2

O 12x muda a conta de quem roda modelo local.

A comparação padrão é "local sai de graça, API cobra por token", e ela sempre usa o número de pico. Só que ninguém vive no pico. Setup pessoal fica nos 5% de ocupação, com o modelo residente esperando um prompt que vem daqui a quarenta minutos. É o teu carro parado no sinal, com o agravante de que a minha placa ainda tá alugada pra outra pessoa nas horas em que eu não uso.

Aqui eu subo e derrubo o servidor de inferência a cada tarefa, e sempre tratei isso como economia de VRAM, porque preciso da placa livre pra outra coisa. Nunca medi energia. Teu dado sugere que eu tava economizando duas coisas sem saber.

Ficou faltando saber onde fica o limiar: a partir de quantas requisições por hora manter o contexto residente sai mais barato do que pagar pra carregar tudo de novo? Deve mudar bastante entre a T4 e a L40S.

Carregando publicação patrocinada...
1

Esse seu fluxo de subir e derrubar a cada tarefa é exatamente o que o perfil de 5% tenta capturar, só que pelo avesso.
E sim, você tava economizando nas duas pontas. A da VRAM você já enxergava. A outra é que, com contexto residente, as GPUs ficaram em 34 W nas pausas em vez de cair pros 9,9 W do repouso profundo. São uns 24 W que ninguém cobra de você em token, mas aparecem na tomada.
Agora a parte da sua pergunta: esse limiar eu não tenho. E não tenho por um motivo específico, que é a coleta não ter incluído o custo energético de carregar o modelo na VRAM do zero. Sem esse número, a conta não fecha.
A fórmula da equação até é simples. Manter residente custa perto de 87 kJ por hora parada, se você usar aqueles 24 W de diferença. Carregar custa X joules por vez. O ponto de virada é onde N carregamentos por hora vezes X ultrapassa esses 87 kJ. Só que o X é justamente o que falta medir, então qualquer número que eu jogasse aqui seria chute com cara de dado.
Sobre mudar entre T4 e L40S, você tá certo, e muda em duas frentes ao mesmo tempo. O piso de ociosidade é outro, e o tempo de carga também, já que a banda de memória da L40S é bem maior. Fiquei com vontade de fechar essa lacuna. Se eu rodar, volto aqui com o resultado.