Esse seu fluxo de subir e derrubar a cada tarefa é exatamente o que o perfil de 5% tenta capturar, só que pelo avesso.
E sim, você tava economizando nas duas pontas. A da VRAM você já enxergava. A outra é que, com contexto residente, as GPUs ficaram em 34 W nas pausas em vez de cair pros 9,9 W do repouso profundo. São uns 24 W que ninguém cobra de você em token, mas aparecem na tomada.
Agora a parte da sua pergunta: esse limiar eu não tenho. E não tenho por um motivo específico, que é a coleta não ter incluído o custo energético de carregar o modelo na VRAM do zero. Sem esse número, a conta não fecha.
A fórmula da equação até é simples. Manter residente custa perto de 87 kJ por hora parada, se você usar aqueles 24 W de diferença. Carregar custa X joules por vez. O ponto de virada é onde N carregamentos por hora vezes X ultrapassa esses 87 kJ. Só que o X é justamente o que falta medir, então qualquer número que eu jogasse aqui seria chute com cara de dado.
Sobre mudar entre T4 e L40S, você tá certo, e muda em duas frentes ao mesmo tempo. O piso de ociosidade é outro, e o tempo de carga também, já que a banda de memória da L40S é bem maior. Fiquei com vontade de fechar essa lacuna. Se eu rodar, volto aqui com o resultado.
Respondendo a "O 12x muda a conta de quem roda modelo local. A..." dentro da publicação Quanto de energia uma IA gasta enquanto não faz nada?
1