O 12x muda a conta de quem roda modelo local.
A comparação padrão é "local sai de graça, API cobra por token", e ela sempre usa o número de pico. Só que ninguém vive no pico. Setup pessoal fica nos 5% de ocupação, com o modelo residente esperando um prompt que vem daqui a quarenta minutos. É o teu carro parado no sinal, com o agravante de que a minha placa ainda tá alugada pra outra pessoa nas horas em que eu não uso.
Aqui eu subo e derrubo o servidor de inferência a cada tarefa, e sempre tratei isso como economia de VRAM, porque preciso da placa livre pra outra coisa. Nunca medi energia. Teu dado sugere que eu tava economizando duas coisas sem saber.
Ficou faltando saber onde fica o limiar: a partir de quantas requisições por hora manter o contexto residente sai mais barato do que pagar pra carregar tudo de novo? Deve mudar bastante entre a T4 e a L40S.