1

Você não é ruim em configurar IA local. O problema é o cenário mesmo, e eu digo isso tendo subido bem o hardware pra tentar provar o contrário.

Eu fiz um vídeo testando alguns modelos locais e o resultado foi desastroso:
https://www.youtube.com/watch?v=Gf0u_q7bAVg

O contexto era exatamente o seu, só que com folga de hardware. Eu via vários vídeos com resultados milagrosos, modelo local rodando em máquina modesta resolvendo tudo, e como tenho uma RTX 4080 Super imaginei que ia rodar algo robusto com sobra. Não foi nem perto.

Peguei o Qwen 27B MoE e dei uma especificação real de trabalho, a mesma que o Opus 4.8 tinha resolvido em menos de uma hora. O modelo local levou mais de 24 horas. Consumo de energia no talo o tempo inteiro, o PC praticamente inutilizável enquanto ele trabalhava, e o resultado depois de 24 horas foi ridículo. Não foi "pior porém aceitável". Foi um entregável que eu não usaria.

Ou seja: o gargalo não era caber na VRAM. Eu tinha VRAM. O que faltava era capacidade do modelo.

Duas coisas que acho que valem pra sua análise:

  1. A comparação que importa não é modelo grande contra modelo pequeno, é agente contra agente. Uma tarefa de código real não é uma resposta única, são dezenas de idas e voltas: ler arquivo, rodar teste, corrigir, tentar de novo. Um modelo que erra 30% a mais por passo não erra 30% a mais no total, ele descarrila. Por isso a diferença que você sente entre local e Claude/GPT parece maior do que qualquer benchmark sugere. E é maior mesmo, porque o erro acumula.

  2. O custo local não é zero, ele só está escondido. Energia, hardware amortizado, tempo de configuração e, principalmente, o seu tempo esperando e corrigindo. Quando eu somo isso, a assinatura fica barata. Não tenho dúvida.

Sobre o seu caso específico de 8 GB: eu não tentaria rodar modelo grande em offload pra CPU. Isso é o pior dos dois mundos, você paga a lentidão do modelo grande sem ganhar a qualidade dele de forma utilizável. Se for insistir, eu manteria só o que cabe inteiro na GPU e mudaria o tipo de tarefa: autocomplete inline, geração de commit, renomear e reescrever trecho pequeno, classificação, embedding pra busca local. Nesse recorte o modelo pequeno funciona bem e é rápido. O que ele não vai fazer é o trabalho agêntico de ponta a ponta, e é justamente esse trabalho que faz a assinatura valer o preço.

Minha leitura hoje: modelo local vai chegar num patamar interessante quando hardware específico pra IA ficar popular e barato, com memória unificada e banda alta como padrão em máquina de desenvolvedor. Não é uma questão de "modelo aberto não presta", é questão de a nossa máquina ainda ser a errada pro trabalho. Enquanto isso não acontece, eu parei de perder tempo tentando.

E sobe esses benchmarks no GitHub, por favor. Falta muito dado honesto sobre isso. A internet está cheia de vídeo de demo bonita rodando o hello world e quase ninguém publica o que acontece quando você joga uma tarefa real em cima.

Carregando publicação patrocinada...