6

Já rodou uma LLM local? Já tentou usá-la para trabalho?

Recentemente comprei uma placa de vídeo, uma RX 7600 com 8 GB de VRAM. Ela me ajuda muito a jogar e usar o computador de uma forma mais agradável. Desde que comprei, pensei se poderia usá-la no meu trabalho como dev mobile. Afinal, planos para usar IA têm um custo caro, e eu queria reduzir os meus.

Eu não sei se sou ruim em configurar IA local ou se realmente não tem muito o que fazer no meu cenário, mas testei vários modelos, com vários agentes e vários parâmetros diferentes. Testei o Qwen 3.6 27B, o Qwen 3.6 35B, o Gemma 4 12B, o Ornith 9B e, para minha surpresa, não sei se por expectativas altas ou se realmente tive um resultado ruim, quase todos foram muito lentos. Testei também o Qwen 3.5 9B. Tudo muito lento, mas entregavam alguma coisa.

Pedi um simples Snake Game em Go. Só o Qwen 3.6 35B e o Ornith 9B conseguiram me dar algo que compilasse. O Qwen 3.6 35B demorava quase 5 minutos para responder. Eu sei que ele roda praticamente na minha CPU, já que não cabe na minha VRAM, mas quero ressaltar que a qualidade dele, nos meus testes, não foi isso tudo. Ele errou coisas simples também, entregando código que nem compilava, apesar de ter sido o modelo que mais acertou.

O Ornith 9B era muito rápido, cabe inteiro na minha GPU, mas, por outro lado, era bem menos assertivo, bem menos mesmo. Eu sinto que o máximo que posso esperar desse modelo é a implementação de uma função ou classe de forma guiada, pelo menos por enquanto.

É bizarro o quanto os planos de IA, como Claude ou GPT, são superiores, até nos modelos mais simples ou no modo gratuito.

Alguém tem alguma dica sobre como rodar melhor no meu cenário? Eu tenho testes e benchmarks que fiz rodando vários prompts simples 10 vezes e tirando a média de velocidade e acerto. Talvez eu coloque tudo no GitHub. Se eu fizer isso, volto aqui para colocar o link, só para referenciar tudo isso que citei.

Enfim, estou um pouco frustrado tentando rodar IA local. Talvez 8 GB de VRAM sejam só para brincar mesmo com IA local, pelo menos no momento.

Carregando publicação patrocinada...
3

Meus 2 cents,

Uma ideia para rodar modelos locais eh:

Eh uma aplicacao local (AI Workspace) que permite gerenciar diversos aspectos do LLM e tambem facilita encontrar modelos compativeis com teu hardware (opcao do menu "cookbook").

Ele usa o ollama e outros itens por baixo dos panos.

E para gerenciar o uso de tokens com modelos externos:

Eh um AI Gateway que permite gerenciar diversos providers e itens correlatos.

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

1
1

Você não é ruim em configurar IA local. O problema é o cenário mesmo, e eu digo isso tendo subido bem o hardware pra tentar provar o contrário.

Eu fiz um vídeo testando alguns modelos locais e o resultado foi desastroso:
https://www.youtube.com/watch?v=Gf0u_q7bAVg

O contexto era exatamente o seu, só que com folga de hardware. Eu via vários vídeos com resultados milagrosos, modelo local rodando em máquina modesta resolvendo tudo, e como tenho uma RTX 4080 Super imaginei que ia rodar algo robusto com sobra. Não foi nem perto.

Peguei o Qwen 27B MoE e dei uma especificação real de trabalho, a mesma que o Opus 4.8 tinha resolvido em menos de uma hora. O modelo local levou mais de 24 horas. Consumo de energia no talo o tempo inteiro, o PC praticamente inutilizável enquanto ele trabalhava, e o resultado depois de 24 horas foi ridículo. Não foi "pior porém aceitável". Foi um entregável que eu não usaria.

Ou seja: o gargalo não era caber na VRAM. Eu tinha VRAM. O que faltava era capacidade do modelo.

Duas coisas que acho que valem pra sua análise:

  1. A comparação que importa não é modelo grande contra modelo pequeno, é agente contra agente. Uma tarefa de código real não é uma resposta única, são dezenas de idas e voltas: ler arquivo, rodar teste, corrigir, tentar de novo. Um modelo que erra 30% a mais por passo não erra 30% a mais no total, ele descarrila. Por isso a diferença que você sente entre local e Claude/GPT parece maior do que qualquer benchmark sugere. E é maior mesmo, porque o erro acumula.

  2. O custo local não é zero, ele só está escondido. Energia, hardware amortizado, tempo de configuração e, principalmente, o seu tempo esperando e corrigindo. Quando eu somo isso, a assinatura fica barata. Não tenho dúvida.

Sobre o seu caso específico de 8 GB: eu não tentaria rodar modelo grande em offload pra CPU. Isso é o pior dos dois mundos, você paga a lentidão do modelo grande sem ganhar a qualidade dele de forma utilizável. Se for insistir, eu manteria só o que cabe inteiro na GPU e mudaria o tipo de tarefa: autocomplete inline, geração de commit, renomear e reescrever trecho pequeno, classificação, embedding pra busca local. Nesse recorte o modelo pequeno funciona bem e é rápido. O que ele não vai fazer é o trabalho agêntico de ponta a ponta, e é justamente esse trabalho que faz a assinatura valer o preço.

Minha leitura hoje: modelo local vai chegar num patamar interessante quando hardware específico pra IA ficar popular e barato, com memória unificada e banda alta como padrão em máquina de desenvolvedor. Não é uma questão de "modelo aberto não presta", é questão de a nossa máquina ainda ser a errada pro trabalho. Enquanto isso não acontece, eu parei de perder tempo tentando.

E sobe esses benchmarks no GitHub, por favor. Falta muito dado honesto sobre isso. A internet está cheia de vídeo de demo bonita rodando o hello world e quase ninguém publica o que acontece quando você joga uma tarefa real em cima.

0
1

cara, tu nao vai conseguir rodar nada satisfatorio com 8gb de vram, ainda mais sendo AMD...
to falando de desenvolvimento de software;
pague o claude e seja feliz;

2

Já pago inclusive o MAx, pago a muito tempo já kkkk mas eu queria reduzir para o pro a ideia era rodar algo para fazer o simples enquanto o claude resolve os mais dificeis.

1
1

Infelizmente você tem razão, e meu medo era exatamente isso, vai que no futuro fica tão caro que fica inviavel pagar mas local é tenso também não rola atualmente.

1

uma RX 7600

Não é a toa que a NVIDIA é atualmente a empresa mais valiosa do mundo.

Ela tem o cuda

GPU AMD não consegue rodar modelos locais de forma satisfatória, só Nvidia.

Já testou os modelos chineses? ou o próprio grok?

2

Não eu testei varios do ollama localmente e roda muito rapido o problema é a qualidade mesmo infelizmente, tenho um amigo com uma plara da NVIDIA ele consegue rodar melhor por que a placa dele tem 12VRAM mas ainda sim longe de ser satisfatorio ele paga o claude max para trabalho assim como eu

1

O limite aqui é VRAM, não fabricante. Um modelo de 35B não cabe em 8GB de forma alguma, seja NVIDIA ou AMD — a conta de memória não fecha em nenhum dos dois casos.
Sobre CUDA vs ROCm: uso a mesma RX 7600 8GB no Linux e rodo modelos locais sem problema. O suporte da AMD melhorou bastante e hoje é bem viável pra inferência.

1

Já rodei milhões de tentativas com ollama pra tentar economizar e ter um LLM Local com placa de vídeo de diferentes modelos e nadaaaaaaaa!!

O que eu gastei com isso era melhor ter usado para pagar os tokens da Claude e eu teria economizado bem mais!!

Mas valeu o conhecimento !!

(Será? kkk)

Conteúdo excluído
0