Diferentes modelos para cada situação.
Nos últimos anos, nos acostumamos a pensar em inteligência artificial quase como sinônimo de LLMs generativas: enviamos uma entrada, esperamos os tokens serem gerados um a um e, se quisermos mais velocidade, pagamos por mais poder computacional.
Mas esse não foi o único caminho da inteligência artificial.
Antes da explosão das LLMs autoregressivas, já existiam abordagens bastante diferentes. O BERT, por exemplo, popularizou uma arquitetura baseada em representações bidirecionais que podia ser adaptada para tarefas específicas, como classificação, inferência e extração de informação. Não havia necessidade de transformar toda tarefa em geração de texto.
Da mesma forma, os modelos de difusão seguiram outro caminho: em vez de utilizar um modelo generativo autoregressivo de texto, especializaram a arquitetura para um processo de geração adequado ao domínio da imagem. Os modelos de difusão latente mostraram inclusive que mudanças na representação e na arquitetura poderiam reduzir significativamente o custo computacional da geração.
O surgimento de modelos como Jev torna essa distinção novamente evidente.
A proposta do Jev não é simplesmente produzir uma LLM menor. A TypeSafe apresenta os chamados System One Models como uma classe de modelos voltada para decisões estruturadas: em vez de gerar uma sequência de tokens, o modelo recebe um estado e retorna decisões tipadas, probabilidades e confiança, podendo produzir as respostas em paralelo.
O Laya segue uma direção semelhante e é particularmente interessante porque utiliza encoders derivados da linhagem BERT, como ModernBERT e mmBERT, mas os treina para produzir decisões tipadas em uma única passagem. O projeto relata dezenas de milissegundos por consulta em uma GPU T4 e processamento ainda mais rápido quando várias perguntas são agrupadas.
Isso aponta para uma possibilidade maior: talvez o futuro da IA não seja escolher entre "uma LLM cada vez maior" ou "nenhuma IA". Talvez seja construir sistemas compostos por modelos diferentes, cada um resolvendo uma parte do problema para a qual é computacionalmente adequado.
Uma aplicação de OCR, por exemplo, não precisa necessariamente de uma grande LLM multimodal. Um detector especializado pode localizar o texto, um reconhecedor pode convertê-lo em caracteres e outro modelo pequeno pode classificar ou estruturar o resultado. Se cada componente fizer apenas aquilo que precisa fazer, o sistema inteiro pode ser muito mais barato e rápido.
Foi justamente isso que me chamou atenção ao trabalhar com OCR no Chrome. Em uma máquina sem GPU dedicada, consegui processar um arquivo inteiro em aproximadamente 20 segundos, com uma precisão que, na minha experiência, superou uma implementação convencional do EasyOCR. O mais interessante não foi apenas o resultado do OCR, mas perceber que uma tarefa aparentemente "de IA" não exigia uma supermáquina.
Isso também muda a maneira de pensar sobre hardware.
Durante a popularização das LLMs, tornou-se comum associar IA a GPUs de alto desempenho, especialmente NVIDIA. Mas o desempenho real depende também da arquitetura do modelo e da qualidade da implementação. O próprio Ollama, por exemplo, ampliou sua aceleração por GPU através de Vulkan, permitindo utilizar hardware AMD e Intel além dos caminhos específicos de fabricantes.
A questão, portanto, não é simplesmente "qual é a maior máquina que podemos colocar atrás do modelo?".
A pergunta pode ser outra:
qual é o menor modelo capaz de resolver corretamente esta tarefa e qual é a implementação mais eficiente para executá-lo?
Uma LLM grande continua sendo extremamente importante quando precisamos de linguagem aberta, geração, programação, raciocínio complexo ou tarefas para as quais não sabemos antecipadamente qual será a estrutura da resposta.
Mas muitas tarefas práticas não precisam disso.
Para essas tarefas, pode ser mais eficiente utilizar um classificador, um encoder, um detector, um modelo de OCR, um modelo de ranking, um modelo de decisão ou qualquer outra arquitetura especializada. E, quando uma decisão realmente exigir raciocínio ou geração complexa, o sistema pode então chamar uma LLM.
Em vez de:
LLM para tudo.
podemos imaginar:
modelo pequeno para o que é simples → modelo especializado para o que é específico → LLM para o que realmente exige geração e raciocínio.
Isso não significa abandonar as LLMs. Significa deixar de tratá-las como a única forma possível de inteligência artificial.
Talvez a próxima grande etapa da IA não seja apenas construir modelos maiores, mas aprender a construir sistemas em que cada modelo faça somente aquilo que precisa fazer.
E, nesse cenário, eficiência computacional deixa de ser uma consequência da existência de uma IA e passa a ser parte fundamental do projeto da própria IA.