Os modelos menores estao melhorando muito. As empresas estão cada vez mais conseguindo condensar a inteligência.
Entretanto, acredito que existe um limite de usabilidade. De fato, para escrita de commits um modelo de 7B de parâmetros funciona muito bem. Llms são muito boas em resumir texto. O problema com modelos pequenos é que não são bons em generalizar tarefas e não tem grande quantidade de informação "salva" em seus pesos; sendo assim, não são adequados para uso agentico, ou planejamento de tarefas, na minha opinião.
De toda forma, acredito que o futuro seja esse mesmo: delegar tarefas específicas para modelos menores em ambiente local. Boa parte do código que desenvolvo hoje em dia vem do GLM 5.3 Flash. Um modelo de 300B de parâmetros, que, independente da crise do hardware, já pode, em teoria, ser rodado em hardware de consumidor (novos Mac Studio).