1

Novos modelos de IA de fronteira estão complicando coisas simples?

Tenho usado os dois principais modelos para codificação (Claude Fable 5 e GPT 5.6 sol), e tive a impressão que nesses modelos eles subiram muito a régua para coisas que não deveriam ser complexas, gerando um trabalho muito maior (consequentemente usando mais tokens) e com qualidade não tão melhor.

Para não ficar só na impressão, resolvi "tirar a prova". Tinha um processo de backup/restore específico do PostgreSQL para um sistema, que foi criado pelo Opus 4.7: Um script sh com 72 linhas de código, conta com opção verbose/quiet/debug, comentários no meio de cada etapa do script. Simples, eficiente e funcional, funcionou de primeira e nunca deu problema.

Peguei exatamente o mesmo prompt/especificação e executei no Fable 5: Saiu um sistema de backup em bash com inúmeras funções/opções (todas que eu não pedi na especificação original), documentação completa em alguns MDs (ele criou uma pasta docs com 4 MDs de documentação),arquivos diferentes para backup e restore, mais de 1000 linhas de código sem falar na documentação. Mais 4 horas de execução (contra poucos minutos do Opus 4.7), um caminhão de tokens. A pior parte vem agora: Na primeira execução, erro de sintaxe, foi mais vários minutos pra ele entender erro e corrigir os bugs.

Mais alguém percebeu isso? Quais opiniões tem a respeito?

Carregando publicação patrocinada...
1

O mesmo prompt não funciona igual para diferentes modelos e versões:

Exemplos:

Compared with Claude Opus 4.8, Claude Fable 5 shows improvement in:

  • Long-horizon autonomy. Claude Fable 5 sustains productive output over extended periods, completing multiday, goal-directed runs with strong instruction retention across long, complex tasks.
  • First-shot correctness on complex, well-specified problems. Early testers reported single-pass implementations of systems that previously took days of iteration.

Então seria necessário avaliar o prompt. Um prompt muito vago abre margem para o modelo interpretar mais inclinado para o "padrão" que foi treinado (ou do system prompt e outras limitações dele). Com um prompt mais elaborado, dificilmente o modelo implementará muito mais do que o que foi pedido.

Mas, sim, se deixar um prompt muito amplo o Fable pode fazer algo mais complexo, como a documentação diz.

Instruction-following is improved enough that you can steer most behaviors with a brief instruction rather than enumerating each behavior by name. For example, when un-steered, Claude Fable 5 can elaborate beyond what the task needs, especially at higher effort settings: surveying options it won't pursue, explaining root causes at length, producing heavily-structured PR descriptions, or writing comments that narrate what the next line does. A short brevity instruction is as effective as listing each pattern.

(e o effort também influencia no resultado)