4

Meus 2 cents,

Parabens pelo post !

Uma coisa que chama a atencao na tua solucao eh que esta virando consenso eh a necessidade de loop de processos que envolvam LLMs, mesmo que isso tenha algum custo (mas como voce pontuou nao precisam ser modelos caros).

Por exemplo:

Obrigado por compartilhar !

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

Carregando publicação patrocinada...
1

Boa, e concordo que o loop virou consenso.

No meu caso o que pesou não foi só ter loop: foi separar quem escreve de quem avalia. Quando tentei Generator e Evaluator na mesma chamada, o modelo aprovou o próprio rascunho na hora. O ganho sumiu inteiro.

Os casos de ARC-AGI-3 que você linkou parecem apontar pro mesmo lugar: a diferença vem do harness em volta do modelo.

Vou olhar o Retrodict com calma. Meu próximo passo é o roteador que manda as perguntas fáceis pro single-shot, porque hoje 62% das minhas queries pagam Evaluator sem precisar. Valeu pelos links.