Boa, e concordo que o loop virou consenso.
No meu caso o que pesou não foi só ter loop: foi separar quem escreve de quem avalia. Quando tentei Generator e Evaluator na mesma chamada, o modelo aprovou o próprio rascunho na hora. O ganho sumiu inteiro.
Os casos de ARC-AGI-3 que você linkou parecem apontar pro mesmo lugar: a diferença vem do harness em volta do modelo.
Vou olhar o Retrodict com calma. Meu próximo passo é o roteador que manda as perguntas fáceis pro single-shot, porque hoje 62% das minhas queries pagam Evaluator sem precisar. Valeu pelos links.