1

A coluna de sucessos falsos é a que pesa. O LLM no controle declarou a tarefa cumprida sem cumprir, em cerca de uma a cada quatro. O ANCHOR quase zera isso no conjunto de desenvolvimento, e o texto já avisa que esse conjunto serviu para ajustar o sistema.

O buraco que a tabela mostra é o "Mostrar mais": 47% contra 57% a 60%. O plano só existe para os elementos que já vieram numerados. Se o botão que revela o resto ficou de fora do resumo, não há passo para ele, e a conferência de efeito nem roda. O modelo que enxerga a página abre o painel e continua. Os 80 pedidos escritos por quem nunca viu o projeto é que vão dizer se isso se mantém.

Carregando publicação patrocinada...
1

Valeu, leitura certeira. Só um detalhe: no benchmark, o LLM no controle recebe a mesma lista numerada que o ANCHOR, sem captura de tela, então a diferença não é enxergar mais. A minha hipótese é o jeito de agir: ele explora (clica no "Mostrar mais" para ver o que aparece), enquanto o planejador do ANCHOR planeja em direção a um alvo pelo nome, e, se o alvo ainda não está na lista, não há passo para ele.

Uma correção possível é tratar os controles que revelam conteúdo ("Mostrar mais", expansores) como candidatos quando o alvo não aparece, e replanejar depois de abri-los. E concordo: quem vai dizer se isso se mantém são os 80 pedidos do conjunto fechado.