4

Meus 2 cents,

Parabens pela iniciativa !

Benchmarks que comparem o "intuitivo" (ou a voz das ruas) com o real sao mais que bem vindos: as vezes certos metodos de fazer as coisas sao tao repetidos que parecem verdades absolutas - mas no caso da IA/LLM eh preciso considerar que eh uma disciplina em construcao, entao "verdades" de ontem podem nao ser mais a realidade de hoje, e a unica forma de identificar isso eh atraves de metricas objetivas.

E fazer isso atraves de um "paper", merece parabens duplos.

OBS: O link no post aponta para uma versao "antiga" do paper - no site ele avisa que tem uma versao mais recente (https://zenodo.org/records/20998558).

Repositorio devidamente starreado e forkeado - obrigado por compartilhar !

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

Carregando publicação patrocinada...
1

Valeu pelo aviso, Oletros. Tua observação salvou o post: acabei de atualizar os dois pontos (canonical no topo + link no rodapé) pro concept DOI 10.5281/zenodo.20978073, que sempre redireciona pra última versão. A versão 1 vazou pra publicação antes de eu lembrar de usar o concept; lição pros próximos papers.

Sobre "métricas como única forma de identificar": é exatamente o que me obrigou a fazer 40 trials. Rodei 3 vezes desconfiando de erro de medida antes de aceitar, porque "executor grátis sai mais caro" soa contraintuitivo o bastante pra parecer bug. Acabou sendo mecânico (cache do Opus relendo o sumário do Qwen), não filosofia. Sem o número eu provavelmente teria mantido o setup só pelo charme do "PC com GPU faz o trabalho sujo".

Obrigado pela star e pelo fork. Se rodar o harness em outra codebase e der inversão de resultado, manda. É o tipo de réplica que falta nessa discussão.