1

Ressalva justa: o baseline era vetorial simples, sem híbrido nem rerank, e revendo o projeto D, parte do "perde nuance" era mais busca ruim do que falta de grafo. B e D eu medi por desfecho, não por recall (clusters que a auditoria não viu em 3 semanas no B, 30 horas a menos por trimestre no D), então você tocou na parte mais fraca do post.

Vou montar o golden set com as 20 perguntas reais e medir recall de fonte contra híbrido com rerank antes do re-teste de 60 dias; se o 7x encolher, publico o encolhimento.

Carregando publicação patrocinada...