Post raro, porque tem número e tem os dois casos onde não funcionou. A maioria só publica o projeto B.
Uma ressalva no que os 7x significam: o baseline foi RAG vetorial simples. Na minha experiência, quando a busca "perde nuance" em contrato e documento financeiro, quase nunca é falta de grafo. É falta de busca híbrida (só embedding erra feio em nome de fornecedor, número de cláusula, sigla) e de rerank, que é o passo com melhor retorno por real gasto que eu conheço. Contra híbrido com rerank, esse múltiplo provavelmente encolhe bastante.
E pergunta de segundo nível nem sempre precisa de grafo, às vezes precisa é de mais de um retrieval. "Padrão de risco em pelo menos 3 empresas" vira N buscas mais uma agregação: custa mais na query e zero na indexação, sem reindexação semanal.
O que eu faria antes de assinar o 7x: pegar as 20 perguntas que você já usa, montar um golden set e medir recall de fonte, não satisfação com a resposta. Se o baseline já traz as fontes certas e o modelo é que não conecta, o gargalo é síntese e grafo não resolve. Se nem traz, aí o grafo tem chance de pagar.
Como você mediu B e D, por sinal? No C você tem 89% para 91% e latência. Nos dois que sustentam a tese a evidência é qualitativa, e é justamente onde o número seria mais útil.