Muito bom o cuidado de rodar mais de uma execução por prompt. Esse é o tipo de teste que parece simples, mas vira achismo rápido se não tiver repetição.
Uma coisa que fiquei pensando: além de registrar se houve citação, talvez valha separar “a IA conhece o domínio” de “a IA escolhe citar aquele artigo para aquela pergunta”. São problemas diferentes. O primeiro parece mais ligado a descoberta/indexação; o segundo, a autoridade percebida e encaixe do conteúdo na intenção do prompt.
Você chegou a guardar também idioma, região, horário e se a resposta veio com busca web ativa em todos os casos? Imagino que isso possa mudar bastante o resultado, principalmente entre prompts branded e topical.