Ideia ótima, mas como um formando em Biblioteconomia que foca na parte de sistemas de recuperação de informação, tenho dois centavos que podem ajudar.
Utilizar LLM pra buscar nos resumos não tem resultado metrificável, ainda mais que quanto mais texto ela tiver que ler, mais a janela de contexto e outras variáveis vão influenciar.
O que eu sugiro, e é algo que estou estudando e tentando desenvolver também, é que durante a própria indexação do link o sistema sugira palavras-chave, categorias, etc (basicamente uma classificação assistida), aí você só aprova/corrige e segue o processo atual.
Na hora de recuperar, a quantidade de termos pesquisados fica muito mais enxuto. E também já vai ser possível expandir pra um buscador de fato, sem depender de uma LLM, caso veja necessidade e etc.
No meu caso em particular, meu estudo é para aplicar em sistemas empresariais, então até os parâmetros de como os termos sugeridos são configurados tem que ser código, estável,estável e auditavel. Então ainda tenho um longo caminho antes de ter algo concreto pra compartilhar por aqui.
Mas espero que os conceitos ajudem.