Une publication sur arXiv détaille une comparaison contrôlée de six stratégies de Retrieval-Augmented Generation (RAG) pour la réponse aux questions scientifiques. Cette étude montre les compromis entre différentes approches de récupération d'information intégrées à un même modèle générateur, Meta-Llama/Llama-3.1-8B-Instruct.
L’enjeu est d’optimiser la qualité des réponses fournies par les grands modèles de langage (LLM) en les ancrant dans des bases de connaissances spécialisées, tout en tenant compte des contraintes techniques et opérationnelles liées à la taille et la complexité des corpus scientifiques.
Top-k dense retrieval : un classique toujours pertinent mais limité
La méthode de récupération top-k dense repose sur l’extraction des documents les plus similaires à la requête dans un espace d’embeddings. Elle reste un standard pour sa simplicité et sa rapidité. Toutefois, dans un contexte scientifique, où la précision terminologique est déterminante, cette approche peut manquer de finesse, notamment face à des questions complexes ou ambigües.
Reformulation de requête par LLM et reranking : affiner la recherche en deux temps
L’étude teste aussi la reformulation automatique des questions par un LLM avant la récupération, ce qui permet de mieux contextualiser la recherche. Cette étape est parfois suivie d’un reranking par le même LLM, qui réévalue la pertinence des documents récupérés. Ce processus améliore la qualité des résultats mais augmente la latence et la charge computationnelle.
Fusion multi-requêtes via Reciprocal Rank Fusion : combiner pour mieux classer
La fusion multi-requêtes consiste à générer plusieurs reformulations d’une même question, puis à agréger les résultats par une méthode de fusion des rangs (RRF). Cette stratégie vise à capter différentes facettes de la requête, augmentant la couverture des documents pertinents. Elle complexifie cependant le pipeline et nécessite une gestion fine des ressources.
Pipeline agentic : autonomie du générateur dans la décision de récupération
Un pipeline innovant testé dans l’étude donne au générateur la capacité de décider lui-même s’il doit effectuer une récupération ou non. Cette approche agentic vise à optimiser les coûts en évitant des requêtes inutiles, mais elle dépend fortement de la qualité de la décision interne du modèle, ce qui peut introduire des erreurs ou des omissions dans la réponse.
Late-interaction avec ColBERTv2 : un compromis entre précision et coût
La méthode late-interaction, implémentée ici avec ColBERTv2, permet de comparer les embeddings des requêtes et des documents de manière plus fine et dynamique, améliorant la précision de la récupération. Cette technique est plus coûteuse en calcul mais se montre efficace pour des corpus spécialisés et volumineux, comme ceux utilisés en sciences.
Uniformité du générateur et protocole d’évaluation : une base solide pour la comparaison
Tous les pipelines évalués partagent le même générateur, Meta-Llama/Llama-3.1-8B-Instruct, ainsi que les mêmes prompts et protocoles d’évaluation. Cette homogénéité garantit que les différences observées proviennent des stratégies de récupération et non du modèle de génération lui-même, renforçant la validité des conclusions.
Cette étude éclaire les choix techniques à faire pour intégrer efficacement des modules de récupération dans des systèmes de question answering scientifique. Elle invite les acteurs du secteur à considérer non seulement la qualité des résultats mais aussi les coûts opérationnels et la complexité d’implémentation dans leurs architectures.
Sources
Articles et annonces consultés
Passer à l'action



