Définition
Le RAG ajoute un contexte, il ne réentraîne pas le modèle.
Le Retrieval-Augmented Generation associe une étape de recherche à une étape de génération. À chaque question, le système cherche des passages pertinents dans un corpus puis les fournit au modèle. Le modèle doit répondre à partir de ce contexte et, idéalement, citer les sources utilisées.
Rechercher
Identifier les passages autorisés les plus utiles pour la question.
Répondre
Produire une réponse limitée par les instructions et le contexte reçu.
Vérifier
Afficher les références et permettre une validation par l’utilisateur.
Architecture
Une chaîne de données et de responsabilités.
Un RAG exploitable ne se résume pas à une base vectorielle. Les droits d’accès doivent être appliqués avant que le contexte n’arrive au modèle ; la provenance et la version des documents doivent rester visibles jusqu’à la citation.
Documents autorisés et propriétaires identifiés
Extraction, découpage et métadonnées
Représentation et recherche
Sélection du contexte utile
Réponse à partir du contexte
Validation, journaux et évaluation continue
Prérequis
Six conditions de réussite.
Des sources possédées et maintenues
Chaque corpus a un propriétaire, une fréquence de mise à jour et une règle d’archivage.
Des permissions applicables à la recherche
Un utilisateur ne doit jamais récupérer un passage auquel il n’a pas droit, même si le modèle peut techniquement le résumer.
Un découpage adapté au document
La taille des passages, les titres, tableaux et métadonnées sont évalués selon les questions réelles.
Des réponses avec provenance
Les passages cités, leur document et leur version doivent être accessibles depuis la réponse.
Une règle de refus
Le système doit savoir indiquer qu’aucune source suffisante n’a été trouvée.
Une boucle de maintenance
Les erreurs observées alimentent le corpus de test, les réglages de recherche et la gouvernance documentaire.
Évaluation
Tester la recherche séparément de la réponse.
Une réponse incorrecte peut venir d’un document absent, d’un mauvais passage, d’un contexte tronqué ou du modèle. Un jeu d’évaluation doit donc conserver la question, la source attendue, les passages pertinents et les critères de réponse.
Recherche
Le bon document et le bon passage apparaissent-ils dans les premiers résultats ?
Fidélité
La réponse est-elle supportée par les passages cités, sans ajout non démontré ?
Complétude
Les éléments indispensables de la réponse attendue sont-ils présents ?
Refus et sécurité
Le système refuse-t-il lorsque la source manque ou que l’utilisateur n’est pas autorisé ?
Limites
Les risques à traiter explicitement.
- Documents obsolètes ou contradictoires
- Fuite de données par des droits mal appliqués
- Instructions malveillantes dans les documents
- Passages pertinents absents des premiers résultats
- Réponse plausible mais non supportée par la source
- Coût mémoire et latence d’un contexte trop long
Sources
Références utilisées.
Les affirmations techniques s’appuient en priorité sur des organismes publics, des publications de recherche et la documentation des outils.
- RechercheRetrieval-Augmented Generation for Knowledge-Intensive NLP TasksPublication fondatrice de l’approche RAG.
- RechercheRetrieval-Augmented Generation for Large Language Models: A SurveyPanorama des composants, méthodes d’évaluation et difficultés.
- ANSSIRecommandations de sécurité pour un système d’IA générative
- CNILQuestions-réponses sur l’utilisation d’un système d’IA générative