Ressources · 09
Qualité RAG : évaluer un assistant documentaire sur preuves
Mesurer corpus, récupération, citations, réponse, abstention et dérive séparément pour savoir réellement ce qui doit être corrigé.
· 17 min
Ce que ce guide permet
- Savoir si l’échec vient du corpus, du retrieval ou du modèle
- Contrôler chaque citation
- Valoriser une bonne abstention
- Détecter la dérive après changement
Contrôle express
- La source de référence est-elle autorisée et à jour ?
- Le bon passage apparaît-il dans les premiers résultats ?
- Chaque affirmation décisive est-elle étayée ?
- L’assistant sait-il dire qu’il ne sait pas ?
- Les cas sensibles sont-ils escaladés ?
Méthode pas à pas
- 01
Définir les tâches utiles
Collectez des questions réelles, leurs variantes et le résultat métier attendu. Ajoutez ambiguïtés, conflits de sources, documents périmés et demandes hors périmètre.
Livrable : taxonomie de cas et risques.
- 02
Assainir le corpus
Attribuez propriétaire, droits, date de validité et statut à chaque source. Retirez doublons, fragments orphelins et documents dont l’autorité est inconnue.
Livrable : registre de corpus.
- 03
Évaluer la récupération
Mesurez si les passages nécessaires sont retrouvés et correctement ordonnés avant d’évaluer la formulation finale. Inspectez aussi les requêtes sans preuve disponible.
Livrable : mesures de couverture et pertinence.
- 04
Évaluer réponse et citations
Vérifiez exactitude par rapport aux passages, complétude, limites, lien entre citation et affirmation, ainsi que la capacité à signaler une contradiction.
Livrable : grille de fidélité et utilité.
- 05
Tester refus et attaques
Ajoutez injection indirecte, demande de données interdites, source malveillante, faux document prioritaire et action irréversible. Définissez les escalades humaines.
Livrable : résultats sécurité et garde-fous.
- 06
Surveiller les changements
Versionnez corpus, index, paramètres, modèle et consignes. Rejouez le jeu stable à chaque évolution et analysez les retours réels sans conserver plus de données que nécessaire.
Livrable : tableau de dérive et procédure de revue.
Indicateurs de pilotage
| Indicateur | Ce qu’il mesure | Première action |
|---|---|---|
| Couverture retrieval | Questions dont les passages nécessaires sont retrouvés | Corriger corpus, découpage ou requête avant le modèle |
| Fidélité | Affirmations réellement soutenues par les sources citées | Bloquer ou reformuler les réponses non étayées |
| Abstention utile | Cas sans preuve correctement refusés ou escaladés | Ajuster les seuils de confiance |
| Régression | Écart de qualité entre deux versions sur le même jeu | Identifier la modification responsable |
Erreurs fréquentes
- Mesurer uniquement la fluidité du texte
- Mélanger échec de retrieval et hallucination
- Utiliser un jeu trop facile
- Changer plusieurs composants sans test comparatif
Questions fréquentes
Combien de questions faut-il ?
Commencez avec un ensemble représentatif et versionné couvrant les risques importants. Sa diversité et sa qualité comptent davantage qu’un grand volume artificiel.
Une métrique automatique suffit-elle ?
Non. Elle accélère le tri, mais les cas sensibles, ambigus et métier nécessitent des critères explicites et une revue humaine.
Faut-il conserver toutes les conversations ?
Non. Ne gardez que les traces nécessaires, avec finalité, accès et durée définis. Préférez des cas anonymisés pour l’amélioration.






