Ressources · 09

Qualité RAG : évaluer un assistant documentaire sur preuves

Mesurer corpus, récupération, citations, réponse, abstention et dérive séparément pour savoir réellement ce qui doit être corrigé.

· 17 min

Évaluation de sources, citations et réponses d’un assistant documentaire RAG

Ce que ce guide permet

  • Savoir si l’échec vient du corpus, du retrieval ou du modèle
  • Contrôler chaque citation
  • Valoriser une bonne abstention
  • Détecter la dérive après changement

Contrôle express

  • La source de référence est-elle autorisée et à jour ?
  • Le bon passage apparaît-il dans les premiers résultats ?
  • Chaque affirmation décisive est-elle étayée ?
  • L’assistant sait-il dire qu’il ne sait pas ?
  • Les cas sensibles sont-ils escaladés ?

Méthode pas à pas

  1. 01

    Définir les tâches utiles

    Collectez des questions réelles, leurs variantes et le résultat métier attendu. Ajoutez ambiguïtés, conflits de sources, documents périmés et demandes hors périmètre.

    Livrable : taxonomie de cas et risques.

  2. 02

    Assainir le corpus

    Attribuez propriétaire, droits, date de validité et statut à chaque source. Retirez doublons, fragments orphelins et documents dont l’autorité est inconnue.

    Livrable : registre de corpus.

  3. 03

    Évaluer la récupération

    Mesurez si les passages nécessaires sont retrouvés et correctement ordonnés avant d’évaluer la formulation finale. Inspectez aussi les requêtes sans preuve disponible.

    Livrable : mesures de couverture et pertinence.

  4. 04

    Évaluer réponse et citations

    Vérifiez exactitude par rapport aux passages, complétude, limites, lien entre citation et affirmation, ainsi que la capacité à signaler une contradiction.

    Livrable : grille de fidélité et utilité.

  5. 05

    Tester refus et attaques

    Ajoutez injection indirecte, demande de données interdites, source malveillante, faux document prioritaire et action irréversible. Définissez les escalades humaines.

    Livrable : résultats sécurité et garde-fous.

  6. 06

    Surveiller les changements

    Versionnez corpus, index, paramètres, modèle et consignes. Rejouez le jeu stable à chaque évolution et analysez les retours réels sans conserver plus de données que nécessaire.

    Livrable : tableau de dérive et procédure de revue.

Indicateurs de pilotage

IndicateurCe qu’il mesurePremière action
Couverture retrievalQuestions dont les passages nécessaires sont retrouvésCorriger corpus, découpage ou requête avant le modèle
FidélitéAffirmations réellement soutenues par les sources citéesBloquer ou reformuler les réponses non étayées
Abstention utileCas sans preuve correctement refusés ou escaladésAjuster les seuils de confiance
RégressionÉcart de qualité entre deux versions sur le même jeuIdentifier la modification responsable

Erreurs fréquentes

  • Mesurer uniquement la fluidité du texte
  • Mélanger échec de retrieval et hallucination
  • Utiliser un jeu trop facile
  • Changer plusieurs composants sans test comparatif

Questions fréquentes

Combien de questions faut-il ?

Commencez avec un ensemble représentatif et versionné couvrant les risques importants. Sa diversité et sa qualité comptent davantage qu’un grand volume artificiel.

Une métrique automatique suffit-elle ?

Non. Elle accélère le tri, mais les cas sensibles, ambigus et métier nécessitent des critères explicites et une revue humaine.

Faut-il conserver toutes les conversations ?

Non. Ne gardez que les traces nécessaires, avec finalité, accès et durée définis. Préférez des cas anonymisés pour l’amélioration.