资源 · 09

RAG 质量:使用证据评估知识助手

分别衡量语料库、检索、引用、答案、弃权和偏差,以便了解真正需要改进的地方。

已更新 · 2 min

桌上显示代码的笔记本电脑 插图 · 虚构场景

本指南有助于实现的目标

  • 确定失败是源于语料库、检索还是模型
  • 追踪每一条引用
  • 奖励适当的弃权
  • 检测变更后的偏差

快速检查

  • 参考来源是否已获得授权且为最新版本?
  • 正确的段落是否出现在顶部附近?
  • 每个决定性论断都有依据吗?
  • 助手能否表示不知道?
  • 敏感案例是否已升级?

分步指南

  1. 1

    定义有用的任务

    收集真实问题、其变体以及预期的业务结果。 添加歧义、来源冲突、过期文档和超出范围的请求。

    交付成果:案例和风险分类。

  2. 2

    清理语料库

    为每个来源分配所有者、权限、有效期和状态。 删除重复项、孤立片段和来源不明的文档。

    交付成果:语料库注册表。

  3. 3

    评估检索效果。

    在评估最终措辞之前,衡量是否已找到并排序必要的段落。 检查不存在证据的查询。

    交付成果:覆盖率和相关性指标。

  4. 4

    评估答案和引用。

    检查对原文的忠实度、完整性、局限性、引用与论点之间的关系以及标记矛盾的能力。

    交付成果:忠实度和实用性评价标准。

  5. 5

    测试拒绝和攻击。

    添加间接注入、禁止的数据请求、恶意来源、虚假优先级文档和不可逆操作。 定义人工升级机制。

    交付成果:安全结果和防护措施。

  6. 6

    监控变更。

    对语料库、索引、设置、模型和指令进行版本控制。 每次更改后都重放稳定集,并分析真实反馈,不保留不必要的数据。

    交付成果:漂移仪表板和审查流程。

虚构示例

示例情境

内部助手根据一些已过期的程序进行回答。 测试集包含常规、模糊和无法回答的问题;每个引用都会与文档版本进行核对。

决策及预期证据

发布会等待,直到排除过期的来源、拒绝不支持的答案并确定语料库所有者。

管理指标

指标衡量内容首要行动
检索覆盖率找到所需段落的问题在模型运行前修复语料库、组块或查询
忠实度引用来源真正支持的说法屏蔽或重写无依据的答案
有效的回避正确拒绝或升级无证据的案例调整置信度阈值
回归同一数据集不同版本之间的质量差异确定导致问题的更改

常见错误

  • 仅测量写作流畅性
  • 混淆检索失败和幻觉
  • 使用过于简单的评估集
  • 未经比较就更改多个组件

常见问题解答

需要多少个问题?

从涵盖重要风险的具有代表性的版本化数据集开始。 多样性和质量比人为增加数量更重要。

单一的自动化指标就足够了吗?

不够。它能加快分诊速度,但敏感、模糊和领域性案例需要明确的标准和人工审核。

是否应该保留所有对话记录?

不应该。仅保留目的明确、访问权限和期限明确的必要记录。 为了改进,建议优先处理匿名案例。

官方参考文献

参考文献支持该方法。 请根据您的实际情况调整检查;它们并非认证。 原始参考文献标题和源文档可能使用其他语言。