资源 · 09
RAG 质量:使用证据评估知识助手
分别衡量语料库、检索、引用、答案、弃权和偏差,以便了解真正需要改进的地方。
已更新 · 2 min
本指南有助于实现的目标
- 确定失败是源于语料库、检索还是模型
- 追踪每一条引用
- 奖励适当的弃权
- 检测变更后的偏差
快速检查
- 参考来源是否已获得授权且为最新版本?
- 正确的段落是否出现在顶部附近?
- 每个决定性论断都有依据吗?
- 助手能否表示不知道?
- 敏感案例是否已升级?
分步指南
- 1
定义有用的任务
收集真实问题、其变体以及预期的业务结果。 添加歧义、来源冲突、过期文档和超出范围的请求。
交付成果:案例和风险分类。
- 2
清理语料库
为每个来源分配所有者、权限、有效期和状态。 删除重复项、孤立片段和来源不明的文档。
交付成果:语料库注册表。
- 3
评估检索效果。
在评估最终措辞之前,衡量是否已找到并排序必要的段落。 检查不存在证据的查询。
交付成果:覆盖率和相关性指标。
- 4
评估答案和引用。
检查对原文的忠实度、完整性、局限性、引用与论点之间的关系以及标记矛盾的能力。
交付成果:忠实度和实用性评价标准。
- 5
测试拒绝和攻击。
添加间接注入、禁止的数据请求、恶意来源、虚假优先级文档和不可逆操作。 定义人工升级机制。
交付成果:安全结果和防护措施。
- 6
监控变更。
对语料库、索引、设置、模型和指令进行版本控制。 每次更改后都重放稳定集,并分析真实反馈,不保留不必要的数据。
交付成果:漂移仪表板和审查流程。
虚构示例
示例情境
内部助手根据一些已过期的程序进行回答。 测试集包含常规、模糊和无法回答的问题;每个引用都会与文档版本进行核对。
决策及预期证据
发布会等待,直到排除过期的来源、拒绝不支持的答案并确定语料库所有者。
管理指标
| 指标 | 衡量内容 | 首要行动 |
|---|---|---|
| 检索覆盖率 | 找到所需段落的问题 | 在模型运行前修复语料库、组块或查询 |
| 忠实度 | 引用来源真正支持的说法 | 屏蔽或重写无依据的答案 |
| 有效的回避 | 正确拒绝或升级无证据的案例 | 调整置信度阈值 |
| 回归 | 同一数据集不同版本之间的质量差异 | 确定导致问题的更改 |
常见错误
- 仅测量写作流畅性
- 混淆检索失败和幻觉
- 使用过于简单的评估集
- 未经比较就更改多个组件
常见问题解答
需要多少个问题?
从涵盖重要风险的具有代表性的版本化数据集开始。 多样性和质量比人为增加数量更重要。
单一的自动化指标就足够了吗?
不够。它能加快分诊速度,但敏感、模糊和领域性案例需要明确的标准和人工审核。
是否应该保留所有对话记录?
不应该。仅保留目的明确、访问权限和期限明确的必要记录。 为了改进,建议优先处理匿名案例。
官方参考文献
参考文献支持该方法。 请根据您的实际情况调整检查;它们并非认证。 原始参考文献标题和源文档可能使用其他语言。






