资源 · 49
在版本变更前评估 AI 回归
比较同一任务的不同版本,查找局部损失,并基于案例而非平均值做出决策。
已更新 · 3 min
本指南有助于实现的目标
- 隔离测试的变更
- 保留独立的参考集
- 按分段检查故障
- 准备关闭或回滚
快速检查
- 哪个组件发生了变化?
- 是否使用测试集优化了候选模型?
- 谁来解决标注分歧?
- 平均值是否会掩盖敏感错误?
- 能否恢复之前的配置?
分步指南
- 1
定义任务和拒绝
描述预期输出、允许的数据和代价高昂的错误。 区分准确性、有用性、适当的拒绝和行动效果。 NIST 的框架要求根据具体情况进行测量;它不提供通用的可靠性评分。
交付成果:标准和决策负责人。
- 2
区分参考和发现。
将稳定的数据集排除在优化之外。 单独添加新的匿名反馈案例:它们揭示了盲点,但不应悄悄地改变比较的分母。
交付成果:带有来源信息的版本化数据集。
- 3
文档注释。
解释答案可接受、部分可接受或不正确的原因。 由合格的审阅者解决歧义,并保留分歧的原因。 对于开放式任务,单一的参考答案可能过于局限。
交付成果:评分标准和已裁决的案例。
- 4
在相同条件下进行比较
使用已记录的版本、参数、工具和数据源重放相同的输入。 当输出发生变化时重复试验并报告变化。 区分模型故障、数据缺失、工具不可用和测试缺陷。
交付成果:成对的结果和最小化的跟踪记录。
- 5
按风险类别进行决策
即使平均值有所改善,也要按语言、文档类型和敏感情况检查损失。 在读取结果之前定义停止、纠正和有限发布标准。 一个严重案例即可成为暂缓发布的理由。
交付成果:决策、保留和例外情况。
- 6
发布后重放
准备可恢复的配置和可联系的负责人。 将早期反馈与测试集进行比较,而不将局部成功视为所有用途的证据。 当数据或依赖关系发生变化时重新评估。
交付成果:监控和回滚程序。
可重复使用的工作表
填写您已授权的观察结果。 这些字段是工作模板,而非观察结果。
| 字段 | 待记录信息 |
|---|---|
| 案例和细分 | 稳定的标识符、语言、任务类型 |
| 预期结果 | 验收标准和参考证据 |
| 版本 A / B | 结果、重复、失败原因 |
| 决策 | 接受、纠正或停止;所有者和证据 |
虚构示例
示例情境
虚构示例:某个版本改进了常规答案,但在文档冲突时删除了不确定性声明。
决策及预期证据
该报告隔离了该子集,保留了原始证据,并暂不发布该用途的版本,直到重新测试更正为止。
区分机制
| 机制 | 目的 | 验证或限制 |
|---|---|---|
| 稳定集 | 版本比较 | 避免优化 |
| 新案例 | 发现盲点 | 与历史结果分开报告 |
| 在役观察 | 理解实际使用情况 | 尊重权限、最小化和上下文 |
管理指标
| 指标 | 衡量内容 | 首要行动 |
|---|---|---|
| 成对损失 | 先前已接受的案例现在失败 | 检查每个敏感损失 |
| 注释分歧 | 判断不同的案例 | 比较前明确规则 |
| 分段覆盖率 | 实际呈现的情况 | 命名未测试的用途 |
常见错误
- 在最终测试中进行优化
- 同时更改集和版本
- 将自动判断视为真理
- 接受关键损失,因为 平均值改进
常见问题解答
是否需要自动评判?
不需要。 如果其评判标准经过验证,它可以加快分类速度;但对于模棱两可或成本高昂的案例,仍需业务人员裁决。
平均值改进就足够了吗?
不够。比较相关案例和细分,然后应用测试前制定的标准。
需要多少案例?
案例数量取决于多样性和风险。 报告数量、来源和局限性;任何小样本集都无法建立普遍的安全性。
官方参考文献
参考文献支持该方法。 请根据您的实际情况调整检查;它们并非认证。 原始参考文献标题和源文档可能使用其他语言。
参考资料查阅日期 .






