资源 · 49

在版本变更前评估 AI 回归

比较同一任务的不同版本,查找局部损失,并基于案例而非平均值做出决策。

已更新 · 3 min

本指南有助于实现的目标

  • 隔离测试的变更
  • 保留独立的参考集
  • 按分段检查故障
  • 准备关闭或回滚

快速检查

  • 哪个组件发生了变化?
  • 是否使用测试集优化了候选模型?
  • 谁来解决标注分歧?
  • 平均值是否会掩盖敏感错误?
  • 能否恢复之前的配置?

分步指南

  1. 1

    定义任务和拒绝

    描述预期输出、允许的数据和代价高昂的错误。 区分准确性、有用性、适当的拒绝和行动效果。 NIST 的框架要求根据具体情况进行测量;它不提供通用的可靠性评分。

    交付成果:标准和决策负责人。

  2. 2

    区分参考和发现。

    将稳定的数据集排除在优化之外。 单独添加新的匿名反馈案例:它们揭示了盲点,但不应悄悄地改变比较的分母。

    交付成果:带有来源信息的版本化数据集。

  3. 3

    文档注释。

    解释答案可接受、部分可接受或不正确的原因。 由合格的审阅者解决歧义,并保留分歧的原因。 对于开放式任务,单一的参考答案可能过于局限。

    交付成果:评分标准和已裁决的案例。

  4. 4

    在相同条件下进行比较

    使用已记录的版本、参数、工具和数据源重放相同的输入。 当输出发生变化时重复试验并报告变化。 区分模型故障、数据缺失、工具不可用和测试缺陷。

    交付成果:成对的结果和最小化的跟踪记录。

  5. 5

    按风险类别进行决策

    即使平均值有所改善,也要按语言、文档类型和敏感情况检查损失。 在读取结果之前定义停止、纠正和有限发布标准。 一个严重案例即可成为暂缓发布的理由。

    交付成果:决策、保留和例外情况。

  6. 6

    发布后重放

    准备可恢复的配置和可联系的负责人。 将早期反馈与测试集进行比较,而不将局部成功视为所有用途的证据。 当数据或依赖关系发生变化时重新评估。

    交付成果:监控和回滚程序。

可重复使用的工作表

填写您已授权的观察结果。 这些字段是工作模板,而非观察结果。

字段待记录信息
案例和细分稳定的标识符、语言、任务类型
预期结果验收标准和参考证据
版本 A / B结果、重复、失败原因
决策接受、纠正或停止;所有者和证据

虚构示例

示例情境

虚构示例:某个版本改进了常规答案,但在文档冲突时删除了不确定性声明。

决策及预期证据

该报告隔离了该子集,保留了原始证据,并暂不发布该用途的版本,直到重新测试更正为止。

区分机制

机制目的验证或限制
稳定集版本比较避免优化
新案例发现盲点与历史结果分开报告
在役观察理解实际使用情况尊重权限、最小化和上下文

管理指标

指标衡量内容首要行动
成对损失先前已接受的案例现在失败检查每个敏感损失
注释分歧判断不同的案例比较前明确规则
分段覆盖率实际呈现的情况命名未测试的用途

常见错误

  • 在最终测试中进行优化
  • 同时更改集和版本
  • 将自动判断视为真理
  • 接受关键损失,因为 平均值改进

常见问题解答

是否需要自动评判?

不需要。 如果其评判标准经过验证,它可以加快分类速度;但对于模棱两可或成本高昂的案例,仍需业务人员裁决。

平均值改进就足够了吗?

不够。比较相关案例和细分,然后应用测试前制定的标准。

需要多少案例?

案例数量取决于多样性和风险。 报告数量、来源和局限性;任何小样本集都无法建立普遍的安全性。

官方参考文献

参考文献支持该方法。 请根据您的实际情况调整检查;它们并非认证。 原始参考文献标题和源文档可能使用其他语言。

参考资料查阅日期 .