用途:持续检查端到端成功率、人工接管、恢复、审计与单位成功任务成本。没有分母、观察期和失败定义的数据,不做横向排名。
固定字段
- 系统、场景与观察期;
- 端到端成功率及分母;
- 无人连续执行时长与每百任务人工接管次数;
- 错误发现率、自动恢复率与平均恢复时间;
- 权限、审计覆盖与完整单位成本。
初始跟踪
METR
公开 50% 成功时间跨度;接管、恢复、审计和单位经济缺失。
OSWorld提供开放电脑任务成功率;长期运行、接管、恢复和成本缺失。
GAIA提供浏览与工具链答案成功率;不测生产权限、恢复和单位经济。
Anthropic Research公开内部相对性能与约 15 倍聊天 token 成本;绝对成功率、接管和恢复时间未公开。
Klarna Assistant公司自报规模化处理量;独立解决率、升级率、恢复和完整成本未公开。
OpenAI Operator公开确认点与接管边界;长期成功率、接管率、恢复和单位成本未公开。
Anthropic Claude Code / Cowork 隔离架构(E-024,2026-07)首次给出与「人工监督」直接相关的两个分母外数字:用户最终批准约 93% 的逐项权限请求;受控红队中 25 次有 24 次执行了凭证外传。改用 OS 级沙箱后确认弹窗减少 84%。对本表的含义:人工确认不能计入可靠性,审批通过率高说明监督形同虚设;后续凡引用「有人工审核」作为安全保证的系统,必须同时给出审批通过率。仍缺:端到端成功率、接管次数、恢复时间与单位成本,且全部数字为厂商自述、无第三方审计。
当前最大缺口
市场最常披露处理量,最少披露成功分母、人工接管、失败恢复和完整成本。因此本表暂不排榜,只建立可审计口径。新增一条口径要求:凡以「人工确认/人在环」作为安全或可靠性依据的系统,须同时披露审批通过率——否则该项不计入监督有效性。