用途:持续检查端到端成功率、人工接管、恢复、审计与单位成功任务成本。没有分母、观察期和失败定义的数据,不做横向排名。

固定字段

初始跟踪

METR

公开 50% 成功时间跨度;接管、恢复、审计和单位经济缺失。

OSWorld

提供开放电脑任务成功率;长期运行、接管、恢复和成本缺失。

GAIA

提供浏览与工具链答案成功率;不测生产权限、恢复和单位经济。

Anthropic Research

公开内部相对性能与约 15 倍聊天 token 成本;绝对成功率、接管和恢复时间未公开。

Klarna Assistant

公司自报规模化处理量;独立解决率、升级率、恢复和完整成本未公开。

OpenAI Operator

公开确认点与接管边界;长期成功率、接管率、恢复和单位成本未公开。

Anthropic Claude Code / Cowork 隔离架构(E-024,2026-07)

首次给出与「人工监督」直接相关的两个分母外数字:用户最终批准约 93% 的逐项权限请求;受控红队中 25 次有 24 次执行了凭证外传。改用 OS 级沙箱后确认弹窗减少 84%。对本表的含义:人工确认不能计入可靠性,审批通过率高说明监督形同虚设;后续凡引用「有人工审核」作为安全保证的系统,必须同时给出审批通过率。仍缺:端到端成功率、接管次数、恢复时间与单位成本,且全部数字为厂商自述、无第三方审计。

当前最大缺口

市场最常披露处理量,最少披露成功分母、人工接管、失败恢复和完整成本。因此本表暂不排榜,只建立可审计口径。新增一条口径要求:凡以「人工确认/人在环」作为安全或可靠性依据的系统,须同时披露审批通过率——否则该项不计入监督有效性。