总判定:0 / 6 可排名。没有一个来源同时公开端到端成功率与分母、人工接管率、重试/失败定义、自动恢复率与恢复时间、完整单位成功任务成本。Q4 维持 58%

逐项判定

METR · BLOCKED

有 benchmark 成功曲线和失败定义;不提供生产接管、恢复与完整成本。

OSWorld / GAIA · BLOCKED

有 benchmark 成功率;不测长期生产权限、人工接管、恢复和任务级经济。

Anthropic Research · BLOCKED

内部 eval 相对单代理提升 90.2%,多代理约为 chat 的 15× token;没有绝对生产成功率、接管率和恢复时间。

Klarna Assistant · BLOCKED

首月 230 万次对话、复询下降 25%、自报利润改善;没有独立解决分母、人工升级率、恢复与完整成本。

OpenAI Operator · BLOCKED

公开登录、支付、验证码接管和重大动作确认;不公开长期接管率、恢复率与单位成功成本。

五种不能偷换

唯一允许改变 Q4 的数据包

至少三个独立真实流程,在连续观察期同时披露五字段;成功定义一致,成本计入推理、工具、验证、重试、人工接管与失败损失。字段不足就写“不可排名”,不调整概率。

当前判断

AI 已适合边界清楚、可验证、可回滚的生产子流程;“通用自主生产可靠性”仍未被公开数据证明。