总判定:0 / 6 可排名。没有一个来源同时公开端到端成功率与分母、人工接管率、重试/失败定义、自动恢复率与恢复时间、完整单位成功任务成本。Q4 维持 58%。
逐项判定
METR · BLOCKED
有 benchmark 成功曲线和失败定义;不提供生产接管、恢复与完整成本。
OSWorld / GAIA · BLOCKED有 benchmark 成功率;不测长期生产权限、人工接管、恢复和任务级经济。
Anthropic Research · BLOCKED内部 eval 相对单代理提升 90.2%,多代理约为 chat 的 15× token;没有绝对生产成功率、接管率和恢复时间。
Klarna Assistant · BLOCKED首月 230 万次对话、复询下降 25%、自报利润改善;没有独立解决分母、人工升级率、恢复与完整成本。
OpenAI Operator · BLOCKED公开登录、支付、验证码接管和重大动作确认;不公开长期接管率、恢复率与单位成功成本。
五种不能偷换
- 处理量不等于独立解决率;
- 相对 benchmark 提升不等于绝对生产成功率;
- 有接管机制不等于低接管率;
- token 倍数不等于完整单位成功成本;
- 自报利润改善不等于经审计的任务级单位经济。
唯一允许改变 Q4 的数据包
至少三个独立真实流程,在连续观察期同时披露五字段;成功定义一致,成本计入推理、工具、验证、重试、人工接管与失败损失。字段不足就写“不可排名”,不调整概率。
当前判断
AI 已适合边界清楚、可验证、可回滚的生产子流程;“通用自主生产可靠性”仍未被公开数据证明。