当前判断:AI 的下一段价值不只来自模型更强,而来自模型、记忆、工具、验证器、权限、工作流和责任边界能否组成稳定系统。
八个核心变量
能否持续执行数小时或数天,保持目标、状态和约束,不断档、不漂移。
记忆与遗忘能否保留有用历史,在环境变化时清除过期状态,避免错误惯性。
工具执行能否正确选择工具、处理失败、检查副作用,并基于结果修正下一步。
世界状态是否理解行动对象、环境变化、时间连续性和因果后果,而不只是生成语言。
验证纠错结果能否由测试、规则、外部传感器或人类复核;错误能否定位、回滚和重试。
权限审计是否遵守最小权限,记录谁在何时基于什么证据做了什么动作。
人工接管人工接管率是否下降;高风险节点是否知道必须停下来请求授权。
责任边界结果、损失、异常和合同责任能否清楚归因,不用“模型生成”逃避责任。
真正的验收指标
不只看 benchmark。重点看端到端任务成功率、无人工连续运行时间、每任务人工接管次数、错误发现与恢复率、可审计覆盖率、单位成功任务成本,以及部署后的真实留存。
研究卡 003:公开基准给出的边界
以 50% 成功率对应的人类任务时长衡量可靠执行。论文报告 Claude 3.7 Sonnet 约为 50 分钟,并明确提醒软件任务结果不能直接外推到所有生产流程。 来源
OSWorld369 个真实网页与桌面任务中,原始论文报告人类成功率超过 72.36%,当时最佳模型为 12.24%。真实 GUI、操作知识和跨应用状态会放大错误。 来源
GAIA466 个需要推理、多模态、浏览和工具调用的问题中,原始论文报告人类为 92%,带插件的 GPT-4 为 15%。工具可用不等于工具链可靠。 来源
研究卡 003:生产案例
厂商工程复盘显示,多智能体方案在内部研究评测上相对单代理提高 90.2%,但约使用普通聊天 15 倍 token。性能提升成立,不代表单位经济普遍成立。 来源
Klarna 客服助手公司曾自报首月处理约三分之二客服对话。该案例支持边界清楚、可升级人工的高频流程,但“处理量”不是端到端解决率,且数据缺少独立审计。 来源
OpenAI Operator产品把确认、接管和高风险动作限制内置于执行链,说明生产可靠性依赖权限边界,而不是默认完全自治。真实用户长期成功率、恢复时间和单位成功成本仍未公开。 来源
研究卡 003 的当前结论
AI 已可进入边界清楚、可验证、可回滚且任务价值较高的生产子流程;开放环境的通用自主执行尚未成立。下一轮不再追单项榜单,而是追踪生产期端到端成功率、每百任务人工接管次数、自动恢复率、平均恢复时间、审计覆盖率与单位成功任务成本。
jvalue 继承:对象—规则—行动闭环
AI 必须知道组织里有什么、对象如何关联、状态如何变化,而不只是读取文本。
规则与权限层谁能基于什么证据,对什么对象执行什么动作,必须可限制、可授权、可追责。
行动与回写层输出要变成可执行 Action,并把结果回写真实状态,形成下一轮决策的输入。
部署与恢复层生产价值还取决于版本控制、环境适配、监控、回滚和长期运营;不能部署和恢复的 Action 仍是演示。
产品化检验客户越深不必然越好。若现场经验不能沉淀成模板、平台能力和客户自助,深度嵌入会退化为高成本定制。
当前风险
Agent 演示容易选择成功样本;长上下文不等于稳定记忆;工具调用不等于懂得验证;自动化越深,错误传播和权限风险越大。系统必须用独立传感器和护栏约束模型,不能让模型自己证明自己可靠。
观察案例:ScienceOne(未验证)
ScienceOne 把科学多模态模型、论文与专业数据库、科研工具和任务工作流组合在一起。这与本母题的核心判断一致:可靠能力更可能来自复合系统,而不只是更大的模型。
它尚未证明什么发布材料没有公开完整 benchmark、测试集、样本量、原始输出、模型与工具权限、运行预算及外部复现。“第三方模型盲评”仍属于 LLM-as-judge,不能替代领域专家评审和真实实验验证。
当前证据处理只登记为产品路线观察,不作为“性能领先”或“科研工作流已被重塑”的证据,也不改变本站当前判断。
升级为有效证据的条件公开技术报告与测试集、独立团队复现、真实科研任务成功率、人工接管率、错误恢复记录、成本数据,以及实验或临床层面的结果验证。
研究卡 033:可解释性与责任链闸门
内部机理尚未完全可读,不妨碍模型进入可验证、可回滚、低损失任务;任务越高风险、越难外部核验、越不可逆,就越需要日志、独立验证、人工监督、申诉、回滚与明确责任主体。可解释性是重要风险传感器,但不是可靠性的唯一充分条件。 查看完整审计卡 →
反证条件
如果系统在开放环境中的成功率长期停滞、人工接管无法下降、错误恢复成本高于人工执行,或权限与责任无法合同化,则“可靠生产系统”仍只是包装过的 Copilot。
与另外三题的关系
- 它检验 Transformer 的能力是否真正转化为生产表现;
- 它检验新架构是否解决长程状态、成本或可靠性问题;
- 它决定模型能力能否沉淀为工作流、数据反馈、迁移成本和商业护城河。