当前判断:生产失败的核心不是模型偶尔答错,而是错误能否在外部动作前被发现、能否停止扩散、能否恢复一致状态,以及责任链能否还原。

12 个具体失败模式

过度委派

简单任务生成过多代理;限制代理数、工具调用和 token 预算。

多代理重复劳动

子任务高度重叠;用覆盖矩阵与冲突检测去重。

无止境搜索

结果已充分仍继续调用;预先定义充分条件与最大轮次。

错误工具选择

数据域与工具域不匹配;执行前校验工具前置条件。

目标漂移

模糊委派缺目标、来源、格式或边界;不完整任务 schema 应拒绝执行。

计划丢失

长任务压缩后偏离原目标;持久化计划并分阶段回看。

置信错误驱动动作

模型以确定语气输出错误内容;高影响动作必须使用外部验证器。

自动化偏见

人工持续接受建议而不挑战;设置强制复核点和可逆决策。

上游组件不可追踪

模型、数据或工具版本不明;维护组件清单、版本锁和 provenance。

隐私数据超范围流动

工具输入或日志含越界数据;最小化、脱敏、域隔离并记录数据流。

权限与身份滥用

包括 goal hijacking、tool misuse、privilege abuse、memory poisoning、跨代理通信失守与 rogue agents;最小权限、动作 allowlist、运行时隔离和确认点缺一不可。

重试扩大副作用

网络错误后重复写入或创建对象;使用幂等键、参数一致性检查、重试上限与“至多一次”语义。

统一验收格式

每个 Agent 流程都应回答七个问题:触发条件是什么、最早信号是什么、影响了什么对象、自动止损是什么、何时人工接管、怎样恢复一致状态、哪些日志能证明恢复完成。

来源边界

Anthropic 提供真实多代理工程失败,NIST 提供跨行业风险与治理结构,OWASP 提供 Agent 特有安全威胁,AWS 与 Stripe 提供重试和幂等工程语义。它们共同支持分类框架,但不提供统一事故发生率,因此本页不排风险概率榜。