当前判断:生产失败的核心不是模型偶尔答错,而是错误能否在外部动作前被发现、能否停止扩散、能否恢复一致状态,以及责任链能否还原。
12 个具体失败模式
简单任务生成过多代理;限制代理数、工具调用和 token 预算。
多代理重复劳动子任务高度重叠;用覆盖矩阵与冲突检测去重。
无止境搜索结果已充分仍继续调用;预先定义充分条件与最大轮次。
错误工具选择数据域与工具域不匹配;执行前校验工具前置条件。
目标漂移模糊委派缺目标、来源、格式或边界;不完整任务 schema 应拒绝执行。
计划丢失长任务压缩后偏离原目标;持久化计划并分阶段回看。
置信错误驱动动作模型以确定语气输出错误内容;高影响动作必须使用外部验证器。
自动化偏见人工持续接受建议而不挑战;设置强制复核点和可逆决策。
上游组件不可追踪模型、数据或工具版本不明;维护组件清单、版本锁和 provenance。
隐私数据超范围流动工具输入或日志含越界数据;最小化、脱敏、域隔离并记录数据流。
权限与身份滥用包括 goal hijacking、tool misuse、privilege abuse、memory poisoning、跨代理通信失守与 rogue agents;最小权限、动作 allowlist、运行时隔离和确认点缺一不可。
重试扩大副作用网络错误后重复写入或创建对象;使用幂等键、参数一致性检查、重试上限与“至多一次”语义。
统一验收格式
每个 Agent 流程都应回答七个问题:触发条件是什么、最早信号是什么、影响了什么对象、自动止损是什么、何时人工接管、怎样恢复一致状态、哪些日志能证明恢复完成。
来源边界
Anthropic 提供真实多代理工程失败,NIST 提供跨行业风险与治理结构,OWASP 提供 Agent 特有安全威胁,AWS 与 Stripe 提供重试和幂等工程语义。它们共同支持分类框架,但不提供统一事故发生率,因此本页不排风险概率榜。