当前判断:内部机理尚未完全可读,不妨碍模型在可验证、可回滚、低损失任务中使用;但任务越高风险、越难外部核验、越不可逆,系统越不能只依赖输出测试,必须补上日志、独立验证、人工监督、申诉、回滚与明确责任主体。可解释性是重要风险传感器,但不是可靠性的唯一充分条件。Q4 维持 58%。
先拆开三个常被混用的概念
能否把模型内部表征或计算路径映射为人可理解、可干预、可重复验证的因果特征。
系统可审计性能否记录输入、版本、权限、工具动作、外部证据、人工接管、输出与后果,并允许复盘和追责。它不要求先读懂每个参数。
责任可归属谁批准部署、谁监控、谁承担损失、谁有停止和纠错义务。责任不能由“模型生成”承担。
人类为何能使用看不懂内部零件的模型
使用门槛不是完全理解内部机制,而是能否在限定分布内测量行为、控制权限并限制失败后果。翻译、资料整理和代码草稿可以由人或测试直接验收;高风险任务若结果难验证、错误不可逆或影响基本权利,仅靠平均准确率不够。
当前技术证据
研究者从 Claude 3 Sonnet 中提取数百万特征,并通过增强或抑制部分特征观察到相应行为变化。这说明某些内部表征可被定位和因果干预;但研究只提供粗略局部地图,不等于解释任意输出、覆盖全部层或完成生产级审计。来源
NIST AI RMFNIST 把可信性放进完整风险管理框架,强调设计、开发、使用和评估全过程,而不是把“能解释每个神经元”设为唯一准入条件。来源
EU AI Act欧盟对高风险系统要求风险管理、活动日志、文档、部署者信息、人工监督、稳健性、网络安全和准确性。监管路径本身说明:现实可托付依靠多层控制组合,不只依靠模型内部解释。来源
对 MoE 的准确边界
“专家”并不天然对应数学、代码或中文等人类职业标签;Router 学到的是分布式统计分工。工程师可以通过路由比例、负载均衡、吞吐、延迟和任务质量使用它,但不能因此推断某个专家对某类输出承担清晰、稳定、唯一的因果责任。
Q4 生产准入规则
- 低风险、可核验、可回滚:允许黑箱模型进入工作流,重点验收结果和成本。
- 中风险、多步骤:必须有工具权限隔离、独立验证器、完整日志、失败恢复和人工升级。
- 高风险、难核验、不可逆:模型不得成为唯一决策者;必须保留有能力的人类监督、申诉渠道、责任主体和停止机制。
需要修正的旧表述
“没有内部可解释性,就绝不能进入金融、医疗、司法”过强。现实制度允许经过验证、受监督、可审计的复杂黑箱组件参与高风险流程;真正不能接受的是没有外部验证、没有日志、没有人类监督、没有申诉与责任主体的自主决策链。
升级与否证条件
方法能跨模型、跨层、跨任务复现;对关键行为给出稳定因果链;能在部署前发现传统行为测试漏掉的风险,并降低真实事故率。
上调系统可托付多个高责任流程长期披露端到端成功率、误伤率、人工接管率、申诉纠错率、事故损失、日志覆盖与责任执行数据。
下调内部解释只生成听起来合理的事后故事,无法预测或干预行为;或系统虽有日志和人工监督,实际仍无法发现、阻断和纠正重大错误。
停止条件不收集“某特征像某概念”的重复展示;下一轮只接受跨模型复现、因果干预、事故降低或生产责任数据。