当前判断:Agent 实际能力不是模型分数,而是模型能力 × 环境权限 × 验证质量 × 持续运行机制。K3 说明底层模型仍在改进记忆、检索与稀疏容量;产品则可能释放或压住这些能力。Q4 维持 58%,因为长期自主任务的正确率、接管率和完整成本仍缺独立数据。
架构层:记忆不是上下文长度的同义词
精确检索 token 上下文,但 KV cache 随序列增长,受显存与带宽约束。
线性注意力 → DeltaNet → Gated DeltaNet固定状态降低增长成本,却带来信息干扰;Delta rule 增加定点覆盖,门控增加动态遗忘。
KDA + MLAKDA 用逐通道衰减管理固定状态,周期性 MLA 保留完整 softmax 检索,避免把有限状态冒充无损记忆。
MoE + AttnRes稀疏专家扩充容量;块级 Attention Residuals 让深层网络选择性读取较早表示,缓解跨层信息稀释。
参数边界:“一个 K3 等于 22,580 个 GPT-2”只是 2.8T 总参数除以 124M。K3 每 token 只激活 896 个路由专家中的 16 个;总参数、激活参数、推理成本与能力不能混用。
产品层:能力可能被释放,也可能被束缚
Product overhang 是可检验假说:模型已有能力可能因工具不足、权限过窄、反馈缺失或过度脚手架而无法进入产品。放宽权限也可能只扩大错误半径。
- 最小 Harness:安全、权限、审计与回滚不可删;能力型提示只在同类失败重复出现后加入。
- 验证器优先:测试、静态分析、截图对比、真实环境探测和可逆检查,优先于继续堆提示词。
- 代际消融:模型升级后在隔离环境重测旧 skills、hooks 与 system prompt;用成功率、错误率、成本和接管率决定保留。
- 持续运行不等于持续正确:任务跑几天或几周只证明没有停止,不能证明目标未漂移、结果正确或无需人工。
数据飞轮:必须补齐中间链条
高质量任务 → 可观测轨迹 → 明确失败标签 → 合法可用数据 → 评测/训练改进 → 更高任务成功率 → 更多高质量任务。
使用分析、数据保留、训练授权和实际训练使用是四件不同的事。没有失败标签的轨迹可能只是噪音;没有权限证据,不能把用户会话直接写成专有训练护城河。
证据等级与停止条件
Kimi 官方公开的架构、权重与关键 Infra;开源建模代码支持的架构解释;已有生产 Harness 的可验证失败与恢复记录。
只作线索Opus 5 可自主运行数月、提示注入已解决、11 天重写 Bun 等同一年工程团队、40 万会话已进入训练。
下一次只接受统一真实任务下的成功率、人工接管、恢复、耗时、token 与总成本;或可审计的数据授权、训练使用和改进幅度。
修正原则
能形成增量判断就公开,但标明事实、解释和待验证项;后续出现原论文、代码、基准或真实任务反证时,直接修订页面和版本账本,不保护旧结论。