结论:能力增益成立,经济胜利未证。更多推理时间、采样、搜索与验证可以提高部分难题成功率,但这不是 Transformer 架构突破,也没有证明每个成功任务的总成本下降。Q2 总判断维持 68%;其中经济瓶颈维持 78%。
四层证据
Snell 等人的受控研究显示,按题目难度自适应分配推理算力,比 best-of-N 基线高效 4 倍以上;在小模型已有非微弱成功率的题目上,较小模型可在 FLOPs 匹配下超过 14 倍大的模型。边界同样明确:最优策略随题目难度变化,并非“多想总会更好”。
预算强制 · benchmark 可提升s1 用 budget forcing 延长或截断推理,在 AIME24 上把 32B 模型从 50% 提到 57%。这是数学 benchmark 的能力证据,不是生产任务的延迟、恢复、人工复核或完整成本证据。
产品机制 · 思考已成为可控资源Anthropic 提供 thinking budget / effort 控制,并明确完整 thinking tokens 计费;Google 同样单列 thought tokens,响应价格为输出 token 与思考 token 之和。隐藏或省略思考内容可以减少传输与首字等待,不会消除计算费用。
缺失字段 · 无法结算现有公开材料没有同时给出:同一真实任务、相同质量门槛、不同推理预算、成功分母、P50/P95 延迟、重试、人工复核、恢复与每成功任务全成本。
判断修正
- 技术:test-time compute 是把算力从训练期搬到推理期并按题目分配,不等于基础架构已经突破。
- 经济:token 单价下降可能被更多思考、搜索、验证和重试吃掉;应看 cost per successful task,而不是 cost per token。
- 产品:简单任务应低思考,复杂任务才增加预算。不能自适应路由的系统,会把质量增益变成普遍延迟与成本税。
唯一允许改变判断的数据包
至少三个真实生产流程,在固定质量门槛下公开不同 reasoning effort 的成功率、P50/P95 延迟、总 token/算力、重试、人工接管和每成功任务全成本。若高推理预算在这些流程中持续降低完整成本,经济瓶颈下调;若只提高 benchmark 或准确率而总成本上升,维持或上调。