结论:能力增益成立,经济胜利未证。更多推理时间、采样、搜索与验证可以提高部分难题成功率,但这不是 Transformer 架构突破,也没有证明每个成功任务的总成本下降。Q2 总判断维持 68%;其中经济瓶颈维持 78%。

四层证据

研究结果 · 收益依赖题目

Snell 等人的受控研究显示,按题目难度自适应分配推理算力,比 best-of-N 基线高效 4 倍以上;在小模型已有非微弱成功率的题目上,较小模型可在 FLOPs 匹配下超过 14 倍大的模型。边界同样明确:最优策略随题目难度变化,并非“多想总会更好”。

预算强制 · benchmark 可提升

s1 用 budget forcing 延长或截断推理,在 AIME24 上把 32B 模型从 50% 提到 57%。这是数学 benchmark 的能力证据,不是生产任务的延迟、恢复、人工复核或完整成本证据。

产品机制 · 思考已成为可控资源

Anthropic 提供 thinking budget / effort 控制,并明确完整 thinking tokens 计费;Google 同样单列 thought tokens,响应价格为输出 token 与思考 token 之和。隐藏或省略思考内容可以减少传输与首字等待,不会消除计算费用。

缺失字段 · 无法结算

现有公开材料没有同时给出:同一真实任务、相同质量门槛、不同推理预算、成功分母、P50/P95 延迟、重试、人工复核、恢复与每成功任务全成本。

判断修正

唯一允许改变判断的数据包

至少三个真实生产流程,在固定质量门槛下公开不同 reasoning effort 的成功率、P50/P95 延迟、总 token/算力、重试、人工接管和每成功任务全成本。若高推理预算在这些流程中持续降低完整成本,经济瓶颈下调;若只提高 benchmark 或准确率而总成本上升,维持或上调。

来源