结论:路由机制可行,生产经济不可结算。模型路由和 adaptive thinking 已证明能按任务差异分配资源;但公开证据没有给出生产混淆矩阵、错误路由后的重试/事故成本与每成功任务全成本。Q2 总判断维持 68%,经济瓶颈维持 78%。

四类证据

RouteLLM · benchmark 节省成立

RouteLLM 用偏好数据在强弱模型之间动态选择;论文报告某些测试中,在不牺牲回答质量的条件下成本降低超过 2 倍,并观察到更换强弱模型后的迁移能力。它证明路由器可以学,不证明生产分布漂移下仍然校准。

FrugalGPT · 级联潜力成立

FrugalGPT 在其数据集与当时价格条件下,报告最多 98% 成本下降而匹配最佳单模型,或在相同成本下比 GPT-4 高 4% 准确率。结果高度依赖任务集、评分器、模型组合和历史价格,不能直接外推到当前生产系统。

厂商机制 · 自适应已产品化

Anthropic adaptive thinking 让模型按请求复杂度决定是否思考及思考量;OpenAI reasoning effort 也允许低到高的推理强度,并说明模型会对简单任务少用 token、复杂任务多思考。机制可用,不等于难度判断准确率已公开。

关键缺口 · 误判账本缺失

没有公开材料同时披露:简单/困难任务真值、路由选择、假阴性与假阳性、质量损失、额外延迟、重试、人工接管、线上事故和每成功任务全成本。

两类误判必须分开

判断修正

022 的“按题目分配算力”从研究策略升级为可产品化机制,但经济结论仍不能升级。真正的优化目标不是平均 token 最少,而是在质量门槛和失败损失约束下,让每成功任务全成本最低。路由器本身还会引入分类、监控、回退和校准成本。

唯一允许改变判断的数据包

至少三个连续运行的真实流程,按任务类别公开路由混淆矩阵、质量门槛、P50/P95 延迟、token/费用、重试、接管、事故损失和每成功任务全成本,并与固定高推理基线对照。只有总体成本下降且假阴性风险不恶化,经济瓶颈才允许下调。

来源