RESEARCH EVOLUTION · R1.0—R3.2

四道母题的
判断演化记录

从新增第四母题,到把研究重心转向可靠执行:这里保留每次新增证据、旧判断缺口、当前倾向与下一项验证。

R
研究判断版本事实或解释改变研究判断
W
网站设计版本只改变组织与呈现,不升级结论
01

完整历程

2026-07-18 — 2026-07-19

研究判断如何一步步改写

研究轨与设计轨分开编号。视觉重做不能冒充研究进展。

R3.1当前判断

研究地图越大,越需要统一证据字段

三份内部协作材料形成专题、产品与总地图三层语料,但产品数据出现时间倒挂与机械等差序列。框架可以保留,数字必须回到原始来源重建。

新增
研究卡 038 与 E-028:公开错误类型与验收方法,不公开内部原文件和作者身份。
不改变
jaiv1 商业预测与 jairl 四道母题置信度全部不动。
R1.0结构修正

从三题变成四题

原框架覆盖商业与架构,却解释不了 AI 如何进入真实生产。新增“可靠生产系统”,把记忆、工具、验证、权限、审计和责任纳入研究。

改变
研究对象由商业与架构两端,扩成贯穿真实生产闭环的四道母题。
待验证
复合系统能否在长期任务中稳定运行。
R1.1证据约束

ScienceOne 没有改变当前结论

发布材料展示了模型、数据库、工具与科研工作流的组合,但缺少完整测试集、原始输出、成本和外部复现。

保留
“复合系统值得观察”的路线线索。
拒绝
不采信“性能领先”或“工作流已重塑”。
R1.2基座沉淀

登记两份外部历史研究基座

从独立专题站 jaiv2 与 jvalue 抽取五层结算栈、默认入口、关系型护城河和对象—规则—行动系统。jaiv2 的 48 节专题内容继续在 jaiv2.pages.dev 独立维护。

继承
结构性变量与研究问题。
边界
jairl 不收录 jaiv2 主体;旧财务数字与旧公司判断不自动视为当前事实。
R1.3方法升级

从研究章程变成证据系统

外部审计指出“证据先于叙事”没有公开证据坐标。于是补上证据账本、判断卡、反证条件、置信度与版本记录。

新增
17 条证据坐标与四张判断卡的基础结构。
约束
没有来源、强度与作用边界的材料不能直接升级判断。
R1.4输出 001

第一份技术比较研究

基于原始论文比较 Transformer、Mamba、RWKV、xLSTM 与 Hyena 的复杂度、推理状态、论文规模与证据缺口。

判断变化
从“寻找替代者”收敛为“当前无全面替代者,混合架构先验更稳”。
证据缺口
缺少统一训练预算下的大规模跨架构复现。
R1.5输出 002

第一份模型公司护城河比较

比较 OpenAI、Anthropic、Google、Meta 与 DeepSeek 的模型、成本、入口、企业工作流和价值捕获。

判断变化
从“谁模型最强”转向“谁掌握入口、系统资产、企业关系与价值捕获”。
证据缺口
私营模型公司的留存、毛利与资本条款不透明。
R1.6历史

演化本身成为研究主产品

研究不再是一组静态文章,而是一条可检查的判断链。当前重心从模型能力竞赛转向系统价值验证。

当前倾向
入口、工作流、系统资产与可靠执行,更可能决定长期价值捕获。
下一验证
可靠生产系统基准与护城河指标仪表盘。
R3.0当前判断

流量口径闸门:渠道领先不得外推为护城河

第五次报告预读版、新版工作簿与 190 张产品界面 OCR(E-026,三级材料)把三条战线的形态分清楚了:豆包赢移动触达、WorkBuddy 赢桌面分发、TraeWork 赢主动工作深度、可灵赢专业创作意图。但材料把头部流量、模型品牌、数据飞轮与商业化优势连成一条链,链上没有一环有独立证据。

新增
研究卡 036:一处重复乘算错误(放大倍数随频次而异,改变了产品相对排序)、三处口径风险、七条暂时判断的逐条校正、四条反证条件。
不改变
四道母题置信度一律不动。报告独立收敛到与本站同构的四层控制点结构,可记为结构层交叉验证;但它自列的胜负指标全篇无一给值。
R2.9历史

Harness 能否成为独立利润吸收层

R1.7—R2.8 的逐条记录见版本记录页。本条以《中国模型公司产品》工作簿(E-025,三级材料)拆出模型、Harness、Workspace、Skill 生态与交易权限五个控制点,登记候选判断:Harness 可能是模型商品化之后独立的利润吸收层。

新增
研究卡 035:五个控制点、五家公司位置、五条反证条件与十项跟踪变量;主归属 Q1,交叉引用 Q4。
不改变
四道母题置信度一律不动。材料为产品与商业研究而非实验证据,且豆包成本收入、各产品 DAU、智谱 ARR、任务通过率均未独立复现,只作观察层补强。
02

当前状态

CURRENT STATE · R1.6

四题不是同样成熟

置信度不是精确概率,而是让不确定性、反证压力与研究优先级可见。

Q1 · 护城河72%

系统资产比权重更重要

72%

已知入口、生态、成本、工作流和客户关系可形成复合壁垒。

缺口私营模型公司的留存、毛利和资本条款不透明。

打开判断卡 →
Q2 · Transformer68%

经济瓶颈比技术死亡更确定

68%

已知长序列计算、内存与推理成本是明确约束。

缺口缺少统一训练预算下的大规模跨架构复现。

打开判断卡 →
Q3 · 下一代底座65%

混合架构暂时最可信

65%

已知SSM、循环和长卷积各自解决部分约束。

缺口没有单一路线在规模、生态和真实任务上全面胜出。

打开判断卡 →
Q4 · 可靠系统52%

复合系统仍是方向,但验证层本身已被证明不可靠

52%

已知模型、工具、权限、验证和回滚必须协同。新增(R3.2)用来判定可靠性的评估机制自身可被污染:某第三方独立调查在前沿实验室的评估记录中量出约 7% 被工具调用欺骗;另一起事件中,评估环境内的自动化集群逃出沙箱并经第三方跳板进入他人内网。

缺口长任务成功率、人工接管率和失败恢复数据稀缺。新增缺口污染率 7% 是首次量化,无历史序列,因此无法判断这是情况恶化还是审计能力提升

打开判断卡 →
03

研究路线

NEXT RESEARCH

下一步以完成标准为终点

按证据价值排序,不按发布热度排序。

  1. NOW现在

    研究卡 003:可靠生产系统基准

    建立统一比较框架:真实任务成功率、连续执行时长、人工接管率、错误恢复、权限边界、审计能力与单任务成本。

    完成标准:至少 3 个公开基准+3 个真实产品或案例,正反证据同时入账。
  2. NEXT接着

    护城河指标仪表盘

    把价格、推理成本、默认入口、开发者生态、企业客户深度、资本强度与价值捕获变成可周期更新的指标。

    完成标准:每项指标有来源、日期、可比口径和失效条件。
  3. THEN然后

    架构比较卡第二轮

    补充混合架构与更大规模复现,不再只比较原始论文承诺。

    完成标准:同任务、近似预算、可复现结果优先,无法横比时明确拒绝排名。
  4. LOOP每月

    四道判断卡复核

    检查新增证据是否改变置信度、最强反证或承认错误条件。

    完成标准:无变化也记录“检查过但未升级”,避免沉默造成假稳定。