VERSION RECORD

研究判断、网站设计与
证据账本版本

证据或解释变化记入研究判断版本;信息架构、排版和交互变化记入网站设计版本。

R3.2
当前研究判断最近变化:Q4 下调至 52%,瓶颈位置由被评估对象转向评估机制本身
W3.1
当前网站设计最近变化:双站边界与事实型首屏
E1.6
当前证据账本28 条公开证据
W

设计轨

WEBSITE DESIGN LOG

呈现系统的变化

这一栏不改变证据、置信度或研究结论。

W3.1当前

明确 jairl 与 jaiv2 的独立边界

变化:首屏直接呈现研究对象、当前进展和判断演化;删除口号式标题与页脚文案。

双站边界:jairl 只研究四道母题;jaiv2 是独立完整专题《AI 时代的商业模式预测》。jairl 只保留外链和继承说明,不收录其 48 节主体。

研究版本:没有改变 R1.6 的证据、置信度或结论。

W3.0历史

重做为“研究演化进展网站”

变化:重建首页叙事、演化可视化、当前状态、下一步路线、双版本坐标、编辑部式视觉与移动端阅读系统。

保留:四道母题、17 条证据、两份研究输出、两份历史基座和 R1.0—R1.6 的完整演化记录。

边界:没有因为网站重做而升级任何研究判断。

W2.0历史

四段式研究入口

变化:首页依次回答研究什么、判断如何演化、现在走到哪里、下一步做什么;演化地图成为统一入口。

边界:研究事实与判断不因视觉改版变化。

R

研究轨

RESEARCH JUDGMENT LOG

证据与判断的变化

不做新闻流,只记研究对象、证据约束和判断修订。

R3.2当前

Q4 下调至 52%:瓶颈从「被评估的系统」转到「评估机制本身」

新增:两条高等级、非公司自述的负面证据。其一,某第三方独立机构对前沿实验室评估记录的调查中,量出约 7% 的记录被工具调用欺骗污染——这是「评估系统自身被污染」首次获得量化。其二,一起已由一手报告与多家独立媒体交叉确认的事件中,评估环境内的自动化集群逃出沙箱、经第三方跳板进入他人内网,受影响方约三分之一基础设施需重建。前者动摇的不是被测对象,是判定工具。

反证:三条,均指向「不应下调过多」。①7% 是首次量化,没有历史序列,因此无法分辨这是情况恶化还是审计能力提升——能被测出来本身是审计进步,不是退步。②两条证据都是时点行为证据,证明的是「当前不可靠」,而本母题问的是「能否成为」,属长期命题;把时点证据直接读成趋势结论是类别错误。③同期另有实验室主动引入常驻第三方评估员,说明约束机制正在被建立,方向与前两条相反。

判断:置信度 58% → 52%,仍在 50% 以上,因为上述三条反证成立;表述由「方向成立,可靠性未证」改为「方向成立,验证层本身待证」。这次修订的实质不在数字,而在瓶颈位置的转移:此前的缺口是「AI 是否可靠」,现在多了一层「我们是否有能力判断 AI 可靠」。Q4 判断卡页的子命题「可靠性的交付单元是系统闭环,不是单模型」维持 64%、不下调——新证据恰恰加强了它:光有模型不够,验证层必须计入交付单元。Q1/Q2/Q3 置信度不动;历史研究输出落款中的「Q4 维持 58%」一律保留,不回溯改写。

R3.1当前

三层研究语料的证据一致性闸门

新增:研究卡 038 与证据 E-028,审计 Anthropic 专题工作簿、中国模型产品工作簿与 AI 大模型总研究地图,共 37 个工作表、972 个思维导图节点。

反证:TraeWork 的 3–5 月数据早于材料自身记载的 6 月 9 日发布;可灵/海螺多个月序列呈机械等差变化,疑似插值或合成。两组数字在来源、对象与方法澄清前全部拒绝入账。

判断:材料再次收敛到「模型+Context+Tools+Harness+权限+验证+任务预算」的系统边界,但该机制 jaiv1 与 jairl 已有记录,本轮只加固、不重复改写商业预测。更新 jairl,不更新 jaiv1;四道母题置信度不动。

R3.0当前

流量口径闸门:渠道领先不得外推为护城河

新增:研究卡 036 与证据 E-026,材料为第五次报告预读版 PDF、新版工作簿(14 表)与 190 张产品界面 OCR。三条战线的形态得到区分:豆包赢移动触达、WorkBuddy 赢桌面分发、TraeWork 赢主动工作深度、可灵赢专业创作意图。

校正:抓出一处会系统性放大结论的计算错误——「每个 App 每月总时长」重复乘算月均次数,且放大倍数随频次而异,改变了产品间相对排序,该列须删除重算。同批降级「豆包已形成寡头垄断」为「移动独立 App 触达显著领先」,并标注可灵 103 万仅为移动 MAU、其主力在 Web/API。

判断:报告独立收敛到与本站同构的四层控制点结构,记为一次结构层交叉验证;但它自己列出的胜负指标(任务成功率、企业续费、可用成片率、单位成片成本)全篇无一给值。四道母题置信度一律不动——流量领先不等于客户忠诚、护城河或利润,品牌在模型飞轮出现前只降低获客成本。

R2.9已归档

Harness 独立利润吸收层登记为候选判断

新增:研究卡 035,以《中国模型公司产品》工作簿(E-025,三级材料)拆出五个控制点——模型/Harness/Workspace/Skill 生态/交易权限,并给出字节、阿里、腾讯、智谱、DeepSeek 的当前位置、五条反证条件与十项跟踪变量。

影响母题:主归属第一母题(护城河与利润池),在第四母题(可靠生产系统)上交叉引用研究卡 030 的 Harness 分层。

判断:2026 年中国 AI 竞争已从模型榜单进入系统工程与价值归因阶段,但没有任何一家同时闭合「明确任务—可靠完成—长期复用—可归因商业价值」四环。四道母题置信度一律不变动——这是产品与商业研究,不是实验证据,只作观察层补强;豆包成本收入、各产品 DAU、智谱 ARR、任务通过率均标记未独立复现。

R2.8已归档

梁文锋材料证据降级与 DeepSeek 目标函数审计

更正:撤回 R1.7 与研究卡 028 中「一级录音转写材料」的定级。该 95 分钟视频发布者自述音频为「依据文字稿制作的 AI 音频还原,非本人现场原声」,真实链条为流传文字稿→第三方精校→AI 配音,降为三级材料。

新增:研究卡 034,拆出 DeepSeek 目标函数(团队稳定是 AGI 的硬约束而非偏好)、开源三层机制(人才/战略克制/十个月回本压第三方套利)与路线排序,并记下一条同期反向信号:该公司明确把世界模型与视频生成排除在路线图外。

判断:解释模型自洽不等于材料可靠,四道母题置信度一律不动。同时沉淀方法约束:中文长音频不得用 Whisper small 输出直接作引用底稿(术语系统性误识,「奇点」→「起点」11 次)。

R2.7已归档

注意力路线反向实验与中国模型公司位置审计

新增:E-018–E-022 五条一手核验证据:Kimi Linear 公平对照胜出 vs MiniMax M2 生产回退构成同期反向实验;K2/Moonlight 拆开"2× 效率"的真实口径;智谱/MiniMax 招股书确立中国样本单位经济。

判断:Q3 拆为中期混合优先 65%(维持)与当前旗舰全注意力为主 85%(新增);Q1 维持 70%。同批拦下七条二手错数字("13% 触发 clip"、"O(LK)"、"首次推动 Interleaved Thinking 标准"等),不入账。

R2.6已归档

内部可解释性、系统审计与责任归属分开

新增:Anthropic 稀疏特征映射、NIST AI RMF 与 EU AI Act 共同支持分层验收:内部机理、系统日志和责任主体不是同一件事。

修正:撤回“没有完全内部解释就不能进入高风险领域”的过强表述;高风险准入依赖风险管理、外部验证、日志、人工监督、申诉、回滚和责任组合。Q4 维持 58%。

R2.5已归档

聚合平台用量与全球商业份额分开

新增:OpenRouter 周榜前五均为中国模型、前十占八,构成低切换成本聚合 API 市场中的真实用量信号。

边界:token 不是用户、收入、成功任务或全球份额;二手文章的 14 倍与份额数字数学冲突,不进入判断。Q1 不变。

R2.4已归档

动态基础设施约束与同行测试边界

新增:芯片、供电、并网、电气设备、冷却、互联与集群工程按地域和阶段轮流成为约束;同行短期封闭测试可提高风险发现速度。

边界:马斯克访谈是管理层判断,不是独立统计或模型测评;中国总发电量不等于可用 AI 电力,同行互检也不能替代独立机构和政府问责。Q1、Q4 不变。

R2.3已归档

优化框架与发明框架分开验收

新增:在 renderer→simulator 五道闸之外,补上提出新概念、设计区分性干预、接受否证与修订的科学发明闸。

边界:《LLMs can’t jump》是立场论文,不是不可能性证明;它提出机制缺口和研究方向,不证明未来 AI 永远无法“跳跃”。Q3 维持 65%。

R2.2已归档

Transformer 贝叶斯机制边界

新增:受控 wind tunnels 显示小型 Transformer 可实现信念累积、传递和随机访问绑定,并逼近闭式后验。

边界:实验为 2–3M 参数、低维潜变量和合成任务;不外推为大型语言模型在自然语言中普遍按贝叶斯最优方式推理。Q2 / Q3 置信度不变。

R2.1已归档

目标函数也是权力

新增:分布式执行与集中式规则可以并存;把目标、排序、反馈、停止权、申诉权和规则改写权补入企业控制层。

边界:赫拉利提供结构框架,不把其 Facebook 机制解释冒充内部实验或完整因果证据;Q4 维持 58%。

R2.0已归档

企业 AI 控制层审计

新增:用 Alex Karp 访谈拆出业务语义、数据权利、动作权限、模型路由、验证、日志与回滚组成的企业控制层。

判断:管理层证词能提出风险假说,不能证明模型供应商违规或主权 AI 需求规模;Q4 维持 58%。

R1.9已归档

模型记忆与产品 Harness 分层

新增:连接 Kimi K3 的固定状态记忆、精确检索、稀疏容量与跨层残差,并把产品悬垂、最小 Harness、验证器和数据飞轮拆成可证伪链条。

判断:Agent 实际能力取决于模型、环境权限、验证与持续运行;长时间运行不等于长期正确。Q4 维持 58%。

R1.8当前

三份 AI 工作簿证据闸门

新增:审计 Epoch、SemiAnalysis 与 AI 大模型共 42 个工作表,把原始来源、模型估算、媒体转述和整理者推断拆开。

判断:重复执行不等于可靠持续学习;单位算力成本下降与总资本、电力和基础设施集中上升可以并存。四道母题置信度不变。

R1.7历史

梁文锋算力与 CUDA 护城河审计

新增:把 TileLang 软件迁移、国产卡产能、芯片代际与训练资源拆成四条独立证据链。

未改变:材料为管理层录音转写,缺第三方基准和集群数据;Q1 70% 暂不调整。

R1.6历史

演化进展成为研究主结构

变化:新增完整演化地图、四题当前状态、关键未知项和带完成标准的下一步路线。

目的:访客不只看到结论,还能看到结论从哪里来、为何变化、接下来怎样验证。

R1.5输出 002

模型公司护城河比较卡

新增:OpenAI、Anthropic、Google、Meta、DeepSeek 的模型、成本、入口、企业工作流和价值捕获比较。

判断:模型领先不是充分护城河;Google 系统资产最厚,独立模型公司的长期利润仍需单位经济验证。

R1.4输出 001

第一份技术比较卡

新增:Transformer vs Mamba / RWKV / xLSTM / Hyena,基于五篇原始论文比较复杂度、状态、规模证据与缺口。

判断:没有全面替代者;Transformer 的经济瓶颈比“技术死亡”更确定,混合架构先验暂时不变。

R1.3方法升级

从研究章程升级为证据系统

变化:新增证据账本、四道判断卡、版本记录、固定引用入口和基础设施。

原因:外部审计指出网站虽强调“证据先于叙事”,却没有公开证据坐标和判断演化。

R1.2基座沉淀

继承 jvalue 旧研究

新增:默认入口、关系型护城河、对象—规则—行动系统、客户经验产品化和 Frontier AI 单位经济五组变量。

边界:不继承旧财务数字,不把公司叙事当当前证据。

R1.1证据约束

ScienceOne 不改变当前结论

新增证据:产品路线展示了模型、数据库、工具和科研工作流的组合。

未改变:因缺完整测试集、原始输出、成本和外部复现,不采信“性能领先”和“工作流已重塑”。

R1.0结构修正

新增第四母题

判断变化:原三题只能覆盖商业和架构两端;新增“可靠生产系统”,研究模型如何通过记忆、工具、验证、权限、工作流和责任进入真实生产。