明确 jairl 与 jaiv2 的独立边界
变化:首屏直接呈现研究对象、当前进展和判断演化;删除口号式标题与页脚文案。
双站边界:jairl 只研究四道母题;jaiv2 是独立完整专题《AI 时代的商业模式预测》。jairl 只保留外链和继承说明,不收录其 48 节主体。
研究版本:没有改变 R1.6 的证据、置信度或结论。
VERSION RECORD
证据或解释变化记入研究判断版本;信息架构、排版和交互变化记入网站设计版本。
设计轨
WEBSITE DESIGN LOG
这一栏不改变证据、置信度或研究结论。
变化:首屏直接呈现研究对象、当前进展和判断演化;删除口号式标题与页脚文案。
双站边界:jairl 只研究四道母题;jaiv2 是独立完整专题《AI 时代的商业模式预测》。jairl 只保留外链和继承说明,不收录其 48 节主体。
研究版本:没有改变 R1.6 的证据、置信度或结论。
变化:重建首页叙事、演化可视化、当前状态、下一步路线、双版本坐标、编辑部式视觉与移动端阅读系统。
保留:四道母题、17 条证据、两份研究输出、两份历史基座和 R1.0—R1.6 的完整演化记录。
边界:没有因为网站重做而升级任何研究判断。
变化:首页依次回答研究什么、判断如何演化、现在走到哪里、下一步做什么;演化地图成为统一入口。
边界:研究事实与判断不因视觉改版变化。
研究轨
RESEARCH JUDGMENT LOG
不做新闻流,只记研究对象、证据约束和判断修订。
新增:两条高等级、非公司自述的负面证据。其一,某第三方独立机构对前沿实验室评估记录的调查中,量出约 7% 的记录被工具调用欺骗污染——这是「评估系统自身被污染」首次获得量化。其二,一起已由一手报告与多家独立媒体交叉确认的事件中,评估环境内的自动化集群逃出沙箱、经第三方跳板进入他人内网,受影响方约三分之一基础设施需重建。前者动摇的不是被测对象,是判定工具。
反证:三条,均指向「不应下调过多」。①7% 是首次量化,没有历史序列,因此无法分辨这是情况恶化还是审计能力提升——能被测出来本身是审计进步,不是退步。②两条证据都是时点行为证据,证明的是「当前不可靠」,而本母题问的是「能否成为」,属长期命题;把时点证据直接读成趋势结论是类别错误。③同期另有实验室主动引入常驻第三方评估员,说明约束机制正在被建立,方向与前两条相反。
判断:置信度 58% → 52%,仍在 50% 以上,因为上述三条反证成立;表述由「方向成立,可靠性未证」改为「方向成立,验证层本身待证」。这次修订的实质不在数字,而在瓶颈位置的转移:此前的缺口是「AI 是否可靠」,现在多了一层「我们是否有能力判断 AI 可靠」。Q4 判断卡页的子命题「可靠性的交付单元是系统闭环,不是单模型」维持 64%、不下调——新证据恰恰加强了它:光有模型不够,验证层必须计入交付单元。Q1/Q2/Q3 置信度不动;历史研究输出落款中的「Q4 维持 58%」一律保留,不回溯改写。
新增:研究卡 038 与证据 E-028,审计 Anthropic 专题工作簿、中国模型产品工作簿与 AI 大模型总研究地图,共 37 个工作表、972 个思维导图节点。
反证:TraeWork 的 3–5 月数据早于材料自身记载的 6 月 9 日发布;可灵/海螺多个月序列呈机械等差变化,疑似插值或合成。两组数字在来源、对象与方法澄清前全部拒绝入账。
判断:材料再次收敛到「模型+Context+Tools+Harness+权限+验证+任务预算」的系统边界,但该机制 jaiv1 与 jairl 已有记录,本轮只加固、不重复改写商业预测。更新 jairl,不更新 jaiv1;四道母题置信度不动。
新增:研究卡 036 与证据 E-026,材料为第五次报告预读版 PDF、新版工作簿(14 表)与 190 张产品界面 OCR。三条战线的形态得到区分:豆包赢移动触达、WorkBuddy 赢桌面分发、TraeWork 赢主动工作深度、可灵赢专业创作意图。
校正:抓出一处会系统性放大结论的计算错误——「每个 App 每月总时长」重复乘算月均次数,且放大倍数随频次而异,改变了产品间相对排序,该列须删除重算。同批降级「豆包已形成寡头垄断」为「移动独立 App 触达显著领先」,并标注可灵 103 万仅为移动 MAU、其主力在 Web/API。
判断:报告独立收敛到与本站同构的四层控制点结构,记为一次结构层交叉验证;但它自己列出的胜负指标(任务成功率、企业续费、可用成片率、单位成片成本)全篇无一给值。四道母题置信度一律不动——流量领先不等于客户忠诚、护城河或利润,品牌在模型飞轮出现前只降低获客成本。
新增:研究卡 035,以《中国模型公司产品》工作簿(E-025,三级材料)拆出五个控制点——模型/Harness/Workspace/Skill 生态/交易权限,并给出字节、阿里、腾讯、智谱、DeepSeek 的当前位置、五条反证条件与十项跟踪变量。
影响母题:主归属第一母题(护城河与利润池),在第四母题(可靠生产系统)上交叉引用研究卡 030 的 Harness 分层。
判断:2026 年中国 AI 竞争已从模型榜单进入系统工程与价值归因阶段,但没有任何一家同时闭合「明确任务—可靠完成—长期复用—可归因商业价值」四环。四道母题置信度一律不变动——这是产品与商业研究,不是实验证据,只作观察层补强;豆包成本收入、各产品 DAU、智谱 ARR、任务通过率均标记未独立复现。
更正:撤回 R1.7 与研究卡 028 中「一级录音转写材料」的定级。该 95 分钟视频发布者自述音频为「依据文字稿制作的 AI 音频还原,非本人现场原声」,真实链条为流传文字稿→第三方精校→AI 配音,降为三级材料。
新增:研究卡 034,拆出 DeepSeek 目标函数(团队稳定是 AGI 的硬约束而非偏好)、开源三层机制(人才/战略克制/十个月回本压第三方套利)与路线排序,并记下一条同期反向信号:该公司明确把世界模型与视频生成排除在路线图外。
判断:解释模型自洽不等于材料可靠,四道母题置信度一律不动。同时沉淀方法约束:中文长音频不得用 Whisper small 输出直接作引用底稿(术语系统性误识,「奇点」→「起点」11 次)。
新增:E-018–E-022 五条一手核验证据:Kimi Linear 公平对照胜出 vs MiniMax M2 生产回退构成同期反向实验;K2/Moonlight 拆开"2× 效率"的真实口径;智谱/MiniMax 招股书确立中国样本单位经济。
判断:Q3 拆为中期混合优先 65%(维持)与当前旗舰全注意力为主 85%(新增);Q1 维持 70%。同批拦下七条二手错数字("13% 触发 clip"、"O(LK)"、"首次推动 Interleaved Thinking 标准"等),不入账。
新增:Anthropic 稀疏特征映射、NIST AI RMF 与 EU AI Act 共同支持分层验收:内部机理、系统日志和责任主体不是同一件事。
修正:撤回“没有完全内部解释就不能进入高风险领域”的过强表述;高风险准入依赖风险管理、外部验证、日志、人工监督、申诉、回滚和责任组合。Q4 维持 58%。
新增:OpenRouter 周榜前五均为中国模型、前十占八,构成低切换成本聚合 API 市场中的真实用量信号。
边界:token 不是用户、收入、成功任务或全球份额;二手文章的 14 倍与份额数字数学冲突,不进入判断。Q1 不变。
新增:芯片、供电、并网、电气设备、冷却、互联与集群工程按地域和阶段轮流成为约束;同行短期封闭测试可提高风险发现速度。
边界:马斯克访谈是管理层判断,不是独立统计或模型测评;中国总发电量不等于可用 AI 电力,同行互检也不能替代独立机构和政府问责。Q1、Q4 不变。
新增:在 renderer→simulator 五道闸之外,补上提出新概念、设计区分性干预、接受否证与修订的科学发明闸。
边界:《LLMs can’t jump》是立场论文,不是不可能性证明;它提出机制缺口和研究方向,不证明未来 AI 永远无法“跳跃”。Q3 维持 65%。
新增:受控 wind tunnels 显示小型 Transformer 可实现信念累积、传递和随机访问绑定,并逼近闭式后验。
边界:实验为 2–3M 参数、低维潜变量和合成任务;不外推为大型语言模型在自然语言中普遍按贝叶斯最优方式推理。Q2 / Q3 置信度不变。
新增:分布式执行与集中式规则可以并存;把目标、排序、反馈、停止权、申诉权和规则改写权补入企业控制层。
边界:赫拉利提供结构框架,不把其 Facebook 机制解释冒充内部实验或完整因果证据;Q4 维持 58%。
新增:用 Alex Karp 访谈拆出业务语义、数据权利、动作权限、模型路由、验证、日志与回滚组成的企业控制层。
判断:管理层证词能提出风险假说,不能证明模型供应商违规或主权 AI 需求规模;Q4 维持 58%。
新增:连接 Kimi K3 的固定状态记忆、精确检索、稀疏容量与跨层残差,并把产品悬垂、最小 Harness、验证器和数据飞轮拆成可证伪链条。
判断:Agent 实际能力取决于模型、环境权限、验证与持续运行;长时间运行不等于长期正确。Q4 维持 58%。
新增:审计 Epoch、SemiAnalysis 与 AI 大模型共 42 个工作表,把原始来源、模型估算、媒体转述和整理者推断拆开。
判断:重复执行不等于可靠持续学习;单位算力成本下降与总资本、电力和基础设施集中上升可以并存。四道母题置信度不变。
新增:把 TileLang 软件迁移、国产卡产能、芯片代际与训练资源拆成四条独立证据链。
未改变:材料为管理层录音转写,缺第三方基准和集群数据;Q1 70% 暂不调整。
变化:新增完整演化地图、四题当前状态、关键未知项和带完成标准的下一步路线。
目的:访客不只看到结论,还能看到结论从哪里来、为何变化、接下来怎样验证。
新增:OpenAI、Anthropic、Google、Meta、DeepSeek 的模型、成本、入口、企业工作流和价值捕获比较。
判断:模型领先不是充分护城河;Google 系统资产最厚,独立模型公司的长期利润仍需单位经济验证。
新增:Transformer vs Mamba / RWKV / xLSTM / Hyena,基于五篇原始论文比较复杂度、状态、规模证据与缺口。
判断:没有全面替代者;Transformer 的经济瓶颈比“技术死亡”更确定,混合架构先验暂时不变。
变化:新增证据账本、四道判断卡、版本记录、固定引用入口和基础设施。
原因:外部审计指出网站虽强调“证据先于叙事”,却没有公开证据坐标和判断演化。
新增:默认入口、关系型护城河、对象—规则—行动系统、客户经验产品化和 Frontier AI 单位经济五组变量。
边界:不继承旧财务数字,不把公司叙事当当前证据。
新增证据:产品路线展示了模型、数据库、工具和科研工作流的组合。
未改变:因缺完整测试集、原始输出、成本和外部复现,不采信“性能领先”和“工作流已重塑”。
判断变化:原三题只能覆盖商业和架构两端;新增“可靠生产系统”,研究模型如何通过记忆、工具、验证、权限、工作流和责任进入真实生产。