JAIRL · 当前研究范围

四道 AI 母题的
研究进展与
判断演化

持续记录四道长期母题的事实、解释、判断、反证、当前进度与下一步验证。

研究判断R3.1当前结论版本
网站设计W3.1呈现系统版本

当前研究主线 从“模型能力竞赛”转向“系统价值验证”

00

阅读坐标

RESEARCH OVERVIEW

研究范围与进度

01 / 研究什么

四道长期母题

护城河、Transformer 边界、下一代技术底座,以及可靠生产系统。

看四道母题
02 / 如何演化

七次判断修订

每次变化保留新增证据、旧判断缺口、当前倾向和下一项验证。

看完整历程
03 / 走到哪里

进入比较研究

研究骨架与证据账本已建立,已完成两份可横比、可复核的研究卡。

看当前状态
04 / 下一步

验证可靠执行

优先比较真实任务成功率、人工接管、恢复、审计与单任务成本。

看下一步
01

当前位置

CURRENT POSITION · R3.1

现在走到哪里

研究系统已经搭好;最重要的缺口不再是“再找一个模型故事”,而是取得真实系统的长期运行数据。

当前总判断

模型权重会扩散。入口、工作流、系统资产与可靠执行,更可能决定长期护城河和价值捕获。

这不是最终结论。它仍受真实任务成功率、人工接管率、推理单位经济和企业客户留存压力测试。

技术先验
Transformer 尚未被全面替代;混合架构比单一路线胜出更可信。
最大未知
真实任务成功率、人工接管率、失败恢复、单位经济与企业留存。
证据边界
论文证明路线存在,不证明产品胜出;官方资料证明定义,不证明 ROI。
已完成
4 道判断卡、28 条证据、38 张研究卡、2 份历史基座审计。
02

研究对象

03

演化轨迹

JUDGMENT EVOLUTION

R1.0—R3.1 判断修订记录

打开完整演化地图 →

  1. R1.0
    三题变四题

    补上可靠生产系统,连接技术与真实工作。

  2. R1.2
    审计历史基座

    继承框架,不自动继承旧数字和旧结论。

  3. R1.3
    建立证据系统

    补上账本、判断卡、反证与置信度。

  4. R1.4–1.5
    完成两份比较研究

    技术路线与模型公司护城河开始可横比。

  5. R1.6
    进入系统验证

    把研究重心转向长期成功率、恢复与价值捕获。

  6. R1.7
    算力与 CUDA 护城河审计

    把软件迁移、国产卡产能、芯片代际与训练资源拆成独立证据链。

  7. R1.8
    三份工作簿证据闸门

    线索库不整体当证据;持续学习未证,单位算力成本不等于业务全成本。

  8. R1.9
    模型记忆与产品 Harness

    架构记忆、环境权限、验证器与持续运行分层;长时间运行不等于长期正确。

  9. R2.0
    企业 AI 控制层

    模型之外还要控制业务语义、数据权利、动作权限、模型路由、验证、日志与回滚;供应商主张不等于违规证据。

  10. R2.1
    目标函数也是权力

    分布式执行不等于权力消失;目标、排序、反馈、停止权与申诉权决定系统实际趋向。

  11. R2.2
    Transformer 贝叶斯机制边界

    小型受控模型可实现精确后验;不外推为大型语言模型在自然语言中普遍进行贝叶斯最优推理。

  12. R2.9
    Harness 是否为独立利润吸收层

    以三级工作簿材料拆出模型/Harness/Workspace/Skill 生态/交易权限五个控制点;候选判断入账,四道母题置信度不变。

  13. R3.1
    当前:三层语料证据一致性闸门

    专题、产品与总研究地图必须共享来源、日期、对象与方法字段;时间倒挂和机械等差序列拒绝入账,四道母题置信度不变。

  14. R3.0
    流量口径闸门

    渠道领先不得外推为护城河。抓出一处会改变排序的重复乘算错误,降级「寡头垄断」表述;四道母题置信度不变。

  15. R2.8
    材料可靠性与解释自洽分开

    梁文锋 95 分钟视频经核验为 AI 配音的文字稿还原,非现场原音,降为三级材料并同步下调研究卡 028 定级;DeepSeek 目标函数、开源三层机制与路线排序只作可证伪假说,四道母题置信度不动。

  16. R2.6–2.7
    可解释性分层与注意力路线反向实验

    内部机理、系统日志与责任主体分开验收;Kimi Linear 胜出与 MiniMax M2 回退构成同期反向实验。

  17. R2.5
    聚合平台用量与全球商业份额分开

    OpenRouter 证明低切换成本市场中中国模型用量强,但 token 不等于用户、收入、成功任务或全球份额。

  18. R2.4
    基础设施与治理都按动态约束验收

    芯片、供电、冷却和集群工程会轮流成为瓶颈;同行测试能补发现速度,不能替代独立监管。

  19. R2.3
    优化框架与发明框架分开验收

    交互模拟器仍不是科学发明;还需提出新概念、设计区分性实验、接受否证并修订。

04

下一步

NEXT RESEARCH

路线按证据价值排序

没有完成标准的“下一步”只是愿望。这里同时公开任务、顺序和验收条件。

  1. DONE已完成

    研究卡 003:可靠生产系统基准

    完成 3 个公开基准与 3 个生产案例,当前判断降至 64%。

    查看基准卡 →
  2. LIVE持续更新

    研究卡 004:生产可靠性跟踪表

    持续记录成功率、人工接管、恢复、审计与单位成功任务成本。

    打开跟踪表 →
  3. NOW持续更新

    研究卡 005:护城河指标仪表盘

    跟踪价格、成本、默认入口、企业工作流深度与价值捕获。

    打开仪表盘 →
  4. THEN然后

    架构比较卡第二轮

    补充混合架构与更大规模复现,不再只比较原始论文承诺。

    完成:同任务、近似预算、可复现结果优先;无法横比时拒绝排名。

查看完整路线与月度复核 →

05

研究档案

RESEARCH ARCHIVE

当前输出与历史研究引用

当前研究用于更新四道母题;外部历史材料只提供结构性线索,不能自动充当当前证据。

ACTIVE OUTPUTS

研究卡 01–38

001 · 技术比较卡

Transformer vs Mamba / RWKV / xLSTM / Hyena

基于原始论文比较复杂度、状态、规模证据与缺口。

2026-07-19 · 原始论文
002 · 公司比较卡

OpenAI / Anthropic / Google / Meta / DeepSeek

拆开模型、成本、入口、工作流与价值捕获。

2026-07-19 · 结构证据
003 · 可靠系统基准卡

公开基准与生产案例

比较长任务、电脑操作、工具链、接管与单位经济。

2026-07-19 · 3 个基准+3 个案例
004 · 持续跟踪表

生产可靠性指标

只记录带口径的成功率、接管、恢复、审计与完整成本。

2026-07-19 · Ongoing
005 · 持续仪表盘

模型公司护城河指标

跟踪成本、入口、工作流与价值捕获,不随单次榜单改写。

2026-07-19 · Ongoing
006 · 架构比较第二轮

Jamba / Mamba-2 / Hymba / xLSTM

核验大规模、第三方受控对照与单位经济缺口。

2026-07-19 · 5 篇来源
007 · 生产失败图谱

AI Agent 的 12 种失效链

把失败映射到信号、止损、接管、恢复与审计证据。

2026-07-19 · 5 类一手来源
008 · 生产准入清单

Agent 上线八道硬闸

用 PASS / FAIL / BLOCKED 管理权限、验证、恢复、审计与单位经济。

2026-07-19 · 可执行验收
009 · 首次真实审计

jairl 当前流程判定 FAIL

八道闸实测为 2 PASS / 3 FAIL / 3 BLOCKED,责任链日志触发一票否决。

2026-07-19 · 真实验收记录
010 · 恢复演练

真实发布、回退与再验证

测试版本上线后回退到已知版本;首次复核即恢复,静态发布恢复闸升级为 PASS。

2026-07-19 · Cloudflare API 实测
011 · 发布证据 harness

成功与失败都留下机器记录

自动保存 SHA256、工具版本、退出码、固定版本和双域名验收,不再靠人工补写。

2026-07-19 · 可执行发布链
012 · 长任务状态 harness

PID、心跳、终态与恢复入口

用原子状态取代孤立 PID 和半截日志,成功、失败、中断都可判断。

2026-07-19 · 单机任务恢复
013 · 八道闸重新验收

FAIL 清零,整体升为 BLOCKED

010–012 清除三个 FAIL;当前为 6 PASS / 0 FAIL / 2 BLOCKED。

2026-07-19 · 不升级无人值守
014 · token 权限实测

Pages 面可见,项目级最小权限未证

真实 API 探测确认 Workers、D1、用户资料受限,但 token 可见账户内全部 10 个 Pages 项目。

2026-07-19 · 权限闸保持 BLOCKED
015 · 单位经济首轮基线

失败链吃掉 80.8% 墙钟时间

10 次非 dry-run 尝试中 6 次成功;把失败与中断纳入单位成功任务分母。

2026-07-19 · 完整成本仍 BLOCKED
016 · 发布经济字段 harness

未知成本不再默认为零

强制记录人工、AI、工具、接管与失败损失;缺失或非法值在部署前拒绝。

2026-07-19 · pages.release.v2
017 · 生产数据可比性审计

六个候选,0 个可排名

逐项核验成功率、接管、失败、恢复与完整单位成本,拒绝用处理量和 benchmark 补洞。

2026-07-19 · Q4 维持 58%
018 · 垂直场景观察名单

客服与软件工程仍不能排名

Fin 接近结果计量,GitHub 接近工作流审计;两者仍缺接管、恢复与完整单位成本。

2026-07-19 · 只保留两项观察
019 · 模型护城河兑现审计

三家公司均不可结算

OpenAI、Anthropic、Google 均缺分产品留存、毛利与迁移证据;护城河主语上移到系统资产。

2026-07-19 · Q1 维持 72%
020 · 跨模型迁移反证审计

调用层可移植,生产迁移未证

OpenAI-compatible 与多模型选择削弱模型 API 锁定,但没有完整生产迁移账本。

2026-07-19 · 0 个完整案例
021 · Transformer 三类瓶颈

技术 45% / 经济 78% / 产品 74%

不再把架构、成本与可靠性交给一个“到顶了”叙事;Q2 总判断维持 68%。

2026-07-19 · 修复版本不一致
022 · Test-time compute 成本审计

能力增益成立,经济胜利未证

更多思考可提高部分难题成功率,但思考 token、延迟、重试与验证必须进入每成功任务成本。

2026-07-19 · Q2 维持 68%
023 · 自适应推理路由审计

机制可行,生产经济不可结算

benchmark 路由可以省钱,但假阴性、重试、人工接管与事故成本仍没有生产混淆矩阵。

2026-07-19 · Q2 维持 68%
024 · 世界模型类别错误审计

能力目标不是主干架构

Genie 2 与 V-JEPA 2 的世界建模进展仍可建立在 Transformer 上;不能把世界模型当作同层替代品。

2026-07-19 · Q3 维持 65%
025 · Renderer → Simulator 审计

三个候选,0 个过五道闸

交互、3D 导出和真实机器人规划分别进步,但显式状态、物理约束与 sim-to-real 尚未同时成立。

2026-07-19 · Q3 维持 65%
026 · 生成世界训练效用审计

四类证据,0 个闭合因果链

生成环境、想象训练与真实机器人结果分别存在,但缺加入生成世界前后的真实任务对照。

2026-07-19 · Q3 维持 65%
027 · 决定性证据缺口总表

四道母题进入证据触发式观察期

每题只保留一个允许改变概率的数据包;字段不齐统一结算为不可判定。

2026-07-19 · Q1–Q4 收敛
029 · 三份工作簿证据闸门

线索价值高,不可整体当证据

审计 Epoch、SemiAnalysis 与 AI 大模型 42 个工作表;持续学习未证,算力效率不等于业务全成本。

2026-07-27 · 四题置信度不变
032 · Token 调用量周监测

局部平台榜不冒充全球总榜

每周核 OpenRouter、聚合网关、厂商与云渠道;分开 token、请求、用户、收入与全球份额。

2026-07-30 · 每周一更新
035 · Harness 利润层审计

五个控制点,四环无人闭合

模型/Harness/Workspace/Skill 生态/交易权限;三级材料,候选判断,母题置信度不变。

2026-08-17 · Q1 主归属,Q4 交叉引用
036 · 流量到护城河审计

渠道领先不得外推为护城河

纠正重复乘算与跨渠道口径混用;四道母题置信度不变。

2026-08-18 · Q1/Q4
037 · 残差拓扑余量

mHC 已在 1.6T 模型落地

一级证据支持 Transformer 宏观拓扑仍有余量;Q2 技术子项下调。

2026-08-19 · Q2
038 · 三层语料证据闸门

框架可留,数字必须重建来源链

37 个工作表+972 个节点;拦下时间倒挂与疑似插值序列。

2026-08-25 · Q1/Q4

RESEARCH DISCIPLINE

事实 → 解释 → 判断 → 反证

共同验证层:四道母题最终都要落到行业成本结构、劳动分工、利润池、竞争壁垒与价值分配。行业影响不是第五道母题,而是现实检验。

打开证据入口闸门 →