使用规则:论文证明一种方法被提出,不自动证明它已形成产品或商业优势;公司文档证明产品定义,不自动证明效果;宣传稿只能作为待验证线索。
| ID | 母题 | 证据与日期 | 类型 | 方向 | 强度 | 当前作用 |
|---|---|---|---|---|---|---|
| E-001 | Q2 |
Attention Is All You Need 2017-06 |
原始论文 | 基础事实 | 高 | 确立 Transformer 起点;不回答其当前是否到瓶颈。 |
| E-002 | Q3 |
Mamba 2023-12 |
原始论文 | 支持替代路线 | 高 | 证明选择性 SSM 是可研究路线;未证明已全面替代 Transformer。 |
| E-003 | Q3 |
RWKV 2023-05 |
原始论文 | 支持替代路线 | 高 | 提供并行训练与循环推理的混合方向。 |
| E-004 | Q3 |
xLSTM 2024-05 |
原始论文 | 支持替代路线 | 高 | 说明循环架构仍有现代化空间;生态和规模验证仍不足。 |
| E-005 | Q3 |
Hyena Hierarchy 2023-02 |
原始论文 | 支持替代路线 | 高 | 支持长卷积路线;尚非通用胜出证据。 |
| E-006 | Q3/Q4 |
I-JEPA 2023-01 |
原始论文 | 扩展技术地图 | 高 | 支持非生成式表征与世界模型方向;离可靠行动系统仍有距离。 |
| E-007 | Q4/Q1 |
Palantir Ontology 文档 访问于 2026-07-18 |
官方产品文档 | 支持系统栈 | 中 | 支持对象、关系、动作进入企业语义层;不能单独证明客户 ROI 或护城河。 |
| E-008 | Q4/Q1 |
Claude Code 文档 访问于 2026-07-18 |
官方产品文档 | 支持 Agent 化 | 中 | 证明产品能读代码、改文件和运行命令;真实长期成功率仍需外部评测。 |
| E-009 | Q1/Q2 |
Anthropic 定价 访问于 2026-07-18 |
官方商业资料 | 经济性约束 | 中 | 证明模型使用存在持续推理成本;不能由价格表推导毛利。 |
| E-010 | Q4 | ScienceOne / S1-Omni 发布报道 2026-07-18 |
二手宣传稿 | 路线观察 | 低 | 只支持“模型+数据+工具+工作流”值得观察;不支持性能领先结论。 |
| E-011 | Q1/Q4 |
《AI 时代的商业模式预测》 独立专题站 · 固定审计于 2026-07-18 |
内部既有研究 | 工作假设 | 中低 | 只引用五层结算栈作为工作假设;不将 jaiv2 的 48 节主体并入 jairl,且需外部公司数据持续压力测试。 |
| E-012 | Q1/Q4 |
jvalue AI 公司研究 固定审计于 2026-07-18 |
内部既有研究 | 工作假设 | 中低 | 形成入口、关系系统和组织行动栈;旧财务与公司结论不自动继承。 |
| E-013 | Q1 |
OpenAI API Pricing 访问于 2026-07-19 |
官方商业资料 | 成本/结算 | 中 | 证明 API 按使用量结算;不能推导公司毛利或客户留存。 |
| E-014 | Q1/Q4 |
Anthropic Pricing
/
Claude Code 访问于 2026-07-19 |
官方产品资料 | 工作流候选 | 中 | 证明订阅/API与 coding Agent 产品形态;不能证明工作流锁定。 |
| E-015 | Q1 |
Vertex AI Pricing
/
Workspace AI 访问于 2026-07-19 |
官方产品资料 | 系统分发 | 中 | 证明 Google 同时覆盖云与办公入口;不能单独证明 AI 增量利润。 |
| E-016 | Q1 |
Meta Llama
/
GitHub 访问于 2026-07-19 |
官方产品/代码 | 开放生态 | 中 | 证明开放模型与分发策略;不能证明资本投入已产生回报。 |
| E-017 | Q1 |
DeepSeek API Pricing
/
GitHub 访问于 2026-07-19 |
官方产品/代码 | 成本与开放 | 中 | 证明 API 与开放研究入口;不能证明企业客户、收入质量或持续护城河。 |
| E-018 | Q3 |
Kimi Linear (KDA) 2025-10 |
原始论文+开源权重 | 支持混合路线 | 中高 | 48B/3B激活、1.4T 公平对照下首个自称全面胜出全注意力(基线为 MLA);发布版训至 5.7T,权重 MIT 开源、vLLM 支持。效率数字(75% KV cache、6.3× 解码)为厂商自测,无第三方复现。 |
| E-019 | Q3/Q4 |
MiniMax M2 回归全注意力(官方复盘) 2025-10 |
官方技术复盘 | 反对"混合当前可用于旗舰" | 高 | 生产回退一手案例:62 层全部 softmax(config 可查)。四条理由:评测体系照不出多跳缺陷、长上下文退化、RL 数值精度、推理基建不成熟;并预判算力放缓后线性收益将显现——同时构成 Q3 中期方向的间接支持与 Q4 评测缺口证据。 |
| E-020 | Q3 |
Attention Residuals 2026-03 |
原始论文 | 支持组件重构 | 中低 | Softmax 聚合替代加法残差;48B/3B、1.4T 对照 GPQA-Diamond +7.5 为离群值,多数基准仅 +1~5%;无训练代码与 checkpoint,唯一独立小规模复测(124M)未见收益。1.25× 为训练收敛等效,非推理提速。 |
| E-021 | Q2/Q3 |
Kimi K2 技术报告 / Moonlight (Muon) 2025-07 / 2025-02 |
原始论文+开源权重 | 支持效率 scaling | 中 | QK-Clip 机制与 1T/32B/384 专家为论文级;"15.5T 零 loss spike"论文有陈述但外部不可验证。注意:"约 2× 效率"出自 Moonlight 的 compute-optimal 实验(最大 16B 总参),不得移植为 K2 规模的 token 效率;Muon 系社区工作,月之暗面是规模化者。 |
| E-022 | Q1 | 智谱 / MiniMax 港交所招股与上市文件 2026-01 |
官方财务文件 | 经济性约束 | 高 | 智谱 2024 收入 3.124 亿元、净亏 29.58 亿元、本地化部署占收入 84.5%;MiniMax 2024 收入 3052 万美元、毛利率 23.3%。证明中国模型公司"小收入+大亏损+上市补给"结构与 To B 私有化交付形态;不能由此推导终局格局。 |
| E-023 | Q1/Q3 | 《梁文锋投资人会议》95 分钟视频文字稿(OCR 精校 203 页+Whisper 回填) 2026-08 核验 |
三级 · 非现场原音 | 仅供假说 | 低 | 发布者自述音频为「依据文字稿制作的 AI 音频还原」,链条为流传文字稿→第三方精校→AI 配音,真实性未独立验证;页脚标注 4 小时而实际 95 分钟,应视为节选。可用于提炼 DeepSeek 目标函数、开源定价与路线排序假说并建证伪清单,不得作为一手引用或公司披露,不改变任何母题置信度。同批下调研究卡 028 的材料定级。 |
| E-024 | Q4 | Anthropic Details How it Contains Claude across Web, Code, and Cowork(InfoQ 报道 Anthropic 工程博客) 2026-07 / 中文版 2026-08 核验 |
二级报道·源为公司工程披露 | 支持「隔离优先于对齐」 | 中 | 三项可引用量化:用户最终批准约 93% 的权限请求,逐项授权的安全价值被证伪;引入 OS 级沙箱(macOS Seatbelt / Linux bubblewrap,默认禁网)后确认弹窗减少 84%;受控红队中 25 次有 24 次 Claude 执行了 AWS 凭证外传。另有两个已修复缺陷:信任目录确认前即解析 .claude/settings.json 并执行启动 Hook;api.anthropic.com 在白名单内导致可经 Files API 外传工作区文件——证明白名单授予的是该域名的全部能力而非单一接口。数据全部由 Anthropic 自述、无第三方审计,且为利益相关方叙述,不得当作行业普适基线。 |
| E-025 | Q1/Q4 | 《中国模型公司产品》工作簿(本地 /Users/jagger/Desktop/中国模型公司产品.xlsx,26,520,396 字节,10 个工作表)2026-08-17 获取 |
三级 · 混合来源工作簿 | 仅供假说 | 低 | 同一工作簿混合官方产品页面、公司自报、咨询机构测算(易观/QuestMobile/艾瑞截图)、媒体匿名爆料与专家访谈,缺逐条可点击引用与抓取日期,不得当作公司披露事实。豆包收入与算力成本、各产品 DAU、智谱 ARR、任务通过率、缓存命中率一律标记「未独立复现」。快照数据,不可作长期事实锚:2026 年套餐、席位价格、用户规模与产品功能变化快;App MAU/Web visits/PC 交互次数/DAU/「访问量」不可横加。可用价值在于控制点结构(模型/Harness/Workspace/Skill 生态/交易权限)与可证伪清单,见研究卡 035。不改变任何母题置信度。 |
| E-026 | Q1/Q4 | 《AI 大模型第五次报告》预读版 PDF(10 页)+《中国模型公司产品》工作簿新版(14 表)+《AI大模型产品使用界面》图包(190 张有效界面 OCR) 2026-08-18 获取 |
三级 · 第三方监测+自采界面 | 仅供形态判断 | 低 | 流量数字为 2026 年 6 月移动端第三方监测口径(QuestMobile/易观/艾瑞类),非公司披露,未逐条标注抓取日期与统计对象,一律标记「未独立复现」。发现一处会系统性放大结论的计算错误:工作簿「每个 App 每月总时长」按「月活 × 月均次数 × 月均时长」计算,而月均时长已是月累计值,重复乘算且放大倍数随频次而异,该列与其占比须删除后按「月活 × 月人均时长」重算。另有两处口径风险:WorkBuddy 月均活跃 20.43 天与单日 0.19 次调用不自洽,「活跃设备」应含常驻/签到/后台触发;可灵 103 万为移动 MAU,其主力在 Web/API,与即梦的「15.8 倍」差距被系统性放大。可用价值在于三条战线的形态区分与 190 张界面证明的 Harness/Workspace 真实结构,见研究卡 036。不得用于份额、忠诚度、护城河或收入结论,不改变任何母题置信度。 |
| E-027 | Q2/Q3 | mHC: Manifold-Constrained Hyper-Connections+DeepSeek-V4 技术报告 2025-12 / 2026 核验 |
一级 · 原始论文+生产采用 | 反对「Transformer 技术余量耗尽」 | 高 | mHC 把残差拓扑约束为双随机映射,并已用于 1.6T 参数 DeepSeek-V4-Pro;支持宏观拓扑仍有余量。只移动 Q2 技术子项,不外推到推理经济或产品可靠性,见研究卡 037。 |
| E-028 | Q1/Q4 | Anthropic 专题工作簿+中国模型产品工作簿+AI 大模型总研究地图 2026-08-25 获取 |
三级 · 内部协作汇编 | 仅供结构与反证 | 低 | 37 个工作表与 972 个思维导图节点形成专题/产品/总地图三层语料;但发现 TraeWork 月度数据早于材料自记发布日,以及可灵/海螺月序列呈机械等差变化。框架可作导航,未经来源链重建的数字不得入账,见研究卡 038。四道母题置信度不变。 |
证据缺口
- 缺少统一成本口径下的 Transformer 与替代架构对照。
- 缺少真实企业 Agent 的长期成功率、人工接管率和错误恢复数据(E-024 只提供了厂商自述的审批通过率与红队命中率,非跨厂商基线)。
- 缺少模型公司按产品拆分的毛利、推理成本和客户留存。
- 缺少同任务、同预算、可独立复现的 Harness 对照测评(E-025 只提供产品结构与厂商口径,不构成成功率基线)。
- 缺少第三方监测机构的字段定义(活跃设备、有效调用、访问量分别怎么算),以及跨渠道去重口径——没有它们,单渠道排名不能外推为市场份额(E-026)。
- 缺少多模型切换率数据,这是直接验证「模型品牌是否构成客户忠诚」的唯一近路。