当前判断:这批材料把研究对象换对了——从「谁的模型强」换成「谁赢了哪个控制点」,与研究卡 035 的五层控制点结构独立收敛到同一形状,构成一次正向交叉验证。但它把流量规模写得太像竞争壁垒。本卡登记的不是新结论,而是一条方法闸门:渠道口径不得跨层外推,流量领先不等于客户忠诚、护城河或利润。四道母题置信度一律不动。

先定证据等级:仍是三级材料

材料构成

三份:①《AI大模型第五次报告_预读版》PDF 10 页;②《中国模型公司产品》工作簿新版,14 个工作表(较 E-025 版增加 4 表);③《AI大模型产品使用界面》图包,190 张有效界面截图已完成 OCR(图包共 380 个图像条目,另一半为 macOS 重复资源文件)。

为什么仍定三级

流量数字来自第三方监测机构(QuestMobile/易观/艾瑞类),非公司披露,未逐条标注抓取日期与统计对象;界面截图属自采一手观察,但只能证明产品形态,不能证明使用量、成功率或收入。

作者自身的定级意识

预读版第 8 页「最容易被误读的 4 件事」(会员积分≠API 额度、最长时长的两种含义、账面生成费≠成片成本、资源包折扣有前提)是全篇质量最高的一页,说明作者知道自己在比什么。这一页应保留,不应在正式版被压缩掉。

事实层:三条战线各自赢的是什么

以下数字为 2026 年 6 月移动端口径的第三方监测值,均标记未独立复现,只用于形态判断,不用于份额或收入结论。

1 · Chatbot:豆包赢移动触达

豆包 3.823 亿月活/月均 76.7 次/143.7 分钟;千问 1.672 亿/17.4 次/22.9 分钟;DeepSeek 1.298 亿/62.3 次/124.8 分钟;元宝 0.498 亿/29.2 次/58.6 分钟;Kimi 0.073 亿/33.5 次/56.8 分钟。规模排序与使用深度排序不一致:DeepSeek 规模第三、深度第二;千问规模第二、深度明显偏弱。

2 · 办公 Agent:分发与深度分属两家

WorkBuddy 月活设备 2,000 万/日活 1,300 万/人均 20.43 活跃天/单日 0.19 次/单日 15.20 分钟;TraeWork 月活 1,297 万/日活 519 万/12.19 天/0.52 次/33.06 分钟。腾讯赢触达与企业控制,字节赢主动工作深度。

3 · 视频:即梦赢漏斗,可灵赢意图

即梦约 1,633 万月活,可灵约 103 万;但可灵人均月使用时长约 60 分钟,约为即梦两倍。

界面 OCR 的独立补强

WorkBuddy 强调低门槛、图形化 Experts/Skills/Connectors、企业版席位、模型管控与腾讯生态;TraeWork 强调 Work/Code/Design 统一工作区、文件、自动化、插件、云端执行与多档 Credits;即梦首屏为推荐流与模板,可灵创作工具居中,海螺推荐流最弱、最接近纯生成工具。两家办公产品都已越过「聊天壳」阶段,形成真实的 Harness/Workspace 结构——这是界面证据能支持的最强结论,止于此。

方法层:一处会系统性放大结论的计算错误

错误

新版工作簿「每个 App 每月总时长」列按 月活 × 月均使用次数 × 月均使用时长 计算(豆包 42,136、DeepSeek 10,093 等)。但「人均使用时长」在该监测口径下已是每月累计值,不能再乘一次月均次数。

后果

该列整体被放大,且放大倍数随各产品频次不同而不同——高频产品被放得更大,因此由该列导出的「总使用时长占比」不仅偏高,还改变了产品间的相对排序。所有基于该列的结论必须删除后重算,正确式为 月活 × 月人均使用时长

第二处口径不自洽

WorkBuddy 日活/月活约 65%、月均活跃 20.43 天,却只有单日 0.19 次调用。最合理解释是设备常驻、签到、后台或生态入口触发进入了「活跃」口径,真实主动任务频率低得多。在拿到监测机构字段定义前,不得写成「高频办公使用」。

第三处不可横加

移动 App/PC 客户端/Web/API 不是同一市场:豆包、即梦偏移动,TraeWork、WorkBuddy 偏桌面,可灵与开发工具偏 Web/API,DeepSeek 同时是模型品牌与 API 入口。可灵的 103 万是移动 MAU,不是可灵的用户规模——用它对比即梦,等于用手机装机量比较专业创作工具与内容平台,「15.8 倍」被系统性放大。

判断层:七条暂时判断的逐条校正

  1. 「豆包已形成寡头垄断」——降级。改为「豆包在中国 AI 原生移动 App 的触达与使用总量上显著领先」。未界定相关市场、用户大量多开、无留存/付费/切换率/默认模型份额,四项缺一不可。
  2. 「订阅+电商是 Chatbot 商业模式」——保留为路径,不写成已跑通。缺付费规模、续费、增量 GMV 与利润。
  3. 「豆包/元宝/千问偏生活,Kimi 偏工作」——基本成立。属产品定位观察,不是收入结论。
  4. 「WorkBuddy 覆盖最广、TraeWork 使用更深」——有条件成立。必须同时写明设备口径与主动调用口径的疑点。
  5. 「WorkBuddy 花哨、TraeWork 像 Claude Code」——属界面解释。可说明目标人群与认知成本,不能推导产品能力。
  6. 「即梦活跃领先、可灵使用更深」——仅限移动 App 口径。不得外推视频生成总体市场。
  7. 「即梦像抖音、可灵居中、海螺工具化」——界面证据支持。但需用创作转化、分享率与付费结构验证。

与母题的关系

第一母题(Q1 · 护城河与利润池,主归属):本卡不提供新的护城河证据,只把一条推理禁令写进观察层——头部流量、模型品牌、数据飞轮、商业化先发优势这四件事被材料连成了一条链,而链上没有一环有独立证据。当前未证明:用户数据会专有地回流并持续提升模型;规模会产生能力飞轮;用户不会因价格与任务效果切换;月活会转化为可持续收入。因此现阶段合理的客户选择顺序仍是 客户任务 → 最低满足能力 → 全成本价格 → 可靠交付 → 复用/迁移成本 → 品牌。品牌在模型飞轮出现前最多降低获客成本,不构成客户忠诚或护城河Q1 维持 72%。

第四母题(Q4 · 可靠生产系统,交叉引用):预读版第 6 页把办公产品拆成「模型供给 → 执行系统 → 企业控制 → 交付结果」四层,与本站的 模型 → Harness → Workspace → 权限与服务 → Outcome 基本同构,且是独立收敛,记为一次结构层交叉验证。但报告第 9、10 页自己列出的「真正的胜负指标」——任务成功率、企业续费、可用成片率、单位成片成本——全篇没有给出任何一个值。结构对了,数据仍是空的。Q4 维持 58%。

第二、第三母题不变。本批材料没有任何新的技术实验证据。

反证条件:什么会推翻本卡的方法闸门

  1. 监测机构公布字段定义,证明「活跃设备」与「有效调用」本就是同一口径,前述不自洽消失。
  2. 出现跨渠道(移动+Web+API+内嵌)的统一去重口径,使单渠道排名可以合法外推。
  3. 出现多模型切换率数据,显示用户在能力与价格接近时仍不切换——那将是品牌忠诚的第一份直接证据。
  4. 头部产品披露按产品拆分的付费人数、续费率与单任务毛利,且与移动流量排序一致。

后续跟踪变量

  1. 同一真实任务下的三产品盲测:完成率、人工接管次数、重试次数与耗时。
  2. D30/D90、项目复用率与文件/历史迁出成本。
  3. 付费人数、续费率、退款率;企业席位扩张、续约与部署周期。
  4. 单任务/单可用成片全成本与毛利。
  5. 多模型切换率——用于直接验证「品牌忠诚度是否存在」。
  6. 视频侧:可用成片率、重试次数、单位可用秒成本、API 收入与商业客户复购。

缺口与停止条件

本批材料能回答与不能回答

能回答「谁覆盖广、谁用得深、产品形态长什么样」;不能回答「谁在赚钱、谁留得住人、谁有护城河」。这不是缺陷,是阶段限制,但结论不得滑过这条线。

下一次只接受

同任务、同预算、可独立复现的对照测评;或厂商披露的按产品拆分留存、毛利与续费;或带字段定义的监测数据。不再收集移动 MAU 排名与功能清单。

材料指纹

三份来源:AI大模型第五次报告_预读版_20260818.pdf(10 页,10,546 字符已抽取)、中国模型公司产品.xlsx 新版(14 个工作表,较 E-025 版新增 4 表)、AI大模型产品使用界面.zip(190 张有效界面图已 OCR)。获取日期 2026-08-18。证据账本登记为 E-026(三级)。分析全文见工作区 丘婷婷_AI大模型第五次报告_三文件综合分析_2026-08-18.md。前一版材料见 E-025 与研究卡 035