当前判断:2026 年中国 AI 竞争已从模型榜单进入系统工程与价值归因阶段,但没有任何一家同时闭合「明确任务—可靠完成—长期复用—可归因商业价值」四环。本卡把「Harness 可能是模型商品化之后独立的利润吸收层」登记为候选判断,不是已验证结论:支撑它的材料是产品与商业研究,不是实验证据,因此四道母题置信度一律不动,只作观察层补强。
先定证据等级:这是三级材料
单一 xlsx 工作簿,10 个工作表:视频应用产品、易观博览、QuestMobile、艾瑞咨询数据、chatbot斗争历史、腾讯阿里字节的办公大战、腾讯workbuddy、字节traework、智谱zcode、deepseek harness。
为什么定三级同一工作簿内混合了官方产品页面、公司自报口径、咨询机构测算、媒体匿名爆料与专家访谈,且缺逐条可点击引用与抓取日期。不得当作公司披露事实使用。
逐项标注「未独立复现」豆包的收入与算力成本、各产品 DAU、智谱 ARR、Coding Agent 任务通过率、98% 缓存命中率——以上一律标记未独立复现,只能作假说,不能进入任何母题的置信度计算。
快照风险2026 年的套餐、积分、席位价格、用户规模与产品功能变化快,属快照数据,不可作长期事实锚。第三方流量口径亦不可横加:App MAU、Web visits、PC 交互次数、DAU 与「访问量」不是同一指标。
事实层:五个正在被争夺的控制点
以下五条只写工作簿中真实存在的产品结构与公开形态,不含推断。凡涉及规模、收入、成功率的数字均未独立复现。
DeepSeek 以模型/API 和免费轻前端形成品牌;智谱选择 GLM 与 ZCode 深度联调;字节、腾讯的工作台允许多模型或自带模型。
2 · Harness/Runtime 执行层WorkBuddy、TraeWork、ZCode 都把任务拆解、工具调用、上下文管理、权限、缓存、子智能体、错误恢复与结果校验放到前台。工作簿多处提出 Agent 能力 = 模型能力 × Harness 能力。
TraeWork 以 Work/Code/Design 三模式、文件与多端任务组织工作;WorkBuddy 以受控工作区、Experts、Skills、Connectors 组织执行;Kimi、MiniMax 争长期项目与专业资料。
4 · Skill、Connector 与生态分发层腾讯可连接文档、网盘、企微、支付等;阿里可连接淘宝、支付宝、飞猪、高德、物流;字节可连接内容、视频、电商与飞书。TraeWork、WorkBuddy 均展示插件/技能市场。
5 · 交易、权限与企业控制层阿里最接近服务与支付闭环;WorkBuddy 提供企业席位、SSO、VPC/私有化与托管 Agent;AutoGLM 争设备操作权限。
解释层:竞争问题被换掉了
竞争已从「模型会不会答」转成「系统能不能连续做完」。同一模型在不同 Harness 中可能出现显著任务成功率差异——这是工作簿提出的机制,不是已复现的实验结果。模型仍决定能力上限,但模型可替换性正在上升:强模型可以制造一次入口换手,却不自动形成长期用户关系。
用户交出的不只是 Prompt,而是文件、历史、项目状态、权限和组织上下文。大厂的历史业务资产正在被重新封装成 Agent 可调用的能力。一旦 AI 从建议走向行动,价值会向掌握账号、支付、审批、安全、审计和责任归属的一方集中。
判断层:五层利润池,各自的成立条件
有规模但价格下降快,资本与算力密集。长期价值取决于模型品牌、API 使用量、成本曲线与迭代领先是否可持续。
Harness/Runtime本卡的候选判断落在这一层:Harness 不是薄壳,而可能成为模型商品化后的独立利润吸收层。成立条件是真实任务成功率、失败恢复与长期留存;功能列表不能证明护城河。
Workspace/企业控制比聊天记录更强的转换成本候选项。壁垒不是「保存过聊天」,而是项目能否持续、产物能否迭代、权限能否继承、失败能否恢复、协作能否审计。
Skill/生态生态资产提供「参赛资格」,不自动构成护城河。只有调用率、成功率、复用率、第三方供给质量、审核成本与分成收入能证明经济网络效应。多数平台目前只是「产品形态上的平台」,尚未证明是「经济意义上的平台」。
Outcome/交易潜在利润池最大,也最慢最重。演示一次下单不等于可靠生产系统;必须看确认机制、错误赔付、审计日志与真实增量交易。
最重要的经济判断:用户越来越不是为「访问某个模型」付钱,而是为任务完成、并发、持续项目、可交付文件、可靠恢复和企业治理付钱。
五家公司的当前位置
拥有最完整的「流量—创作—API—工作台」组合(豆包、Seedance/即梦/火山方舟/BytePlus、TraeWork),但没有证据证明这些入口已被组织成一个高回报闭环。风险:豆包、飞书、Trae 之间可能重复建设;移动规模不等于专业任务成功或付费。
阿里交易行动层最强,商品、支付、地图、旅行、物流连接最完整,最有机会证明 Outcome 层价值;但必须披露独立买家、增量订单、抽佣、补贴、复购与产品 P&L。订单可能只是入口迁移,不一定是增量 GMV。
腾讯WorkBuddy 可能成为腾讯的「AI 工作控制面」,具备个人订阅/Credits 与企业席位、部署收费;目前只能确认产品结构,不能确认经济护城河——绝对 DAU、付费人数、单品收入与长期留存缺失。
智谱路线最清楚:不做纯模型供应商,做垂直整合的 Agentic Engineering 产品,ZCode 围绕 GLM 把 Goal、Subagents、Remote Control、闲时任务与缓存优化产品化。但用户数、通过率、缓存命中率、ARR 多为公司或媒体口径,需同任务、同预算、独立复现。
DeepSeek更像模型层的「Intel Inside」,而不是中国超级应用。开放权重、低价 API 与轻前端形成强模型心智,但用户可在第三方前端使用 DeepSeek,终端关系与高价值上下文未必留在 DeepSeek;收入、客户、毛利与全成本缺失。
反证条件:什么会推翻本卡的候选判断
- 同模型条件下,不同 Harness 的真实任务成功率长期趋同。
- 用户可以低成本迁移项目、文件、历史、Skills 与授权,Workspace 留存不强。
- 多 Agent/长任务的协调与错误成本长期高于节省的人力。
- 企业不愿为独立 Agent 工作台采购,只把能力吸收进飞书、钉钉、企微等既有套件。
- Outcome 层订单主要来自补贴或入口迁移,没有增量收入与利润。
后续跟踪变量(十项)
- 真实任务成功率,而不是功能数量。
- D30/D90 与项目复用率。
- 付费人数、续费率与退款率。
- 单任务全成本与毛利。
- 长任务恢复、回滚与审计能力。
- 用户保存的项目/文件/组织上下文深度。
- Skill 调用率、第三方开发者收入与审核成本。
- AI 带来的增量订单、take rate 与复购。
- 企业席位扩张、私有化/VPC 采用与销售周期。
- 模型可替换后,用户是否仍留在同一个 Harness/Workspace。
与母题的关系
第一母题(Q1 · 护城河与利润池,主归属):模型、Harness、Workspace、生态与交易是五个不同控制点,不能用「谁模型强」代替产业分析。本卡把利润池拆分补进 Q1 的观察层,不改变 Q1 置信度 72%——材料为三级,无独立单位经济。
第四母题(Q4 · AI 能否成为可靠生产系统,交叉引用):工作簿提供了一张明确的工程验证表——任务成功率、长任务恢复、上下文压缩、权限网关、回滚、审计、子 Agent 编排与可验收目标。这与研究卡 030 模型记忆与产品 Harness 的分层一致,与 002 模型公司护城河比较 构成中国样本的对照。Q4 维持 58%:产品演示多、独立任务评测少,功能存在不等于复杂任务可靠完成。
第二、第三母题不变。本材料对 Transformer 边界与下一代技术底座没有新的实验性证据。
缺口与停止条件
缺任务级成本、推理毛利、付费转化、续费、D30/D90、CAC、LTV 与回收期。
匿名爆料需降级豆包收入/算力成本、各产品 DAU、组织调整等匿名来源只能做假说,不能当公司事实。
图片型工作表的口径绑定易观、QuestMobile、艾瑞截图中的测算方法与注释应与结论绑定,避免二次转述丢口径;本卡未复述其中任何具体数值。
下一次只接受同任务、同预算、可独立复现的 Harness 对照测评;或厂商披露的按产品拆分留存、毛利与续费数据;或可核验的增量 GMV 与 take rate。不再收集产品功能清单和榜单排名。
材料指纹
来源文件 中国模型公司产品.xlsx,26,520,396 字节,10 个工作表,本地路径 /Users/jagger/Desktop/中国模型公司产品.xlsx,获取日期 2026-08-17。证据账本登记为 E-025(三级)。分析全文见工作区 丘婷婷_AI大模型研究报告分析_2026-08-17.md。