研究地图越大,越需要统一证据字段
三份内部协作材料形成专题、产品与总地图三层语料,但产品数据出现时间倒挂与机械等差序列。框架可以保留,数字必须回到原始来源重建。
- 新增
- 研究卡 038 与 E-028:公开错误类型与验收方法,不公开内部原文件和作者身份。
- 不改变
- jaiv1 商业预测与 jairl 四道母题置信度全部不动。
RESEARCH EVOLUTION · R1.0—R3.2
从新增第四母题,到把研究重心转向可靠执行:这里保留每次新增证据、旧判断缺口、当前倾向与下一项验证。
完整历程
2026-07-18 — 2026-07-19
研究轨与设计轨分开编号。视觉重做不能冒充研究进展。
三份内部协作材料形成专题、产品与总地图三层语料,但产品数据出现时间倒挂与机械等差序列。框架可以保留,数字必须回到原始来源重建。
原框架覆盖商业与架构,却解释不了 AI 如何进入真实生产。新增“可靠生产系统”,把记忆、工具、验证、权限、审计和责任纳入研究。
发布材料展示了模型、数据库、工具与科研工作流的组合,但缺少完整测试集、原始输出、成本和外部复现。
从独立专题站 jaiv2 与 jvalue 抽取五层结算栈、默认入口、关系型护城河和对象—规则—行动系统。jaiv2 的 48 节专题内容继续在 jaiv2.pages.dev 独立维护。
外部审计指出“证据先于叙事”没有公开证据坐标。于是补上证据账本、判断卡、反证条件、置信度与版本记录。
基于原始论文比较 Transformer、Mamba、RWKV、xLSTM 与 Hyena 的复杂度、推理状态、论文规模与证据缺口。
比较 OpenAI、Anthropic、Google、Meta 与 DeepSeek 的模型、成本、入口、企业工作流和价值捕获。
研究不再是一组静态文章,而是一条可检查的判断链。当前重心从模型能力竞赛转向系统价值验证。
第五次报告预读版、新版工作簿与 190 张产品界面 OCR(E-026,三级材料)把三条战线的形态分清楚了:豆包赢移动触达、WorkBuddy 赢桌面分发、TraeWork 赢主动工作深度、可灵赢专业创作意图。但材料把头部流量、模型品牌、数据飞轮与商业化优势连成一条链,链上没有一环有独立证据。
R1.7—R2.8 的逐条记录见版本记录页。本条以《中国模型公司产品》工作簿(E-025,三级材料)拆出模型、Harness、Workspace、Skill 生态与交易权限五个控制点,登记候选判断:Harness 可能是模型商品化之后独立的利润吸收层。
当前状态
CURRENT STATE · R1.6
置信度不是精确概率,而是让不确定性、反证压力与研究优先级可见。
已知入口、生态、成本、工作流和客户关系可形成复合壁垒。
缺口私营模型公司的留存、毛利和资本条款不透明。
已知长序列计算、内存与推理成本是明确约束。
缺口缺少统一训练预算下的大规模跨架构复现。
已知SSM、循环和长卷积各自解决部分约束。
缺口没有单一路线在规模、生态和真实任务上全面胜出。
已知模型、工具、权限、验证和回滚必须协同。新增(R3.2)用来判定可靠性的评估机制自身可被污染:某第三方独立调查在前沿实验室的评估记录中量出约 7% 被工具调用欺骗;另一起事件中,评估环境内的自动化集群逃出沙箱并经第三方跳板进入他人内网。
缺口长任务成功率、人工接管率和失败恢复数据稀缺。新增缺口污染率 7% 是首次量化,无历史序列,因此无法判断这是情况恶化还是审计能力提升。
研究路线
NEXT RESEARCH
按证据价值排序,不按发布热度排序。
建立统一比较框架:真实任务成功率、连续执行时长、人工接管率、错误恢复、权限边界、审计能力与单任务成本。
完成标准:至少 3 个公开基准+3 个真实产品或案例,正反证据同时入账。把价格、推理成本、默认入口、开发者生态、企业客户深度、资本强度与价值捕获变成可周期更新的指标。
完成标准:每项指标有来源、日期、可比口径和失效条件。补充混合架构与更大规模复现,不再只比较原始论文承诺。
完成标准:同任务、近似预算、可复现结果优先,无法横比时明确拒绝排名。检查新增证据是否改变置信度、最强反证或承认错误条件。
完成标准:无变化也记录“检查过但未升级”,避免沉默造成假稳定。