| 位次·发言人 | 承担的论证环节 | 核心命题 | 这一环若被质疑,整条链的后果 |
|---|---|---|---|
| 1 · 吴泳铭 集团 CEO | 需求侧公理 | 思考将像动力一样成为规模化商品,远期机器思考量达人类 1000 倍 | 整条链失效。20GW 与 50 万卡的合理性完全依赖这个前提 |
| 2 · 刘大一恒 Qwen LLM 负责人 | 模型仍可 Scaling | RSI 递归自我改进已进入训练/推理/芯模协同,参数向 5–10T 推进 | 若 Scaling 边际收益证伪,则十万亿参数集群无需求支撑 |
| 3 · 郑波 ATH 技术副总裁 | 需求侧二次放大 | 体验的边际成本趋近于零,三年内出现原生全模态统一生成模型 | 若体验侧不爆发,Token 消耗停留在文本办公量级 |
| 4 · 高慧 平头哥副总裁 | 算力结构性变化 | Agent 时代推理远超训练,CPU 从配角回到关键路径 | 若算力结构未变,通用 GPU 采购即可满足,无需全栈自研 |
| 5 · 李飞飞 阿里云 CTO | 云必须被重写 | 传统云面向人设计,Agentic Cloud 面向智能体重构,云从运营算力转向运营智力 | 若云不需重写,阿里云相对海外云厂无结构性差异化 |
| RSI 落地环节 | 具体做法 | 披露结果 | 证据性质 |
|---|---|---|---|
| 模型自我训练 | Qwen3.8-Max 自主搭建训练流程、构造数据、设计实验、定位缺陷 | 人类零参与持续迭代超 1 个月,完成 33 轮有效迭代;Artificial Analysis 得分 40→45(+12.5%) | 厂商自述 + 第三方榜单可验证 |
| 推理优化 | 在从未见过的平头哥新款 GPU 上自主适配 Qwen3.8-Flash 推理框架 | 单实例推理吞吐量 +96% | 厂商自述 |
| 芯模协同设计 | 仅凭一份真实总线模块规范,自主跑前端/验证/后端全链路 | 自主运行 60+ 小时、调用 EDA 工具超万次,物理实现面积 -42% | 厂商自述 |
| 架构效率 | Qwen3.8-Flash 提前开源下一代架构,创新注意力与模型内信息传递机制 | 训练成本降低近 90%,被称为行业性价比「斩杀线」模型 | 厂商自述 + 开源可复核 |
| 结构性变化 | Chatbot 时代 | Agent 时代 |
|---|---|---|
| 算力主战场 | 训练为主:模型学完知识,考试交差 | 推理消耗远超训练:成千上万个 Agent 同时在真实任务里跑 |
| 单次任务形态 | 一问一答 | 一个任务拆成十几步:搜索、读文档、跑代码、汇总,每步都要调工具、存状态 |
| 算力需求曲线 | 大致线性 | 非线性放大——「翻着跟头往上滚」 |
| CPU 角色 | 打杂:发调度、做请求、搬数据,大部分时间在等活干 | 回到关键路径:每次搜索调用、每个代码沙箱启动、每个中间状态保存、多路结果汇总,全落在 CPU 上 |
| 瓶颈判定 | 一颗好 GPU 基本够用 | GPU/CPU/内存/网络任一环节卡住整个系统都得等,必须是一整套系统 |
| 产品 | 披露效能数字 | 证据性质 |
|---|---|---|
| Context Engine · Agent Context | 复杂知识检索准确率 +50 个百分点,Token 使用效率 3 倍以上 | 厂商自述 |
| Tair KVCM(KVCache 调度) | 缓存有效命中率 99%,每 Token 成本 -50% | 厂商自述 |
| KVCacheStore | 缓存覆盖时间窗口 +900%,吞吐 +20%,首 Token 延迟 -54% | 厂商自述(客户生产环境) |
| 新一代 CPFS 存储 | 模型启动耗时 -50%,峰值算力利用率 +30%,AI 存储成本 -69% | 厂商自述 |
| AgentCore | TCO -70%;支持长任务、失败重试、断点恢复、异步执行 | 厂商自述 |
| Agent Sandbox | 创建吞吐 10 万/分钟,深休眠唤醒 <600ms,兼容 E2B 与 K8s | 厂商自述 |
| 实证案例 | 上下文来源 | 解决的具体问题 | 规模 |
|---|---|---|---|
| 古茗茶饮 | 飞书文档、知识库、答疑群、培训日程 → 整合为「门店运营知识空间」 | 上新频繁,运营标准需及时下发门店;店员问海报张贴规范时,Agent 拿到的不是全部运营知识,而是当前任务所需上下文 | 近 1 万名一线员工 |
| 富立卡(仓储物流包装) | 企业上下文在三个数字员工间共享 | 销售每人每天处理 300+ 条客户询盘、需与 6 个部门协作;配置查询/报价/合同三个数字员工围绕同一笔业务分工 | 销售团队全员 |
| 反方论点 | 关键实证 | 来源性质 |
|---|---|---|
| ①上下文越长越差,且劣化发生在窗口上限之前(context rot) | 所有前沿模型随 token 增加可靠性可测量地下降。Anthropic 归因:transformer 注意力产生 n² 两两关系,且训练中长序列样本远少于短序列 → 模型存在有限的「attention budget」。反直觉发现:模型在逻辑连贯文档上表现比打乱文档更差——连贯叙事产生更有说服力的干扰项 | Anthropic 官方技术说明 |
| ②位置效应显著,中段信息会被系统性低估(lost-in-the-middle) | 答案文档从位置 1 移到 20 文档上下文中的位置 10,准确率下降 超过 30%;另有 GPT-4o 记录显示同模型同 prompt 下,准确率随上下文增长从 99.3% 降到 69.7% | Liu et al., TACL 2024 等学术文献 |
| ③延迟与准确率存在硬取舍,全上下文方案在协作场景基本不可用 | Atlan 五级记忆基准:全上下文准确率 72.9%、p95 延迟 17.12 秒;扁平向量准确率降到 66.9%,但延迟仅 1.44 秒(快 12 倍) | 第三方基准测试 |
| ④Agent 故障主要不在模型,而在上下文管道——但修法是工程纪律,不是资产壁垒 | 7 个框架 1,187 个真实 bug 报告分析:58% 的 Agent bug 位于 agent core 与 context 层,工具集成 21%、规划 13%、记忆 8% | Islam et al., arXiv:2601.15232 |
| ⑤最大的可靠性跃升来自 Harness,不是 Context | Cognition/Devin 的「context anxiety」:开启 1M token beta 但静默封顶 200K,焦虑消失——prompt 与 context 内容均未改动。LangChain 2026 年 3 月:coding agent 在 Terminal-Bench 2.0 从第 30 名升到第 5 名,底层模型完全没换,全部增益来自 harness(工具设计、执行沙箱、重试逻辑、验证回路)优化 | 两家公司公开工程复盘 |
| 层级 | 是什么 | 竞争属性 | 会不会被商品化 | 结论 |
|---|---|---|---|---|
| L1 · 上下文技术 | 长窗口、KV Cache、检索重排、压缩、记忆管理、prompt caching | 纯工程能力,有公开论文与开源实现 | 正在被商品化——阿里云、Redis、DataHub、Cloudflare 同期入场 | 不是护城河 |
| L2 · 上下文工程纪律 | WRITE/SELECT/COMPRESS/ISOLATE 四操作的执行质量;与 Harness 的协同 | 组织能力,可复制但复制成本高、需要持续投入 | 难以商品化,但也难以形成排他性 | 短期差异化 |
| L3 · 专有上下文资产 | 只有你有、别人拿不到、且随时间增值的业务上下文:客户历史决策、行业术语体系、失败案例库、特定场景的验收标准 | 数据资产,具备时间累积性与排他性 | 不可商品化——云厂商能卖你工具,卖不了你的历史 | 真护城河 |
| 角色 | 该投的层 | 不该做的事 | 判断依据 |
|---|---|---|---|
| 云厂商/基础模型公司 | L1 为主:把上下文技术做成标准件(这正是阿里云 Context Engine 的定位) | 不要承诺替客户构建 L3——那是客户自己的资产,厂商无法代持 | L1 有规模效应,能摊薄到所有客户 |
| 企业 IT/数字化部门 | L3 为主,L2 为辅:先盘清哪些上下文是本企业独有且在增值的,再建装配管道 | ⚠️ 不要先买工具后找数据。也不要把「把所有文档灌进知识库」当成建 Context | 古茗案例的关键不是接了飞书,而是把散落信息重组为「门店运营知识空间」这个结构 |
| FDE/解决方案交付方 | L2 为核心竞争力:把上下文装配与 Harness 工程做成可复用方法论 | 不要卖「我们有更好的模型」——模型在趋同,这个说法两个季度就失效 | LangChain 第30→第5 证明:同模型下 Harness 差距可以是数量级的 |
| 内容/传媒公司 | L3:把审美判断、事实边界、行业术语、失败案例沉淀成可复用上下文 | 不要把预算全押在「用哪家视频模型」上——模型会换,判断标准不会 | 陆川案例中人机分工的分界线正是:人管问题意识、核心表达、审美判断与事实边界 |
| 医疗机构/医疗 AI | L3:真实世界临床数据 + 报告文本的配对关系 | 不要重复投「一病一模」——DAMO RADAR 已经开源了通用路径 | DAMO RADAR 的技术突破核心正是影像与报告文本的器官级对齐,无需额外人工标注 |
| 评价维度 | 旧尺子(2024–2025) | 新尺子(2026 · 生产级基准线) |
|---|---|---|
| 模型能力 | 单条 demo 的视觉惊艳度 | Artificial Analysis 等榜单的持续位次——Wan3.0 拿下文生视频与视频编辑双榜第一,4 款模型进入文生视频全球前十 |
| 可交付性 | 能不能生成 | 出片稳定率:同一提示词多次生成的一致性,决定能否排进制作周期 |
| 成本 | Token 单价 | 可计算的成片成本:从脚本到成片的全流程折算,而非单次调用价格 |
| 工程集成 | 有没有 API | API 服务等级 + 工作流适配:能否插进现有剪辑、审核、分发链路 |
| 能力边界 | 分辨率/时长 | 单次 30 秒生成、结构化输入(文档/表格/网页)、原生音画同步 |
| 优先级 | 行动项 | 为什么现在做 | 可验证的完成标准 |
|---|---|---|---|
| P0 | 建立本机构的专业上下文库(L3):审美标准、事实边界规则、行业术语体系、失败案例 | 陆川指出通用模型带「影视感」缺「陌生感」——这个缺口只能靠专有上下文补,且换模型不影响其价值 | 能用同一套上下文,在两家不同厂商的模型上产出风格一致的成片 |
| P0 | 把「成片成本」做成可计算模型:从脚本到成片全流程折算,而非单次调用单价 | 这是客户的新尺子,也是唯一能进合同的口径。模型榜单位次半衰期太短 | 能对任一题材给出成本区间与出片稳定率两个数字 |
| P1 | 等 11 月下一代视频模型发布后再做长内容技术选型 | 郑波已明确预告:更长、更可控、更完整、更智能,具备导演级创作思维,从单镜头到理解完整叙事。当前长镜头一致性仍是待解课题 | 完成一次 A/B:同一叙事在新旧模型上的镜头一致性对比 |
| P1 | 按「原生全模态统一模型三年内出现」做架构预留,不要把图像/视频/音乐/配音管道写死 | 郑波判断三年内出现原生一体化模型,届时多模型拼接的管道会成为技术债 | 管道层做到可替换:更换任一模态的后端不影响上游编排 |
| P2 | 事实边界治理:为纪实、历史、新闻类内容建立 AI 生成物的标注与审核规则 | 「AI 复原历史如何守住事实边界」是官方承认的未解课题,也是合规风险最高的一处 | 有书面规则,且能对任一成片追溯哪些镜头为 AI 生成 |
| 维度 | 传统「一病一模」路线 | DAMO RADAR 通用模型路线 |
|---|---|---|
| 覆盖范围 | 一个模型针对一种疾病的特定场景 | 一次识别 146 种病症、覆盖 18 个器官(含各类恶性肿瘤) |
| 训练依赖 | 依赖大量人工标注,成本高、耗时长 | 无需额外人工标注:直接学习影像与诊断报告文本的内在关联 |
| 核心技术 | 监督学习 + 专病特征工程 | 视觉-语言学习 + 国际首创「器官级细粒度对齐」:把 CT 三维数据拆解为独立解剖单元,在器官层面精准对齐影像与报告文本,再用自适应对比建模动态调整 |
| 研发周期 | 立项到落地发布往往需 2–3 年 | 技术范式可迁移至其他医疗影像领域,不必逐病重来 |
| 泛化能力 | 换一类题目便无从下手(「善攻个别题型的学生」) | 面对初始训练之外的急诊场景仍有高性能:急腹症 AUC 0.904 |
| 证据项 | 内容 | 证据强度 | 说明 |
|---|---|---|---|
| 同行评审 | 登上 Science,2026-09-18 发表 | 最高 | 顶级期刊同行评审,区别于厂商自述 |
| 样本规模 | 近 4 万例连续临床病例,146 种病症,18 个器官 | 高 | 「连续临床病例」而非筛选样本,更接近真实分布 |
| 人机对照 | 14 家医院 26 名影像科医生参与对比试验 | 高 | 多中心、多医生,平均准确率超过其中 23 名 |
| 临床增益 | 敏感性 +10%、阅片耗时 -30.7%,并使低年资医生达到高年资医生诊断水平 | 高 | 这是最具落地价值的一条——直接指向基层医院 |
| 泛化验证 | 训练外的急诊场景(急腹症)AUC 仍达 0.904 | 中高 | 单一外部场景,尚非广泛外部验证 |
| 可复现性 | 模型、核心代码、全套技术框架已全面开源 | 最高 | 可独立复核,是与闭源方案的根本差异 |
| 二次验证 | 肖文波称经过第二轮临床验证,效果依旧稳定出色 | 待披露 | ⚠️ 第二轮验证的样本与口径未公开,暂不宜引用具体数字 |