01 / 24
2026 杭州云栖大会 · 首日主论坛深度解读

机器智能叙事的五层拆解、
Context 竞争力判断,
与文传/医疗两大行业的落地口径

本报告拆解 6 位核心发言人的观点与叙事结构,独立评估「Context 是否构成 AI 下一阶段核心竞争力」这一命题的正反证据,并针对文化传媒与医疗两个行业给出可执行的判断口径。
发言人吴泳铭 · 刘大一恒 · 郑波 · 高慧 · 李飞飞 · 陈宇森
证据类型现场速记 · 官方发布稿 · 上市公司披露 · 第三方评测榜 · 同行实证
核心命题Context 重要 ≠ Context 是护城河
分析日期 2026-09-22|口径:仅采用已公开披露信息,厂商自述与第三方独立核实分列
来源:2026 云栖大会现场速记与官方发布材料01
02 · 执行摘要

今年云栖的真实主题不是模型,而是把 Token 从「能力」重述为「可被资本开支定价的商品」

1000×
吴泳铭:机器思考总量对人类的远期倍数,当前不足 3%
20GW
2032 年阿里云全球数据中心目标规模
5–10T
Qwen4.5/Qwen5 规划参数量,Qwen4 已在训练
50万卡
真武 V900 单一集群上限,芯片 2027Q1 量产
01
五个人讲了五层,但论证方向只有一个:先证明需求无上限,再证明只有全栈自研能接住
吴泳铭立时代框架(需求侧),刘大一恒证模型仍在 Scaling,郑波证体验侧需求爆发,高慧证算力结构变了、CPU 回到关键路径,李飞飞证云必须重写。这是一条为天量资本开支服务的完整论证链,而非五份独立技术汇报。
02
叙事升级的同时,组织已从「分权」收回「集权」——这是今年最容易被忽略的信号
去年周靖人一人 50 分钟讲完全栈;今年被拆成 4 人(15+15+15+20 分钟),周靖人缺席主论坛转任首席科学家。3 月 ATH 事业群成立、6 月 Token Foundry 由吴泳铭直接负责、8 月云智能与平头哥合并。讲台结构就是组织结构的投影。
03
Context 被首次提到与 Model 同级:李飞飞的 Model×Harness×Context,陈宇森的「Context is All You Need」
阿里云推出 Context Engine(存储—计算处理—上下文工程三位一体),千问办公推出「企业上下文」产品。两条线同日发布、口径一致,说明这是集团级判断而非单一 BU 的产品叙事。
04
文化传媒:AI 视频的竞争已从跑分转向交付,「生产级基准线」被首次明确
陆川《历史·现场》以 5 天完成传统需数月、千万级投入的制作;爆炸场景从 19 天实拍压缩到约四轮提示词。企业客户关注点已从 demo 惊艳度转向出片稳定性、综合成本、API 服务与工作流适配
05
医疗:DAMO RADAR 上 Science 并开源,把医疗影像 AI 从「一病一模」推进到通用模型范式
腹部增强 CT 一次识别 146 种病症、覆盖 18 个器官,近 4 万例真实检查平均 AUC 0.913,人机对比中平均准确率超过 26 名放射科医生中的 23 名。这是范式级变化,不是指标级改进。
口径说明:本页所有数字均为发言人或官方发布口径。带「厂商自述」性质的效能数字(如成本下降 70%)在后文单独标注,不与第三方独立核实结果混用。
SO WHAT
如果只记一句:吴泳铭在用工业革命类比,把「巨额资本开支」从一个赌注重述为一个必然。对我们而言,需要评估的不是他的判断对不对,而是在他的判断成立与不成立两种情形下,我们各自该做什么
来源:吴泳铭/刘大一恒/郑波/高慧/李飞飞/陈宇森 9-22 主论坛与专场发言02

六位发言人的观点与叙事逻辑

拆解每个人说了什么、为什么在这个位置说、以及有意留在暗处的是什么
Part Ⅰ03
04 · 叙事结构

五位主论坛发言人不是五个主题,而是一条从需求侧到供给侧闭合的单向论证链

读懂今年云栖的关键,是看出发言顺序本身就是论证顺序。吴泳铭先把「需求无上限」立成公理,后面四个人分别证明「只有全栈自研能接住这个需求」。
位次·发言人承担的论证环节核心命题这一环若被质疑,整条链的后果
1 · 吴泳铭
集团 CEO
需求侧公理思考将像动力一样成为规模化商品,远期机器思考量达人类 1000 倍整条链失效。20GW 与 50 万卡的合理性完全依赖这个前提
2 · 刘大一恒
Qwen LLM 负责人
模型仍可 ScalingRSI 递归自我改进已进入训练/推理/芯模协同,参数向 5–10T 推进若 Scaling 边际收益证伪,则十万亿参数集群无需求支撑
3 · 郑波
ATH 技术副总裁
需求侧二次放大体验的边际成本趋近于零,三年内出现原生全模态统一生成模型若体验侧不爆发,Token 消耗停留在文本办公量级
4 · 高慧
平头哥副总裁
算力结构性变化Agent 时代推理远超训练,CPU 从配角回到关键路径若算力结构未变,通用 GPU 采购即可满足,无需全栈自研
5 · 李飞飞
阿里云 CTO
云必须被重写传统云面向人设计,Agentic Cloud 面向智能体重构,云从运营算力转向运营智力若云不需重写,阿里云相对海外云厂无结构性差异化
补充:第 6 位关键发言人陈宇森(千问办公 CEO)在同日下午专场发布「企业上下文」,与李飞飞的 Context Engine 形成 IaaS/SaaS 两端呼应——见 Part Ⅱ。
SO WHAT
这条链的强度取决于最弱一环。目前最弱的是第 3 环(体验侧需求爆发缺乏已实现的财务验证),最强的是第 4 环(CPU 回到关键路径有明确工程机理支撑)。评估阿里 AI 叙事时,应优先追问第 3 环的收入证据。
来源:2026 云栖大会主论坛议程与五位发言人演讲实录04
05 · 发言人拆解 · 吴泳铭

工业革命类比的真实功能,是把天量资本开支从「赌注」重述为「历史必然」

论点一 · 重新定义 AI
「机器智能不是人造体力,而是全新物种」
他先拆掉图灵测试式的评价框架:Artificial 在英文里更接近「人造的」,而蒸汽机很快就超越了人和马能做的事——再多的人和马也无法让飞机上天。这一步把 AI 从「像不像人」的评价轴上移走,为后面的「1000 倍」腾出空间。
论点二 · 供给与需求双推演
顶级思考将从奢侈品变成商品
供给侧:培养顶级科学家需数十年,罕见病如新生儿早衰症全球有记录患者仅几百人,现有医药商业逻辑不会为几百人投十几年与巨资;AI 可为每个细分领域组织上百万 Agent 持续研究。需求侧:思考消耗量不再与人口成正比,而与机器智能的深度与供给规模成正比。
论点三 · 爆品未至
AI Coding 只是 1882 年的电灯
1882 年珍珠街电站点亮约 400 盏灯,爱迪生卖灯泡送电——「就像今天的 Agent 软件大战,下载软件送一个月 token」。1902 年才有空调,1946 年才有第一台计算机(距那 400 盏灯 60 多年)。
<3%
当前机器思考总量占人类比例
99.9%
远期机器承担的思考工作占比(类比机械动力已占物理工作 99.9%)
2 小时
1900 年前后全世界全年发电量,折算为今天的用量
20GW
2032 年阿里云全球数据中心目标规模
⚠️ 值得单独记住的一句:吴泳铭同时承认「AI 数据中心相关供应链的全球性紧缺正在限制算力增长速度」。这是全场唯一一处主动披露的供给侧约束,也是 20GW 目标最现实的风险敞口。
方法论
叙事技法值得学:他没有论证「阿里该花这么多钱」,而是论证「电气时代第一步必须先建电站和电网」,让资本开支变成不需要辩护的事。但类比不是证明——发电量能被计量并直接定价,Token 消耗与客户支付意愿之间的传导链条要长得多。
来源:吴泳铭 9-22 主论坛演讲全文(都市快报整理);上海证券报、新华网05
06 · 发言人拆解 · 刘大一恒

RSI 是对「Scaling 尚未终结」的重新论证,而 33 轮零人工迭代是全场最硬的一组证据

演讲题目《Qwen:迈向真实世界智能体》。值得注意的是,他的前任林俊旸离职后发的首篇长文,主张 AI 重心要从训练模型转向训练智能体——半年后接任者在集团最大舞台上讲的正是这件事。
RSI 落地环节具体做法披露结果证据性质
模型自我训练Qwen3.8-Max 自主搭建训练流程、构造数据、设计实验、定位缺陷人类零参与持续迭代超 1 个月,完成 33 轮有效迭代;Artificial Analysis 得分 40→45(+12.5%)厂商自述 + 第三方榜单可验证
推理优化在从未见过的平头哥新款 GPU 上自主适配 Qwen3.8-Flash 推理框架单实例推理吞吐量 +96%厂商自述
芯模协同设计仅凭一份真实总线模块规范,自主跑前端/验证/后端全链路自主运行 60+ 小时、调用 EDA 工具超万次,物理实现面积 -42%厂商自述
架构效率Qwen3.8-Flash 提前开源下一代架构,创新注意力与模型内信息传递机制训练成本降低近 90%,被称为行业性价比「斩杀线」模型厂商自述 + 开源可复核
2.4T-A95B
Qwen3.8-Max 参数/激活量,两年内旗舰参数涨 33 倍
30 亿+
Qwen 累计下载量,460+ 开源模型、30 万+ 衍生模型
史上第一
Qwen3.8-27B 成为 HuggingFace 历史最受欢迎开源模型
4 款
Qwen4 家族:Max/Flash/Plus/27B 开源,分层覆盖云端与本地
生态侧客户:Perplexity、Airbnb、Pinterest、路透社已基于 Qwen 开展 Agent、AI 助手或自研模型。Qwen3.8 系列一个月内下载超 5,600 万次、衍生模型 1,900+。
SO WHAT
「33 轮零人工迭代」之所以重要,不是因为分数涨了 5 分,而是因为它是第一个可被第三方榜单交叉验证的 RSI 证据。如果这条路径成立,模型能力的增长将不再受人类研究者数量约束——这才是 5–10T 参数规划的真实依据。
来源:刘大一恒 9-22 主论坛演讲;Artificial Analysis、HuggingFace 榜单;站长之家、今日头条整理06
07 · 发言人拆解 · 郑波

「体验的边际成本趋近于零」是文化传媒行业今天唯一必须记住的一句话

郑波的叙事位置很特殊:他不讲基础设施,他证明需求会爆发。论证路径是「人类感知世界一直依靠图像、视频、声音与交互,而从想法到可视化结果中间隔着一整条漫长生产链条」——全模态生成正在拆掉这条链条。
模型/能力(第三方榜单位次)
披露位次
Wan3.0 视频生成
AA 双榜第一
Qwen-Image-3.1 图像
逼近 GPT-Image
Qwen-Audio-3.1(ASR/TTS/Realtime)
国际第一梯队·国内第一
视频模型进入 AA 文生视频全球前十
4 款
HappyOyster 2.0 世界模型
Preview 阶段
三项关键预告
11 月发布下一代视频模型,三年内出现原生全模态统一生成模型
  • 新视频模型方向:更长、更可控、更完整、更智能——长时间保持一致性,创作者可精准掌控人物/场景/镜头
  • 关键措辞是「导演级创作思维,从生成单个镜头迈向理解完整叙事」,这是从工具到创作主体的定位跃迁
  • 统一模型不是多个模型拼接,而是原生一体化:一个模型同时完成图像、视频、音乐生成并具备世界理解能力
他引用的市场数据
需求侧已有量化支撑,但口径需注意
  • 63% 的视频营销人员已在使用 AI 视频工具
  • 预计 2030 年 AI 图像与视频生成市场规模达 608 亿美元
  • ⚠️ 这两个数字是第三方市场预测,非阿里已实现收入;判断传媒机会时应与阿里视频模型的实际客户付费规模分开看
收束语值得原样记下:「从生成走向理解,从分散走向统一,从内容走向体验,从想象走向可见,这就是 AI 的下一步。」
SO WHAT
对传媒行业,这一页的含义是:内容生产的稀缺性正在从「产能」转移到「判断力」。当生成 10 秒短视频只需十分钟、配乐半小时可成,护城河不再是能不能做出来,而是知不知道该做什么、以及做出来能不能卖掉。
来源:郑波 9-22 主论坛演讲(新浪财经现场实录);亿邦动力、今日头条整理07
08 · 发言人拆解 · 高慧

CPU 从配角回到关键路径,是今年云栖最被低估、也最有工程机理支撑的一个判断

高慧的论证最不依赖对未来的假设,而是直接指出 Agent 工作负载的结构与 Chatbot 完全不同。这也是全场五个论证环节里技术机理最扎实的一环。
结构性变化Chatbot 时代Agent 时代
算力主战场训练为主:模型学完知识,考试交差推理消耗远超训练:成千上万个 Agent 同时在真实任务里跑
单次任务形态一问一答一个任务拆成十几步:搜索、读文档、跑代码、汇总,每步都要调工具、存状态
算力需求曲线大致线性非线性放大——「翻着跟头往上滚」
CPU 角色打杂:发调度、做请求、搬数据,大部分时间在等活干回到关键路径:每次搜索调用、每个代码沙箱启动、每个中间状态保存、多路结果汇总,全落在 CPU 上
瓶颈判定一颗好 GPU 基本够用GPU/CPU/内存/网络任一环节卡住整个系统都得等,必须是一整套系统
真武 V900 对真武 M890 的性能倍数,2027Q1 量产
216GB
V900 显存,片间互联 1200GB/s,原生支持 FP8/FP4
650+
真武 M890 已商业化的外部客户数,覆盖 20+ 行业
1.4×
倚天 730 单核 SPECint2017/GHz 对倚天 710 的倍数
CPU 双产品线分工:倚天 720(192 核,走吞吐并发,应对几百上千个 Agent 同时跑)/倚天 730(第一代自研高性能核,追求单核不浪费微秒)/倚天 750(2029,支持通过 ICN 总线与真武直连)。
SO WHAT
这一页给出一个可立即使用的判断规则:凡是宣称做 Agent 基础设施但只谈 GPU 卡数的方案,都还停在 Chatbot 时代的成本模型里。评估供应商时应直接追问 CPU、沙箱启动延迟与中间状态存储的设计。
来源:高慧 9-22 主论坛演讲;网易科技、亿邦动力整理;平头哥官方发布08
09 · 发言人拆解 · 李飞飞

「云的价值从运营算力转向运营智力」——这句话真正指向的是收费方式的重写

演讲题《Agentic Cloud:生产智能,创造价值》。核心前提:传统云产品交互体系面向人设计(控制台操作、人工写 API 调用),而智能体负载具备无规律弹性、短生命周期、瞬时启停特征,原有架构无法适配。
智能体落地三要素(原文口径)
Model × Harness × Context
  • Model:决定智能体的智能决策水平
  • Context:全面、及时、准确的上下文,为运行提供可靠决策依据
  • Harness:为持续自我迭代、自我校正、自我约束提供安全可靠的执行保障
  • 对应三层技术栈:AI Native Cloud → Agent Native Cloud → Context Engine
四大目标(可作为验收尺子)
从概率智能走向可靠生产力
  • ①概率性 AI → 可靠生产力:把严肃工作流里的不确定性降到最低
  • ②粗放调用 → 精细化使用:智能体运行成本下降 70%
  • ③单点实验 → 智能基础设施:国内 300 万中小企业+大型企业,每家数十到上百个 Agent=千万级
  • ④智能体孤岛 → 智能组织:企业工作流中智能体渗透率提升至 50% 甚至更高
产品披露效能数字证据性质
Context Engine · Agent Context复杂知识检索准确率 +50 个百分点,Token 使用效率 3 倍以上厂商自述
Tair KVCM(KVCache 调度)缓存有效命中率 99%,每 Token 成本 -50%厂商自述
KVCacheStore缓存覆盖时间窗口 +900%,吞吐 +20%,首 Token 延迟 -54%厂商自述(客户生产环境)
新一代 CPFS 存储模型启动耗时 -50%,峰值算力利用率 +30%,AI 存储成本 -69%厂商自述
AgentCoreTCO -70%;支持长任务、失败重试、断点恢复、异步执行厂商自述
Agent Sandbox创建吞吐 10 万/分钟,深休眠唤醒 <600ms,兼容 E2B 与 K8s厂商自述
商业模式判断(延续其此前对外表达):SaaS 行业主流是按结果订阅付费而非按资源消耗量计费,AI SaaS 或将走向「按任务结果付费」,客户为智能任务成果买单而非为 GPU/CPU/Token 买单。评估云基础设施的标尺随之从算力密度转向智能体任务成功率、执行效率、治理可控性
风险
「按结果付费」如果成真,会同时改写两件事:云厂商的收入确认方式,以及集成商/FDE 的议价基础。⚠️ 但注意,这一页所有效能数字都是厂商自述,没有第三方核实——在对外引用时必须标注口径,不能升级为项目效果承诺。
来源:李飞飞 9-22 主论坛演讲;新华网、上海证券报、新浪财经现场实录09
10 · 叙事盲区

真正需要追问的是三个被留在暗处的问题,它们决定叙事能否兑现为财务结果

01
20GW 的现实约束被一句话带过,但它是整个资本开支计划的最大变量
吴泳铭主动承认「AI 数据中心相关供应链的全球性紧缺正在限制算力增长速度」,随后没有展开。缺口在哪一环(电力/变压器/HBM/液冷/土地)、2027Q1 V900 量产的产能保障如何,全部未披露。这是全场最重要的一处「说了但没说透」。
02
增长数字给了绝对额与同比,但没有给出 Token 收入的独立口径
上季度 AI 云与算力服务收入 484.37 亿元、同比 +45%,其中 AI 相关产品收入 123.76 亿元。但「AI 相关产品」的构成(API/MaaS/IaaS 扩容/千问办公订阅)未拆分,无法判断增长来自模型调用还是传统云扩容。评估 Token 生意的真实规模时,这个口径缺失是决定性的。
03
「工作流渗透率 50%」是最激进的一个数字,却没有配套的度量定义
李飞飞提出智能体在企业工作流中的渗透率要到 50% 甚至更高。分母是什么(岗位数/任务数/工时?)、怎么统计、目标年份是哪一年,均未定义。这类无分母指标在汇报中很有力,但不能进 KPI。
04
两条 Context 产品线同日发布,但边界没有说清
阿里云的 Context Engine(IaaS 层,面向开发者)与千问办公的企业上下文(SaaS 层,面向业务)在「把企业数据结构化供 Agent 调用」这件事上高度重叠。客户该用哪个、两者如何互操作,现场没有给出决策树。这对做技术选型的团队是实际问题。
方法说明:以上四点均为「官方材料中明确提及但未展开」或「逻辑上必需但完整缺失」,不含推测性指控。每一点都可在后续分论坛材料或财报电话会中继续追踪。
纪律
对内使用这份材料时的纪律:把「愿景类数字」(1000 倍、99.9%、50% 渗透率)与「可核验数字」(484.37 亿收入、AA 榜 40→45、AUC 0.913)严格分栏。前者用于判断方向,后者才能进入任何决策模型。
来源:基于 9-22 公开发布材料的缺口分析;收入数据引自阿里巴巴上季度财报披露10

Context 对 AI 是否重要?
是否是接下来的核心竞争力?

正反证据对质,并给出可执行的分层判断
Part Ⅱ11
12 · Context · 正方证据

Context 确实重要——今年云栖第一次把它放到与 Model 同级的位置,而且是集团级共识

陈宇森 · 千问办公 CEO(SaaS 侧)
「Context is All You Need」
核心判断:数据是 Agent 进入企业业务流程的最重要前提。他给出的因果链非常明确——
  • 模型和 Agent 能力在变强,个人办公效率显著提升
  • 组织生产力并未线性提升
  • 卡点在于 Agent「进不去」业务工作流
  • 而 Agent 懂业务的前提是准确的企业上下文
产品设计的关键取向:不是越多越好,而是越准越好——「给 Agent 一本精准业务手册,而不是一座图书馆」。
李飞飞 · 阿里云 CTO(IaaS 侧)
上下文不再是应用侧的一段缓存,而是企业需统一建设和治理的新型数据资产
Context 被列为智能体落地三要素之一,并单独构建 Context Engine(存储—计算处理—上下文工程三位一体):
  • 底层:多模态数据存储承接对话、视频帧、点云、轨迹、Agent 反馈
  • 中间层:数据集成、转换、治理、质量、建模
  • 上层:全域知识库、多模态语义整合、持续记忆管理、实时上下文装配
目标表述很精准:让 Agent 从「知道什么」走向「此刻应该做什么」
实证案例上下文来源解决的具体问题规模
古茗茶饮飞书文档、知识库、答疑群、培训日程 → 整合为「门店运营知识空间」上新频繁,运营标准需及时下发门店;店员问海报张贴规范时,Agent 拿到的不是全部运营知识,而是当前任务所需上下文1 万名一线员工
富立卡(仓储物流包装)企业上下文在三个数字员工间共享销售每人每天处理 300+ 条客户询盘、需与 6 个部门协作;配置查询/报价/合同三个数字员工围绕同一笔业务分工销售团队全员
行业侧交叉验证:金山办公 CEO 章庆元 2026 年判断——随着大模型性能趋同(「平权」),竞争将转向价格与效率,而「上下文」将成为软件公司在 AI 时代的核心壁垒,企业长期积累的工作上下文构成难以被时间复制的优势。Gartner 2025 年 7 月亦明确表态:context engineering in,prompt engineering out。
SO WHAT
正方最强的论据不是产品,而是那个诊断:个人效率提升没有线性转化为组织生产力。这个现象我们在自己的项目里也能观察到,它确实指向上下文缺失而非模型能力不足。
来源:陈宇森 9-22 千问办公专场;李飞飞主论坛演讲;环球网、国际金融报、上海证券报12
13 · Context · 反方证据

但「Context 重要」不等于「Context 是护城河」——三类独立实证指向另一个答案

这一页的证据全部来自阿里体系之外的第三方,且多数是可复核的公开实验或学术结论。它们不否认 Context 重要,而是指出把上下文堆多、堆长的方向是错的,且真正的差距正在向另一层转移。
反方论点关键实证来源性质
①上下文越长越差,且劣化发生在窗口上限之前(context rot)所有前沿模型随 token 增加可靠性可测量地下降。Anthropic 归因:transformer 注意力产生 n² 两两关系,且训练中长序列样本远少于短序列 → 模型存在有限的「attention budget」。反直觉发现:模型在逻辑连贯文档上表现比打乱文档更差——连贯叙事产生更有说服力的干扰项Anthropic 官方技术说明
②位置效应显著,中段信息会被系统性低估(lost-in-the-middle)答案文档从位置 1 移到 20 文档上下文中的位置 10,准确率下降 超过 30%;另有 GPT-4o 记录显示同模型同 prompt 下,准确率随上下文增长从 99.3% 降到 69.7%Liu et al., TACL 2024 等学术文献
③延迟与准确率存在硬取舍,全上下文方案在协作场景基本不可用Atlan 五级记忆基准:全上下文准确率 72.9%、p95 延迟 17.12 秒;扁平向量准确率降到 66.9%,但延迟仅 1.44 秒(快 12 倍第三方基准测试
④Agent 故障主要不在模型,而在上下文管道——但修法是工程纪律,不是资产壁垒7 个框架 1,187 个真实 bug 报告分析:58% 的 Agent bug 位于 agent core 与 context 层,工具集成 21%、规划 13%、记忆 8%Islam et al., arXiv:2601.15232
⑤最大的可靠性跃升来自 Harness,不是 ContextCognition/Devin 的「context anxiety」:开启 1M token beta 但静默封顶 200K,焦虑消失——prompt 与 context 内容均未改动。LangChain 2026 年 3 月:coding agent 在 Terminal-Bench 2.0 从第 30 名升到第 5 名,底层模型完全没换,全部增益来自 harness(工具设计、执行沙箱、重试逻辑、验证回路)优化两家公司公开工程复盘
⚠️ 一个对判断很关键的数量事实:97% 的团队认同上下文工程重要,只有 4% 真正落地——24 倍的认知-执行鸿沟。同时 Redis、DataHub、Cloudflare 几乎同期入场上下文工程,意味着这条赛道正被云厂商快速 commodity 化,独立框架的窗口期在收窄。
反证
反方的核心不是「Context 不重要」,而是:上下文工程作为一项能力正在被云厂商商品化,因此它本身很难成为护城河。真正稀缺的是两样东西——别人拿不到的专有数据,和别人抄不走的 Harness 工程纪律。
来源:Anthropic 技术说明;Liu et al. TACL 2024;arXiv:2601.15232;Atlan 基准;Cognition/LangChain 公开复盘13
14 · Context · 分层判断

Context 必须拆成三层来判断,因为其中只有一层具备资产累积性、真正构成护城河

把正反双方放在一起,矛盾其实来自「Context」这个词被当成一件事。它是三件事,竞争属性完全不同。
层级是什么竞争属性会不会被商品化结论
L1 · 上下文技术长窗口、KV Cache、检索重排、压缩、记忆管理、prompt caching纯工程能力,有公开论文与开源实现正在被商品化——阿里云、Redis、DataHub、Cloudflare 同期入场不是护城河
L2 · 上下文工程纪律WRITE/SELECT/COMPRESS/ISOLATE 四操作的执行质量;与 Harness 的协同组织能力,可复制但复制成本高、需要持续投入难以商品化,但也难以形成排他性短期差异化
L3 · 专有上下文资产只有你有、别人拿不到、且随时间增值的业务上下文:客户历史决策、行业术语体系、失败案例库、特定场景的验收标准数据资产,具备时间累积性与排他性不可商品化——云厂商能卖你工具,卖不了你的历史真护城河
41% → 73%
仅应用四操作(WRITE/SELECT/COMPRESS/ISOLATE),同模型无微调的任务成功率变化
-52% / +2.6%
JetBrains 在 250+ turn 轨迹上做 observation masking:成本降、解题率升
第30 → 第5
LangChain 仅优化 Harness、不换模型的榜单位次变化
注意 L2 与 L3 的关系:L2 决定你能多快把 L3 变现,L3 决定你的天花板在哪。只做 L2 会被同行追平;只有 L3 而没有 L2,资产会烂在库里调不出来。
SO WHAT
直接回答大白的问题:Context 对 AI 极其重要,但它本身不是核心竞争力——「专有上下文资产 × Harness 工程纪律」才是。Context 的特殊性在于,它是 Model/Harness/Context 三层里唯一具备资产累积性的那一层,所以值得当作长期资产建设,但不能当作技术壁垒来指望。
来源:本报告基于 Part Ⅱ 正反证据的综合判断;效能数字引自 JetBrains 2025、LangChain 2026 公开复盘14
15 · Context · 决策表

不同角色该投 Context 的哪一层,答案完全不同——按这张表决策而不是按热度跟进

角色该投的层不该做的事判断依据
云厂商/基础模型公司L1 为主:把上下文技术做成标准件(这正是阿里云 Context Engine 的定位)不要承诺替客户构建 L3——那是客户自己的资产,厂商无法代持L1 有规模效应,能摊薄到所有客户
企业 IT/数字化部门L3 为主,L2 为辅:先盘清哪些上下文是本企业独有且在增值的,再建装配管道⚠️ 不要先买工具后找数据。也不要把「把所有文档灌进知识库」当成建 Context古茗案例的关键不是接了飞书,而是把散落信息重组为「门店运营知识空间」这个结构
FDE/解决方案交付方L2 为核心竞争力:把上下文装配与 Harness 工程做成可复用方法论不要卖「我们有更好的模型」——模型在趋同,这个说法两个季度就失效LangChain 第30→第5 证明:同模型下 Harness 差距可以是数量级的
内容/传媒公司L3:把审美判断、事实边界、行业术语、失败案例沉淀成可复用上下文不要把预算全押在「用哪家视频模型」上——模型会换,判断标准不会陆川案例中人机分工的分界线正是:人管问题意识、核心表达、审美判断与事实边界
医疗机构/医疗 AIL3:真实世界临床数据 + 报告文本的配对关系不要重复投「一病一模」——DAMO RADAR 已经开源了通用路径DAMO RADAR 的技术突破核心正是影像与报告文本的器官级对齐,无需额外人工标注
这张表的使用方式:先定位自己的角色,只看那一行;跨行照搬会导致投错层。最常见的错误是企业 IT 部门去做 L1(自研上下文中间件),三个季度后被云厂商标准件淘汰。
自检
一条可以立即执行的自检:问「如果换掉我们现在用的所有模型和工具,还剩下什么?」剩下的那部分就是你真正的 Context 资产。如果答案是「什么都不剩」,那当前投入的全是 L1,需要立刻调整。
来源:本报告综合判断;案例引自云栖大会公开发布与第三方工程复盘15

文化传媒行业

从模型跑分到产业交付:生产级基准线已被划出
Part Ⅲ16
17 · 文化传媒 · 结构变化

传媒行业今年真正的变化,是评价 AI 视频的尺子从「效果惊艳」换成了「能否进生产」

这个转变有明确的证据:企业客户的反馈关键词已经不是「像不像真的」,而是出片稳定性、综合成本、API 服务、工作流适配。对阿里视频模型,客户反复提到的三个词是「稳定、真实、有质感」。
评价维度旧尺子(2024–2025)新尺子(2026 · 生产级基准线)
模型能力单条 demo 的视觉惊艳度Artificial Analysis 等榜单的持续位次——Wan3.0 拿下文生视频与视频编辑双榜第一,4 款模型进入文生视频全球前十
可交付性能不能生成出片稳定率:同一提示词多次生成的一致性,决定能否排进制作周期
成本Token 单价可计算的成片成本:从脚本到成片的全流程折算,而非单次调用价格
工程集成有没有 APIAPI 服务等级 + 工作流适配:能否插进现有剪辑、审核、分发链路
能力边界分辨率/时长单次 30 秒生成、结构化输入(文档/表格/网页)、原生音画同步
已规模化的产业场景
短剧、广告、电商、文旅、音乐 MV
合作企业已披露:井英科技、巨日禄、LibTV、Flova AI、Pollo.ai、筷子科技。万相系列走开源路线,压低了中小企业接入门槛,这是阿里在这条赛道与闭源对手的关键差异。
竞争格局(需清醒看待)
这是大模型竞争最激烈的落地赛道之一
海外:OpenAI Sora、Google Veo 持续迭代。国内:快手可灵、字节即梦、MiniMax 海螺密集上新。导演侧也已分流——贾樟柯此前已与 Seedance 2.0 合作,陆川这次选择阿里。⚠️ 榜单位次在这条赛道的半衰期很短,不宜作为长期选型依据。
SO WHAT
对传媒行业客户,选型话术应当调整:不要问「哪家模型效果最好」,要问「哪家能把成片成本算清楚、并保证排期内的出片稳定率」。前者每季度换答案,后者才是能签合同的东西。
来源:红星新闻、杭州市政府门户、浙江日报报道;Artificial Analysis 榜单;阿里视频生成模型官方披露17
18 · 文化传媒 · 案例解剖

陆川案例的价值不在于「5 天完成」,而在于它第一次画出了人机分工的准确边界

5 天
《历史·现场》全片完成周期;传统方式复原明代北京城+宫廷+大规模爆炸需数月
19 天 → 约4轮
爆炸场景:传统实拍需 19 天,本次约四轮提示词优化
95%+
模型对爆炸烟尘、碎片画面的呈现达到导演预期的准确度
>50%
视频生成环节中模型的参与度与贡献度占比
人机分工的准确边界(可直接复用)
人管问题意识与事实边界,AI 管素材拓展与执行效率
  • 史料阶段:人先确定研究方向,AI 协助搜集材料(《酌中志》《天爵堂文集》《天变邸抄》)
  • 制作阶段:导演把控镜头方向、画面质感与整体调性,AI 负责实现意图
  • 主题阶段:AI 作为对话者帮助梳理问题
  • 归纳:人负责问题意识、核心表达、审美判断与事实边界;AI 负责拓展素材、具象想象、提高执行效率
导演本人指出的真实缺陷
通用模型训练数据来自既有古装影视作品,生成画面带「古装剧感」,缺少真实历史应有的「陌生感」
这是一条非常专业的批评,也指出了下一步方向:阿里视频模型技术负责人回应将与更多导演、行业专家及历史学者合作,为模型引入更全面、更严谨的专业信息,并持续加强 Agentic Video 能力。

⚠️ 仍待解的三个课题:长镜头一致性、复杂场景的物理准确性、AI 复原历史如何守住事实边界。第三条对做历史、新闻、纪实类内容的机构尤其关键。
题材:1626 年明代「王恭厂之变」,成因至今成谜。短片以三位真实史料记载的亲历者视角展开——爆炸中心幸存的火药匠役吴二、宫内宦官刘若愚、民间文人薛冈。陆川同时通过编程、模型后训练等方式深入参与创作,这也是双方合作被称为「双向选择」的原因。
SO WHAT
这个案例最该被内部引用的一句话是陆川的定性:「AI 不是已有景观的摄影者,而是未知景观的创造者」。但配套要引用他的批评——通用模型会把训练数据里的「影视感」带进来,这意味着做严肃内容必须自建专业上下文(L3),不能直接用通用模型交付。
来源:红星新闻、杭州市政府门户、新华网浙江、浙江日报对陆川及阿里技术负责人的报道18
19 · 文化传媒 · 行动建议

传媒行业的护城河正在从产能转向判断力,预算应当相应重新分配

优先级行动项为什么现在做可验证的完成标准
P0建立本机构的专业上下文库(L3):审美标准、事实边界规则、行业术语体系、失败案例陆川指出通用模型带「影视感」缺「陌生感」——这个缺口只能靠专有上下文补,且换模型不影响其价值能用同一套上下文,在两家不同厂商的模型上产出风格一致的成片
P0把「成片成本」做成可计算模型:从脚本到成片全流程折算,而非单次调用单价这是客户的新尺子,也是唯一能进合同的口径。模型榜单位次半衰期太短能对任一题材给出成本区间与出片稳定率两个数字
P1等 11 月下一代视频模型发布后再做长内容技术选型郑波已明确预告:更长、更可控、更完整、更智能,具备导演级创作思维,从单镜头到理解完整叙事。当前长镜头一致性仍是待解课题完成一次 A/B:同一叙事在新旧模型上的镜头一致性对比
P1按「原生全模态统一模型三年内出现」做架构预留,不要把图像/视频/音乐/配音管道写死郑波判断三年内出现原生一体化模型,届时多模型拼接的管道会成为技术债管道层做到可替换:更换任一模态的后端不影响上游编排
P2事实边界治理:为纪实、历史、新闻类内容建立 AI 生成物的标注与审核规则「AI 复原历史如何守住事实边界」是官方承认的未解课题,也是合规风险最高的一处有书面规则,且能对任一成片追溯哪些镜头为 AI 生成
不建议做的事:①不要把预算主要押在「选哪家模型」——模型在趋同且换代极快;②不要用榜单位次向客户承诺效果,客户已经不看这个了;③不要跳过成本模型直接进生产,出片稳定率不达标会击穿排期。
SO WHAT
一句话总结传媒行业的判断:当生成成本趋近于零,唯一还稀缺的是「知道该做什么」和「知道做出来对不对」。这两件事都属于 L3 专有上下文,也是预算应当转移过去的方向。
来源:本报告基于郑波演讲、陆川案例与产业客户反馈的综合建议19

医疗行业

DAMO RADAR 把医疗影像 AI 从「一病一模」推进到通用模型范式
Part Ⅳ20
21 · 医疗 · 范式转变

DAMO RADAR 是范式级变化而非指标级改进,因为它证明了通用模型路线在医疗影像上成立

9 月 18 日登上 Science 并正式开源(模型、核心代码、全套技术框架)。阿里达摩院与浙江大学医学院附属第一医院等机构联合研发。这是理解今年云栖医疗线的前置事件——它比任何产品发布都更重要。
维度传统「一病一模」路线DAMO RADAR 通用模型路线
覆盖范围一个模型针对一种疾病的特定场景一次识别 146 种病症、覆盖 18 个器官(含各类恶性肿瘤)
训练依赖依赖大量人工标注,成本高、耗时长无需额外人工标注:直接学习影像与诊断报告文本的内在关联
核心技术监督学习 + 专病特征工程视觉-语言学习 + 国际首创「器官级细粒度对齐」:把 CT 三维数据拆解为独立解剖单元,在器官层面精准对齐影像与报告文本,再用自适应对比建模动态调整
研发周期立项到落地发布往往需 2–3 年技术范式可迁移至其他医疗影像领域,不必逐病重来
泛化能力换一类题目便无从下手(「善攻个别题型的学生」)面对初始训练之外的急诊场景仍有高性能:急腹症 AUC 0.904
146 种 / 18 个器官
单模型一次可识别的病症数与覆盖器官数
已全面开源
模型、核心代码与全套技术框架,可独立复核
5 篇《自然·医学》
达摩院过去三年医疗 AI 顶刊成果,另有 10 多篇其他顶级期刊
为什么选腹部 CT 作为突破口:它被业内视为「最难读的 CT」——一份报告需覆盖消化、泌尿等多个系统的数十个器官,腹部器官多为软组织、密度相近、病灶识别难度极高。浙大一院放射科主任肖文波(30+ 年从业)称,腹部影像组是年轻医生最怕进的科室组别,即便中高级医生完成一份报告也需 20 分钟至半小时。
SO WHAT
这一页的战略含义:医疗影像 AI 的「一病一模」商业模式面临根本性挑战。当通用模型开源且达到专家水平,单病种模型的护城河(标注数据 + 专病特征)大幅贬值。做医疗 AI 的团队需要重新评估在研管线的价值。
来源:Science 2026-09-18 发表论文;上海证券报、光明网、中新社、杭州市政府门户报道21
22 · 医疗 · 证据强度

这组数字的可信度显著高于全场其他指标,因为它经过同行评审与人机对照双重验证

0.913
近 4 万例真实世界检查的平均 AUC(146 种病症)
23 / 26
人机对比中平均准确率超过的放射科医生人数(来自 14 家医院)
+10%
AI 辅助下医生识别疾病的敏感性提升(防漏诊能力)
-30.7%
AI 辅助下阅片耗时缩短幅度
证据项内容证据强度说明
同行评审登上 Science,2026-09-18 发表最高顶级期刊同行评审,区别于厂商自述
样本规模近 4 万例连续临床病例,146 种病症,18 个器官「连续临床病例」而非筛选样本,更接近真实分布
人机对照14 家医院 26 名影像科医生参与对比试验多中心、多医生,平均准确率超过其中 23 名
临床增益敏感性 +10%、阅片耗时 -30.7%,并使低年资医生达到高年资医生诊断水平这是最具落地价值的一条——直接指向基层医院
泛化验证训练外的急诊场景(急腹症)AUC 仍达 0.904中高单一外部场景,尚非广泛外部验证
可复现性模型、核心代码、全套技术框架已全面开源最高可独立复核,是与闭源方案的根本差异
二次验证肖文波称经过第二轮临床验证,效果依旧稳定出色待披露⚠️ 第二轮验证的样本与口径未公开,暂不宜引用具体数字
团队背景:达摩院长期投入医疗 AI,已突破胰腺癌、胃癌、肠癌等消化系统肿瘤筛查及主动脉夹层预警,过去三年发表 5 篇《自然·医学》及 10 多篇其他顶级期刊论文。这不是一次性成果。
口径
这是全场唯一一组可以直接进决策模型的数字——有同行评审、有多中心人机对照、有开源可复核。与之形成对照的是 Part Ⅰ 中那些「厂商自述」效能数字,两类证据在对外材料中必须分栏,不可混用。
来源:Science 2026-09-18;浙大一院肖文波、达摩院张建鹏/张灵公开表述;多家权威媒体交叉核对22
23 · 医疗 · 落地与约束

技术已达专家水平,但真正的瓶颈在基层落地路径与政策窗口,而不在模型能力

最高价值的落地方向
基层医院,而不是三甲
肖文波的原话给出了明确指向:「基层医院阅片量有限、医生临床经验相对不足,腹部 CT 阅片难度更大。希望这款 AI 能尽快落地基层,助力一线临床诊断。」结合论文中「使低年资医生达到高年资医生诊断水平」这一结论,价值最大的场景是医生经验最薄弱的地方,而非资源最充足的地方。这与常见的「先打三甲标杆再下沉」路径正好相反。
政策窗口
十部门《医药工业发展「十五五」规划》同期发布
  • 到 2030 年生物医药产业加速成为国家新兴支柱产业
  • 创新药产业规模增速年均 20% 以上
  • 全球年销售额超 10 亿美元的品种数量达5 个以上
  • 另:萧山展区设有国家人工智能应用中试基地(医疗)·浙江——这是值得关注的政策载体
⚠️ 注意:这份规划针对医药工业,与影像 AI 不直接对应,不要把两者的政策利好合并计算。
设备端
算力正在下沉到桌面级,部署门槛显著降低联众医疗展出影像多模态大模型方案:基于 NVIDIA DGX Spark(1.2kg 桌面级轻量化算力)+阿里云智算 OS,支持行业专属模型一键部署、影像快速调阅、智能路由,适配基层到三甲全场景。这解决的正是基层医院没有机房的现实问题。
监测端
非接触式生命体征监测走向「无感」浙江元贝贝:垂直专科模型+医疗大数据双向闭环,非接触式智能睡眠监测系统置于床垫之下,自研微态零感光纤传感技术捕捉微米级心跳/呼吸振动,非接触、非穿戴、非侵入,识别呼吸与心率异常并触发报警。
企业端
医药企业开始从「用 AI 工具」转向「组织级接入」国邦医药集团与阿里云达成战略合作,方向为组织变革、营销与供应链、AI 赋能研发;同时宣布接入千问办公。这是本届大会医疗侧唯一一家公开签约的上市医药企业。
⚠️ 必须标注的空白:本届大会没有公开披露医疗影像 AI 的收费模式、医院采购路径或医保支付衔接。技术成熟度与商业化成熟度之间仍有明确断层,这是评估医疗 AI 项目时最需要独立尽调的部分。
瓶颈
医疗行业的判断:模型能力已经不是瓶颈,瓶颈在支付方与准入。DAMO RADAR 开源后,任何团队都能拿到专家级通用影像模型,因此竞争会迅速转移到基层渠道能力、医院工作流嵌入深度、以及支付路径设计——这三件事都属于 L3 专有资产。
来源:肖文波公开表述;十部门《医药工业发展「十五五」规划》;联众医疗、元贝贝展台资料;证券时报23
24 · 总结

三句话收口:需求侧尚未被财务验证,Context 值得投但只投第三层,两个行业的瓶颈都已转移

01
关于云栖叙事:把「愿景数字」与「可核验数字」严格分栏,只让后者进决策模型
愿景侧:1000 倍思考量、99.9% 替代率、50% 工作流渗透率、20GW 数据中心——用于判断方向,不用于任何测算。可核验侧:AA 榜 40→45、Qwen 30 亿下载、真武 M890 已服务 650+ 客户、AI 云收入 484.37 亿(+45% YoY)、DAMO RADAR AUC 0.913。最大的未披露项是「AI 相关产品收入 123.76 亿」的构成拆分,它决定 Token 生意的真实规模。
02
关于 Context:极其重要,但它不是核心竞争力——「专有上下文资产 × Harness 工程纪律」才是
Context 值得当长期资产建设,因为它是 Model/Harness/Context 三层中唯一具备资产累积性的那一层。但 L1 上下文技术正在被云厂商商品化(阿里云、Redis、DataHub、Cloudflare 同期入场),不构成壁垒。反方最有力的证据是 LangChain 的 第30名→第5名,模型完全没换——最大的可靠性跃升来自 Harness,不是 Context 的量。
03
关于文化传媒:护城河从产能转向判断力,预算应随之迁移
生成成本趋近于零之后,稀缺的是「知道该做什么」与「知道做出来对不对」。陆川案例已划出人机分界:人管问题意识、核心表达、审美判断与事实边界。行动上:P0 建专业上下文库+做成片成本模型;11 月新视频模型发布后再定长内容技术选型;为纪实类内容建立 AI 生成物的事实边界治理规则。
04
关于医疗:模型能力不再是瓶颈,竞争转向基层渠道、工作流嵌入与支付路径
DAMO RADAR 上 Science 并完全开源(模型+代码+框架),意味着专家级通用影像模型不再稀缺,「一病一模」在研管线需重估价值。最高价值落地方向是基层而非三甲(因为增益来自补足经验不足)。⚠️ 本届大会未披露任何收费模式、医院采购路径与医保支付衔接——这是必须独立尽调的断层。
后续可追踪的三个观察点:①分论坛材料中是否出现 AI 收入的更细口径;②11 月下一代视频模型的实际长镜头一致性表现;③DAMO RADAR 开源后首批基层医院部署案例与付费方式。
SO WHAT
如果要给一条最短的行动指令:停止把预算押在「选哪个模型」,转向建设换掉任何模型都不会失效的那部分资产。在传媒是审美与事实标准,在医疗是渠道与工作流,在企业内部是业务上下文——这三者都只能自己攒,攒的时间就是护城河的宽度。
来源:本报告全部前述证据的综合收口;分析日期 2026-09-2224