返回资讯中心
外部精选
ai-models
#AI 落地#产业观察#业界

阿里云加速构建Agentic Cloud:推出AgentCore、新一代CPFS等重磅新品

9月22日,2026杭州云栖大会上,阿里云CTO李飞飞系统性阐述了Agentic Cloud 战略布局,阿里云将Model、Harness、Context作为核心构建场景,推出全新的云上算力底座和Agent 构建治理平台AgentCore、Agent Sandbox、新一代高性能存储CPFS等一系列新品,让 AI 真正进入生产流程、走向规模化价值创造。 随着2026年Agent的爆发式增长,越来越多的智能体正跨过“问答型”的分水岭,进…

雷峰网7 分钟阅读中文

以下正文同步自 雷峰网,版权归原站所有,已转换为易读排版。

9月22日,2026杭州云栖大会上,阿里云CTO李飞飞系统性阐述了Agentic Cloud 战略布局,阿里云将Model、Harness、Context作为核心构建场景,推出全新的云上算力底座和Agent 构建治理平台AgentCore、Agent Sandbox、新一代高性能存储CPFS等一系列新品,让 AI 真正进入生产流程、走向规模化价值创造。

随着2026年Agent的爆发式增长,越来越多的智能体正跨过“问答型”的分水岭,进入自主规划、实时决策阶段,这对算力和云提出了更高的要求。李飞飞认为,企业级 Agent 的大规模落地还需要这些能力:以全面、统一、持续更新的上下文形成全域认知;支持自主运行与持续进化;融入安全、控制、信任和身份认证,实现人与 Agent、Agent 之间的可信协作;从静态规则走向实时感知、动态推理和自主行动。

围绕这四大能力支柱,阿里云重构了从 AI Native Cloud、 Agent Native Cloud到 Context Engine 的完整技术栈体系。

AI Native Cloud:挑战 RSI 的算力底座

当下模型尺寸正面临从万亿到十万亿参数的跃迁,训练范式也从预训练、后训练 Agentic RL 进一步走向以递归式自我改进RSI,这要求云底座同时解决超大规模集群稳定性、毫秒级弹性、百万级并发,以及训练、推理和环境交付的统一协同。

阿里云在会上展示了全栈自研的算力底座,覆盖计算、存储、网络等多个产品线,应对RSI带来的挑战。以灵骏真武M890超节点为例,这是首个国产十万卡超节点集群,有力支撑了Qwen3.8 Max、KIMI K3等超2T参数大模型对外提供商业服务。即将在明年推出灵骏真武V900超节点,性能提升三倍,搭载业界首发200Pbps通信带宽,6us时延集群架构,自研SNPO支持全光互联,支持千卡Scale-Up互连,单集群可扩展至 50 万卡规模,向广域超节点演进。

同时,阿里云还推出了新一代全栈自研高性能存储CPFS,提供高达百TB/s级吞吐和亿级IOPS,单文件系统规模提升5倍至100PiB,支撑大规模模型训练和多模态数据处理。在实际模型训练中,可将模型启动平均耗时降低50%、峰值算力利用率提升30%、AI存储成本降低69%,使GPU从“等待数据”转向持续高效计算。

推理方面,面对容量激增的KVCache和多轮任务的普及,阿里云围绕Token生产和缓存调用进行极致的优化,推出大模型KVCache管理和调度系统Tair KVCM,统一编排 Mempool、KVCacheStore 与远端共享存储等多级缓存,存有效命中率可达 99%,每token成本下降50%;推出存储加速引擎KV CacheStore,位于G3.5存储层,承接长上下文、多轮对话和复杂Agent任务产生的大量缓存,满足千亿级KV存储规模,在客户生产环境下实现缓存覆盖时间窗口扩大 900%,吞吐提升 20%,首 token 延迟降低 54%;全新的智算中心融合网络TPN,采用2层网络设计,访问带宽增加 2.5 倍,网络规模增加10倍,延时降低 1/3……这些围绕“算网存”多方协同的技术创新,为模型推理。

此外,人工智能平台PAI新增支持异步AgenticRL的训练框架,打通轨迹采样、回报累计、模型训练、参数更新的环路。在支持Qwen模型后训练的实战中,实现5天完成一次SOTA模型的后训练。

Agent Native Cloud:支撑 Agent 应用规模化落地

随着Harness工程和skill的成熟与普及,大模型竞争正从能力比拼转向业务价值兑现——能在真实的生产环境中精细化使用、具备智能组织和智能基础设施、不是概率智能而是可靠的生产力……这些正成为让 Agent 真正融入业务流程必须跨越的门槛。

为了更快让企业级客户与Harness深度协同,阿里云推出企业级Agent构建治理平台AgentCore,将企业级Agent基础设施标准化、托管化,支持长任务、失败重试、断点恢复和异步执行;提供安全执行环境、资源隔离、身份权限和全链路审计,统一管理模型、MCP Server、Skill 等资产,可提升任务完成率99%,TCO成本降低70%。

此外,阿里云还准备了一系列Agent相关产品,为企业级客户提供丰富的选择:包括Agent Sandbox,为 Agent 提供开箱即用、极致弹性、安全可靠的执行环境,创建吞吐10万/分钟,深休眠唤醒<600ms,兼容 E2B 和 K8s,满足从开发者到企业级 Agent 的规模化运行需求;Agentic OS,Agent 原生操作系统,可节省Token消耗30%以上,沙箱部署密度提升 3 倍;Agentic Computer,为智能体提供统一、长期在线的专属云电脑工位,兼容主流 Agent 框架,具备 Computer Use 和 GUI 操作能力,权限可控、操作可审计……

Context Engine:让企业全域数据成为 Agent 的实时上下文

决定Agent能力上限的不只是模型参数,还包括能否持续理解企业知识、业务状态和执行反馈,因此上下文不再是应用侧的一段缓存,而正在成为企业需要统一建设和治理的新型数据资产。

围绕这一变化,阿里云提出了“存储—计算处理—上下文工程”三位一体的引擎——Context Engine ,将企业全域数据转化为实时上下文,让 Agent 从“知道什么”进一步走向“此刻应该做什么”:底层以多模态数据存储承接对话、视频帧、点云、轨迹和 Agent 反馈;中间层覆盖数据集成、转换、治理、质量和建模;上层通过全域知识库、多模态语义整合、持续记忆管理和实时上下文装配,把分散数据组织成 Agent 可以按需调用、动态更新的上下文。

产品层面,Agent Context 面向复杂知识检索,将准确率提升 50 个百分点,Token使用效率提升3倍以上;OpenLake 提供统一全模态数据湖仓,通过一份数据支持多引擎计算,使总体拥有成本降低 38%;Apsara Lakebase 支持亚秒级、零拷贝创建数据分支,为 Agent 提供快速、隔离的数据空间;MC-MaxFrame 以自研分布式计算框架处理多模态数据,计算性能提升 12%;Flink Streaming Agent 提供 60 多种全模态算子,把实时数据流转化为可触发业务流程的实时行动。

从面向 Model 的模型生产,到面向 Harness 的自主运行与持续进化,再到面向 Context 的实时智能决策,阿里云正在把算力、网络、存储、运行环境、身份安全和企业数据组织成统一的 Agentic Cloud。“阿里云已形成从 AI 芯片、服务器 CPU,到互联、网卡、存储主控和 AI 软件栈的完整布局,可以从计算、网络到存储做全栈协同和联合调优,把智能生产效率做到更高。”李飞飞表示。

正文由 FLUX 从来源站点 RSS 同步,内容未经改写;遇到排版缺失或需要图片、视频时请以原文为准。