云计算·大数据 频道

Agent Native Cloud,让阿里云站上云原生架构的下一个十年起点

  云原生这个概念已经很久没人提了,最早人们认为这只是云大厂的一种营销话术。但Agent Infra概念火了以后,让二者发生了化学反应。云原生+Agent Infra= Agent Native Cloud,这可能是我们对阿里云云原生这个最新产品的直接理解!

  在上海WAIC期间,阿里云发布了Agent Native Cloud,如何理解这一产品的最新能力升级?显然,不只是云原生与Agent Infra这两个概念的简单相加,而是对云上基础设施在新应用环境下的重构!

  由IT168&IT1PUB最新推出的《Agent Infra变革进行时,企业级智能体规模化落地的“基础设施之战”》选题,将以系列文章的方式,陆续推出原创内容。本期,我们将从阿里云视角分析下AI云原生范式下的Agent Infra,如何实现“共生自进化”!

  在了解Agent Native Cloud到底是怎样一款产品时,我们先看看阿里云为什么要发布这样一款产品?

  当Agent开发全面转向云端

  就像传统应用开发的发展脉络一样。最初,企业部署Agent更愿意部署在本地,觉得本地电脑会让Agent更安全、更可控。

  但现在,用户的思路变了,本地电脑只能跑2-3个Agent,但在云端这个数字可以轻松扩展到5个、10个,甚至是20个。

  以AI编程编排工具Conductor为例,这家企业的CEO在X上发布了一条推文,未来几周内,公司将把重心全面转向云Agent,并强调这是一次堵上公司全部身价的战略转型。

  这家靠“本地体验”起家的公司,之所以放弃原有的根据地,是因为开发者们发现:单个AI编程Agent已经不够用了,如果让Claude Code改一个文件,虽然它改得不错。但如果你想同时做五个功能、修三个Bug、重构一个模块,排着队等一个Agent完成,效率就回到了原点。

  虽然,本地也可以部署多个Agent,但协作效率差,给人的感觉是:像有8只手,各干个的。同时,每只手都在消耗你的本地空间。风扇狂转,CPU飙升,内存吃紧……更致命的是,一旦你合上电脑,所有Agent全部停摆。你只能守在屏幕前,像看着一锅粥,不能离人。

  所以,需要强调的一点是,阿里云发布Agent Native Cloud,不是临时起意,而是刚好踩在用户的痛点上。

  Agent可控、可复用、可协作、会进化的平台架构

  问题是,满足Agent需要的云上开发环境到底长什么样?从"传统云原生"到"Agent原生云"到底变了什么?

  阿里云云原生应用平台负责人周琦有一句话,说到了点上。他说:“下一轮竞争,比的不是谁拥有更多Agent,而是谁能把Agents变成可控、可复用、可协作、会进化的组织资产。”

  如何实现这一目标?阿里云Agent Native Cloud,围绕 Agent 生命周期,打造了可靠运行环境的Agent infra和Platform。

  要知道,Agent Infra不是单一产品,而是一套完整的基础设施技术栈,完整的架构图如下:

  其中,AgentRun是为 Agent 而生的运行时。它从根本上解决了Agent部署的“毛坯房”问题,一个Agent可以"随时唤醒→执行任务→保存状态→缩容到0",长会话成本直降70%;AgentLoop,让 Agent 不再是黑盒,通过全栈可观测引擎可以快速解决Agent执行出错这个问题,用户可以基于 OpenTelemetry Trace,实现从用户请求→模型调用→工具执行的全链路追踪。

  听起来很美好,那阿里云是怎么通过上述能力实现Agent的全生命期管理的呢?从整个平台能力来看,最新升级的Agent Native Cloud,在基础设施层为Agent场景量身打造了具备MicroVM/VM级强隔离能力的Sandbox环境,不仅支持会话缩容至零以显著降低长时运行成本,更具备应对高并发需求的极致弹性。

  在此基础上,阿里云推出了全生命周期的Agent Platform,由高代码构建平台AgentRun、多智能体治理协作平台AgentTeams及观测与优化平台AgentLoop三大核心组成,并辅以Identity、Gateway、Policy等关键模块,全面覆盖从构建、运行到治理、评估的完整链路;配合智能运维平台STAROps,更推动运维模式从被动告警响应向主动的AgenticOps演进。

  依托Agent Native Cloud,阿里云在AgentScope、Higress等开源项目中落地实践,利用AgentTeams组建研发、客服及数据分析团队,通过Team Leader Agent调度Worker Agent高效执行,并借助AgentLoop持续采集真实轨迹与量化评估驱动智能体进化。这一体系成功实现了15个Agent的7×24小时全天候服务,承担了85%的答疑工作,使运营支持时长大幅降低90%,版本发布周期缩短至1天。

  可观测性,是Agent从黑盒到白盒的关键“一跃”

  Agent要想从实验室走进生产环境,有一个关键问题,就是可观测性。

  如今,Agent已是一个能自主决策的超级智能体,但越聪明越难管。首先,多智能体的协作让调用关系变成一张网,传统监控环境跟不上,使得监测成为盲盒;其次,性能和故障难以定位,找不到慢请求的卡点;其三,安全攻击面扩大,提示词的注入越权的调用,加大了隐私数据泄露的风险。

  如何让黑盒变成白盒?阿里云还推出了云监控2.0方案,借助CMS2.0这个agent可观测的能力,可以让agent的推理过程全链路可追踪。用户需要把完整的数据拿到手,在这些数据之上,再用全域智能运维平台STAROps做更聪明的诊断分析、安全审计和成本优化。

  阿里云云监控 CMS 2.0 将此前独立的云监控 CMS、日志服务 SLS、应用实时监控服务 ARMS 整合为一站式统一可观测平台,以 UModel 数据模型为核心,打通指标、日志与链路数据,显著降低运维复杂度,也为上层 Agent 提供了统一、可推理的数据底座。

  STAROps提供 RAM 权限控制、高风险操作人工确认、Agent 行为审计与端到端加密等企业级保障。基于 STAROps ,企业可根据需求构建专属 SRE Agent,并配置职责、权限与技能,使其自主调度运维操作、独立完成任务;同时, STAROps 本身就是一套运行在阿里云基础设施之上的 Agent,通过统一编排承接复杂的跨域运维作业。企业既可以通过 OpenAPI 与 MCP 将 STAROps 无缝接入现有工作流、快速获得 AI 提效,也能以此加速向 Agent Native 的智能运维模式升级。

  写在最后

  Agent开发从本地走向云端,带动了云基础设施的深化发展。而阿里云围绕Agent Infra的最新部署,标志着云原生架构迎来了它的下一个十年起点。在这个新起点上,云不再仅仅是算力和存储的容器,而是成为了智能体生长、协作与进化的土壤。

  从这个角度来看,Agent Native Cloud的最新升级,并不是凭空出现,而是阿里云对时代趋势的精准回应。它没有停留在概念层面的炒作,而是用AgentRun、AgentTeams、AgentLoop以及STAROps这一整套“组合拳”,实实在在地解决了Agent在落地过程中面临的运行成本、协作效率、可观测性以及安全治理等核心难题。

  Agent Native Cloud不仅定义了AI时代基础设施的新标准,更向我们展示了一个清晰的未来:当云与Agent真正融为一体,企业数字化转型的天花板将被彻底打破,一个由智能体驱动的高效、自治、进化的新商业时代,正由此拉开序幕。

0
相关文章