一句话结论
千问AI平台新增Agent服务与行业AI解决方案,助力阿里算力向2032年20GW迈进。
关键要点
- 平台上线Agent Studio,提供24小时托管运行、50多个原子API及自动模型路由能力。
- 模型弹性启动时间从1200秒压缩至70秒,首Token延迟降低38%,支持百万级并发调度。
- API优速模式可将TPS提升1.5至2倍,Token Plan一份订阅即可调用多款主流模型。
- 阿里预计2032年算力规模超20GW,覆盖芯片到应用全栈,加速Agent产业进化。
背景与事实
2026年9月22日,在2026云栖大会MaaS & Agent技术主论坛上,阿里巴巴集团战略副总裁、ATH事业群MaaS业务线总裁文征宣布千问AI平台全面升级。此次升级以推动Agent进入生产为核心,在原有模型服务基础上新增Agent服务与行业AI解决方案,涵盖模型供给、生产运行、Agent构建与托管的完整体系。文征指出,过去一年阿里云MaaS平台服务的客户数增长六倍,随着订单、代码、内容和业务流程主动发起调用,Agent正进入企业核心流程,企业需求已从单一模型API转向智能交付结果。面对持续放大的需求,阿里坚定投入全栈AI,预计到2032年,阿里云运营的算力规模将超过20GW,支撑从芯片、AI基础设施到千问大模型、Agent工具和AI原生应用的完整体系。
在模型服务层面,千问AI平台遵循“First and Best”原则支持全球一流自研和开放模型上线。针对Agent决策链路长、并发高、对时延敏感的特点,平台通过FlashBoot、UniScheduler等能力调度异构算力,将模型弹性启动时间由1200秒缩短至70秒,可在1分钟内拉起1万个Pods,首Token延迟降低38%,Prompt Caching成本最高节省95%。平台提供99.9%生产级SLA、十亿级单客户峰值TPM和CMaaS机密推理服务,支持监控、告警和成本治理。本次升级的API优速模式可将TPS提升1.5至2倍,用户切换model ID即可使用;吞吐预留新增夜间8小时预留规格,独占吞吐面向大型企业及金融、政企客户,支持定制模型部署与性能定制。Token Plan以一份订阅覆盖Qwen、Kimi、GLM、DeepSeek等多类模型,原生打通Qoder、Cursor、Codex、OpenClaw等主流编程工具与Agent框架,并可与千问App、千问办公共享抵扣。
在企业级全栈Agent服务平台Agent Studio方面,平台可根据任务自动路由选择模型,提供24小时不间断托管运行,支持企业内部知识数据和外部软件服务接入。在开发运行层面,提供50多个原子API覆盖运行环境、长期记忆、工具服务、会话请求和服务端点部署等能力,企业可按需组合并接入自身业务,全新的Agent API即将发布以实现一次请求完成多项配置。Agent Studio还将推出Agent自进化引擎,包含运行观测、AI评测器、AI优化器和自动验证等能力,支持在上下文交互中持续调优与进化。在生态服务方面,One Key MCP可用一个API Key连接100多项生态服务,包括高德、飞猪、1688及金融、法律等各领域服务,平台可自动理解需求、寻找工具并完成调用,减少开发者逐一注册和配置鉴权的工作。
在应用与行业落地方面,千问AI平台通过自身产品实践持续验证技术和体验。Meoo 1.0通过CLI和OpenAPI提供应用构建、部署及企业协作能力;伶鹊2.0服务20个行业、5000余家企业客户和超过10万个坐席;万镜一刻以Agent、创作工作台和技能广场服务视频生产,万小智3.0从建站延展至获客和经营,推动“Vibe Coding”走向“Vibe Business”。在行业与终端场景,泛海集团基于千问搭建工业AI平台和数控工艺Agent,沉淀工程师经验与零件案例;网易游戏与千问AI平台围绕游戏研发链路开展合作;荣耀基于Qwen Intelligence方案为荣耀YOYO智能体提供多模态理解、长链路任务规划等能力;比亚迪依托千问AI座舱解决方案打造座舱超级智能体,支持理解和执行模糊、多重指令。文征认为,平台的价值在于让更多应用生长出来,将模型服务、Agent服务、AI原生应用和行业实践连成体系,推动智能从通用能力走向产业生产力。相关模型服务和Agent能力已在千问AI平台上线,开发者可通过API完成产品集成或订阅Token Plan。
影响分析
对中文开发者而言,Agent Studio与Token Plan降低了企业级Agent构建与托管的门槛,统一订阅多款主流模型可显著简化采购与成本管控流程,尤其利好中小企业快速将智能能力嵌入核心业务。API优速模式与吞吐预留规格为高并发场景提供了更灵活的弹性算力选择,结合99.9%生产级SLA,可支撑金融、政企等对稳定性要求严苛的系统落地。从产业层面看,千问AI平台通过全栈能力覆盖从模型到应用的完整链路,加速Agent在工业、游戏、智能座舱等垂直领域的规模化渗透,推动行业从单点AI调用向结果交付型智能系统演进。
适用边界
上述结论与能力主要适用于面向Agent生产环境、企业级并发调度及多模型统一订阅的场景。对于纯学术研究、本地化部署或小规模个人调用,API优速模式的吞吐提升与Token Plan的跨模型订阅价值有限;对数据合规要求极高且无法接受外部托管的企业,CMaaS机密推理需结合具体数据驻留要求评估。此外,Agent自进化引擎与One Key MCP的生态服务覆盖范围以100多项合作服务为限,未接入的长尾工具仍需开发者手动配置,相关结论不适用于完全自主可控、无外部服务依赖的封闭环境。
孤本观察
基于来源事实,千问AI平台此次升级以“从调用到交付”为价值主线,将算力、模型、Agent工具与行业实践打包为全栈体系;判断其竞争壁垒不仅在于20GW算力规模的长期投入,更在于通过50多个原子API与One Key MCP将分散的企业知识、外部服务与模型能力串联为可自动编排的生产力闭环,而非单一模型性能的领先。
常见问题
千问AI平台升级后,模型弹性启动时间和首Token延迟有何具体改善?
模型弹性启动时间从1200秒压缩至70秒,首Token延迟降低38%。
Token Plan订阅可以调用哪些模型,并打通了哪些编程工具?
覆盖Qwen、Kimi、GLM、DeepSeek等模型,原生打通Qoder、Cursor、Codex、OpenClaw等工具。
阿里巴巴预计2032年算力规模目标是多少,覆盖哪些层级?
预计2032年算力规模超20GW,覆盖芯片、AI基础设施、千问大模型、Agent工具及AI原生应用。
Agent Studio提供了哪些API数量及运行支持能力?
提供50多个原子API,支持24小时不间断托管运行及企业内部知识与外部软件服务接入。
来源:量子位