一句话结论
AWS 推出新版 AgentCore 运行时,利用快照恢复与弹性内存分配技术,使 AI 智能体冷启动延迟稳定在约 2 秒,并改为按实际使用量计费。
关键要点
- 新运行时采用按需内存分配机制,会话结束后立即释放内存,取代原有的高水位追踪计费模式,消除峰值占用浪费。
- 基于快照技术优化冷启动,测试显示 200 MB 至 2 GB 镜像的 P75 冷启动延迟稳定在约 2 秒,远优于原运行时 5.4 秒至 30 秒的波动区间。
- 新增 x86 架构支持、基线定价选项及作用域身份功能,允许运行现有 x86 代理、为持续活跃会话预留资源,并为无人值守代理分配独立权限边界。
- 开发者需将 platformVersion 参数设置为 V2 以启用新运行时,相关示例与负载测试代码已发布在 AgentCore GitHub 示例仓库。
背景与事实
Amazon Web Services (AWS) 近日发布了 Amazon Bedrock AgentCore 的新一代运行时,旨在解决托管 AI 智能体在计算资源效率与启动速度上的核心痛点。该运行时提供一个完全托管的计算环境,允许开发者部署和运行 AI 智能体而无需维护底层基础设施。旧版运行时的主要问题在于其内存管理采用“高水位追踪”模式,即长运行或突发负载的智能体需持续支付基于历史峰值内存的费用,而非实际使用量;同时,冷启动延迟随容器镜像大小和并发度增加而显著恶化,特别是在突发流量下,初始化环境虽快,但拉取镜像和初始化的过程导致延迟不可预测。
新运行时通过两项核心技术创新解决了上述问题。首先是内存管理的重构:系统从小型高效内存配置启动,仅在负载需求增加时动态分配内存。这一机制基于对数十亿会话的分析优化,空闲内存会被及时回收,账单精确跟踪会话全生命周期的变化,实现真正的按实际使用量计费。其次是冷启动速度的提升,源自快照技术的应用。环境只需准备一次并生成快照,新实例可直接恢复该快照,从而无论镜像大小或并发量如何变化,启动延迟均保持在一个紧凑且可预测的范围内。
在性能验证方面,AWS 团队使用 Amazon EC2 实例上的 Python 客户端通过 boto3 SDK 进行了严格测试。测试场景为在 us-west-2 区域调用 us-east-1 区域的代理,且未建立 VPC 对等连接,模拟了跨区域的真实网络延迟环境。测试共发送 5,000 次冷调用,覆盖 5 种不同大小的镜像。数据结果显示,新运行时在 200 MB 至 2 GB 镜像范围内的 P75 冷启动延迟约为 2 秒;相比之下,原运行时的延迟从 5.4 秒起步,随着镜像增大最高接近 30 秒。这种稳定的低延迟特性使得新运行时不仅适用于交互式场景,也能高效支撑长期无监督运行的智能体,显著降低闲置成本并提高负载适应性。
除了性能优化,新运行时还扩展了功能边界,引入了五项新特性:支持基线定价选项,允许用户预留内存基线以支持突发流量,适合持续活跃会话;提供更大计算资源配额,扩展 RAM、vCPU 和会话存储上限;增加 x86 架构支持,使开发者能够运行现有的 x86 代理、工具或环境,降低迁移门槛;实现生命周期控制,支持暂停/恢复会话并序列化状态,增强任务管理的灵活性;以及作用域身份功能,为无人值守代理分配独立的权限边界,提升安全性。用户需将 platformVersion 参数设置为 V2 以启用这些新功能,更多技术细节与负载测试示例可在 AgentCore 开发者指南及 GitHub 示例仓库中查阅。
影响分析
对于中文开发者与企业从业者而言,这一更新意味着 AI 智能体部署的经济性与可靠性门槛大幅降低。分析认为,旧版“峰值计费”模式曾导致许多间歇性运行的智能体项目面临不可控的成本风险,尤其是那些仅在特定时段活跃的自动化代理。新运行时引入的“立即释放内存”机制直接消除了这部分闲置浪费,使得小团队或个人开发者也能以可预测的低成本实验长周期智能体任务。此外,冷启动延迟的稳定化(P75 约 2 秒)消除了突发流量下的服务抖动,这直接关系到用户体验的 SLA(服务等级协议)承诺,使得基于 AgentCore 构建的高并发在线服务更具商业可行性。x86 架构的加入则降低了现有遗留系统的迁移阻力,允许企业在不重写代码的情况下快速接入托管环境,加速 AI 落地进程。
适用边界
本结论主要适用于希望简化基础设施运维、追求成本可预测性及稳定低延迟启动的 AI 智能体部署场景。然而,对于拥有高度定制化网络拓扑或需要极端即时响应(亚毫秒级)的边缘计算场景,跨区域测试(us-west-2 调用 us-east-1)中的网络延迟可能仍需结合本地化部署策略进行评估。此外,若现有工作负载深度依赖旧版运行时的特定非标准行为或尚未适配 x86 架构的新特性限制,直接切换至 V2 平台版本可能需要额外的迁移适配工作。
孤本观察
这是一种典型的通过底层虚拟化快照技术换取上层应用一致性的工程权衡,它用预先生成的状态换取了运行时的确定性,实质上是将不确定性从“启动阶段”转移到了“构建阶段”。
常见问题
新版 AgentCore 运行时如何计费以消除峰值占用浪费?
采用按需内存分配机制,会话结束后立即释放内存,取代原有的高水位追踪计费模式,实现按实际使用量计费。
新运行时在 200 MB 至 2 GB 镜像下的 P75 冷启动延迟是多少?
P75 冷启动延迟稳定在约 2 秒。
开发者如何启用新版 AgentCore 运行时?
需将 platformVersion 参数设置为 V2。
新运行时支持哪种架构以降低现有代理的迁移门槛?
新增 x86 架构支持,允许运行现有的 x86 代理、工具或环境。
旧版运行时冷启动延迟的波动范围是多少?
原运行时延迟从 5.4 秒起步,随着镜像增大最高接近 30 秒。