孤本网
/ 0 阅读
0
0

AWS发布aws-ai-ml技能:通过编码代理实现SageMaker AI推理端点的自动化基准测试与优化

一句话结论

AWS推出aws-ai-ml技能,允许编码代理直接调用SageMaker AI进行模型基准测试、部署推荐及成本优化,降低推理调优门槛。

关键要点

  • 该技能通过AWS Agent Toolkit提供,支持Kiro、Claude Code和Codex等遵循MCP协议的编码代理。
  • 核心功能包括运行端点基准测试、推荐最优部署配置、对比不同模型或实例的性能指标,并生成可执行的SageMaker Python SDK v3代码。
  • 支持对Qwen3、Hugging Face等模型的推理性能进行量化分析,关键指标涵盖吞吐量、延迟百分位、首token时间及并发数。
  • 在SageMaker Studio JupyterLab空间中使用需配置私有共享设置和预配置镜像,首次启动耗时约5至10分钟。
  • 本地安装前置条件为AWS CLI版本2.35及以上,并需安装uv工具;Kiro和Claude Code可通过AWS MCP Server在运行时发现技能,无需本地安装。

背景与事实

亚马逊云科技(AWS)在机器 learning 博客中发布了一项名为“aws-ai-ml”的新技能,旨在将现有的编码代理转变为Amazon SageMaker AI推理优化专家。该技能依托AWS Agent Toolkit提供,目前支持集成Kiro、Claude Code和Codex等遵循模型上下文协议(MCP)的编码工具。其核心目标是简化生成式AI推理端点的性能评估与部署配置流程,使开发者能够以自然语言描述意图,由代理自动执行复杂的技术任务。

在具体功能层面,该技能允许代理对SageMaker AI端点上的模型进行基准测试。代理会自动生成Python笔记本,调用SageMaker Python SDK中的Workload.synthetic()和start_benchmark() API来模拟负载测试。测试完成后,代理会提供基于真实流量模式的定量性能报告,指标包括吞吐量、延迟百分位、首token时间(time-to-first-token)以及并发数,并推荐如预填充解码等改进机制以优化性能。此外,代理还能协助寻找部署实例类型,生成代码以评估模型在候选实例和配置下的表现,最终提供包含多项性能指标的排名部署选项。

针对跨能力请求,例如“暂存模型并获取部署建议”,该技能支持在同一对话中自然串联不同操作。具体场景包括处理S3模型部署建议、寻找JumpStart模型的最便宜实例(无需S3暂存,支持门控模型替代)以及Hugging Face模型优化(展示许可证并暂存至S3)。示例对比数据显示,在512/256 token、并发4的工作负载下,运行于4-GPU ml.g5.12xlarge实例的Qwen3-8B模型相比运行于单L4 GPU ml.g6.4xlarge实例的Qwen3-1.7B模型,输出token吞吐量提升了44.1%(从188.2 tokens/s提升至271.2 tokens/s),每用户吞吐量提升45.9%,请求吞吐量提升46.7%。尽管Qwen3-1.7B在首token时间上占优(67.5 ms对比166.3 ms),但Qwen3-8B在token间延迟和请求延迟上分别降低了33.0%和32.0%,表现为显著的性能改善。

安装与配置方面,若用户在本地环境运行,需确保安装了AWS CLI 2.35及以上版本及uv工具。若在SageMaker Studio的JupyterLab空间中使用,必须创建具有私有共享设置的空间,并选择预配置镜像,首次启动预计需要5至10分钟。AWS凭证需具备调用SageMaker AI API的权限,包括创建端点、运行基准测试和推荐作业,但技能本身无需额外的IAM配置。对于Kiro和Claude Code,用户可通过AWS MCP Server在运行时发现该技能,无需在本地进行安装。

影响分析

这一变化对中文开发者及AI工程从业者具有显著的降本增效意义。传统上,优化生成式AI推理性能需要深厚的底层架构知识,涉及实例选择、量化策略、批处理大小调整等复杂参数调优。aws-ai-ml技能的引入,将这一过程转化为“自然语言提问-自动执行代码-生成报告”的标准化流程。对于资源有限的团队,这意味着可以更高效地找到“性价比最高”的部署方案,避免因盲目选择高算力实例而产生的不必要成本。例如,通过代理自动比较不同模型和实例组合的性能/成本比,开发者可以直观地看到如Qwen3系列模型在不同硬件配置下的吞吐量和延迟变化,从而做出数据驱动的决策。此外,由于支持生成可执行的Python SDK v3代码,开发者可以将这些优化逻辑直接整合到CI/CD流水线中,实现推理配置的持续自动化监控与迭代,这在高频更新大模型的工程实践中尤为宝贵。

适用边界

该技能的有效性依赖于对Amazon SageMaker AI服务的深度绑定,因此不适用于使用其他云厂商(如阿里云、腾讯云、华为云)或本地私有化部署推理服务的场景。其基准测试功能主要针对SageMaker托管的端点,若模型未在SageMaker上部署,则无法直接调用其推荐的实例配置逻辑。此外,虽然支持Hugging Face模型的暂存和优化建议,但最终的性能推荐和成本计算是基于AWS基础设施的定价和实例特性,迁移至非AWS环境时需重新评估实例匹配度。对于未使用Kiro、Claude Code或Codex等特定MCP支持代理的开发团队,需依赖本地安装流程,且必须严格遵守AWS CLI版本及凭证权限要求,否则无法触发技能功能。

孤本观察

编辑认为,该技能实质上是AWS将“推理运维”从手动调参转向代理自动化执行的关键节点,其价值不仅在于单一测试,更在于将异构实例选择与模型性能评估闭环化,标志着云厂商开始通过工具链而非单纯算力供给来锁定AI工程工作流。

常见问题

在SageMaker Studio JupyterLab空间中使用该技能需要哪些前置配置?

需创建具有私有共享设置的空间,并选择预配置镜像,首次启动耗时约5至10分钟。

在512/256 token、并发4负载下,Qwen3-8B在ml.g5.12xlarge实例的输出吞吐量比Qwen3-1.7B提升多少?

输出token吞吐量从188.2 tokens/s提升至271.2 tokens/s,提升了44.1%。

本地安装该技能对AWS CLI和工具包有何版本要求?

需安装AWS CLI 2.35及以上版本,并需安装uv工具。

该技能支持哪些编码代理?是否需要在本地安装?

支持Kiro、Claude Code和Codex等MCP协议代理;Kiro和Claude Code可通过AWS MCP Server运行时发现,无需本地安装。

AWS凭证在调用该技能时有哪些权限要求?

需具备调用SageMaker AI API的权限,包括创建端点、运行基准测试和推荐作业,技能本身无需额外IAM配置。

来源:AWS Machine Learning Blog


评论