孤本网
发布于 2026-09-11 / 0 阅读
0
0

Amazon SageMaker Inference推出前缀感知路由以降低 LLM延迟

在构建基于大型语言模型(LLM)的应用时,发送给模型的提示通常包含固定部分和可变部分:固定部分设定上下文,如指令、参考文档和对话历史;可变部分包含实际用户输入。以客服机器人为例,每个请求都以相同文本块开头。

Amazon SageMaker Inference为实时端点提供三种路由策略:RANDOM(默认)、LEAST_OUTSTANDING_REQUESTS和新增的 PREFIX_AWARE。PREFIX_AWARE将共享相同提示前缀的请求发送到同一实例,适用于 LLM并启用前缀缓存。该策略可按生产变体在端点配置中设置,更新配置即可切换,无需重新部署模型。官方称其适用于 RAG、多轮对话、模板机器人和代码补全等场景。

启用时,PrefixLength范围为1024–65536,ConcurrencyThreshold范围为1–1024。该功能无需修改模型容器或框架,在路由层生效。多租户隔离方面,Invoke API可使用请求头 X-Amzn-SageMaker-Prefix-Aware-Id,最多64个 ASCII字符;OpenAI API可使用 prompt_cache_key。该策略支持推理组件和动态 LoRA适配器。建议启用前缀缓存,并保持序列化一致。

使用限制与建议包括:需谨慎设置 PrefixLength。过短会使具有相同短前缀的所有请求


评论