Amazon 宣布为 Amazon SageMaker Inference on HyperPod 推出模型缓存(model caching)功能,用于减少大语言模型(LLM)推理部署的冷启动时间。
按照官方博客的说明,在 Amazon SageMaker HyperPod 上部署 LLM 进行推理时,从请求一个 pod 到它真正可以对外提供流量服务之间存在一段空档期。这段时间主要被两次串行下载占据:一次是从 Amazon Elastic Container Registry(Amazon ECR)拉取推理服务器容器镜像,另一次是从存储源下载模型权重,存储源可以是 Amazon Simple Storage Service(Amazon S3)、Amazon FSx for Lustre 或 HuggingFace Hub。对较小的模型来说,这可能只是几分钟;但对 DeepSeek-R1 这类 600 GB 以上的大模型而言,