Amazon Bedrock 新增提示缓存(prompt caching)功能,旨在减少重复处理长提示词带来的成本和延迟。该功能通过缓存提示词中重复的前缀部分,使后续请求无需重新计算相同内容,从而加快响应速度并降低 token 消耗。
据 AWS 介绍,提示缓存适用于需要多次调用同一长上下文或系统提示的场景,例如文档问答、代码生成和对话代理。启用后,模型可复用已缓存的提示前缀,仅对新增内容进行处理。AWS 称,在部分场景下,该功能可将延迟降低最高 85%,成本降低最高 90%。
使用该功能需满足一定限制:缓存的最小 token 数为 1024,缓存条目的存活时间(TTL)为 5 分钟。目前支持的模型包括 Anthropic 的 Claude 3.5 Sonnet、Claude 3.5 Haiku 以及 Amazon Nova 系列模型。开发人员可通过 Bedrock API 中的 cachePoint 字段指定需要缓存的提示部分。
该功能已在美国东部(弗吉尼亚北部)等区域推出,具体可用性因模型和区域而异。AWS 同时提供了配套的笔记本和脚本,方便开发者测试提示缓存对成本和延迟的影响。