发生了什么
AWS Machine Learning 发布文章,介绍 Amazon Bedrock 中的提示缓存功能。该功能针对反复向基础模型发送相同上下文的场景,可将输入 token 成本最多降低 90%。
文章结合 Converse API 梳理了六种提示缓存的实用场景,分别是消息内容、系统提示、工具定义、混合 TTL、租户隔离以及 LangChain 集成。
内容同时涉及成本与延迟两个维度的优化。
为什么重要
对需要反复提交同一段上下文的调用方来说,输入 token 成本是持续支出的一部分,缓存机制直接作用于这一环节。
文章给出的六种场景覆盖了从单条消息、系统提示到工具定义和租户隔离等不同层面,说明缓存并非只适用于单一调用形态。
混合 TTL 与租户隔离被单独列出,意味着缓存策略在生命周期管理和多租户边界上都有可讨论的设计空间。
关键事实
Amazon Bedrock 提示缓存可在重复发送相同上下文时,将输入 token 成本最多降低 90%。
文章使用 Converse API 演示六种提示缓存场景。
六种场景为:消息内容、系统提示、工具定义、混合 TTL、租户隔离、LangChain 集成。
来源为 AWS Machine Learning,发布时间为 2026-09-15。
接下来看什么
后续可关注这六种场景各自的具体配置方式与适用条件,尤其是混合 TTL 与租户隔离如何影响缓存命中。
成本之外,延迟优化的实际幅度也是值得跟踪的方向。
