发生了什么

在 Amazon Bedrock 上运行大规模检索增强生成(RAG)时,输入令牌往往是成本的重要组成部分。

AWS 这篇文章介绍了一种查询感知的上下文压缩模式:在检索步骤之后,先使用较小的模型根据用户查询过滤检索到的分块,再由主模型进行回答。

这种做法的目的是减少输入令牌数量、降低费用,同时尽量保持答案质量。

为什么重要

由于输入令牌在规模化 RAG 中的成本占比可观,减少它们能直接改善成本结构。

使用较小模型先行过滤,是一种在不牺牲太多回答质量的前提下优化资源利用的思路,可能对长期运行生成式 AI 应用的团队有吸引力。

关键事实

输入令牌常构成大规模 RAG 运行成本的重要部分。

该方法在检索后使用较小模型按查询过滤上下文。

该模式旨在降低输入令牌与成本,同时维持回答质量。

接下来看什么

这一模式在不同查询复杂度和检索规模下的实际效果值得关注。

未来是否会出现更精细的过滤策略或与其他优化手段结合,也值得观察。

来源