何が起きたか
AWS Machine Learningは、大規模なRetrieval Augmented Generation(RAG)の実行コストにおいて、入力トークンが大きな割合を占め得ることを説明する投稿を公開しました。
この投稿では、Amazon Bedrock上でのクエリ対応コンテキスト圧縮パターンについて概説しています。検索後、より小さなモデルが、クエリと比較して取得されたチャンクをフィルタリングします。
フィルタリングが完了すると、主要モデルは削減されたコンテキストのみを使用して回答し、入力トークンとコストを削減しつつ、回答品質の維持を目指します。
なぜ重要か
RAGワークロードでは、多くの場合、取得した大きなコンテキストを高価なモデルに供給するため、入力トークン数が大きなコスト要因となります。
メインの推論ステップの前に、より小さなモデルを使用して無関係なチャンクを除去することは、品質を必ずしも犠牲にすることなくコストを管理するための実用的な手段を提供します。
このパターンは、専門化された小規模モデルとより大規模な生成モデルとの間で作業を分割することにより、AIパイプラインを最適化するという幅広い傾向を示しています。
主要な事実
このパターンはクエリ対応コンテキスト圧縮と呼ばれ、Amazon Bedrock上で実行されます。
主要モデルが回答を生成する前に、より小さなモデルが取得されたチャンクをクエリに対してフィルタリングします。
明示された目標は、回答品質を維持しながら入力トークンとコストを削減することです。
次の注目点
この圧縮パターンが、コスト効率を求めるBedrockベースのRAGアプリケーションにとって標準的な構成要素となるかどうか。
主要モデルが応答する前に、より小さなモデルがコンテキストをフィルタリングする場合に、実際にどの程度の品質トレードオフが生じるか。
