무슨 일이 있었나
AWS Machine Learning은 대규모 RAG(검색 증강 생성) 실행 비용에서 입력 토큰이 상당한 비중을 차지할 수 있다는 게시물을 게시했습니다.
이 게시물은 Amazon Bedrock에서 쿼리 인식 컨텍스트 압축 패턴을 설명합니다. 검색 후 더 작은 모델이 검색된 청크를 쿼리와 비교하여 필터링합니다.
필터링이 완료되면 기본 모델이 축소된 컨텍스트만 사용하여 답변하므로 입력 토큰과 비용이 줄어들고 답변 품질 유지를 목표로 합니다.
왜 중요한가
RAG 워크로드는 종종 크게 검색된 컨텍스트를 비용이 많이 드는 모델에 입력하여 입력 토큰 수가 상당한 비용 요인이 됩니다.
주요 추론 단계 전에 더 작은 모델을 사용하여 관련 없는 청크를 제거하면 품질을 반드시 희생하지 않으면서 지출을 통제할 수 있는 실질적인 수단을 제공합니다.
이 패턴은 특수화된 더 작은 모델과 대형 생성 모델 간에 작업을 분할하여 AI 파이프라인을 최적화하는 광범위한 추세를 보여줍니다.
핵심 사실
이 패턴은 쿼리 인식 컨텍스트 압축이라고 하며 Amazon Bedrock에서 실행됩니다.
기본 모델이 답변을 생성하기 전에 더 작은 모델이 쿼리를 기준으로 검색된 청크를 필터링합니다.
명시된 목표는 답변 품질을 유지하면서 입력 토큰과 비용을 줄이는 것입니다.
다음에 주목할 점
이 압축 패턴이 비용 효율성을 추구하는 Bedrock 기반 RAG 애플리케이션의 표준 구성 요소가 될지 여부.
기본 모델이 응답하기 전에 더 작은 모델이 컨텍스트를 필터링할 때 실제로 얼마나 많은 품질 트레이드오프가 발생하는지.
