Qué ocurrió
AWS Machine Learning publicó una entrada que describe cómo los tokens de entrada pueden representar una parte considerable del costo de ejecutar Generación Aumentada por Recuperación (RAG) a gran escala.
La publicación describe un patrón de compresión de contexto sensible a la consulta en Amazon Bedrock: después de la recuperación, un modelo más pequeño filtra los fragmentos recuperados comparándolos con la consulta.
Una vez completado el filtrado, el modelo principal responde usando únicamente el contexto reducido, lo que reduce los tokens de entrada y el costo, procurando preservar la calidad de la respuesta.
Por qué es importante
Las cargas de trabajo de RAG suelen introducir grandes contextos recuperados en modelos costosos, lo que convierte el número de tokens de entrada en un factor de costo significativo.
Usar un modelo más pequeño para eliminar fragmentos irrelevantes antes del paso principal de inferencia ofrece una palanca práctica para controlar el gasto sin sacrificar necesariamente la calidad.
Este patrón apunta a una tendencia más amplia de optimizar los flujos de IA dividiendo el trabajo entre modelos especializados más pequeños y modelos de generación más grandes.
Datos clave
El patrón se llama compresión de contexto sensible a la consulta y se ejecuta en Amazon Bedrock.
Un modelo más pequeño filtra los fragmentos recuperados en función de la consulta antes de que el modelo principal genere una respuesta.
Los objetivos declarados son reducir los tokens de entrada y el costo mientras se preserva la calidad de la respuesta.
Qué observar a continuación
Si este patrón de compresión se convierte en un componente estándar para las aplicaciones de RAG basadas en Bedrock que buscan eficiencia de costos.
Cuánta pérdida de calidad surge en la práctica cuando un modelo más pequeño filtra el contexto antes de que responda el modelo principal.
