เกิดอะไรขึ้น
AWS Machine Learning เผยแพร่บทความอธิบายว่าโทเคนอินพุตสามารถคิดเป็นสัดส่วนที่มีนัยสำคัญของต้นทุนในการรัน Retrieval Augmented Generation (RAG) ในระดับสเกลใหญ่
บทความดังกล่าวอธิบายรูปแบบการบีบอัดบริบทตามคำถาม (query-aware context compression) บน Amazon Bedrock โดยหลังจากขั้นตอนการดึงข้อมูล (retrieval) แล้ว โมเดลขนาดเล็กกว่าจะทำหน้าที่กรองส่วนข้อมูล (chunks) ที่ดึงมาได้ด้วยการเปรียบเทียบกับคำถาม
เมื่อกรองเสร็จแล้ว โมเดลหลักจะตอบคำถามโดยใช้เฉพาะบริบทที่ถูกลดขนาดลง ซึ่งช่วยลดจำนวนโทเคนอินพุตและต้นทุน พร้อมทั้งพยายามรักษาคุณภาพของคำตอบไว้
เหตุใดเรื่องนี้จึงสำคัญ
งาน RAG มักป้อนบริบทที่ดึงมาได้ขนาดใหญ่เข้าสู่โมเดลที่มีราคาแพง ทำให้จำนวนโทเคนอินพุตกลายเป็นปัจจัยสำคัญที่ผลักดันต้นทุน
การใช้โมเดลขนาดเล็กกว่าเพื่อคัดส่วนข้อมูลที่ไม่เกี่ยวข้องออกก่อนขั้นตอนการอนุมาน (inference) หลัก เป็นแนวทางที่ใช้งานได้จริงในการควบคุมค่าใช้จ่ายโดยไม่จำเป็นต้องเสียคุณภาพ
รูปแบบนี้สะท้อนถึงแนวโน้มในวงกว้างของการปรับปรุงประสิทธิภาพของไปป์ไลน์ AI ด้วยการแบ่งงานระหว่างโมเดลขนาดเล็กที่เชี่ยวชาญเฉพาะทางกับโมเดลสร้างข้อความ (generation) ขนาดใหญ่กว่า
ข้อเท็จจริงสำคัญ
รูปแบบนี้มีชื่อว่า query-aware context compression และทำงานบน Amazon Bedrock
โมเดลขนาดเล็กกว่าจะกรองส่วนข้อมูลที่ดึงมาได้โดยเทียบกับคำถาม ก่อนที่โมเดลหลักจะสร้างคำตอบ
เป้าหมายที่ระบุไว้คือการลดจำนวนโทเคนอินพุตและต้นทุน พร้อมทั้งรักษาคุณภาพของคำตอบไว้
สิ่งที่ต้องจับตาดูต่อไป
รูปแบบการบีบอัดนี้จะกลายเป็นองค์ประกอบมาตรฐานสำหรับแอปพลิเคชัน RAG บน Bedrock ที่ต้องการประสิทธิภาพด้านต้นทุนหรือไม่
ในทางปฏิบัติจะเกิดการแลกเปลี่ยนด้านคุณภาพมากน้อยเพียงใด เมื่อโมเดลขนาดเล็กกว่าทำหน้าที่กรองบริบทก่อนที่โมเดลหลักจะตอบคำถาม
