เกิดอะไรขึ้น

AWS Machine Learning เผยแพร่บทความอธิบายว่าโทเคนอินพุตสามารถคิดเป็นสัดส่วนที่มีนัยสำคัญของต้นทุนในการรัน Retrieval Augmented Generation (RAG) ในระดับสเกลใหญ่

บทความดังกล่าวอธิบายรูปแบบการบีบอัดบริบทตามคำถาม (query-aware context compression) บน Amazon Bedrock โดยหลังจากขั้นตอนการดึงข้อมูล (retrieval) แล้ว โมเดลขนาดเล็กกว่าจะทำหน้าที่กรองส่วนข้อมูล (chunks) ที่ดึงมาได้ด้วยการเปรียบเทียบกับคำถาม

เมื่อกรองเสร็จแล้ว โมเดลหลักจะตอบคำถามโดยใช้เฉพาะบริบทที่ถูกลดขนาดลง ซึ่งช่วยลดจำนวนโทเคนอินพุตและต้นทุน พร้อมทั้งพยายามรักษาคุณภาพของคำตอบไว้

เหตุใดเรื่องนี้จึงสำคัญ

งาน RAG มักป้อนบริบทที่ดึงมาได้ขนาดใหญ่เข้าสู่โมเดลที่มีราคาแพง ทำให้จำนวนโทเคนอินพุตกลายเป็นปัจจัยสำคัญที่ผลักดันต้นทุน

การใช้โมเดลขนาดเล็กกว่าเพื่อคัดส่วนข้อมูลที่ไม่เกี่ยวข้องออกก่อนขั้นตอนการอนุมาน (inference) หลัก เป็นแนวทางที่ใช้งานได้จริงในการควบคุมค่าใช้จ่ายโดยไม่จำเป็นต้องเสียคุณภาพ

รูปแบบนี้สะท้อนถึงแนวโน้มในวงกว้างของการปรับปรุงประสิทธิภาพของไปป์ไลน์ AI ด้วยการแบ่งงานระหว่างโมเดลขนาดเล็กที่เชี่ยวชาญเฉพาะทางกับโมเดลสร้างข้อความ (generation) ขนาดใหญ่กว่า

ข้อเท็จจริงสำคัญ

รูปแบบนี้มีชื่อว่า query-aware context compression และทำงานบน Amazon Bedrock

โมเดลขนาดเล็กกว่าจะกรองส่วนข้อมูลที่ดึงมาได้โดยเทียบกับคำถาม ก่อนที่โมเดลหลักจะสร้างคำตอบ

เป้าหมายที่ระบุไว้คือการลดจำนวนโทเคนอินพุตและต้นทุน พร้อมทั้งรักษาคุณภาพของคำตอบไว้

สิ่งที่ต้องจับตาดูต่อไป

รูปแบบการบีบอัดนี้จะกลายเป็นองค์ประกอบมาตรฐานสำหรับแอปพลิเคชัน RAG บน Bedrock ที่ต้องการประสิทธิภาพด้านต้นทุนหรือไม่

ในทางปฏิบัติจะเกิดการแลกเปลี่ยนด้านคุณภาพมากน้อยเพียงใด เมื่อโมเดลขนาดเล็กกว่าทำหน้าที่กรองบริบทก่อนที่โมเดลหลักจะตอบคำถาม

แหล่งที่มา