เกิดอะไรขึ้น
โมเดลภาษาขนาดใหญ่แบบมัลติโมดัลมักพึ่งพา Visual Chain-of-Thought (Visual CoT) ซึ่งสร้างภาพสำหรับการให้เหตุผลระหว่างขั้นตอน เพื่อจัดการกับงานด้านพื้นที่ เวลา และงานที่เกี่ยวข้องกับร่างกาย (embodied tasks)
แม้ Visual CoT จะช่วยในการคาดการณ์ล่วงหน้าเชิงภาพ แต่ก็เพิ่มภาระในการประมวลผล (inference overhead) อย่างมาก โดยเฉพาะสำหรับการให้เหตุผลวิดีโอเชิงรุก (proactive video reasoning)
เฟรมเวิร์กใหม่ของ Apple ที่ชื่อ Internalized Visual Thinking (IVT) ย้ายการให้เหตุผลเชิงภาพไปไว้ในขั้นตอนการฝึกโมเดล ทำให้สามารถให้เหตุผลได้โดยตรงในขั้นตอนการประมวลผล (inference) โดยไม่ต้องสร้างภาพระหว่างขั้นตอน
เหตุใดจึงสำคัญ
แนวทางนี้อาจทำให้การให้เหตุผลเกี่ยวกับวิดีโอมีประสิทธิภาพและใช้งานได้จริงมากขึ้นสำหรับแอปพลิเคชันแบบเรียลไทม์ ช่วยลดภาระด้านการประมวลผล
ด้วยการฝังการคิดเชิงภาพไว้ในตัวโมเดล โมเดลอาจให้ผลลัพธ์การประมวลผลที่รวดเร็วขึ้นโดยไม่สูญเสียคุณภาพของการให้เหตุผล ซึ่งอาจเปิดทางให้นำไปใช้งานได้อย่างแพร่หลายมากขึ้น
ข้อเท็จจริงสำคัญ
Visual CoT สร้างภาพสำหรับการให้เหตุผลระหว่างขั้นตอน เพื่อใช้ในการให้เหตุผลด้านพื้นที่ เวลา และงานที่เกี่ยวข้องกับร่างกาย
Visual CoT ก่อให้เกิดภาระในการประมวลผลที่สูงมาก
IVT เป็นเฟรมเวิร์กหลังการฝึก (post-training) ที่ปรับให้เหมาะสมร่วมกันทั้งการทำนายข้อความและการคิดเชิงภาพ
IVT มีเป้าหมายให้โมเดลเรียนรู้การคิดเชิงภาพในระหว่างการฝึก และให้เหตุผลได้โดยตรงในขั้นตอนการประมวลผล
สิ่งที่ต้องจับตาดูต่อไป
ว่า IVT จะสามารถรักษาหรือปรับปรุงความแม่นยำในการให้เหตุผลเมื่อเทียบกับ Visual CoT ในงานวิดีโอจากโลกจริงได้หรือไม่
ประสิทธิภาพและความสามารถในการขยายขนาดของการฝึก IVT เปรียบเทียบกับวิธีการที่มีอยู่เดิมในการใช้งานระดับใหญ่เป็นอย่างไร
