เกิดอะไรขึ้น

การกลั่นความสามารถด้านการเรียกใช้เครื่องมือมักเริ่มต้นด้วยการทำ supervised fine-tuning บนชุดข้อมูล trajectory ที่สร้างขึ้นโดยโมเดลครู (teacher) ไปป์ไลน์ในระบบจริงจะทำขั้นตอนนี้ซ้ำทุกวันหรือทุกสัปดาห์ โดยต้องเสียค่าใช้จ่ายในการเรียกใช้โมเดลครูระดับแนวหน้าทุกครั้ง

กลไกมาตรฐานนั้นเรียบง่าย คือเก็บ trajectory ที่โมเดลครูทำสำเร็จไว้ ส่วนที่ล้มเหลวจะถูกทิ้งไป เนื่องจากความล้มเหลวไม่ได้ให้สัญญาณใด ๆ กับระบบ สถานการณ์ยาก ๆ แบบเดิมจึงมักวนกลับมาเกิดซ้ำในทุกรอบ

จากการประเมินด้วย τ2-bench พบว่า 57% ของการทดลองของโมเดลครูล้มเหลว และสองในสามของความล้มเหลวเหล่านั้นเป็นกรณี near-miss ซึ่งการเรียกใช้เครื่องมือส่วนใหญ่ถูกต้อง แต่ trajectory กลับค้างและไม่จบสมบูรณ์

เหตุใดเรื่องนี้จึงสำคัญ

การรัน generate-and-filter loop แบบเดิมซ้ำ ๆ หมายความว่าทีมงานต้องจ่ายค่าธรรมเนียมโมเดลครูระดับแนวหน้าซ้ำแล้วซ้ำเล่า โดยไม่เคยได้เรียนรู้จากสิ่งที่ผิดพลาดเลย สถานการณ์ยาก ๆ ที่เป็นอุปสรรคต่อความก้าวหน้ายังคงไม่ได้รับการแก้ไข

กรณี near-miss มีสัญญาณที่มีค่าอยู่ในตัว เพราะแสดงให้เห็นว่าโมเดลนั้นเกือบจะทำพฤติกรรมที่ถูกต้องแล้ว การมองข้ามกรณีเหล่านี้อาจหมายถึงการปล่อยให้โอกาสในการปรับปรุงที่ทำได้ง่ายและคุ้มค่าหลุดลอยไป ซึ่งดูเหมือนจะเป็นช่องว่างที่ PROOF-Gen พยายามเข้าไปแก้ไข ด้วยการเชื่อมโยงข้อมูลที่ถูกปรับให้เหมาะสมเข้ากับการกลั่นที่ดีขึ้น

ข้อเท็จจริงสำคัญ

การทำ supervised fine-tuning บนชุดข้อมูล trajectory ที่สร้างโดยโมเดลครู เป็นขั้นตอนแรกมาตรฐานในการกลั่นความสามารถด้านการเรียกใช้เครื่องมือ

ไปป์ไลน์หลังการฝึกโมเดล (post-training) จะรันกระบวนการกลั่นซ้ำทุกวันหรือทุกสัปดาห์ โดยต้องจ่ายค่าใช้จ่ายของโมเดลครูระดับแนวหน้าในทุกรอบ

กลไกในปัจจุบันคือ generate-and-filter นั่นคือเก็บ trajectory ที่ผ่าน ทิ้ง trajectory ที่ล้มเหลว

จากการทดสอบ τ2-bench พบว่า 57% ของการทดลองของโมเดลครูล้มเหลว โดยสองในสามของกรณีเหล่านี้เป็น near-miss ที่การเรียกใช้เครื่องมือส่วนใหญ่ถูกต้อง

สิ่งที่ต้องจับตาดูต่อไป

ต้องรอดูว่าการใช้ข้อมูลที่ถูกปรับให้เหมาะสมของ PROOF-Gen ซึ่งอาจรวมถึง trajectory ที่ล้มเหลวหรือเป็น near-miss จะสามารถทำลายวงจร generate-and-filter และช่วยเพิ่มประสิทธิภาพของการกลั่นได้หรือไม่

หากประสบความสำเร็จ แนวทางนี้อาจช่วยลดค่าใช้จ่ายที่เกิดขึ้นซ้ำ ๆ จากการเรียกใช้โมเดลครูระดับแนวหน้า และช่วยให้โมเดลสามารถผ่านสถานการณ์ยาก ๆ ที่ยังคงค้างอยู่ได้ในที่สุด

แหล่งที่มา