เกิดอะไรขึ้น
งานวิจัยนี้นำเสนอแนวทางการฝึกโมเดลแบบ iterative pseudo-labeling สำหรับระบบรู้จำเสียงพูดอัตโนมัติแบบสลับภาษาจีนกลาง-อังกฤษ (Mandarin-English code-switching ASR) ซึ่งถือเป็นการนำวิธีนี้มาใช้กับ CS-ASR เป็นครั้งแรก
แนวทางนี้ใช้คลังข้อมูลขนาดใหญ่ที่ไม่มีป้ายกำกับในการสร้าง pseudo-label เพื่อสร้างชุดข้อมูลแบบกึ่งมีผู้สอน (semi-supervised) สำหรับการฝึกโมเดล
กระบวนการฝึกแบ่งออกเป็นสามขั้นตอน ได้แก่ การสร้าง pseudo-label การฝึกโมเดลสองภาษาแบบสองขั้น (two-stage bilingual model training) และการปรับปรุงซ้ำแบบวนรอบ (iterative improvements)
เหตุใดจึงสำคัญ
การสลับภาษา ซึ่งเกิดขึ้นเมื่อผู้พูดสลับใช้ภาษาภายในประโยคเดียวกัน เป็นที่ทราบกันดีว่าเป็นความท้าทายอย่างมากสำหรับระบบ ASR เนื่องจากข้อมูลฝึกที่ออกแบบมาโดยเฉพาะยังมีอยู่น้อย
ด้วยการใช้ประโยชน์จากข้อมูลที่ไม่มีป้ายกำกับผ่านกระบวนการ iterative pseudo-labeling แนวทางนี้จึงเปิดแนวทางที่เป็นไปได้ในการพัฒนา CS-ASR โดยไม่ต้องพึ่งพาการถอดเสียงพูดแบบสลับภาษาด้วยมือซึ่งมีต้นทุนสูง
กระบวนการปรับปรุงซ้ำแบบวนรอบนี้อาจช่วยให้โมเดลค่อย ๆ พัฒนาผลการทำนายของตัวเองได้ดีขึ้นเรื่อย ๆ ทำให้ใช้ประโยชน์จากทรัพยากรสองภาษาที่มีอยู่ได้อย่างมีประสิทธิภาพมากขึ้น
ข้อเท็จจริงสำคัญ
การสลับภาษาคือการใช้ภาษาสลับกันภายในประโยคเดียวกัน และเป็นความท้าทายสำคัญสำหรับระบบ ASR
งานวิจัยฉบับนี้เป็นการนำเทคนิค iterative pseudo-labeling มาใช้กับ CS-ASR เป็นครั้งแรก
แนวทางนี้ประกอบด้วยสามขั้นตอน ได้แก่ การสร้าง pseudo-label การฝึกโมเดลสองภาษาแบบสองขั้น และการปรับปรุงซ้ำแบบวนรอบ
สิ่งที่ต้องจับตาดูต่อไป
แนวทาง iterative pseudo-labeling นี้จะสามารถขยายไปใช้กับคู่ภาษาที่มีการสลับภาษาอื่น ๆ นอกเหนือจากจีนกลาง-อังกฤษได้หรือไม่
คุณภาพของ pseudo-label ที่สร้างขึ้นจะพัฒนาไปอย่างไรในแต่ละรอบการวนซ้ำ และจะนำไปสู่การพัฒนาประสิทธิภาพอย่างต่อเนื่องหรือไม่
ความเป็นไปได้ในการนำวิธีการแบบกึ่งมีผู้สอนนี้ไปประยุกต์ใช้ในระบบ ASR ที่ใช้งานจริงในบริบทที่มีหลายภาษาหรือมีการสลับภาษา
