เกิดอะไรขึ้น

งานวิจัยนี้นำเสนอแนวทางการฝึกโมเดลแบบ iterative pseudo-labeling สำหรับระบบรู้จำเสียงพูดอัตโนมัติแบบสลับภาษาจีนกลาง-อังกฤษ (Mandarin-English code-switching ASR) ซึ่งถือเป็นการนำวิธีนี้มาใช้กับ CS-ASR เป็นครั้งแรก

แนวทางนี้ใช้คลังข้อมูลขนาดใหญ่ที่ไม่มีป้ายกำกับในการสร้าง pseudo-label เพื่อสร้างชุดข้อมูลแบบกึ่งมีผู้สอน (semi-supervised) สำหรับการฝึกโมเดล

กระบวนการฝึกแบ่งออกเป็นสามขั้นตอน ได้แก่ การสร้าง pseudo-label การฝึกโมเดลสองภาษาแบบสองขั้น (two-stage bilingual model training) และการปรับปรุงซ้ำแบบวนรอบ (iterative improvements)

เหตุใดจึงสำคัญ

การสลับภาษา ซึ่งเกิดขึ้นเมื่อผู้พูดสลับใช้ภาษาภายในประโยคเดียวกัน เป็นที่ทราบกันดีว่าเป็นความท้าทายอย่างมากสำหรับระบบ ASR เนื่องจากข้อมูลฝึกที่ออกแบบมาโดยเฉพาะยังมีอยู่น้อย

ด้วยการใช้ประโยชน์จากข้อมูลที่ไม่มีป้ายกำกับผ่านกระบวนการ iterative pseudo-labeling แนวทางนี้จึงเปิดแนวทางที่เป็นไปได้ในการพัฒนา CS-ASR โดยไม่ต้องพึ่งพาการถอดเสียงพูดแบบสลับภาษาด้วยมือซึ่งมีต้นทุนสูง

กระบวนการปรับปรุงซ้ำแบบวนรอบนี้อาจช่วยให้โมเดลค่อย ๆ พัฒนาผลการทำนายของตัวเองได้ดีขึ้นเรื่อย ๆ ทำให้ใช้ประโยชน์จากทรัพยากรสองภาษาที่มีอยู่ได้อย่างมีประสิทธิภาพมากขึ้น

ข้อเท็จจริงสำคัญ

การสลับภาษาคือการใช้ภาษาสลับกันภายในประโยคเดียวกัน และเป็นความท้าทายสำคัญสำหรับระบบ ASR

งานวิจัยฉบับนี้เป็นการนำเทคนิค iterative pseudo-labeling มาใช้กับ CS-ASR เป็นครั้งแรก

แนวทางนี้ประกอบด้วยสามขั้นตอน ได้แก่ การสร้าง pseudo-label การฝึกโมเดลสองภาษาแบบสองขั้น และการปรับปรุงซ้ำแบบวนรอบ

สิ่งที่ต้องจับตาดูต่อไป

แนวทาง iterative pseudo-labeling นี้จะสามารถขยายไปใช้กับคู่ภาษาที่มีการสลับภาษาอื่น ๆ นอกเหนือจากจีนกลาง-อังกฤษได้หรือไม่

คุณภาพของ pseudo-label ที่สร้างขึ้นจะพัฒนาไปอย่างไรในแต่ละรอบการวนซ้ำ และจะนำไปสู่การพัฒนาประสิทธิภาพอย่างต่อเนื่องหรือไม่

ความเป็นไปได้ในการนำวิธีการแบบกึ่งมีผู้สอนนี้ไปประยุกต์ใช้ในระบบ ASR ที่ใช้งานจริงในบริบทที่มีหลายภาษาหรือมีการสลับภาษา

แหล่งที่มา