เกิดอะไรขึ้น

Google ได้อัปเดตบริการ Gemini Audio ด้วยโมเดล Gemini 3.5 รุ่นใหม่ ได้แก่ Gemini 3.5 Live, 3.5 Live Experimental และ 3.5 Transcribe

ตามประกาศดังกล่าว ความสามารถในการถอดเสียงแบบใหม่นี้จะตรวจจับศัพท์เฉพาะทางได้โดยอัตโนมัติ และรองรับภาษาได้มากกว่า 85 ภาษา

Google ระบุว่าโมเดลเหล่านี้ถูกออกแบบมาเพื่อให้ความแม่นยำที่ดีขึ้นสำหรับฟีเจอร์ AI ที่ควบคุมด้วยเสียง แม้จะมีเสียงรบกวนรอบข้างหรือการพูดที่ไม่ชัดเจนก็ตาม

เหตุใดจึงสำคัญ

การตัดคำฟุ่มเฟือยอย่าง ‘อ้ำ’ และ ‘อือ’ ออกโดยอัตโนมัติ จะช่วยให้บทถอดเสียงที่สร้างโดย AI สะอาดขึ้นและอ่านง่ายขึ้น ไม่ว่าจะใช้สำหรับการประชุม การจดบันทึก หรือคำบรรยาย

การรองรับศัพท์เฉพาะทางและภาษาที่หลากหลาย อาจทำให้ Gemini Audio ใช้งานได้จริงมากขึ้นในสาขาต่าง ๆ เช่น การแพทย์ กฎหมาย และธุรกิจระหว่างประเทศ

ข้อเท็จจริงสำคัญ

การอัปเดตนี้เป็นส่วนหนึ่งของชุดฟีเจอร์ Gemini Audio ของ Google

การอัปเดตนี้เปิดตัวโมเดลใหม่ 3 รุ่น ได้แก่ Gemini 3.5 Live, 3.5 Live Experimental และ 3.5 Transcribe

ระบบถอดเสียงสามารถตรวจจับศัพท์เฉพาะทางได้ และรองรับภาษามากกว่า 85 ภาษา

โมเดลเหล่านี้ถูกออกแบบมาให้รับมือกับเสียงรบกวนรอบข้างและการพูดที่ไม่สมบูรณ์แบบได้โดยไม่มีปัญหา

สิ่งที่ต้องจับตาดูต่อไป

การตัดคำฟุ่มเฟือยออกจะยังคงเป็นตัวเลือกที่ปิด-เปิดได้หรือไม่ สำหรับผู้ใช้ที่ต้องการบทถอดเสียงแบบคำต่อคำ

การตรวจจับศัพท์เฉพาะทางและการรองรับหลายภาษาจะทำงานได้ดีเพียงใดในสภาพแวดล้อมจริงที่มีเสียงรบกวน

แหล่งที่มา