เกิดอะไรขึ้น
Google ได้อัปเดตบริการ Gemini Audio ด้วยโมเดล Gemini 3.5 รุ่นใหม่ ได้แก่ Gemini 3.5 Live, 3.5 Live Experimental และ 3.5 Transcribe
ตามประกาศดังกล่าว ความสามารถในการถอดเสียงแบบใหม่นี้จะตรวจจับศัพท์เฉพาะทางได้โดยอัตโนมัติ และรองรับภาษาได้มากกว่า 85 ภาษา
Google ระบุว่าโมเดลเหล่านี้ถูกออกแบบมาเพื่อให้ความแม่นยำที่ดีขึ้นสำหรับฟีเจอร์ AI ที่ควบคุมด้วยเสียง แม้จะมีเสียงรบกวนรอบข้างหรือการพูดที่ไม่ชัดเจนก็ตาม
เหตุใดจึงสำคัญ
การตัดคำฟุ่มเฟือยอย่าง ‘อ้ำ’ และ ‘อือ’ ออกโดยอัตโนมัติ จะช่วยให้บทถอดเสียงที่สร้างโดย AI สะอาดขึ้นและอ่านง่ายขึ้น ไม่ว่าจะใช้สำหรับการประชุม การจดบันทึก หรือคำบรรยาย
การรองรับศัพท์เฉพาะทางและภาษาที่หลากหลาย อาจทำให้ Gemini Audio ใช้งานได้จริงมากขึ้นในสาขาต่าง ๆ เช่น การแพทย์ กฎหมาย และธุรกิจระหว่างประเทศ
ข้อเท็จจริงสำคัญ
การอัปเดตนี้เป็นส่วนหนึ่งของชุดฟีเจอร์ Gemini Audio ของ Google
การอัปเดตนี้เปิดตัวโมเดลใหม่ 3 รุ่น ได้แก่ Gemini 3.5 Live, 3.5 Live Experimental และ 3.5 Transcribe
ระบบถอดเสียงสามารถตรวจจับศัพท์เฉพาะทางได้ และรองรับภาษามากกว่า 85 ภาษา
โมเดลเหล่านี้ถูกออกแบบมาให้รับมือกับเสียงรบกวนรอบข้างและการพูดที่ไม่สมบูรณ์แบบได้โดยไม่มีปัญหา
สิ่งที่ต้องจับตาดูต่อไป
การตัดคำฟุ่มเฟือยออกจะยังคงเป็นตัวเลือกที่ปิด-เปิดได้หรือไม่ สำหรับผู้ใช้ที่ต้องการบทถอดเสียงแบบคำต่อคำ
การตรวจจับศัพท์เฉพาะทางและการรองรับหลายภาษาจะทำงานได้ดีเพียงใดในสภาพแวดล้อมจริงที่มีเสียงรบกวน
