何が起きたか
Googleは、Gemini Audioサービスを、Gemini 3.5 Live、3.5 Live Experimental、3.5 Transcribeを含む新しいGemini 3.5モデルで更新しました。
発表によると、新しい文字起こし機能は、専門用語を自動的に検出し、85以上の言語に対応します。
Googleによれば、これらのモデルは、背景ノイズや不明瞭な音声がある場合でも、音声制御のAI機能に対してより高い精度を提供するように作られています。
重要性
「えーと」や「あー」のようなフィラーワードを自動的に除去することで、AIが生成した文字起こしは、会議、メモ、キャプションなどでより簡潔で読みやすくなります。
専門用語への対応と幅広い言語のサポートにより、Gemini Audioは医療、法律、国際ビジネスなどの分野でより実用的になる可能性があります。
要点
今回のアップデートは、GoogleのGemini Audio機能セットの一部です。
Gemini 3.5 Live、3.5 Live Experimental、3.5 Transcribeの3つの新しいモデルを導入します。
文字起こしは専門用語を検出し、85以上の言語に対応します。
これらのモデルは、背景ノイズや不完全な音声にも問題なく対応できるように設計されています。
今後の注目点
逐語的な文字起こしを必要とするユーザーにとって、フィラーワード除去が引き続きオプションとなるかどうか。
専門用語の検出と多言語対応が、現実の騒がしい環境でどの程度うまく機能するか。
