ニュース
「えー」「あー」を除去して複数話者音声文字変換「Gemini 3.5 Transcribe」
2026年8月28日 11:58
Googleは26日(米国時間)、新しい高精度な音声文字変換モデル「Gemini 3.5 Transcribe」を発表した。背景のノイズなどの影響を低減し、音声データを正確で洗練されたテキストに変換できるほか、複数話者の識別などを強化した。
すでに、GeminiアプリやAndroidなどのGoogle製品では、Android版RamblerやmacOS版Geminiアプリの音声機能を通じて提供されているが、今後はGoogle AI StudioのGemini APIや、Gemini Enterprise Agent Platformで、Gemini 3.5 Transcribeの活用が可能となる。
Gemini 3.5 Transcribeでは、自然な話し方を正確に捉え、ユーザーの意図を理解し、独自の語彙を認識。音声でのタスク実行などに対応する。スマートな文字起こしや正確な文字起こし、関数呼び出し(Function calling)、カスタム語彙、複数話者の識別などが特徴となる。
自己修正(「火曜日に会おう…いや、水曜日だ」など)をシームレスに処理し、間投詞(「えー」や「あー」)を除去し、テキストを自動的にフォーマット
このモデルは、関数呼び出しを通じて、画像生成やファイル分析などの複雑なタスクを他のGeminiモデルに委任できます。現在、Gemini macOSアプリで利用可能
Artificial Analysis による測定結果で、ストリーミング用途では平均ワードエラー率(WER)4.0%、非ストリーミング用途では 2.6%を達成。騒がしい実環境においても高いパフォーマンスを発揮し、郵便番号や注文 IDなどの英数字エンティティを正確に認識する
提供されたカスタム語彙に文字起こしをシームレスに適応させることで、専門用語や独自の綴りを認識
85以上の言語を自動的に検出して文字起こしを行ない、地域のアクセントや多様な方言にもシームレスに対応
事前に録音された音声において、最大3人の話者の発言をタイムスタンプ付きで正確に特定する(3人以上の文字起こしはテスト段階)
従来の文字起こしモデル「Chirp 3」から大幅に進歩し、新機能の追加や単語誤り率の改善のほか、レイテンシ(遅延)も大幅に短縮している。
また、Android版のGboardのRambler機能や、Google Antigravity、Google AI Studio、macOS 版の Gemini アプリなどでGemini 3.5 Transcribeに対応。またChromeのWebからの音声入力もまもなくGemini 3.5 Transcribeに切り替わる予定。





