ニュース
グーグル、Gemini 3.8に新音声モデル 声再現やAIアバターとの会話も
2026年9月25日 13:53
Googleは、音声生成モデル「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」およびライブ対話モデルに映像のアバターを組み合わせる「Gemini 3.8 Live with Live Avatar」を発表した。音声生成モデルはGoogle AI StudioやGemini APIなどで順次提供し、Live Avatar機能はGemini Enterpriseで提供開始した。
表現力豊かな音声生成モデル
Gemini 3.8 Flash TTSおよびFlash-Lite TTSは、同社がこれまでで最も表現力豊かだと謳う音声生成モデル。Flash TTSでは、自然言語による指示から100以上の言語や方言にわたって役割、アクセント、声質などを指定し、新たな声を作成できる。演技や話す速度、相づちなども細かく指定可能。
2,000以上の既成音声も用意するほか、30秒の音声サンプルから声を再現する機能、長時間の音声生成、2人の会話生成にも対応する。Flash-Lite TTSは、大量の吹き替えや音声コンテンツ制作、音声エージェント作成など、大規模かつ低コストでの利用を想定する。
音声の再現には本人の同意確認が必要で、生成音声にはSynthIDやC2PAの情報を付与する。両モデルはGemini APIとGoogle AI Studioで提供開始し、今後Gemini Enterpriseでも提供する。Flash TTSはGemini Notebook、Flash-Lite TTSはGoogle Vidsでも展開する。
AIとの対話にアバターを追加
Live Avatarは、ライブ対話モデル「Gemini 3.8 Live」によるリアルタイム会話と低遅延のストリーミング動画を組み合わせ、映像アバターと対話できる機能。正確なリップシンクや自然な表情、スムーズなやり取りを実現するという。
視覚情報と音声情報を同時に処理でき、会話を続けながらバックグラウンドでツールを呼び出して情報を取得する非同期処理にも対応する。97言語間をシームレスに切り替えて会話でき、途中で言語を切り替えてもリップシンクや表情がずれずに表示できる。
生成するアバター映像や音声にはSynthIDの透かしを埋め込む。同機能を搭載したGemini 3.8 Liveは、Gemini Enterpriseで利用できる。






