音声AIが部品になる日 ー Google新TTS2種が動かす、コールセンターの差別化点

Googleが2026年9月23日、音声合成の基盤モデル2種「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」を開発者向けに公開した。Googleの公式発表によれば、両モデルは100以上の言語に対応し、自然言語プロンプトで新しい音声を設計できる。SiliconANGLEの報道では、Flash TTSが130言語、Flash-Lite TTSが101言語に対応し、2,000を超えるプリセット音声を持つとされる。ここで問いたいのは性能の高さではない。音声生成が「外から借りてくる部品」になったとき、コールセンター(コールセンター=コンタクトセンター)の何が変わるのか、である。
1. 何が発表されたのか、数字で押さえる

公表された事実を整理する。提供形態は、開発者向けにGemini APIとGoogle AI Studioで提供開始、企業向けはGemini Enterprise経由のAPIで提供予定とされる(Google発表)。言語対応はFlashが130、Flash-Liteが101。日本語やブラジルポルトガル語、ベトナム語などで、人間の主観評価に基づくベンチマークVoice Arenaで上位に入ったという。
音声は2,000超のプリセットに加え、音色・アクセント・話速を自然言語で指定してカスタム音声を作れる。さらに30秒の音源から一貫した声を再現できるとする。この声再現には、本人同意の検証、SynthIDの電子透かし、C2PAのコンテンツ来歴が組み込まれると説明されている。Flash-Liteは低レイテンシ・高ボリューム向けと位置づけられ、ダビングや音声エージェントが名指しの用途に挙がっている。モデルの仕様はGoogle CloudのText-to-Speechの公式ドキュメントにある。
なお、両モデルが音質ベンチマークで1位・2位を占めたという順位は、Google自身の評価に基づく自己申告である。第三者による独立検証ではない点は割り引いて読む必要がある。
会員先行公開中(10月2日に一般公開)



