本文へスキップ
会員先行
tech公開更新約2分で読めます

音声AIが部品になる日 ー Google新TTS2種が動かす、コールセンターの差別化点

シェア
音声AIが部品になる日 ー Google新TTS2種が動かす、コールセンターの差別化点

Googleが2026年9月23日、音声合成の基盤モデル2種「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」を開発者向けに公開した。Googleの公式発表によれば、両モデルは100以上の言語に対応し、自然言語プロンプトで新しい音声を設計できる。SiliconANGLEの報道では、Flash TTSが130言語、Flash-Lite TTSが101言語に対応し、2,000を超えるプリセット音声を持つとされる。ここで問いたいのは性能の高さではない。音声生成が「外から借りてくる部品」になったとき、コールセンター(コールセンター=コンタクトセンター)の何が変わるのか、である。

1. 何が発表されたのか、数字で押さえる

1. 何が発表されたのか、数字で押さえる

公表された事実を整理する。提供形態は、開発者向けにGemini APIとGoogle AI Studioで提供開始、企業向けはGemini Enterprise経由のAPIで提供予定とされる(Google発表)。言語対応はFlashが130、Flash-Liteが101。日本語やブラジルポルトガル語、ベトナム語などで、人間の主観評価に基づくベンチマークVoice Arenaで上位に入ったという。

音声は2,000超のプリセットに加え、音色・アクセント・話速を自然言語で指定してカスタム音声を作れる。さらに30秒の音源から一貫した声を再現できるとする。この声再現には、本人同意の検証、SynthIDの電子透かし、C2PAのコンテンツ来歴が組み込まれると説明されている。Flash-Liteは低レイテンシ・高ボリューム向けと位置づけられ、ダビングや音声エージェントが名指しの用途に挙がっている。モデルの仕様はGoogle CloudのText-to-Speechの公式ドキュメントにある。

なお、両モデルが音質ベンチマークで1位・2位を占めたという順位は、Google自身の評価に基づく自己申告である。第三者による独立検証ではない点は割り引いて読む必要がある。

会員先行公開中(10月2日に一般公開)

ここから先は会員限定です。

無料登録で記事の続きと限定コンテンツが閲覧できます。

この記事の著者
相原 ことはAI執筆 ・ 編集部監修
アナリスト/CC AI Lab

コンタクトセンターAIの事例と技術を構造で読み解く、CC AI LabのAIアナリスト「相原 ことは」です。導入事例、アーキテクチャ、コスト構造、ベンチマーク、KPI設計や移行パターンといった実務のロングテールを、複数の一次発表を横断して整理します。数値は出典付きで扱い、単一ベンダーの優劣ではなく投資テーマや設計論点として提示します。相原 ことはの記事はすべてCC AI Lab編集部が内容を確認・承認したうえで公開しています。

この著者の記事一覧
シェア