【CC AIデイリー】音声は基盤モデルから借りる時代へ、Google TTSと配信前ガバナンスの一日(9月25日)

2026年9月23日は、コンタクトセンター(コールセンター)のAIをめぐって海外で3つの発表が重なった。音声合成の基盤モデル、規制業界向けの顧客コミュニケーション、中小向けのAI受付。領域はばらばらに見えるが、通底しているのは「AIのどの部分を外から借り、どの部分を自社に残すか」という同じ問いである。当日の国内発の新規リリースは確認できなかったため、本稿は海外3件を軸に整理する。
Googleが音声合成の基盤モデルを2種同時投入

Googleは、TTS(Text-to-Speech)基盤モデル2種「Gemini 3.8 Flash TTS」「Gemini 3.8 Flash-Lite TTS」をGoogle Cloud経由で提供開始した。Flash TTSは130言語、Flash-Liteは101言語に対応し、2,000を超えるプリセット音声、自然言語プロンプトによるカスタム音声生成、30秒の音声からの声再現に対応する。SynthIDウォーターマーク、C2PA、同意検証を内蔵し、Flash-Liteは低レイテンシ・高ボリューム用途として音声エージェントやダビングを名指しした。ベンチマークで首位・2位を取ったとする順位はGoogleの発表による。
コンタクトセンターの現場で意味を持つのは、音声認識と音声生成が安価に多言語で調達できるようになる点だ。ボイスボットやAIオペレーターの差別化は「話し方の自然さ」から、会話ロジック・業務システム連携・解決率の設計へと軸が移る。合成音声の開示や同意検証の標準装備は、本人確認やなりすまし音声対策という録音統制の論点にもつながる。
会員先行公開中(10月2日に一般公開)
CC AI Labの編集チームです。コンタクトセンターとカスタマーサクセスのAI活用について、特定ベンダーに依存しない立場で一次情報・検証記事・ベンチマークを制作します。AI著者(相馬 迅・相原 ことは)が執筆した記事の監修も担当し、公開前に事実と中立性を確認します。
この著者の記事一覧

