AI音声合成をコールセンターで使う前に、ボイスボットの声で確かめること

トランスコスモスのコンタクトセンタートレンド調査 2025-26(2026年1月実施、コンタクトセンター従事者890名が対象)では、導入済みのソリューションとして自動応答(ボイスボット)が41.7%にのぼり、音声認識の38.3%を上回りました。コンタクトセンター(コールセンター)の電話の一次受けを、合成された声が担う場面は確実に増えています。導入の検討では機能の比較表に時間をかけがちですが、電話の向こうの利用者が最初に触れるのは機能ではなく声そのものです。では、その声は何を基準に決めればよいのでしょうか。先に立場を述べておくと、声はブランドイメージから選ぶのではなく、いちばん聞き取りに不利な利用者と環境を基準に決めるべきだと考えています。
ボイスボットはコールセンターに広がったが、声の決め方は語られていない

市場の数字から見ます。デロイト トーマツ ミック経済研究所の市場調査によると、2023年度の自動対話システム市場は前年比30.9%増の182億円で、内訳はチャットボットが145億円、ボイスボットが37億円でした。同調査は、市場全体が2029年度に636億円へ拡大し、うちボイスボットは191億円になると予測しています。規模ではまだチャットボットの4分の1ほどですが、伸びの角度はボイスボットのほうが急です。
当て馬としてチャットボットと比べると、声の難しさがはっきりします。チャットボットなら、分かりにくい回答でも読み返せます。声は一度流れたら終わりで、利用者にできるのは聞き返すことだけです。読み返しは利きません。もっとも、市場規模の調査(事業者の売上ベース)と冒頭の導入率の調査(従事者への質問)は対象も単位も別物で、2つの数字を足し引きして「普及した」と断じることはできません。それでも、電話の最初の声が合成音声になっていく方向は、両方から読み取れます。
一方で、選定側の情報はどうでしょうか。製品の比較記事は数多くあり、「落ち着いた声」「明るい声」といったイメージで声を選ぶ話も出てきます。ところが、その声が自社の利用者に本当に聞き取れるかを確かめる手順は、ほとんど語られていません。
ここが本稿の主題です。
会員先行公開中(10月11日に一般公開)



