コールセンターの音声AI構成を比較する4つの視点 認識・合成・対話の責任分担

電話の音声AIには、音声をいったん文字に起こしてから考え、また声に戻す「組み合わせ型」と、音声のまま受けて音声で返す「一体型」の2つの作り方があります。OpenAIは開発者向けの音声エージェントの設計ガイドで両方を並べ、会話の反応速度を重視する用途には一体型を、初めて作る場合や既存のLLMアプリを音声化する場合には組み合わせ型を勧めています。では、コンタクトセンター(コールセンター)が音声AIを調達するとき、どちらを選び、どこまでを誰の責任にすればよいのでしょうか。本稿の立場は、「どちらが高性能か」より先に「どの段階で何が起きたかを後から特定できるか」で選ぶべきだ、というものです。
視点1:音声認識・対話・音声合成の流れを分ける

まず、音声AIの中で何が起きているかを分解します。組み合わせ型は3人の係のリレーにたとえられます。聞き取り係(音声認識、ASR)が発話を文字にし、判断係(対話エンジンやLLM)が返答の文面を決め、読み上げ係(音声合成、TTS)がそれを声にします。OpenAIのガイドは、この連鎖型について、入力も応答もテキストで残るため記録が取れ、アプリ側で制御しやすいと説明しています。
一体型は、この3人を1人の通訳に置き換える形です。音声を直接受けて音声で返すため、係の間の受け渡しがありません。音声AI基盤を提供するDeepgramの解説記事は、組み合わせ型では受け渡しのたびにテキストが表に出るのに対し、一体型は1つの音声モデルの内部で処理が完結すると整理しています。
ここで当て馬として、昔ながらのIVR(プッシュ操作の自動音声応答)と比べてみます。IVRは「1番を押したらこの音声を流す」という決め打ちで、どこで失敗したかは操作ログを見ればほぼ分かります。音声AIは、組み合わせ型でも一体型でも、IVRより原因の追跡が難しくなります。もっとも、組み合わせ型は途中のテキストが残るぶん、IVRに近い追跡のしやすさを一部保てます。ただし、ここで比べているのは構造上の性質であり、個別製品の精度や速度を並べた比較ではない点に留意が必要です。
会員先行公開中(10月6日に一般公開)



