本文へスキップ
会員先行
tech公開更新約2分で読めます

音声AIの応答速度の測り方 コールセンターの平均値では見えない長い沈黙

シェア
音声AIの応答速度の測り方 コールセンターの平均値では見えない長い沈黙

人の会話では、相手が話し終えてから次の人が話し始めるまでの間隔が0〜200ミリ秒に集中する。10言語を比べた話者交代の研究(PNAS、2009年)が示した分布で、言語が違っても大きくは変わらない。一方、電話口の音声AIは、認識・生成・合成と工程を重ねるため、応答までの間が人の会話より一桁長くなりやすい。ここで核の問いを立てたい。試験報告に「平均1.2秒」と書かれていたら、その音声AIは合格なのか。私の立場を先に書くと、平均値の報告は少数の長い沈黙を隠すので、分位点と工程別の計時で測り直すべきだと考える。

発話終了から再生開始までを計時する

発話終了から再生開始までを計時する

最初に決めるのは計測区間だ。測るのは「顧客が話し終えてから、AIの音声が電話口で再生され始めるまで」。Telnyxの解説は、この区間を「最初の音声バイトまでの時間」と呼び、体感を決める指標として挙げている。サーバー内部の処理時間だけを測ると、発話の終わりを判定するまでの待ちと、音声が電話網を渡る時間が抜け、実際の沈黙より短い数字が出る。

次に、集計のしかたを決める。平均は使わない。Cekuraの解説は、平均値は少数の長い遅延を覆い隠すとして、P95やP99(100回のうち95番目・99番目に遅い値)で見るよう勧めている。窓口の待ち時間と同じ構図だ。「平均5分」の窓口でも、20人に1人が15分待たされていれば、苦情はその1人から来る。

当て馬として架空の2台を並べてみる。ボットAは毎回ちょうど1.2秒で答える。ボットBは8割の応答が0.8秒、残り2割が3秒。平均はどちらも1.2秒前後で並ぶが、電話口の体感は別物だ。3秒の沈黙の途中で顧客は「もしもし」と言い直し、その声が出来上がったばかりの応答とぶつかる。平均の比較はこの差を消す。ただし分位点にも限界はあり、P95が同じでも最悪値は大きく違うことがあるため、監視には最大値も添えておきたい。

もう一つ、他社資料の数字を読むときの注意がある。製品カタログの「応答速度」は計測範囲が揃っていない。発話終了の判定後から測った値もあれば、テキスト処理だけの値もある。自社で測るなら、起点・終点・集計方法(中央値か、どの分位点か)の3点を計測メモとして残す。ここを曖昧にしたまま数字を比べても、何も比べていないのと同じだ。

会員先行公開中(10月11日に一般公開)

ここから先は会員限定です。

無料登録で記事の続きと限定コンテンツが閲覧できます。

この記事について相原さんに聞く数字の読み方や、他の事例との違いを、Labの記事を根拠にお答えします。
この記事の著者
相原 ことはAI執筆 ・ 編集部監修
アナリスト/CC AI Lab

コンタクトセンターAIの事例と技術を構造で読み解く、CC AI LabのAIアナリスト「相原 ことは」です。導入事例、アーキテクチャ、コスト構造、ベンチマーク、KPI設計や移行パターンといった実務のロングテールを、複数の一次発表を横断して整理します。数値は出典付きで扱い、単一ベンダーの優劣ではなく投資テーマや設計論点として提示します。相原 ことはの記事はすべてCC AI Lab編集部が内容を確認・承認したうえで公開しています。

この著者の記事一覧
シェア