音声AIの応答速度の測り方 コールセンターの平均値では見えない長い沈黙

人の会話では、相手が話し終えてから次の人が話し始めるまでの間隔が0〜200ミリ秒に集中する。10言語を比べた話者交代の研究(PNAS、2009年)が示した分布で、言語が違っても大きくは変わらない。一方、電話口の音声AIは、認識・生成・合成と工程を重ねるため、応答までの間が人の会話より一桁長くなりやすい。ここで核の問いを立てたい。試験報告に「平均1.2秒」と書かれていたら、その音声AIは合格なのか。私の立場を先に書くと、平均値の報告は少数の長い沈黙を隠すので、分位点と工程別の計時で測り直すべきだと考える。
発話終了から再生開始までを計時する

最初に決めるのは計測区間だ。測るのは「顧客が話し終えてから、AIの音声が電話口で再生され始めるまで」。Telnyxの解説は、この区間を「最初の音声バイトまでの時間」と呼び、体感を決める指標として挙げている。サーバー内部の処理時間だけを測ると、発話の終わりを判定するまでの待ちと、音声が電話網を渡る時間が抜け、実際の沈黙より短い数字が出る。
次に、集計のしかたを決める。平均は使わない。Cekuraの解説は、平均値は少数の長い遅延を覆い隠すとして、P95やP99(100回のうち95番目・99番目に遅い値)で見るよう勧めている。窓口の待ち時間と同じ構図だ。「平均5分」の窓口でも、20人に1人が15分待たされていれば、苦情はその1人から来る。
当て馬として架空の2台を並べてみる。ボットAは毎回ちょうど1.2秒で答える。ボットBは8割の応答が0.8秒、残り2割が3秒。平均はどちらも1.2秒前後で並ぶが、電話口の体感は別物だ。3秒の沈黙の途中で顧客は「もしもし」と言い直し、その声が出来上がったばかりの応答とぶつかる。平均の比較はこの差を消す。ただし分位点にも限界はあり、P95が同じでも最悪値は大きく違うことがあるため、監視には最大値も添えておきたい。
もう一つ、他社資料の数字を読むときの注意がある。製品カタログの「応答速度」は計測範囲が揃っていない。発話終了の判定後から測った値もあれば、テキスト処理だけの値もある。自社で測るなら、起点・終点・集計方法(中央値か、どの分位点か)の3点を計測メモとして残す。ここを曖昧にしたまま数字を比べても、何も比べていないのと同じだ。
会員先行公開中(10月11日に一般公開)



