コールセンターのボイスボットが無言を待ち続ける 無入力時の案内を設計する4つの観点

トランスコスモスの2022年調査(全国20〜79歳の6,633名)では、ボイスボットによる案内を受けたことがある人は47.1%、体験者のうち問い合わせがボイスボットで解決したと答えた人は54.7%だった。半数は体験済みで、半数近くは解決しきれていない。解決しない通話の典型が、顧客が黙り、ボットが同じ聞き返しを繰り返す場面だ。核の問いはこうなる。顧客が話さないとき、ボットは何秒待ち、何回聞き返し、そのあと何をすべきか。私の立場を先に書くと、秒数や回数に一律の正解はなく、無入力を「考え中」「聞こえていない」「話したのに拾われていない」の3つに分けて設計し、どれだったかを記録で確かめ続けるしかない、と考える。
考え中と聞こえていない状態を分ける

無言には種類がある。質問を聞いて答えを考えている。音声が小さい、または環境音にまぎれて届いていない。そもそも相手がガイダンスを聞き取れておらず、何を話せばよいか分からない。電話口の沈黙は全部同じに聞こえるが、打ち手は全部違う。
当て馬として有人のコンタクトセンター(コールセンター)を置くと、違いがはっきりする。オペレーターは沈黙の質を聞き分け、「ご契約番号はお手元にございますか」と探し物の時間を作ったり、声量から聞こえの問題を察したりする。ボットにはこの判断がなく、設計した分岐しか持たない。だから分岐の設計が会話の質をそのまま決める。
システム側の仕様も、この区別をあいまいにしがちだ。例えばDialogflow CXの解説では、no-input(無入力)イベントは、音声入力が空のとき、入力に認識できる発話が含まれないとき、無音のまま時間切れになったとき、のいずれでも発火する。つまり「無入力」のログには、本当に黙っていた人と、小さな声で話したのに認識されなかった人が混ざりうる。このイベントは、発話はあったが意図に合わなかったno-match(不一致)とも別物だ。どのイベントがどの条件で発火するかは実機で確かめる。ここが設計の出発点になる。
人の側の事情も押さえておきたい。10言語を比べた話者交代の研究(PNAS、2009年)のとおり、人同士の会話の間合いは0〜200ミリ秒に集中するが、それは慣れた相手との話し方だ。機械相手に生年月日や会員番号を聞かれた人は、思い出し、手元を探し、言葉を選んでから話す。考え中の沈黙は正常な沈黙であり、そこに矢継ぎ早の聞き返しを被せると、考える時間そのものを奪う。
会員先行公開中(10月11日に一般公開)



