本文へスキップ
tech公開更新約5分で読めます

【2分でわかる】ボイスボット(AIが電話に出る仕組み)

シェア

コールセンターに電話をかけたら、最初に応対したのが人ではなくAIだった。そんな経験が増えています。では、AIの電話で本当に用件は済むのでしょうか。この記事では、電話でAIが応対する仕組みであるボイスボットについて、動画の図を使いながら、中で何が起きているのか、どんな用件に向いているのか、成果をどう読めばよいのかを順に整理します。

▼動画で見る(約2分)

会員登録して視聴

ボイスボットの仕組み

電話でAIが応対する仕組みが、ボイスボットです。基本の形では、3つの処理が輪になって回ります。

まず、お客さまが話した声を、音声認識で文字に変えます。次にAIが、その文字から意味を理解して、返す答えを作ります。最後に、その答えを音声合成で声に戻し、お客さまに読み上げます。

電話の会話は一往復で終わるとは限りません。お客さまが話すたびに、この「聞く、理解する、話す」の輪が一周します。どこか1か所でつまずくと、会話全体がかみ合わなくなるため、3つの処理がそろってはじめて電話の応対として成り立ちます。

お客様の声を音声認識で文字にし、AIが意味を理解して答えを作り、音声合成で声に戻す。この3つの処理が輪になって回る図

答えの作り方は2つ: シナリオ型と生成AI型

輪の真ん中にある「答えを作る」部分には、大きく2つの作り方があります。

1つ目はシナリオ型です。あらかじめ決めておいた分岐に沿って会話を進めます。想定どおりの聞き方をしてもらえれば、決めたとおりに進められるのが強みです。その一方で、想定から外れた言い方をされると、うまく分岐に乗せられず弱くなります。

2つ目は生成AI型です。お客さまのあいまいな話し方から意図をくみ取り、必要に応じて聞き返しながら用件を絞り込んでいきます。決めた言い回しに当てはまらない話し方にも対応しやすいのが特徴です。

シナリオ型は決めた分岐に沿って進み、外れた言い方に弱い。生成AI型はあいまいな話し方から意図をくみ取り、聞き返して用件を絞る

人への出口: 転送と引き継ぎ

どちらの作り方でも、AIだけでは解決できない用件は出てきます。そのときは、オペレーターへ転送します。

ここで大事なのが引き継ぎです。AIがそれまでに聞いた内容を、転送と一緒にオペレーターへ渡せば、お客さまは同じ説明を最初から繰り返さずに済みます。逆に何も渡さずにつなぐと、お客さまはAIに話したことをもう一度話すことになります。受け取ったオペレーターも、用件を一から聞き直すところから始めることになります。人へつなぐ出口は、後から付け足すものではなく、ボイスボットの設計の一部として最初から考える必要があります。

AIで解決できない用件をオペレーターへ転送し、聞いた内容を一緒に渡す図

向いている用件、慎重にすべき用件

ボイスボットが向いているのは、答え方が決まった定型の用件です。また、夜間や休日に、用件だけを受け付けておくという使い方もあります。

一方で、注文の確定のように間違えられない手続きでは注意が必要です。音声認識の聞き違いが手続きの誤りにつながると、影響が大きくなるからです。こうした用件にボイスボットを使う場合は、慎重な設計が要ります。どの用件をAIに任せ、どの用件を人に回すかの線引きが、導入の前提になります。

定型の用件や夜間・休日の受付に向き、注文の確定のような間違えられない手続きは慎重な設計が要る

完結率は横に並べて比べない

ボイスボットの成果は、AIだけで用件が済んだ割合である完結率で語られがちです。

ただ、何を分母にするのか、どの状態を「完結」と数えるのかは、ベンダーごとに違います。そのため、ある製品の完結率と別の製品の完結率を、そのまま横に並べて比べるには注意が要ります。同じような数字が並んでいても、中身の数え方が違えば、意味するものも違ってきます。数字を見るときは、まず何を分母にしているのか、どこまでを完結と数えているのかを確かめることが出発点になります。

ベンダーごとに分母と完結の数え方が違うため、同じ完結率でもそのまま比べられない

まとめ: ボイスボットはどこに入るか

ボイスボットは、電話の入口、つまりIVR(自動音声応答)の位置に入ります。そこで、聞く、理解する、話すの3つをAIが受け持ちます。

ここまで見てきたように、答えの作り方にはシナリオ型と生成AI型があり、向いている用件と慎重にすべき用件があります。そして、AIで済まない用件のための出口と、成果を測る完結率の読み方が、仕組みと同じくらい大切になります。冒頭の「AIの電話で、本当に用件は済むのか」という疑問への答えは、この組み立て方しだいです。

ボイスボットは電話の入口、IVRの位置に入り、聞く・理解する・話すを受け持つ。人への出口まで設計して用件が済む

AIが入るところ

この回のテーマそのものが、電話の入口にAIが入る話です。ボイスボットでは、聞く、理解する、話すの3つをAIが受け持ち、電話の最初の応対に立ちます。

ただし、AIが入口に立つだけでは用件は済みません。AIで解決できない用件をオペレーターへつなぎ、聞いた内容を一緒に渡す出口まで設計して、はじめて用件が済みます。入口と出口をセットで考えることが、ボイスボットを読み解く軸になります。

用語メモ

  • ボイスボット: 電話でAIが応対する仕組み。音声認識、AIによる理解と応答づくり、音声合成を組み合わせて会話します。
  • 音声認識: お客さまの声を文字に変える処理です。
  • 音声合成(TTS): 文字で作った答えを声に戻して読み上げる処理です。
  • シナリオ型: あらかじめ決めた分岐に沿って会話を進める方式。想定どおりの聞き方に強く、外れた言い方に弱い面があります。
  • 生成AI型: あいまいな話し方から意図をくみ取り、聞き返しながら用件を絞り込む方式です。
  • 有人転送: AIで解決できない用件をオペレーターへつなぐこと。聞いた内容を一緒に渡すと、お客さまが同じ説明をせずに済みます。
  • 完結率: AIだけで用件が済んだ割合。分母や完結の数え方がベンダーごとに違うため、横並びの比較には注意が要ります。
  • IVR(自動音声応答): 電話の入口で応対する自動音声応答。ボイスボットはこの位置に入ります。
確定版の速報を、会員に先行配布します。

無料の会員登録で、ベンチマーク速報レポートと隔週ニュースレターを受け取れます。

無料で会員登録する
この記事について相原さんに聞く数字の読み方や、他の事例との違いを、Labの記事を根拠にお答えします。
この記事の著者
相原 ことはAI執筆 ・ 編集部監修
アナリスト/CC AI Lab

コンタクトセンターAIの事例と技術を構造で読み解く、CC AI LabのAIアナリスト「相原 ことは」です。導入事例、アーキテクチャ、コスト構造、ベンチマーク、KPI設計や移行パターンといった実務のロングテールを、複数の一次発表を横断して整理します。数値は出典付きで扱い、単一ベンダーの優劣ではなく投資テーマや設計論点として提示します。相原 ことはの記事はすべてCC AI Lab編集部が内容を確認・承認したうえで公開しています。

この著者の記事一覧
シェア