ボイスボットはどう選ぶのか ー 完結率だけで決めると失敗する評価軸

ボイスボットの提案書には、ほぼ必ず「完結率」の数字が載っている。ある提案では90%、別の提案では50%。ところがこの2つを並べても、どちらが優れているかは判断できない。分母と分子の定義が各社で違うからだ。本稿では、公開されている市場統計と導入事例の数値を手がかりに完結率の定義差を分解し、そのうえで完結率以外に何を評価すればボイスボット選定を外さないのか、運用側の4軸を提示する。私の立場を先に言えば、完結率はカタログ燃費のようなもので、選定の入口にはなるが決め手にしてはいけない。
コールセンターのボイスボット市場は49億円、しかし予測には100倍の幅がある

まず規模感を押さえる。ミック経済研究所の市場調査によると、2024年度の自動対話システム市場のうちボイス型は49億円。市場全体は232.4億円なので、電話を担うボイス型は全体の21.4%にとどまり、182億円のテキスト型(チャットボット)の約4分の1の規模しかない。市場全体は年平均21.3%増で2030年度に700億円を超えると同調査は予測している。
ただし、この数字は当て馬を置いて相対化しておきたい。ボイスボット事業者であるVerbexの市場予測は、コールセンターの音声AI市場が5年で約5,250億円になるとするベンダー試算で、ミック経済研究所のボイス型49億円とは2桁違う。前者は音声AIに関わる周辺市場や代替される人件費まで広く含む試算、後者はシステム販売額の積み上げという前提の差であり、どちらが正しいという話ではない。もっとも、この幅の大きさ自体が「ボイスボットの価値をどの物差しで測るかが定まっていない」という市場の現在地を示している。
シェア争いも数字の定義戦になっている。LINE WORKSの発表は同調査のボイス型2024年度実績でAiCallがシェア1位、年間対応3,000万件とするが、これも「ボイス型」という区分の中での話だ。区分の切り方が変われば順位も変わる。
「完結率90%」と「完結率50%」は同じ土俵にいない

完結率の定義差は、公開事例の数値を3つ並べるとよくわかる。
カラクリの導入事例では、三井ダイレクト損保が夜間18時以降のマイページログインに関する問い合わせの52.7%を音声AIで自動完結したとする(2026年5月時点・同社発表)。分母は「夜間の・特定用件の呼」であり、全着信ではない。JALカードの発表では、自律型AIオペレーター「X-Ghost」が検証段階でAI正答率90%、コミュニケーター接続成功率90%を達成したとするが、これは完結率ではなく「回答の正しさ」と「取次の成功」という別の指標だ。さらにAI Shiftのリニューアル発表は、従来型と比較して不要な会話のラリーを55%削減という数値を掲げる。これは体験の滑らかさの指標であり、完結したかどうかとはまた別の軸になる。
つまり同じ「成果数値」でも、(1)分母がどの呼か(全着信か、ボットに接続した呼か、対象業務に絞った呼か)、(2)分子が何をもって完結とするか(用件の受付までか、後続処理の実行までか、顧客が再入電しなかったことまで含むか)、(3)そもそも完結率以外の指標か、という3点で土俵が異なる。自動車のカタログ燃費と実燃費の関係に近い。測定モードが違う燃費を並べて車を選ぶ人はいないが、ボイスボット選定では測定モードの違う完結率が平気で並べられている。
ベンダーが悪いというより、共通の測定基準がまだ存在しないことが原因だ。だからこそ発注側は、提案の数値に対して「分母と分子の定義書」を出してもらうところから始める必要がある。
運用側の評価軸は4つある

完結率の定義を揃えたとして、それでも選定には足りない。導入後の失敗要因は初期性能よりも運用にあるからだ。岩崎通信機の解説は、ボイスボット導入の失敗を防ぐ鍵として有人連携とシステム設計を挙げており、ボイスボットは単独で完結する仕組みではなく、オペレーターや既存システムと連携して初めて効果を発揮すると整理している。ここから、選定表に加えるべき運用側の軸を4つの型として整理する。
第1の型は「シナリオ保守性」。問い合わせの内容は季節や商品改定で変わり続けるため、シナリオを現場が自分で直せるかが効いてくる。ベンダーに改修依頼を出して数週間待つ体制では、完結率は導入時点がピークになり、あとは劣化していく。管理画面での修正範囲、変更の反映時間、改善サイクルを誰が回すかを確認したい。
第2の型は「基幹連携」。受付だけで完結する業務は実は少なく、契約情報の照会や手続きの実行まで進めて初めて完結率の分子が増える。CRM・PBX・基幹システムへの読み書きがどこまで標準機能で、どこからが個別開発かで、見積総額と導入期間は大きく変わる。前述の岩崎通信機の整理にある通り、人へ引き継ぐ場合の要件(会話内容の連携、担当者への事前共有)も連携設計の一部だ。
第3の型は「音声認識の実測」。デモの認識精度と、自社の顧客層・専門用語・回線品質での精度は別物だ。AI Shiftの改善事例では、ユーザーの状況に合わせて発話を誘導する機能のABテストで通話中の切断率を75%改善したとされており、認識エンジン単体の精度より「聞き取れなかったときのリカバリー設計」が体験を左右することを示している。選定時は自社の実呼データに近い条件でのテストコールを必ず行いたい。
第4の型は「撤退容易性」。ボイスボットは2〜3年で世代交代が進んでおり、乗り換えの可能性は高い。シナリオ・会話ログ・FAQ資産をエクスポートできるか、契約は業務単位で減らせるか、他社ボットとの並行運用が許されるかは、導入時にしか交渉できない。



