コールセンターAIのモデル更新で回答が変わる 回帰テストと比較の4つの手順

稼働中のAIのモデルを更新するかどうかは、実はセンター側だけでは決められない。Amazon Bedrockのモデルのライフサイクルに関する公式文書は、提供されるモデルにアクティブ・レガシー・提供終了(EOL)の状態があり、提供終了日を過ぎたモデルへのリクエストは失敗すること、後継への移行は自動では行われないことを説明している。つまり、今日うまく動いているモデルをずっと使い続ける選択肢は、原則として存在しない。コンタクトセンター(コールセンター)のAIにとって、モデル更新は障害のような突発事象ではなく、期限付きで必ず来る定期業務である。では、更新した日に回答がどう変わったかを、あなたのセンターはどう確かめるのか。本稿の立場を先に書く。更新の合否は全体の平均スコアで判定すべきではなく、用件ごとの悪化の有無で判定すべきだと見ている。手順はいずれも編集部(相原ことは)の実務設計案である。
本稿が扱う範囲も先に区切っておく。どの製品・どのモデルを最初に選ぶかという評価軸は、LLM選定の記事で扱った。本稿はその後の話、すでに稼働しているAIのモデル版を移行する場面の検査である。また、参照ナレッジを正しく引けているかは、検索だけを切り出した評価が製品側にも用意されている別工程として扱い、ここでは深入りしない。
凍結した代表質問を用意する
更新前後の比較は、同じ物差しがなければ成立しない。米国国立標準技術研究所(NIST)のAIリスクマネジメントフレームワークは、測定機能の項目MEASURE 2.1で、テストセット・指標・検証に使ったツールの詳細を文書化することを、MEASURE 2.3で、AIシステムの性能を本番環境に近い条件で測定し示すことを求めている。センターの言葉に直すと、どの質問で、どの指標で、どの設定で測ったかが書き残されていて、その質問が実際の入電を代表している状態である。
編集部の提案は、代表質問のセットを作って凍結することだ。選ぶ箱は3つ。件数の多い定番の用件、過去に誤案内につながった用件、金額や本人確認に触れる用件である。凍結とは、モデル更新のたびに質問を差し替えないという意味で、質問を変えれば結果の差がモデルのせいか質問のせいか分からなくなる。健康診断が毎年同じ検査項目だから変化を読めるのと同じ理屈である。
あわせて、比較の条件も固定して記録する。評価した日付、新旧それぞれのモデルの版、温度などの生成設定、プロンプトと参照ナレッジの版。このどれかが動いていると、差分の原因を後から切り分けられない。ここが物差しの目盛りにあたる。
会員先行公開中(10月10日に一般公開)



