判断だけを返すAI「Jev」が出た。コンタクトセンターは、どの判断を判定器に渡してよいのか

2026年9月15日(米国時間)、サンフランシスコのTypeSafe AIが、同社が「System One models」と呼ぶ新しい種類のモデルの第1弾「Jev」を公式ブログで公開しました。公開直後の1週間は招待制でしたが、Fyveの解説記事によると9月21日から順番待ちが撤廃され、誰でも使える状態になっています。同社は2024年創業で、Wikipediaの記載では公開と同時にDCVCがリードする4,000万ドルのシードラウンドを発表しました。
何が新しいのか。Jevは文章を生成しません。公式ブログは「Jev gives up string generation」と書いています。返すのは、選択肢から1つを選ぶ「choice」、ルーブリックで採点する「score」、文が真かどうかを0から1で答える「noul」の3種類の答えと、その確率だけです。同社は応答時間を「End-to-end response time is 70ms-500ms」とし、料金は入力100万トークンあたり0.042ドル、出力は無料としています。
これでコンタクトセンターのAI設計では、「判断」という1工程を、文章を書くLLMから切り出せるようになりました。そこで立てたい問いは、センターのどの判断を判定器に渡してよいのか、渡してはいけない判断はどれか、です。
私の立場を先に書きます。判定器には、センターの「判定」工程にはっきりした居場所があります。用件の振り分け、有人切替の合図、自動QAの定型項目、送信前の確認です。一方で、判定の「はい」を事実として扱ってはいけない判断もあります。本人確認、解約受付、苦情の確定がそれにあたります。速さと安さは、この線引きを変えません。
この記事の要点
①Jevの数字の多くは同社の自社評価で、70〜500ミリ秒は判定1回の時間です。音声認識・音声合成・電話網を含む通話全体の時間ではありません。ITmedia AI+の解説によると、「Zero Hallucinations」は構造化出力が壊れないという意味で、判断が正しいという意味ではありません
②choice・noul・scoreは、センターではそれぞれ用件振り分け、有人切替や送信前確認、QAの定型項目という問いに置き換えられます。効くのは、誤りを回収でき、ターンの間に収まり、人の採点で校正できる判断です
③顧客の自由文をそのまま判定させると、文面で判定が動く経路になります。Pydanticなど周辺の開発者は、判定器を決定論的なチェックの隣に置き、代わりにしない使い方を示しています
1. 数字を性質ごとに読み分ける
Jevの周辺には、性格の違う数字が同じ調子で並んでいます。
数値 | 同社の表記 | 読み手が置く留保 |
|---|---|---|
応答70〜500ミリ秒 | 公式ブログ「End-to-end response time is 70ms-500ms」 | 判定1回の応答時間。音声認識・音声合成・電話網を含む通話全体の経路の時間ではない。海外のエンドポイントを日本から呼ぶ場合は往復の通信時間が加わる |
40〜200倍速い | 公式ブログ「40x-200x faster」。比較相手の既存LLMは応答3〜329秒と同社が記載 | 同社が「System One」型と呼ぶ問いに限った比較 |
193.6倍速い・444.6倍安い | 公式サイト「193.6x Faster, 444.6x Cheaper」、条件は「based on workflows for System One tasks」 | 評価ワークフローは同社チームが作成し、参照答はGPT-6 AstraとFable 5.1の平均。同社自身がブログで「on the higher end of real world gains」と書いている |
入力100万トークン0.042ドル・出力無料 | Docs「Models」「$42 / $0.042」「Output tokens are free.」 | 判定1回の単価。1通話や1件あたりの額は、何回判定を呼ぶかで決まる。レート上限は予告なく変わりうると同社が明記 |
Zero Hallucinations | 公式サイトの表示 | ITmedia AI+によると根拠は構造化出力とツールコールのエラー率がゼロであること。判断が正しいという意味ではない |
順番待ち14万人を36時間で解消 | VentureBeatの報道によると、9月15日の公開後の値 | 順番待ちの解消速度で、本番導入の件数ではない |
Vercelの有料AI Gatewayチームの約13%が24時間以内に利用 | VentureBeatの報道によると、24時間以内の値 | 分母はVercelの有料AI Gatewayチーム。利用の深さや継続は書かれていない |
表の外で押さえておく点が2つあります。1つは言語です。同社のモデル説明ページは「English is the primary training language and where accuracy is currently best.」と書き、日本語を含むCJKは「handled but not equally well.」としています。もう1つは入力です。同じページは「Text only」とし、音声は受け付けません。電話で使うなら、音声認識で文字にしてから渡すことになります。
デモの数字にも触れておきます。The Registerは、同社サイトに掲載されたDoomデモでJevが0.114秒、比較したLLMが8.566秒だったと伝えています。同社が自ら掲載したデモの値で、第三者が同じ条件で測った数字ではありません。
会員先行公開中(10月3日に一般公開)



