問い合わせメールを読んで、経理か総務か営業かに振り分ける。この作業に文章はいらない。要るのは「経理」の2文字と、その判断をどれだけ信じてよいかの数字だけだ。
2026年9月15日にTypeSafe AIが公開したJevは、そこだけをやるモデルだった。文章を返さない。返すのは型の決まった値と確率。同社はこれを「System Oneモデル」と呼んでいる。
先に断っておく。Jevは早期アクセスで待機リストがあり、私はまだ動かしていない。以下の仕様と数字は、公式ブログ、公式ドキュメント、報道記事を2026年9月20日に読んで確かめた範囲だ。自分で測った値は1つもない。
返ってくるのは3つの形だけ
Jevへの質問は3種類しかない。公式ドキュメントの例を、事務の仕事に置き換えるとこうなる。
| 質問の形 | 何を返すか | 事務での例 |
|---|---|---|
| Choice | 選択肢から1つ。最大255個まで | この問い合わせの担当は経理か総務か営業か |
| Score | 順序のある段階の上の位置。2〜10段階 | 相手の不満の強さを0から2で |
| Noul | 0から1の確率 | この文面は返金を求めているか |
Choiceは選んだ答えに加えて、選択肢ごとの確率と確信度を返す。Scoreは1.035のように段階の間の値も返る。Noulは確率そのものが答えなので、別枠の確信度がない。数字がそのまま信じてよさの度合いになる。
呼び出しはHTTPでPOST https://api.typesafe.ai/v1/systemone、モデル名はjev-latest。Python向けのSDKはpip install typesafe-sdkで入り、Python3.10以上が要る。1回の呼び出しに複数の質問を並べられて、10個目の質問を足してもトークン代は増えるが時間はほとんど変わらない、と実践記事の著者は書いている。
速いのは、文章を作らないから
いまの対話型のモデルが遅いのは、答えそのものより、答えを文章にする工程が長いからだ。1文字ずつ次を予測して並べる。100字の返事には100回の予測が要る。
Jevは文章を作る機能を捨てている。状態を受け取り、1回の並列処理で型つきの値と確率を出す。だから「経理」という答えに、文章を組み立てる時間がかからない。確信度は、モデルが出した確率分布の形から計算される。分布が1つの選択肢に尖っていれば高く、散らばっていれば低い。
学習の方法も違う。対話型のモデルで使われるRLHFやRLVRではなく、TypeSafe AIはRLCD(Reinforcement Learning for Calibrated Decisions)という方法を使ったと書いている。狙いは較正だ。確信度0.9と出したものが、実際に9割当たる状態に近づける。同社は「確信度が高いほど正確」「似た入力には似た答えを返す」と説明している。
公表されている数字と、外から出てきた数字
| 項目 | 値 | 出どころ |
|---|---|---|
| 入力の料金 | 100万トークンあたり0.042ドル | 公式ブログ |
| 出力の料金 | 無料 | 公式ブログ |
| 応答時間 | 70から500ミリ秒 | 公式ブログ |
| 対話型モデルとの比較 | 0.114秒に対し8.566秒。193.6倍速く444.6倍安い | 公式の社内評価 |
| 外部の実測 | 1,018件の分類で中央値256ミリ秒 | 実践記事の著者 |
最後の行を見てほしい。公称の下限が70ミリ秒で、外の人が実際に1,018件流したら中央値256ミリ秒だった。遅いという話ではなく、公称は良い条件での値だということだ。
比較のほうはもっと差が出ている。VercelのCEOは「p95で18倍速く、より正確」と報告した。一方でBryo AIは「Geminiのほうがわずかに正確だが、10倍から20倍高い」としている。193.6倍という数字は、TypeSafe AI自身が自社のワークフローで測ったものだ。報道記事はこの点を名指しで指摘している。
事務の判定に置き換えると
毎日繰り返している判定のうち、答えが有限の選択肢に収まるものが対象になる。問い合わせメールの一次振り分け。請求書の科目の候補出し。シフト希望を受け付けてよいかの可否。どれも出力は短く、必要なのは判断と、その確からしさだ。
逆に、対象にならない仕事もはっきりしている。議事録の要約、メールの下書き、マニュアルの文章。Jevは文字列を作れないので、この種の仕事は今までどおり対話型のモデルに投げることになる。私が以前書いた議事録をAIに書かせる手順は、そのまま使い続ける領域だ。
確信度でしきい値を切る
Jevを使う使わないに関係なく、判定をAIに任せるときの型はこれになる。確信度で3つに分け、それぞれ扱いを変える。
| 確信度 | 扱い | 向く仕事 |
|---|---|---|
| 0.9以上 | そのまま自動で処理する | 定型の問い合わせ、毎月同じ取引先の請求書 |
| 0.6から0.9 | AIの案を初期値にして担当が確認する | 複数の部署にまたがる問い合わせ |
| 0.6未満 | AIの案は見ずに人が読んで決める | 初めての種類、金額の大きい取引 |
公式ドキュメントも、高い確信度は自動処理へ、中くらいは確認へ、低いものは人へ、という分け方を勧めている。金銭が動く操作は確信度0.85超といった高いしきい値にする、という例も載っている。
この表の0.9と0.6は、私が置いた仮の値だ。自分の職場で30件ほど手で答え合わせをして、間違いが混ざり始める境目を見つけて決め直してほしい。
読み違えやすい3つの点
「ハルシネーションがない」を「答えが間違わない」と読むと事故る。この言葉が指しているのは、返ってくる値が必ず決めた型に収まるということだ。選択肢にない部署名が返ることはないし、数値を求めた場所に文章が入ることもない。報道記事は「0%という数字は実測ではない。答えは間違いうる」と書いている。型が守られることと、判断が正しいことは別だ。
公称の193.6倍を、そのまま社内の企画書に書くと後で困る。上に書いたとおり、外部の報告は18倍だったり、精度で他社が上回ったりしている。自分のデータで50件ほど測ってから数字を出すほうが安全だ。
3つ目は苦手分野だ。ドキュメントは、数を正確に数えることと日付の計算が苦手だと明記している。否定表現や言外の条件も字義どおりに取る。「来月の頭までに返事が要る」を日付に変換させるような使い方は外れる。状態に関係のない情報を詰め込むほど精度が落ちる、とも書かれている。渡す情報は絞る。
待機リストのあいだに試せること
Jevが来るまで待つ必要はない。いま使っているモデルでも、判定と確信度だけを返させる型は作れる。依頼文はこれだけでいい。
次のメールを読み、JSONだけを返す。説明の文章は書かない。
{"department": "経理|総務|営業|その他", "confidence": 0から1の数, "refund": 0から1の数}
判断に迷うときは confidence を下げる。
---
(ここにメール本文)
返ってきたJSONを表に落とし、confidenceが0.6未満の行だけ人が読む。この運用に慣れておけば、Jevが使えるようになったときに、置き換えるのは呼び出し部分だけで済む。
ただし1つ注意がある。対話型モデルが自己申告する確信度は較正されていない。0.9と書いてあっても9割当たる保証はなく、根拠なく高い数字を出す傾向がある。較正を売りにしているJevの確信度とは別物だと思って、しきい値は手元の答え合わせで決めること。
使うかどうかの判断
同じ判定を毎日100件以上しているなら、待機リストに登録して自分のデータで測る価値がある。料金の桁が変わるので、件数が多いほど差が出る。
月に数十件なら、いまのモデルで足りる。呼び出し先を増やすと、APIキーの管理も監視も増える。件数の少ない判定のために増やす手間ではない。
私自身は待機リストに並んで、使えるようになったら問い合わせの振り分けで50件を手で答え合わせするつもりだ。その結果は、出たらこの記事に追記する。
出典(すべて2026年9月20日確認): TypeSafe AI「Introducing System One Models & Jev」(公式ブログ)、TypeSafe AI公式ドキュメント(System One、Quick Start)、gihyo.jp「TypeSafe AI、AIモデル「Jev」の早期提供を開始」、MarkTechPost「TypeSafe AI Releases Jev」、DEV Community「How to Use Jev」。



