
Jev対Kev:サポートチケットでJevを上回る$95のファインチューニング
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 578 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
ジャレッド・パーマーは2026年9月20日、TypeSafe AIがJevをローンチしてから5日後にKevをリリースした。そして重要な数字はベンチマーク表には載っていない。それはREADMEにある。すべて合わせて、Modal上のH100時間で約95ドル、さらに評価データの生成に使ったJev API呼び出しが3セントだった。KevはApache-2.0で、セルフホスト可能であり、Qwen3.5のベース重みを基に構築された3つのサイズ——およそ0.8B、4B、9B——を備え、ゼロから作った決定モデルではなく、凍結したベースにrank-16のLoRAアダプタとポインタヘッドを組み付けたものだ。それはJevの型付き意思決定APIを正確に踏襲している。Choice、Score、Noulで、TypeSafe自身のPython SDKと互換になるほど近い。Jevのほうはといえば、2026年9月15日にTypeSafe AIのクローズドなホスト型System Oneモデルとしてローンチされ、キャリブレーションされた信頼度付きの型付き回答を返し、テキストは一切返さず、そのアーキテクチャ、パラメータ数、学習コンピュート、重みをこれまで一度も公開していない。したがってこの比較は、実際にはモデル比較ではない。中古のノートPCの値段で半日のうちに再現したとき、Jevの価値のどれだけが生き残るかのテストなのだ。
ベンチマークが実際に示すもの

見出しは、Kevが迫り、1つの狭いタスクでは勝利するということだ。Kevのロックされた新規ソーステストセットでは、Kev-9Bは0.837でJevの0.857に対抗した。900件のチケットにわたるサポートチケットルーティング——scienthoonセット——では、Kev-9Bは0.952でJevの0.897に対抗し、これはオープンな再現が再現対象のモデルを上回る唯一の公開結果である。Kevはまたいくつかの論理認識タスクでも優位に立つ。SemiF決定セット、144問の構造化セットでは、Jevが0.965対Kev-9Bの0.917で勝利する。
Kevが負けるときは、ひどく負ける。ドメイン外精度:Kev-8Bは79.6%で、Jevの85.7%に対して。MMLU:70%対90%。MMLU-Pro:0.515対0.840。日単位精度での日付演算:60%対93%。パターンは一貫している——Kevはラベル集合が小さくドメインが固定された狭いルーティングや分類では競争力があるが、世界知識や多段階の算術を必要とするものでは崩壊する。なぜなら、凍結された小型ベースモデル上のランク16アダプターは、世界知識が宿る場所ではないからだ。
これらの数字はすべて、Kev 自身のハーネスか第三者のトラッカーから来ており、Palmer の README には、これは制御された比較ではないとはっきり書かれている — Jev のトレーニングデータは非公開なので、そのような比較を構築する方法はない。README には、Jev の出力はトレーニングに一切使われていないとも記載されている。どちらの免責事項も、数字をより信頼できなくするどころか、より信頼できるものにする類のものだ。比較を公開している当人が、それが何を証明できないかを教えてくれているのだから。
{{1}}95ドルで手に入る、{{/1}}Jevからはいくら払っても手に入らないもの

コスト比較になると、この2つの製品はもはや比較対象にすらならない。Jevは入力100万トークンあたり0.042ドルで出力は無料であり、1回ごとの呼び出しベースでは本当に太刀打ちしにくいほど安い——しかし、それは待機リスト付きのホスト型アーリーアクセスAPIであり、TypeSafeはレート制限が予告なく変更される可能性があると述べている。Kevは自分でダウンロードする重みだ。1000万回目の分類の限界費用は、あなた自身の電気代である。
そこから4つのことが導き出されるが、それらのいずれもベンチマークスコアに関するものではない。
• データがあなたのインフラストラクチャから外部に出ることは一切ありません。Jevはホスト型エンドポイントであり、送信するあらゆる状態 — サポートチケット、ログ行、医療記録 — はTypeSafeに送られます。Kevはあなた自身のGPU上で動作し、規制対象のワークロードにとってこれは好みではなく決定的な要因です。
• レート制限なし、ウェイトリストなし、非推奨化のリスクもなし。TypeSafe自身のドキュメントには、レート制限は予告なく変更される場合があると記載されています。ローカルチェックポイントには、そのような条項はありません。
• あなたはそれをファインチューニングできます。Kevは特化するためのベースであり、それを生み出したLoRAレシピは公開されています。もしあなたのルーティングタクソノミーが、一般的なモデルではうまく扱えない40のクラスを持っているなら、あなた自身のラベルでトレーニングできます — それはまさにPalmerが行ったことで、MLチームを雇うのではなく、数十ドル単位のコストで実現しました。
• コンテキストの上限はあなたが変更できます。Jev の文書化されたリクエスト予算はおよそ 32,000 トークンで、Choice フィールドは 255 個の選択肢が上限です。Kev は Qwen3.5 のウィンドウを継承しており、それははるかに大きく、選択肢の上限はベンダーの制限ではなく、あなた自身のサービングスタックの実装上の詳細です。
Jevがまだ持っていて、Kevが持っていないもの
キャリブレーションの主張は、きれいに移行しないものであり、それはTypeSafeの売り込みの核心です。Jevは、TypeSafeがRLCDと呼ぶ方法で訓練されています — 較正された意思決定のための強化学習 — これは、答えが好まれることよりも、信頼度の値が正直であることを最適化します。Jevのすべての回答には、オプションに対する確率分布が付属しているので、コードでしきい値を設定できます。最上位のバンドでは自動的に行動し、中間ではフラグを立て、最下位ではエスカレーションします。
Kev は同じ型付き形状と同じ確率出力を生成する。API が意図的に互換になるよう作られているからだ。それらの確率が較正されているかどうかは別問題であり、正直に言えば、どちらのモデルについても信頼性ダイアグラムを公表した人はいない。別の較正監査は、隠されたポリシーの優先度タスクにおいて Jev が 44.7% の精度を記録し、期待較正誤差が 0.325 であったと報告しており、これは Jev における較正が普遍的な性質ではなく、タスクごとに急激に変動することを示唆している。そして TypeSafe 自体も、公表された挙動を信頼するのではなく、ユーザー自身のラベル付き事例に対して信頼度しきい値をテストするようユーザーに促している。
Jevのもう一つの特徴は、Qwen3.5で学習されていないことだ。rank-16アダプターを備えた9Bモデルには知識の上限があり、0.515対0.840というMMLU-Proの差は、その上限が目に見える形になったものだ。ルーティングの判断で、あるものが何であるかを知る必要が時々あるなら、Jevのより大きな非公開アーキテクチャが、Kevのアダプターにはできない仕事を担っている。
レイテンシとデプロイメント形態
Jev の文書化されたエンドツーエンド遅延は 70~500ms で、TypeSafe 自身の比較ではフロンティア LLM 呼び出しの 3~329 秒に対してであり、呼び出しに質問を追加してもほとんど変わらない。なぜなら各質問は状態の単一の共有読み取りに対して並列に評価されるからだ。H100 上の Kev-9B は単一のフォワードパスでは同じ桁になるだろうが、その比較はどちらの方向でも同一条件での比較ではない。負荷がかかった共有 GPU 上のセルフホスト型 9B は、ホスト型エンドポイントと同じ遅延ではなく、ホスト型エンドポイントは自分のラックにある筐体と同じではない。ためらいなく言えるのは、どちらもエージェントループでのターンごとの使用には十分速いということであり、Kev の遅延は約束されたサービスレベルではなく、自分が制御するハードウェアの関数であるということだ。
再現についての率直な見方
Kevが存在すること自体がJevに関する証拠であり、それは明言に値する。あるクローズドモデルの振る舞いが、公開ベース重み上で、一人の手によって、5日間と95ドルで近似できるということは、その優位性のどれだけがアーキテクチャによるもので、どれだけが学習データとサービングによるものかを物語っている。だからといってJevの構築が容易だという結論にはならない — API表面の模倣は容易だが、キャリブレーションはそうではない。しかし、それは堀がインターフェースではないことを意味しており、Jevを本番経路として評価する者は誰でも、オープンベースのファインチューニングが、そのコミットメントの何分の一かでほぼ目的を達成しうる可能性を織り込むべきだ。
これは、どちらか一方にまだ本番パスを賭けるべきではないという主張の根拠でもあります。Jev を評価しているのであれば、それにコミットせずに試してみるのが賢明な姿勢です。そして OrcaRouter は Jev を提供していません。TypeSafe のモデルはアーリーアクセスであり、独自のリクエスト形式を採用しているためです。私たちがカバーしているのは、こうした意思決定モデルが組み込まれているワークフローのうち、生成側の半分です: プロバイダの定価をそのまま 0% のマークアップで通過させた、OpenAI 互換の 1 つのキーの背後にある 200 以上のモデル、自動フェイルオーバー付き。安価な意思決定レイヤーがトラフィックを振り分け、生成モデルが残りを処理するという 2 モデル構成は、2 つ目のベンダー契約なしに私たちの側でテストできます。そして、意思決定コンポーネントがあなたのデータに対してひどく較正がずれていることが判明した場合、それがインシデントになるのを防ぐのがフェイルオーバーパスです。
評決
あなたの意思決定タスクが狭く、固定ドメインで、大量処理で、プライバシーに敏感なら、今日の時点で Kev のほうがより防御可能な選択であり、その差は僅差ではない — 重みはあなたが所有し、データ経路を制御でき、自社ラベルでファインチューニングでき、サポートチケットのルーティングでは 9B チェックポイントがすでに Jev 自身の公表数値で Jev を上回っている。あなたの意思決定タスクが世界知識、多段算術、または自動化の判断基準にしようとしている信頼度値を必要とするなら、Jev のより大きな非公開モデルとその RLCD トレーニングが実際に機能しており、Kev のアダプターはどちらの代わりにもならない。
どちらの比較でも決着しない唯一の点はキャリブレーションだ。どちらのモデルについても信頼性ダイアグラムを公表した人はいないからだ。どちらかを基準に自動化する前に、自分のラベル付きケースでそれを検証してほしい — 信頼度の値は、両製品ともデプロイごとに勝ち取らなければならない部分であり、速度はすでにコモディティ化している部分なのだ。

