生成されたタイトルカードは「Jev vs DeepSeek V4.1 Flash」と表示し、その下のサブタイトルは「1000あたり8セントは堀にはならない」で、Jev(型付きの意思決定、較正された信頼度、入力100万あたり$0.042、出力無料)とDeepSeek V4.1 Flash(生成的、100万コンテキスト、ピーク時100万あたり$0.30 / $1.20)を対比している。
Guides & Insights

Jev vs DeepSeek V4.1 Flash:1000あたり8セントは堀ではない

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Jevの問題を決める比較は、フロンティアモデルとの比較ではない。それは、2026年9月10日にリリースされたDeepSeek V4.1 Flashとの比較である。TypeSafe AIがJevを出荷する5日前だ。なぜならDeepSeek V4.1 Flashは本当に安価な生成モデルであり、Jevができることのほとんどを実行できる、その場で最も安価なものであるからだ。2026年9月に発表された独立したテストでは、標準的な意図分類セットであるBANKING77から77の例を両方に通した:Jevは1,000分類あたり7セント、精度75%という結果だった。DeepSeek V4.1 Flashは1,000あたり8セント、精度79%だった。同じテストでGPT-5.6 Lunaは12セント、83%だった。100万トークンのコンテキストウィンドウ、ネイティブのツール呼び出し、画像入力を備えた生成モデルが、専用設計の意思決定モデルに1,000分類あたり1セント差で後れを取り、—そして精度では4ポイント上回った。それがこの対決の中心にある不快な事実であり、Jevが実際に何を売っているのかを再定義する。

各モデルの役割

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, parallel evaluation against one shared read of the state, free output, and the roughly 32,000-token request budget.

JevはSystem Oneの意思決定モデルです。テキストを一切返しません。状態といくつかの型付き質問——提供したリストからのChoice、順序付きルーブリックのScore、またはNoul(キャリブレーションされた確率を伴うはい/いいえの主張)——を送信すると、信頼値付きの型付き回答を返します。すべての質問は、状態の単一の共有読み取りに対して並列に評価されます。そのため、質問を追加しても応答時間はほとんど変わらず、出力は無料です。計量すべき出力トークンが存在しないからです。入力は100万トークンあたり$0.042、出力は無料で、リクエスト予算はおよそ32,000トークンです。2026年9月15日に、Diogo Almeidaが設立し、DCVCがリードする$40Mのシードラウンドを調達したTypeSafe AIからローンチされました。

DeepSeek V4.1 Flashは従来型の生成モデルであり、そうでないふりはしていない。2026年9月10日にリリースされ、API IDは deepseek-flash で、552BパラメータのMixture-of-Expertsとして構築され、8B/16Bの非対称アクティベーション、1Mトークンのコンテキストウィンドウ、テキストと画像の入力に対応する。テキストをトークンごとに生成する。まさにこの特性が、呼び出しあたりのコストを高くし、呼び出しあたりの能力を高くしている。毎秒208.3トークンで動作し、最初のトークンまでの時間は1.13秒、価格は100万トークンあたりピーク時$0.30/$1.20、オフピーク時$0.15/$0.60。Artificial AnalysisではIndex 40に位置する — 中位であり、フロンティアではない。

分類ごとの計算がなぜその結果になるのか

1セントの差は偶然ではなく、安定しているわけでもない。それは各モデルがどのように課金するかから生じるものだ。

Jevの1判断あたりのコストは事実上固定です。入力に対する1回のパス分を支払うことになり、それは100万トークンあたり0.042ドルで、尋ねる質問の数が増えてもほとんど変わりません。1つのラベルを必要とする分類と、20個のラベルを必要とする分類では、コストはほぼ同じです。

• DeepSeek V4.1 Flash の意思決定あたりのコストは、出力に比例して増える。短いラベルへの分類は安価だが、根拠、信頼度、構造化された JSON エンベロープを求める同じタスクでは、出力トークンが数倍になり、したがって価格も数倍になる。

• ピーク時とオフピーク時では、DeepSeekの入力価格が2倍、出力価格も2倍になる。分類ジョブを誤った時間帯にバッチ処理すれば、1セントの差はまったく別の数字になる。

独立した推定値がこれほど大きく食い違うのはそのためだ。77例のBANKING77テストでは7セント対8セントだった。別の複合ベンチマークJevBenchでは、Jevが1,000件あたり$0.041、DeepSeek V4.1 Flashが1,000件あたり$0.579とされ、14倍の差があった。83件の営業担当者連絡先を対象とした3番目のテストでは、DeepSeek V4.1 Flashが1回あたり$0.183、Jevが$0.0055で、33倍の差だった。これらの数値が2桁の幅にわたるのは、それぞれが異なるプロンプト、異なる出力形状、異なる時刻を前提としていたからだ。単一の分類あたりの数値を、モデルの性質ではなく評価ハーネスの性質であるかのように引用する者は、何かを売り込んでいる。

生成モデルにはできないことを、Jevの構造があなたにもたらすもの

差別化要因は価格ではない。契約だ。Jevの出力はスキーマにロックされている。モデルが実行される前に、考え得るすべての回答が列挙されるからだ — 選択肢リスト、ルーブリック、または真偽の主張をあなたが提供した — そのため、宣言された型の外側の値を出力する余地はない。不正な形式の応答は、Jevが生成し得るものではない。DeepSeek V4.1 Flashはスキーマを使って構造化出力に制約でき、実際にはほとんどの場合それに準拠するが、その保証は構造的性質というよりも強い事前分布である。パイプラインが月に1000万件の分類を実行するなら、「ほとんど」と「常に」はインシデントレポート上の別々の明細項目だ。

二つ目の特性はキャリブレーションです。Jevは、TypeSafeがRLCD——較正された意思決定のための強化学習——と呼ぶ手法で訓練されており、すべての回答が確率分布を伴うため、コードでしきい値を設定できます。上回れば自動承認し、中間ならフラグを立て、下回ればエスカレーションする、という具合です。DeepSeek V4.1 Flashは、求めれば信頼度の数値を生成しますが、それは生成されたトークンであり、較正された出力ではありません。そして生成された信頼度は測定値ではなく、自分自身に関する主張です。この区別こそ、意思決定モデルにお金を払う理由そのものであり、安価な生成モデルが構造上決して太刀打ちできない唯一の点です。

第三はレイテンシの形状です。Jev の文書化されたエンドツーエンドレイテンシは、いくつの質問が紐づけられていても 70~500ms で、TypeSafe 自身の比較におけるフロンティア LLM 呼び出しの 3~329 秒と対照的です。DeepSeek V4.1 Flash の 1.13 秒の TTFT と 208 トークン/秒のスループットは生成モデルとして優れており、それが評価されるべき基準です — しかし、数百ミリ秒の生成出力に初回トークンレイテンシを加えても、1回の意思決定あたり数秒であり、1秒の何分の一でもありません。TypeSafe の社内ワークフローダッシュボードでは、Jev はコスト列とレイテンシ列では勝ち、精度列では負けており、請求書処理では 61.8% 対 79.1%、カスタマーサービスでは 76.0% 対 78.3% です。ダッシュボードの参照回答はグラウンドトゥルースではなくモデル判定を平均したものであり、またダッシュボード自体がハーネスバイアスの可能性を指摘しています。

コンテキストのギャップは現実であり、一方向である

ここでの一つの次元は、差が小さいわけでもなく、フレーミングの問題でもない。DeepSeek V4.1 Flash は100万トークンのコンテキストウィンドウを搭載しているが、Jev のリクエスト予算はおよそ32,000トークンだ。分類が契約書全体、長いサポートスレッド、または大きなコードファイルを読むことに依存しているなら、DeepSeek V4.1 Flash はそれを読めるが、Jev には読めない — 意思決定ごとの安さをどれだけ積み上げても、収まらない状態は解決できない。また、Jev はローンチ時点で画像入力も音声入力も受け付けないが、DeepSeek V4.1 Flash は画像を受け付ける。

裏を返せば、Jev の狭いウィンドウは制約ではなく負債であるかのように価格付けされており、TypeSafe 自身のドキュメントにある二段階パターンがその回避策だ。255 オプションの上限を超える Choice フィールドでは、候補をバッチでスコアリングし、その後スコアを横断して選択する。これは状態が小さく、オプション集合が大きい場合には機能する。状態が大きい場合には機能しない。

それぞれが属する場所

Jevに頼るべきなのは、判断が真に閉形式であり、状態が32Kトークンに収まり、1回の呼び出しにかかる秒数が実際のコストとなるほど処理量が多く、パイプラインが分岐の判断に使える信頼度の値を必要とする場合だ。ガードレールチェック、エージェントループ内でのターンごとの検証、大量トラフィックのルーティング、大規模な文書セットの並列スコアリングが、ドキュメントに記載された適合用途である。

タスクが長いものを読む必要があるとき、ラベルと並べて根拠を生成する必要があるとき、画像を見る必要があるとき、または分類がより長い生成ワークフローの一段階であり、それを別のベンダーに切り出すと、まずいプロンプトで消えかねない1セントの節約のために余分なホップが増えてしまうときには、DeepSeek V4.1 Flash を選ぼう。そして、「生成モデルにも同じことができる」はタスクの正しい説明であって、Jev の失敗ではないことに注意しよう — 興味深い問いは、信頼度の値が必要かどうかだ。なぜなら、それは比較上の唯一の明細項目であり、生成モデルがどんな価格でも提供できないものだからだ。

意思決定レイヤーと生成レイヤーを1つのキーで実行する

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash, showing the model routed through the unified API with provider list price passed through at 0% markup, plus the routing-details and failover panels.

DeepSeek V4.1 FlashはOrcaRouterがルーティングするモデルの一つで、プロバイダーの定価を0%のマークアップでそのまま透過提供しています——つまり、DeepSeekがオフピーク割引を打ち出した当日からそれが当社側でも有効になり、2つの価格表を追いかける必要はありません。Jev自体は当社では提供していません。TypeSafeのモデルはアーリーアクセスで、独自のリクエスト形式を話すためです。この比較が指し示すアーキテクチャは2モデル構成——Jevが判断し、DeepSeek V4.1 Flashが生成する——であり、OrcaRouterは単一のOpenAI互換エンドポイントの背後で生成側を担い、自動フェイルオーバーを備えているため、実績のない判断コンポーネントが単一障害点になることはありません。200以上のモデル、1つのキー、1つの請求

評決

Jevが生成モデルより劇的に安いことを期待してここに来たなら、正直に言えば、DeepSeek V4.1 Flashと比べて通常はそうではありません。そしてこの77例のテストでは、1セント安く、精度は4ポイント低かった。Jevが売っているのは、分類あたりの価格ではありません。出力が不正な形式になり得ないという構造的保証、コードが分岐に使える較正済みの信頼度、そして秒ではなくミリ秒で測られるレイテンシの下限です。これら3つは、頻繁に実行され気にするパイプラインなら対価を払う価値があります — そして、400ページの文書を読んでその要約を書くことがあなたのタスクなら、まったく価値はありません。それはDeepSeek V4.1 Flashの仕事であり、Jevの仕事だったことは決してありません。

A generated two-column scoreboard comparing Jev and DeepSeek V4.1 Flash across the same six labelled dimensions, with a footer reading "Per-classification figures from a 77-example test; not a controlled comparison."