「NV-Reason-CT vs DeepSeek V4 Pro」というタイトルと、「スキャンを読むコスト、そしてバッチを実行すべきタイミング」というサブタイトルが付いた生成済みのヒーローカード。向かい合う2枚のカードが1対の青い矢印で区切られている。左のカードには「NV-Reason-CT」というラベルとボディスキャンのアイコン、そして「CTボリューム1件 - 13,824ビジュアルトークン - 公表されたスループットなし」が記載されている。右のカードには「DeepSeek V4 Pro」というラベルとチップのアイコン、そして「合計1.6T / アクティブ49BのMoE - 1Mコンテキスト - 100万トークンあたり$0.66 / $1.98、2つのUTC時間帯で倍額」が記載されている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

NV-Reason-CT vs DeepSeek V4 Pro:スキャン読影のコスト、そしてバッチを実行すべきタイミング

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

臨床パイプラインの予算を、どんなベンチマークよりも大きく左右する運用上の事実がひとつある:DeepSeek V4 Proは入力トークン100万あたり0.66ドル、出力トークン100万あたり1.98ドルで、これらの料金は毎日2つの時間帯、UTC 01:00〜04:00と06:00〜10:00に倍になる。それらの時間帯の外で実行するバッチ処理は、時間帯内で実行する場合の半分のコストで済む。一方、NV-Reason-CTは、NVIDIAの46.9億パラメータの3D CT推論モデルだが、料金表が一切ない——ダウンロードして実行する重みの集合であり、13,824トークンのスタディ1件について公表されたスループット値もない。このうち一方のモデルはスケジュールすればよい。もう一方は、予算を立てる前に測定しなければならない。

その非対称性は、この問題に入るための有用な切り口だ。なぜなら、両モデルは対極に位置し、財務面では正反対の失敗の仕方をするからだ。NV-Reason-CT は固定費型の手段だ。購入してしまえば、限界的なスタディはほぼ無料だが、量の判断は大きく、スタディあたりのレイテンシが重い。DeepSeek V4 は変動費型のエンジンだ。購入するものは何もなく、すべてが従量制で、そのメーターにはカレンダーから読み取れるスケジュールがある。

それぞれが何なのかを、それぞれ1行で

• 役割 — NV-Reason-CTは胸部または腹部のCTボリュームを読み取り、構造化された所見を出力します。DeepSeek V4 Proはテキストを読み書きします

• アーキテクチャ — COLIPRIから初期化されたPrimusという3Dビジョントランスフォーマー。Qwen3.5-4Bの言語バックボーンと3D多軸回転位置埋め込みを備え、パラメータ数は46.9億(うち43.5億がアクティブ)。これに対し、1.6兆パラメータのMixture of Expertsはトークンあたり490億がアクティブ

• 入力 — 単一チャンネルのNIfTIボリューム(.nii、.nii.gz)。ハウンズフィールド単位、LPS配向、2 mm等方性にリサンプリングし、解剖領域にクロップ; テキストと比較

• コンテキスト — 1つのボリュームが24×24×24のグリッドで13,824の視覚トークンになり、空間ダウンサンプリングもマージ層もなし。入力1,048,576トークン、出力384,000トークンに対して

• 対応する解剖 — 胸部と腹部のみ、それ以外はなし。テキストが描写できるあらゆるものと対比して

• 価格 — リスト価格なし、セルフホスト、研究あたりのスループットは未公表。100万トークンあたり$0.66 / $1.98に対して、上記の2つのUTC時間帯で倍増、キャッシュ読み取りは$0.022

• 実測レイテンシ — 未公開。初回トークンまでの中央値3,483ミリ秒、毎秒96.01出力トークン、エラー率0.75%という結果に対して

そこにある2つの行は、それぞれ1行以上の価値がある。コンテキストの行は明らかだ——100万トークン対13,824——だが、単位は比較可能ではなく、どちらの方向であれ、それを能力差として読むのは誤りだ。13,824トークンは、CT検査1件を忠実に表現するために要する量だ。100万トークンは、保持できる周辺テキストの量だ。最初の数値は解像度についての記述であり、2番目の数値は記憶についての記述だ。

レイテンシの行は、飛ばされがちな行だ。DeepSeek V4 Proの最初のトークンまでの中央値3.48秒と毎秒96トークンは、計測済みで公表された数値であり、それによってテキスト処理ジョブを机上で見積もれる。NV-Reason-CTに相当する数値が一切ないことは、このモデルへの批判ではない。誰かが実際に動かすまでCTパイプラインのコストを見積もれない、その理由である。13,824個の視覚トークンを扱う4.69Bモデルは小さな計算ではなく、自分のハードウェアで時間を計測するまでは、推測しているにすぎない。

自分を欺かずに2つのベンチマーク記録を読む

DeepSeek V4 Proの記録は、独立した測定とベンダー側の報告が混ざり合ったものであり、その混在は示唆に富む。というのも、そこには一見すると衝撃的に見える数字が一つ含まれているが、実際にはそうではないからだ。

• Artificial Analysis Intelligence Index — 36。これは測定済みモデルの72.4パーセンタイルに位置します

• GPQA Diamond — 92.8、これは分野のトップに近い

• Humanity's Last Exam — 41、MMLU-Proでは41、数学インデックスでは62.51

• τ²-Bench — 96.20、IFBench は 76.46、tau_banking は 39.59

• 長文脈リコール — 80.33

• SciCodeとTerminal-Bench — Terminal-Benchの第2版で51と78.65

36という複合指数が、92.8というGPQA Diamondの隣に並んでいると、指数とは何か に気づくまでは矛盾のように読める。指数は多数の評価をまたいだ集約であり、そのうちのいくつかで卓越し、他ではそこそこであるモデルは、合計では中位に位置する一方で、個別のリーダーボードでは首位に立つ。36だけを引用してDeepSeek V4 Proが中位層だと主張する人は、平均を最大値であるかのように引用している。92.8だけを引用してそれが分野をリードしていると主張する人は、最大値を平均値であるかのように引用している。どちらの数字もArtificial Analysisによるもので、どちらも真実だ。

NV-Reason-CTの記録にはそのような混在はなく、それこそが率直に言ってその問題点だ。そのCT-RATEの数値——18ラベルにわたる0.614 F1と0.871 AUROCで、固定の均一なしきい値と、分類ヘッドもタスク固有の適応もなしの直接的なyes/noプロンプトを使用——はNVIDIA自身の論文にのみ由来し、他にはどこにもない。その論文の比較対象(VoxelFMが0.581、Pillar-0が0.544、ClinFusion-8Bが0.442、CT-CLIPが0.398、Merlinが0.358、MedGemma 1.5が0.303)は完全に他の画像モデルである。そこには汎用テキストモデルが一つも登場せず、第三者がこれらの数値のいずれかを再現したこともない。

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

スケジューリングの問いを、徹底的に解き明かす

DeepSeek V4 Pro の時間制料金は、どちらのモデルにとっても運用上最も実行に移しやすい点であり、具体的な手順を追って説明する価値がある。

CTプログラムにおける現実的なテキスト側の作業負荷は、華やかなものではない。過去のレポートのコーパスから構造化フィールドを抽出して、学習に使えるラベルを手に入れること、DICOMディレクトリツリーを大規模にNIfTIへ変換すること、評価ハーネスを書いては何度も書き直すこと、4つのデータセットにまたがって単位と用語を正規化すること、そしてコホートを要約することだ。中規模のプログラムなら、入力1億トークン、出力1000万トークンといったところで、これは「大量のテキスト作業」を表すために意図的に丸めた数字だ。

• 倍増したウィンドウ内 — 100万あたり$1.32と$3.96、したがってそのボリュームでは$132に加えて$39.60

• その範囲外では — 100万件あたり$0.66と$1.98、つまり$66に$19.80を加えた金額

• その差 — 約86ドル、オフピーク時の請求額の49%に当たる。本質的にバッチ処理が可能なジョブを移動させた場合の金額である

• キャッシュ読み取り — 100万件あたり$0.022、これは入力レートの60分の1であるため、コーパス全体で再利用するプロンプトプレフィックスはほぼ無料になります

それは丸め誤差ではありません。そして、作業が非同期であるからこそ利用できるのです。レポート抽出は14:00に行われる必要はありません。DICOM変換ジョブにとって、時刻は一切関係ありません。料金体系はスケジューリングへの直接的な誘いであり、それを無視するパイプラインは、気が向いたときに実行するという特権のために49%の割増料金を支払っていることになります。キャッシュ読み取りが重要である理由も同じです。共有システムプロンプトや固定の抽出スキーマは、数千のレポートで再利用され、入力レートの60分の1に収まります。

NV-Reason-CTにはそれに相当するレバーがない。メーターがないからだ。スキャンを1件読むコストは、お使いのGPUの1時間あたりのコストを、1時間に処理できるスキャン数で割ったものに等しく、そして2番目の数字こそ、誰も公表していないものだ。1件の検査が2秒で済むなら、L40S 1枚で大規模なプログラムを楽に処理できる。20秒かかるなら、ハードウェアの計算はまったく変わってくる。NVIDIAはH100とL40Sでテストしたが、それはカードのクラスを示すもので、速度を示すものではない。

それらが代替可能だと仮定することの落とし穴

この組み合わせが招く誤りは、よくあるカテゴリー錯誤よりも微妙である。というのも、スライドの上ではもっともらしく見える版が、それには存在するからだ。

DeepSeek V4 Proは1,048,576トークンを保持し、最大384,000トークンを出力する。CTボリュームは、それを正しく読むモデルの計算では、わずか13,824トークンである。したがって、100万トークンのウィンドウを持つテキストモデルなら、そのトークン数で70件余りのCT検査を収められる。算術は正しく、結論——CTデータをテキストモデルに投入し、イメージング基盤を節約できるという結論——は誤りである。その理由は、そもそも13,824という数字が存在する理由にある。

その数値は、スキャンの圧縮された要約ではない。それはスキャンそのものであり、384ミリメートルの立方体を2mm等方分解能で、8 x 8 x 8のパッチに切り分け、空間ダウンサンプリングも統合層もなしに言語モデルへ渡したものだ。トークン数が多いのは、まさに何も捨て去られなかったからだ。結節を測定可能にするスライス間隔、テクスチャを形容詞ではなく閾値にする密度値。テキストモデルは、文書がそうできないのと同じように、それらのトークンをボリュームとして取り込むことはできない。トークン数に余裕はある。インターフェースがないのだ。

論文自身の内部比較が、その差を数値で示している。MedGemma 1.5は、最大85枚の軸位断スライス——2次元またはスライス積み重ね型フロントエンドが合理的に達成できる最高の条件——を与えられた場合、0.303のF1スコアを記録するのに対し、ネイティブのボリューメトリックモデルは0.614である。この差こそが3次元エンコーダの価値であり、どれだけコンテキストウィンドウを広げても埋めることはできない。

逆置換は、より単純な理由で失敗します。NV-Reason-CTは胸部と腹部をサポートし、プロンプトではなくNIfTIファイルを入力とし、ツール使用はなく、そのモデルカードは研究と教育に限定しており、医療機器ではないこと、出力が不正確になる可能性があることを明記しています。レポートからフィールドを抽出することはできず、あなたのコーパスを構築するスクリプトを書くこともできません。

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

{{1}}私たちが適合する領域{{/1}}、そして{{2}}私たちが意図的に適合しない領域{{/2}}

DeepSeek V4 Pro は OrcaRouter 経由で deepseek/deepseek-v4-proとして、プロバイダーの定価のままマークアップゼロで、200 を超えるモデルをカバーする単一の API の中で提供されます。時間帯によって価格が変わるモデルでは、このパススルーはいつも以上に重要です。ベンダーが料金や適用時間帯を変更すると、間に古い数字を抱え込むマークアップ層が存在しないため、こちら側の料金も同じ日に変わります。自動フェイルオーバーは、プロバイダーがバッチ処理の途中で性能低下を起こした場合に対応します。長時間の無人抽出ジョブでは、まさにこれが一晩を無駄にする障害の形であり、ルーティング DSL を使えば、すべてを 1 つのエンドポイントに通すのではなく、個々のリクエストをそれを処理すべきモデルに送ることができます。

NV-Reason-CTは当社のプラットフォーム上にはありません。NVIDIAのモデルも一切ありません。このアーキテクチャのCT側は、ご自身がダウンロードした重みを使うご自身のハードウェアであり、読者にそうでないと思わせるような文を私たちが書くつもりはありません。入力が患者由来のボリュームデータであり、ライセンスがOpenMDW-1.1で、付随するホスト型サービスが一切ないことを考えれば、いずれにせよそのモデルはローカル実行にこそふさわしいのです。

ペアリングが実際に何を教えてくれるのか

2つのモデルは競合しておらず、それらを比較する意味は、失敗の仕方が異なるという点にある。NV-Reason-CTは、オープンなものの中では他にない能力——検査のフル解像度でのネイティブな3次元CT推論——を提供し、予算化されていない検査あたりのコスト、非公開のスループット、臨床展開を禁じるライセンスを受け入れるよう求める。DeepSeek V4 Proは、公開されたレイテンシ、公開されたエラー率、独立した測定値、そして時計を見るだけで半額にできる価格を備えた従量制のエンジンを提供するが、スキャンをまったく見ることができない。

購入するのではなく自分で作るのであれば、実運用に耐える形は地味なものだ。CT の読み取りはローカルで実行し、見積もりではなく計測によって予算を立て、その周りにあるテキスト関連のものはすべてオフピーク時間帯に待ち合わせさせる。誰も真似すべきでないスケジュールは、バッチがたまたま準備できたからという理由で UTC 02:00 に1億トークン分の抽出を走らせるものだ。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.