生成されたヒーローカードは「NV-Reason-CT vs GPT-5.6 Sol」というタイトルで、サブタイトルは「13,824 visual tokens before you type a word」。下部には3つのチップが並ぶ:「4.69B CT specialist vs undisclosed」「3D NIfTI in, findings out」「Sol: 1,050,000 in / 128,000 out」。OrcaRouter のロゴが右下に合成されている。
Guides & Insights

NV-Reason-CT 対 GPT-5.6 Sol:単語を入力する前に13,824個の視覚トークン

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

送信する胸部CTは1件ごとに、NV-Reason-CTプロンプトが始まる前に13,824個の視覚トークンを消費する。これは癖でもチューニング上の選択でもない——設計そのものだ。このモデルがネイティブに備える3Dビジョンエンコーダは、384×384×384mmのボリュームを24×24×24のグリッドに変換し、モデルカードには13,824個のトークンとその三次元座標すべてが「空間的ダウンサンプリングなしで」言語モデルに届くと明記されている。これを、おそらくすでに支払っているものと比べてみてほしい。GPT-5.6 Solはテキスト、画像、ファイルを受け付け、そこに送られる画像は2Dの絵だ——スライス、DICOMビューアのスクリーンショット、PDFから貼り付けた放射線画像。一方のモデルにはボリュームを扱う経路がある。もう一方にあるのはコンテキストウィンドウだ。両者を比べるほとんどの比較はこの違いのところで崩壊し、そしてその崩壊こそが面白いところなのだ。

誰も発表しなかったリリース

NVIDIAはNV-Reason-CTについて、ニュースルームで一言も発表していない。ローンチ記事もなく、基調講演のスライドも、プレスリリースもない。存在するのは、2026年9月8日に作成されたHugging Faceリポジトリ、9月2日に作成されたNVIDIA-Medtech組織配下のGitHubリポジトリ、GradioのデモSpace、そしてarXivプレプリント——NV-Reason-CT:CT解析のための3D視覚言語モデル——2026年9月23日に、NVIDIAの16名の著者チームがNIHとチューリッヒ大学の共著者らとともに投稿したものである。

それは実際に存在するパターンであり、謎として扱うよりも正確に名付ける価値がある。NVIDIAの医療画像グループは重みを静かに公開し、告知は論文とリポジトリに任せる。前身のNV-Reason-CXR-3Bも、2025年10月に同じ形で登場した。ここでの違いは規模だ。同グループがそのレシピを2D X線からネイティブな3Dボリュームへ拡張したのはこれが初めてで、論文は2日前のものだ。

リポジトリから知り得ること:アーキテクチャ、ライセンス、学習データ、ベンチマーク表。まだ確認されていないこと:NVIDIAがこれをサポート対象の製品ラインとして位置づける意図があるのか、さらにチェックポイントが続くのか、そして著者以外の誰かの評価にどれだけ耐えうるのか。リポジトリはバージョン0.1で、研究・教育専用と説明されている。

各モデルが実際に受け付けるもの

ここから、一対一の比較が一気に正直になるところだ。この2つのモデルは入力サーフェスを共有していない。

NV-Reason-CT は NIfTI ボリューム — .nii または .nii.gz — を、ボクセル値がハウンズフィールド単位で読み込みます。肺のハウンズフィールド単位と3次元モルフォロジーヒューリスティックを用いて胸部または腹部に自動的にクロップし、2mm 等方性解像度にリサンプリングし、解剖値として "chest" または "abdomen" のみを受け付けます。出力はテキストです。構造化レポート、回答、または段階的な推論トレースで、短い回答のために推論をオフにするスイッチがあります。

GPT-5.6 Solはテキスト、画像、ファイルを読み取り、1,050,000トークンのコンテキストウィンドウと、1回の応答で最大128,000出力トークンを備えています。ボリュメトリックエンコーダーはありません。CTを入力するには、まず300枚余りのスライスを2D画像エンコーダーが受け入れられる形に平坦化する方法を決めなければなりません — モンタージュ、少数のキースライス、レンダリングされた最大値投影などです。これらの選択はいずれも、3D経路が保持するために作られた空間的関係を捨て去ります。

つまり、率直な捉え方は「どちらのモデルがより賢いか」ではない。そうではなく、Sol の画像経路と NV-Reason-CT の3D経路は異なる問いに答えているということだ。Sol は放射線科医によるスキャンの説明について推論できる。NV-Reason-CT はそのスキャンについて推論できる。

1つのベンチマークが存在し、そのうちの1つだけに番号が付いている

NV-Reason-CTは、CT-RATEの18ラベル分類タスクにおいて、分類ヘッドもタスク固有の適応も用いず、直接的なYes/Noプロンプトを使用して、Macro-F1 0.614およびMacro-AUROC 0.871を報告している。これらはモデルカードに記載された著者自身の数値であり、有用なのは比較行の方だ:VoxelFMはMacro-F1 0.581、Pillar-0は0.544、ClinFusion-8Bは0.442、CT-CLIPは0.398、Merlinは0.358、MedGemma 1.5は0.303。同じ固定の均一しきい値上で、生成3Dモデルは3D対照事前学習ベースラインおよびスライスベースのフロンティアモデルを上回っている。

その表の1つの数値は、繰り返すよりも懐疑的に見るに値する。AUROCの差である。NV-Reason-CTは0.871、VoxelFMは0.870と報告している。ベンダーが実施した評価における1000分の1ポイントは勝利ではなく、その評価が帯びるノイズの範囲内での引き分けである。0.033というMacro-F1の差こそが、裏付けられた主張である。

GPT-5.6 SolにはCT-RATEの数値がない。CT-RATEはそれが実行できるベンチマークではないからだ。それにはArtificial Analysis Intelligence Indexが47、AAが測定したGPQA Diamondスコアが94.1、Humanity's Last Examスコアが49.5がある——いずれも一般的な推論を測る指標だ。0.614のMacro-F1をAA Indexの47の横に並べるのは、二つの異なる物差しで算術をするようなものだ。私はそんなことはしないし、そうする人は誰であれ疑うべきだ。

2つの異なる製品の推論トレース

両方のモデルは推論を出力する。それが唯一の真に哲学的な共通点であり、その違いは示唆に富んでいる。

GPT-5.6 Solは設定可能な推論エフォートを提供しているため、レイテンシとコストをリクエストごとの深さと引き換えにでき、推論を返してもらうようinclude_reasoningを通じてリクエストできます。これは、送信する内容すべてに適用される汎用的な機能です。

NV-Reason-CTの推論は意図的に狭く設計されている。学習コーパスは、70,111件の固有のCTボリュームから抽出された約55万件の構造化QA例で、その一部は、録音・文字起こしされた専門家の読影から収集された放射線科医執筆の推論である。SFTに続くGRPO段階では、胸部および腹部異常セットに対する検証可能な報酬を用いる。つまり、報酬シグナルは、記述された所見が実際にそのボリューム内に存在するかどうかに基づいており、文章が読みやすいかどうかではない。モデルカードは、出力を「レビュー可能な所見、鑑別診断、不確実性」と説明し、生成された推論は「モデルの内部計算を表すことを保証されない」という明示的な注意を添えている。この注意は実際に重要な役割を果たしている。それは、データと照合して確認できるトレースと、ただ鑑賞するしかないトレースの違いなのだ。

サイズとライセンスを、一度に

• パラメータ — NV-Reason-CT は合計 4.69B / CT 経路でアクティブ 4.35B、Qwen3.5-4B バックボーン + Primus 3D ViT から構成 vs GPT-5.6 Sol は非公開 • チェックポイントサイズ — NV-Reason-CT 約10.6 GB BF16 safetensors、Ampere/Hopper/Lovelace で動作 vs GPT-5.6 Sol は API のみ • 入力 — Hounsfield 単位の 3D NIfTI CT ボリューム vs テキスト、画像、ファイル • コンテキスト — NV-Reason-CT は該当なし、1 ボリュームは 1 つの固定 13,824 トークンプレフィックス vs Sol は入力 1,050,000 トークン、出力 128,000 トークン • ライセンス — OpenMDW-1.1、重みはダウンロード可能 vs プロプライエタリ、API アクセスのみ • 提供状況 — ベンダーリポジトリと独自の重み vs OrcaRouter でルーティング、$4.00 / $20.00(100 万トークンあたり)、Sol の料金は入力 272K トークンを超えると $8.00 / $30.00 に倍増

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

その別れが実際にあなたに及ぼす代償

コスト比較は、ワークロードが異なることを認めて初めて意味を持ちます。ですので、実際に意味が通るのはこちらです。

Solはトークン単位で課金され、その価格には段差がある。プロンプトが272Kトークンまでは、入力100万トークンあたり4.00ドル、出力100万トークンあたり20.00ドルで、それを超えると8.00ドルと30.00ドルになる。OrcaRouterでは、OpenAI自身の定価のままマークアップゼロで提供されている。これは聞こえ以上に重要だ。表示されるレートはOpenAIが公表しているレートそのものなので、価格が動けば次の契約更新時ではなく当日に請求へ反映される。キャッシュ読み取りレートは100万トークンあたり0.40ドルで、入力の10分の1だ。これが、大きな固定プレフィックスを伴う長いエージェントループを算数的に成り立たせている。

NV-Reason-CTにはトークンあたりの価格が一切ない。10.6 GBをダウンロードし、GPUの代金を支払う。これは設備投資か運用費かという問題であり、答えは1つしかない。十分に高い利用量であれば、アクティブパラメータ4.35Bのモデルをセルフホストする方がコストで勝る。それ未満の利用量では勝てず、分岐点はGPU利用率に完全に依存する。NVIDIA以外の誰も、このチェックポイントのスループット値をまだ公表していない。したがって、分岐点を提示する人は推測しているにすぎない。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

ここでルーターが役立つのは、ワークフローの中でスキャンではない部分です。本番の臨床研究パイプラインは、単一のモデルであることはほとんどありません——それは抽出、推論ステップ、要約ステップ、時にはセカンドオピニオンです。OrcaRouter は200以上のモデルをOpenAI互換の単一エンドポイントの背後に公開し、プロバイダー間の自動フェイルオーバーを備えているため、そのパイプラインの汎用の半分は、2つ目の契約なしで差し替えたり経路を変更したりできます。NV-Reason-CT は、私たちがルーティングするモデルの1つではありません。それは自分で実行するチェックポイントです。パイプラインの2つの半分は、依然として1つのキーの背後に置くことができます。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

未解決の問題

NV-Reason-CTは、論文としては公開から2日、リポジトリとしては17日しか経っていない。そしてそれが属する分野は、次のデータ点が有益な情報となるほど小さい。注目すべきは3点だ。CT-RATEの独立した再現、このファミリーにおける2つ目のチェックポイント、そしてNVIDIAの医療部門がこれを単発の論文ではなく製品ラインとして扱っている兆候。それまでは、擁護できる立場は狭く、しかし明確だ――これは現在ダウンロード可能な中で最も強力なネイティブ3D CT推論チェックポイントであり、著者自身の表に基づく評価では、CTを読むこと以外の何においても汎用フロンティアモデルの代替にはならない。