
NV-Reason-CT 対 Grok 4.6:スキャンを読むのは誰で、レポートを読むのは誰か
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 45 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
CTパイプラインにAIを載せる方法は2つあり、そのうち画像に関わるのは片方だけだ。NV-Reason-CTはその1つ目である。NIfTIボリュームを直接読み取る46.9億パラメータの3D視覚言語モデルで、NVIDIAからのローンチ投稿もないまま、2026年9月8日にHugging Faceへ公開された。Grok 4.6は2つ目である。2026年8月12日にリリースされた50万トークンのテキスト・画像モデルで、入力トークン100万あたり2.00ドル、そして誰かがすでに所見を書き終えた後に発生する仕事の部分が非常に得意だ。両者を比較に並べると、いつもの問い——どちらが優れているか——は的外れであることが分かる。両者はパイプラインの同じスロットを争っているのではない。同じ予算の行を争っているのだ。
それぞれの側で実際に出荷されたもの
NV-Reason-CTは製品としてではなく、リポジトリ、論文、デモスペースとして登場した。NVIDIA-MedtechのGitHubリポジトリは2026年9月2日に作成され、Hugging Faceの重みは9月8日に続いた。arXivプレプリント、NV-Reason-CT: CT解析のための3D視覚言語モデルは、9月23日にNVIDIA、NIH、チューリッヒ大学の16名の著者によって公開された。NVIDIAのニュースルームにはこれに関する記載は一切ない。モデルカードにはバージョン0.1と記載されており、研究および教育での使用に制限されている。
Grok 4.6 は対極的な種類のリリースだ。第一級の商用エンドポイントであり、ベンダーの開発者向けドキュメントでは「Latest」として掲載され、公開された料金表に基づいて価格が設定され、既存の統合がベース URL を変更するだけで採用できる OpenAI 互換モデルとして利用できる。Grok 4.5 の後継であり、同じコンテキストウィンドウ、同じ入力サーフェス、同じ基本価格を備えている。
その非対称性こそが、この比較の全体像だ。一方は、たまたまダウンロードできるようになっている研究用の成果物。もう一方は、インフラストラクチャーである。両者を突き合わせて読むことで、医用画像の世界において「研究用の成果物」と「インフラストラクチャー」の境界線が現在どこに引かれているのかが見えてくる——そしてそれは、あなたが想像するような場所ではない。
投入と産出における分業
• ボリューム入力 — NV-Reason-CT は .nii/.nii.gz NIfTI ボリュームをハウンズフィールド単位で読み取り、胸部または腹部のみに対応 vs Grok 4.6 はテキスト、画像、ファイルを読み取り、ボリューム経路はない • 空間処理 — NV-Reason-CT は 384×384×384 mm のボリュームを 3D MRoPE を用いて 24×24×24 グリッドの 13,824 トークンに変換し、ダウンサンプリングなし vs Grok 4.6 は画像を 2D 画像として扱う • コンテキスト — NV-Reason-CT では 1 ボリュームが 1 つの固定プレフィックスで、通常の意味でのコンテキストウィンドウはない vs Grok 4.6 は 500,000 トークン • 出力 — NV-Reason-CT は構造化レポート、回答、または思考を無効化可能な推論トレース vs Grok 4.6 は構造化出力とツール呼び出しを備えたテキスト • ライセンス — NV-Reason-CT は OpenMDW-1.1、10.6 GB の BF16 重み vs Grok 4.6 はプロプライエタリ、API のみ • 価格 — NV-Reason-CT は GPU 設備投資で、トークンあたりの料金なし vs Grok 4.6 は 100 万トークンあたり $2.00 / $6.00、200K 入力超では 2 倍

この2つは自然な引き継ぎとして読める。NV-Reason-CTがボリュームから所見を生成し、Grok 4.6は、そうした所見を1,000件、1つのコンテキストウィンドウに渡して、コホート全体を横断するパターンを探すことになるモデルだ。誰もそのパイプラインを公表していない。それは明白なアーキテクチャであり、それが未検証であることは率直に言っておく価値がある。
Grok 4.6の数値、そしてそれは誰のものか
Grok 4.6について2つの数値が一緒に出回っているが、それらは同じ種類のものではない。GPQA Diamondのスコア94.9はArtificial Analysisによって測定されたもので、ベンダーが報告したものではない——第三者が実施したからこそ、この2つのカテゴリーのうち信頼性が高いのはこちらである。Artificial Analysis Intelligence Indexのスコア44は、インデックス改訂版v4.3.2において、Grok 4.6を同クラス211中28位に位置づけている。Artificial Analysisはまた、このモデルをプロプライエタリとして記録している。重みは公開されていない。
同じボード上で、AAはTerminal-Bench 2.1を88.4、SciCodeを56.5、Humanity's Last Examを42.9、𝜏²-bankingを50.7、長文脈リコールを80.3と測定している。これらは汎用推論を測る計器だ。そのどれも3D CTボリューム上では実行できず、これはGrok 4.6への批判ではない——ベンチマークスイートが何を測定しているかについての言明である。
CT側には表がちょうど1つしかなく、それは著者らのものである。
NV-Reason-CTの公開エビデンス基盤の全体は、CT-RATEの18ラベルに関する1つの分類表のみであり、固定された均一な閾値のもと、分類ヘッドを用いずに直接的なYes/Noプロンプトを使っている。報告されているのはMacro-F1 0.614およびMacro-AUROC 0.871で、これに対してVoxelFMは0.581/0.870、Pillar-0は0.544/0.861、ClinFusion-8Bは0.442、CT-CLIPは0.398/0.733、Merlinは0.358/0.662、MedGemma 1.5は0.303である。
これらはベンダーによる報告であり、モデルカードに基づくもので、まだ独立した第三者によって再現されていないため、そのように位置づけている。表の中で注目すべき点が2つある。VoxelFMに対するF1の差は0.033で、固定閾値における18ラベルでは実際に意味のある隔たりである。同じモデルに対するAUROCの差は0.001で、これは引き分けである。どちらの数値も同じ表の同じ行に現れているが、主張を伴っているのはそのうち片方だけである。
この表が示しているもう一つのことは、論文自体の枠組みに関するものだ。比較モデルは、3D対照事前学習システム、2D/3D融合型の生成MLLM、そしてスライスベースのフロンティアモデルである。著者たちがボリュームを入力とするシステムをベンチマーク対象に選んだのは、ここで意味のある主張が、生成3Dモデルがヘッドなしの分類で識別3Dモデルを上回り得るということだけだからだ。NV-Reason-CTが汎用フロンティアモデルとどの点で比べられるかについては何も述べていない。その比較はこの軸上には存在しないからである。

お金はどこへ行くのか、そしてなぜティアの境界が重要なのか
Grok 4.6の料金表には、多くのアーキテクチャを静かに左右する細部がある。200K入力トークンを超えるプロンプトには基本料金の2倍が課金される——入力$4.00、出力$12.00で、キャッシュ読み取り料金は$0.50から$1.00に上がる。調査結果を1つの長いコンテキストに蓄積していくコホートレビューのジョブは、まさにその線を越えるワークロードだ。そのしきい値を下回る場合、100万トークンあたり$0.50というキャッシュ読み取り料金は入力価格の4分の1であり、それこそが、大きな固定プレフィックスを何千ものレポートに対してループ処理することを、単に可能にするだけでなく手頃なものにしている。
OrcaRouterを通じて、Grok 4.6はそのプロバイダー定価で、マークアップゼロで提供されます。したがって、上記の階層の計算は、実際にお支払いいただく計算そのものであり、将来それが調整された場合も、次回の更新時ではなくその日のうちに請求に反映されます。このようなジョブを、単一のエンドポイントをハードコードするのではなくルーティングする理由は、臨床パイプラインのコホートレビューを担う部分こそ、最終決定を下す前に3つの異なるモデルを試したくなる場面だからです。—そして、プロバイダー間の自動フェイルオーバーを備えた1つのOpenAI互換キーであれば、その実験にかかるのはモデル名の変更だけです。
パイプラインの CT 側には、そのようなオプションはありません。NL-Re-Re は OrcaRouter 上でホストされていません。これは、自分で実行するカスタムモデルを備えた 10.6 GB のチェックポイントで、Ampere、Hopper、Lovelace 上で、trust_remote_code=True を使って動かすものです。そうでないかのように示唆するつもりはありません。このパイプラインを構築するということは、片方の半分のために GPU を、もう片方のためにトークンを購入するということです。そして、少なくとも両方の半分を 1 つのコンソールから管理できるという事実こそが、主張する価値のある唯一の統合ポイントです。

第二の読者には実際どれほどの価値があるのか
NV-Reason-CT論文には、専門放射線科医による予備的研究が含まれており、そこでは「AI支援レビューに対する良好な信頼度評価」と、報告された読影・報告時間の平均50%短縮が報告されている。これらは強い数字であり、論文自体が述べている注意点が付きまとう。すなわち予備的であり、著者自身の研究デザインである。公表された独立再現はなく、対照を設定した読影研究における50%の時間短縮は、再現が行われると縮小する類の結果まさにそのものである。注視する価値はある。確立したものとして引用する価値はない。
それと照らし合わせて読むと、Grok 4.6 の放射線科ワークフローへの貢献は、診断ではまったくない。それはレポートを読む層だ — トリアージキュー、フォローアップレター、コーディング、事前承認パケット。その作業はテキストであり、大量にあり、1件あたりは安く、間違えたときの失敗の仕方は臨床的というより事務的だ。また、500K のコンテキストウィンドウと $0.50 のキャッシュ読み取りが真にその価値を発揮する場所でもある。
つまり、この比較が行き着く分断は露骨だ。NV-Reason-CTには本物の3D経路があり、流通も価格も、独立した検証もない。Grok 4.6には流通があり、価格があり、独立したベンチマーク評価もあり、ボリュメトリック経路はまったくない。スキャンの読影が必要なら、それができるのはこのうち片方だけだ。スキャンにまつわる書類処理を片付けたいなら、製品と言えるのはもう片方だけだ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
