「NV-Reason-CT vs Nemotron 3 Ultra」というタイトルの生成ヒーローカードがあり、サブタイトルは「1つのロゴ、2つのリリース哲学」。下部には3つのチップが並ぶ:「合計4.69B vs 550B/アクティブ55B」、「~10.6 GB BF16 vs 数百GB」、「2026年9月8日リリース vs 6月4日リリース」。OrcaRouterのロゴが右下に合成されている。
Guides & Insights

NV-Reason-CT vs Nemotron 3 Ultra:ひとつのロゴ、ふたつのリリース哲学

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

NVIDIAは今年2つのオープンウェイトモデルを出荷しながら、そのうち1つについては誰にも知らせなかった。Nemotron 3 Ultraは2026年6月4日にHugging Faceで公開され、総パラメータ550B・アクティブ55Bのフラッグシップとして、技術レポート、OpenMDW-1.1ライセンス体制、そしてその背後にあるオープンな事前学習および事後学習データセットの完全なリリースを伴っていた。NV-Reason-CTは2026年9月8日に4.69BパラメータのCT専門モデルとして公開され、リポジトリ、デモSpace、そして2週間後のarXivプレプリントがあり、その引用ブロックでこのリリースに言及している。2つ目については告知がなかった。両者を比較しても、実際には能力を比較しているわけではない——550Bの汎用フラッグシップと4.69Bの医療専門モデルは重ならない。比較しているのは、モデルをどう公開するかについての2つの異なる理論であり、どちらも同じ企業によって、3か月違いで運用されたものだ。

各リポジトリに実際に含まれている内容

Nemotron 3 Ultra のリリースは完全なオープンパイプラインです。Hugging Face 上の NVFP4 チェックポイントは 249,746 ダウンロードと 338 いいねを集めており、BF16 版、ベースチェックポイント、ポストトレーニングデータセットもすべて併せて公開されています。12言語対応、テキストのみで、マルチトークン予測を備えた潜在 Mixture-of-Experts Mamba2-Transformer ハイブリッドに基づいて構築され、openmdw-1.1 ライセンスを採用しています。Artificial Analysis は、出荷される NVFP4 精度で Intelligence Index 47.7、フル精度で 48.2 と評価しており、同ボードによれば、これは米国のオープンウェイトモデルの中で最高です。以前の Nemotron 教師モデルに関する当社の報道では、プロバイダー価格の中央値が入力100万トークンあたり約 $0.60、出力100万トークンあたり $2.60 であり、サードパーティ測定における NVIDIA の毎秒183出力トークンというスループット値も記録しています。

NV-Reason-CTは、はるかに小さく、はるかに閉鎖的な成果物です。10.6ギガバイトのBF16重み、10 KBのmodel.py、26 KBのprocessor.py、チャットテンプレート、およびinference.py。デモSpaceが1つ。論文が1本。今週時点で210ダウンロード。データセットのリリースなし。技術レポートなし。単一ボリュームの例以外にサービング構成なし。

この対比は規模の話ではない — 下流のエンジニアがその成果物を使って何を行えるかの話だ。Ultra のリリースは、他の誰かがトレーニングを再現できるように設計されている。NV-Reason-CT のリリースは、他の誰かが推論を実行できるように設計されている。これらは異なる約束だ。

それらのうち1つだけがNVIDIA独自のスタック上に構築されています

人々を驚かせる詳細はここにあり、それはモデルのフロントマターから検証できます。NV-Reason-CT のベースモデルはQwen/Qwen3.5-4Bであり、ファインチューン関係にあり、Nemotron のチェックポイントではありません。NVIDIA は、COLIPRI から初期化された Primus 3D ビジョントランスフォーマーを Qwen 言語モデルに接続し、教師ありファインチューニングとそれに続く Group Relative Policy Optimization を用いて、そのペアをエンドツーエンドでトレーニングしました。

それは批判ではなく、スキャンダルでもない。視覚言語の仕事では業界の標準であり、NVIDIAはリポジトリのメタデータでそれを明瞭に開示している。しかし、それはこの組み合わせについての最も自然な想定――NV-Reason-CTがNemotronの派生であるという想定――が誤りであることを意味する。このページの2つのモデルが共有しているのはロゴとライセンスファミリーだけで、本質的に他には何も共有していない。共有されたアーキテクチャも、共有されたトークナイザーも、共有された学習データも、共有されたサービング経路もない。

サイズ、どこで実行されるかを決める数値で

• パラメータ — NV-Reason-CT は合計 4.69B / CT 経路でアクティブ 4.35B 対 Nemotron 3 Ultra は合計 550B / アクティブ 55B のスパース LatentMoE • ディスク上のチェックポイント — NV-Reason-CT は約 10.6 GB BF16 対 Nemotron 3 Ultra は BF16 で数百ギガバイト、さらに NVFP4 でも公開 • 入力 — NV-Reason-CT は Hounsfield 単位の 3D NIfTI CT ボリューム、胸部または腹部のみ、1 つの 13,824 トークンのボリュームプレフィックス 対 Nemotron 3 Ultra はテキスト、最大 1M トークンのコンテキストで出力上限 65K • コンテキスト — NV-Reason-CT は通常の意味では該当なし 対 Nemotron 3 Ultra は 1,000,000 トークン • ライセンス — 両方とも OpenMDW-1.1 • ハードウェア — NV-Reason-CT は Ampere / Hopper / Lovelace、H100 と L40S でテスト済み 対 Nemotron 3 Ultra は 55B アクティブでのマルチ GPU サービング • 独立スコア — NV-Reason-CT は公開なし 対 Nemotron 3 Ultra は AA Intelligence Index 47.7 NVFP4 / 48.2 フル精度

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

実用上の線引きはメモリのほうだ。3Dエンコーダーを備えた4.69Bモデルなら1枚のカードに収まり、研究グループならそれを正当化できる。総パラメータ550Bでアクティブ55Bのモデルは、量子化しても本格的なサービング基盤を必要とする。どちらも週末の実験ではないが、その問題の桁は違う。

平均化できない二つの評価レジーム

Ultraの根拠は汎用能力にある。Artificial Analysis Intelligence Indexは40代後半で、推論、コーディング、エージェントタスクにわたるベンチマークを網羅しており、さらにこのファミリーについてベンダーが報告した数値として、SWE-Bench Verified 71.9、MMLU-Pro 86.8、LiveCodeBench v6 89.0がある——この最後の3つはNVIDIA自身の数値であり、その旨が明記されている。

NV-Reason-CTの証拠は1つの表である。CT-RATEの18ラベル分類タスクにおいて、固定の均一なしきい値で、分類ヘッドを用いず、直接的なYes/Noプロンプトを使用して、Macro-F1 0.614およびMacro-AUROC 0.871。VoxelFMの0.581/0.870、Pillar-0の0.544/0.861、ClinFusion-8Bの0.442、CT-CLIPの0.398/0.733、Merlinの0.358/0.662、MedGemma 1.5の0.303に対して。再びNVIDIAの数値であり、モデルカード上のもので、独立した再現はまだない。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

AA Intelligence Index の 47.7 と CT-RATE Macro-F1 の 0.614 は、同じ一つのものを測った二つの測定値ではない。それらは二つのものを測った測定値である。Ultra が NV-Reason-CT より「優れている」と言うのに擁護できる方法は存在せず、その理由は採点の好みではない。測定指標がまったく重なっていないからである。この組み合わせで唯一正直な比較は、各モデルが何に対して認定されているか、つまりそれがその仕事を果たすという証拠が存在するとはどういうことかという文字通りの意味での比較だけである。

なぜ静かなリリースが合理的な選択なのか

自分が医療画像チームにいると想像してください。動作する3D CTモデルがあります。放射線科医、医学生、研究者にそれを使ってもらいたいと考えています。基調講演をすると、何が得られますか?

ローンチイベントは、サポート、ロードマップ、長期的な持続性について、研究チームには応えられない期待を高める。それは、4.69Bのモダリティ固定モデルが、構造的に無関係な理由でぱっとしないように見えるベンチマークでの汎用評価を招く。そして、明示的に「専門的な臨床判断の代替として使用してはならない」モデルを、ライセンス条項を読まないオーディエンスの前にさらす。リポジトリ、論文、デモSpaceは、その3つすべてを読むオーディエンスにちょうど届き、アーティファクトをそれ自身のペースで語らせる。バージョン文字列は「0.1」。カードには研究および教育のみと書かれている。それは、購入されるためではなく、引用されるために設計されたリリースだ。

Ultraのリリースは真逆で、同じくらい合理的だ——フラッグシップには流通、料金表、エコシステムのサポートが必要であり、だからこそデータセットとレポートが付属していたのだ。

ルーターが適する場面と、適さない場面

これらのモデルはいずれもOrcaRouter上にはなく、そうでないと示唆するつもりもありません。NV-Reason-CTは、ご自身でホストするカスタムモデルコードを伴う10.6 GBのチェックポイントであり、Nemotron 3 Ultraは55Bのアクティブパラメータで、NVIDIA自身のAPIおよび複数のサードパーティプラットフォームを通じて提供されています。

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

両方を扱うチームにとって、ルーティングレイヤーが果たす役割はより限定的だが、それでも有用だ。大量処理にNV-Reason-CTを使い、周辺テキストに汎用モデルを使う臨床研究パイプラインは、2つ目の契約なしでその汎用モデルを差し替えられる場所を必要としており、200以上のモデルをカバーする単一のOpenAI互換エンドポイントで、プロバイダー間の自動フェイルオーバーを備えたものが、その場所だ。これにより、自己ホスト型の専門モデルとホスト型の汎用モデルを、2つの統合ではなく1つのキーの下に保てる。

ペアリングから何を得るか

競合として読めば、この2つのモデルはカテゴリー錯誤である。ケーススタディとして読めば、異例なほど明快だ。同じベンダー、同じライセンス体系、同じ年——そして、まったく異なる2つの下流意図に合わせて選ばれた2つのリリース戦略。一方は、エコシステムを伴うインフラストラクチャー。もう一方は重みを伴う論文であり、特定の小規模な読者層がそれを実行し、引用できるようにリリースされたものだ。

汎用的なオープンウェイトモデルを探しているなら、NV-Reason-CT は候補ではなく、そもそもそうしたものになることを意図していなかった。胸部および腹部の CT ボリュームをプログラムで読むなら、Nemotron 3 Ultra は役に立てず、そもそもそのためのものではなかった。両者に本当に重なるのはロゴだけであり、唯一の本当の教訓は、対象読者が十分に少なく、かつ自力でリポジトリを見つけられるほど技術に通じているなら、NVIDIA は静かに出荷する用意があるということだ。