「NV-Reason-CT vs Claude Opus 5」というタイトルの生成されたヒーローカード。サブタイトルは「真剣に受け止める価値のあるカテゴリーエラー」。向かい合う2枚のカードは、1対の青い矢印で区切られている:左のカードには「NV-Reason-CT」というラベルが付いており、ボディスキャンのアイコンと「4.69Bパラメータ - CTボリュームあたり13,824トークン - 医療機器ではありません」が表示されている。右のカードには「Claude Opus 5」というラベルが付いており、チップのアイコンと「1Mコンテキスト - 128K出力 - 100万トークンあたり$5 / $25」が表示されている。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

NV-Reason-CT vs Claude Opus 5:真剣に受け止める価値のあるカテゴリー錯誤

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

を同じ文に入れることNV-Reason-CTとClaude Opus 5はカテゴリー錯誤であり、それでもなおやる価値がある。なぜならその錯誤は示唆に富むからだ。NV-Reason-CT は NVIDIA による 46.9 億パラメータのネイティブ 3D 視覚言語モデルで、胸部または腹部の CT ボリュームをハウンズフィールド単位で受け取り、所見ごとに構造化された記述を生成する。これは医療機器ではなく、そのモデルカードにもそう記されている。Claude Opus 5 はベンダーの汎用フロンティアテキスト・視覚モデルで、2026年7月24日にリリースされ、100万トークンのコンテキストウィンドウ、128,000トークンの出力上限、公表レートは入力100万トークンあたり5ドル、出力100万トークンあたり25ドルである。一方は CT を読む。もう一方はそれ以外のすべてを読む。

この比較が繰り返される理由——そして、誰かが新しい医療VLMを見て、おなじみの物差しに手を伸ばすたびに、それはこれからも繰り返されるだろう——は、どちらも画像についての文章を生成するという点にある。その表面的な類似性は、人々が両者について推論する仕方に実際に悪影響を及ぼしている。だからこそ、詳細に解きほぐす価値がある。

彼らが実際に共有している軸、そして共有していない方の軸

それらが重なるのはちょうど一箇所だけで、そこは見た目よりも狭い。

• 入力モダリティ — NV-Reason-CT は、ハウンズフィールド単位の1チャンネル NIfTI ボリュームを専用の三次元プロセッサで処理します。一方、Claude Opus 5 はテキスト、画像、ファイルを受け取りますが、これは画像向けの第二世代インターフェースであり、ボリューム CT 検査をネイティブに取り込むことはできません

• 返ってくるもの — NV-Reason-CT からの、解剖学的領域別に整理された所見リストと、Claude Opus 5 による一般的な散文、構造化 JSON、ツール呼び出しとの対比

• 作業単位 — 1つのCTボリュームを2 mm等方にリサンプリングし、解剖学的範囲に合わせてクロップし、8 x 8 x 8のパッチに分割したもの。トークン予算に何を入れるかに対して

• コンテキスト — NV-Reason-CTにはチャットウィンドウが一切なく、1つのボリュームがダウンサンプリングなしで13,824個の視覚トークンになる。Claude Opus 5は最大1,000,000トークンを保持し、最大128,000を出力する

• ライセンス — OpenMDW-1.1、自身のハードウェア上で実行するダウンロード可能なモデル。ホスト型APIと対照的に

• 明示された用途 — NV-Reason-CTについては研究・教育目的のみで、医療機器ではないと明示。Claude Opus 5の汎用アシスタンス用途には反対

• 価格 — 定価はありません。買うべきものは何もなく、動かすべき重みしかないからです。100万トークンあたり$5と$25、キャッシュ読み取りは$0.50という価格に対して

「modality in」行こそ、カテゴリー錯誤が生まれる場所だ。どちらも画像を受け入れるため、どちらも画像モデルのように見え、読者は当然、どちらが画像に優れているのかと問う。しかしCT検査は画像ではない。それはミリメートル単位の物理的スケール、較正された密度単位、そして三次元でしか意味を持たない解剖構造を備えたボリューム配列である。Claude Opus 5のビジョンは本当に能力が高く、X線写真や病理スライドについてもまともな議論ができる。それは、2mm分解能で384ミリメートルのハンスフィールド値の立方体を統合し、結節の分葉について報告するのとは別のタスクである。

各側の数字が実際に何を測定しているのか

2つのモデルには決して交わることのないベンチマーク記録があり、それに気づかずに並べて読むことが、悪い調達判断を生む原因になる。

NV-Reason-CTは、CT-RATE公開胸部CTベンチマークにおける結果を、18個のラベルにわたり、固定の均一しきい値と、分類ヘッドなし・タスク固有の適応なしの直接的なyes/noプロンプトを用いて報告している。0.614 F1と0.871 AUROCを記録し、VoxelFMの0.581と0.870、Pillar-0の0.544と0.861、ClinFusion-8Bの0.442 F1、CT-CLIPの0.398と0.733、Merlinの0.358と0.662、そして最大85枚の軸位断スライスを与えた場合のMedGemma 1.5の0.303 F1を上回っている。レポート由来のマクロF1も0.592である。これらの数値はすべてNVIDIA自身の論文に由来する。それらのいずれも他の誰によっても再現されておらず、モデルは数週間前からダウンロード可能になっている。

Claude Opus 5の記録は汎用用途のもので、大部分は独立しています。Artificial Analysisは、Intelligence Indexで50.8、Coding Indexで78、GPQA Diamondで93.2、Humanity's Last Examで54.9と測定しており、長文コンテキスト想起スコアは79.33です。これらは汎用推論、コード、知識タスクに関する第三者による数値です。そのセットに臨床画像ベンチマークはなく、Claude Opus 5の公開記録のどこにもCT-RATEの行はありません。

ですから、正直に言えば、どちらかが優位にあるということではありません。そうではなく、この2つのモデルは、これまで誰によっても同じタスクで測定されたことがありません。「NV-Reason-CT は医用画像処理において Claude Opus 5 より優れている」という形式の文は、書かれているとおりでは反証不可能です。なぜなら、誰もその実験を実施していないからです。NVIDIA 自身の比較表には、汎用フロンティアモデルは含まれていません。

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

人々がインターフェースの問いを誤るところ

唯一本当に興味深い技術的な重なりは、誰も議論しないものだ。つまり、CTモデルとテキストモデルの間のインターフェースがどうあるべきか、ということである。

合理的な直感は、Claude Opus 5に一連のCT画像やダウンサンプリングされたボリュームを渡し、推論させることだ。1,000,000トークンのコンテキストなら十分に余裕があるように聞こえるし、わずか13,824視覚トークンの研究と比べれば、余地はたっぷりあるように思える。問題は余地ではない。Claude Opus 5の視覚パイプラインは、画像をピクセルスケールを持つ2次元の絵として扱う。そのように提示された胸部CTは、病変を測定可能にするスライス間隔や、「すりガラス」を記述ではなく閾値にする密度校正を失ってしまう。軸位スライスのモンタージュを渡せば、もっともらしく一貫した段落が返ってくるかもしれない。しかし、得られないのは測定値だ。

それはまさにNV-Reason-CTの設計が計算資源を費やしている点です。384ミリメートルのボリュームから得られる24×24×24のグリッドは、空間的ダウンサンプリングもマージ層もなしに、フル解像度で言語モデルに渡されます。そのため、アクティブな経路は4.35Bパラメータであり、はるかに小さいものではありません。このアーキテクチャは、空間的詳細を保持することがトークンコストに見合うという賭けです。それは言語能力についてではなく、表現についての賭けであり、Claude Opus 5はそれに関与していません。

生産的なパターンは地味な方だ。容積の読影にはCTモデルを使い、その周辺のすべてにはテキストモデルを使う。レポート生成と正規化、コホート要約、評価ハーネス、DICOMアーカイブを大規模にNIfTIへ変換すること、どの検査を人間が最初に目を通すべきかのトリアージ。これは長文書とコードの作業であり、1Mコンテキストモデルがその料金に見合う力を発揮するのはまさにここだ。

コスト、換算できない2つの単位で

Claude Opus 5は従量課金制です。入力トークン100万あたり5ドル、出力100万あたり25ドル、キャッシュ読み取りは50セント、キャッシュ書き込みは10ドルです。レポートのコーパスを正規化したり、評価コードを書いたり書き直したりするパイプラインでは、これにより、組み立て可能な見積もりが得られます。入力トークン、出力トークン、キャッシュ読み取り、そしてキャッシュをうまく使えば、はるかに安い請求額です。

NV-Reason-CTには価格がありません。46.9億のパラメータをダウンロードし、電気代、GPU時間、エンジニアリング時間で支払うことになります。13,824トークンの完全なスタディについて公表されたスループット値はなく、提供されている量子化版もないため、それを実行する際のスタディあたりのコストは、自分で測定しなければならない数値です。これは研究用の重みでは普通のことですが、両者の実用上の最大の違いでもあります。一方には料金表があり、もう一方には、すでに支払ってしまうまで見えない請求書があります。

本当に意味のある比較は、トークン単位ではなく検査単位で行うものだ。CT読影は1件分の作業単位である。同じ症例に対するレポート正規化の処理は、数千トークンで測られるテキスト作業だ。前者に金額を付けるには自分のハードウェアを知る必要があるが、後者に付けるのは単なる算数だ。

比較の真ん中の罠

名指しする価値のある特定の誤りがある。この対決が誘発するのはまさにそれだからだ。それは、NV-Reason-CTを汎用モデルの専門特化ファインチューンと見なし、それゆえ汎用モデルのほうがほとんどのケースで十分近く、はるかに柔軟であると想定することである。

それはファインチューニングではない。Primusと呼ばれる3Dビジョントランスフォーマーであり、COLIPRIから初期化され、3D多軸回転位置埋め込みを備えたQwen3.5-4B言語バックボーンに接続され、CT-RATE、CancerVerse、およびNIH内部コレクションにまたがる70,111件のCTボリュームから抽出された約550,000件の構造化された質問応答例で訓練され、その後、異常セットF1を2.0、領域固有のレポート構造スコアを0.5、ソフト長さペナルティを1.0で重み付けする報酬に対してGRPOで調整された。3次元エンコーダがこのモデルの要点である。2次元またはスライスベースのフロントエンドは別の道具であり、論文自体の比較がその違いの価値を示している:MedGemma 1.5は最大85枚の軸位スライスを入力したときF1 0.303であるのに対し、ネイティブなボリュームモデルは0.614である。

逆の誤りも同じくらいよくあり、同じくらい高くつく。つまり、NV-Reason-CT が専門特化しているからといって、あらゆる臨床業務にそれを使うべきだと想定することだ。これは胸部と腹部のみをサポートし、それ以外は何もできない。その呼び出しはチャットメッセージではなく NIfTI ファイルであり、ライセンス条件は研究および教育目的のみと定めている。病理スライドを読んだり、ガイドラインに関する質問に答えたり、DICOM 変換をバッチ処理するコードを書いたりすることはない。テキスト作業のために CT モデルに手を伸ばすのは、ボリュメトリクスのためにテキストモデルに手を伸ばすのと同じカテゴリー錯誤であり、ただ方向が逆なだけだ。

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

2つの半分が1つのシステムにどのように収まるか

どちらのモデルも他方を置き換えるものではなく、理にかなったアーキテクチャには両方が含まれる――そこで、それらをどう呼び出すかという実務的な疑問が生じる。

Claude Opus 5 は OrcaRouter を通じて anthropic/claude-opus-5Anthropic のプロバイダー一覧レートでマークアップなしで提供されます。200 以上のモデルをカバーする単一の API の中でこれは単一の呼び出しにとってよりも、その周辺のパイプラインにとって重要なことです。臨床ビルドのテキスト部分が複数の候補のうちの 1 つのモデルである場合、それらすべてが 1 つのキーの背後にあれば、2 つ目の契約やコード変更なしに自社のコーパス上で比較できます。またルーティング DSL を使えば、個々のリクエストをそれを処理すべきモデルに送りつつ、プロバイダーが劣化したときには自動フェイルオーバーがカバーします。

NV-Reason-CT は当社のプラットフォーム上にはなく、NVIDIA のモデルも同様です。これは、ご自身のハードウェアにダウンロードして実行する重みであり、ライセンスが許可しているのはまさにそれで、入力が患者由来のボリュームデータであることを踏まえると、おそらくどのみち望んでいることでもあります。当社がホストしていないモデルをルーティングしているなどと示唆するつもりはありません。このビルドのテキスト側は当社が役に立てる領域です。ボリューム側は、4.69B モデルと GPU を前に、あなたが自力で対応する領域です。

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

厳しい吟味に耐える評決

CTボリュームを構造化所見として読み込ませたいなら、そのためのモデルがあります。NVIDIAの研究グループから出たもので、API呼び出しではなくダウンロードして使うタイプです。レポートのコーパスを正規化したい、評価ハーネスを書いてほしい、DICOM変換ジョブをスクリプト化したい、あるいはコホートを要約したいなら、そのためのモデルもあり、料金表が用意されています。

保持すべき線引きは、実験が行われていないのだから、どちらかが何かにおいて他方より優れていることは示されていない、というものだ。示されているのは、ネイティブな三次元インターフェースが公開の胸部CTベンチマークでスライスベースのものを上回り、その差を著者らは約3 F1ポイントと見積もっていること、そして汎用フロンティアモデルが推論、コード、長文脈の作業において分野のトップにあると独立に測定されていることだ。これらは二つの異なる仕事についての二つの主張である。それらをランキングとして読むことがカテゴリー錯誤であり、それは、誰もまだ発表していない直接対決を誰かが発表するそのときまで、ずっと生き延びる。