
Reason-CT 対 Qwen3.8 Max:ファインチューニングと、その元となったファミリー
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 45 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
最初の行はNV-Reason-CTのモデルカードに書かれていて、ほとんどの人が流し読みしてしまうことを教えてくれる。ベースモデルはQwen/Qwen3.5-4Bで、リポジトリのメタデータにファインチューン関係として記載されている。NVIDIAがPrimus 3DビジョンTransformerを接続する言語モデルを必要としたとき、Qwenを採用した。そのチェックポイントをQwen3.8 Max — Alibaba自身の100万トークンのフラッグシップで、2026年8月3日に出荷された — と比較すれば、あなたが見ているのはファインチューンと一族の本業だ。一方は胸部および腹部のCTボリュームを読み取る4.69Bのスペシャリストで、2026年9月8日に告知なしでHugging Faceに公開された。もう一方はテキスト、画像、動画入力に対応する汎用フラッグシップで、公開された料金表があり、先週私たちのネットワーク上で計測された3720万トークンのトラフィックがある。興味深い問いは、どちらが勝つかではない。4Bのファインチューンが、その一族のフラッグシップにはできない何をできるのか、そしてなぜその答えがあなたが予想するよりも具体的なのか、である。
ファインチューニングが具体的にもたらしたもの
NVIDIA自身によるこのギャップの捉え方は異例なほど正確で、リポジトリ内で最も有用な一文だ。ほとんどの視覚言語システムは「2D画像上で動作するか、言語デコーディングの前にボリュメトリック特徴量を圧縮するか」のいずれかである。それはモデル群の一クラス全体を説明するものであり、市場にあるあらゆる汎用マルチモーダル・フラッグシップがそこに含まれる。
この解決策は規模の問題ではなく、アーキテクチャ上のものである。384×384×384 mm の入力ボリュームは、13,824 個の視覚トークンからなる 24×24×24 のグリッドになる。これらのトークンとその三次元座標は、空間的ダウンサンプリングなしで言語モデルに入力され、3D MRoPE がデコーダ内の空間的関係を保持する。入力ボリュームは、肺のハンスフィールド単位を用いて胸部または腹部へと解剖学的に配慮してクロップされ、その後 2 mm の等方性解像度にリサンプリングされる。
それを Qwen3.8 Max が受け付けるものと突き合わせて読んでみてほしい。テキスト、画像、そして動画——そして動画は、このシリーズにおいてボリューム入力に最も近いものであり、だからこそ修辞的な比較点ではなく、誠実な比較点となる。動画とは、時間順に並んだ2Dフレームの積み重ねだ。CTボリュームとは、z軸に沿った物理的位置順に並んだ2Dスライスの積み重ねであり、ハンスフィールド単位で表され、ミリメートル単位の間隔が既知である。どちらも三次元配列だ。だが、放射線科医の所見を位置特定できる物理座標系を持つのはそのうちの一方だけであり、イメージセンサーの外で意味を持つ単位で測定されているのも一方だけだ。動画で訓練されたモデルは時間的連続性を学ぶ。CTボリュームで訓練されたモデルは、あるスライスにある病変が、8ミリ下の次のスライスでも同じ病変であることを学ぶ。
学習コーパスこそが本当の違いだ
ここから2つのモデルはまったく比較にならなくなり、そしてこれはスペック表が隠してしまう部分である。
NV-Reason-CTは、約550,000件の構造化QA例を用いて、教師あり微調整とそれに続くGroup Relative Policy Optimizationによりエンドツーエンドで訓練された。これらのQA例は70,111件のユニークなCTボリュームから抽出された。情報源は、CT-RATE — イスタンブール・メディポル大学メガ病院からの対となる放射線レポート付きの47,149症例 — 、NIH内部の15,991症例のセット、およびCancerVerseの4つの造影相と13の悪性腫瘍タイプにわたる22,720症例である。コーパスには、標準化されたレポート、異常に焦点を当てたQA、マルチターン対話、および記録された専門家の解釈から文字起こしされた放射線科医執筆の推論が含まれる。GRPO段階では、胸部および腹部の異常セットに対して検証可能な報酬を使用する。つまり、報酬シグナルは、記述された所見がボリューム内に存在するかどうかをチェックするのであり、その文章が臨床的に聞こえるかどうかをチェックするのではない。
Qwen3.8 Maxの学習コーパスは、そのような詳細な形では公表されていないし、仮に公表されても役には立たない。対象となる能力が汎用的だからだ。代わりに、関連する証拠となるのはArtificial Analysisの数値である。Intelligence Indexは45.4で、当社APIのスナップショットでは145モデル中15位、AA Codingは76.2で9位、Terminal-Bench 2.1は88.8、GPQA Diamondは92.8、Humanity's Last Examは43.1、SciCodeは52.1、長文コンテキスト想起は80.3だった。これらはベンダーの主張ではなく第三者による測定であり、そのためこのページのどちらの側にとっても最も信頼できる数値となっている。
I don't see any text to translate — your message contains only the instructions. Please send the source text (with its `{{1}}...{{/1}}` markers) and I'll return the Japanese translation with every marker preserved exactly.
どちらのモデルも推論トレースを出力し、どちらもそれをオフにできる。だが、両者が似ているのはインターフェースまでだ。
Qwen3.8 Max はenable_thinking と reasoning_effort を公開しており、さらに完全なサンプリング面 — temperature、top_p、seed、ペナルティ、構造化出力、ツール呼び出し — も備えています。これは、手持ちのあらゆるものに向けられる汎用的な推論能力です。その思考は、与えられた問題と同じ水準のものでしかなく、与えられたテキスト以外の何かに対して主張を検証する手段を持ちません。
NV-Reason-CT の推論は、読み手との契約がより限定的であり、モデルカードはその限界を明示している。生成された推論は「レビュー可能なモデル出力であり、モデルの内部計算を表すことを保証するものではない」とされている。この但し書きは実際に重要な役割を果たしており、もっともらしく聞こえるトレースを臨床医がどう扱うかについてチームが考え抜いたときにしか現れない種類の一文だ。カードは、出力をレビュー可能な所見、鑑別診断、不確実性として説明している。言い換えれば、ただ読むだけのトレースではなく、ボリュームと照合して確認できるトレースである。
スループット、それを測定できる唯一の場所から
Qwen3.8 Maxは、過去7日間でOrcaRouter自身のプレイグラウンドを通じて3,720万トークンを処理しました。最初のトークンが出力されるまでの中央値は1.96秒で、このシリーズのモデルの中では余裕を持って最速です。出力速度は毎秒53.3トークンでした。同期間のエラー率は3.5%でした。
それら2つの数値は相反する方向に引っ張り合っており、どちらも重要だ。レイテンシは素晴らしく、モデルを快適に反復改善できる。エラー率は同じ期間でKimi K3の0.21%よりおよそ17倍高く、同期のユーザー向け呼び出しの背後に置くか、リトライ付きのバッチジョブに置くかを決めるのはこの数値だ。これは当社のネットワーク上で測定された挙動であり、ベンチマークではない。そしてこれは、料金表が決して教えてくれない類のものだ。
NV-Reason-CT には、どこにも同等の測定値が存在しません。これはカスタムモデルコードを伴う 10.6 GB の BF16 チェックポイントで、trust_remote_code=True を指定して Ampere、Hopper、または Lovelace ハードウェア上で読み込まれ、NVIDIA によって H100 と L40S でテストされています。公開されている p50 も、エラー率も、スループットの数値もありません。これをセルフホストする方がトークン単位の支払いより有利になる分岐点のボリュームを教えてくれる人は、勘で話しているだけです。
価格と形状、並べて比較
• 価格 — NV-Reason-CT は GPU 設備投資で、トークン単位の料金なし。一方、Qwen3.8 Max は100万トークンあたり $2.00 / $6.00、キャッシュ読み取り $0.25、キャッシュ書き込み $2.50
• 入力 — Hounsfield単位のNV-Reason-CT 3D NIfTI CTボリューム、胸部または腹部のみ vs Qwen3.8 Maxのテキスト、画像、動画
• コンテキスト — NV-Reason-CT:1巻、固定の13,824トークンプレフィックス 対 Qwen3.8 Max:1,000,000トークン
• パラメータ — NV-Reason-CT は合計4.69B/CT経路で4.35Bがアクティブ、対するQwen3.8 Maxは非公開
• ライセンス — NV-Reason-CT は OpenMDW-1.1、重みは公開、一方 Qwen3.8 Max はプロプライエタリで API アクセスのみ
• 独立系スコア — NV-Reason-CT なし 対 Qwen3.8 Max、AA Intelligence Index 45.4、GPQA Diamond 92.8

Qwen3.8 Maxのキャッシュ経済性は、特定の形に報いる。$0.25のキャッシュ読み出しは$2.00の新規入力に対して8倍の割引であり、$2.50のキャッシュ書き込みは、長く再利用可能なプレフィックスがすぐに元を取れることを意味する。それは、数千のリクエストにわたって再利用されるシステムプロンプトとプロトコル文書というワークロードだ。NV-Reason-CTは逆のコストプロファイルを持つ——GPUを購入してしまえばスキャンあたりの限界費用はほぼゼロで、1台のGPUを無期限に保持するという厳しい下限がある。

家族を一緒に切り盛りする
ここでの自然なアーキテクチャは——そして、誰もこれを公表していないことは言っておく価値があるが——大量処理向けのファインチューンと、その周辺のすべてを担うフラッグシップだ。NV-Reason-CTが構造化所見を生成し、Qwen3.8 Maxが紹介状のテキスト、プロトコルマッチング、コーディング、フォローアップレター——100万トークンのウィンドウと8倍のキャッシュ割引が真にその価値を発揮する、大量のテキスト作業——を処理する。
もしそれがあなたのパイプラインなら、その半分はあなたがホストするチェックポイントで、残りの半分はあなたが購入するトークンであり、後半こそがルーターが単一ベンダーのエンドポイントにはできないことをやってのける部分です。Qwen3.8 Max は OrcaRouter を通じて Alibaba の定価で、マークアップゼロで提供されています。つまり上記の $2.00 / $6.00 が実際に支払う金額であり、将来の価格変動は更新時ではなくその日のうちに請求に反映されます。プロバイダー間の自動フェイルオーバーはいつも以上に重要になります。モデル自体の実測エラー率が 3.5% である場合、別の正常なエンドポイントへ送る再試行が、一時的な不具合とバッチ失敗の分かれ目になるからです。そして、パイプラインの汎用部分は 200 以上のモデルをカバーする OpenAI 互換エンドポイントの背後にある 1 つのモデル名にすぎないため、1 週間の実験のために別のものへ差し替えるのに必要なのは統合作業ではなく文字列の変更だけです。
NV-Reason-CTは、はっきり言ってOrcaRouter上にはなく、今後も載ることはありません——これは自分で実行するカスタムコードによる3D推論です。統合について正直に言えば、セルフホストのスペシャリストとルーティングされたジェネラリストが1つのキーの下に同居できる、というのが主張のすべてです。

実際に効力を持つ評決
この組み合わせは「どちらが優れているか」という分類に入れられるべきではない。Qwen3.8 Max は第三者が一般的な推論で測定しており、ほとんどの競合を上回っている。NV-Reason-CT には、ある CT ベンチマークにおける自社数値の表が一つあるだけで、4.69B というパラメータ数は、一般的な比較では特筆すべきものではない。あらゆる一般ベンチマークでフラッグシップが勝つ。その理由は、一般ベンチマークこそがフラッグシップの目的として作られたものだからだ。
NV-Reason-CT が作られた唯一のタスク——胸部または腹部の CT ボリュームを読み取り、そこに何が写っているかを、誰かが確認できるトレース付きで述べること——において、Qwen3.8 Max は単に弱い競合相手ではない。ボリューメトリックエンコーダを持たないため、スキャンをどのように画像へ平坦化するかを誰かがまず決めない限り、入力に対して実行すること自体できない。空間情報の行き先を決めるのは、まさにその判断である。それこそが、ネイティブな 3D 経路と 13,824 トークンの固定プレフィックスを備えた 4B ファインチューニングの狙いそのものであり、このモデルについて興味深いのがその規模ではなくバックボーンの小ささである理由でもある。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
