生成されたヒーローカード。タイトルは「NV-Reason-CT vs Kimi K3」、サブタイトルは「210ダウンロードと5億8,800万トークン」。下部に3つのチップが並ぶ:「210 HFダウンロード vs 5億8,780万トークン / 7日」、「当社ネットワーク上で測定誤差0.21%」、「1ボリューム vs 1,048,576トークン」。OrcaRouterのロゴが右下に合成されている。
Guides & Insights

NV-Reason-CT vs Kimi K3:ダウンロード数210、5億8,800万トークン

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これらのモデルの一方は、Hugging Faceから210回ダウンロードされている。もう一方は、過去7日間で私たち自身のプレイグラウンドを通じて5億8,800万トークンを動かした。どちらもオープンウェイトで、どちらも今すぐダウンロードでき、この2つの数字の隔たりこそが、この比較で最も有用なものだ。NV-Reason-CTは、胸部および腹部CT向けのNVIDIAの46.9億パラメータの3D視覚言語モデルで、2026年9月8日に予告なしでHugging Faceに公開された。Kimi K3は、MoonshotAIの1,048,576トークンのフラッグシップで、2026年7月15日に出荷され、現在私たちのネットワーク上で最も活発に使われているモデルの一つだ。どちらも、調達申請書にとって重要な意味では「オープン」である。しかし、同じようにオープンなわけではまったくない。

「you can download it」の2つの意味

まずは、各ダウンロードが実際にディスク上へ何を置くのかから始めましょう。ここが、ほとんどのオープンウェイト比較が曖昧になるところだからです。

NV-Reason-CT では model.safetensors が BF16 でおよそ 10.6 GB で入手でき、さらに model.py と、かなりの規模の processor.py が付属します — 解剖学的構造を考慮したクロッピング、2 mm リサンプリング、3D パッチ化を実装した 26 KB のカスタム処理コードです。モデルの読み込みには trust_remote_code=True を使用します。つまり、自分のプロセス内で NVIDIA のリポジトリコードを実行することになります。推論には CUDA PyTorch が必要で、対応カードには Ampere、Hopper、Lovelace が挙げられており、H100 と L40S でテストされています。入力は一度に 1 つの NIfTI ボリュームです。公開されているバッチ処理の説明も、スループットの数値もなく、リポジトリには inference.py の例以外にサービング構成もありません。

Kimi K3は、1,048,576トークンのコンテキストウィンドウ、テキストと画像の入力、ネイティブのツール呼び出し、構造化出力、設定可能な推論エフォートを備えた汎用推論モデルです。1回のリクエストで100件の臨床ガイドラインを読ませたり、ある部門の10年分の報告書を読ませたりするときに頼りになるモデルです。Artificial Analysisの長文コンテキスト想起スコアは88.7で、このシリーズのモデルの中で最高であり、Grok 4.6の80.3を実に8.4ポイント上回っています。

平たく言えば、NV-Reason-CT は入力範囲が狭く、信頼して保守しなければならないカスタムコードを伴う専門特化型チェックポイントだ。Kimi K3 は入力範囲が広く、インフラのように振る舞う汎用モデルだ。どちらもダウンロード可能だ。そのまま導入できるのは片方だけだ。

CTの証拠は、完全な形で、しかも短い。

NV-Reason-CTの品質について公に知られていることはすべて、同モデル自身のモデルカードにあるたった1つの表に依拠している:CT-RATEの18ラベル分類タスクを、固定された一律のしきい値で、直接的なYes/Noプロンプティングにより、分類ヘッドなし、タスク固有の適応なしで行ったものだ。Macro-F1 0.614、Macro-AUROC 0.871。

比較表の行は、VoxelFM が 0.581/0.870、Pillar-0 が 0.544/0.861、ClinFusion-8B が 0.442、CT-CLIP が 0.398/0.733、Merlin が 0.358/0.662、MedGemma 1.5 が 0.303 です。これらはいずれも NVIDIA のカードに記載されたベンダー報告値であり、まだどれも独立に再現されていません — その論文は公開からまだ2日しか経っていません。

この表が確立していることは限定的であり、正確に述べておく価値がある。タスク固有のヘッドを持たない生成3Dモデルが、18ラベルのCT分類において、3D対比事前学習ベースラインおよびスライスベースのフロンティアモデルを上回る。確立していないのは、一般的推論に関する事柄、胸部および腹部CT以外のモダリティに関する事柄、そしてAUROCの優位性に関する事柄である——0.871対0.870は小数点をまとった引き分けにすぎない。

Kimi K3の数値、そしてオープンウェイトのリーダーボードに関する但し書き

Artificial AnalysisはKimi K3のインテリジェンス指数を43.6と測定しており、当社のモデルAPIにおけるランキングのスナップショットでは、これはそのボード上で145モデル中19位に位置づけられる。GPQA Diamondスコアは93.5、Humanity's Last Examは46.9、SciCodeは59.5、Terminal-Bench 2.1は85.0、AA Codingは76.2で9位、𝜏²-bankingは46.0。

ランキングに関するある主張には注意が必要だ。なぜなら、それは間違えやすく、これまでも実際に間違えられてきたからだ。Kimi K3のAA Intelligence Indexは44で、オープンウェイトボードのオープンウェイトモデルの中で3位につけており、46のMiMo-V2.6-Proと45のGLM-5.3の後ろに位置する。それはそのボードの首位ではなく、Grok 4.6と同じボードで競っているわけでもない——Artificial AnalysisはGrok 4.6をプロプライエタリとして記録しているため、その44は一般ランキングに属し、オープンウェイトのものではない。この2つの指数は同じに見えるが、同じではない。

オペレーターが実際に目にするもの

これが5億8800万という数字の出どころであり、この記事で誰かのマーケティング資料ではなく私たち自身に属する唯一の証拠なのだから、はっきり示しておく価値がある。

過去7日間で、Kimi K3 は OrcaRouter のプレイグラウンドを通じて5億8,780万トークンを処理した。初回トークンまでの時間の中央値は7.8秒で、毎秒42.9出力トークンを生成し、その期間のエラー率は0.21%——約480リクエストに1件の失敗だった。この実測エラー率こそ、モデルカードからは得られないものであり、モデルをバッチジョブの背後に置いて安全かどうかを決める数字だ。

NV-Reason-CT に相当するものは存在しない。なぜなら、それはどこかでホストされているエンドポイントではなく、自分で実行するチェックポイントだからだ。p50 も、エラー率も、稼働率もなく、フェイルオーバー先も存在しない。これはけなしているわけではない。セルフホスティングに関する構造的な事実であり、だからこそ研究グループはある火曜日に NV-Reason-CT を導入できても、プロダクションのチームは一般にはそうできないのだ。

この両方の半分を動かしている場合——Kimi K3をホスト型の汎用レイヤーとして、NV-Reason-CTを自前のGPUボックスで——ホスト型の半分がレジリエンスを得るのはルーティング側です。Kimi K3はMoonshot自身の定価、入力100万トークンあたり$3.00で提供され、出力100万トークンあたり$15.00でマークアップはゼロ、キャッシュ読み取りレートは100万トークンあたり$0.30で入力の10分の1、そして価格が変わらずそのまま渡されるため、ベンダーの値引きは同じ日にあなたの請求に反映されます。プロバイダーをまたぐ自動フェイルオーバーこそが、上流のエンドポイントの一つがぐらついてもバッチジョブを生き延びさせます——そして0.21%のエラー率では、ぐらつきは忘れてしまえるほど稀であり、忘れられなくなるその時まで簡単に忘れ去られます。

コスト形状は互いに類似していない

• 価格 — NV-Reason-CT の GPU 設備投資+自前のサービングスタック 対 Kimi K3 100万トークンあたり $3.00 / $15.00、キャッシュ読み取り $0.30

• 最小限の実行可能な支出 — NV-Reason-CT が Ampere 以降の GPU 1 台を無期限に保持する場合と、Kimi K3 の 1 リクエストの場合

• コンテキスト — NV-Reason-CT 1ボリューム、13,824トークン固定 対 Kimi K3 1,048,576トークン

• 1000回目のリクエストの限界費用 — GPUの代金を支払ってしまえばNV-Reason-CTは実質ゼロであるのに対し、Kimi K3はトークン数に比例して増加する

• 最初に破綻するのはどこか — NV-Reason-CT の未検証のスループットとバッチ処理の話がないのに対し、Kimi K3 のリクエストあたり100万トークンでの長コンテキストコスト

• モダリティ — NV-Reason-CT 3D NIfTI、胸部または腹部 対 Kimi K3 のテキストと画像、何でも

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

経済性は規模によって逆転する。Kimi K3 は始めるのにコストがかからず、線形にスケールする。NV-Reason-CT は始めるのに GPU が 1 基必要で、その後はほぼ横ばいでスケールする——だからこそ、210 ダウンロードは失敗のシグナルではない。それは、すでにハードウェアを保有している機関を対象とし、そうした機関がトークンスループット統計には一切現れないチェックポイントにとって、正しい数字なのだ。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

実際にどちらを選んでいるのですか

CTボリュームを読み取り、推論トレースを伴う構造化された所見を生成することが仕事なら、Kimi K3にはできず、NV-Reason-CTにはできる。「より下手」ではない——できないのだ。なぜなら、そのどこにもボリュームエンコーダが存在せず、スキャンをまず画像へと平坦化すると、3D経路が保持するために存在している空間的関係が失われてしまうからだ。

もしその仕事が、400ページの紹介状を読み、それらをプロトコル文書と照合し、構造化出力を生成することだとしたら、NV-Reason-CT は検討対象に入っておらず、Kimi K3 は、当社のネットワーク上で測定された誤り率が0.25%未満で、利用可能なより良い回答の一つです。

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

本当の決断は、この二つのどちらを選ぶかではない。あなたの課題が量の問題なのか、テキストの問題なのか、ということだ。そして2億1000万対5億8800万という隔たりは、その区別を外から見たときにそう見えるものにすぎない。一方のモデルは、重みが付いた論文だ。もう一方は、インフラの一片だ。どちらも持つ価値があるが、どちらも他方の代わりにはならない。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新