Eine generierte Hero-Karte mit dem Titel 'NV-Reason-CT vs Kimi K3' und dem Untertitel '210 Downloads und 588 Millionen Tokens'. Drei Chips verlaufen entlang des unteren Randes: '210 HF-Downloads vs. 587,8 Mio. Tokens / 7 Tage', '0,21 % gemessener Fehler in unserem Netzwerk' und 'Ein Volume vs. 1.048.576 Tokens'. Das OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

NV-Reason-CT vs. Kimi K3: 210 Downloads und 588 Millionen Tokens

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Eines dieser Modelle wurde 210 Mal von Hugging Face heruntergeladen. Das andere hat in den letzten sieben Tagen 588 Millionen Token durch unseren eigenen Playground bewegt. Beide sind Open-Weights, beide sind genau jetzt herunterladbar, und die Kluft zwischen diesen beiden Zahlen ist das Nützlichste an diesem Vergleich. NV-Reason-CTist NVIDIAs 4,69-Milliarden-Parameter-3D-Vision-Language-Modell für Thorax- und Abdomen-CT, das am 8. September 2026 ohne Ankündigung auf Hugging Face veröffentlicht wurde. Kimi K3ist MoonshotAIs Flaggschiff mit 1.048.576 Token, ausgeliefert am 15. Juli 2026 und heute eines der meistgenutzten Modelle in unserem Netzwerk. Beide sind „offen" in dem Sinne, der für ein Beschaffungsformular zählt. Sie sind keineswegs auf dieselbe Weise offen.

Zwei Bedeutungen von „Du kannst es herunterladen“

Beginne damit, was jeder Download tatsächlich auf deiner Festplatte ablegt, denn genau hier werden die meisten Open-Weights-Vergleiche schwammig.

NV-Reason-CT liefert dir model.safetensors mit etwa 10,6 GB in BF16, dazu eine model.py und eine umfangreiche processor.py — 26 KB benutzerdefinierter Verarbeitungscode, der das anatomiebewusste Zuschneiden, das 2-mm-Resampling und die 3D-Patchifizierung implementiert. Du lädst es mit trust_remote_code=True, was bedeutet, dass du den Repository-Code von NVIDIA in deinem Prozess ausführst. Für die Inferenz ist CUDA-PyTorch erforderlich, und die Karte listet Ampere, Hopper und Lovelace auf, getestet auf H100 und L40S. Die Eingabe ist jeweils ein einzelnes NIfTI-Volumen. Es gibt keine veröffentlichte Batching-Strategie, keine Durchsatzzahl und keine Serving-Konfiguration im Repository außer einem inference.py-Beispiel.

Kimi K3 bietet Ihnen ein universell einsetzbares Reasoning-Modell mit einem Kontextfenster von 1.048.576 Token, Text- und Bildeingabe, nativen Tool-Aufrufen, strukturierten Ausgaben und konfigurierbarem Reasoning-Aufwand. Es ist das Modell, zu dem Sie greifen würden, um hundert klinische Leitlinien in einer einzigen Anfrage zu lesen – oder die Berichte eines ganzen Jahrzehnts einer Abteilung. Sein Long-Context-Recall-Score bei Artificial Analysis liegt bei 88,7 – der höchste der Modelle in dieser Serie und volle 8,4 Punkte über den 80,3 von Grok 4.6.

Einfach gesagt: NV-Reason-CT ist ein spezialisierter Checkpoint mit einer schmalen Eingabeoberfläche und eigenem Code, dem Sie vertrauen und den Sie pflegen müssen. Kimi K3 ist ein allgemeines Modell mit einer breiten Eingabeoberfläche, das sich wie Infrastruktur verhält. Beide sind herunterladbar. Nur eines von ihnen ist ein Drop-in-Ersatz.

Das CT-Beweismaterial, vollständig, und es ist kurz.

Alles öffentlich Bekannte über die Qualität von NV-Reason-CT stützt sich auf eine einzige Tabelle in der eigenen Modellkarte: die 18-Label-Klassifizierungsaufgabe von CT-RATE bei einem festen einheitlichen Schwellenwert, direktes Ja/Nein-Prompting, kein Klassifizierungskopf, keine aufgabenspezifische Anpassung. Macro-F1 0,614, Macro-AUROC 0,871.

Die Vergleichszeilen sind VoxelFM mit 0,581/0,870, Pillar-0 mit 0,544/0,861, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398/0,733, Merlin mit 0,358/0,662 und MedGemma 1.5 mit 0,303. Jede einzelne davon ist eine vom Anbieter gemeldete Zahl aus NVIDIAs Model Card, und keine wurde bisher unabhängig reproduziert – das Paper ist zwei Tage alt.

Was die Tabelle belegt, ist eng begrenzt und es lohnt sich, es genau zu sagen: Ein generatives 3D-Modell ohne aufgabenspezifischen Head schlägt bei der CT-Klassifikation mit 18 Labels 3D-kontrastive Pretraining-Baselines und ein slice-basiertes Frontier-Modell. Was sie nicht belegt, ist irgendetwas über allgemeines Reasoning, irgendetwas über andere Modalitäten als Thorax- und Abdomen-CT und irgendetwas über den AUROC-Vorteil – 0,871 gegen 0,870 ist ein Gleichstand, der einen Dezimalpunkt trägt.

Kimi K3s Zahlen und der Vorbehalt beim Open-Weights-Board

Artificial Analysis misst Kimi K3 mit einem Intelligence Index von 43,6, was es in der Momentaufnahme des Rankings unserer Modell-API auf Platz 19 von 145 Modellen in diesem Leaderboard setzt. Sein GPQA-Diamond-Wert beträgt 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 auf Rang 9 und 𝜏²-banking 46,0.

Eine Ranking-Aussage erfordert Sorgfalt, denn sie ist leicht falsch zu verstehen – und sie wurde schon einmal falsch verstanden. Der AA Intelligence Index von Kimi K3 mit 44 liegt unter den Open-Weights-Modellen auf dem Open-Weights-Board auf Platz drei, hinter MiMo-V2.6-Pro mit 46 und GLM-5.3 mit 45. Es ist nicht der Spitzenreiter auf diesem Board und konkurriert nicht auf derselben Ebene wie Grok 4.6 — Artificial Analysis führt Grok 4.6 als proprietär, daher gehört seine 44 zum allgemeinen Ranking, nicht zum Open-Weights-Ranking. Die beiden Indizes sehen identisch aus und sind es nicht.

Was der Bediener tatsächlich sieht

Daher stammt die Zahl 588 Millionen, und es lohnt sich, das ausdrücklich zu erwähnen, denn sie ist der einzige Beleg in diesem Artikel, der von uns stammt und nicht aus dem Marketing von irgendwem.

In den letzten sieben Tagen bewegte Kimi K3 587,8 Millionen Token durch OrcaRouters Playground. Die mediane Zeit bis zum ersten Token betrug 7,8 Sekunden, die Ausgabegeschwindigkeit lag bei 42,9 Token pro Sekunde, und die Fehlerrate in diesem Zeitraum betrug 0,21 % — ein Fehler bei etwa 480 Anfragen. Diese gemessene Fehlerrate ist genau das, was man aus einer Model Card nicht erfährt, und sie ist die Zahl, die entscheidet, ob ein Modell bedenkenlos hinter einen Batch-Job gesetzt werden kann.

Für NV-Reason-CT gibt es kein Äquivalent, denn es ist nirgendwo ein gehosteter Endpunkt – es ist ein Checkpoint, den man selbst laufen lässt. Es gibt kein p50, keine Fehlerrate, keine Uptime und niemanden, auf den man per Failover ausweichen könnte. Das ist kein Seitenhieb; es ist eine strukturelle Tatsache beim Selbsthosting, und es ist der Grund, warum eine Forschungsgruppe NV-Reason-CT an einem Dienstag einsetzen kann und ein General in der Regel nicht.

Wenn Sie beide Hälften davon betreiben — Kimi K3 als gehostete allgemeine Ebene und NV-Reason-CT auf Ihrer eigenen GPU-Maschine —, dann ist die Routing-Seite der Punkt, an dem die gehostete Hälfte ihre Ausfallsicherheit erhält. Kimi K3 wird zu Moonshots eigenem Listenpreis von 3,00 $ pro Million Input angeboten und 15,00 $ pro Million Output bei null Aufschlag; der Cache-Read-Tarif von 0,30 $ pro Million beträgt ein Zehntel des Inputs, und weil der Preis unverändert weitergegeben wird, erreicht eine Anbieterkürzung Ihre Rechnung noch am selben Tag. Automatisches Failover zwischen Anbietern ist das, was einen Batch-Job am Leben hält, wenn ein vorgelagerter Endpunkt wackelt — und bei einer Fehlerrate von 0,21 % sind solche Ausschläge selten genug, dass man sie leicht vergisst, bis sie es nicht mehr sind.

Die Kostenformen ähneln sich nicht

• Preis — NV-Reason-CT GPU-Capex plus Ihren eigenen Serving-Stack vs. Kimi K3 $3,00 / $15,00 pro Million, $0,30 für gecachte Lesevorgänge

• Minimal sinnvolle Ausgaben — NV-Reason-CT eine Ampere- oder neuere GPU dauerhaft gehalten vs. Kimi K3 eine Anfrage

• Kontext — NV-Reason-CT ein Volumen, 13.824 Token fest vs. Kimi K3 1.048.576 Token

• Grenzkosten der tausendsten Anfrage — NV-Reason-CT effektiv null, sobald die GPU bezahlt ist, gegenüber Kimi K3 linear mit den Tokens

• Wo es zuerst scheitert — nicht verifizierter Durchsatz von NV-Reason-CT und keine Batching-Strategie vs. Langkontext-Kosten von Kimi K3 bei 1 Mio. Tokens pro Anfrage

• Modalitäten — NV-Reason-CT 3D NIfTI, Thorax oder Abdomen vs. Kimi K3 Text und Bild, beliebig

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

Die Wirtschaftlichkeit kehrt sich je nach Volumen um. Kimi K3 kostet nichts für den Start und skaliert linear. NV-Reason-CT kostet eine GPU für den Start und skaliert dann nahezu flach — weshalb 210 Downloads kein Signal für ein Scheitern sind. Es ist die richtige Zahl für einen Checkpoint, dessen Zielgruppe Institutionen sind, die die Hardware bereits besitzen und die in einer Token-Durchsatzstatistik überhaupt nicht auftauchen werden.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Welche du tatsächlich wählst

Wenn die Aufgabe darin besteht, ein CT-Volumen zu lesen und einen strukturierten Befund mit einer Reasoning-Spur zu erstellen, kann Kimi K3 das nicht und NV-Reason-CT kann es. Nicht „macht es schlechter“ – sondern kann es nicht, weil es darin nirgends einen volumetrischen Encoder gibt und das Abflachen eines Scans zu Bildern zuerst die räumlichen Beziehungen verwirft, die der 3D-Pfad bewahren soll.

Wenn die Aufgabe darin besteht, 400 Seiten Überweisungsnotizen zu lesen, sie mit einem Protokolldokument abzugleichen und strukturierte Ausgaben zu erzeugen, kommt NV-Reason-CT nicht in Frage, und Kimi K3 ist eine der besseren verfügbaren Antworten, mit einer gemessenen Fehlerrate von unter einem Viertelprozent in unserem Netzwerk.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

Die eigentliche Entscheidung liegt nicht zwischen den beiden. Sie besteht darin, ob Ihr Problem ein Volumenproblem oder ein Textproblem ist, und die Kluft von 210 gegenüber 588 Millionen ist einfach das, wie diese Unterscheidung von außen aussieht. Das eine Modell ist ein Paper mit Gewichten. Das andere ist ein Stück Infrastruktur. Beide sind es wert, vorhanden zu sein; keines ersetzt das andere.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert