
NV-Reason-CT vs. Gemini 3.1 Pro: Die breiteste Eingabeoberfläche – und dennoch kein CT-Leser
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 506 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 183 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Vierundneunzig Prozent. Das ist die Fehlerrate, die unser eigener Katalog derzeit für eine Route verzeichnet, die Gemini 3.1 Pro – 93,93 %, zusammen mit einer medianen Zeit bis zum ersten Token, die wie eine Obergrenze von zehn Sekunden anmutet, und einem Durchsatzwert von 978 Token pro Sekunde. Liest man das als Aussage über das Modell, zieht man genau den falschen Schluss. Liest man es als Aussage über eine Preview-Stufe unter Last, wird es zum nützlichsten Element auf der Seite, denn genau das erlebt eine klinische Pipeline tatsächlich, wenn sie von einer Route abhängt, die nicht für Produktionsverkehr bereitgestellt wurde.
Das Modell auf der anderen Seite dieses Vergleichs hat weder ein solches Problem noch eine solche Messung. NV-Reason-CT ist NVIDIAs nativer 3D-CT-Reasoner mit 4,69 Milliarden Parametern, herunterladbar unter OpenMDW-1.1, ohne jede veröffentlichte Durchsatzangabe und ohne irgendwo gehostet zu werden. Die eine Seite dieses Duells bietet Ihnen also die breiteste Eingabeoberfläche im Feld, mit einem Verfügbarkeitsprofil, auf das Sie Ihre Architektur abstellen müssen; die andere bietet Ihnen eine einzige, eng umrissene Fähigkeit mit einer Latenz, die Sie selbst messen müssen. Keine der beiden Seiten hat ein Monitoring-Dashboard, dem Sie vom ersten Tag an vertrauen können – und das aus entgegengesetzten Gründen.
Zwei Modelle, zwei Definitionen von „multimodal“
Das Wort leistet in beiden Produktbeschreibungen eine Menge Arbeit – und fast nichts davon ist gemeinsam.
• Akzeptierte Eingaben — Gemini 3.1 Pro akzeptiert Text, Bilder, Audio, Video und Dateien; NV-Reason-CT akzeptiert ein einkanaliges NIfTI-Volumen in Hounsfield-Einheiten und sonst nichts
• Was „3D“ bedeutet — NV-Reason-CT führt ein Resampling auf 2 mm isotrop über einen 384-Millimeter-Würfel durch und zerlegt ihn in 8 x 8 x 8 Patches für ein 24 x 24 x 24-Raster; der Videoeingang von Gemini 3.1 Pro ist eine Sequenz zweidimensionaler Einzelbilder mit einer Zeitachse
• Kontext — 1.048.576 Tokens Eingang und 65.536 Ausgang für Gemini 3.1 Pro; ein Volume umfasst 13.824 visuelle Tokens für NV-Reason-CT, ohne Downsampling und ohne Merging-Layer, und es gibt kein Chat-Fenster darum
• Veröffentlichung — 19. Februar 2026 für Gemini 3.1 Pro, auf einem Preview-Slug; ein nicht angekündigter Research-Drop für NV-Reason-CT, mit Repository-Aktivität datiert vom 2. bis 25. September 2026
• Preis — 2 $ und 12 $ pro Million Token bis 200.000 Token, danach 4 $ und 18 $, mit Cache-Lesevorgängen zu 0,20 $ und Cache-Schreibvorgängen zu 0,375 $; im Vergleich zu selbstgehosteten Modellgewichten ohne Preisliste
• Funktionen — Vision, Audio, Tool-Nutzung, JSON-Ausgabe und Reasoning für Gemini 3.1 Pro; strukturierte Befunde nach anatomischer Region für NV-Reason-CT, ohne Tools
• Lizenz und Status — eine gehostete Preview-API; gegen OpenMDW-1.1-Gewichte, deren Modellkarte ausschließlich Forschung und Bildung angibt und unmissverständlich klarstellt, dass es sich nicht um ein Medizinprodukt handelt
Ein Video-Input und ein volumetrischer CT-Input wirken aus der Entfernung benachbart und könnten aus der Nähe nicht weiter voneinander entfernt sein. Video besteht aus Einzelbildern über die Zeit. Eine CT-Untersuchung ist ein einzelnes statisches Volumen mit drei räumlichen Achsen, einem physischen Maßstab in Millimetern und einer kalibrierten Dichteeinheit, wobei das, was gemessen wird, die Dichte einer Struktur ist, deren Größe eine Rolle spielt. Gemini 3.1 Pro wird sich eine chirurgische Aufzeichnung ansehen und beschreiben, was passiert ist. Es wird keinen Knoten vermessen. Das ist keine Einschränkung, die Google versäumt hat anzugehen; es ist ein anderes Problem, das niemand mit einem allgemeinen Modell gelöst hat.
Was die beiden Benchmark-Datensätze abdecken und was sie auslassen
Gemini 3.1 Pro hat eine unabhängige Bilanz, und diese ist gut auf den Achsen, die es misst.
• GPQA Diamond — 94,1, der höchste Wert in dieser gesamten Artikelserie
• Humanity's Last Exam — 47, mit einem Long-Context-Recall-Wert von 82, erneut der höchste in diesem Vergleich
• IFBench und SciCode — 77.14 und 58.7
• τ²-Bench — 95,61, mit tau_banking bei 21,44 und Terminal-Bench Hard bei 53,79
• Artificial Analysis Intelligenz und Coding — 29,7 und 68,8
• Gemessene Latenz — ein Median von zehn Sekunden bis zum ersten Token, der eher eine Obergrenze als ein echter Median zu sein scheint, bei 978 Token pro Sekunde und einer Fehlerrate von 93,93 %
Beachten Sie die Gestalt dessen: ein Wissens- und Long-Context-Profil an der Spitze des Vergleichs, ein Intelligenzindex im unteren Mittelfeld und eine unbrauchbare Verfügbarkeitsmessung. Alle drei beschreiben dasselbe Modell auf derselben Route. Ein hoher GPQA Diamond bedeutet, dass es sehr viel weiß. Ein Composite-Wert von 29,7 bedeutet, dass es nicht in allem führend ist. Eine Fehlerrate von 93,93 % bedeutet, dass auf diesem speziellen Pfad die meisten Ihrer Anfragen nicht abgeschlossen werden — und das ist mit ziemlicher Sicherheit eine Kapazitäts- und Provisionierungsgegebenheit bei einem Preview-Endpunkt und keine Eigenschaft der Gewichte. Von außen können wir nicht beweisen, welches von beidem zutrifft. Was wir sagen können, ist, dass keine dieser drei Zahlen ein Tippfehler ist und jede Architektur, die nur die erste liest, eine schlechte Woche haben wird.
NV-Reason-CTs Bilanz ist schmaler und mit einem anderen Vorbehalt verbunden. Seine 0,614 F1 und 0,871 AUROC auf CT-RATE, über achtzehn Labels hinweg mit einem festen einheitlichen Schwellenwert und einem direkten Ja/Nein-Prompt und ohne Klassifikationskopf oder aufgabenspezifische Anpassung, sind NVIDIAs eigene Zahlen aus NVIDIAs eigenem Paper. Die Vergleichsgruppe dahinter – VoxelFM mit 0,581, Pillar-0 mit 0,544, ClinFusion-8B mit 0,442, CT-CLIP mit 0,398, Merlin mit 0,358, MedGemma 1.5 mit 0,303 – enthält ausschließlich Bildgebungsmodelle. Kein allgemeines multimodales Modell taucht auf, was bedeutet, dass die Frage „Wie würde Gemini 3.1 Pro auf CT-RATE abschneiden?“ nicht gestellt, geschweige denn beantwortet wurde.

Das Preview-Tier-Problem, korrekt formuliert
Dies ist der Teil des Vergleichs, der nichts mit CT zu tun hat und alles mit dem Betreiben von irgendetwas Klinischem.
Eine Fehlerrate von 93,93 % ist keine subtile Verschlechterung. Sie ist eine Route, auf der die überwältigende Mehrheit der Aufrufe fehlschlägt. Die natürliche Reaktion ist, das Modell für unbrauchbar zu erklären, und diese Reaktion ist aus zwei Gründen falsch. Erstens spiegelt eine auf einem Preview-Endpunkt gemessene Fehlerrate Kapazität, Kontingent und regionales Routing wider, nicht die Fähigkeit des Modells. Googles Preview-Tiers sind bekanntermaßen für Evaluierung statt für Produktion ausgelegt, und ein Slug, der nach einem Preview benannt ist, ist ein Slug, der ohne Vorankündigung gedrosselt werden kann. Zweitens ist die Messung eine Momentaufnahme eines Pfades zu einem Zeitpunkt. Sie wird sich ändern. Was sich nicht ändern wird, ist die Lehre: Eine Abhängigkeit von einer Preview-Route ist eine Abhängigkeit von einer Kapazitätsentscheidung, die jemand anderes trifft.
Die Abhilfemaßnahmen sind wenig glamourös, und sie sind der eigentliche Grund dafür, dass Routing als Disziplin existiert und nicht als Bequemlichkeit.
• Einen Preview-Slug niemals fest in einen Produktionspfad hartcodieren — kapsle die Funktionalität hinter einer Schnittstelle, damit das dahinterliegende Modell ohne Deployment ausgetauscht werden kann
• Erneut versuchen und auf einen anderen Anbieter oder ein anderes Modell ausweichen – bei einem Batch-Extraktionsjob ist eine Ausfallrate von 94 % verkraftbar, wenn die Fehler woandershin geleitet werden, und fatal, wenn nicht
• Messen Sie Ihre eigene Fehlerquote, anstatt eine vorgegebene zu übernehmen – die Zahl von 93,93 % ist der Wert unseres Katalogs für eine Route, und Ihre wird von Ihrer Region, Ihrem Volumen und der Form Ihrer Arbeitslast abhängen
• Halten Sie ein zweites Modell für alles warm, was auf einer klinischen Zeitachse liegt — Der Ausfallmodus, vor dem Sie sich schützen, ist nicht eine schlechte Antwort, sondern gar keine Antwort
Dieselbe Disziplin gilt in die entgegengesetzte Richtung auf der CT-Seite, wo es überhaupt keine Route gibt. Ein selbst gehostetes Modell hat keine Anbieterfehlerrate; es hat eine Hardware-Fehlerrate, einen Wartungsaufwand und eine Kapazitätsobergrenze, die davon abhängt, wie viele GPUs Sie gekauft haben. Der Fehlermodus ist eine Warteschlange, und die Abhilfe ist Scheduling statt Failover. Anderes Problem, dieselbe Regel: Wissen Sie, auf welche Zahl Sie sich tatsächlich verlassen.
Wo ein langer Kontext wirklich hilft und wo nicht.
Das 1.048.576-Token-Fenster von Gemini 3.1 Pro und seine Langkontext-Recall-Wertung von 82 Punkten sind echte Vorteile und es lohnt sich, sie bewusst statt versehentlich zu nutzen.
Der Punkt, an dem sie in einem CT-Programm etwas bringen, ist nicht der Scan. Es ist alles drumherum. Ein einzelner Extraktionsdurchlauf über eine lange Operationsnotiz und die zugehörigen Berichte, wobei das gesamte Dokument im Kontext gehalten wird, damit die Felder zueinander konsistent sind. Eine Kohortenzusammenfassung, die Hunderte Patientennarrative gleichzeitig halten muss, um das Muster über sie hinweg zu erkennen. Ein Konvertierungsjob, bei dem das Schema, einhundert Beispiel-Datensätze und das Fehlerprotokoll alle im selben Aufruf sichtbar sein müssen. Das sind Aufgaben, bei denen ein langes Fenster die Antwort verändert, nicht nur den Komfort.
Die Stelle, an der es nicht hilft, ist der Scan selbst, und der Grund ist es wert, genau genannt zu werden, weil es genau der Fehler ist, zu dem diese Gegenüberstellung verleitet. Ein Thorax-CT, dargestellt so, wie NV-Reason-CT es darstellt, kostet 13.824 Tokens. Gemini 3.1 Pro könnte siebzig solcher Untersuchungen in seinem Fenster unterbringen, mit Platz übrig. Die Einschränkung ist nicht der Platz. Sie besteht darin, dass der Vision-Pfad von Gemini 3.1 Pro ein Bild als ein Bild mit einer Pixel-Skala behandelt, sodass eine so präsentierte Untersuchung den Zwischenschichtabstand und die Dichtekalibrierung verloren hat, bevor das erste Token ausgegeben wird. Man kann eine Million Tokens für ein Volumen ausgeben und hat trotzdem kein Volumen. Der Vergleich in der Arbeit selbst macht die Kosten dafür konkret: MedGemma 1.5 mit 0,303 F1, wenn bis zu 85 axiale Schichten eingespeist werden, gegenüber 0,614 für das native volumetrische Modell, was eine Lücke von ungefähr dem Doppelten ist.
Wo wir stehen, und das eine, das wir nicht sagen werden
Gemini 3.1 Pro wird über OrcaRouter als google/gemini-3.1-pro-preview zum Listenpreis des Anbieters ohne Aufschlag bereitgestellt, innerhalb einer einzigen API, die mehr als 200 Modelle abdeckt. Für ein Modell, das sich derzeit in einer Preview-Stufe befindet, ist diese Kombination nützlicher, als es klingt. Null Aufschlag bedeutet, dass eine Preisänderung des Anbieters noch am selben Tag bei uns ankommt, statt von einer Zwischenschicht absorbiert zu werden, die an einer alten Zahl festhält. Automatisches Failover bedeutet, dass eine Route, die auszufallen beginnt, nicht einen ganzen Batch mit sich reißt – was angesichts einer gemessenen Fehlerrate im neunziger Bereich auf einem Pfad nicht hypothetisch ist. Und eine Routing-DSL, mit der sich einzelne Anfragen an das Modell senden lassen, das sie bearbeiten sollte, ermöglicht es Ihnen, die Long-Context-Arbeit auf ein Modell und die günstige Volumenarbeit auf ein anderes zu verlagern, ohne zwei Integrationen pflegen zu müssen.
NV-Reason-CT ist nicht auf unserer Plattform. Kein NVIDIA-Modell ist es. Es sind Gewichte, die Sie selbst herunterladen und ausführen, und die ehrliche Einordnung ist, dass die beiden Hälften dieser Architektur an völlig unterschiedlichen Orten angesiedelt sind: die eine hinter einer API mit einer Preisliste und einem Preview-Risiko, die andere auf Ihrer eigenen Hardware mit einer OpenMDW-1.1-Lizenz und einem Durchsatzwert, den Sie selbst ermitteln müssen.


Die Entscheidung, die den Kontakt mit der Produktion übersteht
Wenn es bei Ihrem Problem um das Verstehen von Text, Audio, Video oder Dokumenten bei langem Kontext geht, wird Gemini 3.1 Pro bei Wissen und Recall unabhängig an der Spitze des Feldes gemessen, und das Einzige, was zwischen ihm und einer Produktionspipeline steht, ist die Zuverlässigkeit der Route – ein lösbares Engineering-Problem, kein Modellproblem. Setzen Sie es hinter Failover, hardcodieren Sie nicht den Preview-Slug, und messen Sie Ihre eigene Fehlerrate, statt irgendjemandem zu vertrauen – auch uns nicht.
Wenn Ihr Problem ein Thorax- oder Abdomen-CT-Volumen ist, gibt es in diesem Vergleich genau ein offenes Modell, das es adressieren kann; es ist nicht das mit dem Fenster von einer Million Token, und die Zahl, die Ihre Planung bestimmen sollte, ist nicht sein F1-Score. Es ist die Latenz pro Studie, die niemand veröffentlicht hat. Messen Sie sie, bevor Sie jemandem einen Durchsatzwert versprechen.
Der Vergleich lohnt sich, weil er zwei Dinge trennt, die ständig vermischt werden: die Breite der Eingabe und die Tiefe der Repräsentation. Gemini 3.1 Pro hat die breiteste Eingabeoberfläche, die jemals jemand ausgeliefert hat, und den besten Long-Context-Recall in diesem Set – und kann eine CT-Untersuchung trotzdem nicht als CT-Untersuchung lesen. NV-Reason-CT kann eine lesen und sonst nichts. Eine Pipeline braucht beides, braucht beides auf unterschiedlicher Infrastruktur und muss wissen, welche der beiden Zahlen auf jeder Seite diejenige ist, die einen um drei Uhr morgens alarmiert.
