
NV-Reason-CT vs Gemini 3.1 Pro: najszersza powierzchnia wejściowa, a wciąż nie czytnik CT
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 506 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 183 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Dziewięćdziesiąt cztery procent. Taki współczynnik błędów odnotowuje obecnie nasz własny katalog dla jednej trasy obsługującej Gemini 3.1 Pro — 93,93%, obok mediany czasu do pierwszego tokenu, która wygląda jak dziesięciosekundowy limit, oraz przepustowości na poziomie 978 tokenów na sekundę. Odczytaj to jako stwierdzenie o samym modelu, a wyciągniesz dokładnie błędny wniosek. Odczytaj to jako stwierdzenie o warstwie podglądowej pod obciążeniem, a stanie się to najużyteczniejszą rzeczą na stronie — bo dokładnie tego doświadcza kliniczny potok przetwarzania, gdy opiera się na trasie, która nie została przygotowana na ruch produkcyjny.
Model po drugiej stronie tego porównania nie ma takiego problemu ani takiego pomiaru. NV-Reason-CT to natywny model rozumowania 3D CT firmy NVIDIA z 4,69 mld parametrów, dostępny do pobrania na licencji OpenMDW-1.1, bez jakichkolwiek opublikowanych danych o przepustowości i bez hostingu w ogóle. Tak więc jedna strona tego starcia daje ci najszerszą powierzchnię wejściową w branży, z profilem dostępności, wokół którego musisz projektować; druga daje ci jedną wąską możliwość, z opóźnieniem, które musisz zmierzyć samodzielnie. Żadna z nich nie ma pulpitu monitorowania, któremu można zaufać od pierwszego dnia — i to z przeciwnych powodów.
Dwa modele, dwie definicje „multimodalności”
To słowo wykonuje mnóstwo pracy w obu opisach produktów, a niemal nic z tej pracy nie jest wspólne.
• Akceptowane dane wejściowe — Gemini 3.1 Pro przyjmuje tekst, obrazy, dźwięk, wideo i pliki; NV-Reason-CT przyjmuje wyłącznie jednokanałowy wolumen NIfTI w jednostkach Hounsfielda i nic więcej
• Co oznacza „3D” — NV-Reason-CT ponownie próbkuje do izotropowych 2 mm w sześcianie o boku 384 milimetrów i dzieli go na fragmenty 8 x 8 x 8 dla siatki 24 x 24 x 24; wejście wideo Gemini 3.1 Pro to sekwencja dwuwymiarowych klatek z
• Kontekst — 1 048 576 tokenów na wejściu i 65 536 na wyjściu dla Gemini 3.1 Pro; jeden tom to 13 824 tokeny wizualne dla NV-Reason-CT, bez downsamplingu i bez warstwy scalającej, a wokół niego nie ma okna czatu
• Wydanie — 19 lutego 2026 dla Gemini 3.1 Pro, pod roboczym adresem podglądowym; nieogłoszony research drop dla NV-Reason-CT, z aktywnością w repozytorium datowaną na 2–25 września 2026
• Cena — 2 USD i 12 USD za milion tokenów do 200 000 tokenów, a następnie 4 USD i 18 USD, przy czym odczyt z pamięci podręcznej kosztuje 0,20 USD, a zapis do pamięci podręcznej 0,375 USD; w zestawieniu z samodzielnie hostowanymi wagami bez cennika
• Możliwości — wizja, audio, korzystanie z narzędzi, dane wyjściowe JSON i rozumowanie dla Gemini 3.1 Pro; ustrukturyzowane wyniki według regionu anatomicznego dla NV-Reason-CT, bez narzędzi
• Licencja i status — hostowane API w wersji zapoznawczej; na wagach OpenMDW-1.1, których karta modelu wskazuje wyłącznie zastosowania badawcze i edukacyjne oraz wprost stwierdza, że nie jest to wyrób medyczny
Wejście wideo i objętościowe wejście CT z dystansu wyglądają podobnie, a z bliska nie mogłyby się bardziej różnić. Wideo to klatki w czasie. Badanie CT to pojedyncza statyczna objętość z trzema osiami przestrzennymi, fizyczną skalą w milimetrach i skalibrowaną jednostką gęstości, w której mierzoną rzeczą jest gęstość struktury, której rozmiar ma znaczenie. Gemini 3.1 Pro obejrzy nagranie operacji i opisze, co się stało. Nie zmierzy guzka. To nie jest ograniczenie, którego Google nie zdołał rozwiązać; to inny problem, którego nikt nie rozwiązał za pomocą modelu ogólnego.
Co obejmują dwa rekordy benchmarkowe, a co pomijają
Gemini 3.1 Pro ma niezależny dorobek i jest on dobry na osiach, które mierzy.
• GPQA Diamond — 94,1, najwyższy wynik w całym tym zestawie artykułów
• Humanity's Last Exam — 47, z wynikiem 82 w zakresie przywoływania długiego kontekstu, ponownie najwyższym w tym porównaniu
• IFBench i SciCode — 77.14 i 58.7
• τ²-Bench — 95,61, z tau_banking na poziomie 21,44 i Terminal-Bench Hard na poziomie 53,79
• Inteligencja i kodowanie Artificial Analysis — 29,7 i 68,8
• Zmierzona latencja — dziesięciosekundowa mediana do pierwszego tokenu, która wydaje się być ograniczeniem, a nie prawdziwą medianą, przy 978 tokenach na sekundę i 93,93% wskaźniku błędów
Zwróć uwagę na układ tego: wynik wiedzy i długiego kontekstu na górze porównania, wynik złożony 29,7 w dolnej środkowej części oraz wskaźnik błędów 93,93%, będący miarą dostępności. Wszystkie trzy opisują ten sam model na tej samej trasie. Wysoki wynik GPQA oznacza, że wie bardzo dużo. Wynik złożony 29,7 oznacza, że nie przoduje we wszystkim. Wskaźnik błędów 93,93% oznacza, że na tej konkretnej ścieżce większość twoich żądań nie zostanie ukończona — i jest to prawie na pewno fakt dotyczący przepustowości i aprowizacji punktu końcowego w wersji zapoznawczej, a nie właściwość wag. Nie możemy z zewnątrz dowieść, które z nich zachodzi. Możemy powiedzieć tyle, że żadna z tych trzech liczb nie jest literówką, a każda architektura, która odczytuje tylko pierwszą z nich, będzie miała zły tydzień.
Wynik NV-Reason-CT jest węższy i wiąże się z innym zastrzeżeniem. Jego 0,614 F1 i 0,871 AUROC na CT-RATE, w osiemnastu etykietach, przy stałym jednolitym progu, bezpośrednim pytaniu tak/nie oraz bez głowy klasyfikacyjnej czy dostosowania do konkretnego zadania, to własne liczby NVIDIA z własnej publikacji NVIDIA. Zestaw porównawczy stojący za nimi — VoxelFM na 0,581, Pillar-0 na 0,544, ClinFusion-8B na 0,442, CT-CLIP na 0,398, Merlin na 0,358, MedGemma 1.5 na 0,303 — zawiera wyłącznie modele obrazowe. Nie pojawia się w nim żaden ogólny model multimodalny, co oznacza, że pytanie „jak poradziłby sobie Gemini 3.1 Pro na CT-RATE” nie zostało zadane, a tym bardziej nie uzyskało odpowiedzi.

Problem poziomu podglądu, sformułowany należycie
To jest ta część porównania, która nie ma nic wspólnego z CT, a w całości dotyczy prowadzenia czegokolwiek o charakterze klinicznym.
Współczynnik błędów na poziomie 93,93% nie jest subtelnym pogorszeniem. To trasa, na której zawodzi zdecydowana większość wywołań. Naturalną reakcją jest uznanie modelu za bezużyteczny, ale ta reakcja jest błędna z dwóch powodów. Po pierwsze, współczynnik błędów mierzony na punkcie końcowym w wersji zapoznawczej odzwierciedla przepustowość, przydziały i routing regionalny, a nie możliwości modelu. Warstwy zapoznawcze Google słyną z tego, że są przygotowane do oceny, a nie do produkcji, a slug nazwany od wersji zapoznawczej to slug, który można ograniczyć bez ostrzeżenia. Po drugie, pomiar jest migawką jednej ścieżki w jednym momencie. To się zmieni. Nie zmieni się lekcja: zależność od trasy w wersji zapoznawczej to zależność od decyzji o przepustowości podejmowanej przez kogoś innego.
Środki zaradcze są nieatrakcyjne i to one są całym powodem, dla którego routing istnieje jako dyscyplina, a nie jako udogodnienie.
• Nigdy nie wpisuj na sztywno sluga podglądu w ścieżkę produkcyjną — umieść tę funkcję za interfejsem, aby model, który za nią stoi, można było wymienić bez wdrożenia
• Ponów próbę i przełącz się awaryjnie na innego dostawcę lub inny model — w przypadku zadania wsadowego ekstrakcji wskaźnik niepowodzeń na poziomie 94% da się przetrwać, jeśli błędy są kierowane gdzie indziej, a jeśli nie — jest zabójczy
• Zmierz własny wskaźnik błędów, zamiast dziedziczyć cudzy — wartość 93,93% to liczba z naszego katalogu dla jednej trasy, a twoja będzie zależeć od twojego regionu, wolumenu i kształtu obciążenia
• Utrzymuj drugi model w gotowości dla wszystkiego, co ma kliniczny harmonogram — tryb awarii, przed którym się chronisz, to nie zła odpowiedź, lecz brak odpowiedzi
Ta sama dyscyplina obowiązuje w przeciwnym kierunku po stronie CT, gdzie nie ma żadnej trasy. Model hostowany samodzielnie nie ma współczynnika błędów dostawcy; ma współczynnik błędów sprzętu, obciążenie związane z utrzymaniem i pułap przepustowości wyznaczany przez to, ile kart GPU kupiłeś. Trybem awarii jest kolejka, a środkiem zaradczym — planowanie, a nie przełączanie awaryjne. Inny problem, ta sama zasada: wiedz, od którego wskaźnika tak naprawdę zależą twoje działania.
Gdzie długi kontekst naprawdę pomaga, a gdzie nie
Okno 1 048 576 tokenów Gemini 3.1 Pro i wynik 82 punktów w przywoływaniu długiego kontekstu to prawdziwe zalety, które warto wykorzystywać świadomie, a nie przypadkowo.
To, gdzie w programie CT się to opłaca, to nie skan. To wszystko wokół niego. Pojedynczy przebieg ekstrakcji przez długą notatkę operacyjną i powiązane z nią raporty, utrzymujący cały dokument w kontekście, tak aby pola były ze sobą spójne. Podsumowanie kohorty, które musi pomieścić setki narracji pacjentów naraz, aby znaleźć wzorzec wśród nich. Zadanie konwersji, w którym schemat, sto przykładowych rekordów i dziennik błędów muszą być widoczne w tym samym wywołaniu. To zadania, w których długie okno zmienia odpowiedź, a nie tylko wygodę.
Miejscem, w którym to nie pomaga, jest sam skan, a powód warto podać precyzyjnie, ponieważ jest to błąd, do którego zachęca to zestawienie. Tomografia komputerowa klatki piersiowej przedstawiona tak, jak przedstawia ją NV-Reason-CT, kosztuje 13 824 tokeny. Gemini 3.1 Pro mógłby zmieścić siedemdziesiąt takich badań w swoim oknie, i to z zapasem. Ograniczeniem nie jest miejsce. Problem polega na tym, że ścieżka wizyjna Gemini 3.1 Pro traktuje obraz jako zdjęcie o skali pikseli, więc badanie przedstawione w ten sposób utraciło odstępy między warstwami i kalibrację gęstości, zanim został wyemitowany pierwszy token. Można wydać milion tokenów na wolumen i wciąż nie mieć wolumenu. Porównanie zawarte w samej pracy czyni koszt tego konkretnym: MedGemma 1.5 przy 0,303 F1, gdy podano jej do 85 przekrojów osiowych, wobec 0,614 dla natywnego modelu wolumetrycznego, co stanowi różnicę w przybliżeniu dwukrotną.
Gdzie pasujemy i ta jedna rzecz, której nie powiemy
Gemini 3.1 Pro jest udostępniany przez OrcaRouter jako google/gemini-3.1-pro-preview w cenie katalogowej dostawcy, bez marży, w ramach jednego API obejmującego ponad 200 modeli. W przypadku modelu, który obecnie znajduje się na poziomie preview, ta kombinacja jest bardziej przydatna, niż się wydaje. Zerowa marża oznacza, że zmiana stawki dostawcy trafia po naszej stronie tego samego dnia, zamiast być pochłaniana przez warstwę pośrednią trzymającą się starej liczby. Automatyczne przełączanie awaryjne oznacza, że trasa, która zaczyna zawodzić, nie pociąga za sobą całej partii — co, biorąc pod uwagę zmierzony wskaźnik błędów na poziomie dziewięćdziesięciu kilku procent na jednej ścieżce, nie jest hipotetyczne. A DSL routingu do kierowania poszczególnych żądań do modelu, który powinien je obsłużyć, pozwala przydzielić zadania z długim kontekstem do jednego modelu, a tanie zadania o dużej objętości do innego, bez utrzymywania dwóch integracji.
NV-Reason-CT nie ma na naszej platformie. Żaden model NVIDIA też nie. To wagi, które pobierasz i uruchamiasz samodzielnie, a uczciwe ujęcie sprawy jest takie, że dwie połowy tej architektury żyją w całkowicie różnych miejscach: jedna za API z cennikiem i ryzykiem wersji zapoznawczej, druga na własnym sprzęcie z licencją OpenMDW-1.1 i wskaźnikiem przepustowości, który musisz samodzielnie uzyskać.


Decyzja, która przetrwa kontakt z produkcją
Jeśli Twoim problemem jest rozumienie tekstu, dźwięku, wideo lub dokumentów w długim kontekście, Gemini 3.1 Pro jest niezależnie mierzony na czele dziedziny pod względem wiedzy i przywoływania, a jedyną rzeczą, która dzieli go od potoku produkcyjnego, jest niezawodność routingu — co jest rozwiązywalnym problemem inżynieryjnym, a nie problemem modelu. Umieść go za mechanizmem przełączania awaryjnego, nie wpisuj na sztywno sluga wersji zapoznawczej i mierz własny wskaźnik błędów, zamiast ufać czyjemukolwiek, w tym naszemu.
Jeśli Twoim problemem jest objętość TK klatki piersiowej lub jamy brzusznej, w tym porównaniu istnieje dokładnie jeden otwarty model, który może sobie z tym poradzić, nie jest to ten z oknem na milion tokenów, a liczbą, która powinna rządzić Twoim planowaniem, nie jest jego wynik F1. Jest to opóźnienie na badanie, którego nikt nie opublikował. Zmierz je, zanim komukolwiek obiecasz wartość przepustowości.
To porównanie warto przeprowadzić, ponieważ rozdziela dwie rzeczy, które są stale mieszane: szerokość danych wejściowych i głębokość reprezentacji. Gemini 3.1 Pro ma najszerszą powierzchnię wejściową, jaką ktokolwiek wprowadził na rynek, oraz najlepsze przywoływanie długiego kontekstu w tym zestawie, a mimo to wciąż nie potrafi odczytać badania TK jako badania TK. NV-Reason-CT potrafi odczytać jedno i nic poza tym. Potok potrzebuje obu, potrzebuje ich na różnej infrastrukturze i musi wiedzieć, która z dwóch liczb po każdej stronie jest tą, która zaalarmuje cię o trzeciej nad ranem.
