Wygenerowana karta hero zatytułowana 'NV-Reason-CT vs Gemini 3.1 Pro' z podtytułem 'Najszersza powierzchnia wejściowa, a wciąż nie czytnik CT'. Dwie zwrócone do siebie karty są rozdzielone parą niebieskich strzałek: lewa karta jest oznaczona jako 'NV-Reason-CT' z ikoną skanowania ciała i 'tylko klatka piersiowa i brzuch - 13 824 tokenów wizualnych na objętość - OpenMDW-1.1'; prawa karta jest oznaczona jako 'Gemini 3.1 Pro' z ikoną chipa i 'audio, wideo, obraz, plik, tekst na wejściu - kontekst 1M - poziom preview'. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

NV-Reason-CT vs Gemini 3.1 Pro: najszersza powierzchnia wejściowa, a wciąż nie czytnik CT

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dziewięćdziesiąt cztery procent. Taki współczynnik błędów odnotowuje obecnie nasz własny katalog dla jednej trasy obsługującej Gemini 3.1 Pro — 93,93%, obok mediany czasu do pierwszego tokenu, która wygląda jak dziesięciosekundowy limit, oraz przepustowości na poziomie 978 tokenów na sekundę. Odczytaj to jako stwierdzenie o samym modelu, a wyciągniesz dokładnie błędny wniosek. Odczytaj to jako stwierdzenie o warstwie podglądowej pod obciążeniem, a stanie się to najużyteczniejszą rzeczą na stronie — bo dokładnie tego doświadcza kliniczny potok przetwarzania, gdy opiera się na trasie, która nie została przygotowana na ruch produkcyjny.

Model po drugiej stronie tego porównania nie ma takiego problemu ani takiego pomiaru. NV-Reason-CT to natywny model rozumowania 3D CT firmy NVIDIA z 4,69 mld parametrów, dostępny do pobrania na licencji OpenMDW-1.1, bez jakichkolwiek opublikowanych danych o przepustowości i bez hostingu w ogóle. Tak więc jedna strona tego starcia daje ci najszerszą powierzchnię wejściową w branży, z profilem dostępności, wokół którego musisz projektować; druga daje ci jedną wąską możliwość, z opóźnieniem, które musisz zmierzyć samodzielnie. Żadna z nich nie ma pulpitu monitorowania, któremu można zaufać od pierwszego dnia — i to z przeciwnych powodów.

Dwa modele, dwie definicje „multimodalności”

To słowo wykonuje mnóstwo pracy w obu opisach produktów, a niemal nic z tej pracy nie jest wspólne.

• Akceptowane dane wejściowe — Gemini 3.1 Pro przyjmuje tekst, obrazy, dźwięk, wideo i pliki; NV-Reason-CT przyjmuje wyłącznie jednokanałowy wolumen NIfTI w jednostkach Hounsfielda i nic więcej

• Co oznacza „3D” — NV-Reason-CT ponownie próbkuje do izotropowych 2 mm w sześcianie o boku 384 milimetrów i dzieli go na fragmenty 8 x 8 x 8 dla siatki 24 x 24 x 24; wejście wideo Gemini 3.1 Pro to sekwencja dwuwymiarowych klatek z

• Kontekst — 1 048 576 tokenów na wejściu i 65 536 na wyjściu dla Gemini 3.1 Pro; jeden tom to 13 824 tokeny wizualne dla NV-Reason-CT, bez downsamplingu i bez warstwy scalającej, a wokół niego nie ma okna czatu

• Wydanie — 19 lutego 2026 dla Gemini 3.1 Pro, pod roboczym adresem podglądowym; nieogłoszony research drop dla NV-Reason-CT, z aktywnością w repozytorium datowaną na 2–25 września 2026

• Cena — 2 USD i 12 USD za milion tokenów do 200 000 tokenów, a następnie 4 USD i 18 USD, przy czym odczyt z pamięci podręcznej kosztuje 0,20 USD, a zapis do pamięci podręcznej 0,375 USD; w zestawieniu z samodzielnie hostowanymi wagami bez cennika

• Możliwości — wizja, audio, korzystanie z narzędzi, dane wyjściowe JSON i rozumowanie dla Gemini 3.1 Pro; ustrukturyzowane wyniki według regionu anatomicznego dla NV-Reason-CT, bez narzędzi

• Licencja i status — hostowane API w wersji zapoznawczej; na wagach OpenMDW-1.1, których karta modelu wskazuje wyłącznie zastosowania badawcze i edukacyjne oraz wprost stwierdza, że nie jest to wyrób medyczny

Wejście wideo i objętościowe wejście CT z dystansu wyglądają podobnie, a z bliska nie mogłyby się bardziej różnić. Wideo to klatki w czasie. Badanie CT to pojedyncza statyczna objętość z trzema osiami przestrzennymi, fizyczną skalą w milimetrach i skalibrowaną jednostką gęstości, w której mierzoną rzeczą jest gęstość struktury, której rozmiar ma znaczenie. Gemini 3.1 Pro obejrzy nagranie operacji i opisze, co się stało. Nie zmierzy guzka. To nie jest ograniczenie, którego Google nie zdołał rozwiązać; to inny problem, którego nikt nie rozwiązał za pomocą modelu ogólnego.

Co obejmują dwa rekordy benchmarkowe, a co pomijają

Gemini 3.1 Pro ma niezależny dorobek i jest on dobry na osiach, które mierzy.

• GPQA Diamond — 94,1, najwyższy wynik w całym tym zestawie artykułów

• Humanity's Last Exam — 47, z wynikiem 82 w zakresie przywoływania długiego kontekstu, ponownie najwyższym w tym porównaniu

• IFBench i SciCode — 77.14 i 58.7

• τ²-Bench — 95,61, z tau_banking na poziomie 21,44 i Terminal-Bench Hard na poziomie 53,79

• Inteligencja i kodowanie Artificial Analysis — 29,7 i 68,8

• Zmierzona latencja — dziesięciosekundowa mediana do pierwszego tokenu, która wydaje się być ograniczeniem, a nie prawdziwą medianą, przy 978 tokenach na sekundę i 93,93% wskaźniku błędów

Zwróć uwagę na układ tego: wynik wiedzy i długiego kontekstu na górze porównania, wynik złożony 29,7 w dolnej środkowej części oraz wskaźnik błędów 93,93%, będący miarą dostępności. Wszystkie trzy opisują ten sam model na tej samej trasie. Wysoki wynik GPQA oznacza, że wie bardzo dużo. Wynik złożony 29,7 oznacza, że nie przoduje we wszystkim. Wskaźnik błędów 93,93% oznacza, że na tej konkretnej ścieżce większość twoich żądań nie zostanie ukończona — i jest to prawie na pewno fakt dotyczący przepustowości i aprowizacji punktu końcowego w wersji zapoznawczej, a nie właściwość wag. Nie możemy z zewnątrz dowieść, które z nich zachodzi. Możemy powiedzieć tyle, że żadna z tych trzech liczb nie jest literówką, a każda architektura, która odczytuje tylko pierwszą z nich, będzie miała zły tydzień.

Wynik NV-Reason-CT jest węższy i wiąże się z innym zastrzeżeniem. Jego 0,614 F1 i 0,871 AUROC na CT-RATE, w osiemnastu etykietach, przy stałym jednolitym progu, bezpośrednim pytaniu tak/nie oraz bez głowy klasyfikacyjnej czy dostosowania do konkretnego zadania, to własne liczby NVIDIA z własnej publikacji NVIDIA. Zestaw porównawczy stojący za nimi — VoxelFM na 0,581, Pillar-0 na 0,544, ClinFusion-8B na 0,442, CT-CLIP na 0,398, Merlin na 0,358, MedGemma 1.5 na 0,303 — zawiera wyłącznie modele obrazowe. Nie pojawia się w nim żaden ogólny model multimodalny, co oznacza, że pytanie „jak poradziłby sobie Gemini 3.1 Pro na CT-RATE” nie zostało zadane, a tym bardziej nie uzyskało odpowiedzi.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

Problem poziomu podglądu, sformułowany należycie

To jest ta część porównania, która nie ma nic wspólnego z CT, a w całości dotyczy prowadzenia czegokolwiek o charakterze klinicznym.

Współczynnik błędów na poziomie 93,93% nie jest subtelnym pogorszeniem. To trasa, na której zawodzi zdecydowana większość wywołań. Naturalną reakcją jest uznanie modelu za bezużyteczny, ale ta reakcja jest błędna z dwóch powodów. Po pierwsze, współczynnik błędów mierzony na punkcie końcowym w wersji zapoznawczej odzwierciedla przepustowość, przydziały i routing regionalny, a nie możliwości modelu. Warstwy zapoznawcze Google słyną z tego, że są przygotowane do oceny, a nie do produkcji, a slug nazwany od wersji zapoznawczej to slug, który można ograniczyć bez ostrzeżenia. Po drugie, pomiar jest migawką jednej ścieżki w jednym momencie. To się zmieni. Nie zmieni się lekcja: zależność od trasy w wersji zapoznawczej to zależność od decyzji o przepustowości podejmowanej przez kogoś innego.

Środki zaradcze są nieatrakcyjne i to one są całym powodem, dla którego routing istnieje jako dyscyplina, a nie jako udogodnienie.

• Nigdy nie wpisuj na sztywno sluga podglądu w ścieżkę produkcyjną — umieść tę funkcję za interfejsem, aby model, który za nią stoi, można było wymienić bez wdrożenia

• Ponów próbę i przełącz się awaryjnie na innego dostawcę lub inny model — w przypadku zadania wsadowego ekstrakcji wskaźnik niepowodzeń na poziomie 94% da się przetrwać, jeśli błędy są kierowane gdzie indziej, a jeśli nie — jest zabójczy

• Zmierz własny wskaźnik błędów, zamiast dziedziczyć cudzy — wartość 93,93% to liczba z naszego katalogu dla jednej trasy, a twoja będzie zależeć od twojego regionu, wolumenu i kształtu obciążenia

• Utrzymuj drugi model w gotowości dla wszystkiego, co ma kliniczny harmonogram — tryb awarii, przed którym się chronisz, to nie zła odpowiedź, lecz brak odpowiedzi

Ta sama dyscyplina obowiązuje w przeciwnym kierunku po stronie CT, gdzie nie ma żadnej trasy. Model hostowany samodzielnie nie ma współczynnika błędów dostawcy; ma współczynnik błędów sprzętu, obciążenie związane z utrzymaniem i pułap przepustowości wyznaczany przez to, ile kart GPU kupiłeś. Trybem awarii jest kolejka, a środkiem zaradczym — planowanie, a nie przełączanie awaryjne. Inny problem, ta sama zasada: wiedz, od którego wskaźnika tak naprawdę zależą twoje działania.

Gdzie długi kontekst naprawdę pomaga, a gdzie nie

Okno 1 048 576 tokenów Gemini 3.1 Pro i wynik 82 punktów w przywoływaniu długiego kontekstu to prawdziwe zalety, które warto wykorzystywać świadomie, a nie przypadkowo.

To, gdzie w programie CT się to opłaca, to nie skan. To wszystko wokół niego. Pojedynczy przebieg ekstrakcji przez długą notatkę operacyjną i powiązane z nią raporty, utrzymujący cały dokument w kontekście, tak aby pola były ze sobą spójne. Podsumowanie kohorty, które musi pomieścić setki narracji pacjentów naraz, aby znaleźć wzorzec wśród nich. Zadanie konwersji, w którym schemat, sto przykładowych rekordów i dziennik błędów muszą być widoczne w tym samym wywołaniu. To zadania, w których długie okno zmienia odpowiedź, a nie tylko wygodę.

Miejscem, w którym to nie pomaga, jest sam skan, a powód warto podać precyzyjnie, ponieważ jest to błąd, do którego zachęca to zestawienie. Tomografia komputerowa klatki piersiowej przedstawiona tak, jak przedstawia ją NV-Reason-CT, kosztuje 13 824 tokeny. Gemini 3.1 Pro mógłby zmieścić siedemdziesiąt takich badań w swoim oknie, i to z zapasem. Ograniczeniem nie jest miejsce. Problem polega na tym, że ścieżka wizyjna Gemini 3.1 Pro traktuje obraz jako zdjęcie o skali pikseli, więc badanie przedstawione w ten sposób utraciło odstępy między warstwami i kalibrację gęstości, zanim został wyemitowany pierwszy token. Można wydać milion tokenów na wolumen i wciąż nie mieć wolumenu. Porównanie zawarte w samej pracy czyni koszt tego konkretnym: MedGemma 1.5 przy 0,303 F1, gdy podano jej do 85 przekrojów osiowych, wobec 0,614 dla natywnego modelu wolumetrycznego, co stanowi różnicę w przybliżeniu dwukrotną.

Gdzie pasujemy i ta jedna rzecz, której nie powiemy

Gemini 3.1 Pro jest udostępniany przez OrcaRouter jako google/gemini-3.1-pro-preview w cenie katalogowej dostawcy, bez marży, w ramach jednego API obejmującego ponad 200 modeli. W przypadku modelu, który obecnie znajduje się na poziomie preview, ta kombinacja jest bardziej przydatna, niż się wydaje. Zerowa marża oznacza, że zmiana stawki dostawcy trafia po naszej stronie tego samego dnia, zamiast być pochłaniana przez warstwę pośrednią trzymającą się starej liczby. Automatyczne przełączanie awaryjne oznacza, że trasa, która zaczyna zawodzić, nie pociąga za sobą całej partii — co, biorąc pod uwagę zmierzony wskaźnik błędów na poziomie dziewięćdziesięciu kilku procent na jednej ścieżce, nie jest hipotetyczne. A DSL routingu do kierowania poszczególnych żądań do modelu, który powinien je obsłużyć, pozwala przydzielić zadania z długim kontekstem do jednego modelu, a tanie zadania o dużej objętości do innego, bez utrzymywania dwóch integracji.

NV-Reason-CT nie ma na naszej platformie. Żaden model NVIDIA też nie. To wagi, które pobierasz i uruchamiasz samodzielnie, a uczciwe ujęcie sprawy jest takie, że dwie połowy tej architektury żyją w całkowicie różnych miejscach: jedna za API z cennikiem i ryzykiem wersji zapoznawczej, druga na własnym sprzęcie z licencją OpenMDW-1.1 i wskaźnikiem przepustowości, który musisz samodzielnie uzyskać.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

Decyzja, która przetrwa kontakt z produkcją

Jeśli Twoim problemem jest rozumienie tekstu, dźwięku, wideo lub dokumentów w długim kontekście, Gemini 3.1 Pro jest niezależnie mierzony na czele dziedziny pod względem wiedzy i przywoływania, a jedyną rzeczą, która dzieli go od potoku produkcyjnego, jest niezawodność routingu — co jest rozwiązywalnym problemem inżynieryjnym, a nie problemem modelu. Umieść go za mechanizmem przełączania awaryjnego, nie wpisuj na sztywno sluga wersji zapoznawczej i mierz własny wskaźnik błędów, zamiast ufać czyjemukolwiek, w tym naszemu.

Jeśli Twoim problemem jest objętość TK klatki piersiowej lub jamy brzusznej, w tym porównaniu istnieje dokładnie jeden otwarty model, który może sobie z tym poradzić, nie jest to ten z oknem na milion tokenów, a liczbą, która powinna rządzić Twoim planowaniem, nie jest jego wynik F1. Jest to opóźnienie na badanie, którego nikt nie opublikował. Zmierz je, zanim komukolwiek obiecasz wartość przepustowości.

To porównanie warto przeprowadzić, ponieważ rozdziela dwie rzeczy, które są stale mieszane: szerokość danych wejściowych i głębokość reprezentacji. Gemini 3.1 Pro ma najszerszą powierzchnię wejściową, jaką ktokolwiek wprowadził na rynek, oraz najlepsze przywoływanie długiego kontekstu w tym zestawie, a mimo to wciąż nie potrafi odczytać badania TK jako badania TK. NV-Reason-CT potrafi odczytać jedno i nic poza tym. Potok potrzebuje obu, potrzebuje ich na różnej infrastrukturze i musi wiedzieć, która z dwóch liczb po każdej stronie jest tą, która zaalarmuje cię o trzeciej nad ranem.