
NV-Reason-CT vs Grok 4.6: Kto odczytuje skan, a kto raport?
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 45 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Istnieją dwa sposoby, aby wprowadzić AI do pipeline'u CT, i tylko jeden z nich dotyczy obrazu. NV-Reason-CT jest pierwszym z nich: modelem 3D typu vision-language o 4,69 mld parametrów, który odczytuje wolumeny NIfTI bezpośrednio i został opublikowany na Hugging Face 8 września 2026 r. bez wpisu premierowego ze strony NVIDIA. Grok 4.6 jest drugim: modelem tekstowo-obrazowym o 500 000 tokenów, który trafił na rynek 12 sierpnia 2026 r., kosztuje 2,00 USD za milion tokenów wejściowych i jest bardzo dobry w tej części zadania, która następuje już po tym, jak ktoś zapisał wynik badania. Zestaw je ze sobą, a zwyczajowe pytanie — który jest lepszy — okaże się źle postawione. Nie konkurują o to samo miejsce w pipeline'ie. Konkurują o tę samą pozycję w budżecie.
Co faktycznie zostało wydane po każdej ze stron
NV-Reason-CT pojawił się jako repozytorium, praca i demo Space, a nie jako produkt. Repozytorium GitHub w organizacji NVIDIA-Medtech utworzono 2 września 2026 r.; wagi na Hugging Face pojawiły się 8 września; preprint arXiv, NV-Reason-CT: Trójwymiarowy model wizualno-językowy do analizy CT, ukazał się 23 września z szesnastoma autorami z NVIDIA, NIH i Uniwersytetu w Zurychu. Newsroom NVIDIA nie zawiera o nim żadnych informacji. Karta modelu opisuje wersję 0.1 i ogranicza użycie do celów badawczych i edukacyjnych.
Grok 4.6 jest wydaniem przeciwnego rodzaju. Jest to pierwszorzędny komercyjny endpoint, wymieniony jako „Latest” w dokumentacji deweloperskiej dostawcy, wyceniony według opublikowanego cennika i dostępny jako model kompatybilny z OpenAI, który istniejące integracje przyjmują poprzez zmianę bazowego URL. Zastąpił Grok 4.5 z tym samym oknem kontekstowym, tą samą powierzchnią wejściową i tym samym podstawowym cennikiem.
Ta asymetria to cała opowieść tego porównania. Jedno to artefakt badawczy, który przypadkiem da się pobrać. Drugie to infrastruktura. Zestawienie ich ze sobą mówi, gdzie obecnie przebiega granica między „artefaktem badawczym” a „infrastrukturą” w obrazowaniu medycznym — i wcale nie tam, gdzie można by się domyślać.
Podział pracy, w nakładach i wynikach
• Wejście objętościowe — NV-Reason-CT czyta wolumeny NIfTI .nii/.nii.gz w jednostkach Hounsfielda, wyłącznie klatka piersiowa lub jama brzuszna, w porównaniu z Grok 4.6, który czyta tekst, obrazy i pliki, bez ścieżki objętościowej • Obsługa przestrzenna — NV-Reason-CT konwertuje wolumen 384×384×384 mm na siatkę 24×24×24 złożoną z 13 824 tokenów z 3D MRoPE, bez podpróbkowania, w porównaniu z Grok 4.6, który traktuje obraz jako dwuwymiarowy obrazek • Kontekst — w NV-Reason-CT jeden wolumen to jeden stały prefiks, brak okna kontekstu w zwykłym sensie, w porównaniu z 500 000 tokenów w Grok 4.6 • Dane wyjściowe — NV-Reason-CT ustrukturyzowany raport, odpowiedź lub ślad rozumowania z możliwością wyłączenia myślenia, w porównaniu z tekstem w Grok 4.6 z ustrukturyzowanymi danymi wyjściowymi i wywołaniami narzędzi • Licencja — NV-Reason-CT OpenMDW-1.1, wagi BF16 o rozmiarze 10,6 GB, w porównaniu z zastrzeżoną licencją Grok 4.6, dostępny tylko przez API • Cena — NV-Reason-CT nakłady inwestycyjne na GPU, brak stawki za token, w porównaniu z Grok 4.6: 2,00 / 6,00 USD za milion, podwojona powyżej 200 tys. tokenów wejściowych

Ta para czyta się jako naturalne przekazanie. NV-Reason-CT generuje odkrycie z wolumenu; Grok 4.6 to model, któremu przekazałbyś tysiąc takich odkryć w jednym oknie kontekstowym, aby szukać wzorców w całej kohorcie. Nikt nie opublikował tego potoku. To oczywista architektura i warto powiedzieć wprost, że jest nieprzetestowana.
Liczby Groka 4.6 i czyje one są
Dwie liczby dotyczące Grok 4.6 krążą razem i nie są tym samym rodzajem rzeczy. Wynik 94,9 w GPQA Diamond jest mierzony przez Artificial Analysis, a nie podawany przez dostawcę — co jest bardziej wiarygodne z tych dwóch kategorii właśnie dlatego, że przeprowadziła to strona trzecia. Wynik 44 w Artificial Analysis Intelligence Index, w wersji indeksu v4.3.2, plasuje Grok 4.6 na 28. miejscu spośród 211 w swojej klasie. Artificial Analysis odnotowuje również, że model jest własnościowy: wagi nie są publicznie dostępne.
Na tej samej tablicy wyników AA mierzy Terminal-Bench 2.1 na 88,4, SciCode na 56,5, Humanity's Last Exam na 42,9, 𝜏²-banking na 50,7 oraz long-context recall na 80,3. To instrumenty ogólnego rozumowania. Żadnego z nich nie można uruchomić na wolumenie CT 3D, i nie jest to przytyk do Grok 4.6 — to stwierdzenie o tym, co mierzy zestaw benchmarków.
Strona CT ma dokładnie jedną tabelę i jest to tabela autorów.
Cała publiczna baza dowodów NV-Reason-CT to jedna tabela klasyfikacji na 18 etykietach CT-RATE, przy stałym jednolitym progu, z użyciem bezpośredniego monitu Tak/Nie bez głowicy klasyfikacyjnej. Podaje Macro-F1 0,614 i Macro-AUROC 0,871, w porównaniu z VoxelFM na poziomie 0,581/0,870, Pillar-0 na poziomie 0,544/0,861, ClinFusion-8B na poziomie 0,442, CT-CLIP na poziomie 0,398/0,733, Merlin na poziomie 0,358/0,662 i MedGemma 1.5 na poziomie 0,303.
Są to dane zgłoszone przez dostawcę, pochodzące z karty modelu, i oznaczam je jako takie, ponieważ żadna niezależna strona ich jeszcze nie odtworzyła. W tabeli warto zauważyć dwie rzeczy. Przewaga w F1 nad VoxelFM wynosi 0,033, co stanowi realną różnicę na 18 etykietach przy stałym progu. Przewaga w AUROC nad tym samym modelem wynosi 0,001, co oznacza remis. Obie liczby pojawiają się w tym samym wierszu tej samej tabeli, a tylko jedna z nich jest podstawą twierdzenia.
Kolejna rzecz, którą ujawnia tabela, dotyczy sposobu, w jaki sama praca ujmuje zagadnienie. Modele porównawcze to systemy kontrastywnego wstępnego trenowania 3D, fuzyjny generatywny MLLM 2D/3D oraz model frontierowy oparty na plastrach. Autorzy zdecydowali się porównywać z systemami, które przyjmują dane objętościowe, ponieważ jedynym istotnym twierdzeniem jest tu to, że generatywny model 3D może przewyższyć dyskryminacyjne modele 3D w klasyfikacji bez głowicy. Nie mówi natomiast nic o tym, jak NV-Reason-CT wypada w porównaniu z ogólnym modelem frontierowym pod jakimkolwiek względem, ponieważ takie porównanie nie istnieje na tej osi.

Dokąd trafiają pieniądze i dlaczego granica poziomu ma znaczenie
Tabela stawek Grok 4.6 zawiera szczegół, który po cichu przesądza o wielu aspektach architektury: prompty powyżej 200 tys. tokenów wejściowych są rozliczane według podwójnej stawki podstawowej — 4,00 USD za wejście, 12,00 USD za wyjście, a stawka za odczyt z pamięci podręcznej rośnie z 0,50 USD do 1,00 USD. Zadanie przeglądu kohorty, które gromadzi ustalenia w jednym długim kontekście, to dokładnie ten typ obciążenia, który przekracza tę granicę. Poniżej tego progu stawka za odczyt z pamięci podręcznej wynosząca 0,50 USD za milion stanowi jedną czwartą ceny wejścia, co sprawia, że zapętlanie dużego stałego prefiksu przez tysiące raportów jest opłacalne, a nie tylko możliwe.
Przez OrcaRouter Grok 4.6 jest udostępniany w cenie katalogowej tego dostawcy, bez żadnej marży, więc arytmetyka progów powyżej to arytmetyka, którą faktycznie płacisz, a każda przyszła korekta w niej trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu. Powód, dla którego warto kierować takie zadanie przez router, zamiast zakodować na sztywno jeden punkt końcowy, jest taki, że ta połowa klinicznego potoku, która odpowiada za przegląd kohort, to właśnie miejsce, w którym zechcesz wypróbować trzy różne modele, zanim się na coś zdecydujesz — a mając jeden klucz zgodny z OpenAI z automatycznym przełączaniem awaryjnym między dostawcami, ten eksperyment kosztuje jedynie zmianę nazwy modelu.
Połowa CT tego potoku nie ma takiej opcji. NV-Reason-CT nie jest hostowany w OrcaRouter — to 10,6 GB checkpoint z niestandardowym kodem modelu, który uruchamiasz samodzielnie, na układach Ampere, Hopper lub Lovelace, z trust_remote_code=True. Nie zamierzamy sugerować inaczej. Jeśli budujesz ten potok, kupujesz GPU dla jednej połowy, a tokeny dla drugiej, a to, że obiema połowami można przynajmniej zarządzać z jednej konsoli, jest jedynym twierdzeniem o integracji, które warto głosić.

Ile tak naprawdę jest wart drugi czytelnik
Artykuł NV-Reason-CT zawiera wstępne badanie z udziałem ekspertów radiologów, w którym zgłoszono „korzystne oceny pewności dla przeglądu wspomaganego przez AI” oraz 50% skrócenie średniego zgłaszanego czasu interpretacji i raportowania. To mocne liczby, ale wiążą się z zastrzeżeniem, które sam artykuł podaje: są wstępne i opierają się na własnym projekcie badania autorów. Nie ma opublikowanej niezależnej replikacji, a 50-procentowe skrócenie czasu w kontrolowanym badaniu czytania to dokładnie ten rodzaj wyniku, który maleje przy replikacji. Warto to śledzić. Nie warto tego cytować jako ustalonego.
W zestawieniu z tym wkład Grok 4.6 w przepływ pracy radiologicznej to wcale nie diagnoza. To warstwa, która czyta raporty — kolejkę triażu, list dotyczący dalszego postępowania, kodowanie, pakiet preautoryzacji. Ta praca to tekst, ma dużą objętość, jest tania jednostkowo, a skutek pomyłki jest administracyjny, a nie kliniczny. To także obszar, w którym okno kontekstowe 500K i odczyt z pamięci podręcznej za 0,50 USD naprawdę zasługują na swoje miejsce.
Podział, na którym kończy się to porównanie, jest bez ogródek: NV-Reason-CT ma prawdziwą ścieżkę 3D, a nie ma dystrybucji, ceny ani niezależnej weryfikacji. Grok 4.6 ma dystrybucję, cenę, niezależne pokrycie benchmarkowe i w ogóle nie ma ścieżki objętościowej. Jeśli potrzebujesz odczytu skanu, tylko jeden z nich może to zrobić. Jeśli potrzebujesz ogarniętej dokumentacji wokół skanu, tylko ten drugi jest produktem.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
