
NV-Reason-CT vs GPT-5.6 Sol: 13 824 tokenów wizualnych, zanim wpiszesz słowo
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 45 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Każde pojedyncze CT klatki piersiowej, które wysyłasz do NV-Reason-CT, kosztuje 13 824 tokenów wizualnych, zanim jeszcze zacznie się prompt. To nie jest kaprys ani wybór w ramach dostrajania — taki jest cały zamysł. Natywny trójwymiarowy enkoder wizyjny modelu przyjmuje wolumen 384×384×384 mm i zamienia go w siatkę 24×24×24, a karta modelu wyraźnie stwierdza, że wszystkie 13 824 tokeny i ich trójwymiarowe współrzędne trafiają do modelu językowego „bez przestrzennego podpróbkowania”. Porównaj to z tym, za co prawdopodobnie już płacisz. GPT-5.6 Sol przyjmuje tekst, obrazy i pliki, a wysłany do niego obraz jest dwuwymiarowy — przekrój, zrzut ekranu z przeglądarki DICOM, rycina radiologiczna wklejona z PDF-a. Jeden z tych modeli ma ścieżkę wolumetryczną. Drugi ma okno kontekstowe. Większość porównań między nimi rozpada się na tym rozróżnieniu, a to załamanie jest najciekawsze.
Premiera, której nikt nie zapowiedział
NVIDIA nie opublikowała ani słowa o NV-Reason-CT w swoim newsroomie. Nie ma wpisu o premierze, slajdu z prezentacji keynote, komunikatu prasowego. Istnieje natomiast repozytorium Hugging Face utworzone 8 września 2026 r., repozytorium GitHub w organizacji NVIDIA-Medtech utworzone 2 września, przestrzeń demonstracyjna (Space) w Gradio oraz preprint na arXiv — NV-Reason-CT: 3D Visual Language Model for CT Analysis — przesłany 23 września 2026 r. przez szesnastoosobowy zespół z NVIDIA, którego współautorami są badacze z NIH i Uniwersytetu Zuryskiego.
To rzeczywisty wzorzec i warto nazwać go precyzyjnie, zamiast traktować jak tajemnicę. Zespół NVIDIA ds. obrazowania medycznego po cichu publikuje wagi, a ogłaszanie pozostawia artykułowi i repozytorium. Poprzednik, NV-Reason-CXR-3B, ukazał się w październiku 2025 r. w ten sam sposób. Różnica polega tu na skali: ten zespół po raz pierwszy rozszerzył ten przepis z 2D zdjęć rentgenowskich na natywne wolumeny 3D, a artykuł ma zaledwie dwa dni.
Co można ustalić na podstawie repozytorium: architektura, licencja, dane treningowe, tabela benchmarków. Co nie zostało jeszcze potwierdzone: czy NVIDIA zamierza traktować to jako wspieraną linię produktową, czy pojawią się kolejne checkpointy oraz jak wypada w ewaluacji przeprowadzonej przez kogokolwiek innego niż autorzy. Repozytorium ma wersję 0.1 i określa się jako przeznaczone wyłącznie do badań i edukacji.
Co właściwie akceptuje każdy model
Tu właśnie bezpośrednie porównanie szybko staje się szczere. Te dwa modele nie mają wspólnej powierzchni wejściowej.
NV-Reason-CT odczytuje woluminy NIfTI — .nii lub .nii.gz — z intensywnościami wokseli w jednostkach Hounsfielda. Automatycznie przycina do klatki piersiowej lub jamy brzusznej, wykorzystując jednostki Hounsfielda dla płuc i heurystykę morfologiczną 3D, ponownie próbkuje do izotropowej rozdzielczości 2 mm i akceptuje tylko "chest" lub "abdomen" jako wartości anatomiczne. Na wyjściu zwraca tekst: ustrukturyzowany raport, odpowiedź lub ślad rozumowania krok po kroku, z przełącznikiem do wyłączania rozumowania dla krótkich odpowiedzi.
GPT-5.6 Sol odczytuje tekst, obrazy i pliki, mając okno kontekstowe wynoszące 1 050 000 tokenów i do 128 000 tokenów wyjściowych w pojedynczej odpowiedzi. Nie ma enkodera wolumetrycznego. Podaj mu skan CT, a najpierw musisz zdecydować, jak spłaszczyć około trzystu warstw w coś, co zaakceptuje enkoder obrazów 2D — montaż, garść kluczowych warstw, wyrenderowaną projekcję maksymalnej intensywności. Każdy z tych wyborów wyrzuca relacje przestrzenne, które ścieżka 3D miała za zadanie zachować.
A więc uczciwe ujęcie sprawy nie brzmi: „który model jest mądrzejszy”. Chodzi o to, że ścieżka obrazowa modelu Sol i ścieżka 3D modelu NV-Reason-CT odpowiadają na różne pytania. Sol potrafi rozumować o opisie skanu sporządzonym przez radiologa. NV-Reason-CT potrafi rozumować o samym skanie.
Istnieje jeden benchmark i tylko jeden z nich ma na sobie numer.
NV-Reason-CT podaje Macro-F1 0,614 i Macro-AUROC 0,871 w 18-etykietowym zadaniu klasyfikacji CT-RATE, używając bezpośredniego promptu Tak/Nie, bez głowicy klasyfikacyjnej i bez adaptacji do konkretnego zadania. To własne liczby autorów z karty modelu, a przydatną częścią jest wiersz porównawczy: VoxelFM z 0,581 Macro-F1, Pillar-0 z 0,544, ClinFusion-8B z 0,442, CT-CLIP z 0,398, Merlin z 0,358, MedGemma 1.5 z 0,303. Przy tym samym stałym, jednolitym progu generatywny model 3D przewyższa modele bazowe kontrastowego wstępnego trenowania 3D oraz wiodący model oparty na skrawkach.
Jedna liczba w tej tabeli zasługuje raczej na sceptycyzm niż na powtarzanie: różnica w AUROC. NV-Reason-CT podaje 0,871 wobec 0,870 dla VoxelFM. Jedna tysięczna punktu, w ocenie przeprowadzonej przez dostawcę, nie jest zwycięstwem — to remis w granicach szumu, jaki niesie ze sobą ta ocena. Różnica w Macro-F1 wynosząca 0,033 to uzasadnione twierdzenie.
GPT-5.6 Sol nie ma wyniku CT-RATE, ponieważ CT-RATE nie jest benchmarkiem, na którym można go uruchomić. Ma wskaźnik Artificial Analysis Intelligence Index na poziomie 47, zmierzony przez AA wynik GPQA Diamond na poziomie 94,1 oraz wynik Humanity's Last Exam na poziomie 49,5 — wszystkie to narzędzia do ogólnego rozumowania. Zestawienie 0,614 Macro-F1 obok 47 w AA Index byłoby arytmetyką na dwóch różnych linijkach. Nie zamierzam tego robić, a nie powinieneś ufać nikomu, kto to robi.
Ślady rozumowania, dwa różne produkty
Oba modele emitują rozumowanie. To jedyna autentyczna zbieżność filozoficzna, a różnica jest pouczająca.
GPT-5.6 Sol udostępnia konfigurowalny poziom wysiłku rozumowania, więc w przypadku każdego żądania wymieniasz opóźnienie i koszt na głębię, a rozumowanie możesz otrzymać z powrotem za pomocą include_reasoning. To ogólna możliwość stosowana do wszystkiego, co wyślesz.
Rozumowanie NV-Reason-CT jest celowo wąskie. Korpus szkoleniowy obejmuje około 550 000 ustrukturyzowanych przykładów QA pochodzących z 70 111 unikalnych wolumenów CT, a jego część stanowi rozumowanie autorstwa radiologów zebrane z nagranych i transkrybowanych interpretacji ekspertów. Etap GRPO następujący po SFT wykorzystuje weryfikowalne nagrody w zbiorach nieprawidłowości klatki piersiowej i jamy brzusznej — co oznacza, że sygnał nagrody opiera się na tym, czy stwierdzona zmiana faktycznie występuje w wolumenie, a nie na tym, czy tekst czyta się dobrze. Karta modelu opisuje dane wyjściowe jako „obserwacje możliwe do przeglądu, diagnozy różnicowe i niepewność”, a także zawiera wyraźne ostrzeżenie, że wygenerowane rozumowanie „nie ma gwarancji, że odzwierciedla wewnętrzne obliczenia modelu”. To ostrzeżenie ma realne znaczenie. To różnica między śladem, który można sprawdzić względem danych, a śladem, który można tylko podziwiać.
Rozmiar i licencja, za jednym zamachem
• Parametry — NV-Reason-CT 4,69 mld łącznie / 4,35 mld aktywnych w ścieżce CT, z rdzenia Qwen3.5-4B plus Primus 3D ViT vs GPT-5.6 Sol nieujawnione • Rozmiar checkpointu — NV-Reason-CT ~10,6 GB BF16 safetensors, działa na Ampere/Hopper/Lovelace vs GPT-5.6 Sol tylko przez API • Dane wejściowe — woluminy CT 3D NIfTI w jednostkach Hounsfielda vs tekst, obraz, plik • Kontekst — NV-Reason-CT nie dotyczy, jeden wolumen to jeden stały prefiks 13 824 tokenów vs Sol 1 050 000 tokenów na wejściu, 128 000 na wyjściu • Licencja — OpenMDW-1.1, wagi do pobrania vs własnościowe, dostęp tylko przez API • Dostępność — repozytorium dostawcy i własne wagi vs kierowane przez OrcaRouter po $4.00 / $20.00 za milion, przy czym stawka Sol powyżej 272 tys. tokenów wejściowych podwaja się do $8.00 / $30.00

Ile tak naprawdę kosztuje cię rozstanie
Porównanie kosztów ma sens tylko wtedy, gdy przyjmiemy, że zakresy prac są różne, więc oto wersja, która to uwzględnia.
Sol jest rozliczany za token, a jego cennik ma próg: 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych do 272 tys. tokenów promptu, a następnie 8,00 USD i 30,00 USD. W OrcaRouter jest udostępniany w cenie katalogowej samego OpenAI, bez żadnej marży, co ma większe znaczenie, niż się wydaje — stawka, którą widzisz, jest stawką publikowaną przez OpenAI, więc każda zmiana ceny trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy. Jego stawka za odczyt z pamięci podręcznej wynosi 0,40 USD za milion, czyli jedną dziesiątą ceny wejścia, i to właśnie sprawia, że długie pętle agentowe z dużym stałym prefiksem są arytmetycznie wykonalne.
NV-Reason-CT nie ma w ogóle ceny za token. Pobierasz 10,6 GB i płacisz za GPU. To pytanie o capex kontra opex i ma tylko jedną odpowiedź: przy odpowiednio dużym wolumenie samodzielne hostowanie modelu o 4,35 mld aktywnych parametrów wygrywa kosztowo. Poniżej tego wolumenu już nie, a punkt przecięcia zależy w całości od wykorzystania Twojego GPU. Nikt poza NVIDIA nie opublikował jeszcze wartości przepustowości dla tego checkpointu, więc każdy, kto podaje Ci punkt przecięcia, zgaduje.

To, w czym router pomaga w tym przypadku, to ta część procesu, która nie jest skanowaniem. Produkcyjny pipeline badań klinicznych rzadko składa się z jednego modelu — to ekstrakcja, krok rozumowania, krok podsumowania, czasem druga opinia. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI z automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu tę ogólnego przeznaczenia połowę pipeline'u można wymienić lub przekierować bez drugiego kontraktu. NV-Reason-CT nie jest jednym z modeli, które routingujemy; to checkpoint, który uruchamiasz samodzielnie. Obie połowy pipeline'u mogą nadal działać za jednym kluczem.

Otwarte pytanie
NV-Reason-CT ma dwa dni jako artykuł i siedemnaście dni jako repozytorium, a dziedzina, do której należy, jest na tyle mała, że następny punkt danych będzie pouczający. Wypatruj trzech rzeczy: niezależnej reprodukcji CT-RATE, drugiego checkpointu w rodzinie i jakiegokolwiek sygnału, że grupa medyczna NVIDIA traktuje to jako linię produktową, a nie artykuł. Do tego czasu możliwa do obrony pozycja jest wąska i jasna — to najsilniejszy obecnie dostępny do pobrania checkpoint do rozumowania na natywnym CT 3D, oceniany na podstawie własnej tabeli autorów, i nie jest zamiennikiem ogólnego modelu frontierowego w niczym poza odczytywaniem CT.
