
NV-Reason-CT vs Qwen3.8 Max: model dostrojony i rodzina, z której pochodzi
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 45 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Pierwsza linijka NV-Reason-CT karty modelu mówi coś, co większość ludzi tylko przebiega wzrokiem. Model bazowy to Qwen/Qwen3.5-4B, wymieniony w metadanych repozytorium jako relacja dostrojenia. Więc kiedy NVIDIA potrzebowała modelu językowego, do którego mogłaby doczepić wizyjny transformer Primus 3D, wzięła Qwena. Porównaj ten checkpoint z Qwen3.8 Max — flagowym modelem samej Alibaby o 1 000 000 tokenów, wydanym 3 sierpnia 2026 — a patrzysz na model dostrojony i na rodzinny biznes. Jeden to specjalista o 4,69B parametrów, który czyta obrazy TK klatki piersiowej i jamy brzusznej i został opublikowany na Hugging Face 8 września 2026 bez żadnej zapowiedzi. Drugi to ogólny flagowiec z wejściem tekstowym, obrazowym i wideo, opublikowanym cennikiem oraz 37,2 miliona tokenów zmierzonego ruchu w naszej sieci w ostatnim tygodniu. Ciekawe pytanie nie brzmi, który wygrywa. Brzmi: co potrafi dostrojony model 4B, czego nie potrafi flagowiec jego rodziny, i dlaczego odpowiedź jest bardziej konkretna, niż można by się spodziewać.
Co konkretnie dał fine-tuning
Sposób, w jaki sama NVIDIA ujmuje tę lukę, jest niezwykle precyzyjny i stanowi najbardziej użyteczne zdanie w repozytorium: większość systemów wizyjno-językowych „albo działa na obrazach 2D, albo kompresuje cechy wolumetryczne przed dekodowaniem języka”. To opis całej klasy modeli, a obejmuje on każdy flagowy model multimodalny ogólnego przeznaczenia na rynku.
Rozwiązanie ma charakter architektoniczny, a nie jest kwestią skali. Wejściowa objętość 384×384×384 mm staje się siatką 24×24×24 obejmującą 13 824 tokeny wizualne. Tokeny te i ich trójwymiarowe współrzędne trafiają do modelu językowego bez przestrzennego podpróbkowania, a 3D MRoPE zachowuje relacje przestrzenne wewnątrz dekodera. Wejściowe objętości są przycinane z uwzględnieniem anatomii do obszaru klatki piersiowej lub jamy brzusznej z wykorzystaniem jednostek Hounsfielda dla płuc, a następnie ponownie próbkowane do izotropowej rozdzielczości 2 mm.
Przeczytaj to w kontekście tego, co akceptuje Qwen3.8 Max. Tekst, obraz i wideo — a wideo jest najbliższą rzeczą w tej serii do danych wolumetrycznych, co czyni je uczciwym punktem porównania, a nie retorycznym. Wideo to stos dwuwymiarowych klatek uporządkowanych w czasie. Wolumen CT to stos dwuwymiarowych przekrojów uporządkowanych według fizycznego położenia wzdłuż osi z, w jednostkach Hounsfielda, o znanym odstępie milimetrowym. Oba są trójwymiarowymi tablicami. Tylko jeden z nich ma fizyczny układ współrzędnych, do którego można zlokalizować wynik badania radiologa, i tylko jeden z nich jest mierzony w jednostce, która ma znaczenie poza czujnikiem obrazu. Model trenowany na wideo uczy się ciągłości czasowej. Model trenowany na wolumenach CT uczy się, że zmiana w jednym przekroju to ta sama zmiana w następnym przekroju osiem milimetrów niżej.
Prawdziwą różnicę stanowi korpus treningowy.
To jest moment, w którym oba modele przestają być w ogóle porównywalne, i to jest właśnie to, co ukrywa karta specyfikacji.
NV-Reason-CT był trenowany od początku do końca z użyciem nadzorowanego dostrajania, po którym następuje Group Relative Policy Optimization, na około 550 000 ustrukturyzowanych przykładów QA zaczerpniętych z 70 111 unikalnych wolumenów CT. Źródłami są CT-RATE — 47 149 przypadków z Istanbul Medipol University Mega Hospital ze sparowanymi raportami radiologicznymi — wewnętrzny zbiór NIH liczący 15 991 przypadków oraz 22 720 przypadków CancerVerse obejmujących cztery fazy kontrastowe i trzynaście typów nowotworów złośliwych. Korpus obejmuje standaryzowane raporty, QA skoncentrowane na nieprawidłowościach, dialogi wieloturowe oraz rozumowanie autorstwa radiologów, transkrybowane z nagranych interpretacji ekspertów. Etap GRPO wykorzystuje weryfikowalne nagrody w zbiorach nieprawidłowości klatki piersiowej i jamy brzusznej, co oznacza, że sygnał nagrody sprawdza, czy podana obserwacja występuje w wolumenie, a nie czy tekst brzmi klinicznie.
Korpus treningowy Qwen3.8 Max nie jest publikowany z takim poziomem szczegółowości, a nawet gdyby był, niewiele by to pomogło, ponieważ docelowa zdolność ma charakter ogólny. Odpowiednim dowodem są natomiast jego wyniki Artificial Analysis: Intelligence Index 45.4, co daje mu 15. miejsce spośród 145 modeli w naszym snapshotcie API, AA Coding 76.2 na pozycji 9, Terminal-Bench 2.1 na poziomie 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 oraz długokontekstowe przywoływanie informacji 80.3. To pomiary stron trzecich, a nie twierdzenia dostawcy, co czyni je najbardziej wiarygodnymi liczbami po obu stronach tej strony.
Wynik rozumowania, dwa różne kontrakty
Oba modele emitują ślady rozumowania i oba pozwalają je wyłączyć. Podobieństwo kończy się na interfejsie.
Qwen3.8 Max udostępnia enable_thinking i reasoning_effort, wraz z pełnym zakresem próbkowania — temperatura, top_p, seed, kary, ustrukturyzowane dane wyjściowe, wywoływanie narzędzi. To ogólna zdolność rozumowania, którą kierujesz na to, co masz. Jego myślenie jest tak dobre, jak problem, który mu podasz, i nie ma sposobu, aby zweryfikować twierdzenie w oparciu o cokolwiek innego niż tekst, który otrzymało.
Rozumowanie NV-Reason-CT ma węższy kontrakt z czytelnikiem, a karta modelu wyraźnie określa ten limit: generowane rozumowanie to „{{1}}podlegający przeglądowi wynik modelu, który nie gwarantuje odzwierciedlenia wewnętrznego przetwarzania modelu{{/1}}”. To zastrzeżenie odgrywa istotną rolę i jest to zdanie, które pojawia się tylko wtedy, gdy zespół zastanowił się, co klinicysta zrobi z wiarygodnie brzmiącym śladem. Karta opisuje wynik jako podlegające przeglądowi obserwacje, diagnozy różnicowe i niepewność. Innymi słowy, ślad, który można sprawdzić względem danych wolumetrycznych, a nie taki, który można tylko przeczytać.
Przepustowość — z jedynego miejsca, w którym możemy ją zmierzyć
Qwen3.8 Max przepuścił 37,2 miliona tokenów przez własny playground OrcaRouter w ciągu ostatnich siedmiu dni. Mediana czasu do pierwszego tokenu wyniosła 1,96 sekundy — zdecydowanie najszybciej spośród modeli w tej serii — przy 53,3 tokenu wyjściowego na sekundę. Wskaźnik błędów w tym oknie wyniósł 3,5%.
Te dwie liczby ciągną w przeciwnych kierunkach i obie mają znaczenie. Opóźnienie jest znakomite i sprawia, że iterowanie z tym modelem jest przyjemne. Współczynnik błędów jest około siedemnaście razy wyższy niż 0,21% Kimi K3 w tym samym oknie i to właśnie ta liczba decyduje o tym, czy umieścisz go za synchronicznym wywołaniem skierowanym do użytkownika, czy w zadaniu wsadowym z ponowieniami. To zmierzone zachowanie w naszej sieci, a nie benchmark, i jest to coś, czego cennik nigdy ci nie powie.
NV-Reason-CT nie ma nigdzie żadnego równoważnego pomiaru. To checkpoint BF16 o rozmiarze 10,6 GB z niestandardowym kodem modelu, ładowany przy użyciu trust_remote_code=True na sprzęcie Ampere, Hopper lub Lovelace, przetestowany przez NVIDIA na H100 i L40S. Nie opublikowano żadnej wartości p50, wskaźnika błędów ani przepustowości. Każdy, kto podaje ci wielkość progową, przy której samodzielne hostowanie tego modelu wygrywa z płaceniem za token, zgaduje.
Cena i kształt obok siebie
• Cena — capex GPU NV-Reason-CT, brak stawki za token w porównaniu z Qwen3.8 Max: 2,00 USD / 6,00 USD za milion tokenów, 0,25 USD za odczyt z pamięci podręcznej, 2,50 USD za zapis do pamięci podręcznej
• Wejście — woluminy CT 3D NIfTI NV-Reason-CT w jednostkach Hounsfielda, wyłącznie klatka piersiowa lub jama brzuszna vs Qwen3.8 Max: tekst, obraz i wideo
• Kontekst — NV-Reason-CT jeden wolumen, stały prefiks 13 824 tokenów vs Qwen3.8 Max 1 000 000 tokenów
• Parametry — NV-Reason-CT 4,69 mld łącznie / 4,35 mld aktywnych w ścieżce CT w porównaniu z Qwen3.8 Max – nieujawnione
• Licencja — NV-Reason-CT OpenMDW-1.1, wagi opublikowane vs Qwen3.8 Max zastrzeżony, dostęp tylko przez API
• Niezależne wyniki — NV-Reason-CT brak vs Qwen3.8 Max AA Intelligence Index 45,4, GPQA Diamond 92,8

Ekonomika pamięci podręcznej Qwen3.8 Max sprzyja konkretnemu wzorcowi: odczyt z pamięci podręcznej za 0,25 USD wobec świeżego wejścia za 2,00 USD to ośmiokrotna zniżka, a zapis do pamięci podręcznej za 2,50 USD sprawia, że długi, wielokrotnego użytku prefiks szybko się zwraca. To profil obciążenia odpowiadający monitowi systemowemu i dokumentowi protokołu używanym ponownie w tysiącach żądań. NV-Reason-CT ma odwrotny profil kosztów — koszt krańcowy skanowania bliski zeru po zakupie GPU oraz twarde minimum jednego GPU utrzymywanego bezterminowo.

Wspólne prowadzenie rodziny
Naturalną architekturą w tym przypadku — i warto powiedzieć, że nikt jej nie opublikował — jest model dostrojony do dużego wolumenu oraz model flagowy do wszystkiego wokół. NV-Reason-CT generuje ustrukturyzowane ustalenie; Qwen3.8 Max obsługuje tekst skierowania, dopasowywanie protokołu, kodowanie, list z dalszym postępowaniem — pracę tekstową o dużej skali, w której okno miliona tokenów i ośmiokrotny rabat za pamięć podręczną naprawdę zasługują na swoje miejsce.
Jeśli to jest twój potok, połowa z niego to checkpoint, który hostujesz, a połowa to tokeny, które kupujesz, i to właśnie w tej drugiej połowie router robi coś, czego nie potrafi endpoint pojedynczego dostawcy. Qwen3.8 Max jest udostępniany przez OrcaRouter w cenie katalogowej Alibaby bez żadnej marży, więc podane wyżej 2,00 USD / 6,00 USD to kwota, którą płacisz, a każda przyszła zmiana ceny trafia na twoje rozliczenie tego samego dnia, a nie dopiero przy odnowieniu. Automatyczne przełączanie awaryjne między dostawcami ma większe znaczenie niż zwykle, gdy zmierzony wskaźnik błędów samego modelu wynosi 3,5% — ponowna próba skierowana do innego zdrowego endpointu to różnica między chwilowym zakłóceniem a nieudaną partią. A ponieważ ogólna połowa potoku to jedna nazwa modelu za endpointem zgodnym z OpenAI, obsługującym ponad 200 modeli, podmiana na coś innego na tygodniowy eksperyment kosztuje zmianę ciągu znaków, a nie integrację.
NV-Reason-CT, żeby było jasne, nie jest dostępny na OrcaRouter i nie będzie — to niestandardowa inferencja 3D oparta na własnym kodzie, którą uruchamiasz samodzielnie. Uczciwa wersja historii integracji jest taka, że self-hostowany specjalista i routowany generalista mogą działać pod jednym kluczem, i to jest całość tego twierdzenia.

Werdykt, który rzeczywiście się ostał
To zestawienie trafia pod hasło „które jest lepsze” i nie powinno. Qwen3.8 Max jest oceniany przez strony trzecie pod kątem ogólnego rozumowania i bije większość stawki; NV-Reason-CT ma jedną tabelę własnych wyników w jednym benchmarku CT i liczbę parametrów 4,69B, która w jakimkolwiek ogólnym porównaniu nie byłaby niczym szczególnym. W każdym ogólnym benchmarku wygrywa flagowiec, a powód jest taki, że ogólny benchmark to coś, do czego został stworzony.
W jedynym zadaniu, do którego stworzono NV-Reason-CT — odczytywaniu objętości tomografii komputerowej klatki piersiowej lub jamy brzusznej i mówieniu, co się w niej znajduje, ze śladem, który ktoś może sprawdzić — Qwen3.8 Max nie jest słabszym konkurentem. Nie ma kodera wolumetrycznego, więc w ogóle nie można go uruchomić na danych wejściowych, dopóki ktoś najpierw nie zdecyduje, jak spłaszczyć skan do obrazów. To właśnie w tej decyzji ginie informacja przestrzenna. Na tym polega cały sens dostrajania modelu 4B z natywną ścieżką 3D i stałym prefiksem 13 824 tokenów i dlatego w tym modelu interesująca jest małość jego szkieletu, a nie jego rozmiar.
