Wygenerowana karta hero zatytułowana „NV-Reason-CT vs Qwen3.8 Max” z podtytułem „Model dostrojony i rodzina, z której pochodzi”. Wzdłuż dolnej krawędzi znajdują się trzy plakietki: „Model bazowy: Qwen/Qwen3.5-4B”, „13 824 tokeny vs 1 000 000” oraz „3,5% vs 0,21% zmierzonego błędu”. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max: model dostrojony i rodzina, z której pochodzi

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pierwsza linijka NV-Reason-CT karty modelu mówi coś, co większość ludzi tylko przebiega wzrokiem. Model bazowy to Qwen/Qwen3.5-4B, wymieniony w metadanych repozytorium jako relacja dostrojenia. Więc kiedy NVIDIA potrzebowała modelu językowego, do którego mogłaby doczepić wizyjny transformer Primus 3D, wzięła Qwena. Porównaj ten checkpoint z Qwen3.8 Max — flagowym modelem samej Alibaby o 1 000 000 tokenów, wydanym 3 sierpnia 2026 — a patrzysz na model dostrojony i na rodzinny biznes. Jeden to specjalista o 4,69B parametrów, który czyta obrazy TK klatki piersiowej i jamy brzusznej i został opublikowany na Hugging Face 8 września 2026 bez żadnej zapowiedzi. Drugi to ogólny flagowiec z wejściem tekstowym, obrazowym i wideo, opublikowanym cennikiem oraz 37,2 miliona tokenów zmierzonego ruchu w naszej sieci w ostatnim tygodniu. Ciekawe pytanie nie brzmi, który wygrywa. Brzmi: co potrafi dostrojony model 4B, czego nie potrafi flagowiec jego rodziny, i dlaczego odpowiedź jest bardziej konkretna, niż można by się spodziewać.

Co konkretnie dał fine-tuning

Sposób, w jaki sama NVIDIA ujmuje tę lukę, jest niezwykle precyzyjny i stanowi najbardziej użyteczne zdanie w repozytorium: większość systemów wizyjno-językowych „albo działa na obrazach 2D, albo kompresuje cechy wolumetryczne przed dekodowaniem języka”. To opis całej klasy modeli, a obejmuje on każdy flagowy model multimodalny ogólnego przeznaczenia na rynku.

Rozwiązanie ma charakter architektoniczny, a nie jest kwestią skali. Wejściowa objętość 384×384×384 mm staje się siatką 24×24×24 obejmującą 13 824 tokeny wizualne. Tokeny te i ich trójwymiarowe współrzędne trafiają do modelu językowego bez przestrzennego podpróbkowania, a 3D MRoPE zachowuje relacje przestrzenne wewnątrz dekodera. Wejściowe objętości są przycinane z uwzględnieniem anatomii do obszaru klatki piersiowej lub jamy brzusznej z wykorzystaniem jednostek Hounsfielda dla płuc, a następnie ponownie próbkowane do izotropowej rozdzielczości 2 mm.

Przeczytaj to w kontekście tego, co akceptuje Qwen3.8 Max. Tekst, obraz i wideo — a wideo jest najbliższą rzeczą w tej serii do danych wolumetrycznych, co czyni je uczciwym punktem porównania, a nie retorycznym. Wideo to stos dwuwymiarowych klatek uporządkowanych w czasie. Wolumen CT to stos dwuwymiarowych przekrojów uporządkowanych według fizycznego położenia wzdłuż osi z, w jednostkach Hounsfielda, o znanym odstępie milimetrowym. Oba są trójwymiarowymi tablicami. Tylko jeden z nich ma fizyczny układ współrzędnych, do którego można zlokalizować wynik badania radiologa, i tylko jeden z nich jest mierzony w jednostce, która ma znaczenie poza czujnikiem obrazu. Model trenowany na wideo uczy się ciągłości czasowej. Model trenowany na wolumenach CT uczy się, że zmiana w jednym przekroju to ta sama zmiana w następnym przekroju osiem milimetrów niżej.

Prawdziwą różnicę stanowi korpus treningowy.

To jest moment, w którym oba modele przestają być w ogóle porównywalne, i to jest właśnie to, co ukrywa karta specyfikacji.

NV-Reason-CT był trenowany od początku do końca z użyciem nadzorowanego dostrajania, po którym następuje Group Relative Policy Optimization, na około 550 000 ustrukturyzowanych przykładów QA zaczerpniętych z 70 111 unikalnych wolumenów CT. Źródłami są CT-RATE — 47 149 przypadków z Istanbul Medipol University Mega Hospital ze sparowanymi raportami radiologicznymi — wewnętrzny zbiór NIH liczący 15 991 przypadków oraz 22 720 przypadków CancerVerse obejmujących cztery fazy kontrastowe i trzynaście typów nowotworów złośliwych. Korpus obejmuje standaryzowane raporty, QA skoncentrowane na nieprawidłowościach, dialogi wieloturowe oraz rozumowanie autorstwa radiologów, transkrybowane z nagranych interpretacji ekspertów. Etap GRPO wykorzystuje weryfikowalne nagrody w zbiorach nieprawidłowości klatki piersiowej i jamy brzusznej, co oznacza, że sygnał nagrody sprawdza, czy podana obserwacja występuje w wolumenie, a nie czy tekst brzmi klinicznie.

Korpus treningowy Qwen3.8 Max nie jest publikowany z takim poziomem szczegółowości, a nawet gdyby był, niewiele by to pomogło, ponieważ docelowa zdolność ma charakter ogólny. Odpowiednim dowodem są natomiast jego wyniki Artificial Analysis: Intelligence Index 45.4, co daje mu 15. miejsce spośród 145 modeli w naszym snapshotcie API, AA Coding 76.2 na pozycji 9, Terminal-Bench 2.1 na poziomie 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 oraz długokontekstowe przywoływanie informacji 80.3. To pomiary stron trzecich, a nie twierdzenia dostawcy, co czyni je najbardziej wiarygodnymi liczbami po obu stronach tej strony.

Wynik rozumowania, dwa różne kontrakty

Oba modele emitują ślady rozumowania i oba pozwalają je wyłączyć. Podobieństwo kończy się na interfejsie.

Qwen3.8 Max udostępnia enable_thinking i reasoning_effort, wraz z pełnym zakresem próbkowania — temperatura, top_p, seed, kary, ustrukturyzowane dane wyjściowe, wywoływanie narzędzi. To ogólna zdolność rozumowania, którą kierujesz na to, co masz. Jego myślenie jest tak dobre, jak problem, który mu podasz, i nie ma sposobu, aby zweryfikować twierdzenie w oparciu o cokolwiek innego niż tekst, który otrzymało.

Rozumowanie NV-Reason-CT ma węższy kontrakt z czytelnikiem, a karta modelu wyraźnie określa ten limit: generowane rozumowanie to „{{1}}podlegający przeglądowi wynik modelu, który nie gwarantuje odzwierciedlenia wewnętrznego przetwarzania modelu{{/1}}”. To zastrzeżenie odgrywa istotną rolę i jest to zdanie, które pojawia się tylko wtedy, gdy zespół zastanowił się, co klinicysta zrobi z wiarygodnie brzmiącym śladem. Karta opisuje wynik jako podlegające przeglądowi obserwacje, diagnozy różnicowe i niepewność. Innymi słowy, ślad, który można sprawdzić względem danych wolumetrycznych, a nie taki, który można tylko przeczytać.

Przepustowość — z jedynego miejsca, w którym możemy ją zmierzyć

Qwen3.8 Max przepuścił 37,2 miliona tokenów przez własny playground OrcaRouter w ciągu ostatnich siedmiu dni. Mediana czasu do pierwszego tokenu wyniosła 1,96 sekundy — zdecydowanie najszybciej spośród modeli w tej serii — przy 53,3 tokenu wyjściowego na sekundę. Wskaźnik błędów w tym oknie wyniósł 3,5%.

Te dwie liczby ciągną w przeciwnych kierunkach i obie mają znaczenie. Opóźnienie jest znakomite i sprawia, że iterowanie z tym modelem jest przyjemne. Współczynnik błędów jest około siedemnaście razy wyższy niż 0,21% Kimi K3 w tym samym oknie i to właśnie ta liczba decyduje o tym, czy umieścisz go za synchronicznym wywołaniem skierowanym do użytkownika, czy w zadaniu wsadowym z ponowieniami. To zmierzone zachowanie w naszej sieci, a nie benchmark, i jest to coś, czego cennik nigdy ci nie powie.

NV-Reason-CT nie ma nigdzie żadnego równoważnego pomiaru. To checkpoint BF16 o rozmiarze 10,6 GB z niestandardowym kodem modelu, ładowany przy użyciu trust_remote_code=True na sprzęcie Ampere, Hopper lub Lovelace, przetestowany przez NVIDIA na H100 i L40S. Nie opublikowano żadnej wartości p50, wskaźnika błędów ani przepustowości. Każdy, kto podaje ci wielkość progową, przy której samodzielne hostowanie tego modelu wygrywa z płaceniem za token, zgaduje.

Cena i kształt obok siebie

• Cena — capex GPU NV-Reason-CT, brak stawki za token w porównaniu z Qwen3.8 Max: 2,00 USD / 6,00 USD za milion tokenów, 0,25 USD za odczyt z pamięci podręcznej, 2,50 USD za zapis do pamięci podręcznej

• Wejście — woluminy CT 3D NIfTI NV-Reason-CT w jednostkach Hounsfielda, wyłącznie klatka piersiowa lub jama brzuszna vs Qwen3.8 Max: tekst, obraz i wideo

• Kontekst — NV-Reason-CT jeden wolumen, stały prefiks 13 824 tokenów vs Qwen3.8 Max 1 000 000 tokenów

• Parametry — NV-Reason-CT 4,69 mld łącznie / 4,35 mld aktywnych w ścieżce CT w porównaniu z Qwen3.8 Max – nieujawnione

• Licencja — NV-Reason-CT OpenMDW-1.1, wagi opublikowane vs Qwen3.8 Max zastrzeżony, dostęp tylko przez API

• Niezależne wyniki — NV-Reason-CT brak vs Qwen3.8 Max AA Intelligence Index 45,4, GPQA Diamond 92,8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

Ekonomika pamięci podręcznej Qwen3.8 Max sprzyja konkretnemu wzorcowi: odczyt z pamięci podręcznej za 0,25 USD wobec świeżego wejścia za 2,00 USD to ośmiokrotna zniżka, a zapis do pamięci podręcznej za 2,50 USD sprawia, że długi, wielokrotnego użytku prefiks szybko się zwraca. To profil obciążenia odpowiadający monitowi systemowemu i dokumentowi protokołu używanym ponownie w tysiącach żądań. NV-Reason-CT ma odwrotny profil kosztów — koszt krańcowy skanowania bliski zeru po zakupie GPU oraz twarde minimum jednego GPU utrzymywanego bezterminowo.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Wspólne prowadzenie rodziny

Naturalną architekturą w tym przypadku — i warto powiedzieć, że nikt jej nie opublikował — jest model dostrojony do dużego wolumenu oraz model flagowy do wszystkiego wokół. NV-Reason-CT generuje ustrukturyzowane ustalenie; Qwen3.8 Max obsługuje tekst skierowania, dopasowywanie protokołu, kodowanie, list z dalszym postępowaniem — pracę tekstową o dużej skali, w której okno miliona tokenów i ośmiokrotny rabat za pamięć podręczną naprawdę zasługują na swoje miejsce.

Jeśli to jest twój potok, połowa z niego to checkpoint, który hostujesz, a połowa to tokeny, które kupujesz, i to właśnie w tej drugiej połowie router robi coś, czego nie potrafi endpoint pojedynczego dostawcy. Qwen3.8 Max jest udostępniany przez OrcaRouter w cenie katalogowej Aliba​by bez żadnej marży, więc podane wyżej 2,00 USD / 6,00 USD to kwota, którą płacisz, a każda przyszła zmiana ceny trafia na twoje rozliczenie tego samego dnia, a nie dopiero przy odnowieniu. Automatyczne przełączanie awaryjne między dostawcami ma większe znaczenie niż zwykle, gdy zmierzony wskaźnik błędów samego modelu wynosi 3,5% — ponowna próba skierowana do innego zdrowego endpointu to różnica między chwilowym zakłóceniem a nieudaną partią. A ponieważ ogólna połowa potoku to jedna nazwa modelu za endpointem zgodnym z OpenAI, obsługującym ponad 200 modeli, podmiana na coś innego na tygodniowy eksperyment kosztuje zmianę ciągu znaków, a nie integrację.

NV-Reason-CT, żeby było jasne, nie jest dostępny na OrcaRouter i nie będzie — to niestandardowa inferencja 3D oparta na własnym kodzie, którą uruchamiasz samodzielnie. Uczciwa wersja historii integracji jest taka, że self-hostowany specjalista i routowany generalista mogą działać pod jednym kluczem, i to jest całość tego twierdzenia.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

Werdykt, który rzeczywiście się ostał

To zestawienie trafia pod hasło „które jest lepsze” i nie powinno. Qwen3.8 Max jest oceniany przez strony trzecie pod kątem ogólnego rozumowania i bije większość stawki; NV-Reason-CT ma jedną tabelę własnych wyników w jednym benchmarku CT i liczbę parametrów 4,69B, która w jakimkolwiek ogólnym porównaniu nie byłaby niczym szczególnym. W każdym ogólnym benchmarku wygrywa flagowiec, a powód jest taki, że ogólny benchmark to coś, do czego został stworzony.

W jedynym zadaniu, do którego stworzono NV-Reason-CT — odczytywaniu objętości tomografii komputerowej klatki piersiowej lub jamy brzusznej i mówieniu, co się w niej znajduje, ze śladem, który ktoś może sprawdzić — Qwen3.8 Max nie jest słabszym konkurentem. Nie ma kodera wolumetrycznego, więc w ogóle nie można go uruchomić na danych wejściowych, dopóki ktoś najpierw nie zdecyduje, jak spłaszczyć skan do obrazów. To właśnie w tej decyzji ginie informacja przestrzenna. Na tym polega cały sens dostrajania modelu 4B z natywną ścieżką 3D i stałym prefiksem 13 824 tokenów i dlatego w tym modelu interesująca jest małość jego szkieletu, a nie jego rozmiar.