Wygenerowana karta główna zatytułowana „NV-Reason-CT vs Claude Opus 5" z podtytułem „Błąd kategorialny, który warto potraktować poważnie". Dwie zwrócone do siebie karty rozdziela para niebieskich strzałek: lewa karta jest oznaczona „NV-Reason-CT" i opatrzona ikoną skanu ciała oraz opisem „4,69 mld parametrów - 13 824 tokeny na objętość CT - to nie jest wyrób medyczny"; prawa karta jest oznaczona „Claude Opus 5" i opatrzona ikoną chipu oraz opisem „1 mln kontekstu - 128 tys. tokenów wyjściowych - 5 / 25 USD za 1 mln tokenów". Logo OrcaRouter jest wkomponowane w prawym dolnym narożniku.
Guides & Insights

NV-Reason-CT vs Claude Opus 5: Błąd kategorii, który warto potraktować poważnie

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Umieszczenie NV-Reason-CT i Claude Opus 5 w jednym zdaniu to błąd kategorii, ale i tak warto to zrobić, bo błąd ten jest pouczający. NV-Reason-CT to natywny model wizyjno-językowy 3D od NVIDIA o 4,69 miliarda parametrów, który przyjmuje objętość TK klatki piersiowej lub jamy brzusznej w jednostkach Hounsfielda i tworzy ustrukturyzowany opis kolejnych znalezisk. Nie jest to wyrób medyczny i sama karta modelu to potwierdza. Claude Opus 5 to ogólny, wiodący model tekstowy i wizyjny tego producenta, wydany 24 lipca 2026 r., z oknem kontekstu wynoszącym milion tokenów, limitem wyjścia 128 000 tokenów oraz podaną stawką pięciu dolarów za milion tokenów wejściowych i dwudziestu pięciu za milion tokenów wyjściowych. Jeden z nich odczytuje TK. Drugi odczytuje wszystko inne.

Powód, dla którego to porównanie wciąż się pojawia — i będzie się pojawiać za każdym razem, gdy ktoś zobaczy nowy medyczny VLM i sięgnie po znaną miarę — jest taki, że oba generują tekst o obrazie. To powierzchowne podobieństwo wyrządza prawdziwe szkody w sposobie, w jaki ludzie rozumują o tych dwóch rzeczach, więc warto szczegółowo rozłożyć je na czynniki pierwsze.

Faktyczna oś, która jest im wspólna, i ta, która nie jest.

Pokrywają się dokładnie w jednym miejscu, które jest węższe, niż się wydaje.

• Modalność w — NV-Reason-CT przyjmuje jednokanałowe woluminy NIfTI w jednostkach Hounsfielda przez dedykowany trójwymiarowy procesor; Claude Opus 5 przyjmuje tekst, obrazy i pliki, co stanowi drugą generację interfejsu dla obrazów i nie potrafi natywnie przetwarzać wolumetrycznego badania CT

• Co zwracają — lista wyników uporządkowana według regionu anatomicznego z NV-Reason-CT w zestawieniu z ogólnym tekstem ciągłym, ustrukturyzowanym JSON-em lub wywołaniami narzędzi z Claude Opus 5

• Jednostki pracy — jeden wolumen CT, zresamplowany do izotropowych 2 mm, przycięty do anatomii, pocięty na fragmenty 8 x 8 x 8; w zestawieniu z tym, co umieścisz w budżecie tokenów

• Kontekst — NV-Reason-CT w ogóle nie ma okna czatu; pojedyncza objętość staje się 13 824 tokenami wizualnymi bez podpróbkowania. Claude Opus 5 przyjmuje na wejściu 1 000 000 tokenów i generuje do 128 000

• Licencja — OpenMDW-1.1, model do pobrania, który uruchamiasz na własnym sprzęcie; w odróżnieniu od hostowanego API

• Deklarowane zastosowanie — wyłącznie badania naukowe i edukacja, wyraźnie nie jest wyrobem medycznym, dla NV-Reason-CT; a nie ogólne wsparcie dla Claude Opus 5

• Cena — brak ceny katalogowej, bo nie ma czego kupić, są tylko wagi do uruchomienia; dla porównania $5 i $25 za milion tokenów, a odczyty z pamięci podręcznej po $0,50

Wiersz „modalność wejściowa” to miejsce, w którym rodzi się błąd kategorii. Oba przyjmują obraz, więc oba wyglądają jak modele obrazowe, a czytelnik zasadnie pyta, który lepiej radzi sobie z obrazami. Ale badanie CT nie jest obrazem. To objętościowa tablica z fizyczną skalą w milimetrach, skalibrowaną jednostką gęstości i anatomią, która cokolwiek znaczy tylko w trzech wymiarach. Możliwości wizualne Claude Opus 5 są naprawdę duże i potrafi on sensownie omówić radiogram lub preparat histopatologiczny. To inne zadanie niż integrowanie sześcianu o boku 384 milimetrów wypełnionego wartościami Hounsfielda przy rozdzielczości 2 mm i raportowanie o zrazikowatości guzka.

Co tak naprawdę mierzą liczby po każdej stronie

Te dwa modele mają rekordy benchmarków, które nigdy się nie przecinają, a czytanie ich obok siebie bez zauważenia tego to właśnie sposób, w jaki podejmuje się złe decyzje.

NV-Reason-CT podaje swoje wyniki na publicznym benchmarku TK klatki piersiowej CT-RATE, w osiemnastu etykietach, przy użyciu stałego jednolitego progu i bezpośredniego promptu tak/nie, bez głowicy klasyfikacyjnej i bez adaptacji do konkretnego zadania. Osiąga 0,614 F1 i 0,871 AUROC, wyprzedzając VoxelFM z 0,581 i 0,870, Pillar-0 z 0,544 i 0,861, ClinFusion-8B z 0,442 F1, CT-CLIP z 0,398 i 0,733, Merlin z 0,358 i 0,662 oraz MedGemma 1.5 z 0,303 F1, gdy dostarczy się mu do 85 przekrojów osiowych. Jest także makro-F1 wyliczony z raportu na poziomie 0,592. Każda z tych liczb pochodzi z pracy samej NVIDIA. Żadna z nich nie została odtworzona przez nikogo innego, a model jest dostępny do pobrania od kilku tygodni.

Dorobek Claude Opus 5 ma charakter ogólny i jest w dużej mierze niezależny. Artificial Analysis mierzy go na 50,8 w swoim Intelligence Index, 78 w Coding Index, 93,2 w GPQA Diamond i 54,9 w Humanity's Last Exam, z wynikiem przywoływania długiego kontekstu na poziomie 79,33. To liczby stron trzecich dotyczące ogólnego rozumowania, kodu i zadań wiedzowych. W tym zestawie nie ma benchmarku obrazowania klinicznego, a w opublikowanym dorobku Claude Opus 5 nie ma nigdzie wiersza CT-RATE.

Uczciwe stwierdzenie nie polega więc na tym, że jeden z nich jest z przodu. Polega ono na tym, że nikt nigdy nie zmierzył obu tych modeli na tym samym zadaniu.Każde zdanie o postaci „NV-Reason-CT jest lepszy niż Claude Opus 5 w obrazowaniu medycznym” jest w zapisanej formie nie do obalenia, ponieważ nikt nie przeprowadził tego eksperymentu. Własna tabela porównawcza NVIDIA nie zawiera żadnego ogólnego modelu czołowego.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Gdzie ludzie mylą się w kwestii interfejsu

Jedyny naprawdę interesujący techniczny punkt wspólny to ten, o który nikt się nie spiera: jak powinien wyglądać interfejs między modelem CT a modelem tekstowym.

Rozsądnym odruchem jest podanie Claude Opus 5 zestawu obrazów TK albo zdownsamplowanej objętości i poproszenie go o rozumowanie. Przy 1 000 000 tokenów kontekstu brzmi to hojnie, a na tle badania, które liczy tylko 13 824 tokenów wizualnych, brzmi jak mnóstwo miejsca. Miejsce nie jest problemem. Potok wizyjny Claude Opus 5 traktuje obraz jako dwuwymiarowy obrazek ze skalą pikselową. TK klatki piersiowej przedstawiona w ten sposób traci odstęp między warstwami, który czyni zmianę mierzalną, oraz kalibrację gęstości, która sprawia, że „matowa szyba” jest progiem, a nie opisem. Możesz przekazać mu montaż warstw osiowych i otrzymać spójnie brzmiący akapit. Czego nie możesz uzyskać, to pomiar.

To właśnie na to projekt NV-Reason-CT przeznacza swoje moc obliczeniowe. Siatka 24 x 24 x 24 z objętości 384 milimetrów jest przekazywana modelowi językowemu w pełnej rozdzielczości, bez przestrzennego zmniejszania rozdzielczości i bez warstwy scalającej, dlatego aktywna ścieżka ma 4,35 mld parametrów, a nie coś znacznie mniejszego. Ta architektura jest założeniem, że zachowanie szczegółów przestrzennych jest warte kosztu tokenów. To zakład dotyczący reprezentacji, a nie zdolności językowych, i Claude Opus 5 nie bierze w nim udziału.

Produktywny wzorzec jest nudny: użyj modelu CT do odczytu objętościowego, a modelu tekstowego do wszystkiego wokół. Generowanie i normalizacja raportów, podsumowania kohort, narzędzia ewaluacyjne, konwersja archiwów DICOM do NIfTI na dużą skalę, sortowanie badań pod kątem tego, które człowiek powinien obejrzeć najpierw. To praca z długimi dokumentami i kodem i właśnie tam model z kontekstem 1M zarabia na swoją stawkę.

Koszt, w dwóch jednostkach, które się nie przeliczają

Claude Opus 5 jest rozliczany według zużycia. Pięć dolarów za milion tokenów wejściowych i dwadzieścia pięć dolarów za milion wyjściowych, odczyty z pamięci podręcznej po pięćdziesiąt centów, zapisy do pamięci podręcznej po dziesięć dolarów. W przypadku potoku, który normalizuje korpus raportów albo pisze i przepisuje kod ewaluacyjny, daje to prognozę, którą można zbudować: tokeny wejściowe, tokeny wyjściowe, odczyty z pamięci podręcznej i znacznie tańszy rachunek, jeśli dobrze ustawisz cachowanie.

NV-Reason-CT nie ma ceny. Pobierasz 4,69 miliarda parametrów i płacisz w energii elektrycznej, godzinach GPU i czasie pracy inżynierów. Nie opublikowano żadnej wartości przepustowości dla pełnego badania obejmującego 13 824 tokeny ani nie ma w ofercie wariantu skwantyzowanego, więc koszt uruchomienia na jedno badanie jest liczbą, którą musiałbyś zmierzyć samodzielnie. To normalne w przypadku wag badawczych, a zarazem największa praktyczna różnica między nimi dwoma: jeden ma cennik, drugi ma rachunek, którego nie zobaczysz, dopóki już go nie zapłacisz.

Porównanie, które naprawdę się liczy, odbywa się na poziomie badania, a nie tokena. Odczyt CT to jedna jednostka pracy. Przebieg normalizacji raportu dla tego samego przypadku to zadanie tekstowe mierzone w tysiącach tokenów. Przypisanie kwoty w dolarach do pierwszego oznacza znajomość własnego sprzętu; przypisanie jej do drugiego to arytmetyka.

Pułapka w środku porównania

Jest pewien konkretny błąd, który warto nazwać, ponieważ to właśnie do niego zachęca to zestawienie. Polega on na traktowaniu NV-Reason-CT jako specjalistycznego fine-tune'u modelu ogólnego i wynikającym z tego założeniu, że model ogólny będzie wystarczająco blisko w większości przypadków i znacznie bardziej elastyczny.

To nie jest fine-tuning. To 3D transformer wizyjny nazwany Primus, zainicjowany z COLIPRI, dołączony do szkieletu językowego Qwen3.5-4B z 3D wieloosiowym osadzaniem pozycji rotary, wytrenowany na około 550 000 ustrukturyzowanych przykładach pytań i odpowiedzi pochodzących z 70 111 tomów CT z CT-RATE, CancerVerse i wewnętrznej kolekcji NIH, a następnie dostrojony za pomocą GRPO względem nagrody, która waży F1 zbioru nieprawidłowości na 2,0, wynik struktury raportu specyficzny dla regionu na 0,5 i miękką karę za długość na 1,0. Trójwymiarowy enkoder jest sednem tego modelu. Dwuwymiarowy lub oparty na plastrach front end to inne narzędzie, a samo porównanie w artykule pokazuje, ile warta jest ta różnica: MedGemma 1.5 przy 0,303 F1, gdy podano jej do 85 plastrów osiowych, w porównaniu z 0,614 dla natywnego modelu wolumetrycznego.

Odwrotny błąd jest równie częsty i równie kosztowny: zakładanie, że ponieważ NV-Reason-CT jest wyspecjalizowany, należy go używać do wszystkiego, co kliniczne. Obsługuje klatkę piersiową i brzuch i nic poza tym, jego wywołanie to plik NIfTI, a nie wiadomość na czacie, a warunki licencji przewidują wyłącznie zastosowania badawcze i edukacyjne. Nie odczyta slajdu patologicznego, nie odpowie na pytanie dotyczące wytycznych ani nie napisze kodu, który wsadowo przeprowadza Twoją konwersję DICOM. Sięganie po model CT do pracy z tekstem to ten sam błąd kategorii co sięganie po model tekstowy do pomiarów objętościowych — tylko w drugą stronę.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Jak obie połówki układają się w jeden system

Żaden z modeli nie zastępuje drugiego, a rozsądna architektura zawiera oba — co rodzi praktyczne pytanie, jak je wywoływać.

Claude Opus 5 jest udostępniany przez OrcaRouter jako anthropic/claude-opus-5 według stawki listowej dostawcy Anthropic z zerową marżą, w ramach jednego API obejmującego ponad 200 modeli. Ma to mniejsze znaczenie w przypadku pojedynczego wywołania niż w przypadku otaczającego potoku: gdy tekstowa połowa klinicznego builda jest jednym modelem spośród kilku kandydatów, posiadanie ich wszystkich za jednym kluczem oznacza, że możesz porównać je na własnym korpusie bez drugiej umowy czy zmiany kodu, a DSL routingu pozwala wysyłać pojedyncze żądania do modelu, który powinien je obsłużyć, podczas gdy automatyczny failover zabezpiecza cię, gdy dostawca ulega degradacji.

NV-Reason-CT nie ma na naszej platformie i żaden model NVIDIA również nie. To wagi, które pobierasz i uruchamiasz na własnym sprzęcie, co jest dokładnie tym, na co pozwala licencja, a ponieważ dane wejściowe to dane wolumetryczne pochodzące od pacjentów, prawdopodobnie i tak jest to to, czego chcesz. Nie zamierzamy sugerować, że kierujemy ruch do modelu, którego nie hostujemy. Część tekstowa tego rozwiązania to obszar, w którym jesteśmy przydatni; część wolumetryczna to obszar, w którym jesteś zdany na siebie z modelem 4,69B i GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Werdykt, który przetrwa wnikliwą analizę

Jeśli potrzebujesz odczytu wolumenu TK do ustrukturyzowanych wniosków, jest na to model — wyszedł z grupy badawczej NVIDIA i jest do pobrania, a nie do wywoływania przez API. Jeśli potrzebujesz znormalizowanego korpusu raportów, napisanego środowiska ewaluacyjnego, oskryptowanego zadania konwersji DICOM albo podsumowania kohorty, na to też jest model — i ma cennik.

Stanowisko, którego należy się trzymać, jest takie, że nie wykazano, by którykolwiek z nich był lepszy od drugiego w czymkolwiek, ponieważ eksperyment nie został przeprowadzony. Wykazano natomiast, że natywny trójwymiarowy interfejs przewyższa interfejs oparty na przekrojach w publicznym benchmarku tomografii komputerowej klatki piersiowej o margines, który autorzy szacują na około trzy punkty F1, oraz że ogólny model frontier jest niezależnie mierzony na szczycie dziedziny w zadaniach rozumowania, kodowania i pracy z długim kontekstem. To są dwa stwierdzenia dotyczące dwóch różnych zadań. Odczytanie ich jako rankingu jest błędem kategorii i utrzymuje się aż do momentu, gdy ktoś opublikuje bezpośrednie porównanie, którego nikt jeszcze nie opublikował.