Wygenerowana karta hero zatytułowana „NV-Reason-CT vs DeepSeek V4 Pro" z podtytułem „Koszt odczytania skanu i to, kiedy uruchamiać partię". Dwie zwrócone do siebie karty rozdziela para niebieskich strzałek: lewa karta jest oznaczona „NV-Reason-CT" z ikoną skanu ciała i „jeden wolumen CT – 13 824 tokeny wizualne – brak opublikowanej przepustowości"; prawa karta jest oznaczona „DeepSeek V4 Pro" z ikoną chipa i „1,6T łącznie / 49B aktywnych MoE – kontekst 1M – 0,66 USD / 1,98 USD za M, podwojone w dwóch oknach UTC". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

NV-Reason-CT kontra DeepSeek V4 Pro: Koszt odczytania skanu i kiedy uruchamiać przetwarzanie wsadowe

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Oto operacyjny fakt, który wpływa na więcej budżetów klinicznych pipeline'ów niż jakikolwiek benchmark: DeepSeek V4 Pro kosztuje 0,66 USD za milion tokenów wejściowych i 1,98 USD za milion tokenów wyjściowych, a te stawki podwajają się w dwóch oknach każdego dnia, od 01:00 do 04:00 i od 06:00 do 10:00 UTC. Praca wsadowa wykonywana poza tymi oknami kosztuje połowę tego, ile kosztuje w ich obrębie. Tymczasem NV-Reason-CT, model rozumujący 3D CT NVIDII o 4,69 miliarda parametrów, nie ma żadnego cennika — to zestaw wag, który pobierasz i uruchamiasz, bez publikowanego wskaźnika przepustowości dla pojedynczego badania o 13 824 tokenach. Jeden z tych modeli planujesz. Drugi musisz zmierzyć, zanim możesz uwzględnić go w budżecie.

Ta asymetria to użyteczny punkt wyjścia do tego porównania, ponieważ te dwa modele znajdują się na przeciwnych końcach potoku i pod względem finansowym zawodzą w przeciwny sposób. NV-Reason-CT to instrument o stałych kosztach: koszt krańcowy badania jest niemal zerowy, gdy sprzęt zostanie już kupiony, ale decyzja o zakupie sprzętu jest poważna, a opóźnienie przypadające na badanie nie jest udokumentowane. DeepSeek V4 Pro to silnik o zmiennych kosztach: nic nie trzeba kupować, wszystko jest rozliczane, a licznik ma harmonogram, który można odczytać z kalendarza.

Czym jest każde z nich, każde w jednej linii

• Zadanie — NV-Reason-CT odczytuje wolumen TK klatki piersiowej lub jamy brzusznej i generuje ustrukturyzowane wyniki; DeepSeek V4 Pro odczytuje i zapisuje tekst

• Architektura — trójwymiarowy transformer wizyjny o nazwie Primus, zainicjalizowany na bazie COLIPRI, z językowym backbone'em Qwen3.5-4B i trójwymiarowym wieloosiowym rotacyjnym osadzaniem pozycji, o 4,69 mld parametrów, z których 4,35 mld jest aktywnych; w zestawieniu z mieszaniną ekspertów o 1,6 biliona parametrów i 49 mld aktywnych parametrów na token

• Wejście — jednokanałowe wolumeny NIfTI (.nii, .nii.gz) w jednostkach Hounsfielda, zorientowane w układzie LPS, ponownie próbkowane izotropowo do 2 mm i przycięte do anatomii; w zestawieniu z tekstem

• Kontekst — pojedyncza objętość staje się 13 824 tokenami wizualnymi w siatce 24 x 24 x 24, bez przestrzennego podpróbkowania i bez warstwy scalającej; w porównaniu z 1 048 576 tokenami wejściowymi i 384 000 wyjściowymi

• Obsługiwane obszary anatomiczne — klatka piersiowa i brzuch, i nic więcej; w przeciwieństwie do wszystkiego, co może opisać tekst

• Cena — brak ceny katalogowej, hostowane samodzielnie, brak publikowanej przepustowości na badanie; w porównaniu z 0,66 USD / 1,98 USD za milion tokenów, podwajającej się w dwóch wymienionych powyżej oknach UTC, przy odczytach z pamięci podręcznej po 0,022 USD

• Zmierzona latencja — niepublikowana; w zestawieniu z medianą czasu do pierwszego tokena wynoszącą 3 483 milisekundy przy 96,01 tokena wyjściowego na sekundę, przy współczynniku błędów 0,75%

Dwa wiersze są tam warte więcej niż jedna linijka każdy. Wiersz kontekstu jest oczywistym przypadkiem — milion tokenów wobec 13 824 — ale jednostki nie są porównywalne i błędem jest odczytywać je jako lukę w możliwościach w którąkolwiek stronę. 13 824 tokeny to koszt wiernego odwzorowania jednego badania CT. Milion tokenów to ilość otaczającego tekstu, jaką możesz utrzymać. Pierwsza liczba mówi o rozdzielczości; druga mówi o pamięci.

Wiersz z opóźnieniem to ten, który się pomija. Mediana 3,48 sekundy do pierwszego tokenu i 96 tokenów na sekundę w DeepSeek V4 Pro to zmierzone, opublikowane wartości, które pozwalają oszacować zadanie tekstowe na papierze. Brak jakichkolwiek równoważnych danych dla NV-Reason-CT nie jest krytyką tego modelu; to powód, dla którego nie da się oszacować kosztu pipeline'u CT, zanim ktoś go nie uruchomi. Model 4,69B na 13 824 tokenach wizualnych to nie jest małe obliczenie, a dopóki nie zmierzysz jego czasu na własnym sprzęcie, tylko zgadujesz.

Czytanie dwóch rekordów benchmarkowych bez oszukiwania samego siebie

Wynik DeepSeek V4 Pro to mieszanka niezależnych pomiarów i raportowania przez dostawcę, a ta mieszanka jest pouczająca, ponieważ zawiera jedną liczbę, która wygląda alarmująco, ale nią nie jest.

• Artificial Analysis Intelligence Index — 36, co plasuje się w 72,4. percentylu mierzonych modeli

• GPQA Diamond — 92,8, co plasuje się w czołówce tej dziedziny

• Humanity's Last Exam — 41, i 41 w MMLU-Pro, 62,51 w indeksie matematycznym

• τ²-Bench — 96,20, z IFBench na 76,46 i tau_banking na 39,59

• Przywoływanie w długim kontekście — 80,33

• SciCode i Terminal-Bench — 51 i 78.65 w drugiej wersji Terminal-Bench

Indeks złożony na poziomie 36 obok GPQA Diamond na poziomie 92,8 brzmi jak sprzeczność, dopóki nie zauważysz, czym jest indeks. To agregat wielu ewaluacji, a model, który jest doskonały w kilku z nich, a w innych zaledwie dostateczny, w sumie uplasuje się w środku stawki, będąc jednocześnie na czele poszczególnych rankingów. Kto przytacza samo 36, aby dowodzić, że DeepSeek V4 Pro jest średniej półki, ten przytacza średnią tak, jakby była maksimum. Kto przytacza samo 92,8, aby dowodzić, że przewodzi stawce, ten przytacza maksimum tak, jakby było średnią. Obie liczby pochodzą z Artificial Analysis i obie są prawdziwe.

NV-Reason-CT nie ma w swoich wynikach takiej mieszanki i to jest rzeczywisty problem z nim. Jego wyniki CT-RATE — 0,614 F1 i 0,631 AUROC dla osiemnastu etykiet, przy stałym jednolitym progu oraz bezpośrednim promptcie typu tak/nie, bez głowicy klasyfikacyjnej i bez adaptacji do konkretnego zadania — pochodzą z pracy samej NVIDIA i nigdzie indziej. Zestaw porównawczy w tej pracy (VoxelFM z wynikiem 0,581, Pillar-0 z 0,544, ClinFusion-8B z 0,442, CT-CLIP z 0,398, Merlin z 0,358, MedGemma 1.5 z 0,303) to wyłącznie inne modele obrazowania. Nie występuje w nim ani jeden ogólny model tekstowy, a żadna strona trzecia nie odtworzyła żadnej z tych liczb.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

Kwestia planowania, przeanalizowana

Cennik zależny od czasu w DeepSeek V4 Pro jest najbardziej operacyjnie przydatnym elementem obu modeli, dlatego zasługuje na konkretne omówienie krok po kroku.

Realistyczne obciążenie po stronie tekstu w programie CT nie jest efektowne. Polega na wyodrębnianiu ustrukturyzowanych pól z korpusu historycznych raportów, aby mieć etykiety, na których można trenować, konwertowaniu drzew katalogów DICOM do NIfTI na dużą skalę, pisaniu i przepisywaniu narzędzia ewaluacyjnego, normalizowaniu jednostek i terminologii w czterech zbiorach danych oraz podsumowywaniu kohort. Przyjmijmy sto milionów tokenów wejściowych i dziesięć milionów tokenów wyjściowych dla programu średniej wielkości, co jest celowo okrągłą liczbą zastępującą „dużo pracy z tekstem”.

• W podwojonym oknie — $1,32 i $3,96 za milion, czyli $132 plus $39,60 przy tych wolumenach

• Poza tymi oknami — $0,66 i $1,98 za milion, czyli $66 plus $19,80

• Różnica — około 86 USD, czyli 49% rachunku za okres poza szczytem, za przeniesienie zadania, które z natury nadaje się do przetwarzania wsadowego

• Odczyty z pamięci podręcznej — 0,022 USD za milion, co stanowi jedną sześćdziesiątą stawki wejściowej, więc każdy prefiks promptu, który ponownie wykorzystujesz w całym korpusie, jest niemal darmowy

To nie jest błąd zaokrąglenia, a jest to dostępne, ponieważ praca jest asynchroniczna. Ekstrakcja raportów nie musi odbywać się o 14:00. W zadaniu konwersji DICOM nic nie zależy od tego, która jest godzina. Struktura cenowa jest bezpośrednim zaproszeniem do planowania, a potok, który to ignoruje, płaci 49% premii za przywilej uruchamiania, kiedy mu się podoba. Odczyty z pamięci podręcznej mają znaczenie z tego samego powodu: współdzielony prompt systemowy lub stały schemat ekstrakcji, wykorzystywany ponownie w tysiącach raportów, wynosi jedną sześćdziesiątą stawki wejściowej.

NV-Reason-CT nie ma odpowiednika dźwigni, ponieważ nie ma licznika. Koszt odczytu skanu to tyle, ile kosztuje godzina pracy twojego GPU podzielona przez liczbę skanów na godzinę, które zdołasz przez niego przepuścić, a ta druga liczba to ta, której nikt nie opublikował. Jeśli jedno badanie zajmuje dwie sekundy, pojedynczy L40S z łatwością obsłuży duży program. Jeśli zajmuje dwadzieścia, arytmetyka sprzętowa zmienia się całkowicie. NVIDIA testowała na H100 i L40S, co mówi, jakiej klasy jest karta, a nie jakie jest tempo.

Pułapka w założeniu, że można je zastąpić

Błąd, do którego zachęca to zestawienie, jest subtelniejszy niż typowy błąd kategorialny, ponieważ istnieje jego wersja, która na slajdzie wygląda rozsądnie.

DeepSeek V4 Pro ma 1 048 576 tokenów i generuje do 384 000. Objętość CT to — według obliczeń modelu, który właściwie ją odczytuje — zaledwie 13 824 tokeny. Zatem model tekstowy z oknem miliona tokenów ma miejsce na siedemdziesiąt kilka badań CT przy tej liczbie tokenów. Arytmetyka się zgadza, a wniosek — że można by podać dane CT modelowi tekstowemu i zaoszczędzić sobie infrastrukturę obrazowania — jest błędny, z tego powodu, dla którego liczba 13 824 w ogóle istnieje.

Ta liczba nie jest skompresowanym podsumowaniem skanu. To jest skan, w izotropowej rozdzielczości 2 mm na sześcianie o boku 384 milimetrów, pocięty na fragmenty 8 x 8 x 8, przekazany modelowi językowemu bez przestrzennego próbkowania w dół i bez warstwy scalającej. Liczba tokenów jest wysoka właśnie dlatego, że nic nie zostało wyrzucone: odstęp między warstwami, który czyni guzek mierzalnym, wartości gęstości, które czynią teksturę progiem, a nie przymiotnikiem. Model tekstowy nie może przyswoić tych tokenów jako wolumenów, podobnie jak nie może tego zrobić dokument. Ma budżet. Nie ma interfejsu.

Wewnętrzne porównanie zawarte w samym artykule wyraża tę różnicę liczbowo. MedGemma 1.5, której podano do 85 przekrojów osiowych — czyli maksimum, na co w rozsądnym zakresie stać dwuwymiarowy lub składany z przekrojów interfejs wejściowy — uzyskuje wynik 0,303 F1 wobec 0,614 dla natywnego modelu wolumetrycznego. Ta luka to wartość trójwymiarowego enkodera i żadna wielkość okna kontekstowego jej nie zniweluje.

Odwrotne podstawienie zawodzi z bardziej prozaicznych powodów. NV-Reason-CT obsługuje klatkę piersiową i jamę brzuszną, przyjmuje plik NIfTI, a nie prompt, nie obsługuje korzystania z narzędzi, a jego karta modelu ogranicza go do badań i edukacji oraz stwierdza, że nie jest wyrobem medycznym i że wyniki mogą być nieprawidłowe. Nie potrafi wyodrębnić pól z raportu ani napisać skryptu, który buduje twój korpus.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

Gdzie pasujemy, a gdzie celowo nie.

DeepSeek V4 Pro jest udostępniany przez OrcaRouter jako deepseek/deepseek-v4-pro, w cenie katalogowej dostawcy z zerową marżą, w ramach jednego API obejmującego ponad 200 modeli. Ten pass-through ma większe znaczenie niż zwykle w przypadku modelu z ceną zależną od pory dnia: gdy dostawca zmienia stawkę lub okno czasowe, stawka po naszej stronie zmienia się tego samego dnia, ponieważ nie ma pośredniej warstwy marży, która trzymałaby starą liczbę. Automatyczne przełączanie awaryjne obejmuje przypadek, gdy dostawca ulega degradacji w trakcie przetwarzania partii, co przy długim zadaniu ekstrakcji przebiegającym bez nadzoru jest właśnie tym trybem awarii, który realnie kosztuje cię całą noc, a DSL routingu pozwala kierować poszczególne żądania do modelu, który powinien je obsłużyć, zamiast przepuszczać wszystko przez jeden endpoint.

NV-Reason-CT nie znajduje się na naszej platformie. Żaden model NVIDIA też nie. Część CT tej architektury to Twój własny sprzęt z własnymi pobranymi wagami i nie zamierzamy napisać zdania, które pozwoliłoby czytelnikowi sądzić inaczej. Biorąc pod uwagę, że dane wejściowe to wolumetryczne dane pochodzące od pacjentów, a licencja to OpenMDW-1.1 bez żadnej dołączonej usługi hostowanej, wykonanie lokalne i tak jest właściwym miejscem dla tego modelu.

Co tak naprawdę mówi ci to zestawienie

Te dwa modele nie konkurują ze sobą, a sens ich porównywania polega na tym, że zawodzą w różny sposób. NV-Reason-CT daje ci możliwość, jakiej nie oferuje nic innego w otwartym dostępie — natywne trójwymiarowe rozumowanie CT przy pełnej rozdzielczości badania — i wymaga zaakceptowania nieujętego w budżecie kosztu na badanie, niepublikowanej przepustowości oraz licencji, która zabrania wdrożenia klinicznego. DeepSeek V4 Pro daje ci silnik rozliczany za zużycie z opublikowaną latencją, opublikowanym współczynnikiem błędów, niezależnymi pomiarami i ceną, którą można obniżyć o połowę, patrząc na zegar, ale nie potrafi w ogóle zobaczyć skanu.

Jeśli budujesz to coś, zamiast je kupować, forma, która przetrwa kontakt, jest nudna. Uruchom odczyt CT lokalnie, zaplanuj jego budżet, mierząc, a nie wyceniając, i ustaw wszystko, co tekstowe, wokół tego na spotkanie z oknem poza szczytem. Jedynym harmonogramem, którego nikt nie powinien kopiować, jest ten, który uruchamia ekstrakcję stu milionów tokenów o 02:00 UTC, bo właśnie wtedy partia przypadkiem była gotowa.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.