Wygenerowana karta główna zatytułowana „NV-Reason-CT vs Kimi K3" z podtytułem „210 pobrań i 588 milionów tokenów". Na dole znajdują się trzy plakietki: „210 pobrań HF vs 587,8 mln tokenów / 7 dni", „0,21% zmierzonego błędu w naszej sieci" oraz „Jeden wolumen vs 1 048 576 tokenów". Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

NV-Reason vs Kimi K3: 210 i 588 milionów tokenów

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeden z tych modeli został pobrany 210 razy z Hugging Face. Drugi przeprowadził 588 milionów tokenów przez nasz własny playground w ciągu ostatnich siedmiu dni. Oba mają otwarte wagi, oba można pobrać już teraz, a różnica między tymi dwiema liczbami jest najcenniejszą rzeczą w tym porównaniu. NV-Reason-CT to opracowany przez NVIDIA model wizyjno-językowy 3D do tomografii klatki piersiowej i jamy brzusznej o 4,69 mld parametrów, opublikowany na Hugging Face 8 września 2026 roku bez żadnego ogłoszenia. Kimi K3 to flagowy model MoonshotAI obsługujący 1 048 576 tokenów, wydany 15 lipca 2026 roku i obecnie jeden z najbardziej obciążonych modeli w naszej sieci. Oba są „otwarte” w sensie, który ma znaczenie przy wypełnianiu formularza zakupowego. Wcale nie są jednak otwarte w ten sam sposób.

Dwa znaczenia wyrażenia „możesz to pobrać”

Zacznij od tego, co każde pobranie faktycznie zapisuje na twoim dysku, bo właśnie tutaj większość porównań otwartych wag się rozmywa.

NV-Reason-CT daje ci model.safetensors o rozmiarze około 10,6 GB w BF16, a także model.py oraz pokaźny processor.py — 26 KB własnego kodu przetwarzania, który implementuje kadrowanie świadome anatomii, ponowne próbkowanie 2 mm i podział na patche 3D. Ładujesz go za pomocą trust_remote_code=True, co oznacza, że wykonujesz kod repozytorium NVIDIA wewnątrz swojego procesu. Wnioskowanie wymaga PyTorch z CUDA, a karta modelu wymienia Ampere, Hopper i Lovelace, przetestowane na H100 i L40S. Na wejściu jest jedna objętość NIfTI naraz. Nie opublikowano żadnych informacji o batchowaniu, nie ma danych o przepustowości ani konfiguracji serwowania w repozytorium poza przykładem inference.py.

Kimi K3 daje ci model rozumowania ogólnego przeznaczenia z oknem kontekstowym o rozmiarze 1 048 576 tokenów, obsługą tekstu i obrazów, natywnym wywoływaniem narzędzi, ustrukturyzowanymi danymi wyjściowymi oraz konfigurowalnym poziomem wysiłku rozumowania. To model, po który sięgniesz, by odczytać sto wytycznych klinicznych w jednym żądaniu albo raporty działu z całej dekady. Jego wynik long-context recall według Artificial Analysis wynosi 88,7 — najwyższy wśród modeli z tej serii i o pełne 8,4 punktu wyższy od 80,3 Grok 4.6.

Mówiąc wprost: NV-Reason-CT to specjalistyczny checkpoint o wąskim zakresie obsługiwanych danych wejściowych i z własnym kodem, któremu musisz zaufać i który musisz utrzymywać. Kimi K3 to model ogólnego przeznaczenia o szerokim zakresie obsługiwanych danych wejściowych, który działa jak infrastruktura. Oba można pobrać. Tylko jeden z nich jest gotowy do użycia od razu.

Dowód CT w całości, i jest krótki

Wszystko, co jest publicznie znane na temat jakości NV-Reason-CT, opiera się na jednej tabeli w jego własnej karcie modelu: zadanie klasyfikacji 18 etykiet CT-RATE przy stałym jednolitym progu, bezpośrednie promptowanie Yes/No, brak głowicy klasyfikacyjnej, brak dostosowania do konkretnego zadania. Macro-F1 0,614, Macro-AUROC 0,871.

Wiersze porównawcze to VoxelFM z wynikiem 0.581/0.870, Pillar-0 z 0.544/0.861, ClinFusion-8B z 0.442, CT-CLIP z 0.398/0.733, Merlin z 0.358/0.662 i MedGemma 1.5 z 0.303. Każda z tych wartości to liczba podana przez dostawcę z karty NVIDIA i żadna nie została jeszcze niezależnie odtworzona — praca została opublikowana zaledwie dwa dni temu.

To, co ustala ta tabela, jest wąskie i warto je dokładnie wyrazić: generatywny model 3D bez głowy wyspecjalizowanej do zadania przewyższa bazowe modele 3D kontrastywnego wstępnego trenowania oraz model frontier oparty na skrawkach w 18-etykietowej klasyfikacji CT. To, czego nie ustala, to nic na temat ogólnego rozumowania, nic na temat modalności innych niż CT klatki piersiowej i jamy brzusznej oraz nic na temat przewagi w AUROC — 0,871 wobec 0,870 to remis w przebraniu przecinka dziesiętnego.

Liczby Kimi K3 i zastrzeżenie dotyczące tablicy otwartych wag

Artificial Analysis mierzy Kimi K3 na poziomie 43,6 w Intelligence Index, co plasuje go na 19. miejscu spośród 145 modeli na tej liście w migawce rankingu naszego API modeli. Jego wyniki to: GPQA Diamond 93,5, Humanity's Last Exam 46,9, SciCode 59,5, Terminal-Bench 2.1 85,0, AA Coding 76,2 na 9. miejscu i 𝜏²-banking 46,0.

Jedno twierdzenie dotyczące rankingu wymaga ostrożności, bo łatwo je pomylić, a już wcześniej je mylono. Wskaźnik AA Intelligence Index modelu Kimi K3 wynoszący 44 zajmuje trzecie miejsce wśród modeli open-weights na liście open-weights, za MiMo-V2.6-Pro z 46 i GLM-5.3 z 45. Nie jest liderem tej listy i nie konkuruje na tej samej liście co Grok 4.6 — Artificial Analysis klasyfikuje Grok 4.6 jako własnościowy, więc jego 44 należy do rankingu ogólnego, a nie do rankingu open-weights. Te dwa wskaźniki wyglądają identycznie, ale identyczne nie są.

Co operator faktycznie widzi

Stąd bierze się liczba 588 milionów i warto to wyjaśnić, ponieważ to jedyny dowód w tym artykule, który pochodzi od nas, a nie z czyjegoś marketingu.

W ciągu ostatnich siedmiu dni Kimi K3 przepuścił 587,8 miliona tokenów przez playground OrcaRouter. Mediana czasu do pierwszego tokenu wynosiła 7,8 sekundy, generował 42,9 tokenów wyjściowych na sekundę, a jego wskaźnik błędów w tym okresie wyniósł 0,21% — jeden błąd na około 480 żądań. Ten zmierzony wskaźnik błędów to coś, czego nie można uzyskać z karty modelu, i to właśnie ta liczba decyduje o tym, czy model można bezpiecznie umieścić za zadaniem wsadowym.

Dla NV-Reason-CT nie ma odpowiednika, ponieważ nie jest to nigdzie hostowany endpoint — to checkpoint, który uruchamiasz samodzielnie. Nie ma p50, wskaźnika błędów, czasu działania ani nikogo, do kogo można by przełączyć się awaryjnie. To nie jest przytyk; to strukturalny fakt dotyczący samodzielnego hostowania i to jest powód, dla którego zespół badawczy może wdrożyć NV-Reason-CT we wtorek, a zespół produkcyjny zazwyczaj nie może.

Jeśli uruchamiasz obie połowy tego — Kimi K3 jako hostowaną warstwę ogólną, a NV-Reason-CT na własnej maszynie z GPU — to strona routingu jest tym, co zapewnia hostowanej połowie odporność. Kimi K3 jest udostępniany w cenie katalogowej samego Moonshot wynoszącej 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych bez żadnej marży, jego stawka za odczyt z pamięci podręcznej wynosząca 0,30 USD za milion to jedna dziesiąta ceny wejścia, a ponieważ cena jest przekazywana bez zmian, obniżka ze strony dostawcy trafia na Twój rachunek tego samego dnia. Automatyczne przełączanie awaryjne między dostawcami jest tym, co utrzymuje zadanie wsadowe przy życiu, gdy jeden z nadrzędnych punktów końcowych zaczyna szwankować — a przy wskaźniku błędów wynoszącym 0,21% takie szwankowania są na tyle rzadkie, że łatwo o nich zapomnieć, dopóki się nie zdarzą.

Kształty kosztów nie są do siebie podobne

• Cena — CAPEX na GPU NV-Reason-CT plus własny stack do serwowania w porównaniu z Kimi K3: $3,00 / $15,00 za milion, $0,30 za odczyt z pamięci podręcznej

• Minimalny opłacalny wydatek — NV-Reason-CT: jeden GPU Ampere lub nowszy utrzymywany bezterminowo vs Kimi K3: jedno żądanie

• Kontekst — NV-Reason-CT jeden tom, 13 824 tokenów na stałe vs Kimi K3 1 048 576 tokenów

• Koszt krańcowy tysięcznego żądania — NV-Reason-CT praktycznie zerowy po opłaceniu GPU w porównaniu z Kimi K3, którego koszt jest liniowy względem liczby tokenów

• Gdzie pęknie najpierw — niezweryfikowana przepustowość NV-Reason-CT i brak podejścia do batchingu kontra koszt długiego kontekstu Kimi K3 przy 1 mln tokenów na żądanie

• Modalności — NV-Reason-CT 3D NIfTI, klatka piersiowa lub brzuch vs Kimi K3 tekst i obraz, cokolwiek

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

Ekonomia odwraca się w zależności od wolumenu. Kimi K3 nic nie kosztuje na starcie i skaluje się liniowo. NV-Reason-CT wymaga GPU na starcie, a potem skaluje się niemal płasko — dlatego 210 pobrań nie jest sygnałem porażki. To właściwa liczba dla checkpointu, którego odbiorcami są instytucje, które już posiadają ten sprzęt i które nigdy nie znajdą się w żadnej statystyce przepustowości tokenów.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Który tak naprawdę wybierasz?

Jeśli zadanie polega na odczytaniu wolumenu CT i wygenerowaniu ustrukturyzowanego wyniku wraz ze śladem rozumowania, Kimi K3 nie potrafi tego zrobić, a NV-Reason-CT potrafi. Nie „robi to gorzej” — nie potrafi, ponieważ nie ma w nim nigdzie enkodera wolumetrycznego, a spłaszczenie skanu do obrazów najpierw odrzuca relacje przestrzenne, które ścieżka 3D ma za zadanie zachować.

Jeśli zadanie polega na przeczytaniu 400 stron notatek ze skierowań, porównaniu ich z dokumentem protokołu i wygenerowaniu ustrukturyzowanych wyników, to NV-Reason-CT nie wchodzi w grę, a Kimi K3 jest jedną z lepszych dostępnych odpowiedzi — przy zmierzonym wskaźniku błędów poniżej jednej czwartej procenta w naszej sieci.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

Prawdziwa decyzja nie polega na wyborze między tymi dwoma. Polega na tym, czy twój problem jest problemem wolumenu, czy problemem tekstu, a przepaść między 210 a 588 milionami to po prostu to, jak to rozróżnienie wygląda z zewnątrz. Jeden model to artykuł z wagami. Drugi to kawałek infrastruktury. Oba warto mieć; żaden nie zastępuje drugiego.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie