
Claude Haiku 5.5 kontra Nemotron 3.5 Lightning 30B A3B Base: Tani nie potrafi odpowiedzieć na pytanie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Na dwóch liczbach, na których najbardziej zależy arkuszowi kalkulacyjnemu ds. zakupów, wygrywa tańszy i szybszy model. Nemotron 3.5 Lightning 30B A3B Base działa z prędkością 298,9 tokenów wyjściowych na sekundę, co jest najszybszym wynikiem spośród 142 niezależnie śledzonych modeli, i kosztuje 0,06 USD za milion tokenów wejściowych w porównaniu do 0,10 USD w Claude Haiku 5.5. Nie jest też asystentem, przed czym ostrzega cię słowo „Base” w jego nazwie. To wstępnie wytrenowany checkpoint — bez nadzorowanego dostrajania, bez uczenia ze wzmocnieniem, bez szablonu czatu godnego tej nazwy — opublikowany na licencji OpenMDW-1.1 11 sierpnia 2026 r., aby inni mogli na nim budować. Claude Haiku 5.5, wydany 7 października 2026 r., to gotowy produkt, do którego można wysłać pytanie. Porównywanie ich pod względem ceny jest jak porównywanie kosztu mąki do kosztu chleba, a ciekawa część tego starcia polega na ustaleniu, którego z nich naprawdę potrzebuje twoje obciążenie.
Nikt w relacjach z premiery nie mówi tego jasno, ponieważ „tańszy i szybszy niż Claude Haiku 5.5” to lepszy nagłówek niż „tańszy, szybszy i nieużywalny bez przeprowadzenia dostrajania”. Oba stwierdzenia są prawdziwe. Tylko jedno z nich jest użyteczne.
Czym tak naprawdę jest każdy model
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, wydany 7 października 2026 r. Tekst i obraz na wejściu, tekst na wyjściu. Kontekst 1 mln tokenów, maksymalne wyjście 128 000 tokenów (300 000 po nagłówku beta w Batch API), data odcięcia treningu czerwiec 2026, wycofanie nie wcześniej niż 7 października 2027 r. Regulowany poziom wysiłku: Low, Medium, High, Xhigh i Max, domyślnie Medium, z adaptacyjnym myśleniem domyślnie włączonym. API rozliczane za zużycie, odczyty z pamięci podręcznej po 0,01 USD za milion, Batch za połowę stawki. Dostępny przez API Anthropic, a stamtąd wszędzie, gdzie modele Anthropic są odsprzedawane.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, ogłoszony 11 sierpnia 2026 r. Hybrydowy checkpoint typu mixture-of-experts z 30 miliardami parametrów i około 3 miliardami aktywnych parametrów na token, zbudowany na stosie Mamba-2 plus MoE plus attention, destylowany z Nemotron 3 Ultra i dostarczany z dekodowaniem spekulatywnym MTP, DFlash i DSpark. Kontekst sięga 1 mln tokenów, choć około 256 000 to praktyczny limit na pojedynczym H100. Obsługuje wyłącznie tekst. Wagi są otwarte na licencji OpenMDW-1.1. Jest to bazowy checkpoint: surowe, wstępnie wytrenowane wagi bez dostrajania instrukcyjnego, co oznacza, że uzupełnia tekst, a nie wykonuje instrukcje.

• Wymiary, każdy w jednej linii
• Cena danych wejściowych — Claude Haiku 5.5 0,10 USD za milion do 100 tys. tokenów, następnie 0,50 USD; Nemotron 3.5 Lightning 30B A3B Base 0,06 USD za milion.
Cena wyjściowa — 0,50 USD za milion do 100 tys. tokenów, następnie 2,50 USD, w porównaniu z 0,20 USD za milion.
• Koszt na ukończone zadanie — 0,21 USD za niezależne zadanie indeksowania dla Claude Haiku 5.5, w porównaniu z 0,09 USD dla Nemotron — tańszy model jest tańszy na zadanie, a nie tylko na token.
• Szybkość generowania — 243,4 tokena na sekundę dla Claude Haiku 5.5, dziewiąty spośród 182; 298,9 tokena na sekundę dla Nemotron, pierwszy spośród 142.
• Czas do pierwszego tokenu — około 0,3 sekundy dla Claude Haiku 5.5 w porównaniu z 0,54 sekundy dla Nemotron.
• Niezależny wynik — Artificial Analysis Intelligence Index 43 dla Claude Haiku 5.5, drugie miejsce na 182, przy konfiguracji Max na poziomie 43,40; Indeks 13 dla Nemotron, dwudzieste dziewiąte miejsce na 142.
• Okno kontekstowe — 1 000 000 tokenów każde, z czego około 256 000 realnie użytecznych dla Nemotron na pojedynczym H100.
• Modalności — tekst i obraz na wejściu dla Claude Haiku 5.5; tylko tekst dla Nemotron.
• Wagi — zastrzeżone kontra otwarte na licencji OpenMDW-1.1, hybrydowy MoE o łącznej liczbie 30B i 3B aktywnych parametrów.
• Dostrajanie instrukcyjne — obecne w Claude Haiku 5.5, nieobecne w bazowym checkpoincie.
Problem „Base”, wyrażony wprost
Bazowy checkpoint przewiduje następny token. Zadaj mu pytanie, a często będzie kontynuować tekst w stylu dokumentu, który mógłby zawierać takie pytanie, zamiast udzielić odpowiedzi. Wpisz mu prompt „Streść tę umowę”, a model bazowy może wygenerować wiarygodną kontynuację dokumentu szkoleniowego z dziedziny prawa, a nie streszczenie twojej umowy. NVIDIA publikuje osobny checkpoint BF16 oraz osobne, dostrojone do instrukcji modele siostrzane właśnie dlatego, że bazowe wagi są surowcem.
Na własnej karcie modelu NVIDIA — podane przez producenta, nieodtworzone niezależnie — bazowy checkpoint uzyskuje 78,59 w MMLU, 67,94 w MMLU-Pro, 91,28 w GSM8K, 77,44 w HumanEval i 69,62 w RULER przy 1 mln tokenów. Karta Lightning dla dostrojonego modelu siostrzanego podaje MMLU-Pro 81,94, GPQA Diamond 75,44, SWE-Bench Verified 51,56 i 86% w PinchBench, z około 30% szybszym wnioskowaniem niż model, który zastąpił. Nawet dostrojone liczby pochodzą od samej NVIDIA, a to właśnie liczby bazowe dotyczą checkpointu wymienionego w tytule tego artykułu. Na ich tle niezależnie zmierzony wynik 43,40 modelu Claude Haiku 5.5 — drugie miejsce na 182 w indeksie Artificial Analysis, innym indeksie mierzącym co innego — nie jest bezpośrednio porównywalny, a uczciwa interpretacja jest taka, że bazowy checkpoint 30B i gotowy mały model są oceniane przez różne narzędzia do różnych celów.
To, co można powiedzieć bez zastrzeżeń, to kształt tej luki. Bazowy checkpoint, który przed udzieleniem jakiejkolwiek odpowiedzi wymaga potoku dostrajania, stosu serwowania i środowiska ewaluacyjnego, nie jest substytutem hostowanego modelu w cenie 0,10 USD za milion. To punkt wyjścia dla kogoś, kto chce być właścicielem tego modelu.
Gdzie Nemotron naprawdę wygrywa, i nie jest to nagroda pocieszenia
Prędkość przede wszystkim. 298,9 tokenów wyjściowych na sekundę stawia go na szczycie rankingu 142 modeli — o 23% szybciej niż Claude Haiku 5.5 z wynikiem 243,4. W przypadku potoku wrażliwego na opóźnienia to realna, mierzalna różnica — i właśnie dlatego na pudełku widnieje nazwa „Lightning”.
Po drugie, otwarte wagi — i to jest ten większy punkt. W ramach OpenMDW-1.1 możesz pobrać checkpoint, dostroić go na własnych danych i hostować samodzielnie. Claude Haiku 5.5 nie można w ogóle dostroić ani hostować samodzielnie za żadną cenę. Dla zespołu z własnościowym zadaniem, nietypowym rozkładem danych wejściowych lub wymogiem zgodności, że ruch nigdy nie opuszcza ich własnej infrastruktury, ta różnica jest decydująca, niezależnie od tego, co mówią strony z benchmarkami. Model o łącznej liczbie 30B parametrów i 3B aktywnych jest też wystarczająco mały, by dało się go ekonomicznie serwować — architektura jest zaprojektowana dokładnie do tego.
Po trzecie, cena: 0,06 USD za milion na wejściu i 0,20 USD za milion na wyjściu, z 17% zniżką na cache oraz 0,09 USD za zadanie indeksowania, to około połowa ceny 0,21 USD Claude Haiku 5.5. Oba modele są tanie; Nemotron jest tańszy.
Gdzie Claude Haiku 5.5 wygrywa — a wygrywa w każdym wymiarze, który wymaga odpowiedzi
Podążanie za instrukcjami, ponieważ zostało ono do tego wytrenowane. Niezależna zdolność, przy Index 43 wobec 13 — trzydziestopunktowa różnica na tablicy, która oceniła oba, co stanowi największą tego rodzaju różnicę w tym zestawie porównań. Wejście obrazowe, którego Nemotron w ogóle nie obsługuje. Maksymalne wyjście na poziomie 128 000 tokenów wobec niepublikowanej liczby, z betową ścieżką 300 000 tokenów w Batch. Oraz pokrętło wysiłku, które pozwala odzyskać koszty poprzez obniżenie wysiłku rozumowania, a nie poprzez przebudowę modelu.
Zastrzeżenie dotyczące gadatliwości działa tu w obie strony. W zestawie testów Artificial Analysis Claude Haiku 5.5 generuje około 440 milionów tokenów wyjściowych wobec mediany wynoszącej około 100 milionów — myśli bardzo dużo. Nemotron generuje około 120 milionów, co to samo źródło opisuje jako nieco gadatliwe jak na swój rozmiar. Koszt Haiku 5.5 na zadanie wynosi jednak 0,21 USD wobec 0,09 USD w przypadku Nemotronu, więc nawet ten rozmowny model nie jest tym drogim. To pokazuje, że ceny za token wprowadzają w błąd w obie strony, a budżet należy planować na podstawie liczby na zadanie.
Samodzielny hosting kontra jeden punkt końcowy
Nemotron 3.5 Lightning 30B A3B Base jest dystrybuowany jako otwarte wagi i obsługiwany przez kilku dostawców inferencji; NVIDIA publikuje również dostrojone modele siostrzane. Claude Haiku 5.5 jest dostępny przez API Anthropic, a stamtąd wszędzie tam, gdzie modele Anthropic są odsprzedawane. Żaden z nich nie znajduje się w katalogu OrcaRouter i nie będziemy udawać, że jest inaczej — z tego sąsiedztwa kierujemy anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 i anthropic/claude-fable-5.1, czyli poziom powyżej tematu tego artykułu.
Dwie ścieżki opisane w tym porównaniu mają naprawdę odmienną infrastrukturę i warto je nazwać. Ścieżka self-hosted oznacza GPU, framework serwujący, decyzję o kwantyzacji i dyżury operacyjne. Ścieżka hostowana oznacza klucz i ciąg nazwy modelu. OrcaRouter istnieje dla tej drugiej ścieżki: jedno API do ponad 200 modeli, jeden klucz i jeden rachunek, cena katalogowa dostawcy przekazywana bez marży (0% markup), dzięki czemu obniżka u dostawcy obowiązuje tego samego dnia, a pod spodem automatyczne przełączanie awaryjne. To nie jest droga do bazowego checkpointu 30B, a zakup maszyny klasy DGX nie jest drogą do hostowanego małego modelu.

Kto powinien wybrać, które
Jeśli Twoje zadanie jest dobrze zdefiniowane, Twoje dane treningowe są wystarczająco duże, by miały znaczenie, a Twój ruch nie może opuścić Twojej własnej infrastruktury, Nemotron 3.5 Lightning 30B A3B Base jest ciekawszym obiektem: najszybszy ze 142 pod względem szybkości wyjściowej, o połowę niższa cena za token i możesz go modyfikować. Uwzględnij w budżecie koszt uruchomienia fine-tuningu i koszt serwowania, zanim policzysz oszczędności, ponieważ stawka 0,06 USD za token wejściowy zakłada, że ktoś już wykonał pracę, która zamienia checkpoint w asystenta.
Jeśli chcesz wysłać zapytanie i dostać odpowiedź jeszcze tego popołudnia, Claude Haiku 5.5 jest tym, który to załatwia — 43 w niezależnym indeksie wobec 13, obsługa obrazów, limit wyjściowy 128 000 tokenów i cena, która jest naprawdę niska. Porównanie wygląda na bliskie tylko na cenniku. Przestaje wyglądać blisko w momencie, gdy zadanie polega na odpowiedzi na pytanie, a nie na kontynuowaniu dokumentu.

