
Claude Haiku 5.5 już dostępny w cenie 0,10 USD za milion tokenów: twierdzenie o 75% i jego dwa przypisy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Anthropic udostępnił Claude Haiku 5.5w powszechnej dostępności 7 października 2026 r. w cenie 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych — te same dwie liczby, które OpenAI pobiera za GPT-6 Luna, i jedna piąta tego, co Claude Haiku 4.5kosztuje od 2025 r., kiedy to zadebiutował w cenie 1,00 i 5,00 USD. Nagłówek w poście premierowym Anthropic głosi, że nowy model kosztuje „średnio około 75% mniej w eksploatacji” niż jego poprzednik, i właśnie tę liczbę powtarza każde późniejsze podsumowanie. Towarzyszą jej dwa przypisy, które większość tych podsumowań pominęła: poniżej 100 000 tokenów obniżka wynosi 90%, powyżej — 50%, a Claude Haiku 5.5 korzysta z nowszego tokenizera współdzielonego z Claude 4.7 i późniejszymi, więc ten sam tekst liczy się jako około 30% więcej tokenów niż w przypadku Claude Haiku 4.5. Zatem te 75% to stwierdzenie o rachunku, a nie o cenniku, a dla każdego, kto pisze długie prompty, to dwie różne rzeczy. Tabela porównawcza samego dostawcy zawiera też GPT-6 Luna i Claude Sonnet 5.5 jako kolumny obok niego, co sprawia, że dokumentacja premiery jest wyjątkowo łatwa do zakwestionowania.
Arytmetyka stojąca za „75% mniej”
Najpierw zapoznaj się z cennikiem, bo nie jest on jednolity. Wejście kosztuje 0,10 USD za milion do 100 000 tokenów, a powyżej tej liczby 0,50 USD za milion — pięć razy więcej. Wyjście to 0,50 USD, a następnie 2,50 USD. Buforowanie działa według tego samego progu: zapis do pamięci podręcznej na pięć minut to 0,125 USD za milion poniżej progu i 0,625 USD powyżej niego, zapis godzinny to 0,20 USD i 1,00 USD, a odczyt z pamięci podręcznej to 0,01 USD i 0,05 USD. API Message Batches daje 50% zniżki na oba liczniki, a na ścieżce wsadowej model obsługuje do 300 000 tokenów wyjściowych z output-300k-2026-03-24 nagłówkiem beta.
Teraz nałóż na to tokenizer, bo właśnie tutaj główne twierdzenie staje się interesujące. Polecenie, które w tokenizerze Claude Haiku 4.5 miało 90 000 tokenów, w nowym ma około 117 000. Jego rozmiar się nie zmienił, ale przekroczyło linię 100 000 tokenów, więc jest rozliczane po $0.50 za milion tokenów wejściowych zamiast $0.10. W Claude Haiku 4.5 ta sama treść kosztowała $0.09 na wejściu ($1.00 za milion × 0.09 miliona). W Claude Haiku 5.5 kosztuje $0.058. To obniżka o 35% — rzeczywista i daleka od 90%. Liczba 90% dotyczy żądań, które po rozszerzeniu ich przez tokenizer pozostają poniżej tej linii, a właśnie tam mieści się duża część ruchu krótkich wywołań: wywołanie klasyfikacyjne o 20 000 tokenów staje się 26 000 tokenów, pozostaje w pierwszym progu i tam koszt wejścia jest rzeczywiście jedną dziesiątą tego, czym był.
Wynikają z tego trzy rzeczy i warto je rozdzielić, a nie uśredniać:
• Krótkie wywołania otrzymują pełny rabat. Ekstrakcja, routing, klasyfikacja, streszczanie dokumentu mieszczącego się poniżej limitu — te operacje mają 90% stawkę na wejściu i wyjściu, pomniejszoną o ekspansję tokenizatora.
• Długie wywołania są tańsze o około jedną trzecią, a nie o trzy czwarte. Żądanie, które po ponownej tokenizacji przekracza 100 000 tokenów, płaci 0,50 USD i 2,50 USD za milion — wciąż połowę stawek Claude Haiku 4.5, ale poziom, w którym się znajduje, jest pięciokrotnie wyższy niż poziom reklamowany na etykiecie.
• „75% mniej średnio” to liczba ważona ruchem i należy do Anthropic. To opis własnego oczekiwanego miksu podany przez samego dostawcę, a Anthropic wyraźnie zaznacza, że zapytanie poniżej progu stanowiło około 90% żądań kierowanych do poprzedniego Haiku. Jeśli Twój miks nie wygląda jak tamten miks, Twoja średnia nie będzie wyglądać jak tamta średnia — a jedynym sposobem, by się dowiedzieć, która to która, jest policzenie tokenów we własnym ruchu, na nowym tokenizerze, zanim ustalisz budżet.

Co jeszcze zostało z nim dostarczone?
Model to nie tylko cena. Kilka szczegółów premiery zmienia sposób, w jaki piszesz pod niego kod, a jeden z nich zepsuje istniejącego klienta.
• Adaptacyjne myślenie jest domyślnie włączone, z regulacją poziomu wysiłku od Low do Max i domyślną wartością średni. To pierwszy model klasy Haiku z możliwością regulacji poziomu wysiłku i główna dźwignia wpływająca zarówno na jakość, jak i koszt odpowiedzi.
• Parametry próbkowania są odrzucane. Wysłanie wartości innej niż domyślna dla temperature, top_p lub top_k zwraca 400. Każda migracja, która przeniosła te argumenty dalej, zakończy się głośnym błędem przy pierwszym żądaniu, zamiast po cichu degradować, co jest przynajmniej uczciwym trybem awarii.
• kontekst 1 mln tokenów i do 128 000 tokenów wyjściowych w synchronicznym Messages API, z datą odcięcia wiedzy w czerwcu 2026 r. i zobowiązaniem do wycofania nie wcześniej niż 7 października 2027 r.
• Pięć platform już pierwszego dnia: Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry oraz Claude Platform on AWS. To wdrożenie w tym samym dniu, a nie etapowe udostępnianie, jakie często towarzyszy takim premierom.
• Narzędzia też poszły do przodu.SDK Pythona i TypeScript firmy Anthropic obsługują teraz w wersji beta korzystanie z komputera i przeglądarki, a firma dodała miesięczne środki na API dla subskrybentów Max 5x (100 USD), Max 20x (200 USD) i Team (do 500 USD w puli).
• Profil bezpieczeństwa jest węższy, niż sugeruje cena. Anthropic twierdzi, że zabezpieczenia cybernetyczne w Claude Haiku 5.5 są bardziej restrykcyjne niż w Claude Haiku 4.5, ale mniej restrykcyjne niż w najnowszych modelach frontier — szersze zastosowanie defensywne niż pozwala na to Claude Sonnet 5.5, przy nadal zablokowanym testowaniu penetracyjnym — oraz że zabezpieczenia biologiczne odpowiadają tym w Claude Sonnet 5, Claude Sonnet 5.5 i Claude Opus 5. Ewaluacje alignmentu poprawiły się w szerokim zakresie względem poprzednika we własnym zestawie testów Anthropic.
Co mówi tabela dostawcy, a co mówi niezależna rada
Anthropic opublikował tabelę benchmarków z trzema kolumnami porównawczymi i warto ją przeczytać jako dokument o tym, jak dostawcy argumentują. Każda podana poniżej liczba pochodzi od dostawcy, została uzyskana na harnessach Anthropic i żadna z nich nie została niezależnie odtworzona; tam, gdzie pojawia się GPT-6 Luna, to Anthropic przeprowadza własne ewaluacje na modelu konkurenta.
•Praca oparta na wiedzy — GDP-AA v2.1 na poziomie 1620 dla Claude Haiku 5.5, wobec 735 dla Claude Haiku 4.5, 1437 dla GPT-6 i 1840 dla Claude Sonnet 5.5. AA-Briefcase v1.1 na poziomie 1578, 614, 1336 i 1824.
• Korzystanie z komputera — OSWorld 2.1 w trybie offline na poziomie 72,4% wobec 15,7%, 48,9% i 83,9%.
• Rozumowanie — Humanity's Last Exam na poziomie 45,9% bez narzędzi i 57,4% z nimi, w porównaniu z 10,2% i 18,7% dla Claude Haiku 4.5 oraz 56,9% i 64,5% dla Claude Sonnet 5.5.
• Kodowanie agentowe — Terminal-Bench 4.0 na poziomie 39,2% wobec 0,0%, 16,4% i 70,6%. FrontierCode 1.1 (Main) na poziomie 46,4% wobec 42,4% dla GPT-6 Luna i 52,1% dla Claude Sonnet 5.5.
• Czytanie wykresów — Chartography na poziomie 46,4% bez narzędzi wobec 6,4%, 29,1% i 61,6%.
W tej tabeli Claude Haiku 5.5 wygrywa każdy wiersz zarówno z poprzednim Haiku, jak i z GPT-6 Luna, a większość z nich przegrywa z Claude Sonnet 5.5 — co jest uczciwym obrazem małego segmentu: duży skok generacyjny, a mimo to wciąż poziom poniżej modelu średniej klasy przy najtrudniejszych zadaniach. Anthropic mówi o tym w poście, polecając Claude Sonnet 5.5 i Claude Opus 5.5 do złożonego kodowania agentowego, jednocześnie pozycjonując Haiku do kompaktowania, podsumowywania, klasyfikacji i ról subagentów.
Niezależny obraz jest bardziej zniuansowany i wymaga więcej uwagi. Artificial Analysis mierzy Claude Haiku 5.5 przy wysiłku Max na poziomie 43 w swoim Intelligence Index v4.3.2 — drugie miejsce wśród 182 modeli — oraz 241,9 tokenów wyjściowych na sekundę — szybko, zgodnie z reklamą. Mierzy także koszt 0,21 USD na ukończone zadanie Index, ponieważ model wygenerował 440 milionów tokenów wyjściowych, wykonując zestaw testów, w porównaniu z medianą 100 milionów; oceniający opisuje go jako bardzo rozwlekły. GPT-6 Luna, z wynikiem 38 w tym samym indeksie, kosztuje 0,07 USD na zadanie. Ta sama cena katalogowa, trzykrotnie wyższy rachunek. To nie jest sprzeczność z twierdzeniem z premiery — to to samo zjawisko, którego dotyczy twierdzenie z premiery, widziane z drugiej strony: tabela stawek określa, ile płacisz za token, a kwota, którą faktycznie płacisz, to stawka razy liczba tokenów, a Claude Haiku 5.5 zużywa ich więcej na odpowiedź niż jego rywale. Wysiłek jest dźwignią; domyślnym ustawieniem modelu jest średni, nie Max, a zespół, który ustawi go niżej, zobaczy zarówno mniejszy rachunek, jak i niższy wynik.
Wywoływanie tego z jednego miejsca
Pytanie migracyjne, które rodzi ta premiera, nie brzmi „czy jest lepiej”, ale „ile kosztuje mnie na tym mój ruch”, a odpowiedź zależy od długości twoich promptów, współczynnika trafień w pamięć podręczną i wybranego ustawienia wysiłku. Aby do tego dojść, trzeba przepuścić własny zestaw promptów przez obie generacje — co jest tanie w przypadku jednego punktu końcowego, a żmudne w przypadku dwóch.
Sam Claude Haiku 5.5 nie znajduje się jeszcze w katalogu OrcaRouter i powiedzenie tego wprost jest bardziej użyteczne niż sugerowanie czegoś przeciwnego. Reszta oferty Anthropic to: Claude Haiku 4.5, Claude Sonnet 5.5 i Claude Opus 5.5 — wszystkie można u nas wywoływać już dziś w cenie katalogowej dostawcy z 0% narzutu przekazywanego dalej, więc odnoga „przed” testu migracyjnego działa na tym samym kluczu, który zachowasz później, a obniżka ceny ze strony dostawcy na tej odnodze obowiązuje u nas tego samego dnia. Odnoga „po” to API Anthropic, dopóki nowy model nie trafi do środowiska uruchomieniowego, które obsługujemy. To, co daje ci w międzyczasie współdzielony punkt końcowy, to automatyczne przełączanie awaryjne działające pod spodem wywołania, dzięki czemu nowy model może obsługiwać ruch produkcyjny, nawet gdy ścieżka nie będzie od niego zależeć, a także DSL routingu na wypadek, gdy eskalacja z Haiku do Sonnet powinna należeć do trasy, a nie do kodu twojej aplikacji.

Dwa wyniki klientów z tej premiery warto zachować jako tropy, a nie dowody. Asana podaje ponad 30% redukcji opóźnienia i nawet 2,5-krotnie szybsze wnioskowanie na turę agenta; HubSpot podaje 92,8% uśrednione z trzech przebiegów w swoim pakiecie CRM; AlphaSense podaje 0,84 wobec 0,76 w przypadku 400 zapytań. To wyselekcjonowane przez dostawcę liczby klientów w ogłoszeniu samego dostawcy, a ich wartość polega na wskazaniu, które obciążenia przetestować najpierw, a nie na mówieniu, co otrzymasz.
Co zmieniłoby obraz sytuacji
Liczba 75% zostanie rozstrzygnięta tak samo, jak rozstrzyga się każdą ważoną ruchem deklarację dostawcy: na podstawie twojej własnej faktury. To, co naprawdę pozostaje otwarte po niezależnej stronie, to koszt na zadanie. Jeśli utrzyma się wraz z napływem kolejnych przebiegów, uczciwym podsumowaniem tego startu będzie to, że Anthropic obniżył cennik o 80% i zbudował model, który zużywa więcej tokenów na odpowiedź, więc rzeczywista oszczędność jest prawdziwa, duża, zależna od obciążenia i rzadko równa liczbie z plakatu. Jeśli spadnie wraz z ustawieniami wysiłku i buforowaniem, ten poziom wypada jeszcze lepiej. Tak czy inaczej, liczbą, którą trzeba sprawdzić przed przejściem, jest twoja własna liczba tokenów na zadanie w nowym tokenizerze — to jedyna wartość, której wpis o premierze nie może ci podać.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
