
Prawdziwa historia Claude Haiku 5.5 to klif 100K: ile nowy Haiku pobiera powyżej 100 000 tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Claude Haiku 5.5 zadebiutował 7 października 2026 r. z ceną podaną w nagłówkach wynoszącą 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych, a liczbą, którą powtarzano wszędzie, była ta, którą sama Anthropic umieściła w ogłoszeniu: obniżka o 90 procent w stosunku do stawek Haiku 4.5 za te same dwie pozycje rozliczeniowe. Te 90 procent jest prawdziwe. Jest też ograniczone do połowy jednego wymiaru rachunku, a gdy tylko żądanie przekroczy 100 000 tokenów, każda stawka z nim związana zaczyna robić coś, co relacje z premiery w większości pominęły. Ten tekst dotyczy właśnie tej granicy — ile kosztuje, jakie obciążenia faktycznie ją przekraczają i dlaczego „90 procent taniej” to twierdzenie o wycinku rachunku, a nie o Twoim rachunku.
Dwie ceny i punkt, w którym się zmieniają
Anthropic publikuje dla modelu dwie kolumny, a przełączenie między nimi to pojedynczy próg oparty na rozmiarze żądania, a nie na jakimkolwiek ustawieniu modelu, które wybierzesz:
• Krótki poziom, na poziomie 100 000 tokenów lub poniżej — 0,10 USD za milion tokenów wejściowych, 0,50 USD za milion tokenów wyjściowych (lista Anthropic) • Długi poziom, powyżej 100 000 tokenów — 0,50 USD za milion tokenów wejściowych, 2,50 USD za milion tokenów wyjściowych (lista Anthropic) • Odczyty z pamięci podręcznej — 0,01 USD za milion (krótki poziom) i 0,05 USD za milion (długi poziom) • Batch API — 50 procent zniżki w obu kolumnach i maksymalna długość wyjścia wynosząca 300 000 tokenów • Standardowa maksymalna długość wyjścia — 128 000 tokenów, z oknem kontekstu o rozmiarze 1 miliona tokenów w obu poziomach

To są własne, opublikowane stawki Anthropic, a nie zmierzone, i stanowią obecny cennik: ceny tak nowego modelu nie miały czasu się zmienić, choć Anthropic nie ma żadnego zobowiązania, by je utrzymywać.
Przeczytaj te cztery liczby po kolei, a kształt tej rzeczy staje się oczywisty. Każda stawka w warstwie długiego kontekstu jest dokładnie pięć razy wyższa od stawki dla krótkiego kontekstu, a próg wynosi te same 100 000 tokenów dla wszystkich naraz. Nie ma tu łagodnej krzywej, żadnej interpolacji, żadnego pasa pośredniego — żądanie o długości 99 000 tokenów i żądanie o długości 101 000 tokenów różnią się pięciokrotnie w przypadku każdego tokenu na rachunku, nie tylko tych 2 000 tokenów, które przekroczyły granicę. To właśnie sprawia, że jest to raczej klif niż zbocze, i tego właśnie nie widzi narracja o „90 procentach taniej”.

Dlaczego skaleczenie wygląda na większe, niż jest
W dokonanym przez Anthropic porównaniu z Haiku 4.5 krótszy próg to prawdziwa redukcja o 90 procent zarówno na wejściu, jak i na wyjściu — Haiku 4.5 kosztował 1,00 USD i 5,00 USD za milion dla tych samych dwóch kolumn. Dłuższy próg to inna historia: 0,50 USD i 2,50 USD wobec tych samych 1,00 USD i 5,00 USD to obniżka o 50 procent, a nie o 90 procent. Uczciwa wersja twierdzenia z premiery jest więc taka, że Claude Haiku 5.5 jest o 90 procent tańszy niż Haiku 4.5 poniżej 100 000 tokenów i o 50 procent tańszy powyżej tej liczby, co dokładnie odpowiada podziałowi podanemu we własnej dokumentacji Anthropic, gdy przeczyta się obie kolumny, a nie jedną. Ta pojedyncza wartość procentowa nie jest błędna; to wartość procentowa dla krótszego progu, przedstawiona bez swojego warunku.
Jest jeszcze druga rzecz ciągnąca w przeciwnym kierunku, i jest ona ciekawsza, bo łatwo ją przeoczyć, a trudno obejść. Claude Haiku 5.5 jest wyposażony w nowy tokenizer, a własne wytyczne Anthropic podają liczbę tokenów dla danego fragmentu tekstu jako około 30 procent wyższą niż ta, którą Haiku 4.5 generował dla tej samej treści. To, ile płacono za token, spadło, a to, ile płaci się za token *twojego* tekstu, wzrosło o około jedną trzecią względem rozliczeń starego modelu. Podany przez Anthropic wynik netto — że model jest średnio około 75 procent tańszy w eksploatacji — już to uwzględnia — obniżka ceny katalogowej o 90 procent minus około 30-procentowa inflacja tokenów daje mniej więcej taki wynik przy ruchu z krótkim kontekstem — ale te dwa efekty można rozdzielić i warto je rozdzielić. Zmiana ceny to zmiana ceny katalogowej, którą można odczytać ze strony; zmiana tokenizera zmienia to, ile jednostek tej ceny pochłaniają twoje istniejące prompty, i ujawnia się w twoich własnych liczbach tokenów, zanim ujawni się gdziekolwiek indziej.
W przypadku obciążenia, które już z zapasem mieściło się poniżej 100 000 tokenów na wywołanie, praktyczny efekt to proste obniżenie kosztu na wywołanie, częściowo kompensowane przez tokenizer. W przypadku takiego, które tego nie robiło, arytmetyka działa odwrotnie podwójnie w długiej połowie.
Co tak naprawdę znajduje się powyżej 100 000 tokenów?
Odruchem jest zaklasyfikowanie cen długiego kontekstu pod „agentowe kodowanie i RAG, nie my”. To zbyt pochopne, ponieważ granica 100 000 tokenów dotyczy pojedynczego żądania, a rozmiar pojedynczego żądania to nie to samo co rozmiar zadania. Kilka wzorców regularnie ją przekracza:
• Agent czytający bazę kodu, który przez całą sesję utrzymuje duży zbiór roboczy w kontekście, zamiast pobierać go ponownie na każdym kroku
• Analiza dokumentów i umów, w której dane wejściowe to długi PDF wraz z własnymi instrukcjami i przykładami few-shot — rodzaj promptu, który miał 60 000 tokenów, zanim ktokolwiek dodał przykłady
• Potoki wczytywania danych, które grupują wiele małych elementów w jedno wywołanie, aby zamortyzować narzut przypadający na wywołanie, i przez to przenoszą całą partię powyżej progu
• Produkty czatowe, które przechowują pełną historię rozmowy w treści zapytania, zamiast ją podsumowywać, przez co żądanie rośnie monotonicznie, aż coś je obetnie
• Wejścia w stylu transkrypcji audio i długich wideo, czyli dokładnie ten ruch, którego obsługę ma umożliwiać okno o rozmiarze 1 miliona tokenów
Okno kontekstowe o rozmiarze 1 miliona tokenów to ta część karty specyfikacji, która sprawia, że o tym skoku warto rozmawiać. Anthropic sprzedaje możliwość przekazania modelowi bardzo dużego żądania, a cennik jest skonstruowany tak, że ostatnie 900 000 tokenów tego żądania kosztują pięć razy więcej niż pierwsze 100 000. Oba te fakty są zamierzone; są po prostu ogłaszane w różnych miejscach. Jeśli okno długiego kontekstu jest powodem, dla którego w ogóle patrzysz na ten model, kolumna długiego kontekstu jest twoją kolumną, a procent z premiery należy do kogoś innego.
Presja, jaką cena wywiera na poziom Flash
Deklarowanym zamiarem Anthropic stojącym za modelem jest utrzymanie taniej, wysokoprzepustowej części stosu, a cennik wyraźnie odzwierciedla ten zamiar. Relacje Bloomberga na temat premiery przedstawiały to jako sytuację, w której Anthropic broni swojej pozycji w segmencie niższych kosztów przed tańszymi konkurentami oferującymi modele o otwartych wagach, a narracja po stronie dostawcy poszła dalej — że nowy Haiku został wyceniony tak, by znacząco podciąć bezpośrednich rywali.
Porównanie jest klarowne tylko w przypadku krótkiego progu cenowego, gdzie 0,10 USD i 0,50 USD to agresywnie niskie stawki. Powyżej 100 000 tokenów stawki 0,50 USD i 2,50 USD nie są już tańsze od niczyjego krótkiego progu cenowego; to zwykłe stawki średniego poziomu. Twierdzenie dostawcy o „szerokim marginesie” odnosi się do pierwszej kolumny cennika stawek, a Anthropic ma prawo je tam formułować — to trafny odczyt publikowanych przez siebie liczb. Nie jest to twierdzenie o tym, ile płaci się w przypadku obciążenia o długim kontekście, i nie należy go cytować jako takiego.
Reszta modelu, w skrócie
Claude Haiku 5.5 zachowuje funkcje, które trafiły do linii Sonnet i Opus, zamiast okrajać je na potrzeby tej klasy rozmiarowej. Obecne jest adaptacyjne myślenie z domyślnym ustawieniem wysiłku na poziomie średnim, a to pierwszy model w klasie Haiku z regulowanym pokrętłem wysiłku obejmującym zakres od Low do Max. Granica wiedzy to czerwiec 2026, a identyfikator modelu to claude-haiku-5-5. Anthropic podaje datę wycofania nie wcześniej niż 7 października 2027 r. — tę samą datę co premiera, rok później — a model figuruje w ofercie Amazon Bedrock, Google Cloud i Microsoft Azure obok własnego API Anthropic.

Jeśli chodzi o benchmarki, wszystko w poście premierowym ma tę samą etykietę pochodzenia i słusznie: to liczby raportowane przez dostawcę, zmierzone przez firmę sprzedającą model, bez niezależnego odtworzenia opublikowanego w chwili pisania.
• GDPval-AA v2.1 — zgłoszony przez dostawcę wynik 1 620 dla Claude Haiku 5.5, w porównaniu z 735 dla Haiku 4.5 w tym samym środowisku testowym
• AA-Briefcase v1.1 — 1 578 według producenta, wobec 614 w poprzedniej generacji
• OSWorld 2.1 — 72,4 procent według dostawcy, wobec 15,7 procent
• Terminal-Bench 4.0 — zgłoszone przez producenta 39,2, wobec 0,0
• Humanity's Last Exam — 45,9 procent według dostawcy lub 57,4 przy użyciu narzędzi
Wielkość tych różnic jest powodem, by je sygnalizować, a nie cytować. Skok z 15,7 do 72,4 w benchmarku agenta OS mierzonym przez samego dostawcę modelu to liczba, którą należy traktować z rezerwą, dopóki strona trzecia nie uruchomi tego samego zestawu testowego. Artificial Analysis opublikowało własny indeks dla tego modelu na początku października 2026 r. — niezależny wynik 43,395, z 0,329 w Terminal-Bench Hard i 0,444 w HLE — i to właśnie ten zestaw należy cytować, gdy twierdzenie ma przetrwać podważenie. Liczby dostawcy i liczby niezależne nie są ze sobą sprzeczne; to po prostu różne zestawy testowe, a mieszanie ich w jednym zdaniu sprawia, że wpis na blogu kończy się twierdzeniem, że ewaluacja dostawcy jest faktem.
Notatka o infrastrukturze, skoro prowadzimy jedną
Anthropic sprzedaje Claude Haiku 5.5 przez własne API oraz przez Bedrock, Google Cloud i Azure. Jeśli zastanawiasz się, które z nich wywołać, albo dodajesz go obok innych modeli, które już masz w swoim stacku, pamiętaj, że cena katalogowa dostawcy jest taka sama niezależnie od tego, gdzie jest sprzedawany, a OrcaRouter jest zbudowany tak, by przekazywać tę cenę katalogową bez żadnej marży — dzięki temu zmiana ceny Anthropic dla tego modelu jest u nas widoczna tego samego dnia, a nie z opóźnieniem. W naszym katalogu znajdują się też qwen/qwen3.8-flash w cenie 0,15 i 0,47 USD za milion oraz z-ai/glm-5.3-flash w cenie 0,15 i 0,50 USD — para, która najczęściej trafia na miejsce obok modelu klasy Haiku, na tym samym kluczu i tym samym rachunku — co sprawia, że mieszany stack kosztuje jedną umowę zamiast trzech. Samego Claude Haiku 5.5 nie udostępniamy; w tym celu zwróć się bezpośrednio do Anthropic.
Jeden praktyczny wniosek z tego klifu, jeśli kierujesz ruch do więcej niż jednego modelu: granica 100 000 tokenów to miejsce, w którym żądanie, które kiedyś było tanie, staje się drogie, choć nic w tym żądaniu nie zmienia się w istotny sposób. Jeśli Twoja warstwa routingu potrafi przełączać się awaryjnie, rozsądnym rozwiązaniem jest kierować ruch z długim kontekstem do tego modelu, który faktycznie jest tani powyżej tego progu, a ruch z krótkim kontekstem pozostawiać temu, który jest tani poniżej niego, zamiast zakładać, że publikowana stawka jednego modelu dotyczy obu przypadków.
Co wyciągnąć z premiery
Obniżka ceny jest prawdziwa i duża — poniżej 100 000 tokenów. Ten model to pierwszy Haiku z kompletnym zestawem funkcji w wersji produkcyjnej i pokrętłem wysiłku, co w zastosowaniach agentowych liczy się bardziej niż cena. Różnice w wynikach benchmarków są raportowane przez dostawcę i za każdym razem, gdy się je powtarza, należy je tak oznaczać. A cennik zawiera próg przy 100 000 tokenów, który naraz mnoży każdą stawkę przez pięć — i to jest ta jedna rzecz związana z tą premierą, którą odbiorca waszego stacku, a nie czytelnik komunikatu prasowego, najbardziej musi wiedzieć, zanim zostanie ustalony budżet tokenowy kolejnego sprintu.
Jeśli chcesz sprawdzić tę arytmetykę na podstawie własnego ruchu, dwie liczby, które należy wyciągnąć, to 95. percentyl rozmiaru Twoich żądań oraz Twój udział w wydatkach na żądania powyżej 100 000 tokenów. Jeśli pierwsza jest poniżej progu, obowiązuje Cię 90 procent, a relacja z premiery trafnie opisywała Twoją sytuację. Jeśli druga stanowi znaczącą część rachunku, liczbą, która się liczy, jest 50, i warto ponownie przeliczyć szacunek kosztów dla tego modelu w stosie, który wybrałeś, przy założeniu 90.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
