Wygenerowana karta hero z napisem „Codzienny briefing AI — 8 października 2026”, plakietką AKTUALNOŚCI, nagłówkiem „Claude Haiku 5.5 trafia do sprzedaży, a odczyty z pamięci podręcznej Sonnet 5.5 tanieją o połowę” oraz czterema żetonami o treści: $0,10 / $0,50 za 1 mln, kontekst 1 mln tokenów, domyślny poziom wysiłku: średni i odczyt z pamięci podręcznej z $0,20 na $0,10.
Engineering & Research

Codzienny przegląd AI, 8 października: Claude Haiku 5.5 debiutuje w cenie 0,10 USD, a koszt odczytów z pamięci podręcznej Sonnet 5.5 spada o połowę

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Haiku 5.5 trafił do sprzedaży 7 października 2026 r. i jest najtańszą rzeczą, jaką firma kiedykolwiek udostępniła przez API: 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych w promptach do 100 000 tokenów, z oknem kontekstu 1 mln tokenów i regulatorem wysiłku od Low do Max. Tego samego dnia, bez własnego wpisu o premierze, odczyty z pamięci podręcznej promptów w Claude Sonnet 5.5 spadły z 0,20 USD do 0,10 USD za milion tokenów. Jedno z nich jest produktem, a drugie pozycją w cenniku, i to właśnie ta pozycja przyniesie w tym kwartale więcej pieniędzy.

Najpierw cena, bo to jedyna część, na którą możesz zadziałać już dziś. Potem wysiłek, czyli to, co po cichu decyduje o cenie. A na końcu obniżka za cache, o której połowa osób płacących za Sonnet 5.5 nie dowie się aż do następnej faktury.

Czym jest Claude Haiku 5.5 — w kolejności, która ma znaczenie

Według samego dostawcy jest to „najtańszy, najszybszy i najbardziej wszechstronny mały model, jaki kiedykolwiek wydaliśmy”, a data premiery to 7 października 2026 r. — dzień przed tym briefem. Identyfikator modelu to claude-haiku-5-5. Na wejściu przyjmuje tekst i obrazy, a na wyjściu zwraca tekst. Okno kontekstowe wynosi 1 000 000 tokenów, w porównaniu do 200 000 w Claude Haiku 4.5, a maksymalna długość odpowiedzi to 128 000 tokenów; nagłówek beta w Batch API podnosi ten limit do 300 000. Data odcięcia danych treningowych to czerwiec 2026 r., a Anthropic zobowiązuje się nie wycofywać go przed 7 października 2027 r.

Najważniejszą kwestią dla każdego, kto kieruje ruchem, nie jest okno kontekstowe. Jest nią to, że to pierwszy model klasy Haiku z regulowanym poziomem wysiłku. Poziomy wysiłku to Low, Medium, High, Xhigh i Max, domyślny to Medium, a myślenie adaptacyjne jest domyślnie włączone — funkcja z Sonnet i Opus trafiająca o jeden poziom niżej. Wpis premierowy zawiera też dwie rzeczy związane z kupowaniem, a nie budowaniem: miesięczne kredyty API dla planów Claude Max i Team, 100 USD w Max 5x i 200 USD w Max 20x, z pulą do 500 USD dla Team, oraz wsparcie w wersji beta dla computer-use i browser-use w SDK. Bezpieczeństwo dotrzymuje kroku temu poziomowi: zabezpieczenia cybernetyczne są surowsze niż w Claude Haiku 4.5, żądania testów penetracyjnych są nadal blokowane, a zabezpieczenia biologiczne odpowiadają tym w Claude Sonnet 5, Claude Sonnet 5.5 i Claude Opus 5.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

Cena, a w jej środku klif 100 000 tokenów

Stawka podstawowa wynosi 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych. Zwróć uwagę na gwiazdkę: to stawka dla promptów o długości do 100 000 tokenów. Powyżej 100 000 obie liczby mnoży się przez pięć: 0,50 USD za wejście i 2,50 USD za wyjście. W tanim przedziale zapisy do pamięci podręcznej kosztują 0,125 USD za milion w warstwie pięciominutowej i 0,20 USD w warstwie godzinowej, a odczyty z pamięci podręcznej kosztują 0,01 USD za milion — jedną dziesiątą stawki wejściowej, co jest największym rabatem na pamięć podręczną, jaki Anthropic opublikował dla dowolnego modelu. Tryb wsadowy ponownie zmniejsza wszystko o połowę: 0,05 USD i 0,25 USD w tanim przedziale, 0,25 USD i 1,25 USD powyżej niego.

Porównaj to z Claude Haiku 4.5, który nadal widnieje w cenniku w stałej stawce 1,00 USD za dane wejściowe i 5,00 USD za dane wyjściowe, bez progów zależnych od kontekstu, z odczytem z pamięci podręcznej po 0,10 USD i oknem 200 000 tokenów. Nowy model jest dziesięć razy tańszy przy tym samym kształcie promptu i ma pięciokrotnie większy kontekst. Nie ma tu żadnej kalkulacji migracyjnej do przeprowadzenia; te liczby nie są nawet blisko siebie.

Klif to element, wokół którego trzeba projektować. Prompt o 99 000 tokenów kosztuje 99 centów za tysiąc wywołań przy stawce za dane wejściowe. Prompt o 101 000 tokenów kosztuje 5,05 dolara za tysiąc. Różnica dwóch tysięcy tokenów oznacza pięciokrotnie wyższy rachunek, więc cokolwiek zbudujesz w tanim przedziale, powinno albo z zapasem mieścić się poniżej 100 000 tokenów, albo celowo i konsekwentnie go przekraczać — najgorszym wynikiem jest potok, który balansuje na granicy i za połowę swojego ruchu płaci wysoką stawkę.

Wysiłek jest teraz parametrem cenowym, a ustawienie domyślne nie jest najtańsze

Ponieważ poziom wysiłku domyślnie ma wartość Medium, a myślenie jest domyślnie włączone, cena katalogowa i rzeczywista cena to nie ta sama liczba. Tokeny rozumowania są rozliczane jako tokeny wyjściowe. W opublikowanym przez Anthropic własnym przebiegu Artificial Analysis Intelligence Index — raportowanym przez dostawcę, nieodtworzonym przez nas — Claude Haiku 5.5 emituje około 162 000 tokenów na zadanie, z czego około 129 000 to tokeny rozumowania. Mediana modeli w tym indeksie emituje rzędu 100 milionów tokenów w całym zestawie; Haiku 5.5 zużywa 440 milionów. Przy 0,50 USD za milion tokenów wyjściowych na taką gadatliwość można sobie pozwolić i właśnie o to chodzi: przy stawce Haiku 5.5 dużo myślenia wciąż jest tańsze niż trochę myślenia w modelu, który pobiera 5,00 USD za wyjście.

Ustaw wysiłek na Low w przypadku klasyfikacji, ekstrakcji i decyzji o routingu, gdy chcesz szybkiej odpowiedzi, a nie przemyślanej, a dla wszystkiego, co przeczyta użytkownik, pozostaw go na Medium. Zejście do Low to również niezawodny sposób, aby utrzymać gadatliwego agenta w przedziale 100 000 tokenów, ponieważ najpierw zmniejsza liczbę tokenów rozumowania, a dopiero potem obniża jakość odpowiedzi.

Cichsza linia: liczba odczytów z pamięci podręcznej Sonnet 5.5 zmniejszona o połowę

Claude Sonnet 5.5 odczytuje zbuforowany prompt po 0,10 USD za milion tokenów od 7 października, wobec 0,20 USD. Cena wejściowa Sonnet 5.5 wynosi 2,00 USD, a wyjściowa 10,00 USD, więc mnożnik odczytu z pamięci podręcznej wynoszący 0,05x jest teraz takim samym mnożnikiem, jaki ma Haiku 5.5, zastosowanym do dwudziestokrotnie większej stawki wejściowej. Według własnych szacunków Anthropic pozwala to obniżyć koszt większości prac agentowych o około 20%, co jest twierdzeniem o kształcie obciążenia, a nie benchmarkiem: obowiązuje tylko wtedy, gdy duża część twoich danych wejściowych to stabilny prefiks, który wysyłasz ponownie w każdej turze. Jeśli twoje prompty są unikalne przy każdym wywołaniu, ta zmiana nic cię nie kosztuje i nic ci nie oszczędza.

Warto zauważyć, co implikuje ta obniżka. Anthropic agresywnie wycenia długotrwałe prefiksy w modelu średniej klasy dokładnie w momencie, gdy wprowadza bardzo tani mały model, co można odczytać jako argument za architekturą dwumodelową: odnoga Sonnet 5.5 z gorącym cachem dla pracy wymagającej osądu oraz odnoga Haiku 5.5 dla wolumenu, który go nie wymaga.

Co pokazują niezależne dane po jednym dniu

Artificial Analysis oceniło Claude Haiku 5.5 dzień po premierze. Jego Intelligence Index wynosi ogółem 43, a konfiguracja Max-effort została raportowana na 43,40, co daje drugie miejsce wśród 182 modeli w zestawieniu. Koszt na zadanie indeksowe to 0,21 USD — 46. najniższy. Cena mieszana przy proporcji wejście:wejście z pamięci podręcznej:wyjście wynoszącej 7:2:1 to 0,08 USD za milion, i to właśnie ta liczba sprawia, że wcześniejsze porównanie poziomów wydaje się niesprawiedliwe wobec wszystkiego innego. Szybkość generowania to 243,4 tokena na sekundę — dziewiąta najszybsza w zestawieniu — z raportowanym opóźnieniem pierwszego tokena na poziomie około 0,3 sekundy oraz 90-procentowym rabatem na pamięć podręczną.

Ta liczba 440 milionów tokenów na wyjściu to zastrzeżenie dołączone do 43. Wynik jest prawdziwy i uzyskany niezależnie; podobnie jest z rozwlekłością. Model, który myśli tak dużo, jest tani w przeliczeniu na token, ale nie zawsze tani w przeliczeniu na zadanie, a różnica między tymi dwiema liczbami to miejsce, w którym tak naprawdę zapada decyzja o routingu.

Dla zobrazowania skali: opublikowane przez sam Anthropic porównania umieszczają Claude Haiku 5.5 na poziomie 1620 w GDPval-AA v2.1 wobec 735 dla Claude Haiku 4.5, 72,4% w OSWorld 2.1 wobec 15,7%, 45,9% w Humanity's Last Exam bez narzędzi wobec 10,2% oraz 39,2% w Terminal-Bench 4.0 wobec 0,0%. To dane raportowane przez dostawcę na podstawie wybranych przez dostawcę ewaluacji i należy je traktować jako orientacyjne, ale kierunek nie jest subtelny — to nie jest drobne ulepszenie małego modelu.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

Dostęp do tych modeli bez drugiej umowy

Claude Haiku 5.5 jest dostępny przez własne API Anthropic, a stamtąd — wszędzie tam, gdzie modele Anthropic są odsprzedawane. W katalogu OrcaRouter linia Anthropic obejmuje dziś anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 i anthropic/claude-fable-5.1 — nie hostujemy Claude Haiku 5.5 i ten tekst nie będzie udawał inaczej. To, co oferujemy, to poziom wyżej, a OrcaRouter przekazuje cenę katalogową dostawcy dalej z 0% marży, dlatego właśnie obniżka ceny odczytu z pamięci podręcznej Sonnet 5.5 pojawiła się w naszym cenniku tego samego dnia, w którym wprowadziła ją Anthropic, a nie w zaplanowanym cyklu zmiany cennika.

Wersja praktyczna: jeśli chcesz wypróbować Haiku 5.5 w odnodze klasyfikacji, podczas gdy twoja odnoga oceny pozostaje na Claude Sonnet 5.5, trzymasz dwa klucze zamiast jednego, a warstwa routingu jest tym miejscem, w którym rozstrzyga się A/B. To cały argument za bramą zamiast bezpośredniej integracji — jeden endpoint, ciągi modeli i ścieżka przełączenia awaryjnego, gdy dostawca szwankuje.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

Co obserwować dalej

Trzy rzeczy. Czy zewnętrzni dostawcy zaczną odsprzedawać Haiku 5.5 po mieszanej stawce poniżej 0,10 USD, czyli w punkcie, w którym warstwa routingu zaczyna na siebie zarabiać, a nie tylko upraszczać zaopatrzenie. Czy Anthropic przesunie granicę progu 100 000 tokenów, skoro klif dokładnie przy 100 000 to dziwne miejsce, żeby model z oknem 1 mln tokenów miał właśnie tam próg. I czy liczba 440 milionów tokenów określająca gadatliwość spadnie w wydaniu punktowym, ponieważ ta jedna liczba stoi między Haiku 5.5 a tym, by był oczywistym domyślnym wyborem dla całej dolnej połowy stosu produkcyjnego.