Wygenerowana karta hero dla „Taniej za token, drożej za odpowiedź”, z plakietką „KOSZT NA ODPOWIEDŹ”, nadtytułem „DWIE TANIE WARSTWY, JEDNA WSPÓLNA TABLICA” i podtytułem „Claude Haiku 5.5 z wynikiem 43,40 przeciwko Gemini 3.5 Flash-Lite z wynikiem 22,2 w Intelligence Index v4.3.2”. Na czterech żetonach widnieją napisy „43,40 vs 22,2”, „$0,21 vs $0,12”, „$0,10 vs $0,30” i „$0,50 vs $2,50”. Dwie karty poniżej są oznaczone „PRZEWAGA ANTHROPIC” („o dwadzieścia jeden punktów wyżej na wspólnej tablicy i taniej w obu miernikach”) oraz „PRZEWAGA GOOGLE” („taniej w przypadku ukończonego zadania i przyjmuje wideo oraz audio”). Stopka głosi: „Niezależne wyniki i koszt na zadanie od Artificial Analysis; ceny katalogowe odczytane 8 października 2026 r.” Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite: Taniej za token, drożej za odpowiedź

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Haiku 5.5 kosztuje 0,10 USD za milion tokenów wejściowych i 0,50 USD za milion tokenów wyjściowych. Gemini 3.5 Flash-Lite kosztuje 0,30 USD i 2,50 USD według tych samych dwóch taryf. Model Anthropic to jedna trzecia ceny na wejściu i jedna piąta ceny na wyjściu, a w Artificial Analysis Intelligence Index v4.3.2 uzyskuje 43,40 wobec 22,2 — przewaga ponad dwudziestu punktów w dziedzinie, w której dziesięć punktów to skok o generację. Jeśli chodzi o cennik, nie jest to wyrównane porównanie, a jeśli chodzi o możliwości — również nie jest to wyrównane porównanie.

Na fakturze to wyrównane porównanie, ale wypada odwrotnie. Umieść oba modele w tym samym niezależnym rankingu i rozliczaj każdy z nich za ukończone zadanie, a nie za token, a Gemini 3.5 Flash-Lite wychodzi taniej na odpowiedź. Artificial Analysis podaje dla Claude Haiku 5.5 kwotę 0,21 USD za zadanie Intelligence Index, a dla Gemini 3.5 Flash-Lite 0,1235 USD — przewaga 1,7 do jednego na korzyść modelu, który płaci pięć razy więcej za każdy emitowany token.

Ta inwersja to cały sens tego porównania. Claude Haiku 5.5 zastępuje najtańszy poziom, jaki Ant​hropic kiedykolwiek wydała, i bije wszystko w pobliżu na wspólnej tablicy wyników. Gemini 3.5 Flash-Lite został wydany 21 lipca 2026 r. i od lata jest najkorzystniejszym wyborem w tym przedziale. Pytanie, które kupujący faktycznie ma, nie brzmi, który z nich jest lepszy, bo odpowiedź na to już zapadła. Brzmi ono: który z nich postawić przed żądaniem, które musi zostać zrealizowane tanio.

Wszystkie poniższe wartości podano w przeliczeniu na milion tokenów w dolarach amerykańskich. Ceny katalogowe to stawki publikowane przez samych dostawców. Niezależne wyniki, wartości kosztu na zadanie i pomiary szybkości przypisywane Artificial Analysis należą do tego ewaluatora. Wartości opóźnień dla Gemini 3.5 Flash-Lite pochodzą z naszego własnego, mierzonego ruchu. Jeżeli jakaś liczba pochodzi z prowadzonego przez nas rejestru modeli, a nie została odczytana w danym dniu ze strony ewaluatora, za źródło uznajemy tego ewaluatora, a nie siebie.

Naklejka i faktura nie zgadzają się.

Luka w koszcie na zadanie nie wynika z cennika, a powód, dla którego istnieje, warto poznać, zanim którykolwiek z modeli zbliży się do produkcji.

Claude Haiku 5.5 jest rozwlekły, a ewaluator mówi to wprost. Uruchamiając Intelligence Index, Artificial Analysis odnotowało 440 milionów tokenów wyjściowych z modelu w porównaniu ze medianą 100 milionów dla wszystkich modeli i oznaczyło go jako bardzo rozwlekły. Myślenie jest rozliczane jako dane wyjściowe, myślenie jest domyślnie włączone, a suwak wysiłku startuje na poziomie średnim, a niska stawka za dane wejściowe nie pomaga w obciążeniu, którego rachunek w większości dotyczy danych wyjściowych.

Gemini 3.5 Flash-Lite też nie jest zwięzły, ale jest wymiernie tańszy w przeliczeniu na zadanie. Ten sam ranking odnotowuje dla niego 17 507 tokenów wyjściowych na ukończone zadanie indeksowania — 10 405 z nich to rozumowanie, a 7 102 to odpowiedź. Zestaw to z wolumenem tokenów modelu Ant​hropic, a arytmetyka się zgadza: pięciokrotna przewaga w stawce za tokeny wyjściowe jest częściowo pochłaniana przez model, który generuje większą odpowiedź, a na poziomie zadania pozostaje niewielka wada, a nie duża przewaga.

Jest jeszcze drugi, cichszy efekt działający w ten sam sposób. Dokumentacja Anthropic mówi, że Claude Haiku 5.5 używa tokenizera współdzielonego z Claude 4.7 i późniejszymi, więc ten sam tekst liczy się jako około 30% więcej tokenów niż w modelu, który ten zastępuje. Stawka spadła trzykrotnie w porównaniu z poziomem Google. Liczba tokenów nie spadła, a dla tego samego tekstu wzrosła.

Oba modele, jeśli chodzi o liczby, które mają znaczenie

Zbuforowane stawki i ceny katalogowe z własnej dokumentacji Anthropic i Google; niezależne dane przypisywane Artificial Analysis; opóźnienie na żywo z naszego własnego siedmiodniowego okna ruchu. Zbuforowane 2026-10-08.

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• Wejście — Claude Haiku 5.5: 0,10 USD do 100 000 tokenów i 0,50 USD powyżej; Gemini 3.5 Flash-Lite: 0,30 USD jednolicie w oknie 1 048 576 tokenów.

• Wynik — Claude Haiku 5.5: 0,50 USD do 100 000 tokenów i 2,50 USD powyżej; Gemini 3.5 Flash-Lite: 2,50 USD (stawka stała).

Dane wejściowe z pamięci podręcznej — Claude Haiku 5.5: 0,01 USD do 100 000 tokenów, a powyżej 0,05 USD; Gemini 3.5 Flash-Lite: 0,03 USD. Zapisy do pamięci podręcznej kosztują 0,125 USD i 0,625 USD za milion tokenów w przypadku Claude Haiku 5.5.

• Kontekst i dane wyjściowe — milion tokenów dla każdego. Maksymalna wielkość danych wyjściowych to 128 000 tokenów dla Claude Haiku 5.5 wobec 65 536 dla Gemini 3.5 Flash-Lite, więc górna granica Ant​hropic jest około dwukrotnie wyższa.

• Modalność wejściowa — tekst i obrazy dla Claude Haiku 5.5; tekst, obrazy, wideo, audio i pliki dla Gemini 3.5 Flash-Lite. Oba zwracają tekst.

• Niezależny wynik — 43,40 dla Claude Haiku 5.5 (Max), drugie miejsce wśród 182 modeli w Intelligence Index v4.3.2, wobec 22,2 dla Gemini 3.5 Flash-Lite, dziewięćdziesiąte szóste miejsce na 147 i trzydziesty czwarty percentyl tego rankingu.

• Niezależny koszt zadania — 0,21 USD wobec 0,1235 USD na tej samej tablicy.

• Przepustowość — 241,9 tokena wyjściowego na sekundę zmierzone dla Claude Haiku 5.5 przez Artificial Analysis, w porównaniu z 280,0 dla Gemini 3.5 Flash-Lite zmierzonymi na naszym własnym playgroundzie w ciągu ostatnich siedmiu dni. To dwa różne harnessy, nie jeden, więc należy je odczytywać jako rząd wielkości, a nie jako wyścig.

Dwadzieścia jeden punktów i z czego są zrobione

Dwudziestojednopunktowa luka w indeksie sięgającym sześćdziesiątek to nie margines. To różnica między modelem, który potrafi utrzymać pętlę agentową, a modelem, któremu należy przekazać jedno dobrze sprecyzowane wywołanie.

Obaj dostawcy nie mierzą nawzajem swoich harnessów, więc ich własne zestawy testów nie mogą zostać ze sobą zestawione. Ant​hropic publikuje wyniki GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 i FrontierCode dla Claude Haiku 5.5; Goo​gle publikuje własny zestaw dla poziomu Flash-Lite; żaden z nich nie uruchomił zestawu drugiego. Jedynym dostępnym porównaniem jabłko do jabłka jest niezależny ranking, a tam model Ant​hropic ma przewagę, która nie jest mała.

Wyniki cząstkowe przyznane przez ewaluatora dla Gemini 3.5 Flash-Lite utrwalają obraz tego poziomu. Model osiąga 83,8% w GPQA Diamond i 54,2% w SWE-Bench Pro, 54% w Terminal-bench 2.1, 41,3% w SciCode i 39,2% w MLE-Bench, a do tego 18,8% w Humanity's Last Exam. To liczby kompetentnego, taniego poziomu ogólnego przeznaczenia — mocnego w pytaniach wiedzowych, ale wyraźnie pozostającego w tyle w najtrudniejszych ewaluacjach rozumowania i badań. Claude Haiku 5.5 z wynikiem 43,40 w zestawieniu złożonym plasuje się w zupełnie innym przedziale, a praktyczny wniosek jest taki, że praca wymagająca wieloetapowego planowania w długim horyzoncie wcale nie jest zadaniem dla poziomu Google.

Milion tokenów okna, a 65 536 odpowiedzi

Oba okna kontekstu mają ten sam rozmiar i nie są tym samym produktem.

Długi kontekst w Gemini 3.5 Flash-Lite pogarsza się wraz z odległością w sposób, który warto wycenić, zanim obdarzy się go zaufaniem. W GDM-MRCR v2, ewaluacji wyszukiwania z ośmioma igłami, osiąga średnio 72,2%, gdy igły mieszczą się w 128 000 tokenów, oraz 21,3% w wariancie punktowym na milion tokenów. Jego wynik Long-Context Recall wynosi 76%, a CharXiv Reasoning osiąga 74,5% bez narzędzi i 76,5% z nimi. Okno miliona tokenów to realna zdolność; niezawodne odzyskiwanie informacji z jego dalekiego końca to mniejsza zdolność, a dwie powyższe liczby to odległość między nimi. Okno modelu Claude nie zostało zmierzone w ten sam sposób na tej samej tablicy wyników, więc nie ma dla niego równoważnego wyniku, a ten artykuł go nie wymyśli.

Górne limity wyjściowe to ta bardziej bezpośrednio użyteczna różnica. Claude Haiku 5.5 wygeneruje 128 000 tokenów w jednej odpowiedzi; Gemini 3.5 Flash-Lite zatrzymuje się na 65 536. Jeśli artefaktem, który chcesz otrzymać z powrotem, jest długi plik, pełna migracja, wygenerowany zestaw testów lub przepisanie w skali transkryptu, jeden z tych dwóch modeli może go wytworzyć w jednym wywołaniu, a drugi nie — a zadanie podzielone na dwa wywołania kosztuje ponad dwa razy więcej niż jedno wywołanie, ponieważ wspólny prefiks jest wysyłany dwukrotnie.

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

Audio i wideo to nie kwestia ceny

Gemini 3.5 Flash-Lite przyjmuje wideo, audio i pliki w tej samej stawce co tekst. Claude Haiku 5.5 przyjmuje tekst i obrazy.

Dla potoku, który przyjmuje nagrane rozmowy, zrzuty ekranu lub nagrania z monitoringu, różnica w możliwościach, która ma znaczenie, to nie dwadzieścia jeden punktów indeksu. Chodzi o to, że jeden z tych modeli przyjmuje dane wejściowe bezpośrednio, a drugi wymaga przed sobą etapu transkrypcji lub ekstrakcji klatek — drugi model, drugi rachunek i nowy tryb awarii między źródłem a odpowiedzią. Zespoły w takiej sytuacji nie wybierają między dwoma tanimi poziomami. Wybierają między jednym modelem a potokiem.

Odwrotna sytuacja dotyczy obrazów i dokumentów. Oba modele odczytują obrazy natywnie, a Claude Haiku 5.5 osiąga w tym 43,40 w zestawieniu zbiorczym, więc zadanie ekstrakcji obrazów stron lub rozumienia diagramów, w którym nie ma audio, należy przypisać do strony Ant​hropic na podstawie liczb, a nie argumentu o modalności.

Uruchamianie jednego z tych dwóch stąd

Gemini 3.5 Flash-Lite znajduje się w katalogu OrcaRouter w cenie katalogowej Google z 0% marży, co oznacza, że stawka dostawcy jest przekazywana bezpośrednio, a nie uśredniana, a zmiana w cenniku Google trafia na Twoją fakturę w dniu, w którym trafia do nich. To jeden klucz i jedno SDK dla poziomu Google obok Claude Sonnet 5.5 i Claude Opus 5.5, które również znajdują się w katalogu — więc test A/B między odcinkiem Google Flash-Lite a odcinkiem Anthropic jest już konfiguracją, a nie projektem integracyjnym. Automatyczne przełączanie awaryjne działa pod spodem, dzięki czemu żaden z odcinków nie jest pojedynczym punktem awarii, a DSL routingu pozwoli wyrazić eskalację w trasie, jeśli to tam należy umieścić tę logikę.

Profil opóźnień tego odcinka opiera się na naszym własnym pomiarze, a nie na pomiarze dostawcy. W ciągu ostatnich siedmiu dni ruchu na żywo Gemini 3.5 Flash-Lite utrzymywał p50 na poziomie 2 426 milisekund i p95 na poziomie 8 600 milisekund przy 280 tokenach wyjściowych na sekundę, ze współczynnikiem błędów 0,313%. Traktuj to jako okno kroczące, a nie obietnicę: zmienia się wraz ze zmianami ruchu i warunków u dostawcy, a liczbą, której można zaufać w przypadku danego potoku, jest ta, którą samodzielnie zmierzysz po tygodniu.

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 nie znajduje się w katalogu. Został wydany 7 października 2026 r. — dzień przed powstaniem tego tekstu — a dziś nie można kierować do niego ruchu z naszej strony, więc strona Anthropic w tym porównaniu jest obecnie osiągalna tylko u Anthropic. Powiedzenie tego wprost jest lepsze niż pozostawienie tego w domyśle. Luka między wydaniem modelu a możliwością wywołania go przez nas jest normalna, nie jest obietnicą co do tego, kiedy się zamknie, a czytelnik planujący migrację powinien planować według kalendarza, który widzi, a nie tego, który wolałby.

Który z nich i dla kogo

Jeśli praca polega na tekście na wejściu i tekście na wyjściu, jeśli prompty mieszczą się poniżej 100 000 tokenów, a zadanie wymaga wieloetapowego planowania lub agentów o długim horyzoncie działania, Claude Haiku 5.5 jest silniejszym modelem o dwadzieścia jeden punktów i tańszym w przeliczeniu na token od trzech do pięciu razy. Planuj budżet według kosztu na zadanie, a nie według cennika, spodziewaj się około $0.21 za rodzaj zadania, który mierzy niezależny panel, i ponownie przelicz swoje prompty, zanim cokolwiek prognozujesz, ponieważ sama zmiana tokenizera przesuwa ten wynik o około trzydzieści procent.

Jeśli praca jest krótka, masowa i ma kształt odpowiedzi — tag, kategoria, ekstrakcja, decyzja dotycząca zabezpieczeń — to arytmetyka przemawia za Gemini 3.5 Flash-Lite i robi to z bardzo przyziemnego powodu. Rachunek za wywołanie, które generuje bardzo mało, zdominowany jest przez dane wejściowe; dwie stawki za dane wejściowe to 0,30 USD wobec 0,10 USD, a znacznie mniejszy ślad zadania modelu Google sprawia, że tańsza stawka wygrywa gotowe zadanie, mimo że przegrywa na metce. Dodaj wejście wideo, audio lub plik, a wybór przestaje w ogóle dotyczyć ceny.

To, co to zestawienie faktycznie rozstrzyga, jest węższe niż „nowy Haiku jest tani". Rozstrzyga mianowicie, że stawka z nagłówka w tanim planie słabo podpowiada, ile ten plan cię kosztuje, oraz że model, który na stronie z cennikiem wygląda na trzykrotnie droższy, może przysłać ci niższy rachunek. Niezależnie od tego, co wybierzesz, mierz tokeny, które generujesz, a nie te, które wysyłasz, bo w przypadku obu tych modeli to na tym liczniku rachunek jest naprawdę oparty.