Wygenerowana karta hero zatytułowana „Claude Haiku 5.5 vs Gemini 3.6 Flash” z nadtytułem „7,5x KOSZT NA ODPOWIEDŹ”, przedstawiająca Claude Haiku 5.5 z wartościami: Wejście 0,10 USD, Wyjście 0,50 USD i Indeks 43,40 w porównaniu z Gemini 3.6 Flash z wartościami: Wejście 0,75 USD, Wyjście 3,75 USD i Indeks 33,98, nad paskiem z napisem „Koszt na ukończone zadanie 0,21 USD vs 1,60 USD”.
Engineering & Research

Claude Haiku 5.5 kontra Gemini 3.6 Flash: 7,5 razy wyższy koszt za odpowiedź, o dziewięć punktów słabszy model

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Haiku 5.5 i Gemini 3.6 Flash znajdują się w tej samej klasie swoich linii produktowych — mały, szybki, tani — i na tym podobieństwo się kończy. W Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 uzyskuje 43,40 punktu w konfiguracji Max wobec 33,98 dla Gemini 3.6 Flash w konfiguracji High. W tym samym przebiegu jedno ukończone zadanie Index kosztuje 0,21 USD w Claude Haiku 5.5 i 1,60 USD w Gemini 3.6 Flash.

Czytaj te dwie liczby razem, bo każda z osobna wprowadza w błąd. Tańszy model nie jest tylko odrobinę tańszy; jest 7,5 razy tańszy na ukończone zadanie. A model, który pokonuje, nie jest tylko odrobinę słabszy; jest słabszy o 9,42 punktu indeksu, co w rankingu 182 modeli odpowiada odległości między górnym kwartylem a środkiem.

Oba fakty pochodzą z tego samego niezależnego przebiegu, co ma znaczenie, ponieważ karty dostawców w tym miejscu nie mówią ani o jednym, ani o drugim. Anthropic wprowadził Claude Haiku 5.5 7 października 2026 r.; Google wypuścił Gemini 3.6 Flash 21 lipca 2026 r. Ciekawe są trzy miesiące między nimi.

Dwie karty obok siebie

Za milion tokenów w dolarach amerykańskich. Stawki Anthropic i Google pochodzą z ich własnej dokumentacji cenowej; wspólne wiersze to Artificial Analysis Intelligence Index v4.3.2. Zbuforowano 2026-10-08.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.6 Flash — the scoreboard' with rows Index v4.3.2 43.40 against 33.98, cost per task $0.21 against $1.60, input price $0.10 against $0.75, output tokens per task 162,164 against 41,606, Terminal Bench 4.0 0.3283 against 0.0707 and input modality 'text, image' against 'text, image, video, audio', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Gemini 3.6 Flash is flagged deprecated on the board.'

• Dane wejściowe — Claude Haiku 5.5: 0,10 USD do 100 000 tokenów i 0,50 USD powyżej; Gemini 3.6 Flash: obecnie stawka stała 0,75 USD, od 1 stycznia 2027 r. wzrasta do 1,50 USD.

• Wyjście — Claude Haiku 5.5 $0.50 do 100 000 tokenów i $2.50 powyżej; Gemini 3.6 Flash $3.75 stała stawka dziś, wzrośnie do $7.50 tego samego dnia.

• Dane wejściowe z pamięci podręcznej — Claude Haiku 5.5 0,01 USD i 0,05 USD; Gemini 3.6 Flash 0,075 USD, plus opłata za przechowywanie w wysokości 0,50 USD za milion tokenów na godzinę.

• Kontekst i limit wyjścia — 1 mln tokenów w obu przypadkach. Claude Haiku 5.5 ogranicza odpowiedź do 128 000 tokenów; Gemini 3.6 Flash do 65 536.

• Modalność — Claude Haiku 5.5 przyjmuje tekst i obrazy. Gemini 3.6 Flash przyjmuje tekst, obrazy, wideo, audio i pliki. To jedyny wiersz, w którym strona Google jest jednoznacznie na prowadzeniu, a w przypadku potoku rozumienia mediów może przesądzić o całej kwestii.

• Niezależny wynik — 43,40 dla Claude Haiku 5.5 (Max) w porównaniu z 33,98 dla Gemini 3.6 Flash (High).

• Koszt na ukończone zadanie — 0,21 USD wobec 1,60 USD, w tym samym przebiegu ewaluacji.

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the pricing lines $0.10/$0.50 up to 100,000 tokens and $0.50/$2.50 over it, and the release line 'Released October 7, 2026'.

Dlaczego to na zadanie, a nie na token, jest liczbą, której należy użyć

Mnożnik z cennika wygląda już na 7,5 na wejściu i 7,5 na wyjściu, więc wartość na zadanie nie jest tu zaskoczeniem — ale warto pokazać, dlaczego oba modele wypadają tak samo pod jednym względem, a tak daleko od siebie pod drugim, ponieważ ta sama arytmetyka działa odwrotnie w pozostałych porównaniach z tej partii.

Gemini 3.6 Flash jestmniej gadatliwy z tych dwóch. Generuje 41 606 tokenów wyjściowych na zadanie Intelligence Index — 20 061 na rozumowanie i 21 545 na odpowiedź — w porównaniu z 162 164 w Claude Haiku 5.5, z podziałem na 129 047 na rozumowanie i 33 118 na odpowiedź. Model Anthropic zużywa prawie czterokrotnie więcej tokenów na wykonanie tej samej pracy, a przy tym jego tempo generowania wynosi jedną siódmą tempa Google'a, więc luka w liczbie tokenów i luka w tempie mnożą się, a nie znoszą.

Ta kombinacja — tania stawka pomnożona przez intensywne użytkowanie — to uczciwy opis ekonomiki Claude Haiku 5.5, a sam wpis Anthropic ogłaszający premierę przyznaje drugą stronę tego: model jest „szczególnie opłacalny, gdy używa się go do zadań z promptami o długości do 100 000 tokenów, które stanowią około 90% żądań do naszego poprzedniego modelu Haiku”. Po przekroczeniu 100 000 tokenów stawka za dane wejściowe wynosi 0,50 USD, a za dane wyjściowe 2,50 USD; w tym momencie przewaga nad Gemini 3.6 Flash spada do około 1,5x.

Co zrobił własny poziom Google, podczas gdy to porównanie stało w miejscu

I tu właśnie tekst przestaje być porównaniem dwóch modeli, a staje się ostrzeżeniem, z którym Gemini tak naprawdę go porównujesz.

Google utrzymywało cenę modelu Flash na niezmienionym poziomie przez trzy generacje. Gemini 3.6 Flash, Gemini 3.7 Flash i Gemini 3.8 Flash mają w dokumentacji cenowej samego Google identyczną stawkę 0,75 USD za dane wejściowe i 3,75 USD za dane wyjściowe, taką samą stawkę za pamięć podręczną wynoszącą 0,075 USD oraz ten sam skok 1 stycznia 2027 r. do 1,50 USD i 7,50 USD. Karta Google'a dla linii 3.6 opisuje go jako „nasz poprzedni model Flash", co jest określeniem samego dostawcy.

Zmienił się wynik, nie cena. W niezależnym rankingu Gemini 3.6 Flash uzyskuje 33,98, Gemini 3.7 Flash 39,06, a Gemini 3.8 Flash 40,93 — wszystkie w swojej najwyższej opublikowanej konfiguracji intensywności. Dziewięć punktów indeksu pojawiło się w warstwie Flash Google w ciągu sześciu tygodni, bez zmiany stawki.

Konsekwencja dla każdego, kto jest w trakcie oceny, jest konkretna: jeśli trzy tygodnie temu przeprowadziłeś benchmark tego starcia z Gemini 3.7 Flash, twój wynik jest nieaktualny, a jeśli przeprowadzisz go z Gemini 3.8 Flash, różnica do Claude Haiku 5.5 zmniejsza się do 2,47 punktu. Gemini 3.6 Flash to wersja tego porównania, która najbardziej schlebia Anthropic, a jednocześnie jest to wersja, od której sprzedaży Google jest najdalej.

Artificial Analysis oznacza wpis 3.6 jako przestarzały. Dokumentacja cenowa Google wciąż podaje tę stawkę, a jego lista modeli wciąż kieruje do sekcji 3.6, więc uczciwa interpretacja to nie „zniknął”, lecz „zastąpiony dwukrotnie w obrębie własnej rodziny w ciągu dziesięciu tygodni” — i to jest fakt o tym, jak szybko porusza się ten poziom, a nie powód, by pomijać porównanie.

Za kogo to właściwie decyduje

Za Gemini 3.6 Flash przemawia realny argument i nie jest nim wynik.

Jeśli potrzebujesz audio lub wideo w prompcie, Claude Haiku 5.5 nie potrafi tego w ogóle — odczytuje tekst i obrazy i nic więcej. Gemini 3.6 Flash odczytuje tekst, obrazy, wideo, audio i pliki, a nasz własny katalog odnotowuje go przy zmierzonym 582 tokenach wyjściowych na sekundę z medianą czasu do pierwszego tokenu wynoszącą 4,1 sekundy w ciągu ostatniego tygodnia, co czyni go szybkim modelem nawet według standardów Flash. W przypadku potoku rozumienia multimediów lista modalności to cała decyzja, a różnica indeksu to przypis.

Jeśli Twoja praca to tekst i obrazy, liczby nie są na tyle zbliżone, żeby było o czym dyskutować. Przy mieszance 7:2:1 z przewagą danych wejściowych — kształcie, jaki ma większość ruchu produkcyjnego — Claude Haiku 5.5 kosztuje 0,077 USD za milion tokenów w porównaniu z 0,63 USD za Gemini 3.6 Flash. Przy ponad milionie mieszanych tokenów dziennie to 77 centów przeciwko 6,30 USD, a druga liczba pogorszy się 1 stycznia 2027 r., podczas gdy pierwsza się nie zmieni.

Klif 100 000 tokenów to jedyny warunek, który odwraca tę sytuację. Potok wyszukiwania lub przetwarzania długich dokumentów, który rutynowo składa prompty o rozmiarze 150 000 tokenów, płaci stawkę Anthropic 0,50 USD/2,50 USD za całe żądanie, a w tym momencie oba modele mieszczą się w granicach 1,5x względem siebie pod względem ceny, podczas gdy Gemini 3.6 Flash nadal wygrywa pod względem modalności i pod względem wartości 91,8%, którą Google publikuje dla multi-needle retrieval przy średniej 128k. To dane raportowane przez dostawcę i nieodtworzone, i dokładnie w takim ujęciu należy je przedstawiać.

A capture of the OrcaRouter model page for Gemini 3.6 Flash under google/gemini-3.6-flash, showing a 65K maximum output, text, image, video, file and audio input, public benchmarks published by Google dated 2026-07-21, a p50 time to first token of 4.1 seconds, and the page's own description of the model as Google's fast, cost-efficient multimodal model in the Gemini 3 family with a 1M-token context window.

Dzwonienie do obu lub do jednego

Gemini 3.6 Flash jest od dziś dostępny w katalogu OrcaRouter pod nazwą google/gemini-3.6-flash, w cenie katalogowej Google z marżą 0% — 0,75 USD i 3,75 USD przy odczycie z pamięci podręcznej za 0,075 USD, rozliczane dokładnie tak, jak nalicza je dostawca. Ma to znaczenie właśnie w przypadku tego modelu, ponieważ podwyżka, którą Google wprowadza 1 stycznia, jest zmianą stawek, a katalog typu pass-through uwzględnia ją w dniu, w którym następuje, a nie przy kolejnym odnowieniu umowy. Jeden klucz API i jedno wywołanie SDK obsługują ten model lub dowolny z ponad 200 pozostałych w katalogu, więc test A/B między odnogą Google a odnogą Anthropic to zmiana ciągu nazwy modelu z automatycznym przełączaniem awaryjnym w tle, a nie druga integracja.

Claude Haiku 5.5 nie ma w katalogu. Model Anthropic jest dostępny przez własne API Anthropic oraz przez AWS, Google Cloud i Microsoft Azure — i to jest cała uczciwa odpowiedź. Z tej linii mamy natomiast Claude Sonnet 5.5 i Claude Opus 5.5 — co sprawia, że ścieżka eskalacji od taniego wywołania klasyfikacyjnego aż do wywołania agentowego średniego szczebla jest decyzją dotyczącą routingu, a nie projektem.

Co sprawia, że werdykt jest na tyle prosty, że można go wyrazić wprost. W przypadku pracy z tekstem i obrazami przy krótkich długościach promptów Claude Haiku 5.5 wygrywa w każdym wymiarze poza pułapem odpowiedzi. W przypadku czegokolwiek z dźwiękiem lub wideo Gemini 3.6 Flash jest jedynym z tych dwóch, który w ogóle może odpowiedzieć — a jeśli zamierzasz płacić stawkę Google za tę możliwość, zapytaj, za którego Gemini płacisz tę stawkę, bo na tym poziomie możesz dostać o dziewięć punktów indeksu więcej za te same pieniądze od nowszego brata.

Jedno API do ponad 200 modeli, jeden klucz, automatyczne przełączanie awaryjne pod spodem, więc test A/B między ramieniem Google a ramieniem Anthropic to zmiana ciągu modelu, a nie druga integracja.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie