
Claude Haiku 5.5 kontra Gemini 3.6 Flash: 7,5 razy wyższy koszt za odpowiedź, o dziewięć punktów słabszy model
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Claude Haiku 5.5 i Gemini 3.6 Flash znajdują się w tej samej klasie swoich linii produktowych — mały, szybki, tani — i na tym podobieństwo się kończy. W Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 uzyskuje 43,40 punktu w konfiguracji Max wobec 33,98 dla Gemini 3.6 Flash w konfiguracji High. W tym samym przebiegu jedno ukończone zadanie Index kosztuje 0,21 USD w Claude Haiku 5.5 i 1,60 USD w Gemini 3.6 Flash.
Czytaj te dwie liczby razem, bo każda z osobna wprowadza w błąd. Tańszy model nie jest tylko odrobinę tańszy; jest 7,5 razy tańszy na ukończone zadanie. A model, który pokonuje, nie jest tylko odrobinę słabszy; jest słabszy o 9,42 punktu indeksu, co w rankingu 182 modeli odpowiada odległości między górnym kwartylem a środkiem.
Oba fakty pochodzą z tego samego niezależnego przebiegu, co ma znaczenie, ponieważ karty dostawców w tym miejscu nie mówią ani o jednym, ani o drugim. Anthropic wprowadził Claude Haiku 5.5 7 października 2026 r.; Google wypuścił Gemini 3.6 Flash 21 lipca 2026 r. Ciekawe są trzy miesiące między nimi.
Dwie karty obok siebie
Za milion tokenów w dolarach amerykańskich. Stawki Anthropic i Google pochodzą z ich własnej dokumentacji cenowej; wspólne wiersze to Artificial Analysis Intelligence Index v4.3.2. Zbuforowano 2026-10-08.

• Dane wejściowe — Claude Haiku 5.5: 0,10 USD do 100 000 tokenów i 0,50 USD powyżej; Gemini 3.6 Flash: obecnie stawka stała 0,75 USD, od 1 stycznia 2027 r. wzrasta do 1,50 USD.
• Wyjście — Claude Haiku 5.5 $0.50 do 100 000 tokenów i $2.50 powyżej; Gemini 3.6 Flash $3.75 stała stawka dziś, wzrośnie do $7.50 tego samego dnia.
• Dane wejściowe z pamięci podręcznej — Claude Haiku 5.5 0,01 USD i 0,05 USD; Gemini 3.6 Flash 0,075 USD, plus opłata za przechowywanie w wysokości 0,50 USD za milion tokenów na godzinę.
• Kontekst i limit wyjścia — 1 mln tokenów w obu przypadkach. Claude Haiku 5.5 ogranicza odpowiedź do 128 000 tokenów; Gemini 3.6 Flash do 65 536.
• Modalność — Claude Haiku 5.5 przyjmuje tekst i obrazy. Gemini 3.6 Flash przyjmuje tekst, obrazy, wideo, audio i pliki. To jedyny wiersz, w którym strona Google jest jednoznacznie na prowadzeniu, a w przypadku potoku rozumienia mediów może przesądzić o całej kwestii.
• Niezależny wynik — 43,40 dla Claude Haiku 5.5 (Max) w porównaniu z 33,98 dla Gemini 3.6 Flash (High).
• Koszt na ukończone zadanie — 0,21 USD wobec 1,60 USD, w tym samym przebiegu ewaluacji.

Dlaczego to na zadanie, a nie na token, jest liczbą, której należy użyć
Mnożnik z cennika wygląda już na 7,5 na wejściu i 7,5 na wyjściu, więc wartość na zadanie nie jest tu zaskoczeniem — ale warto pokazać, dlaczego oba modele wypadają tak samo pod jednym względem, a tak daleko od siebie pod drugim, ponieważ ta sama arytmetyka działa odwrotnie w pozostałych porównaniach z tej partii.
Gemini 3.6 Flash jestmniej gadatliwy z tych dwóch. Generuje 41 606 tokenów wyjściowych na zadanie Intelligence Index — 20 061 na rozumowanie i 21 545 na odpowiedź — w porównaniu z 162 164 w Claude Haiku 5.5, z podziałem na 129 047 na rozumowanie i 33 118 na odpowiedź. Model Anthropic zużywa prawie czterokrotnie więcej tokenów na wykonanie tej samej pracy, a przy tym jego tempo generowania wynosi jedną siódmą tempa Google'a, więc luka w liczbie tokenów i luka w tempie mnożą się, a nie znoszą.
Ta kombinacja — tania stawka pomnożona przez intensywne użytkowanie — to uczciwy opis ekonomiki Claude Haiku 5.5, a sam wpis Anthropic ogłaszający premierę przyznaje drugą stronę tego: model jest „szczególnie opłacalny, gdy używa się go do zadań z promptami o długości do 100 000 tokenów, które stanowią około 90% żądań do naszego poprzedniego modelu Haiku”. Po przekroczeniu 100 000 tokenów stawka za dane wejściowe wynosi 0,50 USD, a za dane wyjściowe 2,50 USD; w tym momencie przewaga nad Gemini 3.6 Flash spada do około 1,5x.
Co zrobił własny poziom Google, podczas gdy to porównanie stało w miejscu
I tu właśnie tekst przestaje być porównaniem dwóch modeli, a staje się ostrzeżeniem, z którym Gemini tak naprawdę go porównujesz.
Google utrzymywało cenę modelu Flash na niezmienionym poziomie przez trzy generacje. Gemini 3.6 Flash, Gemini 3.7 Flash i Gemini 3.8 Flash mają w dokumentacji cenowej samego Google identyczną stawkę 0,75 USD za dane wejściowe i 3,75 USD za dane wyjściowe, taką samą stawkę za pamięć podręczną wynoszącą 0,075 USD oraz ten sam skok 1 stycznia 2027 r. do 1,50 USD i 7,50 USD. Karta Google'a dla linii 3.6 opisuje go jako „nasz poprzedni model Flash", co jest określeniem samego dostawcy.
Zmienił się wynik, nie cena. W niezależnym rankingu Gemini 3.6 Flash uzyskuje 33,98, Gemini 3.7 Flash 39,06, a Gemini 3.8 Flash 40,93 — wszystkie w swojej najwyższej opublikowanej konfiguracji intensywności. Dziewięć punktów indeksu pojawiło się w warstwie Flash Google w ciągu sześciu tygodni, bez zmiany stawki.
Konsekwencja dla każdego, kto jest w trakcie oceny, jest konkretna: jeśli trzy tygodnie temu przeprowadziłeś benchmark tego starcia z Gemini 3.7 Flash, twój wynik jest nieaktualny, a jeśli przeprowadzisz go z Gemini 3.8 Flash, różnica do Claude Haiku 5.5 zmniejsza się do 2,47 punktu. Gemini 3.6 Flash to wersja tego porównania, która najbardziej schlebia Anthropic, a jednocześnie jest to wersja, od której sprzedaży Google jest najdalej.
Artificial Analysis oznacza wpis 3.6 jako przestarzały. Dokumentacja cenowa Google wciąż podaje tę stawkę, a jego lista modeli wciąż kieruje do sekcji 3.6, więc uczciwa interpretacja to nie „zniknął”, lecz „zastąpiony dwukrotnie w obrębie własnej rodziny w ciągu dziesięciu tygodni” — i to jest fakt o tym, jak szybko porusza się ten poziom, a nie powód, by pomijać porównanie.
Za kogo to właściwie decyduje
Za Gemini 3.6 Flash przemawia realny argument i nie jest nim wynik.
Jeśli potrzebujesz audio lub wideo w prompcie, Claude Haiku 5.5 nie potrafi tego w ogóle — odczytuje tekst i obrazy i nic więcej. Gemini 3.6 Flash odczytuje tekst, obrazy, wideo, audio i pliki, a nasz własny katalog odnotowuje go przy zmierzonym 582 tokenach wyjściowych na sekundę z medianą czasu do pierwszego tokenu wynoszącą 4,1 sekundy w ciągu ostatniego tygodnia, co czyni go szybkim modelem nawet według standardów Flash. W przypadku potoku rozumienia multimediów lista modalności to cała decyzja, a różnica indeksu to przypis.
Jeśli Twoja praca to tekst i obrazy, liczby nie są na tyle zbliżone, żeby było o czym dyskutować. Przy mieszance 7:2:1 z przewagą danych wejściowych — kształcie, jaki ma większość ruchu produkcyjnego — Claude Haiku 5.5 kosztuje 0,077 USD za milion tokenów w porównaniu z 0,63 USD za Gemini 3.6 Flash. Przy ponad milionie mieszanych tokenów dziennie to 77 centów przeciwko 6,30 USD, a druga liczba pogorszy się 1 stycznia 2027 r., podczas gdy pierwsza się nie zmieni.
Klif 100 000 tokenów to jedyny warunek, który odwraca tę sytuację. Potok wyszukiwania lub przetwarzania długich dokumentów, który rutynowo składa prompty o rozmiarze 150 000 tokenów, płaci stawkę Anthropic 0,50 USD/2,50 USD za całe żądanie, a w tym momencie oba modele mieszczą się w granicach 1,5x względem siebie pod względem ceny, podczas gdy Gemini 3.6 Flash nadal wygrywa pod względem modalności i pod względem wartości 91,8%, którą Google publikuje dla multi-needle retrieval przy średniej 128k. To dane raportowane przez dostawcę i nieodtworzone, i dokładnie w takim ujęciu należy je przedstawiać.

Dzwonienie do obu lub do jednego
Gemini 3.6 Flash jest od dziś dostępny w katalogu OrcaRouter pod nazwą google/gemini-3.6-flash, w cenie katalogowej Google z marżą 0% — 0,75 USD i 3,75 USD przy odczycie z pamięci podręcznej za 0,075 USD, rozliczane dokładnie tak, jak nalicza je dostawca. Ma to znaczenie właśnie w przypadku tego modelu, ponieważ podwyżka, którą Google wprowadza 1 stycznia, jest zmianą stawek, a katalog typu pass-through uwzględnia ją w dniu, w którym następuje, a nie przy kolejnym odnowieniu umowy. Jeden klucz API i jedno wywołanie SDK obsługują ten model lub dowolny z ponad 200 pozostałych w katalogu, więc test A/B między odnogą Google a odnogą Anthropic to zmiana ciągu nazwy modelu z automatycznym przełączaniem awaryjnym w tle, a nie druga integracja.
Claude Haiku 5.5 nie ma w katalogu. Model Anthropic jest dostępny przez własne API Anthropic oraz przez AWS, Google Cloud i Microsoft Azure — i to jest cała uczciwa odpowiedź. Z tej linii mamy natomiast Claude Sonnet 5.5 i Claude Opus 5.5 — co sprawia, że ścieżka eskalacji od taniego wywołania klasyfikacyjnego aż do wywołania agentowego średniego szczebla jest decyzją dotyczącą routingu, a nie projektem.
Co sprawia, że werdykt jest na tyle prosty, że można go wyrazić wprost. W przypadku pracy z tekstem i obrazami przy krótkich długościach promptów Claude Haiku 5.5 wygrywa w każdym wymiarze poza pułapem odpowiedzi. W przypadku czegokolwiek z dźwiękiem lub wideo Gemini 3.6 Flash jest jedynym z tych dwóch, który w ogóle może odpowiedzieć — a jeśli zamierzasz płacić stawkę Google za tę możliwość, zapytaj, za którego Gemini płacisz tę stawkę, bo na tym poziomie możesz dostać o dziewięć punktów indeksu więcej za te same pieniądze od nowszego brata.
Jedno API do ponad 200 modeli, jeden klucz, automatyczne przełączanie awaryjne pod spodem, więc test A/B między ramieniem Google a ramieniem Anthropic to zmiana ciągu modelu, a nie druga integracja.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
