Karta główna zatytułowana „Claude Haiku 5.5 vs Gemini 3.7 Flash”, przedstawiająca po lewej Claude Haiku 5.5 wydany 7 października 2026 r., a po prawej Gemini 3.7 Flash oznaczony jako przestarzały, wiersz Intelligence Index v4.3.2 z wartością 43,40 wobec 39,06 oraz wiersz Terminal Bench 4.0 z wartością 0,3283 wobec 0,1364.
Guides & Insights

Claude Haiku 5.5 kontra Gemini 3.7 Flash: Jeden z tych dwóch został już wycofany

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Niezręczny fakt kryje się pod każdymClaude Haiku 5.5 kontra Gemini 3.7 Flash porównaniem napisanym dzisiaj: Gemini 3.7 Flash jest przestarzały. Dostawca udostępnił go 13 sierpnia 2026 r., a 2 września zastąpił go Gemini 3.8 Flash; Artificial Analysis prowadzi teraz stronę 3.7 z oznaczeniem przestarzałości. Natomiast Claude Haiku 5.5 zadebiutował 7 października 2026 r. i ma zobowiązanie do wycofania nie wcześniej niż w październiku 2027 r.

To nie czyni tego porównania bezużytecznym. Zmienia pytanie. To już nie jest „który z tych dwóch powinienem wywołać” — dla większości zespołów odpowiedź brzmi: żaden, ponieważ linia 3.7 została zastąpiona w ramach własnej rodziny. Na co się natomiast przydaje, to coś subtelniejszego i być może bardziej użytecznego: jasny odczyt tego, jak szybko w ciągu trzech tygodni posunął się poziom flash Google’a, oraz tego, które elementy specyfikacji modelu z poziomu flash faktycznie decydują o tym, czy zostanie użyty.

Co możesz jeszcze zmierzyć

Oba modele zostały uruchomione na tej samej niezależnej tablicy, która jest jedynym miejscem, w którym w ogóle można je zestawić. W Artificial Analysis Intelligence Index v4.3.2 Claude Haiku 5.5 uzyskuje 43,40 w konfiguracji Max w porównaniu z 39,06 dla Gemini 3.7 Flash w konfiguracji High — różnica 4,33 punktu.

Obaj dostawcy publikują również własne zestawy ewaluacyjne, które nie nakładają się w sposób umożliwiający bezpośrednie porównanie. Wspólne niezależne wiersze to cztery, które Artificial Analysis przeprowadziła na obu:

• Terminal Bench 4.0 — 0,3283 dla Claude Haiku 5.5 wobec 0,1364 dla Gemini 3.7 Flash. 19-punktowa różnica bezwzględna i największa asymetria w zestawie.

• SciCode — 0,5498 wobec 0,5718. Gemini 3.7 Flash wyprzedza go o 2,2 punktu.

• Humanity's Last Exam — 0,4439 wobec 0,4787. Gemini 3.7 Flash o 3,5 punktu.

• AutomationBench, wynik częściowy — 0.3541 wobec 0.6203. Gemini 3.7 Flash o 27 punktów.

Przeczytaj ten zestaw uważnie, bo zawiera interesujący wynik. Gemini 3.7 Flash wygrywa trzy z czterech wspólnych benchmarków, a mimo to przegrywa w indeksie złożonym o 4,3 punktu. Indeks to ważona mieszanka, a wagi stawiają wiersze dotyczące terminala i kodu — gdzie różnica biegnie w przeciwnym kierunku i to o znacznie większą wartość — przed zagregowanym wynikiem pozostałych. To nie tyle artefakt punktacji, ile stwierdzenie o tym, do czego służy indeks: próbuje on przewidzieć, czy model potrafi dokończyć zadanie, a w tym pytaniu linia 3.7 wypadła słabo w sposób, którego jej przyzwoite wyniki w benchmarkach naukowych nie ukryły.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.7 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 39.06, Terminal Bench 4.0 0.3283 against 0.1364, SciCode 0.5498 against 0.5718, Humanity's Last Exam 0.4439 against 0.4787, cost per task $0.21 against $0.93 and input price $0.10 against $0.75, footed 'Gemini 3.7 Flash is listed as deprecated; all figures per Artificial Analysis v4.3.2.'

W czym linia 3.7 była tak naprawdę słaba

Dwa wiersze opowiadają tę historię lepiej niż indeks.

Terminal Bench 4.0 z wynikiem 0,1364 to niska wartość, a obok niej widnieje 0,8577 z poprzedniej generacji Terminal Bench uzyskane przez ten sam model. To nie jest model, który się pogorszył; to benchmark, który zmienił to, co mierzy, a Gemini 3.7 Flash nie dokonał tego przejścia. Claude Haiku 5.5, na tym samym zrewidowanym benchmarku, uzyskuje 0,3283 — co nie jest spektakularne w ujęciu absolutnym, ale stanowi prawie dwa i pół raza więcej niż wynik 3.7 Flash, w wierszu, który najbezpośredniej przewiduje wydajność w kodowaniu agentowym.

Drugi wiersz to Tau-Bench Banking, w którym Gemini 3.7 Flash osiąga wynik 0,3278. Niezawodność korzystania z narzędzi w ustrukturyzowanej domenie to dokładnie to, do czego wdraża się tani model, a wynik poniżej 0,33 to liczba, która po cichu zabija pilotaż. Claude Haiku 5.5 nie ma opublikowanego wyniku Tau-Bench w tej samej tabeli, więc nie ma tam dostępnego porównania — uczciwą rzeczą jest powiedzieć to wprost, zamiast go wywnioskować.

Tam, gdzie Gemini 3.7 Flash się sprawdził, sprawdził się jak zawsze: GPQA z wynikiem 0,9455 i MMMU-Pro z wynikiem 0,8549 to prawdziwe mocne strony, a jego wejście multimodalne nigdy nie budziło wątpliwości. Niepowodzenie dotyczyło tej części karty specyfikacji, która decyduje o tym, czy pętla agenta działa, a nie tej, która zdobywa miejsca w rankingach.

Co się zmieniło w ciągu trzech tygodni po tym

Gemini 3.8 Flash pojawił się 2 września 2026 r., a zmiany wewnątrz własnej warstwy flash Google’a to użyteczniejsze porównanie dla każdego, kto planuje pipeline na 2027 rok.

Na tym samym indeksie Gemini 3.8 Flash osiąga 40,93 wobec 39,06 dla linii 3.7 — wzrost o 1,87 punktu w ciągu trzech tygodni. Terminal Bench 4.0 wzrósł z 0,1364 do 0,1970. Tau-Bench Banking wzrósł z 0,3278 do 0,4495. To dokładnie te wiersze, w których model 3.7 wypadał najgorzej, co sugeruje, że następca został ukierunkowany dokładnie na tę słabość, a nie na ogólny wzrost możliwości.

Cena w ogóle się nie zmieniła. Gemini 3.7 Flash był wyceniony na 0,75 USD za milion tokenów wejściowych i 3,75 USD za milion tokenów wyjściowych, a Gemini 3.8 Flash zadebiutował z tymi samymi stawkami 0,75 USD i 3,75 USD — identyczny cennik, przypisany do modelu lepszego o dwa punkty indeksu w wierszach, które mają znaczenie dla agentów.

A capture of Google's Gemini API pricing documentation page, headed 'Gemini Developer API pricing', with the banner 'Gemini 3.8 Flash is now available. Try it out.' and the documentation's left-hand model list showing Gemini 3.8 Flash, Gemini 3.7 Flash, Gemini 3.6 Flash and Gemini 3.5 Flash.

Cennik to miejsce, w którym to porównanie naprawdę się rozstrzyga.

W porównaniu z Claude Haiku 5.5 cena Google mówi wszystko i nie ma tu nawet porównania.

• Dane wejściowe — Claude Haiku 5.5 0,10 USD za milion tokenów do 100 000, powyżej 0,50 USD; Gemini 3.7 Flash 0,75 USD w stałej stawce, albo siedem i pół razy więcej niż stawka Anthropic w pierwszym progu.

• Wyjście — $0,50 dla Claude Haiku 5.5 w pierwszym poziomie, $2,50 powyżej niego; $3,75 dla Gemini 3.7 Flash.

• Dane wejściowe z pamięci podręcznej — 0,01 USD i 0,125 USD dla Claude Haiku 5.5; 0,075 USD za odczyt i 0,75 USD za zapis dla Gemini 3.7 Flash.

• Kontekst — milion tokenów dla obu. Maksymalna długość wyjściowa — 128 000 tokenów dla Claude Haiku 5.5 w porównaniu z 65 536 dla Gemini 3.7 Flash.

• Modalność wejściowa — tekst i obrazy dla Claude Haiku 5.5; tekst, obrazy, mowa i wideo dla Gemini 3.7 Flash. To wciąż jedyny wiersz, w którym specyfikacja Google jest zdecydowanie dłuższa, i przetrwał przejście na wersję 3.8 bez zmian.

• Niezależny koszt przypadający na ukończone zadanie Index — 0,21 USD dla Claude Haiku 5.5 wobec 0,93 USD dla Gemini 3.7 Flash. Różnica 4,4×, szersza niż sugerowałby stosunek wejściowy siedem i pół do jednego, ponieważ to model Anthropic jest tutaj rozwlekły: 162 164 tokeny wyjściowe na zadanie Index wobec 58 387 tokenów dla Gemini 3.7 Flash. Anthropic dokumentuje również tokenizer współdzielony z Claude 4.7 i późniejszymi, który zlicza około 30% więcej tokenów dla tego samego tekstu, co działa w tym samym kierunku.

• Szybkość — 212,3 sekundy na zadanie Index w przypadku Gemini 3.7 Flash wobec 424,6 w przypadku Claude Haiku 5.5. Model Google'a jest szybszy z tych dwóch o czynnik dwa, co jest jedynym wierszem w tej sekcji, w którym tańszy model nie jest również lepszy.

Co to oznacza, jeśli wybierasz dzisiaj

Praktyczny wniosek jest taki, że żadna z tych dwóch nie jest właściwą odpowiedzią, z różnych powodów.

Gemini 3.7 Flash jest przestarzały, wyceniony na tym samym poziomie co jego następca i gorszy od tego następcy dokładnie w tych wierszach, których potrzebuje tani model produkcyjny. Polecanie go oznaczałoby polecanie cennika dołączonego do zastąpionego modelu — następca kosztuje tyle samo i robi więcej. Nikt, kto w październiku 2026 wybiera między tymi dwoma, nie powinien trafić na linię 3.7, a fakt, że jej cennik pozostaje bez zmian, właśnie przesądza sprawę.

Claude Haiku 5.5 to model dostępny na żywo, a w zadaniach typu tekst na wejściu, tekst na wyjściu jest tańszy pod każdym względem, wyżej w zestawieniu zbiorczym i znacznie lepszy w dwóch wierszach, które przewidują sukces w zadaniach agentowych. Jest też wolniejszy i nie obsługuje mowy ani wideo. To, czy ma to znaczenie, jest kwestią twojego pipeline'u, a nie samych modeli.

Trzecia możliwość, którą uwidacznia różnica punktów indeksu między 3,8 a 3,7, jest taka, że warstwa flash Google'a rozwija się tak szybko, że trzytygodniowe porównanie jest już historyczne. Każde bezpośrednie starcie w warstwie flash traktuj jako mające termin przydatności mierzony w tygodniach, a nie w kwartałach.

Bieganie po tej stronie, po której wylądujesz

Gemini 3.8 Flash — następca, a nie przestarzały 3.7 — jest w katalogu OrcaRouter w cenie katalogowej Google z 0% narzutu, więc stawka publikowana przez Google to stawka, która trafia na Twój rachunek, a zmiana po ich stronie jest widoczna u nas tego samego dnia. Claude Sonnet 5.5. Claude Opus 5.5 są również w katalogu, co sprawia, że test routingu z dwoma dostawcami to konfiguracja, a nie projekt: jedno API dla ponad 200 modeli, jeden klucz, automatyczne przełączanie awaryjne pod spodem, a także DSL routingu, gdy wolisz trzymać eskalację w trasie niż w kodzie.

Sam Gemini 3.7 Flash nie znajduje się w naszym katalogu, a Claude Haiku 5.5 również nie. Oba pozostają dostępne za pośrednictwem własnych API ich dostawców, a w przypadku Google'a także za pośrednictwem kilku platform zewnętrznych. Warto powiedzieć to wprost, zamiast zostawiać czytelnika, by odkrył to sam.

A capture of the OrcaRouter model page for Gemini 3.8 Flash under google/gemini-3.8-flash, showing a 65K maximum output, text, image, video, file and audio input, benchmarks published by Google on 2026-09-02, a p50 time to first token of 3.838 seconds, and the rates $0.75 input and $3.75 output per million tokens.

Liczba do odjęcia

To nie luka w indeksie wynosząca 4,33 punktu. Chodzi o to, że Gemini 3.7 Flash wygrał trzy z czterech wspólnych benchmarków, a mimo to przegrał w wyniku złożonym o cztery punkty, ponieważ benchmark, któremu indeks przypisuje największą wagę, był tym, w którym uzyskał 0,1364. Wyniki naukowe modelu klasy flash mogą wyglądać dobrze, mimo że zawodzi on w tym, do czego kupuje się tanie modele.

Wniosek jest taki, że następca poprawił dokładnie te wiersze w ciągu trzech tygodni, przy niezmienionej cenie. Na tej podstawie presja konkurencyjna w tym segmencie nie wynika z ceny. Wynika z tego, czy model potrafi ukończyć wieloetapowe zadanie, a to zmienia się teraz szybciej niż cenniki.