
Claude Sonnet 5.5 kontra Gemini 3.1 Pro: taniej za token, jedenaście razy drożej za zadanie
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Na cenniku Claude Sonnet 5.5 jest tańszym modelem i pod względem możliwości nie ma nawet porównania. Osiągnął ogólną dostępność 28 września 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych; Gemini 3.1 Pro, ogłoszony 19 lutego 2026 r. i nadal udostępniany z punktu końcowego w wersji zapoznawczej, kosztuje 2,00 USD i 12,00 USD. Sonnet 5.5 uzyskuje także 56 punktów w Intelligence Index v4.3 firmy Artificial Analysis wobec 30 punktów Gemini 3.1 Pro Preview — różnica dwudziestu sześciu punktów w ramach jednego zestawu testowego. Kontekst Gemini o długości 1 048 576 tokenów to jedyna kluczowa liczba, w której wygrywa bezapelacyjnie. Ten sam ewaluator podaje jednak, że ukończenie jednego zadania otwartego kosztuje 0,67 USD w przypadku modelu Google i 7,60 USD w przypadku modelu Anthropic, co stanowi jedenastokrotność działającą w przeciwnym kierunku. Obie liczby są poprawne, a powód, dla którego współistnieją — limit 65 536 tokenów wyjściowych po jednej stronie i problem z rozwlekłością po drugiej — stanowi sedno tego porównania.
Czym właściwie jest każdy endpoint
Ustal tożsamości przed arytmetyką. Podmiotem tutaj jest anthropic/claude-sonnet-5.5, wydany 28 września 2026 r., dane wejściowe: tekst, obrazy i pliki, kontekst 1 000 000 tokenów, maksymalna długość wyjścia 128 000 tokenów, adaptacyjne myślenie z parametrem effort domyślnie ustawionym na high w Claude Platform. Przeciwnikiem jest google/gemini-3.1-pro-preview, wydany 19 lutego 2026 r., dane wejściowe: tekst, obrazy, wideo, dźwięk i pliki, kontekst 1 048 576 tokenów, maksymalna długość wyjścia 65 536 tokenów. Jedna z tych dwóch nazw zawiera słowo, którego nie ma druga, i nie jest to ozdoba.
Sufiks „preview” jest dołączony od siedmiu miesięcy. Google w tym okresie wydało kilka wersji Flash i nie wydało żadnego następcy warstwy Pro; model, który został zastąpiony przez 3.1 Pro, jest oznaczony jako wyłączony. Nic z tego nie jest wadą modelu — przez cały ten czas był dostępny, stabilny i prawidłowo wyceniony — ale oznacza to, że punkt końcowy, z którym się integrujesz, nie jest objęty zobowiązaniem dotyczącym cyklu życia dla ogólnej dostępności, a w tej rodzinie wycofano już jeden model Pro. Traktuj to jako stałą pozycję, a nie przypis, ponieważ zmienia to, ile kosztuje wieloletnia decyzja architektoniczna, jeśli popełnisz błąd.
Dwie liczby wskazujące w przeciwnych kierunkach
Najpierw porównanie na token, ponieważ to właśnie je wszyscy przeprowadzają i przemawia ono na korzyść nowszego modelu.
• Wejście — 2,00 USD za milion w obu przypadkach; dokładny remis przy stawce podstawowej
• Wyjście — 10,00 USD za Claude Sonnet 5.5 w porównaniu z 12,00 USD za Gemini 3.1 Pro; model Anthropic jest o 17% tańszy
• Odczyt z pamięci podręcznej — 0,20 USD za milion w przypadku obu poniżej granicy warstwy
• Zapis do pamięci podręcznej — 2,50 USD za milion w pięciominutowym oknie dla Claude Sonnet 5.5 w porównaniu z 0,375 USD dla Gemini 3.1 Pro; Google jest około siedem razy tańszy pod względem zapisu wpisu do pamięci podręcznej
• Kontekst — 1 000 000 wobec 1 048 576; różnica bez praktycznych konsekwencji
• Maksymalna długość wyjścia — 128 000 tokenów w porównaniu do 65 536; model Anthropic ma niemal dwukrotnie wyższy pułap
• Modalność wejściowa — tekst, obraz i plik w porównaniu z tekstem, obrazem, wideo, dźwiękiem i plikiem
Następnie porównanie dla poszczególnych zadań, od tego samego ewaluatora, w tym samym tygodniu, w konfiguracji maksymalnego wysiłku po obu stronach: 7,60 USD za Claude Sonnet 5.5 wobec 0,67 USD za Gemini 3.1 Pro. Jedenaście razy. Mechanizm jest udokumentowany na tej samej stronie, a nie wywnioskowany — Sonnet 5.5 wygenerował 410 milionów tokenów w całym zestawie testów indeksowych wobec mediany 88 milionów dla całej konkurencji, a ewaluator opisuje go jako bardzo rozwlekłego, podczas gdy Gemini 3.1 Pro jest opisywany jako dość zwięzły. Kiedy jeden model pisze kilkukrotnie więcej niż drugi, 17-procentowa przewaga w stawce za tokeny wyjściowe nie przetrwa kontaktu z fakturą.
Lekcja ta wykracza poza te dwa modele: cennik wycenia token, a rozliczasz się za ukończoną pracę. Każde porównanie, które zatrzymuje się na cenniku, mierzy niewłaściwą wielkość.
Granica poziomu przy 200 000 tokenów
Cennik Gemini 3.1 Pro nie jest jednolity, a ten skok jest wystarczająco duży, aby odwrócić część powyższego porównania. Dla promptów poniżej 200 000 tokenów stawki wynoszą 2,00 USD za wejście i 12,00 USD za wyjście, przy 0,20 USD za odczyt z pamięci podręcznej. Powyżej tej granicy całe wywołanie jest wyceniane na nowo: 4,00 USD za wejście, 18,00 USD za wyjście i 0,40 USD za odczyt z pamięci podręcznej — stawka za wejście podwaja się, osiągając dokładnie dwukrotność stawki Claude Sonnet 5.5, a stawka za wyjście zmienia się z 17% niższej po stronie Anthropic na 80% wyższą po stronie Google.
Ta granica nie jest egzotyczna. Prompt o rozmiarze 200 000 tokenów to niewielka baza kodu, długi zestaw umów, kilka godzin transkrypcji albo agent, który działa już od jakiegoś czasu. Praca z długim kontekstem to dokładnie to, do czego sprzedaje się okno o rozmiarze 1 mln tokenów, więc poziom, który najbardziej korzysta na tym oknie, jest także poziomem, na którym przewaga cenowa znika. Jeśli Twoje prompty regularnie przekraczają 200 000 tokenów, oceniaj Gemini 3.1 Pro przy stawkach 4,00 USD i 18,00 USD, a nie przy stawkach ze strony docelowej.
Zapisy do pamięci podręcznej zasługują na własne zdanie, ponieważ odwracają się w drugą stronę i przetrwają zmianę poziomu. Przy $0.375 za milion w porównaniu do $2.50, Gemini jest znacznie tańsze w wypełnianiu pamięci podręcznej, a ta stawka nie zmienia się, gdy przekraczasz granicę. Dla agenta, który odbudowuje duży prefiks w każdym kroku, zamiast go ponownie wykorzystywać, ta pojedyncza linia może być większą przewagą strukturalną niż stawka za wejście — i jest to jedyna linia w tym porównaniu, której nie dotyka żadna granica poziomu.
Limit 65,536 tokenów i dlaczego decyduje o architekturze
Liczba, która najbardziej zmienia to, co możesz zbudować, to maksymalna wielkość wyjścia: 65 536 tokenów w Gemini 3.1 Pro wobec 128 000 w Claude Sonnet 5.5. Pułap nie jest miarą wydajności; to ograniczenie tego, czy zadanie zmieści się w jednym wywołaniu.
Wszystko, co generuje duży artefakt — kompletny plik źródłowy, długi raport, pełny dokument, ustrukturyzowany zbiór danych — powyżej 65 536 tokenów w przypadku Gemini musi zostać rozłożone na łańcuch wywołań z przekazywanym między nimi stanem. Dekompozycja kosztuje więcej tokenów wejściowych na każdym kroku, więcej kodu orkiestracji oraz wprowadza nowy tryb awarii na stykach, w których kończy się jeden fragment, a zaczyna następny. Drugie ograniczenie to potęguje: własne materiały Anthropic wskazują praktyczny próg Sonnet 5.5 dla niezawodnej długiej pracy jako istotnie wyższy, a pułap Gemini jest tym bardziej restrykcyjnym z tych dwóch — i to dwukrotnie. Jeśli najdłuższy artefakt ma 40 000 tokenów, ta sekcja jest nieistotna i należy porównywać koszt przypadający na zadanie. Jeśli ma 100 000, pułap już podjął decyzję za ciebie.
Modalność — jedyna oś, którą Gemini posiada na wyłączność.
Gemini 3.1 Pro obsługuje wideo i audio; Claude Sonnet 5.5 obsługuje tekst, obrazy i pliki, a nie obsługuje żadnego z nich. W przypadku obciążenia opartego na multimediach — nagraniach rozmów, zrzutach ekranu, wideo produktowym, audio ze spotkań — w tym zestawieniu nie ma dostępnego zamiennika, a porównanie cen jest bezprzedmiotowe, ponieważ tylko jeden z dwóch punktów końcowych może w ogóle przyjąć dane wejściowe. W przypadku obciążeń tekstowych i obrazowych zestawy możliwości się pokrywają, a powyższa kalkulacja cenowa ma zastosowanie.
Inny wskaźnik operacyjny Gemini'ego wart jest przytoczenia, ponieważ łatwo go przeoczyć na stronie, która na pierwszym miejscu stawia inteligencję: nasz katalog mierzy medianę opóźnienia pierwszego tokenu na poziomie 10 000 ms przy p50 i szybkość generowania wyjścia blisko 1 283 tokenów na sekundę, przy siedmiodniowym wskaźniku błędów 56,8%. To niezwykle szybki model z bardzo wysokim zaobserwowanym wskaźnikiem niepowodzeń — kombinacja, która znacznie lepiej nadaje się do pracy wsadowej z hojnymi budżetami na ponowienia niż do czegokolwiek, na co użytkownik czeka. Claude Sonnet 5.5 to w porównaniu profil wolniejszy i stabilniejszy. Wskaźnik błędów nie pojawia się na stronie docelowej żadnego z dostawców; to liczba, która ujawnia się dopiero wtedy, gdy kandydaci znajdują się za jednym punktem końcowym, który ich mierzy — co jest jednym z powodów, by oceniać oba z jednego miejsca, a nie z dwóch pulpitów.
Co gdzie kierować
Wyślij to do Claude Sonnet 5.5, gdy praca dotyczy tekstu lub obrazu, gdy poprzeczka jakości jest wystarczająco wysoka, by różnica dwudziestu sześciu punktów w indeksie miała znaczenie, gdy artefakty wyjściowe są wystarczająco długie, by potrzebować limitu 128 000 tokenów, albo gdy obciążenie jest interaktywne, a wskaźnik błędów na poziomie 56,8% jest nie do przyjęcia. W przypadku zadań ustrukturyzowanych i ograniczonych kara za rozwlekłość, która daje wynik 7,60 USD, w dużej mierze znika, a przewaga na token staje się realnymi pieniędzmi.
Wyślij to do Gemini 3.1 Pro, gdy dane wejściowe zawierają wideo lub audio, gdy prompty mieszczą się poniżej 200 000 tokenów i wolumen jest wysoki, gdy często zapisujesz duże pamięci podręczne i zapis do pamięci podręcznej za 0,375 USD się kumuluje, lub gdy zadanie ma charakter wsadowy, a koszt na zadanie to jedyna kolumna, która się liczy — przy 0,67 USD za zadanie wobec 7,60 USD możesz pozwolić sobie na bardzo wiele ponownych prób.
Oba są dziś trasowane w OrcaRouter. google/gemini-3.1-pro-preview i anthropic/claude-sonnet-5 to aktywne pozycje katalogowe dostępne na jednym poświadczeniu w cenie katalogowej dostawcy z 0% marży, co oznacza, że powyższy podział można wyrazić jako regułę routingu, a nie jako dwie integracje — żądania o profilu multimedialnym do jednego punktu końcowego, żądania tekstowe i obrazowe do drugiego, z przełączeniem awaryjnym, jeśli którykolwiek zacznie zwracać błędy. Claude Sonnet 5.5 nie jest jeszcze trasą na naszej platformie; gdy zostanie wpisany, ta sama reguła obejmie go bez nowego klucza.
Szczery werdykt dla tego starcia: Claude Sonnet 5.5 jest znacznie lepszym modelem i tańszym w przeliczeniu na token, a Gemini 3.1 Pro jest około jedenaście razy tańszy na ukończone zadanie w pracy otwartej, sześć razy tańszy przy zapisie pamięci podręcznej i jedynym z tej dwójki, który potrafi obejrzeć wideo. Ktoś, kto cytuje ci cennik, opisuje porównanie, które nie istnieje; to, które istnieje, dotyczy tego, które żądania możesz ograniczyć.



Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
