Wygenerowano główną kartę tytułową dla Claude Sonnet 5.5 vs Gemini 3.1 Pro, z podtytułem „Taniej za token, jedenaście razy drożej za zadanie”, pokazującą $2.00 i $10.00 za milion tokenów w porównaniu z $2.00 i $12.00, z odnotowanym po prawej stronie limitem wyjściowym 65 536 tokenów, oraz logo OrcaRouter złożonym w prawym dolnym rogu.
Guides & Insights

Claude Sonnet 5.5 kontra Gemini 3.1 Pro: taniej za token, jedenaście razy drożej za zadanie

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Na cenniku Claude Sonnet 5.5 jest tańszym modelem i pod względem możliwości nie ma nawet porównania. Osiągnął ogólną dostępność 28 września 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych; Gemini 3.1 Pro, ogłoszony 19 lutego 2026 r. i nadal udostępniany z punktu końcowego w wersji zapoznawczej, kosztuje 2,00 USD i 12,00 USD. Sonnet 5.5 uzyskuje także 56 punktów w Intelligence Index v4.3 firmy Artificial Analysis wobec 30 punktów Gemini 3.1 Pro Preview — różnica dwudziestu sześciu punktów w ramach jednego zestawu testowego. Kontekst Gemini o długości 1 048 576 tokenów to jedyna kluczowa liczba, w której wygrywa bezapelacyjnie. Ten sam ewaluator podaje jednak, że ukończenie jednego zadania otwartego kosztuje 0,67 USD w przypadku modelu Google i 7,60 USD w przypadku modelu Anthropic, co stanowi jedenastokrotność działającą w przeciwnym kierunku. Obie liczby są poprawne, a powód, dla którego współistnieją — limit 65 536 tokenów wyjściowych po jednej stronie i problem z rozwlekłością po drugiej — stanowi sedno tego porównania.

Czym właściwie jest każdy endpoint

Ustal tożsamości przed arytmetyką. Podmiotem tutaj jest anthropic/claude-sonnet-5.5, wydany 28 września 2026 r., dane wejściowe: tekst, obrazy i pliki, kontekst 1 000 000 tokenów, maksymalna długość wyjścia 128 000 tokenów, adaptacyjne myślenie z parametrem effort domyślnie ustawionym na high w Claude Platform. Przeciwnikiem jest google/gemini-3.1-pro-preview, wydany 19 lutego 2026 r., dane wejściowe: tekst, obrazy, wideo, dźwięk i pliki, kontekst 1 048 576 tokenów, maksymalna długość wyjścia 65 536 tokenów. Jedna z tych dwóch nazw zawiera słowo, którego nie ma druga, i nie jest to ozdoba.

Sufiks „preview” jest dołączony od siedmiu miesięcy. Google w tym okresie wydało kilka wersji Flash i nie wydało żadnego następcy warstwy Pro; model, który został zastąpiony przez 3.1 Pro, jest oznaczony jako wyłączony. Nic z tego nie jest wadą modelu — przez cały ten czas był dostępny, stabilny i prawidłowo wyceniony — ale oznacza to, że punkt końcowy, z którym się integrujesz, nie jest objęty zobowiązaniem dotyczącym cyklu życia dla ogólnej dostępności, a w tej rodzinie wycofano już jeden model Pro. Traktuj to jako stałą pozycję, a nie przypis, ponieważ zmienia to, ile kosztuje wieloletnia decyzja architektoniczna, jeśli popełnisz błąd.

Dwie liczby wskazujące w przeciwnych kierunkach

Najpierw porównanie na token, ponieważ to właśnie je wszyscy przeprowadzają i przemawia ono na korzyść nowszego modelu.

• Wejście — 2,00 USD za milion w obu przypadkach; dokładny remis przy stawce podstawowej

• Wyjście — 10,00 USD za Claude Sonnet 5.5 w porównaniu z 12,00 USD za Gemini 3.1 Pro; model Anthropic jest o 17% tańszy

• Odczyt z pamięci podręcznej — 0,20 USD za milion w przypadku obu poniżej granicy warstwy

• Zapis do pamięci podręcznej — 2,50 USD za milion w pięciominutowym oknie dla Claude Sonnet 5.5 w porównaniu z 0,375 USD dla Gemini 3.1 Pro; Google jest około siedem razy tańszy pod względem zapisu wpisu do pamięci podręcznej

• Kontekst — 1 000 000 wobec 1 048 576; różnica bez praktycznych konsekwencji

• Maksymalna długość wyjścia — 128 000 tokenów w porównaniu do 65 536; model Anthropic ma niemal dwukrotnie wyższy pułap

• Modalność wejściowa — tekst, obraz i plik w porównaniu z tekstem, obrazem, wideo, dźwiękiem i plikiem

Następnie porównanie dla poszczególnych zadań, od tego samego ewaluatora, w tym samym tygodniu, w konfiguracji maksymalnego wysiłku po obu stronach: 7,60 USD za Claude Sonnet 5.5 wobec 0,67 USD za Gemini 3.1 Pro. Jedenaście razy. Mechanizm jest udokumentowany na tej samej stronie, a nie wywnioskowany — Sonnet 5.5 wygenerował 410 milionów tokenów w całym zestawie testów indeksowych wobec mediany 88 milionów dla całej konkurencji, a ewaluator opisuje go jako bardzo rozwlekłego, podczas gdy Gemini 3.1 Pro jest opisywany jako dość zwięzły. Kiedy jeden model pisze kilkukrotnie więcej niż drugi, 17-procentowa przewaga w stawce za tokeny wyjściowe nie przetrwa kontaktu z fakturą.

Lekcja ta wykracza poza te dwa modele: cennik wycenia token, a rozliczasz się za ukończoną pracę. Każde porównanie, które zatrzymuje się na cenniku, mierzy niewłaściwą wielkość.

Granica poziomu przy 200 000 tokenów

Cennik Gemini 3.1 Pro nie jest jednolity, a ten skok jest wystarczająco duży, aby odwrócić część powyższego porównania. Dla promptów poniżej 200 000 tokenów stawki wynoszą 2,00 USD za wejście i 12,00 USD za wyjście, przy 0,20 USD za odczyt z pamięci podręcznej. Powyżej tej granicy całe wywołanie jest wyceniane na nowo: 4,00 USD za wejście, 18,00 USD za wyjście i 0,40 USD za odczyt z pamięci podręcznej — stawka za wejście podwaja się, osiągając dokładnie dwukrotność stawki Claude Sonnet 5.5, a stawka za wyjście zmienia się z 17% niższej po stronie Anthropic na 80% wyższą po stronie Google.

Ta granica nie jest egzotyczna. Prompt o rozmiarze 200 000 tokenów to niewielka baza kodu, długi zestaw umów, kilka godzin transkrypcji albo agent, który działa już od jakiegoś czasu. Praca z długim kontekstem to dokładnie to, do czego sprzedaje się okno o rozmiarze 1 mln tokenów, więc poziom, który najbardziej korzysta na tym oknie, jest także poziomem, na którym przewaga cenowa znika. Jeśli Twoje prompty regularnie przekraczają 200 000 tokenów, oceniaj Gemini 3.1 Pro przy stawkach 4,00 USD i 18,00 USD, a nie przy stawkach ze strony docelowej.

Zapisy do pamięci podręcznej zasługują na własne zdanie, ponieważ odwracają się w drugą stronę i przetrwają zmianę poziomu. Przy $0.375 za milion w porównaniu do $2.50, Gemini jest znacznie tańsze w wypełnianiu pamięci podręcznej, a ta stawka nie zmienia się, gdy przekraczasz granicę. Dla agenta, który odbudowuje duży prefiks w każdym kroku, zamiast go ponownie wykorzystywać, ta pojedyncza linia może być większą przewagą strukturalną niż stawka za wejście — i jest to jedyna linia w tym porównaniu, której nie dotyka żadna granica poziomu.

Limit 65,536 tokenów i dlaczego decyduje o architekturze

Liczba, która najbardziej zmienia to, co możesz zbudować, to maksymalna wielkość wyjścia: 65 536 tokenów w Gemini 3.1 Pro wobec 128 000 w Claude Sonnet 5.5. Pułap nie jest miarą wydajności; to ograniczenie tego, czy zadanie zmieści się w jednym wywołaniu.

Wszystko, co generuje duży artefakt — kompletny plik źródłowy, długi raport, pełny dokument, ustrukturyzowany zbiór danych — powyżej 65 536 tokenów w przypadku Gemini musi zostać rozłożone na łańcuch wywołań z przekazywanym między nimi stanem. Dekompozycja kosztuje więcej tokenów wejściowych na każdym kroku, więcej kodu orkiestracji oraz wprowadza nowy tryb awarii na stykach, w których kończy się jeden fragment, a zaczyna następny. Drugie ograniczenie to potęguje: własne materiały Anthropic wskazują praktyczny próg Sonnet 5.5 dla niezawodnej długiej pracy jako istotnie wyższy, a pułap Gemini jest tym bardziej restrykcyjnym z tych dwóch — i to dwukrotnie. Jeśli najdłuższy artefakt ma 40 000 tokenów, ta sekcja jest nieistotna i należy porównywać koszt przypadający na zadanie. Jeśli ma 100 000, pułap już podjął decyzję za ciebie.

Modalność — jedyna oś, którą Gemini posiada na wyłączność.

Gemini 3.1 Pro obsługuje wideo i audio; Claude Sonnet 5.5 obsługuje tekst, obrazy i pliki, a nie obsługuje żadnego z nich. W przypadku obciążenia opartego na multimediach — nagraniach rozmów, zrzutach ekranu, wideo produktowym, audio ze spotkań — w tym zestawieniu nie ma dostępnego zamiennika, a porównanie cen jest bezprzedmiotowe, ponieważ tylko jeden z dwóch punktów końcowych może w ogóle przyjąć dane wejściowe. W przypadku obciążeń tekstowych i obrazowych zestawy możliwości się pokrywają, a powyższa kalkulacja cenowa ma zastosowanie.

Inny wskaźnik operacyjny Gemini'ego wart jest przytoczenia, ponieważ łatwo go przeoczyć na stronie, która na pierwszym miejscu stawia inteligencję: nasz katalog mierzy medianę opóźnienia pierwszego tokenu na poziomie 10 000 ms przy p50 i szybkość generowania wyjścia blisko 1 283 tokenów na sekundę, przy siedmiodniowym wskaźniku błędów 56,8%. To niezwykle szybki model z bardzo wysokim zaobserwowanym wskaźnikiem niepowodzeń — kombinacja, która znacznie lepiej nadaje się do pracy wsadowej z hojnymi budżetami na ponowienia niż do czegokolwiek, na co użytkownik czeka. Claude Sonnet 5.5 to w porównaniu profil wolniejszy i stabilniejszy. Wskaźnik błędów nie pojawia się na stronie docelowej żadnego z dostawców; to liczba, która ujawnia się dopiero wtedy, gdy kandydaci znajdują się za jednym punktem końcowym, który ich mierzy — co jest jednym z powodów, by oceniać oba z jednego miejsca, a nie z dwóch pulpitów.

Co gdzie kierować

Wyślij to do Claude Sonnet 5.5, gdy praca dotyczy tekstu lub obrazu, gdy poprzeczka jakości jest wystarczająco wysoka, by różnica dwudziestu sześciu punktów w indeksie miała znaczenie, gdy artefakty wyjściowe są wystarczająco długie, by potrzebować limitu 128 000 tokenów, albo gdy obciążenie jest interaktywne, a wskaźnik błędów na poziomie 56,8% jest nie do przyjęcia. W przypadku zadań ustrukturyzowanych i ograniczonych kara za rozwlekłość, która daje wynik 7,60 USD, w dużej mierze znika, a przewaga na token staje się realnymi pieniędzmi.

Wyślij to do Gemini 3.1 Pro, gdy dane wejściowe zawierają wideo lub audio, gdy prompty mieszczą się poniżej 200 000 tokenów i wolumen jest wysoki, gdy często zapisujesz duże pamięci podręczne i zapis do pamięci podręcznej za 0,375 USD się kumuluje, lub gdy zadanie ma charakter wsadowy, a koszt na zadanie to jedyna kolumna, która się liczy — przy 0,67 USD za zadanie wobec 7,60 USD możesz pozwolić sobie na bardzo wiele ponownych prób.

Oba są dziś trasowane w OrcaRouter. google/gemini-3.1-pro-preview i anthropic/claude-sonnet-5 to aktywne pozycje katalogowe dostępne na jednym poświadczeniu w cenie katalogowej dostawcy z 0% marży, co oznacza, że powyższy podział można wyrazić jako regułę routingu, a nie jako dwie integracje — żądania o profilu multimedialnym do jednego punktu końcowego, żądania tekstowe i obrazowe do drugiego, z przełączeniem awaryjnym, jeśli którykolwiek zacznie zwracać błędy. Claude Sonnet 5.5 nie jest jeszcze trasą na naszej platformie; gdy zostanie wpisany, ta sama reguła obejmie go bez nowego klucza.

Szczery werdykt dla tego starcia: Claude Sonnet 5.5 jest znacznie lepszym modelem i tańszym w przeliczeniu na token, a Gemini 3.1 Pro jest około jedenaście razy tańszy na ukończone zadanie w pracy otwartej, sześć razy tańszy przy zapisie pamięci podręcznej i jedynym z tej dwójki, który potrafi obejrzeć wideo. Ktoś, kto cytuje ci cennik, opisuje porównanie, które nie istnieje; to, które istnieje, dotyczy tego, które żądania możesz ograniczyć.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie