Genererade ett hero-titelkort för Claude Sonnet 5.5 vs Gemini 3.1 Pro, med undertexten ”Billigare per token, elva gånger dyrare per uppgift”, som visar $2.00 och $10.00 per miljon tokens mot $2.00 och $12.00 med ett utdatatak på 65 536 token noterat till höger, och OrcaRouter-logotypen komponerad i det nedre högra hörnet.
Guides & Insights

Claude Sonnet 5.5 mot Gemini 3.1 Pro: billigare per token, elva gånger dyrare per uppgift

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

På prislistan är Claude Sonnet 5.5 den billigare modellen och kapacitetsmässigt är det inte ens nära. Den nådde allmän tillgänglighet den 28 september 2026 till $2.00 per miljon indata-tokens och $10.00 per miljon utdata-tokens; Gemini 3.1 Pro, som annonserades den 19 februari 2026 och fortfarande levereras från en förhandsgransknings-endpoint, kostar $2.00 och $12.00. Sonnet 5.5 får också 56 på Artificial Analysis Intelligence Index v4.3, mot 30 för Gemini 3.1 Pro Preview — en tjugosex poängs lucka i en enda testrigg. Gem​inis kontext på 1 048 576 tokens är den enda rubriksiffran som den vinner ohotat. Ändå rapporterar samma utvärderare att det kostar $0.67 att slutföra en öppen uppgift på Goog​le-modellen och $7.60 på Anthro​pic-modellen, vilket är en faktor elva åt motsatt håll. Båda siffrorna är korrekta, och anledningen till att de kan samexistera — ett tak på 65 536 tokens för utdata på ena sidan och ett mångordighetsproblem på den andra — är hela denna jämförelse.

Vad varje slutpunkt faktiskt är

Fastställ identiteterna före aritmetiken. Subjektet här är anthropic/claude-sonnet-5.5, släppt den 28 september 2026, text-, bild- och filinmatning, kontext på 1 000 000 tokens, maximal utdata på 128 000 tokens, adaptivt tänkande med en effort-parameter som är inställd på hög som standard på Claude Platform. Motståndaren är google/gemini-3.1-pro-preview, släppt den 19 februari 2026, text-, bild-, video-, ljud- och filinmatning, kontext på 1 048 576 tokens, maximal utdata på 65 536 tokens. Ett av dessa två namn bär ett ord som det andra inte har, och det är inte dekoration.

Preview-suffixet har suttit på i sju månader. Google släppte flera Flash-versioner under den perioden och ingen efterträdare till Pro-nivån; modellen som 3.1 Pro ersatte listas som nedstängd. Inget av detta är en defekt i modellen – den har varit i drift, stabil och korrekt prissatt hela tiden – men det betyder att den slutpunkt du integrerar mot inte omfattas av ett livscykelåtagande för allmän tillgänglighet, och den här familjen har redan avvecklat en Pro-modell. Behandla det som en stående radpost snarare än en fotnot, eftersom det förändrar vad ett flerårigt arkitekturbeslut kostar om du gör fel.

Två tal som pekar i motsatta riktningar

Jämförelsen per token först, eftersom det är den som alla kör och den gynnar den nyare modellen.

• Indata — $2.00 per miljon för båda; exakt lika i rubrikpriset

• Utdata — 10,00 USD för Claude Sonnet 5.5 mot 12,00 USD för Gemini 3.1 Pro; Anthropic-modellen är 17 % billigare

• Cacheläsning — $0,20 per miljon för båda under nivågränsen

• Cacheskrivning — $2.50 per miljon för femminutersfönstret på Claude Sonnet 5.5 mot $0.375 för Gemini 3.1 Pro; Google är ungefär sju gånger billigare att skriva en cachepost med

• Kontext — 1 000 000 mot 1 048 576; en skillnad utan praktisk betydelse

• Maximal utdata — 128 000 tokens mot 65 536; Anthropic-modellen har nästan dubbelt så högt tak

• Indatamodalitet — text, bild och fil mot text, bild, video, ljud och fil

Sedan jämförelsen per uppgift, från samma utvärderare, under samma vecka, i en konfiguration för maximal ansträngning på båda sidor: 7,60 dollar för Claude Sonnet 5.5 mot 0,67 dollar för Gemini 3.1 Pro. Elva gånger. Mekanismen dokumenteras på samma sida i stället för att härledas – Sonnet 5.5 genererade 410 miljoner token i indexsviten mot en median på 88 miljoner för fältet, vilket utvärderaren beskriver som mycket ordrikt, medan Gemini 3.1 Pro beskrivs som ganska koncis. När en modell skriver flera gånger så mycket som den andra överlever inte en fördel på 17 % i utdatapriset mötet med fakturan.

Lärdomen sträcker sig bortom dessa två modeller: en prislista sätter ett pris på en token, och du faktureras för färdigt arbete. Varje jämförelse som stannar vid prisbladet mäter fel kvantitet.

Nivågränsen vid 200 000 tokens

Prissättningen för Gemini 3.1 Pro är inte platt, och steget är tillräckligt stort för att invertera delar av jämförelsen ovan. Under en prompt på 200 000 token är priserna $2.00 för indata och $12.00 för utdata med en cacheläsning på $0.20. Ovanför den gränsen omprissätts hela anropet till $4.00 för indata, $18.00 för utdata och $0.40 för cacheläsning — indatapriset fördubblas till exakt dubbelt så mycket som Claude Sonnet 5.5:s, och utdata går från 17 % billigare på Anthropics sida till 80 % dyrare på Googles sida.

Gränsen är inte exotisk. En prompt på 200 000 token är en liten kodbas, en lång uppsättning avtal, några timmars transkription eller en agent som har arbetat ett tag. Arbete med lång kontext är precis vad ett fönster på 1 miljon token säljs för, så den nivå som belönar fönstret mest är också den nivå där prisfördelen försvinner. Om dina prompter rutinmässigt överskrider 200 000 token bör du utvärdera Gemini 3.1 Pro till $4.00 och $18.00, inte till priserna på landningssidan.

Cacheskrivningar förtjänar en egen mening, eftersom de inverterar i den andra riktningen och överlever nivåbytet. Med $0,375 per miljon mot $2 000 per miljon är Gemini långt billigare att fylla en cache med, och det ändras inte när man går till en högre nivå. För en agent som bygger om ett stort prefix varje tur i stället för att återanvända ett kan just den raden vara en större strukturell fördel än inputpriset — och det är det enda i den här jämförelsen som ingen nivågräns kan ändra.

Taket på 65 536 token, och varför det avgör arkitekturen

Den siffra som förändrar mest vad du kan bygga är den maximala utdatan: 65 536 tokens på Gemini 3.1 Pro mot 128 000 på Claude Sonnet 5.5. Ett tak är inte ett prestandamått; det är en begränsning för huruvida en uppgift ryms i ett anrop.

Allt som genererar en stor artefakt – en komplett källfil, en lång rapport, ett fullständigt dokument, en strukturerad datauppsättning – över 65 536 tokens i Geminis fall måste delas upp i en kedja av anrop med tillstånd som skickas mellan dem. Uppdelning kostar fler indatatokens i varje steg, mer orkestreringskod och ett nytt felmod vid skarvarna där en del slutar och nästa börjar. En andra begränsning förvärrar det: Anthropics eget material placerar Sonnet 5.5:s praktiska tröskel för tillförlitligt långt arbete väsentligt högre, och Geminis tak är det snävare av de två med en faktor två. Om din längsta artefakt är 40 000 tokens är det här avsnittet irrelevant och du bör jämföra utifrån kostnad per uppgift. Om den är 100 000 har taket redan fattat beslutet åt dig.

Modalitet, den enda axeln som Gemini helt och hållet äger

Gemini 3.1 Pro tar emot video och ljud; Claude Sonnet 5.5 tar emot text, bilder och filer och kan inte ta emot något av dessa. För en arbetsbelastning byggd kring media – samtalsinspelningar, skärminspelningar, produktvideo, mötesljud – finns ingen ersättning tillgänglig i denna kombination, och prisjämförelsen är irrelevant eftersom bara en av de två ändpunkterna överhuvudtaget kan ta emot indata. För text- och bildarbetsbelastningar överlappar funktionsuppsättningarna och prisberäkningen ovan gäller.

Geminis andra driftstal är värt att nämna eftersom det är lätt att missa på en sida som marknadsför intelligens först: vår katalog mäter en medianlatens för första token på 10 000 ms vid p50 och en utdatahastighet nära 1 283 tokens per sekund, med en sjudagars felfrekvens på 56,8 %. Det är en extremt snabb modell med en mycket hög observerad felfrekvens – en kombination som passar batcharbete med generösa återförsöksbudgetar mycket bättre än något en användare väntar på. Claude Sonnet 5.5 är jämförelsevis den långsammare, jämnare profilen. Felfrekvensen visas inte på någon av leverantörernas landningssidor; det är en sådan siffra som bara dyker upp när kandidaterna ligger bakom en enda slutpunkt som mäter dem, vilket är ett skäl att utvärdera båda från en plats i stället för två instrumentpaneler.

Vad som ska routas vart

Skicka det till Claude Sonnet 5.5 när arbetet är text eller bild, när kvalitetsribban är tillräckligt hög för att ett indexgap på tjugosex punkter ska spela roll, när utdataartefakterna är tillräckligt långa för att behöva taket på 128 000 token, eller när arbetsbelastningen är interaktiv och en felfrekvens på 56,8 % är oacceptabel. På strukturerade, avgränsade uppgifter försvinner till stor del mångordighetsstraffet som ger siffran 7,60 dollar, och fördelen per token blir riktiga pengar.

Skicka det till Gemini 3.1 Pro när indata innehåller video eller ljud, när promptar håller sig under 200 000 tokens och volymen är hög, när du ofta skriver stora cachar och cacheskrivningen på 0,375 $ ackumuleras, eller när uppgiften är batchformad och kostnaden per uppgift är den enda kolumnen som spelar roll — vid 0,67 $ per uppgift mot 7,60 $ har du råd med en hel del återförsök.

Båda är routbara på OrcaRouter idag. google/gemini-3.1-pro-preview och anthropic/claude-sonnet-5 är båda aktiva katalogposter på en och samma autentiseringsuppgift till leverantörens listpris med 0 % påslag, vilket innebär att uppdelningen ovan kan uttryckas som en routningsregel i stället för som två integrationer — de medieformade förfrågningarna till en endpoint, text- och bildförfrågningarna till den andra, med failover om någon av dem börjar ge fel. Claude Sonnet 5.5 är ännu inte en route på vår plattform; när den listas täcker samma regel den utan en ny nyckel.

Den ärliga domen om den här matchningen: Claude Sonnet 5.5 är den bättre modellen med bred marginal och den billigare per token, och Gemini 3.1 Pro är ungefär elva gånger billigare per slutförd uppgift i öppet arbete, sex gånger billigare att skriva en cache med, och den enda av de två som kan se en video. Den som citerar prislistan för dig beskriver en jämförelse som inte finns; den som faktiskt finns handlar om vilka förfrågningar du kan avgränsa.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen