Gegenereerde hero-titelkaart voor Claude Sonnet 5.5 vs Gemini 3.1 Pro, met als ondertitel 'Goedkoper per token, elf keer duurder per taak', met $2,00 en $10,00 per miljoen tokens tegenover $2,00 en $12,00, waarbij rechts een outputplafond van 65.536 tokens wordt vermeld, en het OrcaRouter-logo in de rechteronderhoek is gecompositeerd.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: goedkoper per token, elf keer duurder per taak

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op de tariefkaart is Claude Sonnet 5.5 het goedkopere model, en qua capaciteiten is het geen gelijkopgaande strijd. Het bereikte algemene beschikbaarheid op 28 september 2026 voor $2,00 per miljoen input-tokens en $10,00 per miljoen output-tokens; Gemini 3.1 Pro, aangekondigd op 19 februari 2026 en nog steeds aangeboden via een preview-endpoint, kost $2,00 en $12,00. Sonnet 5.5 scoort ook 56 op de Intelligence Index v4.3 van Artificial Analysis tegenover de 30 van Gemini 3.1 Pro Preview — een gat van zesentwintig punten op één enkele testomgeving. De context van 1.048.576 tokens van Gemini is het enige opvallende cijfer waarop het overtuigend wint. Toch meldt dezelfde evaluator dat het afronden van één open-ended taak $0,67 kost op het Google-model en $7,60 op het Anthropic-model, wat een factor elf de andere kant op is. Beide cijfers zijn correct, en de reden dat ze naast elkaar bestaan — een outputplafond van 65.536 tokens aan de ene kant en een probleem met breedsprakigheid aan de andere — is de kern van deze hele vergelijking.

Wat elk eindpunt eigenlijk is

Stel de identiteiten vast voordat je gaat rekenen. Het subject hier is anthropic/claude-sonnet-5.5, uitgebracht op 28 september 2026, tekst-, afbeeldings- en bestandsinvoer, context van 1.000.000 tokens, maximale uitvoer van 128.000 tokens, adaptief denken met een effort-parameter die standaard op high staat op het Claude Platform. De tegenstander is google/gemini-3.1-pro-preview, uitgebracht op 19 februari 2026, tekst-, afbeeldings-, video-, audio- en bestandsinvoer, context van 1.048.576 tokens, maximale uitvoer van 65.536 tokens. Een van die twee namen bevat een woord dat de andere niet heeft, en dat is geen decoratie.

Het achtervoegsel 'preview' hangt er al zeven maanden aan. Google bracht in dat venster verschillende Flash-releases uit en geen opvolger van de Pro-tier; het model dat door 3.1 Pro werd vervangen, staat als stopgezet vermeld. Niets daarvan is een defect aan het model — het is al die tijd live, stabiel en correct geprijsd geweest — maar het betekent wel dat het endpoint waartegen je integreert niet valt onder een levenscyclusverplichting voor algemene beschikbaarheid, en deze familie heeft al één Pro-model buiten gebruik gesteld. Behandel dat als een blijvende regelpost in plaats van een voetnoot, want het verandert wat een architectuurbeslissing voor meerdere jaren kost als je het verkeerd aanpakt.

Twee getallen die in tegengestelde richtingen wijzen

De vergelijking per token eerst, omdat het degene is die iedereen uitvoert en die het nieuwere model bevoordeelt.

• Invoer — $2,00 per miljoen voor beide; exact gelijk op het tarief in de kop

• Uitvoer — $10,00 voor Claude Sonnet 5.5 tegenover $12,00 voor Gemini 3.1 Pro; het Anthropic-model is 17% goedkoper

• Cache-lezen — $0,20 per miljoen voor beide onder de niveaugrens

• Cacheschrijven — $2,50 per miljoen voor het vijfminutenvenster op Claude Sonnet 5.5 tegenover $0,375 voor Gemini 3.1 Pro; Google is ongeveer zeven keer goedkoper om een cache-entry mee te schrijven.

• Context — 1.000.000 tegenover 1.048.576; een verschil zonder praktische gevolgen

• Maximale uitvoer — 128.000 tokens tegenover 65.536; het Anthropic-model heeft een bijna twee keer zo hoog plafond

• Invoermodaliteit — tekst, afbeelding en bestand tegenover tekst, afbeelding, video, audio en bestand

Dan de vergelijking per taak, van dezelfde beoordelaar, in dezelfde week, in een configuratie met maximale inspanning aan beide zijden: $7,60 voor Claude Sonnet 5.5 tegen $0,67 voor Gemini 3.1 Pro. Elf keer. Het mechanisme wordt op dezelfde pagina gedocumenteerd in plaats van afgeleid — Sonnet 5.5 genereerde 410 miljoen tokens in de indexsuite tegen een mediaan van 88 miljoen voor het veld, wat de beoordelaar als zeer uitgebreid beschrijft, terwijl Gemini 3.1 Pro als vrij beknopt wordt beschreven. Wanneer het ene model meerdere keren zoveel schrijft als het andere, overleeft een voordeel van 17% op het outputtarief het contact met de factuur niet.

De les reikt verder dan deze twee modellen: een tariefkaart geeft een prijs aan een token, en je betaalt voor voltooid werk. Elke vergelijking die stopt bij de prijslijst meet de verkeerde grootheid.

De niveaugrens bij 200.000 tokens

De prijsstelling van Gemini 3.1 Pro is niet uniform, en de sprong is groot genoeg om delen van de bovenstaande vergelijking om te keren. Bij een prompt van minder dan 200.000 tokens zijn de tarieven $2,00 voor invoer en $12,00 voor uitvoer, met $0,20 voor het lezen uit cache. Boven die grens wordt de hele aanroep opnieuw geprijsd tegen $4,00 invoer, $18,00 uitvoer en $0,40 voor het lezen uit cache — het invoertarief verdubbelt tot precies het dubbele van dat van Claude Sonnet 5.5, en de uitvoer gaat van 17% goedkoper aan de Anthropic-kant naar 80% duurder aan de Google-kant.

De grens is niet exotisch. Een prompt van 200.000 tokens is een kleine codebase, een lange set contracten, een paar uur transcript, of een agent die al een tijdje aan het werk is. Werk met een lange context is precies waarvoor een venster van 1M tokens wordt verkocht, dus het niveau dat het venster het meest beloont, is ook het niveau waar het prijsvoordeel verdwijnt. Als je prompts regelmatig 200.000 tokens overschrijden, evalueer Gemini 3.1 Pro dan tegen $4,00 en $18,00, niet tegen de tarieven op de landingspagina.

Cache-writes verdienen een eigen zin, want ze keren om in de tegenovergestelde richting en overleven de tierwijziging. Tegen $0,375 per miljoen tegenover $2,50 is Gemini veel goedkoper om een cache mee te vullen, en dat tarief verandert niet wanneer je de grens oversteekt. Voor een agent die elke beurt een grote prefix opnieuw opbouwt in plaats van er een te hergebruiken, kan die ene regel een groter structureel voordeel zijn dan het invoertarief — en het is de enige regel in deze vergelijking die door geen enkele tiergrens wordt geraakt.

Het plafond van 65.536 tokens, en waarom dat de architectuur bepaalt

Het getal dat het meest verandert aan wat je kunt bouwen, is de maximale output: 65.536 tokens op Gemini 3.1 Pro tegenover 128.000 op Claude Sonnet 5.5. Een plafond is geen prestatiemaatstaf; het is een beperking op de vraag of een taak in één aanroep past.

Alles wat een groot artefact produceert — een volledig bronbestand, een lang rapport, een volledig document, een gestructureerde dataset — moet in het geval van Gemini boven de 65.536 tokens worden opgesplitst in een keten van aanroepen waarbij state tussen de aanroepen wordt doorgegeven. Decompositie kost bij elke stap meer invoertokens, meer orchestratiecode en introduceert een nieuwe faalmodus op de naden waar de ene chunk eindigt en de volgende begint. Een tweede beperking verergert dit: het eigen materiaal van Anthropic stelt de praktische drempel van Sonnet 5.5 voor betrouwbaar lang werk aanzienlijk hoger, en het plafond van Gemini is het strakkere van de twee, met een factor twee. Als je langste artefact 40.000 tokens is, is deze sectie irrelevant en moet je op kosten per taak vergelijken. Als het 100.000 is, heeft het plafond de beslissing al voor je genomen.

Modaliteit, de enige as die Gemini volledig bezit

Gemini 3.1 Pro accepteert video en audio; Claude Sonnet 5.5 accepteert tekst, afbeeldingen en bestanden en kan geen van beide aan. Voor een workload die rond media is opgebouwd — gespreksopnamen, schermopnamen, productvideo, vergaderaudio — is er in deze combinatie geen vervanging beschikbaar, en is de prijsvergelijking irrelevant omdat slechts één van de twee eindpunten de invoer überhaupt kan accepteren. Voor tekst- en afbeeldingsworkloads overlappen de capaciteitensets elkaar en is de bovenstaande prijsberekening bepalend.

Het andere operationele cijfer van Gemini is het vermelden waard, omdat het makkelijk over het hoofd te zien is op een pagina die intelligentie vooropstelt: onze catalogus meet een mediane first-tokenlatentie van 10.000 ms bij p50 en een outputsnelheid van bijna 1.283 tokens per seconde, met een foutpercentage over zeven dagen van 56,8%. Dat is een uiterst snel model met een zeer hoog waargenomen uitvalpercentage — een combinatie die veel beter geschikt is voor batchwerk met ruime retrybudgetten dan voor alles waar een gebruiker op zit te wachten. Claude Sonnet 5.5 is in vergelijking het langzamere, stabielere profiel. Het foutpercentage komt op de landingspagina van geen van beide leveranciers voor; het is het soort cijfer dat alleen opduikt wanneer de kandidaten achter één enkele endpoint die hen meet zitten, wat een reden is om beide op één plek te evalueren in plaats van op twee dashboards.

Wat waar naartoe routeren

Stuur het naar Claude Sonnet 5.5 wanneer het werk tekst of beeld is, wanneer de kwaliteitslat hoog genoeg ligt dat een indexkloof van zesentwintig punten ertoe doet, wanneer de output-artefacten lang genoeg zijn om het plafond van 128.000 tokens nodig te hebben, of wanneer de werklast interactief is en een foutpercentage van 56,8% onacceptabel is. Bij gestructureerde, afgebakende taken vervliegt de uitgebreidheidsstraf die het cijfer van $7,60 oplevert grotendeels, en wordt het voordeel per token echt geld.

Stuur het naar Gemini 3.1 Pro wanneer de invoer video of audio bevat, wanneer prompts onder de 200.000 tokens blijven en het volume hoog is, wanneer je vaak grote caches schrijft en de cache-write van $0,375 zich opstapelt, of wanneer de taak batchvormig is en de kosten per taak de enige kolom zijn die ertoe doen — bij $0,67 per taak tegenover $7,60 kun je een groot aantal herpogingen veroorloven.

Beide zijn vandaag routeerbaar op OrcaRouter. google/gemini-3.1-pro-preview en anthropic/claude-sonnet-5 staan beide als live catalogusvermeldingen op één credential tegen de lijstprijs van de provider met 0% markup, wat betekent dat de splitsing hierboven kan worden uitgedrukt als één routeringsregel in plaats van als twee integraties — de media-achtige verzoeken naar het ene endpoint, de tekst-en-beeldverzoeken naar het andere, met failover als een van beide fouten begint te geven. Claude Sonnet 5.5 is nog geen route op ons platform; zodra die wordt vermeld, dekt dezelfde regel die zonder nieuwe sleutel.

Het eerlijke oordeel over deze confrontatie: Claude Sonnet 5.5 is met een ruime marge het betere model en het goedkopere per token, en Gemini 3.1 Pro is ongeveer elf keer goedkoper per afgeronde taak bij open-ended werk, zes keer goedkoper om een cache mee te schrijven, en de enige van de twee die een video kan bekijken. Iedereen die je de tariefkaart voorhoudt, beschrijft een vergelijking die niet bestaat; de vergelijking die wél bestaat, gaat erover welke aanvragen je kunt begrenzen.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt