
Claude Sonnet 5.5 vs GPT-6 Sol: In de prijsklasse van $2 zitten nu twee topmodellen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Claude Sonnet 5.5 en GPT-6 Sol hebben exact dezelfde prijs — $2 per miljoen inputtokens, $10 per miljoen outputtokens — en ze verschenen zes dagen na elkaar, eind september 2026. Dat toeval is niet het interessante deel. Het interessante is dat toen Artificial Analysis beide modellen mat op zijn v4.3.2 Intelligence Index, het middenklasse-model van Anthropic hoger eindigde dan het model dat OpenAI als zijn vlaggenschip verkoopt: 56 voor Claude Sonnet 5.5 tegenover 47 voor GPT-6 Sol. In dezelfde revisie staat Claude Sonnet 5 — het model dat Sonnet 5.5 vervangt — op 38.
Dit is dus niet langer een vergelijking van een goedkope tier tegenover een dure. Het is een vergelijking van twee modellen in dezelfde prijsklasse, van twee labs, met een verschil van 18 punten tussen de Anthropic-versie en zijn eigen voorganger, en een verschil van negen punten in het voordeel van Anthropic tegenover de top-end release van OpenAI. Alles hieronder is een poging om uit te zoeken welke van die verschillen standhouden onder een echte workload, en welke ervan een benchmarkartefact zijn.
Wat elk model daadwerkelijk is
Claude Sonnet 5.5 is het tweede model in Anthropic's 5.5-generatie, uitgebracht op 28 september 2026, vijf dagen na de lancering van Claude Opus 5.5 die het aankondigde. Het draagt de id claude-sonnet-5-5 in de Claude API, Amazon Bedrock, Google Cloud en Microsoft Foundry, behoudt het contextvenster van 1M tokens en het uitvoerplafond van 128K van deze tier, en houdt de prijzen van Claude Sonnet 5 exact aan: $2 in, $10 uit, $0,20 per miljoen voor cache-reads, $2,50 voor een cache-write van vijf minuten. Het is vanaf dag één beschikbaar met nul dataretentie, en Anthropic's toezegging over de pensionering loopt tot 28 september 2027.

GPT-6 Sol is de opvolger van het model dat verwarrend genoeg GPT-5.6 Sol heet — het model dat OrcaRouter nog steeds als bereikbaar vermeldt tegen $4 voor invoer en $20 voor uitvoer, en dat Artificial Analysis inmiddels als verouderd heeft gemarkeerd met een verwijzing naar GPT-6 Sol. Het nieuwe model verscheen op 22 september 2026 tegen $2 / $10, met een contextvenster van 1.050.000 tokens, een uitvoerplafond van 128K en een getrapt tarief: het genoemde tarief van $2 / $10 geldt tot 272.000 invoertokens, en alles daarboven wordt gefactureerd tegen $4 / $15.
Dat laatste detail is de eerste plek waar de framing van "identieke prijsstelling" breekt.
De prijsgelijkheid geldt alleen voor korte prompts.
Beide tariefkaarten vermelden $2 en $10, en bijna elke vergelijking op de lanceerdag stopte daar. Zet de twee naast elkaar op de voorwaarden die de rekening bepalen:
• Hoofdtarief — Claude Sonnet 5.5 $2 / $10 vs. GPT-6 Sol $2 / $10
• Tarief voor lange context — Sonnet 5.5 factureert het volledige 1M-venster tegen het standaardtarief; GPT-6 Sol verdubbelt naar $4 / $15 boven 272.000 invoertokens
• Contextvenster — 1.000.000 tokens vs. 1.050.000 tokens
• Maximale uitvoer — 128K tokens op de synchrone API voor beide; Sonnet 5.5 bereikt 300K op de Message Batches API achter de output-300k-2026-03-24 header
• Batchkorting — 50% korting op input en output voor Sonnet 5.5; controleer de actuele voorwaarden van OpenAI voor Sol in plaats van te veronderstellen dat ze gelijk zijn
• Cache-leesbewerkingen — $0,20 per miljoen voor beide
Een repository-sweep van 800.000 tokens is per token twee keer zo duur op GPT-6 Sol als op Claude Sonnet 5.5, en dat is precies de workload waarvoor beide modellen op de markt worden gebracht. Als je prompts kort zijn, zijn de tariefkaarten echt aan elkaar gewaagd en zou prijs niets moeten beslissen. Als ze lang zijn, heeft de prijs dat al gedaan.
Anthropics eigen scorebord, lees aandachtig.
Anthropic heeft een vierkoloms vergelijking gepubliceerd met Claude Sonnet 5, Claude Opus 5.5 en GPT-6 Sol. De door de leverancier gerapporteerde cijfers, die nog door geen enkele derde partij zijn gereproduceerd:

• Terminal-Bench 4.0 — Sonnet 5.5 70,6% vs. Sonnet 5 10,3%
• FrontierCode 1.1, Main — Sonnet 5.5 46,2% bij maximale inspanning, Sonnet 5 42,4%, Opus 5.5 54,4%, GPT-6 Sol 49,3%
• CursorBench 4.0 — Sonnet 5.5 55,5% vs Sonnet 5 34,1% vs Opus 5.5 57,8%
• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs Sonnet 5 1359 vs Opus 5.5 1822 vs GPT-6 Sol 1483
• Humanity's Last Exam, met tools — Sonnet 5.5 64,5% vs Sonnet 5 54,9% vs Opus 5.5 67,7%
• OSWorld 2.1, gedeeltelijk — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%
• Grafieken maken, geen hulpmiddelen — Sonnet 5.5 61,6% vs Sonnet 5 15,6% vs Opus 5.5 64,4% vs GPT-6 Sol 53,6%
Twee van die rijen bevatten voetnoten en beide zijn van belang. De GDPval-AA-, AA-Briefcase- en Chartography-cijfers voor GPT-6 Sol worden door Anthropic gemarkeerd als gemeten na een fix voor beeldbegrip aan de kant van OpenAI, en het FrontierCode-cijfer voor Sonnet 5.5 is het Max-effort-resultaat, waarvan Anthropic opmerkt dat het onder zijn eigen Xhigh-resultaat bij dezelfde evaluatie lag. Een leverancier die zichzelf vergelijkt met een concurrent op een benchmark die hij zelf uitvoert, met voetnoten die beide partijen nuanceren, is geen neutraal bewijs. Het is het beste bewijs dat op de dag van de lancering beschikbaar is, en het is niet hetzelfde als een meting.
Wat de onafhankelijke cijfers zeggen, en wat ze niet zeggen
Artificial Analysis heeft een eerste onafhankelijke run gepubliceerd: Index 56 op v4.3.2, kosten van $7,60 per Index-taak, en een verboseheidscijfer van 410M outputtokens tegenover een mediaan van 88M. Dat verboseheidscijfer verdient meer aandacht dan het nu krijgt. Het betekent dat het model de neiging heeft om heel veel tokens te besteden op weg naar een antwoord, en het is het mechanisme achter de enige efficiëntieclaim die niet uit de eigen tabel van Anthropic komt.
Anthropic zegt dat Claude Sonnet 5.5 output 30% sneller genereert dan Claude Sonnet 5 en "tot 30% minder per taak" kost bij hetzelfde tarief per token. Die twee beweringen samen beschrijven een model dat hetzelfde werk doet met minder tokens, niet een goedkopere tariefkaart. Of dat standhoudt, is precies waar een verbositeitsmeting van 410M tokens voor dient, en één onafhankelijke run is niet genoeg om dat te beslechten — maar het is genoeg om te zeggen dat de marketingzin en het gemeten tokental in tegengestelde richtingen wijzen, en het gemeten aantal is degene dat op een factuur verschijnt.
Merk ook op wat de {{1}} nog niet bevat. Er is geen {{2}} OSWorld-, Terminal- of Cursor-replicatie van iemand bij Anthropic. En de {{3}} is een samengestelde maatstaf: die zegt niets over de tien evaluaties in {{4}}. Een voorsprong van negen punten kan een verlies van vijftien punten verbergen op die ene evaluatie waar jouw workload van afhangt.
Waar ze uiteenlopen op manieren die een tariefkaart niet kan weergeven
Prijs en indexscore zijn de twee eenvoudige assen. De assen die een migratie bepalen, zijn de gedragsmatige, en hier liggen de twee modellen ver uit elkaar.

Claude Sonnet 5.5 heeft adaptief denken standaard ingeschakeld met high als standaardinspanning, en verwijdert drie dingen die de vorige generatie toestond: het verzenden van thinking: {"type": "disabled"} geeft nu een 400 terug en moet worden vervangen door between_tools; geforceerd gebruik van tools — tool_choice ingesteld op "any" of een met naam opgegeven tool — geeft direct een 400 terug; en de oudere computer_20251124 computer-use-tool wordt op de Claude API en in Google Cloud afgewezen ten gunste van een toolset. Thinking-blokken zijn nu ook gebonden aan het model dat ze heeft geproduceerd, dus een gesprek kan van Claude Sonnet 5 naar Claude Sonnet 5.5 verhuizen en zijn redenering behouden, maar kan er niet meer mee terugkeren.
Stelt je agent-looptool_choice: "any" in om een schema-valide aanroep af te dwingen, dan weigert Claude Sonnet 5.5 het verzoek totdat je overschakelt naar auto met strikt toolgebruik of gestructureerde uitvoer. Dat is een echte migratietaak, en het is precies het soort ding dat van een wijziging van één regel in de model-ID een middag werk maakt.
De kosten van een overstap naar GPT-6 Sol zijn van een andere aard, omdat het model dat het vervangt nog steeds in de catalogus staat en nog steeds wordt aangeroepen. GPT-5.6 Sol is niet teruggetrokken; het is verouderd bij Artificial Analysis, geprijsd op het dubbele van het nieuwe model, en ontvangt nog steeds verkeer. OrcaRouter's eigen metingen tonen dat het wekelijks ongeveer 95 miljoen tokens verwerkt, wat een redelijke indicatie is van hoeveel integraties nog niet zijn gemigreerd. Overstappen naar GPT-6 Sol is een prijsbeslissing die je later kunt nemen; je hoeft die nu niet te nemen.
De vergelijking uitvoeren op één sleutel
Het praktische probleem met een vergelijking tussen twee leveranciers is dat het je meestal twee accounts, twee SDK-trajecten en twee sets rate limits kost voordat je iets leert. OrcaRouter bestaat om dat weg te nemen: één OpenAI-compatibel endpoint, meer dan 200 modellen, de lijstprijs van de provider doorberekend zonder opslag, en automatische failover tussen providers.
Beide modellen die hier van belang zijn, zijn er vandaag op te routeren. GPT-6 Sol staat in de catalogus voor $2 / $10, met de long-contextlaag intact, en Claude Sonnet 5 — het model waarop het meeste Claude API-verkeer nog steeds draait, met een gemeten 150 outputtokens per seconde en een p50-tijd tot de eerste token van ongeveer vijf seconden — staat sinds 30 juni op het platform voor Anthropics eigen $2 / $10.
Claude Sonnet 5.5 zelf staat nog niet in onze catalogus. Hoewel dat klopt, is de eerlijke weg ernaartoe de eigen API van de leverancier en de drie clouds die Anthropic vermeldt, en de eerlijke manier om het te evalueren is om het te richten op een deel van het verkeer dat je kunt missen. Daarvoor is de routeringslaag bedoeld: promoveer een percentage, houd het foutpercentage in de gaten, en houd het vorige model als terugvaloptie in plaats van als terugdraaiplan.
Welke gaat er naar productie?
Kies op basis van de vorm van de werklast, niet op basis van een samengestelde score.
Claude Sonnet 5.5 is de betere aankoop voor werk met een lange context, voor alles wat al is geschreven op het Anthropic tool-use- en computer-use-oppervlak, en voor teams wier prompts regelmatig meer dan een kwart miljoen tokens overschrijden — het vasttariefvenster is daar meer waard dan welke indexdelta dan ook. Accepteer dat er een checklist aan de migratie vastzit: geforceerd toolgebruik, de denk-schakelaar, de advisor-toolkoppelingen en een wijziging van de computer-use-tool.
GPT-6 Sol is de veiligere keuze voor continuïteit voor een OpenAI-vormige stack, en de goedkopere als je prompts kort zijn en je integraties al gebouwd zijn. Het voordeel is niet capaciteit — op de composite blijft het achter — maar dat zijn voorganger nog steeds draait en de migratie geen deadline heeft.
Op basis van de cijfers die vandaag beschikbaar zijn, wint Claude Sonnet 5.5 de rechtstreekse vergelijking op de onafhankelijke index en op het gebied van de economie van lange contexten, en verliest op niets dat enige gepubliceerde meting tot nu toe kan detecteren buiten de betrouwbaarheidsmarge van de eigen tabel van de leverancier. Dat is een beperktere bewering dan in het lanceringsmateriaal wordt gedaan, en het is de bewering waarop het de moeite loont te handelen.
Wat het antwoord zou veranderen, is een tweede onafhankelijke run op de agentische evaluaties, en een gepubliceerd tokens-per-taakcijfer voor beide modellen op dezelfde taken. Zolang beide niet bestaan, is de samengestelde index een voorsprong van negen punten voor het model dat goedkoper te draaien is, en een samengestelde voorsprong van negen punten is niet hetzelfde als een voorsprong van negen punten op jouw workload.
Vergeleken in dit artikel3
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
