
GPT-6.1 Sol vs Claude Opus 5.5: Een echte kloof, ongelijk verdeeld
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 141 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 294 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Het gat van 5,8 punten tussen Claude Opus 5.5 en GPT-6.1 Sol op de Artificial Analysis Intelligence Index is het grootste van alle koppels in deze set, en anders dan bij de meeste zal het niet worden gedicht met een aanpassing van de instellingen. Claude Opus 5.5, uitgebracht op 22 september 2026 en geprijsd op $4,00 per miljoen inputtokens en $20,00 per miljoen outputtokens, scoort 57,6. GPT-6.1 Sol, uitgebracht op 29 september 2026 voor $2,00 en $10,00, scoort 51,8. Claude Opus 5.5 is het hoger scorende model met een marge die groter is dan die welke de meeste frontiermodellen van elkaar scheidt, en het kost 8,3× meer per taak om daar te komen — $5,98 tegen $0,72. Tot nu toe wint het dure model simpelweg, wat de minst interessante versie van deze vergelijking is. Wat het de moeite waard maakt om te lezen, is dat de 5,8 punten niet gelijkmatig over de suite zijn verdeeld: op de enige as die het meeste werk met lange documenten en lange sessies bepaalt, liggen de twee modellen binnen twee punten van elkaar.
Beide zijn vlaggenschipmodellen in hetzelfde marktsegment: contextvensters van de 1M-klasse, uitvoerplafonds van 128K, tekst-, beeld- en bestandsinvoer, uitgebreid nadenken aan de ene kant en een inspanningsladder met vijf niveaus aan de andere kant. Claude Opus 5.5 volgt Claude Opus 5 op en is gepositioneerd voor veeleisend redeneren, coderen en langdurig agentisch werk; GPT-6.1 Sol staat één trede onder GPT-6 Astra en is gepositioneerd voor agentisch coderen, computergebruik en documentintensief professioneel werk. Ze zijn op dezelfde taken gericht. Uit de meting blijkt dat ze daar niet allemaal even goed in zijn.
Waar de 5,8 punten echt zitten
Een samengestelde index verbergt zijn componenten. Haal de afzonderlijke evaluaties erbij en het gat ziet er niet langer uit als een gat, maar begint eruit te zien als een profiel.
• Humanity's Last Exam — Claude Opus 5.5 61,4% vs. GPT-6.1 Sol 52,9%, een verschil van 8,5 punten op abstract redeneren
• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, een verschil van 12,7 punten op code van onderzoekskwaliteit
• Recall bij lange context — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, een verschil van 1,7 punt bij het ophalen van feiten uit een lange invoer
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% tegenover een Sol-cijfer dat niet bij dezelfde revisie is gepubliceerd
• Contextvenster — GPT-6.1 Sol 1.050.000 tokens vs. Claude Opus 5.5 1.000.000 tokens, met een uitvoerplafond van 128.000 tokens voor beide
• Kosten per indextaak — Claude Opus 5.5 $5,98 vs GPT-6.1 Sol $0,72
De verdeling is het verhaal. Waar de taak erin bestaat abstract te redeneren — een moeilijke examenvraag, een programmeerprobleem van onderzoeksniveau zonder bestaand antwoord om te kopiëren — staat Claude Opus 5.5 beslissend voor, en een SciCode-verschil van 12,7 punten is geen ruis. Waar de taak erin bestaat de juiste passage in een zeer lange invoer te vinden en te gebruiken, staan de twee modellen effectief gelijk, en GPT-6.1 Sol houdt die positie vast met 50.000 tokens meer capaciteit. Een groot deel van het productiewerk met LLM's is van de tweede soort: antwoorden met retrieval-augmentatie, het beoordelen van contracten en dossiers, het analyseren van logs en transcripten, code review over een grote repository. Dat werk wordt gemeten door de derde opsomming, niet door de eerste twee, en op die opsomming levert de premie 1,7 punten op.
De indexrijen eerlijk lezen
Twee kanttekeningen horen naast die cijfers in plaats van onderaan de pagina.
De configuraties verschillen. Artificial Analysis zet Claude Opus 5.5 in een "Max, Default Fallback"-configuratie in de grafiek en GPT-6.1 Sol op maximale inspanning. Beide zijn de sterkste instellingen waaronder elk model wordt gepubliceerd, wat de vergelijking eerlijk maakt, maar het is een vergelijking van twee plafonds in plaats van twee standaardinstellingen zoals ze worden geleverd. De eigen standaardinstellingen van Claude Opus 5.5 in een gehoste API kunnen afwijken van de in de grafiek weergegeven run, en de standaardinspanning van GPT-6.1 Sol is medium.
De rij voor Terminal-Bench is aan één kant opzettelijk leeg. De 59,6% van Claude Opus 5.5 komt uit de Artificial Analysis-revisie waarin dat cijfer werd gepubliceerd; het equivalente cijfer voor GPT-6.1 Sol is niet beschikbaar bij een overeenkomstige revisie. Een getal citeren uit een andere run van dezelfde benchmark zou een onjuiste vergelijking zijn, en de eerlijke keuze is om de cel leeg te laten in plaats van die te vullen met iets dat ongeveer juist is.
Uitvoerigheid werkt hier in dezelfde richting als bij de goedkopere broertjes: Claude Opus 5.5 produceert 260M uitvoertokens op de indexsuite tegenover 67M van GPT-6.1 Sol, een verschil van 3,9× bij een tarief dat al twee keer zo hoog is. Daar komt een ratio van 8,3× per taak vandaan, terwijl de tariefkaart 2× voor input en 2× voor output toont. De meerprijs is niet 8,3× omdat het model 8,3× kost — die is 8,3× omdat het 2× kost en 3,9× zo lang nadenkt.
Het pleidooi om het te betalen
Als je werk lijkt op de eerste twee bullets, is de berekening eenvoudig en pleit ze in het voordeel van Claude Opus 5.5. Een verschil van 12,7 punten bij wetenschappelijke code van onderzoeksniveau, of 8,5 punten bij moeilijk abstract redeneren, is het verschil tussen een agent die zelfstandig een ticket afsluit en een agent die bij elke derde stap een mens nodig heeft. Agentisch coderen over een grote codebase is de workload die beide leveranciers als eerste noemen, en het is de workload waarin de spreiding het grootst is. Voor $5,98 in plaats van $0,72 per taak betalen om een mislukte run te vermijden die een engineer twintig minuten kost, is geen moeilijke keuze.
Er is een tweede argument dat helemaal niet over scores gaat. Claude Opus 5.5 is vijftien dagen oud en heeft een hoeveelheid ervaring met evaluatie, beoordeling en deployment door derden opgebouwd die een model van acht dagen oud niet heeft. Voor een productietraject is de volwassenheid van de omringende kennis iets waard dat de index niet inprijst.
Het pleidooi tegen, en het getal dat de doorslag geeft
Het tegenargument is de rij voor lange context. Als de dominante vorm van je verkeer "grote input, kort antwoord" is — en voor heel veel teams is dat zo — dan is de as waarvoor je wordt belast niet de as die je verbruikt. Bij lange-contextrecall verschillen de twee modellen 1,7 punt bij een prijsverhouding van 8,3×, en het goedkopere model heeft het grotere venster. Dat is het geval waarin de meerprijs reëel en meetbaar is, en wordt besteed aan capaciteit die de workload nooit benut.
Het beslissende getal is dus niet de index. Het is het aandeel van je taken dat op SciCode lijkt in plaats van op recall. Teams die die vraag vanuit hun eigen logs kunnen beantwoorden, moeten die vanuit hun eigen logs beantwoorden; een benchmarksuite is een proxy voor een mix van taken, en die mix is de variabele.
Beide op één toets, wat de vraag beantwoordbaar maakt.


Claude Opus 5.5 staat op OrcaRouter voor zijn eigen $4,00 / $20,00, met cache-reads voor $0,20. GPT-6.1 Sol staat op OrcaRouter voor $2,00 / $10,00, en stijgt naar $4,00 / $15,00 boven 272.000 prompttokens, met cache-reads voor $0,10. Beide tegen de lijstprijs van de provider, niets extra erbovenop, met één key en één factuur.
Dat is bij deze combinatie belangrijker dan gewoonlijk, omdat de twee modellen geen vervangers van elkaar zijn — het is een routeringsbeslissing. Stuur het werk met lange documenten en grote volumes naar GPT-6.1 Sol, houd het zware redeneerwerk en het werk aan codewijzigingen op Claude Opus 5.5, en beide zitten achter hetzelfde endpoint met dezelfde inloggegevens. Als een route verslechtert, verplaatst automatische failover de aanroep in plaats van deze te laten mislukken, en omdat de routering declaratief is, kan ze per taakklasse worden uitgedrukt in plaats van per applicatie. Het testen van de opsplitsing is een configuratiewijziging, geen migratie.
Het laatste dat het vermelden waard is, gaat over de houdbaarheid van deze vergelijking. Beide modellen zijn dagen of weken oud. GPT-6.1 Sol heeft één onafhankelijke configuratie gepubliceerd; Claude Opus 5.5 heeft er één. Een enkele run per model is een momentopname, en de interessante faalmodus is niet dat een van deze cijfers onjuist is — het is dat een configuratie met gemiddelde inspanning, of een tweede evaluator, het profiel hertekent. Tot die tijd is de verdedigbare lezing de lezing die de componenten geven: een beslissende kloof op het gebied van moeilijk redeneren en onderzoekscode, een kleine op het gebied van werk met een lange context, en een rekening van 8,3× die gerechtvaardigd moet worden door het deel van je werklast dat op eerstgenoemde lijkt.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
