
GPT-6.1 Sol vs GPT-5.6 Sol: Viereneenhalve indexpunten, de helft van de rekening, twee regressies
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
OpenAI bracht GPT-6.1 Sol uit op 29 september 2026, elf weken na GPT-5.6 Sol, die op 9 juli 2026 verscheen als het vlaggenschip van de vorige generatie. Beide zijn nog steeds te koop, beide zijn nog steeds aanroepbaar, en het verschil tussen beide op het neutrale scorebord is 4,8 punten — 51,8 tegen 47,0 op de Intelligence Index van Artificial Analysis, beide gemeten bij maximale redeneerinspanning op dezelfde suite van tien evaluaties. Het prijsverschil is veel groter dan het scoreverschil: $0,72 per voltooide indextaak tegen $1,99, en $2,00/$10,00 per miljoen tokens tegen $4,00/$20,00. Dat is de korte versie. De lange versie is dat de upgrade niet uniform is, en twee van de evaluaties gingen achteruit.
Wat elk model is, en wat wat heeft vervangen
GPT-5.6 Sol was de top van de 5.6-lijn — een gesloten model dat alleen via de API beschikbaar is, met een contextvenster van 1.050.000 tokens, een uitvoerplafond van 128.000 tokens, invoer van tekst, afbeeldingen en bestanden, en een redeneerladder van none tot max. OpenAI beschreef het als het niveau dat is gebouwd voor het zwaarste werk: langdurige agentische workflows, software-engineering over meerdere bestanden, diepgaand redeneren — en de prijs was daar dan ook naar: $4,00 en $20,00 per miljoen tokens, met gecachte invoer voor $0,40 en cache-writes voor $5,00. Boven 272.000 invoertokens werd de prijs verhoogd naar $8,00 en $30,00, en er was een Batch-niveau van $2,50 en $15,00.
GPT-6.1 Sol is de middenklasse van de generatie die daarna kwam: onder GPT-6 Astra, boven GPT-6 Luna, en nu het model waarop OpenAI kostenbewuste ontwikkelaars richt. Het behoudt het venster van 1.050.000 tokens en de uitvoerlimiet van 128.000 tokens, verlengt de kennisafsluitdatum van 20 april naar 30 april 2026, en verkleint de inspanningsladder van zes treden naar vijf — laag, gemiddeld (standaard), hoog, xhigh, max. De none waarde die GPT-5.6 Sol accepteerde, geeft nu een foutmelding, en OpenAI's migratierichtlijn is expliciet dat de vervanging laag is, geen stille upgrade.
Het is de moeite waard hier even bij stil te staan, want dit is de enige wijziging in de release die geld kost in plaats van geld bespaart. Een pipeline die koos voor none om een goedkope, snelle, niet-redenerende aanroep te krijgen, heeft die configuratie niet meer, op geen van beide modelfamilies. De goedkoopste trede op GPT-6.1 Sol is een redeneertrede, en redeneertokens worden gefactureerd als outputtokens, of je ze nu kunt zien of niet.
De ladder, trede voor trede
De onafhankelijke raad publiceert een score en de kosten per run voor elke effort-instelling op beide modellen, waardoor de head-to-head iets nuttigers wordt dan een enkele vergelijking. Naast elkaar gezet bij gelijkwaardige instellingen:
• Inspanningsladder, GPT-6.1 Sol — max 51,8 bij $0,72 per indextaak; xhigh 51,0 bij $0,39; high 50,2 bij $0,32; medium (de standaard) 47,8 bij $0,21 • Uitvoersnelheid — 59,7 tokens per seconde voor GPT-6.1 Sol versus 87,8 voor GPT-5.6 Sol
• Tijd tot eerste chunk — 332 seconden voor GPT-6.1 Sol versus een snellere waarde voor GPT-5.6 Sol, tegen een bordmediaan van bijna 4 seconden
• Uitvoertokens bij de indexrun — 67,2 miljoen voor GPT-6.1 Sol versus 90,0 miljoen voor GPT-5.6 Sol
• Prijs voor invoer / uitvoer — $2,00 / $10,00 versus $4,00 / $20,00
• Gecachte invoer — $0,10 versus $0,40; cacheschrijfacties $2,50 versus $5,00
• Batchtarief — niet gepubliceerd voor GPT-6.1 Sol versus $2,50 / $15,00 voor GPT-5.6 Sol
• Stap voor lange context — boven 272.000 invoertokens herprijst GPT-6.1 Sol naar $4,00 / $15,00 voor het hele verzoek versus $8,00 / $30,00 voor GPT-5.6 Sol
• Ondergrens van de inspanning — low versus none
Twee dingen volgen uit die lijst. Het eerste is dat de prijsverlaging structureel is en niet promotioneel: het standaardtarief van GPT-6.1 Sol van $2,00 en $10,00 onderbiedt GPT-5.6 Sol's batchtarief van $2,50 en $15,00, dus zelfs het kortingstarief van het oude model is duurder dan de lijstprijs van het nieuwe model. Het tweede is dat de upgrade geen rechte lijn is qua latentie. GPT-6.1 Sol is ongeveer een derde langzamer in het genereren van output en deed er 332 seconden over tot de eerste chunk bij de lange-prompttests van het board — dezelfde orde van grootte als de 107 seconden van GPT-6 Sol en ongeveer tachtig keer de mediaan van het board. Als je een interactief product op GPT-5.6 Sol hebt gebouwd, is dit een functionele regressie, onafhankelijk van welke benchmark dan ook, en de oplossing is architecturaal, geen parameter.

Twee evaluaties gingen de verkeerde kant op
De samengestelde winst is 4,8 punten. De componenten zijn niet uniform positief, en de scores per evaluatie van de board zeggen dat ook:
• SciCode — GPT-6.1 Sol 0,542 vs GPT-5.6 Sol 0,571. Een achteruitgang van 2,9 punt op wetenschappelijk programmeren.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 vs GPT-5.6 Sol Elo 1611,3. Een Elo-achteruitgang van 36 punten op economisch waardevol kenniswerk.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 vs GPT-5.6 Sol 0,495. Een winst van 3,4 punt.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 vs GPT-5.6 Sol 0,399. Een winst van 16 punten, de grootste afzonderlijke verschuiving in dit tweetal.
• AA-Omniscience — GPT-6.1 Sol 41,5 vs GPT-5.6 Sol 22,0, wat meer draait om betrouwbaarheid van kennis en hallucinatie dan om louter het ophalen van feiten.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — de resterende vijf, die de composiet aanvullen en waar de rest van de winst van 4,8 punt wordt behaald.
Een model dat wezenlijk beter is op terminalwerk, aanzienlijk beter op feitelijke betrouwbaarheid, en meetbaar slechter op wetenschappelijk programmeren en op Elo voor professioneel werk, is geen strikt beter model. Het is een ander punt op de frontier, en het is daar bewust geplaatst: OpenAI's eigen lanceringspositionering voor GPT-6.1 Sol is kosten per voltooide taak bij bijna-flagshipkwaliteit, niet maximale score. Als jouw workload SciCode-vormig of GDPval-vormig is, is het samengestelde getal niet het getal dat voor jou geldt, en de regressie wel.
GPT-5.6 Sol heeft nog steeds het gepubliceerde long-context-resultaat
De enige plek waar het oudere model een cijfer heeft dat het nieuwere niet heeft, is de retrievalnauwkeurigheid in de contextband waarin de tariefkaart van GPT-6.1 Sol verandert. GPT-5.6 Sol heeft een gepubliceerd MRCR v2 acht-naalds resultaat van 91,5% in het bereik van 256.000 tot 512.000 tokens. GPT-6.1 Sol heeft geen gepubliceerde tegenhanger, en boven 272.000 inputtokens wordt het hele verzoek opnieuw geprijsd tegen 2× input en cache en 1,5× output.
Leg die twee feiten naast elkaar, en het segment waarin de economie van het nieuwe model het zwakst is, is precies het segment waarin het oude model de enige gedocumenteerde sterkte heeft. De besparingen verdwijnen niet — $4,00 en $15,00 op de herprijsde tier tegenover $8,00 en $30,00 op GPT-5.6 Sols eigen long-context-tier is nog steeds een halvering — maar het halve-prijsverhaal is een verhaal voor algemene workloads, en een long-context-retrievalpipeline is dat niet. Als dat jouw workload is, is GPT-5.6 Sol tegen $4,00 en $20,00 met een gepubliceerde 91,5% een verdedigbare plek om te blijven.
De overige gepubliceerde resultaten van GPT-5.6 Sol blijven ongewijzigd en zijn de reden dat sommige teams niet zullen overstappen: BrowseComp 90,4 voor webonderzoeksagenten, Terminal-Bench 2.1 op 88,8 en 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 op 62,6. Die zijn door OpenAI gerapporteerd, op de testomgeving van OpenAI, en ze werden in juli gerapporteerd. Wat sindsdien is veranderd, is dat de board nu beide modellen op één suite met één set instellingen beoordeelt, en het oudere model verliest op de samengestelde score en op kosten.
De migratie zelf is een stringwijziging, met één uitzondering.
Dezelfde leverancier, hetzelfde API-oppervlak, naast elkaar in de ranking, hetzelfde venster en dezelfde output-limiet — dus voor de meeste stacks is dit een model-identifier en een prijs die halveert. De uitzonderingen zijn specifiek en het is de moeite waard om ze te benoemen voordat je de schakelaar omzet.
Als je code reasoning.effort op none of minimal, zal die falen in plaats van te degraderen, en low is de gedocumenteerde vervanging. Als je verkeer boven de 272.000 inputtokens uitkomt, controleer dan de opnieuw geprijsde tier voordat je de besparingen modelleert. Als je product afhankelijk is van de tijd tot het eerste token, meet voordat je uitbrengt, want de 332-secondenwaarde van het scorebord is geen afrondingsfout. En als je evals een SciCode-vormige of GDPval-vormige slice bevatten, draai die slice dan op beide modellen in plaats van de samengestelde score te vertrouwen.
Beide modellen staan op OrcaRouter tegen de eigen lijstprijzen van OpenAI — GPT-6.1 Sol voor $2,00 en $10,00 met gecachte input voor $0,10, GPT-5.6 Sol voor $4,00 en $20,00 met gecachte input voor $0,40 — volgens een pass-throughmodel waarbij een prijswijziging van OpenAI dezelfde dag dat die ingaat aan onze kant wordt doorgevoerd, in plaats van pas nadat een reseller opnieuw heeft onderhandeld. Omdat de prijslijst ongewijzigd wordt doorgegeven in plaats van met een opslag, is de rekensom in dit artikel de rekensom die je krijgt: hetzelfde model van $0,72 per taak, dezelfde halvering, geen platformpremie aan weerszijden.

Het praktische nut van beide achter één endpoint te hebben, is dat de vergelijking live blijft. Stuur nieuw verkeer naar GPT-6.1 Sol, houd GPT-5.6 Sol als fallback en als het long-contextpad binnen één configuratiewijziging bereik, en laat automatische failover het venster overbruggen waarin de beschikbaarheid en Enterprise-enablement van een twee maanden oud vlaggenschip nog moeten landen. Een migratie die de rekening halveert en twee sub-benchmarks achteruitzet, is geen beslissing die je één keer neemt en dan vergeet; je neemt die per route, en een routeringslaag is wat dat goedkoop maakt.

Waar elk thuishoort
• Algemeen agentisch en terminalwerk — GPT-6.1 Sol. Zestien punten op Terminal-Bench 4.0 en de helft van de prijs is geen twijfelgeval.
• Feitelijke betrouwbaarheid, producten met opgehaalde antwoorden — GPT-6.1 Sol, met een AA-Omniscience-verschil van bijna twintig punten.
• Wetenschappelijk programmeren — controleer eerst je eigen evaluaties. Het scorebord toont een regressie van 2,9 punten, en de composietscore zal die niet naar voren brengen.
• Economisch waardevol kenniswerk — dezelfde waarschuwing. De GDPval-AA Elo-regressie is 36 punten.
• Retrieval met lange context boven 272.000 tokens — GPT-5.6 Sol, totdat GPT-6.1 Sol een gepubliceerd cijfer in dat bereik heeft.
• Interactieve, latentiegevoelige oppervlakken — meet voordat je migreert. Snellere uitvoer, veel tragere eerste token.
• Goedkoopste niet-redenerende aanroep — geen van beide. Die configuratie bestaat niet meer binnen deze familie.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
