
GPT-6.1 Sols eerste onafhankelijke score is binnen: 0,84 punten achter Astra, tegen minder dan een kwart van de taakkosten
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 507 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 194 tok/s
- OrcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Elk artikel over GPT-6.1 Sol dat in de dagen na OpenAI's DevDay-release van 29 september 2026 werd gepubliceerd — inclusief deze blog — had dezelfde kanttekening: de capaciteitscijfers waren van de leverancier en geen enkele derde partij had het model geëvalueerd. Die kanttekening is nu achterhaald. Artificial Analysis heeft een GPT-6.1 Sol-rij op zijn Intelligence Index, uitgevoerd met maximale reasoning-inspanning, en het is het eerste cijfer in het korte leven van dit model dat niet door OpenAI is geproduceerd. Het luidt 51,8 tegen 52,7 voor GPT-6 Astra en 47,5 voor GPT-6 Sol — een verschil van minder dan één punt met het $10/$50-vlaggenschip, en een stap omhoog van 4,3 punt ten opzichte van het model dat GPT-6.1 Sol vervangt. Het getal dat de rij interessant maakt, is het getal ernaast: de ranglijst vermeldt de prijs van de evaluatierun achter elke score, en de Index-run van GPT-6.1 Sol kostte $0,72 per taak, terwijl die van Astra $3,26 kostte. Viereneenhalve keer het geld voor 0,84 punt is de hele vergelijking in één regel, en het is nu een gemeten regel in plaats van de inkadering daarvan door een leverancier.
De rij zelf, en waarop deze is uitgevoerd

Artificial Analysis publiceert zijn Intelligence Index als een composiet van tien evaluaties, en de versie die op 30 september 2026 draaide was v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1. Alle drie de OpenAI-modellen in dit artikel draaien op diezelfde versie, waardoor de onderstaande vergelijking op een manier appels met appels vergelijkt zoals een eigen lanceringstabel van een leverancier dat nooit doet. De ranglijst registreert ook de releasedatum die deze voor het model heeft — 2026-09-29, de DevDay-datum — en evalueert het in de max-effortconfiguratie, de instelling die de pagina in zijn eigen kop vermeldt.
• Intelligence Index — 51,8 voor GPT-6.1 Sol (max), 52,7 voor GPT-6 Astra (max), 47,5 voor GPT-6 Sol (max).
• Kosten per indextaak — $0,72 voor GPT-6.1 Sol, $3,26 voor Astra, $1,05 voor GPT-6 Sol. Dit is het eigen cijfer van de ranglijst voor wat één volledige indexevaluatie kostte om te draaien, geen tariefkaart.
• Outputtokens verbruikt tijdens de run — 67,2 miljoen voor GPT-6.1 Sol, 60,0 miljoen voor Astra, 76,8 miljoen voor GPT-6 Sol. In het eigen commentaar van AA wordt 67 miljoen 'redelijk beknopt' genoemd tegenover een mediaan van 82 miljoen op de ranglijst, wat een tweede, stillere overwinning is op het model dat het vervangt.
• Outputsnelheid — 66,8 tokens per seconde voor GPT-6.1 Sol, 57,0 voor Astra, 76,2 voor GPT-6 Sol.
• Prijzen zoals de ranglijst ze vermeldt — $2,00 input en $10,00 output per miljoen tokens voor GPT-6.1 Sol, met gecachte input tegen $0,10 en cachewrites tegen $2,50. Die vier getallen komen exact overeen met de prijspagina van de leverancier, wat het minst dramatische en meest nuttige is aan deze rij: een onafhankelijke lijst van de tarieven die we al hadden genoemd.
Een kanttekening vooraf, voordat de cijfers als munitie worden gebruikt. De index van AA bestaat uit tien evaluaties, en de evaluaties waarmee OpenAI zijn eigen aankondiging opende — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — zitten daar niet bij. AA draait zijn eigen AutomationBench-variant, die niet dezelfde harness is als de AutomationBench-versie die de leverancier aanhaalde. Het onafhankelijke verslag bevestigt of weerlegt dus niet de vier belangrijkste claims uit het lanceringsbericht; het meet een grotendeels andere set taken, en het is de moeite waard om het te lezen als een second opinion over de vorm van het model, in plaats van als een oordeel over die specifieke zinnen.
Astra wint nog steeds, met minder dan een punt verschil, voor vier en een half keer zoveel geld.

Beide modellen bieden een ladder van inspanningsniveaus, en de raad heeft nu voor elke trede van beide een score en een kostenpost per run gepubliceerd. Naast elkaar gezet zeggen de ladders iets wat de enkele headline-vergelijking niet kan: de beste configuratie van GPT-6.1 Sol concurreert niet met de beste van Astra. Ze concurreert met de op een na beste van Astra.
• GPT-6.1 Sol, max — 51.8, $0.72 per indextaak. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.
Astra leidt op elke trede, wat de eerlijke samenvatting van de confrontatie is en ook het minst interessante deel ervan. Het interessante deel is de wisselkoers. Als je de goedkoopste Astra-configuratie wilt die de beste van GPT-6.1 Sol verslaat, is dat Astra op xhigh: 52,4 tegen 51,8, voor $2,31 tegen $0,72. Dat is 0,56 indexpunt voor $1,59 meer per evaluatierun — ongeveer 3,2 keer de kosten voor minder dan één procent van de score. Ga de andere kant op en zet GPT-6.1 Sol naar xhigh, dan lever je 0,8 punten in, terwijl de rekening daalt naar $0,39, wat 5,9 keer goedkoper is dan Astra's xhigh en een negende van Astra's run met maximale inspanning.
Er is een tweede lezing van dezelfde ladder die pleit tegen het kopen van Astra op maximale inspanning. Astra's vier lagere treden zijn allemaal goedkoper dan zijn max, en zijn xhigh ligt 0,29 punten onder zijn max — iets meer dan een half procent van de score voor een verlaging van 29% van de runkosten. Elk inkoopgesprek over dit paar dat begint bij "Astra op max" en eindigt bij "Astra kost 4,5 keer meer" laat Astra's eigen goedkopere treden buiten de vergelijking.
Zes evaluaties gaan naar Astra, twee gaan naar GPT-6.1 Sol, twee eindigen gelijk.
Het samengestelde cijfer verbergt een splitsing. Als je bij maximale inspanning evaluatie voor evaluatie scoort, is GPT-6.1 Sol geen uniform iets slechtere Astra — het is beter in twee dingen en slechter in zes.
• GDPval-AA — Elo 1575,1 voor GPT-6.1 Sol tegen 1541,9 voor Astra, een voorsprong van 33 punten op taken voor professioneel werk. Dit is de grootste individuele onafhankelijke overwinning voor het goedkopere model.
• AA-LCR v1.1, redenering over lange context — 0,830 tegen 0,807. GPT-6.1 Sol leidt.
• AA-Briefcase v1.1 — Elo 1564,2 tegen 1568,9. Astra met 4,7.
• AutomationBench-AA — 0,649 tegen 0,685. Astra met 3,6 punten.
• Terminal-Bench 4.0 — 0,561 tegen 0,591. Astra met 3,0 punten.
• SciCode — 0,542 tegen 0,565. Astra met 2,3 punten.
• Humanity's Last Exam — 0,529 tegen 0,547. Astra met 1,8 punten.
• AA-Omniscience — 41,5 tegen 43,4. Astra met 1,9 punten.
• GDP.pdf en CritPt — exact gelijke standen op respectievelijk 0,310 en 0,317, bij beide modellen.
Twee van die rijen zijn meer waard dan hun positie in de lijst. De GDPval-AA-marge is de enige plek waar het voordeel van het goedkopere model groot genoeg is om een verandering van harness te overleven, en die valt precies op de workload die de positioneringslijn van de leverancier claimt — professioneel, documentintensief werk. En de twee exacte gelijke standen zitten bij de evaluaties met de smalste spreidingen, wat eraan herinnert dat een samengesteld verschil van 0,84 punt wordt opgebouwd uit rijen die individueel uiteenlopen van een overwinning van 33 punten tot een verlies van 3,6 punt.
Ten opzichte van het model dat het vervangt, is de stijging reëel maar niet uniform.
De vergelijking die ertoe doet voor iedereen die GPT-6 Sol al in productie draait, is die welke 6.1 Sol maakt met zijn eigen voorganger, en het onafhankelijke verslag is daarin scherper dan het bericht van de leverancier was. Acht van de tien evaluaties verbeteren. Twee gaan achteruit.
• SciCode — GPT-6.1 Sol scoort 0,542 waar GPT-6 Sol 0,576 scoorde. Het nieuwere model is 3,5 punten slechter in wetenschappelijke code.
• AA-LCR v1.1 — 0,830 voor 6.1 Sol tegen 0,837 voor GPT-6 Sol. Een minimaal verschil, maar in de verkeerde richting, op de lange-context-evaluatie.
• AA-Omniscience — 41,5 tegen 27,1. Dit is de grootste beweging in de rij: een sprong van 14,4 punten op de kennisevaluatie, en de nauwkeurigheid op die set stijgt van 0,545 naar 0,621.
• Hallucinatiepercentage op dezelfde set — 0,543 voor GPT-6.1 Sol, een daling ten opzichte van 0,601 voor GPT-6 Sol en nog steeds boven de 0,513 van GPT-6 Astra. AA-Omniscience splitst zijn score in "had het goed" en "zelfverzekerd fout", en juist in die splitsing verdient de 6.1-refresh zijn bestaansrecht: het is een wezenlijk minder oneerlijk model dan Sol, en het is nog steeds het meest oneerlijke van de drie.
• Terminal-Bench 4.0 — 0,561 tegen 0,439, een winst van 12,2 punten. AA-Briefcase — 1482,8 tot 1564,2 Elo. GDP.pdf — 0,248 tot 0,310.
De interpretatie is dat dit eerder een opfrissing van kennis en tooling was dan een opfrissing van redeneervermogen. De evaluaties die het meest zijn verschoven, zijn de evaluaties die belonen dat je dingen weet en ze niet verzint; de evaluatie die is gedaald, is een smalle, technische. Iedereen die voor de cachebesparing naar 6.1 Sol is overgestapt, krijgt de kennistoename als bonus en moet niet aannemen dat die zich uitstrekt tot elke harness die men draait.
Waar het bestuur het rangschikt, en wat erboven staat

In de ranglijst van de Intelligence Index staat GPT-6 Astra op maximale inspanning op de 7e plaats en GPT-6.1 Sol op maximale inspanning op de 10e plaats, met GPT-6 Sol op maximale inspanning op de 20e plaats. De negen rijen boven GPT-6.1 Sol zijn twee Astra-configuraties, drie Claude Opus 5.5-configuraties, één Claude Sonnet 5.5-configuratie en twee Claude Fable 5.1-configuraties — dus het model waar GPT-6.1 Sol het dichtst bij staat, is het vlaggenschip van zijn eigen familie, en het model dat het in die rangorde daadwerkelijk heeft verdrongen, is zijn voorganger, dertien plaatsen lager.
Zonder de effort-instelling wordt de ordening compacter op een manier die van belang is voor kostenplanning: GPT-6.1 Sol staat op xhigh 13e, op high 15e, op medium 19e en op low 35e, terwijl Astra op high 14e staat, op medium 16e en op low 26e. Met andere woorden, GPT-6.1 Sol op xhigh staat hoger dan Astra op high in de ranglijst, en GPT-6.1 Sol op medium staat hoger dan Astra op low. Effort is hier een grotere hefboom dan de modelkeuze, althans onder deze twee.
Eerlijk gezegd, wat te doen met het nummer
De leveranciersbewering die in deze rij werd getest, was dat GPT-6.1 Sol het topmodel bijna evenaart voor ongeveer een vijfde van de prijs. De onafhankelijke versie van die zin is: het komt binnen 0,84 indexpunten van het topmodel, en de evaluatierun die aan zijn score ten grondslag lag, kostte 22% van die van het topmodel. Dat ligt dicht genoeg bij de bewering dat niemand zich erdoor misleid zou moeten voelen, en het is een sterkere bewering dan "onverifieerd" in elk opzicht dat voor een koper van belang is.
Wat de rij niet doet, is een prijskaartje hangen aan je workload. Een index-run is een specifieke mix van taken, en het getal dat de echte rekening bepaalt, is de tariefkaart tegenover je eigen tokenprofiel — daarom is de cachelijn nog steeds de lijn om te modelleren: de $0,10 voor gecachte input van GPT-6.1 Sol tegenover de $1,00 van Astra is een tienvoudig verschil waar geen enkele indexscore aan te pas komt. Aan onze kant geldt dezelfde doorberekening: OrcaRouter bedient GPT-6 Astra, GPT-6 Sol en GPT-6 Luna tegen OpenAI's eigen listprijzen, zonder opslag erbovenop, dus op de dag dat een leverancierstarief verschuift, verschuift het tarief aan onze kant mee, in plaats van te wachten op een tweede contract. GPT-6.1 Sol staat niet op onze routes — de publieke catalogus geeft vandaag "model not found" terug voor openai/gpt-6.1-sol, en er is geen eerlijke manier om een model te beschrijven dat we niet kunnen bedienen. Wat één API-sleutel je op dit moment wél oplevert, is het paar waar de benchmark daadwerkelijk over discussieert — Astra voor het zwaarste werk, Sol voor het volume — met de listprijzen van de providers zonder opslag doorgegeven en automatische failover tussen providers wanneer een van hen een fout geeft.
Twee dingen zouden dit verder aanscherpen. Een tweede onafhankelijke testomgeving op hetzelfde model zou ons vertellen of de voorsprong op GDPval-AA een eigenschap van het model is of van die evaluatie, en dat is het meest bruikbare ontbrekende gegeven in de rij. En een onafhankelijke meting van het long-context-niveau van 272.000 tokens zou meer uitmaken dan nog een composietpunt, want daar houdt de prijsstelling van deze familie op goedkoop te zijn.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
