Een gegenereerde hero-kaart voor GPT-6.1 Sol met als kop 'De onafhankelijke score is gearriveerd', met badges met de tekst 'Uitgebracht: 29 september 2026', 'Intelligentie-index: 52 bij maximale inspanning' en 'Kosten per indextaak: $0,72', een voettekst met de tekst 'Onafhankelijke cijfers volgens Artificial Analysis, index v4.3.2, uitgelezen op 30 september 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

GPT-6.1 Sols eerste onafhankelijke score is binnen: 0,84 punten achter Astra, tegen minder dan een kwart van de taakkosten

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Elk artikel over GPT-6.1 Sol dat in de dagen na OpenAI's DevDay-release van 29 september 2026 werd gepubliceerd — inclusief deze blog — had dezelfde kanttekening: de capaciteitscijfers waren van de leverancier en geen enkele derde partij had het model geëvalueerd. Die kanttekening is nu achterhaald. Artificial Analysis heeft een GPT-6.1 Sol-rij op zijn Intelligence Index, uitgevoerd met maximale reasoning-inspanning, en het is het eerste cijfer in het korte leven van dit model dat niet door OpenAI is geproduceerd. Het luidt 51,8 tegen 52,7 voor GPT-6 Astra en 47,5 voor GPT-6 Sol — een verschil van minder dan één punt met het $10/$50-vlaggenschip, en een stap omhoog van 4,3 punt ten opzichte van het model dat GPT-6.1 Sol vervangt. Het getal dat de rij interessant maakt, is het getal ernaast: de ranglijst vermeldt de prijs van de evaluatierun achter elke score, en de Index-run van GPT-6.1 Sol kostte $0,72 per taak, terwijl die van Astra $3,26 kostte. Viereneenhalve keer het geld voor 0,84 punt is de hele vergelijking in één regel, en het is nu een gemeten regel in plaats van de inkadering daarvan door een leverancier.

De rij zelf, en waarop deze is uitgevoerd

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis publiceert zijn Intelligence Index als een composiet van tien evaluaties, en de versie die op 30 september 2026 draaide was v4.3.2 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1. Alle drie de OpenAI-modellen in dit artikel draaien op diezelfde versie, waardoor de onderstaande vergelijking op een manier appels met appels vergelijkt zoals een eigen lanceringstabel van een leverancier dat nooit doet. De ranglijst registreert ook de releasedatum die deze voor het model heeft — 2026-09-29, de DevDay-datum — en evalueert het in de max-effortconfiguratie, de instelling die de pagina in zijn eigen kop vermeldt.

• Intelligence Index — 51,8 voor GPT-6.1 Sol (max), 52,7 voor GPT-6 Astra (max), 47,5 voor GPT-6 Sol (max).
• Kosten per indextaak — $0,72 voor GPT-6.1 Sol, $3,26 voor Astra, $1,05 voor GPT-6 Sol. Dit is het eigen cijfer van de ranglijst voor wat één volledige indexevaluatie kostte om te draaien, geen tariefkaart.
• Outputtokens verbruikt tijdens de run — 67,2 miljoen voor GPT-6.1 Sol, 60,0 miljoen voor Astra, 76,8 miljoen voor GPT-6 Sol. In het eigen commentaar van AA wordt 67 miljoen 'redelijk beknopt' genoemd tegenover een mediaan van 82 miljoen op de ranglijst, wat een tweede, stillere overwinning is op het model dat het vervangt.
• Outputsnelheid — 66,8 tokens per seconde voor GPT-6.1 Sol, 57,0 voor Astra, 76,2 voor GPT-6 Sol.
• Prijzen zoals de ranglijst ze vermeldt — $2,00 input en $10,00 output per miljoen tokens voor GPT-6.1 Sol, met gecachte input tegen $0,10 en cachewrites tegen $2,50. Die vier getallen komen exact overeen met de prijspagina van de leverancier, wat het minst dramatische en meest nuttige is aan deze rij: een onafhankelijke lijst van de tarieven die we al hadden genoemd.

Een kanttekening vooraf, voordat de cijfers als munitie worden gebruikt. De index van AA bestaat uit tien evaluaties, en de evaluaties waarmee OpenAI zijn eigen aankondiging opende — DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 — zitten daar niet bij. AA draait zijn eigen AutomationBench-variant, die niet dezelfde harness is als de AutomationBench-versie die de leverancier aanhaalde. Het onafhankelijke verslag bevestigt of weerlegt dus niet de vier belangrijkste claims uit het lanceringsbericht; het meet een grotendeels andere set taken, en het is de moeite waard om het te lezen als een second opinion over de vorm van het model, in plaats van als een oordeel over die specifieke zinnen.

Astra wint nog steeds, met minder dan een punt verschil, voor vier en een half keer zoveel geld.

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Beide modellen bieden een ladder van inspanningsniveaus, en de raad heeft nu voor elke trede van beide een score en een kostenpost per run gepubliceerd. Naast elkaar gezet zeggen de ladders iets wat de enkele headline-vergelijking niet kan: de beste configuratie van GPT-6.1 Sol concurreert niet met de beste van Astra. Ze concurreert met de op een na beste van Astra.

• GPT-6.1 Sol, max — 51.8, $0.72 per indextaak. GPT-6 Astra, max — 52.7, $3.26.
• GPT-6.1 Sol, xhigh — 51.0, $0.39. GPT-6 Astra, xhigh — 52.4, $2.31.
• GPT-6.1 Sol, high — 50.2, $0.32. GPT-6 Astra, high — 50.9, $1.73.
• GPT-6.1 Sol, medium — 47.8, $0.21. GPT-6 Astra, medium — 49.6, $1.54.
• GPT-6.1 Sol, low — 42.1, $0.13. GPT-6 Astra, low — 45.8, $0.82.

Astra leidt op elke trede, wat de eerlijke samenvatting van de confrontatie is en ook het minst interessante deel ervan. Het interessante deel is de wisselkoers. Als je de goedkoopste Astra-configuratie wilt die de beste van GPT-6.1 Sol verslaat, is dat Astra op xhigh: 52,4 tegen 51,8, voor $2,31 tegen $0,72. Dat is 0,56 indexpunt voor $1,59 meer per evaluatierun — ongeveer 3,2 keer de kosten voor minder dan één procent van de score. Ga de andere kant op en zet GPT-6.1 Sol naar xhigh, dan lever je 0,8 punten in, terwijl de rekening daalt naar $0,39, wat 5,9 keer goedkoper is dan Astra's xhigh en een negende van Astra's run met maximale inspanning.

Er is een tweede lezing van dezelfde ladder die pleit tegen het kopen van Astra op maximale inspanning. Astra's vier lagere treden zijn allemaal goedkoper dan zijn max, en zijn xhigh ligt 0,29 punten onder zijn max — iets meer dan een half procent van de score voor een verlaging van 29% van de runkosten. Elk inkoopgesprek over dit paar dat begint bij "Astra op max" en eindigt bij "Astra kost 4,5 keer meer" laat Astra's eigen goedkopere treden buiten de vergelijking.

Zes evaluaties gaan naar Astra, twee gaan naar GPT-6.1 Sol, twee eindigen gelijk.

Het samengestelde cijfer verbergt een splitsing. Als je bij maximale inspanning evaluatie voor evaluatie scoort, is GPT-6.1 Sol geen uniform iets slechtere Astra — het is beter in twee dingen en slechter in zes.

• GDPval-AA — Elo 1575,1 voor GPT-6.1 Sol tegen 1541,9 voor Astra, een voorsprong van 33 punten op taken voor professioneel werk. Dit is de grootste individuele onafhankelijke overwinning voor het goedkopere model.
• AA-LCR v1.1, redenering over lange context — 0,830 tegen 0,807. GPT-6.1 Sol leidt.
• AA-Briefcase v1.1 — Elo 1564,2 tegen 1568,9. Astra met 4,7.
• AutomationBench-AA — 0,649 tegen 0,685. Astra met 3,6 punten.
• Terminal-Bench 4.0 — 0,561 tegen 0,591. Astra met 3,0 punten.
• SciCode — 0,542 tegen 0,565. Astra met 2,3 punten.
• Humanity's Last Exam — 0,529 tegen 0,547. Astra met 1,8 punten.
• AA-Omniscience — 41,5 tegen 43,4. Astra met 1,9 punten.
• GDP.pdf en CritPt — exact gelijke standen op respectievelijk 0,310 en 0,317, bij beide modellen.

Twee van die rijen zijn meer waard dan hun positie in de lijst. De GDPval-AA-marge is de enige plek waar het voordeel van het goedkopere model groot genoeg is om een verandering van harness te overleven, en die valt precies op de workload die de positioneringslijn van de leverancier claimt — professioneel, documentintensief werk. En de twee exacte gelijke standen zitten bij de evaluaties met de smalste spreidingen, wat eraan herinnert dat een samengesteld verschil van 0,84 punt wordt opgebouwd uit rijen die individueel uiteenlopen van een overwinning van 33 punten tot een verlies van 3,6 punt.

Ten opzichte van het model dat het vervangt, is de stijging reëel maar niet uniform.

De vergelijking die ertoe doet voor iedereen die GPT-6 Sol al in productie draait, is die welke 6.1 Sol maakt met zijn eigen voorganger, en het onafhankelijke verslag is daarin scherper dan het bericht van de leverancier was. Acht van de tien evaluaties verbeteren. Twee gaan achteruit.

• SciCode — GPT-6.1 Sol scoort 0,542 waar GPT-6 Sol 0,576 scoorde. Het nieuwere model is 3,5 punten slechter in wetenschappelijke code.
• AA-LCR v1.1 — 0,830 voor 6.1 Sol tegen 0,837 voor GPT-6 Sol. Een minimaal verschil, maar in de verkeerde richting, op de lange-context-evaluatie.
• AA-Omniscience — 41,5 tegen 27,1. Dit is de grootste beweging in de rij: een sprong van 14,4 punten op de kennisevaluatie, en de nauwkeurigheid op die set stijgt van 0,545 naar 0,621.
• Hallucinatiepercentage op dezelfde set — 0,543 voor GPT-6.1 Sol, een daling ten opzichte van 0,601 voor GPT-6 Sol en nog steeds boven de 0,513 van GPT-6 Astra. AA-Omniscience splitst zijn score in "had het goed" en "zelfverzekerd fout", en juist in die splitsing verdient de 6.1-refresh zijn bestaansrecht: het is een wezenlijk minder oneerlijk model dan Sol, en het is nog steeds het meest oneerlijke van de drie.
• Terminal-Bench 4.0 — 0,561 tegen 0,439, een winst van 12,2 punten. AA-Briefcase — 1482,8 tot 1564,2 Elo. GDP.pdf — 0,248 tot 0,310.

De interpretatie is dat dit eerder een opfrissing van kennis en tooling was dan een opfrissing van redeneervermogen. De evaluaties die het meest zijn verschoven, zijn de evaluaties die belonen dat je dingen weet en ze niet verzint; de evaluatie die is gedaald, is een smalle, technische. Iedereen die voor de cachebesparing naar 6.1 Sol is overgestapt, krijgt de kennistoename als bonus en moet niet aannemen dat die zich uitstrekt tot elke harness die men draait.

Waar het bestuur het rangschikt, en wat erboven staat

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

In de ranglijst van de Intelligence Index staat GPT-6 Astra op maximale inspanning op de 7e plaats en GPT-6.1 Sol op maximale inspanning op de 10e plaats, met GPT-6 Sol op maximale inspanning op de 20e plaats. De negen rijen boven GPT-6.1 Sol zijn twee Astra-configuraties, drie Claude Opus 5.5-configuraties, één Claude Sonnet 5.5-configuratie en twee Claude Fable 5.1-configuraties — dus het model waar GPT-6.1 Sol het dichtst bij staat, is het vlaggenschip van zijn eigen familie, en het model dat het in die rangorde daadwerkelijk heeft verdrongen, is zijn voorganger, dertien plaatsen lager.

Zonder de effort-instelling wordt de ordening compacter op een manier die van belang is voor kostenplanning: GPT-6.1 Sol staat op xhigh 13e, op high 15e, op medium 19e en op low 35e, terwijl Astra op high 14e staat, op medium 16e en op low 26e. Met andere woorden, GPT-6.1 Sol op xhigh staat hoger dan Astra op high in de ranglijst, en GPT-6.1 Sol op medium staat hoger dan Astra op low. Effort is hier een grotere hefboom dan de modelkeuze, althans onder deze twee.

Eerlijk gezegd, wat te doen met het nummer

De leveranciersbewering die in deze rij werd getest, was dat GPT-6.1 Sol het topmodel bijna evenaart voor ongeveer een vijfde van de prijs. De onafhankelijke versie van die zin is: het komt binnen 0,84 indexpunten van het topmodel, en de evaluatierun die aan zijn score ten grondslag lag, kostte 22% van die van het topmodel. Dat ligt dicht genoeg bij de bewering dat niemand zich erdoor misleid zou moeten voelen, en het is een sterkere bewering dan "onverifieerd" in elk opzicht dat voor een koper van belang is.

Wat de rij niet doet, is een prijskaartje hangen aan je workload. Een index-run is een specifieke mix van taken, en het getal dat de echte rekening bepaalt, is de tariefkaart tegenover je eigen tokenprofiel — daarom is de cachelijn nog steeds de lijn om te modelleren: de $0,10 voor gecachte input van GPT-6.1 Sol tegenover de $1,00 van Astra is een tienvoudig verschil waar geen enkele indexscore aan te pas komt. Aan onze kant geldt dezelfde doorberekening: OrcaRouter bedient GPT-6 Astra, GPT-6 Sol en GPT-6 Luna tegen OpenAI's eigen listprijzen, zonder opslag erbovenop, dus op de dag dat een leverancierstarief verschuift, verschuift het tarief aan onze kant mee, in plaats van te wachten op een tweede contract. GPT-6.1 Sol staat niet op onze routes — de publieke catalogus geeft vandaag "model not found" terug voor openai/gpt-6.1-sol, en er is geen eerlijke manier om een model te beschrijven dat we niet kunnen bedienen. Wat één API-sleutel je op dit moment wél oplevert, is het paar waar de benchmark daadwerkelijk over discussieert — Astra voor het zwaarste werk, Sol voor het volume — met de listprijzen van de providers zonder opslag doorgegeven en automatische failover tussen providers wanneer een van hen een fout geeft.

Twee dingen zouden dit verder aanscherpen. Een tweede onafhankelijke testomgeving op hetzelfde model zou ons vertellen of de voorsprong op GDPval-AA een eigenschap van het model is of van die evaluatie, en dat is het meest bruikbare ontbrekende gegeven in de rij. En een onafhankelijke meting van het long-context-niveau van 272.000 tokens zou meer uitmaken dan nog een composietpunt, want daar houdt de prijsstelling van deze familie op goedkoop te zijn.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt