
GPT-6.1 Sol vs GPT-6 Luna: Dertien indexpunten, tien keer zoveel geld, en twee evaluaties waarin het niet standhoudt
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
OpenAI bracht GPT-6.1 Sol uit op 29 september 2026, een week nadat GPT-6 Luna op 22 september arriveerde in dezelfde keynote-cyclus. Het zijn de twee uiteinden van dezelfde generatie: Luna is het goedkope niveau, Sol is het middenniveau daarboven, en GPT-6 Astra staat boven beide. Het prijsverschil tussen de twee is een orde van grootte — $ 0,10 en $ 0,50 per miljoen tokens tegenover $ 2,00 en $ 10,00, gecachte input $ 0,01 tegen $ 0,10 — en het capaciteitsverschil op het onafhankelijke board is 13,7 Intelligence Index-punten, 51,8 tegen 38,1 bij maximale reasoning effort. Tien keer zoveel geld voor dertien punten is ongeveer de slechtste wisselkoers in het huidige OpenAI-assortiment. Wat de vergelijking de moeite waard maakt om erover te schrijven, is de vraag van veertig dollar die daarop volgt: welke dertien punten?
De twee modellen, en de week ertussen
GPT-6 Luna is het kleine model van de GPT-6-generatie — het model dat OpenAI beschrijft als gebouwd voor hoogvolume- en latentiegevoelig werk: classificatie, extractie, routering, bulk-samenvatting, de binnenste lus van een agent. Het heeft een contextvenster van 1.050.000 tokens en een uitvoerplafond van 128.000 tokens, accepteert tekst, afbeeldingen en bestanden als invoer, en behoudt de volledige inspanningsladder met zes treden, inclusief geen, wat het 6.1-niveau heeft geschrapt. De tariefkaart is de reden van zijn bestaan: $0,10 voor invoer en $0,50 voor uitvoer per miljoen tokens, gecachte invoer tegen $0,01 en cache-schrijfacties tegen $0,125, met een long-context-stap boven 272.000 invoertokens naar $0,20, $0,75 en $0,02 voor gecachte invoer.
GPT-6.1 Sol is de mid-tier-refresh die een week later uitkwam. Hetzelfde venster, dezelfde uitvoerlimiet, dezelfde invoermodaliteiten, een kennisafsluitdatum van 30 april 2026 tegenover die van Luna, en een inzetladder die begint bij laag omdat geen en minimaal ronduit afgewezen worden. Het is geprijsd op $2,00 en $10,00, met gecachte invoer tegen $0,10 — twintig keer het invoertarief van Luna en twintig keer het uitvoertarief daarvan, met een cachelijn die per treffer tien keer duurder is.
Beide zijn in de verkoop, beide zitten zowel in ChatGPT Work en Codex als in de API, en beide zijn aan onze kant aanroepbaar via dezelfde sleutel. Niets aan deze combinatie vereist een keuze.
Wat dertien indexpunten daadwerkelijk opleveren
De samengestelde score is het minst informatieve getal in de vergelijking, omdat die het gemiddelde neemt over taken die zich heel verschillend gedragen. Per evaluatie gescoord bij maximale redeneerinspanning op Artificial Analysis v4.3.2, is de vorm een tweedeling in plaats van een helling:
• AA-LCR v1.1, redeneren over lange context — GPT-6 Luna 0.833 versus GPT-6.1 Sol 0.830. Luna ligt marginaal voor.
• SciCode — GPT-6 Luna 0.546 vs GPT-6.1 Sol 0.542. Opnieuw in de praktijk gelijk, en opnieuw staat het goedkopere model nominaal aan kop.
• Terminal-Bench 4.0 — GPT-6 Luna 0,126 tegen GPT-6.1 Sol 0,561. Een gat van 43 punten; op het gebied van terminalwerk zitten de twee modellen in verschillende klassen.
• Humanity's Last Exam — GPT-6 Luna 0.385 vs GPT-6.1 Sol 0.529.
• AutomationBench-AA — GPT-6 Luna 0.532 vs GPT-6.1 Sol 0.649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 tegenover GPT-6.1 Sol Elo 1575,1, een Elo-verschil van 138 punten op het gebied van professioneel kenniswerk.
• GDP.pdf — GPT-6 Luna 0.228 vs. GPT-6.1 Sol 0.310.
• CritPt — GPT-6 Luna 0.194 vs GPT-6.1 Sol 0.317.
• AA-Omniscience — GPT-6 Luna 0.65 vs GPT-6.1 Sol 41.5. Op een schaal waar nul betekent dat er evenveel juiste als onjuiste antwoorden zijn, zit Luna op de waterlijn en Sol beduidend daarboven.
• MMMU-Pro — GPT-6 Luna 0,797 vs. GPT-6.1 Sol 0,860.
• Kosten per indextaak, onafhankelijk — GPT-6 Luna $0,068 vs GPT-6.1 Sol $0,72; ongeveer een tienvoudig verschil in het voordeel van het goedkope model
• Uitvoertokens bij de index-run — GPT-6 Luna 144 miljoen vs. GPT-6.1 Sol 67 miljoen, tegen een klassenmediaan van 100 miljoen voor Luna en ongeveer 81 miljoen voor Sol
Twee van de tien evaluaties zijn een gelijkspel in het voordeel van het goedkope model. Acht gaan naar het dure, en in zes van die acht is de marge niet marginaal. Dat is de eerlijke lezing van de dertien punten: het is geen uniforme kwaliteitsgradiënt, het zijn twee capaciteiten — volgehouden agentische uitvoering en feitelijke betrouwbaarheid — waar Luna simpelweg niet dezelfde klasse model is, en een brede middenmoot waar het verschil reëel maar klein genoeg is om onzichtbaar te zijn in je eigen evaluatieset.
Het AA-LCR-resultaat verdient één kanttekening, want het is het cijfer dat Luna het meest vleit. Long-contextredenering op 0,833 is een sterke score en de twee modellen liggen binnen een half punt van elkaar, maar de benchmark meet retrieval en redeneren over lange inputs, niet het vermogen om gedurende een lange sessie te handelen. De kloof op Terminal-Bench 4.0 is hoe "gedurende een lange sessie handelen" eruitziet wanneer het wordt gescoord, en die is 43 punten groot.

De kosten-per-taak-berekening, en waar die niet meer opgaat
Artificial Analysis prijst elke index-run op basis van gemeten tokenverbruik, dus het kostencijfer is geen afleiding uit een tariefkaart. De run van GPT-6 Luna kostte $0,068 per taak; die van GPT-6.1 Sol kostte $0,72. De verhouding is 10,7×, wat alleen iets slechter is dan de nominale twintigvoudige prijsverhouding omdat Luna tijdens de run 144 miljoen outputtokens genereerde tegenover 67 miljoen van Sol — het goedkope model is ruim twee keer zo breedsprakig, en dat vreet aan zijn eigen voordeel. Toch liggen de posities niet dicht bij elkaar, en bij een workload met korte antwoorden zou het verschil groter worden: minder outputvolume betekent dat Luna's breedsprakigheidspenalty krimpt terwijl zijn prijsvoordeel gelijk blijft.
Waar de rekensom niet meer klopt, is bij elke workload waarop de index niet lijkt. Als je taak een bewerking op repositoryschaal is waarbij twintig toolaanroepen coherent moeten blijven, dan kost een model van $0,07 dat de taak niet volbrengt je de hele retry-lus plus de kloktijd, en is het model van $0,72 dat het in één keer afmaakt goedkoper. De eigen lanceringsframing van GPT-6.1 Sol is volledig op dit idee gebouwd — kosten per voltooide taak — en dat is het juiste kader: de relevante vergelijking is niet het tokentarief, het is de verwachte kosten per uitkomst, en bij taken die Luna niet kan voltooien, is die verwachting onbegrensd.
Twee structurele details maken de grens scherper. Ten eerste de long-contextstap: beide modellen passen hun prijs aan boven 272.000 inputtokens, Luna naar $0,20 en $0,75 en Sol naar $4,00 en $15,00, waardoor de absolute kloof bij de grens breder wordt in plaats van te dichten, maar het bijgestelde tarief van Luna ligt nog steeds een orde van grootte onder het standaardtarief van Sol. Ten tweede, en makkelijk te missen: de inspanningsladder heeft niet dezelfde vorm. Luna accepteert none; Sol niet. Een cascade die eerst naar Sol routeert en bij een fout of time-out terugvalt op Luna, mag de reasoning.effort van het verzoek niet ongewijzigd meenemen, want een configuratie die op het ene model geldig is, geeft op het andere een foutmelding. Dat is een kwestie van de routeringslaag, niet van modelkwaliteit, en het is precies het soort ding dat één endpoint met een routeringsregel hoort op te vangen.
Beide draaien is het punt, geen afdekking
Beide modellen staan op OrcaRouter tegen OpenAI's eigen lijstprijzen, zonder dat er iets bovenop komt: GPT-6 Luna voor $0,10 en $0,50 met gecachte input tegen $0,01, GPT-6.1 Sol voor $2,00 en $10,00 met gecachte input tegen $0,10, en de stap van 272.000 tokens bij elk model wordt exact doorgegeven zoals de leverancier die vermeldt. Omdat het platform de lijstprijs van de provider doorgeeft in plaats van er een opslag op te zetten, is de twintigvoudige verhouding in dit artikel de verhouding die je daadwerkelijk betaalt, aan beide kanten.

De reden die hier specifiek van belang is, is dat dit tweetal een cascade is die nog geschreven moet worden. Een classificator, een router, een bulk-extractietaak en een coderingsagent op reponiveau horen niet op hetzelfde model thuis, en het prijsverschil is groot genoeg dat de verkeerde keuze in beide richtingen duur is — twintig keer te veel per aanroep in de ene richting, een mislukte taak in de andere. Eén sleutel, twee modellen, en een regel die eenvoudig verkeer naar Luna stuurt en naar Sol escaleert wanneer de taakklasse verandert of wanneer Luna's output een controle niet doorstaat, is een configuratiewijziging aan onze kant in plaats van een tweede leverancierscontract. Automatische failover dekt het geval waarin een van de twee is gedegradeerd, wat voor een model dat acht dagen geleden is uitgebracht nog steeds een reële mogelijkheid is.

De beslissing, in één keer
• Classificatie, extractie, routering, bulk-samenvatting, inner loops van agents — GPT-6 Luna, en stop met lezen. Voor $0,10/$0,50 met een gecachte read van één cent zijn dertien indexpunten aan algemene capaciteit niet tien keer de factuur waard voor werk waarbij het antwoord kort en controleerbaar is.
• Coderen op repo-schaal, terminalagents, uitvoering in meerdere stappen — GPT-6.1 Sol. Het verschil van 43 punten op Terminal-Bench 4.0 is het hele argument; dit is de capaciteit die de prijs koopt.
• Kenniswerkvragen waarbij een fout antwoord duur is — GPT-6.1 Sol, over de AA-Omniscience- en GDPval-AA-verschillen. Luna's score voor feitelijke betrouwbaarheid zit op de waterlijn.
• Lange inputs met een kort gegenereerd antwoord — GPT-6 Luna. Het redeneert over een lange context op gelijke hoogte met een model dat twintig keer zoveel kost, en de langdradigheidsboete van 144 miljoen tokens krijgt nooit de kans om van toepassing te zijn.
• Alles wat al ingesteld is op none — blijf op Luna, of begroot de wijziging. Die trede bestaat niet op GPT-6.1 Sol.
• Latentiegevoelige oppervlakken — GPT-6 Luna, op basis van de eigen metingen van het board: 129,4 outputtokens per seconde en 100 seconden tot de eerste chunk, tegenover de 59,7 en 332 van Sol.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
