Een gegenereerde hero-titelkaart met de tekst 'GPT-6 Luna vs GPT-6 Astra', met ondertitel 'Honderd keer de prijs op de tariefkaart. Zesenveertig keer per voltooide taak.', met chips die Luna tonen op $0,10/$0,50 per 1M met index 37, Astra op $10,00/$50,00 per 1M met index 53, en kosten per indextaak van $0,07 tegen $3,26, met het OrcaRouter-logo rechtsonder.
Guides & Insights

GPT-6 Luna vs GPT-6 Astra: honderd keer de prijs voor zestien indexpunten

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De leverancier bracht beide modellen binnen dezelfde maand uit. GPT-6 Astra verscheen op 3 september 2026 voor $10,00 per miljoen inputtokens en $50,00 per miljoen output, gepositioneerd als het meest capabele systeem van het bedrijf voor professioneel werk met een lange tijdshorizon. GPT-6 Luna volgde op 22 september 2026 voor $0,10 en $0,50 — een honderdste van de inputprijs, een honderdste van de outputprijs — als de efficiëntieklasse van de familie. Zestien indexpunten scheiden hen op de onafhankelijke ranglijst die beide meet. Zestien punten voor een honderdvoudige prijs is de hele vergelijking in één regel, en dat is niet het interessante deel.

Het interessante is dat de honderdvoudige sticker krimpt tot iets in de buurt van zesenveertigvoud zodra je meerekent hoe elk model zich daadwerkelijk gedraagt bij een taak, en dat het resterende verschil helemaal geen algemene intelligentie is. Het is computergebruik, autonomie over een lange horizon en een veiligheidsclassificatie die bepaalt of je organisatie het model überhaupt mag aanroepen. Dat laatste punt is iets wat geen enkele benchmarktabel vastlegt, en voor veel teams beslecht het de kwestie voordat de prijs ter sprake komt.

Twee geledingen van één familie, negentien dagen na elkaar

Astra is het vlaggenschip van OpenAI en het model dat het bedrijf omschrijft als het meest intelligente en best afgestemde ter wereld. Het accepteert tekst-, afbeeldings- en bestandsinvoer, heeft een contextvenster van 1.050.000 tokens met een uitvoerlimiet van 128.000 tokens, en beschikt over altijd actieve reasoning met een configureerbare inspanning van laag tot max. Het is het eerste OpenAI-model dat de drempel voor de Critical-capaciteit op het gebied van cybersecurity overschrijdt onder het Preparedness Framework van het bedrijf, en de uitrol volgde uit die classificatie en niet uit capaciteit: eerst een beperkt aantal organisaties, toegang voor bedrijven standaard uitgeschakeld en vanaf 9 september te beheren, waarna de beschermingsniveaus geleidelijk werden verruimd.

Luna is het andere uiteinde van dezelfde familie. Tekst en beeld in, tekst uit, hetzelfde contextvenster van 1.050.000 tokens en hetzelfde uitvoerplafond van 128.000 tokens, en een redeneerladder die loopt van none via low, medium, high, xhigh en max, met medium als standaard. Geen toegangsbeperking, geen enterprise-schakelaar, geen veiligheidsniveau waarvoor je moet kwalificeren. Het is algemeen beschikbaar voor iedereen met een API-sleutel, en OpenAI's eigen beschrijving is beperkt en eerlijk: het meest efficiënte model voor gerichte, high-volume taken.

De twee modellen delen een contextvenster, een uitvoerlimiet, een familie van kennisafsluitdata en een prijsclausule voor lange context. Verder delen ze bijna niets, en de reden is dat ze zijn gebouwd voor verschillende helften van dezelfde taak.

De tariefkaart vermeldt honderd keer. De taakkosten vermelden zesenveertig.

Eén regel per dimensie, beide zijden op elk:

• Invoer per 1M — GPT-6 Luna $0,10 vs GPT-6 Astra $10,00

• Uitvoer per 1 miljoen — GPT-6 Luna $0,50 vs. GPT-6 Astra $50,00

• Gecachte invoer — GPT-6 Luna $0,01 per 1 miljoen vs GPT-6 Astra $1,00 per 1 miljoen, beide een korting van 90% op hun eigen niet-gecachte tarief

• Kosten per indextaak — GPT-6 Luna ongeveer $0,07 vs GPT-6 Astra ongeveer $3,26

• Kosten om de volledige index te draaien — GPT-6 Luna $122,39 vs GPT-6 Astra $5.324,10

• AA Intelligence Index — GPT-6 Luna 37 bij maximale inspanning vs GPT-6 Astra 53 bij maximale inspanning

• Uitvoertokens tijdens de index-run — GPT-6 Luna 150M vs GPT-6 Astra 60M, tegenover een mediaan van 88M op het leaderboard

• Uitvoersnelheid — GPT-6 Luna 153,9 tokens/sec vs GPT-6 Astra 51,4 tokens/sec bij xhigh

• Tijd tot eerste token — GPT-6 Luna snel genoeg om achter een interactief oppervlak te zitten vs GPT-6 Astra 208,73s bij xhigh

• Schakelaar om redeneren uit te zetten — GPT-6 Luna none tot max, met none als optie versus GPT-6 Astra altijd aan, geen niet-redeneermodus

• Computergebruik en autonomie — het aanroepen van tools en agentische loops bij GPT-6 Luna versus GPT-6 Astra, gebouwd voor het end-to-end bedienen van een computer

• Toegang — GPT-6 Luna algemeen beschikbaar voor iedereen versus GPT-6 Astra afgeschermd, enterprise standaard uitgeschakeld, beheerdersinstellingen vereist

• Op OrcaRouter — GPT-6 Luna niet in onze catalogus versus GPT-6 Astra routeerbaar tegen OpenAI's lijstprijs

A generated single-panel scoreboard card headed 'A hundred times on the rate card' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GPT-6 Astra $10.00 in / $50.00 out per 1M with index 53 at max effort; cost per completed index task about $0.07 against about $3.26; output tokens on the index run Luna 150M against Astra's 60M and a board median of 88M; output speed Luna 153.9 tokens per second against Astra's 51.4 at xhigh; and access, Luna open to anyone with an API key against Astra gated with enterprise off by default. Footer: 'Index, cost per task and speed per Artificial Analysis; prices per OpenAI.'

Zet de rij met kosten per taak af tegen de tariefkaartverhouding en de kloof slinkt met meer dan de helft. Luna verbruikt 150 miljoen outputtokens om de index te voltooien; Astra verbruikt 60 miljoen. Astra is tweeënhalf keer zo beknopt, en bij een model met outputprijs is dat veel waard — het is de reden dat een honderdvoudig verschil in de tariefkaart een zesenveertigvoudig verschil in taakkosten wordt, en de reden dat elke vergelijking die alleen op stickerprijzen is gebaseerd, de voordelen van de goedkope laag met een factor twee zal overschatten.

De snelheidsrijen wijzen de andere kant op en liggen ver uiteen. Luna genereert drie keer zoveel tokens per seconde als Astra en levert zijn eerste token binnen een tijd die voor een gebruiker acceptabel is om te wachten. Astra's tijd tot het eerste token van 208,73 seconden op xhigh is geen latentiecijfer; het is een verklaring over waar het model voor dient. Niets waarnaar een persoon kijkt, kan met die instelling op Astra draaien.

Wat zestien punten daadwerkelijk opleveren

Het gat in de index is reëel, en de nuttige vraag is wat erin zit, want het antwoord is niet "zestien procent meer intelligentie".

De gepubliceerde capaciteiten van Astra clusteren op een specifieke plek. OpenAI rapporteert 72,6% op OSWorld 2.0 en 69% op AutomationBench-AA — beide zijn maatstaven voor een model dat software bedient zoals een mens dat doet, over vele stappen, gedurende een lange periode. Aan de kenniszijde zijn de cijfers 96,1 op GPQA Diamond, 97,6% op FrontierMath Tier 4 en 57,2% op Humanity's Last Exam met tools, en het ophalen uit lange context is een uitgesproken sterk punt: 100% op OpenAI's eigen eight-needle-benchmark tussen 256K en 512K tokens, 96,3% tussen 512K en 1M. Deze cijfers zijn door de leverancier gerapporteerd en niet gereproduceerd, en de harness maakt uit — hetzelfde model scoort 99,9% op ARC-AGI-3 onder OpenAI's aangepaste provideradapter tegenover 62,7% op de standaardharness, een verschil dat evenveel zegt over de harness als over het model.

Samen gelezen is dat geen algemeen voordeel. Het is een voordeel dat geconcentreerd is in taken die lang duren, een computer gebruiken en een verifieerbaar eindpunt hebben. Astra's concurrerende positionering is niet gericht tegen een andere chatbot; die is gericht tegen een werksessie, en de modellen waarmee het op de onafhankelijke benchmark wordt vergeleken, zijn de andere vlaggenschepen in dezelfde klasse — het evenaart Claude Fable 5.1 met 53 op de Intelligence Index tegen ongeveer 40% van de kosten per taak.

Luna's achterstand van zestien punten is dus niet gelijkmatig verdeeld. Bij een korte, goed gespecificeerde taak die door een programma wordt afgehandeld, zullen de twee modellen vaak hetzelfde bruikbare antwoord produceren en zal het verschil onzichtbaar zijn. Bij een taak die veertig opeenvolgende acties in een browser vereist, met een checkpoint aan het einde, is die achterstand het verschil tussen voltooien en niet voltooien — en dat is de taak waarvoor Astra is gebouwd en Luna niet.

De poort die niemand inprijst

Astra is het eerste OpenAI-model dat de Critical cybersecurity-drempel overschrijdt onder het Preparedness Framework van het bedrijf, en het praktische gevolg is dat het uitgeschakeld wordt geleverd voor enterprise-accounts. Een beheerder moet het inschakelen, onder een van toepassing zijnde tariefkaart en overeenkomst, voordat gebruikers het überhaupt te zien krijgen. De toegang ging op 3 september open voor een beperkte groep organisaties en werd daarna verruimd; de beheerdersinfrastructuur kwam op 9 september beschikbaar.

Luna heeft niets van dat alles. Het is vanaf dag één beschikbaar voor iedereen met een API-sleutel, zonder kwalificatiestap, zonder beheerdersschakelaar en zonder beveiligingslaag die tussen een ontwikkelaar en een eerste aanroep staat.

Voor een team in een gereguleerde sector, een defensiecontractant, of waar dan ook met een veiligheidsbeoordeling in het inkooptraject, is dit waar de hele beslissing om draait. Het honderdvoudige prijsverschil is een begrotingspost; een toegangspoort is een project. En voor een team buiten die beperkingen is de poort irrelevant en is Astra simpelweg een duur model met een ongewoon lange tijd tot de eerste token.

Het is de moeite waard om toe te voegen dat de toegangsbeperking een weloverwogen standpunt is en niet louter een ongemak. Een model dat zelfstandig een computer bestuurt en goed kwetsbaarheden vindt, is een model dat een lab alleen met de nodige voorzichtigheid moet verstrekken, en de manier waarop het wordt ingezet volgt uit de vaststelling van de capaciteit. Dat maakt het niet gemakkelijker om aan te schaffen, maar het betekent wel dat de beperking waarschijnlijk niet wordt versoepeld door een supportticket.

Dezelfde klif, dezelfde familie, twee keer

Beide modellen hebben dezelfde long-contextclausule, wat het duurste is om te missen op beide tariefkaarten. Verzoeken die meer dan 272.000 invoertokens bevatten, worden gefactureerd tegen tweemaal de invoer- en cachetarieven en 1,5x het uitvoertarief — voor het hele verzoek, niet alleen het deel boven de drempel. Bij Astra verandert dat een aanroep van $10,00/$50,00 in $20,00/$75,00. Bij Luna verandert het $0,10/$0,50 in $0,20/$0,75.

Omdat de clausule proportioneel is, verandert ze de verhouding tussen de twee modellen niet — ze verdubbelt beide. Wat ze wel verandert, is de absolute omvang van de fout, en de fout is waarschijnlijker op Astra, omdat de workloads waarvoor Astra bestaat juist degenen zijn die een werkcontext van een miljoen tokens met zich meebrengen. Eén enkele Astra-aanroep met lange context kost $75 per miljoen outputtokens; hetzelfde werk opsplitsen in twee aanroepen onder 272K halveert dat, zonder de prompt te wijzigen. Bij een model waarvan de hele waardepropositie werk met een lange horizon is, is het de moeite waard die rekensom vóór de eerste productieaanroep te maken, niet erna.

De beslissing is een routeringsbeslissing

Wat deze combinatie ongebruikelijk maakt onder de vergelijkingen op deze blog, is dat beide modellen van dezelfde leverancier zijn, op hetzelfde account draaien en via hetzelfde endpoint worden bereikt. Er is geen tweede contract te ondertekenen en geen tweede SDK om te leren. De keuze tussen hen is helemaal geen aankoopbeslissing — het is een routeringsbeslissing, en een die de meeste teams per verzoek zouden moeten maken in plaats van één keer.

De vorm van de splitsing is duidelijk genoeg. Luna voor de duizend kleine aanroepen die een agent onderweg naar een taak doet: classificatie, extractie, toolselectie, samenvatting van een tussenresultaat. Astra voor de taak zelf, één keer, aan het einde, waar het antwoord het product is. Dat is een tweelaagse pipeline binnen één applicatie, en het kostenverschil tussen het geheel op Astra draaien en de binnenste lus op Luna draaien is het verschil tussen levensvatbare en niet-levensvatbare unit economics.

GPT-6 Astra staat op OrcaRouter tegen OpenAI's lijstprijs, wat onder pass-through-prijzen betekent dat een tariefwijziging van OpenAI dezelfde dag nog aan onze kant live is. GPT-6 Luna staat op het moment van schrijven niet in onze catalogus en is alleen bereikbaar via OpenAI's eigen API, dus een team dat beide wil, gebruikt één sleutel voor GPT-6 Astra naast wat het al voor OpenAI gebruikt. Dit is ook de combinatie waarbij model fusion zijn bestaansrecht bewijst: een panel van een goedkoop model met hoge doorvoer en een duur, zorgvuldig model dat samen antwoordt, waarbij het goedkope lid het leeuwendeel van het werk doet en het dure de rol van scheidsrechter vervult, is een configuratie die de routeringslaag kan uitdrukken zonder dat de applicatie weet dat een van beide modellen bestaat.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Welke, en wanneer?

Neem GPT-6 Luna, tenzij je een specifieke reden hebt om dat niet te doen. Het is een honderdste van de prijs op de tariefkaart en een zesenveertigste van de prijs per voltooide taak, het is drie keer sneller, de eerste token arriveert binnen een tijd die een gebruiker kan afwachten, en je kunt het opdragen om helemaal te stoppen met redeneren — wat het bruikbaar maakt als classifier. Stel de effort-parameter expliciet in, want de standaardwaarde is medium en het kopcijfer 37 is een max-effort-getal. Houd lange aanroepen onder 272.000 invoertokens. Toets de tweepuntsregressie in de Coding Agent Index aan je eigen evaluatie in plaats van aan een leveranciersgrafiek.

Kies GPT-6 Astra wanneer de taak de lange is en het antwoord het product is. Computergebruik over vele stappen, professionele analyse met een verifieerbaar eindpunt, alles waarbij zestien indexpunten het verschil zijn tussen afmaken en stilzwijgend stoppen. Accepteer de tijd tot het eerste token — 208 seconden bij xhigh is geen cijfer dat je achter een mens kunt zetten — en accepteer de inkooppoort als je organisatie er een heeft. Draai daarna alles wat tot die taak leidt op de goedkope tier, want de inner loop is waar het geld naartoe gaat.

De fout die deze vergelijking uitlokt, is dat je haar behandelt als een keuze tussen twee modellen. Het is een keuze over waar elk model in een pijplijn zit, en het antwoord is bijna altijd: beide.

A screenshot of the OrcaRouter model page for GPT-6 Astra (openai/gpt-6-astra), showing the Vision, Tools, JSON and Reasoning badges, a 2026-09-04 catalogue date, 1M-token context with 128K maximum output and text, image and file input, list pricing of $10.00 input and $50.00 output per 1M tokens, a p50 time to first token of 7.81s, and the description of GPT-6 Astra as OpenAI's flagship model for long-horizon end-to-end work with always-on reasoning from low through max.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt