En genererad tvåkolumns jämförelsetavla med titeln 'GPT-6.1 Sol vs GPT-6 Luna – resultattavlan'. Vänster kolumn 'GPT-6.1 Sol': rader med 'Intelligensindex: 51,8', 'Kostnad per indexuppgift: 0,72 $', 'Pris per 1M: 2,00 $ / 10,00 $', 'Utdatatokens vid indexkörning: 67M', 'Terminal-Bench 4.0: 56,1 %', 'Lägsta ansträngningsnivå: låg'. Höger kolumn 'GPT-6 Luna': rader med 'Intelligensindex: 38,1', 'Kostnad per indexuppgift: 0,07 $', 'Pris per 1M: 0,10 $ / 0,50 $', 'Utdatatokens vid indexkörning: 144M', 'Terminal-Bench 4.0: 12,6 %', 'Lägsta ansträngningsnivå: ingen'. En sidfot lyder 'Oberoende siffror enligt Artificial Analysis v4.3.2 vid maximal ansträngning; leverantörslistpriser.'
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: Tretton indexpoäng, tio gånger pengarna och två utvärderingar där det inte håller

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

OpenAI släppte GPT-6.1 Sol den 29 september 2026, en vecka efter att GPT-6 Luna kom den 22 september i samma keynote-cykel. De är de två ändarna av samma generation: Luna är den billiga nivån, Sol är mellannivån ovanför den, och GPT-6 Astra ligger över båda. Prisskillnaden mellan de två är en tiopotens — $0,10 och $0,50 per miljon tokens mot $2,00 och $10,00, cachad indata $0,01 mot $0,10 — och förmågeskillnaden på den oberoende resultattavlan är 13,7 Intelligence Index-poäng, 51,8 mot 38,1 vid maximal resonemangsansträngning. Tio gånger pengarna för tretton poäng är ungefär den sämsta växelkursen i OpenAI:s nuvarande sortiment. Det som gör jämförelsen värd att skriva om är fyrtiodollarsfrågan som följer: vilka tretton poäng?

De två modellerna, och veckan mellan dem

GPT-6 Luna är den lilla modellen i GPT-6-generationen – den som OpenAI beskriver som byggd för högvolym- och latenskänsligt arbete: klassificering, extrahering, routing, massammanfattning, en agents inre loop. Den har ett kontextfönster på 1 050 000 tokens och ett utdatatak på 128 000 tokens, tar text, bilder och filer som indata och behåller hela ansträngningsstegen med sex steg inklusive none, som 6.1-nivån tog bort. Prislistan är anledningen till att den finns: $0,10 in och $0,50 ut per miljon tokens, cachad indata till $0,01 och cache-skrivningar till $0,125, med ett långkontextsteg över 272 000 indatatokens till $0,20, $0,75 och $0,02 cachat.

GPT-6.1 Sol är mellannivåuppdateringen som släpptes en vecka senare. Samma fönster, samma utdatatak, samma indatamodaliteter, en kunskapsgräns den 30 april 2026 jämfört med Lunas, och en ansträngningsstege som börjar på låg eftersom ingen och minimal avvisas direkt. Den är prissatt till $2.00 och $10.00 med cachad indata till $0.10 – tjugo gånger Lunas indatapris och tjugo gånger dess utdatapris, med en cachelinje som är tio gånger dyrare per träff.

Båda är till salu, båda finns i ChatGPT Work och Codex samt i API:et, och båda kan anropas via samma nyckel hos oss. Inget med detta par kräver att man väljer.

Vad tretton indexpunkter faktiskt köper

Kompositvärdet är det minst informativa talet i jämförelsen, eftersom det medelvärdesbildar över uppgifter som beter sig mycket olika. När man poängsätter utvärdering för utvärdering vid maximal resonemangsansträngning på Artificial Analysis v4.3.2, är formen en splittring snarare än en lutning:

• AA-LCR v1.1, långkontextresonemang — GPT-6 Luna 0,833 mot GPT-6.1 Sol 0,830. Luna ligger marginellt före.

• SciCode — GPT-6 Luna 0,546 vs GPT-6.1 Sol 0,542. Återigen i praktiken jämnt, och återigen ligger den billigare modellen nominellt före.

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs GPT-6.1 Sol 0.561. En skillnad på 43 punkter; de två modellerna är i olika ligor när det gäller terminalarbete.

• Mänsklighetens sista examen — GPT-6 Luna 0,385 mot GPT-6.1 Sol 0,529.

• AutomationBench-AA — GPT-6 Luna 0.532 mot GPT-6.1 Sol 0.649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 mot GPT-6.1 Sol Elo 1575,1, en Elo-skillnad på 138 poäng inom professionellt kunskapsarbete.

• GDP.pdf — GPT-6 Luna 0.228 mot GPT-6.1 Sol 0.310.

• CritPt — GPT-6 Luna 0.194 mot GPT-6.1 Sol 0.317.

• AA-Omniscience — GPT-6 Luna 0.65 vs GPT-6.1 Sol 41.5. På en skala där noll betyder lika många korrekta svar som felaktiga ligger Luna vid vattenlinjen och Sol ligger klart över den.

• MMMU-Pro — GPT-6 Luna 0,797 mot GPT-6.1 Sol 0,860.

• Kostnad per indextask, oberoende — GPT-6 Luna 0,068 $ mot GPT-6.1 Sol 0,72 $; en skillnad på omkring tio gånger till den billiga modellens fördel

• Utdata-tokens vid indexkörningen — GPT-6 Luna 144 miljoner mot GPT-6.1 Sol 67 miljoner, jämfört med ett klassmedianvärde på 100 miljoner för Luna och omkring 81 miljoner för Sol

Två av tio utvärderingar är oavgjorda till förmån för den billiga modellen. Åtta tillfaller den dyra, och i sex av dessa åtta är marginalen inte marginell. Det är den ärliga tolkningen av de tretton punkterna: det är inte en enhetlig kvalitetsgradient, det är två förmågor – uthållig agentisk exekvering och faktatillförlitlighet – där Luna helt enkelt inte är samma klass av modell, och en bred mellangrupp där skillnaden är verklig men tillräckligt liten för att vara osynlig i din egen utvärderingsuppsättning.

AA-LCR-resultatet förtjänar ett förbehåll, eftersom det är den siffra som smickrar Luna mest. Långkontextresonemang på 0,833 är ett starkt resultat och de två modellerna ligger inom en halv poäng från varandra, men benchmarken mäter hämtning och resonemang över långa indata, inte förmågan att agera över en lång session. Gapet på Terminal-Bench 4.0 är hur "agera över en lång session" ser ut när det poängsätts, och det är 43 poäng brett.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Aritmetiken för kostnad per uppgift, och var den upphör att stämma

Artificial Analysis prissätter varje indexkörning utifrån uppmätt tokenförbrukning, så kostnadssiffran är inte en slutsats från en prislista. GPT-6 Lunas körning kostade 0,068 USD per uppgift; GPT-6.1 Sols kostade 0,72 USD. Förhållandet är 10,7×, vilket är något sämre än det nominella tjugofaldiga prisförhållandet enbart därför att Luna genererade 144 miljoner utdata-tokens under körningen mot Sols 67 miljoner – den billiga modellen är mer än dubbelt så pratsam, och det urholkar dess egen fördel. Ändå är skillnaden i rangordning inte liten, och i en arbetsbelastning med korta svar skulle den vidgas: mindre utdatavolym innebär att Lunas mångordighetsstraff krymper medan dess prisfördel förblir fast.

Aritmetiken slutar stämma för varje arbetsbelastning som indexet inte liknar. Om din uppgift är en redigering som sträcker sig över ett helt repository och som kräver att tjugo verktygsanrop hålls sammanhängande, kostar en modell för $0,07 som misslyckas med uppgiften dig hela återförsöksloopen plus väggklockstiden, och modellen för $0,72 som blir klar på ett försök är billigare. GPT-6.1 Sols egen inramning av lanseringen bygger helt på den här idén — kostnad per slutförd uppgift — och det är den korrekta ramen: den relevanta jämförelsen är inte tokenpriset, utan den förväntade kostnaden per utfall, och för uppgifter som Luna inte kan slutföra är den förväntade kostnaden obegränsad.

Två strukturella detaljer skärper gränsen. För det första, långkontextsteget: båda modellerna får nytt pris över 272 000 indata-tokens, Luna till $0,20 och $0,75 och Sol till $4,00 och $15,00, så den absoluta skillnaden ökar vid gränsen i stället för att minska, men Lunas nya pris ligger fortfarande en storleksordning under Sols standardpris. För det andra, och lätt att missa: effort-stegen har inte samma form. Luna accepterar none; det gör inte Sol. En kaskad som dirigerar till Sol först och faller tillbaka till Luna vid fel eller timeout får inte föra över begärans reasoning.effort oförändrat, eftersom en konfiguration som är giltig på en modell returnerar ett fel på den andra. Det är en fråga för routinglagret, inte en modellkvalitetsfråga, och det är precis den typ av sak som en enskild endpoint med en routingregel förväntas absorbera.

Att köra båda är själva poängen, inte en hedge.

Båda modellerna finns på OrcaRouter till OpenAIs egna listpriser utan något påslag: GPT-6 Luna för $0,10 och $0,50 med cachad indata för $0,01, GPT-6.1 Sol för $2,00 och $10,00 med cachad indata för $0,10, och steget på 272 000 token för var och en förs vidare exakt så som leverantören listar det. Eftersom plattformen förmedlar leverantörens listpris vidare i stället för att lägga på ett påslag, är det tjugofaldiga förhållandet i den här artikeln det förhållande du faktiskt betalar, på båda sidor.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

Anledningen till att det spelar roll just här är att det här paret är en kaskad som väntar på att skrivas. En klassificerare, en router, ett bulkutvinningsjobb och en kodagent i repostorlek hör inte hemma på samma modell, och prisskillnaden är tillräckligt stor för att det är dyrt att välja fel i endera riktningen — tjugo gånger för mycket per anrop i ena riktningen, en misslyckad uppgift i den andra. En nyckel, två modeller och en regel som skickar enkel trafik till Luna och eskalerar till Sol när uppgiftsklassen ändras eller när Lunas utdata misslyckas i en kontroll, är en konfigurationsändring på vår sida snarare än ett andra leverantörsavtal. Automatisk failover täcker fallet där en av de två är degraderad, vilket för en modell som släpptes för åtta dagar sedan fortfarande är en reell möjlighet.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

Beslutet, i ett svep

• Klassificering, extrahering, routning, massammanfattning, agenters inre loopar — GPT-6 Luna, och sluta läs. Vid $0.10/$0.50 med en cachead läsning för en cent är tretton indexpoäng av allmän förmåga inte värda tio gånger fakturabeloppet för arbete där svaret är kort och kontrollerbart.

• Kodning i reposkala, terminalagenter, flerstegsutförande — GPT-6.1 Sol. Gapet på 43 poäng i Terminal-Bench 4.0 är hela argumentet; detta är förmågan som priset köper.

• Frågor inom kunskapsarbete där ett felaktigt svar är kostsamt — GPT-6.1 Sol, om gapen i AA-Omniscience och GDPval-AA. Lunas faktatillförlitlighetspoäng ligger vid vattenlinjen.

• Långa indata med ett kort genererat svar — GPT-6 Luna. Den resonerar över lång kontext i paritet med en modell som kostar tjugo gånger så mycket, och dess verbositetsstraff på 144 miljoner token får aldrig en chans att tillämpas.

• Allt som redan är inställt på inget — stanna kvar på Luna, eller budgetera för ändringen. Den nivån finns inte på GPT-6.1 Sol.

• Latenskänsliga ytor — GPT-6 Luna, enligt styrelsens egna mätningar: 129,4 utdatatokens per sekund och 100 sekunder till första chunken jämfört med Sols 59,7 och 332.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen