Ett genererat herokort för GPT-6.1 Sol med rubriken 'Det oberoende resultatet har anlänt', med märken som lyder 'Lanserad: 29 september 2026', 'Intelligensindex: 52 vid maximal ansträngning' och 'Kostnad per indexuppgift: 0,72 $', en sidfot med texten 'Oberoende siffror enligt Artificial Analysis, index v4.3.2, avlästa 30 september 2026', och OrcaRouter-logotypen i det nedre högra hörnet.
Guides & Insights

GPT-6.1 Sols första oberoende poäng är inne: 0,84 poäng efter Astra, till under en fjärdedel av uppgiftskostnaden

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Varje artikel om GPT-6.1 Sol som publicerades under dagarna efter Ope​nAI:s DevDay-släpp den 29 september 2026 – inklusive den här bloggens – innehöll samma förbehåll: kapacitetssiffrorna var leverantörens och ingen tredje part hade betygsatt modellen. Det förbehållet är nu inaktuellt. Artificial Analysis har en rad för GPT-6.1 Sol i sitt Intelligence Index, körd med maximal resonemangsansträngning, och det är den första siffran i den här modellens korta liv som Ope​nAI inte tog fram. Den visar 51,8 mot 52,7 för GPT-6 Astra och 47,5 för GPT-6 Sol – en marginal på mindre än en punkt till flaggskeppet för $10/$50, och ett steg upp på 4,3 punkter från modellen som GPT-6.1 Sol ersätter. Siffran som gör raden intressant är den bredvid: resultattavlan prissätter utvärderingskörningen bakom varje poäng, och GPT-6.1 Sols indexkörning kostade $0,72 per uppgift där Astras kostade $3,26. Fyra och en halv gånger pengarna för 0,84 punkter är hela jämförelsen i en rad, och det är nu en uppmätt rad snarare än en leverantörs inramning av en.

Själva raden, och vad den kördes på

A screenshot of the Artificial Analysis model page for GPT-6.1 Sol at maximum reasoning effort, headed 'GPT-6.1 Sol (max) Intelligence, Performance & Price Analysis', with a class-rank strip above the summary naming the model's Intelligence, Speed, Cost and Verbosity positions out of 221 models. The summary paragraph reports an Intelligence Index score of 52 against a median of 26 across 221 models in the class, $2.00 per million input tokens and $10.00 per million output tokens, $0.72 per task to evaluate on the Intelligence Index, and 67 tokens per second against an average of 74, with 67 million output tokens generated against a board median of 82 million; a panel to its right lists a 1M-token context window together with text-and-image input. The page names Intelligence Index v4.3.2 and its ten constituent evaluations.

Artificial Analysis publicerar sitt Intelligence Index som en sammansättning av tio utvärderingar, och versionen som kördes den 30 september 2026 var v4.3.2 – AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1. Alla tre OpenAI-modeller i den här artikeln kör på samma version, så jämförelsen nedan sker på lika villkor på ett sätt som en leverantörs egen lanseringstabell aldrig gör. Tavlan registrerar också det releasedatum den har för modellen – 2026-09-29, datumet för DevDay – och utvärderar den i max-effort-konfigurationen, vilket är inställningen som sidan anger i sin egen rubrik.

• Intelligence Index — 51,8 för GPT-6.1 Sol (max), 52,7 för GPT-6 Astra (max), 47,5 för GPT-6 Sol (max).
• Kostnad per indextask — 0,72 $ för GPT-6.1 Sol, 3,26 $ för Astra, 1,05 $ för GPT-6 Sol. Detta är tavlans egen siffra för vad en fullständig indexutvärdering kostade att köra, inte ett prisblad.
• Utdatatoken som förbrukades under körningen — 67,2 miljoner för GPT-6.1 Sol, 60,0 miljoner för Astra, 76,8 miljoner för GPT-6 Sol. AA:s egen kommentar kallar 67 miljoner "ganska kortfattat" mot en median på 82 miljoner på tavlan, vilket är en andra, tystare seger över modellen den ersätter.
• Utdatahastighet — 66,8 token per sekund för GPT-6.1 Sol, 57,0 för Astra, 76,2 för GPT-6 Sol.
• Priser så som de anges på tavlan — 2,00 $ för indata och 10,00 $ för utdata per miljon token för GPT-6.1 Sol, med cachad indata på 0,10 $ och cacheskrivningar på 2,50 $. De fyra siffrorna matchar leverantörens prissida exakt, vilket är det minst dramatiska och mest användbara med raden: en oberoende lista över de priser vi redan angett.

En inledande kommentar innan siffrorna används som ammunition. AA:s index består av tio utvärderingar, och de utvärderingar som OpenAI inledde sitt eget tillkännagivande med – DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 – finns inte bland dem. AA kör sin egen AutomationBench-variant, som inte är samma testmiljö som den AutomationBench-version leverantören hänvisade till. Så den oberoende redogörelsen bekräftar eller vederlägger inte de fyra huvudpåståendena från lanseringsinlägget; den mäter en till stor del annan uppsättning uppgifter, och den är värd att läsa som en andra åsikt om modellens form snarare än som en dom över just de meningarna.

Astra vinner fortfarande, med mindre än en poäng, för fyra och en halv gånger så mycket pengar

A generated scoreboard titled 'GPT-6.1 Sol - the independent scoreboard', listing six rows: Intelligence Index 51.8 at maximum effort, cost per index task $0.72 against GPT-6 Astra's $3.26, output tokens on the run 67.2 million, output speed 66.8 tokens per second, price $2.00 input and $10.00 output per million tokens with cached input at $0.10, and release date September 29, 2026. A footer reads that all figures are per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.

Båda modellerna exponerar en ansträngningsstege, och tavlan har nu publicerat en poäng och en körningskostnad för varje steg i båda. Sida vid sida säger stegarna något som den enda rubrikjämförelsen inte kan: GPT-6.1 Sols bästa konfiguration tävlar inte med Astras bästa. Den tävlar med Astras näst bästa.

• GPT-6.1 Sol, max — 51,8, 0,72 $ per indexuppgift. GPT-6 Astra, max — 52,7, 3,26 $.
• GPT-6.1 Sol, xhigh — 51,0, 0,39 $. GPT-6 Astra, xhigh — 52,4, 2,31 $.
• GPT-6.1 Sol, hög — 50,2, 0,32 $. GPT-6 Astra, hög — 50,9, 1,73 $.
• GPT-6.1 Sol, medel — 47,8, 0,21 $. GPT-6 Astra, medel — 49,6, 1,54 $.
• GPT-6.1 Sol, låg — 42,1, 0,13 $. GPT-6 Astra, låg — 45,8, 0,82 $.

Astra leder på varje nivå, vilket är den ärliga sammanfattningen av duellen och också den minst intressanta delen av den. Det intressanta är växelkursen. Om du vill ha den billigaste Astra-konfigurationen som slår GPT-6.1 Sols bästa, är det Astra vid xhigh: 52,4 mot 51,8, för 2,31 $ mot 0,72 $. Det är 0,56 av en indexpunkt för 1,59 $ mer per utvärderingskörning – ungefär 3,2 gånger kostnaden för mindre än en procent av poängen. Gå åt andra hållet och sänk GPT-6.1 Sol till xhigh, så offrar du 0,8 poäng medan notan faller till 0,39 $, vilket är 5,9 gånger billigare än Astras xhigh och en niondel av Astras körning med maximal ansträngning.

Det finns en andra tolkning av samma stege som talar emot att köpa Astra vid maximal ansträngning. Astras fyra lägre steg är alla billigare än dess max, och dess xhigh ligger 0,29 poäng under dess max – drygt en halv procent av poängen för en 29 % sänkning av körningskostnaden. Varje inköpsdiskussion om detta par som börjar i "Astra på max" och slutar i "Astra kostar 4,5 gånger mer" lämnar Astras egna billigare steg utanför jämförelsen.

Sex utvärderingar går till Astra, två går till GPT-6.1 Sol, två är lika

Det sammansatta måttet döljer en splittring. Utvärdering för utvärdering, poängsatt vid maximal ansträngning, är GPT-6.1 Sol inte en genomgående något sämre Astra — den är bättre på två saker och sämre på sex.

• GDPval-AA — Elo 1575.1 för GPT-6.1 Sol mot 1541.9 för Astra, en ledning på 33 poäng i professionella arbetsuppgifter. Detta är den största enskilda oberoende segern för den billigare modellen.
• AA-LCR v1.1, resonemang över lång kontext — 0.830 mot 0.807. GPT-6.1 Sol leder.
• AA-Briefcase v1.1 — Elo 1564.2 mot 1568.9. Astra med 4.7.
• AutomationBench-AA — 0.649 mot 0.685. Astra med 3.6 poäng.
• Terminal-Bench 4.0 — 0.561 mot 0.591. Astra med 3.0 poäng.
• SciCode — 0.542 mot 0.565. Astra med 2.3 poäng.
• Humanity's Last Exam — 0.529 mot 0.547. Astra med 1.8 poäng.
• AA-Omniscience — 41.5 mot 43.4. Astra med 1.9 poäng.
• GDP.pdf och CritPt — helt jämnt på 0.310 respektive 0.317, för båda modellerna.

Två av dessa rader är värda mer än sin placering i listan. GDPval-AA-marginalen är den enda platsen där den billigare modellens försprång är tillräckligt stort för att överleva ett byte av utvärderingsramverk, och den landar på exakt den arbetsbelastning som leverantörens positioneringsfras gör anspråk på – professionellt, dokumenttungt arbete. Och de två döda oavgjorda resultaten finns på de utvärderingar som har de snävaste spridningarna, vilket är en påminnelse om att en sammansatt skillnad på 0,84 poäng byggs upp av rader som var för sig sträcker sig från en vinst på 33 poäng till en förlust på 3,6 poäng.

Jämfört med modellen den ersätter är uppgången verklig men inte enhetlig.

Den jämförelse som spelar roll för alla som redan kör GPT-6 Sol i produktion är den som 6.1 Sol gör mot sin egen föregångare, och den oberoende redogörelsen är skarpare kring det än leverantörens inlägg var. Åtta av tio utvärderingar blir bättre. Två går bakåt.

• SciCode — GPT-6.1 Sol får 0,542 där GPT-6 Sol fick 0,576. Den nyare modellen är 3,5 punkter sämre på vetenskaplig kod.
• AA-LCR v1.1 — 0,830 för 6.1 Sol mot 0,837 för GPT-6 Sol. Hårfin skillnad, men åt fel håll, i utvärderingen av lång kontext.
• AA-Omniscience — 41,5 mot 27,1. Det här är den största förändringen i raden: ett hopp på 14,4 punkter i kunskapsutvärderingen, och träffsäkerheten på den uppsättningen stiger från 0,545 till 0,621.
• Hallucinationsfrekvens på samma uppsättning — 0,543 för GPT-6.1 Sol, ned från 0,601 för GPT-6 Sol och fortfarande över GPT-6 Astras 0,513. AA-Omniscience delar upp sin poäng i "hade rätt" och "säkert fel", och det är i uppdelningen som 6.1-uppdateringen gör nytta: den är en betydligt mindre ohederlig modell än Sol, och den är fortfarande den mest ohederliga av de tre.
• Terminal-Bench 4.0 — 0,561 mot 0,439, en ökning med 12,2 punkter. AA-Briefcase — 1482,8 till 1564,2 Elo. GDP.pdf — 0,248 till 0,310.

Tolkningen är att detta var en kunskaps- och verktygsuppdatering snarare än en resonemangsuppdatering. De utvärderingar som förändrades mest är de som belönar att veta saker och inte hitta på dem; den utvärdering som föll är en snäv, teknisk sådan. Den som har bytt till 6.1 Sol för cache-besparingen får kunskapsvinsten som en bonus och bör inte anta att den gäller för varje harness de kör.

Var styrelsen rankar det, och vad som ligger ovanför

A generated two-column scoreboard titled 'GPT-6.1 Sol vs GPT-6 Sol — the independent scoreboard', with both columns carrying the same six labels. Left column 'GPT-6.1 Sol (max)': Intelligence Index 51.8, cost per index task $0.72, SciCode 0.542, long-context reasoning 0.830, AA-Omniscience 41.5, hallucination rate 0.543. Right column 'GPT-6 Sol (max)': Intelligence Index 47.5, cost per index task $1.05, SciCode 0.576, long-context reasoning 0.837, AA-Omniscience 27.1, hallucination rate 0.601. A footer reads 'Figures per Artificial Analysis, Intelligence Index v4.3.2, read September 30, 2026.'

I resultattavlans standardordning för Intelligence Index ligger GPT-6 Astra med maximal ansträngning på 7:e plats och GPT-6.1 Sol med maximal ansträngning på 10:e plats, medan GPT-6 Sol med maximal ansträngning ligger på 20:e plats. De nio raderna ovanför GPT-6.1 Sol är två Astra-konfigurationer, tre Claude Opus 5.5-konfigurationer, en Claude Sonnet 5.5-konfiguration och två Claude Fable 5.1-konfigurationer – så modellen som GPT-6.1 Sol ligger närmast är flaggskeppet i dess egen familj, och modellen som den faktiskt har trängt undan i den ordningen är dess egen föregångare, tretton platser ned.

Tar man bort effort-inställningen komprimeras ordningen på ett sätt som spelar roll för kostnadsplanering: GPT-6.1 Sol med xhigh ligger på 13:e plats, med high på 15:e, med medium på 19:e och med low på 35:e, medan Astra ligger på 14:e plats med high, 16:e med medium och 26:e med low. Med andra ord rankas GPT-6.1 Sol med xhigh högre än Astra med high på listan, och GPT-6.1 Sol med medium rankas högre än Astra med low. Effort är en större hävstång här än modellval, åtminstone mellan dessa två.

Vad ska man göra med numret, ärligt talat

Leverantörens påstående som den här raden testade var att GPT-6.1 Sol nästan matchar flaggskeppet till ungefär en femtedel av priset. Den oberoende versionen av den meningen är: den ligger inom 0,84 indexpunkter från flaggskeppet, och utvärderingskörningen bakom dess poäng kostade 22 % av flaggskeppets. Det är tillräckligt nära påståendet för att ingen ska känna sig vilseledd av det, och det är ett starkare påstående än "overifierad" i alla avseenden som spelar roll för en köpare.

Det raden inte gör är att prissätta din arbetsbelastning. En indexkörning är en specifik blandning av uppgifter, och talet som avgör en verklig faktura är prislistan mot din egen tokenprofil — vilket är varför cachelinjen fortfarande är linjen att modellera: GPT-6.1 Sols $0.10 för cachad indata mot Astras $1.00 är en tiofaldig skillnad som ingen indexpoäng rör vid. På vår sida gäller samma vidarebefordran: OrcaRouter tillhandahåller GPT-6 Astra, GPT-6 Sol och GPT-6 Luna till OpenAI:s egna listpriser utan påslag, så den dag en leverantörs taxa ändras flyttas taxan på vår sida med den i stället för att vänta på ett andra avtal. GPT-6.1 Sol finns inte på våra rutter — den offentliga katalogen returnerar "model not found" för openai/gpt-6.1-sol i dag, och det finns inget ärligt sätt att beskriva en modell vi inte kan betjäna. Vad en API-nyckel faktiskt ger dig just nu är paret som benchmarken faktiskt argumenterar om — Astra för det svåraste arbetet, Sol för volymen — med leverantörernas listpriser vidarebefordrade utan påslag och automatisk redundansväxling mellan leverantörer när en av dem får fel.

Två saker skulle skärpa detta ytterligare. En andra oberoende testrigg på samma modell skulle visa oss huruvida GDPval-AA-försprånget är en egenskap hos modellen eller hos den utvärderingen, och det är den enskilt mest användbara saknade datapunkten i raden. Och en oberoende mätning av 272 000-token-nivån för lång kontext skulle betyda mer än ännu en sammansatt poäng, eftersom det är där den här familjens prissättning slutar vara billig.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen