En genererad tvåkolumns jämförelsetavla med titeln 'GPT-6.1 Sol vs GPT-5.6 Sol – resultattavlan'. Vänster kolumn 'GPT-6.1 Sol': rader som lyder 'Intelligensindex: 51.8', 'Kostnad per indexuppgift: $0.72', 'Indata / utdata: $2.00 / $10.00', 'Cachad indata: $0.10', 'Utdatatoken vid indexkörning: 67M', 'Ansträngningsgolv: lågt'. Höger kolumn 'GPT-5.6 Sol': rader som lyder 'Intelligensindex: 47.0', 'Kostnad per indexuppgift: $1.99', 'Indata / utdata: $4.00 / $20.00', 'Cachad indata: $0.40', 'Utdatatoken vid indexkörning: 90M', 'Ansträngningsgolv: inget'. En sidfot lyder 'Oberoende siffror enligt Artificial Analysis v4.3.2 vid maximal ansträngning; leverantörslistpriser'.
Guides & Insights

GPT-6.1 Sol vs GPT-5.6 Sol: Fyra och en halv indexpoäng, halva notan, två regressioner

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

OpenAI släppte GPT-6.1 Sol den 29 september 2026, elva veckor efter GPT-5.6 Sol, som släpptes den 9 juli 2026 som den förra generationens flaggskepp. Båda är fortfarande till salu, båda går fortfarande att anropa, och skillnaden mellan dem på den neutrala resultattavlan är 4,8 poäng — 51,8 mot 47,0 på Artificial Analysis Intelligence Index, båda uppmätta vid maximal resonemangsansträngning på samma svit med tio utvärderingar. Prisskillnaden är mycket större än poängskillnaden: $0,72 per slutförd indexuppgift mot $1,99, och $2,00/$10,00 per miljon tokens mot $4,00/$20,00. Det är den korta versionen. Den långa versionen är att uppgraderingen inte är enhetlig, och två av utvärderingarna gick bakåt.

Vad varje modell är, och vad som ersatte vad

GPT-5.6 Sol var toppen av 5.6-serien – en sluten modell som endast är tillgänglig via API, med ett kontextfönster på 1 050 000 token, ett utdatatak på 128 000 token, indata för text, bild och fil samt en resonemangsstege som sträcker sig från ingen till max. Den beskrevs av OpenAI som nivån byggd för det svåraste arbetet: långsiktiga agentiska arbetsflöden, programvaruutveckling över flera filer, djupgående resonemang, och priset sattes därefter till 4,00 USD och 20,00 USD per miljon token, med cachad indata på 0,40 USD och cacheskrivningar på 5,00 USD. Över 272 000 indatatoken ändrades priset till 8,00 USD och 30,00 USD, och den hade en Batch-nivå på 2,50 USD och 15,00 USD.

GPT-6.1 Sol är mellannivån i generationen som kom efter: under GPT-6 Astra, över GPT-6 Luna, och nu modellen som Open​AI riktar mot kostnadsmedvetna utvecklare. Den behåller fönstret på 1 050 000 token och utdatataket på 128 000 token, utökar kunskapsavskärningen från 20 april till 30 april 2026, och minskar ansträngningsstegen från sex steg till fem — low, medium (standard), high, xhigh, max. Värdet none som GPT-5.6 Sol accepterade returnerar nu ett fel, och Open​AI:s migreringsvägledning är tydlig med att ersättningen är low, inte en tyst uppgradering.

Det här är värt att stanna upp vid, eftersom det är den enda förändringen i släppet som kostar pengar i stället för att spara pengar. En pipeline som användenone för att få ett billigt, snabbt anrop utan resonemang har inte den konfigurationen längre, i någon av modellfamiljerna. Det billigaste steget på GPT-6.1 Sol är ett resonemangssteg, och resonemangstoken faktureras som uttoken oavsett om du kan se dem eller inte.

Stegen, steg för steg

Den oberoende nämnden publicerar en poäng och en körningskostnad för varje ansträngningsnivå på båda modellerna, vilket gör duellen till något mer användbart än en enskild jämförelse. Uppställda vid motsvarande inställningar:

• Ansträngningsnivåer, GPT-6.1 Sol — max 51,8 vid $0,72 per indextask; xhigh 51,0 vid $0,39; hög 50,2 vid $0,32; medium (standard) 47,8 vid $0,21 • Utdatahastighet — 59,7 tokens per sekund för GPT-6.1 Sol mot 87,8 för GPT-5.6 Sol
• Tid till första chunk — 332 sekunder för GPT-6.1 Sol mot ett snabbare värde för GPT-5.6 Sol, mot en median på resultattavlan nära 4 sekunder
• Utdatatoken i indexkörningen — 67,2 miljoner för GPT-6.1 Sol mot 90,0 miljoner för GPT-5.6 Sol
• Indata-/utdatapris — $2,00 / $10,00 mot $4,00 / $20,00
• Cachad indata — $0,10 mot $0,40; cacheskrivningar $2,50 mot $5,00
• Batchpris — inte publicerat för GPT-6.1 Sol mot $2,50 / $15,00 för GPT-5.6 Sol
• Långkontextsteg — vid över 272 000 indatatoken omprissätts GPT-6.1 Sol till $4,00 / $15,00 för hela begäran mot GPT-5.6 Sols $8,00 / $30,00
• Lägsta ansträngningsnivå — låg mot ingen

Två saker framgår av den listan. Den första är att prissänkningen är strukturell snarare än kampanjbaserad: GPT-6.1 Sols standardpris på 2,00 och 10,00 dollar understiger GPT-5.6 Sols batchpris på 2,50 och 15,00 dollar, så även den gamla modellens rabatterade nivå är dyrare än den nya modellens listpris. Den andra är att uppgraderingen inte är en rak linje när det gäller latens. GPT-6.1 Sol genererar utdata en tredjedel långsammare och det tog 332 sekunder till första chunk i boardens långprompttester – samma storleksordning som GPT-6 Sols 107 sekunder och ungefär åttio gånger boardens resultat. Om du byggde en interaktiv produkt på GPT-5.6 Sol är detta en funktionell regression oberoende av alla benchmarks, och åtgärden är arkitektonisk, inte en parameter.

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

Två utvärderingar rörde sig åt fel håll

Den sammansatta vinsten är 4,8 punkter. Komponenterna är inte enhetligt positiva, och styrelsens poäng per utvärdering säger detsamma:

• SciCode — GPT-6.1 Sol 0,542 mot GPT-5.6 Sol 0,571. En regression på 2,9 punkter inom vetenskaplig kodning.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 mot GPT-5.6 Sol Elo 1611,3. En Elo-regression på 36 punkter inom ekonomiskt värdefullt kunskapsarbete.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 mot GPT-5.6 Sol 0,495. En förbättring på 3,4 punkter.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 mot GPT-5.6 Sol 0,399. En förbättring på 16 punkter, den största enskilda förändringen i den parvisa jämförelsen.
• AA-Omniscience — GPT-6.1 Sol 41,5 mot GPT-5.6 Sol 22,0, vilket handlar om kunskapstillförlitlighet och hallucination snarare än rå återkallning.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — de återstående fem, som fullbordar det sammansatta måttet och är där resten av förbättringen på 4,8 punkter tjänas in.

En modell som är meningsfullt bättre på terminalarbete, betydligt bättre på faktatillförlitlighet och mätbart sämre på vetenskaplig kodning och på Elo för professionellt arbete är inte en strikt bättre modell. Den är en annan punkt på frontlinjen, och den placerades där med avsikt: Open​AIs egen inramning av lanseringen för GPT-6.1 Sol är kostnad per slutförd uppgift vid nästan flaggskeppskvalitet, inte maximal poäng. Om din arbetsbelastning är SciCode-formad eller GDPval-formad är det sammanvägda talet inte det som gäller dig, och regressionen är det.

GPT-5.6 Sol har fortfarande det publicerade långkontextresultatet

Det enda stället där den äldre modellen har en siffra som den nyare inte har är hämtningsnoggrannhet i det kontextband där GPT-6.1 Sols prislista ändras. GPT-5.6 Sol har ett publicerat MRCR v2-resultat för åtta nålar på 91,5 % i intervallet 256 000–512 000 token. GPT-6.1 Sol har ingen publicerad motsvarighet, och över 272 000 indatatoken omprissätts hela dess begäran till 2× indata och cache samt 1,5× utdata.

Lägg ihop de två fakta, och segmentet där den nya modellens ekonomi är svagast är exakt det segment där den gamla modellen har den enda dokumenterade styrkan. Besparingarna försvinner inte – $4.00 och $15.00 på den omprissatta nivån mot $8.00 och $30.00 på GPT-5.6 Sols egen långkontextnivå är fortfarande en halvering – men halva-priset-berättelsen är en berättelse för generell arbetsbelastning, och en långkontextpipeline för informationssökning är inte det. Om det är din arbetsbelastning är GPT-5.6 Sol till $4.00 och $20.00 med en publicerad 91,5 % en försvarbar plats att stanna kvar på.

GPT-5.6 Sols övriga publicerade resultat förblir intakta och är anledningen till att vissa team inte kommer att byta: BrowseComp 90,4 för webbforskningsagenter, Terminal-Bench 2.1 på 88,8 och 88,0, SWE-Bench Pro 64,6, Agents' Last Exam 53,6, OSWorld 2.0 på 62,6. De är OpenAI-rapporterade, på OpenAI:s harness, och de rapporterades i juli. Det som har förändrats sedan dess är att panelen nu poängsätter båda modellerna i en och samma svit med en och samma uppsättning inställningar, och den äldre modellen förlorar på det sammansatta måttet och på kostnaden.

Själva migreringen är en strängändring, med ett undantag

Samma leverantör, samma API-yta, intill varandra i rankningen, samma fönster och utdatatak – så för de flesta stackar är detta en modellidentifierare och ett pris som halveras. Undantagen är specifika och värda att namnge innan du slår om.

Om din kod ställer in reasoning.effort till none eller minimal, kommer den att misslyckas i stället för att degradera, och low är den dokumenterade ersättningen. Om din trafik kör över 272 000 indatatokens, kontrollera den omprissatta nivån innan du modellerar besparingen. Om din produkt är beroende av tid till första token, mät innan du levererar, eftersom boardens 332-sekunderssiffra inte är ett avrundningsfel. Och om dina utvärderingar har en SciCode-formad eller GDPval-formad del i sig, kör den delen på båda modellerna i stället för att lita på det sammansatta resultatet.

Båda modellerna finns på OrcaRouter till Open​AIs egna listpriser — GPT-6.1 Sol till $2,00 och $10,00 med cachad inmatning till $0,10, GPT-5.6 Sol till $4,00 och $20,00 med cachad inmatning till $0,40 — under en genomströmningsmodell som lägger en Open​AI-prisändring på vår sida samma dag den landar i stället för efter att en återförsäljare har omförhandlat. Eftersom prislistan förs vidare oförändrad i stället för att läggas på, är aritmetiken i den här artikeln den aritmetik du får: samma modell på $0,72 per uppgift, samma halvering, inget plattformspremium som läggs på åt någon av sidorna.

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

Den praktiska nyttan med att ha båda bakom en och samma slutpunkt är att jämförelsen förblir levande. Skicka ny trafik till GPT-6.1 Sol, håll GPT-5.6 Sol bara en konfigurationsändring bort som reserv och som den långa kontextvägen, och låt automatisk failover täcka fönstret där tillgängligheten och Enterprise-aktiveringen för en två månader gammal flaggskeppsmodell fortfarande håller på att stabiliseras. En migrering som halverar räkningen och flyttar två delbenchmarks bakåt är inte ett beslut att fatta en gång och sedan glömma; det är ett beslut att fatta per rutt, och ett routinglager är vad som gör det billigt.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Där var och en hör hemma

• Allmänt agentiskt och terminalbaserat arbete — GPT-6.1 Sol. Sexton poäng på Terminal-Bench 4.0 och halva priset är inte ett svårt val.
• Faktatillförlitlighet, produkter med hämtade svar — GPT-6.1 Sol, med ett gap på nästan tjugo poäng i AA-Omniscience.
• Vetenskaplig kodning — kontrollera dina egna utvärderingar först. Resultattavlan visar en regression på 2,9 punkter, och det sammansatta måttet kommer inte att fånga upp den.
• Ekonomiskt värdefullt kunskapsarbete — samma förbehåll. GDPval-AA Elo-regressionen är 36 poäng.
• Långkontexthämtning över 272 000 tokens — GPT-5.6 Sol, tills GPT-6.1 Sol har en publicerad siffra i det intervallet.
• Interaktiva, latenskänsliga ytor — mät innan du migrerar. Snabbare utdata, mycket långsammare första token.
• Billigaste anrop utan resonemang — ingen av dem. Den konfigurationen finns inte längre i den här familjen.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen