OpenAI sänkte GPT-5.6 API-priserna: Vad som ändrades, varför och hur du får det
Guides & Insights

OpenAI sänkte GPT-5.6 API-priserna: Vad som ändrades, varför och hur du får det

Författare

jinhao song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 30 juli 2026 sänkte OpenAI API-priserna för sina två billigare GPT-5.6-modeller – en kraftig sänkning av den billigaste nivån och en trimning av mellannivån, medan flaggskeppsmodellen lämnades orörd. Det är ett anmärkningsvärt drag i ett allt hårdare priskrig, och det hamnade på den publicerade prislistan omedelbart. Den här artikeln förklarar exakt vad som ändrades, tekniken bakom, hur de nya priserna står sig mot konkurrenterna, de dolda kostnaderna att hålla koll på, hur du sänker din nota ytterligare – och hur de lägre priserna redan är live på OrcaRouter med 0 % påslag.

Varje siffra nedan är märkt med källa. Prissättningen är per miljon tokens (inmatning / utmatning) och återspeglar OpenAI:s prislista från 30 juli 2026, som rapporterats av medier inklusive Unite.AI, samt OrcaRouters pass-through-modellsidor; konkurrentsiffror är källmärkta. Priserna ändras — verifiera innan du bygger.

TL;DR. OpenAI sänkte GPT-5.6 Luna till 0,20 $ / 1,20 $ (från 1 $ / 6 $, cirka 80 % rabatt) och GPT-5.6 Terra till 2 $ / 12 $ (från 2,50 $ / 15 $, cirka 20 % rabatt), medan GPT-5.6 Sol ligger kvar på 5 $ / 30 $. Två effektivitetsvinster betalade för det: omskrivna GPU-kernlar (cirka 20 % lägre serveringskostnad) och en omdesignad spekulativ avkodningsmodell (15 %+ snabbare tokengenerering). Sänkningen pressar Luna under Anthropics Haiku 4.5 och mot det billiga golvet för öppna modeller som DeepSeek och GLM har satt. Om du dirigerar via en leverantörsneutral slutpunkt utan påslag, som OrcaRouter, är de nya priserna redan live — samma pris, ett OpenAI-kompatibelt API, med alla konkurrerande modeller bredvid för att jämföra och dirigera mellan.

Viktiga slutsatser

• GPT-5.6 Luna: nu $0.20 / $1.20 per 1M tokens, ner från $1 / $6 — ungefär en sänkning på 80 %.

• GPT-5.6 Terra: nu $2 / $12, ned från $2.50 / $15 — en sänkning på cirka 20%.

• GPT-5.6 Sol (flaggskepp): oförändrat till $5 / $30.

• Varför: omskrivna produktions-GPU-kärnor (~20 % lägre serveringskostnad) plus en ny design av draftmodellen för spekulativ avkodning (15 %+ effektivare tokengenerering), enligt OpenAI:s teknikinlägg från 29 juli.

• Så här får du det: priset är redan återspeglat på OrcaRouter (0% påslag) — Luna för $0,20 / $1,20 — genom en OpenAI-kompatibel slutpunkt.

Vad exakt ändrades?

OpenAI:s GPT-5.6-familj är uppbyggd som en nivåtrappa: Luna (snabb, billigast), Terra (mellan) och Sol (flaggskepp). Prissänkningen den 30 juli gällde de två billigare nivåerna. Enligt den rapporterade prislistan sjönk GPT-5.6 Luna från $1 / $6 till $0,20 / $1,20 per miljon inmatnings-/utmatningstoken — en minskning med cirka 80 % på både inmatning och utmatning — och GPT-5.6 Terra sjönk från $2,50 / $15 till $2 / $12, ungefär 20 %. GPT-5.6 Sol, flaggskeppet byggt för det svåraste resonerandet och agentisk kodning, höll sig på $5 / $30. Volymnivåerna blev dramatiskt billigare; toppnivån ändrades inte.

Grundpriset per token är inte hela historien. GPT-5.6-prissättningen har också nivåer baserade på inmatningslängd (mycket långa sammanhang flyttas till en högre taxa), en rabatt för promptcache (cachad inmatning är mycket billigare än färsk inmatning) och ett batchalternativ (asynkrona jobb till rabatterat pris). Alla tre gäller även efter prissänkningen, så det effektiva priset för en arbetsbelastning som är tung på cache eller batch kan bli ännu lägre. Se upp med långkontext-nivån i andra riktningen: att mata in enorma prompter kan knuffa upp dig en nivå.

De två optimeringarna bakom klippet

Det här var ingen förlustledargest – OpenAI beskrev det som en effektivitetsutdelning. I ett tekniskt inlägg den 29 juli 2026 beskrev medlemmar av OpenAIs teknikpersonal optimeringar inom inferens och agentmiljön bakom Codex och ChatGPT Work. Två saker sticker ut. För det första omskrivningar av GPU-kernlar i produktionsinfrastrukturen – där Sol, som körs i Codex, användes för att skriva om företagets egna kernels – vilket OpenAI säger minskade de totala serveringskostnaderna med cirka 20 %. För det andra en omdesignad utkastmodell för spekulativ avkodning som enligt uppgift förbättrade effektiviteten i tokengenereringen med mer än 15 %. Lägre serveringskostnad, som förs vidare till kunderna som lägre priser i de volymstarka nivåerna, är berättelsen – och det är en glimt av en återkopplingsslinga som hela branschen jagar: att använda frontier-modeller för att optimera själva infrastrukturen som serverar dem.

Hur de nya priserna jämförs

Prissänkningen riktar sig rakt mot konkurrenterna. Enligt Unite.AI:s rapportering undercutar Luna:s nya $0,20 / $1,20 Anthropic:s Haiku 4.5 med ungefär 5x på input och cirka 4x på output, och Terra:s nya $2 / $12 hamnar under Claude Sonnet 5:s standardpris (rapporterat till $3 / $15, med verkan efter 31 augusti 2026). Mot fältet av öppen vikt ligger Luna nu nära det billiga inferensgolv som etablerats av DeepSeek:s V4-serie och Zhipu:s GLM-5.2 (ungefär $1,20 / $4,10), med Alibaba:s Qwen och Google:s Gemini Flash-nivåer i samma härad. Med andra ord har OpenAI flyttat sina volymnivåer ner till där de billigaste kapabla modellerna redan finns – vilket minskar prispåslaget för att välja en proprietär modell framför en öppen.

Inferens fortsätter att bli billigare.

Zoomar man ut passar den här prissänkningen in i en flerårig trend: kostnaden för en given kapacitetsnivå har fallit kraftigt, generation efter generation, när labben pressar ut mer genomströmning ur samma hårdvara. OpenAI:s egna äldre prisnivåer illustrerar nedgången över tid, och varje effektivitetsgenombrott — bättre kärnor, spekulativ avkodning, billigare attention — tenderar att visa sig som en prissänkning inom några månader. För köpare är den praktiska innebörden att arkitektera för en värld där inferens blir billigare enligt ett schema: bind dig inte för hårt till en enda modells prissättning, och håll byten billiga.

Den dolda kostnaden att se upp för: resonemangstokens

GPT-5.6-modeller är resonemangsmodeller, och det påverkar de faktiska kostnaderna. När resonemang är aktiverat genererar modellen interna resonemangstokens som debiteras som utdata – så din effektiva utdatakostnad kan bli högre än vad en naiv uppskattning av "ord i svaret" antyder, särskilt för svåra prompts med hög resonemangsansträngning. Lösningen är att anpassa resonemangsansträngningen till uppgiften (låg eller av för enkla anrop), sätta ett tak på utdata där det är möjligt och mäta faktisk tokenanvändning i stället för att anta. Ett lägre pris per token hjälper, men att kontrollera hur många tokens du genererar hjälper mer.

Vad det innebär för utvecklare

Om du använder GPT-5.6 Luna eller Terra för stora volymer – klassificering, extraktion, routing, lätta agenter, chatt – har din nota just sjunkit, i vissa fall med större delen av dess värde, utan att någon kod behöver ändras. Det gör volymnivåerna ännu attraktivare för kostnadskänsliga arbetsbelastningar och minskar prisskillnaden mot billiga öppna modeller. Flaggskeppsprissättningen är oförändrad: Sol till $5 / $30 är fortfarande ett premiumval för de svåraste uppgifterna. Det vinnande mönstret är att dirigera efter svårighetsgrad – billiga nivåer (eller billiga öppna modeller) för de lätta 80 procenten, flaggskeppet bara där det tjänar in sin kostnad.

Så här minskar du din räkning ytterligare

Prissänkningen är en grund att bygga på, inte mållinjen. De största ytterligare hävstängerna: cache av promptar (återanvänd en stabil systemprompt eller lång kontext och betala den mycket lägre avgiften för cachad inmatning); batchalternativet (kör icke-brådskande jobb asynkront till rabatterat pris); nivå- och modellroutning (skicka varje begäran till den billigaste modellen som kan hantera den, inklusive öppna modeller); och resonemangskontroll (betala inte för djupa resonemang på triviala anrop). Sammantagna minskar dessa rutinmässigt de faktiska räkningarna mycket mer än någon enskild prisförändring. Som en konkret referens: vid 10 miljoner tokens per månad med 70 % inmatningsandel, ger Luna's nya priser ungefär 5 dollar i månaden (cirka 4,37 dollar med cachning); samma volym på Sol är cirka 125 dollar i månaden — det tydligaste argumentet för routning efter svårighetsgrad.

Så här fångar du de lägre priserna direkt

Här är delen som knyter ihop allt. a href="https://www.orcarouter.ai/">OrcaRouter/a> tar 0 % påslag och förmedlar leverantörspriserna direkt, så OpenAIs priser är redan live på OrcaRouter: GPT-5.6 Luna visar $0,20 / $1,20 och Terra $2 / $12 på modellsidorna just nu — samma priser som på OpenAIs egen prissida, tillgängliga via en enda OpenAI-kompatibel slutpunkt tillsammans med 185+ andra modeller. Du får samma pris utan migrering, och du kan prisjämföra Luna och Terra med DeepSeek, GLM, Qwen, Gemini och Claude på ett ställe, för att sedan dirigera varje förfrågan till det som är billigast för jobbet. Det finns också en gratissnivå och en offersida för ytterligare besparingar.

Prissänkningen är redan live på OrcaRouter: GPT-5.6 Luna för $0,20 / $1,20 per 1M tokens, vidarebefordrad med 0 % påslag.

Välj rutt efter svårighetsgrad för att spara ännu mer.

Den billigaste fakturan är inte en enda modell — det är rätt modell per förfrågan. Eftersom OrcaRouter exponerar hela modellutbudet genom en enda slutpunkt kan du skicka enkla, högvolymsanrop till Luna eller en billig öppen modell och reservera Sol eller en annan flaggskeppsmodell för de svåra, med byte via en konfigurationsändring i stället för en ny integration. En prissänkning på Luna gör den strategin att dirigera efter svårighetsgrad ännu billigare, utan att du behöver koppla om något.

FAQ

Hur mycket sänkte OpenAI priserna på GPT-5.6?

GPT-5.6 Luna sjönk från $1 / $6 till $0,20 / $1,20 per miljon tokens (cirka 80 %), och GPT-5.6 Terra från $2,50 / $15 till $2 / $12 (cirka 20 %). GPT-5.6 Sol låg kvar på $5 / $30.

När trädde prissänkningen i kraft?

30 juli 2026, registrerad i OpenAI:s API-ändringslogg och live på den publicerade prislistan.

Varför sänkte OpenAI priserna?

OpenAI tillskriver det inferensoptimeringar — omskrivna produktions-GPU-kärnor (cirka 20 % lägre serveringskostnad) och en omdesignad spekulativ avkodningsmodell (15 %+ högre tokengenereringseffektivitet) — enligt ett ingenjörsinlägg från den 29 juli 2026.

Har flaggskeppet (Sol) blivit billigare?

Nej. GPT-5.6 Sol ligger kvar på $5 / $30 per miljon tokens. Endast de två billigare nivåerna, Luna och Terra, sänktes.

Hur jämför sig de nya priserna med Anthropic och öppna modeller?

Enligt rapporter underbjuder Luna nu Anthropics Haiku 4.5 med ungefär 5x input / 4x output, och Terra hamnar under Claude Sonnet 5:s standardpris ($3 / $15). Luna ligger också nära den billiga golvnivån för öppna modeller som satts av DeepSeek och GLM-5.2.

Vad är haken med resonemangstokens?

GPT-5.6 är resonemangsmodeller; interna resonemangstokens debiteras som utdata, så den faktiska utdatakostnaden kan överstiga en naiv uppskattning. Justera resonemangsinsatsen och begränsa utdata för att kontrollera den.

Hur får jag de nya lägre priserna?

De är redan live på OpenAIs API och, med 0% påslag, på OrcaRouter — där GPT-5.6 Luna visar $0.20 / $1.20 — genom en OpenAI-kompatibel slutpunkt, utan att någon kodändring behövs.

Slutsats

OpenAIs prissänkning den 30 juli gör GPT-5.6 Luna och Terra dramatiskt billigare för högvolymarbete – en effektivitetsutdelning från kernel-omskrivningar och spekulativ avkodning, och ett tydligt svar på ett verkligt priskrig som nu undercuttar Anthropics billigare nivåer och närmar sig golvet för öppna modeller. Flaggskeppet Sol är oförändrat, så dirigera efter svårighetsgrad, utnyttja cachning och batchning, och kontrollera resonemangstoken för att spara mest. Och eftersom OrcaRouter förmedlar leverantörspriser med 0% påslag, är de lägre priserna redan aktiva där – samma pris, en OpenAI-kompatibel slutpunkt, hela modellutbudet på ett ställe. Ta del av sänkningen utan att ändra en enda rad kod, och låt varje förfrågan välja den billigaste modellen som kan utföra jobbet.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube