
OpenAI:s Decisions API: GPT-6 Luna slutar chatta och väljer ett enda svar
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 393 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 209 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
GPT-6 Lunasläpptes den 22 september 2026 som den billiga nivån i OpenAI:s GPT-6-trappa. Det som är nytt den 29 september är ett jobb för den som inte har något med konversation att göra. OpenAI:s Decisions API tar en fråga du har skrivit, en ändlig lista med svar som du tillåter och en bit kontext – text eller en bild – och returnerar ett av dessa svar. Inte prosa. Inte ett stycke att tolka och hoppas på. Ett enda val, så att ett supportärende hamnar i en av fem köer, en bild hamnar i en modereringskategori, eller en agent väljer sitt nästa drag utifrån en policy du har definierat. Det annonserades på DevDay 2026 och är nu i begränsad förhandsversion, och OpenAI säger att en bred lansering planeras de kommande dagarna.
Det mesta av det ett team behöver innan det bygger vidare på detta är ännu inte publicerat. Det finns inget pris per anrop, ingen angiven gräns för hur många kandidatsvar en begäran kan innehålla, inget uttalande om huruvida man kan finjustera den på sina egna data, och — per den 30 september — ingen post för den någonstans i OpenAI:s eget index över utvecklardokumentation, ändringslogg eller API-referens. Vi kontrollerade alla tre. Funktionen finns för närvarande i OpenAI:s DevDay-sammanfattning och i vad en talesperson för OpenAI sade till reportrar på lanseringsdagen. Så resten av den här artikeln håller tre nivåer tydligt åtskilda: vad OpenAI har bekräftat, vad en mätning från lanseringsdagen gör anspråk på, och vad ingen ännu kan veta.
Vad ett begränsat beslut faktiskt är
Två befintliga metoder gör det här jobbet dåligt, och Decisions API riktar sig mot gapet mellan dem. Den första är att prompta en chattmodell: du skriver en noggrann instruktion som ber den välja från en lista, den skriver en mening till dig, och om du har tur kan du läsa ut token-sannolikheter ur svaret för att få något som liknar en konfidenspoäng. Det fungerar, det förbrukar tokens, och konfidenssiffran är en grov gissning. Den andra är att träna en liten klassificerare: snabb, billig, och den behöver märkta data plus en omträningskörning varje gång etiketuppsättningen ändras.
En beslutsmodell ligger mellan dem. Den accepterar nya etiketter i prompten – på samma sätt som en prompt gör – men returnerar en poäng eller ett val som en utvecklare kan förgrena sig på utan att parsa, vilket är den egenskap en klassificerare hade och en chattmodell aldrig hade. OpenAI är inte obekant med formen: dess Moderation API har i åratal returnerat poäng per kategori i stället för text, med en skillnad som spelar roll här. Moderations kategorier är OpenAIs. Decisions API:s kategorier är dina.
Begränsningen är produkten, och det är värt att vara precis om vad den ger och inte ger. Ett ändligt utfallsrum innebär att varje tillåtet värde är känt i förväg, så din applikation kan avvisa ett svar som den inte har definierat, koppla en annan behörighetsnivå till varje gren och falla tillbaka på en människa när konfidensen eller kontexten är svag. Det gör också offlineutvärdering hanterbar, eftersom varje testfall har en målklass och en mätbar kostnad när det är fel. Vad den inte ger är korrekthet. En begränsad modell kan fortfarande välja fel giltigt svar, styras av vilseledande kontext eller ärva biasen i de kategorier du skrev.
Påståendet om 150 millisekunder, och siffran som OpenAI inte publicerade
OpenAI säger att Decisions API fattar beslut ungefär tio gånger snabbare än GPT-6 Luna gör via det vanliga API:et – i storleksordningen 150 millisekunder mot cirka 1,6 sekunder. Siffran är leverantörsuppgiven och inte reproducerad; det finns ingen oberoende mätning av den under de två dagar som gått sedan lanseringen, och OpenAI:s egen sammanfattning säger bara "beslutsfattande i realtid". Ingen latensfördelning, ingen region, ingen indatastorlek, ingen samtidighetsnivå och inget servicenivåavtal åtföljer siffran.
Vår egen trafikdata är inte en ersättning för det testet, men den förklarar varför den saknade fördelningen spelar roll. Under de sju dagarna fram till den 30 september visar GPT-6 Luna, betjänad via OrcaRouters vanliga chat-completions-rutt, en median på 699 millisekunder och en p95 på 7,6 sekunder över 3,23 miljarder tokens av blandad arbetsbelastning – en spridning på mer än en storleksordning mellan mitten och svansen. Det är en annan förfrågningsprofil än ett begränsat beslut, så det är inte en jämförelse med påståendet om 150 ms. Det är anledningen till att en enda p50-siffra i rubriken är fel tal att dimensionera en tidsgräns efter. Om du testar förhandsversionen, registrera median, p95 och p99 separat för text- och bildindata, inkludera nätverkstid och återförsök, och mät den deadline som din produkt faktiskt har – ett routingbeslut för en asynkron kö och ett som ligger mellan ett klick och en betalning delar inte samma latensbudget.

Prissättning: vad den underliggande modellen kostar, och varför det inte är API:ets pris
OpenAI har inte publicerat någon prisuppgift för Decisions API. Det är inte heller säkert att anta att Luna-tokenpriserna gäller, eftersom Decisions API är en egen paketering – en annan slutpunkt med andra gränser, och OpenAI har sagt att man kommer att dela mer information ”vid bred utrullning”. Den som i dag uppger en kostnad per beslut åt dig drar bara en egen slutsats.
Det som publiceras är prislistan för modellen som den bygger på, hämtad från OpenAIs prissida den 30 september 2026:
• Indata – 0,10 $ per miljon tokens, vilket blir 0,20 $ över 272 000 indatatokens
• Utdata – 0,50 $ per miljon tokens, vilket blir 0,75 $ över 272 000 indatatokens
• Cachad indata – 0,01 $ per miljon tokens; cacheskrivningar debiteras med 0,125 $, en premie på 25 % jämfört med den ocachade taxan
• Batch- och Flex-bearbetning – 50 % av standardtaxorna; Snabbläge – 2x de tillämpliga taxorna
Långkontextgränsen är den som överraskar folk, och den fungerar på samma sätt som i GPT-6-familjen: att överskrida 272 000 indata-tokens prisar om hela begäran enligt den högre nivån, inte bara överskottet. Ett besluts-API som skickar ett långt dokument eller en stor bilduppsättning till modellen är precis den typ av anrop som kan passera den gränsen, vilket är ytterligare en sak som förhandsversionens opublicerade gränser lämnar öppet.
GPT-6 Luna på sina egna villkor
Om man tar bort API:et är modellen under huven en resonemangsmodell i botten av en familj med tre nivåer — under GPT-6 Sol till $2.00/$10.00 och flaggskeppet GPT-6 Astra till $10.00/$50.00 — med ett kontextfönster på 1 050 000 tokens, ett utdatatak på 128 000 tokens, en kunskapsgräns den 18 maj 2026 och en resonemangsansträngning som kan ställas in över sex värden från ingen till max. Den tar text- och bildindata och returnerar text, och i OpenAIs egen utvecklardokumentation är standardinställningen för ansträngning medium. Ett praktiskt förbehåll från samma sida, orelaterat till Decisions API men relevant om du kopplar in Luna som reserv: i Chat Completions fungerar funktionsanrop endast när resonemangsansträngningen är inställd på ingen. Verktyg med någon annan ansträngningsinställning kräver Responses API.
När det gäller kvalitet är det oberoende måttet Artificial Analysis Intelligence Index på 37,3 för Luna vid maximal ansträngning, mot 47,5 för GPT-6 Sol – en skillnad på omkring tio punkter, vilket är det ärliga sättet att tolka prisskillnaden på tjugo gånger för input. Ingen av siffrorna säger något om Decisions API, vars begränsade uppgift är en helt annan mätning och som inte har någon publicerad poäng.

Jev, Laya och inramningen av "system one"
Decisions API kom inte till ett tomt fält. TypeSafe AI:s Jev, som lanserades den 15 september 2026 av Diogo Almeida och har varit allmänt tillgänglig sedan den 21 september, är modellen som gjorde den här kategorin begriplig för utvecklare: den genererar ingen text alls, utan returnerar i stället typade svar med konfidensvärden, för 0,042 USD per miljon indatatoken, med utdata som debiteras till noll. Det första oberoende testet av Jev, utfört av Every, genomförde 777 bedömningar över 37 dokument på under 0,7 sekunder för ungefär en fjärdedels cent, och ett andra test uppmätte en median på 0,35 sekunder per passage mot 8,83 sekunder för Claude Fable 5.1 vid hög ansträngning – cirka 25 gånger snabbare till ungefär 1/580 av kostnaden, samtidigt som den fångade sex av sju avsiktligt inplanterade defekter, medan Fable 5 fångade alla sju. ”Bra men inte perfekt” var Everys omdöme, och det är den rätta tolkningen i en rad. Laya är den tredje aktören i samma form, en beslutsmodell som svarar utan att skriva en enda token.
Om OpenAI byggde Decisions API på grund av Jev är spekulation. The New Stack, som rapporterade om det på lanseringsdagen, kallade en reaktion på TypeSafe för ”sannolik” och noterade att OpenAI troligen skyndade på tillkännagivandet före DevDay; OpenAI har inte sagt något sådant, och tidpunkten – att Jev blev allmänt tillgänglig den 21 september, DevDay den 29 september – är talande men inte bevis. Vad som inte är spekulation är att de två ännu inte är jämförbara på den axel som köpare bryr sig om. Jev publicerar ett pris, en anropsform och ett GA-datum. Decisions API publicerar inget av dessa tre.
Var den körs, och vad som ska hållas varmt bredvid den
Decisions API är OpenAI:s egen paketering. Det är inte en modell i vår katalog och vi routar den inte, så om du vill ha just den här slutpunkten är det hos OpenAI den finns. Modellen som den bygger på är en annan sak: GPT-6 Luna är en live-rutt på OrcaRouter till OpenAI:s listpris utan påslag som förs vidare – 0,10 USD för indata och 0,50 USD för utdata per miljon tokens, med >272K-nivån till 0,20/0,75 USD – och under de sju dagarna fram till den 30 september har den hanterat 3,23 miljarder tokens via oss med en felfrekvens på 0,18 %.
Det spelar roll för hur du minskar risken i en förhandsversion. Det förnuftiga sättet att testa en endpoint för begränsade beslut är att hålla den promptbaserade vägen varm som fallback, eftersom en förhandsversion kan ändra gränser eller prissättning utan förvarning och ett beslut som ligger på en kritisk väg behöver någonstans att ta vägen. Att hålla den fallbacken på samma nyckel som dina andra modeller innebär inget andra avtal och ingen kodändring för fallbackvägen: ett API för 200+ modeller, med automatisk failover mellan leverantörer när en krånglar. Och om ditt beslut är ett steg i en längre kedja komponerar routing-DSL:en modeller till ett enda anrop, vilket är precis det orchestrator-plus-decider-mönster som Jev-bevakningen populariserade — en större modell som planerar, en liten modell som väljer varje steg. Det mönstret går att bygga idag av modeller vi tillhandahåller; själva Decisions API skulle ligga utanför det tills OpenAI öppnar upp det.
Vem ska flytta, och vem ska vänta
Om ditt problem är ett klassificerings- eller routingjobb med hög volym där en felaktig gren är billig och reversibel, är förhandsversionen värd en förfrågningsstruktur och en märkt datamängd den här veckan – förmågan är verklig, begränsningen är en genuin förbättring jämfört med att tolka prosa, och en förhandsversion är den billigaste möjliga tidpunkten att lära sig var dess felkostnader hamnar. Om ditt beslut auktoriserar pengar, skickar meddelanden till en kund eller sitter mellan en användare och en betalning, förändrar inget med den här veckan din kalkyl: det finns inget publicerat pris att modellera, ingen publicerad gräns att designa kring, inget SLA och inget ord om huruvida du kan justera saken på dina egna data. De fyra luckorna är vad "bred utrullning" måste fylla, och tills OpenAI namnger dem är den ärliga tolkningen av Decisions API ett lovande gränssnitt med en snabb tidsplan enligt leverantören och ingen räkning bifogad.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
