Hero-titelkort med texten 'OpenAI:s Decisions API', med underrubriken 'GPT-6 Luna slutar chatta och väljer ett svar', med tre rundade kort med texterna 'Ett svar från en lista du definierar', 'Leverantörsuppgivet ~150 ms' och 'Inget publicerat pris ännu', en sidfot med texten 'OpenAI-siffror är leverantörsrapporterade; ingen oberoende mätning ännu.', och OrcaRouter-logotypen komponerad i nedre högra hörnet.
Guides & Insights

OpenAI:s Decisions API: GPT-6 Luna slutar chatta och väljer ett enda svar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GPT-6 Lunasläpptes den 22 september 2026 som den billiga nivån i OpenAI:s GPT-6-trappa. Det som är nytt den 29 september är ett jobb för den som inte har något med konversation att göra. OpenAI:s Decisions API tar en fråga du har skrivit, en ändlig lista med svar som du tillåter och en bit kontext – text eller en bild – och returnerar ett av dessa svar. Inte prosa. Inte ett stycke att tolka och hoppas på. Ett enda val, så att ett supportärende hamnar i en av fem köer, en bild hamnar i en modereringskategori, eller en agent väljer sitt nästa drag utifrån en policy du har definierat. Det annonserades på DevDay 2026 och är nu i begränsad förhandsversion, och OpenAI säger att en bred lansering planeras de kommande dagarna.

Det mesta av det ett team behöver innan det bygger vidare på detta är ännu inte publicerat. Det finns inget pris per anrop, ingen angiven gräns för hur många kandidatsvar en begäran kan innehålla, inget uttalande om huruvida man kan finjustera den på sina egna data, och — per den 30 september — ingen post för den någonstans i OpenAI:s eget index över utvecklardokumentation, ändringslogg eller API-referens. Vi kontrollerade alla tre. Funktionen finns för närvarande i OpenAI:s DevDay-sammanfattning och i vad en talesperson för OpenAI sade till reportrar på lanseringsdagen. Så resten av den här artikeln håller tre nivåer tydligt åtskilda: vad OpenAI har bekräftat, vad en mätning från lanseringsdagen gör anspråk på, och vad ingen ännu kan veta.

Vad ett begränsat beslut faktiskt är

Två befintliga metoder gör det här jobbet dåligt, och Decisions API riktar sig mot gapet mellan dem. Den första är att prompta en chattmodell: du skriver en noggrann instruktion som ber den välja från en lista, den skriver en mening till dig, och om du har tur kan du läsa ut token-sannolikheter ur svaret för att få något som liknar en konfidenspoäng. Det fungerar, det förbrukar tokens, och konfidenssiffran är en grov gissning. Den andra är att träna en liten klassificerare: snabb, billig, och den behöver märkta data plus en omträningskörning varje gång etiketuppsättningen ändras.

En beslutsmodell ligger mellan dem. Den accepterar nya etiketter i prompten – på samma sätt som en prompt gör – men returnerar en poäng eller ett val som en utvecklare kan förgrena sig på utan att parsa, vilket är den egenskap en klassificerare hade och en chattmodell aldrig hade. OpenAI är inte obekant med formen: dess Moderation API har i åratal returnerat poäng per kategori i stället för text, med en skillnad som spelar roll här. Moderations kategorier är OpenAIs. Decisions API:s kategorier är dina.

Begränsningen är produkten, och det är värt att vara precis om vad den ger och inte ger. Ett ändligt utfallsrum innebär att varje tillåtet värde är känt i förväg, så din applikation kan avvisa ett svar som den inte har definierat, koppla en annan behörighetsnivå till varje gren och falla tillbaka på en människa när konfidensen eller kontexten är svag. Det gör också offlineutvärdering hanterbar, eftersom varje testfall har en målklass och en mätbar kostnad när det är fel. Vad den inte ger är korrekthet. En begränsad modell kan fortfarande välja fel giltigt svar, styras av vilseledande kontext eller ärva biasen i de kategorier du skrev.

Påståendet om 150 millisekunder, och siffran som OpenAI inte publicerade

OpenAI säger att Decisions API fattar beslut ungefär tio gånger snabbare än GPT-6 Luna gör via det vanliga API:et – i storleksordningen 150 millisekunder mot cirka 1,6 sekunder. Siffran är leverantörsuppgiven och inte reproducerad; det finns ingen oberoende mätning av den under de två dagar som gått sedan lanseringen, och OpenAI:s egen sammanfattning säger bara "beslutsfattande i realtid". Ingen latensfördelning, ingen region, ingen indatastorlek, ingen samtidighetsnivå och inget servicenivåavtal åtföljer siffran.

Vår egen trafikdata är inte en ersättning för det testet, men den förklarar varför den saknade fördelningen spelar roll. Under de sju dagarna fram till den 30 september visar GPT-6 Luna, betjänad via OrcaRouters vanliga chat-completions-rutt, en median på 699 millisekunder och en p95 på 7,6 sekunder över 3,23 miljarder tokens av blandad arbetsbelastning – en spridning på mer än en storleksordning mellan mitten och svansen. Det är en annan förfrågningsprofil än ett begränsat beslut, så det är inte en jämförelse med påståendet om 150 ms. Det är anledningen till att en enda p50-siffra i rubriken är fel tal att dimensionera en tidsgräns efter. Om du testar förhandsversionen, registrera median, p95 och p99 separat för text- och bildindata, inkludera nätverkstid och återförsök, och mät den deadline som din produkt faktiskt har – ett routingbeslut för en asynkron kö och ett som ligger mellan ett klick och en betalning delar inte samma latensbudget.

A single-column scoreboard titled 'GPT-6 Luna and the Decisions API - the scoreboard' with six rows: Decisions API price 'not published', candidate-answer limit 'not published', fine-tuning on your data 'no statement', stated decision latency '~150 ms vendor-reported', GPT-6 Luna input / output '$0.10 / $0.50 per 1M', and AA Intelligence Index at max effort '37.3', with a footer reading 'OpenAI figures vendor-reported; Index per Artificial Analysis; unpublished means blank, not zero.' and the OrcaRouter logo composited in the bottom-right corner.

Prissättning: vad den underliggande modellen kostar, och varför det inte är API:ets pris

OpenAI har inte publicerat någon prisuppgift för Decisions API. Det är inte heller säkert att anta att Luna-tokenpriserna gäller, eftersom Decisions API är en egen paketering – en annan slutpunkt med andra gränser, och OpenAI har sagt att man kommer att dela mer information ”vid bred utrullning”. Den som i dag uppger en kostnad per beslut åt dig drar bara en egen slutsats.

Det som publiceras är prislistan för modellen som den bygger på, hämtad från OpenAIs prissida den 30 september 2026:

• Indata – 0,10 $ per miljon tokens, vilket blir 0,20 $ över 272 000 indatatokens
• Utdata – 0,50 $ per miljon tokens, vilket blir 0,75 $ över 272 000 indatatokens
• Cachad indata – 0,01 $ per miljon tokens; cacheskrivningar debiteras med 0,125 $, en premie på 25 % jämfört med den ocachade taxan
• Batch- och Flex-bearbetning – 50 % av standardtaxorna; Snabbläge – 2x de tillämpliga taxorna

Långkontextgränsen är den som överraskar folk, och den fungerar på samma sätt som i GPT-6-familjen: att överskrida 272 000 indata-tokens prisar om hela begäran enligt den högre nivån, inte bara överskottet. Ett besluts-API som skickar ett långt dokument eller en stor bilduppsättning till modellen är precis den typ av anrop som kan passera den gränsen, vilket är ytterligare en sak som förhandsversionens opublicerade gränser lämnar öppet.

GPT-6 Luna på sina egna villkor

Om man tar bort API:et är modellen under huven en resonemangsmodell i botten av en familj med tre nivåer — under GPT-6 Sol till $2.00/$10.00 och flaggskeppet GPT-6 Astra till $10.00/$50.00 — med ett kontextfönster på 1 050 000 tokens, ett utdatatak på 128 000 tokens, en kunskapsgräns den 18 maj 2026 och en resonemangsansträngning som kan ställas in över sex värden från ingen till max. Den tar text- och bildindata och returnerar text, och i OpenAIs egen utvecklardokumentation är standardinställningen för ansträngning medium. Ett praktiskt förbehåll från samma sida, orelaterat till Decisions API men relevant om du kopplar in Luna som reserv: i Chat Completions fungerar funktionsanrop endast när resonemangsansträngningen är inställd på ingen. Verktyg med någon annan ansträngningsinställning kräver Responses API.

När det gäller kvalitet är det oberoende måttet Artificial Analysis Intelligence Index på 37,3 för Luna vid maximal ansträngning, mot 47,5 för GPT-6 Sol – en skillnad på omkring tio punkter, vilket är det ärliga sättet att tolka prisskillnaden på tjugo gånger för input. Ingen av siffrorna säger något om Decisions API, vars begränsade uppgift är en helt annan mätning och som inte har någon publicerad poäng.

OpenAI's developer documentation page for the gpt-6-luna model, showing the model heading with compare and playground controls, the reasoning, speed and price tiles, the '$0.1 - $0.5' price range, text and image input with text output, a 1,050,000-token context window, a 128,000-token maximum output, a May 18 2026 knowledge cutoff, the note that reasoning.effort supports none, low, medium (default), high, xhigh and max, and the note that Chat Completions supports function calling only with reasoning effort set to none.

Jev, Laya och inramningen av "system one"

Decisions API kom inte till ett tomt fält. TypeSafe AI:s Jev, som lanserades den 15 september 2026 av Diogo Almeida och har varit allmänt tillgänglig sedan den 21 september, är modellen som gjorde den här kategorin begriplig för utvecklare: den genererar ingen text alls, utan returnerar i stället typade svar med konfidensvärden, för 0,042 USD per miljon indatatoken, med utdata som debiteras till noll. Det första oberoende testet av Jev, utfört av Every, genomförde 777 bedömningar över 37 dokument på under 0,7 sekunder för ungefär en fjärdedels cent, och ett andra test uppmätte en median på 0,35 sekunder per passage mot 8,83 sekunder för Claude Fable 5.1 vid hög ansträngning – cirka 25 gånger snabbare till ungefär 1/580 av kostnaden, samtidigt som den fångade sex av sju avsiktligt inplanterade defekter, medan Fable 5 fångade alla sju. ”Bra men inte perfekt” var Everys omdöme, och det är den rätta tolkningen i en rad. Laya är den tredje aktören i samma form, en beslutsmodell som svarar utan att skriva en enda token.

Om OpenAI byggde Decisions API på grund av Jev är spekulation. The New Stack, som rapporterade om det på lanseringsdagen, kallade en reaktion på TypeSafe för ”sannolik” och noterade att OpenAI troligen skyndade på tillkännagivandet före DevDay; OpenAI har inte sagt något sådant, och tidpunkten – att Jev blev allmänt tillgänglig den 21 september, DevDay den 29 september – är talande men inte bevis. Vad som inte är spekulation är att de två ännu inte är jämförbara på den axel som köpare bryr sig om. Jev publicerar ett pris, en anropsform och ett GA-datum. Decisions API publicerar inget av dessa tre.

Var den körs, och vad som ska hållas varmt bredvid den

Decisions API är OpenAI:s egen paketering. Det är inte en modell i vår katalog och vi routar den inte, så om du vill ha just den här slutpunkten är det hos OpenAI den finns. Modellen som den bygger på är en annan sak: GPT-6 Luna är en live-rutt på OrcaRouter till OpenAI:s listpris utan påslag som förs vidare – 0,10 USD för indata och 0,50 USD för utdata per miljon tokens, med >272K-nivån till 0,20/0,75 USD – och under de sju dagarna fram till den 30 september har den hanterat 3,23 miljarder tokens via oss med en felfrekvens på 0,18 %.

Det spelar roll för hur du minskar risken i en förhandsversion. Det förnuftiga sättet att testa en endpoint för begränsade beslut är att hålla den promptbaserade vägen varm som fallback, eftersom en förhandsversion kan ändra gränser eller prissättning utan förvarning och ett beslut som ligger på en kritisk väg behöver någonstans att ta vägen. Att hålla den fallbacken på samma nyckel som dina andra modeller innebär inget andra avtal och ingen kodändring för fallbackvägen: ett API för 200+ modeller, med automatisk failover mellan leverantörer när en krånglar. Och om ditt beslut är ett steg i en längre kedja komponerar routing-DSL:en modeller till ett enda anrop, vilket är precis det orchestrator-plus-decider-mönster som Jev-bevakningen populariserade — en större modell som planerar, en liten modell som väljer varje steg. Det mönstret går att bygga idag av modeller vi tillhandahåller; själva Decisions API skulle ligga utanför det tills OpenAI öppnar upp det.

Vem ska flytta, och vem ska vänta

Om ditt problem är ett klassificerings- eller routingjobb med hög volym där en felaktig gren är billig och reversibel, är förhandsversionen värd en förfrågningsstruktur och en märkt datamängd den här veckan – förmågan är verklig, begränsningen är en genuin förbättring jämfört med att tolka prosa, och en förhandsversion är den billigaste möjliga tidpunkten att lära sig var dess felkostnader hamnar. Om ditt beslut auktoriserar pengar, skickar meddelanden till en kund eller sitter mellan en användare och en betalning, förändrar inget med den här veckan din kalkyl: det finns inget publicerat pris att modellera, ingen publicerad gräns att designa kring, inget SLA och inget ord om huruvida du kan justera saken på dina egna data. De fyra luckorna är vad "bred utrullning" måste fylla, och tills OpenAI namnger dem är den ärliga tolkningen av Decisions API ett lovande gränssnitt med en snabb tidsplan enligt leverantören och ingen räkning bifogad.

OrcaRouter's model page for openai/gpt-6-luna, showing the model name and OpenAI attribution dated 2026-09-22, capability pills for vision, tools, JSON and reasoning, the description of GPT-6 Luna as the fast cost-efficient model below GPT-6 Sol, the /v1/chat/completions route, a $0.10 input and $0.50 output rate per million tokens with a 699 ms p50 time to first token, a 1M-token context with 128K maximum output, and 3234.7M tokens of traffic.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen