GPT-5.4 mini för med sig kärnfunktionerna från GPT-5.4 i en snabbare, mer effektiv modell optimerad för arbetsbelastningar med hög genomströmning. Den stöder text- och bildinmatningar med stark prestanda inom resonemang, kodning,...
GPT‑5.4 Mini är en kompakt språkmodell från OpenAI som balanserar kapacitet med lägre beräkningskostnad. Den stöder ett kontextfönster på 400 000 tokens och en maximal utdata på 128 000 tokens,…
GPT‑5.4 Mini utmärker sig vid komplexa, flerstegs resonemangsuppgifter som kan delas upp i en tankekedja. Prestandamätningar visar starka resultat på GPQA Diamond (87,5) och liknande vetenskapliga resonemangsdataset. Den hanterar matematisk problemlösning, kodgenerering och felsökning samt logiska pussel effektivt. Dess stora kontextfönster gör att den även kan bibehålla sammanhang över långa dokument – idealiskt för att sammanfatta långa rapporter, extrahera viktiga punkter från juridiska avtal eller besvara frågor om en hel forskningsartikel. Modellen presterar också väl i verktygsanvändningsscenarier där den måste avgöra när externa funktioner ska anropas baserat på samtalshistorik. För enklare uppgifter som kortfattad fråga‑svar eller klassificering kan en billigare modell vara mer kostnadseffektiv.
Om ditt användningsfall involverar korta prompts (under 10K tokens), enkel klassificering eller enkel generering som inte kräver djup resonemang, kan en billigare modell som GPT‑4o-mini eller GPT‑3.5‑Turbo (tillgänglig via OrcaRouter) ge tillräcklig kvalitet till en bråkdel av kostnaden. GPT‑5.4 Minis pris på $0.75/$4.50 per 1M tokens är högre än många mindre modeller. Dessutom, om du inte behöver multimodal inmatning (fil eller bild) eller 400K kontextfönstret, tillför dessa funktioner inget värde. Utvärdera den genomsnittliga tokenförbrukningen per begäran och den nödvändiga utdatalängden. För högvolymproduktionssystem kan även små besparingar per token avsevärt minska månadskostnaden. OrcaRouter låter dig enkelt byta modeller genom att ändra modell-ID i API-anropet.
Ja, GPT‑5.4 Mini stöder funktionsanropsgränssnittet som är kompatibelt med OpenAIs API. När du använder OrcaRouters OpenAI‑kompatibla slutpunkt kan du definiera funktioner (verktyg) i begäran och låta modellen bestämma om den ska anropa dem. Det stora kontextfönstret är särskilt användbart för agenter som behöver hålla en historik över funktionsanrop och deras resultat. Denna förmåga möjliggör att bygga komplexa AI-arbetsflöden: naturliga språkfrågor utlöser funktionsanrop till databaser, miniräknare eller API:er, och modellen bearbetar de returnerade data för att generera slutliga svar. För bästa resultat, ange tydliga funktionsbeskrivningar och exempel. Observera att modellen ibland kan returnera ogiltiga funktionsargument; implementera valideringslager i produktion.
GPT‑5.4 Mini stöder JSON‑läge när du ställer in parametern `response_format` till `{"type": "json_object"}` i API‑begäran. Detta instruerar modellen att producera giltig JSON. I kombination med systemprompten kan du tvinga fram ett specifikt schema. Gränsen på 128K‑token för utdata möjliggör generering av mycket långa strukturerade dokument, såsom fullständiga SQL‑scheman eller kapslade konfigurationsfiler. Modellen garanterar dock inte strukturell korrekthet utöver JSON‑giltighet—du kan behöva efterbearbeta eller validera mot ett schema. För produktion, använd verktygsanropsmetoden (tool calling) för att tvinga fram mer tillförlitliga strukturerade utdata. OrcaRouter‑API:n skickar parametern `response_format` exakt som den anges till OpenAI, utan modifiering.
GPQA Diamond är ett flervalsriktmärke som testar vetenskapligt resonemang på forskarnivå inom fysik, kemi, biologi och andra områden. En poäng på 87,5 innebär att GPT‑5.4 Mini korrekt besvarade 87,5 % av frågorna, vilket placerar modellen på en hög resonemangsförmåga i förhållande till sin modellstorlek. Denna poäng är ett av de mest framträdande riktmärken som rapporterats av OpenAI. Det indikerar att modellen kan hantera komplexa vetenskapliga frågor som kräver djup förståelse och steg‑för‑steg‑resonemang. Riktmärken fångar dock inte alla verkliga scenarier; utvärdera modellen på dina egna representativa uppgifter. Jämfört med större modeller som GPT‑5.4 Full (som vanligtvis presterar högre) erbjuder Mini‑varianten en balans mellan prestanda och kostnad.
Svarstiden beror främst på modellens underliggande infrastruktur (OpenAI) samt längden på indata och utdata. Eftersom OrcaRouter inte tillför någon extra bearbetning utöver att dirigera förfrågan till OpenAI, är svarstiden jämförbar med att anropa OpenAI direkt. För en prompt med 10 000 indatatokens och 500 tokener i utdata är svarstiden normalt under fem sekunder. För längre utdata (upp till 128 000 tokener) kan svarstiden sträcka sig över flera minuter. OrcaRouter stöder strömning via server‑sända händelser, vilket minskar den upplevda fördröjningen genom att leverera tokener allt eftersom de genereras. Använd stream‑parametern för att aktivera realtidsutdata. Observera att multimodala indata (bilder/filer) kan tillföra extra bearbetningstid.
Trots starka resonemangsriktmärken kan GPT‑5.4 Mini fortfarande producera faktiska fel eller hallucinera information, särskilt inom nischade eller snabbt föränderliga ämnen. Kunskapsgränsen är inte specificerad; anta att den återspeglar OpenAI:s senaste träningsdata. Modellen kan också ha svårigheter med uppgifter som kräver exakt aritmetik eller precis återkallelse av obskyra fakta. Dessutom kan utskriftsgränsen på 128K‑token, även om den är generös, vara otillräcklig för att generera mycket långa böcker eller hela kodbaser i ett pass. För sådana uppgifter, överväg att dela upp utskriften eller använda en modell med sekventiell generering. Modellens prestanda på andra språk än engelska kan vara mindre robust. Testa alltid med olika indata från din måldomän.
Större modeller i GPT‑5.4‑familjen, såsom GPT‑5.4 Full, uppnår vanligtvis högre poäng på resonemangsriktmärken (t.ex. GPQA Diamond >90) och har större kontextfönster (t.ex. 1M tokens). De är dock dyrare per token och har högre latens. GPT‑5.4 Mini offrar en del råprestanda för lägre kostnad och snabbare inferens. För uppgifter som inte kräver högsta noggrannhet ger Mini‑varianten ofta en fördelaktig avvägning mellan kostnad och prestanda. Om din applikation kräver maximal noggrannhet för svåra resonemangsuppgifter, välj Full‑modellen. OrcaRouter erbjuder båda alternativen med enkla modell‑ID‑byten. Benchmark‑poäng är bara en faktor; utvärdera på ditt eget dataset.
OrcaRouter fakturerar till exakt leverantörspris utan påslag. För GPT‑5.4 Mini är priset $0,75 per 1 miljon inmatningstoken och $4,50 per 1 miljon utmatningstoken. Inmatningstoken inkluderar systemprompten, användarmeddelanden och eventuella multimodala token (fil eller bild). Utmatningstoken räknar endast den genererade texten. Det tillkommer inga extra avgifter för strömmande eller icke‑strömmande samtal. Cachelagrade inmatningstoken rabatteras inte eftersom OrcaRouter vidarebefordrar leverantörens prissättning utan ändringar. För att uppskatta kostnaden multiplicerar du dina genomsnittliga tokenantal per begäran med dessa priser. För högvolymanvändning överväg att använda en modell med lägre pris per token för enkla uppgifter.
Medan GPT‑5.4 Mini är billigare än den fullständiga GPT‑5.4‑modellen, är den fortfarande dyrare än många mindre modeller som GPT‑4o-mini eller GPT‑3.5‑Turbo. Använd den endast när det större kontextfönstret, multimodala stödet eller högre resonemangsförmågan är avgörande. Till exempel kan en kundsupportschattbot med korta förfrågningar överutnyttja resurser genom att använda denna modell. Batchbehandling av långa dokument kan snabbt driva upp tokenkostnaderna. Beräkna totalt antal tokens per dokument och multiplicera med priserna för att se om ett billigare alternativ med liknande kapacitet finns. OrcaRouter gör att du kan dirigera förfrågningar till flera modeller baserat på promptlängd eller ämne, vilket automatiskt optimerar kostnaden.
Nej. OrcaRouter modifierar eller cachar inte modellsvar. Varje begäran vidarebefordras till OpenAI i realtid, och du debiteras exakt leverantörens pris per token. Det finns inga volymrabatter eller förbetalda planer; prissättningen är betalning efter användning baserat på tokenförbrukning. Denna transparens innebär att dina kostnader direkt återspeglar din OpenAI-användning. Om OpenAI inför cachning eller prissättning i nivåer i framtiden kommer OrcaRouter att föra vidare dessa förändringar utan påslag. För förutsägbar högvolymsanvändning, överväg ett direkt företagsavtal med OpenAI, men för flexibel åtkomst med minimal administration är OrcaRouter ett enkelt alternativ.
För att använda GPT‑5.4 Mini, ställ in bas-URL:en för den OpenAI-kompatibla klienten till https://api.orcarouter.ai/v1 och modell-ID:t till "openai/gpt-5.4-mini". Ange din OrcaRouter API-nyckel som autentiseringstoken. Alla standardparametrar för OpenAI-chattkomplettering stöds: `messages`, `temperature`, `top_p`, `max_tokens`, `stream`, `response_format`, `tools`, etc. Exempel (Python): ```python from openai import OpenAI client = OpenAI(api_key="your-orcarouter-key", base_url="https://api.orcarouter.ai/v1") response = client.chat.completions.create( model="openai/gpt-5.4-mini", messages=[{"role": "user", "content": "Explain quantum entanglement"}], max_tokens=1000 ) ``` Svaret innehåller kompletteringarna, användningsstatistik och modellidentifierare.
OrcaRouters API är utformat för att vara fullt OpenAI‑kompatibelt. Det finns inga OrcaRouter‑specifika parametrar; alla parametrar skickas direkt till den underliggande leverantören (OpenAI). OrcaRouter lägger dock till en liten latensfördröjning för routning och autentisering, vanligtvis under 50 millisekunder. Du kan skicka standardparametrar som `user`, `stop`, `frequency_penalty`, `presence_penalty` och `logit_bias`. API:t returnerar modellfältet som "openai/gpt-5.4-mini" oavsett leverantör. Om du behöver spåra användning per begäran, använd parametern `user` eller tolka de returnerade användningsmåtten. För avancerad routning (t.ex. reservmodeller), kontakta OrcaRouters support.
Ja. Migrationen kräver endast två ändringar i din kod: ersätt OpenAI:s bas-URL med https://api.orcarouter.ai/v1 och använd din OrcaRouter API-nyckel. Modell-ID:t måste föregås av leverantörens prefix (t.ex. "openai/gpt-5.4-mini" istället för "gpt-5.4-mini"). Alla andra parametrar förblir oförändrade. Detta gör att du kan använda OrcaRouter som en enhetlig gateway för flera leverantörer utan att ändra din befintliga OpenAI-integration. Testa på en delmängd av trafiken innan du byter helt. OrcaRouter tillhandahåller användningsloggar och faktureringsinformation som du kan jämföra med din tidigare direkta användning för att verifiera kostnadstransparens.
GPT‑5.4 Mini är en nyare modell från OpenAI med ett större kontextfönster (400K jämfört med 128K för GPT‑4o) och högre maxutdata (128K jämfört med typiska 4K‑16K). Den stöder även bild- och filinmatning, medan GPT‑4o främst hanterar text och bilder. Prissättningen för GPT‑4o är vanligtvis lägre (2,50 USD / 10 USD per 1M tokens för standardversionen) men beror på varianten. På resonemangsbaserade prestandatester som GPQA Diamond överträffar GPT‑5.4 Mini (87,5) GPT‑4o:s rapporterade poäng (omkring 70‑80). GPT‑4o har dock testats brett och kan ha bättre stöd för vissa verktyg. Välj GPT‑5.4 Mini när långt kontext och hög resonemangsförmåga prioriteras; använd GPT‑4o för kortare uppgifter där kostnaden är avgörande.
GPT‑5.4 Full erbjuder en större kontextwindow (1M tokens) och högre absoluta resonemangspoäng (GPQA Diamond >90), men till betydligt högre prissättning per token. Mini‑varianten offrar en del benchmarkprestanda för kostnadseffektivitet. För många praktiska tillämpningar är skillnaden i utdatakvalitet marginell, särskilt på uppgifter som inte tänjer på resonemangets gränser. Om din användning kräver bearbetning av extremt långa dokument (över 400K tokens) eller maximering av noggrannhet på svåra graduate‑nivåfrågor, är GPT‑5.4 Full motiverad. Annars ger GPT‑5.4 Mini ofta liknande resultat till ungefär halva kostnaden. OrcaRouter låter dig enkelt växla mellan de två genom att ändra model‑ID i din API‑förfrågan.
Claude 3.5 Sonnet (av Anthropic) erbjuder ett kontextfönster på 200K, vilket är lägre än GPT‑5.4 Minis 400K. Priset för Claude 3.5 Sonnet är $3,00 per 1M indata och $15,00 per 1M utdata (Anthropics priser), vilket gör den dyrare per token. Benchmark-poäng på liknande resonemangstester är jämförbara, även om direkta jämförelser på GPQA Diamond inte är offentligt tillgängliga. Claude 3.5 Sonnet är känt för stark instruktionsföljning och säkerhetsskyddsräcken. GPT‑5.4 Mini kan föredras för uppgifter som kräver mycket lång kontext eller högre utdatatokensgränser. Utvärdera båda på dina specifika promptar, eftersom subjektiva kvalitetsskillnader kan påverka användarnas tillfredsställelse. OrcaRouter ger tillgång till båda modellerna för enkel A/B-testning.
Öppen källkodsmodeller som Llama 3.1 70B eller Mixtral 8x22B kan köras på egen hårdvara för förutsägbara kostnader, särskilt vid hög volym. De har dock ofta mindre kontextfönster (128K eller mindre) och kan kräva betydande infrastruktur för att uppnå låg svarstid. GPT‑5.4 Mini erbjuder ett kontextfönster på 400K, multimodal indata och expertanpassad resonemangsförmåga utan infrastrukturell överbyggnad. Om du värderar användarvänlighet, tokenbaserad prissättning och möjligheten att skala omedelbart är GPT‑5.4 Mini via OrcaRouter mer praktiskt. Om du behöver fullständig kontroll över dataresidens och har låga svarstidskrav, och din uppgift passar inom ett mindre kontext, kan ett alternativ med öppen källkod vara billigare i längden. Testa båda i din miljö.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-5.4-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningresponse_formatseedstreamstructured_outputstool_choicetools| Inmatning / 1M token | $0.750 |
| Utdata / 1M tokens | $4.50 |
| Cacheläsning / 1M | $0.075 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/openai/gpt-5.4-miniÖppna @misc{orcarouter_gpt_5_4_mini,
title = {GPT-5.4 Mini API},
author = {OpenAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-5.4-mini}
}OpenAI. (2026). GPT-5.4 Mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-5.4-mini