OpenAI GPT-5.4-2026-03-05: 1.05M kontext, 128K utdata, 92.0 GPQA Diamond. Text, bild, filinmatning.
Detta är en stor språkmodell från OpenAI med ett kontextfönster på 1 050 000 tokens och en maximal utdata på 128 000 tokens. Den accepterar text-, bild- och filinmatningar, vilket gör att användare…
Med sitt 1,05M kontext och multimodala stöd utmärker den sig i uppgifter som att analysera långa finansiella rapporter med inbäddade diagram, sammanfatta hela juridiska upptäcktsdokument, granska stora kodbaser för buggar eller mönster och bedriva akademisk forskning över långa artiklar. Den kan kombinera flera bilder (t.ex. bilder från en presentation) med textuell kontext och producera en enhetlig sammanfattning. Den maximala utdatan på 128K gör den också lämplig för att generera omfattande rapporter, kompletta programvaruprojekt eller utökad narrativt innehåll som skulle trunkeras av modeller med mindre utdatabegränsningar. Användningsfall som kräver hög resonemangsförmåga, såsom flerstegsmatematik eller logiska problem, drar också nytta av benchmark-poängen.
Om din uppgift innefattar korta in- och utdata (t.ex. chatbot-konversationer under 4K tokens, enkel klassificering eller korta översättningar) kan en mindre modell som OpenAI:s GPT-4o mini eller GPT-4o vara mer kostnadseffektiv och snabbare. Om uppgiften inte kräver den resoneringsdjup som mäts med GPQA Diamond kan en billigare modell uppnå acceptabla resultat till lägre kostnad. Eftersom prissättningen för denna modell på OrcaRouter inte är offentligt tillgänglig är det troligt att kostnaden per token är högre än för mindre modeller. Utvärdera om den utökade kontexten och utdatastorleken är nödvändig; om inte, kommer en lättare modell att minska både monetär kostnad och latens.
Modellen hanterar ursprungligen text-, bild- och filinmatningar inom samma kontextfönster. Det innebär att du kan skicka en förfrågan som innehåller en textuppmaning, några bilder (t.ex. fotografier, diagram) och bifogade filer (t.ex. PDF-filer, kalkylblad) som en del av meddelandematrisen. Modellen kommer att resonera över alla modaliteter. Du kan till exempel be den jämföra ett diagram i en bild med data i en CSV-fil och producera en textanalys. Observera att bild- och filbearbetning förbrukar tokens från kontextfönstret; en stor bild kan använda tusentals tokens, så planera dina förfrågningar därefter för att hålla dig inom 1,050,000 tokens.
Filindata-modaliteten täcker vanliga dokumentformat som PDF, Word, Excel, PowerPoint, textfiler och eventuellt bildformat utöver typiska webbbilder. Även om de exakta fil-MIME-typerna inte anges i de tillhandahållna fakta, stöder OrcaRouter sannolikt samma utbud som OpenAIs filendpunkter. För bästa resultat, använd textbaserade filer (PDF, TXT, kod) eftersom bilder hanteras separat via bildmodaliteten. Modellen kan extrahera text från filer och införliva den i sitt resonemang. Om du behöver analysera en bild som är inbäddad i en fil (t.ex. en PDF med bilder) är det bättre att extrahera bilden separat och skicka den via bildinmatningen.
GPQA Diamond är ett riktmärke som består av flervalsfrågor på forskarnivå inom biologi, fysik och kemi. En poäng på 92,0 indikerar att modellen svarade rätt på 92 % av dessa frågor. Detta är ett starkt resultat, vilket tyder på att modellen besitter djupgående resonemang och domänspecifik kunskap. Riktmärkespoäng garanterar dock inte perfekt prestanda i alla verkliga scenarier. Modellen kan fortfarande producera fel i nyanserade uppgifter eller ämnen utanför dess träningsdistribution. Denna poäng är en jämförande metrik: den visar att denna modell överträffar många tidigare modeller på detta specifika test, men för domänspecifika högriskapplikationer bör du alltid validera utdata.
Styrkor inkluderar förmågan att bearbeta mycket långa sammanhang, hantera flera modaliteter och producera långa utdata. Det höga GPQA Diamond-resultatet indikerar stark resonemangsförmåga. Begränsningar: som med alla LLM:er kan den generera troligen klingande men felaktig information (hallucination). Det stora kontextfönstret innebär att om en användare tillhandahåller motstridig eller irrelevant information inom sammanhanget kan modellen ha svårt att fokusera på viktiga delar. Även eftersom modellen är stor kan inferensfördröjningen vara högre än för mindre modeller. Modellens maximala utdata på 128 000 tokens är generös men fortfarande ändlig; extremt långa genereringar kan fortfarande trunkeras om utdata överstiger den gränsen. Inga fördröjnings- eller hastighetssiffror är offentligt tillhandahållna.
Det enda specifika riktmärket som tillhandahålls är GPQA Diamond på 92,0. Som jämförelse presterade tidigare OpenAI-modeller som GPT-4 (augusti 2023) runt 38,0 på GPQA (den högre ribban Diamond). GPT-4o (maj 2024) uppnådde ungefär 75–80 på GPQA Diamond (allmänt känt). Därför visar denna modell förbättring. För andra riktmärken som MMLU, HumanEval etc. tillhandahålls inga data; användare bör anta typiskt stark prestanda som förväntas av en flaggskeppsmodell från OpenAI. Den viktigaste differentieringsfaktorn är kontext- och utdatastorleken: GPT-4o har 128K kontext och 16K utdata, medan denna modell har 1,05M kontext och 128K utdata. Så för mycket långa dokument är denna modell det bättre valet.
Inga multimodala riktmärken (t.ex. för bildtextning eller visuell frågebesvarande) ingår i de angivna fakta. Men med tanke på att modellen stöder bild- och filinmatning är det rimligt att anta att den presterar bra på standarduppgifter inom visuellt språk, sannolikt jämförbar med eller bättre än GPT-4o:s vision-förmågor. Användare som är intresserade av specifik multimodal noggrannhet bör testa modellen på sina egna datamängder. GPQA Diamond-poängen (endast text) ger en baslinje för resonemang, men täcker inte visuellt resonemang. För uppgifter som kräver att läsa text från bilder använder modellen internt optisk teckenigenkänning, men inga separata OCR-noggrannhetssiffror anges.
Prissättningen för openai/gpt-5.4-2026-03-05 på OrcaRouter är inte offentligt tillgänglig i den tillgängliga faktan. Vanligtvis har modeller med mycket stora kontextfönster och höga utmatningsgränser ett högre pris per token på grund av de beräkningsresurser som krävs. För aktuell prissättning bör du hänvisa till OrcaRouter-instrumentpanelen eller kontakta deras support. När du budgeterar, tänk på att den höga maximala utmatningen (128K tokens) kan leda till större räkningar per begäran. Vissa plattformar erbjuder cacheringsrabatter för upprepade uppmaningar; kontrollera OrcaRouters dokumentation för detaljer. För kostnadskänsliga arbetsbelastningar, utvärdera om mindre modeller kan uppnå acceptabla resultat för en del av pipelinen.
OrcaRouter kan erbjuda cachelagringsmekanismer där uppmaningar som upprepas över flera förfrågningar lagras tillfälligt för att minska kostnaderna. Detta är vanligt hos många API-leverantörer. För en modell med 1,05M kontext kan cachelagring vara särskilt fördelaktigt om du ofta använder samma systemuppmaning eller ett stort statiskt dokument. De specifika cachelagringsprinciperna för denna modell är dock inte detaljerade i den tillhandahållna informationen. Du kan troligen aktivera cachelagring genom att ställa in lämpliga rubriker eller använda OrcaRouters inbyggda funktioner. Utan cachelagring bearbetar varje förfrågan hela kontexten, så kostnaderna skalas linjärt med indatalängden. För att optimera, bearbeta indata för att ta bort irrelevant innehåll innan du skickar dem.
Inga prissiffror anges för någon modell i fakta. Som en allmän notering tenderar modeller med större kontextfönster och nyare releasedatum att vara prissatta högre än tidigare modeller. GPT-4o, som har 128K kontext och 16K utdata, skulle sannolikt vara billigare än denna modell. För frekventa korta förfrågningar kan den lägre kostnaden för GPT-4o vara mer ekonomisk. För uppgifter med långa dokument kan kontextfönstret för GPT-4o vara otillräckligt, vilket tvingar till chunking och flera anrop; i så fall kan den högre kostnaden per token för denna modell faktiskt vara lägre totalt eftersom den undviker extra bearbetning. Användare bör göra egna kostnadsberäkningar baserat på faktiska användningsmönster.
Ställ in bas-URL:en till https://api.orcarouter.ai/v1 och använd modell-ID:t "openai/gpt-5.4-2026-03-05" i begärandekroppen. API:et är fullt kompatibelt med OpenAI Python-klienten, curl eller vilken HTTP-klient som helst som stöder chat completions-slutpunkten. Exempel med openai-biblioteket i Python: ```python import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_KEY") response = client.chat.completions.create( model="openai/gpt-5.4-2026-03-05", messages=[{"role":"user","content":"Explain quantum computing"}], max_tokens=2048 ) ``` Alla standardparametrar stöds. Kom ihåg att ersätta YOUR_KEY med en OrcaRouter API-nyckel.
De minsta obligatoriska parametrarna är "model" (sträng, måste vara "openai/gpt-5.4-2026-03-05") och "messages" (array med meddelandeobjekt). Varje meddelandeobjekt kräver en "role" (system, user eller assistant) och "content". För multimodal inmatning kan innehållet vara en array av innehållsdelar (text, image_url eller file). Modellen stöder också en parameter "max_tokens" (heltal upp till 128 000). Om den utelämnas kan modellen generera tills stoppvillkoret uppnås. Andra valfria parametrar inkluderar temperature, top_p, frequency_penalty, presence_penalty, stop och stream. Allt följer OpenAI Chat Completions-specifikationen.
Migration innebär att ändra bas-URL:en och eventuellt uppdatera API-nyckeln. Om din kod för närvarande använder OpenAI Python-klienten med standard bas-URL (api.openai.com), behöver du bara instansiera klienten med base_url="https://api.orcarouter.ai/v1" och din OrcaRouter API-nyckel. Modell-ID:t ändras från OpenAI-modellnamnet (t.ex. "gpt-5.4-2026-03-05") till "openai/gpt-5.4-2026-03-05" (notera leverantörsprefixet). Alla andra parametrar förblir desamma. Testa med en enkel begäran först. Denna modell kan ha något annorlunda beteende än samma modell när den används direkt via OpenAI, men den bör vara funktionellt identisk för de flesta användningsfall.
GPT-4o (specifikt versionen gpt-4o-2024-08-06) har ett kontextfönster på 128 000 tokens och en maximal utdatalängd på 16 384 tokens. Däremot erbjuder openai/gpt-5.4-2026-03-05 ett kontextfönster på 1 050 000 tokens (ungefär 8,2 gånger större) och en maximal utdatalängd på 128 000 tokens (ungefär 7,8 gånger större). Detta gör den nyare modellen mycket bättre lämpad för uppgifter som omfattar hela böcker, massiva kodbaser eller långa samtalshistoriker, samt för att generera långa utdata som fullständiga rapporter. Däremot kan GPT-4o ha snabbare inferens och lägre kostnad. Benchmarkmässigt är GPT-4o:s GPQA Diamond-poäng lägre (cirka 80) jämfört med 92,0, vilket indikerar bättre resonemang på forskarnivåfrågor. För uppgifter som ryms inom GPT-4o:s kontext förblir den ett starkt alternativ.
GPT-4 Turbo (gpt-4-turbo-2024-04-09) har ett kontextfönster på 128 000 tokens och maxutdata på 4 096 tokens. Dess GPQA Diamond-poäng är betydligt lägre (runt 38). Därför överträffar 5.4-modellen den både vad gäller kontext, utdata och resonemang. Eftersom GPT-4 Turbo är äldre kan den fortfarande användas för kortare uppgifter till lägre kostnad, men för alla arbetsbelastningar som kräver lång kontext eller avancerat resonemang är denna modell överlägsen. Den nyare modellen har också inbyggt stöd för bild- och filinmatning, medan GPT-4 Turbos bildfunktioner introducerades senare och inte är lika integrerade.
OrcaRouter erbjuder troligen även andra OpenAI-modeller (t.ex. openai/gpt-4o, openai/gpt-4-turbo) samt modeller från andra leverantörer. Om du behöver ett kontextfönster större än 128K tokens men mindre än 1,05M, kan du överväga modeller som Anthropics Claude 3.5 Sonnet (200K kontext) eller Googles Gemini 1.5 Pro (1M kontext). Valet beror på dina specifika krav gällande resonemang, multimodalt stöd och utdatalängd. Denna modell utmärker sig genom sin kombination av ett mycket stort kontextfönster och hög resonemangspoäng. För bästa resultat, testa ditt specifika användningsfall med en exempelförfrågan via OrcaRouters API för att jämföra utdatakvalitet mellan modeller.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-5.4-2026-03-05",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningresponse_formatseedstreamstructured_outputstool_choicetools| Nivå | Inmatning / 1M token | Utdata / 1M tokens | Cacheläsning / 1M |
|---|---|---|---|
| ≤ 272K | $2.50 | $15.00 | $0.250 |
| ≤ ∞ | $5.00 | $22.50 | $0.500 |
| Nivå väljs utifrån antalet inmatningstoken per förfrågan | |||
Uppskattning baserad på listpris
Skiktad prissättning — den här uppskattningen använder priser för basnivån.
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/openai/gpt-5.4-2026-03-05Öppna @misc{orcarouter_gpt_5_4_2026_03_05,
title = {openai/gpt-5.4-2026-03-05 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-5.4-2026-03-05}
}openai. (n.d.). openai/gpt-5.4-2026-03-05 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-5.4-2026-03-05