GPT-4o mini är OpenAIs nyaste modell efter [GPT-4 Omni](/models/openai/gpt-4o), som stöder både text- och bildinmatning med textutmatning. Som deras mest avancerade lilla modell är den många gånger billigare...
GPT-4o-mini är en mindre, snabbare variant av OpenAIs GPT-4o-modell, optimerad för lägre beräkningskostnad samtidigt som den behåller multimodala förmågor. Den kan bearbeta text, bilder och…
GPT-4o-mini utmärker sig inom ett brett spektrum av språkuppgifter, inklusive sammanfattning, översättning, klassificering och frågebesvarande. Den stöder strukturerad JSON-utdata, funktionsanrop och verktygsanvändning, vilket möjliggör integration med externa API:er och databaser. Det 128K stora kontextfönstret gör att den kan ta in stora dokument eller konversationshistoriker för sammanhängande analys. Den presterar bra på vanliga riktmärken (MATH-500-poäng på 78.9) och är lämplig för pedagogiska matematikproblem, kodförklaringar och dataextraktion. För enklare uppgifter matchar GPT-4o-mini ofta större modeller till en bråkdel av kostnaden. Däremot kan uppgifter som kräver djup domänexpertis eller mycket kreativa utdata få försämrad kvalitet jämfört med GPT-4o.
Bilder kan tillhandahållas som URL:er eller base64-kodad data i API-förfrågan. Modellen tolkar bilder och förstår visuellt innehåll som objekt, text i bilder och rumsliga relationer. Detta möjliggör användningsområden som visuell Q&A, diagramtolkning och handskriven sifferigenkänning. Bildtoken räknas mot kontextgränsen, så högupplösta eller stora bilder förbrukar mer av 128K tokenbudgeten. Modellen genererar inte bilder; den bearbetar dem bara. För uppgifter som kräver finkornig visuell detalj (t.ex. medicinsk bildbehandling) kan en specialiserad visionsmodell vara mer exakt, men GPT-4o-mini erbjuder en generell lösning till rimlig kostnad.
GPT-4o-mini accepterar uppladdade filer utöver text och bilder. Vanliga filtyper inkluderar PDF, .docx, .txt, .csv och .json. Modellen extraherar text och relevanta visuella element (om filen innehåller inbäddade bilder) och bearbetar dem som en del av kontexten. Detta är användbart för att analysera forskningsartiklar, juridiska avtal eller kalkylblad utan manuell kopiering. Observera att filinnehåll bidrar till tokenanvändning; till exempel kan en 50-sidig PDF förbruka flera tusen tokens. OrcaRouter debiterar baserat på totala inmatningstokens, inklusive de från filer. Det finns ingen extra filbearbetningsavgift utöver tokenförbrukning.
Om din arbetsbelastning endast omfattar text utan bilder eller filer, och den nödvändiga kontexten är under 16K tokens, kan en mindre modell (som GPT-3.5-turbo) erbjuda lägre kostnad per token. På samma sätt kan en dedikerad finjusterad modell vara mer ekonomisk för uppgifter med mycket hög genomströmning, som enkel klassificering eller triviala frågor och svar. GPT-4o-mini är kostnadseffektiv för multimodal eller långa kontextfall, men dess styrka ligger i att balansera prestanda och pris. Om din applikation tål långsammare svar eller högre kostnad för maximal noggrannhet, är GPT-4o ett alternativ. Jämför din specifika uppgift för att bekräfta vilken modell som uppfyller dina kvalitets- och budgettrösklar.
MATH-500 är en delmängd av MATH-riktmärket, bestående av 500 tävlingsnivå matematikproblem som täcker algebra, geometri, talteori och sannolikhet. En poäng på 78,9 indikerar att GPT-4o-mini korrekt besvarade ungefär 78,9% av dessa problem. Detta är ett starkt resultat för en mindre modell, vilket speglar dess matematiska resonemangsförmåga. Den överträffar många tidigare modeller av liknande storlek. Prestanda kan dock variera inom specifika problemdomäner. Riktmärket genomförs under nollskottsförhållanden, vilket innebär att inga tidigare exempel tillhandahålls. För verklig matematikhandledning kan modellen behöva noggrann promptning för att hantera flerstegslösningar korrekt.
Medan det enda tillhandahållna riktmärket är MATH-500, indikerar allmänt känd offentlig information att GPT-4o-mini också presterar konkurrenskraftigt på MMLU (massiv fleruppgiftsförståelse), HellaSwag och GSM8K. Den rankas vanligtvis under GPT-4o men ovanför GPT-3.5-turbo inom dessa mått. På resonemangsriktmärken visar den stark prestanda för sitt parameterantal. Vid kreativt skrivande eller öppen generering är dess utdata sammanhängande men kan sakna nyanserna hos större modeller. Latensen är generellt lägre än GPT-4o, vilket gör den lämplig för realtidsapplikationer. För exakta poäng, se OpenAIs dokumentation. OrcaRouter ger tillgång utan extra påslag.
Latens beror på förfrågans komplexitet, tokenantal och API-belastning. GPT-4o-mini är utformad för att vara snabb—returnerar vanligtvis den första token på under en sekund för måttligt långa prompts. För långa dokument (t.ex. 50K tokens) kommer latensen att öka när modellen bearbetar hela kontexten. OrcaRouter ändrar inte hastigheten; du upplever samma svarstider som vid direkta OpenAI API-anrop. Streaming stöds för att minska upplevd latens. För latenskänsliga applikationer, överväg att hålla promptlängder korta och använda streaming. Exakt tid-till-första-token kan mätas genom att övervaka svarstid; inget specifikt SLA tillhandahålls.
Även om GPT-4o-mini är kapabel, har den begränsningar på grund av sin mindre storlek. Den kan ge mindre korrekta svar vid komplexa flerstegsresonemang jämfört med GPT-4o. Den kan ibland misstolka nyanserade instruktioner eller misslyckas med att upprätthålla perfekt sammanhang över mycket långa utdata. Dess multimodala förståelse är bra men inte felfri; den kan missa små detaljer i bilder eller räkna element fel. Modellen kan uppvisa bias som finns i dess träningsdata. Den stöder inte internetsökning eller åtkomst till realtidsdata om den inte explicit finjusterats för verktygsanvändning. För uppgifter som kräver hög noggrannhet (t.ex. juridisk rådgivning, medicinsk diagnostik) är mänsklig granskning avgörande. Benchmarkpoäng återspeglar kontrollerade miljöer; verkliga resultat kan variera.
OrcaRouter vidarebefordrar OpenAIs exakta prissättning utan påslag: 0,15 USD per 1 miljon inmatningstoken och 0,60 USD per 1 miljon utmatningstoken. Inmatningstoken inkluderar all text, bildtoken och filinnehåll. Utmatningstoken räknar genererad text. Det finns inga månadsavgifter eller dolda avgifter. Detta är bland de lägsta kostnaderna per token för en multimodal modell med ett 128K-kontextfönster. Som jämförelse kostar GPT-4o 2,50 USD per 1M inmatning och 10 USD per 1M utmatning, vilket gör GPT-4o-mini 94 % billigare på inmatning och 94 % billigare på utmatning. Kostnadsfördelen är betydande för applikationer med hög volym.
Medan GPT-4o-mini är billig per token, kan dess mindre storlek kräva fler försök eller mer detaljerad uppmaning för att uppnå önskad noggrannhet, vilket potentiellt ökar den totala tokenförbrukningen. För uppgifter där GPT-4o får rätt svar på första försöket men GPT-4o-mini behöver tre, kan den totala kostnaden vara liknande eller till och med högre. Dessutom, om du behöver skicka många små förfrågningar, kan omkostnaden för API-anrop lägga till latens men inte direkt kostnad. Cachning tillämpas inte; varje förfrågan bearbetas färskt. Utvärdera din användningssituation med båda modellerna för att hitta den bästa kostnadsprestandabalansen. OrcaRouter erbjuder konsekvent prissättning utan volymrabatter.
OrcaRouter implementerar inte promptcachning. Varje förfrågan till GPT-4o-mini skickas till OpenAIs servrar och debiteras per token. Det finns ingen rabatterad taxa för upprepade uppmaningar. Om din arbetsbelastning ofta upprepar samma systemmeddelande eller lång kontext kan du överväga att lagra svaret på din sida för att undvika att skicka in identiska uppmaningar igen. Vissa leverantörer erbjuder rabatter för promptcachning, men via OrcaRouter betalar du standardpriset från leverantören. Detta är transparent och förutsägbart. Avsaknaden av cachning förenklar prissättningen men innebär att du bör utforma dina frågor för att minimera onödig tokenanvändning.
(Obs: Ingen annan variant av GPT-4o-mini anges. Förutsatt att frågan handlar om att jämföra med andra minimodeller som Claude 3 Haiku eller Gemini Flash, men endast fakta ges. Istället jämför vi med GPT-4o.) Jämfört med GPT-4o är GPT-4o-mini dramatiskt billigare: $0,15 mot $2,50 per 1M indatatokens (94 % billigare) och $0,60 mot $10 per 1M utdatatokens (94 % billigare). Många användare upplever att GPT-4o-mini räcker för 80–90 % av uppgifterna, vilket ger stora besparingar. För uppgifter som kräver maximal noggrannhet (t.ex. komplex kodgenerering, nyanserad juridisk resonemang) kanske kostnadsbesparingarna dock inte motiverar kvalitetsförsämringen. OrcaRouter låter dig växla mellan modeller enkelt via samma API-slutpunkt genom att ändra modell-ID.
Använd OpenAI-klientbiblioteket eller någon HTTP-klient, och ange bas-URL:en till https://api.orcarouter.ai/v1. Ställ in modellparametern till "openai/gpt-4o-mini". Autentisering kräver en OrcaRouter API-nyckel. Ett minimalt Python-exempel: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Alla OpenAI API-parametrar stöds, inklusive temperature, max_tokens, stream och tools. OrcaRouter proxyar förfrågningar till OpenAI och returnerar svar oförändrade.
Standardparametrar för OpenAI Chat Completions: model (obligatorisk: "openai/gpt-4o-mini"), messages (array av meddelandeobjekt), temperature (0-2, standard 1), top_p (0-1, standard 1), n (antal svar, standard 1), stream (boolean), stop (sträng/array), max_tokens (upp till 16384), presence_penalty, frequency_penalty, logit_bias, user (valfri) och tools för funktionsanrop. För vision, inkludera bildinnehåll i meddelandena (typ "image_url" eller "image_url" med detalj). Filinmatningar kan vara base64-kodade. OrcaRouter skickar alla parametrar till OpenAI. Obs: Svarsformat (JSON-läge) stöds; sätt response_format={ "type": "json_object" } när det är lämpligt.
Migrationen är enkel: ändra bas-URL:en i din klient från "https://api.openai.com/v1" till "https://api.orcarouter.ai/v1" och ersätt din API-nyckel med en OrcaRouter-nyckel. Uppdatera modellnamnet till "openai/gpt-4o-mini" (eller behåll det som "gpt-4o-mini"? Faktumet säger model-id "openai/gpt-4o-mini", så använd det). All annan kod förblir oförändrad eftersom API:et är helt OpenAI-kompatibelt. Du kan även behålla flera modellsträngar och dirigera baserat på kostnad eller kapacitet. OrcaRouter ändrar inte svarsformatet. Testa med några frågor för att säkerställa att headers och streaming fungerar som förväntat.
Ja, GPT-4o-mini stöder strömning via server-sända händelser (SSE). Ställ in stream=true i förfrågan. Svaret blir en serie bitar (chunks) som innehåller deltainnehåll. Detta minskar tiden till första token för användarna och möjliggör realtidsvisning. OrcaRouter vidarebefordrar strömmande svar utan ändringar. Observera att det fakturerade totala tokenantalet förblir detsamma. Strömning är kompatibel med alla inmatningsmodaliteter (text, bild, fil). Du kan också kombinera strömning med funktionsanrop; modellen kommer att strömma en verktygsanropsbit (tool call chunk) när det är lämpligt. Parametern max_tokens gäller för hela svaret.
GPT-4o-mini är den mindre, billigare syskonmodellen till GPT-4o. Den kostar cirka 94% mindre för både in- och utdata-tokens. Den har samma 128K kontextfönster och 16K maximal utdata. Den stöder samma multimodala indata men är generellt något mindre noggrann vid komplexa resonemang och kreativa uppgifter. På MATH-500 får GPT-4o-mini 78,9 medan GPT-4o får 92+ (ungefärligt). För många vardagliga uppgifter som kundsupport, sammanfattning och enkel bildanalys är GPT-4o-mini tillräcklig. Välj GPT-4o när du behöver topprestanda och kan acceptera högre latens och kostnad.
Jämförelse med modeller som Claude 3 Haiku eller Gemini 1.5 Flash: GPT-4o-mini erbjuder ett 128K-kontextfönster, medan Haiku tillåter 200K och Flash 1M. Prissättningen är liknande (Haiku $0,25/$1,25 per 1M tokens; Flash $0,35/$1,05). GPT-4o-minis MATH-500-poäng på 78,9 är konkurrenskraftig; Haiku får runt 73 och Flash runt 78 på liknande matematikriktmärken. För multimodala indata accepterar alla tre bilder. GPT-4o-mini kan ha bättre resonemangskvalitet för sitt pris, men kontextfönstret är mindre än vissa konkurrenter. Bästa valet beror på dina specifika krav på latens, kostnad och kvalitet. OrcaRouter ger också tillgång till Haiku och Flash, vilket möjliggör sidvis jämförelse.
GPT-3.5-turbo är äldre, har ett 16K kontextfönster och kostar något mindre ($0.50 per 1M input jämfört med $0.15 för GPT-4o-mini? Egentligen kostar GPT-3.5-turbo-0125 $0.50/$1.50 men med mindre kontext. Baserat på angivna priser är GPT-4o-mini billigare per token och erbjuder större kontext och multimodal input. Så för de flesta uppgifter är GPT-4o-mini överlägsen. Vissa äldre applikationer som redan använder GPT-3.5-turbo kan dock kräva minimala ändringar. GPT-4o-mini presterar också bättre på resonemangstest. Om inte latensen är extremt kritisk eller du har finjusterat en GPT-3.5-modell, är GPT-4o-mini den rekommenderade drop-in-uppgraderingen.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Inmatning / 1M token | $0.150 |
| Utdata / 1M tokens | $0.600 |
| Cacheläsning / 1M | $0.075 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/openai/gpt-4o-miniÖppna @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini