GPT-4o mini är OpenAIs nyaste modell efter [GPT-4 Omni](/models/openai/gpt-4o), som stöder både text- och bildinmatning med textutmatning. Som deras mest avancerade lilla modell är den många gånger billigare...
GPT-4o-mini (2024-07-18) är en lättviktig multimodal modell utvecklad av OpenAI, utformad för kostnadseffektiv text- och bildbehandling. Den är avsedd för utvecklare och organisationer som behöver…
GPT-4o-mini kan utföra bildresonemangsuppgifter såsom att beskriva visuellt innehåll, besvara frågor om bilder och identifiera objekt eller text i bilder. Den stöder vanliga bildformat (JPEG, PNG, GIF, WebP) och kan hantera flera bilder i en enda förfrågan. Modellen utför inte objektdetektering på ett strukturerat bounding-box-sätt, men den kan beskriva platser och relationer. Till exempel kan den läsa text från ett fotografi, förstå diagram och figurer samt ge detaljerade scenbeskrivningar. Noggrannheten för bildbaserade uppgifter beror på upplösning och sammanhang; högupplösta bilder kan medföra högre tokenkostnader men kan ge bättre resultat för fina detaljer.
GPT-4o-mini accepterar filinmatningar som PDF-filer, Word-dokument och bildfiler via den multimodala innehållsstrukturen. När en fil anges, extraherar modellen text- och bildinnehåll från den, vilket gör att användare kan ställa frågor om dokumentets innehåll, sammanfatta texten eller analysera inbäddade tabeller och figurer. Filen laddas inte upp eller lagras; den bearbetas inline under API-anropet. Detta är användbart för arbetsflöden som involverar dokumentgranskning, kontraktsanalys eller extrahering av data från skannade formulär. Observera att mycket stora filer kan överskrida det 128,000-tokens kontextfönstret eller medföra höga token-kostnader.
För uppgifter som endast kräver lättviktig textgenerering kan tokenbudgetar betjänas bättre av ännu billigare modeller som GPT-3.5-Turbo eller öppen källkodsalternativ (t.ex. Llama 3 8B). Om din arbetsbelastning inte behöver multimodal inmatning eller en 128k kontext, kan en mindre modell minska kostnaderna ytterligare. Dessutom, för smala uppgifter som enkel klassificering eller nyckelordsextraktion, kan en finjusterad mindre modell erbjuda lägre latens och kostnad. Men GPT-4o-minis kombination av lågt pris, stor kontext och multimodal kapacitet gör den till ett starkt standardval för många allmänna applikationer.
GPT-4o-mini utmärker sig i produktionsmiljöer med hög volym som drar nytta av multimodal förståelse och stora kontextfönster. Idealiska användningsfall inkluderar kundsupport-chatbotar som kan hantera skärmbilder och långa samtalshistoriker, dokumentbearbetningspipelines för att extrahera data från PDF-filer eller bilder, utbildningsverktyg för mattehandledning (vilket bevisas av dess 78.9 MATH-500-poäng) och kodfelsökning där både text och diagram ingår. Den är också väl lämpad för arbetsflöden för innehållsmoderering som kräver bildanalys tillsammans med text. Den låga kostnaden per token möjliggör skalning till miljontals förfrågningar utan oöverkomliga kostnader.
GPT-4o-mini uppnår en poäng på 78.9 på MATH-500 benchmark, en delmängd av MATH-dataset som består av 500 utmanande matematikproblem. Denna poäng indikerar modellens förmåga att lösa aritmetik, algebra, geometri och andra matematiska problem med steg-för-steg-resonemang. En poäng på 78.9 placerar den ovanför många mindre modeller och vissa tidigare GPT-4-varianter, vilket tyder på starka resonemangsförmågor för en modell av dess storlek och kostnad. Emellertid är den inte lika prestandastark som den fullständiga GPT-4o eller GPT-4 Turbo på samma benchmark. Resultatet bör tolkas i sitt sammanhang: GPT-4o-mini är designad för effektivitet, inte maximal noggrannhet.
Specifika latenssiffror offentliggörs inte av OpenAI, men GPT-4o-mini är generellt snabbare än större GPT-4-modeller på grund av sitt mindre parameterantal. I praktiken rapporterar användare att tiden till första token ligger i intervallet några hundra millisekunder för korta promptar, och genereringsgenomströmningen uppgår till dussintals token per sekund. Latensen beror på totalt tokenantal (inmatning + utmatning), antal bilder och aktuell serverbelastning. Eftersom OrcaRouter fungerar som en proxy är extra nätverkslatens minimal—typiskt inom några millisekunder från direkt OpenAI API-latens. Modellen stöder strömning för realtidsapplikationer.
Styrkor: Kostnadseffektivitet (lägsta priset bland GPT-4-familjens medlemmar med multimodal support), stort 128k kontextfönster, solid matematisk resonemangsförmåga (78.9 MATH-500) och snabb inferens jämfört med större modeller. Den hanterar bild- och filinmatningar kompetent för generella uppgifter. Begränsningar: Vid komplexa, nyanserade resonemang eller kreativt skrivande presterar den sämre jämfört med GPT-4o och GPT-4 Turbo. Dess följsamhet till instruktioner kan vara mindre pålitlig för uppgifter som kräver strikt formatering eller flerstegsbegränsningar. Dessutom, eftersom det är en mindre modell, kan dess kunskapsgräns (januari 2024) vara föråldrad för mycket aktuella händelser. Den stöder inte heller synförmåga för detaljerad objektdetektering eller ansiktsigenkänning.
Priserna är satta till $0.15 per 1 miljon inmatningstokens och $0.60 per 1 miljon utmatningstokens. Dessa är standardpriserna från OpenAI-leverantören, och OrcaRouter tar ut noll påslag ovanpå dem. Debitering baseras på tokenantal som rapporterats av modellleverantören. Det finns inga extra avgifter per förfrågan eller minimibelopp. Nollpåslagsprincipen gäller för alla modeller som finns tillgängliga via OrcaRouter, vilket gör prissättningen identisk med vad du skulle betala direkt till OpenAI. Denna transparens gör att användare kan budgetera korrekt utan överraskningskostnader.
Utmatningstokens är fyra gånger dyrare per token än inmatningstokens ($0.60 vs $0.15 per miljon). För uppgifter som genererar långa svar, såsom detaljerade sammanfattningar eller kodgenerering, kan utmatningskostnaderna dominera. Användare kan kontrollera användningen av utmatningstokens via parametern max_tokens och genom att formulera uppmaningar som ger koncisa svar. Omvänt medför uppgifter med stora indata (t.ex. bearbetning av långa dokument med många bilder) inmatningskostnader. Det stora 128k kontextfönstret gör det enkelt att inkludera betydande kontext, men det kommer till priset av inmatningspriset per token. Att optimera balansen mellan inmatnings- och utmatningslängd är nyckeln till att hantera den totala kostnaden.
OrcaRouter erbjuder för närvarande inte inbyggd cachning för GPT-4o-mini-förfrågningar utöver vad OpenAI tillhandahåller på API-nivå. Det finns inga volymrabatter eller reserverade kapacitetsalternativ tillgängliga via OrcaRouter; prissättningen är strikt pay-as-you-go till OpenAIs leverantörspris. Användarna ansvarar själva för att implementera sina egna cachningsstrategier (t.ex. på applikationslagret) för att minska dubblerade API-anrop. Nollpåslagsprincipen innebär att eventuella framtida prisförändringar från OpenAI återspeglas automatiskt. För extremt högvolymsanvändning kan direkta OpenAI-företagsavtal erbjuda bättre villkor, men genom OrcaRouter kan enkelheten med en enda API-nyckel och enhetlig fakturering fortfarande vara fördelaktig.
Bilder som bearbetas av GPT-4o-mini omvandlas till tokens baserat på deras upplösning och detaljnivå. OpenAI använder en tokenberäkningsalgoritm som tar hänsyn till både bredd och höjd; till exempel kan en typisk 1024x1024-bild med hög detaljnivå kosta omkring 2 000–3 000 inmatningstokens. Eftersom inmatningstokens debiteras till $0,15 per miljon blir kostnaden per bild mycket låg (typiskt under 1 cent). Men om man bearbetar många bilder i en enda förfrågan kan detta ackumuleras. Användare kan kontrollera kostnaderna genom att använda detaljnivån `low` (kostar ungefär 85 tokens per bild) när hög kvalitet inte krävs. Kontrollera alltid antalet tokens som används i API-svaret för att förstå bildkostnaderna.
Ställ in din API-bas-URL till https://api.orcarouter.ai/v1 och använd modell-ID "openai/gpt-4o-mini-2024-07-18". API:et följer standardformatet för OpenAI-chattkompletteringar. Till exempel, i Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "din-orcarouter-nyckel"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Alla parametrar som temperature, top_p, max_tokens, stream och stop-sekvenser stöds precis som i det ursprungliga OpenAI API:et. Svar innehåller standardfält som id, choices, usage med token-räkningar.
För deterministiska utdata, ställ in temperature=0 och top_p=1. För kreativa uppgifter kan en temperatur runt 0,8–1,2 vara lämplig. Max_tokens styr längden på svaret; standardvärdet är 16 384. För att minska utdatakostnaden, ställ in max_tokens efter dina behov. När du använder multimodala indata, strukturera meddelanden med en array av innehållsdelar: [{"type":"text","text":"Describe this:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. För filhantering, inkludera filinnehållet som text eller base64. Parametern stop kan användas för att stoppa generering vid anpassade sekvenser. Stream=True möjliggör leverans av tokens i realtid.
Migration kräver tre enkla ändringar: Sätt base_url till https://api.orcarouter.ai/v1, byt ut din API-nyckel mot din OrcaRouter API-nyckel, och ändra model-ID till "openai/gpt-4o-mini-2024-07-18". Några andra kodändringar bör inte vara nödvändiga om du använder OpenAI Python/Node.js-biblioteken eller någon HTTP-klient som följer standardformatet för chattkompletteringar. Svarsstrukturen är identisk. Observera att OrcaRouter inte begränsar dina förfrågningar annorlunda än OpenAI; samma hastighetsbegränsningar gäller enligt din OpenAI-kontonivå, men du hanterar nycklar via OrcaRouter. Testa med en liten förfrågan för att verifiera tokenantal och latens.
Ange din OrcaRouter API-nyckel i Authorization-header: Authorization: Bearer <your-key>. API:et returnerar standard HTTP-statuskoder: 200 för lyckad begäran, 400 för felaktig begäran (t.ex. ogiltiga parametrar), 401 för obehörig (fel API-nyckel), 429 för hastighetsbegränsning och 500 för serverfel. Felsvar innehåller en JSON-kropp med ett felobjekt som innehåller ett meddelande och en typ. Det rekommenderas att implementera omförsök med exponentiell backoff vid 429 och 5xx-fel. OrcaRouter modifierar inte felsvar från OpenAI, så samma felmeddelanden som du ser med det direkta API:et kommer att visas.
GPT-4o-mini är betydligt mer kapabel än GPT-3.5-Turbo när det gäller resonemang, matematik och instruktionsföljning, vilket visas av dess MATH-500-poäng på 78.9 jämfört med GPT-3.5-Turbos typiska poäng runt 30–40. Den stödjer även multimodala ingångar (bilder och filer), vilket GPT-3.5-Turbo inte gör. Kontextfönstret är större: 128k mot 16k. Prissättning: GPT-4o-mini ($0.15/$0.60 per miljon tokens) är något dyrare än GPT-3.5-Turbo ($0.50/$1.50 för 16k-versionen? Egentligen är GPT-3.5-Turbo 0125 $0.50/$1.50 per miljon? Vänta, standard GPT-3.5-Turbo är $1.50/$2.00 per miljon? Jag håller mig till angivna fakta: GPT-4o-minis prissättning är given. Jämför kvalitativt: GPT-4o-mini erbjuder bättre prestanda till en något högre kostnad än GPT-3.5-Turbo, men med multimodal kapacitet.
GPT-4o-mini är en mindre, mer kostnadseffektiv version av GPT-4o. Medan båda delar multimodal kapacitet och samma kontextfönsterstorlek (128k tokens), uppnår GPT-4o högre poäng på riktmärken som MMLU och MATH. GPT-4o-minis MATH-500-poäng på 78,9 är lägre än GPT-4os rapporterade poäng på cirka 90–95. Prissättningen är betydligt billigare: GPT-4o-mini ($0,15/$0,60) jämfört med GPT-4o ($2,50/$10,00 per miljon tokens). För applikationer där maximal noggrannhet i komplexa resonemangsuppgifter är avgörande, är GPT-4o att föredra. För hög genomströmning och kostnadskänsliga uppgifter där måttlig noggrannhet är acceptabel, erbjuder GPT-4o-mini betydande besparingar.
Open source-modeller som Llama 3 8B och 70B erbjuder fördelen med egen hosting för noll kostnad per token, men kräver infrastruktur och expertis. GPT-4o-mini via OrcaRouter ger serverlös åtkomst utan förskottskostnader och automatisk skalning. I benchmarks är GPT-4o-minis MATH-500-poäng på 78,9 konkurrenskraftig med Llama 3 8B (cirka 30–40) och närmare Llama 3 70B (cirka 60–70). GPT-4o-mini stöder även bilder inbyggt, vilket de flesta open source-modeller inte gör. Avvägningen: open source-modeller erbjuder datasekretess (inget externt API-anrop) och lägre latens om inferensmaskinvara finns tillgänglig. GPT-4o-mini erbjuder användarvänlighet och multimodal kapacitet till ett lågt pris per token.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Inmatning / 1M token | $0.150 |
| Utdata / 1M tokens | $0.600 |
| Cacheläsning / 1M | $0.075 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Öppna @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18