GPT-4o mini is OpenAI's nieuwste model na [GPT-4 Omni](/models/openai/gpt-4o), dat zowel tekst- als afbeeldingsinvoer ondersteunt met tekstuitvoer. Als hun meest geavanceerde kleine model is het vele malen betaalbaarder...
GPT-4o-mini (2024-07-18) is een lichtgewicht multimodaal model ontwikkeld door OpenAI, ontworpen voor kostenefficiënte tekst- en beeldverwerking. Het is bedoeld voor ontwikkelaars en organisaties…
GPT-4o-mini kan beeldredeneertaken uitvoeren, zoals het beschrijven van visuele inhoud, het beantwoorden van vragen over afbeeldingen en het identificeren van objecten of tekst in afbeeldingen. Het ondersteunt standaard afbeeldingsformaten (JPEG, PNG, GIF, WebP) en kan meerdere afbeeldingen in één verzoek verwerken. Het model voert geen objectdetectie uit in de zin van gestructureerde begrenzingskaders, maar het kan locaties en relaties beschrijven. Het kan bijvoorbeeld tekst uit een foto lezen, grafieken en diagrammen begrijpen en gedetailleerde scènebeschrijvingen geven. De nauwkeurigheid van beeldgebaseerde taken hangt af van resolutie en context; afbeeldingen met een hoge resolutie kunnen meer tokenskosten met zich meebrengen, maar kunnen betere resultaten opleveren voor fijnkorrelige details.
GPT-4o-mini accepteert bestandsinvoer zoals PDF's, Word-documenten en afbeeldingsbestanden via de multimodale inhoudsstructuur. Wanneer een bestand wordt verstrekt, haalt het model tekst en afbeeldingsinhoud uit het bestand, zodat gebruikers vragen kunnen stellen over de inhoud van het document, de tekst kunnen samenvatten of ingebedde tabellen en figuren kunnen analyseren. Het bestand wordt niet geüpload of opgeslagen; het wordt inline verwerkt tijdens de API-aanroep. Dit is nuttig voor workflows waarbij documentbeoordeling, contractanalyse of het extraheren van gegevens uit gescande formulieren betrokken is. Merk op dat zeer grote bestanden het contextvenster van 128.000 tokens kunnen overschrijden of hoge tokenkosten kunnen veroorzaken.
Voor taken die alleen lichte tekstgeneratie vereisen, kunnen tokenbudgetten beter worden benut door nog goedkopere modellen zoals GPT-3.5-Turbo of open-source alternatieven (bijv. Llama 3 8B). Als je workload geen multimodale invoer of een 128k-context nodig heeft, kan een kleiner model de kosten verder verlagen. Bovendien kan voor smalle taken zoals eenvoudige classificatie of trefwoordenextractie een fijn afgesteld kleiner model lagere latentie en lagere kosten bieden. De combinatie van lage prijs, grote context en multimodale mogelijkheden van GPT-4o-mini maakt het echter een sterke standaardkeuze voor veel algemene toepassingen.
GPT-4o-mini excelleert in productieomgevingen met hoge volumes die profiteren van multimodaal begrip en grote contextvensters. Ideale gebruiksscenario's zijn onder meer chatbots voor klantenservice die screenshots en lange gespreksgeschiedenissen kunnen verwerken, documentverwerkingspijplijnen voor het extraheren van gegevens uit PDF's of afbeeldingen, educatieve hulpmiddelen voor wiskundebijles (zoals blijkt uit de 78.9 MATH-500-score), en codefoutopsporing waarbij zowel tekst als diagrammen betrokken zijn. Het is ook zeer geschikt voor contentmoderatieworkflows die beeldanalyse naast tekst vereisen. De lage kosten per token maken schaalvergroting naar miljoenen verzoeken mogelijk zonder buitensporige kosten.
GPT-4o-mini behaalt een score van 78,9 op de MATH-500 benchmark, een subset van de MATH-dataset bestaande uit 500 uitdagende wiskundeproblemen. Deze score geeft het vermogen van het model aan om rekenkundige, algebraïsche, meetkundige en andere wiskundige problemen op te lossen met stapsgewijze redenering. Een score van 78,9 plaatst het boven veel kleinere modellen en enkele eerdere GPT-4-varianten, wat wijst op sterke redeneercapaciteiten voor een model van zijn omvang en kosten. Het is echter niet zo performant als de volledige GPT-4o of GPT-4 Turbo op dezelfde benchmark. Het resultaat moet in context worden geïnterpreteerd: GPT-4o-mini is ontworpen voor efficiëntie, niet voor maximale nauwkeurigheid.
Specifieke latentiecijfers worden niet openbaar gemaakt door OpenAI, maar GPT-4o-mini is over het algemeen sneller dan grotere GPT-4-modellen vanwege het kleinere aantal parameters. In de praktijk rapporteren gebruikers een tijd-tot-eerste-token in de orde van een paar honderd milliseconden voor korte prompts, en een generatiedoorvoer van tientallen tokens per seconde. Latentie hangt af van het totale aantal tokens (input + output), aantal afbeeldingen en de huidige serverbelasting. Omdat OrcaRouter als proxy fungeert, is extra netwerklatentie minimaal—doorgaans binnen een paar milliseconden van de directe OpenAI API-latentie. Het model ondersteunt streaming voor real-time toepassingen.
Sterke punten: Kostenefficiëntie (laagste prijs onder GPT-4-familieleden met multimodale ondersteuning), groot 128k-contextvenster, solide wiskundig redeneren (78.9 MATH-500), en snelle inferentie in vergelijking met grotere modellen. Het verwerkt afbeelding- en bestandsinvoer bekwaam voor algemene taken. Beperkingen: Bij complex, genuanceerd redeneren of creatief schrijven presteert het minder goed vergeleken met GPT-4o en GPT-4 Turbo. Het volgen van instructies kan minder betrouwbaar zijn voor taken die strikte opmaak of meerstapsbeperkingen vereisen. Bovendien, omdat het een kleiner model is, kan de kennisafsluitdatum (januari 2024) verouderd zijn voor zeer recente gebeurtenissen. Het ondersteunt ook geen vision-mogelijkheden voor gedetailleerde objectdetectie of gezichtsherkenning.
De prijzen zijn vastgesteld op $0,15 per 1 miljoen invoertokens en $0,60 per 1 miljoen uitvoertokens. Dit zijn de standaardtarieven van OpenAI, en OrcaRouter rekent hier geen opslag bovenop. Facturatie gebeurt op basis van het aantal tokens zoals gerapporteerd door de modelprovider. Er zijn geen extra kosten per verzoek of minimumbedragen. Het beleid van geen opslag geldt voor alle modellen die via OrcaRouter beschikbaar zijn, waardoor de prijzen identiek zijn aan wat u rechtstreeks aan OpenAI zou betalen. Deze transparantie stelt gebruikers in staat om nauwkeurig te budgetteren zonder verrassingskosten.
Uitvoertokens zijn vier keer duurder per token dan invoertokens ($0,60 vs $0,15 per miljoen). Voor taken die lange antwoorden genereren, zoals gedetailleerde samenvattingen of codegeneratie, kunnen uitvoerkosten domineren. Gebruikers kunnen het verbruik van uitvoertokens beheren via de max_tokens-parameter en door prompts te maken die beknopte antwoorden uitlokken. Omgekeerd brengen taken met grote invoeren (bijv. het verwerken van lange documenten met veel afbeeldingen) invoerkosten met zich mee. Het grote 128k contextvenster maakt het gemakkelijk om substantiële context op te nemen, maar dat gaat tegen het tarief per invoertoken. Het optimaliseren van de balans tussen invoer- en uitvoerlengte is de sleutel tot het beheren van de totale kosten.
OrcaRouter biedt momenteel geen ingebouwde caching voor GPT-4o-mini-aanvragen naast wat OpenAI op API-niveau levert. Er zijn geen volumekortingen of gereserveerde capaciteitsopties beschikbaar via OrcaRouter; de prijzen zijn strikt pay-as-you-go tegen het tarief van de OpenAI-provider. Gebruikers zijn zelf verantwoordelijk voor het implementeren van hun eigen caching-strategieën (bijv. op applicatieniveau) om dubbele API-aanroepen te verminderen. Het nul-opslagbeleid betekent dat eventuele toekomstige prijswijzigingen door OpenAI automatisch worden doorgevoerd. Voor extreem hoogvolume gebruiksscenario's kunnen directe OpenAI-enterpriseovereenkomsten betere voorwaarden bieden, maar via OrcaRouter kan de eenvoud van een enkele API-sleutel en geünifieerde facturering nog steeds voordelig zijn.
Afbeeldingen verwerkt door GPT-4o-mini worden omgezet in tokens op basis van hun resolutie en detailniveau. OpenAI gebruikt een tokenberekeningsalgoritme dat zowel breedte als hoogte in overweging neemt; bijvoorbeeld een typische 1024x1024 afbeelding met hoog detail kan ongeveer 2.000–3.000 invoertokens kosten. Aangezien invoertokens worden gefactureerd tegen $0,15 per miljoen, zijn de kosten per afbeelding zeer laag (doorgaans sub-cent). Het verwerken van veel afbeeldingen in één enkele aanvraag kan echter oplopen. Gebruikers kunnen de kosten beheersen door het detailniveau `low` te gebruiken (kost ongeveer 85 tokens per afbeelding) wanneer hoge getrouwheid niet vereist is. Controleer altijd de tokens die in de API-respons worden gebruikt om de afbeeldingskosten te begrijpen.
Stel uw API-basis-URL in op https://api.orcarouter.ai/v1 en gebruik de model-ID "openai/gpt-4o-mini-2024-07-18". De API volgt het standaard OpenAI chat-voltooiingsformaat. Bijvoorbeeld, in Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "uw-orcarouter-sleutel"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hallo!"}]). Alle parameters zoals temperature, top_p, max_tokens, stream en stop-reeksen worden ondersteund zoals in de oorspronkelijke OpenAI API. Antwoorden bevatten standaardvelden zoals id, choices, usage met tokens-tellingen.
Voor deterministische uitvoer stelt u temperature=0 en top_p=1 in. Voor creatieve taken kan een temperature rond 0.8–1.2 geschikt zijn. Max_tokens bepaalt de lengte van het antwoord; standaard is 16.384. Om de uitvoeringskosten te verlagen, stelt u max_tokens in op uw behoeften. Bij gebruik van multimodale inputs structureert u berichten met een array van inhoudsdelen: [{"type":"text","text":"Beschrijf dit:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Voor bestandsverwerking neemt u de bestandsinhoud op als tekst of base64. De stop-parameter kan worden gebruikt om de generatie te stoppen bij aangepaste reeksen. Stream=True zorgt voor real-time tokenlevering.
Migratie vereist drie eenvoudige aanpassingen: stel de base_url in op https://api.orcarouter.ai/v1, vervang uw API-sleutel door uw OrcaRouter API-sleutel, en wijzig de model-ID naar "openai/gpt-4o-mini-2024-07-18". Er zijn geen andere codewijzigingen nodig als u de OpenAI Python/Node.js-bibliotheken gebruikt of een HTTP-client die de standaard chat completions-indeling volgt. De responsstructuur is identiek. Merk op dat OrcaRouter uw verzoeken niet anders beperkt dan OpenAI; dezelfde snelheidslimieten gelden als voor uw OpenAI-accountniveau, maar u beheert sleutels via OrcaRouter. Test met een klein verzoek om tokentellingen en latentie te verifiëren.
Geef uw OrcaRouter API-sleutel op in de Authorization-header: Authorization: Bearer <uw-sleutel>. De API retourneert standaard HTTP-statuscodes: 200 voor succes, 400 voor ongeldige aanvraag (bijv. ongeldige parameters), 401 voor ongeautoriseerd (verkeerde API-sleutel), 429 voor snelheidsbeperking en 500 voor serverfouten. Foutmeldingen bevatten een JSON-body met een error-object met een message en type. Het wordt aanbevolen om herpogingen met exponentiële backoff te implementeren voor 429- en 5xx-fouten. OrcaRouter wijzigt foutmeldingen van OpenAI niet, dus dezelfde foutmeldingen die u ziet bij de directe API zullen verschijnen.
GPT-4o-mini is aanzienlijk capabeler dan GPT-3.5-Turbo op het gebied van redeneren, wiskunde en het opvolgen van instructies, zoals blijkt uit de MATH-500-score van 78,9 tegenover de typische score van GPT-3.5-Turbo van rond de 30-40. Het ondersteunt ook multimodale inputs (afbeeldingen en bestanden), wat GPT-3.5-Turbo niet doet. Het contextvenster is groter: 128k vs 16k. Prijzen: GPT-4o-mini ($0,15/$0,60 per miljoen tokens) is iets duurder dan GPT-3.5-Turbo ($0,50/$1,50 voor de 16k-versie? Eigenlijk is GPT-3.5-Turbo 0125 $0,50/$1,50 per miljoen? Wacht, standaard GPT-3.5-Turbo is $1,50/$2,00 per miljoen? Ik hou me aan de verstrekte feiten: de prijzen van GPT-4o-mini zijn gegeven. Vergelijk kwalitatief: GPT-4o-mini biedt betere prestaties tegen iets hogere kosten dan GPT-3.5-Turbo, maar met multimodale mogelijkheden.
GPT-4o-mini is een kleinere, kostenefficiëntere versie van GPT-4o. Beide delen multimodale mogelijkheden en dezelfde contextvenstergrootte (128k tokens), maar GPT-4o behaalt hogere scores op benchmarks zoals MMLU en MATH. De MATH-500-score van GPT-4o-mini van 78,9 is lager dan de gerapporteerde score van GPT-4o van ongeveer 90–95. De prijzen zijn aanzienlijk lager: GPT-4o-mini ($0,15/$0,60) versus GPT-4o ($2,50/$10,00 per miljoen tokens). Voor toepassingen waar maximale nauwkeurigheid bij complexe redeneertaken cruciaal is, heeft GPT-4o de voorkeur. Voor hoge doorvoer en kostengevoelige taken waarbij een gematigde nauwkeurigheid acceptabel is, biedt GPT-4o-mini aanzienlijke besparingen.
Open-source-modellen zoals Llama 3 8B en 70B bieden het voordeel van zelfhosting voor nul per-token kosten, maar vereisen infrastructuur en expertise. GPT-4o-mini via OrcaRouter biedt serverloze toegang zonder vooruitbetaling en automatische schaalvergroting. Op benchmarks is de MATH-500-score van GPT-4o-mini van 78.9 concurrerend met Llama 3 8B (ongeveer 30-40) en dichter bij Llama 3 70B (ongeveer 60-70). GPT-4o-mini ondersteunt ook native afbeeldingen, wat de meeste open-source modellen niet doen. De afweging: open-source modellen bieden gegevensprivacy (geen externe API-aanroep) en lagere latentie als er inferentiehardware beschikbaar is. GPT-4o-mini biedt gebruiksgemak en multimodale mogelijkheden tegen een lage prijs per token.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Invoer / 1M tokens | $0.150 |
| Uitvoer / 1M tokens | $0.600 |
| Cache lezen / 1M | $0.075 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Openen @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18