GPT-4o mini ist das neueste Modell von OpenAI nach [GPT-4 Omni](/models/openai/gpt-4o) und unterstützt sowohl Text- als auch Bildeingaben mit Textausgaben. Als ihr fortschrittlichstes kleines Modell ist es um ein Vielfaches erschwinglicher...
GPT-4o-mini (2024-07-18) ist ein leichtgewichtiges multimodales Modell, das von OpenAI entwickelt wurde und für kosteneffiziente Text- und Bildverarbeitung konzipiert ist. Es richtet sich an…
GPT-4o-mini kann Bildverarbeitungsaufgaben wie die Beschreibung visueller Inhalte, die Beantwortung von Fragen zu Bildern und die Identifizierung von Objekten oder Text in Bildern durchführen. Es unterstützt gängige Bildformate (JPEG, PNG, GIF, WebP) und kann mehrere Bilder in einer einzigen Anfrage verarbeiten. Das Modell führt keine Objekterkennung im Sinne strukturierter Begrenzungsrahmen durch, kann aber Positionen und Beziehungen beschreiben. Beispielsweise kann es Text aus einem Foto lesen, Diagramme und Schaubilder verstehen und detaillierte Szenenbeschreibungen liefern. Die Genauigkeit bildbasierter Aufgaben hängt von Auflösung und Kontext ab; hochauflösende Bilder können höhere Token-Kosten verursachen, aber bei feinen Details bessere Ergebnisse liefern.
GPT-4o-mini akzeptiert Dateieingaben wie PDFs, Word-Dokumente und Bilddateien über die multimodale Inhaltsstruktur. Wenn eine Datei bereitgestellt wird, extrahiert das Modell Text- und Bildinhalte daraus, sodass Benutzer Fragen zum Inhalt des Dokuments stellen, seinen Text zusammenfassen oder eingebettete Tabellen und Abbildungen analysieren können. Die Datei wird nicht hochgeladen oder gespeichert; sie wird während des API-Aufrufs inline verarbeitet. Dies ist nützlich für Arbeitsabläufe, die Dokumentenprüfung, Vertragsanalyse oder das Extrahieren von Daten aus gescannten Formularen umfassen. Beachten Sie, dass sehr große Dateien das 128.000-Token-Kontextfenster überschreiten oder hohe Token-Kosten verursachen können.
Für Aufgaben, die nur eine leichte Textgenerierung erfordern, können Token-Budgets möglicherweise besser durch noch günstigere Modelle wie GPT-3.5-Turbo oder Open-Source-Alternativen (z. B. Llama 3 8B) bedient werden. Wenn Ihr Workload keine multimodale Eingabe oder einen 128k-Kontext benötigt, könnte ein kleineres Modell die Kosten weiter senken. Darüber hinaus kann für enge Aufgaben wie einfache Klassifizierung oder Schlüsselwortextraktion ein feinabgestimmtes kleineres Modell niedrigere Latenz und Kosten bieten. Allerdings macht die Kombination aus niedrigem Preis, großem Kontext und multimodaler Fähigkeit von GPT-4o-mini es zu einer starken Standardwahl für viele allgemeine Anwendungen.
GPT-4o-mini eignet sich hervorragend für Produktionsumgebungen mit hohem Volumen, die von multimodalem Verständnis und großen Kontextfenstern profitieren. Ideale Anwendungsfälle umfassen Chatbots für den Kundensupport, die Screenshots und lange Gesprächsverläufe verarbeiten können, Dokumentenverarbeitungspipelines zum Extrahieren von Daten aus PDFs oder Bildern, Bildungs-Tools für Mathematik-Nachhilfe (belegt durch den Wert von 78,9 MATH-500) sowie Code-Debugging, bei dem sowohl Text als auch Diagramme beteiligt sind. Außerdem eignet es sich gut für Content-Moderation-Workflows, die eine Bildanalyse neben Text erfordern. Die niedrigen Kosten pro Token ermöglichen eine Skalierung auf Millionen von Anfragen ohne übermäßige Kosten.
GPT-4o-mini erreicht eine Punktzahl von 78,9 im MATH-500-Benchmark, einem Teil des MATH-Datensatzes, der aus 500 anspruchsvollen Mathematikaufgaben besteht. Diese Punktzahl zeigt die Fähigkeit des Modells, arithmetische, algebraische, geometrische und andere mathematische Probleme mit schrittweiser Argumentation zu lösen. Eine Punktzahl von 78,9 platziert es über vielen kleineren Modellen und einigen früheren GPT-4-Varianten, was auf starke Reasoning-Fähigkeiten für ein Modell seiner Größe und Kosten hindeutet. Allerdings ist es im gleichen Benchmark nicht so leistungsfähig wie das vollständige GPT-4o oder GPT-4 Turbo. Das Ergebnis sollte im Kontext interpretiert werden: GPT-4o-mini ist für Effizienz ausgelegt, nicht für maximale Genauigkeit.
Spezifische Latenzwerte werden von OpenAI nicht öffentlich gemacht, aber GPT-4o-mini ist aufgrund seiner geringeren Parameteranzahl generell schneller als größere GPT-4-Modelle. In der Praxis berichten Nutzer von einer Time-to-First-Token im Bereich von einigen hundert Millisekunden für kurze Eingabeaufforderungen und einem Durchsatz bei der Generierung von Dutzenden Tokens pro Sekunde. Die Latenz hängt von der Gesamtzahl der Tokens (Eingabe + Ausgabe), der Anzahl der Bilder und der aktuellen Serverlast ab. Da OrcaRouter als Proxy fungiert, ist die zusätzliche Netzwerklatenz minimal – typischerweise innerhalb weniger Millisekunden der direkten OpenAI-API-Latenz. Das Modell unterstützt Streaming für Echtzeitanwendungen.
Stärken: Kosteneffizienz (niedrigster Preis unter den GPT-4-Familienmitgliedern mit Multimodalunterstützung), großes 128k-Kontextfenster, solide mathematische Argumentation (78,9 MATH-500) und schnelle Inferenz im Vergleich zu größeren Modellen. Es verarbeitet Bild- und Dateieingaben kompetent für allgemeine Aufgaben. Einschränkungen: Bei komplexen, nuancierten Überlegungen oder kreativem Schreiben schneidet es im Vergleich zu GPT-4o und GPT-4 Turbo schlechter ab. Seine Befolgungsfähigkeit von Anweisungen kann bei Aufgaben, die strenge Formatierung oder mehrstufige Einschränkungen erfordern, weniger zuverlässig sein. Zusätzlich kann aufgrund eines kleineren Modells sein Wissensstand (Januar 2024) für sehr aktuelle Ereignisse veraltet sein. Es unterstützt auch keine Bildverarbeitungsfähigkeiten für feinkörnige Objekterkennung oder Gesichtserkennung.
Die Preise betragen 0,15 $ pro 1 Million Eingabe-Token und 0,60 $ pro 1 Million Ausgabe-Token. Dies sind die Standard-OpenAI-Anbieterpreise, und OrcaRouter erhebt keinen Aufschlag darauf. Die Abrechnung erfolgt auf Grundlage der Token-Anzahlen, die vom Modellanbieter gemeldet werden. Es gibt keine zusätzlichen Gebühren pro Anfrage oder Mindestbeträge. Die Null-Aufschlag-Richtlinie gilt für alle über OrcaRouter verfügbaren Modelle, sodass die Preise identisch zu denen sind, die Sie direkt bei OpenAI zahlen würden. Diese Transparenz ermöglicht es den Nutzern, ihr Budget genau zu planen, ohne Überraschungskosten.
Output-Token sind pro Token viermal teurer als Input-Token (0,60 USD vs. 0,15 USD pro Million). Bei Aufgaben, die lange Antworten generieren, wie detaillierte Zusammenfassungen oder Codegenerierung, können die Output-Kosten dominieren. Benutzer können die Nutzung von Output-Token über den Parameter max_tokens und durch die Erstellung von Prompts steuern, die prägnante Antworten hervorrufen. Umgekehrt entstehen bei Aufgaben mit großen Eingaben (z. B. Verarbeitung langer Dokumente mit vielen Bildern) Input-Kosten. Das große 128k-Kontextfenster macht es einfach, umfangreichen Kontext einzubeziehen, aber das geht zum Preis pro Input-Token. Die Optimierung des Gleichgewichts zwischen Eingabe- und Ausgabelänge ist der Schlüssel zur Steuerung der Gesamtkosten.
OrcaRouter bietet derzeit keine integrierte Caching-Funktion für GPT-4o-mini-Anfragen über das hinaus, was OpenAI auf API-Ebene bereitstellt. Es gibt keine Mengenrabatte oder reservierte Kapazitäten über OrcaRouter; die Preisgestaltung erfolgt streng nach dem Pay-as-you-go-Modell zum OpenAI-Anbieterkurs. Die Nutzer sind für die Implementierung eigener Caching-Strategien (z. B. auf Anwendungsebene) verantwortlich, um doppelte API-Aufrufe zu reduzieren. Die Nullaufschlagsrichtlinie bedeutet, dass etwaige zukünftige Preisänderungen durch OpenAI automatisch übernommen werden. Für extrem hochvolumige Anwendungsfälle könnten direkte Enterprise-Vereinbarungen mit OpenAI bessere Konditionen bieten, aber über OrcaRouter kann die Einfachheit eines einzelnen API-Schlüssels und einer einheitlichen Abrechnung dennoch vorteilhaft sein.
Von GPT-4o-mini verarbeitete Bilder werden basierend auf ihrer Auflösung und ihrem Detailgrad in Token umgewandelt. OpenAI verwendet einen Token-Berechnungsalgorithmus, der sowohl Breite als auch Höhe berücksichtigt; ein typisches 1024x1024-Bild mit hohem Detailgrad kann beispielsweise rund 2.000–3.000 Eingabe-Token kosten. Da Eingabe-Token mit 0,15 $ pro Million abgerechnet werden, sind die Kosten pro Bild sehr gering (in der Regel unter einem Cent). Allerdings können sich die Kosten summieren, wenn viele Bilder in einer einzigen Anfrage verarbeitet werden. Benutzer können Kosten kontrollieren, indem sie den Detailgrad `low` verwenden (etwa 85 Token pro Bild), wenn keine hohe Bildtreue erforderlich ist. Überprüfen Sie stets die in der API-Antwort angegebenen Token, um die Bildkosten zu verstehen.
Legen Sie Ihre API-Basis-URL auf https://api.orcarouter.ai/v1 fest und verwenden Sie die Modell-ID "openai/gpt-4o-mini-2024-07-18". Die API folgt dem Standard-OpenAI-Chat-Completions-Format. Zum Beispiel in Python: openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Alle Parameter wie temperature, top_p, max_tokens, stream und stop-Sequenzen werden wie in der ursprünglichen OpenAI-API unterstützt. Antworten enthalten Standardfelder wie id, choices, usage mit Token-Zählungen.
Für deterministische Ausgaben setzen Sie temperature=0 und top_p=1. Für kreative Aufgaben kann eine Temperatur um 0,8–1,2 angemessen sein. Max_tokens steuert die Länge der Antwort; der Standardwert ist 16.384. Um die Ausgabekosten zu reduzieren, setzen Sie max_tokens nach Ihren Bedürfnissen. Bei Verwendung multimodaler Eingaben strukturieren Sie Nachrichten als Array von Inhaltsteilen: [{"type":"text","text":"Beschreibe dies:"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Für die Dateiverarbeitung fügen Sie den Dateiinhalt als Text oder base64 hinzu. Der stop-Parameter kann verwendet werden, um die Generierung bei benutzerdefinierten Sequenzen anzuhalten. Stream=True ermöglicht die Echtzeit-Token-Auslieferung.
Migration erfordert drei einfache Änderungen: Setzen Sie die base_url auf https://api.orcarouter.ai/v1, ersetzen Sie Ihren API-Key durch Ihren OrcaRouter-API-Key und ändern Sie die Modell-ID auf "openai/gpt-4o-mini-2024-07-18". Es sollten keine weiteren Codeänderungen erforderlich sein, wenn Sie die OpenAI Python/Node.js-Bibliotheken oder einen HTTP-Client verwenden, der dem Standard-Chat-Completions-Format folgt. Die Antwortstruktur ist identisch. Beachten Sie, dass OrcaRouter Ihre Anfragen nicht anders drosselt als OpenAI; die gleichen Ratenbegrenzungen gemäß Ihrem OpenAI-Kontotarif gelten, aber Sie verwalten die Schlüssel über OrcaRouter. Testen Sie mit einer kleinen Anfrage, um Token-Anzahl und Latenz zu überprüfen.
Geben Sie Ihren OrcaRouter-API-Schlüssel im Authorization-Header an: Authorization: Bearer <your-key>. Die API gibt standardmäßige HTTP-Statuscodes zurück: 200 für Erfolg, 400 für fehlerhafte Anfrage (z. B. ungültige Parameter), 401 für nicht autorisiert (falscher API-Schlüssel), 429 für Ratenbegrenzung und 500 für Serverfehler. Fehlerantworten enthalten einen JSON-Body mit einem Fehlerobjekt, das eine Nachricht und einen Typ enthält. Es wird empfohlen, Wiederholungen mit exponentiellem Backoff für 429- und 5xx-Fehler zu implementieren. OrcaRouter ändert keine Fehlerantworten von OpenAI, daher werden dieselben Fehlermeldungen angezeigt, die Sie mit der direkten API sehen.
GPT-4o-mini ist deutlich leistungsfähiger als GPT-3.5-Turbo in Bezug auf logisches Denken, Mathematik und Befolgung von Anweisungen, wie durch seinen MATH-500-Score von 78.9 im Vergleich zu GPT-3.5-Turbos typischem Score von etwa 30-40 gezeigt wird. Es unterstützt auch multimodale Eingaben (Bilder und Dateien), was GPT-3.5-Turbo nicht tut. Das Kontextfenster ist größer: 128k gegenüber 16k. Preise: GPT-4o-mini ($0.15/$0.60 pro Million Tokens) ist etwas teurer als GPT-3.5-Turbo ($0.50/$1.50 für die 16k-Version? Eigentlich ist GPT-3.5-Turbo 0125 bei $0.50/$1.50 pro Million? Halt, standard GPT-3.5-Turbo kostet $1.50/$2.00 pro Million? Ich bleibe bei den gegebenen Fakten: Die Preise von GPT-4o-mini sind angegeben. Vergleichen Sie qualitativ: GPT-4o-mini bietet eine bessere Leistung zu etwas höheren Kosten als GPT-3.5-Turbo, jedoch mit multimodaler Fähigkeit.
GPT-4o-mini ist eine kleinere, kostengünstigere Version von GPT-4o. Während beide multimodale Fähigkeiten und die gleiche Kontextfenstergröße (128k Tokens) teilen, erzielt GPT-4o höhere Bewertungsergebnisse bei Benchmarks wie MMLU und MATH. GPT-4o-minis MATH-500-Wert von 78,9 ist niedriger als der von GPT-4o berichtete Wert von ungefähr 90–95. Die Preisgestaltung ist deutlich günstiger: GPT-4o-mini (0,15 $/0,60 $) gegenüber GPT-4o (2,50 $/10,00 $ pro Million Tokens). Für Anwendungen, bei denen maximale Genauigkeit bei komplexen Denkaufgaben entscheidend ist, ist GPT-4o vorzuziehen. Für Aufgaben mit hohem Durchsatz und Kostenempfindlichkeit, bei denen eine moderate Genauigkeit akzeptabel ist, bietet GPT-4o-mini erhebliche Einsparungen.
Open-Source-Modelle wie Llama 3 8B und 70B bieten den Vorteil des Self-Hostings zu null Kosten pro Token, erfordern jedoch Infrastruktur und Fachkenntnisse. GPT-4o-mini über OrcaRouter bietet serverlosen Zugang ohne Vorabkosten und automatische Skalierung. In Benchmarks ist der MATH-500-Score von GPT-4o-mini mit 78,9 wettbewerbsfähig im Vergleich zu Llama 3 8B (etwa 30–40) und näher an Llama 3 70B (etwa 60–70). GPT-4o-mini unterstützt zudem nativ Bilder, was die meisten Open-Source-Modelle nicht tun. Der Kompromiss: Open-Source-Modelle bieten Datenschutz (kein externer API-Aufruf) und geringere Latenz, falls Inferenzhardware verfügbar ist. GPT-4o-mini bietet Benutzerfreundlichkeit und Multimodalfähigkeiten zu einem niedrigen Preis pro Token.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Eingabe / 1M Tokens | $0.150 |
| Ausgabe / 1M Tokens | $0.600 |
| Cache-Lesen / 1M | $0.075 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Öffnen @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18