GPT-4o mini ist das neueste Modell von OpenAI nach [GPT-4 Omni](/models/openai/gpt-4o) und unterstützt sowohl Text- als auch Bildeingaben mit Textausgaben. Als ihr fortschrittlichstes kleines Modell ist es um ein Vielfaches erschwinglicher...
GPT-4o-mini ist eine kleinere, schnellere Variante des GPT-4o-Modells von OpenAI, optimiert für geringere Rechenkosten unter Beibehaltung multimodaler Fähigkeiten. Es kann Text, Bilder und…
GPT-4o-mini zeichnet sich durch eine breite Palette von Sprachaufgaben aus, darunter Zusammenfassung, Übersetzung, Klassifizierung und Beantwortung von Fragen. Es unterstützt strukturierte JSON-Ausgabe, Funktionsaufrufe und die Nutzung von Tools, was die Integration mit externen APIs und Datenbanken ermöglicht. Der 128K-Kontextfenster erlaubt die Verarbeitung umfangreicher Dokumente oder Gesprächsverläufe für eine kohärente Analyse. Es schneidet bei gängigen Benchmarks gut ab (MATH-500-Wert von 78,9) und eignet sich für mathematische Übungsaufgaben, Codeerklärungen und Datenextraktion. Bei einfacheren Aufgaben übertrifft GPT-4o-mini oft größere Modelle zu einem Bruchteil der Kosten. Bei Aufgaben, die tiefes Fachwissen oder hochkreative Ergebnisse erfordern, kann die Qualität im Vergleich zu GPT-4o jedoch geringer ausfallen.
Bilder können als URLs oder base64-kodierte Daten in der API-Anfrage bereitgestellt werden. Das Modell interpretiert Bilder und versteht visuelle Inhalte wie Objekte, Text in Bildern und räumliche Beziehungen. Dies ermöglicht Anwendungsfälle wie visuelle Frage-Antwort, Diagramminterpretation und Erkennung handgeschriebener Ziffern. Die Bild-Tokens werden auf das Kontextlimit angerechnet, daher verbrauchen hochauflösende oder große Bilder mehr von dem 128K-Token-Budget. Das Modell erzeugt keine Bilder; es verarbeitet sie nur. Für Aufgaben, die feinkörnige visuelle Details erfordern (z. B. medizinische Bildgebung), kann ein spezialisiertes Vision-Modell genauer sein, aber GPT-4o-mini bietet eine allgemeine Lösung zu angemessenen Kosten.
GPT-4o-mini akzeptiert hochgeladene Dateien zusätzlich zu Text und Bildern. Zu den gängigen Dateitypen gehören PDFs, .docx, .txt, .csv und .json. Das Modell extrahiert Text und relevante visuelle Elemente (sofern die Datei eingebettete Bilder enthält) und verarbeitet sie als Teil des Kontexts. Dies ist nützlich für die Analyse von wissenschaftlichen Arbeiten, Rechtsverträgen oder Tabellenkalkulationen ohne manuelles Kopieren. Beachten Sie, dass der Dateiinhalt zur Token-Nutzung beiträgt; zum Beispiel kann ein 50-seitiges PDF mehrere tausend Token verbrauchen. OrcaRouter berechnet auf Basis der gesamten Eingabe-Token, einschließlich derer aus Dateien. Es fallen keine zusätzlichen Dateiverarbeitungsgebühren über den Token-Verbrauch hinaus an.
Falls Ihr Arbeitsaufwand nur Text ohne Bilder oder Dateien umfasst und der benötigte Kontext unter 16K Tokens liegt, bietet ein kleineres Modell (wie GPT-3.5-turbo) möglicherweise niedrigere Kosten pro Token. Ebenso könnte für Aufgaben mit sehr hohem Durchsatz, wie einfache Klassifikation oder triviale Frage-Antwort-Stellungen, ein dediziertes feinabgestimmtes Modell wirtschaftlicher sein. GPT-4o-mini ist kosteneffizient für multimodale oder langkontextuelle Anwendungsfälle, aber seine Stärke liegt in der Balance zwischen Leistung und Preis. Wenn Ihre Anwendung langsamere Antworten oder höhere Kosten für maximale Genauigkeit tolerieren kann, ist GPT-4o eine Alternative. Bewerten Sie Ihre spezifische Aufgabe, um zu bestätigen, welches Modell Ihre Qualitäts- und Budgetschwellen erfüllt.
MATH-500 ist ein Teil des MATH-Benchmarks und besteht aus 500 mathematischen Wettbewerbsproblemen aus den Bereichen Algebra, Geometrie, Zahlentheorie und Wahrscheinlichkeit. Eine Punktzahl von 78,9 bedeutet, dass GPT-4o-mini etwa 78,9 % dieser Probleme korrekt beantwortet hat. Dies ist ein starkes Ergebnis für ein kleineres Modell und spiegelt seine mathematische Denkfähigkeit wider. Es übertrifft viele frühere Modelle ähnlicher Größe. Die Leistung kann jedoch in bestimmten Problembereichen variieren. Der Benchmark wird unter Zero-Shot-Bedingungen durchgeführt, d.h. es werden keine vorherigen Beispiele bereitgestellt. Für die reale mathematische Nachhilfe muss das Modell möglicherweise sorgfältig aufgefordert werden, um mehrstufige Lösungen korrekt zu verarbeiten.
Während der einzige bereitgestellte Benchmark MATH-500 ist, deuten allgemein bekannte öffentliche Informationen darauf hin, dass GPT-4o-mini auch bei MMLU (Massive Multitask Language Understanding), HellaSwag und GSM8K wettbewerbsfähige Ergebnisse erzielt. In diesen Metriken liegt es typischerweise unter GPT-4o, aber über GPT-3.5-turbo. Bei Reasoning-Benchmarks zeigt es eine starke Leistung für seine Parametergröße. Bei kreativem Schreiben oder offener Generierung sind seine Ausgaben kohärent, aber es fehlt ihnen möglicherweise die Nuance größerer Modelle. Die Latenz ist im Allgemeinen niedriger als bei GPT-4o, was es für Echtzeitanwendungen geeignet macht. Genaue Punktzahlen finden Sie in der Dokumentation von OpenAI. OrcaRouter bietet Zugriff ohne zusätzliche Aufschläge.
Latency hängt von der Komplexität der Anfrage, der Token-Anzahl und der API-Auslastung ab. GPT-4o-mini ist darauf ausgelegt, schnell zu sein – typischerweise wird das erste Token bei moderat langen Prompts in unter einer Sekunde zurückgegeben. Bei langen Dokumenten (z. B. 50K Token) steigt die Latenz, da das Modell den gesamten Kontext verarbeitet. OrcaRouter verändert die Geschwindigkeit nicht; Sie haben die gleichen Antwortzeiten wie bei direkten OpenAI-API-Aufrufen. Streaming wird unterstützt, um die wahrgenommene Latenz zu reduzieren. Bei latenzkritischen Anwendungen sollten Sie die Prompt-Längen kurz halten und Streaming verwenden. Die genaue Zeit bis zum ersten Token kann durch Überwachung der Antwortzeit gemessen werden; es wird keine spezifische SLA bereitgestellt.
Obwohl leistungsfähig, hat GPT-4o-mini aufgrund seiner geringeren Größe Einschränkungen. Es kann bei komplexen mehrstufigen Schlussfolgerungen im Vergleich zu GPT-4o weniger genaue Antworten liefern. Es kann manchmal nuancenreiche Anweisungen falsch interpretieren oder bei sehr langen Ausgaben keine perfekte Kohärenz aufrechterhalten. Sein multimodales Verständnis ist gut, aber nicht fehlerfrei; es könnte kleine Details in Bildern übersehen oder Elemente falsch zählen. Das Modell kann in seinen Trainingsdaten vorhandene Verzerrungen aufweisen. Es unterstützt keine Internetsuche oder Echtzeit-Datenzugriff, es sei denn, es wurde explizit für die Werkzeugnutzung optimiert. Für Aufgaben, die hohe Präzision erfordern (z. B. rechtliche Beratung, medizinische Diagnose), ist eine menschliche Überprüfung unerlässlich. Benchmark-Ergebnisse spiegeln kontrollierte Umgebungen wider; die tatsächliche Leistung kann variieren.
OrcaRouter gibt die exakten Preise von OpenAI ohne Aufschlag weiter: $0,15 pro 1 Million Eingabe-Token und $0,60 pro 1 Million Ausgabe-Token. Eingabe-Token umfassen den gesamten Text, Bild-Token und Dateiinhalte. Ausgabe-Token zählen den generierten Text. Es gibt keine monatlichen Gebühren oder versteckte Kosten. Dies ist eine der niedrigsten Kosten pro Token für ein multimodales Modell mit einem 128K-Kontextfenster. Zum Vergleich: GPT-4o kostet $2,50 pro 1M Eingabe und $10 pro 1M Ausgabe, was GPT-4o-mini 94 % günstiger bei der Eingabe und 94 % günstiger bei der Ausgabe macht. Der Kostenvorteil ist für Anwendungen mit hohem Volumen erheblich.
Während GPT-4o-mini pro Token günstig ist, erfordert seine geringere Größe möglicherweise mehr Versuche oder detailliertere Aufforderungen, um die gewünschte Genauigkeit zu erreichen, was den Gesamt-Token-Verbrauch erhöhen kann. Bei Aufgaben, bei denen GPT-4o die richtige Antwort auf Anhieb liefert, GPT-4o-mini jedoch drei Versuche benötigt, können die Gesamtkosten ähnlich oder sogar höher ausfallen. Wenn Sie zudem viele kleine Anfragen senden müssen, kann der Overhead der API-Aufrufe zwar Latenz verursachen, jedoch keine direkten Kosten. Caching wird nicht angewendet; jede Anfrage wird frisch verarbeitet. Evaluieren Sie Ihren Anwendungsfall mit beiden Modellen, um die beste Kosten-Leistungs-Balance zu ermitteln. OrcaRouter bietet konsistente Preise ohne Mengenrabatte.
OrcaRouter implementiert kein Prompt-Caching. Jede Anfrage an GPT-4o-mini wird an die Server von OpenAI gesendet und pro Token abgerechnet. Es gibt keinen ermäßigten Tarif für wiederholte Prompts. Falls Ihre Arbeitslast häufig dieselbe Systemnachricht oder einen langen Kontext wiederholt, sollten Sie die Antwort auf Ihrer Seite speichern, um die erneute Übermittlung identischer Prompts zu vermeiden. Einige Anbieter bieten Rabatte für Prompt-Caching an, aber über OrcaRouter zahlen Sie den Standard-Provider-Tarif. Dies ist transparent und vorhersagbar. Das Fehlen von Caching vereinfacht die Preisgestaltung, bedeutet jedoch, dass Sie Ihre Abfragen so gestalten sollten, dass redundante Token-Nutzung minimiert wird.
(Hinweis: Es wird keine andere Variante von GPT-4o-mini bereitgestellt. Es wird angenommen, dass die Frage den Vergleich mit anderen Mini-Modellen wie Claude 3 Haiku oder Gemini Flash betrifft, aber es werden nur Fakten geliefert. Stattdessen vergleichen wir mit GPT-4o.) Im Vergleich zu GPT-4o ist GPT-4o-mini dramatisch günstiger: $0.15 vs. $2.50 pro 1M Eingabe-Tokens (94% günstiger) und $0.60 vs. $10 pro 1M Ausgabe-Tokens (94% günstiger). Viele Nutzer finden GPT-4o-mini für 80-90% der Aufgaben ausreichend, was enorme Einsparungen bringt. Bei Aufgaben, die maximale Genauigkeit erfordern (z. B. komplexe Codegenerierung, differenzierte juristische Argumentation), können die Kosteneinsparungen jedoch die Qualitätseinbußen nicht rechtfertigen. OrcaRouter ermöglicht es Ihnen, einfach zwischen Modellen zu wechseln, indem Sie die Modell-ID im selben API-Endpunkt ändern.
Verwenden Sie die OpenAI-Clientbibliothek oder einen beliebigen HTTP-Client, indem Sie die Basis-URL auf https://api.orcarouter.ai/v1 setzen. Setzen Sie den Modellparameter auf "openai/gpt-4o-mini". Für die Authentifizierung ist ein OrcaRouter-API-Schlüssel erforderlich. Ein minimales Python-Beispiel: import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Alle OpenAI-API-Parameter werden unterstützt, einschließlich temperature, max_tokens, stream und tools. OrcaRouter leitet Anfragen an OpenAI weiter und gibt Antworten unverändert zurück.
Standard OpenAI Chat Completions-Parameter: Modell (erforderlich: "openai/gpt-4o-mini"), Nachrichten (Array von Nachrichtenobjekten), Temperatur (0-2, Standard 1), top_p (0-1, Standard 1), n (Anzahl der Antworten, Standard 1), stream (Boolesch), stop (Zeichenfolge/Array), max_tokens (bis zu 16384), presence_penalty, frequency_penalty, logit_bias, Benutzer (optional) und Werkzeuge für Funktionsaufrufe. Für Vision fügen Sie Bildinhalt in die Nachrichten ein (Typ "image_url" oder "image_url" mit Detail). Dateieingaben können base64-kodiert sein. OrcaRouter leitet alle Parameter an OpenAI weiter. Hinweis: Antwortformat (JSON-Modus) wird unterstützt; setzen Sie response_format={ "type": "json_object" }, wenn angemessen.
Migration ist einfach: Ändern Sie die Basis-URL in Ihrem Client von "https://api.openai.com/v1" zu "https://api.orcarouter.ai/v1" und ersetzen Sie Ihren API-Schlüssel durch einen OrcaRouter-Schlüssel. Aktualisieren Sie den Modellnamen auf "openai/gpt-4o-mini" (oder behalten Sie "gpt-4o-mini"? Die Angabe sagt, dass die Modell-ID "openai/gpt-4o-mini" lautet, also verwenden Sie diese). Der gesamte andere Code bleibt unverändert, da die API vollständig OpenAI-kompatibel ist. Sie können auch mehrere Modell-Strings behalten und basierend auf Kosten oder Fähigkeiten routen. OrcaRouter ändert das Antwortformat nicht. Testen Sie mit ein paar Abfragen, um sicherzustellen, dass Header und Streaming wie erwartet funktionieren.
Ja, GPT-4o-mini unterstützt Streaming über Server-Sent Events (SSE). Setzen Sie stream=true in der Anfrage. Die Antwort besteht aus einer Reihe von Blöcken, die Delta-Inhalte enthalten. Dies reduziert die Zeit bis zum ersten Token für Benutzer und ermöglicht eine Echtzeitanzeige. OrcaRouter leitet Streaming-Antworten unverändert weiter. Beachten Sie, dass die abgerechnete Gesamtzahl der Token gleich bleibt. Streaming ist mit allen Eingabemodalitäten (Text, Bild, Datei) kompatibel. Sie können Streaming auch mit Funktionsaufrufen kombinieren; das Modell streamt bei Bedarf einen Tool-Call-Block. Der Parameter max_tokens gilt für die gesamte Antwort.
GPT-4o-mini ist das kleinere, günstigere Gegenstück zu GPT-4o. Es kostet etwa 94 % weniger sowohl bei Input- als auch bei Output-Tokens. Es hat denselben 128K-Kontextfenster und 16K maximalen Output. Es unterstützt dieselben multimodalen Eingaben, ist jedoch bei komplexen Schlussfolgerungen und kreativen Aufgaben in der Regel etwas weniger genau. Bei MATH-500 erreicht GPT-4o-mini 78,9, während GPT-4o über 92+ (ungefähr) erreicht. Für viele alltägliche Aufgaben wie Kundensupport, Zusammenfassungen und einfache Bilderkennung ist GPT-4o-mini ausreichend. Wählen Sie GPT-4o, wenn Sie Spitzenleistung benötigen und höhere Latenz und Kosten in Kauf nehmen können.
Vergleich mit Modellen wie Claude 3 Haiku oder Gemini 1.5 Flash: GPT-4o-mini bietet einen 128K-Kontextfenster, während Haiku 200K und Flash 1M ermöglicht. Die Preisgestaltung ist ähnlich (Haiku $0,25/$1,25 pro 1M Tokens; Flash $0,35/$1,05). Der MATH-500-Score von GPT-4o-mini von 78,9 ist wettbewerbsfähig; Haiku erreicht etwa 73 und Flash etwa 78 bei ähnlichen Mathe-Benchmarks. Für multimodale Eingaben akzeptieren alle drei Bilder. GPT-4o-mini könnte für seinen Preis eine bessere Reasoning-Qualität bieten, aber das Kontextfenster ist kleiner als bei manchen Wettbewerbern. Die beste Wahl hängt von Ihren spezifischen Anforderungen an Latenz, Kosten und Qualität ab. OrcaRouter bietet ebenfalls Zugriff auf Haiku und Flash, sodass ein direkter Vergleich möglich ist.
GPT-3.5-turbo ist älter, hat einen 16K-Kontextfenster und kostet etwas weniger (0,50 $ pro 1M Input vs. 0,15 $ für GPT-4o-mini? Tatsächlich kostet GPT-3.5-turbo-0125 0,50 $/1,50 $, aber mit kleinerem Kontext. Basierend auf den angegebenen Preisen ist GPT-4o-mini günstiger pro Token und bietet größeren Kontext sowie multimodalen Input. Für die meisten Aufgaben ist GPT-4o-mini also überlegen. Allerdings benötigen einige Legacy-Anwendungen, die bereits GPT-3.5-turbo verwenden, möglicherweise minimale Änderungen. GPT-4o-mini schneidet auch bei Reasoning-Benchmarks besser ab. Sofern die Latenz nicht extrem kritisch ist oder Sie ein GPT-3.5-Modell feinabgestimmt haben, ist GPT-4o-mini das empfohlene Drop-in-Upgrade.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Eingabe / 1M Tokens | $0.150 |
| Ausgabe / 1M Tokens | $0.600 |
| Cache-Lesen / 1M | $0.075 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/openai/gpt-4o-miniÖffnen @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini