GPT-4o mini Search Preview ist ein spezialisiertes Modell für die Websuche in Chat Completions. Es wurde trainiert, um Websuchanfragen zu verstehen und auszuführen.
GPT-4o-mini Search Preview ist eine Variante von OpenAIs GPT-4o-mini-Modell, die integrierte Websuchfunktionen enthält. Es wurde entwickelt, um Antworten zu liefern, die Echtzeitinformationen aus dem…
Das Modell kombiniert allgemeines Sprachverständnis und -generierung mit einer Live-Websuche. Es kann Fragen zu aktuellen Ereignissen beantworten, Daten von bestimmten Websites abrufen und Informationen aus mehreren Online-Quellen synthetisieren. Es behält die typischen GPT-4o-mini-Fähigkeiten bei: Textzusammenfassung, Übersetzung, Codegenerierung, logisches Denken und kreatives Schreiben. Die Suchvorschau ermöglicht den Zugriff auf aktuelle Nachrichten, Aktienkurse, Wetter, Produktdetails und andere zeitkritische Daten. Da das Modell jedoch auf Geschwindigkeit und Effizienz ausgelegt ist, kann seine Argumentationstiefe geringer sein als die des vollständigen GPT-4o-Modells.
Das Modell zeichnet sich in Szenarien aus, in denen Antworten von sich ändernden oder aktuellen Informationen abhängen. Beispiele hierfür sind Live-Kundendienstmitarbeiter, die den Bestellstatus oder Rückgaberichtlinien prüfen müssen, Content-Tools, die Zusammenfassungen zu Trendthemen erstellen, und Forschungsassistenten, die Fakten aus mehreren Online-Quellen zusammenstellen. Es ist auch nützlich, um Behauptungen anhand aktueller Daten zu überprüfen, wie etwa die Überprüfung der neuesten Ankündigung eines Unternehmens oder eines Sportergebnisses. Aufgrund seiner relativ geringen Kosten und schnellen Antwortzeiten eignet es sich für Anwendungen mit hohem Anfragevolumen, bei denen die Web-Grundlage ein zentrales Merkmal ist.
Wenn Ihre Anwendung keine Websuche oder aktuelle Informationen benötigt, ziehen Sie in Betracht, das Basismodell GPT-4o-mini ohne Suchvorschau zu verwenden. Das Basismodell ist sogar noch günstiger (gleiche Preisgestaltung pro Token, aber ohne den Overhead der Suchabfrage) und kann bei reinen Konversationsaufgaben schneller sein. Für sehr einfache Anfragen, die kein breites Weltwissen erfordern, können kleinere Modelle wie GPT-4o-mini (Basis) oder sogar ältere Modelle wie GPT-3.5 Turbo ausreichen. Bewerten Sie, ob die Suchvorschau-Funktion die Kosten für Ihren spezifischen Anwendungsfall rechtfertigt.
Die Suchvorschau wird automatisch vom Modell ausgelöst, wenn es feststellt, dass die Abfrage externe Informationen benötigt. Sie müssen keine Such-APIs konfigurieren oder Suchergebnisse manuell übergeben. Sie können das Verhalten des Modells jedoch beeinflussen, indem Sie es explizit zur Verwendung der Websuche auffordern oder Quellen angeben. Das Modell respektiert die von OpenAI angewandten Standardsicherheits- und Inhaltsfilter. Beachten Sie, dass die Websuche im Vergleich zum Basismodell zu Latenz führen kann, da das Modell auf die Suchergebnisse wartet, bevor es die endgültige Antwort generiert.
Spezifische Benchmark-Ergebnisse für GPT-4o-mini Search Preview wurden nicht als separate Variante veröffentlicht. Basierend auf dem zugrunde liegenden GPT-4o-mini wird jedoch erwartet, dass dieses Modell bei Standard-NLP-Benchmarks wie MMLU, HellaSwag und GSM8K gute Leistungen erbringt, jedoch wahrscheinlich mit geringerer Genauigkeit als das vollständige GPT-4o. Die Suchvorschau-Funktion kann die Leistung bei Aufgaben verbessern, die aktuelle Kenntnisse erfordern (z. B. Wissensfragen zu aktuellen Ereignissen), ändert jedoch nicht die zugrunde liegenden Denkfähigkeiten des Modells. Für die faktische Genauigkeit ist das Modell auf die Qualität und Aktualität der abgerufenen Webquellen angewiesen.
GPT-4o-mini Search Preview ist für niedrige Latenz im Vergleich zu GPT-4o ausgelegt. Das Basismodell GPT-4o-mini ist für schnelle Inferenz bekannt, und die Suchvorschau fügt zusätzliche Zeit für die Websuche hinzu. Die gesamte Antwortzeit hängt von Faktoren wie Netzwerklatenz, der Anzahl der abgerufenen Suchergebnisse und der Länge des Kontexts ab. Bei typischer Nutzung werden Antworten innerhalb weniger Sekunden generiert. Für Anwendungen, die absolute Minimallatenz erfordern, wäre das Basismodell GPT-4o-mini (ohne Suche) schneller. Die API von OrcaRouter unterstützt Streaming, um Token bereits während der Generierung anzuzeigen.
Stärken: Das Modell liefert aktuelle Informationen ohne separate Suchintegration, hat ein großes Kontextfenster (128k Tokens) und ist für hohe Nutzungsvolumen kosteneffizient. Einschränkungen: Es akzeptiert nur Text; es kann manchmal unvollständige oder irrelevante Webinhalte abrufen; seine Argumentationstiefe ist geringer als die von GPT-4o; und die Suchvorschau kann die Latenz erhöhen. Zusätzlich zitiert das Modell nicht immer explizit Quellen, daher sollten Nutzer kritische Informationen überprüfen. Es ist nicht für Aufgaben wie multimodales Verständnis, fortgeschrittene Mathematik oder komplexes Chain-of-Thought-Denken ausgelegt, bei denen GPT-4o besser abschneidet.
OrcaRouter berechnet GPT-4o-mini Search Preview zum Anbieterpreis ohne Aufschlag: $0.15 pro Million Input-Token und $0.60 pro Million Output-Token. Das bedeutet, Sie zahlen genau das, was OpenAI verlangt, ohne zusätzliche Gebühren. Die Preisgestaltung erfolgt pro Token, wobei Kontext-Token als Input und generierte Token als Output gezählt werden. Das Modell verwendet das standardmäßige OpenAI-Tokenisierungsschema. Für die Search Preview-Funktion selbst fallen keine zusätzlichen Kosten an; die Kosten sind die gleichen wie für das Basis-GPT-4o-mini, trotz des zusätzlichen Webabrufs.
Im Vergleich zu GPT-4o (das $2,50 pro Million Input-Token und $10 pro Million Output-Token kostet), ist GPT-4o-mini Search Preview deutlich günstiger – etwa 16-mal günstiger für Input und 16,6-mal günstiger für Output. Dies macht es zu einem starken Kandidaten für Anwendungen, bei denen die Kosten pro Abfrage wichtig sind, insbesondere wenn Sie Websuche benötigen. Allerdings kostet die Basisversion GPT-4o-mini (ohne Search Preview) gleich viel pro Token, verfügt aber nicht über die Suchfunktion. Wenn keine Suche benötigt wird, könnte man die geringfügig höhere Latenz einsparen, aber die Kosten pro Token sind identisch.
OrcaRouter unterstützt möglicherweise das Caching von Suchergebnissen oder Modellantworten, abhängig von der Konfiguration. Falls aktiviert, können wiederholte Abfragen nach denselben Informationen aus dem Cache bedient werden, was sowohl Latenz als auch Token-Nutzung reduziert. Allerdings variieren die Cache-Richtlinien. Für aktuellste Informationen führt das Modell in der Regel für jede Anfrage eine frische Websuche durch. Um Kosten zu minimieren, erwägen Sie die Verwendung des Basis GPT-4o-mini, wenn Ihre Abfragen keine Webdaten benötigen. Überwachen Sie stets Ihren Token-Verbrauch über das OrcaRouter-Dashboard, um Ihre Ausgaben zu verstehen.
OrcaRouter gibt die genauen Preise von OpenAI ohne Aufschlag weiter. Die Abrechnung erfolgt auf Basis der Token-Anzahl, die vom Anbieter gemeldet wird. Es gibt keine Einrichtungsgebühren, monatlichen Mindestbeträge oder zusätzliche Kosten für das API-Gateway. Sie zahlen nur für die von Ihnen genutzten Token zu den angegebenen Tarifen. Für GPT-4o-mini Search Preview bedeutet das $0.15 pro einer Million Eingabe-Token und $0.60 pro einer Million Ausgabe-Token. Stellen Sie sicher, dass Ihr Konto bei OrcaRouter eingerichtet ist, um auf das Modell zu diesen Tarifen zuzugreifen.
Um das Modell zu verwenden, senden Sie eine POST-Anfrage an https://api.orcarouter.ai/v1/chat/completions mit dem model-Feld auf "openai/gpt-4o-mini-search-preview" gesetzt. Dieser Endpunkt ist OpenAI-kompatibel, sodass Sie jedes OpenAI SDK oder jeden Client verwenden können, indem Sie die Basis-URL und den API-Schlüssel ändern. Beispiel curl: curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "What is the current weather in London?"}] }' Die Suchvorschau wird automatisch ausgelöst.
Die API unterstützt alle standardmäßigen OpenAI Chat-Completion-Parameter: temperature (0-2, Standard 1), top_p, n, stream, stop, max_tokens (bis zu 16384), presence_penalty, frequency_penalty und logit_bias. Das Modell respektiert diese Parameter. Für die Suchvorschau sind keine zusätzlichen Parameter erforderlich; das Modell entscheidet selbst, wann es suchen soll. Sie können es jedoch dazu auffordern, explizit eine Websuche anzufordern (z. B. „Suche im Web nach den neuesten Nachrichten über …“), um die Abrufung zu fördern. Beachten Sie, dass das Modell möglicherweise dennoch keine Suche durchführt, wenn es internes Wissen für ausreichend hält.
Wenn Sie bereits die OpenAI-API verwenden, ist die Migration zu OrcaRouter unkompliziert: Ändern Sie die Basis-URL von https://api.openai.com/v1 zu https://api.orcarouter.ai/v1 und ersetzen Sie Ihren API-Schlüssel durch einen von OrcaRouter. Die Modell-ID lautet "openai/gpt-4o-mini-search-preview". Alle anderen Anfragekörper und Antwortformate bleiben identisch. Sie können jede OpenAI-Clientbibliothek (Python, Node.js usw.) ohne Änderungen verwenden. OrcaRouter unterstützt auch Streaming, Funktionsaufrufe und andere erweiterte Funktionen, die mit der OpenAI-API kompatibel sind.
Um Antworten zu streamen, setzen Sie "stream": true in Ihrer Anfrage. OrcaRouter gibt Daten als Server-Sent Events zurück, identisch mit dem Streaming-Format von OpenAI. Jedes Ereignis enthält ein Delta der Antwort. Streaming ist besonders nützlich für benutzerorientierte Anwendungen, um Tokens während ihrer Erstellung anzuzeigen. Bei Suchvorschauabfragen kann das Modell zunächst anzeigen, dass es sucht, bevor es die endgültige Antwort ausgibt. Der Stream wird diese Zwischentokens enthalten. Stellen Sie sicher, dass Ihr Client Teilaktualisierungen ordnungsgemäß verarbeiten kann.
GPT-4o-mini Search Preview ist eine kleinere, schnellere und günstigere Variante von GPT-4o mit zusätzlichen Websuchfunktionen. Während GPT-4o über überlegene Argumentationsfähigkeiten, eine größere Wissensbasis (bis zu seinem Trainingsdatum) und multimodale Unterstützung (Bilder, Audio) verfügt, ist dieses Modell rein textbasiert und nutzt Websuche, um sein begrenztes Trainingswissen zu erweitern. Für Aufgaben, die tiefgehende Analysen oder komplexe Mathematik erfordern, ist GPT-4o besser geeignet. Für kostenbewusste Anwendungen, die aktuelle Informationen benötigen, ist GPT-4o-mini Search Preview eine starke Alternative. Der Preis ist etwa 16-mal günstiger.
Das Basismodell GPT-4o-mini umfasst keine Websuche; es stützt sich ausschließlich auf seine Trainingsdaten, deren Stichtag Ende 2023 liegt. GPT-4o-mini Search Preview bietet die Möglichkeit, aktuelle Informationen aus dem Internet abzurufen. Beide Modelle haben denselben Kontextrahmen (128k Token), maximale Ausgabe (16384) und dasselbe Token-basierte Preisschema. Die Suchvorschau-Variante kann aufgrund der Webabfrage eine etwas höhere Latenz aufweisen. Wenn Ihre Anwendung keine Live-Daten benötigt, ist das Basismodell funktional identisch und möglicherweise schneller. Beide Modelle werden über OrcaRouter mit unterschiedlichen Modell-IDs angesprochen.
Weitere suchfähige Modelle sind Gemini mit Google Search Grounding oder Modelle, die plugin-basierte Websuche verwenden. GPT-4o-mini Search Preview bietet native Integration ohne externe Plugins. Es ist generell günstiger als größere suchfähige Modelle (wie GPT-4 mit Browsing). Allerdings kann es im Vergleich zu dedizierten Such-APIs weniger umfassend in den Suchergebnissen sein. Für hochgenaues Webwissen sollten Sie in Betracht ziehen, dies mit einer faktenbasierten Such-API zu ergänzen und die Ergebnisse einem Basismodell zuzuführen. Dieses Modell eignet sich am besten für einfache bis mäßig komplexe Abfragen, die von aktuellen Webdaten profitieren.
Wählen Sie dieses Modell, wenn Sie Folgendes benötigen: (1) niedrige Kosten pro Abfrage, (2) automatische Websuche ohne benutzerdefinierte Integration, (3) schnelle Antwortzeiten und (4) ein großes Kontextfenster. Wählen Sie eine vollständige GPT-4o-Variante, wenn Sie multimodale Eingaben oder tiefere Überlegungen benötigen. Wählen Sie das Basis-GPT-4o-mini, wenn Sie keine Websuche benötigen und etwas schnellere Antworten wünschen. Wählen Sie eine dedizierte Such-API plus ein kleines Modell, wenn Sie eine fein granulare Kontrolle über Suchquellen und -ergebnisse benötigen. Dieses Modell eignet sich am besten als direkter Ersatz für GPT-3.5 oder GPT-4o-mini in Anwendungen, die von Live-Informationen profitieren würden.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Eingabe / 1M Tokens | $0.150 |
| Ausgabe / 1M Tokens | $0.600 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/openai/gpt-4o-mini-search-previewÖffnen @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview