GPT-4o mini Search Preview est un modèle spécialisé pour la recherche web dans Chat Completions. Il est entraîné à comprendre et exécuter des requêtes de recherche web.
GPT-4o-mini Search Preview est une variante du modèle GPT-4o-mini d'OpenAI qui intègre des capacités de recherche web intégrées. Il est conçu pour fournir des réponses intégrant des informations en…
Le modèle combine la compréhension et la génération de langage général avec une recherche web en direct. Il peut répondre à des questions sur des événements récents, extraire des données de sites web spécifiques et synthétiser des informations provenant de multiples sources en ligne. Il conserve les capacités typiques de GPT-4o-mini : résumé de texte, traduction, génération de code, raisonnement logique et écriture créative. L'aperçu de recherche ajoute la capacité d'accéder aux actualités en cours, aux cours des actions, à la météo, aux détails des produits et à d'autres données sensibles au facteur temps. Cependant, le modèle étant optimisé pour la vitesse et l'efficacité, sa profondeur de raisonnement peut être inférieure à celle du modèle GPT-4o complet.
Le modèle excelle dans les scénarios où les réponses dépendent d'informations changeantes ou récentes. Les exemples incluent les agents du service client en direct qui doivent vérifier le statut des commandes ou les politiques de retour, les outils de contenu qui génèrent des résumés de sujets tendance, et les assistants de recherche qui compilent des faits à partir de multiples sources en ligne. Il est également utile pour vérifier des affirmations par rapport à des données actuelles, comme vérifier la dernière annonce d'une entreprise ou un score sportif. En raison de son coût relativement bas et de ses temps de réponse rapides, il convient aux applications avec des volumes de requêtes élevés où l'ancrage web est une fonctionnalité clé.
Si votre application n'a pas besoin de recherche web ou d'informations actualisées, envisagez d'utiliser le modèle de base GPT-4o-mini sans aperçu de recherche. Le modèle de base est encore moins cher (même tarif par token, mais sans le surcoût de la recherche) et peut être plus rapide pour des tâches purement conversationnelles. Pour des requêtes très simples qui ne nécessitent pas une vaste connaissance du monde, des modèles plus petits comme GPT-4o-mini (base) ou même des modèles plus anciens comme GPT-3.5 Turbo peuvent suffire. Évaluez si la fonction d'aperçu de recherche justifie le coût pour votre cas d'utilisation spécifique.
L'aperçu de recherche est déclenché automatiquement par le modèle lorsqu'il estime que la requête nécessite des informations externes. Vous n'avez pas besoin de configurer des API de recherche ni de fournir manuellement les résultats de recherche. Cependant, vous pouvez influencer le comportement du modèle en lui demandant explicitement d'utiliser la recherche web, ou en spécifiant des sources. Le modèle respecte les filtres de sécurité et de contenu standard appliqués par OpenAI. Notez que la recherche web peut entraîner une latence par rapport au modèle de base, car le modèle attend les résultats de recherche avant de générer la réponse finale.
Les scores de référence spécifiques pour GPT-4o-mini Search Preview n'ont pas été publiés publiquement en tant que variante distincte. Cependant, sur la base de GPT-4o-mini de base, ce modèle devrait obtenir de bons résultats sur des benchmarks NLP standard comme MMLU, HellaSwag et GSM8K, mais probablement avec une précision inférieure à celle du GPT-4o complet. La fonctionnalité de prévisualisation de recherche peut améliorer les performances sur les tâches nécessitant des connaissances actuelles (comme les anecdotes sur des événements récents), mais ne modifie pas les capacités de raisonnement du modèle sous-jacent. Pour l'exactitude factuelle, le modèle dépend de la qualité et de l'actualité des sources web qu'il récupère.
GPT-4o-mini Search Preview est conçu pour une faible latence par rapport à GPT-4o. Le GPT-4o-mini de base est connu pour son inférence rapide, et l'aperçu de recherche ajoute un temps supplémentaire pour la récupération web. Le temps de réponse total dépend de facteurs tels que la latence réseau, le nombre de résultats de recherche récupérés et la longueur du contexte. Dans une utilisation typique, les réponses sont générées en quelques secondes. Pour les applications nécessitant une latence absolument minimale, le GPT-4o-mini de base (sans recherche) serait plus rapide. L'API d'OrcaRouter prend en charge le streaming pour commencer à afficher les tokens au fur et à mesure de leur génération.
Points forts : Le modèle fournit des informations à jour sans intégration de recherche séparée, dispose d'une grande fenêtre de contexte (128k tokens) et est rentable pour une utilisation à grand volume. Limitations : Il n'accepte que du texte ; il peut parfois récupérer un contenu web incomplet ou non pertinent ; son raisonnement est moins profond que celui de GPT-4o ; et l'aperçu de recherche peut augmenter la latence. De plus, le modèle peut ne pas toujours citer explicitement les sources, les utilisateurs devraient donc vérifier les informations critiques. Il n'est pas conçu pour des tâches comme la compréhension multimodale, les mathématiques avancées ou le raisonnement en chaîne de pensée complexe, pour lesquelles GPT-4o est plus performant.
OrcaRouter facture GPT-4o-mini Search Preview au tarif du fournisseur sans marge : 0,15 $ par million de jetons d'entrée et 0,60 $ par million de jetons de sortie. Cela signifie que vous payez exactement ce qu'OpenAI facture, sans frais supplémentaires. La tarification est par jeton, les jetons de contexte étant comptés comme entrée et les jetons générés comme sortie. Le modèle utilise le système de tokenisation standard d'OpenAI. Il n'y a pas de frais supplémentaires pour la fonctionnalité de prévisualisation de recherche elle-même ; le coût est le même que celui du GPT-4o-mini de base, malgré la récupération Web supplémentaire.
Par rapport à GPT-4o (qui coûte 2,50 $ par million de tokens en entrée et 10 $ par million de tokens en sortie), GPT-4o-mini Search Preview est nettement moins cher — environ 16 fois moins pour l’entrée et 16,6 fois moins pour la sortie. Cela en fait un bon candidat pour les applications où le coût par requête est important, surtout lorsqu’on a besoin d’une recherche web. Cependant, le GPT-4o-mini de base (sans Search Preview) coûte le même montant par token mais ne dispose pas de la recherche. Si la recherche n’est pas nécessaire, on peut économiser la légère latence supplémentaire, mais le coût par token est identique.
OrcaRouter peut prendre en charge la mise en cache des résultats de recherche ou des réponses du modèle, selon la configuration. Si activée, les requêtes répétées pour les mêmes informations peuvent être servies depuis le cache, réduisant ainsi la latence et l'utilisation des tokens. Cependant, les politiques de mise en cache varient. Pour obtenir les informations les plus récentes, le modèle effectue généralement une nouvelle recherche web à chaque requête. Pour minimiser les coûts, envisagez d'utiliser le GPT-4o-mini de base si vos requêtes ne nécessitent pas de données web. Surveillez toujours votre utilisation des tokens via le tableau de bord d'OrcaRouter pour comprendre vos dépenses.
OrcaRouter répercute le prix exact d'OpenAI sans ajouter aucune marge. La facturation est basée sur le nombre de jetons communiqué par le fournisseur. Il n'y a pas de frais de mise en place, de minimum mensuel ni de frais supplémentaires pour la passerelle API. Vous ne payez que les jetons que vous utilisez, aux tarifs indiqués. Pour GPT-4o-mini Search Preview, cela signifie 0,15 $ par million de jetons d'entrée et 0,60 $ par million de jetons de sortie. Assurez-vous que votre compte est configuré avec OrcaRouter pour accéder au modèle à ces tarifs.
Pour utiliser le modèle, envoyez une requête POST à https://api.orcarouter.ai/v1/chat/completions avec le champ model défini sur "openai/gpt-4o-mini-search-preview". Ce point de terminaison est compatible OpenAI, vous pouvez donc utiliser n'importe quel SDK ou client OpenAI en modifiant l'URL de base et la clé API. Exemple curl : curl https://api.orcarouter.ai/v1/chat/completions \ -H "Authorization: Bearer YOUR_ORCAROUTER_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "openai/gpt-4o-mini-search-preview", "messages": [{"role": "user", "content": "Quel temps fait-il actuellement à Londres ?"}] }' L'aperçu de recherche sera déclenché automatiquement.
L'API prend en charge tous les paramètres standard de complétion de chat d'OpenAI : temperature (0-2, valeur par défaut 1), top_p, n, stream, stop, max_tokens (jusqu'à 16384), presence_penalty, frequency_penalty et logit_bias. Le modèle respecte ces paramètres. Pour l'aperçu de recherche, aucun paramètre supplémentaire n'est nécessaire ; le modèle décide quand rechercher. Cependant, vous pouvez lui demander explicitement d'effectuer une recherche sur le web (par exemple, "Rechercher sur le web pour les dernières nouvelles concernant...") pour encourager la récupération. Notez que le modèle peut toujours choisir de ne pas rechercher s'il estime que ses connaissances internes sont suffisantes.
Si vous utilisez déjà l'API d'OpenAI, migrer vers OrcaRouter est simple : changez l'URL de base de https://api.openai.com/v1 à https://api.orcarouter.ai/v1, et remplacez votre clé API par une clé d'OrcaRouter. L'ID du modèle devient "openai/gpt-4o-mini-search-preview". Tous les autres corps de requête et formats de réponse restent identiques. Vous pouvez utiliser n'importe quelle bibliothèque client OpenAI (Python, Node.js, etc.) sans modification. OrcaRouter prend également en charge le streaming, le function calling et d'autres fonctionnalités avancées compatibles avec l'API d'OpenAI.
Pour diffuser les réponses en continu, définissez "stream": true dans votre requête. OrcaRouter renvoie les données sous forme d'événements envoyés par le serveur, identiques au format de diffusion en continu d'OpenAI. Chaque événement contient un delta de la réponse. La diffusion en continu est particulièrement utile pour les applications destinées aux utilisateurs afin d'afficher les jetons au fur et à mesure de leur génération. Pour les requêtes d'aperçu de recherche, le modèle peut d'abord indiquer qu'il effectue une recherche avant de produire la réponse finale. Le flux inclura ces jetons intermédiaires. Assurez-vous que votre client peut gérer les mises à jour partielles avec élégance.
GPT-4o-mini Search Preview est une variante plus petite, plus rapide et moins coûteuse de GPT-4o, dotée de capacités de recherche web supplémentaires. Alors que GPT-4o offre un raisonnement supérieur, une base de connaissances plus vaste (jusqu'à sa date limite d'entraînement) et un support multimodal (images, audio), ce modèle est limité au texte et s'appuie sur la recherche web pour compenser sa connaissance limitée de l'entraînement. Pour les tâches nécessitant une analyse approfondie ou des calculs complexes, GPT-4o est meilleur. Pour les applications sensibles aux coûts nécessitant des informations actualisées, GPT-4o-mini Search Preview est une alternative solide. Son prix est environ 16 fois moins élevé.
Le modèle de base GPT-4o-mini n'inclut pas la recherche web ; il repose uniquement sur ses données d'entraînement, dont la date limite se situe fin 2023. GPT-4o-mini Search Preview ajoute la capacité de récupérer des informations actualisées sur Internet. Les deux modèles ont la même fenêtre de contexte (128k tokens), la même sortie maximale (16384) et la même tarification par jeton. La variante Search Preview peut présenter une latence légèrement plus élevée en raison de la récupération web. Si votre application n'a pas besoin de données en direct, le modèle de base est fonctionnellement identique et peut être plus rapide. Les deux modèles sont accessibles via OrcaRouter avec des identifiants de modèle différents.
Les autres modèles avec capacité de recherche incluent Gemini avec l'ancrage à Google Search, ou des modèles utilisant une recherche web basée sur des plugins. GPT-4o-mini Search Preview offre une intégration native sans plugins externes. Il est généralement moins cher que les modèles de recherche plus volumineux (comme GPT-4 avec navigation). Cependant, il peut être moins complet dans les résultats de recherche par rapport aux API de recherche dédiées. Pour une connaissance web à haute précision, envisagez de compléter avec une API de recherche factuelle et d'alimenter les résultats dans un modèle de base. Ce modèle est idéal pour les requêtes simples à modérément complexes qui bénéficient de données web actuelles.
Choisissez ce modèle lorsque vous avez besoin : (1) d’un faible coût par requête, (2) d’une recherche web automatique sans intégration personnalisée, (3) de temps de réponse rapides et (4) d’une grande fenêtre contextuelle. Choisissez une variante complète de GPT-4o si vous avez besoin d’entrées multimodales ou d’un raisonnement plus approfondi. Choisissez le GPT-4o-mini de base si vous n’avez pas besoin de recherche web et souhaitez des réponses légèrement plus rapides. Choisissez une API de recherche dédiée associée à un petit modèle si vous avez besoin d’un contrôle précis sur les sources et les résultats de recherche. Ce modèle est idéal comme remplacement direct de GPT-3.5 ou GPT-4o-mini dans les applications qui bénéficieraient d’informations en direct.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-search-preview",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Entrée / 1M tokens | $0.150 |
| Sortie / 1M tokens | $0.600 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4o-mini-search-previewOuvrir @misc{orcarouter_gpt_4o_mini_search_preview,
title = {GPT-4o-mini Search Preview API},
author = {OpenAI},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview}
}OpenAI. (2025). GPT-4o-mini Search Preview API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-search-preview