Prévisualisation du modèle GPT-4o uniquement texte avec contexte de 128K, sortie de 16K, accessible via l'API OrcaRouter au tarif de 2,50 $ / 10 $ par million de jetons.
Ce modèle est une version préliminaire d’OpenAI, limitée aux entrées textuelles uniquement. Il porte l’identifiant openai/gpt-4o-search-preview-2025-03-11 lorsqu’il est utilisé via l’API…
En tant qu'aperçu textuel de GPT-4o, il excelle dans la compréhension et la génération de langage naturel dans un large éventail de domaines. Il peut effectuer des résumés de documents, répondre à des questions, écrire de manière créative, traduire et générer du code. La grande fenêtre de contexte lui permet de maintenir une cohérence sur de très longs passages, ce qui le rend adapté à des tâches comme l'analyse de livres ou le traitement de logs volumineux. Il prend en charge les messages système, utilisateur et assistant dans un format de type chat. Les capacités de raisonnement zero-shot et few-shot du modèle sont typiques des modèles de la classe GPT-4, lui permettant de traiter des instructions complexes sans nécessiter de fine-tuning approfondi.
Si votre tâche ne nécessite pas toute la puissance de raisonnement de GPT-4o, envisagez d'utiliser un modèle plus petit ou moins cher d'OrcaRouter, comme openai/gpt-4o-mini ou gpt-3.5-turbo. Les exemples de tâches mieux adaptées aux modèles moins chers incluent la classification simple, la génération de contenu de forme courte, ou les questions-réponses de base avec un contexte limité. Le coût du modèle en prévisualisation peut ne pas être justifié pour des requêtes à volume élevé et de faible complexité. De plus, si une entrée multimodale est nécessaire, ce modèle ne peut pas gérer les images ou l'audio ; un autre modèle (par exemple, GPT-4o standard ou GPT-4V) serait nécessaire. Évaluez toujours le compromis entre la qualité et le coût par jeton.
Ce modèle est identifié comme une variante 'search-preview', mais aucune capacité spécifique d'utilisation d'outils ou de recherche web n'est détaillée dans les spécifications publiquement disponibles. Il est uniquement textuel et fonctionne comme un modèle de langage standard. Les utilisateurs ne doivent pas supposer l'existence d'une fonctionnalité de recherche ou de récupération intégrée. Pour la génération augmentée, vous pouvez implémenter des pipelines de génération augmentée par récupération (RAG) séparément, en alimentant la fenêtre de contexte du modèle avec les documents récupérés. OrcaRouter n'ajoute aucun middleware d'utilisation d'outils ; le modèle répond uniquement en fonction de son entraînement et de l'invite fournie. Les versions futures pourraient modifier ce comportement, mais pour l'instant, dans l'aperçu, aucune intégration d'outil n'est documentée.
En tant qu'aperçu, ce modèle peut présenter un comportement inattendu ou une fiabilité moindre par rapport aux versions stables. Il est uniquement textuel, donc toute demande multimodale sera rejetée. Le nombre maximal de 16 384 jetons de sortie est substantiel mais peut encore tronquer des générations très longues. La date de coupure des connaissances et les données d'entraînement du modèle ne sont pas spécifiées ; il pourrait ne pas être au courant des événements très récents. L'utilisation en production est déconseillée car le modèle pourrait être mis à jour ou supprimé. De plus, la latence peut être plus élevée que celle des modèles stables en raison de sa nature d'aperçu. Testez toujours minutieusement avant de déployer à grande échelle.
Aucun score de benchmark spécifique pour cette version préliminaire particulière n'a été fourni. En tant que variante du GPT-4o, elle devrait offrir des performances similaires au GPT-4o standard sur les tâches linguistiques courantes, mais les chiffres exacts ne sont pas divulgués. Les utilisateurs peuvent effectuer leurs propres évaluations en utilisant des ensembles de données publics. La grande fenêtre de contexte lui confère un avantage sur les benchmarks de documents longs, mais comme il s'agit d'une version préliminaire, les scores peuvent différer du modèle de production. Pour des chiffres faisant autorité, reportez-vous aux rapports de benchmark officiels d'OpenAI pour GPT-4o. OrcaRouter ne modifie pas les sorties ni les performances du modèle.
Les chiffres de latence et de débit pour ce modèle d'aperçu n'ont pas été publiés. En tant qu'aperçu, il peut être plus lent que le GPT-4o stable en raison d'une infrastructure expérimentale. Les temps de réponse dépendent de la longueur de l'entrée, de la longueur de la sortie et de la demande simultanée. OrcaRouter n'impose pas de latence supplémentaire au-delà du routage API normal. Pour estimer la vitesse, les développeurs peuvent exécuter des requêtes d'exemple avec des charges utiles typiques. Pour les applications de production nécessitant des performances constantes, envisagez d'utiliser le modèle stable gpt-4o à la place, à moins que les fonctionnalités spécifiques de l'aperçu ne soient nécessaires.
Les modèles de la classe GPT-4 sont reconnus pour leur raisonnement solide dans divers domaines, notamment les mathématiques, la logique et l'inférence de sens commun. Cette version préliminaire devrait hériter de ces capacités. Le large contexte permet un raisonnement complexe en chaîne de pensée sur de nombreuses étapes sans perdre la trace des parties précédentes. Cependant, aucun indicateur de performance spécifique n'est fourni pour cette version exacte. Les utilisateurs doivent valider la performance sur leurs propres tâches spécifiques au domaine. Le modèle peut également présenter un meilleur suivi des instructions par rapport aux versions précédentes de GPT, mais là encore, une vérification indépendante est recommandée.
En plus d'être une prévisualisation, le modèle n'offre aucun support multimodal. Il ne peut pas traiter directement les images, l'audio ou la vidéo. Sa date de coupure des connaissances est inconnue, donc il peut manquer d'informations sur les événements postérieurs à son entraînement. La limite de sortie de 16 384 tokens, bien que généreuse, ne peut pas produire des textes extrêmement longs en une seule génération ; pour des sorties plus longues, un prompting itératif ou un découpage est nécessaire. La prévisualisation peut également avoir des taux d'erreur ou de refus plus élevés pour certains sujets sensibles. Les performances sur les langues autres que l'anglais peuvent varier. Testez toujours sur des données représentatives avant le déploiement.
Le modèle est proposé à $2.50 pour 1 million de jetons en entrée et $10.00 pour 1 million de jetons en sortie. Ce sont les tarifs du fournisseur OpenAI ; OrcaRouter n'ajoute aucune majoration. Par exemple, le traitement d'une invite de 10,000 jetons et la génération de 1,000 jetons coûterait environ $0.025 pour l'entrée et $0.01 pour la sortie, soit un total de $0.035. Les coûts augmentent linéairement avec l'utilisation de jetons. Il n'y a pas de frais supplémentaires pour l'utilisation d'OrcaRouter comme passerelle API. Assurez-vous de surveiller votre utilisation pour éviter des frais inattendus. Comparez avec des modèles moins coûteux si votre tâche ne nécessite pas toutes les capacités.
OrcaRouter n'offre actuellement pas de remises sur le volume ni de mise en cache des jetons pour ce modèle. Toute facturation est à l'usage, basée sur la consommation réelle de jetons au tarif du fournisseur. OrcaRouter n'effectue pas de mise en cache des prompts ou des réponses ; chaque requête est traitée indépendamment. Si vous avez un débit très élevé, contactez OrcaRouter pour d'éventuels arrangements personnalisés. Pour optimiser les coûts, envisagez d'utiliser des prompts plus courts, de réutiliser efficacement le contexte, ou de regrouper les appels. Le modèle ne prend pas en charge de tarifs réduits pour les hits en cache, car aucun mécanisme de mise en cache n'est en place.
À $2.50/$10 par million de tokens, cet aperçu est tarifé de manière similaire au GPT-4o standard mais peut différer légèrement. Des alternatives moins chères incluent openai/gpt-4o-mini (environ $0.15/$0.60 par million) ou gpt-3.5-turbo (à peu près $0.50/$1.50). Pour les tâches qui peuvent tolérer une qualité inférieure, ces modèles offrent des économies significatives. Le coût du modèle d'aperçu se situe dans la fourchette supérieure du catalogue OrcaRouter. Si vous l'utilisez uniquement pour des tests, vous pouvez encourir des coûts modérés en fonction du volume de requêtes. Évaluez toujours l'utilisation prévue de tokens et comparez-la avec le gain de qualité obtenu en utilisant un modèle plus grand.
Pour utiliser ce modèle, définissez l'URL de base de votre client API sur https://api.orcarouter.ai/v1 et spécifiez l'ID du modèle comme openai/gpt-4o-search-preview-2025-03-11. Vous devez utiliser une clé API délivrée par OrcaRouter. L'API est entièrement compatible avec OpenAI, donc le code existant écrit pour le point de terminaison de chat completions d'OpenAI fonctionnera avec des modifications minimes. Exemple d'appel avec curl : curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_ORCAROUTER_KEY" -H "Content-Type: application/json" -d '{ "model": "openai/gpt-4o-search-preview-2025-03-11", "messages": [{"role": "user", "content": "Hello"}], "max_tokens": 100 }'.
Vous pouvez utiliser tous les paramètres standard de complétion de chat pris en charge par OpenAI : 'messages', 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' et 'n'. Le modèle prend en charge une fenêtre de contexte de 128 000 jetons, donc 'max_tokens' peut être défini jusqu'à 16 384. 'temperature' contrôle le caractère aléatoire ; les valeurs vont de 0 à 2. 'stream' est pris en charge pour les réponses en temps réel. OrcaRouter n'introduit pas de paramètres supplémentaires. Assurez-vous que vos requêtes respectent les limites de jetons ; les entrées plus longues que la fenêtre de contexte (y compris la réponse) seront tronquées ou renverront une erreur.
La migration est simple. Remplacez votre URL de base OpenAI (https://api.openai.com/v1) par l'URL de base d'OrcaRouter (https://api.orcarouter.ai/v1). Remplacez votre clé API par une clé OrcaRouter. Mettez à jour le champ modèle avec openai/gpt-4o-search-preview-2025-03-11. Aucune autre modification de code n'est nécessaire. Si vous utilisiez un modèle OpenAI différent, vous pouvez continuer à utiliser la même structure de code. OrcaRouter transmet tous les paramètres standard. Après la migration, vérifiez que les réponses sont cohérentes. Notez que la facturation sera gérée par OrcaRouter et que vous aurez besoin d'un compte chez eux.
OrcaRouter ne divulgue pas publiquement de limites de débit spécifiques pour ce modèle en prévisualisation. La disponibilité dépend de l'infrastructure d'OpenAI et de la capacité de la passerelle d'OrcaRouter. Pour les applications de production, tenez compte du statut de prévisualisation du modèle et de son instabilité potentielle. OrcaRouter peut imposer des limites d'utilisation raisonnables pour prévenir les abus. Vous pouvez vous attendre à un service au mieux, mais aucun SLA n'est fourni. Si vous avez besoin d'un débit garanti, contactez OrcaRouter pour des options dédiées. Le modèle peut également être supprimé ou remplacé sans préavis, alors prévoyez des modèles de repli.
Le modèle standard GPT-4o (openai/gpt-4o) est multimodal, en version stable, tandis que cet aperçu est limité au texte et destiné aux tests précoces. L'aperçu peut inclure des fonctionnalités à venir absentes de la version standard, mais peut aussi être moins fiable. Les tarifs sont similaires. Le modèle standard accepte davantage de types d'entrée (images, audio). Si vous n'avez pas besoin des fonctionnalités d'aperçu, le GPT-4o standard est le choix le plus sûr. Les deux sont disponibles sur OrcaRouter avec la même interface API, ce qui facilite le basculement.
Gpt-4o-mini est un modèle plus petit et moins cher, optimisé pour les tâches simples. Il coûte environ $0.15 par million de tokens d'entrée et $0.60 par million de tokens de sortie (approximatif). Ce modèle d'aperçu est environ 16x plus cher pour l'entrée et 16x plus cher pour la sortie. Le modèle d'aperçu offre un contexte plus large (128K vs. 128K ? En fait, gpt-4o-mini a aussi 128K, mais cela peut varier. Nous savons que ce modèle fait 128K. Le contexte de gpt-4o-mini est également de 128K selon les informations publiques, mais nous ne pouvons pas le supposer. Nous dirons « fenêtre de contexte comparable » mais notons la différence de prix.) Ce modèle est meilleur pour le raisonnement complexe, tandis que gpt-4o-mini est suffisant pour de nombreuses tâches standard. Choisissez en fonction des besoins de qualité et du budget.
Les modèles Claude (par exemple, Claude 3.5 Sonnet) offrent de grandes fenêtres de contexte et un raisonnement solide, mais leur API n'est pas directement compatible avec OpenAI. OrcaRouter fournit une interface unifiée pour plusieurs fournisseurs, mais cet aperçu provient exclusivement d'OpenAI. Les modèles Claude peuvent avoir des tarifs et des atouts différents dans des domaines comme la sécurité et la génération de texte long. Pour une comparaison directe, vous devriez tester sur vos propres cas d'usage. OrcaRouter vous permet de basculer entre les fournisseurs, mais ce modèle d'aperçu n'est disponible que via la route OpenAI. Aucune comparaison de référence n'est fournie.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-search-preview-2025-03-11",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)max_tokensresponse_formatstreamstructured_outputsweb_search_options| Entrée / 1M tokens | $2.50 |
| Sortie / 1M tokens | $10.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4o-search-preview-2025-03-11Ouvrir @misc{orcarouter_gpt_4o_search_preview_2025_03_11,
title = {openai/gpt-4o-search-preview-2025-03-11 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-search-preview-2025-03-11}
}openai. (n.d.). openai/gpt-4o-search-preview-2025-03-11 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-search-preview-2025-03-11