GPT-4o (« o » pour « omni ») est le dernier modèle d'IA d'OpenAI, prenant en charge les entrées textuelles et images avec des sorties textuelles. Il maintient le niveau d'intelligence de [GPT-4 Turbo](/models/openai/gpt-4-turbo) tout en étant deux fois plus...
GPT-4o est un modèle de langage large multimodal développé par OpenAI. Il accepte des entrées de texte, d'image et de fichiers, et produit des sorties textuelles. Ce modèle est conçu pour les…
GPT-4o excelle dans le raisonnement multimodal, le traitement de longs contextes et la résolution de problèmes mathématiques. Son contexte de 128k tokens lui permet de retenir et de référencer de grandes quantités d'informations, ce qui le rend utile pour des tâches comme l'analyse de documents, la génération de code sur l'ensemble des projets et les conversations complexes à plusieurs tours. Le modèle a obtenu un score de 75.9 sur le benchmark MATH-500, indiquant une forte capacité à résoudre des problèmes mathématiques. De plus, sa capacité à accepter des entrées d'images et de fichiers signifie qu'il peut raisonner sur du contenu visuel — comme des diagrammes, des graphiques ou des photographies — en combinaison avec du texte. Sur OrcaRouter, vous pouvez tirer parti de ces atouts sans payer de majoration par rapport aux prix affichés par OpenAI.
GPT-4o est très efficace pour les tâches nécessitant une compréhension à la fois textuelle et visuelle. Voici quelques exemples : répondre à des questions sur un schéma dans un manuel, extraire des données d’une facture scannée, générer du code à partir d’une image de maquette, ou résumer un long article de recherche avec des figures. Son large contexte le rend également adapté à l’analyse de bases de code entières ou de longs historiques de conversations. Le raisonnement mathématique est un autre de ses points forts, comme le montre son score de 75.9 sur MATH-500. Sur OrcaRouter, ces cas d’usage sont simples à mettre en œuvre : vous envoyez une requête standard compatible OpenAI avec les types de contenu appropriés, et le modèle renvoie une réponse textuelle.
Si votre tâche ne nécessite pas d'entrée multimodale ou un large contexte, un modèle moins cher pourrait être plus rentable. Par exemple, pour des tâches simples de classification de texte, de résumé ou de traduction qui tiennent dans un contexte plus petit, des modèles comme GPT-3.5 Turbo (au prix de $0.50 par 1M d'entrée et $1.50 par 1M de sortie) sont nettement moins chers. Le coût d'entrée de GPT-4o est de $2.50 par 1M de tokens, ce qui est cinq fois plus élevé que celui de GPT-3.5 Turbo. Si vous traitez de grands volumes de données textuelles sans avoir besoin de raisonnement multimodal, un modèle plus petit peut réduire les coûts. OrcaRouter propose une variété de modèles afin que vous puissiez choisir le meilleur équilibre entre prix et performance.
GPT-4o est conçu pour accepter des images et des fichiers en entrée, lui permettant d'effectuer des tâches telles que la réponse à des questions visuelles, le sous-titrage d'images et la compréhension de documents. Bien que des scores spécifiques de benchmarks multimodaux ne soient pas fournis dans les faits disponibles, l’architecture du modèle prend en charge le raisonnement conjoint sur le texte et les images. Par exemple, il peut compter des objets dans une image ou interpréter un graphique. Le modèle produit uniquement du texte, pas d'images. Sur OrcaRouter, les requêtes multimodales sont envoyées en utilisant les mêmes paramètres que l’API d’OpenAI : inclure une partie image_url ou contenu de fichier dans le tableau messages. Le modèle traite les données visuelles et renvoie une réponse textuelle basée sur l’entrée combinée.
GPT-4o obtient un score de 75.9 sur le benchmark MATH-500. MATH-500 est un sous-ensemble du dataset MATH, qui comprend 500 problèmes mathématiques difficiles couvrant divers sujets tels que l'algèbre, la géométrie et le calcul. Un score de 75.9 signifie que le modèle résout correctement environ 76 % de ces problèmes. Cela indique une forte capacité de raisonnement mathématique, bien que pas parfaite. En comparaison, de nombreux modèles plus petits obtiennent un score inférieur à 50 sur des benchmarks similaires. Ce score reflète la capacité du modèle à effectuer un raisonnement multi-étapes et à gérer la notation mathématique. Sur OrcaRouter, vous pouvez utiliser GPT-4o pour des tâches liées aux mathématiques comme le tutorat, la préparation aux tests ou la vérification de calculs.
Comme tous les grands modèles de langage, GPT-4o a ses limites. Il peut produire des réponses incorrectes ou hallucinées, en particulier sur des sujets avec peu de données d’entraînement ou nécessitant des connaissances très récentes (sa date limite d’entraînement n’est pas fournie dans les faits, mais en tant que modèle OpenAI, il a une date limite de connaissance). Il peut être sensible à la formulation des invites et avoir du mal avec des instructions ambiguës. Malgré son score élevé sur MATH-500, il n’est pas infaillible pour les preuves mathématiques complexes. Le modèle traite les images mais n’en génère pas. De plus, la grande fenêtre de contexte (128k tokens) peut entraîner une augmentation de l’utilisation des tokens, ce qui augmente les coûts si elle n’est pas gérée avec soin. Sur OrcaRouter, vous pouvez atténuer certains problèmes en ajustant des paramètres comme temperature et top_p.
Les chiffres de latence exacts pour GPT-4o ne sont pas fournis dans les faits. En général, GPT-4o est un modèle volumineux et aura une latence plus élevée que des modèles plus petits comme GPT-3.5 Turbo ou Llama 3.1 8B. Cependant, il est probablement optimisé pour une inférence plus rapide que le GPT-4 original. Via OrcaRouter, vous pouvez vous attendre à des temps de réponse similaires à ceux que vous obtiendriez directement d'OpenAI, car la plateforme achemine les requêtes sans traitement supplémentaire. Pour les applications en temps réel où la vitesse est critique, envisagez d'utiliser un modèle plus rapide et moins cher pour les tâches simples et réservez GPT-4o pour les requêtes complexes qui bénéficient de ses capacités.
Sur OrcaRouter, GPT-4o est facturé exactement aux tarifs indiqués par OpenAI : $2.50 par million de tokens d'entrée et $10.00 par million de tokens de sortie. Aucune majoration n'est ajoutée par OrcaRouter. La facturation est basée sur le nombre de tokens arrondi au token entier le plus proche. Les tokens d'entrée incluent le texte, les images et les fichiers que vous envoyez, bien que les images soient généralement tokenisées à un taux fixe par le modèle (p. ex., chaque image consomme un certain nombre de tokens). Les tokens de sortie sont le texte généré par le modèle. Vous n'êtes facturé que pour ce que vous utilisez ; il n'y a pas de frais mensuels ni d'engagement minimum. Cette tarification transparente vous permet de budgétiser avec précision vos charges de travail d'IA.
Le principal compromis est entre le coût et la capacité. GPT-4o coûte 2,50 $ en entrée et 10 $ en sortie par million de tokens. Des modèles moins chers comme GPT-3.5 Turbo (0,50 $ en entrée, 1,50 $ en sortie) ou Llama 3.1 8B sont plus économiques pour des tâches simples ou à volume élevé. Cependant, GPT-4o offre une entrée multimodale et une fenêtre de contexte plus grande. Si votre application nécessite la compréhension d'images ou le traitement de documents très longs, GPT-4o peut être nécessaire malgré le coût plus élevé. Pour des tâches textuelles avec des entrées courtes, un modèle moins cher peut faire économiser de l'argent. Sur OrcaRouter, vous pouvez basculer entre les modèles avec un simple changement de l'ID du modèle, afin d'optimiser le coût pour chaque requête.
Non. OrcaRouter facture GPT-4o au tarif exact du fournisseur sans marge. Les prix sont de $2.50 pour 1M de jetons en entrée et de $10.00 pour 1M de jetons en sortie. Il n'y a pas de frais cachés, de ventes incitatives ou de frais supplémentaires. OrcaRouter répercute le coût directement depuis OpenAI. Cette politique s'applique à tous les modèles listés sur la plateforme. L'URL de base est https://api.orcarouter.ai/v1 et l'ID du modèle est "openai/gpt-4o". Vous pouvez vérifier la tarification à tout moment en consultant votre tableau de bord d'utilisation. Il n'y a pas de tarification par paliers ni d'engagement requis — payez uniquement pour les jetons consommés.
Pour utiliser GPT-4o via OrcaRouter, envoyez des requêtes HTTP POST à l'URL de base https://api.orcarouter.ai/v1/chat/completions. Définissez le paramètre model sur "openai/gpt-4o". Votre requête doit inclure une clé API (fournissez votre clé API OrcaRouter dans l'en-tête Authorization). Le corps de la requête suit le format standard des complétions de chat OpenAI : un tableau messages avec des paires rôle/contenu, des paramètres facultatifs comme temperature, max_tokens, top_p, etc. Pour les entrées multimodales, incluez des parties de contenu ayant un type "text" ou "image_url" (ou file). La réponse est un objet JSON contenant la complétion du modèle. Exemple de commande curl : curl https://api.orcarouter.ai/v1/chat/completions -H "Authorization: Bearer YOUR_API_KEY" -H "Content-Type: application/json" -d '{"model":"openai/gpt-4o","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/image.jpg"}}]}]}'
Lors de l'appel à GPT-4o via OrcaRouter, vous pouvez utiliser les mêmes paramètres que ceux de l'API OpenAI. Les paramètres couramment utilisés incluent : - temperature (float, 0-2) : Contrôle le caractère aléatoire. Des valeurs plus basses comme 0,2 rendent la sortie plus déterministe. - max_tokens (integer, par défaut 16384) : Nombre maximum de tokens dans la réponse. - top_p (float, 0-1) : Paramètre d'échantillonnage nucleus. - frequency_penalty et presence_penalty : Réduisent la répétition. - stop (string ou array) : Séquences d'arrêt. - stream (boolean) : Active les réponses en streaming (true/false). - seed (integer) : Pour un échantillonnage déterministe. Vous pouvez également utiliser le champ facultatif « user » pour suivre des utilisateurs individuels. Le modèle prend en charge l'appel de fonctions et l'utilisation d'outils, bien que cela ne soit pas explicitement listé dans les faits. Sur OrcaRouter, tous les paramètres standard sont acceptés.
La migration est simple car OrcaRouter propose un endpoint compatible avec OpenAI. Étapes : 1. Obtenez une clé API auprès d'OrcaRouter (inscrivez-vous sur leur site web). 2. Remplacez l'URL de base `https://api.openai.com/v1` par `https://api.orcarouter.ai/v1`. 3. Remplacez l'ID du modèle `"gpt-4o"` par `"openai/gpt-4o"`. 4. Utilisez le même format de corps de requête. Aucune modification de code autre que l'endpoint et le nom du modèle n'est nécessaire. 5. Mettez à jour l'en-tête Authorization pour utiliser votre clé API OrcaRouter. Il est recommandé de tester avec une seule requête. OrcaRouter utilise les mêmes modes streaming et non-streaming. Il n'y a aucune différence dans le comportement du modèle, car il s'agit du même modèle OpenAI sous-jacent. Vos prompts et paramètres existants fonctionneront de manière identique.
L'URL de base pour l'API OrcaRouter est https://api.orcarouter.ai/v1. L'ID de modèle spécifique à utiliser pour GPT-4o est "openai/gpt-4o". Cette chaîne exacte doit être passée dans le paramètre "model" de la requête. Par exemple, dans un appel de point de terminaison de complétions de chat, vous définissez "model": "openai/gpt-4o". OrcaRouter prend en charge ce modèle pour les complétions en streaming et non-streaming. Si vous utilisez un SDK ou une bibliothèque OpenAI configuré pour pointer vers une URL de base personnalisée, définissez simplement l'URL de base sur https://api.orcarouter.ai/v1 et fournissez votre clé API OrcaRouter. Le préfixe d'ID de modèle "openai/" le distingue des modèles d'autres fournisseurs sur OrcaRouter.
GPT-4o est le successeur multimodal de GPT-4 Turbo. Les deux modèles disposent d'une fenêtre de contexte de 128 k. Cependant, GPT-4o ajoute la prise en charge native des images et des fichiers en entrée, tandis que GPT-4 Turbo était principalement textuel (la vision n'était disponible que dans des versions séparées). GPT-4o a également une sortie maximale plus élevée de 16 384 tokens, contre 4 096 ou 8 192 pour GPT-4 Turbo. Les tarifs diffèrent : GPT-4 Turbo coûte 10,00 $ par million de tokens en entrée et 30,00 $ par million en sortie, ce qui rend GPT-4o considérablement moins cher (2,50 $/10,00 $). Le score MATH-500 de 75,9 pour GPT-4o est généralement supérieur aux benchmarks rapportés de GPT-4 Turbo, bien que les scores exacts de Turbo ne soient pas dans les faits. Sur OrcaRouter, les deux modèles sont disponibles sans marge.
GPT-3.5 Turbo est un modèle moins cher et plus rapide, optimisé pour des tâches simples. Sa fenêtre de contexte est de 16,384 tokens, bien plus petite que les 128k de GPT-4o. GPT-3.5 ne prend pas en charge les entrées d'image — il est uniquement textuel. Son tarif est de $0,50 pour 1M de tokens en entrée et $1,50 pour 1M de tokens en sortie, ce qui le rend environ 5x moins cher pour les entrées et 6,6x moins cher pour les sorties par rapport à GPT-4o. Sur le benchmark MATH-500, GPT-3.5 Turbo obtient généralement des scores beaucoup plus bas (les chiffres exacts ne sont pas fournis). GPT-4o est mieux adapté aux raisonnements complexes, aux documents longs et aux tâches multimodales. Utilisez GPT-3.5 Turbo pour des interactions simples à fort volume. Sur OrcaRouter, vous pouvez facilement basculer entre eux en modifiant l'ID du modèle.
Claude 3.5 Sonnet est un modèle concurrent d'Anthropic. Il dispose également d'une fenêtre de contexte de 200k (plus grande que celle de GPT-4o, qui est de 128k) et prend en charge les entrées d'image. La tarification de Claude 3.5 Sonnet est généralement de 3,00 $ par million de tokens en entrée et de 15,00 $ par million en sortie, ce qui rend GPT-4o moins cher en entrée mais plus cher en sortie ? En réalité, GPT-4o est à 2,50 $ en entrée contre 3,00 $, donc moins cher ; en sortie, 10 $ contre 15 $, donc moins cher. Sur les benchmarks, Claude 3.5 Sonnet atteint des performances similaires en mathématiques et en raisonnement, mais les scores exacts varient. Les deux modèles sont performants dans les tâches multimodales. Le choix entre eux peut dépendre de caractéristiques de performance spécifiques ou de préférences d'écosystème. Sur OrcaRouter, les deux sont accessibles via le même format d'API avec des identifiants de modèle différents (par exemple, « anthropic/claude-3.5-sonnet »).
Llama 3.1 405B est un modèle à poids ouverts de Meta avec 405 milliards de paramètres. Il prend également en charge une fenêtre de contexte de 128k et une entrée textuelle, mais ses capacités multimodales sont moins claires (il peut ne pas prendre en charge les images nativement). Llama 3.1 405B est disponible via OrcaRouter à un prix inférieur, généralement autour de 1,00 $ par 1M d’entrée et 1,00 $ par 1M de jetons de sortie (approximatif, non fourni dans les faits). Ses scores de référence sur MATH-500 ne sont pas donnés mais sont probablement inférieurs aux 75,9 de GPT-4o. GPT-4o est propriétaire et offre un meilleur raisonnement multimodal prêt à l’emploi et potentiellement une précision plus élevée sur des tâches complexes. Llama 3.1 405B est un bon choix pour les utilisateurs qui souhaitent un modèle ouvert ou qui ont besoin de l’héberger eux-mêmes. Sur OrcaRouter, vous pouvez comparer les deux modèles côte à côte.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrée / 1M tokens | $2.50 |
| Sortie / 1M tokens | $10.00 |
| Lecture cache / 1M | $1.25 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4oOuvrir @misc{orcarouter_gpt_4o,
title = {GPT-4o API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o}
}OpenAI. (2024). GPT-4o API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o