GPT-4o (« o » pour « omni ») est le dernier modèle d'IA d'OpenAI, prenant en charge les entrées textuelles et images avec des sorties textuelles. Il maintient le niveau d'intelligence de [GPT-4 Turbo](/models/openai/gpt-4-turbo) tout en étant deux fois plus...
GPT-4o (2024-05-13) est un modèle de langage multimodal d'OpenAI, accessible via l'API d'OrcaRouter. Il traite le texte, les images et les fichiers, ce qui le rend adapté aux tâches qui mélangent des…
GPT-4o peut analyser les images fournies dans le cadre de l'entrée. Il peut décrire le contenu visuel, répondre à des questions sur les objets, le texte dans les images et les relations spatiales. Il peut également extraire et transcrire du texte à partir de documents scannés ou de photos. Parce qu'il traite les images directement, vous n'avez pas besoin d'un modèle OCR ou de vision séparé. L'image est tokenisée pour s'adapter à la fenêtre de contexte. Par exemple, un utilisateur peut télécharger une capture d'écran d'un graphique et demander au modèle d'interpréter les tendances. La compréhension du modèle ne se limite pas à des légendes simples ; il peut raisonner sur le contenu, comparer plusieurs images et utiliser des indices visuels en même temps que des instructions textuelles. Cette capacité est intégrée dans le même appel API, utilisant le même format de message que les requêtes uniquement textuelles. Sur OrcaRouter, vous envoyez des images sous forme de données encodées en base64 ou d'URL dans le tableau de contenu. L'ID du modèle reste "openai/gpt-4o-2024-05-13".
GPT-4o accepte les fichiers en entrée. Les formats pris en charge incluent PDF, les documents Microsoft Office (Word, Excel, PowerPoint), les fichiers texte et les formats d’image. Pour les PDF et les fichiers Office, le modèle extrait le contenu textuel et analyse la mise en page. Il ne restitue pas directement la mise en forme complexe mais lit le contenu textuel. Cela est utile pour traiter des rapports, des contrats, des feuilles de calcul ou des présentations sans extraction manuelle. Le contenu du fichier est tokenisé et compte dans le total des tokens d’entrée. Le modèle peut répondre à des questions sur le contenu du fichier, le résumer ou effectuer des calculs sur des données tabulaires. Lorsque vous utilisez des fichiers, vous les incluez dans le contenu du message en utilisant les champs appropriés de l’API OpenAI. OrcaRouter gère la transmission sans modification. Notez que les capacités du modèle dépendent de la qualité du texte extrait ; les images fortement scannées dans les PDF peuvent ne pas être entièrement lisibles à moins qu’elles ne contiennent des couches de texte intégrées.
GPT-4o est un modèle premium avec un coût plus élevé que des alternatives comme GPT-4o-mini ou les variantes antérieures de GPT-3.5. Si votre tâche ne nécessite pas les capacités multimodales (par exemple, des tâches textuelles uniquement), un contexte étendu (jusqu'à 128K) ou le niveau de raisonnement mathématique mesuré par MATH-500 (79,1), un modèle moins cher peut être plus économique. Par exemple, la classification simple, la génération de contenu court ou les conversations basiques peuvent être prises en charge par des modèles à moindre coût tout en offrant une qualité acceptable. De plus, si votre application est sensible à la latence et que le modèle plus petit est plus rapide, le compromis peut favoriser la rapidité plutôt que la précision absolue. Enfin, si vous avez rarement besoin de traiter des images ou des fichiers, la capacité multimodale supplémentaire est inutile. OrcaRouter propose une gamme de modèles vous permettant de choisir le meilleur rapport qualité-prix. Évaluez les exigences de votre cas d'utilisation par rapport aux scores de référence et aux prix pour déterminer si les avantages de GPT-4o justifient le coût supplémentaire.
GPT-4o peut générer jusqu'à 16 384 jetons par requête. C'est une limite généreuse qui permet des réponses longues, du code détaillé ou des analyses multi-paragraphes. Cependant, les jetons de sortie sont facturés à 15,00 $ par million, ce qui rend les sorties plus longues plus coûteuses. Vous pouvez contrôler la longueur de la sortie à l'aide du paramètre max_tokens dans l'appel API. Si vous prévoyez avoir besoin de très longues générations, envisagez de regrouper ou de diviser la requête. La limite de 16 384 s'applique à l'ensemble de la complétion, y compris les étapes de raisonnement ou le chain-of-thought si demandé. Pour les tâches très complexes qui nécessitent une réflexion approfondie, vous devrez peut-être utiliser plusieurs appels. Sur OrcaRouter, le nombre de jetons de sortie est indiqué dans le champ usage de la réponse API, ce qui vous permet de suivre les coûts avec précision. Il n'y a pas de limite supplémentaire imposée par OrcaRouter ; la limite native du modèle s'applique.
GPT-4o a obtenu un score de 79,1 sur le benchmark MATH-500. MATH-500 se compose de 500 problèmes mathématiques difficiles couvrant divers sujets tels que l'algèbre, la géométrie, la théorie des nombres et les probabilités. Un score de 79,1 signifie que le modèle a répondu correctement à 79,1 % des problèmes. Il s'agit d'un résultat solide qui indique une capacité de raisonnement mathématique robuste, en particulier pour un modèle multimodal. Le benchmark teste à la fois la résolution de problèmes et le raisonnement pas à pas. Ce score peut guider les attentes pour des applications impliquant le tutorat en mathématiques, le calcul scientifique ou les puzzles logiques. Notez que les performances sur un benchmark ne garantissent pas des résultats identiques dans des tâches réelles ; un ajustement spécifique au domaine ou une ingénierie des prompts peuvent être nécessaires. Lors de l'évaluation de ce modèle, comparez son score MATH-500 à ceux d'autres modèles que vous évaluez. OrcaRouter ne fournit pas de données de benchmark supplémentaires, il s'agit donc du seul point de référence fourni pour ce modèle.
La latence dépend de plusieurs facteurs : la longueur de l'entrée, la longueur de la sortie attendue, la charge actuelle sur les serveurs d'OpenAI, et le chemin réseau entre votre application et OrcaRouter. OrcaRouter n'ajoute pas de surcharge significative au-delà du temps de réponse du fournisseur sous-jacent. Pour les requêtes typiques avec une entrée modérée (quelques milliers de tokens) et des sorties courtes (moins de 1 000 tokens), les réponses arrivent souvent en quelques secondes. Les sorties plus longues (proches de 16 384 tokens) prendront naturellement plus de temps car le modèle génère les tokens séquentiellement. Les entrées d'images augmentent également la latence en raison de la tokenisation et du traitement. Vous pouvez optimiser la latence en réduisant la longueur de la sortie, en utilisant des invites plus courtes, ou en regroupant les requêtes. OrcaRouter fournit des points de terminaison API standard qui renvoient les résultats de manière asynchrone via le streaming si souhaité. Pour les applications interactives en temps réel, envisagez d'utiliser le mode streaming (stream: true) pour commencer le traitement dès l'arrivée des tokens. Aucun nombre de latence spécifique n'est fourni dans les faits du modèle, donc il s'agit d'estimations qualitatives.
Points forts : Entrée multimodale (texte, image, fichier), grande fenêtre de contexte de 128K, solide raisonnement mathématique (MATH-500 : 79,1) et limite élevée de tokens de sortie (16 384). Il traite efficacement les longs documents et les conversations à plusieurs tours. L'API est standard et compatible OpenAI, facilitant l'intégration. Limites : Coût plus élevé par rapport aux modèles plus petits. Non optimisé pour les tâches qui ne tirent pas parti de la multimodalité ou d'un grand contexte. Aucune information n'est fournie sur les performances en langues non anglaises ni sur des critères de sécurité spécifiques. La compréhension des images peut être limitée pour des scènes très complexes ou des images de basse résolution. De plus, le modèle peut produire des réponses incorrectes sur des problèmes en dehors de sa distribution d'entraînement. Aucune garantie de latence n'est divulguée. Pour les utilisateurs nécessitant une latence extrêmement faible ou un coût extrêmement bas, un autre modèle pourrait être plus adapté. Le score de référence de 79,1 sur MATH-500 indique une marge d'amélioration sur les problèmes mathématiques les plus difficiles. Évaluez si ces compromis correspondent aux exigences de votre application.
GPT-4o est facturé par token, avec des tarifs distincts pour les tokens d'entrée et de sortie. Les tokens d'entrée coûtent 5,00 $ pour 1 million de tokens. Les tokens de sortie coûtent 15,00 $ pour 1 million de tokens. Ce sont les tarifs du fournisseur, répercutés par OrcaRouter sans aucune majoration. Le coût par requête = (tokens d'entrée/1e6 * 5) + (tokens de sortie/1e6 * 15). Par exemple, une conversation avec 4 000 tokens d'entrée et 200 tokens de sortie coûterait (0,004 * 5 $) + (0,0002 * 15 $) = 0,02 $ + 0,003 $ = 0,023 $. Il n'y a pas de frais supplémentaires pour les appels API eux-mêmes ; vous ne payez que pour les tokens consommés. Les tarifs sont mis à jour dynamiquement en fonction des changements du fournisseur ; OrcaRouter transmet toute modification future. Puisqu'il n'y a pas de majoration, les utilisateurs bénéficient des mêmes tarifs que les clients directs d'OpenAI, mais avec la commodité de la gestion et de la facturation unifiées d'OrcaRouter. Notez que les images et les fichiers sont tokenisés et contribuent au nombre de tokens d'entrée, ce qui augmente souvent le coût par rapport aux entrées uniquement textuelles.
Non. OrcaRouter n'offre pas de réductions, de tokens mis en cache, ni de tarifs réduits pour des entrées répétées. Chaque token est facturé au tarif standard du fournisseur. Il n'y a pas de coût de mise en cache séparé ni de surcharge pour un volume élevé. Les tarifs de 5 $ / 15 $ par million de tokens sont des prix fixes. Les utilisateurs nécessitant un très haut débit peuvent se renseigner sur des arrangements personnalisés, mais le service standard n'inclut pas de remises sur le volume. De plus, il n'y a pas de frais cachés tels que des frais de connexion ou de minimum mensuel. La tarification est transparente et directement liée à l'utilisation des tokens. Pour optimiser les coûts, envisagez de réduire la taille des entrées (par exemple, en tronquant l'historique, en utilisant des invites plus courtes) et la longueur des sorties (par exemple, en définissant un max_tokens plus bas). De plus, utiliser le modèle uniquement lorsque ses capacités sont nécessaires (multimodal, grand contexte) aide à maîtriser les coûts. Si votre application a des invites répétitives qui sont identiques à chaque fois, la mise en cache au niveau de l'application peut réduire l'utilisation de tokens, mais OrcaRouter lui-même ne fournit pas une telle fonctionnalité.
GPT-4o a un prix premium. Pour de nombreuses tâches, un modèle moins cher (par exemple, GPT-4o-mini ou GPT-3.5-turbo) peut suffire. Faites un compromis en évaluant la complexité et la précision requise. Si votre tâche implique une extraction ou une classification simple avec un contexte limité, un modèle moins cher peut offrir des performances similaires pour une fraction du coût. À l’inverse, si la tâche nécessite une compréhension nuancée des images, de longs documents ou une haute précision mathématique (score MATH-500 de 79,1 contre des scores inférieurs sur des modèles moins chers), GPT-4o peut valoir son prix. Utilisez des tests A/B sur un échantillon représentatif pour comparer qualité et coût. Notez également que le même prix par million de tokens s’applique quelle que soit la longueur du texte ; les requêtes plus courtes sont moins chères. Si votre workflow utilise fréquemment le contexte complet de 128K, le coût en tokens d’entrée pour cette requête peut être élevé ; assurez-vous que ce contexte est réellement nécessaire. OrcaRouter fournit des métriques d’utilisation pour vous permettre de surveiller et d’optimiser.
Pour appeler GPT-4o sur OrcaRouter, utilisez le point de terminaison d'API compatible OpenAI : base_url = "https://api.orcarouter.ai/v1". Définissez le paramètre model sur "openai/gpt-4o-2024-05-13". Vous aurez besoin d'une clé API d'OrcaRouter. Le format de la requête suit l'API standard OpenAI Chat Completions : un tableau messages avec les rôles (system, user, assistant), un contenu optionnel pour les images et fichiers, et des paramètres comme temperature, max_tokens, top_p, frequency_penalty, presence_penalty et stop. Par exemple, une simple requête textuelle est envoyée en POST à /chat/completions. Pour les images, incluez le contenu dans le message utilisateur avec le type "image_url". Pour les fichiers, incluez-les également dans le contenu (le format spécifique suit la spécification OpenAI). La réponse inclura le message de l'assistant, les statistiques d'utilisation (prompt_tokens, completion_tokens, total_tokens) et d'autres métadonnées. Aucun en-tête spécial n'est requis au-delà des en-têtes standard Content-Type et Authorization. L'intégration est identique à l'utilisation directe d'OpenAI.
Tous les paramètres standard des OpenAI Chat Completions sont pris en charge : messages (obligatoire), model (obligatoire, défini sur "openai/gpt-4o-2024-05-13"), temperature (0–2, par défaut 1), top_p (0–1, par défaut 1), n (nombre de complétions, par défaut 1), stop (chaînes ou liste de chaînes), max_tokens (par défaut 16,384, limite à 16,384), presence_penalty (−2 à 2, par défaut 0), frequency_penalty (−2 à 2, par défaut 0), logit_bias (mappage des ID de token à la valeur de biais), user (chaîne pour la surveillance des abus), stream (booléen, par défaut false), et functions/tools (pour l'appel de fonctions). Pour les entrées multimodales, le contenu des messages peut être un tableau de parties de contenu de type "text" ou "image_url". De plus, vous pouvez inclure un contenu de type "file" conformément à la documentation d'OpenAI (par exemple, pour les pièces jointes PDF). OrcaRouter transmet ces paramètres directement au fournisseur sans modification. Assurez-vous de ne pas dépasser la fenêtre de contexte de 128K tokens. L'API renvoie des codes d'erreur standard pour les requêtes invalides, la limitation de débit ou les échecs d'authentification.
La migration est simple car l’API d’OrcaRouter est entièrement compatible avec OpenAI. Vous devez seulement changer deux choses : l’URL de base de https://api.openai.com/v1 à https://api.orcarouter.ai/v1, et l’ID du modèle de "gpt-4o-2024-05-13" à "openai/gpt-4o-2024-05-13". Votre clé API d’OrcaRouter remplace votre clé OpenAI. Tout le code existant qui utilise la bibliothèque Python/Node d’OpenAI ou des requêtes HTTP brutes fonctionnera sans autres modifications. Le format des messages, les noms des paramètres et la structure des réponses sont identiques. Pour les bibliothèques qui acceptent un paramètre d’URL de base, définissez-le simplement sur le point de terminaison d’OrcaRouter. Si vous utilisiez le client d’OpenAI, vous pouvez l’instancier avec base_url défini sur le point de terminaison d’OrcaRouter. Aucune modification de la conception des prompts ou de la logique de mise en cache n’est requise. OrcaRouter prend également en charge le streaming (stream: true) et l’appel de fonction exactement comme avant. Les tests peuvent être effectués avec un petit ensemble de requêtes pour vérifier que le comportement correspond.
OrcaRouter ne modifie pas le comportement du modèle. Il agit uniquement comme une passerelle, transférant vos requêtes aux serveurs d’OpenAI et renvoyant la réponse telle quelle. Aucun prétraitement, post-traitement ou filtrage de contenu supplémentaire n’est appliqué par OrcaRouter. Concernant le traitement des données : OrcaRouter ne stocke ni ne consigne les données de prompt ou de complétion au-delà de ce qui est nécessaire pour la facturation et la surveillance opérationnelle. Les propres politiques de données d’OpenAI s’appliquent à l’utilisation du modèle via OrcaRouter. Selon les faits fournis, il n’est fait mention d’aucune conservation des données par OrcaRouter au-delà de la journalisation standard de l’API. Les utilisateurs devraient consulter à la fois la politique de confidentialité d’OrcaRouter et celle d’OpenAI pour comprendre le traitement des données. Si vous avez des exigences strictes en matière de résidence des données, consultez OrcaRouter pour connaître les options disponibles. Rien n’indique qu’OrcaRouter partage des données avec d’autres clients. L’ID du modèle est la seule modification nécessaire ; aucune instruction personnalisée n’est injectée.
Les principales différences entre GPT-4o et GPT-4o-mini sont la taille de la fenêtre de contexte, les capacités multimodales, les performances de référence et le coût. GPT-4o offre une fenêtre de contexte de 128K et prend en charge les entrées d'images et de fichiers. GPT-4o-mini (selon les offres d'OpenAI) a généralement un contexte plus petit (par exemple 128K ou 16K sur certaines versions) et peut ne pas prendre en charge toutes les modalités. Sur MATH-500, GPT-4o obtient un score de 79,1 ; GPT-4o-mini obtiendrait un score inférieur. Tarification : GPT-4o coûte 5 $ / 15 $ par million de jetons, tandis que GPT-4o-mini est nettement moins cher (par exemple 0,15 $ / 0,60 $ par million de jetons dans certaines versions). Ainsi, GPT-4o-mini est adapté aux tâches plus simples où un coût réduit est primordial, tandis que GPT-4o est meilleur pour le raisonnement complexe, les tâches à long contexte et multimodales. Lors du choix entre eux, il faut tenir compte des exigences de précision et du besoin de vision ou de gestion de fichiers. OrcaRouter propose les deux modèles sous des identifiants distincts. Si votre charge de travail utilise rarement des images ou un grand contexte, GPT-4o-mini peut être le choix économiquement supérieur.
GPT-4o (2024-05-13) est un modèle multimodal avec une fenêtre de contexte de 128K, tandis que les versions plus anciennes de GPT-4 (telles que gpt-4-0613) ont généralement un contexte de 8K ou 32K et sont uniquement textuelles (certaines versions ultérieures prennent en charge les images via des points de terminaison de vision distincts). La tarification de GPT-4o (5 $ / 15 $ par million de tokens) est généralement inférieure au prix de GPT-4 Turbo à son apogée (par exemple, 10 $ / 30 $ par million de tokens). Performances sur les benchmarks : le score MATH-500 fourni de 79,1 correspond à GPT-4o ; GPT-4 n'avait pas de score MATH-500 officiel dans les faits fournis, mais il était connu pour obtenir des scores inférieurs sur des benchmarks mathématiques similaires. GPT-4o offre également une limite de sortie plus élevée (16K tokens) par rapport aux anciens GPT-4 (4K ou 8K selon la version). Dans l'ensemble, GPT-4o offre un meilleur rapport qualité-prix pour les applications multimodales et à long contexte. Cependant, les anciens modèles GPT-4 peuvent avoir été affinés pour des tâches spécifiques ; évaluez sur vos propres données. Grâce à OrcaRouter, les deux familles de modèles sont accessibles.
Une comparaison directe nécessite des faits spécifiques aux modèles qui ne sont pas fournis ici. En général, les deux modèles sont compétitifs en matière de raisonnement et de capacités multimodales. GPT-4o dispose d'une fenêtre de contexte de 128K, similaire au contexte de 200K de Claude (pour Sonnet). Les deux prennent en charge les images. Les scores des benchmarks varient : GPT-4o fournit un score MATH-500 de 79.1 ; les scores de Claude 3.5 Sonnet sur ce benchmark ne sont pas fournis. Tarification : GPT-4o est à $5/$15 par million de tokens ; la tarification de Claude Sonnet est généralement d'environ $3/$15 par million de tokens (sujette à modification). Ainsi, les coûts d'entrée pour GPT-4o sont plus élevés. Les différences de performances dépendent de la tâche : certains utilisateurs trouvent Claude supérieur pour l'écriture de longs textes, tandis que GPT-4o excelle en mathématiques et en codage. Sans évaluation contrôlée, il est recommandé de tester les deux sur des échantillons représentatifs. OrcaRouter propose les deux modèles, vous pouvez donc comparer facilement en changeant l'ID du modèle. En fin de compte, le meilleur modèle dépend de vos exigences spécifiques en matière de précision, de latence et de coût. Les faits fournis n'incluent pas les scores de Claude, cette comparaison reste donc qualitative.
Llama 3 (par exemple, Llama 3 70B) est un modèle open-source qui peut être auto-hébergé, tandis que GPT-4o est propriétaire et accessible via API. GPT-4o prend en charge les entrées multimodales (texte, image, fichier) avec un contexte de 128K, alors que Llama 3 est généralement limité au texte (sauf si finement ajusté pour la vision) et a un contexte plus petit (par exemple, 8K ou 32K). Scores de référence : le score MATH-500 de GPT-4o est de 79.1 ; Llama 3 70B obtient environ 70–75 sur des benchmarks mathématiques similaires (non fournis dans les faits, mais connaissances générales). Coût : le coût de l'API de GPT-4o par token est fixe ; l'auto-hébergement de Llama 3 implique des coûts d'infrastructure (GPU, électricité) qui peuvent être inférieurs à volume élevé. Latence : GPT-4o basé sur API peut être plus rapide pour les charges de travail en rafale ; les modèles auto-hébergés peuvent offrir une latence constante si la capacité est réservée. Flexibilité : Llama 3 peut être finement ajusté ; GPT-4o ne le peut pas. Pour les utilisateurs souhaitant éviter la dépendance vis-à-vis d'un fournisseur ou traiter des données sensibles entièrement sur site, les modèles open-source sont attrayants. OrcaRouter donne accès aux deux types : vous pouvez utiliser GPT-4o via API et également accéder aux modèles open-source via OrcaRouter si disponibles.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrée / 1M tokens | $5.00 |
|---|---|
| Sortie / 1M tokens | $15.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
Ce dont parlent les développeurs cette semaine
GET /api/public/models/openai/gpt-4o-2024-05-13Ouvrir @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13