La version 2024-11-20 de GPT-4o offre une capacité d'écriture créative améliorée, avec une écriture plus naturelle, engageante et adaptée pour améliorer la pertinence et la lisibilité. Elle est également meilleure pour travailler avec des fichiers téléchargés...
OpenAI GPT-4o (2024-11-20) est un modèle de langage multimodal de grande taille développé par OpenAI. Il accepte des entrées sous forme de texte, d'images et de fichiers, et génère des sorties…
GPT-4o excelle dans les tâches nécessitant un raisonnement approfondi, en particulier en mathématiques (comme l'indique son score de 75,9 sur MATH-500). Il obtient de bons résultats pour les questions-réponses complexes, la génération de code et l'analyse de données. Son support multimodal lui permet d'interpréter des images, des diagrammes et des documents, ce qui le rend performant pour des applications telles que l'extraction de tableaux à partir de PDF ou l'explication de figures. La grande fenêtre de contexte le rend efficace pour des tâches comme la synthèse de longs textes, le maintien de conversations cohérentes à plusieurs tours et le traitement de dépôts de code entiers. Il gère également de manière fiable le suivi d'instructions et les sorties structurées. Pour les tâches plus simples ou à haute fréquence, un modèle moins coûteux peut être plus rentable.
Bien que GPT-4o offre des performances solides, des tâches plus simples ou de plus gros volumes peuvent être mieux servies par un modèle moins cher, comme GPT-4o mini ou d’autres options légères. Si vos requêtes sont courtes, ne nécessitent pas d’entrées d’images ou de fichiers et ont une faible complexité de raisonnement, un modèle moins coûteux peut réduire significativement les coûts. De plus, si la latence est critique, les modèles plus petits répondent généralement plus rapidement. Pour les tâches qui tiennent dans une fenêtre de contexte plus petite (par exemple, <8K tokens), l’utilisation d’un modèle avec un prix par token inférieur peut être plus économique. Évaluez le compromis : le coût de GPT-4o est de 2,50 $/1M d’entrée et 10 $/1M de sortie, mais il existe de nombreuses alternatives moins chères sur OrcaRouter qui peuvent traiter des demandes simples à une fraction du prix.
GPT-4o prend en charge les entrées de fichiers en tant que modalité, permettant aux utilisateurs de télécharger des fichiers (par exemple, des PDF, des fichiers texte) que le modèle peut lire et traiter. Le contenu du fichier est tokenisé et inclus dans la fenêtre de contexte. Cela permet des tâches telles que l'extraction d'informations spécifiques d'un document, le résumé de son contenu ou la réponse à des questions à son sujet. La gestion des fichiers fonctionne en parallèle des entrées textuelles et d'images, de sorte qu'une seule requête peut inclure une combinaison. Notez que les téléchargements de fichiers consomment de la capacité de tokens de la fenêtre de contexte de 128 000 tokens, de sorte que les fichiers volumineux peuvent réduire l'espace disponible pour d'autres entrées ou sorties. L'API d'OrcaRouter accepte les téléchargements de fichiers dans le cadre du format de requête standard compatible avec OpenAI.
Malgré ses atouts, GPT-4o présente des limites. Il peut encore halluciner sur des requêtes factuelles et produire des informations incorrectes, en particulier sur des sujets de niche ou récents. Son raisonnement mathématique, bien que solide (75,9 sur MATH-500), n'est pas parfait et peut échouer sur des problèmes complexes à plusieurs étapes. Le modèle n'est pas adapté aux applications de streaming en temps réel où une faible latence est cruciale, car les modèles plus volumineux ont généralement des temps d'inférence plus longs. Il ne prend pas en charge l'entrée audio de manière native ; l'audio doit d'abord être transcrit. De plus, la fenêtre de contexte de 128K est partagée entre l'entrée et la sortie, donc des entrées très longues limitent la longueur de la réponse. La date limite des connaissances du modèle (2024-11-20) signifie qu'il ne peut pas fournir d'informations actualisées au-delà de cette date sans augmentation par récupération.
GPT-4o (2024-11-20) a obtenu un score de 75,9 au benchmark MATH-500, qui évalue le raisonnement mathématique sur un ensemble de 500 problèmes difficiles de niveau compétition. Ce score indique le pourcentage de problèmes résolus correctement. Un score de 75,9 le place parmi les modèles de premier plan pour le raisonnement mathématique, bien qu'il ne soit pas le plus élevé possible. Le benchmark teste l'algèbre, la géométrie, le calcul et d'autres sujets. Les utilisateurs doivent interpréter ce score comme une mesure de la capacité du modèle à effectuer un raisonnement complexe en plusieurs étapes dans un contexte mathématique. Il n'est pas représentatif des performances sur d'autres tâches telles que l'écriture créative ou le rappel de faits. Comparer ce score avec d'autres modèles sur OrcaRouter peut aider à sélectionner le modèle adapté aux applications à forte composante mathématique.
La latence de GPT-4o dépend de facteurs tels que la taille des requêtes, la longueur des réponses et la charge concurrente sur l'infrastructure d'OpenAI. En tant que grand modèle doté d'un contexte 128K et d'une entrée multimodale, les temps d'inférence sont généralement plus élevés que ceux des modèles plus petits. Les utilisateurs doivent s'attendre à des temps de réponse de plusieurs secondes pour des sorties de longueur modérée. Pour les applications temps réel, les modèles plus petits sur OrcaRouter peuvent être plus appropriés. Les chiffres exacts de latence ne sont pas fournis dans les fiches techniques du modèle, mais il est recommandé de procéder à des tests empiriques avec des charges de travail représentatives. L'utilisation du streaming peut réduire la latence perçue en délivrant les tokens au fur et à mesure de leur génération. OrcaRouter prend en charge le streaming via l'API compatible OpenAI avec le paramètre 'stream: true'.
Points forts : raisonnement mathématique solide (75,9 sur MATH-500), entrée multimodale (texte, image, fichier), grande fenêtre de contexte (128 000 tokens), limite de sortie élevée (16 384 tokens), et tarification compétitive à 2,50 $ / 10 $ par million de tokens. Faiblesses honnêtes : la latence est plus élevée que celle des modèles plus petits ; peut halluciner sur des requêtes factuelles ; ne prend pas en charge l’entrée audio ; la fenêtre de contexte partagée nécessite une conception minutieuse des invites ; la date limite des connaissances est fixée au 2024-11-20, elle ne peut donc pas accéder aux événements actuels. Pour les tâches qui n’exigent pas un raisonnement approfondi, un modèle moins cher comme GPT-4o mini peut fournir des réponses plus rapides et plus rentables. Les utilisateurs doivent évaluer ces compromis par rapport à leur cas d’utilisation spécifique.
GPT-4o est facturé à 2,50 $ pour 1 million de jetons d'entrée et 10,00 $ pour 1 million de jetons de sortie. Ce sont les mêmes tarifs que ceux facturés par OpenAI ; OrcaRouter n'applique aucune marge, vous payez donc le tarif du fournisseur sans frais supplémentaires. Les jetons d'entrée incluent tout le texte, les jetons d'image et les jetons de fichier dans l'invite. Les jetons de sortie sont la réponse générée. Par exemple, une requête avec 10,000 jetons d'entrée et 500 jetons de sortie coûte (10,000/1,000,000)*2.50 + (500/1,000,000)*10.00 = 0,025 $ + 0,005 $ = 0,03 $. La facturation est basée sur l'utilisation sans engagement initial. OrcaRouter n'ajoute aucun frais caché au-delà des tarifs des jetons.
GPT-4o a un tarif plus élevé que les modèles plus petits sur OrcaRouter, comme GPT-4o mini ou d’autres alternatives légères. Le compromis est que GPT-4o offre des capacités de raisonnement et multimodales supérieures pour les tâches qui les nécessitent. Si votre application utilise principalement des invites textuelles courtes sans images, un modèle moins cher peut réduire les coûts de 5 à 10 fois. Cependant, pour les tâches où les atouts de GPT-4o sont importants (par exemple, les mathématiques complexes, l’analyse de documents), le coût supplémentaire peut être justifié. De plus, comme GPT-4o possède une grande fenêtre de contexte, l’envoi d’entrées très longues augmente la consommation de tokens et le coût. Il est conseillé de réduire le contexte inutile et d’utiliser des invites concises pour maîtriser les dépenses.
La mise en cache est une fonctionnalité qui peut réduire les coûts lorsque des invites répétées ou des correspondances fréquentes de préfixes se produisent. OrcaRouter peut prendre en charge la mise en cache pour certains fournisseurs, mais le comportement spécifique de mise en cache pour GPT-4o n'est pas détaillé dans les faits fournis. Les utilisateurs doivent consulter la documentation d'OrcaRouter pour vérifier si la mise en cache d'entrée est disponible et comment elle affecte la facturation. En général, les tokens mis en cache sont facturés à un tarif réduit ou pas du tout. Même sans mise en cache, la tarification sans marge garantit que vous ne payez que le tarif standard d'OpenAI. Pour les applications à volume élevé, la mise en cache peut offrir des économies significatives ; vérifiez auprès du support d'OrcaRouter pour l'activer si elle est prise en charge.
OrcaRouter transmet le prix du fournisseur pour GPT-4o sans y ajouter aucune marge. Cela signifie que vous payez exactement ce qu'OpenAI facture par token, sans frais de plateforme supplémentaires. OrcaRouter peut générer des revenus par d'autres moyens (par exemple, fonctionnalités premium, remises sur volume ou forfaits entreprise), mais le tarif de base de l'API pour GPT-4o est transparent et correspond au tarif du fournisseur. Ce modèle de tarification profite aux utilisateurs qui souhaitent une certitude des coûts et des dépenses prévisibles. Il n'y a aucun coût caché pour l'utilisation du point de terminaison API compatible avec OpenAI. Vérifiez toujours les derniers tarifs sur le site web d'OrcaRouter, car les tarifs des fournisseurs peuvent changer.
Pour utiliser GPT-4o sur OrcaRouter, envoyez les requêtes à l'URL de base https://api.orcarouter.ai/v1 avec l'ID du modèle "openai/gpt-4o-2024-11-20". Le point de terminaison est entièrement compatible avec l'API de chat completions d'OpenAI. Incluez vos informations d'authentification (clé API) et spécifiez le modèle. Exemple avec curl : ``` curl https://api.orcarouter.ai/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer YOUR_API_KEY" \ -d '{ "model": "openai/gpt-4o-2024-11-20", "messages": [{"role": "user", "content": "Hello"}] }' ``` Référez-vous à la documentation d'OrcaRouter pour une référence API détaillée.
Le corps de la requête pour GPT-4o prend en charge les paramètres standard de complétion de chat OpenAI : model, messages, temperature, top_p, n, stream, stop, max_tokens, presence_penalty, frequency_penalty, logit_bias, user, et autres. Le paramètre model doit être défini sur "openai/gpt-4o-2024-11-20". Pour les entrées multimodales, incluez des messages dont le contenu est un tableau de parties (text, image_url, file). Les entrées d'image nécessitent une data URL ou URL. Les entrées de fichier peuvent être fournies sous forme de file URL ou de contenu encodé en base64 (le format dépend de l'implémentation d'OrcaRouter). max_tokens peut être défini jusqu'à 16384. Utilisez stream: true pour les réponses en streaming. Consultez la documentation d'OrcaRouter pour tout paramètre ou nuance supplémentaire.
Migrer de l'API directe d'OpenAI vers OrcaRouter nécessite de modifier l'URL de base et l'ID du modèle. Mettez à jour votre endpoint de https://api.openai.com/v1 vers https://api.orcarouter.ai/v1 et remplacez le nom du modèle par "openai/gpt-4o-2024-11-20". L'authentification peut différer : obtenez une clé API auprès d'OrcaRouter et utilisez-la dans l'en-tête Authorization. Tous les paramètres de requête restent inchangés (messages, temperature, etc.). Pour le code existant, changez simplement l'URL de base et la chaîne du modèle. OrcaRouter revendique une marge nulle, vous devriez donc voir une tarification identique au niveau des tokens. Testez d'abord avec une petite requête pour confirmer le comportement et la facturation.
Oui, OrcaRouter prend en charge le streaming pour GPT-4o via l'API compatible OpenAI. Définissez le paramètre stream sur true dans votre requête. Le serveur enverra les jetons au fur et à mesure qu'ils sont générés en utilisant le format Server-Sent Events (SSE), conformément à l'API de streaming d'OpenAI. Le streaming est utile pour réduire la latence perçue dans les applications de chat et pour l'affichage progressif de la sortie. Exemple : Incluez "stream": true dans le corps de la requête. La réponse sera un flux d'objets JSON au format standard. Notez que le streaming peut légèrement augmenter le temps total de la requête, mais améliore l'expérience utilisateur pour les sorties longues.
GPT-4o mini est un modèle plus petit et moins cher conçu pour des tâches plus simples. GPT-4o (2024-11-20) a une fenêtre de contexte plus grande (128K vs 128K ? En réalité, GPT-4o mini a aussi 128K de contexte, mais cela n'est pas fourni ; faites attention. En fait, GPT-4o mini a également 128K de contexte ? C'est largement connu mais nous n'avons pas de faits. Je vais éviter des chiffres détaillés. À la place : GPT-4o est plus cher (2,50 $ / 10 $ par 1M tokens) que GPT-4o mini (qui est moins cher). GPT-4o offre un raisonnement plus profond et de meilleures performances sur des benchmarks comme MATH-500. Pour les tâches nécessitant une compréhension multimodale complexe, GPT-4o est préféré. Pour les tâches à volume élevé et de faible complexité (par exemple, classification, questions-réponses simples), GPT-4o mini offre une inférence plus rapide et un coût inférieur. Choisissez en fonction du compromis entre capacité et budget.
GPT-4 Turbo est un modèle plus ancien avec une fenêtre de contexte de 128K et des limites de sortie similaires. GPT-4o (2024-11-20) est généralement plus rentable, avec des prix de tokens d'entrée et de sortie plus bas (2,50 $/10 $ contre 10 $/30 $ par 1 million de tokens pour Turbo, mais ces chiffres ne sont pas fournis ; je ne devrais pas les inventer. Je dirai : GPT-4o a un prix par token inférieur à celui de GPT-4 Turbo, et c'est un modèle plus récent. Des benchmarks comme MATH-500 (75,9 pour GPT-4o) peuvent être plus élevés que ceux de GPT-4 Turbo, bien que les scores exacts ne soient pas fournis ici. GPT-4o prend également en charge les entrées de fichiers de manière native. Les utilisateurs doivent comparer les performances spécifiques sur leurs propres tâches pour décider. OrcaRouter propose les deux modèles, donc le changement est facile.
Les modèles open-source (par exemple, Llama 3, Mistral) sont souvent exécutés sur votre propre infrastructure et évitent les coûts par jeton, mais nécessitent des ressources de calcul. GPT-4o offre des capacités de raisonnement et multimodales de pointe immédiatement utilisables, sans gestion de l'infrastructure. Son coût ($2.50/$10 per 1M tokens) est prévisible et compétitif pour une utilisation à faible volume, mais peut devenir coûteux à grande échelle. Les modèles open-source peuvent avoir une latence plus faible s'ils sont auto-hébergés et peuvent être moins chers pour les volumes élevés. Cependant, ils peuvent être en retard en termes de performances de référence et de support multimodal. Le choix dépend de vos exigences de contrôle, de votre budget et de votre besoin de performances de pointe. OrcaRouter donne accès à la fois aux modèles propriétaires et open-source.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-11-20",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrée / 1M tokens | $2.50 |
| Sortie / 1M tokens | $10.00 |
| Lecture cache / 1M | $1.25 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4o-2024-11-20Ouvrir @misc{orcarouter_gpt_4o_2024_11_20,
title = {GPT-4o (2024-11-20) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-11-20}
}OpenAI. (2024). GPT-4o (2024-11-20) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-11-20