GPT-4o mini est le nouveau modèle d'OpenAI après [GPT-4 Omni](/models/openai/gpt-4o), prenant en charge les entrées de texte et d'image avec des sorties de texte. En tant que son petit modèle le plus avancé, il est plusieurs fois plus abordable...
GPT-4o-mini (2024-07-18) est un modèle multimodal léger développé par OpenAI, conçu pour un traitement économique du texte et des images. Il est destiné aux développeurs et aux organisations ayant…
GPT-4o-mini peut effectuer des tâches de raisonnement d'image telles que décrire le contenu visuel, répondre à des questions sur des images et identifier des objets ou du texte dans des images. Il prend en charge les formats d'image standard (JPEG, PNG, GIF, WebP) et peut traiter plusieurs images dans une seule requête. Le modèle n'effectue pas de détection d'objets au sens structuré des boîtes englobantes, mais il peut décrire des emplacements et des relations. Par exemple, il peut lire du texte à partir d'une photographie, comprendre des graphiques et des diagrammes, et fournir des descriptions détaillées de scènes. La précision des tâches basées sur l'image dépend de la résolution et du contexte ; les images haute résolution peuvent entraîner des coûts de tokens plus élevés mais peuvent donner de meilleurs résultats pour les détails fins.
GPT-4o-mini accepte des fichiers tels que des PDF, des documents Word et des fichiers image via la structure de contenu multimodal. Lorsqu'un fichier est fourni, le modèle en extrait le texte et le contenu image, permettant aux utilisateurs de poser des questions sur le contenu du document, d'en résumer le texte ou d'analyser les tableaux et figures intégrés. Le fichier n'est ni téléchargé ni stocké ; il est traité en ligne lors de l'appel API. Cela est utile pour des flux de travail impliquant la révision de documents, l'analyse de contrats ou l'extraction de données à partir de formulaires scannés. Notez que les fichiers très volumineux peuvent dépasser la fenêtre de contexte de 128 000 tokens ou entraîner des coûts de token élevés.
Pour les tâches qui ne nécessitent qu'une génération de texte légère, les budgets de tokens peuvent être mieux utilisés par des modèles encore moins chers comme GPT-3.5-Turbo ou des alternatives open-source (par exemple, Llama 3 8B). Si votre charge de travail n'a pas besoin d'entrée multimodale ou d'un contexte de 128k, un modèle plus petit pourrait réduire davantage les coûts. De plus, pour des tâches restreintes telles que la classification simple ou l'extraction de mots-clés, un modèle plus petit et affiné peut offrir une latence et un coût plus faibles. Cependant, la combinaison d'un prix bas, d'un grand contexte et de capacités multimodales de GPT-4o-mini en fait un choix par défaut solide pour de nombreuses applications à usage général.
GPT-4o-mini excelle dans les environnements de production à haut volume qui bénéficient d'une compréhension multimodale et de grands contextes. Les cas d'utilisation idéaux incluent les chatbots de support client capables de traiter des captures d'écran et de longs historiques de conversation, les pipelines de traitement de documents pour extraire des données de PDF ou d'images, les outils éducatifs pour le tutorat en mathématiques (comme en témoigne son score de 78,9 sur MATH-500), et le débogage de code où le texte et les diagrammes sont impliqués. Il est également bien adapté aux flux de travail de modération de contenu nécessitant une analyse d'image en complément du texte. Le faible coût par jeton permet de passer à l'échelle pour des millions de requêtes sans frais prohibitifs.
GPT-4o-mini obtient un score de 78,9 sur le benchmark MATH-500, un sous-ensemble du dataset MATH composé de 500 problèmes mathématiques difficiles. Ce score indique la capacité du modèle à résoudre des problèmes d'arithmétique, d'algèbre, de géométrie et d'autres mathématiques avec un raisonnement étape par étape. Un score de 78,9 le place au-dessus de nombreux modèles plus petits et de certaines variantes antérieures de GPT-4, suggérant de fortes capacités de raisonnement pour un modèle de sa taille et de son coût. Cependant, il n'est pas aussi performant que le GPT-4o complet ou le GPT-4 Turbo sur le même benchmark. Le résultat doit être interprété en contexte : GPT-4o-mini est conçu pour l'efficacité, pas pour une précision maximale.
Les chiffres de latence spécifiques ne sont pas divulgués publiquement par OpenAI, mais GPT-4o-mini est généralement plus rapide que les modèles GPT-4 plus volumineux en raison de son nombre réduit de paramètres. En pratique, les utilisateurs rapportent un temps jusqu'au premier token de quelques centaines de millisecondes pour des prompts courts, et un débit de génération de plusieurs dizaines de tokens par seconde. La latence dépend du nombre total de tokens (entrée + sortie), du nombre d'images et de la charge actuelle du serveur. Étant donné qu'OrcaRouter agit comme un proxy, la latence réseau supplémentaire est minime—généralement de l'ordre de quelques millisecondes par rapport à la latence directe de l'API OpenAI. Le modèle prend en charge le streaming pour les applications en temps réel.
Points forts : Rentabilité (tarif le plus bas parmi les membres de la famille GPT-4 avec support multimodal), large fenêtre contextuelle de 128k, raisonnement mathématique solide (78,9 MATH-500), et inférence rapide par rapport aux modèles plus grands. Il gère correctement les entrées d’images et de fichiers pour les tâches générales. Limitations : Sur les raisonnements complexes et nuancés ou l’écriture créative, ses performances sont inférieures à celles de GPT-4o et GPT-4 Turbo. Son suivi des instructions peut être moins fiable pour les tâches nécessitant un formatage strict ou des contraintes multi-étapes. De plus, en tant que modèle plus petit, sa date limite de connaissances (janvier 2024) peut être obsolète pour les événements très récents. Il ne prend pas non plus en charge les capacités de vision pour la détection fine d’objets ou la reconnaissance faciale.
Les prix sont fixés à 0,15 $ par million de jetons d'entrée et 0,60 $ par million de jetons de sortie. Il s'agit des tarifs standard du fournisseur OpenAI, et OrcaRouter n'applique aucune marge supplémentaire. La facturation est basée sur le nombre de jetons tel que rapporté par le fournisseur du modèle. Il n'y a aucuns frais supplémentaires par requête ni minimum. La politique de marge nulle s'applique à tous les modèles disponibles via OrcaRouter, ce qui rend les prix identiques à ce que vous paieriez directement à OpenAI. Cette transparence permet aux utilisateurs de budgétiser avec précision sans coûts surprises.
Les jetons de sortie sont quatre fois plus chers par jeton que les jetons d'entrée (0,60 $ contre 0,15 $ par million). Pour les tâches qui génèrent de longues réponses, comme les résumés détaillés ou la génération de code, les coûts de sortie peuvent dominer. Les utilisateurs peuvent contrôler l'utilisation des jetons de sortie via le paramètre max_tokens et en élaborant des invites qui suscitent des réponses concises. Inversement, les tâches avec de grandes entrées (par exemple, le traitement de longs documents avec de nombreuses images) engendrent des coûts d'entrée. La grande fenêtre de contexte de 128k permet d'inclure facilement un contexte substantiel, mais cela se fait au taux d'entrée par jeton. Optimiser l'équilibre entre la longueur d'entrée et de sortie est essentiel pour gérer le coût global.
OrcaRouter n'offre actuellement pas de mise en cache intégrée pour les requêtes GPT-4o-mini au-delà de ce que fournit OpenAI au niveau de l'API. Il n'y a pas de remises sur le volume ni d'options de capacité réservée disponibles via OrcaRouter ; la tarification est strictement en paiement à l'utilisation, au tarif du fournisseur OpenAI. Les utilisateurs sont responsables de la mise en œuvre de leurs propres stratégies de mise en cache (par exemple, au niveau de l'application) pour réduire les appels API redondants. La politique de marge zéro signifie que toute modification future des prix par OpenAI est répercutée automatiquement. Pour les cas d'utilisation à très haut volume, les accords directs avec OpenAI pour les entreprises pourraient offrir de meilleures conditions, mais via OrcaRouter, la simplicité d'une clé API unique et d'une facturation unifiée peut encore être avantageuse.
Les images traitées par GPT-4o-mini sont converties en jetons en fonction de leur résolution et de leur niveau de détail. OpenAI utilise un algorithme de calcul de jetons qui prend en compte à la fois la largeur et la hauteur ; par exemple, une image typique de 1024x1024 avec un niveau de détail élevé peut coûter environ 2 000–3 000 jetons d'entrée. Étant donné que les jetons d'entrée sont facturés à 0,15 $ par million, le coût par image est très faible (généralement inférieur à un centime). Cependant, le traitement de nombreuses images dans une seule requête peut s'accumuler. Les utilisateurs peuvent contrôler les coûts en utilisant le niveau de détail `low` (coûte environ 85 jetons par image) lorsque la haute fidélité n'est pas nécessaire. Vérifiez toujours les jetons utilisés dans la réponse de l'API pour comprendre les coûts des images.
Définissez l'URL de base de votre API sur https://api.orcarouter.ai/v1 et utilisez l'ID de modèle "openai/gpt-4o-mini-2024-07-18". L'API suit le format standard des complétions de chat OpenAI. Par exemple, en Python : openai.api_base = "https://api.orcarouter.ai/v1"; openai.api_key = "your-orcarouter-key"; response = openai.ChatCompletion.create(model="openai/gpt-4o-mini-2024-07-18", messages=[{"role":"user","content":"Hello!"}]). Tous les paramètres tels que temperature, top_p, max_tokens, stream et stop sequences sont pris en charge comme dans l'API OpenAI d'origine. Les réponses incluent les champs standards comme id, choices, usage avec les compteurs de tokens.
Pour des sorties déterministes, réglez temperature=0 et top_p=1. Pour les tâches créatives, une température autour de 0,8 à 1,2 peut être appropriée. Max_tokens contrôle la longueur de la réponse ; la valeur par défaut est 16 384. Pour réduire le coût de sortie, définissez max_tokens en fonction de vos besoins. Lorsque vous utilisez des entrées multimodales, structurez les messages avec un tableau de parties de contenu : [{"type":"text","text":"Décrivez ceci :"}, {"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]. Pour le traitement de fichiers, incluez le contenu du fichier sous forme de texte ou en base64. Le paramètre stop peut être utilisé pour interrompre la génération à des séquences personnalisées. Stream=True permet la livraison de tokens en temps réel.
La migration nécessite trois modifications simples : définissez le base_url sur https://api.orcarouter.ai/v1, remplacez votre clé API par votre clé API OrcaRouter, et modifiez l'ID du modèle en "openai/gpt-4o-mini-2024-07-18". Aucune autre modification de code ne devrait être nécessaire si vous utilisez les bibliothèques OpenAI Python/Node.js ou tout client HTTP qui suit le format standard des chat completions. La structure de réponse est identique. Notez qu'OrcaRouter ne limite pas vos requêtes différemment d'OpenAI ; les mêmes limites de débit s'appliquent en fonction de votre niveau de compte OpenAI, mais vous gérez les clés via OrcaRouter. Testez avec une petite requête pour vérifier les compteurs de tokens et la latence.
Fournissez votre clé API OrcaRouter dans l'en-tête Authorization : Authorization: Bearer <your-key>. L'API renvoie des codes de statut HTTP standard : 200 pour succès, 400 pour requête incorrecte (par exemple, paramètres invalides), 401 pour non autorisé (mauvaise clé API), 429 pour limitation de débit, et 500 pour erreurs serveur. Les réponses d'erreur incluent un corps JSON avec un objet error contenant un message et un type. Il est recommandé d'implémenter des tentatives avec backoff exponentiel pour les erreurs 429 et 5xx. OrcaRouter ne modifie pas les réponses d'erreur d'OpenAI, donc les mêmes messages d'erreur que vous voyez avec l'API directe apparaîtront.
GPT-4o-mini est significativement plus performant que GPT-3.5-Turbo en raisonnement, mathématiques et suivi d'instructions, comme le montre son score de 78,9 sur MATH-500 contre un score typique d'environ 30-40 pour GPT-3.5-Turbo. Il prend également en charge les entrées multimodales (images et fichiers), ce que GPT-3.5-Turbo ne fait pas. La fenêtre de contexte est plus grande : 128k contre 16k. Tarification : GPT-4o-mini (0,15 $/0,60 $ par million de tokens) est légèrement plus cher que GPT-3.5-Turbo (0,50 $/1,50 $ pour la version 16k ? En réalité, GPT-3.5-Turbo 0125 coûte 0,50 $/1,50 $ par million ? Attendez, le GPT-3.5-Turbo standard coûte 1,50 $/2,00 $ par million ? Je vais m'en tenir aux faits fournis : le prix de GPT-4o-mini est donné. Comparez qualitativement : GPT-4o-mini offre de meilleures performances à un coût légèrement supérieur à celui de GPT-3.5-Turbo, mais avec une capacité multimodale. réflexion
GPT-4o-mini est une version plus petite et plus économique de GPT-4o. Bien que tous deux partagent des capacités multimodales et la même taille de fenêtre de contexte (128k tokens), GPT-4o obtient des scores plus élevés sur des benchmarks comme MMLU et MATH. Le score MATH-500 de GPT-4o-mini, de 78,9, est inférieur au score rapporté de GPT-4o, qui est d'environ 90 à 95. La tarification est nettement moins chère : GPT-4o-mini (0,15 $ / 0,60 $) contre GPT-4o (2,50 $ / 10,00 $ par million de tokens). Pour les applications où la précision maximale sur des tâches de raisonnement complexes est cruciale, GPT-4o est préférable. Pour les tâches à haut débit et sensibles aux coûts où une précision modérée est acceptable, GPT-4o-mini offre des économies substantielles.
Les modèles open source comme Llama 3 8B et 70B offrent l'avantage de l'auto-hébergement pour un coût zéro par jeton, mais nécessitent une infrastructure et une expertise. GPT-4o-mini via OrcaRouter propose un accès serverless sans frais initiaux et une mise à l'échelle automatique. Sur les benchmarks, le score MATH-500 de GPT-4o-mini (78,9) est compétitif par rapport à Llama 3 8B (environ 30-40) et plus proche de Llama 3 70B (environ 60-70). GPT-4o-mini prend également en charge les images nativement, ce que la plupart des modèles open source ne font pas. Le compromis : les modèles open source offrent la confidentialité des données (aucun appel API externe) et une latence plus faible si le matériel d'inférence est disponible. GPT-4o-mini offre une facilité d'utilisation et une capacité multimodale à un faible prix par jeton.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini-2024-07-18",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrée / 1M tokens | $0.150 |
| Sortie / 1M tokens | $0.600 |
| Lecture cache / 1M | $0.075 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4o-mini-2024-07-18Ouvrir @misc{orcarouter_gpt_4o_mini_2024_07_18,
title = {GPT-4o-mini (2024-07-18) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18}
}OpenAI. (2024). GPT-4o-mini (2024-07-18) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini-2024-07-18