GPT-4o mini est le nouveau modèle d'OpenAI après [GPT-4 Omni](/models/openai/gpt-4o), prenant en charge les entrées de texte et d'image avec des sorties de texte. En tant que son petit modèle le plus avancé, il est plusieurs fois plus abordable...
GPT-4o-mini est une variante plus petite et plus rapide du modèle GPT-4o d'OpenAI, optimisée pour un coût de calcul réduit tout en conservant des capacités multimodales. Elle peut traiter du texte,…
GPT-4o-mini excelle dans une large gamme de tâches linguistiques, y compris la synthèse, la traduction, la classification et le question-réponse. Il prend en charge la sortie JSON structurée, les appels de fonction et l'utilisation d'outils, permettant l'intégration avec des API et des bases de données externes. La fenêtre de contexte de 128K lui permet d'ingérer de grands documents ou historiques de conversations pour une analyse cohérente. Il obtient de bonnes performances sur les benchmarks courants (score de 78.9 sur MATH-500) et convient aux problèmes mathématiques éducatifs, à l'explication de code et à l'extraction de données. Pour les tâches plus simples, GPT-4o-mini égale souvent des modèles plus grands à une fraction du coût. Cependant, les tâches nécessitant une expertise approfondie du domaine ou des résultats très créatifs peuvent voir une qualité diminuée par rapport à GPT-4o.
Les images peuvent être fournies sous forme d'URL ou de données encodées en base64 dans la requête API. Le modèle interprète les images, comprenant le contenu visuel tels que les objets, le texte dans les images et les relations spatiales. Cela permet des cas d'usage comme le Q&A visuel, l'interprétation de diagrammes et la reconnaissance de chiffres manuscrits. Les tokens d'image sont comptabilisés dans la limite de contexte, donc les images haute résolution ou volumineuses consomment davantage du budget de 128K tokens. Le modèle ne génère pas d'images ; il les traite uniquement. Pour les tâches nécessitant des détails visuels fins (par exemple, l'imagerie médicale), un modèle de vision spécialisé peut être plus précis, mais GPT-4o-mini offre une solution polyvalente à un coût raisonnable.
GPT-4o-mini accepte les fichiers téléchargés en plus du texte et des images. Les types de fichiers courants incluent les PDF, .docx, .txt, .csv et .json. Le modèle extrait le texte et les éléments visuels pertinents (si le fichier contient des images intégrées) et les traite dans le contexte. Cela est utile pour analyser des articles de recherche, des contrats juridiques ou des feuilles de calcul sans copie manuelle. Notez que le contenu des fichiers contribue à l'utilisation des tokens ; par exemple, un PDF de 50 pages peut consommer plusieurs milliers de tokens. OrcaRouter facture en fonction du nombre total de tokens d'entrée, y compris ceux provenant des fichiers. Aucun frais supplémentaire de traitement de fichier n'est facturé au-delà de la consommation de tokens.
Si votre charge de travail implique uniquement du texte sans images ni fichiers, et que le contexte requis est inférieur à 16K tokens, un modèle plus petit (comme GPT-3.5-turbo) peut offrir un coût par token plus bas. De même, pour des tâches à très haut débit comme la classification simple ou des questions-réponses triviales, un modèle fine-tuné dédié pourrait être plus économique. GPT-4o-mini est rentable pour les cas d'utilisation multimodaux ou à long contexte, mais sa force réside dans l'équilibre entre performance et prix. Si votre application peut tolérer des réponses plus lentes ou un coût plus élevé pour une précision maximale, GPT-4o est une alternative. Évaluez votre tâche spécifique pour confirmer quel modèle atteint vos seuils de qualité et de budget.
MATH-500 est un sous-ensemble du benchmark MATH, composé de 500 problèmes mathématiques de niveau compétition couvrant l'algèbre, la géométrie, la théorie des nombres et les probabilités. Un score de 78,9 indique que GPT-4o-mini a correctement répondu à environ 78,9 % de ces problèmes. C'est un résultat solide pour un modèle plus petit, reflétant sa capacité de raisonnement mathématique. Il dépasse de nombreux modèles antérieurs de taille similaire. Cependant, les performances peuvent varier selon les domaines de problèmes spécifiques. Le benchmark est réalisé dans des conditions zero-shot, ce qui signifie qu'aucun exemple préalable n'est fourni. Pour un tutorat mathématique réel, le modèle peut nécessiter des instructions soigneuses pour gérer correctement les solutions en plusieurs étapes.
Bien que le seul benchmark fourni soit MATH-500, des informations publiques largement connues indiquent que GPT-4o-mini obtient également des scores compétitifs sur MMLU (compréhension massive de langage multitâche), HellaSwag et GSM8K. Il se classe généralement en dessous de GPT-4o mais au-dessus de GPT-3.5-turbo sur ces métriques. Sur les benchmarks de raisonnement, il montre de bonnes performances pour son nombre de paramètres. En matière d'écriture créative ou de génération ouverte, ses sorties sont cohérentes mais peuvent manquer de la nuance des modèles plus grands. La latence est généralement plus faible que celle de GPT-4o, ce qui le rend adapté aux applications en temps réel. Pour des scores exacts, reportez-vous à la documentation d'OpenAI. OrcaRouter donne accès sans majorations supplémentaires.
La latence dépend de la complexité de la requête, du nombre de jetons et de la charge de l'API. GPT-4o-mini est conçu pour être rapide—il renvoie généralement le premier jeton en moins d'une seconde pour des invites de longueur modérée. Pour des documents longs (par exemple, 50 000 jetons), la latence augmentera à mesure que le modèle traite l'ensemble du contexte. OrcaRouter ne modifie pas la vitesse ; vous bénéficiez des mêmes temps de réponse que les appels directs à l'API OpenAI. Le streaming est pris en charge pour réduire la latence perçue. Pour les applications critiques en termes de latence, envisagez de garder les invites courtes et d'utiliser le streaming. Le délai exact avant le premier jeton peut être mesuré en surveillant le temps de réponse ; aucun SLA spécifique n'est fourni.
Bien que performant, GPT-4o-mini présente des limitations en raison de sa taille réduite. Il peut produire des réponses moins précises sur des raisonnements complexes en plusieurs étapes par rapport à GPT-4o. Il peut parfois mal interpréter des instructions nuancées ou ne pas maintenir une parfaite cohérence sur des sorties très longues. Sa compréhension multimodale est bonne mais pas parfaite ; il peut manquer de petits détails dans les images ou mal compter des éléments. Le modèle peut présenter des biais présents dans ses données d'entraînement. Il ne prend pas en charge la recherche internet ou l'accès aux données en temps réel sauf s'il est explicitement affiné pour l'utilisation d'outils. Pour les tâches nécessitant une haute précision (par exemple, conseils juridiques, diagnostic médical), une révision humaine est essentielle. Les scores de référence reflètent des contextes contrôlés ; les performances réelles peuvent varier.
OrcaRouter transmet exactement la tarification d'OpenAI sans aucune majoration : $0.15 par million de jetons d'entrée et $0.60 par million de jetons de sortie. Les jetons d'entrée incluent tout le texte, les jetons d'image et le contenu des fichiers. Les jetons de sortie comptent le texte généré. Il n'y a pas de frais mensuels ni de frais cachés. Cela représente l'un des coûts par jeton les plus bas pour un modèle multimodal avec une fenêtre de contexte de 128K. À titre de comparaison, GPT-4o coûte $2.50 par million d'entrées et $10 par million de sorties, ce qui rend GPT-4o-mini 94 % moins cher en entrée et 94 % moins cher en sortie. L'avantage de coût est significatif pour les applications à volume élevé.
Bien que GPT-4o-mini soit bon marché par jeton, sa taille plus petite peut nécessiter davantage de tentatives ou un prompt plus détaillé pour atteindre la précision souhaitée, augmentant potentiellement la consommation totale de jetons. Pour les tâches où GPT-4o obtient la bonne réponse en un essai mais GPT-4o-mini en nécessite trois, le coût global peut être similaire, voire plus élevé. De plus, si vous devez soumettre de nombreuses petites requêtes, la surcharge des appels API peut ajouter de la latence mais pas de coût direct. La mise en cache n'est pas appliquée ; chaque requête est traitée à nouveau. Évaluez votre cas d'utilisation avec les deux modèles pour déterminer le meilleur équilibre coût-performance. OrcaRouter propose une tarification cohérente sans remises sur volume.
OrcaRouter n'implémente pas la mise en cache des prompts. Chaque requête vers GPT-4o-mini est envoyée aux serveurs d'OpenAI et facturée par token. Il n'y a pas de tarif réduit pour les prompts répétés. Si votre charge de travail répète fréquemment le même message système ou un contexte long, vous pouvez envisager de stocker la réponse de votre côté pour éviter de soumettre à nouveau des prompts identiques. Certains fournisseurs offrent des réductions pour la mise en cache des prompts, mais via OrcaRouter, vous payez le tarif standard du fournisseur. C'est transparent et prévisible. L'absence de mise en cache simplifie la tarification mais signifie que vous devez concevoir vos requêtes pour minimiser l'utilisation redondante de tokens.
(Remarque : Aucune autre variante de GPT-4o-mini n'est fournie. En supposant que la question porte sur la comparaison avec d'autres mini-modèles comme Claude 3 Haiku ou Gemini Flash, mais seuls des faits sont fournis. Au lieu de cela, nous comparons à GPT-4o.) Comparé à GPT-4o, GPT-4o-mini est nettement moins cher : 0,15 $ contre 2,50 $ par million de tokens en entrée (94 % moins cher) et 0,60 $ contre 10 $ par million de tokens en sortie (94 % moins cher). De nombreux utilisateurs estiment que GPT-4o-mini est adapté à 80 à 90 % des tâches, offrant d'énormes économies. Cependant, pour les tâches nécessitant une précision maximale (par exemple, génération de code complexe, raisonnement juridique nuancé), les économies de coûts peuvent ne pas justifier les baisses de qualité. OrcaRouter vous permet de basculer facilement entre les modèles via le même point de terminaison API en changeant l'ID du modèle.
Utilisez la bibliothèque cliente OpenAI ou tout client HTTP, en pointant l'URL de base vers https://api.orcarouter.ai/v1. Définissez le paramètre model sur "openai/gpt-4o-mini". L'authentification nécessite une clé API OrcaRouter. Un exemple minimal en Python : import openai client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your-key") response = client.chat.completions.create(model="openai/gpt-4o-mini", messages=[{"role": "user", "content": "Explain quantum computing."}]) Tous les paramètres de l'API OpenAI sont pris en charge, notamment temperature, max_tokens, stream et tools. OrcaRouter traite les requêtes vers OpenAI et renvoie les réponses inchangées.
Paramètres standard des OpenAI Chat Completions : model (obligatoire : "openai/gpt-4o-mini"), messages (tableau d'objets message), temperature (0-2, défaut 1), top_p (0-1, défaut 1), n (nombre de réponses, défaut 1), stream (booléen), stop (chaîne/tableau), max_tokens (jusqu'à 16384), presence_penalty, frequency_penalty, logit_bias, user (optionnel), et tools pour l'appel de fonctions. Pour la vision, incluez le contenu de l'image dans les messages (type "image_url" ou "image_url" avec detail). Les entrées de fichiers peuvent être encodées en base64. OrcaRouter transmet tous les paramètres à OpenAI. Remarque : Le format de réponse (mode JSON) est pris en charge ; définissez response_format={ "type": "json_object" } le cas échéant.
La migration est simple : modifiez l'URL de base dans votre client de `https://api.openai.com/v1` à `https://api.orcarouter.ai/v1` et remplacez votre clé API par une clé OrcaRouter. Mettez à jour le nom du modèle en `openai/gpt-4o-mini` (ou conservez-le en `gpt-4o-mini` ? Le fait indique que l'identifiant du modèle est `openai/gpt-4o-mini`, utilisez donc celui-ci). Tout autre code reste inchangé car l'API est entièrement compatible avec OpenAI. Vous pouvez également conserver plusieurs chaînes de modèles et router en fonction du coût ou de la capacité. OrcaRouter ne modifie pas le format de réponse. Testez avec quelques requêtes pour vous assurer que les en-têtes et le streaming fonctionnent comme prévu.
Oui, GPT-4o-mini prend en charge le streaming via les événements envoyés par le serveur (SSE). Définissez stream=true dans la requête. La réponse sera une série de morceaux contenant du contenu delta. Cela réduit le temps jusqu'au premier jeton pour les utilisateurs et permet un affichage en temps réel. OrcaRouter transmet les réponses de streaming sans modification. Notez que le nombre total de jetons facturés reste le même. Le streaming est compatible avec toutes les modalités d'entrée (texte, image, fichier). Vous pouvez également combiner le streaming avec des appels de fonction ; le modèle diffusera un morceau d'appel d'outil le cas échéant. Le paramètre max_tokens s'applique à l'ensemble de la réponse.
GPT-4o-mini est le petit frère moins cher de GPT-4o. Il coûte environ 94 % de moins sur les tokens d’entrée et de sortie. Il dispose de la même fenêtre de contexte de 128K et d’une sortie maximale de 16K. Il prend en charge les mêmes entrées multimodales, mais est généralement légèrement moins précis sur les tâches de raisonnement complexe et de création. Sur MATH-500, GPT-4o-mini obtient un score de 78,9 tandis que GPT-4o obtient 92+ (approximatif). Pour de nombreuses tâches quotidiennes comme le support client, le résumé et la vision simple, GPT-4o-mini est suffisant. Choisissez GPT-4o lorsque vous avez besoin de performances de premier ordre et que vous pouvez accepter une latence et un coût plus élevés.
Comparaison avec des modèles comme Claude 3 Haiku ou Gemini 1.5 Flash : GPT-4o-mini offre une fenêtre de contexte de 128K, tandis que Haiku permet 200K et Flash 1M. Les tarifs sont similaires (Haiku 0,25 $/1,25 $ par million de jetons ; Flash 0,35 $/1,05 $). Le score MATH-500 de 78,9 de GPT-4o-mini est compétitif ; Haiku obtient environ 73 et Flash environ 78 sur des benchmarks mathématiques similaires. Pour les entrées multimodales, les trois acceptent les images. GPT-4o-mini peut offrir une meilleure qualité de raisonnement pour son prix, mais sa fenêtre de contexte est plus petite que celle de certains concurrents. Le meilleur choix dépend de vos exigences spécifiques en matière de latence, coût et qualité. OrcaRouter donne également accès à Haiku et Flash, permettant une comparaison côte à côte.
GPT-3.5-turbo est plus ancien, a une fenêtre de contexte de 16K et coûte légèrement moins cher (0,50 $ par million d’entrées contre 0,15 $ pour GPT-4o-mini ? En réalité, GPT-3.5-turbo-0125 coûte 0,50 $/1,50 $ mais avec un contexte plus petit). D’après la tarification fournie, GPT-4o-mini est moins cher par jeton et offre un contexte plus large ainsi qu’une entrée multimodale. Donc, pour la plupart des tâches, GPT-4o-mini est supérieur. Cependant, certaines applications héritées utilisant déjà GPT-3.5-turbo peuvent nécessiter des changements minimes. GPT-4o-mini offre également de meilleures performances sur les benchmarks de raisonnement. Sauf si la latence est extrêmement critique ou que vous avez affiné un modèle GPT-3.5, GPT-4o-mini est la mise à niveau de remplacement direct recommandée.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-4o-mini",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamstructured_outputstemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Entrée / 1M tokens | $0.150 |
| Sortie / 1M tokens | $0.600 |
| Lecture cache / 1M | $0.075 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-4o-miniOuvrir @misc{orcarouter_gpt_4o_mini,
title = {GPT-4o-mini API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-mini}
}OpenAI. (2024). GPT-4o-mini API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-mini