Modèle de texte économique d'OpenAI avec un score MMLU-Pro de 46,2, accessible via l'API OrcaRouter.
openai/gpt-3.5-turbo-0125 est un modèle de génération de texte développé par OpenAI et disponible via l'API d'OrcaRouter. Il fait partie de la famille GPT-3.5-Turbo, optimisé pour les tâches…
GPT-3.5-Turbo-0125 excelle dans un large éventail de tâches textuelles, notamment le chat, le résumé, la traduction, la réponse aux questions et la génération de contenu. Il suit bien les instructions et peut produire des réponses cohérentes et contextuellement appropriées pour le support client, le brainstorming et l'étiquetage de données. Ses données d'entraînement couvrent divers domaines jusqu'en avril 2023, ce qui lui permet d'obtenir des performances raisonnables sur les connaissances communes et les styles d'écriture. Pour une sortie structurée, il peut formater du JSON ou suivre des schémas personnalisés lorsqu'il y est invité clairement.
Si votre application implique un volume très élevé avec des tâches simples et répétitives, comme une classification directe ou la génération de phrases uniques, vous pourriez envisager d'utiliser des modèles plus petits tels que GPT-3.5-Turbo-Instruct ou même des alternatives open-source hébergées sur OrcaRouter. Les économies de coûts peuvent être significatives lorsque le nombre de jetons est faible et que les exigences de précision sont minimes. Cependant, GPT-3.5-Turbo-0125 reste un choix rentable pour la plupart des usages généraux, surtout compte tenu de son score de référence solide de 46.2 sur MMLU-Pro.
Oui, le modèle a été entraîné sur du texte multilingue, bien que ses meilleures performances soient en anglais. Il peut comprendre et générer du texte dans de nombreuses langues, dont l'espagnol, le français, le chinois, l'arabe et d'autres. La précision peut diminuer pour les langues peu représentées dans les données d'entraînement ou pour les expressions très idiomatiques. Pour les tâches nécessitant une maîtrise multilingue précise, envisagez de compléter avec un réglage fin spécifique à la langue ou d'utiliser un modèle natif. Les entrées et sorties sont toujours du texte, donc les caractères non anglais sont pris en charge.
Étant donné que la fenêtre de contexte totale est de 16 385 tokens (spécification publique largement connue), le modèle peut traiter des documents de longueur modérée en une seule passe. Cependant, la sortie est limitée à 4096 tokens par requête. Pour des sorties plus longues, vous devez implémenter une approche map-reduce ou par fenêtre glissante. Le mécanisme d'attention du modèle peut maintenir la cohérence sur l'ensemble du contexte, mais les performances peuvent se dégrader pour les tâches nécessitant de se référer au tout début d'un long prompt. Des stratégies de découpage et de résumé sont recommandées pour les textes très longs.
MMLU-Pro est une version améliorée du benchmark Massive Multitask Language Understanding, qui mesure la capacité d'un modèle à répondre à des questions dans 57 domaines, y compris les sciences, le droit et les sciences humaines. Un score de 46,2 indique que GPT-3.5-Turbo-0125 répond correctement à environ 46,2 % des questions, ce qui est compétitif parmi les petits modèles. Ce score reflète une solide culture générale, mais montre aussi une marge d'amélioration par rapport à des modèles plus grands comme GPT-4. Pour les tâches nécessitant une expertise approfondie, envisagez d'évaluer le modèle sur des benchmarks spécifiques au domaine.
La latence exacte dépend de la taille de la requête, des conditions réseau et de la charge actuelle sur l'infrastructure d'OpenAI. En utilisation typique, GPT-3.5-Turbo-0125 répond en quelques secondes pour les invites courtes, souvent plus rapidement que les modèles plus volumineux. OrcaRouter n'ajoute pas de surcharge significative au-delà du temps de réponse du fournisseur. Pour les applications en temps réel, testez avec votre charge de travail. La vitesse et le coût du modèle en font un choix populaire pour les chatbots interactifs et les pipelines de production où la latence par requête est importante.
GPT-3.5-Turbo-0125 est largement utilisé pour sa fiabilité, son formatage cohérent et ses solides capacités de suivi des instructions. Il échoue rarement à produire une réponse cohérente et traite les fautes de frappe ou les formulations ambiguës avec élégance. Sa couverture de données d'entraînement jusqu'en avril 2023 lui permet de répondre avec précision aux événements actuels de cette période. Le modèle prend également en charge les messages système pour définir le comportement, ce qui facilite la personnalisation pour différentes applications telles que le jeu de rôle ou la génération contrainte.
Ce modèle peut rencontrer des difficultés avec le raisonnement complexe, les calculs arithmétiques en plusieurs étapes et les instructions très nuancées. Il peut parfois produire des réponses plausibles mais incorrectes (hallucinations) et peut ne pas respecter de manière cohérente des règles de formatage strictes. Sa longueur de sortie est limitée à 4096 tokens, ce qui peut être insuffisant pour la génération de contenu long. De plus, il n'a pas accès à Internet par défaut et ne peut pas récupérer d'informations en temps réel ni effectuer d'actions en dehors de l'interface de chat. Pour une logique avancée ou des données à jour, envisagez une génération augmentée par récupération (RAG) ou un modèle plus performant.
OrcaRouter répercute exactement la tarification d'OpenAI sans aucune marge : 0,50 $ par million de tokens d'entrée et 1,50 $ par million de tokens de sortie. Il n'y a aucun frais de plateforme supplémentaire, aucun abonnement ni frais par requête au-delà de ces taux de tokens. Les tokens d'entrée incluent le prompt, le message système et l'historique de conversation ; les tokens de sortie sont la réponse générée. La facturation est basée sur le nombre de tokens traités, mesuré par le tokenizer tiktoken pour GPT-3.5.
Bien que GPT-3.5-Turbo-0125 soit déjà l'un des modèles les plus rentables d'OpenAI, vous pouvez encore optimiser en envoyant des prompts plus courts, en réduisant l'historique des conversations lorsque c'est possible, et en utilisant une valeur max_tokens plus petite si votre cas d'utilisation le permet. Évitez les messages système excessivement longs s'ils ne sont pas nécessaires. Pour un volume très élevé, demandez-vous si un modèle gratuit ou open-source sur OrcaRouter pourrait répondre à vos exigences de précision. Le compromis est que les modèles moins chers peuvent nécessiter un prompt engineering ou un fine-tuning plus rigoureux.
OrcaRouter n'offre actuellement pas de mécanisme de mise en cache intégré pour les invites ou les réponses. Chaque appel API est facturé en fonction des jetons envoyés et reçus dans cette requête. Si vous réutilisez la même invite dans plusieurs appels (par exemple, des messages système identiques), vous êtes facturé pour ces jetons à chaque fois. Pour réduire les coûts, envisagez de mettre en cache les requêtes identiques au niveau de l'application ou de regrouper plusieurs requêtes en une seule invite avec plusieurs messages utilisateur.
Utilisez le point de terminaison standard OpenAI Chat Completions avec l'URL de base https://api.orcarouter.ai/v1. Définissez le paramètre model sur 'openai/gpt-3.5-turbo-0125'. Incluez votre clé API OrcaRouter dans l'en-tête Authorization. Exemple avec cURL : curl https://api.orcarouter.ai/v1/chat/completions -H 'Authorization: Bearer YOUR_API_KEY' -H 'Content-Type: application/json' -d '{"model":"openai/gpt-3.5-turbo-0125","messages":[{"role":"user","content":"Hello"}]}'. Le format de réponse correspond à la spécification d'OpenAI.
Tous les paramètres standards des complétions chat d'OpenAI sont disponibles, y compris : 'messages', 'max_tokens' (jusqu'à 4096), 'temperature', 'top_p', 'frequency_penalty', 'presence_penalty', 'stop' et 'stream'. 'n' (nombre de complétions) est également pris en charge. Il n'y a pas de support pour 'logprobs' ou 'logit_bias' pour ce modèle sur la passerelle OrcaRouter. Notez que le paramètre 'max_tokens' est limité à 4096 pour correspondre à la limite de sortie du modèle. Pour le streaming, définissez 'stream' : true pour recevoir des deltas incrémentiels.
Si vous utilisez actuellement OpenAI directement, la migration vers OrcaRouter est simple : remplacez l'URL de base de https://api.openai.com/v1 par https://api.orcarouter.ai/v1, mettez à jour l'ID du modèle en 'openai/gpt-3.5-turbo-0125' si vous utilisiez un alias générique, et remplacez votre clé API par celle d'OrcaRouter. Aucune modification de code du format de message ou des paramètres n'est nécessaire. Si vous utilisiez un autre fournisseur, assurez-vous que votre bibliothèque cliente prend en charge le schéma compatible OpenAI. OrcaRouter fournit un remplacement direct.
GPT-4 surpasse généralement GPT-3.5-Turbo-0125 dans le raisonnement complexe, la précision factuelle et le respect des instructions nuancées, comme en témoignent des scores de référence plus élevés sur MMLU et d'autres tests. Cependant, GPT-4 est nettement plus coûteux (généralement 10 fois le coût par token) et peut avoir une latence plus élevée. GPT-3.5-Turbo-0125 offre un bon rapport qualité-prix pour les tâches qui n'exigent pas la profondeur de GPT-4. Choisissez le modèle plus grand pour une analyse avancée ou lorsque la marge d'erreur est faible.
Anthropic's Claude 3 Haiku est un modèle concurrent à faible coût avec une inférence rapide et des fonctionnalités de sécurité robustes. Les deux modèles sont uniquement textuels et conçus pour des applications à volume élevé. Bien que les comparaisons spécifiques de référence varient, GPT-3.5-Turbo-0125 est largement adopté et bénéficie d'une documentation et d'un écosystème étendus. Claude 3 Haiku peut avoir des atouts différents en matière d'écriture créative et de comportement de refus. Le choix dépend des préférences du développeur et des exigences d'intégration. OrcaRouter prend en charge les deux modèles, vous pouvez donc les comparer directement.
Les modèles open-source (par exemple, Llama 3, Mistral) peuvent être exécutés sur votre propre matériel ou via OrcaRouter pour des coûts par jeton potentiellement plus faibles, surtout à grande échelle. Cependant, ils nécessitent souvent plus de configuration, d'ingénierie des invites, et peuvent avoir un suivi des instructions plus faible. GPT-3.5-Turbo-0125 offre une fiabilité clé en main, une qualité constante et une gestion d'infrastructure nulle. Pour les équipes sans expertise en ML, l'API gérée est souvent préférable. Exécutez des benchmarks sur votre charge de travail spécifique pour décider.
OpenAI pourrait publier des versions plus récentes de GPT-3.5-Turbo ou déprécier cet instantané spécifique. OrcaRouter mettra à jour les modèles disponibles en conséquence. Si votre application repose sur un comportement cohérent, vous pouvez souhaiter épingler une version spécifique du modèle en utilisant l'ID exact du modèle. OrcaRouter fournit un préavis de dépréciation. Pour les systèmes de production à enjeux élevés, envisagez de tester les nouvelles versions dans un environnement de préproduction avant de basculer.
Compatible OpenAI — gardez votre SDK actuel
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-3.5-turbo-0125",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_tokenspresence_penaltyresponse_formatseedstopstreamtemperaturetool_choicetoolstop_logprobstop_pparallel_tool_calls| Entrée / 1M tokens | $0.500 |
| Sortie / 1M tokens | $1.50 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/openai/gpt-3.5-turbo-0125Ouvrir @misc{orcarouter_gpt_3_5_turbo_0125,
title = {openai/gpt-3.5-turbo-0125 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125}
}openai. (n.d.). openai/gpt-3.5-turbo-0125 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-3.5-turbo-0125