
API Claude Opus 5 : comment l'invoquer, combien elle coûte, et quand c'est exagéré
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.
Deux points de terminaison, un modèle
La plupart des tutoriels pour l'API Claude Opus 5 ne montrent que l'appel natif Anthropic, et ils s'arrêtent là. Il existe en réalité deux dialectes, et les deux atteignent les mêmes poids.
• Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.
• OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.
• Modèles cloud. Sur Amazon Bedrock, l'identifiant est anthropic.claude-opus-5 ; sur Google Vertex AI et Microsoft Foundry, il conserve l'identifiant propriétaire claude-opus-5. Ces chemins sont destinés aux équipes déjà engagées auprès d'un fournisseur cloud ; la voie compatible OpenAI est celle qui garde votre code portable.
Le modèle ne se soucie pas du dialecte que vous utilisez. Ce qui diffère, c'est tout ce qui entoure l'appel — facturation, clés, limites de débit, basculement, et combien d'autres modèles vous pouvez atteindre sans changer de code.
Ce que vous obtenez — et les deux choses qui cassent l'ancien code
Claude Opus 5 est le produit phare d'Anthropic, fortement axé sur le raisonnement : une fenêtre de contexte d'un million de tokens (le maximum est également la valeur par défaut), un plafond de sortie de 128K, une date de coupure des connaissances de mai 2026, et une entrée texte, image et fichier avec une sortie texte. Sur le classement indépendant Artificial Analysis, il a obtenu un score AA Coding de 78,0, classé n°1 sur 132, et un score AA Intelligence de 63,1, classé n°2 sur 134, avec un score GPQA Diamond de 93,2 et un score de 54,9 au Humanity's Last Exam, en date du 24 juillet 2026. Les propres déclarations de lancement d'Anthropic — environ le double d'Opus 4.8 sur Frontier-Bench — émanent du fournisseur et n'ont pas été reproduites de manière indépendante.

La réflexion est activée par défaut. La réflexion adaptative décide dans quelle mesure raisonner à chaque appel, contrôlée par le paramètre output_config.effort, qui accepte de low à max et la valeur par défaut est high. Pour les boucles de codage et d'agents, xhigh est le point de départ recommandé ; low et medium sont réellement plus efficaces sur Opus 5 qu'ils ne l'étaient sur les modèles précédents, ce qui les rend viables pour des charges de travail réelles plutôt que des appels triviaux. Les jetons de raisonnement comptent dans votre facture de sortie.
Deux changements de rupture de Claude Opus 4.8 piègent quiconque copie un ancien corps de requête :
• Un max_tokens serré provoque désormais une troncature. Comme le raisonnement est activé par défaut, un max_tokens dimensionné autour de la longueur de réponse attendue est d'abord consommé par le raisonnement. Si vous migrez une charge de travail 4.8 sans modification, attendez-vous à des réponses tronquées jusqu'à ce que vous augmentiez la limite ou réduisiez l'effort.
• Les paramètres d'échantillonnage sont rejetés. temperature, top_p, et top_k pour toute valeur non par défaut renvoient une erreur 400, tout comme un préremplissage d'assistant. Contrôlez la sortie avec effort, et non temperature.
• La désactivation de thinking est plafonnée. thinking: {"type": "disabled"} n'est accepté qu'avec un effort high ou inférieur ; l'associer avec xhigh ou max renvoie une erreur 400. La façon sensée de réduire les coûts est de baisser l'effort, pas de désactiver thinking.
Le coût réel
Claude Opus 5 est proposé à 5 $ par million de jetons d'entrée et 25 $ par million de sortie — le même tarif que Claude Opus 4.8, ce qui est la bonne nouvelle discrète de cette version. Les lectures de cache sont facturées à 0,50 $ par million (la mise en cache des invites nécessite un préfixe d'au moins 512 jetons et prend en charge des TTL de 5 minutes et 1 heure). Un mode rapide en aperçu de recherche exécute le même modèle à un débit allant jusqu'à 2,5 fois plus de jetons de sortie par seconde pour 10 $ / 50 $, et l'API Batch renvoie les résultats de manière asynchrone à moitié prix.

Une facture concrète : une requête de 100K tokens qui produit 20K tokens de sortie coûte $0.50 pour l’entrée et $0.50 pour la sortie — $1.00 sans cache. Si ce prompt de 100K tokens est servi depuis le cache à l’appel suivant, le coût d’entrée tombe à environ $0.05, pour un aller-retour à $0.55. Ce calcul de cache fait toute la différence entre un Opus abordable sur un contexte long et répété et un Opus qui ne l’est pas du tout.
Le palier au-dessus et celui en dessous, à titre d'échelle : Claude Fable 5 est le modèle le plus performant d'Anthropic à $10 / $50 ; Claude Sonnet 5 est à $3 / $15 (avec $2 / $10 tarif de lancement jusqu'au 31 août 2026) ; Claude Haiku 4.5 est à $1 / $5. Sur OrcaRouter, chacun d'eux est répercuté au prix catalogue du fournisseur sans marge par jeton, donc la comparaison ci-dessus correspond aussi à ce que vous payez réellement.
Le cas d'un seul point de terminaison
Si vous lisez un guide d'API Claude Opus 5, vous avez probablement déjà une intégration et une clé, et la vraie question est de savoir si vous voulez une seconde intégration et une seconde clé pour le prochain modèle que vous essaierez. OrcaRouter y répond avec un point de terminaison compatible OpenAI devant 200+ modèles : le même client, la même URL de base, et un identifiant de modèle différent par modèle — anthropic/claude-opus-5 aujourd'hui, un modèle moins cher lorsque la charge de travail ne justifie plus le niveau Opus, un nouveau modèle de pointe dès sa sortie, le tout sans modification de code.

L'économie est la partie honnête. OrcaRouter ajoute 0 $ par jeton — vous payez le tarif publié de chaque fournisseur, donc Claude Opus 5 reste à 5 $ / 25 $ d'Anthropic, et une baisse de prix d'un fournisseur est active chez nous le jour même de son annonce. Apporter votre propre clé est une option de première classe : remettez votre clé API Anthropic existante, conservez vos propres limites de débit et crédits, et le fournisseur vous facture directement. Les garde-fous — un bouclier PII et une politique de contenu — sont appliqués avant que la requête ne soit facturée, pas après. La page du modèle pour anthropic/claude-opus-5 affiche le prix en direct, le contexte de 1 M, les chiffres de débit actuels, et le DSL de routage compose un basculement pour qu'un modèle moins cher réponde lorsque Opus 5 renvoie une erreur ou lorsque la forme de votre trafic le permet.
Là où Opus 5 est la mauvaise réponse.
Être le meilleur n'est pas la même chose qu'être adapté à votre charge de travail, et il y a trois domaines où le produit phare à 5 $ / 25 $ perd.
• Appels à volume élevé et à faible enjeu. Un pipeline de résumé ou de classification traitant 10M de jetons d'entrée par mois coûte $50 sur Claude Opus 5 contre $10 sur Claude Haiku 4.5 — même endpoint, même clé, un seul changement d'id. Haiku n'est pas Opus, mais pour le routage, l'extraction et la mise en forme, il est suffisamment proche pour que le 5x soit difficile à justifier.
• Boucles d'agent longues. Opus 5 vérifie son propre travail sans qu'on le lui demande, si bien qu'une instruction « revérifie ta réponse » réglée pour un modèle plus ancien déclenche désormais une sur-vérification et consomme des jetons de raisonnement. Avec un effort xhigh ou max, le budget de réflexion augmente par construction. Si votre agent n'a pas besoin de raisonnement de pointe, Claude Sonnet 5 à 3 $ / 15 $ est le choix par défaut sur lequel la plupart des équipes de production devraient se baser, et le curseur d'effort est là pour le réduire.
• Lorsque le modèle n'est pas le nôtre. OrcaRouter route et facture ; Anthropic fait tourner les poids. Le endpoint, la marge zéro, le basculement et les garde-fous sont les nôtres, mais la qualité d'inférence et le comportement de sécurité appartiennent à Anthropic, et avec BYOK, l'argent leur revient directement. Tel est l'accord, dit sans détour : vous payez le tarif du fournisseur dans les deux cas, et la question est de savoir si un seul endpoint pour 200+ modèles en vaut la peine.
En résumé
Appelez l'API Claude Opus 5 avec le point de terminaison natif Messages si vous n'avez pas d'autre intégration, et avec le point de terminaison compatible OpenAI si vous voulez un seul client pour tout. C'est le bon modèle lorsque la tâche est difficile, le contexte est long et que la sortie vaut 25 $ par million de jetons — et c'est le mauvais modèle lorsque la tâche est routinière. La configuration la plus propre est celle qui vous permet de changer d'avis : un seul point de terminaison, votre propre clé, une marge de 0 $ et un ID de modèle que vous pouvez remplacer le jour où la charge de travail change.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
