
Claude Sonnet 5.5 vs Gemini 3.1 Pro : moins cher par token, onze fois plus cher par tâche
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 984 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Sur la grille tarifaire, Claude Sonnet 5.5 est le modèle le moins cher et il n'y a pas photo sur les capacités. Il a atteint la disponibilité générale le 28 septembre 2026 à 2,00 $ par million de jetons d'entrée et 10,00 $ par million de jetons de sortie ; Gemini 3.1 Pro, annoncé le 19 février 2026 et toujours servi depuis un point de terminaison de préversion, est à 2,00 $ et 12,00 $. Sonnet 5.5 obtient également un score de 56 sur l'Intelligence Index v4.3 d'Artificial Analysis, contre 30 pour Gemini 3.1 Pro Preview — un écart de vingt-six points sur un même harnais. Le contexte de 1 048 576 jetons de Gemini est le seul chiffre phare qu'il remporte haut la main. Pourtant, le même évaluateur rapporte que terminer une tâche ouverte coûte 0,67 $ sur le modèle Google et 7,60 $ sur celui d'Anthropic, soit un facteur de onze en sens inverse. Les deux chiffres sont corrects, et la raison de leur coexistence — un plafond de sortie de 65 536 jetons d'un côté et un problème de verbosité de l'autre — constitue l'essentiel de cette comparaison.
Ce qu'est réellement chaque endpoint
Corrigez les identités avant l’arithmétique. Le sujet ici est anthropic/claude-sonnet-5.5, publié le 28 septembre 2026, entrée texte, image et fichier, contexte de 1 000 000 de tokens, sortie maximale de 128 000 tokens, réflexion adaptative avec un paramètre d’effort dont la valeur par défaut est high sur la Claude Platform. L’adversaire est google/gemini-3.1-pro-preview, publié le 19 février 2026, entrée texte, image, vidéo, audio et fichier, contexte de 1 048 576 tokens, sortie maximale de 65 536 tokens. L’un de ces deux noms contient un mot que l’autre n’a pas, et ce n’est pas de la décoration.
Le suffixe preview est présent depuis sept mois. Google a publié plusieurs versions de Flash pendant cette période, et aucun successeur au niveau Pro ; le modèle que 3.1 Pro a remplacé est répertorié comme arrêté. Rien de tout cela n'est un défaut du modèle — il a été en service, stable et correctement tarifé tout du long — mais cela signifie que le point de terminaison sur lequel vous effectuez votre intégration n'est pas couvert par un engagement de cycle de vie de disponibilité générale, et cette famille a déjà retiré un modèle Pro. Considérez cela comme un poste permanent plutôt qu'une simple note de bas de page, car cela change ce que coûte une décision d'architecture pluriannuelle si vous vous trompez.
Deux nombres qui pointent dans des directions opposées
La comparaison par token d'abord, parce que c'est celle que tout le monde exécute et elle avantage le modèle le plus récent.
• Entrée — 2,00 $ par million dans les deux cas ; égalité parfaite au tarif affiché
• Sortie — 10,00 $ pour Claude Sonnet 5.5 contre 12,00 $ pour Gemini 3.1 Pro ; le modèle d’Anthropic est 17 % moins cher
• Lecture du cache — 0,20 $ par million pour les deux, en dessous de la limite de palier
• Écriture de cache — 2,50 $ par million pour la fenêtre de cinq minutes sur Claude Sonnet 5.5, contre 0,375 $ pour Gemini 3.1 Pro ; Google est environ sept fois moins cher pour écrire une entrée de cache.
• Contexte — 1 000 000 contre 1 048 576 ; une différence sans conséquence pratique
• Sortie maximale — 128 000 tokens contre 65 536 ; le modèle Anthropic dispose d'un plafond presque deux fois plus élevé
• Modalité d'entrée — texte, image et fichier contre texte, image, vidéo, audio et fichier
Ensuite, la comparaison par tâche, du même évaluateur, la même semaine, dans une configuration d’effort maximal des deux côtés : 7,60 $ pour Claude Sonnet 5.5 contre 0,67 $ pour Gemini 3.1 Pro. Onze fois. Le mécanisme est documenté sur la même page plutôt que déduit — Sonnet 5.5 a généré 410 millions de tokens sur l’ensemble de la suite d’indices, contre une médiane de 88 millions pour le domaine, ce que l’évaluateur décrit comme très verbeux, tandis que Gemini 3.1 Pro est décrit comme assez concis. Quand un modèle écrit plusieurs fois plus que l’autre, un avantage de 17 % sur le tarif de sortie ne survit pas au contact de la facture.
La leçon est plus générale que ces deux modèles : une grille tarifaire attribue un prix à un token, et vous êtes facturé pour le travail terminé. Toute comparaison qui s’arrête à la feuille de tarifs mesure la mauvaise quantité.
La limite de palier à 200 000 tokens
La tarification de Gemini 3.1 Pro n'est pas uniforme, et le palier est suffisamment important pour inverser certaines parties de la comparaison ci-dessus. En dessous d'une invite de 200 000 jetons, les tarifs sont de 2,00 $ en entrée et 12,00 $ en sortie, avec une lecture de cache à 0,20 $. Au-delà de ce seuil, l'ensemble de l'appel est refacturé à 4,00 $ en entrée, 18,00 $ en sortie et 0,40 $ de lecture de cache — le tarif d'entrée double pour atteindre exactement le double de celui de Claude Sonnet 5.5, et la sortie passe de 17 % moins chère côté Anthropic à 80 % plus chère côté Google.
La limite n’est pas exotique. Une invite de 200 000 tokens correspond à une petite base de code, un long ensemble de contrats, quelques heures de transcription, ou un agent qui travaille depuis un moment. Le travail en contexte long est précisément ce pour quoi une fenêtre de 1 M de tokens est vendue, donc le palier qui récompense le plus la fenêtre est aussi celui où l’avantage de prix disparaît. Si vos invites dépassent régulièrement 200 000 tokens, évaluez Gemini 3.1 Pro à 4,00 $ et 18,00 $, et non aux tarifs indiqués sur la page de destination.
Les écritures de cache méritent leur propre phrase, car elles s'inversent dans l'autre sens et survivent au changement de palier. À 0,375 $ par million contre 2,50 $, Gemini est bien moins cher pour remplir un cache, et ce tarif ne bouge pas lorsque vous franchissez la frontière. Pour un agent qui reconstruit un grand préfixe à chaque tour plutôt que d'en réutiliser un, cette seule ligne peut représenter un avantage structurel plus important que le tarif d'entrée — et c'est la seule ligne de cette comparaison qu'aucune frontière de palier ne touche.
Le plafond de 65 536 jetons, et pourquoi il détermine l’architecture
Le chiffre qui change le plus ce que vous pouvez construire est la sortie maximale : 65 536 tokens sur Gemini 3.1 Pro contre 128 000 sur Claude Sonnet 5.5. Un plafond n’est pas une mesure de performance ; c’est une contrainte sur la capacité d’une tâche à tenir en un seul appel.
Tout ce qui émet un artefact volumineux — un fichier source complet, un long rapport, un document entier, un jeu de données structuré — au-dessus de 65 536 tokens dans le cas de Gemini doit être décomposé en une chaîne d'appels avec un état transmis entre eux. La décomposition coûte plus de tokens d'entrée à chaque étape, plus de code d'orchestration, et un nouveau mode de défaillance aux jointures où un bloc se termine et le suivant commence. Une seconde contrainte s'y ajoute : la documentation d'Anthropic elle-même situe le seuil pratique de Sonnet 5.5 pour un travail long fiable nettement plus haut, et le plafond de Gemini est le plus restrictif des deux d'un facteur deux. Si votre artefact le plus long fait 40 000 tokens, cette section est sans objet et vous devriez comparer sur le coût par tâche. S'il fait 100 000, le plafond a déjà pris la décision pour vous.
La modalité, l'unique axe que Gemini domine sans partage
Gemini 3.1 Pro accepte la vidéo et l’audio ; Claude Sonnet 5.5 accepte le texte, les images et les fichiers et ne peut prendre ni l’un ni l’autre. Pour une charge de travail articulée autour de médias — enregistrements d’appels, captures d’écran, vidéo produit, audio de réunion — il n’existe aucune substitution possible dans ce duo, et la comparaison des prix est sans objet car un seul des deux points de terminaison peut accepter l’entrée. Pour les charges de travail texte et image, les ensembles de capacités se recoupent et l’arithmétique des prix ci-dessus s’applique.
L'autre chiffre opérationnel de Gemini mérite d'être mentionné, car il est facile à manquer sur une page qui met en avant l'intelligence : notre catalogue mesure une latence médiane du premier token de 10 000 ms au p50 et un débit de sortie proche de 1 283 tokens par seconde, avec un taux d'erreur sur sept jours de 56,8 %. C'est un modèle extrêmement rapide avec un taux d'échec observé très élevé — une combinaison qui convient bien mieux au traitement par lots avec des budgets de nouvelle tentative généreux qu'à tout ce qu'un utilisateur attend. Claude Sonnet 5.5 est, en comparaison, le profil plus lent et plus stable. Le taux d'erreur n'apparaît sur la page d'accueil d'aucun des deux fournisseurs ; c'est le genre de chiffre qui n'apparaît que lorsque les candidats se trouvent derrière un point de terminaison unique qui les mesure, ce qui est une raison d'évaluer les deux depuis un seul endroit plutôt que depuis deux tableaux de bord.
Quoi router vers où
Envoyez-le à Claude Sonnet 5.5 lorsque le travail est du texte ou des images, lorsque la barre de qualité est suffisamment élevée pour qu'un écart d'indice de vingt-six points compte, lorsque les artefacts de sortie sont assez longs pour nécessiter le plafond de 128 000 tokens, ou lorsque la charge de travail est interactive et qu'un taux d'erreur de 56,8 % est inacceptable. Sur les tâches structurées et délimitées, la pénalité de verbosité qui produit le chiffre de 7,60 $ disparaît en grande partie, et l'avantage par token devient de l'argent réel.
Envoyez-le à Gemini 3.1 Pro lorsque l’entrée contient de la vidéo ou de l’audio, lorsque les invites restent sous 200 000 tokens et que le volume est élevé, lorsque vous écrivez fréquemment de grands caches et que les 0,375 $ d’écriture de cache s’accumulent, ou lorsque la tâche est de type traitement par lots et que le coût par tâche est la seule colonne qui compte — à 0,67 $ la tâche contre 7,60 $, vous pouvez vous permettre un très grand nombre de réessais.
Les deux sont routables sur OrcaRouter dès aujourd'hui. google/gemini-3.1-pro-preview et anthropic/claude-sonnet-5 sont tous deux des entrées de catalogue actives sur un seul identifiant, au prix catalogue du fournisseur avec 0 % de marge, ce qui signifie que la répartition ci-dessus peut être exprimée sous forme de règle de routage plutôt que de deux intégrations — les requêtes de type média vers un point de terminaison, les requêtes texte et image vers l'autre, avec basculement si l'un ou l'autre commence à renvoyer des erreurs. Claude Sonnet 5.5 n'est pas encore une route sur notre plateforme ; lorsqu'il sera listé, la même règle le couvrira sans nouvelle clé.
Le verdict honnête pour cette confrontation : Claude Sonnet 5.5 est le meilleur modèle, et de loin, ainsi que le moins cher par token, tandis que Gemini 3.1 Pro est environ onze fois moins cher par tâche terminée sur du travail ouvert, six fois moins cher pour écrire un cache, et le seul des deux capable de voir une vidéo. Quiconque vous cite la grille tarifaire décrit une comparaison qui n’existe pas ; celle qui existe porte sur les requêtes que vous pouvez borner.



Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
