Carte de titre principale intitulée « Claude Opus 5.5 et le test de la pastèque », sous-titrée « Le Claude le plus lisible à ce jour — et il enterre encore l'essentiel », avec trois badges affichant Flesch-Kincaid 6,95, Facilité de lecture 68,4 et le 22 septembre 2026, et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Claude Opus 5.5 et le test de la pastèque : Anthropic a corrigé la prose, mais l'essentiel reste enfoui

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'un des échantillons qui a le plus voyagé au-delà de la semaine de lancement était une nouvelle courte au sujet d'une pastèque. Quelques centaines de mots, aucun benchmark attaché, aucun graphique — juste un modèle auquel on avait demandé d'écrire quelque chose de court et qui s'en sortait dans l'ensemble correctement. C'est un artefact étrange à voir figurer près du cœur d'une sortie phare, mais cela pointe vers ce que le fournisseur a choisi de mettre en avant lorsqu'il a livré Claude Opus 5.5 le 22 septembre 2026 : non pas un point de plus sur Terminal-Bench, mais de la prose. Le cadrage de l'entreprise est que ce modèle écrit moins « Claudish » — son terme pour le registre formulaïque, trop prudent et plein de précautions oratoires, que Claude Opus 5 s'est attiré des critiques pour, et par rapport auquel Claude Fable 5.1, GPT-6 Astra et GPT-5.6 Sol ont chacun été évalués depuis. Donc la question à laquelle il vaut la peine de répondre n'est pas de savoir si la démo était charmante. C'est de savoir si la prose s'est améliorée de manière mesurable, dans quelle mesure, et où elle échoue encore.

Ce qu'Anthropic dit avoir corrigé

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

L’affirmation d’Anthropic est suffisamment précise pour être testée. Opus 5.5, selon l’entreprise, place les informations les plus importantes en premier, utilise moins de jargon et suit de plus près les règles d’écriture énoncées par un utilisateur que les modèles Opus précédents. Les éléments à l’appui sont rapportés par le fournisseur et non reproduits : des tests internes de vérification des faits qu’Anthropic affirme avoir réussis 16 fois sur 18, contre zéro sur 18 pour les deux Claude Fable 5.1 et Claude Opus 5. Les témoignages de clients dans la documentation de lancement vont dans le même sens — John Ruelas, de Ramp, décrivant une production qui « écrit comme un bon collègue », Box rapportant une verbosité réduite d’environ 40 % sur ses propres charges de travail.

Deux choses méritent d’être distinguées ici. La première, c’est que « moins Claudish » est un mode de défaillance réel et nommable, et non une invention marketing. Les praticiens se plaignent de la prose de Claude condensée et mal structurée depuis les générations Opus post-4.6, et la plainte est précise : trop de préambule, trop de reformulations du prompt, l’habitude d’arriver au fait deux paragraphes après le moment où le lecteur en avait besoin. La seconde, c’est que les chiffres d’Anthropic pour avoir corrigé cela sont exactement cela — les chiffres d’Anthropic. Le chiffre de 16 sur 18 ne bénéficie d’aucune réplication indépendante, et « 40 % de verbosité en moins » est une mesure interne d’un client, non une méthodologie publiée.

Cette version comporte aussi un changement qui ne concerne pas l’écriture et qu’il est utile de connaître : Opus 5.5 est le premier modèle Opus livré avec des protections en cybersécurité, en biologie et en développement de LLM de frontière, identiques à celles appliquées à Claude Fable 5.1. Lorsqu’une requête déclenche l’une de ces protections, Anthropic indique qu’elle redirige alors la requête de manière transparente vers un autre modèle plutôt que de la refuser catégoriquement.

Les chiffres qui ne sont pas ceux d'Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

L'analyse indépendante la plus utile de l'affirmation sur l'écriture provient de Every's Vibe Check, qui a soumis les mêmes invites à cinq modèles de pointe et a évalué les résultats avec deux instruments de lisibilité standard. Sur cet ensemble d'invites, Claude Opus 5.5 s'est révélé le plus lisible du groupe — et l'écart avec le modèle qu'il a remplacé est tout l'intérêt :

• niveau scolaire Flesch-Kincaid — Claude Opus 5.5 à 6,95, contre Claude Opus 5 à 7,97

• Indice de lisibilité de Flesch — 68,4 pour Opus 5.5, contre 61,35 pour Opus 5

• Claude Fable 5.1 — niveau scolaire 7,43, facilité de lecture 66,09

• GPT-6 Astra — niveau scolaire 7,52, indice de facilité de lecture 64,55

• GPT-5.6 Sol — niveau scolaire 8,74, facilité de lecture 56,62

Lisez les deux indicateurs ensemble, car ils évoluent en sens opposés et c’est justement là l’essentiel : un niveau scolaire plus bas et un indice de lisibilité plus élevé signifient tous deux une prose plus simple. Opus 5.5 se situe environ un niveau scolaire entier en dessous d’Opus 5, à peu près un demi-niveau en dessous de Claude Fable 5.1 comme de GPT-6 Astra, et près de deux niveaux en dessous de GPT-5.6 Sol. Autrement dit, un niveau de lecture de septième année plutôt que de huitième.

C’est une véritable amélioration, et elle est aussi limitée. Il s’agit de l’ensemble de prompts d’un seul média, pas d’un benchmark avec une liste de tâches fixe et un classement derrière. Cela vous indique la direction prise et à peu près l’ampleur du pas. Cela ne vous dit pas qu’Opus 5.5 écrit bien dans le cadre de votre travail, et les propres notes qualitatives d’Every montrent clairement que l’évaluateur ne le pensait pas non plus.

I don't see any source text to translate — your message contains only the translation instructions (and the final paragraph appears to be garbled). Please send the actual message you'd like translated into French, including its `{{1}}...{{/1}}` span markers. I'll preserve every marker exactly as-is and translate only the text between them.

La même évaluation qui a produit les chiffres de lisibilité est sans détour sur la défaillance qui a survécu au correctif. Invité à commencer un essai, Opus 5.5 a mis 37 à 39 phrases pour couvrir ce que l’évaluateur avait couvert en 21, et a consacré un paragraphe entier à un point que l’évaluateur avait formulé en huit mots. Le résumé de l’évaluateur est que le modèle « noie encore l’essentiel » — et la version plus acérée du reproche est qu’il peut diagnostiquer correctement ce dont un paragraphe a besoin, puis produire une révision qui ignore son propre diagnostic.

En tant qu'éditeur, il s'en est moins bien sorti qu'en tant que rédacteur. Comparé aux autres modèles sur les tâches d'édition, Opus 5.5 est arrivé derrière Claude Opus 5, GPT-5.6 Sol et GPT-6 Astra — le modèle est meilleur pour produire des phrases lisibles que pour reconnaître quelle phrase aurait dû venir en premier. Le verdict du critique tient dans une phrase qui mérite d'être citée, car c'est la chose la plus utile de toute la critique : « Je suis plus satisfait de lui comme collaborateur que de la prose qu'il produit. »

La lecture pratique en découle directement. Rédigez avec lui, et rédigez à effort élevé ou au-delà — c'est dans les réglages d'effort inférieurs que le remplissage est le pire. Fournissez vos propres exemples plutôt que de lui demander d'en inventer. Ensuite, remontez vous-même le point en tête, ou confiez le brouillon à quelque chose qui le fera. Ce qu'Opus 5.5 vous offre, c'est un chemin plus rapide vers un premier brouillon propre et un collaborateur véritablement meilleur pour les passes qui suivent. Il ne vous offre pas un éditeur.

Ce que coûtent les mots supplémentaires

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

Le problème de verbosité comporte une dimension de coût que les critiques d'écriture omettent pour la plupart, et elle va à l'encontre du récit de lancement. Artificial Analysis, qui mène sa propre évaluation au lieu de se fier aux chiffres des fournisseurs, place Claude Opus 5.5premier sur 212 modèles de son Intelligence Index, avec un score de 58 — mais 95e sur 212 pour la verbosité, puisqu'il a généré 260 millions de tokens de sortie lors de cette exécution de l'Index, contre une médiane de 88 millions. Son évaluation a coûté 5,98 $ par tâche de l'Intelligence Index, et 8 708,20 $ au total.

Si l’on met cela en regard de la propre affirmation d’efficacité d’Anthropic, les deux ne concordent pas manifestement. La position rapportée par le fournisseur est qu’Opus 5.5 utilise moins de tokens et génère sa sortie plus de 30 % plus vite qu’Opus 5. L’évaluation indépendante d’Artificial Analysis a jugé le modèle très verbeux par rapport à ses pairs. Les deux peuvent être vrais simultanément — des compositions de tâches différentes, des réglages d’effort différents, des définitions différentes de « moins de tokens » — mais personne ne devrait interpréter le cadrage du lancement comme un fait établi concernant l’économie de tokens. Côté prix, le tableau est plus clair : 4 $ par million de tokens d’entrée et 20 $ par million de tokens de sortie, en baisse par rapport à 5 $/25 $, avec une remise de 95 % sur le cache dans les chiffres d’Artificial Analysis.

Si vous payez au token généré, la prose verbeuse n'est pas une préférence de style. C'est une ligne de facture.

L'exécuter face à ce que vous avez déjà

Une précision en toute honnêteté avant la partie pratique : Claude Opus 5.5 ne fait pas partie de nos routes. Nous ne l’hébergeons pas, et rien de ce qui suit ne doit être lu comme une affirmation que c’est le cas. Vous y accédez via l’API d’Anthropic elle-même et plusieurs plateformes tierces.

Ce qui est sur OrcaRouter aujourd'hui, c'est le modèle qu'il a remplacé et le niveau au-dessus. Claude Opus 5 est disponible sur OrcaRouter aujourd'hui, et Claude Fable 5.1 aussi, tous deux au prix catalogue du fournisseur, avec 0 % de marge ajoutée répercutée — ce qui signifie qu'un changement de prix du vendeur se répercute chez nous le jour même, plutôt que quand un revendeur trouve le temps de s'en occuper. Si vous cherchez à décider si la prose d'Opus 5.5 vaut le passage, c'est un duo utile : vous pouvez faire la comparaison avec une seule clé, sans second contrat ni modification de code, car les deux modèles sont à une API pour plus de 200 modèles d'ici, sur le même point de terminaison.

L'autre raison de garder un second modèle dans la boucle est le mode de défaillance dont traite cet article. Un modèle qui enfouit l'essentiel est un modèle que l'on veut pouvoir contourner en cours de tâche, et le basculement automatiqueexiste précisément pour qu'une mauvaise génération ne devienne pas un pipeline bloqué. Si vous préférez ne pas choisir un seul modèle, le DSL de routage en compose plusieurs en un seul appel et la fusion de modèles fait tourner un panel de modèles qui répondent ensemble — une forme pertinente pour le travail d'édition, où la défaillance relève du jugement plutôt que de la capacité.

Qui devrait agir, et qui devrait attendre

Si votre reproche à l'égard de Claude Opus 5 était de devoir réécrire ses ouvertures, Opus 5.5 constitue une véritable amélioration d'environ un niveau scolaire pour ce problème, et les données de lisibilité indiquent que le progrès est mesurable plutôt qu'une question de ressenti. Si votre reproche était qu'il lui faut trois paragraphes pour en venir au fait, rien dans les preuves indépendantes n'indique que cela ait changé. Ce sont des reproches différents, et la couverture du lancement continue de les traiter comme un seul.

Pour le travail créatif en particulier, l’histoire de la pastèque ne prouve rien, sinon que les gens se tournent vers de petites consignes chaleureuses et à faible enjeu lorsqu’ils veulent sonder un nouveau modèle. C’est une chose raisonnable à faire. C’est aussi exactement le contexte où une tendance à enterrer le propos est la moins visible, car personne ne lit une histoire de pastèque pour en tirer la thèse. Placez le modèle devant un document où le lecteur a besoin de la conclusion dès les deux premières phrases, et vous découvrirez lequel des deux problèmes vous aviez réellement.

Ce qu’il faut surveiller ensuite, c’est de savoir si le prochain modèle de la famille — Sonnet 5.5 et Haiku 5.5 sont tous deux attendus dans les semaines à venir — hérite du gain de lisibilité, et si quelqu’un publie un chiffre de lisibilité pour la révision plutôt que pour la rédaction. Le chiffre pour la rédaction est le plus facile. Le chiffre pour la révision est celui où Opus 5.5 se classe encore derrière trois de ses concurrents.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement