Carte principale multimodale Claude Opus 5.5 : le nom du modèle sur une carte de titre générée.
Guides & Insights

Claude Opus 5.5 Multimodal : il génère de la vidéo à partir de code, mais ne peut pas en regarder une

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Demandez une vidéo à Claude Opus 5.5 et vous pouvez en obtenir une — un programme d'appels HTML, CSS ou canvas qui dessine chaque image, que vous exécutez ensuite. Donnez-lui une vidéo et demandez ce qui s'y passe, et vous n'obtenez rien du tout, car il n'y a pas d'entrée vidéo. Cette asymétrie constitue à elle seule toute la surface de modalité de ce modèle, et elle est identique sur les onze modèles Anthropic de notre tableau, il vaut donc la peine de le dire sans détour : Claude Opus 5.5 lit du texte, des images et des fichiers, écrit du texte, et s'arrête là. Le tableau qui l'entoure est bien moins uniforme. MiniMax H3 génère de la vidéo purement et simplement, OrcaDub 1.0 prend une vidéo en entrée et en renvoie une version doublée, et Qwen3.8-Max regardera un clip pour deux dollars par million de tokens d'entrée — soit la moitié de ce que Claude Opus 5.5 facture pour le même million, et avec une capacité qu'il n'a pas.

Voici une lecture de la ligne de modalité telle qu'OrcaRouter l'enregistre le 2026-09-29, pour l'ensemble des 204 modèles du catalogue. Les chiffres ci-dessous sont des déclarations du catalogue, et non nos benchmarks — un champ de modalité correspond à ce qu'indique la fiche du modèle, et les fiches de modèle évoluent.

Ce que le catalogue enregistre réellement

Sur les 204 modèles, 182 déclarent une surface d'entrée. Les 22 autres la laissent vierge, ce qui en dit long sur la fiche plutôt que sur le modèle — huit modèles vidéo Kling, quatre méta-modèles OrcaRouter, et quelques points de terminaison gratuits et en aperçu parmi eux.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Sur ces 182 :

• 131 images lues

• 77 lisent des fichiers — et chacun de ces 77 lit aussi des images, donc l'entrée de fichiers est un renforcement de l'entrée d'images sur cette carte, jamais une sixième modalité distincte

• 49 vidéos lues

• 19 écouter l'audio

• 50 prendre le texte et rien d'autre

Claude Opus 5.5 se situe sur la ligne image et fichier, et non sur la ligne vidéo. Notre propre page de modèle le dit en une phrase, sous le titre « Contexte, modalités et réflexion » : entrée multimodale — texte, images et fichiers — avec sortie texte, une fenêtre de contexte de 1 M de tokens et jusqu’à 128 K de tokens en sortie. Telle est la surface d’entrée complète. Aucune cinquième entrée ne se cache dans un sous-menu.

Cinquante représente un quart des modèles qui indiquent {{1}}texte uniquement{{/1}} ; ensuite, les derniers modèles s'en chargeraient, d'après les rapports.

Pourquoi « vidéo avec code » n'est pas une modalité vidéo

Les démos qui ont circulé sont réelles, et l'effet l'est aussi : Claude Opus 5.5est exceptionnellement doué pour écrire un programme qui produit du mouvement — un moteur de rendu autonome qui génère des images lorsque vous l'exécutez. C'est une capacité authentique et utile. Ce que ce n'est pas, en revanche, c'est une modalité de sortie. Le catalogue ne recense qu'une seule sortie pour ce modèle, et c'est du texte. La vidéo est fabriquée en aval, par le code que le modèle a écrit, sur votre machine, avec votre moteur de rendu.

La conséquence pratique joue dans les deux sens, et c'est la seconde moitié que les gens négligent.

En sortie, vous êtes responsable de l'étape de rendu. La vidéo basée sur le code est inspectable, diffable, réexécutable à une résolution différente, et bon marché de la même manière qu'une réponse textuelle est bon marché — quelques dollars de tokens plutôt qu'un compteur de facturation à la seconde. Vous êtes également responsable de chaque échec : une police manquante, un mauvais budget de frames, un moteur de rendu qui ne correspond pas au code qui lui a été transmis.

En amont, il n'y a rien à lui transmettre. Si votre matériau source est un enregistrement d'écran, un clip produit, un webinaire de deux heures ou le film de lancement d'un concurrent, Claude Opus 5.5ne peut pas le regarder. Vous pouvez lui envoyer la transcription, les diapositives sous forme d'images fixes, ou une description rédigée par quelqu'un d'autre. C'est la contrainte qui décide réellement des architectures, et elle est invisible dans une bande démo.

Deux camps : 60 modèles prennent le document, 29 prennent le clip

Regroupez les 182 modèles selon leur ensemble d'entrées exact, et le tableau se scinde en deux groupes qui se chevauchent à peine.

Camp A — documents et images, pas de vidéo : 60 modèles.Prix d'entrée médian 2,00 $ par million de tokens. C'est là que Claude Opus 5.5 se situe, aux côtés des onze modèles Anthropic, de trois des cinq lignes Grok et du pan « raisonnement » du catalogue OpenAI — chaque ligne GPT-4.1 et GPT-6, et, dans les familles GPT-4o et GPT-5, tout sauf les variantes voice, codex, search et chat-latest. Le camp A détient aussi le plafond du tableau des prix : openai/gpt-5.5-pro et openai/gpt-5.4-pro à 30 $ par million de tokens en entrée. C'est le prix d'entrée le plus élevé de tout le tableau, et c'est un prix qu'ils partagent avec deux lignes GPT-4 d'OpenAI et deux points de terminaison de synthèse vocale, dont aucun ne lit de document. Aucun des huit ne peut regarder une vidéo.

Camp B — texte, images et vidéo, sans fichiers : 29 modèles. Prix d'entrée médian 0,25 $ par million de tokens. Vingt-deux des vingt-neuf portent un préfixe Qwen ; les autres sont MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B et deux versions de Qwen ajustées pour Obsidian. Son plafond est Qwen3.8-Max à 2,00 $ par million — autrement dit, le modèle de lecture vidéo le plus cher de ce camp coûte exactement la moitié de Claude Opus 5.5.

L'écart médian entre les camps est de 8×. L'écart d'adhésion est encore plus marqué. Sur les 182 modèles qui déclarent une surface d'entrée, 60 acceptent des documents et pas de vidéo, 32 acceptent de la vidéo et pas de documents, 73 n'acceptent ni l'un ni l'autre, et seulement 17 acceptent les deux. Le chevauchement est suffisamment faible pour que les deux groupes apparaissent comme des produits presque disjoints, et les 17 du milieu appartiennent presque entièrement au haut de gamme de Google — quinze sur dix-sept — plus les deux versions Muse Spark de Meta.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Il existe une raison plausible à cette configuration. La compréhension de documents et la compréhension de vidéos sont des problèmes d’ingénierie différents, avec des courbes de coûts différentes, et les fournisseurs qui ont résolu la vidéo en premier sont, pour la plupart, ceux qui vendent des tokens bon marché par centaines de millions. Les fournisseurs qui ont résolu les documents en premier sont ceux qui vendent du raisonnement à prix élevé. Personne n’a encore été contraint de faire les deux au même prix, si bien que le marché s’est scindé en deux produits et les a tarifés en conséquence.

Les dix-neuf qui prennent tout

Dix-neuf modèles acceptent les quatre types d'entrée — texte, image, vidéo et audio. Seize sont de Google, deux de Meta, un de MiniMax. La gamme de Google au sein de ce groupe va de 0,10 $ par million pour gemini-2.5-flash-lite à 4,00 $ pour gemini-pro-latest, donc « lit tout » n'est pas un palier tarifaire ; c'est une décision que Google a prise à chaque niveau de prix. La contribution de Meta est la paire de versions Muse Spark — Muse Spark 1.1 et Muse Spark 1.2, identiques au catalogue à 1,25 $ par million en entrée et 4,25 $ en sortie, avec un contexte de 1 M de tokens.

C'est le camp qui illustre le point opérationnel de l'article : un pipeline conscient de la vidéo n'a pas besoin d'un modèle phare. Il faut choisir dans une liste de dix-neuf, dont dix coûtent moins d'un dollar par million de jetons d'entrée.

Cinq modèles sur ce tableau émettent autre chose que du texte

Lire une vidéo et en produire une sont deux tours de force différents, et le second est plus rare. Sur les 204 modèles, 139 déclarent une surface de sortie ; cinq d'entre eux nomment autre chose que du texte.

Trois sont des générateurs d'images : Nano Banana (Gemini 2.5 Flash Image) à 0,30 $ en entrée et 30,00 $ en sortie par million de jetons, Nano Banana Pro (Gemini 3 Pro Image Preview) à 0,24 $ par requête, et Nano Banana 2 (Gemini 3.1 Flash Image Preview) à 0,151 $ par requête. Deux génèrent de la vidéo : MiniMax H3, facturé à la seconde de sortie générée — 0,08 $ par seconde en 768P et 0,13 $ en 2K, pour des clips de quatre à quinze secondes avec audio stéréo natif — et OrcaDub 1.0, facturé à 0,60 $ par minute de vidéo source, couvrant 28 langues et clonant une voix distincte par locuteur.

Deux lectures à éviter ici. Premièrement, les 65 lignes restantes laissent le champ de sortie vide ; un champ vide signifie que le catalogue ne consigne pas de surface de sortie, et ce n'est pas une preuve qu'un modèle n'émet que du texte. Deuxièmement, lire la vidéo et produire de la vidéo sont des axes distincts qui ne se recoupent presque pas dans ce tableau — OrcaDub 1.0 prend la vidéo en entrée et la restitue en sortie, ce qui en fait le seul modèle ici qui puisse plausiblement se situer aux deux extrémités d'un pipeline, tandis que MiniMax H3 prend quatre types d'entrée pour produire un seul type de sortie qui n'est pas du texte.

Quoi router vers où

Quatre règles découlent du recensement, et elles sont peu coûteuses à appliquer.

• Si votre entrée est un clip, ne vous tournez pas d'abord vers un modèle phare de la frontière. Le camp qui lit la vidéo sans avoir besoin de documents compte 29 modèles, dont vingt-deux Qwen, et sa médiane est d'un quart par million. Envoyez plutôt au modèle phare les images et la transcription, et laissez-le faire le raisonnement.

• Si votre entrée est un PDF, un contrat ou un document long, le camp de la vidéo n'est pas le bon camp.Seuls 17 modèles déclarent à la fois une entrée fichier et une entrée vidéo, et chaque modèle qui déclare une entrée fichier déclare aussi une entrée image, donc les deux vont de pair. Claude Opus 5.5à 4,00 $ par million achète la surface documentaire plus une fenêtre de 1 M de tokens, c'est le compromis que vous faites.

• Si vous avez besoin de produire des médias, vous choisissez parmi cinq modèles, et non dans le tableau. Trois génèrent des images fixes et deux génèrent de la vidéo, et ces deux derniers facturent à la seconde et à la minute plutôt qu'au token — une estimation de coût établie à partir des prix d'entrée sera donc erronée par construction.

• Si vous avez besoin d'une sortie vidéo et que votre source est un script, la génération de code reste la voie la moins coûteuse sur cette plateforme. Claude Opus 5.5 écrit le moteur de rendu pour le prix d'un texte ; MiniMax H3 le rend pour 8 cents par seconde. Enchaîner les deux coûte moins cher que l'une ou l'autre de ces alternatives et vous laisse un fichier que vous pouvez modifier.

FAQ

Claude Opus 5.5 peut-il regarder une vidéo ?

Non. Ses modalités d'entrée déclarées sont le texte, l'image et le fichier. La vidéo n'en fait pas partie, pas plus que l'audio. Un enregistrement d'écran ou un clip produit doit être converti — images échantillonnées, transcription, ou les deux — avant de pouvoir être envoyé.

Est-ce que Claude Opus 5.5 génère directement des vidéos ?

Pas en tant que modalité. Il renvoie du texte, et ce texte est souvent un programme autonome qui produit du mouvement lorsque vous l'exécutez. C'est vous qui faites le rendu ; le modèle n'émet jamais de pixel. Si vous voulez un modèle sur ce tableau qui renvoie lui-même de la vidéo, MiniMax H3 et OrcaDub 1.0 sont les deux.

« multimodal » est-il un palier tarifaire ?

Non, et le classement montre pourquoi dans les deux sens. Google propose une multimodalité complète à quatre entrées, de 0,10 $ par million de jetons d'entrée à 4,00 $, tandis que le prix d'entrée le plus élevé à égalité du classement — openai/gpt-5.5-pro à 30 $ par million — lit les documents et les images, mais pas la vidéo. Ce que vous payez, c'est le niveau de raisonnement, pas le nombre de modalités.

Pourquoi tant de modèles lisent-ils des documents, tant de lisent-ils ainsi

Comme les fichiers et les images vont de pair sur ce tableau : les 77 modèles qui lisent les fichiers lisent aussi les images, donc l’entrée de fichiers est une extension de l’entrée d’images plutôt qu’une capacité indépendante. Le chiffre à retenir est que 60 des 182 modèles déclarant une surface d’entrée prennent en charge les documents et les images, et pas du tout la vidéo — soit un tiers du tableau, et là où se situe le niveau des modèles phares.

Comment devrais-je tarifer un pipeline vidéo ?

Selon l'unité de facturation du modèle. Les lecteurs vidéo sont facturés au token, comme n'importe quel modèle de conversation. Les générateurs vidéo de ce tableau sont facturés à la seconde produite (MiniMax H3 : 0,08 $ en 768P, 0,13 $ en 2K) ou à la minute de source (OrcaDub 1.0 : 0,60 $). Mélanger les deux unités dans une même estimation est la façon la plus courante de se tromper sur un budget vidéo.

La ligne à retenir

Ce qui est intéressant à propos de Claude Opus 5.5, ce n'est pas qu'il soit multimodal. La plupart des modèles du marché le sont. C'est que la frontière des modalités se situe à un endroit inhabituel — documents et images fixes en entrée, texte en sortie, aucune vidéo dans un sens ou dans l'autre — alors que les démos qui l'ont rendu célèbre sont des vidéos. Ces deux faits ne sont pas en contradiction, et les interpréter comme une contradiction, c'est ce qui rend l'histoire de la vidéo par le code déroutante. Le modèle écrit un moteur de rendu ; le moteur de rendu fabrique le film. Ce que l'on peut transmettre au modèle, c'est un script, un document et une capture d'écran.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Tout ce qui précède est un instantané du catalogue OrcaRouter au 2026-09-29 et des déclarations de modalités qu'il contient. Les spécifications des fournisseurs évoluent, et la liste des modalités d'une fiche de modèle est la première chose à revérifier avant de vous fonder sur un chiffre. Si une affirmation ici compte pour une décision, ouvrez la page du modèle — les champs s'y trouvent.