
Claude Opus 5.5 réalise un clip vidéo en un seul essai : ce que « Plan a Video » produit vraiment
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 496 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 183 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Un signal publié sur X le 23 septembre 2026 se lit : « Le plan de Claude : une vidéo par opus 5.5 en un seul essai », accompagné d’un hommage à @jeffgwoah. Il s’agit d’une affirmation de démo, pas d’une affirmation de sortie — et elle tombe du mauvais côté de ce qui compte d’ordinaire. Claude Opus 5.5 n’est pas un modèle non publié à dénicher dans une fuite. Anthropic l’a lancé le 22 septembre 2026, à 4 $ par million de tokens d’entrée et 20 $ par million de tokens de sortie. Il n’a qu’un jour d’existence, il est en disponibilité générale, et figure déjà sur la grille tarifaire. Donc la question intéressante n’est pas de savoir si Opus 5.5 existe. C’est ce que ces publications « one-shotted a video » montrent réellement, car l’expression signifie quelque chose de plus étroit que ce qu’elle laisse entendre, et la différence détermine si vous pouvez en utiliser la moindre partie.
Voici la version courte, et c’est la partie que la plupart des reposts omettent : dans les démos qui résistent à l’examen, Claude Opus 5.5 ne génère pas de pixels. Il écrit du code qui peint des pixels. Le résultat est un programme, pas un fichier vidéo.
Ce que les deux démos en circulation ont réellement fait
Deux artefacts publics sous-tendent cette catégorie d’affirmations, et tous deux sont vérifiables car tous deux ont publié leur source.
Le premier est un clip musical de 156,6 secondes pour une chanson intitulée « I'm Upping My P(doom) », un dépôt nommé PDoomVideo publié sur GitHub le 22 septembre 2026 — le jour même du lancement d'Opus 5.5. Son README indique que le clip « a nécessité deux générations, toutes deux dans Claude Code », la première attribuée à Claude Opus 5.5 (Medium) et la seconde à Claude Opus 5.5 avec l'effort par défaut. Il indique également que « tout ce qui se trouve dans ce dépôt a été généré par le modèle » et qu'« aucune idée de scène n'a été spécifiée » — la seule consigne donnée était d'utiliser un design de personnage particulier et de donner à chaque parole des visuels et des transitions intéressants.
Le second est un dépôt de démonstration de trois jeux publié le 23 septembre 2026, plus proche d'une expérience contrôlée que d'une vitrine : trois jeux 3D jouables dans le navigateur, avec une invite d'une seule phrase chacun, générés en une seule session avec ce que le dépôt décrit comme zéro modification humaine du code, puis déployés. Les jeux tiennent chacun dans un seul fichier HTML, sans ressources externes — les modèles, les textures, l'animation et le son sont tous générés de manière procédurale par le code. L'un des trois a exigé que le modèle recherche la disposition officielle d'une carte de jeu et reconstruise sa géométrie à partir de cette recherche avant d'écrire quoi que ce soit.
Aucun des deux dépôts n’est une publication d’un fournisseur. Tous deux sont des artefacts tiers, autodéclarés, et l’affirmation de « zéro modification humaine » en particulier porte sur un historique Git, et non sur un élément audité par une partie extérieure. Considérez la description du processus comme le récit de l’auteur et les artefacts eux-mêmes comme les éléments de preuve.
Le storyboard est le véritable résultat.
Le détail qui détermine si « one-shotted » est une description juste est un fichier dans le premier dépôt appelé STORYBOARD.md. Ce n'est pas une liste de plans établie par un humain. C'est un document que le modèle a écrit pour lui-même après sa première passe de génération, et il est véritablement précis : une règle selon laquelle « quelque chose se passe à l'écran » dans chaque plan, une instruction de garder le texte hors des cadres, un ensemble nommé de personnages aux designs fixes, une palette qui évolue du crème chaud au violet spatial puis au rouge d'alarme, et retour, une règle selon laquelle les expressions des personnages se transforment plutôt que de basculer brusquement, et une exigence que chaque coupe soit motivée par l'action — une morsure vers le noir, une chute, un zoom à travers un œil.
Ce document est le plan vers lequel pointe le texte du signal. Le modèle a produit un brief de réalisation, puis a lancé des sous-agents en parallèle sur cette base, un par chapitre, chacun écrivant un fichier JavaScript qui peint son propre segment de la chronologie.
Le pipeline de rendu est ordinaire et mérite d’être énoncé clairement, car c’est là que le cadrage « une IA a fait une vidéo » s’effondre : les images sont peintes dans une page à l’aide de p5.js et d’une bibliothèque de pinceaux aquarelle, un script Node pilote cette page dans Chrome en mode headless et capture chaque image, et ffmpeg assemble les images avec la piste audio. À 24 images par seconde sur 156,6 secondes, cela fait environ 3 760 images rendues une par une.
Donc la phrase exacte n’est pas « Claude Opus 5.5 a généré une vidéo. » C’est « Claude Opus 5.5 a écrit, puis dirigé, un programme qui génère une vidéo. » La distinction n’est pas pédante — c’est toute la raison pour laquelle la technique est utile à quiconque ne réalise pas de clip musical.
Pourquoi la formule « deux générations » compte plus que la formule « one-shot »
Le même README sape son propre titre. La vidéo a nécessité deux générations, pas une. La première passe a produit un résultat que l’auteur a ensuite poussé plus loin ; le storyboard et le guide d’animation — les documents qui rendent la seconde passe cohérente — ont été écrits après cette première passe, pas avant.
C'est la forme honnête de toute tâche sérieuse de génération à long horizon, et cela vaut la peine d'être dit, car le cadrage « en une seule tentative » fixe une attente que les artefacts ne satisfont pas. Le prompt était un seul message. Le travail n'a pas été fait en une seule passe. Ce que le modèle a fait, c'est tenir ensemble une construction volumineuse, multi-fichiers et de plusieurs heures, suffisamment bien pour que la deuxième passe soit une révision plutôt qu'un redémarrage — ce qui est une capacité réelle et bien moins tape-à-l'œil que « un prompt, une vidéo ».
Il existe un chiffre indépendant qui décrit cela mieux que ne le font les démos. Artificial Analysis a mesuré Claude Opus 5.5 sur son Intelligence Index à 58 en effort maximal — le score le plus élevé jamais enregistré, plusieurs points devant les modèles suivants — et a rapporté que le modèle consomme environ 119 000 tokens de sortie par tâche de l’Index, contre environ 73 000 pour Claude Opus 5 et environ 78 000 pour Claude Fable 5.1. Il utilise environ 1,6 fois plus de tokens de sortie et aboutit à un coût par tâche à peu près identique (~5,98 $ contre ~5,86 $) malgré un prix par token inférieur de 20 %. La génération à long horizon, voilà à quoi ressemble ce profil de tokens vu de l’extérieur : le modèle dépense le budget sur lui-même.


Où les artefacts ne sont plus utilisables
Les modes de défaillance dans cette catégorie de travail sont constants, et les deux dépôts pointent vers le même, sous des angles différents.
• La sortie est un programme, pas un fichier. Si vous avez besoin d'un MP4 à remettre à quelqu'un, il vous faut encore Node, un navigateur et ffmpeg. Le modèle a produit le moteur de rendu, pas le rendu. C'est une dépendance de build qui vous appartient pour toujours.
• L'échelle dépend des images, pas des prompts. 3 760 images ont nécessité une passe nocturne scriptée sur le matériel de l'auteur. Rien dans Opus 5.5 ne change le coût du rendu de la 2 000e image.
• Le déterminisme est une exigence, pas un simple agrément. Les images sont rendues en parallèle et dans le désordre, donc chaque image doit être une fonction pure de son horodatage — aucun état conservé d'une image à l'autre, aucun aléa non initialisé. Un modèle qui n'a pas intégré cela produit une vidéo qui scintille. Les deux dépôts le gèrent ; rien dans le prompt ne l'impose.
• Un one-shot ne veut pas dire sans audit. La preuve la plus claire est le travail sur le jeu du deuxième dépôt : le modèle a dû étudier la disposition d'une carte existante avant de la construire, ce qui revient pour lui à décider que sa première réponse aurait été erronée.
• Personne n'a chiffré l'échec. Aucun des deux dépôts ne rapporte combien de tentatives ont été nécessaires, combien de jetons ont été brûlés, ni quelle part de la seconde génération servait à corriger la première. C'est le chiffre dont une équipe a réellement besoin avant de s'engager.
Ce que cela change pour vous, et ce que cela ne change pas
Si vous espériez un modèle de génération vidéo, Claude Opus 5.5 n'en est pas un, et aucune quantité de séquences de démonstration ne suffit à en faire un. Le contenu de lancement d'Anthropic ne comporte aucune capacité de génération vidéo ; les évaluations publiées du modèle portent sur le codage agentique, l'utilisation d'ordinateur et le travail intellectuel. Ce que les démos démontrent, c'est de la génération de code sur un horizon long à partir d'un brief créatif — la même faculté qui se manifeste dans la migration de 680 000 lignes et le portage de C vers Rust qu'Anthropic cite dans son propre article de lancement, simplement dirigée vers quelque chose que vous pouvez regarder.
Si c'est cette capacité que vous voulez, la question pratique cesse d'être « quel modèle » pour devenir « comment exécuter une chose comme celle-ci sans y engager un chemin de production ». La génération sur un horizon long est coûteuse et son mode de défaillance est silencieux — vous obtenez un programme plausible qui produit un rendu pendant quatre minutes, puis casse. La façon raisonnable de le tester consiste à acheminer le travail via un endpoint que vous avez déjà plutôt qu'un nouveau contrat : Opus 5.5 est sur OrcaRouter au prix catalogue d'Anthropic avec 0 % de marge, aux côtés des autres modèles de la famille, de sorte qu'une exécution de génération nocturne peut utiliser la même clé et les mêmes règles de basculement que tout le reste de ce que vous appelez. Si l'exécution meurt à l'image 3 000, c'est un problème de routage plutôt qu'une réarchitecture.

Deux choses méritent d’être surveillées avant de planifier en fonction de cela. Anthropic a déclaré que Sonnet 5.5 et Haiku 5.5 suivraient « dans les semaines à venir », ce qui changera l’équation d’un long rendu — un modèle moins cher capable de maintenir ensemble un build multi-fichiers rendrait la passe nocturne routinière plutôt que remarquable. Et le schéma de storyboard lui-même est portable : rien dans ce document n’est propre à Opus 5.5, et rien n’empêche un modèle plus petit d’en écrire un moins bon.
Pour l’instant, la lecture honnête de « Le plan de Claude : une vidéo par opus 5.5 réalisée en un seul essai » est plus restrictive qu’elle n’en a l’air et plus utile qu’elle n’y paraît. Le modèle a écrit une liste de plans, a briefé ses propres sous-agents, puis a écrit le moteur de rendu — et le fait qu’un plan comme celui-là ait survécu au contact de 3 760 images est l’affirmation qui mérite d’être testée, pas la vidéo.
