Hero-titelkort för Claude Opus 5.5 med texten ”Vad en video som gjorts i ett enda försök faktiskt producerar”, med OrcaRouter-logotypen i det nedre högra hörnet.
Engineering & Research

Claude Opus 5.5 gör en musikvideo i ett svep: Vad ”Plan a Video” faktiskt producerar

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

En signal som publicerades på X den 23 september 2026 lyder: "Claude's Plan: en video av Opus 5.5 gjord i ett enda försök," med en hyllning till @jeffgwoah bifogad. Det är ett demopåstående, inte ett lanseringspåstående – och det hamnar på fel sida av det som vanligtvis spelar roll. Claude Opus 5.5 är inte en osläppt modell som ska nosas upp ur en läcka. Anthropic släppte den den 22 september 2026, för 4 USD per miljon indatatoken och 20 USD per miljon utdatatoken. Den är en dag gammal, allmänt tillgänglig och finns redan på prislistan. Så den intressanta frågan är inte huruvida Opus 5.5 existerar. Det är vad dessa "one-shotted a video"-inlägg faktiskt visar, eftersom frasen betyder något snävare än den låter, och skillnaden avgör om du kan använda något av det.

Här är den korta versionen, och det är den delen som de flesta återpubliceringar utelämnar: i de demos som håller för granskning genererar Claude Opus 5.5 inte pixlar. Den skriver kod som målar pixlar. Utdata är ett program, inte en videofil.

Vad de två demos som är i omlopp faktiskt gjorde

Två offentliga artefakter ligger bakom den här typen av påstående, och båda går att kontrollera eftersom båda publicerade sin källa.

Den första är en 156,6 sekunder lång musikvideo till en låt som heter "I'm Upping My P(doom)", ett repo som heter PDoomVideo och som publicerades på GitHub den 22 september 2026 — samma dag som Opus 5.5 lanserades. I dess README står det att videon "tog två generationer, båda i Claude Code", där den första tillskrivs Claude Opus 5.5 (Medium) och den andra Claude Opus 5.5 med standardansträngning. Där står också att "allt i detta repository genererades av modellen" och att "inga scenidéer angavs" — den enda instruktionen som gavs var att använda en viss karaktärsdesign och att ge varje textrad intressanta visuella effekter och övergångar.

Den andra är ett demorepo med tre spel, publicerat den 23 september 2026, som ligger närmare ett kontrollerat experiment än en uppvisning: tre spelbara 3D-webbläsarspel, en prompt på en enda mening vardera, genererade i en enda session med vad repot beskriver som noll mänskliga redigeringar av koden, och sedan driftsatta. Spelen är HTML i en enda fil utan externa tillgångar – modeller, texturer, animering och ljud genereras alla procedurellt av kod. Ett av de tre krävde att modellen tog reda på en spelbanas officiella layout och byggde upp dess geometri utifrån den efterforskningen innan den skrev något.

Inget av repona är en leverantörspublikation. Båda är tredjepartsartefakter, självrapporterade, och särskilt påståendet om "noll mänskliga redigeringar" är ett påstående om en git-historik, inte något som en utomstående part har granskat. Betrakta processbeskrivningen som författarens redogörelse och artefakterna själva som bevisningen.

Storyboarden är det verkliga resultatet

Detaljen som avgör huruvida "one-shotted" är en rättvisande beskrivning är en fil i det första repot som heter STORYBOARD.md. Det är inte en människas tagninglista. Det är ett dokument som modellen skrev åt sig själv efter sin första genereringsomgång, och det är verkligen specifikt: en regel att "något händer på skärmen" i varje tagning, en instruktion att hålla text borta från bildrutorna, en namngiven ensemble av figurer med fasta designer, en palett som rör sig från varm gräddvit via rymdviolett till alarmrött och tillbaka, en regel att figurernas ansiktsuttryck genomgår morfning i stället för att snabbt skifta, och ett krav att varje klipp ska motiveras av handling — ett bett mot svart, ett fall, en zoom genom ett öga.

Det dokumentet är planen som signaltexten pekar på. Modellen tog fram en regibrief och körde sedan subagenter mot den parallellt, en per kapitel, där var och en skrev en JavaScript-fil som målar sitt eget segment av tidslinjen.

Renderingspipelinen är vanlig och värd att nämna rakt ut, för det är där inramningen "AI gjorde en video" faller samman: bildrutor målas i en sida med hjälp av p5.js och ett akvarellpenselbibliotek, ett Node-skript driver den sidan i headless Chrome och tar skärmbilder av varje bildruta, och ffmpeg fogar samman bildrutorna med ljudspåret. Vid 24 bildrutor per sekund över 156,6 sekunder blir det ungefär 3 760 bildrutor som renderas en i taget.

Så den korrekta meningen är inte "Claude Opus 5.5 genererade en video." Det är "Claude Opus 5.5 skrev, och regisserade sedan, ett program som renderar en video." Skillnaden är inte pedantisk – det är hela anledningen till att tekniken är användbar för alla som inte gör en musikvideo.

Varför raden "two generations" spelar större roll än raden "one-shot"

Samma README undergräver sin egen rubrik. Videon tog två generationer, inte en. Den första omgången gav ett resultat som författaren sedan drev vidare; storyboarden och animationsguiden — dokumenten som gör den andra omgången sammanhängande — skrevs efter den första omgången, inte före den.

Det är den ärliga formen av varje seriös genereringsuppgift med lång horisont, och det är värt att säga eftersom inramningen som en engångsuppgift skapar en förväntan som artefakterna inte infriar. Prompten var ett meddelande. Arbetet var inte ett enda pass. Vad modellen gjorde var att hålla samman ett stort bygge med flera filer som pågick under många timmar tillräckligt väl för att det andra passet blev en revidering snarare än en omstart — vilket är en verklig och mycket mindre prålig förmåga än "en prompt, en video."

Det finns ett oberoende tal som beskriver detta bättre än demosarna gör. Artificial Analysis mätte Claude Opus 5.5 på sitt Intelligence Index till 58 vid maximal ansträngning – den högsta poäng de har registrerat, flera poäng före nästa modeller – och rapporterade att modellen förbrukar ungefär 119 000 utdatatoken per Index-uppgift, mot omkring 73 000 för Claude Opus 5 och omkring 78 000 för Claude Fable 5.1. Den använder omkring 1,6 gånger utdatatokenmängden och landar på ungefär samma kostnad per uppgift (~5,98 USD mot ~5,86 USD) trots ett 20 % lägre pris per token. Långhorisontell generering är hur den tokenprofilen ser ut utifrån: modellen lägger budgeten på sig själv.

A single-column scoreboard for Claude Opus 5.5 with rows reading Shipped: September 22, 2026; Price: $4 / $20 per M tokens; AA Index: 58 at max effort; Output tokens per Index task: 119k; Cost per Index task: $5.98; Native video output: none, over a footer line reading 'AA figures per Artificial Analysis; price per Anthropic.'A four-card pipeline diagram titled 'Claude Opus 5.5 — what the run actually produces', with cards reading Plan: STORYBOARD.md, written by the model; Build: one JavaScript painter per chapter; Render: ~3,760 frames at 24 fps in headless Chrome; Join: ffmpeg adds the audio track, over a footer reading 'Pipeline as described in the PDoomVideo repo README; not independently reproduced.'

Där artefakterna slutar vara användbara

Felmoderna i den här typen av arbete är konsekventa, och båda repona pekar på detsamma från olika håll.

• Utdata är ett program, inte en fil. Om du behöver en MP4 som du kan ge till någon behöver du fortfarande Node, en webbläsare och ffmpeg. Modellen producerade renderaren, inte renderingen. Det är ett byggberoende som du äger för alltid.

• Det skalar med bildrutor, inte med prompter. 3 760 bildrutor tog en skriptad nattlig körning på författarens egen hårdvara. Ingenting med Opus 5.5 ändrar kostnaden för att måla bildruta 2 000.

• Determinism är ett krav, inte en finess. Bildrutor renderas parallellt och i oordning, så varje bildruta måste vara en ren funktion av sin tidsstämpel — inget medfört tillstånd, ingen slumpmässighet utan frö. En modell som inte har internaliserat det producerar en video som flimrar. Båda reporna hanterar det; inget i prompten tvingar fram det.

• One-shot betyder inte ogranskat. Det tydligaste beviset är det andra repots spelarbete: modellen var tvungen att undersöka en befintlig kartas layout innan den byggde den, vilket är modellen som avgör att dess första svar skulle ha varit fel.

• Ingen har prissatt misslyckandet. Inget av repona rapporterar hur många försök det tog, hur många tokens som brändes, eller hur mycket av den andra generationen som gick åt till att fixa den första. Det är siffran ett team faktiskt behöver innan man binder sig.

Vad detta förändrar för dig, och vad det inte gör

Om du hoppades på en videogenereringsmodell är Claude Opus 5.5 inte en sådan, och hur mycket demomaterial som helst gör den inte till en. Anthropics lanseringsmaterial innehåller ingen videogenereringsförmåga; modellens publicerade utvärderingar är agentisk kodning, datoranvändning och kunskapsarbete. Det som demona visar är långsiktig kodgenerering med en kreativ brief — samma förmåga som syns i migreringen på 680 000 rader och C-till-Rust-portningen som Anthropic hänvisar till i sitt eget lanseringsinlägg, bara riktad mot något du kan titta på.

Om det är den förmågan du vill ha, upphör den praktiska frågan att vara ”vilken modell” och blir ”hur kör jag något sådant här utan att binda en produktionsväg till det”. Långsiktig generering är dyr och dess felmod är tyst – du får ett trovärdigt program som renderar i fyra minuter och sedan går sönder. Det rimliga sättet att testa det är att dirigera arbetet genom en slutpunkt du redan har i stället för ett nytt avtal: Opus 5.5 finns på OrcaRouter till Anthropics listpris med 0 % påslag, tillsammans med de andra modellerna i familjen, så en genereringskörning över natten kan ligga på samma nyckel och samma failover-regler som allt annat du anropar. Om körningen dör vid bildruta 3 000 är det ett routingproblem snarare än en ny arkitektur.

Artificial Analysis article page dated September 22, 2026 headlined 'Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index, along with a 20% price cut and larger cache hit discount', showing the key-takeaways list: an Index score of 58 at max effort, pricing cut to $4/$20 per 1M tokens from $5/$25, cache reads down to $0.20, ~119k output tokens per Index task against ~73k for Opus 5, and four of five effort levels on the Intelligence vs Cost per Task frontier.

Två saker är värda att hålla ögonen på innan du planerar utifrån detta. Anthropic har sagt att Sonnet 5.5 och Haiku 5.5 följer "inom de närmaste veckorna", vilket kommer att ändra kalkylen för en lång rendering — en billigare modell som kan hålla ihop ett bygge med flera filer skulle göra nattkörningen rutinmässig snarare än anmärkningsvärd. Och själva storyboard-mönstret är portabelt: inget i det dokumentet är specifikt för Opus 5.5, och inget hindrar en mindre modell från att skriva ett sämre sådant.

För nu är den ärliga tolkningen av "Claude's Plan a video by opus 5.5 one shotted" snävare än den låter och mer användbar än den ser ut. Modellen skrev en tagninglista, briefade sina egna subagenter och skrev sedan renderaren – och det faktum att en sådan plan överlevde kontakten med 3 760 bildrutor är påståendet värt att testa, inte videon.