Card del titolo hero per Claude Opus 5.5 con la scritta "Cosa produce davvero un video al primo colpo", con il logo OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Claude Opus 5.5 gira un video musicale in un colpo solo: cosa produce davvero "Plan a Video"

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un segnale pubblicato su X il 23 settembre 2026 recita: "Piano di Claude: un video di opus 5.5 one shotted", con allegato un omaggio a @jeffgwoah. È un'affermazione dimostrativa, non un annuncio di rilascio — e si colloca dalla parte sbagliata di ciò che di solito conta. Claude Opus 5.5 non è un modello non ancora rilasciato da scovare da un leak. Anthropic lo ha distribuito il 22 settembre 2026, a 4 $ per milione di token in input e 20 $ per milione in output. Ha un giorno di vita, è generalmente disponibile ed è già nel listino prezzi. Quindi la domanda interessante non è se Opus 5.5 esista. È che cosa stiano effettivamente mostrando questi post sul "one-shotted a video", perché la frase significa qualcosa di più ristretto di quanto sembri, e la differenza decide se puoi usarne qualcosa.

Ecco la versione breve, ed è la parte che la maggior parte dei repost omette: nelle demo che reggono un esame attento, Claude Opus 5.5 non genera pixel. Scrive codice che dipinge pixel. L'output è un programma, non un file video.

Che cosa hanno effettivamente fatto le due demo in circolazione

Due artefatti pubblici sono alla base di questa classe di affermazioni, ed entrambi sono verificabili perché entrambi hanno pubblicato il loro codice sorgente.

Il primo è un video musicale di 156,6 secondi per una canzone intitolata "I'm Upping My P(doom)", un repo chiamato PDoomVideo pubblicato su GitHub il 22 settembre 2026 — lo stesso giorno in cui è stato lanciato Opus 5.5. Il suo README afferma che il video "ha richiesto due generazioni, entrambe in Claude Code", la prima attribuita a Claude Opus 5.5 (Medium) e la seconda a Claude Opus 5.5 con effort predefinito. Afferma inoltre che "tutto in questo repository è stato generato dal modello" e che "non sono state specificate idee per le scene" — l'unica indicazione fornita era di usare un particolare design del personaggio e di dare a ogni verso immagini e transizioni interessanti.

Il secondo è un repository demo con tre giochi pubblicato il 23 settembre 2026, più vicino a un esperimento controllato che a una vetrina: tre giochi 3D giocabili nel browser, un prompt di una sola frase ciascuno, generati in un'unica sessione con quello che il repository descrive come zero modifiche umane al codice, poi distribuiti. I giochi sono HTML in un singolo file senza risorse esterne: modelli, texture, animazioni e suoni sono tutti generati proceduralmente dal codice. Uno dei tre ha richiesto al modello di cercare la disposizione ufficiale di una mappa di gioco e di ricostruirne la geometria da quella ricerca prima di scrivere qualsiasi cosa.

Nessuno dei due repository è una pubblicazione di un fornitore. Entrambi sono artefatti di terze parti, autodichiarati, e in particolare l'affermazione "zero interventi umani" riguarda una cronologia git, non qualcosa che una parte esterna abbia verificato. Considera la descrizione del processo come il resoconto dell'autore e gli artefatti stessi come le prove.

Lo storyboard è il vero output

Il dettaglio che decide se "one-shotted" è una descrizione equa è un file nel primo repository chiamato STORYBOARD.md. Non è la lista delle inquadrature di un essere umano. È un documento che il modello ha scritto per sé stesso dopo la sua prima passata di generazione, ed è davvero specifico: una regola secondo cui "qualcosa accade sullo schermo" in ogni inquadratura, un'istruzione di tenere il testo fuori dai frame, un cast di personaggi con nomi e design fissi, una palette che passa dal crema caldo al viola spaziale fino al rosso allarme e ritorno, una regola per cui le espressioni dei personaggi si trasformano gradualmente invece di scattare, e il requisito che ogni stacco sia motivato dall'azione — un morso verso il nero, una caduta, uno zoom attraverso un occhio.

Quel documento è il piano a cui punta il testo del segnale. Il modello ha prodotto un brief di regia, poi ha eseguito dei subagenti su di esso in parallelo, uno per capitolo, ciascuno dei quali scriveva un file JavaScript che disegna il proprio segmento della timeline.

La pipeline di rendering è ordinaria e vale la pena dirla chiaramente, perché è qui che crolla la narrazione secondo cui "l'AI ha fatto un video": i fotogrammi vengono dipinti in una pagina usando p5.js e una libreria di pennelli ad acquerello, uno script Node pilota quella pagina in Chrome headless e cattura ogni fotogramma, e ffmpeg unisce i fotogrammi con la traccia audio. A 24 fotogrammi al secondo per 156,6 secondi, sono circa 3.760 fotogrammi renderizzati uno alla volta.

Quindi la frase accurata non è "Claude Opus 5.5 ha generato un video". È "Claude Opus 5.5 ha scritto, e poi diretto, un programma che renderizza un video". La distinzione non è pedante — è l'intera ragione per cui la tecnica è utile a chiunque non stia realizzando un video musicale.

Perché la frase "due generazioni" conta più della frase "one-shot"

Lo stesso README mina il proprio titolo. Il video ha richiesto due generazioni, non una. La prima passata ha prodotto un risultato che l'autore ha poi portato oltre; lo storyboard e la guida all'animazione — i documenti che rendono coerente la seconda passata — sono stati scritti dopo quella prima passata, non prima.

Questa è la forma onesta di ogni seria attività di generazione a lungo termine, e vale la pena dirlo perché l'inquadramento one-shot crea un'aspettativa che gli artefatti non soddisfano. Il prompt era un unico messaggio. Il lavoro non è stato un'unica passata. Ciò che il modello ha fatto è stato tenere insieme una build grande, multi-file e di più ore abbastanza bene che la seconda passata è stata una revisione anziché un riavvio — che è una capacità reale e molto meno appariscente di «un prompt, un video».

C'è un numero indipendente che lo descrive meglio di quanto facciano le demo. Artificial Analysis ha misurato Claude Opus 5.5 sul suo Intelligence Index a 58 al massimo sforzo — il punteggio più alto che abbia registrato, con diversi punti di vantaggio sui modelli successivi — e ha riportato che il modello consuma circa 119.000 token di output per attività dell'Indice, contro circa 73.000 per Claude Opus 5 e circa 78.000 per Claude Fable 5.1. Utilizza circa 1,6 volte i token di output e si attesta su un costo per attività più o meno equivalente (~5,98 $ contro ~5,86 $) nonostante un prezzo per token inferiore del 20%. La generazione a lungo orizzonte è ciò che quel profilo di token appare dall'esterno: il modello sta spendendo il budget su se stesso.

A single-column scoreboard for Claude Opus 5.5 with rows reading Shipped: September 22, 2026; Price: $4 / $20 per M tokens; AA Index: 58 at max effort; Output tokens per Index task: 119k; Cost per Index task: $5.98; Native video output: none, over a footer line reading 'AA figures per Artificial Analysis; price per Anthropic.'A four-card pipeline diagram titled 'Claude Opus 5.5 — what the run actually produces', with cards reading Plan: STORYBOARD.md, written by the model; Build: one JavaScript painter per chapter; Render: ~3,760 frames at 24 fps in headless Chrome; Join: ffmpeg adds the audio track, over a footer reading 'Pipeline as described in the PDoomVideo repo README; not independently reproduced.'

Dove gli artefatti smettono di essere utilizzabili

Le modalità di fallimento in questa categoria di lavoro sono costanti, ed entrambi i repository puntano alla stessa da direzioni diverse.

• L'output è un programma, non un file. Se hai bisogno di un MP4 da consegnare a qualcuno, hai ancora bisogno di Node, un browser e ffmpeg. Il modello ha prodotto il renderer, non il render. Questa è una dipendenza di build che possiedi per sempre.

• Si scala con i fotogrammi, non con i prompt. 3.760 fotogrammi hanno richiesto un passaggio notturno scriptato sull'hardware dell'autore. Nulla in Opus 5.5 cambia il costo di dipingere il fotogramma 2.000.

• Il determinismo è un requisito, non un vezzo. I frame vengono renderizzati in parallelo e fuori ordine, quindi ogni frame deve essere una funzione pura del suo timestamp — nessuno stato trasportato, nessuna casualità senza seme. Un modello che non lo ha interiorizzato produce un video che sfarfalla. Entrambi i repo lo gestiscono; nulla nel prompt lo impone.

• One-shot non significa senza verifica. La prova più chiara è il lavoro sul gioco del secondo repo: il modello ha dovuto studiare la disposizione di una mappa esistente prima di costruirla, il che equivale a decidere che la sua prima risposta sarebbe stata sbagliata.

• Nessuno ha quantificato il costo del fallimento. Nessuno dei due repo riporta quante iterazioni siano servite, quanti token siano stati consumati o quanta parte della seconda generazione sia stata dedicata a correggere la prima. È questo il numero di cui un team ha davvero bisogno prima di impegnarsi.

Che cosa cambia questo per te e che cosa no

Se speravi in un modello di generazione video, Claude Opus 5.5 non lo è, e nessuna quantità di filmati dimostrativi può renderlo tale. Il materiale di lancio di Anthropic non contiene alcuna capacità di generazione video; le valutazioni pubblicate del modello riguardano coding agentico, uso del computer e lavoro intellettuale. Ciò che le demo dimostrano è la generazione di codice su lungo orizzonte con un brief creativo — la stessa facoltà che emerge nella migrazione da 680.000 righe e nel port da C a Rust citati da Anthropic nel suo stesso post di lancio, solo indirizzata verso qualcosa che puoi guardare.

Se è questa la capacità che vuoi, la domanda pratica smette di essere "quale modello" e diventa "come faccio a far girare una cosa del genere senza vincolarci un percorso di produzione". La generazione a lungo orizzonte è costosa e il suo modo di fallire è silenzioso: ottieni un programma plausibile che renderizza per quattro minuti e poi si rompe. Il modo ragionevole di testarla è instradare il lavoro attraverso un endpoint che hai già, invece che tramite un nuovo contratto: Opus 5.5 è su OrcaRouter al prezzo di listino di Anthropic con 0% di ricarico, insieme agli altri modelli della famiglia, così una generazione notturna può usare la stessa chiave e le stesse regole di failover di tutto il resto che chiami. Se l'esecuzione muore al fotogramma 3.000, quello è un problema di routing, non una riarchitettura.

Artificial Analysis article page dated September 22, 2026 headlined 'Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index, along with a 20% price cut and larger cache hit discount', showing the key-takeaways list: an Index score of 58 at max effort, pricing cut to $4/$20 per 1M tokens from $5/$25, cache reads down to $0.20, ~119k output tokens per Index task against ~73k for Opus 5, and four of five effort levels on the Intelligence vs Cost per Task frontier.

Due cose meritano attenzione prima di pianificare in base a questo. Anthropic ha detto che Sonnet 5.5 e Haiku 5.5 seguiranno "nelle prossime settimane", il che cambierà i calcoli su un rendering lungo — un modello più economico in grado di tenere insieme una build multi-file renderebbe il passaggio notturno routine anziché degno di nota. E lo schema dello storyboard è di per sé portabile: nulla in quel documento è specifico di Opus 5.5, e nulla impedisce a un modello più piccolo di scriverne uno peggiore.

Per ora, la lettura onesta di «Claude's Plan a video by opus 5.5 one shotted» è più ristretta di quanto sembri e più utile di quanto appaia. Il modello ha scritto una lista delle inquadrature, ha istruito i propri subagenti e poi ha scritto il renderer — e il fatto che un piano del genere sia sopravvissuto al contatto con 3.760 fotogrammi è l'affermazione che vale la pena verificare, non il video.