
Claude Opus 5.5 Multimodale: genera video dal codice, ma non riesce a guardarne uno
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 1009 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 195 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Chiedi a Claude Opus 5.5 un video e potresti ritrovarti con uno — un programma di chiamate HTML, CSS o canvas che disegna ogni fotogramma, che poi esegui. Dagli un video e chiedi cosa succede al suo interno e non ottieni assolutamente nulla, perché non c'è input video. Questa asimmetria è l'intera superficie modale di questo modello, ed è identica su tutti gli undici modelli Anthropic della nostra classifica, quindi vale la pena affermarlo chiaramente: Claude Opus 5.5 legge testi, immagini e file, scrive testo e si ferma lì. La classifica intorno a esso è molto meno uniforme. MiniMax H3 genera video direttamente, OrcaDub 1.0 prende in input un video e ne restituisce uno doppiato, e Qwen3.8-Max guarderà una clip per due dollari per milione di token di input — la metà di quanto Claude Opus 5.5 fa pagare per lo stesso milione, e con una capacità che non possiede.
Questa è una lettura della riga della modalità così come OrcaRouter la registra il 2026-09-29, su tutti i 204 modelli del catalogo. I numeri riportati di seguito sono dichiarazioni di catalogo, non i nostri benchmark — un campo di modalità è ciò che dice la scheda del modello, e le schede dei modelli cambiano.
Ciò che il catalogo registra effettivamente
Dei 204 modelli, 182 dichiarano una superficie di input. Gli altri 22 la lasciano vuota, il che è un'indicazione sul record più che sul modello — tra cui otto modelli video Kling, quattro meta-modelli OrcaRouter e una serie sparsa di endpoint del livello gratuito e di anteprima.

In quei 182:
• 131 immagini lette
• 77 leggono file — e ognuno di quei 77 legge anche le immagini, quindi l'input di file è un rafforzamento dell'input di immagini su questa board, mai una sesta modalità separata
• 49 video letti
• 19 ascolta audio
• 50 prendi il testo e nient'altro
Claude Opus 5.5 è sulla linea di immagini e file, non su quella video. La nostra stessa pagina del modello lo dice in una frase, sotto la voce «Contesto, modalità e pensiero»: input multimodale — testo, immagini e file — con output testuale, una finestra di contesto da 1M di token e fino a 128K token di output. Questa è la superficie di input completa. Non c'è nessuna quinta voce nascosta in un sottomenu.
Cinquanta è un numero più grande di quanto la maggior parte delle persone si aspetti. Più di un quarto dei modelli che dichiarano qualcosa accettano solo testo, il che significa che una pipeline costruita sul presupposto di poter allegare uno screenshot e farlo comprendere si romperà su un quarto di questa board.
Perché "video con codice" non è una modalità video
Le demo che hanno fatto il giro sono reali, e lo è anche l'effetto: Claude Opus 5.5 è insolitamente bravo a scrivere un programma che disegna il movimento — un renderer autonomo che produce frame quando lo esegui. Questa è una capacità autentica e utile. Ciò che non è, è una modalità di output. Il catalogo registra esattamente un output per questo modello, ed è testo. Il video è prodotto a valle, dal codice che il modello ha scritto, sulla tua macchina, con il tuo renderer.
La conseguenza pratica vale in entrambe le direzioni, e la seconda metà è quella che la gente non coglie.
In uscita, il passo di rendering è tuo. Il video basato su codice è ispezionabile, differenziabile con diff, rieseguibile a una risoluzione diversa ed economico nello stesso modo in cui lo è una risposta testuale — qualche dollaro di token anziché un contatore di fatturazione al secondo. Ti assumi anche la responsabilità di ogni errore: un font mancante, un budget di frame sbagliato, un renderer che non concorda con il codice che gli è stato passato.
All'ingresso, non c'è nulla da dargli. Se il tuo materiale di partenza è una registrazione dello schermo, una clip di prodotto, un webinar di due ore o il film di lancio di un concorrente, Claude Opus 5.5 non può guardarlo. Puoi inviare la trascrizione, le slide come fotogrammi fissi o una descrizione scritta da qualcun altro. È questo il vincolo che determina davvero le architetture, ed è invisibile in una demo reel.
Due fazioni: 60 modelli prendono il documento, 29 prendono la clip
Raggruppa i 182 modelli in base al loro esatto insieme di input e la scheda si separa in due gruppi che si sovrappongono appena.
Campo A — documenti e immagini, nessun video: 60 modelli. Prezzo mediano di input $2.00 per milione di token. È qui che si colloca Claude Opus 5.5, insieme a tutti gli undici modelli Anthropic, a tre delle cinque righe Grok e all'estremità di ragionamento del catalogo OpenAI — ogni riga GPT-4.1 e GPT-6, e nelle famiglie GPT-4o e GPT-5 tutto tranne le varianti voice, codex, search e chat-latest. Il campo A detiene anche il tetto della tabella dei prezzi: openai/gpt-5.5-pro e openai/gpt-5.4-pro a $30 per milione di token in input. È il prezzo di input più alto presente in tutta la tabella, ed è un prezzo che condividono con due righe GPT-4 di OpenAI e due endpoint text-to-speech, nessuno dei quali legge un documento. Nemmeno uno degli otto è in grado di guardare un video.
Camp B — testo, immagini e video, nessun file: 29 modelli. Prezzo mediano dell'input 0,25 $ per milione di token. Ventidue dei ventinove hanno il prefisso Qwen; gli altri sono MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B e due build Qwen ottimizzate per Obsidian. Il suo tetto è Qwen3.8-Max a 2,00 $ per milione — vale a dire che il modello più costoso per la lettura di video di questo camp costa esattamente la metà di Claude Opus 5.5.
Il divario mediano tra i due schieramenti è 8×. Il divario nelle appartenenze è ancora più netto. Dei 182 modelli che dichiarano una superficie di input, 60 accettano documenti e non video, 32 accettano video e non documenti, 73 non accettano né gli uni né gli altri, e solo 17 accettano entrambi. La sovrapposizione è così piccola che i due gruppi risultano prodotti quasi disgiunti, e i 17 nel mezzo sono quasi interamente del livello superiore di Google — quindici dei diciassette — più le due build Muse Spark di Meta.

C'è una ragione plausibile per questa forma. La comprensione dei documenti e la comprensione dei video sono problemi ingegneristici diversi, con curve di costo diverse, e i fornitori che hanno risolto per primi il problema dei video sono, per lo più, quelli che vendono token economici a centinaia di milioni. I fornitori che hanno risolto per primi il problema dei documenti sono quelli che vendono il ragionamento a un prezzo premium. Nessuno è ancora stato costretto a fare entrambe le cose allo stesso prezzo, quindi il mercato si è diviso in due prodotti e li ha prezzati di conseguenza.
I diciannove che prendono tutto
Diciannove modelli accettano tutti e quattro i tipi di input — testo, immagine, video e audio. Sedici sono di Google, due di Meta, uno di MiniMax. All'interno di questo gruppo, la gamma di Google va da $0,10 per milione per gemini-2.5-flash-lite fino a $4,00 per gemini-pro-latest, quindi "legge tutto" non è un livello di prezzo; è una decisione che Google ha preso a ogni fascia di prezzo. Il contributo di Meta è la coppia di build Muse Spark — Muse Spark 1.1 e Muse Spark 1.2, identiche nel catalogo a $1,25 per milione in input e $4,25 in output, con un contesto da 1M token.
Questo è lo schieramento che dimostra il punto operativo dell'articolo: una pipeline video-aware non richiede un modello di punta. Richiede di scegliere da un elenco di diciannove, dieci dei quali costano meno di un dollaro per milione di token di input.
Cinque modelli su questa scheda emettono qualcosa di diverso dal testo
Leggere video e produrli sono abilità diverse, e la seconda è più rara. Dei 204 modelli, 139 dichiarano una superficie di output; cinque di questi indicano qualcosa di diverso dal testo.
Tre sono generatori di immagini: Nano Banana (Gemini 2.5 Flash Image) a $0,30 in input e $30,00 in output per milione di token, Nano Banana Pro (Gemini 3 Pro Image Preview) a $0,24 per richiesta, e Nano Banana 2 (Gemini 3.1 Flash Image Preview) a $0,151 per richiesta. Due generano video: MiniMax H3, con tariffazione al secondo di output generato — $0,08 al secondo a 768P e $0,13 a 2K, per clip da quattro a quindici secondi con audio stereo nativo — e OrcaDub 1.0, con tariffazione di $0,60 al minuto di video sorgente, che copre 28 lingue e clona una voce separata per ciascun parlante.
Due interpretazioni da evitare qui. Primo, le restanti 65 righe lasciano vuoto il campo dell'output; vuoto significa che il catalogo non registra una superficie di output, e non è prova che un modello emetta solo testo. Secondo, leggere video e produrre video sono assi distinti con quasi nessuna sovrapposizione in questa tabella — OrcaDub 1.0riceve video e restituisce video, il che lo rende l'unico modello qui che plausibilmente si colloca a entrambe le estremità di una pipeline, mentre MiniMax H3accetta quattro tipi di input per produrre un unico tipo di output che non è testo.
Cosa instradare e dove
Dal censimento emergono quattro regole, e sono economiche da applicare.
• Se il tuo input è una clip, non puntare subito su un modello di punta frontier. Il gruppo che legge i video senza bisogno di documenti conta 29 modelli, ventidue dei quali Qwen, e la sua mediana è un quarto di dollaro per milione. Manda invece al modello di punta i fotogrammi e la trascrizione, e lascia che sia lui a fare il ragionamento.
• Se il tuo input è un PDF, un contratto o un documento lungo, il campo video è quello sbagliato. Solo 17 modelli dichiarano sia l'input di file sia quello video, e ogni modello che dichiara l'input di file dichiara anche l'input di immagini, quindi i due vanno di pari passo. Claude Opus 5.5 a 4,00 $ per milione acquista la superficie per i documenti più una finestra da 1M di token, ed è questo lo scambio che stai facendo.
• Se hai bisogno di output multimediale, stai scegliendo tra cinque modelli, non dalla board. Tre producono immagini fisse e due producono video, e questi due fatturano al secondo e al minuto invece che per token — quindi una stima dei costi basata sui prezzi di input sarà sbagliata per costruzione.
• Se ti serve un output video e la tua fonte è uno script, la generazione di codice resta la via più economica su questa scheda. Claude Opus 5.5 scrive il renderer al prezzo del testo; MiniMax H3 lo renderizza a otto centesimi al secondo. Concatenare i due costa meno di entrambe le alternative e ti lascia un file che puoi modificare.
Domande frequenti
Claude Opus 5.5 può guardare un video?
No. Le sue modalità di input dichiarate sono testo, immagine e file. Il video non è tra queste, e nemmeno l'audio. Una registrazione dello schermo o una clip di prodotto deve essere convertita — fotogrammi campionati, una trascrizione, o entrambi — prima di poter essere inviata.
Claude Opus 5.5 genera video direttamente?
Non come modalità. Restituisce testo, e quel testo è spesso un programma autonomo che genera movimento quando lo esegui. Il rendering è tuo; il modello non emette mai un pixel. Se vuoi un modello su questa board che restituisca video esso stesso, MiniMax H3 e OrcaDub 1.0 sono i due.
"multimodale" è un livello di prezzo?
No, e la tabella mostra perché in entrambe le direzioni. Google offre la multimodalità completa a quattro input da $0,10 a $4 per milione di token di input, mentre il prezzo di input più alto a pari merito nella tabella — openai/gpt-5.5-pro a $30 per milione legge documenti e immagini ma non video. Quello che paghi è il livello di ragionamento, non il numero di modalità.
Perché così pochi modelli leggono documenti se così tanti leggono immagini?
Poiché file e immagini viaggiano insieme in questa classifica: tutti i 77 modelli che leggono i file leggono anche le immagini, quindi l'input di file è un'estensione dell'input di immagini anziché una capacità indipendente. Il numero da ricordare è che 60 dei 182 modelli che dichiarano una superficie di input accettano documenti e immagini e nessun video — un terzo della classifica, e dove si colloca la fascia di punta.
Come dovrei prezzare una pipeline video?
Dall'unità in cui il modello fattura. I lettori video hanno un prezzo per token, come qualsiasi modello di chat. I generatori video di questa board hanno un prezzo al secondo di output (MiniMax H3: $0,08 a 768P, $0,13 a 2K) o al minuto di sorgente (OrcaDub 1.0: $0,60. Mescolare le due unità in un'unica stima è il modo più comune in cui un budget video risulta sbagliato.
La riga da ricordare
La cosa interessante di Claude Opus 5.5 non è che sia multimodale. La maggior parte della line-up lo è. È che la linea delle modalità cade in un punto insolito — documenti e immagini statiche in ingresso, testo in uscita, nessun video in nessuna delle due direzioni — mentre le demo che l'hanno reso famoso sono video. Questi due fatti non sono in conflitto, ed è leggerli come un conflitto che rende confusa la vicenda dei video di codice. Il modello scrive un renderer; il renderer produce il film. Ciò che si può passare al modello è uno script, un documento e uno screenshot.

Tutto quanto sopra è un'istantanea del catalogo OrcaRouter al 2026-09-29 e delle dichiarazioni di modalità in esso contenute. Le specifiche dei fornitori cambiano, e l'elenco delle modalità di una model card è la prima cosa da ricontrollare prima di basarsi su un numero. Se un'affermazione qui è rilevante per una decisione, apri la pagina del modello — i campi sono lì.
