Cartão hero multimodal do Claude Opus 5.5: o nome do modelo sobre um cartão de título gerado.
Guides & Insights

Claude Opus 5.5 Multimodal: ele renderiza vídeo a partir de código, mas não consegue assistir a um

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Peça a Claude Opus 5.5 um vídeo e você pode acabar com um — um programa de HTML, CSS ou chamadas de canvas que pinta cada quadro, e que você depois executa. Entregue um vídeo a ele e pergunte o que acontece nele e você não recebe absolutamente nada, porque não há entrada de vídeo. Essa assimetria é toda a superfície de modalidades deste modelo, e é idêntica em todos os onze modelos da Anthropic em nosso painel, então vale dizer de forma direta: Claude Opus 5.5 lê texto, imagens e arquivos, escreve texto, e para por aí. O painel ao seu redor é muito menos uniforme. MiniMax H3 gera vídeo de forma direta, OrcaDub 1.0 recebe um vídeo e devolve um dublado, e Qwen3.8-Max assistirá a um clipe por dois dólares por milhão de tokens de entrada — metade do que Claude Opus 5.5 cobra pelo mesmo milhão, e com uma capacidade que ele não tem.

Esta é uma leitura da linha de modalidade conforme registrada pela OrcaRouter em 2026-09-29, abrangendo todos os 204 modelos do catálogo. Os números abaixo são declarações do catálogo, não nossos benchmarks — um campo de modalidade é o que a ficha do modelo diz, e as fichas dos modelos mudam.

O que o catálogo realmente registra

Dos 204 modelos, 182 declaram uma superfície de entrada. Os outros 22 deixam-na em branco, o que é uma afirmação sobre o registo e não sobre o modelo — entre eles, oito modelos de vídeo Kling, quatro meta-modelos OrcaRouter e alguns endpoints de nível gratuito e de pré-visualização dispersos.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

Ao longo desses 182:

• 131 imagens lidas

• 77 leem arquivos — e cada um desses 77 também lê imagens, então a entrada de arquivo é um reforço da entrada de imagem neste quadro, nunca uma sexta modalidade separada

• 49 vídeos lidos

• 19 ouvir áudio

• 50 pegue o texto e nada mais

Claude Opus 5.5 está na linha de imagem e arquivo, e não na linha de vídeo. Nossa própria página do modelo diz isso em uma frase, sob o título "Contexto, modalidades e pensamento": entrada multimodal — texto, imagens e arquivos — com saída de texto, uma janela de contexto de 1M de tokens e até 128K tokens de saída. Essa é a superfície de entrada completa. Não há uma quinta entrada escondida em um submenu.

Cinquenta é um número maior do que a maioria das pessoas espera. Mais de um quarto dos modelos que declaram qualquer coisa aceitam apenas texto, o que significa que um pipeline construído com a suposição de que pode anexar uma captura de tela e tê-la compreendida vai quebrar em um quarto deste quadro.

Por que "video with" não é uma modalidade de vídeo

As demonstrações que circularam por aí são reais, e o efeito também: Claude Opus 5.5 é excepcionalmente bom em escrever um programa que desenha movimento — um renderizador autocontido que produz quadros quando você o executa. Essa é uma capacidade genuína e útil. O que ele não é: uma modalidade de saída. O catálogo registra exatamente uma saída para esse modelo, e ela é texto. O vídeo é fabricado a jusante, pelo código que o modelo escreveu, na sua máquina, com o seu renderizador.

A consequência prática funciona nos dois sentidos, e a segunda metade é a metade que as pessoas deixam passar.

Na saída, a etapa de renderização é sua. Vídeo baseado em código é inspecionável, diffável, pode ser executado novamente em uma resolução diferente e é barato como uma resposta de texto — alguns dólares em tokens em vez de um medidor de cobrança por segundo. Você também é responsável por todas as falhas: uma fonte ausente, um orçamento de frames ruim, um renderizador que discorda do código que recebeu.

Na entrada, não há nada para lhe entregar. Se o seu material de origem for uma gravação de tela, um clipe de produto, um webinar de duas horas ou o filme de lançamento de um concorrente, Claude Opus 5.5 não consegue olhar para isso. Você pode enviar a transcrição, os slides como quadros estáticos ou uma descrição escrita por outra pessoa. Essa é a restrição que de fato decide as arquiteturas, e ela é invisível em um vídeo de demonstração.

Dois grupos: 60 modelos recebem o documento, 29 recebem o clipe

Agrupe os 182 modelos pelo seu conjunto exato de entradas e o quadro se separa em dois grupos que quase não se sobrepõem.

Grupo A — documentos e imagens, sem vídeo: 60 modelos. Preço mediano de entrada US$ 2,00 por milhão de tokens. É aqui que Claude Opus 5.5 se encontra, ao lado de todos os onze modelos da Anthropic, de três das cinco linhas do Grok e da parte de raciocínio do catálogo da OpenAI — todas as linhas do GPT-4.1 e do GPT-6 e, nas famílias GPT-4o e GPT-5, tudo exceto as variantes de voz, codex, busca e chat-latest. O Grupo A também detém o teto da tabela de preços: openai/gpt-5.5-pro e openai/gpt-5.4-pro a US$ 30 por milhão de tokens de entrada. Esse é o preço de entrada mais alto em todo o quadro, e é um preço que eles compartilham com duas linhas do GPT-4 da OpenAI e dois endpoints de conversão de texto em fala, nenhum dos quais lê um documento. Nenhum dos oito consegue assistir a um vídeo.

Campo B — texto, imagens e vídeo, sem arquivos: 29 modelos. Preço de entrada mediano $0,25 por milhão de tokens. Vinte e dois dos vinte e nove carregam o prefixo Qwen; o restante é MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B e duas builds do Qwen ajustadas para o Obsidian. Seu teto é o Qwen3.8-Max a $2,00 por milhão — ou seja, o modelo de leitura de vídeo mais caro deste campo custa exatamente metade do Claude Opus 5.5.

A diferença mediana entre os campos é 8×. A diferença de adesão é ainda mais acentuada. Dos 182 modelos que declaram uma superfície de entrada, 60 aceitam documentos e não vídeo, 32 aceitam vídeo e não documentos, 73 não aceitam nenhum dos dois, e apenas 17 aceitam ambos. A sobreposição é pequena o suficiente para que os dois grupos se leiam como produtos quase disjuntos, e os 17 do meio são quase inteiramente o nível superior do Google — quinze dos dezessete — mais os dois builds Muse Spark da Meta.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Há uma razão plausível para a forma. Compreensão de documentos e compreensão de vídeo são problemas de engenharia diferentes com curvas de custo diferentes, e os fornecedores que resolveram o vídeo primeiro são, em sua maioria, os que vendem tokens baratos às centenas de milhões. Os fornecedores que resolveram documentos primeiro são os que vendem raciocínio com um prêmio. Ninguém foi ainda forçado a fazer ambos pelo mesmo preço, então o mercado se dividiu em dois produtos e os precificou de acordo.

Os dezenove que tomam tudo

Dezenove modelos aceitam todos os quatro tipos de entrada — texto, imagem, vídeo e áudio. Dezesseis são do Google, dois são da Meta, um é da MiniMax. A própria faixa do Google dentro desse grupo vai de $0,10 por milhão para o gemini-2.5-flash-lite até $4,00 para o gemini-pro-latest, então "lê tudo" não é uma faixa de preço; é uma decisão que o Google tomou em todos os níveis de preço. A contribuição da Meta é o par de versões do Muse Spark — Muse Spark 1.1 e Muse Spark 1.2, idênticas no catálogo a $1,25 por milhão na entrada e $4,25 na saída, com um contexto de 1M de tokens.

Este é o campo que evidencia o ponto operacional do artigo: um pipeline com capacidade para vídeo não exige um modelo de ponta. Exige escolher de uma lista de dezenove, dez dos quais custam menos de um dólar por milhão de tokens de entrada.

Cinco modelos neste quadro emitem algo que não é texto.

Ler vídeo e produzi-lo são truques diferentes, e o segundo é mais raro. Dos 204 modelos, 139 declaram uma superfície de saída; cinco deles nomeiam algo além de texto.

Três são geradores de imagens: Nano Banana (Gemini 2.5 Flash Image) a $0.30 de entrada e $30.00 de saída por milhão de tokens, Nano Banana Pro (Gemini 3 Pro Image Preview) a $0.24 por solicitação, e Nano Banana 2 (Gemini 3.1 Flash Image Preview) a $0.151 por solicitação. Dois geram vídeo: MiniMax H3, cobrado por segundo de saída gerada — $0.08 por segundo em 768P e $0.13 em 2K, para clipes de quatro a quinze segundos com áudio estéreo nativo — e OrcaDub 1.0, cobrado a $0.60 por minuto de vídeo de origem, abrangendo 28 idiomas e clonando uma voz separada por falante.

Dois enquadramentos a evitar aqui. Primeiro, as 65 linhas restantes deixam o campo de saída em branco; em branco significa que o catálogo não regista uma superfície de saída, e isso não é evidência de que um modelo emita apenas texto. Segundo, ler vídeo e fazer vídeo são eixos separados com quase nenhuma sobreposição neste quadro — OrcaDub 1.0 recebe vídeo na entrada e devolve vídeo na saída, o que o torna o único modelo aqui que, plausivelmente, fica nas duas extremidades de um pipeline, enquanto MiniMax H3 recebe quatro tipos de entrada para produzir um único tipo de saída que não é texto.

O que encaminhar para onde

Quatro regras decorrem do censo, e são baratas de aplicar.

• Se a sua entrada for um clipe, não recorra primeiro a um modelo de fronteira de ponta. O grupo que lê vídeo sem precisar de documentos é formado por 29 modelos, vinte e dois deles Qwen, e sua mediana é um quarto por milhão. Em vez disso, envie ao modelo de ponta os quadros e a transcrição, e deixe que ele faça o raciocínio.

• Se a sua entrada for um PDF, um contrato ou um documento longo, o grupo de vídeo é o grupo errado. Apenas 17 modelos declaram entrada de arquivo e de vídeo, e todo modelo que declara entrada de arquivo também declara entrada de imagem, então os dois andam juntos. Claude Opus 5.5 a US$ 4,00 por milhão compra a superfície de documentos mais uma janela de 1M de tokens, que é a troca que você está fazendo.

• Se você precisa de saída de mídia, você está escolhendo entre cinco modelos, e não a partir do ranking. Três geram imagens estáticas e dois geram vídeo, e esses dois cobram por segundo e por minuto, em vez de por token — então uma estimativa de custo baseada nos preços de entrada estará errada por construção.

• Se você precisa de vídeo na saída e sua fonte é um roteiro, a geração de código continua sendo o caminho mais barato neste quadro. Claude Opus 5.5 escreve o renderizador pelo preço de texto; MiniMax H3 o renderiza por oito centavos por segundo. Encadear os dois custa menos do que qualquer uma das alternativas e deixa você com um arquivo que pode editar.

Perguntas Frequentes

O Claude Opus 5.5 consegue assistir a um vídeo?

Não. As suas modalidades de entrada declaradas são texto, imagem e ficheiro. Vídeo não está entre elas, nem áudio. Uma gravação de ecrã ou um clipe de produto tem de ser convertido — fotogramas amostrados, uma transcrição, ou ambos — antes de poder ser enviado.

O Claude Opus 5.5 gera vídeo diretamente?

Não como uma modalidade. Ele retorna texto, e esse texto é frequentemente um programa autocontido que renderiza movimento quando você o executa. A renderização é sua; o modelo nunca emite um pixel. Se você quer um modelo nesta placa que retorne o próprio vídeo, MiniMax H3 e OrcaDub 1.0 são os dois.

"multimodal" é um nível de preço?

Não, e o quadro mostra por quê em ambas as direções. O Google oferece multimodalidade completa com quatro tipos de entrada, de US$ 0,10 por milhão de tokens de entrada a US$ 4,00, enquanto o preço de entrada mais alto, empatado, no quadro — openai/gpt-5.5-pro a US$ 30 por milhão — lê documentos e imagens, mas não vídeo. O que você paga é o nível de raciocínio, não a contagem de modalidades.

Por que tão poucos modelos leem documentos se tantos leem imagens?

Como arquivos e imagens andam juntos neste painel: todos os 77 modelos que leem arquivos também leem imagens, então a entrada de arquivos é uma extensão da entrada de imagens, e não uma capacidade independente. O número a lembrar é que 60 dos 182 modelos que declaram uma superfície de entrada aceitam documentos e imagens e nenhum vídeo — um terço do painel, e onde está o nível de ponta.

Como devo precificar um pipeline de vídeo?

Pela unidade em que o modelo cobra. Leitores de vídeo têm preço por token, como qualquer modelo de chat. Geradores de vídeo neste quadro têm preço por segundo de saída (MiniMax H3: $0,08 em 768P, $0,13 em 2K) ou por minuto de origem (OrcaDub 1.0: $0,60). Misturar as duas unidades em uma única estimativa é a forma mais comum de um orçamento de vídeo sair errado.

A linha para lembrar

O interessante a respeito de Claude Opus 5.5 não é que ele seja multimodal. A maior parte do setor já é. É que a fronteira das modalidades fica num lugar incomum — documentos e imagens estáticas entram, texto sai, e não há vídeo em nenhuma direção — enquanto as demonstrações que o tornaram famoso são vídeos. Esses dois fatos não estão em conflito, e lê-los como um conflito é o que torna confusa a história do código-vídeo. O modelo escreve um renderizador; o renderizador faz o filme. O que se pode entregar ao modelo é um roteiro, um documento e uma captura de tela.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Tudo acima é um instantâneo do catálogo OrcaRouter em 2026-09-29 e das declarações de modalidade nele. As especificações dos fornecedores mudam, e a lista de modalidades de uma ficha de modelo é a primeira coisa a verificar de novo antes de você se basear em um número. Se uma afirmação aqui importa para uma decisão, abra a página do modelo — os campos estão nela.