Cartão de título principal para o Claude Opus 5.5 com o texto 'O que um vídeo feito em uma única tentativa realmente produz', com o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Claude Opus 5.5 cria um videoclipe em um único take: o que "Plan a Video" realmente produz

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um sinal publicado no X em 23 de setembro de 2026 diz: "O plano do Claude, um vídeo feito pelo opus 5.5 em uma única tentativa", com uma homenagem a @jeffgwoah anexada. Isso é uma alegação de demonstração, não uma alegação de lançamento — e fica do lado errado daquilo que costuma importar. Claude Opus 5.5 não é um modelo não lançado a ser farejado a partir de um vazamento. A Anthropic o lançou em 22 de setembro de 2026, a US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída. Ele tem um dia de vida, está disponível de forma geral e já consta na tabela de preços. Então a pergunta interessante não é se o Opus 5.5 existe. É o que essas postagens de "fez um vídeo em uma única tentativa" estão de fato mostrando, porque a frase significa algo mais restrito do que parece, e a diferença decide se você pode usar alguma coisa disso.

Aqui está a versão curta, e é a parte que a maioria das repostagens deixa de fora: nas demos que resistem à inspeção, Claude Opus 5.5 não gera pixels. Ele escreve código que pinta pixels. A saída é um programa, não um arquivo de vídeo.

O que as duas demos em circulação realmente fizeram

Dois artefatos públicos estão por trás desse tipo de alegação, e ambos são verificáveis porque ambos publicaram seu código-fonte.

O primeiro é um videoclipe de 156,6 segundos para uma música chamada "I'm Upping My P(doom)", um repositório chamado PDoomVideo publicado no GitHub em 22 de setembro de 2026 — o mesmo dia em que o Opus 5.5 foi lançado. Seu README afirma que o vídeo "levou duas gerações, ambas no Claude Code", a primeira atribuída ao Claude Opus 5.5 (Medium) e a segunda ao Claude Opus 5.5 com esforço padrão. Ele também afirma que "tudo neste repositório foi gerado pelo modelo" e que "nenhuma ideia de cena foi especificada" — a única orientação dada foi usar um design de personagem específico e dar a cada letra visuais e transições interessantes.

O segundo é um repositório de demonstração com três jogos, publicado em 23 de setembro de 2026, que está mais para um experimento controlado do que para uma vitrine: três jogos 3D de navegador jogáveis, um prompt de uma única frase para cada, gerados em uma única sessão com o que o repositório descreve como zero edições humanas no código, e depois implantados. Os jogos são HTML de arquivo único, sem recursos externos — modelos, texturas, animação e som são todos gerados proceduralmente por código. Um dos três exigiu que o modelo pesquisasse o layout oficial de um mapa de jogo e reconstruísse sua geometria com base nessa pesquisa antes de escrever qualquer coisa.

Nenhum dos repositórios é uma publicação de fornecedor. Ambos são artefatos de terceiros, autodeclarados, e a alegação de "zero edições humanas", em particular, é uma alegação sobre um histórico do git, não algo que uma parte externa tenha auditado. Trate a descrição do processo como o relato do autor e os próprios artefatos como as evidências.

O storyboard é o resultado real

O detalhe que decide se "one-shotted" é uma descrição justa é um arquivo no primeiro repositório chamado STORYBOARD.md. Não é uma lista de planos feita por um humano. É um documento que o modelo escreveu para si mesmo após sua primeira passagem de geração, e é genuinamente específico: uma regra de que "algo acontece na tela" em cada plano, uma instrução para manter texto fora dos quadros, um elenco nomeado de personagens com designs fixos, uma paleta que vai do creme quente ao violeta espacial até o vermelho de alarme e volta, uma regra de que as expressões dos personagens se transformam em vez de saltar, e a exigência de que todo corte seja motivado pela ação — uma mordida para o preto, uma queda, um zoom através de um olho.

Esse documento é o plano para o qual o texto do sinal está apontando. O modelo produziu um briefing de direção e, em seguida, executou subagentes em paralelo com base nele, um por capítulo, cada um escrevendo um arquivo JavaScript que pinta seu próprio segmento da linha do tempo.

O pipeline de renderização é comum e vale a pena declarar claramente, porque é onde o enquadramento de "IA fez um vídeo" desmorona: os quadros são pintados em uma página usando p5.js e uma biblioteca de pincéis de aquarela, um script Node controla essa página no Chrome headless e captura a tela de cada quadro, e o ffmpeg une os quadros à faixa de áudio. A 24 quadros por segundo ao longo de 156,6 segundos, isso é aproximadamente 3.760 quadros renderizados um de cada vez.

Portanto, a frase exata não é "Claude Opus 5.5 gerou um vídeo." É "Claude Opus 5.5 escreveu e depois dirigiu um programa que renderiza um vídeo." A distinção não é pedante — é toda a razão pela qual a técnica é útil para qualquer pessoa que não esteja fazendo um videoclipe.

Por que a frase "duas gerações" importa mais do que a frase "tiro único"

O mesmo README enfraquece sua própria manchete. O vídeo exigiu duas gerações, não uma. A primeira passada produziu um resultado que o autor depois levou adiante; o storyboard e o guia de animação — os documentos que tornam a segunda passada coerente — foram escritos depois dessa primeira passada, não antes dela.

Essa é a forma honesta de toda tarefa séria de geração de longo horizonte, e vale dizer isso porque o enquadramento de uma única tentativa cria uma expectativa que os artefatos não atendem. O prompt foi uma única mensagem. O trabalho não foi uma única passagem. O que o modelo fez foi manter uma construção grande, com vários arquivos e de várias horas, coesa o suficiente para que a segunda passagem fosse uma revisão em vez de um recomeço — o que é uma capacidade real e muito menos chamativa do que "um prompt, um vídeo".

Há um número independente que descreve isto melhor do que as demos. A Artificial Analysis mediu o Claude Opus 5.5 no seu Intelligence Index em 58 com esforço máximo — a pontuação mais alta que já registrou, vários pontos à frente dos modelos seguintes — e relatou que o modelo consome cerca de 119.000 tokens de saída por tarefa do Index, contra cerca de 73.000 do Claude Opus 5 e cerca de 78.000 do Claude Fable 5.1. Ele usa cerca de 1,6x os tokens de saída e chega a aproximadamente o mesmo custo por tarefa (~US$ 5,98 contra ~US$ 5,86), apesar de um preço por token 20% menor. A geração de horizonte longo é o que esse perfil de tokens parece visto de fora: o modelo está gastando o orçamento em si mesmo.

A single-column scoreboard for Claude Opus 5.5 with rows reading Shipped: September 22, 2026; Price: $4 / $20 per M tokens; AA Index: 58 at max effort; Output tokens per Index task: 119k; Cost per Index task: $5.98; Native video output: none, over a footer line reading 'AA figures per Artificial Analysis; price per Anthropic.'A four-card pipeline diagram titled 'Claude Opus 5.5 — what the run actually produces', with cards reading Plan: STORYBOARD.md, written by the model; Build: one JavaScript painter per chapter; Render: ~3,760 frames at 24 fps in headless Chrome; Join: ffmpeg adds the audio track, over a footer reading 'Pipeline as described in the PDoomVideo repo README; not independently reproduced.'

Onde os artefatos deixam de ser utilizáveis

Os modos de falha nesse tipo de trabalho são consistentes, e os dois repositórios apontam para o mesmo deles, partindo de direções diferentes.

• A saída é um programa, não um arquivo. Se você precisar de um MP4 que possa entregar a alguém, ainda vai precisar do Node, de um navegador e do ffmpeg. O modelo produziu o renderizador, não a renderização. Essa é uma dependência de compilação que você manterá para sempre.

• A escala vem dos frames, não dos prompts. 3.760 frames exigiram uma passagem noturna automatizada no hardware do próprio autor. Nada em Opus 5.5 altera o custo de pintar o frame 2.000.

• O determinismo é um requisito, não um capricho. Os frames são renderizados em paralelo e fora de ordem, portanto cada frame deve ser uma função pura do seu timestamp — sem estado carregado de um frame para outro, sem aleatoriedade não semeada. Um modelo que não internalizou isso produz um vídeo que pisca. Ambos os repositórios lidam com isso; nada no prompt força isso.

• One-shot não significa não auditado. A evidência mais clara é o trabalho de jogo do segundo repositório: o modelo teve de pesquisar o layout de um mapa existente antes de construí-lo, o que equivale ao modelo decidir que sua primeira resposta teria sido errada.

• Ninguém precificou a falha. Nenhum dos repositórios relata quantas tentativas foram necessárias, quantos tokens consumiu, ou quanto da segunda geração foi gasto corrigindo a primeira. Esse é o número de que uma equipe realmente precisa antes de se comprometer.

O que isto muda para você, e o que não muda

Se você esperava um modelo de geração de vídeo, Claude Opus 5.5 não é um, e nenhuma quantidade de imagens de demonstração o torna um. O material de lançamento da Anthropic não contém capacidade de geração de vídeo; as avaliações publicadas do modelo são codificação agêntica, uso de computador e trabalho de conhecimento. O que as demonstrações mostram é geração de código de longo horizonte com um briefing criativo — a mesma capacidade que aparece na migração de 680.000 linhas e no port de C para Rust citado pela Anthropic em seu próprio post de lançamento, apenas apontada para algo que você pode assistir.

Se é essa a capacidade que você quer, a questão prática deixa de ser "qual modelo" e passa a ser "como eu executo uma coisa dessas sem comprometer um caminho de produção com ela". A geração de longo horizonte é cara e seu modo de falha é silencioso — você obtém um programa plausível que renderiza por quatro minutos e depois quebra. A maneira razoável de testá-la é encaminhar o trabalho por um endpoint que você já tem, em vez de um novo contrato: o Opus 5.5 está no OrcaRouter pelo preço de tabela da Anthropic com 0% de margem, junto com os outros modelos da família, então uma execução de geração noturna pode ficar na mesma chave e nas mesmas regras de failover que tudo o mais que você chama. Se a execução morrer no quadro 3.000, isso é um problema de roteamento e não uma re-arquitetura.

Artificial Analysis article page dated September 22, 2026 headlined 'Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index, along with a 20% price cut and larger cache hit discount', showing the key-takeaways list: an Index score of 58 at max effort, pricing cut to $4/$20 per 1M tokens from $5/$25, cache reads down to $0.20, ~119k output tokens per Index task against ~73k for Opus 5, and four of five effort levels on the Intelligence vs Cost per Task frontier.

Duas coisas merecem atenção antes de você planejar em torno disso. A Anthropic afirmou que Sonnet 5.5 e Haiku 5.5 chegam "nas próximas semanas", o que mudará os cálculos de uma renderização longa — um modelo mais barato capaz de manter coesa uma build com vários arquivos tornaria a execução noturna rotineira, e não digna de nota. E o próprio padrão de storyboard é portátil: nada naquele documento é específico do Opus 5.5, e nada impede que um modelo menor escreva um pior.

Por ora, a leitura honesta de "O plano do Claude: um vídeo do opus 5.5 feito em uma única tentativa" é mais limitada do que soa e mais útil do que parece. O modelo escreveu uma lista de tomadas, orientou seus próprios subagentes e depois escreveu o renderizador — e o fato de um plano como esse ter sobrevivido ao contato com 3.760 quadros é a afirmação que vale a pena testar, não o vídeo.