
Claude Opus 5.5 graba un video musical en un solo intento: qué produce realmente "Plan a Video"
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 496 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Una señal publicada en X el 23 de septiembre de 2026 dice: "El plan de Claude: un video hecho por opus 5.5 en un solo intento", con un homenaje a @jeffgwoah adjunto. Eso es una afirmación sobre una demo, no sobre un lanzamiento — y cae del lado equivocado de lo que suele importar. Claude Opus 5.5 no es un modelo sin lanzar que haya que descubrir a partir de una filtración. Anthropic lo lanzó el 22 de septiembre de 2026, a $4 por millón de tokens de entrada y $20 por millón de salida. Tiene un día desde su lanzamiento, está disponible de forma general y ya figura en la lista de precios. Así que la pregunta interesante no es si Opus 5.5 existe. Es qué están mostrando en realidad estas publicaciones de "one-shotted a video", porque la frase significa algo más limitado de lo que suena, y la diferencia decide si puedes usar algo de ello.
Esta es la versión corta, y es la parte que la mayoría de las republicaciones omiten: en las demos que resisten una inspección, Claude Opus 5.5 no genera píxeles. Escribe código que pinta píxeles. La salida es un programa, no un archivo de video.
Lo que realmente hicieron los dos demos en circulación
Dos artefactos públicos subyacen a este tipo de afirmación, y ambos son verificables porque ambos publicaron su código fuente.
El primero es un video musical de 156,6 segundos para una canción llamada "I'm Upping My P(doom)", un repositorio llamado PDoomVideo publicado en GitHub el 22 de septiembre de 2026 — el mismo día en que se lanzó Opus 5.5. Su README afirma que el video "se hizo en dos generaciones, ambas en Claude Code", la primera atribuida a Claude Opus 5.5 (Medium) y la segunda a Claude Opus 5.5 con el esfuerzo predeterminado. También afirma que "todo en este repositorio fue generado por el modelo" y que "no se especificó ninguna idea de escena" — la única indicación que se dio fue usar un diseño de personaje en particular y dar a cada letra visuales y transiciones interesantes.
El segundo es un repositorio de demostración de tres juegos publicado el 23 de septiembre de 2026, que está más cerca de un experimento controlado que de una vitrina: tres juegos de navegador 3D jugables, con un prompt de una sola frase cada uno, generados en una sola sesión con lo que el repositorio describe como cero ediciones humanas al código, y luego desplegados. Los juegos son HTML de un solo archivo sin recursos externos: los modelos, las texturas, la animación y el sonido se generan todos de forma procedimental mediante código. Uno de los tres requirió que el modelo buscara el diseño oficial de un mapa de juego y reconstruyera su geometría a partir de esa investigación antes de escribir nada.
Ninguno de los dos repositorios es una publicación de un proveedor. Ambos son artefactos de terceros, autodeclarados, y la afirmación de "cero ediciones humanas" en particular es una afirmación sobre un historial de git, no algo que un tercero haya auditado. Trata la descripción del proceso como el relato del autor y los propios artefactos como la evidencia.
El storyboard es el resultado real.
El detalle que decide si "one-shotted" es una descripción justa es un archivo en el primer repositorio llamado STORYBOARD.md. No es una lista de tomas de un humano. Es un documento que el modelo escribió para sí mismo después de su primera pasada de generación, y es genuinamente específico: una regla de que "algo sucede en pantalla" en cada toma, una instrucción de mantener el texto fuera de los cuadros, un elenco de personajes con nombres y diseños fijos, una paleta que va del crema cálido al violeta espacial, al rojo de alarma y de vuelta, una regla de que las expresiones de los personajes se transformen en lugar de cambiar bruscamente, y un requisito de que cada corte esté motivado por la acción — un mordisco a negro, una caída, un zoom a través de un ojo.
Ese documento es el plan al que apunta el texto de la señal. El modelo produjo un brief de dirección y luego ejecutó subagentes contra él en paralelo, uno por capítulo, y cada uno escribió un archivo JavaScript que pinta su propio segmento de la línea de tiempo.
El pipeline de renderizado es ordinario y merece la pena decirlo sin rodeos, porque es donde se viene abajo el planteamiento de «la IA hizo un vídeo»: los fotogramas se pintan en una página usando p5.js y una biblioteca de pinceles de acuarela, un script de Node controla esa página en Chrome sin interfaz y captura cada fotograma, y ffmpeg une los fotogramas con la pista de audio. A 24 fotogramas por segundo a lo largo de 156,6 segundos, eso son aproximadamente 3.760 fotogramas renderizados uno a uno.
Así que la frase precisa no es «Claude Opus 5.5 generó un video». Es «Claude Opus 5.5 escribió, y luego dirigió, un programa que renderiza un video». La distinción no es pedante — es la razón misma por la que la técnica es útil para cualquiera que no esté haciendo un video musical.
Por qué la frase «dos generaciones» importa más que la frase «de un solo intento»
El mismo README socava su propio titular. El vídeo requirió dos generaciones, no una. La primera pasada produjo un resultado que el autor después llevó más lejos; el guion gráfico y la guía de animación —los documentos que hacen coherente la segunda pasada— se escribieron después de esa primera pasada, no antes.
Esa es la forma honesta de toda tarea seria de generación de horizonte largo, y vale la pena decirlo porque el enfoque de un solo intento crea una expectativa que los artefactos no cumplen. El prompt fue un solo mensaje. El trabajo no fue una sola pasada. Lo que hizo el modelo fue mantener una construcción grande, de varios archivos y de varias horas lo suficientemente cohesionada como para que la segunda pasada fuera una revisión en lugar de un reinicio — lo cual es una capacidad real y mucho menos llamativa que "un prompt, un video".
Hay un número independiente que describe esto mejor que las demos. Artificial Analysis midió Claude Opus 5.5 en su Intelligence Index con 58 en esfuerzo máximo —la puntuación más alta que ha registrado, varios puntos por delante de los siguientes modelos— y reportó que el modelo consume aproximadamente 119.000 tokens de salida por tarea del Index, frente a unos 73.000 de Claude Opus 5 y unos 78.000 de Claude Fable 5.1. Usa alrededor de 1,6 veces los tokens de salida y llega a un costo por tarea más o menos igual (~$5,98 frente a ~$5,86) a pesar de un precio por token 20 % menor. La generación de horizonte largo es lo que ese perfil de tokens parece desde fuera: el modelo está gastando el presupuesto en sí mismo.


Donde los artefactos dejan de ser utilizables
Los modos de fallo en este tipo de trabajo son consistentes, y ambos repos apuntan al mismo desde direcciones distintas.
• El resultado es un programa, no un archivo. Si necesitas un MP4 que puedas entregarle a alguien, sigues necesitando Node, un navegador y ffmpeg. El modelo produjo el renderizador, no el renderizado. Esa es una dependencia de compilación que asumes para siempre.
• Escala con los fotogramas, no con los prompts. 3.760 fotogramas requirieron una pasada programada durante la noche en el hardware del propio autor. Nada en Opus 5.5 cambia el costo de pintar el fotograma 2.000.
• El determinismo es un requisito, no un lujo. Los fotogramas se renderizan en paralelo y fuera de orden, así que cada fotograma debe ser una función pura de su marca de tiempo —sin estado arrastrado, sin aleatoriedad sin semilla. Un modelo que no ha interiorizado eso produce un video que parpadea. Ambos repositorios se encargan de ello; nada en el prompt lo fuerza.
• Hacerlo de una sola vez no significa que no se audite. La evidencia más clara es el trabajo en el juego del segundo repositorio: el modelo tuvo que investigar la disposición de un mapa existente antes de construirlo, lo cual equivale a que el modelo decidiera que su primera respuesta habría sido errónea.
• Nadie le ha puesto precio al fracaso. Ninguno de los dos repositorios informa cuántos intentos hizo falta, cuántos tokens se quemaron ni qué parte de la segunda generación consistió en arreglar la primera. Ese es el número que un equipo realmente necesita antes de comprometerse.
Lo que esto cambia para ti y lo que no
Si esperabas un modelo de generación de video, Claude Opus 5.5 no lo es, y ninguna cantidad de material de demostración lo convierte en uno. El material de lanzamiento de Anthropic no contiene ninguna capacidad de generación de video; las evaluaciones publicadas del modelo son codificación agéntica, uso de computadora y trabajo de conocimiento. Lo que las demostraciones demuestran es generación de código de horizonte largo con un brief creativo — la misma facultad que aparece en la migración de 680,000 líneas y el port de C a Rust que Anthropic cita en su propia publicación de lanzamiento, solo que apuntada a algo que puedes ver.
Si esa es la capacidad que quieres, la pregunta práctica deja de ser «qué modelo» y pasa a ser «cómo ejecuto algo así sin comprometer con ello una ruta de producción». La generación de largo horizonte es cara y su modo de fallo es silencioso: obtienes un programa plausible que se renderiza durante cuatro minutos y luego falla. La forma razonable de probarlo es enrutar el trabajo a través de un endpoint que ya tienes en lugar de un contrato nuevo: Opus 5.5 está en OrcaRouter al precio de lista de Anthropic con un 0 % de recargo, junto a los otros modelos de la familia, así que una ejecución de generación nocturna puede usar la misma clave y las mismas reglas de failover que todo lo demás que llamas. Si la ejecución muere en el fotograma 3000, eso es un problema de enrutamiento y no una rearquitectura.

Hay dos cosas que vale la pena seguir de cerca antes de planificar en torno a esto. Anthropic ha dicho que Sonnet 5.5 y Haiku 5.5 llegan "en las próximas semanas", lo que cambiará la aritmética de un renderizado largo: un modelo más barato capaz de mantener unida una compilación de varios archivos haría que la pasada nocturna fuera rutinaria en lugar de digna de mención. Y el patrón de guion gráfico en sí es portátil: nada en ese documento es específico de Opus 5.5, y nada impide que un modelo más pequeño escriba uno peor.
Por ahora, la lectura honesta de «El plan de Claude: un video de opus 5.5 hecho en un solo intento» es más limitada de lo que suena y más útil de lo que parece. El modelo escribió una lista de planos, briefó a sus propios subagentes y luego escribió el renderizador; y el hecho de que un plan así sobreviviera al contacto con 3.760 frames es la afirmación que vale la pena poner a prueba, no el video.
