Tarjeta principal multimodal de Claude Opus 5.5: el nombre del modelo sobre una tarjeta de título generada.
Guides & Insights

Claude Opus 5.5 Multimodal: renderiza vídeo a partir de código, pero no puede ver uno

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Pide Claude Opus 5.5 que te haga un vídeo y puedes acabar con uno: un programa de HTML, CSS o llamadas a canvas que pinta cada fotograma y que luego ejecutas. Dale un vídeo y pregúntale qué ocurre en él y no obtienes absolutamente nada, porque no hay entrada de vídeo. Esa asimetría es toda la superficie de modalidades de este modelo, y es idéntica en los once modelos de Anthropic de nuestra tabla, así que merece la pena decirlo sin rodeos: Claude Opus 5.5lee texto, imágenes y archivos, escribe texto y ahí se acaba. La tabla que lo rodea es mucho menos uniforme. MiniMax H3genera vídeo directamente, OrcaDub 1.0recibe un vídeo y devuelve uno doblado, y Qwen3.8-Maxverá un clip por dos dólares por millón de tokens de entrada, la mitad de lo que Claude Opus 5.5cobra por ese mismo millón, y con una capacidad que este no tiene.

Esta es una lectura de la línea de modalidad tal como OrcaRouter la registra el 2026-09-29, abarcando los 204 modelos del catálogo. Las cifras que aparecen a continuación son declaraciones del catálogo, no nuestros benchmarks — un campo de modalidad es lo que dice la ficha del modelo, y las fichas de los modelos cambian.

Lo que el catálogo registra en realidad

De los 204 modelos, 182 declaran una superficie de entrada. Los otros 22 la dejan en blanco, lo cual es una afirmación sobre el registro más que sobre el modelo: ocho modelos de video Kling, cuatro metamodelos de OrcaRouter y un puñado de endpoints de nivel gratuito y de vista previa entre ellos.

A horizontal bar chart of declared input modalities across the OrcaRouter catalogue: 131 models read images, 77 read files, 49 read video, 19 read audio, and 50 take text only.

En esos 182:

• 131 imágenes

• 77 leen archivos — y cada uno de esos 77 también lee imágenes, así que la entrada de archivos es un refuerzo de la entrada de imágenes en esta placa, nunca una sexta modalidad aparte

• 49 video leído

• 19 escuchar audio

• 50 toma texto y nada más

Claude Opus 5.5 está en la línea de imagen y archivos, y no en la de vídeo. Nuestra propia página del modelo lo dice en una sola frase, bajo el encabezado «Contexto, modalidades y razonamiento»: entrada multimodal —texto, imágenes y archivos— con salida de texto, una ventana de contexto de 1M de tokens y hasta 128K tokens de salida. Esa es la superficie de entrada completa. No hay una quinta entrada escondida en un submenú.

Cincuenta es un número más grande de lo que la mayoría de la gente espera. Más de una cuarta parte de los modelos que declaran algo en absoluto aceptan solo texto, lo que significa que un pipeline construido sobre la suposición de que puede adjuntar una captura de pantalla y que esta se entienda fallará con una cuarta parte de este tablero.

Por qué "video con código" no es una modalidad de video

Las demos que se viralizaron son reales, y el efecto también lo es: Claude Opus 5.5 es inusualmente bueno escribiendo un programa que dibuja movimiento — un renderizador autocontenido que produce fotogramas cuando lo ejecutas. Eso es una capacidad genuina y útil. Lo que no es es una modalidad de salida. El catálogo registra exactamente una salida para este modelo, y es texto. El video se fabrica aguas abajo, mediante el código que escribió el modelo, en tu máquina, con tu renderizador.

La consecuencia práctica actúa en ambos sentidos, y la segunda mitad es la mitad que la gente pasa por alto.

A la salida, el paso de renderizado es tuyo. El video basado en código es inspeccionable, se le puede aplicar diff, se puede volver a ejecutar a otra resolución y es barato del mismo modo en que una respuesta de texto es barata: unos pocos dólares en tokens en lugar de un medidor de facturación por segundo. También te haces cargo de cada fallo: una fuente que falta, un presupuesto de fotogramas mal calculado, un renderizador que no concuerda con el código que se le entregó.

De entrada, no hay nada que darle. Si tu material de origen es una grabación de pantalla, un clip de producto, un seminario web de dos horas o el video de lanzamiento de un competidor, Claude Opus 5.5 no puede verlo. Puedes enviarle la transcripción, las diapositivas como imágenes fijas o una descripción escrita por otra persona. Esa es la restricción que realmente determina las arquitecturas, y es invisible en un video de demostración.

Dos bandos: 60 modelos toman el documento, 29 toman el clip

Agrupa los 182 modelos por su conjunto de entrada exacto y el tablero se separa en dos grupos que apenas se superponen.

Campamento A — documentos e imágenes, sin vídeo: 60 modelos. Precio de entrada medio $2.00 por millón de tokens. Aquí es dondeClaude Opus 5.5 se sitúa, junto a los once modelos de Anthropic, tres de las cinco filas de Grok y el extremo de razonamiento del catálogo de OpenAI — todas las filas de GPT-4.1 y GPT-6 y, en las familias GPT-4o y GPT-5, todo excepto las variantes voice, codex, search y chat-latest. El campamento A también ostenta el techo de la tabla de precios: openai/gpt-5.5-pro y openai/gpt-5.4-pro a $30 por millón de tokens de entrada. Es el precio de entrada más alto de todo el tablero, y es un precio que comparten con dos filas de GPT-4 de OpenAI y dos endpoints de texto a voz, ninguno de los cuales lee un documento. Ni uno solo de los ocho puede ver un vídeo.

Campamento B — texto, imágenes y video, sin archivos: 29 modelos. Precio de entrada medio: $0.25 por millón de tokens. Veintidós de los veintinueve llevan el prefijo Qwen; el resto son MiniMax M3, GLM-5.3-Flash, Kimi K2.6, Kimi K2.7-Code, Gemma 4 26B y dos builds de Qwen ajustados para Obsidian. Su techo es Qwen3.8-Max a $2.00 por millón — es decir, el modelo de lectura de video más caro de este campamento cuesta exactamente la mitad de Claude Opus 5.5.

La brecha mediana entre los bandos es de 8×. La brecha de membresía es aún más marcada. De los 182 modelos que declaran una superficie de entrada, 60 aceptan documentos y no video, 32 aceptan video y no documentos, 73 no aceptan ninguno, y solo 17 aceptan ambos. La superposición es lo bastante pequeña como para que los dos grupos se lean como productos casi disjuntos, y los 17 del medio son casi en su totalidad el nivel superior de Google —quince de los diecisiete— más los dos desarrollos de Muse Spark de Meta.

A comparison scoreboard contrasting the two catalogue camps: 60 document-and-image models at a median $2.00 per million input tokens against 29 video-and-image models at a median $0.25 per million.

Hay una razón plausible para esa forma. La comprensión de documentos y la comprensión de vídeo son problemas de ingeniería distintos, con curvas de costes distintas, y los proveedores que resolvieron primero el vídeo son, en su mayoría, los que venden tokens baratos por centenares de millones. Los proveedores que resolvieron primero los documentos son los que venden razonamiento a precio de prima. Nadie se ha visto aún obligado a hacer ambas cosas al mismo precio, así que el mercado se ha escindido en dos productos y los ha tarificado en consecuencia.

Los diecinueve que se lo llevan todo

Diecinueve modelos aceptan los cuatro tipos de entrada — texto, imagen, video y audio. Dieciséis son de Google, dos son de Meta, uno es de MiniMax. La propia gama de Google dentro de ese grupo va desde $0.10 por millón para gemini-2.5-flash-lite hasta $4.00 para gemini-pro-latest, así que "lo lee todo" no es un nivel de precio; es una decisión que Google tomó en cada punto de precio. La contribución de Meta es el par de versiones de Muse Spark — Muse Spark 1.1 y Muse Spark 1.2, idénticos en el catálogo a $1.25 por millón de entrada y $4.25 de salida, con un contexto de 1M tokens.

Este es el bando que demuestra el punto operativo del artículo: una pipeline consciente de video no requiere un modelo insignia. Requiere elegir de una lista de diecinueve, diez de los cuales cuestan menos de un dólar por millón de tokens de entrada.

Cinco modelos en este tablero emiten algo que no es texto.

Leer video y hacerlo son trucos diferentes, y el segundo es más raro. De los 204 modelos, 139 declaran una superficie de salida; cinco de ellos nombran algo distinto de texto.

Tres son generadores de imágenes: Nano Banana (Gemini 2.5 Flash Image) a $0.30 de entrada y $30.00 de salida por millón de tokens, Nano Banana Pro (Gemini 3 Pro Image Preview) a $0.24 por solicitud, y Nano Banana 2 (Gemini 3.1 Flash Image Preview) a $0.151 por solicitud. Dos generan vídeo: MiniMax H3, facturado por segundo de salida generada — $0.08 por segundo a 768P y $0.13 a 2K, para clips de cuatro a quince segundos con audio estéreo nativo — y OrcaDub 1.0, facturado a $0.60 por minuto de vídeo de origen, que cubre 28 idiomas y clona una voz distinta por hablante.

Hay dos enfoques que conviene evitar aquí. Primero, las 65 filas restantes dejan en blanco el campo de salida; en blanco significa que el catálogo no registra una superficie de salida, y no es prueba de que un modelo emita únicamente texto. Segundo, leer video y crear video son ejes distintos con casi ninguna superposición en este tablero — OrcaDub 1.0 recibe video y devuelve video, lo que lo convierte en el único modelo de aquí que plausiblemente se sitúa en ambos extremos de un pipeline, mientras que MiniMax H3 toma cuatro tipos de entrada para producir un único tipo de salida que no es texto.

Qué enrutar y adónde

Del censo se desprenden cuatro reglas, y son baratas de aplicar.

• Si tu entrada es un clip, no recurras primero a un modelo insignia de frontera. El grupo que lee video sin necesitar documentos está formado por 29 modelos, veintidós de ellos son Qwen, y su mediana es de un cuarto por millón. En su lugar, envíale al modelo insignia los fotogramas y la transcripción, y deja que haga el razonamiento.

Si tu entrada es un PDF, un contrato o un documento largo, el bando de vídeo es el bando equivocado. Solo 17 modelos declaran tanto entrada de archivo como de vídeo, y todos los modelos que declaran entrada de archivo también declaran entrada de imagen, por lo que ambas van juntas. Claude Opus 5.5 a $4.00 por millón compra la superficie de documentos más una ventana de 1M de tokens, que es el intercambio que estás haciendo.

• Si necesitas obtener contenido multimedia, estás eligiendo entre cinco modelos, no desde el panel. Tres generan imágenes fijas y dos generan video, y esos dos cobran por segundo y por minuto en lugar de por token, así que una estimación de costos basada en los precios de entrada será incorrecta por construcción.

• Si necesitas salida de vídeo y tu fuente es un guion, la generación de código sigue siendo la ruta más barata en esta placa. Claude Opus 5.5escribe el renderizador por el precio de un texto; MiniMax H3lo renderiza por ocho centavos el segundo. Encadenar ambos cuesta menos que cualquiera de las dos alternativas y te deja un archivo que puedes editar.

Preguntas frecuentes

¿Puede Claude Opus 5.5 ver un vídeo?

No. Sus modalidades de entrada declaradas son texto, imagen y archivo. El video no está entre ellas, y el audio tampoco. Una grabación de pantalla o un clip de producto tiene que convertirse —fotogramas muestreados, una transcripción, o ambos— antes de poder enviarse.

¿Claude Opus 5.5 genera vídeo directamente?

No como una modalidad. Devuelve texto, y ese texto con frecuencia es un programa autocontenido que genera movimiento cuando lo ejecutas. El renderizado es tuyo; el modelo nunca emite un píxel. Si quieres un modelo en esta placa que devuelva vídeo por sí mismo, MiniMax H3 y OrcaDub 1.0 son los dos.

¿"multimodal" es un nivel de precios?

No, y el tablero muestra por qué en ambas direcciones. Google ofrece multimodalidad completa de cuatro entradas desde $0,10 por millón de tokens de entrada hasta $4,00, mientras que el precio de entrada más alto (empatado) del tablero — openai/gpt-5.5-pro a $30 por millón — lee documentos e imágenes, pero no video. Lo que pagas es el nivel de razonamiento, no la cantidad de modalidades.

¿Por qué tan pocos modelos leen documentos si tantos leen imágenes?

Como los archivos y las imágenes van juntos en este panel, los 77 modelos que leen archivos también leen imágenes, así que la entrada de archivos es una extensión de la entrada de imágenes y no una capacidad independiente. La cifra que hay que recordar es que 60 de los 182 modelos que declaran una superficie de entrada aceptan documentos y no vídeo: un tercio del panel, y donde se sitúa la categoría insignia.

¿Cómo debería ponerle precio a un pipeline de video?

Según la unidad en la que factura el modelo. Los lectores de video se cobran por token, como cualquier modelo de chat. Los generadores de video de este panel se cobran por segundo de salida (MiniMax H3: $0.08 a 768P, $0.13 a 2K) o por minuto de fuente (OrcaDub 1.0: $0.60). Mezclar las dos unidades en un solo cálculo es la forma más común de que un presupuesto de video salga mal.

La línea que recordar

Lo interesante de Claude Opus 5.5 no es que sea multimodal. La mayoría de la gama lo es. Es que la línea de modalidad cae en un lugar inusual —documentos e imágenes fijas de entrada, texto de salida, sin vídeo en ninguna dirección—, mientras que las demos que lo hicieron famoso son vídeo. Esos dos hechos no están en conflicto, y leerlos como un conflicto es lo que hace que la historia de código-vídeo sea confusa. El modelo escribe un renderizador; el renderizador hace la película. Lo que se le puede entregar al modelo es un guion, un documento y una captura de pantalla.

The OrcaRouter model page for Claude Opus 5.5, showing the Context, modalities and thinking section with text, image and file input, text output, a 1M-token context window and up to 128K output tokens.

Todo lo anterior es una instantánea del catálogo de OrcaRouter del 29 de septiembre de 2026 y de las declaraciones de modalidad que contiene. Las especificaciones de los proveedores cambian, y la lista de modalidades de una ficha de modelo es lo primero que hay que volver a comprobar antes de basar una decisión en una cifra. Si alguna afirmación de aquí es relevante para una decisión, abre la página del modelo: los campos están en ella.