Una tarjeta de título principal generada que dice UN BRIEF, DOS MODELOS, UN VIDEO NARRADO, dividida en dos columnas. La columna izquierda, encabezada por Claude Opus 5.5, dice: escribe el guion; lanzado el 22 de septiembre de 2026; 4,00 dólares de entrada y 20,00 dólares de salida por millón de tokens. La columna derecha, encabezada por Gemini 3.8 Flash TTS, dice: lo lee en voz alta; disponibilidad general el 22 de septiembre de 2026; 9,00 dólares por millón de tokens de audio. Una línea al pie dice: un render de 5m51s equivale a unos 8.775 tokens de audio, aproximadamente 8 centavos de narración.
Guides & Insights

Claude Opus 5.5 y Gemini 3.8 Flash TTS produjeron un vídeo de noticias narrado: el brief, las dos tarifas y lo que cuesta la voz

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos, dos proveedores, un video terminado y un prompt lo bastante corto como para pegarlo en una caja de chat. El 2 de octubre de 2026, el escritor de IA en chino 宝玉 (X/@dotey) publicó dos renders de la misma recopilación de chimes —uno en inglés y otro en chino— y dijo que ambos fueron creados de principio a fin por Claude Opus 5.5, que encontró su propio material y escribió su propia narración, con la voz aportada por Gemini 3.8 Flash TTS usando una clave de API que proporcionó el propio autor. Ninguno de los dos modelos es nuevo: Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, y las notas de versión de Google fechan la conversión de texto a voz de Gemini 3.8 el mismo día. Lo que apenas tiene unos días de vida es el empaquetado: el propio brief del productor y una serie de repositorios creados entre el 30 de septiembre y el 3 de octubre que convierten ese brief en un Claude Code que puedes instalar. Este es un artículo sobre el flujo de trabajo, no sobre un lanzamiento.

Lo que el brief realmente especifica

La plantilla es una sola oración con tres huecos. Traducida al inglés desde el chino original, dice: hazme un video de chismes sobre {tema} (material complementario: {enlaces/capturas de pantalla, opcional}; versión anonimizada: eliminar {nombre de la persona}, opcional). Todo lo interesante sobre el formato está oculto en esos tres huecos, porque un brief tan corto solo es delegable si el destinatario puede hacer tres cosas sin que se lo digan: encontrar su propio material de origen, decidir cuál es la historia y devolver un artefacto terminado en lugar de un plan.

El tema es una cadena de texto libre, así que el modelo hace una selección editorial: qué cuenta como la historia, qué momentos incluir, en qué orden van. Ese es un trabajo distinto del resumen, y es la parte del flujo de trabajo sobre la que el operador tiene menos control. El material complementario opcional es la válvula de escape: pega un enlace o una captura de pantalla y el modelo trabaja a partir de una fuente fija en lugar de buscar, que es la diferencia entre un render reproducible y un vídeo distinto cada vez que lo ejecutas. La tercera ranura, 去敏, es la que merece que nos detengamos en ella, y volveremos sobre ello.

Lee el brief como una especificación y te dice lo que asume sobre el arnés. Asume que el modelo puede llegar al mundo exterior —el paso de descubrimiento se delega, no se describe—, y que lo que el modelo puede alcanzar es una propiedad de las herramientas que monta el operador, no de Claude Opus 5.5 en sí. Asume una pila de imágenes o de renderizado, porque el artefacto entregado es un vídeo y Claude Opus 5.5 no emite vídeo. Y asume una voz.

La división de la historia

Esa última suposición es el hecho estructural de este flujo de trabajo. Nuestra propia entrada de catálogo para anthropic/claude-opus-5.5 enumera sus modalidades de entrada como texto, imagen y archivo, y su modalidad de salida como texto: una modalidad menos. El modelo no puede sintetizar voz, y no puede oír una pista una vez que existe. Todo vídeo narrado construido de este modo tiene, por tanto, al menos dos dependencias de modelo con dos tarifas, dos proveedores y dos credenciales, y la segunda tiene que proporcionarla un humano. Opus 5.5 puede escribir el guion y conectar el renderizado; no puede abrir una cuenta de Google ni aprovisionar una clave. El autor de la publicación del 2 de octubre dice exactamente eso: la clave de Gemini era suya.

La restricción tiene una segunda arista que es fácil pasar por alto hasta que lo lanzas. Como Claude Opus 5.5 no recibe audio de entrada, el modelo que escribió la narración no puede comprobarla. Nombres mal pronunciados, énfasis extraño, una frase que el sintetizador reproduce sin entonación —nada de eso llega al modelo que la escribió. El control de calidad de la voz consiste en que una persona escuche la salida, cada vez, y ese es el paso que impide que esto sea un pipeline totalmente desatendido, por muy bueno que sea el guion. Cuando la propia salida del modelo es un programa, la revisión consiste en escuchar, no en un diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Lo que cuesta la voz — y no es la parte cara

La página de precios de Google publica la conversión que hace que este cálculo cuadre: los tokens de audio corresponden a 25 tokens por segundo de salida. Los dos renderizados de la publicación del 2 de octubre duran 351 segundos y 332 segundos, leídos de los propios metadatos multimedia del tuit —aproximadamente cinco minutos cincuenta y uno y cinco minutos treinta y dos—. A 25 tokens por segundo, esos son 8.775 y 8.300 tokens de audio, y a la tarifa actual de audio de Flash TTS de $9.00 por millón de tokens, eso es aproximadamente ocho centavos de narración por video y alrededor de quince centavos por ambas versiones de idioma juntas.

Pon eso junto a la parte de razonamiento del mismo trabajo. La tarifa de lista de Claude Opus 5.5 es de $4 por millón de tokens de entrada y $20 por millón de salida, con los tokens de razonamiento facturados como salida, y las lecturas de caché a $0.20 por millón. La narración de un vídeo de seis minutos es un error de redondeo frente a los tokens que el modelo gasta en decidir cuál es la historia, leer fuentes y escribir el guion que lee la voz. La conclusión práctica no es «el TTS es barato» — es que, en este pipeline, la voz es la única partida que no tienes que optimizar, y el esfuerzo debe ir a la parte que cuesta dólares.

Dos detalles de la tarjeta de tarifas cambiarán eso, así que planifique en función de ellos desde ahora:

• El periodo promocional termina — Flash TTS standard cuesta $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y después $1.00 y $18.00. La narración del mismo video cuesta unos dieciséis centavos en enero, exactamente el doble.

• Hay un nivel más barato con una contrapartida real: Gemini 3.8 Flash-Lite TTS cobra $0.50 y $6.00 en el mismo esquema, y sube a $1.00 y $12.00, cubriendo 101 idiomas frente a los 130 de Flash TTS. Para un explicativo con un solo narrador en inglés, Lite es dos tercios de la tarifa de audio y el límite de idiomas es irrelevante; para el render bilingüe en la publicación del 2 de octubre, no es obviamente irrelevante, que es la decisión que la división de niveles te pide tomar.

El nivel Batch y Flex de Google cuesta 0,25 $ de entrada y 4,50 $ de salida, y Priority cuesta 0,90 $ y 16,20 $; conviene saberlo si tus renders se procesan en cola en lugar de ser interactivos, porque nada en un resumen de chismes requiere la respuesta en tiempo real.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Esta semana, el brief se convirtió en una habilidad

Un prompt en un tuit es una demostración; un repositorio es algo que se puede instalar. Los repositorios que aparecieron en torno a este formato son la parte que está genuinamente dentro de los últimos siete días, y vale la pena leerlos por separado en lugar de como un conjunto, porque cada uno hace una apuesta distinta sobre cuánto del pipeline debería fijarse en el código.

• hoangduong92/idea-to-film-skill — creado el 30 de septiembre de 2026, con licencia MIT, y la coincidencia más cercana a la publicación del 2 de octubre: una skill de Claude Code que lleva una idea a un cortometraje narrado en MP4 con animación dibujada por código, música, efectos de sonido, una voz de Gemini TTS y subtítulos. La voz se menciona en la descripción, que es la forma honesta de publicar esto: el segundo proveedor es una dependencia declarada, no una oculta.

• samuelstroschein/opus-video-generator — creado el 2 de octubre, con licencia MIT, y el que tiene la postura más marcada en cuanto a credenciales: crea vídeos de lanzamiento en tu navegador con tu propia suscripción de Claude, ejecutado mediante npx. Esa es una respuesta distinta al problema clave anterior: mantener la autorización existente del humano en el circuito en lugar de generar una nueva clave de API para un agente.

• makevoid/motion-graphics-music-video-skill-noimage — creado el 2 de octubre, con licencia MIT, y el que tiene una disciplina que vale la pena copiar: declara en su propia descripción que no usa ningún modelo de imagen ni modelo de vídeo, y produce gráficos en movimiento a partir de una pista de música y un prompt. Cuando el único paso generativo es el código, el resultado es reproducible y cada licencia de recurso de la pieza final es algo que puedes evaluar por tu cuenta.

• RohanRatwani/explainer-video-opus-5.5 — creado el 2 de octubre, con licencia MIT, orientado al explicativo en 16:9 y Shorts en lugar del resumen de chismes, y menciona explícitamente el problema de sincronización: cada animación sincronizada con la narración. Ese orden importa, porque significa que el audio se renderiza antes de que se coloquen los visuales.

• zhuyansen/awesome-opus-5.5-video — creado el 27 de septiembre, sin licencia declarada, y con diferencia el más visible del grupo con 67 estrellas, mientras que los demás tienen un solo dígito o cero. Es un índice en lugar de una herramienta, en inglés y chino, y su existencia es una señal útil sobre la forma del interés: lo que la gente quiere primero es un catálogo de lo que otros afirman haber hecho, y las herramientas vienen después.

Ninguna de estas es una dependencia estable. Tienen apenas unos días, son de un solo autor y sus términos de licencia son lo único que se interpone entre tú y un metraje que no puedes usar. Pero lo importante es la dirección: el prompt del tuit es el prototipo, y la habilidad del repositorio es lo que un equipo adoptaría de verdad.

Dos versiones de idioma, una historia

La publicación del 2 de octubre es deliberadamente bilingüe: una versión en inglés y otra en chino del mismo tema. Eso es inusual para una demo y expone algo real sobre este formato: que el chisme no viaja por traducción. Los elementos que sostienen una historia en un mercado (quién dijo qué a quién, qué desmentido se emitió, cómo se ve la línea temporal) no son los que la sostienen en otro, así que la segunda versión es una reescritura con un juicio editorial distinto, no una pasada de traducción. Lo que sí se transfiere es el esqueleto: la misma estructura de la historia, la misma pila de renderizado, la misma voz.

La consecuencia en costes es pequeña y va en la dirección correcta. Según los cálculos anteriores, añadir el segundo idioma cuesta unos ocho centavos de audio adicional para una historia que el modelo ya ha investigado una vez. Cuando la parte cara de un pipeline es el razonamiento y la parte barata es la salida, producir una segunda versión en otro idioma sale casi gratis, lo que constituye un argumento a favor de tratar la localización como una salida de primera clase del flujo de trabajo en lugar de como un proyecto aparte.

La desidentificación es una edición, no una eliminación

El tercer espacio del brief es el que debería hacerte frenar. 去敏 — desensibilizar, una versión desidentificada que elimina a una persona nombrada — se ofrece como un parámetro opcional, como si borrar un nombre fuera un filtro que se activa. No lo es. Una recopilación de chismes sobre un acontecimiento identificable, con el nombre eliminado, por lo general sigue siendo sobre esa persona: el lector reconstruye el nombre a partir del contexto, y todo, desde el titular hasta la miniatura, puede llevar el identificador. Eliminar la cadena cambia de qué dice tratar el vídeo sin cambiar de quién trata, y si tu motivo para eliminar el nombre es legal o reputacional, la cadena no es la parte que estaba creando la exposición.

De esto se desprenden dos cosas para cualquiera que publique este formato. En primer lugar, la obligación de citar las fuentes no se transfiere a otro solo porque el presentador sea sintético: una recopilación generada que se nutre del trabajo periodístico ajeno hereda la obligación de decir de dónde proviene esa información, y el brief de la publicación del 2 de octubre no incluye ningún espacio para las fuentes; ese es un vacío que quien opera la herramienta tiene que llenar a mano. En segundo lugar, el producto es legítimamente sintético, y a quien escucha no se le dice que lo es a menos que tú se lo digas. Una etiqueta es una sola línea de texto y marca la diferencia entre una demo y un contenido que engaña a quien lo ve acerca de lo que está viendo. Si quieres que los parámetros carguen con ese peso, incluye la divulgación en el brief y trátala como algo no opcional, del mismo modo que el proveedor de la voz debería nombrarse en lugar de ocultarse.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Ejecutándolo en una tecla, y la única tecla que aún no cubre

Si estás construyendo este pipeline, el costo de integración no son las llamadas al modelo, sino la segunda credencial. Claude Opus 5.5 se puede enrutar hoy como anthropic/claude-opus-5.5 al precio de lista de Anthropic de $4 y $20 por millón de tokens, transferido con un 0% de margen, de modo que un cambio de precio del proveedor llega a tu factura el mismo día en lugar de en la próxima revisión de contrato. Enrutarlo junto con el resto de tu stack a través de un único endpoint compatible con OpenAI es lo que elimina el segundo SDK, y la conmutación por error automática es lo que te permite probar un modelo más nuevo o menos probado en un render interno sin poner la ruta de producción detrás de él.

La frontera honesta es la voz. Los endpoints de TTS Gemini 3.8 Flash y Flash-Lite TTS de Google no están hoy en nuestro catálogo —la API pública de modelos devuelve un not-found para google/gemini-3.8-flash-tts—, así que el flujo de trabajo de la publicación del 2 de octubre necesita de verdad la clave de Google del propio autor, y eso es una restricción real, no algo temporal que podamos despachar con un gesto. El endpoint de TTS que sí tenemos es el más antiguo google/gemini-3.1-flash-tts-preview, a 1,00 $ por millón de tokens de texto de entrada y 20,00 $ por millón de tokens de audio de salida: se puede usar en la misma forma de pipeline, con el precio de la generación anterior, y no es el modelo sobre el que se construyó este flujo de trabajo. Elige tu camino con conocimiento de causa: una clave para el razonador y otra para la voz, o una sola clave y el TTS más antiguo.

Qué ver

Lo que haría que este formato fuera aburrido, en el buen sentido, es una modalidad de audio en el modelo que produce. Hasta que Claude Opus 5.5 —o lo que sea que lo reemplace— pueda escuchar la pista que encargó y ajustarla, la voz sigue siendo un paso que se revisa a mano, y estos pipelines mantienen a los humanos en el bucle por construcción y no por política. Vigila los repositorios de habilidades durante las próximas dos semanas en lugar de las demos: los que sobrevivan serán los que declaren sus proveedores, tengan una licencia y te permitan volver a ejecutar el mismo brief y obtener el mismo vídeo. El prompt de la publicación del 2 de octubre parecerá la parte fácil, porque lo era.

Para un pipeline que ya cuenta con su propio material y guion, calcula tu propia cifra en lugar de tomar prestada una de X: a 25 tokens por segundo, cada minuto de narración terminada equivale a 1500 tokens de audio y alrededor de 1,35 centavos con la tarifa actual de Flash TTS — una cifra que puedes contrastar con un tarifario antes de dedicar una franja de producción a un presentador sintético.