
Claude Opus 5.5 y Gemini 3.8 Flash TTS produjeron un vídeo de noticias narrado: el brief, las dos tarifas y lo que cuesta la voz
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Dos modelos, dos proveedores, un video terminado y un prompt lo bastante corto como para pegarlo en una caja de chat. El 2 de octubre de 2026, el escritor de IA en chino 宝玉 (X/@dotey) publicó dos renders de la misma recopilación de chimes —uno en inglés y otro en chino— y dijo que ambos fueron creados de principio a fin por Claude Opus 5.5, que encontró su propio material y escribió su propia narración, con la voz aportada por Gemini 3.8 Flash TTS usando una clave de API que proporcionó el propio autor. Ninguno de los dos modelos es nuevo: Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, y las notas de versión de Google fechan la conversión de texto a voz de Gemini 3.8 el mismo día. Lo que apenas tiene unos días de vida es el empaquetado: el propio brief del productor y una serie de repositorios creados entre el 30 de septiembre y el 3 de octubre que convierten ese brief en un Claude Code que puedes instalar. Este es un artículo sobre el flujo de trabajo, no sobre un lanzamiento.
Lo que el brief realmente especifica
La plantilla es una sola oración con tres huecos. Traducida al inglés desde el chino original, dice: hazme un video de chismes sobre {tema} (material complementario: {enlaces/capturas de pantalla, opcional}; versión anonimizada: eliminar {nombre de la persona}, opcional). Todo lo interesante sobre el formato está oculto en esos tres huecos, porque un brief tan corto solo es delegable si el destinatario puede hacer tres cosas sin que se lo digan: encontrar su propio material de origen, decidir cuál es la historia y devolver un artefacto terminado en lugar de un plan.
El tema es una cadena de texto libre, así que el modelo hace una selección editorial: qué cuenta como la historia, qué momentos incluir, en qué orden van. Ese es un trabajo distinto del resumen, y es la parte del flujo de trabajo sobre la que el operador tiene menos control. El material complementario opcional es la válvula de escape: pega un enlace o una captura de pantalla y el modelo trabaja a partir de una fuente fija en lugar de buscar, que es la diferencia entre un render reproducible y un vídeo distinto cada vez que lo ejecutas. La tercera ranura, 去敏, es la que merece que nos detengamos en ella, y volveremos sobre ello.
Lee el brief como una especificación y te dice lo que asume sobre el arnés. Asume que el modelo puede llegar al mundo exterior —el paso de descubrimiento se delega, no se describe—, y que lo que el modelo puede alcanzar es una propiedad de las herramientas que monta el operador, no de Claude Opus 5.5 en sí. Asume una pila de imágenes o de renderizado, porque el artefacto entregado es un vídeo y Claude Opus 5.5 no emite vídeo. Y asume una voz.
La división de la historia
Esa última suposición es el hecho estructural de este flujo de trabajo. Nuestra propia entrada de catálogo para anthropic/claude-opus-5.5 enumera sus modalidades de entrada como texto, imagen y archivo, y su modalidad de salida como texto: una modalidad menos. El modelo no puede sintetizar voz, y no puede oír una pista una vez que existe. Todo vídeo narrado construido de este modo tiene, por tanto, al menos dos dependencias de modelo con dos tarifas, dos proveedores y dos credenciales, y la segunda tiene que proporcionarla un humano. Opus 5.5 puede escribir el guion y conectar el renderizado; no puede abrir una cuenta de Google ni aprovisionar una clave. El autor de la publicación del 2 de octubre dice exactamente eso: la clave de Gemini era suya.
La restricción tiene una segunda arista que es fácil pasar por alto hasta que lo lanzas. Como Claude Opus 5.5 no recibe audio de entrada, el modelo que escribió la narración no puede comprobarla. Nombres mal pronunciados, énfasis extraño, una frase que el sintetizador reproduce sin entonación —nada de eso llega al modelo que la escribió. El control de calidad de la voz consiste en que una persona escuche la salida, cada vez, y ese es el paso que impide que esto sea un pipeline totalmente desatendido, por muy bueno que sea el guion. Cuando la propia salida del modelo es un programa, la revisión consiste en escuchar, no en un diff.

Lo que cuesta la voz — y no es la parte cara
La página de precios de Google publica la conversión que hace que este cálculo cuadre: los tokens de audio corresponden a 25 tokens por segundo de salida. Los dos renderizados de la publicación del 2 de octubre duran 351 segundos y 332 segundos, leídos de los propios metadatos multimedia del tuit —aproximadamente cinco minutos cincuenta y uno y cinco minutos treinta y dos—. A 25 tokens por segundo, esos son 8.775 y 8.300 tokens de audio, y a la tarifa actual de audio de Flash TTS de $9.00 por millón de tokens, eso es aproximadamente ocho centavos de narración por video y alrededor de quince centavos por ambas versiones de idioma juntas.
Pon eso junto a la parte de razonamiento del mismo trabajo. La tarifa de lista de Claude Opus 5.5 es de $4 por millón de tokens de entrada y $20 por millón de salida, con los tokens de razonamiento facturados como salida, y las lecturas de caché a $0.20 por millón. La narración de un vídeo de seis minutos es un error de redondeo frente a los tokens que el modelo gasta en decidir cuál es la historia, leer fuentes y escribir el guion que lee la voz. La conclusión práctica no es «el TTS es barato» — es que, en este pipeline, la voz es la única partida que no tienes que optimizar, y el esfuerzo debe ir a la parte que cuesta dólares.
Dos detalles de la tarjeta de tarifas cambiarán eso, así que planifique en función de ellos desde ahora:
• El periodo promocional termina — Flash TTS standard cuesta $0.50 por millón de tokens de texto de entrada y $9.00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026, y después $1.00 y $18.00. La narración del mismo video cuesta unos dieciséis centavos en enero, exactamente el doble.
• Hay un nivel más barato con una contrapartida real: Gemini 3.8 Flash-Lite TTS cobra $0.50 y $6.00 en el mismo esquema, y sube a $1.00 y $12.00, cubriendo 101 idiomas frente a los 130 de Flash TTS. Para un explicativo con un solo narrador en inglés, Lite es dos tercios de la tarifa de audio y el límite de idiomas es irrelevante; para el render bilingüe en la publicación del 2 de octubre, no es obviamente irrelevante, que es la decisión que la división de niveles te pide tomar.
El nivel Batch y Flex de Google cuesta 0,25 $ de entrada y 4,50 $ de salida, y Priority cuesta 0,90 $ y 16,20 $; conviene saberlo si tus renders se procesan en cola en lugar de ser interactivos, porque nada en un resumen de chismes requiere la respuesta en tiempo real.

Esta semana, el brief se convirtió en una habilidad
Un prompt en un tuit es una demostración; un repositorio es algo que se puede instalar. Los repositorios que aparecieron en torno a este formato son la parte que está genuinamente dentro de los últimos siete días, y vale la pena leerlos por separado en lugar de como un conjunto, porque cada uno hace una apuesta distinta sobre cuánto del pipeline debería fijarse en el código.
• hoangduong92/idea-to-film-skill — creado el 30 de septiembre de 2026, con licencia MIT, y la coincidencia más cercana a la publicación del 2 de octubre: una skill de Claude Code que lleva una idea a un cortometraje narrado en MP4 con animación dibujada por código, música, efectos de sonido, una voz de Gemini TTS y subtítulos. La voz se menciona en la descripción, que es la forma honesta de publicar esto: el segundo proveedor es una dependencia declarada, no una oculta.
• samuelstroschein/opus-video-generator — creado el 2 de octubre, con licencia MIT, y el que tiene la postura más marcada en cuanto a credenciales: crea vídeos de lanzamiento en tu navegador con tu propia suscripción de Claude, ejecutado mediante npx. Esa es una respuesta distinta al problema clave anterior: mantener la autorización existente del humano en el circuito en lugar de generar una nueva clave de API para un agente.
• makevoid/motion-graphics-music-video-skill-noimage — creado el 2 de octubre, con licencia MIT, y el que tiene una disciplina que vale la pena copiar: declara en su propia descripción que no usa ningún modelo de imagen ni modelo de vídeo, y produce gráficos en movimiento a partir de una pista de música y un prompt. Cuando el único paso generativo es el código, el resultado es reproducible y cada licencia de recurso de la pieza final es algo que puedes evaluar por tu cuenta.
• RohanRatwani/explainer-video-opus-5.5 — creado el 2 de octubre, con licencia MIT, orientado al explicativo en 16:9 y Shorts en lugar del resumen de chismes, y menciona explícitamente el problema de sincronización: cada animación sincronizada con la narración. Ese orden importa, porque significa que el audio se renderiza antes de que se coloquen los visuales.
• zhuyansen/awesome-opus-5.5-video — creado el 27 de septiembre, sin licencia declarada, y con diferencia el más visible del grupo con 67 estrellas, mientras que los demás tienen un solo dígito o cero. Es un índice en lugar de una herramienta, en inglés y chino, y su existencia es una señal útil sobre la forma del interés: lo que la gente quiere primero es un catálogo de lo que otros afirman haber hecho, y las herramientas vienen después.
Ninguna de estas es una dependencia estable. Tienen apenas unos días, son de un solo autor y sus términos de licencia son lo único que se interpone entre tú y un metraje que no puedes usar. Pero lo importante es la dirección: el prompt del tuit es el prototipo, y la habilidad del repositorio es lo que un equipo adoptaría de verdad.
Dos versiones de idioma, una historia
La publicación del 2 de octubre es deliberadamente bilingüe: una versión en inglés y otra en chino del mismo tema. Eso es inusual para una demo y expone algo real sobre este formato: que el chisme no viaja por traducción. Los elementos que sostienen una historia en un mercado (quién dijo qué a quién, qué desmentido se emitió, cómo se ve la línea temporal) no son los que la sostienen en otro, así que la segunda versión es una reescritura con un juicio editorial distinto, no una pasada de traducción. Lo que sí se transfiere es el esqueleto: la misma estructura de la historia, la misma pila de renderizado, la misma voz.
La consecuencia en costes es pequeña y va en la dirección correcta. Según los cálculos anteriores, añadir el segundo idioma cuesta unos ocho centavos de audio adicional para una historia que el modelo ya ha investigado una vez. Cuando la parte cara de un pipeline es el razonamiento y la parte barata es la salida, producir una segunda versión en otro idioma sale casi gratis, lo que constituye un argumento a favor de tratar la localización como una salida de primera clase del flujo de trabajo en lugar de como un proyecto aparte.
La desidentificación es una edición, no una eliminación
El tercer espacio del brief es el que debería hacerte frenar. 去敏 — desensibilizar, una versión desidentificada que elimina a una persona nombrada — se ofrece como un parámetro opcional, como si borrar un nombre fuera un filtro que se activa. No lo es. Una recopilación de chismes sobre un acontecimiento identificable, con el nombre eliminado, por lo general sigue siendo sobre esa persona: el lector reconstruye el nombre a partir del contexto, y todo, desde el titular hasta la miniatura, puede llevar el identificador. Eliminar la cadena cambia de qué dice tratar el vídeo sin cambiar de quién trata, y si tu motivo para eliminar el nombre es legal o reputacional, la cadena no es la parte que estaba creando la exposición.
De esto se desprenden dos cosas para cualquiera que publique este formato. En primer lugar, la obligación de citar las fuentes no se transfiere a otro solo porque el presentador sea sintético: una recopilación generada que se nutre del trabajo periodístico ajeno hereda la obligación de decir de dónde proviene esa información, y el brief de la publicación del 2 de octubre no incluye ningún espacio para las fuentes; ese es un vacío que quien opera la herramienta tiene que llenar a mano. En segundo lugar, el producto es legítimamente sintético, y a quien escucha no se le dice que lo es a menos que tú se lo digas. Una etiqueta es una sola línea de texto y marca la diferencia entre una demo y un contenido que engaña a quien lo ve acerca de lo que está viendo. Si quieres que los parámetros carguen con ese peso, incluye la divulgación en el brief y trátala como algo no opcional, del mismo modo que el proveedor de la voz debería nombrarse en lugar de ocultarse.

Ejecutándolo en una tecla, y la única tecla que aún no cubre
Si estás construyendo este pipeline, el costo de integración no son las llamadas al modelo, sino la segunda credencial. Claude Opus 5.5 se puede enrutar hoy como anthropic/claude-opus-5.5 al precio de lista de Anthropic de $4 y $20 por millón de tokens, transferido con un 0% de margen, de modo que un cambio de precio del proveedor llega a tu factura el mismo día en lugar de en la próxima revisión de contrato. Enrutarlo junto con el resto de tu stack a través de un único endpoint compatible con OpenAI es lo que elimina el segundo SDK, y la conmutación por error automática es lo que te permite probar un modelo más nuevo o menos probado en un render interno sin poner la ruta de producción detrás de él.
La frontera honesta es la voz. Los endpoints de TTS Gemini 3.8 Flash y Flash-Lite TTS de Google no están hoy en nuestro catálogo —la API pública de modelos devuelve un not-found para google/gemini-3.8-flash-tts—, así que el flujo de trabajo de la publicación del 2 de octubre necesita de verdad la clave de Google del propio autor, y eso es una restricción real, no algo temporal que podamos despachar con un gesto. El endpoint de TTS que sí tenemos es el más antiguo google/gemini-3.1-flash-tts-preview, a 1,00 $ por millón de tokens de texto de entrada y 20,00 $ por millón de tokens de audio de salida: se puede usar en la misma forma de pipeline, con el precio de la generación anterior, y no es el modelo sobre el que se construyó este flujo de trabajo. Elige tu camino con conocimiento de causa: una clave para el razonador y otra para la voz, o una sola clave y el TTS más antiguo.
Qué ver
Lo que haría que este formato fuera aburrido, en el buen sentido, es una modalidad de audio en el modelo que produce. Hasta que Claude Opus 5.5 —o lo que sea que lo reemplace— pueda escuchar la pista que encargó y ajustarla, la voz sigue siendo un paso que se revisa a mano, y estos pipelines mantienen a los humanos en el bucle por construcción y no por política. Vigila los repositorios de habilidades durante las próximas dos semanas en lugar de las demos: los que sobrevivan serán los que declaren sus proveedores, tengan una licencia y te permitan volver a ejecutar el mismo brief y obtener el mismo vídeo. El prompt de la publicación del 2 de octubre parecerá la parte fácil, porque lo era.
Para un pipeline que ya cuenta con su propio material y guion, calcula tu propia cifra en lugar de tomar prestada una de X: a 25 tokens por segundo, cada minuto de narración terminada equivale a 1500 tokens de audio y alrededor de 1,35 centavos con la tarifa actual de Flash TTS — una cifra que puedes contrastar con un tarifario antes de dedicar una franja de producción a un presentador sintético.
