
Claude Opus 5.5 e Gemini 3.8 Flash TTS produziram um vídeo de notícias narrado: o briefing, as duas tabelas de preços e quanto custa a voz.
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois modelos, dois fornecedores, um vídeo finalizado e um prompt curto o suficiente para colar em uma caixa de chat. Em 2 de outubro de 2026, o escritor de IA em chinês 宝玉 (X/@dotey) publicou duas renderizações do mesmo resumo de fofocas — uma em inglês, uma em chinês — e disse que ambas foram construídas de ponta a ponta por Claude Opus 5.5, que encontrou seu próprio material e escreveu sua própria narração, com a voz fornecida por Gemini 3.8 Flash TTS usando uma chave de API fornecida pelo autor. Nenhum dos modelos é novo: a Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, e as notas de versão do Google datam os modelos de conversão de texto em fala Gemini 3.8 do mesmo dia. O que tem apenas alguns dias é o empacotamento — o próprio briefing do produtor, e uma série de repositórios criados entre 30 de setembro e 3 de outubro que transformam esse briefing em uma skill do Claude Code que você pode instalar. Este é um artigo sobre o fluxo de trabalho, não sobre um lançamento.
O que o briefing realmente especifica
O modelo é uma frase com três lacunas. Traduzido do chinês original para o inglês, ele diz: faça para mim um vídeo de fofoca sobre {tópico} (material complementar: {links/capturas de tela, opcional}; versão anonimizada: remover {nome da pessoa}, opcional). Tudo o que há de interessante no formato está escondido nessas três lacunas, porque um briefing tão curto só é delegável se o destinatário puder fazer três coisas sem que lhe digam: encontrar seu próprio material de origem, decidir qual é a história e devolver um artefato finalizado em vez de um plano.
O tópico é uma string de texto livre, então o modelo está fazendo uma seleção editorial — o que conta como a história, quais momentos incluir, em que ordem eles aparecem. Essa é uma tarefa diferente da sumarização, e é a parte do pipeline sobre a qual o operador tem menos controle. O material suplementar opcional é a válvula de escape: cole um link ou uma captura de tela e o modelo trabalha a partir de uma fonte fixa em vez de pesquisar, o que é a diferença entre uma renderização reproduzível e um vídeo diferente toda vez que você o executa. O terceiro slot, 去敏, é o que vale a pena aprofundar e voltaremos a ele.
Leia o briefing como uma especificação e ele lhe diz o que pressupõe sobre o harness. Ele pressupõe que o modelo consegue alcançar o mundo exterior — a etapa de descoberta é delegada, não descrita — e o que o modelo consegue alcançar é uma propriedade das ferramentas que o operador monta, não do próprio Claude Opus 5.5. Ele pressupõe uma pilha de imagens ou de renderização, porque o artefato entregue é um vídeo e o Claude Opus 5.5 não emite vídeo. E pressupõe uma voz.
A divisão do trabalho é a história
Essa última suposição é o fato estrutural deste fluxo de trabalho. Nossa própria entrada de catálogo para anthropic/claude-opus-5.5 lista suas modalidades de entrada como texto, imagem e arquivo, e sua modalidade de saída como texto — apenas uma modalidade de saída. O modelo não consegue sintetizar fala, e não consegue ouvir uma faixa depois que ela existe. Todo vídeo narrado construído dessa forma, portanto, tem pelo menos duas dependências de modelo, com duas tabelas de preços, dois fornecedores e duas credenciais, e a segunda precisa ser fornecida por um humano. O Opus 5.5 pode escrever o roteiro e conectar a renderização; não pode abrir uma conta Google nem provisionar uma chave. O autor do post de 2 de outubro diz exatamente isso: a chave do Gemini era dele.
A restrição tem uma segunda aresta que é fácil de ignorar até você publicar. Como o Claude Opus 5.5 não recebe áudio de entrada, o modelo que escreveu a narração não pode verificar a narração. Nomes pronunciados incorretamente, ênfases estranhas, uma frase que o sintetizador reproduz sem expressão — nada disso chega ao modelo que a criou. O controle de qualidade da voz é uma pessoa ouvindo a saída, sempre, e essa é a etapa que impede que isto seja um pipeline totalmente sem intervenção humana, não importa quão bom seja o roteiro. Quando a saída do próprio modelo é um programa, a revisão é uma escuta, não um diff.

O que a voz custa — e não é a parte cara
A página de preços do Google divulga a conversão que deixa essa aritmética simples: tokens de áudio correspondem a 25 tokens por segundo de saída. Os dois renders no post de 2 de outubro duram 351 segundos e 332 segundos, conforme os próprios metadados de mídia do tweet — aproximadamente cinco minutos e cinquenta e um segundos e cinco minutos e trinta e dois segundos. A 25 tokens por segundo, esses valores são 8.775 e 8.300 tokens de áudio e, à tarifa atual de áudio do Flash TTS de US$ 9,00 por milhão de tokens, isso dá cerca de oito centavos de narração por vídeo e aproximadamente quinze centavos para as duas versões de idioma juntas.
Coloque isso ao lado da parte de raciocínio do mesmo trabalho. A tarifa de tabela do Claude Opus 5.5 é de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, com tokens de pensamento cobrados como saída e leituras de cache a US$ 0,20 por milhão. A narração de um vídeo de seis minutos é um erro de arredondamento diante dos tokens que o modelo gasta decidindo qual é a história, lendo fontes e escrevendo o roteiro que a voz lê. A conclusão prática não é que "TTS é barato" — é que, neste pipeline, a voz é o único item de linha que você não precisa otimizar, e o esforço deve ir para a parte que custa dólares.
Dois detalhes da tabela de preços vão alterar essa conta, então planeje-se em relação a eles agora:
• A janela promocional se encerra — o Flash TTS standard custa US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 1,00 e US$ 18,00. A narração do mesmo vídeo custa cerca de dezesseis centavos em janeiro, exatamente o dobro.
• Há um nível mais barato com um trade-off real — o Gemini 3.8 Flash-Lite TTS cobra US$ 0,50 e US$ 6,00 no mesmo esquema de cobrança, subindo para US$ 1,00 e US$ 12,00, cobrindo 101 idiomas contra os 130 do Flash TTS. Para um vídeo explicativo com narrador único em inglês, o Lite custa dois terços da tarifa de áudio, e o teto de idiomas é irrelevante; para a renderização bilíngue no post de 2 de outubro, ele não é obviamente irrelevante, que é a decisão que a divisão de níveis está pedindo que você tome.
O nível Batch e Flex do Google custa US$ 0,25 na entrada e US$ 4,50 na saída, e o Priority custa US$ 0,90 e US$ 16,20 — vale a pena saber se seus renders ficam na fila em vez de serem interativos, porque nada em um resumo de fofocas exige a resposta em tempo real.

Nesta semana, o briefing se tornou uma habilidade.
Um prompt em um tweet é uma demonstração; um repositório é algo que você pode instalar. Os repositórios que surgiram em torno desse formato são a parte que está genuinamente dentro dos últimos sete dias, e vale a pena lê-los separadamente em vez de como um conjunto, porque cada um faz uma aposta diferente sobre quanto do pipeline deve ser fixado em código.
• hoangduong92/idea-to-film-skill — criado em 30 de setembro de 2026, licenciado sob MIT, e a correspondência mais próxima da publicação de 2 de outubro: uma skill do Claude Code que leva uma ideia até um MP4 de curta-metragem narrada com animação desenhada por código, música, efeitos sonoros, uma voz Gemini TTS e legendas. A voz é indicada na descrição, que é a forma honesta de lançar isto: o segundo fornecedor é uma dependência declarada, não uma dependência oculta.
• samuelstroschein/opus-video-generator — criado em 2 de outubro, licenciado sob MIT, e o mais opinativo quanto a credenciais: ele gera vídeos de lançamento no seu navegador com a sua própria assinatura do Claude, executado via npx. Essa é uma resposta diferente para o problema-chave acima — manter o direito existente da pessoa no circuito, em vez de cunhar uma nova chave de API para um agente.
• makevoid/motion-graphics-music-video-skill-noimage — criado em 2 de outubro, licenciado sob MIT, e aquele com uma disciplina que vale a pena copiar: ele declara na própria descrição que não usa modelo de imagem nem modelo de vídeo, produzindo motion graphics a partir de uma faixa musical e um prompt. Quando a única etapa generativa é código, a saída é reproduzível e cada licença de ativo da peça final é sua para avaliar.
RohanRatwani/explainer-video-op5.5criado em 2 de outubro, com licença MIT, com foco no explicador em 16:9 e Shorts em vez do resumo de fofocas, e nomeia explicitamente o problema de sincronização: cada animação sincronizada com a narração. Essa ordem importa, porque significa que o áudio é renderizado antes que os visuais sejam posicionados.
• zhuyansen/awesome-opus-5.5-video — criado em 27 de setembro, sem licença declarada e, de longe, o mais visível do grupo, com 67 estrelas, enquanto os outros estão na casa dos dígitos únicos ou em zero. É um índice, e não uma ferramenta, em inglês e chinês, e sua existência é um sinal útil sobre a forma do interesse: o que as pessoas querem primeiro é um catálogo do que os outros afirmam ter feito, e o ferramental vem depois.
Nenhuma dessas é uma dependência estável. Elas têm apenas alguns dias, são de um único autor, e seus termos de licença são a única coisa que separa você de um trecho de filmagem que você não pode usar. Mas a direção é o que importa: o prompt no tweet é o protótipo, e a habilidade no repositório é o que uma equipe realmente adotaria.
Duas versões linguísticas, uma história
O post de 2 de outubro é deliberadamente bilíngue — uma versão em inglês e uma em chinês do mesmo tópico. Isso é incomum para uma demo e revela algo real sobre este formato: a fofoca não se propaga por tradução. Os elementos que sustentam uma história em um mercado (quem disse o quê a quem, qual negação foi emitida, como a linha do tempo se apresenta) não são os elementos que a sustentam em outro, então a segunda versão é uma reescrita com um julgamento editorial diferente, não um passe de tradução. O que se transfere é o esqueleto: a mesma estrutura de história, a mesma stack de renderização, a mesma voz.
A consequência de custo é pequena e na direção certa. Com base na aritmética acima, adicionar o segundo idioma custa cerca de oito centavos de áudio adicional para uma matéria que o modelo já pesquisou uma vez. Quando a parte cara de um pipeline é o raciocínio e a parte barata é a saída, produzir uma segunda versão em outro idioma é quase de graça — o que é um argumento para tratar a localização como uma saída de primeira classe do fluxo de trabalho, em vez de um projeto separado.
Desidentificação é uma edição, não uma exclusão
O terceiro campo do briefing é o que deveria te fazer pisar no freio. 去敏 — dessensibilizar, uma versão desidentificada que remove uma pessoa nomeada — é oferecido como um parâmetro opcional, como se apagar um nome fosse um filtro que você liga. Não é. Um resumo de fofocas sobre um evento identificável, com o nome removido, geralmente ainda é sobre aquela pessoa: o leitor supõe o nome pelo contexto, e tudo, da manchete à miniatura, pode carregar o identificador. Tirar a string muda aquilo que o vídeo diz ser o seu assunto sem mudar de quem ele trata, e se o seu motivo para tirar o nome é jurídico ou de reputação, a string não é a parte que estava gerando a exposição.
Duas coisas decorrem para quem lança esse formato. Primeiro, o dever de atribuição de fontes não deixa de ser seu só porque o apresentador é sintético: um compilado gerado que se baseia na reportagem de outras pessoas herda a obrigação de dizer de onde veio a reportagem, e o briefing no post de 2 de outubro não contém nenhum espaço para fontes — essa é uma lacuna que o operador tem de preencher manualmente. Segundo, o artefato é legitimamente sintético, e o ouvinte não é informado disso a menos que você o informe. Um rótulo é uma linha de texto e é a diferença entre uma demonstração e um conteúdo que engana o espectador sobre o que ele está assistindo. Se você quer que os parâmetros carreguem esse peso, coloque a divulgação no briefing e trate-a como não opcional, do mesmo modo que o fornecedor da voz deveria ser nomeado, e não ocultado.

Executando-o em uma chave, e a única chave que ele ainda não cobre
Se você está construindo esse pipeline, o custo de integração não são as chamadas ao modelo — é a segunda credencial. O Claude Opus 5.5 já é roteável hoje como anthropic/claude-opus-5.5, ao preço de tabela da própria Anthropic de US$ 4 e US$ 20 por milhão de tokens, repassado com 0% de markup, de modo que uma mudança de preço do fornecedor chega à sua fatura no mesmo dia, e não na próxima revisão de contrato. Roteá-lo junto com o resto da sua stack por meio de um único endpoint compatível com OpenAI é o que elimina o segundo SDK, e o failover automático é o que permite testar um modelo mais novo ou menos comprovado em um render interno sem colocar o caminho de produção atrás dele.
A fronteira honesta é a voz. Os endpoints Gemini 3.8 Flash TTS e Flash-Lite TTS do Google não estão no nosso catálogo hoje — a API pública de modelos retorna um erro de não encontrado para google/gemini-3.8-flash-tts — então o fluxo de trabalho do post de 2 de outubro realmente precisa da própria chave do Google do autor, e isso é uma restrição real, não algo temporário que possamos simplesmente ignorar. O endpoint de TTS que nós de fato oferecemos é o mais antigo google/gemini-3.1-flash-tts-preview, a US$ 1,00 por milhão de tokens de texto de entrada e US$ 20,00 por milhão de tokens de áudio de saída: utilizável no mesmo formato de pipeline, com preço para a geração mais antiga e não o modelo no qual este fluxo de trabalho foi criado. Escolha seu caminho com conhecimento de causa — uma chave para o raciocinador e uma segunda para a voz, ou uma chave e o TTS mais antigo.
O que assistir
O que tornaria este formato entediante, no bom sentido, é uma modalidade de áudio no modelo produtor. Até que o Claude Opus 5.5 — ou o que quer que o substitua — consiga ouvir a faixa que encomendou e ajustá-la, a voz continua sendo uma etapa revisada manualmente, e esses pipelines permanecem com humanos no circuito por construção, e não por política. Fique de olho nos repositórios de skills nas próximas duas semanas, em vez das demos: os que sobreviverem serão os que declaram seus fornecedores, têm uma licença e permitem que você execute novamente o mesmo briefing e obtenha o mesmo vídeo. O prompt na publicação de 2 de outubro vai parecer a parte fácil, porque era.
Para um pipeline que já tem o próprio material e o próprio roteiro, faça a sua própria conta em vez de tomar uma emprestada de X: a 25 tokens por segundo, cada minuto de narração finalizada equivale a 1.500 tokens de áudio e a cerca de 1,35 centavo na tarifa atual do Flash TTS — um número que você pode conferir em uma tabela de tarifas antes de reservar um espaço de produção para um locutor sintético.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
