Um cartão de título principal gerado com os dizeres UM BRIEFING, DOIS MODELOS, UM VÍDEO NARRADO, dividido em duas colunas. A coluna da esquerda, intitulada Claude Opus 5.5, traz: escreve o roteiro; lançado em 22 de setembro de 2026; 4,00 dólares de entrada e 20,00 dólares de saída por milhão de tokens. A coluna da direita, intitulada Gemini 3.8 Flash TTS, traz: lê em voz alta; disponibilidade geral em 22 de setembro de 2026; 9,00 dólares por milhão de tokens de áudio. Uma linha de rodapé traz: uma renderização de 5m51s tem cerca de 8.775 tokens de áudio, aproximadamente 8 centavos de narração.
Guides & Insights

Claude Opus 5.5 e Gemini 3.8 Flash TTS produziram um vídeo de notícias narrado: o briefing, as duas tabelas de preços e quanto custa a voz.

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos, dois fornecedores, um vídeo finalizado e um prompt curto o suficiente para colar em uma caixa de chat. Em 2 de outubro de 2026, o escritor de IA em chinês 宝玉 (X/@dotey) publicou duas renderizações do mesmo resumo de fofocas — uma em inglês, uma em chinês — e disse que ambas foram construídas de ponta a ponta por Claude Opus 5.5, que encontrou seu próprio material e escreveu sua própria narração, com a voz fornecida por Gemini 3.8 Flash TTS usando uma chave de API fornecida pelo autor. Nenhum dos modelos é novo: a Anthropic lançou o Claude Opus 5.5 em 22 de setembro de 2026, e as notas de versão do Google datam os modelos de conversão de texto em fala Gemini 3.8 do mesmo dia. O que tem apenas alguns dias é o empacotamento — o próprio briefing do produtor, e uma série de repositórios criados entre 30 de setembro e 3 de outubro que transformam esse briefing em uma skill do Claude Code que você pode instalar. Este é um artigo sobre o fluxo de trabalho, não sobre um lançamento.

O que o briefing realmente especifica

O modelo é uma frase com três lacunas. Traduzido do chinês original para o inglês, ele diz: faça para mim um vídeo de fofoca sobre {tópico} (material complementar: {links/capturas de tela, opcional}; versão anonimizada: remover {nome da pessoa}, opcional). Tudo o que há de interessante no formato está escondido nessas três lacunas, porque um briefing tão curto só é delegável se o destinatário puder fazer três coisas sem que lhe digam: encontrar seu próprio material de origem, decidir qual é a história e devolver um artefato finalizado em vez de um plano.

O tópico é uma string de texto livre, então o modelo está fazendo uma seleção editorial — o que conta como a história, quais momentos incluir, em que ordem eles aparecem. Essa é uma tarefa diferente da sumarização, e é a parte do pipeline sobre a qual o operador tem menos controle. O material suplementar opcional é a válvula de escape: cole um link ou uma captura de tela e o modelo trabalha a partir de uma fonte fixa em vez de pesquisar, o que é a diferença entre uma renderização reproduzível e um vídeo diferente toda vez que você o executa. O terceiro slot, 去敏, é o que vale a pena aprofundar e voltaremos a ele.

Leia o briefing como uma especificação e ele lhe diz o que pressupõe sobre o harness. Ele pressupõe que o modelo consegue alcançar o mundo exterior — a etapa de descoberta é delegada, não descrita — e o que o modelo consegue alcançar é uma propriedade das ferramentas que o operador monta, não do próprio Claude Opus 5.5. Ele pressupõe uma pilha de imagens ou de renderização, porque o artefato entregue é um vídeo e o Claude Opus 5.5 não emite vídeo. E pressupõe uma voz.

A divisão do trabalho é a história

Essa última suposição é o fato estrutural deste fluxo de trabalho. Nossa própria entrada de catálogo para anthropic/claude-opus-5.5 lista suas modalidades de entrada como texto, imagem e arquivo, e sua modalidade de saída como texto — apenas uma modalidade de saída. O modelo não consegue sintetizar fala, e não consegue ouvir uma faixa depois que ela existe. Todo vídeo narrado construído dessa forma, portanto, tem pelo menos duas dependências de modelo, com duas tabelas de preços, dois fornecedores e duas credenciais, e a segunda precisa ser fornecida por um humano. O Opus 5.5 pode escrever o roteiro e conectar a renderização; não pode abrir uma conta Google nem provisionar uma chave. O autor do post de 2 de outubro diz exatamente isso: a chave do Gemini era dele.

A restrição tem uma segunda aresta que é fácil de ignorar até você publicar. Como o Claude Opus 5.5 não recebe áudio de entrada, o modelo que escreveu a narração não pode verificar a narração. Nomes pronunciados incorretamente, ênfases estranhas, uma frase que o sintetizador reproduz sem expressão — nada disso chega ao modelo que a criou. O controle de qualidade da voz é uma pessoa ouvindo a saída, sempre, e essa é a etapa que impede que isto seja um pipeline totalmente sem intervenção humana, não importa quão bom seja o roteiro. Quando a saída do próprio modelo é um programa, a revisão é uma escuta, não um diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

O que a voz custa — e não é a parte cara

A página de preços do Google divulga a conversão que deixa essa aritmética simples: tokens de áudio correspondem a 25 tokens por segundo de saída. Os dois renders no post de 2 de outubro duram 351 segundos e 332 segundos, conforme os próprios metadados de mídia do tweet — aproximadamente cinco minutos e cinquenta e um segundos e cinco minutos e trinta e dois segundos. A 25 tokens por segundo, esses valores são 8.775 e 8.300 tokens de áudio e, à tarifa atual de áudio do Flash TTS de US$ 9,00 por milhão de tokens, isso dá cerca de oito centavos de narração por vídeo e aproximadamente quinze centavos para as duas versões de idioma juntas.

Coloque isso ao lado da parte de raciocínio do mesmo trabalho. A tarifa de tabela do Claude Opus 5.5 é de US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de saída, com tokens de pensamento cobrados como saída e leituras de cache a US$ 0,20 por milhão. A narração de um vídeo de seis minutos é um erro de arredondamento diante dos tokens que o modelo gasta decidindo qual é a história, lendo fontes e escrevendo o roteiro que a voz lê. A conclusão prática não é que "TTS é barato" — é que, neste pipeline, a voz é o único item de linha que você não precisa otimizar, e o esforço deve ir para a parte que custa dólares.

Dois detalhes da tabela de preços vão alterar essa conta, então planeje-se em relação a eles agora:

• A janela promocional se encerra — o Flash TTS standard custa US$ 0,50 por milhão de tokens de texto de entrada e US$ 9,00 por milhão de tokens de áudio de saída até 31 de dezembro de 2026, depois US$ 1,00 e US$ 18,00. A narração do mesmo vídeo custa cerca de dezesseis centavos em janeiro, exatamente o dobro.

• Há um nível mais barato com um trade-off real — o Gemini 3.8 Flash-Lite TTS cobra US$ 0,50 e US$ 6,00 no mesmo esquema de cobrança, subindo para US$ 1,00 e US$ 12,00, cobrindo 101 idiomas contra os 130 do Flash TTS. Para um vídeo explicativo com narrador único em inglês, o Lite custa dois terços da tarifa de áudio, e o teto de idiomas é irrelevante; para a renderização bilíngue no post de 2 de outubro, ele não é obviamente irrelevante, que é a decisão que a divisão de níveis está pedindo que você tome.

O nível Batch e Flex do Google custa US$ 0,25 na entrada e US$ 4,50 na saída, e o Priority custa US$ 0,90 e US$ 16,20 — vale a pena saber se seus renders ficam na fila em vez de serem interativos, porque nada em um resumo de fofocas exige a resposta em tempo real.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Nesta semana, o briefing se tornou uma habilidade.

Um prompt em um tweet é uma demonstração; um repositório é algo que você pode instalar. Os repositórios que surgiram em torno desse formato são a parte que está genuinamente dentro dos últimos sete dias, e vale a pena lê-los separadamente em vez de como um conjunto, porque cada um faz uma aposta diferente sobre quanto do pipeline deve ser fixado em código.

• hoangduong92/idea-to-film-skill — criado em 30 de setembro de 2026, licenciado sob MIT, e a correspondência mais próxima da publicação de 2 de outubro: uma skill do Claude Code que leva uma ideia até um MP4 de curta-metragem narrada com animação desenhada por código, música, efeitos sonoros, uma voz Gemini TTS e legendas. A voz é indicada na descrição, que é a forma honesta de lançar isto: o segundo fornecedor é uma dependência declarada, não uma dependência oculta.

• samuelstroschein/opus-video-generator — criado em 2 de outubro, licenciado sob MIT, e o mais opinativo quanto a credenciais: ele gera vídeos de lançamento no seu navegador com a sua própria assinatura do Claude, executado via npx. Essa é uma resposta diferente para o problema-chave acima — manter o direito existente da pessoa no circuito, em vez de cunhar uma nova chave de API para um agente.

• makevoid/motion-graphics-music-video-skill-noimage — criado em 2 de outubro, licenciado sob MIT, e aquele com uma disciplina que vale a pena copiar: ele declara na própria descrição que não usa modelo de imagem nem modelo de vídeo, produzindo motion graphics a partir de uma faixa musical e um prompt. Quando a única etapa generativa é código, a saída é reproduzível e cada licença de ativo da peça final é sua para avaliar.

RohanRatwani/explainer-video-op5.5criado em 2 de outubro, com licença MIT, com foco no explicador em 16:9 e Shorts em vez do resumo de fofocas, e nomeia explicitamente o problema de sincronização: cada animação sincronizada com a narração. Essa ordem importa, porque significa que o áudio é renderizado antes que os visuais sejam posicionados.

• zhuyansen/awesome-opus-5.5-video — criado em 27 de setembro, sem licença declarada e, de longe, o mais visível do grupo, com 67 estrelas, enquanto os outros estão na casa dos dígitos únicos ou em zero. É um índice, e não uma ferramenta, em inglês e chinês, e sua existência é um sinal útil sobre a forma do interesse: o que as pessoas querem primeiro é um catálogo do que os outros afirmam ter feito, e o ferramental vem depois.

Nenhuma dessas é uma dependência estável. Elas têm apenas alguns dias, são de um único autor, e seus termos de licença são a única coisa que separa você de um trecho de filmagem que você não pode usar. Mas a direção é o que importa: o prompt no tweet é o protótipo, e a habilidade no repositório é o que uma equipe realmente adotaria.

Duas versões linguísticas, uma história

O post de 2 de outubro é deliberadamente bilíngue — uma versão em inglês e uma em chinês do mesmo tópico. Isso é incomum para uma demo e revela algo real sobre este formato: a fofoca não se propaga por tradução. Os elementos que sustentam uma história em um mercado (quem disse o quê a quem, qual negação foi emitida, como a linha do tempo se apresenta) não são os elementos que a sustentam em outro, então a segunda versão é uma reescrita com um julgamento editorial diferente, não um passe de tradução. O que se transfere é o esqueleto: a mesma estrutura de história, a mesma stack de renderização, a mesma voz.

A consequência de custo é pequena e na direção certa. Com base na aritmética acima, adicionar o segundo idioma custa cerca de oito centavos de áudio adicional para uma matéria que o modelo já pesquisou uma vez. Quando a parte cara de um pipeline é o raciocínio e a parte barata é a saída, produzir uma segunda versão em outro idioma é quase de graça — o que é um argumento para tratar a localização como uma saída de primeira classe do fluxo de trabalho, em vez de um projeto separado.

Desidentificação é uma edição, não uma exclusão

O terceiro campo do briefing é o que deveria te fazer pisar no freio. 去敏 — dessensibilizar, uma versão desidentificada que remove uma pessoa nomeada — é oferecido como um parâmetro opcional, como se apagar um nome fosse um filtro que você liga. Não é. Um resumo de fofocas sobre um evento identificável, com o nome removido, geralmente ainda é sobre aquela pessoa: o leitor supõe o nome pelo contexto, e tudo, da manchete à miniatura, pode carregar o identificador. Tirar a string muda aquilo que o vídeo diz ser o seu assunto sem mudar de quem ele trata, e se o seu motivo para tirar o nome é jurídico ou de reputação, a string não é a parte que estava gerando a exposição.

Duas coisas decorrem para quem lança esse formato. Primeiro, o dever de atribuição de fontes não deixa de ser seu só porque o apresentador é sintético: um compilado gerado que se baseia na reportagem de outras pessoas herda a obrigação de dizer de onde veio a reportagem, e o briefing no post de 2 de outubro não contém nenhum espaço para fontes — essa é uma lacuna que o operador tem de preencher manualmente. Segundo, o artefato é legitimamente sintético, e o ouvinte não é informado disso a menos que você o informe. Um rótulo é uma linha de texto e é a diferença entre uma demonstração e um conteúdo que engana o espectador sobre o que ele está assistindo. Se você quer que os parâmetros carreguem esse peso, coloque a divulgação no briefing e trate-a como não opcional, do mesmo modo que o fornecedor da voz deveria ser nomeado, e não ocultado.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Executando-o em uma chave, e a única chave que ele ainda não cobre

Se você está construindo esse pipeline, o custo de integração não são as chamadas ao modelo — é a segunda credencial. O Claude Opus 5.5 já é roteável hoje como anthropic/claude-opus-5.5, ao preço de tabela da própria Anthropic de US$ 4 e US$ 20 por milhão de tokens, repassado com 0% de markup, de modo que uma mudança de preço do fornecedor chega à sua fatura no mesmo dia, e não na próxima revisão de contrato. Roteá-lo junto com o resto da sua stack por meio de um único endpoint compatível com OpenAI é o que elimina o segundo SDK, e o failover automático é o que permite testar um modelo mais novo ou menos comprovado em um render interno sem colocar o caminho de produção atrás dele.

A fronteira honesta é a voz. Os endpoints Gemini 3.8 Flash TTS e Flash-Lite TTS do Google não estão no nosso catálogo hoje — a API pública de modelos retorna um erro de não encontrado para google/gemini-3.8-flash-tts — então o fluxo de trabalho do post de 2 de outubro realmente precisa da própria chave do Google do autor, e isso é uma restrição real, não algo temporário que possamos simplesmente ignorar. O endpoint de TTS que nós de fato oferecemos é o mais antigo google/gemini-3.1-flash-tts-preview, a US$ 1,00 por milhão de tokens de texto de entrada e US$ 20,00 por milhão de tokens de áudio de saída: utilizável no mesmo formato de pipeline, com preço para a geração mais antiga e não o modelo no qual este fluxo de trabalho foi criado. Escolha seu caminho com conhecimento de causa — uma chave para o raciocinador e uma segunda para a voz, ou uma chave e o TTS mais antigo.

O que assistir

O que tornaria este formato entediante, no bom sentido, é uma modalidade de áudio no modelo produtor. Até que o Claude Opus 5.5 — ou o que quer que o substitua — consiga ouvir a faixa que encomendou e ajustá-la, a voz continua sendo uma etapa revisada manualmente, e esses pipelines permanecem com humanos no circuito por construção, e não por política. Fique de olho nos repositórios de skills nas próximas duas semanas, em vez das demos: os que sobreviverem serão os que declaram seus fornecedores, têm uma licença e permitem que você execute novamente o mesmo briefing e obtenha o mesmo vídeo. O prompt na publicação de 2 de outubro vai parecer a parte fácil, porque era.

Para um pipeline que já tem o próprio material e o próprio roteiro, faça a sua própria conta em vez de tomar uma emprestada de X: a 25 tokens por segundo, cada minuto de narração finalizada equivale a 1.500 tokens de áudio e a cerca de 1,35 centavo na tarifa atual do Flash TTS — um número que você pode conferir em uma tabela de tarifas antes de reservar um espaço de produção para um locutor sintético.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente