
Claude Opus 5.5 et Gemini 3.8 Flash TTS ont produit une vidéo d’actualités narrée : Le Brief, les deux grilles tarifaires, et ce que coûte la voix
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 217 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 111 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 43 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Deux modèles, deux fournisseurs, une vidéo finalisée, et une invite assez courte pour être collée dans une fenêtre de chat. Le 2 octobre 2026, l'écrivain IA sinophone 宝玉 (X/@dotey) a publié deux rendus du même récapitulatif de potins — un en anglais, un en chinois — et a déclaré que les deux avaient été produits de bout en bout par Claude Opus 5.5, qui a trouvé son propre matériel et écrit sa propre narration, la voix étant fournie par Gemini 3.8 Flash TTS à l'aide d'une clé API fournie par l'auteur. Aucun des deux modèles n'est nouveau : Anthropic a publié Claude Opus 5.5 le 22 septembre 2026, et les notes de version de Google datent les modèles de synthèse vocale Gemini 3.8 du même jour. Ce qui n'a que quelques jours, c'est l'emballage — le brief de production lui-même, et une série de dépôts créés entre le 30 septembre et le 3 octobre qui transforment ce brief en une compétence Claude Code que vous pouvez installer. Il s'agit d'un article sur le flux de travail, pas sur un lancement.
Ce que le brief précise réellement
Le modèle est une phrase avec trois emplacements. Traduit en anglais depuis le chinois d'origine, il se lit : fais-moi une vidéo de potins sur {sujet} (matériel complémentaire : {liens/captures d'écran, facultatif} ; version anonymisée : supprimer {nom de la personne}, facultatif). Tout ce qui est intéressant dans ce format est caché dans ces trois emplacements, car un brief aussi court n'est délégable que si le destinataire peut faire trois choses sans qu'on le lui dise : trouver ses propres sources, décider quelle est l'histoire et rendre un artefact fini plutôt qu'un plan.
Le sujet est une chaîne de texte libre, donc le modèle effectue une sélection éditoriale — ce qui compte comme l'histoire, quelles séquences inclure, dans quel ordre elles s'enchaînent. C'est un travail différent du résumé, et c'est la partie du pipeline sur laquelle l'opérateur a le moins de contrôle. Le contenu supplémentaire facultatif est l'échappatoire : on colle un lien ou une capture d'écran et le modèle travaille à partir d'une source fixe au lieu de chercher, ce qui fait la différence entre un rendu reproductible et une vidéo différente à chaque exécution. Le troisième emplacement, 去敏, est celui sur lequel il vaut la peine de s'attarder, et nous y reviendrons.
Lisez le brief comme une spécification, et il vous dit ce qu’il présuppose au sujet du harnais. Il présuppose que le modèle peut atteindre le monde extérieur — l’étape de découverte est déléguée, pas décrite — et ce que le modèle peut atteindre est une propriété des outils que l’opérateur monte, pas de Claude Opus 5.5 lui-même. Il présuppose une pile d’images ou de rendu, parce que l’artefact livré est une vidéo et que Claude Opus 5.5 n’émet pas de vidéo. Et il présuppose une voix.
La division du travail est l'histoire
Cette dernière hypothèse est le fait structurel de ce flux de travail. Notre propre fiche catalogue pour anthropic/claude-opus-5.5 répertorie ses modalités d'entrée comme texte, image et fichier, et sa modalité de sortie comme texte — une seule modalité en sortie. Le modèle ne peut pas synthétiser de la parole, et il ne peut pas entendre une piste une fois qu'elle existe. Chaque vidéo narrée construite de cette manière a donc au moins deux dépendances de modèle, avec deux grilles tarifaires, deux fournisseurs et deux identifiants, et la seconde doit être fournie par un humain. Opus 5.5 peut écrire le script et câbler le rendu ; il ne peut pas ouvrir un compte Google ni provisionner une clé. L'auteur du post du 2 octobre dit exactement cela : la clé Gemini était la sienne.
La contrainte a un second tranchant, facile à négliger jusqu'à la livraison. Parce que Claude Opus 5.5 n'accepte pas d'audio en entrée, le modèle qui a écrit la narration ne peut pas vérifier la narration. Des noms mal prononcés, une emphase étrange, une phrase que le synthétiseur rend plate — rien de tout cela n'atteint le modèle qui l'a rédigée. Le contrôle qualité de la voix, c'est un humain qui écoute la sortie, à chaque fois, et c'est cette étape qui empêche le pipeline d'être entièrement sans intervention, quelle que soit la qualité du script. Là où la sortie du modèle est un programme, la relecture est une écoute, pas un diff.

Ce que coûte la voix — et ce n’est pas la partie coûteuse
La page de tarification de Google publie la conversion qui rend ce calcul limpide : les tokens audio correspondent à 25 tokens par seconde de sortie. Les deux rendus du post du 2 octobre durent 351 secondes et 332 secondes, d'après les métadonnées média du tweet lui-même — soit environ cinq minutes cinquante-et-une et cinq minutes trente-deux. À 25 tokens par seconde, cela fait 8 775 et 8 300 tokens audio, et au tarif actuel de l'audio Flash TTS de 9,00 $ par million de tokens, cela représente environ huit cents de narration par vidéo et environ quinze cents pour les deux versions linguistiques réunies.
Mettez cela en regard du volet raisonnement de la même tâche. Le tarif catalogue de Claude Opus 5.5 est de 4 $ par million de jetons d'entrée et de 20 $ par million de jetons de sortie, les jetons de réflexion étant facturés comme des jetons de sortie, et les lectures de cache à 0,20 $ par million. La narration d'une vidéo de six minutes représente une erreur d'arrondi face aux jetons que le modèle dépense pour décider quelle est l'histoire, lire des sources et écrire le script que lit la voix. La conclusion pratique n'est pas que « le TTS est bon marché » — c'est que, dans ce pipeline, la voix est le seul poste que vous n'avez pas à optimiser, et l'effort doit porter sur la partie qui coûte des dollars.
Deux détails de la grille tarifaire modifieront ce calcul, alors anticipez-les dès maintenant :
• La période promotionnelle se termine — Flash TTS standard coûte 0,50 $ par million de jetons de texte en entrée et 9,00 $ par million de jetons audio en sortie jusqu'au 31 décembre 2026, puis 1,00 $ et 18,00 $. La narration de la même vidéo coûte environ seize cents en janvier, soit exactement le double.
• Il existe un niveau moins cher avec un vrai compromis — Gemini 3.8 Flash-Lite TTS facture 0,50 $ et 6,00 $ sur le même barème, passant à 1,00 $ et 12,00 $, et couvre 101 langues contre 130 pour Flash TTS. Pour une vidéo explicative en anglais avec un seul narrateur, Lite représente deux tiers du tarif audio et le plafond de langues est sans importance ; pour le rendu bilingue de la publication du 2 octobre, il n’est pas évident qu’il soit sans importance, ce qui est la décision que la séparation des niveaux vous demande de prendre.
Le niveau Batch and Flex de Google est à 0,25 $ en entrée et 4,50 $ en sortie, et Priority est à 0,90 $ et 16,20 $ — bon à savoir si vos rendus sont mis en file d’attente plutôt qu’interactifs, car rien dans un récapitulatif de potins n’exige une réponse en temps réel.

Cette semaine, le brief est devenu une compétence
Un prompt dans un tweet est une démonstration ; un dépôt est une chose que l’on peut installer. Les dépôts apparus autour de ce format constituent la partie qui se situe véritablement dans les sept derniers jours, et ils méritent d’être lus séparément plutôt que comme un ensemble, car chacun fait un pari différent sur la part du pipeline qui doit être figée dans le code.
• hoangduong92/idea-to-film-skill — créé le 30 septembre 2026, sous licence MIT, et la correspondance la plus proche de la publication du 2 octobre : une compétence Claude Code qui transforme une idée en un court métrage MP4 narré, avec animation dessinée par le code, musique, effets sonores, une voix Gemini TTS et des sous-titres. La voix est nommée dans la description, ce qui est la façon honnête de livrer ceci : le deuxième fournisseur est une dépendance déclarée, pas cachée.
• samuelstroschein/opus-video-generator — créé le 2 octobre, sous licence MIT, et le plus tranché en matière d'identifiants : il crée des vidéos de lancement dans votre navigateur sur votre propre abonnement Claude, exécuté via npx. C'est une réponse différente au problème de clé évoqué plus haut — garder l'habilitation existante de l'humain dans la boucle au lieu de générer une nouvelle clé API pour un agent.
• makevoid/motion-graphics-music-video-skill-noimage — créé le 2 octobre, sous licence MIT, et celui dont la discipline mérite d'être copiée : il indique dans sa propre description qu'il n'utilise ni modèle d'image ni modèle vidéo, produisant des motion graphics à partir d'une piste musicale et d'un prompt. Lorsque la seule étape générative est du code, le résultat est reproductible et c'est à vous de raisonner sur chaque licence d'actif de l'œuvre finale.
• RohanRatwani/explainer-video-opus-5.5 — créé le 2 octobre, sous licence MIT, ciblant l'explication en 16:9 et en Shorts plutôt que le récapitulatif de potins, et il nomme explicitement le problème de synchronisation : chaque animation est calée sur la narration. Cet ordre est important, car il signifie que l'audio est rendu avant que les visuels ne soient placés.
• zhuyansen/awesome-opus-5.5-video — créé le 27 septembre, aucune licence déclarée, et de loin le plus visible du groupe avec 67 étoiles, les autres étant à un chiffre ou à zéro. Il s'agit d'un index plutôt que d'un outil, en anglais et en chinois, et son existence est un signal utile sur la forme de l'intérêt : ce que les gens veulent d'abord, c'est un catalogue de ce que d'autres prétendent avoir réalisé, et l'outillage suit.
Aucun de ces éléments n’est une dépendance stable. Ils datent de quelques jours, n’ont qu’un seul auteur, et leurs conditions de licence sont la seule chose qui vous empêche d’utiliser une séquence. Mais c’est la direction qui compte : le prompt du tweet est le prototype, et la compétence dans le dépôt est ce qu’une équipe adopterait réellement.
Deux versions linguistiques, une seule histoire
La publication du 2 octobre est délibérément bilingue — une version anglaise et une version chinoise du même sujet. C’est inhabituel pour une démo, et cela expose quelque chose de réel à propos de ce format : les potins ne se transmettent pas par la traduction. Les moments clés qui portent un récit sur un marché (qui a dit quoi à qui, quel démenti a été publié, à quoi ressemble la chronologie) ne sont pas ceux qui le portent sur un autre, de sorte que la seconde version est une réécriture avec un jugement éditorial différent, et non une passe de traduction. Ce qui se transfère, c’est le squelette : la même structure narrative, la même pile de rendu, la même voix.
La conséquence sur le coût est faible et va dans le bon sens. D’après le calcul ci-dessus, ajouter la deuxième langue coûte environ huit centimes d’audio supplémentaire pour une histoire sur laquelle le modèle a déjà effectué des recherches une fois. Lorsque la partie coûteuse d’un pipeline est le raisonnement et que la partie bon marché est la sortie, produire une deuxième version dans une autre langue est presque gratuit — ce qui plaide pour traiter la localisation comme une sortie à part entière du flux de travail plutôt que comme un projet distinct.
La dé-identification est une modification, pas une suppression.
Le troisième emplacement du brief est celui qui devrait vous ralentir. 去敏 — désensibiliser, une version dé-identifiée qui retire une personne nommée — est proposé comme paramètre facultatif, comme si supprimer un nom était un filtre que l'on active. Ce n'est pas le cas. Une compilation de potins sur un événement identifiable, une fois le nom retiré, porte généralement toujours sur cette personne : le lecteur reconstitue le nom à partir du contexte, et tout, du titre à la vignette, peut porter l'identifiant. Retirer la chaîne de caractères change ce que la vidéo dit avoir pour sujet sans changer de qui elle parle, et si votre raison de retirer le nom est d'ordre juridique ou réputationnel, ce n'est pas la chaîne qui créait l'exposition.
Deux choses en découlent pour quiconque diffuse ce format. Premièrement, l’obligation de sourçage ne se transfère pas à quelqu’un d’autre parce que le présentateur est synthétique : un récapitulatif généré qui reprend les reportages d’autrui hérite de l’obligation de dire d’où viennent ces reportages, et le brief de la publication du 2 octobre ne contient aucun emplacement de sourçage — c’est une lacune que l’opérateur doit combler à la main. Deuxièmement, l’artefact est légitimement synthétique et l’auditeur n’en est pas informé, sauf si vous le lui dites. Une étiquette tient en une ligne de texte et c’est la différence entre une démo et un contenu qui induit un spectateur en erreur sur ce qu’il regarde. Si vous voulez que les paramètres portent ce poids, mettez la divulgation dans le brief et traitez-la comme non facultative, de la même manière que le fournisseur de la voix devrait être nommé plutôt que caché.

L'exécuter sur une seule touche, et la seule touche qu'il ne couvre pas encore.
Si vous construisez ce pipeline, le coût d'intégration ne tient pas aux appels au modèle — il tient à la seconde clé d'authentification. Claude Opus 5.5 est routable dès aujourd'hui sous la forme anthropic/claude-opus-5.5, au prix catalogue d'Anthropic lui-même, soit 4 $ et 20 $ par million de tokens, répercuté avec 0 % de marge, de sorte qu'une évolution tarifaire d'un fournisseur se répercute sur votre facture le jour même, et non à la prochaine revue de contrat. L'acheminer aux côtés du reste de votre stack via un unique point de terminaison compatible OpenAI, voilà ce qui élimine le second SDK, et le basculement automatique est ce qui vous permet d'essayer un modèle plus récent ou moins éprouvé sur un rendu interne sans placer le chemin de production derrière lui.
La limite honnête, c'est la voix. Les points de terminaison Google Gemini 3.8 Flash TTS et Flash-Lite TTS ne figurent pas dans notre catalogue aujourd'hui — l'API publique des modèles renvoie une erreur « not found » pour google/gemini-3.8-flash-tts — donc le workflow de l'article du 2 octobre nécessite bel et bien la propre clé Google de l'auteur, et c'est une véritable contrainte, et non une contrainte temporaire que l'on peut balayer d'un revers de main. Le point de terminaison TTS que nous proposons, lui, est l'ancien google/gemini-3.1-flash-tts-preview, à 1,00 $ par million de tokens de texte en entrée et 20,00 $ par million de tokens audio en sortie : utilisable dans la même forme de pipeline, tarifé pour la génération précédente, et ce n'est pas le modèle sur lequel ce workflow a été construit. Choisissez votre voie en connaissance de cause — une clé pour le raisonneur et une seconde pour la voix, ou une clé et l'ancien TTS.
Que regarder
Ce qui rendrait ce format ennuyeux, au bon sens du terme, c'est une modalité audio sur le modèle de production. Tant que Claude Opus 5.5 — ou ce qui le remplacera — ne pourra pas entendre la piste qu'il a commandée et l'ajuster, la voix restera une étape révisée manuellement, et ces pipelines resteront human-in-the-loop par construction plutôt que par politique. Surveillez les dépôts de compétences ces deux prochaines semaines plutôt que les démos : ceux qui survivront seront ceux qui déclarent leurs fournisseurs, portent une licence et vous permettent de relancer le même brief pour obtenir la même vidéo. Le prompt de l'article du 2 octobre paraîtra la partie facile, parce que c'était le cas.
Pour un pipeline qui dispose déjà de son propre matériel et de son script, calculez votre propre chiffre plutôt que d'en emprunter un à X : à 25 tokens par seconde, chaque minute de narration finalisée représente 1 500 tokens audio et environ 1,35 cent au tarif Flash TTS actuel — un chiffre que vous pouvez vérifier par rapport à une grille tarifaire avant d'engager un créneau de production pour un hôte synthétique.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
