Een gegenereerde hero-titelkaart met de tekst ÉÉN BRIEFING, TWEE MODELLEN, ÉÉN VIDEO MET VOICE-OVER, opgesplitst in twee kolommen. De linkerkolom, met als kop Claude Opus 5.5, luidt: schrijft het script; uitgebracht op 22 september 2026; 4,00 dollar in en 20,00 dollar uit per miljoen tokens. De rechterkolom, met als kop Gemini 3.8 Flash TTS, luidt: leest het voor; algemeen beschikbaar op 22 september 2026; 9,00 dollar per miljoen audiotokens. Een regel in de voettekst luidt: een render van 5m51s is ongeveer 8.775 audiotokens, ruwweg 8 cent aan voice-over.
Guides & Insights

Claude Opus 5.5 en Gemini 3.8 Flash TTS produceerden een ingesproken nieuwsvideo: de briefing, de twee tariefkaarten en wat de stem kost

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee modellen, twee leveranciers, één afgewerkte video en een prompt die kort genoeg is om in een chatvenster te plakken. Op 2 oktober 2026 publiceerde de Chinese AI-auteur 宝玉 (X/@dotey) twee renders van dezelfde roddelrubriek — één in het Engels, één in het Chinees — en zei dat beide van begin tot eind waren gemaakt door Claude Opus 5.5, dat zijn eigen materiaal vond en zijn eigen voice-over schreef, met de stem geleverd door Gemini 3.8 Flash TTS met een API-sleutel die de auteur zelf aanleverde. Geen van beide modellen is nieuw: Anthropic bracht Claude Opus 5.5 uit op 22 september 2026, en in de release-opmerkingen van Google worden de tekst-naar-spraakmodellen van Gemini 3.8 op dezelfde dag gedateerd. Wat pas enkele dagen oud is, is de verpakking — de producer-brief zelf, en een reeks repositories die tussen 30 september en 3 oktober zijn aangemaakt en die die brief omzetten in een Claude Code-skill die je kunt installeren. Dit is een stuk over de workflow, niet over een lancering.

Wat de briefing eigenlijk specificeert

Het sjabloon is één zin met drie slots. Vertaald uit het oorspronkelijke Chinees naar het Engels luidt het als volgt: maak voor mij een roddelvideo over {topic} (aanvullend materiaal: {links/screenshots}, optioneel; geanonimiseerde versie: verwijder {person's name}, optioneel). Alles wat interessant is aan het format zit verborgen in die drie slots, want een opdracht die zo kort is, is alleen delegeerbaar als de ontvanger drie dingen kan doen zonder dat hem iets gezegd wordt: zijn eigen bronmateriaal vinden, bepalen wat het verhaal is, en een afgerond eindproduct inleveren in plaats van een plan.

Het onderwerp is een vrije-tekststring, dus het model doet redactionele selectie — wat als het verhaal telt, welke beats erin moeten, in welke volgorde ze komen. Dat is een andere taak dan samenvatten, en het is het deel van de pipeline waar de operator het minste controle over heeft. Het optionele aanvullende materiaal is het ontsnappingsluik: plak een link of een screenshot en het model werkt vanuit een vaste bron in plaats van te zoeken, wat het verschil is tussen een reproduceerbare render en een andere video telkens wanneer je het uitvoert. Het derde slot, desensibilisering, is het onderdeel waar we bij stil moeten staan, en we komen erop terug.

Lees de briefing als een specificatie, en die vertelt je wat er over de harness wordt verondersteld. Er wordt verondersteld dat het model de buitenwereld kan bereiken — de ontdekkingsstap wordt gedelegeerd, niet beschreven — en wat het model kan bereiken, is een eigenschap van de tools die de operator aankoppelt, niet van Claude Opus 5.5 zelf. Er wordt verondersteld dat er een beeld- of renderingstack is, omdat het opgeleverde artefact een video is en Claude Opus 5.5 geen video produceert. En er wordt een stem verondersteld.

De arbeidsverdeling is het verhaal

Die laatste aanname is het structurele feit van deze workflow. Onze eigen catalogusvermelding voor anthropic/claude-opus-5.5 vermeldt tekst, afbeelding en bestand als invoermodaliteiten, en tekst als uitvoermodaliteit — één modaliteit aan de uitvoerkant. Het model kan geen spraak synthetiseren en het kan een track niet horen zodra die bestaat. Elke op deze manier gemaakte video met voice-over heeft daarom minstens twee modelafhankelijkheden, met twee tariefkaarten, twee leveranciers en twee inloggegevens, en de tweede moet door een mens worden aangeleverd. Opus 5.5 kan het script schrijven en de render aansluiten; het kan geen Google-account openen of een sleutel aanmaken. De auteur van het bericht van 2 oktober zegt precies dat: de Gemini-sleutel was van hem.

De beperking heeft een tweede kant die gemakkelijk te missen is tot je uitbrengt. Omdat Claude Opus 5.5 geen audio als invoer accepteert, kan het model dat de voice-over heeft geschreven de voice-over niet controleren. Verkeerd uitgesproken namen, vreemde klemtoon, een zin die de synthesizer vlak weergeeft — niets daarvan bereikt het model dat het heeft geschreven. Kwaliteitscontrole op de stem is elke keer een mens die naar de output luistert, en dat is de stap die voorkomt dat dit een volledig onbeheerde pijplijn wordt, hoe goed het script ook is. Waar de output van het model zelf een programma is, is de beoordeling een luisterbeurt, niet een diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Wat de stem kost — en dat is niet het dure deel.

De prijzenpagina van Google publiceert de conversie die deze berekening overzichtelijk maakt: audiotokens komen overeen met 25 tokens per seconde output. De twee renders in het bericht van 2 oktober duren 351 seconden en 332 seconden, afgelezen uit de eigen mediametadata van de tweet — ongeveer vijf minuten en eenenvijftig seconden en vijf minuten en tweeëndertig seconden. Bij 25 tokens per seconde zijn dat 8.775 en 8.300 audiotokens, en tegen het huidige Flash TTS-audiotarief van $9,00 per miljoen tokens is dat ongeveer acht cent aan voice-over per video en ongeveer vijftien cent voor beide taalversies samen.

Zet dat naast de redeneerkant van dezelfde taak. Het lijsttarief van Claude Opus 5.5 is $4 per miljoen invoertokens en $20 per miljoen uitvoertokens, waarbij denktokens als uitvoer worden gefactureerd en cache-leesbewerkingen $0,20 per miljoen kosten. De voice-over van een video van zes minuten is een afrondingsfout vergeleken met de tokens die het model besteedt aan het bepalen wat het verhaal is, het lezen van bronnen en het schrijven van het script dat de stem voorleest. De praktische conclusie is niet "TTS is goedkoop" — het is dat in deze pipeline de stem de enige kostenpost is die je niet hoeft te optimaliseren, en de inspanning hoort bij het deel dat dollars kost.

Twee details van de tariefkaart zullen die berekening veranderen, dus houd daar nu al rekening mee:

• Het promotievenster sluit — Flash TTS standard kost $0,50 per miljoen teksttokens in en $9,00 per miljoen audiotokens uit tot en met 31 december 2026, daarna $1,00 en $18,00. De voice-over van dezelfde video kost in januari ongeveer zestien cent, precies het dubbele.

• Er is een goedkopere laag met een echte afweging — Gemini 3.8 Flash-Lite TTS rekent $0,50 en $6,00 volgens hetzelfde schema, oplopend naar $1,00 en $12,00, en dekt 101 talen tegenover de 130 van Flash TTS. Voor een uitlegvideo met één verteller in het Engels is Lite tweederde van het audiotarief en is het taalplafond irrelevant; voor de tweetalige render in het bericht van 2 oktober is dat niet zonder meer irrelevant, en dat is de beslissing die de opsplitsing in niveaus je vraagt te nemen.

Google's Batch- en Flex-tier kost $0,25 voor input en $4,50 voor output, en Priority kost $0,90 en $16,20 — handig om te weten als je renders in de wachtrij staan in plaats van interactief, want niets aan een roddeloverzicht vraagt om een antwoord in realtime.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Deze week veranderde de briefing in een vaardigheid

Een prompt in een tweet is een demonstratie; een repository is iets dat je kunt installeren. De repositories die rond dit formaat zijn verschenen, vormen het deel dat echt binnen de laatste zeven dagen valt, en ze zijn het waard om afzonderlijk te lezen in plaats van als een geheel, omdat elk ervan een andere gok waagt over hoeveel van de pipeline in code vastgelegd zou moeten worden.

• hoangduong92/idea-to-film-skill — gemaakt op 30 september 2026, MIT-gelicenseerd, en de beste match met de post van 2 oktober: een Claude Code-skill die een idee omzet in een MP4 van een ingesproken korte film met codegetekende animatie, muziek, geluidseffecten, een Gemini TTS-stem en ondertitels. De stem wordt in de beschrijving genoemd, en dat is de eerlijke manier om dit te leveren: de tweede leverancier is een aangegeven afhankelijkheid, niet een verborgen een.

• samuelstroschein/opus-video-generator — gemaakt op 2 oktober, MIT-gelicentieerd, en het meest uitgesproken over inloggegevens: het maakt launchvideo's in je browser op je eigen Claude-abonnement, uitgevoerd via npx. Dat is een ander antwoord op het kernprobleem hierboven — houd de bestaande rechten van de mens in het proces in plaats van een nieuwe API-sleutel voor een agent aan te maken.

• makevoid/motion-graphics-music-video-skill-noimage — gemaakt op 2 oktober, MIT-gelicentieerd, en degene met een discipline die het kopiëren waard is: in de eigen beschrijving staat dat het geen beeldmodel en geen videomodel gebruikt en motion graphics produceert op basis van een muziektrack en een prompt. Wanneer de enige generatieve stap code is, is de output reproduceerbaar en is elke assetlicentie in het eindproduct iets waar jij over kunt redeneren.

•Ratra.../explainer-video-opus5.5 — gemaakt op 2 oktober, MIT-gelicenseerd, gericht op de 16:9- en Shorts-uitlegvideo in plaats van het roddeloverzicht, en het benoemt het timingprobleem expliciet: elke animatie is getimed op de voice-over. Die volgorde is van belang, want het betekent dat de audio wordt gerenderd voordat de beelden worden geplaatst.

• zhansen/awesome-opus-5.5-video — aangemaakt op 27 september, geen licentie aangegeven, en verreweg het meest zichtbaar van de groep met 67 sterren, terwijl de andere in de enkele cijfers zitten of op nul staan. Het is eerder een index dan een tool, in het Engels en Chinees, en het bestaan ervan is een nuttig signaal over de vorm van de interesse: wat mensen als eerste willen, is een catalogus van wat anderen beweren te hebben gemaakt, en de tooling volgt.

Geen van deze is een stabiele afhankelijkheid. Ze zijn een paar dagen oud, ze zijn door één auteur gemaakt, en hun licentievoorwaarden zijn het enige dat tussen jou en een stuk beeldmateriaal staat dat je niet kunt gebruiken. Maar het gaat om de richting: de prompt in de tweet is het prototype, en de skill in de repository is wat een team daadwerkelijk zou overnemen.

Twee taalversies, één verhaal

Het bericht van 2 oktober is bewust tweetalig: een Engelse weergave en een Chinese weergave van hetzelfde onderwerp. Dat is ongebruikelijk voor een demo, en het legt iets echts bloot over dit formaat, namelijk dat roddel niet via vertaling reist. De beats die een verhaal in de ene markt dragen (wie wat tegen wie zei, welke ontkenning werd afgegeven, hoe de tijdlijn eruitziet) zijn niet de beats die het in een andere markt dragen, dus de tweede versie is een herschrijving met een andere redactionele afweging, geen vertaalslag. Wat wel overkomt, is het skelet: dezelfde verhaalstructuur, dezelfde renderingstack, dezelfde stem.

De kostenconsequentie is klein in de juiste richting. Op basis van de bovenstaande berekening kost het toevoegen van de tweede taal ongeveer acht cent extra audio tegenover een verhaal dat het model al één keer heeft onderzocht. Wanneer het dure deel van een pijplijn het redeneren is en het goedkope deel de output, is het produceren van een tweede versie in een andere taal bijna gratis — wat een argument is om lokalisatie te behandelen als een volwaardige output van de workflow in plaats van als een apart project.

De-identificatie is een bewerking, geen verwijdering

De derde plek in de briefing is de plek waarbij je zou moeten stilstaan. 去敏 — desensibiliseren, een geanonimiseerde versie die een met naam genoemd persoon verwijdert — wordt aangeboden als een optionele parameter, alsof het verwijderen van een naam een filter is dat je aanzet. Dat is het niet. Een roddeloverzicht over een identificeerbare gebeurtenis waarin de naam is verwijderd, gaat meestal nog steeds over die persoon: de lezer vult de naam in vanuit de context, en alles van de kop tot de miniatuur kan de identificatie bevatten. Het verwijderen van de tekenreeks verandert waar de video zegt dat het over gaat, zonder te veranderen over wie het gaat, en als je reden om de naam te verwijderen een juridische of reputatiegerelateerde is, dan is de tekenreeks niet het onderdeel dat de blootstelling veroorzaakte.

Twee dingen volgen hieruit voor iedereen die dit formaat uitbrengt. Ten eerste gaat de plicht om bronnen te vermelden niet van je over omdat de presentator synthetisch is: een gegenereerde round-up die leest uit de verslaggeving van anderen, erft de verplichting om te zeggen waar die verslaggeving vandaan komt, en de briefing in het bericht van 2 oktober bevat helemaal geen plek voor bronvermelding — dat is een gat dat de operator met de hand moet opvullen. Ten tweede is het artefact terecht synthetisch, en een luisteraar krijgt dat niet te horen tenzij jij het hem vertelt. Een label is één regel tekst en het is het verschil tussen een demo en een stuk content dat een kijker misleidt over wat hij zit te kijken. Als je wilt dat de parameters dat gewicht dragen, zet de openbaarmaking dan in de briefing en behandel die als verplicht, zoals de leverancier van de stem genoemd hoort te worden in plaats van verborgen.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Het uitvoeren op één toets, en de enige toets die het nog niet dekt

Als je deze pipeline bouwt, zijn de integratiekosten niet de modelaanroepen — het is de tweede credential. Claude Opus 5.5 is vandaag routeerbaar als anthropic/claude-opus-5.5 tegen Anthropic's eigen listprijs van $4 en $20 per miljoen tokens, doorgegeven met 0% markup, zodat een prijswijziging van de leverancier je factuur dezelfde dag bereikt in plaats van bij de volgende contractbespreking. Het naast de rest van je stack routeren via één OpenAI-compatibel endpoint is wat de tweede SDK overbodig maakt, en automatische failover is wat je in staat stelt een nieuwer of minder bewezen model uit te proberen op een interne render zonder dat het productiepad ervan afhankelijk wordt.

De eerlijke grens is de stem. De Gemini 3.8 Flash TTS- en Flash-Lite TTS-endpoints van Google staan vandaag niet in onze catalogus — de publieke model-API geeft een not-found voor google/gemini-3.8-flash-tts — dus de workflow in het bericht van 2 oktober heeft echt de eigen Google-sleutel van de auteur nodig, en dat is een echte beperking, geen tijdelijke die we even kunnen wegwuiven. Het TTS-endpoint dat we wél aanbieden is de oudere google/gemini-3.1-flash-tts-preview, tegen $1,00 per miljoen teksttokens in en $20,00 per miljoen audiotokens uit: bruikbaar in dezelfde pipelinevorm, geprijsd voor de oudere generatie, en niet het model waarop deze workflow is gebouwd. Kies je pad bewust — één sleutel voor het redeneermodel en een tweede voor de stem, of één sleutel en de oudere TTS.

Wat te kijken

Wat dit formaat saai zou maken, in de goede zin, is een audiomodaliteit op het producerende model. Totdat Claude Opus 5.5 — of wat het ook vervangt — de track die het heeft laten maken kan horen en aanpassen, blijft de stem een handmatig beoordeelde stap, en blijven deze pipelines door hun constructie human-in-the-loop in plaats van door beleid. Houd de komende twee weken de skill-repositories in de gaten in plaats van de demo's: degenen die overleven, zijn degenen die hun leveranciers vermelden, een licentie hebben en waarmee je dezelfde briefing opnieuw kunt uitvoeren en dezelfde video krijgt. De prompt in het bericht van 2 oktober zal eruitzien als het gemakkelijke deel, omdat het dat ook was.

Voor een pipeline die al over zijn eigen materiaal en script beschikt, bereken je je eigen cijfer in plaats van er een van X te lenen: bij 25 tokens per seconde is elke minuut voltooide voice-over 1.500 audiotokens en ongeveer 1,35 cent tegen het huidige Flash TTS-tarief — een cijfer dat je kunt controleren aan de hand van een tariefkaart voordat je een productieslot toewijst aan een synthetische host.