Ett genererat hero-titelkort med texten EN BRIEF, TVÅ MODELLER, EN VIDEO MED BERÄTTARRÖST, uppdelat i två kolumner. Den vänstra kolumnen, med rubriken Claude Opus 5.5, lyder: skriver manuset; släppt 22 september 2026; 4,00 dollar in och 20,00 dollar ut per miljon tokens. Den högra kolumnen, med rubriken Gemini 3.8 Flash TTS, lyder: läser upp det högt; allmänt tillgänglig 22 september 2026; 9,00 dollar per miljon ljudtokens. En sidfotsrad lyder: en rendering på 5 min 51 s är cirka 8 775 ljudtokens, ungefär 8 cent för berättarrösten.
Guides & Insights

Claude Opus 5.5 och Gemini 3.8 Flash TTS producerade en nyhetsvideo med berättarröst: Briefen, de två prislistorna och vad rösten kostar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två modeller, två leverantörer, en färdig video och en prompt kort nog att klistra in i en chattruta. Den 2 oktober 2026 publicerade den kinesiskspråkiga AI-skribenten 宝玉 (X/@dotey) två renderingar av samma skvallersammanställning – en på engelska, en på kinesiska – och sade att båda byggdes från början till slut av Claude Opus 5.5, som hittade sitt eget material och skrev sin egen berättartext, med rösten levererad av Gemini 3.8 Flash TTS med hjälp av en API-nyckel som författaren tillhandahöll. Ingen av modellerna är ny: Anthropic släppte Claude Opus 5.5 den 22 september 2026, och Googles versionsinformation daterar Gemini 3.8 text-to-speech-modellerna till samma dag. Det som är några dagar gammalt är paketeringen – själva producentbriefen, och en serie repositorier skapade mellan 30 september och 3 oktober som omvandlar den briefen till en Claude Code-färdighet du kan installera. Det här är en artikel om arbetsflödet, inte om en lansering.

Vad briefen faktiskt specificerar

Mallen är en enda mening med tre luckor. Översatt till engelska från den ursprungliga kinesiskan lyder den: gör en skvallervideo åt mig om {topic} (kompletterande material: {links/screenshots, valfritt}; avidentifierad version: ta bort {person's name}, valfritt). Allt intressant med formatet är dolt i de tre luckorna, eftersom en så kort brief bara går att delegera om mottagaren kan göra tre saker utan att bli tillsagd: hitta sitt eget källmaterial, avgöra vad historien är och lämna tillbaka en färdig artefakt i stället för en plan.

Ämnet är en fritextsträng, så modellen gör ett redaktionellt urval – vad som räknas som berättelsen, vilka nedslag som ska ingå, i vilken ordning de kommer. Det är en annan uppgift än sammanfattning, och det är den del av pipelinen som operatören har minst kontroll över. Det valfria kompletterande materialet är nödutgången: klistra in en länk eller en skärmbild och modellen arbetar utifrån en fast källa i stället för att söka, vilket är skillnaden mellan en reproducerbar rendering och en annan video varje gång du kör den. Den tredje platsen, 去敏, är den som är värd att uppehålla sig vid, och vi återkommer till den.

Läs briefen som en specifikation och den berättar vad den förutsätter om harnessen. Den förutsätter att modellen kan nå omvärlden — upptäcktssteget delegeras, inte beskrivs — och vad modellen kan nå är en egenskap hos de verktyg som operatören monterar, inte hos Claude Opus 5.5 själv. Den förutsätter en bild- eller renderingsstack, eftersom den levererade artefakten är en video och Claude Opus 5.5 inte avger video. Och den förutsätter en röst.

Arbetsdelningen är berättelsen

Det sista antagandet är det strukturella faktumet i det här arbetsflödet. Vår egen katalogpost för anthropic/claude-opus-5.5 listar dess indatamodaliteter som text, bild och fil, och dess utdatamodalitet som text – en modalitet ut. Modellen kan inte syntetisera tal, och den kan inte höra ett spår när det väl finns. Varje berättarröstvideo som byggs på detta sätt har därför minst två modellberoenden med två priskort, två leverantörer och två autentiseringsuppgifter, och den andra måste tillhandahållas av en människa. Opus 5.5 kan skriva manuset och koppla upp renderingen; den kan inte öppna ett Google-konto eller etablera en nyckel. Författaren till inlägget den 2 oktober säger exakt det: Gemini-nyckeln var hans.

Begränsningen har en andra kant som är lätt att missa tills man väl har släppt det. Eftersom Claude Opus 5.5 inte tar emot något ljud kan modellen som skrev berättarrösten inte kontrollera berättarrösten. Feluttalade namn, märklig betoning, en mening som syntetiseraren återger platt — inget av det når modellen som författade det. Kvalitetskontrollen av rösten är en människa som lyssnar på resultatet, varje gång, och det är steget som hindrar detta från att bli en helt obemannad pipeline hur bra manuset än är. När modellens egen utdata är ett program är granskningen en lyssning, inte en diff.

A screenshot of Google's Gemini API documentation for the Gemini 3.8 Flash TTS model, captured in English on 3 October 2026, showing the model identifier gemini-3.8-flash-tts, the studio-grade voice fidelity and long-form multi-turn stability description, voice design and voice replication support, and a supported-languages count of over 130 languages.

Vad rösten kostar — och det är inte den dyra delen

Googles prissättningssida publicerar den omvandling som gör den här aritmetiken enkel: ljudtoken motsvarar 25 token per sekund utdata. De två renderingarna i inlägget från 2 oktober är 351 sekunder och 332 sekunder långa, avlästa från tweetens egen mediametadata – ungefär fem minuter och femtioen sekunder respektive fem minuter och trettiotvå sekunder. Med 25 token per sekund blir det 8 775 och 8 300 ljudtoken, och med den aktuella ljudprisnivån för Flash TTS på 9,00 USD per miljon token är det ungefär åtta cent berättarröst per video och ungefär femton cent för båda språkversionerna tillsammans.

Ställ det bredvid resonemangssidan av samma jobb. Listpriset för Claude Opus 5.5 är 4 dollar per miljon indatatoken och 20 dollar per miljon utdatatoken, med tänktoken fakturerade som utdata, och cacheläsningar på 0,20 dollar per miljon. Berättarrösten till en sexminutersvideo är ett avrundningsfel jämfört med de token modellen gör av med för att avgöra vad historien är, läsa källor och skriva manuset som rösten läser. Den praktiska slutsatsen är inte att "TTS är billigt" – den är att rösten i den här pipelinen är den enda posten du inte behöver optimera, och att ansträngningen hör hemma på den del som kostar dollar.

Två detaljer i prislistan kommer att ändra den kalkylen, så ta höjd för dem redan nu:

• Kampanjperioden stänger – Flash TTS standard är 0,50 dollar per miljon inmatade texttokens och 9,00 dollar per miljon utmatade ljudtokens till och med den 31 december 2026, därefter 1,00 och 18,00 dollar. Berättarrösten till samma video kostar omkring sexton cent i januari, exakt det dubbla.

• Det finns en billigare nivå med en verklig avvägning – Gemini 3.8 Flash-Lite TTS debiterar $0.50 och $6.00 enligt samma schema, och stiger till $1.00 och $12.00, med stöd för 101 språk jämfört med Flash TTS 130. För en förklarande video med en enda berättarröst på engelska är Lite två tredjedelar av ljudtaxan och språktaket är irrelevant; för den tvåspråkiga renderingen i inlägget den 2 oktober är det inte uppenbart irrelevant, vilket är beslutet som nivåuppdelningen ber dig fatta.

Googles Batch- och Flex-nivå kostar $0,25 in och $4,50 ut, och Priority kostar $0,90 och $16,20 — värt att veta om dina renderingar köas i stället för att vara interaktiva, för inget med en skvallersammanställning kräver svaret i realtid.

A two-column rate-card panel titled The voice versus the reasoner. The left column, Gemini 3.8 Flash TTS, reads: text input 0.50 dollars per million through 31 December 2026 then 1.00; audio output 9.00 dollars per million through 31 December 2026 then 18.00; metering 25 audio tokens per second of speech; six-minute narration about 8 cents today, about 16 cents from 1 January 2027. The right column, Claude Opus 5.5, reads: input 4.00 dollars per million; output 20.00 dollars per million with thinking billed as output; cache reads 0.20 dollars per million; output modality text only, so it cannot hear the track it commissioned. A footer line reads: Google and Anthropic published rates, read 3 October 2026, vendor-reported.

Den här veckan blev briefen en färdighet

En prompt i en tweet är en demonstration; ett repository är något man kan installera. Repositorierna som dök upp kring detta format är den del som verkligen ligger inom de senaste sju dagarna, och de är värda att läsas var för sig snarare än som en uppsättning, eftersom var och en gör en annan satsning på hur mycket av pipelinen som bör fixeras i kod.

• hoangduong92/idea-to-film-skill — skapad den 30 september 2026, MIT-licensierad, och den närmaste matchningen till inlägget den 2 oktober: en Claude Code-skill som tar en idé till en kortfilm i MP4 med berättarröst, kodritad animering, musik, ljudeffekter, en Gemini TTS-röst och undertexter. Rösten namnges i beskrivningen, vilket är det ärliga sättet att leverera detta: den andra leverantören är ett deklarerat beroende, inte ett dolt.

• samuelstroschein/opus-video-generator — skapad den 2 oktober, MIT-licensierad och den som har starkast åsikter om autentiseringsuppgifter: den skapar lanseringsvideor i din webbläsare på din egen Claude-prenumeration, körd via npx. Det är ett annat svar på det centrala problemet ovan — håll människans befintliga behörighet kvar i loopen i stället för att generera en ny API-nyckel åt en agent.

• makevoid/motion-graphics-music-video-skill-noimage — skapad 2 oktober, MIT-licensierad, och den som har en disciplin värd att kopiera: i sin egen beskrivning anger den att den inte använder någon bildmodell och ingen videomodell, utan producerar rörelsegrafik från ett musikspår och en prompt. När det enda generativa steget är kod blir resultatet reproducerbart, och licensen för varje tillgång i det färdiga verket är något du själv kan bedöma.

• RohanRatwani/explainer-video-opus-5.5 — skapad 2 oktober, MIT-licensierad, med inriktning på 16:9- och Shorts-förklararen snarare än skvallersammanfattningen, och den pekar ut tajmningsproblemet explicit: varje animation tajmad efter berättarrösten. Den ordningen spelar roll, eftersom den innebär att ljudet renderas innan bilderna placeras.

• zhuyansen/awesome-opus-5.5-video — skapad den 27 september, ingen licens angiven, och med god marginal den mest synliga i gruppen med 67 stjärnor, medan de andra ligger på ensiffriga antal eller noll. Det är ett index snarare än ett verktyg, på engelska och kinesiska, och dess existens är en användbar signal om hur intresset ser ut: det folk först vill ha är en katalog över vad andra påstår sig ha skapat, och verktygen följer efter.

Ingen av dessa är ett stabilt beroende. De är bara några dagar gamla, de har en enda upphovsperson, och deras licensvillkor är det enda som står mellan dig och ett filmklipp som du inte kan använda. Men riktningen är poängen: prompten i tweeten är prototypen, och färdigheten i repositoryt är vad ett team faktiskt skulle använda.

Två språkversioner, en berättelse

Inlägget den 2 oktober är medvetet tvåspråkigt – en engelsk återgivning och en kinesisk av samma ämne. Det är ovanligt för en demo och det blottar något verkligt om det här formatet, nämligen att skvaller inte färdas genom översättning. De nedslag som bär en historia på en marknad (vem som sade vad till vem, vilket dementi som utfärdades, hur tidslinjen ser ut) är inte de nedslag som bär den på en annan, så den andra versionen är en omskrivning med en annan redaktionell bedömning, inte en översättningsomgång. Det som överförs är skelettet: samma berättelsestruktur, samma renderingsstack, samma röst.

Kostnadskonsekvensen är liten i rätt riktning. Enligt beräkningen ovan kostar det att lägga till det andra språket ungefär åtta cent i extra ljud för en berättelse som modellen redan har undersökt en gång. När den dyra delen av en pipeline är resonemanget och den billiga delen är utdata, är det nästan gratis att producera en andra version på ett annat språk — vilket är ett argument för att behandla lokalisering som en förstklassig utdata från arbetsflödet snarare än ett separat projekt.

Avidentifiering är en redigering, inte en radering.

Den tredje posten i briefen är den som bör få dig att sakta ner. 去敏 – desensibilisering, en avidentifierad version som tar bort en namngiven person – erbjuds som en valfri parameter, som om borttagandet av ett namn vore ett filter man slår på. Det är det inte. En skvallersammanställning om en identifierbar händelse, med namnet borttaget, handlar oftast fortfarande om den personen: läsaren fyller i namnet utifrån kontexten, och allt från rubriken till miniatyrbilden kan bära identifieraren. Att ta bort strängen ändrar vad videon säger att den handlar om utan att ändra vem den handlar om, och om ditt skäl att ta bort namnet är juridiskt eller reputationsmässigt, är strängen inte den del som skapade exponeringen.

Två saker följer för alla som lanserar det här formatet. För det första förs inte skyldigheten att ange källor över från dig bara för att presentatören är syntetisk: en genererad sammanställning som bygger på andras rapportering ärver skyldigheten att berätta var rapporteringen kommer ifrån, och briefen i inlägget från 2 oktober innehåller inte ens en plats för källhänvisning – det är en lucka som operatören måste fylla i manuellt. För det andra är artefakten legitimt syntetisk, och en lyssnare får inte veta det om du inte berättar det. En etikett är en rad text, och den avgör skillnaden mellan en demo och ett innehåll som vilseleder en tittare om vad hen tittar på. Om du vill att parametrarna ska bära den vikten, skriv in upplysningen i briefen och behandla den som obligatorisk, på samma sätt som röstens leverantör bör namnges i stället för att döljas.

The OrcaRouter model page for anthropic/claude-opus-5.5, captured in English on 3 October 2026, showing a 1,000,000-token context window, 128,000-token maximum output, text, image and file input with text output, a release date of 22 September 2026, capability chips for vision, tools, JSON and reasoning, and pricing of 4.00 dollars per million input tokens and 20.00 dollars per million output tokens.

Kör den på en nyckel, och den enda nyckeln den ännu inte täcker

Om du bygger den här pipelinen är integrationskostnaden inte modellanropen – det är den andra autentiseringsuppgiften. Claude Opus 5.5 går att routa redan idag som anthropic/claude-opus-5.5 till Anthropics eget listpris på $4 och $20 per miljon tokens, vidarefakturerat med 0 % påslag, så en prisändring från leverantören når din faktura samma dag i stället för vid nästa avtalsgenomgång. Att routa den tillsammans med resten av din stack via en enda OpenAI-kompatibel endpoint är det som tar bort den andra SDK:n, och automatisk redundansväxling är det som låter dig testa en nyare eller mindre beprövad modell på en intern rendering utan att lägga produktionsvägen bakom den.

Den ärliga gränsen är rösten. Googles Gemini 3.8 Flash TTS- och Flash-Lite TTS-endpoints finns inte i vår katalog i dag – det publika modell-API:et returnerar not-found för google/gemini-3.8-flash-tts – så arbetsflödet i inlägget den 2 oktober kräver verkligen författarens egen Google-nyckel, och det är en verklig begränsning snarare än en tillfällig sådan som vi kan vifta bort. Den TTS-endpoint vi faktiskt har är den äldre google/gemini-3.1-flash-tts-preview, till $1.00 per miljon texttokens in och $20.00 per miljon ljudtokens ut: användbar i samma pipeline-form, prissatt för den äldre generationen, och inte modellen som det här arbetsflödet byggdes på. Välj din väg medvetet – en nyckel för resoneraren och en andra för rösten, eller en nyckel och den äldre TTS:en.

Vad du ska titta på

Det som skulle göra det här formatet tråkigt, i positiv bemärkelse, är en ljudmodalitet på den producerande modellen. Tills Claude Opus 5.5 – eller vad som än ersätter den – kan höra spåret den beställt och justera det, förblir rösten ett manuellt granskat steg, och dessa pipelines förblir human-in-the-loop av konstruktion snarare än av policy. Håll koll på skill-repositorierna under de kommande två veckorna i stället för på demosarna: de som överlever kommer att vara de som deklarerar sina leverantörer, har en licens och låter dig köra om samma brief och få samma video. Prompten i inlägget den 2 oktober kommer att framstå som den lätta delen, för det var den.

För en pipeline som redan har sitt eget material och manus, räkna fram din egen siffra i stället för att låna en från X: vid 25 tokens per sekund är varje minut färdig berättarröst 1 500 ljudtokens och cirka 1,35 cent enligt dagens Flash TTS-pris – en siffra du kan stämma av mot ett prisblad innan du bokar en produktionsplats åt en syntetisk programledare.