Ett genererat hero-kort för 'Skapa och distribuera anpassat ljud' med underrubriken 'Gemini 3.8 Flash TTS' på en vit bakgrund med mjuka blå- och cyan-gradientaccenter. Tre numrerade kort visar '1 Designa en röst från en prompt', '2 Lagra den i ett år, eller håll en sjudagarsnyckel' och '3 Anropa /v1/audio/speech', ovanför en sidfotsrad som lyder 'Gemini API, 23 september 2026. Leverantörssiffror.' OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Skapa och driftsätt anpassat ljud med Gemini 3.8 Flash TTS: röstdesign, kloning och de två klockorna som avgör

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 3.8 Flash TTS och Gemini 3.8 Flash-Lite TTS låter dig båda skapa en röst utifrån en skriven beskrivning i stället för att välja en ur en lista, och båda blev allmänt tillgängliga på Gemini API den 23 september 2026. Huvudnyheten som folk upprepar är röstdesignen. Delen som är värd att planera kring är vad som händer med en designad röst efteråt, eftersom leverantören ger dig två sätt att behålla en och kopplar en olika livslängd till vart och ett. Väljer du fel går rösten som din produkt är beroende av ut inom en vecka.

Det är gapet i lanseringsbevakningen hittills. Tillkännagivandeinläggen förklarar att man kan prompta fram en röst, och några av dem nämner kloning från ett 30-sekundersprov. Ingen av dem går igenom lagringsmodellen, som är det som avgör om en röstpipeline kan reproduceras från en konfigurationsfil eller måste provisioneras om enligt ett schema. Den här artikeln täcker hela vägen – design, lagring, anrop och betalning – med priserna och kvoterna så som Google publicerar dem.

Vad släpptes den 23 september?

Två modeller, ett API-schema. Identifierarna är gemini-3.8-flash-tts och gemini-3.8-flash-lite-tts, och Googles dokumentation är tydlig med att båda använder "exakt samma API-schema och promptformat" – att byta mellan dem är en ändring av en parameter, inte en omskrivning.

• Indata – endast text. Båda modellerna tar emot text och returnerar ljud; de är inte multimodala och genererar inte text tillbaka.

• Utdata — WAV, 24 kHz mono 16-bitars PCM med tecken på den unära slutpunkten; PCM utan header (audio/l16) på strömningsslutpunkten; audio/mulaw och audio/alaw accepteras med en konfigurerbar samplingsfrekvens.

• Språk — 130 i Flash TTS, 101 i Flash-Lite TTS, automatiskt identifierade från texten i stället för deklarerade i begäran.

• Voices – 30 utvalda studioröster listade i dokumentationen (Kore och Puck bland dem), ett Extended Voice Library med "hundratals" fler som kan sökas via voices-slutpunkten, plus de två skapandevägarna nedan.

• Regi — radvis styrning av framförandet, scener med två talare iscensatta från ett enda manus, och icke-verbala signaler som <laughs>, <sigh> och |mhm| skrivna direkt i transkriptet.

De två nivåerna finns eftersom arbetsbelastningarna gick isär. Flash TTS positioneras för maximal akustisk återgivning och komplex gestaltning; Flash-Lite TTS beskrivs med Googles egna ord som "arbetshästen" som ersätter gemini-3.1-flash-tts-preview, inriktad på massdubbning, uppläsningsfunktioner och röstagentkaskader. Båda ersätter en enda förhandsvisningsmodell som hade funnits i API:et sedan april 2026, så om du använde förhandsvisningen är migreringen ett val av nivå snarare än en versionshöjning.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

Att designa en röst är en prompt, och det förändrar granskningssteget

Skapandeytan är det genuint nya i den här generationen. En promptadröst byggs upp från en beskrivning i naturligt språk – roll, accent, röstkaraktär – och returnerar en identifierare som du återanvänder. I API:et är detta ett anrop för röstskapande med store: true och en promptad indata; i Googles egna exempel sträcker sig beskrivningarna från en högenergisk Melbourne-DJ till en japansk drake. När rösten väl har skapats refereras den i en talförfrågan via sin identifierare, och stilinstruktionerna per förfrågan kan då vara minimala eller tomma, eftersom karaktären redan är inbakad i rösten.

Den praktiska konsekvensen är en förändring av arbetsflödet, inte bara en funktion. Röstcasting var tidigare en licensförhandling eller en studiobokning, vilket innebar att röstvalet skedde en gång, tidigt, och överlevde granskning eftersom det var dyrt att ändra det. När en röst är ett stycke text blir casting en design token – något som en produktchef kan begära att få omrullat på en tisdag. Team som lägger beskrivningssträngen i versionshantering och behandlar det genererade röst-ID:t som en byggartefakt får konsekvent utdata i alla miljöer. Team som skapar röster för hand i AI Studio får inte det, och felet kommer att se ut som en oförklarlig skillnad mellan staging- och produktionsljud.

De två klockorna

Det här är avsnittet som lanseringsinläggen hoppar över. Google låter dig behålla en designad eller replikerad röst i ett av två tillstånd, och de går ut i vilt olika takt.

• Lagrade röster – skapade med lagring aktiverad, de finns i ditt projekt och omfattas av en kvot på 200 röster per projekt med en livstid på ett år.

• Tillståndslösa nycklar – röstkloning kan returnera en klienthanterad nyckel (voicekey_…-formen) i stället för en lagrad identifierare, och den nyckeln har en livstid på sju dagar.

Lästa tillsammans utgör det paret en designinstruktion. En lagrad röst är ett åtagande på ett år och ett hårt tak på 200 per projekt, vilket är generöst för en produkt med en fast rollbesättning och oanvändbart för allt som genererar en ny röst per kund. Den tillståndslösa nyckeln är motsatsen: ingen kvotpress, men en nyckel som du måste återutfärda varje vecka, vilket innebär att din applikation behöver en väg för förnyelse och din infrastruktur behöver lagra autentiseringsuppgifter som roterar. Ingen av dem är fel. Att välja utan att lägga märke till vilken du valde är hur en röstagent tystnar på dag åtta.

Två ytterligare egenskaper följer med replikering och är värda att känna till innan du lovar något till ett juridiskt team. Att skapa en replikerad röst kräver en muntlig samtyckesinspelning från röstens ägare som måste matcha referenstalaren – en muntlig kontroll, inte en kryssruta. Och resultatet bär proveniens: varje klipp vattenmärks med SynthID, och replikerade röster bär dessutom C2PA Content Credentials. Designvägen är medvetet den svårare att missbruka, och båda barriärerna är strukturella snarare än policyuttalanden.

En avvikelse som är värd att flagga snarare än att lösa. Googles tabell över modeller som stöds listar röstdesign och röstreplikering som tillgängliga på båda 3.8 TTS-modellerna. Merparten av bevakningen av lanseringen beskriver replikering som en del av just Flash TTS-berättelsen. Om replikering spelar roll för ditt beslut mellan nivåerna bör du verifiera det mot dokumentationen för den nivå du avser att släppa i stället för att lita på någon av sammanfattningarna.

Vad en timmes ljud kostar

Google fakturerar tal i tokens, inte tecken eller sekunder, och omvandlingen är offentliggjord: ljud mäts med 25 tokens per sekund utdata, vilket är 90 000 tokens per timme. Det gör aritmetiken ovanligt enkel, och det är siffran att lägga i en budget snarare än priset per miljon.

• Flash TTS standard — $0.50 per miljon texttokens in, $9.00 per miljon ljudtokens ut till och med den 31 december 2026, därefter $1.00 och $18.00. Batch och Flex är $0.25 och $4.50; Priority är $0.90 och $16.20.

• Flash-Lite TTS standard — $0,50 och $6,00 fram till samma datum, därefter $1,00 och $12,00. Batch och Flex $0,25 och $3,00; Priority $0,90 och $10,80.

• I sekunder — Flash TTS landar på ungefär $0,81 per timme genererat ljud under kampanjperioden och cirka $1,62 efteråt; Flash-Lite TTS ligger på ungefär $0,54 och sedan $1,08.

• Jämfört med modellen som den ersätter – gemini-3.1-flash-tts-preview är prissatt till 1,00 $ och 20,00 $ per miljon, så ljudutmatningsposten sjönk med 55 procent för Flash TTS och 70 procent för Flash-Lite TTS.

Planera inte utifrån kampanjsiffran. Google publicerar båda kolumnerna i samma tabell, vilket innebär att januaritaxan inte är ett rykte som upptäcks senare – den står på kortet i dag, och varje uppskattning per tusen minuter som utgår från $0.81 måste klara att fördubblas.

Ett oberoende tal, och flera som inte är det

Googles tillkännagivande inleds med benchmarkresultat, och de bör läsas för precis vad de är. Företaget säger att Flash TTS tog förstaplatsen i Hume AI:s Voice Design Benchmark med 71,4, ledde accentmodellering med 60,8, och att Flash TTS och Flash-Lite TTS rankades som etta och tvåa på Hume AI:s Overall Quality Index, med starka placeringar i blindpreferens på Voice Arena för japanska, brasiliansk portugisiska, vietnamesiska, modern standardarabiska, mexikansk spanska och hindi. Allt leverantörsrapporterat, inga av körningarna är offentliga.

Det finns en detalj i den listan som är värd att lägga märke till. Alan Cowen, som anges som en av författarna till Googles tillkännagivande, är grundare av Hume AI – labbet vars Voice Design Benchmark levererar siffran i rubriken. Det gör inte siffran fel, och Humes benchmark är en riktig sådan, men de två är inte oberoende av varandra, och en läsare som väger in 71,4 bör känna till det innan hen upprepar det som validering från tredje part.

Den oberoende insamlade siffran finns på Artificial Analysis Provider Voice Arena, hämtad för den här artikeln den 24 september 2026: Gemini 3.8 Flash TTS ligger tvåa med ett Elo på 1 260 och ett intervall på 17 punkter över 1 999 prov, efter Cartesia Sonic 3.6 på 1 273. Gemini 3.8 Flash-Lite TTS ligger sexa på 1 235. Modellen som ersätts, Gemini 3.1 Flash TTS, ligger tia på 1 199 över 3 430 prov. Preferens bland blinda lyssnare, inte ett labbs egen utvärdering – och det enda kvalitetstalet här som Google inte har beställt.

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

Var man kan köra det, och var det ännu inte går

Båda modellerna är tillgängliga idag i Gemini API och Google AI Studio, utan väntelista. Konsument- och företagsytorna är aviserade snarare än lanserade: Flash TTS kommer till Gemini Notebook och Flash-Lite TTS till Google Vids, åtkomst till Gemini Enterprise beskrivs som kommande, och röstremixning – att justera klang, tonhöjd, tempo och accent hos en befintlig röst – listas som en framtida funktion snarare än en nuvarande. Om din plan bygger på remixning existerar den inte ännu.

För vår egen del, ärlighet först: Gemini 3.8 TTS-slutpunkterna finns inte i OrcaRouters routingtabell. Generationen de ersätter är – google/gemini-3.1-flash-tts-preview finns i katalogen till samma $1.00 och $20.00 per miljon tokens som Google publicerar, eftersom leverantörens listpris förs vidare utan påslag, och den svarar på samma /v1/audio/speech slutpunkt som ditt OpenAI-kompatibla SDK redan är inriktat på. Det spelar större roll än det låter för en taluppgift, eftersom det du faktiskt köper är en stabil slutpunkt som din applikation kan anropa medan modellerna bakom den ändras. Din kod har en modellsträng; katalogen har routningen. När Googles kampanjfönster stängs den 31 december och Flash TTS fördubblas, ändras priset för en routad modell samma dag i stället för vid nästa avtalsförnyelse – och en modell som går ner växlar över i stället för att ta din uppläsningskö med sig.

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

Om du utvärderar den här genereringen innan du fattar beslut är det billiga experimentet ett i två nivåer. Kör samma manus genom Flash TTS och Flash-Lite TTS, eftersom schemat är identiskt och skillnaden är en parameter – bestäm sedan med ditt eget ljud i stället för med ett benchmarkdiagram, och kontrollera på Artificial Analysis om kvalitetsgapet överlever sina felstaplar innan du betalar premien. För ett stort uppläsningsprojekt är premien riktiga pengar; för en supportbot som läser upp ett telefonnummer är det inte uppenbart att den ger dig något som en lyssnare kan höra.