Googles snabba, kostnadseffektiva text-till-tal-modell för realtidsljudgenerering, tillgänglig via OrcaRouter.
google/gemini-3.1-flash-tts-preview är en text-till-tal-modell från Google, en del av Gemini Flash-familjen. Den tar emot textinmatning och genererar talat ljud som utdata. Modellen är optimerad för…
Den primära funktionen är att omvandla skriven text till naturligt klingande tal. Modellen är utformad för hastighet och utnyttjar Flash-arkitekturen för att minska latens. Den stöder flera språk och röster? Detta specifika förhandsvisnings språk- och röststöd är inte detaljerat i tillhandahållna fakta; du bör konsultera Googles dokumentation för aktuella röstalternativ. Modellen kan hantera varierande textinmatningar inklusive skiljetecken, siffror och förkortningar, och producerar talad utmatning som återspeglar den avsedda rytmen och tonen.
De bästa användningsområdena inkluderar alla applikationer där talsyntes med låg latens är avgörande: realtidsröstassistenter, direktöversatt dubbning, interaktiva chattrobotar med röstutmatning och automatiserade telefonsystem. Det utmärker sig även för batchbearbetning när du snabbt behöver generera många korta ljudklipp. Innehållsproducenter kan använda det för dynamiska berättarröster i videospel eller ljudböcker. Eftersom utmatningskostnaden är hög i förhållande till inmatningen är det mest ekonomiskt när utmatningsljudet är koncist.
Om ditt användningsfall innefattar extremt lång ljudgenerering (t.ex. timmar av tal) eller inte kräver låg latens, överväg en batcherad TTS-modell med lägre kostnad per token i utdata. För applikationer där indatavolymen dominerar (t.ex. många korta uppmaningar), gör den låga indatakostnaden denna Flash-modell attraktiv. För scenarier som kräver mycket hög utdatakvalitet – såsom känslomässigt uttrycksfulla karaktärer – kan du utvärdera premium TTS-modeller från Google eller andra leverantörer. Övervaka alltid total tokenvolym och latenskrav.
Som en Gemini Flash-modell är denna TTS-variant optimerad för låg latens. Specifika latensriktmärken (t.ex. tid till första ljudpaketet) anges inte i de tillgängliga fakta. I praktiken svarar Flash-modeller ofta inom hundratals millisekunder för korta indata. Latens kan variera beroende på utdatalängd, nätverksförhållanden och samtidig förfrågningsbelastning. OrcaRouters routing kan tillföra minimal overhead. För realtidsapplikationer, testa med dina förväntade ljudlängder under belastning.
Styrkor inkluderar låg ingångskostnad ($1,00/1M tokens), snabb generering och Googles robusta infrastruktur. Förhandsvisningsstatusen innebär att modellkvalitet och tillgänglighet kan förändras. En begränsning är den höga utdatakostnaden ($20,00/1M tokens) i jämförelse med textmodeller. Dessutom är utdata-ljudkvaliteten – såsom naturlighet, accentvariation och prosodi – inte benchmarkad här. Du bör utvärdera modellens röstkvalitet för din specifika domän (t.ex. teknisk jargong, känslomässig räckvidd) innan produktionsdistribution.
Inga benchmark-resultat för google/gemini-3.1-flash-tts-preview finns i tillgängliga fakta. TTS-modeller utvärderas ofta med mått som Mean Opinion Score (MOS) för naturlighet, word error rate (WER) för tydlighet, och latenspercentiler. Utan specifika siffror bör du köra din egen utvärdering med representativa frågor för att bedöma kvalitet och hastighet i förhållande till dina krav. OrcaRouter lägger inte till eller ändrar modellens prestanda.
Tillgängliga fakta anger inte vilka språk eller accentfunktioner som stöds för denna TTS-förhandsvisning. Googles bredare TTS-modeller stöder vanligtvis flera språk, men denna specifika variants täckning är okänd. Du bör testa med flerspråkig text för att bekräfta utdatakvaliteten. För engelska är prestandan troligen robust med tanke på Googles investeringar. För mindre vanliga språk bör du överväga att kontakta Google direkt eller testa med exempeltext via OrcaRouters API.
Priserna följer Googles officiella priser utan någon påslag från OrcaRouter. Inmatningstokens (text) kostar $1.00 per 1 miljon tokens. Utmatningstokens (ljud) kostar $20.00 per 1 miljon tokens. Utmatningstokens genereras per ljudenhet; det exakta förhållandet mellan token och tid anges inte. Du debiteras för både inmatnings- och utmatningstokens som används i varje begäran. Det finns inga ytterligare plattformsavgifter eller krav på minimibelopp. Debitering sker via OrcaRouters befintliga betalningsmetoder.
Inmatningstoken är 20 gånger billigare än utmatningstoken. Detta uppmuntrar till att skicka längre textprompter (inom token-gränserna) för att generera proportionellt längre ljudutmatning, eftersom inmatningskostnaden förblir låg. Till exempel kan generering av ett 1-minuters ljudklipp förbruka många utmatningstoken till $20/1M, medan textprompten kanske bara kostar några ören. Optimera genom att hålla utmatningen kortfattad när det är möjligt. Om din användning genererar mycket långt ljud kan utmatningskostnaden per begäran snabbt öka.
De tillgängliga fakta nämner inga cache- eller rabattprogram för denna modell på OrcaRouter. OrcaRouters prissättning är vidarebefordrad till leverantörspriser. Du kanske vill kontrollera med OrcaRouter för eventuella volymrabattalternativ eller reserverad kapacitet som kan gälla över modeller. Eftersom kostnaden för utgående token är hög, kan cachning av genererade ljudsegment för upprepad användning (t.ex. vanliga svar) minska den totala kostnaden avsevärt.
Jämförelser tillhandahålls inte direkt. Googles Flash TTS är dock positionerad som kostnadseffektiv för realtidsanvändning med låg ingångskostnad. Andra TTS-modeller (t.ex. OpenAI TTS, ElevenLabs) kan ha olika prissättningsstrukturer – ofta debiteras per tecken eller per sekund ljud. Denna modells prissättning per token kan vara dyrare för mycket långt ljud men billigare för korta, skurar av generering. Utvärdera dina förväntade tokenvolymer mot andra erbjudanden i OrcaRouters katalog.
Använd valfri OpenAI-kompatibel klient. Ställ in bas-URL till https://api.orcarouter.ai/v1, API-nyckel från ditt OrcaRouter-konto, och modell-ID till "google/gemini-3.1-flash-tts-preview". Skicka en chattkompletteringsförfrågan med ett användarmeddelande som innehåller texten som ska talas. Svaret kommer att innehålla ljudinnehåll (troligen som en base64-kodad bit eller URL). Det exakta utdataformatet beror på Googles modellimplementering. Se OrcaRouters dokumentation för strömningsstöd och svarsanalys.
Standardparametrar för chattkomplettering gäller: modell, meddelanden (med roll och innehåll), och eventuellt temperature eller top_p för utdatavariation (även om det är mindre relevant för TTS). För röstval kan Googles modell stödja en extra parameter (t.ex. röstnamn). Tillgängliga fakta listar inte specifika TTS-parametrar. Du kan behöva skicka ytterligare fält som "voice" eller "language" i förfrågans brödtext. Konsultera Googles API-dokumentation för förhandsgranskningsmodellen för exakta alternativ.
Det är vanligt att TTS-modeller stöder strömmande ljud, där ljudchunkar skickas allt eftersom de genereras. De angivna fakta bekräftar inte strömningsstöd för denna förhandsvisningsmodell. Om strömning är aktiverad kan du använda stream-parametern inställd på true i din API-förfrågan och bearbeta chunkarna när de anländer. OrcaRouter stöder strömning för kompatibla modeller. Testa med en enkel förfrågan för att se om ljud returneras stegvis eller som en komplett blob.
Om du redan använder ett OpenAI-kompatibelt API, ändra bas-URL till https://api.orcarouter.ai/v1 och uppdatera modell-ID. Uppdatera dina förfrågningsparametrar så att de matchar Googles TTS-specifikationer (t.ex. röstnamn). Du kan behöva justera hanteringen av ljudutdata om formatet skiljer sig (t.ex. MP3 vs WAV). Testa med exempelprompter för att kontrollera kvaliteten. Eftersom prissättningen är utan påslag (zero-markup) kan dina kostnader ändras baserat på tokenanvändning. Inga särskilda migreringsverktyg krävs.
OpenAI erbjuder TTS-modeller (tts-1, tts-1-hd) med prissättning per tecken (~$0,015 per 1k tecken). I kontrast använder Googles modell token-baserad prissättning, vilket kan vara mer ekonomiskt för korta inmatningar men dyrare för långa utdata. OpenAIs TTS stöder flera röster och språk; Googles förhandsvisningsspecifikationer är inte fullt kända. Latens: både Flash och OpenAIs modeller är utformade för låg latens. Kvalitet är subjektiv; du bör testa med ditt innehåll för att jämföra naturlighet och prosodi.
Google erbjuder även premium TTS-modeller (t.ex. WaveNet, Studio) via sitt Cloud Text-to-Speech API. Dessa modeller tar vanligtvis betalt per tecken i texten som skickas, vilket kan vara billigare för mycket långt ljud men har högre kostnad per förfrågan. Flash TTS är snabbare och har enklare prissättning per input (per token) men kan ha färre röstalternativ. För högfientligt, känslomässigt rikt tal kan en premiummodell vara bättre. För snabbhet och låg kostnad per input är Flash-varianten fördelaktig.
Om du behöver realtidssvar och har korta inmatningstexter (många små förfrågningar), är denna Flash-modells låga inmatningskostnad och snabba generering idealisk. För mycket lång ljudgenerering (t.ex. fullständiga ljudböcker) kan en modell som tar betalt per teckeninmatning (som Googles standard-TTS) vara billigare, eftersom kostnaden för utdatatoken undviks. Överväg även röstvariation och språkstöd: om du behöver många distinkta röster, kontrollera om denna förhandsvisning stöder det. Testa båda alternativen med din arbetsbelastning innan du bestämmer dig.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1voice| Inmatning / 1M token | $1.00 |
| Utdata / 1M tokens | $20.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemini-3.1-flash-tts-previewÖppna @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview