Google Gemini 2.5 Pro preview med TTS, tillgänglig via OrcaRouter med noll påslag.
google/gemini-2.5-pro-preview-tts är en förhandsvisning av en text-till-tal-modell från Google, byggd på Gemini 2.5 Pro-grunden. Den omvandlar textinmatning till talat ljud. Modellen nås via…
Den primära funktionen hos google/gemini-2.5-pro-preview-tts är att omvandla skriven text till talat ljud. Den är byggd på Googles Gemini 2.5 Pro, vilket indikerar stark språkförståelse, vilket bör resultera i naturlig frasering, lämplig intonation och tydligt uttal. Modellen tar endast emot text som indata, så den är inte multimodal på indatasidan. Den hanterar inte ljudindata, bilder eller video. Utdatan är troligen ljud i ett standard digitalt format. Som en TTS-modell kan den hantera flera språk, men specifikt språkstöd har inte offentliggjorts för denna förhandsversion. Den är optimerad för att generera tal, inte för andra Gemini 2.5 Pro-funktioner som resonemang eller kodgenerering.
Modellen utmärker sig i tillämpningar som kräver omvandling av skriven text till naturligt klingande tal. De bästa användningsområdena inkluderar röstassistenter där assistenten läser upp svar, automatiserad uppläsning av ljudböcker och podcaster, tillgänglighetsfunktioner som läser upp text på skärmen för synskadade användare, samt kundtjänstsystem som levererar talade svar. Den kan också användas för språkinlärningsapplikationer där korrekt uttal modelleras, eller för att generera talinnehåll från RSS-flöden eller artiklar. På grund av dess förhandsgranskningsstatus är det tillrådligt att testa noggrant för ditt specifika språk, domän eller stilbehov innan du satsar på storskalig distribution.
Även om google/gemini-2.5-pro-preview-tts erbjuder premium TTS-kvalitet, kan det vara överkurs för enkla pip eller notifikationsljud, eller för applikationer där låg latens är avgörande men modellens bearbetningstid är längre än dedikerade TTS-chips. Om du bara behöver grundläggande, monotont tal eller har mycket hög volym med strikta budgetbegränsningar, kan en lättare TTS-modell (t.ex. från andra leverantörer på [OrcaRouter](https://orcarouter.com)) med lägre kostnad per token vara mer lämplig. Dessutom, om din användning kräver realtidsströmning med extremt låg latens, utvärdera om Geminis preview-modell uppfyller dina hastighetskrav, eftersom större modeller kan introducera högre first-token-latens.
Vid modellens förhandsversion har Google inte publicerat specifika riktmärkesresultat för varianten gemini-2.5-pro-preview-tts. Den underliggande basmodellen Gemini 2.5 Pro har visat stark prestanda inom språkförståelse och resonemangsuppgifter, men TTS-variantens talqualitetsdata (t.ex. Mean Opinion Score, Word Error Rate) har inte delats offentligt. Utan officiella riktmärken rekommenderar OrcaRouter att utvärdera modellen på din egen testuppsättning av textinmatningar, och mäta subjektiv ljudkvalitet, latens och tillförlitlighet under belastning. För produktionsbeslut gör du egna A/B-jämförelser med andra TTS-tjänster.
Specifika latenssiffror för google/gemini-2.5-pro-preview-tts har inte offentliggjorts. Som en TTS-modell baserad på en stor språkmodellsarkitektur kan den uppvisa högre latens jämfört med specialiserade neurala TTS-modeller som är optimerade för realtidsströmning. Faktorer som påverkar hastigheten inkluderar längden på inmatningstexten, modellens interna bearbetningstid samt nätverkets rundtur till OrcaRouters slutpunkter. För applikationer där låg latens är avgörande (t.ex. konversations-AI) bör denna modell testas med typiska inmatningslängder för att bedöma dess lämplighet. Överväg att använda strömning eller chunkad textgenerering om API:et stöder det.
Styrkor: Bygger på Googles avancerade Gemini 2.5 Pro-arkitektur, vilket sannolikt ger mycket naturligt, uttrycksfullt tal med bra prosodi och uttal. Åtkomst via OrcaRouters OpenAI-kompatibla API förenklar integration. Ingen prispåslag från leverantören gör kostnaden förutsägbar. Begränsningar: Inmatningsmodaliteten är endast text; den kan inte bearbeta ljud eller andra modaliteter. Eftersom det är en förhandsversion kan den ha okända kantfall eller ojämn kvalitet. Kontextfönstrets storlek är okänd, vilket begränsar längden på text som kan konverteras i en enda förfrågan. Utdataformatets detaljer anges inte. Den är inte utformad för uppgifter som taligenkänning eller röstkloning.
Priset för google/gemini-2.5-pro-preview-tts baseras på tokenanvändning, debiterat med $1,00 per 1 miljon indatatokens och $20,00 per 1 miljon utdatatokens. Indatatokens inkluderar textprompten och eventuella instruktioner. Utdatatokens representerar det genererade ljudet. OrcaRouter debiterar till exakt leverantörspris utan påslag, vilket innebär att du bara betalar vad Google tar ut, plus eventuella tillämpliga skatter. Det finns inga minimiåtaganden eller månadsavgifter. Användningen mäts per förfrågan och summeras på din OrcaRouter-faktura. Eftersom antalet utdata-tokens för TTS kan vara högt (ljud är mer tokentätt än text), är utdatakostnaden den största utgiften.
Priset för utgående token (20 $ per 1M) är betydligt högre än för inkommande token (1 $ per 1M). Detta är typiskt för generativa modeller eftersom utgående token kräver mer beräkningskraft. För text-till-tal representeras ljudutgången som en serie token, och omvandling av text till tal innebär generering av en lång sekvens av ljudtoken. Den totala kostnaden för en specifik uppgift beror på längden på utmatat ljud i förhållande till inmatningstexten. Om du behöver generera långa talstycken (t.ex. en hel ljudbok) kan kostnaderna ackumuleras. För korta uppmaningar (t.ex. en enda mening) är kostnaderna minimala. Övervaka din tokenanvändning för att uppskatta kostnader.
Nej, OrcaRouter lägger inte till någon påslag på leverantörens taxa för google/gemini-2.5-pro-preview-tts. De listade priserna på $1.00 per 1M inmatningstokens och $20.00 per 1M utmatningstokens är exakt vad Google tar betalt. OrcaRouter skickar dessa vidare direkt till dig. Detta är förenligt med OrcaRouters prismodell för många modeller där plattformen fungerar som en transparent proxy. Du betalar endast för de tokens du förbrukar. Eventuella valfria funktioner som cachelagring eller premiumsupport kan medföra separata avgifter, men den grundläggande kostnaden per token har inget påslag.
För att använda google/gemini-2.5-pro-preview-tts, skicka förfrågningar till OrcaRouters OpenAI-kompatibla API vid bas-URL https://api.orcarouter.ai/v1. Använd modell-ID:t 'google/gemini-2.5-pro-preview-tts' i dina API-anrop. Förfrågningsformatet följer den vanliga OpenAI chat completions-strukturen med ett 'model'-fält, en 'messages'-array som innehåller din textprompt (med en system- och/eller användarroll) samt standardparametrar som temperature och max_tokens. Svaret kommer att innehålla de genererade ljudtokens, som din klient kan avkoda för att spela upp som tal. Autentisering sker via en API-nyckel som tillhandahålls av OrcaRouter.
API:t stöder standard OpenAI-kompatibla parametrar inklusive 'model', 'messages' (array av objekt med role och content), 'temperature' (för att kontrollera variation i ljudutgång), 'max_tokens' (för att begränsa längden på genererat ljud) och 'top_p'. Som en TTS-modell kan det finnas ytterligare parametrar för röststil eller hastighet, men dessa har inte dokumenterats i tillgängliga fakta. Se OrcaRouters API-dokumentation för de senaste fälten som stöds. Parametern 'response_format' kan tillåta specificering av ljudkodning (t.ex. wav eller mp3). Om det inte stöds som standard kan du behöva avkoda den returnerade tokenströmmen.
Om du för närvarande använder en annan TTS-tjänst (t.ex. Google Cloud Text-to-Speech, Amazon Polly) innebär migreringen till google/gemini-2.5-pro-preview-tts via OrcaRouter att du uppdaterar din API-slutpunkt och ditt förfrågningsformat. OrcaRouter använder OpenAI-kompatibla slutpunkter, så du byter från en leverantörsspecifik SDK till en OpenAI-kompatibel sådan. Ersätt din befintliga bas-URL med https://api.orcarouter.ai/v1, använd modell-ID:t 'google/gemini-2.5-pro-preview-tts' och justera dina förfrågningskroppar för att matcha chat completions-schemat. Du kan behöva ändra hur du hanterar svaret: istället för att ta emot ljudfiler direkt får du tokeniserad utdata som du måste avkoda. Testa med exempelinmatningar.
Autentisering görs genom att inkludera en API-nyckel i Authorization-huvudet (format: Bearer YOUR_API_KEY). Du får API-nyckeln från ditt OrcaRouter-konto. Hastighetsbegränsningar sätts av OrcaRouter baserat på din plan; de är inte samma som Googles begränsningar. För högvolymanvändning, kontakta OrcaRouter för att justera begränsningarna. Förhandsgranskningsmodellen kan ha ytterligare begränsningar från Google – om du stöter på fel som 'model not available', kontrollera att din OrcaRouter-plan inkluderar denna modell. Det finns inga specifika hastighetsbegränsningar angivna för denna modell, men standard bästa praxis (återförsök med exponentiell backoff) rekommenderas.
google/gemini-2.5-pro-preview-tts är en specialiserad variant av Gemini 2.5 Pro-familjen som är anpassad för text-till-tal. Andra Gemini 2.5 Pro-modeller är allmänna och hanterar text, bilder, ljud och video som indata; de genererar inte tal som utdata inbyggt. Denna TTS-variant tar bort multimodal indata och fokuserar på att generera ljud från text. Den använder sannolikt samma underliggande språkförståelse för prosodi och takt, men den är inte lämplig för resonemang, kodning eller multimodal analys. Om du behöver TTS-funktioner utan att ge upp multimodal indata, skulle du kombinera en standard Gemini-modell med en separat TTS-pipeline. Förhandsversionen av TTS ger en mer strömlinjeformad pipeline.
OrcaRouter erbjuder tillgång till TTS-modeller från olika leverantörer. Denna modell från Google är baserad på en stor språkmodellarkitektur, vilket kan producera mer naturligt och kontextmedvetet tal än äldre konkatenativa eller parametriska TTS-system. Den kan dock vara långsammare och dyrare per token jämfört med specialiserade neurala TTS-modeller utformade för låg latens och hög genomströmning. Många populära TTS-tjänster tar betalt per tecken eller per sekund ljud, inte per token, vilket gör direkta kostnadsjämförelser knepiga. För produktionsdistributioner som kräver extremt låg kostnad kan dedikerade TTS-modeller vara att föredra. Googles modell är bäst för användningsfall där den högsta utdatakvaliteten motiverar den högre tokenkostnaden.
Välj denna modell om du behöver toppmodern talkvalitet från Googles senaste Gemini-arkitektur och vill nå den via ett standard OpenAI-kompatibelt API utan att hantera Google Cloud-inloggningsuppgifter. Den påslagsfria prissättningen garanterar transparens. Den är idealisk för applikationer där naturlighet är avgörande, såsom konversations-AI eller narrativt innehåll. Förhandsgranskningsstatusen möjliggör tidig experimentering för att utvärdera kvaliteten för din domän. Däremot, om du behöver realtidsstreaming med mindre än 100 ms latens, kan en dedikerad streaming TTS-modell vara bättre. Om din budget är känslig, testa även utdata-tokenförbrukningen för typiska användningsfall för att säkerställa att kostnaden är acceptabel.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1voice| Inmatning / 1M token | $1.00 |
| Utdata / 1M tokens | $20.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/google/gemini-2.5-pro-preview-ttsÖppna @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts