Ett genererat hero-kort för "Gemini 3.8 TTS vs ElevenLabs" på vit bakgrund med mjuka gradientaccenter i blått och cyan. Det vänstra kortet "ElevenLabs Eleven v3" listar 100 USD per 1 miljon tecken, 70+ språk, Elo 1 167 och plats 17; det högra kortet "Gemini 3.8 Flash TTS" listar 33 USD per 1 miljon tecken, 130 språk, Elo 1 260 och plats 2. En sidfotsrad lyder "Elo enligt Artificial Analysis Provider Voice Arena, sept. 2026." OrcaRouter-logotypen är inkomponerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: Vad tre gånger priset ger dig

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Vid samma volym kostar ElevenLabs flaggskeppsmodell för syntes ungefär tre gånger så mycket som leverantörens nya modell.ElevenLabs Eleven v3 debiterar $0,10 per tusen tecken — $100 per miljon — och Gemini 3.8 Flash TTS debiterar $9,00 per miljon ljudtoken, vilket Artificial Analysis normaliserar till $33,00 per miljon tecken. Det är en 3,0x skillnad på mätaren, och det är det enskilt största faktumet i den här jämförelsen. Den intressanta frågan är inte om gapet är verkligt; det är vad de extra sextiosju dollarna per miljon tecken faktiskt köper, för svaret är inte "bättre tal".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Tre meter, inte en

Det första att reda ut är att dessa två produkter inte mäter samma sak, och de publicerade prislistorna döljer det.

• ElevenLabs fakturerar per tecken. Eleven v3 kostar 0,10 USD per 1 000 tecken, med ett tak på 5 000 tecken per begäran. Eleven v3 Conversational kostar 0,05 USD per 1 000, och modellerna Flash och Turbo kostar också 0,05 USD per 1 000 men med en begäransgräns på 40 000 tecken och en uppgiven latens på ~75 ms jämfört med Eleven v3 Conversationals ~280 ms.

Google fakturerar per token, och ljudtokens är inte texttokens. Gemini 3.8 Flash TTS tar $0.50 per miljon texttokens som indata och $9.00 per miljon ljudtokens som utdata, mätt med 25 ljudtokens per sekund genererat tal. Det finns ingen publicerad teckenbegränsning per begäran.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis fakturerar inte någon av dem; det normaliserar. $100.00 och $33.00 per miljon tecken på dess Provider Voice Arena-topplista är en härledd gemensam nämnare, så att listan överhuvudtaget kan rangordna efter pris. Användbar för en kvot, inte för en offert.

Den ärliga versionen av siffran 3,0x är alltså: på den enda jämförbara grund som finns är Google ungefär en tredjedel av priset. Vad det betyder i ditt eget kalkylark beror på om din arbetsbelastning domineras av korta eller långa strängar – en ljudmätare per sekund och en textmätare per tecken går isär kraftigt när yttranden blir längre, eftersom tystnad, pauser och prosodisk utfyllnad kostar ljud-tokens men inga tecken.

En arbetad månad

Ta en miljon tecken text, ungefär lika lång som en medelstor roman, omvandlad till tal en gång.

• ElevenLabs Eleven v3 — $100.00 för syntetiseringen, plus vilken plannivå du än behöver för att köra den vid din samtidighet. De publicerade planerna har Starter för $6, Creator för $22, Pro för $99, Scale för $299 och Business för $990, och teckenkvoterna ingår i dessa i stället för att faktureras separat.

• Gemini 3.8 Flash TTS — 33,00 USD motsvarande, eller ungefär 16,50 USD om jobbet kan batchas, eftersom Batch- och Flex-nivån halverar ljudpriset till 4,50 USD per miljon tokens. Prioritetstjänst höjer det till 16,20 USD per miljon, eller cirka 59,40 USD motsvarande, vilket fortfarande är klart under ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6,00 USD per miljon ljudtoken, cirka 22,10 USD motsvarande vid samma normalisering, till priset av 101 språk i stället för 130.

Kör samma miljon tecken genom Googles kampanjprissättning och gapet vidgas ytterligare, eftersom båda de nya Gemini TTS-modellerna har halva priset till 31 december 2026 och därefter dubblas. Den som bygger ett affärscase på siffrorna från september bygger det på en rabatt som har ett publicerat utgångsdatum.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Det enda stället där jämförelsen slår om är vid mycket korta yttranden. En mätare per tecken tar nästan inget betalt för en bekräftelse på tre ord; en ljudmätare per sekund tar betalt för den sekund som bekräftelsen tar att säga, inklusive tystnaden omkring den. Om din produkt är ett röstgränssnitt uppbyggt av svar i en mening, rör sig kalkylen mot ElevenLabs. Om det är berättande, ljudböcker, lokalisering av långformat eller något där texten är lång och ljudet är längre, rör den sig kraftigt mot Google.

Kvalitetsfrågan, ärligt talat

I Artificial Analysis Provider Voice Arena — blinda parvisa röster över varje leverantörs egna native-röster — ligger de två modellerna inte nära varandra, och Google ligger före.

• Gemini 3.8 Flash TTS — rang 2, Elo 1 260, ett 17-punktsintervall, 1 999 prover, 8 arenaröster, släppt i september 2026.

• ElevenLabs Eleven v3 — plats 17, Elo 1 167, ett intervall på 11 poäng, 4 345 prover, 8 röster i arenan, anges som februari 2026 på resultattavlan.

Nittiotre Elo-poäng skiljer dem åt, och till skillnad från gapet mellan de tre högsta på den tavlan är detta verkligt: Eleven v3:s intervall är 1 156 till 1 178 och Geminis är 1 243 till 1 277, utan överlappning. Eleven v3:s antal prover är mer än dubbelt så stort som Geminis, så uppskattningen är inte heller tunn.

Det är ett genuint besvärligt resultat för prisargumentet, och det talar emot den självklara slutsatsen. ElevenLabs tar tre gånger så mycket betalt och placerar sig sjutton placeringar lägre i blind preferens. Vad de extra sextiosju dollararna än köper, så är det inte en röst som låter bättre i en direkt jämförelse.

Vad ElevenLabs egentligen säljer

ElevenLabs säljer inte i första hand en syntes-endpoint, och att prissätta det som om det vore det är där de flesta jämförelser går fel. Vad pengarna köper:

• En röstbank. ElevenLabs delade röstbibliotek har hundratals röster och är en genuin produktyta — det folk kommer till ElevenLabs för är ofta en specifik röst de hört någonstans, inte modellen bakom den. Gemini 3.8 Flash TTS levereras med 30 färdigbyggda studioröster, en väg för röstdesign som genererar en från en beskrivning i naturligt språk, och en replikeringsväg som klonar från ett 30-sekundersprov med samtyckesverifiering, en SynthID-vattenstämpel och C2PA-uppgifter kopplade. Standardkatalogen är mindre; förmågan att skapa en specifik röst är jämförbar.

• Latensnivåer som separata produkter. Flash och Turbo vid ~75 ms och en gräns på 40 000 tecken är en annan produkt än v3 vid ~280 ms och 5 000 tecken, och båda är billigare än v3. Om din applikation behöver under 100 ms säljer ElevenLabs det uttryckligen, och Googles lanseringsmaterial gör inte något jämförbart latenspåstående för någon av de nya TTS-modellerna.

• Ett ekosystem. Dubbning, röstagenter, samtalsslutpunkter, en planstruktur med samtidighet kopplad — av samma anledning som Cartesia säljer telefoni: det är en stack, inte en modell.

Om du köper en stack är 3.0x priset för att inte sätta ihop den. Om du köper ett syntesanrop betalar du det för ett röstbibliotek och en latensnivå.

Vad Google faktiskt säljer

Motargumentet är snävare och starkare än "billigare".

• Språktäckning — 130 språk för Flash TTS och 101 för Flash-Lite TTS, automatiskt detekterade från texten, jämfört med de 70+ språk som ElevenLabs dokumenterar för Eleven v3. För en lokaliseringsomgång är den skillnaden inte en funktionsjämförelse, utan ett täckningsgap.

• Regi — rad-för-rad-kontroll av framförandet, iscensättning av scener med två talare i ett enda anrop, och icke-verbala signaler skrivna i manuset som <laughs>, <sigh>, <gasp>, |mhm| och |yeah|. Google hävdar att 3.8-generationen förbättrade långformskonsekvens och tvåtalarkontroll jämfört med Gemini 3.1 Flash TTS, vilket är exakt vad dessa funktioner finns till för. Leverantörens påstående, ej reproducerat.

• Rösttillståndsmodell — 200 tillståndsbaserade anpassade röster per projekt med en livstid på ett år, eller tillståndslösa röster som adresseras med ett voicekey_... handtag som löper ut efter sju dagar. Det är ett infrastrukturbeslut som du kan planera utifrån.

• Utgångskontroll — WAV 24 kHz mono 16-bitars signerad PCM på den unära slutpunkten, headerlös PCM (audio/l16) på strömningsslutpunkten, samt audio/mulaw och audio/alaw med en konfigurerbar samplingsfrekvens.

Googles lanseringsbenchmarkresultat är leverantörsrapporterade och bör läsas så: etta på Hume AI Voice Design Benchmark med 71,4 och etta inom accentmodellering med 60,8, etta respektive tvåa på Hume Overall Quality Index för Flash respektive Flash-Lite, samt topplaceringar i blind preferens som påstås för japanska, brasiliansk portugisiska, vietnamesiska, modern standardarabiska, mexikansk spanska och hindi. Ingen av dessa körningar är offentlig. Arena-Elo-talet ovan är det enda oberoende insamlade talet i den här artikeln, och det råkar stämma överens med riktningen i leverantörens påståenden.

Switchkalkylen

Byt om din arbetsbelastning är långformat, flerspråkig eller tillräckligt högvolym att 3,0x dyker upp som en egen rad, och om du kan leva med en mindre standardröstkatalog och ingen publicerad nivå under 100 ms. Det täcker berättarröst, dubbning, tillgänglighet och de flesta typer av produktinbäddat tal.

Stanna kvar om du köper stacken – röstbiblioteket, latensnivåerna, dubbnings- och agentprodukterna – eller om din arbetsbelastning domineras av mycket korta yttranden där en ljudmätare per sekund straffar dig. Stanna också kvar om du redan har finjusterat en röstidentitet på ElevenLabs som dina användare känner igen, eftersom röstkontinuitet är en produktfunktion och att återskapa den på en ny modell är ett projekt.

Hur som helst är det kloka draget att köra båda i en månad på verklig trafik innan du binder dig, och det är argumentet för att inte koppla in någon av dem direkt i din kodbas. OrcaRouter sätter 200+ modeller bakom en enda nyckel till leverantörens listpris utan påslag, så en prisändring från något av labben når din faktura samma dag i stället för vid förnyelsen, och automatisk redundans håller en produktionsröstväg vid liv när en helt ny slutpunkt beter sig illa. Vi hostar inte ElevenLabs – dess syntes- och agentlager är dess egen produkt – och vi hostar inte Gemini 3.8 TTS-slutpunkterna, som kommer från Googles API. Det vi tillhandahåller är textlagret under och routningen ovanpå.

Siffran att hålla ögonen på är Eleven v3:s Elo i nästa revidering av topplistan. Nittiotre poäng är ett stort underläge för en modell som tar tre gånger så mycket betalt, och om intervallet krymper utan att gapet sluts, upphör prisargumentet att vara en affär och blir en dom.