Een gegenereerde hero-kaart voor 'Gemini 3.8 TTS vs ElevenLabs' op een witte achtergrond met zachte blauw- en cyaangradiëntaccenten. De linkerkaart 'ElevenLabs Eleven v3' vermeldt $100 per 1 mln. tekens, 70+ talen, Elo 1.167 en rang 17; de rechterkaart 'Gemini 3.8 Flash TTS' vermeldt $33 per 1 mln. tekens, 130 talen, Elo 1.260 en rang 2. Een voettekstregel luidt 'Elo per Artificial Analysis Provider Voice Arena, sept. 2026.' Het OrcaRouter-logo is in de rechteronderhoek gecomponeerd.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: Wat drie keer de prijs je oplevert

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Bij hetzelfde volume kost het vlaggenschip-synthesemodel van ElevenLabs ongeveer drie keer zoveel als het nieuwe model van de leverancier. ElevenLabs Eleven v3 rekent $0,10 per duizend tekens — $100 per miljoen — en Gemini 3.8 Flash TTS rekent $9,00 per miljoen audiotokens, wat Artificial Analysis normaliseert naar $33,00 per miljoen tekens. Dat is een verschil van 3,0x op de meter, en het is het belangrijkste feit in deze vergelijking. De interessante vraag is niet of het verschil echt is; het is wat de extra zevenenzestig dollar per miljoen tekens werkelijk koopt, want het antwoord is niet "betere spraak".

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Drie meter, niet één

Het eerste dat je goed moet beseffen, is dat deze twee producten niet hetzelfde meten, en de gepubliceerde tariefkaarten verbergen dat.

• ElevenLabs factureert per teken. Eleven v3 kost $0,10 per 1.000 tekens, met een maximum van 5.000 tekens per verzoek. Eleven v3 Conversational kost $0,05 per 1.000, en de Flash- en Turbo-modellen kosten ook $0,05 per 1.000, maar met een limiet van 40.000 tekens per verzoek en een geclaimde latentie van ~75 ms tegenover de ~280 ms van v3 Conversational.

Google factureert per token, en audiotokens zijn geen teksttokens. Gemini 3.8 Flash TTS rekent $0.50 per miljoen teksttokens in en $9.00 per miljoen audiotokens uit, gemeten aan 25 audiotokens per seconde gegenereerde spraak. Er is geen gepubliceerde limiet voor het aantal tekens per verzoek.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis factureert geen van beide; het normaliseert. De $100,00 en $33,00 per miljoen tekens op zijn Provider Voice Arena-ranglijst zijn een afgeleide gemene deler zodat de ranglijst überhaupt op prijs kan rangschikken. Nuttig voor een ratio, niet voor een prijsopgave.

Dus de eerlijke versie van het 3,0x-cijfer is: op de enige beschikbare like-for-like-basis is Google ongeveer een derde van de prijs. Wat dat in je eigen spreadsheet betekent, hangt ervan af of je workload wordt gedomineerd door korte of lange strings — een audio-meter per seconde en een tekst-meter per teken lopen sterk uiteen naarmate uitingen langer worden, omdat stilte, pauzes en prosodische opvulling allemaal audio-tokens kosten, maar geen tekens.

Een bewerkte maand

Neem een miljoen tekens tekst, ongeveer de lengte van een middelgrote roman, eenmalig omgezet naar spraak.

• ElevenLabs Eleven v3 — $100,00 voor de synthese, plus welk abonnementsniveau je ook nodig hebt om het op jouw gelijktijdigheid te draaien. De gepubliceerde abonnementen bieden Starter voor $6, Creator voor $22, Pro voor $99, Scale voor $299 en Business voor $990, en de tekentoewijzingen zijn daarin inbegrepen in plaats van apart gefactureerd.

• Gemini 3.8 Flash TTS — $33,00 equivalent, of ongeveer $16,50 als de taak batchbaar is, omdat de Batch- en Flex-tier het audiotarief halveert naar $4,50 per miljoen tokens. Priority-service verhoogt het naar $16,20 per miljoen, of ongeveer $59,40 equivalent, wat nog steeds ruim onder ElevenLabs ligt.

• Gemini 3.8 Flash-Lite TTS — $6,00 per miljoen audiotokens, ongeveer $22,10 equivalent bij dezelfde normalisatie, ten koste van 101 talen in plaats van 130.

Laat dezelfde miljoen tekens via Google's promotietarieven lopen en de kloof wordt nog groter, want beide nieuwe Gemini TTS-modellen zitten tot 31 december 2026 op het halve tarief en verdubbelen daarna. Wie een businesscase bouwt op de cijfers van september, bouwt die op een korting met een gepubliceerde einddatum.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

De enige plek waar de vergelijking omslaat, is bij zeer korte uitingen. Een meter per teken rekent bijna niets voor een bevestiging van drie woorden; een audiometer per seconde rekent voor de seconde die het kost om de bevestiging uit te spreken, inclusief de stilte eromheen. Als je product een spraakinterface is die bestaat uit antwoorden van één zin, verschuift de rekensom richting ElevenLabs. Als het gaat om narratie, audioboeken, lokalisatie van lange teksten of alles waarbij de tekst lang is en de audio nog langer, verschuift het sterk richting Google.

De kwaliteitskwestie, eerlijk gezegd

Op de Artificial Analysis Provider Voice Arena — blinde paarsgewijze stemmen op de eigen native stemmen van elke aanbieder — liggen de twee modellen ver uit elkaar, en Google ligt voor.

• Gemini 3.8 Flash TTS — rang 2, Elo 1.260, een interval van 17 punten, 1.999 samples, 8 arena-stemmen, uitgebracht in september 2026.

• ElevenLabs Eleven v3 — rang 17, Elo 1.167, een interval van 11 punten, 4.345 samples, 8 arenastemmen, op het bord vermeld als februari 2026.

Drieënnegentig Elo-punten scheiden hen, en anders dan de kloof tussen de top drie op dat scorebord, is deze wel echt: het interval van Eleven v3 is 1.156 tot 1.178 en dat van Gemini is 1.243 tot 1.277, zonder overlap. Het aantal samples van Eleven v3 is meer dan het dubbele van dat van Gemini, dus ook de schatting is niet dun.

Dat is een ronduit ongemakkelijk resultaat voor het prijsargument, en het gaat in tegen de voor de hand liggende conclusie. ElevenLabs rekent drie keer zoveel en staat zeventien plaatsen lager in blinde voorkeur. Wat die extra zevenenzestig dollar ook koopt, het is geen beter klinkende stem in een directe vergelijking.

Wat ElevenLabs eigenlijk verkoopt

ElevenLabs verkoopt in de eerste plaats geen synthese-endpoint, en het prijzen alsof dat wel zo is, is waar de meeste vergelijkingen misgaan. Wat je voor dat geld krijgt:

• Een stemmenbibliotheek. De gedeelde stemmenbibliotheek van ElevenLabs telt honderden stemmen en is een echt productoppervlak — waar mensen vaak naar ElevenLabs komen, is een specifieke stem die ze ergens hebben gehoord, niet het model erachter. Gemini 3.8 Flash TTS wordt geleverd met 30 vooraf gebouwde studiostemmen, een stemontwerptraject dat er een genereert op basis van een natuurlijketaalbeschrijving, en een replicatietraject dat kloont vanaf een sample van 30 seconden, met toestemmingsverificatie, een SynthID-watermerk en C2PA-credentials eraan gekoppeld. De standaardcatalogus is kleiner; het vermogen om een specifieke stem te creëren is vergelijkbaar.

• Latentieniveaus als afzonderlijke producten. Flash en Turbo met ~75 ms en een limiet van 40.000 tekens zijn een ander product dan v3 met ~280 ms en 5.000 tekens, en beide zijn goedkoper dan v3. Als uw applicatie sub-100 ms nodig heeft, verkoopt ElevenLabs dat expliciet, en het lanceringsmateriaal van Google maakt voor geen van beide nieuwe TTS-modellen een vergelijkbare latentieclaim.

• Een ecosysteem. Dubbing, spraakagenten, conversationele endpoints, een abonnementsstructuur met concurrency eraan vast — dezelfde reden waarom Cartesia telefonie verkoopt: het is een stack, geen model.

Als je een stack koopt, is de 3.0x de prijs van het niet zelf assembleren ervan. Als je een syntheseaanroep koopt, betaal je die voor een stemmenbibliotheek en een latentieniveau.

Wat Google eigenlijk verkoopt

Het tegenargument is nauwer en sterker dan "goedkoper".

• Taaldekking — 130 talen op Flash TTS en 101 op Flash-Lite TTS, automatisch gedetecteerd op basis van de tekst, tegenover de ruim 70 talen die ElevenLabs documenteert voor Eleven v3. Voor een lokalisatieronde is dat verschil geen functievergelijking, maar een dekkingskloof.

• Regie — aansturing van de voordracht regel voor regel, enscenering van een scène met twee sprekers binnen één enkele aanroep, en non-verbale signalen die in het script worden geschreven als <laughs>, <sigh>, <gasp>, |mhm| en |yeah|. Google beweert dat de 3.8-generatie de consistentie over lange vormen en de aansturing van twee sprekers heeft verbeterd ten opzichte van Gemini 3.1 Flash TTS, en dat is precies waar die functies voor bestaan. Claim van de leverancier, niet gereproduceerd.

• Stemstatusmodel — 200 stateful aangepaste stemmen per project met een TTL van één jaar, of stateless stemmen die worden aangesproken via een voicekey_...-handle die na zeven dagen verlopen. Dat is een infrastructuurbeslissing waarop u uw planning kunt baseren.

• Uitvoerbeheer — WAV 24 kHz mono 16-bits signed PCM op het unary-eindpunt, headerloos PCM (audio/l16) op het streaming-eindpunt, en audio/mulaw en audio/alaw met een configureerbare samplefrequentie.

De lanceringbenchmarks van Google zijn door de leverancier gerapporteerd en moeten ook zo worden gelezen: eerste op de Hume AI Voice Design Benchmark met 71,4 en eerste op accentmodellering met 60,8, eerste en tweede op de Hume Overall Quality Index voor respectievelijk Flash en Flash-Lite, en de hoogste posities in blinde voorkeur die worden geclaimd in het Japans, Braziliaans-Portugees, Vietnamees, Modern Standaardarabisch, Mexicaans Spaans en Hindi. Geen van die runs is openbaar. De arena-Elo hierboven is het enige onafhankelijk verzamelde getal in dit artikel, en het komt toevallig overeen met de richting van de claims van de leverancier.

De switchcalculus

Stap over als je workload long-form, meertalig of high-volume genoeg is dat 3.0x als factuurregel opduikt, en als je kunt leven met een kleinere standaard stemcatalogus en geen gepubliceerde sub-100 ms-tier. Dat dekt narratie, dubbing, toegankelijkheid en de meeste spraak die in producten is ingebed.

Blijf als je de stack koopt — de stemmenbibliotheek, de latentieniveaus, de nasynchronisatie- en agentproducten — of als je werklast wordt gedomineerd door zeer korte uitingen waarbij een audiometer per seconde je benadeelt. Blijf ook als je al een stemidentiteit op ElevenLabs hebt fijn afgestemd die je gebruikers herkennen, want stemcontinuïteit is een productfunctie en het opnieuw creëren ervan op een nieuw model is een project.

Hoe dan ook is de verstandige zet om beide een maand op echt verkeer te draaien voordat je je vastlegt, en dat is het argument om geen van beide rechtstreeks op je codebase aan te sluiten. OrcaRouter zet 200+ modellen achter één sleutel tegen de lijstprijs van de provider, zonder opslag, zodat een prijswijziging van een van beide labs dezelfde dag nog op je factuur terechtkomt in plaats van bij verlenging, en automatische failover houdt een productie-spraakpad in de lucht wanneer een gloednieuw endpoint zich misdraagt. Wij hosten ElevenLabs niet — de synthese- en agentlagen zijn hun eigen product — en we hosten ook de Gemini 3.8 TTS-endpoints niet, die van Google's API komen. Wat wij leveren is de tekstlaag eronder en de routing erboven.

Het getal dat het volgen waard is, is de Elo van Eleven v3 in de volgende revisie van het leaderboard. Drieënnegentig punten is een grote achterstand voor een model dat drie keer zoveel kost, en als het interval smaller wordt zonder dat de kloof dichtgaat, houdt het prijsargument op een afweging te zijn en wordt het een oordeel.