Een gegenereerde hero-kaart voor het artikel 'Gemini 3.8 Live vs ElevenLabs', met twee afgeronde kaarten aan weerszijden van de kop. Op de linkerkaart staat 'Gemini 3.8 Live' boven een wolk-en-golfvorm-pictogram en de regel 'spraak naar spraak, één doorgang, per minuut'; op de rechterkaart staat 'ElevenLabs Agents' boven een pijplijnpictogram met drie blokken en het label 'STT - LLM - TTS' en de regel 'samengesteld, per agentminuut'. Een ondertitel luidt 'Een component die je huurt versus een systeem dat componenten huurt'. Het OrcaRouter-logo is in de rechteronderhoek samengesteld.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: Een model tegenover een pijplijn

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Open de documentatie van ElevenLabs voor zijn agentplatform en er zit een Gemini-model middenin. ElevenLabs Agents is een cascade — een front-end voor spraakherkenning, een taalmodel en een back-end voor tekst-naar-spraak — en het taalmodel in de gepubliceerde stack is er een van Gemini. Dat is de juiste plek om een vergelijking tussen Gemini 3.8 Live en ElevenLabs te beginnen, want de twee dingen die worden vergeleken zijn niet hetzelfde soort object. Gemini 3.8 Live is het spraak-naar-spraakmodel, uitgebracht op de Live API op 15 september 2026, met een prijs per minuut audio. ElevenLabs Eleven v3 is het vlaggenschip-synthesemodel van een spraakplatform dat ook ElevenLabs Agents verkoopt, en het is geprijsd per teken, niet per gesprek. Het ene is een component die je kunt huren. Het andere is een systeem dat componenten huurt — waaronder, in ten minste één gepubliceerde configuratie, die van een Gemini-model.

Die asymmetrie beslecht de meeste vragen die mensen daadwerkelijk bij deze vergelijking meebrengen. Als je je afvraagt welke je moet aanroepen, is het eerlijke antwoord dat ze geen vervangers van elkaar zijn: de ene is een model met een tariefkaart en geen telefonie, de andere is een product met telefonie, limieten voor gelijktijdigheid en drie meters die tegelijk lopen. Welke goedkoper, beter of sneller is, hangt volledig af van welke van die twee vormen je applicatie al is.

Eén model, of drie modellen in opeenvolging

Gemini 3.8 Live is een native spraak-naar-spraak-systeem. Audio gaat erin, audio komt eruit, en het redeneren gebeurt in dezelfde forward pass die de spraak produceert — één model, één latencybudget, één rekening. Google bracht het op 15 september 2026 uit in twee varianten: gemini-3.8-live voor grootschalig gesprekswerk, en gemini-3.8-live-extended-thinking voor dezelfde interface, maar dan met meerstapsredenering erachter. Beide ondersteunen 97 talen met wisselen tijdens het gesprek, beide verwerken visuele input bijna in realtime, beide voeren tool- en API-aanroepen op de achtergrond uit terwijl het gesprek doorgaat, en beide voorzien ze elke seconde gegenereerde audio van een watermerk met SynthID. Het gepubliceerde tarief is $0.005 per minuut audio-invoer en $0.018 per minuut audio-uitvoer.

ElevenLabs Agents is dat niet. Het is een pijplijn, en de pijplijn is het product. Een realtime spraakherkenningsmodel transcribeert de beller, een taalmodel beslist wat er gezegd moet worden, en een synthesemodel — Eleven Flash v2 in de configuratie die ElevenLabs documenteert — spreekt het antwoord uit. Elke fase wordt afzonderlijk gemeten, elke fase kan worden vervangen, en het geheel zit achter een beheerde laag die telefonie, beurtdetectie en gelijktijdige verwerking afhandelt. ElevenLabs Eleven v3, het belangrijkste synthesemodel van het bedrijf, is weer een ander product: een tekst-naar-spraakmodel met een prijs van $100 per miljoen tekens, verkocht voor narratie, dubbing en stemontwerp, niet voor het voeren van een gesprek.

Het eerste dat je goed moet krijgen, is dat "Gemini 3.8 Live vs ElevenLabs Eleven v3" geen rechtstreekse confrontatie is tussen twee spraakmodellen. Eleven v3 neemt geen audio-invoer aan en houdt geen gesprek. De vergelijking die iets betekent, is Gemini 3.8 Live tegenover ElevenLabs Agents, waarbij Eleven v3 er alleen bij is als het kwaliteitsplafond voor synthese waarop het platform is gebouwd.

Waar elk ervan daadwerkelijk op een bord staat

Er is geen ranglijst die deze twee tegen elkaar afzet, en de reden is leerzaam: ze blijven opduiken op verschillende ranglijsten die verschillende dingen meten.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

Op de Speech to Speech Index van Artificial Analysis — die spraakredenering, het voltooien van agentische taken, arena-voorkeur en taaksucces samenbrengt in één getal — scoort Gemini 3.8 Live 76,0, met de Extended Thinking-variant op 82,6 op de eerste plaats. Dat zijn metingen die Artificial Analysis met zijn eigen harness uitvoert, niet door Google gepubliceerde cijfers, hoewel Googles eigen aankondiging getallen uit dezelfde componenten citeert.

ElevenLabs staat helemaal niet op die ranglijst, omdat het geen spraak-naar-spraak-model levert om te meten. Waar het wel voorkomt, is in de Speech Agent Arena, die samengestelde agents evalueert in plaats van modellen, en het beeld daar is echt gemengd: ElevenLabs Agents is gemeten op 937 Elo met een taaksuccespercentage van 90,5%, tegen 1.046 Elo en 74,6% taaksucces voor een agent die is gebouwd op de vorige Gemini Live-generatie, waarbij de Gemini-agent de eerste audio in 0,96 seconden bereikt. Lees dat paar aandachtig. De op Gemini gebaseerde agent wint op voorkeur en snelheid; de ElevenLabs-agent wint op het voltooien van de taak. Dat is een cascade die een native model verslaat op betrouwbaarheid, wat niet het resultaat is dat de architectuurdiagrammen zouden voorspellen.

Twee kanttekeningen bij die cijfers, die beide van belang zijn. De Gemini-kant van die vergelijking gebruikte de Gemini Live-generatie van begin 2026, niet 3.8 Live, dus het zegt niets over het model waar dit artikel over gaat. En de derde ranglijst die meespeelt — de Provider Voices-spraakarena van Artificial Analysis, die synthesemodellen rangschikt — zet ElevenLabs Eleven v3 op 1.177 Elo en de gespreksvariant, ElevenLabs v3 Conversational, op 1.219 Elo, tegen 1.283 voor de koploper, Cartesia Sonic 3.6. Die ranglijst meet hoe goed de stem klinkt, niet hoe goed de agent presteert, en het door elkaar halen van die twee leidt ertoe dat mensen uiteindelijk een synthesescore aanhalen als bewijs voor een conversationeel systeem.

Specificatiecontrast

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Architectuur — Gemini 3.8 Live is één native spraak-naar-spraakmodel versus ElevenLabs Agents is een cascade van spraakherkenning, een taalmodel en synthese

• Invoer en uitvoer — Gemini 3.8 Live ontvangt audio en geeft audio terug in één keer tegenover ElevenLabs, die audio ontvangt via Scribe v2 Realtime en deze teruggeeft via Eleven Flash v2, met daartussen een teksttranscript.

• Wat je kunt vervangen — bij Gemini 3.8 Live niets, het model is het model, tegenover bij ElevenLabs elke fase afzonderlijk, inclusief het taalmodel, dat in de gedocumenteerde stack een Google-model is

• Talen — Gemini 3.8 Live 97 met schakelen tijdens het gesprek vs ElevenLabs Eleven v3 74

• Audioprijzen — Gemini 3.8 Live: $0,005 per minuut in en $0,018 per minuut uit, tegenover ElevenLabs dat op agentminuten is geprijsd, waarbij taalmodel-tokens afzonderlijk daarbovenop worden gemeten

• Telefonie — Gemini 3.8 Live geen first-party, je brengt je eigen carrier en sessiebeheer mee vs. ElevenLabs beheerd, first-party

• Gelijktijdigheid — Gemini 3.8 Live voor zover je Live API-quotum het toelaat, versus ElevenLabs dat in gelijktijdigheidsniveaus wordt verkocht

• Agent-tooling — Gemini 3.8 Live achtergrondtool en API-uitvoering binnen het model versus ElevenLabs, een beheerde agentlaag met beurtdetectie, workflows en een stemmenbibliotheek

• Open artefact — geen van beide. Beide zijn gesloten, uitsluitend cloud en propriëtair.

• Latentie — Gemini 3.8 Live 1,18 seconden tot de eerste audio voor het standaardmodel en 1,35 voor Extended Thinking, volgens Artificial Analysis, tegenover ElevenLabs, waarvoor dit niet als één enkel getal is gepubliceerd, omdat de latentie van een cascade de som van drie stadia is

De laatste rij is degene die de architectuurkeuze beter verklaart dan alle andere. Een native model heeft één latentiebudget. Een cascade heeft er drie, en de reden dat teams nog steeds voor de cascade kiezen, is alles daarboven: het transcript dat je kunt loggen, de fase die je kunt vervangen, en het telefoonnummer dat gewoon werkt.

Wat een minuut kost, in beide richtingen

De rekensom voor Gemini 3.8 Live is ongewoon eenvoudig omdat er maar één meter is. Een minuut gesprek is ruwweg een minuut audio van de beller plus een minuut modelaudio: $0,005 plus $0,018, dus ongeveer 2,3 cent per minuut tegen het gepubliceerde tarief. De kosten-per-uurkolom van Artificial Analysis, die de kosten voor het voltooien van een vaste set audio-reasoningtaken normaliseert naar een uurbedrag, zet het standaardmodel op $0,84 per uur aan inputaudio — het goedkoopste betaalde tarief in dat overzicht — en de Extended Thinking-variant op $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

De rekensom van ElevenLabs is lastiger, en dat is eerder het punt dan een kritiekpunt. Een agentminuut heeft niet één prijs: er is de platformheffing voor de agentminuut zelf, de taalmodel-tokens die op de middelste schakel worden verbruikt, en de carrier-minuten daaronder — drie meters, in het slechtste geval drie leveranciers, en een factuur die verandert zodra een van hen verandert. De synthesisekant is inzichtelijker: ElevenLabs Eleven v3 voor $100 per miljoen tekens is ongeveer $8 per uur aan doorlopende vertelling bij normale spreeksnelheden, tegenover ongeveer $2,70 voor de goedkoopste open-weights-concurrent in dezelfde arena. ElevenLabs rekent een toeslag voor de stem, en op die ranglijst is die toeslag reëel — het staat overall op de vierde plaats.

Wat de twee kostenstructuren in de praktijk betekenen, is dat Gemini 3.8 Live goedkoper is per gespreksminuut en veel goedkoper per uur audio, terwijl ElevenLabs duurder is en veel voorspelbaarder om te beheren. Een team zonder ML-engineers en met een telefoonnummer dat moet worden opgezet, zal in de eerste maand minder uitgeven aan ElevenLabs, omdat het alternatief is om te bouwen wat ElevenLabs al heeft gebouwd. Een team dat al zijn eigen sessiebeheer en zijn eigen carrier draait, zal minder uitgeven aan het ruwe model, omdat ze niet betalen voor een pipeline die ze al hebben.

Waar ElevenLabs echt beter in is

Het zou gemakkelijk zijn om het prijsverschil als een oordeel te lezen. Dat is het niet, en de redenen daarvoor zijn precies de redenen die een tariefkaart nooit laat zien.

• Telefonie. ElevenLabs verkoopt telefoonnummers, SIP-trunking en de gelijktijdigheid om oproepen te beantwoorden. Google verkoopt een model dat spreekt. Als je product een telefoonlijn is, is het gat tussen die twee zinnen maanden aan engineering.

• Stemidentiteit. De Voice Library, de cloning-pipeline en de dubbingstudio vormen een volwassen productoppervlak. Gemini 3.8 Live geeft je een model; het geeft je geen catalogus van gelicentieerde stemmen of een workflow om een bestaande opname naar negen talen te lokaliseren.

• Standaard een transcript. Omdat een cascade eerst transcribeert en dan redeneert, krijg je gratis tekstlogs van elk gesprek — nuttig voor compliance, voor evaluatie, en voor het ondankbare werk van uitzoeken waarom de agent iets fout deed. Een native spraak-naar-spraak-model heeft zo'n artefact niet, tenzij je er zelf een bouwt.

• Verwisselbare onderdelen. Wanneer er een beter taalmodel op de markt komt, kan een ElevenLabs-cascade het overnemen zonder iets opnieuw te trainen. Dat is precies waarom de gedocumenteerde stack een Google-model in het midden heeft — en het is het allersterkste argument voor de cascade-architectuur.

Wat het ruwe model je oplevert

Het tegenargument gaat niet over prijs. Het gaat erom wat één enkele forward pass kan doen wat drie fasen niet kunnen.

Gemini 3.8 Live hoort prosodie, toon en aarzeling rechtstreeks in plaats van via een transcript dat die al heeft weggegooid, waardoor het midden in een zin van taal kan wisselen en waardoor zijn score voor gespreksdynamiek — 96,1% voor het standaardmodel, volgens Artificial Analysis — de enige component is waarin het zijn eigen redeneerzware broertje verslaat. Het voert ook tool- en API-aanroepen op de achtergrond uit terwijl het blijft praten, zodat een opzoeking geen stilte oplevert. En de Extended Thinking-variant is een werkelijk andere capaciteit in plaats van een grotere versie van dezelfde: hij lost 68,6% van de τ-Voice-klantenservicescenario's op tegenover 30,1% voor het standaardmodel, een gat van 38 punten dat het grootste afzonderlijke getal in de release is en de reden dat Google de lijn in tweeën heeft gesplitst.

Als de taak van je agent is om een taak met meerdere stappen af te ronden in plaats van een aangenaam gesprek te voeren, dan is die kloof van 38 punten de hele beslissing, en het kost $3,50 per uur in plaats van $0,84 — nog steeds onder elk model dat het op dat bord verslaat.

Het middelste been is het been dat je daadwerkelijk kunt bewegen.

Hier is de naad die het benoemen waard is, want dit is waar de architectuurvraag een inkoopvraag wordt. In een cascade is het middelste been — het deel dat bepaalt wat er gezegd moet worden, de tools aanroept en het redeneerwerk doet — gewone tekstinferentie. Het is ook het been met de meeste kostenvariantie, de meeste lock-in en de minste reden om aan één enkele leverancier gebonden te zijn. De stack die ElevenLabs documenteert, gebruikt daar toevallig een Gemini-model. Dat hoeft niet.

OrcaRouter dekt dat deel en niet de buitenste twee. Wij hosten de Gemini 3.8 Live voice-endpoints niet — die komen van Google's eigen Live API — en we hosten ElevenLabs niet, waarvan de synthese- en agentlagen een eigen product vormen. Wat wij leveren is de tekstlaag eronder: 200+ modellen achter één enkele sleutel tegen de listprijs van de provider, zonder opslag, zodat een prijsverlaging van een upstream-lab dezelfde dag op je factuur terechtkomt in plaats van bij de volgende verlenging. Voor een voice-stack specifiek verdienen drie van die eigenschappen zichzelf terug. Automatische failover houdt een gesprek in leven wanneer een backend midden in een zin een fout geeft of een time-out krijgt — een storing die de beller onmiddellijk merkt. De routing-DSL componeert meerdere modellen tot één aanroep, zodat een goedkoop model de bevestigingsbeurten kan afhandelen en een sterker model de transactie kan overnemen. En model fusion laat een panel samen antwoorden op de beurten waar het oordeel van één enkel model niet goed genoeg is om er alleen op te vertrouwen. Wijzigen welk model in het midden van een cascade zit, is een configuratiewijziging, geen herbouw — en dat is precies de reden dat de cascade-architectuur bestaat.

Welke moet je kiezen?

Kies ElevenLabs als je een telefoonlijn uitrolt en je geen voice-stack wilt bouwen. Je koopt telefonie, een stemcatalogus, transcripten, gelijktijdigheid en een supportcontract, en de meerprijs per minuut is wat die kosten. Je koopt ook de mogelijkheid om halverwege van model te wisselen zonder iets anders te veranderen, wat meer waard is dan het klinkt.

Kies Gemini 3.8 Live als spraak een functie is van iets dat je al beheert. Je krijgt het goedkoopste competente spraak-naar-spraak-tarief dat op dit moment door wie dan ook wordt gepubliceerd, 97 talen met schakelen midden in het gesprek, uitvoering van tools die doorloopt terwijl het model blijft praten, en — als je agent taken moet voltooien in plaats van alleen te converseren — het agentische gat van 38 punten dat de Extended Thinking-variant oplevert voor ongeveer vier keer de uurlijkse audiokosten. Jij levert de carrier, de sessielevenscyclus en de logs.

Waar op te letten: of ElevenLabs één latentiecijfer publiceert voor een beheerde agentminuut, want dat is het cijfer dat deze vergelijking kwantitatief zou maken in plaats van structureel; en of het resultaat van de Speech Agent Arena overeind blijft wanneer een agent die op 3.8 Live is gebouwd erop wordt gemeten, want dat een cascade momenteel een native model verslaat op taaksucces is het interessantste in deze confrontatie en het minst verklaarde.