Ett genererat hjältekort för artikeln ”Gemini 3.8 Live vs ElevenLabs”, som visar två rundade kort på varsin sida om rubriken. Det vänstra kortet visar ”Gemini 3.8 Live” ovanför en ikon med moln och vågform samt raden ”tal till tal, ett pass, per minut”; det högra kortet visar ”ElevenLabs Agents” ovanför en pipeline-ikon med tre block märkt ”STT - LLM - TTS” och raden ”sammansatt, per agentminut”. En underrubrik lyder ”En komponent du hyr vs ett system som hyr komponenter”. OrcaRouter-logotypen är inlagd i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 Live vs ElevenLabs: En modell mot en pipeline

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Öppna ElevenLabs dokumentation för agentplattformen, och där sitter en Gemini-modell mitt i. ElevenLabs Agents är en kaskad – en front-end för taligenkänning, en språkmodell och en back-end för text-till-tal – och språkmodellen i den publicerade stacken är en Gemini. Det är rätt plats att börja en Gemini 3.8 Live vs ElevenLabs-jämförelse, eftersom de två sakerna som jämförs inte är samma typ av objekt. Gemini 3.8 Live är tal-till-tal-modellen, släppt på Live API den 15 september 2026, prissatt per minut ljud. ElevenLabs Eleven v3 är flaggskeppssyntesmodellen från en röstplattform som också säljer ElevenLabs Agents, och den är prissatt per tecken, inte per konversation. Den ena är en komponent du kan hyra. Den andra är ett system som hyr komponenter – inklusive, i åtminstone en publicerad konfiguration, en Gemini-modells.

Den asymmetrin avgör de flesta av de frågor som folk faktiskt tar med sig till den här jämförelsen. Om du frågar vilken man ska anropa, är det ärliga svaret att de inte är substitut: den ena är en modell med en prislista och ingen telefoni, den andra är en produkt med telefoni, samtidighetsbegränsningar och tre mätare som körs samtidigt. Vilken som är billigare, bättre eller snabbare beror helt och hållet på vilken av dessa två former ditt program redan är.

En modell, eller tre modeller i följd

Gemini 3.8 Live är ett inbyggt tal-till-tal-system. Ljud går in, ljud kommer ut, och resonemanget sker i samma framåtpassning som producerar talet – en modell, en latensbudget, en faktura. Google lanserade det i två varianter den 15 september 2026: gemini-3.8-live för konversationsarbete i stor skala, och gemini-3.8-live-extended-thinking för samma gränssnitt med flerstegsresonemang bakom. Båda hanterar 97 språk med växling mitt i konversationen, båda bearbetar visuella indata nästan i realtid, båda kör verktygs- och API-anrop i bakgrunden medan konversationen fortsätter, och båda vattenmärker varje sekund av genererat ljud med SynthID. Den publicerade avgiften är $0,005 per minut för ljudinmatning och $0,018 per minut för ljudutmatning.

ElevenLabs Agents är inte det. Det är en pipeline, och pipelinen är produkten. En realtidsmodell för taligenkänning transkriberar den som ringer, en språkmodell avgör vad som ska sägas, och en syntesmodell – Eleven Flash v2 i den konfiguration som ElevenLabs dokumenterar – talar svaret. Varje steg mäts separat, varje steg kan bytas ut, och allt ligger bakom ett hanterat lager som sköter telefoni, turdetektering och samtidighet. ElevenLabs Eleven v3, företagets främsta syntesmodell, är ännu en annan produkt: en text-till-tal-modell som kostar 100 dollar per miljon tecken och säljs för uppläsning, dubbning och röstdesign snarare än för att föra en konversation.

Så det första man måste få rätt på är att "Gemini 3.8 Live vs ElevenLabs Eleven v3" inte är en direkt duell mellan två talmodeller. Eleven v3 tar inte emot ljudinmatning och för ingen konversation. Den jämförelse som är meningsfull är Gemini 3.8 Live mot ElevenLabs Agents, där Eleven v3 bara är med som det tak för synteskvaliteten som plattformen är byggd kring.

Var var och en faktiskt sitter på en bräda

Det finns ingen topplista som rankar dessa två mot varandra, och anledningen är lärorik: de fortsätter att dyka upp på olika listor som mäter olika saker.

Screenshot of the Artificial Analysis Speech to Speech AI Model & Provider Leaderboard page, captured September 2026, showing the page header and title, the methodology blurb describing comparison across reasoning quality, conversational dynamics, generation time and price, Highlights cards for the AA-Speech to Speech Index, Arena and Time to first audio, a Related Links panel listing the Text to Speech, Speech to Text and Speech Agent Arena leaderboards, and the Cost per Hour of Input Audio chart with its cheapest bar at $0.78 beneath the Speech to Speech Index / Index by Component panel.

I Artificial Analysiss Speech to Speech Index – som sammanväger talresonemang, agentisk uppgiftslösning, arena-preferens och uppgiftsframgång till ett enda tal – får Gemini 3.8 Live 76,0, med varianten Extended Thinking på 82,6 på första plats. Det är mätningar som Artificial Analysis kör i sitt eget testramverk, inte siffror som Google har publicerat, även om Googles eget tillkännagivande citerar siffror från samma komponenter.

ElevenLabs förekommer inte alls på den tavlan, eftersom de inte levererar någon tal-till-tal-modell att mäta. Där det däremot förekommer är i Speech Agent Arena, som utvärderar sammansatta agenter snarare än modeller, och bilden där är verkligen blandad: ElevenLabs Agents har uppmätts till 937 Elo med en uppgiftsframgångsgrad på 90,5 %, mot 1 046 Elo och 74,6 % uppgiftsframgång för en agent byggd på den tidigare generationen av Gemini Live, där Gemini-agenten når första ljudet på 0,96 sekunder. Läs det paret noga. Den Gemini-baserade agenten vinner på preferens och hastighet; ElevenLabs-agenten vinner på att få uppgiften utförd. Det är en kaskad som slår en nativ modell i tillförlitlighet, vilket inte är resultatet som arkitekturdiagrammen skulle förutspå.

Två förbehåll rörande dessa siffror, och båda spelar roll. Gemini-sidan av den jämförelsen använde Gemini Live-generationen från tidigt 2026, inte 3.8 Live, så den säger inget om den modell som den här artikeln handlar om. Och den tredje tavlan i spel — Artificial Analysis Provider Voices tal-arena, som rangordnar syntesmodeller — placerar ElevenLabs Eleven v3 på 1 177 Elo och den konversationella varianten, ElevenLabs v3 Conversational, på 1 219 Elo, mot 1 283 för ledaren, Cartesia Sonic 3.6. Den tavlan mäter hur bra rösten låter, inte hur väl agenten presterar, och att blanda de två är hur folk till slut citerar en syntespoäng som bevis för ett konversationssystem.

Spec-kontrast

A generated two-column scoreboard titled 'Gemini 3.8 Live vs ElevenLabs - the scoreboard'. The Gemini 3.8 Live column reads: Architecture 'native speech to speech', Audio in 'yes, one pass', Audio out 'yes, one pass', Languages '97, mid-conversation switching', Audio price '$0.005 in / $0.018 out per minute', Telephony 'none first-party', Agent tooling 'bring your own', Task success '93.2% (AA component)'. The ElevenLabs column reads: Architecture 'cascaded STT - LLM - TTS', Audio in 'yes, via Scribe v2 Realtime', Audio out 'yes, via Eleven Flash v2', Languages '74 on Eleven v3', Audio price 'per agent minute, plus LLM tokens', Telephony 'managed, first-party', Agent tooling 'built in', Task success '90.5% (Speech Agent Arena)'. Footer: 'Gemini 3.8 Live figures per Artificial Analysis and vendor materials; ElevenLabs figures vendor-reported. Not a like-for-like head-to-head.'

• Arkitektur — Gemini 3.8 Live är en enda nativ tal-till-tal-modell, medan ElevenLabs Agents är en kaskad av taligenkänning, en språkmodell och syntes

• In- och utdata – Gemini 3.8 Live tar emot ljud och returnerar ljud i en enda omgång, medan ElevenLabs tar emot ljud via Scribe v2 Realtime och returnerar det via Eleven Flash v2, med en texttranskription däremellan

• Vad du kan byta ut — Gemini 3.8 Live ingenting, modellen är modellen vs ElevenLabs varje steg oberoende, inklusive språkmodellen, som i den dokumenterade stacken är en från Google

• Språk — Gemini 3.8 Live 97 med växling mitt i samtalet vs ElevenLabs Eleven v3 74

• Ljudprissättning — Gemini 3.8 Live $0,005 per minut in och $0,018 per minut ut jämfört med ElevenLabs som prissätts utifrån agentminuter, med språkmodelltokens mätta separat ovanpå

• Telefoni — Gemini 3.8 Live ingen förstapart, du tar med din egen operatör och sessionshantering jämfört med ElevenLabs hanterad, förstapart

• Samtidighet — Gemini 3.8 Live, så mycket som din Live API-kvot tillåter, kontra ElevenLabs som säljs i samtidighetsnivåer

• Agentverktyg — Gemini 3.8 Live bakgrundsverktyg och API-körning i modellen vs ElevenLabs, ett hanterat agentlager med turerkänning, arbetsflöden och ett röstbibliotek

• Öppen artefakt – ingendera. Båda är stängda, endast molnbaserade och proprietära

• Latens — Gemini 3.8 Live 1,18 sekunder till första ljudet för standardmodellen och 1,35 för Extended Thinking, enligt Artificial Analysis, medan ElevenLabs inte har publicerat ett enda nummer, eftersom en kaskads latens är summan av tre steg

Den sista raden är den som förklarar arkitekturvalet bättre än någon av de andra. En nativ modell har en latensbudget. En kaskad har tre, och anledningen till att team fortfarande väljer kaskaden är allt ovanför den: transkriptet du kan logga, steget du kan byta ut och telefonnumret som bara fungerar.

Vad en minut kostar, åt båda hållen

Gemini 3.8 Lives aritmetik är ovanligt enkel eftersom det bara finns en mätare. En minut samtal är ungefär en minut ljud från den som ringer plus en minut modelljud: $0,005 plus $0,018, alltså ungefär 2,3 cent per minut enligt den publicerade taxan. Kolumnen för kostnad per timme från Artificial Analysis, som normaliserar kostnaden för att slutföra en fast ljudresoneringsuppsättning till en timsiffra, anger standardmodellen till $0,84 per timme ingående ljud — den billigaste betalda taxan på den resultattavlan — och varianten Extended Thinking till $3,50.

Screenshot of the ElevenLabs pricing page captured September 2026, showing the ElevenCreative, ElevenAgents and ElevenAPI product tabs, a Monthly billing toggle, and the Free, Starter, Creator and Pro plan cards with their monthly prices of $0, $6, $11 and $99, the 'First month 50% off' promotion on Pro, and each tier's included credit allowance and feature list.

ElevenLabs aritmetik är svårare, och det är poängen snarare än en kritik. En agentminut har inte ett enda pris: det finns plattformsavgiften för själva agentminuten, de språkmodelltokens som förbrukas på mellanbenet, och operatörsminuterna därunder — tre mätare, tre leverantörer i värsta fall, och en räkning som ändras när någon av dem ändras. Syntessidan är mer begriplig: ElevenLabs Eleven v3 till $100 per miljon tecken är ungefär $8 i timmen för kontinuerlig uppläsning vid vanlig taltakt, mot cirka $2.70 för den billigaste konkurrenten med öppna vikter på samma arena. ElevenLabs tar ut ett merpris för rösten, och på den tavlan är merpriset verkligt — den ligger på fjärde plats totalt.

Vad de två kostnadsstrukturerna innebär i praktiken är att Gemini 3.8 Live är billigare per konversationsminut och mycket billigare per ljudtimme, medan ElevenLabs är dyrare och mycket mer förutsägbart att driva. Ett team utan ML-ingenjörer och med ett telefonnummer att sätta upp kommer att lägga mindre på ElevenLabs under den första månaden, eftersom alternativet är att bygga det som ElevenLabs redan har byggt. Ett team som redan kör sin egen sessionshantering och sin egen operatör kommer att lägga mindre på råmodellen, eftersom de inte betalar för en pipeline som de redan har.

Vad ElevenLabs verkligen är bättre på

Det skulle vara lätt att läsa prisskillnaden som en dom. Det är den inte, och anledningarna är sådana som ett prisblad aldrig visar.

• Telefoni. ElevenLabs säljer telefonnummer, SIP-trunkering och samtidigheten att svara på samtal. Google säljer en modell som talar. Om din produkt är en telefonlinje är gapet mellan de två meningarna månader av ingenjörsarbete.

• Röstidentitet. Voice Library, kloningspipelinen och dubbningsstudion är en mogen produktyta. Gemini 3.8 Live ger dig en modell; det ger dig inte en katalog över licensierade röster eller ett arbetsflöde för att lokalisera en befintlig inspelning till nio språk.

En transkription som standard. Eftersom en kaskad transkriberar innan den resonerar får du textloggar över varje samtal gratis – användbara för regelefterlevnad, för utvärdering och för det oglamorösa arbetet med att ta reda på varför agenten gjorde något fel. En nativ tal-till-tal-modell har ingen sådan artefakt om du inte bygger en.

• Utbytbara delar. När en bättre språkmodell lanseras kan en ElevenLabs-kaskad ta den i bruk utan att träna om någonting. Det är precis därför den dokumenterade stacken har en Google-modell i mitten — och det är det enskilt starkaste argumentet för kaskadarkitekturen.

Vad den råa modellen ger dig

Motargumentet handlar inte om pris. Det handlar om vad en enda framåtpassning kan göra som tre steg inte kan.

Gemini 3.8 Live hör prosodi, tonfall och tvekan direkt i stället för genom en transkription som redan har kastat bort dem, vilket är anledningen till att den kan byta språk mitt i en mening och till att dess poäng för samtalsdynamik – 96,1 % för standardmodellen, enligt Artificial Analysis – är den enda komponent där den slår sitt eget resonemangstunga syskon. Den kör också verktygs- och API-anrop i bakgrunden medan den fortsätter tala, så en uppslagning leder inte till tystnad. Och varianten Extended Thinking är en genuint annan förmåga snarare än en större version av samma sak: den löser 68,6 % av τ-Voice kundtjänstscenarier mot 30,1 % för standardmodellen, en lucka på 38 punkter som är det största enskilda talet i lanseringen och anledningen till att Google delade upp produktlinjen i två.

Om din agents uppgift är att slutföra en flerstegsuppgift snarare än att föra ett trevligt samtal, är det där 38-punktsgapet hela avgörandet, och den kostar 3,50 dollar i timmen i stället för 0,84 dollar – fortfarande lägre än varje modell som den slår på den resultattavlan.

Det mittersta benet är det du faktiskt kan röra

Här är skarven som är värd att namnge, för det är där arkitekturfrågan övergår i en upphandlingsfråga. I en kaskad är det mellersta benet – delen som bestämmer vad som ska sägas, anropar verktygen och utför resonemanget – vanlig textinferens. Det är också benet med störst kostnadsvariation, mest inlåsning och minst anledning att vara knutet till en enda leverantör. Stacken som ElevenLabs dokumenterar råkar använda en Gemini-modell där. Det behöver den inte.

OrcaRouter täcker den delen och inte de två yttre. Vi hostar inte röstslutpunkterna för Gemini 3.8 Live – de kommer från Googles eget Live API – och vi hostar inte ElevenLabs, vars syntes- och agentlager är en egen produkt. Det vi tillhandahåller är textlagret under: 200+ modeller bakom en enda nyckel till leverantörens listpris utan påslag, så att en prissänkning från ett uppströmslabb når din faktura samma dag i stället för vid nästa förnyelse. För just en röststack gör tre av dessa egenskaper nytta. Automatisk failover håller ett samtal vid liv när en backend får fel eller tidsutfall mitt i en mening, vilket är ett fel som den som ringer märker omedelbart. Routnings-DSL:en komponerar flera modeller till ett anrop, så att en billig modell kan hantera bekräftelseturerna och en starkare kan ta transaktionen. Och modellfusion låter en panel svara tillsammans på de turer där en enskild modells omdöme inte är tillräckligt bra för att litas på ensam. Att ändra vilken modell som sitter i mitten av en kaskad är en konfigurationsändring, inte en ombyggnad – vilket är hela anledningen till att kaskadarkitekturen finns.

Vilken ska man välja?

Välj ElevenLabs om du lanserar en telefonlinje och inte vill bygga en röststack. Du köper telefoni, en röstkatalog, transkriptioner, samtidighet och ett supportavtal, och premien per minut är vad dessa kostar. Du köper också möjligheten att byta modell mitt i utan att ändra något annat, vilket är värt mer än det låter.

Välj Gemini 3.8 Live om rösten är en funktion i något du redan driver. Du får den billigaste kompetenta tal-till-tal-taxan som någon för närvarande publicerar, 97 språk med växling mitt i samtalet, verktygskörning som körs medan modellen fortsätter prata och – om din agent måste slutföra uppgifter i stället för att bara samtala – det 38-punktiga agentiska gapet som Extended Thinking-varianten köper för ungefär fyra gånger den timvisa ljudkostnaden. Du tillhandahåller operatören, sessionens livscykel och loggarna.

Vad man bör hålla koll på: huruvida ElevenLabs publicerar en enda latenssiffra för en hanterad agentminut, eftersom det är siffran som skulle göra den här jämförelsen kvantitativ i stället för strukturell; och huruvida resultatet för Speech Agent Arena håller när en agent byggd på 3.8 Live mäts på det, eftersom en kaskad som för närvarande slår en nativ modell i uppgiftsframgång är det mest intressanta i den här matchningen och det minst förklarade.