
Gemini 3.8 Live vs ElevenLabs: model kontra pipeline
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Otwórz dokumentację ElevenLabs dotyczącą jej platformy agentowej, a w środku znajdziesz model Gemini. ElevenLabs Agents to kaskada — frontend rozpoznawania mowy, model językowy i backend syntezy mowy — a model językowy w opublikowanym stosie to Gemini. To właściwe miejsce, aby rozpocząć porównanie Gemini 3.8 Live z ElevenLabs, ponieważ porównywane rzeczy nie są tym samym rodzajem obiektu. Gemini 3.8 Live to model mowa-do-mowy, udostępniony w Live API 15 września 2026 r., wyceniany za minutę dźwięku. ElevenLabs Eleven v3 to flagowy model syntezy platformy głosowej, która sprzedaje również ElevenLabs Agents, i jest wyceniany za znak, a nie za rozmowę. Jeden to komponent, który możesz wynająć. Drugi to system, który wynajmuje komponenty — w tym, w co najmniej jednej opublikowanej konfiguracji, komponent modelu Gemini.
Ta asymetria rozstrzyga większość pytań, które ludzie faktycznie zadają w tym zestawieniu. Jeśli pytasz, który z nich wywołać, szczera odpowiedź brzmi: nie są substytutami: jeden to model z cennikiem i bez telefonii, drugi to produkt z telefonią, limitami współbieżności i trzema licznikami działającymi jednocześnie. To, który z nich jest tańszy, lepszy albo szybszy, zależy wyłącznie od tego, którą z tych dwóch form Twoja aplikacja już ma.
Jeden model albo trzy modele sekwencyjnie
Gemini 3.8 Live to natywny system konwersji mowy na mowę. Dźwięk trafia na wejście, dźwięk wychodzi na wyjściu, a rozumowanie odbywa się w tym samym przebiegu w przód, który generuje mowę — jeden model, jeden budżet opóźnień, jeden rachunek. Google udostępnił go w dwóch wariantach 15 września 2026 r.: gemini-3.8-live do pracy konwersacyjnej na dużą skalę oraz gemini-3.8-live-extended-thinking dla tego samego interfejsu z wieloetapowym rozumowaniem w tle. Oba obsługują 97 języków ze zmianą języka w trakcie rozmowy, oba przetwarzają dane wejściowe wizualne niemal w czasie rzeczywistym, oba wykonują wywołania narzędzi i interfejsów API w tle, podczas gdy rozmowa trwa, a oba znakują wodnym znakiem każdą sekundę wygenerowanego dźwięku za pomocą SynthID. Opublikowana stawka wynosi 0,005 USD za minutę wejścia audio i 0,018 USD za minutę wyjścia audio.
ElevenLabs Agents to nie to. To pipeline, a pipeline jest produktem. Model rozpoznawania mowy w czasie rzeczywistym transkrybuje dzwoniącego, model językowy decyduje, co powiedzieć, a model syntezy — Eleven Flash v2 w konfiguracji udokumentowanej przez ElevenLabs — wypowiada odpowiedź. Każdy etap jest rozliczany osobno, każdy etap można wymienić, a całość znajduje się za zarządzaną warstwą, która obsługuje telefonię, wykrywanie tur i współbieżność. ElevenLabs Eleven v3, flagowy model syntezy firmy, to znowu inny produkt: model tekst-na-mowę w cenie 100 USD za milion znaków, sprzedawany do narracji, dubbingu i projektowania głosu, a nie do prowadzenia rozmowy.
Pierwszą rzeczą, którą trzeba dobrze zrozumieć, jest to, że „Gemini 3.8 Live vs ElevenLabs Eleven v3” nie jest bezpośrednim starciem dwóch modeli mowy. Eleven v3 nie przyjmuje danych wejściowych audio i nie prowadzi rozmowy. Porównaniem, które ma sens, jest Gemini 3.8 Live z ElevenLabs Agents, a Eleven v3 występuje tu wyłącznie jako pułap jakości syntezy, wokół którego zbudowano platformę.
Gdzie każde z nich faktycznie znajduje się na planszy
Nie ma rankingu, który stawiałby ich naprzeciw siebie, a powód jest pouczający: nieustannie pojawiają się na różnych listach, które mierzą różne rzeczy.

W Indeksie Speech to Speech firmy Artificial Analysis — który łączy rozumowanie mowy, ukończenie zadań agentowych, preferencje areny i sukces zadania w jedną liczbę — Gemini 3.8 Live uzyskuje 76,0, a wariant Extended Thinking z wynikiem 82,6 na pierwszym miejscu. Są to pomiary, które Artificial Analysis przeprowadza w ramach własnego harnessu, a nie dane opublikowane przez Google, choć w ogłoszeniu samego Google cytowane są liczby z tych samych komponentów.
ElevenLabs w ogóle nie pojawia się na tej tablicy, ponieważ nie udostępnia modelu mowa-do-mowy, który można by zmierzyć. Pojawia się natomiast w Speech Agent Arena, która ocenia złożonych agentów, a nie modele, i obraz tam jest naprawdę mieszany: ElevenLabs Agents zmierzono na 937 Elo przy 90,5% skuteczności realizacji zadań, w porównaniu z 1 046 Elo i 74,6% skuteczności realizacji zadań dla agenta zbudowanego na poprzedniej generacji Gemini Live, przy czym agent Gemini osiągał pierwsze audio w 0,96 sekundy. Przyjrzyj się uważnie tej parze. Agent oparty na Gemini wygrywa pod względem preferencji i szybkości; agent ElevenLabs wygrywa pod względem doprowadzania zadania do końca. To kaskada pokonująca natywny model pod względem niezawodności, co nie jest wynikiem, którego przewidywałyby diagramy architektury.
Dwie uwagi do tych liczb, obie istotne. Strona Gemini w tym porównaniu użyła wczesnej generacji Gemini Live z początku 2026 r., a nie 3.8 Live, więc nie jest to odczyt modelu, o którym jest ten artykuł. A trzecia tablica brana pod uwagę — arena mowy Provider Voices od Artificial Analysis, która rankinguje modele syntezy — plasuje ElevenLabs Eleven v3 na 1177 Elo, a wariant konwersacyjny, ElevenLabs v3 Conversational, na 1219 Elo, wobec 1283 dla lidera, Cartesia Sonic 3.6. Ta tablica mierzy, jak dobrze brzmi głos, a nie jak dobrze radzi sobie agent; mieszanie tych dwóch rzeczy prowadzi do tego, że ludzie cytują wynik syntezy jako dowód na temat systemu konwersacyjnego.
Kontrast specyfikacji

• Architektura — Gemini 3.8 Live to jeden natywny model mowa-mowa, podczas gdy ElevenLabs Agents to kaskada rozpoznawania mowy, modelu językowego i syntezy
• Wejście i wyjście — Gemini 3.8 Live przyjmuje dźwięk i zwraca dźwięk w jednym przebiegu, w przeciwieństwie do ElevenLabs, które przyjmuje dźwięk przez Scribe v2 Realtime i zwraca go przez Eleven Flash v2, z transkrypcją tekstową pomiędzy
• Co możesz wymienić — w Gemini 3.8 Live nic, model to model, a w ElevenLabs każdy etap niezależnie, w tym model językowy, który w udokumentowanym stosie jest rozwiązaniem Google
• Języki — Gemini 3.8 Live 97 z przełączaniem w trakcie rozmowy vs ElevenLabs Eleven v3 74
• Cennik audio — Gemini 3.8 Live 0,005 USD za minutę wejścia i 0,018 USD za minutę wyjścia vs ElevenLabs rozliczany za minuty agenta, z tokenami modelu językowego rozliczanymi osobno dodatkowo
• Telefonia — Gemini 3.8 Live: brak własnego rozwiązania, samodzielnie zapewniasz operatora i zarządzanie sesjami vs ElevenLabs: zarządzane, własne
• Współbieżność — Gemini 3.8 Live: tyle, na ile pozwala limit Twojego Live API, kontra ElevenLabs sprzedawany w pakietach współbieżności
• Narzędzia agentowe — Gemini 3.8 Live: narzędzie działające w tle i wykonywanie wywołań API wewnątrz modelu vs ElevenLabs: zarządzana warstwa agentowa z detekcją tur, przepływami pracy i biblioteką głosów
• Otwarty artefakt — żaden. Oba są zamknięte, wyłącznie chmurowe i własnościowe.
• Opóźnienie — Gemini 3.8 Live 1,18 sekundy do pierwszego dźwięku w przypadku modelu standardowego i 1,35 w przypadku Extended Thinking, według Artificial Analysis; dla ElevenLabs nie jest publikowane jako pojedyncza liczba, ponieważ opóźnienie kaskady jest sumą trzech etapów
Ostatni wiersz wyjaśnia wybór architektury lepiej niż jakikolwiek inny. Model natywny ma jeden budżet opóźnień. Kaskada ma trzy, a powodem, dla którego zespoły wciąż wybierają kaskadę, jest wszystko powyżej: transkrypcja, którą można rejestrować, etap, który można podmienić, oraz numer telefonu, który po prostu działa.
Ile kosztuje minuta w obie strony
Arytmetyka Gemini 3.8 Live jest wyjątkowo prosta, ponieważ jest tylko jeden licznik. Minuta rozmowy to w przybliżeniu minuta audio rozmówcy plus minuta audio modelu: $0,005 plus $0,018, czyli około 2,3 centa na minutę według opublikowanej stawki. Kolumna kosztu na godzinę w Artificial Analysis, która normalizuje koszt ukończenia stałego zestawu rozumowania audio do wartości godzinowej, określa model standardowy na poziomie $0,84 za godzinę audio wejściowego — najtańsza płatna stawka w tym zestawieniu — a wariant Extended Thinking na poziomie $3,50.

Arytmetyka ElevenLabs jest trudniejsza i to jest sedno, a nie zarzut. Minuta agenta nie ma jednej ceny: jest opłata platformy za samą minutę agenta, tokeny modelu językowego zużywane na środkowym odcinku i minuty operatora pod spodem — trzy liczniki, w najgorszym razie trzech dostawców, i rachunek, który zmienia się, gdy zmieni się którykolwiek z nich. Strona syntezy jest bardziej czytelna: ElevenLabs Eleven v3 po 100 USD za milion znaków to około 8 USD za godzinę ciągłej narracji przy zwykłym tempie mówienia, w porównaniu z około 2,70 USD dla najtańszego konkurenta z otwartymi wagami na tej samej arenie. ElevenLabs pobiera dopłatę za głos, a w tym zestawieniu ta dopłata jest realna — ogólnie zajmuje czwarte miejsce.
To, co te dwie struktury kosztów oznaczają w praktyce, to że Gemini 3.8 Live jest tańszy za minutę rozmowy i znacznie tańszy za godzinę audio, podczas gdy ElevenLabs jest droższy i znacznie bardziej przewidywalny w obsłudze. Zespół bez inżynierów ML i z numerem telefonu do uruchomienia wyda mniej na ElevenLabs w pierwszym miesiącu, ponieważ alternatywą jest zbudowanie tego, co ElevenLabs już zbudował. Zespół, który już prowadzi własne zarządzanie sesjami i własnego operatora, wyda mniej na sam model, ponieważ nie płaci za pipeline, który już ma.
W czym ElevenLabs jest naprawdę lepszy
Łatwo byłoby odczytać tę różnicę w cenie jako wyrok. Tak jednak nie jest, a przyczyny są takie, jakich cennik nigdy nie pokazuje.
• Telefonia. ElevenLabs sprzedaje numery telefonów, trunking SIP i współbieżność pozwalającą odbierać połączenia. Google sprzedaje model, który mówi. Jeśli twoim produktem jest linia telefoniczna, luka między tymi dwoma zdaniami to miesiące prac inżynieryjnych.
• Tożsamość głosu. Biblioteka głosów, potok klonowania i studio dubbingu to dojrzały obszar produktu. Gemini 3.8 Live daje ci model; nie daje ci katalogu licencjonowanych głosów ani przepływu pracy do lokalizowania istniejącego nagrania na dziewięć języków.
• Domyślnie transkrypcja. Ponieważ kaskada najpierw transkrybuje, a dopiero potem rozumuje, otrzymujesz za darmo tekstowe logi każdego wywołania — przydatne do celów zgodności, do ewaluacji oraz do niewdzięcznej pracy polegającej na ustalaniu, dlaczego agent coś źle zrobił. Natywny model mowa-do-mowy nie ma takiego artefaktu, chyba że go zbudujesz.
• Wymienne elementy. Gdy pojawi się lepszy model językowy, kaskada ElevenLabs może go przyjąć bez ponownego trenowania czegokolwiek. Właśnie dlatego udokumentowany stos ma w środku model Google — i to jest najsilniejszy argument na rzecz architektury kaskadowej.
Co daje ci surowy model
Kontrargument nie dotyczy ceny. Dotyczy tego, co potrafi pojedynczy przebieg w przód, czego nie potrafią trzy etapy.
Gemini 3.8 Live słyszy prozodię, ton i wahanie bezpośrednio, a nie przez transkrypcję, która już je zgubiła, dlatego potrafi zmieniać języki w połowie zdania i dlatego jego wynik w zakresie dynamiki konwersacyjnej — 96,1% dla modelu standardowego według Artificial Analysis — jest jedynym elementem, w którym przewyższa swojego własnego bliźniaka nastawionego na intensywne rozumowanie. Wykonuje też wywołania narzędzi i API w tle, nie przestając mówić, dzięki czemu wyszukiwanie nie powoduje ciszy. A wariant Extended Thinking to naprawdę inna możliwość, a nie większa wersja tej samej: rozwiązuje 68,6% scenariuszy obsługi klienta τ-Voice wobec 30,1% w przypadku modelu standardowego — 38-punktowa różnica, która jest największą pojedynczą liczbą w tym wydaniu i powodem, dla którego Google podzielił tę linię na dwie.
Jeśli zadaniem twojego agenta jest wykonanie wieloetapowego zadania, a nie prowadzenie przyjemnej rozmowy, ta 38-punktowa różnica rozstrzyga o całej decyzji, a kosztuje 3,50 dolara za godzinę zamiast 0,84 dolara — wciąż mniej niż każdy model przewyższany przez niego w tym rankingu.
Środkowa noga to ta, którą faktycznie można poruszyć.
Oto szew wart nazwania, ponieważ to tutaj pytanie architektoniczne zamienia się w pytanie zakupowe. W kaskadzie środkowy etap — część, która decyduje, co powiedzieć, wywołuje narzędzia i przeprowadza rozumowanie — to zwykłe wnioskowanie tekstowe. Jest to również etap z największą zmiennością kosztów, największym uzależnieniem i najmniejszym powodem, by wiązać się z jakimkolwiek pojedynczym dostawcą. Stos, który dokumentuje ElevenLabs, akurat używa tam modelu Gemini. Nie musi.
OrcaRouter obsługuje ten odcinek, a nie dwa zewnętrzne. Nie hostujemy endpointów głosowych Gemini 3.8 Live — te pochodzą z własnego Live API Google — i nie hostujemy ElevenLabs, którego warstwy syntezy i agentów są jego własnym produktem. To, co dostarczamy, to warstwa tekstowa pod spodem: ponad 200 modeli za jednym kluczem w cenie katalogowej dostawcy, bez marży, więc obniżka ceny od laboratorium wyżej w łańcuchu trafia na Twój rachunek tego samego dnia, a nie przy kolejnym odnowieniu. W przypadku stosu głosowego szczególnie trzy z tych właściwości się opłacają. Automatyczne przełączanie awaryjne utrzymuje połączenie przy błędzie lub przekroczeniu limitu czasu backendu w połowie zdania — a taką awarię rozmówca zauważa natychmiast. DSL routingu komponuje kilka modeli w jedno wywołanie, więc tani model może obsłużyć tury potwierdzeń, a mocniejszy może przejąć transakcję. A fuzja modeli pozwala panelowi odpowiadać wspólnie w turach, w których osąd pojedynczego modelu nie jest wystarczająco dobry, by zaufać mu samodzielnie. Zmiana tego, który model znajduje się w środku kaskady, to zmiana konfiguracji, a nie przebudowa — i właśnie dlatego architektura kaskadowa istnieje.
Który wybrać
Wybierz ElevenLabs, jeśli uruchamiasz linię telefoniczną i nie chcesz budować stosu technologii głosowych. Kupujesz telefonię, katalog głosów, transkrypcje, współbieżność i umowę wsparcia, a dopłata za minutę to koszt tych elementów. Kupujesz także możliwość zmiany modelu w trakcie bez zmieniania czegokolwiek innego, co jest warte więcej, niż się wydaje.
Wybierz Gemini 3.8 Live, jeśli głos jest funkcją czegoś, co już obsługujesz. Otrzymujesz najtańszą kompetentną stawkę za mowę na mowę, jaką ktokolwiek obecnie publikuje, 97 języków z przełączaniem w trakcie rozmowy, wykonywanie narzędzi, które działa, gdy model wciąż mówi, oraz — jeśli twój agent musi wykonywać zadania, a nie tylko rozmawiać — 38-punktową lukę agentową, którą wariant Extended Thinking kupuje za około czterokrotność godzinowego kosztu audio. Ty zapewniasz operatora, cykl życia sesji i logi.
Na co zwrócić uwagę: czy ElevenLabs opublikuje pojedynczą wartość opóźnienia dla zarządzanej minuty agenta, ponieważ to jest liczba, która uczyniłaby to porównanie ilościowym, a nie strukturalnym; oraz czy wynik Speech Agent Arena się obroni, gdy zostanie na nim zmierzony agent zbudowany na 3.8 Live, ponieważ kaskada obecnie bijąca model natywny pod względem skuteczności wykonania zadania jest najciekawszą rzeczą w tym starciu i najmniej wyjaśnioną.
