Wygenerowana karta hero dla „Gemini 3.8 TTS vs ElevenLabs” na białym tle z delikatnymi niebiesko-cyjanowymi akcentami gradientowymi. Lewa karta „ElevenLabs Eleven v3” zawiera $100 za 1 mln znaków, ponad 70 języków, Elo 1,167 i pozycję 17; prawa karta „Gemini 3.8 Flash TTS” zawiera $33 za 1 mln znaków, 130 języków, Elo 1,260 i pozycję 2. W wierszu stopki widnieje „Elo według Artificial Analysis Provider Voice Arena, wrzesień 2026”. Logo OrcaRouter zostało nałożone w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: co daje ci trzykrotnie wyższa cena

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Przy tym samym wolumenie flagowy model syntezy ElevenLabs kosztuje około trzy razy tyle, co nowy model tego samego dostawcy. ElevenLabs Eleven v3 rozlicza się stawką 0,10 USD za tysiąc znaków — 100 USD za milion — a Gemini 3.8 Flash TTS rozlicza się stawką 9,00 USD za milion tokenów audio, co Artificial Analysis normalizuje do 33,00 USD za milion znaków. To 3,0-krotna różnica na liczniku i najważniejszy fakt w tym porównaniu. Interesujące pytanie nie brzmi, czy ta różnica jest prawdziwa; brzmi, co właściwie kupuje się za dodatkowe sześćdziesiąt siedem dolarów za milion znaków, bo odpowiedź nie brzmi „lepsza mowa”.

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

Trzy metry, nie jeden

Na początek trzeba wyjaśnić, że te dwa produkty nie mierzą tego samego, a publikowane cenniki to ukrywają.

• ElevenLabs rozlicza się według liczby znaków. Eleven v3 kosztuje 0,10 USD za 1000 znaków, z limitem 5000 znaków na żądanie. Eleven v3 Conversational kosztuje 0,05 USD za 1000, a modele Flash i Turbo również 0,05 USD za 1000, ale z limitem 40 000 znaków na żądanie i deklarowanym opóźnieniem ~75 ms w porównaniu z ~280 ms w Eleven v3 Conversational.

Google rozlicza według tokenów, a tokeny audio to nie tokeny tekstowe. Gemini 3.8 Flash TTS pobiera 0,50 USD za milion tokenów tekstowych na wejściu i 9,00 USD za milion tokenów audio na wyjściu, rozliczanych przy 25 tokenach audio na sekundę generowanej mowy. Nie opublikowano żadnego limitu znaków na żądanie.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis nie wystawia rachunków żadnemu z nich; normalizuje. $100.00 i $33.00 za milion znaków w jej tabeli liderów Provider Voice Arena to pochodny wspólny mianownik, dzięki któremu tabela może w ogóle szeregować według ceny. Przydatne do proporcji, nie do wyceny.

Zatem uczciwa wersja wartości 3,0x jest następująca: na jedynej dostępnej porównywalnej podstawie Google to około jedna trzecia ceny. Co to oznacza w twoim własnym arkuszu kalkulacyjnym, zależy od tego, czy w twoim obciążeniu dominują krótkie czy długie ciągi znaków — licznik audio na sekundę i licznik tekstu na znak rozchodzą się gwałtownie w miarę wydłużania się wypowiedzi, ponieważ cisza, pauzy i wypełnienie prozodyczne kosztują tokeny audio, a nie znaki.

Przepracowany miesiąc

Weź milion znaków tekstu — mniej więcej długość średniej wielkości powieści — i zamień je jednorazowo na mowę.

• ElevenLabs Eleven v3 — 100,00 USD za syntezę, plus dowolny poziom planu, jakiego potrzebujesz, aby uruchomić go przy swojej współbieżności. Opublikowane plany przedstawiają się następująco: Starter za 6 USD, Creator za 22 USD, Pro za 99 USD, Scale za 299 USD i Business za 990 USD, a limity znaków są wliczone w te plany, a nie rozliczane osobno.

• Gemini 3.8 Flash TTS — równowartość 33,00 USD, czyli około 16,50 USD, jeśli zadanie można realizować wsadowo, ponieważ poziom Batch i Flex zmniejsza o połowę stawkę za audio do 4,50 USD za milion tokenów. Usługa Priority podnosi ją do 16,20 USD za milion, czyli równowartość około 59,40 USD, co nadal jest znacznie poniżej ElevenLabs.

• Gemini 3.8 Flash-Lite TTS — 6,00 USD za milion tokenów audio, co odpowiada około 22,10 USD przy tej samej normalizacji, kosztem 101 języków zamiast 130.

Przepuść ten sam milion znaków przez promocyjne ceny Google, a różnica jeszcze się powiększy, ponieważ oba nowe modele Gemini TTS mają o połowę niższą stawkę do 31 grudnia 2026 r., po czym ich cena się podwaja. Każdy, kto buduje uzasadnienie biznesowe na wrześniowych liczbach, opiera je na rabacie, który ma opublikowaną datę wygaśnięcia.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

Jedynym miejscem, w którym porównanie się odwraca, są bardzo krótkie wypowiedzi. Taryfa za znak nie nalicza prawie nic za trzywyrazowe potwierdzenie; taryfa za sekundę audio nalicza opłatę za sekundę, której wymaga wypowiedzenie potwierdzenia, wraz z otaczającą ją ciszą. Jeśli Twój produkt to interfejs głosowy zbudowany z jednozdaniowych odpowiedzi, arytmetyka przechyla się w stronę ElevenLabs. Jeśli to narracja, audiobooki, lokalizacja długich treści czy cokolwiek, gdzie tekst jest długi, a audio jeszcze dłuższe, przechyla się mocno w stronę Google.

Pytanie o jakość, szczerze mówiąc

W Artificial Analysis Provider Voice Arena — w ślepych głosowaniach parami na własnych natywnych głosach każdego dostawcy — te dwa modele dzieli duża różnica, a Google prowadzi.

• Gemini 3.8 Flash TTS — pozycja 2, Elo 1260, przedział 17 punktów, 1999 próbek, 8 głosów areny, wydany we wrześniu 2026.

• ElevenLabs Eleven v3 — miejsce 17, Elo 1,167, 11-punktowy przedział, 4,345 próbek, 8 głosów areny, na tablicy widnieje jako luty 2026.

Dzieli je dziewięćdziesiąt trzy punkty Elo, a w przeciwieństwie do różnicy między pierwszą trójką na tej tablicy ta różnica jest realna: przedział Eleven v3 to od 1 156 do 1 178, a Gemini – od 1 243 do 1 277, bez nakładania się. Liczba próbek Eleven v3 jest ponad dwukrotnie większa niż w przypadku Gemini, więc oszacowanie również nie opiera się na skąpych danych.

To naprawdę niezręczny wynik dla argumentu o cenie i przemawia przeciw oczywistemu wnioskowi. ElevenLabs pobiera trzy razy wyższą kwotę i plasuje się o siedemnaście miejsc niżej w ślepym rankingu preferencji. Cokolwiek można kupić za dodatkowe sześćdziesiąt siedem dolarów, nie jest to lepiej brzmiący głos w bezpośrednim porównaniu.

Co ElevenLabs tak naprawdę sprzedaje

ElevenLabs nie sprzedaje przede wszystkim punktu końcowego syntezy, a wycenianie go tak, jakby to robił, jest tym, co sprawia, że większość porównań jest błędna. Co kupujesz za te pieniądze:

• Biblioteka głosów. Wspólna biblioteka głosów ElevenLabs liczy setki głosów i jest prawdziwym elementem produktu — tym, po co ludzie przychodzą do ElevenLabs, jest często konkretny głos, który gdzieś usłyszeli, a nie model, który za nim stoi. Gemini 3.8 Flash TTS oferuje 30 gotowych głosów studyjnych, ścieżkę projektowania głosu, która generuje go na podstawie opisu w języku naturalnym, oraz ścieżkę replikacji, która klonuje głos z 30-sekundowej próbki z weryfikacją zgody, znakiem wodnym SynthID i dołączonymi poświadczeniami C2PA. Domyślny katalog jest mniejszy; możliwość utworzenia konkretnego głosu jest porównywalna.

• Poziomy opóźnień jako osobne produkty. Flash i Turbo przy ~75 ms i limicie 40 000 znaków to inny produkt niż v3 przy ~280 ms i 5 000 znaków, a oba są tańsze niż v3. Jeśli Twoja aplikacja wymaga poniżej 100 ms, ElevenLabs sprzedaje to wprost, a materiały premierowe Google nie zawierają porównywalnego twierdzenia o opóźnieniu dla żadnego z nowych modeli TTS.

• Ekosystem. Dubbing, agenci głosowi, konwersacyjne punkty końcowe, struktura planów z przypisaną współbieżnością — ten sam powód, dla którego Cartesia sprzedaje telefonię: to stos, a nie model.

Jeśli kupujesz stack, 3.0x to cena tego, że nie składasz go samodzielnie. Jeśli kupujesz wywołanie syntezy, płacisz za bibliotekę głosów i poziom opóźnienia.

Co tak naprawdę sprzedaje Google

Kontrargument jest węższy i silniejszy niż „taniej”.

• Pokrycie językowe — 130 języków w Flash TTS i 101 w Flash-Lite TTS, wykrywanych automatycznie na podstawie tekstu, w porównaniu z ponad 70 językami, które ElevenLabs podaje w dokumentacji dla Eleven v3. W przypadku lokalizacji ta różnica nie jest porównaniem funkcji, lecz luką w pokryciu.

• Reżyseria — kontrola sposobu wypowiadania poszczególnych kwestii, aranżacja sceny z dwoma mówcami w ramach jednego wywołania oraz sygnały niewerbalne wpisane w scenariusz jako <laughs>, <sigh>, <gasp>, |mhm| i |yeah|. Google twierdzi, że generacja 3.8 poprawiła spójność długich form wypowiedzi oraz kontrolę nad dwoma mówcami względem Gemini 3.1 Flash TTS — i właśnie do tego te funkcje służą. Twierdzenie dostawcy, nieodtworzone.

• Model stanu głosów — 200 stanowych głosów własnych na projekt z rocznym TTL albo głosy bezstanowe adresowane za pomocą uchwytu voicekey_..., który wygasa po siedmiu dniach. To decyzja infrastrukturalna, którą możesz uwzględnić w planach.

• Sterowanie wyjściem — WAV 24 kHz mono 16-bitowy PCM ze znakiem w punkcie końcowym typu unary, PCM bez nagłówka (audio/l16) w punkcie końcowym strumieniowym oraz audio/mulaw i audio/alaw z konfigurowalną częstotliwością próbkowania.

Premierowe benchmarki Google są raportowane przez dostawcę i należy je tak odczytywać: pierwsze miejsce w Hume AI Voice Design Benchmark z wynikiem 71,4 i pierwsze miejsce w modelowaniu akcentu z 60,8, pierwsze i drugie miejsce w Hume Overall Quality Index odpowiednio dla Flash i Flash-Lite oraz najwyższe pozycje w ślepych preferencjach deklarowane w językach japońskim, brazylijskim portugalskim, wietnamskim, współczesnym standardowym arabskim, meksykańskim hiszpańskim i hindi. Żaden z tych przebiegów nie jest publicznie dostępny. Elo areny powyżej to jedyna niezależnie zebrana liczba w tym artykule i przypadkiem zgadza się z kierunkiem twierdzeń dostawcy.

Rachunek przełączników

Przełącz się, jeśli Twoje obciążenie obejmuje długie formy, wiele języków lub jest na tyle duże, że 3.0x pojawia się jako osobna pozycja, oraz jeśli możesz zaakceptować mniejszy domyślny katalog głosów i brak publikowanego poziomu poniżej 100 ms. Obejmuje to narrację, dubbing, dostępność i większość mowy osadzonej w produktach.

Zostań, jeśli kupujesz ten stos — bibliotekę głosów, poziomy opóźnień, produkty do dubbingu i agentów — albo jeśli Twoje obciążenie zdominowane jest przez bardzo krótkie wypowiedzi, w których licznik audio za sekundę działa na Twoją niekorzyść. Zostań również, jeśli masz już dostrojoną tożsamość głosu w ElevenLabs, którą rozpoznają Twoi użytkownicy, ponieważ ciągłość głosu jest funkcją produktu, a odtworzenie jej na nowym modelu to projekt.

Tak czy inaczej, rozsądnym posunięciem jest uruchomienie obu przez miesiąc na prawdziwym ruchu, zanim podejmiesz decyzję, i to jest argument za tym, by nie podłączać żadnego z nich bezpośrednio do swojego kodu. OrcaRouter umieszcza ponad 200 modeli za jednym kluczem, w cenie katalogowej dostawcy, bez marży, więc zmiana ceny w którymkolwiek z tych laboratoriów trafia na Twój rachunek tego samego dnia, a nie dopiero przy odnowieniu, a automatyczne przełączanie awaryjne utrzymuje produkcyjną ścieżkę mowy w działaniu, gdy całkiem nowy endpoint zaczyna się źle zachowywać. Nie hostujemy ElevenLabs — jej warstwy syntezy i agentów to jej własny produkt — i nie hostujemy endpointów TTS Gemini 3.8, które pochodzą z API Google. To, co dostarczamy, to warstwa tekstowa pod spodem i routing nad nią.

Liczbą wartą obserwowania jest Elo Eleven v3 w następnej aktualizacji rankingu. Dziewięćdziesiąt trzy punkty to duża strata dla modelu, który kosztuje trzy razy więcej, a jeśli przedział się zwęzi, a luka się nie zamknie, argument cenowy przestaje być kartą przetargową i staje się wyrokiem.