
Eleven v4 kontra Gemini 3.1 Flash TTS: 116-punktowa różnica i tańszy model Google
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 982 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Szukając dziś głosu Google, trafisz na niewłaściwy. Google Gemini 3.1 Flash TTS jest sklasyfikowany na 11. miejscu w Provider Voice Arena firmy Artificial Analysis z Elo 1 203 w 3 512 występach, w cenie 18,31 USD za milion znaków. ElevenLabs Eleven v4, wydany 28 września 2026 r., zajmuje 1. miejsce z Elo 1 319 w 1 674 występach, w cenie 80,00 USD za milion. To wygląda na 116-punktową lukę wobec tańszego konkurenta — dopóki nie zauważysz, że własny Gemini 3.8 Flash TTS Google plasuje się na trzecim miejscu tej samej tablicy z 1 267 i niższą znormalizowaną ceną 16,49 USD. Prawdziwy pojedynek to nie ten, który sugeruje starcie z nagłówka, a powodem jest data premiery.
Jedno z nich jest o osiemnaście miesięcy nowsze, niż wygląda.
Gemini 3.1 Flash TTS ma na tablicy datę premiery 15 kwietnia 2026 r. Eleven v4 ma 28 września 2026 r. To pięć i pół miesiąca, co nie stanowi pokolenia w syntezie mowy, ale wystarczyło, by Google zdążyło wypuścić następcę: Gemini 3.8 Flash TTS i Gemini 3.8 Flash-Lite TTS weszły do ogólnej dostępności 23 września 2026 r., pięć dni przed Eleven v4, i oba są sklasyfikowane powyżej 3.1 na tej samej tablicy. Gemini 3.8 Flash-Lite TTS zajmuje szóste miejsce z wynikiem 1 241 i 11,03 USD za milion.

Zatem uczciwe porównanie ma trzy punkty, a nie dwa, a uporządkowanie według ceny jest ciekawą częścią:
• Miejsce 1, ElevenLabs Eleven v4 — Elo 1 319, 80,00 USD za milion znaków, 1 674 wystąpienia, interwał ±19
• Miejsce 3, Google Gemini 3.8 Flash TTS — Elo 1 267, 16,49 USD za milion znaków, wydany 23 września 2026
• Miejsce 6, Google Gemini 3.8 Flash-Lite TTS — Elo 1,241, 11,03 USD za milion znaków, wydany 23 września 2026
• Miejsce 11, Google Gemini 3.1 Flash TTS — Elo 1 203, 18,31 USD za milion znaków, wydany 15 kwietnia 2026, 3 512 wystąpień, przedział ±12
Zauważ, co przedziały robią z tym uszeregowaniem. Gemini 3.1 Flash TTS szacuje na 1,203 z przedziałem ±12, więc jego prawdziwa wartość plasuje się gdzieś między 1,191 a 1,215. Eleven v4 szacuje na 1,319 z przedziałem ±19 — mniej więcej między 1,300 a 1,338. Te dwa zakresy się nie stykają, a dzieląca je luka ma ponad sto punktów szerokości. To jest tak czyste, jak to tylko możliwe w przypadku tablicy preferencji.

Dlaczego liczebność próby ma większe znaczenie niż rangi
Za szacunkiem Gemini 3.1 Flash TTS stoi 3512 wystąpień; za Eleven v4 — 1674, ponieważ na tej tablicy ma dopiero jeden dzień. Oszacowanie nowszego modelu niesie większą niepewność na próbkę i przedział ±19 to odzwierciedla. Jeśli jesteś typem nabywcy, który czeka, aż liczba się ustabilizuje, praktyczna zasada jest taka, że uporządkowanie powyżej szerokości przedziału to część, na której możesz działać. Tutaj ranking z zapasem utrzymuje się mimo słupków błędów w obu kierunkach — wyprzedza 3.8 Flash TTS i nie wyprzedza go nikt w tym porównaniu.
Arena liczy również głosy areny: osiem w przypadku Eleven v4, siedem w przypadku Gemini 3.1 Flash TTS. To liczba odrębnych głosów dostawcy użytych w testach w ciemno i przybliżony wskaźnik tego, jak dużą domyślną obsadę wnosi dostawca. Miejsce 1 Eleven v4 zostało zdobyte z ośmioma głosami, co oznacza, że zwycięstwo nie jest dziełem jednego szczęśliwego narratora.
Różnice w możliwościach, których Elo nie wycenia
Rankingi mierzą preferencje, a nie pokrycie funkcji. O rzeczywistych projektach decydują cztery różnice i żadna z nich nie pojawia się w Elo.
• Reżyseria w skrypcie — Eleven v4 dokumentuje wbudowane tagi audio ([laughs], [whispers], [said angrily in French accent]) oraz prompty dostarczania w języku naturalnym; generacja 3.1 Google dokumentuje wybór głosu i promptowanie, ale nie równoważną składnię tagów do wskazówek wykonawczych.
• Tworzenie głosu — generacja Gemini 3.8 dodała projektowanie głosu na podstawie opisu tekstowego oraz replikację głosu z 30-sekundowej próbki, wraz ze znakowaniem wodnym i metadanymi pochodzenia na wyjściu. Gemini 3.1 Flash TTS jest wcześniejszy i oferuje gotowy zestaw głosów.
• Klonowanie z rzeczywistego audio — Instant Voice Cloning w Eleven v4 działa na podstawie dziesięciu sekund audio, a powyżej niego znajduje się poziom profesjonalny. Ścieżka replikacji Google w generacji 3.8 wymaga 30 sekund i dodaje weryfikację zgody. Różne progi, różne mechanizmy zgody.
Limit wejściowy na żądanie — Eleven v4 dokumentuje 10 000 znaków. Google rozlicza swoje modele TTS w tokenach, a nie w znakach, więc nie ma bezpośrednio porównywalnego limitu znaków na żądanie, a tych dwóch mierników nie należy stawiać obok siebie, jakby były tym samym.
Ten ostatni punkt to ten, który wywraca arkusze zakupowe. ElevenLabs podaje cenę za 1000 znaków. Google podaje cenę za milion tokenów, na wejściu i wyjściu. Artificial Analysis normalizuje oba do osi na milion znaków — stąd biorą się $80.00 i $18.31 — ale ta normalizacja to przeliczenie przyjęte przez zarząd, a nie faktura któregokolwiek z dostawców. Używaj jej do ustalania rankingu, a nie do prognozowania.

Co cennik Eleven v4 zmienia w tym porównaniu
Przez dwa tygodnie powyższe porównanie cen jest błędne na korzyść ElevenLabs, a potem błędne na jej niekorzyść. Na stronie cennika API ElevenLabs Eleven v4 jest wyceniony na 0,022 USD za 1000 znaków wobec podanej ceny katalogowej 0,08 USD, oznaczonej jako 72% zniżki do 12 października. Eleven v4 Turbo jest wyceniony na 0,011 USD wobec 0,04 USD. Po 12 października promocyjna liczba znika, a widniejąca w cenniku kwota 80,00 USD za milion staje się stawką, którą faktycznie płacisz.
Przeprowadź obliczenia dla miesiąca z pięcioma milionami znaków. Eleven v4 kosztuje 110 USD w okresie promocyjnym i 400 USD po nim. Gemini 3.1 Flash TTS, przy normalizacji na poziomie 18,31 USD przyjętej w rankingu, wynosi około 92 USD za ten sam miesiąc — taniej niż w promocji i około cztery razy taniej niż stawka cennikowa. Zespół, który przeprowadza benchmarki we wrześniu i wdraża produkt w listopadzie, podejmie decyzję na podstawie kwoty, która już nie istnieje.
Gdzie routing pasuje, a gdzie nie
Żaden z tych modeli nie znajduje się w katalogu OrcaRouter. Nie ma tu żadnego punktu końcowego ElevenLabs ani punktu końcowego Google TTS, który można by wywołać, a szczera odpowiedź na pytanie „jak mogę się do nich dostać przez ciebie?” brzmi: nie możesz. Do Eleven v4 można dotrzeć przez własne API ElevenLabs, a do Gemini 3.1 Flash TTS przez API Google'a. Powiedzenie czegokolwiek innego byłoby wymyślaniem integracji.
To, do czego w takim porównaniu przydaje się pojedynczy klucz, to sama decyzja. Jeśli rozważasz endpoint za 400 dolarów miesięcznie wobec takiego za 92 dolary miesięcznie, odpowiedź zależy od twoich własnych skryptów, twoich własnych języków i twoich własnych listenerów — a uzyskanie tej odpowiedzi oznacza wywołanie obu z tej samej ścieżki kodu z tym samym kształtem żądania, zamiast stawiania dwóch integracji z dostawcami, by przeprowadzić jeden test. OrcaRouter pokrywa tę warstwę: ponad 200 modeli za jednym kluczem, z cenami katalogowymi dostawców przekazywanymi przy 0% marży, więc zmiana ceny przez dostawcę jest odzwierciedlana w dniu, w którym wchodzi w życie, plus automatyczny failover, jeśli któryś upstream pogorszy się w trakcie oceny.
Kto powinien wybrać, które
Pick Eleven v4, gdy głos jest produktem. Prowadzi w rankingu o 116 punktów, z czystszym przedziałem niż model poniżej, jako jedyny z tych dwóch ma udokumentowaną śródliniową składnię tagów do sterowania wykonaniem, a jego próg klonowania wynosi dziesięć sekund, a nie trzydzieści. Premia jest realna — czterokrotność znormalizowanej ceny katalogowej — i pozwala kupić szczyt rankingu.
Wybierz Gemini 3.1 Flash TTS tylko wtedy, gdy już się na niego zdecydowałeś. To pięciomiesięczny model generacji preview o niższym wyniku i wyższej cenie znormalizowanej niż wrześniowe wydanie samego Google, a jedynym powodem, by go zatrzymać, jest inercja w istniejącej integracji. Jeśli masz tę inercję, migracja w obrębie stacku Google do 3.8 Flash TTS daje 64 punkty Elo i niższą cenę znormalizowaną bez zmiany dostawcy — co jest rzadkim przypadkiem, gdy aktualizacja jest również tańszą opcją.
Dla wszystkich innych aktualne pytanie brzmi: Eleven v4 kontra Gemini 3.8 Flash TTS, a odpowiedź to prawdziwy kompromis, a nie ranking: 52 punkty Elo i składnia tagów w zamian za mniej więcej jedną piątą kosztu na znak. Uruchom oba na tych samych skryptach po 12 października, gdy promocja ElevenLabs się skończy, a różnica w cenie będzie tą, którą faktycznie zapłacisz.
