
Eleven v4 kontra OpenAI TTS-1 HD: Dwa lata dryfu na jednej tablicy
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 982 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
OpenAI TTS-1 HD ma datę premiery 6 listopada 2023. ElevenLabs Eleven v4 ma datę premiery 28 września 2026. Na Artificial Analysis' Provider Voice Arena te dwie daty dzieli 216 punktów Elo — TTS-1 HD zajmuje 35. miejsce z 1 104 punktami w 3 500 wystąpieniach po 30,00 USD za milion znaków, podczas gdy Eleven v4 zajmuje 1. miejsce z 1 319 punktami w 1 674 wystąpieniach po 80,00 USD. Obie wartości mają wąskie przedziały ufności, ±12 i ±19, więc kolejność nie budzi wątpliwości. Ciekawe pytanie nie brzmi, który model jest lepszy, ponieważ zostało to rozstrzygnięte, zanim ten artykuł powstał. Chodzi o to, dlaczego endpoint z 2023 roku wciąż ma 3 500 wystąpień na tablicy wyników, na której pięciodniowy model ma 1 674, i co to mówi o migracji, którą masz rozważyć.
Tablica wyników i ten jeden wiersz, w którym OpenAI wygrywa
O tym starciu decyduje pięć wymiarów, a obie strony każdego z nich warto czytać obok siebie.
• Preferencja w ciemno, głosy dostawców — Eleven v4 1. miejsce, Elo 1319 (±19, 1674 wystąpień) vs TTS-1 HD 35. miejsce, Elo 1104 (±12, 3500 wystąpień). 216-punktowa różnica, która utrzymuje się mimo przedziałów błędów.
• Cena podstawowa za milion znaków — Eleven v4 80,00 USD vs TTS-1 HD 30,00 USD. OpenAI jest o 62% tańsze według cennika, a jeszcze tańsze w czasie promocji ElevenLabs.
• Głosy — Eleven v4 dokumentuje natychmiastowe klonowanie na podstawie dziesięciu sekund audio oraz profesjonalny poziom klonowania; TTS-1 HD udostępnia stały zestaw głosów, dziewięć dla rodziny tts-1 w dokumentacji samego OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) i nie obsługuje klonowania.
• Sterowanie wykonaniem — Eleven v4 dokumentuje wbudowane znaczniki audio i podpowiedzi reżyserskie w języku naturalnym; TTS-1 HD przyjmuje zwykły tekst, a parametr steerable-instructions OpenAI należy do jego nowszego modelu TTS, a nie do tego.
• Data wydania — Eleven v4 28 września 2026 vs TTS-1 HD 6 listopada 2023.

Cena to wiersz, w którym OpenAI wygrywa, i jest to większe zwycięstwo, niż się wydaje, ponieważ promocja ElevenLabs jest tymczasowa. Przy 0,022 USD za 1000 znaków Eleven v4 kosztuje 22 USD za milion do 12 października — jest wręcz tańszy niż TTS-1 HD. Po 12 października kosztuje 80 USD za milion w porównaniu z 30 USD OpenAI i już tak zostaje.
Dlaczego model z 2023 roku ma dwukrotnie większą liczbę próbek
Ta liczba to najbardziej przydatna informacja na tej tablicy i łatwo ją źle odczytać. Liczba wystąpień w Arena rośnie wraz z ruchem, a ruch rośnie dzięki integracjom, które zbudowano raz i nigdy do nich nie wracano. Za TTS-1 HD stoi 3500 wystąpień, ponieważ jest domyślnym endpointem mowy dla każdego zespołu, który już wywołuje OpenAI w ramach Chat Completions: ten sam klucz, ten sam SDK, ta sama pozycja rozliczeniowa, jeszcze jedno wywołanie. Nic w tym zdaniu nie mówi o jakości głosu, a 216-punktowy deficyt mu nie przeszkodził.

Tak wygląda dług migracyjny na tablicy rankingowej. To nie jest sygnał, że starszy model jest konkurencyjny; to sygnał, że przejście na nowy coś kosztuje i że duża liczba zespołów uznała, że owo „coś” jest warte więcej niż 216 punktów Elo. To uzasadniony wniosek w przypadku odczytu powiadomień, ale słaby w przypadku produktu, w którym głos jest tym, co słyszy klient.
Argumenty za pozostaniem przy TTS-1 HD
Trzy rzeczy sprawiają, że da się go obronić, a żadna z nich to nie jakość.
Determinizm jest na pierwszym miejscu. Stały zestaw dziewięciu głosów daje spójne wyniki między wersjami w sposób, w jaki pipeline klonowania tego nie robi, a spójny wynik jest tym, czego chcesz na ścieżce użytkowej, gdzie nikt nie słucha w poszukiwaniu artyzmu. Nie ma klonu, który mógłby dryfować, żadnej próbki referencyjnej do ponownego nagrania ani artefaktu zgody do utrzymywania.
Koszt integracji jest drugi i to ten, którego arena nie potrafi wycenić. Dodanie drugiego dostawcy mowy oznacza nowe konto, nowy cennik, nowy tryb awarii i nowy element do monitorowania. Dla zespołu, który już działa w stacku OpenAI, to realny czas inżynierów, a 216 punktów Elo tego nie pokryje.
Wolumen z dolnej półki jest trzeci. Przy 30 dolarach za milion znaków cały miesięczny rachunek za głos w małym produkcie to błąd zaokrąglenia i nie ma czego optymalizować. To reżim, w którym tania odpowiedź i leniwa odpowiedź to ta sama odpowiedź, i to jest w porządku.
Argumenty za przeprowadzką i kontrargument przeciwko temu
Przechodź na nowszy model, gdy głos ma kontakt z klientem. Klonowanie w dziesięć sekund, wbudowana reżyseria wykonania, ponad 90 języków i limit 10 000 znaków na żądanie nie są kosmetycznymi różnicami względem stałego zestawu dziewięciu głosów z 2023 r., a 216-punktowa różnica w arenie to skompresowana wersja znacznie większej luki w możliwościach. Jeśli budujesz agenta, asystenta marki lub cokolwiek, w czym słuchacz wyrabia sobie opinię o Twoim produkcie już po pierwszym zdaniu, starszy endpoint jest złym domyślnym wyborem.
Kontrargument jest taki, że „przejście na Eleven v4” nie jest jedynym posunięciem. OpenAI od tego czasu wypuściło nowszy model TTS ze sterowalnym parametrem instrukcji, a Gemini 3.8 Flash TTS od Google zajmuje trzecie miejsce na tym samym rankingu z wynikiem 1 267 i znormalizowaną ceną 16,49 USD za milion — to zysk 163 punktów względem TTS-1 HD przy mniej więcej połowie ceny z rankingu. Jeśli twoim ograniczeniem jest pozostanie u obecnego dostawcy, to ta aktualizacja jest tańsza. Jeśli jest nim pozostanie w obecnej chmurze, to jedyna możliwość.
Gdzie tak naprawdę plasuje się OrcaRouter w tym porównaniu
This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

ElevenLabs Eleven v4 nie ma w naszym katalogu i nie ma czego przez nas wywoływać: dociera się do niego przez własne API ElevenLabs, według własnego cennika ElevenLabs. To, co zmienia pojedynczy klucz, to kształt migracji. Jeśli powodem, dla którego nie przetestowałeś nowego lidera, jest to, że oznacza to integrację z drugim dostawcą, kosztem sprawdzenia jest jedno wywołanie API z użyciem klucza, który już posiadasz, a nie cykl zakupowy. Ceny katalogowe dostawców są przekazywane z 0% marży, więc zmiana cennika przez dostawcę — w tym przywrócenie przez ElevenLabs z 12 października — jest aktywna po naszej stronie w dniu, w którym następuje, a automatyczne przełączanie awaryjne oznacza, że ścieżka mowy będąca w trakcie oceny nie musi stać się zależnością produkcyjną, dopóki nie podejmiesz decyzji.
Arytmetyka, która powinna to rozstrzygnąć
Pięć milionów znaków miesięcznie, co odpowiada średniej wielkości produktowi i około 100 godzinom mowy. TTS-1 HD kosztuje 150 USD. Eleven v4 kosztuje 110 USD w okresie promocyjnym i 400 USD po 12 października. Gemini 3.8 Flash TTS, przy normalizacji przyjętej przez zarząd, kosztuje około 82,50 USD.
Odczytaj te cztery liczby, a decyzja rozstrzyga się jednoznacznie. W tym oknie czasowym najnowszy i najwyżej sklasyfikowany model na tablicy jest także drugim najtańszym — tańszym niż punkt końcowy z 2023 r., od którego jest lepszy o 216 punktów Elo. Po 12 października jest najdroższą opcją na liście, prawie pięciokrotnie droższą. W tej dacie nie zmienia się nic w modelach; zmienia się tylko faktura.
Tak więc: jeśli prowadzisz ocenę w tym miesiącu, oceniaj według stawki promocyjnej, a stawkę cennikową wpisz do uzasadnienia biznesowego. Jeśli wypuszczasz produkt w przyszłym kwartale, planuj przy 0,08 USD za 1000 znaków, a każde porównanie, które podaje 0,022 USD, traktuj jak dokument z wydrukowaną datą ważności. A jeśli korzystasz z TTS-1 HD i szczerym powodem jest bezwładność integracyjna, użytecznym pierwszym krokiem nie jest plan migracji — lecz pojedynczy test A/B na własnych skryptach, wyceniony według stawki, którą faktycznie będziesz płacić w listopadzie.
