Wygenerowana karta główna dla ElevenLabs Eleven v4 kontra OpenAI TTS-1 HD z dwiema kartami wyników: Eleven v4 z Elo 1 319, miejsce 1 i 80,00 USD za 1 mln znaków; OpenAI TTS-1 HD z Elo 1 104, miejsce 35 i 30,00 USD za 1 mln znaków; z podpisem „216 punktów Elo, a oba punkty końcowe wciąż przyjmują ruch”. Stopka: „Provider Voice Arena, według Artificial Analysis, wrzesień 2026”. Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Eleven v4 kontra OpenAI TTS-1 HD: Dwa lata dryfu na jednej tablicy

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

OpenAI TTS-1 HD ma datę premiery 6 listopada 2023. ElevenLabs Eleven v4 ma datę premiery 28 września 2026. Na Artificial Analysis' Provider Voice Arena te dwie daty dzieli 216 punktów Elo — TTS-1 HD zajmuje 35. miejsce z 1 104 punktami w 3 500 wystąpieniach po 30,00 USD za milion znaków, podczas gdy Eleven v4 zajmuje 1. miejsce z 1 319 punktami w 1 674 wystąpieniach po 80,00 USD. Obie wartości mają wąskie przedziały ufności, ±12 i ±19, więc kolejność nie budzi wątpliwości. Ciekawe pytanie nie brzmi, który model jest lepszy, ponieważ zostało to rozstrzygnięte, zanim ten artykuł powstał. Chodzi o to, dlaczego endpoint z 2023 roku wciąż ma 3 500 wystąpień na tablicy wyników, na której pięciodniowy model ma 1 674, i co to mówi o migracji, którą masz rozważyć.

Tablica wyników i ten jeden wiersz, w którym OpenAI wygrywa

O tym starciu decyduje pięć wymiarów, a obie strony każdego z nich warto czytać obok siebie.

• Preferencja w ciemno, głosy dostawców — Eleven v4 1. miejsce, Elo 1319 (±19, 1674 wystąpień) vs TTS-1 HD 35. miejsce, Elo 1104 (±12, 3500 wystąpień). 216-punktowa różnica, która utrzymuje się mimo przedziałów błędów.

• Cena podstawowa za milion znaków — Eleven v4 80,00 USD vs TTS-1 HD 30,00 USD. OpenAI jest o 62% tańsze według cennika, a jeszcze tańsze w czasie promocji ElevenLabs.

• Głosy — Eleven v4 dokumentuje natychmiastowe klonowanie na podstawie dziesięciu sekund audio oraz profesjonalny poziom klonowania; TTS-1 HD udostępnia stały zestaw głosów, dziewięć dla rodziny tts-1 w dokumentacji samego OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) i nie obsługuje klonowania.

• Sterowanie wykonaniem — Eleven v4 dokumentuje wbudowane znaczniki audio i podpowiedzi reżyserskie w języku naturalnym; TTS-1 HD przyjmuje zwykły tekst, a parametr steerable-instructions OpenAI należy do jego nowszego modelu TTS, a nie do tego.

• Data wydania — Eleven v4 28 września 2026 vs TTS-1 HD 6 listopada 2023.

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Cena to wiersz, w którym OpenAI wygrywa, i jest to większe zwycięstwo, niż się wydaje, ponieważ promocja ElevenLabs jest tymczasowa. Przy 0,022 USD za 1000 znaków Eleven v4 kosztuje 22 USD za milion do 12 października — jest wręcz tańszy niż TTS-1 HD. Po 12 października kosztuje 80 USD za milion w porównaniu z 30 USD OpenAI i już tak zostaje.

Dlaczego model z 2023 roku ma dwukrotnie większą liczbę próbek

Ta liczba to najbardziej przydatna informacja na tej tablicy i łatwo ją źle odczytać. Liczba wystąpień w Arena rośnie wraz z ruchem, a ruch rośnie dzięki integracjom, które zbudowano raz i nigdy do nich nie wracano. Za TTS-1 HD stoi 3500 wystąpień, ponieważ jest domyślnym endpointem mowy dla każdego zespołu, który już wywołuje OpenAI w ramach Chat Completions: ten sam klucz, ten sam SDK, ta sama pozycja rozliczeniowa, jeszcze jedno wywołanie. Nic w tym zdaniu nie mówi o jakości głosu, a 216-punktowy deficyt mu nie przeszkodził.

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

Tak wygląda dług migracyjny na tablicy rankingowej. To nie jest sygnał, że starszy model jest konkurencyjny; to sygnał, że przejście na nowy coś kosztuje i że duża liczba zespołów uznała, że owo „coś” jest warte więcej niż 216 punktów Elo. To uzasadniony wniosek w przypadku odczytu powiadomień, ale słaby w przypadku produktu, w którym głos jest tym, co słyszy klient.

Argumenty za pozostaniem przy TTS-1 HD

Trzy rzeczy sprawiają, że da się go obronić, a żadna z nich to nie jakość.

Determinizm jest na pierwszym miejscu. Stały zestaw dziewięciu głosów daje spójne wyniki między wersjami w sposób, w jaki pipeline klonowania tego nie robi, a spójny wynik jest tym, czego chcesz na ścieżce użytkowej, gdzie nikt nie słucha w poszukiwaniu artyzmu. Nie ma klonu, który mógłby dryfować, żadnej próbki referencyjnej do ponownego nagrania ani artefaktu zgody do utrzymywania.

Koszt integracji jest drugi i to ten, którego arena nie potrafi wycenić. Dodanie drugiego dostawcy mowy oznacza nowe konto, nowy cennik, nowy tryb awarii i nowy element do monitorowania. Dla zespołu, który już działa w stacku OpenAI, to realny czas inżynierów, a 216 punktów Elo tego nie pokryje.

Wolumen z dolnej półki jest trzeci. Przy 30 dolarach za milion znaków cały miesięczny rachunek za głos w małym produkcie to błąd zaokrąglenia i nie ma czego optymalizować. To reżim, w którym tania odpowiedź i leniwa odpowiedź to ta sama odpowiedź, i to jest w porządku.

Argumenty za przeprowadzką i kontrargument przeciwko temu

Przechodź na nowszy model, gdy głos ma kontakt z klientem. Klonowanie w dziesięć sekund, wbudowana reżyseria wykonania, ponad 90 języków i limit 10 000 znaków na żądanie nie są kosmetycznymi różnicami względem stałego zestawu dziewięciu głosów z 2023 r., a 216-punktowa różnica w arenie to skompresowana wersja znacznie większej luki w możliwościach. Jeśli budujesz agenta, asystenta marki lub cokolwiek, w czym słuchacz wyrabia sobie opinię o Twoim produkcie już po pierwszym zdaniu, starszy endpoint jest złym domyślnym wyborem.

Kontrargument jest taki, że „przejście na Eleven v4” nie jest jedynym posunięciem. OpenAI od tego czasu wypuściło nowszy model TTS ze sterowalnym parametrem instrukcji, a Gemini 3.8 Flash TTS od Google zajmuje trzecie miejsce na tym samym rankingu z wynikiem 1 267 i znormalizowaną ceną 16,49 USD za milion — to zysk 163 punktów względem TTS-1 HD przy mniej więcej połowie ceny z rankingu. Jeśli twoim ograniczeniem jest pozostanie u obecnego dostawcy, to ta aktualizacja jest tańsza. Jeśli jest nim pozostanie w obecnej chmurze, to jedyna możliwość.

Gdzie tak naprawdę plasuje się OrcaRouter w tym porównaniu

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 nie ma w naszym katalogu i nie ma czego przez nas wywoływać: dociera się do niego przez własne API ElevenLabs, według własnego cennika ElevenLabs. To, co zmienia pojedynczy klucz, to kształt migracji. Jeśli powodem, dla którego nie przetestowałeś nowego lidera, jest to, że oznacza to integrację z drugim dostawcą, kosztem sprawdzenia jest jedno wywołanie API z użyciem klucza, który już posiadasz, a nie cykl zakupowy. Ceny katalogowe dostawców są przekazywane z 0% marży, więc zmiana cennika przez dostawcę — w tym przywrócenie przez ElevenLabs z 12 października — jest aktywna po naszej stronie w dniu, w którym następuje, a automatyczne przełączanie awaryjne oznacza, że ścieżka mowy będąca w trakcie oceny nie musi stać się zależnością produkcyjną, dopóki nie podejmiesz decyzji.

Arytmetyka, która powinna to rozstrzygnąć

Pięć milionów znaków miesięcznie, co odpowiada średniej wielkości produktowi i około 100 godzinom mowy. TTS-1 HD kosztuje 150 USD. Eleven v4 kosztuje 110 USD w okresie promocyjnym i 400 USD po 12 października. Gemini 3.8 Flash TTS, przy normalizacji przyjętej przez zarząd, kosztuje około 82,50 USD.

Odczytaj te cztery liczby, a decyzja rozstrzyga się jednoznacznie. W tym oknie czasowym najnowszy i najwyżej sklasyfikowany model na tablicy jest także drugim najtańszym — tańszym niż punkt końcowy z 2023 r., od którego jest lepszy o 216 punktów Elo. Po 12 października jest najdroższą opcją na liście, prawie pięciokrotnie droższą. W tej dacie nie zmienia się nic w modelach; zmienia się tylko faktura.

Tak więc: jeśli prowadzisz ocenę w tym miesiącu, oceniaj według stawki promocyjnej, a stawkę cennikową wpisz do uzasadnienia biznesowego. Jeśli wypuszczasz produkt w przyszłym kwartale, planuj przy 0,08 USD za 1000 znaków, a każde porównanie, które podaje 0,022 USD, traktuj jak dokument z wydrukowaną datą ważności. A jeśli korzystasz z TTS-1 HD i szczerym powodem jest bezwładność integracyjna, użytecznym pierwszym krokiem nie jest plan migracji — lecz pojedynczy test A/B na własnych skryptach, wyceniony według stawki, którą faktycznie będziesz płacić w listopadzie.