
Eleven v4 kontra VoxCPM2: model z rankingu przeciw checkpointowi, którego nie możesz wynająć
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 982 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Najbardziej użytecznym faktem w tym pojedynku jest wiersz, który nie istnieje. ElevenLabs Eleven v4 zajmuje 1. miejsce w Provider Voice Arena Artificial Analysis z Elo 1319 w 1674 wystąpieniach, w cenie 80,00 USD za milion znaków. VoxCPM2, checkpoint OpenBMB wydany w kwietniu 2026 r., nie pojawia się nigdzie na żadnej z tablic wyników dla mowy — nie ma go w rankingu, nie ma go poza rankingiem, nie ma go jako wpisu podglądowego. To nie jest werdykt o jakości. Oznacza to, że niezależnie od tego, którą liczbę chciałeś porównać z 1319, nikt jej nie uzyskał, a porównania trzeba dokonać na podstawie czegoś innego niż preferencje. Pozostaje własność, dostrajanie i pytanie o licencję, którego hostowany endpoint nie pozwala zadać.
Co tak naprawdę daje ci każda ze stron
To są różne klasy produktów, a różnica nie jest kosmetyczna.
• Dostęp — Eleven v4 to hostowany endpoint dostępny przez własne API ElevenLabs, rozliczany za znak. VoxCPM2 to checkpoint na Hugging Face w repozytorium openbmb/VoxCPM2; pobierasz go i uruchamiasz, a nie ma żadnego firmowego endpointu, który można by wywołać.
• Licencja — VoxCPM2 jest udostępniany na licencji Apache 2.0, wyraźnie dopuszczającej użytek komercyjny. Eleven v4 to komercyjne API, którego warunki określa ElevenLabs. Ta różnica ma znaczenie, jeśli Twój dział prawny pyta, czy możesz dostrajać, redystrybuować lub rozprowadzać wagi; w przypadku checkpointu odpowiedź jest zapisana i niezmienna.
• Rozmiar i sprzęt — VoxCPM2 to 2B parametrów na bazie MiniCPM-4, a karta podaje około 8 GB VRAM przy bfloat16, z maksymalną długością sekwencji 8 192 tokenów. ElevenLabs nie publikuje liczby parametrów dla Eleven v4, a zapotrzebowanie sprzętowe hostowanego modelu nie jest czymś, czym zarządzasz.
• Łańcuch wyjściowy — VoxCPM2 przyjmuje dźwięk referencyjny 16 kHz i emituje 48 kHz dzięki wbudowanej superrozdzielczości AudioVAE V2, bez zewnętrznego upsamplera na ścieżce. Hosted TTS przekazuje strumień w dowolnej częstotliwości próbkowania wybranej przez dostawcę.
• Niezależny wynik — Eleven v4 ma taki i jest na pierwszym miejscu. VoxCPM2 nie ma żadnego. Brak nie jest niskim wynikiem; to model bez wyniku, a o tych dwóch nigdy nie należy mówić w tym samym zdaniu, jakby drugi był liczbą.

Liczba, która zastępuje brakujące Elo
Jeśli nie możesz porównać preferencji, porównaj to, co możesz obliczyć, a w przypadku modelu hostowanego samodzielnie jest to przepustowość. Karta VoxCPM2 podaje współczynnik czasu rzeczywistego około 0,30 w standardowym PyTorch na RTX 4090, spadający do około 0,13 w Nano-VLLM. Współczynnik czasu rzeczywistego to sekundy obliczeń na sekundę dźwięku, więc te dwie liczby oznaczają, że jedna godzina GPU daje około 3,3 godziny gotowej mowy w pierwszym przypadku i około 7,7 godziny w drugim.

Z tego od razu wynikają dwa wnioski. Stos obsługi ma większe znaczenie niż model: ten sam checkpoint na tej samej karcie ponad dwukrotnie zwiększa swoją wydajność, gdy zmienisz silnik wnioskowania, więc każdy model kosztów, który używa wartości 0,30, zawyża twój koszt własnego hostowania o współczynnik około 2,3. A wykorzystanie to cała gra: karta, która stoi bezczynnie, nie przebije API rozliczanego za znak przy żadnej cenie, ponieważ rachunek API skaluje się z tym, co mówisz, podczas gdy rachunek za kartę skaluje się z tym, kiedy ją kupiłeś.
Dlatego uczciwa wersja tej decyzji nie brzmi: „co brzmi lepiej”. Brzmi: „ile godzin audio produkujesz miesięcznie i czy sprzęt jest zajęty”. Poniżej wolumenu, przy którym karta pozostaje załadowana, API wygrywa i to bezapelacyjnie. Powyżej niego, na sprzęcie, który już posiadasz, koszt krańcowy checkpointu na tysięczną część godziny jest taki sam jak jego koszt za pierwszą godzinę — a to przewaga strukturalna, której nie dorówna żaden cennik.
Możliwość, której hostowany endpoint ci nie sprzeda
To tutaj porównanie przestaje być lustrzanym odbiciem, ponieważ jest jedna rzecz, którą VoxCPM2 robi, a której Eleven v4 zasadniczo nie potrafi: można go ponownie wytrenować. Karta modelu dokumentuje zarówno pełne dostrajanie SFT, jak i dostrajanie LoRA na zaledwie pięciu do dziesięciu minutach audio, wraz z dostarczonym skryptem treningowym i konfiguracją dla każdego z nich.
To zmienia kształt programu głosowego. Hostowane API daje ci stały model plus to, co dostawca udostępnia w zakresie klonowania — w przypadku Eleven v4 dziesięć sekund audio referencyjnego do natychmiastowego klonowania, z profesjonalnym poziomem powyżej. Checkpoint dostrajany za pomocą LoRA daje ci model, który nigdy nie widział danych nikogo innego i którego zachowanie możesz przypiąć do konkretnej wersji. W przypadku głosu marki, regulowanej domeny lub języka, z którym obsada dostawcy radzi sobie słabo, to zupełnie inna kategoria rozwiązania, a nie tańsza.
Ten kompromis jest wyraźny i wart podkreślenia: w przypadku VoxCPM2 akceptujesz, że żadna strona trzecia nigdy nie oceniła tego modelu, że gwarancje jakości to coś, co sam budujesz i mierzysz, oraz że limit sekwencji 8 192 tokenów i ostrzeżenie zawarte w samej karcie — że projektowanie głosu i kontrola stylu różnią się między uruchomieniami oraz że zaleca się od jednej do trzech generacji — są teraz Twoim problemem QA.
Co daje Ci Eleven v4, czego nie może dać checkpoint
Idąc w drugą stronę, zalety modelu hostowanego to te, które widać w kalendarzu wydań, a nie w specyfikacji.
• Ranking oparty na pomiarach — pierwsze miejsce na tablicy wyników, której oszacowanie opiera się na 1674 próbkach, a wokół niego rozciąga się przedział około ±19 punktów. Cokolwiek ta tablica wyników mierzy, jest niezależna od obu dostawców i jest jedynym sygnałem jakości od strony trzeciej w tym porównaniu.
• Wskazówki wykonawcze w tekście — śródwierszowe znaczniki audio, takie jak [śmiech], [szept] i [wypowiedziane ze złością z francuskim akcentem], a także podpowiedzi dotyczące sposobu mówienia w języku naturalnym i ulepszona obsługa Międzynarodowego Alfabetu Fonetycznego. Uzyskanie zmiany nastroju z modelu hostowanego samodzielnie oznacza ponowne wygenerowanie lub dostrojenie; tutaj to token w skrypcie.
• Pokrycie, którego nie musisz weryfikować — ponad 90 języków w porównaniu z 30 w VoxCPM2, z zastrzeżeniem, że lista checkpointu jest jawna i zawiera nazwy (w tym dialekty chińskie), podczas gdy „ponad 90” dostawcy to liczba bez listy.
• Brak powierzchni operacyjnej — brak GPU, brak stosu serwowania, brak dryfu wersji, a promocyjna stawka $0.022 za 1000 znaków do 12 października w porównaniu z ceną katalogową $0.08 po tym terminie.

Żadne z nich nie jest nasze — i właśnie o to chodzi w tej sekcji.
OrcaRouter nie hostuje żadnego z tych modeli. W naszym katalogu nie ma endpointu ElevenLabs ani endpointu VoxCPM2, a uczciwa odpowiedź dotycząca routingu jest taka, że do Eleven v4 dociera się przez własne API ElevenLabs, natomiast VoxCPM2 to coś, co wdrażasz na własnym sprzęcie. Nie zamierzamy sugerować czegokolwiek innego tylko po to, żeby porównanie było schludniejsze.
Tam, gdzie pojedynczy klucz rzeczywiście pomaga, jest decyzja przed decyzją. Powodem, dla którego rozmowy o self-hostingu grzęzną, jest to, że alternatywa nigdy nie jest oceniana: API to jedno wywołanie, a checkpoint to cały stos serwujący, więc API wygrywa domyślnie, a nie w wyniku kalkulacji. Wkładem OrcaRouter jest to, że hostowana połowa tego porównania jest tania w przetestowaniu — ponad 200 modeli za jednym kluczem API, z cenami katalogowymi dostawców przekazywanymi przy 0% marży, więc opcja hostowana jest oceniana według rzeczywistej stawki, a nie szacowanej, z automatycznym przełączaniem awaryjnym, jeśli umieścisz kandydata za aktywną ścieżką, zanim skończysz podejmować decyzję.
Jak zdecydować w jednym przebiegu
Wybierz Eleven v4, jeśli głos musi być dobry już za pierwszym podejściem, a chcesz mieć to zrobione w tym tygodniu. Dostajesz czołówkę niezależnego rankingu, udokumentowaną składnię sterowania głosem, najszerszą udokumentowaną liczbę języków w tym porównaniu i zero infrastruktury. Płacisz 0,08 USD za każde 1000 znaków od 13 października, i godzisz się na to, że nie możesz go ponownie wytrenować, przypiąć do konkretnej wersji ani trzymać audio na własnym sprzęcie.
Wybierz VoxCPM2, jeśli model ma być twój. Apache 2.0, 2 mld parametrów przy około 8 GB VRAM, wyjście 48 kHz bez upsamplera w łańcuchu oraz ścieżka fine-tuningu, która działa w oparciu o pięć do dziesięciu minut audio — to możliwości, których hostowany endpoint nie oferuje za żadną cenę, a brak wiersza w arenie jest ich kosztem. Przeprowadź pomiary przepustowości na własnej karcie, zanim się zdecydujesz, ponieważ współczynniki czasu rzeczywistego 0,30 i 0,13 to własne pomiary karty modelu, a twój stack serwujący nie odtworzy ich dokładnie.
A jeśli szczera odpowiedź brzmi, że nie znasz swojego miesięcznego wolumenu audio, to właśnie tę liczbę trzeba znaleźć. To ona rozstrzyga to porównanie. Żadna z konsol ci tego nie powie.
