
VoxCPM2: 900 000 pobrań miesięcznie, a Transformery nadal nie mogą go wczytać
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 za 1 mln tokenów · 705 tok/s
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 za 1 mln tokenów · 57 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3150Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 201 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOWOŚĆAnthropic: Claude Opus 52026-07-2461Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2150Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1651Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0854Inteligencja72Kod
- tencentTencent: Hy32026-07-0641Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencja69Kod60Matematyka
Metadane Hugging Face'a dla VoxCPM2 podają jego bibliotekę jako voxcpm — a nie transformers. To pojedyncze pole wyjaśnia dziwną lukę istniejącą obecnie w świecie open-source'owej mowy: model text-to-speech OpenBMB o parametrach 2B zdobył 900 282 pobrania w ciągu ostatnich trzydziestu dni, doczekał się 25 publicznych finetuningów, 10 kwantyzacji, 7 adapterów i ponad 100 Spaces, a mimo to nadal nie może zostać załadowany przez bibliotekę, przy użyciu której wczytuje się prawie każdy inny model w tym serwisie. Pull request, który to naprawia, został otwarty 4 sierpnia 2026 roku i do dziś pozostaje otwarty.
Ta luka jest warta zrozumienia, zanim pojawi się poprawka, ponieważ kształtuje to, ile kosztuje cię integracja tego modelu w tym tygodniu w porównaniu z przyszłym kwartałem. A to opiera się na ciekawszym pytaniu, czy VoxCPM2 rzeczywiście jest tak daleko przed konkurencją, jak sugerują doniesienia. Wszystko poniżej pochodzi z trzech głównych źródeł: openbmb/VoxCPM2 — karta modelu i metadane repozytorium, plik README w repozytorium OpenBMB/VoxCPM na GitHub oraz raport techniczny VoxCPM2 (arXiv:2606.06928, złożony 5 czerwca 2026). Każdy wynik benchmarku w tym artykule jest własnością OpenBMB, uzyskany przez OpenBMB i — jak sam dokument stwierdza w swojej głównej tabeli porównawczej — liczby konkurencyjne w niej zostały skopiowane z innych publikacji, a nie przeliczone ponownie w porównywalnych warunkach. O ile nam wiadomo, żadne niezależne laboratorium nie opublikowało reprodukcji żadnego z tych wyników.
Specyfikacja na jednym ekranie
VoxCPM2 został wydany w kwietniu 2026 roku (repozytorium Hugging Face utworzono 3 kwietnia, ostatnia modyfikacja 16 kwietnia) jako trzecia generacja linii VoxCPM. W porównaniu z bezpośrednim poprzednikiem:
• Rozmiar — 2B parametrów wobec 0.8B backbone w VoxCPM1.5 i 0.6B backbone w VoxCPM-0.5B.
• Języki — 30 plus 9 chińskich dialektów, w porównaniu z tylko chińskim i angielskim w obu wcześniejszych wersjach.
• Audio — przyjmuje referencję 16 kHz, emituje 48 kHz, w porównaniu z symetrycznym 44.1 kHz na wejściu i wyjściu w VoxCPM1.5.
• Backbone — MiniCPM-4-1B (28 warstw, szerokość 2048) jako tekstowo-semantyczny model językowy, w porównaniu z MiniCPM-4-0.5B (24 warstwy, szerokość 1024).
• Budżet sekwencji — 8192 tokenów przy szybkości 6,25 Hz po stronie modelu językowego, co daje około 20 minut audio w jednym kontekście.
• Koszt sekundy mowy — współczynnik czasu rzeczywistego 0,30 w czystym PyTorch i 0,13 przez Nano-vLLM na jednym RTX 4090, przy około 8 GB VRAM. VoxCPM1.5 osiągnął 0,15 przy 0,8B i 6 GB.
• Licencja — Apache-2.0 dla wag, kodu do dostrajania i narzędzi do wnioskowania. Bez bramki, bez klauzuli dozwolonego użytkowania, dozwolone użycie komercyjne.
• Dane treningowe — „ponad 2 miliony godzin” wielojęzycznej mowy, bez podanej nazwy korpusu i bez informacji o pochodzeniu.
Przeczytaj linię RTF dwa razy, ponieważ biegnie w złym kierunku. VoxCPM2 jest mniej więcej dwa razy wolniejszy na sekundę wygenerowanego audio niż model 0.8B, który zastępuje, i potrzebuje o jedną trzecią więcej VRAM. Model 2B nie kupił przepustowości; kupił języki i kontrolę, a zapłacił za nie opóźnieniami. Jeśli prowadzisz agenta czasu rzeczywistego, ten kompromis jest pierwszą rzeczą, którą należy wycenić.
Co faktycznie zmienia PR #47756
Dziś uruchomienie VoxCPM2 oznacza zainstalowanie własnego pakietu OpenBMB — pip install voxcpm, Python 3.10 do 3.12, PyTorch 2.5 lub nowszy, CUDA 12 lub nowsza — oraz załadowanie modelu przez wywołanie VoxCPM.from_pretrained, które nie ma nic wspólnego z API Transformers. Wszystko, co następuje po tej decyzji, jest szyte na miarę: własny batching, własny klej do serwowania, własna obsługa pięciu trybów generowania.
W trakcie prac zmieniłoby się to. Issue #47695, „Add native support for OpenBMB VoxCPM2", został zgłoszony 31 lipca. PR #47756, „support for VoxCPM2", pojawił się 4 sierpnia i ostatnio był aktualizowany 5 sierpnia. Ma etykietę „New model" i dodaje modułową konfigurację oraz implementację modelowania, niestandardowy tokenizator i procesor, kodowanie i dekodowanie AudioVAE ze strumieniowaniem, warunkowanie głosem referencyjnym, kontynuację z promptem audio, automatyczne rejestracje klas oraz wpis potoku tekst-na-formę-falową — z raportowanym przejściem 64 testów modelu. Jest oparty na PR #47736, który dodaje samo MiniCPM4; szkielet tekstowy musi zostać wdrożony, zanim model mowy, który go opakowuje, będzie mógł się pojawić.

Dwie kwestie zasługują na uwagę i obie przemawiają przeciwko optymizmowi. Po pierwsze, wszystkie trzy elementy — zgłoszenie i oba pull requesty — zostały otwarte przez tego samego indywidualnego kontrybutora społeczności, a nie przez OpenBMB ani opiekuna Hugging Face. Nie stoi za tym żadne zobowiązanie dostawcy, więc nie ma też harmonogramu, na którym można by polegać. Po drugie, stos dwóch PR-ów z 203 commitami dotyczącymi nowej modalności nie jest szybkim przeglądem. PR-y dotyczące nowych modeli w Transformers zwykle wymagają tygodni wymiany zdań z opiekunami, a ten ma na razie cztery komentarze.
Praktyczne odczytanie: jeśli natywna klasa Transformers jest kluczowa dla twojej architektury — ponieważ standaryzujesz na AutoModel, albo ponieważ twoja warstwa serwowania obsługuje tylko Transformers — VoxCPM2 nie jest dla ciebie gotowy i nie ma żadnej daty. Jeśli możesz pozostać w obrębie pakietu voxcpm, model jest w pełni używalny już dziś, a ekosystem wyraźnie zagłosował, że jest to do zaakceptowania: 900 282 pobrań miało miejsce bez żadnego natywnego wsparcia. Istnieje też środkowa ścieżka, którą większość omówień pomija. OpenBMB dostarcza integrację vLLM-Omni udostępniającą kompatybilny z OpenAI /v1/audio/speech endpoint, a także build llama.cpp-omni z wagami GGUF, który działa na CPU, Metal, CUDA lub Vulkan bez żadnej zależności od Pythona. Jeśli tym, czego naprawdę chciałeś od Transformers, był standardowy interfejs serwowania, a nie sama klasa, to już istnieje.
"Tokenizer-free" nie oznacza nieskwantyzowany
Wyrażenie w każdym nagłówku na temat tego modelu jest najczęściej błędnie odczytywane. VoxCPM2 nie ma zewnętrznego dyskretnego kodeka audio — nie ma wyuczonego słownika tokenów mowy umieszczonego między modelem językowym a przebiegiem, tak jak ma to miejsce w liniach CosyVoice czy Moshi. To jest twierdzenie i jest prawdziwe.
W modelu nadal występuje kwantyzacja. Backbone uruchamia różniczkowalne półdyskretne wąskie gardło oparte na skończonej kwantyzacji skalarnej (Finite Scalar Quantization), a artykuł wprost opisuje jego rolę: tekstowo-semantyczny model językowy generuje ukryte stany, FSQ kwantyzuje je skalarnie w każdym wymiarze do „szkieletu semantycznego”, rezydualny akustyczny model językowy odzyskuje drobne szczegóły odrzucone przez FSQ, a lokalny dyfuzyjny transformer przekształca oba strumienie warunkujące w następny ciągły latentny patch poprzez flow matching. Cztery etapy, które widzisz pod skrótami LocEnc, TSLM, RALM i LocDiT, to dokładnie ten łańcuch.
Rozróżnienie, które ma znaczenie w praktyce, to nie {{1}}kwantyzacja kontra jej brak.{{/1}} Chodzi o to, że wąskie gardło jest {{2}}trenowane end-to-end wraz ze wszystkim, co je otacza, a nie zamrożone z góry jako osobny kodek z własną funkcją straty.{{/2}} To właśnie eliminuje typowy mechanizm awarii, w którym model językowy uczy się przewidywać tokeny, których kodek nie potrafi wiernie zdekodować. VoxCPM2 poszerzył wąskie gardło FSQ z 256 do 512 wymiarów i zastąpił starą sumę elementową zasilającą model resztowy uczoną projekcją konkatenacji — to drobne zmiany, a przy tym jedne z nielicznych w raporcie poparte opisanym mechanizmem, a nie różnicą w wynikach benchmarków.
Wyjście 48 kHz jest częściowo wymyślone, i taki jest zamysł.
„48 kHz studio-quality output” to najbardziej cytowany parametr modelu i jednocześnie najczęściej błędnie rozumiany. AudioVAE V2 jest asymetryczny: enkoder działa z częstotliwością 16 kHz, a dekoder rekonstruuje sygnał z częstotliwością 48 kHz. W artykule nazwano to „implicit super-resolution”, co jest uczciwą nazwą dla tego, czym to naprawdę jest.
Oto konsekwencja: enkoder 16 kHz ma sufit Nyquista na poziomie 8 kHz, więc nic powyżej 8 kHz w twoim materiale referencyjnym nigdy nie dociera do modelu. Każda odrobina energii w dwóch najwyższych oktawach wyjścia — powietrze w głosie, sybilanty, jasność krawędzi talerzy — jest generowana przez dekoder z wiarygodnego priora, a nie przenoszona z klonowanego mówcy. W przypadku większości narracji i prac agentowych jest to niewidoczne albo wręcz ulepszenie, bo dobry wyuczony prior bije twardą półkę 8 kHz. Dla każdego, czyją pracą jest wierność konkretnemu nagranemu głosowi, to fakt, wokół którego trzeba zaprojektować rozwiązanie — i nie ujawni go test odsłuchowy na laptopowych głośnikach.
Uzasadnienie przedstawione w artykule jest najbardziej wiarygodnym argumentem inżynieryjnym w raporcie i warto je przytoczyć, bo nie jest to marketing: pozostawienie enkodera na poziomie 16 kHz pozwala OpenBMB w całości ponownie wykorzystać oryginalny korpus treningowy VoxCPM 16 kHz, eliminuje ukrytą niezgodność między źródłami nagranymi z różnymi częstotliwościami próbkowania oraz unika eksplozji długości sekwencji, którą wyższa częstotliwość wejściowa narzuciłaby pętli autoregresyjnej. Podniesienie jakości tylko dekodera daje wierność wyjścia bez ponoszenia kosztów w najdroższej części modelu. To dobry kompromis, podjęty świadomie. Oznacza to również, że użytkownicy VoxCPM1.5 przechodzą z enkodera 44.1 kHz na enkoder 16 kHz — degradację po stronie wejścia sprzedaną w pakiecie z ulepszeniem po stronie wyjścia. Tabela rekonstrukcji samego OpenBMB pokazuje, jak to wygląda: kodek VoxCPM1.5 wciąż osiąga najlepszą pełnopasmową odległość melową spośród trzech generacji, 1.139 wobec 1.335 w AudioVAE V2, ponieważ działa natywnie z wysoką częstotliwością próbkowania zamiast odtwarzać sygnał do tej częstotliwości.
Czytanie tablicy wyników OpenBMB tak, jak napisał ją OpenBMB
Konkurencyjny, nie pierwszy
W standardowym benchmarku klonowania głosu zero-shot Seed-TTS-Eval, VoxCPM2 osiąga 1,84% współczynnika błędów słownych z 75,3% podobieństwem mówcy w zbiorze angielskim, 0,97% współczynnika błędów znaków z 79,5% podobieństwem w zbiorze chińskim oraz 8,13% CER z 75,3% podobieństwem w trudnym podzbiorze chińskim. Sam artykuł określa ten wynik jako „konkurencyjny”, a tabela potwierdza to określenie, a nie te mocniejsze, które krążą.

Wśród systemów open-source w tej samej tabeli Fish Audio S2 osiąga lepszy wskaźnik błędów we wszystkich trzech podzbiorach (0.99 / 0.54 / 5.99). Qwen3-TTS pokonuje go w angielskim WER z wynikiem 1.23. A LongCat-Audio-DiT zdecydowanie wygrywa w pięciu z sześciu komórek — 1.50 WER i 78.6 podobieństwa dla angielskiego, 81.8 podobieństwa dla chińskiego, 6.04 CER i 79.7 podobieństwa dla trudnego chińskiego. Tym, co wyróżnia VoxCPM2, jest równowaga: to jeden z bardzo nielicznych systemów, które jednocześnie są blisko czołówki pod względem podobieństwa i osiągają przyzwoite wyniki w zakresie zrozumiałości, a także jedyny na tej liście, który dodatkowo oferuje projektowanie głosu w języku naturalnym. Ale „state-of-the-art” to nie to, co pokazuje jego własna tabela wyników; uczciwe ujęcie jest takie, że to mocny system ogólnego przeznaczenia, a nie lider benchmarków.
3,3x więcej parametrów dało prawie żadną zrozumiałość.
Najbardziej przydatny wiersz w tej tabeli to {{1}}ten, którego nikt nie cytuje{{/1}}. VoxCPM-0.5B, pierwsza generacja 0,6B z września 2025 roku, osiąga 1,85% WER dla angielskiego i 0,93% CER dla chińskiego. VoxCPM2, przy 2B, osiąga 1,84% i 0,97%. Dla angielskiego to w granicach szumu, a {{2}}dla chińskiego nieco gorzej{{/2}}.
To, co faktycznie dały dodatkowe parametry, widać w kolumnach podobieństwa i nigdzie indziej: SIM dla angielskiego wzrósł z 72.9 do 75.3, a dla chińskiego z 77.2 do 79.5. Wszystko inne, co oferuje model 2B, wypada całkowicie poza tym benchmarkiem — 28 dodatkowych języków, projektowanie głosu z opisu tekstowego, klonowanie ze sterowaniem stylem, wyjście 48 kHz. To dużo i jest to uczciwy argument za aktualizacją. Ale jeśli Twoje zadania to klonowanie głosu po angielsku lub chińsku i wybierasz na podstawie wskaźnika błędów, VoxCPM2 nie daje Ci niczego, czego nie dawał już model 0.6B — przy trzykrotnie większych wagach i dwukrotnie większym opóźnieniu. Co ciekawe, VoxCPM1.5 wypada najsłabiej z tej trójki w tym benchmarku (2.12 / 1.18), co sprawia, że rozwój tej rodziny modeli wygląda mniej jak drabina, a bardziej jak trzy różne produkty.
Jeden model, dwie ewaluacje, różnica o rząd wielkości.
W tym miejscu wymagana jest ostrożność, ponieważ dwa wielojęzyczne wyniki w tym raporcie rażąco się ze sobą sprzeczają i oba są przywoływane tak, jakby rozstrzygały sprawę.
Najważniejszą liczbą jest średni wskaźnik błędów wynoszący 1,68% w 30 językach. Pochodzi on z zestawu testowego, który OpenBMB zbudował sam — 500 wypowiedzi na język — i ocenił przy użyciu Gemini 3.1 Flash Lite jako rozpoznawcy. W nim VoxCPM2 notuje dla angielskiego 0,42, dla chińskiego 0,92, dla hindi 0,79, dla arabskiego 1,23.
Raport zawiera również MiniMax-MLS-Test, zestaw 24 języków od zewnętrznego dostawcy, oceniany za pomocą Whisper-large-v3. Ten sam model. W nim VoxCPM2 osiąga 19,70 dla hindi i 13,05 dla arabskiego — odpowiednio dwadzieścia pięć razy i dziesięć razy gorzej, niż wskazuje jego własny benchmark, w językach, które oficjalnie obsługuje. Również w tej kolumnie: kantoński 38,58, czeski 24,13, rumuński 21,58, ukraiński 6,32.
Trzy rzeczy wyjaśniają większość z tego i warto je rozdzielić, ponieważ powszechnie znana wersja tej historii przekręca je.
• Czeski, rumuński i ukraiński nie są językami obsługiwanymi. Sprawdź tagi językowe w samym repozytorium: 30 kodów i żaden z nich nie jest cs, ro ani uk. Krytykowanie VoxCPM2 za 24% WER w czeskim to krytykowanie go za język, którego nigdy nie deklarował. Kantoński prawdopodobnie mieści się w „9 chińskich dialektach”, ale każdy system w tej kolumnie osiąga na nim ponad 30%, co wskazuje na rozpoznawcę, a nie na którykolwiek z modeli.
• Arabski i hindi są obsługiwane i to jest prawdziwe odkrycie. To są dwa języki, dla których OpenBMB deklaruje wsparcie, a jego dwie ewaluacje różnią się o rząd wielkości. Wytłumaczenie podane w samej pracy jest takie, że języki te mają „stosunkowo ograniczoną ilość danych” w korpusie treningowym oraz że „część wyższego WER może wynikać z ograniczonej dokładności rozpoznawania”. To rozsądna hipoteza, ale nietestowana. Jeśli wdrażasz rozpoznawanie mowy dla arabskiego lub hindi, opublikowany zakres dla tego modelu wynosi od 0,79% do 19,70% i żadna z tych wartości nie została niezależnie zweryfikowana. Zarezerwuj dzień na własne pomiary; nie polegaj na żadnej z tych liczb.
• Te metryki nie mają nawet tej samej jednostki.Hindi jest oceniane jako wskaźnik błędów znakowych na zbiorze wewnętrznym i wskaźnik błędów słownych na MiniMax-MLS. To nie są porównywalne wielkości, co jest kolejnym powodem, dla którego 25-krotna różnica nie jest jednoznacznym oskarżeniem — i kolejnym powodem, dla którego średnia 1,68% nie powinna być odczytywana jako wynik porównywalny wprost.
Ta sama ostrożność dotyczy twierdzenia, które w omówieniu tego modelu dźwiga największy ciężar liczbowy: że {{1}}VoxCPM2 pokonuje ElevenLabs pod względem podobieństwa mówcy, 85,4% do 61,3% w języku angielskim, wygrywając w 22 z 24 języków{{/1}}. To rzeczywiście mówi tabela. Jest to jednak także tabela, którą {{2}}artykuł zestawia częściowo z wcześniej opublikowanych wyników{{/2}}, i taka, w której {{3}}kolumna zrozumiałości ElevenLabs zawiera 73,94% WER dla tajskiego, 73,42% dla wietnamskiego i 16,03% dla chińskiego{{/3}}. To nie są liczby działającego komercyjnego produktu; to sygnatura {{4}}niezgodności punktacji lub konfiguracji{{/4}}. Tabela, która w jednej kolumnie jest tak wadliwa, nie staje się wiarygodna w innej tylko dlatego, że {{5}}wynik schlebia modelowi, o którym czytasz{{/5}}.
Pięć trybów z jednego rdzenia — i przepis, który napędza twoje liczby
Najczystszą ideą architektury jest to, że VoxCPM2 nie posiada oddzielnych modeli ani głowic dla swoich możliwości. Wszystkie pięć trybów to te same parametry, z inaczej ułożoną sekwencją wejściową, dlatego pojedynczy checkpoint 2B pokrywa to, co zwykle wymaga małej floty:
• Basic TTS — tekst na wejściu, dźwięk na wyjściu.
• Projektowanie głosu — opis w nawiasie jest po prostu dodawany przed tekstem, więc „(zmęczony mężczyzna w średnim wieku, ochrypły, mówiący powoli)” i sama kwestia przechodzą przez ten sam model językowy bez dodatkowego modułu. Nie ma żadnego referencyjnego audio.
• Klonowanie referencyjne — izolowany klip referencyjny warunkuje tożsamość mówcy, bez wymaganego transkryptu.
• Kontrolowane klonowanie — klip referencyjny plus opis stylu, dzięki czemu możesz sklonować głos, a następnie poprosić, by brzmiał pospiesznie lub rozbawiony.
• Klonowanie kontynuacji — klip referencyjny sparowany z jego transkrypcją, traktowany jako prefiks audio, który model kontynuuje, co jest trybem o najwyższej wierności.
W raporcie zakopany jest parametr, który większość opracowań pomija, a to on najprawdopodobniej zmieni twoje wyniki. Dwie ścieżki warunkowania — izolowane odniesienie i prefiks kontynuacji — można stosować osobno lub razem, a między nimi istnieje zależność kompromisowa. W ablacjach przeprowadzonych przez OpenBMB użycie obu tych ścieżek jednocześnie daje najlepsze podobieństwo mówcy na każdym podzbiorze. Pominięcie prefiksu kontynuacji i przekazanie tylko izolowanego odniesienia daje najlepszą zrozumiałość na trudnych chińskich tekstach — 6,85% CER wobec 7,44% — kosztem około pięciu punktów podobieństwa. Wyjaśnienie zawarte w artykule jest sensowne: bez czasowego prefiksu audio, który kotwiczy prozodię, model ma więcej swobody w wyborze sposobu wypowiedzi, który poradzi sobie z trudnym tekstem.
Więc domyślna opcja to wybór, a nie pułap. Praca nad dopasowywaniem głosu wymaga obu ścieżek; trudny lub nietypowy tekst wymaga trybu wyłącznie referencyjnego. Jedno uczciwe zastrzeżenie: bezwzględne wartości w tamtej tabeli ablacji nie są spójne z tabelą główną dla przepisu, którego — według artykułu — używano w całej pracy, co w przypadku preprintu jest raczej pomyłką księgową niż czymś złowrogim — ale to trzeci powód, by traktować każdą liczbę tutaj jako wskazówkę do testów, a nie wartość do zacytowania.
Projektowanie głosu: bardziej posłuszne niż naturalne
Projektowanie głosowe to funkcja, która sprawia, że to wydanie jest interesujące, a nie przyrostowe, i to właśnie w jej przypadku dane dostawcy są najbardziej wymowne, jeśli chodzi o realny kompromis.
W InstructTTSEval VoxCPM2 uzyskuje 84.2 w specyfikacji parametrów akustycznych, 83.2 w dyrektywach dotyczących stylu opisowego i 71.4 w odgrywaniu ról dla języka angielskiego — ten ostatni wynik jest najlepszy w tabeli, przed Qwen3-TTS-1.7B-VD z 68.4 i Gemini-TTS-Pro z 67.2. W języku chińskim jest słabszy, a kolejność się odwraca: 85.2 / 71.5 / 60.8, wobec 89.0 / 90.1 / 75.5 dla Gemini-TTS-Pro. Najmocniejsze twierdzenie, jakie można postawić, jest takie, że VoxCPM2 przoduje w angielskim odgrywaniu ról i pozostaje w tyle za zamkniętym systemem z czołówki niemal wszędzie indziej w podążaniu za instrukcjami.
Ludzki panel słuchowy — 50 słuchaczy, randomizowany i podwójnie zaślepiony, według raportu — wyostrza to. W generowaniu sterowalnym VoxCPM2 osiąga 4,50 w podążaniu za instrukcjami wobec 4,41 Qwen3-TTS-VD, a w naturalności wypada gorzej (4,48 wobec 4,61). W zwykłym klonowaniu zero-shot wygrywa w podobieństwie mówcy (4,74 wobec 4,69) i remisuje lub odstaje w naturalności (4,78 wobec 4,80 Qwen3-TTS, z nakładającymi się przedziałami ufności).
Ten wzorzec jest na tyle spójny, że można na nim oprzeć planowanie: VoxCPM2 robi to, co mu powiesz, i brzmi przy tym odrobinę mniej po ludzku, natomiast Qwen3-TTS brzmi nieco lepiej i nieco luźniej trzyma się instrukcji. To, który z nich jest odpowiedni, zależy wyłącznie od tego, czy wartość Twojego produktu leży w precyzyjnej kontroli, czy w bezproblemowym dostarczaniu. OpenBMB sam zaznacza tę konsekwencję w swoich zastrzeżeniach – i jest to coś, co dostawcy zwykle pomijają: projektowanie głosu i kontrolowane klonowanie „mogą dawać zmienne wyniki między uruchomieniami”, a uzyskanie głosu, jakiego chcesz, może wymagać kilku prób. Wbuduj mechanizm ponawiania w swój potok, a jeśli głos ma znaczenie – również ludzki filtr odsłuchowy.
Ile kosztuje prowadzenie i kiedy wynajem to właściwy wybór
Nigdzie nie ma hostowanego VoxCPM2. Pasek boczny samego Hugging Face mówi to wprost — „Ten model nie jest udostępniany przez żadnego dostawcę inferencji” — i to dotyczy również nas: OrcaRouter nie obsługuje VoxCPM2 i żadne chęci tego nie zmienią, że model TTS 2B bez partnera inferencyjnego to wagi, które hostujesz sam, albo nic.
To sprawia, że kwestia kosztów staje się kwestią GPU, a arytmetyka jest prosta. Przy współczynniku rzeczywistym Nano-vLLM wynoszącym 0,13 na pojedynczym RTX 4090, jedna godzina GPU daje około 7,7 godzin audio, więc koszt za godzinę audio to stawka godzinowa za jedną kartę 24 GB podzielona przez około 7,7. W czystym PyTorch przy RTF 0,30 spada to do około 3,3 godzin audio na godzinę GPU. Obie liczby pochodzą od OpenBMB, zmierzone na ich sprzęcie i ich tekście, a na Twoim będą inne — rozmiar partii, trudność tekstu i liczba ponownych prób wymuszonych przez bramkę jakości to mnożniki, których liczba RTF nie uwzględnia. Współczynnik ponownych prób to ten, o którym ludzie zapominają: model, który według dostawcy może wymagać kilku prób, aby trafić w docelowy głos, nie kosztuje tyle, ile wynika z jego RTF.

Porównanie, jakiego ludzie oczekują na tym etapie, dotyczy wynajmowanego API, a uczciwa odpowiedź brzmi, że tych dwóch rzeczy nie da się wprost przeliczyć. openai/tts-1-hd kosztuje 30,00 USD za milion tokenów w obie strony — to cena katalogowa dostawcy przekazywana bez zmian przez OrcaRouter, ponieważ nie doliczamy żadnej marży, więc kwota na naszej stronie modelu to dokładnie to, co pobiera OpenAI. Ale tokeny to nie sekundy i żaden opublikowany przelicznik nie zamienia jednych na drugie na tyle wiarygodnie, żeby można było na tym zbudować arkusz kalkulacyjny. Każdy, kto pokazuje ci proste porównanie godzinowe między samodzielnie hostowanym modelem TTS o otwartych wagach a API rozliczanym za tokeny, przyjął założenie, którego ci nie pokazał.
Warto powiedzieć, gdzie architektonicznie przebiega granica. Samodzielne hostowanie VoxCPM2 ma sens, gdy potrzebujesz konkretnego sklonowanego głosu, gdy wolumen audio jest na tyle stabilny, aby utrzymać GPU zajęte, gdy dane nie mogą opuszczać Twojej infrastruktury lub gdy zamierzasz dostroić go techniką LoRA — a obsługuje to na 5–10 minutach docelowego audio, co jest naprawdę tanim rozwiązaniem. Wynajem ma sens, gdy wolumen jest nierównomierny, gdy nie możesz zapewnić obsługi GPU lub gdy głos jest wymienny. Większość prawdziwych produktów głosowych to dwa systemy, nie jeden: warstwa syntezy oraz model językowy odpowiadający za rozumowanie. Część rozumująca to ta, którą warto umieścić za jednym kluczem z automatycznym przełączaniem awaryjnym między dostawcami, tak aby zmiana modelu była zmianą ciągu znaków, a nie procesem zakupowym; do tego właśnie służy OrcaRouter, obejmujący ponad 200 modeli. Część syntezy — gdy chodzi o konkretny głos, który posiadasz i dostrajasz — powinna działać na Twoim własnym sprzęcie. VoxCPM2 wpisuje się dokładnie w tę drugą kategorię, a fakt, że nikt go nie udostępnia, jest konsekwencją tego, czym jest, a nie przeoczeniem.
Czego OpenBMB mówi, byś nie oczekiwał
Sekcja dotycząca ograniczeń jest niezwykle szczera jak na wydanie z takim impetem i wystarczająco krótka, by potraktować ją poważnie:
• Jakość klonowania to powierzchnia nadużyć.Karta mówi o tym wprost: model generuje mowę na tyle realistyczną, że można jej użyć do podszywania się i oszustw, a generowane przez AI audio powinno być oznaczone. Apache-2.0 nie nakłada na to absolutnie żadnych ograniczeń — w przeciwieństwie do licencji kilku konkurencyjnych modeli głosowych o otwartych wagach nie ma tu klauzuli dopuszczalnego użytku, za którą można się schować. Politykę zgody i ujawniania informacji piszesz samodzielnie.
• Zmienność między kolejnymi przebiegami jest oczekiwana w przypadku dwóch funkcji kontrolnych, a nie błąd do zgłoszenia.
• Te 30 języków to realna granica. Wszystko poza nimi może działać i jest nieprzetestowane; spodziewaj się dostrajania.
• Spójność kontroli stylu jest opisywana jako wciąż w fazie rozwoju przez ludzi, którzy ją zbudowali.
A luki, których karta nie wymienia: brak jakiegokolwiek ujawnienia korpusu treningowego, więc licencja Apache-2.0 na wagi rozwiązuje kwestię kodu, ale nic nie mówi o pochodzeniu danych. Brak niezależnej oceny jakiejkolwiek liczby w tym artykule. Brak opublikowanych opóźnień w milisekundach — RTF to współczynnik przepustowości, a agent głosowy żyje lub umiera dzięki czasowi do pierwszego dźwięku, którego nie ma w raporcie.
Trzy pytania, których karta modelu nie rozstrzyga
Czy powinienem przejść z VoxCPM1.5 lub VoxCPM-0.5B?
Tylko dla nowych możliwości i dopiero po zmierzeniu. Jeśli potrzebujesz języków poza chińskim i angielskim, projektowania głosu lub klonowania ze sterowalnym stylem, aktualizacja jest sednem sprawy i nie ma alternatywy w tej rodzinie. Jeśli dziś korzystasz z klonowania w języku angielskim lub chińskim i jesteś zadowolony, argument za aktualizacją jest z natury słaby: ten sam benchmark pokazuje, że VoxCPM-0.5B dorównuje VoxCPM2 pod względem współczynnika błędów, a płaciłbyś dwukrotnie większe opóźnienie i o jedną trzecią więcej VRAM za około 2,4 punktu podobieństwa mówcy. Jest też szczegół migracji, który łatwo przeoczyć — jeśli wcześniej podawałeś VoxCPM1.5 referencyjne audio 44,1 kHz, enkoder VoxCPM2 przyjmuje 16 kHz, więc Twój potok referencyjny się zmienia, a górna część materiału źródłowego przestaje mieć znaczenie.
Czy faktycznie mogę wypuścić komercyjny produkt głosowy na tym?
Pod względem prawnym licencja jest jedną z najbardziej liberalnych: Apache-2.0, bez bramek, bez ograniczeń użycia, dozwolone użycie komercyjne, zarówno wagi, jak i kod do fine-tuningu są objęte licencją. Otwarte pytanie nie dotyczy tekstu licencji, ale tego, czego za nią brakuje. OpenBMB nie podaje korpusu treningowego, co oznacza, że nikt nie może powiedzieć, czyje głosy znajdują się w 2 milionach godzin. W przypadku modelu, którego główną cechą jest odtwarzanie głosu konkretnej osoby, to pytanie należy skierować do własnego doradcy prawnego, a nie do karty modelu — i jest to to samo pytanie, którego obecnie unika każdy model głosowy o otwartych wagach. Praktycznie rzecz biorąc, trudniejsze przeszkody mają charakter operacyjny: brak natywnej klasy Transformers, brak hostowanego endpointu gdziekolwiek, zmienność wyników między uruchomieniami w przypadku cech kontrolnych oraz brak wartości czasu do pierwszego dźwięku, jeśli budujesz coś konwersacyjnego.
Czy jest wystarczająco dobry, aby zastąpić płatnego dostawcę TTS?
W przypadku narracji w języku angielskim i chińskim, wcześniej nagranych treści oraz każdego zadania, w którym kontrolujesz konkretny głos i możesz wykonywać pracę wsadowo: tak, na podstawie dostępnych dowodów, a licencja sprawia, że wypróbowanie jest niemal darmowe. W przypadku agentów konwersacyjnych działających w czasie rzeczywistym: sam zmierz czas do pierwszego dźwięku, zanim się zdecydujesz, ponieważ nikt go nie opublikował, a RTF ci tego nie powie. W przypadku arabskiego, hindi lub jakiegokolwiek języka z długiego ogona: dwie własne ewaluacje dostawcy różnią się o rząd wielkości, więc traktuj model jako niepotwierdzony w tych językach, niezależnie od tego, którą liczbę widziałeś. A w przypadku wszystkiego, gdzie błędna wymowa jest incydentem biznesowym, a nie tylko uciążliwością, zauważ, że VoxCPM2 nie jest liderem zrozumiałości nawet we własnej tabeli — Fish Audio S2 i LongCat-Audio-DiT są przed nim, a także mają otwarte wagi.
Co obejrzeć
Dwie rzeczy, w różnym tempie. Ta bliższa to PR #47756 i PR MiniCPM4 pod nim. Jeśli oba zostaną zmergowane, VoxCPM2 stanie się wywołaniem AutoModel, a koszt integracji dla wszystkich, którzy postawili na Transformers, spadnie z dnia na dzień niemal do zera — a skoro 900 282 pobrań miesięcznie już odbywa się na piechotę, to istotne odblokowanie. Jeśli utkną, odpowiedzią dla tych zespołów pozostaje „użyj pakietu OpenBMB albo endpointu vLLM-Omni", a współtwórca społeczności, który opiekuje się oboma PR-ami, nie ma żadnej siły przebicia, by to zmienić.
Wolniejsze pytanie brzmi, czy ktokolwiek spoza OpenBMB kiedykolwiek opublikuje jakąś liczbę. Cztery miesiące po premierze, przy 900 000 miesięcznych pobrań, 25 dostrojonych modelach i ponad 100 Spaces zbudowanych na jego bazie, każda krążąca liczba dotycząca wydajności wciąż wywodzi się z jednego raportu technicznego napisanego przez ludzi, którzy wytrenowali model. To nie jest przytyk wobec OpenBMB, którzy udokumentowali swoją pracę dokładniej i uczciwiej niż większość — raport ujawnia wybory rozpoznawcy, słabości dotyczące ilości danych oraz niestabilność samego modelu. To przytyk wobec reszty z nas. Najcenniejszą rzeczą, jaką ktokolwiek w społeczności open-source zajmującej się mową mógłby w tym miesiącu opublikować, jest uruchomienie modeli VoxCPM2, Qwen3-TTS, Fish Audio S2 i LongCat-Audio-DiT ocenione przez Whisper, z wykorzystaniem zbiorów Seed-TTS-Eval i MiniMax-MLS, w identycznych warunkach. Dopóki to nie powstanie, uczciwe podsumowanie VoxCPM2 jest takie, że jest to najbardziej zaawansowany model głosowy o otwartych wagach na checkpoint, jaki ktokolwiek wypuścił, że nie jest to najdokładniejszy model, oraz że obie części tego zdania opierają się na słowie dostawcy.
