
Gemini 3.8 TTS kontra VoxCPM2: Wynajmowanie głosu czy uruchamianie własnego, w prawdziwych liczbach
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Nie ma wiersza w rankingu, który stawia Gemini 3.8 Flash TTS i VoxCPM2 obok siebie, a ten brak jest najużyteczniejszym faktem w tym porównaniu. Gemini 3.8 Flash TTS to hostowany endpoint z Elo 1260, na 2. miejscu w Artificial Analysis Provider Voice Arena, z opublikowanym cennikiem rozliczanym w tokenach. VoxCPM2 to checkpoint OpenBMB — 2 miliardy parametrów, Apache 2.0, wydany w kwietniu 2026 roku — którego nie hostuje żaden dostawca inferencji. Nie możesz go wynająć. Uruchamiasz go sam.
Zatem pytanie nie brzmi, który model lepiej wypada. Chodzi o to, czy twojemu obciążeniu lepiej służy płacenie za znak za cudze GPU, czy posiadanie GPU i płacenie za nie niezależnie od tego, czy pracują. To pytanie arytmetyczne i w przeciwieństwie do większości porównań modeli ma odpowiedź, którą można obliczyć, zanim podejmiesz zobowiązanie.

Jedno z nich wynajmujesz, drugie obsługujesz.
Zacznij od tego, co każdy z nich faktycznie ci daje.
• Dostęp — Gemini 3.8 Flash TTS jest dostępny wyłącznie przez API, wywoływany za pośrednictwem Gemini API oraz powierzchni Google wymienionych w ogłoszeniu z 23 września 2026 r. VoxCPM2 nie ma własnego punktu końcowego w użyciu produkcyjnym ani dostawcy inferencji, który by go obsługiwał; punkt kontrolny jest produktem.
• Licencja — VoxCPM2 jest udostępniany na licencji Apache 2.0, która pozwala na użycie komercyjne bez odrębnej umowy. To naprawdę permisywna licencja i nie jest ona domyślnym rozwiązaniem w przypadku otwartych wag modeli mowy, z których kilka jest udostępnianych na warunkach wyłącznie badawczych, kierujących użycie komercyjne z powrotem przez hostowane API.
• Rozmiar — VoxCPM2 ma 2 mld parametrów i mieści się w około 8 GB VRAM przy obniżonej precyzji na potrzeby programowania, a szczytowe zużycie podczas serwowania wynosi około 22 GB na karcie 24 GB. Google nie opublikował liczby parametrów dla żadnego z modeli Gemini 3.8 TTS.
• Tworzenie głosu — Gemini 3.8 Flash TTS projektuje głos na podstawie opisu tekstowego, replikuje głos z 30-sekundowej próbki i prowadzi dialog dwóch mówców w ramach jednego wywołania. VoxCPM2 to model zamiany tekstu na mowę obsługujący jeden głos; rozmowa to dwa zszyte przebiegi.
• Niezależny wynik — Flash TTS go ma. VoxCPM2 nie pojawia się wśród wierszy rankingowych na Provider Voice Arena zarejestrowanej 24 września 2026 r. Brak na tablicy nie jest wyrokiem o jakości — zwykle oznacza, że nikt nie zgłosił modelu — ale oznacza, że nie ma liczbowego wskaźnika preferencji stron trzecich, który można by uwzględnić.

Ten ostatni punkt działa w obie strony i warto powiedzieć to wprost, zamiast go łagodzić: jeśli przed podjęciem decyzji potrzebujesz niezależnego sygnału jakości, tylko jeden z tych dwóch go zapewnia.
Liczba, która o tym decyduje: współczynnik czasu rzeczywistego
Samodzielne hostowanie modelu mowy zamienia rozliczenie za znak na rozliczenie za godzinę GPU, a kurs wymiany między tymi dwiema jednostkami to współczynnik czasu rzeczywistego modelu — ile sekund obliczeń potrzeba, aby wygenerować jedną sekundę dźwięku.
Opublikowane wyniki VoxCPM2 to 0,30 w zwykłym PyTorch i 0,13 w Nano-VLLM. Należy je odczytywać jako przepustowość, a nie opóźnienie: przy 0,13 jedna godzina GPU czasu zegarowego daje rząd 7,7 godziny gotowego audio. Przy 0,30 ta sama godzina GPU daje bliżej 3,3 godziny. To są własne liczby z karty modelu, zmierzone przez OpenBMB, i stanowią najważniejszą pojedynczą daną wejściową do każdej decyzji typu budować czy kupować w tym przypadku.
Wynikają z nich trzy rzeczy.
• Stos serwujący ma większe znaczenie niż model. Przejście ze zwykłego PyTorch na Nano-VLLM ponad dwukrotnie zwiększa przepustowość na identycznym sprzęcie. Każdy model kosztów oparty na wartości 0,30 przeszacowuje koszt własnego hostingu o współczynnik około 2,3.
• Wykorzystanie jest tu wszystkim. Wynajęty GPU, który przez 90% czasu stoi bezczynnie, nie jest tańszy od API za żadną cenę. Próg opłacalności pojawia się dopiero wtedy, gdy utrzymujesz kartę zajętą.
• Grupowanie wsadowe znów zmienia arytmetykę. Współczynnik czasu rzeczywistego jest mierzony na strumień; serwer obsługujący równoczesne żądania amortyzuje stały koszt między nimi, co jest dokładnie tym reżimem, w którym self-hosting zaczyna wygrywać.
Ile kosztuje godzina audio — w obie strony
Postaw oba modele rozliczeniowe na tej samej osi. Jedna godzina gotowego audio to 3600 sekund materiału wyjściowego.
Po stronie wynajmu Google rozlicza w tokenach, a nie w znakach: 0,50 USD za milion wejściowych tokenów tekstowych i 9,00 USD za milion wyjściowych tokenów audio do 31 grudnia 2026 r., a następnie 18,00 USD; Flash-Lite TTS to 0,50 USD i 6,00 USD, a następnie 12,00 USD. Batch i Flex kosztują 0,25 USD i 4,50 USD dla Flash TTS w porównaniu z 0,25 USD i 3,00 USD dla Flash-Lite TTS, a Priority kosztuje 0,90 USD i 16,00 USD. Artificial Analysis normalizuje standardowe stawki do 16,50 USD i 11,00 USD za milion znaków, co jest przeliczeniem redakcji, a nie wyceną Google, i to właśnie tę liczbę należy stosować przy porównywaniu z modelem, który rozlicza w znakach.
Po stronie własnej infrastruktury nie ma w ogóle stawki za znak. Koszt to godzina GPU pomnożona przez liczbę godzin, jakich potrzebujesz przy powyższej przepustowości, plus stos obsługi, plus ludzie, którzy utrzymują go w działaniu. Zaletą VoxCPM2 jest to, że koszt krańcowy tysięcznej godziny jest taki sam jak pierwszej — a wadą, że koszt krańcowy pierwszej godziny to GPU.
Dlatego właśnie ta decyzja jest wyjątkowo klarowna:
• Poniżej pewnego wolumenu API wygrywa i to nie jest nawet blisko. Płacisz jednocyfrowe kwoty w dolarach za godzinę audio w porównaniu z kosztem kapitałowym, a promocyjna stawka Google powiększa tę różnicę aż do 1 stycznia 2027 r.
• Powyżej tego wolumenu, na sprzęcie, który już posiadasz i możesz stale obciążać, checkpoint Apache 2.0 wygrywa zdecydowanie — a w przeciwieństwie do checkpointu objętego licencją badawczą, nic w licencji nie stoi na przeszkodzie, by go wdrożyć.
• W rozwiązaniu pośrednim szczera odpowiedź brzmi: kupujesz opcjonalność, a nie oszczędności. Self-hosting daje możliwość przypięcia wersji, utrzymania audio we własnej infrastrukturze i przestania przejmowania się zmianą stawek przez dostawcę.
Gdzie każda z nich jest prawidłową odpowiedzią
Wybierz Gemini 3.8 Flash TTS, jeśli chcesz produkt z lepszą dokumentacją. Ma niezależny wynik, opublikowaną cenę, dialog dwóch mówców w jednym wywołaniu, projektowanie i replikację głosu oraz brak jakiejkolwiek powierzchni operacyjnej poza kluczem API. Jego bliźniaczy Flash-Lite TTS daje drugi punkt cenowy w tym samym interfejsie przy znormalizowanej cenie 11,00 USD za milion znaków. W zamian akceptujesz stawkę, która podwaja się 1 stycznia 2027 r., oraz brak możliwości uruchomienia modelu gdziekolwiek.
Wybierz VoxCPM2, gdy chodzi o pracę operacyjną. Apache 2.0 oznacza, że użycie komercyjne jest wprost dozwolone, rozmiar 2B oznacza, że wystarczy jeden akcelerator, a współczynnik czasu rzeczywistego 0,13 w Nano-VLLM oznacza, że skromna karta wytwarza kilka godzin dźwięku na godzinę czasu zegarowego. Godzisz się na to, że nikt inny nie uruchomi tego za ciebie: żadnego hostowanego punktu końcowego, żadnego wiersza w arenie, żadnej karty stawek dostawcy, a każda gwarancja jakości, jaką otrzymujesz, jest tą, którą sam zbudujesz i zmierzysz.

Żaden z tych modeli nie jest hostowany przez OrcaRouter i warto powiedzieć to wprost, zamiast sugerować coś przeciwnego. Miejscem, w którym można wywołać Gemini 3.8 Flash TTS, jest własne API Google i powierzchnie wskazane przez Google; VoxCPM2 to checkpoint, który samodzielnie wdrażasz. OrcaRouter obejmuje natomiast warstwę ponad tą decyzją — ponad 200 modeli dostępnych za jednym kluczem w cenie katalogowej dostawcy bez marży, więc zmiana ceny u dostawcy jest widoczna po naszej stronie tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym, automatyczne przełączanie awaryjne dzięki czemu model będący w fazie testów nigdy nie musi być zależnością produkcyjną, oraz DSL routingu, który łączy kilka modeli w jedno wywołanie, gdy pojedynczy głos nie udźwignie całego zadania.
Co obejrzeć dalej
Dwie rzeczy zmieniłyby to porównanie w znaczący sposób, a żadna z nich jeszcze nie nastąpiła.
Pierwsza rzecz to ktoś hostujący VoxCPM2. Jego nieobecność na rynku inferencji jest głównym powodem, dla którego te dwa modele porównuje się pod kątem ekonomii, a nie jakości — jeśli jakiś dostawca go podchwyci, kalkulacja „wynajem kontra posiadanie” przestaje być czynnikiem decydującym, a brakujący wiersz areny staje się tym, co chcesz uzupełnić.
Drugą kwestią jest styczniowa zmiana stawek po stronie Google. Przy stawce promocyjnej API jest wystarczająco tanie, że większość obciążeń nie powinna sama hostować czegokolwiek; przy stawce po okresie promocyjnym różnica maleje do tego stopnia, że zespół dysponujący istniejącymi mocami GPU i stabilnym wolumenem powinien ponownie przeliczyć liczby, zamiast zakładać, że API nadal wygrywa.
Dopóki któreś z tych posunięć nie zostanie wykonane, decydującym czynnikiem nie jest ranking. Liczy się to, ile godzin materiału audio miesięcznie tworzysz, oraz to, czy karta jest zajęta.
