
Gemini 3.8 Live kontra GLM-4-Voice: co tak naprawdę dało 21 miesięcy rozwoju AI głosowej
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 459 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 183 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
GLM-4-Voice został wydany 3 grudnia 2024 r. Gemini 3.8 Live został zapowiedziany 15 września 2026 r. To 21 miesięcy i najważniejszy fakt w tym porównaniu — ważniejszy niż jakikolwiek benchmark, ponieważ determinuje, jakiego rodzaju pytanie tak naprawdę zadajesz.
Te dwa modele nie są rywalami. Nikt, kto w 2026 roku wdraża głos na dużą skalę, nie wybiera między nimi pod względem jakości. Prawdziwe pytanie to to, które stawia GLM-4-Voice, a na które Gemini 3.8 Live nie potrafi odpowiedzieć: co byłoby potrzebne, aby to posiadać, a nie wynajmować? To pytanie ma autentyczną odpowiedź i przez 21 miesięcy zmieniło się mniej, niż mogłoby się wydawać.
Co wypuścił Google, a co wypuścił Zhipu
Gemini 3.8 Live to hostowany model dialogu na żywo o zamkniętych wagach. Obsługuje dane wejściowe wizualne w niemal rzeczywistym czasie, automatycznie wykrywa i przełącza się między 97 obsługiwanymi językami w trakcie rozmowy oraz wykonuje wywołania narzędzi i API w tle, gdy rozmowa trwa. Jest dostępny dla deweloperów przez Gemini API i Google AI Studio, w prywatnej wersji zapoznawczej w Gemini Enterprise oraz w Search Live. Ogłoszona cena wynosi $0,005 za minutę wejścia audio i $0,018 za minutę wyjścia audio przez Live API; wykres kosztu na godzinę wejścia audio firmy Artificial Analysis niezależnie wskazuje na $1,50 za godzinę. Jego bliźniak, Gemini 3.8 Live Extended Thinking, obecnie zajmuje pierwsze miejsce w tym samym indeksie z wynikiem 82,6, podczas gdy sam Gemini 3.8 Live plasuje się na 76,0.
GLM-4-Voice to pierwszy model mowy end-to-end firmy Zhipu AI i jest to checkpoint do pobrania. To trójczęściowy zestaw: tokenizer mowy zbudowany na enkoderze Whisper-large-v3 z wąskim gardłem z kwantyzacją wektorową przy około 0,4 mld parametrów, autoregresyjny model językowy (GLM-4-Voice-9B, zainicjowany z GLM-4-9B) o około 9 mld parametrów oraz dekoder flow-matching ponownie wytrenowany na podstawie CosyVoice. Mówi po chińsku i angielsku, obsługuje sterowane instrukcjami emocje, ton, tempo mowy i dialekt — w tym kantoński, mandaryński z Chongqing oraz mowę pekińską — i tokenizuje mowę z częstotliwością 12,5 Hz do pojedynczego strumienia książki kodowej przy około 175 bps, o rząd wielkości niżej niż typowe neuronowe kodeki audio.
Wymiary, obok siebie:
• Premiera — Gemini 3.8 Live: 15 września 2026. GLM-4-Voice: 3 grudnia 2024.
• Wagi — zamknięte, dostępne wyłącznie w wersji hostowanej vs do pobrania, kod na licencji Apache-2.0 z niestandardową licencją na wagi.
• Języki — 97 z przełączaniem w trakcie rozmowy w porównaniu z chińskim i angielskim.
• Vision — wejście wizualne niemal w czasie rzeczywistym kontra brak.
• Wywoływanie narzędzi — wykonywanie narzędzi i wywołań API w tle w trakcie rozmowy kontra brak jakiegokolwiek kanału narzędziowego.
• Kontekst — niepublikowany przez Google vs kontekst 8K, maksymalne wyjście 4K.
• Minimalne wymagania do samodzielnego hostowania — nie dotyczy vs oficjalnie 32 GB RAM plus GPU CUDA; około 12 GB VRAM przy int4.
• Znakowanie wodne — SynthID we wszystkich generowanych materiałach audio w porównaniu z brakiem opisu.

21 miesięcy kupiło zdolność, nie tylko jakość
Najprostsza historia jest taka, że model frontier z 2026 r. bije otwarty checkpoint z 2024 r. Rzeczywiście tak jest, a przewaga jest duża — ale bardziej użyteczna obserwacja jest taka, że kategoria zmieniła kształt, a nie przesunęła się wzdłuż jednej osi.
Według własnego raportu technicznego Zhipu, GLM-4-Voice osiąga 93,6% dokładności zamiany mowy na tekst na Topic-StoryCloze, 82,9% w mowie do mowy, naturalność UTMOS na poziomie 4,45 oraz odpowiedzi na pytania głosowe 5,40/10 w kategorii ogólnej i 5,20/10 w kategorii wiedzy — wszystko to dane raportowane samodzielnie i nieodtworzone. Niezależna ewaluacja jest rzadsza i mniej pochlebna: w VoiceBench odnotowuje ogólny wynik 56,48, zajmując około 29. miejsce na 42 w jednym zestawieniu i 30. miejsce na 40 w innym, przy czym rozumienie wieloetapowe opisano jako słabe w obu językach. W benchmarku rozumienia wieloetapowego dialogu C³ osiąga 11,09% w języku chińskim i 33,22% w angielskim. VCB Bench uznał, że prowadzi w kontroli emocji z wynikiem 93,0 w chińskiej podmetryce SIF oraz w silnym dopasowaniu tekstu do mowy, ale obsługa dialektów w TELEVAL wyniosła 4,57% bez wyraźnej instrukcji.
Te liczby opisują model, który dobrze radzi sobie z ekspresją wokalną, a słabo z długotrwałym rozumieniem. Oto model mowy z 2024 roku w jednym zdaniu.
Wynik 76,0 Gemini 3.8 Live w Speech to Speech Index firmy Artificial Analysis to wskaźnik złożony obejmujący rozumowanie mowy, skuteczność agentową, preferencję areny i wskaźnik sukcesu zadań. Nie chodzi o to, że nowszy model jest lepszy w tym samym zadaniu o większy mnożnik. Chodzi o to, że wskaźnik złożony obejmuje teraz w ogóle skuteczność agentową i sukces zadań — kategorie, w których GLM-4-Voice nie może konkurować, ponieważ nie ma kanału narzędziowego. Model z 2024 r. jest oceniany w grze, do której nigdy nie został stworzony.

Licencja to część, którą ludzie pomijają.
Jeśli patrzysz na GLM-4-Voice, ponieważ jest otwarty, przeczytaj warunki, zanim wagi skończą się pobierać. Podział jest realny i łatwo go błędnie odczytać:
• Code — Apache-2.0. Naprawdę permisywna.
• Wagi — niestandardowa licencja, która wymaga podania autorstwa i rejestracji w Zhipu w przypadku użytku komercyjnego.
„Otwarte wagi” i „Apache-2.0” to nie to samo stwierdzenie, a wiele wtórnych publikacji o tym modelu miesza je ze sobą. Jeśli zamierzasz wprowadzić produkt komercyjny oparty na GLM-4-Voice, wymóg rejestracji jest krokiem prawnym, a nie formalnością, i powinien znaleźć się na ścieżce krytycznej. Jeden z trackerów posuwa się dalej i opisuje model jako własnościowy z warunkowym użyciem komercyjnym. Tak czy inaczej, brak rachunku za minutę nie oznacza braku relacji komercyjnej.
Arytmetyka kosztów, zrobiona uczciwie
Argument za samodzielnym hostingiem jest taki, że stały miesięczny koszt wygrywa z kosztem za minutę przy dużej skali. Ten argument jest prawdziwy i jest mniejszy, niż wygląda, gdy policzysz, czym zarządzasz.
GLM-4-Voice oficjalnie wymaga 32 GB RAM-u i GPU CUDA. Społecznościowe kwantyzacje int4 działają na mniej więcej 12 GB VRAM, w praktyce około 10–11 GB, czyli w zasięgu RTX 3060, z praktycznym pułapem około 30 sekund mowy na turę. Chmurowa A10 za około 0,50–1,00 USD za godzinę to gdzieś między 350 a 700 USD miesięcznie za nieprzerwanie działającą instancję — zanim obsłużysz choćby jednego użytkownika, i bez przełączania awaryjnego, bez możliwości obsługi skoków ruchu i bez nikogo, kto zostałby powiadomiony, gdy dekoder o 3 w nocy zacznie generować szum.
Z drugiej strony, Gemini 3.8 Live w cenie 1,50 USD za godzinę audio wejściowego oznacza, że 350 USD daje ci około 233 godzin głosu. To nie jest w oczywisty sposób gorsze, a wiąże się z przepustowością, której nie zapewniłeś. Punkt przecięcia istnieje; jest wyższy, niż sugeruje porównanie z nagłówka, i przesuwa się w zależności od tego, czy ruch jest stały, czy skokowy. Ruch skokowy to przypadek, w którym rozliczanie za minutę wygrywa zdecydowanie, ponieważ bezczynne GPU są rozliczane dokładnie tak samo jak zajęte.
Istnieje też różnica w tym, co się otrzymuje za pieniądze. Doniesienia społeczności o skwantyzowanych wdrożeniach GLM-4-Voice wskazują opóźnienie ciągłego dialogu na poziomie 38–120 ms, choć liczby te pochodzą z opisów, a nie od Zhipu. Opóźnienie Gemini 3.8 Live nie zostało w ogóle opublikowane przez Google. Jeśli niskie opóźnienie jest Twoim twardym wymaganiem, żadne z nich nie podaje liczby, na której można by oprzeć planowanie — jedno ma pomiary społeczności zewnętrznych, drugie ma referencje partnerów i żadnej liczby.

Opcja pośrednia: logika na własność, możliwości w wynajmie
Ujmowanie tego jako self-host kontra hosting zewnętrzny pomija układ, do którego większość zespołów faktycznie trafia. GLM-4-Voice nie ma kanału narzędziowego, więc każdy zbudowany na nim produkt potrzebuje osobnego modelu tekstowego do wyszukiwania — co oznacza, że samodzielnie hostowany model mowy i tak stoi przed hostowanym modelem tekstowym. Decyzja o wdrożeniu i decyzja o możliwościach są rozłączne.
Ten podział to miejsce, w którym router wykonuje prawdziwą pracę. OrcaRouter udostępnia 190 modeli za jednym kluczem w cenie katalogowej dostawcy, bez marży, więc cel delegowania stojący za twoim front-endem mowy można podmienić na żywym ruchu bez przebudowywania czegokolwiek, a obniżka ceny po stronie dostawcy dociera do ciebie tego samego dnia, a nie przy kolejnym odnowieniu. Automatyczne przełączanie awaryjne ma większe znaczenie niż zwykle w konfiguracji samodzielnie hostowanej, ponieważ gdy to twoja własna instancja GPU uległa awarii, model backendu jest nadal osiągalny i sesja nie musi ginąć razem z nią. Dwie uwagi, bo to porównanie prowokuje nieporozumienia: nie hostujemy GLM-4-Voice, a punkty końcowe Gemini 3.8 Live również nie znajdują się w naszym routerze — pochodzą od ich dostawców. To, co jest w routerze, to warstwa tekstowa, której oba przekazują pracę.
Decyzja i lekcja, która się pod nią kryje
Wybierz GLM-4-Voice, jeśli potrzebujesz modelu na własnym sprzęcie, jeśli Twój ruch jest naprawdę stabilny przy dużym wolumenie, jeśli budujesz wyłącznie w języku chińskim lub angielskim i jeśli potrzebujesz modyfikować model, a nie wywoływać go. Zaplanuj rejestrację licencji jako realne zadanie i oczekuj, że samodzielnie rozwiążesz problem rozumienia wieloturowego — to udokumentowany słaby punkt modelu i żadna ilość dostrajania wokół limitu wyjściowego 4K w pełni tego nie ukryje.
Wybierz Gemini 3.8 Live, jeśli Twoje wymagania obejmują obsługę wizji, wywoływanie narzędzi, więcej niż dwa języki lub dowolny wzorzec ruchu, który określiłbyś jako skokowy. To model w wersji zapoznawczej z niepublikowanymi danymi dotyczącymi kontekstu i opóźnień, co stanowi realne ryzyko planistyczne, ale jest też jedynym z tych dwóch, który potrafi coś wyszukać w trakcie zdania.
Ogólna lekcja jest warta więcej niż którykolwiek z tych werdyktów. Dwadzieścia jeden miesięcy rozwoju głosowego AI zaowocowało modelem, który nie jest przede wszystkim lepszym modelem głosowym — to głosowy interfejs do agenta. Jeśli powodem, dla którego chciałeś otwartych wag, był koszt, arytmetyka jest bliższa, niż sugeruje bezlicencyjne ujęcie. Jeśli powodem była kontrola, ta nie została wcale utowarowiona, a GLM-4-Voice pozostaje uzasadnioną odpowiedzią na pytanie, którego Gemini 3.8 Live nie porusza.
