Główna karta tytułowa dla Gemini 3.8 Live vs GLM-4-Voice z nadtytułem „OrcaRouter · radar modeli — bezpośrednie starcie” i podtytułem „Co tak naprawdę dało 21 miesięcy AI głosowej”. Dwie karty głoszą „Gemini 3.8 Live — wrz 2026, hostowany, narzędzia, 97 języków” oraz „GLM-4-Voice — gru 2024, otwarte wagi, 9B, chiński i angielski”, z plakietkami: 21 miesięcy różnicy, kod Apache-2.0 i licencja na niestandardowe wagi. Logo OrcaRouter jest nałożone w prawym dolnym rogu.
Guides & Insights

Gemini 3.8 Live kontra GLM-4-Voice: co tak naprawdę dało 21 miesięcy rozwoju AI głosowej

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GLM-4-Voice został wydany 3 grudnia 2024 r. Gemini 3.8 Live został zapowiedziany 15 września 2026 r. To 21 miesięcy i najważniejszy fakt w tym porównaniu — ważniejszy niż jakikolwiek benchmark, ponieważ determinuje, jakiego rodzaju pytanie tak naprawdę zadajesz.

Te dwa modele nie są rywalami. Nikt, kto w 2026 roku wdraża głos na dużą skalę, nie wybiera między nimi pod względem jakości. Prawdziwe pytanie to to, które stawia GLM-4-Voice, a na które Gemini 3.8 Live nie potrafi odpowiedzieć: co byłoby potrzebne, aby to posiadać, a nie wynajmować? To pytanie ma autentyczną odpowiedź i przez 21 miesięcy zmieniło się mniej, niż mogłoby się wydawać.

Co wypuścił Google, a co wypuścił Zhipu

Gemini 3.8 Live to hostowany model dialogu na żywo o zamkniętych wagach. Obsługuje dane wejściowe wizualne w niemal rzeczywistym czasie, automatycznie wykrywa i przełącza się między 97 obsługiwanymi językami w trakcie rozmowy oraz wykonuje wywołania narzędzi i API w tle, gdy rozmowa trwa. Jest dostępny dla deweloperów przez Gemini API i Google AI Studio, w prywatnej wersji zapoznawczej w Gemini Enterprise oraz w Search Live. Ogłoszona cena wynosi $0,005 za minutę wejścia audio i $0,018 za minutę wyjścia audio przez Live API; wykres kosztu na godzinę wejścia audio firmy Artificial Analysis niezależnie wskazuje na $1,50 za godzinę. Jego bliźniak, Gemini 3.8 Live Extended Thinking, obecnie zajmuje pierwsze miejsce w tym samym indeksie z wynikiem 82,6, podczas gdy sam Gemini 3.8 Live plasuje się na 76,0.

GLM-4-Voice to pierwszy model mowy end-to-end firmy Zhipu AI i jest to checkpoint do pobrania. To trójczęściowy zestaw: tokenizer mowy zbudowany na enkoderze Whisper-large-v3 z wąskim gardłem z kwantyzacją wektorową przy około 0,4 mld parametrów, autoregresyjny model językowy (GLM-4-Voice-9B, zainicjowany z GLM-4-9B) o około 9 mld parametrów oraz dekoder flow-matching ponownie wytrenowany na podstawie CosyVoice. Mówi po chińsku i angielsku, obsługuje sterowane instrukcjami emocje, ton, tempo mowy i dialekt — w tym kantoński, mandaryński z Chongqing oraz mowę pekińską — i tokenizuje mowę z częstotliwością 12,5 Hz do pojedynczego strumienia książki kodowej przy około 175 bps, o rząd wielkości niżej niż typowe neuronowe kodeki audio.

Wymiary, obok siebie:

• Premiera — Gemini 3.8 Live: 15 września 2026. GLM-4-Voice: 3 grudnia 2024.

• Wagi — zamknięte, dostępne wyłącznie w wersji hostowanej vs do pobrania, kod na licencji Apache-2.0 z niestandardową licencją na wagi.

• Języki — 97 z przełączaniem w trakcie rozmowy w porównaniu z chińskim i angielskim.

• Vision — wejście wizualne niemal w czasie rzeczywistym kontra brak.

• Wywoływanie narzędzi — wykonywanie narzędzi i wywołań API w tle w trakcie rozmowy kontra brak jakiegokolwiek kanału narzędziowego.

• Kontekst — niepublikowany przez Google vs kontekst 8K, maksymalne wyjście 4K.

• Minimalne wymagania do samodzielnego hostowania — nie dotyczy vs oficjalnie 32 GB RAM plus GPU CUDA; około 12 GB VRAM przy int4.

• Znakowanie wodne — SynthID we wszystkich generowanych materiałach audio w porównaniu z brakiem opisu.

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21 miesięcy kupiło zdolność, nie tylko jakość

Najprostsza historia jest taka, że model frontier z 2026 r. bije otwarty checkpoint z 2024 r. Rzeczywiście tak jest, a przewaga jest duża — ale bardziej użyteczna obserwacja jest taka, że kategoria zmieniła kształt, a nie przesunęła się wzdłuż jednej osi.

Według własnego raportu technicznego Zhipu, GLM-4-Voice osiąga 93,6% dokładności zamiany mowy na tekst na Topic-StoryCloze, 82,9% w mowie do mowy, naturalność UTMOS na poziomie 4,45 oraz odpowiedzi na pytania głosowe 5,40/10 w kategorii ogólnej i 5,20/10 w kategorii wiedzy — wszystko to dane raportowane samodzielnie i nieodtworzone. Niezależna ewaluacja jest rzadsza i mniej pochlebna: w VoiceBench odnotowuje ogólny wynik 56,48, zajmując około 29. miejsce na 42 w jednym zestawieniu i 30. miejsce na 40 w innym, przy czym rozumienie wieloetapowe opisano jako słabe w obu językach. W benchmarku rozumienia wieloetapowego dialogu C³ osiąga 11,09% w języku chińskim i 33,22% w angielskim. VCB Bench uznał, że prowadzi w kontroli emocji z wynikiem 93,0 w chińskiej podmetryce SIF oraz w silnym dopasowaniu tekstu do mowy, ale obsługa dialektów w TELEVAL wyniosła 4,57% bez wyraźnej instrukcji.

Te liczby opisują model, który dobrze radzi sobie z ekspresją wokalną, a słabo z długotrwałym rozumieniem. Oto model mowy z 2024 roku w jednym zdaniu.

Wynik 76,0 Gemini 3.8 Live w Speech to Speech Index firmy Artificial Analysis to wskaźnik złożony obejmujący rozumowanie mowy, skuteczność agentową, preferencję areny i wskaźnik sukcesu zadań. Nie chodzi o to, że nowszy model jest lepszy w tym samym zadaniu o większy mnożnik. Chodzi o to, że wskaźnik złożony obejmuje teraz w ogóle skuteczność agentową i sukces zadań — kategorie, w których GLM-4-Voice nie może konkurować, ponieważ nie ma kanału narzędziowego. Model z 2024 r. jest oceniany w grze, do której nigdy nie został stworzony.

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

Licencja to część, którą ludzie pomijają.

Jeśli patrzysz na GLM-4-Voice, ponieważ jest otwarty, przeczytaj warunki, zanim wagi skończą się pobierać. Podział jest realny i łatwo go błędnie odczytać:

• Code — Apache-2.0. Naprawdę permisywna.

• Wagi — niestandardowa licencja, która wymaga podania autorstwa i rejestracji w Zhipu w przypadku użytku komercyjnego.

„Otwarte wagi” i „Apache-2.0” to nie to samo stwierdzenie, a wiele wtórnych publikacji o tym modelu miesza je ze sobą. Jeśli zamierzasz wprowadzić produkt komercyjny oparty na GLM-4-Voice, wymóg rejestracji jest krokiem prawnym, a nie formalnością, i powinien znaleźć się na ścieżce krytycznej. Jeden z trackerów posuwa się dalej i opisuje model jako własnościowy z warunkowym użyciem komercyjnym. Tak czy inaczej, brak rachunku za minutę nie oznacza braku relacji komercyjnej.

Arytmetyka kosztów, zrobiona uczciwie

Argument za samodzielnym hostingiem jest taki, że stały miesięczny koszt wygrywa z kosztem za minutę przy dużej skali. Ten argument jest prawdziwy i jest mniejszy, niż wygląda, gdy policzysz, czym zarządzasz.

GLM-4-Voice oficjalnie wymaga 32 GB RAM-u i GPU CUDA. Społecznościowe kwantyzacje int4 działają na mniej więcej 12 GB VRAM, w praktyce około 10–11 GB, czyli w zasięgu RTX 3060, z praktycznym pułapem około 30 sekund mowy na turę. Chmurowa A10 za około 0,50–1,00 USD za godzinę to gdzieś między 350 a 700 USD miesięcznie za nieprzerwanie działającą instancję — zanim obsłużysz choćby jednego użytkownika, i bez przełączania awaryjnego, bez możliwości obsługi skoków ruchu i bez nikogo, kto zostałby powiadomiony, gdy dekoder o 3 w nocy zacznie generować szum.

Z drugiej strony, Gemini 3.8 Live w cenie 1,50 USD za godzinę audio wejściowego oznacza, że 350 USD daje ci około 233 godzin głosu. To nie jest w oczywisty sposób gorsze, a wiąże się z przepustowością, której nie zapewniłeś. Punkt przecięcia istnieje; jest wyższy, niż sugeruje porównanie z nagłówka, i przesuwa się w zależności od tego, czy ruch jest stały, czy skokowy. Ruch skokowy to przypadek, w którym rozliczanie za minutę wygrywa zdecydowanie, ponieważ bezczynne GPU są rozliczane dokładnie tak samo jak zajęte.

Istnieje też różnica w tym, co się otrzymuje za pieniądze. Doniesienia społeczności o skwantyzowanych wdrożeniach GLM-4-Voice wskazują opóźnienie ciągłego dialogu na poziomie 38–120 ms, choć liczby te pochodzą z opisów, a nie od Zhipu. Opóźnienie Gemini 3.8 Live nie zostało w ogóle opublikowane przez Google. Jeśli niskie opóźnienie jest Twoim twardym wymaganiem, żadne z nich nie podaje liczby, na której można by oprzeć planowanie — jedno ma pomiary społeczności zewnętrznych, drugie ma referencje partnerów i żadnej liczby.

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

Opcja pośrednia: logika na własność, możliwości w wynajmie

Ujmowanie tego jako self-host kontra hosting zewnętrzny pomija układ, do którego większość zespołów faktycznie trafia. GLM-4-Voice nie ma kanału narzędziowego, więc każdy zbudowany na nim produkt potrzebuje osobnego modelu tekstowego do wyszukiwania — co oznacza, że samodzielnie hostowany model mowy i tak stoi przed hostowanym modelem tekstowym. Decyzja o wdrożeniu i decyzja o możliwościach są rozłączne.

Ten podział to miejsce, w którym router wykonuje prawdziwą pracę. OrcaRouter udostępnia 190 modeli za jednym kluczem w cenie katalogowej dostawcy, bez marży, więc cel delegowania stojący za twoim front-endem mowy można podmienić na żywym ruchu bez przebudowywania czegokolwiek, a obniżka ceny po stronie dostawcy dociera do ciebie tego samego dnia, a nie przy kolejnym odnowieniu. Automatyczne przełączanie awaryjne ma większe znaczenie niż zwykle w konfiguracji samodzielnie hostowanej, ponieważ gdy to twoja własna instancja GPU uległa awarii, model backendu jest nadal osiągalny i sesja nie musi ginąć razem z nią. Dwie uwagi, bo to porównanie prowokuje nieporozumienia: nie hostujemy GLM-4-Voice, a punkty końcowe Gemini 3.8 Live również nie znajdują się w naszym routerze — pochodzą od ich dostawców. To, co jest w routerze, to warstwa tekstowa, której oba przekazują pracę.

Decyzja i lekcja, która się pod nią kryje

Wybierz GLM-4-Voice, jeśli potrzebujesz modelu na własnym sprzęcie, jeśli Twój ruch jest naprawdę stabilny przy dużym wolumenie, jeśli budujesz wyłącznie w języku chińskim lub angielskim i jeśli potrzebujesz modyfikować model, a nie wywoływać go. Zaplanuj rejestrację licencji jako realne zadanie i oczekuj, że samodzielnie rozwiążesz problem rozumienia wieloturowego — to udokumentowany słaby punkt modelu i żadna ilość dostrajania wokół limitu wyjściowego 4K w pełni tego nie ukryje.

Wybierz Gemini 3.8 Live, jeśli Twoje wymagania obejmują obsługę wizji, wywoływanie narzędzi, więcej niż dwa języki lub dowolny wzorzec ruchu, który określiłbyś jako skokowy. To model w wersji zapoznawczej z niepublikowanymi danymi dotyczącymi kontekstu i opóźnień, co stanowi realne ryzyko planistyczne, ale jest też jedynym z tych dwóch, który potrafi coś wyszukać w trakcie zdania.

Ogólna lekcja jest warta więcej niż którykolwiek z tych werdyktów. Dwadzieścia jeden miesięcy rozwoju głosowego AI zaowocowało modelem, który nie jest przede wszystkim lepszym modelem głosowym — to głosowy interfejs do agenta. Jeśli powodem, dla którego chciałeś otwartych wag, był koszt, arytmetyka jest bliższa, niż sugeruje bezlicencyjne ujęcie. Jeśli powodem była kontrola, ta nie została wcale utowarowiona, a GLM-4-Voice pozostaje uzasadnioną odpowiedzią na pytanie, którego Gemini 3.8 Live nie porusza.