
Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: Jeden dostarcza liczbę, drugi mapę
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dwa wiodące modele tłumaczenia mowy w czasie rzeczywistym nie zgadzają się co do tego, na jakim kryterium są gotowe dać się mierzyć, a ta rozbieżność jest bardziej użyteczna niż jakiekolwiek porównanie specyfikacji. Qwen3.8-LiveTranslate, wydany 19 września 2026 r., wysuwa na pierwszy plan jedną twardą liczbę: średnie opóźnienie 2,3 sekundy, w dół z 2,8 w poprzedniej generacji. Gemini 3.5 Live Translate, model mowa-do-mowy tego dostawcy ogłoszony w czerwcu 2026 r. i wciąż noszący identyfikator modelu w wersji zapoznawczej, wysuwa na pierwszy plan zasięg — ponad 70 języków, automatyczne wykrywanie, przełączanie w trakcie rozmowy oraz integrację z aplikacjami Translate i Meet tego dostawcy. Jedna firma opublikowała liczbę dotyczącą opóźnienia, której można ją rozliczyć. Druga opublikowała liczbę języków. Jeśli wybierasz między nimi, zrozumienie, dlaczego to obietnice różnego rodzaju, ma większe znaczenie niż to, która lista jest dłuższa.
Dwie architektury, które zgadzają się co do celu i nic poza tym
Oba modele istnieją po to, by zabić to samo zachowanie: tłumacza działającego w trybie turowym, który czeka, aż skończysz zdanie, zanim cokolwiek powie. To właśnie ta pauza sprawia, że interpretacja maszynowa wydaje się interpretacją maszynową.
Qwen3.8-LiveTranslate osiąga to dzięki architekturze Interleave na szkielecie Hybrid MoE, podzielonej na moduł Thinker, który łączy audio, wideo, tekst źródłowy i tłumaczenie w jedną sekwencję przyczynową, oraz moduł Talker, który ponownie syntezuje tłumaczenie w barwie głosu oryginalnego mówcy. Twierdzenie jest takie, że połączenie rozpoznawania, tłumaczenia i syntezy w jedną sekwencję usuwa opóźnienie i utratę semantyczną, które trzystopniowy potok ponosi na każdej granicy modułu.
Gemini 3.5 Live Translate zajmuje tę samą pozycję end-to-end, ale z drugiej strony: jest oparty na Gemini 3 Pro jako natywny model audio-do-audio, strumieniujący w sposób ciągły przez Gemini Live API, zamiast realizować dyskretną kaskadę ASR → MT → TTS. W praktyce utrzymujesz stałe dwukierunkowe połączenie WebSocket, wysyłasz w górę 100-milisekundowe fragmenty audio i odbierasz przetłumaczone fragmenty audio. Żaden z tych modeli nie robi już tego po staremu. Oba robią teraz to po nowemu. Wszystkie różnice tkwią w szczegółach drugiego rzędu.
Porównanie opóźnień nie jest takim remisem, jak się wydaje.
Google opisuje Gemini 3.5 Live Translate jako pozostawanie „kilka sekund za” mówiącym. Nie opublikowało wartości LAAL ani żadnej innej nazwanej, odtwarzalnej metryki opóźnienia dla tego modelu. Qwen opublikował 2,3 sekundy i zdefiniował, co to oznacza.
Ta asymetria jest rutynowo spłaszczana do „obie wynoszą około dwóch do trzech sekund”. Taka interpretacja nie znajduje oparcia w niczym, co powiedziała którakolwiek z firm. Sformułowanie Google’a jest zgodne z 2 sekundami i zgodne z 4; firma po prostu nie chciała dać się przypiąć. Porównanie, którego faktycznie można dziś dokonać, jest następujące:
• Publikowany wskaźnik opóźnienia — Qwen3.8-LiveTranslate: LAAL 2,3 s, według producenta. Gemini 3.5 Live Translate: brak opublikowanych danych.
• Niezależny pomiar opóźnień — brak, w przypadku żadnego z modeli. Żadna strona trzecia nie opublikowała bezpośredniego porównania.
Uczciwy wniosek jest taki, że jeśli chodzi o opóźnienie, Qwen przedstawiło falsyfikowalne twierdzenie, a Google – niejasne. To punkt na korzyść Qwen w kwestii przejrzystości i dokładnie zero punktów na jej korzyść w kwestii wydajności, dopóki ktoś nie zmierzy obu. Jeśli opóźnienie jest czynnikiem decydującym w Twoim wdrożeniu, obecny stan dowodów nie uzasadnia decyzji zakupowej w żadnym kierunku.

60 języków kontra ponad 70 to niewłaściwa tablica wyników.
Liczby dotyczące języków są nieustannie przytaczane i wprowadzają w błąd w obie strony.
Qwen3.8-LiveTranslate rozpoznaje 60 języków źródłowych i generuje wypowiedź w 29 z nich. Gemini 3.5 Live Translate obsługuje ponad 70 języków z automatycznym wykrywaniem, a w Google Meet przekłada się to na ponad 2000 kombinacji językowych, podczas gdy wcześniej limitem było tłumaczenie oparte na angielskim w pięciu językach.
Przeczytaj uważnie drugą liczbę, zanim uznasz ją za potrójne zwycięstwo. Liczba ponad 2000 podana przez Google zlicza pary uporządkowane — każdy język źródłowy w parze z każdym językiem docelowym — co jest uzasadnioną i rzeczywiście użyteczną miarą pokrycia, ale nieporównywalną z liczbą dla pojedynczego języka. A lista Google, choć szersza, jest silnie przesunięta w stronę języków o dużej liczbie użytkowników: afrykanerski, arabski, bengalski, niderlandzki, angielski, francuski, niemiecki, hindi, indonezyjski, włoski, japoński, koreański, malajski, perski, polski, portugalski, rosyjski, hiszpański, suahili, tamilski, telugu, tajski, turecki, ukraiński, urdu, wietnamski, zulu. 29 języków, w których Qwen generuje mowę, to jeszcze węższy zbiór, a lista żadnego z dostawców nie jest poważną odpowiedzią na długi ogon — dialekty regionalne i języki o niskich zasobach, w przypadku których narzędzia tłumaczenia ustnego historycznie zawodziły najdotkliwiej. Obie firmy twierdzą, że nad tym pracują. Żadna z nich tego nie wypuściła.
Gdzie ta dwójka tak naprawdę się rozchodzi: sala pełna ludzi
Jedynym miejscem, w którym modele składają naprawdę odmienne obietnice, jest obsługa wielu mówców, i to właśnie ta różnica najprawdopodobniej przesądzi o rzeczywistym wdrożeniu.
Qwen3.8-LiveTranslate oferuje diarizację mówców w czasie rzeczywistym: każde zdanie jest przypisywane do mówcy, gdy tylko się pojawi, a replikacja głosu jest opisywana jako stabilna przy zmianach tur. Qwen sam raportuje wskaźnik błędu diarizacji na poziomie 9,7% na własnym długim zestawie testowym z wieloma mówcami, wobec 30,6% dla Seed LiveInterpret 2.0 — to porównanie dostawcy w ewaluacji prowadzonej przez dostawcę, więc traktuj to jako twierdzenie z dołączoną liczbą, a nie jako wynik. Model emituje również tekst źródłowy i tłumaczenie na tej samej osi czasu, co umożliwia synchronizowane napisy dwujęzyczne bez osobnego przebiegu wyrównywania.
Gemini 3.5 Live Translate kładzie nacisk na coś przeciwnego. Jego udokumentowaną mocną stroną jest zachowanie prozodii — utrzymanie wysokości, tempa, intonacji i rejestru emocjonalnego mówiącego, dzięki czemu przetłumaczony głos oddaje charakter oryginału. Jego udokumentowane słabości są dokładnie tam, gdzie pomogłaby diaryzacja: niespójne klonowanie głosu, które może dryfować po długich pauzach lub trafiać na niewłaściwą płeć, słabe przechodzenie między mówcami bez wyraźnego sygnału końca zdania, problemy z silnymi akcentami i blisko spokrewnionymi parami językowymi, takimi jak hiszpański i portugalski, oraz niedoskonałe radzenie sobie z hałasem w tle. Google ogranicza również czyste sesje audio do 15 minut, chyba że zostaną przedłużone, i oznacza każdy generowany strumień audio znakiem wodnym SynthID, którego obecnie nie można usunąć.
• Przypisywanie wypowiedzi wielu mówcom — Qwen: diaryzacja w czasie rzeczywistym, deklarowane 9,7% DER. Gemini: udokumentowane słabe przejmowanie tur, brak deklaracji diaryzacji.
• Wierność głosu — Qwen: reprodukcja barwy źródłowej za pomocą modułu Talker. Gemini: zachowanie prozodii, wysokości tonu i tempa; udokumentowane dryfowanie klonowania.
• Wynik dwujęzyczny — Qwen: źródło i tłumaczenie generowane na tej samej osi czasu. Gemini: opcjonalna transkrypcja wejścia i wyjścia, konfigurowana dla każdej sesji.
• Znakowanie wodne — Qwen: nie podano. Gemini: SynthID we wszystkich generowanych materiałach audio, brak możliwości usunięcia.
• Długość sesji — Qwen: nie podano. Gemini: 15-minutowy limit na sesje zawierające wyłącznie dźwięk.
• Typy danych wejściowych — Qwen: audio i obraz. Gemini: tylko audio, bez wprowadzania tekstu.

Ile faktycznie kosztuje działanie każdego z nich
Qwen3.8-LiveTranslate jest wyceniany za milion tokenów przez WebSocket Realtime API. W regionie Singapuru: $7,50 za wejście audio, $0,55 za wejście obrazu, $20,00 za wyjście tekstowe, $30,00 za wyjście audio. W Pekinie: ¥40 / ¥3,3 / ¥100 / ¥160 za milion — w przybliżeniu $5,65 / $0,47 / $14,13 / $22,61. Jego kontekst wynosi 53 248 tokenów, a limit szybkości to 10 żądań na minutę i 100 000 tokenów na minutę w obu regionach.
Ten limit 10 RPM to najważniejsza liczba w cenniku. Warunki handlowe Gemini 3.5 Live Translate nie są publikowane w ten sam sposób, co samo w sobie jest sygnałem dotyczącym dojrzałości: Google udostępnia tę funkcję przez Live API i AI Studio w publicznej wersji zapoznawczej, w Google Meet w prywatnej wersji zapoznawczej dla wybranych klientów Workspace oraz w aplikacji Translate na Androida i iOS. Ceny i limity szybkości obowiązujące w wersji zapoznawczej mogą ulec zmianie bez powiadomienia, a Google nie zobowiązał się do daty ogólnej dostępności (GA).
Zatem porównanie kosztów obecnie dotyczy modelu z opublikowaną ceną i sztywnym limitem współbieżności oraz modelu bez opublikowanej ceny i nieokreślonym limitem. Jeśli w tym kwartale musisz modelować ekonomikę jednostkową, tylko jeden z nich da się ująć w budżecie.

Co musiałby wykazać niezależny test
Wszystko powyżej opiera się na własnych ogłoszeniach obu dostawców, ponieważ nikt nie porównał tych modeli bezpośrednio ze sobą. Wynik, który rzeczywiście rozstrzygnąłby to starcie, wymaga czterech rzeczy, a żadna z nich jeszcze nie istnieje:
• LAAL zmierzono w ten sam sposób na obu modelach, na tym samym dźwięku, w tych samych parach językowych — wartości 2,3 s dla Qwen nie można porównać z niczym, czego Google odmówiło podać.
• Wskaźnik błędu diaryzacji na współdzielonym korpusie wielomówcowym, a nie na własnym zestawie Omnilingua-MSpeaker firmy Qwen.
• Stabilność klonowania głosu w długich sesjach — właśnie w tym zakresie dokumentacja samego Gemini sygnalizuje dryf, a Qwen wysuwa swoje najśmielsze twierdzenie.
• Zachowanie przy limitach współbieżności — czy 10 RPM Qwena wytrzymuje rzeczywiste obciążenie spotkaniami i czy limity „preview” Gemini przetrwają zetknięcie z produkcją.
Dopóki ten test nie istnieje, możliwe do obrony stanowisko jest wąskie: Qwen opublikował więcej i obiecał bardziej konkretne rzeczy; Google ma szersze pokrycie językowe i zasięg dystrybucji, któremu nie dorówna żaden model dostępny wyłącznie przez API.
Który wybrać
Kieruj się kształtem swojego problemu, a nie tablicą wyników, bo tablica wyników nie jest jeszcze wiarygodna.
Jeśli Twoje obciążenie jest wielopodmiotowe i przypisanie autorstwa ma znaczenie — transkrypcja spotkań, panel dyskusyjny, sala sądowa, cokolwiek, gdzie wiedza, kto wypowiedział przetłumaczone zdanie, stanowi część wartości — Qwen3.8-LiveTranslate jest jedynym z tych dwóch, który deklaruje taką możliwość, a udokumentowana słabość Gemini w zakresie przejmowania tur wskazuje w tym samym kierunku. Jeśli Twoje obciążenie obejmuje szeroki zakres języków, jest skierowane do konsumentów i już funkcjonuje w ekosystemie Google, ponad 70 języków Gemini 3.5 Live Translate oraz jego obecność w aplikacji Translate i Meet to zalety, którym żaden konkurent oferujący wyłącznie API nie dorównuje pod względem dystrybucji.
Jeśli budujesz produkt, a nie kupujesz demo, zwróć uwagę, że oba są wąskimi specjalistami. Żaden z nich nie prowadzi pętli agenta, żaden nie podsumowuje, a Qwen3.8-LiveTranslate wprost nie obsługuje wywoływania funkcji, ustrukturyzowanych danych wyjściowych, buforowania kontekstu ani dostrajania. Tłumacz to dopiero początek Twojego potoku, a nie jego całość. OrcaRouter nie jest dziś miejscem, w którym można wywołać którykolwiek z tych modeli tłumaczeniowych — żadnego z nich nie ma w naszym katalogu i wolimy powiedzieć to wprost, niż sugerować coś innego. To, co zapewniamy, to ta połowa stosu, która konsumuje transkrypcję: jeden klucz do ponad 200 modeli w cenie katalogowej dostawcy, z zerową doliczaną marżą, dzięki czemu moduł podsumowujący, narzędzie egzekwujące glosariusz lub agent niższego poziomu czytający tę transkrypcję można wymienić lub przełączyć awaryjnie bez dotykania umowy z drugim dostawcą.
Jego spód
Qwen3.8-LiveTranslate i Gemini 3.5 Live Translate są wystarczająco zbliżone pod względem podstaw, że marketing stał się czynnikiem odróżniającym: jeden opublikował wskaźnik opóźnienia i cennik, drugi opublikował mapę językową i ekosystem. Żaden z nich nie został poddany niezależnemu testowi. Wersja tego porównania warta przeczytania to ta, która powstanie po tym, jak ktoś uruchomi oba na tym samym materiale audio — a biorąc pod uwagę, jak szybko ta kategoria się rozwija, może to być bliżej, niż się wydaje.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
