
Poznaj Qwen3.8-LiveTranslate: pół sekundy, które sprawia, że interpretacja AI działa w ludzkim tempie
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-LiveTranslate trafił na rynek 19 września 2026 roku, a całe ogłoszenie sprowadza się do jednego odejmowania. Średnie opóźnienie — LAAL, przeciętny odstęp między chwilą, gdy słowo opuszcza usta mówiącego, a momentem, w którym jego tłumaczenie dociera do ucha słuchacza — spada z 2,8 sekundy w poprzedniej generacji do 2,3 sekundy. Zawodowi tłumacze symultaniczni pracują przy odstępie od ucha do głosu wynoszącym około 2 do 3 sekund. To cała historia: nie to, że maszyna przyspieszyła, lecz to, że jej opóźnienie mieści się teraz w przedziale, w którym słuchacze przestają w ogóle zauważać maszynę. Dane z premiery podają jakość tłumaczenia FLEURS poprzedniej generacji na poziomie 83,0 xCOMET-XXL; w przypadku tej generacji deklaruje się 85,7. Obie liczby pochodzą od dostawcy, zostały uzyskane w jego własnym środowisku ewaluacyjnym i żadna niezależna strona ich dotąd nie odtworzyła — co jest najważniejszym zastrzeżeniem w tym artykule.
To, co sprawia, że to wydanie warto czytać poza samym nagłówkiem, to mechanizm. Qwen nie skrócił opóźnienia, tworząc szybszy rozpoznawacz ani lżejszy syntezator. Usunął szwy między nimi.
Co tak naprawdę się zmieniło: szwy zniknęły
Klasyczna interpretacja symultaniczna to trójetapowy potok przetwarzania, który od dekady składa się w ten sam sposób: automatyczne rozpoznawanie mowy transkrybuje strumień, tłumaczenie maszynowe konwertuje transkrypcję, a synteza mowy odczytuje wynik na głos. Każdy etap to osobny model z własnym budżetem opóźnień, a przy każdym przekazaniu coś się gubi — prozodia w pierwszym, tożsamość mówiącego w trzecim oraz stałe kilkaset milisekund na każdej granicy, gdzie moduł musi poczekać na wystarczającą liczbę tokenów, by nabrać pewności.
Qwen3.8-LiveTranslate zastępuje tę kaskadę tym, co dostawca nazywa architekturą Interleave, zbudowaną na szkielecie Hybrid MoE i podzieloną na dwa współpracujące moduły:
• Thinker — porządkuje wideo, audio, tekst źródłowy i tłumaczenie w jedną sekwencję przyczynową, przeplataną w porządku czasowym, i generuje zrozumienie oraz tłumaczenie end-to-end w jednym przebiegu, a nie w trzech.
• Talker — pobiera przetłumaczony tekst razem z oryginalnym audio i syntetyzuje mowę, która zachowuje barwę głosu mówcy źródłowego, dzięki czemu można rozpoznać, że dubbingowany głos należy do osoby, która mówiła.
Twierdzenie architektoniczne jest takie, że ponieważ rozpoznawanie, tłumaczenie i synteza współdzielą jedną ramę modelowania sekwencji, zamiast przekazywać komunikaty przez granice modułów, system przestaje płacić podatek między modułami dwa razy na wypowiedź. To wiarygodny opis tego, skąd wzięło się 0,5 sekundy, a jednocześnie dokładnie ten rodzaj twierdzenia, które tanio się głosi, a drogo weryfikuje. Traktuj to jako wyjaśnienie dostawcy, a nie jako ustalony wynik.
Trzy zdolności, które są naprawdę nowe
Pokrycie językowe nie uległo zmianie: rozpoznawanych jest 60 języków źródłowych, 29 dostępnych dla mowy wyjściowej — takie same liczby jak w Qwen3.5-LiveTranslate. Ciekawe nowości dotyczą tego, co dzieje się, gdy mówi więcej niż jedna osoba.
• Diarizacja mówcy w czasie rzeczywistym — każde zdanie jest przypisywane do mówcy w momencie jego wypowiadania, a replikacja barwy głosu jest opisywana jako stabilniejsza przy zmianach tury. Qwen samodzielnie podaje wskaźnik błędu diarizacji na poziomie 9,7% na własnym długim zestawie testowym z wieloma mówcami, wobec 30,6% dla Seed LiveInterpret 2.0. Obie liczby pochodzą od Qwen.
• Źródło i tłumaczenie w tej samej ramce — model generuje oryginalny transkrypt i przetłumaczony tekst na jednej osi czasu, co właśnie umożliwia utworzenie pary dwujęzycznych napisów na ekranie bez drugiego przebiegu wyrównywania.
• Dezambiguacja w długim kontekście — wcześniejszy kontekst jest przenoszony dalej, dzięki czemu nazwiska, tytuły grzecznościowe i terminy dziedzinowe pozostają spójne. To ten element, który w praktyce ma największe znaczenie: klasycznym błędem tłumaczenia symultanicznego nie jest niewłaściwe słowo, lecz to, że ta sama osoba jest oddawana na trzy różne sposoby w trakcie jednego spotkania.
Diaryzacja to tutaj naprawdę wyróżniający element. Gemini 3.5 Live Translate, konkurencyjny model Google do tłumaczenia mowy na mowę w czasie rzeczywistym, ma udokumentowane problemy z naprzemiennością mówienia — może mieć trudność z rozpoznaniem, kiedy mówiący faktycznie przestał mówić. Qwen reklamuje przeciwną właściwość jako funkcję. Żadna z firm nie opublikowała bezpośredniego porównania, które by to rozstrzygnęło.

Uczciwe czytanie twierdzeń o benchmarkach
Qwen został przetestowany na dwóch zestawach i warto je rozdzielić, ponieważ mierzą różne rzeczy.
• FLEURS, 70 kierunków językowych — publiczny, powszechnie używany wielojęzyczny benchmark audio. Qwen twierdzi, że ma przewagę zarówno nad swoim poprzednikiem, jak i nad tym, co nazywa obecnymi głównymi systemami tłumaczenia ustnego w czasie rzeczywistym, pod względem jakości tłumaczenia, średniego opóźnienia, dokładności rozpoznawania mowy i jakości syntezy mowy. Tu znajduje się porównanie 85,7 vs 83,0 xCOMET-XXL.
• Omnilingua-MSpeaker, 14 kierunków językowych — własny wielomówcowy zestaw ewaluacyjny Qwen do długich nagrań audio. Firma twierdzi, że ma lepszą wierność, płynność i zwięzłość oraz niższy wskaźnik błędów diaryzacji. Benchmark stworzony przez dostawcę nie jest bezwartościowy, ale nie jest też dowodem: zaprojektowali go ludzie, których model jest na nim oceniany.
Szczera konkluzja jest taka, że FLEURS jest prawdziwy i publiczny, więc 85.7 jest przynajmniej teoretycznie możliwe do sprawdzenia; Omnilingua-MSpeaker nie jest, więc zwycięstwo w diarizacji pozostaje twierdzeniem, dopóki ktoś nie powtórzy testu. W momencie pisania tego tekstu żadna strona trzecia nie opublikowała wyników Qwen3.8-LiveTranslate, a model ma zaledwie kilka godzin.
Ile kosztuje API i jedna liczba, która cię ugryzie
Qwen3.8-LiveTranslate ma zamknięte wagi i jest dostępny wyłącznie przez API. Działa przez WebSocket Realtime API pod identyfikatorem modelu qwen3.8-livetranslate-flash-realtime, a nie przez zwykły punkt końcowy HTTP. Ceny są naliczane za milion tokenów, a ponieważ tokeny audio są gęste, stawki z cennika wyglądają zaskakująco na tle modeli tekstowych, dopóki nie przypomnisz sobie, czym jest token audio:
• Region Singapur — wejście audio 7,50 USD, wejście obrazu 0,55 USD, wyjście tekstu 20,00 USD, wyjście audio 30,00 USD za milion tokenów.
• region Pekin — ¥40 za wejście audio, ¥3,3 za wejście obrazu, ¥100 za wyjście tekstowe, ¥160 za wyjście audio za milion tokenów, co przy obecnych kursach daje około $5,65 / $0,47 / $14,13 / $22,61.
• Kontekst — łącznie 53 248 tokenów, podzielonych na 49 152 tokenów maksymalnego wejścia i 4096 tokenów maksymalnego wyjścia.
• Limity szybkości — 10 żądań na minutę i 100 000 tokenów na minutę, identyczne w obu regionach.
To ograniczenie szybkości jest liczbą, którą trzeba podkreślić. Dziesięć żądań na minutę to hojny limit dla kilku sal konferencyjnych i zdecydowanie za mało dla wdrożenia w centrum kontaktowym albo transmisji na żywo z tysiącami jednoczesnych strumieni. Qwen utrzymał cenę interfejsu zasadniczo na niezmienionym poziomie względem poprzedniej generacji — stawki w Pekinie pozostały bez zmian, a Singapur jest nieznacznie tańszy — ale model, który architektonicznie jest gotowy na skalę, jest udostępniany jak wersja zapoznawcza. Każdy, kto planuje ruch produkcyjny, powinien odczytywać pułap 10 RPM jako wiążące ograniczenie, a nie cenę za token.

Wywołanie tego nie przypomina wywołania modelu czatu.
Realtime API jest sterowane zdarzeniami, co stanowi inny model mentalny niż endpoint uzupełnień. Otwierasz gniazdo, otrzymujesz session.created, następnie wysyłasz zdarzenie session.update, aby skonfigurować sesję, zanim popłynie jakiekolwiek audio.
• target_language jest wymagany i musi być ustawiony przed pierwszym fragmentem audio — nie ma niejawnego domyślnego języka docelowego.
• source_language jest opcjonalny i domyślnie ustawiony na automatyczne wykrywanie.
• output_modalities wybiera ["text"] dla samej transkrypcji lub ["text","audio"] dla przetłumaczonej mowy.
• input_audio_buffer.append przesyła w górę fragmenty PCM zakodowane w base64; response.text.delta i response.audio.delta wracają w dół, a response.done oznacza koniec tury.
Dwie praktyczne uwagi. Po pierwsze, przeglądarka nie może ustawić Authorization jako nagłówka w uzgadnianiu WebSocket, więc połączenie trzeba otworzyć po stronie serwera i przekazywać dźwięk do klienta przez własny socket — tego nie da się podłączyć bezpośrednio do front-endu. Po drugie, Qwen wyraźnie ostrzega, że zestaw parametrów i zdarzeń różni się od poprzedniej generacji LiveTranslate, więc każdy kod napisany pod Qwen3.5-LiveTranslate wymaga ponownego sprawdzenia, a nie tylko przepięcia. Darmowy endpoint wersji próbnej działa pod adresem omni.qwen.ai/live-translate, jeśli chcesz posłuchać opóźnienia, zanim zainwestujesz czas inżynierów.
Czego celowo nie robi
Qwen wymienia zestaw możliwości jako niedostępne, a ta lista jest wyjaśniająca. Brak wywoływania funkcji. Brak ustrukturyzowanego wyjścia. Brak wyszukiwania w sieci. Brak kontynuacji prefiksu, buforowania kontekstu i wnioskowania wsadowego. Brak dostrajania.
To specjalista, a nie generalista w roli tłumacza. Nie będzie prowadzić Twojej pętli agenta i nie będzie modelem, który podsumowuje spotkanie. Projektuj odpowiednio: tłumacz generuje transkrypt i przetłumaczony strumień audio, a wszystko, co następuje dalej — ekstraktor działań, egzekutor glosariusza, zapis zwrotny do CRM — jest zadaniem odrębnego modelu tekstowego.
To właśnie w tym podziale router zasługuje na swoje miejsce. Sam Qwen3.8-LiveTranslate jest dostępny przez własne API dostawcy oraz kilka platform zewnętrznych; nie ma go dziś w katalogu OrcaRouter i nie będziemy udawać, że jest inaczej. To, co OrcaRouter faktycznie oferuje, to otaczający stos — w tym flagowy Qwen3.8-Max samego Alibaby, model rzadkiej mieszaniny ekspertów o 2,4 biliona parametrów i kontekście 1 mln tokenów, w cenie $2.00 za milion tokenów wejściowych i $6.00 za milion tokenów wyjściowych, rozliczany po cenie katalogowej dostawcy, bez doliczania marży. Utrzymanie interpretera i modeli, które konsumują jego dane wyjściowe, za jednym punktem końcowym i jednym kluczem oznacza, że potok transkrypcji nie potrzebuje drugiej umowy, gdy podmieniasz sumaryzator, a automatyczne przełączanie awaryjne utrzymuje przy życiu dalszą połowę systemu, gdy pojedynczy dostawca się zachwieje — co przy 10 żądaniach na minutę jest scenariuszem, który warto zaplanować, a nie odkrywać.

Co obejrzeć dalej
Dwie rzeczy zmieniłyby to wydanie z dobrze uargumentowanego twierdzenia w ustalony fakt. Pierwszą jest niezależny pomiar opóźnienia: LAAL to dobrze zdefiniowana metryka, a każdy, kto ma endpoint wersji próbnej i stanowisko ze stoperem, może uzyskać liczbę, której autorem nie jest Qwen. Drugą jest własna, ogłoszona roadmapa Qwen — zbliżanie się do dolnej granicy opóźnienia, długoterminowa pamięć międzysesyjna oraz pokrycie języków długiego ogona i dialektów regionalnych. To właśnie na punkcie długiego ogona należy ich rozliczać, ponieważ 60 języków źródłowych to szanująca się liczba, która po cichu wyklucza większość mówiących na świecie, a przepaść między demem działającym w mandaryńskim i angielskim a takim, które działa w joruba lub keczua, to miejsce, w którym produkty do tłumaczenia ustnego w czasie rzeczywistym historycznie grzęzły.
Na razie rozsądne stanowisko jest takie, że Qwen3.8-LiveTranslate to pierwszy model tłumaczenia symultanicznego, którego kluczowy wynik jest zestawiany z ludzkimi tłumaczami ustnymi, a nie z jego własnym poprzednikiem — a taki sposób przedstawiania to znacznie trudniejszy test do zdania niż ten, który zastępuje. Jeszcze go nie zdał. Tylko zgłosił się do niego na ochotnika.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
