
Qwen3.8-Omni-Flash kontra Qwen2.5-Omni: 18 miesięcy później aktualizacja straciła swój głos
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Oto fakt, który czyni to porównanie ciekawszym niż zwykłe odświeżenie generacji. Starszy model potrafi mówić, a nowszy nie. Qwen2.5-Omni, wydany w marcu 2025 roku, przyjmował jako dane wejściowe tekst, obrazy, dźwięk i wideo, a odpowiadał tekstem lub w strumieniowej, naturalnej mowie, w jednym modelu end-to-end, który można było pobrać. Qwen3.8-Omni-Flash, wydany 18 września 2026 roku, obsługuje te same cztery modalności w oknie kontekstu trzydzieści razy większym, przyjmuje godzinę ciągłego materiału audio-wideo tam, gdzie jego przodek radził sobie z sekundami, i zwraca wyłącznie tekst. Osiemnaście miesięcy pracy kupiło znacznie szerszy zakres danych wejściowych i oddało kanał wyjściowy. Czy to postęp, czy kompromis, zależy wyłącznie od tego, do czego używałeś starego modelu — a odpowiedź dzieli się wyraźnie na dwie części.
Dane liczbowe dla Qwen2.5-Omni pochodzą od dostawcy, z jego materiałów premierowych z marca 2025 r., a osiemnaście miesięcy szerokiego wdrożenia częściowo je potwierdziło. Dane dla Qwen3.8-Omni-Flash są również danymi firmy Alibaba, z materiałów premierowych opublikowanych kilka godzin przed napisaniem tego tekstu, i nic z nich nie zostało niezależnie odtworzone. Jeśli twierdzenie pochodzi od krytyka, a nie od dostawcy, jest oznaczone jako takie. Jedyny fakt strukturalny, który nie wymaga weryfikacji, jest zarazem najdonioślejszy: Qwen2.5-Omni ma otwarte wagi i można go pobrać, a Qwen3.8-Omni-Flash nie.
Czym był Qwen2.5-Omni i dlaczego miał znaczenie
Gdy został wydany 26 marca 2025 r., Qwen2.5-Omni był pierwszym modelem omni-modalnym typu end-to-end w rodzinie — premiera przedstawiała go jako odpowiedź na problem „zoo specjalistów”, w którym transkrypcja, wizja i głos wymagały osobnego modelu i osobnej warstwy łączącej. Model 7B obsługiwał wszystkie cztery modalności wejściowe, a także zarówno wyjście tekstowe, jak i mowę, twierdził, że osiąga najnowocześniejsze wyniki w benchmarku fuzji OmniBench, wyprzedzając Gemini-1.5-Pro, i raportował wynik jakości generowania mowy na poziomie 4,51, który Alibaba określiła jako ludzki. Wariant 3B wykorzystywał tę samą architekturę.
Inżynieria, która sprawiła, że to działało, zasługuje na nazwę, ponieważ nowy model jej nie używa. Thinker-Talker dzielił zadanie na dwie części: transformer Thinker łączył enkodery audio i obrazu oraz tworzył semantykę i tekst, podczas gdy Talker strumieniował tokeny mowy ze stanów ukrytych Thinkera, współdzieląc pełną historię rozmowy. Time-aligned multimodal RoPE (TMRoPE) przeplatał pozycje wideo i audio, dzięki czemu oba strumienie pozostawały zsynchronizowane. Strumieniowanie blokowe pozwalało enkoderom zajmować się percepcją, podczas gdy model językowy obsługiwał długie sekwencje, co umożliwiło niskolatencyjne odpowiedzi głosowe. Dostarczono z nim dwa stałe głosy: Chelsie i Ethan.
Ograniczenia były równie realne. Kontekst wynosił 32 768 tokenów. Pamięć była ograniczeniem wiążącym znacznie bardziej niż moc obliczeniowa: własne tabele firmy Alibaba szacowały wnioskowanie BF16 z FlashAttention-2 na około 31 GB pamięci GPU dla 15-sekundowego wideo, 42 GB dla 30 sekund i 60 GB dla pełnej minuty. Minuta wideo, na modelu 7B, na jednym z największych pojedynczych GPU, jakie można było wynająć. Tę liczbę warto mieć przed oczami, ponieważ to jest liczba, do zniszczenia której zbudowano model z 2026 roku.
Czym jest Qwen3.8-Omni-Flash
Nowy model jest natywnie omni-modalny, a nie składany z części — zbudowany bezpośrednio na Qwen3.8-Flash linii architektury, a nie jako tekstowy LLM z doklejonymi enkoderami percepcji, co stanowi różnicę strukturalną, a nie tylko etykietę generacji. Przyjmuje tekst, obraz, dźwięk i wideo, w tym dźwięk stereo oraz czterokanałowy dźwięk przestrzenny, i zwraca tekst w kontekście miliona tokenów z maksymalnym wejściem około 991 tys., maksymalnym wyjściem 131 tys. i budżetem rozumowania 262 tys. Obsługuje do godziny ciągłego audio-wideo na jedno wywołanie. Rozpoznawanie mowy obejmuje 74 języki, a generowanie mowy w 29 językach jest obsługiwane przez otaczające narzędzia, a nie przez sam model. Jest dostępny na platformie Qianwen AI oraz w Alibaba Cloud Model Studio pod identyfikatorem qwen3-8-omni-flash, w cenie 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion wyjściowych, przy czym wejście z pamięci podręcznej kosztuje 0,016 USD.

Osiemnaście miesięcy, wymiar po wymiarze
• Kontekst — Qwen2.5-Omni 32 768 tokenów w porównaniu z Qwen3.8-Omni-Flash przy milionie, czyli około trzydziestokrotny wzrost.
• Czas trwania multimediów — sekundy wideo, ograniczone pamięcią GPU, w porównaniu z godziną ciągłego audio-wideo w jednym hostowanym połączeniu.
• Dane wyjściowe — tekst plus strumieniowa mowa naturalna w starym modelu; tylko tekst w nowym.
• Wdrożenie — Qwen2.5-Omni ma otwarte wagi na licencji Apache-2.0, można go pobrać z Hugging Face i ModelScope; Qwen3.8-Omni-Flash jest dostępny wyłącznie przez API, bez ogłoszonego wydania wag.
• Sprzęt — 7B parametrów wymagających do ~60 GB pamięci GPU na minutę wideo, w porównaniu z hostowanym endpointem, którego w ogóle nie aprowizujesz.
• Cena — stary model wymaga od Ciebie GPU; nowy kosztuje 0,15 USD za milion tokenów wejściowych, a Alibaba twierdzi, że wejście audio na godzinę jest o 98% tańsze niż generacja Qwen3.5-Omni-Plus, którą zastępuje.
• Generowanie mowy — dwa stałe głosy w 2025 r. w porównaniu z 29 językami generowania mowy w narzędziach z 2026 r., przy czym nic z tego nie jest tworzone przez sam model.
Transakcja, której nikt nie reklamował
Przeczytaj obie karty specyfikacji razem, a kształt ostatnich osiemnastu miesięcy staje się jasny. Alibaba spędziła ten okres na rozwiązywaniu kwestii poboru danych — ile mediów model może przyswoić, jak tanio i jaką część decyzji może podejmować samodzielnie. Qwen3.8-Omni-Flash jest triumfem na tej osi. Tryb Agentic Understanding, w którym model wybiera, co próbkować, zamiast przetwarzać każdą klatkę, zmniejsza liczbę tokenów na zapytanie z 145 736 do 79 117, jednocześnie podnosząc dokładność OmniVideoBench z 63,4 do 67,8, a dostawca podaje, że błąd diaryzacji mówców w AliMeeting gwałtownie spada z 88,11 do 3,35.
To, czego ten okres nie traktował priorytetowo, to wyjście. Charakterystyczny trik modelu z 2025 roku — jeden model, który cię słyszy i odpowiada na głos, od początku do końca, bez oddzielnego syntezatora mowy — nie ma tu następcy. Jeśli zbudowałeś agenta głosowego, pipeline dubbingu lub narzędzie dostępności na Talkerze z Qwen2.5-Omni, model z 2026 roku nie jest jego aktualizacją; to komponent, do którego musiałbyś doczepić nowy etap syntezy mowy z tekstu, dodając opóźnienie i dostawcę do pipeline'u, który wcześniej nie miał ani jednego, ani drugiego. Materiały premierowe są w tej kwestii szczere, jeśli uważnie przeczytasz wiersz dotyczący modalności, ale nie jest to nagłówek, a każdy, kto migruje w założeniu, że „omni” oznacza to samo w obu wydaniach, odkryje różnicę na produkcji.

Dlaczego model 2025 wciąż ma pracę
Trzy powody, i żaden z nich nie jest nostalgią. Pierwszy to głos, jak wyżej. Drugi to otwarte wagi: 32K kontekstu i 7B rozmiaru będzie działać na sprzęcie, który kontrolujesz, offline, bez danych opuszczających budynek i bez licznika za token — jedyna opcja, jeśli twoje audio podlega zasadzie rezydencji danych lub twój budżet opóźnień wyklucza podróż w obie strony. Trzeci to koszt przy bardzo niskim wolumenie. GPU, które już posiadasz, jest darmowe na marginesie; 0,15 USD za milion tokenów w modelu hostowanym jest tanie, ale nie zerowe, a stały koszt provisioningu względem niego jest realny dla obciążenia uruchamianego dwa razy w tygodniu.
Kontrargument jest taki, że ograniczenia starego modelu z każdym rokiem stają się coraz bardziej dotkliwe. Minuta wideo, 32K kontekstu i brak wywoływania narzędzi lub ustrukturyzowanych danych wyjściowych w świecie, w którym agenci są domyślnym sposobem wdrażania, to wąskie ramy. Dla potoku, który musi przetwarzać nagrane spotkania, Qwen3.8-Omni-Flash nie jest jedynie lepszy — to różnica między możliwym a niemożliwym, ponieważ model z 2025 r. fizycznie nie może pomieścić danych wejściowych.
Warto skonkretyzować, ile życia pozostało w starych wagach, ponieważ „legacy” nie oddaje ich znaczenia. Qwen2.5-Omni-7B: repozytorium odnotowało 343 676 pobrań w ciągu ostatniego miesiąca, gdy sprawdziliśmy je 18 września 2026 r., z około setką społecznościowych Spaces i dziesiątkami dostrojonych modeli, adapterów i kwantyzacji zbudowanych na tej podstawie. Cokolwiek robi model flagowy, duża grupa ludzi wciąż wdraża model z 2025 roku — i, co godne uwagi, Hugging Face nie wymienił żadnego dostawcy inferencji, który by go wdrażał, co oznacza, że prawie całe to użycie jest hostowane samodzielnie.
Nowy model ulepsza stary
Najdziwniejszy i najbardziej przekonujący szczegół tej premiery kryje się pod koniec materiałów. W eksperymencie, który Alibaba opisuje jako model optymalizujący model, Qwen3.8-Omni-Flash autonomicznie poprawił rozpoznawanie mowy w dialekcie syczuańskim Qwen2.5-Omni-3B — mniejszego brata modelu, który nominalnie zastępuje — obniżając współczynnik błędów znaków z 25.79% do 15.30% w ciągu dwunastu godzin i tworząc 3,413 próbek treningowych w czterech rundach.
To lepszy argument na rzecz nowszego modelu niż jakikolwiek benchmark w wydaniu i na nowo określa relację między nimi. Model z 2026 r. nie jest tylko zamiennikiem modelu z 2025 r.; to narzędzie, które ulepsza wagi modelu z 2025 r. Jeśli używasz Qwen2.5-Omni na produkcji dla języka lub dialektu, z którym radzi sobie słabo, praktyczną drogą może być utrzymanie wdrożenia i użycie nowego modelu do zbudowania danych treningowych, zamiast migrowania obciążenia. Należy jednak pamiętać, że to demonstracja raportowana przez dostawcę, bez opublikowanej metodologii, i należy ją traktować jako zachęcającą anegdotę, a nie powtarzalny przepis.

Jeśli migrujesz
Decyzja rzadko sprowadza się do jednego modelu. Zespół odchodzący od samodzielnie hostowanego modelu omni wybiera między trzema wariantami: pozostać przy otwartych wagach i dalej utrzymywać infrastrukturę, przejść na API dostawcy i oddać kontrolę albo podzielić obciążenie tak, aby tylko ta część, która wymaga przyjęcia miliona tokenów, trafiała do modelu hostowanego. Ta trzecia opcja jest zwykle właściwa i zarazem jest tą, którą ludzie pomijają, bo brzmi jak więcej pracy, niż jest w rzeczywistości — dostrojenia pod dialekt, na które poświęciłeś miesiąc, nie trzeba wyrzucać tylko dlatego, że etap podsumowywania spotkań został przeniesiony.
Routing pomaga właśnie na stykach. OrcaRouter daje ci jeden klucz do ponad 200 modeli z 0% narzutu na cenę katalogową dostawcy i automatycznym przełączaniem awaryjnym jeśli punkt końcowy ulegnie degradacji, co oznacza, że hostowana połowa rozdzielonego potoku nie potrzebuje własnej umowy, własnego kodu klienta ani własnego monitoringu, zanim dowiesz się, czy obciążenie uzasadnia którąkolwiek z tych rzeczy. Żeby było jasne, czego nie robimy: żaden z modeli omni nie znajduje się w naszym katalogu — oba działają na platformach Alibaba lub na twoim własnym sprzęcie — więc to decyzja routingowa, którą podejmujesz wokół modeli, a nie za naszym pośrednictwem.
Kto powinien się przenieść, a kto nie
Przechodź, jeśli Twoje obciążenie obejmuje długie nagrania audio lub wideo, jeśli to 32K kontekstu powstrzymuje istnienie potoku, jeśli potrzebujesz zachowań agentowych w pracy z mediami albo jeśli problemem, z którym się mierzysz, jest diaryzacja mówców na dużą skalę. Zostań, jeśli potrzebujesz, aby model mówił, jeśli Twoje audio nie może opuścić Twojej infrastruktury, jeśli zależysz od konkretnych wag Qwen2.5-Omni, które już dostroiłeś, albo jeśli wolumen Twoich wywołań jest tak niski, że posiadany przez Ciebie GPU wygrywa z licznikiem.
Niezręczne podsumowanie jest takie, że to mniej zamiennik niż rozwidlenie linii produktowej. Alibaba spędziła osiemnaście miesięcy, budując najlepszy model wejściowy, jaki potrafiła, i nie zbudowała następcy połowy wyjściowej. Jeśli twoja praca opiera się na stronie wejściowej, aktualizacja jest niemal obowiązkowa. Jeśli opiera się na stronie wyjściowej, model z 2025 roku wciąż jest najnowszą rzeczą, która robi to, czego potrzebujesz — i warto o tym wiedzieć, zanim zaplanujesz migrację, która po cichu usunęłaby funkcję, od której zależą twoje działania.
