
Wydanie Qwen3.8-Flash-Next: Wnętrze zapowiedzi architektury Qwen4 firmy Alibaba
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Najbardziej użytecznym dokumentem opublikowanym przez Alibaba 26 sierpnia 2026 roku nie był press kit — był to raport techniczny. Qwen3.8-Flash-Next, model multimodalny typu mixture-of-experts o otwartych wagach, wydany tego dnia, ukazał się wraz z artykułem zatytułowanym „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability", a raport jest sednem sprawy. Robi on to, czego podczas premier dostawcy prawie nigdy nie robią: publikuje ablacje, negatywne wyniki i eksperymenty nad recepturą treningu, a następnie łączy każde ustalenie z architekturą rodziny Qwen4, którą ten model ma zapowiadać.
Co tak naprawdę wypuszczono 26 sierpnia
Sam model jest skromny jak na standardy Qwen z 2026 roku i jest to zamierzone. Qwen3.8-Flash-Next przechowuje 125B parametrów głównego modelu oraz osobną tabelę embeddingów n-gramowych o rozmiarze 51B — łącznie około 176B przed modułem przewidywania wielu tokenów o rozmiarze 4B — ale aktywuje tylko 6B na token. Jest to model mieszanki ekspertów z 512 ekspertami, routingiem top-10 i 48 warstwami, natywnie obsługujący 262 144 tokeny kontekstu i rozszerzalny do 1M przez YaRN. Przyjmuje tekst, obrazy i wideo jako dane wejściowe i generuje tekst. Wagi są dostępne na Hugging Face i ModelScope na licencji qwen-community-1.0, a blog Alibaby nazywa go „eksperymentalną zapowiedzią architektury, która będzie stanowić podstawę Qwen4" — tę samą rolę, którą Qwen3-Next odegrał dla linii Qwen3.5, kanarka, który leci przed flagowcem.
Tego samego dnia Alibaba uruchomił komercyjny odpowiednik: serwerowy build o nazwie Qwen3.8-Flash w API QwenCloud, w cenie 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych. Te dwie wersje łatwo ze sobą pomylić, warto więc je rozróżniać. Qwen3.8-Flash-Next to wersja zapoznawcza z otwartymi wagami, którą analizuje raport techniczny; Qwen3.8-Flash to produkcyjny build API, wyceniony, z domyślnym kontekstem 1 mln tokenów i formatami żądań zgodnymi z OpenAI i Anthropic. Cena, benchmarki i argumenty architektoniczne wywodzą się z tego samego inżynierskiego zaplecza.

Cztery zakłady architektoniczne w raporcie technicznym
Kręgosłupem artykułu są cztery zakłady dotyczące tego, jak powinien wyglądać długokontekstowy, niskokosztowy model graniczny, każdy poparty eksperymentami.
• Attention — hybryda GDN + QSA. Trzy z każdych czterech warstw używają Gated DeltaNet, warstwy liniowej uwagi, która kompresuje historię do stanu rekurencyjnego o stałym rozmiarze zamiast pamięci podręcznej KV, która rośnie wraz z długością sekwencji. Pozostała warstwa to Qwen Sparse Attention, która agreguje sekwencję w mikro-bloki, ocenia je tanio i uruchamia pełną uwagę tylko na istotnych regionach. Alibaba raportuje przyspieszenie prefill do 7.6× i dekodowania do 4.9× przy kontekście 1M; własny benchmark SGLang z dnia premiery zmierzył jeszcze wyższe wartości: 10.2× i 6.6×. Przy współczynniku trafień pamięci podręcznej prefiksu wynoszącym 90% przepustowość prefill osiąga 8.6× wartości Qwen3.7-Plus. Są to dane od dostawców i partnerów, nie zaś wyniki niezależnie audytowane.
• Strumień residualny — bramkowana ścieżka residualna (Gated Residual). Pojedyncza ścieżka residualna jest rozszerzona do czterech równoległych gałęzi z dynamicznym bramkowaniem elementowym, wielogałęziową architekturą w stylu Hyper-Connection ze sterowaniem typu GatedNorm. Bramka reguluje odczyty i zapisy dla każdej gałęzi, co według artykułu tłumi wartości odstające aktywacji, a w praktyce pozwala przechowywać stany residualne w FP8.
• Embedding — 51-miliardowa tablica n-gramów. Zamiast jednego embedddingu na token, model używa tablicy odnośników opartej na bieżącym tokenie i poprzednich, przechowując całe frazy i lokalne wzorce. Jest to niemal bezkosztowe dla każdego tokena, a ponieważ adresy odnośników są znane z wyprzedzeniem, może znajdować się w pamięci hosta i być pobierane z wyprzedzeniem asynchronicznie, całkowicie poza pamięcią GPU. To właśnie ten trik pozwala uruchomić checkpoint o rozmiarze 176B na maszynach klasy 75GB, a wywodzi się z warstwowych embeddingów Gemmy 3n i Engrama DeepSeek.
• Optymalizacja — Muon, dostrojony. Trening wykorzystuje optymalizator Muon, metodę pędu opartą na ortogonalizacji, stosowaną do dwuwymiarowych map liniowych (uwagi, GDN i wag ekspertów MoE), podczas gdy AdamW pozostaje dla embeddingów, routera i parametrów niskiego rzędu. Artykuł raportuje również negatywny wynik wart przeczytania: rozgrzewanie rozmiaru wsadu zostało porzucone, gdy okazało się, że kosztuje 18,8% więcej kroków optymalizatora bez żadnej poprawy.
Tabela benchmarków, przeczytaj uważnie
Każda liczba w nagłówkach tutaj pochodzi od samego Qwena, opublikowana na karcie modelu i w raporcie, a żadna z nich nie została niezależnie odtworzona — model ma jeden dzień i żadna zewnętrzna strona go jeszcze nie audytowała. Nawet czytając to w ten sposób, wciąż jest to uderzające, ponieważ Qwen3.8-Flash-Next toczy wyrównaną walkę z DeepSeek-V4-Flash-0731, znacznie większym i uznanym modelem, przy 6B aktywnych parametrach.
• DeepSWE 1.1 — 58.7 vs 54.4 (deklarowane przez producenta).
• SWE-bench Pro — 62,5 vs 56,0 (według dostawcy).
Toolathlon Zweryfikowano — 73.5 vs 70.3 (dane producenta).
• LiveCodeBench v6 — 91.9 vs 90.6 (raportowane przez producenta).
• GPQA Diamond — 91.7 vs 90.8 (wg dostawcy).
• IFBench — 81.3 vs 79.2 (dane producenta).
Następnie niedobór, który raport otwarcie pokazuje: NL2Repo-Bench, 48.1 wobec 54.2 DeepSeek-V4-Flash-0731 — prawdziwy deficyt w generowaniu kodu na poziomie repozytorium, jedynym wymiarze kodowania agentowego, w którym mniejszy model nie nadąża. Agents' Last Exam to remis: 24.3 wobec 25.2. W automatyzacji biurowej Qwen raportuje CoWorkBench 73.9 — ale to wewnętrzny benchmark i Alibaba trzyma go z dala od głównego wykresu.

W dziedzinie wizji deklarowana tabela wyników pokazuje AndroidWorld 84.5 wobec 62.0 dla Claude Opus 4.6 Max oraz RealWorldQA 88.5 wobec 73.9. Humanity's Last Exam to jedyny flagowy wskaźnik, w którym Qwen wyraźnie przegrywa z Claude Opus 4.6 Max — a ocena tego wyniku została przeprowadzona przez GPT-4o, więc nawet to porównanie nie jest czyste.
Cena: jedna dwunasta flagowca
Następnie liczba, która ma znaczenie dla budżetów. Serwowana wersja Qwen3.8-Flash kosztuje 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych w QwenCloud. To mniej więcej jedna dwunasta ceny flagowego modelu Alibaby, Qwen3.8-Max, wynoszącej 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych — a wszystko to w przypadku modelu, który według raportu został wytrenowany przy około jednej dziewiątej mocy obliczeniowej Qwen3.7-Plus. Chińscy dostawcy modeli spędzili lato, obniżając ceny w warstwie flash, a to wydanie jest stroną Qwen tej kampanii, lądującą z uzasadnieniem architektonicznym, a nie tylko zniżką.
Dla każdego, kto porównuje oferty w tej kategorii, obliczenia są prostsze, gdy każdy dostawca pokazuje tę samą liczbę. OrcaRouter udostępnia pozostałą część rodziny Qwen — Qwen3.8-Max, Qwen3.8-27B i Qwen3.8 — po cenie katalogowej dostawcy z 0% marżą, więc obniżka ceny producenta jest u nas aktywna tego samego dnia, w którym zostanie ogłoszona. Qwen3.8-Flash-Next nie ma jeszcze w naszym katalogu; gdy trafi do środowiska uruchomieniowego, które obsługujemy, włączy się do tego samego rozwiązania z jednym kluczem i ceną katalogową, bez potrzeby drugiej umowy.
Co możesz z tym zrobić dzisiaj
Wsparcie serwowania od pierwszego dnia jest wyjątkowo szerokie. SGLang dostarcza stronę cookbook i dedykowany obraz (lmsysorg/sglang:qwen38flashnext); vLLM ma vllm/vllm-openai:qwen38-flash-next; NVIDIA waliduje oba rozwiązania oraz TensorRT LLM na racku GB300 NVL72, osiągając ponad 16 000 tokenów na sekundę na GPU w FP8, a NeMo obejmuje fine-tuning. Poniżej skali centrum danych model działa na klastrach DGX Spark i stacjach roboczych 4×RTX PRO 6000, a wydany tego samego dnia zestaw kwantyzacji społeczności — GGUFe od Unsloth i wersja 1-bitowa mieszcząca się w 75 GB RAM przy około 80% pełnej dokładności — oznacza, że checkpoint o wadze 176B jest realnie uruchamialny na sprzęcie, który posiada mały zespół. Zespoły, które wolą wywoływać model przez API, niż uruchamiać go lokalnie, mogą skorzystać z Qwen3.8-Flash API za pośrednictwem QwenCloud od Alibaba oraz kilku platform zewnętrznych, choć to otwarte wagi większość wczesnych użytkowników pobierze w pierwszej kolejności.

Matematyka VRAM kryjąca się za tą listą to tabela n-gramów i to właśnie w jej stronę w następnej kolejności zmierzają stosy serwowania. Embedding dla każdej warstwy, który raport techniczny trzyma poza pamięcią GPU, to czysta struktura typu lookup — na każdy wygenerowany token model pobiera tylko około 16 ze swoich 320 milionów wierszy — dzięki czemu jego offloading jest tani. vLLM serwuje Qwen3.8-Flash-Next z dedykowanego obrazu deweloperskiego, podczas gdy pull request z obsługą architektury jest nadal otwarty, a najnowszy element tych prac — draft PR od tego samego autora vLLM (vllm-project/vllm#54371, niezmergowany) — dodaje ścieżkę serwowania PLE-Offload, która trzyma tabelę w pamięci hosta i odczytuje ją przez CUDA unified virtual addressing zamiast rezerwować VRAM. Przy FP8 tabela to mniej więcej 48 GB z ~173 GB checkpointu, więc jej offloading to różnica między GPU klasy data center a pojedynczą kartą 96 GB — RTX PRO 6000 albo pulą pamięci unified jednego DGX Spark. To wczesny etap, więc traktujcie to raczej jako kierunek niż wspieraną dziś opcję; ale to runtime doganiający to, co raport techniczny już wcześniej deklarował, i rzecz, na którą warto uważać, jeśli to właśnie liczba VRAM was powstrzymywała.
Jednodniowa wersja zapoznawcza z niepotwierdzonymi wynikami to podręcznikowy przykład, na którym nie warto opierać ścieżki produkcyjnej — i właśnie do tego służy failover. Jeśli środowisko uruchomieniowe ma Qwen3.8-Flash-Next, a wskażesz jeden endpoint na niego z automatycznym failoverem na model, któremu już ufasz, zyskujesz korzyści z nowej architektury w ruchu niekrytycznym i czysty awaryjny powrót, gdy model sobie nie radzi — bez przepinania, bo to reguła routingu, a nie zmiana kodu.
Co mówi ten podgląd o Qwen4?
Alibaba już to przerabiał. Qwen3-Next zapowiadał Gated DeltaNet pod koniec 2025 roku ze skąpą dokumentacją, a architektura została w pełni wyspecyfikowana dopiero, gdy seria Qwen3.5 przyjęła ją na dużą skalę. Ten schemat się powtarza: Qwen3.8-Flash-Next jest kanarkiem, a raport jest specyfikacją przez eksperyment. Konkretne rzeczy, na które warto patrzeć, to czy flagowy Qwen4 przyjmie podział GDN/QSA w stosunku trzy do jednego, czy embedding n-gramów przetrwa kontakt z produkcyjnym serwowaniem na skalę flagowca, a przede wszystkim czy niezależne ewaluacje potwierdzą przewagę 6B-active nad większymi modelami. Jeśli teza o wydajności się utrzyma, flagowy Qwen4 może trafić na rynek z dramatycznie niższymi kosztami serwowania niż poprzednia generacja.
Często zadawane pytania
Qwen3.8-Flash-Next i Qwen3.8-Flash — ten sam model?
Nie, i to rozróżnienie ma znaczenie. Qwen3.8-Flash-Next to zapowiedź architektury o otwartych wagach, którą analizuje raport techniczny; Qwen3.8-Flash to produkcyjna wersja API, którą Alibaba udostępnia na QwenCloud w cenie $0.16/$0.47 za milion tokenów z domyślnym kontekstem 1M. Ta sama linia inżynieryjna, różne artefakty — jedna służy do samodzielnego hostowania i inspekcji, druga to płatna usługa zarządzana.
Czy obciążenia produkcyjne powinny się dziś na to przenieść?
Nie bez drugiej opinii. Każdy benchmark pochodzi od dostawcy i nie został niezależnie odtworzony, architektura jest na tyle nowa, że stosy serwujące wciąż się stabilizują — wsparcie samego vLLM wciąż trafia przez otwarte pull requesty — a jedyna luka w kodowaniu agentowym (NL2Repo) dotyczy dokładnie tego rodzaju zadań, na jakie trafiają zawodowi programiści. Otwarte wagi sprawiają, że samodzielna ocena jest tania, a wsparcie SGLang i vLLM od pierwszego dnia umożliwia pilotaż już w tym tygodniu — ale pilotaż za failoverem to uczciwy sposób na start, a nie przełączenie.
Kiedy zostanie wydany prawdziwy Qwen4?
Alibaba nie powiedział. Jedyny sygnał czasowy w tym wydaniu ma charakter historyczny: ostatni kanarek, Qwen3-Next, przeleciał mniej więcej sezon przed tym, jak seria Qwen3.5 przyjęła jego architekturę. W tym rytmie okręty flagowe Qwen4 są bliżej, niż się wydaje — ale raport wyraźnie dotyczy architektury, a nie mapy drogowej.
Najważniejsze
Qwen3.8-Flash-Next to rzadka premiera, w której to praca badawcza jest produktem. Jeśli chodzi o sam model, uczciwa karta wyników przedstawia się następująco: 6B aktywnych parametrów dorównujących znacznie większym modelom w większości wspólnych benchmarków, jedna wyraźnie wskazana luka w kodzie na poziomie repozytorium, oferowana cena równa jednej dwunastej ceny modelu flagowego oraz architektura, która jest odpowiedzią Qwen na to, jak model z czołówki może być tani. Raport techniczny wyjaśnia, do czego służy Qwen3.8-Flash-Next — i nie jest to sam model. Jest dowodem na architekturę, która będzie Qwen4, i warto go przeczytać, zanim Qwen4 się ukaże, ponieważ zmienia decyzję, którą podejmiesz, gdy Qwen4 nadejdzie.
