Qwen3.8-Flash-Next Wydanie — Wewnątrz podglądu architektury Qwen4 firmy Alibaba. Zregenerowana ilustracja.
Guides & Insights

Wydanie Qwen3.8-Flash-Next: Wnętrze zapowiedzi architektury Qwen4 firmy Alibaba

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej użytecznym dokumentem opublikowanym przez Ali​baba 26 sierpnia 2026 roku nie był press kit — był to raport techniczny. Qwen3.8-Flash-Next, model multimodalny typu mixture-of-experts o otwartych wagach, wydany tego dnia, ukazał się wraz z artykułem zatytułowanym „On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability", a raport jest sednem sprawy. Robi on to, czego podczas premier dostawcy prawie nigdy nie robią: publikuje ablacje, negatywne wyniki i eksperymenty nad recepturą treningu, a następnie łączy każde ustalenie z architekturą rodziny Qwen4, którą ten model ma zapowiadać.

Co tak naprawdę wypuszczono 26 sierpnia

Sam model jest skromny jak na standardy Qw​en z 2026 roku i jest to zamierzone. Qwen3.8-Flash-Next przechowuje 125B parametrów głównego modelu oraz osobną tabelę embeddingów n-gramowych o rozmiarze 51B — łącznie około 176B przed modułem przewidywania wielu tokenów o rozmiarze 4B — ale aktywuje tylko 6B na token. Jest to model mieszanki ekspertów z 512 ekspertami, routingiem top-10 i 48 warstwami, natywnie obsługujący 262 144 tokeny kontekstu i rozszerzalny do 1M przez YaRN. Przyjmuje tekst, obrazy i wideo jako dane wejściowe i generuje tekst. Wagi są dostępne na Hugging Face i ModelScope na licencji qwen-community-1.0, a blog Ali​baby nazywa go „eksperymentalną zapowiedzią architektury, która będzie stanowić podstawę Qwen4" — tę samą rolę, którą Qwen3-Next odegrał dla linii Qw​en3.5, kanarka, który leci przed flagowcem.

Tego samego dnia Ali​baba uruchomił komercyjny odpowiednik: serwerowy build o nazwie Qwen3.8-Flash w API QwenCloud, w cenie 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych. Te dwie wersje łatwo ze sobą pomylić, warto więc je rozróżniać. Qwen3.8-Flash-Next to wersja zapoznawcza z otwartymi wagami, którą analizuje raport techniczny; Qwen3.8-Flash to produkcyjny build API, wyceniony, z domyślnym kontekstem 1 mln tokenów i formatami żądań zgodnymi z Open​AI i Anthropic. Cena, benchmarki i argumenty architektoniczne wywodzą się z tego samego inżynierskiego zaplecza.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

Cztery zakłady architektoniczne w raporcie technicznym

Kręgosłupem artykułu są cztery zakłady dotyczące tego, jak powinien wyglądać długokontekstowy, niskokosztowy model graniczny, każdy poparty eksperymentami.

• Attention — hybryda GDN + QSA. Trzy z każdych czterech warstw używają Gated DeltaNet, warstwy liniowej uwagi, która kompresuje historię do stanu rekurencyjnego o stałym rozmiarze zamiast pamięci podręcznej KV, która rośnie wraz z długością sekwencji. Pozostała warstwa to Qw​en Sparse Attention, która agreguje sekwencję w mikro-bloki, ocenia je tanio i uruchamia pełną uwagę tylko na istotnych regionach. Ali​baba raportuje przyspieszenie prefill do 7.6× i dekodowania do 4.9× przy kontekście 1M; własny benchmark SGLang z dnia premiery zmierzył jeszcze wyższe wartości: 10.2× i 6.6×. Przy współczynniku trafień pamięci podręcznej prefiksu wynoszącym 90% przepustowość prefill osiąga 8.6× wartości Qwen3.7-Plus. Są to dane od dostawców i partnerów, nie zaś wyniki niezależnie audytowane.

• Strumień residualny — bramkowana ścieżka residualna (Gated Residual). Pojedyncza ścieżka residualna jest rozszerzona do czterech równoległych gałęzi z dynamicznym bramkowaniem elementowym, wielogałęziową architekturą w stylu Hyper-Connection ze sterowaniem typu GatedNorm. Bramka reguluje odczyty i zapisy dla każdej gałęzi, co według artykułu tłumi wartości odstające aktywacji, a w praktyce pozwala przechowywać stany residualne w FP8.

• Embedding — 51-miliardowa tablica n-gramów. Zamiast jednego embedddingu na token, model używa tablicy odnośników opartej na bieżącym tokenie i poprzednich, przechowując całe frazy i lokalne wzorce. Jest to niemal bezkosztowe dla każdego tokena, a ponieważ adresy odnośników są znane z wyprzedzeniem, może znajdować się w pamięci hosta i być pobierane z wyprzedzeniem asynchronicznie, całkowicie poza pamięcią GPU. To właśnie ten trik pozwala uruchomić checkpoint o rozmiarze 176B na maszynach klasy 75GB, a wywodzi się z warstwowych embeddingów Gemmy 3n i Engrama Deep​Seek.

• Optymalizacja — Muon, dostrojony. Trening wykorzystuje optymalizator Muon, metodę pędu opartą na ortogonalizacji, stosowaną do dwuwymiarowych map liniowych (uwagi, GDN i wag ekspertów MoE), podczas gdy AdamW pozostaje dla embeddingów, routera i parametrów niskiego rzędu. Artykuł raportuje również negatywny wynik wart przeczytania: rozgrzewanie rozmiaru wsadu zostało porzucone, gdy okazało się, że kosztuje 18,8% więcej kroków optymalizatora bez żadnej poprawy.

Tabela benchmarków, przeczytaj uważnie

Każda liczba w nagłówkach tutaj pochodzi od samego Qwena, opublikowana na karcie modelu i w raporcie, a żadna z nich nie została niezależnie odtworzona — model ma jeden dzień i żadna zewnętrzna strona go jeszcze nie audytowała. Nawet czytając to w ten sposób, wciąż jest to uderzające, ponieważ Qwen3.8-Flash-Next toczy wyrównaną walkę z DeepSeek-V4-Flash-0731, znacznie większym i uznanym modelem, przy 6B aktywnych parametrach.

• DeepSWE 1.1 — 58.7 vs 54.4 (deklarowane przez producenta).

• SWE-bench Pro — 62,5 vs 56,0 (według dostawcy).

Toolathlon Zweryfikowano — 73.5 vs 70.3 (dane producenta).

• LiveCodeBench v6 — 91.9 vs 90.6 (raportowane przez producenta).

• GPQA Diamond — 91.7 vs 90.8 (wg dostawcy).

• IFBench — 81.3 vs 79.2 (dane producenta).

Następnie niedobór, który raport otwarcie pokazuje: NL2Repo-Bench, 48.1 wobec 54.2 DeepSeek-V4-Flash-0731 — prawdziwy deficyt w generowaniu kodu na poziomie repozytorium, jedynym wymiarze kodowania agentowego, w którym mniejszy model nie nadąża. Agents' Last Exam to remis: 24.3 wobec 25.2. W automatyzacji biurowej Qw​en raportuje CoWorkBench 73.9 — ale to wewnętrzny benchmark i Ali​baba trzyma go z dala od głównego wykresu.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

W dziedzinie wizji deklarowana tabela wyników pokazuje AndroidWorld 84.5 wobec 62.0 dla Claude Opus 4.6 Max oraz RealWorldQA 88.5 wobec 73.9. Humanity's Last Exam to jedyny flagowy wskaźnik, w którym Qw​en wyraźnie przegrywa z Claude Opus 4.6 Max — a ocena tego wyniku została przeprowadzona przez GPT-4o, więc nawet to porównanie nie jest czyste.

Cena: jedna dwunasta flagowca

Następnie liczba, która ma znaczenie dla budżetów. Serwowana wersja Qwen3.8-Flash kosztuje 0,16 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych w QwenCloud. To mniej więcej jedna dwunasta ceny flagowego modelu Ali​baby, Qwen3.8-Max, wynoszącej 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych — a wszystko to w przypadku modelu, który według raportu został wytrenowany przy około jednej dziewiątej mocy obliczeniowej Qwen3.7-Plus. Chińscy dostawcy modeli spędzili lato, obniżając ceny w warstwie flash, a to wydanie jest stroną Qw​en tej kampanii, lądującą z uzasadnieniem architektonicznym, a nie tylko zniżką.

Dla każdego, kto porównuje oferty w tej kategorii, obliczenia są prostsze, gdy każdy dostawca pokazuje tę samą liczbę. OrcaRouter udostępnia pozostałą część rodziny Qwen — Qwen3.8-Max, Qwen3.8-27B i Qwen3.8 — po cenie katalogowej dostawcy z 0% marżą, więc obniżka ceny producenta jest u nas aktywna tego samego dnia, w którym zostanie ogłoszona. Qwen3.8-Flash-Next nie ma jeszcze w naszym katalogu; gdy trafi do środowiska uruchomieniowego, które obsługujemy, włączy się do tego samego rozwiązania z jednym kluczem i ceną katalogową, bez potrzeby drugiej umowy.

Co możesz z tym zrobić dzisiaj

Wsparcie serwowania od pierwszego dnia jest wyjątkowo szerokie. SGLang dostarcza stronę cookbook i dedykowany obraz (lmsysorg/sglang:qwen38flashnext); vLLM ma vllm/vllm-openai:qwen38-flash-next; NVIDIA waliduje oba rozwiązania oraz TensorRT LLM na racku GB300 NVL72, osiągając ponad 16 000 tokenów na sekundę na GPU w FP8, a NeMo obejmuje fine-tuning. Poniżej skali centrum danych model działa na klastrach DGX Spark i stacjach roboczych 4×RTX PRO 6000, a wydany tego samego dnia zestaw kwantyzacji społeczności — GGUFe od Unsloth i wersja 1-bitowa mieszcząca się w 75 GB RAM przy około 80% pełnej dokładności — oznacza, że checkpoint o wadze 176B jest realnie uruchamialny na sprzęcie, który posiada mały zespół. Zespoły, które wolą wywoływać model przez API, niż uruchamiać go lokalnie, mogą skorzystać z Qwen3.8-Flash API za pośrednictwem QwenCloud od Ali​baba oraz kilku platform zewnętrznych, choć to otwarte wagi większość wczesnych użytkowników pobierze w pierwszej kolejności.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

Matematyka VRAM kryjąca się za tą listą to tabela n-gramów i to właśnie w jej stronę w następnej kolejności zmierzają stosy serwowania. Embedding dla każdej warstwy, który raport techniczny trzyma poza pamięcią GPU, to czysta struktura typu lookup — na każdy wygenerowany token model pobiera tylko około 16 ze swoich 320 milionów wierszy — dzięki czemu jego offloading jest tani. vLLM serwuje Qwen3.8-Flash-Next z dedykowanego obrazu deweloperskiego, podczas gdy pull request z obsługą architektury jest nadal otwarty, a najnowszy element tych prac — draft PR od tego samego autora vLLM (vllm-project/vllm#54371, niezmergowany) — dodaje ścieżkę serwowania PLE-Offload, która trzyma tabelę w pamięci hosta i odczytuje ją przez CUDA unified virtual addressing zamiast rezerwować VRAM. Przy FP8 tabela to mniej więcej 48 GB z ~173 GB checkpointu, więc jej offloading to różnica między GPU klasy data center a pojedynczą kartą 96 GB — RTX PRO 6000 albo pulą pamięci unified jednego DGX Spark. To wczesny etap, więc traktujcie to raczej jako kierunek niż wspieraną dziś opcję; ale to runtime doganiający to, co raport techniczny już wcześniej deklarował, i rzecz, na którą warto uważać, jeśli to właśnie liczba VRAM was powstrzymywała.

Jednodniowa wersja zapoznawcza z niepotwierdzonymi wynikami to podręcznikowy przykład, na którym nie warto opierać ścieżki produkcyjnej — i właśnie do tego służy failover. Jeśli środowisko uruchomieniowe ma Qwen3.8-Flash-Next, a wskażesz jeden endpoint na niego z automatycznym failoverem na model, któremu już ufasz, zyskujesz korzyści z nowej architektury w ruchu niekrytycznym i czysty awaryjny powrót, gdy model sobie nie radzi — bez przepinania, bo to reguła routingu, a nie zmiana kodu.

Co mówi ten podgląd o Qwen4?

Ali​baba już to przerabiał. Qwen3-Next zapowiadał Gated DeltaNet pod koniec 2025 roku ze skąpą dokumentacją, a architektura została w pełni wyspecyfikowana dopiero, gdy seria Qw​en3.5 przyjęła ją na dużą skalę. Ten schemat się powtarza: Qwen3.8-Flash-Next jest kanarkiem, a raport jest specyfikacją przez eksperyment. Konkretne rzeczy, na które warto patrzeć, to czy flagowy Qwen4 przyjmie podział GDN/QSA w stosunku trzy do jednego, czy embedding n-gramów przetrwa kontakt z produkcyjnym serwowaniem na skalę flagowca, a przede wszystkim czy niezależne ewaluacje potwierdzą przewagę 6B-active nad większymi modelami. Jeśli teza o wydajności się utrzyma, flagowy Qwen4 może trafić na rynek z dramatycznie niższymi kosztami serwowania niż poprzednia generacja.

Często zadawane pytania

Qwen3.8-Flash-Next i Qwen3.8-Flash — ten sam model?

Nie, i to rozróżnienie ma znaczenie. Qwen3.8-Flash-Next to zapowiedź architektury o otwartych wagach, którą analizuje raport techniczny; Qwen3.8-Flash to produkcyjna wersja API, którą Ali​baba udostępnia na QwenCloud w cenie $0.16/$0.47 za milion tokenów z domyślnym kontekstem 1M. Ta sama linia inżynieryjna, różne artefakty — jedna służy do samodzielnego hostowania i inspekcji, druga to płatna usługa zarządzana.

Czy obciążenia produkcyjne powinny się dziś na to przenieść?

Nie bez drugiej opinii. Każdy benchmark pochodzi od dostawcy i nie został niezależnie odtworzony, architektura jest na tyle nowa, że stosy serwujące wciąż się stabilizują — wsparcie samego vLLM wciąż trafia przez otwarte pull requesty — a jedyna luka w kodowaniu agentowym (NL2Repo) dotyczy dokładnie tego rodzaju zadań, na jakie trafiają zawodowi programiści. Otwarte wagi sprawiają, że samodzielna ocena jest tania, a wsparcie SGLang i vLLM od pierwszego dnia umożliwia pilotaż już w tym tygodniu — ale pilotaż za failoverem to uczciwy sposób na start, a nie przełączenie.

Kiedy zostanie wydany prawdziwy Qwen4?

Ali​baba nie powiedział. Jedyny sygnał czasowy w tym wydaniu ma charakter historyczny: ostatni kanarek, Qwen3-Next, przeleciał mniej więcej sezon przed tym, jak seria Qw​en3.5 przyjęła jego architekturę. W tym rytmie okręty flagowe Qwen4 są bliżej, niż się wydaje — ale raport wyraźnie dotyczy architektury, a nie mapy drogowej.

Najważniejsze

Qwen3.8-Flash-Next to rzadka premiera, w której to praca badawcza jest produktem. Jeśli chodzi o sam model, uczciwa karta wyników przedstawia się następująco: 6B aktywnych parametrów dorównujących znacznie większym modelom w większości wspólnych benchmarków, jedna wyraźnie wskazana luka w kodzie na poziomie repozytorium, oferowana cena równa jednej dwunastej ceny modelu flagowego oraz architektura, która jest odpowiedzią Qwen na to, jak model z czołówki może być tani. Raport techniczny wyjaśnia, do czego służy Qwen3.8-Flash-Next — i nie jest to sam model. Jest dowodem na architekturę, która będzie Qwen4, i warto go przeczytać, zanim Qwen4 się ukaże, ponieważ zmienia decyzję, którą podejmiesz, gdy Qwen4 nadejdzie.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube