
Qwen3.8-Flash-Next: Alibaba zapowiada architekturę Qwen4, zanim Qwen4 powstanie
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
Alibaba zamierza opublikować architekturę Qwen4, zanim opublikuje model Qwen4. Qwen3.8-Flash-Next — otwarty, multimodalny model mixture-of-experts zbudowany na architekturze nowej generacji, która będzie napędzać rodzinę Qwen4 — ma zostać udostępniony publicznie na ModelScope o godzinie 23:00 czasu pekińskiego 26 sierpnia 2026 roku. Alibaba przedstawia to udostępnienie jako zapowiedź technologiczną: programiści otrzymują architekturę wcześniej, a pełna rodzina Qwen4 pojawi się później. W momencie pisania tego tekstu liczba parametrów, licencja i cena nie są potwierdzone, więc jest to artykuł podsumowujący to, co wiemy do tej pory — każdy konkret poniżej jest oznaczony pod względem stopnia pewności.
{{1}}Jeśli w tym miesiącu nie śledziłeś tempa prac Alibaby, punktem odniesienia jest Qwen3.8-Max — flagowy model o 2,4 biliona parametrów, wydany 3 sierpnia i udostępniony jako open-source pod nazwą Qwen3.8-2.4T-A95B niespełna dwa tygodnie później. Qwen3.8-Flash-Next pojawia się niespełna miesiąc po tym. To samo laboratorium, które wypuściło model open-weight o 2,4 biliona parametrów, udostępnia teraz architekturę dla następnej generacji, zanim flagowy model tej generacji w ogóle otrzyma nazwę.{{/1}}
Co ogłoszono?
Sygnał dotarł na arenę zwykłymi kanałami. 25 sierpnia pojawił się teaser ModelScope dla Qwen3.8-Flash-Next z oznaczeniem „Upcoming Open-Release", hasłem „Onward to the Next-Gen — Lightning-Fast" i licznikiem czasu wskazującym na 2026-08-26 23:00 (UTC+08:00). Zespół Qwen z Alibaba napisał tego samego dnia na X: „Nadchodzi kolejna fala Qwen." Post od @kimmonismus na X, który skierował do nas ten materiał, opisywał to samo nieco innymi słowami: otwarty multimodalny MoE o otwartych wagach na architekturze nowej generacji — wczesny dostęp, aby społeczność mogła przygotować się na rodzinę Qwen4.

Fragment warty ponownego przeczytania to sposób, w jaki Alibaba sama to formułuje. Model opisano jako zbudowany na architekturze nowej generacji, „która będzie napędzać nadchodzącą rodzinę Qwen4" — i wyraźnie nie jako sam Qwen4. Podany przez Alibabę powód jest taki, że zmiany architektoniczne powinny trafić w ręce społeczności, zanim rodzina się pojawi, aby środowiska uruchomieniowe, kwantyzacje i aplikacje były gotowe, gdy nadejdzie właściwy produkt. To stanowisko marketingowe, ale także zobowiązanie techniczne: najpierw zaprezentować trudną część, zabrać społeczność ze sobą.
Co jest dziś potwierdzone, a co nie:
• Potwierdzone, zgodnie z teaserem i oświadczeniem Qwen: Qwen3.8-Flash-Next jest modelem o otwartych wagach, multimodalnym i typu MoE, opartym na architekturze Qwen4.
• Potwierdzono, zgodnie z oświadczeniem Qwen: wprowadza dwie główne zmiany architektoniczne — architekturę hybrydową GDN oraz Qwen Sparse Attention (QSA).
• Potwierdzono, zgodnie z zapowiedzią: czas premiery, 2026-08-26 23:00 (UTC+08:00), na ModelScope.
• Niepotwierdzone: całkowita lub aktywna liczba parametrów, warunki licencji, długość kontekstu, dostępność API lub ceny oraz każdy wynik benchmarku. Nie istnieje jeszcze żadna niezależna ocena, ponieważ wagi nie zostały udostępnione.

Czym tak naprawdę jest architektura Qwen4
Dwa mechanizmy napędzają tę historię. Pierwszym z nich jest GDN — Gated Delta Network — warstwa liniowej uwagi Alibaby. Podczas gdy standardowy transformer przechowuje pamięć podręczną kluczy i wartości, która rośnie wraz z długością sekwencji, warstwa GDN utrzymuje stan rekurencyjny o stałym rozmiarze i aktualizuje go za pomocą wyuczonej reguły bramkowania; jej rodowód biegnie przez DeltaNet i Mamba-2. To jest ta korzyść, która od czasów Qwen3-Next po cichu napędza linię {{1}}Qwen{{/1}}: długie konteksty pozostają tanie, ponieważ stan nie rośnie, a mniejszość warstw pełnej uwagi pozostaje w mieszance, aby wykonywać precyzyjne wyszukiwanie informacji, w którym liniowa uwaga wypada słabo. W obecnej generacji mieszanka ta składa się z mniej więcej trzech warstw GDN na każdą warstwę pełnej uwagi — analiza checkpointu Qwen3.8-2.4T-A95B przeprowadzona przez społeczność wylicza 69 warstw GDN wobec 23 warstw uwagi. Qwen3.8-Flash-Next jest opisywany jako „architektura hybrydowa GDN”, wywodząca się dokładnie z tej linii.
Druga z nich, QSA — Qwen Sparse Attention — jest tym, co naprawdę nowe, i nie ma jeszcze żadnego publicznego opisu technicznego: tylko nazwa i określenie jej mianem jednej z dwóch głównych zmian w wersji zapoznawczej. Ten brak szczegółów sam w sobie jest częścią schematu. Wersja zapoznawcza Qwen3-Next pod koniec 2025 roku wprowadziła Gated DeltaNet przy równie skąpej dokumentacji, a architektura doczekała się pełnej specyfikacji dopiero wtedy, gdy przyjęła ją seria Qwen3.5. Dla czytelnika praktyczny wniosek jest za każdym razem ten sam: najpierw pojawia się kanarek architektury, a dopiero po nim dokumentacja i modele produkcyjne.
Scenariusz, który już raz zadziałał.
Alibaba zastosował już to samo zagranie wcześniej i okazało się skuteczne. Pod koniec 2025 roku Qwen3-Next zapowiedział Gated DeltaNet oraz hybrydę uwagi liniowej i pełnej. Gdy seria Qwen3.5 trafiła na rynek, wdrożyła ten schemat na pełną skalę — a hybryda utrzymała się w generacji Qwen3.8, w tym we flagowym modelu 2.4T. Ten precedens ma tu znaczenie ze względu na harmonogram, jaki implikuje. Pełnej rodziny Qwen4 należy oczekiwać po tej zapowiedzi, a nie w niej samej; jeśli odstęp po Qwen3-Next jest jakąkolwiek wskazówką, dystans między „oto architektura” a „oto rodzina” mierzy się w miesiącach. Nic w tej zapowiedzi tego nie potwierdza — to wnioskowanie na podstawie schematu, który Alibaba zastosował już dwukrotnie.
Czego wciąż nie wiemy
Niewiadome są sednem zapowiedzi i są one rzeczywiste:
• Parametry. Zwiastun nie ujawnia żadnych. Spekulacje społeczności na X i Reddicie — bez oficjalnego poparcia — wskazują na konfigurację o łącznej wielkości około 125B i 6B aktywnych parametrów, z dużą tabelą przeglądową osadzeń n-gramowych. Traktuj to jako plotkę.
• Poziom „Flash”. W generacji Qwen3.5, model Qwen3.5-Flash dostępny wyłącznie w chmurze był ulepszoną wersją modelu Qwen3.5-35B-A3B o otwartych wagach. To, czy Qwen3.8-Flash-Next jest odpowiednikiem o otwartych wagach modelu Qwen3.8 o podobnej wielkości, jest nieznane; może to być zamiast tego model klasy 125B-A6B. Obie interpretacje są przypuszczeniami.
• Licencja. Ostatnie wydania Qwen od Alibaba obejmują zakres od Apache-2.0 (Qwen3.8-27B) po licencję Qwen3.8-Max ograniczoną przychodami. To, gdzie trafi Flash-Next, zdecyduje, czy może być używany komercyjnie, i w jakim zakresie.
• Benchmarki. Oświadczenie Qwen podkreśla agentowe programowanie, zadania o długim horyzoncie oraz inteligencję multimodalną, ale nie podano żadnych liczb i nie ma niezależnej oceny, dopóki wagi nie zostaną opublikowane.
Rodzina iterująca w dwutygodniowym cyklu
Tempo wokół to osobna historia. Qwen3.8-Max, flagowy model z 2,4 biliona parametrów, wydany 3 sierpnia; model open-weight Qwen3.8-2.4T-A95B pojawił się 12–13 sierpnia; darmowy Qwen3.8-27B na licencji Apache-2.0 trafił do rąk użytkowników kilka dni później; a teraz, zanim miesiąc dobiegnie końca, zapowiadana jest architektura następnej generacji. Żadne inne laboratorium nie iteruje obecnie w tym tempie. Dla czytelnika wybierającego modele praktyczną konsekwencją jest to, że „najlepszy Qwen" to ruchomy cel — a różnica między generacjami pojawia się szybciej, niż zwykle dostosowuje się otaczający ekosystem. Kupowanie decyzji zamiast modelu staje się coraz bardziej uzasadnionym posunięciem.
Co teraz powinien zrobić programista
Planuj architekturę, nie tylko model. Qwen3.8-Flash-Next będzie niezweryfikowaną wersją zapoznawczą od pierwszego dnia: brak niezależnych benchmarków, ekosystem uruchomieniowy wciąż nadrabiający zaległości i tylko deklaracje producenta co do mocnych stron agentowych i długoterminowych, które mają znaczenie dla obciążeń, które miałyby z niego korzystać. Bezpieczny sposób oceny nie polega na wpięciu go do ścieżki produkcyjnej — lecz na skierowaniu do niego mało ryzykownej kopii obciążenia, porównaniu wyniku z dotychczasowym modelem i pozwoleniu automatycznemu przełączaniu awaryjnemu przejąć momenty, gdy dostawca obsługujący zupełnie nowy model open-weight zachowuje się nieprawidłowo. W OrcaRouter to ten sam endpoint i ten sam klucz, których już używasz: Qwen3.8-Flash-Next i Twój obecny model znajdują się za jednym API, a DSL routingu może przeprowadzić test A/B wersji zapoznawczej względem dotychczasowego modelu z tym samym promptem, zanim cokolwiek zostanie zatwierdzone.
Ceny, gdy już istnieją, należy odczytywać w ten sam sposób. Alibaba nie ogłosiła ceny API dla Flash-Next, a niewydane wagi nie są nigdzie routowalne. Gdy dostawca w końcu ją ujawni, OrcaRouter przekazuje cenę katalogową dostawcy wprost, z 0% marży — więc niezależnie od tego, jaka okaże się liczba Alibaba, pojawi się bez zmian, tego samego dnia. Najbliższy punkt odniesienia, który możesz dziś faktycznie wywołać, to Qwen3.8-Max (qwen/qwen3.8-max), flagowiec, pod którym ta architektura ostatecznie się znajdzie: z oknem kontekstowym o długości 1 000 000 tokenów oraz cenami 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, przekazywanymi po cenie katalogowej. Zapamiętaj tę liczbę, gdy cena Flash-Next spadnie; to koszt, który następna generacja musi pobić.

Co oglądać przy upadku
W momencie, gdy skończy się odliczanie wydania, liczą się cztery rzeczy:
• Liczba parametrów i poziom aktywnych parametrów — czy jest to model klasy 125B-A6B, o którym mówią plotki, czy mniejszy wariant.
• Licencja — permisywna jak Qwen3.8-27B lub restrykcyjna jak licencja Max.
• Czy pierwsze niezależne ewaluacje potwierdzają twierdzenia dostawcy dotyczące kodowania agentowego i długiego horyzontu — liczby, którym należy ufać, a nie marketingowa narracja.
Jak długo Alibaba czeka, zanim pełna rodzina Qwen4 podąży za zapowiedzią.
Nic z tego nie jest stąd poznawalne. To, co jest dziś poznawalne, to kształt decyzji, którą podjął Alibaba: obstawia on, że następna generacja jego architektury jest warta oddania przed flagowym modelem. Ten zakład jest sednem sprawy — a wagi pojawią się jutro.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
