Poznaj Qwen3.8-Flash — multimodalny model MoE o otwartych wagach, który zapowiada architekturę Qwen4. Zregenerowana ilustracja.
Guides & Insights

Poznaj Qwen3.8-Flash: multimodalny MoE o otwartych wagach, który zapowiada architekturę Qwen4 — 0,15 USD / 0,47 USD za 1 mln tokenów w QwenCloud

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

26 sierpnia 2026 roku zespół Qwen udostępnił jako open source wagi stojące za Qwen3.8-Flash — opublikowane na Hugging Face i ModelScope pod nazwą Qwen3.8-Flash-Next — oraz uruchomił produkcyjny model noszący nazwę Qwen3.8-Flash w API QwenCloud, potwierdzając oficjalną wycenę następnego dnia. Najważniejsza liczba — oficjalnie potwierdzona w ogłoszeniu Alibaby z 28 sierpnia — to multimodalna mieszanka ekspertów o 125 miliardach parametrów, która aktywuje tylko około 6 miliardów parametrów na token, z rzadkością na poziomie mniej więcej 95%, zbudowana na architekturze, którą Alibaba wprost określa jako wczesną zapowiedź generacji Qwen4. Produkcyjne API jest dostępne na QwenCloud w cenie 0,15 dolara za milion tokenów wejściowych, 0,47 dolara za milion tokenów wyjściowych oraz 0,016 dolara za milion w przypadku trafień w pamięć podręczną — to najtańszy sposób uruchomienia czegoś, co strukturalnie wywodzi się z następnego flagowca Alibaby, i pierwszy raz, gdy laboratorium wypuściło publicznie preview architektury jako otwarte wagi przed powstaniem pełnej rodziny modeli.

Jedna liczba ma więcej do powiedzenia niż reszta specyfikacji: 6B. Qwen3.8-Flash nie osiąga swoich możliwości dzięki samemu rozmiarowi — osiąga je dzięki rozmieszczeniu mocy obliczeniowej. Ciało MoE o 125B parametrów, tablica embeddingów N-gram o 51B oraz mały moduł przewidywania wielu tokenów przechowują na dysku łącznie blisko 180B parametrów, a mimo to każdy token przechodzi przez jedynie 6B z nich. Na tym właśnie stoi cała ta wersja i to dlatego koszt trenowania spadł tak znacząco.

Co faktycznie zostało wydane

Qwen3.8-Flash, bez przyrostka, to produkcyjna wersja modelu, która jest obecnie dostępna w API QwenCloud oraz w produkcie Qwen Office firmy Alibaba; domyślnie oferuje kontekst 1 mln tokenów i wbudowane narzędzia, w cenie 0,15 USD / 0,47 USD za milion tokenów, z trafieniami cache wycenianymi na 0,016 USD. 28 sierpnia lista dostępności się poszerzyła: zgodnie z ogłoszeniem Alibaby, Qwen3.8-Flash jest teraz osiągalny również przez OpenCode Go, subskrypcję ryczałtową open-source'owego agenta kodowania działającego w terminalu — lista modeli OpenCode zawiera go jako qwen3.8-flash w tych samych stawkach 0,15 USD / 0,47 USD za milion tokenów.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

Oficjalne ogłoszenie Qw​en Studio przedstawia wydanie otwartych wag jako zaproszenie dla ekosystemu: wprowadźcie zmiany strukturalne wcześnie, aby społeczność i stacki wnioskowania mogły się zaadaptować, zanim powstanie pełna linia Qwen4. Pierwszym sygnałem, że to zadziałało, jest SGLang — silnik wnioskowania wspierany przez LMSYS — który już pierwszego dnia opublikował wsparcie dla Qwen3.8-Flash-Next, a model skonfigurowano także dla Transformers, vLLM i TokenSpeed.

Architektura to historia.

To nie jest pomniejszony model generacji Qwen 3.8. Qwen3.8-Flash wprowadza cztery zmiany, które – według zespołu – odziedziczy rodzina Qwen4, a każda z nich celuje w inne wąskie gardło.

Uwaga — Gated DeltaNet plus Qw​en Sparse Attention. Gated DeltaNet (GDN) kompresuje historię do stanów o stałym rozmiarze w trzech z każdych czterech warstw, dzięki czemu model nie czyta ponownie wszystkiego na każdym kroku; QSA traktuje długi kontekst jako problem wyszukiwania — lekki indeksator agreguje sekwencję w mikro-bloki, ocenia ważność bloków i kieruje uwagę do najbardziej istotnych regionów. Według pomiarów Alibaba kernel uwagi QSA osiąga do 7,6× szybsze prefill i 4,9× szybsze dekodowanie przy kontekście 1M tokenów (dane dostawcy).

• Residual — bramkowany residual. Pojedynczy strumień residualny dzieli się na cztery równoległe gałęzie z bramkowaniem element po elemencie, co pozwala sieci decydować dla każdego tokena, ile odczytać i zapisać w każdej gałęzi; jedna gałąź staje się kanałem dalekiego zasięgu łączącym wczesne warstwy uwagi z głębokimi. Stany residualne są przechowywane w FP8, aby zmniejszyć przepustowość pamięci.

• Embedding — embeddingi N-gramowe. Tablica odnośników o 51 miliardach parametrów, indeksowana na podstawie bieżącego tokenu oraz kilku poprzedzających. Dodaje pojemność bez zwiększania kosztu obliczeniowego przypadającego na token, a ponieważ tablica może znajdować się w pamięci hosta i być asynchronicznie prefetchowana, nie zajmuje na stałe pamięci GPU.

Optymalizator — Muon. Duże parametry liniowe 2D (attention, GDN, eksperci MoE) trenują z Muon, natomiast embeddingi, router i niskowymiarowe części Gated Residual pozostają przy AdamW; zespół ponownie dopasował prawo skalowania dla nowej architektury wokół tej mieszanki.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Dla programisty dwie z tych rzeczy mają znaczenie natychmiast: stos uwagi to powód, dla którego kontekst 1M tokenów może być domyślną opcją, a nie ambitnym celem, a tabela N-gramów to powód, dla którego model 125B może być nadal serwowany w lekki sposób. Reszta to materiał zapowiadający Qwen4 — i właśnie w ten sposób pozycjonuje to Alibaba.

Arkusz benchmarkowy, uczciwie oznaczony

Każda liczba w tej sekcji jest własną oceną Alibaby, powstałą dzień temu i niepotwierdzoną przez żadne niezależne laboratorium w momencie pisania tego tekstu. Traktuj je jako wskazówki kierunkowe, a nie rozstrzygnięte wyniki. W zestawie testów Alibaby model Qwen3.8-Flash-Next (6B aktywnych) notuje SWE-bench Pro 62,5, DeepSWE 1.1 58,7, CoWorkBench 73,9, AndroidWorld 84,5 oraz MathVision 95,7, z wynikiem JobBench 55,7 — a wariant bazowy, Qwen3.8-Flash-Next-Base, jest opisywany jako najlepszy otwarty model w 8 z 14 benchmarków w bezpośrednim porównaniu, w tym MMLU-Pro, SuperGPQA, BBH i MMMU.

Twierdzenia Alibaby o miejscu w rodzinie modeli należy nazwać tym, czym są — twierdzeniami. Firma twierdzi, że Qwen3.8-Flash pokonuje Claude Opus 4.6 o 9,1 punktu w SWE-bench Pro i o około 20 punktów w JobBench oraz zbliża się do Claude Opus 4.8. Wszystko raportowane przez producenta, wszystko bez niezależnego potwierdzenia. To, co można dziś sprawdzić niezależnie, jest węższe: wagi są opublikowane, stos wnioskowania już je uruchamia, a SGLang dodał wsparcie tego samego dnia. Niezależne odtworzenie arkusza benchmarków to kwestia dni, a nie tygodni.

Ile to kosztuje

Cennik jest najłatwiejszą częścią do zweryfikowania, ponieważ jest to opublikowana cena, a nie benchmark — a 27 sierpnia Alibaba oficjalnie potwierdziła produkcyjne stawki QwenCloud: 0,15 USD za milion tokenów wejściowych, 0,47 USD za milion tokenów wyjściowych i 0,016 USD za milion przy trafieniach w pamięć podręczną, przy czym stawka krajowa w Chinach wynosi 0,8/2,7/0,1 juana. Liczba dotycząca trafień w pamięć podręczną jest kluczowa dla obciążeń agentowych: agent z długim kontekstem, który przy każdej turze ponownie czyta dużą historię, płaci grosze za powtarzane odczyty — a to dokładnie obciążenie, na które celuje stos uwagi Qwen4-preview. Chińskie media natychmiast porównały tę flagową cenę z konkurencją — to mniej więcej jedna trzecia tego, co pobiera DeepSeek-V4-Flash, i zaokrąglenie w porównaniu z czołowymi zamkniętymi modelami. Według własnych wyliczeń Alibaby koszt treningu wyniósł około jednej dziewiątej ceny Qwen3.7-Plus, a ta strukturalna dźwignia sprawia, że cena API jest właśnie taka, jaka jest.

Obok reszty rodziny Qw​en 3.8 różnica jest rażąca: flagowy model Qwen3.8-Max kosztuje 2,00 i 6,00 USD za milion tokenów i jest już dostępny na OrcaRouter po cenie producenta, z zerową marżą. Teraz, gdy produkcyjne API Qwen3.8-Flash jest otwarte, ta sama zasada bezpośredniego przenoszenia ceny obowiązuje dla oficjalnych stawek 0,15/0,47 USD oraz stawki 0,016 USD za trafienie w pamięci podręcznej — warstwa routingu to różnica między przeczytaniem o obniżce ceny a wprowadzeniem jej do konfiguracji. Oba modele za jednym kluczem, automatyczne przełączanie awaryjne między nimi, bez drugiej umowy.

Co oznacza „wersja zapoznawcza Qwen4”?

Jeśli przeczytamy ogłoszenie dosłownie, stawka jest jasna: to nie jest nowy poziom Qw​en 3.8 — to architektura Qwen4 wydana wcześniej, pod ochronną marką mniejszego, tańszego modelu. Powody takiego działania są sensowne: frameworki, kwantyzacja i wzorce wdrożeniowe potrzebują czasu, aby dojrzeć, a model z 6B aktywnych parametrów to tani sposób dla społeczności na przetestowanie GDN + QSA na dużą skalę, zanim Alibaba zbuduje na tym droższą rzecz. Drugą stroną medalu jest to, że produkcyjny Qwen3.8-Flash to API zbudowane na architekturze, którą szerszy ekosystem wciąż audytuje. Wcześni użytkownicy są z definicji zestawem testowym.

Szybka ścieżka do wypróbowania tego.

Dziś masz cztery realistyczne opcje. Samodzielnie hostuj otwarte wagi przez vLLM, SGLang, Transformers lub TokenSpeed — wersja FP8 jest rozsądnym pierwszym krokiem na wszystkim, co jest mniejsze niż pełny węzeł. Wywołaj API QwenCloud, dostępne teraz w oficjalnej cenie $0,15/$0,47, z trafieniami cache za $0,016. Użyj go w OpenCode Go, subskrypcji flat-rate open-source'owego agenta kodującego w terminalu, który w tym tygodniu dodał Qwen3.8-Flash (ogłoszone przez Alibaba 28 sierpnia, potwierdzone na liście modeli OpenCode). Albo wywołaj produkcyjnego Flasha przez router, tak jak już wywołujesz Qwen3.8-Max, z oficjalną stawką przekazywaną dalej bez narzutu — bez potrzeby utrzymywania dedykowanej integracji.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

Otwarte pytanie jest tym uczciwym: {{1}}czy model, który aktywuje 6 miliardów swoich parametrów, sprawdzi się w produkcji przy szerokim zakresie obciążeń, czy też arkusz benchmarków, który dziś wygląda na świeży, nadal będzie tak wyglądać za miesiąc?{{/1}} {{2}}To nie powód, by czekać — to powód, by umieścić go za mechanizmem failover, a nie przed całym swoim stackiem.{{/2}} {{3}}Wagi są opublikowane, cena ustalona, a architektura to zadeklarowany kierunek Alibaby.{{/3}} {{4}}Najbliższe tygodnie zdecydują, czy 6B wystarczyło.{{/4}}

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube