
Poznaj Qwen3.8-Flash: multimodalny MoE o otwartych wagach, który zapowiada architekturę Qwen4 — 0,15 USD / 0,47 USD za 1 mln tokenów w QwenCloud
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
26 sierpnia 2026 roku zespół Qwen udostępnił jako open source wagi stojące za Qwen3.8-Flash — opublikowane na Hugging Face i ModelScope pod nazwą Qwen3.8-Flash-Next — oraz uruchomił produkcyjny model noszący nazwę Qwen3.8-Flash w API QwenCloud, potwierdzając oficjalną wycenę następnego dnia. Najważniejsza liczba — oficjalnie potwierdzona w ogłoszeniu Alibaby z 28 sierpnia — to multimodalna mieszanka ekspertów o 125 miliardach parametrów, która aktywuje tylko około 6 miliardów parametrów na token, z rzadkością na poziomie mniej więcej 95%, zbudowana na architekturze, którą Alibaba wprost określa jako wczesną zapowiedź generacji Qwen4. Produkcyjne API jest dostępne na QwenCloud w cenie 0,15 dolara za milion tokenów wejściowych, 0,47 dolara za milion tokenów wyjściowych oraz 0,016 dolara za milion w przypadku trafień w pamięć podręczną — to najtańszy sposób uruchomienia czegoś, co strukturalnie wywodzi się z następnego flagowca Alibaby, i pierwszy raz, gdy laboratorium wypuściło publicznie preview architektury jako otwarte wagi przed powstaniem pełnej rodziny modeli.
Jedna liczba ma więcej do powiedzenia niż reszta specyfikacji: 6B. Qwen3.8-Flash nie osiąga swoich możliwości dzięki samemu rozmiarowi — osiąga je dzięki rozmieszczeniu mocy obliczeniowej. Ciało MoE o 125B parametrów, tablica embeddingów N-gram o 51B oraz mały moduł przewidywania wielu tokenów przechowują na dysku łącznie blisko 180B parametrów, a mimo to każdy token przechodzi przez jedynie 6B z nich. Na tym właśnie stoi cała ta wersja i to dlatego koszt trenowania spadł tak znacząco.
Co faktycznie zostało wydane
Qwen3.8-Flash, bez przyrostka, to produkcyjna wersja modelu, która jest obecnie dostępna w API QwenCloud oraz w produkcie Qwen Office firmy Alibaba; domyślnie oferuje kontekst 1 mln tokenów i wbudowane narzędzia, w cenie 0,15 USD / 0,47 USD za milion tokenów, z trafieniami cache wycenianymi na 0,016 USD. 28 sierpnia lista dostępności się poszerzyła: zgodnie z ogłoszeniem Alibaby, Qwen3.8-Flash jest teraz osiągalny również przez OpenCode Go, subskrypcję ryczałtową open-source'owego agenta kodowania działającego w terminalu — lista modeli OpenCode zawiera go jako qwen3.8-flash w tych samych stawkach 0,15 USD / 0,47 USD za milion tokenów.

Oficjalne ogłoszenie Qwen Studio przedstawia wydanie otwartych wag jako zaproszenie dla ekosystemu: wprowadźcie zmiany strukturalne wcześnie, aby społeczność i stacki wnioskowania mogły się zaadaptować, zanim powstanie pełna linia Qwen4. Pierwszym sygnałem, że to zadziałało, jest SGLang — silnik wnioskowania wspierany przez LMSYS — który już pierwszego dnia opublikował wsparcie dla Qwen3.8-Flash-Next, a model skonfigurowano także dla Transformers, vLLM i TokenSpeed.
Architektura to historia.
To nie jest pomniejszony model generacji Qwen 3.8. Qwen3.8-Flash wprowadza cztery zmiany, które – według zespołu – odziedziczy rodzina Qwen4, a każda z nich celuje w inne wąskie gardło.
Uwaga — Gated DeltaNet plus Qwen Sparse Attention. Gated DeltaNet (GDN) kompresuje historię do stanów o stałym rozmiarze w trzech z każdych czterech warstw, dzięki czemu model nie czyta ponownie wszystkiego na każdym kroku; QSA traktuje długi kontekst jako problem wyszukiwania — lekki indeksator agreguje sekwencję w mikro-bloki, ocenia ważność bloków i kieruje uwagę do najbardziej istotnych regionów. Według pomiarów Alibaba kernel uwagi QSA osiąga do 7,6× szybsze prefill i 4,9× szybsze dekodowanie przy kontekście 1M tokenów (dane dostawcy).
• Residual — bramkowany residual. Pojedynczy strumień residualny dzieli się na cztery równoległe gałęzie z bramkowaniem element po elemencie, co pozwala sieci decydować dla każdego tokena, ile odczytać i zapisać w każdej gałęzi; jedna gałąź staje się kanałem dalekiego zasięgu łączącym wczesne warstwy uwagi z głębokimi. Stany residualne są przechowywane w FP8, aby zmniejszyć przepustowość pamięci.
• Embedding — embeddingi N-gramowe. Tablica odnośników o 51 miliardach parametrów, indeksowana na podstawie bieżącego tokenu oraz kilku poprzedzających. Dodaje pojemność bez zwiększania kosztu obliczeniowego przypadającego na token, a ponieważ tablica może znajdować się w pamięci hosta i być asynchronicznie prefetchowana, nie zajmuje na stałe pamięci GPU.
Optymalizator — Muon. Duże parametry liniowe 2D (attention, GDN, eksperci MoE) trenują z Muon, natomiast embeddingi, router i niskowymiarowe części Gated Residual pozostają przy AdamW; zespół ponownie dopasował prawo skalowania dla nowej architektury wokół tej mieszanki.

Dla programisty dwie z tych rzeczy mają znaczenie natychmiast: stos uwagi to powód, dla którego kontekst 1M tokenów może być domyślną opcją, a nie ambitnym celem, a tabela N-gramów to powód, dla którego model 125B może być nadal serwowany w lekki sposób. Reszta to materiał zapowiadający Qwen4 — i właśnie w ten sposób pozycjonuje to Alibaba.
Arkusz benchmarkowy, uczciwie oznaczony
Każda liczba w tej sekcji jest własną oceną Alibaby, powstałą dzień temu i niepotwierdzoną przez żadne niezależne laboratorium w momencie pisania tego tekstu. Traktuj je jako wskazówki kierunkowe, a nie rozstrzygnięte wyniki. W zestawie testów Alibaby model Qwen3.8-Flash-Next (6B aktywnych) notuje SWE-bench Pro 62,5, DeepSWE 1.1 58,7, CoWorkBench 73,9, AndroidWorld 84,5 oraz MathVision 95,7, z wynikiem JobBench 55,7 — a wariant bazowy, Qwen3.8-Flash-Next-Base, jest opisywany jako najlepszy otwarty model w 8 z 14 benchmarków w bezpośrednim porównaniu, w tym MMLU-Pro, SuperGPQA, BBH i MMMU.
Twierdzenia Alibaby o miejscu w rodzinie modeli należy nazwać tym, czym są — twierdzeniami. Firma twierdzi, że Qwen3.8-Flash pokonuje Claude Opus 4.6 o 9,1 punktu w SWE-bench Pro i o około 20 punktów w JobBench oraz zbliża się do Claude Opus 4.8. Wszystko raportowane przez producenta, wszystko bez niezależnego potwierdzenia. To, co można dziś sprawdzić niezależnie, jest węższe: wagi są opublikowane, stos wnioskowania już je uruchamia, a SGLang dodał wsparcie tego samego dnia. Niezależne odtworzenie arkusza benchmarków to kwestia dni, a nie tygodni.
Ile to kosztuje
Cennik jest najłatwiejszą częścią do zweryfikowania, ponieważ jest to opublikowana cena, a nie benchmark — a 27 sierpnia Alibaba oficjalnie potwierdziła produkcyjne stawki QwenCloud: 0,15 USD za milion tokenów wejściowych, 0,47 USD za milion tokenów wyjściowych i 0,016 USD za milion przy trafieniach w pamięć podręczną, przy czym stawka krajowa w Chinach wynosi 0,8/2,7/0,1 juana. Liczba dotycząca trafień w pamięć podręczną jest kluczowa dla obciążeń agentowych: agent z długim kontekstem, który przy każdej turze ponownie czyta dużą historię, płaci grosze za powtarzane odczyty — a to dokładnie obciążenie, na które celuje stos uwagi Qwen4-preview. Chińskie media natychmiast porównały tę flagową cenę z konkurencją — to mniej więcej jedna trzecia tego, co pobiera DeepSeek-V4-Flash, i zaokrąglenie w porównaniu z czołowymi zamkniętymi modelami. Według własnych wyliczeń Alibaby koszt treningu wyniósł około jednej dziewiątej ceny Qwen3.7-Plus, a ta strukturalna dźwignia sprawia, że cena API jest właśnie taka, jaka jest.
Obok reszty rodziny Qwen 3.8 różnica jest rażąca: flagowy model Qwen3.8-Max kosztuje 2,00 i 6,00 USD za milion tokenów i jest już dostępny na OrcaRouter po cenie producenta, z zerową marżą. Teraz, gdy produkcyjne API Qwen3.8-Flash jest otwarte, ta sama zasada bezpośredniego przenoszenia ceny obowiązuje dla oficjalnych stawek 0,15/0,47 USD oraz stawki 0,016 USD za trafienie w pamięci podręcznej — warstwa routingu to różnica między przeczytaniem o obniżce ceny a wprowadzeniem jej do konfiguracji. Oba modele za jednym kluczem, automatyczne przełączanie awaryjne między nimi, bez drugiej umowy.
Co oznacza „wersja zapoznawcza Qwen4”?
Jeśli przeczytamy ogłoszenie dosłownie, stawka jest jasna: to nie jest nowy poziom Qwen 3.8 — to architektura Qwen4 wydana wcześniej, pod ochronną marką mniejszego, tańszego modelu. Powody takiego działania są sensowne: frameworki, kwantyzacja i wzorce wdrożeniowe potrzebują czasu, aby dojrzeć, a model z 6B aktywnych parametrów to tani sposób dla społeczności na przetestowanie GDN + QSA na dużą skalę, zanim Alibaba zbuduje na tym droższą rzecz. Drugą stroną medalu jest to, że produkcyjny Qwen3.8-Flash to API zbudowane na architekturze, którą szerszy ekosystem wciąż audytuje. Wcześni użytkownicy są z definicji zestawem testowym.
Szybka ścieżka do wypróbowania tego.
Dziś masz cztery realistyczne opcje. Samodzielnie hostuj otwarte wagi przez vLLM, SGLang, Transformers lub TokenSpeed — wersja FP8 jest rozsądnym pierwszym krokiem na wszystkim, co jest mniejsze niż pełny węzeł. Wywołaj API QwenCloud, dostępne teraz w oficjalnej cenie $0,15/$0,47, z trafieniami cache za $0,016. Użyj go w OpenCode Go, subskrypcji flat-rate open-source'owego agenta kodującego w terminalu, który w tym tygodniu dodał Qwen3.8-Flash (ogłoszone przez Alibaba 28 sierpnia, potwierdzone na liście modeli OpenCode). Albo wywołaj produkcyjnego Flasha przez router, tak jak już wywołujesz Qwen3.8-Max, z oficjalną stawką przekazywaną dalej bez narzutu — bez potrzeby utrzymywania dedykowanej integracji.

Otwarte pytanie jest tym uczciwym: {{1}}czy model, który aktywuje 6 miliardów swoich parametrów, sprawdzi się w produkcji przy szerokim zakresie obciążeń, czy też arkusz benchmarków, który dziś wygląda na świeży, nadal będzie tak wyglądać za miesiąc?{{/1}} {{2}}To nie powód, by czekać — to powód, by umieścić go za mechanizmem failover, a nie przed całym swoim stackiem.{{/2}} {{3}}Wagi są opublikowane, cena ustalona, a architektura to zadeklarowany kierunek Alibaby.{{/3}} {{4}}Najbliższe tygodnie zdecydują, czy 6B wystarczyło.{{/4}}
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
