
Qwen3.8-Flash-Next kontra Qwen3.8-27B: MoE z Qwen4-preview przeciwko otwartemu koniowi roboczemu
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 578 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 182 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Zaskakujące w Qwen3.8-Flash-Next nie jest to, że Alibaba twierdzi, iż model aktywujący zaledwie 6 miliardów parametrów na token pokonuje większość otwartej konkurencji — ale to, że jego serwowanie wymaga więcej pamięci niż 27-miliardowy model gęsty, z którym jest porównywany. Qwen3.8-Flash-Next, którego kod źródłowy opublikowano 26 sierpnia 2026 roku jako zapowiedź architektury Qwen4, trzyma 51-miliardową tablicę przeglądową N-gramów w pamięci RAM zamiast w VRAM; Qwen3.8-27B, multimodalny model gęsty na licencji Apache-2.0, wypuszczony w połowie sierpnia i będący koniem roboczym obecnej generacji Qwen 3.8 o otwartych wagach, mieści się na pojedynczej karcie graficznej 24 GB przy kwantyzacji 4-bitowej. Na własnej liście benchmarków Alibaby nowy MoE pokonuje 27B w 21 z 22 porównywanych benchmarków. Na podstawie niezależnych dowodów — pozycji na arenie, badania agenta prawnego, zewnętrznych pomiarów przepustowości — 27B jest jedynym z tych dwóch, który ma jakiekolwiek. To połączenie stanowi całą decyzję.
To starcie w jednym zdaniu: dwa modele typu open-weight, tekstowo-wizyjne, tej samej generacji, z tym samym natywnym kontekstem 262K, oba zaprojektowane do działania poza centrum danych — a różni je architektura, licencja, cena oraz stopień, w jakim ich historia została zweryfikowana. Qwen3.8-Flash-Next to rzadki model MoE, który zapowiada wszystko, co Qwen4 ma odziedziczyć. Qwen3.8-27B to model gęsty, który kompresuje to, czego Alibaba nauczyła się, budując flagowy model 2.4T, w coś, co może uruchomić pojedyncze GPU. Wybór między nimi to mniej kwestia możliwości — Alibaba twierdzi, że wersja zapoznawcza jest lepsza — a bardziej tego, czy ufasz jednodniowej karcie produktowej bardziej niż modelowi, który społeczność już rozłożyła na czynniki pierwsze.
Tablica wyników
Najpierw o źródłach: wszystkie poniższe dane dotyczące Qwen3.8-Flash-Next pochodzą od samego Alibaby, są jednodniowe i niezweryfikowane. Główne wyniki benchmarków Qwen3.8-27B również są raportowane przez Alibabę, ale 27B dysponuje niezależnymi rezultatami — miejscami w rankingu preferencji ludzkich, badaniem z dziedziny prawa oraz pomiarami przepustowości AMD — którym wersja preview nie może dorównać.
• Całkowita liczba parametrów — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B przechowywanych), 6B aktywnych. Qwen3.8-27B: ~27B gęstych (28B z enkoderem wizyjnym), wszystkie aktywne.
• Architektura — Qwen3.8-Flash-Next: zapowiedź Qwen4 — uwaga rozproszona Qwen (Qwen Sparse Attention) naprzemiennie z Gated DeltaNet, bramkowane połączenie rezydualne, embeddingi N-gram, trenowany optymalizatorem Muon. Qwen3.8-27B: 48 warstw liniowej uwagi GDN plus 16 warstw pełnej uwagi (3:1), gęsty.
• Kontekst — oba natywnie 262 144 tokeny, rozszerzalne do 1M przez YaRN.
• Modalność — oba przyjmują tekst, obrazy i wideo jako dane wejściowe i zwracają tekst.
• Licencja — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
• Cena — Qwen3.8-Flash-Next: $0.16 / $0.47 za 1M (zapowiedziano; API produkcyjne nie jest jeszcze otwarte). Qwen3.8-27B: $0.33 / $2.40 za 1M, dostępny dziś.
• Zapotrzebowanie pamięci — Qwen3.8-Flash-Next: tabela 51B w pamięci RAM hosta, ~96 GB pamięci systemowej plus pamięć GPU; FP8 ~186 GB, Q4 GGUF ~82 GB. Qwen3.8-27B: BF16 ~55,6 GB, wariant 4-bitowy mieści się na karcie 24 GB.
• Niezależne dowody — Qwen3.8-Flash-Next: jeszcze brak. Qwen3.8-27B: #1 otwarty model na Arena.ai Image-to-WebDev, #9 ogółem na Code Arena WebDev, #1 open-weight w benchmarku Harvey's Legal Agent, przepustowość mierzona przez AMD.

Według własnych danych Alibaby, preview wygrywa prawie wszystko.
Opublikowane przez Alibabę porównanie daje modelowi Qwen3.8-Flash-Next wyniki równe lub lepsze w 21 z 22 benchmarków językowych i wizyjnych względem Qwen3.8-27B, a te zwycięstwa nie są kosmetyczne. SWE-bench Pro 62.5 wobec 61.7 to marginalna przewaga, ale DeepSWE 58.7 wobec 42.2, JobBench 55.7 wobec 33.4 oraz CoWorkBench 73.9 wobec 70.7 to realne różnice właśnie w obciążeniach agentowych i biurowych, do których skierowany jest wariant flash. Główne liczby wersji zapoznawczej — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — również przewyższają odpowiednie wiersze modelu 27B w tabeli Alibaby. To teza tej wersji wyrażona w danych: większość zdolności rozumowania i kodowania większej linii Qwen 3.8 przy ułamku aktywnej mocy obliczeniowej.
Pozostaw etykietę przypisaną do tego zdania. To są własne oceny Alibaby, z własnego środowiska testowego Alibaby, w przypadku wersji podglądowej sprzed jednego dnia i niezreplikowane dla obu. Analiza architektury KGP Talkie, która plasuje się w tym porównaniu, dochodzi do tego samego wniosku, ale opiera się na tym samym arkuszu od dostawcy. Tabela od dostawcy to obietnica; nic w tym akapicie nie zostało niezależnie potwierdzone.
Co 27B ma, czego Flash-Next nie ma: dowody
W tym miejscu starcie przestaje być jednostronne. Qwen3.8-27B spędził dwa tygodnie w otwartym dostępie, a społeczność wyprodukowała trzy niezależne punkty danych. Na liście rankingowej Image-to-WebDev serwisu Arena.ai — ślepych głosach ludzi, którzy wybierają, który z dwóch zanonimizowanych wyników woleliby wdrożyć — 27B zajmuje 1. miejsce wśród modeli open source i 7. miejsce w ogóle, z raportowanym wynikiem 1 574. Na pokrewnej liście Code Arena WebDev plasuje się na 9. miejscu w ogóle z wynikiem 1 595, jako jedyny model w swojej klasie rozmiarowej w pierwszej dziesiątce. Firma Harvey, zajmująca się AI dla prawa, wraz z Engram przeprowadziła badanie na syntetycznej kancelarii prawnej, które umieściło zaadaptowany 27B na szczycie ich benchmarku agentów prawnych — z zastrzeżeniem, że model wcześniej studiował korpus testowy, co czyni to demonstracją potencjału dostrajania, a nie wynikiem dla oryginalnych wag. AMD opublikowało pomiary przepustowości z dnia zerowego: 24,5 tokena/s na Ryzen AI Max+ 395 i 51,8 tokena/s na Radeon AI PRO R9700. Żaden z tych wyników nie jest ogólnym wskaźnikiem jakości — wciąż nie ma indeksu Artificial Analysis dla 27B — ale każdy pochodzi od strony trzeciej, która faktycznie uruchomiła model.
Qwen3.8-Flash-Next nie ma nic z tego. Cała jego tabela benchmarków pochodzi od Alibaby i w chwili pisania ma zaledwie kilka godzin, a żadne niezależne laboratorium nie odtworzyło ani jednego wiersza. To nie jest oskarżenie; to definicja wydania sprzed jednego dnia. Ale to właśnie ta asymetria powinna kierować wyborem: wersja zapoznawcza przoduje w jedynych liczbach, jakie istnieją, a każdą z tych liczb opublikował dostawca, który chce, żebyś w nie uwierzył.
Fork wdrożeniowy
Praktyczna różnica między tymi dwoma modelami polega na tym, gdzie znajdują się parametry, i to determinuje, jakiego sprzętu potrzebujesz. Qwen3.8-Flash-Next celowo przenosi swoją 51B tablicę embeddingów N-gram do pamięci hosta, skąd może być asynchronicznie pobierana z wyprzedzeniem — dlatego zwiększa pojemność o 51B parametrów bez zwiększania kosztu obliczeniowego na token. Konsekwencją jest to, że model nie zmieści się na 24GB karcie konsumenckiej tak, jak wcześniej mieścił się lokalny Qwen. Według szacunków społeczności Q4 GGUF zajmie łącznie około 82GB (mniej więcej 58GB głównych wag plus 24GB tablica odnośników), wersja FP8 około 186GB, BF16 około 360GB; sprawdzony przepis to maszyna z pamięcią RAM rzędu 96GB plus dowolne GPU, które uruchomi aktywny model 6B. Korzyść jest taka, że koszt obliczeniowy na token jest niski — na tym opiera się cały zamysł tej architektury — a długi kontekst 1M tokenów pozostaje przystępny, ponieważ warstwy GDN kompresują historię zamiast rozbudowywać pamięć podręczną KV.
Qwen3.8-27B to model dokładnie odwrotny: gęsty, więc każdy token przepuszcza wszystkie 27 miliardów parametrów, ale na tyle mały, że całość mieści się na sprzęcie, który już masz. Wagi BF16 ważą około 55,6 GB; przy kwantyzacji 4-bitowej działa na karcie z 24 GB pamięci, takiej jak RTX 3090 lub 4090, a pomiary AMD pokazują, że osiąga 24,5–51,8 tokenów/s na sprzęcie klasy AI Max i Radeon PRO. Jeśli ograniczeniem jest pojedyncza stacja robocza, to model 27B faktycznie się na niej mieści; jeśli ograniczeniem jest koszt pojedynczego tokena w skali, to Flash-Next wygrywa na papierze.
Widełki cenowe
Ceny API opowiadają tę samą historię z drugiej strony. Qwen3.8-27B jest dziś dostępny na OrcaRouter w cenie 0,33 USD za milion tokenów wejściowych i 2,40 USD za milion tokenów wyjściowych, z ceną katalogową dostawcy przekazywaną dalej bez marży — opcja self-host jest wywoływalna, bez konieczności zakupu GPU. Qwen3.8-Flash-Next nie jest jeszcze nigdzie trasowany: otwarte wagi są jedyną ścieżką, dopóki produkcyjny Qwen3.8-Flash nie zostanie udostępniony w QwenCloud API w zapowiedzianych cenach 0,16 USD / 0,47 USD. Gdy to API zostanie udostępnione, ten sam model pass-through sprawi, że cena 0,16 USD / 0,47 USD pojawi się po naszej stronie tego samego dnia, na tym samym kluczu co 27B, z automatycznym failover między nimi — więc sposób na wdrożenie jednodniowej architektury nie polega na tym, by postawić na nią produkcję, ale na skierowaniu na nią części ruchu, ze sprawdzonym modelem jako fallbackiem. Warstwa routingu może również być frontem dla modelu, który hostujesz samodzielnie, co jest praktyczną ścieżką do oceny otwartych wag Flash-Next już dziś, bez konieczności drugiej integracji.

Który uruchomić
Wybierz Qwen3.8-Flash-Next, jeśli chcesz już teraz podążać w kierunku Qwen4, jeśli Twoje obciążenie jest na tyle duże, że $0.16/$0.47 w porównaniu z $0.33/$2.40 to realna liczba, lub jeśli masz wystarczająco RAM, aby go hostować lokalnie i odpowiada Ci arkusz producenta. Wybierz Qwen3.8-27B, jeśli potrzebujesz licencji Apache-2.0, pojedynczej karty 24GB, modelu, który możesz uruchomić już dziś, lub jakiegokolwiek stopnia niezależnych dowodów — to jedyny z tych dwóch, który był uruchamiany przez kogokolwiek spoza Alibaba.

Powyższe dwa zrzuty ekranu to publiczne powierzchnie każdej z połówek: lista OrcaRouter, gdzie Qwen3.8-27B jest dziś dostępny za $0,33/$2,40, oraz karta modelu Qwen/Qwen3.8-Flash-Next na Hugging Face.
A szczere zakończenie jest pytaniem, ponieważ baza dowodowa ma jeden dzień: czy model, który aktywuje 6 miliardów swoich parametrów, utrzyma wynik 21 na 22 w niezależnej replikacji, czy też tabela N-gramów, dzięki której działa lekko, jest jednocześnie tym, co zawodzi przy rzeczywistych obciążeniach? Model 27B przetrwał już dwa tygodnie społecznościowej kontroli. Flash-Next jest tam, gdzie 27B był dwa tygodnie temu — co jest najlepszym argumentem za uruchamianiem ich obok siebie, zamiast wybierać.
