Karta tytułowa hero dla artykułu 'Qwen3.8-Flash-Next — LEAK REPORT' z plakietką 'UNVERIFIED — QWEN4 ARCHITECTURE PREVIEW', podtytułem 'Alibaba ships the Qwen4 architecture before the model', trzema chipami z napisami 'Source: @kimmonismus', 'Aug 25, 2026' i 'Release: Aug 26 23:00 UTC+08', lewą kartą z napisem 'The claim: an open-weight multimodal MoE previewing the Qwen4 architecture' i prawą kartą z napisem 'Status: weights unreleased, ~24h to drop'. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Qwen3.8-Flash-Next już dostępny: Alibaba wdraża architekturę Qwen4, zanim Qwen4 powstanie

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Qwen3.8-Flash-Next wreszcie ma liczby, których nie wygenerowała Alibaba — i nie mówią one tego, co głosi najgłośniejsza wersja tej historii. W Artificial Analysis Intelligence Index, przeliczonym na wersję v4.3 7 września, wersja preview Alibaby z otwartymi wagami uzyskuje wynik 40 i zajmuje piąte miejsce wśród 113 modeli w swojej klasie porównawczej. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — model, z którym wciąż się go porównuje — uzyskuje wynik 35 i zajmuje dziewiąte miejsce. To nie parytet; to pięciopunktowa przewaga mniejszego modelu. To także pierwsza szeroka, niezależna tablica wyników, która dociera do modelu, którego jedynymi publikowanymi liczbami — aż do tego miesiąca — były liczby samego dostawcy. Sam model nie jest nowy: wagi udostępniono na Hugging Face 24 sierpnia, a formalna premiera na ModelScope miała miejsce 26 sierpnia. To, co zmieniło się w tym miesiącu, to fakt, że czytelnik może teraz sprawdzić te twierdzenia, zamiast przyjmować je na wiarę.

Zachęta do ponownego przyjrzenia się temu wpisowi pochodziła od @teortaxesTex na X, który zapytał, czy wersja zapowiednia jest po cichu niedoceniana: rzekomo na tym samym poziomie Artificial Analysis co DeepSeek V4 Flash 0731, „prawie 4x mniejsza”, z „prawie 3x mniejszą liczbą aktywnych parametrów”. Dwa z tych trzech twierdzeń nie wytrzymują konfrontacji z opublikowanymi danymi — a korekta działa na korzyść modelu, ponieważ w liczbach, które mają znaczenie, wersja zapowiednia wyprzedza swój obiekt porównania, a nie jest z nim na równi.

Zacznijmy od rozmiaru, gdzie liczby są jednoznaczne. Qwen3.8-Flash-Next przechowuje około 180B parametrów — 125B rdzenia mieszanki ekspertów, osobną tabelę osadzeń n-gramów o rozmiarze 51B i około 4B warstw wielotokenowej predykcji — a aktywuje 6B z nich na token. DeepSeek V4 Flash 0731 przechowuje 284B i aktywuje 13B. To są liczby z karty modelu Qwen i dokumentacji DeepSeek, i to są liczby, które Artificial Analysis podaje na obu stronach modeli. Współczynniki, które z tego wynikają, to 1,6x w przypadku przechowywanych parametrów i 2,2x w przypadku aktywnych parametrów. To autentyczna historia o efektywności i powód, dla którego ta architektura ma znaczenie — ale to nie jest 4x ani 3x. Nie udało nam się znaleźć nigdzie opublikowanej liczby, która potwierdzałaby większe mnożniki. Jeśli intencją była pamięć zajmowana podczas serwowania, a nie liczba parametrów, to ta wartość również nie została opublikowana.

Co ogłoszono?

Alibaba opublikowała architekturę Qwen4, zanim opublikowała model Qwen4. Qwen3.8-Flash-Next — model o otwartych wagach, multimodalny mixture-of-experts zbudowany na architekturze nowej generacji, która będzie napędzać rodzinę Qwen4 — został wydany w dwóch etapach: oficjalne repozytorium Qwen/Qwen3.8-Flash-Next pojawiło się na Hugging Face 24 sierpnia, dwa dni przed wydaniem na ModelScope, na które wskazywał licznik zapowiedzi. Oficjalna premiera na ModelScope miała miejsce 26 sierpnia o 23:00 UTC+08:00, a w tym samym czasie wyceniono udostępnioną wersję Qwen3.8-Flash. Główne twierdzenie z karty modelu, które krąży od tamtej pory, jest takie, że model aktywujący 6 mld parametrów na token bije Claude Opus 4.6 Max w 8 z 9 porównywalnych benchmarków w tabeli samego Alibaby. Pełna rodzina Qwen4, jak powtarza Alibaba, pojawi się później.

Jeśli nie śledzisz w tym miesiącu tempa Alibaby, punktem odniesienia jest Qwen3.8-Max — flagowy model z 2,4 biliona parametrów, wydany 3 sierpnia i udostępniony na licencji open source jako Qwen3.8-2.4T-A95B niecałe dwa tygodnie później. Wagi Qwen3.8-Flash-Next są dostępne niecały miesiąc po tym. To samo laboratorium, które wypuściło model z otwartymi wagami o 2,4 biliona parametrów, teraz udostępnia architekturę kolejnej generacji, zanim flagowy model tej generacji został nawet nazwany.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

Warta ponownego przeczytania jest sposób, w jaki sama Alibaba to ujmuje. Model opisano jako zbudowany na nowej generacji architekturze „która będzie napędzać nadchodzącą rodzinę Qwen4” — i wyraźnie nie jako sam Qwen4. Podany przez Alibabę powód jest taki, że zmiany architektoniczne powinny znaleźć się w rękach społeczności, zanim pojawi się rodzina, aby środowiska uruchomieniowe, kwantyzacje i aplikacje były gotowe, gdy prawdziwy produkt trafi na rynek. To stanowisko marketingowe, ale także zobowiązanie techniczne: najpierw pokazać trudną część, zabrać społeczność ze sobą.

Co rozstrzyga karta modelu, a czego nie:

• Potwierdzone, zgodnie z oficjalną kartą modelu: Qwen3.8-Flash-Next to model o otwartych wagach, multimodalny i typu mixture-of-experts oparty na architekturze Qwen4 — karta nazywa go „eksperymentalnym podglądem architektury, która będzie stanowić podstawę Qwen4.”

• Potwierdzone, zgodnie z kartą modelu i konfiguracją: dwie główne zmiany architektoniczne — Gated Delta Network (GDN) i Qwen Sparse Attention (QSA) — w 48-warstwowej hybrydzie, w której 36 warstw to warstwy z liniową atencją, a 12 to warstwy z pełną atencją.

• Potwierdzone z repozytorium: łącznie 125B parametrów, z 6B aktywowanych na token (512 ekspertów, 10 routowanych plus jeden współdzielony) — Artificial Analysis podaje 180B, gdy uwzględni się osobną 51B tabelę osadzeń n-gramów i warstwy MTP — z natywnym kontekstem 262 144 tokenów, rozszerzalnym do 1 000 000 na licencji Qw​en Community License 1.0.

• Nie jest już niepotwierdzony: model został już niezależnie oceniony, i to dwukrotnie. Tabela Alibaby wciąż jest tabelą samego dostawcy i wciąż nie została odtworzona, ale nie jest już jedynym dowodem w pokoju.

Pierwsze niezależne wyniki już są — i mówią „z przodu”, a nie „na równi”

Artificial Analysis udostępniło Intelligence Index v4.3 7 września, a ponowne punktowanie jest powodem, dla którego cokolwiek z tego jest w ogóle porównywalne. Aktualizacja v4.3 zastąpiła Terminal-Bench v2.1 znacznie trudniejszym Terminal-Bench v4.0 i zamieniła τ³-Banking na AutomationBench-AA, benchmark agentowych przepływów pracy zbudowany z Zapier na prywatnym, odłożonym zbiorze testowym liczącym 657 zadań. Waga prywatnego zbioru odłożonego wzrosła do 45%. Deklarowanym celem było powstrzymanie czołówki przed manipulowaniem indeksem, a wpływ na wyniki był duży: GPT-6 Astra i Claude Fable 5.1, dwaj liderzy, oba osiągnęły 53, mimo że na starej skali uzyskiwały wyniki w sześćdziesiątkach.

To ma znaczenie, gdy czyta się liczby społeczności. Liczby „56 kontra 52”, które krążyły dla Qwen3.8-Flash-Next i DeepSeek V4 Flash 0731 na początku września, zostały obliczone na indeksie pre-v4.3; w v4.3 ta para plasuje się na 40 i 35. Cytowanie jednego zestawu przeciw drugiemu to porównywanie dwóch różnych egzaminów.

W obecnym indeksie oto, jak faktycznie wypadają oba modele w porównaniu we własnych ewaluacjach Artificial Analysis:

• Indeks Inteligencji — Qwen3.8-Flash-Next 40 (5. na 113 w klasie) vs DeepSeek V4 Flash 0731 (rozumowanie, maksymalny wysiłek) 35 (9. na 113).

• Agentowa praca wiedzowa — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.

• Terminal i kodowanie — Terminal-Bench v4.0 25% vs 12%; SciCode 51% vs 50%.

• Rozumowanie ogólne i naukowe — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.

• Przypominanie faktów a konfabulacja — AA-Omniscience −10 kontra −14, czteropunktowa przewaga Qwen preview.

• Cena — 0,15 USD za milion tokenów wejściowych / 0,47 USD za milion tokenów wyjściowych vs 0,44 / 1,32 USD; uśredniona cena 0,0882 USD za milion tokenów vs 0,2298 USD. Koszt na zadanie Intelligence Index: 0,37 USD vs 0,22 USD.

• Szybkość i opóźnienie — 53 tokeny wyjściowe na sekundę vs 210; czas do pierwszego tokenu 2,80 s vs 0,98 s; odpowiedź end-to-end 49,76 s vs 12,88 s; czas na zadanie 1 572,60 s vs 221,65 s.

• Zużycie tokenów — 108 tys. tokenów wyjściowych na zadanie w porównaniu z 62 tys., z czego 72 tys. to tokeny rozumowania w porównaniu z 45 tys. Artificial Analysis nazywa wersję zapoznawczą „bardzo rozwlekłą” i „wolniejszą niż przeciętna”.

• Kontekst i rozmiar — 256k tokenów vs 1,000k; 180B łącznie / 6B aktywnych vs 284B / 13B.

Czytane razem, to ostrzejsza odpowiedź niż „ten sam poziom". Qwen3.8-Flash-Next wygrywa argument o dokładność i wydajność na niemal każdej osi, którą mierzy Artificial Analysis — to model z wyższym wynikiem, jest mniejszy, a koszt na token ma około trzykrotnie niższy. DeepSeek V4 Flash 0731 wygrywa z kolei bezapelacyjnie argument o produkcję: czterokrotnie większa przepustowość, jedna czwarta opóźnienia end-to-end, siedmiokrotnie krótszy czas rzeczywisty na ukończone zadanie i czterokrotnie większe okno kontekstu. A jeśli chodzi o koszt na ukończone zadanie — liczbę, która przetrwa gadatliwość tokenów — Deep​Seek jest tańszym modelem: 0,22 USD wobec 0,37 USD, mimo wyższej ceny katalogowej. Jeśli „niedoceniany" znaczy „lepszy, niż wynika to z jego reputacji, pod względem jakości na parametr", etykieta jest zasadna. Jeśli znaczy „powinieneś uruchamiać właśnie to", kolumny szybkości i opóźnienia mówią co innego.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Istnieją również niezależne dowody poza Artificial Analysis. Zewnętrzne środowisko testowe smf-bench opublikowało 5 września przebieg „Official A”: Qwen3.8-Flash-Next w kwantyzacji NVFP4 firmy NVIDIA na pojedynczym DGX Spark, z wyłączonym trybem myślenia, uzyskał 137 z 157 (87,3%) oraz bezbłędny wynik 30 na 30 w sekcji kodowania, wobec 117 z 157 dla przebiegu DeepSeek V4 Flash Vision-Exp na dwóch Sparkach w tym samym środowisku testowym z 157 testami. To jedno środowisko testowe na jednej klasie maszyn i nie zastępuje szeroko zakrojonej ewaluacji — ale jest drugim punktem danych wskazującym ten sam kierunek, a pochodzi od kogoś, kto nie ma żadnego interesu związanego z którymkolwiek z dostawców.

Czym tak naprawdę jest architektura Qwen4

Tę historię niosą dwa mechanizmy. Pierwszy, GDN — Gated Delta Network — to warstwa uwagi liniowej Aliba​ba. Tam, gdzie standardowy transformer utrzymuje pamięć podręczną klucz-wartość, która rośnie wraz z długością sekwencji, warstwa GDN utrzymuje stan rekurencyjny o stałym rozmiarze i aktualizuje go za pomocą wyuczonej reguły bramkowania; jej rodowód wiedzie przez DeltaNet i Mamba-2. Korzyścią jest to, co od Qwen3-Next po cichu napędza linię Qw​en: długie konteksty pozostają tanie, ponieważ stan nie rośnie, a mniejszość warstw pełnej uwagi pozostaje w mieszance, aby wykonywać precyzyjne wyszukiwanie, do którego uwaga liniowa się nie nadaje. W obecnej generacji ta mieszanka wynosi około trzech warstw GDN na każdą warstwę pełnej uwagi — społecznościowa analiza checkpointu Qwen3.8-2.4T-A95B wykazuje 69 warstw GDN wobec 23 warstw uwagi. Qwen3.8-Flash-Next pokazuje ten sam podział trzy do jednego: 36 warstw uwagi liniowej wobec 12 warstw pełnej uwagi.

Drugi, QSA — Qwen Sparse Attention — jest naprawdę nowym elementem, a jego publiczny opis wciąż jest skąpy: karta modelu dodaje, że działa na poziomie mikro-bloków z budżetem 512 bloków / 2048 tokenów, ale nie istnieje jeszcze pełne opracowanie techniczne. Ten niedobór szczegółów sam w sobie jest częścią schematu. Zapowiedź Qwen3-Next pod koniec 2025 r. wprowadziła Gated DeltaNet z tak samo skąpą dokumentacją, a architektura została w pełni opisana dopiero wtedy, gdy przyjęła ją seria Qwen3.5. Dla czytelnika praktyczny wniosek jest za każdym razem taki sam: kanarek architektury pojawia się pierwszy, a dokumentacja i modele produkcyjne pojawiają się później.

Scenariusz, który już raz zadziałał.

Aliba​ba ma już za sobą dokładnie to samo zagranie i ono zadziałało. Pod koniec 2025 r. Qwen3-Next zaprezentował Gated DeltaNet oraz hybrydę uwagi liniowej i pełnej. Gdy seria Qwe​n3.5 trafiła na rynek, przyjęła ten plan na szeroką skalę — a hybryda utrzymuje się w generacji Qwen3.8 od tamtej pory, w tym w flagowym modelu 2.4T. Precedens ma tu znaczenie z powodu czasu, jaki ze sobą niesie. Pełnej rodziny Qwen4 należy spodziewać się dopiero po tej zapowiedzi, a nie w jej ramach; jeśli luka w przypadku Qwen3-Next jest jakąkolwiek wskazówką, odległość między „oto architektura” a „oto rodzina” mierzy się w miesiącach. Nic w karcie modelu tego nie potwierdza — to wniosek wyciągnięty ze schematu, który Aliba​ba powtórzyła już dwukrotnie.

Czego wciąż nie wiemy

Niewiadome się zmniejszyły, ale nie zniknęły:

• Tabela benchmarków dostawcy nadal pochodzi od dostawcy. Artificial Analysis oceniło teraz ten model niezależnie, co rozwiązuje największą lukę w relacjonowaniu premiery — ale sztandarowe twierdzenie samej firmy Aliba​ba, że model przewyższa Claude Opus 4.6 Max w 8 z 9 porównywalnych benchmarków, opiera się na własnych wewnętrznych ewaluacjach firmy Aliba​ba (CoWorkBench, JobBench, AndroidWorld) obok publicznych, a żadna z nich nie została odtworzona przez stronę trzecią.

• Czy wersja zapoznawcza to ten sam model co wersja udostępniana. Karta pozycjonuje Qwen3.8-Flash-Next jako eksperymentalną wersję zapoznawczą z otwartymi wagami, podczas gdy produkcyjny wariant udostępniany — Qwen3.8-Flash od Qwen Cloud — dodaje domyślny kontekst o rozmiarze 1 000 000 tokenów oraz wbudowane narzędzia. Nadal nie podano, czy ten udostępniany model to ta sama architektura w większym oknie kontekstu, a niezależne wyniki powyżej dotyczą wersji zapoznawczej z otwartymi wagami, a nie udostępnianego modelu API.

• Licencja jest znana i jest prawdziwą licencją: Qwen Community License 1.0 zezwala na użycie komercyjne, w tym sprzedaż utworów pochodnych, ale wymaga oddzielnej umowy komercyjnej z Alibaba, jeśli prowadzisz działalność typu Model-as-a-Service lub asystenta AI w pracy po przekroczeniu określonego progu przychodów i miesięcznej liczby aktywnych użytkowników. Nie jest tym samym co uzależniona od progu przychodów licencja Qwen3.8-Max, ale warto ją przeczytać przed budowaniem na wagach.

• Jeden raport z praktyki wart odnotowania: wpis z 6 września o community buildzie NVFP4 odnotowuje awarię wywoływania narzędzi z ograniczeniami gramatycznymi, gdy jednocześnie włączone są tryb thinking i przewidywanie wielu tokenów, której źródło wskazano w ścieżce dekodowania z ograniczeniami xgrammar. To błąd czasu wykonania w skwantyzowanym community buildzie, a nie właściwość modelu — ale jeśli Twoje środowisko ewaluacyjne opiera się na wywołaniach narzędzi z ograniczeniami gramatycznymi, to pierwsza rzecz, którą należy przetestować.

Rodzina iterująca w dwutygodniowym cyklu

Rytm wokół tego jest osobną historią. Qwen3.8-Max, flagowy model z 2,4 biliona parametrów, wydano 3 sierpnia; model o otwartych wagach Qwen3.8-2.4T-A95B pojawił się 12–13 sierpnia; darmowy Qwen3.8-27B na licencji Apache-2.0 trafił na rynek kilka dni później; a teraz, przed końcem miesiąca, prezentowana jest architektura następnej generacji — i tydzień później niezależnie zbenchmarkowana. Żadne inne laboratorium nie prowadzi obecnie iteracji w takim tempie. Dla czytelnika wybierającego modele praktyczną konsekwencją jest to, że „najlepszy Qwen” to ruchomy cel — a różnica między generacjami nadchodzi szybciej, niż otaczający ekosystem zwykle się dostosowuje. Coraz bardziej uzasadnionym posunięciem staje się kupowanie decyzji, a nie modelu.

Co teraz powinien zrobić programista

Liczby dotyczące wydajności zmieniają kalkulację lokalnego serwowania bardziej niż sam start. Model z 6B aktywnych parametrów, który uzyskuje 40 w obecnym indeksie, da się skompresować: oficjalna kwantyzacja NVFP4 firmy NVIDIA to ta, której użyto w uruchomieniu smf-bench z 5 września, a społecznościowe kompilacje NVFP4 i FP8 poza nią są już w obiegu, co sprawia, że wdrożenie modelu przechowywanego jako 180B na poziomie pojedynczego GPU jest w ogóle wiarygodne. Zastrzeżenie pozostaje bez zmian — to niesprawdzona wersja zapoznawcza, tabela dostawcy nie została odtworzona, a kształt niezależnych wyników (mocne w pracy z wiedzą i zadaniach terminalowych, słabsze w generowaniu repozytoriów w długim horyzoncie i jednorazowych wskaźnikach zdawalności agentów) oznacza, że słabości modelu ujawniają się dokładnie tam, gdzie zachodzą zmiany w kodzie produkcyjnym. Uruchom na nim kopię rzeczywistego obciążenia o niskim ryzyku, zanim dotknie czegokolwiek, co ma znaczenie, i pozwól automatycznemu przełączaniu awaryjnemu pochłonąć momenty, gdy wersja zapoznawcza zachowuje się źle.

W kwestii ceny obraz, który przy premierze był mglisty, jest teraz konkretny. Artificial Analysis podaje stawkę serwowania wersji preview na 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, wobec 0,44 USD i 1,32 USD dla DeepSeek V4 Flash 0731 — czyli ten sam rząd wielkości co serwowany wariant Qwen3.8-Flash, który Qwen Cloud wycenia na 1 ¥ i 3 ¥ (około 0,16 USD i 0,47 USD). Wariant produkcyjny to ten, który faktycznie możesz wywołać już dziś: jest tu kierowany jako qwen/qwen3.8-flash, a OrcaRouter przekazuje cenę katalogową dostawcy przy 0% marży, więc gdy Alibaba zmieni tę liczbę, endpoint zmieni się wraz z nią tego samego dnia. To samo dotyczy modelu porównawczego w tym artykule — DeepSeek V4 Flash 0731 jest kierowany jako deepseek/deepseek-v4-flash-0731 po cenie katalogowej dostawcy, co sprawia, że część powyższego zestawienia dotyczącą kosztu na token można przetestować na własnym ruchu, a nie na liczbach tokenów z benchmarku. To, co nie jest tu kierowane, to sam preview Flash-Next z otwartymi wagami: aby używać go dziś, pobierasz wagi i serwujesz je samodzielnie, co jest dokładnie powodem, dla którego opisana powyżej historia kwantyzacji ma większe znaczenie niż cena katalogowa. Poprzeczka, którą ta generacja musi przeskoczyć, jest wciąż widoczna na tym samym endpoincie: Qwen3.8-Max (qwen/qwen3.8-max) plasuje się na poziomie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, również przekazywanym po cenie katalogowej dostawcy.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Praktyczna sekwencja niewiele się zmieniła, ale zaufanie do niej już tak. Jeśli chcesz wariant produkcyjny udostępniany jako usługa bez pobierania 100 GB wag, Qwen3.8-Flash można już wywoływać w cenie katalogowej. Jeśli chcesz architekturę — GDN, QSA, tabelę n-gramów, triki z offloadem — wagi są do pobrania, a środowiska uruchomieniowe są gotowe: vLLM obsługuje go od pierwszego dnia dzięki ścieżce offloadu, która utrzymuje 51-miliardową tabelę embeddingów n-gramów w pamięci hosta, a nie na stałe w VRAM, SGLang i TensorRT-LLM znajdują się na liście Day 0 NVIDII, a biblioteka Ollamy zawiera kompilację MLX, którą możesz pobrać na Apple Silicon. Jedyną rzeczą, którą trzeba przestać robić, jest traktowanie modelu jako niewiadomej, jeśli chodzi o jakość. Został już poddany pomiarom i wypadł dobrze.

Co obejrzeć dalej

• Czy niezależne liczby się utrzymają w miarę dojrzewania indeksu. Wynik 40 Qwen3.8-Flash-Next wiąże się z nietypowo wysokim rachunkiem za tokeny — spalił 245 mln tokenów podczas przebiegu indeksu wobec mediany 140 mln — a sama Artificial Analysis w swojej notatce nazywa go „bardzo gadatliwym”. Wynik uzyskany dzięki dłuższemu rozumowaniu wciąż jest wynikiem, ale to coś, co zmienia się, gdy zmienia się ewaluacja. Następna rewizja indeksu będzie prawdziwym testem tego, czy 40 było poziomem, czy lokalnym maksimum.

• Czy udostępniany Qwen3.8-Flash jest oceniany osobno. Każda niezależna liczba w tym tekście dotyczy wersji preview z otwartymi wagami. Wariant produkcyjny z kontekstem 1M i wbudowanymi narzędziami nie ma własnego niezależnego wyniku, a jeśli to ta sama architektura w dłuższym kontekście, to tania ewaluacja, którą ktoś powinien opublikować.

• Jak w praktyce sprawdza się wsparcie dla serwowania day-0 — podawane przez dostawcę wartości przepustowości GB300 wciąż są deklaracjami dostawcy, a konfiguracje TP4 expert-parallel i KV-offload są jeszcze na tyle nowe, że bywają kruche.

• Jak długo Alibaba będzie czekać, zanim pełna rodzina Qwen4 podąży za wersją zapoznawczą.

Część tej historii dotycząca tego, co wiemy do tej pory, została już w dużej mierze zamknięta. Karta specyfikacji jest publiczna, wagi można pobrać, architektura jest potwierdzona, serwowany wariant Qwen3.8-Flash działa w hostowanych API w cenie katalogowej, a model został niezależnie oceniony przez dwie odrębne strony — przy czym mniejszy model wygrywa w kwestii jakości, a większy w kwestii przepustowości. Otwarte pozostaje pytanie, czy 6B-active preview generalizuje poza benchmarki, względem których był dostrajany, oraz jak długo Alibaba czeka, zanim pojawi się pełna rodzina Qwen4. To ostatnie pytanie wciąż jest tym, na które wydanie nie daje odpowiedzi, i wciąż jest tym, które będzie miało największe znaczenie.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie