Wygenerowana karta tytułowa zatytułowana „Qwen 4.5 i Qwen 5: od 5 do 10 bilionów parametrów", z podtytułem „Zakres roadmapy, nie specyfikacja", oraz trzy karty o treści „Cel roadmapy / 5–10 bln parametrów", „Flagowy model w sprzedaży / Qwen3.8-Max 2.4T" i „Data premiery / nie ogłoszono". W stopce widnieje wiersz: „Zgodnie z komunikatem prasowym Alibaby z 22 września 2026 r.; karta modelu nie została opublikowana". Płaski, wektorowy styl edytorski na białym tle z niebiesko-cyjanowym gradientem i logo OrcaRouter złożonym w prawym dolnym rogu.
Guides & Insights

Qwen 4.5 i Qwen 5 mają docelowo od 5 do 10 bilionów parametrów: co Alibaba powiedziała, a czego nie powiedziała

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Na swojej konferencji Apsara w Hangzhou 22 września 2026 roku firma określiła rozmiar generacji po następnej. Qwen 4.5 i Qwen 5 serie są „prognozowane do skalowania do 5–10 bilionów parametrów” według brzmienia własnego angielskiego komunikatu prasowego firmy — zapis w roadmapie, a nie specyfikacja. Żaden z modeli nie ma daty wydania, karty modelu, identyfikatora API, ceny ani opublikowanego wyniku benchmarku, co oznacza, że nic związanego z którymkolwiek z nich nie można dziś wywołać. Flagowy model, który można faktycznie kupić, to Qwen3.8-Max, ogólnie dostępny od 3 sierpnia 2026 roku, z 2,4 biliona parametrów. W dniach po konferencji to zdanie z roadmapy zostało spłaszczone w wielu publikacjach do twierdzenia, że nadchodzi model o 10 bilionach parametrów — twierdzenia silniejszego i prostszego niż to, które przedstawiła firma. Odległość między tymi dwoma zdaniami to około rok planowania.

Twierdzenie i jego wersja, która się rozprzestrzeniła

Na scenie powiedziano dwie rzeczy i warto je rozdzielić, ponieważ niosą ze sobą bardzo różną ilość informacji. Pierwsza to aktualizacja statusu: Qwen 4 jest trenowany, na nowej architekturze. Druga to plan rozwoju: serie Qwen 4.5 i Qwen 5 mają osiągnąć przedział parametrów od 5 do 10 bilionów.

Angielska informacja prasowa Alibaby przypisuje jedno i drugie firmie, a nie wskazanemu z nazwiska członkowi kierownictwa. Relacja z konferencji, która idzie dalej, przypisuje plan działania Liu Da Yihengowi, który kieruje projektem dużego modelu językowego Qwen w Alibaba Token Hub, i podaje jego ujęcie, że skalowanie jest kluczową ścieżką prowadzącą do sztucznej superinteligencji. To ujęcie stanowi kontekst, w jakim podano liczbę parametrów, i wyjaśnia, dlaczego liczba ta jest przedziałem, a nie celem.

To, co wówczas krążyło, to górna granica przedziału. Angielskie nagłówki, które się pojawiły, obejmują co najmniej jeden opisujący zapowiedziany model o 10 bilionach parametrów oraz kilka opisujących plan modelu o 5 do 10 bilionów parametrów. Obie wersje to możliwe do obrony interpretacje slajdu. Żadna nie jest specyfikacją, a różnica ma znaczenie dla każdego, kto musi planować, mając to na względzie.

5 bilionów to cel jednego pokolenia, a 10 bilionów – innego.

Najbardziej przydatną rzeczą, którą trzeba właściwie zrozumieć w tym ogłoszeniu, jest to, że 5–10 bilionów to przedział obejmujący dwie generacje, a nie jeden model o szerokiej tolerancji. Samo zdanie firmy Alibaba wiąże ten przedział z „nadchodzącą serią modeli Qwen 4.5 i Qwen 5” — serią rozumianą jako liczba mnoga, ujmowaną łącznie.

Chińskojęzyczne relacje z tej samej konferencji znów są precyzyjne w innym kierunku: nagłówki opisują modele po Qwen 4.5 jako rozszerzające się do przedziału 5–10 bilionów. Taka interpretacja umieszcza również górny kraniec 10 bilionów poza Qwen 4.5. Jedynym stwierdzeniem, co do którego wszystkie źródła się zgadzają, jest to, że przedział obejmuje zakres od Qwen 4.5 do Qwen 5. Przypisanie 10 bilionów konkretnie do Qwen 5 to wniosek, który stał się nagłówkiem, a nie cytatem.

Dla skali — a to jedyne liczby w tej historii, które są opublikowane, a nie prognozowane:

• Od 5 do 10 bilionów — zakres parametrów, który komunikat prasowy Alibaby przypisuje do serii Qwen 4.5 i Qwen 5

• 2,4 biliona — łączna liczba parametrów Qwen3.8-Max, flagowego modelu w bieżącej ofercie, zgodnie z jego oficjalną kartą modelu

• 95 miliardów — liczba aktywnych parametrów Qwen3.8-Max na token, wartość, która określa koszt obsługi tokena

• 10 bilionów — górna granica tego przedziału i jedyna jego część, która trafiła do większości angielskich nagłówków

• 0 — liczba opublikowanych specyfikacji, dat wydania, cen, okien kontekstowych lub wyników benchmarków dla Qwen 4.5 lub Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

Numer parametru, który ma znaczenie, to ten, którego nikt nie opublikował.

Parametry całkowite to liczba, którą laboratorium decyduje się podać. Parametry aktywne to liczba, której potrzebuje kupujący, a roadmapa nie zawiera ani jednej.

Qwen3.8-Max to model typu mixture-of-experts z łączną liczbą 2,4 biliona parametrów i 95 miliardami aktywnych na token. To współczynnik aktywacji wynoszący około 4 procent: model przechowuje dużą część wiedzy w wagach, których nie odczytuje przy danym tokenie, a płaci za obliczenia tylko za niewielki ich wycinek. Łączna liczba parametrów mówi, ile pamięci zajmuje całość i jak dużej maszyny potrzebujesz. Aktywne parametry mówią, ile płacisz przy każdej odpowiedzi.

Rozciągnij ten stosunek na przyszłość, a kształt problemu staje się widoczny. Model o 10 bilionach parametrów zbudowany przy tych samych 4 procentach aktywacji aktywowałby rzędu 400 miliardów parametrów na token — ponad czterokrotnie więcej niż aktywuje obecnie Qwen3.8-Max. To arytmetyka oparta na podanym założeniu, a nie twierdzenie o Qwen 5: zwiększ rzadkość, a liczba aktywnych parametrów spadnie; zmniejsz ją, a wzrośnie. Ale to właśnie ta arytmetyka decyduje, czy model o 10 bilionach parametrów jest produktem w ofercie, czy artefaktem badawczym, i to jest obliczenie, do którego zachęca nagłówek o 5 do 10 bilionów, a potem pozostawia je niedokończonym.

To również moment, w którym ekonomia routingu przestaje być abstrakcyjna. W OrcaRouter cena katalogowa dostawcy jest przekazywana z 0% narzutu, więc obniżka ceny dostawcy w warstwie Qwen obowiązuje na Twoim kluczu tego samego dnia, a nie przy odnowieniu. Generacja, której koszt obsługi jest naprawdę niepewny, to dokładnie ten przypadek, w którym takie przekazanie ceny jest warte więcej niż rabat wynegocjowany z góry względem liczby, której nikt nie opublikował.

Ogłoszenie chipu to rzeczywisty harmonogram.

Alibaba ogłosiła plan rozwoju modeli i nowy akcelerator w tym samym komunikacie prasowym, a te dwie kwestie są ze sobą bardziej powiązane, niż sugeruje komunikat.

Zhenwu V900 firmy T-Head to procesor do uczenia i wnioskowania z 216 GB pamięci i 1200 GB/s przepustowości międzyukładowej, natywnym wsparciem dla FP8 i FP4 oraz deklarowaną trzykrotnie wyższą wydajnością od swojego poprzednika, Zhenwu M890, wydanego w maju. Produkcja masowa i premiera komercyjna są zaplanowane na pierwszy kwartał 2027 roku. Towarzyszący serwer supernode obsługuje klastry nawet do 500 000 kart, a T-Head twierdzi, że linia Zhenwu obsłużyła ponad 650 klientów.

Przeczytaj oba komunikaty razem, a sekwencja staje się czytelna. Trenowanie i udostępnianie modelu typu mixture-of-experts w skali 10 bilionów to problem połączeń, zanim staje się problemem obliczeniowym, ponieważ równoległość ekspertów oznacza ciągłe przenoszenie aktywacji między układami, a 1200 GB/s przepustowości międzyukładowej to liczba, która rozstrzyga, czy jest to w ogóle wykonalne. Krzem dostępny według takiego harmonogramu przesuwa najwcześniejsze prawdopodobne okno na uruchomienie treningu o takiej skali dopiero na drugą połowę 2027 roku — a nawet wtedy samo wysłanie układu nie mówi nic o tym, że trening dobiegnie końca. Alibaba połączyła oba tematy, umieszczając je w jednym komunikacie; samo to powiązanie jest naszą interpretacją i zostało tak oznaczone.

Horyzont czasowy samej spółki jest z tym spójny. Dyrektor generalny Eddie Wu wyznaczył cel ponad 20 gigawatów globalnej moc centrów danych Alibaba Cloud do 2032 roku — cel dotyczący moc, a nie moc już wdrożoną, i perspektywę ponadpięcioletnią, a nie perspektywę kolejnego kwartału.

Twierdzenia o samodoskonaleniu podtrzymujące roadmapę

Powód, dla którego plan wart 5–10 bilionów w ogóle można poddać dyskusji, a nie tylko uznać za kosztowny, to rekurencyjne samodoskonalenie: jeśli pipeline treningowy sam się usprawnia, wymagana moc obliczeniowa na generację spada, a granica możliwości przesuwa się bliżej poziomu przystępnego cenowo. To kluczowe twierdzenie leżące u podstaw roadmapy, a zarazem najmniej weryfikowalna rzecz, jaką powiedziała Alibaba.

Co podała firma: Qwen3.8-Max ukończył 33 cykle iteracyjne w ciągu około miesiąca w pełni zautomatyzowanej pracy obejmującej projektowanie potoków, walidację danych i diagnostykę błędów, i podniósł swój wynik Artificial Analysis z 40 do 45. W eksperymencie dotyczącym projektowania układów scalonych model poświęcił ponad 60 godzin na samodoskonalenie w całym cyklu projektowym, wykonał ponad 10 000 wywołań narzędzi automatyzacji projektowania elektronicznego i zmniejszył powierzchnię układu o 42 procent bez utraty wydajności. Jeden z raportów z konferencji opisuje również 96-procentową poprawę przepustowości wnioskowania uzyskaną dzięki autonomicznemu dostrojeniu nowego GPU T-Head.

Są to informacje zgłoszone przez dostawcę i nie zostały niezależnie zreplikowane. To nie jest formalność — autonomiczna pętla, która ocenia własne eksperymenty, mierzy się z własnym oceniającym, a świat zewnętrzny nie ma sposobu, by sprawdzić kryteria oceny. Relacje z konferencji na ogół o tym mówiły i czytelnicy powinni tak zakładać.

W tej samej tezie kryje się druga pułapka i dotyczy ona etykiet, a nie uczciwości. Alibaba nie podała, względem której wersji Artificial Analysis Intelligence Index mierzony jest jej ruch z 40 na 45, a ten indeks został przebudowany od premiery tego modelu. Obecna strona Artificial Analysis dla Qwen3.8 Max (0902) wskazuje 45 — niezależny wynik, według wersji obowiązującej dziś. Odczyt zarejestrowany dla tego samego modelu w połowie sierpnia, według obowiązującej wtedy wersji, wynosił 56. 45 i 56 to nie ten sam pomiar w tych samych jednostkach, a odjęcie jednego od drugiego daje liczbę, która nic nie znaczy. Czego strona nie zawiera, to 40, od którego Alibaba twierdzi, że się poprawiła: punkt wyjścia tej delty pochodzi od samej firmy, a tylko punkt końcowy przypadkiem znajduje się tam, gdzie obecnie jest niezależny odczyt. Czytaj ten ruch jako kierunek, nie jako pomiar.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

Co Alibaba faktycznie wypuścił na tej samej konferencji

Pomijając plan rozwoju, konferencja i tak zawierała prawdziwe premiery – wszystkie multimodalne:

• Qwen3.8-LiveTranslate — tłumaczenie symultaniczne, z opóźnieniem (LAAL) skróconym o niemal 20 procent, z 2,8 sekundy do 2,3 sekundy

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS i Qwen-Audio-3.1-Realtime — odświeżony zestaw narzędzi do przetwarzania mowy

• Qwen-Audio-3.1-TTS-Next — filmowe pejzaże dźwiękowe, które łączą dialogi i tło ze scenariusza tekstowego, przeznaczone do audiobooków, filmu i telewizji, podcastów i gier

• Qwen-Image 3.1 — generowanie obrazów dostrojone do kreatywnego projektowania i marketingu e-commerce, planowane na późniejszą część tego roku, z natywnym generowaniem przezroczystego tła

• Qwen Intelligence — pełnostackowa platforma agentowa skierowana do producentów smartfonów

Każda pozycja na tej liście to produkt z oknem dostawy. Twierdzenie o skali frontier to jedyna pozycja w agendzie bez przypisanej daty, a ten kontrast nie jest przypadkiem: wdrożenie warstwy multimodalnej finansuje rok roadmapy, a roadmapa sprawia, że kolejna runda finansowania albo następny kontrakt chmurowy staje się opowieścią, a nie arkuszem kalkulacyjnym. Obie te rzeczy są realne. Tylko jedno z nich jest czymś, co można nazwać.

Co można dziś wywołać i co musi się zmienić, aby to się zmieniło

Generacja Qwen 3.8 pozostaje całością linii dostępnej w sprzedaży. Qwen3.8-Max jest ogólnie dostępny od 3 sierpnia 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, stałej dla całego kontekstu o długości 1 000 000 tokenów, bez dopłaty za długie prompty. Jego wagi opublikowano 12 sierpnia 2026 r. jako Qwen3.8-2.4T-A95B w formatach BF16 i FP8 na podstawie niestandardowej licencji Qwen. Tabela wyników producenta jest mocna i nieaudytowana — Terminal-Bench 2.1 na poziomie 86,6, GPQA Diamond 92,6, OSWorld-Verified 86,1, wszystkie to własne dane Alibaby — Niezależny obraz jest mniej pochlebny niż ten od producenta: Artificial Analysis plasuje Qwen3.8 Max (0902) z wynikiem Intelligence Index 45, na 24. miejscu na 212 modeli, przy zmierzonym koszcie 5,41 USD na zadanie Intelligence Index i 39,2 tokenów wyjściowych na sekundę — 159. miejsce na 212, blisko wolnego końca stawki. Ta sama strona podaje okno kontekstowe jako 984k w porównaniu z 1 000 000 na naszej własnej stronie modelu — różnica warta poznania przed zaplanowaniem zadania z długim kontekstem. Wynik klasy frontier, prędkość w środku stawki: to szczera ocena flagowego modelu w sprzedaży i punkt odniesienia, który każdy Qwen 4.5 musi jednocześnie pobić w obu wymiarach.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

OrcaRouter obsługuje rodzinę Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash i qwen3.8-27b — w jednym punkcie końcowym zgodnym z OpenAI, obok ponad 200 innych modeli, co oznacza, że poziom Qwen 4.5 byłby zmianą identyfikatora modelu na istniejącym kluczu, a nie nową umową z dostawcą, nowym rachunkiem i nowym SDK. Gdy taki model się pojawi, to właśnie w tym katalogu się znajdzie. Dziś nie ma w nim ani Qwen 4.5, ani Qwen 5, ponieważ żaden z nich nie został wydany — i żadna liczba publikacji o planach rozwojowych tego nie zmieni.

Praktyczne zastosowanie takiej mapy drogowej jest przeciwieństwem planu migracji. Jeśli wariant Qwen 4.5 ostatecznie okaże się realny dla twojego obciążenia, tanim sposobem, by się o tym przekonać, jest skierowanie części rzeczywistego ruchu do niego za automatycznym fallbackiem — tak by model, który okaże się wolny, drogi lub gorszy od obecnego, kosztował cię procent jednego obciążenia, a nie jedną czwartą całości. Właśnie do tego służy failover, a nieprzetestowany model frontier mający zaledwie kilka dni to najoczywistszy przypadek, by z niego skorzystać.

Na co patrzeć, a w co jeszcze nie wierzyć

Punkt na roadmapie staje się wydaniem, gdy pojawi się niewielki zestaw konkretnych elementów. Karta modelu zawierająca całkowitą liczbę parametrów, liczbę aktywnych parametrów i okno kontekstowe. Identyfikator API, który można przekazać w żądaniu. Wagi w hubie modeli. Wpis w niezależnym rankingu z dołączoną datą. Cena. Każdy z tych elementów to sygnał; większość z nich razem oznacza premierę.

Rzeczy, które nie są premierą, choć mogą wyglądać technicznie: wzmianka z konferencji; pull request frameworka do serwowania dodający gałąź architektury dla eksperymentalnego builda Qwen, co jest pracą nad silnikiem w czyimś stosie inferencji, a nie modelem, który można wywołać; datowany identyfikator snapshotu dla generacji, która już trafiła na rynek; oraz wpis w mediach społecznościowych parafrazujący uwagę ze sceny. Sygnałem, który doprowadził do powstania tego artykułu, był ostatni z nich, a powód, dla którego warto było o tym napisać, jest taki, że leżące u podstaw twierdzenie można sprawdzić w oparciu o własny komunikat prasowy Alibaby — z którego pochodzą przedział od 5 do 10 bilionów, status Qwen 4 i dane RSI. Sygnał wskazywał na tę historię; nie jest nią.

Pytanie na najbliższą przyszłość jest węższe, niż sugerują nagłówki. Alibaba poinformowała, że Qwen 4 jest w fazie treningu, co w sekwencji stawia Qwen 4 przed zarówno 4.5, jak i 5 — więc następną rzeczą, na którą warto patrzeć, nie jest model o 10 bilionach parametrów, lecz to, czy Qwen 4 pojawi się z kartą modelu, ceną i punktem końcowym, oraz kiedy. Dopóki któryś element tego łańcucha się nie pojawi, uczciwe stanowisko wobec zakresu od 5 do 10 bilionów jest takie, że to kierunek rozwoju, ujawniony oficjalnie, bez przypisanej do niego specyfikacji i bez daty. Planuj z myślą o Qwen3.8-Max, obserwuj przedział 4.5–5 jako tezę o skalowaniu, a nie produkt, a każdą liczbę parametrów, jaką zobaczysz dla modelu bez karty modelu, traktuj jako prognozę.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie