Wygenerowana redakcyjna karta główna zatytułowana „Ling-3.1-flash vs Qwen3.8-Flash” z podtytułem „Dwie odpowiedzi na to samo pytanie: jak zbudować szybki poziom?” Lewy panel z nagłówkiem „Skaluj w górę i ogłoś” zawiera podpis „~560B łącznie · ~25B aktywnych · kontekst 1M” oraz etykietę o treści „wagi: wkrótce”. Prawy panel z nagłówkiem „Zmniejsz i wypuść” zawiera „125B łącznie · 6B aktywnych · zapowiada Qwen4” oraz etykietę o treści „wagi: na Hugging Face”.
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Dwa sposoby budowania szybkiej warstwy, a tylko jeden z nich trafia na rynek

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa chińskie laboratoria przyjrzały się tej jesieni temu samemu problemowi — jak zbudować tani, szybki model, który jest wystarczająco dobry, by działać w pętli agenta — i doszły do przeciwnych wniosków. Ling-3.1-flash, ogłoszony przez Ant Group 30 września 2026 r., to liczący około 560 miliardów parametrów mixture-of-experts aktywujący około 25 miliardów parametrów na token, z oknem kontekstowym podawanym jako do 1 miliona tokenów i deklarowanym zamiarem udostępnienia jako open source „wkrótce”. Qwen3.8-Flash, wydany przez zespół Qwen firmy Alibaba 26 sierpnia 2026 r., to 125-miliardowy multimodalny mixture-of-experts aktywujący około 6 miliardów parametrów na token, którego wagi są już na Hugging Face pod nazwą Qwen3.8-Flash-Next, model produkcyjny działający na żywo w API QwenCloud w cenie 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, oraz wsparcie od dnia zerowego w SGLang. Jedno laboratorium zwiększyło skalę i ogłosiło. Drugie zmniejszyło skalę i wdrożyło. Ta różnica jest bardziej pouczająca niż jakikolwiek benchmark opublikowany przez którekolwiek z tych laboratoriów.

To także powód, dla którego to porównanie trzeba czytać uważnie. Ling-3.1-flash nie ma wag, licencji, karty modelu, ceny API ani niezależnej oceny; cały opublikowany materiał to post z ogłoszeniem, wykres benchmarku dostawcy i miejsce we własnym produkcie Ling Studio firmy Ant. Qwen3.8-Flash ma to wszystko oraz czterotygodniową przewagę w uruchamianiu przez osoby, które nie pracują dla firmy Alibaba. Porównywanie wyboru architektury jest uczciwe. Porównywanie możliwości jeszcze nie.

Te dwie decyzje projektowe i dlaczego się różnią

Założenie Qwen jest takie, że szybka klasa powinna być strukturalnie odmienna od flagowca, a nie tylko od niego mniejsza. Qwen3.8-Flash aktywuje 6 miliardów ze swoich 125 miliardów parametrów — około 95% rzadkości — a swoją zdolność czerpie z tego, gdzie kierowane są obliczenia, a nie z samej szerokości. Alibaba wyraźnie stwierdziła, że architektura leżąca u podstaw, która łączy Gated DeltaNet z Qwen Sparse Attention i tablicą osadzeń N-gram, jest wczesnym podglądem generacji Qwen4, opublikowanym celowo wcześnie, aby silniki wnioskowania, narzędzia do kwantyzacji i wzorce wdrażania mogły dojrzeć wokół niej, zanim na jej bazie powstaną drogie modele. Wynikiem jest model, który z założenia jest tani na token: około 6 miliardów parametrów pracy na każdy token, w cenie ustalonej przez Alibabę na 0,15 USD za wejście i 0,47 USD za wyjście za milion tokenów.

Zakład Anta, na tyle, na ile ujawnia go ogłoszenie, jest bliższy konwencjonalnemu skalowaniu z bardzo długim kontekstem. Ling-3.1-flash utrzymuje dużą aktywną część — około 25 miliardów parametrów na token z 560 miliardów, czyli mniej więcej jeden na dwadzieścia dwa — i deklaruje okno do 1 miliona tokenów, czterokrotnie większe niż to, co obsługuje poprzednia generacja Ling. Aplikacja Ling Studio opisuje go jako stworzony do „agentów ogólnego przeznaczenia, wyszukiwania, rutynowej pracy biurowej oraz tworzenia oprogramowania/kodu”, co jest pozycjonowaniem na szybką półkę, ale ekonomika parametrów jest taka jak w znacznie cięższym modelu. Przy identycznym wejściu token przechodzący przez 25 mld aktywnych parametrów kosztuje około czterech razy więcej obliczeń niż token przechodzący przez 6 mld, zanim w grę wchodzi jakakolwiek decyzja cenowa.

Żadne z tych podejść nie jest błędne; oba dają się obronić jako odpowiedzi na pytanie „co ogranicza tani model”. Qwen stawia na to, że górną granicą są rzadkość i nowy stos mechanizmów uwagi. Ant stawia na to, że górną granicą są kontekst i wiedza o świecie oraz że może sobie pozwolić na moc obliczeniową. Tym, co je dla czytelnika różni, nie jest filozofia projektowania, lecz sposób udostępnienia: projekt, który można pobrać i zmierzyć, w przeciwieństwie do projektu, o którym można tylko poczytać.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Ile cię kosztuje każdy z nich i co to oznacza w praktyce

Luka cenowa nie jest subtelna i nie jest niewielka. Qwen3.8-Flash jest publikowany w cenie $0.15 za milion tokenów wejściowych, $0.47 za milion tokenów wyjściowych i $0.018 za milion przy odczytach z cache — te same liczby na ogłoszeniu Alibaby, na produkcyjnej karcie modelu dostawcy i na stronie modelu routowanego, którą obsługujemy, co właśnie wygląda jak przekazywanie z 0% marży, gdy sprawdzisz to w trzech źródłach. Ant nie opublikował żadnej stawki dla Ling-3.1-flash — żadnej ceny API, żadnej zniżki za cache, niczego porównywalnego. Jedyna opublikowana liczba dla linii Ling dotyczy poprzedniej generacji, która jest wyceniona na $0.075 za wejście i $0.22 za wyjście za milion, czyli około połowy stawki wejściowej Qwen i mniej niż połowa jego stawki wyjściowej. Gdyby nowy poziom Ling został wyceniony blisko miejsca, w którym plasował się stary, na papierze podciąłby Qwen3.8-Flash; gdyby został wyceniony gdziekolwiek blisko mocy obliczeniowej, jaką implikują jego 25B aktywnych parametrów, to nie. Tak czy inaczej to zgadywanie, bo ta liczba nie istnieje.

To w kwestii kontekstu twierdzenie Ling jest rzeczywiście większe. Ant podaje do 1 miliona tokenów dla Ling-3.1-flash; Qwen3.8-Flash jest oferowany z domyślnym kontekstem 1M tokenów w produkcyjnym API oraz natywnym oknem 262 144 tokenów w otwartych wagach, z możliwością rozszerzenia. Z liczbą podaną przez Ling wiążą się dwa zastrzeżenia i żadne z nich nie zostało rozstrzygnięte. Po pierwsze, „do 1M” to specyfikacja, a nie pomiar — nikt nie opublikował zachowania przy wyszukiwaniu w długim kontekście dla modelu, którego nikt spoza Ant nie może wywołać. Po drugie, poprzednia generacja Ling miała dokładnie tę samą lukę między reklamowanym oknem a stojącym za nim uzasadnieniem architektonicznym, a odpowiedź nadeszła dopiero wtedy, gdy w końcu opublikowano wagi, format i limity kontekstu. Główne 1M to obietnica. 1M w Qwen3.8-Flash to domyślna wartość serwowana w usłudze, z którą można skonfrontować twierdzenie Ant.

Dlaczego „podgląd” to uczciwe słowo po jednej stronie tego

Sposób, w jaki sama Alibaba przedstawia Qwen3.8-Flash, jest taki, że to podgląd architektury wydany pod nazwą produkcyjną — otwarte wagi noszą sufiks „Next” właśnie po to, aby nikt nie pomylił prototypu z dostrojonym modelem serwującym. To ujęcie zostało potwierdzone przez wydarzenia, a nie przez marketing: SGLang udostępnił wsparcie day-0 dla Qwen3.8-Flash-Next już w dniu premiery, a model skonfigurowano również dla Transformers, vLLM i TokenSpeed; wagi zostały od tego czasu podchwycone przez różne społeczności zajmujące się kwantyzacją. Wersje szybko stały się czymś zwyczajnym, co jest typowe dla wydanego modelu.

Ogłoszenie Anta ma taki sam kształt o krok wcześniej: publikacja specyfikacji przed wydaniem, z wyraźnym stwierdzeniem, że model wkrótce zostanie udostępniony jako open source. To prawowity sposób premiery — Ling-3.0-flash poszedł dokładnie tą ścieżką w lipcu, a wagi trafiły na licencję MIT 7 sierpnia, około dwa tygodnie później. Jednak stan obu projektów dzisiaj nie jest porównywalny i żadna ilość czytania wykresów nie zasypie tej luki. Warto sprecyzować, co osoba z zewnątrz może wnieść do każdego z nich.

Co jest dziś niezależnie weryfikowalne w przypadku Ling-3.1-flash: że ogłoszenie istnieje i jest datowane na 30 września; że dane dotyczące liczby parametrów, liczby parametrów aktywnych i kontekstu są własnymi danymi Ant; że model pojawia się w produkcie Ling Studio firmy Ant; oraz że nie opublikowano wag, licencji ani karty modelu. Co jest niezależnie weryfikowalne w przypadku Qwen3.8-Flash: że wagi można pobrać w BF16 i FP8; że warunki licencji są czytelne; że cena API jest opublikowana; oraz że twierdzenia Alibaby dotyczące benchmarków są otwarte na reprodukcję od końca sierpnia. Druga lista jest dłuższa i to całe porównanie w miniaturze.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Jak te dwa zostałyby faktycznie ocenione

Ant opublikował kartę benchmarku z Ling-3.1-flash, która stawia go przeciwko GPT-5.6 Sol, Claude Opus 5, Kimi K3, dwóm wariantom GLM i DeepSeek-V4.1-Flash, z kluczowymi liczbami: 1 673 Elo w GDPVal-AA v2.1, 75,16 w FrontierSWE i 65,35 w HealthBench Professional. Na tej karcie widnieją dwa problemy, jeszcze zanim ktokolwiek zacznie spierać się o liczby. Pierwszy to zestaw porównawczy: oba modele frontier, które Ant wybrał, są o generację z tyłu, ponieważ Claude Opus 5.5 i GPT-6 Sol zostały uruchomione 22 września 2026 i są teraz dostępne w routingu, co oznacza, że karta porównuje październikowy model z lipcowym frontierem, a nie z obecnym. Drugi to przypis na samej karcie, który stwierdza, że wynik HealthBench Professional pochodzi ze „środowiska AQ” i że możliwości modelu w zakresie opieki zdrowotnej można obecnie doświadczyć wyłącznie w AQ — środowisku, którego nie definiuje żadna publiczna dokumentacja. Wynik z nagłówka, którego środowisko oceny nie zostało nazwane, nie jest odtwarzalny nawet w zasadzie.

Dla kontrastu, porównywalne twierdzenia Qwen3.8-Flash pojawiły się, gdy wagi były już dostępne, a Alibaba oparła swoją pozycję na twierdzeniu, które każdy może sprawdzić: że to ze współczynnika rzadkości, a nie z liczby parametrów, bierze się ta zdolność. Cztery tygodnie użytkowania to nie wyrok, ale wystarczająco długo, by twierdzenia przestały być niekwestionowane — a to użyteczny stan dla modelu.

Co właściwie z tym zrobić, dzisiaj

Dla twórców praktyczny podział jest prosty. Ling-3.1-flash nie jest komponentem, który możesz wdrożyć w tym tygodniu: nie ma endpointu, który można wywołać, nie ma wag do hostowania, nie ma licencji do sprawdzenia i nie ma ceny, względem której można zaplanować budżet. Niezależnie od tego, jaki ostatecznie będzie finalny model, użytecznym posunięciem już teraz jest ustawienie wyzwalacza — wagi opublikowane, licencja liberalna, niezależny wynik w FrontierSWE gdzieś w okolicach 75.16 — i powrócenie do tego później. Historia poprzedniej generacji pokazuje, że wagi mogą pojawić się dwa tygodnie po ogłoszeniu, więc ten wyzwalacz może zadziałać szybko.

Qwen3.8-Flash jest już komponentem. Jest dostępny w naszym katalogu jako model routowany w cenie katalogowej dostawcy, bez marży — karta modelu routowanego podaje 0,15 USD za wejście, 0,47 USD za wyjście i 0,018 USD za milion odczytów z pamięci podręcznej, czyli te same liczby, które publikuje Alibaba, co jest tym, co polityka 0% marży oznacza w praktyce, a nie na slajdzie. Za jednym kluczem sąsiaduje z Claude Opus 5, GPT-5.6 Sol i DeepSeek-V4.1-Flash, więc porównanie, do którego zachęca Ant — kandydat przeciwko obecnemu frontowi — można przeprowadzić, wskazując w konfiguracji dwie trasy zamiast utrzymywać dwie integracje, a automatyczne przełączanie awaryjne obsłuży weekend, w którym dostawca się zachwieje. To różnica między dyskusją o architekturze a eksperymentem.

Werdykt, o ile w ogóle można go wydać: Qwen postawił śmielszy zakład architektoniczny i miał pewność siebie, by opublikować go wcześnie i pozwolić ludziom go rozłożyć na części. Ant postawił na cięższy zakład — więcej parametrów, więcej aktywnych obliczeń na token, więcej kontekstu — i jak dotąd opublikował wykres zamiast modelu. Wykres wygląda dobrze. Wykres jest też jedyną rzeczą, jaką ktokolwiek ma.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie