
Ling-3.1-flash vs Qwen3.8-Flash: Dwa sposoby budowania szybkiej warstwy, a tylko jeden z nich trafia na rynek
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 262 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- xAISpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Dwa chińskie laboratoria przyjrzały się tej jesieni temu samemu problemowi — jak zbudować tani, szybki model, który jest wystarczająco dobry, by działać w pętli agenta — i doszły do przeciwnych wniosków. Ling-3.1-flash, ogłoszony przez Ant Group 30 września 2026 r., to liczący około 560 miliardów parametrów mixture-of-experts aktywujący około 25 miliardów parametrów na token, z oknem kontekstowym podawanym jako do 1 miliona tokenów i deklarowanym zamiarem udostępnienia jako open source „wkrótce”. Qwen3.8-Flash, wydany przez zespół Qwen firmy Alibaba 26 sierpnia 2026 r., to 125-miliardowy multimodalny mixture-of-experts aktywujący około 6 miliardów parametrów na token, którego wagi są już na Hugging Face pod nazwą Qwen3.8-Flash-Next, model produkcyjny działający na żywo w API QwenCloud w cenie 0,15 USD za milion tokenów wejściowych i 0,47 USD za milion tokenów wyjściowych, oraz wsparcie od dnia zerowego w SGLang. Jedno laboratorium zwiększyło skalę i ogłosiło. Drugie zmniejszyło skalę i wdrożyło. Ta różnica jest bardziej pouczająca niż jakikolwiek benchmark opublikowany przez którekolwiek z tych laboratoriów.
To także powód, dla którego to porównanie trzeba czytać uważnie. Ling-3.1-flash nie ma wag, licencji, karty modelu, ceny API ani niezależnej oceny; cały opublikowany materiał to post z ogłoszeniem, wykres benchmarku dostawcy i miejsce we własnym produkcie Ling Studio firmy Ant. Qwen3.8-Flash ma to wszystko oraz czterotygodniową przewagę w uruchamianiu przez osoby, które nie pracują dla firmy Alibaba. Porównywanie wyboru architektury jest uczciwe. Porównywanie możliwości jeszcze nie.
Te dwie decyzje projektowe i dlaczego się różnią
Założenie Qwen jest takie, że szybka klasa powinna być strukturalnie odmienna od flagowca, a nie tylko od niego mniejsza. Qwen3.8-Flash aktywuje 6 miliardów ze swoich 125 miliardów parametrów — około 95% rzadkości — a swoją zdolność czerpie z tego, gdzie kierowane są obliczenia, a nie z samej szerokości. Alibaba wyraźnie stwierdziła, że architektura leżąca u podstaw, która łączy Gated DeltaNet z Qwen Sparse Attention i tablicą osadzeń N-gram, jest wczesnym podglądem generacji Qwen4, opublikowanym celowo wcześnie, aby silniki wnioskowania, narzędzia do kwantyzacji i wzorce wdrażania mogły dojrzeć wokół niej, zanim na jej bazie powstaną drogie modele. Wynikiem jest model, który z założenia jest tani na token: około 6 miliardów parametrów pracy na każdy token, w cenie ustalonej przez Alibabę na 0,15 USD za wejście i 0,47 USD za wyjście za milion tokenów.
Zakład Anta, na tyle, na ile ujawnia go ogłoszenie, jest bliższy konwencjonalnemu skalowaniu z bardzo długim kontekstem. Ling-3.1-flash utrzymuje dużą aktywną część — około 25 miliardów parametrów na token z 560 miliardów, czyli mniej więcej jeden na dwadzieścia dwa — i deklaruje okno do 1 miliona tokenów, czterokrotnie większe niż to, co obsługuje poprzednia generacja Ling. Aplikacja Ling Studio opisuje go jako stworzony do „agentów ogólnego przeznaczenia, wyszukiwania, rutynowej pracy biurowej oraz tworzenia oprogramowania/kodu”, co jest pozycjonowaniem na szybką półkę, ale ekonomika parametrów jest taka jak w znacznie cięższym modelu. Przy identycznym wejściu token przechodzący przez 25 mld aktywnych parametrów kosztuje około czterech razy więcej obliczeń niż token przechodzący przez 6 mld, zanim w grę wchodzi jakakolwiek decyzja cenowa.
Żadne z tych podejść nie jest błędne; oba dają się obronić jako odpowiedzi na pytanie „co ogranicza tani model”. Qwen stawia na to, że górną granicą są rzadkość i nowy stos mechanizmów uwagi. Ant stawia na to, że górną granicą są kontekst i wiedza o świecie oraz że może sobie pozwolić na moc obliczeniową. Tym, co je dla czytelnika różni, nie jest filozofia projektowania, lecz sposób udostępnienia: projekt, który można pobrać i zmierzyć, w przeciwieństwie do projektu, o którym można tylko poczytać.

Ile cię kosztuje każdy z nich i co to oznacza w praktyce
Luka cenowa nie jest subtelna i nie jest niewielka. Qwen3.8-Flash jest publikowany w cenie $0.15 za milion tokenów wejściowych, $0.47 za milion tokenów wyjściowych i $0.018 za milion przy odczytach z cache — te same liczby na ogłoszeniu Alibaby, na produkcyjnej karcie modelu dostawcy i na stronie modelu routowanego, którą obsługujemy, co właśnie wygląda jak przekazywanie z 0% marży, gdy sprawdzisz to w trzech źródłach. Ant nie opublikował żadnej stawki dla Ling-3.1-flash — żadnej ceny API, żadnej zniżki za cache, niczego porównywalnego. Jedyna opublikowana liczba dla linii Ling dotyczy poprzedniej generacji, która jest wyceniona na $0.075 za wejście i $0.22 za wyjście za milion, czyli około połowy stawki wejściowej Qwen i mniej niż połowa jego stawki wyjściowej. Gdyby nowy poziom Ling został wyceniony blisko miejsca, w którym plasował się stary, na papierze podciąłby Qwen3.8-Flash; gdyby został wyceniony gdziekolwiek blisko mocy obliczeniowej, jaką implikują jego 25B aktywnych parametrów, to nie. Tak czy inaczej to zgadywanie, bo ta liczba nie istnieje.
To w kwestii kontekstu twierdzenie Ling jest rzeczywiście większe. Ant podaje do 1 miliona tokenów dla Ling-3.1-flash; Qwen3.8-Flash jest oferowany z domyślnym kontekstem 1M tokenów w produkcyjnym API oraz natywnym oknem 262 144 tokenów w otwartych wagach, z możliwością rozszerzenia. Z liczbą podaną przez Ling wiążą się dwa zastrzeżenia i żadne z nich nie zostało rozstrzygnięte. Po pierwsze, „do 1M” to specyfikacja, a nie pomiar — nikt nie opublikował zachowania przy wyszukiwaniu w długim kontekście dla modelu, którego nikt spoza Ant nie może wywołać. Po drugie, poprzednia generacja Ling miała dokładnie tę samą lukę między reklamowanym oknem a stojącym za nim uzasadnieniem architektonicznym, a odpowiedź nadeszła dopiero wtedy, gdy w końcu opublikowano wagi, format i limity kontekstu. Główne 1M to obietnica. 1M w Qwen3.8-Flash to domyślna wartość serwowana w usłudze, z którą można skonfrontować twierdzenie Ant.
Dlaczego „podgląd” to uczciwe słowo po jednej stronie tego
Sposób, w jaki sama Alibaba przedstawia Qwen3.8-Flash, jest taki, że to podgląd architektury wydany pod nazwą produkcyjną — otwarte wagi noszą sufiks „Next” właśnie po to, aby nikt nie pomylił prototypu z dostrojonym modelem serwującym. To ujęcie zostało potwierdzone przez wydarzenia, a nie przez marketing: SGLang udostępnił wsparcie day-0 dla Qwen3.8-Flash-Next już w dniu premiery, a model skonfigurowano również dla Transformers, vLLM i TokenSpeed; wagi zostały od tego czasu podchwycone przez różne społeczności zajmujące się kwantyzacją. Wersje szybko stały się czymś zwyczajnym, co jest typowe dla wydanego modelu.
Ogłoszenie Anta ma taki sam kształt o krok wcześniej: publikacja specyfikacji przed wydaniem, z wyraźnym stwierdzeniem, że model wkrótce zostanie udostępniony jako open source. To prawowity sposób premiery — Ling-3.0-flash poszedł dokładnie tą ścieżką w lipcu, a wagi trafiły na licencję MIT 7 sierpnia, około dwa tygodnie później. Jednak stan obu projektów dzisiaj nie jest porównywalny i żadna ilość czytania wykresów nie zasypie tej luki. Warto sprecyzować, co osoba z zewnątrz może wnieść do każdego z nich.
Co jest dziś niezależnie weryfikowalne w przypadku Ling-3.1-flash: że ogłoszenie istnieje i jest datowane na 30 września; że dane dotyczące liczby parametrów, liczby parametrów aktywnych i kontekstu są własnymi danymi Ant; że model pojawia się w produkcie Ling Studio firmy Ant; oraz że nie opublikowano wag, licencji ani karty modelu. Co jest niezależnie weryfikowalne w przypadku Qwen3.8-Flash: że wagi można pobrać w BF16 i FP8; że warunki licencji są czytelne; że cena API jest opublikowana; oraz że twierdzenia Alibaby dotyczące benchmarków są otwarte na reprodukcję od końca sierpnia. Druga lista jest dłuższa i to całe porównanie w miniaturze.

Jak te dwa zostałyby faktycznie ocenione
Ant opublikował kartę benchmarku z Ling-3.1-flash, która stawia go przeciwko GPT-5.6 Sol, Claude Opus 5, Kimi K3, dwóm wariantom GLM i DeepSeek-V4.1-Flash, z kluczowymi liczbami: 1 673 Elo w GDPVal-AA v2.1, 75,16 w FrontierSWE i 65,35 w HealthBench Professional. Na tej karcie widnieją dwa problemy, jeszcze zanim ktokolwiek zacznie spierać się o liczby. Pierwszy to zestaw porównawczy: oba modele frontier, które Ant wybrał, są o generację z tyłu, ponieważ Claude Opus 5.5 i GPT-6 Sol zostały uruchomione 22 września 2026 i są teraz dostępne w routingu, co oznacza, że karta porównuje październikowy model z lipcowym frontierem, a nie z obecnym. Drugi to przypis na samej karcie, który stwierdza, że wynik HealthBench Professional pochodzi ze „środowiska AQ” i że możliwości modelu w zakresie opieki zdrowotnej można obecnie doświadczyć wyłącznie w AQ — środowisku, którego nie definiuje żadna publiczna dokumentacja. Wynik z nagłówka, którego środowisko oceny nie zostało nazwane, nie jest odtwarzalny nawet w zasadzie.
Dla kontrastu, porównywalne twierdzenia Qwen3.8-Flash pojawiły się, gdy wagi były już dostępne, a Alibaba oparła swoją pozycję na twierdzeniu, które każdy może sprawdzić: że to ze współczynnika rzadkości, a nie z liczby parametrów, bierze się ta zdolność. Cztery tygodnie użytkowania to nie wyrok, ale wystarczająco długo, by twierdzenia przestały być niekwestionowane — a to użyteczny stan dla modelu.
Co właściwie z tym zrobić, dzisiaj
Dla twórców praktyczny podział jest prosty. Ling-3.1-flash nie jest komponentem, który możesz wdrożyć w tym tygodniu: nie ma endpointu, który można wywołać, nie ma wag do hostowania, nie ma licencji do sprawdzenia i nie ma ceny, względem której można zaplanować budżet. Niezależnie od tego, jaki ostatecznie będzie finalny model, użytecznym posunięciem już teraz jest ustawienie wyzwalacza — wagi opublikowane, licencja liberalna, niezależny wynik w FrontierSWE gdzieś w okolicach 75.16 — i powrócenie do tego później. Historia poprzedniej generacji pokazuje, że wagi mogą pojawić się dwa tygodnie po ogłoszeniu, więc ten wyzwalacz może zadziałać szybko.
Qwen3.8-Flash jest już komponentem. Jest dostępny w naszym katalogu jako model routowany w cenie katalogowej dostawcy, bez marży — karta modelu routowanego podaje 0,15 USD za wejście, 0,47 USD za wyjście i 0,018 USD za milion odczytów z pamięci podręcznej, czyli te same liczby, które publikuje Alibaba, co jest tym, co polityka 0% marży oznacza w praktyce, a nie na slajdzie. Za jednym kluczem sąsiaduje z Claude Opus 5, GPT-5.6 Sol i DeepSeek-V4.1-Flash, więc porównanie, do którego zachęca Ant — kandydat przeciwko obecnemu frontowi — można przeprowadzić, wskazując w konfiguracji dwie trasy zamiast utrzymywać dwie integracje, a automatyczne przełączanie awaryjne obsłuży weekend, w którym dostawca się zachwieje. To różnica między dyskusją o architekturze a eksperymentem.
Werdykt, o ile w ogóle można go wydać: Qwen postawił śmielszy zakład architektoniczny i miał pewność siebie, by opublikować go wcześnie i pozwolić ludziom go rozłożyć na części. Ant postawił na cięższy zakład — więcej parametrów, więcej aktywnych obliczeń na token, więcej kontekstu — i jak dotąd opublikował wykres zamiast modelu. Wykres wygląda dobrze. Wykres jest też jedyną rzeczą, jaką ktokolwiek ma.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
