Wygenerowana redakcyjna karta hero zatytułowana „Ling-3.1-flash vs Ling-3.0-flash" z podtytułem „Jedna jest dostępna do pobrania już dziś. Druga to zdanie w poście prasowym." Dwie kolumny porównawcze: „Ling-3.1-flash (zapowiedziany)" wymienia „~560B łącznie / ~25B aktywnych", „kontekst do 1M tokenów" i „brak wag, brak licencji"; „Ling-3.0-flash (wydany)" wymienia „124B łącznie / 5.1B aktywnych", „obsługiwany kontekst 262 144 tokenów" i „wagi MIT na Hugging Face".
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: Co faktycznie zmieniają okno 1 mln tokenów i 4,5-krotnie większa liczba parametrów

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Rodzina Ling od Ant Group ma nowy szybki wariant, a tym razem ma za sobą zaledwie jedno zdanie. Ling-3.1-flash ogłoszono 30 września 2026 r. — łącznie około 560 miliardów parametrów, około 25 miliardów aktywnych na token, okno kontekstu podawane jako do 1 miliona tokenów i dołączona utarta formułka: „Planujemy wkrótce udostępnić ten model jako open source”. Zastępowany przez niego model na szczycie linii szybkich modeli, Ling-3.0-flash, jest pod każdym względem zupełnie innym zwierzęciem: 124 miliardy parametrów łącznie, 5,1 miliarda aktywnych na token, obsługiwany kontekst 262 144 tokenów, wagi na licencji MIT na Hugging Face od 7 sierpnia oraz niezależny Artificial Analysis Intelligence Index wynoszący 20. Jeden z tych modeli możesz pobrać już dziś. O drugim możesz poczytać. Porównywanie ich jest naprawdę użyteczne, ale tylko wtedy, gdy porównanie zaczyna się właśnie tam.

Ta nagłówkowa arytmetyka jest prosta i nieco myląca. Ling-3.1-flash ma około 4,5× całkowitej liczby parametrów Ling-3.0-flash i około 4,9× liczby parametrów aktywnych — 25B wobec 5,1B na token. Pobieżna lektura mówi: „znacznie większy model, więc znacznie mądrzejszy model”. Bardziej wnikliwa lektura wskazuje, że Ant w przybliżeniu zachował proporcję rzadkości, skalując trzon, a to, co się dzięki temu zyskuje, to pojemność, a niekoniecznie głębokość rozumowania na token: model, który przepuszcza przez każdy token 25B ze swoich 560B, wykonuje więcej pracy na token niż model przepuszczający 5,1B, ale płaci też za to około pięciokrotnie większym nakładem obliczeń na token. To, jak wypadnie ten kompromis, zależy w całości od tego, czy architektura Anta efektywnie radzi sobie z dodatkowymi parametrami — a na to pytanie ogłoszenie nie odpowiada.

Te dwa modele, obok siebie

Zestaw opublikowane fakty obok siebie, a generacje rozdzielą się wyraźnie. Każda poniższa linia podaje, co Ant lub niezależny ewaluator faktycznie opublikował; tam, gdzie brakuje liczby, brakuje jej, ponieważ nikt jej nie opublikował.

• Łączna liczba parametrów — Ling-3.1-flash: ~560B (producent). Ling-3.0-flash: 124B (karta modelu).

• Aktywne parametry na token — Ling-3.1-flash: ~25B (dostawca). Ling-3.0-flash: 5,1B (karta modelu).

• Okno kontekstu — Ling-3.1-flash: do 1 mln tokenów (dostawca). Ling-3.0-flash: natywnie 256 tys., obsługiwane przy 262,144 (karta modelu i receptury wnioskowania).

• Wagi i licencja — Ling-3.1-flash: nieopublikowane; brak repozytorium, brak licencji (sprawdzone 30 września i ponownie 1 października 2026). Ling-3.0-flash: MIT, na Hugging Face jako inclusionAI/Ling-3.0-flash oraz na ModelScope od 7 sierpnia 2026.

• Formaty wag — Ling-3.1-flash: brak dostępnych. Ling-3.0-flash: BF16 (~255GB) i FP8 (~128GB) z laboratorium, plus kwantyzacje społeczności.

• Pochodzenie benchmarku — Ling-3.1-flash: w całości raportowane przez dostawcę, brak publicznego harnessu, brak wag do ponownego uruchomienia. Ling-3.0-flash: niezależnie oceniony przez Artificial Analysis z wynikiem 20 w Intelligence Index, a obok opublikowano zmierzoną prędkość wyjściową i wolumen generowania tokenów.

• Dostępność — Ling-3.1-flash: wyłącznie własny produkt Ant, Ling Studio. Ling-3.0-flash: możliwość samodzielnego hostowania, a także wywoływania przez developerskie API Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Do czego prawdopodobnie służy dodatkowa przepustowość

Jednolinijkowy opis Ling-3.1-flash autorstwa samego Ant to najbardziej informacyjny element tego wydania. Aplikacja Ling Studio reklamuje go jako narzędzie do „uniwersalnych agentów, wyszukiwania, rutynowej pracy biurowej oraz tworzenia oprogramowania/kodu” — ujęcie zorientowane na pracę biurową i agentowość, a nie na benchmarki rozumowania. Jest to spójne ze sposobem organizacji rodziny: Ling to uniwersalna linia tekstowa i narzędziowa, Ring to linia rozumowania, a Ming obsługuje multimodalność. Ling-3.0-flash zajmował to samo miejsce o jedną generację wcześniej i był wyraźnie szybkim, tanim segmentem, a nie flagowcem.

Patrząc na to zwiększenie skali w tym świetle, ma to sens. Obciążenia agentowe i związane z wywoływaniem narzędzi są długie, powtarzalne i wymagające dużego kontekstu: pojedyncza pętla agenta może spalić dziesiątki tysięcy tokenów skumulowanych wyników narzędzi, zanim podejmie działanie, więc okno 1M tokenów jest wymogiem funkcjonalnym, a nie ozdobnikiem z karty specyfikacji. Zwiększanie całkowitej liczby parametrów przy zachowaniu dużej aktywnej frakcji to sposób na dodanie modelowi wiedzy o świecie i głębszego podążania za instrukcjami, choć model ten wciąż musi być wystarczająco szybki, by działać wewnątrz pętli. Ant nie buduje tutaj wolniejszego, mądrzejszego flagowca; buduje większą szybką warstwę.

Kontrargumentem jest koszt i jest to ta sama arytmetyka, nadciągająca z przeciwnego kierunku. Dodatkowa pojemność nie jest darmowa w czasie wnioskowania — płaci się za nią przy każdym tokenie, a Ant nie opublikował w ogóle żadnej ceny za Ling-3.1-flash: żadnego cennika API, żadnego rabatu za cache, niczego porównywalnego z 0,075/0,22 USD za milion tokenów, które podaje poprzednia generacja. To brakująca liczba, która rozstrzygnęłaby to porównanie, a jej brak.

Benchmarki i kto je przeprowadził

Ling-3.1-flash pojawia się z trzema wynikami, które w izolacji wyglądają mocno: 1673 Elo w GDPVal-AA v2.1, 75,16 w FrontierSWE i 65,35 w HealthBench Professional. Wszystkie trzy są wynikami samego Ant, zaczerpniętymi z ogłoszenia, i żadnego z nich nie odtworzyło zewnętrzne laboratorium. Praktyczną konsekwencją jest to, że można je porównywać z liczbami innych dostawców, ale nie z liczbami niezależnymi — a 20-punktowy Intelligence Index Artificial Analysis dla Ling-3.0-flash to niezależna liczba w innej skali, więc zestawienie ich obok siebie byłoby porównywaniem pomiaru z twierdzeniem. W chwili pisania tego tekstu na Artificial Analysis nie ma strony Ling-3.1-flash.

Jeden przypis na wykresie samego Anta wart jest odnotowania sam w sobie. Karta podaje, że wynik HealthBench Professional oceniano w „środowisku AQ” i że możliwości Ling-3.1-flash w obszarze opieki zdrowotnej można obecnie wypróbować wyłącznie w AQ. Żadna publiczna dokumentacja nie wyjaśnia, czym jest AQ. Wynik z nagłówka opatrzony kwalifikatorem nienazwanego środowiska nie jest czymś, co zespół z zewnątrz może odtworzyć, nawet gdy wagi już istnieją.

Którego tak naprawdę użyć w tym tygodniu?

Pytanie o wybór generacji rozstrzyga się różnie w zależności od tego, czego potrzebujesz dziś, a dla niemal każdego odpowiedzią w tej chwili nie jest nowszy model.

Jeśli w tym tygodniu musisz coś uruchomić, Ling-3.0-flash jest jedynym z tych dwóch, który istnieje w użytecznej formie: wagi MIT, które możesz hostować samodzielnie, FP8, jeśli zależy ci na mniejszym śladzie, opublikowany cennik oficjalnego API oraz niezależny wynik, który mówi, co dostajesz. To naprawdę dobry model w swojej klasie — niezależna ocena umieściła go na granicy Pareto otwartych wag pod względem inteligencji względem całkowitej liczby parametrów i wysoko oceniła jego szybkość, z zastrzeżeniem, że jest wyjątkowo rozwlekły i wygenerował około 260 mln tokenów w trakcie oceny, wobec mediany blisko 100 mln.

Jeśli planujesz na najbliższe sześć miesięcy, Ling-3.1-flash wyznacza kierunek rozwoju, ale nie jest jeszcze komponentem. Konkretne rzeczy, które warto obserwować, zanim nim zostanie: czy wagi faktycznie zostaną otwarte i na jakiej licencji, czy serwowane okno to rzeczywiście 1M, czy rozszerzenie krótszego natywnego kontekstu, ile kosztuje za milion tokenów oraz czy niezależne laboratorium odtworzy wynik 75,16 na FrontierSWE. Spełnienie któregokolwiek z tych warunków byłoby powodem, by ponownie przeprowadzić porównanie. Żaden z nich nie został spełniony.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Gdzie to pasuje w stosie routingu

Żaden z modeli Ling nie znajduje się dziś w naszym katalogu — Ling-3.0-flash, Ling-3.0-flash-VL i Ling-3.1-flash — wszystkie trzy zwracają not-found względem API modeli OrcaRouter, więc szczera odpowiedź na pytanie „czy mogę wywołać go przez was” brzmi: nie, na razie. To, do czego warstwa routingu naprawdę się nadaje w takim tygodniu jak ten, to druga połowa problemu: modele, na tle których testowałbyś kandydata. Claude Opus 5, GPT-5.6 Sol i DeepSeek-V4.1-Flash — wszystkie są aktywnymi trasami w cenie katalogowej dostawcy bez marży, a router, który trzyma je za jednym kluczem z automatycznym przełączaniem awaryjnym, pozwala utrzymać środowisko ewaluacyjne wycelowane w ruchomy cel bez utrzymywania czterech integracji. Gdy wagi Ling-3.1-flash zostaną udostępnione i będzie można odczytać licencję, taki też będzie kształt decyzji: dodać jeden endpoint, a nie przebudowywać stacku.

Podsumowanie generacyjne jest krótkie. Ling-3.0-flash to wydany, niezależnie oceniony, objęty permisywną licencją model, który można hostować samodzielnie już dziś. Ling-3.1-flash to większa, o dłuższym kontekście, droższa w uruchomieniu obietnica, której Ant nie dostarczył jeszcze w żadnej formie użytecznej dla dewelopera. Traktowanie drugiego jako ulepszenia pierwszego to błąd, do którego zachęca to wydanie, a liczby jeszcze go nie potwierdzają.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".