Główna karta tytułowa dla „Ling-3.1-flash osiąga 41 w AA Intelligence Index”, z podtytułem „560B ogółem / 25B aktywnych MoE od Ant Group”. Duża zaokrąglona karta przedstawia liczbę „41” z etykietą „Artificial Analysis Intelligence Index v4.3.2”; poniżej druga mała karta zawiera „vs 20” z etykietą „Ling-3.0-flash”. Wiersz stopki zawiera „Wartość indeksu niezależnie zmierzona przez Artificial Analysis; model wydany 2026-10-01”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Ling-3.1-flash osiąga 41 punktów w Artificial Analysis Intelligence Index: 560B MoE podwaja wynik poprzednika

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ling-3.1-flash, mieszanka ekspertów Ant Group z 560 miliardami parametrów, ma teraz liczbę, której nie zapisało jego własne laboratorium: 41 w Artificial Analysis Intelligence Index. Indeks prowadzi niezależny ewaluator, na kontrolowanym przez siebie sprzęcie, według stałego zestawu testów — i plasuje ten model 21 punktów wyżej niż jego bezpośredniego poprzednika, Ling-3.0-flash, który nadal ma 20 punktów w tym samym indeksie. Ant ogłosił Ling-3.1-flash pod koniec września 2026 r., Artificial Analysis datuje premierę na 1 października, a model jest o trzy miesiące młodszy od tego, którego wynik podwaja.

Ta różnica jest sednem. Skok o 21 punktów w kompozycie zasilanym przez dziesięć różnych ewaluacji nie jest czymś, co wykres dostawcy mógłby sfałszować, i nie jest czymś, o czym ten blog mógłby napisać dwa tygodnie temu, kiedy jedynym istniejącym pomiarem Ling-3.1-flash był własny raport Ant: 1673 Elo w GDPval v2, 75,16 w FrontierSWE, 65,35 w FrontierSWE. Te liczby były twierdzeniami laboratorium, ale nieodtworzonymi. Liczba 41 jest innego rodzaju. To pierwsza liczba w tym wydaniu, za którą może odpowiadać strona trzecia.

Co faktycznie mierzy 41

Artificial Analysis Intelligence Index v4.3.2 to ważony kompozyt dziesięciu ewaluacji: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. Czytanie kompozytu w izolacji to błąd, więc wiersze dla poszczególnych ewaluacji mają większe znaczenie niż wynik główny:

• GDPval-AA — 1621,75 dla Ling-3.1-flash wobec 948,35 dla Ling-3.0-flash. To największy pojedynczy skok w zestawie i ten, na którym opiera się większość ruchu indeksu.

• GDP.pdf — 0,100 we wszystkich zaliczeniach, w górę z 0,054. Wciąż nisko w ujęciu absolutnym, ale to niemal podwojenie.

• AA-LCR v1.1 rozumowanie w długim kontekście — 0,83 wobec 0,73 dla poprzednika i na równi z DeepSeek V4.1 Flash (Max) z wynikiem 0,84.

• SciCode — 0,541 wobec 0,420. Zysk w zakresie nauki kodowania, a nie zysk w jakości czatu.

• Rozumowanie fizyczne CritPt — 0,180 wobec 0,017 wcześniej. Dziesięć razy więcej niż poprzednik na małej bazie.

• AA-Omniscience — +2,22, w porównaniu z −17,88 dla Ling-3.0-flash. Omówiono to poniżej, ponieważ stoi w sprzeczności z głównym przekazem.

Ling-3.0-flash nie tylko przegrał z Ling-3.1-flash na tych wierszach; załamał się na dwóch z nich. Uzyskał 0,032 w AutomationBench-AA i dokładnie 0,000 w Terminal-Bench 4.0. To jest kontekst, w którym należy odczytywać 41 — poprzednik był wydajnym, tanim modelem o otwartych wagach, który zasadniczo nie miał żadnych zdolności agentowo-terminalowych.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

Skąd wziął się wzrost: praca agentowa, a nie rozmowa

Porównaj wkład Ling-3.1-flash w indeks z dwoma modelami klasy Flash, z którymi najczęściej jest zestawiany, a ujawni się wzorzec, który ukrywa agregat. DeepSeek V4.1 Flash (Max) notuje 39 w tym samym indeksie, a GLM 5.3 Flash notuje 42, więc wszystkie trzy mieszczą się w przedziale trzech punktów. Ale osiągają to z różnych miejsc.

• Praca agentowa w terminalu — Ling-3.1-flash 0,333 w Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0,268, GLM 5.3 Flash 0,328.

• Praca agentowa w świecie rzeczywistym — Ling-3.1-flash 1 621,75 Elo w GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.

• Nauka kodowania — Ling-3.1-flash 0,541 w SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.

Wąska interpretacja jest taka, że Ling-3.1-flash jest konkurencyjny w benchmarkach agentowych i ma nieznaczną przewagę w SciCode. Użyteczna interpretacja jest taka, że jest najsilniejszy z całej trójki w dwóch miarach agentowo-terminalowych, które większość ludzi ma na myśli, mówiąc „czy potrafi prowadzić pętlę narzędziową” — a pod względem niezawodności wiedzy ustępuje obu pozostałym. To konkretny profil, a nie ogólne zwycięstwo, i warto go nazwać, zanim ktokolwiek kupi workload wyłącznie na podstawie samej liczby indeksowej.

Rachunek, który przychodzi z większym modelem

Ling-3.0-flash był wyceniany na 0,07 USD za milion tokenów wejściowych i 0,22 USD za milion tokenów wyjściowych w API samego Ant, a jego wagi były otwarte na licencji MIT. Ling-3.1-flash nie jest jeszcze ani jednym, ani drugim. Artificial Analysis odnotowuje jego koszt działania na poziomie 0,30 USD za milion tokenów wejściowych i 0,90 USD za milion tokenów wyjściowych — ze stawką 0,06 USD za trafienie w cache, czyli 80% zniżki od ceny wejścia — mierzonym względem własnego API InclusionAI jako dostawcy usług. To mniej więcej czterokrotny wzrost ceny tokenów wejściowych w porównaniu z poprzednim modelem, w zamian za 21 punktów indeksu.

Czy ten kompromis się opłaca, zależy w całości od obciążenia, a sam indeks potrafi to wycenić: uruchomienie wszystkich dziesięciu ewaluacji Intelligence Index na Ling-3.1-flash kosztuje około 960 USD przy tych stawkach, wobec około 477 USD dla DeepSeek V4.1 Flash (Max) i 280 USD dla GLM 5.3 Flash. Powód to nie tylko cennik. Ling-3.1-flash to bardzo gadatliwy model rozumujący — zużył 220 milionów tokenów wyjściowych, przechodząc przez indeks, znacznie powyżej mediany dla swojej półki cenowej, a jego przebiegi ewaluacji zajmują średnio około 357 sekund na zadanie wobec 285 sekund dla DeepSeek V4.1 Flash (Max) i 979 sekund dla GLM 5.3 Flash. W przeliczeniu na zadanie Ling-3.1-flash kosztuje około 0,99 USD wobec 0,27 USD w przypadku DeepSeek i 0,25 USD w przypadku GLM 5.3 Flash.

Nic z tego nie widać z 41, a wszystko to trafia na fakturę. Model może wygrać indeks, a przegrać budżet.

Dwie liczby, które przeczą nagłówkowi

Pierwsza to wiarygodność wiedzy. Ling-3.1-flash uzyskuje +2.22 w AA-Omniscience, które mierzy, czy model wie, co wie: poprawne odpowiedzi zdobywają punkty, halucynacje kosztują punkty, a odmowy nie kosztują nic. Jego wskaźnik dokładności wynosi 29.1%, a wskaźnik halucynacji 37.9%. Postawiony obok modeli z tej samej rodziny, to najsłabszy profil w grupie — GLM 5.3 Flash uzyskuje +7.47 przy wskaźniku halucynacji 27.6%, a DeepSeek V4.1 Flash (Max) uzyskuje −5.30 przy oszałamiającym wskaźniku halucynacji 96.5% wśród udzielonych odpowiedzi. Wynik złożony nagradza Ling-3.1-flash za zdolność, którą demonstruje, a nie za wiarygodność, z jaką ją demonstruje, a model, który zmyśla jedną trzecią tego, co twierdzi, wymaga w środowisku produkcyjnym mechanizmu wyszukiwania wokół siebie.

Drugi aspekt to kontekst. Artificial Analysis wymienia Ling-3.1-flash z oknem kontekstowym wynoszącym 1 000 000 tokenów. Materiały premierowe samego Ant również podają 1M jako wartość docelową. Ale dokumentacja deweloperska Ant, która wylicza okna tej rodziny model po modelu, podaje dla Ling-3.0-flash natywne 256K z możliwością rozszerzenia do 1M, a nie zawiera jeszcze żadnego wpisu dla Ling-3.1-flash. Wyróżniający się wiersz dotyczący długiego kontekstu, który faktycznie został zmierzony — AA-LCR na poziomie 0,83 — to wynik rozumowania na długim kontekście, a nie pomiar okna udostępnianego w usłudze. Traktuj 1M jako deklarowany pułap i zweryfikuj dostarczane okno własnym żądaniem z długim kontekstem, zanim zaczniesz projektować w oparciu o nie.

Jak wypada na karcie specyfikacji

Obraz wymiar po wymiarze, najpierw podmiot, w każdym wierszu:

• Łączna liczba parametrów — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.

• Aktywne parametry na token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash aktywuje ich najwięcej, co jest jednym z powodów, dla których koszt jego obsługi jest taki, jaki jest.

• Wagi i licencja — Ling-3.1-flash nieopublikowany (zastrzeżony, brak tekstu licencji) vs DeepSeek V4.1 Flash (Max) otwarty na licencji MIT vs GLM 5.3 Flash otwarty na licencji MIT.

• Deklarowany kontekst — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Wszystkie trzy deklarują ten sam limit; tylko dwa z nich mają checkpoint do pobrania, względem którego można by ten limit zweryfikować.

• Modalność — Ling-3.1-flash: tekst na wejściu, tekst na wyjściu vs DeepSeek V4.1 Flash (Max): tekst i obraz na wejściu vs GLM 5.3 Flash: tekst, obraz i wideo na wejściu. To jedyna oś, na której Ling-3.1-flash po prostu pozostaje w tyle, i żaden wiersz benchmarku tego nie rekompensuje.

• Cena w API dostawcy — Ling-3.1-flash $0.30 / $0.90 za milion tokenów wejściowych / wyjściowych w porównaniu z DeepSeek V4.1 Flash (Max) $0.30 / $1.20 w porównaniu z GLM 5.3 Flash $0.15 / $0.50.

• Wynik indeksu — 41 vs 39 vs 42. Trzy punkty rozrzutu w porównaniu trzech opcji to nie ranking; to remis rozstrzygnięty przez to, któremu z testów obciążenie czytelnika akurat najbardziej przypomina.

Gdzie możesz to wywołać

Ling-3.1-flash nie znajduje się dziś w katalogu OrcaRouter — wyszukanie w naszym publicznym API modeli dla modelu od InclusionAI zwraca wynik „nie znaleziono” i nie będziemy sugerować inaczej. Obecnie działa na własnym API Ant oraz na platformach zewnętrznych udostępniających to wydanie, i to jest uczciwy zakres jego dostępności. Warto zauważyć, że dla każdego, kto porównuje trzy powyższe modele, pozostałe dwa są teraz dostępne w routingu: zarówno DeepSeek V4.1 Flash, jak i GLM 5.3 Flash znajdują się w katalogu OrcaRouter w cenach katalogowych swoich dostawców z zerową marżą, za jednym kluczem API, z automatycznym przełączaniem awaryjnym między nimi. Jeśli z powyższego porównania wynika, że Twoje obciążenie bardziej zależy od niezawodności wiedzy niż od pracy w terminalu w trybie agentowym, GLM 5.3 Flash jest tym, którego warto wypróbować — a możesz go wypróbować w porównaniu z DeepSeek V4.1 Flash na tym samym kluczu, bez drugiej umowy czy linijki nowego kodu klienta.

Co zmienia 41, a czego nie

To, co zmienia, to pozycja tego wydania. Ling-3.1-flash nie jest już specyfikacją z dołączonym wykresem dostawcy; to model o niezależnie zmierzonej pozycji, a ta pozycja to prawdziwy skok pokoleniowy w zdolnościach agentowych względem Ling-3.0-flash — taki rodzaj skoku, który wynika ze zmiany projektu, a nie z większej mocy obliczeniowej przy tym samym przepisie. To, czego nie zmienia, to nic w kwestii zakupów. Wagi są nadal zamknięte, licencja nadal nieokreślona, modalność nadal tylko tekstowa, a cena jest około czterokrotnie wyższa niż u poprzednika za zysk, który koncentruje się w zadaniach agentowych i terminalowych.

Jeśli Twoja praca to pętle agentowe, sterowanie narzędziami i długie łańcuchy narzędzi, 41 to najbardziej znacząca liczba opublikowana dotychczas na temat tego modelu i zasługuje na poważne rozważenie, dopóki dostępność wciąż się rozszerza. Jeśli Twoja praca obejmuje multimodalność, odpowiadanie na pytania krytyczne dla wiedzy albo wrażliwą na budżet inferencję o dużej skali, 41 nie dotyczy Twojego problemu — a GLM 5.3 Flash, już dostępny w routingu i już otwarty na licencji MIT przy połowie ceny wyjściowej, jest lepiej pozycjonowanym modelem z całej trójki. Indeks mówi Ci, gdzie plasuje się Ling-3.1-flash. Nie mówi Ci, czy powinno Cię to obchodzić, a na to pytanie odpowiada to, co budujesz.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie