
Ling-3.1-flash osiąga 41 punktów w Artificial Analysis Intelligence Index: 560B MoE podwaja wynik poprzednika
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Ling-3.1-flash, mieszanka ekspertów Ant Group z 560 miliardami parametrów, ma teraz liczbę, której nie zapisało jego własne laboratorium: 41 w Artificial Analysis Intelligence Index. Indeks prowadzi niezależny ewaluator, na kontrolowanym przez siebie sprzęcie, według stałego zestawu testów — i plasuje ten model 21 punktów wyżej niż jego bezpośredniego poprzednika, Ling-3.0-flash, który nadal ma 20 punktów w tym samym indeksie. Ant ogłosił Ling-3.1-flash pod koniec września 2026 r., Artificial Analysis datuje premierę na 1 października, a model jest o trzy miesiące młodszy od tego, którego wynik podwaja.
Ta różnica jest sednem. Skok o 21 punktów w kompozycie zasilanym przez dziesięć różnych ewaluacji nie jest czymś, co wykres dostawcy mógłby sfałszować, i nie jest czymś, o czym ten blog mógłby napisać dwa tygodnie temu, kiedy jedynym istniejącym pomiarem Ling-3.1-flash był własny raport Ant: 1673 Elo w GDPval v2, 75,16 w FrontierSWE, 65,35 w FrontierSWE. Te liczby były twierdzeniami laboratorium, ale nieodtworzonymi. Liczba 41 jest innego rodzaju. To pierwsza liczba w tym wydaniu, za którą może odpowiadać strona trzecia.
Co faktycznie mierzy 41
Artificial Analysis Intelligence Index v4.3.2 to ważony kompozyt dziesięciu ewaluacji: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR v1.1. Czytanie kompozytu w izolacji to błąd, więc wiersze dla poszczególnych ewaluacji mają większe znaczenie niż wynik główny:
• GDPval-AA — 1621,75 dla Ling-3.1-flash wobec 948,35 dla Ling-3.0-flash. To największy pojedynczy skok w zestawie i ten, na którym opiera się większość ruchu indeksu.
• GDP.pdf — 0,100 we wszystkich zaliczeniach, w górę z 0,054. Wciąż nisko w ujęciu absolutnym, ale to niemal podwojenie.
• AA-LCR v1.1 rozumowanie w długim kontekście — 0,83 wobec 0,73 dla poprzednika i na równi z DeepSeek V4.1 Flash (Max) z wynikiem 0,84.
• SciCode — 0,541 wobec 0,420. Zysk w zakresie nauki kodowania, a nie zysk w jakości czatu.
• Rozumowanie fizyczne CritPt — 0,180 wobec 0,017 wcześniej. Dziesięć razy więcej niż poprzednik na małej bazie.
• AA-Omniscience — +2,22, w porównaniu z −17,88 dla Ling-3.0-flash. Omówiono to poniżej, ponieważ stoi w sprzeczności z głównym przekazem.
Ling-3.0-flash nie tylko przegrał z Ling-3.1-flash na tych wierszach; załamał się na dwóch z nich. Uzyskał 0,032 w AutomationBench-AA i dokładnie 0,000 w Terminal-Bench 4.0. To jest kontekst, w którym należy odczytywać 41 — poprzednik był wydajnym, tanim modelem o otwartych wagach, który zasadniczo nie miał żadnych zdolności agentowo-terminalowych.

Skąd wziął się wzrost: praca agentowa, a nie rozmowa
Porównaj wkład Ling-3.1-flash w indeks z dwoma modelami klasy Flash, z którymi najczęściej jest zestawiany, a ujawni się wzorzec, który ukrywa agregat. DeepSeek V4.1 Flash (Max) notuje 39 w tym samym indeksie, a GLM 5.3 Flash notuje 42, więc wszystkie trzy mieszczą się w przedziale trzech punktów. Ale osiągają to z różnych miejsc.
• Praca agentowa w terminalu — Ling-3.1-flash 0,333 w Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0,268, GLM 5.3 Flash 0,328.
• Praca agentowa w świecie rzeczywistym — Ling-3.1-flash 1 621,75 Elo w GDPval-AA, DeepSeek V4.1 Flash (Max) 1 600, GLM 5.3 Flash 1 646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Nauka kodowania — Ling-3.1-flash 0,541 w SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.
Wąska interpretacja jest taka, że Ling-3.1-flash jest konkurencyjny w benchmarkach agentowych i ma nieznaczną przewagę w SciCode. Użyteczna interpretacja jest taka, że jest najsilniejszy z całej trójki w dwóch miarach agentowo-terminalowych, które większość ludzi ma na myśli, mówiąc „czy potrafi prowadzić pętlę narzędziową” — a pod względem niezawodności wiedzy ustępuje obu pozostałym. To konkretny profil, a nie ogólne zwycięstwo, i warto go nazwać, zanim ktokolwiek kupi workload wyłącznie na podstawie samej liczby indeksowej.
Rachunek, który przychodzi z większym modelem
Ling-3.0-flash był wyceniany na 0,07 USD za milion tokenów wejściowych i 0,22 USD za milion tokenów wyjściowych w API samego Ant, a jego wagi były otwarte na licencji MIT. Ling-3.1-flash nie jest jeszcze ani jednym, ani drugim. Artificial Analysis odnotowuje jego koszt działania na poziomie 0,30 USD za milion tokenów wejściowych i 0,90 USD za milion tokenów wyjściowych — ze stawką 0,06 USD za trafienie w cache, czyli 80% zniżki od ceny wejścia — mierzonym względem własnego API InclusionAI jako dostawcy usług. To mniej więcej czterokrotny wzrost ceny tokenów wejściowych w porównaniu z poprzednim modelem, w zamian za 21 punktów indeksu.
Czy ten kompromis się opłaca, zależy w całości od obciążenia, a sam indeks potrafi to wycenić: uruchomienie wszystkich dziesięciu ewaluacji Intelligence Index na Ling-3.1-flash kosztuje około 960 USD przy tych stawkach, wobec około 477 USD dla DeepSeek V4.1 Flash (Max) i 280 USD dla GLM 5.3 Flash. Powód to nie tylko cennik. Ling-3.1-flash to bardzo gadatliwy model rozumujący — zużył 220 milionów tokenów wyjściowych, przechodząc przez indeks, znacznie powyżej mediany dla swojej półki cenowej, a jego przebiegi ewaluacji zajmują średnio około 357 sekund na zadanie wobec 285 sekund dla DeepSeek V4.1 Flash (Max) i 979 sekund dla GLM 5.3 Flash. W przeliczeniu na zadanie Ling-3.1-flash kosztuje około 0,99 USD wobec 0,27 USD w przypadku DeepSeek i 0,25 USD w przypadku GLM 5.3 Flash.
Nic z tego nie widać z 41, a wszystko to trafia na fakturę. Model może wygrać indeks, a przegrać budżet.
Dwie liczby, które przeczą nagłówkowi
Pierwsza to wiarygodność wiedzy. Ling-3.1-flash uzyskuje +2.22 w AA-Omniscience, które mierzy, czy model wie, co wie: poprawne odpowiedzi zdobywają punkty, halucynacje kosztują punkty, a odmowy nie kosztują nic. Jego wskaźnik dokładności wynosi 29.1%, a wskaźnik halucynacji 37.9%. Postawiony obok modeli z tej samej rodziny, to najsłabszy profil w grupie — GLM 5.3 Flash uzyskuje +7.47 przy wskaźniku halucynacji 27.6%, a DeepSeek V4.1 Flash (Max) uzyskuje −5.30 przy oszałamiającym wskaźniku halucynacji 96.5% wśród udzielonych odpowiedzi. Wynik złożony nagradza Ling-3.1-flash za zdolność, którą demonstruje, a nie za wiarygodność, z jaką ją demonstruje, a model, który zmyśla jedną trzecią tego, co twierdzi, wymaga w środowisku produkcyjnym mechanizmu wyszukiwania wokół siebie.
Drugi aspekt to kontekst. Artificial Analysis wymienia Ling-3.1-flash z oknem kontekstowym wynoszącym 1 000 000 tokenów. Materiały premierowe samego Ant również podają 1M jako wartość docelową. Ale dokumentacja deweloperska Ant, która wylicza okna tej rodziny model po modelu, podaje dla Ling-3.0-flash natywne 256K z możliwością rozszerzenia do 1M, a nie zawiera jeszcze żadnego wpisu dla Ling-3.1-flash. Wyróżniający się wiersz dotyczący długiego kontekstu, który faktycznie został zmierzony — AA-LCR na poziomie 0,83 — to wynik rozumowania na długim kontekście, a nie pomiar okna udostępnianego w usłudze. Traktuj 1M jako deklarowany pułap i zweryfikuj dostarczane okno własnym żądaniem z długim kontekstem, zanim zaczniesz projektować w oparciu o nie.
Jak wypada na karcie specyfikacji
Obraz wymiar po wymiarze, najpierw podmiot, w każdym wierszu:
• Łączna liczba parametrów — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.
• Aktywne parametry na token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash aktywuje ich najwięcej, co jest jednym z powodów, dla których koszt jego obsługi jest taki, jaki jest.
• Wagi i licencja — Ling-3.1-flash nieopublikowany (zastrzeżony, brak tekstu licencji) vs DeepSeek V4.1 Flash (Max) otwarty na licencji MIT vs GLM 5.3 Flash otwarty na licencji MIT.
• Deklarowany kontekst — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Wszystkie trzy deklarują ten sam limit; tylko dwa z nich mają checkpoint do pobrania, względem którego można by ten limit zweryfikować.
• Modalność — Ling-3.1-flash: tekst na wejściu, tekst na wyjściu vs DeepSeek V4.1 Flash (Max): tekst i obraz na wejściu vs GLM 5.3 Flash: tekst, obraz i wideo na wejściu. To jedyna oś, na której Ling-3.1-flash po prostu pozostaje w tyle, i żaden wiersz benchmarku tego nie rekompensuje.
• Cena w API dostawcy — Ling-3.1-flash $0.30 / $0.90 za milion tokenów wejściowych / wyjściowych w porównaniu z DeepSeek V4.1 Flash (Max) $0.30 / $1.20 w porównaniu z GLM 5.3 Flash $0.15 / $0.50.
• Wynik indeksu — 41 vs 39 vs 42. Trzy punkty rozrzutu w porównaniu trzech opcji to nie ranking; to remis rozstrzygnięty przez to, któremu z testów obciążenie czytelnika akurat najbardziej przypomina.
Gdzie możesz to wywołać
Ling-3.1-flash nie znajduje się dziś w katalogu OrcaRouter — wyszukanie w naszym publicznym API modeli dla modelu od InclusionAI zwraca wynik „nie znaleziono” i nie będziemy sugerować inaczej. Obecnie działa na własnym API Ant oraz na platformach zewnętrznych udostępniających to wydanie, i to jest uczciwy zakres jego dostępności. Warto zauważyć, że dla każdego, kto porównuje trzy powyższe modele, pozostałe dwa są teraz dostępne w routingu: zarówno DeepSeek V4.1 Flash, jak i GLM 5.3 Flash znajdują się w katalogu OrcaRouter w cenach katalogowych swoich dostawców z zerową marżą, za jednym kluczem API, z automatycznym przełączaniem awaryjnym między nimi. Jeśli z powyższego porównania wynika, że Twoje obciążenie bardziej zależy od niezawodności wiedzy niż od pracy w terminalu w trybie agentowym, GLM 5.3 Flash jest tym, którego warto wypróbować — a możesz go wypróbować w porównaniu z DeepSeek V4.1 Flash na tym samym kluczu, bez drugiej umowy czy linijki nowego kodu klienta.
Co zmienia 41, a czego nie
To, co zmienia, to pozycja tego wydania. Ling-3.1-flash nie jest już specyfikacją z dołączonym wykresem dostawcy; to model o niezależnie zmierzonej pozycji, a ta pozycja to prawdziwy skok pokoleniowy w zdolnościach agentowych względem Ling-3.0-flash — taki rodzaj skoku, który wynika ze zmiany projektu, a nie z większej mocy obliczeniowej przy tym samym przepisie. To, czego nie zmienia, to nic w kwestii zakupów. Wagi są nadal zamknięte, licencja nadal nieokreślona, modalność nadal tylko tekstowa, a cena jest około czterokrotnie wyższa niż u poprzednika za zysk, który koncentruje się w zadaniach agentowych i terminalowych.
Jeśli Twoja praca to pętle agentowe, sterowanie narzędziami i długie łańcuchy narzędzi, 41 to najbardziej znacząca liczba opublikowana dotychczas na temat tego modelu i zasługuje na poważne rozważenie, dopóki dostępność wciąż się rozszerza. Jeśli Twoja praca obejmuje multimodalność, odpowiadanie na pytania krytyczne dla wiedzy albo wrażliwą na budżet inferencję o dużej skali, 41 nie dotyczy Twojego problemu — a GLM 5.3 Flash, już dostępny w routingu i już otwarty na licencji MIT przy połowie ceny wyjściowej, jest lepiej pozycjonowanym modelem z całej trójki. Indeks mówi Ci, gdzie plasuje się Ling-3.1-flash. Nie mówi Ci, czy powinno Cię to obchodzić, a na to pytanie odpowiada to, co budujesz.


Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
