
Ling-3.1-flash erreicht 41 im Artificial Analysis Intelligence Index: Das 560B-MoE verdoppelt seinen Vorgänger
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Ling-3.1-flash, Ant Groups 560-Milliarden-Parameter-Mixture-of-Experts, trägt jetzt eine Zahl, die sein eigenes Labor nicht geschrieben hat: 41 auf dem Artificial Analysis Intelligence Index. Der Index wird von dem unabhängigen Evaluator auf Hardware durchgeführt, die der Evaluator kontrolliert, gegen eine feste Suite — und er platziert das Modell 21 Punkte über seinem eigenen direkten Vorgänger, Ling-3.0-flash, der immer noch bei 20 auf demselben Index liegt. Ant kündigte Ling-3.1-flash Ende September 2026 an, Artificial Analysis datiert die Veröffentlichung auf den 1. Oktober, und es ist drei Monate jünger als das Modell, das es verdoppelt.
Diese Lücke ist die Geschichte. Eine Bewegung um 21 Punkte bei einem zusammengesetzten Wert, in den zehn verschiedene Evaluierungen einfließen, ist nicht die Art von Sache, die ein Anbieterdiagramm fälschen kann, und sie ist nicht die Art von Sache, über die dieser Blog vor vierzehn Tagen hätte schreiben können, als die einzige vorhandene Messung von Ling-3.1-flash die eigene Benchmark-Karte von Ant war: 1.673 Elo bei GDPval-AA v2.1, 75,16 bei FrontierSWE, 65,35 bei HealthBench Professional. Diese Zahlen waren echte Behauptungen eines echten Labors, aber nicht reproduziert. Die 41 ist von anderer Art. Sie ist die erste Zahl in dieser Veröffentlichung, an der ein Dritter gemessen werden kann.
Was die 41 tatsächlich misst
Der Artificial Analysis Intelligence Index v4.3.2 ist ein gewichtetes Kompositum aus zehn Evaluierungen: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1. Ein Kompositum isoliert zu betrachten, ist ein Fehler, daher sind die Zeilen pro Evaluierung wichtiger als die Schlagzeile:
• GDPval-AA — 1.621,75 für Ling-3.1-flash gegenüber 948,35 für Ling-3.0-flash. Dies ist der größte einzelne Sprung im Set und derjenige, auf dem der Großteil der Indexbewegung beruht.
• GDP.pdf — 0,100 All-Pass, gestiegen von 0,054. In absoluten Zahlen noch niedrig, aber nahezu eine Verdopplung.
• AA-LCR v1.1 Langkontext-Reasoning — 0,83 gegenüber 0,73 beim Vorgänger und gleichauf mit DeepSeek V4.1 Flash (Max) bei 0,84.
• SciCode — 0,541 gegenüber 0,420. Ein Gewinn im Coding-Science-Bereich, kein Gewinn bei der Chat-Qualität.
• CritPt Physik-Reasoning — 0,180, gegenüber 0,017 zuvor. Zehnmal so viel wie der Vorgänger auf einer kleinen Basis.
• AA-Omniscience — +2,22 gegenüber −17,88 für Ling-3.0-flash. Dieser wird unten diskutiert, weil er der Schlagzeile zuwiderläuft.
Ling-3.0-flash verlor in diesen Zeilen nicht nur gegen Ling-3.1-flash; bei zwei von ihnen brach es ein. Es erreichte 0,032 auf AutomationBench-AA und exakt 0,000 auf Terminal-Bench 4.0. Das ist der Kontext, in dem die 41 gelesen werden sollte – der Vorgänger war ein effizientes, günstiges Modell mit offenen Gewichten, das praktisch überhaupt keine agentische Terminal-Fähigkeit besaß.

Woher der Gewinn kam: agentische Arbeit, nicht Konversation
Vergleicht man die Index-Beiträge von Ling-3.1-flash mit den beiden Flash-Tier-Modellen, neben die es am häufigsten gestellt wird, zeigt sich ein Muster, das das Aggregat verbirgt. DeepSeek V4.1 Flash (Max) erzielt 39 im selben Index und GLM 5.3 Flash erzielt 42, sodass alle drei innerhalb einer Spanne von drei Punkten liegen. Doch sie kommen auf unterschiedlichen Wegen dorthin.
• Agentische Terminal-Arbeit — Ling-3.1-flash 0.333 auf Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.
• Agentische Arbeit in der realen Welt — Ling-3.1-flash 1.621,75 Elo auf GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.
• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.
• Programmierwissenschaft — Ling-3.1-flash 0,541 bei SciCode, DeepSeek V4.1 Flash (Max) 0,519, GLM 5.3 Flash 0,516.
Die enge Lesart ist, dass Ling-3.1-flash bei agentischen Benchmarks konkurrenzfähig und bei SciCode leicht voraus ist. Die nützliche Lesart ist, dass es von den dreien bei den beiden agentischen Terminal-Maßen am stärksten ist, die die meisten meinen, wenn sie sagen „kann es eine Tool-Schleife steuern“ — und beim Maß für Wissenszuverlässigkeit liegt es hinter beiden zurück. Das ist ein spezifisches Profil, kein allgemeiner Sieg, und es lohnt sich, das zu benennen, bevor jemand eine Workload allein anhand der Indexzahl einkauft.
Die Rechnung, die mit einem größeren Modell kommt
Ling-3.0-flash kostete 0,07 $ pro Million Input-Tokens und 0,22 $ pro Million Output-Tokens über die eigene API von Ant, und es war Open Weights unter MIT. Ling-3.1-flash ist beides noch nicht. Artificial Analysis verzeichnet seine laufenden Kosten mit 0,30 $ pro Million Input und 0,90 $ pro Million Output – bei einem Cache-Hit-Preis von 0,06 $, einem Rabatt von 80 % auf den Input – gemessen an der eigenen API von InclusionAI als Serving-Anbieter. Das ist ungefähr eine Vervierfachung des Input-Preises gegenüber dem Modell, das es ersetzt, für einen Index-Zuwachs von 21 Punkten.
Ob sich dieser Tausch lohnt, hängt ganz von der Arbeitslast ab, und der Index selbst kann ihn beziffern: Alle zehn Intelligence Index-Evaluierungen gegen Ling-3.1-flash kosten zu diesen Sätzen etwa $960, gegenüber rund $477 für DeepSeek V4.1 Flash (Max) und $280 für GLM 5.3 Flash. Der Grund ist nicht nur die Preisliste. Ling-3.1-flash ist ein sehr redseliger Reasoner – es verbrauchte 220 Millionen Output-Tokens, um den Index zu durchlaufen, deutlich über dem Median seiner Preisklasse, und seine Evaluierungsläufe dauern durchschnittlich etwa 357 Sekunden pro Aufgabe gegenüber 285 Sekunden für DeepSeek V4.1 Flash (Max) und 979 Sekunden für GLM 5.3 Flash. Pro Aufgabe kostet Ling-3.1-flash etwa $0,99 gegenüber $0,27 bei DeepSeek und $0,25 bei GLM 5.3 Flash.
Nichts davon ist von der 41 aus sichtbar, und alles davon landet auf der Rechnung. Ein Modell kann einen Index gewinnen und ein Budget verlieren.
Die beiden Zahlen, die der Schlagzeile widersprechen
Das erste ist die Wissenszuverlässigkeit. Ling-3.1-flash erreicht +2,22 bei AA-Omniscience, was misst, ob ein Modell weiß, was es weiß: Richtige Antworten bringen Punkte, Halluzinationen kosten Punkte und Verweigerungen kosten nichts. Seine Genauigkeitsrate liegt bei 29,1 % und seine Halluzinationsrate bei 37,9 %. Neben seinen Stallgefährten ist das das schwächste Profil der Gruppe – GLM 5.3 Flash erreicht +7,47 mit einer Halluzinationsrate von 27,6 %, und DeepSeek V4.1 Flash (Max) erreicht −5,30 mit einer verblüffenden Halluzinationsrate von 96,5 % unter den beantworteten Fragen. Der Gesamtwert belohnt Ling-3.1-flash für die Fähigkeit, die es zeigt, nicht für die Zuverlässigkeit, mit der es sie zeigt, und ein Modell, das ein Drittel dessen erfindet, was es behauptet, braucht im Produktivbetrieb Retrieval um sich herum.
Das Zweite ist der Kontext. Artificial Analysis listet Ling-3.1-flash mit einem Kontextfenster von 1.000.000 Token. Auch das eigene Release-Material von Ant nennt 1M als Ziel. Doch Ants Entwicklerdokumentation, die die Fenster der Familie Modell für Modell auflistet, gibt Ling-3.0-flash ein natives 256K, erweiterbar auf 1M, und enthält noch gar keinen Eintrag für Ling-3.1-flash. Die markante Long-Context-Zeile, die tatsächlich gemessen wurde – AA-LCR bei 0,83 –, ist ein Score für Reasoning über langen Kontext, keine Messung des bereitgestellten Fensters. Betrachten Sie 1M als die erklärte Obergrenze und validieren Sie das tatsächlich gelieferte Fenster mit Ihrer eigenen Long-Context-Anfrage, bevor Sie Ihre Architektur darauf auslegen.
Wie es sich auf dem Datenblatt schlägt
Das Bild Dimension für Dimension, Subjekt zuerst, in jeder Zeile:
• Gesamtparameter — Ling-3.1-flash 560B vs. DeepSeek V4.1 Flash (Max) 552B vs. GLM 5.3 Flash 320B.
• Aktive Parameter pro Token — Ling-3.1-flash 25B vs. DeepSeek V4.1 Flash (Max) 16B vs. GLM 5.3 Flash 18B. Ling-3.1-flash aktiviert am meisten, was einer der Gründe dafür ist, dass seine Serving-Kosten so ausfallen, wie sie ausfallen.
• Gewichte und Lizenz — Ling-3.1 nicht veröffentlicht (proprietär, keine Lizenz) vs. DeepSeek V4.1 Flash (Max) offen unter MIT vs. GLM 5.3 Flash offen unter MIT.
• Angegebener Kontext — Ling-3.1-flash 1M vs. DeepSeek V4.1 Flash (Max) 1M vs. GLM 5.3 Flash 1M. Alle drei beanspruchen dieselbe Obergrenze; nur zwei von ihnen haben einen herunterladbaren Checkpoint, gegen den du sie überprüfen könntest.
• Modalität — Ling-3.1-flash Text rein, Text raus vs. DeepSeek V4.1 Flash (Max) Text und Bild rein vs. GLM 5.3 Flash Text, Bild und Video rein. Das ist die eine Achse, auf der Ling-3.1-flash schlicht zurückliegt, und keine Benchmark-Zeile macht das wett.
• Preis auf der API des Anbieters — Ling-3.1-flash 0,30 $ / 0,90 $ pro Million Input / Output vs. DeepSeek V4.1 Flash (Max) 0,30 $ / 1,20 $ vs. GLM 5.3 Flash 0,15 $ / 0,50 $.
• Indexwert — 41 vs. 39 vs. 42. Drei Punkte Streuung in einem Dreiervergleich sind kein Ranking; es ist ein Gleichstand, der danach entschieden wird, welcher Bewertung die Arbeitslast des Lesers zufällig ähnelt.
Wo Sie es anrufen können
Ling-3.1-flash ist heute nicht im OrcaRouter-Katalog – eine Abfrage gegen unsere öffentliche Modell-API für das Modell unter InclusionAI liefert not-found, und wir werden nichts anderes suggerieren. Es läuft derzeit über die eigene API von Ant und über Drittanbieterplattformen, die das Release führen, was der ehrliche Umfang seiner Verfügbarkeit ist. Erwähnenswert für alle, die die drei oben genannten Modelle vergleichen, ist, dass die anderen beiden derzeit routbar sind: DeepSeek V4.1 Flash und GLM 5.3 Flash stehen beide im OrcaRouter-Katalog zu den Listenpreisen ihrer Anbieter ohne Aufschlag, hinter einem einzigen API-Schlüssel, mit automatischem Failover zwischen ihnen. Wenn der obige Vergleich besagt, dass Ihr Workload mehr Wert auf Wissenszuverlässigkeit als auf agentische Terminal-Arbeit legt, ist GLM 5.3 Flash das Modell, das Sie ausprobieren sollten – und Sie können es gegen DeepSeek V4.1 Flash mit demselben Schlüssel testen, ohne einen zweiten Vertrag oder eine Zeile neuen Client-Code.
Was die 41 ändert – und was nicht
Was es ändert, ist der Status des Releases. Ling-3.1-flash ist keine Spezifikation mit angehängtem Hersteller-Chart mehr; es ist ein Modell mit einer unabhängig gemessenen Position, und diese Position ist ein echter Generationssprung bei der agentischen Leistungsfähigkeit gegenüber Ling-3.0-flash – die Art von Sprung, die aus einer Designänderung statt aus mehr Rechenleistung nach derselben Rezeptur entsteht. Was es nicht ändert, ist die Beschaffung in irgendeiner Hinsicht. Die Gewichte sind weiterhin geschlossen, die Lizenz ist weiterhin ungeschrieben, die Modalität ist weiterhin nur Text, und der Preis liegt etwa viermal so hoch wie der seines Vorgängers – für einen Zugewinn, der sich auf Agenten- und Terminal-Aufgaben konzentriert.
Wenn Ihre Arbeit aus Agent-Loops, Tool-Steuerung und langen Tool-Ketten besteht, ist die 41 die aussagekräftigste Zahl, die bisher über dieses Modell veröffentlicht wurde, und sie verdient einen ernsthaften Blick, solange die Verfügbarkeit noch ausgeweitet wird. Wenn Ihre Arbeit multimodal ist, oder wissenskritische Fragebeantwortung, oder budgetempfindliche Inferenz mit hohem Volumen, erreicht die 41 Ihr Problem nicht — und GLM 5.3 Flash, bereits routbar und bereits unter MIT zu halbem Output-Preis offen, ist das besser positionierte Modell der drei. Der Index sagt Ihnen, wo Ling-3.1-flash steht. Er sagt Ihnen nicht, ob Sie sich dafür interessieren sollten, und diese Frage beantwortet das, was Sie bauen.


In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
