
Ling-3.1-flash vs. Ling-3.0-flash: Was ein 1M-Token-Fenster und 4,5-mal so viele Parameter tatsächlich verändern
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 262 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Die Ling-Familie von Ant Group hat eine neue Schnell-Klasse, und dieses Mal ist sie nur einen Satz alt. Ling-3.1-flash wurde am 30. September 2026 angekündigt – rund 560 Milliarden Gesamtparameter, etwa 25 Milliarden pro Token aktiv, ein Kontextfenster, das mit bis zu 1 Million Token angegeben wird, und eine Floskel obendrauf: „Wir planen, das Modell bald als Open Source zu veröffentlichen." Das Modell, das es an der Spitze der Schnell-Reihe ablöst, Ling-3.0-flash, ist in jeder Hinsicht ein anderes Kaliber: 124 Milliarden Gesamtparameter, 5,1 Milliarden pro Token aktiv, ein ausgeliefertes Kontextfenster von 262.144 Token, MIT-lizenzierte Gewichte auf Hugging Face seit dem 7. August und ein unabhängiger Artificial Analysis Intelligence Index von 20. Eines dieser Modelle lässt sich heute herunterladen. Über das andere kann man nur lesen. Ein Vergleich der beiden ist wirklich nützlich – aber nur, wenn der Vergleich genau dort ansetzt.
Die Rechnung aus der Schlagzeile ist einfach und leicht irreführend. Ling-3.1-flash hat etwa 4,5-mal so viele Gesamtparameter wie Ling-3.0-flash und etwa 4,9-mal so viele aktive Parameter – 25 Mrd. gegenüber 5,1 Mrd. pro Token. Eine oberflächliche Lesart sagt: „Viel größeres Modell, also viel klügeres Modell.“ Die genauere Lesart ist, dass Ant das Sparsitätsverhältnis in etwa beibehalten hat, während es den Rumpf skaliert hat, und was man dadurch gewinnt, ist Kapazität, nicht unbedingt Reasoning-Tiefe pro Token: Ein Modell, das für jedes Token 25 Mrd. seiner 560 Mrd. durchleitet, verrichtet pro Token mehr Arbeit als eines, das 5,1 Mrd. durchleitet, zahlt dafür aber auch ungefähr den fünffachen Rechenaufwand pro Token, um das zu tun. Wie dieser Trade-off ausfällt, hängt ganz davon ab, ob die Architektur von Ant effizient mit den zusätzlichen Parametern umgeht – und das ist eine Frage, die die Ankündigung nicht beantwortet.
Die beiden Modelle, Seite an Seite
Stellen Sie die veröffentlichten Fakten nebeneinander, und die Generationen trennen sich sauber. Jede der folgenden Zeilen gibt an, was Ant oder ein unabhängiger Evaluator tatsächlich veröffentlicht hat; wo eine Zahl fehlt, fehlt sie, weil niemand sie veröffentlicht hat.
• Gesamtparameter — Ling-3.1-flash: ~560B (Anbieter). Ling-3.0-flash: 124B (Modellkarte).
• Aktive Parameter pro Token — Ling-3.1-flash: ~25B (Anbieter). Ling-3.0-flash: 5,1B (Modellkarte).
• Kontextfenster — Ling-3.1-flash: bis zu 1 Mio. Token (Anbieter). Ling-3.0-flash: 256K nativ, bereitgestellt mit 262.144 (Modellkarte und Inferenzrezepte).
• Gewichte und Lizenz — Ling-3.1-flash: nicht veröffentlicht; kein Repository, keine Lizenz (überprüft am 30. September und erneut am 1. Oktober 2026). Ling-3.0-flash: MIT, auf Hugging Face als inclusionAI/Ling-3.0-flash und auf ModelScope seit 7. August 2026.
• Gewichtsformate — Ling-3.1-flash: keine verfügbar. Ling-3.0-flash: BF16 (~255GB) und FP8 (~128GB) aus dem Labor, plus Community-Quantisierungen.
• Benchmark-Herkunft — Ling-3.1-flash: vollständig vom Anbieter gemeldet, keine öffentliche Testumgebung, keine Gewichte zum erneuten Ausführen. Ling-3.0-flash: unabhängig von Artificial Analysis mit einem Intelligence Index von 20 bewertet, wobei gemessene Ausgabegeschwindigkeit und Token-Generierungsvolumen daneben veröffentlicht wurden.
• Verfügbarkeit — Ling-3.1-flash: ausschließlich im eigenen Ling-Studio-Produkt von Ant. Ling-3.0-flash: selbst hostbar und zusätzlich über die Entwickler-API von Ant aufrufbar.

Wofür die zusätzliche Kapazität wahrscheinlich gedacht ist
Ants eigene einzeilige Beschreibung von Ling-3.1-flash ist das Informativste im Release. Die Ling Studio App bewirbt es mit „Allzweck-Agenten, Suche, routinemäßige Büroarbeit und Software-/Code-Entwicklung“ — eine Rahmung als Büroarbeit und Agentik, nicht als Reasoning-Benchmark. Das passt dazu, wie die Familie organisiert ist: Ling ist die Allzweck-Linie für Text und Tools, Ring ist die Reasoning-Linie und Ming kümmert sich um Multimodales. Ling-3.0-flash besetzte eine Generation zuvor denselben Slot und war explizit die schnelle, günstige Stufe statt das Flaggschiff.
Betrachtet man die Skalierung in diesem Licht, ergibt sie Sinn. Agentische Workloads und Tool-Calling-Workloads sind lang, repetitiv und kontexthungrig: Eine einzelne Agentenschleife kann Zehntausende Tokens angesammelter Tool-Ausgaben verbrauchen, bevor sie eine Aktion ausführt, weshalb ein 1-Million-Token-Fenster eine funktionale Anforderung und nicht bloß eine Verzierung im Datenblatt ist. Die Gesamtparameterzahl zu skalieren und gleichzeitig einen großen aktiven Anteil beizubehalten, ist der Weg, einem Modell Weltwissen und Tiefe bei der Anweisungsbefolgung hinzuzufügen, das dennoch schnell genug sein muss, um in einer Schleife zu sitzen. Ant baut hier kein langsameres, klügeres Flaggschiff; Ant baut eine größere schnelle Stufe.
Das Gegenargument sind die Kosten, und es ist dieselbe Rechnung, die aus der anderen Richtung kommt. Die zusätzliche Kapazität ist zur Inferenzzeit nicht kostenlos – sie wird bei jedem Token bezahlt, und Ant hat für Ling-3.1-flash überhaupt keinen Preis veröffentlicht: keine API-Preisliste, keinen Cache-Rabatt, nichts Vergleichbares zu den $0.075/$0.22 pro Million Token, die die vorherige Generation aufführt. Das ist die fehlende Zahl, die diesen Vergleich entscheiden würde, und sie fehlt.
Benchmarks und wer sie durchgeführt hat
Ling-3.1-flash kommt mit drei Werten, die isoliert betrachtet stark aussehen: 1.673 Elo auf GDPVal-AA v2.1, 75,16 auf FrontierSWE und 65,35 auf HealthBench Professional. Alle drei sind Ant-eigene Werte, stammen aus der Ankündigung, und keiner wurde von einem externen Labor reproduziert. Die praktische Konsequenz ist, dass sie mit anderen Anbieterzahlen verglichen werden können, aber nicht mit unabhängigen — und der 20-Punkte-Intelligence-Index von Artificial Analysis für Ling-3.0-flash ist eine unabhängige Zahl auf einer anderen Skala, sodass ein direkter Vergleich der beiden bedeuten würde, eine Messung mit einer Behauptung zu vergleichen. Zum Zeitpunkt des Verfassens gibt es keine Seite zu Ling-3.1-flash bei Artificial Analysis.
Eine Fußnote in der eigenen Grafik von Ant ist es wert, für sich genommen hervorgehoben zu werden. Die Karte gibt an, dass das Ergebnis von HealthBench Professional in der „AQ-Umgebung“ bewertet wurde und dass die Gesundheitsfunktionen von Ling-3.1-flash derzeit nur in AQ erfahrbar sind. Keine öffentliche Dokumentation erklärt, was AQ ist. Ein Schlagzeilen-Score, der einen unbenannten Umgebungsqualifizierer trägt, ist nichts, was ein externes Team reproduzieren kann, selbst wenn die Gewichte einmal vorliegen.
Welche man diese Woche tatsächlich verwenden sollte
Die Generationenfrage fällt unterschiedlich aus, je nachdem, was Sie heute brauchen, und für fast alle lautet die Antwort im Moment nicht das neuere Modell.
Wenn Sie diese Woche etwas zum Laufen bringen müssen, ist Ling-3.0-flash das einzige der beiden, das in einer nutzbaren Form existiert: MIT-Gewichte, die Sie selbst hosten können, FP8, wenn Sie den geringeren Speicherbedarf möchten, veröffentlichte First-Party-API-Preise und ein unabhängiger Score, der Ihnen sagt, was Sie bekommen. Es ist ein wirklich gutes Modell in seiner Klasse – die unabhängige Evaluierung platzierte es auf der Open-Weights-Pareto-Frontier für Intelligenz im Verhältnis zur Gesamtparameterzahl und bewertete seine Geschwindigkeit sehr gut, mit der Einschränkung, dass es ungewöhnlich wortreich ist und im Rahmen der Evaluierung etwa 260 Mio. Token generierte, gegenüber einem Median von nahezu 100 Mio.
Wenn Sie für die nächsten sechs Monate planen, ist Ling-3.1-flash die Richtung, in die es geht, und noch keine Komponente. Die konkreten Dinge, auf die Sie achten sollten, bevor daraus eine wird: ob die Gewichte tatsächlich offen sind und unter welcher Lizenz, ob das angebotene Kontextfenster tatsächlich 1M umfasst oder eine Erweiterung eines kürzeren nativen Kontexts ist, was es pro Million Token kostet und ob ein unabhängiges Labor die 75,16 auf FrontierSWE reproduziert. Sollte einer dieser Punkte eintreten, wäre das ein Grund, den Vergleich erneut durchzuführen. Nichts davon ist eingetreten.

Wo dies in einem Routing-Stack einzuordnen ist
Keines der Ling-Modelle ist heute in unserem Katalog — Ling-3.0-flash, Ling-3.0-flash-VL und Ling-3.1-flash {{2}}gegenüber der OrcaRouter-Modell-API{{/2}} liefern alle ein Not-found zurückgegenüber der OrcaRouter-Modell-API, die ehrliche Antwort auf „Kann ich es über euch aufrufen" ist also nein, vorerst. Wofür eine Routing-Schicht in einer Woche wie dieser tatsächlich gut ist, ist die andere Hälfte des Problems: die Modelle, gegen die man einen Kandidaten benchmarken würde. Claude Opus 5, GPT-5.6 Sol und DeepSeek-V4.1-Flash sind alle live verfügbare Routen zum Listenpreis des Anbieters ohne Aufschlag, und ein Router, der sie hinter einem einzigen Schlüssel mit automatischem Failover bündelt, ist der Weg, einen Evaluierungs-Harness auf ein bewegliches Ziel ausgerichtet zu halten, ohne vier Integrationen zu pflegen. Wenn die Gewichte von Ling-3.1-flash veröffentlicht werden und die Lizenz lesbar ist, ist das ebenfalls die Form der Entscheidung: einen Endpunkt hinzufügen, nicht den Stack neu bauen.
Die generationenübergreifende Zusammenfassung ist kurz. Ling-3.0-flash ist ein ausgeliefertes, unabhängig bewertetes, permissiv lizenziertes Modell, das sich heute selbst hosten lässt. Ling-3.1-flash ist ein größeres, kontextreicheres und teurer zu betreibendes Versprechen, das Ant noch in keiner Form geliefert hat, die ein Entwickler nutzen kann. Den zweiten als Upgrade des ersten zu betrachten, ist der Fehler, zu dem dieses Release einlädt, und die Zahlen stützen ihn noch nicht.

