Generierte redaktionelle Hero-Karte mit dem Titel „Ling-3.1-flash vs Ling-3.0-flash“ und dem Untertitel „Eines ist heute herunterladbar. Das andere ist ein Satz in einem Pressetext.“ Zwei Vergleichsspalten: „Ling-3.1-flash (angekündigt)“ listet „~560 Mrd. gesamt / ~25 Mrd. aktiv“, „bis zu 1M-Token-Kontext“ und „keine Gewichte, keine Lizenz“; „Ling-3.0-flash (erschienen)“ listet „124 Mrd. gesamt / 5,1 Mrd. aktiv“, „bereitgestellter Kontext von 262.144 Token“ und „MIT-Gewichte auf Hugging Face“.
Guides & Insights

Ling-3.1-flash vs. Ling-3.0-flash: Was ein 1M-Token-Fenster und 4,5-mal so viele Parameter tatsächlich verändern

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Ling-Familie von Ant Group hat eine neue Schnell-Klasse, und dieses Mal ist sie nur einen Satz alt. Ling-3.1-flash wurde am 30. September 2026 angekündigt – rund 560 Milliarden Gesamtparameter, etwa 25 Milliarden pro Token aktiv, ein Kontextfenster, das mit bis zu 1 Million Token angegeben wird, und eine Floskel obendrauf: „Wir planen, das Modell bald als Open Source zu veröffentlichen." Das Modell, das es an der Spitze der Schnell-Reihe ablöst, Ling-3.0-flash, ist in jeder Hinsicht ein anderes Kaliber: 124 Milliarden Gesamtparameter, 5,1 Milliarden pro Token aktiv, ein ausgeliefertes Kontextfenster von 262.144 Token, MIT-lizenzierte Gewichte auf Hugging Face seit dem 7. August und ein unabhängiger Artificial Analysis Intelligence Index von 20. Eines dieser Modelle lässt sich heute herunterladen. Über das andere kann man nur lesen. Ein Vergleich der beiden ist wirklich nützlich – aber nur, wenn der Vergleich genau dort ansetzt.

Die Rechnung aus der Schlagzeile ist einfach und leicht irreführend. Ling-3.1-flash hat etwa 4,5-mal so viele Gesamtparameter wie Ling-3.0-flash und etwa 4,9-mal so viele aktive Parameter – 25 Mrd. gegenüber 5,1 Mrd. pro Token. Eine oberflächliche Lesart sagt: „Viel größeres Modell, also viel klügeres Modell.“ Die genauere Lesart ist, dass Ant das Sparsitätsverhältnis in etwa beibehalten hat, während es den Rumpf skaliert hat, und was man dadurch gewinnt, ist Kapazität, nicht unbedingt Reasoning-Tiefe pro Token: Ein Modell, das für jedes Token 25 Mrd. seiner 560 Mrd. durchleitet, verrichtet pro Token mehr Arbeit als eines, das 5,1 Mrd. durchleitet, zahlt dafür aber auch ungefähr den fünffachen Rechenaufwand pro Token, um das zu tun. Wie dieser Trade-off ausfällt, hängt ganz davon ab, ob die Architektur von Ant effizient mit den zusätzlichen Parametern umgeht – und das ist eine Frage, die die Ankündigung nicht beantwortet.

Die beiden Modelle, Seite an Seite

Stellen Sie die veröffentlichten Fakten nebeneinander, und die Generationen trennen sich sauber. Jede der folgenden Zeilen gibt an, was Ant oder ein unabhängiger Evaluator tatsächlich veröffentlicht hat; wo eine Zahl fehlt, fehlt sie, weil niemand sie veröffentlicht hat.

• Gesamtparameter — Ling-3.1-flash: ~560B (Anbieter). Ling-3.0-flash: 124B (Modellkarte).

• Aktive Parameter pro Token — Ling-3.1-flash: ~25B (Anbieter). Ling-3.0-flash: 5,1B (Modellkarte).

• Kontextfenster — Ling-3.1-flash: bis zu 1 Mio. Token (Anbieter). Ling-3.0-flash: 256K nativ, bereitgestellt mit 262.144 (Modellkarte und Inferenzrezepte).

• Gewichte und Lizenz — Ling-3.1-flash: nicht veröffentlicht; kein Repository, keine Lizenz (überprüft am 30. September und erneut am 1. Oktober 2026). Ling-3.0-flash: MIT, auf Hugging Face als inclusionAI/Ling-3.0-flash und auf ModelScope seit 7. August 2026.

• Gewichtsformate — Ling-3.1-flash: keine verfügbar. Ling-3.0-flash: BF16 (~255GB) und FP8 (~128GB) aus dem Labor, plus Community-Quantisierungen.

• Benchmark-Herkunft — Ling-3.1-flash: vollständig vom Anbieter gemeldet, keine öffentliche Testumgebung, keine Gewichte zum erneuten Ausführen. Ling-3.0-flash: unabhängig von Artificial Analysis mit einem Intelligence Index von 20 bewertet, wobei gemessene Ausgabegeschwindigkeit und Token-Generierungsvolumen daneben veröffentlicht wurden.

• Verfügbarkeit — Ling-3.1-flash: ausschließlich im eigenen Ling-Studio-Produkt von Ant. Ling-3.0-flash: selbst hostbar und zusätzlich über die Entwickler-API von Ant aufrufbar.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Wofür die zusätzliche Kapazität wahrscheinlich gedacht ist

Ants eigene einzeilige Beschreibung von Ling-3.1-flash ist das Informativste im Release. Die Ling Studio App bewirbt es mit „Allzweck-Agenten, Suche, routinemäßige Büroarbeit und Software-/Code-Entwicklung“ — eine Rahmung als Büroarbeit und Agentik, nicht als Reasoning-Benchmark. Das passt dazu, wie die Familie organisiert ist: Ling ist die Allzweck-Linie für Text und Tools, Ring ist die Reasoning-Linie und Ming kümmert sich um Multimodales. Ling-3.0-flash besetzte eine Generation zuvor denselben Slot und war explizit die schnelle, günstige Stufe statt das Flaggschiff.

Betrachtet man die Skalierung in diesem Licht, ergibt sie Sinn. Agentische Workloads und Tool-Calling-Workloads sind lang, repetitiv und kontexthungrig: Eine einzelne Agentenschleife kann Zehntausende Tokens angesammelter Tool-Ausgaben verbrauchen, bevor sie eine Aktion ausführt, weshalb ein 1-Million-Token-Fenster eine funktionale Anforderung und nicht bloß eine Verzierung im Datenblatt ist. Die Gesamtparameterzahl zu skalieren und gleichzeitig einen großen aktiven Anteil beizubehalten, ist der Weg, einem Modell Weltwissen und Tiefe bei der Anweisungsbefolgung hinzuzufügen, das dennoch schnell genug sein muss, um in einer Schleife zu sitzen. Ant baut hier kein langsameres, klügeres Flaggschiff; Ant baut eine größere schnelle Stufe.

Das Gegenargument sind die Kosten, und es ist dieselbe Rechnung, die aus der anderen Richtung kommt. Die zusätzliche Kapazität ist zur Inferenzzeit nicht kostenlos – sie wird bei jedem Token bezahlt, und Ant hat für Ling-3.1-flash überhaupt keinen Preis veröffentlicht: keine API-Preisliste, keinen Cache-Rabatt, nichts Vergleichbares zu den $0.075/$0.22 pro Million Token, die die vorherige Generation aufführt. Das ist die fehlende Zahl, die diesen Vergleich entscheiden würde, und sie fehlt.

Benchmarks und wer sie durchgeführt hat

Ling-3.1-flash kommt mit drei Werten, die isoliert betrachtet stark aussehen: 1.673 Elo auf GDPVal-AA v2.1, 75,16 auf FrontierSWE und 65,35 auf HealthBench Professional. Alle drei sind Ant-eigene Werte, stammen aus der Ankündigung, und keiner wurde von einem externen Labor reproduziert. Die praktische Konsequenz ist, dass sie mit anderen Anbieterzahlen verglichen werden können, aber nicht mit unabhängigen — und der 20-Punkte-Intelligence-Index von Artificial Analysis für Ling-3.0-flash ist eine unabhängige Zahl auf einer anderen Skala, sodass ein direkter Vergleich der beiden bedeuten würde, eine Messung mit einer Behauptung zu vergleichen. Zum Zeitpunkt des Verfassens gibt es keine Seite zu Ling-3.1-flash bei Artificial Analysis.

Eine Fußnote in der eigenen Grafik von Ant ist es wert, für sich genommen hervorgehoben zu werden. Die Karte gibt an, dass das Ergebnis von HealthBench Professional in der „AQ-Umgebung“ bewertet wurde und dass die Gesundheitsfunktionen von Ling-3.1-flash derzeit nur in AQ erfahrbar sind. Keine öffentliche Dokumentation erklärt, was AQ ist. Ein Schlagzeilen-Score, der einen unbenannten Umgebungsqualifizierer trägt, ist nichts, was ein externes Team reproduzieren kann, selbst wenn die Gewichte einmal vorliegen.

Welche man diese Woche tatsächlich verwenden sollte

Die Generationenfrage fällt unterschiedlich aus, je nachdem, was Sie heute brauchen, und für fast alle lautet die Antwort im Moment nicht das neuere Modell.

Wenn Sie diese Woche etwas zum Laufen bringen müssen, ist Ling-3.0-flash das einzige der beiden, das in einer nutzbaren Form existiert: MIT-Gewichte, die Sie selbst hosten können, FP8, wenn Sie den geringeren Speicherbedarf möchten, veröffentlichte First-Party-API-Preise und ein unabhängiger Score, der Ihnen sagt, was Sie bekommen. Es ist ein wirklich gutes Modell in seiner Klasse – die unabhängige Evaluierung platzierte es auf der Open-Weights-Pareto-Frontier für Intelligenz im Verhältnis zur Gesamtparameterzahl und bewertete seine Geschwindigkeit sehr gut, mit der Einschränkung, dass es ungewöhnlich wortreich ist und im Rahmen der Evaluierung etwa 260 Mio. Token generierte, gegenüber einem Median von nahezu 100 Mio.

Wenn Sie für die nächsten sechs Monate planen, ist Ling-3.1-flash die Richtung, in die es geht, und noch keine Komponente. Die konkreten Dinge, auf die Sie achten sollten, bevor daraus eine wird: ob die Gewichte tatsächlich offen sind und unter welcher Lizenz, ob das angebotene Kontextfenster tatsächlich 1M umfasst oder eine Erweiterung eines kürzeren nativen Kontexts ist, was es pro Million Token kostet und ob ein unabhängiges Labor die 75,16 auf FrontierSWE reproduziert. Sollte einer dieser Punkte eintreten, wäre das ein Grund, den Vergleich erneut durchzuführen. Nichts davon ist eingetreten.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Wo dies in einem Routing-Stack einzuordnen ist

Keines der Ling-Modelle ist heute in unserem Katalog — Ling-3.0-flash, Ling-3.0-flash-VL und Ling-3.1-flash {{2}}gegenüber der OrcaRouter-Modell-API{{/2}} liefern alle ein Not-found zurückgegenüber der OrcaRouter-Modell-API, die ehrliche Antwort auf „Kann ich es über euch aufrufen" ist also nein, vorerst. Wofür eine Routing-Schicht in einer Woche wie dieser tatsächlich gut ist, ist die andere Hälfte des Problems: die Modelle, gegen die man einen Kandidaten benchmarken würde. Claude Opus 5, GPT-5.6 Sol und DeepSeek-V4.1-Flash sind alle live verfügbare Routen zum Listenpreis des Anbieters ohne Aufschlag, und ein Router, der sie hinter einem einzigen Schlüssel mit automatischem Failover bündelt, ist der Weg, einen Evaluierungs-Harness auf ein bewegliches Ziel ausgerichtet zu halten, ohne vier Integrationen zu pflegen. Wenn die Gewichte von Ling-3.1-flash veröffentlicht werden und die Lizenz lesbar ist, ist das ebenfalls die Form der Entscheidung: einen Endpunkt hinzufügen, nicht den Stack neu bauen.

Die generationenübergreifende Zusammenfassung ist kurz. Ling-3.0-flash ist ein ausgeliefertes, unabhängig bewertetes, permissiv lizenziertes Modell, das sich heute selbst hosten lässt. Ling-3.1-flash ist ein größeres, kontextreicheres und teurer zu betreibendes Versprechen, das Ant noch in keiner Form geliefert hat, die ein Entwickler nutzen kann. Den zweiten als Upgrade des ersten zu betrachten, ist der Fehler, zu dem dieses Release einlädt, und die Zahlen stützen ihn noch nicht.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".