Generierte redaktionelle Hero-Karte mit dem Titel „Ling-3.1-flash: angekündigt, nicht offen“ und dem Untertitel „~560B Parameter insgesamt · ~25B aktiv pro Token · bis zu 1M Kontext“. Drei beschriftete Karten lauten „Gewichte: noch nicht ausgeliefert“, „Benchmarks: nur vom Anbieter berichtet“ und „Keine Lizenz · keine Modellkarte · kein Download“.
Guides & Insights

Ling-3.1-flash wird angekündigt, nicht offen: ~560B Parameter, ein 1M-Token-Kontext und ein Diagramm, das nur Ant ausgeführt hat

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ant Groups Ling-Team hat am 30. September 2026 Zahlen zu seinem nächsten Fast-Tier-Modell vorgelegt und im selben Atemzug gesagt, dass man es noch nicht bekommen kann. Ling-3.1-flash ist ein Mixture-of-Experts-Modell mit ungefähr 560 Milliarden Parametern, das pro Token etwa 25 Milliarden Parameter aktiviert und ein Kontextfenster von bis zu 1 Million Token mitbringt – laut der Modellankündigung, die Ant über seinen eigenen @AntLingAGI-Account veröffentlichte. Der Satz, der dieses Release definiert, ist der, der auf die Spezifikationen folgt: „Wir planen, das Modell bald als Open Source zu veröffentlichen.“ Stand heute gibt es kein Ling-3.1-flash-Repository auf Hugging Face, keine Lizenz, keine herunterladbare Gewichtsdatei und keine Evaluation von irgendjemandem außerhalb von Ant Group. Was existiert, ist ein Benchmark-Diagramm, eine Live-Produktoberfläche und ein Versprechen.

Dieser Unterschied ist die ganze Geschichte, und es lohnt sich, dies unverblümt zu sagen, denn die Darstellung, die die meisten Menschen zuerst erreicht – eine Open-Weight-Veröffentlichung der 500B-Klasse aus China, die nahe an der Frontier landet – beschreibt etwas, das nicht geschehen ist. Ling-3.1-flash ist keine offene Veröffentlichung. Sie ist eine angekündigte. Die beiden liegen nicht nah beieinander, und die Lücke zwischen ihnen ist genau die Stelle, an der sich Leserinnen und Leser die Finger verbrennen können: Wenn Sie Kapazität planen, ein Pilotprojekt budgetieren oder eine Beschaffungsnotiz rund um offene Gewichte schreiben, die es noch nicht gibt, planen Sie gegen eine Pressemitteilung.

Was die Ankündigung tatsächlich enthält

Der Beitrag ist kurz, und die darin genannten Zahlen sind konkret. Ant gibt eine Gesamtparameterzahl von etwa 560 Milliarden bei rund 25 Milliarden aktiven pro Token an, ein Verhältnis von nahezu 1 zu 22 – geringfügig dichter als die Ling-3.0-flash-Generation, die es ablöst: Jenes Modell kommt auf insgesamt 124 Mrd. bei 5,1 Mrd. aktiven, etwa 1 zu 24, mit einem Umfang von weniger als einem Viertel der Größe. Der Kontext wird mit „bis zu 1 Mio. Token“ angegeben, viermal so viel wie das 262.144-Token-Fenster, das die Ling-3.0-flash-Familie heute bietet. Drei zentrale Werte werden genannt: 1.673 Elo auf GDPVal-AA v2.1, 75,16 auf FrontierSWE und 65,35 auf HealthBench Professional.

Jede einzelne dieser Zahlen ist vom Anbieter gemeldet, aus erster Hand und in keiner Form veröffentlicht, die ein Dritter erneut ausführen kann. Es gibt keinen Evaluierungs-Harness, kein Prompt-Set, keine Laufkonfiguration und keinen Seed – und, noch grundlegender, keine Gewichte, auf denen man sie laufen lassen könnte. Wenn Ants Zahlen stimmen, gehört das Modell zur Spitzenklasse chinesischer Open-Model-Veröffentlichungen; derzeit gibt es keine Möglichkeit, herauszufinden, ob sie stimmen.

Das Diagramm – und der darin eingebaute Vorbehalt

Ant Group's own Ling-3.1-flash benchmark card, published from the @AntLingAGI account on 30 September 2026. Multi-panel bar charts compare Ling-3.1-flash against GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3 and GLM 5.3 Flash, and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states that HealthBench Professional was evaluated in the AQ environment.

Ant hat Ling-3.1-flash zusammen mit einer Multi-Panel-Benchmark-Karte veröffentlicht, die es in ein Feld von Frontier- und Near-Frontier-Modellen einordnet: GPT-5.6 Sol, Claude Opus 5, Kimi K3, zwei Einträge aus der GLM-Familie und DeepSeek-V4.1-Flash. Über die Panels hinweg steht der Ling-Balken bei den agentischen und Coding-Messwerten an oder nahe der Spitze und im Mittelfeld bei den Multi-Turn- und domänenspezifischen Werten. Liest man sie als das, was sie ist – die eigene Aufgabenauswahl des Anbieters, entnommen aus einer Suite, die General-Purpose-Agent-Arbeit, Coding, Aufgaben im Bankenbereich und das Gesundheitswesen umfasst –, ist es eine glaubwürdig wirkende Karte.

Wenn man allerdings sieht, wer darauf steht, fällt eines auf. Die Frontier-Peers, für die sich Ant entschieden hat, sind GPT-5.6 Sol und Claude Opus 5. Beide dieser Modelle liegen inzwischen eine Generation zurück. Opus 5.5 und GPT-6 Sol gingen beide am 22. September 2026 live, am selben Tag, und beide sind heute routbar. Die neuesten Modelle, die Ant nicht auf die Karte gesetzt hat, sind genau die, an denen ein Leser es gemessen sehen möchte – dieselbe Beschwerde, die in der ersten Kommentarwelle zum Release aufkam: der Wunsch, dass ein im Oktober erscheinendes Modell gegen die Frontier des Oktobers statt gegen die des Juli gebenchmarkt worden wäre. Das ist kein Schlag gegen das Modell, das durchaus standhalten dürfte. Es ist ein Grund, die Karte als richtungsweisende Aussage statt als Urteil zu behandeln und festzuhalten, dass der von Ant gewählte Vergleich dem Ergebnis weniger schmeichelt, als dass er es alt aussehen lässt.

Wo man es anfassen kann, und eine unerklärte Fußnote

Es gibt heute genau einen Ort, an dem Ling-3.1-flash für einen Nutzer läuft: Ants eigenes Produkt. Die Ling-Studio-Oberfläche unter ling.tbox.cn führt Ling-3.1-flash in ihrer Modellauswahl, und die Beschreibung des Modells durch die App selbst ist breiter gefasst als die Benchmark-Karte — sie bewirbt es für „Allzweck-Agenten, Suche, Routine-Büroarbeit und Software-/Codeentwicklung“, was die vertraute Positionierung für diese Stufe ist: nicht das tiefgründigste Reasoning-Modell der Familie, sondern dasjenige, das dafür gedacht ist, ständig und kostengünstig aufgerufen zu werden.

Diese Oberfläche trägt zudem das unangenehmste Detail der Veröffentlichung. Die Fußnote der Benchmark-Karte selbst besagt, dass HealthBench Professional – die Zahl 65,35, eine der drei Zahlen im Ankündigungstext – „in der AQ-Umgebung bewertet“ wurde, und ergänzt, dass die Gesundheitsfunktionen von Ling-3.1-flash „derzeit nur in AQ erfahrbar sind“. Nichts auf der Karte erklärt, was AQ ist, und keine öffentliche Dokumentation, die wir finden konnten, definiert es. Ein Schlagzeilen-Score mit einem angehängten Umgebungszusatz, bei dem die Umgebung nicht genannt wird, ist kein reproduzierbares Ergebnis; er ist eine Produktdemo mit einer Zahl daneben.

Was erkennbar ist und was nicht

Diese Veröffentlichung in diese beiden Kategorien einzuordnen, ist das Nützlichste, was ein Leser heute damit tun kann.

Jetzt bekannt: die Parameter, die Anzahl der aktiven Parameter und das Kontextfenster, wie vom Anbieter angegeben; die drei Anbieter-Benchmarks; die Existenz des Modells im eigenen Produkt von Ant; das von Ant ausgewählte Vergleichsset; die Tatsache, dass keine Gewichte, keine Lizenz und keine Modellkarte veröffentlicht wurden; und die Tatsache, dass Artificial Analysis, die die vorherige Generation unabhängig bewertet hat, keine Ling-3.1-flash-Seite hat. Zum Zeitpunkt dieses Textes hat die unabhängige Bewertungs-Pipeline, die den 20-Punkte-Wert von Ling-3.0-flash im Intelligence Index lesbar gemacht hat, überhaupt nichts zu 3.1 veröffentlicht.

Nicht jetzt feststellbar: ob die Gewichte tatsächlich geöffnet werden und unter welcher Lizenz; ob die Architektur eine hochskalierte Version des hybriden Ling-3.0-Stacks oder etwas Neues ist; was das Modell über Ants API kostet, falls es überhaupt einen API-Preis hat; wie es sich in der Praxis unter langem Kontext verhält, im Gegensatz dazu, wie das Fenster spezifiziert wird; und ob die Benchmark-Lücken Bestand haben, wenn jemand, der nicht Ant ist, dieselben Aufgaben ausführt. Jede dieser Fragen beantwortet ein veröffentlichtes Modell am ersten Tag und ein angekündigtes Modell an einem späteren Tag, der noch nicht angesetzt wurde.

Generated two-column information card. Left column headed "Knowable today" lists five cards: "~560B total / ~25B active (vendor)", "up to 1M-token context (vendor)", "1,673 Elo GDPval-AA v2.1 (vendor)", "available in Ant's Ling Studio only" and "no independent score exists". Right column headed "Not knowable" lists five cards: "whether the weights will open", "the licence terms", "API price per million tokens", "long-context behaviour in practice" and "whether the benchmark gaps hold".

Wie man einen Tag wie diesen liest

Das Muster ist inzwischen so verbreitet, dass man es benennen kann. Ein chinesisches Labor mit starker Erfolgsbilanz veröffentlicht eine Modellkarte und ein Benchmark-Diagramm, die Zahlen landen nahe der Frontier, die Community reagiert auf die Zahlen, und die Gewichte kommen — oder auch nicht — Wochen später an. Ling-3.0-flash spielte diesen Sommer genau dieses Spiel, und es lohnt sich, sich daran zu erinnern, wie es ausging: Ant kündigte es am 24. Juli 2026 als reines API-Modell ohne Lizenzangabe und ohne unabhängigen Benchmark an, und die Gewichte unter MIT erschienen erst am 7. August auf Hugging Face, zwei Wochen nach der Ankündigung. Ling-3.1-flash befindet sich am ersten Tag an dem entsprechenden Punkt dieses Verlaufs, mit dem zusätzlichen Unterschied, dass diesmal das Versprechen, Open Source zu veröffentlichen, ausdrücklich in der Ankündigung steht statt nur angedeutet zu werden.

Keines der Modelle, die Ant als Vergleichspunkte ausgewählt hat, ist in unserem Katalog als Gegenstand des Beitrags vertreten – Ling-3.1-flash, Ling-3.0-flash und Ling-3.0-flash-VL liefern heute allesamt „not found“ im OrcaRouter-Katalog, und wir werden nichts anderes vorgeben. Doch drei der Vergleichsmodelle in diesem Chart sind derzeit routbar: Claude Opus 5, GPT-5.6 Sol und DeepSeek-V4.1-Flash liegen alle hinter einem einzigen Schlüssel, zum Listenpreis des Anbieters ohne Aufschlag, mit automatischem Failover zwischen ihnen. Das ist in einer Woche wie dieser wichtiger, als es klingt, denn der ehrliche Weg, ein angekündigtes Modell zu bewerten, besteht darin, den Vergleich durchzuführen, zu dem Ant einlädt – gegen die Modelle, die man tatsächlich aufrufen kann –, solange das Vergleichsobjekt noch ein Chart ist.

Wenn die Gewichte veröffentlicht werden, wird die nützliche Frage nicht lauten, ob Ling-3.1-flash Opus 5 bei einem einzigen Elo-Rating geschlagen hat. Sie wird lauten, ob ein ~560B-MoE mit ~25B aktiven Parametern einen 1M-Token-Kontext zu einem Preis halten kann, der die Sparsity rechtfertigt, und ob die Lizenz permissiv genug ist, um selbst zu hosten. Das sind die zwei Fragen, die die Ankündigung nicht beantwortet, und sie sind die einzigen, die entscheiden werden, ob daraus ein Modell wird, auf dem Leute aufbauen, oder eine Folie in der nächsten Präsentation von jemandem. Vorerst: Der Name ist echt, die Zahlen stammen allein von Ant, und die Gewichte sind nach wie vor lediglich ein Satz.

Generated horizontal timeline with four milestone nodes. "Jul 24, 2026 — Ling-3.0-flash announced, API-only, no weights, no licence"; "Aug 7, 2026 — MIT weights land on Hugging Face, 14 days later"; "Sep 30, 2026 — Ling-3.1-flash announced: ~560B, ~25B active, 1M context"; and a dashed open node reading "Weights: not yet — 'we plan to open-source soon'", captioned "the same point in the same arc, on day one".