
Ling-3.1-flash ist live und zwei Wochen lang kostenlos: Was das 560B MoE tatsächlich leistet
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Ling-3.1-flash, das ungefähr 560 Milliarden Parameter umfassende Mixture-of-Experts, das das inclusionAI-Labor von Ant Group am 29. und 30. September 2026 angekündigt hat, ist diese Woche keine Pressemitteilung mehr: Es beantwortet jetzt Anfragen über eine kommerzielle Live-API. Das Modell läuft als zweiwöchiger kostenloser Test auf einem Inference-Gateway eines Drittanbieters und erscheint auch in Ants eigenem Produkt Ling Studio – was die Frage von „existiert es“ zu „was leistet es tatsächlich“ verschiebt. Die Antwort ist enger gefasst, als die Schlagzeilenzahlen vermuten lassen. Ling-3.1-flash ist Text-in, Text-out; es bedient einen Kontext von 262.144 Token (256K), obwohl die Ankündigung 1 Mio. als das letztlich angestrebte Ziel nennt; seine Ausgabe ist auf 32.768 Token begrenzt; und niemand hat den Preis veröffentlicht, den man am fünfzehnten Tag zahlen wird, wenn das kostenlose Zeitfenster schließt und die Gewichte folgen sollen.
Diese Lücke zwischen der Ankündigungskarte und dem Live-Endpunkt ist das, woran man sich festhalten sollte, denn die meiste Berichterstattung über diese Veröffentlichung liest die Spezifikationen, als würde das Modell sie heute ausliefern. Tut es nicht. Ling-3.1-flash ist das zweite Modell dieses Labors in drei Monaten, das als das ankommt, was der unabhängige Tracker LLM Releases schlicht unter „weights not released“ einsortiert, und der Unterschied zwischen dem, was Ant über das Modell sagt, und dem, was ein Entwickler jetzt aufrufen kann, ist die Stelle, an der ein Budget oder ein Pilot unbemerkt schiefgehen kann.
Was hat sich zwischen der Ankündigung und heute geändert?
Die Ankündigung selbst war ein Spec-Post: ~560B Gesamtparameter, ~25B aktive pro Token, bis zu 1M Token Kontext, drei zentrale Evaluationskennzahlen und ein Versprechen – „wir planen, das Modell bald als Open Source zu veröffentlichen.“ Daran hat sich nichts geändert. Geändert hat sich die Verfügbarkeit. Innerhalb eines Tages nach der Ankündigung war das Modell auf einer kommerziellen Edge erreichbar, und die kostenlose Testversion stellt denselben echten Endpoint bereit, den auch eine kostenpflichtige Variante bieten würde: dieselbe API-Oberfläche, dieselbe Nur-Text-Modalität, derselbe Schalter für den Denkmodus für langfristig angelegte Agentenarbeit.
Für alle, die abwägen, ob sie dafür Engineering-Zeit investieren sollen, dreht sich diese Woche alles um die Testphase – und sie hat zwei Seiten. Zwei Wochen kostenlose Inferenz sind eine wirklich günstige Gelegenheit zu sehen, wie sich das Modell bei den eigenen Prompts verhält – eine Seltenheit für ein Modell dieser Größe. Doch kostenlos ist ein Aktionszustand, kein Preis. Es gibt noch nirgendwo eine veröffentlichte Tarifkarte für die Zeit nach der Testphase für Ling-3.1-flash, daher ist jedes Kostenmodell, das Sie auf der kostenlosen Stufe aufbauen, nur ein Platzhalter, bis Ant und seine Hosting-Anbieter Zahlen dazu vorlegen.
Das Datenblatt und die drei Zahlen, die noch Versprechen sind
• Parameter — insgesamt 560B, ~25B aktiv pro Token. Laut Hersteller und ungefähr das Vierfache der vorherigen Generation mit 124B insgesamt / 5,1B aktiv. Das Sparsitätsverhältnis liegt weiterhin bei etwa 1 zu 22, die Aktivierung ist also nicht dramatisch schlanker — das Modell ist einfach deutlich größer als das, das es ablöst.
• Kontext — heute werden 262.144 Tokens bereitgestellt. „Bis zu 1 Mio.“ ist das Ziel, sobald das Fenster aktiviert ist; es ist nicht das, was der Testendpunkt Ihnen liefert, und es ist die mit Abstand häufigste Fehlinterpretation dieses Releases.
• Ausgabe — maximal 32.768 Token. Angemessen für Agent-Loops, knapp, wenn Sie lange Dokumente in einem Durchgang generieren möchten.
• Modalität — Text rein, Text raus. Dies ist ein Textmodell. Vision, Audio und Dateieingabe sind nicht Teil des Launches, und dafür wurde kein Datum genannt.
• Reasoning — ein Hybrid-Stack mit einem expliziten Umschalter für den Denkmodus, dasselbe Muster, das die vorherige Generation verwendete, ausgerichtet auf mehrstufige Agenten- und Tool-Calling-Arbeit statt auf Single-Turn-Chat.
• Gewichte und Lizenz — nicht veröffentlicht. Dies ist die Zahl, die am meisten zählt und die bisher überhaupt keinen Wert hat: kein Hugging Face Repository, kein Lizenztext und kein herunterladbarer Checkpoint existieren bis heute.

Die Benchmark-Karte, gelesen mit dem Rabatt, den sie benötigt
Die eigene Berichterstattung von Ant weist Ling-3.1-flash über fünf Agenten-Benchmarks hinweg einen Gesamtwert von 81,0 zu, mit 40,4 % bei Terminal-Bench 4.0, 55,9 % bei SWE-Atlas und 65,35 % bei HealthBench Professional; die eigene Darstellung des Unternehmens ergänzt 1.673 Elo bei GDPVal-AA v2.1 und 75,16 bei FrontierSWE. Jede einzelne dieser Zahlen ist eine Eigenangabe. Es gibt kein Harness, kein Prompt-Set und keine Gewichte, mit denen irgendjemand sonst die Suite erneut ausführen könnte – was für ein Modell in diesem Stadium der übliche Vorbehalt ist. Und hier lohnt es sich, es klar auszusprechen: Ein nicht reproduzierter Anbieterwert ist eine Behauptung über ein Modell, keine Messung eines solchen.
Die Model Card ist zudem auf eine Weise informativ, die ihre Autoren möglicherweise nicht beabsichtigt haben. Das Ergebnis von 40,4 % bei Terminal-Bench 4.0 liegt deutlich hinter der Frontier-Klasse; Claude Sonnet 5.5, ein Mittelklassemodell und kein Flaggschiff, erreicht 70,6 % in derselben Version dieses Benchmarks. Die ehrliche Lesart ist nicht, dass Ling-3.1-flash schwach ist – 40,4 % sind für ein auf Kosteneffizienz ausgerichtetes Modell ein respektabler agentischer Terminal-Wert –, sondern dass die Formulierung „nahe an der Frontier bei wichtigen Benchmarks“, die am Ankündigungstag in sozialen Medien kursierte, dem Kontakt mit den konkreten Ergebniszeilen nicht standhält. Der Benchmark, bei dem das Modell am stärksten abschneidet, HealthBench Professional mit 65,35, ist zugleich derjenige, der die unangenehme Fußnote trägt: Ant gibt an, dass es in einer Umgebung namens AQ evaluiert wurde und dass die Gesundheitsfähigkeit des Modells „derzeit nur in AQ erlebt werden kann“, ohne dass an irgendeiner öffentlichen Stelle definiert wird, was AQ ist. Ein Schlagzeilenwert, an dem eine unbenannte Umgebung hängt, ist eine Demo, kein reproduzierbares Ergebnis.
Warum ein großes Modell, das als Testversion erscheint, die eigentliche Nachricht ist
Der interessantere Schritt hier ist die Abfolge, nicht die Parameter. Ling-3.0-flash ging direkt zu offenen Gewichten. Dieses hier startet zuerst als Testversion, wobei Gewichte, Lizenz und offizielle Preisgestaltung alle zurückgehalten werden und eine öffentliche Zusage besteht, erst nach Ende der kostenlosen Phase Open Source zu werden. Das ist ein Playbook für eine kommerzielle Veröffentlichung, das eine Open-Model-Ankündigung trägt, und es ist eine echte Veränderung, die man verfolgen sollte: Wenn die Gewichte unter einer permissiven Lizenz erscheinen, bekommt die Community ein 560B-Basismodell zum Fine-Tuning und Destillieren; wenn sie mit kommerziellen Auflagen kommen, war die zweiwöchige Testphase das Produkt und die „Open-Source“-Aussage Marketing. So oder so fällt die Entscheidung innerhalb des Testfensters, und darauf sollte man achten, nicht auf irgendeine einzelne Benchmark-Zeile.
Wo es läuft und das ehrliche Bild des Routings
Vorerst ist Ling-3.1-flash über die eigene Produktoberfläche des Anbieters und über Drittanbieter-Inferenzplattformen erreichbar, die die Testversion betreiben – und mehr ist es nicht. Im Katalog von OrcaRouter steht es heute nicht; eine Abfrage an unsere öffentliche Modell-API für Ling-3.1-flash, Ling-3.0-flash und die Ling-3.0-Vision-Variante gibt jeweils not-found zurück, und wir werden nichts anderes vortäuschen. Wenn ein Ant-Endpunkt allgemein verfügbar wird und einen veröffentlichten Listenpreis hat, ist das Durchreichmodell, auf dem OrcaRouter läuft – der Listenpreis des Anbieters wird ohne Aufschlag weitergegeben, sodass eine Preissenkung des Anbieters am selben Tag bei uns live ist –, genau die Vereinbarung, die zu einem Modell passt, dessen Preisgestaltung noch nicht geschrieben ist.
Was Sie heute tun können, ohne auf die Lizenzentscheidung zu warten, ist der Vergleich, der für ein unerprobtes Modell wirklich zählt: Messen Sie es an den Flash-Tier-Modellen, die Sie jetzt aufrufen können. Gemini 3.8 Flash und DeepSeek-V4.1-Flash sind beide in unserem Katalog zu den Listenpreisen ihrer Anbieter verfügbar, hinter einem einzigen API-Schlüssel, mit automatischem Failover zwischen ihnen. Bei einem Modell in einer kostenlosen Testphase, dessen Gewichte und Preisliste beide unbekannt sind, ist das die vernünftige Art, es bereitzuhalten – ein weiterer Kandidat, den Sie ansteuern können, solange die Testphase läuft, und ein Produktionspfad, der nicht davon abhängt, was am fünfzehnten Tag passiert.

Was diese Woche zu tun ist
Wenn das Modell für Ihre Arbeit relevant ist, ist die Testphase der Grund, jetzt zu handeln, statt darauf zu warten, dass sich die Open-Weight-Frage klärt – zwei Wochen kostenlose Inferenz auf einem 560B-MoE sind die günstigste Evaluierung, die Sie bekommen werden, und die Antwort auf „Hält es bei meinen Prompts stand?“ ist heute verfügbar, auch wenn die Antwort auf „Kann ich es selbst hosten?“ es nicht ist. Drei Dinge, die Sie prüfen sollten, solange das Zeitfenster offen ist, und zwar in dieser Reihenfolge:
• Führe deine eigene Workload aus, nicht die Benchmark-Karte. Die veröffentlichten Zahlen sind Ants Auswahl an Aufgaben; deine Prompts sind die, die deinen Stack bestimmen.
• Testen Sie den Kontext, den Sie tatsächlich verwenden werden. Der Endpunkt liefert 262.144 Token, nicht 1 Mio. Wenn Ihr Design von dem größeren Fenster abhängt, entwerfen Sie auf Grundlage eines Versprechens.
• Baue kein Kostenmodell auf „kostenlos“ auf. „Kostenlos“ ist ein Zustand von zwei Wochen. Plane bis zur Veröffentlichung einer Preisliste den Wechsel zurück zu einem kostenpflichtigen Flash-Tier-Modell als Standard ein und behandle Ling-3.1-flash als zusätzliche Kapazität.
Die Ankündigung ist echt und das Modell läuft – was mehr ist, als man noch vor einer Woche sagen konnte. Aber „veröffentlicht und offen“ und „im Testbetrieb laufend“ sind unterschiedliche Zustände, und dieser ist eindeutig der zweite – eine 560B-Spezifikation, ein 256K-Endpunkt, eine nur vom Anbieter bereitgestellte Benchmark-Karte und ein Zwei-Wochen-Countdown, der die einzige feste Deadline in der gesamten Veröffentlichung ist.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
