Generierte redaktionelle Hero-Karte mit dem Titel „Ling-3.1-flash ist live und zwei Wochen lang kostenlos“ und dem Untertitel „Was das 560B-MoE heute tatsächlich leistet“. Vier abgerundete Karten zeigen „Parameter: 560B insgesamt / ~25B aktiv“, „Kontext: 262.144 Tokens“, „Ausgabelimit: 32.768 Tokens“ und „Gewichte: nicht veröffentlicht“, über einer Fußzeile mit dem Text „Vom Anbieter angegebene Spezifikationen; kein veröffentlichter Preis nach der Testphase.“
Guides & Insights

Ling-3.1-flash ist live und zwei Wochen lang kostenlos: Was das 560B MoE tatsächlich leistet

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ling-3.1-flash, das ungefähr 560 Milliarden Parameter umfassende Mixture-of-Experts, das das inclusionAI-Labor von Ant Group am 29. und 30. September 2026 angekündigt hat, ist diese Woche keine Pressemitteilung mehr: Es beantwortet jetzt Anfragen über eine kommerzielle Live-API. Das Modell läuft als zweiwöchiger kostenloser Test auf einem Inference-Gateway eines Drittanbieters und erscheint auch in Ants eigenem Produkt Ling Studio – was die Frage von „existiert es“ zu „was leistet es tatsächlich“ verschiebt. Die Antwort ist enger gefasst, als die Schlagzeilenzahlen vermuten lassen. Ling-3.1-flash ist Text-in, Text-out; es bedient einen Kontext von 262.144 Token (256K), obwohl die Ankündigung 1 Mio. als das letztlich angestrebte Ziel nennt; seine Ausgabe ist auf 32.768 Token begrenzt; und niemand hat den Preis veröffentlicht, den man am fünfzehnten Tag zahlen wird, wenn das kostenlose Zeitfenster schließt und die Gewichte folgen sollen.

Diese Lücke zwischen der Ankündigungskarte und dem Live-Endpunkt ist das, woran man sich festhalten sollte, denn die meiste Berichterstattung über diese Veröffentlichung liest die Spezifikationen, als würde das Modell sie heute ausliefern. Tut es nicht. Ling-3.1-flash ist das zweite Modell dieses Labors in drei Monaten, das als das ankommt, was der unabhängige Tracker LLM Releases schlicht unter „weights not released“ einsortiert, und der Unterschied zwischen dem, was Ant über das Modell sagt, und dem, was ein Entwickler jetzt aufrufen kann, ist die Stelle, an der ein Budget oder ein Pilot unbemerkt schiefgehen kann.

Was hat sich zwischen der Ankündigung und heute geändert?

Die Ankündigung selbst war ein Spec-Post: ~560B Gesamtparameter, ~25B aktive pro Token, bis zu 1M Token Kontext, drei zentrale Evaluationskennzahlen und ein Versprechen – „wir planen, das Modell bald als Open Source zu veröffentlichen.“ Daran hat sich nichts geändert. Geändert hat sich die Verfügbarkeit. Innerhalb eines Tages nach der Ankündigung war das Modell auf einer kommerziellen Edge erreichbar, und die kostenlose Testversion stellt denselben echten Endpoint bereit, den auch eine kostenpflichtige Variante bieten würde: dieselbe API-Oberfläche, dieselbe Nur-Text-Modalität, derselbe Schalter für den Denkmodus für langfristig angelegte Agentenarbeit.

Für alle, die abwägen, ob sie dafür Engineering-Zeit investieren sollen, dreht sich diese Woche alles um die Testphase – und sie hat zwei Seiten. Zwei Wochen kostenlose Inferenz sind eine wirklich günstige Gelegenheit zu sehen, wie sich das Modell bei den eigenen Prompts verhält – eine Seltenheit für ein Modell dieser Größe. Doch kostenlos ist ein Aktionszustand, kein Preis. Es gibt noch nirgendwo eine veröffentlichte Tarifkarte für die Zeit nach der Testphase für Ling-3.1-flash, daher ist jedes Kostenmodell, das Sie auf der kostenlosen Stufe aufbauen, nur ein Platzhalter, bis Ant und seine Hosting-Anbieter Zahlen dazu vorlegen.

Das Datenblatt und die drei Zahlen, die noch Versprechen sind

• Parameter — insgesamt 560B, ~25B aktiv pro Token. Laut Hersteller und ungefähr das Vierfache der vorherigen Generation mit 124B insgesamt / 5,1B aktiv. Das Sparsitätsverhältnis liegt weiterhin bei etwa 1 zu 22, die Aktivierung ist also nicht dramatisch schlanker — das Modell ist einfach deutlich größer als das, das es ablöst.

• Kontext — heute werden 262.144 Tokens bereitgestellt. „Bis zu 1 Mio.“ ist das Ziel, sobald das Fenster aktiviert ist; es ist nicht das, was der Testendpunkt Ihnen liefert, und es ist die mit Abstand häufigste Fehlinterpretation dieses Releases.

• Ausgabe — maximal 32.768 Token. Angemessen für Agent-Loops, knapp, wenn Sie lange Dokumente in einem Durchgang generieren möchten.

• Modalität — Text rein, Text raus. Dies ist ein Textmodell. Vision, Audio und Dateieingabe sind nicht Teil des Launches, und dafür wurde kein Datum genannt.

• Reasoning — ein Hybrid-Stack mit einem expliziten Umschalter für den Denkmodus, dasselbe Muster, das die vorherige Generation verwendete, ausgerichtet auf mehrstufige Agenten- und Tool-Calling-Arbeit statt auf Single-Turn-Chat.

• Gewichte und Lizenz — nicht veröffentlicht. Dies ist die Zahl, die am meisten zählt und die bisher überhaupt keinen Wert hat: kein Hugging Face Repository, kein Lizenztext und kein herunterladbarer Checkpoint existieren bis heute.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

Die Benchmark-Karte, gelesen mit dem Rabatt, den sie benötigt

Die eigene Berichterstattung von Ant weist Ling-3.1-flash über fünf Agenten-Benchmarks hinweg einen Gesamtwert von 81,0 zu, mit 40,4 % bei Terminal-Bench 4.0, 55,9 % bei SWE-Atlas und 65,35 % bei HealthBench Professional; die eigene Darstellung des Unternehmens ergänzt 1.673 Elo bei GDPVal-AA v2.1 und 75,16 bei FrontierSWE. Jede einzelne dieser Zahlen ist eine Eigenangabe. Es gibt kein Harness, kein Prompt-Set und keine Gewichte, mit denen irgendjemand sonst die Suite erneut ausführen könnte – was für ein Modell in diesem Stadium der übliche Vorbehalt ist. Und hier lohnt es sich, es klar auszusprechen: Ein nicht reproduzierter Anbieterwert ist eine Behauptung über ein Modell, keine Messung eines solchen.

Die Model Card ist zudem auf eine Weise informativ, die ihre Autoren möglicherweise nicht beabsichtigt haben. Das Ergebnis von 40,4 % bei Terminal-Bench 4.0 liegt deutlich hinter der Frontier-Klasse; Claude Sonnet 5.5, ein Mittelklassemodell und kein Flaggschiff, erreicht 70,6 % in derselben Version dieses Benchmarks. Die ehrliche Lesart ist nicht, dass Ling-3.1-flash schwach ist – 40,4 % sind für ein auf Kosteneffizienz ausgerichtetes Modell ein respektabler agentischer Terminal-Wert –, sondern dass die Formulierung „nahe an der Frontier bei wichtigen Benchmarks“, die am Ankündigungstag in sozialen Medien kursierte, dem Kontakt mit den konkreten Ergebniszeilen nicht standhält. Der Benchmark, bei dem das Modell am stärksten abschneidet, HealthBench Professional mit 65,35, ist zugleich derjenige, der die unangenehme Fußnote trägt: Ant gibt an, dass es in einer Umgebung namens AQ evaluiert wurde und dass die Gesundheitsfähigkeit des Modells „derzeit nur in AQ erlebt werden kann“, ohne dass an irgendeiner öffentlichen Stelle definiert wird, was AQ ist. Ein Schlagzeilenwert, an dem eine unbenannte Umgebung hängt, ist eine Demo, kein reproduzierbares Ergebnis.

Warum ein großes Modell, das als Testversion erscheint, die eigentliche Nachricht ist

Der interessantere Schritt hier ist die Abfolge, nicht die Parameter. Ling-3.0-flash ging direkt zu offenen Gewichten. Dieses hier startet zuerst als Testversion, wobei Gewichte, Lizenz und offizielle Preisgestaltung alle zurückgehalten werden und eine öffentliche Zusage besteht, erst nach Ende der kostenlosen Phase Open Source zu werden. Das ist ein Playbook für eine kommerzielle Veröffentlichung, das eine Open-Model-Ankündigung trägt, und es ist eine echte Veränderung, die man verfolgen sollte: Wenn die Gewichte unter einer permissiven Lizenz erscheinen, bekommt die Community ein 560B-Basismodell zum Fine-Tuning und Destillieren; wenn sie mit kommerziellen Auflagen kommen, war die zweiwöchige Testphase das Produkt und die „Open-Source“-Aussage Marketing. So oder so fällt die Entscheidung innerhalb des Testfensters, und darauf sollte man achten, nicht auf irgendeine einzelne Benchmark-Zeile.

Wo es läuft und das ehrliche Bild des Routings

Vorerst ist Ling-3.1-flash über die eigene Produktoberfläche des Anbieters und über Drittanbieter-Inferenzplattformen erreichbar, die die Testversion betreiben – und mehr ist es nicht. Im Katalog von OrcaRouter steht es heute nicht; eine Abfrage an unsere öffentliche Modell-API für Ling-3.1-flash, Ling-3.0-flash und die Ling-3.0-Vision-Variante gibt jeweils not-found zurück, und wir werden nichts anderes vortäuschen. Wenn ein Ant-Endpunkt allgemein verfügbar wird und einen veröffentlichten Listenpreis hat, ist das Durchreichmodell, auf dem OrcaRouter läuft – der Listenpreis des Anbieters wird ohne Aufschlag weitergegeben, sodass eine Preissenkung des Anbieters am selben Tag bei uns live ist –, genau die Vereinbarung, die zu einem Modell passt, dessen Preisgestaltung noch nicht geschrieben ist.

Was Sie heute tun können, ohne auf die Lizenzentscheidung zu warten, ist der Vergleich, der für ein unerprobtes Modell wirklich zählt: Messen Sie es an den Flash-Tier-Modellen, die Sie jetzt aufrufen können. Gemini 3.8 Flash und DeepSeek-V4.1-Flash sind beide in unserem Katalog zu den Listenpreisen ihrer Anbieter verfügbar, hinter einem einzigen API-Schlüssel, mit automatischem Failover zwischen ihnen. Bei einem Modell in einer kostenlosen Testphase, dessen Gewichte und Preisliste beide unbekannt sind, ist das die vernünftige Art, es bereitzuhalten – ein weiterer Kandidat, den Sie ansteuern können, solange die Testphase läuft, und ein Produktionspfad, der nicht davon abhängt, was am fünfzehnten Tag passiert.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Was diese Woche zu tun ist

Wenn das Modell für Ihre Arbeit relevant ist, ist die Testphase der Grund, jetzt zu handeln, statt darauf zu warten, dass sich die Open-Weight-Frage klärt – zwei Wochen kostenlose Inferenz auf einem 560B-MoE sind die günstigste Evaluierung, die Sie bekommen werden, und die Antwort auf „Hält es bei meinen Prompts stand?“ ist heute verfügbar, auch wenn die Antwort auf „Kann ich es selbst hosten?“ es nicht ist. Drei Dinge, die Sie prüfen sollten, solange das Zeitfenster offen ist, und zwar in dieser Reihenfolge:

• Führe deine eigene Workload aus, nicht die Benchmark-Karte. Die veröffentlichten Zahlen sind Ants Auswahl an Aufgaben; deine Prompts sind die, die deinen Stack bestimmen.

• Testen Sie den Kontext, den Sie tatsächlich verwenden werden. Der Endpunkt liefert 262.144 Token, nicht 1 Mio. Wenn Ihr Design von dem größeren Fenster abhängt, entwerfen Sie auf Grundlage eines Versprechens.

• Baue kein Kostenmodell auf „kostenlos“ auf. „Kostenlos“ ist ein Zustand von zwei Wochen. Plane bis zur Veröffentlichung einer Preisliste den Wechsel zurück zu einem kostenpflichtigen Flash-Tier-Modell als Standard ein und behandle Ling-3.1-flash als zusätzliche Kapazität.

Die Ankündigung ist echt und das Modell läuft – was mehr ist, als man noch vor einer Woche sagen konnte. Aber „veröffentlicht und offen“ und „im Testbetrieb laufend“ sind unterschiedliche Zustände, und dieser ist eindeutig der zweite – eine 560B-Spezifikation, ein 256K-Endpunkt, eine nur vom Anbieter bereitgestellte Benchmark-Karte und ein Zwei-Wochen-Countdown, der die einzige feste Deadline in der gesamten Veröffentlichung ist.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert