
Ling-3.0-flash: Was wir jetzt über Ant Groups Open-Weight-Fast-Tier-MoE wissen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Das InclusionAI-Labor von Ant Group hat offiziell Ling-3.0-flash veröffentlicht – angekündigt am 24. Juli 2026 und am 7. August unter der MIT-Lizenz als Open Source bereitgestellt – und das Bild hat sich seit der Vorschau, die wir hier im Juli veröffentlicht haben, erheblich verändert. Es ist ein natives Hybrid-Reasoning-Mixture-of-Experts-Modell mit insgesamt 124B Parametern und nur 5,1B aktiven pro Token, das als schnelle, günstige Stufe der Ling-Familie entwickelt wurde. Die beiden Zahlen, die alles verändert haben: Artificial Analysis bewertet es nun mit 38 auf dem Intelligence Index (24 Punkte mehr als die vorherige Fast-Tier-Generation, Ling-2.6-flash) und platziert es auf der Open-Weights-Pareto-Grenze für Intelligenz im Vergleich zu den Gesamtparametern. Die Gewichte sind auf Hugging Face und ModelScope verfügbar.
Als wir dieses Modells am 24. Juli zum ersten Mal behandelten, lautete die ehrliche Zusammenfassung: nur per API, keine Gewichte, keine Lizenzangabe, kein unabhängiger Benchmark. Alle vier Aussagen sind inzwischen überholt. Ant hat die Gewichte am 7. August unter der MIT-Lizenz als Open Source veröffentlicht, und Artificial Analysis hat seitdem eine vollständige unabhängige Evaluierung veröffentlicht. Dieses Update überarbeitet die ursprüngliche Kurzfassung entsprechend – die Kennzeichnungen als „unverifiziert“, die den Juli-Beitrag dominierten, gelten nun für einen deutlich engeren Bereich von Behauptungen, hauptsächlich für Ants Spitzengeschwindigkeitswerte, statt für das Modell als Ganzes.
TL;DR.Ling-3.0-flash ist das schnelle Open-Weight-MoE von Ant Group: 124B gesamt / 5,1B aktiv, MIT-Lizenz, 256K nativer Kontext (262K im Betrieb). Artificial Analysis vergibt ihm einen Intelligence Index von 38 — 24 Punkte mehr als die Vorgängergeneration Ling-2.6-flash und an der Pareto-Frontier für Open-Weight-Modelle in Bezug auf Intelligenz vs. Gesamtparameter — mit einem gemessenen Output von etwa 368 Token/s. Die Gewichte sind unter der MIT-Lizenz auf Hugging Face und ModelScope verfügbar. Weiterhin nur vom Anbieter stammend: die Behauptung eines Spitzendurchsatzes von über 1.100 Token/s, der Wert von unter 100 ms für die Zeit bis zum ersten Token und die Benchmark-Tabelle der Modellkarte. Die Preise der Erstanbieter-API betragen 0,075 $ Eingabe / 0,22 $ Ausgabe pro 1M Token (80 % Rabatt bei Cache-Treffern); das kostenlose Startkontingent endete am 3. August.
Wichtige Erkenntnisse
• Es ist die schnelle/günstige Stufe, nicht das Flaggschiff.Das Flaggschiff der vorherigen Generation mit 1T-Parametern bleibt InclusionAIs größtes Modell; Ling-3.0-flash ist das kleinere, schnellere Geschwistermodell, das für umfangreiche Text- und Tool-Aufrufe ausgelegt ist.
• Die Gewichte sind jetzt unter der MIT-Lizenz offen verfügbar. Die Gewichte wurden am 7. August unter der MIT-Lizenz auf Hugging Face (inclusionAI/Ling-3.0-flash) und ModelScope veröffentlicht — eine Kehrtwende zum „API-only“-Bild vom Juli.
• Es hat endlich einen unabhängigen Score. Artificial Analysis misst einen Intelligence Index von 38, 24 Punkte mehr als Ling-2.6-flash, und platziert das Modell auf der Pareto-Frontier für Open-Weights-Modelle in Bezug auf Intelligenz versus Gesamtparameter.
• Die Geschwindigkeit wird jetzt teilweise gemessen.AA erzielt eine Ausgabegeschwindigkeit von etwa 368 Tokens/s und eine Zeit bis zum ersten Token von ~1,98 s; Ants beworbener Spitzenwert von 1.100+ Tokens/s stammt weiterhin nur vom Anbieter.
• Die Preise stehen fest, und die kostenlose Einführungsphase ist beendet. Die First-Party-API listet $0.075 Input / $0.22 Output pro 1M Tokens mit 80 % Cache-Hit-Rabatt; das kostenlose Einführungsangebot endete am 3. August.
• Es ist ein Teil einer Modellfamilie aus drei Modellen. InclusionAI unterteilt seine Modellpalette in Ling (Allzweck-MoE für Text und Tools, dieses Modell), Ring (Reasoning) und Ming (multimodal).
Ein Hinweis zum Lesen dieses Updates:Dies ist eine Überarbeitung der Vorschau vom 24. Juli, geschrieben nachdem die Gewichte veröffentlicht wurden und die ersten unabhängigen Ergebnisse erschienen. Alle unten aufgeführten Spezifikationen, Benchmarks und Preise sind mit ihrer Quelle gekennzeichnet. Wo die Ant Group die einzige Quelle ist — die Angaben zur Spitzengeschwindigkeit und die Benchmark-Tabelle der Modellkarte —, sagen wir dies ausdrücklich. Wo Artificial Analysis etwas unabhängig gemessen hat, zitieren wir das.
Was wir tatsächlich wissen
Die Architektur ist nun vollständig auf der Modellkarte dokumentiert. Ling-3.0-flash verwendet einen nativen hybrid-linearen Attention-Stack — Kimi Delta Attention (KDA) und Gated-MLA-Schichten im 5:1-Verhältnis (35 KDA + 7 MLA), mit feinkörnigem diagonalem Gating bei KDA — auf einem Sparse-MoE (512 geroutete Experten, 8 pro Token aktiviert, also 1/64). So erreicht es 124 Mrd. Gesamtparameter mit nur 5,1 Mrd. aktiven Parametern. Das Kontextfenster beträgt nativ 256K und wird in den Inferenz-Rezepten mit 262.144 Token bereitgestellt; Ant gibt an, dass die Architektur auf 1M skaliert. Die maximale Ausgabelänge wird nicht offengelegt. Das Modell ist rein textbasiert mit Tool-Calling-Unterstützung; multimodale Eingaben sind der separaten Ming-Linie vorbehalten.
Das Labor veröffentlicht zwei Gewichtsformate — BF16 (etwa 255 GB) und FP8 (etwa 128 GB) — und Community-quantisierte Varianten sind bereits über die Modellkarte verlinkt. Die eigenen Deployment-Rezepte des Labors zielen auf SGLang und vLLM.
Verfügbarkeit: offene Gewichte unter MIT
Am 7. August hat das InclusionAI-Team von Ant Group die Gewichte unter der MIT-Lizenz auf Hugging Face (inclusionAI/Ling-3.0-flash) und ModelScope als Open Source veröffentlicht. Das ist eine freizügige, kommerziell nutzbare Lizenz – dieselbe, unter der auch Ling 2.0 und Ling 2.6 veröffentlicht wurden – und sie bedeutet, dass Sie Ling-3.0-flash selbst hosten, feinabstimmen und bereitstellen können, anstatt es über eine API zu mieten. Das Modell ist außerdem über Ants eigene Entwickler-API und mehrere Drittanbieter-Plattformen aufrufbar. Bei einem schnellen Modell zu diesem Preis ist die interessantere Frage, ob man es selbst hostet (FP8 läuft in etwa 128 GB) oder bei einer API bleibt.

Unabhängige Bewertungen: ein AA Intelligence Index von 38
Die mit Abstand größte Änderung gegenüber dem Beitrag vom Juli ist, dass nun unabhängige Zahlen existieren. Artificial Analysis hat eine Seite für Ling-3.0-flash und misst einen Wert von 38 auf dem Intelligence Index – 24 Punkte über der vorherigen Fast-Tier-Generation Ling-2.6-flash (14) und gleichauf mit MiMo-V2.5 und Qwen 3.6 27B, während nur ein Bruchteil ihrer Parameter aktiviert wird. Artificial Analysis verortet das Modell außerdem auf der Open-Weights-Pareto-Front für Intelligenz im Vergleich zu Gesamtparametern: Kein Open-Weights-Modell mit weniger Gesamtparametern erzielt einen höheren Wert. Das führende Open-Weights-Modell der Flash-Klasse auf AA, DeepSeek V4 Flash, erzielt weiterhin einen höheren Wert (Index 52 bei maximalem Reasoning-Aufwand).
Auch die agentischen und Long-Context-Ergebnisse sind in ihrer Tendenz stark. Beim τ3-Bench-Banking-Suite von AA erzielt Ling-3.0-flash 27 % und liegt damit unter den Open-Weights-Modellen der Flash-Klasse auf Platz zwei, hinter DeepSeek V4 Flash (39 %). Bei GDPval-AA v2 erreicht es ein Elo von 1108, gegenüber 545 für Ling-2.6-flash. Ant hat das Modell in über 10.000 interaktiven Umgebungen trainiert (laut Anbieter) und positioniert es als Ausführungsknoten für Agent-Workflows – schnell, günstig und wegwerfbar, wobei die anspruchsvolle Denkarbeit einem größeren Flaggschiff überlassen bleibt.
Ein Hinweis zur Quellenlage: Die Benchmark-Tabelle auf Ant’s Modellkarte — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — stammt vom Anbieter und wurde noch nicht unabhängig reproduziert. Behandle sie als die eigenen Angaben des Labors, in derselben Kategorie wie die unten aufgeführten Spitzengeschwindigkeitswerte.
Geschwindigkeit: gemessen, dann behauptet.
Die Geschwindigkeits-Story besteht jetzt aus zwei verschiedenen Geschichten. Unabhängig davon misst Artificial Analysis auf der First-Party-API eine Ausgaberate von rund 368 Token/s und eine Time-to-First-Token von etwa 1,98 s — für eine 5,1B-aktive MoE wirklich schnell, und genug, um das Modell in Sachen Geschwindigkeit nahe an die Spitze seiner Klasse zu bringen. Separat beansprucht Ant Group eine durchschnittliche Ausgaberate von über 1.100 Token/s auf bestimmten GPU-Konfigurationen und eine Time-to-First-Token unter 100 ms, mit einer clusterweiten hierarchischen Caching-Schicht auf Basis von SGLang HiCache und Mooncake. Diese zweite Zahlenreihe stammt ausschließlich vom Anbieter — gemessen auf Hardware- und Batch-Setups, die Ant kontrolliert, ohne dass eine unabhängige Wiederholung veröffentlicht wurde. Für die Planung verwenden Sie den AA-Wert; behandeln Sie 1.100+ Token/s als Marketing-Obergrenze, die Sie anhand Ihrer eigenen Workload verifizieren sollten.

Preise: günstig, und die Aktion ist vorbei.
Artificial Analysis listet die First-Party-API mit 0,075 $ pro 1 Mio. Input-Token und 0,22 $ pro 1 Mio. Output, mit Cache-Treffern bei 0,015 $ (−80 %) – alle Preise vom Anbieter festgelegt. Das kostenlose Start-Kontingent (500k kostenlose Token/Tag, kostenloser API-Zugang) endete am 3. August, und Ant bot einen vorübergehenden Rabatt von 75 % auf sein Ling Studio bis zum 31. August 2026 an, danach gelten die Listenpreise. Selbst zum vollen Listenpreis liegt Ling-3.0-flash mit 0,075 $/0,22 $ klar im günstigen Segment für ein Modell mit einem Index von 38.
Bei so niedrigen Preisen zählen die Wechselkosten mehr als der Preis pro Token. OrcaRouter existiert, um diesen Wechsel günstig zu machen: eine API für über 200 Modelle, Listenpreise der Anbieter ohne Aufschlag und automatisches Failover zwischen den Anbietern – wenn ein neu verfügbares Modell wie dieses auf dem Papier also gut aussieht, können Sie es ohne zweiten Vertrag gegen Ihre reale Arbeitslast testen und hinter demselben Schlüssel auf ein anderes Modell zurückgreifen, falls es bei einer bestimmten Aufgabe hinter den Erwartungen zurückbleibt.
Die Familie Ling / Ring / Ming
Ling-3.0-flash existiert nicht für sich allein — InclusionAI organisiert seine Veröffentlichungen in drei benannten Familien, die jeweils auf eine andere Aufgabe abzielen. Ling ist die allgemeine MoE-Linie für alltägliche Textgenerierung und Tool-Aufrufe, und Ling-3.0-flash sitzt an ihrem schnellen/günstigen Ende, eine Stufe unter dem 1T-Parameter-Flaggschiff der vorherigen Generation. Ring ist die auf Reasoning ausgerichtete Linie, die für mehrstufige Chain-of-Thought-Prozesse gebaut ist. Ming ist die multimodale Linie. Wenn Ihre Aufgabe schwereres Reasoning oder Bildeingaben erfordert, ist das richtige InclusionAI-Modell wahrscheinlich nicht Ling-3.0-flash — es ist für Volumen und Geschwindigkeit in der Text-und-Tools-Spur gebaut.
Für wen es gedacht ist: drei Szenarien
1. Hochvolumige, latenzempfindliche Text- oder Tool-Aufruf-Pipelines
Das ist das Heimspiel des Modells. Mit einem unabhängigen Index von 38, einer MIT-Lizenz und rund 368 gemessenen tok/s ist die schnelle Stufe nun überprüfbar statt nur hypothetisch — Sie können Ihr eigenes Evaluierungsset darauf laufen lassen oder die Gewichte herunterladen und selbst hosten. Bauen Sie Ihre Lösung jedoch nicht auf die 1.100+ tok/s-Obergrenze des Anbieters, bis Sie diese auf Ihrer eigenen Workload gemessen haben.
2. Teams, die langen Kontext mit begrenztem Budget benötigen
Ein nativer 256K-Kontext (262K bereitgestellt) mit einem angekündigten Weg zu 1M, zu Preisen von 0,075 $/0,22 $, ist eine attraktive Kombination für retrieval-intensive oder dokumentverarbeitende Aufgaben. Die Long-Context-Angaben der Modellkarte stammen vom Anbieter – setzen Sie das Modell daher im Vergleich mit etablierten Long-Context-Optionen auf die Shortlist und verifizieren Sie die Werte anhand Ihres eigenen Korpus, bevor Sie sich festlegen.
3. Beobachter verfolgen Chinas MoE-Landschaft und die InclusionAI-Roadmap
Die Juli-Frage – ob InclusionAI offen bleiben würde? – hat jetzt eine Antwort: ja, MIT, und schnell. Dass Ling-3.0-flash mit 5,1B aktiven Parametern auf der AA-Pareto-Grenze landet, ist ein Datenpunkt für alle, die verfolgen, wie chinesische Labore eher über Effizienz als über die rohe Parameterzahl konkurrieren.
Was ist noch unverifiziert?
Eine kurze Liste, jetzt, da die großen Lücken geschlossen sind. Die Spitzengeschwindigkeitsangaben des Anbieters (1.100+ Tok/s, unter 100 ms TTFT) haben keine unabhängige Nachmessung. Die Benchmark-Tabelle auf dem Modellkartenblatt ist vom Anbieter gemeldet. Die FP4/INT4-Varianten und der einzelne DGX-Spark-Bereitstellungspfad sind vom Anbieter angegeben. Und was das Wissen betrifft: AA’s Omniscience Index zeigt, dass die Verbesserung gegenüber der Vorgängergeneration größtenteils durch Enthaltung erreicht wurde — die Halluzinationen sanken (97% → 44%), während die Genauigkeit nur leicht stieg (16% → 18%) — also verwechseln Sie den Indexsprung in der Schlagzeile nicht mit einem umfassenden Wissenssprung.
Wann nicht verwenden
Verzichten Sie auf Ling-3.0-flash für multimodale Arbeit — das ist die Ming-Linie. Verzichten Sie darauf, wenn Sie ein Flaggschiff für schweres Reasoning statt eines schnellen Ausführers brauchen — das ist Rings Revier. Wenn Sie selbst hosten möchten, kalkulieren Sie die echte Hardware ein: BF16 benötigt etwa 255 GB, FP8 etwa 128 GB. Und wenn Ihnen eine Behauptung wichtig ist, prüfen Sie sie — die Zahlen zu Spitzengeschwindigkeit und langem Kontext stammen von Ant, bis ein unabhängiges Labor sie erneut durchführt.
FAQ
Ist Ling-3.0-flash Open Weight?
Ja. Die Gewichte wurden am 7. August unter der MIT-Lizenz auf Hugging Face (inclusionAI/Ling-3.0-flash) und ModelScope als Open Source veröffentlicht. Das ist eine freizügige, kommerziell nutzbare Lizenz — dieselbe, unter der Ling 2.0 und Ling 2.6 veröffentlicht wurden.
Wie schneidet Ling-3.0-flash bei Benchmarks ab?
Artificial Analysis misst einen Intelligenzindex von 38, was 24 Punkte über Ling-2.6-flash liegt, und platziert das Modell auf der Pareto-Frontier für Open-Weight-Modelle in Bezug auf Intelligenz versus Gesamtparameterzahl. Die Benchmark-Tabelle auf Ants Modellkarte (z. B. SWE-Bench Pro 56.6) stammt vom Anbieter und wurde nicht unabhängig reproduziert.
Wie schnell ist es wirklich?
Artificial Analysis misst über die First-Party-API eine Ausgabegeschwindigkeit von etwa 368 Tokens/Sekunde und eine Zeit bis zum ersten Token von ~1,98 s. Ant gibt bei bestimmten GPU-Konfigurationen einen Spitzendurchsatz von 1.100+ Tokens/Sekunde und eine TTFT unter 100 ms an — das sind Herstellerangaben ohne unabhängige Nachmessung.
Was kostet Ling-3.0-flash?
AA listet die First-Party-API mit 0,075 $ pro 1M Eingabe-Token und 0,22 $ pro 1M Ausgabe-Token, mit 80 % Rabatt bei Cache-Treffern. Der kostenlose Einstiegstarif endete am 3. August, und eine befristete Aktion mit 75 % Rabatt auf Ling Studio läuft bis zum 31. August 2026.
Wie groß ist das Kontextfenster?
Nativ 256K, bereitgestellt bei 262.144 Tokens; Ant behauptet, die Architektur skaliert auf 1M. Die maximale Ausgabelänge wird nicht angegeben.
Was ist der Unterschied zwischen Ling, Ring und Ming?
Ling ist die Allzweck-Text- und Tool-Aufruf-MoE-Linie von InclusionAI, und Ling-3.0-flash befindet sich an deren schnellem/günstigem Ende. Ring ist die auf Reasoning ausgerichtete Linie. Ming übernimmt multimodale Aufgaben. Es handelt sich um getrennte Familien für verschiedene Aufgaben, nicht um Stufen eines einzelnen Modells.
Ist Ling-3.0-flash dasselbe wie das vorherige 1T-Flaggschiff?
Nein. Ling-3.0-flash ist die neuere, kleinere Fast-Tier-Veröffentlichung (124B insgesamt / 5.1B aktiv). Das Flaggschiff mit 1T Parametern der vorherigen Generation bleibt das größere Modell.
Sollte ich heute Ling-3.0-flash in der Produktion einsetzen?
Vertretbarer als noch im Juli, jetzt da es eine unabhängige Bewertung und eine MIT-Lizenz gibt. Führen Sie zuerst Ihren eigenen Evaluierungssatz aus, überprüfen Sie die Geschwindigkeitsangaben des Anbieters anhand Ihrer Workload und entscheiden Sie sich zwischen API und Self-Hosting (FP8 läuft in etwa 128GB). Die verbleibenden anbieterspezifischen Zahlen sind eng genug, um sie bei der Planung berücksichtigen zu können.
Fazit
Ling-3.0-flash hat in zwei Wochen den Sprung von „Datenblatt und Herstellerangaben“ zu „Open Weight und unabhängig bewertet“ geschafft. Ein AA Intelligence Index von 38 bei 5,1B aktiven Parametern — an der Pareto-Front für Open-Weight-Modelle, MIT-lizenziert, bei 0,075 $/0,22 $ — macht es zu einem der effizientesten Open-Weight-Modelle, auf die man derzeit zurückgreifen kann, und zu einem, das man tatsächlich selbst ausführen kann. Die Einschränkungen sind geringer als zuvor: Die Spitzengeschwindigkeits- und Model-Card-Werte stammen weiterhin von Ant, bis ein unabhängiges Labor sie reproduziert. Für umfangreiche Textverarbeitung und Tool-Calling zu diesem Preis hat es sich eine echte Evaluierung verdient.

