Ling-3.0-flash: Was wir tatsächlich über Ant Groups neuen Fast-Tier-MoE wissen (und was nicht)
Guides & Insights

Ling-3.0-flash: Was wir tatsächlich über Ant Groups neuen Fast-Tier-MoE wissen (und was nicht)

Autor

Jim Song

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ant Group's InclusionAI-Labor hat Ling-3.0-flash am oder um den 23. Juli 2026 veröffentlicht – was bedeutet, dass es zum Zeitpunkt dieser Kurzdarstellung erst wenige Tage alt ist. Es handelt sich um ein Mixture-of-Experts (MoE)-Sprachmodell mit insgesamt 124B Parametern und etwa 5,1B aktiven Parametern pro Token (etwa ein 24:1-Sparsity-Verhältnis), das für Textgenerierung und Tool-Aufrufe entwickelt wurde. Es ist als die schnelle, günstige Stufe der Ling-Familie positioniert; der Spitzenplatz gehört weiterhin dem viel größeren Ling-2.6-1T (1T insgesamt / 63B aktiv). Der Zugriff erfolgt derzeit nur über die API – über Ants eigenes Entwicklerportal, über OpenRouter als inclusionai/ling-3.0-flash und über ZenMux.

Das ist das gesamte bestätigte Bild, und es lohnt sich, offen zu sagen, warum dieser Bericht vorsichtiger klingt als eine typische Modellbeschreibung. Es gibt keine Hugging Face-Gewichte, kein GitHub-Repository für Ling-V3 und keine klare Lizenzangabe – ein echter Unterschied zu Ling 2.0 und Ling 2.6, die beide als offene Gewichte unter MIT veröffentlicht wurden. Es gibt auch keinerlei unabhängige Benchmark-Daten: Artificial Analysis, der am häufigsten zitierte Drittanbieter-Bewerter für diese Modellklasse, hat noch keine Seite dafür. Jede aktuell im Umlauf befindliche Leistungs- und Geschwindigkeitszahl geht auf Ant Group selbst zurück.

TL;DR.Ling-3.0-flash ist ein 124B/5.1B-aktives MoE-Modell von Ant Group's InclusionAI, das innerhalb der letzten Tage veröffentlicht wurde, nur per API, ohne Hugging Face-Gewichte und mit einer unbestätigten Lizenz. Herstellerangaben — 1000 Tokens/s Spitzendurchsatz, unter 100 ms Zeit bis zum ersten Token — haben noch keine unabhängige Bestätigung, und es gibt keinen Artificial-Analysis-Score für dieses spezifische Modell. Die vorherige Generation Ling-2.6-flash erreichte einen Artificial Analysis Intelligence Index von nur 14 (Ling-2.6-1T erreichte 26), was ein nützlicher Kontext ist, aber kein Ersatz für die tatsächliche Leistungsfähigkeit von 3.0-flash. Die Preisgestaltung (¥0.40 Eingang / ¥1.20 Ausgang pro 1M Tokens, derzeit kostenlos während der Einführungswoche mit 500k kostenlosen Tokens pro Tag) ist ausdrücklich werblich und wird sich voraussichtlich ändern. Behandeln Sie alles hier als Vorschau, nicht als endgültiges Urteil.

Wichtige Erkenntnisse

Es ist die schnelle/günstige Stufe, nicht das Flaggschiff.Ling-2.6-1T bleibt InclusionAIs größtes Modell; Ling-3.0-flash ist ein kleineres, günstigeres, schnelleres Geschwisterchen, das auf hohe Nutzungsvolumen abzielt.

Es existiert noch kein unabhängiger Benchmark. Artificial Analysis hat keine Seite für Ling-3.0-flash. Die einzigen öffentlichen Zahlen stammen von Ant Group selbst, und die Dokumentation von Ant zeigt derzeit überhaupt keine Benchmark-Tabelle für dieses Modell.

Geschwindigkeitsangaben stammen nur vom Anbieter. Spitzenwerte von 1000 Token/s und eine Time-to-First-Token unter 100 ms stammen von der Ant Group, ohne dass ein Durchsatztest eines Drittanbieters eine der beiden Angaben bestätigt.

Keine offenen Gewichte, Lizenz unbestätigt. Es gibt kein Hugging Face-Repository und kein GitHub Ling-V3-Projekt. Frühere Ling-Generationen waren MIT-lizenziert; ob 3.0-flash dem folgen wird, ist unbekannt.

Die Preise sind eine Aktion zur Einführungswoche. ¥0,40/¥1,20 pro 1 M Token auf Ants Plattform wird derzeit erlassen, mit 500k kostenlosen Token pro Tag und einem kostenlosen OpenRouter-Eintrag – von alledem sollte nicht ausgegangen werden, dass es nach Ende der Aktion bestehen bleibt.

Es ist ein Teil einer Drei-Modell-Familie.InclusionAI unterteilt sein Sortiment in Ling (allgemeine MoE, dieses Modell), Ring (logikorientiert) und Ming (multimodal).

Ein Hinweis zum Lesen dieses Kurzberichts: jede Spezifikation, jeder Benchmark und jeder Preis im Folgenden ist mit der Quelle gekennzeichnet. Wo Ant Group die einzige Quelle ist, sagen wir das deutlich und schränken es entsprechend ein. Wo Vorgänger-Ling-Modelle unabhängige Bewertungen haben, zitieren wir sie als Kontext – nicht als Ersatz für Daten zu Ling-3.0-flash selbst, die es noch nicht gibt. Dies wird wahrscheinlich eine Folgeaktualisierung erfordern, sobald unabhängige Tests aufholen.

Was wir tatsächlich wissen

Architektonisch gesehen ist Ling-3.0-flash ein spärliches MoE-Modell: insgesamt 124 Milliarden Parameter, von denen bei einem beliebigen Token etwa 5,1 Milliarden aktiv sind – das macht es im Vergleich zu seiner Gesamtgröße günstig und schnell. Das Kontextfenster beträgt laut eigener Dokumentation von Ant 256.000 Token, mit einer Anbieterangabe, dass es auf 1 Million erweiterbar ist; die OpenRouter-Auflistung zeigt 262.144 Token, was mit der 256K-Angabe übereinstimmt. Die maximale Ausgabelänge wird nirgendwo, soweit wir finden konnten, angegeben. Das Modell unterstützt Standard-Textgenerierung und Tool-Aufrufe, aber es wurde keine multimodale Eingabe oder Ausgabe erwähnt – diese Fähigkeit liegt bei der separaten Ming-Linie.

Bei Verfügbarkeit ist das Bild nur über die API verfügbar und einheitlich auf den drei von uns gefundenen Routen: Ant Groups eigener Entwicklerplattform, OpenRouter (gelistet als inclusionai/ling-3.0-flash) und ZenMux. Keine dieser Optionen macht herunterladbare Gewichte verfügbar. Es gibt keine GitHub-Organisationsseite für ein „Ling-V3“-Projekt, und die Dokumentation von Ant gibt keine Lizenz für dieses spezifische Modell an – eine bedeutende Lücke, da Ling 2.0 und Ling 2.6 beide als offene Gewichte unter MIT veröffentlicht wurden. Bis InclusionAI dies klärt, nehmen Sie weder an, dass Ling-3.0-flash offen sein wird, noch dass es das nicht sein wird.

Die Lücken: was nicht verifiziert ist

Die größte Lücke sind Benchmarks. Zum Zeitpunkt dieser Veröffentlichung hat Artificial Analysis – der unabhängige Evaluator, der für genau diese Modellklasse am häufigsten zitiert wird – keine Seite für Ling-3.0-flash; das URL-Muster, das normalerweise diese Seite hosten würde, gibt einen 404-Fehler zurück. Das bedeutet, dass es derzeit keine Drittanbieter-Ergebnisse für Reasoning, Coding oder Mathematik für dieses Modell gibt, weder von Artificial Analysis noch von einem anderen unabhängigen Evaluator, den wir finden konnten. Ants eigene Dokumentation verstärkt dies: Sie veröffentlicht überhaupt keine Benchmark-Tabelle für 3.0-flash, weder vom Anbieter noch anderweitig, was für eine Modellveröffentlichung ungewöhnlich ist und für sich genommen erwähnenswert ist.

Zur groben Einordnung: Modelle der vorherigen Ling-Generation haben durchaus unabhängige Bewertungen. Ling-2.6-flash erzielte einen Artificial Analysis Intelligence Index von 14, und das größere Ling-2.6-1T erreichte 26 – beide weit hinter den führenden Open-Weight-Modellen, die Artificial Analysis damals verfolgte. Ants eigene Verkaufszahlen für Ling-2.6-flash gaben 61,2 % bei SWE-bench Verified und 73,85 % bei AIME2026 an. Keine dieser Zahlen sollte direkt auf Ling-3.0-flash übertragen werden; eine neue Generation mit einer neuen Architektur kann sich in beide Richtungen bewegen, und bis ein unabhängiger Bewerter sie tatsächlich testet, ist jede Fähigkeitsbehauptung für 3.0-flash eine Vermutung, die als Tatsache verkleidet ist.

Geschwindigkeitsangaben des Anbieters: auf dem Papier schnell, in der Praxis unbestätigt.

Das herausragende Leistungsversprechen von Ant Group für Ling-3.0-flash ist nicht die Reasoning-Qualität – es ist die rohe Geschwindigkeit. Der Anbieter gibt eine Spitzendurchsatzrate von 1000 Tokens pro Sekunde und eine Zeit bis zum ersten Token unter 100 Millisekunden an, beides wäre tatsächlich schnell, wenn es bestätigt würde. Aber „wenn bestätigt" leistet in diesem Satz echte Arbeit: Diese Zahlen stammen ausschließlich aus den eigenen Unterlagen von Ant Group, gemessen unter Bedingungen, die Ant kontrolliert und nicht vollständig offengelegt hat (Hardware, Batch-Größe, Prompt-Länge und Auslastung beeinflussen die Durchsatzwerte erheblich). Kein unabhängiges Labor hat eine erneute Messung veröffentlicht. Bis jemand außerhalb von Ant einen vergleichbaren Test durchführt, behandeln Sie 1000 tok/s und sub-100ms TTFT als Marketingzahlen, die es wert sind, an Ihrem eigenen Workload überprüft zu werden – nicht als gesicherte Fakten.

Preise und warum sie ein bewegliches Ziel sind

Auf Ant Groups eigener Plattform beträgt der Listenpreis für Ling-3.0-flash ¥0,40 pro 1 Mio. Input-Token und ¥1,20 pro 1 Mio. Output-Token – von Grund auf günstig, passend zur Positionierung als schnelles/günstiges Modell. Aber diesen Listenpreis zahlt derzeit tatsächlich niemand: Ant führt eine kostenlose Einführungswochenaktion durch und bietet separat 500.000 kostenlose Token pro Tag auf seiner Plattform an. OpenRouter zeigt eine ling-3.0-flash:free-Variante zu $0/$0. All dies sollte nicht mit einem stabilen Preis verwechselt werden. Einführungsaktionen laufen aus, kostenlose Stufen werden gedeckelt, und die Beträge ¥0,40/¥1,20 könnten sich verschieben, sobald reale Nutzungsdaten vorliegen. Wenn Sie Produktionsausgaben anhand dieses Modells planen, budgetieren Sie gegen den Listenpreis, nicht gegen den Aktionspreis, und überprüfen Sie dies vor der Festlegung erneut.

Die Familie Ling / Ring / Ming

Ling-3.0-flash existiert nicht isoliert – InclusionAI unterteilt seine Veröffentlichungen in drei benannte Familien, jede für eine andere Aufgabe. Ling ist die allgemeine MoE-Reihe, die alltägliche Textgenerierung und Tool-Aufrufe abdeckt; Ling-3.0-flash befindet sich am schnellen/günstigen Ende davon, wobei Ling-2.6-1T nach wie vor das größere Flaggschiff ist. Ring ist InclusionAI's auf logisches Denken ausgerichtete Reihe, entwickelt für Aufgaben, die eher auf mehrstufigen Gedankenketten als auf rohem Durchsatz basieren. Ming ist die multimodale Reihe, die Bilder und andere nicht-textuelle Modalitäten verarbeitet, die Ling selbst nicht anrührt. Wenn Ihre Aufgabe stärkeres logisches Denken oder multimodale Eingaben erfordert, ist das richtige InclusionAI-Modell wahrscheinlich nicht Ling-3.0-flash – es ist für Volumen und Geschwindigkeit in der Text-und-Tools-Spur gebaut, nicht dafür, sich in das Territorium der anderen beiden Familien auszudehnen.

Für wen es gedacht ist: drei Szenarien

1. Hochvolumige, latenzempfindliche Text- oder Tool-Aufruf-Pipelines — als Pilot, nicht als Verpflichtung.

Wenn Ihr Workload von durchsatzintensiver Textgenerierung oder Tool-Aufrufen dominiert wird – Chat, leichtgewichtige Agenten, hochfrequente API-Aufrufe –, dann macht die Positionierung von Ling-3.0-flash (kleine Anzahl aktiver Parameter, behauptete TTFT unter 100 ms, nahezu kostenloses Einführungspreisangebot) einen Pilotversuch lohnenswert. Der Haken ist, dass „einen Pilotversuch lohnenswert“ sich von „den Produktionstraffic umstellen“ unterscheidet. Da es keine unabhängigen Benchmark-Daten gibt, sind Sie selbst der Benchmark: Führen Sie Ihre eigenen Evaluierungssets durch, bevor Sie ihm etwas Kundenorientiertes anvertrauen, und bauen Sie keine Kostenmodelle auf Basis der aktuellen Werbepreise auf.

2. Teams, die lange Kontextfenster benötigen, aber ein begrenztes Budget haben

Ein 256K-Kontextfenster (mit einer Herstellerangabe der Erweiterbarkeit auf 1M) zu einem wirklich niedrigen Listenpreis ist eine attraktive Kombination für abrufintensive oder dokumentenverarbeitende Anwendungsfälle, vorausgesetzt, die tatsächliche Reasoning-Qualität des Modells bleibt über diese Kontextlänge hinweg erhalten – was, wie gesagt, keine unabhängige Quelle getestet hat. Dies ist ein vernünftiger Kandidat, um ihn zusammen mit etablierten günstigen Long-Context-Optionen in die engere Wahl zu ziehen, aber er sollte Seite an Seite mit ihnen evaluiert werden, anstatt allein aufgrund von Ant’s Spezifikationsblatt übernommen zu werden.

3. Beobachter, die die chinesische MoE-Landschaft und die InclusionAI-Roadmap verfolgen

Für Teams, die die Wettbewerbslandschaft der chinesischen Open- und Semi-Open-Modelllabore verfolgen, anstatt ein einzelnes Modell in der Produktion einzusetzen, ist Ling-3.0-flash ein nützlicher Datenpunkt: Es signalisiert, dass InclusionAI schnell an seiner schnellen Stufe iteriert, möglicherweise von offenen Gewichten zurücktritt (zumindest vorerst) und weiterhin auf eine Drei-Familien-Struktur (Ling/Ring/Ming) setzt, anstatt auf ein allgemeines Modell. Es lohnt sich, es zu bookmarken und wieder aufzugreifen, sobald Benchmark- und Lizenzklarheit erreicht ist.

Wann nicht verwenden

Überspringen Sie Ling-3.0-flash für alles, bei dem Sie eine verifizierte Fähigkeitsbehauptung zitieren müssen – es gibt keinen unabhängigen Benchmark, auf den Sie verweisen können, daher ist jede Aussage über seine Denk-, Programmier- oder Mathematikkompetenz derzeit nicht überprüfbar. Verzichten Sie darauf, wenn Sie offene Gewichte für Self-Hosting, Feintuning oder Compliance-Gründe benötigen; es sind keine verfügbar, und die Lizenz für dieses spezifische Modell wurde nicht einmal angegeben, geschweige denn als permissiv bestätigt. Überspringen Sie es für multimodale Aufgaben – das ist die Aufgabe der Ming-Reihe, nicht von Ling. Und seien Sie vorsichtig, wenn Sie ein Kostenmodell auf den aktuellen Preisen aufbauen: Die kostenlose Einführungswoche, die 500k kostenlosen täglichen Tokens und die kostenlose OpenRouter-Stufe sind alle werblich, und der Listenpreis von ¥0.40/¥1.20, auf den es wahrscheinlich zurückfallen wird, wurde selbst nicht gegen reale Nutzungsmuster getestet.

FAQ

Ist Ling-3.0-flash Open Weight?

Derzeit nicht. Es gibt zum Zeitpunkt dieser Niederschrift kein Hugging-Face-Repository und kein GitHub-Ling-V3-Projekt. Frühere Ling-Generationen (2.0 und 2.6) wurden unter MIT als offene Gewichte veröffentlicht, aber nichts bestätigt, dass Ling-3.0-flash diesem Muster folgen wird – oder dass es das nicht tut.

Wie schneidet Ling-3.0-flash bei Benchmarks ab?

Es gibt noch keinen unabhängigen Benchmark dafür — Artificial Analysis hat keine Seite für dieses Modell. Die eigene Dokumentation von Ant Group veröffentlicht ebenfalls keine Benchmark-Tabelle dafür. Als groben historischen Kontext: Die vorherige Generation Ling-2.6-flash erzielte einen Artificial Analysis Intelligence Index von 14, und Ling-2.6-1T erreichte 26, aber keine dieser Zahlen sollte für diese neue Generation als gültig angenommen werden.

Wie schnell ist es wirklich?

Ant Group gibt eine Spitzendurchsatzrate von 1000 Token/s und eine Zeit bis zum ersten Token von unter 100 ms an. Beides sind herstellereigene Angaben, für die bisher keine unabhängige Nachmessung veröffentlicht wurde. Betrachten Sie sie als Behauptungen, die Sie anhand Ihrer eigenen Workload überprüfen müssen, nicht als bestätigte Leistungswerte.

Was kostet Ling-3.0-flash?

Der Listenpreis auf Ants Plattform beträgt ¥0,40 pro 1 Mio. Input-Token und ¥1,20 pro 1 Mio. Output-Token, aber derzeit ist es während einer Launch-Week-Aktion kostenlos, wobei auch 500k freie Token pro Tag verfügbar sind. OpenRouter listet ebenfalls eine kostenlose Variante. Erwarten Sie, dass sich diese Aktionsbedingungen ändern.

Wie groß ist das Kontextfenster?

256K Token laut Ants Dokumentation, mit einer Herstellerangabe, dass es auf 1M erweiterbar ist. OpenRouters Auflistung zeigt 262.144 Token, was der 256K-Angabe entspricht. Die maximale Ausgabelänge ist nicht offengelegt.

Was ist der Unterschied zwischen Ling, Ring und Ming?

Ling ist InclusionAIs allgemeine Text- und Tool-Aufruf-MoE-Linie, und Ling-3.0-flash befindet sich am schnellen/günstigen Ende. Ring ist die auf Reasoning ausgerichtete Linie. Ming übernimmt multimodale Aufgaben. Sie sind separate Modellfamilien, die für verschiedene Aufgaben entwickelt wurden, nicht Stufen desselben Modells.

Ist Ling-3.0-flash dasselbe wie Ling-2.6-1T?

Nein. Ling-2.6-1T ist InclusionAIs größeres Flaggschiff (1T insgesamt / 63B aktive Parameter) und bleibt ein separates, größeres Modell. Ling-3.0-flash (124B insgesamt / ~5,1B aktiv) ist die neuere, kleinere, schnellere Version.

Sollte ich heute Ling-3.0-flash in der Produktion einsetzen?

Erst nachdem Sie Ihre eigene Bewertung durchgeführt haben. Ohne unabhängigen Benchmark, eine unbestätigte Lizenz und Preise, die derzeit Aktion sind, ist es vernünftig, einen Pilotversuch zu starten, aber verfrüht, produktionskritische oder compliance-sensitive Workloads darauf zu übertragen, ohne eigene Tests und einen Plan dafür, was passiert, wenn die Aktionsbedingungen enden.

Fazit

Ling-3.0-flash ist eine wirklich neue Veröffentlichung, die es zu beobachten lohnt – ein 124B/5.1B-aktives MoE-Modell, das gezielt auf schnelle, günstige und hochvolumige Text- und Tool-Calling-Aufgaben ausgerichtet ist, und zwar von einem Labor, das bereits zuvor glaubwürdige Modelle ausgeliefert hat. Aber derzeit ist es nur ein Datenblatt und eine Reihe von Behauptungen des Anbieters, kein verifiziertes Produkt: keine unabhängigen Benchmarks, keine offenen Gewichte, keine bestätigte Lizenz und eine Preisgestaltung, die explizit als Werbeaktion deklariert ist. Das ist kein Grund, es abzutun – sondern ein Grund, es vorsichtig zu testen, die für Sie relevanten Behauptungen direkt zu überprüfen und diese Kurzanalyse erneut aufzusuchen, sobald Artificial Analysis oder ein anderer unabhängiger Bewerter echte Zahlen veröffentlicht.

© 2026 OrcaRouter

Für Anbieter

Sie betreiben eine Inferenz-Plattform? Bringen Sie Ihre Modelle auf OrcaRouter.

Kontaktieren Sie uns

Community beitreten

DiscordEmailXGitHubYouTube