Eine Titelkarte für Ling-3.0-flash-VL, die das Modell als ein natives multimodales Mixture-of-Experts mit 124B Parametern und 5,5B aktiven Parametern aus dem inclusionAI-Labor von Ant Group zusammenfasst, veröffentlicht im September 2026 unter der MIT-Lizenz, mit 25 Punkten auf dem Artificial Analysis Intelligence Index v4.3 und 142,9 Ausgabe-Token pro Sekunde.
Guides & Insights

Ling-3.0-flash-VL: Ants 5,5B-Active-Vision-Modell landet bei 25 im Intelligence Index

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ling-3.0-flash-VL hat jetzt einen Benchmark-Wert, den niemand bei Ant Group eingetippt hat, und das ist die Neuigkeit. Das erste native multimodale Modell aus dem inclusionAI-Lab von Ant erhält 25 auf dem Artificial Analysis Intelligence Index — ein unabhängiger Durchlauf auf der aktuellen v4.3-Skala, veröffentlicht zusammen mit einer Modellseite, auf der Geschwindigkeit, Latenz und Preis aufgeführt sind. Es erscheint drei Wochen, nachdem die eigene Modellkarte des Anbieters 42 auf demselben Index angegeben hatte, und das Nützlichste, was ein Leser mit diesen beiden Zahlen tun kann, ist zu verstehen, warum sie kein Widerspruch sind: Ant hat nach dem Intelligence-Index-Protokoll v4.1.1 gemessen, Artificial Analysis nach v4.3, und das sind unterschiedliche Maßstäbe, die aus unterschiedlichen Evaluationssets gebaut wurden. Die Zahl des Anbieters hat den Kontakt mit einem Dritten nicht so sehr überlebt, sondern wurde vielmehr auf einer Skala neu erhoben, die es nicht gab, als sie geschrieben wurde.

Das Modell unter dem Score ist ein Sparse Mixture-of-Experts mit 124 Mrd. Gesamtparametern und rund 5,5 Mrd. aktiven Parametern pro Token, veröffentlicht unter der MIT-Lizenz mit BF16- und FP8-Gewichten, das Text, Bilder und Videos akzeptiert und Text zurückgibt. Diese Zahl der aktiven Parameter ist das ganze Argument für die Sache. Mit 5,5 Mrd. aktiven Parametern liegt Ling-3.0-flash-VL auf der Kurve, die in offenen Modellen zur interessantesten geworden ist – die Frontier der Intelligenz, aufgetragen gegen aktivierte Parameter statt gegen die Gesamtgröße –, und es ist dort, weil es pro Einheit an Inferenzrechenleistung eine ordentliche Menge Arbeit leistet, nicht weil es riesig ist.

Dieser Beitrag behandelt, was tatsächlich veröffentlicht wurde und wann, was der unabhängige Durchlauf aussagt, warum die Pareto-Behauptung besser standhält als die meisten, was das Modell kostet und wo man es tatsächlich aufrufen kann. Die Kurzfassung, für alle, die nur diese wollen: Ling-3.0-flash-VL ist real, hat offene Gewichte, ist ungewöhnlich günstig im Betrieb, liegt messbar über dem Durchschnitt seiner Größenklasse und ist merklich wortreicher und langsamer bei der Veröffentlichung, als der reine Score vermuten lässt. Die vom Anbieter behauptete 42 wurde nie unabhängig reproduziert und ist nicht mit der 25 vergleichbar, die jetzt auf dem Board steht.

Was tatsächlich ausgeliefert wurde – und die Zeitachse, die immer wieder plattgewalzt wird

Die Berichterstattung über dieses Release neigt dazu, mehrere getrennte Ereignisse zu einem einzigen Veröffentlichungsdatum zusammenzufassen, und die Daten sind wichtig, weil sie erklären, warum frühe Berichte ein Modell beschrieben, das niemand außerhalb von Ant bewerten konnte. Das Hugging Face-Repository inclusionAI/Ling-3.0-flash-VL wurde am 4. September 2026 erstellt — 64 Shards BF16-Gewichte, eine MIT-Lizenz, einen Custom-Code-Stack für die bailing_moe_v3_vl Architektur, und für ein paar Tage lud es fast niemand herunter. Die FP8-Quantisierung folgte am 8. September, ungefähr 126 GB über 64 Shards, wobei der Vision-Turm mit höherer Präzision als die Expertengewichte gehalten wurde. Artificial Analysis listet das Release als 10. September 2026, wobei dies das Datum ist, auf das sich die eigene Seite bezieht, und die Modellseite mit dem Score ging etwa zu diesem Zeitpunkt live.

„Im September 2026 veröffentlicht“ ist korrekt, aber nutzlos. Die praktische Abfolge war: Gewichte am 4., ein zweites Präzisionsformat am 8. und eine unabhängige Messung am 10. Das ist deshalb wichtig, weil ein Modell mit Gewichten auf der Festplatte, aber ohne gehosteten Endpunkt und ohne Drittanbieter-Score für die meisten Teams noch nichts ist, was man evaluieren kann – es ist ein Download, für den man erst Ressourcen bereitstellen muss. Ling-3.0-flash-VL überschritt diese Grenze, als sowohl die API als auch der unabhängige Score existierten.

Serving-Unterstützung kam zeitgleich mit den Gewichten, nicht danach. Ant veröffentlichte ein SGLang-Deployment-Cookbook und pflegt einen auf Ling abgestimmten Fork von vLLM für die Architektur – den Teil einer offenen Veröffentlichung, der normalerweise um Wochen hinterherhinkt. Hier hinkte er nicht hinterher.

Die Zahl auf der Tafel und die auf der Karte

Hier ist die unabhängige Darstellung von Artificial Analysis, der einzigen derzeit existierenden Messung dieses Modells durch Dritte:

• Intelligenzindex — 25 auf v4.3, Platz 2 von 64 in seiner Größenklasse, gegenüber einem Klassenmedian von 8br /> • Gesamtparameter — 124Bbr /> • Aktive Parameter — 5,5B pro Tokenbr /> • Ausgabegeschwindigkeit — 142,9 Token/Sekunde, Nr. 10 von 64, gegenüber einem Vergleichsmedian von 105,1br /> • Zeit bis zum ersten Token — 2,21 Sekunden, gegenüber einem Vergleichsmedian von 2,29br /> • Kontextfenster — 262K Token, gemessen von Artificial Analysis, gegenüber den 256K, die die Modellkarte selbst angibtbr /> • Lizenz — MIT, offene Gewichte

Und hier ist die Anbieterangabe, die so oft daneben abgedruckt wird: 42 beim Artificial Analysis Intelligence Index, Protokoll v4.1.1, vier Punkte mehr als das, was das reine Textmodell Ling-3.0-flash im selben Protokoll erzielt hat. Diese Angabe steht in der Modellkarte, es gibt keine veröffentlichte Evaluierungs-Aufzeichnung, und es ist nicht die Zahl, die Artificial Analysis meldet. Zwei Dinge stimmen gleichzeitig: Die 42 ist nicht reproduziert, und sie ist kein Beweis für irgendetwas Unehrliches, weil v4.1.1 und v4.3 nicht dasselbe messen. Artificial Analysis hat seinen Index im September 2026 neu aufgestellt und sein gesamtes Board neu bewertet; v4.3 umfasst zehn Evaluierungen, darunter AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 und Humanity's Last Exam. Jeder Artikel, der immer noch eine 42 neben einer 25 zitiert, ohne die Version zu nennen, vergleicht zwei verschiedene Tests und nennt es einen Rückgang.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

Das Detail, das über die Schlagzeilen-Punktzahl hinaus hervorzuheben ist, ist die Ausführlichkeit. Artificial Analysis verzeichnet bei Ling-3.0-flash-VL Ausgaben von 160 Mio. Ausgabe-Tokens für den Abschluss des Intelligence Index, was auf Rang #8 von 64 gegenüber einem Median von 84 Mio. eingestuft wird, und bezeichnet es als „sehr ausführlich“. Für ein Modell, dessen Verkaufsargument kostengünstige Inferenz durch eine geringe Anzahl aktiver Parameter ist, läuft das dem Verkaufsargument direkt zuwider. Man zahlt pro Token, nicht pro Parameter. Ein Modell, das 5,5B aktiviert, aber fast die doppelte Token-Anzahl des Medians ausgibt, um dieselben Fragen zu beantworten, gibt einen Teil dieses strukturellen Vorteils an der Kasse zurück – was genau die Art von Wechselwirkung ist, die eine Preistabelle pro Token verbirgt und eine Messung der Kosten pro Aufgabe offenlegt.

Die Pareto-Behauptung, ein wenig unter Druck gesetzt

Die Behauptung, Ling-3.0-flash-VL liege auf der Pareto-Front zwischen Intelligenz und aktiven Parametern, ist ungewöhnlicherweise eine, die von den unabhängigen Daten gestützt und nicht bloß zugelassen wird. Der Klassenmedian auf diesem Index liegt bei 8; Ling-3.0-flash-VL erreicht 25; und das, während es 5,5 Mrd. Parameter pro Token aktiviert. Für Teams, deren bindende Einschränkung bedienbarer Durchsatz ist – ein einzelner Beschleuniger, ein festes Anfragebudget, ein Edge-Deployment –, macht dieses Verhältnis die gesamte Entscheidung aus, und das ist eine wirklich starke Leistung.

Zwei Vorbehalte verhindern, dass es ein sauberer Sieg wird. Der erste ist die Diskrepanz bei der Parameteranzahl: Die Model Card nennt ungefähr 5,5B aktive Parameter, während das SGLang-Cookbook ein Modell mit 5,1B aktiven Parametern beschreibt. Beides sind Ant-Dokumente, der Unterschied ist gering, und er verändert die Form der Kurve geringfügig, nicht aber ihre Richtung. Der zweite ist, dass „Frontier“ eine relative Behauptung über ein Feld ist, das sich wöchentlich bewegt. Bei der Intelligenz pro aktivem Parameter für eine gegebene Größe der Beste zu sein, ist eine Position, die man hält, bis das nächste Modell in dieser Größenklasse erscheint, und diese Größenklasse ist dicht besetzt.

Die eigene Vorzeigedemonstration des Anbieters – Ling-3.0-flash-VL, das unter dem Handle „linthium“ in der Image-to-WebDev Arena antritt, erzielte 1.441 gegen GPT-5.4, das 1.440 erreichte – sollte eher als Aufmerksamkeitsmacher denn als Ergebnis gelesen werden. Ein Ein-Punkt-Vorsprung liegt im Rauschen eines Arena-Elo, wird vom Anbieter gemeldet und ist nicht die Art von Abstand, die irgendetwas entscheidet. Der dahinterstehende Fähigkeitsanspruch ist interessanter als die Zahl: Das Modell ist für eine visuelle Feedbackschleife gebaut, in der es aus einem Layout Frontend-Code erzeugt, seine eigene Ausgabe rendert, sich das Rendering ansieht und korrigiert – beobachten, handeln, verifizieren, korrigieren, statt einmal eine Beschriftung zu erzeugen und dann aufzuhören.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Was es kostet, was weniger klar ist, als es aussieht

Die Seite von Artificial Analysis führt Ling-3.0-flash-VL mit 0,00 $ pro 1 Mio. Eingabe- und 0,00 $ pro 1 Mio. Ausgabe-Token, gegenüber den Vergleichsmedians von 0,14 $ und 0,40 $. Das ist kein Preis. Es ist der Anschein eines Preises. Artificial Analysis bepreist den Endpunkt, den es sehen kann, und der Endpunkt, den es sehen kann, ist kostenlos – das Modell läuft auf Ants Ling Studio als kostenlose Testversion, und genau dieser kostenlose Werbezugang spiegelt sich in der Auflistung wider. Ants eigene multimodale Dokumentation veröffentlicht für das Vision-Modell überhaupt keine Preise pro Token, es gibt also keine Preisliste des Anbieters, gegen die man die Null prüfen könnte. Zum Maßstab: Das reine Textmodell Ling-3.0-flash wurde mit etwa 0,075 $ pro 1 Mio. Eingabe- und 0,22 $ pro 1 Mio. Ausgabe-Token gelistet, und Ants domänenspezifische Ling-Varianten starteten ebenfalls als kostenlose APIs.

Betrachten Sie die Null als Testfenster und nicht als Tarif. Kostenlose Stufen bei frisch veröffentlichten Modellen sind ein Instrument zur Kundengewinnung, und die ehrliche Planungsannahme ist, dass Ling-3.0-flash-VL irgendwann einen Preis in der Größenordnung seines Text-Geschwisters tragen wird. Außerdem gibt es eine anhaltende Unklarheit, die das Erscheinen eines kostenpflichtigen Endpunkts nicht auflösen wird: Ants eigene API-Beispiele verwenden die Modellkennung Ling-3.0-flash-VL-rc1, eine Release-Candidate-Kennzeichnung, und es bleibt unklar, ob der bereitgestellte Checkpoint byteidentisch mit den offenen Gewichten vom 4. September ist. Wenn Sie Ihre eigenen Prompts gegen die gehostete API benchmarken und erwarten, dass die Ergebnisse auf einen selbst gehosteten BF16-Build übertragbar sind, dann ist das eine Annahme, die Sie testen sollten, bevor Sie darauf aufbauen.

Das Kostenbild kehrt sich um, je nachdem, auf welcher Seite man steht. Für ein Team, das bereits über Beschleuniger verfügt, passt der FP8-Build mit ungefähr 126 GB in einen Acht-Wege-Knoten der 80-GB-Klasse, und die 5,5B aktiven Parameter bedeuten, dass man die amortisierten Kosten dieses Knotens gegen einen sehr kleinen Rechen-Fußabdruck pro Token zahlt – die günstigstmögliche Version dieses Modells ist die, die man selbst bereitstellt. Für ein Team ohne Beschleuniger ist die Frage, ob ein kostenpflichtiger Endpunkt verfügbar wird, bevor die kostenlose Stufe schließt.

Wo Sie es tatsächlich aufrufen können, einschließlich des Teils, in dem wir Nein sagen.

Ling-3.0-flash-VL ist über Ants eigene Plattform erreichbar — ein OpenAI-kompatibler Endpunkt unter api.ant-ling.com/v1/chat/completions und ein Anthropic-kompatibler daneben — plus kostenloser Testzugang auf Ling Studio, plus offene Gewichte, die du selbst hosten kannst. Unabhängige Gateways haben begonnen, es ebenfalls aufzulisten, und das ist wirklich der schnellste Weg, es auszuprobieren, ohne irgendetwas bereitstellen zu müssen.

Was klar gesagt werden sollte, ist, dass OrcaRouter routet Ling-3.0-flash-VL heute nicht. Es ist nicht in unserem Modellkatalog, also wäre alles, was Sie hier über einen Aufruf über uns lesen, Fiktion, und wir hätten es lieber, wenn Sie das von vornherein wüssten. Was wir routen, ist das Vision-Modell, das am direktesten damit vergleichbar ist: DeepSeek V4 Flash Vision Exp, die experimentelle multimodale Version von Deep​Seek, die in unserem Katalog live ist, mit einem Kontextfenster von 1 Mio. Token und einem veröffentlichten Preis. Wenn Ihre tatsächliche Anforderung ein leistungsfähiges Vision-Modell hinter einem OpenAI-kompatiblen Endpunkt ist — mit einer eingerichteten Fallback-Kette, sodass bei einem Aussetzer eines Anbieters erneut versucht wird, bevor Ihre Antwort beginnt, und die Listenpreise der Anbieter ohne Aufschlag weitergegeben werden, sodass eine Preisänderung eines Anbieters Sie am selben Tag erreicht, an dem sie erfolgt — dann ist das das Modell, das Sie zuerst ausprobieren sollten, solange Ling-3.0-flash-VL außerhalb des Katalogs bleibt.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Was von hier aus zu beobachten ist

Drei Dinge werden darüber entscheiden, ob dieses Release in sechs Monaten bedeutend erscheint. Das erste ist ein zweiter unabhängiger Lauf: Ein Score von einem Evaluator ist ein Datenpunkt, und die interessante Frage ist, ob die Platzierung von Ling-3.0-flash-VL auf der Kurve von Intelligenz gegenüber aktiven Parametern einen anderen Harness übersteht. Das zweite ist echte Preisgestaltung. Solange Ant keine Preisliste für das Vision-Modell veröffentlicht, ist jeder Kostenvergleich damit eine Schätzung im Gewand einer Zahl, und die kostenlose Stufe erledigt die Arbeit, die sonst ein Preis erledigen würde. Das dritte ist das FP8-Qualitätsdelta – der Vision-Tower wurde in diesem Build bewusst auf höherer Präzision gehalten als die Expertengewichte, und ob die quantisierte Version bei feingranularen visuellen Aufgaben mit BF16 mithält, ist genau die Art von Frage, die erst auftaucht, wenn Leute sie im Produktivbetrieb laufen lassen, statt sie zu benchmarken.

Das heute verfügbare Urteil ist enger gefasst, als die Launch-Berichterstattung nahelegte, und nützlicher als die Punktzahl allein. Ling-3.0-flash-VL ist ein echtes, MIT-lizenziertes, selbst hostbares Vision-Modell, das nur einen kleinen Bruchteil seiner 124 Mrd. Parameter aktiviert, auf einem aktuellen unabhängigen Index 25 Punkte erzielt – gegenüber einem Klassenmedian von 8 – und einen Teil dieses Vorteils durch Weitschweifigkeit wieder abgibt. Das ist ein gutes Modell mit ehrlichem Zuschnitt. Die 42 auf der Modellkarte ist eine Zahl von einem Maßstab, den es nicht mehr gibt.