Ein generiertes Hero-Titelbild für Ling-3.0-flash-VL, mit dem Untertitel „Ant eröffnet ein multimodales Modell auf der schnellen Ling-Linie“, das drei Eingabesymbole mit den Beschriftungen Text, Bild und Kurzvideo zeigt, die durch einen Chip mit der Aufschrift „124B sparse MoE · 5.5B active“ in ein Textausgabe-Symbol führen, mit Fußzeilen-Chips „MIT weights“, „Live API“ und „FP8“ sowie dem Hinweis „Gewichte veröffentlicht am 4. September 2026“ und dem OrcaRouter-Logo unten rechts.
Guides & Insights

Ling-3.0-flash-VL: Ant bringt ein multimodales Modell in der schnellen Ling-Reihe heraus

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 4. September 2026 veröffentlichte das inclusionAI-Labor von Ant Group die MIT-lizenzierten Gewichte von Ling-3.0-flash-VL auf Hugging Face und aktualisierte noch am selben Tag die Entwicklerdokumentation der Ant-Ling-Plattform entsprechend. Ling-3.0-flash-VL ist der erste Checkpoint mit Bildverständnis in der Ling-3.0-flash-Familie: Dasselbe Sparse-Mixture-of-Experts-Backbone mit rund 124 Milliarden Parametern, das das reine Textmodell Ling-3.0-flash zu einem der meistdiskutierten günstigen Reasoning-Modelle des Spätsommers machte, verarbeitet nun neben Text auch Bilder und kurze Videoclips. Die FP8-Quantisierung folgte am 8. September, am Morgen, an dem dieser Artikel entsteht. Innerhalb von vier Tagen erhielt das Release damit drei Zugangswege, über die ein Leser aktiv werden kann: offene Gewichte, eine offizielle API auf Ants Ling-Plattform und einen vom Anbieter gemeldeten Score von 42 im Artificial-Analysis-Intelligence-Index-Protokoll Version 4.1.1 – vier Punkte über dem unabhängig gemessenen Wert von 38 des textbasierten Schwestermodells. Was ihm noch fehlt, ist eine formelle Ankündigung: Die Hugging-Face-Karte und das Entwickler-Tutorial sind der gesamte Launch. Genau deshalb trennt dieser Artikel die Angaben des Anbieters von dem, was ein Außenstehender verifizieren kann.

Die Veröffentlichung ist wichtig wegen ihrer Auswirkungen auf Ants Produktlandschaft. Bis Mitte 2026 befand sich die multimodale Arbeit in Ants Modellportfolio in der separaten Ming-Linie, während Ling-3.0-flash – auch im eigenen Erklärstück dieses Blogs zum Textmodell – als die schnelle, auf Text und Tools ausgelegte Stufe für Agenten, Programmierung und Deep Research positioniert war. Ling-3.0-flash-VL sprengt diese Grenze: Es bringt visuelle Informationen in ein Reasoning-Modell, das um einen ungewöhnlich kleinen Footprint aktivierter Parameter und lange agentische Läufe herum gebaut ist, und übergibt das Ergebnis Entwicklern gleich auf dreierlei Weise. Das macht es zu einer grundlegend anderen Entscheidung als die früheren domänenangepassten Varianten (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), die als kostenlose APIs ohne Gewichte ausgeliefert wurden. Dieses Modell ist offen, läuft auf Ants kostenpflichtiger Plattform und ist so neu, dass noch niemand außerhalb des Anbieters einen unabhängigen Lauf veröffentlicht hat. Der letzte Punkt ist der wichtigste in diesem Beitrag.

Was wurde veröffentlicht, und wann?

Jedes unten genannte Datum ist anhand der Repositories und der Dokumentation überprüfbar; nichts davon beruht auf einer Pressemitteilung, die nicht existiert.

• 4. September — das Repository inclusionAI/Ling-3.0-flash-VL auf Hugging Face wurde um 15:24 UTC mit 64 bf16-Shards von Gewichten, einem vollständigen Custom-Code-Stack für die bailing_moe_v3_vl Architektur, einem Chat-Template mit standardmäßig aktiviertem Denken und einer MIT-Lizenz erstellt. Die Download-Zahl liegt zum Zeitpunkt des Schreibens bei einigen Dutzend: Das ist ein Release, das nur ein Repo-Beobachter am ersten Tag entdeckt hätte.

• 4. September — Das Entwicklerportal der Ling-Plattform von Ant hat das Tutorial zum multimodalen Verständnis hinzugefügt, das das Modell auf der offiziellen API dokumentiert (der „Zuletzt aktualisiert“-Vermerk der Seite selbst trägt das Datum 4. September 2026). Chinesische Entwicklermedien berichteten am darauffolgenden Tag über die Funktion und stellten sie als Bild- und Kurzvideo-Verständnis für visuelle Fragebeantwortung und Inhaltsanalyse dar.

• Ab dem 5. September folgte die Serving- und Deployment-Unterstützung schnell: ein SGLang-Deployment-Cookbook für das Modell, ein von der inclusionAI-Organisation gepflegter, eigener vLLM-Fork und ein Eintrag in einer Bring-your-own-Weights-Deployment-Bibliothek mit einem vorgefertigten Chat-Completions-Endpunkt. Das sind Laufzeitumgebungen und Infrastruktur, keine Ankündigungen – aber sie zeigen, dass das Modell dafür gebaut wurde, serviert zu werden, nicht nur veröffentlicht zu werden.

• Am 8. September — die FP8-Quantisierung inclusionAI/Ling-3.0-flash-VL-fp8 wurde veröffentlicht (64 Shards, ~126 GB), wobei der Vision Tower bewusst in höherer Präzision belassen wurde, während die MoE-Gewichte auf FP8 E4M3 komprimiert sind. Für Self-Hosting auf weniger oder kleineren GPUs ist dies der Checkpoint, den die meisten Menschen tatsächlich herunterladen werden.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

Die obige Karte ist das, was dieses Release am ehesten an einem Launch-Post zu bieten hat – Modellbeschreibung, Architektur, Links zu den SGLang- und vLLM-Rezepten – und sonst keine Ankündigung, die wir finden können. Beachten Sie die Unstimmigkeit, die es sich lohnt, vorab zu erwähnen: Die Modellkarte sagt „nur 5.5B Parameter pro Token aktiviert“, während das etwa zeitgleich mit diesem Release verfasste SGLang-Kochbuch ein „5.1B aktives“ Modell beschreibt. Bei einem brandneuen Checkpoint ist der Unterschied wahrscheinlich auf die Zählweise des Vision-Towers zurückzuführen und nicht auf zwei verschiedene Modelle, aber es ist genau die Art von Detail, die als ungeklärt markiert werden sollte, anstatt überspielt zu werden.

Ein 124B-Modell, das 5,5B aktiviert – jetzt mit Augen

Ling-3.0-flash-VL behält das hybride sparse-MoE-Rezept bei, das die Textvariante prägte. Die Modellkarte beschreibt ein 42-Schichten-Backbone, bei dem sich Kimi-Delta-Attention- und Gated-MLA-Schichten im Verhältnis 5:1 abwechseln — der gleiche strukturelle Rhythmus wie bei Ling-3.0-flash — mit insgesamt rund 124,8 Milliarden Parametern, von denen pro Token nur ein kleiner Teil aktiviert wird. Was neu ist, ist der Wahrnehmungs-Stack: ein visueller ViT-Encoder, dessen Ausgabe über einen zweischichtigen MLP-Projektor in das Sprach-Backbone eingespeist wird, plus VideoRoPE, um sowohl räumliche als auch zeitliche Positionen zu kodieren, sodass Videoframes in einer Reihenfolge ankommen, die das Modell nachvollziehen kann. Die Eingabe besteht aus Text, Bild und Video; die Ausgabe ist Text.

• Parameter — insgesamt 124B, ~5,5B pro Token aktiviert, laut Anbieterkarte (siehe obigen Hinweis zur Zählweise).

• Kontext — beworben als „bis zu 1M Token“; die heute existierenden Deployment-Rezepte erreichen 256K über YaRN-RoPE-Scaling, was die ehrliche praktische Kennzahl ist, mit der man planen sollte, bis jemand einen verifizierten längeren Lauf veröffentlicht.

• Thinking — das Reasoning ist standardmäßig über die Chat-Vorlage aktiviert; sowohl die offiziellen API-Beispiele als auch die Serving-Rezepte zeigen einen enable_thinking: false-Schalter pro Anfrage für latenzempfindliche Aufrufe.

• Lizenz — MIT, beide Präzisionsformate, ohne Zusatzbedingungen. Dies ist dieselbe saubere Lizenz, die das Open-Sourcing des Textmodells im August bemerkenswert machte, und sie ist der einzige Grund, warum Selbsthosting eine realistische Option und keine Grauzone ist.

Die Design-Intention zählt genauso viel wie das Datenblatt. Ant positioniert Ling-3.0-flash-VL als ein Modell, das „visuelle Informationen in den vollständigen Prozess des Verstehens, Denkens, Handelns und Verifizierens einbringt" — das ist die Sprache agentischer Workloads, nicht die der Bildbeschriftung. Ein Modell, das eine 30-sekündige Bildschirmaufnahme betrachten, eine lange Tool-Calling-Sitzung im Kontext halten und seine aktivierten Kosten nahe 5B Parametern halten kann, zielt direkt auf Computer-Use-Agenten und auf Kurzvideo-gestützte Agenten ab. Das ist ein anderes Produkt als die Vision-Language-Modelle, die für die Beantwortung von Fragen zu Einzelbildern optimiert sind, und es ist der Rahmen, vor dem jede der folgenden Benchmarks gelesen werden sollte.

Was die offizielle API tatsächlich akzeptiert

Das Tutorial zur Ant-Ling-Plattform behandelt Ling-3.0-flash-VL für zwei API-Varianten: einen OpenAI-kompatiblen Endpunkt unter api.ant-ling.com/v1/chat/completions und einen Anthropic-kompatiblen Endpunkt unter api.ant-ling.com/anthropic/v1/messages. Die Einschränkungen sollte man kennen, bevor man darauf aufbaut:

• Bilder — JPEG und PNG, nur Base64, bis zu 40 Bilder pro Anfrage, jedes Bild bis zu 16.384 × 784 Pixel und jeder Base64-String bis zu 32 MB. Der OpenAI-kompatible image_url.detail-Parameter wird ignoriert; die Engine entscheidet intern über die Auflösung.

• Video — MP4, MOV oder WMV, ein Clip pro Anfrage, auf 30 Sekunden begrenzt, mit festen 2 Bildern pro Sekunde bis zu 32 Bildern abgetastet, base64 bis zu 32 MB. Video funktioniert nur auf dem OpenAI-kompatiblen Endpunkt; der Anthropic-kompatible Endpunkt akzeptiert Text und Bilder, aber kein Video.

• Modellkennung — die curl-Beispiele des Tutorials bezeichnen das Modell als Ling-3.0-flash-VL-rc1 statt Ling-3.0-flash-VL. Dieses -rc1-Suffix ist eine Kennzeichnung für einen Release-Kandidaten und eine echte offene Frage: In der Dokumentation steht nichts darüber, welche Gewichte die Plattform bereitstellt oder ob der API-Checkpoint mit dem Build der offenen Gewichte vom 4. September übereinstimmt. Wenn Sie die API mit den offenen Gewichten vergleichen, ist das das Erste, was Sie testen sollten, und keine Annahme, die Sie treffen sollten.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

Auf der obigen Seite sind die Eingabebeschränkungen festgelegt – Bild- und Videoformate, Obergrenzen pro Anfrage sowie die beiden Endpunkt-Arten. Dort wird außerdem bestätigt, dass es sich bei dem Modell um ein tatsächlich verfügbares kommerzielles API-Angebot handelt und nicht nur um einen reinen Dokumentations-Platzhalter.

Die Zahlen — und wer sie gemeldet hat

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

Die eine zentrale Kennzahl auf der Karte ist 42 im Artificial-Analysis-Intelligence-Index-Protokoll Version 4.1.1, die laut Ant vier Punkte vor dem Wert von 38 des reinen Textmodells Ling-3.0-flash liegt. Die Unterscheidung in diesem Satz trägt das Gewicht. Die 38 ist eine Messung von Artificial Analysis – unabhängig durchgeführt, auf deren Leaderboard veröffentlicht und in der gesamten Branchenberichterstattung über das Textmodell zustimmend zitiert. Die 42 ist eine Behauptung auf Ants eigener Modellkarte, die unter einem AA-Index-Protokoll aufgestellt wurde, aber noch nicht von Artificial Analysis gelistet ist, das zum Zeitpunkt dieses Schreibens keine Seite für Ling-3.0-flash-VL hatte. Niemand außerhalb von Ant hat diesen Checkpoint bisher ausgeführt. Betrachten Sie die 42 als eine Herstellerangabe aus derselben Familie, die auch die echte 38 des Textmodells hervorgebracht hat – ein Grund, genauer hinzusehen, nicht eine Zahl, die als gesichert zitiert werden kann.

Alles andere in der Veröffentlichung ist qualitativ oder methodologisch. Die Karte beschreibt das Modell anhand einer „Verstehen, Denken, Handeln“-Fähigkeitsgrafik und deutet eine agentische Terminal-Bench-Evaluierung unter einem AA-artigen Protokoll an, veröffentlicht aber keine numerischen Textergebnisse, die wir hier reproduzieren könnten; das Deployment-Kochbuch listet Genauigkeitszellen (MMMU-Pro, GSM8K) auf, die an bestimmte Serving-Konfigurationen gebunden sind und lesenswert sind, aber eher infrastrukturnahe Messungen als unabhängige Bewertungen darstellen. Die ehrliche Zusammenfassung ist kurz: ein plausibles, kostengünstig zu betreibendes, visionsfähiges Denkmodell ohne öffentliche unabhängige Bestenliste bislang.

Was es kostet und was die Familiengeschichte nahelegt

Ams multimodalem Tutorial ist kein Preis pro Token für Ling-3.0-flash-VL zu entnehmen, daher ist alles hier Inferenz und entsprechend klar gekennzeichnet. Der nützliche Anker ist das Text-Gegenstück auf derselben Plattform: Der Erstanbieter-Listenpreis von Ling-3.0-flash liegt bei etwa 0,075 $ pro 1M Input-Token und 0,22 $ pro 1M Output, wobei Cache-Reads rund 80 % günstiger sind; die chinesische Konsole bepreist es in Renminbi (0,40 ¥ Input / 1,20 ¥ Output pro 1M Token) nach einer frühen 75-%-Rabattaktion, die am 31. August endete. Ein multimodales Modell mit 124B-A5.5B ist im Betrieb teurer als ein Textmodell mit 124B-A5.1B – der Vision-Turm ist dicht und läuft für jedes Bild-Token – daher ist ein Preis auf oder leicht über diesem Band die vernünftige Ausgangserwartung. Die Historie der Modellfamilie spricht aber auch in die andere Richtung: Die Domain-Varianten Fin und Sante wurden als kostenlose APIs gestartet; Ant hat also gezeigt, dass es Nullpreise nutzt, um die Adoption einer Ling-Variante anzukurbeln, die es im Markt haben möchte. Ob die VL nun dem bezahlten Textmodell-Band folgt oder dem Muster der kostenlosen Variante, ist schlicht noch nicht öffentlich bekannt.

Bei der Selbsthosting-Route sind die Zahlen konkret, da die Dateien öffentlich sind. Das bf16-Release umfasst etwa 250 GB Download über 64 Shards – eine Multi-GPU-Angelegenheit, die auf allem außer den größten Einzelknoten schwierig ist –, während das FP8-Release (~126 GB, Vision-Tower in bf16 gehalten) bequem auf einen Knoten mit 8 × 80-GB-Beschleunigern passt und die Version ist, die die meisten Teams tatsächlich ausführen werden. Durchsatzangaben aus dem Serving-Kochbuch existieren zwar, stammen aber aus Anbieternähe; es gilt der übliche Vorbehalt, dass der tatsächliche token/s-Wert von Ihrer Hardware und Ihrem Batch abhängt.

Wo eine Routing-Ebene hineinpasst — ehrlich

Zum Start listet keines der großen Modell-Gateways von Drittanbietern, die wir geprüft haben, Ling-3.0-flash-VL, und auch OrcaRouter — die Routing-Plattform, zu der dieser Blog gehört — bietet es nicht an. Nichts in diesem Beitrag sollte so gelesen werden, als wäre es der Fall. Das ist der ehrliche Stand eines vier Tage alten Modells, und es lohnt sich, das klar zu sagen, denn die Optionen, die ein Leser heute tatsächlich hat, sind genau zwei: die offizielle API von Ant aufrufen oder die MIT-Gewichte selbst hosten. Der Routing-Aspekt ist das, was als Nächstes kommt. Sobald ein solches Modell über Drittanbieter verfügbar ist, ist die Ökonomie eines Pass-through-Routers der Grund, ihn für die Evaluierung zu bevorzugen: Der Listenpreis des Anbieters wird ohne Aufschlag weitergegeben, sodass eine Preissenkung des Anbieters (oder ein Experiment mit kostenlosem Tarif wie die Fin- und Sante-Launches) am selben Tag live ist, an dem sie angekündigt wird. Automatisches Failover ermöglicht es zudem, eine reale Workload auf ein erst wenige Tage altes offenes Modell zu richten, ohne den eigenen Stack an die Betriebszeit eines einzelnen Anbieters oder das Verhalten eines einzelnen Checkpoints zu koppeln. Für eine Modellfamilie, die ihre Preise bereits einmal neu festgesetzt hat und sich in sechs Wochen in vier Varianten aufgespalten hat, ist das keine Hypothese — es ist der Unterschied zwischen manuellem Nachtesten bei jeder Änderung von Ant und einmaligem Nachtesten über eine einzige API.

Was zu sehen

Diese Veröffentlichung ist noch so jung, dass die brauchbaren Signale größtenteils Prüfungen sind, die jeder durchführen kann. Erstens, ob Artificial Analysis (oder ein anderes unabhängiges Labor) Ling-3.0-flash-VL aufführt und die 42 bestätigt oder korrigiert – dieser einzelne Datenpunkt trennt „das beste Modell der Familie“ von „einer weiteren Anbieternummer“. Zweitens, ob die -rc1-Kennung in der offiziellen API auf die Open Weights vom 4. September verweist; falls nicht, sind die API und der Selbsthosting-Pfad verschiedene Modelle, und jeder Vergleich, den Sie lesen, muss angeben, welches davon verwendet wurde. Drittens: die Preisgestaltung – ein veröffentlichter VL-Tarif auf der Ling-Plattform und ob er der kostenpflichtigen Preisstufe des Textmodells oder dem Playbook der kostenlosen Fin/Sante-API folgt. Viertens, ob der FP8-Checkpoint die Genauigkeit der Karte im realen Betrieb hält – der in bf16 gehaltene Vision-Tower ist ein gutes Zeichen, aber Behauptungen über quantisierte Vision benötigen einen Lauf, keine Konfiguration. Und fünftens: die Produktzuordnungsfrage – jetzt, da Vision in der schnellen Ling-Linie integriert ist, beobachten Sie, ob Ant Ming als separate multimodale Marke beibehält oder die beiden konvergieren lässt.

Für einen Entwickler ist die kurzfristige Antwort kurz. Wenn Sie heute darauf aufbauen möchten, ist die offizielle API der Weg ohne Infrastruktur, und die FP8-Gewichte sind der Weg für Self-Hosting – beide sind seit dieser Woche real verfügbar. Wenn Sie auf die Zahl 42 aufbauen möchten, warten Sie, bis jemand außerhalb von Ant sie reproduziert. Alles, was an Ling-3.0-flash-VL wirklich nützlich ist – MIT-Gewichte, eine plausible Architektur, ein aggressives Preis-pro-Aktivierung-Design und ein Anbieter-Score, der ernst zu nehmen ist – ist vorhanden; alles, was es zu einer sicheren Standardoption machen würde, steht noch aus.