
Ling-3.0-flash-VL vs. DeepSeek V4 Flash Vision Exp: Zwei Wetten auf Open Vision
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Ling-3.0-flash-VL und DeepSeek V4 Flash Vision Exp sind die beiden Open-Weight-Vision-Modelle dieser Gewichtsklasse, die ein Team heute realistisch herunterladen und betreiben kann, und sie wurden von Leuten gebaut, die sich uneinig darüber sind, wofür Vision da ist. Ling-3.0-flash-VL aus dem inclusionAI-Labor von Ant Group aktiviert pro Token etwa 5,5 Mrd. seiner 124 Mrd. Parameter und betrachtet Vision als etwas, das innerhalb einer Rückkopplungsschleife angewendet wird – generieren, rendern, hinsehen, korrigieren – bei geringstmöglichen Inferenzkosten. DeepSeek V4 Flash Vision Exp, DeepSeeks erster multimodaler Bau, kombiniert ein Kontextfenster von 1 Mio. Token mit einer maximalen Ausgabe von 384K Token und betrachtet Vision als einen weiteren Input, den ein Agent liest, während er eine lange Aufgabe erledigt. Das eine ist darauf optimiert, wie wenig das Denken kostet. Das andere ist darauf optimiert, wie viel es halten kann, während es das tut.
Dieser Unterschied, nicht ein Benchmark-Delta, sollte die Entscheidung bestimmen. Die beiden Modelle haben kein gemeinsames Evaluationsprotokoll, an dem sie verglichen werden könnten, und nur eines von ihnen hat überhaupt eine unabhängige Bewertung. Was folgt, ist die ehrliche Gestalt des Vergleichs: die Architektur-Wetten, die Spezifikationen, die tatsächlich voneinander abweichen, die Benchmark-Lage einschließlich der Frage, warum sie dünn ist, was jedes kostet und welches für welche Aufgabe gewinnt – plus der Teil, in dem wir klar sagen, welches der beiden in unserem Katalog ist.
Die beiden Wetten, präzise formuliert
Die Ling-Seite davon ist eine Wette auf Aktivierungssparsität als primären Kostenhebel. Ling-3.0-flash-VL ist ein sparse Mixture-of-Experts mit insgesamt 124B Parametern – die Modellkarte zeigt etwa 124,8B, und das SGLang-Cookbook beschreibt 5,1B aktiv, wo die Karte ungefähr 5,5B angibt – und betreibt einen 42-schichtigen Hybrid-Trunk, der Kimi Delta Attention mit gated MLA-Blöcken in einem Verhältnis von 5:1 abwechselt. Ein Vision-Encoder mit beliebiger Auflösung und ein zweischichtiger MLP-Projektor speisen diesen Trunk, wobei VideoRoPE die räumliche und zeitliche Position handhabt, sodass Videoframes in einer kohärenten Reihenfolge landen. Die architektonische Konsequenz ist ein Modell, dessen Betrieb pro Token nur einen kleinen Bruchteil eines dichten 124B kostet, was der ganze Grund dafür ist, dass es an der Frontier von Intelligenz versus aktiven Parametern auftaucht.
Die DeepSeek-Seite ist eine Wette auf Kontext und agentisches Durchhaltevermögen. DeepSeek V4 Flash Vision Exp übernimmt die Textarchitektur von DeepSeek-V4-Flash, ergänzt einen Vision-Encoder und einen Aligner und setzt dann das Training fort — eine Quelle gibt das Ergebnis mit rund 305 Mrd. Parametern an, was DeepSeek nicht im Detail bestätigt hat. Es verfügt über ein Kontextfenster von 1.048.576 Token und eine maximale Ausgabe von 384.000 Token, unterstützt JSON-Ausgabe, Tool-Aufrufe, die Responses API, die Anthropic API und die Fortsetzung von Gesprächspräfixen, und DeepSeek hat ausdrücklich klargestellt, dass dies kein visuelles Frage-Antwort-Modell ist. Es ist Wahrnehmung für Agenten: das Lesen von Web-Screenshots, Software-Oberflächen und Diagrammen und das anschließende Übergehen in Tool-Aufrufe. Bilder werden in Token umgewandelt und als solche abgerechnet, mit einer Obergrenze von 384 Token pro Bild.
Liest man diese beiden Absätze zusammen, zeigt sich die Form der Entscheidung. Wenn Ihr Workload „schau dir das an, entscheide etwas, handle, schau wieder hin“ lautet, dann ist bei Ling die Anzahl der aktiven Parameter das, was die Schleife erschwinglich macht, und sein Vision-Feedback-Design ist genau darauf ausgerichtet. Wenn Ihr Workload „lies dieses 400-seitige Dokument mit Abbildungen darin und mach weiter“ lautet, dann ist das Kontextfenster von DeepSeek das entscheidende Merkmal, und nichts auf der Ling-Seite kann damit konkurrieren.
Warum der Benchmark-Vergleich dünner ist, als er aussieht
Dies ist der Abschnitt, den die meisten Vergleiche überspringen, und ihn zu überspringen führt zu einer Tabelle voller Zahlen, die nichts bedeuten. Hier ist der tatsächliche Stand der Evidenz.
Ling-3.0-flash-VL hat eine unabhängige Messung: 25 im Artificial Analysis Intelligence Index v4.3, rangiert auf Platz 2 von 64 in seiner Größenklasse gegenüber einem Klassenmedian von 8. Die Karte des Anbieters gibt separat 42 für das Intelligence Index protocol v4.1.1 an, einer eingestellten Skala, die nicht vergleichbar ist — behandeln Sie die 42 als nicht reproduziert.
DeepSeek V4 Flash Vision Exp hat überhaupt keine Seite bei Artificial Analysis. Jede dazu veröffentlichte Zahl stammt von DeepSeek selbst, aus der Ankündigung zur Veröffentlichung, und mehrere davon sind ausdrücklich relativ zu Opus-4.8 statt zu einem festen Protokoll angegeben. Das ist keine Kritik an den Zahlen; es ist eine Aussage darüber, was man mit ihnen machen kann. Man kann ein unabhängig bewertetes Modell und ein ausschließlich vom Anbieter bewertetes Modell nicht in dieselbe Spalte setzen und einen Gewinner erklären, und jede Seite, die das tut, fabriziert ein Ergebnis.
Legitim ist der Vergleich jedes Modells mit seiner eigenen berichteten Bilanz, mit beigefügter Provenienz:
• Ling-3.0-flash-VL, unabhängig — Intelligence Index 25 auf v4.3, Nr. 2 von 64 in der Klasse, Klassenmedian 8, laut Artificial Analysisbr /> • Ling-3.0-flash-VL, Anbieter — 42 im eingestellten v4.1.1-Protokoll und 1.441 gegenüber GPT-5.4s 1.440 in der Image-to-WebDev Arena als „linthium"; beides vom Anbieter gemeldet und der Vorsprung in der Arena liegt innerhalb des Elo-Rauschensbr /> • DeepSeek V4 Flash Vision Exp, Anbieter — Terminal Bench 2.1 83,9; DeepSWE 59,3 gegenüber Opus-4.8s 58,0; Agents' Last Exam 27,3 gegenüber Opus-4.8s 25,7; Toolathlon-Verified 75,9; Cybergym 75,3; Chartography 64,3; NL2Repo 57,7; DSBench-Hard 63,6; ZeroBench Pass@5 35,0; ApexBench Pass@1 36,5; AutomationBench 25,7br /> • DeepSeek V4 Flash Vision Exp, unabhängig — keine veröffentlicht
Beachte, woraus die DeepSeek-Liste überwiegend besteht: agentische und Software-Engineering-Evaluierungen, keine Vision-Evaluierungen. DeepSeeks eigene Darstellung ist, dass das Vision-Modell bei reinen Textaufgaben mit dem offiziellen DeepSeek-V4-Flash ohne Regression mithält und dass die Zugewinne bei multimodalen Agenten-Benchmarks liegen – wo DeepSeek das Ergebnis als Annäherung an Opus-4.8 beschreibt, statt es zu übertreffen, und einen Abstand von etwa zehn Punkten bei den strukturierten Data-Science- und Code-Aufgaben NL2Repo und DSBench-Hard einräumt. Das ist eine ungewöhnlich sorgfältige Reihe von Aussagen, und sie verrät, dass das Modell als Wahrnehmungs-Upgrade für einen bestehenden Agenten-Stack verkauft wird und nicht als neue Obergrenze.

Die Spezifikationen, die tatsächlich voneinander abweichen
Die meisten Angaben der beiden Datenblätter stimmen überein: Beide sind Open-Weight unter MIT, beide nehmen Text und Bilder entgegen und geben Text zurück, beide liefern BF16-Gewichte mit quantisierten Builds, für beide sind Serving-Rezepte veröffentlicht, und beide verarbeiten Video in irgendeiner Form. Die Unterschiede konzentrieren sich auf vier Punkte.
• Parameter — Ling-3.0-flash-VL hat insgesamt 124B Parameter bei etwa 5,5B aktiven pro Token; für DeepSeek V4 Flash Vision Exp werden rund 305B angegeben, ohne veröffentlichte Angabe zu den aktiven Parameternbr /> • Kontextfenster — Ling-3.0-flash-VL misst laut Artificial Analysis 262K Token gegenüber den 256K, die die eigene Modellkarte nennt; DeepSeek V4 Flash Vision Exp läuft nativ mit 1.048.576 Tokenbr /> • Maximale Ausgabe — Ling-3.0-flash-VL ist deutlich kürzer, im Bereich von Zehntausenden von Token; DeepSeek V4 Flash Vision Exp erreicht 384.000br /> • Bildverarbeitung — Ling-3.0-flash-VL akzeptiert bis zu 40 Bilder pro Anfrage mit bis zu 16.384 × 784 Pixeln pro Bild, ausschließlich base64; DeepSeek V4 Flash Vision Exp akzeptiert base64, externe URLs oder eine Files-API-Referenz und begrenzt die Bildkosten auf 384 Token pro Bildbr /> • Aktive Parameter — Ling-3.0-flash-VL aktiviert etwa 5,5B pro Token; DeepSeek V4 Flash Vision Exp hat keine Angabe zu aktiven Parametern veröffentlicht
Die Zeile für die Bildverarbeitung ist diejenige, die unterschätzt wird. Eine harte Obergrenze von 384 Tokens pro Bild bedeutet, dass ein dichtes Diagramm oder ein ganzseitiger Screenshot auf ungefähr dasselbe Budget wie ein Vorschaubild komprimiert wird — günstig und verlustbehaftet auf eine Weise, die für feingranulare Leseaufgaben eine Rolle spielt. Lings Ansatz geht in die andere Richtung: ein sehr großes Pixelbudget pro Bild, Transport ausschließlich per Base64 und daher eine viel schwerere Anfrage-Payload. Welche besser ist, hängt ganz davon ab, ob es sich bei Ihren Bildern um Fotos von Dokumenten handelt, die Sie präzise lesen müssen, oder um UI-Screenshots, die Sie ungefähr verstehen müssen.
Die zweite unterschätzte Zeile ist die maximale Ausgabe. Die Obergrenze von Ling-3.0-flash-VL bei Zehntausenden von Tokens ist in Ordnung für eine Beschreiben-dann-Korrigieren-Schleife und einschränkend für alles, das ein großes Artefakt ausgeben möchte – eine lange generierte Datei, eine vollständige Dokumentneufassung, einen mehrere tausend Zeilen langen Diff. Die 384K-Ausgabe von DeepSeek existiert genau deshalb, weil ihre vorgesehene Arbeitslast in einem großen Tool-Call-Ergebnis oder einem generierten Artefakt endet. Wenn Ihre Pipeline erwartet, dass das Modell etwas Langes zurückgibt, entscheidet diese eine Zeile den Vergleich, bevor irgendein Benchmark dies tut.
Preis und der Unterschied zwischen kostenlos und ohne Preisangabe
DeepSeek V4 Flash Vision Exp hat eine konkrete Zahl in unserem Katalog: 0,24 $ pro 1 Mio. Eingabe-Tokens und 0,73 $ pro 1 Mio. Ausgabe-Tokens, mit einem Kontextfenster von 1.048.576 Tokens und einer maximalen Ausgabe von 384.000 Tokens, erreichbar als deepseek/deepseek-v4-flash-vision-exp. Das ist ein veröffentlichter Tarif, der genauso abgerechnet wird wie die Text-Version V4-Flash, wobei Bilder mit bis zu 384 Tokens pro Bild in Tokens umgewandelt werden. Es ist ein Tarif, den man in eine Tabellenkalkulation eintragen kann.
Ling-3.0-flash-VL hat keinen Preis. Die Artificial-Analysis-Seite listet es mit 0,00 $ pro 1 Mio. Eingabe-Token und 0,00 $ pro 1 Mio. Ausgabe-Token gegenüber Medianwerten vergleichbarer Modelle von 0,14 $ und 0,40 $ — doch das spiegelt die kostenlose Testversion wider, die auf dem Ling Studio von Ant läuft, und nicht einen Tarif. Die multimodale Dokumentation von Ant veröffentlicht keinen Preis pro Token für das Vision-Modell, es gibt also nichts, wogegen sich die Null prüfen ließe. Das rein textbasierte Schwestermodell Ling-3.0-flash wurde mit etwa 0,075 $ pro 1 Mio. Eingabe-Token und 0,22 $ pro 1 Mio. Ausgabe-Token gelistet, und die domänenspezifischen Ling-Veröffentlichungen von Ant wurden als kostenlose APIs eingeführt, was eine ähnliche endgültige Ausgestaltung nahelegt — aber eine Andeutung ist kein Preis.
Stellen Sie die beiden ehrlich nebeneinander, und der Kostenvergleich lautet: Das eine Modell hat einen Tarif, das andere ein Aktionsfenster und eine plausible Schätzung. Wer behauptet, Ling-3.0-flash-VL sei billiger als DeepSeek V4 Flash Vision Exp, vergleicht eine kostenlose Testversion mit einem Listenpreis. Die vertretbare Aussage ist, dass Ling-3.0-flash-VL sehr wahrscheinlich pro Token günstiger sein wird, sobald es bepreist ist, weil 5,5 Mrd. aktive Parameter ein struktureller Vorteil sind, den keine Tarifänderung auslöscht — mit dem Vorbehalt, dass die Wortfülle von Ling-3.0-flash-VL diesen Vorteil schmälert. Artificial Analysis verzeichnet, dass es im Intelligence Index 160 Mio. Ausgabe-Tokens verbrennt, auf Rang 8 von 64 gegenüber einem Median von 84 Mio. und als „sehr wortreich“ gekennzeichnet. Man zahlt pro ausgegebenem Token, also gibt ein Modell, das fast doppelt so viel sagt, um dieselbe Antwort zu erreichen, einen Teil dessen zurück, was seine Sparse-Aktivierung gewinnt.
Welches, wofür
Der ehrliche Entscheidungsbaum teilt sich zuerst nach Kontext und Ausgabelänge auf, bevor er sich nach irgendetwas anderem aufteilt, denn das sind die Dimensionen, in denen die beiden Modelle keine Substitute sind.
Wählen Sie DeepSeek V4 Flash Vision Exp, wenn Ihre Aufgabe lang ist und in einem Artefakt endet: Dokumente mit mehreren hundert Seiten und Abbildungen, Codebasen, die von Anfang bis Ende gelesen werden, Agent-Schleifen, die ein großes Ergebnis ausgeben müssen, Workloads, bei denen Sie ein Bild per URL oder eine Files-API-Referenz statt Base64 übergeben möchten, und Pipelines, bei denen Sie die Responses API, Präfix-Fortsetzung oder einen veröffentlichten Preis pro Token benötigen, gegen den Sie budgetieren können. Es ist außerdem das einzige der beiden, bei dem ein Anbieter behauptet, bei Textaufgaben mit seinem eigenen Textmodell gleichzuziehen, was wichtig ist, wenn ein Modell in Ihrem Stack zwei ersetzt.
Wählen Sie Ling-3.0-flash-VL, wenn Ihre bindende Einschränkung die Kosten pro Aufruf sind und Ihre Schleife kurz ist: GUI-Automatisierung, wiederholte Screenshot-Inspektion, Frontend-Generierung mit einem Render-and-Correct-Zyklus, medizinische oder finanzielle Dokumentstichproben, bei denen Sie eine hohe Auflösung pro Bild benötigen und eine geringe Ausgabemenge akzeptieren können. Die Anzahl der aktiven Parameter von 5,5B ist der Grund, es zu wählen, die MIT-Lizenz ist der Grund, dass es sicher ist, selbst zu hosten, und das Design der Vision-Feedback-Schleife zielt genau auf das Muster Beobachten-Handeln-Verifizieren-Korrigieren ab. Beachten Sie, dass Sie ein nicht bepreistes Modell mit einem kostenlosen Einstiegspfad und ohne Zusage wählen, was danach kommt.
Und wenn Sie tatsächlich ein einziges Modell brauchen, das Bilder kompetent liest, ohne eines der Extreme – weder einen 5,5B-Sparsamkeitstrick noch ein Million-Token-Fenster –, dann ist keines von beiden die interessante Antwort, und die gewöhnlichen Mittelklasse-Vision-Modelle werden Ihnen besser und günstiger dienen als jeder der beiden Spezialisten.
Sie zu betreiben und wo wir ehrlich gesagt hineinpassen
DeepSeek V4 Flash Vision Exp ist in unserem Katalog. Sie können es über OrcaRouters OpenAI-kompatiblen Endpunkt mit der Modellzeichenfolge aufrufen deepseek/deepseek-v4-flash-vision-exp, mit demselben Schlüssel, den Sie für alles andere verwenden, zum veröffentlichten Tarif von $0.24/$0.73, ohne Aufschlag — der Listenpreis des Anbieters wird direkt weitergegeben, sodass Sie, wenn DeepSeek den Tarif senkt, dies noch am selben Tag erreicht und nicht erst bei der nächsten Vertragsverlängerung. Wenn Sie zum ersten Mal ein Vision-Modell in einen Produktionspfad einbinden, ist dies das sicherere der beiden, um auf einer Routing-Ebene zu beginnen, da Sie eine Fallback-Kette konfigurieren können, sodass ein Anbieterfehler eine andere Route erneut versucht, bevor Ihre Antwort beginnt. Niemand möchte, dass sein erster Produktions-Vision-Aufruf der ist, der ihm etwas über Single-Provider-Ausfall beibringt.

Ling-3.0-flash-VL ist nicht in unserem Katalog, und wir werden nichts anderes andeuten. Es ist über Ants eigene Plattform erreichbar, die einen OpenAI-kompatiblen Endpunkt und einen Anthropic-kompatiblen veröffentlicht, über kostenlosen Testzugang bei Ling Studio und über die offenen Gewichte auf Hugging Face, die du selbst mit dem veröffentlichten SGLang-Rezept oder Ants eigenem vLLM-Fork bereitstellen kannst. Eines solltest du prüfen, bevor du in diesen Weg investierst: Ants API-Beispiele verwenden den Bezeichner Ling-3.0-flash-VL-rc1, eine Release-Candidate-Kennzeichnung, und ob der ausgelieferte Checkpoint mit den offenen Gewichten übereinstimmt, ist öffentlich nicht geklärt. Wenn du Benchmarks gegen die gehostete API durchführst und erwartest, dass die Zahlen auf ein selbst gehostetes BF16-Deployment übertragbar sind, teste diese Annahme zuerst.

Die Zusammenfassung, die einer Prüfung standhält: Dies sind keine konkurrierenden Antworten auf ein und dieselbe Frage. DeepSeek V4 Flash Vision Exp ist eine Wahrnehmungsschicht mit langem Kontext für Agenten – mit veröffentlichtem Preis und einem vom Anbieter gemeldeten Benchmark-Blatt, das sich auf agentische Evaluierungen stützt. Ling-3.0-flash-VL ist ein günstig bereitzustellendes Vision-Modell mit einer echten unabhängigen Bewertung, einer kostenlosen Stufe ohne Preisangabe und einem Design, das auf kurze Korrekturschleifen ausgerichtet ist. Passen Sie die Form Ihrer Arbeitslast an die Form des Modells an, und die Tatsache, dass nur eines von beiden einen unabhängigen Wert auf der Rangliste hat, sollte beeinflussen, wie viel Gewicht Sie dem Marketing des anderen beimessen.
Derselbe Schlüssel erreicht den Rest des Katalogs, und du kannst den vollständigen Modellkatalog durchsuchen, um zu sehen, was sonst noch hinter einem OpenAI-kompatiblen Endpunkt steckt.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
