Hero-Titelkarte für „Ling-3.1-flash vs. DeepSeek V4.1 Flash“, mit dem Untertitel „Zwei Indexpunkte, dreifache Rechnung“. Zwei abgerundete Karten stehen nebeneinander mit einem deutlichen Zwischenraum: die linke, beschriftet mit „Ling-3.1-flash“, zeigt „AA Index: 41“, „Kosten pro Aufgabe: $0,99“, „Gewichte: geschlossen“; die rechte, beschriftet mit „DeepSeek V4.1 Flash (Max)“, zeigt „AA Index: 39“, „Kosten pro Aufgabe: $0,27“, „Gewichte: MIT“. Eine Fußzeile lautet: „Kosten und Indexwerte laut Artificial Analysis.“ Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Guides & Insights

Ling-3.1-flash vs. DeepSeek V4.1 Flash: Zwei Indexpunkte, dreifache Rechnung

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ling-3.1-flash und DeepSeek V4.1 Flash (Max) liegen beim Artificial Analysis Intelligence Index zwei Punkte auseinander — 41 gegen 39 — und beim Preis weit auseinander. Lässt man die zehn Evaluierungen, aus denen dieser Index besteht, für jedes Modell laufen, kostet Ling-3.1-flash rund 0,99 $ pro Aufgabe gegenüber DeepSeeks 0,27 $. Beide sind Mixture-of-Experts-Modelle mit rund 550 Milliarden Parametern und einem angegebenen Kontext von 1 Mio. Token. Eines ist ein geschlossenes, reines Textmodell aus dem InclusionAI-Labor von Ant Group, veröffentlicht am 2026-10-01 und nach wie vor ohne veröffentlichte Gewichte oder Lizenz. Das andere ist seit 2026-09-10 unter MIT quelloffen, verarbeitet Bilder ebenso wie Text, läuft bei 23 Anbietern und ist das Modell, das die meisten Teams bereits in einer Konfigurationsdatei hätten. In den meisten Belangen ist der Vergleich nicht knapp. Die interessante Frage ist, warum es diese zwei Punkte überhaupt gibt.

Wo Ling-3.1-flash wirklich vorne liegt

Es liegt vorn bei den Evaluierungen, die das Bedienen eines Terminals und das Schreiben von Code messen, der tatsächlich laufen muss, und der Vorsprung ist es wert, genau benannt zu werden, gerade weil die Gesamtwerte ihn verdecken.

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs. DeepSeek V4.1 Flash (Max) 0.268. Beide sind in absoluten Zahlen bescheiden; die Differenz macht ein Viertel von DeepSeeks Ergebnis aus.

• SciCode — 0,541 vs. 0,519.

• CritPt Physik-Schlussfolgerung — 0.180 vs. 0.143.

• GDPval-AA agentische Arbeit in der realen Welt — 1.621,75 Elo vs. 1.600 Elo.

Zwei dieser vier sind nahezu gleichauf, eine ist ein knapper Sieg, und Terminal-Bench 4.0 ist die einzige Zeile, in der der Unterschied einen Wechsel des Seeds überstehen würde. Dem steht gegenüber, wo DeepSeek gewinnt: AA-Briefcase v1.1 agentische Wissensarbeit mit 1.420,47 Elo gegen 1.400,35, AutomationBench-AA mit 0,689 gegen 0,617, AA-LCR Long-Context-Reasoning mit 0,84 gegen 0,83 und – die Zeile, die für den Produktivbetrieb am wichtigsten ist – AA-Omniscience mit −5,30 gegenüber +2,22 von Ling-3.1-flash bei einem Maß, bei dem eine Halluzination schlimmer ist als eine Verweigerung. Die Genauigkeit von DeepSeek liegt dort bei 46,4 % mit einer Halluzinationsrate von 96,5 % unter den Fragen, die es beantwortet; Ling-3.1-flash beantwortet 29,1 % korrekt mit einer Halluzinationsrate von 37,9 %. Keines von beiden ist ein Modell, das man ohne vorgeschaltetes Retrieval auf eine Wissensdatenbank ansetzt.

Die Preislücke ist größer als die Indexlücke, und es ist nicht nur die Preisliste.

Die beworbenen Tarife sehen nahezu identisch aus. Artificial Analysis führt beide mit 0,30 $ pro Million Input-Tokens auf. Bei den beiden anderen Zahlen gehen sie jedoch deutlich auseinander:

• Ausgabe — Ling-3.1-flash 0,90 $ pro Million vs. DeepSeek V4.1 Flash (Max) 1,20 $ pro Million. Hier ist Ling-3.1-flash das eindeutig günstigere Modell, und zwar um 25 %.

• Cache-Lesen — Ling-3.1-flash 0,06 $ pro Million gegenüber DeepSeek V4.1 Flash (Max) 0,006 $ pro Million, ein Rabatt von 98 % gegenüber einem von 80 %. Hier sind die beiden Modelle nicht mehr vergleichbar.

Der Mischpreis bei einem 7:2:1-Mix aus Cache-Treffern/Input/Output liegt bei $0,192 für Ling-3.1-flash und $0,184 für DeepSeek V4.1 Flash (Max) – nahezu ausgeglichen. Doch der Mix ist eine Annahme darüber, wie man ein Modell nutzt, und diese Annahme trägt eine Menge Gewicht. Jede Workload mit intensiver Prompt-Wiederverwendung – ein langer System-Prompt, eine Retrieval-Präambel, eine Agent-Schleife, die bei jedem Turn den angesammelten Kontext erneut sendet – verschiebt den effektiven Mix in Richtung Cache-Lesevorgänge, und dort gewinnt der 10-fache Unterschied bei den Cache-Preisen die Oberhand. Das Token-Volumen verstärkt dies auf dieselbe Weise: Ling-3.1-flash ist ein redseliger Reasoner und generiert über die Index-Evaluierungen hinweg 220 Millionen Output-Tokens gegenüber 250 Millionen bei DeepSeek und kommt auf durchschnittlich rund 357 Sekunden pro Evaluierungsaufgabe gegenüber 285 Sekunden bei DeepSeek. Es denkt pro Antwort mehr nach und braucht dafür länger.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Ein ausgearbeitetes Beispiel: dieselbe Agent-Schleife bei beiden

Nehmen Sie einen Tool-steuernden Agenten, der pro Aufgabe 1 Mio. Eingabe-Tokens verarbeitet, von denen 90 % aus dem Cache bedient werden, und 200.000 Ausgabe-Tokens zurückgibt. Bei Ling-3.1-flash ergibt sich mit den obigen Zahlen: 900.000 gecachte Eingabe-Tokens zu $0,06 plus 100.000 frische Eingabe zu $0,30 plus 200.000 Ausgabe zu $0,90 kommen auf etwa $0,26 pro Aufgabe. Die identische Schleife auf DeepSeek V4.1 Flash (Max) kommt auf etwa $0,14 – ungefähr die Hälfte.

Wenden Sie jetzt DeepSeeks Zeitplan an, denn das ist der Teil, den die meisten Vergleiche auslassen. DeepSeeks Off-Peak-Tarif ist der oben genannte, und Off-Peak gilt an Wochenenden und den größten Teil des Tages; doch während zwei Zeitfenstern an Wochentagen, 01:00–04:00 und 06:00–10:00 UTC, verdoppeln sich die Preise für Input und Cache. Verschieben Sie dieselbe Schleife in ein Peak-Zeitfenster, und die Kosten von DeepSeek landen bei etwa 0,28 $ — dann ist die pauschale, höhere Preisliste von Ling-3.1-flash die günstigere Option für diese Stunde, und der 10×-Cache-Rabatt wurde durch die Uhrzeit neutralisiert.

Das ist die ganze Entscheidung in einem Zahlenpaar. Wenn Ihr Agenten-Traffic cache-lastig ist und Sie ihn einplanen können, kostet DeepSeek V4.1 Flash (Max) ungefähr die Hälfte von Ling-3.1-flash – für einen Indexunterschied von zwei Punkten. Wenn Ihr Traffic cache-lastig ist und in DeepSeeks Peak-Zeitfenster fällt, kosten die beiden Modelle ungefähr gleich viel, und die geringfügig bessere Terminal-Agent-Zeile von Ling-3.1-flash wird zum Zünglein an der Waage.

Die Achsen, bei denen kein Vergleich möglich ist

Drei Dimensionen liegen nicht dicht beieinander, und sie sind diejenigen, die tendenziell über eine Architektur entscheiden, bevor über den Preis gesprochen wird.

• Gewichte und Lizenz — Ling-3.1-flash hat keine Gewichte veröffentlicht, hat keinen Lizenztext und Artificial Analysis führt es als proprietär. DeepSeek V4.1 Flash (Max) ist Open Weights unter MIT, von Hugging Face herunterladbar, mit erlaubter kommerzieller Nutzung. Eines davon kann selbst gehostet, feinabgestimmt und air-gapped betrieben werden; das andere nicht.

• Modalität — Ling-3.1-flash ist Text-Eingabe, Text-Ausgabe. DeepSeek V4.1 Flash (Max) akzeptiert Bilder neben Text und wird auf multimodalen Benchmarks bewertet. Wenn irgendein Teil Ihrer Pipeline dem Modell einen Screenshot, ein Diagramm oder einen Scan übergibt, endet der Vergleich dort.

• Bereitstellungsoberfläche — DeepSeek V4.1 Flash (Max) ist über 23 Anbieter verfügbar, darunter OrcaRouter; Ling-3.1-flash läuft über die eigene API des Anbieters und die Drittanbieterplattformen, die sein Release führen. Für einen Produktionspfad ist die Anzahl der Anbieter eine Resilienzeigenschaft, kein Beliebtheitswettbewerb.

Noch eine Asymmetrie, die in keiner dieser Listen auftaucht: DeepSeek V4.1 Flash (Max) stellt in einer einzigen Antwort 384.000 Ausgabe-Tokens bereit. Ant hat keine maximale Ausgabelänge für Ling-3.1-flash veröffentlicht, daher lässt sich eine Arbeitslast für lange Generierungen noch nicht daran dimensionieren. Das Fehlen einer veröffentlichten Obergrenze ist nicht dasselbe wie eine kleine Obergrenze, aber es ist auch keine Zahl, mit der man planen kann.

Beides ausführen, und wie das tatsächlich aussieht

Ling-3.1-flash ist heute nicht im OrcaRouter-Katalog — eine Abfrage gegen unsere öffentliche Modell-API liefert für das Modell unter InclusionAI not-found zurück, und dieser Beitrag wird nicht so tun, als wäre es anders. DeepSeek V4.1 Flash ist derzeit routbar zum Anbieter-Listenpreis ohne Aufschlag, sodass eine Preisänderung des Anbieters bei uns am selben Tag live ist, an dem sie eintrifft, und es steht hinter demselben einzigen API-Schlüssel wie der Rest des Katalogs, mit automatischem Failover zwischen vorgelagerten Anbietern.

Diese Asymmetrie hat eine praktische Ausprägung. Der vernünftige Weg, einen Vergleich zu handhaben, bei dem ein Modell geschlossen ist, etwa viermal so viel kostet wie sein Vorgänger und nur über einen Anbieter erreichbar ist, besteht darin, das offene, breit verfügbare Modell als Standardpfad beizubehalten und den Herausforderer als etwas zu behandeln, das man testet, statt als etwas, auf das man sich festlegt. DeepSeek V4.1 Flash (Max) kann heute die Produktionsschleife tragen — offene Gewichte, Bildeingabe, 384K-Ausgabe, 98 % Cache-Rabatt —, während Ling-3.1-flash die agentspezifische Arbeit erhält, bei der seine Vorteile bei Terminal-Bench und SciCode tatsächlich zum Tragen kommen. Da beide das OpenAI-kompatible Chat-Completions-Format sprechen, ist diese Aufteilung eine Routing-Entscheidung statt eines Integrationsprojekts: ein Endpunkt, ein Schlüssel und eine Regel, die die Aufgaben an das Modell schickt, das jeweils messbar besser darin ist.

Das Urteil

Nach den verfügbaren Belegen gewinnt DeepSeek V4.1 Flash (Max) diesen Vergleich, und er gewinnt vor allem bei Dingen, die nichts mit zwei Index-Punkten zu tun haben: offene Gewichte unter MIT, Bildeingabe, 384.000 Ausgabe-Tokens, ein Cache-Rabatt von 98 % und 23 Anbieter, zwischen denen ein Failover möglich ist. Der Fall für Ling-3.1-flash ist enger, aber real – es ist der bessere Terminal- und Tool-Agent der beiden und das einzige der beiden, das keinen Tarifplan veröffentlicht hat, in den ein Spitzenzeiten-Multiplikator fest eingebaut ist.

Zwei Dinge würden diese Einschätzung ändern. Wenn Ant Gewichte unter einer permissiven Lizenz veröffentlicht, schließt sich die Offenheitslücke und der Vergleich wird zu einer geradlinigen Diskussion über Fähigkeiten und Kosten. Und wenn das bereitgestellte Langkontext-Fenster von Ant bei den 1M Token validiert wird, die beide Modelle angeben, ist die Behauptung der Kontextparität keine Behauptung mehr. Bis dahin lautet die ehrliche Zusammenfassung, dass ein Modell eine Zeile eines agentischen Benchmarks gewinnen und dennoch die Evaluierung verlieren kann – und dass die Zwei-Punkte-Indexlücke zwischen diesen Modellen ungefähr dem 3,6-Fachen der Kosten pro Aufgabe entspricht, ein Tausch, den nur ein bestimmter Workload eingehen sollte.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.