
Ling-3.1-flash vs Qwen3.8-Flash: Zwei Wege, eine schnelle Stufe aufzubauen – und nur einer davon wird ausgeliefert
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 262 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Zwei chinesische Labore betrachteten diesen Herbst dasselbe Problem – wie baut man ein günstiges, schnelles Modell, das gut genug ist, um in einer Agent-Schleife zu sitzen – und kamen zu entgegengesetzten Antworten. Ling-3.1-flash, am 30. September 2026 von Ant Group angekündigt, ist ein Mixture-of-Experts mit rund 560 Milliarden Parametern, das pro Token etwa 25 Milliarden Parameter aktiviert, mit einem angegebenen Kontextfenster von bis zu 1 Million Token und der erklärten Absicht, „bald“ Open Source zu stellen. Qwen3.8-Flash, am 26. August 2026 vom Qwen-Team von Alibaba veröffentlicht, ist ein multimodales Mixture-of-Experts mit 125 Milliarden Parametern, das pro Token etwa 6 Milliarden Parameter aktiviert; die Gewichte sind bereits auf Hugging Face unter dem Namen Qwen3.8-Flash-Next verfügbar, ein Produktionsmodell, das live auf der QwenCloud-API für 0,15 US-Dollar pro Million Input-Token und 0,47 US-Dollar pro Million Output-Token läuft, mit Day-0-Unterstützung in SGLang. Das eine Labor skalierte hoch und kündigte an. Das andere verkleinerte und lieferte aus. Dieser Unterschied ist lehrreicher als jeder Benchmark, den eines der beiden Labore veröffentlicht hat.
Es ist auch der Grund, warum dieser Vergleich sorgfältig gelesen werden muss. Ling-3.1-flash hat keine Gewichte, keine Lizenz, keine Modellkarte, keinen API-Preis und keine unabhängige Bewertung; die gesamte veröffentlichte Dokumentation besteht aus einem Ankündigungsbeitrag, einer Benchmark-Grafik des Anbieters und einem Platz in Ants eigenem Ling-Studio-Produkt. Qwen3.8-Flash hat all das und einen vierwöchigen Vorsprung darin, von Personen betrieben zu werden, die nicht für Alibaba arbeiten. Eine Architekturentscheidung zu vergleichen ist fair. Fähigkeiten zu vergleichen ist es noch nicht.
Die beiden Designentscheidungen – und warum sie auseinandergehen
Qwens Wette ist, dass die schnelle Stufe strukturell anders sein sollte als das Flaggschiff, nicht bloß kleiner. Qwen3.8-Flash aktiviert 6 Milliarden seiner 125 Milliarden Parameter – etwa 95 % Sparsität – und bezieht seine Fähigkeiten daraus, wohin die Rechenleistung gelenkt wird, statt aus bloßer Breite. Alibaba hat unmissverständlich klargestellt, dass die darunterliegende Architektur, die Gated DeltaNet mit Qwen Sparse Attention und einer N-gram-Einbettungstabelle kombiniert, eine frühe Vorschau auf die Qwen4-Generation ist, die absichtlich früh veröffentlicht wurde, damit Inferenz-Engines, Quantisierungstools und Deployment-Muster um sie herum ausreifen können, bevor die teuren Modelle darauf aufbauen. Das Ergebnis ist ein Modell, das konstruktionsbedingt pro Token günstig ist: rund 6 Milliarden Parameter an Arbeit bei jedem Token, zu einem Preis, den Alibaba mit 0,15 $ für Eingaben und 0,47 $ für Ausgaben pro Million festgelegt hat.
Ants Wette, soweit die Ankündigung sie offenbart, ist näher an konventioneller Skalierung mit einem sehr langen Kontext. Ling-3.1-flash behält einen großen aktiven Anteil – grob 25 Milliarden Parameter pro Token von 560 Milliarden, also etwa einer von zweiundzwanzig – und nennt ein Fenster von bis zu 1 Million Token, viermal so viel, wie die vorherige Ling-Generation bietet. Die Ling Studio App beschreibt es als gebaut für „Allzweck-Agenten, Suche, routinehafte Büroarbeit und Software-/Codeentwicklung“, was eine Positionierung im schnellen Segment ist, aber die Parameterökonomie ist die eines viel schwereren Modells. Bei identischer Eingabe kostet ein Token, das durch 25B aktive Parameter läuft, grob viermal so viel Rechenleistung wie eines, das durch 6B läuft, bevor überhaupt eine Preisentscheidung ins Spiel kommt.
Keiner der beiden Ansätze ist falsch, und beide sind vertretbare Antworten auf die Frage, „was ein günstiges Modell begrenzt“. Qwen wettet darauf, dass Sparsity und ein neuer Attention-Stack die Obergrenze sind. Ant wettet darauf, dass die Obergrenze Kontext und Weltwissen sind und dass es sich die Rechenleistung leisten kann. Was sie für einen Leser voneinander unterscheidet, ist nicht die Designphilosophie, sondern die Bereitstellung: ein Design, das man herunterladen und messen kann, gegenüber einem Design, über das man nur lesen kann.

Was Sie jeder einzelne kostet, und was das in der Praxis bedeutet
Die Preislücke ist nicht subtil, und sie ist nicht knapp. Qwen3.8-Flash wird mit 0,15 $ pro Million Eingabe-Tokens, 0,47 $ pro Million Ausgabe und 0,018 $ pro Million bei Cache-Lesevorgängen angegeben — dieselben Zahlen in Alibabas Ankündigung, auf der Produktions-Modellkarte des Anbieters und auf der gerouteten Modellseite, die wir bereitstellen. Genau so sieht eine Weitergabe mit 0 % Aufschlag aus, wenn man sie mit drei Quellen abgleicht. Ant hat für Ling-3.1-flash überhaupt keinen Preis veröffentlicht — keinen API-Preis, keinen Cache-Rabatt, nichts Vergleichbares. Die einzige veröffentlichte Zahl für die Ling-Reihe stammt von der vorherigen Generation, die mit 0,075 $ Eingabe und 0,22 $ Ausgabe pro Million gelistet ist, etwa die Hälfte von Qwens Eingabepreis und weniger als die Hälfte seines Ausgabepreises. Wenn die neue Ling-Stufe preislich dort liegt, wo die alte lag, würde sie Qwen3.8-Flash auf dem Papier unterbieten; wenn sie preislich auch nur annähernd an die Rechenleistung heranreicht, die ihre 25 Mrd. aktiven Parameter implizieren, wird sie das nicht tun. Das ist so oder so eine Vermutung, denn die Zahl existiert nicht.
Der Kontext ist der Bereich, in dem Lings Anspruch tatsächlich größer ausfällt. Ant nennt bis zu 1 Million Token für Ling-3.1-flash; Qwen3.8-Flash kommt mit einem Standardkontext von 1M Token in der Produktions-API und einem nativen Fenster von 262.144 Token bei den offenen Gewichten, erweiterbar. Auf der Ling-Zahl lasten zwei Einschränkungen, und keine davon ist ausgeräumt. Erstens: „bis zu 1M“ ist eine Spezifikation, keine Messung – niemand hat das Langkontext-Retrieval-Verhalten für ein Modell veröffentlicht, das niemand außerhalb von Ant aufrufen kann. Zweitens: Die vorherige Ling-Generation hatte genau dieselbe Lücke zwischen dem beworbenen Fenster und der architektonischen Geschichte dahinter, und die Antwort kam erst, als die Gewichte, das Format und die Kontextgrenzen endlich veröffentlicht wurden. Die 1M aus der Schlagzeile ist ein Versprechen. Die 1M bei Qwen3.8-Flash ist ein ausgelieferter Standard, an dem man Ants Behauptung messen kann.
Warum „Vorschau“ auf einer Seite davon das ehrliche Wort ist
Alibabas eigene Darstellung von Qwen3.8-Flash ist, dass es sich um eine Architekturvorschau handelt, die unter einem Produktionsnamen ausgeliefert wird – die offenen Gewichte tragen das Suffix „Next“ genau deshalb, damit niemand den Prototyp mit dem abgestimmten Serving-Modell verwechselt. Diese Darstellung wurde eher durch Ereignisse als durch Marketing bestätigt: SGLang lieferte am Veröffentlichungstag Day-0-Unterstützung für Qwen3.8-Flash-Next aus, wobei das Modell auch für Transformers, vLLM und TokenSpeed konfiguriert wurde, und die Gewichte wurden seither in Quantisierungs-Communities aufgegriffen. Versionen wurden schnell alltäglich, und genau so sieht ein ausgeliefertes Modell aus.
Ants Ankündigung hat einen Schritt früher dieselbe Form: eine Spezifikationsveröffentlichung vor dem Release, mit der ausdrücklichen Erklärung, dass das Modell bald als Open Source verfügbar sein wird. Das ist eine legitime Art des Starts – Ling-3.0-flash ging im Juli genau diesen Weg, und die Gewichte landeten am 7. August unter MIT, etwa zwei Wochen später. Doch der Zustand der beiden Projekte heute ist nicht vergleichbar, und kein noch so eifriges Chartslesen schließt diese Lücke. Es lohnt sich, konkret zu benennen, was ein Außenstehender zu jedem der beiden beitragen kann.
Was heute für Ling-3.1-flash unabhängig überprüfbar ist: dass die Ankündigung existiert und auf den 30. September datiert ist; dass die Parameter-, Aktiv-Parameter- und Kontextangaben von Ant selbst stammen; dass das Modell in dem Produkt Ling Studio von Ant erscheint; und dass keine Gewichte, Lizenz oder Modellkarte veröffentlicht wurden. Was für Qwen3.8-Flash unabhängig überprüfbar ist: dass die Gewichte in BF16 und FP8 herunterladbar sind; dass die Lizenzbedingungen lesbar sind; dass der API-Preis veröffentlicht ist; und dass Alibabas Benchmark-Behauptungen seit Ende August zur Reproduktion offenstehen. Die zweite Liste ist länger, und das ist der ganze Vergleich im Kleinen.

Wie die beiden tatsächlich bewertet würden
Ant hat eine Benchmark-Karte mit Ling-3.1-flash veröffentlicht, die es gegen GPT-5.6 Sol, Claude Opus 5, Kimi K3, zwei GLM-Varianten und DeepSeek-V4.1-Flash antreten lässt, mit Schlagzeilenwerten von 1.673 Elo auf GDPVal-AA v2.1, 75,16 auf FrontierSWE und 65,35 auf HealthBench Professional. Zwei Probleme stehen auf dieser Karte, bevor überhaupt jemand über die Zahlen streitet. Das erste ist das Vergleichsset: Beide von Ant gewählten Frontier-Modelle liegen eine Generation zurück, da Claude Opus 5.5 und GPT-6 Sol am 22. September 2026 live gingen und jetzt routingfähig sind, was bedeutet, dass die Karte ein Oktober-Modell gegen den Frontier-Stand vom Juli statt gegen den aktuellen vergleicht. Das zweite ist eine Fußnote auf der Karte selbst, die besagt, dass das Ergebnis für HealthBench Professional aus der „AQ-Umgebung“ stammt und dass die Fähigkeiten des Modells im Gesundheitsbereich derzeit nur in AQ erfahrbar sind – einer Umgebung, die keine öffentliche Dokumentation definiert. Ein Schlagzeilenwert, dessen Evaluierungsumgebung nicht genannt wird, ist selbst im Prinzip nicht reproduzierbar.
Die vergleichbaren Behauptungen von Qwen3.8-Flash hingegen wurden aufgestellt, als die Gewichte bereits veröffentlicht waren, und Alibaba setzte seine Positionierung auf eine Behauptung, die jeder überprüfen kann: dass nämlich das Sparsitätsverhältnis und nicht die Parameteranzahl die Quelle der Leistungsfähigkeit ist. Vier Wochen Nutzung sind kein Urteil, aber lang genug, dass die Behauptungen aufgehört haben, unangefochten zu sein – was der nützliche Zustand für ein Modell ist.
Was man damit tatsächlich anfangen kann – heute
Für Entwickler ist die praktische Unterscheidung einfach. Ling-3.1-flash ist keine Komponente, die man diese Woche schon einsetzen kann: Es gibt keinen Endpunkt, den man aufrufen kann, keine Gewichte, die man hosten kann, keine Lizenz, die man prüfen kann, und keinen Preis, mit dem man kalkulieren kann. Was auch immer das endgültige Modell am Ende sein wird, der nützliche Schritt ist jetzt, einen Auslöser festzulegen – veröffentlichte Gewichte, eine permissive Lizenz, ein unabhängiger Score auf FrontierSWE, der auch nur annähernd bei 75,16 liegt – und die Sache dann erneut zu prüfen. Die eigene Historie der vorherigen Generation zeigt, dass die Gewichte zwei Wochen nach der Ankündigung eintreffen können, sodass dieser Auslöser schnell greifen könnte.
Qwen3.8-Flash ist bereits eine Komponente. Es ist als geroutetes Modell live in unserem Katalog zum Listenpreis des Anbieters ohne Aufschlag — die geroutete Karte weist $0,15 in, $0,47 out und $0,018 pro Million Cache-Reads aus, dieselben Zahlen, die Alibaba veröffentlicht, was eine 0%-Aufschlagspolitik in der Praxis bedeutet und nicht auf einer Folie. Hinter einem einzigen Schlüssel steht es neben Claude Opus 5, GPT-5.6 Sol und DeepSeek-V4.1-Flash, sodass der Vergleich, zu dem Ant einlädt — ein Kandidat gegen die aktuelle Frontier — ausgeführt werden kann, indem man eine Konfiguration auf zwei Routen ausrichtet, statt zwei Integrationen zu pflegen, wobei automatisches Failover das Wochenende überbrückt, an dem ein Anbieter wackelt. Das ist der Unterschied zwischen einer Architekturdiskussion und einem Experiment.
Das Urteil, soweit man eines abgeben kann: Qwen ging die kühnere architektonische Wette ein und hatte das Selbstvertrauen, sie früh zu veröffentlichen und die Leute sie auseinandernehmen zu lassen. Ant ging die schwerere Wette ein – mehr Parameter, mehr aktive Rechenleistung pro Token, mehr Kontext – und hat bisher statt eines Modells ein Diagramm veröffentlicht. Das Diagramm sieht gut aus. Das Diagramm ist außerdem das Einzige, was überhaupt jemand hat.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
