
Gemini 3.5 Flash-Lite vs Qwen 3.8: Günstiges Arbeitstier vs. 2,4T-Flaggschiff
- qwenNEUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 pro 1 Mio. Tokens · 56 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenz69Coding
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 200 tok/s
- orcaNEUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEUAnthropic: Claude Opus 52026-07-2461Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1651Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0854Intelligenz72Coding
- tencentTencent: Hy32026-07-0641Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenz69Coding60Mathe
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenz61Coding61Mathe
Als dieser Vergleich erstmals geschrieben wurde, war er auf ungewöhnliche Weise einseitig: Gemini 3.5 Flash-Lite war ein echtes, käufliches Produkt und Qwen 3.8 war eine eingeschränkte Vorschau ohne Preis, ohne Benchmark und ohne Gewichte. Es gab nur sehr wenig zu vergleichen.
Das ist nicht mehr der Fall. Qwen3.8-Max wurde am 3. August 2026 allgemein verfügbar mit einer veröffentlichten Preisliste von 2 $ / 6 $ pro Million Tokens, einem OpenAI- und DashScope-kompatiblen Endpunkt und einer vollständigen Benchmark-Tabelle. Es ist im Self-Service nutzbar, budgetierbar und live – auch auf OrcaRouter. Deshalb wurde dieser Artikel von Grund auf neu geschrieben, denn der ehrliche Vergleich heute ist nicht „lieferbares Modell versus Vaporware“. Es ist ein echter Stufenvergleich: Googles günstigstes Hochdurchsatz-Arbeitstier gegen Alibabas größtes Flaggschiff.
Ein Hinweis für Entwickler — diese beiden liegen an entgegengesetzten Enden der Kostenkurve, die richtige Frage ist also, in welche Stufe dein Workload gehört. OrcaRouter bündelt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt, sodass du beide für dieselbe Aufgabe testen kannst, ohne zwei SDKs anzubinden.
TL;DR-Fazit.Diese Modelle konkurrieren nicht wirklich miteinander — sie beantworten unterschiedliche Fragen.Flash-Lite ist ein Effizienzmodell: Artificial Analysis Index 36, $0.30 / $2.50 pro 1M, etwa 490 Token/s, allgemein verfügbar. Es ist darauf ausgelegt, jede Anfrage zu vernachlässigbaren Kosten zu bedienen.Qwen3.8-Max ist ein Flaggschiff: ~2,4 Billionen Parameter, ein 1M-Token-Flatrate-Kontext, native Bild- und Videoeingabe sowie selbst gemeldete Frontier-Werte (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) — bei $2 / $6, also dem 6,7-fachen von Flash-Lites Eingabepreis. Flash-Lite ist die richtige Standardwahl für Klassifizierung, Routing und Extraktion in großem Umfang. Qwen3.8-Max ist das Modell, auf das man aufrüstet, wenn eine Aufgabe wirklich Frontier-Denken, eine Million Token Kontext oder Nicht-Text-Eingaben erfordert. Der eine Vorbehalt, der sich nicht geändert hat: Qwen hat weiterhin keinen unabhängigen Benchmark-Score.
Wichtige Erkenntnisse
• Qwen 3.8 ist jetzt allgemein verfügbar — seit dem 3. August 2026 hat es Preise, Self-Service-Zugriff und eine Benchmark-Tabelle veröffentlicht. Die frühere Darstellung einer zugangsbeschränkten, nicht budgetierbaren Vorschau ist überholt.
• Flash-Lite ist dramatisch günstiger: $0.30 / $2.50 pro 1M gegenüber den Preisen von Qwen $2 / $6 — etwa 6,7× beim Input und 2,4× beim Output.
• Flash-Lite ist viel schneller: etwa 490 Tokens/Sek., gebaut für Hochdurchsatzarbeit. Qwen3.8-Max zeigt eine p50-Zeit bis zum ersten Token von 1,64 s in der 7-Tage-Telemetrie von OrcaRouter, ist aber ein großes, gründliches Modell.
• Flash-Lite hat die einzige geprüfte Punktzahl: Artificial Analysis Index 36. Qwen3.8-Max bleibt unbewertet von allen unabhängigen Bewertern, obwohl Alibaba nun eigene Zahlen veröffentlicht.
• Qwen gewinnt eindeutig bei den Fähigkeiten: ein 1M-Token-Kontext zum Festpreis ohne Aufpreis für lange Prompts, plus Text/Bild/Video-Eingabe und OmniDocBench 1.5 92.1 zum Parsen von Dokumenten. Flash-Lite ist ein kleines Effizienzmodell.
• Offene Gewichte: Die von Qwen werden innerhalb der Woche versprochen (noch keine Lizenz), plus ein Qwen3.8-27B läuft Berichten zufolge in ~17GB VRAM. Flash-Lite ist dauerhaft geschlossen.
Genauigkeitshinweis: Alle Qualitätszahlen zu Qwen3.8-Max stammen von Alibaba und sind nicht durch Dritte verifiziert. Die Zahlen zu Gemini 3.5 Flash-Lite stammen von Artificial Analysis. Die Qwen-Preise entsprechen der GA-Preisliste von Alibaba Model Studio und ersetzen den in früheren Versionen dieses Artikels beschriebenen Zugang aus der Vorschauphase.
Die technischen Daten und der Preis, Seite an Seite
• Hersteller / Status — Flash-Lite: Google; allgemein verfügbar; Qwen3.8-Max: Alibaba; GA (3. August 2026)
• Positionierung — Flash-Lite: günstige, durchsatzstarke Effizienzklasse; Qwen3.8-Max: Flaggschiff / Pionierambition
• AA Intelligence Index — Flash-Lite: 36 (Artificial Analysis); Qwen3.8-Max: Noch nicht bewertet
• Vom Anbieter gemeldete Werte — Flash-Lite: der Wert stammt aus einer Messung durch Dritte; Qwen3.8-Max: GPQA Diamond 92,6, Terminal-Bench 2.1 86,6, OSWorld-Verified 86,1, FrontierSWE 73,5 (alle von Alibaba gemeldet)
• Preis (pro 1M, Eingabe / Ausgabe) — Flash-Lite: $0.30 / $2.50; Qwen3.8-Max: $2.00 / $6.00, pauschal über 1M Kontext; Cache-Eingabe $0.25
• Geschwindigkeit — Flash-Lite: ~490 tok/sec (Artificial Analysis); Qwen3.8-Max: p50 TTFT 1.64s (OrcaRouter 7-Tage-Telemetrie)
• Kontext — Flash-Lite: Effizienzstufen-Kontext; Qwen3.8-Max: 1M Token (983.616 mit Denken; max. Ausgabe 131.072)
• Modalität — Flash-Lite: textfokussiertes Effizienzmodell; Qwen3.8-Max: Text, Bild, Video rein → Text raus
• Gewichte — Flash-Lite: geschlossen, nur API; Qwen3.8-Max: noch diese Woche versprochen, noch keine Lizenz
• Heute verfügbar — Flash-Lite: Standard-API, Self-Service; Qwen3.8-Max: Standard-API, Self-Service (Model Studio, DashScope, OrcaRouter)
So dargestellt ist das Ergebnis völlig anders als bisher. Qwens Spalte ist nicht mehr leer – sie ist voll, und in mehreren Zeilen ist sie der stärkere Eintrag. Was den alten Rahmen von „bekannte Größe versus Versprechen“ ersetzt, ist eine klare Stufenlücke: Flash-Lite ist beim Input grob 6,7× günstiger und beim Durchsatz etwa 13× schneller, während Qwen einen multimodalen Kontext mit einer Million Token und behauptetes Reasoning auf Frontier-Niveau bietet. Das sind beides legitime Produkte; sie erfüllen nur unterschiedliche Aufgaben.
Die einzige Zeile, in der die alte Vorsicht weiterhin gilt, ist die Benchmark-Zeile. Flash-Lites Index 36 wurde von Artificial Analysis auf einer öffentlichen Bestenliste gemessen. Jeder Qwen-Wert – GPQA Diamond 92,6, Terminal-Bench 86,6 und der Rest – wurde von Alibaba auf einer eigenen Testumgebung erzielt. Das ist eine echte Verbesserung gegenüber der Alternative, nichts zu veröffentlichen, aber es ist keine Verifizierung durch Dritte, und Labore veröffentlichen die Benchmarks, die sie gewinnen.

Index 36 gegen ein unbewertetes Flaggschiff: das hier ehrlich lesen
Es ist verlockend, Flash-Lites Index 36 gegen Qwens GPQA Diamond 92.6 zu stellen und einen Kantersieg auszurufen. Das wäre ein doppelter Kategorienfehler.
Zunächst ist der Artificial Analysis Intelligence Index ein zusammengesetzter Wert über viele Aufgaben; GPQA Diamond ist ein einzelner Graduierten-Naturwissenschaftstest. Sie liegen nicht auf derselben Skala und können nicht voneinander subtrahiert werden.
Zweitens, und was wichtiger ist, Flash-Lite wurde nie dafür entwickelt, hohe Punktzahlen zu erzielen. Ein Index von 36 ist das, was ein Effizienzmodell ausmacht. Das technische Ziel von Google war ein Modell, das billig und schnell genug ist, um vor jede eingehende Anfrage geschaltet zu werden — Ticket-Routing, Klassifizierung, Extraktion, Zusammenfassung in großem Umfang — wo ein Frontier-Modell wirtschaftlich absurd wäre. Es mit einem 2,4-Billionen-Flaggschiff an der Reasoning-Obergrenze zu messen, verfehlt, wofür es gedacht ist.
Was wir sagen können, ist enger gefasst und nützlicher. Qwen3.8-Max ist sehr wahrscheinlich das deutlich leistungsfähigere Modell — seine selbstberichteten Zahlen liegen weit über dem, was ein Index-36-Modell produzieren würde, und der FrontierSWE-Sprung von 40.7 beim Vorgänger auf 73.5 deutet auf echten Fortschritt hin. Aber „sehr wahrscheinlich“ bleibt eine Schlussfolgerung, denn kein unabhängiger Bewerter hat es bewertet. Zur Einordnung: Der Vorgänger Qwen3.7-Max erzielte 46 im AA-Index — höher als Flash-Lites 36, aber weit von der Spitzenklasse entfernt — daher ist Alibabas impliziter Generationssprung groß und unbestätigt.
Die praktische Konsequenz: Wenn Ihre Aufgabe eine ist, die Flash-Lite bereits korrekt erledigt, ist Qwens höhere Obergrenze für Sie nichts wert und Sie würden das 6,7-Fache dafür zahlen. Die Obergrenze ist nur dann von Bedeutung, wenn Flash-Lite tatsächlich versagt.
Kosten in der Praxis: das Stufengefälle in Zahlen
Nehmen Sie eine Klassifizierungsaufgabe mit hohem Volumen: 2.000 Token Eingabe, 200 Token Ausgabe, 500.000 Mal pro Tag ausgeführt – eine realistische Form für Support-Triage oder Content-Routing.
• Flash-Lite: pro Aufruf, 0.002M × $0.30 = $0.0006, plus 0.0002M × $2.50 = $0.0005. ≈ $0.0011 pro Aufruf → ~$550/Tag.
• Qwen3.8-Max:pro Aufruf, 0,002 Mio. × 2 $ = 0,004 $, plus 0,0002 Mio. × 6 $ = 0,0012 $. ≈ 0,0052 $ pro Aufruf → ~2.600 $/Tag.
• Monatlich: Flash-Lite ≈ $16,500; Qwen ≈ $78,000 — eine Differenz von $61,500 bei gleichem Aufgabenvolumen.
Bei diesem Umfang ist die Stufenwahl der mit Abstand größte Einzelposten im System, und es ist sehr schwer, ein Flaggschiff für Arbeiten zu rechtfertigen, die ein Effizienzmodell bewältigt. Genau für dieses Szenario ist Flash-Lite gedacht.
Jetzt invertieren Sie es. Nehmen Sie eine Aufgabe mit langen Dokumenten: 600.000 Token Kontext, 5.000 Token Ausgabe, 200 Mal am Tag.
• Qwen3.8-Max: 0,6M × $2 = $1,20 plus 0,005M × $6 = $0,03. ≈ $1,23 pro Aufruf, ohne Aufpreis für lange Prompts – und ungefähr $0,18, wenn der Kontext bei $0,25/1M gecacht ist.
• Flash-Lite kann für diese Form überhaupt nicht bepreist werden, da ein 600.000-Token-Kontext für einen einzelnen Aufruf nicht das ist, wofür ein Effizienzklasse-Modell ausgelegt ist.
Die Antwort hängt also vollständig von der Form der Arbeitslast ab, was die eigentliche Lehre ist. Flash-Lite gewinnt bei umfangreicher Arbeit mit kurzem Kontext mit enormem Abstand. Qwen gewinnt bei allem, was eine Million Tokens oder Nicht-Text-Eingaben erfordert, wo Flash-Lite keine günstigere Option ist, sondern schlicht keine Option.

Szenarien: Welche Stufe passt
Support-Triage und Routing bei hohem Volumen.Flash-Lite, eindeutig. Index 36 reicht für die Klassifizierung aus, und bei ungefähr 0,0011 $ pro Aufruf kannst du es bei jedem Ticket ausführen. Eskaliere nur die mehrdeutige Minderheit an ein größeres Modell.
Analyse des gesamten Vertrags- oder Einreichungsdokuments. Qwen3.8-Max. Der Flatrate-Kontext von 1M Token bedeutet, dass ein 400-seitiges Dokument in einem einzigen Aufruf ohne Aufpreis und ohne Chunking verarbeitet wird, und der selbst gemeldete OmniDocBench-1.5-Wert von 92.1 zielt genau auf diese Aufgabe ab.
Screenshot-, Diagramm- oder Video-Pipelines. Standardmäßig wird Qwen3.8-Max verwendet — es akzeptiert Bild- und Videoeingaben und erreicht OSWorld-Verified 86.1 beim Bedienen einer echten GUI. Flash-Lite ist kein Kandidat für Nicht-Text-Eingaben.
Agentisches Programmieren. Qwen3.8-Max bei den angegebenen Zahlen (Terminal-Bench 2.1 86,6, FrontierSWE 73,5), mit der Einschränkung, dass keine davon unabhängig verifiziert ist und sein schwächster selbst angegebener Wert IFBench 82,8 bei der Befolgung von Anweisungen ist — ein echtes Risiko für Pipelines, die die Ausgabe jedes Schritts parsen.
Eine zweistufige Architektur.Oft ist die richtige Antwort beides: Flash-Lite als kostengünstiger erster Durchlauf für jede Anfrage, Qwen3.8-Max als Eskalationspfad für den kleinen Anteil, der eine Million Tokens, ein Bild oder echtes Denken benötigt. Dieses Muster nutzt den Großteil des Kostenvorteils von Flash-Lite aus und hält gleichzeitig eine Spitzenoption verfügbar.
Self-Hosting und Offenheit
Flash-Lite ist dauerhaft geschlossen und nur über die API verfügbar — es gibt keinen Weg zum Selbsthosten.
Die Gewichte von Qwen3.8-Max sind für diese Woche versprochen, aber das Flaggschiff ist kein realistisches Ziel: ungefähr 1.2TB bei 4-Bit gegenüber etwa 141GB pro H200 bedeutet acht oder mehr High-End-Beschleuniger, und Alibaba hat die Anzahl der aktiven Parameter immer noch nicht offengelegt, sodass der Durchsatz, den dieser Aufwand kaufen würde, nicht modellierbar ist. Es gibt auch noch keinen Lizenztext, was bedeutet, dass die kommerzielle Nutzbarkeit formell unbestimmt ist.
Die gleichzeitig angekündigte Qwen3.8-27B ist die Veröffentlichung, die für On-Premise-Pläne wirklich zählt. Sie geht ebenfalls mit offenen Gewichten an den Start und läuft Berichten zufolge in etwa 17 GB VRAM – damit ist sie eine echte Self-Hosting-Option und bemerkenswerterweise ein viel engerer Konkurrent in Flash-Lites Effizienznische als das 2,4-T-Flaggschiff.
FAQ
Kann ich Qwen 3.8 heute benutzen?
Ja. Qwen3.8-Max wurde am 3. August 2026 allgemein verfügbar, mit veröffentlichten Preisen von 2 $ / 6 $ pro 1 Mio. Tokens und einem OpenAI- und DashScope-kompatiblen Endpunkt. Es ist über Alibaba Model Studio, DashScope und OrcaRouter im Self-Service verfügbar. Frühere Versionen dieses Artikels beschrieben eine eingeschränkte Vorschau; das ist veraltet.
Welches ist günstiger?
Gemini 3.5 Flash-Lite, mit großem Abstand: 0,30 $ / 2,50 $ pro 1 Mio. gegenüber Qwen3.8-Max mit 2 $ / 6 $ — also etwa 6,7× günstiger beim Input und 2,4× beim Output. Bei hochvolumigen Aufgaben mit kurzem Kontext dominiert dieser Unterschied jede andere Überlegung.
Welches ist besser?
Das sind unterschiedliche Leistungsklassen. Flash-Lite hat den einzigen geprüften Wert (AA Index 36), wurde aber für günstigen Durchsatz gebaut, nicht für Reasoning. Qwen3.8-Max ist sehr wahrscheinlich deutlich leistungsfähiger — seine selbstberichteten Werte für GPQA Diamond 92.6 und Terminal-Bench 2.1 86.6 liegen auf Frontier-Niveau —, aber es gibt keinen unabhängigen Benchmark, also bleibt das eine Schlussfolgerung und kein gemessenes Ergebnis.
Welches ist schneller?
Flash-Lite, erheblich. Artificial Analysis misst etwa 490 Token/Sekunde, wofür sein Effizienzklassen-Design gedacht ist. Qwen3.8-Max zeigt eine p50-Zeit bis zum ersten Token von 1,64 Sekunden in der 7-Tage-Telemetrie von OrcaRouter, aber es ist ein großes, gründliches Modell, und Rezensenten aus der Preview-Ära fanden es bei langen agentischen Builds langsam.
Hat Qwen 3.8 jetzt offene Gewichte?
Noch nicht. Alibaba sagt, die Flaggschiff-Gewichte treffen im Laufe der Woche ein, aber es gibt immer noch keine Lizenz, Modellkarte oder Repository. Selbst nach der Veröffentlichung benötigt ein 2,4-T-Modell acht oder mehr GPUs der H200-Klasse. Das parallel angekündigte Qwen3.8-27B, das Berichten zufolge etwa 17 GB VRAM benötigt, ist die praktische Option für Self-Hosting.
Sollte ich beide verwenden?
Oft ja. Ein zweistufiges Setup — Flash-Lite als kostengünstiger erster Durchlauf für jede Anfrage, Qwen3.8-Max als Eskalationspfad für langkontextuelle, multimodale oder wirklich schwierige Aufgaben — behält den Großteil des Kostenvorteils von Flash-Lite und bietet Ihnen gleichzeitig eine Spitzenoption, die ihren Preis wert ist.
Welches sollte ich heute für die Produktion wählen?
Flash-Lite für umfangreiche Arbeiten mit kurzem Kontext und reinem Text, bei denen Index 36 ausreicht – es ist günstig, schnell, geprüft und bewährt. Qwen3.8-Max, wenn die Arbeitslast einen Kontext von einer Million Token, Bild- oder Videoeingabe oder Denkfähigkeiten erfordert, die Flash-Lite nachweislich nicht bietet. Beide sind jetzt wirklich einsatzbereit, was beim ersten Verfassen dieses Vergleichs noch nicht der Fall war.
Fazit
Gemini 3.5 Flash-Lite vs Qwen 3.8 war früher ein Vergleich zwischen einem Produkt und einer Ankündigung. Das ist nicht mehr so. Seit dem 3. August 2026 ist Qwen3.8-Max allgemein verfügbar, bepreist, im Self-Service nutzbar und dokumentiert — die ehrliche Einordnung ist also eine Entscheidung über die Preisklasse und nicht über die Einsatzbereitschaft.
Flash-Lite bleibt die richtige Standardwahl für die Arbeit, für die es gebaut wurde: {{1}}bei $0.30 / $2.50 und ~490 Token/s{{/1}} schlägt es bei jeder Anfrage nur mit einem Rundungsfehler zu Buche, und sein geprüfter Index 36 ist für Klassifizierung, Routing und Extraktion völlig ausreichend. Qwen3.8-Max ist die Eskalationsstufe — {{2}}ein Millionen-Token-Kontext zum Flatrate-Preis, native Bild- und Videoeingabe und behauptetes Frontier-Reasoning{{/2}} — {{3}}bei etwa dem 6.7-Fachen der Eingabekosten{{/3}}. Seine einzige ungelöste Schwäche ist dieselbe wie zuvor: {{4}}kein unabhängiger Evaluator hat es bewertet, daher stützt sich seine Qualitätsargumentation auf Alibabas eigene Tabelle{{/4}}. Achten Sie auf {{5}}den ersten unabhängigen Intelligence-Index-Score und die Qwen3.8-27B-Gewichte{{/5}}, die viel direkter mit Flash-Lites Nische konkurrieren werden. Wählen Sie in der Zwischenzeit {{6}}nach Workload-Form{{/6}} — und erwägen Sie, {{7}}beide laufen zu lassen{{/7}}.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
