
Qwen 3.8 vs. Kimi K3: Zwei chinesische Giganten, und jetzt ist einer günstiger
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Dies sind die beiden bedeutendsten chinesischen Frontier-Modelle des Jahres 2026, und sie sind enge Verwandte: beide sind enorme sparse Mixture-of-Experts-Systeme, beide mit 1M-Token-Kontext, beide multimodal, beide mit vielversprechenden offenen Gewichten. Kimi K3 von Moonshot ist tatsächlich das größere der beiden mit 2,8T Gesamtparametern gegenüber Qwens 2,4T — eine nützliche Erinnerung daran, dass die Parameterzahl keine Rangfolge darstellt.
Bis zum 3. August 2026 war dieser Vergleich in einer bestimmten Hinsicht einseitig: Kimi K3 hatte einen geprüften Artificial-Analysis-Intelligence-Index von 57.1, ein #1-LMArena-Frontend-Code-Ranking, veröffentlichte Preise und ausgelieferte Gewichte, während Qwen3.8-Max hatte eine 2.4T-Schlagzeile und sonst nichts. GA veränderte die wirtschaftlichen Verhältnisse entscheidend. Qwen veröffentlicht nun $2 / $6 pro Million Tokens gegenüber Kimis $3 / $15 — was das größere, besser erprobte Modell mit weitem Abstand zum teureren macht.
Ein Hinweis für Entwickler — der schnellste Weg, das herauszufinden, ist, beide mit deinen eigenen Prompts zu testen. OrcaRouter bündelt 200+ Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt, sodass du Qwen 3.8 Max gegen Kimi K3 bei derselben Aufgabe antreten lassen kannst, ohne zwei SDKs einzubinden.
TL;DR-Fazit. Kimi K3 gewinnt weiterhin beim Beweis: ein geprüfter AA Intelligence Index von 57.1 (#3), der LMArena-Frontend-Code-Platz #1 bei 1679, sowie offene Gewichte, die tatsächlich einsatzbereit sind. Qwen3.8-Max bleibt von jedem unabhängigen Evaluator unbewertet. Aber GA hat Qwen zwei echte Vorteile verschafft. Beim Preis ist es jetzt deutlich günstiger — $2 / $6 gegenüber $3 / $15, also 2,5× weniger bei der Ausgabe. Und in dem einen direkten Drittanbieter-Test, den es gibt, verlor Qwen den Hauptwert 80 zu 83, während es sich als Agent sichtbar besser verhielt: 354 Repo-Zitate zu 274, 22 Gateway-Anfragen zu 53 und null fehlgeschlagene Tool-Aufrufe zu zwei. Kimi für geprüfte Qualität; Qwen für günstigere, sauberere agentische Ausführung.
Wichtige Erkenntnisse
• Kimi K3 ist das größere Modell – 2,8 Billionen MoE gegenüber Qwens 2,4 Billionen, also etwa 400 Milliarden mehr – was ein gutes Argument dagegen ist, die Parameteranzahl als Indikator für die Leistungsfähigkeit zu betrachten.
• Qwen3.8-Max ist seit dem 3. August 2026 GA zu $2 / $6 pro 1M Flat, gegenüber Kimi K3s $3 / $15 (AA blended ~$2.31). Qwen ist jetzt 2.5× günstiger beim Output.
• Kimi K3 hat den geprüften Stand: AA Intelligence Index 57.1 (#3), nur hinter Fable 5 und GPT-5.6 Sol, plus LMArena frontend-code #1 (1679). Qwen3.8-Max ist noch unbewertet.
• In dem einzigen direkten Test (Trilogy AI) schlug Kimi Qwen mit 83 zu 80 – insgesamt aber machte Qwen mehr Repo-Zitationen (354 zu 274), weniger Gateway-Anfragen (22 zu 53), und hatte null fehlgeschlagene Tool-Aufrufe (im Vergleich zu zwei), mit einer Tool-Nutzungsbewertung von 9/10 gegenüber Kimis 8/10.
• Qwen meldet nun Agenten- und Coding-Kennzahlen: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (gegenüber 40.7 eines Vorgängers) — alles von Alibaba gemeldet.
• Was das Timing der Offenheit angeht, liegt Kimi weiterhin vorn: seine Gewichte sind im Wesentlichen fertig; die von Qwen werden innerhalb der Woche versprochen, allerdings noch ohne Lizenz oder Repository.
Hinweis zur Genauigkeit: Alle Qualitätszahlen von Qwen3.8-Max stammen von Alibaba und wurden nicht von Dritten verifiziert. Die Kimi-K3-Zahlen stammen von Artificial Analysis und LMArena. Der direkte Vergleich ist ein einzelner Test von Trilogy AI und sollte als ein Datenpunkt betrachtet werden, nicht als allgemeine Rangliste. Die Qwen-Preise basieren auf der GA-Preisliste und ersetzen den Vorschau-Rabatt vom Juli.
Die technischen Daten und der Preis, Seite an Seite
Hier sind die harten Daten, jede Zahl mit ihrer Quelle versehen.
• Hersteller / Status — Qwen3.8-Max: Alibaba; GA (3. August 2026); Kimi K3: Moonshot; Open-Weight-Veröffentlichung
• Architektur — Qwen3.8-Max: ~2.4T gesamt, sparse MoE (aktive Parameter noch nicht offengelegt); Kimi K3: 2.8T MoE, native Vision (Artificial Analysis)
• Kontextfenster — Qwen3.8-Max: 1M Token (983.616 mit Denken; max. Ausgabe 131.072); Kimi K3: 1M Token (Artificial Analysis)
• AA Intelligence Index — Qwen3.8-Max: Noch nicht bewertet; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / Bestenliste — Qwen3.8-Max: Nicht öffentlich bewertet; Kimi K3: Frontend-Code #1, 1679 (LMArena)
• Vom Anbieter gemeldete Ergebnisse — Qwen3.8-Max: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, OSWorld-Verified 86.1 (von Alibaba gemeldet); Kimi K3: Leistung wird von Dritten gemessen
• Preise (in / out) — Qwen3.8-Max: $2.00 / $6.00 pro 1M, pauschal; gecachter Eingang $0.25; Kimi K3: $3 / $15 pro 1M (AA-gemischt ~$2.31), Cache-Treffer $0.30
• Offene Gewichte — Qwen3.8-Max: Noch diese Woche versprochen (noch keine Lizenz); Kimi K3: Offene Gewichte; Gewichte bereit
• Geschwindigkeit — Qwen3.8-Max: p50 TTFT 1,64s (OrcaRouter-7-Tage-Telemetrie); Kimi K3: ausführlich und langsam (~34s TTFT, laut AA)
Zwei Dinge rahmen diesen Vergleich ein, und eines davon kehrte sich am 3. August vollständig um.
Zunächst hat sich das Preisverhältnis umgekehrt. Bis Juli war Kimi K3 das Modell mit einem echten Preis und Qwen das Modell mit einem Rabattgutschein. Jetzt veröffentlichen beide Tarife, und das besser bewährte, größere Modell ist das teurere: $3 / $15 gegenüber $2 / $6. Beim Output – wo Reasoning und Codegenerierung ihr Geld ausgeben – kostet Kimi 2,5× mehr. Qwen verlangt außerdem einen einheitlichen Preis über den gesamten 1M-Token-Kontext, und sein gecachter Input von 0,25 $ unterbietet Kimis Cache-Treffer-Rate von 0,30 $ leicht. Für jede Workload mit hohem Volumen ist Qwens Kostenstruktur jetzt deutlich besser.
Zweitens, die Beweislücke bleibt unverändert, und genau deshalb gewinnt Kimi weiterhin. Der 57,1-Intelligence-Index von Kimi K3 platziert ihn insgesamt auf Platz drei, nur hinter Fable 5 und GPT-5.6 Sol – das ist das Urteil eines neutralen Bewerters. Sein LMArena-Frontend-Code #1 bei 1679 ist ein Crowdsourcing-Ergebnis aus vielen Blindvergleichen. Qwens Terminal-Bench 86,6 und GPQA Diamond 92,6 sind reale Zahlen, aber Alibabas eigene, auf einer Testumgebung, die niemand sonst ausgeführt hat. Ein nützlicher Anker: der Vorgänger Qwen3.7-Max erzielte 46 im AA-Index gegenüber Kimis 57,1, also braucht Qwen einen großen Generationssprung, nur um gleichzuziehen.
Es gibt auch eine Latenz-Eigenheit, die erwähnenswert ist, weil sie der üblichen Darstellung widerspricht. Artificial Analysis misst beim Kimi K3 etwa 34 Sekunden Time-to-First-Token — wirklich langsam. Die GA-Telemetrie von OrcaRouter zeigt für Qwen3.8-Max einen p50-TTFT von 1,64 Sekunden. Diese Messungen stammen aus verschiedenen Quellen und sind kein kontrollierter Vergleich, aber sie erschweren die Annahme aus der Vorschau-Ära, dass Qwen das trägere der beiden ist.

Der einzige direkte Vergleichstest, sorgfältig lesen
Dies ist das einzige Duell in der Serie, bei dem eine dritte Partei beide Modelle bei derselben Aufgabe gegeneinander antreten ließ, weshalb es sich lohnt, genau zu lesen, anstatt es auf einen Sieger zusammenzufassen.
Trilogy AI führte eine Aufgabe zum Architekturverständnis durch — ein reales Repository verstehen und eine korrekte Architekturschlussfolgerung erreichen — und bewertete die Ergebnisse:
• Gesamtwertung — Qwen3.8-Max: 80 / 100; Kimi K3: 83 / 100
• Repo-Zitate — Qwen3.8-Max: 354; Kimi K3: 274
• Gateway-Anfragen — Qwen3.8-Max: 22; Kimi K3: 53
• Fehlgeschlagene Tool-Aufrufe — Qwen3.8-Max: 0; Kimi K3: 2
• Bewertung der Tool-Nutzung — Qwen3.8-Max: 9 / 10; Kimi K3: 8 / 10
• Cache-Trefferquote — Qwen3.8-Max: >90%; Kimi K3: >90%
Kimi gewann die Schlagzeile um drei Punkte. Aber schauen Sie sich die Prozessspalten an, denn für Agenten-Engineering sind sie wichtiger als die Punktzahl. Qwen erreichte dieselbe zentrale architektonische Schlussfolgerung unter Verwendung von weniger als der Hälfte der Gateway-Anfragen, wobei sie 29% mehr Grounding-Zitate erzeugte und — das Detail, das jeden interessieren sollte, der Agenten entwickelt — null fehlgeschlagene Tool-Calls gegenüber Kimis zwei hatte.
Fehlgeschlagene Tool-Aufrufe sind es, die Produktionsagenten tatsächlich zum Scheitern bringen. Sie wirken kaskadenartig: Ein fehlerhafter Aufruf erzeugt einen Fehler, den das Modell interpretieren muss, was Turns verbraucht und weitere Fehler riskiert. Ein Modell, das 22 saubere Anfragen stellt, während ein anderes 53 mit zwei Fehlern stellt, ist im Betrieb günstiger und zuverlässiger, selbst wenn es bei der Antwort drei Punkte darunter liegt. Zusammen mit Qwens 2,5× günstigerer Ausgaberate sprechen die operativen Kosten dieses Laufs deutlich für Qwen.
Die Warnung lautet: Dies ist eine Aufgabe, ein Evaluator, ein Durchlauf. Es ist keine Benchmark-Suite und lässt sich nicht verallgemeinern. Kimi's 57.1-Index und das Frontend-Ranking auf Platz 1 stützen sich auf weit mehr Belege als dieser einzelne Test. Die korrekte Schlussfolgerung ist eng gefasst: Bei mindestens einer realistischen agentischen Aufgabe war Qwen der diszipliniertere Tool-Nutzer, während es bei der Ausgabequalität leicht verlor.

Kosten in der Praxis: Agentenläufe in großem Umfang
Nehmen Sie einen Repository-Analyse-Agenten: 250.000 Tokens Code-Kontext pro Lauf, 12.000 Tokens Ausgabe.
• Qwen3.8-Max: 0.25M × $2 = $0.50, plus 0.012M × $6 = $0.072. ≈ $0.57 pro Lauf.
• Kimi K3: 0,25M × 3 $ = 0,75 $, plus 0,012M × 15 $ = 0,18 $. ≈ 0,93 $ pro Durchlauf.
• Bei 1.500 Runs/Tag: Qwen ≈ $858/Tag; Kimi ≈ $1.395/Tag — etwa 16.000 $/Monat Unterschied.
• Mit Caching auf einem stabilen Repo: Qwens gecachter Input bei $0.25/1M bringt den Lauf auf ≈ $0.14; Kimis Cache-Trefferquote bei $0.30 bringt ihn auf ≈ $0.26.
Der Unterschied ist an beiden Enden real, und das Trilogy-Ergebnis verschärft ihn noch: Wenn Qwen tatsächlich weniger als die Hälfte der Gateway-Anfragen benötigt, um vergleichbare Arbeit abzuschließen, ist der effektive Kostenunterschied bei Agenten-Aufgaben größer, als die Preisliste allein vermuten lässt.
Beide Modelle berechnen Thinking-Tokens als Output, daher kosten reasoning-intensive Konfigurationen mehr als die naive Schätzung auf beiden Seiten – aber Qwens Preis von 6 $ macht diesen Aufschlag 2,5× kleiner.
Offenheit: nahezu Parität, unterschiedliches Timing
Dies ist die Achse, auf der sich die beiden am ähnlichsten sind, und der Unterschied betrifft rein die Verfügbarkeit. Die Gewichte von Kimi K3 sind offen und im Wesentlichen bereit. Die von Qwen3.8-Max werden innerhalb einer Woche versprochen, aber es gibt noch keinen Lizenztext, keine Modellkarte und kein Repository – und eine Lizenz bestimmt, ob man ein Modell überhaupt kommerziell nutzen kann.
Praktisch ist keines der Flaggschiffe von einem normalen Team selbst hostbar. Qwen mit 2.4T ist in 4-Bit ungefähr 1,2TB, verglichen mit etwa 141GB pro H200; Kimi mit 2.8T ist noch größer. Beide benötigen acht oder mehr High-End-Beschleuniger, und Alibabas nicht offengelegte Anzahl aktiver Parameter bedeutet, dass man nicht einmal den Durchsatz von Qwen modellieren kann.
Deshalb ist das gleichzeitig angekündigte Qwen3.8-27B hier von Bedeutung. Da es außerdem mit offenen Gewichten veröffentlicht wird und Berichten zufolge in etwa 17 GB VRAM, verschafft es der Qwen-Familie eine echte On-Premise-Geschichte, die weder das 2.4T- noch das 2.8T-Flaggschiff bietet. Wenn offene Gewichte der eigentliche Grund für die Wahl zwischen diesen beiden sind, verändert die 27B die Rechnung stärker als jeder der beiden Giganten.
FAQ
Ist Qwen 3.8 besser als Kimi K3?
Nicht auf geprüften Belegen. Kimi K3 verfügt über einen unabhängigen AA-Intelligence-Index von 57,1 (#3) und den #1-Platz von LMArena für Frontend-Code, während Qwen3.8-Max von keinem unabhängigen Evaluator eine Bewertung erhalten hat. In dem einen verfügbaren direkten Test gewann Kimi mit 83 zu 80. Qwens Vorteile sind der Preis (2,5× günstigerer Output) und, in demselben Test, eine sauberere Tool-Nutzung.
Welches Modell ist größer?
Kimi K3 hat bei insgesamt 2,8T Parametern gegenüber 2,4T von Qwen3.8-Max – also etwa 400B mehr. Allerdings veröffentlicht keiner der beiden genug, um das aussagekräftig zu machen: Alibaba hat nie die Anzahl der aktiven Parameter von Qwen veröffentlicht, die tatsächlich die Bereitstellungskosten in einem Mixture-of-Experts-Modell bestimmt.
Welches ist günstiger?
Qwen3.8-Max, eindeutig, seit GA. Es listet $2 / $6 pro 1M gegenüber Kimi K3s $3 / $15 – 33% weniger beim Input und 2,5× weniger beim Output. Qwens Rate ist über den gesamten 1M-Kontext flach, und sein gecachter Input bei $0,25 unterbietet Kimis $0,30 Cache-Trefferquote leicht.
Was hat der direkte Vergleich tatsächlich gezeigt?
Trilogy AIs Aufgabe zum Architekturverständnis bewertete Kimi mit 83 und Qwen mit 80. Aber Qwen erzeugte 354 Repository-Zitate gegenüber Kimis 274, verwendete 22 Gateway-Anfragen gegenüber 53, protokollierte null fehlgeschlagene Tool-Aufrufe gegenüber zwei und erreichte 9/10 bei der Tool-Nutzung gegenüber Kimis 8/10. Kimi lieferte die bessere Antwort; Qwen war der diszipliniertere Agent. Es ist eine einzelne Aufgabe, also behandle sie als Datenpunkt und nicht als Rangfolge.
Hat Qwen 3.8 Max die Vorschauphase verlassen?
Ja, am 3. August 2026, mit einer veröffentlichten Preisliste und einem OpenAI- und DashScope-kompatiblen Endpunkt. Die Qoder-Credits-Kampagne vom Juli beschreibt nicht mehr, wie es verkauft wird.
Welches ist schneller?
Möglicherweise ist es jetzt Qwen, was die Annahme aus der Vorschau-Ära umkehrt. Artificial Analysis misst bei Kimi K3 eine Zeit bis zum ersten Token von ungefähr 34 Sekunden; OrcaRouters 7-Tage-GA-Telemetrie zeigt für Qwen3.8-Max einen p50-TTFT von 1,64 Sekunden. Verschiedene Quellen und kein kontrollierter Vergleich, aber beide Modelle haben den Ruf, wortreich zu sein, und Kimis gemessene TTFT ist wirklich langsam.
Kann ich eine der beiden selbst hosten?
Realistisch gesehen nicht im Flaggschiff-Maßstab — 2,4T- und 2,8T-Modelle benötigen acht oder mehr GPUs der H200-Klasse. Kimis Gewichte sind heute verfügbar; Qwens werden noch diese Woche versprochen, allerdings noch ohne Lizenz. Für eine echte On-Premise-Option ist das gleichzeitig angekündigte Qwen3.8-27B (Berichten zufolge ~17 GB VRAM) die praktische Wahl in der Qwen-Familie.
Fazit
Qwen 3.8 vs Kimi K3 ist das engste Duell dieser Serie, und die allgemeine Verfügbarkeit teilte es sauber entlang zweier Achsen. Kimi K3 behält die Qualitätskrone aufgrund der Messungen eines Schiedsrichters: 57,1 im Intelligence Index, insgesamt Platz drei, und LMArenas Spitzenplatz im Frontend-Code. Das sind keine Behauptungen, sondern Ergebnisse — und Qwen hat nichts Vergleichbares.
Was Qwen am 3. August gewonnen hat, ist die Wirtschaftlichkeit, und es hat sie entscheidend gewonnen: $2 / $6 gegenüber $3 / $15, gleichbleibend über eine Million Tokens, mit etwas günstigerem Caching. Hinzu kommt die Trilogy-Erkenntnis, dass Qwen eine vergleichbare agentische Aufgabe mit der Hälfte der Gateway-Anfragen und null fehlgeschlagenen Tool-Aufrufen abgeschlossen hat, und Qwen wirkt wie das operativ effizientere Modell, selbst dort, wo es das weniger genaue ist. Achten Sie auf zwei Ereignisse: den ersten unabhängigen Intelligence-Index-Score für Qwen3.8-Max und die Veröffentlichung der Gewichte mit einer Lizenz. Wenn Qwen irgendwo in die Nähe von Kimis 57,1 kommt, macht die Preislücke es sehr schwer, Kimi für Mengenarbeit zu rechtfertigen. Bis dahin ist Kimi das Modell, dem Sie vertrauen, und Qwen dasjenige, das Sie sich leisten können zu betreiben – und die ehrliche Art, sich zu entscheiden, sind Ihre eigenen Repositories.

In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
