
Qwen 3.8 vs Kimi K3: Die zwei chinesischen Open-Weight-Giganten im direkten Vergleich.
- metaNEUMeta: Muse Spark 1.12026-07-1651Intelligenz71Coding
- kimiNEUMoonshotAI: Kimi K32026-07-1557Intelligenz76Coding
- openaiNEUOpenAI: GPT-5.6 Luna2026-07-0951Intelligenz71Coding
- openaiNEUOpenAI: GPT-5.6 Terra2026-07-0955Intelligenz77Coding
- openaiNEUOpenAI: GPT-5.6 Sol2026-07-0959Intelligenz77Coding
- grokNEUxAI: Grok 4.52026-07-0854Intelligenz72Coding
- tencentTencent: Hy32026-07-0641Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenz69Coding60Mathe
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenz61Coding61Mathe
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenz77Coding
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligenz56Coding59Mathe
- minimaxMiniMax: MiniMax M32026-05-3144Intelligenz59Coding59Mathe
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Intelligenz74Coding68Mathe
- GoogleGemini 3.5 Flash2026-05-2350Intelligenz70Coding51Mathe
- qwenQwen3.7 Max2026-05-2246Intelligenz66Coding71Mathe
- qwenQwen3.7 Max (2026-05-20)2026-05-2046Intelligenz66Coding73Mathe
Von allen Modellen, mit denen Qwen 3.8 Max verglichen wird,Kimi K3 von Moonshot ist der natürlichste Rivale: Beide sind riesige chinesische Mixture-of-Experts-Modelle, beide sind Open-Weight-Class, beide sind bekanntermaßen wortreich, gründlich und langsam. Sie sind sozusagen die beiden größten Giganten der chinesischen Open-Weight-Welt – und ungewöhnlicherweise müssen wir nicht raten, wie sie im Vergleich abschneiden, weil jemand sie gegeneinander antreten ließ, und zwar bei derselben Aufgabe. Das macht dies zum reichhaltigsten Vergleich in der Serie: nicht Verkäuferbehauptungen versus geprüfte Zahlen, sondern ein echter direkter Vergleich.
Bevor ich auf die Details eingehe, ein Hinweis für Entwickler — der ehrliche Weg, eine so knappe Rivalität zu entscheiden, besteht darin, beide mit Ihrem eigenen Workload laufen zu lassen und den Kompromiss zwischen Gründlichkeit und Geschwindigkeit zu beobachten. OrcaRouter stellt über 200 Modelle hinter einem OpenAI-kompatiblen Endpunkt bereit, so dass SieQwen 3.8 gegen Kimi K3 bei denselben Prompts antreten lassen können, ohne zwei SDKs verkabeln zu müssen.
Kurzzusammenfassung. In dem einen direkten Vergleich, den wir haben (Trilogy AI, eine Aufgabe zum Architekturverständnis), Kimi K3 erzielte 83/100 und Qwen 3.8 Max 80/100 — ein knapper Vorsprung von 3 Punkten für Kimi. Aber Qwen war die *gründlichere*: 354 Repository-Zitate vs 274, 22 Gateway-Anfragen vs 53 und null fehlgeschlagene Tool-Aufrufe vs zwei, auf Kosten von höherer Latenz und mehr Tokens. Beide erreichten einen Cache-Treffer von über 90% und trafen die gleiche grundlegende Architekturentscheidung. Heute ist Kimi K3 die sicherere Wahl mit offenen Gewichten — sie hat eine geprüfte Punktzahl (57,1, #3 bei Artificial Analysis), die Arena-Frontend-Krone und Gewichte, die im Wesentlichen verfügbar sind. Qwen 3.8 ist derjenige, den man im Auge behalten sollte: ehrgeiziger, erschöpfender in der Erkundung, aber unbenotet auf öffentlichen Boards mit Gewichten, die nur "coming soon" sind.
Wichtige Erkenntnisse
• Qwen 3.8 Max ist ein 2,4T-Parameter-MoE Vorschau; Kimi K3 ist ein 2,8T MoE mit 1M Kontext und nativer Vision — was bedeutet, dass Qwen ungefähr 400B Parameter kleiner, eine Erinnerung daran, dass eine größere Parameteranzahl nicht besser bedeutet.
• Im einzigen direkten Test (Trilogy AI), setzte sich Kimi K3 mit 80 zu 83 gegen Qwen durch insgesamt – aber Qwen machte mehr Repo-Zitate (354 vs 274), weniger Gateway-Anfragen (22 vs 53), und hatte null fehlgeschlagene Tool-Aufrufe (vs zwei).
• Kimi K3 hat einen geprüften AA Intelligence Index von 57.1 (#3) — hinter Fable 5 und GPT‑5.6 Sol, vor allem anderen. Qwen 3.8 hat überhaupt keinen unabhängigen Benchmark.
• Kimi K3 belegt ebenfalls den LMArena frontend-code #1 Platz (1679); Qwen 3.8 wurde nicht auf öffentlichen Ranglisten bewertet.
• Offenheit ist nahezu gleich, aber der Zeitpunkt unterscheidet sich: Kimi K3s Gewichte sind offen/versprochen und im Wesentlichen bereit; Qwen 3.8s Gewichte sind "coming soon" ohne Datum, Lizenz oder Repo.
Die Qwen 3.8-Zahlen sind Herstellerangaben oder frühe, unkontrollierte Hands-on-Eindrücke — nicht unabhängig geprüft. Kimi K3s Index- und Preiszahlen stammen von Artificial Analysis und können von Moonshots eigenen Meldungen abweichen. Der direkte Vergleich von Trilogy AI ist eine einzelne Aufgabe, keine vollständige Benchmark-Suite. Die Vorschau-Preise von Qwen 3.8 sind ein vorübergehender Rabatt; überprüfen Sie die Preise vor der Budgetplanung.
Die technischen Daten und der Preis, Seite an Seite
Hier sind die harten Daten, jede Wettbewerbszahl ihrer Quelle zugeordnet.
• Hersteller / Status — Qwen 3.8 Max: Alibaba; Vorschau (19. Juli 2026); Kimi K3: Moonshot; Open-Weight-Veröffentlichung
• Architektur — Qwen 3.8 Max: ~2.4T gesamt, sparse MoE (aktive Parameter nicht offengelegt); Kimi K3: 2.8T MoE, native Vision (Quelle: Artificial Analysis)
• Kontextfenster — Qwen 3.8 Max: Berichtet ~1M Token (nicht offiziell bestätigt); Kimi K3: 1M Token (Quelle: Artificial Analysis)
• AA Intelligence Index — Qwen 3.8 Max: Noch keine — unbewertet; Kimi K3: 57.1 — #3 (Artificial Analysis)
• Arena / Bestenliste — Qwen 3.8 Max: Nicht öffentlich bewertet; Kimi K3: Frontend-Code #1, 1679 (LMArena)
• Preise (Eingang/Ausgang) — Qwen 3.8 Max: Nur Vorschau (~90 % Rabatt; API pro Token nicht veröffentlicht); Kimi K3: $3 / $15 pro 1M (AA blended ~$2.31)
• Offene Gewichte — Qwen 3.8 Max: Versprochen "bald" (nicht veröffentlicht); Kimi K3: Offene Gewichte; Gewichte bereit/nah
• Geschwindigkeit — Qwen 3.8 Max: Langsamstes getestetes Modell (praxisnah); Kimi K3: Ausführlich und langsam (~34s TTFT, laut AA)
Zwei Dinge rahmen den gesamten Vergleich ein. Erstens: Die leere Zelle „AA Intelligence Index“ für Qwen 3.8 ist die Geschichte: Kimi K3s 57,1 ist das Urteil eines neutralen Schiedsrichters, das es auf Platz 3 der Welt setzt, nur hinter Fable 5 und GPT-5.6 Sol; Qwen 3.8s Position beruht auf Verkäuferdarstellungen und einer Handvoll praktischer Durchläufe. Zweitens: Beachten Sie die Größeninversion – Qwen 3.8 (2,4T) ist tatsächlich etwa 400B Parameter kleiner als Kimi K3 (2,8T). Alibabas Modell wird als "ehrgeiziger" beschrieben, aber bei der reinen Parameteranzahl ist Kimi der größere Gigant, und es ist dasjenige mit dem geprüften Score, der dies untermauert. Beide sind bekanntermaßen weitschweifig und langsam, sodass sich die Latenz die Waage hält; die eigentlichen Unterscheidungsmerkmale sind Nachweise und Verfügbarkeit von Gewichten, und heute sprechen beide für Kimi.

Den einen echten direkten Vergleich, den wir haben
Dies ist das seltene Matchup, bei dem wir nicht inferieren müssen. Trilogy AI ließ beide Modelle an einer einzigen Aufgabe zum Architekturverständnis arbeiten — Lesen und Nachdenken über eine echte Codebasis — und veröffentlichte den direkten Vergleich. Kimi K3 gewann beim Spitzenwert, aber das zugrundeliegende Verhalten erzählt eine interessantere Geschichte.
• Gesamtbewertung — Qwen 3.8 Max: 80 / 100; Kimi K3: 83 / 100
• Repo-Zitationen — Qwen 3.8 Max: 354; Kimi K3: 274
• Gateway-Anfragen — Qwen 3.8 Max: 22; Kimi K3: 53
• Fehlgeschlagene Tool-Aufrufe — Qwen 3.8 Max: 0; Kimi K3: 2
• Bewertung der Werkzeugnutzung — Qwen 3.8 Max: 9 / 10; Kimi K3: 8 / 10
• Cache-Trefferquote — Qwen 3.8 Max: >90%; Kimi K3: >90%
Lesen Sie die Spalten, nicht nur die oberste Zeile. Kimi K3 gewann mit 3 Punkten, aber Qwen 3.8 war der akribischere Arbeiter: es zitierte80 weitere Stellen im Repository (354 vs 274), kam zu seiner Schlussfolgerung in wesentlich weniger Gateway-Anfragen (22 vs 53), machte null fehlgeschlagene Tool-Aufrufe gegenüber Kimis zwei, und übertraf Kimi in der Tool-Nutzungsbewertung (9 vs 8). Der Kompromiss ist genau das, was man von Qwens Charakter anderswo erwarten würde — es erkundet gründlich, was höhere Latenz und mehr Gesamttoken kostet. Entscheidend ist, beide Modelle trafen die gleiche grundlegende Architekturentscheidung, also ist dies nicht einer richtig und einer falsch; es ist, dass Kimi etwas schneller zu einer etwas besser bewerteten Antwort kommt, und Qwen mit mehr Beweisen und sauberer Tool-Disziplin dort ankommt. Wenn Ihre Arbeit gründliche, gut zitierte Erkundung belohnt, ist Qwens Profil attraktiv; wenn Sie die bewährte, schnellere Antwortoption wünschen, hat Kimi die Runde gewonnen.

FAQ
Ist Qwen 3.8 besser als Kimi K3?
Nicht aufgrund der heute vorhandenen Beweise. Im einzigen direkten Vergleich (Trilogy AI) erzielte Kimi K3 83/100 gegenüber Qwens 80/100, und Kimi hat einen geprüften Artificial Analysis Index von 57.1 (Platz 3) sowie die Arena Frontend-Code-Krone, während Qwen 3.8 überhaupt keine unabhängige Bewertung hat. Qwens Stärke lag in der Gründlichkeit – mehr Repo-Zitate (354 vs. 274), weniger Gateway-Anfragen und null fehlgeschlagene Tool-Aufrufe – aber das ist ein Stilvorteil, kein nachgewiesener Leistungsvorsprung.
Qwen 3.8 ist größer — macht es das besser?
Nein, und es ist tatsächlich umgekehrt bei der Größe: Qwen 3.8 hat ~2,4 Billionen Parameter gegenüber Kimi K3s ~2,8 Billionen, also ist Kimi der größere der beiden um etwa 400 Milliarden. Eine größere Parameterzahl bedeutet trotzdem nicht besser – Kimi ist sowohl größer als auch höher bewertet, was eine klare Erinnerung daran ist, dass Architektur, Training und Feinabstimmung mehr zählen als rohe Parameterzahlen.
Wie vergleicht sich die Preisgestaltung?
Kimi K3 ist ein veröffentlichter, langlebiger $3 / $15 pro 1M Tokens (Artificial Analysis mischt es auf etwa 2,31 $). Die Vorschau von Qwen 3.8 ist stark rabattiert (~90 % Rabatt), hat aber keinen veröffentlichten Preis pro Token-API und der Rabatt ist vorübergehend, sodass ein stabiler Preisvergleich noch nicht möglich ist. Für die Budgetplanung heute ist Kimi diejenige mit einer echten Zahl.
Welche ist die bessere Open-Weight-Wahl?
Beide sind offene Gewichtsklassen, aber der Zeitpunkt unterscheidet sich. Kimi K3s Gewichte sind offen und im Wesentlichen bereit; Qwen 3.8 verspricht „demnächst verfügbar“ ohne Datum, Lizenz oder veröffentlichtes Repository. Falls offene Gewichte der Grund sind, warum du dich für eines entscheidest, ist Kimi die Wahl, die du jetzt umsetzen kannst.
Welches sollte ich heute verwenden?
Kimi K3 ist die sicherere Standardwahl – es hat eine Bewertung (#3) erhalten, die Gewichte sind bereit, und es hat den direkten Vergleich gewonnen. Greifen Sie zu Qwen 3.8, wenn Sie eine erschöpfende, gut belegte Erkundung und saubere Werkzeugnutzung über Geschwindigkeit stellen, und betrachten Sie es als das Modell, das man im Auge behalten sollte, wenn seine Gewichte veröffentlicht werden und eine unabhängige Bewertung eintrifft.
Fazit
Qwen 3.8 vs Kimi K3ist das, was diese Serie am ehesten an einen fairen Kampf herankommt: zwei chinesische Open-Weight-Giganten, beide wortreich, beide gründlich, beide langsam. Kimi K3 gewinnt heute die Runde, weil es die Dinge gewinnt, die über die Annahme entscheiden — einen geprüften #3-Rang, die Arena-Frontend-Krone, einen veröffentlichten Preis und Gewichte, die bereit sind — und es setzte sich mit 80 zu 83 gegen Qwen im einzigen echten direkten Vergleich durch. Aber dieser direkte Vergleich zeigt auch, warum Qwen 3.8 Beachtung verdient: es war das akribischere Modell, das mehr aus der Codebasis zitierte, weniger Anfragen verwendete und null fehlgeschlagene Tool-Aufrufe machte. Wenn Ihre Arbeit eine erschöpfende Erkundung belohnt und wenn Alibaba die Gewichte veröffentlicht und eine unabhängige Bewertung in der Nähe der Spitze landet, könnte sich diese Rivalität umkehren. Bis dahin ist Kimi K3 die sicherere Open-Weight-Wahl, und Qwen 3.8 ist der Herausforderer, den Sie mit Ihren eigenen Eingabeaufforderungen testen sollten.

