
Qwen 4 Max vs. Kimi K3: Das Open-Weights-Versprechen trifft auf die Open-Weights-Einlösung
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026 und tat dann das, worüber die meisten Labore nur reden: Es veröffentlichte die Gewichte. Der Checkpoint mit 2,8 Billionen Parametern erschien am 27. Juli 2026 unter einer modifizierten MIT-Lizenz, elf Tage nach dem Launch. Unterdessen wurde die Yunqi-Konferenz am 22. September 2026 genutzt, um Qwen 4 Max als Flaggschiff einer vierstufigen Familie Qwen 4 anzukündigen, zu der ein Open-Weight-Qwen 4 27B gehört – eine Stufe, die versprochen, aber nicht ausgeliefert ist. Diese beiden Fakten bilden den Vergleich. Alles andere über Qwen 4 Max ist derzeit unbekannt, und die Lücke zwischen einer versprochenen offenen Stufe und einer tatsächlich gelieferten ist der Punkt, an dem diese Gegenüberstellung tatsächlich etwas zu sagen hat.
Was Kimi K3 im Juli auf den Tisch brachte
Kimi K3 ist ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, das pro Token 16 von 896 Experten aktiviert, wodurch bei jedem einzelnen Schritt rund 104 Milliarden Parameter zum Einsatz kommen. Es verfügt über ein Kontextfenster von 1.048.576 Token sowohl auf der Eingabe- als auch auf der Ausgabeseite und akzeptiert Text-, Bild- und Videoeingaben mit Textausgabe. Seine First-Party-API wird mit 3,00 $ pro Million Eingabe-Token, 15,00 $ pro Million Ausgabe-Token und 0,30 $ pro Million gecachter Eingabe-Token gelistet, und die Preise von Drittanbietern liegen darunter.
Die Architektur ist der Teil, den Alibabas eigene Vorschau aufgreift. Kimi K3 basiert auf Kimi Delta Attention und Attention Residuals, von denen Moonshot behauptet, dass sie eine etwa 2,5-mal bessere Skalierungseffizienz als Kimi K2 und bis zu 6,3-mal schnelleres Decoding bei Kontexten mit einer Million Token liefern. Das ist dasselbe Problem, auf das Qwens QSA abzielt – Attention bei extremen Längen bezahlbar zu machen –, was bedeutet, dass die beiden Familien nicht so sehr auf Skalierung konkurrieren, sondern darüber, wessen Sparse-Attention-Design besser altert.
Die Ergebnisse, die Moonshot zum Start veröffentlichte, vom Anbieter angegeben und damals nicht reproduziert:
• Artificial Analysis Intelligence Index — 57, damals auf Platz drei hinter Claude Fable 5 und GPT-5.6 Sol. Dieser Wert wurde unter einer früheren Revision des Index erfasst; der Index wurde seitdem zweimal neu aufgebaut, es handelt sich also um einen historischen Wert und nicht um einen aktuellen.
• Frontend Code Arena — erster Platz mit 1.679 Elo, vor beiden Modellen, die es auf dem allgemeinen Index übertroffen haben
• Terminal-Bench 2.1 — 88.3
• SWE-Marathon — 42, vor Opus 4.8 und GPT-5.6 Sol
• DeepSearchQA — 0,95, erster Platz, und MATH-Vision 0,98, ebenfalls auf Platz eins
• GPQA-Diamond — 0,94
Moonshots eigenes Launch-Material räumt ein, dass K3 bei der Gesamtleistung weiterhin hinter Claude Fable 5 und GPT-5.6 Sol zurückliegt, was ein nützlicherer Satz ist als jede der Erstplatzierungs-Behauptungen darüber. Die interessante Form der Zahlen besteht darin, dass ein Modell, das im allgemeinen Index auf Platz drei steht, im Frontend-Code Platz eins und bei der Long-Horizon-Suche Platz eins belegte – ein Profil, das besagt, dass der aggregierte Index ein spezialisiertes Werkzeug verbirgt, statt ein allgemeines zu beschreiben.

Was Alibaba versprochen hat – und was ein Versprechen wert ist
Die Ankündigung zu Qwen 4 nannte vier Stufen. Qwen 4 Max als Flaggschiff, Qwen 4 Flash für Durchsatz, Qwen 4 Plus als ausgewogene Mittelklasse und Qwen 4 27B als lokale Open-Weight-Stufe. Qwen-LLM-Leiter Liu Da Yiheng beschrieb die Familie als auf einer Architektur einer neuen Generation trainiert und sagte, sie werde bald erscheinen. Es gibt kein Datum, keine Modellkarte, keine API-Kennung, keinen Cloud-Eintrag, keinen Preis und keine veröffentlichte Bewertung für eines der vier.
Zwei konkrete Dinge an dieser Ankündigung werden falsch wiedergegeben, und beide sind wichtig für alle, die darauf aufbauend planen wollen:
• Die Zahl von 5 bis 10 Billionen Parametern, die der Berichterstattung zu Qwen 4 zugeordnet wird, ist keine Spezifikation von Qwen 4. Sie gehört zur Roadmap für Qwen 4.5 und Qwen 5. Für Qwen 4 Max wurde keinerlei Parameteranzahl veröffentlicht.
• Die Weiterführung der Tier-Namen überträgt die Spezifikationen nicht. Kontextfenster, Preis und Lizenz von Qwen 4 Max sind unbekannt; die Zahlen des ausgelieferten Qwen3.8-Max – 1.000.000 Tokens zu 2,00 $ und 6,00 $ pro Million – beschreiben ein anderes Modell
Der Grund, warum die 27B-Klasse die interessante ist, hat nichts mit Benchmarks zu tun. Sie ist die einzige Klasse in der Qwen-4-Reihe, die historisch mit offenen Gewichten ausgeliefert wurde, und die Qwen-3.8-Generation zeigte, was das ermöglicht: Innerhalb von Tagen nach Veröffentlichung der 27B-Gewichte hatte die Community MLX-Konvertierungen, NVFP4-Quantisierungen und Fine-Tunes aller Art erstellt. Ein angekündigtes 27B-Modell ist eine Verpflichtung gegenüber einem nachgelagerten Ökosystem, und es ist die am besten vorhersehbare Lieferung auf der Roadmap.
Doch das Vorhersehbare wird nicht geliefert. Die Gewichte von Kimi K3 sind eine Datei, die man heute herunterladen kann. Die Gewichte von Qwen 4 27B sind eine Zeile in einem Konferenzvortrag.
Offene Gewichte und lauffähige Gewichte sind unterschiedliche Behauptungen
Es steckt eine Falle darin, Kimi K3 als die Open-Weights-Antwort zu behandeln, und es lohnt sich, das deutlich zu sagen, denn es ist die häufigste überzogene Behauptung in der Berichterstattung über chinesische Frontier-Modelle. Ein Mixture-of-Experts mit 2,8 Billionen Parametern ist ein Artefakt in Rechenzentrumsgröße. Veröffentlichte Gewichte bedeuten, dass man es ausführen darf, es inspizieren kann, es feinabstimmen kann und es quantisieren kann. Sie bedeuten nicht, dass man es auf einer Workstation ausführen kann. Die effiziente Bereitstellung eines Checkpoints dieser Größe erfordert Dutzende von Beschleunigern, und bei der Quantisierungsarbeit, die auf eine offene Veröffentlichung folgt – die NVFP4- und REAP-artigen Varianten, die innerhalb von Wochen kursieren –, geht es ebenso sehr darum, das Modell bereitstellbar zu machen, wie darum, es kleiner zu machen.
Die ehrliche Lesart der Lizenz von Kimi K3 ist also enger und dennoch bedeutsam: Es ist ein auditierbares, modifizierbares, selbst hostbares Frontier-Modell unter einer modifizierten MIT-Lizenz, für Organisationen mit der Hardware, um es zu betreiben. Das ist ein echter strategischer Vorteil und passt schlecht zu allen, die „offene Gewichte“ als „läuft auf meinem Laptop“ gelesen haben.
Derselbe Vorbehalt wird für Qwen 4 27B gelten, falls und wenn es erscheint – und er gilt weniger stark, weil eine 27B-Open-Weight-Stufe tatsächlich lokal dimensioniert ist, was auf ein 2,8T-Flaggschiff nicht zutrifft. Genau deshalb verdient die Qwen 4 27B-Stufe in diesem Vergleich mehr Aufmerksamkeit als die Max-Stufe, obwohl die Max-Stufe das war, womit die Ankündigung eröffnet wurde.

Die kommerzielle Frage unter der {{1}}Lizenzfrage{{/1}}
Kimi K3s First-Party-Tarif von 3,00 US-Dollar für Input und 15,00 US-Dollar für Output pro Million Tokens ist eine Premium-Positionierung, und Moonshot hat unmissverständlich klargestellt, dass er bewusst über dem günstigen Ende des chinesischen Marktes angesetzt ist. Gegenüber Qwen3.8-Max mit 2,00 und 6,00 US-Dollar ist das das Eineinhalbfache des Input-Tarifs und das Zweieinhalbfache des Output-Tarifs – eine Lücke, die groß genug ist, dass eine Workload die spezifischen Stärken von Kimi K3 brauchen muss, darunter Frontend-Code und Long-Horizon-Suche, damit sich der Aufpreis lohnt.
OrcaRouter routet kimi/kimi-k3 neben der Qwen-3.8-Familie über einen einzigen OpenAI-kompatiblen Endpoint mit 0 % Aufschlag, was bedeutet, dass Ihnen der Listenpreis des Anbieters in Rechnung gestellt wird und nicht ein aufgeschlagener Gegenwert. In einem Vergleich, in dem der Preisunterschied bei der Ausgabe einen Faktor von 2,5 beträgt, ist das Fehlen einer Plattformmarge kein Rundungsdetail — eine Schicht von zehn Prozent auf einen Ausgabepreis von $15.00 sind $1.50 pro Million Tokens, was mehr ist als die gesamten Eingabekosten des günstigeren Modells in diesem Duell. Derselbe Endpoint bietet automatisches Failover und eine Routing-DSL, um Richtlinien explizit auszudrücken — so testen Sie ein Modell mit dem Profil von Kimi K3 auf einem Teil des Produktionsverkehrs, ohne einen ganzen Pfad auf einen Anbieter zu setzen, den Sie noch nie betrieben haben.
Was OrcaRouter nicht anbietet, ist Qwen 4 Max oder irgendeine Qwen-4-Stufe, denn keine davon existiert bisher als Produkt.

Worauf man achten sollte und was man ignorieren kann
Drei Signale würden diesen Vergleich verändern, und sie sind konkret genug, um auf sie zu achten:
• Die Qwen 4 27B-Gewichte. Nicht die Benchmark-Tabelle der Max-Stufe – der 27B-Checkpoint, seine Lizenz und seine Größe. Das ist die Veröffentlichung, die dir zeigen wird, ob Alibabas Engagement für offene Gewichte in dieser Generation so echt ist wie das der letzten.
• Die Lizenz von Qwen 4 Max, falls vorhanden. Wenn Alibaba die Gewichte für sein Flaggschiff so veröffentlicht, wie es das bei Qwen3.8-Max getan hat, ist das Open-Weights-Argument in diesem Duell kein Vorteil von Kimi mehr, sondern ein Gleichstand.
• Eine neue unabhängige Einschätzung zu Kimi K3. Moonshots Startwerte waren selbst gemeldet, und der Artificial-Analysis-Index wurde seitdem zweimal neu aufgebaut, daher müssen sowohl die 57 als auch der Frontend Code Arena Elo neu basisiert werden, bevor sie mit irgendetwas Aktuellem verglichen werden.
Zu ignorieren ist jede Spezifikationstabelle zu Qwen 4 Max, die erscheint, bevor Alibaba eine Modellkarte veröffentlicht, und jede Behauptung, dass die offenen Gewichte von Kimi K3 es lokal ausführbar machen. Beide Fehler sind bereits im Umlauf. In der Zwischenzeit ist der Vergleich, auf den Sie sich stützen können, der zwischen zwei Modellen, die es gibt: Kimi K3 zu einem Premium-Tarif mit ausgelieferten Gewichten und einem wirklich eigenständigen Coding-Profil sowie Qwen3.8-Max zu weniger als der Hälfte des Output-Tarifs mit einem konstanten Fenster von einer Million Token und eigenen Gewichten. Das ist eine echte Wahl, bei der beide Seiten bepreist sind, und sie erfordert nicht, darauf zu warten, dass aus einer Konferenzfolie ein Produkt wird.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
