Eine generierte Hero-Karte mit dem Titel „Qwen 4 Max vs. Kimi K3“, dem Untertitel „Das Open-Weights-Versprechen trifft auf die Open-Weights-Lieferung“ und drei Pill-Badges mit den Aufschriften „Gewichte versprochen, nicht ausgeliefert“, „K3-Gewichte erscheinen am 27. Juli 2026“ und „Modifizierte MIT-Lizenz“. Eine Fußzeile lautet „Alibaba Yunqi Conference, Hangzhou“. Flaches redaktionelles Vektor-Styling auf weißem Hintergrund mit einem Blau-zu-Cyan-Verlaufswash und dem unten rechts eingefügten OrcaRouter-Logo.
Engineering & Research

Qwen 4 Max vs. Kimi K3: Das Open-Weights-Versprechen trifft auf die Open-Weights-Einlösung

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026 und tat dann das, worüber die meisten Labore nur reden: Es veröffentlichte die Gewichte. Der Checkpoint mit 2,8 Billionen Parametern erschien am 27. Juli 2026 unter einer modifizierten MIT-Lizenz, elf Tage nach dem Launch. Unterdessen wurde die Yunqi-Konferenz am 22. September 2026 genutzt, um Qwen 4 Max als Flaggschiff einer vierstufigen Familie Qwen 4 anzukündigen, zu der ein Open-Weight-Qwen 4 27B gehört – eine Stufe, die versprochen, aber nicht ausgeliefert ist. Diese beiden Fakten bilden den Vergleich. Alles andere über Qwen 4 Max ist derzeit unbekannt, und die Lücke zwischen einer versprochenen offenen Stufe und einer tatsächlich gelieferten ist der Punkt, an dem diese Gegenüberstellung tatsächlich etwas zu sagen hat.

Was Kimi K3 im Juli auf den Tisch brachte

Kimi K3 ist ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, das pro Token 16 von 896 Experten aktiviert, wodurch bei jedem einzelnen Schritt rund 104 Milliarden Parameter zum Einsatz kommen. Es verfügt über ein Kontextfenster von 1.048.576 Token sowohl auf der Eingabe- als auch auf der Ausgabeseite und akzeptiert Text-, Bild- und Videoeingaben mit Textausgabe. Seine First-Party-API wird mit 3,00 $ pro Million Eingabe-Token, 15,00 $ pro Million Ausgabe-Token und 0,30 $ pro Million gecachter Eingabe-Token gelistet, und die Preise von Drittanbietern liegen darunter.

Die Architektur ist der Teil, den Alibabas eigene Vorschau aufgreift. Kimi K3 basiert auf Kimi Delta Attention und Attention Residuals, von denen Moonshot behauptet, dass sie eine etwa 2,5-mal bessere Skalierungseffizienz als Kimi K2 und bis zu 6,3-mal schnelleres Decoding bei Kontexten mit einer Million Token liefern. Das ist dasselbe Problem, auf das Qwens QSA abzielt – Attention bei extremen Längen bezahlbar zu machen –, was bedeutet, dass die beiden Familien nicht so sehr auf Skalierung konkurrieren, sondern darüber, wessen Sparse-Attention-Design besser altert.

Die Ergebnisse, die Moonshot zum Start veröffentlichte, vom Anbieter angegeben und damals nicht reproduziert:

• Artificial Analysis Intelligence Index — 57, damals auf Platz drei hinter Claude Fable 5 und GPT-5.6 Sol. Dieser Wert wurde unter einer früheren Revision des Index erfasst; der Index wurde seitdem zweimal neu aufgebaut, es handelt sich also um einen historischen Wert und nicht um einen aktuellen.

• Frontend Code Arena — erster Platz mit 1.679 Elo, vor beiden Modellen, die es auf dem allgemeinen Index übertroffen haben

• Terminal-Bench 2.1 — 88.3

• SWE-Marathon — 42, vor Opus 4.8 und GPT-5.6 Sol

• DeepSearchQA — 0,95, erster Platz, und MATH-Vision 0,98, ebenfalls auf Platz eins

• GPQA-Diamond — 0,94

Moonshots eigenes Launch-Material räumt ein, dass K3 bei der Gesamtleistung weiterhin hinter Claude Fable 5 und GPT-5.6 Sol zurückliegt, was ein nützlicherer Satz ist als jede der Erstplatzierungs-Behauptungen darüber. Die interessante Form der Zahlen besteht darin, dass ein Modell, das im allgemeinen Index auf Platz drei steht, im Frontend-Code Platz eins und bei der Long-Horizon-Suche Platz eins belegte – ein Profil, das besagt, dass der aggregierte Index ein spezialisiertes Werkzeug verbirgt, statt ein allgemeines zu beschreiben.

A generated scoreboard titled 'Qwen 4 Max vs Kimi K3 - the scoreboard'. Left column 'Qwen 4 Max' reads announced not released, Qwen 4 27B promised, not published, not published, not published, not published. Right column 'Kimi K3' reads GA since July 16 2026, published July 27 2026, Modified MIT, $3.00 per 1M tokens, $15.00 per 1M tokens, 1,048,576 tokens. Footer reads 'Kimi K3 figures from Moonshot's launch material; Qwen 4 Max status per Alibaba's September 22 2026 Yunqi conference.'

Was Alibaba versprochen hat – und was ein Versprechen wert ist

Die Ankündigung zu Qwen 4 nannte vier Stufen. Qwen 4 Max als Flaggschiff, Qwen 4 Flash für Durchsatz, Qwen 4 Plus als ausgewogene Mittelklasse und Qwen 4 27B als lokale Open-Weight-Stufe. Qwen-LLM-Leiter Liu Da Yiheng beschrieb die Familie als auf einer Architektur einer neuen Generation trainiert und sagte, sie werde bald erscheinen. Es gibt kein Datum, keine Modellkarte, keine API-Kennung, keinen Cloud-Eintrag, keinen Preis und keine veröffentlichte Bewertung für eines der vier.

Zwei konkrete Dinge an dieser Ankündigung werden falsch wiedergegeben, und beide sind wichtig für alle, die darauf aufbauend planen wollen:

• Die Zahl von 5 bis 10 Billionen Parametern, die der Berichterstattung zu Qwen 4 zugeordnet wird, ist keine Spezifikation von Qwen 4. Sie gehört zur Roadmap für Qwen 4.5 und Qwen 5. Für Qwen 4 Max wurde keinerlei Parameteranzahl veröffentlicht.

• Die Weiterführung der Tier-Namen überträgt die Spezifikationen nicht. Kontextfenster, Preis und Lizenz von Qwen 4 Max sind unbekannt; die Zahlen des ausgelieferten Qwen3.8-Max – 1.000.000 Tokens zu 2,00 $ und 6,00 $ pro Million – beschreiben ein anderes Modell

Der Grund, warum die 27B-Klasse die interessante ist, hat nichts mit Benchmarks zu tun. Sie ist die einzige Klasse in der Qwen-4-Reihe, die historisch mit offenen Gewichten ausgeliefert wurde, und die Qwen-3.8-Generation zeigte, was das ermöglicht: Innerhalb von Tagen nach Veröffentlichung der 27B-Gewichte hatte die Community MLX-Konvertierungen, NVFP4-Quantisierungen und Fine-Tunes aller Art erstellt. Ein angekündigtes 27B-Modell ist eine Verpflichtung gegenüber einem nachgelagerten Ökosystem, und es ist die am besten vorhersehbare Lieferung auf der Roadmap.

Doch das Vorhersehbare wird nicht geliefert. Die Gewichte von Kimi K3 sind eine Datei, die man heute herunterladen kann. Die Gewichte von Qwen 4 27B sind eine Zeile in einem Konferenzvortrag.

Offene Gewichte und lauffähige Gewichte sind unterschiedliche Behauptungen

Es steckt eine Falle darin, Kimi K3 als die Open-Weights-Antwort zu behandeln, und es lohnt sich, das deutlich zu sagen, denn es ist die häufigste überzogene Behauptung in der Berichterstattung über chinesische Frontier-Modelle. Ein Mixture-of-Experts mit 2,8 Billionen Parametern ist ein Artefakt in Rechenzentrumsgröße. Veröffentlichte Gewichte bedeuten, dass man es ausführen darf, es inspizieren kann, es feinabstimmen kann und es quantisieren kann. Sie bedeuten nicht, dass man es auf einer Workstation ausführen kann. Die effiziente Bereitstellung eines Checkpoints dieser Größe erfordert Dutzende von Beschleunigern, und bei der Quantisierungsarbeit, die auf eine offene Veröffentlichung folgt – die NVFP4- und REAP-artigen Varianten, die innerhalb von Wochen kursieren –, geht es ebenso sehr darum, das Modell bereitstellbar zu machen, wie darum, es kleiner zu machen.

Die ehrliche Lesart der Lizenz von Kimi K3 ist also enger und dennoch bedeutsam: Es ist ein auditierbares, modifizierbares, selbst hostbares Frontier-Modell unter einer modifizierten MIT-Lizenz, für Organisationen mit der Hardware, um es zu betreiben. Das ist ein echter strategischer Vorteil und passt schlecht zu allen, die „offene Gewichte“ als „läuft auf meinem Laptop“ gelesen haben.

Derselbe Vorbehalt wird für Qwen 4 27B gelten, falls und wenn es erscheint – und er gilt weniger stark, weil eine 27B-Open-Weight-Stufe tatsächlich lokal dimensioniert ist, was auf ein 2,8T-Flaggschiff nicht zutrifft. Genau deshalb verdient die Qwen 4 27B-Stufe in diesem Vergleich mehr Aufmerksamkeit als die Max-Stufe, obwohl die Max-Stufe das war, womit die Ankündigung eröffnet wurde.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3), captured September 22 2026, showing the model name, the 1M token context, text and image input with text output, vision, tool and reasoning badges, and a p50 time-to-first-token figure.

Die kommerzielle Frage unter der {{1}}Lizenzfrage{{/1}}

Kimi K3s First-Party-Tarif von 3,00 US-Dollar für Input und 15,00 US-Dollar für Output pro Million Tokens ist eine Premium-Positionierung, und Moonshot hat unmissverständlich klargestellt, dass er bewusst über dem günstigen Ende des chinesischen Marktes angesetzt ist. Gegenüber Qwen3.8-Max mit 2,00 und 6,00 US-Dollar ist das das Eineinhalbfache des Input-Tarifs und das Zweieinhalbfache des Output-Tarifs – eine Lücke, die groß genug ist, dass eine Workload die spezifischen Stärken von Kimi K3 brauchen muss, darunter Frontend-Code und Long-Horizon-Suche, damit sich der Aufpreis lohnt.

OrcaRouter routet kimi/kimi-k3 neben der Qwen-3.8-Familie über einen einzigen OpenAI-kompatiblen Endpoint mit 0 % Aufschlag, was bedeutet, dass Ihnen der Listenpreis des Anbieters in Rechnung gestellt wird und nicht ein aufgeschlagener Gegenwert. In einem Vergleich, in dem der Preisunterschied bei der Ausgabe einen Faktor von 2,5 beträgt, ist das Fehlen einer Plattformmarge kein Rundungsdetail — eine Schicht von zehn Prozent auf einen Ausgabepreis von $15.00 sind $1.50 pro Million Tokens, was mehr ist als die gesamten Eingabekosten des günstigeren Modells in diesem Duell. Derselbe Endpoint bietet automatisches Failover und eine Routing-DSL, um Richtlinien explizit auszudrücken — so testen Sie ein Modell mit dem Profil von Kimi K3 auf einem Teil des Produktionsverkehrs, ohne einen ganzen Pfad auf einen Anbieter zu setzen, den Sie noch nie betrieben haben.

Was OrcaRouter nicht anbietet, ist Qwen 4 Max oder irgendeine Qwen-4-Stufe, denn keine davon existiert bisher als Produkt.

A screenshot of the OrcaRouter models catalogue, captured September 22 2026, showing the filter sidebar (input modalities, context length, input price, status, series), the model card grid and a code sample posting to the OpenAI-compatible endpoint at api.orcarouter.ai.

Worauf man achten sollte und was man ignorieren kann

Drei Signale würden diesen Vergleich verändern, und sie sind konkret genug, um auf sie zu achten:

• Die Qwen 4 27B-Gewichte. Nicht die Benchmark-Tabelle der Max-Stufe – der 27B-Checkpoint, seine Lizenz und seine Größe. Das ist die Veröffentlichung, die dir zeigen wird, ob Alibabas Engagement für offene Gewichte in dieser Generation so echt ist wie das der letzten.

• Die Lizenz von Qwen 4 Max, falls vorhanden. Wenn Alibaba die Gewichte für sein Flaggschiff so veröffentlicht, wie es das bei Qwen3.8-Max getan hat, ist das Open-Weights-Argument in diesem Duell kein Vorteil von Kimi mehr, sondern ein Gleichstand.

• Eine neue unabhängige Einschätzung zu Kimi K3. Moonshots Startwerte waren selbst gemeldet, und der Artificial-Analysis-Index wurde seitdem zweimal neu aufgebaut, daher müssen sowohl die 57 als auch der Frontend Code Arena Elo neu basisiert werden, bevor sie mit irgendetwas Aktuellem verglichen werden.

Zu ignorieren ist jede Spezifikationstabelle zu Qwen 4 Max, die erscheint, bevor Alibaba eine Modellkarte veröffentlicht, und jede Behauptung, dass die offenen Gewichte von Kimi K3 es lokal ausführbar machen. Beide Fehler sind bereits im Umlauf. In der Zwischenzeit ist der Vergleich, auf den Sie sich stützen können, der zwischen zwei Modellen, die es gibt: Kimi K3 zu einem Premium-Tarif mit ausgelieferten Gewichten und einem wirklich eigenständigen Coding-Profil sowie Qwen3.8-Max zu weniger als der Hälfte des Output-Tarifs mit einem konstanten Fenster von einer Million Token und eigenen Gewichten. Das ist eine echte Wahl, bei der beide Seiten bepreist sind, und sie erfordert nicht, darauf zu warten, dass aus einer Konferenzfolie ein Produkt wird.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert