Hero-Karte für Qwen-Image-2.1-Turbo, einen beschleunigten 8-Schritt-Checkpoint von Qwen-Image-2.1, die den mit den Gewichten gespeicherten 8-Schritt-Zeitplan, standardmäßig CFG 1, die Wiederverwendung des Prefix-KV-Caches und die unveränderte Qwen Research Licence zeigt
Engineering & Research

Qwen-Image-2.1-Turbo: Ein 8-Schritte-Checkpoint, der den Zeitplan in die Gewichte verlagerte

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Repository für Qwen-Image-2.1-Turbo erschien am 9. Oktober 2026 auf Hugging Face, und das Interessanteste daran ist nicht die Schrittzahl. Es gibt bfloat16-Gewichte, eine Modellkarte mit ausführbarem Code, eine Lizenzdatei, acht Bilder und eine Zeile in der GitHub-Neuigkeitenliste des Qwen-Image-2.1-Projekts, die die Veröffentlichung ankündigt. Es gibt keinen eigenen Blogbeitrag, keine Benchmark-Tabelle, keinen Pressezyklus und keinerlei Änderung an den Bedingungen, unter denen Qwen-Image-2.1 vertrieben wird. Turbo ist ein beschleunigter Checkpoint von Qwen-Image-2.1 für Text-zu-Bild-Generierung und Bildbearbeitung, der in acht Denoising-Schritten läuft statt in den vierzig, die die eigenen Beispiele des Basismodells verwenden. Er ändert außerdem ganz nebenbei, woher der Sampling-Zeitplan kommt – und das ist der Teil, der Code brechen wird.

Was ist eigentlich im Repository?

Die Karte ist kurz und ungewöhnlich konkret, was es leicht macht, das Bestätigte von dem zu trennen, was impliziert wird.

• Worum es geht: Die Karte beschreibt Qwen-Image-2.1-Turbo als „einen beschleunigten Checkpoint von Qwen-Image-2.1 für die Text-zu-Bild-Generierung und Bildbearbeitung mit 8 Denoising-Schritten“. Es ist keine neue Architektur und keine neue Modellfamilie. Es ist dieselbe 7B-Visual-Generierungskomponente, neu verpackt um eine deutlich kürzere Sampling-Trajektorie.

• So wird es geladen: über QwenImage21Pipeline in Diffusers, dieselbe Pipeline-Klasse, die das Basismodell verwendet, wobei nur der Checkpoint-Name ausgetauscht wird. Die eigenen Metadaten des Repositories geben base_model: Qwen/Qwen-Image-2.1 und library_name: diffusers an und führen base_model:finetune:Qwen/Qwen-Image-2.1 als zweites Tag. Damit beschreibt der Anbieter dies als ein Fine-Tuning des Basis-Checkpoints, nicht als ein Geschwistermodell.

• Was erhalten bleibt: dieselbe 7B-Architektur zur visuellen Generierung, dieselben sieben Auflösungsvoreinstellungen wie bei Qwen-Image-2.1 (quadratisch 2048 × 2048, 4:3 bei 2400 × 1792, 3:4 bei 1792 × 2400, 3:2 bei 2528 × 1696, 2:3 bei 1696 × 2528, 16:9 bei 2752 × 1536 und 9:16 bei 1536 × 2752) sowie dieselben zwei Fähigkeiten – Text-zu-Bild-Generierung und instruktionsgesteuerte Bildbearbeitung. Die Präsentation der Karte ist nach Kategorien gegliedert: Porträtfotografie, menschliche Posen und Bewegung, transparente RGBA-Generierung, Typografie und Posterdesign, UI- und Informationslayout, Einzelbildtransformation, Multi-Referenz-Komposition und eine Vier-Bild-Innenraumkomposition.

• Was es nicht enthält: keine Bewertungszahl. Es gibt keinen Qwen-Image-Bench-Score für den Turbo-Checkpoint auf der Karte und keinen Vergleich mit der Basis. Die einzige Punktzahl in der gesamten Qwen-Image-2.1-Reihe bleibt das eigene Qwen-Image-Bench-Ergebnis des Basismodells, eine vom Anbieter gemeldete Zahl, die am Basis-Checkpoint gemessen wurde – nicht an diesem.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

Der Zeitplan steckt jetzt in den Gewichten, und das ist die eigentliche Veränderung.

Hier ist der Satz, der auf der Karte am wichtigsten ist, und er ist unter den Installationsanweisungen begraben: Der Checkpoint „enthält seinen empfohlenen Sampling-Zeitplan, sodass er einsatzbereit ist, ohne den Scheduler manuell konfigurieren zu müssen.“

Dann die Konsequenz, im Sampling-Abschnitt klar formuliert: „Der empfohlene 8-Schritt-Sampling-Zeitplan wird mit dem Checkpoint gespeichert und automatisch geladen. Das alleinige Festlegen von num_inference_steps überschreibt ihn nicht.“

Lesen Sie das zweimal. In der Diffusers-Konvention, die die meisten im Kopf haben, ist die Schrittanzahl ein Argument zur Aufrufzeit – man übergibt num_inference_steps=40 für das Basismodell, num_inference_steps=4 für einen destillierten Checkpoint, und die Pipeline baut einen passenden Zeitplan auf. Qwen-Image-2.1-Turbo bricht mit dieser Konvention. Der Acht-Schritt-Zeitplan zählt zu den Checkpoint-Metadaten, nicht zu einem Anfrageparameter. Man kann eine andere Ganzzahl übergeben, und die Pipeline verwendet trotzdem den gespeicherten Zeitplan. Die Modellkarte besagt, dass die einzige Möglichkeit, ihn zu überschreiben, darin besteht, zur Aufrufzeit ein explizites sigmas-Argument zu übergeben, und ergänzt, dass andere Zeitpläne „nicht für diesen Checkpoint evaluiert wurden“.

Das praktische Ergebnis ist eine Reproduktionsfalle. Code, der aus der Modellkarte von Qwen-Image-2.1 übernommen und auf das Turbo-Repository gerichtet wird, läuft, wird keinen Fehler verursachen und nicht die Ausgaben liefern, die die Turbo-Showcase zeigt. Er benötigt außerdem einen Diffusers-Build, der pipeline-konfigurierte Sampling-Sigmas versteht – Unterstützung wurde in Diffusers PR #14950 hinzugefügt, die zum Zeitpunkt des Schreibens im Quellbaum statt in einem getaggten Release vorliegt. Die angegebene Installation ist ein CUDA-kompatibler PyTorch-Build plus git+https://github.com/huggingface/diffusers.git, transformers>=5.17.0, accelerate und pillow.

Zwei weitere Standardwerte stammen aus der Karte und nicht aus irgendetwas, das Sie festlegen: Die Generierung verwendet standardmäßig CFG 1, und das Prefix-KV-Caching „verwendet den Text- und Referenzbild-Kontext über die Denoising-Schritte hinweg erneut“. CFG 1 bedeutet keinen Classifier-free-Guidance-Durchlauf, was zu einem großen Teil dazu beiträgt, dass die Trajektorie verkürzt wird, ohne zusammenzubrechen – und es ist auch der Grund, warum die Karte sich nicht mit einer Empfehlung für die Guidance-Skala aufhält. Der Prefix-KV-Cache ist das Erbe des Basismodells: derselbe Mechanismus, den Qwen-Image-2.1 nutzt, um Text- und Referenzbild-Kontext wiederzuverwenden, was stärker, nicht schwächer, ins Gewicht fällt, wenn die Denoising-Schleife nur acht Iterationen lang ist.

Angekündigt in einem Changelog, bereitgestellt als Repository

Die Einordnung, die zu diesem Release passt, ist weder „Launch“ noch „Leak“. Es ist ein eingechecktes Artefakt mit einer datierten Zeile in einer News-Liste. Die GitHub-News-Liste für das Qwen-Image-2.1-Projekt enthält zwei Einträge vom 2026.10.09: einen für den Turbo-Checkpoint, einen mit dem Hinweis, dass die Qwen-Image-2.1 Pro- und Turbo-APIs auf Alibaba Cloud Model Studio „jetzt offiziell live“ sind. Es gibt keinen separaten Turbo-Blogbeitrag; der Blog-Link auf der Karte verweist auf den Qwen-Image-2.1-Blog vom 20. September 2026.

Vergleichen Sie das damit, wie das Basismodell drei Wochen früher herauskam. Die Nachrichtenliste von Qwen-Image-2.1 enthält einen datierten Eintrag für die Gewichte und dann fünf weitere am selben Tag: Diffusers-Unterstützung ab Tag null über PR #14804, native ComfyUI-Unterstützung ab Tag null, vLLM-Omni-Unterstützung mit schrittweiser Ausführung und Prefix-KV-Caching und FP8-Quantisierung und Tensor-Parallelität, SGLang-Unterstützung mit Cache-DiT und CUDA-Graphen und Beschleunigung ab Tag null von LightX2V. Der Turbo-Checkpoint hat nichts davon. Jeder einzelne dieser Ökosystem-Einträge bezieht sich auf Qwen-Image-2.1.

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

Die Repository-Zähler erzählen dieselbe Geschichte über Reife statt über Verdienst, und sie sind eine Momentaufnahme und kein Urteil: Zum Zeitpunkt des Verfassens zeigt Qwen-Image-2.1 122.311 Downloads im letzten Monat und 3.142 Likes, während Qwen-Image-2.1-Turbo – ein paar Stunden alt – 33 Likes zeigt. Downloads sind ein nachlaufender Indikator, und die Turbo-Zahl wird sich ändern. Was sie dir heute sagt, ist nur, dass noch niemand Zeit hatte, es auszuführen.

Was acht Schritte Ihnen nicht verraten

Die Schrittzahl ist die Schlagzeile und die am wenigsten nützliche Zahl im Release, aus drei Gründen, die klar benannt werden sollten.

• Schritte sind keine Sekunden.Weder die Karte noch das Repository veröffentlicht Durchsatz, Latenz oder Speicher für den Turbo-Checkpoint. Acht Schritte bei 2048 × 2048 auf einem 7B-bfloat16-Modell sind eine andere Arbeitslast als acht Schritte auf einem kleineren Modell, und die Karte gibt nicht an, auf welcher Hardware gemessen wurde, weil sie überhaupt keine Messung angibt.

• Es gibt noch keinen Qualitätsanker. Für Turbo gibt es keinen veröffentlichten Score, keinen direkten Vergleich mit dem Basis-Checkpoint und keine unabhängige Bewertung von beidem. Die Showcase-Bilder sind vom Anbieter ausgewählte Ergebnisse bei den vom Anbieter empfohlenen Einstellungen. Sie belegen, dass das Modell Bilder erzeugt; sie belegen nicht, wie viel Qualität für die Reduzierung der Schritte geopfert wurde, und sie sind kein Ersatz für einen Benchmark.

• Speicherhinweise fehlen. Die Modellkarte des Basismodells enthält einen Abschnitt zur Speicheroptimierung; die Turbo-Karte dokumentiert Installation, Generierung, Bearbeitung, Sampling und Seitenverhältnisse sowie Stopps. Wenn Sie vorhaben, dies bereitzustellen, sollten Sie Messungen einplanen.

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

Die Lizenz ist unverändert, und das ist die Schlagzeile für jeden, der ausliefert

Qwen-Image-2.1-Turbo ist unter der Qwen Research License Agreement lizenziert. In den Metadaten des Repositorys steht license: other mit license_name: qwen-research und license_link: LICENSE, und im Repository ist neben den Gewichten eine LICENSE-Datei vorhanden. Der eigene Lizenzabschnitt der Karte enthält einen Satz: Das Modell ist unter der Qwen Research License Agreement lizenziert.

Beschleunigung ändert daran nichts. Eine nichtkommerzielle Forschungslizenz für das Basismodell wird nicht dadurch zu einer kommerziellen Lizenz, dass der Checkpoint schneller ist, und das Turbo-Repository ist ein separater Download unter denselben Bedingungen. Wenn Ihr Interesse an der Acht-Schritt-Generierung darin besteht, dass sie das Modell günstig genug macht, um es in ein Produkt einzubauen, dann ist die Lizenz die Einschränkung, nicht die Schrittanzahl. Diese Frage muss an den Anbieter gehen; sie wird nirgendwo in diesem Repository beantwortet.

Der gehostete Pfad – und wo OrcaRouter darin einzuordnen ist

OrcaRouter leitet Qwen-Image-2.1-Turbo nicht weiter und leitet auch Qwen-Image-2.1 nicht weiter. Keines von beiden erscheint in unserem Katalog, und nichts in diesem Artikel sollte als Angebot verstanden werden, sie bereitzustellen. Wenn Sie eines von beiden möchten, geht das über die eigenen APIs des Anbieters und mehrere Drittanbieter-Plattformen oder über die Gewichte selbst mit einem Diffusers-Build, der neu genug ist, um den gespeicherten Zeitplan des Turbo-Checkpoints zu laden.

Was wir vorne anbieten, ist die gehostete Bildproduktlinie, und es lohnt sich zu wissen, was dazugehört, damit du sie neben das selbst gehostete Experiment halten kannst. OrcaRouter stellt 200+ Modelle hinter einen einzigen OpenAI-kompatiblen Endpunkt zum Listenpreis des Anbieters ohne Aufschlag — wenn ein Anbieter also einen Preis senkt, ist die Preissenkung bei uns noch am selben Tag live, statt auf eine Preisanpassungsrunde zu warten. Es fügt automatisches Failover hinzu, wenn sich die Leistung eines Anbieters verschlechtert, eine Routing-DSL, mit der sich ausdrücken lässt, welche Modelle und Anbieter eine Anfrage verwenden darf, und Modellfusion, um mehrere Modelle zu einem einzigen Aufruf zusammenzusetzen. Die Bildmodelle, die wir routen, sind die OpenAI GPT-Image-Familie, Googles Imagen-4-Stufen einschließlich der Fast- und Ultra-Varianten, Googles Gemini-Bildvorschau-Endpunkte und den Bildendpunkt von xAI Grok Imagine.

Die ehrliche Gestalt der Entscheidung: Wenn Sie ein Acht-Schritt-7B-Modell mit offenen Gewichten brauchen, das Sie inspizieren und verändern können, ist Turbo Selbsthosting-Arbeit, und die Lizenz ist das, was zuerst geklärt werden muss. Wenn Sie diese Woche einen Bild-Endpunkt im Produktivbetrieb brauchen, ist das eine andere Anschaffung, und es ist die, die wir verkaufen.

Was gesagt werden kann und was nicht

• Vom Repository selbst bestätigt: ein beschleunigter 7B-Checkpoint von Qwen-Image-2.1, der Text-zu-Bild-Generierung und Bildbearbeitung in acht Denoising-Schritten durchführt; ein gespeicherter Sampling-Zeitplan, den num_inference_steps nicht überschreibt; standardmäßig CFG 1; Prefix-KV-Caching für Text- und Referenzbild-Kontext; dieselben sieben Auflösungs-Presets wie das Basismodell; einen QwenImage21Pipeline-Ladepfad; einen datierten Release-Eintrag vom 9. Oktober 2026 in der eigenen News-Liste des Projekts; und dieselbe Qwen Research License Agreement wie das Basismodell.

• Nirgends belegt: jegliche Qualitätsmessung für den Turbo-Checkpoint, jegliche Geschwindigkeits- oder Speichermessung, jegliche unabhängige Bewertung des Basis-Checkpoints, von dem er abgeleitet ist, jegliche Aussage zu kommerziellen Bedingungen über die Research-Lizenz hinaus sowie jegliche Day-Zero-Framework-Unterstützung der Art, mit der Qwen-Image-2.1 ausgeliefert wurde.

Die acht Schritte sind die Zahl, die genannt werden wird. Der Zeitplan, der in die Gewichte eingeflossen ist, ist das Detail, das entscheidet, ob Ihr erster Lauf überhaupt etwas reproduziert.