Hero-Karte, die Qwen-Image-2.1-Turbo mit Qwen-Image-2.1 vergleicht und 8 Denoising-Schritte gegenüber 40 zeigt, eine identische 7B-32-Schichten-DiT-Architektur, dieselben sieben Auflösungs-Presets, dieselbe nicht-kommerzielle Qwen Research Licence und einen gespeicherten Sampling-Zeitplan, den num_inference_steps nicht überschreibt
Engineering & Research

Qwen-Image-2.1-Turbo vs. Qwen-Image-2.1: Was hat sich tatsächlich zwischen dem Basis-Checkpoint und der beschleunigten Version geändert?

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Dieselbe 7B-Komponente zur visuellen Generierung. Dieselben 32 Single-Stream-DiT-Schichten. Dieselben sieben Auflösungsvoreinstellungen, dieselbe einheitliche Oberfläche für Generierung und Bearbeitung, dieselbe nichtkommerzielle Lizenz, dieselbe Pipeline-Klasse zum Laden. Qwen-Image-2.1-Turbo und Qwen-Image-2.1 sind keine zwei Modelle, zwischen denen man nach Leistungsfähigkeit wählt — der Turbo-Checkpoint ist ein Fine-Tuning der Basis, und das Repository sagt das in seinen eigenen Metadaten. Was sie trennt, ist eine einzige Sampling-Trajektorie und die Art und Weise, wie diese Trajektorie gespeichert wird. Der eine läuft vierzig Schritte. Der andere läuft acht und weigert sich, sich zur Aufrufzeit etwas anderes sagen zu lassen. Alles Interessante an dem Paar steckt in diesem zweiten Satz.

Beginne mit den Teilen, die identisch sind

Bevor die Unterschiede betrachtet werden, lohnt es sich, die Gemeinsamkeiten zu erfassen, denn sie sind umfangreicher, als die Bezeichnung „Turbo“ vermuten lässt, und genau sie machen den Tausch attraktiv.

• Die Architektur. Die Turbo-Karte gibt an, dass sie „dieselbe 7B-Visual-Generierungsarchitektur“ wie Qwen-Image-2.1 verwendet. Das Projekt beschreibt diese Komponente mit 7B Parametern über 32 Single-Stream-DiT-Schichten. Nichts im Turbo-Repository kündigt ein kleineres, beschnittenes oder neu architekturiertes Backbone an.

• Die Fähigkeiten. Beide Checkpoints werden als fähig beschrieben, Text-zu-Bild-Generierung und Bildbearbeitung durchzuführen. Turbo übernimmt die Oberfläche des Basismodells, anstatt sie erneut aufzuführen: Die Modellkarte des Basismodells dokumentiert native RGBA-Transparenz, bis zu 10 Referenzbilder und lokale Bearbeitungen, die durch Kreise, gemalte Anmerkungen oder separate Masken festgelegt werden, mit Identitätserhaltung für Personen und Produkte.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured in English, showing the Qwen organisation, 3.14k likes, the Text-to-image (diffusers), Diffusers, Safetensors and QwenImage21Pipeline tags, and the introduction text stating that Qwen-Image-2.1 is a unified text-to-image generation and image editing model with 7B parameters in its visual generation component and 32 Single-Stream DiT layers

• Die Auflösungen.Die Karte von Turbo sagt, dass „dieselben Auflösungs-Presets wie bei Qwen-Image-2.1 verwendet werden“ sollen, und listet sie dann auf: 1:1 bei 2048 × 2048, 4:3 bei 2400 × 1792, 3:4 bei 1792 × 2400, 3:2 bei 2528 × 1696, 2:3 bei 1696 × 2528, 16:9 bei 2752 × 1536 und 9:16 bei 1536 × 2752. Die Karte des Basismodells listet die identische Tabelle auf. Beide Karten verwenden die Auflösungsstufe 2048 für ihre Beispiele.

• Der Ladepfad.Beide werden über QwenImage21Pipeline in Diffusers geladen. Der Schnellstart der Turbo-Karte ist der Schnellstart der Basis-Karte, wobei der Checkpoint-Name geändert und bfloat16 als dtype statt torch_dtype geschrieben wird.

• Der Papierkram.Beide stehen unter der Qwen-Image-2.1 Research License Agreement, beide tragen license: other mit license_name: qwen-research, und beide haben eine LICENSE-Datei, die im Repository neben den Gewichten liegt.

Wenn du Qwen-Image-2.1 bereits eingebunden hast, dann ist die Migrationsfläche wirklich klein. Und genau deshalb lohnt es sich, bei dem einen Argument zu verweilen, das sich nicht so verhält, wie du es erwartest.

Der Zeitplan ist aus Ihrem Code in den Checkpoint gewandert.

Beim Basismodell bestimmst du die Anzahl der Schritte selbst. Das Text-zu-Bild-Beispiel auf der Qwen-Image-2.1-Karte, sein Bearbeitungsbeispiel und sein RGBA-Transparenz-Beispiel übergeben alle num_inference_steps=40, und die Zahl ist – wie bei Diffusers üblich – ein Argument zur Aufrufzeit. Nichts auf dieser Karte verrät dir, dass der Checkpoint eigene Vorstellungen vom Zeitplan hat.

Bei Turbo ist der Zeitplan Checkpoint-Metadaten. Die Karte gibt an, dass der Checkpoint „seinen empfohlenen Sampling-Zeitplan enthält, sodass er sofort einsatzbereit ist, ohne den Scheduler manuell konfigurieren zu müssen“, und führt dann im Sampling-Abschnitt aus, was das in der Praxis bedeutet: „Der empfohlene 8-Schritt-Sampling-Zeitplan wird mit dem Checkpoint gespeichert und automatisch geladen. Das alleinige Festlegen von num_inference_steps setzt ihn nicht außer Kraft.“

Daraus folgen zwei Dinge, und beide lassen sich leicht in entgegengesetzte Richtungen falsch machen.

Das Erste ist, dass acht kein Standard ist, den man nach oben anpassen kann. Wenn Sie wissen möchten, wie Turbo bei zwölf Schritten oder zwanzig aussieht, sagt Ihnen die Karte, dass der einzige Weg ein explizites sigmas-Argument zur Aufrufzeit ist – und macht dem Experiment dann einen Riegel vor, indem sie anmerkt, dass andere Zeitpläne „nicht für diesen Checkpoint evaluiert wurden“. Das ist ein Anbieter, der Ihnen sagt, dass die Acht-Schritt-Konfiguration diejenige ist, hinter der er steht, und dass alles andere unerforschtes Territorium ist, das Sie allein betreten. Es ist ein ungewöhnlich ehrlicher Satz, und er sollte eher als Grenze denn als Einladung gelesen werden.

Der zweite ist eine Reproduktionsfalle, an die keine Fehlermeldung geknüpft ist. Nehmen Sie das Beispiel des Basismodells, ändern Sie die Repository-Zeichenfolge in den Turbo-Checkpoint, lassen Sie num_inference_steps=40 stehen, und der Code läuft. Er wird Sie nicht warnen. Er erzeugt ein Bild unter Verwendung des gespeicherten Acht-Schritt-Zeitplans, und es wird nicht die Ausgabe sein, die die Turbo-Showcase anzeigt, weil vierzig nie gelesen wurde. Dies ist der Fehlermodus, bei dem nichts kaputt aussieht — das Rendern wird abgeschlossen, das Bild ist plausibel, und die einzige Möglichkeit, es herauszufinden, besteht darin, nach einem Unterschied zu suchen. Daneben ist eine zweite Abhängigkeit verborgen: Der Checkpoint benötigt einen Diffusers-Build, der pipeline-konfigurierte Sampling-Sigmas versteht, hinzugefügt in PR #14950, der zum Zeitpunkt des Schreibens im Diffusers-Quellbaum statt in einem getaggten Release vorliegt. Die angegebene Installation ist ein CUDA-kompatibler PyTorch-Build plus die Diffusers-Quelle, transformers>=5.17.0, accelerate und pillow.

Was bezahlt die 32 Schritte, die du nicht gegangen bist?

Die Karte nennt zwei Mechanismen, und beide sind wissenswert, weil sie erklären, was der Turbo-Checkpoint darüber annimmt, wie Sie ihn aufrufen werden.

• CFG 1 standardmäßig. „Die Generierung verwendet standardmäßig CFG=1.“ Bei einem Classifier-Free-Guidance-Scale von eins führt das Modell nicht den zweiten, unbedingten Durchlauf aus, den CFG normalerweise erfordert – was ein großer Teil davon ist, wie eine Trajektorie verkürzt wird, ohne einfach abgeschnitten zu werden. Es bedeutet außerdem, dass die Angewohnheit des Basismodells, eine Guidance-Skala abzustimmen, nicht übertragbar ist; hier gibt es nichts abzustimmen, und die Karte bietet keine Guidance-Empfehlung, auf die man abstimmen könnte.

• Präfix-KV-Caching. Die Karte von Turbo besagt: „Präfix-KV-Caching verwendet den Text- und Referenzbild-Kontext über die Denoising-Schritte hinweg erneut.“ Das ist übernommene Maschinerie, nichts Neues für den beschleunigten Checkpoint: Die Ankündigung von Qwen-Image-2.1 führt die Wiederverwendung des Präfix-KV-Caches als eine der vier wichtigsten Verbesserungen des Basismodells auf, zusammen mit Mixed-Granularity-Attention, und die Day-Zero-Serving-Integrationen für das Basismodell — die vLLM-Omni- und SGLang-Einträge in der News-Liste des Projekts — nennen Präfix-KV-Caching explizit unter den Funktionen, die sie unterstützen. In einer Vierzig-Schritt-Schleife ist diese Wiederverwendung eine Optimierung. In einer Acht-Schritt-Schleife fällt sie proportional stärker ins Gewicht, weil jeder zwischengespeicherte Schritt einen größeren Anteil der Gesamtarbeit ausmacht.

Eine Destillationstechnik wird auf der Karte nicht genannt. Die Karte des Basismodells Qwen-Image-2.1 und die README des Projekts beschreiben Architektur und Fähigkeiten; die Turbo-Karte beschreibt die Mechanik. Wenn Sie versuchen, abzuwägen, was acht Schritte in puncto Qualität kosten, gibt Ihnen das Repository keine Methode, auf die Sie sich stützen können – nur einen Zeitplan und eine Reihe von Showcase-Bildern.

Die Schrittzahl ist kein Benchmark

Das ist der Teil des Vergleichs, bei dem die ehrliche Antwort lautet, dass es keinen Vergleich gibt, und es lohnt sich, unverblümt zu sagen, warum.

• Der Turbo-Checkpoint hat keinen veröffentlichten Score. Seine Karte trägt keinerlei Evaluierungszahl. Es gibt kein Qwen-Image-Bench-Ergebnis für Turbo, keinen direkten Vergleich mit dem Basis-Checkpoint, keine Ablation über Schrittanzahlen und keine Tabelle, die zeigt, wo die Qualität abflacht.

• Die Punktzahl des Basis-Checkpoints wird vom Anbieter gemeldet. Die einzige herausgestellte Kennzahl der Qwen-Image-2.1-Reihe ist das Qwen-Image-Bench-Ergebnis des Basismodells selbst, das der Anbieter für den Basis-Checkpoint meldet. Es ist keine Messung des Turbo-Checkpoints und sollte nicht auf ihn übertragen werden – die Beschleunigung ist genau das, was eine solche Zahl voraussichtlich verändern würde, und der Anbieter hat nicht gesagt, um wie viel.

• Keine der beiden Model Cards enthält Angaben zu Zeit oder Speicher. Es gibt weder Latenz- noch Durchsatzwerte noch Angaben zum Speicherbedarf für einen der beiden Checkpoints, und keine der Model Cards nennt die Hardware, auf der ihre Beispiele liefen. Die Model Card des Basismodells dokumentiert zumindest einen Abschnitt zur Speicheroptimierung; die Turbo-Model-Card dokumentiert Installation, Generierung, Bearbeitung, Sampling und Seitenverhältnisse – und endet dort.

Die Argumentation für Turbo gegenüber dem Basis-Checkpoint ist derzeit also eine Frage der Designabsicht, nicht der gemessenen Ergebnisse. Acht Schritte bei derselben Architektur und derselben Auflösungsstufe von 2048 sollten deutlich weniger pro Bild kosten. „Deutlich“ leistet in diesem Satz echte Arbeit, und der einzige Weg, es durch eine Zahl zu ersetzen, besteht darin, beide Checkpoints mit Ihrer eigenen Arbeitslast laufen zu lassen, was auch der einzige Weg ist, herauszufinden, was die verkürzte Trajektorie bei den konkreten Bildern bewirkt, die Ihnen wichtig sind.

Sonst hat sich nichts bewegt, auch die Lizenz nicht.

Zwei Dinge, bei denen ein Leser vernünftigerweise erwarten würde, dass sie sich geändert hätten, die sich aber nicht geändert haben.

Das erste ist das Ökosystem. Als Qwen-Image-2.1 am 20. September 2026 veröffentlicht wurde, verzeichnete die Nachrichtenliste des Projekts am selben Tag fünf separate Day-Zero-Integrationen: Diffusers-Unterstützung über PR #14804, native ComfyUI-Unterstützung mit veröffentlichten Workflow-Vorlagen für Text-zu-Bild und Bearbeitung, vLLM-Omni-Unterstützung mit schrittweiser Ausführung und CUDA-Graph-Decode und FP8-Quantisierung und Tensor-Parallelität, SGLang-Unterstützung mit Cache-DiT und Komponenten-Offload sowie Beschleunigung durch das LightX2V-Projekt. Der Eintrag vom 9. Oktober 2026, der Qwen-Image-2.1-Turbo behandelt, verzeichnet den Checkpoint selbst und einen Hinweis darauf, dass die Pro- und Turbo-APIs auf Alibaba Cloud Model Studio live sind. Es gibt keine Day-Zero-Framework-Liste für Turbo, und jeder Framework-Eintrag in der Nachrichtenliste bezieht sich weiterhin auf das Basismodell. Der Turbo-Checkpoint wird über eine Pipeline-Klasse geladen, die bereits existierte; die Unterstützung für seinen gespeicherten Zeitplan ist der eine neue Baustein, und sie kommt über den Diffusers-Quellcode statt über ein getaggtes Release.

Das Zweite ist die Lizenz. Turbo trägt die Qwen Research License Agreement, genau wie das Basismodell. Die Beschleunigung brachte keine kommerzielle Ausnahmeregelung, keine separate Stufe und keine Lockerung der Bedingungen mit sich — die nichtkommerzielle Beschränkung gilt für das Fine-Tuning ebenso wie für das Basismodell. Die Metadaten des Repositorys selbst und die Lizenzdatei neben den Gewichten sind der Beleg; der Lizenzabschnitt der Karte ist ein Satz, der auf dieselbe Vereinbarung verweist. Wenn der Grund, warum acht Schritte für Sie wichtig sind, darin besteht, dass sie das Modell günstig genug machen, um es in ein Produkt einzubauen, steht die Lizenz dem klar im Weg, und es ist der Anbieter – nicht dieses Repository –, der dafür geradestehen muss.

Gehostete Endpunkte und wo OrcaRouter hineinpasst

OrcaRouter routet weder Qwen-Image-2.1-Turbo noch Qwen-Image-2.1. Beide fehlen in unserem Katalog, und nichts hier ist ein Angebot, eines von beiden bereitzustellen. Wenn Sie sie möchten, führen Ihre Wege über die eigenen gehosteten APIs des Anbieters, mehrere Drittanbieter-Plattformen oder die Gewichte mit einem ausreichend aktuellen Diffusers-Build, um den gespeicherten Sampling-Zeitplan des Turbo-Checkpoints zu verarbeiten.

Wo OrcaRouter für diesen speziellen Vergleich relevant ist, ist der Wechsel, den man vollzieht, wenn das Selbsthosting eines Checkpoints nicht mehr die richtige Antwort ist. Der Wechsel von einem Open-Weights-Modell, das man selbst betreibt, zu einem gehosteten Bild-Endpunkt ist nicht nur ein Modellwechsel – er ist ein Wechsel der Fehlermodi. Ein lokaler Prozess schlägt auf Arten fehl, die man sehen kann; ein gehosteter Endpunkt schlägt auf Arten fehl, die davon abhängen, welcher Anbieter geantwortet hat, und davon, was passiert, wenn einer von ihnen mitten in einer Anfrage schlechter wird. OrcaRouter stellt 200+ Modelle hinter einen einzigen OpenAI-kompatiblen Endpunkt und reicht die Listenpreise der Anbieter ohne Aufschlag durch, sodass eine Preissenkung eines Anbieters bei uns noch am selben Tag sichtbar wird, statt auf eine Preisanpassungsrunde zu warten. Darüber hinaus ergänzt es automatisches Failover über Anbieter hinweg, eine Routing-DSL, mit der festgelegt werden kann, welche Modelle und Anbieter eine Anfrage verwenden darf, sowie Modellfusion, um mehrere Modelle in einem Aufruf zusammenzuführen. Die Bildmodelle, die wir anbieten, sind die OpenAI GPT-Image-Familie, die Imagen-4-Stufen von Google einschließlich der Fast- und Ultra-Varianten, die Gemini-Bildvorschau-Endpunkte von Google und der xAI Grok Imagine Bild-Endpunkt.

Konkret: Wenn Sie zwischen den beiden Qwen-Checkpoints wählen, ist das eine Self-Hosting-Entscheidung, und die Gründe, einen dem anderen vorzuziehen, sind das Schedule-Verhalten und die Schrittzahl. Wenn Sie tatsächlich ein Bild in der Produktion benötigen, ohne die GPUs zu besitzen, ist das die Entscheidung, bei der wir helfen können, und es ist eine andere Entscheidung.

Die Kurzfassung

• Wählen Sie Qwen-Image-2.1, wenn Sie den Checkpoint möchten, dessen Sampling-Verhalten mit seiner Dokumentation übereinstimmt, wenn Sie die Anzahl der Schritte variieren oder Zeitpläne erkunden möchten, oder wenn Sie das Release möchten, das mit Day-Zero-Support für Diffusers, ComfyUI, vLLM-Omni, SGLang und LightX2V erschienen ist.

• Wähle Qwen-Image-2.1-Turbo, wenn du dieselbe Architektur und dieselben Fähigkeiten mit einer drastisch kürzeren Trajektorie möchtest und bereit bist, acht Schritte als fest zu behandeln und Diffusers aus dem Quellcode zu installieren, um es zu laden.

Checklist card headed 'Identical across both checkpoints' listing the 7B visual generation component, 32 single-stream DiT layers, seven resolution presets, text-to-image and image editing, the QwenImage21Pipeline load path, and the non-commercial Qwen Research Licence, with a chip reading 'The only differences are the sampling schedule and the step count'

• In beiden Fällen gilt dieselbe Lizenz, und es gibt keine veröffentlichte Qualitätskennzahl für den beschleunigten Checkpoint, mit der man ihn gegen die Basis vergleichen könnte. Die Reduzierung der Schritte ist real und dokumentiert. Wie viel Bildqualität sie kostet, ist nirgends dokumentiert, und kein noch so genaues Lesen der beiden Karten wird Ihnen das verraten – diese Antwort existiert nur auf Ihrer eigenen Hardware, mit Ihren eigenen Prompts.