
Qwen-Image-3.0 ist jetzt allgemein verfügbar: Alibabas praxisnahes Bildmodell kostet ¥0,18 pro Bild.
Am 5. August 2026, Qwen-Image-3.0 war kein reines Einladungs-Preview mehr und wurde für alle Benutzer der Qwen-KI-Plattform von Alibaba geöffnet. Das gesamte Produkt ist wie ein Versorgungsunternehmen bepreist und nicht wie ein Premium-Kunstservice — Text-zu-Bild ab etwa 0,18 ¥ pro Bild auf der Verbraucherseite, mit einer Pro-Stufe darüber — und Alibabas eigene Darstellung ist, dass dies ein Bildmodell ist, das eine Arbeit erledigen soll, nicht einen Schönheitswettbewerb gewinnen soll. Eine Woche nach der vollständigen allgemeinen Verfügbarkeit ist diese Darstellung ernst zu nehmen: Die beiden Dinge, mit denen Qwen-Image-3.0 punktet, sehr lange Prompts und sehr gut lesbarer Kleintext, sind genau die beiden Dinge, bei denen die meisten Bildmodelle leise scheitern.
Qwen-Image-3.0 wird in zwei Ausgaben angeboten – Qwen-Image-3.0-Pro und Qwen-Image-3.0-Standard – die beide über dieselbe gehostete API bereitgestellt werden. Die Einführung erfolgte gestaffelt: angekündigt am 21. Juli 2026 mit API-Zugang nur auf Einladung über Alibaba Cloud Bailian und die Qwen-AI-Plattform, dann am 5. August vollständig geöffnet. Internationale Entwickler erreichen es über Qwen Cloud, wo die Startberichterstattung Pro mit 0,04 $ pro Bild und Standard mit 0,03 $ pro Bild auflistet. Die Preise für inländische Verbraucher beginnen bei etwa 0,18 ¥ pro Bild. Dies sind die vom Anbieter gemeldeten Startzahlen, und dieser Artikel behandelt sie als solche – es sind die Zahlen, die Alibaba veröffentlicht hat, keine unabhängige Prüfung.
Der Start, in drei Zahlen
Wenn Sie eines aus der Ankündigung lesen, dann sind es diese drei:
• 4.500-Token-Prompts. Qwen-Image-3.0 akzeptiert etwa die 4,5-fache Prompt-Länge seines Vorgängers. Das ist die Änderung, die alles andere ermöglicht: Ein Prompt kann jetzt eine ganze Zeitungsseite, ein Storyboard, eine Neun-Felder-Wissensinfografik oder eine Prüfungsarbeit spezifizieren und sie in einem Durchgang ausgeben, anstatt sie in einem Editor zusammenzusetzen.
• ~10-Pixel-Textdarstellung. Das Modell gibt kleinen, lesbaren Text bis zu einer Schrifthöhe von etwa zehn Pixeln wieder — der Unterschied zwischen einem Bild, das so aussieht, als hätte es Text, und einem, das tatsächlich korrekt lesbar ist.
• 12 Sprachen, 20+ Schriftarten. Mehrsprachige Ausgabe ist nativ und kein nachträglicher Zusatz: Chinesisch, Englisch, Koreanisch und mehr, dargestellt in der im Prompt angeforderten Schrift, ohne die Kästchen für fehlende Glyphen, die die meisten im Westen trainierten Modelle bei CJK plagen.
Fügt man die weniger zitierfähigen, aber ebenso wichtigen Bausteine hinzu — Bild-zu-Bild-Transformation und Bildbearbeitung im selben Modell, Wissensdiagramme, die Formeln, Geometrie und Ableitungsschritte kombinieren, sowie plausible Mock-ups von Web-, Spiel- und Live-Streaming-Oberflächen —, wird das Profil deutlich. Alibaba zielt auf den produktiven Einsatz ab: Massenprüfungserstellung im Bildungswesen, grenzüberschreitende E-Commerce-Plakate, Verlagslayout, UI-Prototyping. Die chinesischen Launch-Materialien fassen die Positionierung in einem Schriftzeichen zusammen: 实, „praktisch".

Was ist bisher unabhängig verifiziert

Hier ist der Teil, der für alle wichtig ist, die von einer glanzvollen Markteinführung verbrannt worden sind. Qwen-Image-3.0 ist ein geschlossenes Modell: keine Gewichte, keine Lizenz, kein technischer Bericht, keine offizielle Benchmark-Veröffentlichung. Das ist eine bewusste Kehrtwendung — Qwen-Image 1.0 und 2.0 wurden als offene Apache-2.0-Gewichte auf Hugging Face veröffentlicht, mit technischen Berichten am selben Tag. 3.0 bricht damit, und Alibaba hat weder eine Modellkarte noch eine Parameteranzahl veröffentlicht. Frühe Berichte zur Markteinführung beschreiben es als etwa 20B Parameter auf einer MMDiT-Architektur, aber behandelt das als gemeldet, nicht als bestätigt: Da es keinen Bericht zu prüfen gibt, kann niemand außerhalb von Alibaba es verifizieren.
Das bedeutet, dass jede oben genannte Hauptfunktion — der 4.500-Token-Eingang, der 10px-Text, die 12 Sprachen — eine Anbieterangabe ist. Der stärkste unabhängige Datenpunkt bisher ist ein chinesischer Praxisvergleich, der im Launch-Zeitfenster veröffentlicht wurde und Qwen-Image-3.0-Pro gegen elf andere Konfigurationen antreten ließ. Die Ergebnisse waren zweischneidig: Qwen-Image-3.0-Pro war hervorragend bei der Generierung von UI/Dashboards, wissenschaftlichen Diagrammen und einheitlichen Designsystemen, mit der höchsten Gesamtqualität in diesen Kategorien — aber es war auch im Durchschnitt das langsamste Modell, und bei kleinen Schriftgrößen kam es in einigen Fällen weiterhin zu verstümmelten Zeichen. Bei strenger Textgenauigkeit bevorzugte derselbe Test GPT-Image-2 Medium, Gemini 3 Pro und Seedream 5.0 Lite. Das ist ein nützliches, ehrliches Bild: stark bei der Struktur, aber noch nicht fehlerfrei bei der winzigen Schrift, die es bewirbt.
Was das Leaderboard betrifft, behauptet Alibabas Startberichterstattung, dass Qwen-Image-3.0-Pro auf dem Text-zu-Bild-Leaderboard der Arena Platz 1 unter den chinesischen Modellen und Platz 2 unter den Mainstream-Modellen erreicht hat, hinter der Ope{{1}}nAI's G{{/1}}PT-Image-Serie. Eine unabhängige Tracking-Website (AITNT, 5. August) zeigt das Pro-Modell an der Spitze von Alibabas eigenen Modellen, und zwar sowohl in der Kategorie Art Creation (1.256 Elo, globaler Rangbereich 2–11) als auch in der Kategorie Photorealistic (1.258 Elo, global 4–13). Beim wöchentlichen Arena-Ranking vom 10. August lag das Pro-Modell insgesamt auf Platz 7 in der Bildgenerierung – weiterhin Spitzenklasse, und es bleibt abzuwarten, ob es sich hält, wenn der Ansturm der Startwoche nachlässt.

Zwei Editionen, eine Preisgeschichte.
Qwen-Image-3.0-Pro und Qwen-Image-3.0-Standard gehören zur gleichen Modellfamilie und werden in zwei Preisstufen angeboten. Auf Qwen Cloud liegen die veröffentlichten Preise pro Bild bei 0,04 $ für Pro und 0,03 $ für Standard; der Preis für inländische Verbraucher beginnt bei etwa 0,18 ¥. Zum Vergleich: Das liegt unter der mittleren Preisstufe von GPT-Image-2 und in etwa auf dem Niveau, auf dem Googles Nano Banana 2 Lite gelandet ist – ein bewusster Preis, der „günstig genug zum Iterieren“ ist. Ein Vorbehalt aus einem unabhängigen Buildability-Audit ist erwähnenswert: Dasselbe Audit, das Ende Juli zu einem bestimmten Zeitpunkt keinen Qwen-Image-3.0-Eintrag auf der Model-Studio-Preisseite von Alibaba Cloud finden konnte. Diese Lücke schloss sich später im Zuge des GA-Rollouts, aber es erinnert daran, dass die API-Oberfläche eines eine Woche alten Modells sich noch beruhigen kann – überprüfen Sie die aktuelle Preisseite, bevor Sie eine Produktionspipeline darauf festlegen.
Wo Sie es anrufen können
Qwen-Image-3.0 ist ein gehostetes Modell, daher ist der Zugangspfad die eigene API des Anbieters sowie mehrere Drittanbieterplattformen, die es seit der GA aufgenommen haben. Es gibt keine Selbsthosting-Option und keinen Open-Weights-Weg, was wichtig ist, wenn Ihre Anforderung Datenresidenz oder volle Kontrolle über die Pipeline ist. Auf der positiven Seite bedeutet das Hosting, dass keine GPU-Kapazitätsplanung erforderlich ist – Sie zahlen pro Bild und der Anbieter skaliert es.
Dies ist auch der Moment, in dem ein Router seinen Wert unter Beweis stellt. Qwen-Image-3.0 ist brandneu, und seine Preisseite wurde innerhalb einer Woche bereits einmal verschoben; wenn Sie es mit dem Rest der Bildmodell-Landschaft vergleichen, möchten Sie keine maßgeschneiderte Integration pro Anbieter, während Sie sich entscheiden. OrcaRouter stellt über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt bereit – zum Listenpreis des Anbieters und ohne Aufschlag –, sodass eine Preissenkung eines Anbieters, auch bei einem Modell, das erst eine Woche alt ist, bei uns am selben Tag live ist, an dem sie erscheint. Automatisches Failover bedeutet, dass Sie Qwen-Image-3.0-nahe Workloads über die Modelle betreiben können, die wir routen (OpenAIs gpt-image-2, xAIs Grok Imagine, Googles Imagen-4-Familie), ohne dass Ihre Bild-Pipeline ausfällt, während Sie einen Neuling gegen das Feld benchmarken. Genau darum geht es bei dem Vergleich: ein einziger API-Schlüssel, eine einheitliche Aufruf-Struktur und die Zahlen direkt nebeneinander.
Wer sollte jetzt handeln?
Teams, die dichte, textlastige Assets erstellen — Prüfungsarbeiten, Produktblätter, mehrsprachige Poster, Dashboard-Mock-ups, Storyboards — sind die natürlichen Early Adopters, denn genau das sind die Workloads, bei denen ein 4.500-Token-Prompt mit nativer mehrsprachiger Darstellung Stunden an Zusammenfügen und Neuabtippen spart. Teams, deren Maßstab Fotorealismus oder absolute typografische Treue ist, haben heute besser erprobte Optionen, und die unabhängigen Testdaten stützen das Abwarten, bis sich die Probleme bei kleinen Schriftgraden verbessern. Verlassen Sie sich in jedem Fall nicht allein auf die Ankündigungen zum Launch: Das Modell ist geschlossen, und das Einzige, was Ihnen zeigt, ob es einen Platz in Ihrem Stack verdient, ist, eigene echte Prompts dagegen laufen zu lassen — was bei 0,03–0,04 $ pro Bild ein günstiges Experiment ist.
