
MAI-Image-2.5-Pro gegen Qwen-Image 3.0: Vierfacher Preis für eine andere Art von Text
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
Stellt man MAI-Image-2.5-Pro und Qwen-Image 3.0 nebeneinander, fällt einem zuerst der Preis auf: ungefähr 108,50 $ pro 1.000 Bilder für Microsofts Premium-Stufe gegenüber ungefähr 25–30 $ pro 1.000 für Alibabas Qwen-Image 3.0 – Alibabas eigener angegebener Preis liegt bei etwa 25 $, während das Ranking von Artificial Analysis 30 $ verzeichnet. Bei jeder der beiden Zahlen ist es mehr als das Dreifache. Was dieser Aufpreis tatsächlich erkauft, ist eine andere Art von Textarbeit. Qwen-Image 3.0, am 21. Juli 2026 von Alibabas Qwen-Team veröffentlicht und am 4. August für eine internationale API geöffnet, ist als Volumen-Textrenderer positioniert – bis zu ~10 px in zwölf Sprachen lesbar, mit einem Prompt-Fenster von 4.500 Token für detaillierte Vorgaben. MAI-Image-2.5-Pro, seit dem 23. Juli in der Public Preview auf Microsoft Foundry, ist der am besten bewertete Editor in einem unabhängigen Ranking, mit einer vom Anbieter angegebenen Textwiedergabe-Genauigkeit, aber einer harten Ausgabeobergrenze von ~1 Megapixel. Beide sind API-Bildmodelle, deren Schlagzeilen sich um Text drehen; sie konkurrieren über den Preis pro Auftrag, nicht über einen einzelnen Qualitätswert.
Zwei Geschichten, keine davon vollständig verifiziert
Der Textkampf ist der Grund, warum beide Modelle existieren, und genau dort ist die Beweislage auch am dünnsten — jede Zahl in diesem Abschnitt stammt vom Anbieter und keine wurde unabhängig reproduziert.
• Qwen-Image 3.0 — Alibabas Veröffentlichungsmaterialien behaupten eine gut lesbare Darstellung bis hinunter zu etwa 10px, native Unterstützung für 12 Sprachen mit 20+ Schriftarten und 100+ künstlerischen Stilen, mathematischer Notation, tiefgestellten und hochgestellten Zeichen sowie mehrzeiligen Formeln, plus Vertrautheit mit gängigen Web-, Spiel- und Software-Oberflächen. Das Promptfenster bietet Platz für bis zu 4.500 Token an Eingabe — ein 4,5-facher Sprung gegenüber der vorherigen Generation — der es ermöglicht, dichte Aufgabenstellungen wie Zeitungsfrontseiten oder ein Neun-Felder-Wissensraster in einem einzigen Aufruf zu verarbeiten.
• MAI-Image-2.5-Pro — Microsoft behauptet 96.8% Textdarstellungsgenauigkeit in Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, eine um 27% bessere Prompt-Befolgung als GPT-Image-1.5 bei internen Auswertungen, und 94% Charakterkonsistenz über mehrere Bilder. Die Eingabespezifikation ist auf dem Papier großzügiger — bis zu 32.000 Text-Eingabe-Token bei einem 131k-Kontextfenster — und die Ausgabe ist auf 1.048.576 Pixel begrenzt, ein 1024×1024-Äquivalent.
Beide Behauptungen sind zum Zeitpunkt des Schreibens nicht reproduziert. Der Unterschied liegt in der Form der Behauptungen: Die von {{1}}Qwen{{/1}} betrifft Umfang und Lesbarkeit über Schriften hinweg, die von {{2}}Microsoft{{/2}} betrifft Genauigkeit und Konsistenz über eine definierte Gruppe von fünf Sprachen. Keiner der Anbieter hat einen Benchmark veröffentlicht, den ein anderes Labor ausführen und überprüfen könnte.
Beim Bearbeiten lebt das Premium.
Was die beiden voneinander unterscheidet, ist die Bearbeitung, und das ist die einzige Achse mit unabhängigen Belegen. MAI-Image-2.5-Pro liegt auf Platz 1 der Artificial Analysis Image Editing Arena mit einem Elo von 1.272 (~6.100 Blindabstimmungen), vor Reve 2.1, MAI-Image-2.5 und GPT Image 2. Auf derselben Rangliste liegt das neuere Qwen-Image-3.0-Pro bei 1.249 – ein wettbewerbsfähiger Wert, 23 Elo zurück, und bemerkenswert für ein Modell, das erst in diesem Monat die internationale API erreicht hat.
Abgesehen vom Basismodell ist Alibabas Bearbeitungsportfolio eher eine Reihe spezialisierter Tricks als eine einzelne Krone: Restaurierung antiker Gemälde, Panoramagenerierung, Skizze-zu-PPT und Multi-Shot-Storyboarding. Microsofts Ansatz ist eine schmalere, tiefere Wette — präzise, chirurgische Bearbeitungen, die den Rest des Bildes konsistent halten (Objektersetzung, Layout-Änderungen, Textaktualisierungen im Bild, Beseitigung von Unschärfe) — also die Art von Bearbeitung, bei der ältere Modelle die gesamte Szene neu generieren und das Motiv verlieren. Für einen Workflow, der da heißt „nimm dieses vorhandene Asset, ändere eine Sache, bring es raus“, ist die unabhängige #1-Platzierung der Pro-Stufe das stärkere Signal; für ein Sammelsurium kreativer Bearbeitungsformate ist Qwens Liste breiter.

Der Spec-Kontrast
• Preis — ~$108.50 pro 1k Bildern (1024×1024, AA-Konvertierung) gegenüber ~$25–30 pro 1k Bildern (Alibaba-Angebot vs. AA-Listentarif)br /> • Veröffentlichung — 23. Juli 2026 (öffentliche Vorschau, Foundry) gegenüber 21. Juli 2026, internationale API 4 Augbr /> • Texteingabe — 32,000 Tokens, 131k Kontext gegenüber einem Prompt-Fenster von 4,500 Tokensbr /> • Ausgabeobergrenze — ~1,048,576 Pixel (~1K) gegenüber bis zu 2048×2048br /> • Bilder pro Aufruf — eine einzelne Ausgabe pro Anfrage gegenüber bis zu sechs Bildern pro Aufrufbr /> • Bearbeitungsrang — Nr. 1, Elo 1,272 (AA) gegenüber 1,249 für Qwen-Image-3.0-Pro auf derselben Ranglistebr /> • Herkunft — Microsofts Behauptung „keine Destillation von Drittanbietermodellen“ gegenüber AIGC-Herkunftskennzeichnung auf Ausgabenbr /> • Gewichte — geschlossen, nur API gegenüber geschlossen, nur API
Die Obergrenze für die Ausgabe und die Anzahl pro Aufruf sind wichtiger, als sie aussehen. Qwen-Image 3.0 kann ein 2048×2048-Bild rendern und bis zu sechs Bilder pro Aufruf zurückgeben, was ein Merkmal der Batch-Ökonomie ist; die Pro-Stufe liegt bei knapp 1K und gibt eine einzelne Ausgabe pro Anfrage zurück. Wenn Ihre Aufgabenstellung lautet: „Gib mir eine Auswahl von sechs Produktaufnahmen“, ist das Alibaba-Modell dafür gebaut und das Microsoft-Modell nicht.

Wenn sich die Prämie selbst bezahlt macht.
Die Entscheidungsregel bezieht sich darauf, wofür die Bilder bestimmt sind, nicht darauf, welches Modell „besser“ ist.
• Zahlen Sie den Aufpreis für MAI-Image-2.5-Pro, wenn das Ergebnis ein Hero-Asset ist – ein Produktbild, ein Poster, ein Keyframe, ein Bild, das in eine Kampagne geht und nicht fünfzigmal neu generiert wird. Die Platzierung Nr. 1 bei der Bearbeitung und das Versprechen der Charakterkonsistenz sind am wichtigsten, wenn eine Bearbeitung beim ersten Mal richtig sein muss.
• Kaufen Sie Volumenkontingente mit Qwen-Image 3.0, wenn die Ausgabe wegwerfbar ist oder in hoher Stückzahl anfällt — lokalisierte Anzeigenvarianten, Platzhaltergrafiken, Skizze-zu-PPT-Foliensätze, Storyboard-Frames, alles, wobei Sie neu generieren statt verfeinern. Bei 25–30 $ pro 1k kostet eine fehlgeschlagene Generierung einen Rundungsfehler; bei 108,50 $ pro 1k ist das nicht der Fall.
Es gibt einen Mittelweg, der eine Erwähnung verdient: für dichte, mehrsprachige Text-im-Bild-Arbeiten – ein Landingpage-Mock-up mit japanischem und spanischem Text, eine Infografik mit Formeln – ist Qwens 10-Pixel-Lesbarkeit und zwölf Sprachen auf dem Papier die bessere Wahl, und das zu einem Viertel des Preises. Das Gegenargument des Microsoft-Modells ist seine behauptete 96,8-prozentige Genauigkeit über fünf Sprachen, aber diese Behauptung ist unverifiziert, und ein Käufer, der zwischen zwei unverifizierten Textbehauptungen wählt, sollte wahrscheinlich den Preis gewichten.

Die Routing-Ebene, wenn sie angewendet wird.
Keines der beiden Modelle ist bislang über OrcaRouter erreichbar — Qwen-Image 3.0 läuft auf Alibabas eigener API (Alibaba Cloud Bailian und der Qwen-Plattform) sowie mehreren Drittanbieter-Plattformen, und MAI-Image-2.5-Pro ist bei Microsoft Foundry — ein ehrlicher Vergleich sagt also klar, dass heute keines von beiden auf unserer Seite steht. Sobald eines der beiden über einen per API erreichbaren Hosting-Anbieter verfügbar wird, greifen die Durchreich-Preise: 0% Aufschlag auf den Listenpreis des Anbieters, Sie zahlen also die Preisliste des Anbieters, und ein Einführungsrabatt oder eine Preissenkung schlägt noch am selben Tag, an dem er angekündigt wird, auf Ihrer Rechnung zu Buche. Das Failover-Argument ist die andere Hälfte: Qwen-Image 3.0 ist eine erst wenige Wochen alte internationale API, also genau die Art von Modell, zu der Sie einen Teil des Traffics routen, während ein bewährtes Fallback die Randfälle abfängt — genau das Szenario, für das eine Routing-Schicht gebaut ist.
Das Urteil
Qwen-Image 3.0 und MAI-Image-2.5-Pro sind nicht dasselbe Produkt zu unterschiedlichen Preisen; es sind verschiedene Produkte, die zufällig unterschiedlich bepreist sind. Das Modell von Microsoft gewinnt die Krone bei der Bearbeitung, bietet ein größeres Kontextfenster und erhebt einen unbewiesenen Genauigkeitsanspruch über fünf Sprachen – für Hero-Assets und chirurgische Bearbeitungen ist der Aufpreis vertretbar. Das Modell von Alibaba stellt mehr Schriften lesbar dar, akzeptiert dichtere Briefings pro Generierung zu eigenen Bedingungen, gibt größere Bilder aus, und zwar in Sechserchargen, und kostet ein Viertel davon – für Volumen und mehrsprachige Text-im-Bild-Arbeit ist es die wirtschaftlich rationale Wahl. Kaufen Sie das Premium, wo das Bild das Produkt ist; kaufen Sie das Volumen, wo das Bild Inventar ist.
