Hero-Karte für das Duell zwischen MAI-Image-2.5-Pro zu etwa 108,50 $ pro 1k Bildern und Qwen-Image 3.0 zu etwa 25 $ pro 1k Bildern, zwei API-Bildmodelle, die beide bei der Textdarstellung führend sind.
Guides & Insights

MAI-Image-2.5-Pro gegen Qwen-Image 3.0: Vierfacher Preis für eine andere Art von Text

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellt man MAI-Image-2.5-Pro und Qwen-Image 3.0 nebeneinander, fällt einem zuerst der Preis auf: ungefähr 108,50 $ pro 1.000 Bilder für Microsofts Premium-Stufe gegenüber ungefähr 25–30 $ pro 1.000 für Alibabas Qwen-Image 3.0 – Alibabas eigener angegebener Preis liegt bei etwa 25 $, während das Ranking von Artificial Analysis 30 $ verzeichnet. Bei jeder der beiden Zahlen ist es mehr als das Dreifache. Was dieser Aufpreis tatsächlich erkauft, ist eine andere Art von Textarbeit. Qwen-Image 3.0, am 21. Juli 2026 von Alibabas Qwen-Team veröffentlicht und am 4. August für eine internationale API geöffnet, ist als Volumen-Textrenderer positioniert – bis zu ~10 px in zwölf Sprachen lesbar, mit einem Prompt-Fenster von 4.500 Token für detaillierte Vorgaben. MAI-Image-2.5-Pro, seit dem 23. Juli in der Public Preview auf Microsoft Foundry, ist der am besten bewertete Editor in einem unabhängigen Ranking, mit einer vom Anbieter angegebenen Textwiedergabe-Genauigkeit, aber einer harten Ausgabeobergrenze von ~1 Megapixel. Beide sind API-Bildmodelle, deren Schlagzeilen sich um Text drehen; sie konkurrieren über den Preis pro Auftrag, nicht über einen einzelnen Qualitätswert.

Zwei Geschichten, keine davon vollständig verifiziert

Der Textkampf ist der Grund, warum beide Modelle existieren, und genau dort ist die Beweislage auch am dünnsten — jede Zahl in diesem Abschnitt stammt vom Anbieter und keine wurde unabhängig reproduziert.

Qwen-Image 3.0 — Alibabas Veröffentlichungsmaterialien behaupten eine gut lesbare Darstellung bis hinunter zu etwa 10px, native Unterstützung für 12 Sprachen mit 20+ Schriftarten und 100+ künstlerischen Stilen, mathematischer Notation, tiefgestellten und hochgestellten Zeichen sowie mehrzeiligen Formeln, plus Vertrautheit mit gängigen Web-, Spiel- und Software-Oberflächen. Das Promptfenster bietet Platz für bis zu 4.500 Token an Eingabe — ein 4,5-facher Sprung gegenüber der vorherigen Generation — der es ermöglicht, dichte Aufgabenstellungen wie Zeitungsfrontseiten oder ein Neun-Felder-Wissensraster in einem einzigen Aufruf zu verarbeiten.

MAI-Image-2.5-Pro — Microsoft behauptet 96.8% Textdarstellungsgenauigkeit in Chinesisch, Englisch, Japanisch, Koreanisch und Spanisch, eine um 27% bessere Prompt-Befolgung als GPT-Image-1.5 bei internen Auswertungen, und 94% Charakterkonsistenz über mehrere Bilder. Die Eingabespezifikation ist auf dem Papier großzügiger — bis zu 32.000 Text-Eingabe-Token bei einem 131k-Kontextfenster — und die Ausgabe ist auf 1.048.576 Pixel begrenzt, ein 1024×1024-Äquivalent.

Beide Behauptungen sind zum Zeitpunkt des Schreibens nicht reproduziert. Der Unterschied liegt in der Form der Behauptungen: Die von {{1}}Q​wen{{/1}} betrifft Umfang und Lesbarkeit über Schriften hinweg, die von {{2}}Microsoft{{/2}} betrifft Genauigkeit und Konsistenz über eine definierte Gruppe von fünf Sprachen. Keiner der Anbieter hat einen Benchmark veröffentlicht, den ein anderes Labor ausführen und überprüfen könnte.

Beim Bearbeiten lebt das Premium.

Was die beiden voneinander unterscheidet, ist die Bearbeitung, und das ist die einzige Achse mit unabhängigen Belegen. MAI-Image-2.5-Pro liegt auf Platz 1 der Artificial Analysis Image Editing Arena mit einem Elo von 1.272 (~6.100 Blindabstimmungen), vor Reve 2.1, MAI-Image-2.5 und GPT Image 2. Auf derselben Rangliste liegt das neuere Qwen-Image-3.0-Pro bei 1.249 – ein wettbewerbsfähiger Wert, 23 Elo zurück, und bemerkenswert für ein Modell, das erst in diesem Monat die internationale API erreicht hat.

Abgesehen vom Basismodell ist Alibabas Bearbeitungsportfolio eher eine Reihe spezialisierter Tricks als eine einzelne Krone: Restaurierung antiker Gemälde, Panoramagenerierung, Skizze-zu-PPT und Multi-Shot-Storyboarding. Microsofts Ansatz ist eine schmalere, tiefere Wette — präzise, chirurgische Bearbeitungen, die den Rest des Bildes konsistent halten (Objektersetzung, Layout-Änderungen, Textaktualisierungen im Bild, Beseitigung von Unschärfe) — also die Art von Bearbeitung, bei der ältere Modelle die gesamte Szene neu generieren und das Motiv verlieren. Für einen Workflow, der da heißt „nimm dieses vorhandene Asset, ändere eine Sache, bring es raus“, ist die unabhängige #1-Platzierung der Pro-Stufe das stärkere Signal; für ein Sammelsurium kreativer Bearbeitungsformate ist Q​wens Liste breiter.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

Der Spec-Kontrast

• Preis — ~$108.50 pro 1k Bildern (1024×1024, AA-Konvertierung) gegenüber ~$25–30 pro 1k Bildern (Alibaba-Angebot vs. AA-Listentarif)br /> • Veröffentlichung — 23. Juli 2026 (öffentliche Vorschau, Foundry) gegenüber 21. Juli 2026, internationale API 4 Augbr /> • Texteingabe — 32,000 Tokens, 131k Kontext gegenüber einem Prompt-Fenster von 4,500 Tokensbr /> • Ausgabeobergrenze — ~1,048,576 Pixel (~1K) gegenüber bis zu 2048×2048br /> • Bilder pro Aufruf — eine einzelne Ausgabe pro Anfrage gegenüber bis zu sechs Bildern pro Aufrufbr /> • Bearbeitungsrang — Nr. 1, Elo 1,272 (AA) gegenüber 1,249 für Qwen-Image-3.0-Pro auf derselben Ranglistebr /> • Herkunft — Microsofts Behauptung „keine Destillation von Drittanbietermodellen“ gegenüber AIGC-Herkunftskennzeichnung auf Ausgabenbr /> • Gewichte — geschlossen, nur API gegenüber geschlossen, nur API

Die Obergrenze für die Ausgabe und die Anzahl pro Aufruf sind wichtiger, als sie aussehen. Qwen-Image 3.0 kann ein 2048×2048-Bild rendern und bis zu sechs Bilder pro Aufruf zurückgeben, was ein Merkmal der Batch-Ökonomie ist; die Pro-Stufe liegt bei knapp 1K und gibt eine einzelne Ausgabe pro Anfrage zurück. Wenn Ihre Aufgabenstellung lautet: „Gib mir eine Auswahl von sechs Produktaufnahmen“, ist das Alibaba-Modell dafür gebaut und das Microsoft-Modell nicht.

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

Wenn sich die Prämie selbst bezahlt macht.

Die Entscheidungsregel bezieht sich darauf, wofür die Bilder bestimmt sind, nicht darauf, welches Modell „besser“ ist.

Zahlen Sie den Aufpreis für MAI-Image-2.5-Pro, wenn das Ergebnis ein Hero-Asset ist – ein Produktbild, ein Poster, ein Keyframe, ein Bild, das in eine Kampagne geht und nicht fünfzigmal neu generiert wird. Die Platzierung Nr. 1 bei der Bearbeitung und das Versprechen der Charakterkonsistenz sind am wichtigsten, wenn eine Bearbeitung beim ersten Mal richtig sein muss.

Kaufen Sie Volumenkontingente mit Qwen-Image 3.0, wenn die Ausgabe wegwerfbar ist oder in hoher Stückzahl anfällt — lokalisierte Anzeigenvarianten, Platzhaltergrafiken, Skizze-zu-PPT-Foliensätze, Storyboard-Frames, alles, wobei Sie neu generieren statt verfeinern. Bei 25–30 $ pro 1k kostet eine fehlgeschlagene Generierung einen Rundungsfehler; bei 108,50 $ pro 1k ist das nicht der Fall.

Es gibt einen Mittelweg, der eine Erwähnung verdient: für dichte, mehrsprachige Text-im-Bild-Arbeiten – ein Landingpage-Mock-up mit japanischem und spanischem Text, eine Infografik mit Formeln – ist Q​wens 10-Pixel-Lesbarkeit und zwölf Sprachen auf dem Papier die bessere Wahl, und das zu einem Viertel des Preises. Das Gegenargument des Microsoft-Modells ist seine behauptete 96,8-prozentige Genauigkeit über fünf Sprachen, aber diese Behauptung ist unverifiziert, und ein Käufer, der zwischen zwei unverifizierten Textbehauptungen wählt, sollte wahrscheinlich den Preis gewichten.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

Die Routing-Ebene, wenn sie angewendet wird.

Keines der beiden Modelle ist bislang über OrcaRouter erreichbar — Qwen-Image 3.0 läuft auf Alibabas eigener API (Alibaba Cloud Bailian und der Qwen-Plattform) sowie mehreren Drittanbieter-Plattformen, und MAI-Image-2.5-Pro ist bei Microsoft Foundry — ein ehrlicher Vergleich sagt also klar, dass heute keines von beiden auf unserer Seite steht. Sobald eines der beiden über einen per API erreichbaren Hosting-Anbieter verfügbar wird, greifen die Durchreich-Preise: 0% Aufschlag auf den Listenpreis des Anbieters, Sie zahlen also die Preisliste des Anbieters, und ein Einführungsrabatt oder eine Preissenkung schlägt noch am selben Tag, an dem er angekündigt wird, auf Ihrer Rechnung zu Buche. Das Failover-Argument ist die andere Hälfte: Qwen-Image 3.0 ist eine erst wenige Wochen alte internationale API, also genau die Art von Modell, zu der Sie einen Teil des Traffics routen, während ein bewährtes Fallback die Randfälle abfängt — genau das Szenario, für das eine Routing-Schicht gebaut ist.

Das Urteil

Qwen-Image 3.0 und MAI-Image-2.5-Pro sind nicht dasselbe Produkt zu unterschiedlichen Preisen; es sind verschiedene Produkte, die zufällig unterschiedlich bepreist sind. Das Modell von Microsoft gewinnt die Krone bei der Bearbeitung, bietet ein größeres Kontextfenster und erhebt einen unbewiesenen Genauigkeitsanspruch über fünf Sprachen – für Hero-Assets und chirurgische Bearbeitungen ist der Aufpreis vertretbar. Das Modell von Alibaba stellt mehr Schriften lesbar dar, akzeptiert dichtere Briefings pro Generierung zu eigenen Bedingungen, gibt größere Bilder aus, und zwar in Sechserchargen, und kostet ein Viertel davon – für Volumen und mehrsprachige Text-im-Bild-Arbeit ist es die wirtschaftlich rationale Wahl. Kaufen Sie das Premium, wo das Bild das Produkt ist; kaufen Sie das Volumen, wo das Bild Inventar ist.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube