Hero card voor de vergelijking tussen MAI-Image-2.5-Pro voor ongeveer $108,50 per 1.000 afbeeldingen en Qwen-Image 3.0 voor ongeveer $25 per 1.000 afbeeldingen, twee API-beeldmodellen die beide vooroplopen in tekstweergave.
Guides & Insights

MAI-Image-2.5-Pro vs Qwen-Image 3.0: Vier keer de prijs voor een ander soort tekst

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet MAI-Image-2.5-Pro en Qwen-Image 3.0 naast elkaar en het eerste wat opvalt is de prijs: ongeveer $108,50 per 1.000 afbeeldingen voor Microsofts premiumlaag tegen ongeveer $25–30 per 1.000 voor Alibaba's Qwen-Image 3.0 — Alibaba's eigen opgegeven tarief ligt rond de $25, terwijl de ranglijst van Artificial Analysis $30 vermeldt. Meer dan drie keer zoveel bij elk van beide cijfers. Wat die meerprijs daadwerkelijk oplevert, is een ander soort tekstwerk. Qwen-Image 3.0, uitgebracht door Alibaba's Q​wen-team op 21 juli 2026 en op 4 augustus geopend voor een internationale API, is geprijsd als de bulksgewijze tekstrender — leesbaar tot ~10px in twaalf talen, met een promptsvenster van 4.500 tokens voor gedetailleerde opdrachten. MAI-Image-2.5-Pro, sinds 23 juli in openbare preview op Microsoft Foundry, is de best beoordeelde editor op een onafhankelijke ranglijst, met door de leverancier geclaimde tekstweergavenauwkeurigheid, maar een harde limiet van ~1 megapixel voor uitvoer. Beide zijn API-beeldmodellen waarvan de koppen over tekst gaan; ze concurreren op prijs per taak, niet op één kwaliteitsscore.

Twee tekstverhalen, geen van beide volledig geverifieerd.

De tekststrijd is de reden waarom beide modellen bestaan, en het is ook waar het bewijs het dunst is — elk cijfer in deze sectie is door de leverancier gerapporteerd en geen enkel is onafhankelijk gereproduceerd.

Qwen-Image 3.0 — Alibaba's releasemateriaal claimt leesbare weergave tot ongeveer 10px, native ondersteuning voor 12 talen met 20+ lettertypen en 100+ artistieke stijlen, wiskundige notatie, subscripts, superscripts en multiline formules, plus bekendheid met gangbare web-, game- en software-interfaces. Het promptvenster biedt plaats aan maximaal 4,500 tokens aan invoer — een sprong van 4,5× ten opzichte van de vorige generatie — waardoor het compacte opdrachten zoals voorpagina's van kranten of een kennisraster van negen panelen in één keer kan verwerken.

MAI-Image-2.5-Pro — Microsoft beweert 96,8% tekstweergavenauwkeurigheid in het Chinees, Engels, Japans, Koreaans en Spaans, een 27% betere promptnaleving dan GPT-Image-1.5 bij interne evaluaties, en 94% personageconsistentie over meerdere afbeeldingen. De inputspecificatie is op papier ruimer — tot 32.000 tekstinvoertokens met een contextvenster van 131k — en de output is beperkt tot 1.048.576 pixels, een equivalent van 1024×1024.

Beide beweringen zijn op het moment van schrijven niet gereproduceerd. Het verschil zit in de vorm van de beweringen: die van Q​wen gaat over volume en leesbaarheid in verschillende schriften, die van Microsoft over nauwkeurigheid en consistentie in een vastgestelde set van vijf talen. Geen van beide leveranciers heeft een benchmark gepubliceerd die een ander lab kan draaien en controleren.

Bewerken is waar het premium zit.

Wat de twee onderscheidt is bewerken, en dit is de enige as met onafhankelijk bewijs. MAI-Image-2.5-Pro staat op Nr. 1 op de Artificial Analysis Image Editing Arena met een Elo van 1.272 (~6.100 blinde stemmen), voor Reve 2.1, MAI-Image-2.5 en GPT Image 2. Op dezelfde ranglijst staat de nieuwere Qwen-Image-3.0-Pro op 1.249 — een concurrerende score, 23 Elo achter, en opmerkelijk voor een model dat pas deze maand de internationale API heeft bereikt.

Naast het basismodel is de bewerkingsportefeuille van Alibaba eerder een set specialistische trucs dan één enkele kroon: restauratie van oude schilderijen, panoramageneratie, schets-naar-PPT en storyboarding met meerdere shots. Die van Microsoft is een smallere, diepere gok — precieze, chirurgische bewerkingen die de rest van het beeld consistent houden (objectvervanging, layoutwijzigingen, tekstupdates in beeld, onscherpte-verwijdering), de klasse van bewerking waarbij oudere modellen de hele scène opnieuw genereren en het onderwerp verliezen. Voor een workflow die luidt: "neem dit bestaande asset, verander één ding, lever het op," is de onafhankelijke #1 van de Pro-tier het sterkere signaal; voor een allegaartje aan creatieve bewerkingsformaten is de lijst van Q​wen breder.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

Het specificatiecontrast

• Prijs — ~$108,50 per 1.000 afbeeldingen (1024×1024, AA-conversie) vs ~$25–30 per 1.000 afbeeldingen (Alibaba-offerte vs AA-lijstarief)br />• Release — 23 juli 2026 (publieke preview, Foundry) vs 21 juli 2026, internationale API 4 augbr />• Tekstinvoer — 32.000 tokens, 131k context vs 4.500-token promptvensterbr />• Uitvoerlimiet — ~1.048.576 pixels (~1K) vs tot 2048×2048br />• Afbeeldingen per aanroep — één uitvoer per verzoek vs tot zes afbeeldingen per aanroepbr />• Bewerkingsrang — nr. 1, Elo 1.272 (AA) vs 1.249 voor Qwen-Image-3.0-Pro op dezelfde ranglijstbr />• Herkomst — Microsofts claim "geen distillatie van modellen van derden" vs AIGC-herkomstlabel op uitvoerbr />• Gewichten — gesloten, alleen API vs gesloten, alleen API

Het outputplafond en het aantal per aanroep doen er meer toe dan ze lijken. Qwen-Image 3.0 kan een 2048×2048 afbeelding renderen en kan tot zes afbeeldingen per aanroep retourneren, wat een batch-economische functie is; de Pro-tier komt uit op ongeveer 1K en retourneert één enkele output per verzoek. Als je opdracht is "geef me een reeks van zes productfoto's", dan is het Alibaba-model daarvoor gebouwd en het Microsoft-model niet.

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

Wanneer de premie zichzelf terugverdient

De beslisregel gaat over waar de afbeeldingen voor dienen, niet over welk model 'beter' is.

Betaal de meerprijs voor MAI-Image-2.5-Pro wanneer de output een hero asset is — een productvisual, een poster, een keyframe, een afbeelding die wordt opgenomen in een campagne en niet vijftig keer opnieuw wordt gegenereerd. De #1-positie voor bewerken en de claim van karakterconsistentie doen er het meest toe wanneer een bewerking in één keer goed moet zijn.

Koop in bulk met Qwen-Image 3.0 wanneer de output wegwerpbaar is of in grote aantallen nodig is — gelokaliseerde advertentievarianten, tijdelijke afbeeldingen, schets-naar-PPT-presentaties, storyboard-frames, alles waarbij je eerder opnieuw genereert dan verfijnt. Bij $25–30 per 1k kost een mislukte generatie een afrondingsfout; bij $108.50 per 1k is dat niet het geval.

Er is een middenweg die het benoemen waard is: voor compact, meertalig tekst-in-beeld-werk — een landingspaginamock met Japanse en Spaanse copy, een infographic met formules — zijn Q​wens 10px-leesbaarheid en twaalf talen op papier de betere keuze, en dat voor een kwart van de prijs. Het tegenargument van het Microsoft-model is de claim van 96,8% nauwkeurigheid in vijf talen, maar die claim is ongeverifieerd, en een koper die tussen twee ongeverifieerde tekstclaims kiest, zou waarschijnlijk de prijs zwaarder moeten laten wegen.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

De routinglaag, wanneer deze van toepassing is

Geen van beide modellen is momenteel bereikbaar via OrcaRouter — Qwen-Image 3.0 draait op Alibaba's eigen API (Alibaba Cloud Bailian en het Q​wen-platform) en verschillende platforms van derden, en MAI-Image-2.5-Pro staat op Microsoft Foundry — dus een eerlijke vergelijking zegt ronduit dat geen van beide vandaag aan onze kant staat. Wanneer een van beide beschikbaar wordt via een aanroepbare gehoste provider, zijn de doorgeef-economieën van toepassing: 0% opslag bovenop de lijstprijs van de provider, dus de tariefkaart van de leverancier is wat je betaalt, en een introductiekorting of prijsverlaging komt dezelfde dag op je factuur terecht als die wordt aangekondigd. Het failover-argument is de andere helft: Qwen-Image 3.0 is een enkele weken oude internationale API, het soort model waar je een deel van het verkeer naartoe stuurt terwijl een bewezen fallback de randgevallen opvangt — precies de opzet waarvoor een routinglaag is gebouwd.

Het vonnis

Qwen-Image 3.0 en MAI-Image-2.5-Pro zijn niet hetzelfde product tegen verschillende prijzen; het zijn verschillende producten die toevallig anders geprijsd zijn. Het model van Microsoft spant de kroon op het gebied van bewerking, heeft een groter contextvenster en doet een onbewezen uitspraak over nauwkeurigheid in vijf talen — voor hero-assets en chirurgische bewerkingen is de meerprijs verdedigbaar. Het model van Alibaba geeft meer schriften leesbaar weer, accepteert per generatie dichtere briefs op eigen voorwaarden, levert grotere output in batches van zes en kost een kwart zoveel — voor volume en meertalig tekst-in-beeld-werk is het de economisch rationele keuze. Koop de premiumversie waar het beeld het product is; koop de volumeversie waar het beeld voorraad is.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube