
MAI-Image-2.5-Pro mot Qwen-Image 3.0: Fyra gånger priset för en annan typ av text
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
Ställ MAI-Image-2.5-Pro och Qwen-Image 3.0 bredvid varandra och det första du märker är priset: ungefär $108,50 per 1 000 bilder för Microsofts premiumnivå mot ungefär $25–30 per 1 000 för Alibabas Qwen-Image 3.0 — Alibabas eget angivna pris ligger på cirka 25 dollar, medan Artificial Analysis ledartavla listar 30 dollar. Mer än tre gånger så mycket pengar oavsett siffra. Vad den premien faktiskt köper är en annan typ av textarbete. Qwen-Image 3.0, som släpptes av Alibabas Qwen-team den 21 juli 2026 och öppnades för ett internationellt API den 4 augusti, är prissatt för att vara textrenderaren för stora volymer — läsbar ner till cirka 10 px på tolv språk, med ett promptfönster på 4 500 tokens för täta briefs. MAI-Image-2.5-Pro, i offentlig förhandsvisning på Microsoft Foundry sedan 23 juli, är den mest ansedda editorn på en oberoende ledartavla, med leverantörens påstådda textrenderingsnoggrannhet men en hård gräns på cirka 1 megapixel i utdata. Båda är API-bildmodeller vars rubriker handlar om text; de konkurrerar på pris per jobb, inte på ett enda kvalitetsresultat.
Två textberättelser, varken helt verifierade.
Textstriden är anledningen till att båda modellerna finns, och det är också där bevisen är som tunnast — varje siffra i detta avsnitt är leverantörsrapporterad och ingen har oberoende reproducerats.
• Qwen-Image 3.0 — Alibabas releasesmaterial hävdar läsbar rendering ner till cirka 10px, inbyggt stöd för 12 språk med 20+ typsnitt och 100+ konstnärliga stilar, matematisk notation, nedsänkta tecken, upphöjda tecken och flerradiga formler, samt förtrogenhet med vanliga webb-, spel- och programvarugränssnitt. Promptfönstret rymmer upp till 4 500 token indata — ett 4,5× hopp jämfört med föregående generation — vilket är vad som låter den svälja täta briefs som tidningars förstasidor eller ett kunskapsrutnät med nio paneler i ett enda anrop.
• MAI-Image-2.5-Pro — Microsoft hävdar 96.8% textåtergivningsnoggrannhet på kinesiska, engelska, japanska, koreanska och spanska, en 27% bättre promptföljsamhet än GPT-Image-1.5 i interna utvärderingar, och 94% karaktärskonsistens mellan bilder. Inmatningsspecifikationen är rymligare på pappret — upp till 32 000 textinmatningstokens med ett 131k kontextfönster — och utmatningen är begränsad till 1 048 576 pixlar, motsvarande 1024×1024.
Inget av påståendena har reproducerats i skrivande stund. Skillnaden ligger i påståendenas utformning: Qwens handlar om volym och läsbarhet över skriftsystem, medan Microsofts handlar om noggrannhet och konsekvens för en definierad uppsättning av fem språk. Ingen av leverantörerna har publicerat ett benchmark som ett annat labb kan köra och kontrollera.
Redigering är där premiumet bor
Det som skiljer dem åt är redigering, och detta är den enda axeln med oberoende belägg. MAI-Image-2.5-Pro ligger på plats 1 på Artificial Analysis Image Editing Arena med Elo 1 272 (~6 100 blinda röster), före Reve 2.1, MAI-Image-2.5 och GPT Image 2. På samma lista ligger den nyare Qwen-Image-3.0-Pro på 1 249 – ett konkurrenskraftigt resultat, 23 Elo efter, och anmärkningsvärt för en modell som nådde det internationella API:et först den här månaden.
Bortom basmodellen är Alibabas redigeringsportfölj en uppsättning specialisttrick snarare än en enda krona: restaurering av antika målningar, panoramagenerering, skiss-till-PPT och storyboarding med flera bilder. Microsofts är ett smalare, djupare satsning — precisa, kirurgiska redigeringar som håller resten av bilden konsekvent (objektersättning, layoutändringar, textuppdateringar i bilden, oskärperensning), den typ av redigering där äldre modeller återskapar hela scenen och förlorar motivet. För ett arbetsflöde som är ”ta denna befintliga tillgång, ändra en sak, leverera den” är Pro-nivåns oberoende #1 den starkare signalen; för en blandning av kreativa redigeringsformat är Qwens lista bredare.

Spec-kontrast
• Pris — ~$108.50 per 1k bilder (1024×1024, AA-konvertering) jämfört med ~$25–30 per 1k bilder (Alibaba-offert vs AA listpris)br />• Lansering — 23 juli 2026 (allmän förhandsversion, Foundry) jämfört med 21 juli 2026, internationellt API 4 augbr />• Textinmatning — 32 000 tokens, 131k kontext jämfört med promptfönster på 4 500 tokensbr />• Utmatningsgräns — ~1 048 576 pixlar (~1K) jämfört med upp till 2048×2048br />• Bilder per anrop — en enda utdata per begäran jämfört med upp till sex bilder per anropbr />• Redigeringsrankning — Nr 1, Elo 1 272 (AA) jämfört med 1 249 för Qwen-Image-3.0-Pro på samma listabr />• Proveniens — Microsofts påstående om "ingen destillering från tredjepartsmodeller" jämfört med AIGC-proveniensmärkning på utdatabr />• Vikter — stängda, endast API jämfört med stängda, endast API
Outputtaket och antalet per anrop är viktigare än de verkar. Qwen-Image 3.0 kan rendera en 2048×2048-bild och kan returnera upp till sex bilder per anrop, vilket är en funktion för batch-ekonomi; Pro-nivån toppar runt 1K och returnerar en enda utdata per begäran. Om din brief är "ge mig en uppsättning av sex produktbilder", är Alibaba-modellen byggd för det och Microsoft-modellen är inte det.

När premien betalar sig själv.
Beslutsregeln handlar om vad bilderna är till för, inte vilken modell som är "bättre."
• Betala premien för MAI-Image-2.5-Pro när resultatet är en hero-tillgång — en produktvisual, en affisch, en nyckelbild, en bild som skickas ut i en kampanj och inte kommer att regenereras femtio gånger. Redigeringsrankningen som #1 och påståendet om karaktärskonsistens betyder mest när en redigering måste bli rätt första gången.
• Köp in volym med Qwen-Image 3.0 när utdata är av engångskaraktär eller produceras i stora mängder — lokaliserade annonsvarianter, placeholder-grafik, skiss-till-PPT-presentationer, storyboardrutor, allt där du regenererar snarare än förfinar. Vid $25–30 per 1k kostar en misslyckad generering ett avrundningsfel; vid $108.50 per 1k gör den inte det.
Det finns en mellanväg värd att nämna: för tät, flerspråkig text-i-bild-arbete — en landningssidsmock med japansk och spansk text, en infografik med formler — är Qwens 10px-läsbarhet och tolv språk det bättre valet på papper, till en fjärdedel av priset. Microsoft-modellens motargument är dess påstående om 96,8% noggrannhet över fem språk, men det påståendet är overifierat, och en köpare som väljer mellan två overifierade textpåståenden bör troligen väga priset.

Routeringslagret, när det tillämpas
Ingen av modellerna är nåbar via OrcaRouter ännu — Qwen-Image 3.0 finns på Alibabas eget API (Alibaba Cloud Bailian och Qwen-plattformen) och flera tredjepartsplattformar, och MAI-Image-2.5-Pro finns på Microsoft Foundry — så en ärlig jämförelse säger tydligt att ingen av dem är på vår sida idag. När endera blir tillgänglig via en anropsbar hostad leverantör, tillämpas pass-through-ekonomin: 0 % påslag på leverantörens listpris, så du betalar enligt leverantörens prislista, och en lanseringsrabatt eller prissänkning hamnar på din faktura samma dag som den tillkännages. Failover-argumentet är den andra hälften: Qwen-Image 3.0 är ett några veckor gammalt internationellt API, den typen av modell som du dirigerar en del av trafiken till medan en beprövad reserv tar hand om gränsfallen — vilket är precis vad ett routningslager är byggt för.
Domen
Qwen-Image 3.0 och MAI-Image-2.5-Pro är inte samma produkt till olika priser; de är olika produkter som råkar ha olika priser. Microsofts modell tar hem redigeringskronan, har ett större kontextfönster och gör ett overifierat korrekthetspåstående på fem språk – för hjältebilder och precisionsredigeringar är premiumpriset försvarbart. Alibabas modell återger fler skriftsystem läsligt, accepterar tätare briefar per generation på sina egna villkor, producerar större bilder och i batchar om sex, och kostar en fjärdedel så mycket – för volym och flerspråkigt text-i-bild-arbete är det det ekonomiskt rationella valet. Köp premium när bilden är produkten; köp volym när bilden är lager.
