En genererad titelbild som visar 'Qwen-Image-3.0 — Allmän tillgänglighet', med funktionsetiketter för 4 500-tokensprompter, textrendering vid ~10 px, 12 språk och priser från ¥0,18 per bild, samt OrcaRouter-logotypen inlagd i hörnet.
Guides & Insights

Qwen-Image-3.0 blir allmänt tillgänglig: Alibabas praktiska bildmodell levereras för ¥0,18 per bild

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 5 augusti 2026 var dagen då Qwen-Image-3.0 slutade vara en förhandsversion endast för inbjudna och öppnades för alla användare av Alibabas Qwen AI-plattform. Hela produkten prissätts som en nyttighet snarare än en premium konsttjänst — text-till-bild från ungefär ¥0,18 per bild på konsumentsidan, med en Pro-nivå ovanför — och Alibabas egen beskrivning är att detta är en bildmodell byggd för att göra ett jobb, inte för att vinna en skönhetstävling. En vecka efter full allmän tillgänglighet är den beskrivningen värd att ta på allvar: de två saker som Qwen-Image-3.0 lyfter fram, mycket långa prompts och mycket läsbar liten text, är exakt de två saker som de flesta bildmodeller tyst misslyckas med.

Qwen-Image-3.0 levereras i två versioner — Qwen-Image-3.0-Pro och Qwen-Image-3.0-Standard — båda exponerade genom samma värdbaserade API. Lanseringen skedde i etapper: tillkännagavs den 21 juli 2026 med inbjudningsbaserad API-åtkomst på Alibaba Cloud Bailian och Qwe​n AI-plattformen, och öppnades helt den 5 augusti. Internationella utvecklare når den via Qwe​n Cloud, där lanseringsrapporteringen listar Pro till 0,04 USD per bild och Standard till 0,03 USD per bild. Inhemska konsumentpriser börjar runt 0,18 ¥ per bild. Dessa är leverantörsrapporterade lanseringssiffror, och den här artikeln behandlar dem som sådana — de är de siffror som Alibaba valde att publicera, inte en oberoende granskning.

Lanseringen, i tre siffror

Om du bara läser en sak från tillkännagivandet, så är det dessa tre:

Promptar på 4 500 tokens. Qwen-Image-3.0 accepterar ungefär 4,5× promptlängden hos sin föregångare. Det är den förändring som möjliggör allt annat: en prompt kan nu specificera en hel tidningssida, en storyboard, en kunskapsinfografik med nio rutor eller ett tentamenspapper och få ut det i ett enda steg istället för att sys ihop i en redigerare.

~10-pixel textåtergivning. Modellen återger liten, läsbar text ned till ungefär tio pixlars texthöjd — skillnaden mellan en bild som ser ut att ha text och en som faktiskt går att läsa korrekt.

12 språk, 20+ typsnitt. Flerspråkig utdata är inbyggd snarare än en eftertanke: kinesiska, engelska, koreanska med mera renderas i det skriftsystem som prompten begär, utan de tomma teckenrutor som plågar de flesta västerländskt tränade modellerna på CJK.

Lägg till de mindre citerbara men lika viktiga delarna — bild-till-bild och bildredigering i samma modell, kunskapsdiagram som kombinerar formler, geometri och härledningssteg, samt trovärdiga skisser av webb-, spel- och livestreaminggränssnitt — och profilen är tydlig. Alibaba siktar på produktionsarbete: massgenerering av prov för utbildning, gränsöverskridande e-handelsaffischer, publiceringslayout, UI-prototypning. De kinesiska lanseringsmaterialen sammanfattar positioneringen i ett tecken: , "praktisk".

A generated spec scoreboard for Qwen-Image-3.0 showing 4,500-token prompts, ~10px text, 12 native languages, pricing from ¥0.18 / $0.03-0.04 per image, Pro and Standard editions, and closed API-only weights, footnoted as sourced from Alibaba launch materials.

Vad är oberoende verifierat hittills

Screenshot of the Qwen-Image blog post 'Qwen Image 3.0 Released: Long Prompts, Small Text, and Multilingual Layouts', announcing Qwen-Image-3.0 on July 21, 2026.

Här är det som spelar roll för den som har blivit bränd av en flashig lansering. Qwen-Image-3.0 är en sluten modell: inga vikter, ingen licens, ingen teknisk rapport, inget officiellt benchmark-släpp. Det är en medveten kursändring — Qwen-Image 1.0 och 2.0 släpptes som öppna, Apache-2.0-vikter på Hugging Face med tekniska rapporter samma dag. 3.0 bryter med det, och Alibaba har inte publicerat något modellkort eller antal parametrar. Tidiga lanseringsrapporter beskriver det som ungefär 20B parametrar på en MMDiT-arkitektur, men betrakta det som rapporterat, inte bekräftat: utan någon rapport att kontrollera kan ingen utanför Alibaba verifiera det.

Det innebär att varje flaggskeppsfunktion ovan — inmatningen på 4 500 tokens, texten på 10 px, de 12 språken — är ett leverantörspåstående. Den starkaste oberoende datapunkten hittills är en kinesisk praktisk jämförelse som publicerades i lanseringsfönstret och som körde Qwen-Image-3.0-Pro mot elva andra konfigurationer. Resultaten går åt båda håll: Qwen-Image-3.0-Pro var utmärkt på UI/dashboard-generering, vetenskapliga diagram och enhetliga designsystem, med högst övergripande slutförandekvalitet i dessa kategorier — men den var också den långsammaste modellen i genomsnitt, och liten text gav fortfarande förvrängda tecken i vissa fall. För strikt textnoggrannhet föredrog samma test GPT-Image-2 medium, Gemi​ni 3 Pro och Seedream 5.0 Lite. Det är en användbar, ärlig bild: stark på struktur, ännu inte felfri på den lilla text den annonserar.

Vad gäller ledartavlan hävdar Alibabas lanseringsbevakning att Qwen-Image-3.0-Pro nådde #1 bland kinesiska modeller och #2 bland vanliga modeller på Arenas text-till-bild-ledartavla, bakom OpenAIs GPT-Image-serie. En oberoende spårningssajt (AITNT, 5 augusti) visar att Pro-modellen ligger högst bland Alibabas egna modeller i både Art Creation-kategorin (1 256 Elo, global rankning 2–11) och Photorealistic-kategorin (1 258 Elo, global 4–13). Enligt Arenas veckorankning den 10 augusti låg Pro-modellen på #7 totalt i bildgenerering – fortfarande i toppskiktet och värd att bevaka för att se om den håller sig när lanseringsveckans rusning avtar.

Screenshot of the Text-to-Image Arena overall leaderboard on arena.ai, showing 77 ranked image models by Elo as of August 10, 2026.

Två utgåvor, en prissättning

Qwen-Image-3.0-Pro och Qwen-Image-3.0-Standard är samma modellfamilj, prissatt i två nivåer. På Qwe​n Cloud är de publicerade priserna per bild $0,04 för Pro och $0,03 för Standard; priset för inhemska konsumenter börjar runt ¥0,18. Som jämförelse ligger det under GPT-Image-2:s mellannivå och ungefär i nivå med där Goo​gles Nano Banana 2 Lite hamnade — ett medvetet pris som är "billigt nog att iterera på". En varning från en oberoende granskning av byggbarhet är värd att flagga: samma granskning som inte kunde hitta en Qwen-Image-3.0-post på Alibaba Clouds Model Studio-prissida vid en tidpunkt i slutet av juli. Den luckan tillslöts senare när GA-utrullningen fortskred, men det är en påminnelse om att en veckogammal modells API-yta fortfarande kan hålla på att stabiliseras — kontrollera den aktuella prissidan innan du kopplar en produktionspipeline till den.

Där du kan ringa det

Qwen-Image-3.0 är en värdbaserad modell, så åtkomstvägen är leverantörens eget API och flera tredjepartsplattformar som har tagit upp den sedan GA. Det finns inget alternativ för självhosting och ingen väg med öppna vikter, vilket spelar roll om ditt krav är dataresidens eller full kontroll över pipelinen. På plussidan innebär värdbaserad att ingen GPU-kapacitetsplanering krävs — du betalar per bild och leverantören skalar det.

Detta är också ögonblicket då en router visar sitt värde. Qwen-Image-3.0 är helt ny och dess prissida har redan ändrats en gång på en vecka; om du utvärderar den mot resten av bildmodellerna vill du inte ha en skräddarsydd integration per leverantör medan du bestämmer dig. OrcaRouter erbjuder 200+ modeller bakom en OpenAI-kompatibel slutpunkt till leverantörens listpris utan påslag, så en prissänkning från en leverantör — inklusive en på en modell som är en vecka gammal — är live hos oss samma dag som den släpps. Automatisk redundans innebär att du kan köra Qwen-Image-3.0-relaterade arbetsbelastningar genom de modeller vi faktiskt dirigerar (Ope​nAI:s gpt-image-2, xAI:s Grok Imagine, Goo​gle:s Imagen 4-familj) utan att din bildpipeline går ner medan du utvärderar en nykomling mot fältet. Jämförelsen är poängen: en enda API-nyckel, ett anropsformat och siffrorna sida vid sida.

Vem bör agera nu

Team som genererar innehållstäta, texttunga material — tentor, produktblad, flerspråkiga affischer, dashboard-skisser, storyboards — är de naturliga tidiga användarna, eftersom det är precis de arbetsflöden där en prompt på 4 500 tokens med inbyggd flerspråkig rendering sparar timmar av sammanfogning och omskrivning. Team vars ribba är fotorealism eller absolut typografisk trohet har bättre beprövade alternativ idag, och de oberoende testdata stödjer att vänta på att problemen med liten text åtgärdas. Oavsett vilket, bygg inte enbart på lanseringspåståendena: modellen är sluten, så det enda som avgör om den förtjänar en plats i din stack är att köra dina egna verkliga prompts mot den — vilket, till $0,03–$0,04 per bild, är ett billigt experiment att genomföra.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube