Titelkort för en jämförelse av Ming-Image-0.1-Design och Qwen-Image 2.1, med undertexten att licensen och hårdvarukostnaden avgör valet, där det ena kortet lyder mer flexibel licens och det andra mer restriktiv licens.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 2.1: Licensen är den verkliga skillnaden

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två öppna bildmodeller lanserades med tre dagars mellanrum i september 2026 och, om man läser ett datablad, ser de ut som samma köp. Ming-Image-0.1-Design, byggd av Ant Groups inclusionAI-team, lade ut sina vikter på Hugging Face den 17 september under en MIT-licens. Qwen-Image 2.1, från Alibabas Qwen-team, följde den 20 september under Qwen Research License Agreement. Båda genererar nativt RGBA, båda uppger 2K-utdata, och båda riktar sig till samma köpare: ett team som vill ha bildgenerering som det själv kan hosta, granska och modifiera. De två sakerna som faktiskt skiljer dem åt är de två som ett datablad är sämst på att visa – vad du juridiskt får göra med resultatet, och hur mycket kisel det tar att producera en sådan.

Det är inte en retorisk inramning. För en av dessa modeller är licensen ett tvärstopp för kommersiell användning; för den andra är den en icke-fråga. Och antalet parametrar som varje leverantör skriver på förpackningen underskattar nedladdningen med en faktor tre eller fyra. Dessa två fakta avgör köpet långt innan något benchmark gör det – och benchmarkarna kan, som det visar sig, inte jämföras alls.

Vad varje repository faktiskt innehåller

Ingen av modellerna är ett enda nätverk. Båda är pipelines, och det är i pipelinen som storleken ligger:

• Generator — Ming-Image-0.1-Design kommer med en designtransformator med 6,15 miljarder parametrar (12,31 GB i BF16); Qwen-Image 2.1 kommer med en single-stream-DiT med 7,1 miljarder parametrar, 32 lager, block-kausal uppmärksamhet och ett icke offentliggjort antal aktiva parametrar (cirka 14,2 GB).

• Textsidan — Ming-Image-0.1-Design kombinerar sin transformer med en multimodal LLM på 17,01B (34,02 GB) och en connector på 3,09B (6,17 GB); Qwen-Image 2.1 använder en Qwen3-VL 8B-textkodare (cirka 17,5 GB).

• Totala parametrar — 26,44B för Ming-Image-0.1-Design mot ungefär 15–16B för Qwen-Image 2.1. Observera att ingen av leverantörernas rubriksiffra är totalen: både "6B" och "7B" beskriver endast generatorn.

• Repostorlek – 52,88 GB för Ming-Image-0.1-Design (varav 49,25 GiB är vikter); ungefär 33 GB för Qwen-Image 2.1.

• Transparens — båda matar ut inbyggd RGBA direkt från modellen i stället för via ett matting-steg i efterhand. Ming-Image-0.1-Design använder sin egen RGBA-VAE; Qwen-Image 2.1 använder en RGBA-VAE med 64 kanaler och 16× rumslig komprimering.

• Standardgenerering — Ming-Image-0.1-Design är validerad vid 2048×2048, 12 steg, BF16, CFG 1.0; Qwen-Image 2.1 har som standard 2048×2048 över 40 steg med sju förinställningar för bildförhållande.

• Licens — MIT för Ming-Image-0.1-Design; Qwen Research License Agreement, icke-kommersiell, för Qwen-Image 2.1.

Etiketten "6B" gör ett stort jobb.

Ant Groups repo har en titel som kretsar kring en modell med 6 miljarder parametrar, och transformatorn är verkligen 6,15B. Men vikterna du laddar ner är 49,25 GiB, repot är 52,88 GB, och konfigurationen som leverantören validerade – 2048×2048 i BF16 med hela textstacken resident – är specificerad för en 80 GiB CUDA-GPU. Det är inte ett avrundningsfel på ett 48 GB-kort; det är ett kort du inte kan använda. En 48 GB-accelerator kommer inte att rymma pipelinen, och inte heller två av dem utan avlastningskonster som leverantören inte dokumenterar.

Qwen-Image 2.1 är den mer förlåtande nedladdningen, med förbehållet att Alibaba publicerar inga officiella VRAM-siffror alls. Det enda modellkortet vägleder om är att aktivera CPU-offload på mindre kort. Det som har mätts upp sedan lanseringen är mer användbart än det som har publicerats: en int8-pipeline körs på runt 16 GiB totalt och ryms helt resident på ett 24 GB-kort, medan en full BF16-körning har rapporterats ligga allt från omkring 17 GB med CPU-offload till ungefär 40 GiB i topp vid 1024×1024 beroende på hur textkodaren placeras. Rapporterad latens för enstaka bilder sträcker sig från några sekunder på en B200 till under tio på ett aktuellt arbetsstationskort. Betrakta alla dessa siffror som mätningar från communityn snarare än specifikationer – de varierar med offload-strategin mer än vad modellerna skiljer sig från varandra.

Den praktiska sammanfattningen: Qwen-Image 2.1 är en modell i 3090-klass om du är villig att avlasta; Ming-Image-0.1-Design är en modell i datacenterklass utan mindre konfiguration.

Licensen är vägskälet.

Det här är delen som faktiskt kommer att stoppa ett projekt, och det är den del som de två utgåvorna behandlar mest olika.

Ming-Image-0.1-Design är MIT. Släpp den i en betalprodukt, finjustera den, vidaredistribuera vikterna, håll dina ändringar stängda – inget av det kräver ett samtal med Ant Group.

Qwen-Image 2.1 är inte det. Det omfattas av Qwen Research License Agreement daterat den 20 september 2026, som endast licensierar vikterna för forskning och utvärdering. Kommersiell användning kräver ett separat avtal från Alibaba, och inget pris för det avtalet är publicerat. Derivat och vidaredistributioner måste innehålla licensen, ett meddelande om "Built with Qwen" eller "Improved using Qwen" och copyright-raden för Hangzhou Tongyi Laboratory, och "Qwen" får inte vara det primära namnet på en härledd modell. Licensen lyder under kinesisk lag med jurisdiktion i Hangzhou.

Det finns en verkligt klargörande punkt i leverantörens egen uppföljning: Alibaba har uppgett att genererade bilder inte ingår i de licensierade "Materialen", så du behåller rättigheterna till det som modellen producerar. Begränsningen gäller vikterna och modellen, inte din output. Det är ett betydelsefullt undantag och det är värt att läsas noggrant, eftersom den enkla sammanfattningen – "bilderna är dina, modellen är inte" – är den korrekta.

Det är också en riktningsändring. Tidigare Qwen-Image-utgåvor, inklusive den ursprungliga Qwen-Image samt byggena 2511 och 2512, förblir Apache 2.0 och kommersiellt tillåtande. Ett team som valde Qwen-Image i fjol för dess licens och uppgraderar till 2.1 den här månaden ärver en begränsning till enbart forskning som det aldrig gick med på. Om tillåtande villkor är kravet är Qwen-Image 2.1 inte den nyare versionen av det du hade – det är en annan uppgörelse.

Vad var och en är byggd för att göra

Licensuppdelningen speglar en skillnad i avsikt, och det är skillnaden som bör styra valet när båda är lagliga alternativ för dig.

Ming-Image-0.1-Design är ett designverktyg. Textstacken finns för att expandera en kort brief till en strukturerad 8K-prompt, och leverantören tillhandahåller "skills" kring det – en Design Skill som tar fram ett visuellt utkast på omkring 15 sekunder, och en PPT Skill som siktar på utdata i slideformat. Dess tillhörande repositorium, Ming-Image-0.1-Design-Layer, tar en tillplattad design och returnerar den som separata lager, vilket är den enda förmågan här som inget annat i det öppna fältet erbjuder. inclusionAI rapporterar att Layer-modellen kör ungefär 4,3× snabbare än en öppen layermodell på 20B för samma uppgift (183 sekunder mot 795) – leverantörsrapporterat, inte reproducerat, och jämförelseobjektet är inte namngivet tillräckligt exakt för att kunna kontrolleras.

Qwen-Image 2.1 är en generator och redigerare. En och samma checkpoint utför både text-till-bild och instruktionsbaserad redigering, tar emot upp till 10 referensbilder för en enskild redigering och stöder lokala redigeringar som lämnar resten av bilden orörd. Den levererades med stöd från dag ett i ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion och LightX2V – en serving-historia som Ming-Image-0.1-Design ännu inte har, eftersom dess egen servingguide pekar på vLLM-Omni.

Läs det som en förgrening snarare än en rangordning. Om uppgiften är att "ta fram en skiktad, redigerbar designresurs utifrån en brief", är Ming-Image-0.1-Design den enda av de två som gör det. Om uppgiften är att "generera och sedan iterativt redigera mot referenser", gör Qwen-Image 2.1 det i en och samma modell, medan Ming-Image-0.1-Design inte gör det alls.

Benchmarkarna är inte jämförbara, och det är det ärliga svaret

Båda leverantörerna har nummer. Inget av numren kan placeras bredvid det andra, och varje artikel som gör det hittar på ett resultat.

Beviset för Ming-Image-0.1-Design är en resultattavla från Artificial Analysis: första plats på Text-to-Image Leaderboard filtrerad till öppna vikter för UI/UX Design, med en Elo på 1 082, före Ideogram 4.0 Quality på 1 052, Ideogram 4.0 på 1 015, HunyuanImage 3.0 Instruct på 1 005 och FLUX.2 [dev] på 1 000. Leverantören rapporterar också vinstfrekvenser på 67,4 % för layout, 67,0 % för komplex komposition och 66,7 % för textrendering, samt första plats i 12 mätvärden på Crello. Resultattavlan är ett tredjepartsinstrument, vilket gör Elo till det starkare av de två bevisen här; vinstfrekvenserna och Crello-svepet är leverantörsrapporterade och bör läsas som påståenden.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

Beviset för Qwen-Image 2.1 är Qwen-Image-Bench, ett benchmark som Qwen-teamet har byggt, där den får 60,28 och leder open source-fältet före Nano Banana 2.0 på 59,82 och GPT Image 1.5 på 59,65. Källmaterialet markerar att benchmarken är byggd av Qwen, och de tre främsta ligger inom en poäng från varandra – en marginal som väl ryms inom bruset för en benchmark vars skapare också är en konkurrent i den.

Så: en tredjeparts-Elo på en delmängd för UI/UX-design, mot en leverantörsbyggd allmän poäng. Olika instrument, olika uppgifter, olika domare. Ingen har publicerat en head-to-head-körning av dessa två modeller mot varandra, och utifrån tillgänglig evidens kan ingen det. Den användbara tolkningen är snäv och värd att uttrycka tydligt — Ming-Image-0.1-Design har tredjepartsbekräftelse specifikt för designarbete, Qwen-Image 2.1 har leverantörsrapporterad styrka inom allmän generering och redigering, och överlappningen mellan dessa två påståenden är mindre än vad rubriksiffrorna antyder.

Att få någon av dem på en endpoint

Ingen av modellerna finns i OrcaRouters katalog i dag. Ming-Image-0.1-Design och Qwen-Image 2.1 är båda självhostade alternativ just nu: vikterna går att ladda ner och serveringsguiderna är verkliga, men du sätter upp GPU:n själv, och i Mings fall är den GPU:n en på 80 GiB. Vi listar dem här som släpp med öppna vikter, inte som rutter.

Vad som är värt att veta innan du satsar på hårdvara är vad samma arbetsbelastning kostar dig som ett anrop. Våra routade bildmodeller omfattar google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, de tre Imagen 4.0-nivåerna (fast, standard och ultra), grok/grok-imagine-image och GPT-Image-familjen — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 och openai/gpt-image-2. Att köra en designbrief mot en av dem i en vecka säger dig huruvida Ming-Image-0.1-Designs lagerutdata är en kapacitet du faktiskt behöver, till en bråkdel av kostnaden för 80 GiB-kortet, och det gör den innan du får reda på om licensen eller VRAM:en skulle bli hindret. När du väl flyttar en självhostad modell till en produktionsväg är samma endpoint där routningen ligger — en nyckel över 200+ modeller, automatisk failover mellan leverantörer, och 0 % påslag, så en leverantörs prissänkning är live hos oss samma dag som den tillkännages.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

Vem ska välja vilken

Välj Ming-Image-0.1-Design om slutprodukten är en designtillgång och inte en bild: lageruppdelad utdata, strukturerad promptexpansion, bildspelsformad generering och en licens som låter dig sälja vad du än skapar med den. Budgetera för ett rejält grafikkort och acceptera att serveringsekosystemet runt det är tunnare än på Qwen-sidan. Det är också det mer användbara av de två om du behöver presentera en siffra för en kund, eftersom dess starkaste bevis är den enda tredjepartssiffran i den här jämförelsen.

Välj Qwen-Image 2.1 om arbetsflödet är generera-sedan-redigera, om du behöver konditionering med referensbilder, eller om du vill köra på hårdvara du redan äger. Den är mindre, har bättre stöd från dag noll, och dess licens är okej för det forsknings- och utvärderingsarbete som de flesta faktiskt gör först. Den blir fel val i samma stund som resultatet är kommersiellt och den juridiska granskningen är på riktigt, eftersom den enda vägen till en kommersiell licens är ett direktavtal med Alibaba och det finns inget offentliggjort pris att planera utifrån.

Välj ingen av dem, ännu, om det du behöver är bildgenerering i produktion den här månaden. Båda dessa är vikter, och vikter är ett hårdvaru- och juridiskt åtagande innan de är en kapacitet. Designfrågan – förändrar skiktad utdata vad mitt team kan leverera – kan besvaras på en hostad slutpunkt först, och det svaret är vad som bör avgöra om 80 GiB-kortet köps.

Vad du ska titta på

Tre saker kommer att förändra den här jämförelsen. Huruvida Ming-Image-0.1-Design får en serveringsväg bortom sin egen vLLM-Omni-guide, eftersom det för närvarande är gapet mellan den och Qwen-Image 2.1:s day-zero-lista för fem ramverk. Huruvida Alibaba sätter ett pris på den kommersiella Qwen-licensen, eftersom ett pris som inte har satts är den enskilt största okända faktorn i detta par. Och huruvida någon — ett labb, en oberoende utvärderare eller en leverantör utan något att förlora — kör dessa två mot varandra på samma prompter. Fram till dess är det närmaste man kommer en rättvis jämförelse inte en poäng över huvud taget. Det är licensraden, och Ming-Image-0.1-Design vinner den ohotat.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.