
Qwen-Image 2.1 släpptes i tysthet: Inuti Qwen/Qwen-Image-2.1-PE-I2I
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Den 20 september 2026 släppte Qwen-Image-teamet Qwen-Image 2.1 på Hugging Face och ModelScope — vikter, licensfil, modellkort och ett blogginlägg, allt samma dag, med nästan ingen framförhållning. Huvudnumret är 7B parametrar i den visuella genereringskomponenten. Den del som nästan ingen ännu har öppnat är Qwen/Qwen-Image-2.1-PE-I2I, en av två prompt-omskrivande checkpoints som släpptes tillsammans med bildmodellen. Det är inte bildmodellen. Det är det som avgör vad din instruktion betyder innan bildmodellen ens har sett den — och i den här versionen är det komponenten som tyst bestämmer vilket språk din utdata kommer tillbaka i.
Vad "släpptes tyst" faktiskt betyder här
Ordvalet spelar roll, eftersom det är lätt att överdriva åt endera hållet. Qwen-Image 2.1 läcktes inte, och det var inte oannonserat. Det finns ett leverantörsblogginlägg daterat den 20 september 2026, ett GitHub-repositorium med en nyhetssektion daterad samma dag och en aktiv nedladdning av vikterna. Det som saknades var en uppladdning: den enda förhandssignalen var en notis den 17 september som erbjöd 50 platser för tidig åtkomst via ModelScope, där utvalda testare ombads publicera ett exempel eller en recension senast den 29 september. Tre dagar senare var vikterna offentliga. Ingen keynote, ingen benchmark-embargo, ingen presscykel.
Det är en specifik typ av släpp, och det är värt att benämna exakt. Leverantören meddelade det. Leverantören marknadsförde det inte. För den som överväger att bygga vidare på det är den praktiska konsekvensen att det inte finns någon oberoende utvärdering att luta sig mot ännu — bara leverantörens eget material och vad testare med tidig åtkomst publicerar under den kommande veckan. Betrakta varje kvalitetspåstående i den här artikeln som kommande från modellkortet och blogginlägget tills någon utanför Alibaba kör den offentligt.
Varför PE-I2I-checkpointen är den intressanta
Qwen-Image 2.1-släppet innehåller tre nedladdningsbara delar, inte en:
• Qwen/Qwen-Image-2.1 — själva bildmodellen. En 32-lagrig enkelströms-DiT med 7B parametrar i den visuella genereringskomponenten, en Qwen3-VL 8B-textkodare och en 64-kanalig RGBA-VAE med 16× rumslig komprimering. Ungefär 33 GB fördelat över de tre komponenterna.
• Qwen/Qwen-Image-2.1-PE-T2I — en prompt-omskrivare för text-till-bild. En finjusterad Qwen3.5-VL 9B, cirka 18,8 GB.
• Qwen/Qwen-Image-2.1-PE-I2I — en promptomskrivare för bild-till-bild-redigering. Även en finjusterad Qwen3.5-VL 9B, också cirka 18,8 GB, uppladdad till Hugging Face kl. 08:46 UTC den 20 september.
"PE" är promptförbättring. I2I-varianten tar en vag redigeringsinstruktion plus en eller flera indatabilder och skriver om den till ett exakt, entydigt redigeringsdirektiv för den nedströms diffusionsmodellen. Repots egen beskrivning är rättfram om indataformen: en indatabild finns alltid, så detta är alltid en bildredigeringsuppgift och aldrig text-till-bild från ingenting. Omskrivningskoden ligger i en prompt_rewrite/ mapp som betjänar båda checkpoints — --task t2i eller --task edit — med en transformers-väg, en vLLM-väg, en serve.sh samt client.py för en ständigt körande tjänst, och pe_core.py för den delade logiken.
Här är varför det spelar större roll än det låter. Bildmodellen har ingen aning om vad du menade. Den har en uppfattning om vad din prompt bokstavligen säger, viktad efter vad textkodaren gör med den. En omskrivare som sitter framför den är där tvetydighet löses upp — eller löses upp fel, konsekvent, i varje bild du genererar. I en enhetlig genererings- och redigeringsmodell med upp till 10 referensbilder har det upplösningssteget mer att få fel än vanligt.
Systemprompten är där språkvalet ligger
PE-I2I-repositoriet levererar en system_prompt.txt tillsammans med vikterna, och det är ovanligt explicit om en sak: språk. Läser man den direkt instrueras omskrivaren att fatta två separata språkbeslut och att hålla dem åtskilda.
• Beskrivningsspråket. Den prosa som omskrivaren skriver för att beskriva redigeringen följer användarens instruktionsspråk — kinesisk instruktion, kinesisk beskrivning; engelsk instruktion, engelsk beskrivning; en instruktion på japanska, koreanska, franska, thai eller något annat får en engelsk beskrivning.
• Språket för den renderade texten. Texten som faktiskt kommer att målas in i utdatabilden, innesluten i dubbla citattecken, avgörs av en strikt prioritetsordning: för det första, om användaren anger den exakta texten eller målspråket, följ det bokstavligen; för det andra, om indatabilden redan innehåller text, matcha det dominerande språket i den befintliga texten — även när instruktionen är skriven på ett annat språk; för det tredje, om det inte finns någon text i bilden och inget språk anges, använd språket i själva instruktionen, och tvinga specifikt inte fram engelska.
Prompten förstärker den andra regeln med ett genomarbetat exempel – en bild som mestadels är på thai, redigerad med en engelsk instruktion som inte anger något språk, måste rendera text på thai – och lägger till två begränsningar: renderad text måste vara enspråkig i stället för ett kinesiskt/engelskt par, och en visuell genre som "spec sheet" eller "storyboard" uppnås genom layout och typografi, aldrig genom att byta ut de renderade etiketterna mot engelska.
Det här är ett litet stycke ingenjörsarbete med en stor sprängradie. Om du genererar produktbilder för en marknad där förpackningstexten spelar roll, är skillnaden mellan "omskrivaren bevarar det befintliga etikettspråket" och "omskrivaren översätter hjälpsamt allt till engelska" skillnaden mellan en användbar resurs och en refuserad sådan. Och eftersom detta beteende specificeras i en systemprompt som följer med i repot, kan du läsa den, diffa den och åsidosätta den – vilket är mer än vad man kan säga om samma steg i en sluten hostad modell.
Vad är bekräftat, och vad är inte
Att vara precis om gränsen här är hela poängen med en vad-vi-vet-artikel.
• Bekräftat från kodförrådet och modellkortet — 7B/32-lagers single-stream DiT-siffran; Qwen3-VL 8B-textkodaren; RGBA-VAE:n med 64 kanaler vid 16× rumslig komprimering; block-kausal uppmärksamhet med en kausal mask på tokennivå för text och en dubbelriktad mask på chunknivå för bildgenerering; återanvändning av prefix-KV-cache, som kortet säger aktiveras när checkpointen har causal_condition: true (det gör den); flow matching med Euler-diskret schemaläggning; inbyggd 2K-utdata med 2048×2048 som standard vid 40 inferenssteg; sju dokumenterade förinställningar för bildförhållande; stöd för upp till 10 referensbilder; lokal redigering via cirkel, målad annotering eller en separat mask; samt RGBA-generering, redigering av transparenta lager och motivutvinning från RGB-foton.
• Bekräftat om licensen, och detta är den vassa kanten — släppet lyder under Qwen Research License Agreement, daterad 20 september 2026, som beviljar rättigheter "ENDAST FÖR ICKE-KOMMERSIELLA ÄNDAMÅL" och anger att kommersiell användning kräver en separat licens som begärs från leverantören. Det är en väsentlig förändring från den tidigare Qwen-Image-serien, som släpptes under Apache 2.0. Läs licensfilen innan du bygger en produkt på detta, inte efter.
• Ej bekräftat — inga oberoende benchmarkresultat finns ännu. Blogginlägget hänvisar till ett jämförelsediagram från Qwen-Image-Bench, men siffrorna i det är leverantörens egna och hade inte reproducerats av någon tredje part vid tiden för skrivandet. Det finns inget publicerat pris för hostad endpoint för Qwen-Image 2.1, och inga angivna villkor för den kommersiella licensen. Och det finns ännu inget besked om huruvida en permisivt licensierad variant kommer att följa.
Den enda oberoende datapunkt som faktiskt finns är en praktisk recension av tidig åtkomst från en testare som hade tillgång via Qwen Ambassador-programmet och körde vikterna för den slutliga versionen genom ett ModelScope Studio-gränssnitt. Den recensionen rapporterade genereringstider på ungefär 10–15 sekunder för text-till-bild och 18–23 sekunder för redigering, stark prestanda för förinställningar för kameraposition och rolltilldelning för flera karaktärer, samt ett specifikt felbeteende värt att känna till: multi-referens-konsekvens försämrades från omkring tre indatabilder och framåt, där sidohästsvansens placering kollapsade till en mittplacerad hästsvans vid profilvinklar. Det är en enda recensent, i ett gränssnitt för tidig åtkomst, utan visad timer. Det är en användbar signal. Det är inte ett benchmark.

Ramverkstöd från dag noll, vilket är den tysta goda nyheten
Var en modell landar på lanseringsdagen säger dig mer om huruvida du faktiskt kan använda den än vad modellkortet gör, och Qwen-Image 2.1 landade brett:
• Diffusers — en QwenImage21Pipeline slogs samman redan dag noll, och modellarkivet bär taggen diffusers:QwenImage21Pipeline.
• ComfyUI — inbyggt stöd från dag ett med arbetsflödesmallar för text-till-bild och bildredigering, samt ett separat Comfy-kompatibelt viktrepositorium.
• vLLM-Omni — stegvis exekvering, prefix-KV-cachning, CUDA Graph-avkodning, FP8-kvantisering och tensor-/Ulysses-parallelism.
• SGLang— en pull request för inbyggt stöd landade 17 september, tre dagar innanvikterna, med stöd för DiT, RGBA-VAE, Qwen3-VL-betingning, flera referensbilder samt RGBA-in- och utdata, validerat på H200, B200, RTX PRO 6000, RTX 5090 och RTX 4090.
• LightX2V — dag-noll-acceleration, plus AMD Radeon via ROCm och multi-chip-stöd genom FlagOS.
SGLang-pull-begäran före släppet är det avslöjande tecknet. Ramverksstöd som landar före vikterna betyder att serveringsvägen testades mot checkpointen, inte skrevs utifrån modellkortet efteråt. För en 7B-komponent med en textkodare på 17,5 GB bredvid sig är det skillnaden mellan en helg av yak-shaving och en eftermiddag.
För begränsade GPU:er rekommenderar modellkortet CPU-offload — pipe.enable_model_cpu_offload() — vilket är den vanliga nödlösningen snarare än en lösning. Nedladdningen på 33 GB domineras av textkodaren, inte DiT:n; själva diffusionstransformatorn är den mindre halvan av paketet på cirka 14 GB.

Den praktiska läsningen
Om du vill prova Qwen-Image 2.1 idag är den ärliga hållningen att du kan göra det, lokalt, under en forskningslicens, utan oberoende benchmarks och utan kommersiella rättigheter. Det är en rimlig avvägning för utvärdering och en dålig för en produktionspipeline, och skillnaden mellan dessa två är exakt vad licensfilen avgör.
För team som benchmarkar bildmodeller utan att vilja binda en produktionsväg till en checkpoint som är några dagar gammal, är routinglagret där den risken hålls innesluten. OrcaRouter frontar 200+ modeller bakom en enda OpenAI-kompatibel endpoint till leverantörens listpris utan påslag, med automatisk failover mellan leverantörer, så en obeprövad modell kan ligga bakom en rutt tillsammans med en modell du redan litar på i stället för att ersätta den — och eftersom listpriset förs vidare är en leverantörsprissänkning på en ruttad modell live samma dag i stället för att vänta på en kontraktsändring. Qwen-Image 2.1 finns inte bland de modeller vi routar vid skrivandet, och den här artikeln kommer inte att antyda något annat. Det vi routar är den omgivande bildlinjen — OpenAIs GPT-Image-familj, Googles Imagen 4-nivåer och Geminis bildförhandsvisningar, samt xAIs Grok Imagine-bildendpoint — vilket är varifrån en failover-väg skulle komma medan du utvärderar nykomlingen på din egen hårdvara.
Den öppna frågan är den som repositoriet inte kan besvara. Alibaba släppte en 7B-bildmodell med öppna vikter under en forskningslicens, samma år som man släppte Qwen-Image 3.0 som en stängd, hostad modell utan några vikter alls. Två lanseringar, två motsatta satsningar, med fyra månaders mellanrum. Vilken av dessa två som nästa Qwen-bildmodell antar – och huruvida forskningslicensen någonsin omvandlas till något ett företag kan använda – är vad man bör hålla ögonen på. Vikterna finns på Hugging Face nu, och vem som helst kan läsa licensfilen själv.

