
Qwen-Image-2.1 vs GPT Image 2: Ladda ner den gratis, eller hyr den bästa
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen-Image-2.1 är en nedladdning på 33 GB som du kan köra gratis och inte får sälja. GPT Image 2 är ett API som du inte kan ladda ner alls, faktureras per token, fyra månader in i produktionen och ligger i toppen av de oberoende bildtopplistorna. Dessa två fakta är hela avvägningen, och det intressanta är att transparensfunktionen – det som gör Qwen-Image-2.1 värt en titt från början – kom till båda systemen inom en månad från varandra via helt olika vägar. Qwen-Image-2.1 släpptes den 20 september 2026 med alfa inbyggt i sitt latenta rum. GPT Image 2 fick background: "transparent" som parameter den 20 augusti 2026 i form av en API-flagga.
Två vägar till samma funktion
Transparent utdata är anledningen till att de flesta till slut jämför dessa två, så börja där, för implementationerna är inte likvärdiga och skillnaden har större betydelse än utdata.
Transparensen i Qwen-Image-2.1 är arkitektonisk. En 64-kanalig RGBA-VAE med 16× rumslig komprimering innebär att alfa är en del av det latenta rummet som modellen avbrusar i. Samma mekanism ger dig generering med transparens, redigering inuti en bild som redan har transparens utan att platta ut den, och motivutvinning från ett vanligt RGB-fotografi som returnerar alfa i stället för en binär mask. Det är en enda förmåga med tre användningsområden, och leverantörens egen beskrivning är att ingen separat nod för bakgrundsborttagning, ingen mattingmodell och inget kantstädningspass behövs.
GPT Image 2:s transparens är en begärandeparameter. Att lägga till background: "transparent" tillsammans med output_format: "png" returnerar en bild med en riktig alfakanal, och det fungerar i text-till-bild, bildredigering och bildgenereringsverktyget i Responses API. Maskbaserad inpainting och transparenta bakgrunder kan kombineras. Det släpptes i Preview, så OpenAIs egen vägledning är att resultaten kan vara instabila — och redigering med transparens beskrivs som att rita om eller ta bort en bakgrund snarare än exakt konturmattning. Minst två sekundära källor hävdar att parametern inte är tillgänglig och att GPT Image 2 inte producerar transparens alls; dessa motsäger rapporteringen om tillkännagivandet, speglingarna av API-dokumentationen och tredjepartstester, så behandla dem som inaktuella eller felaktiga snarare än som en motsignal. Transparens ändrar inte tokenkostnaden — vid en given kvalitet och storlek förbrukar en transparent bild och en ogenomskinlig bild samma bildtokens.
Så båda producerar alpha. Den ena gör det för att modellen byggdes så; den andra för att en parameter ber tjänsten om det. Vilket som är bättre beror helt och hållet på om alpha måste överleva en redigeringsloop, och det går att testa på en eftermiddag.
Vad GPT Image 2:s försprång ger dig
Fyra månader i produktion är inte ett säljargument, det är ett mognadsgap, och det visar sig på ställen som är tråkiga och avgörande.
• Oberoende ställning — GPT Image 2 ligger högst på de oberoende topplistorna för bildmodeller och har legat där tillräckligt länge för att det ska vara ett stabilt påstående snarare än en tillfällig topp under lanseringsveckan. Qwen-Image-2.1 saknades helt på dessa listor när detta skrevs.
• Dokumenterade felmoder — en modell med fyra månaders offentlig användning har en samling kända felfall som du kan läsa om innan du stöter på dem. En modell som släpptes offentligt i går har ett leverantörsresultatkort och ett enda integrationstest.
• Driftsyta — nivåindelade hastighetsbegränsningar uttryckta i både tokens per minut och bilder per minut (från 100 000 TPM och 5 IPM på instegsnivån upp till 8 000 000 TPM och 250 IPM på toppnivån), plus stöd för batch-slutpunkter. Det är skillnaden mellan en demo och en kö som du kan dimensionera.
• Kvalitetssiffror från en tredje part — placeringen på topplistan är oberoende mätt. Qwen-Image-2.1:s enda siffra är leverantörens egen Qwen-Image-Bench-tabell, där den står på 60,28 mot Nano Banana 2.0 på 59,82 och GPT Image 1.5 på 59,65. Leverantörsmaterial, ej reproducerat.
Den enda genuint oberoende datapunkten om Qwen-Image-2.1 är den funktionella verifiering som publicerades tillsammans med SGLang-integrationen: transparent PNG-utdata godkändes, alfa bevarades över hela intervallet 0–255, RGBA-PSNR uppmättes till 60,69 dB på ett enda prov, och FP8-konfigurationer godkändes för generering av transparenta PNG:er. SGLang-författarna säger uttryckligen att detta är en korrekthetskontroll och inte en allmän kvalitetsgaranti. Det är det starkaste bevis som finns för att alfakanalen är verklig. Det säger ingenting om huruvida bilderna är bra.
Räkningen, genomarbetad
GPT Image 2 faktureras per token, vilket innebär att kostnaden för en tillgång beror på kvalitetsnivå och upplösning på ett sätt som ett pris per bild döljer. Publicerade listpriser är 5,00 USD per miljon textinmatningstokens, 8,00 USD per miljon bildinmatningstokens och 30,00 USD per miljon bildutmatningstokens, med cachade priser på 1,25 respektive 2,00 USD. OpenAI publicerar ingen statisk tabell över utdata-tokens för den här modellen – den äldre tabellen som omfattar låga, medelhöga och höga tokenantal är uttryckligen markerad som att den inte gäller för GPT Image 2 – så siffrorna nedan är tredjepartsmätningar av listprissättning vid bildförhållandet 1:1, text-till-bild:
• 1K-utdata — låg kvalitet $0,0059, medel $0,053, hög $0,211 per bild.
• 2K-utdata — $0,012 låg, $0,107 medel, $0,428 hög.
• 4K-utdata — $0,020 låg, $0,178 medel, $0,712 hög.
Skillnaden mellan låg och hög kvalitet vid samma upplösning är en faktor på ungefär trettiofem. Det är det faktiska beslutet i en GPT Image 2-pipeline: inte vilken modell, utan vilken kvalitetsnivå som klarar granskning till lägsta kostnad. Och det samverkar med redigering på ett sätt som överraskar många — input_fidelity kan inte justeras för den här modellen eftersom den automatiskt bearbetar alla bildindata med hög återgivning, så en redigeringsbegäran med referensbilder förbrukar fler token för bildindata än man skulle uppskatta utifrån utdatastorleken. Loopar för generera–granska–redigera är därför dyrare här än vad siffrorna per bild antyder.
Mot det är Qwen-Image-2.1:s marginalkostnad per bild el. Haken är den fasta kostnaden och licensen. Trettiotre gigabyte att ladda ner, en DiT på cirka 14 GB där resten går till textkodaren Qwen3-VL 8B, CPU-avlastning rekommenderas på resursbegränsade kort, och allt under Qwen Research License Agreement daterat 20 september 2026 – endast icke-kommersiellt, med kommersiella rättigheter genom separat överenskommelse och inget offentliggjort pris eller villkor för dem.

Var det hostade alternativet ligger
Det finns en mellanväg som undviker både GPU- och licensfrågan, och det är den som de flesta team faktiskt väljer. OrcaRouter dirigerar OpenAI:s GPT-Image-familj vid sidan av Googles Imagen 4-nivåer och Geminis bildförhandsvisningar samt xAI:s Grok Imagine-bildendpoint — 200+ modeller bakom en enda OpenAI-kompatibel endpoint, leverantörens listpris vidarebefordrat utan påslag, automatisk failover mellan leverantörer, ett routing-DSL och modellfusion. Eftersom listpriset förs vidare i stället för att läggas på blir en leverantörs prissänkning på en dirigerad modell aktiv samma dag, och eftersom failover är automatisk blir en leverantör som har en dålig eftermiddag inte ditt avbrott. Qwen-Image-2.1 finns inte bland de modeller vi dirigerar, och inte heller någon annan Qwen-Image-version — det är en lösning som bara körs lokalt — så detta är inte ett säljsnack för nykomlingen. Det är det ärliga svaret på ”vad ska jag använda medan jag utvärderar nykomlingen”.

Beslutet, klart uttryckt
Välj GPT Image 2 om resultatet är kommersiellt, om du behöver en oberoende uppmätt lägsta kvalitetsnivå, om du vill ha kostnader per tillgång som du kan förutse och sätta ett tak för, eller om du behöver att det fungerar den här veckan utan ett hårdvaruköp. Acceptera att du hyr, att du inte kan finjustera den, att du inte kan köra den offline, och att kostnaden per bild skalar linjärt med volymen för alltid.
Välj Qwen-Image-2.1 om resultatet är forskning, utvärdering eller personligt arbete, om du specifikt vill ha alfa som överlever en redigeringsloop snarare än alfa som en parameter producerade en gång, om du vill läsa omskrivningslogiken — de levererade PE-T2I- och PE-I2I-checkpointarna är finjusterade Qwen3.5-VL 9B-modeller med en läsbar system_prompt.txt, vilket är mer än vad du får från något värdbaserat bild-API — eller om du helt enkelt vill veta vad en 7B-bildmodell med öppna vikter kan göra i september 2026 utan att betala per bild för att ta reda på det.
Välj ingendera och skicka det vidare om leverabeln är kommersiell och tidsfristen är verklig. Det är inte en undanflykt; det är alternativet som inte kräver att du löser en licensfråga som du ännu inte kan få besvarad.

