
Qwen-Image-2.1 vs GPT-Image-2.5: Gapet är en enda siffra, och det handlar inte om kvalitet
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ställ Qwen-Image-2.1 och GPT-Image-2.5 sida vid sida när det gäller specifikationerna, och de ser ut som syskon: båda är enhetliga bildmodeller för generering och redigering, båda ger utdata med transparent bakgrund, båda har släppts under de senaste fem veckorna, båda klarar stillbilder i 2K-klass. Skillnaden som avgör valet mellan dem är en enda siffra, och det är inte en benchmark-poäng. Qwen-Image-2.1 är gratis att ladda ner och omöjlig att sälja. GPT-Image-2.5 är omöjlig att ladda ner och trivial att sälja. Allt annat – arkitekturen, latensen, implementeringen av transparens – följer av det. Qwen-Image-2.1 släpptes med öppen källkod den 20 september 2026; GPT-Image-2.5 tillkännagavs med sina API-modeller i drift den 8 september 2026.
Två sätt att lägga till transparens, med en månads mellanrum
Att båda modellerna fick transparent utdata med bara några veckors mellanrum är ett sammanträffande som är värt att förstå, eftersom de två implementationerna inte är likvärdiga.
Qwen-Image-2.1 lägger in alfa i själva modellen. Den avbrusar i ett 64-kanaligt RGBA-latentutrymme med 16× rumslig komprimering, så alfakanalen är en förstklassig komponent i det som samplern producerar. Det finns inget segmenteringssteg och ingen matting-genomgång. Vid sidan av detta finns en ovanlig extrafunktion: eftersom modellen per prompt kan avgöra om den ska skicka ut RGB eller en bild med alfakanal, kan den också lyfta ut ett motiv ur ett vanligt fotografi och lämna tillbaka ett transparent lager i stället för en binär mask.
GPT-Image-2.5 tar parameter-vägen. OpenAIs API accepterar en background-inställning på auto, opaque eller transparent, och modellen svarar därefter. Det är en kapacitetsväxel på en hostad endpoint snarare än en egenskap hos det latenta rummet, och det kommer med fördelen att du inte behöver tänka på det: sätt flaggan, få en utskärning, gå vidare. Avvägningen är att du får vad endpointen ger dig, vid den upplösning och kostnad som endpointen bestämmer.
Vilken som är bättre är genuint oavgjort. Ingen offentlig jämförelse av Qwen-Image-2.1:s alfakanter mot en dedikerad matting-modell fanns vid tiden för skrivandet, och den enda publicerade kontrollen på Qwen-sidan är en funktionell sådan – transparent PNG-utdata godkändes, alfa bibehölls över hela intervallet 0–255, RGBA-PSNR på 60,69 dB i ett enda prov. Det är en korrekthetskontroll, inte ett kvalitetsomdöme. Det säger att kanalen är verklig.
Vad du faktiskt kan mäta
• Parametrar — Qwen-Image-2.1:s genereringskomponent är en 7B, 32-lagrig enkelströms-diffusionstransformer, parad med en Qwen3-VL 8B-textkodare; ungefär 33 GB vikter totalt, varav DiT står för cirka 14 GB. OpenAI publicerar inget parameterantal för GPT-Image-2.5.
• Upplösning — Qwen-Image-2.1 genererar nativt upp till 2048×2048 vid 40 inferenssteg med sju förinställningar för bildförhållande. GPT-Image-2.5 accepterar storlekar upp till 3840×2160 och 2160×3840, där varje kant är begränsad till 3840 px och måste vara en multipel av 16.
• Referensbilder — Qwen-Image-2.1 tar emot upp till 10 för komposition med flera motiv och virtuell provning. OpenAI:s bildmodeller accepterar referensindata för redigering, men den praktiska gränsen och beteendet för återgivningstrohet skiljer sig mellan modeller och kvalitetsnivåer.
• Latens — SGLang-Diffusion publicerar 2,748 s för en 1024×1024-generering med 40 steg på en enda B200, och 4,74 s på ett 24 GB RTX 4090 med Cache-DiT och INT8-kärnor, endast avbrusning. OpenAI rapporterar att GPT-Image-2.5:s Flare-variant har upp till 50 % lägre latens än GPT-Image-2, där en lanseringspartner mäter 2–4× — leverantörsrapporterat respektive partnerrapporterat, inte en kontrollerad jämförelse.
• Pris — Qwen-Image-2.1 har inget pris för hostad tjänst eftersom det inte finns någon hostad slutpunkt; kostnaden är din egen GPU-tid. GPT-Image-2.5 faktureras enligt samma tokenpriser som GPT-Image-2: $8.00 per 1M bildindatatoken, $30.00 per 1M bildutdatatoken, $5.00 per 1M textindatatoken.
• Licens — Qwen-Image-2.1 levereras under Qwen Research License Agreement daterat 20 september 2026, endast för icke-kommersiell användning. GPT-Image-2.5 är ett kommersiellt API med C2PA-härkomst och en osynlig vattenstämpel på utdata.
En rad i den listan är tunnare än den ser ut. OpenAI publicerar inga priser per bild för GPT-Image-2.5, bara tokenpriser, och förbrukningen av bildtokens varierar med upplösning och kvalitetsnivå. Tredjepartsmätningar anger intervallet från ungefär $0,0059 till $0,712 per bild över 1K, 2K och 4K vid låga, medelhöga och höga inställningar i bildförhållandet 1:1 – användbart som storleksordning, inte som en offert. Om du gör prognoser bör du bygga uppskattningen utifrån antal tokens och din egen promptfördelning, inte utifrån en siffra per bild som någon annan har mätt.

De två kostnaderna som ingen sätter i samma kolumn
Anledningen till att den här jämförelsen inte kan besvaras enkelt är att de två modellerna fakturerar dig i olika valutor, och växelkursen är din egen situation.
GPT-Image-2.5 fakturerar per token, vilket innebär att mätaren är synlig, förutsägbar och skalar linjärt med volymen. Det är en genuin fördel för en produkt med känd trafik: du kan lägga in den i en budget, och en prissänkning från leverantören förändrar din kostnad samma dag. Det är också en skatt på utforskning, eftersom den tionde iterationen av en prompt kostar lika mycket som den första. Det input_fidelity-beteendet gör detta skarpare än vad rubrikpriserna antyder — API:et kan automatiskt tillämpa hög återgivning på bildindata, vilket förbrukar fler indatatokens än en flyktig läsning av prislistan antyder, så redigeringsloopar kostar mer än de per bild-siffror folk citerar.
Qwen-Image-2.1 inverterar båda egenskaperna. Marginalkostnaden för den hundrade genereringen är el. Det gör den till det bättre verktyget för iteration, för batchvisa återfyllningar och för allt där prompten fortfarande utforskas. Vad den inte ger dig är en siffra för finansbladet – du betalar för en GPU oavsett om den är upptagen eller ledig – och den ger dig inte rätt att sälja resultatet. Qwen Research License Agreement tillåter icke-kommersiell forskning och utvärdering och anger att kommersiell driftsättning kräver en separat licens från Hangzhou Tongyi Laboratory Technology. Det finns inget publicerat pris för den licensen och inga angivna villkor. Det är inte en fotnot; för en kommersiell pipeline är det hela beslutet.
Kör båda utan ett andra avtal
Det realistiska svaret för de flesta team är varken det ena eller det andra – det är båda. GPT-Image-2.5 hanterar produktionsvägen där resultatet skickas till en kund och mätaren per token är en egen kostnadspost. Qwen-Image-2.1 hanterar utforskningsvägen där du behöver tvåhundra varianter av en transparent produktbild och ingen leverantör säljer den volymen till ett rimligt pris.
Friktionen är att de två anländer via helt olika vägar. Den ena är en API-nyckel. Den andra är en nedladdning på 33 GB, en Python-miljö och en GPU som du äger. OrcaRouter täcker den hostade halvan: 200+ modeller bakom en OpenAI-kompatibel endpoint, leverantörens listpris förs vidare utan påslag, automatisk failover mellan leverantörer, ett routing-DSL för att uttrycka fallbacks och modellfusion för att kombinera flera modeller i ett enda anrop. Att vara precis om den här modellen är viktigt – vi routar inte GPT-Image-2.5 i dag; våra OpenAI-bildrutter är GPT-Image-2, GPT-Image-1.5 och GPT-Image-1-mini, alla till OpenAI:s listpris, och den dag en uppströmsleverantör lägger till identifierarna gpt-image-2.5 kommer samma nyckel att anropa dem utan kodändring. Vi routar inte heller någon Qwen-Image-modell av någon version, så Qwen-Image-2.1 är inte alls en rutt hos oss. Vad prissättningen utan påslag ger dig under tiden är att när OpenAI ändrar ett pris, flyttas siffran hos oss med det i stället för med eftersläpning.
Domen, formulerad som ett villkor snarare än en vinnare.
Om utdata måste säljas, är det inte ens nära: GPT-Image-2.5 är den enda av de två som du har licens att använda, och tokenmätaren är priset för det. Om utdata är forskning, interna verktyg eller utvärdering, är Qwen-Image-2.1 det starkare instrumentet — native 2K, alpha direkt från samplern, tio referensbilder och en marginell kostnad på noll när hårdvaran väl är betald. Om du behöver båda, kör båda och behandla licensen som gränsen som avgör vilken pipeline ett givet jobb hamnar i.
Två saker skulle ändra på detta. Ett publicerat kommersiellt term sheet för Qwen-Image-2.1 skulle eliminera gapet i licensraden, som för närvarande gör det mesta av jobbet i den här jämförelsen. Och en oberoende post i en bildtopplista för Qwen-Image-2.1 skulle berätta för oss om leverantörens Qwen-Image-Bench-resultat – 60,28, före Nano Banana 2.0 på 59,82 och GPT Image 1.5 på 59,65, först bland öppna modeller – står sig utanför laboratoriet som tog fram det. Ingen av dem finns ännu. Tills de gör det är den ärliga rekommendationen att välja utifrån licensen och mätaren, inte utifrån resultattavlan.


