
GPT-Image-2.5 vs LLaDA-Image: Ett $30/M-Token-API mot en gratis 6B-diffusionsmodell
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
Frågar man vad bildgenerering borde kosta, så byggde två labb de två motsatta svaren inom en vecka från varandra. Den 8 september 2026 släppte OpenAI GPT-Image-2.5 – modellen bakom ChatGPT Images 2.5, såld via API:et som GPT-Image-2.5 Flare och GPT-Image-2.5 Sunburst – prissatt på en tokenprislista till 8 dollar per miljon tokens för bildinmatning och 30 dollar per miljon tokens för bildutdata. Fem dagar tidigare, den 4 september, släppte inclusionAI (det Ant Group-stödda labbet bakom LLaDA-språkfamiljen) tyst LLaDA-Image, en diffusions-transformer-baserad bildgenerator och -redigerare med sex miljarder parametrar, vars vikter går att ladda ner kostnadsfritt. Den ena är den mest kommersiellt kraftfulla bildmodell som OpenAI någonsin har satt bakom en tokenmätare; den andra är ett försök att bevisa att en stark bildmodell kan byggas med ett öppet träningsrecept och ges bort. Att jämföra dem är mindre en direkt match än ett beslut om vilken definition av kostnad du faktiskt betalar.
Nästan alla siffror på GPT-Image-2.5-sidan är leverantörsrapporterade och ingen av dem har ännu oberoende kontrollerats: OpenAI säger att Flare minskar latensen med upp till 50 % jämfört med GPT-Image-2 och att oberoende tester från agentföretaget Manus uppmätte 2–4× snabbare generering, men från och med den 9 september 2026 har ingen av GPT-Image-2.5-modellerna en post på Artificial Analysis bildleaderboards. LLaDA-Images huvudsiffra är lika lite oberoende reproducerad — inclusionAI rapporterar 53.53 på engelska / 53.38 på kinesiska på Qwen-Image-Bench, först bland modeller med öppna vikter vid lanseringen — och eftersom modellen inte har något värdbaserat API kan den inte alls förekomma på API-only-leaderboards. Båda sidorna i denna jämförelse bygger på sina tillverkares egna påståenden, vilket är värt att hålla fast vid genom resten av den här texten.
Två modeller som knappt delar en kategori
GPT-Image-2.5 är en värdbaserad, sluten bildmodell i samma släktlinje som ChatGPT Images 2.0 från april 2026. Den är multimodal på inmatningssidan och producerar bilder som OpenAI hävdar är skarpare i fina detaljer, mer naturliga i ljussättning och textur samt stabilare över flera redigeringsomgångar — Sunburst-endpointen finns specifikt för redigeringsintensivt produktionsarbete där långsammare generering är acceptabel i utbyte mot striktare instruktionskontroll, medan Flare är det snabba standardalternativet för högvolymsgenerering. Utdata kan vara upp till 2048×2048 och 3840×2160, transparenta bakgrunder stöds, och varje utdata bär C2PA-proveniensmetadata plus en osynlig vattenstämpel.
LLaDA-Image är en öppen release av forskningstyp som bygger på en helt annan satsning. Där GPT-Image-2.5 levereras via OpenAIs infrastruktur, är LLaDA-Image en uppsättning vikter som du kör själv: en diffusionstransformator (DiT) med 6 miljarder parametrar på generationssidan — modellkortet anger cirka 7B parametrar när språksidan räknas med — kombinerad med LLaDA 2.0-mini, en diffusionsspråkmodell med mixture-of-experts-arkitektur på totalt 16B / 1B aktiva parametrar, som ”förståelsesidan” som omvandlar textuppmaningar eller redigeringsinstruktioner till den signal som DiT följer. Det ovanliga påståendet i arXiv-rapporten (2609.03796) är träningsreceptet: mer än 90 % av cirka 220 miljoner kumulativa förtränings- och mellanliggande träningsprover är enbart bilder, med en fryst vision-språkmodell som extraherar semantik från olabelerade bilder som en självbetingande signal, så att modellen ”lär sig rita först, sedan lyda.” Progressiv upplösning tar träningen från 256×256 via 512×512 upp till 1024×1024 finjustering, följt av blandad träning för text-till-bild och redigering samt en TwinFlow-destillation med få steg som producerar LLaDA-Image-Turbo-varianten.
Vad var och en faktiskt är bra på
GPT-Image-2.5:s säljargument är precision och kontroll i kommersiell kvalitet. OpenAIs tillkännagivande betonar referensträffsäkerhet — att hålla en person, ett husdjur eller en produkt igenkännbar när miljön eller stilen ändras — och redigering som bara ändrar det man bett om, bestående över många redigeringsomgångar i en enda konversation. Textåtergivning i bilder lyfts specifikt fram, inklusive elimineringen av förvrängda kinesiska tecken som plågade tidigare bildmodeller. Det är precis de förmågor som ett produkt-, varumärkes- eller reklamteam behöver gång på gång.
LLaDA-Images huvudargument är en enda uppsättning vikter som klarar tvåspråkig generering och instruktionsstyrd redigering med ett öppet recept. inclusionAI rapporterar nativ textåtergivning på kinesiska och engelska, en redigeringsväg som injicerar referensbilder genom en dubbelvägsdesign utformad för att bevara oförändrat innehåll, och — på Qwen-Image-Bench — de högsta poängen bland öppna vikter vid lanseringen. De ärliga förbehållen från lanseringen är att perceptuell redigeringskvalitet fortfarande ligger efter specialiserade redigerare och att objekträkning fortfarande är svag. Det är en generalistisk öppen modell, inte en färdig kommersiell produkt.

Poängtavlan är medvetet inte en tävling om bildkvalitet — de två modellerna har aldrig visats samma utvärdering. Det den visar är vart pengarna och kontrollen flödar.
Priset för en bild är det nummer som ingen sida kommer att ge dig
{{1}}OpenAI publicerar en tokenprislista för GPT-Image-2.5 som är identisk med GPT-Image-2:s: 8 dollar per miljon bild-input-tokens, 30 dollar per miljon bild-output-tokens, cachad bildinput till 2 dollar, och texttokens faktureras separat med 5 dollar per miljon.{{/1}} {{2}}Vad som inte publiceras är hur många tokens en viss bild förbrukar, vilket innebär att det inte finns något officiellt pris per bild och ingen kostnadskalkylator.{{/2}} {{3}}Vid AA:s listpris för föregångaren på dess ledartavla — cirka 211 dollar per 1 000 bilder för GPT Image 2 vid "hög" kvalitet — är en token-mätt flaggskeppsmodell ett dyrt verktyg i större volymer, men den siffran gäller GPT-Image-2, inte 2.5, och kostnaden per bild för den nya modellen är i praktiken okänd utanför OpenAI.{{/3}}
LLaDA-Image har det motsatta ärlighetsproblemet. Vikterna kostar ingenting och kortet har en Apache-2.0-märkning, men det verkliga priset är infrastrukturen: en 6B-diffusionstransformator kräver en rejäl GPU för 50-stegs Base-varianten, och FP8-checkpoints (cirka 49 GB i en diffusers-layout) är det praktiska alternativet för de flesta användare. LLaDA-Image-Turbos 2–4-stegsdestillation är eftergiften till den verkligheten. Communityns verktyg har utvecklats snabbt — en pull request för SGLang lägger till stöd för text-till-bild, redigering, sekvensparallellism och FP8, och ett RebelAI ComfyUI-nodpaket stöder INT8- och GGUF-kvantiserad lokal inferens — men "gratis modell" betyder fortfarande "du är hostingleverantören." För ett team som redan driver GPU-kapacitet närmar sig marginalkostnaden för LLaDA-Image noll; för alla andra kan den samlade kostnaden för att driva den överstiga användningsbaserade API-fakturor när man räknar in ingenjörstid.
Den ärliga vägen om du vill ha båda.
Detta är inte antingen-eller för de flesta team. En produktionspipeline kan använda ett värdbaserat API som GPT-Image-2.5 för det kundvända, redigeringstunga arbete som inte får misslyckas, och behålla en öppen modell som LLaDA-Image för experiment, offline-batchjobb och allt som inte kan skicka prompts till en tredje part. Den uppdelningen är precis den typ av problem som ett routningslager är byggt för — ett API som når de värdbaserade modeller du faktiskt använder, där leverantörens listpris förs vidare utan påslag, så att det senare kostar lika mycket att prova en öppen viktmodell via en värdbaserad route som att gå direkt till leverantören. Ingen av modellerna finns i OrcaRouters katalog per den 9 september 2026: GPT-Image-2.5 är endast OpenAI-API för nu (den tidigare generationen, GPT-Image-2, är routad), och LLaDA-Image är endast vikter utan värdbaserad inferens. Designavsikten står sig oavsett dagens katalog.

Vilken bör du bygga på?
Om ditt arbete är kommersiell bildgenerering där en misslyckad redigering kostar en kundrelation — produktbilder, kampanjmaterial, referenskonsekventa bilder, långa flervarviga redigeringssessioner — är GPT-Image-2.5 modellen vars hela design riktar sig mot just det jobbet, och Sunburst-endpointen är anledningen att uppmärksamma den redan innan oberoende poäng finns. Riskerna är prisopaciteten per bild och det faktum att varje kvalitetspåstående är OpenAIs eget. Om ditt arbete är forskning, storskalig experimentering, kinesisk- och engelskspråkig tvåspråkig generering, eller något som måste köras i din egen miljö eller på dina egna data, är LLaDA-Image den mer intressanta releasen — genuint öppna vikter med ett publicerat recept, till priset av att vara din egen infrastruktur och leva med ej reproducerade poäng. Modellerna släpps med en veckas mellanrum och är världar ifrån varandra i operativ modell; rätt val är den som matchar den kostnad du faktiskt kan betala.

