
LLaDA-Image-Turbo: Ant Group släppte tyst en 4-stegs öppen bildgenerator
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1542Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
Den 4 september 2026 publicerade Ant Groups open source-labb inclusionAI vikter för LLaDA-Image-Turbo och LLaDA-Image på Hugging Face – utan lanseringsinlägg, utan pressmeddelande och, i skrivande stund, utan någon deklarerad licens på något av de fyra repositories som labbet skapade. LLaDA-Image-Turbo är den snabba delen av releasen: en destillerad checkpoint som enligt modellkortet förvandlar en prompt eller en redigeringsinstruktion till en 1024×1024-bild i fyra samplingssteg, jämfört med femtio för basmodellen LLaDA-Image, som den destillerades från. Det som gör den tysta releasen värd att läsa om är en enda leverantörsrapporterad rad i modellkortet – state-of-the-art bland open source-modeller på Qwen-Image-Bench – och det som gör den svår att agera på är allt runtomkring den raden som releasen ännu inte säger.
Detta är en rapport från dag ett, inte en recension. Checkpoints är verkliga och nedladdningsbara, den Diffusers-baserade inferenskoden körs från ett klonat repository, och den medföljande uppsatsen, LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes, publicerades på arXiv den 3 september 2026. Men det finns inget tillkännagivande från inclusionAI eller Ant Group att stämma av mot, och när detta skrivs visade LLaDA-Image-Turbo-repot två nedladdningar – enligt alla synliga mått har ingen utanför labbet kört det ännu. Allt nedan är uppdelat därefter: vad repona faktiskt innehåller, vad uppsatsen hävdar, och vad som skulle behöva hända innan LLaDA-Image-Turbo är något ett produktionsteam bör satsa på.
Vad som faktiskt levererades
Fyra checkpoints publicerades på Hugging Face under organisationen inclusionAI under småtimmarna den 4 september 2026 (UTC): LLaDA-Image, basmodellen med femtio steg i BF16; LLaDA-Image-FP8; LLaDA-Image-Turbo, den destillerade snabba checkpointen i BF16; och LLaDA-Image-Turbo-FP8. Modellkortets egen nyhetsrad, daterad 2026-09-04, är hela det formella tillkännagivandet: "Vi släppte LLaDA-Image Base- och Turbo-checkpoints tillsammans med inferenskoden." Ett GitHub-arkiv under samma organisation innehåller inferenskoden, och arXiv-rapporten publicerades dagen innan.
Repositories är inte stubs. Varje Turbo-repo innehåller en fullständig Diffusers-pipeline — en shardad diffusion-transformer-generator, en SigVQ-bildtokeniserare, en query-former-koppling, en scheduler och en textkodare med nio shards — så "modellen" här är inte ett platshållarnamn utan tiotals gigabyte av körbara vikter. Familjen beskrivs som en bildgenererings- och redigeringsmodell med 6 miljarder parametrar; strikt läst är 6B-siffran diffusion-transformer-stommen som tränats från grunden, med en frusen diffusion-språkmodul från labbets LLaDA2-linje (textkodaren med nio shards) som lägger till förståelse ovanpå.

Varför fyrstegsdelen är rubriken.
För en bilddiffusionsmodell handlar kostnaden mest om samplingsteg. Varje steg är ett fullt pass genom nätverket, så skillnaden mellan en modell med femtio steg och en med fyra steg är ungefär en storleksordning i beräkning per bild innan något annat — upplösning, batchstorlek, hårdvara — ens beaktas. Det är hela poängen med "Turbo"-linjen i den här utgåvan. inclusionAI destillerade LLaDA-Image till LLaDA-Image-Turbo med en teknik de kallar Twin-DMD, och den destillerade checkpojnten körs i två till fyra steg, med fyra rekommenderade, vid en guidance-skala på 1.0 jämfört med basmodellens 5.0. Samma pipeline-objekt, samma prompt, samma 1024×1024-utdata — en bråkdel av denoising-passen.
Förbehållet är det vanliga för destillerade bildmodeller, och det är skarpare här än vanligt: destillation byter lite trohet mot hastighet, och inclusionAI har inte publicerat några benchmarksiffror för LLaDA-Image-Turbo alls. Qwen-Image-Bench-poängen i modellkortet tillhör Base-checkpointen med femtio steg. Så det faktiska kvalitetsgapet mellan LLaDA-Image-Turbo vid fyra steg och LLaDA-Image vid femtio steg är inte kvantifierat av leverantören och inte heller testat av någon annan ännu — vilket gör ”Turbo” till ett hastighetspåstående som du bara kan verifiera genom att köra den.
En kontrollpunkt som genererar och redigerar
Den arkitektoniska satsningen bakom familjen är enhetlighet. En enda uppsättning vikter hanterar text-till-bild-generering, VQ-villkorad generering, referensbildsredigering och kinesisk-engelsk textåtergivning — utan separat redigeringsryggrad, vilket är anledningen till att "redigerings"-delen av releasen inte levereras som en egen modell. I redigeringsläge dirigeras referensbilden förbi språkmodulen och injiceras direkt i diffusionsmodellen, medan språkmodulen enbart bearbetar instruktionen; kortet hävdar trogen innehållsbevarande med precisa visuella ändringar, tillsammans med fotorealistisk generering och ren typografisk text på båda språken.
Två tekniska detaljer är värda att notera redan från dag ett. Generatorn är en diffusionstransformator med 6 miljarder parametrar, tränad från grunden med parameterfri RMSNorm och Muon-optimeraren – detaljer som uppsatsen redovisar i stället för att svepa förbi. Och skildringen av träningen i uppsatsen är en medveten omvändning av det vanliga bild–text-receptet: förträning och mellanträning på enbart bilder bygger först upp en stark visuell prior, och först därefter inför labbet parad språklig övervakning och gemensam träning för generering och redigering. Den ordningen – och ”Helt öppna träningsrecept” i uppsatsens titel – är det som gör forskningen lockande. Notera glappet mellan uppsatsens inramning och Hugging Faces utgivningsplan: vikterna och inferenskoden är avprickade, men träningskoden är fortfarande märkt ”kommer snart”.

Att läsa påståendet 53.53 / 53.38
Den siffra som kommer att cirkulera är benchmarkresultatet: på Qwen-Image-Bench, ett text-till-bild-benchmark med separata engelska och kinesiska spår, rapporterar inclusionAI att LLaDA-Image får 53,53 totalt på det engelska spåret och 53,38 på det kinesiska, vilket företaget kallar ny state-of-the-art bland open source-modeller på båda spåren. Läser man det noggrant framträder tre begränsningar. Den är leverantörsrapporterad, baserad på labbets egen utvärdering och har ännu inte reproducerats någonstans. Den gäller den femtio steg långa LLaDA-Image Base-modellen, inte LLaDA-Image-Turbo, den checkpoint som denna release formellt sett handlar om. Och ”open-source state-of-the-art” är en kategori som förändras varje månad – det är ett påstående om var modellen står i förhållande till sina öppna motsvarigheter, inte ett påstående om den stängda fronten.
Det figuren berättar för dig är varför familjen finns. En kinesisk-engelsk text-till-bild- och redigeringsmodell som toppar ett öppet riktmärke i båda spåren är riktad rakt mot den snabbrörliga marknaden för öppna bildmodeller – samma segment där Qwen-Image-familjens checkpoints och en stadig ström av andra öppna vikter har satt takten. Om LLaDA-Image-Turbo återger även det mesta av Base-modellens kvalitet vid fyra steg, blir den en av de billigaste öppna bildmodellerna att köra med ett trovärdigt kvalitetsanspråk bakom sig. ”Om” gör jobbet i den meningen.
De luckor som hindrar ett tyst skepp från att vara en sjösättning.
• Ett tillkännagivande. Raden daterad 2026-09-04 på modellkortet är leverantörens enda uttalande. Det finns inget inclusionAI-blogginlägg, ingen Ant Group-release, inget inlägg i sociala medier, ingen pressbevakning utöver aggregatorer — vilket i sig är en signal värd att respektera snarare än att sopa under mattan.
• En licens. Inget av de fyra Hugging Face-repositories har någon licensmärkning, och GitHub-repositoriet har ingen LICENSE-fil — bara en tvåspråkig LEGAL.md-notis som säger att kinesiska kommentarer i koden gäller framför översatta sådana. Man kan inte förutsätta kommersiella rättigheter till vikter utan deklarerad licens, oavsett hur ”öppen” artikelns titel låter. För den vars användning är kommersiell är detta den första frågan, och den har för närvarande inget svar.
• Turbo-siffror. Inga prestandatest, latens- eller kvalitetssiffror publiceras specifikt för LLaDA-Image-Turbo. Resultattavlan ovan tillhör basmodellen; den destillerade kontrollpunkten är ett okvantifierat påstående tills leverantören eller en oberoende körning fyller i den.
• Oberoende verifiering och värdbaserad åtkomst. Nedladdningar och gillanden är i ensiffriga tal, ingen oberoende reproduktion finns, och ingen inferensleverantör vi kan hitta — inklusive OrcaRouter — erbjuder modellen ännu. Idag är det vikter på Hugging Face och inget annat.
Vad man ska göra med ett en dag gammalt, tyst skepp
Om du är forskare eller ett team som självhyschar, är detta en release att klona och köra denna vecka: öppna vikter, en Diffusers-pipeline, en BF16- och en FP8-variant för att väga minne mot kvalitet, och en artikel som berättar hur den tränades redan innan träningskoden släpps. Om din användning är kommersiell kommer licensgapet först – en fyrstegs bildmodell med ett rimligt kvalitetsanspråk är inte värd en juridisk risk, och det ansvarsfulla är att utvärdera på din egen GPU och vänta på licensvillkoren innan du lägger den i närheten av en produkt.
Fyra saker skulle förvandla detta tysta skepp till en sjösättning värd att bygga vidare på, och ingen av dem har inträffat per den 4 september 2026:
• Ett verkligt tillkännagivande från inclusionAI eller Ant Group, som namnger familjen och dess villkor.
• En deklarerad licens på repositoryn — Apache-2.0 skulle matcha labbets bredare open-weights-praxis och undanröja det kommersiella hindret.
• Publicerade LLaDA-Image-Turbo-poäng, eller en oberoende reproduktion av basmodellens Qwen-Image-Bench-resultat.
• En värdbaserad leverantör som tar upp den, vilket också är det ögonblick då modellen får ett pris per bild och blir något som ett routnings-API kan ge dig i ett enda anrop.

När den sista signalen utlöses — om den utlöses — är priskalkylen enkel: leverantören sätter listpriset, och ett routing-API som skickar leverantörens listpriser rakt igenom med 0 % påslag är det som håller priset aktuellt hos dig samma dag, utan omförhandling och utan ett andra kontrakt. Men den dagen har inte kommit för LLaDA-Image-Turbo, och ingenting i den här texten ska läsas som om den hade kommit. Idag är den ärliga sammanfattningen kort: ett seriöst labb släppte i det tysta en seriös öppen bildmodell med ett verkligt kvalitetsanspråk och flera olösta frågor, och det snabbaste sättet att ta reda på vilka delar av anspråket som överlever kontakt med verkligheten är att köra fyrstegscheckpointen själv.
