
LLaDA2.2-mini: Ant inclusionAIs Diffusion Agent-vikter dök tyst upp den 5 september.
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
Klockan 05:16 UTC den 5 september 2026 skapades ett Hugging Face-repository vid namn inclusionAI/LLaDA2.2-mini, och när detta skrivs är det i stort sett hela historien om releasen: vikterna är upplagda, modellkortet är skrivet, och leverantören — inclusionAI, Ant Group-labbet bakom LLaDA-diffusionsmodellserien — har inte sagt ett ord om det. Inget lanseringsinlägg, ingen utrullning i sociala kanaler, ingen post i modelltabellen i inclusionAI/LLaDA2.X GitHub-README, där den större LLaDA2.2-flash står ensam. Tjugofyra timmar efter att repot dök upp visade nedladdningsräknaren noll. Detta är en text om vad vi vet hittills om LLaDA2.2-mini, och disciplinen i det formatet spelar roll här, eftersom nästan varje intressant siffra kopplad till modellen är en siffra som inclusionAI skrivit in på sitt eget kort. Denna artikel skiljer det som är oberoende verifierbart om releasen från det som är leverantörsrapporterat, och den namnger de öppna frågorna snarare än att sopa dem under mattan.
Kortversionen, för den som bara vill ha formen på det hela: LLaDA2.2-mini är den lilla syskonmodellen till LLaDA2.2-flash, den diffusionsbaserade språkmodell som inclusionAI presenterade i juli 2026. Den finns nu som en mixture-of-experts-checkpoint med 16 miljarder parametrar som aktiverar endast 1,4 miljarder parametrar per token, har ett kontextfönster på 128K och är tränad för agentiskt arbete – verktygsanrop, multi-turn-korrigering – med hjälp av en diffusionsavkodare som kan infoga och ta bort tokens mitt under genereringen. Den är licensierad under Apache-2.0. Och eftersom vikterna bara är en dag gamla och inte har något tillkännagivande bakom sig finns ännu ingen av den vanliga stödstrukturen: ingen oberoende utvärdering, inget hostat API som vi kan hitta, inga driftsättningsguider utöver vad modellkortet självt rekommenderar. Det du kan verifiera idag är arkitekturen, licensen och de siffror som inclusionAI valde att publicera.
Utgåvan är ett arkiv, inte en händelse.
Börja med det som kan kontrolleras utan att lita på någon. Hugging Face API:et registrerar inclusionAI/LLaDA2.2-mini som skapad den 5 september 2026 och senast modifierad samma dag. Den är licensierad under Apache-2.0, använder safetensors-formatet med bf16-tensorer, har en chattmall och kräver trust_remote_code eftersom diffusionarkitekturen levereras som anpassad modellkod. Repots syskon, inclusionAI/LLaDA2.2-flash, skapades den 16 juli 2026, har samlat tusentals nedladdningar och dussintals gillningar under veckorna sedan dess, och tillkännagavs offentligt. Mini har varken tillkännagivandet eller användningen — under sin första dag registrerade den ensiffriga gillningar och inga nedladdningar alls.

Det enda uppmärksamhet från tredje part som mini hittills fått är en aggregatorsida som återpublicerade modellkortet inom några timmar efter att repot dök upp; det är en spegel av kortet, inte en oberoende källa, och det innehåller ingen information som själva repot inte har. Det är hela den offentliga dokumentationen per den 6 september. Den inramning som är avgörande för en läsare som överväger att bry sig: inclusionAI har nu två gånger släppt diffusionsvikter tyst under samma vecka – den här modellen den 5 september och LLaDA-Image-genereringscheckpoints dagen innan – så ett tyst repo-släpp verkar vara ett etablerat släppmönster för labbet, inte en olycka. Inget i det mönstret talar om för oss huruvida ett tillkännagivande är på väg.
Vad LLaDA2.2-mini egentligen är
Arkitekturen är där modellen är mest intressant, och den beskrivs fullständigt på modellkortet. LLaDA2.2-mini är en diffusionsspråkmodell med mixture-of-experts-arkitektur, byggd med LLaDA2.0-mini som grundstomme. Diffusionsspråkmodeller inverterar den vanliga generationsloopen: i stället för att en autoregressiv modell förutsäger en ny token i taget, utgår en diffusions-LLM från ett block av maskerade eller brusiga tokens och förfinar hela blocket parallellt, med successiv brusreducering mot en koherent sekvens. Vid LLaDA2.2-generering tillkommer det som inclusionAI kallar Levenshtein-redigering: två kontrolltokens, DELETE och INSERT, som gör att avkodaren kan ändra längden och strukturen hos den sekvens den producerar snarare än bara innehållet — genom att ta bort ett redundant segment den redan har skrivit, eller öppna en insättningspunkt där ny kontext (till exempel ett verktygsresultat) behöver komma in. Det är den mekanism som modellfamiljen använder för att få diffusionsavkodning att fungera i loopar med flera turer och verktygsanvändning, där en autoregressiv modell helt enkelt kan vänta på nästa användartur medan en blockdiffusionsmodell måste revidera det den redan har genererat.
De relevanta specifikationerna, allt direkt från modellkortet: 16 miljarder parametrar totalt exklusive inbäddningar, 1,4 miljarder aktiva per token genom en MoE med 256 experter där 8 experter dirigeras per token; 20 lager, 16 uppmärksamhetshuvuden, 4 KV-huvuden; ett vokabulär på 157 184 tokens; roterande positionsinbäddningar; och ett kontextfönster på 128K. En teknik som kallas Block Routing begränsar vilka experter som aktiveras på diffusionsblocknivå, vilket är hur modellen håller en 128K-kontext hanterbar på en enda konsument-GPU. Modellkortet positionerar det för ett grafikkort med 24 GB eller mer och rekommenderar SGLang som serveringsbackend för långkontextuella agentiska arbetsbelastningar.

Ovan är där releasen sitter i familjens tidslinje — den släktlinje som gör "LLaDA2.2-mini" begriplig. LLaDA2.0 i november 2025 var den första diffusionsspråkmodellen som skalats till 100 miljarder parametrar; LLaDA2.1 i februari 2026 lade till tokenredigering för snabbare textdiffusion; LLaDA2.2-generationen i juli 2026, som tillkännagavs med LLaDA2.2-flash och dess tekniska rapport, pekade familjen mot agenter. Mini är den del av den generationen som förblev ett löfte ända tills nu: rapporteringen om julireleasen nämnde redan en lättare 16B-variant av flashen för billigare driftsättning, men de fristående vikterna materialiserades först den 5 september.
Siffrorna på kortet, märkta som det de är.
Benchmark-tabellen på modellkortet är inclusionAIs egen, publicerad samma dag som vikterna släpptes, och inget oberoende labb har reproducerat något av den — Artificial Analysis har ingen post för LLaDA2.2-mini, och vi kan inte hitta någon tredjepartskörning. Betrakta siffrorna som leverantörens påståenden med en tendens, inte som uppmätta fakta. Inom den ramen är berättelsen som kortet berättar sammanhängande: LLaDA2.2-mini är en agentisk specialist på långa kontexter, och den offrar en del allmänna benchmark-poäng för att nå dit.
• Agentiskt genomsnitt — 59,00, från τ²-Bench 57,50, Claw-Eval 57,16 och PinchBench 62,33 (leverantörsrapporterat).
• Funktionsanrop — 47.68 på BFCL v4, upp från 25.05 och 28.44 för LLaDA2.0-mini respektive LLaDA2.1-mini; 69.02 på den äldre BFCL v3.
• Lång kontext — 34.99 på LongBench v2, mer än dubbelt så mycket som de 15.51 och 12.13 som de tidigare minis klarade, vilket är den konkreta utdelningen av 128K-fönstret.
• General — ett allmänt genomsnitt på 46.47, med AIME 2026 på 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41 och IFBench 24.93 — flera av dem något under de tidigare mini-modellerna, den synliga kostnaden för att istället spendera träningsbudgeten på agentiskt beteende.

Den sista punkten är värd att stanna upp vid, för den är den ärliga anledningen till att ett team skulle välja den här modellen framför en generalist som är starkare på pappret. LLaDA2.2-mini hävdar inte att den är den bästa lilla modellen på matematik eller instruktionsföljning; den hävdar att den är bra på det som diffusionsmodeller historiskt har varit dåliga på — uthålligt, flervarvigt, verktygsanvändande arbete — samtidigt som antalet aktiva parametrar hålls tillräckligt lågt för att göra skillnad på en enda GPU. BFCL v4-hoppet och LongBench v2-hoppet är de siffror som skulle hålla för en oberoende körning om modellkortet i stort sett stämmer.
Att köra det, och den saknade byggnadsställningen.
På pappret är vägen till att köra LLaDA2.2-mini okomplicerad, eftersom releasen är en Transformers-nativ sådan: modellkortet visar att den laddas med AutoModelForCausalLM och trust_remote_code=True på transformers ≥ 5.2.0, varefter man anropar generate med diffusionsspecifika parametrar — en blocklängd på 32 och temperatur 0.0 är de rekommenderade standardvärdena, och kortet föreslår en utdatalängd på 32 768 token för de flesta frågor. För agentbaserad servering av långa kontexter pekar det på SGLang, och användare i fastlands-Kina får en ModelScope-spegel. Det som ännu inte finns är det omgivande ekosystemet: inget värdbaserat API hos någon leverantör vi kan verifiera, inga GGUF-byggen vi kan hitta, och ramverksstöd som fortfarande håller på att stabiliseras — communityns llama.cpp-arbete med LLaDA2-arkitekturen är färskt, så kvantiseringsläget är tunt.
Den kombinationen — ett genuint nytt avkodningsparadigm, en dag gammalt, endast självhostat — är precis den situation där ett routningslager förtjänar sin plats utan att låtsas att den nya modellen är produktionsredo. Det ansvarsfulla sättet att prova LLaDA2.2-mini är att köra den själv på en testväg medan produktionen ligger kvar på en mogen modell, och det är precis vad OrcaRouters upplägg är till för: ett API som täcker över 200 modeller till leverantörens listpris med 0 % påslag, automatisk failover så att den en dag gamla kontrollpunkten inte tar ned ett arbetsflöde om den stannar upp, och routnings-DSL:et för att kombinera ett självhostat diffusionsanrop med hostade autoregressiva modeller bakom en enda nyckel. När — om — en leverantör listar LLaDA2.2-mini gäller samma pass-through, och priset du ser är leverantörens eget. Till dess är det ärliga beskedet om tillgänglighet: ladda ner Apache-2.0-vikterna från Hugging Face eller ModelScope och kör dem själv.
Vad du ska titta på härnäst
Tre saker skulle göra det vi känner till hittills till en riktig historia, och alla tre saknas i dag. För det första, ett tillkännagivande: om LLaDA2.2-flash-mönstret håller, skulle ett lanseringsinlägg och en teknisk rapport som täcker det kunna följa på det tysta repo-släppet, och det skulle sannolikt tillföra träningsdetaljer som modellkortet utelämnar. För det andra, en oberoende körning: det agentiska genomsnittet på 59,00 och BFCL v4-poängen på 47,68 är de påståenden som är mest värda att reproducera, eftersom agentiska riktmärken är de där valet av harness påverkar poängen mest. För det tredje, serving-mognad: SGLang-serveringsguider, en vLLM-väg och communityns kvantiseringar skulle tala om för dig huruvida fotavtrycket med 1,4B aktiva parametrar är lika billigt att driva i praktiken som specifikationsbladet antyder. Inget av detta existerar den 6 september. Vikterna är äkta, licensen är tillåtande, och arkitekturen är verkligen ett annorlunda sätt att köra en agent — men beviset för att det är en bra agent är, för närvarande, en leverantörs modellkort.
