
LLaDA2.2-mini: Ant inclusionAI's Diffusion Agent-gewichten verschenen stilletjes op 5 september.
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0455Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0247Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0247Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0157Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2646Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1541Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1251Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0547Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligentie49Coderen
Op 5 september 2026 om 05:16 UTC ontstond een Hugging Face-repository genaamd inclusionAI/LLaDA2.2-mini, en op het moment van schrijven is dat vrijwel het hele verhaal van de release: de gewichten staan online, de modelkaart is geschreven, en de leverancier — inclusionAI, het Ant Group-lab achter de LLaDA-diffusiemodellenlijn — heeft er niets over gezegd. Geen lanceringsbericht, geen social-media-uitrol, geen vermelding in de modellentabel van de inclusionAI/LLaDA2.X GitHub-README, waar de grotere LLaDA2.2-flash er alleen bij staat. Vierentwintig uur nadat de repository verscheen, stond de downloadteller op nul. Dit is een wat-we-tot-nu-toe-weten-stuk over LLaDA2.2-mini, en de discipline van dat format is hier belangrijk, omdat bijna elk interessant getal dat aan het model is gekoppeld, een getal is dat inclusionAI zelf op zijn eigen kaart heeft getypt. Dit artikel scheidt wat onafhankelijk verifieerbaar is aan de release van wat door de leverancier is gerapporteerd, en het benoemt de open vragen in plaats van ze glad te strijken.
De korte versie, voor wie alleen de grote lijnen wil: LLaDA2.2-mini is de kleine tegenhanger van het LLaDA2.2-flash diffusietaalmodel dat inclusionAI in juli 2026 aankondigde, nu beschikbaar als een mixture-of-experts-checkpoint met 16 miljard parameters waarvan er per token slechts 1,4 miljard worden geactiveerd, een context van 128K verwerkt, en getraind is voor agentisch werk — tool calling, multi-turn-correctie — met behulp van een diffusiedecoder die tijdens het genereren tokens kan invoegen en verwijderen. Het is Apache-2.0. En omdat de gewichten één dag oud zijn zonder dat er een aankondiging aan voorafging, bestaat de gebruikelijke ondersteuning nog niet: geen onafhankelijke evaluatie, geen gehoste API die we kunnen vinden, geen serving-handleidingen behalve wat de modelkaart zelf aanbeveelt. Wat je vandaag kunt verifiëren is de architectuur, de licentie en de cijfers die inclusionAI heeft gekozen te publiceren.
De release is een repository, geen evenement.
Begin met wat gecontroleerd kan worden zonder iemand te vertrouwen. De Hugging Face API vermeldt inclusionAI/LLaDA2.2-mini als aangemaakt op 5 september 2026 en voor het laatst gewijzigd op dezelfde dag. Het is gelicenseerd onder Apache-2.0, gebruikt het safetensors-formaat met bf16-tensors, bevat een chat-template en vereist trust_remote_code omdat de diffusiearchitectuur als aangepaste modelcode wordt meegeleverd. De zuster-repo, inclusionAI/LLaDA2.2-flash, is op 16 juli 2026 aangemaakt, heeft in de weken erna duizenden downloads en tientallen likes verzameld en is publiekelijk aangekondigd. De mini heeft noch de aankondiging, noch de adoptie gekend — op de eerste dag waren er slechts enkele likes en helemaal geen downloads.

Het enige dat de mini tot nu toe aan aandacht van derden heeft getrokken, is een aggregatiepagina die de modelkaart binnen enkele uren nadat de repo online kwam opnieuw publiceerde; het is een kopie van de kaart, geen onafhankelijke bron, en bevat geen informatie die niet ook in de repo zelf staat. Meer is er per 6 september publiekelijk niet bekend. De framing die telt voor een lezer die moet bepalen of dit aandacht verdient: inclusionAI heeft inmiddels twee keer in dezelfde week stilletjes diffusiegewichten uitgebracht — dit model op 5 september, en de LLaDA-Image-generatiecheckpoints de dag ervoor — dus een stille repo-drop lijkt voor het lab een vast uitbrengpatroon, geen toeval. Niets aan dat patroon vertelt ons of er een aankondiging komt.
Wat LLaDA2.2-mini eigenlijk is
De architectuur is waar het model het interessantst is, en die wordt volledig beschreven op de modelkaart. LLaDA2.2-mini is een mixture-of-experts diffusietaalmodel dat is gebaseerd op de backbone van LLaDA2.0-mini. Diffusietaalmodellen keren de gebruikelijke generatielus om: in plaats van een autoregressief model dat telkens één volgend token voorspelt, vertrekt een diffusie-LLM van een blok gemaskeerde of met ruis belaste tokens en verfijnt het hele blok parallel, waarbij het de ruis verwijdert tot een coherente reeks. De LLaDA2.2-generatie voegt toe wat inclusionAI Levenshtein-editing noemt: twee controletokens, DELETE en INSERT, waarmee de decoder de lengte en structuur van de sequentie die hij produceert kan wijzigen in plaats van alleen de inhoud — bijvoorbeeld het verwijderen van een overtollige passage die hij al heeft geschreven, of het openen van een invoegpunt waar nieuwe context (zeg, een toolresultaat) moet komen. Dat is het mechanisme dat de familie gebruikt om diffusie-decodering te laten werken in multi-turn loops met toolgebruik, waarin een autoregressief model simpelweg kan wachten op de volgende gebruikersbeurt, maar een blokdiffusiemodel moet herzien wat het al heeft gegenereerd.
De relevante specificaties, allemaal rechtstreeks van de modelkaart: 16 miljard totale parameters, exclusief embeddings, 1,4 miljard actieve parameters per token via een MoE met 256 experts, waarvan er 8 per token worden gerouteerd; 20 lagen, 16 attention-heads, 4 KV-heads; een vocabulaire van 157.184 tokens; rotary positie-embeddings; en een contextvenster van 128K. Een techniek genaamd Block Routing beperkt welke experts op diffusieblokniveau worden geactiveerd, en daardoor blijft een 128K-context behapbaar op een enkele consumenten-GPU. De modelkaart positioneert het model voor een GPU met 24 GB of meer en beveelt SGLang aan als serving-backend voor agentische workloads met lange context.

Hierboven staat waar deze release zich bevindt in de familietijdlijn — de afstamming die "LLaDA2.2-mini" begrijpelijk maakt. LLaDA2.0 uit november 2025 was het eerste diffusietaalmodel dat werd opgeschaald naar 100 miljard parameters; LLaDA2.1 uit februari 2026 voegde tokenbewerking toe voor snellere tekstdiffusie; de LLaDA2.2-generatie uit juli 2026, aangekondigd met LLaDA2.2-flash en het technisch rapport, wees de familie richting agents. De mini is het onderdeel van die generatie dat tot nu toe een belofte bleef: berichtgeving over de release van juli vermeldde al een lichtere 16B-variant van de flash voor goedkopere implementatie, maar de losse gewichten verschenen pas op 5 september.
De nummers op de kaart, gelabeld als wat ze zijn
De benchmarktabel op de modelkaart is van inclusionAI zelf, afgedrukt op de dag dat de gewichten online kwamen, en geen onafhankelijk laboratorium heeft er ook maar iets van gereproduceerd — Artificial Analysis heeft geen vermelding voor LLaDA2.2-mini, en wij kunnen geen run van een derde partij vinden. Beschouw de cijfers als claims van de leverancier met een bepaalde richting, niet als gemeten feiten. Binnen dat kader is het verhaal dat de kaart vertelt consistent: LLaDA2.2-mini is een specialist in agentische en lange-contexttaken, en levert daarvoor wat punten in op algemene benchmarks.
• Agentisch gemiddelde — 59.00, van τ²-Bench 57.50, Claw-Eval 57.16 en PinchBench 62.33 (door de leverancier gerapporteerd).
• Function calling — 47,68 op BFCL v4, tegenover respectievelijk 25,05 en 28,44 voor LLaDA2.0-mini en LLaDA2.1-mini; 69,02 op de oudere BFCL v3.
• Lange context — 34.99 op LongBench v2, meer dan het dubbele van de 15.51 en 12.13 die de vorige minis behaalden, wat de concrete opbrengst is van het 128K-venster.
• Algemeen — een algemeen gemiddelde van 46,47, met AIME 2026 op 35,05, OlympiadBench 61,11, LiveCodeBench v6 28,14, GPQA-Diamond 44,41 en IFBench 24,93 — enkele daarvan iets lager dan de eerdere mini’s, de zichtbare prijs van het besteden van het trainingsbudget aan agentisch gedrag in plaats daarvan.

Dat laatste punt is de moeite waard om even bij stil te staan, want het is de eerlijke reden waarom een team dit model zou verkiezen boven een generalist die op papier sterker is. LLaDA2.2-mini beweert niet het beste kleine model te zijn in wiskunde of het opvolgen van instructies; het beweert goed te zijn in datgene waar diffusiemodellen historisch gezien slecht in waren — volgehouden, multi-turn werk met toolgebruik — terwijl het aantal actieve parameters laag genoeg blijft om op één GPU het verschil te maken. De sprong op BFCL v4 en de sprong op LongBench v2 zijn de cijfers die stand zouden houden bij een onafhankelijke run, als de modelkaart in grote lijnen klopt.
Het draaien ervan en het ontbrekende steigerwerk.
Op papier is LLaDA2.2-mini eenvoudig te draaien, omdat de release native ondersteuning biedt voor Transformers: de modelkaart toont het laden ervan met AutoModelForCausalLM en trust_remote_code=True op transformers ≥ 5.2.0, en vervolgens het aanroepen van generate met diffusiespecifieke parameters — een bloklengte van 32 en een temperatuur van 0.0 zijn de aanbevolen standaardwaarden, en de modelkaart adviseert voor de meeste queries een uitvoerlengte van 32.768 tokens. Voor agentische long-context-serving verwijst de release naar SGLang, en gebruikers op het Chinese vasteland krijgen een ModelScope-mirror. Wat nog ontbreekt, is het omliggende ecosysteem: geen gehoste API bij een van de providers die wij kunnen verifiëren, geen GGUF-builds die we kunnen vinden, en frameworkondersteuning die nog niet is uitgekristalliseerd — het werk van de community aan de llama.cpp LLaDA2-architectuur is recent, dus is het kwantiseringsverhaal mager.
Die combinatie — een werkelijk nieuw decodeerparadigma, één dag oud, uitsluitend self-hosted — is precies de situatie waarin een routeringslaag zijn bestaansrecht bewijst zonder te doen alsof het nieuwe model productierijp is. De verantwoorde manier om LLaDA2.2-mini uit te proberen, is door het zelf te draaien in een testomgeving terwijl de productie op een volwassen model blijft draaien, en daarvoor is de opzet van OrcaRouter bedoeld: één API voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, automatische failover zodat het stilvallen van de één dag oude checkpoint geen workflow platlegt, en de routing-DSL om een self-hosted diffusieaanroep te combineren met gehoste autoregressieve modellen achter één enkele sleutel. Wanneer — als — een provider LLaDA2.2-mini opneemt, geldt dezelfde doorberekening en is de prijs die je ziet die van de provider zelf. Tot die tijd is de eerlijke beschikbaarheidslijn: download de Apache-2.0-gewichten van Hugging Face of ModelScope en draai ze zelf.
Wat nu te kijken
Drie dingen zouden dit wat we tot nu toe weten tot een echt verhaal maken, en alle drie ontbreken vandaag. Ten eerste, een aankondiging: als het LLaDA2.2-flash-patroon standhoudt, zouden een lanceerbericht en technische rapportage kunnen volgen op de stille repo-publicatie, en het zou waarschijnlijk trainingsdetails toevoegen die de modelkaart niet vermeldt. Ten tweede, een onafhankelijke run: het agentische gemiddelde van 59,00 en de BFCL v4-score van 47,68 zijn de claims die het meest de moeite waard zijn om te reproduceren, omdat agentische benchmarks degenen zijn waarbij de keuze van de harness de scores het meest beïnvloedt. Ten derde, de volwassenheid van de serving: SGLang-serveergidsen, een vLLM-route en community-kwantificaties zouden je vertellen of de 1.4B-actieve footprint in de praktijk net zo goedkoop te exploiteren is als het specificatieblad suggereert. Geen van deze zaken bestaat op 6 september. De gewichten zijn echt, de licentie is permissief, en de architectuur is werkelijk een andere manier om een agent te draaien — maar het bewijs dat het een goede agent is, is voorlopig de modelkaart van één leverancier.
