
LLaDA2.2-mini: Bobot Agen Difusi milik inclusionAI Muncul Diam-diam pada 5 September
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Kecerdasan49Koding
Pada 05:16 UTC tanggal 5 September 2026, sebuah repositori Hugging Face bernama inclusionAI/LLaDA2.2-mini mulai ada, dan hingga tulisan ini dibuat, hampir itulah keseluruhan cerita perilisan tersebut: bobot model sudah tersedia, kartu model sudah ditulis, dan vendor — inclusionAI, lab Ant Group di balik lini model difusi LLaDA — belum mengatakan apa pun tentangnya. Tidak ada pos peluncuran, tidak ada rilis media sosial, tidak ada entri dalam tabel model README GitHub inclusionAI/LLaDA2.X, tempat LLaDA2.2-flash yang lebih besar sendirian. Dua puluh empat jam setelah repositori itu muncul, penghitung unduhannya menunjukkan nol. Ini adalah tulisan tentang apa yang kita ketahui sejauh ini mengenai LLaDA2.2-mini, dan disiplin format tersebut penting di sini, karena hampir setiap angka menarik yang melekat pada model itu adalah angka yang diketik sendiri oleh inclusionAI ke dalam kartunya. Artikel ini memisahkan apa yang dapat diverifikasi secara independen dari perilisan tersebut dengan apa yang dilaporkan vendor, serta menyebutkan pertanyaan-pertanyaan yang masih terbuka alih-alih menutup-nutupinya.
Versi singkatnya, untuk siapa pun yang hanya ingin tahu gambaran besarnya: LLaDA2.2-mini adalah adik dari model bahasa difusi LLaDA2.2-flash yang diumumkan oleh inclusionAI pada Juli 2026, kini tersedia sebagai checkpoint mixture-of-experts dengan 16 miliar parameter yang hanya mengaktifkan 1,4 miliar parameter per token, mendukung konteks 128K, dan dilatih untuk melakukan pekerjaan agenik — pemanggilan alat, koreksi multi-putaran — menggunakan decoder difusi yang dapat menyisipkan dan menghapus token di tengah proses generasi. Lisensinya Apache-2.0. Dan karena bobotnya baru berumur satu hari tanpa disertai pengumuman apa pun, belum ada infrastruktur pendukung yang lazim: belum ada evaluasi independen, belum ada API yang dihosting yang dapat kami temukan, belum ada panduan serving selain apa yang direkomendasikan oleh kartu modelnya sendiri. Yang dapat Anda verifikasi hari ini adalah arsitekturnya, lisensinya, dan angka-angka yang dipilih oleh inclusionAI untuk dipublikasikan.
Rilis adalah repositori, bukan peristiwa.
Mulailah dengan apa yang bisa diperiksa tanpa mempercayai siapa pun. API Hugging Face mencatat inclusionAI/LLaDA2.2-mini sebagai dibuat pada 5 September 2026, dan terakhir dimodifikasi pada hari yang sama. Ia berlisensi Apache-2.0, menggunakan format safetensors dengan tensor bf16, memiliki templat obrolan, dan memerlukan trust_remote_code karena arsitektur difusi dikirimkan sebagai kode pemodelan khusus. Repositori saudaranya, inclusionAI/LLaDA2.2-flash, dibuat pada 16 Juli 2026, telah mengumpulkan ribuan unduhan dan puluhan suka dalam beberapa minggu sejak itu, serta diumumkan secara publik. Model mini tidak memiliki pengumuman maupun adopsi tersebut — pada hari pertamanya ia mencatat suka satu digit dan tidak ada unduhan sama sekali.

Satu-satunya perhatian pihak ketiga yang mini ini dapatkan sejauh ini adalah halaman agregator yang menerbitkan ulang kartu model dalam hitungan jam setelah repo tersebut muncul; halaman itu adalah cerminan dari kartu tersebut, bukan sumber independen, dan tidak membawa informasi yang tidak dimiliki oleh repo itu sendiri. Itulah seluruh catatan publik per 6 September. Kerangka yang penting bagi pembaca yang memutuskan apakah akan memperhatikan: inclusionAI kini telah dua kali merilis bobot difusi secara diam-diam dalam pekan yang sama — model ini pada 5 September, dan checkpoint generasi LLaDA-Image sehari sebelumnya — sehingga peluncuran repo yang tenang tampaknya menjadi pola rilis yang mapan bagi lab tersebut, bukan sebuah kecelakaan. Tidak ada apa pun dari pola tersebut yang memberi tahu kita apakah sebuah pengumuman akan datang.
Apa sebenarnya LLaDA2.2-mini itu
Arsitekturnya adalah bagian yang paling menarik dari model ini, dan arsitektur tersebut dijelaskan sepenuhnya pada kartu tersebut. LLaDA2.2-mini adalah model bahasa difusi mixture-of-experts yang dibangun di atas backbone LLaDA2.0-mini. Model bahasa difusi membalik putaran generasi yang umum: alih-alih model autoregresif yang memprediksi satu per satu token berikutnya, LLM difusi berawal dari blok token yang di-mask atau berisik dan menyempurnakan seluruh blok secara paralel, melakukan denoising menuju urutan yang koheren. Generasi LLaDA2.2 menambahkan apa yang disebut inclusionAI sebagai penyuntingan Levenshtein: dua token kontrol, DELETE dan INSERT, yang memungkinkan dekoder mengubah panjang dan struktur urutan yang dihasilkannya, bukan hanya isinya — menghapus rentang yang sudah ditulisnya karena redundan, atau membuka titik sisipan tempat konteks baru (misalnya, hasil perkakas) perlu dimasukkan. Itulah mekanisme yang digunakan keluarga model ini untuk membuat decoding difusi berfungsi dalam putaran multi-giliran yang menggunakan perkakas, di mana model autoregresif dapat dengan mudah menunggu giliran pengguna berikutnya, sedangkan model difusi-blok harus merevisi apa yang telah dihasilkannya.
Spesifikasi yang relevan, semuanya langsung dari kartu spesifikasi: 16 miliar total parameter tidak termasuk embedding, 1,4 miliar aktif per token melalui MoE 256 ahli dengan 8 ahli dirutekan per token; 20 lapisan, 16 attention heads, 4 KV heads; kosakata 157.184 token; rotary position embeddings; dan jendela konteks 128K. Sebuah teknik bernama Block Routing membatasi ahli mana yang aktif pada tingkat blok difusi, itulah cara model ini menjaga konteks 128K tetap dapat dikelola pada satu GPU konsumen. Kartu spesifikasi memosisikan model ini untuk GPU 24GB ke atas dan merekomendasikan SGLang sebagai backend serving untuk beban kerja agen berkonteks panjang.

Di atas adalah tempat rilis ini berada dalam linimasa keluarga — garis keturunan yang membuat "LLaDA2.2-mini" dapat dipahami. LLaDA2.0 pada November 2025 adalah model bahasa difusi pertama yang diskalakan hingga 100 miliar parameter; LLaDA2.1 pada Februari 2026 menambahkan penyuntingan token untuk difusi teks yang lebih cepat; generasi LLaDA2.2 pada Juli 2026, yang diumumkan bersama LLaDA2.2-flash dan laporan teknisnya, mengarahkan keluarga ini ke agen. Mini adalah bagian dari generasi itu yang tetap menjadi janji hingga sekarang: liputan rilis Juli sudah menyebutkan varian 16B yang lebih ringan dari flash untuk penempatan yang lebih murah, tetapi bobot model yang berdiri sendiri baru dirilis pada 5 September.
Angka-angka pada kartu, diberi label sesuai dengan apa adanya.
Tabel tolok ukur pada kartu model adalah milik inclusionAI sendiri, dicetak pada hari bobotnya dirilis, dan belum ada laboratorium independen yang mereproduksi semuanya — Artificial Analysis tidak memiliki entri untuk LLaDA2.2-mini, dan kami tidak dapat menemukan uji coba pihak ketiga. Baca angka-angka tersebut sebagai klaim vendor dengan arah tertentu, bukan sebagai fakta terukur. Dalam kerangka itu, cerita yang disampaikan kartu model tetap konsisten: LLaDA2.2-mini adalah spesialis agenik dan konteks panjang, dan ia mengorbankan beberapa poin tolok ukur umum untuk mencapai hal tersebut.
• Rata-rata agentic — 59,00, dari τ²-Bench 57,50, Claw-Eval 57,16, dan PinchBench 62,33 (dilaporkan vendor).
• Pemanggilan fungsi — 47,68 pada BFCL v4, naik dari 25,05 dan 28,44 untuk masing-masing LLaDA2.0-mini dan LLaDA2.1-mini; 69,02 pada BFCL v3 yang lebih lama.
• Konteks panjang — 34.99 di LongBench v2, lebih dari dua kali lipat 15.51 dan 12.13 yang dicapai mini sebelumnya, yang merupakan hasil nyata dari jendela 128K.
• Umum — rata-rata umum 46.47, dengan AIME 2026 pada 35.05, OlympiadBench 61.11, LiveCodeBench v6 28.14, GPQA-Diamond 44.41, dan IFBench 24.93 — beberapa di antaranya sedikit di bawah minis sebelumnya, biaya yang terlihat dari mengalokasikan anggaran pelatihan untuk perilaku agentik sebagai gantinya.

Poin terakhir itu layak direnungkan, karena itulah alasan jujur sebuah tim memilih model ini dibanding generalis yang lebih kuat di atas kertas. LLaDA2.2-mini tidak mengklaim sebagai model kecil terbaik dalam matematika atau mengikuti instruksi; ia mengklaim bagus dalam hal yang secara historis buruk dilakukan model difusi — pekerjaan berkelanjutan, multi-giliran, menggunakan alat — sambil menjaga jumlah parameter aktif cukup rendah untuk berarti pada satu GPU. Lonjakan BFCL v4 dan lonjakan LongBench v2 adalah angka-angka yang akan bertahan dalam uji independen jika kartu model tersebut secara garis besar benar.
Menjalankannya, dan perancah yang hilang
Di atas kertas, cara menjalankan LLaDA2.2-mini tampak mudah, karena rilis ini memang dibuat native untuk Transformers: pada kartu modelnya diperlihatkan cara memuatnya dengan AutoModelForCausalLM dan trust_remote_code=True pada transformers ≥ 5.2.0, lalu memanggil generate dengan parameter khusus difusi — panjang blok 32 dan temperatur 0.0 adalah nilai default yang disarankan, serta kartu model itu menyarankan panjang output 32.768 token untuk sebagian besar kueri. Untuk kebutuhan serving konteks panjang secara agenik, model ini menunjuk ke SGLang, dan pengguna di Tiongkok daratan mendapatkan cermin ModelScope. Yang belum ada adalah ekosistem pendukungnya: belum ada API yang di-hosting di penyedia mana pun yang dapat kami verifikasi, belum ada build GGUF yang bisa kami temukan, dan dukungan framework masih terus berkembang — upaya arsitektur LLaDA2 untuk llama.cpp dari komunitas masih baru, sehingga dukungan kuantisasinya masih tipis.
Kombinasi itu — paradigma decoding yang benar-benar baru, berusia satu hari, khusus self-host — adalah situasi yang tepat di mana lapisan routing membuktikan nilainya tanpa berpura-pura bahwa model baru tersebut siap produksi. Cara untuk mencoba LLaDA2.2-mini secara bertanggung jawab adalah dengan menjalankannya sendiri di jalur uji sementara produksi tetap menggunakan model yang matang, dan itulah fungsi pengaturan OrcaRouter: satu API untuk lebih dari 200 model dengan harga daftar penyedia tanpa markup 0%, failover otomatis sehingga checkpoint berusia satu hari yang macet tidak menjatuhkan alur kerja, dan DSL routing untuk menggabungkan panggilan difusi self-host dengan model autoregresif yang dihosting di balik satu kunci. Ketika — jika — penyedia mendaftarkan LLaDA2.2-mini, pass-through yang sama berlaku dan harga yang Anda lihat adalah harga milik penyedia itu sendiri. Sampai saat itu, pernyataan ketersediaan yang jujur adalah: unduh bobot Apache-2.0 dari Hugging Face atau ModelScope dan jalankan sendiri.
Tontonan Berikutnya
Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.
