LLaDA2.2-mini — News』というニュース記事用の自作タイトルカード。サブタイトルは『2026年9月5日に静かに公開された拡散言語モデルエージェント』。ピルバッジには『16B MoE / 1.4B active』『128K context』『Apache-2.0』、フッターには『リポジトリから判明していることと、まだ確認されていないこと』と記載され、右下隅にはOrcaRouterのロゴが合成されている。
Guides & Insights

LLaDA2.2-mini: Ant inclusionAIのDiffusion Agent Weightsが9月5日に静かに登場した

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年9月5日05:16 UTCに、inclusionAI/LLaDA2.2-miniというHugging Faceリポジトリが誕生した。そして本稿執筆時点で、これがこのリリースに関するほぼ全ての情報である。重みは公開され、モデルカードは書かれているが、ベンダーであるinclusionAI——LLaDA拡散モデルシリーズの背後にあるAnt Groupのラボ——は何も発表していない。ローンチ投稿も、ソーシャルでの展開も、inclusionAI/LLaDA2.X GitHub READMEのモデル表への掲載もない。その表には、より大きなLLaDA2.2-flashが単独で載っているだけだ。リポジトリが現れてから24時間後、そのダウンロードカウンターはゼロのままだった。これはLLaDA2.2-miniに関する「現時点で判明していること」をまとめた記事であり、その形式の厳密さがここでは重要となる。なぜなら、このモデルに関連するほぼすべての興味深い数値は、inclusionAIが自社のカードに打ち込んだ数値だからである。本記事は、このリリースについて独立に検証可能な情報とベンダー報告の情報を区別し、未解決の疑問を曖昧にせず明確に提示する。

短いバージョン、全体像だけを知りたい人のために:LLaDA2.2-miniは、inclusionAIが2026年7月に発表したLLaDA2.2-flash拡散言語モデルの小型版です。現在は、トークンあたりわずか14億パラメータしか活性化しない160億パラメータのmixture-of-expertsチェックポイントとして提供されており、128Kコンテキストを処理し、エージェント的な作業(ツール呼び出し、マルチターン修正)を行うよう訓練されています。その際、生成の途中でトークンを挿入・削除できる拡散デコーダを使用します。ライセンスはApache-2.0です。そして、ウェイトが公開されてからまだ1日しか経っておらず、それに伴うアナウンスもないため、通常の周辺インフラはまだ何も存在しません:独立した評価も、見つけられるホスト型APIも、カード自体が推奨する以上のサーバーガイドもありません。今日確認できるのは、アーキテクチャ、ライセンス、そしてinclusionAIが公開することにした数値だけです。

リリースはイベントではなく、リポジトリである。

まず、誰も信頼せずに確認できるところから始める。Hugging Face API の記録では、inclusionAI/LLaDA2.2-mini は2026年9月5日に作成され、同日に最終更新されている。Apache-2.0ライセンスで、safetensors形式のbf16テンソルを用い、チャットテンプレートを備えており、必要とされるのは、trust_remote_codeである。というのも、diffusionアーキテクチャはカスタムモデリングコードとして提供されているからだ。このリポジトリの兄弟にあたる inclusionAI/LLaDA2.2-flash は、2026年7月16日に作成され、以降数週間で数千ダウンロードと数十のいいねを集め、公に発表もされている。一方 mini には、その発表も普及もない——初日は一桁のいいねしか付かず、ダウンロードは皆無だった。

A screenshot of the Hugging Face model page for inclusionAI/LLaDA2.2-mini (captured September 6, 2026), showing the tags TextGeneration, Transformers, Safetensors, llada2_moe, dllm, diffusion_lm and custom_code, the Apache-2.0 license, the model-card summary 'LLaDA2.2-mini is the lightweight variant of the agentic diffusion language model in the LLaDA2 series', Model size 16B params, Tensor type BF16, a chat template, the line 'This model isn't deployed by any Inference Provider', and the start of the benchmarks table.

「mini」がこれまでに受けた第三者からの注目は、リポジトリ公開から数時間以内にモデルカードを転載したアグリゲーターページが1件あるのみだ。これはモデルカードのミラーであり、独立した情報源ではなく、リポジトリ自体が持っていない情報は何も含まれていない。これが9月6日時点での公開情報のすべてである。注目するかどうかを判断する読者にとって重要な枠組みは次の通りだ。inclusionAIは同じ週に2回、静かに拡散モデルの重みをリリースしている——このモデルが9月5日、LLaDA-Image生成チェックポイントがその前日——つまり、静かなリポジトリ公開は、同研究所の確立されたリリースパターンであり、事故ではない。そのパターンは、アナウンスが行われるかどうかについては何も教えてくれない。

LLaDA2.2-miniが実際に何であるか

アーキテクチャこそがこのモデルで最も興味深い部分であり、その全容はカードに記載されています。LLaDA2.2-miniは、LLaDA2.0-miniバックボーンをベースにした混合エキスパート(MoE)拡散言語モデルです。拡散言語モデルは、通常の生成ループを逆転させます。自己回帰モデルが一度に1つの次のトークンを予測するのとは異なり、拡散LLMはマスクされた、またはノイズを含むトークンのブロックから開始し、ブロック全体を並列に精緻化しながら、一貫性のあるシーケンスへとノイズを除去していきます。LLaDA2.2の生成には、inclusionAIがレーベンシュタイン編集と呼ぶ機能が追加されています。DELETEとINSERTという2つの制御トークンにより、デコーダーは生成中のシーケンスの内容だけでなく、その長さや構造も変更できます。すでに書き出した冗長なスパンを削除したり、新しいコンテキスト(たとえばツールの結果)を挿入する必要がある場所に挿入ポイントを開いたりできるのです。これは、マルチターンでのツール使用ループにおいて拡散デコードを機能させるために、このファミリーが採用しているメカニズムです。自己回帰モデルであれば次のユーザーターンをただ待つだけで済みますが、ブロック拡散モデルは既に生成した内容を修正しなければならないからです。

{{1}}カードに記載された関連仕様は以下の通り。埋め込みを除く総パラメータ数は160億、トークンあたりのアクティブパラメータは14億で、{{/1}}{{2}}これはトークンあたり8エキスパートをルーティングする256エキスパート構成のMoEによるものである。層数は20、アテンションヘッドは16個、KVヘッドは4個で、{{/2}}{{3}}語彙サイズは157,184トークン、位置エンコーディングには回転位置埋め込み(RoPE)を採用し、{{/3}}{{4}}コンテキストウィンドウは128Kである。{{/4}}{{5}}Block Routingと呼ばれる技術は、拡散ブロックレベルでどのエキスパートが動作するかを制限し、それによってモデルは単一のコンシューマーGPU上でも128Kコンテキストを処理可能に保っている。{{/5}}{{6}}また、カードでは24GB以上のGPUでの利用を想定しており、長文脈のエージェント型ワークロードにはサービングバックエンドとしてSGLangを推奨している。{{/6}}

A self-built timeline graphic titled 'The LLaDA family, to September 5, 2026' with four node cards: 'LLaDA2.0 — Nov 2025 — First diffusion LM scaled to 100B', 'LLaDA2.1 — Feb 2026 — Token editing for faster diffusion', 'LLaDA2.2-flash — Jul 2026 — Agentic diffusion · ~100B, announced', and 'LLaDA2.2-mini — Sep 5, 2026 — 1.4B-active agent · weights, quiet', with a footer 'Per the inclusionAI/LLaDA2.X GitHub README and Hugging Face repository timestamps' and the OrcaRouter logo composited in the bottom-right corner.

上記は、このリリースがファミリーのタイムラインのどこに位置するかを示しています — 「LLaDA2.2-mini」を理解可能にする系譜です。2025年11月のLLaDA2.0は、1000億パラメータにスケールされた最初の拡散言語モデルでした。2026年2月のLLaDA2.1は、より高速なテキスト拡散のためのトークン編集を追加しました。2026年7月のLLaDA2.2世代は、LLaDA2.2-flashとその技術報告書とともに発表され、ファミリーをエージェントへと方向づけました。miniは、その世代の中で、これまで約束のまま残されていた部分です。7月のリリースに関する報道では、より低コストなデプロイのためのflashの軽量な16Bバリアントがすでに言及されていましたが、単体のウェイトが実際に登場したのは9月5日でした。

カード上の数字は、それが何であるかとしてラベル付けされている。

モデルカードのベンチマーク表はinclusionAI自身によるもので、重みが公開された当日に出力されたものであり、独立した研究所による再現は一切されていません。Artificial AnalysisにはLLaDA2.2-miniのエントリはなく、第三者による実行結果も見つかりません。これらの数値は、測定された事実ではなく、方向性を伴ったベンダーの主張として読むべきです。その枠組みの中で、モデルカードが伝えるストーリーは一貫しています。LLaDA2.2-miniはエージェント型および長文コンテキストに特化したモデルであり、そのために一部の一般的なベンチマークのスコアを犠牲にしている、というものです。

• エージェンティック平均 — 59.00、τ²-Bench 57.50、Claw-Eval 57.16、PinchBench 62.33 から(ベンダー報告)。

• 関数呼び出し — BFCL v4では47.68(LLaDA2.0-miniとLLaDA2.1-miniのそれぞれ25.05と28.44から上昇)、旧BFCL v3では69.02。

• ロングコンテキスト — LongBench v2 で34.99。これは従来のミニモデルが達成した15.51と12.13の2倍以上であり、128Kウィンドウの具体的な成果です。

• General — 総合平均46.47(AIME 2026は35.05、OlympiadBenchは61.11、LiveCodeBench v6は28.14、GPQA-Diamondは44.41、IFBenchは24.93)— そのうちのいくつかは以前のミニモデルよりわずかに低く、これはトレーニング予算を(そうしたベンチマークではなく)エージェント的な行動に費やしたことによる目に見えるコストである。

A self-built single-column scoreboard titled 'LLaDA2.2-mini — the scoreboard' listing Type 'MoE diffusion LM with Levenshtein editing (DELETE / INSERT)', Total params '16B (excl. embeddings)', Active params '1.4B — top-8 of 256 experts', Context '128K tokens', Agentic avg '59.00 — τ²-Bench 57.50 · Claw-Eval 57.16 · PinchBench 62.33', Function calling 'BFCL v4 47.68 (up from ~25-28 for prior minis)', with a footer 'All figures from the inclusionAI model card — vendor-reported, not independently reproduced' and the OrcaRouter logo composited in the bottom-right corner.

この最後の点は、じっくり噛み締める価値がある。なぜなら、それは、スペック上はより強力な汎用モデルではなく、このモデルをチームが選ぶ、正直な理由だからだ。LLaDA2.2-miniは、数学や指示追従の分野で最良の小型モデルであると主張しているわけではない。このモデルが主張しているのは、拡散モデルが歴史的に苦手としてきた分野、すなわち持続的でマルチターンにわたるツール使用の作業に長けており、しかもアクティブなパラメータ数を、1つのGPU上で意味を持つ程度に低く抑えていることだ。BFCL v4の大幅なスコア向上とLongBench v2の大幅なスコア向上は、モデルカードの内容がおおむね正しければ、独立した実行でも耐えうる数字である。

それを実行すること、そして欠けている足場

書面上、LLaDA2.2-miniを実行する手順は単純です。このリリースはTransformersネイティブのものであり、モデルカードには次のように読み込むと記載されています:AutoModelForCausalLMtrust_remote_code=Trueをtransformers ≥ 5.2.0で使用し、拡散特有のパラメータを指定してgenerateを呼び出します。ブロック長32と温度0.0が推奨デフォルトで、モデルカードはほとんどのクエリに対して32,768トークンの出力長を推奨しています。エージェント向けの長文脈サーバーとしてはSGLangを挙げており、中国本土のユーザーにはModelScopeミラーが提供されています。まだ存在しないのは周辺エコシステムです。検証できるプロバイダーにはホスト型APIがなく、GGUFビルドも見つからず、フレームワークのサポートもまだ固まっていません。コミュニティのllama.cpp LLaDA2アーキテクチャ対応は最近のものであるため、量子化の話は薄いのです。

真に新しいデコードパラダイム——登場から1日しか経たず、セルフホスト専用——という組み合わせこそ、ルーティング層が、新しいモデルを本番運用可能だと偽ることなく、その存在価値を発揮できるまさにその状況です。LLaDA2.2-miniを責任を持って試すには、本番環境は成熟したモデルに据えたまま、自分自身でテストパス上で実行するのが筋であり、OrcaRouterのセットアップはそのためのものです。すなわち、200以上のモデルをプロバイダー記載価格のままマークアップ0%で利用できる単一API、登場して間もないチェックポイントの停止でワークフローをダウンさせない自動フェイルオーバー、そして単一キーの背後でセルフホストの拡散モデル呼び出しとホスト型自己回帰モデルを組み合わせるルーティングDSL。もし——いつか——プロバイダーがLLaDA2.2-miniをリストに掲載すれば、同じパススルーが適用され、表示される価格はプロバイダー自身の提示価格です。それまでは、正直な提供状況の表明はこうです:Apache-2.0のウェイトをHugging FaceまたはModelScopeからダウンロードして、自分で実行してください。

次に見るもの

この“判明している事実”を真のストーリーにするには三つの要素が必要であり、その三つは今日、すべて欠けている。第一に、公式発表だ。LLaDA2.2-flashのパターンが続くなら、静かなリポジトリ公開に続いて、ローンチ投稿やテクニカルレポートの報道が出るかもしれない。そこにはおそらく、モデルカードが省いているトレーニング詳細が含まれるだろう。第二に、独立した再現実行だ。エージェント平均の59.00とBFCL v4のスコア47.68は、最も再現する価値のある主張である。なぜなら、エージェントベンチマークは、ハーネスの選択がスコアを最も大きく動かす類のものだからだ。第三に、サービングの成熟度だ。SGLangのサービングガイド、vLLMの利用経路、コミュニティによる量子化があれば、1.4Bアクティブというフットプリントが、スペックシートが示す通り実際の運用でも安価なのかが分かるだろう。そのいずれも、9月6日の時点では存在しない。重みは本物であり、ライセンスは寛容であり、アーキテクチャは確かにエージェントを動かす別の方法だ。しかし、それが優れたエージェントであるという証拠は、今のところベンダーのカード一枚だけだ。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube