
LLaDA2.2-mini: Ant inclusionAIのDiffusion Agent Weightsが9月5日に静かに登場した
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1849知能75コーディング
- obsidianQwen3.8 27B2026-08-1541知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1251知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0547知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0347知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2140知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128知能49コーディング
2026年9月5日05:16 UTCに、inclusionAI/LLaDA2.2-miniというHugging Faceリポジトリが誕生した。そして本稿執筆時点で、これがこのリリースに関するほぼ全ての情報である。重みは公開され、モデルカードは書かれているが、ベンダーであるinclusionAI——LLaDA拡散モデルシリーズの背後にあるAnt Groupのラボ——は何も発表していない。ローンチ投稿も、ソーシャルでの展開も、inclusionAI/LLaDA2.X GitHub READMEのモデル表への掲載もない。その表には、より大きなLLaDA2.2-flashが単独で載っているだけだ。リポジトリが現れてから24時間後、そのダウンロードカウンターはゼロのままだった。これはLLaDA2.2-miniに関する「現時点で判明していること」をまとめた記事であり、その形式の厳密さがここでは重要となる。なぜなら、このモデルに関連するほぼすべての興味深い数値は、inclusionAIが自社のカードに打ち込んだ数値だからである。本記事は、このリリースについて独立に検証可能な情報とベンダー報告の情報を区別し、未解決の疑問を曖昧にせず明確に提示する。
短いバージョン、全体像だけを知りたい人のために:LLaDA2.2-miniは、inclusionAIが2026年7月に発表したLLaDA2.2-flash拡散言語モデルの小型版です。現在は、トークンあたりわずか14億パラメータしか活性化しない160億パラメータのmixture-of-expertsチェックポイントとして提供されており、128Kコンテキストを処理し、エージェント的な作業(ツール呼び出し、マルチターン修正)を行うよう訓練されています。その際、生成の途中でトークンを挿入・削除できる拡散デコーダを使用します。ライセンスはApache-2.0です。そして、ウェイトが公開されてからまだ1日しか経っておらず、それに伴うアナウンスもないため、通常の周辺インフラはまだ何も存在しません:独立した評価も、見つけられるホスト型APIも、カード自体が推奨する以上のサーバーガイドもありません。今日確認できるのは、アーキテクチャ、ライセンス、そしてinclusionAIが公開することにした数値だけです。
リリースはイベントではなく、リポジトリである。
まず、誰も信頼せずに確認できるところから始める。Hugging Face API の記録では、inclusionAI/LLaDA2.2-mini は2026年9月5日に作成され、同日に最終更新されている。Apache-2.0ライセンスで、safetensors形式のbf16テンソルを用い、チャットテンプレートを備えており、必要とされるのは、trust_remote_codeである。というのも、diffusionアーキテクチャはカスタムモデリングコードとして提供されているからだ。このリポジトリの兄弟にあたる inclusionAI/LLaDA2.2-flash は、2026年7月16日に作成され、以降数週間で数千ダウンロードと数十のいいねを集め、公に発表もされている。一方 mini には、その発表も普及もない——初日は一桁のいいねしか付かず、ダウンロードは皆無だった。

「mini」がこれまでに受けた第三者からの注目は、リポジトリ公開から数時間以内にモデルカードを転載したアグリゲーターページが1件あるのみだ。これはモデルカードのミラーであり、独立した情報源ではなく、リポジトリ自体が持っていない情報は何も含まれていない。これが9月6日時点での公開情報のすべてである。注目するかどうかを判断する読者にとって重要な枠組みは次の通りだ。inclusionAIは同じ週に2回、静かに拡散モデルの重みをリリースしている——このモデルが9月5日、LLaDA-Image生成チェックポイントがその前日——つまり、静かなリポジトリ公開は、同研究所の確立されたリリースパターンであり、事故ではない。そのパターンは、アナウンスが行われるかどうかについては何も教えてくれない。
LLaDA2.2-miniが実際に何であるか
アーキテクチャこそがこのモデルで最も興味深い部分であり、その全容はカードに記載されています。LLaDA2.2-miniは、LLaDA2.0-miniバックボーンをベースにした混合エキスパート(MoE)拡散言語モデルです。拡散言語モデルは、通常の生成ループを逆転させます。自己回帰モデルが一度に1つの次のトークンを予測するのとは異なり、拡散LLMはマスクされた、またはノイズを含むトークンのブロックから開始し、ブロック全体を並列に精緻化しながら、一貫性のあるシーケンスへとノイズを除去していきます。LLaDA2.2の生成には、inclusionAIがレーベンシュタイン編集と呼ぶ機能が追加されています。DELETEとINSERTという2つの制御トークンにより、デコーダーは生成中のシーケンスの内容だけでなく、その長さや構造も変更できます。すでに書き出した冗長なスパンを削除したり、新しいコンテキスト(たとえばツールの結果)を挿入する必要がある場所に挿入ポイントを開いたりできるのです。これは、マルチターンでのツール使用ループにおいて拡散デコードを機能させるために、このファミリーが採用しているメカニズムです。自己回帰モデルであれば次のユーザーターンをただ待つだけで済みますが、ブロック拡散モデルは既に生成した内容を修正しなければならないからです。
{{1}}カードに記載された関連仕様は以下の通り。埋め込みを除く総パラメータ数は160億、トークンあたりのアクティブパラメータは14億で、{{/1}}{{2}}これはトークンあたり8エキスパートをルーティングする256エキスパート構成のMoEによるものである。層数は20、アテンションヘッドは16個、KVヘッドは4個で、{{/2}}{{3}}語彙サイズは157,184トークン、位置エンコーディングには回転位置埋め込み(RoPE)を採用し、{{/3}}{{4}}コンテキストウィンドウは128Kである。{{/4}}{{5}}Block Routingと呼ばれる技術は、拡散ブロックレベルでどのエキスパートが動作するかを制限し、それによってモデルは単一のコンシューマーGPU上でも128Kコンテキストを処理可能に保っている。{{/5}}{{6}}また、カードでは24GB以上のGPUでの利用を想定しており、長文脈のエージェント型ワークロードにはサービングバックエンドとしてSGLangを推奨している。{{/6}}

上記は、このリリースがファミリーのタイムラインのどこに位置するかを示しています — 「LLaDA2.2-mini」を理解可能にする系譜です。2025年11月のLLaDA2.0は、1000億パラメータにスケールされた最初の拡散言語モデルでした。2026年2月のLLaDA2.1は、より高速なテキスト拡散のためのトークン編集を追加しました。2026年7月のLLaDA2.2世代は、LLaDA2.2-flashとその技術報告書とともに発表され、ファミリーをエージェントへと方向づけました。miniは、その世代の中で、これまで約束のまま残されていた部分です。7月のリリースに関する報道では、より低コストなデプロイのためのflashの軽量な16Bバリアントがすでに言及されていましたが、単体のウェイトが実際に登場したのは9月5日でした。
カード上の数字は、それが何であるかとしてラベル付けされている。
モデルカードのベンチマーク表はinclusionAI自身によるもので、重みが公開された当日に出力されたものであり、独立した研究所による再現は一切されていません。Artificial AnalysisにはLLaDA2.2-miniのエントリはなく、第三者による実行結果も見つかりません。これらの数値は、測定された事実ではなく、方向性を伴ったベンダーの主張として読むべきです。その枠組みの中で、モデルカードが伝えるストーリーは一貫しています。LLaDA2.2-miniはエージェント型および長文コンテキストに特化したモデルであり、そのために一部の一般的なベンチマークのスコアを犠牲にしている、というものです。
• エージェンティック平均 — 59.00、τ²-Bench 57.50、Claw-Eval 57.16、PinchBench 62.33 から(ベンダー報告)。
• 関数呼び出し — BFCL v4では47.68(LLaDA2.0-miniとLLaDA2.1-miniのそれぞれ25.05と28.44から上昇)、旧BFCL v3では69.02。
• ロングコンテキスト — LongBench v2 で34.99。これは従来のミニモデルが達成した15.51と12.13の2倍以上であり、128Kウィンドウの具体的な成果です。
• General — 総合平均46.47(AIME 2026は35.05、OlympiadBenchは61.11、LiveCodeBench v6は28.14、GPQA-Diamondは44.41、IFBenchは24.93)— そのうちのいくつかは以前のミニモデルよりわずかに低く、これはトレーニング予算を(そうしたベンチマークではなく)エージェント的な行動に費やしたことによる目に見えるコストである。

この最後の点は、じっくり噛み締める価値がある。なぜなら、それは、スペック上はより強力な汎用モデルではなく、このモデルをチームが選ぶ、正直な理由だからだ。LLaDA2.2-miniは、数学や指示追従の分野で最良の小型モデルであると主張しているわけではない。このモデルが主張しているのは、拡散モデルが歴史的に苦手としてきた分野、すなわち持続的でマルチターンにわたるツール使用の作業に長けており、しかもアクティブなパラメータ数を、1つのGPU上で意味を持つ程度に低く抑えていることだ。BFCL v4の大幅なスコア向上とLongBench v2の大幅なスコア向上は、モデルカードの内容がおおむね正しければ、独立した実行でも耐えうる数字である。
それを実行すること、そして欠けている足場
書面上、LLaDA2.2-miniを実行する手順は単純です。このリリースはTransformersネイティブのものであり、モデルカードには次のように読み込むと記載されています:AutoModelForCausalLMとtrust_remote_code=Trueをtransformers ≥ 5.2.0で使用し、拡散特有のパラメータを指定してgenerateを呼び出します。ブロック長32と温度0.0が推奨デフォルトで、モデルカードはほとんどのクエリに対して32,768トークンの出力長を推奨しています。エージェント向けの長文脈サーバーとしてはSGLangを挙げており、中国本土のユーザーにはModelScopeミラーが提供されています。まだ存在しないのは周辺エコシステムです。検証できるプロバイダーにはホスト型APIがなく、GGUFビルドも見つからず、フレームワークのサポートもまだ固まっていません。コミュニティのllama.cpp LLaDA2アーキテクチャ対応は最近のものであるため、量子化の話は薄いのです。
真に新しいデコードパラダイム——登場から1日しか経たず、セルフホスト専用——という組み合わせこそ、ルーティング層が、新しいモデルを本番運用可能だと偽ることなく、その存在価値を発揮できるまさにその状況です。LLaDA2.2-miniを責任を持って試すには、本番環境は成熟したモデルに据えたまま、自分自身でテストパス上で実行するのが筋であり、OrcaRouterのセットアップはそのためのものです。すなわち、200以上のモデルをプロバイダー記載価格のままマークアップ0%で利用できる単一API、登場して間もないチェックポイントの停止でワークフローをダウンさせない自動フェイルオーバー、そして単一キーの背後でセルフホストの拡散モデル呼び出しとホスト型自己回帰モデルを組み合わせるルーティングDSL。もし——いつか——プロバイダーがLLaDA2.2-miniをリストに掲載すれば、同じパススルーが適用され、表示される価格はプロバイダー自身の提示価格です。それまでは、正直な提供状況の表明はこうです:Apache-2.0のウェイトをHugging FaceまたはModelScopeからダウンロードして、自分で実行してください。
次に見るもの
この“判明している事実”を真のストーリーにするには三つの要素が必要であり、その三つは今日、すべて欠けている。第一に、公式発表だ。LLaDA2.2-flashのパターンが続くなら、静かなリポジトリ公開に続いて、ローンチ投稿やテクニカルレポートの報道が出るかもしれない。そこにはおそらく、モデルカードが省いているトレーニング詳細が含まれるだろう。第二に、独立した再現実行だ。エージェント平均の59.00とBFCL v4のスコア47.68は、最も再現する価値のある主張である。なぜなら、エージェントベンチマークは、ハーネスの選択がスコアを最も大きく動かす類のものだからだ。第三に、サービングの成熟度だ。SGLangのサービングガイド、vLLMの利用経路、コミュニティによる量子化があれば、1.4Bアクティブというフットプリントが、スペックシートが示す通り実際の運用でも安価なのかが分かるだろう。そのいずれも、9月6日の時点では存在しない。重みは本物であり、ライセンスは寛容であり、アーキテクチャは確かにエージェントを動かす別の方法だ。しかし、それが優れたエージェントであるという証拠は、今のところベンダーのカード一枚だけだ。
