
LLaDA2.2-mini:蚂蚁旗下inclusionAI的扩散智能体权重于9月5日悄然上线
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
2026年9月5日05:16 UTC,一个名为 inclusionAI/LLaDA2.2-mini 的 Hugging Face 仓库出现了;截至本文撰写时,这几乎就是这次发布的全部故事:权重已上传,模型卡已写好,而供应商——LLaDA 扩散模型系列背后的蚂蚁集团实验室 inclusionAI——却对此只字未提。没有发布公告,没有社交媒体推广,inclusionAI/LLaDA2.X GitHub README 的模型表中也没有它的条目,那张表格里只有较大的 LLaDA2.2-flash 孤零零地列在那里。仓库出现24小时后,其下载计数仍然为零。这是一篇关于 LLaDA2.2-mini 的“目前已知情况”报道,而这种体裁的自我约束在这里很重要,因为这个模型身上几乎所有值得注意的数字,都是 inclusionAI 自己填到自家模型卡上去的。本文将会区分此次发布中哪些信息可以独立验证、哪些只是厂商自报,并且坦率指出那些悬而未决的问题,而不是将其粉饰过去。
简短版在此,给只想了解个大概的人:LLaDA2.2-mini 是 inclusionAI 于2026年7月发布的 LLaDA2.2-flash 扩散语言模型的小型姊妹版本,现以160亿参数的混合专家检查点形式提供,每个词元仅激活14亿参数,支持128K上下文,并针对智能体任务——工具调用、多轮纠错——进行了训练,其扩散解码器能够在生成过程中插入和删除词元。它采用 Apache-2.0 许可。由于权重发布仅一天且背后没有任何公告,常见的配套生态尚不存在:没有独立评测,找不到托管 API,除了模型卡片自身推荐的内容外,也没有服务部署指南。你今天能够验证的,是架构、许可证,以及 inclusionAI 选择公布的这些数字。
发布是一个仓库,而非一个事件。
先从无需信任任何人即可核查的地方说起。Hugging Face API 记录显示,inclusionAI/LLaDA2.2-mini 创建于 2026 年 9 月 5 日,并于同日最后修改。它采用 Apache-2.0 许可证,使用 safetensors 格式(含 bf16 张量),带有聊天模板,并且需要 trust_remote_code,因为其扩散架构以自定义建模代码的形式提供。该仓库的姊妹模型 inclusionAI/LLaDA2.2-flash 创建于 2026 年 7 月 16 日,此后数周内便积累了数千次下载和数十次点赞,而且获得了公开宣布。而 mini 既没有公开宣布,也没有获得采用——上线第一天只有个位数的点赞,下载量则为零。

迄今为止,mini 吸引到的第三方关注只有一处:一个聚合页面在仓库出现后数小时内就转发了模型卡;那只是模型卡的镜像,并非独立来源,所包含的信息也不超出仓库本身。这就是截至 9 月 6 日的全部公开记录。对于正在决定是否要关注的读者而言,关键的解读框架是:inclusionAI 已在同一周内两次悄无声息地发布扩散权重——该模型于 9 月 5 日发布,而 LLaDA-Image 生成检查点则是在前一天——因此,静默上传仓库似乎是该实验室既定的发布模式,而非意外。但这一模式本身并不能告诉我们是否会有正式公告。
LLaDA2.2-mini 究竟是什么
该模型最令人感兴趣的地方在于其架构,模型卡上对此有完整描述。LLaDA2.2-mini 是一个基于 LLaDA2.0-mini 主干构建的混合专家(MoE)扩散语言模型。扩散语言模型将常规的生成循环颠倒了过来:它不像自回归模型那样逐个预测下一个 token,而是从一个掩码或加噪的 token 区块出发,并行地精炼整个区块,通过去噪逐渐形成连贯的序列。LLaDA2.2 的生成过程还加入了 inclusionAI 所称的“Levenshtein 编辑”机制:两个控制 token——DELETE 和 INSERT——让解码器不仅能改变所生成序列的内容,还能改变其长度与结构,既可以删掉它已经写出的冗余片段,也可以在需要置入新上下文(比如工具返回的结果)的位置打开插入点。该系列模型正是通过这一机制,让扩散解码在多轮、调用工具的循环中得以正常工作:自回归模型只需静静等待下一轮用户输入,而块式扩散模型则必须回过头来修订它已经生成的内容。
相关规格均直接来自规格卡:总参数160亿(不含嵌入层),通过256专家的MoE架构,每个token路由8个专家,每token激活14亿参数;20层、16个注意力头、4个KV头;157,184个token的词表;旋转位置嵌入;以及128K上下文窗口。一种名为Block Routing的技术在扩散块级别限制哪些专家被激活,这正是该模型能够在单块消费级GPU上处理128K上下文的原因。该规格卡将其定位为需要24GB以上显存的显卡,并推荐使用SGLang作为长上下文智能体工作负载的服务后端。

以上便是该版本在家族时间线中的位置——正是这一脉络让“LLaDA2.2-mini”变得清晰可辨。2025年11月,LLaDA2.0成为首个扩展至千亿参数的扩散语言模型;2026年2月,LLaDA2.1新增词元编辑功能,加速了文本扩散;2026年7月,LLaDA2.2世代与LLaDA2.2-flash及其技术报告一同发布,将家族方向指向智能体。mini正是这一世代中至今才兑现承诺的部分:7月发布的报道中已提及一个更轻量的16B flash变体,用于降低部署成本,但独立权重直到9月5日才真正落地。
卡片上的数字,按其标注所示的含义进行标识。
模型卡上的基准测试表是 inclusionAI 自家发布的,发布时间就是权重上线当日,而且没有任何独立实验室复现过其中任何一项结果——Artificial Analysis 上没有 LLaDA2.2-mini 的条目,我们也找不到任何第三方运行记录。应将这些数字视为厂商带有倾向性的自述声明,而非实测事实。在这一框架下,模型卡讲述的故事是自洽的:LLaDA2.2-mini 是面向智能体与长上下文场景的专用模型,它为此牺牲了一些通用基准分数。
• 智能体平均分 — 59.00,来自 τ²-Bench 57.50、Claw-Eval 57.16 和 PinchBench 62.33(供应商报告)。
• 函数调用——在 BFCL v4 上为 47.68,较 LLaDA2.0-mini 的 25.05 和 LLaDA2.1-mini 的 28.44 分别有所提升;在较早的 BFCL v3 上为 69.02。
• 长上下文 — 在LongBench v2上得分34.99,是此前mini版本所取得的15.51和12.13的两倍多,这正是128K窗口带来的具体收益。
• 综合 — 综合平均 46.47,其中 AIME 2026 为 35.05,OlympiadBench 61.11,LiveCodeBench v6 28.14,GPQA-Diamond 44.41,IFBench 24.93 —— 其中数项略低于早前的 mini 版本,这是将训练预算转而投入智能体行为所付出的可见代价。

最后这一点值得多想一想,因为这是一个团队选择该模型、而不是选择纸面上更强的通用模型的真实原因。LLaDA2.2-mini 并不声称自己是数学或指令遵循方面最好的小模型;它声称自己擅长的是扩散模型历来不擅长的领域——持续的、多轮的、使用工具的任务——同时把活跃参数数量保持在足够低的水平,使其在单张 GPU 上也能产生实际影响。BFCL v4 的跃升和 LongBench v2 的跃升,是如果模型卡大体靠谱、就能经得起独立运行检验的数据。
运行它,以及缺失的脚手架。
从纸面上看,运行 LLaDA2.2-mini 之路很直接,因为该发布版本是 Transformers 原生的:模型卡显示可使用 AutoModelForCausalLM 和 trust_remote_code=True 在 transformers ≥ 5.2.0 上进行加载,然后以扩散专用参数调用 generate——推荐的默认块长度为 32、温度为 0.0,且模型卡建议对大多数查询使用 32,768 token 的输出长度。对于面向智能体的长上下文服务,它指向 SGLang;中国大陆用户可使用 ModelScope 镜像。而配套生态尚不存在:在我们能验证的任何提供商处都没有托管 API,也找不到可用的 GGUF 构建,框架支持也仍在定型之中——社区的 llama.cpp LLaDA2 架构实现才刚出现不久,因此量化方面的支撑还相当单薄。
这样一个组合——一种真正全新的解码范式,才问世一天,且仅支持自托管——正是路由层体现其价值的场景,同时又不需要假装新模型已经可以投入生产。要负责任地尝试 LLaDA2.2-mini,方法是让生产环境继续跑在成熟的模型上,而你自己在测试路径上运行它;这正是 OrcaRouter 配置的用途:一个 API 接入 200 多个模型,按提供商标价收费、零加价;自动故障转移保证那个刚满一天的检查点即便停滞也不会拖垮工作流;还有路由 DSL,让你在单一密钥之后,把自托管扩散调用与托管自回归模型组合起来。当——如果——某提供商列出了 LLaDA2.2-mini,同样的透传规则依然适用,你看到的价格就是提供商自己的价格。在那之前,关于可用性的诚实说法是:从 Hugging Face 或 ModelScope 下载 Apache-2.0 权重,然后自己运行。
接下来看什么
有三件事能把目前已知的这些信息变成一个真正的故事,而这三件事今天一件也没有。第一,正式公告:如果 LLaDA2.2-flash 的发布模式仍然成立,那么在悄无声息的仓库发布之后,很可能会出现发布帖和技术报告,而且多半会补上规格卡省略的训练细节。第二,独立复现:agentic 基准均分 59.00 与 BFCL v4 得分 47.68 是最值得复现的成绩,因为 agentic 基准正是评测框架(harness)的选择对分数影响最大的那类基准。第三,服务成熟度:SGLang 部署指南、vLLM 支持路径和社区量化版本,能让你知道 1.4B 激活参数的实际运行成本是否真如规格表暗示的那样低。截至 9 月 6 日,这三件事一件也不存在。权重是真的,许可证很宽松,该架构也确实是一种运行智能体的不同方式——但证明它是一个好智能体的证据,目前不过是供应商给出的一张规格卡。
