
Ling-3.0-flash-base:蚂蚁集团低调发布的检查点版本,现已正式
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
蚂蚁集团的 inclusionAI 实验室将Ling-3.0-flash-base和五个兄弟检查点于2026年8月11日上传到 Hugging Face,未附带任何公告;整整一周里,这六个仓库的下载量都为零——实验室之外似乎没有人注意到。随后,在8月19日,实验室的官方账号公开介绍了这个合集,其中的每个模型卡都在几分钟内得到了更新。这是一篇关于该发布目前已知信息的报道。简要版本如下:Ling-3.0-flash-base并不是一个聊天模型,也不打算成为聊天模型。它是 Ling-3.0-flash 的原始、对齐前的基础检查点;Ling-3.0-flash 是一个拥有124B参数、其中5.1B参数活跃的专家混合(MoE)模型,以MIT许可证发布,供那些想要继续训练它而非调用它的人使用。
时间线:沉默一周,然后发布公告。
顺序很重要,因为它告诉你如何解读本文中的其他所有内容。六个仓库均创建于8月11日,而Ling-3.0-flash-base——也就是本文标题所指的那个合并检查点——的权重于8月12日随一次“初始模型发布”提交落地。没有博客文章、社交帖子或公告伴随其中。在我们进行研究时(一周后),六个仓库中的每一个仍然显示零下载。
这种沉默在8月19日结束。Ant Ling官方账号公开宣布了检查点集合,所有六个仓库的Hugging Face卡片也在几分钟内相继更新——时间戳几乎完全吻合。因此,诚实的说法是:权重是悄悄发布的,公告迟了一周,目前关于这次发布所能了解到的一切,都来自模型卡片本身以及一个简短的训练手册仓库。其他任何信息都尚未得到独立验证。
实际交付的内容:六个检查点,三个训练阶段
InclusionAI 将这次发布描述为 Ling-3.0 系列“训练过程中的检查点集合”,该系列是迄今为止最高效的语言基础模型家族。对于两个最小尺寸中的每一个——Ling-3.0-tiny和Ling-3.0-flash——实验室发布了三个检查点,每个训练阶段一个:
• 预训练 — Ling-3.0-flash-base-30T和Ling-3.0-tiny-base-30T:已完成大规模预训练;无中期训练、无合并、无后期训练。
• 中期训练—Ling-3.0-flash-base-midtrain和Ling-3.0-tiny-base-midtrain:完成了中期训练阶段;未进行检查点合并和后期训练。
• 合并 — Ling-3.0-flash-base 和 Ling-3.0-tiny-base:WSM 合并的基础检查点,由中期训练权重生成,代表后训练之前的最终基础状态。
所有六个都是基础检查点。它们都未经过对齐阶段——监督微调、偏好优化、RL——这一阶段能把基础模型变成可以直接面向用户的东西。模型卡上也直截了当地说明:不建议直接用于终端用户聊天部署,不建议在缺乏额外对齐和评估的情况下用于安全关键型应用,也不建议在未经后训练和任务特定验证的情况下用于生产。
基础检查点是什么——以及为什么 WSM 的变体很重要
如果你只通过 API 使用过模型,"基础检查点"听起来可能像是一个你已知模型的更小或更旧版本。其实两者都不是。基础检查点是从预训练中产出的未对齐神经网络权重文件;你实际使用的指令遵循、工具调用行为是在它之上叠加的。发布基础检查点,是实验室向研究社区提供原始材料,使其能够自行进行继续预训练、微调、蒸馏和强化学习的方式。
让这次发布比一般的基座权重发布更有意思的是其背后的训练配方。InclusionAI 采用了一种它称之为Warmup-Stable and Merge(WSM)的技术,该技术用加权检查点合并取代了传统训练末期的学习率衰减。通俗来说:实验室不是让学习率逐渐衰减以结束训练,而是以稳定的学习率进行训练,在最后阶段保存检查点,并用学习到的权重将其合并。该厂商在模型卡中陈述的动机如下:
• 由于没有衰减阶段来“固化”最终的数据混合,由此产生的基础模型更适合持续的预训练和动态数据扩展。
• 由于合并配方可以离线探索,团队可以比较不同的衰减曲线而无需重新运行昂贵的训练过程对每一种衰减曲线而言
这第二点正是让这次发布成为研究产物而非猎奇之物的关键:这些检查点的全部意义在于它们将被进一步训练,而这一配方正是为了能承受这一点而设计的。
Ling-3.0-flash-base 里面有什么
该架构与后训练的 Ling-3.0-flash 相同,从该模型的广泛报道中应该已经熟悉。从模型卡和config.json:
• 规模——根据供应商提供的数据,总参数为124B(Hugging Face上含嵌入的完整检查点约为127B),其中每个token激活5.1B参数。
• Sparsity — 一种 1/64 稀疏 MoE:512 个路由专家,每个 token 激活 8 个路由专家和 1 个共享专家。
• 注意力 — 一种原生混合线性设计:在 42 个 Transformer 层中,35 个 Kimi Delta Attention (KDA) 层和 7 个 Gated MLA 层以 5:1 的重复模式排列。
• 上下文——该配置包含 256K token 的位置嵌入(262,144),与后训练的兄弟模型具有相同的原生上下文长度。
• 权重 — BF16,以 28 个 safetensors 分片形式发布(磁盘上约 255 GB),并附带自定义的bailing_hybrid建模代码捆绑在仓库中。
• 许可证 — MIT,无附加可接受使用条款。

关于规模数字,需要坦诚说明一点:供应商的模型卡上写的是“总计124B”,这也是到处流传的数字——但仓库中 safetensors 参数总数在计入嵌入层后约为 127.5B。124B 是不含嵌入层的总计,这两个数字并不矛盾;当你在侧边栏或下载器中看到“127B”时,有必要知道你看的是哪一个。
它适用于什么,以及不适用于什么。
模型卡的推荐使用场景是明确的:
• 继续预训练
• 中期训练
• 领域自适应的监督微调
• 偏好优化与RL后训练
• 蒸馏研究
• 长上下文与 MoE 系统研究
而且,它的“不建议按原样使用”清单也同样明确:直接面向终端用户的聊天部署、未经对齐的安全关键型应用、未经后训练的生产环境使用。换言之,这是面向模型训练者的原材料,而非可直接部署的模型。如果你不打算微调或预训练任何东西,那么这里没有你需要下载的内容——这也没什么不对。
故事的另一半是无缝扩展设计。InclusionAI表示,Ling-3.0-tiny-base和Ling-3.0-flash-base采用相同的训练方案,因此社区可以先在tiny检查点上验证持续预训练或微调策略——该检查点占用的GPU内存要少得多——然后将验证过的同一方案扩展到更大的flash检查点。这是一个深思熟虑的工作流选择,而非发布安排的巧合,对于任何真正想要实验的人来说,这是该系列最有用的特性。
硬件现实,以及大多数人真正想要的路线
flash 基础模型的权重规模无可回避。BF16 格式下约 255 GB 的体量意味着,在动手之前你就需要一台强大的多 GPU 节点(或内存优化的训练配置);基础检查点没有官方的 FP8 或 FP4 量化版本——组织目录中现有的量化变体是针对后训练模型的。微调示例位于 inclusionAI/ling-cookbook GitHub 仓库中,该仓库明确仍处于完善阶段。如果持续预训练不是你们团队的重点,基础检查点就不是你们的切入点。
大多数阅读 Ling-3.0 系列资料的人根本不想要基础检查点——他们想要的是能对话的模型。这就是经过后训练的 Ling-3.0-flash,可通过供应商自己的 API 和多个第三方平台获得。当这样一个快速、新发布的开源权重模型出现时,判断它与你当前技术栈相比的最廉价方式,就是把它与你已在使用的模型并排运行——而这正是路由器的用途:一个 API、一个密钥,以及自动故障转移,这样供应商的一次小故障不会让试用中断。OrcaRouter 以这种方式连接 200 多个模型,按 0% 加价直接传递供应商标价,因此你看到的价格就是供应商自己的价格,而供应商返点会在同一天到账。

尚未确认的是什么
因为这次发布在公告意义上已经是一天前的事了,未确认的列表很长,应将其视为待办事项列表,而非批评:
• 没有针对该基础检查点的独立基准测试。模型卡片嵌入了厂商基准图表,将Ling-3.0-flash-base与同类预训练模型在数学、编程、推理、多语言和长上下文套件上进行对比——但这是厂商自己的评估,托管在内部图片服务器上,没有方法论部分,也没有第三方复现。
• 尚无社区复现。截至研究时,六个仓库的下载量均为零,几乎没有任何互动。此次发布太新,还没有人基于这些权重发布独立的微调或继续预训练运行。
• 工具支持尚处于早期阶段。该 bailing_hybrid 架构自带自定义建模代码,因此你依赖于 trust_remote_code,或依赖于已添加支持的框架。微调指南明确仍是一项进行中的工作。
• 公告本身内容单薄。公开介绍是以一条X帖子串和模型卡的形式发布的;除了模型卡所述内容之外,没有单独的发布文档描述训练数据、算力或精确的合并配方。
相比之下,经过后训练的同系列模型确实有独立的公开记录:Ling-3.0-flash经Artificial Analysis追踪,智能指数(Intelligence Index)为38——这一数字来自排行榜,而非厂商。而Ling-3.0-flash-base目前还没有任何此类记录;基础检查点没有在任何地方提供服务,因此也不在任何排行榜上。这两个模型工件处于完全不同的验证阶段,最好不要混淆它们。

现在谁该采取行动
三个群体应以不同的方式阅读本文:
• 进行持续预训练、领域SFT或蒸馏的研究人员——这正是适合你的版本。WSM合并的基础检查点专为继续训练而构建,tiny-then-flash 方案提供了一种在扩展前验证方法的低成本途径。从Ling-3.0-tiny-base开始,验证该方案,然后转向Ling-3.0-flash-base。
• 想要可用模型的工程师——您需要的是后训练的 Ling-3.0-flash,而非此版本。基础检查点不会遵循指令,也未在任何地方提供服务;请勿将 API 客户端指向它们。
• 其他所有人——有用的做法是观望。未来几周值得关注的信号包括:基于这些权重开展的首次独立微调、社区对供应商基准图表的复现,以及第三方训练栈是否会提供一流支持给bailing_hybrid架构。
常见问题
Ling-3.0-flash-base 和 Ling-3.0-flash 有什么区别?
Ling-3.0-flash是后训练模型——经过监督微调和强化学习对齐,能够遵循指令、执行工具调用,并通过 API 提供服务。Ling-3.0-flash-base是同一架构的早期阶段:它是后训练之前最终合并的基础检查点,不会表现得像聊天模型。这一基础模型的存在是为了让研究人员能够自行进行继续预训练、微调或蒸馏,而不是从头开始。
为什么实验室会发布未经后训练的检查点?
因为后训练正是大多数研究者想要自己进行的工作,而基础检查点是进行后训练的正确起点。分别发布预训练、中间训练和合并后的检查点,意味着团队可以选择与自己工作相匹配的阶段:从预训练权重继续进行预训练,或从合并后的基础模型进行微调和强化学习——并且,得益于WSM,无需受学习率衰减约束的限制,这些约束在进一步训练基础模型时会让其变得脆弱。
我能在消费级硬件上运行Ling-3.0-flash-base吗?
实际上不行。BF16 权重分布在 28 个分片中,总计约 255 GB,且基础检查点没有官方的量化版本。较小的姊妹模型 Ling-3.0-tiny-base 才是为在更普通硬件上进行实验而设计的——它沿用了 flash 检查点的训练方案,因此验证过的实验可以扩展到更大规模。
Ling-3.0-flash-base 可以免费商用吗?
是的——它根据MIT许可证发布,不附带可接受使用附加条款。这既涵盖研究用途,也原则上涵盖对权重及基于这些权重构建的任何微调模型的商业用途。它是一个基础检查点,因此这里的“使用”指在其上进行训练;许可证对托管API未作任何说明,因为基础模型并不存在托管API。
底线
对大多数读者来说,Ling-3.0-flash-base 是一个路标,而不是一个产品:它告诉你 Ling-3.0 系列的发展方向,以及实验室希望社区如何在此基础上进行构建,但这里没有任何可以通过 API 调用的东西。对于少数实际在做继续预训练、微调或蒸馏的人来说,它是一个真正有用的发布——六个检查点,采用 MIT 许可,被刻意设计成可以进一步训练,并提供了一条小模型优先的路径,让实验成本变得可负担。而能将它从“有用的发布”变成“经过验证的配方”的,恰恰正是今天所缺少的:一项由实验室之外的人完成的独立复现,展示当有人持续训练 WSM 检查点时,它们能发挥出怎样的能力。
