生成了一张编辑类主视觉卡片,标题为“Ling-3.1-flash 已上线,免费两周”,副标题为“560B MoE 如今实际提供的服务”。四张圆角卡片分别写着“参数:总计 560B / 约 25B 激活”、“上下文:262,144 tokens”、“输出上限:32,768 tokens”和“权重:未公开”,其下方一行页脚文字为“厂商公布的规格;试用期结束后价格未公布。”
Guides & Insights

Ling-3.1-flash 已上线,免费两周:560B MoE 实际提供什么服务

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Ling-3.1-flash——蚂蚁集团 inclusionAI 实验室于 2026 年 9 月 29 日至 30 日发布的大约 5600 亿参数的混合专家模型——本周不再只是一份新闻稿:它现在已在实时商业 API 上响应请求。该模型正以两周免费试用的形式在第三方推理网关上运行,并且也出现在蚂蚁自家的 Ling Studio 产品中——这让问题从“它是否存在”转向“它实际提供什么服务”。答案比那些头条数字所暗示的要更有限。Ling-3.1-flash 是文本输入、文本输出;它提供 262,144 token(256K)上下文,尽管公告称最终目标是 1M;其输出上限为 32,768 token;而且没有人公布第十五天你将支付的价格,届时免费窗口关闭,权重也理应随之发布。

公告卡与已上线端点之间的那道差距,是值得牢牢把握的有用之处,因为关于这次发布的大多数报道都把规格说明解读得仿佛该模型今天就会交付这些能力。事实并非如此。Ling-3.1-flash 是这家实验室三个月内第二个以被独立追踪机构 LLM Releases 直白归入“权重未发布”一类的方式出现的模型,而 Ant 对该模型的说法与开发者现在实际能调用的东西之间的差异,正是预算或试点项目可能悄然出问题的地方。

从公告发布到现在发生了什么变化?

公告本身是一篇规格说明帖:约560B总参数、每token约25B激活参数、最多1M token的上下文、三个关键评测数字,以及一个承诺——“我们计划很快开源该模型。”这些都没有改变。改变的是可用性。公告发布后一天内,该模型便已能在商业边缘上访问,而免费试用所开放的,正是与付费版相同的真实端点:相同的API接口、相同的纯文本模态、相同的用于长周期智能体工作的思考模式开关。

对于任何正在权衡是否要为此投入工程时间的人来说,本周的关键全在试用上,而这件事有利也有弊。两周的免费推理确实是一种非常便宜的方式,可以看看模型在你自己的提示词上表现如何——对这样一个规模的模型来说,这实属罕见。但免费是一种促销状态,而不是价格。目前任何地方都还没有公布 Ling-3.1-flash 试用后的价目表,所以你在免费层之上构建的任何成本模型都只是占位符,直到 Ant 及其托管方给出具体数字。

规格表,以及那三个仍是承诺的数字

• 参数 — 总计 560B,每个 token 约 25B 激活。厂商声称如此,且大致是上一代 124B 总参数 / 5.1B 激活的四倍。稀疏比维持在约 1/22,因此激活并没有显著更精简——模型只是比它所接替的模型大得多。

• 上下文——目前以 262,144 个 token 提供服务。"最高 1M" 是窗口启用后的目标;它并不是试用端点目前能给你的东西,而这是本次发布中最常见的一处误读。

• 输出 — 最多 32,768 个 token。对智能体循环来说够用,但如果你想一次生成长篇文档,就显得紧张了。

• 模态 — 文本输入、文本输出。这是一个文本模型。视觉、音频和文件输入不在发布范围内,目前尚未公布它们的时间。

• 推理 — 一种混合技术栈,带有显式的思考模式开关,沿用上一代的同一模式,面向多步骤智能体与工具调用类工作,而不是单轮对话。

• 权重与许可证——尚未发布。这是最重要的一项数据,也是目前完全没有数值的一项:截至今日,既不存在 Hugging Face 仓库,也没有许可证文本,更没有可下载的检查点。

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

基准测试显卡,配上它应有的折扣来解读

蚂蚁自己发布的报告称,Ling-3.1-flash 在五项智能体基准测试中的总分为 81.0,其中 Terminal-Bench 4.0 上为 40.4%,SWE-Atlas 上为 55.9%,HealthBench Professional 上为 65.35%;该公司自己的说法还补充道,它在 GDPVal-AA v2.1 上达到 1,673 Elo,在 FrontierSWE 上达到 75.16。这些数字中的每一个都来自第一方。没有测试框架、没有提示集,也没有权重供其他人重新运行这套测试,这是处在这一阶段的模型的标准附带说明——而在这里值得直说:未经复现的厂商分数是对模型的一种声称,而不是对模型的一次测量。

这张卡片也以一种其作者可能并未有意为之的方式颇具信息量。40.4% 的 Terminal-Bench 4.0 成绩明显落后于前沿梯队;Claude Sonnet 5.5 是一款中量级模型,而非旗舰模型,却在同一版本的该基准测试中得分 70.6%。诚实的解读并不是 Ling-3.1-flash 很弱——对于一款定位于成本优势的模型来说,40.4% 是一个体面的智能体终端(agentic-terminal)数字——而是,发布当天在社交媒体上流传的“在关键基准测试上接近前沿”的说法,一旦接触到具体的行数据就站不住脚。该模型表现最强的基准测试——HealthBench Professional,得分 65.35——也带着一个令人尴尬的脚注:Ant 表示,它是在一个其称为 AQ 的环境中进行评估的,并且该模型的医疗保健能力“目前只能在 AQ 中体验”,却没有在任何公开渠道定义 AQ 是什么。一个附带未具名环境的头条分数只是演示,不是可复现的结果。

为什么大型模型以试用形式推出才是真正的新闻

这里更有意思的举动是这一序列,而不是那些参数。Ling-3.0-flash 直接走向开放权重。而这一次则是先试用:权重、许可证和官方定价全都暂不公布,并公开承诺只在免费期结束后才开源。那是一套商业发布的打法,却披着开放模型公告的外衣,而且这是一个值得追踪的真实变化:如果权重以宽松许可证发布,社区就得到一个 560B 的基础模型,可以用来微调和蒸馏;如果权重附带商业条件,那么这两周试用就是产品本身,而“开源”那句话只是营销。无论哪种情况,这个选择都会在试用窗口内落地,而它才是值得关注的东西,而不是任何单行基准测试结果。

它在哪里运行,以及真实的路由全貌

目前,Ling-3.1-flash 可通过厂商自有产品界面以及运行试用版的第三方推理平台访问——仅此而已。它今天不在 OrcaRouter 的目录中;通过我们的公共模型 API 查询 Ling-3.1-flash、Ling-3.0-flash 以及 Ling-3.0 vision 变体,均返回未找到,我们不会假装并非如此。当 Ant 端点真正全面可用并公布标价时,OrcaRouter 所采用的透传模式——以零加价转发提供商标价,因此供应商降价当天即在我们这边生效——正是适合定价尚未确定的模型的安排。

今天你无需等那个决定落地,就能做一件对尚未验证的模型而言真正重要的对比:把它与你此刻就能调用的 Flash 系列模型放在一起衡量。Gemini 3.8 Flash和 DeepSeek-V4.1-Flash 都已按各自供应商的标价上架在我们的目录中,共用一把 API 密钥,并在两者之间自动故障转移。对于一个处于免费阶段、权重和价目表都未知的模型来说,这才是稳妥的持有方式——试用期内有一个可以随时路由过去的候选,同时拥有一条不取决于第十五天会发生什么的正式生产路径。

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

本周做什么

如果该模型与你的工作相关,那么这次试用就是现在就行动、而不是等待开放权重问题解决的理由——在一个 560B MoE 上获得两周免费推理,是你所能得到的最便宜的评估,而且尽管“我能否自行托管它”的答案还没有,但“它能否在我的提示上经得起考验”的答案今天就能得到。趁窗口还开着,按顺序检查三件事:

• 跑你自己的实际工作负载,而不是那张基准测试成绩单。公布的数字是 Ant 挑选出来的任务;真正决定你技术栈的,是你自己的提示词。

• 测试你实际会使用的上下文。该端点提供 262,144 个 token,而不是 1M。如果你的设计依赖于更大的窗口,那你就是在依赖一个承诺来做设计。

• 不要基于“免费”来构建成本模型。“免费”只是为期两周的状态。在费率卡发布之前,默认应计划切回有定价的 Flash 层级模型,并将 Ling-3.1-flash 视为增量容量。

公告是真的,模型也在运行,这可比一周前所能说的要多。但“已发布并开放”和“在试用中运行”是不同的状态,而这次牢牢属于后者——560B 规格、256K 端点、仅由厂商提供的基准测试卡,以及一个两周倒计时,而这是整个发布中唯一确定的截止期限。

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新