
Ling-3.1-flash 对比 Gemini 3.8 Flash:256K 试用模型对决 1M Token 线上模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把 Ling-3.1-flash 和 Gemini 3.8 Flash 并排放在一起,二者的不匹配之处不在于智能——而在于状态。Ling-3.1-flash 是蚂蚁集团于 2026 年 9 月 29 日至 30 日宣布的约 560B 参数专家混合模型,是一项为期两周的免费试用,提供 256K 服务上下文、32,768 token 输出上限、仅文本输入,且未公布权重、许可或价格。Gemini 3.8 Flash 是谷歌于 2026 年 9 月 2 日发布的 Flash 层级推理模型,是一个正式可用的 API,拥有完整的 1,048,576 token 窗口、65,536 token 输出、多模态输入和公开的价目表。纸面上,这是对两个模型的比较;实际上,这是对一个你今天就能在其上构建的模型与一个你本月只能测试的模型之间的比较。
那不是否定 Ling-3.1-flash 的理由。一个免费、560B 且带有智能体倾向的 MoE,值得任何人花两周的评估时间。但它改变了正面交锋的目的:不是“我该以哪个为标准”,而是“这个试用模型是否好到让我应该为十五天后的答案留有余地”。这些是不同的问题,而它们在下面每个维度上都有不同的答案。
在任何基准测试之前就决定结果的三件事
大多数比较都从分数开始。这一次却应当从可用性说起,因为这方面的差距并非程度上的差异。
• 定价 — Ling-3.1-flash 在试用期内免费,且完全未公布试用期后的价目表。Gemini 3.8 Flash 在促销期间标价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,2027 年 1 月 1 日将恢复为 1.50 美元 / 7.50 美元。以上均为厂商公布的标价;两者均可能发生变更。
• 背景 — Ling-3.1-flash 在试用中提供 262,144 个 token,最终目标据称为 1,000,000 个。Gemini 3.8 Flash 如今提供完整的 1,048,576 个 token。如果你的工作负载依赖百万 token 窗口,那么这两者中目前只有一个拥有它。
• 权重 — Ling-3.1-flash 没有公开任何权重:没有代码仓库,没有许可证,没有模型检查点,只有一句将在试用期结束后开源的意向声明。Gemini 3.8 Flash 是闭源的,而且永远都会是,但它是一个托管 API,你今天就能明确无误地调用。
放在一起看,这三者共同说明了一点:Ling 模型的招牌优势要么是宣传性的(免费),要么是前瞻性的(100 万上下文、开放权重),而 Gemini 模型的优势则是契约性的。这种不对称贯穿了后文的一切。
Ling 模型真正胜出的地方
两个地方,而且都是真实存在的。
首先是评估期间的成本。对于这个规模的模型来说,两周免费试用并不是可以随手挥开的营销噱头——它是弄清一个 560B 的专家混合模型能否处理你的提示词的最便宜的方式。Gemini 3.8 Flash,无论价格如何,都不是免费的,而横跨几千次调用的一次严肃评估要花真金白银。
第二个是开放性的走向。Ling-3.1-flash 是某个确实发布了 MIT 许可权重的模型的继任者,而 Ant 已公开表示也打算将这一款开源。如果它以宽松许可证落地,你就能得到 Gemini 3.8 Flash 永远无法提供的东西:自行托管、微调或蒸馏一个 560B 基础模型的选择。关键在于最重要的一点——你是在押注一个承诺,而上一代的承诺是在延迟两周后才兑现的,并非保证。
在Gemini 3.8 Flash远未接近失败的地方
撇开审判和公开性问题不谈,运营层面的比较明显偏向谷歌一方。
• 输入 — Gemini 3.8 Flash 可接收文本、图像、视频、文件和音频。Ling-3.1-flash 接收文本并返回文本。对于文档、截图或视频工作流来说,这并非偏好,而是一条能力边界。
• 输出上限 —— 65,536 个 token 对比 32,768 个。一旦你需要一次性生成报告、代码文件或较长的结构化输出,这一点就立刻变得重要。
• 吞吐量——独立测试显示,Gemini 3.8 Flash 的输出速度中位数接近每秒 249 个 token,而 OrcaRouter 自己的七天遥测数据测得每秒 552 个 token,首 token 的 p50 为 4.95 秒。Ling-3.1-flash 的试用托管据报道约为每秒 63 个 token。Gemini 模型属于另一个速度等级。
• 参考深度 — Gemini 3.8 Flash 背后有大量独立测量支撑;Ling-3.1-flash 的数据全部来自第一方,基于全新端点,尚无第三方复现。
• 多模态——凡是需要读取截图、PDF 或通话录音的任务,从架构上就注定属于 Gemini,而不是因为质量更好。

基准测试,以及为什么这两组结果实际上无法相提并论
Ling-3.1-flash 由厂商报告的情况是,在五项智能体基准测试上取得 81.0 的综合成绩,其中 Terminal-Bench 4.0 上为 40.4%,SWE-Atlas 上为 55.9%,HealthBench Professional 上为 65.35%;Ant 自己的说法还补充了 GDPVal-AA v2.1 上的 1,673 Elo 以及 FrontierSWE 上的 75.16。所有这些无一例外都是 Ant 自己的测量结果。没有公开的测试框架,而且更关键的是,也没有任何权重可供任何人重新运行这套测试。
Gemini 3.8 Flash 的情况则性质不同。在 Artificial Analysis 当前的 Intelligence Index 构建版本(v4.3.2)上,它在高推理强度下得分为 40.9,中等为 39.8,低为 33.5——值得指出的是,该指数最近经过修订,因此今年秋季早些时候发布的关于该模型的数字是基于不同构建版本计算得出的,不能与这些数字直接比较。谷歌自己对该模型的宣称包括在 HLE-Verified 上达到 54.9,以及在 Terminal-Bench 2.1 上取得八十多分高位的强劲结果。独立方与厂商的数字并排呈现,两者都成立,但不可互换。
有一处干净利落的横向对比值得做,因为二者落在同一基准系列上。在 Terminal-Bench 4.0 上,Ling-3.1-flash 的厂商数据是 40.4%。Claude Sonnet 5.5——一款中端模型,而非旗舰——在同一版本上得分 70.6%。仅这一行,就是反对把 Ant 的卡片解读为“前沿邻近”的最有力论据:该模型在 Ant 选择突出展示的智能体指标上具备竞争力,而在存在外部数字的终端编程指标上则明显落后。

选择的实际形态
如果你需要在未来两周内构建某个东西,答案毫无悬念,而且这并不是在贬低 Ling-3.1-flash。Gemini 3.8 Flash 是这两者中唯一能给你稳定端点、已公布价格、完整百万 token 窗口、多模态输入,以及一份你能读懂的许可证的模型。它是一个生产级 Flash 档模型。
Ling-3.1-flash 是一个评测目标。它当下的价值在于:评测是免费的,而且这个模型本身很有意思——一个 560B 的 MoE,每个 token 仅激活约 25B,这是对稀疏性的一场押注;而 Ant 把它定位的正是 Flash 级模型所竞争的 Agent、搜索和办公自动化这类工作负载。在试用窗口期内用自己的 prompt 亲自跑一遍之所以值得,恰恰是因为 Ant 之外还没人做过——你将成为最早拥有非厂商观点的人之一。
本月真正说得通的决策树是:把生产流量导向 Gemini 3.8 Flash,把免费试用额度花在用 Ling-3.1-flash 跑你最难的提示词上,而把开放权重的问题留作真正的分岔点。如果权重发布时采用宽松许可,且价格落到接近 Flash 档位的水平,那么 Ling-3.1-flash 就会成为一个真正的第二选择——一个你可以自托管的选择,而 Gemini 永远做不到这一点。如果它们发布时附带种种附加条件,那么试用就到此为止,比较也就到此为止。
用一个键运行两者,并坦诚说明缺少什么
Gemini 3.8 Flash 今天已上架 OrcaRouter 目录,模型 ID 为 google/gemini-3.8-flash,按 Google 自家标价提供、零加价——因此当促销价在 1 月恢复原价时,你在这里支付的价格会自动跟随调整,而无需另签合同。另一个同样值得在同一实验中衡量的低价 Flash 层级模型 DeepSeek-V4.1-Flash,也以供应商标价列于同一目录,因此,将试验模型与成熟的 Flash 层级选项进行三方对比测试,只需一个 API 密钥,即可在两者之间完成自动故障转移。
Ling-3.1-flash 不在我们的目录中,针对我们的公共模型 API 查询它以及上一代模型都返回未找到——所以诚实的表述是,试用在它能运行的地方运行,通过厂商自己的入口和第三方推理平台,而我们并不声称托管它。这是本对比中最可能迅速变化的部分:一个处于免费试用、价格尚未公布的模型,正是那种一旦 Ant 及其托管方发布价目表就会立刻进入路由层的东西,而零加价直通意味着,那一天到来时,这里的价格就是那里的价格。
所以,结论比参数数量所暗示的要更微妙。Ling-3.1-flash 是更有野心的模型,也是更有趣的研究成果;Gemini 3.8 Flash 则是你可以实际交付上线的那个。在许可证和价格出现之前,这就是全部的差别——而这并不是一行基准测试数据所能定论的。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
