
Ling 3.0 Tiny 对比 Gemini 3.5 Flash-Lite:免费并不廉价,现有者仍是稳妥之选
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 586 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1653智能69代码60数学
"免费"是模型市场词汇中最昂贵的词,因为它通常意味着有人正准备向你收取标价以外的费用。这就是Ling 3.0 Tiny——蚂蚁集团InclusionAI新推出的7.9B参数MoE推理模型——与Gemini 3.5 Flash-Lite(Google目前最便宜、最快的Gemini层级)之间这场对决中隐藏的陷阱。Ling 3.0 Tiny目前可免费调用,8月14日促销结束后,每百万token收费$0.06/$0.18——但Artificial Analysis测得,它仅为了在56款模型的评测类别中拿到分数,就烧掉了2.1亿输出token,而中位数仅为6300万,并被标记为"非常啰嗦"。Gemini 3.5 Flash-Lite每token费用是它的五倍,为$0.30/$2.50,但其独立智能指数为36——比Ling 3.0 Tiny高出13分——输出速度约为每秒490 token。更便宜的标价、更快的语速和更低的分数,全都指向同一个模型。这就是这场对比的全部故事,也是你在仅凭价格就默认选择新选手之前需要三思的全部理由。
两款模型同属预算档位,但处于该档位生命周期的不同阶段。Gemini 3.5 Flash-Lite 是成熟的老牌产品:发布于2026年7月21日,由第三方持续重新评测,并被广泛部署为高吞吐、延迟敏感的智能体工作的默认档位。Ling 3.0 Tiny 刚发布一周,定价意在获取用户,且仅被评测过一次。本文厘清了每款模型的实际定位、独立数据说明了什么,以及为何“免费”定价是本次对比中最没有参考价值的数字。
Ling 3.0 Tiny,带有仪表的新成员
Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.
The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Gemini 3.5 Flash-Lite,现任者
Gemini 3.5 Flash-Lite 是 Google 针对同一问题给出的答案,作为 Gemini 3.5 系列中低一个档次的型号推出。它在输入方面原生支持多模态——文本、图像、视频、音频和文件——输出为文本,拥有 1M token 的上下文窗口、最高 64K 的输出 token,以及可配置的推理强度(minimal、low、higher),让流水线可以根据每个请求调节深度和费用。其独立评分实现了真正的代际跃升:Artificial Analysis Intelligence Index 为 36,在 151 个被追踪模型中排名第 12,较 Gemini 3.1 Flash-Lite 的 25 分有所提升。在速度方面,它是 3.5 系列中最快的模型——Google 在发布时称其每秒可输出 350 个 token,而 AA 的实时页面测得其速度约为每秒 490 个 token,在被追踪模型中排名第 2。其厂商报告的智能体(agentic)数据——OSWorld-Verified 上 74.0%、Terminal-Bench 2.1 上 54%、128K 多针检索测试中 72.2%——是 Google 自家的数据,具有方向性参考价值而非权威定论;另外,有一个悬而未决的问题(Google 博客将 computer-use 列为内置功能,但 API 文档中并不支持)值得你在依赖它之前先行核实。
而且,按 token 计算,它在其级别中并不便宜。“Lite”这个名字描述的是该模型在产品线中的位置,而不是下降的标价:Gemini 2.5 Flash-Lite 为每百万 token 0.10/0.40 美元,3.1 Flash-Lite 为 0.25/1.50 美元,而 3.5 Flash-Lite 为 0.30/2.50 美元,缓存输入价格为 0.03 美元。效率优势来自速度和 token 节省,Artificial Analysis 自己的测量显示,实际每任务成本逐代大约翻倍,而每任务时间则减半。
独立的记分牌,需结合上下文阅读
将这两个模型放在同一指标上,差距十分明显:Gemini 3.5 Flash-Lite 为36分,Ling 3.0 Tiny 为23分。但这个醒目的对比只反映了一半情况,因为这两个模型的评分并不是针对同一模型群体。AA 将 Ling 3.0 Tiny 在其微型模型类别(共56个模型)中排在第6位,而该类别的中位数得分是8——远高于同尺寸模型的平均水平。Gemini 3.5 Flash-Lite 在更广泛的追踪模型阵营中位列第12名(共151个模型)。一个是出类拔萃的微型模型;另一个则是开放模型池中扎实的经济型模型。这两种说法都成立,但它们含义不同。就各自所属的级别而言,Ling 3.0 Tiny 在其尺寸类别中的性价比高于 Gemini 3.5 Flash-Lite 在其层级中的表现——但在同一个独立指标上,Gemini 3.5 Flash-Lite 仍然是能力明显更强的模型。

尺寸,每行一个:
• 独立评分 — Ling 3.0 Tiny AA 指数 23(#6/56,类别中位数 8)对比 Gemini 3.5 Flash-Lite AA 指数 36(#12/151)。
• 价格 — Ling 3.0 Tiny 免费促销后每 1M $0.06 / $0.18,对比 Gemini 3.5 Flash-Lite 每 1M $0.30 / $2.50(缓存输入 $0.03)。
• 冗长度 — Ling 3.0 Tiny 在索引运行期间输出了210M个token,而Gemini 3.5 Flash-Lite虽然被测量了,但按该标志并不算冗长。
• 模态 — Ling 3.0 Tiny 仅支持文本,而 Gemini 3.5 Flash-Lite 支持文本、图像、视频、音频和文件输入。
• 上下文 — Ling 3.0 Tiny 为 256K,Gemini 3.5 Flash-Lite 为 1M,两者的最大输出均为 64K。
• 速度 — Ling 3.0 Tiny 在已公布速度数据的端点上约为 90–264 tokens/s,而 Gemini 3.5 Flash-Lite 在 AA 的实时测量中约为 490 tokens/s。
{{1}}速度行是最有可能发生变动的一项。{{/1}}{{2}}Ling 3.0 Tiny 的输出速度确实尚无定论:Artificial Analysis 将其列为 N/A,而 Vercel 宣称可达 264 tokens/秒。{{/2}}{{3}}Gemini 3.5 Flash-Lite 的约 490 tokens/秒是 AA 在自身发布波动平息之后很久取得的实时测量值。{{/3}}{{4}}对于延迟敏感的层级而言,这就是已知确定值与悬而未决的问题之间的差别。{{/4}}
冗长经济学:为什么免费并不廉价
以下算术通常决定这场对决。在 Ling 3.0 Tiny 的促销结束后,让两个模型运行同样的推理密集型任务——比如 4,000 个输入 token、2,000 个输出 token。Ling 3.0 Tiny 计费 (4,000 × $0.06 + 2,000 × $0.18) / 1,000,000,约 $0.0006。Gemini 3.5 Flash-Lite 计费 (4,000 × $0.30 + 2,000 × $2.50) / 1,000,000,约 $0.0062。在相同 token 数量下,Ling 3.0 Tiny 便宜 10 倍。再加上冗长度因素:一个以思维 token 作为输出的推理模型,不会产生相同的 token 数量。如果 Ling 3.0 Tiny 的 210M 对 63M 的冗长度比率在你的工作负载上成立,那么输出端的每任务有效成本大约会增至三倍,10 倍优势就会缩小到 3–4 倍。仍然更便宜——但已不再是免费,而且不像 210M 这个数字听起来那样差距悬殊。
诚实的说法是,这两个模型并非同等质量水平的替代品。Ling 3.0 Tiny 的 23 分对于 1.3B 激活参数的模型来说是出色的成绩;Gemini 3.5 Flash-Lite 的 36 分则是另一个能力档次,外加视觉能力、1M 上下文和成熟的运行速度。你要为这一差距买单——每 token 价格高出五倍,算上速度差异后每项任务的成本更高——但这是真实的能力差距,不是营销包装。如果你的工作负载能接受更便宜模型的质量,Ling 3.0 Tiny 更物有所值。如果你的工作负载需要这种能力,任何价格优势都无法弥合差距。
路由器发挥作用之处
这正是路由层胜过单一模型绑定的工作负载形态,而托管实情决定了你如何构建它。Gemini 3.5 Flash-Lite 现已在 OrcaRouter 上线,按供应商标价——每100万token输入$0.30、输出$2.50,以0%加价直通,因此 Google 价目表上的数字就是我们这边的数字,任何未来的降价都将在当天同步生效。它与其他200多个模型一样,位于同一兼容 OpenAI 的端点之后,当基准供应商在运行中途降级时,可跨供应商自动故障转移,并且路由 DSL 可以将提示词发送给多个模型并保留最佳答案。
Ling 3.0 Tiny 不在 OrcaRouter 上;它由自己的端点提供服务,目前免费。这种组合实际上让路由的理由更充分,而不是更弱。趁免费窗口期,用你自己的流量对 Ling 3.0 Tiny 做基准测试,赶在它开始收费之前。然后在托管层上构建生产链路——对于需要视觉、长上下文或稳定速度配置的调用,使用 Gemini 3.5 Flash-Lite,路由层可以自由地为少数困难请求升级到更昂贵的模型。免费层是一个很好的实验,也是一个脆弱的依赖;托管层才是你可以依托来构建产品的东西。在 OrcaRouter 上,你可以在同一个图中运行两者——Ling 3.0 Tiny 通过直接端点接入,Gemini 3.5 Flash-Lite 通过密钥接入——然后让路由器为每个请求做出决定。

判决
如果你要在两者中二选一,而不是将它们一起路由使用,这个决定说起来简单,但让人难以接受。Ling 3.0 Tiny 是更划算的选择,但也是更弱的模型:它刚发布一周,是纯文本推理层级,就其规模而言得分优异,定价激进,速度与冗长程度尚不明朗;它值得立即免费试用评估,也值得留意它将在 8 月 14 日起按量计费。Gemini 3.5 Flash-Lite 是更稳妥的默认生产选择:独立评测得分高 13 分,支持多模态,拥有 100 万上下文,经既定测量速度快五倍,定价也相应更高。当模型在较低的能力上限下要多说三倍的内容来思考时,免费并不便宜——而现有方案成为稳妥之选是有原因的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
