
Liquid AI d1-3B 对比 Gemma 4 12B:决策模型对阵通用模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把这个对比搞错的最快方式,就是把 Liquid AI d1-3B 和 Gemma 4 12B 放到同一个基准测试上,然后坐等一个赢家。它们回答的并不是同一个问题。Liquid AI d1-3B 是一个 3.12B 的决策模型,于 2026 年 10 月 7 日以开放权重形式发布:你给它一个状态和一组具名问题,它返回概率、一个选定的标签和一个置信度,输出 token 数为零,没有生成步骤。Gemma 4 12B 是 Google 的无编码器任意到任意通用模型,一个 11.96B 的检查点,可接收文本、图像、音频和视频,并在 256,000 token 的窗口内用 140 多种语言写出答案。其中一个告诉你一块电路板是四种东西中的哪一种,另一个告诉你为什么。仅从质量上比较二者,你什么也学不到,因为它们的输出不可通约——而且厂商从未将它们相互进行过基准测试。比较一次调用实际返回什么、成本是多少,以及各自在哪里走到尽头,这一配对就成了一次真正有用的边界测试。
两种不同的输出契约
这里真正起作用的区别,在于网络上返回的是什么。
Liquid AI d1-3B返回结构化答案对象。请求中的每个问题都会声明一个类型——noul用于是/否,带有 P(yes),choice用于从命名选项集中选择一个,并带有每个选项的置信度和概率,或score用于在有序的 2 到 10 级量表上表示位置,并包含期望级别及其分布。模型报告output_tokens: 0,因为不会写入任何内容。针对一个状态提出的多个问题都从单次前向传递中读取,而该状态及其图像会为所有这些问题一次编码完。
Gemma 4 12B返回的是散文式的文本。有时它会返回你要求的 JSON,有时它返回的 JSON 并非你确切要求的那样,而且它会在作答前先进行推理。它首先是一个语言模型:凡是它知道如何分类的内容,它都以文本形式表达出来。当答案需要向人解释,或者要送入期望语言形式的下游环节时,这是一种优势;而当唯一需要的东西只是一个概率值时,这就是一种代价。
下游的一切都由此而来。d1-3B 的响应不可能解析失败。它也无法解释自身,而模型卡也直接说明了这一点:它不是聊天模型,也不撰写文本。
证据的现状
这两组数字的来源并不等同,而在这里,这一点比数字本身更重要。
• Decision Index 0.2.1 — Liquid AI d1-3B 得分为 48.57,由厂商使用官方评分器评分,在 10B 以下的模型中排名第一,领先于得分为 47.11 的 Decider 35B-A3B。Gemma 4 12B 在 Decision Index 上完全没有评分,因此这一行没有对应项。
• 推理基准 — Gemma 4 12B 在 AIME 2026 上得分 77.5,在 GPQA Diamond 上得分 78.8,Codeforces ELO 为 1,659,并且在推理模式下 Artificial Analysis Intelligence Index 为 22,关闭推理时为 13。Liquid AI d1-3B 没有推理基准,因为决策模型不会生成可供评分的推理轨迹。
• 长上下文——Gemma 4 12B 接受 256,000 个 token,并且在 Google 自家模型卡上,128k 下的 MRCR v2 八针测试中得分 43.4%。Liquid AI d1-3B 接受 32,768 个 token。如果你的“状态”是一份四十页文档外加扫描件,那么这一差距就是整个决策的关键,而且差距一点也不小。
视觉 — Liquid AI d1-3B 在十一项公开图像基准测试上的平均得分为 74.1,这些基准被视为在各自选项集上做出的决策;相比之下,其构建所基于的主干模型 LFM2.5-VL-3B 为 73.9。厂商还报告称,移除图像后,同样的问题会降至 45.1。Gemma 4 12B 的视觉能力更强、覆盖面更广,但报告将其呈现为生成质量,而非在给定命名选项上的决策准确率。
• 语言 — Liquid AI d1-3B 记录了 16 种;Gemma 4 12B 则超过 140 种。
• 速度:d1-3B 在 4090 上为 8 毫秒,在 AGX Orin 64 GB 上为 20 毫秒,在 Orin Nano 上为 50 毫秒,并且在 4090 上以每秒 475 次的速度将 64 个状态打包进单次传递。Gemma 4 12B 是生成式的,因此其延迟取决于它写入多少 token。
• 证据质量——Gemma 4 12B 的结果出自 Google,于 2026 年 6 月发布,此后已被庞大的社区反复推敲、量化并重跑。Liquid AI d1-3B 的结果出自 Liquid,两天前才发布,实验室之外无人复现。读第二列时请据此理解。

他们真正竞争的唯一领域
确实存在真正的重叠,而且它并不在排行榜上。它就是 LLM-as-a-judge 调用。
许多生产流水线早已把一个中等规模的通用模型当作评分层来用:给这张工单的紧急程度打分、判断某段输出是否通过某项评分标准、决定智能体下一步该调用哪个工具、检查检索到的段落能否回答该问题。如今,这类工作大多交给一个生成式模型,让它以文本形式吐出一个数字或一个标签,而它给出的数字不过是采样器产出的结果,而非在你那组选项上做 softmax 得到的。这正是 Liquid AI d-3B 经后训练所要取代的工作流程,公开的演示无一不是它的各种变体:一个为 150 张支持工单回答是或否的 SQL、一个对每条工具输出进行保留、裁剪或丢弃、并削减掉 52% token 的智能体上下文压缩循环,以及一个视觉检测应用——它在四项生产任务中分拣良品与缺陷零件,在其从未接受过训练的任务上达到了 85% 到 97% 的准确率。
Gemma 4 12B 能完成上述所有工作,而且远不止于此。它还能撰写摘要,同时容纳一份 256K 的文档,以录制的电话通话作为输入,并用 140 多种语言中的一种作答。如果你的流水线需要一份评估和一段叙述,那么 12B 用一次调用就完成两项工作,而 3B 决策模型只完成其中一项。
边界在于上下文长度和输出形态。长状态、语音输入、多种语言,或者读者期待的说明——Gemma 4 12B,毫无悬念。短状态、固定选项集、每次请求的延迟预算只有个位数毫秒,或者对答案能被解析的硬性保证——那是 d1-3B 那一列,而通用模型在为你根本用不上的能力买单。
调用每一个需要多少费用
这两个模型都不在我们的目录中,因此两者都没有可报价的路由价格——Gemma 4 12B 不在我们提供的 Gemma 规模之列,而 Liquid AI d1-3B 是开放权重,你可以自行托管,或通过供应商自己的 API 和第三方平台访问。作为该系列中与 Gemini 相关一侧的背景信息,我们确实提供路由的两个 Gemma 4 规模标价如下:Gemma 4 26B A4B 为每百万输入 $0.06、每百万输出 $0.33,Gemma 4 31B 为 $0.13 和 $0.38,两者均支持 262,144 token 上下文以及文本、图像和视频输入。其他地方对 Gemma 4 12B 报出的提供商价格中位数约为 $0.10 和 $0.30。
Liquid 的托管版 d1仅对输入 token 计费,每百万 token 收 0.04 美元,图像则按每 32×32 像素区块计 1.5 个 token 计入输入。因此,一次决策请求根本不存在输出 token 这一行,这正是该厂商拿自家与规模大得多的模型做成本对比、结果却落在那个位置的结构性原因。开放权重没有按次调用的价格;你付出的是硬件成本。而两者都必须和你调用的其他一切处于同一条流水线之中,这正是路由器存在的意义所在——用一套 API 覆盖 200 多个模型,各家供应商的挂牌价以 0% 加价率原样透传,以及 自动故障转移,好让上游的一次抖动不至于变成你的服务中断。这是对比周围的管道设施,而不是对比本身。

说实话,该如何决定
从答案格式出发,而不是从模型出发。如果下游系统能够消费概率、标签和置信度,并且答案集很小且已知,那么 Liquid AI d1-3B 并不是 12B 的降级——它是另一种工具,而延迟数据使其成为一种类别不同的部署:在 Jetson Orin Nano 上达到 50 ms 的设备,根本就不该运行 12B。
如果答案必须是一个句子,或者状态超过三万二千个 token,或者有人要把它朗读出来,或者输出语言是孟加拉语,那么 Gemma 4 12B 就是两者中唯一能胜任的,这场比较还没开始就已经结束了。
对大多数团队来说,真正有用的立场是两者兼用,但放在不同位置。一个决策模型放在昂贵调用之前,负责分诊、路由,以及那些不需要语言能力的护栏检查;一个通用模型放在它后面,处理确实需要语言能力的工作。它们是同一条流水线,一个是过滤器,一个是有效载荷——而最能从 d1 版本发布中获益的团队,正是那些已经在让 12B 模型回答是或否的团队。

