
Ember-1 与 Gemma 4 12B:一个让你租用更少的 token,另一个把权重交到你手上
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Ember-1 和 Gemma 4 12B 并不是在争夺采购订单上的同一行,而看清这一点最快的方式,就是问自己:每个月结束时你到底拥有什么。Gemma 4 12B 是 Google 的 119.5 亿参数稠密多模态模型,于 2026 年 6 月 3 日以 Apache 2.0 许可发布——你下载它,检查点就归你所有。Ember-1 是 Fireworks Research 基于 Moonshot AI 的 Kimi K3 开发的专门衍生模型,于 2026 年 9 月 23 日作为研究预览版发布在该厂商自有的无服务器平台上——你调用它,除了账单之外什么都不拥有。一个是关于 token 的先租后买之争;另一个则是资本采购。把它们并排放置,有用的比较并不是哪个模型更好,因为没有任何已发布的信息能让你对此下定论。而是这两种采购形态中,哪一种适合你正在构建的东西。
两份合同,直白陈述
Gemma 4 12B 是一个已完成的开放权重发布版本。Google 会公布权重、架构、基准测试表和许可证,而 llama.cpp、vLLM、MLX、SGLang、Transformers 等运行时社区,会把它跑在你自行掌控的硬件上。购买之后,每个 token 的成本是电费和摊销,而不是供应商开出的一项费用。你要放弃的东西,正是开放权重一贯的代价:容量规划得由你自己负责,而你的质量上限被固定在 119.5 亿参数。
Ember-1 则相反。它没有可下载的权重——它作为供应商自家平台上的一个服务选项存在——也没有公开定价。它提供的反而是一个更窄的宣称,且是建立在一个大得多的模型之上:Kimi K3 的准确率,而达成该准确率所耗费的 token 大约少 40%。Fireworks Research 专门训练它来缩短推理轨迹而不改变答案,并报告称,在七项基准测试和两项客户生产环境 A/B 测试中,推理长度可缩短 35–50% 而不损失准确率。其中每一个数字都是供应商自报的,且未经复现。

代币论点的价值完全取决于谁为这些代币买单
Ember-1 的推介假设了按 token 计费。这一假设对于它所面向的受众来说是成立的——那些针对托管前沿模型运行长时间智能体循环的团队,Fireworks Research 指出 Kimi K3 会将超过 90% 的生成 token 用于内部推理,并且每一轮都会重放之前的轮次,因此早先的推理会被重新读取并重新计费。在这种场景下,缩短轨迹长度就是直接削减月度账单,而 29.9K 输出 token 对比 K3 的 49.3K 的 A/B 结果才是关键数字。
用 Gemma 4 12B 的条件来跑同一个模型,这个论点就瓦解了。当你自行托管一个 Apache-2.0 检查点时,额外的推理 token 消耗的是真实耗时和 GPU 占用,而不是每百万美元的账单。在自己那台 16GB 笔记本上生成冗长的推理轨迹,换来的是更慢的回答,而不是更高的账单。这并不意味着这种低效就无害——在 agent 循环中它依然会不断累积,也依然会表现为延迟——但换算比率不一样,把 40% 的 token 削减当作在自托管硬件上节省 40% 的成本,是一种范畴错误。
规格表,每个维度一行
• 它是什么 — Ember-1:Kimi K3 的研究预览衍生产物,为更短推理而重新训练。Gemma 4 12B:来自 Google Gemma 4 系列的稠密 11.95B 开放权重多模态模型。
• 权重 — Ember-1:未公开任何信息;仅通过供应商的平台提供服务。Gemma 4 12B:Apache 2.0,可下载,无访问门槛。
• 规模 — Ember-1:未披露;继承自 Kimi K3 的架构。Gemma 4 12B:11.95B 稠密,48 层,BF16 格式下权重约 18GB。
• 上下文窗口 — Ember-1:预览版未公布;其基础模型具备 1,048,576 个 token。Gemma 4 12B:256K tokens。
• 输入 — Ember-1:文本。Gemma 4 12B:通过无编码器的统一设计支持文本、图像和音频,部分来源还列出了视频。
• 价格 — Ember-1:未公布;基准表中的美元金额是根据 Kimi K3 的费率表计算得出的。Gemma 4 12B:可免费下载;硬件费用自理。
• 硬件下限 — Ember-1:由供应商自行安排。Gemma 4 12B:16GB 显存或统一内存,依据 Google 的定位。
• 证据——Ember-1:供应商基准测试和两项由供应商执行的 A/B 测试,均未复现。Gemma 4 12B:Google 报告的评估,加上独立的本地运行生态。
Gemma 4 12B 发布了什么,以及它如何读取
Google 自己给出的 Gemma 4 12B 数据,把它置于边缘规模的 Gemma 4 E4B 和更大的 26B MoE 之间:GPQA Diamond 78.8%、MMLU Pro 77.2%、AIME 2026 无工具 77.5%、LiveCodeBench v6 72.0、Codeforces ELO 1659、τ-2 平均 69.0%、MMMU Pro 69.1%、DocVQA 94.9 以及 BigBench Extra Hard 53.0%。这些同样是厂商自报的数据——Google 评估了自己的模型并公布了这份表格——但它们有一个优势:描述的是一个任何人都能下载并重新跑的检查点,这就是为什么开放权重的主张往往很快会获得第三方确认,而封闭预览的主张则不会。
这个模型真正的区别在于结构,而非数值。Gemma 4 12B 没有单独的视觉或音频编码器:图像块和音频波形会直接投影到 token 空间,这正是让一个 12B 模型能够把截图或录音作为输入的原因。它还内置了用于投机解码的多 token 预测草稿器,这是一项延迟特性,而不是质量特性——当你自己运行该模型,预填充的每一毫秒都要由你买单时,这类东西就很重要。
两者真正碰撞之处
这两款模型都面向智能体编程和工具使用场景销售,而这是唯一真正存在选择空间的领域。Ember-1 在 Terminal Bench 2.1 上的成绩为 82.0%,而 Kimi K3 Max 为 80.9%,且 token 用量少 51.9%;其在 SWE-bench Verified 上的结果为 92.2%,而 K3 Max 为 93.2%。Gemma 4 12B 在 Google 公布的数据集中完全没有 Terminal Bench 或 SWE-bench 数字——其智能体表现证据仅有 τ-2 的 69.0%。因此,你无法在共同基准上把两者并列比较,任何这样做的文章都是在编造对比。
可以说,它们处在成本曲线上不同的位置。如果你的智能体工作负载运行在托管的前沿模型上,而账单主要由推理 token 构成,那么 Ember-1 针对的正是这一项——代价是仅有为期两周的访问窗口,且没有公开费率。如果你的工作负载需要在你掌控的硬件上运行、处理截图,或者在供应商决定不再继续预览时仍能存活,那么 Gemma 4 12B 就是二者中唯一能回答这个问题的那个。

一条中间道路,以及在哪里找到它
还有第三种选择,而两家模型各自的营销宣传都没围绕它展开:把更大的 Gemma 4 档位用作混合方案中托管的那一半。OrcaRouter 以供应商标价(加价 0%)在一个 API 后面同时提供 Google 的 Gemma 4 26B-A4B 和 Gemma 4 31B,以及 200 多个其他模型,因此,能访问中等规模 Gemma 的同一把密钥,也能访问那些你原本需要再签一份合同才能用上的前沿模型。Gemma 4 12B 本身不在我们的平台上,Ember-1 也不在——如果你需要在本地使用 12B,直接下载它;如果你想先测试一下更大的 Gemma 能否弥合差距,这个测试只需要一个端点。
这种安排也是评估研究预览版的诚实方式。跨提供商的自动故障转移意味着,一个从预览窗口中消失的模型不会把你的应用程序一并带走——而这正是 Ember-1 的发布状态所引入的具体风险,也是其基准测试表中没有任何内容能够应对的具体风险。
哪一个应该列入你的路线图?
如果所有权是硬性要求——隐私、离线运行、固定的成本下限,或者一款即使供应商改变主意也必须继续运行的产品——那就选择 Gemma 4 12B。它公布的上限低于前沿衍生模型的上限,而它的多模态输入确实具有差异化优势,并且这两个事实都不取决于任何其他人的路线图。
如果你的问题是长时间 agent 运行中按 token 计费的账单,并且你能承受预览版风险,那就选择 Ember-1。在你拥有的两周里,让它以影子模式与现有方案并行运行,在你自己的流量上测量每个已完成任务所消耗的 token 数,并把 40% 当作一个假设,而不是一个费率。你不应该做的是根据质量在两者之间做选择,因为没有人——包括构建 Ember-1 的实验室——发布过能让你这样做的对比。

更重要的是,这两次发布代表了 2026 年末能力被出售的两种方式。一个实验室发布检查点,让生态系统自行判定它的水平;另一个则拿来别人训练好的模型,改进其行为的一个维度,再把这项改进作为服务出售。两者都正当合理,但失败方式不同:开放权重会缓慢且公开地失败,预览版则会突然失败,而且是靠一纸公告来失败。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
