
Ember-1 将 Kimi K3 的推理削减 40%——而细则才是关键
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
最常被引用的数字将是 40%。Fireworks Research 于 2026 年 9 月 23 日发布了 Ember-1,并将其描述为 Moonshot AI 的 Kimi K3 的一个专用衍生模型:它在保持 K3 准确率的同时,达到同等效果所消耗的 token 大约少 40%。这是一个真实且异常具体的说法,而且它附带了三样东西:一份带有 token 缩减列的完整基准测试表、来自生产环境编码流量的两项客户 A/B 测试,以及一个并非全面可用的发布状态。Ember-1 以研究预览版的形式推出,运行在厂商自有的无服务器平台上,访问窗口为两周,是否长期保留取决于需求。理解这其中哪一部分是已交付的产品、哪一部分是论证充分的研究成果,正是整件事的关键。
另外还有一个名称冲突,值得在讨论其他任何内容之前先澄清。另一个名为 Ember 的独立开放研究项目(v0.1.5,来自 Slow Lit Labs)在 2026 年一直在发布长时程连贯性评估,它与本模型没有任何关系。你读到的任何关于 Ember 在匹配推理设置下未能击败 Qwen3-8B 的内容,说的都是那个项目。这里的讨论对象 Ember-1 是来自 Fireworks Research 的 Kimi K3 衍生模型。
Ember-1 到底是什么
Ember-1 不是一种新架构,也不是一个新的基础模型。它是 Kimi K3,经过重新训练,以更简洁地进行推理。Fireworks Research 在其自有的无服务器训练栈上运行了 50 多个训练实验和 200 多项评估,涵盖数学、编程、指令遵循、对话、搜索、工具使用和软件工程,明确目标是去除不会改变答案的推理。该实验室称,在七个基准和两组客户生产流量集上,推理长度可以减少 35–50%,而准确率不下降。上述每一个数字都是由供应商报告的,尚未被独立复现;截至撰写时,还没有第三方发布过 Ember-1 的运行结果。
这种框架之所以重要,是因为显而易见的替代方案早已存在。Kimi K3 自带推理强度设置,而少消耗 token 的省事做法就是把强度调低。Fireworks Research 表示它试过这样做,但低档设置牺牲了太多质量——对于任何在推理模型上调过投入程度的人来说,这个结果都很熟悉。Ember-1 的主张是,强度旋钮太粗,而重新训练则很精细。

为什么推理 token 值得我们付出这么多努力
推理模型的账单主要不是由它的答案决定的。Fireworks Research 指出,K3 在写出任何用户可见内容之前,可能会把超过 90% 的生成 token 花在内部推理上。在单次请求中,这只是成本高昂而已。在多轮智能体循环中,它会叠加放大,因为每一轮都会重放先前的对话,所以较早轮次的推理轨迹会在后续每次调用中被重新读取并再次计费。Fireworks Research 描述称,上下文会随轮次数大致呈二次方增长。这才是本次发布真正针对的目标,也是为什么其主打指标是 token 数大约减少 40%,而不是质量跃升。
这一机制也解释了风险所在。压缩掉多余的思量是没有代价的;压缩掉模型真正需要的一个步骤则不是。过度激进地削减推理时,被广泛报道的失败模式是:模型跳过某个中间检查而直接跳到结论;在智能体里,这会很晚才表现为一次错误的工具调用,而不是一句错话。Fireworks Research 反复强调质量相当,这看起来是对该担忧的回应,而 A/B 数字则是支持这一点的最接近证据的东西——当然,照例要说明:测试集、通过标准和样本量都由提出该主张的一方选定。
附有其来源信息的基准表
这些是 Fireworks Research 的数据,未复现。右列才是值得仔细阅读的部分:它把每个分数与相对 K3 Max 消耗的 token 数和美元数对应起来。
• Terminal Bench 2.1(n=89)—— Ember-1 82.0%,对比 K3 Max 80.9%、K3 High 77.6%、K3 Low 76.4%;token 用量减少 51.9%,每个任务节省 23.10 美元。
• SWE-bench Verified(n=500)— Ember-1 92.2% 对比 K3 Max 93.2%;token 用量减少 15.5%,每个任务节省 $68.10。
• SWE-Interact(n=75)——Ember-1 20.0%,对比 K3 Max 21.3%、K3 High 13.3%、K3 Low 6.7%;token 用量减少 32.5%。
• DeepSWE 1.1(n=113)——Ember-1 75.2% 对比 K3 Max 66.4%;token 用量减少 23.7%,每项任务节省 $126.90。
• τ-2 Bench Airline(n=50)——Ember-1 66%,K3 Max 64%,K3 High 和 Low 均为 64%;token 用量减少 5.9%,每项任务节省 $0.30。
有两点很突出。第一,Ember-1 在 Terminal Bench 2.1 和 DeepSWE 1.1 上完胜,而在 SWE-bench Verified 和 SWE-Interact 上仅以微弱差距落败——这种模式与这样一种模型相符:它与其说丧失了能力,不如说改变了它在哪些任务上投入深思。第二,token 节省幅度极不均匀:Terminal Bench 上为 51.9%,相比之下 τ-2 Airline 上为 5.9%。无论 Ember-1 学到了什么,它都不是对思考一律削减 40%。标题中的“约 40%”是一个平均值,覆盖范围大约从 6% 到 52%;工作负载类似 τ-2 Airline 的团队不应指望能感受到它。
生产环境的 A/B 测试是更有说服力的证据,恰恰因为它们并非为基准测试而构建。在一位客户的编程工作负载中,Ember-1 得分为 0.753,而 K3 为 0.751;用了 21.4 步,而 K3 为 23.8 步;输出 29.9K token,而 K3 为 49.3K——推理 token 减少 71.3%,总 token 减少 39%,质量大致相当。第二位客户在质量相当的情况下,每项任务的 token 减少了约 35%,而 Fireworks Research 表示,它先在自己的内部编程和协作流量上进行了切换,报告的结果是没有人注意到。把所有这一切都视为厂商报告,但要将其视为厂商报告中最强的一种:A/B 偏好和任务完成数据比排行榜更难被操纵。
还有一项评估,是在 Doximity 的 Bedside Bench 上——涵盖十个类别的 500 个经医生验证的临床病例——Fireworks Research 声称 Ember-1 在每任务成本上划定了新的帕累托前沿,并将其与包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5 在内的开源和闭源模型进行了比较。这是一个关于帕累托位置的厂商说法,而帕累托位置是关于二维权衡的说法,而非单一分数,其可靠性完全取决于背后的成本假设。这些假设来自 Kimi K3 的公开 API 费率表。这就把我们带到了读者今天真正能够核实的那部分故事。

基础模型就是你已经可以路由的那部分
Ember-1 的整个成本论据都是对照 Kimi K3 公布的费率来衡量的。Kimi K3 已在 OrcaRouter 上线,价格为每百万输入 token 3.00 美元、每百万缓存输入 token 0.30 美元、每百万输出 token 15.00 美元,上下文窗口为 1,048,576 个 token。这与 Fireworks Research 对比所采用的费率表相同,而且值得注意的是,那些 token 削减列中的节省额是依据你自己就能看到的数字计算出来的,而不是依据供应商内部的成本模型。
Ember-1 本身并不在 OrcaRouter 上。它仅通过厂商自有的无服务器平台以研究预览形式提供,而 Fireworks Research 尚未公布其价格——因此基准测试表中的美元数字是根据 K3 费率和 token 数量推算出来的,而不是来自一份真实存在的 Ember-1 价目表。如果你感兴趣的是算术本身,那么诚实的顺序是:先按 K3 当前的路线为工作负载定价,把 token 减少的百分比视为切换可能带来的收益上限,并在有公布的费率之后再把这笔节省建模为金钱。
OrcaRouter 在这里真正能帮上忙的地方,就在于这种对冲。一个只有两周访问窗口的研究预览版,正是那种你想试用、却又不愿把生产路径押在它身上的模型;而要在不额外签一份合同的前提下做到这一点,办法就是把它放在与你调用的其他一切相同的端点之后。OrcaRouter 提供 200+ 个模型,都置于一个 API 之下,并具备自动故障转移,因此某个预览模型若到下个月变得不可用,那也只是一次路由变更,而非一次迁移。Ember-1 本身并不要求这样做——但两周的窗口期同样也没理由反对它。
这个版本要怎么办
如果你已经在智能体循环中运行 Kimi K3,那么 Ember-1 给出的数字描述的就是你的账单。多轮重放问题是真实存在的,它是长时间智能体运行中的主导成本,而一个能在不改变自身答案的情况下缩短自身轨迹的模型,值得花时间评估。正确的测试不是基准测试表;而是你自己的流量,以影子模式运行——将一部分真实请求同时发送给两个模型,比较输出,在一两周内保持线上结果不受影响,然后再做任何更改。这也是该发布版本自己的批判性读者群给出的建议,而且这个建议是合理的。
如果你运行的是低深思型工作负载,或者是以短单轮调用为主的工作负载,那么节省下来的成本大部分就会消失,而 τ-2 Airline 那一行才是你现实的预期。如果你需要生产级承诺——价格、服务级别、六个月后该端点仍然存在的保证——Ember-1 目前还没有提供。它是一个研究预览版,Fireworks Research 明确将其能否长期存续与需求挂钩。接下来一个月里有趣的问题是,这个为期两周的窗口是否会成为永久性的服务选项,以及是否有第三方能复现其中任何数字。在这两者之一发生之前,这是一个读起来很强的结果,却不是可以用来制定预算的好依据。

不应把上述任何内容解读为贬低这项工作。在不降低准确率的前提下移除推理,比加入推理更难;而且是在别人的前沿模型之上做这件事,而不是训练自己的模型,这正是 2026 年许多能力工作所呈现的形态。Ember-1 是 Fireworks Research 所说的将持续推出的系列中的首个发布,而这个模板——拿一个已经很好的模型,重新训练其某一维度的行为,再把增量以 token 形式出售——无论这次特定预览最终反响如何,都值得关注。
