
Ember-1 对比 LFM2.5 2.6B Base:成品行为对阵原始基底
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
Ember-1 和 LFM2.5 2.6B Base 都不是那种拿来就能用的模型,而它们无法使用的原因恰恰相反。Ember-1 由 Fireworks Research 于 2026 年 9 月 23 日发布,是 Moonshot AI 的 Kimi K3 的一个专门衍生版本,该实验室对它进行了重新训练,使其用大约少 40% 的 token 就能达到 K3 的准确率——这是一种已经定型的行为,仅以研究预览的形式在该厂商自家的无服务器平台上提供,既没有权重,也没有公布价格。LFM2.5 2.6B Base 由 Liquid AI 于 2026 年 8 月 4 日发布,是一个 2.69B 参数的预训练检查点,采用 LFM Open License v1.0 许可,完全没有经过指令微调,它只会续写你的文本,而不会回答你的问题——这是一块原始基材,今天就能下载,且被刻意保持为未完成状态。把两者并排对照阅读,是看清当下关于效率提升究竟来自何处的两种论点的好办法。
两个模型都在回答的问题
两次发布都基于同一个前提:把模型做大所带来的低成本收益已基本被摘取殆尽,而真正有趣的工作已经转向模型如何花掉它已经拥有的东西。两家实验室对此给出了不同的回答。Fireworks Research 拿了一个现有的前沿模型,改变的是它的行为。Liquid AI 则从零开始打造了一个小模型,改变的是规模。两者都不是关于新架构的故事,也都不想登上排行榜榜首。
Ember-1 的答案:保留模型,重新训练行为
Ember-1 不动 Kimi K3 的架构,而是针对一处特定的低效问题。推理模型可能把超过 90% 的生成 token 消耗在内部推敲上,而在多轮智能体循环中,这些轨迹会在后续每一轮被重放并重新计费——Fireworks Research 将由此导致的上下文增长描述为大致随轮数呈二次方增长。该实验室声称,K3 的推理比任务所需更长,而多出的部分可以在不改变答案的情况下去除。它报告称,在其自有的无服务器训练栈上运行了 50 多次训练实验和 200 多次评估,并称在七个基准测试和两个客户生产流量集上,推理长度下降了 35–50%,且没有准确率损失。所有这些都是厂商自报且未经复现的。
结果并不均衡,而这一点被最显眼的那个数字掩盖了。Ember-1 的 token 减少幅度从 Terminal Bench 2.1 上的 51.9% 到 τ-2 Bench Airline 上的 5.9% 不等。在某客户生产环境的编码 A/B 测试中,输出 token 从 49.3K 降至 29.9K,而得分保持在 0.753,对照组为 0.751——推理 token 减少了 71.3%。这意味着它对一种工作负载形态影响很大,对另一种却几乎不可见;而这正是你对一个经过训练、要停止过度思考而非减少思考的模型会有的预期。

LFM2.5 2.6B Base 的回答:改变规模,保持配方
LFM2.5 2.6B Base 是另一种不同的选择。它是 Liquid AI 的小规模混合架构:30 层,其中 22 层是双门控短卷积块,8 层是分组查询注意力层,在约 34 万亿个 token、涵盖 16 种语言的数据上训练,具有 131,072 个 token 的上下文窗口。整个检查点包含 2.69B 稠密参数——小到足以让关于成本的讨论不再围绕 token,而是围绕你手头空余的是哪一块 GPU。
让它与众不同的是它刻意不做的事。它没有进行指令微调,而这也正是“Base”后缀的全部意义所在:交给它一个问题,它会顺着问题的风格继续生成文本,而不是回答它。Liquid AI 自己的模型卡建议将其用于需要大量微调的任务。此外,也没有关于它的已发布评估,而这并非疏忽——在指令遵循基准上评估一个基础检查点不会衡量出任何东西,因为被衡量的行为尚未被训练进去。
对比,每个维度一行
• 它是什么 —— Ember-1:Kimi K3 的再训练衍生版本,推理过程经过缩短。LFM2.5 2.6B Base:从零开始预训练的检查点,未经指令微调。
• 参数 — Ember-1:未披露;继承自 Kimi K3。LFM2.5 2.6B Base:2.69B 稠密。
• 权重 — Ember-1:未公开。LFM2.5 2.6B Base:在 LFM Open License v1.0 下提供。
• 价格 — Ember-1:未公布任何价格;基准测试中的美元成本采用 Kimi K3 的费率卡。LFM2.5 2.6B Base:可免费下载;硬件由你自行提供。
• 上下文 — Ember-1:未在预览版中发布。LFM2.5 2.6B Base:131,072 个令牌。
• 已发布评估 — Ember-1:七项基准测试和两项 A/B 测试,全部由厂商运行。LFM2.5 2.6B Base:无,系有意设计。
• 最终你会得到什么——Ember-1:一个能以 K3 级准确率生成更短推理的端点。LFM2.5 2.6B Base:一个起点,其行为完全取决于你如何训练它。
两种不同的想念
这两个版本中的差距看起来是对称的,实则不然。LFM2.5 2.6B Base 缺失的评估是该制品本身的一种属性:基础检查点没有可供评分的行为,而缺失的指令微调是有意为之的文档化特性,而非缺陷。这种缺失不会造成商业上的不确定性,因为你购买的是一份附带许可证的文件,并且下载完成的那一刻,交付物就已经完整了。
Ember-1 缺失的部分确实尚未解决。没有公布价格,因此成本说法只是基于 Kimi K3 费率卡做的算术推算,而不是你可以据此做预算的费率。没有权重发布,因此该模型无法比供应商继续提供服务的决定活得更久。访问窗口被描述为临时的:Fireworks Research 将其研究发布定位为为期两周的无服务器窗口,其持久性取决于社区需求。一个下个月可能就不存在的预览,与一个仅仅尚未被验证的预览,是两回事;而公告中的第二项客户 A/B——每个任务大约少 35% 的 token——告诉你的是实验室的预期,而不是到 11 月仍然能访问到什么。
这种不对称,就是对“这两者中哪个更就绪”的诚实回答。如果“就绪”指的是可作为即插即用的生产依赖,那么两者都谈不上就绪。LFM2.5 2.6B Base 作为原材料已是成品,作为模型却仍是半成品。Ember-1 作为模型已是成品,作为服务却仍是半成品。

本季度该如何处理每一项
如果你有微调流水线,以及一个标签干净、范围狭窄的任务,LFM2.5 2.6B Base 是两者中更可预测的那个。该检查点很小,许可证宽松,架构在设计上就追求推理高效,而把它变成有用之物的工作——监督微调、评估集、服务栈——是你已经端到端掌握的工作。无论哪种情况,你都得运行自己的评估,因为 Liquid AI 没有发布任何评估。
如果你的托管式智能体工作负载,账单主要由推理 token 主导,那么 Ember-1 解决的是你成本公式中一个实实在在的项,值得花这两周。正确的测试是用影子流量对照你现有的方案:把一部分真实请求同时发给两者,比较输出,不要改动线上结果。这也正是对此次发布的独立批判性报道给出的建议,同时还附有一个公允的警告——压缩审慎推理有可能丢掉模型需要的一步,而在智能体里,这日后表现出来会是一次错误的工具调用,而不是一句错话。
这两个模型都不在 OrcaRouter 上。如果你想测试的是这种模式,而不是这两个具体产物——同一条流水线中的一个小型可微调模型和一个大型托管推理器——那正是路由 DSL 的用途:把多个模型组合成一次调用,并让每个模型处理自己擅长的部分,而背后只需一个密钥和一张账单。即便这两个具体端点都仍然无法触及,这里在架构层面的比较仍然值得做。
这笔交易,说白了
Ember-1 出售的是行为上的确定性以及供应上的不确定性:一个其质量经过仔细论证、其可用性明确附带条件的模型。LFM2.5 2.6B Base 出售的是供应上的确定性以及行为上的不确定性:一个你将始终拥有的文件,而其能力完全取决于你投入其中的训练。有服务问题但没有训练能力的团队应该关注预览版,并希望它成为永久版本。有训练能力且任务范围狭窄的团队应该下载基础版,不再等待任何人的路线图。

这组对比真正说明的是,“效率”已经不再只意味着同一件事。对 Ember-1 来说,它意味着在别人的硬件上以相同质量生成更少的 token。对 LFM2.5 2.6B Base 来说,它意味着模型小到足以让硬件不再属于别人。这两个都是好答案,而且它们不能互换。
