
Ember-1 vs Qwen3.8-Max:以省 token 的衍生之力对抗旗舰
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
这场对比中的两个模型在同一基准上都拿到了实打实的分数,但这仍然无法定论。Ember-1 是 Fireworks Research 基于 Moonshot AI 的 Kimi K3 推出的专门衍生模型,发布于 2026 年 9 月 23 日,在 Terminal Bench 2.1 上报告 82.0%,而所消耗的 token 大约只有其基础模型的一半。Qwen3.8-Max 是阿里巴巴的旗舰模型——一个约 2.4 万亿参数的稀疏混合专家模型,每个 token 约激活 950 亿参数——自 2026 年 8 月 3 日起全面可用,在同一基准上报告 86.6%。这两个数字都由厂商自报,两家实验室都运行自己的评测框架,而两个未公开的评测配置之间 4.6 个百分点的差距算不上定论。真正可以比较的是成本,而这正是这场对比变得有趣的地方:其中一个模型的全部核心理念就是,你不该为不需要的 token 付费,另一个则是定价为每百万输入 2 美元、每百万输出 6 美元的旗舰模型。
每个模型实际上是什么
Ember-1 在任何架构意义上都不是一个新模型。它是 Kimi K3 经过重新训练、以更简洁的方式进行推理的版本,由 Fireworks Research 在自家的无服务器训练栈上通过 50 多次训练实验和 200 多次评估构建而成。该实验室声称,K3 的推理长度超出了任务所需,而多余的推理可以在不改变答案的情况下被去除——在七个基准测试和两次客户生产 A/B 测试中,推理长度下降了 35–50%,且准确率没有损失。它作为研究预览版在厂商自己的无服务器平台上提供,没有公开权重,也没有公布价格。
Qwen3.8-Max 完全是另一类事物。它是 Alibaba 的前沿层级,原生支持文本、图像和视频输入的多模态能力,拥有百万 token 的上下文窗口,并且自发布以来已更新两次:一次是 2026 年 9 月 2 日面向编程与专业办公场景的后训练更新,另一次是 2026 年 9 月 22 日宣布的更快服务层级。Alibaba 将其对标 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro,其公布的评测表也印证了这一雄心——GPQA Diamond 92.6、OSWorld-Verified 86.1、SWE-bench Pro 67.7、PaperBench 93.0、IFBench 82.8,以及 Humanity's Last Exam 43.6,均为厂商自报数据。

并排的价目表
其中一个有价格,另一个没有,这就是第一个实际的不对称。
• 输入 — Ember-1:未公布任何数据;基准表依据 Kimi K3 的费率卡计算美元金额。Qwen3.8-Max:在 OrcaRouter 上每百万 token 2.00 美元。
• 输出 — Ember-1:未公布。Qwen3.8-Max:每百万 tokens 6.00 美元。
• 缓存输入 — Ember-1:不适用。Qwen3.8-Max:缓存读取每百万 token 收费 0.25 美元,仅为输入费率的八分之一,在智能体循环中意义重大,因为每一轮都会重新发送相同的上下文。
• 上下文窗口 — Ember-1:预览版未公布;其基础模型支持 1,048,576 个 token。Qwen3.8-Max:1,000,000 个 token。
• 多模态能力——Ember-1:文本。Qwen3.8-Max:文本、图像和视频输入,文本输出。
• 权重 — Ember-1:无。Qwen3.8-Max:存在开放权重版本,但仅支持文本,缺少所提供端点具备的完整上下文窗口和视觉输入。
• 访问权限 — Ember-1:研究预览版,为期两周的无服务器窗口期,持久性取决于需求。Qwen3.8-Max:正式可用并已定价。
在建模任何东西之前,关于 Qwen3.8-Max 的费率要注意一点:自发布以来,Alibaba 已多次修改该模型的打包方式,而国际费率卡并不总是与 8 月的头条价格一致。请将 $2.00 和 $6.00 视为我们平台当前的线路价格——该价格按供应商标价原样传导,不加价,因此供应商一有变动当天就会体现——在为其编列预算之前,先核对费率卡。
为什么基准测试对比不起作用
Ember-1 的 82.0% 和 Qwen3.8-Max 的 86.6% 都来自 Terminal Bench 2.1,这使二者看似具有可比性,实则并不能使二者真正可比。Ember-1 的表格报告的是其与 Fireworks Research 评估的 Kimi K3 变体对比所得的数字,基于 89 个样本,并附有 token 和成本差值。Qwen3.8-Max 的数字则来自 Alibaba 自己的评估表。不同的实验室、不同的评测框架、不同的智能体脚手架,而在一个仅因脚手架选择就会让分数浮动数分的基准测试中,4.6 个百分点的差距仍落在方法论的本底噪声之内。
你能从 Ember-1 的表格中读到的是 token 列,而这是模型唯一被训练去改变的东西。与自身基础模型相比,Ember-1 在 Terminal Bench 2.1 上少用了 51.9% 的 token,在 SWE-Interact 上少用了 32.5%,在 DeepSWE 1.1 上少用了 23.7%,而在 τ-2 Bench Airline 上仅少用了 5.9%。这种差距本身就是诚实的核心结论。一个能削减反复斟酌的模型,在基础模型过度思考的基准测试上价值巨大,而在基础模型并不如此的基准测试上几乎毫无价值,而如果不衡量你自己的负载,你就无法知道面对的是哪一种。
每项已完成任务的成本,已核算
真正决定这一点的算术如下:用 Kimi K3 公布的费率来替代 Ember-1 的成本,因为 Ember-1 没有费率。Kimi K3 是每百万输入 token 3.00 美元,缓存 0.30 美元,输出 15.00 美元——这正是 Fireworks Research 在其自己的比较中使用的价目表。Qwen3.8-Max 是输入 2.00 美元、输出 6.00 美元,缓存读取为 0.25 美元。
在输入端,Qwen3.8-Max 本来就已经便宜三分之一。在输出端,它每 token 便宜 2.5 倍。这意味着 Ember-1 的 token 缩减并不是在跟一份静态账单竞争——它是在跟一个旗舰模型竞争,而这个旗舰模型在任何效率优化发生之前,每 token 就已经更便宜。Fireworks Research 自己的生产 A/B 测试显示,输出 token 从 49.3K 降至 29.9K,总体减少 39%;把这一点套用到 Qwen3.8-Max 的输出费率上,你会得到同样的 39% 节省,而这比把同样百分比应用到 K3 的 15 美元费率上所获得的绝对收益要小。
因此,Ember-1 的效率优势在与自家基座模型对比时最为突出,而这正是本次发布所主张的论点。若与 Qwen3.8-Max 相比,比较便会转向每美元能力,此时旗舰模型更大的上下文、多模态输入以及可付费使用便成为反驳理由——而且尚无人发布过能为此定论的正面交锋对比。

我们自己的路由数据所显示的
这里涉及的三个模型中有两个是 OrcaRouter 上的实时路由,这提供了任何基准测试表都不包含的视角。Qwen3.8-Max 以 1,000,000 个 token 的上下文提供服务,在过去七天里,首 token 延迟中位数约为 2.0 秒,输出速度约为每秒 52.7 个 token,错误率约为 4.2%。Kimi K3——Ember-1 的基础模型,也是 Ember-1 所声称的每一项节省的参照点——以 1,048,576 个 token 的上下文运行,延迟中位数接近 8.0 秒,输出速度约为每秒 43.6 个 token,错误率约为 0.27%,且流量显著更高。Ember-1 本身不在 OrcaRouter 上。
这些数字重新框定了这个决策。Kimi K3 的首 token 延迟明显更高,按每个输出 token 计的成本大约是 Qwen3.8-Max 的两倍,但在重得多的负载下,错误率却低得多。K3 的省 token 衍生版本缩小了成本差距,却没有弥合延迟差距,因为缩短推理缩短的是生成阶段,而不是排队时间。如果你的工作负载对延迟敏感、而非对账单敏感,那么旗舰版是当下更好的选择,效率叙事则无关紧要。
路由哪一个
当你需要超大上下文窗口、多模态输入、公开定价以及可据此制定预算的服务时,就选择 Qwen3.8-Max。从结构上看,它是两者中更稳妥的选择:已正式可用、有明确价格,并且由一个在保持端点持续更新方面有良好记录的供应商在两个月内两次刷新。
当你的账单主要由长代理循环中的推理令牌主导,并且你是在托管模型而非自己的硬件上运行时,可以尝试 Ember-1。正确的测试是预览版给你的两周时间,针对生产流量进行影子运行,衡量每完成任务的令牌数,而不是每请求的令牌数。你不应该做的是,仅凭一个根据工作负载不同而在 6% 到 52% 之间变化的 40% 数字,就将其作为旗舰模型的同类替代品进行替换。
如果真正的问题是否还要继续运行 Kimi K3,那么这个问题你今天就无需任何预览就能回答:Kimi K3 和 Qwen3.8-Max 都已在 OrcaRouter 上,共用一个密钥,按提供商列表价计费,无加价,并具备 提供商之间的自动故障转移。比较两者在你工作负载上的成本只是一次路由变更,而不是一个采购项目——而且它能给你一个基线,让关于 Ember-1 的任何效率声明都能用你自己的数据来衡量,而不是实验室的数据。

最诚实的总结是,这两个模型是针对不同约束条件进行优化的。Qwen3.8-Max 的目标是成为市面上能力最强的模型,定价也与之相称;Ember-1 的目标则是让一个本就昂贵的模型运行成本更低。两者都合情合理,而这场对比之所以难以给出一个干脆的结论,是因为衍生模型的节省是相对于旗舰模型大幅压低的价目表来定义的。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
