
Boreal vs Kimi K3:两者都无法在你的硬件上运行
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
九十六个 Safetensors 分片。下载 Kimi K3得到的就是这个——一个拥有 2.8 万亿参数的混合专家模型,每个 token 激活 1040 亿个参数,于 2026 年 7 月 27 日以修改版 MIT 许可证发布,此时距 Moonshot AI 发布它已有十一天。Moonshot 自己针对其服务部署的指南建议采用至少 64 个加速器的超级节点配置。Boreal完全无法下载:Creatify 的广告视频模型于 2026 年 9 月 15 日推出,是闭源且自助式的,定价为每秒钟成品 720p 级视频 1 美分。其中一个把权重和硬件账单交到你手上。另一个则把权重留在自己手里,并按秒向你收费。两者都不在你的硬件上运行,而原因恰恰相反——这正是这个对比值得做的原因。
“开放权重”实际给你带来的是什么
“开放权重”这一标签在这组对比中确实起了作用,而它起的作用比听起来要小。
使用 Kimi K3,你真正得到的是持久性。权重以文件形式存在。如果 Moonshot AI 改变定价、降低该模型的优先级,或者消失,检查点仍会存在——支持它的服务栈也会存在,vLLM、SGLang 和 TokenSpeed 都被列为受支持的路径。这不是营销说辞;这是该产物的固有属性。对于风险登记册中包含供应商集中风险的组织来说,这是此次发布最有价值的一点。
你得不到的是可以自行运行的部署。一个拥有896个专家的2.8万亿参数稀疏模型,并不是“量化一下就能直接上手”的东西。官方建议的64个以上加速器并不是一个意志坚定的团队就能大幅压低的保守基线,而是对模型所针对的那一类机器的描述。凡是能以任何接近生产规模的方式运行 Kimi K3 的团队,实际上都是在向运营超级节点的一方租用它。这意味着,权重公开并没有改变实际可用性的问题:你仍然是在从第三方购买推理服务,唯一发生变化的是许可证。
有一条许可细节值得仔细阅读,因为这是大多数摘要都会略过的部分。修改后的 MIT 条款规定,只有在月活跃用户超过 1 亿或月收入达到 2000 万美元时,才会触发品牌和署名义务;并要求被许可方及其关联方在任意连续十二个月内收入超过 2000 万美元的模型即服务业务,必须与 Moonshot 另行签订协议。内部使用和微调基本被允许。转售则受到限制。对于前沿模型来说,这是一份合理的许可,但它与 MIT 有着本质区别——对于计划在其之上构建产品的初创公司而言,这个门槛是未来要谈判的事项,而不是当下的权利。
Boreal 反而给你寄来的是什么
Boreal 做出了相反的取舍,而且这比表面看起来更加深思熟虑。
Creatify 表示,它拥有这些权重并自行提供服务,而且它进行后训练所基于的基础模型是一个能联合生成音频和视频的开源模型。这两点合在一起,就是整个产品策略。开源的血统大致告诉你,被调用的是哪一类模型,以及音频并不是事后才附加上的。所有权则告诉你,没有其他人能提供它,而这正是按秒定价得以成立的前提。
你得到的不是持久性——而是吞吐量。Creatify 宣称其渲染速度与实时大致为 1:1:每过一秒挂钟时间,就产出一秒成片。这更像是推理工程的结果,而非模型质量的结果;而即便权重明天被公开,这一点依然会成立。如果下周这个检查点出现在 Hugging Face 上,那么以大约五秒、五美分渲染一段五秒短片的能力,仍将属于搭建服务栈的人——而那个吞吐量已经调优到相当于 64 个以上加速器的参考实现,也仍会是 Creatify 的。
所以诚实的对称性是这样的:Kimi K3 给你一个你负担不起部署服务的检查点,而 Boreal 给你一个你无法从供应商手中夺走的服务。两者都无法自托管。它们中只有一个是针对供应商风险的对冲,而它恰恰是那种对冲成本高于被对冲之物本身的对冲。

规格对比
• 输出 — Boreal:渲染后的视频,720p 级,文生视频与图生视频。Kimi K3:仅文本。
• 权重——Boreal:专有,由 Creatify 拥有并提供。Kimi K3:于2026年7月27日发布,96 个 Safetensors 分片,采用修改版 MIT 许可,并附带设有收入门槛的转售条款。
• 自托管——Boreal:不可行。Kimi K3:原则上可行,Moonshot 建议至少配备 64 个加速器。
• 价格 — Boreal:成品视频每秒 $0.01。Kimi K3:每 1M 输入 $3.00 / 每 1M 输出 $15.00,缓存读取为每 1M $0.30,并且在完整上下文窗口内采用统一费率。
• 上下文 — Boreal:未公布。Kimi K3:1,048,576 个 token,无长上下文附加费。
• 延迟 — Boreal:标称为 1:1 实时比。Kimi K3:在我们的测试平台上,首 token 时间的 p50 为 10.00 秒——这是我们测量工具所报告的上限值,因此应将其理解为“慢”,而不是一个精确的测量结果。
• 证据——Boreal:仅由厂商运行。Kimi K3:厂商数据行包括 GPQA Diamond 上的 93.5 和 Terminal-Bench 2.1 上的 88.3,在 Frontend Code Arena 以 1679 Elo 获得第一名,以及独立发现,其中包括在具有隐藏不变式的问题上 36% 的失败率。
你无法关闭的痕迹
Kimi K3有一个即便在推理模型中也颇为罕见的计费特性,而这正是本次对比中最具体的成本差异。
思考模式无法关闭,默认的推理强度被设为最高。每一次请求都会生成完整的推理轨迹,而这条轨迹的每一个 token 都按每百万输出 $15.00 计费。即便某个任务的答案只有一个词,你仍然要为一番深思熟虑买单。每百万 $0.30 的缓存读取大幅缓解了输入端,而且在整个 100 万上下文范围内采用统一定价,确实比竞争对手使用的分层结构更友好——但输出端没有任何廉价模式。
Boreal 的成本没有可供弄错的同类杠杆。无论模型是费了很大劲还是轻松完成,一段五秒的片段都是五美分,因为计费单位是成品,而成品是固定的。这未必就更好——它只是完全不受模型内部任何行为的影响。
Kimi K3 已在我们的目录中,而且它是我们榜单上最繁忙的模型,且优势巨大:过去七天共 31.506 亿 token,是 Grok 4.6 流量的十七倍以上,也是 GPT-5.6 Sol 的十三倍。这样的体量,就是开放权重前沿模型在生产环境中的样子——调用方众多、对价格敏感,并且愿意绕开服务最差的那家。它与目录中其他模型共用同一把密钥,按服务商标价费率、0% 加价,而这一点对开放权重模型比对闭源模型更重要:当检查点公开时,价格由正在提供服务的那家服务商决定,因此价格本身就是竞争变量,而且会不断变动。
Boreal 不在我们的产品目录中。OrcaRouter 并不提供视频生成模型,而广告流程中的文本层——简报、钩子变体、合规审查——正是我们相对于它所处的位置。

哪一个,以及要注意什么
如果你的约束是供应商集中度,而且你能获得强大的算力,那么在这两者中,Kimi K3 是唯一能给出真正答案的,而在隐藏不变量问题上的 36% 失败率,就是需要与这一点权衡的数字。它是一款前沿级模型,并附带一条真正的逃生通道,而这条逃生通道贵到大多数团队永远不会去用。
如果你的衡量标准是每个成品广告素材的成本,那么 Boreal 是更便宜、也远更可预测的选择,但它的短板集中在一种特定格式上:在供应商自己的 40 个案例测试中,单人出镜口播片段得分仅为 60%,而产品场景和创作者场景分别为 83% 和 85%。在把整个营销活动押注于这种格式之前,先对它进行测试。
关于证据有一点需要提醒,因为它对二者都适用。Kimi K3 已公布的智能指标至少被修订过一次,因此来自同一评估方、处于 57 至 60 区间的旧数据,不应与当前数据并列引用——这提醒我们,基准分数是带有时间戳的观测结果,而不是模型的固有属性。而 Boreal 的每一项质量数据都来自 Creatify 自己的发布文章。Boreal 的第一份独立评估无论何时出现,其价值都将超过目前所有关于它的已发布内容。

