Muse Spark 1.2 对比 Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 对比 Gemini 3.5 Flash-Lite:两个实验室,两种子代理定义

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在相隔不到两周的时间里,两家实验室先后发布了一款模型,并用同一个词来描述它。根据其模型卡,Gemini 3.5 Flash-Lite“适合在复杂的多智能体工作流中执行聚焦任务的子代理。”Meta 表示,Muse Spark 1.2“既可作为负责规划和委派的主要智能体,也可作为并行执行的子代理。”措辞相同,但直到 Artificial Analysis 将两者放入其 Intelligence Index 中进行评测,才显示出它们实际含义有多么不同:Flash-Lite 以 4300 万个输出 token 完成了整套测试,而 Muse Spark 1.2 需要 9500 万个。这两个模型中,一个思考简短而频繁,另一个思考深入而持久。两者都将结果称为子代理。

那个 token 比率是这次对比中最影响决策的数字,因为子代理层级是一种你可以向外扇出的东西——一次二十个、一次一百个——而扇出会把模型每次调用的习惯成倍放大。接下来会逐一分析每个实验室实际构建了什么、在真实价格下扇出算术是什么样,以及哪里便宜的选项最终变成了昂贵的选择。

每个实验室所说的“词”是什么意思

Flash-Lite 版本是一种按规模定义的角色。Gemini 3.5 Flash-Lite 是其家族中最便宜的层级,这一定位之所以值得注意,是因为它将思考级别直接与多步骤子代理工作负载挂钩——这是该家族中首次以代理角色而非规模或速度来描述某个层级。推理是强制性的,但默认投入为最低,调节档位的上限为高,且该模型专为批量调用和快速响应而构建。厂商报告其在 SWE-Bench Pro 上取得 54.2% 的成绩(Gemini 3 Flash 为 49.6%),在 OSWorld-Verified 上取得 74.0% 的成绩(后者为 65.1%)——两项均为厂商报告的数据,未经独立复现,且都被描述为智能体能力的提升,而非原始智能的提升。

Meta 的版本是按拓扑定义角色。Muse Spark 1.2 的产品文案描述了一个模型,它能够收集上下文、制定计划,并在并行子代理之间委派执行——或者自身作为这些子代理之一。其推理旋钮从 minimal 到 xhigh,默认值为 medium,且 Meta 明确列出了目标工作负载:多文件重构、扩展调试会话、整个代码库生成。这是一个旨在成为编排者、同时也能亲自执行工作的模型,这与一个旨在一次生成二十个实例的模型是不同的产品。

两家实验室都没有针对这一具体说法发布基准测试。Meta 于8月5日发布了1.2版本,却完全没有发布公告——其 Muse Spark 1.1 公告页面仍在描述之前的版本。

指数实际衡量的差距

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

独立评分,由Artificial Analysis对两者运行相同的九项评估综合测试得出:

智能指数——Muse Spark 1.2(xhigh)54分,在185个中排名第13。Gemini 3.5 Flash-Lite 36分,在163个中排名第20。两者相差十八分,而同类中位数为32。

输出速度 — 每秒 165.0 个 token,对比 343.6。Flash-Lite 的流式输出速度快了一倍以上。

首令牌时间 —— 26.12 秒对 10.30 秒,两者均采用最大努力设置。Artificial Analysis 指出,Flash-Lite 的 10.30 秒本身就处于其价格档位中推理模型的高端水平。

冗长度——输出tokens为9500万,对比同一套件的4300万;所有模型的中位数为6500万。Muse Spark 1.2高于中位数46%;Flash-Lite低于中位数34%。

运行指数的成本——$637.85,对比$153.08。

按维度——Artificial Analysis 的子指数显示,Gemini 3.5 Flash-Lite 的编码得分为 49.3,智能体得分为 26.8。Muse Spark 1.2 尚无公开的细分数据;其前代产品在编码和智能体上的得分分别为 71.3 和 37.5。

十八个指数点不是舍入差异。它们不是同一个槽位的两个候选者。

扇出算术

对于子代理层级,按 token 计价是错误的视角,因为该层级的核心在于你会运行许多子代理。以标价为例——Gemini 3.5 Flash-Lite 输入 $0.30、输出 $2.50;Muse Spark 1.2 输入 $1.25、输出 $4.25。

一个编排器派遣二十个子代理。每个子代理读取25,000个词元的作用域上下文,并写回1,500个词元。

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = 大约 22.5 美分每次扇出。

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = 约75美分每个扇出。

三又三分之一倍,听起来还算可控。现在套用实测的冗长度差异。如果 Muse Spark 1.2 像在索引测试中那样,比 Flash-Lite 按比例写出更多内容——完成相同工作所需的输出令牌数约为其 2.2 倍——那么那些 1,500 令牌的回复将变成约 3,300,扇出成本将升至约 91 美分。四倍,而不是三倍。在繁忙的智能体系统中,每小时一百次扇出,这意味着每小时 22 美元与 91 美元之间的差别,或在持续负载下每年约 60 万美元的差别。

两个定价细节使实际差距在一端进一步扩大,在另一端则进一步缩小:

Flash-Lite 按输出价格对内部推理计费。 其内部推理 token 的标价为每百万个 $2.50 — 与可见输出相同。思考并非免费,它只是响应中不可见。如果子代理在回答前思考 2,000 个 token,每次调用需增加半美分,或者在整个扇出过程中增加 10 美分。

从比例上看,缓存对 Muse Spark 1.2 更有利。 缓存输入读取价格为每百万次 0.15 美元,而标价为 1.25 美元——折扣达 88%。Flash-Lite 的缓存输入读取价格为每百万次 0.03 美元,对应 0.30 美元的标价,折扣为 90%,但写入缓存还需额外收取约每百万次 0.083 美元的费用,而 Muse Spark 1.2 则没有公布单独的缓存写入费。对于每个子代理共享同一个大型前缀的扇出场景,两者差距会显著缩小。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

在生产延迟方面,Flash-Lite 的领先幅度最大,而基准测试数字掩盖了这一事实。在 OrcaRouter 上,对滚动一周的真实流量进行统计,Gemini 3.5 Flash-Lite 的首 token 延迟 p50 为 816 毫秒,p95 为 4.57 秒。Muse Spark 1.1——目前可用的最接近代理,因为 1.2 还没有遥测数据——的 p50 为 1.84 秒,p95 为 6.00 秒。当二十个子代理并行运行时,最慢的那个决定挂钟时间,因此决定扇出延迟的是 p95,而不是 p50。

当便宜的那个是错误的决定时

Gemini 3.5 Flash-Lite 的四个约束条件,它们不会出现在价格比较中,但会在事件复盘时显露出来。

65,536 token 的输出上限。这一上限是本类大多数模型所允许的一半,对于被要求生成大文件或返回长结构化文档的子代理来说,是一道硬性屏障。Muse Spark 1.2 的端点完全没有声明最大完成长度——这足够反常,值得测试而非轻信,但它并不是文档中记载的上限。

这是一个不受审核的端点。Flash-Lite 的列表没有审核标志;Meta 的 Muse Spark 1.2 列表有。对某些工作负载来说,这是真正的优势;对另一些来说,则是合规问题。这应该是一个有意的选择,而不是事后才发现。

内置搜索成本高昂。 Flash-Lite 的联网搜索工具定价约为每千次调用 14 美元,而 Muse Spark 1.2 仅为 2.50 美元。如果你的子代理要研究而不是只阅读,便宜的那个模型反而会变成昂贵的那个——贵了五倍半——而且在扇出架构中,搜索量会随扇出规模成比例增长。

其价格上涨了,而不是下跌。Gemini 3.5 Flash-Lite 的定价为 $0.30 和 $2.50,而之前的 Gemini 3.1 Flash-Lite 是 $0.25 和 $1.50。输出价格比它所替代的层级贵 67%。如果你是基于旧模型设定子代理预算的,请重新调整。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

还有一个值得直说的不对称之处:Muse Spark 1.2 仅由一个提供商——Meta——提供服务,没有第三方托管,也没有回退方案。Gemini 3.5 Flash-Lite 拥有常规的第一方多区域服务覆盖面。对于编排器来说,这是整个代理树的单点故障;对于工作层来说,这是扇出的单点故障。

大多数团队最终会采用的组合

将两者对照来看,这两个模型与其说是竞争对手,不如说是一个架构的两半,Meta自己的产品文案也印证了这一点——它将主代理角色与子代理角色分开描述。

由这些数字推演出的形态是:以 Muse Spark 1.2 作为编排器,Gemini 3.5 Flash-Lite 作为工作节点。一次昂贵而深思熟虑的调用,读取代码仓库、持有计划并决定委派哪些任务——其中 26 秒的思考和 95M token 量级的详尽输出,换来一份值得执行的计划——随后是二十次廉价、快速、范围狭窄的调用,每次只做一件划定边界的事,p50 时不到一秒即返回。每个任务只需支付一次接近前沿模型的费率,而每单位工作按预算级费率计算,这正是扇出架构所要的成本曲线。

反过来算,经济账就崩了:20个Muse Spark 1.2子代理以每次扇出91美分的价格运行,其费用是一个弱18个点的模型(用三分之一时间即可完成同样工作)的四倍;而指数36的Flash-Lite编排器生成的计划,工人们根本无法挽救。

过去,跨两家供应商构建系统是件棘手的事。Gemini 3.5 Flash-Lite 已在 OrcaRouter 目录中,价格为 $0.30 和 $2.50——按厂商标价、不加价转售,因此价格变动会在当天传到我们这边,而不是在一个合同周期之后——Muse Spark 1.1 也以相同条件列入其中,价格为 $1.25 和 $4.25,两者都位于同一个兼容 OpenAI 的端点之后。这意味着编排器-工作节点模式在同一个代码库中只需要两个模型字符串,而不是两套 SDK、两个密钥和两张发票,而且自动故障转移还能应对某个供应商在扇出中途出问题的情况。准确来说,目前可用的内容是:Muse Spark 1.2 本身尚未列入目录——Meta 作为其唯一提供商直接提供服务——因此目前这套技术栈最接近的实现是在编排器槽位中运行 1.1。

按角色选择,而非按分数

如果你在挑选一个工作者层级——文档解析、数据提取、限定范围的文件编辑、分类、代理树中狭窄重复的中间环节——Gemini 3.5 Flash-Lite 是更好的工具,18分的指数差距基本无关紧要,因为你并不要求它进行推理。留意输出上限和搜索定价。

如果你正在挑选决定工人做什么的模型,Muse Spark 1.2 是两者中更强的候选者,但需要注意:它没有独立的按维度智能体评分,没有任何竞技场记录,没有生产遥测数据,且只有一个提供商。在它能支撑生产计划之前,这些是需要弥合的差距。

如果你原本指望一个模型能同时胜任这两项工作,那么测量结果的诚实回答是:两者都做不到。Flash-Lite 无法在索引 36 上进行规划;Muse Spark 1.2 无法以每次扇出 91 美分的价格一次生成二十个。两个产品描述中都出现“子代理”一词,这只是营销上的巧合,并不表示它们属于同一个位置。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube