Muse Spark 1.2 比較 Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 對比 Gemini 3.5 Flash-Lite:兩個實驗室,兩種子代理的定義

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在相隔不到兩週的時間內,兩個實驗室各自推出了模型,並用同一個詞來描述它。根據其模型卡所述,Gemini 3.5 Flash-Lite「適合在複雜的多代理工作流程中執行專注任務的子代理」。Meta 表示Muse Spark 1.2可「作為規劃與委派的主要代理,或作為並行執行的子代理」。兩者用詞相同,但 Artificial Analysis 將兩者放入其 Intelligence Index 中測試後,才顯示出它們的含義有多麼不同:Flash-Lite 以 4,300 萬個輸出 token 完成該測試套件,Muse Spark 1.2 則需要 9,500 萬個。其中一個模型思考簡短而頻繁;另一個思考深入而耗時。兩者都將結果稱為子代理。

該 token 比率才是這份比較中最具決策參考價值的數字,因為子代理層級本質上就是一種你可以展開的東西——一次二十個、一次一百個——而展開會將模型每次呼叫的既有習慣成倍放大。接下來的內容將逐步梳理每個實驗室實際上打造了什麼、以真實價格計算的展開算術呈現為何,以及那個看似便宜的選擇結果反而成為昂貴選擇的原因。

每個實驗室所說的這個詞的意思

Flash-Lite 版本是依規模來定義角色。Gemini 3.5 Flash-Lite 是其系列中價格最低的層級,而這一定位之所以引人注目,是因為它將思考等級直接與多步驟子代理工作負載掛鉤——這是該系列首次以代理角色而非規模或速度來描述一個層級。推理是強制性的,但預設的推理強度為 最低,調整上限為高,且該模型被設計為可大量生成並快速回應。供應商報告其在 SWE-Bench Pro 上達到 54.2%,而 Gemini 3 Flash 為 49.6%;在 OSWorld-Verified 上則達到 74.0%,對比為 65.1%——兩者皆為供應商自行報告的數據,未經獨立重現,且皆被描述為代理能力的提升,而非原始智慧的提升。

Meta 的版本是透過拓撲來定義角色。Muse Spark 1.2 的產品文案描述了一個能收集脈絡、制定計畫,並將執行工作委派給並行子代理(subagent)的模型——它本身也可以是這些子代理之一。其推理旋鈕的範圍從 minimal 到 xhigh,預設為 medium,而 Meta 明確指出了目標工作負載:多檔案重構、長時間除錯工作階段、整個儲存庫的生成。這是一個被設計為協調者、同時也能親自執行工作的模型,這與那種被設計為一次可生成二十個的模型是截然不同的產品。

兩個實驗室都沒有針對這一具體說法發布基準測試。Meta 於 8 月 5 日發布了 1.2 版本,卻完全沒有發布公告——其 Muse Spark 1.1 公告頁面仍在介紹先前版本。

指數實際衡量的差距

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Artificial Analysis 對兩者運行相同的九項評估綜合指標所得的獨立評分:

智能指數 — Muse Spark 1.2 (xhigh) 54,在 185 中排名第 13;Gemini 3.5 Flash-Lite 36,在 163 中排名第 20。18 分,而類別中位數為 32。

輸出速度 — 每秒 165.0 個 token,對比 343.6。Flash-Lite 的串流速度快了一倍以上。

首次 token 生成時間 — 26.12 秒對比 10.30 秒,兩者皆以最大努力(maximum effort)進行。Artificial Analysis 指出,Flash-Lite 的 10.30 秒在其價格層級的推理模型中本身就屬於高標。

冗長度 — 同一測試套件的輸出 token 為 95M,對比 43M;所有模型的中位數為 65M。Muse Spark 1.2 高於中位數 46%;Flash-Lite 則低 34%。

運行指數的成本:$637.85 對比 $153.08。

各維度 — Artificial Analysis 的子指數將 Gemini 3.5 Flash-Lite 的編碼能力評為 49.3,代理能力評為 26.8。目前尚無 Muse Spark 1.2 的公開細項數據;其前代產品得分為 71.3 和 37.5。

十八個指數點不是四捨五入的差異。這兩個不是同一個位置的候選人。

扇出算術

按 token 計價不適合用來評估 subagent 層級,因為該層級的重點在於你會大量運行它們。以牌價試算一個例子 — Gemini 3.5 Flash-Lite 輸入 $0.30、輸出 $2.50,Muse Spark 1.2 輸入 $1.25、輸出 $4.25。

一個編排器分派二十個子代理。每個子代理讀取25,000個詞元的範圍化上下文,並寫回1,500個詞元。

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = 約 22.5 美分 每扇出。

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = 約 75 美分 每個扇出。

三又三分之一倍,聽起來還算可控。現在把實測的冗長度差異套用進去。如果 Muse Spark 1.2 寫出的內容按比例多於 Flash-Lite——就像它在索引上的表現那樣,相同工作的輸出 token 數約為 2.2 倍——那麼那些 1,500 token 的回覆會變成約 3,300,而扇出成本會增加到約 91 美分。四倍,不是三倍。在繁忙的代理系統中,每小時一百次扇出,這就意味著每小時 22 美元與 91 美元的差別,也就是在持續負載下每年約 60 萬美元的差距。

兩個定價細節使實際差距在一個方向上變得更寬,在另一個方向上變得更窄:

Flash-Lite 以輸出價格計費內部推理。 其列出的內部推理 token 價格為每百萬個 $2.50——與可見輸出相同。思考並非免費,只是回應中看不見而已。如果子代理在回答前思考了 2,000 個 token,每次呼叫增加 0.5 美分,或在整個扇出中增加 10 美分。

在比例方面,快取對 Muse Spark 1.2 較有利。 快取輸入的讀取價格為每百萬次 0.15 美元,相對於 1.25 美元的表定價格——折扣達 88%。Flash-Lite 讀取快取輸入的價格為 0.03 美元,相對於 0.30 美元,折扣達 90%,但寫入快取則另收每百萬次約 0.083 美元,而 Muse Spark 1.2 並未公布獨立的快取寫入費用。對於每個子代理都共享相同大型前綴的扇出情境,兩者差距會明顯縮小。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

生產延遲是 Flash-Lite 領先幅度最大的領域,而基準測試的數字掩蓋了這點。在 OrcaRouter 上,橫跨一整週滾動的真實流量中,Gemini 3.5 Flash-Lite 顯示首次輸出Token的 p50 時間為 816 毫秒,p95 為 4.57 秒。Muse Spark 1.1——目前最接近的替代指標,因為 1.2 尚未有遙測數據——顯示 p50 為 1.84 秒,p95 為 6.00 秒。當二十個子代理並行執行時,最慢的那個決定實際耗時,因此決定 fan-out 延遲的是 p95,而非 p50。

當便宜的那個是錯誤的選擇時

Gemini 3.5 Flash-Lite 的四個限制不會出現在價格比較中,但會在事件檢討中顯現。

一個 65,536 token 的輸出上限。 這是同類多數模型允許量的一半,對被要求生成大型檔案或回傳長篇結構化文件的子代理而言是一道硬牆。Muse Spark 1.2 的端點完全未宣告最大完成長度——這點相當罕見,值得實測而非單純相信,但它並非有文件記載的上限。

這是一個未經審核的端點。Flash-Lite 的列表未帶任何審核標記;Meta 為 Muse Spark 1.2 提供的列表則有。這對某些工作負載而言是真正的優勢,對其他工作負載來說卻是合規問題,而且這應該是一個刻意的選擇,而不是事後才發現的事實。

昂貴的內建搜尋。 Flash-Lite 的網頁搜尋工具定價約為每次千次呼叫 14 美元,而 Muse Spark 1.2 則為 2.50 美元。如果你的子代理會進行研究而不只是閱讀,便宜的模型反而會變成昂貴的那一個——高出五倍半——而且在扇出架構中,搜尋量會隨扇出規模而擴展。

它的價格上漲了,而不是下跌。Gemini 3.5 Flash-Lite 的定價為 $0.30 和 $2.50,而先前的 Gemini 3.1 Flash-Lite 則為 $0.25 和 $1.50。輸出的價格比它所取代的等級貴了 67%。如果您是根據舊型號來規劃子代理預算,請重新調整。

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

還有一項值得明確指出的不對稱性:Muse Spark 1.2 恰好僅由單一供應商 Meta 提供服務,沒有第三方託管,也沒有備援。Gemini 3.5 Flash-Lite 則具備一般的第一方多區域服務版圖。對編排者(orchestrator)而言,這是整個 agent 樹的單點故障;對工作者(worker)層級而言,這是扇出(fan-out)的單點故障。

大多數團隊最終會採用的配對方式

兩相對照之下,這兩個模型與其說是競爭對手,不如說是同一架構的兩個半邊;Meta 自家的產品文案在分別描述主代理角色與子代理角色時,也正說明了這一點。

這些數字所呈現的樣貌是:以 Muse Spark 1.2 作為編排器,Gemini 3.5 Flash-Lite 作為執行工作者。 一次昂貴且深思熟慮的呼叫,讀取程式庫、掌握計畫並決定該委派什麼——26 秒的思考時間與 95M token 規模的詳盡輸出,為你換來一份值得執行的計畫——緊接著是二十次廉價、快速、範圍狹窄的呼叫,每次只處理一件範圍明確的事,並在 p50 不到一秒內回傳。你每個任務支付一次接近前沿模型的費率,每個工作單位則以經濟費率計價,這正是扇出架構所期望的成本曲線。

反過來看,經濟效益就崩潰了。二十個 Muse Spark 1.2 子代理,每次扇出要 91 美分,是某個能力弱 18 個百分點的模型所需費用的四倍,而那個模型只需三分之一時間就能完成同樣的工作;而一個指數為 36 的 Flash-Lite 編排器所產生的計畫,是那些工作人員無法挽救的。

過去,橫跨兩家供應商進行建置一直是最棘手的地方。Gemini 3.5 Flash-Lite 已收錄在 OrcaRouter 目錄中,價格為 $0.30 與 $2.50——這是供應商牌價,以 0% 加價轉嫁,因此價格變動會在同一天反映在我們這邊,而非等到合約週期結束;Muse Spark 1.1 也以相同條件收錄,價格為 $1.25 與 $4.25,兩者皆透過同一個 OpenAI 相容端點提供。這表示 orchestrator-and-workers 模式只需在一個程式碼庫中使用兩個模型字串,而不是兩套 SDK、兩把金鑰和兩張發票;自動容錯轉移也能涵蓋某家供應商在 fan-out 途中出狀況的情況。精確來說,目前目錄中的狀況是:Muse Spark 1.2 本身尚未列入目錄——Meta 作為唯一供應商直接提供——因此現階段這套技術棧最接近的版本,是在 orchestrator 的位置上運行 1.1。

依角色選擇,而非依分數

如果你正在挑選一個工人層級 — 文件解析、資料擷取、限定範圍的檔案編輯、分類、代理樹中狹窄重複的中段 — Gemini 3.5 Flash-Lite 是更合適的工具,而 18 點的指數落差大多無關緊要,因為你並非要求它進行推理。留意輸出上限和搜尋定價。

如果你是在挑選決定工人任務的模型,Muse Spark 1.2 是兩者中較強的候選,但需要注意:它沒有獨立的逐維度智能體評分、沒有任何競技場記錄、沒有生產遙測數據,而且只有一個供應商。這些都是它在擁有生產計劃之前需要填補的差距。

如果你原本指望一個模型能同時勝任這兩項工作,測量結果給出的誠實答案是:兩者都做不到。Flash-Lite 無法在索引 36 執行規劃;Muse Spark 1.2 無法以每次二十個、每個 fan-out 91 美分的成本被生成。「subagent」這個詞同時出現在兩份產品說明中,只是行銷上的巧合,並不代表它們屬於同一個定位。

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube