
Muse Agent 正式上線:Meta 的消費級 AI 代理運行於 Muse Spark 1.3
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
Meta 於 2026 年 9 月 8 日在美國正式啟用 Muse Agent——這款它一整年都在暗示的消費級 AI 代理,在其全新 iOS 與 Android 應用程式中僅以「Muse」為名對外亮相。Muse Agent 由 Muse Spark 1.3 驅動,也就是 Meta 整整一週前放置在開發者 API 上的同一個檢查點;而這份血統才是真正的重點:Muse Agent 是一個模型的產品化形態,而該模型的釋出說明所談的,正是長程代理式任務。Meta 描述這款代理執行於它自己的電腦上——一台具備檔案系統與終端機的雲端虛擬機器——因此它能夠瀏覽網頁、編寫自身的程式碼、建構小型工具,並在應用程式關閉後持續處理任務。
這不是另一款聊天機器人外殼。Muse 會連接使用者的電子郵件、行事曆、付款與購物帳戶,並實際採取行動:寄送電子郵件、預訂行程、購買商品、協商談判、填寫表單。Meta 表示,在安全測試發現真實漏洞後,他們刻意將產品從四月的內部目標時程延後,以強化防禦;此次發布僅限美國、僅限 18 歲以上帳戶,並設有地理圍欄——這是一家公司把具備消費能力的首版代理,限制在自身仍能掌控的爆炸半徑之內的寫照。以下內容涵蓋 Muse Agent 實際上能做什麼、背後的 Muse Spark 1.3 引擎、Meta 為了合理化「給 AI 一個錢包」所打造的安全架構,以及這套定價對正在打造自家代理的開發者所傳達的訊息。
核心概念:一個擁有自己電腦的代理
Meta針對該產品的設計文章說得很直接:Muse擁有自己的電腦,具備檔案系統與終端機,可用來撰寫程式碼、建立工具——同時還配有完整的瀏覽器,可用來瀏覽網站、填寫表單及完成交易。這是一項架構宣言,而非行銷誇飾:Muse不是從脈絡中作答的大型語言模型,而是一個操作機器的模型,就像Muse Code操作開發者的機器一樣。長期目標,例如規劃一整年的訓練或創立一間小企業,會被拆解成行動計畫,由代理程式隨著時間逐步執行;它也能依排程或回應事件來運作,只有當出現真正的新資訊或需要決策時,才會通知使用者。
{{1}}其互動模式也有別於以往的助手聊天:一條可長期延續、隨時能打斷的主對話可在多日間維繫上下文,另設有針對不同任務的獨立側邊對話、使用者可自行讀寫的持久記憶檔案,以及可存在於聊天之外的「artifact」——文件、PDF、網頁、儀表板、購物清單等。{{/1}}{{2}}使用者可以為此代理程式命名、設定頭像與溝通風格,而上市報導認為,這正是人們與它建立情感連結的核心原因。{{/2}}{{3}}在整合功能方面,Meta 在上市時列出了 Google Workspace(Gmail、Calendar、Drive)、Ticketmaster、OpenTable、Spotify 與 Apple Health,並規劃推出 Shopify 的 Shop Pay 與 1Password;此外,使用者也能為沒有內建整合的服務自行產生自訂 API 連接器。{{/3}}

引擎:Muse Spark 1.3,距離開發者發布還有一週。
以下介紹的是 Muse Spark 1.3,Meta 於 9 月 2 日透過 Muse Code 和 Meta Model API 推出。這是 Muse Spark 系列自 4 月以來的第四個檢查點,而且根據供應商自己的數據,也是該系列在程式碼與代理式工作上邁出的最大一步:在類似任務上,工具呼叫次數約減少 20%,token 數量約減少 25%,相較於 Muse Spark 1.2。當單一代理式任務可能橫跨數千次呼叫時,這種效率就顯得格外重要。標準層級的價格完全維持在 Muse Spark 1.2 的水準:每百萬輸入 token 1.25 美元、每百萬輸出 token 4.25 美元,另設有 0.10/0.20 美元的 Contributor 層級,供允許 Meta 以其流量進行訓練的使用者使用;上下文視窗則維持在 100 萬 token。
獨立評測的面貌開始成形。在 Artificial Analysis 的 Coding Agent Index(編碼代理指數)上——該指數將每個模型與其原生代理框架配對——Muse Spark 1.3 在 Muse Code 框架中運行,於最高的「max」推理設定下取得 68 分,僅次於 Claude Code 中的 Claude Opus 5(xhigh),並領先 Claude Fable 5(max);而市售的 xhigh 配置則得分 64。關於該結果的範圍說明:此分數衡量的是模型驅動自身編碼代理的能力,而非消費級 Muse Agent 產品;Meta 亦未說明消費級代理運行的是哪種推理設定。Meta 自家公布的數據——Terminal-Bench 2.1 為 88.8、DeepSWE v1.1 於 max 設定下為 75.4、OSWorld 2.0 於 max 設定下為 66.9——截至本文撰稿時,仍屬廠商自行回報,尚未經獨立重現。

消費者和開發者線程在此連接。Meta 以每月訂閱方式銷售的 Agent,是開發者可以以每百萬輸入 token 1.25 美元價格呼叫的模型的產品形態——也是同一個在 Meta 自家 Muse Code 測試環境中產出最強編碼結果的模型。Muse Agent 代表 Meta 在第三方尚未有時間在 API 之上打造相同產品之前,直接將其前沿模型帶給終端用戶——這正是其 Superintelligence Labs 成立的初衷所在,用以捍衛這個位置。
安全架構即產品
人們之所以猶豫要不要讓AI存取電子郵件、行事曆和付款方式,正是Meta花費這段延遲時間所處理的問題。每個Muse實例都運行在專屬的Muse Secure VM中——這是一種雲端虛擬機器,可將代理程式和使用者資料與開放網際網路隔離。一個名為Sentinel的獨立系統層級代理程式是唯一的對外通道:每次與外界的互動都必須經過它,它持有政策,且Muse本身無法覆寫它。敏感操作——例如寄送電子郵件、花錢——會顯示核准卡,由使用者接受或拒絕,而虛擬機器會在使用者掌控下保存活動日誌。
憑證與付款設計遵循相同原則。密碼存放於代理程式無法讀取的安全憑證儲存庫,而購物則透過 Stripe 的 Link 基礎設施執行;該系統每次交易會提供代理程式一組一次性卡號,而非使用者的真實卡片號碼。Meta 表示,對話資料不會與其廣告系統分享,使用者也可選擇退出訓練用途。值得關注的路線圖項目是計畫中的 Muse Confidential VM,由 Signal 創辦人 Moxie Marlinspike 共同開發;在此架構下,持有加密金鑰的是使用者——而非 Meta——意即連 Meta 也無法開啟該 VM。這將是面向大眾市場的消費型代理首例,而且目前尚未推出。
定價:給一般用戶的訂閱方案,給開發者的 Token 方案
Muse 的消費者定價是分三層的訂閱制,而非按使用量計費。免費層每週大約有 1 億個 token 的額度,並在每週重設;Meta 表示,大多數人應該留在免費層,並在一個操作跨入付費範圍之前顯示使用量計量表,不過即使免費也必須在帳戶中留存支付卡——這是多位評測者指出的摩擦點。付費層為每月 20 美元和每月 100 美元,在上市報導中被稱為 Power 和 Maximum,適用於超出免費額度的使用者,或需要持續高強度運算負載的使用者。
如果你要的不是租用 Meta 的現成服務,而是自行打造具備這種行為的 agent,那麼真正值得注意的數字是每個 token 的價格;這裡的模型經濟學清楚得出奇。Muse Spark 1.3 已透過 Meta Model API 向所有開發者提供,每百萬個輸入 token 收費 $1.25,每百萬個輸出 token 收費 $4.25;推理 token 以輸出計價,快取輸入則為 $0.15。「token 用量減少 25%」的宣稱正是觀察重點,因為在官方定價不變的條件下,它就是整個成本故事的關鍵。關於路由與容錯轉移,OrcaRouter 的立場與我們在每一篇 Muse Spark 1.3 文章中所聲明的相同:截至本文撰寫當日(9 月 9 日),這項新 checkpoint 尚未收錄於我們的目錄——我們不會列出無法服務的內容。它的前身是:Muse Spark 1.2 已在 OrcaRouter 上線,價格與 Meta 官方定價完全相同,即每百萬個輸入 token 收費 $1.25、每百萬個輸出 token 收費 $4.25,完全沒有加價;因此上述「價格維持不變」的主張,可以對照實際頁面查證。由於我們會直接沿用提供者的官方定價,而非加上自己的利潤,所以某個被納入路由的提供者一旦開始提供 Muse Spark 1.3,它當天就會以 Meta 的價格出現在這裡,並在多個提供者之間,對生產環境的 agent 工作負載進行自動容錯轉移。

看什麼
最重要的開放問題不在基準測試表上。首先,消費級產品的推理配置與安全邊界在真實環境中是否站得住腳——四月的延期據報是由於真實安全測試失敗所致,而一個能花錢的代理,其標準與一個能寫程式的代理截然不同。其次,1億token的免費額度是關於代理經濟學的一份聲明:如果Meta能在這個額度內以大規模運行一個真正有用的個人代理,訂閱定價就會成為「代理能力如何販售」這個問題的認真解答,而$1.25/$4.25的API費率則開始看起來像是其他所有建構相同東西的業者的地板價。第三,Confidential VM、Muse Spark系列所承諾的開放權重釋出,以及基礎模型在未來幾週內陸續導入Instagram、Facebook和Meta AI應用程式中。Muse Agent是這一系列進程的第一天,而不是終點。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
