
Agora-2 對 MiniMax M3:每位參與者一張 GPU,還是每百萬個 Token 十三美分
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
兩種運行一群代理的方式,以兩種不同貨幣計價。MiniMax M3每百萬輸入 token 要價 0.30 美元,每百萬輸出 token 要價 1.20 美元——這個費率讓千代理實驗變成單筆支出項目,而非一輪募資。Agora-2,這個多代理世界模型Odyssey於 2026 年 9 月 21 日預覽,每位參與者視角要價一張 NVIDIA RTX PRO 4500:一場四人工作階段跑在四張 GPU 上,每張卡各有一個渲染模型生成該玩家的 640×480 視角,而這四張卡中還有一張同時承載共享模擬與十六個自主代理策略。MiniMax M3 的數字是按 token 計,隨著你的代理思考量多寡而擴展。Agora-2 的數字是按眼球計,隨著你放進世界裡的同時參與者人數而擴展。比較兩者,就是拿推理預算與渲染預算相比,而對任何在 2026 年規劃多代理研究的人來說,事實證明這正是值得做的事。
帳本中的代幣部分
MiniMax M3 是 MiniMax 的開放權重旗艦模型,於 2026 年 5 月 31 日發布:這是一個 4280 億參數的稀疏專家混合模型,每個 token 約有 230 億參數處於啟用狀態,具備 1,048,576 token 的上下文視窗(其中 MiniMax 保證 512K 可實際使用),支援文字、圖像與影片輸入,並在 Artificial Analysis Intelligence Index v4.3.2 上獲得 29 分。廠商數據顯示,它在 BrowseComp 上為 83.5、在 BankerToolBench 上為 76.1——這些是 MiniMax 自家公布的數字,本文並未重現——而 Artificial Analysis 測得它的輸出速度為每秒 145 個 token,在該排行榜上名列第十快。
然而,對代理艦隊而言,相關數字是快取讀取費率:每百萬個快取符元 0.06 美元,是輸入價格的五分之一。代理迴圈以前綴為主——相同的系統提示、相同的工具結構描述、相同且不斷累積的歷史紀錄,每一輪都重新傳送——因此就迴圈大部分的符元而言,其有效成本遠比 0.30 美元更接近 0.06 美元。正是這樣的算術,讓一場 1,200 個代理的執行——METR 在 OpenAI 2026 年 7 月 ExploitGym 評估中所記錄的那種——成為研究團隊真正能夠重現、而不只是閱讀相關資訊的事情。
{{1}}帳簿{{/1}}的{{2}}GPU 那一邊{{/2}}
Agora-2 的成本結構在其自家的實作附錄中揭露,而且具體得令人耳目一新。每個視圖使用一張 RTX PRO 4500 Blackwell Server Edition。四人對戰的 session 則需要四張。這些顯示卡以 640×480 解析度,為每位參與者產生其視圖,目標是每秒十五次潛在更新與三十個顯示幀,而模擬則以 30 Hz 的 tick 推進。報告也提供了周邊工作的訓練規模:在 32 張 B200 GPU 上達到有效全域批次 128。
換算成與 MiniMax M3 相同的單位,也就是每位同時參與者需要一顆資料中心 GPU,再加上共用的模擬環境搭在其中一顆上運行。這是一項固定成本,不在乎你的代理思考多久,也不會在它們安靜下來時下降。隨之而來有兩個結果,而它們指向相反的方向。在參與者人數少、每個代理需要大量推理的情況下,token 模式顯然更便宜——你只花幾分錢在思考上,而房間裡的第二位代理則完全不花錢。在參與者人數多、互動密集的情況下,這筆帳就反過來了:共享世界裡二十位同時參與者就是二十顆 GPU,而這個數字不會隨著每個人消耗多少 token 而成長。
• 成本單位 — Agora-2 每位參與者檢視需一張 RTX PRO 4500,對比 MiniMax M3 每 1M tokens $0.30/$1.20
• 快取讀取 — Agora-2 不適用,無 Token 計費;對比 MiniMax M3 每 1M 快取 $0.06
• 獨立評分 — Agora-2 未公布 對比 MiniMax M3 AA Intelligence Index 29(v4.3.2)
• 脈絡 — Agora-2 共享狀態加上各檢視有界的歷史,對比 MiniMax M3 的 1,048,576 tokens、保證 512K
• 輸出 — Agora-2 640×480 影片,目標 30 fps,對比 MiniMax M3 文字
• 存取方式 — Agora-2 瀏覽器預覽,無 API、無權重,對比 MiniMax M3 開放權重、社群授權、API


為什麼這兩種成本不是替代品
這很容易被解讀成二選一,但事實並非如此。MiniMax M3 是一個策略大腦:它讀取部分可觀測的情境、進行推理、呼叫工具,並發出動作。Agora-2 則是一個環境,在其中動作會產生其他參與者可見的後果——一個模擬模型,用來預測組合後的動作如何改變共享狀態;一個世界伺服器,負責套用這些動作;以及各視圖渲染器,讓每個參與者都能從自身視角看見同一個世界。Odyssey 的十六個自主實體並非由任何語言模型驅動;它們是透過強化學習訓練出來的遞迴純量與空間策略,會取用十六筆觀測的歷史,並每隔四個模擬週期採取行動。這項設計選擇正是關鍵線索。在每秒三十個週期的情況下,決定該做什麼是一個控制問題,而控制問題是透過訓練一個小型策略來解決,而不是靠呼叫 API。
所以,對一個正在規劃多代理工作的團隊來說,誠實的框架是:這些東西存在於不同的層級,而你需要為每一層編列預算。推理層便宜又有彈性,而且你可以貨比三家。環境層——如果你要的不是遊戲引擎——目前是研究預覽,帶著 GPU 形狀的成本足跡,而且沒有公開的 API。這兩個事實都還很新——M3 自五月起、Agora-2 自九月起——新到幾乎還沒有人為這個組合建立成本模型。
哪些是已驗證的,哪些是目標
MiniMax M3 的獨立評分、上下文視窗、模態與價格是已公開的事實,今日即可查證。其 BrowseComp 與 BankerToolBench 的數字屬於廠商自行回報,每當你引用時都應如此標註。
Agora-2 的數字完全來自 Team Odyssey 的技術報告,公司外部沒有任何單位重現過。其渲染結果——結構化前綴渲染器在三十段監控片段上達到 30.11 dB PSNR,相較於 VAE 基線的 20.67 dB——是完整系統之間的比較,且訓練預算並不相當,正如報告本身所指出的。其相較於交叉注意力所達成的 45.8% 去雜訊器時間縮減,來自隨機初始化的去雜訊器在合成輸入上的結果,衡量的是執行成本而非影像品質。而它的限制章節直言,每秒十五次更新與每秒三十幀的速率屬於目標值;即時多代理人互動期間的持續幀率與輸入到顯示延遲「尚未經過量化評估」;長時距視覺品質、跨視角一致性與端到端動作遵循度仍未被評估;該環境需要一個具備明確幾何與固定外觀詞彙的儀器化引擎;而超出訓練領域的遷移則尚未測試。任何想以每個視角一顆 GPU 建立成本模型的人,都應先讀那一節,因為每顆 GPU 的吞吐量正是尚未被測量的部分。
那通電話
如果你正在打造 Agent 艦隊——大量模型、漫長的迴圈、工具呼叫、不需渲染——MiniMax M3 是規模化執行此事最便宜可信的方式,而快取讀取費率正是決定你帳單的那個數字。它在 OrcaRouter 上以 MiniMax 自家的定價表價格路由,零加成,所以你支付的就是 $0.06 的快取費率,並且若某個端點在執行途中效能衰退,可跨供應商容錯移轉。對艦隊而言,這種直通計價尤其重要:快取權杖上的轉售商利潤,是會乘上每個 Agent 每一輪的利潤。

Agora-2 不是你能路由過去的東西——沒有 API、沒有價格、也沒有權重,只有 Odyssey 的瀏覽器預覽——而且我們並不代管它。它其實是第一個專門打造的共享世界模擬器,讓眾多人類與合成參與者能在受控條件下被觀察彼此互動;而它下方的報告異常坦率,直言它目前離一款產品還有多遠。如果你的問題是大量推理,MiniMax M3 現在就能用,而且便宜。如果你的問題是當一千個這樣的推理者共享同一個世界時會發生什麼事,Odyssey 已經把競技場蓋好了,艱難的測量工作則留給別人去做。
