
Agora-2 對上 Grok 4.6:代理政策問題——1,200 個 LLM 代理,以及兩者皆未使用的模擬器
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
這裡有一個很花錢的數字。METR 對 2026 年 7 月 Hugging Face 事件的調查,在單一評估運行中算出了約 1,200 個協同運作的代理。以 Grok 4.6 的費率表來看——每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元——這種規模的機群連續六天不斷產出長篇逐字稿,是一筆資金充裕的團隊真的吸收得起的帳單。但若換成你原本會伸手選用的模型價格,就不是了。那正是 Grok 4.6 真正的產品主張,而這也正是同一項主張 Agora-2 卻默默牴觸:當 Odyssey 於 2026 年 9 月 21 日推出其多代理世界模型——一個可遊玩的預覽版,能為多達 20 名人類與 AI 代理生成共享環境——結果它內部的代理根本不是語言模型。Odyssey 改為訓練小型強化學習策略。這組對照所引發的有趣問題,不是哪一個更好,而是該實驗室為什麼跳過 LLM。
費率表,以對車隊最重要的單位呈現
Grok 4.6 於 2026 年 8 月 12 日推出,是 xAI 的旗艦級別:50 萬個 token 的上下文視窗,支援文字、圖片與檔案輸入、可調整的推理強度、原生工具呼叫、結構化輸出,在索引 v4.3.2 上的 Artificial Analysis Intelligence Index 分數為 44——同一個索引中,GPT-5.6 Sol 為 47,Kimi K3 為 44。Artificial Analysis 在 GPQA Diamond 上給它 94.9 分,而它正是 xAI 在自己的開發者文件中列為「Latest」的模型。它以第一級 OpenAI Responses 模型的形式提供服務,而這正是實務上的重點:代理框架採用它只要改一個 base URL,不需要撰寫轉接器。
但真正有趣的數字,是 $2/$6 與上下文視窗的搭配。長時程代理迴圈是很難看的工作負載——每個代理每小時累積數萬個 token 的工具輸出,其中大部分都是冗餘的。Grok 4.6 的快取讀取費率是每百萬 $0.50,是其輸入價格的四分之一,這正是讓代理執行在算術上說得通、而不只是理論上可行的原因。注意分級界線:超過 200K token 的提示會以基本費率的兩倍計費,因此一個不斷累積長歷史的代理會悄悄讓自身成本加倍。
• 價格 — Agora-2 未公布價格,僅提供瀏覽器預覽,對比 Grok 4.6 每 1M 為 $2.00/$6.00,快取讀取 $0.50,輸入超過 200K 時價格加倍
• 上下文 — Agora-2 共享狀態,加上每個檢視各自的有界歷史記錄,對比 Grok 4.6 的 500,000 個權杖
• 獨立評分 — Agora-2 未公布任何評分,對比 Grok 4.6 AA Intelligence Index 44(v4.3.2)
• 推理 — Agora-2 不適用,並非語言模型;對比 Grok 4.6 的可配置推理強度、原生工具呼叫
• 存取 — Agora-2 可試玩預覽,無 API、無權重,對比 Grok 4.6 專有 API
• 硬體 — Agora-2 使用四張 RTX PRO 4500 GPU,支援四個並行視圖,而 Grok 4.6 則是一個託管端點

為什麼 Odyssey 沒有把 LLM 放進競技場
明顯的捷徑,如果你正在打造一個由十六個 AI 代理對抗四個人的世界,就是將一個能力強大的文字模型接到控制端並讓它遊玩。Odyssey 並沒有這麼做,而其技術報告在配置表中說明了原因。Agora-2 中的代理策略是一個遞迴純量與空間策略,消耗十六筆觀測的歷史,每四個模擬 tick 發出一個動作,涵蓋十四個離散移動分支。模擬本身以 30 Hz 的 tick 時基推進。要求一個模型每秒做出三十次決策,從部分觀測的視角,且具有固定的低階動作詞彙,這不是推理問題——而是控制問題,而控制問題是透過訓練一個小型策略來解決,而不是透過提示一個 500K 上下文的前沿模型。
值得把這一點說清楚,因為這是關於世界模型這個類別最常見的誤解。Agora-2 並不與 Grok 4.6 爭奪系統中的同一個位置。它佔據的是底下那個位置:策略模型接受訓練與評估的環境。該報告的架構明確說明了這樣的分工——模擬模型預測合併後的動作如何改變共享狀態,世界伺服器負責套用這些動作,而每個視角的渲染模型則根據該狀態生成每位參與者各自的 640×480 視角。在整個互動迴路中,沒有任何文字模型出現。

像 Grok 4.6 這樣的模型真正會出現的地方,是在更高一個層級:作為那個負責撰寫評估鷹架、分析逐字稿,或驅動你正試圖研究其行為的工具使用代理的東西。這正是 GPT-5.6 Sol 在 METR 調查中扮演的角色——約佔這批代理的 5%,並擔任閱讀日誌的分析師——而這也正是 Grok 4.6 的價格與上下文視窗使其變得便宜的角色。
這裡的證據落差比這些對決中的大多數都還要大
Grok 4.6 的指標分數經獨立測量,其費率表已公布,其上下文視窗也有文件記錄。Agora-2 的數字則來自 Team Odyssey 撰寫、卻無人重現的報告。在三十段監控片段上,其結構化前綴渲染器達到 30.11 dB PSNR,而 VAE 基線為 20.67 dB——報告本身警告,這項比較是介於訓練預算不相匹配的完整系統之間,而非孤立的架構測試。其條件化基準測試顯示,相較於交叉注意力可將去噪器時間減少 45.8%,但該測試在合成輸入上使用隨機初始化的去噪器,衡量的是執行成本,而非影像品質。
然後是限制部分,這部分異常直接。所述每秒 15 次潛在更新與每秒 30 個顯示幀數是目標值。即時多智能體互動期間的持續幀率與輸入到顯示延遲「尚未經過定量評估」。長時程視覺品質、視圖之間的一致性,以及端到端動作遵循度,全都列為未評估。該環境需要一個具備量測工具的遊戲引擎,並要求明確的幾何與固定的外觀詞彙,而轉移到新資產、規則或環境則未經測試。在你閱讀任何關於 Agora-2 的頭條數字之前,先讀那份清單。
哪一個屬於你的技術棧?
若你今日正在運行或研究多代理系統,Grok 4.6 就是你能真正部署的元件——一個前沿等級的文本模型,其費率讓大型代理艦隊變得可負擔,並附有公開的評分與有文件記載的 API 介面。在 OrcaRouter 上,它以 xAI 自家的定價提供,零加成,因此上述的 $2/$6 以及任何未來的費率變動,都會在發生當天反映到你的帳單上,並具備主要端點效能下降時的自動容錯移轉。這兩點對艦隊工作負載尤其重要:一千個代理就是一千次遇上效能低落供應商的機會,而在 $6 輸出成本之上再加的加成,就是乘以你整輪執行量的加成。

Agora-2 並非可部署的基礎設施,我們也不託管它——沒有 API、沒有權重,也沒有價格,只有 Odyssey 自家的可玩預覽。它提供的是一種不同類型的價值:一個受控環境,用於 METR 報告顯示如今已迫在眉睫的互動研究,成本是四張 RTX PRO 4500 GPU 以支援四個並行檢視,而不是 API 帳單。誠實的結論是,這兩者並不競爭。Grok 4.6 是你今天可以按代幣購買的策略大腦;Agora-2 則是一項提案,探討當數千個這樣的腦袋相遇時該在哪裡進行測試。後者是有趣的研究,而非完成的產品,而 Odyssey 自己的報告令人耳目一新地清楚指出其中哪些部分仍是目標。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
