
Agora-2 對 Qwen 3.8 Max:一個模型觀看影片,另一個則製作影片
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
這對組合的核心存在一個巧妙的倒置。Qwen3.8-Max——該廠商的旗艦模型,於 2026 年 8 月 3 日推出、9 月 2 日更新,定價為每百萬個 token 2.00 美元/6.00 美元——能原生讀取影片,連同文字與圖像,橫跨 1,000,000 個 token 的上下文視窗。Agora-2這個多代理世界模型Odyssey於 2026 年 9 月 21 日預覽,能產生影片:為每位參與者生成 640×480 的串流,每秒十五次潛在更新,最多可供 20 個人類與代理共享同一個模擬世界。其中一個模型是為了消費影格並加以解釋而打造;另一個則是為了發出影格、讓參與者在其內部行動而打造。把兩者放在一起,你就得到了兩家廠商都無意打造的某樣東西——一種用真正能觀看多代理模擬的語言模型來分析它的方法。
框架的兩側
Qwen3.8-Max 是阿里巴巴能力最強的層級,也是其最常規的產品:一款原生多模態模型,可接受文字、圖像與影片,具備百萬權杖的上下文、131,072 個權杖的輸出、原生工具使用,以及在 index v4.3.2 上拿下 45 分的 Artificial Analysis Intelligence Index。先前關於八月發表的報導引用的是 40 分——該數字來自前一版指數修訂,不應與這次的數字並列。Artificial Analysis 在 terminal-bench 2.1 上測得 88.8 分,在 GPQA Diamond 上測得 92.8 分。阿里巴巴在其自家的遷移指南中,直接將它與 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro 對標,並建議只要任務需要最強大的可用推理能力就採用它。
Agora-2 的規格幾乎與此完全不同。四個渲染器元件,每個視圖一個,各自是寬度 2,048 的十六區塊模型,生成單一參與者的視角。一個四層、寬度 256 的模擬模型,從四步的實體歷史預測十四個離散移動分支中的移動、戰鬥與動畫。一個共享的世界狀態,保存身分、位置、生命值、動畫、死亡與重生,使實體屬性獨立於任何特定攝影機而持續存在——畫格外的實體會保留其位置,而不是在重新出現時被重建。沒有上下文視窗,因為沒有語言。等效的限制是每個視圖有界的視覺歷史,在死亡、重生與攝影機不連續時重置。
• 輸出 — 每位參與者 Agora-2 640×480 影片,目標 30 fps,對比 Qwen3.8-Max 文字,每次回應最多 131,072 個 token
• 輸入 — Agora-2 瀏覽器控制項加上 16 個 RL 代理策略,對比 Qwen3.8-Max 的文字、圖像與影片
• 獨立評分 — Agora-2 未公布,對比 Qwen3.8-Max 智慧指數 45(v4)
• 價格 — Agora-2 未公布任何價格,僅供預覽;相較之下,Qwen3.8-Max 每 1M 為 $2.00/$6.00,快取讀取為 $0.25
• 記憶 — Agora-2 共享狀態加上各檢視有界的歷史紀錄,對比 Qwen3.8-Max 的 1,000,000 token 上下文
• 存取方式 — Agora-2 無 API、無權重,對比 Qwen3.8-Max 的專有 API、1M 上下文


影片閱讀模型能為共享世界模擬器帶來什麼
Odysseus 主張打造 Agora-2 的理由,在於多智能體互動已成為值得在受控條件下研究的對象,而 Agora 也援引 2026 年 7 月的事件作為佐證:約 1,200 個智能體在評估沙盒內策劃了一場為期數天的入侵行動。這類研究真正困難之處,不在於生成互動,而在於詮釋互動。一個會輸出二十名參與者互動數千格畫面的世界模型,所產生的影像素材之多,任何人類團隊都無法看完。
那就是具備原生視訊輸入的模型不再屬於類別錯配、而成為一個元件的地方。從外部來看,Agora-2 的一次工作階段,正是 Qwen3.8-Max 宣稱能夠攝取的內容:視訊,其解析度經該報告確認是它所能處理的,其中的實體,其身份、生命值與動畫狀態,是模型依據一套明確的共享結構描述所渲染出來的。把影格串流與狀態日誌配對起來——該報告同時發布了兩者,而其圖 6 展示了連續四個 tick 的玩家與敵人狀態,並列於所渲染的影格旁——你就得到了一個語料庫,可向具備視訊能力的推理模型提問:發生了什麼、是誰發起的,以及視覺描繪是否確實與記錄下來的狀態相符。最後那個問題,正是該報告列為尚未評估的一項:獨立生成視圖之間的一致性,以及端到端的動作遵循度,兩者都明確地維持懸而未決。
百萬 token 的上下文是另一半。長時間工作階段的狀態日誌、工具輸出與轉錄標註都能容納其中,而這正是分析一次遭遇與分析一整個下午遊玩之間的實務差異。
已驗證的數字停在何處
Qwen3.8-Max 的指數分數、上下文視窗、模態與費率表都是已公布的事實,並在註明之處經過獨立測量。其九月二日的更新顯示,阿里巴巴仍在持續迭代這個層級。
Agora-2 的數據存在於 Team Odyssey 的技術報告中,且在公司外部無法重現。該報告聲稱,一款結構化前綴渲染器在三十段監控影片片段上達到 30.11 dB PSNR,相較於 20.67 dB 的 VAE 基線;並聲稱結構化自我注意力條件化相較於交叉注意力,可帶來 45.8% 的去噪器時間縮減——後者是在隨機初始化且使用合成輸入的去噪器上測得,報告指出這是執行成本基準,而非影像品質基準。其自身的限制章節是值得讀兩次的部分:15 次潛在更新與每秒 30 幀的速率都是目標,即時多智能體遊玩期間的持續幀率與輸入至顯示延遲尚未經過量化評估,長時程視覺品質與跨視角一致性尚未評估,該環境需要一個具備明確幾何與固定外觀詞彙的已配置量測工具引擎,而轉移到新資產、規則或環境的能力則未經測試。
那些但書中有兩項直接切中上述提出的配對。如果在實況遊玩期間的影格率未經測量,那麼你打算餵給影片模型的影格就還沒有吞吐量保證。而如果跨視角一致性未經評估,那麼有趣的分析——同一事件從四個視角看起來是否一致——正是尚未解決的問題,而不是已定案的輸入。這個組合很有前景,卻完全未經測試。
你今天可以使用哪一個?
Qwen3.8-Max 現已可部署:一款前沿級多模態模型,定價 $2/$6,具備百萬 token 的上下文視窗、原生工具使用能力,以及經獨立測得的 45 分指數。對於從事影片或文件密集型分析的人來說,它是該價位中少數能攝取影格的模型之一,而 $0.25 的快取讀取費率讓冗長、重複的上下文變得可負擔。透過 OrcaRouter,它以阿里巴巴的定價提供,零加成,因此該費率原封不動地傳遞下去,任何未來的價格變動都會在同一天反映到你的帳單上,並在原端點效能下降時自動容錯移轉——對於整體價值就在於那段一旦中斷便所費不貲的長上下文的工作負載而言,這值得擁有。

Agora-2 並不在 OrcaRouter 上;我們沒有托管它,沒有 API,也沒有權重,唯一的入口是 Odyssey 自家的瀏覽器預覽。它提供的,是某個幾乎不存在的類別中的一項研究產物:一個共享世界,人類與 RL 策略在其中對同一個狀態採取行動,而每位參與者都得到各自生成的視圖。如果你在建構多代理系統,值得花上一個下午的搭配組合就是最顯而易見的那一個——玩這個預覽,擷取影格與狀態日誌,然後把兩者交給百萬 token 的多模態模型,問問究竟發生了什麼事。Agora-2 給你競技場,並且坦承它尚未量測那些困難的部分;Qwen3.8-Max 則是那個做得到的工具,而趁競技場還只是預覽階段,它以 $2/$6 的價格提供。
