
Apodex 1.1 解析:智能指數 44 分、真正的智能體能力——以及知識可靠性的隱憂
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
Apodex 1.1 發布至今才一週,是專有模型,而在本週之前,它基本上只是實驗室裡的新奇玩意。後來 Artificial Analysis 發表了對該模型的第一份獨立評測——也是 Apodex 首次登上該平台——排行榜出現了一件不尋常的事:Apodex 1.1 在 Artificial Analysis Intelligence Index 拿下 44 分,在 177 個模型中排名第 11,同時其代理任務(agentic work)分數超越其智慧等級內的所有模型,包括 DeepSeek V4 Pro、Qwen3.7 Max 與 Kimi K2.6。同一份報告還浮現了第二個、更難看的數字:知識可靠性紀錄差到足以改變是否在它上面執行實際工作的決定。它的開放權重兄弟模型 Apodex 1.1 Mini,才是大多數人實際上能運行的模型。以下是這份評測說了些什麼、沒說什麼,以及誰該重視。
由陳天橋創立的 AI 公司 Apodex,於 2026 年 8 月 24 日推出了這個系列,同時發表了一篇由 70 位作者合著的 arXiv 論文《Apodex 1.1: Scaling Agentic Intelligence for Complex Work》(2608.23283)。旗艦模型為專有技術——依供應商報告約有 397B 個參數——其設計圍繞一個核心論點:代理(agent)真正的瓶頸不在於原始智能,而在於它們執行任務的環境。因此,Apodex 1.1 經過訓練,可在長時程任務中直接操作檔案、搜尋與程式碼,並配備一個共享的執行框架(「AgentOS」),可協調多達 150 個並行子代理,同時為每一步驟保留溯源紀錄。開放的部分是它的兄弟模型:Apodex 1.1 Mini,這是一個 35B 級的 MoE,由阿里巴巴的 Qwen3.5-35B-A3B 微調而成,以 Apache-2.0 授權釋出,並附帶一個名為 FrontierAgent 的配套代理框架。完整模型目前僅透過 Apodex 自家的 API 與線上工作台提供;Mini 則只能自架部署,別無他途。
智力指數44分意味著什麼
人工分析智慧指數是該平台基準測試套件的加權總和,包括代理型評測(如 GDPval-AA v2 和 Terminal-Bench),以及推理、數學和知識元件。Apodex 1.1 獲得 44 分,在 177 個模型中排名第 11,遠高於 18 的中位數。這也讓該模型落入一個競爭激烈且引人注目的等級:Kimi K2.6(45 分)、MiniMax-M3(45 分)和 Inkling(42 分)的差距都在三分以內,而 Apodex 1.1 是該組中唯一一個一週前大多數 AI 使用者還未聽過其名稱的模型。人工分析指出,該頁面涵蓋的是模型的推理版本,且可能也存在非推理變體。

這個模型的有趣之處不在於整體指數分數本身,而在於其優點與缺點相對於該分數的位置——而這正是分級比較所要具體呈現的。
它超水準發揮之處:代理型與知識工作評測
在衡量真實世界代理工作的兩個 Index 元件上,Apodex 1.1 的表現優於與其差距在 44 分內的鄰近模型。在 GDPval-AA v2(一項評估代理能否端對端完成真實辦公室風格任務的基準)上,Apodex 1.1 的 Elo 達 1348,領先 DeepSeek V4 Pro(1333)、Qwen3.7 Max(1308)和 Kimi K2.6(1202)。在 TerminalBench v2.1(測試代理在終端機工作的基準)上,它獲得 70% 的分數,領先 Kimi K2.6(66%),略遜於 Qwen3.7 Max(75%)。這些都是 Artificial Analysis 獨立執行的數據,也是報告中證明「環境優先訓練」有效的最有力證據。
供應商自家的基準測試宣稱更進一步,在有人能重現之前,應視為供應商自行報告的結果:APEX-Agents 38.5、GDPVal 78.8、SWE-bench Verified 77.7%、Terminal-Bench 2.1 70.8%、Humanity's Last Exam(搭配工具)56.1%、DeepSearchQA 92.4%、FrontierFinance 54.3、FrontierScience-Research 63.3。讓這個 agentic 定位可信而非流於炒作的原因,在於其背後的架構:環境擴展(擴大訓練中所使用的可執行檔案、搜尋與程式碼環境的多樣性)與 agentic 協調擴展(訓練模型分解長期任務、委派平行工作、整合非同步結果並重新規劃)。「Agent Team」模式可針對檢索與合成任務派出最多 150 個子代理,且內建的驗證步驟(「Statement Review」)會在結論送達前先行檢查。換言之:這是一個被設計來容許出錯、自我檢查並修正問題的模型——而非從記憶中背誦事實的模型。
所有這些代理能力的隱藏成本:冗長
該設計在 Artificial Analysis 的成本效率表中,顯示為該模型在知識之後最明顯的弱點:它非常冗長。執行完整的 Intelligence Index 消耗了 1.8 億個輸出 token——而中位數為 6,700 萬——每個基準任務約 17,000 個輸出 token,相比之下 Qwen3.7 Max 約 9,400 個,MiniMax-M3 約 8,100 個。根據 Artificial Analysis 的數據,完整評估總共花費了 618.41 美元的 API 支出。

產生該帳單的定價:輸入每百萬 tokens 0.30 美元,輸出每百萬 3.00 美元——快取輸入的命中價格為 0.03 美元,即 90% 折扣——在典型的 7:2:1 快取/輸入/輸出比例下,綜合約為每百萬 0.38 美元。兩個每 token 價格都高於平台中位數(輸入 0.25 美元,輸出 0.90 美元)。然而,Artificial Analysis 的每任務成本估算仍將 Apodex 1.1 定為每個基準任務約 0.05 美元,比 Qwen3.7 Max(約 0.07 美元)和 Kimi K2.6(約 0.06 美元)便宜。這種對照對於預算規劃很重要:其 token 足夠便宜,即使冗長程度很高,每個任務仍具競爭力——成本風險在於用量,而非費率。如果你讓一個長期運行的 agent 使用它,帳單取決於它說話的量,而它話很多。
在您編列預算之前,有一項定價說明:$0.30/$3.00 是供應商自己的牌價。一個以 0% 加成直接轉傳供應商牌價的路由平台,收取的正是這個數字,而且 Apodex 未來任何降價都會在宣布當天立即生效。
問題在於:知識可靠性記錄欠佳
以下是發佈報導大多忽略的數字。在 Artificial Analysis 的知識可靠性探測器 AA-Omniscience 上,Apodex 1.1 得分為 -21.9。它會嘗試回答 87% 的問題而非拒絕回答,但答對率僅 32%,幻覺率高達 78.4%。對於一個定位為重型解題器的模型來說,這是嚴重的分裂人格:智能體執行能力強,但紮實知識薄弱。
這兩個事實彼此相關,而非相互矛盾。代理型基準(agentic benchmarks)獎勵的是在環境中採取行動——發出工具呼叫、反覆迭代、從錯誤中恢復——因此模型在這些基準上可能表現出色,但記憶檢索能力卻很差,因為環境承擔了記憶的工作。這種設計甚至預設了這一點:Statement Review 的存在就是為了檢查輸出,而工作台圍繞著驗證來建構,而非圍繞著模型憑記憶就能答對。實際的解讀十分直白:不要把 Apodex 1.1 用在依賴它從自身權重中檢索事實的任務上。把它用在長跨度任務上,這類任務的成果可以對照檔案、程式碼與來源資料進行檢查——並驗證最終交付的內容。
開源姊妹產品:Apodex 1.1 Mini 和 FrontierAgent
如果旗艦的封閉之門是個問題,那麼家族中開放的那一半便是制衡之道。Apodex 1.1 Mini 是一個約 35B 總參數/約 3B 啟用參數的 MoE 模型,由 Qwen3.5-35B-A3B(阿里巴巴於 2026 年 2 月開源的基礎模型)微調而來,以 Apache-2.0 授權釋出,具備 262K 上下文視窗,並在 Hugging Face 上提供 FP8、FP4 與 GPTQ-Int4 變體。根據供應商報告,其頭條成績為 FrontierFinance 上的 50.2(在 Apodex 自家評比中居首),以及啟用 Agent Team 框架後 APEX-Agents 上的 27.7。而 FrontierAgent——隨附的開源執行環境——才是真正有趣的成果:一個以終端機為基礎的框架,具備 ReAct 與 Agent Team 模式、沙盒化檔案操作、審批關卡、檢查點與軌跡記錄,且能對接任何與 OpenAI 相容的端點。
在自行架設之前,有兩件事值得了解。首先,Mini 是微調模型,不是前沿模型——閱讀其基準測試數字的方式,應與閱讀旗艦機型的供應商表格相同:這些都是未經重現、包含測試框架、由供應商自行挑選的比較結果。其次,它的行為繼承自基礎模型:如果你想測試底層的 Qwen3.5-35B-A3B 是否已經能完成你的任務,你不需要 GPU 和一套服務堆疊來驗證——基礎模型只需一次 API 呼叫即可取得。
今天誰應該使用 Apodex 1.1
這款旗艦模型目前仍屬早期階段、採封閉模式,且僅限於供應商自家的 API 與線上工作檯;Apodex 表示,更廣泛的 API 可用性將透過主要平台提供,但權重並未開放。這限制了誰能針對本週排行榜採取行動:已使用 Apodex 工作檯的團隊,或願意申請第一方 API 金鑰的團隊。Mini 是門檻較低的路徑,但這意味著需要自行託管。

這個模型真正能立足之處是:長期性代理式管線(輸出在下游驗證)——例如研究工作檯、多步驟檔案與工具任務、終端機作業——以及那些每次任務約0.05美元的成本結構在冗長輸出下依然可行的場合。但目前它還不適用的地方是:任何依賴模型自身知識可信度的應用,或是一個無法容忍未經驗證、剛推出七天的新模型出錯的生產路徑。正是為了這種情況,路由層才是合適的包裝層。一個涵蓋 200+ 模型的 API意味著基礎版 Qwen3.5-35B-A3B 已經可以按牌價呼叫,自託管的 Mini 可以放在同一個路由器後方,並具備自動故障轉移,而且一個不穩定的新模型無法讓生產路徑癱瘓——當它表現不佳時,請求會轉向健康的提供者。
接下來要看什麼
這份評估只是初步解讀,並非最終判決。三件事將決定 Apodex 1.1 在一個月後是否重要:獨立重現供應商所宣稱的代理能力(由 Artificial Analysis 執行的 GDPval 與 TerminalBench 數據,是唯一非由 Apodex 自行產出的數字);知識可靠性差距能否在非推理變體或後續版本中縮小;以及該模型是否會出現在更多 API 與更多獨立評測排行榜上,屆時 44 與 -21.9 這兩個數字就會成為別人必須超越的目標。對於一個才發布七天、卻呈現如此分歧面貌的模型來說,這已是所能要求的最大限度:真材實料的代理能力優勢、誠實的定價,以及一個你在註冊前就已知道的弱點。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
