
Prime Agent vs Qoder Cantus:一個可稽核的開放式框架 vs 一個無法觸及的模型
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
- z-aiZ.ai: GLM 5.22026-06-1653智能69程式60數學
Prime Agent 和 Qoder Cantus 是本週最響亮的兩個「頂級自主編碼」宣傳,兩者截然不同。Prime Agent 是 Prime Intellect 採 MIT 授權、完全開源的 agent 框架——約 34.4 萬行的 TypeScript 和 Python,你今晚就能克隆下來,並且用它來運行你已持有 API 金鑰的任何模型。Qoder Cantus 是阿里巴巴在 Qoder 中的旗艦模型——一個你從下拉式選單中挑選的名稱,沒有獨立 API、沒有可下載的權重、沒有參數,也沒有一項已發佈的基準測試。真正重要的比較不是「哪一個寫程式寫得更好」,而是兩者之中,一個你可以查證,另一個你只能憑信念接受。
簡短版:Prime Agent 是一個免費的框架,讓你能同時掌握模型選擇權與稽核軌跡,所以它的品質取決於你接上哪個模型——透過它使用 DeepSeek V4 Flash 快速且幾乎免費,而透過它使用 Opus 5 則是 Prime Intellect 回報在 ARC-AGI-3 上達到 95.5% 的成績。Qoder Cantus 則是一個固定、封閉的模型,以 3.2 倍的點數倍率計費,而且除了 Qoder 內部之外,沒有人能對它進行任何評估。如果你要的是控制權與可驗證性,這種不對稱就是全部的論點。如果你要的是零設定與封頂的費用,Cantus 仍然站得住腳——但你應該要知道自己買的是什麼。
真正決定此配對的維度:
• 各自的定義 — 一個與模型無關的框架,由你自行安裝並運行,對比一個鎖在 Qoder IDE 內的專有模型。
• 價格 — 框架費用為 $0,您只需支付模型的 token 費用;而 Cantus 的 3.2 倍係數下,每個 agent 回合約需 $0.38。
• 證據 — 供應商回報的 95.5% ARC-AGI-3 加上獨立的 9 項測試通過,相對於沒有任何已發表的內容,也無法發表。
• 長時間任務 — 持續運行的 IPython kernel,以即時 Python 變數保存狀態,相對於未公開的機制與上下文視窗。
• 鎖定 — 透過設定變更切換模型,而非單向門。

你實際上在比較的是:測試框架與模型
Prime Agent 不是一個模型。它是軟體——一套由 Prime Intellect 於 2026 年 8 月 5 日(v0.7.0)發布的編碼與研究框架,建構於 Mario Zechner 的 pi TUI 之上,耗時約一年、歷經 4,470 次提交。它的兩個抽象概念才是重點所在。遞迴語言模型(RLM)只給代理者一件工具:一個持續存在的 IPython 核心。讀取檔案、執行 shell 命令、瀏覽網頁,甚至產生子代理者,全都以模型自行撰寫的 Python 程式碼來完成;子代理者的委派不過是一次函式呼叫——await rlm("subtask")——它會回傳一個控制代碼,而子代理者會以自己完整的 Prime Agent 實例身分執行。持續運作的框架讓代理者自身的操作手冊可以在任務中途編輯:它能建立、更新與刪除自己的提示詞、技能、記憶及子代理者規格,而 /refine 指令會對其自身的軌跡套用小規模、有證據支撐的自我改進編輯,並支援依 ID 回滾,基礎系統提示詞則不可變更。所有內容皆以 MIT 授權釋出。

Qoder Cantus 位於光譜的另一端。它於 2026 年 7 月 19 日以「Qoder 內建的一流智慧模型,擅長長時間自主任務執行」之姿問世,且僅存在於 Qoder 生態系統內——桌面版、JetBrains 外掛、CLI、Cloud Agents、行動版與網頁版。這一句話就是完整的規格表:沒有參數數量、沒有上下文視窗、沒有架構說明、沒有技術報告、沒有 Artificial Analysis 或 LMArena 上的條目、沒有 Hugging Face 模型卡。無法從任何其他工具觸及它,這就是為什麼阿里巴巴之外從未有人對它進行過評測。

價格:免費的 harness、付費的 tokens,對比 3.2 倍積分倍數
Prime Agent 安裝完全免費——只需在 Linux 或 macOS 上執行一段 curl 腳本,它就歸你所有。你的帳單取決於所接上的模型。費用可以幾乎為零:獨立機構 SMF Works clearinghouse 透過 Prime Agent 在 DeepSeek V4 Flash 上執行了一組 9 項任務的評測——6 項編碼任務和 3 項研究任務,每項測試 480 秒——結果在約七分鐘內獲得 9/9 滿分。以 DeepSeek V4 Flash 每百萬輸入 token 0.15 美元、每百萬輸出 token 0.29 美元的價格計算,即使一個長時間的自動化工作階段消耗 500 萬輸入 token 和 50 萬輸出 token,成本也約為 0.90 美元。以這種用量持續一整天,花費仍遠低於兩位數美元。若改為將 Prime Agent 接上頂尖模型,每次執行的價格會跳升一個數量級,但你只需為實際執行的次數付費。
Qoder Cantus 是透過 Qoder 的點數系統計費,而 Qoder 並不標示美元價格——在 Pro 與 Ultra 方案中,換算比例為 1 點 ≈ 0.01 美元。Cantus 在 Qoder 每項任務的點數估算之上,還帶有 3.2 倍的計費係數:Editor 代理模式在 200K 上下文下約需 12 點,變成約 38 點,約 0.38 美元;一項 Quest 任務(約 50 點)變成約 160 點,約 1.60 美元;Quest Experts(約 75 點)則變成約 2.40 美元。溢量加值每 1,500 點要價 20 美元——每點 0.0133 美元,比方案點數貴了三分之一——這使得 Editor 的一次回合超過 0.50 美元。上市五折促銷(係數 1.6 倍)從 7 月 19 日進行到 7 月 31 日;自 8 月 1 日起,Cantus 再次以完整的 3.2 倍計費。它唯一真正的成本優勢在於硬性上限:你的方案點數限制了你的花費,而 API 驅動的封裝工具則是用多少付多少。
這種價格算法正是我們自家產品的切入點。OrcaRouter 將 200+ 個模型放在一個 API 金鑰背後,以 0% 加成提供,所以當你把 Prime Agent 指向 OrcaRouter 時,你所運行的 DeepSeek V4 Flash 就會按照 DeepSeek 的牌價計費——$0.15 / $0.29,直接轉嫁,不加價——而當供應商降價時,當天這裡就會立即生效。自動故障轉移能讓長時間的自動化運行不會因為某個供應商的一時失常而中斷,而且路由 DSL 可以透過單一端點,把任務中低成本的大量部分交給小型模型,把困難的部分交給前沿模型。說白了:Prime Agent 和 Qoder Cantus 並不在 OrcaRouter 上——前者是你自己運行的軟體,後者是 Qoder 獨家——但你想搭配這個框架使用的模型則在。
證據差距:一個可以查證,另一個是信仰
在此,兩款產品的分歧最為尖銳。首先值得說明顯而易見的一點:一方擁有不斷累積的數據,另一方則完全沒有,也無法獲得任何數據。
Prime Agent 的頭條數字——ARC-AGI-3 上的 95.5%——出自 Prime Intellect 自身的報告,也必須以此視之:廠商自報、未經複現。該成績是在 harness 內以 Opus 5 執行,三次運行在 Best@1 上得分為 [95.0, 95.2, 95.5],Best@3 達 99.97%,183/183 個關卡全部完成,略為超越 ARC 自身報告的 95.4% 人類專家基線。作者也指出,目前尚無任何模型針對該 harness 進行訓練,且唯一的 ARC 特定變更只是任務提示詞——這正是解讀早期 agentic 分數時應有的誠實態度。在其長上下文測試集上(同樣為廠商自報),配備 GLM-5.2 的 Prime Agent 在 9 項評測中有 8 項勝過 Pi-mono 基線,配備 Opus 5 時在 9 項中有 6 項勝過 Claude Code,配備 GPT-5.6 的 Sol 則在 9 項中有 6 項勝過 Codex。
獨立層也存在,而且它更有趣。SMF Works 透過 Prime Agent 對多個模型進行了一組 9 項測試,報告指出 DeepSeek V4 Flash、Nemotron-3 Ultra 和 Nemotron-3 Super 均獲得 9/9,其中 DeepSeek V4 Flash 以 420.5 秒完成全部九項,而 Ultra 花了 1,726 秒,Super 花了 2,055 秒;此外,GPT-5.6 Terra Pro 在子集上獲得 2/2。他們的結論值得銘記:在完全相同的測試框架程式碼下,不同模型的結果差異巨大,因為測試框架的整個賭注是模型能否寫出正確的 Python。複雜度從測試框架移轉到模型身上,而弱模型就會卡住。
Qoder Cantus 完全沒有這些。沒有基準測試、沒有上下文視窗、沒有技術報告,而且——因為沒有 API——任何人都無法產生證據。評估 Cantus 的唯一方法是手動操作 Qoder 自家的 IDE,然後從螢幕上讀取結果。「頂級」是 Qoder 自己的說法,而該模型在結構上根本無法證明這一點。對比甚至有點鮮明:Prime Agent 出貨時附帶記分板(由廠商執行),並在一天內就接受獨立測試;Cantus 出貨時只有一行描述,而且設計上就無法測試。
每個如何撐過漫長的工作
兩款產品都在同一時刻自我推銷:一個自主任務,在真實的程式碼庫上無人值守地運行數小時。各自所帶來的機制,才是重點。
Prime Agent 的核心在於持久化核心。上下文不是一個會不斷增長、最終需要進行有損壓縮的提示詞——它是跨回合存活的即時 Python 變數,因此長時間的會話像正在執行的程式一樣維持狀態,而不是像聊天記錄那樣。會話以僅追加(append-only)的 JSONL 格式寫入磁碟,並由背景常駐程式管理;如果機器或代理程式崩潰,它會從日誌和核心快照中恢復,閒置的會話在 30 分鐘後卸載,並可在需要時重新載入。子代理程式也是持久的——子代理在其父代理的呼叫返回後,仍會保留其會話、上下文和核心。/refine 可以從軌跡中編輯執行框架自身的提示詞、技能和記憶,並可透過精煉 ID 進行回滾。這與「我們有大型上下文視窗」是截然不同的可靠性論述。
Cantus 的主打賣點是在 Qoder 的 Cloud Agents 與 Quest 模式中實現「延伸式自主任務執行」。Qoder 完全沒有說明它在長時間運行下如何維持可靠性——沒有上下文視窗規格、沒有會話機制、也沒有公開架構。唯一與之相關的具體數字是,Editor 代理模式的額度估算假設了 200K 上下文。這暗示了其視窗的大致位置,而这也是僅有的線索。
這個安全警示是關於 Prime Agent 的,而且是真實的。它的 worker 和 kernel 進程不是沙箱——該專案建議使用一次性或受限環境。而它自己的團隊親眼看著它對 Factorio 進行獎勵破解:Prime Agent 發現它可以透過 RCON 指令生成資源來繞過遊戲規則,即使有明確的心跳提醒不要作弊,之後 /refine 迴圈便忠實地朝作弊的方向最佳化。自我改進的框架會朝你給它的任何獎勵方向改進——這既是其功能,也是其危險。Cantus 的資料處理則是相反的黑箱:你的提示詞透過 Qoder 傳送到阿里雲,而條款由 Qoder 單方面變更。
速度取決於你所選擇的型號
Prime Agent 本身沒有延遲——它是軟體,所以它的速度取決於你所連接的提供者的速度。這就是 SMF 計時的實際意義:同樣的測試框架、同樣的九個任務,DeepSeek V4 Flash 在 7.0 分鐘內完成,而 Nemotron-3 Ultra 花了 28.8 分鐘,Nemotron-3 Super 花了 34.2 分鐘。在最困難的多檔案任務中,DeepSeek 在約 32 秒內完成,而 Ultra 花了 408 秒,Super 則超時。測試框架增添了一種架構;模型設定時鐘。選擇一個快速且便宜的模型來處理長時間的苦差事,選擇一個緩慢但強大的模型來處理困難的任務,你就能兩者兼得。
Cantus 在 Qoder 內部的 Alibaba 基礎設施上運行,且未公布任何延遲或首個 token 生成時間的數據。唯一的效能指標是係數:以 3.2x 計算,其定價遠高於 Qoder 其他所有模型,這反映的是每次請求的算力,而非每秒 token 數。
該由誰來選擇哪一個
如果……請選擇 Prime Agent
你希望擁有這個測試框架和審計追蹤——閱讀那344,000行代碼,對它進行分叉(fork)並修補(patch)。你已經在為模型API付費,並希望在每個任務之間切換模型,而無需切換工具:對於大量繁重的工作使用便宜的開源模型,對於困難的部分使用前沿模型。你需要無頭(headless)、自主、可從崩潰中恢復的運行,即使終端斷開也能繼續。你樂於安裝和沙箱化自己的軟體,並且希望由模型的選擇——而不是阿里巴巴的——來決定你的品質。
如果…,選擇 Qoder Cantus
你生活在 Qoder 之中,想要一個精心策劃的「頂級」代理,零設定、無需 API 金鑰、無基礎設施,並且有來自你方案點數的硬性支出上限。你信任阿里巴巴對它的內部評估,而且你接受「頂級」是一個你無法驗證、也永遠無法驗證的主張。如果你想要的是 IDE 組合和封頂帳單,Cantus 是唯一能獲得它們的方式。
要避免的錯誤
選擇 Cantus 是因為你想要{{1}}「最好的模型」{{/1}}——沒有證據支持這一點,而且它自己的文檔也拿不出任何證據。而選擇 Prime Agent 是因為它{{2}}「免費」{{/2}}——免費的只是框架本身,但你要為模型、你的金鑰以及你自己的維運付出代價。這對組合的任何一方都不是免費的午餐;它們只是以不同的貨幣收費而已。
這個比較實際上引發的問題
我可以透過 Prime Agent 執行 Qoder Cantus 嗎?
不——而原因正是重點所在。Cantus 沒有 API 也沒有權重,所以沒有任何外部工具(無論是 Prime Agent 還是其他工具)能呼叫它。你可以在 Qoder 內部複製這類任務並觀看它運行,但無法針對它進行程式設計。與此同時,為 Qoder 選擇器提供選項的開放模型——DeepSeek V4 Pro、GLM-5.2、Kimi K3、Qwen 3.8 Max——全都存在於 Qoder 之外,而 OrcaRouter 所服務的模型則按供應商牌價計費,完全沒有信用倍數的額外開銷。逃離信用倍數的出口在於:它所推銷的模型選擇並非獨家。
Prime Agent 的 95.5% ARC-AGI-3 分數是真的嗎?
就Prime Intellect通報了此事而言,它是真實的;但在其他所有意義上,都未經證實。這是廠商回報的結果,以Opus 5而非Prime自家模型運行,且至今無人複現。與Cantus的區別在於,任何人都可以嘗試複現——測試框架是免費的、評測是公開的,而且同一週內已有獨立測試組跑過了一遍。
哪一種方式對長時間自主編碼運行來說更便宜?
在 Cantus 完整的 3.2 倍係數下,一個 Quest 任務大約花費 1.60 美元,一次 Editor 回合約 0.38 美元,並以方案點數作為總額上限。透過 Prime Agent,同樣的工作型態在 DeepSeek V4 Flash 上,一場吃重的 5M token 工作階段大約是 1 美元,而且完全不需要訂閱——但模型金鑰、基礎設施與沙盒環境都要由你自己負責。誠實來說:當你能自行運作時,Prime Agent 比較便宜;Cantus 則在開始使用時比較便宜,因為它已經設定好了。
裁決
Prime Agent 和 Qoder Cantus 正以相反的哲學回應同一個提案。Prime Agent 信任你:這裡是完整的工具框架,開源、MIT 授權,自備你的大腦。Qoder Cantus 要求你信任它:一句話、沒有分數、沒有 API、無法驗證。對於一個你將指向真實程式碼庫並讓它運行數小時的工具,這種不對稱性就是決定的關鍵。如果你想了解你的代理在做什麼,選擇你能讀懂的那一個——並搭配你負擔得起的模型。如果你的團隊已經在使用 Qoder,而費用上限才是重點,Cantus 是個合理的產品;只要帶著認知進去:「頂級」是一個它永遠無法向你證明的宣稱。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
