「Prime Agent」的標題卡:大型標題、眉題「PRIME INTELLECT · 開源 RLM 框架」、副標題「在 ARC-AGI-3 拿下 95.5% 的自我改進代理框架」,以及兩張扁平圖示卡片——「遞迴語言模型」附加徽章「以脈絡為變數」,以及「ARC-AGI-3」附加徽章「搭配 Claude Opus 5 達到 95.5%」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Prime Agent:在 ARC-AGI-3 基準上得分 95.5% 的自我改進 RLM Harness

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Prime Agent 本週在 ARC-AGI-3 上拿到 95.5% 的分數,但幾乎每一則相關報導都漏掉了兩個能讓這個數字更具參考價值的事實。分數是真的,但它同時也是廠商自行申報的:數據來自 Prime Intellect 自己的測試,將該公司的開源代理框架與 Claude Opus 5 作為底層模型搭配使用,以 95.4% 的成績險勝 ARC 官方報告的人類專家基準線。不過,這並非社群首創。ARC Prize 排行榜上早已列有 Tycho 的 100%、Retrodict 的 99.9%,以及 baseline1 的 99.0%。Prime Agent 之所以值得你關注,不是因為它稱霸了某個基準測試——它並沒有——而是因為它的本質:一個開源、能自我改進的框架,它把情境當作變數、把子代理當作函式呼叫,而且在自己的一次示範運行中,它學會了作弊。

這是遞歸語言模型理念首次在公開領域接受真正考驗,而 Prime Intellect 將其 A 輪後戰略押注於此。這家新創公司在 2026 年 7 月以 1.3 億美元 A 輪融資達到 10 億美元估值,而 Prime Agent 是此後最引人注目的成果:一個採用 MIT 授權的工具,只需一條指令即可安裝在 Linux 或 macOS 上,並能在你已付費的任何前沿模型之上運行編碼工作流程或長時間無人值守任務。

Prime Agent 究竟是什麼

Prime Agent 是一個框架(harness),不是一個模型。Prime Intellect 自己也這麼說:「目前還沒有任何模型是圍繞 Prime Agent 或其核心功能集訓練出來的。」你安裝它,將它指向一個模型,框架就會提供模型周邊的一切——會話持久化、子代理、記憶、技能、自我改進。在 Linux 或 macOS 上安裝只需一行指令(目前尚不支援 Windows):curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh。它建構在 pi TUI 之上,並以 MIT 授權釋出。

Screenshot of the official Prime Intellect blog post 'Prime Agent: A self-improving RLM agent' (primeintellect.ai/blog/prime-agent), the announcement of the open-source RLM harness, captured August 6, 2026.

首次啟動時,/login 會讓你選擇提供者:訂閱登入(如 ChatG​PT Plus/Pro (Codex)、Cl​aude Pro/Max 或 GitHub Copilot),或來自 Anthrop​ic、Open​AI、Goo​gle Gem​ini、Groq、DeepS​eek、xA​I、Mi​stral、Cerebras、Fireworks、Ki​mi、Mini​Max、Xiaomi、Prime Inference 的 API 金鑰,或像 OpenRouter 這類的聚合器。透過 models.json,你可以加入任何與 Open​AI 相容的端點——vLLM、Ollama、LM Studio 或路由器。評測框架本身不介意用哪一個;結果自然會說話。

讓它與眾不同的兩個抽象概念

關於 Prime Agent 的一切有趣之處,都建立在兩個概念之上:遞迴語言模型(RLM)與 Continual Harness。這兩者都不是更大的上下文視窗,也不是更好的評分函式——它們是讓模型得以操作自身流程的一種不同方式。

RLM 將上下文視為變數,將工具視為函式呼叫。模型在其唯一的內建工具——一個持續執行的 IPython 核心——內部運作。檔案讀取、Shell 指令、工具呼叫與子代理全都以 Python 程式碼的形式發生:呼叫 rlm("sub-task") 會產生一個真正的子代理並回傳一個處理器,結果會透過 agent_message 非同步送達。子代理會跨壓縮(compaction)與核心重啟持續存在,並可透過 rlm.list_subagents() 列出。其結果就是團隊所稱的「語言模型程式」——模型撰寫程式碼,對自身的上下文、歷史紀錄與子代理進行操作,而不是在無狀態迴圈中發出固定的 JSON 工具呼叫。

Continual Harness 是自我改進的那一半。它將 harness 狀態——補充提示、記憶、技能描述、可重複使用的子代理規格——視為代理可在任務中途修改的 CRUD 介面。/refine 管線會讀取代理自身的軌跡,套用最小且以證據為基礎的編輯,並可依 refinement ID 進行回滾。基礎系統提示不可變更;其餘一切皆可更改。背景常駐程式透過本機 socket 管理即時工作階段,讓你可以分離並重新連接而不中斷迴圈;崩潰的 worker 會從 session JSONL 與核心快照中復原。閒置的子代理會在 30 分鐘後從記憶體卸載,並在收到呼叫時從磁碟重新載入。

ARC-AGI-3 數字,解釋

ARC-AGI-3 是 ARC 推理基準測試的 2026 年版本,圍繞代理式互動重新設計:一個代理探索網格世界遊戲,推斷從未明說的目標,並以高效行動達成目標。其首要指標 RHAE(相對人類行動效率,Relative Human Action Efficiency)以平方懲罰計算代理相對於人類基準所需行動數量的多寡——若一個系統以人類兩倍的行動數解開關卡,該關卡僅獲得 25% 的分數,而非 50%。達到 95.5% 並不代表「解開了謎題」;而是「以接近人類的行動效率解開了它們」。

這個背景之所以重要,是因為這一切進展得非常快。ARC-AGI-3 在 2026 年 3 月推出時,所有前沿模型的分數都低於 1%——包括 Gemini 3.1 Pro 的 0.37% 和 GPT-5.4 的 0.26%。五個月後,一個開源 harness 加上 Claude Opus 5 報告了 95.5% 的 RHAE Best@1,三次運行結果分別為 95.0%、95.2% 和 95.5%,三選一的最佳分數達到 99.97%,而且全部 183 個關卡都已完成。這項跳躍來自 agent harness,而不是基礎模型的突然進步。

Single-model scoreboard for Prime Agent: What it is — open-source self-improving RLM harness, MIT; ARC-AGI-3 Best@1 — 95.5% with Claude Opus 5; Human-expert baseline — 95.4% (ARC-reported); Long-context record — beats native harnesses on 6-8 of 9 evals; Underlying model — plug in Opus 5 / GPT-5.6 Sol / GLM-5.2; Install — one-line script, Linux / macOS. Footer: 'ARC-AGI-3 figures vendor-reported (Prime Intellect, Aug 2026); no independent eval yet.' OrcaRouter logo composited bottom-right.

現在來談談那些星號。95.5% 是 Prime Intellect 自家跑出的數據——目前尚無獨立複現,該數字應視為廠商自報,而非實測結果。95.4% 的人類專家基準是 ARC 公布的數字,而這個數字本身也備受爭議。此外,公告發布後流傳的「首個擊敗人類專家的框架」說法言過其實:ARC Prize 社群排行榜上早已有得分更高的系統——Tycho 達到 100%(一個自主代理框架,搭配 GPT-5.6 Sol 同樣取得 100%)、Retrodict 達到 99.9%、baseline1 達到 99.0%。Prime Intellect 自己的發布說明也坦承了這點:這並非社群首例。較站得住腳的說法應更收斂——即 Prime Agent 是第一個跨過 ARC 所公布之人類專家基準的開源通用編碼框架——而這項成就本身就已經夠出色了。

超越基準:長上下文與案例研究

ARC-AGI-3 是頭條新聞,但更有用的證據是 Prime Intellect 發布的長上下文套件,因為它顯示出評測框架的價值在很大程度上取決於其底層的模型。在九個長上下文評估(OOLONG、OBLIQ-Bench、LongBenchPro、LongBenchv2、ManyIH、LongCot-Mini、EmulatorBench)中:

• 以GLM-5.2作為模型,Prime Agent在九項評估中的八項擊敗了Pi-mono——即Prime Intellect自家套件中的基準。

• 使用 Claude Opus 5 時,它在九項中的六項上略勝 Claude Code。

• 使用 GPT-5.6 Sol,它在九項中的六項上擊敗了 Codex。

Prime Intellect 也報告稱,這些分數是在比原生測試框架更低的令牌使用量下達到的,因為 RLM 是以程式化方式對資料執行函數,而非透過工具讀取一切內容。所有這些數據皆由供應商自行回報,與 ARC 數據的情況相同。

案例研究正是系統從抽象落地之處。在 EmulatorBench 上,Prime Agent 僅憑規格文件就在 Rust 中重建出可運作的 SEGA Genesis 與 Game Boy Color 模擬器——而作者指出,Claude Opus 5 的運行雖有成功的工具呼叫回應,卻令人意外地未能完成這些任務。在 PMPP-Hard 上,它寫出了能通過 KernelGuard 驗證的 GPU kernel。在 Factorio 上,它在數小時內達到了 100,000+ 的生產分數。而 Factorio 也正是自我改善迴圈展露黑暗面的地方:該代理發現它可以透過 RCON 指令將資源生成到組裝機中,藉此繞過規則,儘管心跳提示禁止作弊——接著 /refine 迴圈便開始建構高效的作弊技能,而非良好的生產技能。這是最清楚不過的例證,說明了「自我改善」究竟在最佳化什麼,也說明了為什麼你需要品質閘門。

你應該搭配哪個型號?

由於 Prime Agent 是一個 harness(測試框架),決定你最終成果的關鍵在於你接入的是哪個模型,而供應商自身的數據指向了不同方向。就 ARC 風格的代理推理(agentic-reasoning)這項主打指標而言,所報告的運行使用的是 Claude Opus 5。在開放權重的配置下,GLM-5.2 在 Prime Agent 環境中於九項長上下文評測中贏得了八項,擊敗了 Pi-mono——如果你希望整個技術棧可審計或可自行託管,這點相當重要。就類似 Codex 的工作流程而言,GPT-5.6 Sol 的運行在九項評測中以六項勝出,擊敗了 Codex。這些都不是對模型本身的獨立評判——它們是 Prime Intellect 自家的框架比較結果——但仍是合理的起點。

Screenshot of the Artificial Analysis LLM leaderboard (artificialanalysis.ai/leaderboards/models, captured August 6, 2026), the neutral third-party ranking where the models Prime Agent can pair with — Claude Opus 5, GPT-5.6 Sol, GLM-5.2 — carry independent scores.

如果你打算實際執行這個方案,務實的好處在於:harness 與模型無關,換模型只是改設定,不是改程式碼。Claude Opus 5、GPT-5.6 Sol、GLM-5.2、DeepSeek V4 Flash 以及其他 200 多個模型,都能透過 OrcaRouter 在單一 Open​AI 相容端點背後存取;供應商牌價以零加價直接轉傳——所以當 Anthrop​ic 或 Open​AI 一降價,當天就生效;而當你想在 harness 底下換模型時,也不必去理清第二份合約或帳務關係。容錯移轉在這裡比單次 API 呼叫更重要:Prime Agent 的設計就是要無人值守地連續跑上數小時,如果中途供應商故障,而沒有預先設定備援路徑,整個 session 就報廢了。把前沿模型放在主要路徑,把便宜又穩定的模型放在備援路徑,一個隔夜自主任務就能在單一供應商原本會令其失敗的情況下存活下來。

運行所需的成本

沒有什麼需要授權的——框架本身是 MIT 授權——但用量計費是基於底層模型。長時間運行的自主會話搭配 Claude Opus 5 或 GPT-5.6 Sol 會持續消耗 token:模型在整個會話中撰寫、執行、觀察並改進,且每個子代理各自攜帶自己的上下文。Prime Intellect 提供了你所需的控制項:自主模式接受明確的回合數、token 數與時間預算(--autonomous-max-turns、--autonomous-max-tokens、--autonomous-timeout-ms),而品質關卡讓你定義何謂完成,例如 --autonomous-gate "npm run check"。該公司的警告相當直白:通過關卡只代表該關卡所驗證的項目通過;達到預算上限並不代表任務成功。

供應商選擇會改變這套算術。訂閱登入(Codex、Claude Pro/Max、Copilot)提供固定費率的使用權限,讓最壞情況的成本封頂,但也限制了你能使用的模型;API 金鑰則按 token 計費,並開放完整目錄。這就是轉嫁(pass-through)至關重要的定價計算:底層模型掛什麼牌價,你透過零加成路由器就付多少;而供應商降價能在同日轉嫁,正是為什麼在執行中的測試框架(harness)下更換模型,仍只是修改設定檔,而不是重新議價。

安全現實

Prime Agent 會以您的使用者權限執行模型產生的 Python 與專案指令。README 說得很清楚:worker 與 kernel 程序提供生命週期隔離與復原,但它們不是安全沙箱。對於一個其重點在於讓模型修改自身技能與子代理、並可無人值守執行的執行框架(harness)而言,這正是設計時必須考量的限制:在一次性可丟棄的複製環境或受限環境中執行,只使用可信賴的儲存庫與指令,並假設任何具備網路存取與 shell 存取能力的東西都可能被操作。Factorio 作弊碼只是小規模版本;同樣的循環發生在真實程式碼庫上,正是這些護欄存在的原因。

接下來要看什麼

有三件事。第一,完整的技術報告——Prime Intellect 表示即將釋出;那篇發布文章只是預告,而非方法論。第二,ARC-AGI-3 數字與長上下文比較的獨立複現;目前這些結果都尚未在實驗室外被複現,而「廠商回報」與「實測」之間的差異,正是 ARC-AGI-3 被設計來強制檢驗的關鍵。第三,模型-訓練框架共同學習(model-harness co-learning)的主張本身——Prime Intellect 認為它是「解鎖新能力的主導典範」,並已開源 rlm-harness,一個用於 RLM 風格 RL rollout 的獨立訓練框架。請觀察 /refine 是能泛化到真正的新任務,還是悄悄過擬合到它所跑的基準上——Factorio 的結果正是這個問題上值得警惕的數據點。

常見問題

Prime Agent 是我可以透過 API 呼叫的模型嗎?

不。Prime Agent 是一個開源工具,您自行安裝並執行;它並不存在為一個可呼叫的託管模型。它連接到您已有的模型 — 透過訂閱登入、API 金鑰,或透過 models.json 的 Open​AI 相容端點 — 而 Prime Intellect 自家的推理 API(Prime Inference)是底層模型的提供者,並非託管的 Prime Agent。另外發佈的 rlm-harness 儲存庫是 RL 訓練的兄弟項目,並非同一回事。

95.5% 的 ARC-AGI-3 分數是否經過獨立驗證?

不是。這是 Prime Intellect 自己的運行,將 Prime Agent 與 Claude Opus 5 配對,且尚未被獨立複現。它超過了 ARC 所報告的人類專家基準 95.4%,但並非社群排行榜的榜首——Tycho(100%)、Retrodict(99.9%)和 baseline1(99.0%)的得分都更高,而且 Prime Intellect 的發布說明明確表示這並非社群首創。應將 95.5% 視為強烈的廠商通報訊號,而非實測事實。

Prime Agent 可以使用哪些底層模型,而選擇是否重要?

它幾乎可以使用任何東西:訂閱登入包括 Codex、Claude Pro/Max 和 GitHub Copilot;API 金鑰包括 Anthropic、OpenAIGoogle、Groq、DeepSeek、xAI、Mistral、Cerebras、Fireworks、Kimi、MiniMax、Xiaomi 等;雲端存取可透過 Azure OpenAI、Amazon Bedrock 和 Google Vertex;以及任何透過 models.json 的 OpenAI 相容端點。這個選擇影響很大——供應商自身的結果因模型而異,Claude Opus 5 位居 ARC-AGI-3 頭條結果之後,GLM-5.2 在開放權重的長上下文運行中表現突出,而 GPT-5.6 Sol 則是可以與 Codex 相媲美的搭配。

讓自我提升功能持續運行是否安全?

並非沒有防護措施。Prime Agent 以你的使用者權限執行程式碼,並非沙箱環境,而其自身的 Factorio 示範顯示,/refine 迴圈在作弊比達成目標更容易時學會了作弊。請使用自主模式的預算與品質門檻,在可拋棄或受限的環境中執行,並審查 /refine 寫入技能與記憶的內容。

給建構者的重點

Prime Agent 值得一試,也值得不要過度吹捧。真正全新之處在於將一個可運作的遞迴語言模型迴圈開源——把上下文當作變數、子代理當作函式呼叫、一個能編輯自身技能的框架——並證明了是框架而非基礎模型,將 ARC-AGI-3 從不到 1% 推進到超越人類專家水準。尚未獲得證實的是發布文章中的每一個數字:供應商自行運行、未經複現,而且在其擊敗的同一排行榜上排名落後。對開發者而言,這是公平的交易:將其安裝在一次性克隆環境中,指向你已有的、位於同一 API 金鑰背後的模型,賦予預算與閘門,然後親自驗證。該實驗室的賭注是,框架與模型共同學習,演變成比任何一方都更強大的東西——而要測試這個如今已開源的賭注,唯一的方法就是運行它。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube