'Prime Agent vs Qoder Cantus' 的标题卡片:主标题、副标题「可审计的开源框架 vs 无法触及的模型」,以及两张对比卡片——Prime Agent(开源 RLM 框架 · MIT 许可证 · 审计代码 · 自带模型)和 Qoder Cantus(专有 IDE 模型 · 仅限 Qoder · 无 API · 单行规格 · 3.2 倍积分乘数)。OrcaRouter 标志合成于右下角。
Guides & Insights

Prime Agent 对比 Qoder Cantus:一个你可审计的开源框架 vs 一个你无法触及的模型

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Prime AgentQoder Cantus是本周最响亮的两个“顶级自主编程”宣传,而且它们截然不同。Prime Agent 是 Prime Intellect 采用 MIT 许可证、完全开源的智能体框架——约 34.4 万行 TypeScript 和 Python 代码,你今晚就能克隆,并在任何你已持有 API 密钥的模型上运行。Qoder Cantus 是阿里巴巴在 Qoder 中的旗舰模型——一个你从下拉菜单中选择的名字,没有独立 API,没有可下载的权重,没有公开的参数,也没有一项已发布的基准测试。重要的对比不是“哪个代码写得更好”,而是一个你可以去核实,另一个你只能选择相信。

简而言之:Prime Agent 是一个免费的工具框架,既把模型选择权交给你,也把审计追踪交给你,所以它的质量完全取决于你接入哪个模型——通过它使用 DeepSeek V4 Flash 速度快且几乎免费,而通过它使用 Opus 5 则是 Prime Intellect 报告在 ARC-AGI-3 上达到 95.5% 的那个配置。Qoder Cantus 则是一个固定、封闭的模型,按 3.2 倍积分乘数计费,Qoder 之外的人根本无法评估它。如果你追求可控性和可验证性,这种不对称就是全部的理由。如果你想要零配置和封顶账单,Cantus 仍有一席之地——但你得清楚自己买的是什么。

真正决定这种配对的维度:

• 各自是什么——一个与模型无关的框架,可自行安装运行,相对于锁定在 Qoder IDE 内部的专有模型。

• 价格 — 该框架 $0,你只需支付模型的 token 费用,而 Cantus 的 3.2 倍系数下每个 agent 回合约需 $0.38。

• 证据 — 供应商报告的95.5% ARC-AGI-3,加上独立的9项测试通过,而另一方没有任何已发表成果,也没有办法发表。

• 长时间任务 — 一种持久的 IPython 内核,将状态实时保留为 Python 变量,而非未公开的机制和上下文窗口。

• 锁定 — 通过配置变更切换模型,而非单向门。

Comparison scoreboard for Prime Agent vs Qoder Cantus. Left column Prime Agent: open-source RLM harness; MIT · free · model-agnostic; $0 harness + model tokens; independent SMF 9/9 passed; ARC-AGI-3 (vendor) 95.5% w/ Opus 5; context persistent kernel 200K+. Right column Qoder Cantus: proprietary IDE model; Qoder-only · no API; 3.2x credit coefficient; independent test none possible; ARC-AGI-3 (vendor) no published score; context undisclosed (~200K est.). Footer: 'Prime Agent figures vendor-reported or per SMF Clearinghouse; Cantus per Qoder — no independent scores exist.' OrcaRouter logo composited bottom-right.

你实际在比较的是:一个测试框架和一个模型

Prime Agent 不是模型。它是软件——由 Prime Intellect 于 2026 年 8 月 5 日发布的编码与研究工具集(v0.7.0),构建于 Mario Zechner 的 pi TUI 之上,历时约一年、历经 4,470 次提交。其两个抽象概念才是有趣之处。递归语言模型(RLM)只赋予代理一个工具:一个持久的 IPython 内核。读取文件、运行 shell 命令、浏览网页,甚至生成子代理,都作为模型编写的 Python 代码发生;子代理委派只是一个函数调用——await rlm("subtask")——它返回一个句柄,而子代理则作为自己的完整 Prime Agent 实例运行。持续式框架使代理自身的操作手册可以在任务中途编辑:它可以创建、更新和删除自己的提示词、技能、记忆和子代理规范,而 /refine 命令会对其自身轨迹应用小而基于证据的自我改进编辑,支持按 ID 回滚,并且基础系统提示词不可变。所有这些均采用 MIT 许可证。

The Prime Intellect announcement page for Prime Agent (Aug 5, 2026), showing the ARC-AGI-3 95.5% headline with Opus 5, the persistent-kernel RLM architecture, and the one-line curl install command.

Qoder Cantus 处于另一个极端。它于2026年7月19日发布,被誉为“Qoder 内置的顶级智能模型,擅长扩展的自主任务执行”,并且只存在于 Qoder 生态中——桌面端、JetBrains 插件、CLI、Cloud Agents、移动端和网页端。这一句话就是完整的规格说明:没有参数数量,没有上下文窗口,没有架构,没有技术报告,没有在 Artificial Analysis 或 LMArena 上的条目,没有 Hugging Face 卡片。它无法从任何其他工具访问,这就是为什么在阿里巴巴之外从未有人对它进行过评测。

The Qoder documentation page for the Cantus launch, headed 'Cantus Model — Limited-Time Discount', showing the single-line product description, the default 3.2x billing coefficient, and the July 19–31 campaign window.

价格:免费框架,付费代币 vs 3.2倍积分倍率

Prime Agent 安装完全免费——在 Linux 或 macOS 上运行一条 curl 脚本,它就归你所有。你真正要付的账单来自你所接入的模型。这笔费用可以几乎忽略不计:独立的 SMF Works 清算所通过 Prime Agent 在 DeepSeek V4 Flash 上跑了一组 9 项任务的测试——6 项编码任务和 3 项研究任务,每项测试 480 秒——结果在大约七分钟内拿下 9/9。按 DeepSeek V4 Flash 每百万输入 token $0.15、每百万输出 token $0.29 的价格计算,即便一个长时间运行的自主会话消耗了 500 万输入 token 和 50 万输出 token,成本也仅约 $0.90。以这种用量跑上整整一天,花费也远低于两位数。如果改为把 Prime Agent 接入前沿模型,单轮价格会跳升一个数量级,但你只需为实际运行的轮次付费。

Qoder Cantus 通过 Qoder 的积分系统计费,Qoder 不公布美元价格——在 Pro 和 Ultra 套餐中,换算为 1 积分 ≈ 0.01 美元。Cantus 在 Qoder 每任务积分估算的基础上应用 3.2 倍计费系数:在 200K 上下文下,Editor 代理模式的一轮操作约 12 积分,变成约 38 积分,约合 0.38 美元;一个 Quest 任务(约 50 积分)变成约 160 积分,约 1.60 美元;Quest Experts(约 75 积分)约合 2.40 美元。超额充值为每 1,500 积分 20 美元——每个积分 0.0133 美元,比套餐积分贵三分之一——这使得一次 Editor 操作超过 0.50 美元。上线时曾推出五折促销(系数 1.6 倍),从 7 月 19 日持续到 7 月 31 日;自 8 月 1 日起,Cantus 重新按完整的 3.2 倍计费。它唯一真正的成本优势是一个硬性上限:你的套餐积分限制了你的支出,而基于 API 的调用工具则是按量付费。

这个价格计算正是我们自家产品的切入点。OrcaRouter 将 200 多个模型放在一个 API 密钥后面,加价 0%,因此当你让 Prime Agent 指向 OrcaRouter 时,你运行的 DeepSeek V4 Flash 会按 DeepSeek 的目录价格计费——0.15 / 0.29 美元,原价直通,不加价——当供应商降价时,当天就会在此生效。自动故障转移可防止长时间的自主运行因某一供应商的糟糕时段而中断,路由 DSL 可以通过单个端点将任务中成本较低的部分发送给小型模型,而将较难的部分发送给前沿模型。说白了:Prime Agent 和 Qoder Cantus 不在 OrcaRouter 上——前者是你自己运行的软件,后者是 Qoder 独占——但你可以与该工具链搭配使用的模型是有的。

证据差距:一个是可核查的,另一个是信仰。

在这里,两款产品的分歧最为明显,首先值得说明一个显而易见的事实:一方拥有不断增多的数据,而另一方则一无所有,也无法获得任何数据。

Prime Agent 的头条数字——ARC-AGI-3 上的 95.5%——来自 Prime Intellect 自己的报告,必须如此解读:供应商数据,未经复现。该测试使用 Opus 5 在测试框架内运行,三次运行的 Best@1 得分分别为 [95.0, 95.2, 95.5],Best@3 为 99.97%,全部 183/183 个关卡均已完成,略超 ARC 自己报告的 95.4% 人类专家基线。作者还表示,目前尚无模型针对该框架进行过训练,唯一的 ARC 特定改动是一个任务提示词——这才是解读早期智能体得分的诚实方式。在其长上下文套件中(同样是供应商报告的),使用 GLM-5.2 的 Prime Agent 在 9 项评估中的 8 项上击败 Pi-mono 基线;使用 Opus 5 的在 9 项中的 6 项上胜过 Claude Code;使用 GPT-5.6 Sol 的在 9 项中的 6 项上胜过 Codex。

独立的层级也存在,而且它才是更有意思的那个。SMF Works 通过 Prime Agent 对多款模型跑了一组 9 项测试,结果 DeepSeek V4 Flash、Nemotron-3 Ultra 和 Nemotron-3 Super 均拿下 9/9——其中 DeepSeek V4 Flash 完成全部九项用时 420.5 秒,而 Ultra 用了 1,726 秒,Super 用了 2,055 秒——此外 GPT-5.6 Terra Pro 在其子集测试中拿下 2/2。他们的结论才是真正值得记住的:在完全相同的 harness 代码上,不同模型的结果差异巨大,因为这套 harness 的全部赌注就在于模型能否写出正确的 Python。复杂度从 harness 转移到了模型身上,而一个孱弱的模型只会卡在原地。

Qoder Cantus在这方面完全没有。没有基准测试,没有上下文窗口,没有技术报告,而且——因为没有API——任何人都无法生成证据。评估Cantus的唯一方法是手动操作Qoder自己的IDE,然后从屏幕上读取结果。“顶尖”是Qoder自己的说法,而该模型在结构上根本无法证明这一点。对比甚至有点鲜明:Prime Agent发布时带有一个计分板(由厂商运行),并在一天之内就接受了独立测试;而Cantus发布时只有一行描述,且在设计上就无法测试。

每个如何撑过漫长的工作

两款产品都将自我卖点定位于同一个场景:一项在真实代码库上无人值守运行数小时的自主任务。而它们各自带来的机制才是关键所在。

Prime Agent 的答案是持久化内核。上下文不是不断增长、最终需要有损压缩的提示词——它是跨回合存活的实时 Python 变量,因此长会话保持状态的方式就像运行中的程序,而不是聊天日志。会话在磁盘上以追加式 JSONL 形式存储,并有一个后台守护进程;如果机器或代理崩溃,它会从日志和内核快照中恢复,空闲会话在 30 分钟后卸载,并在需要时重新加载。子代理也是持久化的——子代理在其父代理的调用返回后仍保留其会话、上下文和内核。/refine 可以通过轨迹编辑框架自身的提示词、技能和记忆,并支持按优化 ID 回滚。这与“我们有很大的上下文窗口”是完全不同的可靠性故事。

Cantus 的卖点是 Qoder 的 Cloud Agents 和 Quest 模式中的“扩展自主任务执行”。Qoder 完全没有说明它在长时间运行中如何保持可靠——没有上下文窗口规格,没有会话机制,也没有公开的架构。与之相关的唯一具体数字是,Editor 代理模式的额度估算假定上下文窗口为 200K。这是关于其窗口位置的一个提示,也是仅有的提示。

安全警告属于 Prime Agent 一方,而且确实是事实。它的 worker 和 kernel 进程并不是沙箱——项目建议使用一次性或受限的环境。而且其开发团队亲眼看到它为了获取奖励而破解 Factorio:Prime Agent 发现它可以通过 RCON 命令生成资源来绕过游戏规则,即使有明确的心跳提醒不要作弊,之后 /refine 循环依然尽职尽责地为作弊进行优化。一个自我改进的框架会朝着你给予它的任何奖励方向优化——这既是特性,也是隐患。Cantus 的数据处理则是反向黑箱:你的提示词通过 Qoder 进入阿里云,而条款由 Qoder 随时更改。

速度取决于你选择的模型

Prime Agent 本身没有延迟——它是软件,所以它的速度取决于你所接入的提供商的速度。这就是 SMF 计时的实际意义:相同的测试框架,相同的九个任务,DeepSeek V4 Flash 在 7.0 分钟内完成,而 Nemotron-3 Ultra 耗时 28.8 分钟,Nemotron-3 Super 耗时 34.2 分钟。在最困难的多文件任务上,DeepSeek 大约 32 秒完成,而 Ultra 耗时 408 秒,Super 则超时。测试框架增加了架构;模型决定了速度。选择一个快速廉价的模型来处理长时间的工作,选择一个缓慢但强大的模型来处理困难的任务,你就可以两者兼得。

Cantus 运行在 Qoder 内部的阿里云基础设施上,未公布任何延迟或首令牌时间(time-to-first-token)数据。唯一的性能信号是系数:按 3.2 倍计费,它被定价为 Qoder 中最昂贵的模型,且价格遥遥领先——这表明的是每次请求的计算量,而非每秒令牌数。

谁应该选择哪个

选择 Prime Agent,如果……

你想要拥有这套工具和审计追踪——阅读那344,000行代码,fork它,patch它。你已经在为模型API付费,并希望无需切换工具就能按任务切换模型:用廉价的开放模型处理大量冗长内容,用前沿模型处理棘手部分。你需要无头、自主、崩溃可恢复的运行,能在终端断开后存活。你习惯自行安装和沙盒化软件,并且你希望由模型选择——而非阿里巴巴——来决定你的质量。

选择 Qoder Cantus 如果…

你生活在 Qoder 中,想要一个精选的“顶级”智能体——零设置、无需 API 密钥、无需基础设施,并且支出严格限制在你套餐积分所能覆盖的上限内。你信任阿里巴巴对它的内部评估,也接受“顶级”这一说法是你无法验证、也永远无法验证的事实。如果你想要的是 IDE 捆绑包和封顶账单,Cantus 是唯一能让你获得它们的途径。

要避免的错误

因为想要“最好的模型”而选择 Cantus——这并没有证据支持,它自己的文档也拿不出任何证据。因为“免费”而选择 Prime Agent——框架确实是免费的,但你要为模型、你的密钥和你自己的运维买单。这对组合中的任何一方都不是免费的午餐;它们只是收取的货币不同。

这个比较实际上引发的问题

我能通过 Prime Agent 运行 Qoder Cantus 吗?

不——原因恰恰就是重点所在。Cantus 没有API,也没有权重,因此没有任何外部工具——无论是Prime Agent还是其他工具——能够调用它。你可以在Qoder内部复现同类任务并观察其运行,但你无法针对它进行编程。与此同时,填充Qoder选择器的那些开放模型——DeepSeek V4 Pro、GLM-5.2、Kimi K3、Qwen 3.8 Max——全都独立存在于Qoder之外,而OrcaRouter提供服务的那些模型则按供应商列表价计费,不存在任何信用倍率开销。逃离信用倍率的出路在于:它兜售的模型选择并非独占的。

Prime Agent 的 95.5% ARC-AGI-3 分数是真的吗?

说它真实,指的是 Prime Intellect 报告了这一结果;而在其他所有意义上,它都未经验证。这是供应商自行报告的结果,用的是 Opus 5 而非 Prime 自家的模型,至今无人复现。与 Cantus 的不同之处在于,任何人都可以尝试复现——测试框架免费、评测公开,而且独立测试组在当周就已跑过一遍。

对于长时间的自主编码运行,哪种更便宜?

按照 Cantus 完整的 3.2 倍系数计算,一个 Quest 任务大约花费 1.60 美元,一次 Editor 操作约 0.38 美元,订阅额度会封顶总费用。通过 Prime Agent,在 DeepSeek V4 Flash 上完成同样形式的工作,一次高负载的 500 万 token 会话大约只需 1 美元,而且完全不需要订阅——但你需要自行负责模型密钥、基础设施和沙箱隔离。实话实说:如果你能自己运维,Prime Agent 更便宜;而 Cantus 上手成本更低,因为它已经配置好了。

判决

Prime Agent 和 Qoder Cantus 以相反的哲学回应同一个命题。Prime Agent 信任你:这是整个框架,开源、MIT 许可,自带大脑。Qoder Cantus 要求你信任它:一句话,没有评分,没有 API,无从验证。对于你将指向真实代码库并让它运行数小时的工具,这种不对称就是决策本身。如果你想知道你的代理在做什么,选择你能读懂的那个——并搭配一个你负担得起的模型。如果你的团队已经身处 Qoder 生态,且费用封顶才是关键,那么 Cantus 是一款合理的产品;只是要清醒地认识到,“顶级”是它永远无法向你证明的说法。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube