
Muse Code 对比 Qoder Cantus:带价格清单的智能体与带乘数的模型
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
相隔六天,两家供应商就如何为自主编码代理付费做出了截然相反的押注。2026年8月1日,Qoder Cantus——阿里巴巴的顶级编码模型,只能从Qoder平台内部访问——的半价优惠悄然到期,其计费系数从1.6倍跳回3.2倍。8月5日,Meta发布了Muse Code,一款运行在Muse Spark 1.2之上的终端编码代理,公布了按token计费的费率,其贡献者档位的价格大约仅为Cantus现在每轮对话成本的百分之一。这两款产品中,一款确切地告诉你每个token的价格;另一款只告诉你一个倍数,并让你信任其计量表。
这才是真正的比较,而不是类别名称所暗示的那种比较。其下所有带有基准数字的内容都来自Meta自己的发布图表,这些图表发布时未附带方法论,除非有明确标注的独立测量。对于Cantus,没有任何可标注的内容,因为阿里巴巴没有发布任何基准、上下文窗口、参数数量或技术报告——这一事实结果证明是结构性的,而非疏漏。
你比较的不是两件相同的东西。
Muse Code 是一个需要安装的智能体,也是一个需要租用的模型。一条命令即可将二进制文件安装到你的机器上——curl -fsSL https://dev.meta.ai/install.sh | bash——之后会以 token 为单位通过 Meta Model API 计费。Muse Spark 1.2 也可通过该 API 单独购买,因此模型与工具框架是两笔可以独立完成的购买。
Qoder Cantus 并不是你能购买的产品。它是下拉菜单中的一个条目。Qoder 将其描述为「内置顶级智能模型,擅长执行长时间的自主任务」,而这句话就是全部官方描述——没有发布公告,只有 7 月 19 日的定价促销。要使用 Cantus,你需要订阅 Qoder、打开 Qoder,然后从模型层级选择器中选择 Cantus。没有 API 端点,没有可下载的权重,也没有办法将现有工具指向它。
这种不对称的后果贯穿了后续的每一个部分,因此有必要将两者直截了当地并列摆出:
• 你安装的内容——Muse Code:一个终端二进制文件,仅支持 macOS 和 Linux,公开测试版。Qoder Cantus:无;它是 Qoder 桌面 IDE、JetBrains 插件、CLI、云代理或移动/Web 客户端中的一项设置。
• 操作系统 — Muse Code:支持 macOS 和 Linux,无原生 Windows 版本。Qoder:支持 Windows、macOS 和 Linux,自 2026 年 5 月 15 日 1.0 版本发布以来。
• 计费单位——Muse Code:输入、缓存输入和输出 Token,无订阅,无上限。Qoder Cantus:月度套餐积分,乘以每个模型的系数,上限为套餐所包含的额度。
• 工具外部的模型 — Muse Spark 1.2:可以,通过公开预览中的 Meta Model API。Cantus:不可以,这是设计使然。
• 公布的上下文窗口 — Muse Spark 1.2:1,048,576 个 token。Cantus:未公开。Qoder 的文档列出了 200K、400K 和 1M 选项,具体取决于你选择的模型,但没有为 Cantus 附上任何数字。
• 已发布的基准测试 — Muse Spark 1.2:四块板卡,均由 Meta 运行。Cantus:没有任何人提供结果。
价格,折算为同一币种

{{1}}Meta 的费率是算术式的。{{/1}} {{2}}标准档为每百万输入 token 1.25 美元、每百万缓存输入 token 0.15 美元、每百万输出 token 4.25 美元;贡献者档(你允许 Meta 使用会话数据改进其模型)则为 0.10 美元、0.002 美元和 0.20 美元。{{/2}} {{3}}以一个真实的 agent 步骤为例——输入 60,000 token 的仓库上下文,输出 3,000 token 的“计划并修补”(plan-and-patch)——标准档冷缓存时为 8.8 美分,仓库上下文命中缓存时为 2.2 美分;贡献者档冷缓存时为 0.66 美分,热缓存时为 0.072 美分。{{/3}}
Qoder 的费率需要换算。在重要的套餐中,一个积分价值一美分:Pro 是 20 美元购买 2,000 积分,Ultra 是 200 美元购买 20,000 积分,两者都恰好是 0.01 美元。Qoder 会发布每项任务的积分估算——在 200K 上下文的场景下,Editor 的 agent 模式每轮大约需要 12 积分,Quest 的 agent 模式任务大约需要 50 积分,Quest 的 Experts 模式大约需要 75 积分——并且单独发布一个相乘系数。Cantus 的系数为 3.2 倍。把这两个已公布的数字放在一起看——Qoder 从未在示例演算中这样做过——在 Cantus 上,Editor 的 agent 模式每轮大约消耗 38 积分,即 38 美分。一个 Quest 任务大约需要 160 积分,即 1.60 美元。Quest 的 Experts 模式大约需要 2.40 美元。
因此,一次 Cantus 智能体回合的成本大约是冷 Muse Code 步骤的四倍,约为缓存步骤的十八倍,以及约为贡献者层级步骤的五十八倍。上下文大小并不相同——在我们的步骤中,Qoder 的估算引用为 200K,而 Meta 为 60K——并且 Qoder 明确表示其表格是统计估算而非报价。即使慷慨地考虑这两个注意事项,差距也不会缩小到任何接近对等的程度。
有两个细节让 Cantus 这边的情况比标题所示的更糟。首先是折扣已经没了。Cantus 推出了 "beyond Ultimate" 档位,其系数是 Qoder 之前最高档 1.6x 的两倍,而 7 月 19 日至 31 日的促销活动正好以 Ultimate 的价格出售该档位。该窗口已于 7 月 31 日 23:59 关闭。任何在 7 月底评估过 Cantus 的人,所参考的基准价格已不复存在。第二是溢出问题:计划积分用完后,充值 1,500 积分需要 20 美元,即每积分 0.0133 美元,而非 0.01 美元;一旦超出配额,Cantus Editor 的单次使用成本就会超过 51 美分。
Qoder 为你换来的,是一个上限。每月 20 美元就是每月 20 美元;积分用完后,平台会把你降回基础模型,账单也随之停止。Muse Code 则完全没有上限——Meta 自己的一次 24 小时、1,000 次工具调用的演示运行,单次作业就会消耗约 88 美元的标准层级 token,而且产品中没有任何机制能阻止第二次运行。可预测的开支与便宜的开支是实实在在的取舍,而非修辞上的说法;小团队过去选择有上限的那一方,也是出于充分的理由。
这也是我们应该陈述而非隐藏自身偏见的章节:OrcaRouter 以 0% 加价计费,将提供商标价原样传递,这种定价理念更接近 Meta 公布的费率,而非信用系数。这也是我们无法向您提供 Cantus 报价的原因——没有可原样传递的标价,只有一个应用于私有代币计数的乘数。
一家供应商公布了亏损。另一家什么都没公布——也公布不了。

Meta 的发布材料异乎寻常地自曝其短。在 Terminal-Bench 2.1 上,它报告 Claude Code 中的 Claude Opus 5 为 86.7%,Muse Code 中的 Muse Spark 1.2 为 82.9%,Codex 中的 GPT-5.6 Terra 为 81.8%,Grok 4.5 为 81.6%。在 DeepSWE 1.1 上,它报告 Muse Spark 1.2 为 59.3%,而 Claude Opus 5 为 65.0%,GPT-5.6 Terra 为 64.8%。在 Meta 自家的内部编码基准测试——即 Meta 构建并控制的测试装置——上,它报告 70.6%,而 Claude Opus 5 为 79.4%。在 Meta 选择展示的所有榜单上都排名第二或第三,包括其自家的榜单。独立来看,Artificial Analysis 在 Intelligence Index 上测得 Muse Spark 1.2 为 54 分、Muse Spark 1.1 为 51 分,但 Muse Spark 1.2 的首 token 时间为 26.12 秒,而 Muse Spark 1.1 仅为 2.90 秒——这是一个真实、经外部验证的数字,而且令人难堪。
相比之下,Cantus 只给出了一个形容词:“top-tier”。没有一个基准测试,没有一项独立评估,没有 Artificial Analysis 的条目,没有 LMArena 的排名,也没有任何排行榜上的位置。
关键在于,这并不是 Qoder 下个季度就会清掉的文档积压。独立评估需要程序化访问能力,而 Cantus 并没有 API。任何想为其打分的第三方,都只能手动操作桌面 IDE 或自动化其 UI——而他们面对的模型,其身份、版本和路由行为可能会在会话之间悄然改变,令他们无从察觉。Cantus 按交付形态而言,阿里巴巴之外的任何人都无法对其进行基准评测——这是分发方式选择带来的永久属性,而非暂时状态。
这是一把双刃剑,诚实的比较必须承认这一点。输掉的基准测试套件仍然比没有套件提供更多信息,但Terminal-Bench上的82.9%也不能告诉你Muse Code是否能处理你的monorepo,而且许多团队发现,排行榜上排名更差的模型反而能完成他们的工单。区别在于,使用Muse Code你可以廉价且可逆地发现这一点,而Cantus唯一可用的评估工具就是20美元的订阅和你自己的眼睛。
双方都把宝押在能否撑过这份长期工作上
抛开价格和评分,这两款产品正以惊人相似的机制应对相同的工作负载,这是这场对决中最有趣的趋同之处。
Muse Code 的答案是本地事件日志。每次模型调用、工具运行、审批和编辑都会追加写入磁盘,Meta 称这使会话可以精确重放且重启安全:进程崩溃或机器丢失后,智能体将从停止处恢复,而非重建其上下文。在此之上是 Meta 所称的持久异步后台智能体——这些子智能体在整个会话期间保持存活,并分散到独立的 git 工作树中,而不是按子任务创建和销毁,Meta 称这正是他们能够并行构建六个游戏功能而互不冲突的方式。支持证据只有一个案例研究:在 NVIDIA Hopper 硬件上自主优化 GPU 内核的 24 小时运行,涉及 1,000 多次工具调用,但没有公布任何加速数据。声称的是持续时间,而非结果。
Qoder 的答案是 Quest Mode,而且这个说法还挺押韵。Quest 是一个专用窗口,用于交接长时间运行的多步骤工作,具备任务跟踪、工件审查、检查点和本地工作树执行能力,而这正是 Cantus 的卖点——"扩展的自主任务执行"。Qoder 还带来了 Meta 没有对等物的东西:一个 Knowledge Engine,它能从你的代码库构建 Repo Wiki 和 Knowledge Cards,让智能体在开始长任务时带着已积累的仓库上下文,而不是重新去发现它。这是同一问题空间中一个真正的架构差异,而 Qoder 自 5 月的 1.0 版本起就一直在提供这一功能。
这两项声明均未经过独立验证。Meta 的事件日志尚未经过 Meta 以外任何人的压力测试,而 Qoder's Quest 的结果则从未被任何人衡量过。如果长期可靠性是你的决定性因素,那么两家供应商目前要求的都是同一件事:信任。
转换成本才是他们真正产生分歧的地方。

除了一个之外,Qoder 选择器中的每个模型都可以弃用。Qwen3.7-Max、DeepSeek V4 Pro、GLM-5.2、Kimi-K2.7-Code 和 MiniMax-M3 都以各自的定价系数列在下拉菜单中,而且它们都存在于 Qoder 之外——你可以从自己的代码中调用它们,互相比较价格,并带走你的提示词。Cantus 是那份列表中唯一的一扇单向门。围绕它构建团队工作流,退出成本就不是修改配置;而是发现没有其他产品能运行你定为标准的那个模型。
Muse Code 处于一个尴尬的中间地带。该模型是可移植的——Muse Spark 1.2 位于 Meta Model API 上,任何接受自定义端点的东西都可以调用它——但它只有一个提供者,这使其在构造上就是单点故障。而那 82.9% 属于该模型位于 Muse Code 的那个。Meta 的主要说法是,这两者经过协同训练,以实现“比外部模型的通用包装器更好的工具使用、更少的重试和更高质量的输出”。如果这是真的,从你自己的环境中调用 Muse Spark 1.2,你得到的是模型的一半,而没有经过调优的另一半。Meta 之外没有人曾在竞争性环境中测试过它,以弄清该分数中有多少归功于智能体。
明确一下我们能提供的内容:Muse Spark 1.2 由 Meta 直接提供,不在 OrcaRouter 目录中;Cantus 也不可能出现在任何人的目录里。Muse Spark 1.1 由我们提供,价格是 1.25 美元和 4.25 美元——与 Meta 的标价完全一致,因为我们加价 0%,直接按供应商定价转售;这也是为什么供应商价格变动当天就会反映在我们这边。我们针对 1.1 的生产遥测数据显示,首 token 延迟的 p50 为 1.84 秒,p95 为 6.00 秒——对于聊天形态的工作负载来说,这比任何基准测试工具给出的预期延迟都更有参考价值。
更广泛的问题在于你如何放置抽象层。如果你的智能体框架连接的是一个统一的端点,前端聚合了众多模型,并能在不同提供商之间自动故障转移,那么发布一个编程智能体就只是改个字符串的事,而供应商宕机则是别人的问题。如果你的框架是某个供应商的 IDE,那么所有这些决策都归该供应商说了算。Qoder 自己的 Auto 档位在内部执行模型路由,大约按 1.0 倍积分收费,为每个任务挑选最便宜的合格模型——这与我们作为基础设施所出售的理念相同,关键区别在于谁掌握方向盘。
你的代码存放位置
Meta明确说明了这一点,即便这一提议相当激进,也值得肯定。贡献者层级在输入方面便宜12.5倍,输出方面便宜21倍,缓存输入方面便宜75倍,交换条件是允许Meta使用数据来改进其模型。终端编码智能体的提示词就是你的源代码、你的内部API、你解释临时方案为何存在的注释,以及你的测试夹具中的一切内容。Meta表示,标准层级的提示词不会被用于改进其产品;该层级适用于任何专有内容。请把这一选择视为一项附带折扣的数据处理决策,而非计费偏好,并注意:悄悄降级的动机会随着你的token消耗增长而同步增长。
Qoder在其公开文档中并未对Cantus费率附加任何同等条件——该折扣是限时的,而非限数据量的,并且没有任何更便宜的层级可以在训练权利上做文章。你实际接受的是:一个来源不明的封闭模型,由阿里云托管,处理你的代码仓库,而其安全态势仅由Qoder自己的文档描述,而非任何可核验的基准。对于有数据驻留要求的团队,这首先是一个采购问题,其次才是工程问题,而且其方向与Meta截然相反:Meta会明确告诉你需要付出什么,并收取更少的费用;Qoder则既不明确表态,也不提供任何方向的折扣。
这个比较实际上引发的问题
按实际用量计算,对于单个开发者来说,哪个更便宜?
这完全取决于你是否触及了套餐上限。Qoder Pro 售价 20 美元,包含 2,000 个积分,按 3.2 倍的 Cantus 系数计算,大约相当于 200K 上下文下的 52 次 Editor agent 轮次,或约 12 个 Quest 任务——而且这 20 美元还包括 IDE、仓库索引、Repo Wiki 以及选择器中的其他所有模型。同样 20 美元购买 Muse Code 标准层级的令牌,大约能买到 228 次冷启动步骤或 900 次缓存步骤,在贡献者层级则约为 3,000 个步骤,但完全不包含任何工具。看重 IDE 的轻度用户在 Qoder 上更划算;而任何将 agent 运行到足以消耗完 2,000 个积分的人,则要以 33% 更差的费率购买 20 美元 1,500 积分的加购包,而 Meta 的边际令牌价格保持不变。
在承诺之前,我能恰当地对它们进行对比评估吗?
情况并不对称,而这就是实际的陷阱。Muse Code 可以在一个临时克隆上花几美元进行测试,Muse Spark 1.2 也可以换入现有测试框架中,从而将模型与代理隔离开来。Cantus 则只能通过订阅 Qoder 并在其内部工作来测试,这意味着你是在把 IDE、上下文引擎、Quest Mode 和模型作为一个整体来评估,完全没有办法对结果进行归因。如果 Cantus 表现良好,你不会知道是哪一部分的功劳;如果它表现糟糕,你也不会知道该归咎于哪一部分。
如今,这两者中是否有任何一个可以安全地指向专有仓库?
在标准层级上使用 Muse Code,可以,按 Meta 声明的条款——但有一个前提:它是一个发布仅一天的公开测试版,其崩溃安全保证除 Meta 内部人员外无人验证过。在贡献者层级上使用 Muse Code,除非负责数据处理审批的人先看过条款,否则不予通过。Qoder Cantus 是一个普通的商业 IDE 决策,算不上新颖,但它是一个运行在阿里云上的封闭模型,且没有公开的出处,因此它也属于“源代码被允许流向何处”这一讨论的范畴。
谁应该选择哪个
如果你的工作是长周期且无头部的——迁移、跨 monorepo 的依赖升级、内核或构建系统的工作,这些你原本需要时刻盯着的任务——并且你生活在 macOS 或 Linux 的终端里,那就选 Muse Code。它的定价像基础设施,模型是可移植的,故障模式在你拥有的事件日志中清晰可见,而且在贡献者级别的费率下,尝试的成本几乎为零。你要接受它是测试版,接受它在自家供应商挑选的每一块板上都输了,也接受它不支持 Windows。
如果你真正想要的是一个 IDE 产品,那就选择 Qoder Cantus。仓库知识引擎、Quest Mode、JetBrains 集成、云代理和 Windows 版本都是 Muse Code 无论花多少钱都无法提供的真正优势,而且对于曾被按量计费账单吓到的小团队来说,封顶的月费方案很有价值。开始使用前需要知道三件事:该模型没有基准测试数据,外部也无法对其进行基准测试;50% 的首发折扣已于 7 月 31 日到期,所以现在的价格是早期评估者支付的两倍;如果它成为团队工作方式的核心,就没有退出路径。
能够改变这一分析的因素是狭窄而具体的。如果 Qoder 发布 Cantus API,或者任何第三方设法为其给出一个真实数字,这就不再是已测量产品与形容词之间的比较。在那之前,Muse Code 最有力的论据不是其基准测试分数——它在这方面落败——而是它至少拥有分数、公开的价格表,以及一条出路。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
