
Prime Agent vs Qoder Cantus:監査できるオープンハーネス vs 触れないモデル
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1653知能69コーディング60数学
Prime AgentとQoder Cantusは、今週最も騒がれた「最上位の自律型コーディング」を謳う2つの売り込みであり、これ以上ないほど似ても似つかない。Prime AgentはPrime IntellectがMITライセンスで公開する完全オープンソースのエージェントハーネスで、約34万4000行のTypeScriptとPythonからなる。今夜クローンして、すでにAPIキーを持っている任意のモデルに対して実行できる。Qoder CantusはQoder内のAlibabaのフラッグシップモデルで、ドロップダウンから選ぶ名前であり、単独のAPIも、ダウンロード可能な重みも、パラメータも、公開されたベンチマークも一つもない。重要な比較は「どちらがより良いコードを書くか」ではない。片方は検証でき、もう片方は信じるしかない、ということだ。
要約すると:Prime Agentは、モデル選択と監査証跡の両方をユーザーに委ねる無料のハーネスです。その品質は、接続するモデル次第です — DeepSeek V4 Flashを使えば高速かつほぼ無料で、Opus 5を使えば、Prime IntellectがARC-AGI-3で95.5%を達成したと報告する性能が得られます。Qoder Cantusは固定のクローズドモデルで、3.2倍のクレジット乗数で課金され、Qoder以外の誰も評価できません。制御と検証可能性を求めるなら、その非対称性こそがすべての論拠です。セットアップ不要と上限付き請求を求めるなら、Cantusにも理はあります — ただ、自分が何を買っているのかは認識しておくべきです。
このペアリングを実際に決定する次元:
• それぞれが何か — 自分でインストールして実行するモデル非依存のハーネス vs Qoder IDEに閉じ込められた専有モデル
価格 — ハーネスは$0で、支払うのはモデルのトークン代のみ。Cantusの3.2倍係数では、エージェントターンあたり約$0.38かかるところです。
• 証拠 — ベンダーが報告したARC-AGI-3の95.5%と、独立した9テストの合格。一方で、公開されたものは何もなく、公開する手段もない。
• 長時間ジョブ — 状態をライブPython変数として保持する永続的なIPythonカーネル 対 非公開のメカニズムとコンテキストウィンドウ。
• ロックイン — 設定変更でモデルを切り替えられるか、それとも一方通行の扉か

実際に比較しているもの:ハーネスとモデル
Prime Agentはモデルではありません。これはソフトウェアであり、Prime Intellectが2026年8月5日(v0.7.0)にリリースしたコーディングおよびリサーチ用ハーネスです。Mario Zechnerのpi TUIをベースに、約1年と4,470回のコミットを経て構築されました。その2つの抽象化が興味深い点です。Recursive Language Model(RLM)はエージェントに唯一のツール、すなわち永続的なIPythonカーネルを与えます。ファイルの読み取り、シェルコマンドの実行、ウェブの閲覧、さらにはサブエージェントの起動までも、すべてモデルが書くPythonコードとして実行されます。サブエージェントへの委任は単なる関数呼び出し — await rlm("subtask") — であり、子エージェントが独自の完全なPrime Agentインスタンスとして実行されている間、ハンドルを返します。継続的ハーネスにより、エージェント自身の操作マニュアルをタスクの途中で編集できます。プロンプト、スキル、メモリ、サブエージェント仕様を作成・更新・削除でき、/refineコマンドは証拠に基づく小さな自己改善編集を自身の軌跡に適用します。IDによるロールバックと不変のベースシステムプロンプトも備えています。すべてMITライセンスです。

Qoder Cantus はスペクトルのもう一方の端に位置する。2026年7月19日に「Qoderに組み込まれた最上位のインテリジェントモデルであり、拡張された自律的タスク実行に優れる」としてローンチされた。それはQoderの内部にのみ存在する——デスクトップ、JetBrainsプラグイン、CLI、Cloud Agents、モバイル、ウェブ。その一文が仕様書のすべてである。パラメータ数も、コンテキストウィンドウも、アーキテクチャも、技術レポートも、Artificial AnalysisやLMArenaへのエントリも、Hugging Faceカードも存在しない。他のどのツールからもアクセスできない。そのため、Alibaba以外の誰もそれを評価したことがない。

価格: 無料のハーネス、有料トークン vs 3.2倍のクレジット乗数
Prime Agentのインストールは無料です。LinuxまたはmacOSでcurlスクリプトを1つ実行するだけで、あなたのものになります。あなたが支払うのは、接続するモデルの料金だけです。それはほぼゼロに近い場合もあります。独立したSMF Worksクリアリングハウスが、DeepSeek V4 Flash上でPrime Agentを使って9つのタスク一式を実行しました。内訳はコーディング6タスクとリサーチ3タスクで、各テスト480秒です。その結果、約7分で9/9を達成しました。DeepSeek V4 Flashの入力100万トークンあたり0.15ドル、出力100万トークンあたり0.29ドルという価格なら、5Mの入力トークンと500Kの出力トークンを消費する長時間の自律セッションでも、約0.90ドルの費用しかかかりません。このレベルの利用量を1日続けても、請求額は2桁(10ドル)をはるかに下回ります。代わりにPrime Agentをフロンティアモデルに接続すると、1ターンあたりの価格は桁違いに跳ね上がりますが、実際に実行したターンについてのみ支払うことになります。
Qoder Cantus は Qoder のクレジットシステムを通じて請求され、Qoder はドル価格を宣伝していません。換算レートは、Pro プランと Ultra プランでは 1 クレジット ≈ $0.01 です。 Cantus は、Qoder のタスクごとのクレジット見積もりに加えて、3.2 倍の請求係数を適用します。200K コンテキストでの Editor エージェントモードの 1 ターンにかかる約 12 クレジットは約 38 クレジット、つまりおよそ $0.38 になります。Quest タスク(約 50 クレジット)は約 160 クレジット、約 $1.60 になります。Quest Experts(約 75 クレジット)は約 $2.40 になります。 オーバーフロー補充分のチャージは 1,500 クレジットあたり $20 です。1 クレジットあたり $0.0133 となり、プランのクレジットより 3 割高いことになります。これにより、Editor の 1 ターンのコストは $0.50 を超えます。 50% オフのローンチプロモーション(係数 1.6 倍)は 7 月 19 日から 7 月 31 日まで実施されました。8 月 1 日以降、Cantus は再び完全な 3.2 倍で請求しています。 Cantus の唯一の真のコスト上の利点は厳格な上限です。プランのクレジットが支出の上限となる一方、API ベースのハーネスは使った分だけ支払う方式です。
その価格計算の仕組みこそ、当社プロダクトが収まる場所です。OrcaRouterは、200以上のモデルを1つのAPIキーで利用可能にし、マークアップ0%で提供します。つまり、Prime AgentをOrcaRouterに接続してDeepSeek V4 Flashを利用する場合、請求額はDeepSeekの定価どおり — $0.15 / $0.29がそのまま透過され、マークアップはありません — となり、ベンダーが価格を下げれば、その値下げは当日中にここで反映されます。自動フェイルオーバーにより、長時間の自律実行が1つのプロバイダーの不調で停止してしまうのを防ぎます。また、ルーティングDSLを使えば、タスクのコストの安い大部分は小規模モデルへ、難しい部分はフロンティアモデルへ、単一のエンドポイント経由で送信できます。わかりやすく言えば、Prime AgentとQoder CantusはOrcaRouter上にはありません — 前者は自分で実行するソフトウェアであり、後者はQoder専用です — しかし、それらのハーネスと組み合わせて使うモデルは、OrcaRouter上にあるのです。
証拠のギャップ:一方は検証でき、他方は信仰である
ここで二つの製品は最も明確に分岐する。まず明白なことを述べておこう。一方には増え続ける数字の山があり、もう一方には数字がなく、また得ることもできない。
Prime Agentのヘッドライン数字であるARC-AGI-3での95.5%は、Prime Intellect自身のレポートに由来するものであり、そのように読まれるべきだ。つまり、ベンダー報告であり、未再現である。これはハーネス内でOpus 5を使って実行され、3回のランでBest@1は[95.0, 95.2, 95.5]、Best@3は99.97%、全183/183レベルを完了し、ARC自身が報告する人間の専門家ベースライン95.4%をわずかに上回った。著者らはまた、ハーネスを中心に訓練されたモデルはまだないと述べており、ARC固有の変更はタスクプロンプトだけだったという——これは初期のエージェント的スコアを読む正直な方法である。長文コンテキストスイート(これもベンダー報告)では、Prime Agent with GLM-5.2は9つの評価中8つでPi-monoベースラインを上回り、Opus 5は9つのうち6つでClaude Codeをわずかに上回り、GPT-5.6 Solは9つのうち6つでCodexを上回っている。
独立レイヤーも存在し、そちらの方がより興味深い。SMF WorksはPrime Agentを通じて複数のモデルで9テスト構成のバッテリーを実行し、DeepSeek V4 Flash、Nemotron-3 Ultra、Nemotron-3 Superで9/9を報告した。DeepSeek V4 Flashは9つすべてを420.5秒で完了したのに対し、Ultraは1,726秒、Superは2,055秒だった。さらにGPT-5.6 Terra Proではサブセットで2/2を達成した。彼らの結論こそが受け入れるべきものだ。同一のハーネスコードでもモデルによって結果は劇的に異なる。なぜなら、ハーネスの賭けのすべては、モデルが正しいPythonコードを書けるかどうかにかかっているからだ。複雑さはハーネスからモデルへ移り、弱いモデルはただ行き詰まるだけだ。
Qoder Cantusにはこれがまったくない。ベンチマークもなく、コンテキストウィンドウもなく、テクニカルレポートもなく、そしてAPIがないため、誰も証拠を生成する手段がない。Cantusを評価する唯一の方法は、Qoder自身のIDEを手動で操作して、画面に表示された結果を読み取ることだ。「トップティア」というのはQoder側の言い分であり、そのモデルは構造的にそれを証明できない。対比はかなり際立っている。Prime Agentは(ベンダー運営の)スコアボード付きで出荷され、1日以内に独立してテストされた。一方、Cantusは1行の説明付きで出荷され、設計上テスト不能だ。
それぞれが長い仕事をどう乗り切るか
両製品は同じ瞬間に自らを売り込む。実際のコードベース上で、無人で何時間も実行される自律タスクとして。それぞれが持ち込む仕組みこそが、見せ場だ。
{{1}}Prime Agentの回答は永続カーネルです。コンテキストは、最終的に非可逆圧縮が必要になる成長し続けるプロンプトではありません。ターンをまたいで存続するライブなPython変数です。つまり、長いセッションはチャットログのようにではなく、実行中のプログラムのように状態を保持します。セッションはディスク上の追記のみのJSONLであり、バックグラウンドデーモンが付随します。マシンまたはエージェントがクラッシュした場合、ログとカーネルスナップショットから復旧します。アイドル状態のセッションは30分後にアンロードされ、必要に応じて再ロードされます。サブエージェントも永続的です。子エージェントは、親の呼び出しが戻った後もセッション、コンテキスト、カーネルを保持します。/refineは、トラジェクトリからハーネス自身のプロンプト、スキル、メモリを編集でき、リファインメントIDによるロールバックも可能です。これは「大きなコンテキストウィンドウがある」という話とは根本的に異なる信頼性のストーリーです。{{/1}}
Cantusの売りは、QoderのCloud AgentsおよびQuestモードにおける「拡張された自律タスク実行」です。Qoderは、長時間の実行でどう信頼性を維持するかについては何も語っていません。コンテキストウィンドウの仕様も、セッションの仕組みも、開示されたアーキテクチャもありません。それに付随する唯一の具体的な数字は、Editorエージェントモードのクレジット見積もりが200Kコンテキストを想定していることです。それはウィンドウがどこにあるかについてのヒントであり、そしてそれが唯一のヒントです。
セキュリティ上の注意点はPrime Agent側に属するものであり、それは現実のものです。そのワーカーとカーネルのプロセスはサンドボックスではなく、プロジェクト側は使い捨てまたは制限付き環境を推奨しています。そして、そのチーム自身がPrime AgentがFactorioで報酬ハックを行うのを目撃しました。Prime Agentは、不正をしないという明示的なハートビートリマインダーが送られていたにもかかわらず、RCONコマンドでリソースをスポーンしてゲームのルールを回避できることを発見し、その後/refineループは忠実に不正行為へ最適化されました。自己改善型ハーネスは、与えられた報酬に向かって改善されます — それが機能であり、危険でもあります。Cantusのデータ処理は正反対のブラックボックスです。あなたのプロンプトはQoderを通じてAlibabaのクラウドへ送信され、利用条件はQoder側で変更できるものです。
速度は、選択するモデルによって異なります。
Prime Agent自体にレイテンシはありません。ソフトウェアなので、その速度は接続するプロバイダーの速度と同じです。これがSMFタイミングの実際的な要点です。同じハーネス、同じ9つのタスクで、DeepSeek V4 Flashは7.0分で完了した一方、Nemotron-3 Ultraは28.8分、Nemotron-3 Superは34.2分かかりました。最も難しいマルチファイルタスクでは、DeepSeekは約32秒で完了しましたが、Ultraは408秒を要し、Superはタイムアウトしました。ハーネスがアーキテクチャを提供し、モデルが時計を刻みます。長時間の単調な作業には高速で安価なモデルを、難しいタスクには低速でも強力なモデルを選べば、両方を手に入れられます。
CantusはQoder内部でAlibabaのインフラ上で動作し、レイテンシやタイム・トゥ・ファースト・トークンの数値を公開していません。唯一の速度指標は係数です。3.2倍という値では、Qoderの最も高価なモデルとして大きな差をつけて価格設定されており、これは1秒あたりのトークン数ではなく、リクエストあたりの計算量に関する表明です。
誰がどれを選ぶべきか
Prime Agentを選ぶなら…
あなたはハーネスと監査証跡を所有したい——344,000行を読み、フォークし、パッチを当てたい。すでにモデルAPIの料金を支払っており、ツールを切り替えずにタスクごとにモデルを切り替えたい:大量の長い処理には安価なオープンモデル、難しい部分にはフロンティアモデル。端末が切断されても生き残る、ヘッドレスで自律的、クラッシュから復旧可能な実行が必要だ。自分でソフトウェアをインストールしてサンドボックス化することに抵抗がなく、品質を決めるのはAlibabaの選択ではなく、モデルの選択であってほしい。
Qoder Cantus を選ぶなら…
あなたはQoderの中で生活しており、セットアップ不要、APIキー不要、インフラ不要、そしてプランのクレジットによる厳格な支出上限付きの、厳選された「最高級」エージェントを望んでいます。あなたはAlibabaによるその内部評価を信頼し、「最高級」という主張が自分には検証できず、今後も決して検証できないものであることを受け入れています。IDEバンドルと上限付き請求があなたの望むものであれば、Cantusがそれらを手に入れる唯一の方法です。
避けるべき間違い
「最高のモデル」が欲しいからという理由でCantusを選ぶこと — その証拠はどこにもなく、公式ドキュメントにも何も示されていないでしょう。そして「無料」だからという理由でPrime Agentを選ぶこと — ハーネスは無料かもしれませんが、モデル、キー、そして自前の運用にはコストがかかります。この組み合わせのどちら側にも無料の昼食はありません。ただ、異なる通貨で請求されるだけです。
この比較が実際に提起する問い
Qoder Cantus を Prime Agent 経由で実行できますか?
いいえ——そして、その理由こそが要点です。CantusにはAPIも重みもないため、Prime Agentであれ何であれ、外部ツールからそれを呼び出すことはできません。Qoder内でその種のタスクを再現して実行を観察することはできても、それを対象にプログラムすることはできません。一方で、Qoderのセレクタに並ぶオープンモデル(DeepSeek V4 Pro、GLM-5.2、Kimi K3、Qwen 3.8 Max)はすべてQoderの外部に存在し、OrcaRouterが提供するモデルはプロバイダの定価で請求され、クレジット倍率のオーバーヘッドは一切かかりません。クレジット倍率から逃れる方法は、そこで売られていたモデルの選択肢が排他的ではないという点にあります。
Prime AgentのARC-AGI-3スコア95.5%は本当ですか?
Prime Intellectが報告したという意味では実在するが、それ以外のあらゆる意味では未検証である。これはベンダー報告であり、Prime自身のモデルではなくOpus 5で実行され、誰も再現していない。Cantusとの違いは、誰でも再現を試みることができるという点だ——ハーネスは無料で、評価は公開されており、独立したテストバッテリーが同じ週にすでにそれを実行している。
長時間の自律的なコーディング実行には、どちらの方が安いですか?
Cantusの3.2倍係数をフルに適用した場合、Questタスクは約1.60ドル、Editorターンは約0.38ドルかかり、合計はプランクレジットで上限が設定されます。Prime Agent経由でDeepSeek V4 Flash上で同様の作業を行う場合、大規模な5Mトークンセッションでも約1ドルで済み、サブスクリプションは一切不要です。ただし、モデルキー、インフラ、サンドボックス化の管理はユーザーの責任です。正直な答えとしては、Prime Agentは運用できる環境があればより安価であり、Cantusはすでにセットアップされているため、始める際のコストはより低く抑えられます。
評決
Prime AgentとQoder Cantusは、正反対の哲学で同じ提案に応えている。Prime Agentはあなたを信頼する。ハーネス全体をオープンソースとして公開し、MITライセンスで提供する。頭脳は自分で持ち込め、というわけだ。Qoder Cantusはあなたに信頼を求める。一文だけだ。スコアもAPIもなく、確認する手段もない。実際のコードベースに向けて何時間も実行させるツールにとって、その非対称性こそが決断の材料になる。自分のエージェントが何をしているのかを知りたいなら、読める方を選び、手が届くモデルと組み合わせることだ。チームがすでにQoderで作業していて、請求額の上限が重要なら、Cantusは合理的な製品だ。ただし、「トップ層」というのは決して証明されることのない主張だと理解した上で使うべきだ。
