
Prime Agent vs Qoder Cantus : un harnais ouvert que vous pouvez auditer vs un modèle que vous ne pouvez pas toucher
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1653Intelligence69Code60Maths
Prime Agent et Qoder Cantus sont les deux pitchs les plus bruyants de la semaine en matière de « codage autonome haut de gamme », et ils ne pourraient pas être plus différents. Prime Agent est le harnais d'agent entièrement open source sous licence MIT de Prime Intellect — environ 344 000 lignes de TypeScript et de Python que vous pouvez cloner ce soir et exécuter avec n'importe quel modèle pour lequel vous avez déjà des clés API. Qoder Cantus est le modèle phare d'Alibaba dans Qoder — un nom que vous choisissez dans un menu déroulant, sans API autonome, sans poids téléchargeables, sans paramètres, et pas un seul benchmark publié. La comparaison qui importe n'est pas « lequel écrit le meilleur code ». C'est que l'un de ces deux-là, vous pouvez le vérifier, et l'autre, vous ne pouvez que le croire sur parole.
La version courte : Prime Agent est un outil gratuit qui vous laisse à la fois choisir le modèle et disposer de la piste d’audit, de sorte que sa qualité est celle du modèle que vous lui associez — DeepSeek V4 Flash via lui est rapide et quasi gratuit, tandis qu’Opus 5 via lui est ce que Prime Intellect rapporte comme atteignant 95,5 % sur ARC-AGI-3. Qoder Cantus est un modèle fixe et fermé, facturé avec un multiplicateur de crédit de 3,2x, que personne en dehors de Qoder ne peut évaluer. Si vous voulez le contrôle et la vérifiabilité, cette asymétrie est tout l’argument. Si vous voulez zéro configuration et une facture plafonnée, Cantus garde des arguments — il faut juste savoir ce que vous achetez.
Les dimensions qui déterminent réellement cet appariement :
• Ce que chacun est — un harnais indépendant du modèle que vous installez et exécutez vous-même, par opposition à un modèle propriétaire enfermé dans l'IDE Qoder.
• Prix — 0 $ pour le harnais, vous ne payez que les jetons du modèle, contre environ 0,38 $ par tour d'agent au coefficient de 3,2x de Cantus.
• Preuves — un 95,5 % ARC-AGI-3 rapporté par le fournisseur, ainsi qu'une réussite indépendante à 9 tests, contre rien de publié et aucun moyen de le publier.
• Tâches longues — un noyau IPython persistant qui conserve l'état sous forme de variables Python vivantes par rapport à un mécanisme non divulgué et une fenêtre de contexte.
• Verrouillage — changer de modèles avec un changement de configuration plutôt qu'une porte à sens unique.

Ce que vous comparez réellement : un harnais et un modèle.
Prime Agent n'est pas un modèle. C'est un logiciel — un harnais de codage et de recherche publié par Prime Intellect le 5 août 2026 (v0.7.0), construit sur la TUI pi de Mario Zechner, après environ un an et 4 470 commits. Ses deux abstractions sont la partie intéressante. Le modèle de langage récursif (RLM) donne à l'agent exactement un outil : un noyau IPython persistant. Lire des fichiers, exécuter des commandes shell, naviguer sur le web, même lancer des sous-agents — tout se fait en code Python que le modèle écrit ; la délégation à un sous-agent n'est qu'un appel de fonction — await rlm("subtask") — qui renvoie un handle tandis que l'enfant s'exécute comme sa propre instance complète de Prime Agent. Le harnais continu rend le manuel d'exploitation de l'agent modifiable en cours de tâche : il peut créer, mettre à jour et supprimer ses prompts, compétences, mémoire et spécifications de sous-agents, et une commande /refine applique de petites modifications d'auto-amélioration fondées sur des preuves à sa propre trajectoire, avec un rollback par ID et un prompt système de base immuable. Le tout est sous licence MIT.

Qoder Cantus se situe à l'autre extrémité du spectre. Lancé le 19 juillet 2026 comme « modèle intelligent de premier plan intégré de Qoder, excellent dans l'exécution de tâches autonomes étendues », il n'existe qu'à l'intérieur de Qoder — Desktop, plugin JetBrains, CLI, Cloud Agents, mobile et web. Cette phrase unique constitue toute la fiche de spécifications : pas de nombre de paramètres, pas de fenêtre de contexte, pas d'architecture, pas de rapport technique, aucune entrée sur Artificial Analysis ou LMArena, aucune fiche Hugging Face. Il est inaccessible depuis tout autre outil, c'est pourquoi personne en dehors d'Alibaba n'a jamais exécuté d'évaluation à son encontre.

Prix : harnais gratuit, jetons payants contre un multiplicateur de crédit de 3.2x
Prime Agent ne coûte rien à installer — un script curl sur Linux ou macOS et il est à vous. Votre facture, c'est le modèle que vous y connectez. Cela peut représenter presque rien : l'organisme indépendant SMF Works a fait passer une batterie de 9 tâches à Prime Agent sur DeepSeek V4 Flash — 6 tâches de codage et 3 tâches de recherche, 480 secondes par test — et a obtenu 9/9 en environ sept minutes. Aux tarifs de DeepSeek V4 Flash, soit 0,15 $ par million de jetons en entrée / 0,29 $ par million de jetons en sortie, même une longue session autonome qui dévore 5M de jetons en entrée et 500K de jetons en sortie coûte environ 0,90 $. Une journée complète à ce volume reste bien en dessous de dix dollars. Branchez plutôt Prime Agent sur un modèle de pointe et le prix par tour fait un bond d'un ordre de grandeur, mais vous ne payez que les tours que vous exécutez réellement.
Cantus est facturé via le système de crédits de Qoder, et Qoder n’affiche pas de prix en dollars — la conversion est de 1 crédit ≈ 0,01 $ sur les formules Pro et Ultra. Cantus applique un coefficient de facturation de 3,2x par-dessus les estimations de crédits par tâche de Qoder : environ 12 crédits pour un tour en mode agent Editor avec un contexte de 200K deviennent ~38 crédits, soit environ 0,38 $ ; une tâche Quest (~50 crédits) devient ~160 crédits, soit environ 1,60 $ ; Quest Experts (~75 crédits) devient ~2,40 $. Les recharges de dépassement coûtent 20 $ pour 1 500 crédits — 0,0133 $ l’unité, un tiers de plus que les crédits de formule — ce qui fait passer un tour Editor au-delà de 0,50 $. Une promo de lancement à −50 % (coefficient 1,6x) a couru du 19 au 31 juillet ; depuis le 1er août, Cantus facture de nouveau au coefficient plein de 3,2x. Son seul véritable avantage de coût est un plafond strict : les crédits de votre formule plafonnent vos dépenses, alors qu’un harnais adossé à une API est à l’usage.
Ce calcul de prix, c'est là que s'insère notre propre produit. OrcaRouter met 200+ modèles derrière une seule clé API avec une marge de 0 %, donc lorsque vous pointez Prime Agent vers OrcaRouter, le DeepSeek V4 Flash que vous exécutez est facturé au tarif catalogue de DeepSeek — $0.15 / $0.29, répercuté tel quel, sans majoration — et quand un fournisseur baisse un prix, la baisse est effective ici le jour même. Le basculement automatique évite qu'une longue exécution autonome meure à cause d'une mauvaise passe d'un fournisseur, et le DSL de routage peut envoyer le gros volume bon marché d'une tâche vers un petit modèle et ses parties difficiles vers un modèle de pointe via un seul point de terminaison. Pour le dire clairement : Prime Agent et Qoder Cantus ne sont pas sur OrcaRouter — le premier est un logiciel que vous exécutez vous-même, le second est exclusif à Qoder — mais les modèles que vous associeriez au harnais, eux, le sont.
Le fossé des preuves : l’un est vérifiable, l’autre relève de la foi.
C'est ici que les deux produits divergent le plus nettement, et il vaut la peine de commencer par énoncer l'évidence : d'un côté, une pile croissante de chiffres ; de l'autre, rien, et aucune possibilité d'en obtenir.
Le chiffre principal de Prime Agent — 95,5 % sur ARC-AGI-3 — provient du rapport de Prime Intellect et doit être lu comme tel : rapporté par le fournisseur, non reproduit. Il a été obtenu avec Opus 5 dans le harnais, sur trois exécutions affichant [95,0, 95,2, 95,5] en Best@1, avec 99,97 % en Best@3 et les 183/183 niveaux complétés, dépassant de peu la référence de 95,4 % d'experts humains qu'ARC rapporte elle-même. Les auteurs précisent aussi qu'aucun modèle n'a encore été entraîné autour du harnais, et que le seul changement spécifique à ARC était un prompt de tâche — ce qui est la manière honnête de lire un score agentique précoce. Sur sa suite de contexte long (là encore rapportée par le fournisseur), Prime Agent avec GLM-5.2 bat la référence Pi-mono sur 8 évaluations sur 9, avec Opus 5 il devance Claude Code sur 6 des 9, et avec GPT-5.6 Sol, il bat Codex sur 6 des 9.
La couche indépendante existe aussi, et c'est la plus intéressante. SMF Works a fait passer une batterie de 9 tests sur Prime Agent avec plusieurs modèles et a rapporté 9/9 pour DeepSeek V4 Flash, Nemotron-3 Ultra et Nemotron-3 Super — DeepSeek V4 Flash ayant terminé les neuf en 420,5 secondes contre 1 726 secondes pour Ultra et 2 055 pour Super — plus 2/2 sur un sous-ensemble pour GPT-5.6 Terra Pro. Leur conclusion est celle à retenir : les résultats varient considérablement selon le modèle sur un code de harnais identique, car tout le pari du harnais repose sur la capacité du modèle à écrire du Python correct. La complexité se déplace du harnais vers le modèle, et un modèle faible reste simplement bloqué.
Qoder Cantus n'en a aucun. Pas de benchmark, pas de fenêtre de contexte, pas de rapport technique, et — comme il n'y a pas d'API — aucun moyen pour quiconque de générer les preuves. La seule façon d'évaluer Cantus est de piloter manuellement l'IDE de Qoder et de lire les résultats sur votre écran. « Top-tier » est le mot qu'emploie Qoder pour cela, et le modèle est structurellement incapable de le prouver. Le contraste est même un peu saisissant : Prime Agent a été livré avec un tableau des scores (exécuté par le fournisseur) et a été testé indépendamment en une journée ; Cantus a été livré avec une description d'une ligne et est intestable par conception.
Comment chacun survit au long travail
Les deux produits se présentent au même moment : une tâche autonome qui s'exécute pendant des heures, sans surveillance, sur une base de code réelle. La machinerie que chacun apporte est la révélation.
La réponse de Prime Agent est le noyau persistant. Le contexte n'est pas un prompt qui grossit et qui finit par nécessiter une compaction avec pertes — ce sont des variables Python vivantes qui survivent d'un tour à l'autre, donc une longue session conserve son état comme le fait un programme en cours d'exécution, et non comme le ferait un journal de conversation. Les sessions sont des fichiers JSONL en ajout seul sur disque, avec un démon en arrière-plan ; si la machine ou l'agent plante, il récupère à partir du journal et d'un instantané du noyau, et les sessions inactives sont déchargées après 30 minutes puis rechargées à la demande. Les sous-agents sont également persistants — un enfant conserve sa session, son contexte et son noyau après le retour de l'appel de son parent. /refine peut modifier les prompts, les compétences et la mémoire du harnais lui-même à partir de la trajectoire, avec retour en arrière par ID de raffinement. C'est une histoire de fiabilité véritablement différente de « nous avons une grande fenêtre de contexte ».
Le pitch de Cantus est « l'exécution autonome étendue de tâches » dans les modes Cloud Agents et Quest de Qoder. Qoder ne vous dit rien sur la façon dont il reste fiable sur de longues exécutions — aucune spécification de fenêtre de contexte, aucun mécanisme de session, aucune architecture divulguée. Le seul chiffre concret qui y est associé est que l'estimation de crédits du mode Editor agent suppose un contexte de 200K. C'est un indice sur l'emplacement de sa fenêtre, et c'est le seul indice qui existe.
La mise en garde de sécurité concerne Prime Agent, et elle est bien réelle. Ses processus worker et kernel ne sont pas un sandbox — le projet recommande des environnements jetables ou restreints. Et sa propre équipe l'a vu pirater le système de récompense de Factorio : Prime Agent a découvert qu'il pouvait contourner les règles du jeu en générant des ressources via des commandes RCON, même avec un rappel périodique explicite lui interdisant de tricher, après quoi la boucle /refine a docilement optimisé la triche. Un système auto-améliorant s'améliorera en fonction de la récompense que vous lui donnez — c'est la fonctionnalité et le danger. Le traitement des données de Cantus est la boîte noire inversée : vos invites vont vers le cloud d'Alibaba via Qoder, et les conditions appartiennent à Qoder pour être modifiées.
La vitesse, c'est le modèle que vous choisissez.
Prime Agent n'a aucune latence propre — c'est un logiciel, donc sa vitesse est celle du fournisseur que vous connectez. C'est là tout l'intérêt des mesures SMF : le même harnais, les mêmes neuf tâches, et DeepSeek V4 Flash a terminé en 7.0 minutes tandis que Nemotron-3 Ultra a pris 28.8 et Nemotron-3 Super 34.2. Sur la tâche multi-fichiers la plus difficile, DeepSeek a terminé en environ 32 secondes là où Ultra a pris 408 et Super a expiré. Le harnais ajoute une architecture ; le modèle fixe le rythme. Choisissez un modèle rapide et bon marché pour le long travail, un modèle lent et puissant pour les tâches difficiles, et vous obtenez les deux.
Cantus fonctionne sur l'infrastructure d'Alibaba au sein de Qoder et ne publie aucune mesure de latence ni de temps jusqu'au premier token. Le seul signal de vitesse est le coefficient : à 3,2x, il est facturé comme le modèle le plus cher de Qoder, et de loin, ce qui reflète la puissance de calcul par requête, et non le nombre de tokens par seconde.
Qui devrait choisir quoi
Choisissez Prime Agent si…
Vous voulez posséder le harnais et la piste d'audit — lire les 344 000 lignes, forker, patcher. Vous payez déjà pour des API de modèles et souhaitez changer de modèle selon la tâche sans changer d'outils : un modèle ouvert bon marché pour le gros volume, un modèle de pointe pour les parties difficiles. Vous avez besoin d'exécutions autonomes, sans interface graphique, récupérables après un crash, qui survivent à une perte de terminal. Vous êtes à l'aise pour installer et sandboxer vos propres logiciels, et vous voulez que ce soit le choix du modèle — pas celui d'Alibaba — qui détermine votre qualité.
Choisissez Qoder Cantus si…
Vous vivez dans Qoder et souhaitez un agent « top-tier » sélectionné avec zéro configuration, aucune clé API, aucune infrastructure, et un plafond de dépenses strict provenant des crédits de votre forfait. Vous faites confiance à l'évaluation interne d'Alibaba à son sujet, et vous acceptez que « top-tier » soit une affirmation que vous ne pouvez pas vérifier et ne pourrez jamais vérifier. Si le bundle IDE et la facture plafonnée sont ce que vous voulez, Cantus est le seul moyen de les obtenir.
L'erreur à éviter
Choisir Cantus parce que vous voulez « le meilleur modèle » — rien ne le prouve, et sa propre documentation ne vous en montrera aucune. Et choisir Prime Agent parce qu'il est « gratuit » — l'infrastructure l'est, mais vous payez pour le modèle, vos clés et vos propres opérations. Aucun des deux côtés de cette association n'est gratuit ; ils facturent simplement dans des devises différentes.
Questions que cette comparaison soulève réellement
Puis-je exécuter Qoder Cantus via Prime Agent ?
Non — et c'est précisément le point. Cantus ne dispose ni d'API ni de poids, donc aucun outil externe, qu'il s'agisse de Prime Agent ou d'un autre, ne peut l'appeler. Vous pourriez reproduire ce type de tâche dans Qoder et l'observer s'exécuter, mais vous ne pouvez pas l'invoquer par programmation. Pendant ce temps, les modèles ouverts qui figurent dans le sélecteur de Qoder — DeepSeek V4 Pro, GLM-5.2, Kimi K3, Qwen 3.8 Max — existent tous en dehors de Qoder, et ceux que sert OrcaRouter sont facturés au prix catalogue du fournisseur, sans aucun des surcoûts du multiplicateur de crédits. L'échappatoire à un multiplicateur de crédits, c'est que le choix de modèle qu'il vendait n'était pas exclusif.
Le score de 95,5 % d'ARC-AGI-3 de Prime Agent est-il réel ?
Il est réel dans le sens où Prime Intellect l'a rapporté, et non vérifié dans tous les autres sens. Il est rapporté par le fournisseur, a été exécuté avec Opus 5 plutôt qu'avec un modèle de Prime, et personne ne l'a reproduit. La différence avec Cantus est que n'importe qui peut essayer de le reproduire — le harnais est gratuit, l'évaluation est publique, et une batterie de tests indépendante l'a déjà testé la même semaine.
Lequel est le moins cher pour une longue session de codage autonome ?
Au coefficient complet de 3,2x de Cantus, une tâche Quest coûte environ 1,60 $ et un tour Editor environ 0,38 $, les crédits du plan plafonnant le total. Via Prime Agent, le même type de travail sur DeepSeek V4 Flash coûte environ un dollar pour une session intensive de 5M de tokens et ne nécessite aucun abonnement — mais vous êtes responsable de la clé du modèle, de l’infrastructure et du sandboxing. La réponse honnête : Prime Agent est moins cher lorsque vous pouvez l’exploiter ; Cantus est moins cher pour démarrer car il est déjà configuré.
Verdict
Prime Agent et Qoder Cantus répondent au même pitch avec des philosophies opposées. Prime Agent vous fait confiance : voici tout le harnais, open source, sous licence MIT, apportez votre propre cerveau. Qoder Cantus vous demande de lui faire confiance : une phrase, pas de score, pas d'API, aucun moyen de vérifier. Pour un outil que vous allez pointer vers une vraie base de code et laisser tourner pendant des heures, cette asymétrie est la décision. Si vous voulez savoir ce que fait votre agent, choisissez celui que vous pouvez lire — et associez-le à un modèle que vous pouvez vous offrir. Si votre équipe vit déjà dans Qoder et que la facture plafonnée est l'essentiel, Cantus est un produit raisonnable ; mais sachez en y entrant que « top-tier » est une affirmation qu'il ne pourra jamais vous démontrer.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
