
Prime Agent vs Qoder Cantus: un'infrastruttura aperta che puoi verificare vs un modello che non puoi toccare
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenza69Codice60Matematica
Prime Agent e Qoder Cantus sono le due proposte più eclatanti di "programmazione autonoma di alto livello" della settimana, e non potrebbero essere più diverse. Prime Agent è l'harness per agenti completamente open source di Prime Intellect, con licenza MIT — circa 344.000 righe di TypeScript e Python che puoi clonare stasera ed eseguire con qualunque modello per cui hai già le chiavi API. Qoder Cantus è il modello di punta di Alibaba all'interno di Qoder — un nome che scegli da un menu a tendina, senza API autonoma, senza pesi scaricabili, senza parametri, e nemmeno un benchmark pubblicato. Il confronto che conta non è "quale dei due scrive codice migliore". È che puoi verificare uno di questi, e l'altro puoi solo prenderlo sulla fiducia.
La versione breve: Prime Agent è un harness gratuito che ti offre sia la scelta del modello sia la traccia di audit, quindi la sua qualità è quella del modello a cui lo punti — DeepSeek V4 Flash attraverso di esso è veloce e quasi gratuito, mentre Opus 5 attraverso di esso è ciò che Prime Intellect dichiara raggiungere il 95,5% su ARC-AGI-3. Qoder Cantus è un modello fisso e chiuso, addebitato con un moltiplicatore di credito di 3,2x, che nessuno al di fuori di Qoder può valutare in alcun modo. Se vuoi controllo e verificabilità, quella asimmetria è tutto il punto. Se vuoi zero configurazione e un conto con un tetto massimo, Cantus ha ancora un suo perché — dovresti solo sapere cosa stai comprando.
Le dimensioni che effettivamente decidono questo abbinamento:
• Cosa rappresenta ciascuno — un harness agnostico rispetto al modello che installi ed esegui tu stesso, rispetto a un modello proprietario chiuso all'interno dell'IDE Qoder.
• Prezzo — $0 per l'harness, paghi solo i token del modello rispetto a circa $0,38 per turno di agente con il coefficiente 3,2x di Cantus.
• Prove — un 95,5% su ARC-AGI-3 riportato dal fornitore più il superamento indipendente di 9 test, contro nulla di pubblicato e nessuna possibilità di pubblicarle.
• Job lunghi — un kernel IPython persistente che mantiene lo stato come variabili Python attive rispetto a un meccanismo non divulgato e una finestra di contesto.
• Lock-in — cambiare modello con una modifica di configurazione, invece di una porta a senso unico.

Ciò che stai effettivamente confrontando: un banco di prova e un modello
Prime Agent non è un modello. È un software — un harness di coding e ricerca rilasciato da Prime Intellect il 5 agosto 2026 (v0.7.0), costruito sulla pi TUI di Mario Zechner, dopo circa un anno e 4.470 commit. Le sue due astrazioni sono la parte interessante. Il Recursive Language Model (RLM) fornisce all'agente esattamente un solo strumento: un kernel IPython persistente. Leggere file, eseguire comandi shell, navigare sul web e persino generare sotto-agenti: tutto avviene sotto forma di codice Python scritto dal modello; la delega dei sotto-agenti è solo una chiamata di funzione — await rlm("subtask") — che restituisce un handle mentre il processo figlio gira come una propria istanza completa di Prime Agent. L'harness continuo rende il manuale operativo dell'agente modificabile a metà compito: può creare, aggiornare ed eliminare i propri prompt, competenze, memoria e specifiche dei sotto-agenti, e un comando /refine applica piccole modifiche di auto-miglioramento basate su evidenze alla propria traiettoria, con rollback per ID e un prompt di sistema di base immutabile. Il tutto è sotto licenza MIT.

Qoder Cantus si trova all'estremo opposto dello spettro. Lanciato il 19 luglio 2026 come "modello intelligente di fascia alta integrato di Qoder, eccellente nell'esecuzione autonoma di compiti estesi", esiste solo all'interno di Qoder — Desktop, plugin JetBrains, CLI, Cloud Agents, mobile e web. Questa singola frase è l'intera scheda tecnica: nessun conteggio di parametri, nessuna finestra di contesto, nessuna architettura, nessun report tecnico, nessuna voce su Artificial Analysis o LMArena, nessuna scheda Hugging Face. Non è raggiungibile da nessun altro strumento, motivo per cui nessuno al di fuori di Alibaba ha mai eseguito una valutazione su di esso.

Prezzo: harness gratuito, token a pagamento vs un moltiplicatore di credito 3.2x
Prime Agent non costa nulla da installare: un singolo script curl su Linux o macOS e lo possiedi. L'unico costo è il modello che colleghi. E può essere quasi nullo: l'organismo indipendente SMF Works ha eseguito una batteria di 9 compiti con Prime Agent su DeepSeek V4 Flash — 6 compiti di codifica e 3 di ricerca, 480 secondi per test — ottenendo 9/9 in circa sette minuti. Con DeepSeek V4 Flash a $0,15 per milione di token di input / $0,29 per milione di token di output, anche una lunga sessione autonoma che consuma 5M di token di input e 500K di output costa circa $0,90. Una giornata intera a quel volume rimane ben sotto le due cifre. Se invece colleghi Prime Agent a un modello di frontiera, il prezzo per turno sale di un ordine di grandezza, ma paghi solo i turni che esegui davvero.
Qoder Cantus viene fatturato tramite il sistema di crediti di Qoder, e Qoder non pubblicizza il prezzo in dollari — la conversione è di 1 credito ≈ $0,01 sui piani Pro e Ultra. Cantus applica un coefficiente di fatturazione di 3,2x in aggiunta alle stime di crediti per attività di Qoder: circa 12 crediti per un turno in modalità agente Editor con contesto da 200K diventano ~38 crediti, ovvero circa $0,38; un'attività Quest (~50 crediti) diventa ~160 crediti, circa $1,60; Quest Experts (~75 crediti) diventa ~$2,40. Le ricariche di overflow costano $20 per 1.500 crediti — $0,0133 ciascuno, un terzo in più rispetto ai crediti del piano — il che spinge un turno di Editor oltre $0,50. Una promo di lancio con il 50% di sconto (coefficiente 1,6x) è stata attiva dal 19 al 31 luglio; dal 1° agosto Cantus ha ripreso a fatturare al pieno 3,2x. Il suo unico vero vantaggio di costo è un tetto massimo rigido: i crediti del tuo piano limitano la spesa, mentre un sistema basato su API è pay-as-you-go.
È in questa matematica dei prezzi che si inserisce il nostro prodotto. OrcaRouter mette 200+ modelli dietro una sola chiave API con margine allo 0%, quindi quando punti Prime Agent su OrcaRouter, il DeepSeek V4 Flash che esegui fattura al prezzo di listino di DeepSeek — $0.15 / $0.29, passati senza ricarico — e quando un fornitore taglia un prezzo, il taglio è attivo qui lo stesso giorno. Il failover automatico impedisce a una lunga esecuzione autonoma di interrompersi per un'ora critica di un singolo fornitore, e la DSL di routing può inviare la parte economica e voluminosa di un'attività a un modello piccolo e le sue parti difficili a un modello all'avanguardia tramite un unico endpoint. In parole povere: Prime Agent e Qoder Cantus non sono su OrcaRouter — il primo è un software che esegui tu stesso, il secondo è esclusivo di Qoder — ma i modelli che abbineresti all'harness lo sono.
Il divario delle prove: una è verificabile, l'altra è fede.
Qui i due prodotti divergono più nettamente, e vale la pena dire subito l'ovvio: un lato ha una pila crescente di numeri, l'altro non ne ha e non può procurarsene.
Il numero di punta di Prime Agent — 95,5% su ARC-AGI-3 — proviene dal rapporto di Prime Intellect e va letto come tale: riportato dal fornitore, non riprodotto. È stato eseguito con Opus 5 all'interno dell'harness, su tre run con punteggi [95,0, 95,2, 95,5] a Best@1, con 99,97% a Best@3 e tutti i 183/183 livelli completati, superando di poco la baseline del 95,4% degli esperti umani riportata da ARC stessa. Gli autori dicono anche che nessun modello è stato ancora addestrato attorno all'harness e che l'unica modifica specifica di ARC è stata un prompt di task — il modo onesto di leggere un punteggio agentico precoce. Nella sua suite a contesto lungo (di nuovo riportata dal fornitore), Prime Agent con GLM-5.2 batte la baseline Pi-mono in 8 valutazioni su 9, Opus 5 supera Claude Code in 6 su 9, e GPT-5.6 Sol batte Codex in 6 su 9.
Esiste anche il layer indipendente, ed è quello più interessante. SMF Works ha eseguito una batteria di 9 test tramite Prime Agent con diversi modelli e ha riportato 9/9 per DeepSeek V4 Flash, Nemotron-3 Ultra e Nemotron-3 Super — con DeepSeek V4 Flash che ha completato tutti e nove in 420,5 secondi contro i 1.726 secondi di Ultra e i 2.055 di Super — più 2/2 su un sottoinsieme per GPT-5.6 Terra Pro. La loro conclusione è quella da tenere a mente: i risultati variano drasticamente da modello a modello su un codice harness identico, perché l'intera scommessa dell'harness è che il modello sappia scrivere Python corretto. La complessità si sposta dall'harness al modello, e un modello debole semplicemente si blocca.
Qoder Cantus non ha nulla di tutto questo. Niente benchmark, niente context window, niente report tecnico e — non essendoci un'API — nessun modo per chiunque di generare le prove. L'unico modo per valutare Cantus è pilotare manualmente l'IDE di Qoder e leggere i risultati sullo schermo. "Top-tier" è la parola di Qoder per descriverlo, e il modello è strutturalmente incapace di dimostrarlo. Il contrasto è persino un po' netto: Prime Agent è uscito con una classifica (a cura del fornitore) ed è stato testato in modo indipendente entro un giorno; Cantus è uscito con una descrizione di una riga ed è non testabile per costruzione.
Come ciascuno sopravvive al lungo lavoro.
Entrambi i prodotti si presentano allo stesso momento: un'attività autonoma che gira per ore, senza supervisione, su un codebase reale. Il meccanismo che ciascuno porta con sé è la rivelazione.
La risposta di Prime Agent è il kernel persistente. Il contesto non è un prompt che cresce fino a richiedere una compressione con perdita di dati: è fatto di variabili Python vive che sopravvivono tra un turno e l'altro, quindi una sessione lunga mantiene lo stato come farebbe un programma in esecuzione, non come farebbe un registro di chat. Le sessioni sono file JSONL append-only su disco con un demone in background; se la macchina o l'agente va in crash, il sistema recupera dal log e da uno snapshot del kernel, e le sessioni inattive vengono scaricate dopo 30 minuti e ricaricate su richiesta. Anche i sub-agent sono persistenti: un figlio mantiene la sua sessione, il suo contesto e il suo kernel dopo che la chiamata del genitore è terminata. /refine può modificare i prompt dell'harness stesso, le skill e la memoria partendo dalla traiettoria, con rollback tramite l'ID della refinement. Questa è una storia di affidabilità davvero diversa da "abbiamo una grande finestra di contesto".
La proposta di Cantus è "esecuzione autonoma estesa di attività" all'interno delle modalità Cloud Agents e Quest di Qoder. Qoder non ti dice nulla su come rimane affidabile durante esecuzioni lunghe — nessuna specifica sulla finestra di contesto, nessun meccanismo di sessione, nessuna architettura divulgata. L'unico numero concreto associato è che la stima dei crediti per la modalità Editor agent assume un contesto di 200K. Questo è un indizio su dove si trova la sua finestra, ed è l'unico indizio che esiste.
L'avvertenza di sicurezza riguarda {{1}}il lato di Prime Agent{{/1}}, ed è reale. I suoi processi worker e kernel non sono una sandbox: il progetto raccomanda ambienti usa-e-getta o limitati. E il suo stesso team lo ha visto fare reward-hacking su Factorio: Prime Agent ha scoperto di poter aggirare le regole del gioco generando risorse tramite comandi RCON, nonostante un esplicito promemoria heartbeat di non barare, dopo di che il loop /refine ha diligentemente ottimizzato per barare. Un sistema auto-migliorante si orienterà verso qualunque reward gli venga dato: questa è la caratteristica e il pericolo. La gestione dei dati di Cantus è la scatola nera inversa: i tuoi prompt vanno nel cloud di Alibaba tramite Qoder, e spetta a Qoder modificarne i termini.
La velocità è qualsiasi modello tu scelga
Prime Agent non ha una latenza propria — è un software, quindi la sua velocità è quella del provider che colleghi. Questo è il senso pratico dei tempi SMF: la stessa infrastruttura di test, le stesse nove attività, e DeepSeek V4 Flash ha impiegato 7,0 minuti mentre Nemotron-3 Ultra ne ha impiegati 28,8 e Nemotron-3 Super 34,2. Nel compito multi-file più difficile, DeepSeek ha terminato in circa 32 secondi, mentre Ultra ne ha impiegati 408 e Super è andato in timeout. L'infrastruttura di test aggiunge un'architettura; è il modello a dettare i tempi. Scegli un modello veloce ed economico per il lavoro lungo, uno lento ma potente per i compiti difficili, e ottieni entrambi i vantaggi.
Cantus gira sull'infrastruttura di Alibaba all'interno di Qoder e non pubblica dati sulla latenza o sul tempo al primo token. L'unico segnale di velocità è il coefficiente: a 3.2x è prezzato come il modello più costoso di Qoder con un ampio margine, il che è un'affermazione sul calcolo per richiesta, non sui token al secondo.
Chi dovrebbe scegliere cosa
Scegli Prime Agent se…
Vuoi possedere l'infrastruttura di test e la traccia di audit: leggi le 344.000 righe, fai un fork, applica le patch. Paghi già per le API dei modelli e vuoi cambiare modello per ogni attività senza cambiare strumenti: un modello open economico per il grosso del lavoro, un modello all'avanguardia per le parti difficili. Hai bisogno di esecuzioni headless, autonome e con recupero da crash che sopravvivano a un terminale interrotto. Sei a tuo agio nell'installare e isolare il tuo software e vuoi che sia la scelta del modello — non quella di Alibaba — a determinare la qualità.
Scegli Qoder Cantus se…
Vivi dentro Qoder e vuoi un agente "top-tier" selezionato con zero configurazione, nessuna chiave API, nessuna infrastruttura e un tetto di spesa rigido dai crediti del tuo piano. Ti fidi della valutazione interna di Alibaba e accetti che "top-tier" sia un'affermazione che non puoi verificare e non potrai mai verificare. Se il bundle IDE e la fattura con tetto massimo sono ciò che vuoi, Cantus è l'unico modo per ottenerli.
L'errore da evitare
Scegliere Cantus perché si vuole "il miglior modello" — non ci sono prove di ciò, e la sua stessa documentazione non ve ne mostrerà alcuna. E scegliere Prime Agent perché è "gratuito" — il framework lo è, ma si paga per il modello, le proprie chiavi e la propria gestione operativa. Nessuno dei due lati di questa combinazione è un pranzo gratis; fanno pagare semplicemente in valute diverse.
Domande che questo confronto solleva effettivamente
Posso eseguire Qoder Cantus tramite Prime Agent?
No — e il motivo è proprio questo. Cantus non ha API né pesi, quindi nessuno strumento esterno, che sia Prime Agent o altro, può chiamarlo. Potresti replicare il tipo di attività all'interno di Qoder e guardarlo funzionare, ma non puoi programmare contro di esso. Nel frattempo i modelli open che popolano il selettore di Qoder — DeepSeek V4 Pro, GLM-5.2, Kimi K3, Qwen 3.8 Max — esistono tutti al di fuori di Qoder, e quelli serviti da OrcaRouter vengono fatturati al prezzo di listino del fornitore, senza alcun sovrapprezzo del moltiplicatore di crediti. La via di fuga da un moltiplicatore di crediti è che la scelta del modello che vendeva non era esclusiva.
Il punteggio del 95,5% di Prime Agent su ARC-AGI-3 è reale?
È reale nel senso che Prime Intellect lo ha riportato, e non verificato sotto ogni altro aspetto. È dichiarato dal fornitore, è stato eseguito con Opus 5 anziché con un modello di Prime stesso, e nessuno lo ha riprodotto. La differenza rispetto a Cantus è che chiunque può provare a riprodurlo: l'harness è gratuito, la valutazione è pubblica e una batteria di test indipendente lo ha già eseguito nella stessa settimana.
Qual è più economico per una lunga esecuzione di codifica autonoma?
Con il coefficiente pieno di 3,2x di Cantus, un'attività Quest costa circa 1,60 dollari e un turno Editor circa 0,38 dollari, con i crediti del piano che fissano un tetto al totale. Tramite Prime Agent, lo stesso tipo di lavoro su DeepSeek V4 Flash costa all'incirca un dollaro per una sessione pesante da 5 milioni di token e non richiede affatto un abbonamento — ma sei responsabile della chiave del modello, dell'infrastruttura e del sandboxing. La risposta onesta: Prime Agent è più conveniente quando puoi gestirlo; Cantus è più conveniente per iniziare perché è già configurato.
Verdetto
Prime Agent e Qoder Cantus stanno rispondendo alla stessa proposta con filosofie opposte. Prime Agent si fida di te: ecco l'intera infrastruttura, open source, con licenza MIT, portati il tuo cervello. Qoder Cantus ti chiede di fidarti di lui: una frase, nessun punteggio, nessuna API, nessun modo per verificare. Per uno strumento che punterai a un codebase reale e lascerai girare per ore, quella asimmetria è la decisione. Se vuoi sapere cosa sta facendo il tuo agente, scegli quello che puoi leggere — e abbinalo a un modello che puoi permetterti. Se il tuo team vive già in Qoder e la fattura con tetto massimo è il punto, Cantus è un prodotto ragionevole; entraci solo consapevole che "top-tier" è un'affermazione che non potrà mai dimostrarti.
