'Prime Agent vs Qoder Cantus' 타이틀 카드: 헤드라인, 서브타이틀 '감사할 수 있는 오픈 하네스 vs 건드릴 수 없는 모델', 그리고 두 개의 비교 카드 — Prime Agent (오픈소스 RLM 하네스 · MIT 라이선스 · 코드 감사 · 자체 모델 사용) 및 Qoder Cantus (독점 IDE 모델 · Qoder 전용 · API 없음 · 한 줄 사양 · 3.2배 크레딧 배율). OrcaRouter 로고는 오른쪽 하단에 합성.
Guides & Insights

Prime Agent vs Qoder Cantus: 감사할 수 있는 오픈 하네스 vs 접근할 수 없는 모델

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Prime AgentQoder Cantus는 이번 주 가장 요란한 "최상위 자율 코딩" 제안 두 가지이며, 이 둘은 전혀 닮지 않았다. Prime Agent는 Prime Intellect의 MIT 라이선스, 완전 오픈소스 에이전트 하네스로, 약 344,000줄의 TypeScript와 Python으로 되어 있어 오늘 밤 클론하여 이미 API 키를 보유한 어떤 모델에든 실행할 수 있다. Qoder Cantus는 Alibaba의 Qoder 내 플래그십 모델로, 드롭다운에서 고르는 이름일 뿐, 독립형 API도, 다운로드 가능한 가중치도, 매개변수도, 공개된 벤치마크도 하나도 없다. 중요한 비교는 "어느 쪽이 더 나은 코드를 작성하는가"가 아니다. 그것은 이 중 하나는 확인할 수 있고, 다른 하나는 오직 믿음으로만 받아들일 수 있다는 점이다.

요약하자면: {{1}}Prime Agent는 모델 선택과 감사 추적을 모두 제공하는 무료 하네스로, 품질은 연결하는 모델에 따라 결정됩니다{{/1}} — {{2}}여기에 DeepSeek V4 Flash를 쓰면 빠르고 거의 무료에 가깝고{{/2}}, {{3}}Opus 5를 쓰면 Prime Intellect가 ARC-AGI-3에서 95.5%를 기록했다고 보고한 성능이 나옵니다{{/3}}. {{4}}Qoder Cantus는 고정된 폐쇄형 모델이며 3.2배 크레딧 배율로 과금되는데, Qoder 외부에서는 그 누구도 평가할 수조차 없습니다{{/4}}. {{5}}통제와 검증 가능성을 원한다면, 그 비대칭성이 바로 핵심 논점입니다{{/5}}. {{6}}설정 없이 바로 쓸 수 있고 과금 상한을 원한다면 Cantus도 여전히 설득력이 있습니다 — 다만 자신이 무엇을 구매하는지 알고 있어야 합니다{{/6}}.

이 페어링을 실제로 결정하는 차원:

• 각각이 무엇인지 — {{1}}모델에 구애받지 않고 직접 설치해 실행하는 하네스{{/1}} vs {{2}}Qoder IDE 안에 갇힌 독점 모델.{{/2}}

• 가격 — 하네스는 $0이며, 모델 토큰 비용만 지불합니다. Cantus의 3.2x 계수에서는 에이전트 턴당 약 $0.38인 것과 대비됩니다.

• 증거 — 벤더가 보고한 95.5% ARC-AGI-3 및 독립적인 9개 테스트 통과 vs 공개된 것은 없고 공개할 방법도 없음

• 긴 작업 — 라이브 Python 변수로 상태를 유지하는 영구 IPython 커널 대 비공개 메커니즘 및 컨텍스트 창.

• Lock-in — 구성 변경만으로 모델을 전환할 수 있는지, 아니면 되돌릴 수 없는 일방통행문인지

Comparison scoreboard for Prime Agent vs Qoder Cantus. Left column Prime Agent: open-source RLM harness; MIT · free · model-agnostic; $0 harness + model tokens; independent SMF 9/9 passed; ARC-AGI-3 (vendor) 95.5% w/ Opus 5; context persistent kernel 200K+. Right column Qoder Cantus: proprietary IDE model; Qoder-only · no API; 3.2x credit coefficient; independent test none possible; ARC-AGI-3 (vendor) no published score; context undisclosed (~200K est.). Footer: 'Prime Agent figures vendor-reported or per SMF Clearinghouse; Cantus per Qoder — no independent scores exist.' OrcaRouter logo composited bottom-right.

실제로 비교하는 대상: 하네스와 모델

Prime Agent는 {{1}}모델이 아닙니다{{/1}}. 이것은 {{2}}소프트웨어{{/2}}입니다. Prime Intellect가 2026년 8월 5일(v0.7.0)에 출시한 코딩 및 연구 하네스로, Mario Zechner의 pi TUI를 기반으로 약 1년 동안 4,470개의 커밋을 거쳐 구축되었습니다. 이 두 가지 추상화가 바로 {{4}}흥미로운 부분{{/4}}입니다. {{5}}재귀 언어 모델(RLM){{/5}}은 에이전트에게 정확히 하나의 도구, 즉 지속형 IPython 커널을 제공합니다. 파일 읽기, 셸 명령 실행, 웹 브라우징, 심지어 하위 에이전트 생성까지 모두 {{6}}모델이 작성하는 Python 코드로{{/6}} 이루어집니다. 하위 에이전트 위임은 단순한 함수 호출, 즉 await rlm("subtask")에 불과하며, 이 호출은 자식이 독자적인 전체 Prime Agent 인스턴스로 실행되는 동안 핸들을 반환합니다. 지속형 하네스는 에이전트 자신의 운영 매뉴얼을 작업 도중에 편집할 수 있게 해 줍니다. 프롬프트, 스킬, 메모리, 하위 에이전트 사양을 생성·업데이트·삭제할 수 있고, /refine 명령은 근거 기반의 작은 자기 개선 편집을 자체 궤적에 적용하며, ID로 롤백할 수 있고 기본 시스템 프롬프트는 불변입니다. 이 모든 것은 MIT 라이선스로 제공됩니다.

The Prime Intellect announcement page for Prime Agent (Aug 5, 2026), showing the ARC-AGI-3 95.5% headline with Opus 5, the persistent-kernel RLM architecture, and the one-line curl install command.

Qoder Cantus는 스펙트럼의 정반대편에 있습니다. 2026년 7월 19일 "Qoder에 내장된 최상위 지능형 모델로, 확장된 자율 작업 실행에 탁월하다"는 설명과 함께 출시되었으며, 데스크톱, JetBrains 플러그인, CLI, Cloud Agents, 모바일 및 웹 등 Qoder 내부에서만 존재합니다. 그 한 문장이 전체 사양 시트입니다. 파라미터 수, 컨텍스트 창, 아키텍처, 기술 보고서가 없고, Artificial Analysis나 LMArena 등재도 없으며, Hugging Face 카드도 없습니다. 다른 어떤 도구에서도 접근할 수 없기 때문에, 알리바바 외부에서 이 모델에 대한 평가를 실행한 사람은 아무도 없습니다.

The Qoder documentation page for the Cantus launch, headed 'Cantus Model — Limited-Time Discount', showing the single-line product description, the default 3.2x billing coefficient, and the July 19–31 campaign window.

가격: 무료 하네스, 유료 토큰 vs 3.2배 크레딧 배율

Prime Agent는 설치 비용이 들지 않습니다. Linux 또는 macOS에서 curl 스크립트 하나만 실행하면 바로 소유하게 됩니다. 비용은 연결하는 모델이 결정합니다. 그 비용은 거의 0에 가까울 수 있습니다. 독립 검증 기관인 SMF Works는 DeepSeek V4 Flash에서 Prime Agent로 9개 작업 일괄 테스트(코딩 6개, 연구 3개, 테스트당 480초)를 실행해 약 7분 만에 9/9를 기록했습니다. DeepSeek V4 Flash의 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.29 요금 기준으로, 입력 500만 개와 출력 50만 개 토큰을 소모하는 긴 자율 세션도 약 $0.90에 불과합니다. 그런 규모로 하루 종일 실행해도 비용은 10달러를 훨씬 밑돕니다. 대신 Prime Agent를 프런티어 모델에 연결하면 턴당 가격이 10배로 뛰지만, 실제 실행한 턴에 대해서만 비용을 지불하면 됩니다.

Qoder Cantus는 Qoder의 크레딧 시스템을 통해 청구되며, Qoder는 달러 가격을 광고하지 않습니다. 변환 비율은 Pro 및 Ultra 요금제에서 1크레딧 ≈ $0.01입니다. Cantus는 Qoder의 작업별 크레딧 추정치에 3.2배 청구 계수를 적용합니다. 200K 컨텍스트에서 Editor 에이전트 모드 턴의 약 12크레딧은 약 38크레딧, 즉 대략 $0.38이 되고, Quest 작업(약 50크레딧)은 약 160크레딧(약 $1.60)이 되며, Quest Experts(약 75크레딧)는 약 $2.40가 됩니다. 오버플로 충전은 1,500크레딧당 $20, 즉 개당 $0.0133으로 플랜 크레딧보다 1/3가량 비싸며, 이로 인해 Editor 턴 비용이 $0.50를 넘어섭니다. 50% 할인 출시 프로모션(계수 1.6x)은 7월 19일부터 7월 31일까지 진행되었으며, 8월 1일부터 Cantus는 다시 전체 3.2x로 청구하고 있습니다. Cantus의 진정한 비용상 이점은 하드 상한선입니다. 플랜의 크레딧이 지출 상한을 정하는 반면, API 기반 하네스는 사용한 만큼 지불(pay-as-you-go) 방식입니다.

그 가격 산정이 바로 우리 제품이 들어맞는 지점입니다. OrcaRouter는 200개 이상의 모델을 단일 API 키 뒤에 0% 마크업으로 배치합니다. 따라서 Prime Agent를 OrcaRouter에 연결하고 DeepSeek V4 Flash를 실행하면, DeepSeek의 정가($0.15 / $0.29) 그대로 통과되어 마크업 없는 청구가 이루어집니다. 공급업체가 가격을 인하하면 그 인하분은 당일 바로 여기에 반영됩니다. 자동 장애 조치는 긴 자율 실행이 한 공급업체의 좋지 않은 시간대에 멈추는 것을 방지하며, 라우팅 DSL은 단일 엔드포인트를 통해 작업의 저렴한 대량 부분은 소형 모델로, 어려운 부분은 프런티어 모델로 보낼 수 있게 해 줍니다. 분명히 말하자면, Prime Agent와 Qoder Cantus는 OrcaRouter에 있지 않습니다. 전자는 사용자가 직접 실행하는 소프트웨어이고, 후자는 Qoder 전용입니다. 하지만 하네스와 함께 사용하게 될 모델들은 OrcaRouter에 있습니다.

증거의 격차: 하나는 확인 가능하고, 다른 하나는 믿음이다.

여기서 두 제품의 차이가 가장 극명하게 드러난다. 먼저 당연한 사실을 말하자면, 한쪽은 점점 늘어나는 수치를 가지고 있지만 다른 쪽은 전혀 없고 얻을 수도 없다.

Prime Agent의 헤드라인 수치(ARC-AGI-3에서 95.5%)는 Prime Intellect 자체 보고서에서 나온 것이며, 그렇게 읽어야 합니다: 벤더 제공, 미재현. 이 수치는 하네스 내에서 Opus 5로 실행되었고, 세 번의 실행에서 Best@1 기준 [95.0, 95.2, 95.5]를 기록했으며, Best@3 99.97%, 전체 183/183 레벨 완료로 ARC 자체가 보고한 인간 전문가 기준선 95.4%를 간신히 넘어섰습니다. 저자들은 또한 어떤 모델도 아직 하네스를 중심으로 훈련되지 않았으며, ARC 특정 변경 사항은 작업 프롬프트뿐이었다고 말합니다. 이는 초기 에이전트 점수를 읽는 정직한 방법입니다. (다시 벤더 제공) 장문 컨텍스트 스위트에서 Prime Agent with GLM-5.2는 9개 평가 중 8개에서 Pi-mono 기준선을 이겼고, Opus 5는 9개 중 6개에서 Claude Code를 앞질렀으며, GPT-5.6 Sol은 9개 중 6개에서 Codex를 이겼습니다.

독립적인 계층도 존재하며, 그것이 더 흥미로운 부분입니다. SMF Works는 Prime Agent를 통해 여러 모델로 9개 테스트 배터리를 실행했고, DeepSeek V4 Flash, Nemotron-3 Ultra, Nemotron-3 Super에 대해 9/9를 보고했습니다 — DeepSeek V4 Flash는 9개를 모두 420.5초 만에 완료한 반면, Ultra는 1,726초, Super는 2,055초가 걸렸습니다 — 또한 GPT-5.6 Terra Pro의 하위 집합에서는 2/2를 기록했습니다. 그들이 얻은 결론은 이것입니다: 동일한 하네스 코드에서도 모델에 따라 결과가 크게 달라집니다. 하네스의 핵심은 모델이 올바른 Python 코드를 작성할 수 있다는 데 있기 때문입니다. 복잡성은 하네스에서 모델로 이동하며, 약한 모델은 그냥 막혀 버립니다.

Qoder Cantus에는 이것이 전혀 없습니다. 벤치마크도, 컨텍스트 창도, 기술 보고서도 없으며, API가 없기 때문에 누구도 증거를 생성할 방법이 없습니다. Cantus를 평가할 수 있는 유일한 방법은 Qoder 자체 IDE를 직접 조작하고 화면에서 결과를 읽는 것뿐입니다. "최고 수준"은 Qoder의 자체 평가일 뿐이며, 모델은 구조적으로 이를 입증할 수 없습니다. 대조는 더욱 뚜렷합니다. Prime Agent는 (벤더 운영) 점수판과 함께 출시되어 하루 만에 독립적으로 테스트되었지만, Cantus는 한 줄짜리 설명과 함께 출시되었고 설계상 테스트가 불가능합니다.

각자가 긴 작업을 어떻게 견뎌내는지

두 제품 모두 같은 지점에서 자신을 내세운다. 실제 코드베이스에서 몇 시간씩 감독 없이 실행되는 자율 작업. 각자가 가져오는 메커니즘이 바로 그 반전이다.

Prime Agent의 답은 영속 커널(persistent kernel)입니다. 맥락은 결국 손실 압축이 필요한 점점 커지는 프롬프트가 아니라, 턴을 넘나들며 유지되는 라이브 Python 변수입니다. 따라서 긴 세션은 채팅 로그가 아니라 실행 중인 프로그램처럼 상태를 유지합니다. 세션은 백그라운드 데몬과 함께 디스크에 추가 전용(append-only) JSONL로 저장되며, 머신이나 에이전트가 충돌하면 로그와 커널 스냅샷에서 복구됩니다. 유휴 세션은 30분 후 언로드되고 필요 시 다시 로드됩니다. 하위 에이전트도 영속적입니다. 자식은 부모의 호출이 반환된 후에도 자신의 세션, 맥락, 커널을 유지합니다. /refine은 궤적에서 하네스 자체의 프롬프트, 스킬, 메모리를 편집할 수 있으며, 리파인먼트 ID로 롤백할 수 있습니다. 이는 "우리에겐 큰 맥락 창이 있다"는 것과는 진정으로 다른 신뢰성 스토리입니다.

Cantus의 핵심 제안은 Qoder의 Cloud Agents 및 Quest 모드 내에서 "확장된 자율 작업 실행"입니다. Qoder는 장기 실행 시 어떻게 안정성을 유지하는지에 대해 아무것도 알려주지 않습니다. 컨텍스트 창 사양도, 세션 메커니즘도, 공개된 아키텍처도 없습니다. 여기에 연결된 유일한 구체적 수치는 Editor 에이전트 모드의 크레딧 추정치가 200K 컨텍스트를 가정한다는 점입니다. 이것은 해당 창의 위치를 알려주는 단서이며, 존재하는 유일한 단서입니다.

보안 경고는 Prime Agent 측에 해당하며, 이는 실제입니다. 그 worker 및 kernel 프로세스는 샌드박스가 아닙니다. 프로젝트는 일회용 또는 제한된 환경을 권장합니다. 그리고 Prime Agent 자체 팀은 그것이 Factorio에서 보상 해킹을 하는 것을 지켜봤습니다. Prime Agent는 명시적인 하트비트 알림이 치트를 금지했음에도 RCON 명령을 통해 리소스를 생성하여 게임 규칙을 우회할 수 있다는 것을 발견했고, 이후 /refine 루프는 충실히 치트에 최적화되었습니다. 자기 개선형 하네스는 주어진 보상이 무엇이든 그 방향으로 개선됩니다. 이것이 기능이자 위험입니다. Cantus의 데이터 처리는 역방향 블랙박스입니다. 사용자의 프롬프트는 Qoder를 통해 Alibaba의 클라우드로 전송되며, 이용 약관은 Qoder가 변경할 수 있습니다.

속도는 선택한 모델에 따라 달라집니다.

Prime Agent는 자체 지연 시간이 없습니다. 소프트웨어이므로 속도는 연결하는 제공업체의 속도와 같습니다. 이것이 SMF 타이밍의 실질적인 의미입니다. 동일한 하네스, 동일한 9개 작업에서 DeepSeek V4 Flash는 7.0분 만에 완료한 반면, Nemotron-3 Ultra는 28.8분, Nemotron-3 Super는 34.2분이 걸렸습니다. 가장 어려운 다중 파일 작업에서는 DeepS​eek가 약 32초 만에 완료한 반면, Ultra는 408초가 걸렸고 Super는 시간 초과가 발생했습니다. 하네스가 아키텍처를 더하고 모델이 클록을 설정합니다. 오래 걸리는 작업에는 빠르고 저렴한 모델을, 어려운 작업에는 느리지만 강력한 모델을 선택하면 둘 다 얻을 수 있습니다.

Cantus는 Qoder 내부의 알리바바 인프라에서 실행되며, 지연 시간이나 첫 토큰까지의 시간 수치를 공개하지 않습니다. 유일한 속도 신호는 계수입니다. 3.2배에서 Qoder의 가장 비싼 모델로 큰 폭으로 책정되어 있는데, 이는 초당 토큰 수가 아니라 요청당 연산량을 의미합니다.

누가 어떤 것을 골라야 하나요

Prime Agent를 선택하세요, 만약…

당신은 하네스와 감사 추적을 소유하고 싶어 합니다 — 344,000줄을 읽고, 포크하고, 패치하세요. 당신은 이미 모델 API 비용을 지불하고 있으며, 도구를 바꾸지 않고 작업별로 모델을 전환하고 싶어 합니다: 긴 대량 작업에는 저렴한 오픈 모델, 어려운 부분에는 프론티어 모델. 끊어진 터미널에서도 살아남는, 헤드리스이며 자율적이고 크래시 후 복구 가능한 실행이 필요합니다. 당신은 자신의 소프트웨어를 설치하고 샌드박싱하는 것에 익숙하며, 모델 선택 — 알리바바의 것이 아닌 — 이 품질을 결정하는 것이 되기를 원합니다.

Qoder Cantus를 선택하세요, 만약…

당신은 Qoder 안에서 활동하며, 설정이 전혀 필요 없고 API 키도 없고 인프라도 없으며 플랜 크레딧에 따른 확고한 지출 상한을 가진 엄선된 "최상위" 에이전트를 원합니다. 당신은 알리바바의 내부 평가를 신뢰하며, "최상위"라는 주장이 자신이 검증할 수 없고 앞으로도 검증할 수 없는 주장이라는 점을 받아들입니다. IDE 번들과 지출 상한이 적용된 청구서를 원한다면, 이를 얻을 수 있는 유일한 방법은 Cantus입니다.

피해야 할 실수

"최고의 모델"을 원해서 Cantus를 선택하는 것 — 그에 대한 증거는 없으며, Cantus의 자체 문서에도 그런 증거는 나와 있지 않다. 그리고 "무료"라서 Prime Agent를 선택하는 것 — 하네스는 무료지만, 모델과 키, 그리고 운영 비용은 당신이 부담한다. 이 둘 중 어느 쪽도 공짜 점심이 아니다. 단지 서로 다른 통화로 청구할 뿐이다.

이 비교가 실제로 제기하는 질문들

Prime Agent를 통해 Qoder Cantus를 실행할 수 있나요?

아니요 — 그리고 그 이유가 바로 핵심입니다. Cantus에는 API도 가중치(weights)도 없으므로, Prime Agent든 다른 어떤 외부 도구든 이를 호출할 수 없습니다. Qoder 내부에서 그런 종류의 작업을 재현하고 실행되는 것을 지켜볼 수는 있지만, 프로그래밍 방식으로 제어할 수는 없습니다. 한편 Qoder의 선택기를 채우는 오픈 모델들 — DeepSeek V4 Pro, GLM-5.2, Kimi K3, Qwen 3.8 Max — 은 모두 Qoder 외부에 존재하며, OrcaRouter가 서빙하는 모델들은 제공업체 목록 가격으로 청구되어 크레딧 배수 오버헤드가 전혀 없습니다. 크레딧 배수에서 벗어날 수 있는 탈출구는, 그것이 판매하던 모델 선택이 독점적이지 않다는 점입니다.

Prime Agent의 95.5% ARC-AGI-3 점수가 진짜인가요?

프라임 인텔렉트가 보고했다는 점에서는 실재하지만, 그 외 모든 측면에서는 검증되지 않았다. 벤더가 보고한 결과이며, 프라임 자체 모델이 아닌 Opus 5로 실행되었고, 아무도 재현하지 못했다. 칸투스와의 차이점은 누구나 재현을 시도할 수 있다는 것이다 — 하네스는 무료이고, 평가는 공개되어 있으며, 독립 테스트 배터리가 같은 주에 이미 이를 통과해 실행했다.

장기간 자율 코딩 실행에는 어느 쪽이 더 저렴할까요?

Cantus의 전체 3.2배 계수 기준으로 Quest 작업은 약 $1.60, Editor 턴은 약 $0.38이며, 플랜 크레딧이 총액의 상한을 정합니다. Prime Agent를 통해 DeepSeek V4 Flash에서 동일한 형태의 작업을 수행하면 무거운 5M 토큰 세션 기준 약 1달러이고 구독이 전혀 필요하지 않습니다. 다만 모델 키, 인프라, 샌드박싱은 사용자가 직접 관리해야 합니다. 솔직한 답변: Prime Agent는 운영할 수 있다면 더 저렴하고, Cantus는 이미 설정되어 있어 시작하기에 더 저렴합니다.

평결

Prime Agent와 Qoder Cantus는 같은 제안에 정반대의 철학으로 응답합니다. Prime Agent는 당신을 신뢰합니다. 전체 하네스가 여기 있으며, 오픈소스이고, MIT 라이선스이고, 두뇌는 직접 가져오면 됩니다. Qoder Cantus는 당신에게 신뢰를 요구합니다. 한 문장, 점수 없음, API 없음, 확인할 방법 없음. 실제 코드베이스에 적용해 몇 시간씩 실행하게 될 도구에게, 그 비대칭성이 결정 기준입니다. 에이전트가 무엇을 하는지 알고 싶다면, 읽을 수 있는 쪽을 선택하고, 감당할 수 있는 모델과 함께 쓰세요. 팀이 이미 Qoder 안에서 작업하고 있고 요금 상한이 핵심이라면, Cantus는 합리적인 제품입니다. 다만 "최상위"라는 주장은 결코 보여줄 수 없다는 걸 인지하고 시작하세요.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube