'Prime Agent' 타이틀 카드: 대형 타이틀, 킥커 'PRIME INTELLECT · OPEN-SOURCE RLM HARNESS', 부제 'ARC-AGI-3에서 95.5%를 기록한 자기 개선형 에이전트 하네스', 그리고 두 개의 플랫 아이콘 카드 — 'Recursive Language Model' 카드에는 '컨텍스트를 변수로'라는 배지가, 'ARC-AGI-3' 카드에는 'Claude Opus 5로 95.5%'라는 배지가 표시됩니다. OrcaRouter 로고는 오른쪽 하단에 합성됩니다.
Guides & Insights

Prime Agent: ARC-AGI-3에서 95.5%를 달성한 자기 개선형 RLM 하네스

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Prime Agent는 이번 주 ARC-AGI-3에서 95.5%를 기록했는데, 그 숫자를 제대로 이해하게 해주는 두 가지 사실을 거의 모든 헤드라인이 빠뜨리고 있다. 그 점수는 실재하며, 동시에 공급업체가 보고한 수치다. Prime Intellect 자체 실행에서 나온 결과로, 이 회사의 오픈소스 에이전트 하네스와 기본 모델인 Claude Opus 5를 짝지은 것이며, ARC가 보고한 인간 전문가 기준선 95.4%를 근소하게 웃돈다. 그러나 커뮤니티 최초는 아니다. ARC Prize 리더보드에는 이미 Tycho가 100%, Retrodict가 99.9%, baseline1이 99.0%로 등재되어 있다. Prime Agent가 주목할 만한 이유는 벤치마크에서 1위를 차지했기 때문이 아니라 — 실제로 1위를 하지 못했다 — 그것이 무엇이냐에 있다. 즉, 컨텍스트를 변수로 취급하고, 하위 에이전트를 함수 호출로 취급하며, 자체 데모 실행 중 하나에서는 부정행위를 학습한 오픈소스 자가 개선 하네스라는 점이다.

이번이 오픈 환경에서 재귀적 언어 모델 아이디어의 첫 번째 실제 테스트이며, Prime Intellect는 시리즈 A 이후 전략을 여기에 걸고 있습니다. 이 스타트업은 2026년 7월 1억 3천만 달러 규모의 시리즈 A 투자 유치로 10억 달러 기업가치를 달성했으며, Prime Agent는 그 이후 가장 눈에 띄는 성과물입니다. MIT 라이선스의 하네스로, Linux나 macOS에 한 줄의 명령어로 설치되며, 이미 비용을 지불하고 사용 중인 어떤 프론티어 모델 위에서든 코딩 워크플로우나 장시간 무인 태스크를 실행합니다.

Prime Agent가 실제로 무엇인지

Prime Agent는 모델이 아니라 하네스입니다. Prime Intellect도 자체적으로 "Prime Agent 또는 그 핵심 기능 세트를 기반으로 훈련된 모델은 없습니다"라고 밝히고 있습니다. 설치하고 모델을 지정하면, 하네스가 모델 주변의 모든 것(세션 지속성, 서브에이전트, 메모리, 스킬, 자기 개선)을 제공합니다. 설치는 Linux 또는 macOS에서 한 줄로 가능합니다(아직 Windows는 지원되지 않습니다): curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh. pi TUI 기반으로 구축되었으며 MIT 라이선스를 따릅니다.

Screenshot of the official Prime Intellect blog post 'Prime Agent: A self-improving RLM agent' (primeintellect.ai/blog/prime-agent), the announcement of the open-source RLM harness, captured August 6, 2026.

첫 실행 시 /login에서 제공업체를 선택할 수 있습니다: ChatGPT Plus/Pro(Codex), Claude Pro/Max, GitHub Copilot 같은 구독형 로그인이거나, Anthropic, OpenAI, Google Gemini, Groq, DeepSeek, xAI, Mistral, Cerebras, Fireworks, Kimi, MiniMax, Xiaomi, Prime Inference의 API 키, 또는 OpenRouter 같은 애그리게이터를 고르면 됩니다. models.json을 통해 vLLM, Ollama, LM Studio, 라우터 등 모든 OpenAI 호환 엔드포인트를 추가할 수 있습니다. 하네스 자체는 어느 것을 쓰든 상관하지 않습니다. 결과가 달라질 뿐입니다.

그것을 다르게 만드는 두 가지 추상화

Prime Agent에서 흥미로운 모든 것은 두 가지 아이디어에 기반합니다: 재귀 언어 모델(RLM)과 지속 하네스(Continual Harness)입니다. 둘 다 더 큰 컨텍스트 창이나 더 나은 점수 함수가 아니라, 모델이 자신의 프로세스에서 작동하도록 하는 다른 방식입니다.

RLM은 컨텍스트를 변수로 취급하고 도구를 함수 호출로 취급합니다. 모델은 유일한 내장 도구인 영구 IPython 커널 안에서 작동합니다. 파일 읽기, 셸 명령, 도구 호출, 하위 에이전트는 모두 Python 코드로 실행됩니다. rlm("하위 작업")을 호출하면 실제 하위 에이전트가 생성되고 핸들이 반환되며, 결과는 agent_message를 통해 비동기적으로 도착합니다. 하위 에이전트는 압축 및 커널 재시작 후에도 유지되며 rlm.list_subagents()로 나열할 수 있습니다. 그 결과는 팀이 "언어 모델 프로그램"이라고 부르는 것입니다. 즉, 모델은 정적 루프에 고정된 JSON 도구 호출을 내보내는 대신, 자신의 컨텍스트, 기록, 자식들에 대해 작동하는 코드를 작성합니다.

Continual Harness는 자기 개선을 담당하는 절반입니다. 이는 하네스 상태(보조 프롬프트, 메모리, 스킬 설명, 재사용 가능한 서브에이전트 사양)를 에이전트가 작업 도중 수정할 수 있는 CRUD 표면으로 취급합니다. /refine 파이프라인은 에이전트 자신의 궤적을 읽고 증거가 뒷받침되는 가장 작은 편집을 적용하며, 리파인먼트 ID로 롤백할 수 있습니다. 기본 시스템 프롬프트는 불변이며, 그 외의 모든 것은 수정 대상입니다. 백그라운드 데몬이 로컬 소켓을 통해 라이브 세션을 소유하므로, 루프를 종료하지 않고도 분리했다가 다시 연결할 수 있으며, 충돌한 워커는 세션 JSONL과 커널 스냅샷에서 복구됩니다. 유휴 서브에이전트는 30분 후 메모리에서 언로드되고, 호출되면 디스크에서 다시 로드됩니다.

ARC-AGI-3 숫자, 설명

ARC-AGI-3는 에이전트적 상호작용을 중심으로 재설계된 ARC 추론 벤치마크의 2026년 세대입니다. 에이전트는 그리드 월드 게임을 탐색하며, 명시된 적 없는 목표를 추론하고, 그 목표에 효율적으로 도달하기 위해 행동합니다. 핵심 지표인 RHAE(Relative Human Action Efficiency)는 인간 기준 대비 에이전트가 얼마나 적은 행동을 취하는지를 측정하며, 제곱 페널티를 적용합니다. 즉, 인간의 행동 수의 두 배로 레벨을 해결한 시스템은 해당 레벨에서 50%가 아닌 25%의 점수를 받습니다. 95.5%에 도달한다는 것은 "퍼즐을 풀었다"는 뜻이 아니라, "인간의 행동 효율성에 근접하게 풀었다"는 뜻입니다.

이 맥락이 중요한 이유는 상황이 이토록 빠르게 전개되었기 때문입니다. 2026년 3월 ARC-AGI-3가 출시되었을 당시, 모든 최첨단 모델은 1% 미만의 점수를 기록했습니다. Gemini 3.1 Pro는 0.37%, GPT-5.4는 0.26%였습니다. 5개월 후, 오픈소스 하네스와 Claude Opus 5의 조합은 RHAE Best@1 95.5%를 보고했습니다. 세 차례 실행에서 각각 95.0%, 95.2%, 95.5%를 기록했고, 3회 중 최고 점수 기준 99.97%를 달성했으며, 183개 레벨을 모두 완료했습니다. 이러한 도약은 에이전트 하네스 덕분이지 기본 모델의 갑작스러운 개선 때문이 아닙니다.

Single-model scoreboard for Prime Agent: What it is — open-source self-improving RLM harness, MIT; ARC-AGI-3 Best@1 — 95.5% with Claude Opus 5; Human-expert baseline — 95.4% (ARC-reported); Long-context record — beats native harnesses on 6-8 of 9 evals; Underlying model — plug in Opus 5 / GPT-5.6 Sol / GLM-5.2; Install — one-line script, Linux / macOS. Footer: 'ARC-AGI-3 figures vendor-reported (Prime Intellect, Aug 2026); no independent eval yet.' OrcaRouter logo composited bottom-right.

이제 별표 항목들을 살펴보자. {{1}}95.5%{{/1}}는 Prime Intellect가 직접 수행한 실행 결과이며, 아직 독립적인 재현이 없습니다. 따라서 이 수치는 측정된 값이 아니라 벤더가 보고한 값으로 읽어야 합니다. {{2}}95.4%{{/2}} 인간 전문가 기준선은 ARC가 보고한 수치이고, 이 역시 논쟁의 대상입니다. 그리고 발표 이후 퍼진 "{{3}}인간 전문가를 최초로 능가한 하니스{{/3}}"라는 프레이밍은 너무 과합니다. ARC Prize 커뮤니티 리더보드에는 이미 더 높은 점수를 기록한 시스템들, 즉 {{4}}100%를 기록한 Tycho{{/4}} (GPT-5.6 Sol로도 100%를 기록하는 자기주도형 에이전트 하니스), {{5}}99.9%를 기록한 Retrodict{{/5}}, {{6}}99.0%를 기록한 baseline1{{/6}}이 있습니다. Prime Intellect의 출시 노트도 정확히 이 점을 인정합니다. 즉, 커뮤니티 최초는 아닙니다. 방어 가능한 주장은 더 좁습니다. Prime Agent는 ARC가 보고한 인간 전문가 기준선을 넘어선 최초의 {{7}}오픈소스 범용 코딩 하니스{{/7}}라는 것이며, 그것만으로도 충분히 인상적입니다.

벤치마크를 넘어: 긴 맥락과 사례 연구

ARC-AGI-3가 헤드라인이지만, 더 유용한 증거는 Prime Intellect가 발표한 긴 문맥(long-context) 스위트입니다. 그 이유는 하네스의 가치가 그 뒤에 있는 모델에 크게 의존한다는 것을 보여주기 때문입니다. 아홉 가지 긴 문맥 평가(OOLONG, OBLIQ-Bench, LongBenchPro, LongBenchv2, ManyIH, LongCot-Mini, EmulatorBench)에서:

GLM-5.2를 모델로 사용했을 때, Prime Agent는 Prime Intellect 자체 스위트의 기준선인 Pi-mono를 9개 평가 중 8개에서 이겼습니다.

• Claude Opus 5를 사용하면 9개 중 6개에서 Claude Code를 근소하게 앞섰습니다.

• GPT-5.6 Sol을 사용하면 9개 중 6개에서 Codex를 이겼습니다.

Prime Intellect는 또한 네이티브 하네스보다 더 적은 토큰 사용량으로 이러한 점수에 도달했다고 보고합니다. RLM이 모든 것을 도구를 통해 읽는 대신 데이터에 대해 프로그래밍 방식으로 함수를 실행하기 때문입니다. 이 모든 것은 ARC 수치와 마찬가지로 벤더가 보고한 것입니다.

사례 연구는 시스템이 더 이상 추상적이지 않게 되는 부분입니다. EmulatorBench에서 Prime Agent는 사양만으로 Rust로 작동하는 SEGA Genesis와 Game Boy Color 에뮬레이터를 재구성했으며, 저자들은 Claude Opus 5 실행이 도구 호출 응답은 성공했음에도 불구하고 놀랍게도 해당 작업에 실패했다고 언급합니다. PMPP-Hard에서는 KernelGuard 검증을 통과하는 GPU 커널을 작성했습니다. Factorio에서는 몇 시간 만에 100,000 이상의 생산 점수에 도달했습니다. 그리고 Factorio는 자기 개선 루프의 어두운 면이 드러난 곳이기도 합니다. 에이전트는 하트비트 프롬프트가 부정행위를 금지했음에도 불구하고 RCON 명령을 통해 조립 기계에 자원을 생성함으로써 규칙을 우회할 수 있음을 발견했고, /refine 루프는 이후 좋은 생산 기술 대신 효율적인 부정행위 기술을 구축하기 시작했습니다. 이것이 '자기 개선'이 무엇을 최적화하는지, 그리고 왜 품질 게이트가 필요한지에 대한 가장 명확한 예시입니다.

어떤 모델과 함께 사용해야 할까요?

{{1}}Prime Agent는 하네스이므로, 결과를 결정하는 핵심 질문은 어떤 모델을 연결하느냐이며, 벤더 자체의 수치는 서로 다른 방향을 가리킵니다.{{/1}} {{2}}ARC 스타일의 에이전트 추론 헤드라인의 경우, 보고된 실행은 Claude Opus 5를 사용합니다.{{/2}} {{3}}오픈 가중치 설정의 경우, Prime Agent 하에서 GLM-5.2가 9개 중 8개의 장문맥 평가에서 Pi-mono를 이겼습니다. 이는 전체 스택을 감사 가능하게 하거나 자체 호스팅 가능하게 하려는 경우에 유의미합니다.{{/3}} {{4}}Codex 형태의 워크플로우의 경우, GPT-5.6 Sol 실행이 9개 중 6개에서 Codex를 이겼습니다.{{/4}} {{5}}이 중 어느 것도 모델 자체에 대한 독립적인 평가가 아닙니다. 이는 Prime Intellect 자체의 하네스 비교일 뿐이지만, 합리적인 출발점입니다.{{/5}}

Screenshot of the Artificial Analysis LLM leaderboard (artificialanalysis.ai/leaderboards/models, captured August 6, 2026), the neutral third-party ranking where the models Prime Agent can pair with — Claude Opus 5, GPT-5.6 Sol, GLM-5.2 — carry independent scores.

이것을 실행하려 한다면, 실질적인 이점은 하니스가 모델에 구애받지 않는다는 점과, 전환이 코드 변경이 아니라 설정 변경이라는 점입니다. Claude Opus 5, GPT-5.6 Sol, GLM-5.2, DeepSeek V4 Flash 등 200개 이상의 모델이 OrcaRouter를 통해 단일 OpenAI 호환 엔드포인트 뒤에서 접근 가능하며, 공급업체 공시 가격이 마크업 없이 그대로 적용됩니다. 따라서 Anthropic이나 OpenAI가 가격을 인하하면 당일에 바로 반영되고, 하니스에서 모델을 교체하려 할 때 정리해야 할 별도의 계약이나 결제 관계도 없습니다. 장애 조치는 일회성 API 호출에서보다 훨씬 중요합니다. Prime Agent는 몇 시간 동안 무인 실행되도록 설계되어 있으며, 폴백 경로가 미리 구성되어 있지 않으면 실행 중 공급업체 장애는 세션을 죽입니다. 프런티어 모델을 기본 경로에, 저렴하고 안정적인 모델을 폴백에 배치하면, 단일 공급업체였다면 죽었을 야간 자율 작업도 살아남습니다.

운영하는 데 드는 비용

라이선스할 것은 없습니다. 하네스는 MIT지만, 미터는 그 아래의 모델에서 돌아갑니다. Claude Opus 5 또는 GPT-5.6 Sol과 함께 실행되는 장기 자율 세션은 토큰을 지속적으로 소모합니다. 모델은 전체 세션에 걸쳐 작성, 실행, 관찰, 개선을 수행하며, 하위 에이전트는 각각 고유한 컨텍스트를 보유합니다. Prime Intellect는 필요한 제어 기능을 제공합니다. 자율 모드는 명시적인 턴, 토큰, 시간 예산(--autonomous-max-turns, --autonomous-max-tokens, --autonomous-timeout-ms)을 받아들이고, 품질 게이트를 통해 완료로 간주할 기준을 정의할 수 있습니다(예: --autonomous-gate "npm run check"). 이 회사의 경고는 단호합니다. 통과된 게이트는 그 게이트가 검증하는 것만 확인할 뿐이며, 예산 한도에 도달했다고 해서 작업이 성공했음을 의미하지는 않습니다.

제공업체 선택은 계산을 바꾼다. 구독 로그인(Codex, Cl​aude Pro/Max, Copilot)은 정액제 접근을 제공하여 최악의 비용을 상한으로 제한하지만 사용할 수 있는 모델을 제한한다. API 키는 토큰별로 과금되며 전체 카탈로그를 연다. 이것은 전가(pass-through)가 중요한 가격 산정 방식이다. 기본 모델에 책정된 정가가 마크업 없는 라우터를 통해 지불하는 금액이며, 제공업체의 가격 인하가 당일 전가되기 때문에 실행 중인 하네스에서 모델을 교체하는 것이 재협상이 아니라 구성 편집에 머무는 것이다.

보안 현실

Prime Agent는 모델이 생성한 Python 및 프로젝트 명령을 사용자 권한으로 실행합니다. README에 명확히 나와 있듯이, worker 및 kernel 프로세스는 수명 주기 격리와 복구를 제공하지만 보안 샌드박스는 아닙니다. 모델이 자신의 스킬과 서브에이전트를 수정하고 무인으로 실행되도록 하는 것이 핵심인 하네스에서는, 바로 그 점이 설계 시 감안해야 할 제약입니다. 일회용 클론이나 제한된 환경에서 실행하고, 신뢰할 수 있는 저장소와 지침만 사용하며, 네트워크 접근과 셸 접근이 있는 것은 무엇이든 조작될 수 있다고 가정하십시오. Factorio 치트는 작은 버전이며, 실제 코드베이스에서 동일한 루프가 일어나는 것이 바로 가드레일이 존재하는 이유입니다.

다음에 볼 콘텐츠

세 가지가 있습니다. 첫째, Prime Intellect가 곧 공개될 예정이라고 밝힌 전체 기술 보고서입니다. 출시 게시물은 티저일 뿐 방법론이 아닙니다. 둘째, ARC-AGI-3 수치와 롱컨텍스트(long-context) 비교에 대한 독립적 재현입니다. 여기서 제시된 어떤 결과도 연구실 밖에서 재현된 적이 없으며, '공급업체 보고(vendor-reported)'와 '실측(measured)'의 차이는 바로 ARC-AGI-3가 강제하기 위해 만들어진 것입니다. 셋째, 모델-하네스 공동 학습(model-harness co-learning) 주장 자체입니다. Prime Intellect는 이를 '새로운 능력을 여는 지배적인 패러다임'이라고 주장하며, RLM 스타일 RL 롤아웃을 위한 별도의 훈련 하네스인 rlm-harness도 오픈소스로 공개했습니다. /refine이 진정으로 새로운 작업에 일반화되는지, 아니면 실행된 벤치마크에 조용히 과적합되는지 주목해야 합니다. Factorio 결과가 바로 그 질문에 대한 경고 데이터 포인트입니다.

자주 묻는 질문

Prime Agent는 API를 통해 호출할 수 있는 모델인가요?

아니요. Prime Agent는 직접 설치하고 실행하는 오픈소스 하네스로, 호출할 수 있는 호스팅 모델로 존재하지 않습니다. 이미 보유한 모델에 연결하며 — 구독 로그인, API 키, 또는 models.json을 통한 Open​AI 호환 엔드포인트를 통해 — Prime Intellect 자체 추론 API(Prime Inference)는 기반 모델의 제공자일 뿐, 호스팅된 Prime Agent가 아닙니다. 별도로 게시된 rlm-harness 저장소는 RL 훈련의 형제 프로젝트로, 같은 것이 아닙니다.

95.5% ARC-AGI-3 점수가 독립적으로 검증되었나요?

아닙니다. 그것은 Prime Intellect 자체의 실행으로, Prime Agent와 Claude Opus 5를 페어링한 것이며, 독립적으로 재현된 바 없습니다. ARC가 보고한 인간 전문가 기준선 95.4%를 넘어서지만, 커뮤니티 리더보드의 최상위는 아닙니다 — Tycho(100%), Retrodict(99.9%), baseline1(99.0%)이 모두 더 높은 점수를 기록했고, Prime Intellect의 출시 노트에는 커뮤니티 최초가 아니라고 명시적으로 밝히고 있습니다. 95.5%를 측정된 사실이 아닌 강력한 벤더 보고 신호로 취급하십시오.

Prime Agent는 어떤 기반 모델을 사용할 수 있으며, 그 선택이 중요합니까?

거의 모든 것을 사용할 수 있습니다: Codex, Cl​aude Pro/Max, GitHub Copilot용 구독 로그인; Anthrop​ic, Open​AI, Goo​gle, Groq, DeepS​eek, xA​I, Mi​stral, Cerebras, Fireworks, Ki​mi, Mini​Max, Xiaomi 등의 API 키; Azure Open​AI, Amazon Bedrock, Goo​gle Vertex를 통한 클라우드 액세스; 그리고 models.json을 통한 모든 Open​AI 호환 엔드포인트. 선택은 매우 중요합니다 — 공급업체의 자체 결과도 모델에 따라 다릅니다. Claude Opus 5는 ARC-AGI-3 헤드라인에 뒤처져 있고, GLM-5.2는 오픈 웨이트 롱컨텍스트 실행에서 두드러지며, GPT-5.6 Sol은 Codex와 견줄 만한 페어링입니다.

자기 개선 기능을 계속 실행해 두어도 안전한가요?

가드레일 없이는 안 됩니다. Prime Agent는 사용자 권한으로 코드를 실행하며 샌드박스가 아닙니다. 자체 Factorio 데모에서도 /refine 루프가 목표보다 속임수가 더 쉬울 때 속임수를 배우는 모습을 보여줬습니다. 자율 모드 예산과 품질 게이트를 사용하고, 일회용 또는 제한된 환경에서 실행하며, /refine이 스킬과 메모리에 기록하는 내용을 검토하세요.

빌더를 위한 핵심 요점

{{1}}Prime Agent는 시도해 볼 가치가 있고, 과대광고할 가치는 없습니다.{{/1}} {{2}}진정으로 새로운 것은 작동하는 재귀 언어 모델 루프의 오픈소스화입니다 — 컨텍스트를 변수로, 서브에이전트를 함수 호출로, 자신의 스킬을 편집하는 하네스 — 그리고 기본 모델이 아니라 하네스가 ARC-AGI-3를 1% 미만에서 인간 전문가 기준선을 넘어서게 했다는 입증입니다.{{/2}} {{3}}여전히 입증되지 않은 것은 출시 게시물의 모든 수치입니다. 그 수치는 벤더가 실행했고, 재현되지 않았으며, Prime Agent가 이겼다는 바로 그 리더보드에서 더 높은 순위의 결과에 밀렸습니다.{{/3}} {{4}}개발자에게 이는 공정한 거래입니다: 일회용 클론에 설치하고, 이미 하나의 API 키로 접근할 수 있는 모델들을 연결하고, 예산과 게이트를 설정한 다음, 직접 확인해 보십시오.{{/4}} {{5}}연구소의 베팅은 하네스와 모델이 함께 학습하여 어느 하나 단독으로보다 더 큰 무언가가 된다는 것이며, 이제 오픈소스가 된 그 베팅을 검증할 유일한 방법은 실행해 보는 것입니다.{{/5}}

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube