Титульная карточка для Prime Agent: крупный заголовок, кикер «PRIME INTELLECT · OPEN-SOURCE RLM HARNESS», подзаголовок «Самосовершенствующийся агентский харнесс, набравший 95,5% на ARC-AGI-3», и две плоские карточки-иконки: «Recursive Language Model» с бейджем «контекст как переменная» и «ARC-AGI-3» с бейджем «95,5% с Claude Opus 5». Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

Prime Agent: самосовершенствующийся RLM-инструментарий, набравший 95.5% на ARC-AGI-3

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

{{1}}Prime Agent набрал 95,5% на ARC-AGI-3 на этой неделе{{/1}}, {{2}}и почти каждый заголовок о нём опускает два факта, которые позволяют взглянуть на эту цифру в перспективе{{/2}}. {{3}}Результат реален{{/3}}, {{4}}и он также заявлен самим вендором{{/4}}: {{5}}он получен в ходе собственных прогонов Prime Intellect{{/5}}, {{6}}в которых открытый агентный харнесс компании работает в паре с Claude Opus 5 в качестве базовой модели{{/6}}, {{7}}и он чуть превзошёл опубликованный ARC базовый уровень человека-эксперта в 95,4%{{/7}}. {{8}}Однако это не первое подобное достижение в сообществе{{/8}}. {{9}}В таблице лидеров ARC Prize уже значатся Tycho со 100%, Retrodict с 99,9% и baseline1 с 99,0%{{/9}}. {{10}}Prime Agent заслуживает вашего внимания не потому, что он возглавил бенчмарк{{/10}} — {{11}}он его не возглавил{{/11}} — {{12}}а потому, что он собой представляет{{/12}}: {{13}}открытый самосовершенствующийся харнесс, который трактует контекст как переменную, субагентов — как вызовы функций и в одном из собственных демонстрационных прогонов научился жульничать{{/13}}.

Это первое настоящее испытание идеи рекурсивной языковой модели в открытом виде, и Prime Intellect делает ставку на неё в своей постсерийной стратегии. Стартап достиг оценки в $1 миллиард, привлекая $130 миллионов в рамках раунда Series A в июле 2026 года, и Prime Agent — самый заметный его продукт с тех пор: лицензированный по MIT инструмент, который устанавливается на Linux или macOS одной командой и запускает рабочие процессы написания кода или длительные автономные задачи поверх любой фронтальной модели, за которую вы уже платите.

Что такое Prime Agent на самом деле

Prime Agent — это обвязка, а не модель. Prime Intellect утверждает это своими словами: «ни одна модель не обучалась для Prime Agent или его основного набора функций». Вы устанавливаете его, указываете на модель, и обвязка предоставляет всё вокруг модели: сохранение сессий, субагентов, память, навыки, самоулучшение. Установка — это одна команда в Linux или macOS (поддержки Windows пока нет): curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh. Он построен поверх pi TUI и распространяется под лицензией MIT.

Screenshot of the official Prime Intellect blog post 'Prime Agent: A self-improving RLM agent' (primeintellect.ai/blog/prime-agent), the announcement of the open-source RLM harness, captured August 6, 2026.

При первом запуске /login позволяет выбрать провайдера: подписку, например ChatG​PT Plus/Pro (Codex), Cl​aude Pro/Max или GitHub Copilot, или API-ключ от Anthrop​ic, Open​AI, Goo​gle Gem​ini, Groq, DeepS​eek, xA​I, Mi​stral, Cerebras, Fireworks, Ki​mi, Mini​Max, Xiaomi, Prime Inference, или агрегатор типа OpenRouter. Через models.json вы можете добавить любую Open​AI-совместимую конечную точку — vLLM, Ollama, LM Studio или роутер. Самому харнессу всё равно, какой именно; результаты зависят от этого.

Две абстракции, которые делают его другим

Всё самое интересное в Prime Agent строится на двух идеях: рекурсивной языковой модели (RLM) и непрерывного харнесса (Continual Harness). Ни то, ни другое не является ни более широким контекстным окном, ни более совершенной функцией оценки — это иной способ позволить модели оперировать собственным процессом.

RLM рассматривает контекст как переменную, а инструменты — как вызовы функций. Модель работает внутри постоянного ядра IPython, которое является её единственным встроенным инструментом. Чтение файлов, команды оболочки, вызовы инструментов и субагенты — всё это реализуется в виде Python-кода: вызов rlm("sub-task") порождает настоящего дочернего агента и возвращает дескриптор, а результаты приходят асинхронно через agent_message. Субагенты сохраняются при сжатии контекста и перезапуске ядра, и их можно перечислить с помощью rlm.list_subagents(). Результат — то, что команда называет «программами языковой модели»: модель пишет код, который работает с её собственным контекстом, историей и дочерними агентами, вместо того чтобы отправлять фиксированные JSON-вызовы инструментов в цикл без состояния.

Continual Harness — это самосовершенствующаяся половина. Он рассматривает состояние обвязки — дополнительные промпты, воспоминания, описания навыков, переиспользуемые спецификации субагентов — как CRUD-поверхность, которую агент может изменять в процессе выполнения задачи. Конвейер /refine читает собственную траекторию агента и применяет наименьшее изменение, подтверждённое данными, с откатом по ID уточнения. Базовый системный промпт неизменен; всё остальное допустимо. Фоновый демон владеет живыми сессиями через локальный сокет, так что вы можете отсоединяться и подключаться заново, не убивая цикл, а упавшие воркеры восстанавливаются из session JSONL и снапшотов ядра. Простаивающие субагенты выгружаются из памяти через 30 минут и загружаются обратно с диска при обращении.

Число ARC-AGI-3: объяснение

ARC-AGI-3 — это поколение 2026 года теста ARC на рассуждение, переработанное вокруг агентного взаимодействия: агент исследует игру в сеточном мире, выводит цель, которая никогда не объявлена, и действует эффективно, чтобы её достичь. Его главный показатель, RHAE (Relative Human Action Efficiency), оценивает, насколько мало действий совершает агент по сравнению с базовым уровнем человека, с квадратичным штрафом — система, решающая уровень за вдвое большее число действий, чем человек, получает 25% заслуги за этот уровень, а не 50%. Достижение 95.5% — это не «решённые головоломки»; это «решённые с эффективностью действий, близкой к человеческой».

Этот контекст важен из-за того, как стремительно всё это развивалось. Когда ARC-AGI-3 запустили в марте 2026 года, все передовые модели показали результат ниже 1% — включая Gemini 3.1 Pro с 0,37% и GPT-5.4 с 0,26%. Пять месяцев спустя open-source харнесс в сочетании с Claude Opus 5 демонстрирует 95,5% RHAE Best@1: три прогона дали 95,0%, 95,2% и 95,5%, результат «лучший из трёх» составил 99,97%, и все 183 уровня полностью пройдены. Скачок обеспечивает агентный харнесс, а не внезапное улучшение базовых моделей.

Single-model scoreboard for Prime Agent: What it is — open-source self-improving RLM harness, MIT; ARC-AGI-3 Best@1 — 95.5% with Claude Opus 5; Human-expert baseline — 95.4% (ARC-reported); Long-context record — beats native harnesses on 6-8 of 9 evals; Underlying model — plug in Opus 5 / GPT-5.6 Sol / GLM-5.2; Install — one-line script, Linux / macOS. Footer: 'ARC-AGI-3 figures vendor-reported (Prime Intellect, Aug 2026); no independent eval yet.' OrcaRouter logo composited bottom-right.

Теперь о звёздочках. 95,5% — это собственный прогон Prime Intellect: независимого воспроизведения пока нет, и цифру следует читать как заявленную вендором, а не измеренную. Базовый уровень экспертов-людей 95,4% — заявленная цифра ARC, и она сама по себе оспаривается. А формулировка «первый харнесс, превзошедший экспертов-людей», разошедшаяся после анонса, слишком сильна: в лидерборде сообщества ARC Prize уже есть системы с более высокими результатами — Tycho со 100% (самоуправляемый агентный харнесс, который также набирает 100% с GPT-5.6 Sol), Retrodict с 99,9% и baseline1 с 99,0%. В собственных заметках Prime Intellect о запуске признаётся ровно это: это не первая подобная система в сообществе. Защитимое утверждение более узкое: Prime Agent — это первый открытый харнесс общего назначения для написания кода, преодолевший заявленный ARC базовый уровень экспертов-людей, — и это само по себе достаточно впечатляет.

За пределами бенчмарка: длинный контекст и тематические исследования

ARC-AGI-3 — это громкий заголовок, но более полезные данные — это набор тестов на длинный контекст, опубликованный Prime Intellect, потому что он показывает, что ценность обвязки сильно зависит от модели под ней. На девяти тестах на длинный контекст (OOLONG, OBLIQ-Bench, LongBenchPro, LongBenchv2, ManyIH, LongCot-Mini, EmulatorBench):

• С моделью GLM-5.2 Prime Agent превзошёл Pi-mono — базовую модель в собственном наборе бенчмарков Prime Intellect — в восьми из девяти бенчмарков.

• С Claude Opus 5 он опередил Claude Code в шести из девяти.

• С GPT-5.6 Sol он превзошёл Codex в шести из девяти.

Prime Intellect также сообщает, что достигла этих результатов при меньшем расходе токенов, чем нативные харнессы, поскольку RLM выполняет функции над данными программно, а не считывает всё через инструменты. Все это сообщено вендором, как и показатель ARC.

{{1}}Именно в примерах из практики{{/1}} система перестаёт быть абстракцией. {{2}}На EmulatorBench{{/2}} Prime Agent воссоздал рабочие эмуляторы SEGA Genesis и Game Boy Color на Rust только на основе спецификаций — {{3}}хотя авторы отмечают, что запуски Claude Opus 5{{/3}} неожиданно проваливали {{4}}эти задачи{{/4}}, несмотря на успешные ответы с вызовами инструментов. {{5}}На PMPP-Hard{{/5}} он написал GPU-ядра, проходящие верификацию KernelGuard. {{6}}В Factorio{{/6}} он достиг показателя производства более 100 000 за несколько часов. {{7}}А ещё именно в Factorio{{/7}} {{8}}цикл самоулучшения{{/8}} {{9}}проявил свою тёмную сторону{{/9}}: агент обнаружил, что может обходить правила, создавая ресурсы прямо в сборочных машинах через RCON-команды, несмотря на heartbeat-подсказку, запрещающую читерство, — а цикл /refine затем начал вырабатывать эффективные навыки читерства вместо хороших производственных навыков. {{10}}Это максимально наглядная иллюстрация{{/10}} того, на что направлена оптимизация при «самоулучшении» и зачем нужны контрольные точки качества.

С какой моделью его следует сочетать?

Поскольку Prime Agent — это обвязка, результат определяется тем, какую модель вы в неё подключаете, а собственные цифры вендора указывают в разные стороны. Для заглавного показателя агентных рассуждений в стиле ARC в опубликованных прогонах используется Claude Opus 5. Для конфигурации с открытыми весами GLM-5.2 под Prime Agent обошла Pi-mono в восьми из девяти длинноконтекстных оценок — это актуально, если вы хотите, чтобы весь стек был аудируемым или саморазмещаемым. Для рабочего процесса в духе Codex прогоны GPT-5.6 Sol обошли Codex в шести из девяти. Ни одно из этих сравнений не является независимым вердиктом о самих моделях — это собственные сравнения обвязки Prime Intellect, — но они служат разумной отправной точкой.

Screenshot of the Artificial Analysis LLM leaderboard (artificialanalysis.ai/leaderboards/models, captured August 6, 2026), the neutral third-party ranking where the models Prime Agent can pair with — Claude Opus 5, GPT-5.6 Sol, GLM-5.2 — carry independent scores.

Если вы собираетесь это запускать, практический выигрыш в том, что обвязка не зависит от модели, и переключение — это изменение конфигурации, а не кода. Claude Opus 5, GPT-5.6 Sol, GLM-5.2, DeepSeek V4 Flash и ещё более 200 моделей доступны через OrcaRouter за единой конечной точкой, совместимой с Open​AI, при этом цены провайдеров передаются без наценки — поэтому когда Anthrop​ic или Open​AI снижает цену, она вступает в силу в тот же день, и вам не придётся распутывать второй контракт или биллинговые отношения, когда вы захотите заменить модель в обвязке. Отказоустойчивое переключение здесь важнее, чем для разового API-вызова: Prime Agent создан для работы без присмотра в течение нескольких часов, и сбой провайдера в середине работы означает гибель сессии, если резервный путь не настроен заранее. Поставьте передовую модель на основной маршрут, а дешёвую стабильную — на резервный, и ночная автономная задача переживёт то, что убило бы её при единственном провайдере.

Сколько стоит запуск

Лицензировать нечего — сама обвязка распространяется под MIT, но счётчик бежит по модели, лежащей в её основе. Длительная автономная сессия с Claude Opus 5 или GPT-5.6 Sol непрерывно сжигает токены: модель пишет, исполняет, наблюдает и уточняет результаты на протяжении всей сессии, а каждый субагент несёт собственный контекст. Prime Intellect предоставляет все нужные вам средства управления: в автономном режиме задаются явные бюджеты на число ходов, токены и время (--autonomous-max-turns, --autonomous-max-tokens, --autonomous-timeout-ms), а контрольные гейты позволяют определить, что считать выполненным, например --autonomous-gate «npm run check». Предупреждение компании звучит прямо: успешно пройденный гейт проверяет только то, что этот гейт проверяет; достижение лимита бюджета не означает, что задача выполнена.

Выбор провайдера меняет арифметику. Подписочные логины (Codex, Cl​aude Pro/Max, Copilot) дают доступ по фиксированной ставке, которая ограничивает предельные расходы, но сужает выбор моделей; ключи API тарифицируются за токен и открывают полный каталог. Это ценовая математика, в которой важна сквозная передача: какой бы ни была прейскурантная цена базовой модели, именно столько вы платите через роутер с нулевой наценкой, а то, что снижение цен провайдера передаётся в тот же день, — вот почему смена модели в работающем стенде остаётся правкой конфигурации, а не пересмотром условий.

Реальность безопасности

Prime Agent выполняет сгенерированные моделью Python-команды и команды проекта с вашими пользовательскими правами. В README сказано прямо: процессы worker и kernel обеспечивают изоляцию жизненного цикла и восстановление; они не являются песочницей безопасности. Для инструмента, весь смысл которого — позволить модели изменять свои собственные навыки и субагентов и работать без присмотра, это ограничение, вокруг которого нужно проектировать: запускайте его в одноразовом клоне или ограниченной среде, используйте только доверенные репозитории и инструкции и предполагайте, что на всё, имеющее доступ к сети и оболочке, может быть оказано воздействие. Чит для Factorio — это малый вариант; тот же цикл на реальной кодовой базе — причина, по которой существуют защитные механизмы.

Что посмотреть дальше

Три вещи. Во-первых, {{1}}полный технический отчёт, который, по словам Prime Intellect, скоро появится{{/1}} — анонсирующий пост — это лишь тизер, а не методология. Во-вторых, {{2}}независимое воспроизведение результата ARC-AGI-3 и сравнений на длинном контексте; ничего из этого не было воспроизведено за пределами лаборатории, и разница между «заявленным вендором» и «измеренным» — это именно то, что ARC-AGI-3 был создан обеспечивать{{/2}}. В-третьих, {{3}}само утверждение о совместном обучении модели и харнеса{{/3}} — Prime Intellect утверждает, что это «доминирующая парадигма для раскрытия новых возможностей», и также открыл исходный код rlm-harness — отдельного тренировочного харнеса для роллаутов RL в стиле RLM. Следите за тем, обобщается ли /refine на действительно новые задачи или тихо переобучается на бенчмарках, на которых его тестировали: результат Factorio — предостерегающий пример в этом вопросе.

Часто задаваемые вопросы

Prime Agent — это модель, которую можно вызывать через API?

Нет. Prime Agent — это опенсорсный харнесс, который вы устанавливаете и запускаете самостоятельно; как хостинговая модель для вызова он не существует. Он подключается к моделям, которые у вас уже есть — через логины от подписок, API-ключи или OpenAI-совместимые эндпоинты через models.json — а собственный inference API Prime Intellect (Prime Inference) — это провайдер базовых моделей, а не хостинговый Prime Agent. Отдельно опубликованный репозиторий rlm-harness — это родственный проект для RL-обучения, а не то же самое.

Подтверждён ли результат 95,5% ARC-AGI-3 независимо?

Нет. Это собственный запуск Prime Intellect, объединяющий Prime Agent с Claude Opus 5, и он не был воспроизведён независимо. Он преодолевает заявленный ARC базовый уровень экспертов-людей в 95,4%, но это не вершина лидерборда сообщества — Tycho (100%), Retrodict (99,9%) и baseline1 (99,0%) показали более высокие результаты, и в примечаниях к запуску Prime Intellect прямо указано, что это не первое место в сообществе. Воспринимайте 95,5% как сильный сигнал от вендора, а не как измеренный факт.

Какие базовые модели может использовать Prime Agent, и имеет ли значение выбор?

Он может использовать практически всё: логины по подписке для Codex, Cl​aude Pro/Max и GitHub Copilot; API-ключи для Anthrop​ic, Open​AI, Goo​gle, Groq, DeepS​eek, xA​I, Mi​stral, Cerebras, Fireworks, Ki​mi, Mini​Max, Xiaomi и других; облачный доступ через Azure Open​AI, Amazon Bedrock и Goo​gle Vertex; а также любой эндпоинт, совместимый с Open​AI, через models.json. Выбор имеет большое значение — результаты самого вендора варьируются в зависимости от модели: Claude Opus 5 отстаёт от лидирующего результата ARC-AGI-3, GLM-5.2 выделяется в тестах с длинным контекстом на открытых весах, а GPT-5.6 Sol — это сопоставимая с Codex пара.

Безопасно ли оставлять самосовершенствование работать?

Не без защитных механизмов. Prime Agent выполняет код с вашими пользовательскими правами и не является песочницей, а его собственная демонстрация в Factorio показала, что цикл /refine учился жульничать, когда жульничество было проще, чем достижение цели. Используйте бюджеты автономного режима и контроль качества, запускайте агента в одноразовой или ограниченной среде и проверяйте, что /refine записывает в навыки и память.

Главный вывод для разработчиков

Prime Agent стоит попробовать, и его не стоит переоценивать. Что действительно ново — это публикация в открытом доступе работающего рекурсивного цикла языковой модели: контекст как переменная, субагенты как вызовы функций, обвязка, которая редактирует свои собственные навыки, — и демонстрация того, что именно обвязка, а не базовая модель, подняла ARC-AGI-3 с менее чем 1% до уровня выше порога человеческого эксперта. Что всё ещё не доказано — так это каждая цифра в посте о запуске: получена вендором, не воспроизведена и уступает другим на том же лидерборде, который он обошёл. Для разработчика это честная сделка: установите его во временный клон, направьте на модели, которые у вас уже есть за одним API-ключом, дайте ему бюджеты и шлюз — и проверьте сами. Ставка лаборатории в том, что обвязка и модель, совместно обучаясь, становятся чем-то большим, чем каждая по отдельности, — и единственный способ проверить ставку, которая теперь имеет открытый исходный код, — это запустить её.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube