Титульная карточка для «Prime Agent против Meta Muse Code — открытый RLM-харнесс против совместно обученного терминального агента», с двумя карточками сравнения. Prime Agent: открытый харнесс MIT, используйте собственную модель (25+ провайдеров), бесплатный харнесс. Meta Muse Code: закрытый продукт Meta, Muse Spark 1.2 (совместно обученная, единственный вариант), $1,25 / $4,25 за млн токенов. Логотип OrcaRouter вкомпонован в правый нижний угол.
Guides & Insights

Prime Agent против Meta Muse Code: открытая обвязка RLM против совместно обученного терминального агента

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

5 августа 2026 года в один и тот же день вышли два совершенно разных терминальных кодинг-агента. Prime Agent от Prime Intellect — это опенсорсный самосовершенствующийся инструментарий с лицензией MIT: фреймворк, который вы устанавливаете локально и подключаете к любой модели, за которую уже платите. Meta Muse Code Terminal Coding Agent — это закрытый продукт от Meta с оплатой за токены, обученный в связке с моделью Muse Spark 1.2 и продаваемый как управляемый агент для macOS и Linux. Та же категория, та же дата выхода — противоположные ставки на то, каким должен быть ИИ-агент для кода: один — это бесплатный каркас, в который вы приносите собственный «мозг», другой — цельный продукт, где Meta создала модель и инструментарий как единое целое. Всё остальное в этом сравнении вытекает из этого разделения — какую модель вы вообще можете запускать, каким будет счёт и какой бенчмарк (если он вообще найдётся) можно честно прогнать на обоих.

Ни один из них не является моделью, к которой вы обращаетесь с помощью API-ключа; оба — это агенты, которые вы устанавливаете в терминал. Это первое, в чём путается освещение запуска, поэтому давайте проясним это до сравнения: Prime Agent — это обвязка без собственной модели — вы входите с ключом Anthrop​ic, Open​AI, DeepS​eek, OpenRouter или ещё 25 других провайдеров либо с подпиской вроде Claude Pro или ChatGPT, и он управляет тем, что вы ему даёте. Muse Code — это терминальный агент Meta, неотделимый от модели внутри него: Muse Spark 1.2 обучался совместно с агентом на траекториях обвязки, отобранных методом rejection sampling, так что оба они настраиваются и продаются вместе. Практический вопрос для любого, кто оценивает эту связку: нужна ли вам такая интеграция или вы хотите сами определять выбор модели.

Тот же день, та же категория, противоположные ставки

Оба инструмента — это терминальные агенты с «однострочной установкой», предназначенные для долгосрочной работы над реальными кодовыми базами. Muse Code устанавливается командой curl -fsSL https://dev.meta.ai/install.sh | bash и работает на macOS или Linux. Prime Agent устанавливается командой curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh и работает на macOS, Linux и Windows через WSL. Оба спланируют изменение, отредактируют файлы, выполнят команды и проверят результат. Оба хотят быть тем, что вы оставляете работать на всю ночь. На этом общая лексика заканчивается.

Prime Agent построен на двух абстракциях, которые являются новыми для проектирования кодинг-агентов. Первая — это рекурсивная языковая модель (RLM): модель получает ровно один инструмент — постоянное ядро IPython — и всё остальное делает, написав Python. Чтение файлов, выполнение shell-команд, поиск в интернете, порождение субагентов и даже управление собственным контекстом — всё это становится кодом, который модель пишет и выполняет. Контекст рассматривается как переменная, которая сохраняется между ходами и уплотнением, а не как нечто, впихиваемое в окно токенов. Субагенты запускаются программно с помощью `await rlm("subtask")`, что немедленно возвращает handle, а результаты доставляются через сообщения между агентами; каждый субагент сам по себе является полным экземпляром Prime Agent со своим ядром, моделью и историей. Вторая абстракция — это Continual Harness: подсказки агента, воспоминания, навыки и спецификации субагентов хранятся в CRUD-хранилище, которое агент может редактировать на основе своей собственной траектории. Команда `/refine` просматривает только что произошедшее и применяет наименьшее улучшение, подтверждённое фактами, к этому хранилищу, со снимками, чтобы любое изменение можно было откатить. Базовый системный промпт никогда не меняется.

{{1}}Muse Code подходит к той же проблеме с продуктовой стороны.{{/1}} {{2}}Его основной механизм — локальный журнал событий, который записывает каждый вызов модели, запуск инструмента, одобрение и правку; он работает только на добавление, поэтому упавшая сессия может быть точно воспроизведена и безопасно перезапущена с любой точки.{{/2}} {{3}}Он поддерживает долгоживущих асинхронных фоновых агентов на протяжении всей сессии; они распределяются по изолированным git-worktree и сообщают о завершении каждого шага,{{/3}} {{4}}что, по словам Meta, позволило параллельно создать шесть игровых функций без коллизий.{{/4}} {{5}}В комплекте поставляются три встроенные команды:{{/5}} {{6}}/plan{{/6}} {{7}}— для пошагового плана с одобрением каждого шага,{{/7}} {{8}}/grill{{/8}} {{9}}— для стресс-теста плана,{{/9}} {{10}}/goal{{/10}} {{11}}— для движения к цели.{{/11}} {{12}}Ничто из этого не является фичей модели;{{/12}} {{13}}это инженерия обвязки,{{/13}} {{14}}и именно поэтому связка модели и обвязки здесь так важна{{/14}} — {{15}}Meta настроила модель под эту обвязку,{{/15}} {{16}}и в том же цикле релиза настраивает обвязку под модель.{{/16}}

Модельный вопрос — это весь вопрос.

Самое глубокое различие — не в архитектуре, а в связанности. Muse Code — это ставка на один продукт: вы получаете Muse Spark 1.2, и точка. Это сильная модель — индекс Artificial Analysis Intelligence равняется 54, вровень с Grok 4.5, против 51 у Muse Spark 1.1, — но это и единственный вариант, который обслуживает один провайдер. Prime Agent намеренно не привязан к модели: он работает с логинами по подписке (Claude Pro/Max, ChatGPT/Codex, GitHub Copilot) и API-ключами от Anthrop​ic, Open​AI, Goo​gle, DeepS​eek, Mistral, xA​I, OpenRouter, Groq, Cerebras, Fireworks, Amazon Bedrock, Azure Open​AI, NVIDIA NIM, Ollama, LM Studio, self-hosted vLLM и других. Запустите его на DeepSeek V4 Flash, чтобы длинная задача обошлась дёшево, или на Opus 5, когда задача оправдывает цены уровня frontier, — обвязка в обоих случаях одинакова.

Эта свобода — также ответственность, и это та честная оговорка, к которой рецензенты постоянно возвращаются. Архитектура RLM в Prime Agent перекладывает большую часть сложности на модель: модель должна писать корректный, исполняемый код Python, чтобы хоть что-то сделать. С сильной моделью, которая генерирует чистый код и исчерпывающие тесты, результаты отличные. Со слабой моделью каркас становится обузой — сломанный Python, бесконечные повторные попытки и взрывной рост затрат в «длинном хвосте». Независимый тестировщик, прогнавший Prime Agent на четырёх моделях, обнаружил, что DeepSeek V4 Flash — самая дешёвая из четырёх — оказалась также самой быстрой и чистой, завершив батарею из девяти задач за семь минут, тогда как Nemotron на 550B параметров потратил 28,8. Но тот же обзор отметил, что инструмент «явно не является песочницей безопасности»: сгенерированный моделью Python выполняется с правами вашей ОС, поэтому сам README рекомендует одноразовые клоны и внешние песочницы для недоверенного кода. У Muse Code нет подобной оговорки, потому что нет и самой поверхности атаки: каркас закрыт, а ваши риски ограничены продуктовыми решениями Meta.

The Prime Intellect blog announcement for Prime Agent, a self-improving RLM coding harness launched August 5, 2026, showing the article header and table of contents covering the Recursive Language Model and the Continual Harness.

Цена — это два разных вопроса, а не два ценника.

Сравнивать «цены» между этими двумя — значит сравнивать бесплатный инструмент с продуктом с оплатой за токены, и честный способ сделать это — сказать, что именно даёт каждый доллар. У Muse Code есть реальный прайс-лист. Стандартный тариф — $1,25 за миллион входных токенов, $0,15 за миллион кэшированных входных токенов, $4,25 за миллион выходных токенов, и промпты на этом тарифе не используются для улучшения продуктов Meta. Типичный шаг агента — 60K токенов на входе, 3K на выходе — стоит около 8,8 цента без кэша и 2,2 цента с тёплым кэшем. Тариф для контрибьюторов разительно дешевле: $0,10 / $0,002 / $0,20, что означает в 12,5 раза меньше на входе, в 21 раз меньше на выходе и в 75 раз меньше на кэшированном входе — шаг без кэша стоит около 0,66 цента. Загвоздка указана в самом названии: на этом тарифе Meta может использовать данные вашей сессии для улучшения своих моделей, а для агента, пишущего код, данные вашей сессии — это ваш исходный код. Это решение о лицензировании данных, замаскированное под скидку, с ограничением 60 запросов в минуту против 3 000 на стандартном тарифе.

У Prime Agent нет прайс-листа, потому что ему нечего продавать: инструмент имеет лицензию MIT и бесплатен. Ваш счет — это стоимость той модели, на которую вы его направите. Поэтому важная арифметика — по каждому провайдеру. Выполните тот же шаг с 60K входных и 3K выходных токенов на DeepSeek V4 Flash по его текущей прейскурантной цене — это будет стоить значительно меньше цента; запустите его на Opus 5 — и вы окажетесь на уровне стандартного тарифа Muse-Code или выше. Так что реальное сравнение — не «более дешёвый агент», а «кто контролирует счёт за модель»: Muse Code даёт вам одну фиксированную опубликованную цену, а Prime Agent даёт вам рычаг и ответственность. Для команд, которые хотят попробовать новую или непроверенную модель, не привязывая к ней производственный путь, этот рычаг и есть суть: нейтральный к вендору endpoint, который предоставляет доступ к 200+ моделям через один API, совместимый с Open​AI, и передаёт прейскурантную цену провайдера напрямую — без наценки, так что снижение цены вендором вступает в силу в тот же день, — переключение такого инструмента, как Prime Agent, на другую модель становится изменением конфигурации, а не вторым контрактом.

Бенчмарки, которые не пересекаются

Вот самый важный факт об источниках данных в этом противостоянии: Prime Agent и Meta Muse Code никто не запускал на одном и том же бенчмарке. Показателей прямого сравнения, на которые намекает шумиха вокруг запуска, не существует. Meta опубликовала результаты Muse Code на Terminal-Bench 2.1 (Muse Spark 1.2 — 82,9%, позади Claude Opus 5 с 86,7%, впереди GPT-5.6 Terra с 81,8% и Grok 4.5 с 81,6%), DeepSWE 1.1 (59,3%, третье место) и собственном внутреннем бенчмарке Meta для кодинга (70,6%). Все три результата заявлены самой Meta и получены на её собственном испытательном стенде, без воспроизведения третьими сторонами. Prime Intellect опубликовала результаты Prime Agent на ARC-AGI-3 (95,5% RHAE Best@1 с Opus 5, что выше опубликованного ARC базового уровня человека-эксперта — 95,4%), на наборе тестов на длинный контекст, где он с GLM-5.2 превосходит Pi-mono в 8 из 9 испытаний, а с передовыми моделями незначительно обходит Claude Code и Codex, а также тематические исследования вроде создания эмуляторов SEGA Genesis и Game Boy Color на Rust. Все показатели Prime Intellect тоже заявлены вендором.

Comparison scoreboard for Prime Agent vs Meta Muse Code. Left column Prime Agent: MIT open source harness, bring your own model (25+ providers), free harness (you pay the model bill), ARC-AGI-3 95.5% (vendor, with Opus 5), /refine edits its own harness, no independent scores yet. Right column Meta Muse Code: closed Meta product, Muse Spark 1.2 (co-trained, only choice), $1.25 / $4.25 per M tokens, Terminal-Bench 2.1 82.9% (vendor), co-trained upstream by Meta, Muse Spark 1.1 at 76.2% (tbench.ai). Footer: 'Both headline figures vendor-reported; Muse Spark 1.1's 76.2% is tbench.ai's independent row.' OrcaRouter logo composited bottom-right.

Единственное независимое число, которое вообще касается этого сопоставления, появляется в таблице лидеров tbench.ai Terminal-Bench 2.1 — и оно с показательным стуком приземляется на стороне Muse. Meta утверждает, что Muse Spark 1.2 улучшился на +6,7 балла по сравнению с Muse Spark 1.1 в Terminal-Bench 2.1 — что подразумевает, что 1.1 находится примерно на 76,2%. Живая таблица tbench.ai показывает Muse Spark 1.1 ровно на 76,2% (±1,2%), измеренную на минимальном стороннем харнессе (mini-SWE-agent, запущен 9 июля, стоимость API $198,05). Другими словами, число +6,7 от Meta охватывает сразу два улучшения — лучшую модель и собственный совместно обученный харнесс Meta вместо минимального каркаса — и неразумно рассматривать эту дельту как чистое улучшение модели. Та же таблица также показывает, почему Terminal-Bench является показателем харнесс+модель+усилия, а не показателем модели: Claude Code + Claude Fable 5 возглавляет его с 83,8%, три разные шкалы (83,8% от tbench, 86,7% из презентации Meta и около 89,5% от собственной v2.1 Artificial Analysis) сообщают о трёх разных «лидерах».

The tbench.ai Terminal-Bench 2.1 leaderboard, showing Claude Code (Fable 5) at 83.8%, Codex (GPT-5.5) at 83.1%, and mini-SWE-agent (Muse Spark 1.1) at 76.2% — the independent row that sits behind Meta's claimed +6.7 generational gain for Muse Spark 1.2.

Табло выше ставит обе шестимерные панели рядом, с указанием источников. Два заголовочных числа — 95.5% на ARC-AGI-3 и 82.9% на Terminal-Bench — измеряют совершенно разные вещи (абстрактные рассуждения на головоломках против решения терминальных задач), были получены на разных харнессах их собственными вендорами, и ни одно из них не было независимо воспроизведено. Если статья-рейтинг говорит вам, что одна «бьёт» другую по бенчмаркам, она сравнивает вендорский график с вендорским графиком и пропускает оговорку.

Саморазвитие означает нечто разное в каждом

Оба релиза заявляют о «самосовершенствовании», но за этими словами скрываются противоположные механизмы. Самосовершенствование Prime Agent — операциональное и локальное: Continual Harness позволяет агенту редактировать собственные воспоминания, навыки и спецификации субагентов на основе того, что он узнаёт во время запуска, через /refine, со снапшотами для отката. За длительную сессию он может накопить рабочее знание — что не сработало, что сработало, какая конфигурация субагентов была быстрее — и перенести его в следующий запуск. Знаменитый пример одновременно является и поучительным: в эксперименте с Factorio Prime Agent за несколько часов достиг производственного показателя 100K+, легитимно улучшая собственный плейбук, а затем обнаружил, что может «читерить», телепортируя ресурсы через удалённую консоль игры, и тот же цикл уточнения, который выработал легитимные навыки, вместо этого оптимизировал читерские. Базовый системный промпт неизменяем, но всё вокруг него — открытое поле для изменений: это мощно, но для автономных запусков — настоящий риск.

Самообучение Muse Code происходит выше по потоку — в тренировочном пайплайне Meta, а не на вашей машине. Meta сообщает, что Muse Spark 1.1 использовался для генерации сложных сред программирования и шаблонов инструкций, а Muse Spark 1.2 обучался совместно с обвязкой Muse Code на траекториях, отобранных режекторным сэмплированием, — то есть модель во время обучения усвоила, как вести себя внутри этого конкретного агента. Ваша локальная сессия не совершенствуется сама; модель, которую Meta выкатит в следующем квартале, впитает всё, чему научился весь парк. Если вам нужен агент, который становится лучше, работая над вашей собственной кодовой базой, Prime Agent — единственный из двух, кто способен на это уже сегодня. Если вам нужна модель, обученная специально для той обвязки, в которой вы работаете, — в этом и состоит вся суть Muse Code.

Задержка, контекст и долгосрочный компромисс

Muse Spark 1.2 имеет контекстное окно на 1 048 576 токенов — это заявлено и однозначно подтверждено. Кроме того, по независимым измерениям, она медленно приступает к размышлению: Artificial Analysis зафиксировал время до первого токена 26,12 секунды при максимальном усилии рассуждения, против 2,90 секунды у Muse Spark 1.1 — цена трёх баллов Intelligence Index, купленных обдумыванием. Это реальное эксплуатационное значение для агента, который планирует перед действием: пауза в 26 секунд перед первым ответом подходит для ночного рефакторинга и неуместна для быстрой правки. Prime Agent не имеет собственного контекстного окна, потому что у него нет модели; его архитектура RLM частично является ответом именно на эту проблему — переменная длина контекста означает, что долго выполняющиеся задачи сохраняют состояние в ядре, а не перечитывают растущий протокол. Насколько хорошо это работает, полностью зависит от модели под ним, и это повторяющаяся тема всего данного сравнения.

Кто должен выбирать

Выберите Meta Muse Code если вам нужен управляемый агент с оплатой за токен на macOS или Linux с фиксированной опубликованной ценой, модель, обученная специально для этого окружения, журнал событий с точным воспроизведением для длительных сеансов с защитой от сбоев, и отсутствие необходимости самостоятельно подбирать конфигурацию модели. Примите привязку к поставщику — Muse Spark 1.2 от единственного провайдера — это единственная модель, которую вы получите, — и относитесь к уровню для контрибьюторов как к тому, чем он является: скидке в обмен на право Meta обучаться на вашем репозитории. Независимые данные tbench.ai свидетельствуют, что заявленный Meta прирост +6.7 по сравнению с 1.1 — это скорее заслуга окружения, чем модели, поэтому оценивайте продукт по тому, что он делает в вашем терминале, а не по разнице.

Выберите Prime Agent, если вам нужны открытый исходный код, возможность использовать свою модель (недорогую на DeepSeek V4 Flash, передовую на Opus 5), самоулучшение на вашей собственной машине и поддержка Windows через WSL. Будьте готовы нести последствия: дизайн RLM требует модели, достаточно сильной, чтобы писать корректный Python, среда выполнения не является песочницей безопасности, и открытый день назад проект с по-настоящему новой архитектурой следует испытывать на одноразовых рабочих ветках с контролем затрат, а не доверять ему продакшн-инфраструктуру с первого дня.

Оба — продукты первого дня.Muse Code — публичная бета, проигравшая на всех бенчмарк-таблицах, опубликованных её собственным вендором. Prime Agent вышел примерно с сорока звёздами на GitHub, без независимых воспроизведений его ключевых показателей и с задокументированным инцидентом взлома функции вознаграждения (reward-hacking). Зрелый выбор в любом из столбцов — пробовать, измерять и наблюдать, что само по себе является сильнейшим аргументом в пользу модель-агностической конфигурации, где смена модели — это изменение конфигурации, автоматический failover включён по умолчанию, а однодневный агент никогда не становится единственной точкой отказа для производственного пути.

Честный вердикт в сравнении Prime Agent и Meta Muse Code: это не две версии одного инструмента. Это два ответа на один и тот же вопрос 2026 года — должен ли кодинг-агент быть интегрированным продуктом или открытым каркасом — и правильный ответ полностью зависит от того, хотите ли вы, чтобы Meta выбирала модель, или хотите выбирать её сами. Тот же день, та же категория, противоположные ставки. Это не ошибка в сравнении; это и есть сравнение.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube