Muse Code
Guides & Insights

Muse Code: Meta выпустила кодинг-агента, который проигрывает на собственном бенчмарке.

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вендоры обычно не публикуют рейтинг, в котором они занимают второе место. Meta опубликовала три таких. В презентации запуска Muse Code — терминального агента для программирования, выпущенного Meta Superintelligence Labs 5 августа 2026 года и работающего на вышедшем в тот же день Muse Spark 1.2Claude Opus 5 опережает всех по каждой таблице, которую Meta решила показать, включая ту, которую Meta создала и контролирует сама. На Terminal-Bench 2.1 разрыв составляет 3,8 пункта. На DeepSWE 1.1 — 5,7, при этом GPT-5.6 Terra также впереди. На собственном внутреннем бенчмарке Meta — 8,8. Вирусная версия этого запуска — «59% на DeepSWE 1.1, превосходя Grok 4.5 и Gemini 3.6 Flash» — правда, и это самое скромное из доступных правдивых утверждений.

Что делает запуск более интересным, а не менее. Meta выпустила набор бенчмарков, в котором не побеждает, и всё равно выпустила его, потому что дело не в оценке. Она продаёт рантайм, который выдерживает 24-часовую работу, и цену, которая ниже всех конкурентов более чем на порядок — при условии, что вы готовы позволить Meta читать ваш репозиторий. Каждый показатель бенчмарка ниже взят из собственных графиков Meta, опубликованных без методологии; где существует независимое измерение, в предложении это указано.

Что на самом деле выпустила Meta

Две вещи в один и тот же день, намеренно связанные.

Muse Code — терминальный кодинг-агент, публичная бета, устанавливается одной командой: curl -fsSL https://dev.meta.ai/install.sh | bash. Только macOS и Linux; нативной сборки для Windows нет, как и графического интерфейса или расширения для IDE. Meta описывает его задачу как решение сложных задач программной инженерии в больших репозиториях — планирование изменений, написание кода, проверка результатов.

Muse Spark 1.2 — версия модели рассуждений Meta, ориентированная на программирование, с контекстом в 1 048 576 токенов, доступная в Muse Code и через Meta Model API в публичной предварительной версии. Meta заявляет, что увеличила вычислительные мощности для обучения на задачах программирования и расширила разнообразие обучающих сред, нацелившись на задачи с длинным горизонтом: генерацию целых репозиториев, рефакторинг нескольких файлов и расширенную отладку.

Суть утверждения — в связке. Meta заявляет, что эти две части обучались совместно и что такая связка поэтому даёт «более эффективное использование инструментов, меньше повторных попыток и более качественный результат, чем обычная обёртка вокруг внешней модели». Это формулировка и утверждение самой Meta; ни одна третья сторона не тестировала модель в чужой обвязке, чтобы проверить, реален ли бонус от совместного обучения или же Muse Spark 1.2 просто ведёт себя как компетентная модель для написания кода, где бы её ни разместили.

Вместе с агентом поставляются три встроенных навыка, которые описывают целевой стиль работы лучше, чем маркетинговые тексты: /planсоздает требующий одобрения план до того, как написано хоть что-то, /grillподвергает этот план стресс-тесту, а /goalподталкивает к достижению заявленной цели. Планируй, атакуй план, затем выполняй — именно к такой схеме опытные пользователи Claude Code и Codex приходили вручную, а теперь она доступна как полноценные команды.

Эталонная колода, прочитанная честно

Muse Code

Meta опубликовала сравнения на Terminal-Bench 2.1, DeepSWE 1.1, собственном Meta Internal Coding Bench и GDPval. Числа, как сообщает Meta:

Terminal-Bench 2.1 — Claude Opus 5 при максимальном усилии в Claude Code 86,7%, Muse Spark 1.2 в Muse Code 82,9%, GPT-5.6 Terra в Codex 81,8%, Grok 4.5 в Grok Build 81,6%. Второе место, а со второго по четвёртое места разделяет 1,3 пункта.

DeepSWE 1.1 — Claude Opus 5 65.0%, GPT-5.6 Terra 64.8%, Muse Spark 1.2 59.3%. Третье место, и единственная таблица, где разрыв решающий, а не косметический.

Meta Internal Coding Bench — Claude Opus 5 79.4%, Muse Spark 1.2 70.6%. Домашний бенчмарк Meta, и самое крупное поражение Meta.

Из поколения в поколение — Meta сообщает о +6,7 балла на Terminal-Bench и +6,3 на DeepSWE против Muse Spark 1.1. Это самые большие цифры в презентации, и именно они должны действительно волновать пользователя Muse Spark 1.1.

Стоит назвать одну арифметическую загвоздку, поскольку именно она — причина относиться ко всему вышесказанному как к ориентировочному. Если вычесть +6,7 от Meta, Muse Spark 1.1 оказывается примерно на 76% в Terminal-Bench 2.1 — но публичный лидерборд tbench.ai с конца июля держит подтверждённые 80,0% для Muse Spark 1.1. Оба числа могут быть честными и всё же не совпадать, потому что строка Terminal-Bench — это не оценка модели. Это оценка харнесса плюс модели плюс настройки усилий, и внутренний харнесс Meta для 1.1 — не тот, что запускал tbench. Этот единственный факт наносит сравнению бенчмарков между вендорами больше урона, чем любая отдельная спорная цифра, и он напрямую подводит к следующему разделу.

Среда выполнения — это продукт

Muse Code

Уберите оценки — и останется инженерная подача о том, как не умереть. Два механизма её несут.

Первое — это журнал событий. Muse Code добавляет каждый вызов модели, каждый запуск инструмента, каждое одобрение и каждое изменение в локальный журнал, который, по описанию Meta, делает сеанс точно воспроизводимым и безопасным при перезапуске: убейте его, доведите до сбоя, потеряйте машину — и агент возобновит работу ровно с того места, где остановился, а не будет заново восстанавливать контекст с нуля. Конкуренты имеют аварийное восстановление разного качества; никто из них не сделал это главной особенностью. Это также, кстати, артефакт аудита — полная локальная запись того, что автономный процесс сделал с вашим рабочим деревом, а это именно тот документ, который запрашивает служба безопасности и который большинство агентных CLI не могут создать.

Второе — это то, что Meta называет асинхронными фоновыми агентами. Отличие от обычных субагентов в том, что они не создаются под каждую подзадачу и не уничтожаются после выполнения; они остаются активными на протяжении всей сессии, самостоятельно выполняют следующие шаги и сами выбирают, когда отчитаться перед основным циклом. Заявленный выигрыш — более низкая задержка, поскольку оркестратор не платит за запуск при каждом делегировании.

Подтверждающие данные Meta — это одно тематическое исследование: Muse Code в течение 24 часов, совершив более 1 000 вызовов инструментов, автономно оптимизировал GPU-ядра на оборудовании NVIDIA Hopper и, по словам Meta, достиг существенных улучшений по сравнению с предоставленной базовой реализацией. Никаких цифр ускорения опубликовано не было, поэтому интерес представляет не результат, а продолжительность. Тысяча вызовов инструментов без вмешательства человека — это иная поверхность отказов, чем рефакторинг из пятидесяти вызовов, и это нагрузка, где отставание на 3,8 пункта в бенчмарке значит гораздо меньше, чем то, жив ли процесс на девятом часу.

Цена — это оружие, и часть её оплачивается исходным кодом.

Подписки Muse Code нет. Оплата производится токенами, на одном из двух тарифов, и разница между ними — самое агрессивное в этом запуске:

Standard — $1.25 за миллион входных токенов, $0.15 за миллион кэшированных входных токенов, $4.25 за миллион выходных токенов. Промпты на этом тарифе не используются для улучшения продуктов Meta.

Участник — $0,10 за миллион входных токенов, $0,002 за миллион кэшированных входных токенов, $0,20 за миллион выходных токенов. Взамен Meta может использовать данные для улучшения своих моделей.

Это в 12,5 раза дешевле по входным данным, в 21 раз дешевле по выходным и в 75 раз дешевле по кэшированным входным данным. Пропустите это через реалистичный шаг агента — 60 000 токенов контекста репозитория на входе, 3 000 токенов плана и патча на выходе — и четыре угла ценовой сетки поражают. Стандартный тариф с холодным запросом: 8,8 цента за шаг, 87,75 доллара за тысячу шагов. Стандартный тариф с попаданием контекста репозитория в кэш: 2,2 цента, 21,75 доллара за тысячу. Тариф для контрибьюторов, холодный: 0,66 цента, 6,60 доллара за тысячу. Тариф для контрибьюторов с тёплым кэшем: 0,72 доллара за те же тысячу шагов.

Та же работа — в 122 раза дороже или в 122 раза дешевле, в зависимости от двух решений. Собственный 24-часовой прогон ядра Meta с 1000 вызовов стоит примерно девяносто долларов в токенах на тарифе, защищающем ваши данные, и меньше доллара на тарифе, который этого не делает.

А вот какое решение этот запуск на самом деле ставит перед командами — и это не ценовое решение. Терминальный кодинг-агент читает вашу кодовую базу — в этом вся его функция, — поэтому промпты на тарифе для контрибьюторов содержат ваш исходный код, ваши внутренние API, ваши комментарии о том, почему существует обходное решение, и все тестовые фикстуры, которые оказались в вашем репозитории. Для побочного проекта или дерева открытого кода тариф для контрибьюторов — это почти бесплатные деньги. Для проприетарной кодовой базы или любого репозитория, имеющего доступ к пользовательским данным, это лицензионное решение, переодетое в скидку, и оно должно лежать на столе у того, кто утверждает обработку данных, а не у того, кто следит за облачным счётом. Meta установила на него скидку 12x, потому что данные стоят для Meta как минимум столько же.

Чего нельзя получить через API

Muse Code

82.9% принадлежит Muse Spark 1.2 внутри Muse Code. Если вы вызываете модель из собственного агентного фреймворка, вы получаете модель из этой пары, но не обвязку — ни журнала событий, ни постоянных фоновых агентов, и, если заявление Meta о совместном обучении что-то значит, ни отлаженного поведения при использовании инструментов. Итак, здесь две отдельные оценки, и смешивать их — самая лёгкая ошибка на этой неделе: превосходит ли Muse Code агента, которого вы уже используете, и является ли Muse Spark 1.2 лучшей моделью, чем та, которую вы сейчас вызываете?

Ответ на второй вопрос обходится дешевле, потому что для этого достаточно оставить ваш харнесс неизменным и заменить модель под ним. Стоит уточнить доступность: Muse Spark 1.2 напрямую предоставляется Meta и отсутствует в каталоге OrcaRouter. Muse Spark 1.1 доступен по цене $1.25 и $4.25 — ровно по прайс-листу Meta, потому что OrcaRouter добавляет 0% наценки и передаёт цены провайдера без изменений, что также объясняет, почему изменение цены вендора отражается у нас в тот же день, когда оно происходит, а не после завершения контрактного цикла. Наша семидневная продакшн-телеметрия для 1.1 показывает p50 времени до первого токена 1.84 секунды и p95 — 6.00 секунд, что является более полезной оценкой ожидаемой задержки, чем любой бенчмарк-харнесс.

Практическая ценность единого шлюза в такую неделю, как эта, заключается в том, что набор для сравнения — Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash и Muse Spark 1.1 — находится за одним ключом по прейскурантной цене, поэтому A/B-тест — это изменение строки, а не процедура закупок. Это также покрывает структурный риск в предложении Meta: у Muse Spark 1.2 ровно один провайдер, что делает его единой точкой отказа по своей конструкции. Автоматическое переключение между провайдерами — это разница между тем, станет ли плохой день для Meta плохим днём для вашего агента, или нет.

Это также объясняет, почему 1.2 вышла тихо и постепенно.

Muse Spark 1.2 появился в API Meta 5 августа без анонса и без изменённых цифр — тот же контекст 1M, те же $1.25 и $4.25, тот же пятиуровневый регулятор рассуждений, что и у Muse Spark 1.1. Единственное, что изменилось, было измерено извне: Artificial Analysis зафиксировал время до первого токена в 26.12 секунды против 2.90 секунды у 1.1 при максимальном усилии рассуждений, что дало три пункта индекса интеллекта, с 51 до 54. Если рассматривать это как выпуск универсальной модели, то это странный размен — девятикратное ожидание ради трёх пунктов.

Если читать это как модельную половину совместно обученного агента, это очевидный компромисс. Никто, ожидающий завершения рефакторинга двенадцати файлов, не замечает двадцать шесть секунд планирования; человек, ожидающий завершения чата, замечает их все. Meta не выпускала чат-модель втихую и не надеялась, что никто не измерит задержку. Она поставляла двигатель раньше автомобиля, и анонс появился вместе с автомобилем. Страница разработчика Muse Spark от Meta теперь тоже указывает 1.2.

Следствие — предупреждение для тех, кто выбрал это семейство из-за его широты. Muse Spark 1.1 позиционировалась как мультимодальная модель рассуждений — текст, изображения, видео, аудио и PDF, хорошая для смешанных медиа-исследований. Позиционирование версии 1.2 — это программная работа, а в её рекламных материалах — агент программирования. Мультимодальная поверхность не была удалена, но это больше не то, что Meta оптимизирует или рекламирует, и никто за пределами Meta не опубликовал видео- или аудиорезультат для 1.2.

Где Muse Code еще недостаточно проработан

Это бета, и она помечена как таковая. Гарантия журнала событий никем за пределами Meta не проверялась.

Только macOS и Linux. Разработчики на Windows работают либо через WSL, либо никак, что является реальным ограничением для корпоративных парков устройств, а не просто неудобством.

Только терминал. Никакого GUI, никакой интеграции с IDE и никаких облачных параллельных агентов вроде тех, что уже предлагает Codex. В материалах Meta о запуске не упоминается поддержка MCP.

Никакой опубликованной методологии за этими бенчмарк-графиками нет, и пока нет независимой оценки ни агента, ни субпоказателей кодирования Muse Spark 1.2. У Artificial Analysis есть композитный индекс для 1.2, но нет по-бенчмарковой разбивки по кодированию и агентским задачам, которую она публикует для 1.1 — а агентский результат 1.1 был самым слабым показателем с большим отрывом, что делает его именно той цифрой, которая решила бы вопрос об этом релизе.

Meta опаздывает.Claude Code и Codex уже год как вошли в привычку; вокруг них построены экосистемы плагинов и командные рабочие процессы. Устойчивый к сбоям журнал событий — хороший повод попробовать, но сам по себе не повод переводить команду.

Вопросы, которые люди на самом деле задают

Muse Code бесплатный?

Нет, но и подписки тоже нет — в отличие от планов Claude Code и Codex, с которыми он конкурирует, Muse Code тарифицируется чисто за токены через Meta Model API. Поэтому стоимость зависит от того, сколько контекста репозитория потребляют ваши сессии, а не от числа пользователей, что выгодно тем, кто иногда работает с большими объёмами, и невыгодно постоянно активным агентам. Тариф для контрибьюторов почти бесплатный, так что цена не является реальным препятствием для того, чтобы попробовать.

Обучается ли тарифный план «Контрибьютор» на моем приватном коде?

Условия Meta для этого тарифа таковы: данные могут использоваться для улучшения её моделей, а подсказки кодирующего агента содержат ваш код. Meta заявляет, что подсказки стандартного тарифа не используются для улучшения её продуктов; именно этот тариф следует применять ко всему проприетарному. Относитесь к выбору как к решению об обработке данных со скидкой, а не как к предпочтению по биллингу — и учтите, что скидка применяется за токен, так что стимул тихо перейти на более дешёвый тариф растёт ровно вместе с вашим объёмом использования.

Могу ли я использовать Muse Spark 1.2 с Claude Code или со своим собственным агентом?

Модель доступна через Meta Model API независимо от Muse Code, так что да — для всего, что принимает кастомный эндпоинт. Чего вы не получите, так это совместно обученной пары, которой Meta приписывает свои результаты бенчмарков, и честное ожидание таково: модель, запущенная вне стенда, на котором она настраивалась, покажет результат ниже цифры на графике. Если цель — оценить модель, а не агента, запустите её против Claude Opus 5 и GPT-5.6 Terra на собственном стенде и полностью игнорируйте презентацию.

Кто должен установить это на этой неделе?

Если вы запускаете долгосрочные автономные задачи — миграции, обновление зависимостей в монорепозитории, всё то, за чем вам сейчас приходится следить вручную, потому что агент теряет нить, — Muse Code стоит потраченного на черновой клон вечера. Журнал событий и постоянные фоновые агенты нацелены именно на этот тип сбоя, а отставание по бенчмаркам минимально как раз там, где задачи длятся дольше всего.

Если вы работаете с открытым кодом или кодом, не содержащим чувствительных данных, и стоимость для вас является решающим ограничением, тариф для контрибьюторов — самая интересная цифра на рынке кодинг-агентов прямо сейчас, и 0,66 цента за шаг — это не опечатка.

Если вы руководите командой, использующей Claude Code или Codex для работы с проприетарным репозиторием, здесь пока нет ничего, что заставило бы перейти. Muse Code занимает второе или третье место на всех досках, которые выбрал его собственный вендор, цены стандартного тарифа находятся на уровне конкурентов, а не ниже, а отличительной особенностью является свойство надёжности, которое никто за пределами Meta не тестировал. Следить стоит не за следующим бенчмарком, а за тем, выдержит ли журнал событий, когда кто-то, кто не работает в Meta, прогонит через него тысячу вызовов инструментов.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube