Muse Spark 1.2 и Muse Code-1
Guides & Insights

Muse Spark 1.2 и Muse Code: третья модель Meta за четыре месяца добивается ничьей с Grok 4.5

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Meta выпустила Muse Spark 1.2 5 августа 2026 года, через четыре недели после Muse Spark 1.1 и примерно через четыре месяца после первого Muse Spark. Эта версия появилась с тем, чего не было у двух предыдущих: собственным кодинг-агентом Meta, Muse Code, выпущенным в бета-версии и обученным совместно с моделью, на которой он работает. И в одном рейтинге, который не контролируют ни Meta, ни её конкуренты, этот выпуск ставит Meta на один уровень с SpaceXAI — Muse Spark 1.2 и Grok 4.5 теперь набирают по 54 балла в Artificial Analysis Intelligence Index. Пять дней спустя произошло более важное событие: 10 августа Meta заявила, что откроет веса Muse Spark 1.2 — заявление, которое, если оно осуществится, сделает эту модель самым сильным на сегодняшний день американским конкурентом китайских моделей, имеющим открытые веса.

Две вещи стоит разделить, прежде чем любые из приведённых ниже чисел обретут смысл. Оценка Intelligence Index, показатели задержки и количество токенов взяты из Artificial Analysis, который проводит собственные оценки и публикует результаты; эти данные независимы. Результаты по коду, с которых Meta начала своё объявление, — Terminal-Bench 2.1, DeepSWE v1.1 и внутренний бенчмарк — были получены Meta на собственном испытательном стенде, при этом каждая конкурирующая модель была сопряжена со своим агентным продуктом. Оба вида чисел полезны. Это не один и тот же вид доказательств, и в этой статье они разведены.

Что на самом деле выпустила Meta

Muse Spark 1.2 and Muse Code-2

Объявление, опубликованное в исследовательском блоге Meta по искусственному интеллекту и датированное 5 августа, касается сразу двух продуктов.

Muse Spark 1.2 — обновление семейства Muse Spark, ориентированное на программирование. Meta заявляет, что увеличила вычислительные ресурсы для обучения на задачах программирования и расширила разнообразие обучающих сред, сохранив при этом способность универсального агента, которая была главной особенностью версии 1.1. Заявленные цели обучения — долгосрочные: генерация целых репозиториев, крупные сквозные проекты и то, что Meta называет автоисследованиями, с планированием последовательности работы, целевой обусловленностью для удержания направления на протяжении многих шагов и сжатием контекста для поддержания актуального состояния при длительном сеансе.

Muse Code — терминальный агент для написания кода в бета-версии, устанавливаемый однострочным shell-скриптом с домена разработчиков Meta. Он запускает постоянных фоновых асинхронных агентов, которые сохраняются между сессиями, в локальной среде выполнения на основе журнала событий, которую Meta описывает как точно воспроизводимую и безопасную при перезапуске, и координирует несколько подагентов для каждой задачи в изолированных рабочих деревьях. В комплекте идут три встроенных навыка: /plan для планирования с подтверждением, /grill для стресс-тестирования уже проделанной работы и /goal для доведения задачи до конца.

{{1}}Связка здесь не случайна.{{/1}} Meta утверждает, что они обучались совместно — {{2}}модель настраивалась на траекториях, отобранных методом rejection sampling из харнесса, с оптимизацией рецепта под цели, компактизацию и субагентов{{/2}}. Это тот же приём совместного обучения, который дал Claude Code и Codex, и из этого следует вывод для всех, кто читает результаты бенчмарков: {{3}}ключевые показатели модели по кодингу были получены внутри того самого харнесса, на котором она обучалась{{/3}}. {{4}}Это не читерство, так теперь работает агентная оценка{{/4}}. Но это означает, что {{5}}результат 1.2, полученный на другом скаффолде, — это открытый вопрос, а не надёжное допущение{{/5}}.

Остальная часть спецификации остаётся без изменений относительно версии 1.1, которая сама по себе носит информативный характер. Контекст остаётся на уровне 1 048 576 токенов. Рассуждение остаётся обязательным на пяти уровнях усилий — minimal, low, medium, high, xhigh — со средним уровнем по умолчанию; не существует конфигурации, при которой вы получаете веса без каких-либо вычислительных затрат на обдумывание. На момент запуска веса были закрыты: не существовало репозитория Hugging Face, а единственным собственным (first-party) способом вызова модели был Model API от Meta. Теперь это должно измениться: 10 августа Meta объявила, что откроет веса, отменив политику закрытых весов, действовавшую для первых трёх выпусков Muse Spark.

43, затем 51, затем 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis оценивает Muse Spark 1.2 в 54 балла по своему Индексу интеллекта в режиме xhigh reasoning, что ставит её на 13-е место среди 185 моделей при медиане класса 32. Индекс представляет собой взвешенный состав из девяти оценок — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR — равномерно распределённых по агентам, программированию, общим возможностям и научным рассуждениям.

Если рассматривать это как серию, а не как моментальный снимок, траектория Meta — именно та история. Оригинальный Muse Spark набрал 43 балла в апреле. Muse Spark 1.1 достиг 51 балла 9 июля, что дало прирост на восемь пунктов за квартал. Muse Spark 1.2 добавляет ещё три пункта менее чем за месяц. Meta продвинулась на 11 индексных пунктов за четыре месяца и теперь выпускает обновления быстрее, чем экосистема оценки успевает за ними следить — для 1.2 до сих пор нет опубликованной разбивки по отдельным бенчмаркам, и вообще нет записи в Design Arena, в то время как для 1.1 есть и то и другое.

Пятьдесят четыре очка ставят Meta на один уровень с Grok 4.5 — моделью, которую SpaceXAI выпустила за день до Muse Spark 1.1, — и позади плотной группы лидеров: у Claude Opus 5 — 61, у Claude Fable 5 — 60, у GPT-5.6 Sol — 59. Отставание от верха — шесть или семь очков. Разрыв от уровня, с которого Meta начала год, — одиннадцать. Закроется ли он, зависит от того, сохранится ли темп, а Meta сейчас работает по четырёхнедельному циклу релизов.

Ничья по сводному индексу — это не ничья по конкретной задаче, и стоит сказать, что именно 54 решает, а что — нет. Она определяет, что Muse Spark 1.2 находится в одном ряду с Grok 4.5 по совокупным возможностям. Но она не говорит вам, кто из них лучше пишет патчи, потому что субиндекс программирования, который мог бы ответить на этот вопрос, для 1.2 ещё не опубликован.

Кодовые номера Meta, читай внимательно

Анонс Meta лидирует на трех графиках. На собственных запусках, сообщаемых как pass@1 по пяти попыткам, при этом каждая конкурирующая модель была сопоставлена со своим собственным агентом-продуктом:

Terminal-Bench 2.1 — 82.9% для Muse Spark 1.2, по сравнению с 76.2% для 1.1. Claude Opus 5 показан выше с 86.7%.

DeepSWE v1.1 — 59.3%, по сравнению с 53.0%.

Внутренний бенчмарк Meta по программированию — 70,6%, что выше 68,3%.

Дельты — вот чему стоит верить. Прирост на 6,7 пункта в Terminal-Bench и на 6,3 в DeepSWE, измеренный тем же способом, на том же харнессе и той же командой с разницей в месяц, — это разумная оценка того, насколько 1.2 улучшилась по сравнению с 1.1 в том, что оптимизировала Meta. А вот месту среди вендоров слишком доверять не стоит: подбор харнесса — это большая свободная переменная, и лаборатория, настраивающая свой харнесс вместе со своей моделью, не в состоянии настроить чужие столь же хорошо. Meta была второй на собственном слайде, что, по крайней мере, не типично для вендорского бенчмарка, но ни одна третья сторона на момент написания этого текста не воспроизвела ни одного из этих результатов.

Второй прайс-лист

Самое важное в этом релизе — не то, что видно на бенчмарк-графиках. Muse Spark 1.2 поставляется с двумя ценовыми списками.

Стандартный тариф — $1.25 за миллион входных токенов, $0.15 за миллион при попадании в кэш, $4.25 за миллион выходных. Без изменений по сравнению с 1.1, до цента. Ограничение скорости около 3 000 запросов в минуту. Привязка к веб-поиску тарифицируется отдельно: $2.50 за тысячу запросов.

Contributor tier — $0.10 за вход, $0.002 за кэшированный вход, $0.20 за выход. Это в 12,5 раза дешевле по входу и в 21,25 раза дешевле по выходу. Цена входа — разрешение Meta обучать будущие модели на вашем трафике, а также ограничение скорости 60 запросов в минуту — 2% от стандартного бюджета.

При цене $0.10 и $0.20 Muse Spark 1.2 будет дешевле почти всех моделей, близких к передовым, на рынке, включая бюджетный уровень с открытыми весами, которому он в остальном проигрывает по цене. Это интересная цифра в данном запуске, и это не столько ценовое решение. Шестьдесят запросов в минуту сами по себе исключают большинство производственных схем разветвления, поэтому этот уровень предназначен для экспериментов и работы небольших команд, а не для обслуживания. А вопрос «мы можем обучаться на вашем трафике» — это вопрос к тому, кто отвечает за управление данными в вашей организации, а не к тому, кто выбирает модели. Относитесь к этому как к юридической проверке со скидкой, а не как к более дешевому SKU.

Сколько стоит производство 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis публикует, сколько стоят её собственные оценочные прогоны, и именно в этой колонке проявляется форма Muse Spark 1.2. Прохождение набора из девяти бенчмарков обошлось в $637.85 и сожгло 95 миллионов выходных токенов, против $548.07 и 94 миллионов для Muse Spark 1.1 — при одинаковой цене за токен. Дополнительные 16% — это чистое обдумывание.

Показатели задержки меняются так же. При измерении на xhigh время до первого токена составляет 26,12 секунды для 1.2 против 2,90 секунды для 1.1, а скорость вывода падает с 213,5 до 165,0 токенов в секунду. Meta купила три пункта индекса за время размышлений, и конструкция с обязательными рассуждениями означает, что вы не можете отказаться от этой покупки — можно лишь выбрать, сколько её совершить.

Эти 26 секунд будут процитированы неверно, поэтому заранее даём поправку: это замер при самом затратном уровне усилий, который предоставляет модель, тогда как API по умолчанию использует средний. В качестве ориентира из реального трафика, а не из бенчмарк-стенда, Muse Spark 1.1, обслуживаемый через OrcaRouter — при том уровне усилий, который фактически запрашивают клиенты, — показывает за 7 дней p50 времени до первого токена 1.84 секунды и p95 6.00 секунд, при 519 токенах в секунду и нулевом уровне ошибок. Задержка в бенчмарке при максимальном уровне усилий и задержка в продакшене при уровне усилий по умолчанию — это разные величины, и обычно они отличаются на порядок. Воспринимайте 26.12 с как потолок для глубокого рассуждения, а не как то, что ощущается в реальном запросе.

Где вы можете позвонить сегодня

Muse Spark 1.2 обслуживается собственным Model API от Meta и, на момент написания, больше нигде — репозитория на Hugging Face всё ещё нет, и в каталоге OrcaRouter его тоже нет. Именно это должно изменить объявление от 10 августа: Meta говорит, что веса станут открытыми «в ближайшие недели», и как только это произойдёт, вопрос доступности сместится с «где это обслуживается?» на «какие веса, под какой лицензией и в каких средах выполнения». Muse Spark 1.1 есть в каталоге OrcaRouter по цене $1.25 и $4.25 — те же цифры, которые взимает Meta, потому что OrcaRouter берёт 0% наценки и передаёт цену провайдера без изменений.

Это важнее для сравнения, чем для самой модели. Если вы строите модель затрат для этого релиза, модели, с которыми вы бы его сравнивали, — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash, — доступны по одному ключу по прейскурантной цене, так что цифра в вашей таблице равна цифре в счёте, а снижение цены провайдером вступает в силу в тот же день, а не после продления. Что касается именно Muse Spark 1.2, сегодня ответ — это эндпоинт Meta, второй контракт и отдельный счёт, а когда появятся веса, установка на собственных мощностях станет третьим вариантом.

Что изменилось 10 августа

Через пять дней после релиза позиция Meta в отношении собственного флагмана изменилась. В объявлении от 10 августа Meta сообщила, что откроет веса Muse Spark 1.2 «в ближайшие недели», что сделает это первым выпуском Muse Spark, который команда сможет запустить самостоятельно. Это заявление на уровне руководства, а не фактический релиз: репозитория на Hugging Face пока нет, а точная дата, количество параметров и лицензия остаются неподтверждёнными.

Ставки — это гонка за frontier-веса. Muse Spark 1.2 набирает 54 балла в Artificial Analysis Intelligence Index — выше, чем любая американская модель с открытыми весами, доступная для загрузки, — так что если веса появятся, как обещано, это будет сильнейший американский конкурент с открытыми весами для китайских лабораторий. Такую рамку Цукерберг подробно изложил 10 августа в эссе на 6 500 слов, обвинив ограничения США на обучающие данные в том, что они отдают лидерство в открытых весах зарубежным лабораториям. У этого разворота уже есть первая поставка: Muse Glimmer, модель с 30 миллиардами параметров, выпущенная в тот же день под лицензией Apache 2.0, дистиллированная из Muse Spark и предназначенная для локальных агентных задач. Собственные бенчмарки Meta ставят её выше Google Gemma4-31B и Qwen3.6-27B по агентным задачам; эти показатели предоставлены вендором и пока не воспроизведены независимо.

На что объявление не ответило

Отдельного показателя кодирования нет.Artificial Analysis публикует сводный показатель для 1.2, но пока не публикует субиндексы кодирования и агентности, которые она публиковала для 1.1 (71.3 и 37.5 соответственно). Поскольку агентная работа была самым слабым аспектом 1.1 с большим отрывом, а агентное кодирование — как раз то, что, по заявлениям 1.2, было исправлено, именно этот показатель поставил бы точку в вопросе о релизе.

Результаты испытаний не воспроизведены. Все показатели кодирования в анонсе получены самой Meta. Никто ещё не опубликовал результаты Muse Spark 1.2, полученные на нейтральном стенде.

Мультимодальная проверка не проводилась. В описании Muse Spark заявлена поддержка ввода текста, изображений, видео, аудио и PDF. Независимая оценка охватывает текст и изображения. Обмен сообщениями Meta 1.2 почти полностью перешёл на программную работу, а мультимедийный сценарий 1.1, который явно продавался, сейчас не имеет ни маркетинговой, ни измерительной поддержки.

Нет истории пропускной способности. Объем данных на конечной точке все еще слишком мал, чтобы обычная скользящая статистика задержек заполнилась.

Что посмотреть в ближайшие четыре недели

Четыре вещи определят, соответствует ли этот релиз тому, что заявляет Meta. Первая — независимая агентная оценка для 1.2: если субиндекс, составлявший 37.5 в 1.1, существенно сдвинулся, заявление о кодинг-возможностях — не пустой звук. Вторая — воспроизведёт ли кто-нибудь результат Terminal-Bench за пределами Muse Code; модель, которая показывает результат только в собственной тестовой среде, — это продукт, а не возможность. Третья — что произойдёт с тарифом для контрибьюторов: если лимит в 60 запросов ослабнет, модель, близкая к передовым, с ценой $0.10 на входе и $0.20 на выходе изменит арифметику бюджетного тарифа так, как не изменил бы трёхпунктовый прирост индекса. Четвёртая — обещание по весам: Meta говорит, что веса Muse Spark 1.2 откроются «в ближайшие недели», и появится ли репозиторий в эти сроки — под какой лицензией и как быстро локальные среды выполнения его подхватят — определит, реален ли разворот в сторону открытых весов.

И если этот темп сохранится, Muse Spark 1.3 выйдет в начале сентября. Судя по всему, при выходе стоит следить не за индексным показателем, а за тем, сможет ли Meta добавлять возможности, не увеличивая время размышлений перед каждым запросом ещё на двадцать секунд. Первый плод этого разворота уже вышел: Muse Glimmer — модель с открытым весом на 30 миллиардов параметров, выпущенная Meta 10 августа под лицензией Apache 2.0 и предназначенная для локального запуска агентов. Это самый близкий предварительный взгляд на то, как будет выглядеть открытая Muse Spark 1.2.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно