Muse Spark 1.2 и Muse Code-1
Guides & Insights

Muse Spark 1.2 и Muse Code: третья модель Meta за четыре месяца добивается ничьей с Grok 4.5

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Meta выпустила Muse Spark 1.2 5 августа 2026 года, через четыре недели после Muse Spark 1.1 и примерно через четыре месяца после первого Muse Spark. Эта версия появилась с тем, чего не было у двух предыдущих: собственным кодинг-агентом Meta, Muse Code, выпущенным в бета-версии и обученным совместно с моделью, на которой он работает. И на единственном табло, которое не контролируют ни Meta, ни её конкуренты, этот релиз выводит Meta в мёртвую ничью с SpaceXAI — Muse Spark 1.2 и Grok 4.5 теперь набирают по 54 балла в Artificial Analysis Intelligence Index.

Две вещи стоит разделить, прежде чем любые из приведённых ниже чисел обретут смысл. Оценка Intelligence Index, показатели задержки и количество токенов взяты из Artificial Analysis, который проводит собственные оценки и публикует результаты; эти данные независимы. Результаты по коду, с которых Meta начала своё объявление, — Terminal-Bench 2.1, DeepSWE v1.1 и внутренний бенчмарк — были получены Meta на собственном испытательном стенде, при этом каждая конкурирующая модель была сопряжена со своим агентным продуктом. Оба вида чисел полезны. Это не один и тот же вид доказательств, и в этой статье они разведены.

Что на самом деле выпустила Meta

Muse Spark 1.2 and Muse Code-2

Объявление, опубликованное в исследовательском блоге Meta по искусственному интеллекту и датированное 5 августа, касается сразу двух продуктов.

Muse Spark 1.2 — обновление семейства Muse Spark, ориентированное на программирование. Meta заявляет, что увеличила вычислительные ресурсы для обучения на задачах программирования и расширила разнообразие обучающих сред, сохранив при этом способность универсального агента, которая была главной особенностью версии 1.1. Заявленные цели обучения — долгосрочные: генерация целых репозиториев, крупные сквозные проекты и то, что Meta называет автоисследованиями, с планированием последовательности работы, целевой обусловленностью для удержания направления на протяжении многих шагов и сжатием контекста для поддержания актуального состояния при длительном сеансе.

Muse Code — терминальный агент для написания кода в бета-версии, устанавливаемый однострочным shell-скриптом с домена разработчиков Meta. Он запускает постоянных фоновых асинхронных агентов, которые сохраняются между сессиями, в локальной среде выполнения на основе журнала событий, которую Meta описывает как точно воспроизводимую и безопасную при перезапуске, и координирует несколько подагентов для каждой задачи в изолированных рабочих деревьях. В комплекте идут три встроенных навыка: /plan для планирования с подтверждением, /grill для стресс-тестирования уже проделанной работы и /goal для доведения задачи до конца.

{{1}}Связка здесь не случайна.{{/1}} Meta утверждает, что они обучались совместно — {{2}}модель настраивалась на траекториях, отобранных методом rejection sampling из харнесса, с оптимизацией рецепта под цели, компактизацию и субагентов{{/2}}. Это тот же приём совместного обучения, который дал Claude Code и Codex, и из этого следует вывод для всех, кто читает результаты бенчмарков: {{3}}ключевые показатели модели по кодингу были получены внутри того самого харнесса, на котором она обучалась{{/3}}. {{4}}Это не читерство, так теперь работает агентная оценка{{/4}}. Но это означает, что {{5}}результат 1.2, полученный на другом скаффолде, — это открытый вопрос, а не надёжное допущение{{/5}}.

Остальная часть спецификации не изменена по сравнению с 1.1, которая сама по себе носит информационный характер. Контекст остаётся на уровне 1,048,576 токенов. Рассуждение остаётся обязательным на пяти уровнях усилий — minimal, low, medium, high, xhigh — при этом medium используется по умолчанию; не существует конфигурации, в которой вы получаете веса, не заплатив за некоторое обдумывание. Веса закрыты, репозитория на Hugging Face нет, и собственный Model API от Meta остаётся единственным официальным местом для вызова модели.

43, затем 51, затем 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis оценивает Muse Spark 1.2 в 54 балла по своему Индексу интеллекта в режиме xhigh reasoning, что ставит её на 13-е место среди 185 моделей при медиане класса 32. Индекс представляет собой взвешенный состав из девяти оценок — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR — равномерно распределённых по агентам, программированию, общим возможностям и научным рассуждениям.

Если рассматривать это как серию, а не как моментальный снимок, траектория Meta — именно та история. Оригинальный Muse Spark набрал 43 балла в апреле. Muse Spark 1.1 достиг 51 балла 9 июля, что дало прирост на восемь пунктов за квартал. Muse Spark 1.2 добавляет ещё три пункта менее чем за месяц. Meta продвинулась на 11 индексных пунктов за четыре месяца и теперь выпускает обновления быстрее, чем экосистема оценки успевает за ними следить — для 1.2 до сих пор нет опубликованной разбивки по отдельным бенчмаркам, и вообще нет записи в Design Arena, в то время как для 1.1 есть и то и другое.

Пятьдесят четыре очка ставят Meta на один уровень с Grok 4.5 — моделью, которую SpaceXAI выпустила за день до Muse Spark 1.1, — и позади плотной группы лидеров: у Claude Opus 5 — 61, у Claude Fable 5 — 60, у GPT-5.6 Sol — 59. Отставание от верха — шесть или семь очков. Разрыв от уровня, с которого Meta начала год, — одиннадцать. Закроется ли он, зависит от того, сохранится ли темп, а Meta сейчас работает по четырёхнедельному циклу релизов.

Ничья по сводному индексу — это не ничья по конкретной задаче, и стоит сказать, что именно 54 решает, а что — нет. Она определяет, что Muse Spark 1.2 находится в одном ряду с Grok 4.5 по совокупным возможностям. Но она не говорит вам, кто из них лучше пишет патчи, потому что субиндекс программирования, который мог бы ответить на этот вопрос, для 1.2 ещё не опубликован.

Кодовые номера Meta, читай внимательно

Анонс Meta лидирует на трех графиках. На собственных запусках, сообщаемых как pass@1 по пяти попыткам, при этом каждая конкурирующая модель была сопоставлена со своим собственным агентом-продуктом:

Terminal-Bench 2.1 — 82.9% для Muse Spark 1.2, по сравнению с 76.2% для 1.1. Claude Opus 5 показан выше с 86.7%.

DeepSWE v1.1 — 59.3%, по сравнению с 53.0%.

Внутренний бенчмарк Meta по программированию — 70,6%, что выше 68,3%.

Дельты — вот чему стоит верить. Прирост на 6,7 пункта в Terminal-Bench и на 6,3 в DeepSWE, измеренный тем же способом, на том же харнессе и той же командой с разницей в месяц, — это разумная оценка того, насколько 1.2 улучшилась по сравнению с 1.1 в том, что оптимизировала Meta. А вот месту среди вендоров слишком доверять не стоит: подбор харнесса — это большая свободная переменная, и лаборатория, настраивающая свой харнесс вместе со своей моделью, не в состоянии настроить чужие столь же хорошо. Meta была второй на собственном слайде, что, по крайней мере, не типично для вендорского бенчмарка, но ни одна третья сторона на момент написания этого текста не воспроизвела ни одного из этих результатов.

Второй прайс-лист

Самое важное в этом релизе — не то, что видно на бенчмарк-графиках. Muse Spark 1.2 поставляется с двумя ценовыми списками.

Стандартный тариф — $1.25 за миллион входных токенов, $0.15 за миллион при попадании в кэш, $4.25 за миллион выходных. Без изменений по сравнению с 1.1, до цента. Ограничение скорости около 3 000 запросов в минуту. Привязка к веб-поиску тарифицируется отдельно: $2.50 за тысячу запросов.

Contributor tier — $0.10 за вход, $0.002 за кэшированный вход, $0.20 за выход. Это в 12,5 раза дешевле по входу и в 21,25 раза дешевле по выходу. Цена входа — разрешение Meta обучать будущие модели на вашем трафике, а также ограничение скорости 60 запросов в минуту — 2% от стандартного бюджета.

При цене $0.10 и $0.20 Muse Spark 1.2 будет дешевле почти всех моделей, близких к передовым, на рынке, включая бюджетный уровень с открытыми весами, которому он в остальном проигрывает по цене. Это интересная цифра в данном запуске, и это не столько ценовое решение. Шестьдесят запросов в минуту сами по себе исключают большинство производственных схем разветвления, поэтому этот уровень предназначен для экспериментов и работы небольших команд, а не для обслуживания. А вопрос «мы можем обучаться на вашем трафике» — это вопрос к тому, кто отвечает за управление данными в вашей организации, а не к тому, кто выбирает модели. Относитесь к этому как к юридической проверке со скидкой, а не как к более дешевому SKU.

Сколько стоит производство 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis публикует, сколько стоят её собственные оценочные прогоны, и именно в этой колонке проявляется форма Muse Spark 1.2. Прохождение набора из девяти бенчмарков обошлось в $637.85 и сожгло 95 миллионов выходных токенов, против $548.07 и 94 миллионов для Muse Spark 1.1 — при одинаковой цене за токен. Дополнительные 16% — это чистое обдумывание.

Показатели задержки меняются так же. При измерении на xhigh время до первого токена составляет 26,12 секунды для 1.2 против 2,90 секунды для 1.1, а скорость вывода падает с 213,5 до 165,0 токенов в секунду. Meta купила три пункта индекса за время размышлений, и конструкция с обязательными рассуждениями означает, что вы не можете отказаться от этой покупки — можно лишь выбрать, сколько её совершить.

Эти 26 секунд будут процитированы неверно, поэтому заранее даём поправку: это замер при самом затратном уровне усилий, который предоставляет модель, тогда как API по умолчанию использует средний. В качестве ориентира из реального трафика, а не из бенчмарк-стенда, Muse Spark 1.1, обслуживаемый через OrcaRouter — при том уровне усилий, который фактически запрашивают клиенты, — показывает за 7 дней p50 времени до первого токена 1.84 секунды и p95 6.00 секунд, при 519 токенах в секунду и нулевом уровне ошибок. Задержка в бенчмарке при максимальном уровне усилий и задержка в продакшене при уровне усилий по умолчанию — это разные величины, и обычно они отличаются на порядок. Воспринимайте 26.12 с как потолок для глубокого рассуждения, а не как то, что ощущается в реальном запросе.

Где вы можете позвонить сегодня

Muse Spark 1.2 обслуживается собственным Model API от Meta и, на момент написания, больше нигде — при запуске он не был доступен через OpenRouter, нет репозитория на Hugging Face, и его нет в каталоге OrcaRouter. Muse Spark 1.1 доступен по цене $1.25 и $4.25 — те же цифры, что взимает Meta, потому что OrcaRouter берёт 0% наценки и передаёт цену провайдера без изменений.

Это важнее для сравнения, чем для самой модели. Если вы строите модель затрат для этого релиза, модели, с которыми вы будете её сравнивать, — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — находятся за одним ключом по прейскурантной цене, поэтому цифра в вашей таблице — это цифра в счёте, и снижение цены провайдером вступает в силу в тот же день, а не после продления. Что касается именно Muse Spark 1.2, сегодня ответ — это эндпоинт Meta, второй контракт и отдельный счёт.

На что объявление не ответило

Отдельного показателя кодирования нет.Artificial Analysis публикует сводный показатель для 1.2, но пока не публикует субиндексы кодирования и агентности, которые она публиковала для 1.1 (71.3 и 37.5 соответственно). Поскольку агентная работа была самым слабым аспектом 1.1 с большим отрывом, а агентное кодирование — как раз то, что, по заявлениям 1.2, было исправлено, именно этот показатель поставил бы точку в вопросе о релизе.

Результаты испытаний не воспроизведены. Все показатели кодирования в анонсе получены самой Meta. Никто ещё не опубликовал результаты Muse Spark 1.2, полученные на нейтральном стенде.

Мультимодальная проверка не проводилась. В описании Muse Spark заявлена поддержка ввода текста, изображений, видео, аудио и PDF. Независимая оценка охватывает текст и изображения. Обмен сообщениями Meta 1.2 почти полностью перешёл на программную работу, а мультимедийный сценарий 1.1, который явно продавался, сейчас не имеет ни маркетинговой, ни измерительной поддержки.

Нет истории пропускной способности. Объем данных на конечной точке все еще слишком мал, чтобы обычная скользящая статистика задержек заполнилась.

Что посмотреть в ближайшие четыре недели

Три вещи определят, является ли этот релиз тем, чем его называет Meta. Первое — независимая агентная оценка для 1.2: если субиндекс, который на 1.1 составлял 37,5, существенно сдвинулся, тезис о кодинге реален. Второе — воспроизведёт ли кто-нибудь результат Terminal-Bench за пределами Muse Code; модель, которая работает только в собственной обвязке, — это продукт, а не возможность. Третье — что произойдёт с уровнем для контрибьюторов: если лимит в 60 запросов ослабнет, модель, близкая к передовому краю, с ценой $0,10 на входе и $0,20 на выходе изменит арифметику бюджетного уровня так, как не изменил бы никакой прирост индекса на три пункта.

И если этот темп сохранится, Muse Spark 1.3 должен выйти в начале сентября. Судя по всему, главный показатель при выходе — не индексный балл, а то, сможет ли Meta добавить функции, не добавляя ещё двадцать секунд размышлений перед каждым запросом.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube