Muse Code против Muse Spark 1.1: Что на самом деле измеряет обновление Meta на 6,7 балла
Guides & Insights

Muse Code против Muse Spark 1.1: Что на самом деле измеряет обновление Meta на 6,7 балла

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Сначала вычитание. Презентация Meta к запуску Muse Code — терминального ИИ-агента для написания кода, выпущенного 5 августа 2026 года, — сообщает о 82,9% на Terminal-Bench 2.1 и называет это улучшением на 6,7 пункта по сравнению сMuse Spark 1.1, моделью, за которую большинство читателей уже платят. Отнимите 6,7 от 82,9 и получите 76,2 — это не то число, которое опубликовала Meta, но именно такой результат указан в публичной таблице лидеров Terminal-Bench 2.1 для Muse Spark 1.1 при xhigh effort, представленный в июле и полученный с помощью мини-SWE-agent harness Принстона.

Это совпадение — самый полезный факт в этом сравнении, потому что mini-SWE-agent — это намеренно минимальный каркас: несколько сотен строк, ни постоянных субагентов, ни журнала событий, ни навыков планирования. Результат Meta в 82,9% — это Muse Spark 1.2, работающий внутри специально созданного агента, вместе с которым Meta обучала модель. Если эти две строки разделяет 6,7 пункта, то главный заявленный прирост между поколениями — это обновление модели и обновление каркаса, объединённые в одно число, и Meta не опубликовала ничего, что разделяло бы их.

Meta не сообщила, какой инструментарий использовался для её базовой линии 1.1, поэтому совпадение скорее предположительно, чем доказано. Но это переосмысляет решение для любого, кто сейчас вызывает Muse Spark 1.1 через API, — что является честной формулировкой этого сравнения: вы выбираете не между двумя моделями. Вы выбираете между моделью, которой управляете сами, и агентом, который управляет более новой моделью за вас, и только одна из этих двух вещей была измерена кем-то, кроме Meta.

Это не одна и та же категория, и в спецификации об этом сказано.

{{1}}Половина путаницы вокруг этой пары возникает из-за того, что Muse Code принимают за релиз модели.{{/1}} {{2}}Это не так. Это CLI, и называется он Muse Spark 1.2.{{/2}}

Что это — Muse Code — это терминальный агент, устанавливаемый одной командой (curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1 — это эндпоинт модели, который вы вызываете из своего кода, своего фреймворка для агентов или любого CLI, принимающего настраиваемый базовый URL.

Базовая модель — Muse Code работает на Muse Spark 1.2, обученной совместно с агентом; Muse Spark 1.1 — июльское поколение, всё ещё обслуживается и всё ещё в списке.

Где работает — Muse Code доступен только для macOS и Linux, только через терминал, без графического интерфейса и без расширения для IDE; Muse Spark 1.1 работает везде, где есть HTTPS, включая Windows.

Входные данные — Muse Code принимает репозиторий и промпт; Muse Spark 1.1 принимает текст, изображения, видео, аудио и PDF-документы в одном контексте на 1 048 576 токенов и возвращает текст.

Статус — Muse Code доступен как публичная бета-версия и помечен как таковой; Muse Spark 1.1 находится в общем доступе с июля 2026 года и обрабатывает реальный производственный трафик.

Прейскурантная цена — обе тарифицируются через Meta Model API по цене $1.25 за миллион входных токенов, $0.15 за кэшированный ввод и $4.25 за вывод на стандартном тарифе. Тарифная сетка такая же.

Последняя строка — та, что удивляет людей, и она убивает очевидное предположение. Принятие Muse Code не стоит больше за токен, чем то, что вы уже используете. Его цена измеряется в других валютах — поддержка платформ, задержка, модальность и, на дешёвом тарифе, ваш исходный код. Вот четыре оси, о которых стоит спорить.

Бенчмарк, на котором они расходятся, считанный с подключенной обвязкой

Meta опубликовала две дельты между поколениями по сравнению с Muse Spark 1.1: +6,7 балла на Terminal-Bench 2.1 и +6,3 на DeepSWE 1.1. Оба значения предоставлены самой компанией, оба взяты из графиков, опубликованных в виде изображений без описания методологии, и ни одно из них не было воспроизведено третьей стороной. Если исключить их, подразумеваемые базовые показатели 1.1 от Meta составят примерно 76,2% и 53,0%.

Теперь поставьте 82,9% Meta рядом с лидербордом, на который она не ссылалась. Публичный лидерборд Terminal-Bench 2.1 на момент написания показывает Claude Code в паре с Claude Fable 5 — 83,8% ± 1,2%, Codex с GPT-5.5 — 83,1% ± 1,1%, Terminus 2 с Claude Fable 5 — 80,4%, Cursor CLI с Grok 4.5 — 79,3%, и mini-SWE-agent с Muse Spark 1.1 — 76,2% на восьмом месте. Самозаявленные 82,9% Muse Code оказались бы на третьем месте — ниже двух пар «агент-модель», которых нет в презентации Meta, которая вместо этого сравнивает с Claude Opus 5 — 86,7%, GPT-5.6 Terra — 81,8% и Grok 4.5 — 81,6% в отдельных запусках при максимальном усилии.

Две таблицы лидеров, один бенчмарк, цифры, которые не сходятся, — и совсем третья шкала, если заглянуть в Artificial Analysis, чья независимая оценка Terminal-Bench v2.1 достигает почти 89,5% для GPT-5.6 Sol при потолке 83,8% в публичной таблице лидеров. Никто из этих сторон не лжёт. Строка в Terminal-Bench — это результат для стенда плюс модели плюс настройки усилий плюс выделенных вычислений, и замена любого из этих компонентов сдвигает результат сильнее, чем весь разброс, который Meta выдаёт за поколение.

Именно поэтому интересный показатель на публичной доске — это не колонка точности, а колонка стоимости. Muse Spark 1.1 завершил свой прогон на 76,2% за $198.05. Claude Code с Claude Fable 5 получил свои 83,8% за $552.67, а Codex с GPT-5.5 заплатил $2,059.19 за 83,1%. Это 7,6 пункта точности при 2,8-кратной стоимости в первом случае и примерно 10-кратной во втором — измерено тем же оператором, на тех же задачах, по тем же правилам, что и есть то самое честное сравнение, которого график Meta не даёт. Доска также вычитает баллы за задачи, решённые путём эксплуатации окружения; в заявке Muse Spark 1.1 такого вычета нет, а результат Cursor CLI с Grok 4.5 несёт вычет в 9 пунктов.

Meta не раскрыла стоимость своих 82.9%.

Что Muse Spark 1.1 уже делает, чего Muse Code не может

Суть Muse Code в том, что совместно обученный агент превосходит «универсальную обёртку вокруг внешней модели» — формулировка Meta, утверждение Meta, никем другим не проверенное. Это разумное заявление. Оно также нацелено на пробел, для закрытия которого специально создавался Muse Spark 1.1.

Muse Spark 1.1 нативно общается по Model Context Protocol, сам управляет своими MCP-подключениями без внешнего фреймворка, внутренне оркестрирует роли основного агента и субагента и обобщается zero-shot на новые инструменты и пользовательские навыки. Собственные цифры Meta при запуске для него были цифрами использования инструментов: 88.1 в MCP Atlas для масштабированного использования инструментов — опережая 82.2, которые она сообщала для Claude Opus 4.8, и 75.3 для GPT-5.5 — а также 54.7 на JobBench. Все данные от вендора, все за июль, никем независимо не воспроизведены. Тем не менее суть остаётся: 1.1 — это не чат-модель, к которой кто-то прикрутил агента. Закиньте её в OpenCode, Cline или любой CLI, принимающий кастомную конечную точку, — и у вас сегодня агент.

И ещё есть всё, чего Muse Code структурно коснуться не может. Muse Spark 1.1 работает с изображениями, видео, аудио и PDF-файлами в одном контекстном окне. Терминальному агенту кодирования эта возможность бесполезна, и он не может её предоставить. Если ваша рабочая нагрузка — это дизайн-макет, превращённый в компоненты, транскрибированный и обработанный звонок в поддержку или 400-страничная спецификация, сверенная с реализацией, то более новый инструмент оказывается менее функциональным — и позиционирование Meta для поколения 1.2 сдвинулось от «мультимодального глубокого исследования смешанных медиа» к многофайловым рефакторингам и генерации целого репозитория, и никто не опубликовал никаких видео- или аудиорезультатов для 1.2.

Настоящая асимметрия действует в обратную сторону: это свойство времени выполнения, а не возможность. Muse Code добавляет каждый вызов модели, запуск инструмента, подтверждение и правку в локальный журнал событий, что, по словам Meta, делает сеанс точно воспроизводимым и безопасным для перезапуска: если произойдёт сбой, агент продолжит с того места, где остановился, вместо того чтобы заново восстанавливать свой контекст. Его фоновые агенты сохраняются на протяжении всего сеанса, а не порождаются и уничтожаются для каждой подзадачи. Доказательство Meta — это единственный пример из практики: 24-часовой прогон с более чем 1000 вызовов инструментов для оптимизации GPU-ядер на оборудовании NVIDIA Hopper. Никаких цифр ускорения опубликовано не было, так что утверждение касается именно длительности. Если вы когда-нибудь теряли девятичасовую миграцию из-за того, что обвязка на шаге 300 забыла, что делает, — это действительно то, чего стоит хотеть, и никакая поддержка MCP в модели вам этого не даст.

Та же цена, пока вы не посмотрите на второй уровень.

Поскольку стандартный тариф идентичен с обеих сторон, весь ценовой аргумент в этом сравнении заключается в тарифе, который Meta представила вместе с Muse Code. Тариф contributor стоит $0,10 за миллион входных токенов, $0,002 за кэшированный ввод и $0,20 за вывод — в 12,5 раза дешевле по вводу, в 21 раз по выводу и в 75 раз по кэшированному вводу — в обмен на явное разрешение использовать ваши промпты и завершения для обучения будущих моделей Meta. Трафик стандартного тарифа, как заявляет Meta, таким образом не используется.

Прогоните через него реалистичный шаг агента — 60 000 токенов контекста репозитория на входе, 3 000 токенов плана и патча на выходе — и тысяча шагов будет стоить $87,75 на стандартном тарифе с холодным кэшем, $21,75 при попадании контекста репозитория в кэш, $6,60 на тарифе контрибьютора с холодным кэшем и $0,72 на тарифе контрибьютора с тёплым кэшем. Собственный 24-часовой прогон ядра Meta обходится почти в девяносто долларов на тарифе, защищающем ваш код, и меньше чем в доллар на тарифе, который не защищает.

Это не вопрос биллинга. Промпты кодирующего агента являются вашей кодовой базой — внутренними API, комментарием, объясняющим, почему существует обходное решение, всем, что бы ни содержалось в ваших фикстурах. Для дерева с открытым исходным кодом тариф контрибьютора — почти бесплатные деньги. Для проприетарного репозитория это решение о лицензировании данных, замаскированное под скидку, и его должен утверждать тот, кто отвечает за обработку данных, а не тот, кто следит за облачным счётом. Meta установила скидку в 12x, потому что данные стоят для Meta по крайней мере столько.

Оставаясь на Muse Spark 1.1, вы полностью обходите этот вопрос стороной, и стоит точно знать, чего это стоит и где. Muse Spark 1.1 есть в каталоге OrcaRouter по цене $1.25 и $4.25 — это прайс-лист Meta с точностью до цента, потому что мы добавляем 0% наценки и передаём цены провайдера без изменений; именно поэтому изменение тарифов Meta появляется у нас в тот же день, когда Meta его вносит, а не после контрактного цикла. Наша семидневная производственная телеметрия показывает для него p50 времени до первого токена на уровне 1.84 секунды и p95 на уровне 6.00 секунд — это гораздо более полезный ориентир, чем любой бенчмарк-стенд. Muse Spark 1.2 не входит в наш каталог; его предоставляет напрямую только Meta и больше никто, так что у новой половины этого сравнения сейчас ровно один провайдер и, по построению, нет пути отказоустойчивого переключения. Если вы его оцениваете, зависимость от единственного поставщика — часть того, что вы оцениваете.

Компромисс с задержкой, о котором никто не упоминает в освещении запуска.

Artificial Analysis, проводя независимые измерения при максимальном усилии рассуждения каждой модели, зафиксировала время до первого токена у Muse Spark 1.1 на уровне 2,90 секунды и у Muse Spark 1.2 — на уровне 26,12 секунды. Скорость вывода упала с 213,5 до 165 токенов в секунду. Прирост составил три пункта индекса Intelligence Index — с 51 до 54 — и подъём с #22 на #13 место из 185 моделей.

Как универсальная модель, выпущенная для общего пользования, это плохая сделка — в девять раз дольше ожидание ради трёх очков. Как движок для кодинг-агента это, очевидно, правильный выбор, потому что никто, кто ждёт рефакторинг из двенадцати файлов, не замечает двадцать шесть секунд планирования, а все, кто ждёт ответ в чате, замечают каждую из них. Это самое ясное утверждение того, для кого предназначена каждая сторона этого сравнения, и оно было измерено третьей стороной, а не заявлено самой Meta.

Это также означает, что переход не даётся бесплатно, даже если вас волнует только код. Любое интерактивное взаимодействие, которое вы направили на Muse Spark 1.1 — встроенное завершение кода, бот для ревью, чат-поверхность над вашими документами — становится существенно хуже, если вы с большими усилиями переносите его на поколение 1.2. Обновление точечное, а у точечности есть направление.

Какой из них вам на самом деле следует запускать

Оставайтесь на Muse Spark 1.1, если ваша работа не связана с репозиторием. Мультимодальные конвейеры, анализ длинного контекста, исследования со смешанными медиа, всё интерактивное, всё на Windows, всё, что уже подключено через MCP и работает. Ничто в релизе Muse Code не улучшает их, а измерение задержки делает по крайней мере одно из них хуже.

Попробуйте Muse Code, если ваша проблема — длительность. Миграции монорепозиториев, обновления зависимостей, недельные рефакторинги — задачи, которые вам сейчас приходится контролировать вручную, потому что агент теряет нить. Журнал событий и постоянные фоновые агенты нацелены именно на это, а отставание в несколько пунктов по бенчмаркам имеет наименьшее значение там, где прогон самый длинный. Бета, на временном клоне, на репозитории, который вам не жалко потерять.

Проведите честный эксперимент, если пытаетесь выбрать модель. Зафиксируйте свой тестовый стенд и замените Muse Spark 1.1 на Muse Spark 1.2 под ним. Это изолирует единственную переменную, которую смешивает график Meta, и это единственный способ выяснить, реальна ли премия за совместное обучение или же 1.2 — просто компетентная модель для кодинга, где бы вы её ни использовали. Единый шлюз превращает это в правку одной строки, а не в закупочную процедуру — Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5 и Claude Fable 5 находятся за одним ключом OrcaRouter по прайс-листу с автоматическим переключением между провайдерами, так что этот набор для сравнения ничего не стоит держать наготове. Muse Spark 1.2 — исключение, и её нужно получать от Meta.

Вопросы, которые стоит задать, прежде чем что-либо устанавливать

Можно ли указать Muse Code на Muse Spark 1.1 вместо 1.2?

В материалах запуска Meta об этом не говорится; обе модели были выпущены как совместно обученная пара, что является аргументом против того, что это поддерживается или полезно. Обратное направление, однако, хорошо задокументировано: Muse Spark 1.1 работает в любом агенте, который принимает пользовательский эндпоинт, и именно так большинство людей сегодня используют его в качестве агента. Если ваша цель — контролируемое сравнение, запускайте 1.1 и 1.2 в вашем харнесе, а не пытайтесь подогнать Meta's.

Распространяется ли уровень контрибьютора на Muse Spark 1.1?

Meta представила двухуровневую структуру с запуском Muse Code и Muse Spark 1.2, и опубликованный прайс-лист привязывает цены для контрибьюторов к этому релизу. Исходите из того, что скидка 12x — это предложение поколения 1.2, пока Meta не заявит иное, и оценивайте любую рабочую нагрузку 1.1 в $1.25 и $4.25. Если вы на OrcaRouter, вы по определению находитесь на прайс-листе, так что не существует уровня обмена данными, в который можно было бы вступить или из которого можно было бы выйти.

Тогда утверждение о 6,7 пункта неверно?

Нет — это не прошло аудит и недостаточно специфицировано, что совсем другое. Meta вполне могла запустить свою базовую модель 1.1 в окружении, сопоставимом с Muse Code, и тогда прирост — это чистый результат сравнения модели с моделью. Но методология не публиковалась, подразумеваемый базовый показатель точно совпадает с оценкой минимального стороннего каркаса, и один и тот же бенчмарк даёт три разные шкалы в зависимости от того, кто его запускает. Относитесь к +6.7 как к ориентировочному значению и получите собственную оценку, прежде чем строить планы на его основе.

Что могло бы это уладить?

Одна подача. Если Meta разместит Muse Code на публичной таблице лидеров Terminal-Bench 2.1 по тем же правилам, по которым подавались все остальные — без изменённых таймаутов или ресурсов, с заполненной колонкой стоимости и применёнными вычетами за взлом — 82,9% станет сопоставимо с 76,2% рядом с именем Muse Spark 1.1 и с 83,8% на вершине, и весь этот спор разрешится за один день. До тех пор единственный независимо проверенный показатель в этом противостоянии принадлежит более старой модели, и он говорит, что Muse Spark 1.1 решил три четверти Terminal-Bench 2.1 внутри каркаса, достаточно маленького, чтобы прочитать его за один присест, менее чем за двести долларов.

Второе, за чем стоит наблюдать, имеет более узкий охват и произойдёт раньше: опубликует ли Artificial Analysis подпоказатели по кодингу и агентности для поколения 1.2, которые она уже публикует для 1.1. Агентная производительность была самым слабым опубликованным показателем 1.1 с большим отрывом. Это именно та цифра, которую, по утверждению Meta, исправили, и именно та, которую никто за пределами Meta ещё не измерил.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube