Muse Spark 1.2 против Muse Spark 1.1-1
Guides & Insights

Muse Spark 1.2 против Muse Spark 1.1: стоит ли обновляться?

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Meta заменила Muse Spark 1.1 на Muse Spark 1.2 5 августа 2026 года, не меняя цену, контекстное окно, список модальностей, поддерживаемые параметры или регулятор рассуждений. Поэтому миграция выглядит бесплатной — то же семейство модельных строк, те же тарифы, ничего не нужно пересматривать. Но это не бесплатно. Независимые измерения показывают, что время до первого токена у новой версии составляет 26,12 секунды против 2,90 у старой, а устойчивая скорость вывода — 165 токенов в секунду против 213,5. Вы покупаете три пункта измеренного интеллекта и примерно девятикратное ожидание, прежде чем что-либо вернётся.

Стоит ли этим заниматься, почти полностью зависит от того, как долго выполняются ваши задачи. Вот что на самом деле отличается, что осталось неизменным и чего пока никто не может вам сказать.

Решение в четырёх строках

• Индекс интеллекта: 51 → 54, независимо измеренный компанией Artificial Analysis при настройке xhigh каждой версии.

• Время до первого токена: 2.90s → 26.12s, тот же источник, те же условия.

• Стоимость запуска идентичного набора бенчмарков: $548.07 → $637.85, при той же цене за токен. Дополнительные 16% — это чистый расход токенов.

• Все, о чем спрашивает форма закупки: без изменений.

Muse Spark 1.2 vs Muse Spark 1.1-2

Что действительно идентично

Это стоит перечислить, потому что именно поэтому миграция выглядит тривиальной на бумаге, и потому что различие, которого не существует, — это то, что вам не нужно проверять.

Цена — $1.25 за миллион входных токенов, $4.25 за миллион выходных токенов, $0.15 за миллион при попадании в кэш, $2.50 за тысячу встроенных веб-поисков. Все эти цифры одинаковы в обеих версиях.

Контекст — 1 048 576 токенов у обоих, и ни у одного из них нет тарифа с надбавкой за длинный контекст.

Модальности — текст, изображения, видео, аудио и PDF на входе; текст на выходе. Оба объявления указывают одни и те же пять типов входных данных.

Регулятор рассуждений — обязателен в обеих версиях, пять уровней (минимальный, низкий, средний, высокий, сверхвысокий), по умолчанию средний в обеих. Ни в одной версии нет настройки, отключающей мышление.

Параметры — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Идентичные списки.

Развёртывание — один провайдер, сама Meta, на обоих. Никаких сторонних хостов, никаких вариантов квантования.

Смешанная цена — Artificial Analysis оценивает обе модели в $0,78 за миллион токенов при смешанном взвешивании, чего и следовало ожидать от одинаковых прайс-листов.

Если вы надеялись, что обновление принесёт больше контекста, гарантию длины ответа или более дешёвый кэш, — этого не произошло. Это релиз с обновлением весов и пост-обучением, а тарифная карточка скопирована из предыдущей версии.

Что на самом деле изменилось?

Artificial Analysis в настоящее время является единственной независимой стороной, оценившей обе версии, и она оценивала их при максимальном усилии рассуждения, поэтому сравнение является сопоставимым.

Intelligence Index — 51 для 1.1 (место #22 из 185) до 54 для 1.2 (место #13). Девять позиций в таблице, где медиана класса составляет 32, поэтому прирост даёт реальную позицию, а не просто десятичное значение.

Время до первого токена — от 2.90с до 26.12с. Это главная регрессия, и она отнюдь не незначительна.

Скорость вывода — от 213,5 до 165,0 токенов в секунду. По-прежнему занимает 16-е место из 185 и по-прежнему описывается Artificial Analysis как «заметно быстрый», но на 23% медленнее, чем модель, которую он заменяет.

Многословность — 94 млн выходных токенов на прохождение индекса по сравнению с 95 млн. Практически без изменений, и оба примерно на 45% выше медианы в 65 млн.

Суммарные расходы на оценку — от $548,07 до $637,85. Поскольку многословность почти не изменилась, а цены не изменились вовсе, этот рост на 16% объясняется чем-то помимо видимого вывода: более длинными внутренними цепочками рассуждений, большим числом повторных попыток или большим количеством обращений к инструментам на задачу.

Этот паттерн последователен. Meta не сделала модель дешевле, быстрее или больше. Она заставила модель дольше обдумывать, прежде чем принять решение, и дополнительное обдумывание проявляется в виде задержки, чуть более медленного стриминга и счета на 16% выше за идентичную работу. Три индексных пункта — вот что это дало.

Насколько плоха задержка на самом деле

Показатель 26,12 секунды будет вырван из контекста, поэтому относитесь к нему правильно: он измеряется на уровне xhigh, самом дорогом из пяти уровней усилий, на тестовом наборе, который намеренно сделан сложным. API по умолчанию использует medium.

Чтобы понять, как на самом деле ощущается настройка по умолчанию, Muse Spark 1.1 на OrcaRouter — обслуживающий реальных вызывающих при любом запрашиваемом ими уровне усилий — показывает p50-время до первого токена 1,84 секунды и p95 6,00 секунды за скользящую неделю. Это производственные данные при производственных уровнях усилий, и они более чем на порядок ниже эталонного показателя. У версии 1.2 пока нет производственной телеметрии.

Muse Spark 1.2 vs Muse Spark 1.1-3

Итак, честное прочтение — не «1.2 отвечает за 26 секунд». Оно таково: на том уровне настройки, где 1.2 зарабатывает свои три дополнительных балла, первый токен обходится вам в 26 секунд, а на том же уровне старая модель обходилась вам в три. Если вы уже работаете на xhigh — а это именно та конфигурация, где существует прирост интеллекта, — то именно это число вам и достанется. Если вы работаете на medium или ниже, время будет гораздо меньше, но и улучшение будет не таким заметным.

Эта связка — настоящая ловушка в этом обновлении. Нельзя получить интеллект без обдумывания, потому что обдумывание — это то, откуда берётся интеллект.

Перепозиционирование, стоящее за цифрами.

Meta не публиковала анонс для 1.2 — страница анонса Muse Spark до сих пор описывает 1.1 — но она переписала описание продукта, и этот пересмотр объясняет компромисс.

Muse Spark 1.1 продавался как мультимодальная модель рассуждений с необычно широким спектром входных данных, нацеленная на «мультимодальных агентов, глубокое исследование смешанных медиа и анализ длинного контекста»: длинные отчеты, медиабиблиотеки, записи и видео наряду с текстом.

Описание Muse Spark 1.2 отбрасывает почти всё это и вместо этого называет программную инженерию — многофайловый рефакторинг, продолжительные сеансы отладки, генерацию всего репозитория — затем добавляет явное утверждение о мультиагентности: модель может выступать в роли основного агента, который собирает контекст, планирует и делегирует задачи, или в роли субагента, работающего параллельно под основным агентом. Она также утверждает, что кэширование промптов может снизить эффективную стоимость на 60–80% в зависимости от того, сколько контекста повторяется между вызовами. Последняя цифра — это оценка Meta, а не измеренный результат, хотя ставка кэша в $0,15 делает её арифметически правдоподобной.

Посмотрите на регрессию задержки в контексте этого перепозиционирования — и она перестанет выглядеть ошибкой. Никому, кто рефакторит дюжину файлов, нет дела до 26 секунд планирования. Meta выбрала клиента, и это не тот, кому продали 1.1.

Что в 1.1 всё ещё есть, чего нет в 1.2?

Четырёх недель существования недостаточно для формирования послужного списка, и в трёх конкретных аспектах более старая модель сейчас является лучше документированным продуктом.

Рекорд арены.У Muse Spark 1.1 солидная история в Design Arena: 1334 Elo на 5-м месте в разработке игр, 1334 на 7-м в UI-компонентах, 1320 на 3-м в ASCII-графике, 1318 в визуализации данных, 1309 в общих категориях кода, плюс полная лестница agents-arena, охватывающая веб-приложения, HTML-слайды и разработку игр на Godot. У Muse Spark 1.2 нет записей вообще. На направлении, которое Meta сейчас продвигает активнее всего, для новой модели нет вообще никаких данных о прямом сравнении.

Оценки субиндексов. Artificial Analysis публикует индекс кодирования 71,3 и агентный индекс 37,5 для 1.1. Для 1.2 опубликованного аналога нет. Поскольку агентный показатель был самым слабым аспектом 1.1 с большим отрывом, а агентные возможности — именно то, что 1.2 обещает улучшить, именно это число решило бы вопрос об обновлении — но его пока не существует.

Производственная телеметрия. У 1.1 за плечами неделя реальных данных по задержкам p50 и p95 и 4,4 млн токенов живого трафика через OrcaRouter. У 1.2 нет ни того, ни другого; его конечная точка в настоящее время вообще не сообщает статистики ни по задержкам, ни по пропускной способности, поскольку объём трафика слишком мал для выборки.

Где можно арендовать его помимо Meta. Muse Spark 1.1 есть в каталоге OrcaRouter за $1.25 и $4.25 — по собственным ценам Meta, переданным с нулевой наценкой. Muse Spark 1.2 там пока нет, поэтому сегодня это прямая интеграция с Meta, с единственным провайдером и без резервного пути.

Muse Spark 1.2 vs Muse Spark 1.1-4

Всё это не означает, что 1.2 хуже. Это означает, что доказательства для 1.2 — это один совокупный балл от одного оценщика, тогда как доказательства для 1.1 — это месяц арен, субиндексов и живого трафика. Эта асимметрия должна влиять на то, как вы организуете миграцию по этапам, а не на то, стоит ли за неё браться.

Краткий чек-лист для миграции

Поскольку тарифная карта и поверхность параметров идентичны, замена — это изменение строки модели. Работа заключается в проверке трёх вещей, которые действительно изменились.

Измерьте собственное время до первого токена при вашем собственном уровне усилий. Не принимайте ни показатель 2,90 с, ни 26,12 с. Запускайте свои реальные промпты с тем reasoning_effort, который вы фактически передаёте, и сравнивайте напрямую. Это единственное число, которое может напрочь убить миграцию.

Проверьте настройки тайм-аута и потоковой передачи. Увеличение задержки первого токена в 9 раз при высоком усилии превысит настроенные под 1.1 тайм-ауты клиентов и сделает любую интеграцию без потоковой передачи похожей на зависание.

Пересчитывайте стоимость по фактическому количеству токенов, а не по тарифной сетке. Цены одинаковы, поэтому любое изменение стоимости связано с поведением. Artificial Analysis зафиксировала на 16% больше расходов за ту же работу; увидите ли вы это, зависит от вашего набора задач.

Сначала проверьте стабильность ключа кэша. При стабильном префиксе из 60 000 токенов типичный шаг агента снижается примерно с 8,8 цента до 2,2 цента в любой версии. Этот разброс в 75% больше, чем любой эффект от смены версии, и он полностью под вашим контролем.

Проведите явное повторное тестирование аудио- и видеопутей. В обоих объявлениях заявлены одни и те же пять модальностей ввода, но карточка спецификации Artificial Analysis для версии 1.2 фиксирует только текст и изображение как оценённые. Meta переписала презентацию, уйдя от работы со смешанными медиа. Никто независимо не проверил, сохранилась ли эта возможность.

Оставьте 1.1 доступной в качестве запасного варианта. Запуск обеих версий за одним ключом означает, что откат — это изменение конфигурации, а не инцидент, и позволяет A/B-тестировать их на живом трафике вместо споров о бенчмарках.

Кто двигается сейчас, кто ждёт

Переходите сейчас, если вы запускаете долгосрочных агентов кодирования с высокими усилиями на рассуждение. Задачи уже занимают минуты, и штраф за задержку теряется на этом фоне, прирост интеллекта измеряется третьей стороной, а не заявлен компанией Meta, и три индексных пункта — это значимый скачок на этом уровне — девять позиций в рейтинге из 185 моделей.

Подождите, если что-либо из того, что вы предоставляете, является интерактивным. Не существует такой конфигурации, в которой 1.2 был бы более отзывчивым, чем 1.1, и обязательное рассуждение означает, что вы не можете вернуть отзывчивость, отключив размышление. Версия 1.1 остаётся более быстрой моделью при любом уровне усилий и стоит ровно столько же.

Подождите, если ваша рабочая нагрузка — это анализ смешанных медиа — тот самый сценарий с длинными отчётами, видео и аудио, для которого 1.1 была специально создана и продвигалась. Meta перестала её рекламировать, и единственная независимая оценка 1.2 охватывает текст и изображения. Возможно, эта возможность никуда не делась; просто нет никаких доказательств ни за, ни против, а у 1.1 есть месяц таких доказательств.

Подождите, если вам нужны данные арены. Модель, продвигаемая на основе генерации целых репозиториев, но не имеющая ни записей в Design Arena, ни опубликованного агентного субиндекса, просит вас поверить Meta на слово насчет того, что она изменила. Дайте этому три-четыре недели, и это перестанет быть правдой — и тогда это решение будет гораздо легче принять на основе доказательств, а не одного составного числа.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube