
Muse Spark 1.3 Max Reasoning уже доступен: настройка, стоящая за лучшими результатами Meta, теперь поставляется всем.
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 221 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Muse Spark 1.3 — передовая модель рассуждений, выпущенная Meta Superintelligence Labs 2 сентября, — только что получила режим, на котором был основан её собственный рейтинг. 4 сентября, после двух дней дополнительных испытаний на безопасность, Meta открыла наиболее вычислительно интенсивный режим рассуждений «max» для разработчиков в Meta Model API и в Muse Code, своём терминальном агенте для написания кода. Директор по искусственному интеллекту Александр Ванг объявил об этом в X, и аккаунт компании @AIatMeta подтвердил информацию; то, что при запуске было конфигурацией, ограниченной Meta и предварительным просмотром для партнёров, теперь стало уровнем рассуждений, который может выбрать любой разработчик.
Эта последовательность важна, потому что несколько показателей, доминировавших в освещении запуска Muse Spark 1.3 — 75,4 по DeepSWE v1.1, 66,9 по OSWorld 2.0, 1 754 по GDPval-AA v2 — были получены из конфигурации max, тогда как модель, которую разработчики могли реально вызывать, поставлялась с ограничением параметра reasoning effort до «xhigh». Meta прямо заявила при запуске, что max всё ещё находится в тестировании безопасности, но разделение означало, что главная таблица результатов и вызываемая модель были двумя разными вещами в течение двух дней. Выпущенный в четверг релиз устраняет этот разрыв, не меняя при этом цену за токен. Показатели бенчмарков из этого списка принадлежат самой Meta и до сих пор не воспроизведены независимым испытательным стендом; всё, что в этом материале сообщено вендором, помечено соответствующим образом.
Что утаивалось — и что изменилось 4 сентября
Лестница рассуждений Muse Spark 1.3 не менялась с момента открытия платного API этого семейства: рассуждения всегда включены, а параметр effort в Meta Model API принимает значения minimal, low, medium, high и xhigh, при этом модель тратит всё больше своего выходного бюджета на обдумывание по мере повышения уровня. Max находится выше xhigh — больше вычислений, больше токенов рассуждений и, по словам Meta, значительно сильнее в долгосрочной агентной работе. При запуске 2 сентября Meta выпустила все уровни вплоть до xhigh, но оставила max вне публичного API до завершения того, что она назвала дополнительным тестированием безопасности, предоставив его только ограниченному кругу партнёров — достаточно для проведения независимой оценки, но недостаточно для производственной нагрузки.
4 сентября Ван заявил, что тестирование завершено. Max теперь можно выбрать в качестве настройки в Muse Code — установочный скрипт доступен по адресу dev.meta.ai/install.sh — а также через Meta Model API с идентификатором модели muse-spark-1.3, где параметр effort теперь принимает значение max. Ван описал двухдневную задержку как способ Meta ограничивать доступ «на уровне конфигурации» и сообщил Axios, что Meta не пришлось приостанавливать свою более широкую работу из-за опасений по поводу безопасности. Период был коротким, но это реальный прецедент: Meta теперь готова придержать конкретный режим рассуждений за проверкой безопасности, одновременно немедленно выпуская остальную часть контрольной точки.
Одно практическое предостережение для тех, кто вызывает модель через шлюз, а не через собственный endpoint Meta: несколько сторонних страниц документации и агрегаторов были написаны в день запуска и до сих пор перечисляют reasoning effort только до значения xhigh. Максимальное значение — это развёртывание на стороне Meta, поэтому, прежде чем предполагать, что max достижим, проверьте, что маршрут, через который вы обращаетесь, обновил свой набор параметров — прокси, который проверял допустимые значения 2 сентября, может отклонять «max», пока его сопровождающие не догонят.
Что на самом деле даёт max — и где это не помогает
В четверговых материалах Meta есть явное разделение max против xhigh по запускаемым ею бенчмаркам, и это самое полезное из того, что она опубликовала о модели на сегодняшний день. Все это — данные, предоставленные вендором, полученные в собственном окружении Meta Muse Code harness, и Meta заявляет, что её сравнения с Claude Opus 5 и GPT-5.6 Sol были прогонами «best-effort» на максимальных настройках самих конкурентов, которые «могут не отражать производительность, оптимизированную провайдером». С учётом этой оговорки разделение даёт чёткую картину направления:
• OSWorld 2.0 (задачи агентов, использующих компьютер) — 66,9 при max против 57,2 при xhigh
• GDPval-AA v2 (Elo агента для интеллектуальной работы) — 1 754 при max против 1 709 при xhigh
• JobBench (долгосрочные профессиональные задачи) — 64,9 при max против 61,2 при xhigh
• DeepSearchQA — ничья с результатом 89.4
• Terminal-Bench 2.1 (кодинг терминальным агентом) — 89.2 при xhigh против 88.8 при max; единственный набор тестов, в котором побеждает конфигурация, выпущенная 2 сентября.

Эту закономерность стоит внимательно изучить. Max приносит больше всего пользы там, где задача представляет собой длинный агентный цикл: управление компьютером, выполнение аналитического задания, ведение расписания подзадач, как в JobBench. На одношаговом терминальном бенчмарке он ничего не добавил и стоил немного: Terminal-Bench напоминает, что «больше рассуждений» — это не монотонное улучшение, и это повод сравнить max с xhigh на вашей собственной нагрузке, а не предполагать, что более высокая настройка лучше везде. Meta также отмечает, что результат DeepSWE v1.1 в 75.4, ставший главной цифрой первого дня и выросший с 59.3, о которых Meta сообщала для Muse Spark 1.2 шестью неделями ранее, получен при конфигурации max. Именно эту цифру независимые оценщики перепроверят в первую очередь.
Независимая оценка начинает догонять.
При запуске не хватало независимых измерений, и этот пробел закрывается по графику, который как раз совпадает с развёртыванием max. Индекс Coding Agent Index от Artificial Analysis — который оценивает каждую модель в её собственной среде кодинг-агента и сочетает задачи DeepSWE, Terminal-Bench и SWE-Atlas — на этой неделе поставил Muse Spark 1.3 (max) в среде Muse Code на 68 баллов: это второе место в таблице после Claude Opus 5 (xhigh) в Claude Code и выше, чем у Claude Fable 5 (max) с 67 и GPT-5.6 Sol (max) с 65. Та же таблица оценивает поставляемую конфигурацию xhigh в 64 балла в той же среде Muse Code — это самое чистое прямое сравнение из имеющихся того, что даёт max: примерно четыре пункта индекса на независимом наборе задач. Эта строка таблицы была опубликована, когда max всё ещё находился в партнёрском предварительном доступе; описанная в ней конфигурация — это та, что стала общедоступной 4 сентября.
Artificial Analysis также обновила собственную карточку модели для максимальной конфигурации с момента запуска. В течение предварительного периода в карточке не были указаны ни провайдер, ни цена; в актуальной карточке теперь указана Meta по стандартной цене $1,25 за миллион входных токенов и $4,25 за миллион выходных токенов — та же цена по прайс-листу, что и у Muse Spark 1.2, — а также добавлено примечание о многословности: оценочный запуск AA потребил примерно 130 миллионов токенов при медиане в 79 миллионов, стоимость составила около $1 335 в сумме и выходит примерно на $0,95 за задачу по оценке AA при скорости около 190 выходных токенов в секунду.
Одна цифра из более ранних материалов заслуживает проверки версии. На этой неделе Artificial Analysis обновила свой Intelligence Index до v4.2 — в ту же неделю, когда вышел max, — пересчитав рейтинг и сместив медианные значения. На текущей карточке конфигурация max показывает 53 при медиане сопоставимых моделей 29; значение 62, которое приводилось в материалах недели запуска, было измерено на предыдущей версии индекса, и эти две цифры несопоставимы. Собственное разделение xhigh и max от Meta, приведённое выше, от индекса AA не зависит и обновлением не затрагивается.

Сколько стоит максимум — счет в токенах, а не в прайс-листе
Meta не публикует отдельную цену для максимальной конфигурации, как и специального анализа задержек. Цена за токен идентична Muse Spark 1.2 и любому другому уровню усилий в Muse Spark 1.3: $1.25 за миллион входных токенов, $4.25 за миллион выходных, и $0.15 за кэшированный вход на стандартном тарифе. Токены рассуждений тарифицируются как выходные токены и учитываются в выходном бюджете, поэтому выбор максимума — это не увеличение цены отдельной позицией, а обещание потратить больше этого бюджета на размышления перед ответом.
Таким образом, реальный вопрос стоимости сводится к объёму токенов, и предварительные данные показывают, что max расточителен именно там, где xhigh экономичен. Инструментированный прогон AA потребил около 130 миллионов токенов на одну оценку конфигурации. Для разработчика, уже запускающего длинные агентные циклы на xhigh, значимый A/B-тест — это не «выполняет ли max больше задач», а «выполняет ли max достаточно дополнительных задач, чтобы оправдать существенно больший счёт за токены на той же нагрузке».
Уровень Contributor от Meta — $0.10 за вход и $0.20 за выход на миллион токенов в обмен на то, что Meta обучается на ваших промптах и завершениях — применяется к той же контрольной точке, и Meta сообщает, что значительный двузначный процент разработчиков выбирает его. Условия Contributor делают каждую отправку обучающими данными, а его лимиты частоты запросов строги, поэтому это неудачный выбор по умолчанию для производственного фан-аута, но законный способ дёшево проводить дорогие эксперименты с максимальными объёмами, если обмен данными для вас приемлем.
Ценовой якорь для всего этого легко проверить, не веря Meta на слово, потому что цена контрольной точки Muse Spark 1.3 совпадает с ценой, уже указанной на OrcaRouter по собственному прайс-листу Meta: Muse Spark 1.2 доступна на OrcaRouter по цене $1.25 за миллион входных и $4.25 за миллион выходных токенов с нулевой наценкой, так что утверждение о «неизменной цене» можно проверить на действующей странице, где видны именно эти цифры. Сама контрольная точка Muse Spark 1.3 на OrcaRouter пока не появилась. Когда один из представленных у нас провайдеров начнёт обслуживать её с параметром max, цена на нашей стороне будет напрямую соответствовать прайс-листу Meta — мы не добавляем наценку к ценам провайдеров — и любое снижение цены вендором вступит в силу в тот же день, когда это сделает Meta. Для такого релиза, где экономическая суть кроется в объёме токенов, а не в заголовочной цене, именно сквозная передача цены гарантирует, что цифра в вашем счете будет равна цифре, публикуемой Meta.

Кому следует перейти на max
Решение разделяется чётко:
• Переключайтесь на этот вариант для агентских нагрузок с длинным горизонтом — управление компьютером, брифы по интеллектуальной работе, многошаговые циклы инструментов в Muse Code — где и собственный сплит Meta, и лидерборд кодинг-агентов AA показывают наибольший максимальный прирост. Сначала прогоните A/B-тест против xhigh на выборке своих реальных задач, ведь многословность реальна.
• Оставайтесь на xhigh для высоконагруженных, чувствительных к задержке или коротких однократных вызовов, где max в основном добавляет токены. Terminal-Bench — доказательство того, что это не всегда добавляет возможности.
• Следите за тремя вещами: за выпуском открытых весов, который Цукерберг пообещал без указания даты; за потребительским запуском Muse Spark 1.3 в Instagram, Facebook и Meta AI в ближайшие недели; и за тем, начнёт ли таблица coding-agent от Artificial Analysis выставлять цену на строку Max теперь, когда эта конфигурация стала общедоступной.
Двухдневный гейт оказался коротким, но он доказал то, что переживет сам релиз: сильнейшие показатели Muse Spark 1.3 от Meta никогда не были миражом — они просто ждали проверки безопасности. С 4 сентября модель, к которой может обратиться разработчик, и модель из таблицы лидеров наконец-то стали одной и той же моделью. Вопрос о том, оправдывает ли max затраченные токены, теперь стал эмпирическим, и любой разработчик может ответить на него через API Meta или через тот маршрут, которым он уже пользуется для доступа к семейству Muse Spark.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
