Титульная карточка для 'Muse Spark 1.2 vs GLM-5.2 — закрытый кодер против открытого универсала', где Muse Spark 1.2 изображен под значком закрытого замка, а GLM-5.2 — под значком открытой коробки.
Guides & Insights

Muse Spark 1.2 против GLM 5.2: закрытый кодер против открытого универсала

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Две модели с контекстом в 1,000,000 токенов, цены которых отличаются не более чем на пятнадцать центов за миллион токенов, обе ориентированы на интенсивную агентную работу с кодом — и в остальном у них почти нет ничего общего. Muse Spark 1.2, которую Meta выпустила 5 августа 2026 года вместе с совместно обученным терминальным агентом под названием Muse Code, имеет закрытые веса, дешевле за токен, набирает 57 баллов в текущем индексе Artificial Analysis Intelligence Index и не может отвечать без предварительного рассуждения. GLM 5.2, флагманская модель Z.ai с открытыми весами, выпущенная в середине июня, лицензирована под MIT, самохостируемая, примерно в пять раз быстрее выдает первый токен и по-прежнему пропускает через наш шлюз в четыре с половиной раза больше реального трафика — 213 миллионов токенов за последние семь дней против 46 миллионов у Muse Spark 1.2. Модель с более высоким баллом и более низкой ценой за токен — это та, у которой меньше трафика. Открытая модель — та, на которую люди действительно направляют трафик.

Честная версия этого факта — то, о чём эта статья. Оценки и цены решают меньше, чем то, как модель вписывается в ваш конвейер, и эти два параметра принимают противоположные решения по каждой оси, определяющей соответствие. Там, где существуют независимые цифры, они взяты из Artificial Analysis; там, где они взяты у Meta или Z.ai, они помечены как указанные вендором; показатели задержки и трафика — это собственная семидневная производственная телеметрия OrcaRouter.

Контраст спецификаций, по одному измерению за раз

Цена — Muse Spark 1.2: $1.25 на входе / $4.25 на выходе за миллион токенов, $0.15 при попадании в кэш; GLM 5.2: $1.40 на входе / $4.40 на выходе, $0.26 из кэша. Meta дешевле по каждой позиции.

Контекст — у обоих 1 048 576 токенов. Максимальный вывод: Meta документирует потолок в 131 072 токена для Muse Spark 1.2; GLM 5.2 заявляет 128 000 токенов.

Рассуждение — рассуждение обязательно в Muse Spark 1.2 на пяти уровнях усилия (от minimal до xhigh, по умолчанию medium); GLM 5.2 выполняет гибридное рассуждение, управляемое reasoning_effort на high или max, с глубоким рассуждением, включённым по умолчанию.

Входные данные — Muse Spark 1.2 заявляет о поддержке ввода текста, изображений, видео, аудио и PDF; GLM 5.2 — это текст на входе и текст на выходе.

Веса — Muse Spark 1.2 закрыт, без репозитория и без возможности самостоятельного развертывания; GLM 5.2 поставляется с открытыми весами под лицензией MIT, модель смеси экспертов с 753B параметров и примерно 40B активных на токен.

Возраст — Muse Spark 1.2 на момент написания этого текста исполнилось три дня; GLM 5.2 находится в продакшене с 13 июня, с восьминедельным опытом эксплуатации и целой экосистемой хостов и инструментов, построенных вокруг него.

Разрыв индекса составляет четыре пункта. Ловушка версии реальна.

Текущий Intelligence Index (v4.1.1) от Artificial Analysis оценивает Muse Spark 1.2 в 57 баллов (12-е место из 185), а GLM 5.2 — в 53: это лучший показатель среди моделей с открытыми весами во всём рейтинге, но он отстаёт на четыре балла. Большинство обзоров по-прежнему указывают 54 балла для Muse Spark 1.2, потому что именно такую оценку опубликовали в день запуска; пересчёт в v4.1.1 добавил к ней 2,7 балла — наибольший прирост среди всех моделей в этом обновлении. Если вы где-то увидите «54 vs 51» или «54 vs 53», сначала проверьте, к какой версии индекса относится каждое число, прежде чем считать разрыв реальным.

Стоит сказать, что означает и что не означает разрыв в четыре пункта. Он означает, что в сводном рейтинге из девяти бенчмарков закрытая модель Meta опережает открытую модель Z.ai при сопоставимых усилиях. Это не означает, что Muse Spark 1.2 превосходит GLM 5.2 во всём, потому что две модели достигают своих результатов разными путями. GLM 5.2 — это выброс в математике и рассуждениях: AIME 2026 с результатом 99.2 — но он известен своей многословностью, и его слабое место — глубокая работа с масштабом репозитория. Muse Spark 1.2 устроен противоположным образом: он силён в терминальном кодировании и многофайловых задачах, а его оценка значительно дешевле за задачу, потому что он сжигает гораздо меньше токенов во время обдумывания.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

Где бенчмарки на самом деле расходятся

На Terminal-Bench 2.1 эти две модели ближе, чем предполагает разрыв в индексе, и источник данных значит больше, чем обычно. На том же стенде Artificial Analysis Muse Spark 1.2 набирает 80.1, а GLM 5.2 — 77.9. Meta заявляет 82.9 для Muse Spark 1.2 на собственном стенде; лучший опубликованный показатель Z.ai для GLM 5.2 — 82.7, что сделало её первой моделью с открытыми весами, набравшей выше 80 на этом бенчмарке. Один и тот же бенчмарк, четыре разных числа — сочетание стендов сдвигает эти результаты на несколько пунктов в обе стороны, поэтому к любому утверждению на основе одного Terminal-Bench стоит относиться как к диапазону.

Расхождение, на которое стоит обратить внимание, — это {{1}}DeepSWE 1.1{{/1}}, бенчмарк, проверяющий глубокие многофайловые рассуждения в масштабе репозитория на протяжении длинного цикла агента. Meta сообщает о 59,3 для {{2}}Muse Spark 1.2{{/2}} — это заявленная вендором цифра, и ни одна третья сторона её ещё не воспроизвела. Опубликованный показатель DeepSWE у GLM 5.2 — 46,2, а показатель его предшественника GLM-5.1 составлял 18,0, так что именно в этом аспекте Z.ai добился наибольшего прогресса и при этом всё ещё отстаёт. Если ваша рабочая нагрузка — «согласованно изменить пятьдесят файлов», этот разрыв говорит сам за себя; если ваша рабочая нагрузка — команды терминала и создание каркасов, он едва заметен.

Еще одна находка, которая переворачивает очевидную трактовку. Независимый набор Vals AI, который запускает агентские нагрузки по каждой области, ставит Muse Spark 1.2 на пятое место в общем зачете с результатом 71,88% — и на первое место по Finance Agent, первое по TaxEval и первое по бенчмарку Harvey's Legal Agent, среди 44, 136 и 31 моделей соответственно — при этом Terminal-Bench 2.1 занимает лишь четырнадцатое место из пятидесяти возможных для этой модели. Meta продавала эту модель как модель для кодинга, а независимый оценщик обнаружил, что она сильнее всего в агентах для финансовых, налоговых и юридических документов. Если ваша команда составляет договоры или сверяет бухгалтерские книги, это самое полезное число во всей этой статье.

Вопрос об открытых весах — это настоящая развилка.

Всё вышесказанное касается возможностей. Решение же в основном касается владения, и здесь эти два понятия не могут быть более далеки друг от друга.

GLM 5.2 — это открытые веса с лицензией MIT. Это меняет переговорную позицию, а не только счёт: вы можете развернуть её у себя, если рабочая нагрузка чувствительна или объём велик; вы можете переносить её между провайдерами без повторной интеграции, потому что веса принадлежат вам; и любой хостинг, который её маршрутизирует, вынужден конкурировать по цене и задержке — именно поэтому линейка открытых весов со временем дешевеет. 753B MoE — это не модель для ноутбука: большинство команд по-прежнему будут арендовать её, а не запускать у себя, — но возможность уйти или запустить те же веса in-house за фиксированную стоимость устанавливает нижний предел того, сколько кто-либо может с вас запросить.

Muse Spark 1.2 выбирает противоположный пакет. Веса закрыты, и единственный официальный способ — это Model API от Meta, который мы теперь тоже поддерживаем. Взамен вы получаете совместно обученный продукт: Muse Code, терминальный агент, поставляемый вместе с моделью, был настроен на траекториях harness, отобранных с помощью rejection sampling, и запускает постоянных, устойчивых к перезапуску субагентов на рантайме с точным воспроизведением журнала событий, со встроенными /plan, /grill и /goal навыками. Это действительно совсем другое, чем «хорошая модель, которую вы встраиваете в свой собственный harness», — это агент, который работает сразу. Обратная сторона в том, что он работает только так, как предусмотрено Meta, в инструменте Meta, на macOS или Linux, пока нет ни Windows-клиента, ни MCP, ни плагинов для IDE.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

Цена за токен, цена за задачу

В пересчёте на токен Muse Spark 1.2 дешевле и на входе, и на выходе, а также остаётся дешевле в расчёте на задачу, поскольку он ещё и менее многословная модель. Artificial Analysis замерила, что GLM 5.2 сжигает 141 миллион выходных токенов, 95% из которых — токены рассуждения, только для выполнения Intelligence Index при запуске, — самая многословная из ведущих моделей на доске. Muse Spark 1.2 сжёг 95 миллионов на том же упражнении при цене $0,40 за задачу. Больше токенов по более высокой ставке означает, что стоимость задачи для GLM 5.2 растёт так, как не видно из его прейскуранта, и это правильный способ сравнивать модели рассуждений: оценивать выполненную задачу, а не ставку за миллион токенов.

Существует и третья цена, которая есть только у одной из этих моделей. Muse Spark 1.2 предлагает контрибьюторский тариф: $0,10 за вход / $0,20 за выход — на порядок ниже стандартного тарифа и примерно настолько же ниже прайс-листа GLM 5.2. Плата за вход — разрешение для Meta обучать будущие модели на вашем трафике, плюс ограничение 60 запросов в минуту, исключающее продакшн-фан-аут. Воспринимайте это как юридическую проверку со скидкой, а не как более дешёвый SKU; для команды, которая проходит квалификацию и работает в рамках лимита, сравнение цен перестаёт быть близким.

Задержка: две модели инвертируются

Если разрыв в индексе благоприятствует Meta, то профиль задержки — это то, где GLM 5.2 решительно выигрывает по ощущениям. За последние семь дней реального трафика на OrcaRouter, Muse Spark 1.2 показывает время до первого токена на уровне p50 8.13 секунды и p95 10.00 секунд, а затем выдаёт 576 выходных токенов в секунду с нулевым уровнем ошибок. GLM 5.2 показывает p50 1.55 секунды — более чем в пять раз быстрее до первого токена — но выдаёт лишь 78.5 выходных токенов в секунду с уровнем ошибок 0.16%. В лаборатории при максимальной нагрузке разрыв увеличивается: Artificial Analysis зафиксировал время до первого токена Muse Spark 1.2 на уровне 26 секунд при xhigh, самой дорогой настройке рассуждения.

Итак, одна модель заставляет вас ждать, а затем работает быстро; другая начинает сразу и не торопится. Для всего, за чем наблюдает человек — ответ в чате, интерактивная терминальная сессия — GLM 5.2 ощущается лучше, и именно поэтому она доминирует в интерактивном трафике через наш шлюз. Для длинной генерации, большого патча или черновика документа Muse Spark 1.2 закончит первой, как только начнёт, потому что её скорость вывода в семь раз выше, чем у GLM 5.2. Измерьте не ту цифру — и вы выберете не ту модель по не той причине.

Попробовать оба без второго контракта

Обе модели присутствуют в каталоге OrcaRouter по цене из прайс-листа провайдера — Muse Spark 1.2 по $1.25 и $4.25, GLM 5.2 по $1.40 и $4.40 — поскольку OrcaRouter передаёт тарифы провайдера без наценки (0%). Это делает цены, приведённые выше, реальными ценами из инвойса, а не ценника; переключение между ними сводится к изменению одной строки в строке модели при том же ключе, а не к новой интеграции. Если вендор снижает цену, это снижение в тот же день отражается на нашей стороне.

Маршрутизирующий слой оправдывает себя здесь именно потому, что эти две модели дополняют друг друга. Слабость Muse Spark 1.2 — медленный первый токен и высокая цена при масштабировании; слабость GLM 5.2 — многословность и рассуждения о глубоких репозиториях. Правило маршрутизации, которое направляет этап планирования в Muse Spark 1.2, а веерный запуск параллельных воркеров — в GLM 5.2, или переключается на GLM 5.2 при медленной работе эндпоинта Muse Code, не требует дополнительных затрат на реализацию, поскольку обе модели находятся за одним эндпоинтом. А для модели, которой всего три дня от роду, автоматическое переключение — это способ попробовать её, не ставя на неё продакшн-путь.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

Кто должен выбирать

Выберите Muse Spark 1.2, когда единица работы — крупный целостный артефакт и можно подождать несколько секунд до его запуска: многофайловые рефакторинги, генерация всего репозитория, длинные циклы агентов и — по данным Vals AI — работа с финансовыми, налоговыми и юридическими документами. Лидерство DeepSWE, высокая скорость вывода и уровень Contributor указывают в ту же сторону. Вы принимаете закрытые веса, инструментарий Meta и более медленный первый токен, и вам стоит читать показатели Meta 82.9 и 59.3 как заявления, а не как факты.

Выбирайте GLM 5.2, когда владение и ощущение важнее совокупного показателя: открытые веса, которые вы можете развернуть самостоятельно или перенести, быстрый первый токен для интерактивной работы, экосистема каркасов и инструментов, которая уже работает с ним, и самая мощная доступная универсальная возможность с открытыми весами. Примите многословность, 46.2 DeepSWE и цену по прайс-листу, которая выше за токен даже до учёта разницы в количестве токенов.

Большинство команд обнаружат, что честный ответ — ни один из них по отдельности. Открытая модель — это рабочая лошадка, через которую вы пропускаете основной трафик; закрытая — специалист, которого вы направляете на сложные задачи и чувствительные документы. Четыре индексных пункта разницы в композите, целый мир разницы в том, кто владеет весами — вот в чём выбор, и он намного яснее, чем оценки.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube