Сгенерированная hero-карточка с заголовком «Step 5 Preview vs Muse Glimmer — API и ноутбук». В левой карточке «Step 5 Preview» указано: AA Index 44 при медиане по классу 26, StepFun, анонсирована 20 сентября 2026 года, около 600B всего / 27B активных, контекст 1M токенов, $1.00 за вход / $2.70 за выход за 1M токенов, работает на серверах вендора. В правой карточке «Muse Glimmer» указано: AA Index 17, Meta Superintelligence Labs, выпущена 10 августа 2026 года, 30B параметров в 4-битном формате, менее 20 ГБ, контекст 131K токенов с расширением до 262K, Apache 2.0, работает на вашей собственной GPU офлайн. В нижнем колонтитуле указано: «Показатели Index приведены по данным Artificial Analysis; спецификации Muse Glimmer — по данным Meta».
Guides & Insights

Step 5 Preview против Muse Glimmer: Frontier API и модель для ноутбука

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В таблице лидеров Step 5 Preview и Muse Glimmer не близки: 44 против 17 в Artificial Analysis Intelligence Index — разрыв в двадцать семь пунктов по шкале, текущий лидер которой находится в верхней части пятидесятых — который никакая настройка не закроет. По вопросу, на который команде действительно нужно ответить — где выполняются мои токены — они прямые конкуренты. Step 5 Preview — флагман StepFun, анонсированный 20 сентября 2026 года, примерно 600 миллиардов общих параметров при 27 миллиардах активных, контекст в 1M токенов, цена $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов, доступен только по сети. Muse Glimmer — 30-миллиардная агентная модель с открытыми весами от Meta Superintelligence Labs, выпущенная 10 августа 2026 года под лицензией Apache 2.0, поставляется квантованной до 4 бит, поэтому помещается в память менее 20 ГБ и работает на одной потребительской GPU с отключенной сетью. Правильный способ воспринимать эту пару — не «кто умнее». А «какое из двух ограничений — возможности или периметр — является тем, которое ваша рабочая нагрузка не может сдвинуть».

Это сравнение также служит полезной поправкой к привычке, которую усвоил этот рынок: считать балл композитного индекса всей ценностью модели. Разрыв в двадцать семь пунктов реален, и это не единственное число в файле. В задачах поиска по длинному контексту тот же независимый совет ставит Muse Glimmer в пределах половины балла от моделей с открытыми весами из куда более крупной весовой категории, а собственные агентные бенчмарки Meta выглядят достойно для модели, работающей на ноутбуке. Между тем самую часто упоминаемую слабость Step 5 Preview составляет вовсе не способность, а многословность, и она закрыта до 15 октября, когда должны появиться обещанные веса.

Две модели, два совершенно разных объекта

Step 5 Preview — это система mixture-of-experts, работающая на инфраструктуре StepFun: около 600 млрд общих параметров, 27 млрд активных на токен, ввод текста и изображений, контекстное окно в 1 млн токенов и независимая оценка Intelligence Index 44 против медианы 26 у сопоставимых моделей. Её вывод работает со скоростью 87 токенов в секунду против среднего значения 78 по измерению того же рейтинга, и она сгенерировала около 160 млн выходных токенов в наборе задач индекса, где медианная модель выдаёт около 82 млн — примерно вдвое больше текста на единицу работы, при цене 2,70 доллара за миллион. Веса BF16 были обещаны к 15 октября 2026 года и пока отсутствуют в репозитории, поэтому сегодня модель доступна вам только как API.

Muse Glimmer — это противоположный объект. Это модель с 30 млрд параметров, обученная методом дистилляции логитов у более крупной модели-учителя Muse Spark от Meta, затем дообученная на агентных данных с длинным контекстом и обученная с подкреплением для работы с инструментами. Meta поставляет её в 4-битном квантовании, что снижает объём памяти с более чем 55 ГБ при полной точности до менее 20 ГБ — в пределах 24 ГБ или 32 ГБ видеопамяти, — и она была протестирована Meta на Nvidia RTX 5090, а также на чипах Apple M4 Max и M5 Max. Она принимает на вход текст и изображения более чем на ста языках, поддерживает контекст в 131 072 токена с возможностью расширения до 262 144 и создана для того, чтобы принимать цель, разбивать её на шаги, вызывать инструменты и повторять неудачный вызов, а не останавливаться. Она распространяется под лицензией Apache 2.0 и работает офлайн.

• Независимая оценка — Step 5 Preview: 44 при медиане 26 в своём классе против Muse Glimmer: 17 по тому же индексу в своей старшей конфигурации.

• Масштаб — Step 5 Preview: всего около 600B, 27B активных у StepFun против Muse Glimmer: всего 30B, с квантованием до 4 бит, менее 20 ГБ.

• Контекстное окно — Step 5 Preview: 1 млн токенов против Muse Glimmer: 131 072 с возможностью расширения до 262 144, по данным Meta.

• Цена — Step 5 Preview: $1,00 за ввод / $2,70 за вывод за миллион токенов, опубликованная цена против Muse Glimmer: плата за токены не взимается; GPU вы предоставляете сами.

• Где это работает — Предварительный просмотр шага 5: серверы вендора, по HTTP, против Muse Glimmer: ваше собственное оборудование, офлайн.

• Лицензия — Step 5 Preview: закрытое превью, веса обещаны к 15 октября 2026 года, против Muse Glimmer: Apache 2.0, уже доступно для скачивания.

• Поиск в длинном контексте — Muse Glimmer набирает 80,0 балла в оценке рассуждений с длинным контекстом на индексной доске, отставая менее чем на полбалла от моделей, которые стоят в несколько раз дороже, и настолько близко к показателю Step 5 Preview, что разница не имеет значения для принятия решений при поиске фактов.

Двадцать семь пунктов — и чего они не измеряют

Модель на 30B, дистиллированная для работы в 20 ГБ памяти, проиграет флагманской 600B в индексе общего интеллекта, и материалы самой Meta не утверждают обратного — в одной из своих формулировок она прямо говорит, что Glimmer не предназначен для того, чтобы соответствовать сырой мощности рассуждений полноразмерных облачных моделей. Так что оценка 17 — это не приговор инженерии; это ожидаемый результат взвешивания другой цели. Правильный вопрос — какие из ваших задач этот разрыв действительно затрагивает.

Именно на длинном контексте эти двое подходят ближе всего друг к другу, и именно здесь интуиция даёт сбой. Muse Glimmer набирает 80,0 балла в оценке рассуждений на длинном контексте этого лидерборда — результат, который был бы ничем не примечателен для фронтирной модели и примечателен для модели, работающей на потребительской GPU. Если ваша задача — поиск, суммаризация или извлечение по длинным документам, локальная модель такого уровня не является очевидно неподходящим инструментом, а то, что запрос никогда не покидает вашу машину, — это функция, которую нельзя купить у API ни за какую цену.

Есть и та часть сравнения, которую числа Meta не показывают. Рецензируемое исследование мультиагентной оркестрации протестировало Muse-Glimmer-30B в контролируемых условиях — та же задача, тот же тестовый стенд, те же консультанты — и обнаружило, что он не восстановил ни одного из кандидатов, созданных более крупными передовыми моделями, провалив все три попытки в каждом сценарии. Это одно-единственное исследование одной конфигурации, и это именно тот вид доказательств, который страница модели никогда не показывает. Для агентных конвейеров, где более слабому оркестратору приходится восстанавливаться после сбоя более сильной модели, это самый значимый для принятия решений результат в этом материале, и его стоит прочитать прежде любых бенчмарков Meta, заявленных производителем.

Эти бенчмарки, для полноты картины, — собственные у Meta и невоспроизведённые: 76,0% в SWE-Bench Verified, 51,2% в SWE-Bench Pro, 51,7% в TerminalBench 2.1, 65,9% в OSWorld-Verified, 83,5% в GPQA Diamond, 22% в Humanity's Last Exam и 75,5 в MCP-Atlas. Они измеряются в сравнении с моделями собственного класса размера и описывают способного локального агента, а не фронтирного ризонера.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

Где на самом деле проходит граница

Структурное преимущество Step 5 Preview в том, что он делает работу, которую вы не можете выполнить локально. Контекст в 1 млн токенов, ввод изображений, измеренный показатель, близкий к фронтиру, и 87 выходных токенов в секунду — и при этом не нужно ничего покупать из железа: для составления черновиков, планирования, ревью кода по большому репозиторию или чего угодно, где потолок модели становится узким местом, выигрывает API, и эти двадцать семь пунктов — весь аргумент. Плата за это — противоположность тому, что у Muse Glimmer: промпты покидают ваш периметр, цена взимается заново на каждом токене, а многословность модели делает задачи с длинным выводом дороже, чем предполагает ставка $2.70.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Преимущество Muse Glimmer состоит в том, что он выполняет работу, которая не может покинуть пределы системы. Если данные регулируются, если бюджет задержки составляет несколько миллисекунд, если машина находится офлайн или если предельная стоимость миллионного запроса должна быть равна нулю, то ни один API не подходит — ни этот, ни какой-либо другой. Плата за это — возможности: вы выбираете 17 там, где существует 44, а в агентной оркестрации, возможно, выбираете координатора, который не может восстановиться после ошибок более сильной модели.

Для большинства команд ответ — это не выбор, а разделение, и этому разделению нужно где-то жить. OrcaRouter маршрутизирует более 200 моделей за одним ключом API и одним счётом с наценкой 0% и сквозной передачей цены из прайс-листа провайдера, а также автоматическое переключение при сбое и DSL маршрутизации для направления трафика по задачам, стоимости или задержке. Ни Step 5 Preview, ни Muse Glimmer не входят в этот каталог — флагман StepFun не маршрутизируется нами, а Glimmer — это локальная загрузка — поэтому предлагаемая ценность — не доступ ни к одной из этих моделей. Это набор, с которым вы бы их сравнивали, доступный по одному ключу уже сегодня, чтобы решение «локально или удалённо» определялось вашим собственным распределением задач, а не страницей того вендора, которую вы прочитали последней.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Как решить

Выбирайте Step 5 Preview, когда ограничением является потолок. Если ваши задачи открытого типа, мультимодальные, с длинным контекстом или агентные в том смысле, что им нужен способный планировщик, то модель через API — единственная из двух, которая способна их выполнять, а её цена достаточно низка для своего класса, так что пилотное внедрение — это строка бюджета, а не проект. Заложите в бюджет многословность, планируйте, что дата выхода весов 15 октября сдвинется, и не включайте в это рабочие нагрузки, которые не должны покидать организацию.

Выбирайте Muse Glimmer, когда ограничивающим фактором становится периметр. Если ваши данные нельзя передавать, если вам нужно запускать модель в самолёте или на заводе, или если ваши объёмы делают цену за токен абсурдной, то практичный выбор — это модель на 30B под лицензией Apache-2.0, помещающаяся в 20 ГБ, а её результат извлечения при длинном контексте достаточно хорош, чтобы разрыв в возможностях не проявлялся в каждой рабочей нагрузке. Проверьте её в оркестрации, прежде чем доверять ей там, потому что именно там независимые свидетельства слабее всего.

Если оба ограничения срабатывают одновременно, используйте оба варианта: локальный — для данных, которые нельзя перемещать, API — для задач, которым нужна модель побольше, а решение о маршрутизации пусть будет изменением конфигурации, а не миграцией. Важное сравнение — не 44 против 17. А то, какие из ваших запросов могут позволить себе покинуть машину, и на этот вопрос можете ответить только вы сами.