
Step 5 Preview против Muse Glimmer: Frontier API и модель для ноутбука
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
В таблице лидеров Step 5 Preview и Muse Glimmer не близки: 44 против 17 в Artificial Analysis Intelligence Index — разрыв в двадцать семь пунктов по шкале, текущий лидер которой находится в верхней части пятидесятых — который никакая настройка не закроет. По вопросу, на который команде действительно нужно ответить — где выполняются мои токены — они прямые конкуренты. Step 5 Preview — флагман StepFun, анонсированный 20 сентября 2026 года, примерно 600 миллиардов общих параметров при 27 миллиардах активных, контекст в 1M токенов, цена $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов, доступен только по сети. Muse Glimmer — 30-миллиардная агентная модель с открытыми весами от Meta Superintelligence Labs, выпущенная 10 августа 2026 года под лицензией Apache 2.0, поставляется квантованной до 4 бит, поэтому помещается в память менее 20 ГБ и работает на одной потребительской GPU с отключенной сетью. Правильный способ воспринимать эту пару — не «кто умнее». А «какое из двух ограничений — возможности или периметр — является тем, которое ваша рабочая нагрузка не может сдвинуть».
Это сравнение также служит полезной поправкой к привычке, которую усвоил этот рынок: считать балл композитного индекса всей ценностью модели. Разрыв в двадцать семь пунктов реален, и это не единственное число в файле. В задачах поиска по длинному контексту тот же независимый совет ставит Muse Glimmer в пределах половины балла от моделей с открытыми весами из куда более крупной весовой категории, а собственные агентные бенчмарки Meta выглядят достойно для модели, работающей на ноутбуке. Между тем самую часто упоминаемую слабость Step 5 Preview составляет вовсе не способность, а многословность, и она закрыта до 15 октября, когда должны появиться обещанные веса.
Две модели, два совершенно разных объекта
Step 5 Preview — это система mixture-of-experts, работающая на инфраструктуре StepFun: около 600 млрд общих параметров, 27 млрд активных на токен, ввод текста и изображений, контекстное окно в 1 млн токенов и независимая оценка Intelligence Index 44 против медианы 26 у сопоставимых моделей. Её вывод работает со скоростью 87 токенов в секунду против среднего значения 78 по измерению того же рейтинга, и она сгенерировала около 160 млн выходных токенов в наборе задач индекса, где медианная модель выдаёт около 82 млн — примерно вдвое больше текста на единицу работы, при цене 2,70 доллара за миллион. Веса BF16 были обещаны к 15 октября 2026 года и пока отсутствуют в репозитории, поэтому сегодня модель доступна вам только как API.
Muse Glimmer — это противоположный объект. Это модель с 30 млрд параметров, обученная методом дистилляции логитов у более крупной модели-учителя Muse Spark от Meta, затем дообученная на агентных данных с длинным контекстом и обученная с подкреплением для работы с инструментами. Meta поставляет её в 4-битном квантовании, что снижает объём памяти с более чем 55 ГБ при полной точности до менее 20 ГБ — в пределах 24 ГБ или 32 ГБ видеопамяти, — и она была протестирована Meta на Nvidia RTX 5090, а также на чипах Apple M4 Max и M5 Max. Она принимает на вход текст и изображения более чем на ста языках, поддерживает контекст в 131 072 токена с возможностью расширения до 262 144 и создана для того, чтобы принимать цель, разбивать её на шаги, вызывать инструменты и повторять неудачный вызов, а не останавливаться. Она распространяется под лицензией Apache 2.0 и работает офлайн.
• Независимая оценка — Step 5 Preview: 44 при медиане 26 в своём классе против Muse Glimmer: 17 по тому же индексу в своей старшей конфигурации.
• Масштаб — Step 5 Preview: всего около 600B, 27B активных у StepFun против Muse Glimmer: всего 30B, с квантованием до 4 бит, менее 20 ГБ.
• Контекстное окно — Step 5 Preview: 1 млн токенов против Muse Glimmer: 131 072 с возможностью расширения до 262 144, по данным Meta.
• Цена — Step 5 Preview: $1,00 за ввод / $2,70 за вывод за миллион токенов, опубликованная цена против Muse Glimmer: плата за токены не взимается; GPU вы предоставляете сами.
• Где это работает — Предварительный просмотр шага 5: серверы вендора, по HTTP, против Muse Glimmer: ваше собственное оборудование, офлайн.
• Лицензия — Step 5 Preview: закрытое превью, веса обещаны к 15 октября 2026 года, против Muse Glimmer: Apache 2.0, уже доступно для скачивания.
• Поиск в длинном контексте — Muse Glimmer набирает 80,0 балла в оценке рассуждений с длинным контекстом на индексной доске, отставая менее чем на полбалла от моделей, которые стоят в несколько раз дороже, и настолько близко к показателю Step 5 Preview, что разница не имеет значения для принятия решений при поиске фактов.
Двадцать семь пунктов — и чего они не измеряют
Модель на 30B, дистиллированная для работы в 20 ГБ памяти, проиграет флагманской 600B в индексе общего интеллекта, и материалы самой Meta не утверждают обратного — в одной из своих формулировок она прямо говорит, что Glimmer не предназначен для того, чтобы соответствовать сырой мощности рассуждений полноразмерных облачных моделей. Так что оценка 17 — это не приговор инженерии; это ожидаемый результат взвешивания другой цели. Правильный вопрос — какие из ваших задач этот разрыв действительно затрагивает.
Именно на длинном контексте эти двое подходят ближе всего друг к другу, и именно здесь интуиция даёт сбой. Muse Glimmer набирает 80,0 балла в оценке рассуждений на длинном контексте этого лидерборда — результат, который был бы ничем не примечателен для фронтирной модели и примечателен для модели, работающей на потребительской GPU. Если ваша задача — поиск, суммаризация или извлечение по длинным документам, локальная модель такого уровня не является очевидно неподходящим инструментом, а то, что запрос никогда не покидает вашу машину, — это функция, которую нельзя купить у API ни за какую цену.
Есть и та часть сравнения, которую числа Meta не показывают. Рецензируемое исследование мультиагентной оркестрации протестировало Muse-Glimmer-30B в контролируемых условиях — та же задача, тот же тестовый стенд, те же консультанты — и обнаружило, что он не восстановил ни одного из кандидатов, созданных более крупными передовыми моделями, провалив все три попытки в каждом сценарии. Это одно-единственное исследование одной конфигурации, и это именно тот вид доказательств, который страница модели никогда не показывает. Для агентных конвейеров, где более слабому оркестратору приходится восстанавливаться после сбоя более сильной модели, это самый значимый для принятия решений результат в этом материале, и его стоит прочитать прежде любых бенчмарков Meta, заявленных производителем.
Эти бенчмарки, для полноты картины, — собственные у Meta и невоспроизведённые: 76,0% в SWE-Bench Verified, 51,2% в SWE-Bench Pro, 51,7% в TerminalBench 2.1, 65,9% в OSWorld-Verified, 83,5% в GPQA Diamond, 22% в Humanity's Last Exam и 75,5 в MCP-Atlas. Они измеряются в сравнении с моделями собственного класса размера и описывают способного локального агента, а не фронтирного ризонера.

Где на самом деле проходит граница
Структурное преимущество Step 5 Preview в том, что он делает работу, которую вы не можете выполнить локально. Контекст в 1 млн токенов, ввод изображений, измеренный показатель, близкий к фронтиру, и 87 выходных токенов в секунду — и при этом не нужно ничего покупать из железа: для составления черновиков, планирования, ревью кода по большому репозиторию или чего угодно, где потолок модели становится узким местом, выигрывает API, и эти двадцать семь пунктов — весь аргумент. Плата за это — противоположность тому, что у Muse Glimmer: промпты покидают ваш периметр, цена взимается заново на каждом токене, а многословность модели делает задачи с длинным выводом дороже, чем предполагает ставка $2.70.

Преимущество Muse Glimmer состоит в том, что он выполняет работу, которая не может покинуть пределы системы. Если данные регулируются, если бюджет задержки составляет несколько миллисекунд, если машина находится офлайн или если предельная стоимость миллионного запроса должна быть равна нулю, то ни один API не подходит — ни этот, ни какой-либо другой. Плата за это — возможности: вы выбираете 17 там, где существует 44, а в агентной оркестрации, возможно, выбираете координатора, который не может восстановиться после ошибок более сильной модели.
Для большинства команд ответ — это не выбор, а разделение, и этому разделению нужно где-то жить. OrcaRouter маршрутизирует более 200 моделей за одним ключом API и одним счётом с наценкой 0% и сквозной передачей цены из прайс-листа провайдера, а также автоматическое переключение при сбое и DSL маршрутизации для направления трафика по задачам, стоимости или задержке. Ни Step 5 Preview, ни Muse Glimmer не входят в этот каталог — флагман StepFun не маршрутизируется нами, а Glimmer — это локальная загрузка — поэтому предлагаемая ценность — не доступ ни к одной из этих моделей. Это набор, с которым вы бы их сравнивали, доступный по одному ключу уже сегодня, чтобы решение «локально или удалённо» определялось вашим собственным распределением задач, а не страницей того вендора, которую вы прочитали последней.

Как решить
Выбирайте Step 5 Preview, когда ограничением является потолок. Если ваши задачи открытого типа, мультимодальные, с длинным контекстом или агентные в том смысле, что им нужен способный планировщик, то модель через API — единственная из двух, которая способна их выполнять, а её цена достаточно низка для своего класса, так что пилотное внедрение — это строка бюджета, а не проект. Заложите в бюджет многословность, планируйте, что дата выхода весов 15 октября сдвинется, и не включайте в это рабочие нагрузки, которые не должны покидать организацию.
Выбирайте Muse Glimmer, когда ограничивающим фактором становится периметр. Если ваши данные нельзя передавать, если вам нужно запускать модель в самолёте или на заводе, или если ваши объёмы делают цену за токен абсурдной, то практичный выбор — это модель на 30B под лицензией Apache-2.0, помещающаяся в 20 ГБ, а её результат извлечения при длинном контексте достаточно хорош, чтобы разрыв в возможностях не проявлялся в каждой рабочей нагрузке. Проверьте её в оркестрации, прежде чем доверять ей там, потому что именно там независимые свидетельства слабее всего.
Если оба ограничения срабатывают одновременно, используйте оба варианта: локальный — для данных, которые нельзя перемещать, API — для задач, которым нужна модель побольше, а решение о маршрутизации пусть будет изменением конфигурации, а не миграцией. Важное сравнение — не 44 против 17. А то, какие из ваших запросов могут позволить себе покинуть машину, и на этот вопрос можете ответить только вы сами.
