
Muse Glimmer достигает 230 токенов в секунду на одной RTX 5090: поддержка SGLang Day-0 — вот настоящая история запуска
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
Двести тридцать токенов в секунду — быстрая цифра для любой модели. Для Muse Glimmer — 30B-релиза Meta с плотной архитектурой и открытыми весами от Meta Superintelligence Labs, выпущенного 10 августа 2026 года под лицензией Apache 2.0, — именно эта цифра отделяет модель, которая «работает на моём GPU», от той, которая «обслуживает настоящего агента». SGLang объявила о day-0 поддержке Muse Glimmer в тот же день, когда появились веса, и её опубликованный замер на одной GeForce RTX 5090 составляет 236,4 токена в секунду на пользователя при batch 1, с включёнными NVFP4-квантизацией и драфтером спекулятивного декодирования DFlash от Meta.
Эта одна цифра рассказывает большую часть истории этого релиза, но над остальным стоит замедлиться, потому что интересное не в скорости из заголовков. Интересное в том, что модель также работает из коробки на RTX PRO 6000, на NVIDIA DGX Spark и на Apple silicon через MLX — и что SGLang называет эту работу сотрудничеством с Meta Superintelligence Labs, а не довеском от сообщества. Это первая за долгое время модель Meta, близкая к переднему краю, которая спроектирована вокруг стека обслуживания, а не только вокруг весов.
Что здесь на самом деле означает «day-0 support»
Поддержка Day-0 в SGLang v0.5.17 означает, что модель не была добавлена постфактум: рантайм-часть вышла в том же релизном окне, что и веса, со специально разработанным путём для аппаратного обеспечения, на которое Meta действительно нацелена. Бэкенд SM120 от SGLang охватывает линейку Blackwell для десктопов и рабочих станций — RTX 5090, RTX PRO 6000 и DGX Spark работают на одном оптимизированном пути, — а Apple silicon получает нативный MLX-бэкенд вместо медленного порта.
Стек, под который SGLang и Meta выполнили тюнинг, специфичен. Модель работает как чекпоинт NVFP4 объёмом 18 ГБ в паре с драфтером DFlash в формате BF16 объёмом 5 ГБ — это вспомогательная модель спекулятивного декодирования, которую Meta обучила для Muse Glimmer. Такая комбинация помещается на карту объёмом 32 ГБ с запасом, а весь путь смешанного квантования NVFP4-плюс-MXFP8 занимает примерно 19,5 ГБ в памяти. Что касается SGLang, в примечаниях к выпуску упоминаются три механизма надёжности как часть той же истории: спекулятивное декодирование DFlash, RadixAttention для кэширования префиксов и прерываемые CUDA-графы.
Число, и что оно собой представляет, а что нет.
SGLang опубликованные показатели RTX 5090, все с NVFP4 и путём SM120, выглядят следующим образом:
• Декодирование для одного пользователя (пакет 1) — 63,9 токенов/с в стандартном режиме, 236,4 токенов/с с помощью спекулятивного декодирования DFlash. Этот прирост в 3,7 раза — показатель интерактивности, тот самый, который определяет, ощущается ли локальный агент как разговор или как очередь.
• Совокупная пропускная способность (батч 8) — 501 токен/с стандартно, 1 452 токен/с с DFlash. Это показатель пропускной способности для локального сервера, обрабатывающего несколько запросов одновременно.
• Для сравнения, GGUF q4_k_m на том же GPU — путь, который большинство людей будет использовать с рантаймами в стиле llama.cpp — достигает 72,6 токенов/с в стандартном режиме и 140,7 токенов/с с DFlash. Путь NVFP4 заметно опережает.
Это опубликованные SGLang и Meta цифры со дня запуска, а не независимые воспроизведения — честная формулировка: «заявлено вендором и фреймворком», а независимая проверка сообществом появится в ближайшие недели. Но закономерность в обоих стеках, объявивших цифры, устойчива. В llama.cpp Meta сообщила о 74.9–233.4 токен/с на RTX 5090 с DFlash, что в 3.1 раза быстрее; M5 Max показывает 26.6–50.2; M4 Max — 23.7–37.8. Два разных рантайма, два разных стиля измерений, один и тот же порядок величин: модель на 30B декодирует со скоростью более 200 токенов в секунду на одной потребительской GPU, а DFlash примерно утраивает пропускную способность на каждой конфигурации Nvidia, по которой опубликованы цифры.
Почему "serves" важнее, чем "runs"
Блог Meta по аппаратному обеспечению делает более резкое заявление, чем цифры для десктопов. На NVIDIA Blackwell Ultra — поколении для дата-центров, а не десктопной карте — в блоге указывается более 20 000 токенов в секунду на GPU при BF16/NVF4, при этом SGLang и vLLM названы поддерживаемыми open-source стеками. Это совсем другая лига, и это говорит о том, что Meta на самом деле строит: одни и те же веса должны работать где угодно — от ноутбука до серверной стойки GPU, а фреймворки для обслуживания считались полноправными с первого дня, а не портами, которые нужно было писать позже.
Надёжная половина истории важна не меньше скорости. Локальный агент, который умирает на середине задачи из-за сбоя serving-слоя, по сути ничем не лучше облачного агента, упёршегося в ограничение частоты запросов. Механизмы в day-0 стеке — прерываемое спекулятивное декодирование, кэширование префиксов, позволяющее дёшево возвращаться в длинные контексты агента, и драфтер, настроенный на базовую модель, — это именно те компоненты, которые делают постоянно работающих локальных агентов жизнеспособными. Это те самые «скорость и надёжность», на которые указывал запуск, и это реальная инженерная позиция, а не маркетинговый слоган.

Что вы на самом деле можете с этим делать
Muse Glimmer — это плотная мультимодальная модель с 30 млрд параметров: текстовый и графический ввод через замороженный перцептивный энкодер, текстовый вывод. Она обучена на более чем 100 языках, имеет контекстное окно на 131 072 токена и срез знаний от 4 января 2026 года. Её предназначение — неприглядная агентная работа: вызов функций, использование инструментов, управление расписанием и файлами, оценка LLM в роли судьи и многошаговые задачи с восстановлением после сбоев — когда вызов инструмента завершается сбоем, модель обучена диагностировать проблему и повторять попытку, а не останавливаться. Она предоставляет уровни интенсивности рассуждений (от low до xhigh), которые задаются в системном промпте: именно так можно обменивать задержку на глубину рассуждений при одних и тех же весах.
Показатель в 230 токенов в секунду — это то, что делает всё это пригодным для использования на одной машине. При скорости ниже примерно 50 токенов/с интерактивный агент ощущается как сеанс удалённой отладки; при 200 и выше — как локальный инструмент. В этом одном числе заключён весь аргумент в пользу модели, и именно поэтому список железа — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — читается как руководство по покупкам для эпохи локальных агентов, а не как сноска о совместимости.
Сколько это стоит
Сам Muse Glimmer бесплатен — веса под лицензией Apache 2.0 на Hugging Face по адресу meta-models/Muse-Glimmer-30B, с уже опубликованными GGUF-квантованиями для рантаймов в стиле llama.cpp и без публичного Meta API. Реальная стоимость — это лежащее под ним оборудование: чекпоинт NVFP4 на 18 ГБ плюс драфтер на 5 ГБ означают, что вам нужна видеокарта на 24 или 32 ГБ, либо мощный Mac серии M. Если у вас уже это есть, предельные затраты на постоянно работающего локального агента — это электроэнергия. Если нет, то видеокарта — это статья расходов, и именно так честно сравнивать «бесплатную модель» с размещённым API.
Когда вы всё же проводите такое сравнение, оценивайте обе стороны честно. В OrcaRouter цена, которую вы видите для любой из более чем 200 размещённых моделей, — это прейскурантная цена провайдера, переданная без наценки (0%), поэтому снижение цены вендором вступает в силу здесь в тот же день — это сохраняет честность расчёта между локальным и размещённым вариантами. Сама Muse Glimmer сегодня отсутствует в OrcaRouter, поскольку ни один инференс-провайдер ещё не обслуживает её; она поставляется в виде загрузки. Как только какой-либо провайдер начнёт её обслуживать, тот же ключ, который открывает доступ к остальному каталогу, будет работать и с ней, а автоматическое переключение при сбое — это механизм, который делает безопасным направление производственного трафика на совершенно новую, заявленную вендором модель до того, как у неё появится независимый послужной список.

Более масштабная история, стоящая за скоростью
Воспринимайте работу SGLang на день релиза как сигнал — и выпуск перестаёт быть просто одной моделью. Muse Glimmer — это дистиллированная версия проприетарного флагмана Meta, Muse Spark 1.2, и Meta заявила, что веса учительской модели появятся «в ближайшие недели». Локальный агент на 30B параметров с оптимизированным серверным стеком, учительская модель, которая вот-вот станет открытой, и объявленный вместе с этим фонд сообщества на $1 миллиард — это не точечный релиз. Это начало линейки открытых весов, нацеленной прямо на рынок локальных агентов, а поддержка фреймворков с первого дня — та часть, которая говорит, что Meta рассчитывает, что люди будут реально запускать модель, а не просто скачивать.
Оговорка, которую стоит учитывать: все показатели скорости и производительности, связанные с этим запуском, пока что предоставлены вендором или фреймворком. Показатели пропускной способности согласуются между двумя независимыми стеками, что обнадёживает, но именно независимое бенчмаркирование, запись в Artificial Analysis и воспроизведение в реальных условиях подтвердят историю о 230 токенах в секунду — и они обычно появляются в течение нескольких недель после подобного релиза.
За чем следить, в примерном порядке по скорости: выход Muse Spark 1.2 с открытыми весами (стратегическая трактовка «Meta is back» зависит от этого); первые независимые воспроизведения замеров пропускной способности на оборудовании не от Nvidia, где путь MLX — тот, за которым стоит наблюдать; и первый инференс-провайдер, поднимающий эндпоинт Glimmer, — это как раз тот момент, когда аргументы «бесплатная локальная модель» и «хостируемый API» перестают быть гипотетическими и превращаются в выбор, который можно сделать одним нажатием клавиши.

