Сгенерирована hero-карточка под названием Claude Sonnet 5.5 vs Muse Glimmer с подзаголовком: 30B-модель для ноутбука против нового Sonnet; на ней три карточки статистики: индекс интеллекта 56 против 17, контекстное окно 1M против 131K токенов и веса: закрытые против Apache 2.0, а в нижнем колонтитуле указано: индекс согласно Artificial Analysis v4.3.2; спецификации Muse Glimmer согласно Meta.
Guides & Insights

Claude Sonnet 5.5 vs Muse Glimmer: 30B-модель для ноутбука против нового Sonnet

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Основной вопрос этой страницы — законно ли такое сравнение в принципе, и честный ответ таков: Claude Sonnet 5.5 и Muse Glimmer не являются конкурентами в обычном смысле. В Индексе интеллекта Artificial Analysis, версия v4.3.2, Claude Sonnet 5.5 набирает 56 баллов, а Muse Glimmer — 17, и этот разрыв не шум — это примерно расстояние между передовой моделью общего назначения и очень хорошей небольшой моделью. Но всё же эта пара заслуживает прочтения потому, что у Muse Glimmer есть одно свойство, которое другая модель не купит ни за какие деньги: это модель с открытыми весами и 30 миллиардами параметров, опубликованная Meta 10 августа 2026 года под лицензией Apache 2.0, квантованная до 4 бит, так что помещается менее чем в 20 ГБ видеопамяти, и рассчитанная на работу с отключённой сетью. Claude Sonnet 5.5 появился 28 сентября 2026 года как самый быстрый и самый умный Sonnet от производителя, по цене $2.00 за миллион входных и $10.00 за миллион выходных токенов, и доступен только по сети. Настоящее решение — не в том, какая модель лучше. А в том, где вы хотите запускать токены.

Две модели, два определения задачи

Muse Glimmer появляется из Meta Superintelligence Labs как модель с 30 млрд параметров, обученная дистилляцией логитов от более крупной учительской модели Meta Muse Spark, а затем дообученная на агентных данных с длинным контекстом и усиленная для использования инструментов. Meta выпустила её уже квантованной: 4-битное квантование снижает объём занимаемой памяти с более чем 55 ГБ при полной точности до менее чем 20 ГБ, и именно это позволяет ей уложиться в рамки потребительского GPU с 24 ГБ или 32 ГБ памяти. Meta протестировала её на Nvidia RTX 5090 и на чипах Apple M4 Max и M5 Max. Она принимает на вход текст и изображения, возвращает текст, работает с окном контекста 131 072 токена, которое, по словам Meta, можно расширить до 262 144, и имеет дату отсечения знаний — январь 2026 года.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 — вторая модель в поколении 5.5 компании Anthropic и та, которую компания позиционирует как лучшее сочетание скорости и интеллекта в своей линейке. Она работает с окном в 1 000 000 токенов, выдаёт до 128 000 токенов синхронно и до 300 000 в Message Batches API при использовании output-300k-2026-03-24 заголовка, принимает текст, изображения и файлы, предлагает адаптивное мышление с выбираемым уровнем усилий и датой отсечки знаний июнь 2026 года, а также доступна с нулевым хранением данных с момента запуска. Хранение стоит $0,20 за миллион токенов при чтении из кэша и $2,50 за миллион при записи в кэш. Anthropic утверждает, что она работает на 30% быстрее Claude Sonnet 5 и стоит до 30% меньше на задачу при неизменных тарифах, — это заявления производителя, независимо не подтверждённые.

Контраст в спецификации стоит увидеть за один проход, потому что почти каждая строка — это не что-то лучшее или худшее, а вещь иного рода:

• Веса — Muse Glimmer Apache 2.0, доступны для скачивания, квантованы до 4 бит, в отличие от закрытой Claude Sonnet 5.5

• Где запускается — Muse Glimmer на вашем собственном GPU, офлайн, против Claude Sonnet 5.5 на инфраструктуре A​nthropic

• Параметры — Muse Glimmer: всего 30B, менее 20 ГБ при 4-битном квантовании против нераскрытых параметров Claude Sonnet 5.5

• Контекст — Muse Glimmer: 131 072 токена с возможностью расширения до 262 144 против 1 000 000 токенов у Claude Sonnet 5.5

• Цена за миллион — Muse Glimmer: оплаты за токены нет, ваше оборудование; для сравнения Claude Sonnet 5.5 — $2.00 за вход / $10.00 за выход

• Intelligence Index v4.3.2 — Muse Glimmer 17 против Claude Sonnet 5.5 56

• Стоимость одной задачи Index по результатам измерений — Muse Glimmer $0.06 против Claude Sonnet 5.5 $7.60

Две цифры в этом списке заслуживают разбора, потому что обе — ловушки. Первая — это цифра $0,06 на задачу: именно столько Artificial Analysis потратила, вызывая Muse Glimmer (high) через хостинговый эндпоинт по цене $0,325 за миллион входных и $1,35 за миллион выходных токенов, так что она измеряет экономику аренды этой модели, а не её запуска. При самостоятельном хостинге предельная стоимость за токен исчезает и заменяется GPU, который у вас уже есть или который придётся купить. Вторая — сам разрыв в Index: модель на 30B, квантованная до 20 GB, оценивается по той же линейке, что и фронтирные модели, и таблица лидеров прямо это признаёт, когда помещает Muse Glimmer в небольшую группу лучших open-weight моделей, отмечая при этом, что для своего размера она дорогая.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

В чём Muse Glimmer действительно хорош, и где всё идёт под откос

Сводная оценка слишком груба, чтобы быть единственным ответом, потому что Muse Glimmer не везде показывает семнадцать. Она быстра — Artificial Analysis измеряет 143,8 выходных токенов в секунду, что выше 138,7 у Claude Sonnet 5.5, — и лаконична: генерирует 59 млн токенов в рамках оценки Index против 410 млн у Claude Sonnet 5.5. А в одной оценке она близка к переднему краю: recall по длинному контексту, где она набирает 83,3% против 82,7% у Claude Sonnet 5.5. Модель на 30B, соответствующая совершенно новому фронтирному Sonnet в извлечении из длинного контекста, — самая удивительная строка на этой странице, и это согласуется с тем, как её обучала Meta: агентные данные с длинным контекстом, дистилляция от значительно более крупного учителя.

Именно на агентных результатах виден потолок модели, и рейтинг перестаёт льстить. На Terminal-Bench 4.0 Muse Glimmer набирает 0,5% против 63,6% у Claude Sonnet 5.5. Её показатель в автоматизационном бенчмарке — 0,068 против 0,713. Humanity's Last Exam: 22,0% против 55,0%. Столь низкий результат на бенчмарке выполнения означает, что модель не справляется с задачами, и никакая экономия на локальном хостинге не сделает задачу, которая так и не завершается, дешевле.

Научная литература тоже высказывается об этом прямо, и это стоит сказать, а не замолчать: рецензируемое исследование по оркестрации мультиагентных систем, в котором Muse-Glimmer-30B была одной из протестированных моделей, показало, что она не восстановила ни одного из своих кандидатов. Собственная таблица бенчмарков Meta для этой модели — это документ поставщика, и здесь он обозначен именно так; приведённые выше показатели Artificial Analysis — независимые измерения, и именно на них опирается эта статья.

Итак, это разделение вполне различимо. Muse Glimmer — сильная для своего размера модель: хорошо читает длинный ввод и отвечает по нему, работает быстро, дёшева в эксплуатации и помещается в GPU ноутбучного класса. Это не та модель, которой можно поручить многошаговую задачу по разработке ПО и уйти. Это честная граница, и сравнение, построенное только на композитных оценках, скрыло бы её.

Что вы на самом деле покупаете по тарифу «Фронтир»

Премиальная цена Claude Sonnet 5.5 в первую очередь окупается возможностями, и разрыв в семнадцать пунктов в Индексе — её главное проявление. Но вместе со ставкой $10,00 за вывод идут ещё три вещи, которые не отображаются ни в одной таблице лидеров.

Первое — это окно. Миллион токенов — это примерно в семь с половиной раз больше, чем 131 072 у Muse Glimmer, и Anthropic взимает стандартную ставку за всё это, причём чтение из кэша стоит десятую часть цены ввода, так что переносить большой контекст через множество вызовов становится доступным, а не теоретическим. Подсказка масштаба репозитория вообще не помещается в меньшее окно, поэтому это разница в возможностях, а не в предпочтениях.

Второе — точность работы с инструментами. Между Claude Sonnet 5 и Claude Sonnet 5.5 изменилось пять моделей поведения, и все пять касаются использования инструментов и рассуждений: нестандартные параметры сэмплирования теперь возвращают 400, thinking: {"type": "disabled"} теперь возвращает 400 и превращается в between_tools, принудительный выбор инструмента "any" или именованного инструмента отклоняется, так что циклам приходится переходить на auto со строгим использованием инструментов, более старый инструмент computer_20251124 не принимается в Claude API и Gooogle Cloud, а блоки рассуждений теперь привязаны к создавшей их модели и аккаунту. Шестое изменение ничего не ломает, но проходит незаметно: текст между вызовами инструментов возвращается внутри блоков рассуждений, поэтому потоковое приложение перестаёт показывать вывод, пока не задаст значение отображения или не отключит предварительное рассуждение. Это день работы по миграции для любого, кто использует Sonnet 5, и это плата за доступ к надёжности агентов, которую измеряют строки бенчмарка выше.

Третье — это происхождение данных и обращение с ними. Нулевое хранение данных доступно с момента запуска, A​nthropic публикует минимальный срок вывода из эксплуатации — 28 сентября 2027 года, а модель доступна в Claude API, Bedrock, Goo​gle Cloud и Microsoft Foundry. Для регулируемого покупателя это факты о закупке, которые определяют решение о покупке раньше, чем это сделают результаты бенчмарков.

Офлайн — это требование, а не экономия средств.

Причина, по которой эту пару стоит разместить на одной странице, в том, что для определённого класса развёртываний Muse Glimmer — не более дешёвый вариант, а единственный. Запрос, который не может покинуть устройство; производственный цех или выездная площадка без подключения; изолированная от сети среда, где вызов API нарушает требования соответствия; или бюджет задержки, в котором даже один круговой обмен уже непозволителен: ни одну из этих задач не решает более совершенная модель, стоящая за сетью. Веса под Apache 2.0, которые укладываются в 20 ГБ и работают офлайн, — это и есть весь ответ, а Claude Sonnet 5.5 при любой цене в этом вопросе вообще не участвует.

Опубликованные M​eta тесты на чипах RTX 5090, Apple M4 Max и M5 Max — это практический ориентир для того, что здесь означает «работать локально», и именно 4-битная квантизация делает эти цели вообще достижимыми — объём в полной точности превышает 55 ГБ. Всем, кто планирует развёртывание, следует относиться к аппаратным цифрам как к данным M​eta, а не как к измеренным здесь.

Для всех остальных эти две модели — дополнения, а не замена друг друга, и операционно неудобно то, что держать модель через API Anthropic и самостоятельно развёрнутую модель Meta обычно означает два полностью раздельных стека. OrcaRouter помещает более 200 моделей за одну конечную точку, совместимую с OpenAI, с передачей прайс-листовой цены провайдера и без добавления наценки, автоматическое переключение при сбое между вышестоящими провайдерами и DSL маршрутизации для композиции вызовов — что покрывает хостинговую половину этой схемы, и более крупную модель-учитель Muse Spark 1.2 от Meta можно маршрутизировать здесь как meta/muse-spark-1.2 по цене $1.25 за входные и $4.25 за выходные данные за миллион токенов в окне на 1 048 576 токенов, с чтением из кэша за $0.15. Через этот каталог проходит 42,8 миллиона токенов трафика в неделю, и это как раз полезная часть схемы: хостинговая модель-учитель находится на том же ключе, что и всё остальное, а модель, которую вы запускаете локально, вообще не должна обращаться к сети.

Три замечания о честности, потому что в них легко ошибиться. Сам Muse Glimmer не является одним из наших маршрутов — карточки этой модели нет в нашем каталоге, и на этой странице так и сказано, а не подразумевается обратное. Приведённый ниже снимок — это страница модели, которая действительно существует, Muse Spark 1.2: это чекпойнт, из которого был дистиллирован Muse Glimmer, а не сам Muse Glimmer. Claude Sonnet 5.5 тоже нет в нашем каталоге — через день после релиза; маршрут к нему — собственный API Anthropic, а Claude Sonnet 5 доступен для маршрутизации здесь с 30 июня по цене $2.00 и $10.00 для всех, кому нужна эта промежуточная цель.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

Как решить

Исходите из ограничения, а не из оценки. Если запрос не может выйти за пределы машины или сети, ответ — Muse Glimmer, и разрыв в Index не имеет значения: 30B-модель под лицензией Apache 2.0, которая работает офлайн и не уступает передовой модели в извлечении информации из длинного контекста, для этой задачи — лучшее из доступного. Если запрос должен выполнить многошаговую задачу в области ПО, 30B-модель, набирающая полпроцента на Terminal-Bench, не в числе кандидатов, независимо от того, какое оборудование у вас уже есть.

Между этими двумя полюсами решающим фактором становится измерение, а не мнение: количество токенов на выполненную задачу в вашей собственной рабочей нагрузке, оценённое дважды — один раз по ценам Claude Sonnet 5.5 в $2.00 и $10.00, а другой раз по амортизированной стоимости GPU. То единственное число, которое заставляет по-новому взглянуть на всё сравнение, — $0.06 за задачу Index против $7.60 — это цифра аренды на хостинге для модели, которую большинство людей будут запускать сами, и приводить её так, будто это сопоставимая экономия, было бы лёгкой ошибкой, предотвратить которую и призвана эта страница.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно