Muse Spark 1.2 против Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 против Gemini 3.5 Flash-Lite: Две лаборатории, два определения субагента

Автор

Jim Song

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В течение двух недель друг за другом две лаборатории выпустили по модели и описали её одним и тем же словом. Согласно карточке самой модели, Gemini 3.5 Flash-Lite «подходит для субагентов, которые выполняют узкие задачи в рамках сложных мультиагентных рабочих процессов». Meta утверждает, что Muse Spark 1.2 может служить «либо основным агентом для планирования и делегирования, либо субагентом, работающим параллельно». Одинаковая лексика — и понадобился Artificial Analysis, прогнавший обе модели через свой Intelligence Index, чтобы показать, насколько по-разному они это понимают: Flash-Lite прошла весь набор тестов за 43 миллиона выходных токенов, а Muse Spark 1.2 потребовалось 95 миллионов. Одна из этих моделей думает коротко и часто; другая — напряжённо и долго. Обе называют результат субагентом.

Это соотношение токенов — самый решающий показатель в сравнении, потому что уровень субагентов — это то, что ты разворачиваешь: по двадцать, по сто за раз, — а разворот умножает любые привычки модели, проявляющиеся при каждом вызове. Далее разбирается, что именно построила каждая лаборатория, как выглядит арифметика разворота по реальным ценам и где дешёвый вариант оказывается дорогим выбором.

Что каждая лаборатория подразумевает под словом

Версия Flash-Lite — это роль, определяемая размером. Gemini 3.5 Flash-Lite — самый дешёвый тариф в своём семействе, и такое позиционирование примечательно тем, что уровни мышления напрямую привязаны к многошаговым рабочим нагрузкам субагентов — впервые тариф в этом семействе описан по роли агента, а не по размеру или скорости. Рассуждение обязательно, но по умолчанию уровень усилий — минимальный, максимум на регуляторе — высокий, а модель создана для массового запуска и быстрых ответов. Вендор сообщает о 54.2% на SWE-Bench Pro против 49.6% у Gemini 3 Flash и 74.0% на OSWorld-Verified против 65.1% — обе цифры предоставлены вендором, не воспроизведены независимо и поданы как прирост агентных возможностей, а не «сырого» интеллекта.

Версия Meta — это определение роли по топологии. Продуктовое описание Muse Spark 1.2 описывает модель, которая может собирать контекст, составлять план и делегировать выполнение параллельным субагентам — или сама быть одним из таких субагентов. Её регулятор рассуждений работает в диапазоне от минимального до xhigh со значением по умолчанию medium, и Meta прямо называет целевые рабочие нагрузки: многофайловый рефакторинг, длительные сеансы отладки, генерация целого репозитория. Это модель, предназначенная для роли оркестратора, который может и сам выполнять работу, — то есть совсем другой продукт, чем модель, рассчитанная на запуск по двадцать экземпляров одновременно.

Ни одна лаборатория не опубликовала бенчмарк для этого конкретного утверждения. Meta выпустила 1.2 5 августа без какого-либо анонса — страница анонса Muse Spark 1.1 до сих пор описывает предыдущую версию.

Разрыв, который индекс фактически измеряет

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Независимые баллы, полученные Artificial Analysis при прогоне одного и того же комплекса из девяти оценок на обеих:

Индекс интеллекта — Muse Spark 1.2 (xhigh) 54, место #13 из 185. Gemini 3.5 Flash-Lite 36, место #20 из 163. Восемнадцать баллов при медиане класса 32.

Скорость вывода — 165.0 токенов в секунду против 343.6. Flash-Lite выводит данные более чем в два раза быстрее.

Время до первого токена — 26,12 секунды против 10,30, оба при максимальном усилии. Artificial Analysis отмечает, что показатель 10,30 с у Flash-Lite сам по себе находится на верхней границе для рассуждающих моделей в его ценовой категории.

Многословность — 95M выходных токенов против 43M для того же набора тестов, при медиане 65M по всем моделям. Muse Spark 1.2 на 46% выше медианы; Flash-Lite — на 34% ниже.

Стоимость работы индекса — $637.85 против $153.08.

По показателям — Сублидексы Artificial Analysis оценивают Gemini 3.5 Flash-Lite в 49.3 по кодингу и 26.8 по агентности. Для Muse Spark 1.2 опубликованной разбивки пока нет; его предшественник набрал 71.3 и 37.5.

Восемнадцать пунктов индекса — это не погрешность округления. Это не два кандидата на одну и ту же позицию.

Арифметика разветвления

Цена за токен — не тот показатель для тарифа субагентов, потому что весь смысл такого тарифа в том, что вы запускаете их много. Разберём пример по прейскурантным ценам: $0.30 на входе и $2.50 на выходе для Gemini 3.5 Flash-Lite, $1.25 на входе и $4.25 на выходе для Muse Spark 1.2.

Оркестратор отправляет двадцать субагентов. Каждый читает 25 000 токенов ограниченного контекста и записывает 1 500 токенов обратно.

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = примерно 22,5 цента за fan-out.

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = примерно 75 центов за fan-out.

В три с третью раза, что звучит вполне выполнимо. Теперь применим измеренную разницу в многословности. Если Muse Spark 1.2 выдаёт пропорционально больше, чем Flash-Lite, как это было на индексе — примерно в 2,2 раза больше выходных токенов за одинаковую работу — эти ответы по 1500 токенов вырастают примерно до 3300, и стоимость разветвления возрастает примерно до 91 цента. В четыре раза, а не в три. В нагруженной агентной системе при ста разветвлениях в час это разница между $22 и $91 в час, или примерно $600 000 в год разницы при непрерывной нагрузке.

Две детали ценообразования делают реальный разрыв еще шире в одном направлении и уже в другом:

Flash-Lite тарифицирует внутренние рассуждения по цене выходных токенов. В его объявленных ценах токены внутренних рассуждений стоят $2,50 за миллион — столько же, сколько видимый вывод. Мышление не бесплатно, оно просто невидимо в ответе. Если субагент обдумывает 2000 токенов перед ответом, это добавляет полцента за вызов, или 10 центов при таком разветвлении.

В относительном выражении кэширование выгоднее для Muse Spark 1.2. Чтение кэшированных входных данных стоит $0,15 за миллион против $1,25 по прайс-листу — скидка 88%. Flash-Lite читает кэшированные входные данные по $0,03 против $0,30 — скидка 90%, но также взимает около $0,083 за миллион за запись в кэш, тогда как Muse Spark 1.2 не публикует отдельной платы за запись в кэш. При фан-ауте, когда каждый субагент использует один и тот же большой префикс, разрыв существенно сокращается.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Задержка в продакшене — вот где Flash-Lite вырывается дальше всех, и цифры бенчмарков этого не показывают. На OrcaRouter за скользящую неделю реального трафика Gemini 3.5 Flash-Lite показывает p50 времени до первого токена — 816 миллисекунд и p95 — 4,57 секунды. Muse Spark 1.1 — ближайший доступный аналог, поскольку у версии 1.2 ещё нет телеметрии, — показывает p50 1,84 секунды и p95 6,00 секунд. Когда двадцать субагентов работают параллельно, итоговое время по настенным часам задаёт самый медленный из них, поэтому задержку фан-аута определяет именно p95, а не p50.

Где дешёвый вариант — неверное решение.

Четыре ограничения в Gemini 3.5 Flash-Lite, которые не проявляются при сравнении цен, но проявятся при разборе инцидента.

Потолок вывода в 65 536 токенов. Это половина того, что допускают большинство моделей этого класса, и жёсткое ограничение для субагента, которому поручено сгенерировать большой файл или вернуть длинный структурированный документ. Эндпоинт Muse Spark 1.2 вообще не объявляет максимального объёма завершения — что достаточно необычно, чтобы проверить, а не доверять, но это не задокументированное ограничение.

Это немодерируемый эндпоинт. В описании Flash-Lite нет флага модерации; у Meta для Muse Spark 1.2 он есть. Это реальное преимущество для одних рабочих нагрузок и проблема соответствия для других, и это должно быть осознанным выбором, а не случайным открытием.

Дорогой встроенный поиск. Инструмент веб-поиска Flash-Lite стоит примерно 14 долларов за тысячу вызовов против 2,50 долларов у Muse Spark 1.2. Если ваши субагенты исследуют, а не просто читают, дешёвая модель становится дорогой — в пять с половиной раз — и объём поиска в архитектуре с разветвлением масштабируется вместе с разветвлением.

Его цена выросла, а не упала.Gemini 3.5 Flash-Lite стоит $0.30 и $2.50, тогда как предыдущий Gemini 3.1 Flash-Lite — $0.25 и $1.50. Вывод на 67% дороже, чем уровень, который он заменяет. Если вы рассчитывали бюджет субагента на основе старой модели, пересмотрите его.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Стоит прямо назвать ещё одну асимметрию: Muse Spark 1.2 обслуживается ровно одним провайдером — Meta — без сторонних хостов и без запасного варианта. Gemini 3.5 Flash-Lite имеет обычную собственную инфраструктуру развёртывания в нескольких регионах. Для оркестратора это единая точка отказа для всего вашего дерева агентов; для уровня воркеров — единая точка отказа для фан-аута.

Пара, на которой большинство команд в итоге остановятся

При сопоставлении этих двух моделей видно, что они не столько конкуренты, сколько две половины единой архитектуры, и сам текст продуктовых описаний Meta подтверждает это, описывая роль primary-agent отдельно от роли subagent.

Форма, которая следует из чисел: Muse Spark 1.2 как оркестратор, Gemini 3.5 Flash-Lite как воркеры. Один дорогой, вдумчивый вызов, который читает репозиторий, хранит план и решает, что делегировать — где 26 секунд размышлений и многословность масштаба 95M токенов дают вам план, который стоит выполнить — за которым следуют двадцать дешёвых, быстрых, узких вызовов, каждый из которых выполняет одну ограниченную задачу и при p50 возвращается менее чем за секунду. Вы платите ставки, близкие к фронтирным, один раз за задачу и бюджетные ставки за единицу работы — это именно та кривая затрат, которая нужна архитектуре fan-out.

Инвертируйте это — и экономика рушится. Двадцать субагентов Muse Spark 1.2 по 91 центу за фан-аут — это счет в четыре раза больше за работу, которую модель на 18 пунктов слабее выполняет за треть времени, а оркестратор Flash-Lite с индексом 36 будет выдавать планы, которые работники не смогут спасти.

Раньше самым неудобным было то, что сборка распределялась между двумя вендорами. Gemini 3.5 Flash-Lite есть в каталоге OrcaRouter по цене $0.30 и $2.50 — цена вендора, передаваемая с нулевой наценкой, так что изменение цены доходит до нас в тот же день, а не после контрактного цикла — а Muse Spark 1.1 доступен там по $1.25 и $4.25 на тех же условиях, оба за одним OpenAI-совместимым эндпоинтом. Это означает, что паттерн «оркестратор и воркеры» — это две строки моделей в одной кодовой базе, а не два SDK, два ключа и два счета, а автоматический фейловер покрывает случай, когда у одного вендора случается плохой день посреди фан-аута. Если говорить точно о том, что доступно: Сам Muse Spark 1.2 в каталоге пока отсутствует — Meta предоставляет его напрямую как единственный провайдер — поэтому сегодня ближайшая версия этого стека использует 1.1 в слоте оркестратора.

Выбирайте по роли, а не по баллам

Если вы выбираете рабочий уровень — разбор документов, извлечение данных, ограниченные правки файлов, классификация, узкая повторяющаяся середина агентного дерева — Gemini 3.5 Flash-Lite является лучшим инструментом, и дефицит индекса в 18 пунктов в основном не имеет значения, потому что вы не просите его рассуждать. Следите за потолком вывода и ценами на поиск.

Если вы выбираете модель, которая решает, чем занимаются работники, Muse Spark 1.2 — более сильный кандидат из двух, с оговорками: у неё нет независимой агентной оценки по каждому измерению, никаких результатов в арене, никакой производственной телеметрии и только один провайдер. Это пробелы, которые необходимо закрыть, прежде чем она сможет претендовать на производственный план.

И если вы надеялись, что одна модель справится с обеими задачами, честный ответ по данным измерений — ни одна не может. Flash-Lite не может планировать на индексе 36; Muse Spark 1.2 нельзя порождать по двадцать за раз по 91 центу за разветвление. Слово «субагент», встречающееся в описаниях обоих продуктов, — это маркетинговое совпадение, а не признак того, что они относятся к одной категории.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube