
Muse Spark 1.2 против Gemini 3.5 Flash-Lite: Две лаборатории, два определения субагента
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxНОВИНКАMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
В течение двух недель друг за другом две лаборатории выпустили по модели и описали её одним и тем же словом. Согласно карточке самой модели, Gemini 3.5 Flash-Lite «подходит для субагентов, которые выполняют узкие задачи в рамках сложных мультиагентных рабочих процессов». Meta утверждает, что Muse Spark 1.2 может служить «либо основным агентом для планирования и делегирования, либо субагентом, работающим параллельно». Одинаковая лексика — и понадобился Artificial Analysis, прогнавший обе модели через свой Intelligence Index, чтобы показать, насколько по-разному они это понимают: Flash-Lite прошла весь набор тестов за 43 миллиона выходных токенов, а Muse Spark 1.2 потребовалось 95 миллионов. Одна из этих моделей думает коротко и часто; другая — напряжённо и долго. Обе называют результат субагентом.
Это соотношение токенов — самый решающий показатель в сравнении, потому что уровень субагентов — это то, что ты разворачиваешь: по двадцать, по сто за раз, — а разворот умножает любые привычки модели, проявляющиеся при каждом вызове. Далее разбирается, что именно построила каждая лаборатория, как выглядит арифметика разворота по реальным ценам и где дешёвый вариант оказывается дорогим выбором.
Что каждая лаборатория подразумевает под словом
Версия Flash-Lite — это роль, определяемая размером. Gemini 3.5 Flash-Lite — самый дешёвый тариф в своём семействе, и такое позиционирование примечательно тем, что уровни мышления напрямую привязаны к многошаговым рабочим нагрузкам субагентов — впервые тариф в этом семействе описан по роли агента, а не по размеру или скорости. Рассуждение обязательно, но по умолчанию уровень усилий — минимальный, максимум на регуляторе — высокий, а модель создана для массового запуска и быстрых ответов. Вендор сообщает о 54.2% на SWE-Bench Pro против 49.6% у Gemini 3 Flash и 74.0% на OSWorld-Verified против 65.1% — обе цифры предоставлены вендором, не воспроизведены независимо и поданы как прирост агентных возможностей, а не «сырого» интеллекта.
Версия Meta — это определение роли по топологии. Продуктовое описание Muse Spark 1.2 описывает модель, которая может собирать контекст, составлять план и делегировать выполнение параллельным субагентам — или сама быть одним из таких субагентов. Её регулятор рассуждений работает в диапазоне от минимального до xhigh со значением по умолчанию medium, и Meta прямо называет целевые рабочие нагрузки: многофайловый рефакторинг, длительные сеансы отладки, генерация целого репозитория. Это модель, предназначенная для роли оркестратора, который может и сам выполнять работу, — то есть совсем другой продукт, чем модель, рассчитанная на запуск по двадцать экземпляров одновременно.
Ни одна лаборатория не опубликовала бенчмарк для этого конкретного утверждения. Meta выпустила 1.2 5 августа без какого-либо анонса — страница анонса Muse Spark 1.1 до сих пор описывает предыдущую версию.
Разрыв, который индекс фактически измеряет

Независимые баллы, полученные Artificial Analysis при прогоне одного и того же комплекса из девяти оценок на обеих:
• Индекс интеллекта — Muse Spark 1.2 (xhigh) 54, место #13 из 185. Gemini 3.5 Flash-Lite 36, место #20 из 163. Восемнадцать баллов при медиане класса 32.
• Скорость вывода — 165.0 токенов в секунду против 343.6. Flash-Lite выводит данные более чем в два раза быстрее.
• Время до первого токена — 26,12 секунды против 10,30, оба при максимальном усилии. Artificial Analysis отмечает, что показатель 10,30 с у Flash-Lite сам по себе находится на верхней границе для рассуждающих моделей в его ценовой категории.
• Многословность — 95M выходных токенов против 43M для того же набора тестов, при медиане 65M по всем моделям. Muse Spark 1.2 на 46% выше медианы; Flash-Lite — на 34% ниже.
• Стоимость работы индекса — $637.85 против $153.08.
• По показателям — Сублидексы Artificial Analysis оценивают Gemini 3.5 Flash-Lite в 49.3 по кодингу и 26.8 по агентности. Для Muse Spark 1.2 опубликованной разбивки пока нет; его предшественник набрал 71.3 и 37.5.
Восемнадцать пунктов индекса — это не погрешность округления. Это не два кандидата на одну и ту же позицию.
Арифметика разветвления
Цена за токен — не тот показатель для тарифа субагентов, потому что весь смысл такого тарифа в том, что вы запускаете их много. Разберём пример по прейскурантным ценам: $0.30 на входе и $2.50 на выходе для Gemini 3.5 Flash-Lite, $1.25 на входе и $4.25 на выходе для Muse Spark 1.2.
Оркестратор отправляет двадцать субагентов. Каждый читает 25 000 токенов ограниченного контекста и записывает 1 500 токенов обратно.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = примерно 22,5 цента за fan-out.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = примерно 75 центов за fan-out.
В три с третью раза, что звучит вполне выполнимо. Теперь применим измеренную разницу в многословности. Если Muse Spark 1.2 выдаёт пропорционально больше, чем Flash-Lite, как это было на индексе — примерно в 2,2 раза больше выходных токенов за одинаковую работу — эти ответы по 1500 токенов вырастают примерно до 3300, и стоимость разветвления возрастает примерно до 91 цента. В четыре раза, а не в три. В нагруженной агентной системе при ста разветвлениях в час это разница между $22 и $91 в час, или примерно $600 000 в год разницы при непрерывной нагрузке.
Две детали ценообразования делают реальный разрыв еще шире в одном направлении и уже в другом:
• Flash-Lite тарифицирует внутренние рассуждения по цене выходных токенов. В его объявленных ценах токены внутренних рассуждений стоят $2,50 за миллион — столько же, сколько видимый вывод. Мышление не бесплатно, оно просто невидимо в ответе. Если субагент обдумывает 2000 токенов перед ответом, это добавляет полцента за вызов, или 10 центов при таком разветвлении.
• В относительном выражении кэширование выгоднее для Muse Spark 1.2. Чтение кэшированных входных данных стоит $0,15 за миллион против $1,25 по прайс-листу — скидка 88%. Flash-Lite читает кэшированные входные данные по $0,03 против $0,30 — скидка 90%, но также взимает около $0,083 за миллион за запись в кэш, тогда как Muse Spark 1.2 не публикует отдельной платы за запись в кэш. При фан-ауте, когда каждый субагент использует один и тот же большой префикс, разрыв существенно сокращается.

Задержка в продакшене — вот где Flash-Lite вырывается дальше всех, и цифры бенчмарков этого не показывают. На OrcaRouter за скользящую неделю реального трафика Gemini 3.5 Flash-Lite показывает p50 времени до первого токена — 816 миллисекунд и p95 — 4,57 секунды. Muse Spark 1.1 — ближайший доступный аналог, поскольку у версии 1.2 ещё нет телеметрии, — показывает p50 1,84 секунды и p95 6,00 секунд. Когда двадцать субагентов работают параллельно, итоговое время по настенным часам задаёт самый медленный из них, поэтому задержку фан-аута определяет именно p95, а не p50.
Где дешёвый вариант — неверное решение.
Четыре ограничения в Gemini 3.5 Flash-Lite, которые не проявляются при сравнении цен, но проявятся при разборе инцидента.
• Потолок вывода в 65 536 токенов. Это половина того, что допускают большинство моделей этого класса, и жёсткое ограничение для субагента, которому поручено сгенерировать большой файл или вернуть длинный структурированный документ. Эндпоинт Muse Spark 1.2 вообще не объявляет максимального объёма завершения — что достаточно необычно, чтобы проверить, а не доверять, но это не задокументированное ограничение.
• Это немодерируемый эндпоинт. В описании Flash-Lite нет флага модерации; у Meta для Muse Spark 1.2 он есть. Это реальное преимущество для одних рабочих нагрузок и проблема соответствия для других, и это должно быть осознанным выбором, а не случайным открытием.
• Дорогой встроенный поиск. Инструмент веб-поиска Flash-Lite стоит примерно 14 долларов за тысячу вызовов против 2,50 долларов у Muse Spark 1.2. Если ваши субагенты исследуют, а не просто читают, дешёвая модель становится дорогой — в пять с половиной раз — и объём поиска в архитектуре с разветвлением масштабируется вместе с разветвлением.
• Его цена выросла, а не упала.Gemini 3.5 Flash-Lite стоит $0.30 и $2.50, тогда как предыдущий Gemini 3.1 Flash-Lite — $0.25 и $1.50. Вывод на 67% дороже, чем уровень, который он заменяет. Если вы рассчитывали бюджет субагента на основе старой модели, пересмотрите его.

Стоит прямо назвать ещё одну асимметрию: Muse Spark 1.2 обслуживается ровно одним провайдером — Meta — без сторонних хостов и без запасного варианта. Gemini 3.5 Flash-Lite имеет обычную собственную инфраструктуру развёртывания в нескольких регионах. Для оркестратора это единая точка отказа для всего вашего дерева агентов; для уровня воркеров — единая точка отказа для фан-аута.
Пара, на которой большинство команд в итоге остановятся
При сопоставлении этих двух моделей видно, что они не столько конкуренты, сколько две половины единой архитектуры, и сам текст продуктовых описаний Meta подтверждает это, описывая роль primary-agent отдельно от роли subagent.
Форма, которая следует из чисел: Muse Spark 1.2 как оркестратор, Gemini 3.5 Flash-Lite как воркеры. Один дорогой, вдумчивый вызов, который читает репозиторий, хранит план и решает, что делегировать — где 26 секунд размышлений и многословность масштаба 95M токенов дают вам план, который стоит выполнить — за которым следуют двадцать дешёвых, быстрых, узких вызовов, каждый из которых выполняет одну ограниченную задачу и при p50 возвращается менее чем за секунду. Вы платите ставки, близкие к фронтирным, один раз за задачу и бюджетные ставки за единицу работы — это именно та кривая затрат, которая нужна архитектуре fan-out.
Инвертируйте это — и экономика рушится. Двадцать субагентов Muse Spark 1.2 по 91 центу за фан-аут — это счет в четыре раза больше за работу, которую модель на 18 пунктов слабее выполняет за треть времени, а оркестратор Flash-Lite с индексом 36 будет выдавать планы, которые работники не смогут спасти.
Раньше самым неудобным было то, что сборка распределялась между двумя вендорами. Gemini 3.5 Flash-Lite есть в каталоге OrcaRouter по цене $0.30 и $2.50 — цена вендора, передаваемая с нулевой наценкой, так что изменение цены доходит до нас в тот же день, а не после контрактного цикла — а Muse Spark 1.1 доступен там по $1.25 и $4.25 на тех же условиях, оба за одним OpenAI-совместимым эндпоинтом. Это означает, что паттерн «оркестратор и воркеры» — это две строки моделей в одной кодовой базе, а не два SDK, два ключа и два счета, а автоматический фейловер покрывает случай, когда у одного вендора случается плохой день посреди фан-аута. Если говорить точно о том, что доступно: Сам Muse Spark 1.2 в каталоге пока отсутствует — Meta предоставляет его напрямую как единственный провайдер — поэтому сегодня ближайшая версия этого стека использует 1.1 в слоте оркестратора.
Выбирайте по роли, а не по баллам
Если вы выбираете рабочий уровень — разбор документов, извлечение данных, ограниченные правки файлов, классификация, узкая повторяющаяся середина агентного дерева — Gemini 3.5 Flash-Lite является лучшим инструментом, и дефицит индекса в 18 пунктов в основном не имеет значения, потому что вы не просите его рассуждать. Следите за потолком вывода и ценами на поиск.
Если вы выбираете модель, которая решает, чем занимаются работники, Muse Spark 1.2 — более сильный кандидат из двух, с оговорками: у неё нет независимой агентной оценки по каждому измерению, никаких результатов в арене, никакой производственной телеметрии и только один провайдер. Это пробелы, которые необходимо закрыть, прежде чем она сможет претендовать на производственный план.
И если вы надеялись, что одна модель справится с обеими задачами, честный ответ по данным измерений — ни одна не может. Flash-Lite не может планировать на индексе 36; Muse Spark 1.2 нельзя порождать по двадцать за раз по 91 центу за разветвление. Слово «субагент», встречающееся в описаниях обоих продуктов, — это маркетинговое совпадение, а не признак того, что они относятся к одной категории.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
