
Muse Spark 1.2 против GPT-5.6 Luna: Три индексных пункта за 4.6x цены токена
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Artificial Analysis прогнала тот же набор из девяти бенчмарков через обе модели и сохранила чеки. Прогон Muse Spark 1.2 через него обошёлся в $637.85. Прогон GPT-5.6 Luna через него обошёлся в $174.06. При разнице в затратах в 3,7 раза модель Meta вышла вперёд на три пункта — 54 против 51 по Индексу интеллекта. Хороший ли это обмен — вот в чём весь вопрос, и ответ зависит гораздо меньше от бенчмарка, чем от двух вещей, о которых почти никто не пишет: как ваш агентный фреймворк обрабатывает кэширование промптов, и требуется ли вашей рабочей нагрузке когда-либо что-то слышать или смотреть.
Каждый приведённый ниже показатель — это либо независимое измерение Artificial Analysis, либо актуальный список API, либо собственная производственная телеметрия OrcaRouter; последнюю стоит отметить сразу, поскольку она поучительным образом противоречит цифрам бенчмарков. Ничто здесь не является заявлением вендора, замаскированным под результат; если вендор — единственный источник, об этом прямо сказано.
Табло ближе, чем предполагает ценник.
Muse Spark 1.2 набирает 54 балла в Индексе интеллекта Artificial Analysis при настройке рассуждений xhigh, занимая 13-е место из 185 моделей при медиане класса 32. GPT-5.6 Luna набирает 51 балл при максимальном усилии. Три балла по композитному показателю из GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR.
Прирост на три пункта реален, но невелик, и суб-оценки, существующие для предыдущего поколения, подсказывают, откуда он берётся. Согласно данным Artificial Analysis по отдельным измерениям, Muse Spark 1.1 имеет индекс кодирования 71.3 и агентный индекс 37.5; у GPT-5.6 Luna — 71.4 и 45.6. В кодинге была мёртвая ничья, а Luna опережала на восемь пунктов по агентной работе — ровно то измерение, по которому Meta переписала описание продукта 1.2, чтобы заявить о превосходстве. Совокупный показатель сместился на три пункта в пользу Meta. Никто ещё не опубликовал разбивку по измерениям для 1.2, так что подтверждения тому, что агентный разрыв действительно закрылся, нет.

Разрыв в смешанной цене токенов заметен. Смешанная ставка Artificial Analysis оценивает Muse Spark 1.2 в $0,78 за миллион токенов, а GPT-5.6 Luna — в $0,17. Прейскурантные цены: $1,25 за вход и $4,25 за выход для Muse Spark 1.2, $0,20 за вход и $1,20 за выход для Luna.
Цена за единицу работы, а не за токен: один шаг агента кодирования, который читает 60 000 токенов контекста и пишет 3 000 токенов вывода, стоит около 8,8 цента на Muse Spark 1.2 и около 1,6 цента на GPT-5.6 Luna. При тысяче шагов в день это составляет $88 против $16 — то есть разница примерно в $26 000 в год для одного цикла агента.
Кэширование — это тот момент, когда разрыв либо сокращается, либо удваивается.
Обе модели предлагают агрессивные тарифы на кэшированный ввод, и соотношение между ними не совпадает с соотношением их каталожных цен. Muse Spark 1.2 читает кэшированный ввод по $0.15 за миллион — это скидка 88% от его ставки $1.25. GPT-5.6 Luna читает кэшированный ввод по $0.01 за миллион — это скидка 95% от $0.20.
Повторите тот же шаг агента с префиксом из 60 000 токенов, поданным в тёплом виде: Muse Spark 1.2 падает с 8,8 цента до примерно 2,2 цента. Luna падает с 1,6 цента до примерно 0,4 цента. Абсолютный разрыв сужается с 7,2 до 1,8 цента за шаг, но кратность остаётся примерно той же — кэширование не спасает более дорогую модель, оно просто делает обе дешевле с одинаковым коэффициентом. Что действительно меняется, так это то, какая статья расходов доминирует: при кэшировании стоимость Muse Spark 1.2 на 59% состоит из выходных токенов, а не на 85% из входных, поэтому многословность модели начинает иметь большее значение, чем размер её контекста.
Это не гипотетическая проблема здесь. Muse Spark 1.2 сгенерировал 95M выходных токенов, прошедших через Intelligence Index, при медиане 65M. Собственное резюме Artificial Analysis называет это «несколько многословным». Luna истратила 130M, что звучит хуже, пока не умножите на $1.20 вместо $4.25.
В маркетинговых материалах Meta утверждается, что кэширование промптов может снизить эффективную стоимость на 60–80% в зависимости от того, насколько повторяется контекст. Это оценка вендора, а не измерение, но приведённые выше расчёты попадают в этот диапазон.
Задержка: ось, на которой бенчмарк переворачивает истину.
Если читать только показатели задержки Artificial Analysis, можно заключить, что Muse Spark 1.2 — самый отзывчивый. Время до первого токена: 26,12 секунды у Muse Spark 1.2, 126,99 секунды у GPT-5.6 Luna. Почти в пять раз быстрее.
Оба этих значения измерены при самом дорогом режиме рассуждений каждой модели — xhigh для Muse Spark, max для Luna. Ни одно из них вы не увидите. На OrcaRouter за неделю реального трафика при том уровне усилий, который фактически запрашивают клиенты, GPT-5.6 Luna показывает p50 времени до первого токена 1.84 секунды и p95 9.68 секунды. Muse Spark 1.1 показывает такое же p50 1.84 секунды с более узким p95 6.00 секунды. Данных продакшн-телеметрии для 1.2 пока нет, потому что модель слишком новая.

Структурное различие полезнее, чем любое из этих чисел. Рассуждения GPT-5.6 Luna необязательны — шкала усилий варьируется от отсутствия через низкий, средний, высокий, сверхвысокий до максимума, и вы действительно можете отключить мышление для классификации, маршрутизации или извлечения данных. Рассуждения Muse Spark 1.2 являются обязательными. Шкала не опускается ниже минимального, и не существует настройки, которая дала бы вам веса без оплаты обдумывания. Для любых высоконагруженных и чувствительных к задержкам сценариев это конструктивное ограничение, а не параметр настройки.
Устойчивая пропускная способность близка: 165.0 токенов в секунду у Muse Spark 1.2 против 177.9 у Luna, обе значительно выше медианы класса, равной 71.
Сноска о ценах, о которую все споткнутся.
Цена GPT-5.6 Luna в настоящее время указана по-разному в разных местах, и если вы строите модель затрат, вам стоит узнать об этом, прежде чем называть какую-либо цифру. Каталоги Artificial Analysis и OrcaRouter показывают $0,20 за миллион входных токенов и $1,20 за миллион выходных — это ставка, установленная после июльского снижения цен на GPT-5.6, и именно её Artificial Analysis использовала для расчёта указанного выше счёта за eval в размере $174,06. В некоторых листингах на маркетплейсах сейчас указаны $0,10 и $0,60, а отдельный более высокий тариф включается после 272 000 промпт-токенов. Безопасный вариант — проверить цену на том эндпоинте, который вы фактически вызываете, а не на том, что указан в сравнительной статье.
Деталь о тарифных уровнях реальна независимо от того, какая базовая ставка применяется, и она действительно недостаточно освещена: Цена Luna повышается, когда один запрос превышает примерно 272 000 промпт-токенов. Входные данные примерно удваиваются, выходные возрастают в полтора раза, а кэшированные чтения масштабируются соответственно. Если вы обратили внимание на Luna из-за её окна контекста в 1,05 млн токенов, учтите, что заявленная ставка перестаёт действовать примерно на четверти пути. У Muse Spark 1.2 единая ставка на все 1 048 576 токенов без надбавки за длинный контекст — для действительно длинных одиночных запросов эффективный разрыв между ними значительно сокращается.
Чего Luna не может сделать ни за какую цену
Различие в модальности — самое чёткое основание предпочесть одно другому, и оно не фигурирует ни в одном рейтинге.
• Входные данные — Muse Spark 1.2 принимает текст, изображения, видео, аудио и PDF-документы согласно описанию Meta. GPT-5.6 Luna принимает текст, изображения и файлы. Ни аудио, ни видео. Если ваш конвейер работает с записями или видеоматериалами, Luna вообще не подходит.
• Максимальный вывод — Luna заявляет потолок завершения в 128 000 токенов. Эндпоинт Muse Spark 1.2 не заявляет максимальную длину завершения, что достаточно необычно, чтобы протестировать это, а не строить планы с учётом этого.
• Граница знаний — у Luna's указана дата 16 февраля 2026 года. Meta не публикует дату отсечения для Muse Spark 1.2, так что в любом случае закладывайте бюджет на поиск.
• Обслуживание — Luna общедоступна по всему миру через несколько маршрутов. Muse Spark 1.2 обслуживается ровно одним провайдером: Meta. Одна конечная точка, одна региональная политика, одна точка отказа.
• Модерация — обе являются модерируемыми конечными точками.
Одно честное предостережение насчёт мультимодального преимущества: в технической карте спецификаций Artificial Analysis для Muse Spark 1.2 указаны текстовый и графический ввод как то, что оценивалось, а не полный спектр из пяти модальностей, который рекламирует Meta. API принимает больше, чем кто-либо успел протестировать независимо.

Внедрение, поскольку оно, как выясняется, поддается измерению.
Бенчмарки показывают, на что способна модель; трафик показывает, что именно ей доверяют люди. За скользящую неделю на OrcaRouter GPT-5.6 Luna пропустила 4 679,4 миллиона токенов. Muse Spark 1.1 — с тем же контекстом 1M, сопоставимым индексным баллом, на четыре недели старше в каталоге — пропустила 4,4 миллиона. Это разница примерно в тысячу раз.
Отчасти это вопрос распространённости: Luna по умолчанию входит в большее число инструментов и уже дольше доступна по всему миру в статусе GA, тогда как семейство Muse Spark вышло только в США. Но разрыв тысяча к одному на маршрутизаторе, где оба варианта отличаются лишь одной строкой модели, — это не только вопрос распространённости. Это практическая причина, по которой Luna — более безопасный выбор по умолчанию, а Muse Spark 1.2 — то, что стоит оценивать осознанно.
Стоит отметить, что можно и нельзя арендовать сегодня: GPT-5.6 Luna есть в каталоге OrcaRouter по цене $0.20 и $1.20 — те же цифры, что и в прайс-листе самого провайдера, потому что мы работаем с нулевой наценкой и передаём цену провайдера без изменений. Muse Spark 1.1 доступен там за $1.25 и $4.25 на тех же условиях. Muse Spark 1.2 в каталоге пока нет — его предоставляет напрямую Meta. Так что самый дешёвый способ честно провести это сравнение сегодня — это Luna против Muse Spark 1.1 на одном ключе, меняя одну строку между запусками, а затем повторное тестирование против 1.2, когда она появится.
Выберите один.
Возьмите GPT-5.6 Lunaесли нагрузка высокообъёмная и текстовая: чат, классификация, извлечение, маршрутизация, лёгкое использование инструментов. Она стоит четверть от средневзвешенной цены, позволяет полностью отключать рассуждения, её p50 в 1,84 секунды — это реальный измеренный производственный показатель, а не артефакт бенчмарка, и это модель, за которой стоит в тысячу раз больший живой трафик. Три индексных пункта не переживают такой арифметики.
Выбирайте Muse Spark 1.2, если рабочая нагрузка — это долгосрочное агентное программирование — многофайловые рефакторинги, длительная отладка, работа со всем репозиторием — или если она включает аудио- или видеовход, где Luna просто не может конкурировать. Он также является лучшим выбором для по-настоящему огромных одиночных запросов, поскольку его тариф фиксирован на всём протяжении миллиона токенов, тогда как у Luna он ступенчато повышается после 272K.
Берите оба, если вы честны насчёт того, как на самом деле строятся агентные системы. Неизменно выигрывает одна и та же схема: дешёвая модель обрабатывает рутинное большинство вызовов, а дорогая приберегается для шагов, где качество окупается. Обе модели находятся за одним эндпоинтом, совместимым с OpenAI, так что это разделение — правило маршрутизации, а не отношения со вторым вендором — и если дорогое плечо выходит из строя в середине прогона, автоматическое переключение гарантирует, что ваша оценка не отравит себя молча половиной датасета.
Главное, за чем стоит следить в течение следующего месяца, — это разбивка по измерениям. Вся суть Muse Spark 1.2 — в агентных возможностях, и в предыдущем поколении именно по этому измерению Luna лидировала с отрывом в восемь пунктов. Пока кто-нибудь не опубликует агентный индекс для 1.2, совокупный прирост в три пункта — единственное свидетельство того, что Meta сократила разрыв.
