
Muse Spark 1.2 против Claude Fable 5: Что на самом деле стоят шесть индексных пунктов
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 197 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
Artificial Analysis публикует то, что большинство таблиц бенчмарков упускают: сколько это стоило. Запуск его Intelligence Index из девяти оценок обошёлся в $637.85 для Muse Spark 1.2 и в $5,630.52 для Claude Fable 5. Одинаковый набор бенчмарков, одинаковое окружение, один счёт в 8,8 раза больше другого. Fable 5 набрал 60 против 54 у Muse Spark 1.2.
Разделите разницу, и вы получите число, о котором на самом деле идёт речь в этом сравнении: при такой нагрузке последние шесть пунктов интеллекта стоят примерно $832 за пункт. Платить ли за это — вопрос не из области бенчмарков. Это вопрос о том, какой доле вашего трафика на самом деле нужны эти пункты, и для большинства команд ответ — небольшая и легко определяемая доля.
Предельная точка индекса имеет цену, и она высокая.
Обе цифры получены от одного и того же независимого оценщика, прогнавшего один и тот же композитный набор — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience и AA-LCR. Ни одна из них не является заявлением вендора. Fable 5 занимает 3-е место из 185 моделей; Muse Spark 1.2 — 13-е, при медиане класса 32. Обе значительно выше среднего; лишь одна находится на фронтире.

Цены по прайс-листу объясняют большую часть разрыва и занижают остальное:
• Ввод — Muse Spark 1.2 $1.25 за миллион, Claude Fable 5 $10.00. В восемь раз.
• Результат — $4,25 против $50,00. Почти в двенадцать раз больше.
• Кэшированный ввод — $0.15 против $1.00. Примерно в семь раз, а Fable 5 дополнительно взимает $12.50 за миллион записей в кэш или $20.00 за часовой TTL, тогда как Muse Spark 1.2 вообще не указывает отдельной платы за запись в кэш.
• Смешанная ставка — Artificial Analysis оценивает Muse Spark 1.2 в $0,78 за миллион токенов, а Fable 5 — в $7,70. Чуть меньше, чем в десять раз.
На момент запуска Fable 5 была самой дорогой моделью, которую Artificial Analysis когда-либо тестировала, и она сохранила этот титул. Стоит уточнить, почему: модель израсходовала меньше выходных токенов, чем Muse Spark 1.2, при прохождении индекса — 87M против 95M — так что вся разница в стоимости обусловлена тарифом, а не многословием. Fable 5 не расточительна. Она просто продаётся по цене фронтирного продукта.
В пересчёте на шаг агента, который читает 60 000 токенов контекста репозитория и записывает 3 000 токенов патча: около 8.8 цента на Muse Spark 1.2, около 75 центов на Claude Fable 5. Тысяча шагов в день — это $88 против $750. За год — $32,000 против $274,000.
Где Claude Fable 5 незаменим
Аргумент о стоимости был бы односторонним, если бы шесть пунктов составляли всю разницу. Но это не так, и место, где разрыв увеличивается, — это именно то место, где Meta перепозиционировала Muse Spark 1.2 для конкуренции.
Fable 5 занимает первое место в широком спектре рейтинговых лестниц Design Arena: 1399 Elo и 1-е место в разработке игр, 1367 и 1-е место в ASCII-арте, 1353 и 1-е место в генерации SVG, а также 1-е место в арене агентов для разработки игр на Godot (1344), нативной разработки под Android (1318), агентной разработки игр (1300) и HTML-слайдов (1260), и второе место в веб-приложениях и full-stack разработке. Muse Spark 1.2 не имеет вообще никаких записей в Design Arena — его предшественник набрал вполне достойный результат в середине таблицы (1334 в разработке игр на 5-м месте, 1309 в общих категориях кода на 9-м месте), но новая версия не была оценена ни разу.
Индексы по отдельным измерениям указывают в ту же сторону. Artificial Analysis оценивает Claude Fable 5 с индексом программирования 76,5 и агентным индексом 52,8. Muse Spark 1.1 показывал 71,3 и 37,5 — на пять пунктов ниже по программированию и на пятнадцать по агентной работе. Для 1.2 ещё не опубликованы показатели по отдельным измерениям, поэтому честное заявление таково: мы знаем, что совокупный индекс сократил разрыв на три пункта, но не знаем, какая часть этого пришлась на агентную ось.

Собственное позиционирование продукта Fable 5 утверждает, что отрыв увеличивается с ростом длины и сложности задачи. Это заявление вендора, и в таком виде оно непроверено, но оно согласуется с характером независимых данных: наибольшие отрывы Fable 5 наблюдаются в области агентов, где модель должна удерживать план на протяжении многих ходов, а не в одношаговой генерации.
Где Muse Spark 1.2 — это просто правильный ответ
Три вещи делают его правильным выбором, независимо от шести пунктов.
• Ввод аудио и видео. В описании Meta в качестве входных данных заявлены текст, изображения, видео, аудио и PDF. Claude Fable 5 принимает текст, изображения и файлы — без аудио и видео. Для любого пайплайна, работающего с записями или видеоматериалами, это не компромисс, а жёсткий фильтр. Одна честная оговорка: в карточке спецификации Artificial Analysis для Muse Spark 1.2 в качестве оценённых зафиксированы только текст и изображения, так что более широкий набор возможностей лишь разрекламирован, а не подтверждён независимо.
• Скорость. 165.0 токенов в секунду против 71.7. Muse Spark 1.2 выдаёт результаты более чем вдвое быстрее и занимает 16-е место из 185 по скорости при медиане класса 71 — Fable 5 находится на медиане.
• Стоимость при объёме. Всё в предыдущем разделе.
Добавьте четвертый пункт для тех, чьи запросы действительно огромны: обе модели заявляют примерно миллион токенов контекста — 1 048 576 для Muse Spark 1.2, 1 000 000 для Fable 5 — но Muse Spark 1.2 взимает фиксированную ставку за весь объем, тогда как цена записи в кэш у Fable 5 означает, что хранение большого стабильного префикса требует реальных денег заранее, прежде чем начнет приносить экономию.
Ни одна из этих моделей не является быстрой.
Это раздел, который большинство сравнений пропускают, и он меняет архитектуру, а не счёт.
При максимальном уровне рассуждений Artificial Analysis измеряет время до первого токена в 26,12 секунды для Muse Spark 1.2 и 141,26 секунды для Claude Fable 5, при этом полное время ответа для Fable 5 составляет 148,24 секунды. Ни одна из них не должна находиться перед пользователем при таких настройках.
Производственные показатели куда более благоприятны, и о них стоит знать. На OrcaRouter Claude Fable 5 показывает p50 время до первого токена — 7,04 секунды, p95 — 10,00 секунд за скользящую неделю — это реальный трафик при любом уровне усилий, который запрашивают вызывающие, а не бенчмарк на максимуме. Muse Spark 1.1, для справки, работает с p50 в 1,84 секунды. У Muse Spark 1.2 пока нет производственной телеметрии.

Структурный момент: обе модели имеют обязательное рассуждение. Регулятор усилий Fable 5 охватывает диапазон от низкого до максимального значения и по умолчанию выставлен на высокий; у Muse Spark 1.2 — от минимального до сверхвысокого, по умолчанию — средний. Ни одна из них не позволяет отключить мышление. Если вам нужны ответы за доли секунды, всё это сравнение — не та полка: для этого предназначены модели класса Luna или Flash-Lite.
Двухмодельный стек, вытесненный по цене
Ошибка — рассматривать это как выбор, в котором победитель получает всё, потому что трафик неоднороден. Почти у каждого продакшен-агента есть длинный хвост рутинных шагов — прочитать файл, обобщить diff, отформатировать патч, решить, какой инструмент вызвать следующим, — и короткая голова по-настоящему сложных задач, где неверный ответ стоит часа.
Возьмём те же тысячу шагов агента в день. Всё на Claude Fable 5: около $750. Всё на Muse Spark 1.2: около $88. Разделим 900 рутинных на дешёвую модель и 100 сложных на дорогую: около $79 плюс $75, или $154 в день. Это пятая часть счёта за использование только Fable, при этом передовые возможности сохраняются для десятой части вызовов, которым они действительно нужны — и это примерно $220,000 разницы в год на одном цикле агента.
Причина, по которой сплит стоит создавать, а не просто описывать, в том, что раньше для этого требовались два отношения с вендорами, два SDK и два набора учётных данных. Сейчас этого нет. Claude Fable 5 есть в каталоге OrcaRouter по цене $10.00 и $50.00 — список цен вендора, передаваемый без наценки 0% — и Muse Spark 1.1 там по $1.25 и $4.25 на тех же условиях, за тем же совместимым с OpenAI эндпоинтом. DSL маршрутизации позволяет выразить «сначала дешёвая модель, переход на более дорогую при низкой уверенности или при неудачном тестовом прогоне» одним вызовом, а не кодом оркестрации, который вы сопровождаете, а слияние моделей позволяет отправлять действительно неоднозначные шаги сразу группе моделей и сравнивать результаты. Сам Muse Spark 1.2 ещё не в каталоге — Meta предоставляет его напрямую как единственный провайдер, — так что сегодня самое близкое, что можно собрать к этому стеку, использует 1.1 на дешёвой стороне.
Этот нюанс с единственным провайдером заслуживает отдельной строки в оценке рисков. У Claude Fable 5 есть несколько маршрутов обслуживания и автоматическое переключение между ними. У Muse Spark 1.2 ровно одна конечная точка, управляемая Meta. Если она выйдет из строя, не будет запасного варианта с той же моделью.
Модель затрат, а не вердикт
Полезный результат этого сравнения — не «какая модель побеждает». Это порог, который вы можете вычислить для своей собственной рабочей нагрузки.
Оцените долю ваших вызовов, где ответ класса Muse Spark 1.2 оказывается неверным, а ответ класса Fable 5 — верным. Умножьте на стоимость сбоя — минуты инженера, неудачное слияние, цикл повторных попыток, клиент. Сравните с 66 центами за шаг — именно столько стоит перевод одного вызова с Muse Spark 1.2 на Claude Fable 5 в примере выше с 60K-in / 3K-out. Если ожидаемый убыток от неверного ответа превышает 66 центов, направляйте этот шаг на Fable 5. Если нет — не направляйте.
Для большинства команд такой расчёт относит Fable 5 к ревью кода, финальной генерации патчей, архитектурному планированию и всему, что касается производственных данных, а Muse Spark 1.2 — ко всему остальному: чтению файлов, суммаризации, триажу тестов, выбору инструментов, высоконагруженной середине цикла агента, где затраты реальны, а ставки за вызов — нет.
За чем стоит следить: таблицы лидеров Design Arena и индексы по измерениям для Muse Spark 1.2, которых пока не существует. Самые веские доказательства Fable 5 — именно в очных аренах, где у новой модели Meta вообще нет результатов. Когда эти результаты появятся, этот порог сдвинется — возможно, значительно.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
