Muse Spark 1.2 против Claude Haiku 4.5: одинаковая смешанная цена, противоположные взгляды на мышление
Guides & Insights

Muse Spark 1.2 против Claude Haiku 4.5: одинаковая смешанная цена, противоположные взгляды на мышление

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Artificial Analysis оценивает Muse Spark 1.2 по смешанной ставке $0,78 за миллион токенов и Claude Haiku 4.5 в $0,77. Их разделяет один цент, хотя две лаборатории не договорились ни о чём другом. Модель Meta не может перестать рассуждать; Claude Haiku 4.5 рассуждает только когда вы её просите. Meta даёт вам 1 048 576 токенов контекста; Claude Haiku 4.5 — 200 000. Meta выпустила эту модель 5 августа 2026 года как модель для кодирования с прикреплённым терминальным агентом; Claude Haiku 4.5 вышла в октябре 2025 года как быстрый и дешёвый работник, которому большая модель говорит, что делать. Одинаковая цена за токен, совершенно разные машины.

Это совпадение — удобная отправная точка для сравнения, поскольку оно устраняет переменную, по которой люди обычно принимают решение, и заставляет вопрос касаться формы. В дальнейшем используются независимые цифры там, где они существуют: Artificial Analysis для индексных оценок и лабораторной задержки, собственная семидневная производственная телеметрия OrcaRouter для задержки реального трафика — а показатели, сообщённые вендором, помечаются как таковые, включая один заголовочный показатель бенчмарка вендора, у которого нет стороннего аналога.

Контраст спецификаций, по одному измерению за раз

• Цена — Muse Spark 1.2 по $1.25 за вход / $4.25 за выход за миллион; Claude Haiku 4.5 по $1.00 за вход / $5.00 за выход. Meta дешевле по входу, Claude Haiku 4.5 — по выходу.

• Кэш — $0,15 за миллион при кэш-попадании Muse Spark 1.2, со скидкой 88%; $0,10 за миллион при чтении кэша Claude Haiku 4.5, со скидкой 90%, при этом запись в кэш тарифицируется по $1,25.

• Контекст — 1 048 576 токенов против 200 000. Разница в 5,2 раза, и это самый большой разрыв между ними.

• Максимальный вывод — Claude Haiku 4.5 заявляет лимит в 64 000 токенов; конечная точка Muse Spark 1.2 не объявляет максимальную длину завершения вообще, что достаточно необычно, чтобы проверить, а не предполагать.

• Рассуждениеобязательно в Muse Spark 1.2, с пятью уровнями усилий от minimal до xhigh и по умолчанию medium; необязательно в Claude Haiku 4.5, которая является моделью без рассуждений, пока вы не включите расширенное мышление и не зададите бюджет на рассуждения.

• Входные данные — Meta поддерживает текст, изображения, видео, аудио и PDF; Claude Haiku 4.5 принимает текст и изображения. Оба возвращают текст.

• Веса и провайдеры — обе закрыты. Muse Spark 1.2 доступна только через собственный Model API от Meta; Claude Haiku 4.5 доступна от вендора и через обычных облачных реселлеров и агрегаторов.

• Возраст — Muse Spark 1.2 появился всего несколько дней назад. Claude Haiku 4.5 находится в продакшене с 15 октября 2025 года, с отсечкой знаний по июль 2025 года и девятью месяцами накопленного опыта эксплуатации за плечами.

Разрыв в индексе реален. Число, которое все будут цитировать, — нет.

Artificial Analysis оценивает Muse Spark 1.2 в 54 балла по своему Индексу интеллекта, 13-е место из 185. Текущий показатель Claude Haiku 4.5 — 24. Поставьте их рядом — и заголовок готов; но стоит посмотреть, что представляют собой эти показатели на самом деле, и заголовок рассыпается.

54 — это Muse Spark 1.2, оценённая на xhigh, самом дорогом режиме рассуждения. 24 — это Claude Haiku 4.5, оценённая как модель без режима рассуждения — с отключённым мышлением, — и Artificial Analysis помечает это как оценку, а не как завершённый прогон. В более ранней версии того же индекса, до перевзвешивания в v4.1, Artificial Analysis давала Claude Haiku 4.5 55 баллов с включённым рассуждением и 42 без него. Эти старые цифры тоже нельзя сравнивать с 54, потому что версии индекса перенормируются, и балл эпохи v3 — это не балл v4.1.

Итак, честная формулировка уже, чем кажется по лидерборду: Muse Spark 1.2 при максимальном усилии набирает 54 балла по текущему индексу; для Claude Haiku 4.5 с включённым расширенным мышлением не опубликовано результата v4.1, так что прямого сравнения этих двух моделей на полной мощности пока не существует.Любой, кто показывает вам 54 против 24, сравнивает модель в режиме полного обдумывания с моделью, которой сказали не обдумывать.

Когда вендор публикует цифру, она конкретна: Claude Haiku 4.5 набирает 73,3% на SWE-bench Verified, в среднем по 50 прогонам с бюджетом на размышления 128K. Это цифра вендора, и заложенный в неё бюджет на размышления огромен для модели, позиционируемой как быстрая, — но это та же оценка, которую индустрия приводит для фронтирных моделей, и она помещает Haiku в категорию, на которую её цена не намекает. Meta, в свою очередь, приводит для Muse Spark 1.2 свои цифры: Terminal-Bench 2.1 — 82,9% и DeepSWE v1.1 — 59,3%, тоже полученные вендором, на собственном стенде Meta, где каждый конкурент был в паре со своим собственным агентом. Два вендора, два бенчмарка, никакого пересечения. На данный момент не существует ни одного бенчмарка, на котором обе модели имели бы опубликованный результат от одного и того же оценщика.

Четыре показателя задержки, две разные истории

Латентность — это тот момент, где формулировка «та же цена» перестаёт быть любопытным фактом и превращается в предмет решения, и именно здесь источник измерений имеет наибольшее значение.

В тестовом стенде Artificial Analysis фиксирует время до первого токена 26.12 секунды для Muse Spark 1.2 на xhigh и 1.00 секунду для Claude Haiku 4.5. Разрыв в 26 раз, и если бы этим всё ограничивалось, сравнение было бы окончено.

В продакшене всё наоборот. За семь дней реального трафика на OrcaRouter — клиенты использовали любой желаемый уровень усилия — Claude Haiku 4.5 демонстрирует p50 времени до первого токена 3,84 секунды и p95 10,00 секунд, при 214 токенах в секунду и уровне ошибок 1,0%. Muse Spark 1.1, версия модели Meta, представленная в каталоге, показывает p50 1,84 секунды и p95 6,00 секунд, при 519 токенах в секунду и без зафиксированных ошибок. На живом трафике модель Meta оказывается быстрее.

{{1}}Оба набора чисел верны, и они измеряют разные вещи.{{/1}} {{2}}Лабораторный показатель — это каждая модель при максимальном времени обдумывания с холодным кэшем, что является честной проверкой потолка, но плохой проверкой чат-бокса.{{/2}} {{3}}Производственный показатель включает попадания в кэш, короткие промпты, низкие уровни усилий и всё остальное, что делают реальные приложения, что является честной проверкой медианы и вообще не проверкой худшего случая.{{/3}} {{4}}Ловушка в том, чтобы цитировать один и рассуждать о другом.{{/4}} {{5}}Если вы настраиваете пользовательский таймаут, ваше число — p95. Если вы спрашиваете, сколько стоит глубокий агентный шаг в реальном времени, эталонное значение ближе к истине — и честная оговорка: для самой Muse Spark 1.2 такого производственного показателя пока не существует, потому что она слишком новая и на неё ещё не направляется широкий трафик.{{/5}}

Обе лаборатории продали вам субагента. Они имели в виду разное.

Презентация вендора для Claude Haiku 4.5 была прямой насчёт иерархии: модели класса Sonnet планируют и оркестрируют, а экземпляры Haiku выполняются параллельно под ними. Дёшево, быстро, одноразово, много сразу. Дизайн продукта следует этой логике — окна в 200K достаточно для ограниченной подзадачи и намеренно недостаточно для целого репозитория, мышление отключено по умолчанию, потому что работник, который размышляет, стоит оркестратору денег, а собственный маркетинг вендора называет целевыми сценариями чат в реальном времени, обслуживание клиентов и парное программирование.

Заявление Meta о Muse Spark 1.2 претендует на оба конца одной и той же иерархии. В текстах Meta говорится, что модель может быть основным агентом, который собирает контекст, планирует и делегирует задачи, либо субагентом, работающим параллельно под началом такого агента. Muse Code — терминальный агент, выпущенный вместе с ней, — координирует несколько постоянных субагентов для каждой задачи в изолированных рабочих деревьях на среде выполнения с точным воспроизведением журнала событий. Окно в миллион токенов и постоянно включённое рассуждение — то, что нужно планировщику; и именно их вы бы не выбрали для веерного исполнителя, поскольку каждый параллельный экземпляр платит за обдумывание, о котором вы не просили.

Если читать это как архитектуру, а не как маркетинг, вот в чём настоящая разница: поставщик создал исполнителя и ожидает, что вы принесёте оркестратор; Meta создала оркестратор и утверждает, что он тоже может работать. Если у вас уже есть иерархия, интересный эксперимент — не выбор между ними, а когда Muse Spark 1.2 планирует, а Claude Haiku 4.5 исполняет, — и такую конфигурацию ни один поставщик не продаст вам как готовый пакет.

Сколько стоит один реальный шаг на каждом

Тарифы за миллион токенов ничего не решают в моделях рассуждений, потому что модель сама выбирает, сколько токенов потратить. Вместо этого тарифицируйте шаг.

Возьмём ограниченную задачу по коду: 60 000 токенов контекста репозитория на входе, 3 000 токенов патча на выходе. В режиме холодного кеша Claude Haiku 4.5 стоит $0,060 за вход плюс $0,015 за выход — 7,5 цента. Muse Spark 1.2 стоит $0,075 плюс $0,013 — 8,8 цента. Разница достаточно мала, чтобы считаться шумом, — ровно как и обещала смешанная ставка.

Теперь добавьте то, что скрывает комбинированная ставка. Muse Spark 1.2 не может отключить рассуждения, и при среднем уровне по умолчанию такой шаг, вероятно, генерирует несколько тысяч токенов рассуждения до патча — они тарифицируются как выходные токены. Добавьте 3 000, и тот же шаг составит $0,075 + $0,026 = 10,1 цента, что примерно на 35% выше, чем у Haiku на идентичных входных данных. Claude Haiku 4.5 с отключённым мышлением ничего не платит за обдумывание и остаётся на уровне 7,5 цента; с большим бюджетом на рассуждения он превзойдёт Muse Spark 1.2, потому что Claude Haiku 4.5 взимает $5,00 за миллион выходных токенов против $4,25 у Meta.

Кэширование снова меняет акценты. Если удерживать контекст репозитория стабильным, чтобы он попадал в кэш, входные данные Haiku снижаются до $0.006, а Muse Spark 1.2 — до $0.009 — входная сторона перестаёт иметь значение полностью, и всё сравнение превращается в борьбу за выходные токены, то есть в борьбу за то, сколько каждая модель думает. В рабочей нагрузке с повторяющимся контекстом стабильность ключа кэша ценнее выбора модели, и это справедливо для обеих моделей.

Окно в 1M — это единственное место, где расчёты не сходятся. Всё, чему действительно нужно более 200 000 токенов за один вызов, невозможно запустить на Claude Haiku 4.5 ни за какую цену. Либо вы разбиваете на части и оркеструете — что и задумано вендором, — либо используете модель, у которой достаточно места.

Попробовать оба без второго контракта

Claude Haiku 4.5 есть в каталоге OrcaRouter по цене $1.00 и $5.00 — это цена поставщика, потому что OrcaRouter работает с нулевой наценкой и передаёт цены провайдеров без изменений, что также означает, что изменение цены поставщика отражается у нас в тот же день, а не в следующем контрактном цикле. Приведённые выше показатели производственной задержки получены из того же слоя маршрутизации.

Muse Spark 1.2 отсутствует в каталоге. Сейчас вызвать его можно только через Meta Model API, поэтому по-настоящему прямое сравнение сегодня означает одну интеграцию через нас и одну напрямую через Meta. Muse Spark 1.1 размещён у нас по той же цене — $1.25 и $4.25, которую Meta берёт за 1.2, так что он вполне подходит как заменитель для оценки стоимости и задержек семейства моделей, но не для тех преимуществ в написании кода, ради которых продают 1.2. Когда 1.2 станет маршрутизируемой, сравнение сведётся к изменению одной строки с именем модели при том же ключе — а для описанного выше эксперимента с оркестратором и воркером DSL маршрутизации позволяет подключить планировщик и разворачивающийся воркер в один вызов, а не строить передачу данных между ними вручную.

Суди по форме работы, а не по оценке

Выберите Claude Haiku 4.5, когда работа ограничена и пользователь ждёт. Он подходит для агентов поддержки, классификации, извлечения данных, чатов, дополнений при парном программировании и уровня параллельных работников в иерархии агентов. Это проверенное решение с девятимесячной историей в реальных условиях; размышление необязательно, поэтому вы платите за обдумывание только тогда, когда оно нужно, а 200K достаточно практически для любой ограниченной подзадачи. Его опубликованный результат SWE-bench Verified показывает, что он гораздо способнее, чем следует из цены, при условии что вы готовы потратить тот бюджет на размышления, который был использован для этого результата.

Выберите Muse Spark 1.2, когда единицей работы является репозиторий, а не запрос. Многофайловые рефакторинги, длительная отладка, генерация целых проектов, долгосрочные агентные циклы, за которыми никто не наблюдает. Окно в миллион токенов устраняет проблему разбиения на части, которую Haiku не может решить ни за какую цену, а обязательные рассуждения, которые делают его непригодным для чата, — правильный выбор по умолчанию, когда неверный план обходится дороже, чем медленный.

Решение должен определять не порядковый номер. Вместо этого задайте два вопроса: требуется ли одному вызову когда-либо видеть более 200 000 токенов, и ждёт ли человек первый токен? Да на первый вопрос указывает на Meta. Да на второй — на поставщика. Да на оба означает, что вам нужны две модели, и это честный ответ чаще, чем признаёт маркетинг любого из поставщиков.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно