
Muse Spark 1.2 против Claude Haiku 4.5: одинаковая смешанная цена, противоположные взгляды на мышление
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 1604 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
Контраст спецификаций, по одному измерению за раз
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• Кэш — $0,15 за миллион при кэш-попадании Muse Spark 1.2, со скидкой 88%; $0,10 за миллион при чтении кэша Claude Haiku 4.5, со скидкой 90%, при этом запись в кэш тарифицируется по $1,25.
• Контекст — 1 048 576 токенов против 200 000. Разница в 5,2 раза, и это самый большой разрыв между ними.
• Максимальный вывод — Claude Haiku 4.5 заявляет лимит в 64 000 токенов; конечная точка Muse Spark 1.2 не объявляет максимальную длину завершения вообще, что достаточно необычно, чтобы проверить, а не предполагать.
• Рассуждениеобязательно в Muse Spark 1.2, с пятью уровнями усилий от minimal до xhigh и по умолчанию medium; необязательно в Claude Haiku 4.5, которая является моделью без рассуждений, пока вы не включите расширенное мышление и не зададите бюджет на рассуждения.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• Возраст — Muse Spark 1.2 появился всего несколько дней назад. Claude Haiku 4.5 находится в продакшене с 15 октября 2025 года, с отсечкой знаний по июль 2025 года и девятью месяцами накопленного опыта эксплуатации за плечами.
Разрыв в индексе реален. Число, которое все будут цитировать, — нет.

Artificial Analysis оценивает Muse Spark 1.2 в 54 балла по своему Индексу интеллекта, 13-е место из 185. Текущий показатель Claude Haiku 4.5 — 24. Поставьте их рядом — и заголовок готов; но стоит посмотреть, что представляют собой эти показатели на самом деле, и заголовок рассыпается.
54 — это Muse Spark 1.2, оценённая на xhigh, самом дорогом режиме рассуждения. 24 — это Claude Haiku 4.5, оценённая как модель без режима рассуждения — с отключённым мышлением, — и Artificial Analysis помечает это как оценку, а не как завершённый прогон. В более ранней версии того же индекса, до перевзвешивания в v4.1, Artificial Analysis давала Claude Haiku 4.5 55 баллов с включённым рассуждением и 42 без него. Эти старые цифры тоже нельзя сравнивать с 54, потому что версии индекса перенормируются, и балл эпохи v3 — это не балл v4.1.
Итак, честная формулировка уже, чем кажется по лидерборду: Muse Spark 1.2 при максимальном усилии набирает 54 балла по текущему индексу; для Claude Haiku 4.5 с включённым расширенным мышлением не опубликовано результата v4.1, так что прямого сравнения этих двух моделей на полной мощности пока не существует.Любой, кто показывает вам 54 против 24, сравнивает модель в режиме полного обдумывания с моделью, которой сказали не обдумывать.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
Четыре показателя задержки, две разные истории

Латентность — это тот момент, где формулировка «та же цена» перестаёт быть любопытным фактом и превращается в предмет решения, и именно здесь источник измерений имеет наибольшее значение.
В тестовом стенде Artificial Analysis фиксирует время до первого токена 26.12 секунды для Muse Spark 1.2 на xhigh и 1.00 секунду для Claude Haiku 4.5. Разрыв в 26 раз, и если бы этим всё ограничивалось, сравнение было бы окончено.
В продакшене всё наоборот. За семь дней реального трафика на OrcaRouter — клиенты использовали любой желаемый уровень усилия — Claude Haiku 4.5 демонстрирует p50 времени до первого токена 3,84 секунды и p95 10,00 секунд, при 214 токенах в секунду и уровне ошибок 1,0%. Muse Spark 1.1, версия модели Meta, представленная в каталоге, показывает p50 1,84 секунды и p95 6,00 секунд, при 519 токенах в секунду и без зафиксированных ошибок. На живом трафике модель Meta оказывается быстрее.
{{1}}Оба набора чисел верны, и они измеряют разные вещи.{{/1}} {{2}}Лабораторный показатель — это каждая модель при максимальном времени обдумывания с холодным кэшем, что является честной проверкой потолка, но плохой проверкой чат-бокса.{{/2}} {{3}}Производственный показатель включает попадания в кэш, короткие промпты, низкие уровни усилий и всё остальное, что делают реальные приложения, что является честной проверкой медианы и вообще не проверкой худшего случая.{{/3}} {{4}}Ловушка в том, чтобы цитировать один и рассуждать о другом.{{/4}} {{5}}Если вы настраиваете пользовательский таймаут, ваше число — p95. Если вы спрашиваете, сколько стоит глубокий агентный шаг в реальном времени, эталонное значение ближе к истине — и честная оговорка: для самой Muse Spark 1.2 такого производственного показателя пока не существует, потому что она слишком новая и на неё ещё не направляется широкий трафик.{{/5}}
Обе лаборатории продали вам субагента. Они имели в виду разное.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
Заявление Meta о Muse Spark 1.2 претендует на оба конца одной и той же иерархии. В текстах Meta говорится, что модель может быть основным агентом, который собирает контекст, планирует и делегирует задачи, либо субагентом, работающим параллельно под началом такого агента. Muse Code — терминальный агент, выпущенный вместе с ней, — координирует несколько постоянных субагентов для каждой задачи в изолированных рабочих деревьях на среде выполнения с точным воспроизведением журнала событий. Окно в миллион токенов и постоянно включённое рассуждение — то, что нужно планировщику; и именно их вы бы не выбрали для веерного исполнителя, поскольку каждый параллельный экземпляр платит за обдумывание, о котором вы не просили.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
Сколько стоит один реальный шаг на каждом
Тарифы за миллион токенов ничего не решают в моделях рассуждений, потому что модель сама выбирает, сколько токенов потратить. Вместо этого тарифицируйте шаг.
Возьмём ограниченную задачу по коду: 60 000 токенов контекста репозитория на входе, 3 000 токенов патча на выходе. В режиме холодного кеша Claude Haiku 4.5 стоит $0,060 за вход плюс $0,015 за выход — 7,5 цента. Muse Spark 1.2 стоит $0,075 плюс $0,013 — 8,8 цента. Разница достаточно мала, чтобы считаться шумом, — ровно как и обещала смешанная ставка.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
Кэширование снова меняет акценты. Если удерживать контекст репозитория стабильным, чтобы он попадал в кэш, входные данные Haiku снижаются до $0.006, а Muse Spark 1.2 — до $0.009 — входная сторона перестаёт иметь значение полностью, и всё сравнение превращается в борьбу за выходные токены, то есть в борьбу за то, сколько каждая модель думает. В рабочей нагрузке с повторяющимся контекстом стабильность ключа кэша ценнее выбора модели, и это справедливо для обеих моделей.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
Попробовать оба без второго контракта

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2 отсутствует в каталоге. Сейчас вызвать его можно только через Meta Model API, поэтому по-настоящему прямое сравнение сегодня означает одну интеграцию через нас и одну напрямую через Meta. Muse Spark 1.1 размещён у нас по той же цене — $1.25 и $4.25, которую Meta берёт за 1.2, так что он вполне подходит как заменитель для оценки стоимости и задержек семейства моделей, но не для тех преимуществ в написании кода, ради которых продают 1.2. Когда 1.2 станет маршрутизируемой, сравнение сведётся к изменению одной строки с именем модели при том же ключе — а для описанного выше эксперимента с оркестратором и воркером DSL маршрутизации позволяет подключить планировщик и разворачивающийся воркер в один вызов, а не строить передачу данных между ними вручную.
Суди по форме работы, а не по оценке
Выберите Claude Haiku 4.5, когда работа ограничена и пользователь ждёт. Он подходит для агентов поддержки, классификации, извлечения данных, чатов, дополнений при парном программировании и уровня параллельных работников в иерархии агентов. Это проверенное решение с девятимесячной историей в реальных условиях; размышление необязательно, поэтому вы платите за обдумывание только тогда, когда оно нужно, а 200K достаточно практически для любой ограниченной подзадачи. Его опубликованный результат SWE-bench Verified показывает, что он гораздо способнее, чем следует из цены, при условии что вы готовы потратить тот бюджет на размышления, который был использован для этого результата.
Выберите Muse Spark 1.2, когда единицей работы является репозиторий, а не запрос. Многофайловые рефакторинги, длительная отладка, генерация целых проектов, долгосрочные агентные циклы, за которыми никто не наблюдает. Окно в миллион токенов устраняет проблему разбиения на части, которую Haiku не может решить ни за какую цену, а обязательные рассуждения, которые делают его непригодным для чата, — правильный выбор по умолчанию, когда неверный план обходится дороже, чем медленный.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
