
Muse Spark 1.2 vs Claude Haiku 4.5: 동일한 블렌디드 가격, 생각에 대한 상반된 관점
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 1604 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.
That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.
스펙 대비, 한 번에 하나의 차원씩
• Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.
• 캐시 — Muse Spark 1.2 캐시 적중 시 백만 건당 $0.15 (88% 할인), Claude Haiku 4.5 캐시 읽기 시 백만 건당 $0.10 (90% 할인), 캐시 쓰기는 $1.25로 청구됩니다.
• 컨텍스트 — 1,048,576 토큰 대 200,000. 5.2배 차이이며, 둘 사이의 가장 큰 격차입니다.
• 최대 출력 — Claude Haiku 4.5는 64,000 토큰 상한을 선언하지만, Muse Spark 1.2 엔드포인트는 최대 완료 길이를 전혀 선언하지 않으며, 이는 가정하기보다 테스트할 만큼 특이한 경우입니다.
• 추론 — Muse Spark 1.2에서는 필수이며, 최소(minimal)부터 최상(xhigh)까지 다섯 단계의 강도 수준이 있고 기본값은 중간(medium)입니다. Claude Haiku 4.5에서는 선택 사항으로, 이 모델은 확장 사고를 켜고 사고 예산을 할당하기 전까지는 비추론 모델입니다.
• Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.
• Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.
• 출시 기간 — Muse Spark 1.2는 출시된 지 며칠밖에 안 됐습니다. Claude Haiku 4.5는 2025년 10월 15일부터 프로덕션에서 운영되어 왔으며, 2025년 7월 지식 기준일과 9개월간의 현장 경험을 보유하고 있습니다.
지수 격차는 실제로 존재한다. 그러나 모두가 인용하게 될 그 숫자는 실제가 아니다.

Artificial Analysis는 Intelligence Index에서 Muse Spark 1.2를 54점으로 매겨 185개 중 13위로 평가했습니다. Claude Haiku 4.5의 현재 등재 점수는 24점입니다. 이 둘을 나란히 놓으면 헤드라인이 만들어지지만, 실제 항목이 무엇인지 살펴보면 그 헤드라인은 무너집니다.
54는 가장 비용이 많이 드는 추론 설정인 xhigh에서 평가된 Muse Spark 1.2입니다. 24는 추론 기능을 끈 비추론 모델로 평가된 Claude Haiku 4.5이며, Artificial Analysis는 이를 완료된 실행이 아닌 추정치로 표시합니다. 동일한 지수의 이전 버전, 즉 v4.1 재가중치 적용 전에 Artificial Analysis는 Claude Haiku 4.5를 추론 활성화 시 55, 비활성화 시 42로 평가했습니다. 이전 수치 역시 54와 비교할 수 없습니다. 지수 버전이 재조정되며 v3 시대의 점수는 v4.1 점수가 아니기 때문입니다.
그러므로 정직한 진술은 리더보드가 보여주는 것보다 더 좁습니다: Muse Spark 1.2는 최대 노력으로 현재 지수에서 54점을 기록합니다; Claude Haiku 4.5에 대해 확장 사고를 켠 상태의 v4.1 점수는 공개되지 않았으므로, 이 둘을 최대 노력으로 비교한 동등한 비교는 아직 존재하지 않습니다. 누군가 54 대 24를 보여준다면, 이는 완전한 숙고를 한 모델과 숙고하지 말라고 지시받은 모델을 비교하는 것입니다.
Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.
네 가지 지연 시간 수치, 두 가지 다른 이야기

지연 시간은 "동일 가격"이라는 프레임이 단순한 호기심에서 결정으로 바뀌는 지점이며, 측정 소스가 가장 중요해지는 부분이기도 합니다.
벤치마크 하네스에서 Artificial Analysis는 Muse Spark 1.2의 xhigh에 대한 첫 토큰까지의 시간을 26.12초로 기록하고, Claude Haiku 4.5의 경우 1.00초로 기록합니다. 26배 차이이며, 그것이 전부라면 비교는 끝난 셈입니다.
프로덕션에서는 정반대입니다. OrcaRouter의 7일간 실제 트래픽 — 호출자가 실제로 원하는 노력을 사용하는 상황 — 에서 Claude Haiku 4.5는 첫 토큰까지의 시간이 p50 3.84초, p95 10.00초를 보여주며, 초당 214토큰, 오류율 1.0%를 기록합니다. 카탈로그에 있는 Meta 모델 버전인 Muse Spark 1.1은 p50 1.84초, p95 6.00초를 보여주며, 초당 519토큰, 기록된 오류 없음입니다. 라이브 트래픽에서는 Meta 모델이 더 빠릅니다.
두 숫자 집합 모두 사실이며, 서로 다른 것을 측정합니다. 실험실 수치는 콜드 캐시 상태에서 최대 숙고를 적용한 각 모델의 결과로, 성능 상한을 테스트하기에는 공정하지만 채팅 박스를 테스트하기에는 부적합합니다. 프로덕션 수치는 캐시 히트, 짧은 프롬프트, 낮은 노력 수준 등 실제 애플리케이션이 수행하는 모든 것을 포함하므로 중앙값을 테스트하기에는 공정하지만 최악의 경우에 대해서는 전혀 테스트하지 않습니다. 함정은 하나를 인용하고 다른 하나에 대해 추론하는 것입니다. 사용자 대상 타임아웃을 산정하는 경우 p95가 기준 수치입니다. 심층 에이전트 단계의 벽시계 시간 비용이 궁금하다면 벤치마크 수치가 진실에 더 가깝습니다. 그리고 솔직한 주의사항은 Muse Spark 1.2 자체에 대한 그러한 프로덕션 수치는 아직 존재하지 않는다는 것입니다. 너무 새롭고 널리 라우팅되지 않았기 때문입니다.
두 연구소 모두 당신에게 하위 에이전트를 팔았습니다. 그들이 의미한 바는 서로 달랐습니다.
The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.
메타의 Muse Spark 1.2 홍보는 동일한 계층 구조의 양쪽 끝을 모두 주장한다. 메타의 카피에 따르면 이 모델은 컨텍스트를 수집하고 계획하며 위임하는 주 에이전트가 되거나, 그 아래에서 병렬로 실행되는 서브에이전트가 될 수 있다. 함께 출시된 터미널 에이전트인 Muse Code는 재생-정확한 이벤트 로그 런타임 상에서 격리된 워크트리의 태스크당 여러 개의 영구 서브에이전트를 조정한다. 백만 토큰 윈도우와 상시 추론은 플래너에게 필요한 기능이며, 팬아웃 워커에게는 절대 선택하지 않을 기능이다. 모든 병렬 인스턴스가 요청하지도 않은 숙고 비용을 지불하기 때문이다.
Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.
각각에서 실제 한 단계의 비용
백만 토큰당 요금은 추론 모델에서는 아무 의미가 없습니다. 모델이 토큰을 얼마나 쓸지 스스로 결정하기 때문입니다. 대신 단계(step)별로 가격을 책정하세요.
범위가 정해진 코드 작업을 하나 들어 보자. 저장소 컨텍스트 60,000토큰이 입력되고 패치 3,000토큰이 출력된다. 단순 계산으로 Claude Haiku 4.5는 입력 $0.060에 출력 $0.015가 든다 — 7.5센트. Muse Spark 1.2는 $0.075에 $0.013이 든다 — 8.8센트. 노이즈 수준으로 비슷하며, 혼합 요금제가 약속한 그대로다.
Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.
캐싱은 다시 강조점을 뒤집는다. 저장소 컨텍스트를 안정적으로 유지해서 캐시에 적중되게 하면 Haiku의 입력 비용은 $0.006으로, Muse Spark 1.2는 $0.009로 떨어진다. 입력 측면은 완전히 중요하지 않게 되고, 전체 비교는 출력 토큰을 둘러싼 경쟁이 되며, 이는 각 모델이 얼마나 많이 생각하는지에 대한 경쟁이다. 컨텍스트가 반복되는 워크로드에서는 캐시 키 안정성이 모델 선택보다 더 가치 있으며, 이는 두 모델 모두에 해당된다.
The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.
두 번째 계약 없이 둘 다 시도

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.
Muse Spark 1.2는 카탈로그에 없다. 현재 메타의 모델 API가 이를 호출할 수 있는 유일한 곳이므로, 오늘날 진정한 직접 비교를 하려면 우리를 통한 통합 하나와 메타와의 직접 통합 하나가 필요하다. Muse Spark 1.1은 호스팅되며, 메타가 1.2에 부과하는 것과 동일한 $1.25 및 $4.25에 제공된다. 이는 이 제품군의 비용 및 지연 시간 특성에 대한 합리적인 대용 역할을 하지만, 1.2가 내세우는 코딩 향상까지는 대신하지 못한다. 1.2가 라우팅 가능해지면 비교는 동일한 키에 대한 한 줄의 모델 문자열 변경으로 끝난다. 그리고 위에서 설명한 오케스트레이터-플러스-워커 실험의 경우, 라우팅 DSL은 직접 핸드오프를 구축하는 대신 플래너와 팬아웃 워커를 단일 호출로 연결하는 방법이다.
작품의 형태로 고르세요, 점수가 아니라.
선택하세요Claude Haiku 4.5작업 범위가 한정되어 있고 사용자가 기다리고 있을 때 사용하면 됩니다. 지원 에이전트, 분류, 추출, 채팅, 페어 프로그래밍 완성, 그리고 에이전트 계층 구조의 병렬 워커 계층에 적합합니다. 9개월간의 현장 사용 이력이 있는 검증된 모델이며, thinking은 선택 사항이므로 원할 때만 deliberation 비용을 지불하면 됩니다. 200K는 거의 모든 범위가 정해진 하위 작업에 충분합니다. 공개된 SWE-bench Verified 결과에 따르면, 그 결과에 사용된 thinking 예산을 기꺼이 지출할 의향이 있다면 가격이 시사하는 것보다 훨씬 더 뛰어난 성능을 보여줍니다.
선택하세요: Muse Spark 1.2는 작업 단위가 요청이 아닌 저장소 단위일 때 사용할 모델입니다. 다중 파일 리팩터링, 장기 디버깅, 전체 프로젝트 생성, 아무도 스피너를 지켜보지 않는 장기 에이전트 루프 같은 작업이 여기에 해당합니다. 백만 토큰 컨텍스트 창은 Haiku가 어떤 대가를 치르더라도 해결할 수 없는 청크 분할 문제를 제거하며, 잘못된 계획이 느린 계획보다 비용이 더 많이 드는 상황에서는 채팅 경험을 망치는 필수 추론이 올바른 기본값이 됩니다.
What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
