
Muse Spark 1.2 vs Claude Haiku 4.5: 동일한 블렌디드 가격, 생각에 대한 상반된 관점
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 477 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 186 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Artificial Analysis의 책정 가격은 Muse Spark 1.2가 혼합 기준 토큰 100만 개당 $0.78, Claude Haiku 4.5가 $0.77이다. 단 1센트 차이지만, 그 외에는 전혀 공통점이 없는 두 연구소의 모델이다. Meta의 모델은 추론을 멈추지 못하는 반면, Claude Haiku 4.5는 요청할 때만 추론한다. Meta는 1,048,576토큰의 컨텍스트를 제공하고, Claude Haiku 4.5는 200,000토큰을 제공한다. Meta는 이 모델을 터미널 에이전트가 포함된 코딩 모델로 2026년 8월 5일에 출시했다. Claude Haiku 4.5는 2025년 10월, 더 큰 모델의 지시를 받는 빠르고 저렴한 작업자로 출시되었다. 토큰당 가격은 같지만, 전혀 다른 기계다.
그 우연의 일치는 비교를 시작하기에 유용한 출발점인데, 이는 사람들이 보통 판단 기준으로 삼는 변수를 제거하고 질문을 형태에 관한 것으로 강제하기 때문이다. 다음 내용은 존재하는 경우 독립적인 수치를 사용한다. 지수 점수와 실험실 지연 시간은 Artificial Analysis, 실제 트래픽 지연 시간은 OrcaRouter 자체의 7일간 프로덕션 텔레메트리를 사용하며, 공급업체가 보고한 수치는 그렇게 표시한다. 여기에는 제3자 대응물이 없는 벤더의 벤치마크 헤드라인 하나도 포함된다.
스펙 대비, 한 번에 하나의 차원씩
• 가격 — Muse Spark 1.2는 입력 $1.25 / 출력 $4.25 (백만 개당); Claude Haiku 4.5는 입력 $1.00 / 출력 $5.00. Meta는 입력 비용이 더 저렴하고, Claude Haiku 4.5는 출력 비용이 더 저렴합니다.
• 캐시 — Muse Spark 1.2 캐시 적중 시 백만 건당 $0.15 (88% 할인), Claude Haiku 4.5 캐시 읽기 시 백만 건당 $0.10 (90% 할인), 캐시 쓰기는 $1.25로 청구됩니다.
• 컨텍스트 — 1,048,576 토큰 대 200,000. 5.2배 차이이며, 둘 사이의 가장 큰 격차입니다.
• 최대 출력 — Claude Haiku 4.5는 64,000 토큰 상한을 선언하지만, Muse Spark 1.2 엔드포인트는 최대 완료 길이를 전혀 선언하지 않으며, 이는 가정하기보다 테스트할 만큼 특이한 경우입니다.
• 추론 — Muse Spark 1.2에서는 필수이며, 최소(minimal)부터 최상(xhigh)까지 다섯 단계의 강도 수준이 있고 기본값은 중간(medium)입니다. Claude Haiku 4.5에서는 선택 사항으로, 이 모델은 확장 사고를 켜고 사고 예산을 할당하기 전까지는 비추론 모델입니다.
• 입력 — Meta는 텍스트, 이미지, 비디오, 오디오 및 PDF를 지원하고, Claude Haiku 4.5는 텍스트와 이미지를 입력받습니다. 둘 다 텍스트를 반환합니다.
• 가중치 및 제공업체 — 둘 다 비공개입니다. Muse Spark 1.2는 Meta 자체 Model API로만 제공되며, Claude Haiku 4.5는 공급업체와 일반적인 클라우드 리셀러 및 애그리게이터를 통해 이용할 수 있습니다.
• 출시 기간 — Muse Spark 1.2는 출시된 지 며칠밖에 안 됐습니다. Claude Haiku 4.5는 2025년 10월 15일부터 프로덕션에서 운영되어 왔으며, 2025년 7월 지식 기준일과 9개월간의 현장 경험을 보유하고 있습니다.
지수 격차는 실제로 존재한다. 그러나 모두가 인용하게 될 그 숫자는 실제가 아니다.

Artificial Analysis는 Intelligence Index에서 Muse Spark 1.2를 54점으로 매겨 185개 중 13위로 평가했습니다. Claude Haiku 4.5의 현재 등재 점수는 24점입니다. 이 둘을 나란히 놓으면 헤드라인이 만들어지지만, 실제 항목이 무엇인지 살펴보면 그 헤드라인은 무너집니다.
54는 가장 비용이 많이 드는 추론 설정인 xhigh에서 평가된 Muse Spark 1.2입니다. 24는 추론 기능을 끈 비추론 모델로 평가된 Claude Haiku 4.5이며, Artificial Analysis는 이를 완료된 실행이 아닌 추정치로 표시합니다. 동일한 지수의 이전 버전, 즉 v4.1 재가중치 적용 전에 Artificial Analysis는 Claude Haiku 4.5를 추론 활성화 시 55, 비활성화 시 42로 평가했습니다. 이전 수치 역시 54와 비교할 수 없습니다. 지수 버전이 재조정되며 v3 시대의 점수는 v4.1 점수가 아니기 때문입니다.
그러므로 정직한 진술은 리더보드가 보여주는 것보다 더 좁습니다: Muse Spark 1.2는 최대 노력으로 현재 지수에서 54점을 기록합니다; Claude Haiku 4.5에 대해 확장 사고를 켠 상태의 v4.1 점수는 공개되지 않았으므로, 이 둘을 최대 노력으로 비교한 동등한 비교는 아직 존재하지 않습니다. 누군가 54 대 24를 보여준다면, 이는 완전한 숙고를 한 모델과 숙고하지 말라고 지시받은 모델을 비교하는 것입니다.
벤더가 수치를 발표한 경우, 그것은 정확한 수치입니다: {{1}}Claude Haiku 4.5는 SWE-bench Verified에서 73.3%를 기록했으며, 128K 추론 예산으로 50회 시행을 평균한 값입니다{{/1}}. {{2}}이는 벤더 수치이며, 속도를 내세워 마케팅되는 모델로서는 그 추론 예산이 엄청나게 큽니다. 그러나 이는 업계가 프런티어 모델에 대해 인용하는 것과 동일한 평가이며, Haiku를 가격이 시사하지 않는 등급에 올려놓습니다{{/2}}. {{3}}Meta의 대응 모델인 Muse Spark 1.2에 대한 주장은 Terminal-Bench 2.1에서 82.9%, DeepSWE v1.1에서 59.3%로, 이 역시 벤더 실행 결과로 Meta 자체 하네스에서 각 경쟁 모델을 각자의 에이전트 제품과 짝지은 것입니다{{/3}}. {{4}}두 벤더, 두 벤치마크, 겹치지 않음{{/4}}. {{5}}현재 두 모델 모두 동일한 평가자로부터 발표된 점수를 가진 단일 평가는 존재하지 않습니다{{/5}}.
네 가지 지연 시간 수치, 두 가지 다른 이야기

지연 시간은 "동일 가격"이라는 프레임이 단순한 호기심에서 결정으로 바뀌는 지점이며, 측정 소스가 가장 중요해지는 부분이기도 합니다.
벤치마크 하네스에서 Artificial Analysis는 Muse Spark 1.2의 xhigh에 대한 첫 토큰까지의 시간을 26.12초로 기록하고, Claude Haiku 4.5의 경우 1.00초로 기록합니다. 26배 차이이며, 그것이 전부라면 비교는 끝난 셈입니다.
프로덕션에서는 정반대입니다. OrcaRouter의 7일간 실제 트래픽 — 호출자가 실제로 원하는 노력을 사용하는 상황 — 에서 Claude Haiku 4.5는 첫 토큰까지의 시간이 p50 3.84초, p95 10.00초를 보여주며, 초당 214토큰, 오류율 1.0%를 기록합니다. 카탈로그에 있는 Meta 모델 버전인 Muse Spark 1.1은 p50 1.84초, p95 6.00초를 보여주며, 초당 519토큰, 기록된 오류 없음입니다. 라이브 트래픽에서는 Meta 모델이 더 빠릅니다.
두 숫자 집합 모두 사실이며, 서로 다른 것을 측정합니다. 실험실 수치는 콜드 캐시 상태에서 최대 숙고를 적용한 각 모델의 결과로, 성능 상한을 테스트하기에는 공정하지만 채팅 박스를 테스트하기에는 부적합합니다. 프로덕션 수치는 캐시 히트, 짧은 프롬프트, 낮은 노력 수준 등 실제 애플리케이션이 수행하는 모든 것을 포함하므로 중앙값을 테스트하기에는 공정하지만 최악의 경우에 대해서는 전혀 테스트하지 않습니다. 함정은 하나를 인용하고 다른 하나에 대해 추론하는 것입니다. 사용자 대상 타임아웃을 산정하는 경우 p95가 기준 수치입니다. 심층 에이전트 단계의 벽시계 시간 비용이 궁금하다면 벤치마크 수치가 진실에 더 가깝습니다. 그리고 솔직한 주의사항은 Muse Spark 1.2 자체에 대한 그러한 프로덕션 수치는 아직 존재하지 않는다는 것입니다. 너무 새롭고 널리 라우팅되지 않았기 때문입니다.
두 연구소 모두 당신에게 하위 에이전트를 팔았습니다. 그들이 의미한 바는 서로 달랐습니다.
Claude Haiku 4.5에 대한 벤더의 홍보는 위계 구조를 명확히 했다: Sonnet급 모델이 계획하고 조율하며, Haiku 인스턴스는 그 아래에서 병렬로 실행된다. 저렴하고, 빠르고, 일회용이며, 한 번에 여러 개를 동시에 쓸 수 있다. 제품 설계도 이런 방향성을 따른다 — 200K 윈도우는 범위가 정해진 하위 작업에는 충분하지만, 의도적으로 전체 저장소를 처리하기에는 부족하다. 기본적으로 추론(thinking)이 꺼져 있는 이유는, 숙고하는 워커는 곧 오케스트레이터의 비용을 증가시키는 워커이기 때문이다. 벤더의 자체 마케팅에서도 실시간 채팅, 고객 서비스, 페어 프로그래밍을 주요 대상으로 지목하고 있다.
메타의 Muse Spark 1.2 홍보는 동일한 계층 구조의 양쪽 끝을 모두 주장한다. 메타의 카피에 따르면 이 모델은 컨텍스트를 수집하고 계획하며 위임하는 주 에이전트가 되거나, 그 아래에서 병렬로 실행되는 서브에이전트가 될 수 있다. 함께 출시된 터미널 에이전트인 Muse Code는 재생-정확한 이벤트 로그 런타임 상에서 격리된 워크트리의 태스크당 여러 개의 영구 서브에이전트를 조정한다. 백만 토큰 윈도우와 상시 추론은 플래너에게 필요한 기능이며, 팬아웃 워커에게는 절대 선택하지 않을 기능이다. 모든 병렬 인스턴스가 요청하지도 않은 숙고 비용을 지불하기 때문이다.
마케팅이 아니라 아키텍처로 보면 진짜 차이가 보입니다: 한 벤더는 워커를 만들어 사용자가 오케스트레이터를 가져오길 기대하는 반면, 메타는 오케스트레이터를 만들어 그것 역시 작동할 수 있다고 주장합니다. 이미 계층 구조를 운영 중이라면, 흥미로운 실험은 둘 중 하나를 고르는 것이 아니라 — Muse Spark 1.2로 계획하고 Claude Haiku 4.5로 실행하는 것입니다. 이는 어느 벤더도 패키지로 팔지 않는 구성입니다.
각각에서 실제 한 단계의 비용
백만 토큰당 요금은 추론 모델에서는 아무 의미가 없습니다. 모델이 토큰을 얼마나 쓸지 스스로 결정하기 때문입니다. 대신 단계(step)별로 가격을 책정하세요.
범위가 정해진 코드 작업을 하나 들어 보자. 저장소 컨텍스트 60,000토큰이 입력되고 패치 3,000토큰이 출력된다. 단순 계산으로 Claude Haiku 4.5는 입력 $0.060에 출력 $0.015가 든다 — 7.5센트. Muse Spark 1.2는 $0.075에 $0.013이 든다 — 8.8센트. 노이즈 수준으로 비슷하며, 혼합 요금제가 약속한 그대로다.
이제 혼합 요금이 숨기는 것을 더해 봅시다. Muse Spark 1.2는 추론을 끌 수 없으며, 기본 중간 설정에서는 이러한 단계가 패치 전에 수천 개의 추론 토큰을 생성할 가능성이 높습니다. 해당 토큰은 출력으로 청구됩니다. 3,000을 추가하면 같은 단계는 $0.075 + $0.026 = 10.1센트, 동일한 입력에서 Haiku보다 약 35% 높은 수치입니다. 추론을 끈 Claude Haiku 4.5는 추론 비용을 지불하지 않아 7.5센트를 유지합니다. 그러나 큰 추론 예산을 사용하면 Claude Haiku 4.5는 Meta의 $4.25보다 높은 백만 출력당 $5.00을 청구하므로 Muse Spark 1.2를 초과할 것입니다.
캐싱은 다시 강조점을 뒤집는다. 저장소 컨텍스트를 안정적으로 유지해서 캐시에 적중되게 하면 Haiku의 입력 비용은 $0.006으로, Muse Spark 1.2는 $0.009로 떨어진다. 입력 측면은 완전히 중요하지 않게 되고, 전체 비교는 출력 토큰을 둘러싼 경쟁이 되며, 이는 각 모델이 얼마나 많이 생각하는지에 대한 경쟁이다. 컨텍스트가 반복되는 워크로드에서는 캐시 키 안정성이 모델 선택보다 더 가치 있으며, 이는 두 모델 모두에 해당된다.
1M 윈도우는 수치가 전혀 맞지 않는 유일한 부분입니다. 단일 호출에 실제로 200,000개 이상의 토큰이 필요한 것은 어떤 가격으로도 Claude Haiku 4.5에서 실행할 수 없습니다. 청크로 나누고 오케스트레이션하거나 — 이것이 공급업체가 의도한 방식입니다 — 또는 그만한 여유가 있는 모델을 사용해야 합니다.
두 번째 계약 없이 둘 다 시도

Claude Haiku 4.5는 OrcaRouter 카탈로그에 $1.00 및 $5.00으로 등록되어 있습니다 — 공급업체의 정가입니다. OrcaRouter는 0% 마크업을 적용하고 공급업체 가격을 그대로 전달하기 때문에, 공급업체의 가격 변경은 다음 계약 주기가 아니라 당일에 우리 쪽에 반영됩니다. 위의 프로덕션 지연 시간 수치는 동일한 라우팅 계층에서 나온 것입니다.
Muse Spark 1.2는 카탈로그에 없다. 현재 메타의 모델 API가 이를 호출할 수 있는 유일한 곳이므로, 오늘날 진정한 직접 비교를 하려면 우리를 통한 통합 하나와 메타와의 직접 통합 하나가 필요하다. Muse Spark 1.1은 호스팅되며, 메타가 1.2에 부과하는 것과 동일한 $1.25 및 $4.25에 제공된다. 이는 이 제품군의 비용 및 지연 시간 특성에 대한 합리적인 대용 역할을 하지만, 1.2가 내세우는 코딩 향상까지는 대신하지 못한다. 1.2가 라우팅 가능해지면 비교는 동일한 키에 대한 한 줄의 모델 문자열 변경으로 끝난다. 그리고 위에서 설명한 오케스트레이터-플러스-워커 실험의 경우, 라우팅 DSL은 직접 핸드오프를 구축하는 대신 플래너와 팬아웃 워커를 단일 호출로 연결하는 방법이다.
작품의 형태로 고르세요, 점수가 아니라.
선택하세요Claude Haiku 4.5작업 범위가 한정되어 있고 사용자가 기다리고 있을 때 사용하면 됩니다. 지원 에이전트, 분류, 추출, 채팅, 페어 프로그래밍 완성, 그리고 에이전트 계층 구조의 병렬 워커 계층에 적합합니다. 9개월간의 현장 사용 이력이 있는 검증된 모델이며, thinking은 선택 사항이므로 원할 때만 deliberation 비용을 지불하면 됩니다. 200K는 거의 모든 범위가 정해진 하위 작업에 충분합니다. 공개된 SWE-bench Verified 결과에 따르면, 그 결과에 사용된 thinking 예산을 기꺼이 지출할 의향이 있다면 가격이 시사하는 것보다 훨씬 더 뛰어난 성능을 보여줍니다.
선택하세요: Muse Spark 1.2는 작업 단위가 요청이 아닌 저장소 단위일 때 사용할 모델입니다. 다중 파일 리팩터링, 장기 디버깅, 전체 프로젝트 생성, 아무도 스피너를 지켜보지 않는 장기 에이전트 루프 같은 작업이 여기에 해당합니다. 백만 토큰 컨텍스트 창은 Haiku가 어떤 대가를 치르더라도 해결할 수 없는 청크 분할 문제를 제거하며, 잘못된 계획이 느린 계획보다 비용이 더 많이 드는 상황에서는 채팅 경험을 망치는 필수 추론이 올바른 기본값이 됩니다.
무엇이 이를 결정해야 하는지는 인덱스 번호가 아니다. 대신 두 가지 질문을 던져라: 단일 호출이 200,000개가 넘는 토큰을 처리해야 하는 경우가 있는가, 그리고 첫 번째 토큰을 기다리는 사람이 있는가? 첫 번째에 예라고 답하면 Meta를 가리킨다. 두 번째에 예라고 답하면 벤더를 가리킨다. 둘 다 예라면 두 개의 모델이 필요하다는 뜻이며, 이는 어느 한쪽 벤더의 마케팅이 인정하는 것보다 더 자주 맞는 솔직한 답이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
