
Muse Spark 1.2 대 Claude Fable 5: 6가지 지수 포인트의 실제 비용
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 197 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
Artificial Analysis는 대부분의 벤치마크 표가 생략하는 것, 즉 지출한 비용을 게시합니다. 9개 평가로 구성된 Intelligence Index 실행 비용은 $637.85 에 대한 Muse Spark 1.2 및 $5,630.52 에 대한 Claude Fable 5입니다. 동일한 벤치마크 스위트, 동일한 하네스, 한쪽 청구서가 다른 쪽의 8.8배였습니다. Fable 5는 Muse Spark 1.2의 54점에 비해 60점을 기록했습니다.
차이를 나누면 이 비교가 실제로 의미하는 숫자가 나옵니다. 즉, 그 작업 부하에서 지능의 마지막 6포인트는 대략 포인트당 $832가 듭니다. 이 비용을 지불해야 하는지는 벤치마크 문제가 아닙니다. 실제로 그 포인트가 필요한 트래픽이 얼마나 되는지에 대한 문제이며, 대부분의 팀에게 그 대답은 작고 식별 가능한 일부입니다.
한계 지수 포인트에는 가격이 있으며, 그 가격은 가파르다.
두 수치 모두 동일한 독립 평가 기관이 동일한 복합 벤치마크(GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience 및 AA-LCR)를 실행한 결과입니다. 어느 쪽도 공급업체의 주장이 아닙니다. Fable 5는 185개 모델 중 3위, Muse Spark 1.2는 13위이며, 클래스 중앙값은 32입니다. 둘 다 평균을 훨씬 웃돌지만, 프런티어에 있는 것은 하나뿐입니다.

정가는 격차의 대부분을 설명하며, 나머지는 과소평가하고 있다:
• 입력 — Muse Spark 1.2는 백만 개당 $1.25, Claude Fable 5는 $10.00입니다. 8배입니다.
• 산출 — $4.25 대 $50.00. 거의 12배.
• 캐시된 입력 — $0.15 대비 $1.00. 대략 7배이며, Fable 5는 캐시 쓰기에 백만 건당 $12.50, 또는 1시간 TTL에 $20.00를 추가로 청구하는 반면, Muse Spark 1.2는 별도의 캐시 쓰기 수수료를 전혀 부과하지 않습니다.
• 혼합 요율 — Artificial Analysis에 따르면 Muse Spark 1.2는 토큰 100만 개당 $0.78, Fable 5는 $7.70입니다. 거의 10배 차이입니다.
Fable 5는 출시 당시 Artificial Analysis가 벤치마크한 모델 중 가장 비싼 모델이었으며, 그 타이틀을 지금까지 유지하고 있습니다. 그 이유를 정확히 짚어볼 가치가 있습니다: 이 모델은 Muse Spark 1.2가 인덱스를 통과할 때보다 더 적은 출력 토큰을 사용했습니다 — 87M 대 95M — 따라서 전체 비용 차이는 장황함이 아니라 단가 때문입니다. Fable 5는 낭비적이지 않습니다. 단순히 프론티어 제품으로 가격이 책정된 것뿐입니다.
리포지토리 컨텍스트 60,000토큰을 읽고 3,000토큰의 패치를 작성하는 에이전트 단계로 환산하면: 대략8.8센트(Muse Spark 1.2), 약 75센트(Claude Fable 5). 하루에 천 단계는 $88 대 $750입니다. 1년이면 $32,000 대 $274,000입니다.
Claude Fable 5가 대체될 수 없는 경우
만약 그 여섯 가지 포인트가 차이의 전부라면 비용 측면은 한쪽으로 기울었을 것입니다. 하지만 그렇지 않으며, 격차가 벌어지는 지점은 바로 Meta가 경쟁을 위해 Muse Spark 1.2를 재배치한 지점입니다.
Fable 5는 Design Arena 1:1 래더의 여러 부문에서 1위를 차지하고 있습니다: 게임 개발에서 1399 Elo로 1위, ASCII 아트에서 1367로 1위, SVG 생성에서 1353으로 1위, 그리고 에이전트 아레나에서는 Godot 게임 개발(1344), Android 네이티브(1318), 에이전틱 게임 개발(1300), HTML 슬라이드(1260)에서 1위를 차지했으며, 웹 앱과 풀스택 작업에서는 2위를 기록했습니다. Muse Spark 1.2는 Design Arena 항목이 전혀 없습니다 — 이전 버전은 나름 준수한 중위권 기록(게임 개발 1334로 5위, 일반 코드 카테고리 1309로 9위)을 쌓았지만, 새 버전은 단 한 번도 평가를 받지 못했습니다.
차원별 지수도 같은 방향을 가리킵니다. Artificial Analysis는 Claude Fable 5를 코딩 지수 76.5, 에이전틱 지수 52.8로 평가합니다. Muse Spark 1.1은 71.3과 37.5에 머물렀습니다 — 코딩에서 5점, 에이전틱 작업에서 15점 뒤처진 셈입니다. 1.2에 대한 차원별 수치는 아직 공개되지 않았습니다. 따라서 정직한 표현은 종합 점수가 3점 차이로 좁혀졌다는 것을 알지만, 그중 얼마나 에이전틱 축에 반영되었는지는 모른다는 것입니다.

Fable 5의 자체 제품 포지셔닝은 작업 길이와 복잡성이 증가할수록 격차가 더 벌어진다고 주장합니다. 이는 공급업체의 주장일 뿐이며 명시된 대로 검증되지는 않았지만, 독립 데이터의 형태와는 일치합니다: Fable 5의 가장 큰 격차는 단일 생성(single-shot generation)보다는 에이전트 영역에서 나타나는데, 이 영역에서는 모델이 여러 턴에 걸쳐 계획을 유지해야 하기 때문입니다.
Muse Spark 1.2가 단순히 정답인 경우
세 가지가 여섯 가지 포인트와 관계없이 올바른 선택이 되게 합니다.
• 오디오 및 비디오 입력.Meta의 목록에는 텍스트, 이미지, 비디오, 오디오 및 PDF 입력이 지원된다고 광고되어 있습니다. Claude Fable 5는 텍스트, 이미지 및 파일을 수용합니다 — 오디오 없음, 비디오 없음. 녹음 파일이나 영상 자료를 다루는 모든 파이프라인에게 이는 절충안이 아니라 강력한 필터입니다. 솔직한 경고 하나: Artificial Analysis의 Muse Spark 1.2 사양 카드에는 평가 항목으로 텍스트와 이미지만 기록되어 있으므로, 더 넓은 기능 범위는 독립적으로 검증된 것이 아니라 광고된 것에 불과합니다.
• 속도. 초당 165.0토큰으로 71.7과 비교됩니다. Muse Spark 1.2는 출력 스트리밍 속도가 두 배 이상 빠르며, 속도 부문에서 185개 중 16위를 기록했습니다. 클래스 중앙값은 71입니다 — Fable 5는 중앙값에 해당합니다.
• 대량 구매 시 비용. 이전 섹션의 모든 것.
요청 규모가 정말로 거대한 사람들을 위해 네 번째 항목을 추가합니다: 두 모델 모두 약 백만 개의 컨텍스트 토큰을 광고합니다 — Muse Spark 1.2는 1,048,576개, Fable 5는 1,000,000개 — 하지만 Muse Spark 1.2는 전체 구간에 고정 요금을 부과하는 반면, Fable 5의 캐시 쓰기 가격 책정 방식은 크고 안정적인 접두어를 유지하는 데 드는 비용이 절약 효과를 보기 전에 먼저 실제 돈으로 지불되어야 함을 의미합니다.
이것들 중 어느 것도 빠른 모델이 아닙니다.
이것은 대부분의 1:1 비교가 건너뛰는 섹션이며, 인보이스가 아니라 아키텍처를 변경합니다.
최대 추론 노력 설정에서 Artificial Analysis는 Muse Spark 1.2의 첫 토큰까지의 시간을 26.12초, Claude Fable 5의 첫 토큰까지의 시간을 141.26초로 측정했으며, Fable 5의 종단 간 응답 시간은 148.24초입니다. 어느 쪽도 그런 설정에서는 사용자 앞에 놓일 수 없습니다.
프로덕션 수치는 훨씬 더 우호적이며 알아둘 가치가 있습니다. OrcaRouter에서 Claude Fable 5는 다음을 보여줍니다: p50 기준 첫 토큰까지의 시간은 7.04초, p95는 10.00초 — 일주일 동안의 수치로, 이는 요청자가 요청한 노력 수준에 관계없이 실제 트래픽에서 얻은 결과이지, 최대 부하에서의 벤치마크가 아닙니다. 참고로 Muse Spark 1.1은 p50이 1.84초입니다. Muse Spark 1.2는 아직 프로덕션 원격 측정 데이터가 없습니다.

구조적 요점: 두 모델 모두 필수 추론을 갖추고 있습니다. Fable 5의 노력 다이얼은 낮음에서 최대까지 이어지며 기본값은 높음입니다. Muse Spark 1.2의 노력 다이얼은 최소에서 xhigh까지 이어지며 기본값은 중간입니다. 어느 쪽도 추론을 끌 수 없습니다. 1초 미만의 응답이 필요하다면 이 비교 전체는 잘못된 선반입니다 — 그런 용도는 Luna 또는 Flash-Lite급 모델을 위한 것입니다.
두 모델 스택, 가격에서 밀려나다
이것을 승자 독식 선택으로 보는 것은 실수다. 트래픽이 균일하지 않기 때문이다. 거의 모든 프로덕션 에이전트는 파일 읽기, diff 요약, 패치 포맷, 다음에 호출할 도구 결정 같은 일상적인 단계들의 긴 꼬리와, 잘못된 답이 한 시간을 낭비하게 만드는 진짜 어려운 단계들의 짧은 머리를 갖고 있다.
하루에 같은 천 개의 에이전트 단계를 수행한다고 가정하세요. 전부 Claude Fable 5로 하면 약 $750입니다. 전부 Muse Spark 1.2로 하면 약 $88입니다. 900개의 일상적인 작업은 저렴한 모델에, 100개의 어려운 작업은 비싼 모델에 나누면 약 $79 더하기 $75, 즉 하루 $154. 그것은 전체 Fable 비용의 5분의 1이며, 실제로 필요한 호출의 10분의 1에 대해 최첨단 성능을 유지합니다. 그리고 하나의 에이전트 루프에서 연간 약 $220,000의 차이입니다.
split을 단지 설명하는 대신 실제로 구축할 가치가 있는 이유는 예전에는 두 벤더 관계, 두 SDK, 두 세트의 자격 증명이 필요했기 때문입니다. 이제는 그렇지 않습니다. Claude Fable 5는 OrcaRouter 카탈로그에 $10.00와 $50.00으로 등록되어 있으며, 이는 벤더 권장 소비자가격으로 0% 마크업으로 전달됩니다. Muse Spark 1.1도 동일한 기준으로 $1.25와 $4.25에 동일한 OpenAI 호환 엔드포인트 뒤에 있습니다. 라우팅 DSL을 사용하면 "저비용 모델 우선, 낮은 신뢰도 또는 테스트 실행 실패 시 에스컬레이션"을 유지 관리해야 하는 오케스트레이션 코드 대신 단일 호출로 표현할 수 있으며, 모델 퓨전을 사용하면 진정으로 모호한 단계를 여러 모델 패널에 한 번에 보내 비교할 수 있습니다. Muse Spark 1.2 자체는 아직 카탈로그에 없습니다. Meta가 유일한 제공자로서 직접 제공하기 때문입니다. 따라서 현재 이 스택에 가장 가깝게 구축할 수 있는 것은 저비용 경로에 1.1을 사용하는 것입니다.
단일 공급자라는 세부 사항은 위험 평가에서 별도의 항목으로 다룰 가치가 있습니다. Claude Fable 5는 여러 서비스 경로와 그 사이의 자동 장애 조치를 갖추고 있습니다. Muse Spark 1.2는 Meta가 운영하는 정확히 하나의 엔드포인트만 있습니다. 그것이 중단되면 동일한 모델로 대체할 폴백이 없습니다.
비용 모델이지, 판단이 아니다.
이 비교의 유용한 결과는 "어떤 모델이 이기는가"가 아닙니다. 그것은 자신의 작업 부하에 대해 계산할 수 있는 임계값입니다.
Muse Spark 1.2급 답변이 실패하고 Fable 5급 답변이 성공하는 호출의 비율을 추정하십시오. 실패 비용(엔지니어 시간, 잘못된 병합, 재시도 루프, 고객 손실)을 곱하십시오. 이를 위의 60K 입력/3K 출력 예시에서 단일 호출을 Muse Spark 1.2에서 Claude Fable 5로 업그레이드하는 비용인 단계당 66센트와 비교하십시오. 오답으로 인한 예상 손실이 66센트를 초과하면 해당 단계를 Fable 5로 라우팅하십시오. 그렇지 않으면 라우팅하지 마십시오.
대부분의 팀에게 그 계산은 Fable 5를 코드 리뷰, 최종 패치 생성, 아키텍처 계획 및 프로덕션 데이터를 다루는 모든 작업에 배정하고, Muse Spark 1.2를 그 외의 모든 것—파일 읽기, 요약, 테스트 분류, 도구 선택, 비용은 실질적이지만 호출당 위험 부담은 크지 않은 에이전트 루프의 대용량 중간 단계—에 배정합니다.
계속 지켜봐야 할 한 가지는 Design Arena 래더와 Muse Spark 1.2의 차원별 지수인데, 둘 다 아직 존재하지 않습니다. Fable 5의 가장 강력한 증거는 정확히 Meta의 새 모델이 전혀 기록이 없는 맞대결 아레나에 있습니다. 그 기록이 나타나면 이 임계값은 이동합니다 — 아마도 크게요.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
