
Muse Spark 1.2와 Muse Code: Meta의 4개월 만의 세 번째 모델, Grok 4.5와 타이를 이룬다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
메타가 출시한 Muse Spark 1.2는 2026년 8월 5일에 출시되었으며, 이는 Muse Spark 1.1 출시 4주 후, 첫 Muse Spark 출시 약 4개월 후였다. 이번 버전은 이전 두 버전에는 없던 것을 갖췄다: 바로 메타 자체의 코딩 에이전트, Muse Code, 베타 버전으로 출시되었고 이 모델과 함께 공동 훈련되었다. 그리고 메타나 경쟁사 모두 통제하지 못하는 유일한 순위표에서, 이번 출시로 메타는 SpaceXAI와 동률을 이루었다. Muse Spark 1.2와 Grok 4.5는 이제 Artificial Analysis Intelligence Index에서 둘 다 54점을 기록했다. 5일 후에는 더 큰 발전이 있었다: 8월 10일, 메타는 Muse Spark 1.2의 가중치를 공개하겠다고 밝혔다. 이 발표가 현실화되면, 이 모델은 중국 모델에 맞서는 미국의 현재 가장 강력한 오픈 가중치 경쟁자가 될 것이다.
아래 수치들이 어떤 의미를 갖기 전에, 먼저 구분해 두어야 할 두 가지가 있다. Intelligence Index 점수, 지연 시간 수치, 토큰 수는 Artificial Analysis에서 나온 것으로, 이 기관이 자체 평가를 실행하고 비용을 공개한다. 즉, 이는 독립적인 결과다. Meta가 발표를 시작할 때 내세운 코딩 결과물들 — Terminal-Bench 2.1, DeepSWE v1.1, 그리고 내부 벤치마크 — 은 Meta가 자체 하네스에서 실행했으며, 각 경쟁 모델은 자체 에이전트 제품과 짝을 이루었다. 두 종류의 수치 모두 유용하다. 그러나 이들은 같은 종류의 증거가 아니며, 이 글에서는 이를 구분하여 다룬다.
메타가 실제로 출시한 것

메타의 AI 연구 블로그에 게시된 8월 5일자 발표는 두 가지 제품을 동시에 다루고 있습니다.
• Muse Spark 1.2 — Muse Spark 제품군의 코딩 중심 업데이트. 메타는 코딩 작업에 대한 학습 컴퓨팅을 확대하고 학습 환경의 다양성을 넓히면서, 1.1 릴리스가 내세웠던 일반 에이전트 능력은 유지했다고 밝혔다. 명시된 학습 목표는 장기 지향적(long-horizon)이다: 전체 저장소 생성, 대규모 엔드투엔드 프로젝트, 그리고 메타가 오토리서치라고 부르는 것으로, 작업 순서를 계획하는 플래닝, 여러 단계에 걸쳐 방향을 유지하기 위한 목표 조건화, 세션이 길어질 때 관련 상태를 유지하기 위한 컨텍스트 압축을 포함한다.
• Muse Code — 베타 버전의 터미널 코딩 에이전트로, Meta의 개발자 도메인에서 한 줄 셸 스크립트로 설치할 수 있습니다. 세션을 넘어 유지되는 영구 비동기 백그라운드 에이전트를 실행하며, Meta가 replay-exact 및 restart-safe라고 설명하는 로컬 이벤트 로그 런타임에서 작동합니다. 또한 격리된 작업 트리에서 작업당 여러 하위 에이전트를 조정합니다. 세 가지 번들 스킬을 제공합니다: /plan 승인 게이트 방식의 계획 수립용, /grill 이미 완료된 작업을 스트레스 테스트하는 용도, 그리고 /goal 작업을 완료로 이끄는 용도입니다.
이 결합은 우연이 아닙니다. 메타는 이 둘이 공동 훈련되었다고 말합니다 — 모델은 하네스에서 얻은 거부 샘플링된 궤적으로 미세 조정되었고, 목표, 압축, 서브에이전트에 대한 레시피 최적화가 적용되었습니다. 이는 Claude Code와 Codex를 만들어낸 것과 동일한 공동 훈련 방식이며, 벤치마크 수치를 읽는 이에게 중요한 함의를 갖습니다: 모델의 대표적인 코딩 점수는 모델이 훈련된 바로 그 하네스 안에서 생성되었습니다. 그것은 부정행위가 아니라, 지금 에이전트 평가가 작동하는 방식입니다. 다만 이는 다른 스캐폴드를 통해 얻은 1.2 점수가 안전한 가정이라기보다는 미해결 문제라는 것을 의미합니다.
나머지 사양은 1.1에서 변경되지 않았으며, 1.1 자체도 정보 제공용입니다. 컨텍스트는 1,048,576 토큰으로 유지됩니다. 추론은 다섯 가지 노력 수준(최소, 낮음, 중간, 높음, 매우 높음)에서 여전히 필수이며, 기본값은 중간입니다. 일정 수준의 사고를 지불하지 않고 가중치를 얻을 수 있는 구성은 없습니다. 출시 당시 가중치는 비공개였으며, Hugging Face 저장소도 없었고 Meta 자체 Model API가 이를 호출할 수 있는 유일한 자사 장소였습니다. 이제 그 정책이 변경될 예정입니다. 8월 10일 Meta는 첫 세 번의 Muse Spark 릴리스를 지배했던 비공개 가중치 정책을 뒤집고 가중치를 공개할 것이라고 발표했습니다.
43, 그 다음 51, 그 다음 54

Artificial Analysis는 xhigh 추론 설정에서 자사 Intelligence Index에서 Muse Spark 1.2를 54점으로 평가해, 클래스 중앙값 32를 기준으로 185개 모델 중 13위로 선정했습니다. 이 지수는 에이전트, 코딩, 일반 역량, 과학적 추론에 걸쳐 균등하게 배분된 9가지 평가(GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR)의 가중 복합 지수입니다.
스냅샷이 아니라 연속된 흐름으로 읽으면, Meta의 궤적이 실제 이야기다. 원래 Muse Spark는 4월에 43점을 기록했다. Muse Spark 1.1은 7월 9일에 51점에 도달, 한 분기 만에 8포인트 상승이다. Muse Spark 1.2는 한 달도 안 되어 3포인트를 더 추가했다. Meta는 4개월 만에 11포인트를 움직였으며, 평가 생태계가 따라잡을 수 있는 속도보다 더 빠르게 출시되고 있다. 1.2에 대한 공개된 벤치마크별 세부 결과는 아직 없고, Design Arena 기록도 전혀 없다. 반면 1.1은 두 가지 모두 갖추고 있다.
54점으로 메타는 그록 4.5와 동률이며, 그록 4.5는 SpaceXAI가 뮤즈 스파크 1.1보다 하루 앞서 출시한 모델이다. 메타는 타이트한 최전선 그룹인 클로드 오퍼스 5(61점), 클로드 페이블 5(60점), GPT-5.6 솔(59점) 뒤에 있다. 최고점과의 격차는 6~7포인트다. 메타가 연초에 시작한 지점과의 격차는 11포인트다. 그 격차가 좁혀질지는 출시 주기가 유지되는지에 달려 있으며, 현재 메타는 4주 배포 주기를 따르고 있다.
하지만 복합 지수에서의 동률은 업무에서의 동률이 아닙니다. 54가 무엇을 결정하고 무엇을 결정하지 않는지 말할 가치가 있습니다. 54는 Muse Spark 1.2가 총체적 역량에 있어 Grok 4.5와 같은 논의 대상에 속한다는 것을 결정합니다. 그것은 어느 쪽이 더 나은 패치를 작성하는지 알려주지 않습니다. 왜냐하면 그 질문에 답할 코딩 하위 지수가 1.2에 대해 아직 발표되지 않았기 때문입니다.
Meta의 코딩 숫자를 주의 깊게 읽으세요.
메타의 발표는 세 개의 차트에서 선두를 차지한다. 자체 실행에서는 pass@1로 보고되며, 5회 시도에 걸쳐 각 경쟁 모델이 자체 에이전트 제품과 짝을 이루었다:
• Terminal-Bench 2.1 — Muse Spark 1.2가 1.1의 76.2%에서 82.9%로 상승했습니다. Claude Opus 5가 86.7%로 앞서 있습니다.
• DeepSWE v1.1 — 59.3%, 53.0%에서 상승.
• Meta의 내부 코딩 벤치마크 — 70.6%, 68.3%에서 상승.
델타 값이 신뢰할 만한 부분이다. 한 달 간격으로 같은 팀이 같은 하네스에서 같은 방식으로 측정한 Terminal-Bench 6.7포인트, DeepSWE 6.3포인트 상승은 Meta가 최적화하고 있던 부분에서 1.2가 1.1보다 얼마나 개선되었는지를 합리적으로 보여준다. 교차 벤더 순위는 가볍게 받아들여야 할 부분이다. 하네스 조합은 큰 자유 변수이고, 자체 모델과 함께 자체 하네스를 튜닝하는 연구소가 다른 모든 업체의 하네스를 동등하게 튜닝할 수 있는 입장은 아니기 때문이다. Meta는 자체 슬라이드에서 2위였는데, 이는 적어도 벤더 벤치마크의 전형적인 형태는 아니다. 하지만 이 글을 쓰는 시점까지 어떤 제3자도 이를 재현하지 못했다.
두 번째 가격표
이번 릴리스에서 가장 중요한 점은 벤치마크 차트에 있지 않습니다. Muse Spark 1.2는 두 가지 가격표와 함께 제공됩니다.
• Standard tier — 입력 토큰 100만 개당 $1.25, 캐시 적중 시 100만 개당 $0.15, 출력 100만 개당 $4.25. 1.1과 동일하며, 1센트까지 같습니다. 요청 한도는 분당 약 3,000건입니다. Web-search grounding은 별도로 청구되며, 쿼리 1,000건당 $2.50입니다.
• 컨트리뷰터 등급 — 입력 $0.10, 캐시 입력 $0.002, 출력 $0.20. 이는 입력 기준 12.5배, 출력 기준 21.25배 더 저렴한 가격입니다. 입장 조건은 Meta가 여러분의 트래픽을 사용해 향후 모델을 학습시키도록 허용하는 것이며, 분당 60회 요청 한도(표준 예산의 2%)입니다.
가격이 $0.10 및 $0.20이라면, Muse Spark 1.2는 가격 면에서 오히려 지는 오픈웨이트(open-weight) 예산 등급을 포함해 시중의 거의 모든 프런티어 인접(frontier-adjacent) 모델보다 저렴해집니다. 이것이 이번 출시에서 주목할 만한 숫자이며, 이는 사실상 가격 결정이 아닙니다. 분당 60회 요청이라는 제약만으로도 대부분의 프로덕션 팬아웃(fan-out) 패턴이 배제되므로, 이 등급은 서빙보다는 실험과 소규모 팀 작업을 겨냥한 것입니다. 그리고 '귀하의 트래픽으로 학습할 수 있습니다'라는 조건은 모델을 고르는 사람이 아니라 조직의 데이터 거버넌스(data governance)를 승인하는 사람이 결정할 문제입니다. 더 저렴한 SKU가 아니라 할인이 붙은 법무 검토로 간주하십시오.
54를 생산하는 데 드는 비용

Artificial Analysis는 자체 평가 실행 비용을 공개하며, 그 열에서 Muse Spark 1.2의 실체가 드러난다. 9개 벤치마크 스위트를 완주하는 데 $637.85와 9,500만 개의 출력 토큰이 소모되었고, Muse Spark 1.1은 동일한 토큰당 가격으로 $548.07와 9,400만 개였다. 추가된 16%는 순전히 숙고의 비용이다.
지연 시간 수치도 같은 방식으로 움직입니다. xhigh에서 측정했을 때, 첫 토큰까지의 시간은 1.1의 2.90초에 비해 1.2는 26.12초이고, 출력 속도는 초당 213.5토큰에서 165.0토큰으로 떨어집니다. Meta는 추론 시간을 들여 지수 포인트 3점을 샀으며, 필수 추론 설계상 그 구매를 거절할 수 없습니다 — 오직 그중 얼마를 만들어낼지만 선택할 수 있을 뿐입니다.
그 26초라는 수치는 잘못 인용될 것이므로 미리 정정해 둔다. 이는 모델이 노출하는 가장 고비용 effort 수준에서 측정한 값이며, API의 기본값은 medium이다. 벤치마크 하네스가 아닌 실제 트래픽에서의 기준점으로서, OrcaRouter를 통해 서빙되는 Muse Spark 1.1은 — 호출자가 실제로 요청하는 effort가 무엇이든 — 7일간의 첫 토큰 도달 시간 p50이 1.84초, p95가 6.00초이며, 초당 519토큰과 0% 오류율을 보여준다. 최대 effort에서의 벤치마크 지연 시간과 기본 effort에서의 프로덕션 지연 시간은 서로 다른 수치이며, 대개 한 자릿수(10배) 이상 차이 난다. 26.12초는 딥 리즈닝(deep reasoning)의 상한선으로 읽어야지, 요청이 실제로 체감하는 시간으로 읽어서는 안 된다.
오늘 그것을 호출할 수 있는 곳
Muse Spark 1.2는 Meta 자체 Model API를 통해서만 서비스되며, 현재 글을 쓰는 시점에는 다른 어디에서도 제공되지 않는다. 아직 Hugging Face 저장소도 없고 OrcaRouter 카탈로그에도 없다. 8월 10일 발표가 바로 이것을 바꾸려는 것이다: Meta는 가중치가 '몇 주 안에' 공개될 것이라고 말하며, 일단 공개되면 이용 가능성에 대한 질문은 '어디서 서비스되나?'에서 '어떤 가중치, 어떤 라이선스, 어떤 런타임에서?'로 옮겨갈 것이다. Muse Spark 1.1은 OrcaRouter 카탈로그에 있으며 가격은 $1.25와 $4.25이다. 이는 Meta가 부과하는 것과 동일한 수치인데, OrcaRouter는 마크업 0%를 적용하고 제공업체의 공시 가격을 그대로 통과시키기 때문이다.
그것은 모델 자체보다는 비교에 더 중요한 요소입니다. 이번 릴리스의 비용 모델을 구축한다면 비교 대상이 될 모델들 — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — 은 모두 단일 키로 정가에 제공되므로, 스프레드시트의 숫자가 곧 청구서의 숫자이고, 공급업체의 가격 인하도 갱신 후가 아닌 당일에 반영됩니다. Muse Spark 1.2만 놓고 보면, 현재의 답은 Meta의 엔드포인트, 두 번째 계약, 별도의 청구서이며, 가중치가 공개되면 자체 호스팅 설치가 세 번째 옵션이 됩니다.
8월 10일에 무엇이 바뀌었나요?
출시 5일 만에 Meta는 자사 플래그십에 대한 입장을 뒤집었다. 8월 10일자 발표에서 Meta는 Muse Spark 1.2의 가중치를 '향후 몇 주 내에' 공개하겠다고 밝혔으며, 이는 팀이 직접 실행할 수 있는 최초의 Muse Spark 릴리스가 될 것이다. 이 성명은 임원급 발표일 뿐 아직 실제 배포된 것은 아니다. Hugging Face 저장소는 아직 없으며, 정확한 날짜, 파라미터 수, 라이선스 모두 확인되지 않았다.
이번 판의 핵심은 프런티어 웨이트 경쟁이다. Muse Spark 1.2는 Artificial Analysis Intelligence Index에서 54점을 기록했는데, 이는 현재 다운로드 가능한 모든 미국 오픈 웨이트 모델보다 높은 점수다. 따라서 가중치가 약속대로 공개된다면 중국 연구소들에 맞서는 가장 강력한 미국의 오픈 웨이트 경쟁자가 될 것이다. 이는 Zuckerberg가 8월 10일 6,500단어에 달하는 에세이에서 길게 주장한 프레이밍으로, 미국의 학습 데이터 규제가 오픈 웨이트 주도권을 외국 연구소에 넘겨주고 있다고 비난한 내용이다. 이 방향 전환에는 이미 첫 번째 결과물이 있다. 같은 날 Apache 2.0 라이선스로 공개된 300억 파라미터 모델인 Muse Glimmer는 Muse Spark에서 증류되었으며, 로컬 에이전트 워크로드용으로 제작됐다. Meta 자체 벤치마크에 따르면 에이전트 작업에서 Google의 Gemma4-31B와 Qwen3.6-27B보다 앞서지만, 해당 수치는 공급업체가 측정한 것으로 아직 재현되지 않았다.
발표가 답하지 못한 점
• 독립적인 코딩 수치는 없습니다. Artificial Analysis는 1.2에 대한 종합 점수를 발표했지만, 1.1에 대해 발표했던 코딩 및 에이전틱 하위 지수(각각 71.3과 37.5)는 아직 발표하지 않았습니다. 에이전틱 작업이 1.1의 가장 약한 부분이었고, 에이전틱 코딩이 바로 1.2가 수정했다고 주장하는 부분이므로, 이 숫자가 이번 릴리스의 평가를 결정지을 수 있습니다.
• 하네스 결과의 재현이 없습니다. 발표문의 모든 코딩 수치는 Meta-run입니다. 아직 아무도 중립적 스캐폴드에서 Muse Spark 1.2 점수를 발표하지 않았습니다.
• 멀티모달 검증 없음.Muse Spark 목록은 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 지원한다고 명시합니다. 독립 평가는 텍스트와 이미지를 다룹니다. Meta의 1.2 메시징은 거의 전적으로 소프트웨어 작업으로 전환되었으며, 명시적으로 판매된 혼합 미디어 사용 사례 1.1은 현재 마케팅이나 측정이 뒷받침되지 않습니다.
• 처리량 기록이 없습니다.일반적인 롤링 지연 시간 통계가 생성되기에는 엔드포인트의 볼륨이 여전히 너무 낮습니다.
앞으로 4주 동안 시청할 것
네 가지가 이번 릴리스가 메타가 말하는 그대로인지를 결정할 것이다. 첫째는 1.2에 대한 독립적인 에이전틱 점수다. 1.1에서 37.5였던 하위 지수가 크게 움직였다면 코딩 프레임은 실재하는 것이다. 둘째는 누군가 Muse Code 외부에서 Terminal-Bench 결과를 재현하는지 여부다. 자체 하네스 안에서만 작동하는 모델은 역량이 아니라 제품일 뿐이다. 셋째는 기여자 등급에 어떤 일이 일어나는가다. 60회 요청 상한이 풀린다면, 입력 $0.10/출력 $0.20의 프런티어 인접 모델은 예산 등급의 산술을 3포인트 지수 상승으로는 절대 불가능한 방식으로 바꾼다. 넷째는 가중치 약속이다. 메타는 Muse Spark 1.2의 가중치가 '향후 몇 주 내' 공개된다고 말한다. 그 저장소가 그 일정 안에 도착하는지, 어떤 라이선스로, 로컬 런타임이 얼마나 빨리 이를 채택하는지가 오픈 가중치 전환이 실재하는지 여부를 결정할 것이다.
그리고 그 주기가 유지된다면, Muse Spark 1.3은 9월 초에 출시될 예정입니다. 이 증거로 볼 때, 그것이 출시될 때 주목해야 할 숫자는 인덱스 점수가 아닙니다. 주목해야 할 것은 메타가 모든 요청 앞에 20초의 사고 시간을 추가하지 않고도 기능을 추가할 수 있는지 여부입니다. 그 전환의 첫 번째 결실은 이미 나와 있습니다: 메타가 8월 10일에 Apache 2.0 라이선스로 공개한 300억 파라미터의 오픈 웨이트 모델인 Muse Glimmer는 에이전트를 로컬에서 실행하도록 설계되었으며, 오픈 Muse Spark 1.2가 어떤 모습일지에 대한 지금까지 가장 가까운 미리보기입니다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
