Muse Spark 1.2 and Muse Code-1
Guides & Insights

Muse Spark 1.2와 Muse Code: Meta의 4개월 만의 세 번째 모델, Grok 4.5와 타이를 이룬다

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Meta가 출시한 Muse Spark 1.2는 2026년 8월 5일에, Muse Spark 1.1이 나온 지 4주 후이자 첫 Muse Spark 이후 약 4개월 후에 나왔다. 이번 버전에는 이전 두 버전에는 없던 것이 포함되어 있었다: Meta 자체의 코딩 에이전트인, Muse Code가 베타로 제공되었고, 이것이 실행되는 모델과 함께 공동 훈련되었다. 그리고 Meta와 경쟁사 모두가 통제할 수 없는 하나의 스코어보드에서, 이번 출시는 Meta를 SpaceXAI와 동률로 만들었다 — Muse Spark 1.2와 Grok 4.5는 이제 Artificial Analysis Intelligence Index에서 모두 54점을 기록했다.

아래 수치들이 어떤 의미를 갖기 전에, 먼저 구분해 두어야 할 두 가지가 있다. Intelligence Index 점수, 지연 시간 수치, 토큰 수는 Artificial Analysis에서 나온 것으로, 이 기관이 자체 평가를 실행하고 비용을 공개한다. 즉, 이는 독립적인 결과다. Meta가 발표를 시작할 때 내세운 코딩 결과물들 — Terminal-Bench 2.1, DeepSWE v1.1, 그리고 내부 벤치마크 — 은 Meta가 자체 하네스에서 실행했으며, 각 경쟁 모델은 자체 에이전트 제품과 짝을 이루었다. 두 종류의 수치 모두 유용하다. 그러나 이들은 같은 종류의 증거가 아니며, 이 글에서는 이를 구분하여 다룬다.

메타가 실제로 출시한 것

Muse Spark 1.2 and Muse Code-2

메타의 AI 연구 블로그에 게시된 8월 5일자 발표는 두 가지 제품을 동시에 다루고 있습니다.

Muse Spark 1.2 — Muse Spark 제품군의 코딩 중심 업데이트. 메타는 코딩 작업에 대한 학습 컴퓨팅을 확대하고 학습 환경의 다양성을 넓히면서, 1.1 릴리스가 내세웠던 일반 에이전트 능력은 유지했다고 밝혔다. 명시된 학습 목표는 장기 지향적(long-horizon)이다: 전체 저장소 생성, 대규모 엔드투엔드 프로젝트, 그리고 메타가 오토리서치라고 부르는 것으로, 작업 순서를 계획하는 플래닝, 여러 단계에 걸쳐 방향을 유지하기 위한 목표 조건화, 세션이 길어질 때 관련 상태를 유지하기 위한 컨텍스트 압축을 포함한다.

Muse Code — 베타 버전의 터미널 코딩 에이전트로, Meta의 개발자 도메인에서 한 줄 셸 스크립트로 설치할 수 있습니다. 세션을 넘어 유지되는 영구 비동기 백그라운드 에이전트를 실행하며, Meta가 replay-exact 및 restart-safe라고 설명하는 로컬 이벤트 로그 런타임에서 작동합니다. 또한 격리된 작업 트리에서 작업당 여러 하위 에이전트를 조정합니다. 세 가지 번들 스킬을 제공합니다: /plan 승인 게이트 방식의 계획 수립용, /grill 이미 완료된 작업을 스트레스 테스트하는 용도, 그리고 /goal 작업을 완료로 이끄는 용도입니다.

이 결합은 우연이 아닙니다. 메타는 이 둘이 공동 훈련되었다고 말합니다 — 모델은 하네스에서 얻은 거부 샘플링된 궤적으로 미세 조정되었고, 목표, 압축, 서브에이전트에 대한 레시피 최적화가 적용되었습니다. 이는 Claude Code와 Codex를 만들어낸 것과 동일한 공동 훈련 방식이며, 벤치마크 수치를 읽는 이에게 중요한 함의를 갖습니다: 모델의 대표적인 코딩 점수는 모델이 훈련된 바로 그 하네스 안에서 생성되었습니다. 그것은 부정행위가 아니라, 지금 에이전트 평가가 작동하는 방식입니다. 다만 이는 다른 스캐폴드를 통해 얻은 1.2 점수가 안전한 가정이라기보다는 미해결 문제라는 것을 의미합니다.

나머지 사양은 1.1과 동일하며, 1.1 자체도 정보 제공용입니다. 컨텍스트는 1,048,576토큰으로 유지됩니다. 추론은 다섯 가지 노력 수준(최소, 낮음, 중간, 높음, 최고)에서 필수로 유지되며, 기본값은 중간입니다. 약간의 숙고 없이 가중치를 얻을 수 있는 구성은 없습니다. 가중치는 비공개이며 Hugging Face 저장소도 없고, Meta 자체 Model API만이 이를 호출할 수 있는 유일한 퍼스트파티 장소입니다.

43, 그 다음 51, 그 다음 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis는 xhigh 추론 설정에서 자사 Intelligence Index에서 Muse Spark 1.2를 54점으로 평가해, 클래스 중앙값 32를 기준으로 185개 모델 중 13위로 선정했습니다. 이 지수는 에이전트, 코딩, 일반 역량, 과학적 추론에 걸쳐 균등하게 배분된 9가지 평가(GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR)의 가중 복합 지수입니다.

스냅샷이 아니라 연속된 흐름으로 읽으면, Meta의 궤적이 실제 이야기다. 원래 Muse Spark는 4월에 43점을 기록했다. Muse Spark 1.1은 7월 9일에 51점에 도달, 한 분기 만에 8포인트 상승이다. Muse Spark 1.2는 한 달도 안 되어 3포인트를 더 추가했다. Meta는 4개월 만에 11포인트를 움직였으며, 평가 생태계가 따라잡을 수 있는 속도보다 더 빠르게 출시되고 있다. 1.2에 대한 공개된 벤치마크별 세부 결과는 아직 없고, Design Arena 기록도 전혀 없다. 반면 1.1은 두 가지 모두 갖추고 있다.

54점으로 메타는 그록 4.5와 동률이며, 그록 4.5는 SpaceXAI가 뮤즈 스파크 1.1보다 하루 앞서 출시한 모델이다. 메타는 타이트한 최전선 그룹인 클로드 오퍼스 5(61점), 클로드 페이블 5(60점), GPT-5.6 솔(59점) 뒤에 있다. 최고점과의 격차는 6~7포인트다. 메타가 연초에 시작한 지점과의 격차는 11포인트다. 그 격차가 좁혀질지는 출시 주기가 유지되는지에 달려 있으며, 현재 메타는 4주 배포 주기를 따르고 있다.

하지만 복합 지수에서의 동률은 업무에서의 동률이 아닙니다. 54가 무엇을 결정하고 무엇을 결정하지 않는지 말할 가치가 있습니다. 54는 Muse Spark 1.2가 총체적 역량에 있어 Grok 4.5와 같은 논의 대상에 속한다는 것을 결정합니다. 그것은 어느 쪽이 더 나은 패치를 작성하는지 알려주지 않습니다. 왜냐하면 그 질문에 답할 코딩 하위 지수가 1.2에 대해 아직 발표되지 않았기 때문입니다.

Meta의 코딩 숫자를 주의 깊게 읽으세요.

메타의 발표는 세 개의 차트에서 선두를 차지한다. 자체 실행에서는 pass@1로 보고되며, 5회 시도에 걸쳐 각 경쟁 모델이 자체 에이전트 제품과 짝을 이루었다:

Terminal-Bench 2.1 — Muse Spark 1.2가 1.1의 76.2%에서 82.9%로 상승했습니다. Claude Opus 5가 86.7%로 앞서 있습니다.

DeepSWE v1.1 — 59.3%, 53.0%에서 상승.

Meta의 내부 코딩 벤치마크 — 70.6%, 68.3%에서 상승.

델타 값이 신뢰할 만한 부분이다. 한 달 간격으로 같은 팀이 같은 하네스에서 같은 방식으로 측정한 Terminal-Bench 6.7포인트, DeepSWE 6.3포인트 상승은 Meta가 최적화하고 있던 부분에서 1.2가 1.1보다 얼마나 개선되었는지를 합리적으로 보여준다. 교차 벤더 순위는 가볍게 받아들여야 할 부분이다. 하네스 조합은 큰 자유 변수이고, 자체 모델과 함께 자체 하네스를 튜닝하는 연구소가 다른 모든 업체의 하네스를 동등하게 튜닝할 수 있는 입장은 아니기 때문이다. Meta는 자체 슬라이드에서 2위였는데, 이는 적어도 벤더 벤치마크의 전형적인 형태는 아니다. 하지만 이 글을 쓰는 시점까지 어떤 제3자도 이를 재현하지 못했다.

두 번째 가격표

이번 릴리스에서 가장 중요한 점은 벤치마크 차트에 있지 않습니다. Muse Spark 1.2는 두 가지 가격표와 함께 제공됩니다.

Standard tier — 입력 토큰 100만 개당 $1.25, 캐시 적중 시 100만 개당 $0.15, 출력 100만 개당 $4.25. 1.1과 동일하며, 1센트까지 같습니다. 요청 한도는 분당 약 3,000건입니다. Web-search grounding은 별도로 청구되며, 쿼리 1,000건당 $2.50입니다.

컨트리뷰터 등급 — 입력 $0.10, 캐시 입력 $0.002, 출력 $0.20. 이는 입력 기준 12.5배, 출력 기준 21.25배 더 저렴한 가격입니다. 입장 조건은 Meta가 여러분의 트래픽을 사용해 향후 모델을 학습시키도록 허용하는 것이며, 분당 60회 요청 한도(표준 예산의 2%)입니다.

가격이 $0.10 및 $0.20이라면, Muse Spark 1.2는 가격 면에서 오히려 지는 오픈웨이트(open-weight) 예산 등급을 포함해 시중의 거의 모든 프런티어 인접(frontier-adjacent) 모델보다 저렴해집니다. 이것이 이번 출시에서 주목할 만한 숫자이며, 이는 사실상 가격 결정이 아닙니다. 분당 60회 요청이라는 제약만으로도 대부분의 프로덕션 팬아웃(fan-out) 패턴이 배제되므로, 이 등급은 서빙보다는 실험과 소규모 팀 작업을 겨냥한 것입니다. 그리고 '귀하의 트래픽으로 학습할 수 있습니다'라는 조건은 모델을 고르는 사람이 아니라 조직의 데이터 거버넌스(data governance)를 승인하는 사람이 결정할 문제입니다. 더 저렴한 SKU가 아니라 할인이 붙은 법무 검토로 간주하십시오.

54를 생산하는 데 드는 비용

Muse Spark 1.2 and Muse Code-4

Artificial Analysis는 자체 평가 실행 비용을 공개하며, 그 열에서 Muse Spark 1.2의 실체가 드러난다. 9개 벤치마크 스위트를 완주하는 데 $637.85와 9,500만 개의 출력 토큰이 소모되었고, Muse Spark 1.1은 동일한 토큰당 가격으로 $548.07와 9,400만 개였다. 추가된 16%는 순전히 숙고의 비용이다.

지연 시간 수치도 같은 방식으로 움직입니다. xhigh에서 측정했을 때, 첫 토큰까지의 시간은 1.1의 2.90초에 비해 1.2는 26.12초이고, 출력 속도는 초당 213.5토큰에서 165.0토큰으로 떨어집니다. Meta는 추론 시간을 들여 지수 포인트 3점을 샀으며, 필수 추론 설계상 그 구매를 거절할 수 없습니다 — 오직 그중 얼마를 만들어낼지만 선택할 수 있을 뿐입니다.

그 26초라는 수치는 잘못 인용될 것이므로 미리 정정해 둔다. 이는 모델이 노출하는 가장 고비용 effort 수준에서 측정한 값이며, API의 기본값은 medium이다. 벤치마크 하네스가 아닌 실제 트래픽에서의 기준점으로서, OrcaRouter를 통해 서빙되는 Muse Spark 1.1은 — 호출자가 실제로 요청하는 effort가 무엇이든 — 7일간의 첫 토큰 도달 시간 p50이 1.84초, p95가 6.00초이며, 초당 519토큰과 0% 오류율을 보여준다. 최대 effort에서의 벤치마크 지연 시간과 기본 effort에서의 프로덕션 지연 시간은 서로 다른 수치이며, 대개 한 자릿수(10배) 이상 차이 난다. 26.12초는 딥 리즈닝(deep reasoning)의 상한선으로 읽어야지, 요청이 실제로 체감하는 시간으로 읽어서는 안 된다.

오늘 그것을 호출할 수 있는 곳

Muse Spark 1.2는 Meta의 자체 Model API를 통해 제공되며, 현재 시점 기준으로 다른 곳에서는 제공되지 않습니다. 출시 당시 OpenRouter에서 라우팅되지 않았고, Hugging Face 저장소도 없으며, OrcaRouter 카탈로그에도 포함되어 있지 않습니다. Muse Spark 1.1은 $1.25와 $4.25에 제공되는데, 이는 Meta가 청구하는 가격과 동일합니다. OrcaRouter는 마크업을 0% 적용하고 제공업체의 정가를 그대로 전달하기 때문입니다.

그것은 모델 자체보다 비교에 더 중요합니다. 만약 이번 릴리스에 대한 비용 모델을 구축하고 있다면, 비교 대상이 될 모델들 — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — 은 단일 키로 정가에 제공되므로, 스프레드시트의 수치가 인보이스의 수치와 같고, 공급업체의 가격 인하는 갱신 후가 아니라 당일에 반영됩니다. 특히 Muse Spark 1.2의 경우, 현재 답은 Meta의 엔드포인트, 두 번째 계약, 그리고 별도의 청구서입니다.

발표가 답하지 못한 점

독립적인 코딩 수치는 없습니다. Artificial Analysis는 1.2에 대한 종합 점수를 발표했지만, 1.1에 대해 발표했던 코딩 및 에이전틱 하위 지수(각각 71.3과 37.5)는 아직 발표하지 않았습니다. 에이전틱 작업이 1.1의 가장 약한 부분이었고, 에이전틱 코딩이 바로 1.2가 수정했다고 주장하는 부분이므로, 이 숫자가 이번 릴리스의 평가를 결정지을 수 있습니다.

하네스 결과의 재현이 없습니다. 발표문의 모든 코딩 수치는 Meta-run입니다. 아직 아무도 중립적 스캐폴드에서 Muse Spark 1.2 점수를 발표하지 않았습니다.

멀티모달 검증 없음.Muse Spark 목록은 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 지원한다고 명시합니다. 독립 평가는 텍스트와 이미지를 다룹니다. Meta의 1.2 메시징은 거의 전적으로 소프트웨어 작업으로 전환되었으며, 명시적으로 판매된 혼합 미디어 사용 사례 1.1은 현재 마케팅이나 측정이 뒷받침되지 않습니다.

처리량 기록이 없습니다.일반적인 롤링 지연 시간 통계가 생성되기에는 엔드포인트의 볼륨이 여전히 너무 낮습니다.

앞으로 4주 동안 시청할 것

이번 릴리스가 메타가 말하는 그 제품인지 여부를 결정할 세 가지가 있다. 첫째는 1.2에 대한 독립적인 에이전트 점수다. 1.1에서 37.5였던 하위 지수가 크게 움직였다면, 코딩 주장은 진짜다. 둘째는 누군가 Muse Code 외부에서 Terminal-Bench 결과를 재현하는지다. 자체 하네스 안에서만 성능을 내는 모델은 제품이지 역량이 아니다. 셋째는 기여자 등급에 어떤 일이 벌어지느냐다. 60회 요청 상한이 풀리면, 입력 $0.10, 출력 $0.20인 프런티어 인접 모델이 예산 등급의 계산 방식을 3점 지수 상승으로는 결코 불가능한 방식으로 바꾼다.

그리고 그 주기가 유지된다면, Muse Spark 1.3은 9월 초에 출시될 예정입니다. 이 정황을 볼 때, 출시時に 주목해야 할 수치는 인덱스 점수가 아닙니다. 핵심은 Meta가 모든 요청 앞에 20초의 사고 시간을 추가하지 않으면서도 기능을 더할 수 있는지 여부입니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube