
Muse Code: 메타, 자체 벤치마크에서도 지는 코딩 에이전트를 출시했다
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 191 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
Vendors do not usually publish the chart where they come second. Meta published three of them. In the launch deck for Muse Code — the terminal coding agent Meta Superintelligence Labs released on August 5, 2026, running on the same-day Muse Spark 1.2 — Claude Opus 5 is ahead on every board Meta chose to show, including the one Meta built and controls itself. On Terminal-Bench 2.1 the gap is 3.8 points. On DeepSWE 1.1 it is 5.7, with GPT-5.6 Terra also ahead. On Meta's own internal coding benchmark it is 8.8. The viral version of this launch — "59% on DeepSWE 1.1, outperforming Grok 4.5 and Gemini 3.6 Flash" — is true, and it is the narrowest true statement available.
그 덕분에 이번 출시는 덜 흥미로운 것이 아니라 더 흥미로워진다. Meta는 자기가 이기지 못하는 벤치마크 덱을 출시했고, 그럼에도 출시했다. 그들이 파는 것은 점수가 아니기 때문이다. 그들이 파는 것은 24시간 작업을 견디는 런타임과, Meta가 당신의 저장소를 읽는 것을 허용하는 한, 경쟁 제품보다 한 자릿수 이상 저렴한 가격이다. 아래의 모든 벤치마크 수치는 방법론 없이 공개된 Meta 자체 차트에서 나온 것이며, 독립적인 측정이 존재하는 경우 그 문장에 그렇게 명시되어 있다.
메타가 실제로 출시한 것
같은 날에 두 가지 일이, 의도적으로 함께 묶여 있다.
• Muse Code는 터미널 코딩 에이전트이며, 공개 베타 버전으로, 한 줄로 설치할 수 있습니다: curl -fsSL https://dev.meta.ai/install.sh | bash. macOS와 Linux에서만 사용할 수 있으며, 네이티브 Windows 빌드가 없고, GUI나 IDE 확장 기능도 없습니다. Meta는 이 도구의 역할을 대규모 리포지토리에 걸친 복잡한 소프트웨어 엔지니어링을 맡는 것 — 변경 계획, 코드 작성, 결과 검증 — 이라고 설명합니다.
• Muse Spark 1.2 — 코딩에 초점을 맞춘 Meta 추론 모델의 개정판으로, 1,048,576 토큰 컨텍스트를 제공하며 Muse Code 내부 및 Meta Model API를 통해 공개 미리보기로 이용할 수 있습니다. Meta는 코딩 작업에 대한 훈련 계산량을 늘리고 훈련 환경의 다양성을 확장했다고 밝혔습니다. 목표는 장기적 작업, 즉 전체 리포지토리 생성, 다중 파일 리팩터링, 확장 디버깅입니다.
결합이 곧 주장이다. Meta는 두 요소가 공동 훈련되었으며, 따라서 그 결합이 "외부 모델을 감싸는 일반적인 래퍼보다 더 나은 도구 사용, 더 적은 재시도, 더 높은 품질의 출력"을 만들어낸다고 밝힌다. 그것은 Meta의 표현이자 Meta의 주장이다. 어떤 제3자도 경쟁 하네스 안에서 이 모델을 테스트하여 공동 훈련 프리미엄이 진짜인지, 아니면 Muse Spark 1.2가 어디에 놓이든 단순히 유능한 코딩 모델처럼 행동하는 것인지 확인하지 않았다.
에이전트에는 세 가지 번들 스킬이 포함되어 있으며, 이 스킬들은 마케팅 문구보다 의도된 작업 방식을 더 잘 설명합니다: /plan은(는) 아무것도 작성되기 전에 승인 게이트가 적용된 계획을 생성하고, /grill은(는) 그 계획을 스트레스 테스트하며, /goal은(는) 명시된 목표 달성을 추진합니다. 계획하고, 계획을 공격하고, 실행하라 — 이것은 숙련된 Claude Code 및 Codex 사용자들이 수동으로 수렴한 패턴이며, 이제 일급 명령으로 제공됩니다.
벤치마크 덱, 정직하게 읽기

Meta는 Terminal-Bench 2.1, DeepSWE 1.1, 자체 Meta Internal Coding Bench 및 GDPval에 대한 비교 결과를 발표했습니다. Meta가 보고한 수치는 다음과 같습니다:
• Terminal-Bench 2.1 — Claude Code에서의 Claude Opus 5(최대 노력) 86.7%, Muse Code에서의 Muse Spark 1.2 82.9%, Codex에서의 GPT-5.6 Terra 81.8%, Grok Build에서의 Grok 4.5 81.6%. 2위이며, 2위에서 4위까지는 1.3포인트 차이입니다.
• DeepSWE 1.1 — Claude Opus 5 65.0%, GPT-5.6 Terra 64.8%, Muse Spark 1.2 59.3%. 3위이며, 격차가 피상적이지 않고 결정적인 유일한 리더보드입니다.
• Meta Internal Coding Bench — Claude Opus 5 79.4%, Muse Spark 1.2 70.6%. Meta의 안방 대회이자 Meta의 가장 큰 패배.
• 세대를 거듭할수록 — Meta는 Muse Spark 1.1 대비 Terminal-Bench에서 +6.7포인트, DeepSWE에서 +6.3포인트를 보고합니다. 이는 이 자료에서 가장 큰 수치이며, Muse Spark 1.1 사용자가 실제로 주목해야 할 수치입니다.
하나의 산술적 걸림돌은 언급할 가치가 있다. 왜냐하면 그것이 위의 모든 것을 방향성으로 취급해야 하는 이유이기 때문이다. Meta의 +6.7을 제외하면 Muse Spark 1.1은 Terminal-Bench 2.1에서 약 76%에 도달한다. 하지만 공개 tbench.ai 리더보드는 7월 말 이후로 Muse Spark 1.1에 대해 검증된 80.0%를 유지해 왔다. 두 숫자 모두 정직할 수 있고 여전히 일치하지 않을 수 있다. Terminal-Bench 행은 모델 점수가 아니기 때문이다. 그것은 하네스와 모델, 노력 설정이 결합된 점수이며, 1.1에 대한 Meta의 내부 하네스는 tbench가 실행한 것이 아니었다. 그 단일 사실 하나가 개별적으로 논쟁되는 어떤 수치보다도 벤더 간 벤치마크 비교에 더 큰 타격을 주며, 다음 섹션으로 직접 이어진다.
런타임은 제품입니다.

점수를 빼면 남는 것은 죽지 않겠다는 엔지니어링적 제안이다. 두 가지 메커니즘이 이를 뒷받침한다.
{{1}}첫 번째는 이벤트 로그입니다.{{/1}} Muse Code는 {{2}}모든 모델 호출, 모든 도구 실행, 모든 승인, 모든 편집{{/2}}을 로컬 로그에 추가하며, Meta는 이를 통해 세션이 {{3}}재생 시 정확히 일치하고 재시작에도 안전하다{{/3}}고 설명합니다. {{4}}프로세스를 종료하든, 충돌이 나든, 머신을 잃어버리든{{/4}}, 에이전트는 중단된 지점에서 정확히 재개하며 처음부터 맥락을 {{5}}다시 유도하지{{/5}} 않습니다. 경쟁사들도 품질이 각기 다른 {{6}}충돌 복구 기능{{/6}}을 갖추고 있지만, 그 어떤 업체도 이를 핵심 기능으로 내세우지는 않았습니다. 이는 부수적으로 {{7}}감사 아티팩트{{/7}}이기도 합니다 — 자율 프로세스가 작업 트리에 수행한 작업의 완전한 로컬 기록으로, 보안 검토에서 요구하는 바로 그 문서이며 대부분의 에이전트 CLI가 생성하지 못하는 것입니다.
두 번째는 메타가 비동기 백그라운드 에이전트라고 부르는 것입니다. 일반적인 하위 에이전트와의 차이점은 하위 작업마다 생성되었다가 제거되는 것이 아니라 세션 내내 유지되면서 다음 단계를 스스로 수행하고 메인 루프에 보고할 시점을 스스로 결정한다는 점입니다. 이로 인한 이점은 지연 시간이 낮아진다는 것입니다. 오케스트레이터가 위임할 때마다 초기화 비용을 지불하지 않기 때문입니다.
메타의 뒷받침 증거는 하나의 사례 연구입니다: Muse Code가 24시간 동안 1,000회 이상의 도구 호출을 통해 NVIDIA Hopper 하드웨어에서 GPU 커널을 자율적으로 최적화했으며, 메타는 제공된 기준 구현 대비 상당한 개선이 있었다고 밝혔습니다. 속도 향상 수치는 공개되지 않았으므로, 흥미로운 수치는 결과가 아니라 지속 시간입니다. 인간의 구조 없이 이루어진 1,000번의 도구 호출은 50번의 호출로 끝나는 리팩터링과는 다른 실패 양상을 보여주며, 이는 3.8포인트의 벤치마크 격차보다 프로세스가 9시간째에도 살아 있는지가 훨씬 더 중요한 작업 부하입니다.
가격이 무기다 — 그리고 그 대가의 일부는 소스 코드로 지불된다
뮤즈 코드 구독은 없습니다. 결제는 토큰 방식이며, 두 등급 중 하나로 이루어집니다. 그리고 두 등급 간의 차이는 이번 출시에서 가장 공격적인 부분입니다:
• Standard — 입력 토큰 100만 개당 $1.25, 캐시된 입력 100만 개당 $0.15, 출력 100만 개당 $4.25. 이 티어의 프롬프트는 Meta 제품 개선에 사용되지 않습니다.
• 기여자 — 백만 입력당 $0.10, 백만 캐시 입력당 $0.002, 백만 출력당 $0.20. 그 대가로 Meta는 모델 개선을 위해 이 데이터를 사용할 수 있습니다.
이는 입력에서 12.5배, 출력에서 21배, 캐시된 입력에서 75배 더 저렴합니다. 현실적인 에이전트 단계에 적용해 보면 — 저장소 컨텍스트 60,000 토큰을 입력하고 3,000 토큰의 플랜 및 패치를 출력 — 가격 그리드의 네 모서리가 놀랍습니다. 콜드 프롬프트를 사용하는 스탠다드 티어: 단계당 8.8센트, 1,000단계당 $87.75. 저장소 컨텍스트가 캐시에 적중하는 스탠다드 티어: 단계당 2.2센트, 1,000단계당 $21.75. 콜드 상태의 컨트리뷰터 티어: 단계당 0.66센트, 1,000단계당 $6.60. 워밍 캐시를 사용하는 컨트리뷰터 티어: 동일한 1,000단계에 $0.72.
같은 작업이 두 가지 선택에 따라 122배의 비용 또는 122분의 1의 비용이 든다. 메타 자체의 24시간, 1,000콜 커널 실행은 데이터를 보호하는 티어에서 약 90달러의 토큰 비용이 들지만, 그렇지 않은 티어에서는 1달러 미만이다.
이번 출시가 팀들 앞에 놓는 실제 결정은 가격 결정이 아니다. 터미널 코딩 에이전트는 코드베이스를 읽는다 — 그것이 에이전트의 전부다 — 따라서 기여자 티어의 프롬프트에는 소스 코드, 내부 API, 우회 조치가 존재하는 이유에 대한 주석, 그리고 저장소에 들어 있는 테스트 픽스처가 모두 포함된다. 사이드 프로젝트나 오픈소스 트리의 경우 기여자 티어는 거의 공짜 돈에 가깝다. 독점 코드베이스나 고객 데이터에 접근할 수 있는 저장소의 경우, 이는 할인이라는 옷을 입은 라이선싱 결정이며, 클라우드 비용을 관리하는 사람이 아니라 데이터 처리를 승인하는 사람 앞에 놓여야 한다. 메타는 데이터가 메타에게 최소한 그만한 가치가 있기 때문에 12배 할인으로 가격을 책정했다.
API를 통해 얻을 수 없는 것

82.9%는 Muse Spark 1.2에 속합니다 Muse Code 안에서. 자체 에이전트 프레임워크에서 모델을 호출한다면, 당신은 그 조합의 모델 절반만 구매했고 하네스 절반은 전혀 구매하지 않은 것입니다 — 이벤트 로그도, 상주 백그라운드 에이전트도, 그리고 메타의 공동 훈련 주장이 무슨 의미가 있다면, 미세 조정된 도구 사용 동작도 전혀 없습니다. 그러므로 여기에는 두 가지 별개의 평가가 있으며, 이 둘을 혼동하는 것이 이번 주에 저지르기 가장 쉬운 실수입니다: Muse Code가 현재 실행 중인 에이전트보다 우수한지, 그리고 Muse Spark 1.2가 현재 호출하는 모델보다 더 나은 모델인지.
두 번째 질문은 답하는 데 더 적은 비용이 드는데, 하네스(harness)를 그대로 유지한 채 그 아래의 모델만 교체하면 되기 때문입니다. 가용성에 대해 정확히 말씀드리자면, Muse Spark 1.2는 Meta에서 직접 제공되며 OrcaRouter 카탈로그에는 포함되어 있지 않습니다. Muse Spark 1.1은 $1.25 및 $4.25로, Meta의 정가와 정확히 일치합니다. OrcaRouter가 마크업 0%를 적용하고 제공업체 가격을 그대로 전달하기 때문이며, 이것이 바로 공급업체의 가격 변경이 계약 주기가 끝난 후가 아니라 변경 당일에 저희 쪽에 반영되는 이유이기도 합니다. 1.1에 대한 저희의 7일간 프로덕션 텔레메트리(production telemetry)에 따르면 p50 첫 토큰 생성까지의 시간(TTFT)은 1.84초, p95는 6.00초로, 이는 어떤 벤치마크 하네스가 제공하는 것보다 더 유용한 지연 시간 기대치입니다.
이처럼 여러 모델을 비교해야 하는 주에 단일 게이트웨이가 갖는 실질적 가치는, 비교 대상 세트(Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash, Muse Spark 1.1)가 단일 키 뒤에 정가로 놓여 있어 A/B 테스트가 조달 작업이 아니라 문자열 변경에 불과하다는 점입니다. 또한 이는 Meta 제안의 구조적 위험을 보완합니다. Muse Spark 1.2는 공급자가 정확히 하나뿐이라 설계상 단일 장애 지점이기 때문입니다. 공급자 간 자동 장애 조치는 Meta에 장애가 발생한 날이 곧 에이전트의 장애로 이어지는지, 아니면 그렇지 않은지를 결정합니다.
이것이 또한 1.2가 조용하고 느리게 출시된 이유입니다.
뮤즈 스파크 1.2가 8월 5일 메타의 API에 등장했는데, 발표도 없고 변경된 수치도 없었다 — 동일한 1M 컨텍스트, 동일한 $1.25와 $4.25, 뮤즈 스파크 1.1과 동일한 5단계 추론 다이얼. 움직인 단 한 가지는 외부에서 측정된 것이었다: Artificial Analysis는 최대 추론 노력에서 첫 토큰까지의 시간을 1.1의 2.90초 대비 26.12초로 측정했고, 인텔리전스 인덱스에서 51에서 54로 3포인트를 얻었다. 범용 모델 릴리스로 보면, 그것은 이상한 거래다 — 3포인트를 위해 9배를 기다리는 것.
공동 학습된 에이전트의 모델 절반으로 본다면, 이는 명백한 절충이다. 열두 개 파일 리팩터링을 기다리는 사람은 26초의 계획 시간을 알아차리지 못한다. 하지만 채팅 완료를 기다리는 사람은 그 모든 시간을 알아차린다. 메타는 지연 시간을 측정하는 사람이 없기를 바라며 조용히 채팅 모델을 출시한 것이 아니었다. 메타는 자동차를 출시하기 전에 엔진을 먼저 출시한 것이고, 발표는 자동차가 나오는 시점에 이뤄졌다. 메타의 Muse Spark 개발자 페이지에도 이제 1.2라고 표시된다.
이 귀결은 이 제품군을 그 폭넓음 때문에 채택한 모든 이에게 경고가 된다. Muse Spark 1.1은 텍스트, 이미지, 비디오, 오디오, PDF를 아우르는 멀티모달 추론 모델로 판매되었으며, 혼합 매체 연구에 적합했다. 버전 1.2의 포지셔닝은 소프트웨어 작업이며, 출시 자료는 코딩 에이전트다. 멀티모달 표면은 제거되지 않았지만, 더 이상 메타가 최적화하거나 광고하는 대상이 아니다. 그리고 메타 외부에서는 1.2에 대한 비디오나 오디오 결과를 공개한 사람이 없다.
뮤즈 코드가 아직 부족한 곳
• 베타 버전이며, 그렇게 표시되어 있습니다. 이벤트 로그 보장에 대해서는 Meta 외부의 누구도 검증한 바 없습니다.
• macOS 및 Linux 전용입니다. Windows 개발자는 WSL을 쓰거나 아무것도 쓰지 못하는 실정이며, 이는 기업용 플릿에 단순한 불편함이 아니라 실제 제약 사항입니다.
• 터미널 전용.GUI도, IDE 통합도, Codex가 이미 제공하는 클라우드 호스팅 병렬 에이전트도 없습니다. Meta의 출시 자료에는 MCP 지원이 언급되어 있지 않습니다.
• 공개된 방법론이 어떤 벤치마크 차트 뒤에도 없고, 에이전트나 Muse Spark 1.2의 코딩 하위 점수에 대한 독립적인 평가도 아직 없다. Artificial Analysis는 1.2에 대한 종합 지수는 제공하지만, 1.1에 대해 공개하는 벤치마크별 코딩 및 에이전트 점수 세부 내역은 제공하지 않는다. — 1.1의 에이전트 점수는 단연 가장 약한 부문이었으며, 이 때문에 이번 릴리스를 판가름할 바로 그 수치가 된다.
• Meta는 늦었다.Claude Code와 Codex에는 1년간의 습관, 플러그인 생태계, 그리고 이들을 중심으로 구축된 팀 워크플로우가 이미 자리 잡혀 있다. 크래시로부터 안전한 이벤트 로그는 무언가를 시도해 볼 좋은 이유이지만, 그 자체만으로 팀을 옮길 이유가 되지는 못한다.
사람들이 실제로 묻고 있는 질문들
Muse Code는 무료인가요?
아니요, 하지만 구독도 없습니다. 경쟁 대상인 Claude Code 및 Codex 요금제와 달리 Muse Code는 Meta Model API를 통해 순수하게 토큰 단위로 과금됩니다. 따라서 비용은 세션이 푸시하는 저장소 컨텍스트의 양에 따라 달라지며, 인원수에 비례하지 않습니다. 이는 가끔씩 많이 사용하는 사용자에게 유리하고 항상 켜져 있는 에이전트에게는 불리합니다. 기여자 등급은 무료에 가까워서 가격이 사용해 보는 데 실제 장벽이 되지는 않습니다.
기여자 티어는 제 개인 코드를 학습에 사용하나요?
그 티어에 대한 Meta의 약관은 데이터가 자사 모델을 개선하는 데 사용될 수 있다는 것이며, 코딩 에이전트의 프롬프트에는 여러분의 코드가 포함됩니다. Meta는 표준 티어 프롬프트가 자사 제품을 개선하는 데 사용되지 않는다고 명시합니다. 그것이 독점적인 모든 것에 사용해야 할 티어입니다. 이 선택을 결제 선호도가 아니라 할인이 붙은 데이터 처리 결정으로 취급하세요. 그리고 할인은 토큰당 적용되므로, 조용히 다운그레이드하려는 유인은 사용량이 늘어나는 만큼 정확히 커진다는 점을 유의하세요.
Muse Spark 1.2를 Claude Code 또는 자체 에이전트와 함께 사용할 수 있나요?
이 모델은 Muse Code와 독립적으로 Meta Model API를 통해 사용할 수 있으므로, 사용자 지정 엔드포인트를 허용하는 모든 곳에서 사용 가능합니다. 다만, Meta가 벤치마크 결과에 대해 인정하는 공동 학습 페어링은 제공되지 않으며, 솔직히 기대할 수 있는 것은 튜닝 시 사용된 하네스 밖에서 실행되는 모델은 차트에 표시된 수치보다 낮은 점수를 받는다는 점입니다. 목표가 에이전트가 아닌 모델 자체를 평가하는 것이라면, 자체 하네스에서 Claude Opus 5 및 GPT-5.6 Terra와 비교 실행하고 프레젠테이션 자료는 완전히 무시하세요.
이번 주에 누가 그것을 설치해야 하나요?
장기 자율 작업을 실행한다면 — 마이그레이션, 모노레포 전반의 의존성 업그레이드, 에이전트가 맥락을 잃어서 지금은 직접 지켜봐야 하는 모든 작업 — Muse Code는 스크래치 클론에서 오후 한나절을 투자할 가치가 있다. 이벤트 로그와 지속적인 백그라운드 에이전트는 정확히 그 실패 모드를 겨냥하며, 벤치마크 격차는 작업 시간이 가장 길 때 가장 작다.
만약 오픈소스 또는 민감하지 않은 코드베이스에서 작업 중이고 비용이 제약 조건이라면, 컨트리뷰터 티어는 현재 코딩 에이전트 시장에서 가장 흥미로운 수치이며, 스텝당 0.66센트는 오타가 아닙니다.
팀이 독점 저장소를 대상으로 Claude Code나 Codex를 사용하고 있다면, 아직 여기서 움직여야 할 이유는 없습니다. Muse Code는 자체 공급업체가 선정한 모든 보드에서 2위나 3위에 그치고, 표준 티어 가격은 업계보다 낮지 않고 동등하며, 차별화 요소는 Meta 외에는 아무도 테스트하지 않은 신뢰성 속성입니다. 주목해야 할 것은 다음 벤치마크가 아닙니다. 그것은 Meta에서 일하지 않는 누군가가 수천 번의 도구 호출을 실행했을 때 이벤트 로그가 유지되는지 여부입니다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
