
Muse Code 대 Muse Spark 1.1: Meta의 6.7포인트 업그레이드가 실제로 측정하는 것
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 100만 토큰당 · 28 tok/s
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2770 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
먼저 뺄셈을 하세요. Meta가 2026년 8월 5일에 출시한 터미널 코딩 에이전트인 Muse Code의 출시 자료는 Terminal-Bench 2.1에서 82.9%를 기록했고, 이를 6.7포인트 향상으로 평가합니다. 비교 대상은 Muse Spark 1.1, 즉 이 글을 읽는 대부분의 사람들이 이미 비용을 지불하고 있는 모델입니다. 82.9에서 6.7을 빼면 76.2가 됩니다. 이 수치는 Meta가 발표한 숫자는 아니지만, Princeton의 mini-SWE-agent 하네스로 실행되어 공개 Terminal-Bench 2.1 리더보드에 xhigh effort로 7월에 제출된 Muse Spark 1.1의 점수와 정확히 일치합니다.
그 우연의 일치는 이 비교에서 가장 유용한 사실입니다. 왜냐하면 mini-SWE-agent는 의도적으로 최소한의 스캐폴드이기 때문입니다 — 수백 줄에 불과하고, 지속적인 하위 에이전트도 없고, 이벤트 로그도 없고, 계획 능력도 없습니다. Meta의 82.9%는 Muse Spark 1.2가 Meta가 모델을 함께 훈련시킨 맞춤형 에이전트 안에서 실행되는 것입니다. 만약 그 두 줄이 6.7포인트 차이를 나타낸다면, 헤드라인의 세대적 향상은 모델 업그레이드 와 하네스 업그레이드가 하나의 수치로 묶인 것입니다. 그리고 Meta는 그것들을 분리한 어떤 것도 발표하지 않았습니다.
메타는 자사의 1.1 베이스라인에 어떤 평가 하네스를 사용했는지 밝히지 않았으므로, 그 비교는 입증된 것이라기보다 암시적일 뿐이다. 그러나 이는 현재 API를 통해 Muse Spark 1.1을 호출하는 모든 사람 앞에 놓인 결정의 구도를 바꾼다. 이 맞대결을 솔직하게 표현하면 이렇다. 당신은 두 모델 중 하나를 선택하는 것이 아니다. 당신은 직접 구동하는 모델과 더 새로운 모델을 대신 구동해 주는 에이전트 중 하나를 선택하는 것이며, 그 둘 중 오직 하나만이 메타가 아닌 다른 누군가에 의해 측정되었다.
이것들은 같은 범주가 아니며, 사양서에도 그렇게 나와 있습니다.
이 조합에 대한 혼란의 절반은 Muse Code를 모델 릴리스로 취급하는 데서 비롯됩니다. 하지만 그렇지 않습니다. 그것은 CLI이며, 그것이 호출하는 것은 Muse Spark 1.2입니다.
• 정의 — Muse Code는 한 줄로 설치되는 터미널 에이전트입니다(curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1은 자신의 코드, 자신의 에이전트 프레임워크, 또는 커스텀 base URL을 지원하는 모든 CLI에서 호출하는 모델 엔드포인트입니다.
• 기반 모델 — Muse Code는 에이전트와 공동 학습된 Muse Spark 1.2를 실행합니다. Muse Spark 1.1은 7월 세대로, 여전히 서비스 중이며 목록에도 표시됩니다.
• 실행 환경 — Muse Code는 macOS와 Linux에서만 실행되며, 터미널에서만 동작하고, GUI나 IDE 확장 기능은 없습니다. Muse Spark 1.1은 HTTPS가 지원되는 모든 환경(Windows 포함)에서 실행됩니다.
• 입력 — Muse Code는 저장소와 프롬프트를 받습니다; Muse Spark 1.1은 단일 1,048,576-토큰 컨텍스트에서 텍스트, 이미지, 비디오, 오디오 및 PDF 문서를 입력받고 텍스트를 반환합니다.
• 상태 — Muse Code는 공개 베타이며 그와 같이 표시되어 있습니다; Muse Spark 1.1은 2026년 7월부터 일반 공개되었으며 실제 프로덕션 트래픽을 처리하고 있습니다.
• 정가 — 둘 다 Meta Model API를 통해 표준 티어 기준 입력 토큰 100만 개당 $1.25, 캐시된 입력은 $0.15, 출력은 $4.25로 청구됩니다. 요금표는 동일합니다.
마지막 줄은 사람들을 놀라게 하는 부분이며, 당연한 가정을 무너뜨립니다. Muse Code를 도입한다고 해서 이미 실행 중인 것보다 토큰당 비용이 더 들지 않습니다. 그 비용은 다른 통화로 측정됩니다 — 플랫폼 지원, 지연 시간, 모달리티, 그리고 저가 티어에서는 소스 코드입니다. 이것이 바로 논쟁할 가치가 있는 네 가지 축입니다.
그들이 갈라지는 벤치마크, 하네스를 부착한 상태로 읽음

Meta는 Muse Spark 1.1 대비 두 가지 세대 델타를 발표했다: Terminal-Bench 2.1에서 +6.7점 그리고 DeepSWE 1.1에서 +6.3점. 둘 다 벤더 보고 수치이고, 둘 다 방법론 설명 없이 이미지로 게시된 차트에서 나온 것이며, 어느 것도 제3자에 의해 재현된 적이 없습니다. 이 델타들을 제외하면 Meta가 암시하는 1.1 기준선은 대략 76.2%와 53.0%입니다.
이제 메타의 82.9%를 인용하지 않은 보드 옆에 놓아보세요. 글을 쓰는 시점에 공개된 Terminal-Bench 2.1 리더보드에는 Claude Code가 다음과 같이 짝을 이루고 있습니다: Claude Fable 5와 함께 83.8% ± 1.2%, Codex는 GPT-5.5와 함께 83.1% ± 1.1%, Terminus 2는 Claude Fable 5와 함께 80.4%, Cursor CLI는 Grok 4.5와 함께 79.3%, 그리고 mini-SWE-agent는 Muse Spark 1.1과 함께 76.2%로 8위입니다. Muse Code의 자체 보고 82.9%는 3위에 들어갈 것입니다 — Meta의 자료에 나타나지 않는 두 에이전트-모델 쌍 아래로, Meta의 자료는 대신 다음을 비교합니다: Claude Opus 5에서 86.7%, GPT-5.6 Terra에서 81.8%, 그리고 Grok 4.5는 별도의 실행에서 최대 노력으로 81.6%입니다.

두 개의 보드, 하나의 벤치마크, 서로 맞지 않는 숫자들 — 그리고 Artificial Analysis를 살펴보면 완전히 또 다른 기준이 등장합니다. 그곳의 독립적인 Terminal-Bench v2.1 평가에서는 GPT-5.6 Sol이 약 89.5%에 달하는 반면, 공개 리더보드의 최고치는 83.8%에 그칩니다. 이들 중 어느 쪽도 거짓말을 하고 있지 않습니다. Terminal-Bench의 한 행은 평가 하네스(harness)에 대한 점수에 모델, effort 설정, 컴퓨팅 허용량이 더해진 것이며, 그중 하나라도 바꾸면 결과는 Meta가 하나의 세대라고 주장하는 전체 차이보다 더 크게 움직입니다.
그래서 공개 게시판에서 주목할 만한 수치는 정확도 열이 아니라 비용 열입니다. Muse Spark 1.1은 76.2%의 실행을 완료했으며, 이에 든 비용은 $198.05입니다. Claude Code with Claude Fable 5는 83.8%의 정확도를 얻기 위해 $552.67을 지불했고, Codex with GPT-5.5는 83.1%를 위해 $2,059.19를 지불했습니다. 즉, 첫 번째 경우에는 2.8배의 비용으로 정확도 7.6포인트를 얻었고, 두 번째 경우에는 약 10배의 비용을 지불한 셈입니다. 이는 동일한 운영자가 동일한 작업과 동일한 규칙으로 측정한 결과로, Meta의 차트가 제공하지 못하는 정확한 사과 대 사과 비교입니다. 게시판은 또한 환경을 악용해 해결한 작업에 대해 감점을 적용합니다. Muse Spark 1.1의 제출에는 그러한 감점이 없지만, Cursor CLI의 Grok 4.5 실행에는 9포인트의 감점이 있습니다.
Meta는 자사의 82.9%에 대한 비용 수치를 발표하지 않았다.
Muse Code가 할 수 없는, Muse Spark 1.1이 이미 하는 것
Muse Code의 핵심 주장은 공동 훈련된 에이전트가 "외부 모델을 감싸는 일반적인 래퍼"보다 낫다는 것입니다 — 이는 Meta의 표현이자 Meta의 주장이며, 다른 누구도 검증하지 못했습니다. 그럴듯한 주장입니다. 또한 이는 Muse Spark 1.1이 특별히 메우기 위해 만들어진 격차를 겨냥하고 있습니다.
Muse Spark 1.1은 Model Context Protocol을 기본적으로 지원하며, 외부 프레임워크 없이 자체 MCP 연결을 처리하고, 메인 에이전트와 서브 에이전트 역할을 내부적으로 조율하며, 새로운 도구와 사용자 지정 스킬에 대해 제로샷 일반화를 수행합니다. 메타가 자체 공개한 출시 수치는 도구 사용 수치였습니다: MCP Atlas에서 88.1, 확장된 도구 사용에 대한 점수로 — 클로드 오퍼스 4.8에 대해 보고된 82.2와 GPT-5.5에 대한 75.3보다 앞서며 — 그리고 JobBench에서는 54.7입니다. 모두 공급업체가 보고한 수치이며, 모두 7월 기준이고, 독립적으로 재현된 것은 없습니다. 그럼에도 요점은 여전히 유효합니다: 1.1은 누군가 에이전트를 달아놓은 채팅 모델이 아닙니다. OpenCode, Cline, 또는 사용자 지정 엔드포인트를 지원하는 어떤 CLI에든 넣으면, 오늘 바로 에이전트를 갖게 됩니다.
그리고 나서 Muse Code가 구조적으로 손댈 수 없는 모든 것이 있다. Muse Spark 1.1은 하나의 컨텍스트 창에서 이미지, 비디오, 오디오 및 PDF에 대해 추론한다. 터미널 코딩 에이전트는 그런 표면에 쓸모가 없으며, 그것을 노출할 방법도 없다. 당신의 작업이 컴포넌트로 변환되는 디자인 목업이거나, 전사되고 분류되는 지원 통화이거나, 구현과 교차 참조되는 400페이지 스펙이라면, 더 새로운 것이 덜 유능한 것이다 — 그리고 메타의 1.2 세대 포지셔닝은 '혼합 미디어에 대한 다중 모달 심층 연구'에서 다중 파일 리팩터링과 전체 저장소 생성으로 옮겨갔으며, 누구도 1.2에 대한 비디오나 오디오 결과물을 공개하지 않았다.
진짜 비대칭성은 반대 방향으로 작동하며, 이는 능력(capability)이 아니라 런타임 속성이다. Muse Code는 모든 모델 호출, 도구 실행, 승인 및 편집을 로컬 이벤트 로그에 추가하며, Meta에 따르면 이로 인해 세션이 재생에 있어 정확하고 재시작에도 안전하다고 한다. 즉, 크래시가 나면 에이전트는 컨텍스트를 다시 유도하는 대신 중단된 지점에서 재개된다. 백그라운드 에이전트는 세션 전체에 걸쳐 유지되며, 하위 작업마다 생성되고 해체되지 않는다. Meta의 근거는 단일 사례 연구, 즉 NVIDIA Hopper 하드웨어에서 GPU 커널을 최적화하는 24시간, 1,000회 이상의 도구 호출 실행이다. 속도 향상 수치는 발표되지 않았으므로, 실행 시간이 곧 핵심 주장이다. 9시간짜리 마이그레이션 도중 300단계에서 하네스가 무엇을 하고 있었는지 잊어버려 작업을 잃어본 적이 있다면, 이는 정말로 원하는 기능이며, 모델에 아무리 많은 MCP 지원이 있어도 이를 제공할 수 없다.
정가는 동일하다, 두 번째 등급을 읽기 전까지는.

표준 티어가 양쪽에서 동일하므로, 이번 대결의 가격 쟁점은 전적으로 Meta가 Muse Code와 함께 도입한 티어에 달려 있습니다. 그 기여자 티어는 입력 토큰 100만 개당 $0.10, 캐시된 입력 $0.002, 출력 $0.20이며 — 입력은 12.5배, 출력은 21배, 캐시된 입력은 75배 더 저렴합니다 — 그 대가로 향후 Meta 모델을 훈련하기 위해 사용자의 프롬프트와 완성본을 사용할 수 있는 명시적 허가를 부여합니다. 표준 티어 트래픽은 Meta에 따르면 그런 식으로 사용되지 않습니다.
실제 에이전트 단계를 실행해 보면 — 저장소 컨텍스트 60,000 토큰 입력, 계획 및 패치 3,000 토큰 출력 — 1,000단계 비용은 표준 티어 콜드 기준 $87.75, 저장소 컨텍스트가 캐시에 적중하면 $21.75, 기여자 콜드 기준 $6.60, 웜 캐시가 있는 기여자 기준 $0.72입니다. 메타의 자체 24시간 커널 실행은 코드를 보호하는 티어에서는 약 90달러, 그렇지 않은 티어에서는 1달러 미만에 이릅니다.
그것은 청구 선택이 아닙니다. 코딩 에이전트의 프롬프트이란 당신의 코드베이스입니다 — 내부 API, 우회책이 존재하는 이유를 설명하는 주석, 당신의 픽스처에 우연히 포함되는 그 무엇이든. 오픈소스 트리에서 기여자 티어는 거의 공짜 돈에 가깝다. 독점 저장소에서는 그것은 할인이라는 옷을 입은 데이터 라이선스 결정이며, 클라우드 청구서를 지켜보는 사람이 아니라 데이터 처리를 승인하는 사람 앞에 놓여야 한다. 메타는 데이터가 메타에게 적어도 그만한 가치가 있기 때문에 할인을 12배로 책정했다.
Muse Spark 1.1에 머무르는 것은 문제 자체를 완전히 회피하는 것이며, 그 비용이 정확히 무엇이고 어디에서 발생하는지 알아둘 가치가 있습니다. Muse Spark 1.1은 OrcaRouter 카탈로그에 $1.25 및 $4.25로 등록되어 있으며, 이는 Meta의 정가와 1센트도 다르지 않습니다. 우리는 0% 마크업을 적용하고 제공업체 가격을 그대로 전달하기 때문이며, 이것이 Meta의 요금 변경이 계약 주기가 끝난 후가 아니라 Meta가 변경한 당일에 저희 쪽에도 반영되는 이유입니다. 이에 대한 7일간의 프로덕션 텔레메트리 데이터를 보면 p50 기준 time-to-first-token은 1.84초, p95 기준으로는 6.00초로 나타나며, 이는 어떤 벤치마크 하네스가 알려주는 것보다 훨씬 유용한 기대치입니다. Muse Spark 1.2는 저희 카탈로그에없는 모델입니다. 이 모델은 Meta에서 직접 제공되며 다른 곳에서는 제공되지 않으므로, 이 비교에서 더 새로운 쪽은 구조상 현재 공급업체가 정확히 하나뿐이고 장애 조치 경로가 없습니다. 이 모델을 평가하고 있다면, 그 단일 공급업체 노출이 바로 평가 대상의 일부입니다.
출시 보도에서 아무도 언급하지 않는 레이턴시 트레이드오프
Artificial Analysis가 각 모델의 최대 추론 노력 수준에서 독립적으로 측정한 결과, Muse Spark 1.1의 첫 토큰까지의 시간은 2.90초, Muse Spark 1.2의 경우 26.12초로 나타났습니다. 출력 속도는 초당 토큰 수가 213.5개에서 165개로 감소했습니다. 얻은 것은 Intelligence Index 3포인트(51에서 54) 상승과 185개 모델 중 #22에서 #13으로의 순위 도약이었습니다.
범용 모델 릴리스로 읽으면 나쁜 거래다 — 세 포인트를 위해 아홉 배의 대기를 감수해야 하니까. 코딩 에이전트의 엔진으로 읽으면 {{1}}분명히{{/1}} 옳은 선택이다. 열두 개 파일을 리팩터링하는 데 걸리는 시간을 기다리는 사람은 아무도 26초의 계획 시간을 알아채지 못하는 반면, {{2}}챗 완성{{/2}}을 기다리는 사람은 그 모든 지연을 알아채기 때문이다. 이것이 이 비교의 각 측이 누구를 위한 것인지에 대한 가장 명확한 진술이며, {{3}}Meta가 주장한 것이 아니라 제3자가 측정한 결과{{/3}}다.
이는 코드에만 신경 쓴다 해도 전환이 공짜가 아니라는 뜻이기도 하다. Muse Spark 1.1을 대상으로 했던 모든 대화형 기능(인라인 완성, 리뷰 봇, 문서를 겨냥한 채팅 인터페이스)은 많은 노력을 들여 1.2 세대로 옮기더라도 실질적으로 더 나빠진다. 업그레이드는 표적이 정해져 있으며, 표적을 조준한다는 것은 방향이 있다는 뜻이다.
실제로 실행해야 할 것은 어느 것인가
작업이 저장소 중심이 아니라면 Muse Spark 1.1을 계속 사용하세요. 멀티모달 파이프라인, 장문 맥락 분석, 혼합 미디어 리서치, 대화형 작업, Windows에서의 작업, 이미 MCP를 통해 연결되어 작동 중인 모든 것. Muse Code 출시는 이를 개선하는 것이 없으며, 지연 시간 측정은 그중 적어도 하나를 더 악화시킵니다.
실패 모드가 지속 시간(duration)이라면 Muse Code를 사용해 보세요. 모노레포 마이그레이션, 의존성 업그레이드, 일주일 단위 리팩터링 — 에이전트가 맥락을 놓쳐서 현재 직접 돌봐야 하는 작업들입니다. 이벤트 로그와 지속적 백그라운드 에이전트는 정확히 그런 작업을 대상으로 하며, 벤치마크 몇 점 차이는 실행 시간이 가장 긴 경우에 가장 덜 중요합니다. 베타 버전이며, 잃어도 괜찮은 저장소의 스크래치 클론에서 사용하세요.
모델을 결정하려 한다면 정직한 실험을 하세요. 하네스를 일정하게 유지한 채 그 아래에서 Muse Spark 1.1을 Muse Spark 1.2로 교체하세요. 이렇게 하면 Meta의 차트가 묶어 두는 단일 변수가 분리되며, 공동 훈련 프리미엄이 실제인지 아니면 1.2가 단순히 어디에 놓든 유능한 코딩 모델인지 알아낼 수 있는 유일한 방법입니다. 단일 게이트웨이 덕분에 이는 조달 작업이 아니라 문자열 변경에 불과합니다. Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Claude Fable 5는 모두 하나의 OrcaRouter 키 뒤에 정가로 있으며 공급업체 간 자동 장애 조치를 지원하므로 비교 세트를 유지하는 데 비용이 들지 않습니다. Muse Spark 1.2는 예외이며 Meta에서 가져와야 합니다.
무언가를 설치하기 전에 물어볼 가치가 있는 질문들
Muse Code를 Muse Spark 1.2 대신 1.1에 연결할 수 있나요?
Meta의 출시 자료는 그것을 말하지 않으며, 두 모델은 공동 학습된 쌍으로 출시되었는데, 이는 그것이 지원되거나 유용하다는 주장에 반하는 근거입니다. 반대 방향은 잘 문서화되어 있습니다: Muse Spark 1.1은 사용자 지정 엔드포인트를 수용하는 모든 에이전트에서 작동하며, 오늘날 대부분의 사람들이 이를 에이전트로 실행하는 방식입니다. 당신의 목표가 통제된 비교라면, 1.1과 1.2를 실행하십시오, 당신의하네스 안에서, Meta의 것을 억지로 바꾸려 하기보다는.
컨트리뷰터 등급은 Muse Spark 1.1에도 적용되나요?
메타는 Muse Code와 Muse Spark 1.2 출시와 함께 2계층 구조를 도입했으며, 게시된 요금표는 해당 릴리스에 기여자 가격을 연결합니다. 메타가 달리 밝힐 때까지 12배 할인은 1.2세대 제공 조건으로 간주하고, 1.1 워크로드는 $1.25와 $4.25로 책정하십시오. OrcaRouter를 사용 중이라면 정의상 정가가 적용되므로 선택하거나 해제할 데이터 공유 계층이 없습니다.
그렇다면 6.7포인트라는 주장은 틀린 건가요?
아니요 — 그것은 감사되지 않았고 사양이 불충분하며, 이는 별개의 문제입니다. Meta가 자체 1.1 베이스라인을 Muse Code와 유사한 하네스에서 실행했을 가능성도 충분하며, 그 경우 그 향상 폭은 깔끔한 모델 간 비교 결과입니다. 그러나 방법론이 공개되지 않았고, 암시된 베이스라인은 정확히 최소한의 제3자 스캐폴드 점수와 일치하며, 동일한 벤치마크도 누가 실행하느냐에 따라 세 가지 다른 척도를 산출합니다. +6.7은 방향성 지표로만 취급하고, 이를 기준으로 계획을 세우기 전에 직접 수치를 확보하십시오.
이 문제를 해결할 수 있는 방법은 무엇일까요?
하나의 제출입니다. 만약 Meta가 Muse Code를 공개 Terminal-Bench 2.1 리더보드에 다른 모든 사람들이 제출한 것과 동일한 규칙으로 올린다면 — 수정된 타임아웃이나 리소스 없이, 비용 열이 기재되고, 해킹 공제가 적용된 상태로 — 82.9%는 Muse Spark 1.1 이름 옆의 76.2% 및 최상단의 83.8%와 비교 가능해지며, 이 전체 논쟁은 오후 하나만에 해결됩니다. 그때까지 이 대결에서 독립적으로 검증된 유일한 수치는 구형 모델의 것이며, 그것은 Muse Spark 1.1이 Terminal-Bench 2.1의 4분의 3을 한 번에 읽을 수 있을 만큼 작은 스캐폴드 안에서 200달러 미만으로 해결했다는 것을 말해줍니다.
주목할 만한 두 번째 사항은 범위가 더 좁고 더 빨리 도래한다. Artificial Analysis가 1.1 세대에 대해 이미 공개하고 있는 코딩 및 에이전틱 하위 점수를 1.2 세대에 대해서도 공개할지 여부가 그것이다. 에이전틱 성능은 1.1의 공개된 지표 중 압도적으로 가장 약한 부분이었다. 이는 정확히 메타가 수정했다고 주장하는 수치이며, 동시에 메타 외부에서는 아무도 아직 측정하지 못한 수치다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
