
Muse Spark 1.3 Contributor vs Muse Spark 1.2: 데이터 공유 신규 버전 vs 지난달의 정가 플래그십
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658지능72코딩
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianQwen3.8 27B2026-08-1552지능68코딩
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
팀이 8월에 Muse Spark 1.2로 표준을 정했다면, 9월에 출시된 Muse Spark 1.3 Contributor는 난처한 질문을 던진다. 코딩 에이전트를 토큰 100만 개당 입력 $0.10, 출력 $0.20인 최신 체크포인트로 옮길 것인가, 아니면 이미 통합했고 자체 코드베이스에 대해 벤치마킹을 마쳤으며 토큰 100만 개당 $1.25와 $4.25를 지불하고 있는 Muse Spark 1.2에 계속 머무를 것인가? 난처한 점은 이 비교가 단순한 신구(新舊) 비교가 아니라는 데 있다. Muse Spark 1.3 Contributor는 새로운 Muse Spark 1.3 체크포인트의 데이터 공유 SKU이며, Muse Spark 1.2 대비 가격 우위의 대부분은 가중치가 아니라 계약 조건에서 비롯된다. 이 모델로 프롬프트와 완성 결과를 전송하면 Meta가 이를 자사 모델 훈련에 사용할 수 있다. 따라서 이 결정은 좀처럼 함께 제기되지 않는 두 가지 질문으로 나뉜다. 즉, 1.3 체크포인트가 여러분의 작업에 1.2보다 실질적으로 더 나은지, 그리고 데이터 조항과 Contributor 등급의 운영상 제한이 약 20배 더 저렴한 토큰 비용을 위해 기꺼이 감수할 만한 거래인지 하는 것이다.
각 측이 실제로 무엇인지
Muse Spark 1.2는 8월 5일 Meta의 터미널 코딩 에이전트인 Muse Code와 함께 출시되어, 해당 제품군 최초의 코딩 전용 릴리스가 되었습니다. 이 모델은 텍스트, 이미지, 비디오, 오디오, PDF를 입력받고 텍스트를 출력하는 폐쇄형 가중치 멀티모달 추론 모델로, 1,048,576토큰 컨텍스트 창과 131,072토큰 출력 상한을 갖추고 있습니다. 표준 형태의 가격은 입력 토큰 100만 개당 $1.25, 캐시된 토큰은 $0.15, 출력 토큰 100만 개당 $4.25이며, 사용자 데이터에 대한 Meta의 권리를 부여하는 조항은 없습니다. 또한 이 버전은 타사 플랫폼이 실제로 라우팅하는 제품군의 버전이기도 한데, Meta가 함께 출시한 Contributor SKU는 처음부터 자체 약관을 가진 별도의 상품이었기 때문입니다.
Muse Spark 1.3 Contributor는 Meta가 9월 2일에 공개한 동일한 1.3 체크포인트로, Contributor 계약 조건(입력 $0.10, 캐시된 입력 $0.002, 출력 $0.20)을 따르며, 훈련 데이터 권리를 제공하는 대신 훨씬 더 엄격한 속도 제한 범위가 적용됩니다. 그 외의 모든 것(컨텍스트 창, 입력 양식, 출력 상한, 비공개 가중치)은 표준 버전 및 이전 1.2 세대와 동일합니다. 따라서 이 비교의 두 모델은 세대(1.2 vs 1.3 가중치)와 등급(표준 조건 vs Contributor 조건)이라는 두 개의 독립적인 축에서 차이가 나며, 이 두 축을 분리하는 것이 핵심입니다.
점수판
• 릴리스 — Muse Spark 1.2: 2026년 8월 5일. Muse Spark 1.3 Contributor: 2026년 9월 2일.
• Context / output — identical: 1,048,576 tokens in, 131,072 out.
• 입력 — 동일: 텍스트, 이미지, 비디오, 오디오, PDF; 출력은 텍스트만.
• 가격 — Muse Spark 1.2 표준: 입력 $1.25, 출력 $4.25, 캐시 $0.15. Muse Spark 1.3 기여자: 입력 $0.10, 출력 $0.20, 캐시 $0.002.
• 데이터 사용 — Muse Spark 1.2 standard: 없음. Muse Spark 1.3 Contributor: 프롬프트 및 완성 결과물이 Meta 모델 학습에 사용될 수 있습니다.
• 속도 제한 — Muse Spark 1.2 표준: 분당 요청 3,000건, 분당 토큰 4M. 기여자 프로그램: 분당 요청 60건, 분당 토큰 2.1M.
• 가용성 — Muse Spark 1.2 standard는 서드파티 라우팅 플랫폼에서 제공되는 제품군 구성원이며, Muse Spark 1.3 Contributor는 Meta 자체 API와 Meta가 해당 등급을 위해 계약한 플랫폼에서 제공됩니다.

메타의 말에 따르면 새 체크포인트가 바꾸는 것
메타의 출시 자료는 코딩 에이전트를 정의하는 벤치마크에서 1.2 대비 큰 도약을 주장한다. Terminal-Bench 2.1에서 1.3은 88.8로, 메타가 1.2에 대해 보고한 82.9와 대비되며, 메타는 1.3 점수가 전체 최고 기록과 동률이라고 언급한다. 장기 과제 저장소 벤치마크인 DeepSWE v1.1에서는 1.3이 75.4로, 메타는 이를 최고 수준(state-of-the-art)이라고 부른다. 효율성: 메타 엔지니어들은 동일한 엔지니어링 워크플로에서 1.3이 도구 호출을 약 20%, 토큰을 약 25% 줄인다고 보고한다. 비용 비교에서 가장 조용히 중요한 수치다. 이 모든 수치는 공급업체가 보고한 것이며, 9월 3일 기준으로 독립적으로 재현된 것은 하나도 없다. 이용 가능한 유일한 독립 기준점은 1.2 자체인데, Artificial Analysis는 Terminal-Bench 2.1에서 약 80.1로 측정하고 Intelligence Index 57로 평가한다. 이는 메타가 해당 모델에 대해 제시한 82.9보다 약간 낮은 수치로, 공급업체의 평가와 제3자 테스트 환경 사이의 일반적인 격차를 상기시켜 주는 유용한 사례다. 초기 커뮤니티 반응은 1.3이 1.2를 크게 능가할 것이라는 데 회의적이다. 따라서 업그레이드가 크다고 단정하기 전에 기다려야 할 가장 중요한 것은 독립적인 재실행 결과다.

계약이 더 큰 변수입니다.
잠시 25% 더 적은 토큰이라는 주장이 대략 맞고 1.3이 1.2만큼은 최소한 유능하다고 가정해 보자. 나머지 차이는 계약상의 문제이며 양방향으로 작용한다. Contributor 등급의 분당 60회 요청 상한은 표준 SKU의 3,000회보다 50배나 낮은 수준이다. 대화형 에이전트와 엔지니어 한 명에게는 충분하지만, 병렬 평가, 배치 스윕, 또는 많은 요청을 분산하는 공유 게이트웨이를 운영하는 팀에게는 실질적인 제약이 된다. Contributor 이용 가능 지역 제한도 기본값으로 채택하기 전에 확인해야 할 또 다른 운영상의 사실이다. 그리고 데이터 조항은 이 둘 위에 겹쳐진다. Muse Spark 1.3 Contributor를 통해 전송되는 모든 저장소 컨텍스트, 실패한 테스트 로그, 프롬프트는 Meta가 학습에 사용할 수 있는 자료가 된다. 독자 개발자나 독점 코드베이스가 없는 스타트업에게는 20배 할인을 받을 수 있는 대가로 종종 수용 가능한 조건이다. 클라이언트 NDA 아래 코드를 출시하는 팀이나, 그 자체가 핵심 경쟁력인 무언가를 구축하는 팀에게는 그 조항이 아무리 비용을 절감해 주더라도 일반적으로 탈락 사유가 된다.
월간 계산
한 팀이 월 3,000개의 에이전트 작업을 실행하는데, 작업 하나가 Muse Spark 1.2에서 컨텍스트 입력 토큰 200,000개와 추론 및 도구 호출 출력 토큰 40,000개를 소모한다고 가정해 보겠습니다. 1.2 표준 가격 기준으로 작업당 $0.42입니다. $1.25 × 0.2에 $4.25 × 0.04를 더한 값이며, 월 약 $1,260에 해당합니다. 동일한 워크로드를 Muse Spark 1.3 Contributor로 옮기고 Meta가 주장하는 25% 토큰 절감을 적용하면 작업당 소비량이 입력 150,000개, 출력 30,000개로 줄어듭니다. 즉 $0.10 × 0.15에 $0.20 × 0.03을 더해 작업당 약 $0.02, 월 대략 $63입니다. 이는 동일한 논리적 워크로드에서 20배의 비용 차이이며, 이것이 Contributor SKU의 상업적 근거의 전부입니다. 상쇄 요인은 모델 품질이 아닙니다. 품질은 비슷하거나 오히려 더 나아 보입니다. 핵심은 워크로드가 Contributor 요율 범위 안에 들어가는지, 그리고 실제로 이 서비스를 통해 전송하는 데이터에 대해 학습 데이터 조항이 수용 가능한지입니다. 이 두 가지가 일부 팀에게 정가인 Muse Spark 1.2가 여전히 합리적인 선택지로 남는 유일한 이유입니다.
각각에 접근하기, 솔직히
오늘날 실제로 실용적인 비대칭성이 존재합니다. Muse Spark 1.2 standard는 제3자 플랫폼이 라우팅하는 이 제품군의 구성원입니다. OrcaRouter에서는 Meta의 공식 가격으로, 토큰 100만 개당 입력 $1.25, 출력 $4.25, 마크업 0%, API 키 하나, 최소 사용량 없음, 그리고 상위 제공업체가 혼잡할 경우 자동 장애 조치가 적용된 상태로 운영됩니다. Muse Spark 1.3 Contributor는 아직 당사가 라우팅하지 않습니다. 이 모델은 Meta 자체 API와 Meta가 해당 등급에 대해 계약한 플랫폼에만 있습니다. 즉, 두 모델을 나란히 A/B 테스트하려는 팀은 현재 새 모델용 Meta 계정과 기존 모델용 라우팅 키가 모두 필요합니다. 이러한 분리는 시장의 특성상 일시적입니다. 라우팅 제공업체가 1.3 제품군을 추가하는 순간, 제공업체 요금이 마크업되지 않고 그대로 전달되므로 두 SKU 모두 같은 날 OrcaRouter에 공식 가격으로 표시됩니다. 그때까지 1.3 Contributor를 평가하는 가장 저렴하고 정직한 경로는 Meta 자체 API이며, 기존 1.2 통합을 유지하는 가장 저렴한 방법은 이미 보유한 키입니다.

세 팀, 세 가지 답변
이 결정은 세 가지 경우로 깔끔하게 나뉜다. 독점 코드도 없고 폭발적인 처리량 수요도 없는 독립 개발자나 초기 단계 팀이라면 지금 Muse Spark 1.3 Contributor로 옮겨라 — 20배 절감은 실재하며 데이터 조항이 치를 대가는 미미하다. NDA 아래에서 제품을 배포하거나 코드베이스 자체가 제품인 팀은 Contributor 등급을 선택해서는 안 된다. 올바른 업그레이드는 표준 조건의 Muse Spark 1.3이며, 그동안 Muse Spark 1.2에 머무르는 것도 독립 벤치마크가 1.3의 도약을 확인할 때까지는 타당한 선택이다. 높은 요청 처리량이나 공유 게이트웨이를 가진 팀이라면 Contributor 상한선 때문에 기본 선택지로는 부적합하며, 어느 세대든 표준 SKU가 현실적인 선택이다. 즉, "1.3 Contributor vs 1.2"에 대한 답은 어느 모델이 더 나은지에 대한 문제가 아니다 — 두 세대 모두 강력하다. 문제는 할인이 당신의 요청 속도 제한과 데이터 정책과 맞닥뜨렸을 때 살아남느냐는 것이다.
