
Muse Spark 1.2 대 Muse Spark 1.1: 업그레이드해야 할까요?
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
Meta의 대체는Muse Spark 1.1을로Muse Spark 1.22026년 8월 5일에 가격, 컨텍스트 창, 모달리티 목록, 지원 매개변수 또는 추론 다이얼을 변경하지 않은 채 하는 것이었다. 따라서 그 마이그레이션은 무료처럼 보인다 — 같은 모델 문자열 패밀리, 같은 청구, 재협상할 것이 없다. 그러나 그것은 무료가 아니다. 독립적인 측정에 따르면 새 버전의 첫 토큰까지의 시간은 이전 버전의 2.90초에 비해 26.12초이며, 지속 출력은 초당 213.5개에 비해 165개이다. 당신은 아무것도 돌아오기 전까지 약 9배의 대기를 감수하면서 측정된 지능의 3포인트를 사는 셈이다.
그것을 할 가치가 있는지는 거의 전적으로 작업이 얼마나 오래 실행되는지에 달려 있습니다. 실제로 무엇이 다른지, 무엇이 동일하게 유지되었는지, 그리고 아직 아무도 알려줄 수 없는 것이 여기 있습니다.
네 줄로 된 결정
• 지능 지수: 51 → 54, 각 버전의 xhigh 설정에서 Artificial Analysis가 독립적으로 측정했습니다.
• 첫 토큰까지의 시간: 2.90s → 26.12s, 동일한 소스, 동일한 조건.
• 동일한 벤치마크 스위트 실행 비용: $548.07 → $637.85, 동일한 토큰당 가격 기준으로. 추가 16%는 순전히 토큰 소모입니다.
• 조달 양식이 묻는 모든 것: 변경 없음

진정으로 동일한 것은 무엇인가?
이것은 열거할 가치가 있다. 그것이 마이그레이션이 서류상으로는 사소해 보이는 이유이며, 존재하지 않는 차이는 테스트할 필요가 없는 차이이기 때문이다.
• 가격 — 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $4.25, 캐시 적중 시 100만 개당 $0.15, 내장 웹 검색 1,000회당 $2.50입니다. 이 모든 수치는 두 버전에서 동일합니다.
• 컨텍스트 — 양쪽 모두 1,048,576개의 토큰을 지원하며, 어느 쪽에도 긴 컨텍스트 추가 요금 등급이 없습니다.
• 모달리티 — 텍스트, 이미지, 비디오, 오디오, PDF 입력, 텍스트 출력. 두 목록 모두 동일한 다섯 가지 입력 유형을 명시합니다.
• 추론 다이얼 — 두 버전 모두 필수이며, 다섯 단계(최소, 낮음, 중간, 높음, 매우 높음)가 있습니다. 두 버전 모두 기본값은 중간입니다. 어느 버전에도 추론을 끄는 설정은 없습니다.
• 매개변수 — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. 동일한 목록.
• 서빙 — 양쪽 모두 하나의 제공자, 바로 메타(Meta) 자체입니다. 제3자 호스트도, 양자화 변형도 없습니다.
• 혼합 가격 — Artificial Analysis는 혼합 가중치 기준으로 두 모델 모두 백만 토큰당 $0.78로 책정하는데, 이는 동일한 요금표에서 기대할 수 있는 결과입니다.
업그레이드에 더 많은 컨텍스트, 완료 길이 보장, 또는 더 저렴한 캐시가 포함되기를 바랐다면, 그런 것은 없습니다. 이는 이전 버전에서 복사해 붙여넣은 요금표를 갖춘 가중치 및 사후 학습 릴리스입니다.
실제로 움직인 것은 무엇인가
Artificial Analysis는 현재 두 버전을 모두 평가한 유일한 독립 기관이며, 두 버전 모두 최고 수준의 추론 노력으로 평가했기 때문에 이 비교는 동등한 조건에서 이루어진 것입니다.
• 지능 지수 — 1.1에서는 51(185개 중 #22위), 1.2에서는 54(#13위)입니다. 클래스 중앙값이 32인 보드에서 9계단 차이는, 단순한 소수점 차이가 아니라 실질적인 순위 향상을 가져옵니다.
• 첫 토큰까지의 시간 — 2.90초에서 26.12초까지. 이는 가장 주목할 만한 성능 저하이며, 결코 미미한 수준이 아닙니다.
• 출력 속도 — 초당 213.5~165.0토큰입니다. 여전히 185개 중 16위를 차지하고 있으며, Artificial Analysis는 여전히 이를 "눈에 띄게 빠름"이라고 설명하지만, 교체되는 모델보다 23% 느립니다.
• 장황함 — 인덱스를 통과하는 데 94M 출력 토큰이 소요되었으며, 95M에 비해 사실상 변화가 없습니다. 둘 다 65M 중앙값보다 약 45% 높습니다.
• 총 평가 지출 — $548.07~$637.85. 출력 상세도는 거의 변하지 않았고 가격은 전혀 변하지 않았으므로, 그 16% 증가는 눈에 보이는 출력이 아닌 다른 곳, 즉 더 긴 내부 추론 트레이스, 더 많은 재시도, 또는 태스크당 더 많은 도구 호출에서 비롯된 것입니다.
패턴은 일관적입니다. 메타는 모델을 더 저렴하게, 더 빠르게, 더 크게 만들지 않았습니다. 확정하기 전에 모델이 더 오래 숙고하도록 만들었을 뿐이며, 그 추가적인 숙고는 지연 시간으로, 약간 더 느린 스트리밍으로, 그리고 동일한 작업에 대해 16% 더 높은 비용 청구서로 드러납니다. 그 대가로 얻은 것은 지수 3포인트입니다.
지연 시간이 정말 얼마나 나쁜지
26.12초라는 수치는 문맥에서 벗어나 인용될 것이므로 올바르게 처리해야 합니다. 즉, 측정된 값은 xhigh, 다섯 가지 노력 수준 중 가장 비싼 것으로, 어렵게 설계된 벤치마크 스위트에서 측정되었습니다. API의 기본값은 medium.
기본 설정이 실제로 어떤 느낌인지 가늠해 보면, OrcaRouter에서 실행되는 Muse Spark 1.1은 — 요청된 노력 수준이 무엇이든 실제 호출자에게 서비스하면서 — 롤링 주간 기준 첫 토큰까지의 시간 p50 1.84초, p95 6.00초를 보여줍니다. 이는 프로덕션 노력 수준에서의 프로덕션 데이터이며, 벤치마크 수치보다 한 자릿수 이상 낮습니다. 버전 1.2에는 아직 프로덕션 텔레메트리가 없습니다.

그러므로 정확한 해석은 "1.2는 응답하는 데 26초가 걸린다"는 것이 아닙니다. 그것은 다음과 같습니다: 1.2가 추가 점수 3점을 얻는 설정에서 첫 번째 토큰은 26초가 걸리고, 같은 설정에서 이전 모델은 3초가 걸렸습니다. 이미 xhigh로 실행하고 있었다면 — 그것은 바로 지능 향상이 있는 구성입니다 — 그것이 당신이 물려받는 수치입니다. 만약 medium 또는 그 이하로 실행한다면, 훨씬 더 짧은 시간을 보게 될 것이고, 또한 향상도 덜 보게 될 것입니다.
그 결합이 이 업그레이드의 진짜 함정입니다. 숙고 없이는 지능을 얻을 수 없습니다. 지능은 바로 그 숙고에서 비롯되기 때문입니다.
숫자 뒤에 숨은 재배치
Meta는 1.2에 대한 출시 포스트를 게시하지 않았다 — Muse Spark 발표 페이지는 여전히 1.1을 설명하고 있다 — 그러나 제품 설명을 다시 작성했으며, 그 재작성이 트레이드오프를 설명한다.
Muse Spark 1.1은 비정상적으로 넓은 입력 표면을 갖춘 멀티모달 추론 모델로 판매되었으며, "멀티모달 에이전트, 혼합 미디어에 대한 심층 연구, 장기 컨텍스트 분석"을 겨냥했습니다: 긴 보고서, 미디어 라이브러리, 녹음 파일, 그리고 텍스트와 함께하는 비디오까지.
Muse Spark 1.2의 설명은 이러한 내용의 대부분을 생략하고 대신 소프트웨어 엔지니어링을 명시합니다 — 다중 파일 리팩토링, 확장된 디버깅 세션, 전체 저장소 생성 — 그리고 명시적인 다중 에이전트 주장을 추가합니다: 이 모델은 컨텍스트를 수집하고 계획하며 위임하는 기본 에이전트로 작동하거나, 그 아래에서 병렬로 실행되는 하위 에이전트로 작동할 수 있습니다. 또한 프롬프트 캐싱을 통해 호출 간에 반복되는 컨텍스트의 양에 따라 실질적 비용을 60~80% 절감할 수 있다고 주장합니다. 마지막 수치는 측정된 결과라기보다는 Meta의 추정치이지만, $0.15 캐시 요금을 고려하면 산술적으로 신뢰할 수 있습니다.
그 재배치에 대한 지연 시간 회귀를 읽어 보면 그것은 더 이상 실수처럼 보이지 않는다. 열두 개의 파일을 리팩터링하는 사람은 26초의 계획 시간을 신경 쓰지 않는다. 메타는 고객을 선택했으며, 그 고객은 1.1이 판매된 대상이 아니다.
{{1}}1.1{{/1}}에는 아직 있지만 {{2}}1.2{{/2}}에는 없는 것
4주간의 존재만으로는 실적을 쌓기에 충분하지 않으며, 세 가지 구체적인 측면에서 구형 모델이 현재 더 잘 문서화된 제품입니다.
• 아레나 기록.Muse Spark 1.1은 상당한 Design Arena 이력이 있습니다: 게임 개발 부문 5위에 1334 Elo, UI 컴포넌트 부문 7위에 1334, ASCII 아트 부문 3위에 1320, 데이터 시각화에서 1318, 일반 코드 카테고리에서 1309를 기록했으며, 웹 앱, HTML 슬라이드, Godot 게임 개발을 아우르는 전체 agents-arena 래더도 갖추고 있습니다. Muse Spark 1.2는 항목이 전혀 없습니다. Meta가 현재 가장 집중적으로 마케팅하는 축에서, 새 모델에 대한 맞대결 데이터는 전무합니다.
• 하위 지수 점수.Artificial Analysis는 1.1에 대해 코딩 지수 71.3과 에이전틱 지수 37.5를 게시합니다. 1.2에 대한 공개된 대응 지수는 없습니다. 에이전틱 점수는 1.1의 가장 약한 측면이었고 그 차이가 컸으며, 에이전틱 능력은 바로 1.2가 개선한다고 주장하는 부분이기 때문에, 이 숫자가 업그레이드 여부를 결정지을 것입니다. 하지만 그 숫자는 아직 존재하지 않습니다.
• 프로덕션 텔레메트리.1.1은 일주일치 실제 p50 및 p95 지연 시간과 OrcaRouter의 4.4M 토큰 실시간 트래픽을 보유하고 있습니다. 1.2는 둘 다 없습니다. 트래픽 양이 너무 적어 샘플링할 수 없으므로 1.2의 엔드포인트는 현재 지연 시간이나 처리량 통계를 전혀 보고하지 않습니다.
• 메타 외에 대여할 수 있는 곳. Muse Spark 1.1은 OrcaRouter 카탈로그에 $1.25 및 $4.25로 등록되어 있습니다 — 이는 Meta 자체 정가를 0% 마크업으로 그대로 적용한 가격입니다. Muse Spark 1.2는 아직 카탈로그에 없으므로, 현재는 단일 공급자를 통한 직접 Meta 통합이며 장애 조치 경로가 없습니다.

이 중 어느 것도 1.2가 더 나쁘다는 의미가 아닙니다. 이는 1.2에 대한 증거가 한 평가자의 단일 종합 점수로 구성된 반면, 1.1에 대한 증거는 한 달간의 아레나, 하위 지표, 실시간 트래픽으로 구성되어 있음을 뜻합니다. 그 비대칭성은 마이그레이션을 어떻게 단계적으로 진행할지에 영향을 미쳐야 하지, 시도할지 여부에 영향을 미쳐서는 안 됩니다.
실제로 짧은 마이그레이션 체크리스트
요금 카드와 매개변수 표면이 동일하기 때문에, 스왑은 모델 문자열 변경일 뿐입니다. 실제 작업은 변경된 세 가지를 검증하는 데 있습니다.
• 자신의 effort 설정에서 첫 토큰까지의 시간을 직접 측정하세요. 2.90초나 26.12초 수치를 받아들이지 마세요. 실제 프롬프트를 실제로 전달하는 reasoning_effort 값으로 실행하고 직접 비교하세요. 이것이 마이그레이션을 완전히 무산시킬 수 있는 유일한 수치입니다.
• 타임아웃 및 스트리밍 구성을 확인하세요. high effort 수준에서 첫 토큰 지연 시간이 9배 증가하면 1.1에 맞춰 조정된 클라이언트 타임아웃을 위반하게 되고, 모든 비스트리밍 통합이 응답 없음(hang)처럼 보이게 됩니다.
• 비용은 요금표가 아닌 측정된 토큰 수로 재계산하세요. 가격은 동일하므로 비용 변화는 전적으로 사용 행동에 따른 것입니다. Artificial Analysis는 동일한 작업에 대해 지출이 16% 증가하는 것을 확인했습니다; 이것이 나타나는지 여부는 작업 구성에 따라 다릅니다.
• 캐시 키 안정성을 먼저 검증하세요. 안정적인 60,000토큰 접두사를 사용하면 두 버전 모두에서 일반적인 에이전트 단계 비용이 약 8.8센트에서 약 2.2센트로 떨어집니다. 이 75%의 변동 폭은 버전 변경으로 인한 영향보다 더 크며, 전적으로 여러분이 통제할 수 있습니다.
• 오디오 및 비디오 경로를 명시적으로 다시 테스트하십시오. 두 목록 모두 동일한 다섯 가지 입력 방식을 광고하지만, Artificial Analysis의 1.2 사양 카드에는 평가된 입력 방식으로 텍스트와 이미지만 기록되어 있습니다. Meta는 혼합 미디어 작업을 강조하지 않는 방향으로 홍보 문구를 다시 작성했습니다. 독립적인 누구도 해당 기능이 유지되는지 확인하지 않았습니다.
• 폴백으로 1.1에 계속 접근할 수 있게 유지하세요. 둘 다 하나의 키로 운영하면 롤백이 장애가 아닌 구성 변경이 되며, 벤치마크를 두고 논쟁하는 대신 실제 트래픽에서 둘을 A/B 테스트할 수 있습니다.
누가 지금 움직이고, 누가 기다리는가
지금 이동하세요 높은 추론 강도로 장기 실행 코딩 에이전트를 운영한다면 말이죠. 작업은 이미 수 분이 걸리므로 지연 시간 패널티는 그 시간에 묻혀 버리고, 지능 향상은 Meta가 주장하는 것이 아니라 제3자가 측정하며, 인덱스 3포인트는 이 등급에서 의미 있는 도약입니다 — 185개 모델 보드에서 9계단 상승입니다.
잠깐 제공하는 것이 무엇이든 인터랙티브하다면, 1.2가 1.1보다 반응성이 더 좋은 구성은 존재하지 않습니다. 그리고 필수 추론은 생각 비활성화로 반응성을 되살릴 수 없음을 의미합니다. 버전 1.1은 모든 노력 수준에서 여전히 더 빠른 모델이며 비용도 정확히 동일합니다.
잠깐,만약 당신의 작업 부하가 혼합 미디어 분석 — 1.1이 명시적으로 구축되고 마케팅된 긴 보고서, 비디오 및 오디오 사용 사례 — 이라면. Meta는 더 이상 그것을 광고하지 않으며, 1.2에 대한 유일한 독립 평가는 텍스트와 이미지를 다룹니다. 그 기능은 온전할 가능성이 높지만, 어느 쪽으로든 증거가 없을 뿐이며, 1.1에는 한 달치의 증거가 있습니다.
잠깐 아레나 데이터가 필요하다면. Design Arena 항목도 없고 게시된 에이전틱 하위 지표도 없이 전체 리포지토리 생성에 기반해 판매되는 모델은, Meta가 변경한 사항에 대해 Meta의 말을 곧이곧대로 믿으라고 요구하는 셈입니다. 3~4주만 기다리면 더 이상 그렇지 않을 것입니다. 그 시점이 되면 단일 종합 수치보다는 증거에 기반해 이 결정을 훨씬 더 쉽게 내릴 수 있습니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
