{{1}}'Muse Spark 1.2 vs GLM-5.2 — 폐쇄형 코더 vs 개방형 제너럴리스트'{{/1}}에 대한 타이틀 카드로, {{2}}Muse Spark 1.2는 CLOSED 자물쇠 아이콘 아래에, GLM-5.2는 OPEN 상자 아이콘 아래에 표시됩니다{{/2}}.
Guides & Insights

Muse Spark 1.2 vs GLM 5.2: 폐쇄형 코더 대 개방형 제너럴리스트

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

1,000,000-토큰 컨텍스트 모델 두 개는 백만 토큰당 가격이 서로 15센트 이내이고, 둘 다 코딩 중심의 에이전트 작업을 겨냥한다 — 하지만 그 외에는 거의 공통점이 없다. Muse Spark 1.2는 2026년 8월 5일 Meta가 Muse Code라는 공동 훈련된 터미널 에이전트와 함께 출시한 모델로, 폐쇄형 가중치이고, 토큰당 가격이 더 저렴하며, 현재 Artificial Analysis Intelligence Index에서 57점을 기록하고, 추론 없이는 응답할 수 없다. GLM 5.2은 Z.ai가 6월 중순에 출시한 주력 오픈 가중치 모델로, MIT 라이선스를 보유하고, 자체 호스팅이 가능하며, 첫 토큰까지 약 5배 더 빠르고, 여전히 우리 게이트웨이를 통해 4.5배 더 많은 실제 트래픽을 처리한다 — 지난 7일 동안 2억 1,300만 토큰으로, Muse Spark 1.2의 4,600만 토큰과 비교된다. 점수가 더 높고 토큰당 가격이 더 저렴한 모델은 트래픽이 적다. 사람들이 실제로 라우팅하는 모델은 오픈 모델이다.

이 글은 그 사실의 정직한 버전에 관한 것이다. 점수와 가격보다는 모델이 파이프라인에 얼마나 잘 맞는지가 더 중요하며, 이 두 가지는 적합성을 결정하는 모든 축에서 반대되는 선택을 한다. 독립적인 수치가 있는 경우 Artificial Analysis에서 비롯되었고, Meta 또는 Z.ai에서 비롯된 경우 공급업체 보고 수치로 표시된다. 지연 시간 및 트래픽 수치는 OrcaRouter 자체의 7일간 프로덕션 텔레메트리 데이터다.

스펙 대비, 한 번에 하나의 차원씩

가격 — Muse Spark 1.2는 토큰 100만 개당 입력 $1.25 / 출력 $4.25, 캐시 적중 시 $0.15; GLM 5.2는 입력 $1.40 / 출력 $4.40, 캐시 시 $0.26. Meta는 모든 행에서 더 저렴합니다.

컨텍스트 — 둘 다 1,048,576토큰입니다. 최대 출력: Meta는 Muse Spark 1.2의 상한을 131,072토큰으로 명시합니다. GLM 5.2는 128,000을 선언합니다.

추론 — 추론은 Muse Spark 1.2에서 다섯 가지 노력 수준(최소~매우 높음, 기본값 중간)에 걸쳐 필수이며; GLM 5.2는 reasoning_effort에 의해 제어되는 하이브리드 추론을 높음 또는 최대로 수행하며, 딥 추론이 기본적으로 활성화되어 있습니다.

입력 — Muse Spark 1.2는 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 지원하고, GLM 5.2는 텍스트 입력 및 텍스트 출력만 지원합니다.

가중치 — Muse Spark 1.2는 폐쇄형으로, 저장소도 없고 자체 호스팅 경로도 없습니다. GLM 5.2는 MIT 라이선스의 오픈 가중치를 제공하며, 토큰당 약 40B가 활성화되는 753B 파라미터의 Mixture-of-Experts 모델입니다.

나이 — 이 글을 쓰는 시점에 Muse Spark 1.2는 출시된 지 3일이 되었고, GLM 5.2는 6월 13일부터 프로덕션에서 사용되어 8주간의 현장 경험과 이를 기반으로 구축된 호스트 및 도구 생태계를 갖추고 있습니다.

인덱스 갭은 4포인트입니다. 버전 함정은 실재합니다.

Artificial Analysis의 현재 Intelligence Index(v4.1.1)는 Muse Spark 1.2를 57점으로 평가하며, 185개 모델 중 12위로 집계했습니다. GLM 5.2는 53점으로 오픈 가중치 모델 중 보드에서 가장 높은 점수를 기록했지만, 4점 뒤처져 있습니다. 대부분의 보도는 여전히 Muse Spark 1.2를 54점으로 인용하는데, 이는 출시일 평가에서 보고된 수치이기 때문입니다. v4.1.1 재평가는 여기에 2.7점을 추가했으며, 이는 해당 업데이트에서 어떤 모델보다도 큰 증가 폭입니다. 어디에서 "54 vs 51" 또는 "54 vs 53"을 보더라도, 그 격차를 실제로 받아들이기 전에 각 숫자가 어느 인덱스 버전에 해당하는지 확인하세요.

네 점 차이가 무엇을 의미하고 무엇을 의미하지 않는지 짚어볼 필요가 있다. 이는 아홉 가지 벤치마크 종합 지표에서 메타의 폐쇄형 모델이 비슷한 투입으로 Z.ai의 개방형 모델보다 앞선다는 뜻이다. 이것이 Muse Spark 1.2가 모든 면에서 GLM 5.2를 이긴다는 의미는 아니다. 두 모델은 서로 다른 경로를 통해 점수에 도달하기 때문이다. GLM 5.2는 수학 및 추론 부문의 이상치다 — AIME 2026에서 99.2 — 하지만 장황하기로 유명하며, 그 약점은 대규모 저장소 단위의 심층 작업이다. Muse Spark 1.2는 반대의 형태를 띤다. 터미널 코딩 및 다중 파일 작업에 강하고, 작업당 평가 비용이 훨씬 저렴한데, 그 이유는 추론 과정에서 훨씬 적은 토큰을 소모하기 때문이다.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

벤치마크가 실제로 갈라지는 지점

Terminal-Bench 2.1에서는 두 모델 간의 차이가 인덱스 격차가 시사하는 것보다 더 작으며, 소싱이 평소보다 더 중요하다. 동일한 Artificial Analysis 하네스에서 Muse Spark 1.2는 80.1점, GLM 5.2는 77.9점을 기록했다. Meta는 자체 하네스에서 Muse Spark 1.2가 82.9점이라고 주장하며, Z.ai가 보고한 GLM 5.2의 최고 수치는 82.7로 해당 벤치마크에서 80점을 넘긴 최초의 오픈웨이트 모델이 되었다. 같은 벤치마크인데 숫자는 네 가지다. 하네스 조합에 따라 점수가 양방향으로 수 포인트씩 달라지므로, 단일 터미널 벤치마크 수치는 범위로 간주해야 한다.

주목해야 할 차이는 DeepSWE 1.1입니다. 긴 에이전트 루프에서 깊은 다중 파일, 저장소 규모의 추론을 강조하는 벤치마크죠. Meta는 Muse Spark 1.2에 대해 59.3을 보고했지만, 이는 벤더 수치일 뿐 아직 제3자가 재현한 결과는 없습니다. GLM 5.2의 공개된 DeepSWE 점수는 46.2이고, 이전 모델인 GLM-5.1은 18.0이었으므로, 이는 Z.ai가 가장 크게 개선했지만 여전히 뒤처지는 지표입니다. 워크로드가 "50개 파일을 일관성 있게 변경하는 것"이라면 그 격차가 전부입니다. 하지만 워크로드가 터미널 명령과 스캐폴딩이라면 {{1}}그 차이는{{/1}} {{2}}거의{{/2}} {{3}}체감되지{{/3}} {{4}}않습니다{{/4}}.{{5}}

뻔한 구도를 뒤집는 또 하나의 발견이 있습니다. 도메인별로 에이전트 워크로드를 실행하는 독립 평가 도구인 Vals AI 제품군은 Muse Spark 1.2를 전체 71.88%로 5위에 올렸으며, Finance Agent, TaxEval, Harvey의 Legal Agent 벤치마크에서 각각 44개, 136개, 31개 모델을 상대로 1위를 기록했습니다. 반면 Terminal-Bench 2.1은 50개 도메인 중 14번째로 좋은 성적에 그쳤습니다. Meta는 이 모델을 코더용으로 홍보했지만, 독립 평가 기관은 이 모델이 금융, 세무, 법률 문서 에이전트에서 가장 강점을 보인다고 밝혔습니다. 팀이 계약서를 작성하거나 원장을 조정하는 업무를 한다면, 이는 이 기사에서 가장 유용한 수치입니다.

오픈 가중치 문제가 진정한 갈림길이다.

위의 모든 것은 역량에 관한 것입니다. 결정은 대부분 소유권에 관한 것이며, 여기서 이 둘은 더할 나위 없이 다릅니다.

GLM 5.2는 MIT 라이선스로 배포되는 오픈 가중치 모델입니다. 그렇기에 이는 단순히 청구서만 바꾸는 것이 아니라 협상 구도를 바꿉니다. 민감한 워크로드나 높은 볼륨이 있다면 직접 호스팅할 수 있고, 가중치는 사용자의 것이므로 재통합 없이 제공업체 간에 이동할 수 있습니다. 또한 이 모델을 라우팅하는 모든 호스트는 가격과 지연 시간으로 경쟁해야 하므로, 오픈 가중치 라인은 시간이 지날수록 저렴해집니다. 753B MoE는 노트북용 모델이 아닙니다. 대부분의 팀은 직접 실행하기보다는 여전히 임대할 것입니다. 그러나 떠날 수 있는 선택지, 즉 동일한 가중치를 고정 비용으로 사내에서 실행할 수 있는 선택지는 어떤 제공업체가든 청구할 수 있는 가격의 하한선을 설정해 줍니다.

Muse Spark 1.2는 반대 번들을 택합니다. 가중치는 비공개이며, 유일한 퍼스트파티 경로는 Meta의 Model API인데, 우리는 이제 그 경로도 라우팅합니다. 그 대가로 함께 훈련된 제품을 받습니다: 모델과 함께 출시된 터미널 에이전트인 Muse Code는 리젝션 샘플링된 하네스 궤적으로 튜닝되었고, 이벤트 로그를 정확히 재생하는 런타임 위에서 지속적이고 재시작에도 안전한 서브에이전트들을 실행하며, 번들로 제공되는 /plan, /grill/goal 스킬입니다. 이는 "자체 하네스에 연결하는 좋은 모델"과는 진정으로 다른 것입니다. 도착하자마자 작동하는 에이전트라는 뜻입니다. 트레이드오프는 Meta의 방식과 Meta의 도구에서만 작동하며, macOS나 Linux에서만 가능하고, Windows 클라이언트, MCP, IDE 플러그인은 아직 없다는 것입니다.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

토큰당 가격, 작업당 가격

토큰당으로는 Muse Spark 1.2가 입력과 출력 모두에서 더 저렴하며, 작업당으로도 더 저렴한데, 그 이유는 덜 장황한 모델이기 때문입니다. Artificial Analysis는 GLM 5.2가 출시 당시 Intelligence Index를 실행하는 데만 출력 토큰 1억 4100만 개를 태웠고, 그중 95%가 추론 토큰이었다고 측정했습니다. 보드에서 가장 장황한 선두 모델입니다. Muse Spark 1.2는 같은 작업에 9500만 개를 태우면서 작업당 $0.40였습니다. 더 많은 토큰을 더 높은 비율로 사용한다는 것은 GLM 5.2의 작업당 비용이 목록 가격이 숨기는 방식으로 누적된다는 뜻이며, 이것이 추론 모델을 비교하는 올바른 방법입니다: 백만 토큰 비율이 아니라 완료된 작업에 가격을 매기는 것입니다.

이 모델들 중 하나만이 갖는 세 번째 가격이 있습니다. Muse Spark 1.2는 입력 $0.10/출력 $0.20의 기여자 티어를 제공합니다. 이는 표준 티어보다 한 자릿수 낮은 가격이며, GLM 5.2의 정가보다도 비슷한 폭으로 낮습니다. 이용 조건은 Meta가 여러분의 트래픽을 사용해 향후 모델을 훈련하도록 허용하는 것이며, 분당 60회 요청 상한이 적용되어 프로덕션 팬아웃은 불가능합니다. 더 싼 SKU가 아니라 할인이 붙은 법적 검토로 취급하세요. 자격을 갖추고 상한 안에서 작업하는 팀에게는 가격 비교가 더 이상 접전이 아니게 됩니다.

지연 시간: 두 모델이 역전된다.

인덱스 격차에서 Meta가 유리하다면, 지연 시간 프로파일은 GLM 5.2가 체감상 결정적으로 승리하는 부분입니다. 지난 7일간 OrcaRouter의 실제 트래픽에서 Muse Spark 1.2는 첫 토큰까지의 시간 p50이 8.13초, p95가 10.00초였으며, 이후 초당 576개의 출력 토큰을 빠르게 생성하면서 오류율은 0%였습니다. GLM 5.2는 p50이 1.55초로 첫 토큰 도달까지 5배 이상 빠르지만, 초당 78.5개의 출력 토큰에 그치며 오류율은 0.16%입니다. 실험실에서 최대 성능으로 테스트하면 격차는 더 벌어집니다. Artificial Analysis는 Muse Spark 1.2의 첫 토큰까지의 시간이 가장 비싼 추론 설정인 xhigh에서 26초라고 측정했습니다.

그래서 한 모델은 기다리게 만든 다음 빠르게 결과를 내놓고, 다른 모델은 즉시 시작하지만 시간이 걸립니다. 사람이 지켜보는 모든 것—채팅 턴, 대화형 터미널 세션—에서 GLM 5.2가 더 나은 느낌을 주며, 그래서 그것이 우리 게이트웨이를 통한 대화형 트래픽을 지배합니다. 긴 생성, 큰 패치 또는 문서 초안의 경우, Muse Spark 1.2는 일단 시작하면 먼저 완료됩니다. 출력 속도가 GLM 5.2의 7배이기 때문입니다. 잘못된 수치를 측정하면 잘못된 이유로 잘못된 모델을 선택하게 됩니다.

두 번째 계약 없이 둘 다 시도

두 모델 모두 OrcaRouter 카탈로그에 공급업체 권장 가격으로 등록되어 있습니다. Muse Spark 1.2는 $1.25 및 $4.25, GLM 5.2는 $1.40 및 $4.40입니다. OrcaRouter가 공급업체 요금을 0% 마크업으로 전달하기 때문입니다. 그 결과 가격 책정은 스티커 가격이 아닌 인보이스 기준이 되며, 두 모델 간 전환은 새 통합이 아니라 동일한 키에 대해 모델 문자열에서 한 줄만 변경하면 됩니다. 공급업체가 가격을 인하하면 그 인하분은 당일 우리 측에 반영됩니다.

라우팅 레이어는 두 모델이 서로 보완적이기에 그 가치를 발휘한다. Muse Spark 1.2의 약점은 첫 토큰이 느리고 규모가 커질수록 가격이 높다는 점이고, GLM 5.2의 약점은 장황함과 딥 레포 추론이다. 플래닝 패스를 Muse Spark 1.2로 보내고 병렬 워커 팬아웃을 GLM 5.2로 보내는 라우팅 규칙 — 또는 Muse Code의 엔드포인트가 느릴 때 GLM 5.2로 페일오버하는 규칙 — 은 두 모델이 하나의 엔드포인트 뒤에 있으므로 추가 구축 비용이 들지 않는다. 그리고 출시된 지 3일 된 모델에게 자동 페일오버는 프로덕션 경로에 베팅하지 않고 시도해볼 수 있는 방법이다.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

누가 어떤 것을 골라야 하나요

선택하세요Muse Spark 1.2작업 단위가 크고 일관된 아티팩트이고 누군가 그 시작을 몇 초 기다릴 수 있을 때: 다중 파일 리팩터링, 전체 저장소 생성, 긴 에이전트 루프, 그리고 — Vals AI에 따르면 — 금융, 세금, 법률 문서 작업. DeepSWE 리드, 높은 출력 속도, 그리고 기여자 등급 모두 같은 방향을 가리킵니다. 당신은 폐쇄형 가중치, Meta의 도구, 그리고 더 느린 첫 토큰을 수용하는 것입니다. 그리고 Meta의 82.9와 59.3은 사실이 아니라 주장으로 읽어야 합니다.

선택하세요GLM 5.2, 소유권과 느낌이 종합 점수보다 더 중요할 때: 자체 호스팅하거나 옮길 수 있는 오픈 가중치, 대화형 작업을 위한 빠른 첫 토큰, 이미 이 모델과 함께 작동하는 하네스와 도구 생태계, 그리고 현존하는 가장 강력한 오픈 가중치 범용 성능. 장황함과 46.2 DeepSWE, 그리고 토큰 수 차이를 고려하기 전에도 토큰당 더 높은 정가를 감수하세요.

대부분의 팀은 정직한 답이 둘 중 하나만은 아니라는 것을 알게 될 것입니다. 개방형 인덱스는 대부분의 트래픽을 라우팅하는 주력 도구이고, 폐쇄형 인덱스는 심층 작업과 민감한 문서를 겨냥하는 전문가입니다. 복합 지수에서는 네 지점 차이지만, 가중치를 누가 소유하는지에 있어서는 완전히 다른 세계입니다 — 이것이 선택이며, 점수보다 훨씬 명확합니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube