Muse Glimmer 타이틀 카드: 로컬 GPU용 Meta의 30B 오픈 가중치 에이전트 모델. 칩에는 Apache 2.0, 24-32GB GPU에 적합, Muse Spark 1.2에서 증류됨이라고 적혀 있습니다.
Guides & Insights

Muse Glimmer: 메타의 30B 오픈웨이트 에이전트 모델, Gemma4-31B와 Qwen3.6-27B를 능가한다고 주장

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 8월 10일 아침, X의 한 게시물은 그 어떤 보도자료보다 더 직설적으로 말했다. "세상에, 메타가 돌아왔다." 그 게시물이 반응한 릴리스인 Muse Glimmer(Llama 4 이후 메타의 첫 오픈 가중치 모델)가 같은 날 출시되었고, 메타의 발표문도 그 트윗에 못지않게 공격적이다. 300억 파라미터 모델의 벤치마크 표는 Google의 Gemma4-31B를 24개 항목 중 19개에서, Alibaba의 Qwen3.6-27B를 24개 중 14개에서 이겼다고 주장한다. 가장 대표적인 항목은 에이전틱 벤치마크 MCP-Atlas로, 메타는 여기서 각각 54.2와 62.5를 상대로 75.5를 기록했다고 보고했다.

'smoked'라는 말이 머릿속에서 사실이 되기 전에, 그 숫자를 산출한 사람이 누구인지 주목하세요. Meta의 표에 있는 모든 점수는 Meta가 직접 실행했으며, Meta 자신도 설정을 튜닝하지 않았다고 인정한 경쟁 모델들을 상대로 한 것입니다. Muse Glimmer는 이 정확한 크기 등급을 추적하는 독립 리더보드인 Artificial Analysis에 아직 등재되지 않았습니다. 해당 리더보드에서 Qwen3.6-27B는 현재 Intelligence Index 46을, Gemma4-31B는 39를 기록 중입니다. 따라서 이것은 동시에 두 가지 이야기입니다. 하나는 Meta의 진정으로 중요한 오픈 웨이트 릴리스이고, 다른 하나는 검증에 수 주가 걸릴 벤치마크 주장입니다. 이 글은 이 둘을 분리해서 다룹니다.

뮤즈 글리머가 실제로 무엇인지

Muse Glimmer는 전용 지각 인코더를 통해 텍스트와 이미지 입력을 처리하는 30B 규모의 조밀한(dense) 멀티모달 모델로, 100개 이상의 언어로 훈련되었으며 허용적인 Apache 2.0 라이선스로 배포되었습니다. 모델 가중치는 Hugging Face의 meta-models/Muse-Glimmer-30B에서 확인할 수 있습니다. 이 모델은 Meta의 더 큰 독점 플래그십 모델인 Muse Spark 1.2의 증류(distilled) 버전이며, 훈련 방식에서도 이를 확인할 수 있습니다: 사전 훈련 단계에서 교사 모델로부터의 로짓 증류, 긴 컨텍스트와 에이전트 중심 데이터에 대한 중간 훈련, 그리고 정책 기반 증류 및 강화 학습과 결합된 지도 미세 조정입니다.

제품 개요는 기술만큼이나 구체적이다. 메타는 "상시 실행되는 로컬 에이전트 워크플로"를 위해 Glimmer를 만들었다. 이는 사용자 기기에서 실행되며, 도구를 호출하고, 다단계 계획을 따르고, 도구 호출이 실패하면 멈추는 대신 복구하며, 추론에 들이는 노력을 높이거나 낮출 수 있는 에이전트다. 의도된 용도는 화려하지 않은 작업들이다: 로컬 코딩, 함수 호출, 일정 관리, 파일 정리, LLM-as-a-judge 평가. 이 제품은 OpenClaw와 같은 에이전트 오케스트레이션 프레임워크와 호환되며, 실제로 많은 사람들은 이렇게 에이전트를 실행하게 될 것이다.

하드웨어 이야기는 피치의 나머지 절반이다. 전체 정밀도에서 30B 모델은 55GB 이상의 메모리를 요구한다. Meta의 ~4비트 양자화는 이를 약 17~20GB로 줄여, 24GB 또는 32GB 소비자용 그래픽 카드(RTX 5090이 기준)와 통합 메모리를 갖춘 하이엔드 Mac에 적합하다. 추측 디코딩 드래프터 — Meta가 DFlash라고 부르는 작은 동반 모델 — 는 생성을 가속화한다. Meta는 RTX 5090에서 약 3.1배(llama.cpp에서 74.9에서 233 tokens/sec로), M5 Max에서 1.8배, M4 Max에서 1.5배라고 보고한다. M4 Max에서는 통합 메모리가 이미 대역폭 제약이 덜하다.

이번 릴리스가 사양 시트 너머로 중요한 이유

그 트윗은 사실을 정확히 짚었다. 2025년 봄 Llama 4 이후로 Meta는 오픈 웨이트에 대해 조용해졌고, Meta Superintelligence Labs와 최고 AI 책임자 Alexandr Wang 아래의 독점적 프론티어 라인으로 후퇴했다. Muse Glimmer는 Llama를 AI에서 가장 많이 다운로드된 제품군으로 만든 오픈 웨이트 전략으로의 공개 복귀다. 그리고 이번 발표는 지금까지 가장 강력한 의도 신호를 담고 있었다. 저커버그는 출시와 함께 "The Future is for Everyone"이라는 14페이지 분량의 에세이를 발표하며, 진짜 AI 위험은 집중된 통제이며 오픈 웨이트가 미국이 중국의 오픈 모델 연구소들과 경쟁력을 유지하는 방법이라고 주장했다. 그는 오픈소스 AI에 대한 미국의 규제 완화를 촉구했고, Meta는 10억 달러 규모의 "Future is for Everyone Fund"를 발표했다. Meta는 또한 훨씬 더 큰 모델인 Muse Spark 1.2의 가중치를 "향후 몇 주 안에" 공개할 계획이라고 밝혔다.

그 맥락이 벤치마크 표를 읽는 방식을 바꾼다. 이것은 조용히 출시되는 연구실의 호기심이 아니라, 모델이 딸린 전략 선언문이다. Glimmer는 Meta 라인업에서 '저비용 로컬 에이전트' 포지션을 차지하며, 진지한 에이전트 작업에는 클라우드 API가 필요하다는 주장을 의도적으로 약화시킨다. 실제로 그것이 그 역할을 해내는지가 바로 검증 질문의 핵심이다.

Three-way scoreboard comparing Muse Glimmer, Gemma4-31B and Qwen3.6-27B: MCP-Atlas 75.5/54.2/62.5, DeepSearch QA 74.6/61.7/71.1, GAIA2 43.3/36.4/40.0, SWE-Bench Pro 51.2/36.9/50.2, TerminalBench 2.1 51.7/--/60.7, and AA Intelligence Index --/39/46. Footer: rows 1-5 vendor-reported by Meta; AA Index per Artificial Analysis (no Muse Glimmer entry yet).

'훈제' 주장, 행별로

메타의 표는 24개 벤치마크 항목에 걸쳐 Muse Glimmer를 Gemma4-31B 및 Qwen3.6-27B와 비교합니다. 가장 큰 우위를 주장하는 부분에서 패턴은 일관적입니다: 일반적인 에이전트 추론과 검색입니다.

• MCP-Atlas (에이전트형 도구 사용) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. 이는 헤드라인 행이며 세트에서 가장 큰 격차입니다.

• DeepSearch QA — 74.6 대 61.7 및 71.1.

• GAIA2 (일반 어시스턴트) — 43.3 대 36.4 및 40.0.

• WildClawBench (에이전트 스위트) — 47.6 대 37.6 및 43.2.

• SWE-Bench Pro — 51.2 대 36.9 및 50.2. 세 번째 숫자에 주목하세요: 50.2는 Meta가 자체 측정한 Qwen3.6-27B의 값이고, Alibaba가 자체 발표한 수치는 53.5입니다. 같은 모델인데 누가 실행했느냐에 따라 두 가지 다른 점수가 나옵니다.

• AIME 2026 — 94.7, IFBench 77.0, 그리고 AA-LCR 80.0 (Ge​mma의 68.3 대비).

그것은 강력한 행입니다. 하지만 표는 완전한 휩쓸기가 아니며, Muse Glimmer가 패배한 행들은 승리한 행들만큼이나 유익합니다. Qwen3.6-27B는 실용적인 컴퓨터 사용과 터미널 중심 작업에서 우위를 점합니다: SWE-Bench Verified 77.2 대 Glimmer의 76.0, OSWorld-Verified 75.6 대 65.9, TerminalBench 2.1 60.7 대 51.7, 그리고 ScreenSpot Pro, OmniDocBench, MMMU-Pro 같은 멀티모달 테스트에서도 꾸준한 우위를 보입니다. Gemma4-31B는 한편, Meta가 보고하는 두 지표에서 더 나은 안전 기록을 세웁니다 — CI Memories에서 가장 낮은 위반율과 Siren AgentDojo에서 가장 낮은 공격 성공률 — 그리고 좁은 범위의 추론 테스트(GPQA Diamond, Humanity's Last Exam)에서도 근소하게 앞섭니다.

그대로 읽으면, Meta의 주장은 "대부분의 에이전트 벤치마크에서 다른 두 모델을 이긴다"는 것이며, 자체 표에서는 대체로 사실이다. 핵심은 단서 조항이다. Meta는 모든 행을 직접 실행했고, 경쟁 모델에 대한 테스트 설정이 자체 모델만큼 튜닝되지 않았음을 인정했다. 이는 사기 혐의가 아니다. 튜닝되지 않은 경쟁 모델 설정은 이 업계에서 일상적이고 오히려 예상되는 잘못이지만, 바로 그 때문에 공급업체 작성 표는 독립적인 확인을 받아야 하는 것이다. 위의 Q​wen SWE-Bench Pro 불일치는 전체 문제를 축소판으로 보여준다.

독립 스코어보드가 말하는 바

Artificial Analysis는 아직 Muse Glimmer를 등재하지 않았습니다. 이 모델은 출시된 지 며칠밖에 되지 않았으며, AA의 지수는 자체 실행 결과를 기반으로 구축되기 때문에 시간이 걸립니다. 하지만 AA는 경쟁 모델 두 가지를 모두 추적하므로, 신규 모델이 진입한다고 주장하는 측정된 분야를 확인할 수 있습니다. 현재 지수 기준으로 Qwen3.6-27B는 Intelligence Index 46을 기록했으며, AA는 이를 150B 파라미터 미만의 오픈웨이트 모델 중 가장 지능적인 모델로 설명합니다. Gemma4-31B는 39에 위치합니다. 이는 업체의 주장이 아닌 독립적인 수치입니다.

{{1}}독립적 분석은 헤드라인 수치가 숨기는 비용 측면의 복병도 보여준다.{{/1}} AA의 효율성 데이터에 따르면 Qwen3.6-27B는 약 54.6 tokens/sec를 생성하는 반면 Gemma4-31B는 34.8 tokens/sec를 생성한다. Ge​mma의 time-to-first-token은 더 빠르지만, Q​wen은 전체 인덱스를 실행하는 데 약 3.7배 더 많은 출력 토큰을 사용하므로 종단 간 평가 비용이 약 21배 더 비싸진다. 토큰을 많이 소비하는 모델은 벤치마크 점수가 더 좋아도 실제 환경에서는 더 비싸며, 이는 어떤 벤더의 표에서도 자발적으로 제공되지 않는 의사결정 입력값이다.

그래서 이 글을 쓰는 시점의 솔직한 상황은 다음과 같습니다: 강력한 벤더 보고 결과, Muse Glimmer에 대한 독립적인 결과는 아직 전혀 없으며, 그리고 독립적으로 측정되고 작업별로 나뉘는 경쟁 분야가 있습니다. "Smoked Ge​mma and Q​wen"은 유효한 주장이지만, 아직 검증된 결과는 아닙니다. 주목할 검증 지표는 AA 인덱스 항목, LMArena Elo, 그리고 커뮤니티 재현 결과입니다 — 이 모든 것은 보통 이런 릴리스 후 몇 주 안에 나타납니다.

Screenshot of Artificial Analysis' Small Open Source Models comparison page, showing the 4B-40B open-weight class with Openness and Intelligence index columns and the header noting that Qwen3.6-27B and Qwen3.5-27B are the highest-intelligence small open-source models.

실제로 실행하는 데 드는 비용

Muse Glimmer는 무료입니다 — Apache 2.0, 토큰당 수수료 없음, Meta에 지불할 비용 없음. 비용은 그 아래에 깔리는 하드웨어입니다. 4비트의 30B 모델은 약 17–20GB의 상주 메모리와 KV 캐시, 지각 인코더, DFlash 드래프터를 위한 공간이 필요하며, 이것이 Meta 자체 가이드라인이 24GB 또는 32GB 카드나 고급 Mac을 권장하는 이유입니다. 그 하드웨어를 소유하고 있다면, 상시 가동되는 로컬 에이전트를 실행하는 한계 비용은 본질적으로 전기 요금입니다. 그렇지 않다면, 24GB GPU 또는 최대 사양의 M-시리즈 Mac은 실질적인 비용 항목입니다 — 그리고 8월 9일부터 세 번째 옵션이 있습니다: 임대하는 것입니다. 그 날짜 기준으로 운영 중인 최초의 호스티드 API 등록 항목들은 Muse Glimmer를 131K 컨텍스트 창에서 입력 토큰 100만 개당 $0.35, 출력 토큰 100만 개당 $1.50로 책정합니다. 이는 Meta 가격이 아닌 제공업체가 등록한 마켓플레이스 요금이지만, 하드웨어를 구매하고 싶지 않다면 오늘 실제로 지불할 수 있는 금액입니다.

그 비교는 신중하게 할 가치가 있습니다. '오픈 가중치, 제로 가격'과 '호스팅 API, 토큰당 가격'이 매우 다른 조건에서 만나기 때문입니다. 숫자를 계산할 때는 양쪽 모두 정직하게 책정하세요. OrcaRouter 쪽에서 볼 수 있는 200개 이상의 호스팅 모델에 대한 가격은 공급업체의 정가가 0% 마크업으로 전달된 것이므로, 공급업체의 가격 인하는 마진 재계산 후가 아니라 당일 바로 여기에 반영됩니다. 따라서 로컬 대 호스팅 비교가 직관적입니다. Muse Glimmer 자체는 아직 그 200개 이상의 모델에 포함되지 않으므로, 오늘 현재 그 전달 방식은 적용되지 않습니다. 하지만 핵심은 원칙입니다. 검증되지 않은 오픈 가중치 모델의 가격을 매기는 방법은 공급업체 테이블이 아니라 여러분의 자체 트래픽이며, 라우팅 DSL은 모델이 호출 가능한 API 뒤에 있게 되면 정확히 그 비교를 실행하기 위해 존재합니다.

이번 주에 실제로 어떻게 사용할지

오픈 가중치로 제공되기 때문에 '접근'은 가입이 아니라 다운로드입니다. 기본 저장소는 Hugging Face의 meta-models/Muse-Glimmer-30B이며, GGUF 변형이 이미 게시되었고 양자화 변형은 제3자로부터 제공되고 있습니다. 출시 당일 런타임 지원은 llama.cpp, MLX 및 ExecuTorch였으며, Ollama, LM Studio, vLLM 및 SGLang 통합은 출시 후 며칠 내에 제공되었고, AMD, Arm, Dell, Intel 및 Nvidia에 대한 하드웨어 최적화 작업이 등재되어 있습니다. 대부분의 사용자를 위한 실질적인 경로는 GGUF를 가져와서 llama.cpp 또는 로컬 러너에서 로드하고 에이전트 스캐폴드를 그쪽에 연결하는 것입니다. Meta는 Glimmer 자체에 대한 공개 API를 호스팅하지 않으며, 로컬 경로가 이 모델이 구축된 방식입니다. 그러나 호스팅 경로는 더 이상 가상적이지 않습니다. 제3자 플랫폼이 8월 9일부터 이를 서비스하기 시작했으므로 '다운로드 및 실행'과 'API 호출'이 모두 현재 사용 가능한 옵션입니다.

우리에 대해 솔직하게 말씀드리자면, Muse Glimmer는 아직 OrcaRouter를 통해 제공되지 않습니다. 저희는 호스팅된 API를 라우팅하며, 이번 업데이트 기준으로 해당 모델은 아직 카탈로그에 등록되지 않았습니다. 0% 마크업과 원키 올인원(one-key-everything) 조건은 저희가 라우팅하는 200여 개 모델에 적용되며, 이 모델은 아직 그중 하나가 아닙니다. 카탈로그에 등록되면, 나머지 카탈로그에 접근하는 동일한 키로 새 계약 없이 접근할 수 있고, 자동 장애 조치(failover) 덕분에 독자적인 실적을 쌓기 전인 공급업체 보고 신규 모델에도 실제 트래픽을 안전하게 연결할 수 있습니다. 라우팅 DSL이 존재하는 이유도 바로 여기에 있습니다. 검증되지 않은 모델은 자체 보도자료가 아닌 여러분의 데이터를 통해 프로덕션 경로를 획득해야 합니다.

아래 스크린샷은 출시일에 공개되었던 Hugging Face 카드입니다. 카드에 표시된 "어떤 추론 제공자(inference provider)로도 배포되지 않음"이라는 문구는 Hugging Face 자체(first-party) 추론 서비스를 의미하며, 8월 9일에 등록된 서드파티 호스팅 API 목록과는 별개의 것입니다.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the line that the model is not deployed by any inference provider.

볼 것

이 이야기를 결정지을 세 가지가 있다. 대략 빨리 일어나는 순서로다. 첫째, 약속된 Muse Spark 1.2 오픈 웨이트 공개다. teacher 모델이 {{1}}"몇 주 안에"{{/1}} 출시된다면 Glimmer는 더 이상 일회성이 아니라 본격적인 오픈 웨이트 라인업의 서막이 된다. 이것이 {{2}}"메타가 돌아왔다"{{/2}}는 말의 진짜 전략적 해석이다. 둘째, 독립적 측정이다. Artificial Analysis 지수 등재, LMArena 순위, 커뮤니티 재현 결과는 {{3}}24개 중 19개라는 주장{{/3}}이 Meta가 아닌 다른 이의 검증에서도 살아남는지를 알려줄 것이다. 셋째, 호스팅 물결이다. 이것은 이미 시작됐다. 제공업체들은 {{4}}8월 9일{{/4}}부터 Glimmer를 서비스하기 시작했다. 따라서 로컬 대 호스팅이라는 질문은 이제 API 키 하나만으로 실제로 선택할 수 있는 문제가 됐다. 앞으로 지켜볼 것은 호스팅 보급이 얼마나 넓어지느냐, 그리고 출시 첫 주의 새로움이 사라진 뒤 토큰당 가격이 어떻게 움직이느냐다.

그 트윗은 그 뉴스에 대해 옳았다. 그것이 평결에 대해 옳았는지 여부는 몇 주에 걸친 질문이며, 지금 현재의 솔직한 입장은 Meta 외부의 누구도 알 만큼 충분히 실행해 보지 못했다는 것이다. 이미 확실한 것은 소비자용 GPU에 들어맞고 전면적인 전략 추진의 지원을 받는 30B Apache-2.0 에이전트 모델이 독립 점수가 어떻게 나오든 계획을 세울 만한 릴리스라는 점이다.

실제로 답할 가치가 있는 질문들

뮤즈 글리머(Muse Glimmer)는 정말 오픈소스인가요?

Apache 2.0이라는 허용적 라이선스 아래 공개된 오픈 웨이트 모델로, 누구나 메타에 비용을 지불하지 않고 다운로드·수정·파인튜닝·상업적 배포를 할 수 있습니다. '오픈 웨이트'라는 신중한 표현이 사용된 이유는 OSI가 규정하는 완전한 오픈소스가 아니기 때문이며, 학습 데이터, Muse Spark 티처 모델의 가중치, 일부 도구가 포함되지 않습니다. 실용적인 관점에서 보면 — 실행하고, 출시하고, 그 위에 제품을 판매할 수 있다는 점에서 — 이는 Llama를 AI에서 가장 널리 배포된 오픈 패밀리로 만든 것과 동일한 조건입니다.

Muse Glimmer가 실제로 Gemma4-31B와 Qwen3.6-27B를 능가하나요?

메타 자체의 표에서 보면, 대부분의 에이전틱 및 검색 벤치마크에서는 그렇다. 단, 메타가 비교를 직접 실행했고 경쟁사 설정을 튜닝하지 않았다는 점을 고려해야 한다. 정확히 말하면, 메타는 에이전틱 추론 항목에서 이기고, Qwen3.6-27B는 실전 컴퓨터 사용·터미널 작업과 대부분의 멀티모달 테스트에서 이기며, Gemma4-31B는 더 나은 안전 기록을 보여준다. 출시일 기준으로 Muse Glimmer에 대한 독립적인 인덱스 항목은 전혀 없으므로, 24개 중 19개라는 주장은 제3자가 실행할 때까지 벤더 보고로 간주해야 한다.

노트북에서 실행할 수 있나요?

"laptop"이 24GB 또는 32GB 개별 GPU를 장착했거나 충분한 통합 메모리를 갖춘 고급형 M-시리즈 Mac을 의미하는 경우에만 해당합니다. 4비트 Muse Glimmer는 KV 캐시, 지각 인코더, DFlash 드래프터를 위한 여유 메모리까지 포함해 대략 17–20GB가 필요합니다. 대부분의 사람들에게 이는 실질적인 지출이며, "무료" 모델 안에 숨겨진 비용입니다. 통합 그래픽이나 16GB 머신에서는 릴리스가 전제하는 상시 작동 에이전트 대신 심한 양자화와 느린 출력을 마주하게 될 것입니다.

어디서 구할 수 있나요 — API로 제공되나요?

가중치는 Hugging Face의 meta-models/Muse-Glimmer-30B에 있으며(GGUF 변형 포함), llama.cpp, MLX, ExecuTorch 또는 이를 통합하는 로컬 러너를 통해 로컬에서 실행할 수 있습니다. 호스팅 API 액세스도 8월 9일부터 타사 플랫폼을 통해 제공되며, 입력 토큰 100만 개당 $0.35, 출력 토큰 100만 개당 $1.50입니다. 따라서 24GB GPU를 소유하지 않아도 호출할 수 있습니다. Meta 자체는 여전히 Glimmer용 공개 API를 호스팅하지 않으며, OrcaRouter에도 아직 등록되어 있지 않습니다. 이 모델이 우리 카탈로그에 들어오면 카탈로그의 나머지 부분에 도달하는 동일한 키로 접근할 수 있습니다. 그때까지는 로컬 추론 또는 타사 호스팅 플랫폼이라는 두 가지 정직한 방법이 있습니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube