히어로 타이틀 카드: 'Muse Glimmer — 단일 RTX 5090에서 230 Tokens/s — SGLang Day-0', 통계 칩에는 30B 덴스 오픈 웨이트, Apache 2.0, SGLang day-0 지원이 표시됩니다.
Guides & Insights

Muse Glimmer, 단일 RTX 5090에서 초당 230토큰 달성: SGLang Day-0 지원이야말로 진정한 출시 이야기

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

초당 230토큰은 어떤 모델에게도 빠른 수치입니다. Meta Superintelligence Labs가 Apache 2.0 라이선스로 2026년 8월 10일에 출시한 Meta의 30B 밀집(dense) 오픈 가중치 모델인 Muse Glimmer에게 이 수치는 '내 GPU에서 실행되는' 모델과 '실제 에이전트를 서빙하는' 모델을 가르는 기준입니다. SGLang은 가중치가 공개된 당일 Muse Glimmer에 대한 출시 당일(day-0) 지원을 발표했으며, 단일 GeForce RTX 5090에서 배치 1 기준 사용자당 초당 236.4토큰이라는 측정 결과를 공개했습니다. 이는 NVFP4 양자화와 Meta의 DFlash 추측 디코딩 드래프터(speculative-decoding drafter)를 모두 적용한 상태에서 측정된 수치입니다.

그 수치 하나가 이번 릴리스의 스토리텔링 대부분을 담당하지만, 나머지 부분도 천천히 살펴볼 가치가 있다. 흥미로운 지점은 헤드라인을 장식한 속도가 아니라, 이 모델이 RTX PRO 6000, NVIDIA DGX Spark, 그리고 MLX를 통한 Apple Silicon에서도 별도의 설정 없이 바로 작동한다는 점이다. 또한 SGLang는 이 작업을 커뮤니티의 부산물이 아니라 Meta Superintelligence Labs와의 협업이라고 지칭한다. 이는 오랜만에 등장한 프런티어에 가까운 Meta 모델로, 단순히 가중치만이 아니라 서빙 스택을 중심으로 설계되었다.

여기서 "day-0 support"가 실제로 의미하는 것

SGLang v0.5.17의 Day-0 지원은 모델이 나중에 억지로 추가된 것이 아님을 뜻합니다. 런타임 작업이 가중치와 동일한 릴리스 기간에 포함되었고, Meta가 실제로 목표로 하는 하드웨어를 위한 전용 경로가 마련되었습니다. SGLang의 SM120 백엔드는 Blackwell 데스크톱 및 워크스테이션 제품군을 지원하며, RTX 5090, RTX PRO 6000, DGX Spark 모두 동일한 최적화 경로로 실행됩니다. 또한 Apple silicon은 느린 포트 대신 네이티브 MLX 백엔드를 사용합니다.

SGLang과 Meta가 튜닝한 스택은 특정합니다. 모델은 Meta가 Muse Glimmer를 위해 훈련한 스페큘레이티브 디코딩 동반 모델인 5GB BF16 DFlash 드래프터와 짝을 이루는 18GB NVFP4 체크포인트로 실행됩니다. 이 조합은 32GB 카드에 여유 있게 들어가며, NVFP4와 MXFP8을 합친 혼합 양자화 경로 전체는 대략 19.5GB의 상주 메모리를 차지합니다. SGLang 측에서 릴리스 노트는 같은 이야기의 일부로 세 가지 신뢰성 메커니즘을 언급합니다: DFlash 스페큘레이티브 디코딩, 프리픽스 캐싱을 위한 RadixAttention, 그리고 인터럽트 가능한 CUDA 그래프입니다.

숫자, 그리고 그것이 무엇이고 무엇이 아닌지

SGLang이 공개한 RTX 5090 수치는 모두 NVFP4와 SM120 경로를 기반으로 하며, 그 내용은 다음과 같이 정리됩니다:

• 단일 사용자 디코딩(배치 1) — 표준 63.9 tokens/s, DFlash 추측 디코딩 시 236.4 tokens/s. 이 3.7배 향상은 대화형 수치로서, 로컬 에이전트가 대화처럼 느껴지는지 대기열처럼 느껴지는지를 결정하는 값입니다.

• {{1}}집계 출력 (배치 8){{/1}} — {{2}}표준 501 tokens/s{{/2}}, {{3}}DFlash 사용 시 1,452 tokens/s{{/3}}. {{4}}이는 여러 요청을 동시에 처리하는 로컬 서버의 처리량 수치입니다.{{/4}}

• 비교를 위해, 동일한 GPU에서 GGUF q4_k_m — 대부분의 사람들이 llama.cpp 스타일 런타임에서 사용하게 될 경로 — 는 표준 설정에서 72.6 tokens/s, DFlash에서 140.7 tokens/s에 도달합니다. NVFP4 경로가 의미 있게 앞서 있습니다.

이것은 출시일 기준 SGLang과 Meta가 발표한 수치로, 독립적인 재현 결과가 아닙니다. 정직하게 말하면 공급업체 및 프레임워크 보고 수치이며, 커뮤니티 검증은 앞으로 몇 주에 걸쳐 이뤄질 것입니다. 그러나 수치를 발표한 두 스택에서 나타난 패턴은 일관적입니다. llama.cpp에서 Meta는 DFlash를 사용한 RTX 5090에서 74.9~233.4 tokens/s, 즉 3.1배 향상을 보고했습니다. M5 Max는 26.6에서 50.2로, M4 Max는 23.7에서 37.8로 향상됩니다. 서로 다른 두 런타임, 서로 다른 측정 방식, 그러나 결과는 같은 범위입니다. 즉, 단일 소비자 GPU에서 초당 200토큰 이상을 디코딩하는 30B 모델, 그리고 수치를 발표한 모든 Nvidia 설정에서 처리량을 대략 3배로 높이는 DFlash입니다.

'serves'가 'runs'보다 더 중요한 이유

메타의 하드웨어 블로그는 데스크톱 수치보다 더 선명한 주장을 펼친다. NVIDIA Blackwell Ultra(데스크톱 카드가 아닌 데이터센터용 세대)에서 블로그는 BF16/NVF4 기준 GPU당 초당 20,000개 이상의 토큰을 언급하며, SGLang과 vLLM을 모두 지원되는 오픈소스 스택으로 명시한다. 이는 완전히 다른 수준이며, 메타가 실제로 구축하려는 것이 무엇인지 보여주는 신호다. 즉, 동일한 가중치가 노트북에서 GPU 서버 랙까지 어디서든 실행되도록 설계되었고, 서빙 프레임워크는 나중에 이식할 대상이 아닌 처음부터 핵심 요소로 취급되었다는 것이다.

신뢰성 측면은 속도만큼이나 중요합니다. 서빙 레이어가 끊겨 작업 중간에 죽는 로컬 에이전트는 속도 제한에 걸린 클라우드 에이전트보다 의미 있게 나은 것이 아닙니다. day-0 스택의 메커니즘 — 중단 가능한 추측 디코딩, 긴 에이전트 컨텍스트를 저렴하게 다시 진입할 수 있게 해주는 프리픽스 캐싱, 그리고 베이스 모델에 맞춰 조정된 드래프터 — 은 항상 가동되는 로컬 에이전트를 생존 가능하게 만드는 바로 그 부분들입니다. 이것이 출시가 가리켜 온 '속도와 신뢰성'이며, 이는 마케팅 문구가 아닌 실제 엔지니어링 입장입니다.

A single-model speed board for Muse Glimmer: batch-1 decode 63.9 to 236.4 tok/s with DFlash, batch-8 output 501 to 1,452 tok/s, GGUF q4_k_m 72.6 to 140.7 tok/s, 128K context window, 18GB checkpoint plus 5GB drafter, runs on RTX 5090, RTX PRO 6000, DGX Spark and Mac. Footer: SGLang/NVIDIA-reported, launch day.

실제로 그것으로 무엇을 할 수 있는지

Muse Glimmer는 30B 밀집(dense) 멀티모달 모델로, 고정된 지각 인코더(frozen perception encoder)를 통해 텍스트와 이미지를 입력받고 텍스트를 출력합니다. 100개 이상의 언어로 학습되었으며, 131,072토큰 컨텍스트 창과 2026년 1월 4일자 지식 기준을 갖추고 있습니다. 이 모델의 임무는 화려하지 않은 에이전트 작업, 즉 함수 호출, 도구 사용, 일정 및 파일 관리, LLM-as-a-judge 평가, 그리고 실패 복구가 포함된 다단계 작업입니다. 도구 호출이 실패하면 모델은 중단하지 않고 진단한 뒤 재시도하도록 학습됩니다. 또한 시스템 프롬프트에서 설정하는 추론 노력 수준(낮음부터 xhigh까지)을 제공하며, 이를 통해 동일한 가중치에서 지연 시간과 깊이를 맞바꿀 수 있습니다.

초당 230토큰이라는 수치가 바로 그 모든 것을 한 대의 머신에서 사용 가능하게 만든다. {{1}}초당 약 50토큰 미만에서는 인터랙티브 에이전트가 원격 디버깅 세션처럼 느껴지는 반면, 초당 200토큰 이상에서는 로컬 도구처럼 느껴진다.{{/1}} {{2}}이 숫자 하나가 곧 이 모델에 대한 논거의 전부이며,{{/2}} {{3}}그것이 하드웨어 목록 — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — 이{{/3}} {{4}}호환성 각주가 아니라 로컬 에이전트 시대의 쇼핑 가이드처럼 읽히는 이유다.{{/4}}

비용

Muse Glimmer 자체는 무료입니다. Apache 2.0 가중치는 Hugging Face의 meta-models/Muse-Glimmer-30B에 있으며, llama.cpp 스타일 런타임을 위한 GGUF 양자화 파일도 이미 게시되어 있고 공개 Meta API는 없습니다. 실제 비용은 그 아래에 있는 하드웨어입니다. 18GB NVFP4 체크포인트와 5GB 드래프터(drafter)를 합치면 24GB 또는 32GB 그래픽 카드, 혹은 고급형 M-시리즈 Mac이 필요합니다. 이미 그런 장비를 갖고 있다면, 항상 켜져 있는 로컬 에이전트의 한계 비용은 전기세뿐입니다. 그렇지 않다면 GPU가 비용 항목이 되며, 그것이 '무료 모델'을 호스팅 API와 비교하는 정직한 방법입니다.

그런 비교를 할 때는 양쪽 가격을 정직하게 산정하십시오. OrcaRouter에서 200개가 넘는 호스팅 모델에 표시되는 가격은 공급업체의 정가를 0% 마크업으로 통과시킨 가격이므로, 공급업체의 가격 인하가 당일 바로 반영됩니다. 이 덕분에 로컬 대비 호스팅 비용 비교가 정직하게 유지됩니다. Muse Glimmer 자체는 현재 OrcaRouter에 없습니다. 아직 어떤 추론 제공업체도 이 모델을 서비스하지 않기 때문이며, 현재는 다운로드로 제공됩니다. 어떤 제공업체가 이 모델을 서비스하기 시작하는 순간, 카탈로그의 나머지 모델에 도달하는 것과 동일한 키가 이 모델에도 도달하게 됩니다. 그리고 자동 장애 조치는 독립적인 실적이 없는 새로운 공급업체 보고 모델에 프로덕션 트래픽을 안전하게 연결할 수 있게 해 주는 메커니즘입니다.

Screenshot of the NVIDIA Developer blog 'Run Local AI Agentic Workflows with Meta's Muse Glimmer', describing the 30B open-weight dense model with a 120K+ context window and quoting 20K tokens/sec on a single GPU for always-on local agents.

속도 뒤에 숨은 더 큰 이야기

{{1}}day-0 SGLang 작업{{/1}}을 하나의 신호로 받아들이면, 이번 릴리스는 더 이상 단일 모델이 아닙니다. Muse Glimmer는 Meta의 독점 플래그십 모델인 Muse Spark 1.2의 증류 버전이며, Meta는 교사 모델의 가중치가 "몇 주 안에" 공개될 것이라고 밝혔습니다. 튜닝된 서빙 스택을 갖춘 30B 로컬 에이전트, 곧 오픈될 교사 모델, 그리고 이번 릴리스와 함께 발표된 10억 달러 규모의 커뮤니티 펀드 — 이것은 포인트 릴리스가 아닙니다. 이는 로컬 에이전트 시장을 정조준한 {{2}}오픈 웨이트 라인업의 서막{{/2}}이며, {{3}}출시 당일 제공되는 프레임워크 지원{{/3}}은 Meta가 단순히 다운로드만 받는 게 아니라 실제로 실행하기를 의도하고 있음을 보여주는 부분입니다.

염두에 둬야 할 주의사항: 지금까지 이번 출시와 함께 발표된 모든 속도 및 벤치마크 수치는 벤더나 프레임워크 측이 보고한 수치다. 처리량 수치가 두 개의 독립적인 스택에서 일관되게 나타나는 것은 고무적이지만, 독립적인 벤치마킹, Artificial Analysis 등재, 실제 환경에서의 재현이 있어야 초당 230토큰이라는 이야기가 확정된다. 그리고 그런 확인은 보통 이런 릴리스 후 몇 주 안에 이루어진다.

주목할 것들을 대략 속도 순서로 나열하면: Muse Spark 1.2 오픈 웨이트 공개('Meta is back'에 대한 전략적 해석이 여기에 달려 있다); Nvidia가 아닌 하드웨어에서의 첫 독립적 처리량 재현(여기서 주목할 경로는 MLX다); 그리고 최초로 Glimmer 엔드포인트를 구축하는 추론 제공업체 — 이것이 '무료 로컬 모델'과 '호스팅 API' 논쟁이 더 이상 가상의 논의가 아니라 키 하나로 선택할 수 있는 현실이 되는 순간이다.

Screenshot of the Hugging Face model card for meta-models/Muse-Glimmer-30B, showing the Apache 2.0 license, 30B parameter size, Meta Superintelligence Lab authorship, and the model's purpose-built local-agentic description.
© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube