생성된 히어로 카드 제목: 'Step 5 Preview vs Muse Glimmer - API와 노트북'. 왼쪽 카드 'Step 5 Preview' 내용: 동급 중앙값 26 대비 AA Index 44, StepFun, 2026년 9월 20일 발표, 총 약 600B / 활성 27B, 1M 토큰 컨텍스트, 1M 토큰당 입력 $1.00 / 출력 $2.70, 벤더 서버에서 실행. 오른쪽 카드 'Muse Glimmer' 내용: AA Index 17, Meta Superintelligence Labs, 2026년 8월 10일 출시, 4비트 기준 30B 파라미터, 20GB 미만, 131K 토큰 컨텍스트, 262K까지 확장 가능, Apache 2.0, 자체 GPU에서 오프라인 실행. 바닥글: 'Index 수치는 Artificial Analysis 기준, Muse Glimmer 사양은 Meta 기준.'
Guides & Insights

Step 5 Preview vs Muse Glimmer: Frontier API와 노트북 모델

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

리더보드에서 Step 5 Preview와 Muse Glimmer는 서로 가깝지 않습니다. Artificial Analysis Intelligence Index에서 44 대 17 — 현재 선두가 50점대 후반에 자리한 척도에서 27점 차이 — 이는 아무리 튜닝해도 좁힐 수 없는 격차입니다. 팀이 실제로 답해야 하는 질문 — 내 토큰은 어디에서 돌아가는가 — 에서 이 둘은 직접적인 경쟁자입니다. Step 5 Preview는 StepFun의 플래그십으로, 2026년 9월 20일에 발표되었으며, 총 파라미터 약 6,000억 개에 활성 270억 개, 100만 토큰 컨텍스트, 가격은 입력 100만 토큰당 $1.00, 출력 100만 토큰당 $2.70이고, 네트워크를 통해서만 접근할 수 있습니다. Muse Glimmer는 Meta Superintelligence Labs의 300억 파라미터 오픈 웨이트 에이전트형 모델로, 2026년 8월 10일 Apache 2.0으로 공개되었고, 4비트로 양자화된 상태로 배포되어 20GB 미만의 메모리에 들어가며 네트워크를 뽑은 채 단일 소비자용 GPU에서 실행됩니다. 이 짝을 읽는 올바른 방식은 "어느 쪽이 더 똑똑한가"가 아닙니다. "두 가지 제약 — 역량과 경계 — 중 어느 것이 당신의 워크로드가 움직일 수 없는 제약인가"입니다.

이 비교는 이 시장이 들여온 습관, 즉 종합 지수 점수를 모델 가치의 전부로 취급하는 관행을 바로잡는 데에도 유용하다. 27점 차이는 실재하며, 파일에 있는 유일한 숫자도 아니다. 긴 문맥 검색에서 동일한 독립 평가 위원회는 Muse Glimmer를 훨씬 더 큰 웨이트 클래스의 오픈 웨이트 모델들과 0.5점 이내에 놓았고, Meta 자체의 에이전트 벤치마크는 노트북에서 실행되는 모델로서는 존경할 만하다. 한편 Step 5 Preview의 가장 많이 인용되는 약점은 능력이 전혀 아니라 장황함이며, 약속된 가중치가 10월 15일에 도착할 때까지 비공개다.

두 개의 모델, 완전히 다른 두 개의 대상

Step 5 Preview는 StepFun의 인프라에서 제공되는 전문가 혼합(MoE) 시스템입니다. 총 파라미터는 약 6000억 개, 토큰당 활성 파라미터는 270억 개이며, 텍스트와 이미지 입력, 100만 토큰 컨텍스트 창, 그리고 비교 가능한 모델의 중앙값 26에 대비되는 독립적인 Intelligence Index 점수 44를 갖습니다. 출력 속도는 초당 87토큰으로, 같은 보드의 측정에서 평균 78토큰이며, 인덱스 작업 스위트 전반에서 약 1억 6000만 개의 출력 토큰을 생성했습니다. 중앙값 모델은 약 8200만 개를 출력하므로, 작업 단위당 대략 두 배의 텍스트를 생성하는 셈이며, 100만 개당 $2.70로 청구됩니다. BF16 가중치는 2026년 10월 15일로 약속되었지만 아직 저장소에 없으므로, 오늘 이 모델은 여러분에게 API로만 존재합니다.

Muse Glimmer는 그 반대되는 모델입니다. 이는 Meta의 더 큰 Muse Spark 교사 모델로부터 로짓 증류(logit distillation)로 학습된 30B 매개변수 모델이며, 이후 긴 컨텍스트 에이전틱 데이터로 미세 조정되고 도구 사용을 위해 강화되었습니다. Meta는 이를 4비트로 양자화해 제공하는데, 이로써 전체 정밀도에서 55GB가 넘던 메모리가 20GB 미만으로 줄어들어 24GB 또는 32GB VRAM 범위 안에 들어옵니다. Meta는 Nvidia RTX 5090과 Apple M4 Max 및 M5 Max 실리콘에서 이를 테스트했습니다. 이 모델은 100개 이상의 언어에서 텍스트와 이미지 입력을 받아들이고, 131,072 토큰 컨텍스트를 지원하며 262,144까지 확장할 수 있습니다. 또한 목표를 받아 단계로 나누고, 도구를 호출하며, 실패한 호출을 중단하지 않고 재시도하도록 만들어졌습니다. Apache 2.0이며 오프라인으로 실행됩니다.

• 독립 점수 — Step 5 Preview: 동급 중앙값 26 대비 44 vs Muse Glimmer: 동일 지수에서 고사양 구성 기준 17.

• 규모 — Step 5 Preview: 총 약 600B, StepFun 기준 활성 27B vs Muse Glimmer: 총 30B, 20GB 미만에서 4비트로 양자화.

• 컨텍스트 윈도우 — Step 5 프리뷰: 100만 토큰 vs Muse Glimmer: Meta에 따르면 131,072에서 262,144로 확장 가능.

• 가격 — Step 5 Preview: 백만 토큰당 입력 $1.00 / 출력 $2.70, 공개 가격 vs Muse Glimmer: 토큰당 요금 없음; GPU는 직접 공급

• 실행 위치 — 5단계 미리보기: 공급업체의 서버, HTTP 경유 vs Muse Glimmer: 자체 하드웨어, 오프라인.

• 라이선스 — Step 5 Preview: 비공개 프리뷰, 가중치는 2026년 10월 15일 공개 예정 vs Muse Glimmer: Apache 2.0, 지금 다운로드 가능.

• 장문맥 검색 — Muse Glimmer는 인덱스 보드의 장문맥 추론 평가에서 80.0점을 기록했으며, 이는 가격대가 몇 배 높은 모델들과 0.5점 차이 안에 들고, Step 5 Preview의 점수에 충분히 근접해 그 차이가 사실 확인 작업에 결정적으로 중요하지는 않다.

스물일곱 개의 점, 그리고 그것들이 측정하지 않는 것

20GB 메모리에서 실행되도록 증류된 30B 모델은 일반 지능 지수에서 600B 플래그십에 밀릴 수밖에 없으며, Meta 자체 자료도 그 반대를 주장하지 않는다 — 그 설명 중 하나는 Glimmer가 본격적인 클라우드 모델의 순수 추론 능력에 필적하도록 설계된 것이 아니라고 노골적으로 밝힌다. 따라서 17점은 엔지니어링에 대한 판결이 아니다. 그것은 다른 목표에 무게를 둔 결과로 예상된 것이다. 올바른 질문은 그 격차가 실제로 당신의 어떤 작업을 커버하느냐이다.

장문맥 읽기는 두 가지가 가장 가까워지고 직관이 무너지는 지점이다. Muse Glimmer는 리더보드의 장문맥 추론 평가에서 80.0점을 기록한다 — 이 점수는 프론티어 모델에게는 평범할 것이고, 소비자용 GPU에서 실행되는 모델에게는 놀라운 점수다. 당신의 워크로드가 긴 문서에 대한 검색, 요약 또는 추출이라면, 그 수준의 로컬 모델이 명백히 잘못된 도구는 아니며, 요청이 당신의 기기를 떠나지 않는다는 사실은 어떤 가격으로도 API에서 살 수 없는 기능이다.

그리고 메타의 수치가 보여주지 않는 비교의 한 부분이 있다. 다중 에이전트 오케스트레이션에 관한 동료 심사 연구는 통제된 환경에서 Muse-Glimmer-30B를 테스트했는데 — 동일한 작업, 동일한 하네스, 동일한 컨설턴트 — 더 큰 프런티어 모델들이 생성한 후보를 하나도 복구하지 못했으며, 각 설정에서 세 번의 시도 모두 실패했다. 그것은 하나의 구성에 대한 단일 연구이며, 모델 페이지가 결코 드러내지 않는 종류의 증거다. 더 약한 오케스트레이터가 더 강한 모델의 실패에서 복구해야 하는 에이전트 파이프라인의 경우, 이는 이 글에서 의사 결정에 가장 관련 있는 결과이며, 메타가 공급업체로서 보고한 어떤 벤치마크보다도 먼저 읽어볼 가치가 있다.

완전성을 위해 말하자면, 그 벤치마크는 Meta 자체의 것이며 재현되지 않았다: SWE-Bench Verified 76.0%, SWE-Bench Pro 51.2%, TerminalBench 2.1 51.7%, OSWorld-Verified 65.9%, GPQA Diamond 83.5%, Humanity's Last Exam 22%, MCP-Atlas 75.5. 이들은 같은 크기 등급의 모델들을 상대로 측정된 것이며, 최전선 추론 모델이라기보다는 유능한 로컬 에이전트를 설명한다.

Generated two-column scoreboard card titled 'Step 5 Preview vs Muse Glimmer - the scoreboard'. The left column gives Step 5 Preview an independent index of 44, the vendor's servers as the runtime, closed preview weights, $1.00 / $2.70 per 1M tokens, about 160M output tokens against an 82M median, and wins on capability ceiling, 1M context and image input. The right column gives Muse Glimmer an independent index of 17, your own GPU offline as the runtime, Apache 2.0 weights, no per-token charge, a long-context retrieval score of 80.0 within half a point of much larger models, and wins on privacy perimeter, zero marginal cost and portability. A footer reads 'Index and long-context figures per Artificial Analysis; Muse Glimmer specifications per Meta, vendor-reported.'

경계가 실제로 어디에 놓이는지

Step 5 Preview의 구조적 이점은 로컬에서 할 수 없는 작업을 대신 해준다는 점이다. 1M 토큰 컨텍스트, 이미지 입력, 측정된 프런티어 인접 점수, 하드웨어 구매 없이 초당 87 출력 토큰: 초안 작성, 계획 수립, 대규모 리포지토리 전반의 코드 리뷰, 또는 모델의 한계가 병목인 모든 작업에서 API가 이기며, 그 27점이 모든 논거다. 그 대가는 Muse Glimmer와 정반대다: 프롬프트가 당신의 경계를 벗어나고, 가격이 모든 토큰에 다시 적용되며, 모델의 장황함 때문에 긴 출력 작업이 $2.70 요율이 시사하는 것보다 더 비싸진다.

Screenshot of the Artificial Analysis model page for Muse Glimmer in its high configuration, headed 'Muse Glimmer (High) Intelligence, Performance & Price Analysis', showing Meta as the creator, an open-weights release date of August 2026, an Intelligence Index of 17, and a 131k-token context window with text and image input.

Muse Glimmer의 장점은 외부로 나갈 수 없는 작업을 처리한다는 점입니다. 데이터가 규제 대상이라면, 지연 예산이 몇 밀리초에 불과하다면, 머신이 오프라인 상태라면, 또는 백만 번째 요청의 한계 비용이 0이어야 한다면, 그렇다면 어떤 API도 후보가 될 수 없습니다 — 이 API도, 그 어떤 API도 아닙니다. 그 대가는 성능입니다: 44가 존재하는 상황에서 17을 선택하는 셈이고, 에이전트 오케스트레이션에서는 더 강력한 모델의 실수로부터 복구할 수 없는 조정자를 선택하고 있을 수도 있습니다.

대부분의 팀에게 답은 선택이 아니라 분할이며, 그 분할은 어딘가에 자리가 필요합니다. OrcaRouter는 하나의 API 키와 하나의 청구서 뒤에 200개 이상의 모델을 0% 마크업으로, 공급자 정가를 그대로 전달하며 라우팅합니다, 게다가 자동 장애 조치 그리고 작업, 비용 또는 지연 시간에 따라 트래픽을 보내기 위한 라우팅 DSL을 제공합니다. Step 5 Preview도 Muse Glimmer도 그 카탈로그에 없습니다 — StepFun의 플래그십은 우리가 라우팅하지 않으며 Glimmer는 로컬 다운로드입니다 — 따라서 제공되는 가치는 두 모델 중 어느 것에 대한 접근이 아닙니다. 그것은 당신이 두 모델을 비교 평가할 기준이 되는 세트이며, 오늘 하나의 키로 호출할 수 있으므로, 로컬 대 원격 결정은 마지막으로 읽은 특정 공급업체 페이지가 아니라 당신 자신의 작업 분포에 의해 정해집니다.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

결정하는 방법

상한이 제약 조건일 때는 Step 5 Preview를 선택하세요. 작업이 개방형이거나, 멀티모달이거나, 긴 컨텍스트를 다루거나, 유능한 플래너가 필요한 의미에서 에이전트형이라면, API 모델은 둘 중 그런 작업을 수행할 수 있는 유일한 모델이며, 그 가격은 동급 기준으로 충분히 낮아 파일럿을 프로젝트가 아니라 예산 항목으로 집행할 수 있습니다. 장황함을 예산에 반영하고, 10월 15일 가중치 날짜가 밀릴 것에 대비해 계획하며, 건물 밖으로 나가면 안 되는 워크로드는 여기서 제외하세요.

경계가 제약 조건일 때는 Muse Glimmer를 선택하세요. 데이터를 전송할 수 없거나, 비행기나 공장에서 실행해야 하거나, 사용량이 많아 토큰당 가격이 터무니없게 느껴진다면, 20GB에 들어가는 30B Apache-2.0 모델이 실용적인 선택이며, 장문 컨텍스트 검색 결과가 충분히 좋아서 모든 워크로드에서 성능 격차가 드러나지는 않을 것입니다. 오케스트레이션에서는 신뢰하기 전에 먼저 테스트하세요. 바로 그곳이 독립적인 증거가 가장 약한 영역이기 때문입니다.

두 제약 조건이 동시에 적용되면 둘 다 실행하세요: 이동할 수 없는 데이터에는 로컬을, 더 큰 모델이 필요한 작업에는 API를 사용하고, 라우팅 결정이 마이그레이션이 아니라 구성 변경이 되게 하세요. 중요한 비교는 44 대 17이 아닙니다. 중요한 것은 여러분의 요청 중 어느 것이 머신을 떠날 여유가 있는가이며, 그건 오직 여러분 자신의 트래픽만이 답할 수 있는 질문입니다.