
Claude Sonnet 5.5 vs Muse Glimmer: 새로운 Sonnet에 맞서는 30B 노트북 모델
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 931 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 192 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
이 페이지의 근본적인 질문은 이 비교가 과연 타당한가 하는 것이며, 솔직한 답은 Claude Sonnet 5.5와Muse Glimmer는 일반적인 의미의 경쟁자가 아닙니다. Artificial Analysis의 Intelligence Index, 리비전 v4.3.2에서 Claude Sonnet 5.5는 56점, Muse Glimmer는 17점을 기록하는데, 그 격차는 노이즈가 아닙니다 — 그것은 최전선의 범용 모델과 아주 뛰어난 소형 모델 사이의 거리에 가깝습니다. 그럼에도 이 비교를 읽을 가치가 있는 이유는 Muse Glimmer가 다른 모델이 어떤 가격에도 살 수 없는 한 가지 특성을 지녔기 때문입니다: 바로 300억 개 매개변수의 개방형 가중치 모델로, 2026년 8월 10일 Meta가 Apache 2.0 라이선스로 공개했으며, 4비트로 양자화되어 20GB 미만의 VRAM에 들어가고, 네트워크를 연결하지 않고 실행되도록 설계되었습니다. Claude Sonnet 5.5는 2026년 9월 28일에 해당 공급업체의 가장 빠르고 똑똑한 Sonnet으로 출시되었으며, 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $10.00의 가격이 책정되었고, 네트워크를 통해서만 접근할 수 있습니다. 진짜 결정은 어느 모델이 더 나은가가 아닙니다. 토큰을 어디에서 실행하고 싶은가입니다.
두 가지 모델, 두 가지 직무 정의
Muse Glimmer는 Meta Superintelligence Labs에서 나온 30B 파라미터 모델로, Meta의 더 큰 Muse Spark 교사 모델로부터 로짓 증류를 통해 훈련된 뒤 장문맥 에이전틱 데이터로 미세 조정되고 도구 사용을 위해 강화 학습되었다. Meta는 이미 양자화된 상태로 출시했다: 4비트는 전체 정밀도에서 55GB가 넘던 메모리 사용량을 20GB 미만으로 줄여, 24GB 또는 32GB 소비자용 GPU 범위 안에 들어가게 한다. Meta는 Nvidia RTX 5090과 Apple M4 Max 및 M5 Max 실리콘에서 테스트했다. 이 모델은 텍스트와 이미지 입력을 받고 텍스트를 반환하며, Meta가 262,144까지 확장할 수 있다고 말하는 131,072토큰 컨텍스트 윈도우로 작동하고, 2026년 1월 지식 컷오프를 갖는다.

Claude Sonnet 5.5는 Anthropic의 5.5 세대에 속한 두 번째 모델이며, 회사가 자사 라인업에서 속도와 지능의 최고 조합으로 내세우는 모델입니다. 1,000,000토큰 창을 운영하고, 동기식으로 최대 128,000개의 출력 토큰을, 그리고 Message Batches API에서는 output-300k-2026-03-24 헤더 뒤에서 300,000개까지 지원하며, 텍스트, 이미지, 파일을 받아들이고, 2026년 6월 컷오프와 함께 선택 가능한 노력 수준에서 적응형 사고를 제공하며, 출시 시점부터 제로 데이터 보존으로 이용할 수 있습니다. 저장 비용은 캐시 읽기 백만 토큰당 $0.20, 캐시 쓰기 백만 토큰당 $2.50입니다. Anthropic은 Claude Sonnet 5보다 30% 더 빠르게 실행되고 요금은 그대로인 상태에서 작업당 최대 30% 더 저렴하다고 말합니다 — 공급업체의 주장이며, 독립적으로 재현되지 않았습니다.
스펙 대비는 한 번에 훑어볼 가치가 있습니다. 거의 모든 항목이 더 낫거나 더 나쁜 것이 아니라 서로 다른 종류의 것이기 때문입니다:
• 가중치 — Muse Glimmer Apache 2.0, 다운로드 가능, 4비트로 양자화 vs Claude Sonnet 5.5 폐쇄형
• 실행 위치 — 자체 GPU에서 오프라인으로 실행되는 Muse Glimmer vs Anthropic 인프라에서 실행되는 Claude Sonnet 5.5
• 매개변수 — Muse Glimmer 총 30B, 4비트에서 20GB 미만 vs Claude Sonnet 5.5 미공개
• 컨텍스트 — Muse Glimmer 131,072 토큰, 262,144까지 확장 가능 vs Claude Sonnet 5.5 1,000,000 토큰
• 백만 개당 가격 — Muse Glimmer는 토큰당 요금 없음, 귀하의 하드웨어 vs Claude Sonnet 5.5 $2.00 입력 / $10.00 출력
• Intelligence Index v4.3.2 — Muse Glimmer 17 대 Claude Sonnet 5.5 56
• 측정된 Index 작업당 비용 — Muse Glimmer $0.06 vs Claude Sonnet 5.5 $7.60
그 목록에 있는 두 숫자는 따로 풀어볼 가치가 있습니다. 둘 다 함정이기 때문입니다. 첫 번째는 작업당 $0.06이라는 숫자입니다. 이는 Artificial Analysis가 Muse Glimmer (high)를 호스팅 엔드포인트를 통해 호출하는 데 지출한 금액으로, 입력 100만 개당 $0.325, 출력 100만 개당 $1.35였습니다. 따라서 이는 이 모델을 실행하는 경제성이 아니라 임대하는 경제성을 측정한 것입니다. 자체 호스팅하면 토큰당 한계 비용은 사라지고, 이미 보유했거나 구매해야 하는 GPU로 대체됩니다. 두 번째는 Index 격차 자체입니다 — 20 GB로 양자화된 30B 모델이 프런티어 모델과 같은 잣대로 채점되고 있으며, 리더보드는 Muse Glimmer를 오픈 웨이트 모델 중 상위 몇 자리에 놓으면서도 크기에 비해 비싸다고 지적할 때 바로 그 점을 말해 줍니다.

Muse Glimmer가 진정으로 뛰어난 곳, 그리고 일이 틀어지는 곳
종합 점수는 전체 답이 되기에는 너무 뭉툭하다. Muse Glimmer가 모든 항목에서 일률적으로 17점인 것은 아니기 때문이다. 그것은 빠르다 — Artificial Analysis가 초당 143.8 출력 토큰을 측정해 Claude Sonnet 5.5의 138.7을 앞선다 — 그리고 간결하다. Index 평가 전반에서 59M 토큰을 생성했으며, 이는 Claude Sonnet 5.5의 410M과 대조된다. 그리고 한 평가에서는 최전선에 가깝다. 장문맥 회상에서 Claude Sonnet 5.5의 82.7%에 맞서 83.3%를 기록한다. 30B 모델이 장문맥 검색에서 최신 최전선 Sonnet과 맞먹는다는 것은 이 페이지에서 가장 놀라운 대목이며, 이는 Meta가 훈련한 방식 — 장문맥 에이전트 데이터, 훨씬 더 큰 교사 모델로부터의 증류 — 과 일치한다.
에이전트 결과는 모델의 한계가 드러나고 순위가 더 이상 호의적으로 보이지 않는 지점입니다. Terminal-Bench 4.0에서 Muse Glimmer는 Claude Sonnet 5.5의 63.6% 대비 0.5%를 기록합니다. 자동화 벤치마크 점수는 0.713 대비 0.068입니다. Humanity's Last Exam: 55.0% 대비 22.0%. 실행 벤치마크에서 이렇게 작은 규모의 결과는 모델이 작업을 완료하지 못한다는 뜻이며, 어떤 로컬 호스팅 비용 절감도 결코 끝나지 않는 작업을 더 저렴하게 만들지 못합니다.
연구 문헌도 이 점에 대해 직설적이며, 이는 묻어두기보다 분명히 말할 가치가 있다: 동료 심사를 거친 멀티 에이전트 오케스트레이션 연구에서 Muse-Glimmer-30B가 테스트된 모델 중 하나였는데, 그 모델이 후보 중 어느 것도 복구하지 못한 것으로 나타났다. 해당 모델에 대한 Meta 자체의 벤치마크 표는 공급업체 문서이며 여기서도 그렇게 표시되어 있다; 위의 Artificial Analysis 수치는 독립적인 측정치이고, 이 글은 바로 그 수치에 기댄다.
그래서 이 구분은 명확히 읽힌다. Muse Glimmer는 긴 입력을 읽고 그에 대해 답하는 데 있어 크기 대비 강력하고, 빠르며, 실행 비용이 저렴하고, 노트북급 GPU에 들어간다. 여러 단계의 소프트웨어 작업을 맡기고 떠나도 되는 모델은 아니다. 그것이 정직한 경계이며, 종합 점수만으로 둘러싼 비교는 그것을 가릴 것이다.
프런티어 요금으로 실제로 사는 것
Claude Sonnet 5.5의 프리미엄은 우선 성능을 사는 것이며, 17포인트의 Index 격차가 이를 가장 잘 드러내는 대표적 형태다. 하지만 $10.00 출력 요금과 함께 따라오는 세 가지 다른 요소는 어떤 리더보드에도 나타나지 않는다.
첫 번째는 윈도우입니다. 100만 토큰은 Muse Glimmer의 131,072의 약 7.5배이며, Anthropic은 그 전체에 대해 표준 요금을 청구합니다. 캐시 읽기는 입력 가격의 10분의 1로 책정되어 많은 호출에 걸쳐 큰 컨텍스트를 유지하는 일이 이론에 그치지 않고 감당 가능하도록 합니다. 리포지토리 규모의 프롬프트는 더 작은 윈도우에 전혀 들어가지 않으므로, 이는 선호의 차이가 아니라 역량의 차이입니다.
두 번째는 도구 충실도입니다. Claude Sonnet 5와 Claude Sonnet 5.5 사이에서 다섯 가지 동작이 바뀌었으며, 다섯 가지 모두 도구 사용과 추론에 관한 것입니다: 기본값이 아닌 샘플링 매개변수는 이제 400을 반환하고, thinking: {"type": "disabled"}는 이제 400을 반환하며 다음이 됩니다: between_tools, 강제 도구 선택으로 "any" 또는 명명된 도구를 지정하는 것은 거부되므로 루프는 auto로 엄격한 도구 사용과 함께 이동해야 하며, 이전 computer_20251124 도구는 Claude API와 Google Cloud에서 거부되며, 사고 블록은 이제 이를 생성한 모델과 계정에 묶입니다. 여섯 번째 변경은 아무것도 실패시키지 않지만 조용해집니다: 도구 호출 사이의 텍스트가 사고 블록 안으로 반환되므로, 스트리밍 애플리케이션은 표시 값을 설정하거나 사전 사고를 끄기 전까지 출력을 표시하지 않습니다. 이는 Sonnet 5를 사용하는 모든 사람에게 하루 분량의 마이그레이션 작업이며, 위의 벤치마크 행들이 측정하는 에이전트적 신뢰성을 얻기 위한 입장료입니다.
셋째는 출처 추적과 데이터 처리입니다. 출시 시점부터 데이터 보존 제로 옵션을 제공하고, Anthropic은 2027년 9월 28일이라는 서비스 종료 하한선을 공표했으며, 이 모델은 Claude API, Bedrock, Google Cloud, Microsoft Foundry에서 이용할 수 있습니다. 규제를 받는 구매자에게 이런 사항은 벤치마크보다 먼저 구매 여부를 결정짓는 조달상의 사실입니다.
오프라인은 비용 절감이 아니라 필수 요구사항이다
이 조합이 한 페이지에 함께 있어야 하는 이유는 특정 부류의 배포에서 Muse Glimmer가 더 저렴한 선택지가 아니라 유일한 선택지이기 때문이다. 기기를 떠날 수 없는 요청, 연결성이 없는 공장 현장이나 야외 현장, API 호출이 규정 위반인 에어갭 환경, 또는 왕복이 이미 너무 큰 지연 예산—이 중 어느 것도 네트워크 뒤에 있는 더 나은 모델로는 해결되지 않는다. 20GB 미만에 들어가고 오프라인으로 실행되는 Apache 2.0 가중치가 바로 전부의 답이며, 어떤 가격의 Claude Sonnet 5.5도 이 질문에는 참여하지 않는다.
Meta의 RTX 5090 및 Apple Meta의 실리콘에 대한 공개 테스트는 여기서 "로컬"이 의미하는 바에 대한 실질적인 참고 자료입니다. 4비트 양자화가 있어야 그 장치들을 애초에 사용할 수 있습니다 — 전체 정밀도 풋프린트는 55GB가 넘습니다. 배포를 계획하는 사람이라면 하드웨어 수치를 여기서 측정한 값이 아니라 Meta의 것으로 봐야 합니다.
그 외의 모든 사람에게 이 두 모델은 대체재가 아니라 보완재이며, 운영상 골치 아픈 부분은 Anthropic API 모델과 자체 호스팅 Meta 모델을 함께 보유하는 것이 보통 완전히 분리된 두 개의 스택을 의미한다는 점입니다. OrcaRouter는 200개가 넘는 모델을 하나의 OpenAI 호환 엔드포인트 뒤에 배치하고, 제공업체 정가를 그대로 전달하며 마진을 붙이지 않습니다, 업스트림 제공업체 간 자동 페일오버와 호출을 조합하기 위한 라우팅 DSL을 제공합니다 — 이는 그 구성에서 호스팅되는 절반을 담당합니다. 그리고 Meta의 더 큰 Muse Spark 1.2 교사 모델은 여기에서 다음과 같이 라우팅할 수 있습니다: meta/muse-spark-1.2 — 입력 백만 토큰당 $1.25, 출력 $4.25, 1,048,576토큰 윈도우, 캐시 읽기 $0.15입니다. 이 카탈로그를 통해 주당 4,280만 토큰의 트래픽을 처리하고 있는데, 바로 이것이 이 구성의 유용한 부분입니다: 호스팅된 교사 모델은 다른 모든 것과 같은 키를 사용하고, 로컬에서 실행하는 모델은 네트워크에 전혀 접촉할 필요가 없습니다.
틀리기 쉬운 부분이라, 정직하게 세 가지를 짚고 넘어갑니다. Muse Glimmer 자체는 우리 라우트 중 하나가 아닙니다. 해당 모델 카드는 우리 카탈로그에 존재하지 않으며, 이 페이지는 그렇지 않은 듯이 암시하는 대신 그 사실을 명시합니다. 아래 캡처는 실제로 존재하는 모델인 Muse Spark 1.2의 페이지이며, 이는 Muse Glimmer 자체가 아니라 Muse Glimmer가 증류된 체크포인트입니다. Claude Sonnet 5.5 역시 출시된 지 하루가 지난 시점에 우리 카탈로그에 없습니다. 그 라우트는 Anthropic 자체 API이며, Claude Sonnet 5는 6월 30일부터 여기에서 $2.00 및 $10.00으로 라우팅할 수 있었습니다 스테이징 대상을 원하는 분들을 위해서입니다.

결정하는 방법
점수가 아니라 제약에서 출발하라. 요청이 특정 머신이나 네트워크를 벗어날 수 없다면, Muse Glimmer가 답이며 Index 격차는 무관하다 — 오프라인으로 실행되고 긴 컨텍스트 회상에서 프런티어 모델과 맞먹는 30B Apache 2.0 모델은 그 작업에 한해 이용 가능한 최선이다. 요청이 다단계 소프트웨어 작업을 완수해야 한다면, Terminal-Bench에서 0.5%를 기록하는 30B 모델은 이미 보유한 하드웨어와 무관하게 경쟁 대상이 아니다.
그 두 극단 사이에서 결정을 내리는 기준은 의견이 아니라 측정입니다: 자신의 워크로드에서 완료된 작업당 토큰 수를 두 번 가격 매기는데 — 한 번은 Claude Sonnet 5.5의 $2.00 및 $10.00으로, 한 번은 GPU의 상각 비용으로 계산합니다. 전체 비교를 재구성하는 단 하나의 숫자인 Index 작업당 $0.06 대 $7.60은 대부분의 사람들이 직접 실행할 모델에 대한 호스팅 임대 수치이며, 이를 마치 동등한 절감인 것처럼 인용하는 것이 바로 이 페이지가 피하고자 하는 쉬운 실수일 것입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
