
Meta Muse Spark 1.1 리뷰: 여전히 빠르지만, 더 이상 저렴하지 않다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 984 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
4주 동안 Meta Muse Spark 1.1을 선택할 이유는 산술적이었다. 입력 100만 토큰당 $1.25, 출력 $4.25로, 비슷한 가격대의 거의 모든 것보다 도구를 더 잘 실행하는 네이티브 멀티모달 모델이었다. 그런데 2026년 8월 5일, Meta는 첫 번째 터미널 코딩 에이전트인 Muse Code와 함께 Muse Spark 1.2를 출시하면서, 1.1에는 없던 무언가를 새 모델에 추가했다: 입력 $0.10, 출력 $0.20의 기여자 티어였다. 입력은 12배, 출력은 21배 저렴해진 대신, 사용자의 프롬프트로 Meta가 학습하도록 허용하는 조건이었다. Muse Spark 1.1의 가격은 1센트도 움직이지 않았다. 그러나 그 입지는 움직였다.
이것이 지금 이 모델을 검토하기 위한 정직한 기준입니다. Muse Spark 1.1은 더 이상 사용되지 않지도, 가격이 조정되지도 않았으며, 여전히 Meta의 두 추론(checkpoint) 모델 중 더 빠르고 문서화가 잘 되어 있습니다 — 하지만 더 이상 Meta 모델을 임대하는 가장 저렴한 방법은 아니며, Meta가 가장 강하게 밀고 있는 에이전트는 이 모델에서 실행되지 않습니다. 이 리뷰는 1.1이 무엇인지, 측정 가능하게 무엇을 잘하는지, 8월 출시가 무엇을 바꿨는지, 그리고 여전히 이 모델이 옳은 선택인 더 좁은 작업 범위를 다룹니다. 숫자가 Meta 자체 평가에서 나온 경우 그 문장에 명시되어 있고, Artificial Analysis 또는 프로덕션 트래픽에서 나온 경우에도 그렇게 명시되어 있습니다.
간략 평결
• 정의 — 텍스트, 이미지, 비디오, PDF, 오디오를 입력받고 텍스트를 출력하는 네이티브 멀티모달 추론 모델로, 추론 강도를 조정할 수 있으며 도구를 실행하고 컴퓨터를 조작하도록 설계되었다. 비공개 가중치 모델이며 Meta가 제공한다.
• 가격 — 백만 토큰당 입력 $1.25 / 출력 $4.25, 캐시 적중 시 $0.15. 출시 이후 변경 없이, 여전히 GPT-5.6 Sol의 출력 가격($5/$30)의 약 4분의 1, Claude Opus 4.8의 ($5/$25)의 6분의 1 수준이다.
• 지능 — Artificial Analysis Intelligence Index에서 51점, 클래스 내 185개 중 22위(클래스 중앙값 32). 독립적인 측정 결과이며 Meta의 주장이 아닙니다.
• 강점 — 도구 사용과 에이전트 추론, 그리고 진정한 속도: 초당 213.5 출력 토큰으로, Artificial Analysis가 185개 중 2위로 평가합니다.
• 약점 — 순수 추론과 기본 코딩은 중간 수준이고, 긴 문맥 회상은 최고 수준이 아니며, 장황합니다: Intelligence Index를 완료하는 데 65M 중앙값 대비 94M 출력 토큰이 사용되었습니다.
• 새로운 주의사항 — Muse Spark 1.2는 이제 점수가 3점 더 높고, 기여자 등급에서는 비용이 20분의 1에 불과합니다. 1.1이 여전히 우위를 점하는 부분은 지연 시간이며, 그것은 큰 차이입니다.
메타가 8월 5일에 출시한 것 — 그리고 그것이 1.1에 끼친 영향
Muse Code는 현재 베타 버전인 터미널 코딩 에이전트입니다. macOS 및 Linux(Windows 빌드 없음)에서 한 줄 셸 스크립트로 설치되며 muse 바이너리로 실행됩니다. 대규모 저장소에 걸친 전체 소프트웨어 엔지니어링 작업을 수행합니다: 변경 계획, 코드 작성, 결과 검증. Meta가 내세우는 핵심은 아키텍처적 응집성입니다 — 에이전트와 모델이 따로 만들어진 뒤 조립된 것이 아니라 함께 훈련되었다는 점 — 그리고 기능 목록은 Claude Code와 Codex를 정조준하고 있습니다: 터미널을 닫은 후에도 계속 작동하는 백그라운드 에이전트, 이벤트 로그 재개, 병렬 하위 에이전트 워크트리, 그리고 기본적으로 승인이 활성화된 OS 샌드박스. Meta가 공개한 데모는 NVIDIA Hopper 하드웨어에서 최대 24시간 동안 1,000회 이상의 도구 호출을 실행하는 GPU 커널 최적화 루프입니다.
Muse Code는 Muse Spark 1.1이 아닌 1.2를 실행합니다. 이는 이 리뷰를 읽는 모든 사람에게 첫 번째 실질적 결과입니다: 메타의 에이전트를 원한다면, 여러분은 새로운 체크포인트를 사용하고 있는 것입니다.
두 번째 결과는 가격 책정인데, 이 쪽이 더 흥미롭습니다. Meta는 1.2를 단일 모델 ID가 아닌 두 개의 서로 다른 모델 ID로 출시했습니다:
• Standard (muse-spark-1.2) — 백만 토큰당 입력 $1.25, 캐시 입력 $0.15, 출력 $4.25입니다. Muse Spark 1.1과 동일합니다. Meta는 이 등급의 프롬프트와 완성이 제품 개선에 사용되지 않음을 약속합니다.
• 기여자 (muse-spark-1.2-contributor) — 입력 $0.10, 캐시된 입력 $0.002, 출력 $0.20. 그 대가로 귀하는 Meta에게 귀하의 프롬프트와 완성 결과를 바탕으로 향후 모델을 훈련할 수 있는 권한을 부여합니다.
• Muse Spark 1.1 — 기여자 티어가 존재하지 않습니다. 표준 가격으로 유지되며, Meta는 지원 중단을 발표하지 않았습니다.
메타가 기여자 등급에 대해 내세우는 자체 프레이밍은 "종량제 등급보다도 10배 이상 저렴하다"는 것이지만, 이는 과소평가다. 실제 배수는 입력 기준 12.5배, 출력 기준 21.25배이며, 캐시된 입력은 거의 무료 수준인 $0.002이다. 이것이 이번 출시가 만들어낸 "저렴한 가격"이라는 헤드라인이며, 오직 1.2만의 것이다.

다시 쓰인 가격 이야기
예산을 출력 토큰당 $0.20 기준으로 다시 짜기 전에, 기여자 티어의 나머지 약관을 읽어보세요. 그 약관들이 비용을 저렴하게 만드는 이유이기 때문입니다. 요청 속도 제한은 표준 티어에서 문서화된 분당 3,000건에서 기여자 티어에서는 60건으로 떨어집니다. 이는 노트북에서 실험하는 개발자에게는 허용되지만 프로덕션 에이전트 플릿에는 금지되는 상한선입니다. 데이터 거래는 형식적인 절차가 아닙니다. 귀하의 프롬프트와 모델의 완성 결과물은 학습 자료가 됩니다. 고객 데이터, 독점 소스, 또는 기밀 유지 의무가 있는 모든 것을 다루는 사람에게 기여자 티어는 동일한 제품의 더 저렴한 버전이 아니라 다른 제품입니다. Meta는 같은 출시 시점에 유료 경로의 엔터프라이즈 고객을 위해 데이터 보존 제로 옵션을 추가함으로써 이를 인정했습니다.
그래서 정직한 비교는 "1.1 at $4.25 versus 1.2 at $0.20."이 아닙니다. 즉, 표준 가격에서 두 모델의 비용은 정확히 같으며, 1.2가 더 나은 점수를 받은 모델입니다. $0.20 등급은 실질적이고 공격적인 제안이지만, 개인과 실험을 대상으로 하며, 최신 모델에서만 사용할 수 있습니다.
어느 모델에서든 실제로 비용을 좌우하는 것은 표시 요금이 아니라 캐싱입니다. 대표적인 에이전트 스텝을 살펴보겠습니다. 리포지토리 또는 문서 컨텍스트 60,000토큰이 입력되고, 계획 및 응답 3,000토큰이 출력됩니다. 캐시가 없는 콜드 상태에서는 입력 비용 $0.075에 출력 비용 $0.013이 더해져 약 8.8센트, 즉 천 스텝 기준 $88입니다. 컨텍스트 프리픽스를 안정적으로 유지하면 백만 토큰당 $0.15에 캐시에 적중하여 입력 비용이 $0.009로 떨어지므로, 한 스텝은 약 2.2센트, 천 스텝 실행은 $22가 됩니다. 75%의 차이는 전적으로 에이전트 프레임워크가 안정적인 프리픽스를 재사용하는지, 아니면 매 턴 프롬프트를 재구성하는지에 달려 있습니다. 이 리뷰를 읽은 후 하나의 엔지니어링 조치를 취한다면, 모델 선택이 아니라 캐시 키 안정성을 택하세요.
임대하는 곳에 관한 한 가지 구조적 참고 사항입니다. Muse Spark 1.1은 OrcaRouter 카탈로그에 $1.25와 $4.25로 등재되어 있고, 캐시 읽기 비용은 $0.15입니다. 이는 Meta가 청구하는 것과 동일한 수치인데, OrcaRouter는 0% 마크업으로 운영되며 공급업체 정가를 그대로 전달하기 때문입니다. 따라서 공급업체 가격이 변경되면 그곳에 반영되는 그날 바로 여기에도 반영됩니다. Muse Spark 1.2는 아직 카탈로그에 없으며 Meta가 직접 제공합니다. 이는 아마도 지금 실행하려는 비교에서 중요한 의미를 가집니다. GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5, Gemini 3.1 Pro는 모두 하나의 키 뒤에서 정가로 제공되므로, 추가 계약 없이 단일 평가 세트에서 Muse Spark 1.1과 벤치마크할 수 있고, 스프레드시트의 숫자가 청구서의 숫자와 동일합니다.
Muse Spark 1.1이 실제로 무엇인가
Muse Spark는 Mark Zuckerberg가 Alexandr Wang 휘하에 설립한 Meta Superintelligence Labs의 대표 추론 제품군입니다. 이는 전략적 반전을 뜻합니다. Meta의 Llama 모델이 오픈 가중치 방식이었던 반면, Muse 제품군 — Spark와 이미지·비디오 생성기 — 은 폐쇄형으로 제품과 API로 제공됩니다. Spark 1.0은 2026년 4월 8일에 출시되었고, 1.1은 7월 9일 Meta Model API 공개 미리보기와 함께 이어졌습니다. 개발자에게 실질적인 변화는 Meta가 이제 단순한 가중치 게시자가 아니라, 기존의 두 API 공급업체와 직접 경쟁하는 퍼스트파티 API 공급업체가 되었다는 점입니다. 그리고 8월 5일 코딩 에이전트 출시는 이를 가장 분명하게 확인시켜 줍니다.
버전 1.1은 포인트 릴리스가 아닌 실질적인 도약이었다. Artificial Analysis에서 인텔리전스 지수는 3개월 만에 43에서 51로 8포인트 상승했다. 코딩 지수는 12포인트 오른 71을 기록했고, SciCode는 58%, Humanity's Last Exam은 45%로 개선됐다. 메타는 가장 큰 개선이 도구 사용, 컴퓨터 사용, 코딩, 멀티모달 이해에서 나타났다고 밝혔다. 이는 단순히 답변하도록 조정된 것이 아니라 행동하도록 조정된 모델과 일치하는 결과다.
맥락에 관해서는, 이전의 혼란은 해소되었습니다. Artificial Analysis와 OrcaRouter는 둘 다 컨텍스트 창을 1,048,576 토큰으로 명시하며, Meta는 모델이 능동적으로 압축하는 창이라고 설명합니다. 하지만 백만 토큰을 보유하는 것은 그로부터 회상하는 것과 같지 않으며, 1.1의 장문맥 검색 점수 약 54.1은 회상 성능이 평범함을 시사합니다. 창을 보장이 아닌 용량으로 취급하십시오.
추론 노력: 즉시, 숙고, 그리고 아래의 다이얼
Meta의 소비자용 서피스에서 Muse Spark는 두 가지 명명된 모드를 제공한다. Instant는 표준 채팅 턴처럼 확장된 추론 없이 즉시 답변하고, Contemplating은 강화 학습에서 차용한 '생각 압축(thought compression)' 기법을 사용하여 여러 에이전트를 병렬로 실행한다. Meta는 이를 까다로운 과학·분석 작업에서 DeepMind Deep Think 및 GPT-5.4 Pro와 경쟁하도록 포지셔닝한다. API를 통해서는 동일한 기능이 설정 가능한 reasoning-effort(추론 노력) 파라미터로 나타난다 — Artificial Analysis는 모델이 공개하는 가장 비용이 높은 설정인 xhigh에서 점수를 게시한다.
그 다이얼을 품질 슬라이더가 아닌 비용 레버로 취급하세요. 병렬 에이전트 추론은 단일 패스보다 훨씬 더 많은 토큰을 소모하며, 당신이 읽은 벤치마크 수치는 최대 노력으로 생성된 것입니다. 일상적인 호출에는 낮은 수준을 기본값으로 하고, 첫 번째 답변이 틀렸을 때 비용이 많이 드는 경우에만 높은 수준을 사용하세요.
점수 평가: 도구 사용 시 강력함, 사용하지 않을 시 중간 수준
Muse Spark 1.1을 파악하는 가장 확실한 방법은 도구 사용(tools-on)과 미사용(tools-off)을 비교하는 것입니다. 도구를 사용하면 에이전트 테스트에서 선두를 차지합니다. MCP Atlas 88.1 대 Claude Opus 4.8의 82.2, JobBench 54.7 대 48.4, Legal Agent Bench 20.0 대 Grok 4.5의 12.9, 그리고 도구를 사용한 Humanity's Last Exam 62.1 대 57.9입니다. 도구를 사용하지 않으면 평범합니다. 일반 Humanity's Last Exam은 약 45점으로, 같은 테스트에서 Gemini 3.1 Pro의 약 77점에 크게 뒤처집니다.
실행 정밀도에서도 선두 그룹을 뒤쫓고 있다: OSWorld-Verified 컴퓨터 사용 80.8 대 Opus 4.8의 83.4, SWE-Bench Pro 코딩 61.5 대 69.2, DeepSWE 1.1 장기 과업 코딩 53.3 대 GPT-5.5의 67.0, BabyVision 시각 추론 76.3 대 83.6. 이 수치들 중 상당수는 벤더가 보고한 것이며, 일부는 Meta 자체 평가에서 나온 것으로, 서로 다른 하네스에서 실행된 결과다 — 방향성 참고용으로 읽고 자체 작업에서 재테스트하라.

Artificial Analysis의 독립적인 평가는 더 간결하고 더 유용합니다. 지능 지수(Intelligence Index)는 51로, 185개 중 22위이며 클래스 중앙값은 32입니다. 속도는 초당 213.5 출력 토큰으로 185개 중 2위 — 확실히 빠른 모델입니다. 가격 순위는 31위, 캐시 적중 가격은 $0.15로 88% 할인입니다. 장황함(Verbosity)은 인덱스를 통과하는 데 9,400만 출력 토큰으로, 중앙값 6,500만과 대비되는데, 실제 청구 비용의 상당 부분이 여기서 발생합니다. 전체 스위트 평가 총 비용: $548.07.
한 가지 짚고 넘어갈 만한 주의사항: Meta는 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 지원한다고 광고하지만, Artificial Analysis의 1.1 기술 사양 카드에는 평가된 항목으로 텍스트와 이미지만 기록되어 있습니다. 둘 다 사실일 수 있습니다 — API는 벤치마크 도구가 실행한 것보다 더 많은 입력을 받아들이니까요 — 하지만 Meta 외부에서는 비디오나 오디오 워크로드에 대한 결과를 발표한 사람이 없습니다. 혼합 미디어 분석 때문에 여기 오셨다면, 직접 검증할 시간을 확보하세요.
1.2로 이동해야 할까요? 지연 시간에 대한 답변
코딩에 있어 Meta는 긍정적인 입장이며, 그 수치는 내부적으로 일관적입니다: Terminal-Bench 2.1이 76.2%에서 82.9%로, DeepSWE v1.1이 53.0%에서 59.3%로, 그리고 내부 코딩 벤치마크가 68.3%에서 70.6%로 상승했습니다. 이는 Meta가 자체 하네스에서 5회 시도에 대한 pass@1로 실행한 평가로서, 표준적인 주의사항이 적용됩니다 — 즉, 공급업체의 하네스에서 경쟁 모델은 튜닝이 부족한 경우가 많다는 점입니다. 독립적으로, Artificial Analysis는 Muse Spark 1.2를 Intelligence Index 54점으로 평가하여 185개 중 13위를 기록했으며, 이는 1.1보다 3점 높은 수치입니다.
메타가 그 점수를 얻기 위해 지불한 것은 숙고(deliberation)이며, 이는 모든 타이밍 측정 결과에 나타납니다. Artificial Analysis는 각 모델의 최고 추론 수준에서 첫 토큰까지의 시간을 1.2는 26.12초, 1.1은 2.90초로 측정했습니다. 출력 속도는 초당 213.5토큰에서 165토큰으로 떨어졌습니다. 장황함은 9,500만 대 9,400만 토큰으로 약간 증가했으며, 동일한 벤치마크 스위트를 실행하는 비용은 동일한 토큰당 가격 기준으로 $548.07에서 $637.85로 상승했습니다. 마지막 수치가 이 트레이드오프를 가장 명확하게 보여줍니다: 동일한 가격표, 16% 더 많은 토큰 소모, 3포인트 더 높은 인덱스 점수.
{{1}}26초{{/1}} 수치를 주의 깊게 읽으십시오. 오독하기 쉽습니다. 이는 {{2}}최대 노력{{/2}} 벤치마크 측정값이며, API는 기본적으로 중간 설정을 사용합니다. 실제 트래픽 기준점으로, OrcaRouter에서 실행되는 {{3}}Muse Spark 1.1{{/3}}은(는) — 호출자가 실제로 요청하는 모든 노력 수준을 처리하며 — 일주일간의 프로덕션 트래픽에서 첫 토큰까지의 p50 시간이 1.84초, p95가 6.00초이며 오류율은 0입니다. 최대 노력에서의 벤치마크 지연 시간과 기본 노력에서의 프로덕션 지연 시간은 서로 다른 값이며, 그 차이는 일반적으로 한 자릿수 이상입니다.
그래서 이 결정은 작업 부하의 형태에 따라 명확하게 갈립니다. 리포지토리를 컨텍스트에 담은 채 수 분간 작업하는 장기 실행 코딩 에이전트를 돌리고 있다면 1.2가 더 나은 모델이고, 지연 시간 패널티는 애초에 즉각적으로 느껴지지 않았을 작업에 걸쳐 상쇄됩니다. 채팅 인터페이스, 사람이 기다리는 도구 호출 루프, 초 단위로 측정되는 지연 시간 SLO 같은 대화형 서비스를 제공하고 있다면, Muse Spark 1.1이 이 제품군에서 여전히 더 적합한 형태의 모델이며, 그 속도 순위는 반올림 오류가 아닙니다. 8월 출시와 관련해 달라지는 것은 없습니다.
개발자 경험 및 제한
메타 모델 API는 여전히 공개 미리보기 상태이지만, 8월 출시를 통해 글로벌 접근이 확대되고 엔터프라이즈 제로 데이터 보존 옵션이 추가되었습니다. 메타는 OpenAI 스타일 인터페이스와 SDK 접근을 제공하며, Spark는 메타 AI의 "Thinking" 모드에서 소비자에게 제공되고 있습니다. 요금 한도는 이제 추측이 아니라 공개됩니다. 표준 티어의 경우 분당 3,000건의 요청으로 문서화되어 있습니다. 하지만 미리보기 상태는 여전히 미리보기 상태이므로, 용량이 제한되는 날을 대비해 폴백 경로를 유지하세요. 공급자 간 자동 장애 조치는 미리보기 등급 엔드포인트가 필요로 하는 바로 그런 인프라이며, 미리보기 모델을 게이트웨이를 통해 라우팅하는 것이 비용이 들지 않으면서 두 번째 경로를 확보하는 이유이기도 합니다.

OrcaRouter를 통해 모델 ID는 meta/muse-spark-1.1이며, /v1/chat/completions와 /v1/responses가 모두 사용 가능하므로, 기존 OpenAI 호환 클라이언트는 기본 URL과 모델 문자열만 있으면 됩니다:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
= client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "이 문제를 해결하기 위해 도구를 계획하고 실행하세요."}])
print(response.choices[0].message.content)
적합한 곳 — 그리고 그렇지 않은 곳
적합한 용도: 응답 시간이 사람에게 직접 드러나는 도구 실행 및 컴퓨터 사용 자동화; 학습 데이터로 넘길 수 없는 데이터에 대한 비용 민감형 대규모 추론; 텍스트와 이미지, 비디오, PDF 또는 오디오를 혼합하고 미디어 경로에서 자체 검증이 필요한 워크플로; 그리고 가장 어려운 단계를 위해 프리미엄 모델을 예비로 두고 빠르고 저렴한 기본 모델을 원하는 팀.
약한 적합성: 리더보드 최상위 코딩 정확도와 가장 어려운 그린필드 엔지니어링(이는 여전히 Claude Opus 4.8과 GPT-5.6 Sol의 몫이다); 도구 없는 순수 추론 문제; Gemini 3.1 Pro가 선두인 시각적 정밀도 작업; 장기적인 저장소 작업(이는 이제 명시적으로 1.2와 Muse Code의 역할이다); 그리고 Meta의 가장 저렴한 토큰이 필요한 모든 것(그 등급은 이 모델에 존재하지 않기 때문이다).
자주 묻는 질문
Muse Spark 1.2가 출시된 지금도 1.1을 계속 사용할 수 있나요?
네. Meta는 8월 5일 출시에서 지원 중단이나 가격 인상이 없다고 발표했습니다. 1.1은 Meta Model API에 토큰 100만 개당 $1.25와 $4.25로 그대로 남아 있으며, OrcaRouter 카탈로그에도 동일한 가격으로 등록되어 있습니다. 출시에 대한 보도는 일관되게 기존 API 가격이 유지된다고 설명합니다. 그렇긴 하지만, Meta의 엔지니어링 관심은 눈에 띄게 옮겨갔습니다. 코딩 에이전트, 새로운 벤치마크, 저렴한 티어 모두 1.2에 연결되어 있습니다.
Muse Spark 1.1을 $0.10 기여자 등급에서 받을 수 있나요?
아니요. 기여자 티어는 최신 체크포인트인 muse-spark-1.2-contributor의 별도 모델 ID입니다. 1.1에 해당하는 버전은 없으므로, 가장 저렴한 Meta 추론 토큰을 사용하려면 버전을 전환해야 합니다 — 분당 60회 요청 상한을 수락하고, Meta가 사용자의 프롬프트와 완성(completions)을 학습에 사용하는 것을 허용해야 합니다.
Muse Spark 1.2로 업그레이드해야 할까요?
워크로드가 장기 실행 코딩이나 리포지토리 규모의 에이전트 작업이라면, 그렇습니다. 동일한 표준 가격에 Meta 자체 코딩 평가와 Artificial Analysis의 독립 지수 모두에서 더 높은 점수를 받습니다. 워크로드가 대화형이거나 지연 시간에 민감하다면, 아닙니다. 1.2는 세 지수 포인트를 위해 첫 토큰까지의 시간을 약 9배로 늘리고 출력 속도를 23% 수준으로 낮추며, 추론은 끌 수 없습니다. 둘 다 동일한 API에 있으므로 전환은 어느 쪽이든 모델 문자열만 바꾸면 됩니다. 이는 가장 저렴한 A/B 테스트이며, 결정하기 전에 자체 트래픽으로 실행해 볼 가치가 있습니다.
Muse Spark 1.1은 오픈 소스인가요?
아니요, 그게 바로 그 제품군의 요점입니다. 메타의 Llama 모델과 달리, Muse 제품군은 가중치가 비공개이며 제품 및 API로 제공됩니다. 허깅페이스에는 가중치가 없고, 자체 호스팅 경로도 없으며, 제3자 제공업체도 없습니다. 메타만이 이 모델을 서비스하는 유일한 당사자이므로, 단일 제공자 위험에 대한 실질적인 대답은 두 번째 벤더가 아니라 장애 조치(failover)를 갖춘 라우팅 계층입니다.
평결, 한 버전 후
Muse Spark 1.1은 빠르고 저렴하며 진정한 멀티모달 에이전트 모델로, 도구 사용에 강하고 순수 코딩과 추론에서는 솔직히 중간 수준이다. 8월에 측정된 어떤 지표도 악화되지 않았다. 변한 것은 그 주변 제품군의 구성이다. Meta는 이제 동일한 표준 가격에 더 높은 점수를 받는 모델, 데이터를 제공할 의향이 있는 개발자를 위한 대폭 저렴한 등급, 그리고 1.1에서도 1.1을 지정할 수 있는 어떤 환경에서도 실행되지 않는 에이전트 제품을 보유하고 있다.
남은 것은 더 좁지만 실제적인 권고입니다. 사람이 체감할 수 있는 속도로 Meta의 추론 품질이 필요하다면 — 프로덕션에서 첫 토큰까지 1초, 그 이후 초당 213토큰 — 1.1이 여전히 선택할 버전이며, 1.2가 더하는 세 가지 지수 포인트는 9배의 대기 시간을 감수할 만한 가치가 없습니다. 그 속도가 필요 없다면, 더 이상 머물 이유는 많지 않습니다. 어느 쪽이든 하나의 모델 문자열이므로, 솔직한 조언은 자체 평가 세트에서 하루 동안 둘 다 실행하여 지연 시간 예산이 결정하도록 하는 것입니다.
이 글에서 비교한 모델4
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
