
Muse Spark 1.3 Max Reasoning이 출시되었습니다: Meta의 최고 점수를 이끈 설정이 이제 모든 사용자에게 제공됩니다.
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 221 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Muse Spark 1.3 — Meta Superintelligence Labs가 9월 2일에 출시한 프런티어 추론 모델 — 이제 자체 스코어보드가 기반으로 삼았던 모드를 갖추게 되었습니다. 9월 4일, 이틀간의 추가 안전 테스트를 거친 후 Meta는 Meta Model API와 터미널 코딩 에이전트인 Muse Code에서 개발자들이 모델의 가장 컴퓨팅 집약적인 "max" 추론 설정을 사용할 수 있게 했습니다. 최고 AI 책임자 알렉산더 왕(Alexandr Wang)은 X에서 이번 출시를 발표했고, 회사의 @AIatMeta 계정도 이를 확인했습니다. 출시 당시 Meta와 파트너 프리뷰로 제한되었던 구성이 이제는 모든 개발자가 선택할 수 있는 추론 수준이 되었습니다.
그 순서가 중요한 이유는 Muse Spark 1.3의 출시 보도를 지배한 여러 수치들 — DeepSWE v1.1에서 75.4, OSWorld 2.0에서 66.9, GDPval-AA v2에서 1,754 — 이 최대(max) 구성에서 나온 반면, 개발자들이 실제로 호출할 수 있었던 모델은 추론 노력이 "xhigh"로 제한된 채 출시되었기 때문입니다. Meta는 출시 당시 max가 아직 안전 테스트 중이라고 명확히 밝혔지만, 이러한 분리로 인해 헤드라인 스코어보드와 실제 호출 가능한 모델이 이틀 동안 서로 다른 두 가지를 의미하게 되었습니다. 목요일 출시로 그 격차가 해소되었으며, 토큰당 가격은 건드리지 않은 채 이루어졌습니다. 해당 목록의 벤치마크 수치는 Meta 자체 수치이며 독립적인 평가 장치로 재현되지 않은 상태입니다. 이 기사에서 공급업체가 보고한 모든 내용은 그렇게 표시되어 있습니다.
무엇이 보류되었으며 — 9월 4일에는 무엇이 바뀌었나
Muse Spark 1.3의 추론 단계는 이 제품군의 유료 API가 개방된 이후로 같은 구조를 유지해 왔습니다. 추론은 항상 켜져 있으며, Meta Model API의 모델 effort 매개변수는 minimal, low, medium, high, xhigh 중 하나를 선택하고, 단계가 높아질수록 모델은 출력 예산의 더 많은 부분을 추론에 사용합니다. Max는 xhigh 위에 있습니다. 더 많은 연산과 추론 토큰을 사용하며, Meta의 설명에 따르면 장기적 에이전트 작업에서 훨씬 더 강력합니다. 9월 2일 출시 당시 Meta는 xhigh까지 모든 단계를 제공했지만, Max는 자체적으로 '추가 안전 테스트'가 필요하다며 공개 API에서 제외하고 제한된 파트너들에게만 공유했습니다. 이는 독립적인 평가를 실행할 수준은 되지만, 프로덕션 워크로드를 감당하기에는 부족한 규모였습니다.
9월 4일 Wang은 테스트가 완료되었다고 말했다. Max는 이제 Muse Code에서 선택 가능한 설정이며, 설치 스크립트는 dev.meta.ai/install.sh에 있다. 또한 Meta Model API를 통한 muse-spark-1.3 모델 ID에서는 effort 파라미터가 이제 max를 허용한다. Wang은 이틀 간격을 Meta가 "구성 수준에서" 접근을 게이팅하는 방식이라고 설명했으며, Axios에 안전 우려 때문에 Meta가 더 넓은 작업을 중단할 필요는 없었다고 말했다. 그 기간은 짧았지만 분명한 선례다. Meta는 이제 특정 추론 모드를 안전 검토 뒤에 보류하면서, 체크포인트의 나머지 부분은 즉시 출시할 의향이 있다는 뜻이다.
게이트웨이를 통해 Meta 자체 엔드포인트 대신 모델을 호출하는 사람이라면 알아둘 실용적인 주의사항이 하나 있습니다. 여러 서드파티 문서 페이지와 애그리게이터 목록이 출시일에 작성되어 여전히 reasoning effort를 xhigh까지만 열거하고 있습니다. max 값은 Meta 측 롤아웃이므로, max에 도달할 수 있다고 가정하기 전에 호출하는 라우트가 매개변수 표면을 업데이트했는지 확인하세요. 9월 2일에 허용 값 검증을 마친 프록시는 관리자가 따라잡을 때까지 "max"를 거부할 수 있습니다.
max가 실제로 가져다주는 것 — 그리고 도움이 되지 않는 부분
Meta의 목요일 자료에는 자사가 실행하는 벤치마크에 대해 명시적인 max 대비 xhigh 분할이 포함되어 있으며, 이는 지금까지 모델에 대해 공개한 것 중 가장 유용한 정보입니다. 이 모든 것은 벤더가 보고한 것으로, Meta 자체 Muse Code 하네스 안에서 생성되었으며, Meta는 Claude Opus 5 및 GPT-5.6 Sol과의 비교가 경쟁사 자체 최대 설정에서 실행된 "최선의 노력" 수준으로, "공급업체 최적화 성능을 반영하지 못할 수 있다"고 밝혔습니다. 이러한 단서가 있음에도, 그 분할은 명확한 방향성 있는 이야기를 전달합니다:
• OSWorld 2.0(컴퓨터 사용 에이전트 작업) — max에서 66.9, xhigh에서 57.2
• GDPval-AA v2 (지식 작업 에이전트 Elo) — max에서 1,754 vs xhigh에서 1,709
• JobBench(장기적 전문 작업) — max에서 64.9, xhigh에서 61.2
• DeepSearchQA — 89.4로 동점
• Terminal-Bench 2.1(터미널 에이전트 코딩) — xhigh에서 89.2 vs max에서 88.8로, 9월 2일에 출시된 구성이 승리한 유일한 스위트.

그 패턴은 주의 깊게 읽을 가치가 있다. Max는 작업이 긴 에이전트 루프, 즉 컴퓨터를 조작하거나 지식 작업 브리프를 처리하거나 JobBench처럼 하위 작업 일정을 유지하는 작업에서 가장 도움이 된다. 단일 턴 터미널 벤치마크에서는 아무것도 더하지 못했고 약간의 비용만 발생했다. Terminal-Bench는 "더 많은 추론"이 단조로운 업그레이드가 아님을 상기시켜 주며, 더 높은 설정이 모든 곳에서 더 낫다고 가정하는 대신 자신의 워크로드에서 max와 xhigh를 A/B 테스트해야 하는 이유이기도 하다. 메타는 또한 DeepSWE v1.1의 75.4 결과를 max 설정 수치로 명시한다. 이 수치는 6주 전 메타가 Muse Spark 1.2에 대해 보고한 59.3에서 상승한 첫날 헤드라인이다. 독립 평가자가 가장 먼저 다시 실행할 수치가 바로 이것이다.
독립적인 판독이 따라잡기 시작하고 있습니다.
출시 당시 부재했던 것은 독립적인 측정이 전혀 없다는 점이었으며, 그 공백은 마침 max 출시 일정과 맞물려 메워지고 있습니다. Artificial Analysis의 Coding Agent Index(각 모델을 자체 코딩 에이전트 하네스 안에서 평가하고 DeepSWE, Terminal-Bench, SWE-Atlas 태스크를 결합하는 지수)는 이번 주 Muse Code 하네스에서 Muse Spark 1.3 (max)를 68점으로 배치하며, Claude Code를 사용한 Claude Opus 5 (xhigh)에 이어 보드 2위를 기록했고 67점의 Claude Fable 5 (max) 및 65점의 GPT-5.6 Sol (max)보다 앞섰습니다. 같은 보드는 동일한 Muse Code 하네스에서 출시용 xhigh 구성을 64점으로 평가하는데, 이는 독립적인 태스크 세트에서 max가 추가하는 것, 즉 대략 4 인덱스 포인트에 대한 가장 명확한 동등 비교 결과입니다. 해당 보드 행은 max가 아직 파트너 프리뷰 상태일 때 게시되었으며, 그 행이 설명하는 구성이 9월 4일에 일반 공개된 구성입니다.
Artificial Analysis는 출시 이후 max 구성에 대한 자체 모델 카드도 업데이트했습니다. 미리보기 기간 동안 카드에는 제공업체와 가격이 명시되지 않았지만, 현재 라이브 카드에는 입력 토큰 100만 개당 $1.25, 출력 토큰 100만 개당 $4.25라는 표준 가격으로 Meta가 등재되어 있습니다. 이는 Muse Spark 1.2와 동일한 정가이며, 여기에 장황함 주의사항이 추가되었습니다. AA의 평가 실행은 중앙값 7,900만 토큰과 대비해 약 1억 3,000만 토큰을 소비했고, 총 비용은 약 $1,335였으며, 초당 약 190개 출력 토큰 속도 기준으로 AA의 작업당 추정치에서 작업당 약 $0.95에 해당합니다.
이전 보도에서 나온 한 숫자는 버전 확인이 필요합니다. Artificial Analysis는 이번 주 — max가 출시된 바로 그 주 — Intelligence Index를 v4.2로 갱신하면서 전체 모델을 다시 채점하고 중앙값을 이동시켰습니다. 현재 카드에서 max 구성은 비교 대상 모델 중앙값 29 대비 53으로 표시됩니다. 출시 주 보도에 퍼져 있던 62는 이전 버전의 인덱스로 측정된 값이므로 둘은 비교할 수 없습니다. Meta 자체의 위 xhigh-versus-max 구분은 AA의 인덱스와 무관하며 이번 갱신의 영향을 받지 않습니다.

최대 비용이란 무엇인가 — 청구액은 가격표가 아닌 토큰 기준으로 산정된다
메타는 최대 구성에 대한 별도 가격을 공개하지 않으며, 전용 지연 시간 분석도 제공하지 않습니다. 토큰당 가격은 Muse Spark 1.2 및 Muse Spark 1.3의 다른 모든 노력 수준과 동일합니다: 표준 티어에서 입력 토큰 백만 개당 $1.25, 출력 토큰 백만 개당 $4.25, 캐시된 입력 토큰 백만 개당 $0.15입니다. 추론 토큰은 출력 토큰으로 청구되며 출력 예산에 포함됩니다. 따라서 max를 선택하는 것은 항목별 가격 인상이 아니라, 답변 전에 그 예산을 더 많이 사용해 사고하겠다는 약속입니다.
그렇다면 실제 비용 문제는 토큰 볼륨에 달려 있으며, 초기 데이터에 따르면 max는 xhigh가 효율적인 바로 그 지점에서 비용이 많이 든다. AA의 계측된 실행은 단일 구성 평가에서 약 1억 3천만 토큰을 소비했다. 이미 xhigh에서 긴 에이전트 루프를 실행 중인 개발자에게 중요한 A/B 테스트는 "max가 더 많은 작업을 통과하는가"가 아니라 "max가 동일한 워크로드에서 훨씬 더 큰 토큰 비용을 지불할 만큼 충분한 추가 작업을 통과하는가"이다.
Meta의 Contributor 등급은 — {{1}}백만 토큰당 $0.10 입력, $0.20 출력{{/1}} — Meta가 사용자의 프롬프트와 컴플리션을 학습에 사용하도록 허용하는 대가로 동일한 체크포인트에 적용됩니다. Meta는 의미 있는 두 자리 수 퍼센트의 개발자가 이 등급을 선택한다고 말합니다. Contributor의 약관은 모든 제출물을 학습 데이터로 만들고 속도 제한도 빡빡하기 때문에, 프로덕션 팬아웃의 기본값으로는 부적합하지만, 데이터 트레이드오프를 수용할 수 있다면 비용이 많이 드는 max 실험을 저렴하게 실행할 수 있는 정당한 방법입니다.
이 모든 것의 가격 기준점은 Meta의 말을 신용하지 않아도 쉽게 확인할 수 있습니다. Muse Spark 1.3 체크포인트는 이미 OrcaRouter에 Meta 자체 목록 가격으로 등재되어 있는 모델과 동일한 가격으로 책정되어 있기 때문입니다. Muse Spark 1.2는 OrcaRouter에 토큰 100만 개당 입력 $1.25, 출력 $4.25로 마크업 없이 등재되어 있습니다. 따라서 “가격 변동 없음”이라는 주장은 정확히 그 수치를 보여주는 실시간 페이지로 확인할 수 있습니다. Muse Spark 1.3 자체는 아직 OrcaRouter에 등재되어 있지 않습니다. 당사가 취급하는 제공업체가 이 모델을 max로 서빙하기 시작하면, 당사 쪽에 표시되는 가격은 Meta의 목록 가격을 그대로 전달한 것입니다. 당사는 제공업체 가격에 마크업을 하지 않으며, Meta가 가격 인하를 적용하면 해당 인하는 그날 바로 반영됩니다. 이번 릴리스처럼 흥미로운 경제적 측면이 표면 가격보다는 토큰 볼륨에 있는 경우, 그렇게 직접 전달되는 구조 덕분에 실제 청구 금액과 Meta가 공개하는 금액이 동일하게 유지됩니다.

누가 max로 전환해야 할까요?
그 결정은 깔끔하게 갈린다:
• 장기 실행 에이전트 워크로드 — 컴퓨터 사용, 지식 업무 브리핑, Muse Code의 다단계 도구 루프 — 에서는 전환하세요. Meta 자체 스플릿과 AA의 코딩 에이전트 보드 모두에서 가장 큰 최대 이득을 보여주는 부분입니다. 실제 작업 샘플로 먼저 xhigh와 A/B 테스트해 보세요. 장황함은 실제 문제이니까요.
• 대용량, 지연 시간에 민감한 호출이나 짧은 단일 턴 호출에는 xhigh를 계속 사용하세요. 이러한 호출에서 max는 주로 토큰만 추가합니다. Terminal-Bench는 max가 항상 성능을 높여 주지는 않는다는 증거입니다.
• 여기서 세 가지를 주목하세요: 주커버그가 날짜 없이 약속한 오픈 웨이트(open-weights) 릴리스, 향후 몇 주 내에 Muse Spark 1.3이 인스타그램, 페이스북, 메타 AI에 소비자 대상으로 출시되는 것, 그리고 구성이 일반 공개된 지금 Artificial Analysis의 코딩 에이전트 보드가 최대 행(max row)에 가격을 매기기 시작하는지 여부입니다.
이틀간의 게이트는 짧은 것으로 드러났지만, 롤아웃 자체보다 오래 가는 한 가지를 증명했다. Meta의 가장 강력한 Muse Spark 1.3 수치는 결코 환상이 아니었다. 단지 안전 검토를 기다리고 있었을 뿐이다. 9월 4일부터 개발자가 호출할 수 있는 모델과 스코어보드의 모델은 마침내 동일한 모델이 되었다. max가 그 토큰 값을 하는지는 이제 모든 개발자가 Meta의 API나 이미 Muse Spark 제품군에 도달하기 위해 사용하는 어떤 경로를 통해서든 답할 수 있는 경험적 질문이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
