Muse Spark 1.2 vs Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 대 Gemini 3.5 Flash-Lite: 두 연구소, 서브에이전트의 두 가지 정의

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 연구소가 2주 이내에 각자 모델을 출시하면서 같은 단어로 그 모델을 설명했다. 자체 모델 카드에 따르면, Gemini 3.5 Flash-Lite는 "복잡한 다중 에이전트 워크플로우 내에서 집중된 작업을 수행하는 서브에이전트에 적합하다"고 설명된다. 메타는 Muse Spark 1.2가 "계획 및 위임을 위한 기본 에이전트 또는 병렬로 실행되는 서브에이전트 역할을 할 수 있다"고 말한다. 같은 단어를 썼지만, Artificial Analysis가 두 모델을 Intelligence Index로 돌려보고 나서야 그 단어의 의미가 얼마나 달랐는지 드러났다. Flash-Lite는 4,300만 개의 출력 토큰으로 테스트 스위트를 마친 반면, Muse Spark 1.2는 9,500만 개가 필요했다. 두 모델 중 하나는 짧고 자주 생각하는 반면, 다른 하나는 깊고 오래 생각한다. 두 모델 모두 그 결과를 서브에이전트라고 부른다.

그 토큰 비율은 비교에서 의사 결정에 가장 중요한 숫자입니다. 서브에이전트 티어는 한 번에 스무 개, 백 개씩 펼쳐내는 것이기 때문이며, fan-out은 모델이 가진 호출당 습관을 배가시킵니다. 이어지는 내용은 각 연구소가 실제로 구축한 것을 분석하고, 실제 가격에서 fan-out 계산이 어떻게 이루어지는지 살펴보며, 값싼 선택이 오히려 비싼 선택이 되는 경우를 다룹니다.

각 실험실이 그 단어로 의미하는 바

Flash-Lite 버전은 크기별 역할 정의입니다. Gemini 3.5 Flash-Lite는 해당 제품군에서 가장 저렴한 등급이며, 추론 수준을 다단계 서브에이전트 워크로드에 직접 연결한다는 점에서 그 포지셔닝이 주목할 만합니다 — 해당 제품군의 등급이 크기나 속도가 아닌 에이전트 역할로 설명된 것은 이번이 처음입니다. 추론은 필수이지만 기본 노력 수준은 최소이며, 노력 다이얼은 높음(high)이 최대치이고, 모델은 대량으로 스폰되어 빠르게 응답하도록 설계되었습니다. 벤더는 SWE-Bench Pro에서 Gemini 3 Flash의 49.6% 대비 54.2%, OSWorld-Verified에서는 65.1% 대비 74.0%를 보고했습니다 — 두 수치 모두 벤더가 보고한 수치로 독립적으로 재현되지 않았으며, 둘 다 순수 지능 향상이 아닌 에이전트 성능 향상으로 설명됩니다.

Meta의 버전은 토폴로지 기반 역할 정의입니다. Muse Spark 1.2의 제품 카피는 컨텍스트를 수집하고, 계획을 세우고, 병렬 서브에이전트들에게 실행을 위임할 수 있는 — 혹은 그 자체가 그러한 서브에이전트 중 하나가 될 수 있는 — 모델을 설명합니다. 추론 다이얼은 최소에서 xhigh까지이며 기본값은 medium이고, Meta는 대상 워크로드를 명시적으로 제시합니다: 다중 파일 리팩터링, 장기 디버깅 세션, 전체 저장소 생성. 이것은 작업을 직접 수행할 수도 있는 오케스트레이터로 설계된 모델로, 한 번에 스무 개씩 생성되도록 설계된 모델과는 다른 제품입니다.

어느 연구실도 그 특정 주장에 대한 벤치마크를 발표하지 않았다. Meta는 8월 5일에 출시 공지 하나도 없이 1.2를 출시했다 — 자사의 Muse Spark 1.1 발표 페이지는 여전히 이전 버전을 설명하고 있다.

지수가 실제로 측정하는 격차

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

Artificial Analysis가 두 모델 모두에 동일한 9개 평가 복합 지표를 적용하여 산출한 독립적인 점수:

지능 지수 — Muse Spark 1.2 (xhigh) 54점, 185개 중 13위. Gemini 3.5 Flash-Lite 36점, 163개 중 20위. 클래스 중앙값 32 대비 18점.

출력 속도 — 초당 165.0 토큰 대 343.6. Flash-Lite는 두 배 이상 빠르게 스트리밍합니다.

첫 토큰까지의 시간 — 최대 노력 기준 26.12초 대 10.30초. Artificial Analysis는 Flash-Lite의 10.30초가 그 자체로 해당 가격대의 추론 모델 중 높은 편에 속한다고 언급한다.

장황함 — 출력 토큰 수는 동일한 스위트에서 95M으로, 같은 스위트의 43M과 비교되며, 모든 모델의 중앙값은 65M입니다. Muse Spark 1.2는 중앙값보다 46% 높고, Flash-Lite는 34% 낮습니다.

인덱스 운영 비용 — $637.85 대비 $153.08.

차원별 — Artificial Analysis의 하위 지수에 따르면 Gemini 3.5 Flash-Lite는 코딩 49.3, 에이전트 26.8을 기록했습니다. Muse Spark 1.2에 대한 공개된 세부 분석은 아직 없으며, 이전 버전은 71.3과 37.5를 기록했습니다.

18 인덱스 포인트는 반올림 차이가 아닙니다. 이들은 같은 슬롯을 위한 두 후보가 아닙니다.

팬아웃 산술

토큰당 가격은 서브에이전트 티어를 평가하기에 잘못된 기준입니다. 이 티어의 핵심은 에이전트를 여러 개 실행하는 것이기 때문입니다. 정가 기준으로 예를 들어보겠습니다 — Gemini 3.5 Flash-Lite는 입력 $0.30, 출력 $2.50이고, Muse Spark 1.2는 입력 $1.25, 출력 $4.25입니다.

오케스트레이터는 20개의 하위 에이전트를 파견합니다. 각 에이전트는 범위가 지정된 컨텍스트 25,000토큰을 읽고 1,500토큰을 다시 작성합니다.

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = 약 22.5 센트 fan-out당.

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = 약 75센트 팬아웃당.

3과 1/3배는 관리 가능해 보입니다. 이제 측정된 장황함 차이를 적용합니다. Muse Spark 1.2가 인덱스에서 그랬던 것처럼 Flash-Lite보다 비례적으로 더 많은 출력을 생성한다면, 즉 동일한 작업에 대해 약 2.2배의 출력 토큰을 생성한다면, 그 1,500토큰 응답은 약 3,300토큰이 되고, 팬아웃은 약 91센트로 상승합니다. 네 배지, 세 배가 아닙니다. 바쁜 에이전트 시스템에서 시간당 100회의 팬아웃이 발생한다면, 이는 시간당 $22에서 $91까지의 차이, 즉 연속 부하 기준 연간 약 $600,000의 차이를 의미합니다.

두 가지 가격 책정 세부 사항은 실제 격차를 한 방향으로는 더욱 넓히고 다른 방향으로는 더욱 좁힌다:

Flash-Lite는 내부 추론을 출력 속도로 청구합니다. 그 공시 가격은 내부 추론 토큰을 백만 개당 $2.50로 책정하며, 이는 표시되는 출력과 동일합니다. 생각은 무료가 아니라, 단지 응답에서 보이지 않을 뿐입니다. 하위 에이전트가 답변 전에 2,000토큰을 숙고한다면, 호출당 0.5센트를 추가하거나, 팬아웃 전체에 걸쳐 10센트를 추가하십시오.

캐싱은 비율 기준으로 Muse Spark 1.2에 유리합니다. 캐시된 입력 읽기는 $1.25 목록가 대비 $0.15로 88% 할인입니다. Flash-Lite는 캐시된 입력 읽기를 $0.30 대비 $0.03으로 90% 할인하지만, 캐시를 쓰는 데 백만 건당 약 $0.083을 부과하는 반면 Muse Spark 1.2는 별도의 캐시 쓰기 수수료를 공시하지 않습니다. 모든 하위 에이전트가 동일한 큰 접두사를 공유하는 팬아웃의 경우 그 격차는 상당히 줄어듭니다.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

프로덕션 지연 시간은 Flash-Lite가 가장 크게 앞서는 부분이며, 벤치마크 수치는 이를 숨깁니다. OrcaRouter에서 실제 트래픽의 1주일 이동 기간 동안, Gemini 3.5 Flash-Lite는 다음과 같은 수치를 보여줍니다: p50 첫 토큰 도달 시간 816밀리초 및 p95 4.57초. Muse Spark 1.1은 — 1.2에 아직 원격 측정이 없으므로 사용 가능한 가장 근접한 프록시 — 1.84초의 p50과 6.00초의 p95를 보여줍니다. 20개의 서브에이전트가 병렬로 실행될 때, 가장 느린 서브에이전트가 전체 실행 시간을 결정하므로, 팬아웃 지연 시간을 좌우하는 지표는 p50이 아니라 p95입니다.

저렴한 것이 잘못된 선택인 경우

가격 비교에서는 나타나지 않지만 사고 검토에서는 나타날 Gemini 3.5 Flash-Lite의 네 가지 제약 조건.

65,536-토큰 출력 상한. 이는 이 등급의 대부분 모델이 허용하는 용량의 절반이며, 대용량 파일을 생성하거나 긴 구조화 문서를 반환해야 하는 하위 에이전트에게는 넘을 수 없는 벽입니다. Muse Spark 1.2의 엔드포인트는 최대 완료 길이를 전혀 명시하지 않습니다 — 이는 신뢰하기보다 테스트해볼 만큼 특이하지만, 문서화된 제한은 아닙니다.

이것은 중재되지 않은 엔드포인트입니다. Flash-Lite 목록에는 중재 플래그가 없지만, Meta의 Muse Spark 1.2용 목록에는 있습니다. 이는 일부 워크로드에는 진정한 이점이고 다른 워크로드에는 규정 준수 문제이며, 발견이 아니라 의도적인 선택이어야 합니다.

비싼 내장 검색. Flash-Lite의 웹 검색 도구는 천 회 호출당 약 14달러인 반면, Muse Spark 1.2는 2.50달러입니다. 만약 서브에이전트가 단순히 읽기만 하는 대신 조사를 한다면, 저렴한 모델이 비싼 모델이 됩니다 — 5.5배 더 — 그리고 팬아웃 아키텍처에서 검색 볼륨은 팬아웃에 비례하여 증가합니다.

가격은 내린 게 아니라 올랐습니다. Gemini 3.5 Flash-Lite는 $0.30 및 $2.50, 이전 Gemini 3.1 Flash-Lite는 $0.25 및 $1.50에 책정되어 있습니다. 출력 가격은 대체되는 등급보다 67% 더 비쌉니다. 이전 모델에 맞춰 서브에이전트 예산을 책정했다면 다시 조정하세요.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

한 가지 더 비대칭성을 분명히 언급하자면: Muse Spark 1.2는 정확히 한 공급자, 즉 Meta만이 제공하며, 제3자 호스트도 폴백도 없습니다. Gemini 3.5 Flash-Lite는 일반적인 퍼스트파티 다중 리전 서빙 풋프린트를 갖추고 있습니다. 오케스트레이터에게는 이것이 전체 에이전트 트리의 단일 실패 지점이고, 워커 계층에게는 팬아웃의 단일 실패 지점입니다.

대부분의 팀들이 실제로 선택하게 될 조합

서로 대조해서 읽으면, 이 두 모델은 경쟁자라기보다는 하나의 아키텍처를 구성하는 두 절반이며, Meta 자체 제품 설명도 기본 에이전트 역할과 하위 에이전트 역할을 별도로 설명할 때 이를 방증한다.

숫자들로부터 도출되는 형태: 오케스트레이터로는 Muse Spark 1.2, 워커로는 Gemini 3.5 Flash-Lite. 리포지토리를 읽고 계획을 유지하며 무엇을 위임할지 결정하는 하나의 비싸고 신중한 호출 — 26초의 사고와 95M 토큰 규모의 장황함이 실행할 가치가 있는 계획을 제공한다 — 뒤에는 각각 하나의 범위가 지정된 작업을 수행하고 p50에서 1초 미만으로 응답하는 스무 개의 저렴하고 빠르며 좁은 호출이 따른다. 프런티어에 준하는 요율을 작업당 한 번 지불하고, 작업 단위당 저비용 요율을 지불하는데, 이것이 바로 팬아웃 아키텍처가 원하는 비용 곡선이다.

그것을 뒤집으면 경제성이 붕괴된다. 팬아웃당 91센트인 뮤즈 스파크 1.2 서브에이전트 20개는 18포인트 더 약한 모델이 3분의 1 시간에 완료하는 작업 비용의 4배이며, 인덱스 36의 플래시-라이트 오케스트레이터는 작업자들이 구제할 수 없는 계획을 만들어 낼 것이다.

두 벤더에 걸쳐 나뉘어 있던 구성이 예전에는 까다로운 부분이었습니다. Gemini 3.5 Flash-Lite는 OrcaRouter 카탈로그에 $0.30 및 $2.50으로 등록되어 있습니다. 이는 벤더 정가를 0% 마크업으로 전달한 가격으로, 가격 변경이 계약 주기 이후가 아니라 당일에 저희 쪽에 반영됩니다. 그리고 Muse Spark 1.1도 같은 기준으로 $1.25 및 $4.25에 있으며, 둘 다 하나의 OpenAI 호환 엔드포인트 뒤에 있습니다. 즉, 오케스트레이터-워커 패턴은 두 개의 SDK, 두 개의 키, 두 개의 인보이스 대신 하나의 코드베이스에 두 개의 모델 문자열로 존재하게 되고, 자동 장애 조치가 팬아웃 중 한 벤더의 일시적 장애 상황을 커버합니다. 사용 가능한 것을 정확히 말하자면: Muse Spark 1.2 자체는 아직 카탈로그에 없습니다 — Meta가 유일한 제공자로서 이를 직접 서비스하며 — 따라서 오늘날 이 스택에서 가장 가까운 버전은 오케스트레이터 슬롯에서 1.1을 실행합니다.

역할로 선택하라, 점수가 아니라

작업자 티어를 선택한다면 — 문서 파싱, 데이터 추출, 범위가 제한된 파일 편집, 분류, 에이전트 트리의 좁고 반복적인 중간 단계 — Gemini 3.5 Flash-Lite가 더 나은 도구이며, 추론을 요구하는 것이 아니므로 18포인트 지수 격차는 대부분 무의미합니다. 출력 상한과 검색 가격에 주목하세요.

작업자가 수행할 작업을 결정하는 모델을 선택한다면, Muse Spark 1.2가 둘 중 더 강력한 후보입니다. 다만 독립적인 차원별 에이전트 점수가 없고, 어떤 아레나 기록도 없으며, 프로덕션 텔레메트리도 없고, 제공 업체가 하나뿐이라는 단점이 있습니다. 프로덕션 계획을 갖추려면 이러한 격차를 해소해야 합니다.

만약 하나의 모델이 두 작업을 모두 수행하리라 기대했다면, 측정 결과에 따른 솔직한 대답은 어느 모델도 그렇지 않다는 것입니다. Flash-Lite는 인덱스 36에서 계획을 세울 수 없고, Muse Spark 1.2는 팬아웃당 91센트에 한 번에 20개씩 생성할 수 없습니다. 두 제품 설명에 모두 등장하는 "subagent"라는 단어는 마케팅상의 우연일 뿐, 같은 슬롯에 속한다는 신호가 아닙니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube