
Muse Voice Transcribe: Meta의 스트리밍 음성-텍스트 모델, 해설
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 1009 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
Muse Voice Transcribe는 Meta의 스트리밍 음성-텍스트 변환 모델입니다. Meta Model API에서 오디오 1시간당 $0.18에, 모델 ID muse-voice-transcribe-1.0으로 실행되며, 실시간 오디오를 스트리밍하든 완성된 녹음을 넘기든 가격은 동일합니다. 이 모델이 한 줄짜리 가격 확인이 아니라 참조 문서로 볼 가치가 있는 이유는 작업이 어디에서 일어나는지에 있습니다. 20개가 넘는 목소리에 대한 화자 귀속과 발화 종료 감지가 스트림 끝에 덧붙여지는 배치 처리 단계가 아니라 인식 모델 내부에서 실행됩니다. 이는 음성-텍스트 변환 전용입니다 — Meta의 개발자 문서에도 그렇게 명시되어 있습니다. 음성을 합성하지 않으며 음성-대-음성 대화 API를 제공하지도 않습니다.
이 페이지는 독자가 모델의 이름 자체를 검색한 뒤 도착하는 페이지입니다. 그래서 발표문이라기보다 두 가지 질문, 즉 이 모델은 무엇이며 오디오 한 시간의 비용은 얼마인가에 대한 안정적인 답이 되도록 만들어졌습니다.2026-09-01에 날짜가 명시된 발표 글 Muse Voice Transcribe 소개에서 Meta Superintelligence Labs가 Muse Voice Transcribe를 공개했습니다. 이 글은 독자가 여전히 Meta의 블로그 색인을 통해 찾아갈 수 있지만, 이제 자체 URL에서는 응답하지 않습니다. 아래의 모든 내용은 2026-09-29에 Meta 자체 페이지에서 읽은 것으로, 주로 모델 페이지와 API의 음성-텍스트 변환 및 개요 문서를 참고했습니다. Meta가 수치를 공개하지 않은 부분에서는 이 페이지는 대리 수치를 끌어오는 대신 그 사실을 그대로 밝힙니다.
Meta의 용어로 말하자면, 그것은 무엇인가
Meta 자체 문서는 설명을 다음과 같이 명확히 시작합니다. "Muse Voice Transcribe는 Meta Model API의 Meta 음성-텍스트 모델입니다. 발화 턴 감지, 화자 레이블, 어휘 바이어싱과 함께 실시간 오디오나 기존 녹음을 전사하세요." 개요 페이지는 같은 내용을 한 문장으로 압축합니다 — 스트리밍 화자 분리, 네이티브 엔드포인팅 및 음성 활동 감지, 문맥 및 키워드 바이어싱, 그리고 코드 스위칭이 포함된 25개 평가 언어. 따라서 출력은 세 가지 레이블을 한 번에 담는 단일 전사 스트림입니다: 단어, 말하는 사람, 그리고 발화가 끝났는지 여부. 이는 대부분의 프로덕션 스택이 현재 인식기와 별도의 음성 활동 감지기, 별도의 화자 분리 모델을 조합해 구성하는 조합이며, 각각 자체 지연 예산을 가지고 있습니다.
Meta의 모델 페이지는 이를 "20명 이상의 화자에 대한 실시간 귀속과 함께 경쟁력 있는 지연 시간 및 스트리밍 전사 정확도"라고 표현하고, 개발자 문서는 출력 필드를 "턴 수준 타이밍과 선택적 화자 레이블이 포함된 전사 텍스트"라고 설명합니다. 여기에서 두 가지가 따라오며, 둘 다 프레이밍보다 더 중요합니다:
• 오디오 입력, 텍스트 출력 모델입니다. 텍스트 입력도, 텍스트 출력도 아니며, Meta는 이것이 음성 생성기가 아니라고 분명히 밝히고 있습니다.
• 스트리밍 모델이 우선입니다. 실시간 경로는 파일 경로를 감싼 래퍼가 아니라, 아래에 설명된 대로 자체 이벤트와 모드, 한도를 가진 WebSocket 세션입니다.
오디오 한 시간에 드는 비용
Muse Voice Transcribe에 관한 Meta의 모델 페이지는 가격을 "단일 모델로 시간당 $0.18에 구축"으로 명시하고 있으며, 사양 표에는 muse-voice-transcribe-1.0을오디오 1시간당 $0.18 및 1,000분당 $3.00으로 기재하고 있습니다. 이는 하나의 요금을 서로 다른 두 가지 단위로 표현한 것으로, 2026-09-29 기준으로 확인한 Meta 자체 페이지에 둘 다 표기되어 있습니다. 개발자 문서는 같은 요금을 세 번째 방식으로 명시합니다: "가격은 시간당 $0.18이며, 이는 처리된 오디오 기준입니다." 이 페이지의 어떤 수치도 Meta 가격 페이지에서 가져온 것이 아닙니다. 읽을 수 있는 Meta 가격 페이지가 존재하지 않기 때문입니다. 문서는 이 요금을 "Pricing and rate limits" 페이지로 연결하는데, 2026-09-29 기준으로 확인했을 때 해당 페이지는 이 페이지를 사용할 수 없습니다라고 응답하므로, 모델 페이지가 이 요금의 기록 출처(source of record)이며, 여기서 사용된 유일한 출처입니다.
청구 관련 세부 내용은 개발자 문서에 있으며, 워크로드 규모를 산정하기 전에 알아 둘 가치가 있습니다:
• 스트리밍과 비스트리밍의 비용은 동일합니다. 실시간 엔드포인트에 대한 추가 요금은 없습니다.
• 제로 데이터 보존 처리는 문서에 따르면 스탠더드 등급과 동일한 가격으로 책정됩니다 — 추가 요금 항목이 아닙니다.
• 과금은 정수 초 단위로 내림 처리되므로, 2초짜리 턴은 3초가 아니라 2초로 과금됩니다.
• 전사본이 생성되기 전에 발생한 실패는 청구되지 않으며, 429 속도 제한 응답도 청구되지 않습니다.
• 무료 크레딧은 모델 수준이 아니라 플랫폼 수준에 존재합니다. Meta의 음성 텍스트 변환 문서는 가격 책정 문단을 "플랫폼 무료 티어 크레딧이 적용됩니다."라는 문장으로 끝맺습니다. 이 모델 관련 페이지에서 '무료'와 관련된 표현은 이것뿐이며, 이는 의도적으로 구체적이지 않습니다. 즉 전사를 위한 무료 허용량을 약속하는 것이 아니라 플랫폼 크레딧 제도를 가리키며, 이에 대한 수치, 기간 또는 자격 규칙은 어디에도 명시되어 있지 않습니다. 이것을 모델을 위한 무료 티어가 아니라 청구 금액을 줄여줄 수 있는 크레딧으로 읽어야 합니다. 개인 에이전트가 "사람들이 필요로 하는 대부분의 용도에 무료"라고 밝힌 Meta의 소비자 대상 성명은 Muse 앱에 관한 별도의 문장이며 Model API에는 적용되지 않습니다.
구체적인 예시를 들어 보자. 시간당 요금은 체감하기 어렵기 때문이다. 2시간짜리 녹음 인터뷰의 전사 비용은 $0.36이다. 1,000시간의 통화 오디오, 즉 중간 규모 컨택 센터의 대략 한 달치 통화량은 $180이다. 그 규모에서는 단가가 논거의 전부이며, 단가는 또한 당신 발밑에서 달라질 수 있는 유일한 것이기도 하다. Meta의 페이지가 이에 대한 기준이며, 그곳에서 수치가 바뀌면 여기서도 바뀐다.
스트리밍 인터페이스, 엔드포인트별로
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• 라이브 오디오 — wss://api.meta.ai/v1/asr/realtime. 전송 방식은 WebSocket이며, 인증 세부 사항은 함정입니다: 핸드셰이크 프레임에서 인증하며, Authorization 헤더는 무시됩니다. 핸드셰이크는 첫 번째 JSON 텍스트 프레임이어야 하며 10초 이내에 도착해야 합니다. 세션은 최대 60분 동안 지속되고, 새 WebSocket은 새 세션을 생성하며, 재개 토큰은 없습니다.
• 녹음 — POST https://api.meta.ai/v1/asr/transcribe. 멀티파트 업로드이며, 이 요청은 합니다 헤더로 인증Authorization. 입력 형식은 제한적입니다: 모노 16비트 PCM WAV, 16 또는 24 kHz만 가능합니다. 최대 용량은 요청 본문당 32MB, 요청당 오디오 10분입니다.
실시간 세션에서는 세 가지 모드가 여러분이 받는 내용을 바꿉니다. PUSH_TO_TALK은 기본값이며 단일 턴 전사를 수행합니다. ENDPOINTING은 모델이 감지한 턴 경계를 제공하며, 감지된 음성 세그먼트마다 하나의 턴으로, speechStart, 반복되는 transcript, speechEnd 및 speechComplete 이벤트를 방출합니다 — 단, speechEnd는 전사가 아니라는 경고가 함께 제공됩니다. DIARIZATION은 자동 화자 감지 및 귀속을 추가하여 speaker 이벤트를 A 및 B와 같은 레이블로 방출합니다. 부분 전사는 각 부분이 이전 것을 대체하는 누적 방식이나 델타 방식으로 제공됩니다.
같은 문서에 있는 두 가지 운영상 세부 사항은 놓치기 쉽고, 프로덕션에서 발견하면 큰 대가를 치르게 됩니다:
• 다이어리제이션은 명확한 발화 종료 지점이 아니라 가능한 새 화자를 표시하며, Meta는 이것이 저지연 음성 명령 용도에 맞게 튜닝되지 않았다고 밝힙니다. 레이블을 세션 범위 식별자로 취급하세요 — A는 한 세션에서 다음 세션의 A와 같은 사람이 아닙니다.
• 턴은 서로 겹칠 수 있으므로, 턴별 상태는 도착 순서가 아니라 턴 식별자를 키로 삼아야 합니다.
• 공개된 테넌트당 한도는 동시 128개 및 시간당 16,000개 스트림입니다.
모델 내부에서 실행되는 것과 그것이 대체하는 것
Meta의 모델 페이지는 점수가 아니라 아키텍처에 대해 구체적인 주장을 합니다. “20명 이상의 화자에 대한 화자 귀속과 발화 종료 감지는 인식 모델 내부에서 이루어집니다”라고 말하며, 이를 오디오 스트림 끝에서의 일괄 처리와 명시적으로 대비합니다. 실질적인 차이는 기다려야 할 두 번째 단계가 없다는 점입니다. 화자 레이블과 턴 경계는 단어와 동일한 스트림으로 도착하므로, 다운스트림 음성 에이전트나 실시간 캡션 인터페이스는 후처리 단계 없이 완성된 턴과 화자 식별 정보를 얻습니다.
Meta가 모델 내에 존재한다고 문서화한 다른 기능들:
• 네이티브 엔드포인팅 및 음성 활동 감지 기능을 제공하므로 API 앞에서 자체 VAD를 실행하지 않아도 됩니다. 문서의 표현에 따르면, 자체 음성 활동 감지를 실행하지 않고도 발화당 하나의 완성된 스크립트를 얻을 수 있으며, 감지된 발화 종료가 세션을 종료시키지 않습니다.
• 문맥 및 키워드 바이어싱, 파인튜닝 없음. Meta의 모델 페이지는 정확도가 "문맥 및 키워드 바이어싱을 통해, 파인튜닝 없이" 유지된다고 설명하며, 이는 스트리밍 ASR을 일반 언어 평균이 아니라 도메인 어휘 — 의약품명, 티커 심볼, 제품 SKU — 에서 사용할 수 있게 해 주는 기능입니다. 문서는 한계를 정확히 밝힙니다: 키워드는 인식을 바이어스하지만 정확한 철자를 보장하지 않으며, 키워드와 언어 바이어스 모두 세션 시작 시 고정됩니다.
• 코드 전환(code-switching)을 지원하는 25개 평가 언어. 문서에는 다음과 같이 나열되어 있습니다: 아랍어, 벵골어, 네덜란드어, 영어, 프랑스어, 독일어, 히브리어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 칸나다어, 한국어, 말레이어, 중국어(만다린), 마라티어, 폴란드어, 포르투갈어, 스페인어, 타갈로그어, 타밀어, 텔루구어, 태국어, 터키어, 베트남어. 다음에 어떤 언어가 나올지 미리 알려주지 않은 채 문장 중간과 발화 중간에 전환하는 코드 전환은 단일 언어 인식기가 구조적으로 제공할 수 없는 기능입니다. 기억해 둘 만한 주의점 하나: 언어 바이어스는 자유 형식 문맥이 아니라 언어 목록이며, 모델이 해당 언어들을 사용하도록 강제하지는 않습니다.
날짜가 명시된 발표 게시물은 더 나아가, 모델이 70개 이상의 언어로 학습되었으며 그중 25개 언어는 "광범위하게 검증됨"이라고 말합니다. 이는 공급업체가 보고한 내용이며, 검증된 25개 목록은 Meta가 보증하는 부분집합입니다. 계획 시 기준으로 삼아야 할 범위는 70개가 아니라 바로 그 25개입니다.
문서에 명시된 제한
참조 페이지는 그것이 명시하는 제약 조건만큼만 유용하며, 메타는 여러 가지를 명시한다.
• 단어 수준이 아닌 턴 수준 타임스탬프입니다. 모델 페이지와 문서 모두 이를 분명히 밝히고 있습니다: "턴 수준 타임스탬프를 반환하지만, 단어 수준 타임스탬프는 반환하지 않습니다." 턴에는 밀리초 단위의 시작 및 종료 시간이 포함됩니다. 제품에 단어별 클릭 후 탐색 기능 — 노래방 가사 하이라이트, 단어별 신뢰도 라우팅, 강제 정렬 — 이 필요하다면, 이 모델은 잘못된 선택이며 아무리 프롬프트 엔지니어링을 해도 그 사실은 달라지지 않습니다.
• 신뢰도 점수도, 사운드 이벤트 감지도, 감정 감지도, 전사문 재포맷팅도 없습니다.Meta는 이 네 가지를 모두 사용할 수 없다고 명시합니다. 얻을 수 있는 것은 단어, 턴, 타이밍, 화자 레이블뿐이며, 모델이 얼마나 확신하는지에 대한 정보는 없습니다.
• 음성 합성 및 음성-음성 대화 API가 없습니다. 단방향입니다.
• 파일 경로에서는 오디오 형식이 제한적입니다. 모노 16비트 PCM WAV, 16 또는 24kHz입니다. 그 외의 형식은 업로드하기 전에 변환해야 합니다.
오픈 웨이트, 그리고 Muse Glimmer 혼란
Muse Voice Transcribe는 독점 모델이며 API를 통해 제공됩니다 — 오픈 웨이트 릴리스가 아니고, Meta의 문서에서도 그렇게 주장한 적이 없습니다. 이 점이 중요한 이유는 독자들이 Muse 제품군의 오픈 웨이트 경로를 잘못된 이름에 연결하기 때문입니다. Muse Glimmer가 바로 그 경로입니다: Meta의 문서는 이를 Muse Spark에서 증류된 오픈 웨이트 멀티모달 모델로 설명하며, 허용적인 Apache 2.0 라이선스로 배포되어 vLLM, SGLang, llama.cpp, ExecuTorch 같은 런타임을 통해 자체 하드웨어에서 다운로드해 실행할 수 있습니다. Muse Voice Transcribe는 같은 페이지에서 Muse Spark, Muse Image, SAM과 함께 다운로드하는 대상이 아니라 호출하는 모델로 분류됩니다.
그러니까 Muse Voice Transcribe에는 가중치가 없고, 자체 호스팅 옵션도 없으며, 이를 감사하거나 미세 조정할 방법도 없습니다. 어떤 페이지에서 그렇지 않다고 말한다면, 그것은 이를 Muse Glimmer와 혼동한 것입니다. 모델의 가중치가 공개되지 않은 경우, 서빙 플랫폼이 전부입니다. 그리고 그것이 다음 섹션에서 다룰 내용입니다.
클라이언트가 그것에 도달하는 방법
Meta의 Model API는 이미 보유한 클라이언트에 바로 투입할 수 있도록 만들어졌습니다. API 개요 페이지에 명시된 공급업체의 주장에 따르면, Model API는 "OpenAI 호환 및 Anthropic 호환 클라이언트 라이브러리와 OpenAI 호환 에이전트 CLI에 드롭인 호환됩니다. 클라이언트의 기본 URL을 설정하고 키를 추가한 뒤 나머지 코드는 그대로 유지하세요."라고 합니다. Model API 전반적으로 세 가지 요청 형태가 제공됩니다 — Responses API, Chat Completions API, Messages API — 따라서 기존 통합은 보통 재작성 없이 일치하는 표면을 갖습니다. 범위에 관한 한 가지 주의: 그 호환성 문장과 그 세 가지 형태는 Model API 전체의 기능이며, Muse Voice Transcribe 자체 모델 페이지에 인쇄된 문구가 아닙니다. 모델 페이지 자체의 퀵스타트는 더 좁습니다 — 기존 OpenAI 호환 클라이언트를 Meta Model API로 향하게 하라고만 말하며, 5분 이내에 첫 번째 작동하는 요청을 갖게 될 것이라고 합니다.
참조 페이지에서 짚어 둘 만한 솔직한 한 가지 공백: 이 모델에 관한 Meta의 문서에는 Muse Voice Transcribe용 공식 클라이언트 라이브러리가 명시되어 있지 않으며, "클라이언트 라이브러리" 페이지는 Voice 섹션이 아니라 SAM 섹션 아래에 있습니다. 음성-텍스트 가이드가 대신 제공하는 것은 구체적인 종속성 목록 — Python 3.9 이상과 websockets 및 sounddevice 패키지 — 그리고 Voice API 기초 쿡북입니다. 따라서 드롭인 주장은 일반적으로 Model API의 요청 표면을 설명하는 것이며, 실시간 ASR 엔드포인트 자체는 고유한 핸드셰이크 규칙을 가진 WebSocket이고 문서화된 래퍼가 없습니다.

Meta가 아직 공개하지 않은 것
벤치마크가 없다는 것은 문서에 관한 사실이므로, 여기서도 그렇게 명시한다. Muse Voice Transcribe에 대한 Meta의 모델 페이지에는 인쇄된 정확도 표가 없다. 정확도 근거는 세 가지 이미지 자산 — 스트리밍 단어 오류율 리더보드, 화자 분리 오류율 비교, 스트리밍 정확도 지수 — 으로 제공되며, 추출 가능한 텍스트에는 수치가 없다. 모델 페이지 자체에는 단어 오류율도, 화자 분리 오류율도, 언어별 세부 내역도 제시되지 않는다.
발표 게시물에는 벤더가 보고한 수치가 실제로 담겨 있으며, 여기에는 스트리밍 단어 오류율과 평균 화자 분리 오류율이 포함됩니다. 그리고 그것들은 모델 출시 당시 우리가 정리했던 수치입니다. 이는 메타 자체의 측정치이며 제3자가 아직 재현하지 못한 상태입니다. 이 페이지는 그 비교를 다시 실행하지 않습니다. 출시 당일 벤더 벤치마크를 레퍼런스 페이지에서 재실행하는 것은 재현되지 않은 수치를 확정된 것처럼 포장하는 셈이기 때문입니다. 분명히 말할 수 있는 범위는 더 좁습니다: 메타는 이 모델에 대해 동일한 조건과 동일한 하네스에서 이름이 명시된 경쟁 상대와의 일대일 비교를 공개하지 않습니다. 따라서 어디에서 읽는 어떤 비교든 서로 다른 조건에서 수집된 벤더 수치를 비교한 것에 불과합니다.
한 날짜도 의도적으로 확정되지 않은 채 남아 있습니다. 모델 페이지에는 출시일이 전혀 없으며, 유일한 버전 표시는 -1.0이며, 이는 모델 ID에 있습니다. 이 글의 2026-09-01 날짜는 그 날짜가 명시된 발표 게시물에서 비롯되었으며, 여기서는 사건을 보도하기보다는 모델의 날짜를 표기하기 위해 사용됩니다.


누가 이걸 선택해야 하고, 누가 선택하지 말아야 할까
Muse Voice Transcribe의 활용 근거는 좁지만 강력하다: 단어, 화자 식별, 발화 턴 종료를 동일한 스트림에서 필요로 하는 라이브 오디오를, 온디맨드가 아니라 연속 실행할 수 있을 만큼 낮은 가격에 제공한다는 점이다. 음성 에이전트, 실시간 자막, 회의 및 통화 인텔리전스, 받아쓰기, 대량 전사는 Meta가 명시한 워크로드이며, 이 인터페이스가 실제로 겨냥해 설계된 워크로드이기도 하다 — 엔드포인팅 모드와 세션 범위 화자 레이블을 갖춘 60분 WebSocket.
반대 근거도 똑같이 구체적입니다. 단어 수준 타임스탬프, 단어별 신뢰도, 사운드 이벤트나 감정 감지, 또는 전사문 재포맷팅이 필요하다면, 이 모델에는 그런 기능이 없으며, 이는 버그가 아니라 문서화된 미지원 사항입니다. 오디오가 16 또는 24kHz의 모노 16비트 WAV가 아닌 형식으로 들어오는데 파일 엔드포인트를 사용한다면, 다른 곳에서는 치르지 않아도 될 변환 단계를 거쳐야 합니다. 그리고 정확도만이 유일한 기준인 보관된 녹음의 일괄 전사가 요구사항이라면, 스트리밍을 내세우는 것은 아무 소용이 없습니다 — 두 경로의 가격은 동일하므로, 사용하지도 않을 실시간 기능에 비용을 지불하는 셈입니다.
프로덕션 경로를 확정하기 전에 확인해야 할 단 하나는 이 페이지가 답하기 위해 존재하는 수치이며, 그것은 모델이 전혀 바뀌지 않고도 바뀔 수 있는 유일한 수치입니다: 오늘 Meta 자체 모델 페이지에 적혀 있는 대로 오디오 1시간당 $0.18입니다. 이에 대한 권위 있는 출처는 Meta의 페이지입니다. 이 수치가 움직이면, 그것에 맞춰 산정된 모든 것 — 1,000시간 규모의 월, 인터뷰당 비용, 구축 대 구매 계산 — 도 함께 움직입니다.
