기사 히어로 카드에는 'Daily AI Brief — 9월 19'가 적혀 있고, 배지 'NEWS'와 부제 'Grok Voice Transcribe 2.0 출시, Meta가 Muse를 공개'가 있으며, 칩에는 배치 시간당 $0.10, 2.7% 스트리밍 WER, 3.4% 첫 부분, Muse 커넥터 라이브가 표시되어 있고, 흰색에서 파란색으로 가는 그라데이션 위 오른쪽 하단에 OrcaRouter 로고가 있습니다.
Engineering & Research

일일 AI 브리핑, 9월 19일: Grok Voice Transcribe 2.0 정식 출시 및 Meta, 개발자에게 Muse 개방

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok Voice Transcribe 2.0은 2026년 9월 18일부로 Grok Voice API에서 라이브로 제공되며, 녹음 전사는 오디오 1시간당 $0.10, 스트리밍은 시간당 $0.20입니다 — 버전 1.0에 대해 SpaceXAI가 부과했던 것과 동일한 요율입니다. 같은 주에 Meta는 Muse 커넥터 플랫폼을 외부 개발자에게 개방하여, 어떤 서비스든 기존 API를 노출하고 Meta의 Muse 에이전트가 사용자를 대신해 이를 호출할 수 있게 했습니다. 이들은 서로 다른 두 회사가 서로 다른 두 제품에 대해 내놓은 무관해 보이는 헤드라인처럼 보이며, 지난 2년의 대부분 동안에는 실제로 그랬을 것입니다. 함께 읽으면 이들은 같은 이야기입니다: 전사는 입력으로 변해가고 있고, 싸움은 그것을 소비하는 호출을 누가 소유하느냐로 옮겨갔습니다.

가격부터 시작하자, 그것이 독자가 오늘 당장 행동할 수 있는 부분이기 때문이다. 그다음은 정확성인데, 이는 실재하지만 출시 당시의 프레이밍이 시사하는 것보다는 범위가 좁다. 그다음은 Meta 관련 글인데, 이것이 6개월 후에 중요해질 바로 그것이다.

정액 요금제, 그리고 이미 전사 서비스에 비용을 지불하고 있다면 그것이 의미하는 것

Grok Voice Transcribe 2.0은 1.0과 가격이 동일합니다. '같은 가격에서 시작'하는 것도, 만료되는 프로모션 요금도 아닙니다. 말 그대로 동일하며, 배치 작업의 경우 오디오 1시간당 $0.10, 스트리밍의 경우 1시간당 $0.20으로, 1,000분당 $1.67과 $3.33에 해당합니다. 화자 분리, 신뢰도 점수가 포함된 단어 수준 타임스탬프, 역 텍스트 정규화, 필러 단어 제거, 핵심 용어 바이어싱은 모두 추가 기능으로 별도 판매되지 않고 그 가격에 포함되어 있으며, 이는 이 분야의 일반적인 관행이 아닙니다.

실질적인 효과는 극적이라기보다 산술적입니다. 한 달에 컨택센터 오디오 5,000시간을 전사하는 팀은 어느 쪽을 택하든 배치 경로에 500달러를 지불하며, 새 모델은 동일한 분량을 현저히 낮은 오류율로 처리합니다. 마이그레이션 때문에 지불 금액이 달라지는 것은 전혀 없으며, 바로 그래서 이 마이그레이션을 정당화하기 쉽습니다. 내려야 할 비용 결정은 없고 품질 결정만 있을 뿐인데, 그 품질이 올라갔기 때문입니다.

기존 통합은 /v1/stt에서 grok-voice-transcribe-2.0을 model 매개변수로 전달하거나, 스트리밍을 위해 WebSocket 세션이 열릴 때 이를 선택하는 방식으로 옮겨갑니다. 스키마 변경, 새 엔드포인트, 오디오 파이프라인 재인코딩은 없습니다. SpaceXAI는 현재 1.0을 기본값으로 남겨 두었으므로, model 매개변수를 전혀 건드리지 않는 통합은 회사가 이를 전환할 때까지 계속 구버전을 받게 됩니다. 회사는 이 전환이 1.0의 지원 중단과 함께 향후 몇 주 안에 일어날 것이라고 밝혔습니다. 그 기간은 의도적으로 활용할 가치가 있습니다: 프로덕션 오디오의 섀도 복사본을 2.0으로 향하게 하고, 오늘 출시하는 전사 결과와 비교해 보세요. 기본값이 한 번 전환되면 테스트했는지 여부와 관계없이 2.0을 실행하게 되기 때문입니다.

스펙 시트의 나머지 부분은 형태가 그대로이며, 단순히 정확도를 평가하는 게 아니라 배포 규모를 산정하려는 경우라면 알아둘 가치가 있습니다. 8 kHz 전화 음성부터 48 kHz까지 12가지 입력 오디오 형식, 단일 요청에서 최대 8개의 독립 오디오 채널, 도메인 어휘용 요청당 100개 핵심 용어, 녹음 중 전환까지 지원하는 자동 언어 감지, 그리고 25개 언어에 걸친 역 텍스트 정규화로 발화된 날짜, 통화, 전화번호, 이메일 주소가 사람이 쓰는 방식대로 표기되어 돌아옵니다. 서비스 한도는 팀당 초당 10건의 요청과 100개의 동시 스트리밍 세션이며, 서비스는 단일 리전인 us-east-1에서 실행됩니다. 이는 이 시트에서 프로덕션 팀이라면 한 번쯤 멈춰 생각하게 될 유일한 항목인데, 단일 리전 음성 API는 곧 단일 리전 장애이기 때문입니다.

정확도가 실제로 움직인 지점

출시 당시의 주장은 "두 배 더 정확하다"였지만, 그 근거가 되는 수치는 그 표현보다 더 구체적이고 덜 일률적입니다. 여기서 독립적인 측정 기준인 Artificial Analysis의 AA-WER Streaming 보드에서는 두 버전이 다음과 같이 구분됩니다:

• 최종 전사 정확도 — Grok Voice Transcribe 2.0은 단어 오류율 2.7%, Grok Voice Transcribe 1.0은 3.9%이며, 둘 다 화자가 말을 멈춘 후 측정됨

• 첫 번째 부분 전사 정확도 — 3.4% WER 대 18.3%로, 이는 두 버전 간의 단일 격차 중 단연 가장 크다

• 최종 스크립트까지 걸린 시간 — 0.49초 대 0.37초, 따라서 이 측정 기준에서는 2.0이 더 빠른 것이 아니라 더 느립니다

• 첫 부분 익절까지 걸린 시간 — 0.49초 대 0.25초, 동일한 거래를 반대 방향으로 했을 때

마지막 쌍이 이 표에서 가장 흥미로운 부분이다. Grok Voice Transcribe 2.0은 양방향 모두에서 약 0.25초의 지연을 대가로 정확도를 얻었다. 음성 에이전트에게 이는 실질적인 비용이다. 자연스러운 멈춤과 발신자가 알아차리는 멈춤의 차이이기 때문이다. 반면 배치 파이프라인에서는 눈에 띄지 않는다. 첫 부분 결과의 개선은 만들 수 있는 것을 바꾸는 개선이다. 부분 전사는 발신자가 아직 말하고 있는 동안 에이전트가 추론할 수 있는 텍스트이기 때문이다. 그 수치가 18.3%에서 3.4%로 가는 것은 부분 결과가 대략적인 힌트에 그치는 것과 사용 가능한 것이 되는 것의 차이다. 최종 전사가 3.9%에서 2.7%로 가는 것은 어떤 사용자도 알아차리지 못할 좋은 개선이다.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAI는 또한 네 가지 내부 평가를 공개했으며, 이는 그 라벨을 붙인 채 읽을 가치가 있습니다 — 이것들은 회사 자체 오디오에 대한 회사 자체 수치이며, 독립적으로 재현된 것이 아닙니다:

• 8 kHz 고객 지원 통화 — 1.0의 10.6% WER에서 2.0의 7.1%로 감소

• Grok과의 대화 — 8.7%에서 3.3%로 감소

• 음성으로 말하는 자격 증명, 즉 이름, 이메일, 계정 정보를 소리 내어 읽는 경우 — 7.2%에서 3.2%로 감소

• 19개 언어의 짧은 문구 — 20.6%에서 6.8%로 감소

8 kHz 행이야말로 주목해야 할 부분입니다. 전화 오디오는 이 범주에서 가장 어려운 일반 입력이며, 대부분의 컨택트 센터 구매자가 실제로 보유한 입력입니다. 그리고 이 항목에서 10.6%에서 7.1%로 떨어진 것은 그 구매자들에게 헤드라인 보드 수치보다 더 큰 의미가 있습니다.

리더보드 주장, 솔직하게 읽기

SpaceXAI는 이 모델이 정확도에서 32개 스트리밍 모델 중 1위라고 말한다. Artificial Analysis의 리더보드는 실제로 최종 전사 및 첫 부분(first-partial) 순위 모두에서 이 모델을 1위로 놓는다. 하지만 그 리더보드 페이지는 33개 모델 중 27개만 표시하므로, "32"는 회사 자체 집계이며, 이 순위는 독자가 그 집합의 구성을 이해해야 하는 대상에 대한 것이다. AA-WER Streaming은 세 가지 영어 데이터셋의 가중 합성 지표다: AA-AgentTalk 50%, VoxPopuli 25%, Earnings22 25%로, 총 약 8시간 분량의 오디오이며, 에이전트 스타일 대화 음성에 크게 가중치가 실려 있다. 이는 억양, 전화 통신 코덱, 도메인 어휘, 다채널 콜센터 오디오를 어떤 체계적인 방식으로도 측정하지 않는다.

그중 어느 것도 그 수치를 틀리게 만들지 않는다. 그것은 수치를 구체적으로 만들 뿐이다. 에이전트 대화에 가중치를 둔 영어 리더보드를 선두하는 모델은 에이전트 대화 형태의 영어 오디오에 맞는 선택이며, 8 kHz 결과를 믿어야 할 정직한 이유는 공개 리더보드가 아니라 벤더의 내부 평가에 있다. 다른 오디오 프로필을 가진 구매자는 이 순위를 일반적인 판정으로 읽기보다 자신의 오디오로 테스트해야 한다 — 이는 이번 출시 전에도 사실이었고, 다음 출시 이후에도 사실일 것이다.

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta, 개발자들에게 Muse 커넥터 공개

이번 주 두 번째 이야기는 메타의 것이다. 메타가 9월 8일 iOS, Android, muse.ai, WhatsApp 전반에 걸쳐 출시한 개인 에이전트 Muse는 이제 서드파티 커넥터를 받아들인다: 한 서비스가 자사의 API를 공개하면, Muse가 에이전트와 브라우저, 사용자 컨텍스트를 제공해 그 API를 사람이 요청만 하면 호출할 수 있는 무언가로 바꿔준다. 메타가 여기에 붙인 프레이밍은 분업이다 — 당신이 API를 가져오면, 우리가 의도와 사용자를 가져온다. 메타가 직접 출시한 것들에 더해, 처음 이름이 오른 커넥터는 Notion과 회의록 도구 Granola였다.

이것이 무엇이고 무엇이 아닌지는 정확히 짚고 넘어갈 가치가 있습니다. 이것은 개방형 에이전트 간 프로토콜이 아닙니다. 커넥터를 만드는 것은 Muse 자체 사용자 기반 안에서의 배포를 얻을 뿐, 그 밖의 어디에서도 얻지 못합니다. 개방형 프로토콜에 맞춰 만드는 것은 호환되는 모든 에이전트에 걸친 도달 범위를 얻지만, 특정 사용자 기반은 얻지 못합니다. 또한 Meta는 개발자가 계획을 세우는 데 필요한 부분들, 즉 커넥터 심사 과정, 기술 통합 영역, 서로 겹치는 두 커넥터 사이에서 Muse가 어떻게 선택하는지, 개발자가 커넥터가 실제로 어떤 사용을 이끌어냈는지 어떻게 측정하는지를 공개하지 않았습니다.

의심할 여지가 없는 것은 방향이다. Muse는 각 사용자의 에이전트를 자체 브라우저와 외부로 나가는 작업 앞의 별도 검토 계층을 갖춘 자체 가상 머신에서 실행하며, 실제 API 키가 아니라 대리 토큰을 보관한다. 그 아키텍처는 에이전트가 많은 것들을 호출하게 하는 계획일 때만 이치에 맞는다. 전사 API는 에이전트가 호출하는 것들 중 하나이며, Meta에는 자체 전사 API가 있다 — Meta가 9월 초에 오디오 시간당 $0.18로 출시한 실시간 모델인 Muse Voice Transcribe다. 에이전트와 음성 모델을 모두 소유한 플랫폼은 자체 트래픽을 자체 모델로 라우팅할 분명한 이유가 있으며, 커넥터를 기반으로 개발하는 개발자들은 뭔가가 그것을 기본값이 아니게 만들지 않는 한 그것이 기본값이라고 가정해야 한다.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

이번 달 음성 기능을 출시하는 팀이 실제로 해야 할 일

두 이야기 모두 같은 방향을 가리킨다. 음성 정확도는 수렴하고 있다 — 3주 안에 같은 보드에서 세 모델이 서로 1.5포인트 이내에 들어왔다 — 그리고 남은 차별화 요소는 가격, 지연 시간, 라이선스, 그리고 라우팅을 누가 통제하는가이다. 그렇기 때문에 전사 호출이 어디로 가는지에 대한 선택이 어떤 모델이 그것에 응답하는지에 대한 선택보다 더 중대해진다. 앞으로 1년 동안 그 답을 여러 번 바꾸고 싶어질 것이기 때문이다.

이것이 OrcaRouter가 위치한 계층입니다. 하나의 API 키로 OpenAI 호환 엔드포인트 뒤에 있는 200개 이상의 모델을 사용할 수 있고, 제공자 간 자동 장애 조치가 이루어지므로, 단일 리전 음성 서비스가 안 좋은 오후를 보내더라도 그것이 곧바로 여러분의 장애가 되지는 않습니다. 우리는 제공자 정가를 0% 마크업으로 그대로 전달합니다. 즉, 벤더의 가격 인하나 새 모델 버전이 재가격 책정을 기다리지 않고 같은 날 우리 쪽에 반영됩니다. 그리고 모든 모델이 하나의 계약 아래에 있기 때문에, 전사 워크로드를 한 모델에서 다른 모델로 옮기는 일은 두 번째 조달이 아니라 모델 문자열 변경에 불과합니다.

이번 주를 위한 세 가지 구체적인 행동. Grok Voice Transcribe 1.0을 사용 중이라면, 1.0이 아직 기본값이고 전환을 여전히 직접 통제할 수 있는 지금, 자신의 오디오로 2.0을 섀도 테스트하세요. 에이전트용 스트리밍 음성을 평가 중이라면, 누군가의 리더보드를 믿기보다 자신의 지연 예산에서 첫 부분 결과까지 걸리는 시간을 측정하세요 — 이 모델이 정확도를 얻기 위해 쓴 0.25초는 에이전트가 그 텍스트로 무엇을 하느냐에 따라 아무것도 아니거나 치명적일 수 있습니다. 그리고 언젠가 개인 에이전트가 호출할 수도 있는 무언가를 만들고 있다면, Muse 커넥터 프로그램을 면밀히 주시하세요. 그것이 내세우는 배포 논리는 함께 출시된 기술적 세부 사항보다 더 강력한 논거이기 때문입니다.