
Grok Voice Transcribe 2.0, 가격은 그대로 유지하면서 스트리밍 정확도 1위 자리를 차지하다
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0은 SpaceXAI가 2026년 9월 18일에 출시한 음성-텍스트 변환 모델이며, 이에 대해 중요한 단 하나의 숫자는 출시 발표 글이 맨 앞에 내세우는 숫자가 아니다. 바로 이것이다: 통화자가 아직 말을 이어가는 동안 음성 에이전트가 실제로 행동에 옮길 수 있는 텍스트인 최초 부분 전사가 Grok Voice Transcribe 1.0의 18.3% 단어 오류율에서 3.4%로 낮아졌다. 이는 Artificial Analysis의 AA-WER Streaming 보드에서 측정한 수치로, 새 모델은 이제 최종 전사 순위(2.7% WER, 발화 종료 후 0.49초)와 최초 부분 전사 순위(3.4%, 0.49초) 모두에서 1위에 올랐다. 최종 전사 정확도도 3.9%에서 2.7%로 개선됐는데, 이는 실질적이지만 크지 않다. 부분 전사의 도약이야말로 무엇을 만들 수 있는지를 바꾸는 변화다.
1.0과 2.0 사이에 실제로 무엇이 달라졌나요?
두 버전은 동일한 API의 동일한 제품이며, SpaceXAI는 인터페이스를 변경하지 않았습니다: Grok Voice Transcribe 2.0은 grok-voice-transcribe-2.0에 /v1/stt 대신 grok-voice-transcribe-1.0전달하거나 스트리밍을 위해 WebSocket 연결이 생성될 때 이를 선택하는 방식으로 선택됩니다. 모델 매개변수를 생략하는 기존 통합은 SpaceXAI가 기본값을 전환할 때까지 계속 1.0을 받게 되며, 회사에 따르면 이 전환은 구버전의 지원 중단과 함께 앞으로 몇 주 안에 이루어질 예정입니다. 그때까지 2.0은 옵트인 방식이며 1.0은 의도적으로 고정할 수 있습니다. 이는 이런 종류의 변경에 알맞은 형태입니다: 요청했든 아니든 프로덕션 기본값이 되기 전에 자체 오디오로 A/B 테스트를 해볼 수 있습니다.
Artificial Analysis 수치들은 나란히 놓고 읽으면 "두 배 더 정확하다"보다 더 구체적인 이야기를 들려준다:
• 최종 전사 정확도 — Grok Voice Transcribe 2.0은 2.7% WER, Grok Voice Transcribe 1.0은 3.9% WER(AA-WER Streaming 기준), 둘 다 발화 종료 후 측정
• 첫 번째 부분 전사 정확도 — 3.4% WER 대 18.3%, 두 버전 간 가장 큰 단일 격차
• 최종 전사까지 걸리는 시간 — 0.49초 vs 0.37초, 따라서 새 모델은 자신이 대체하는 모델보다 확정하는 데 더 느립니다.
• 첫 부분까지 걸린 시간 — 0.49초 대 0.25초, 이 역시 더 느림
• 배치(비스트리밍) 정확도 — Artificial Analysis의 비스트리밍 부문에서 AA-WER 2.3%를 기록했으며, 이는 Whisper Large v3의 4.07%, GPT Transcribe의 3.31%와 대비됩니다
• 배치 처리량 — 동일 보드에서 실시간 대비 약 162×로, MAI-Transcribe-2의 333×에는 뒤지고 Gemini 3.5 Transcribe의 88×보다는 앞선다
그 네 번째와 다섯 번째 줄은 이번 릴리스의 솔직한 주의사항입니다. SpaceXAI는 지연 시간을 대가로 정확도를 얻었습니다. 새 모델은 첫 부분 결과와 최종 전사본을 반환하는 데 1.0보다 약 3분의 1초 더 느립니다. Deepgram Flux가 0.02초 만에 부분 결과를 반환하고 Soniox v5가 0.05초에 반환하는 리더보드에서, Grok Voice Transcribe 2.0은 속도로 전혀 경쟁하지 않습니다 — 그것은 정확함으로 경쟁하며, 그 맞바꿈에서 큰 차이로 승리합니다. 그 맞바꿈이 옳은 선택인지는 전적으로 애플리케이션이 응답 발화를 시작해야 하는 라이브 음성 에이전트인지, 아니면 0.5초가 눈에 띄지 않는 전사 파이프라인인지에 달려 있습니다.

"두 배 더 정확하다"는 주장, 검증해봤다
SpaceXAI의 대표 문구는 2.0이 같은 가격으로 1.0보다 두 배 더 정확하다는 것이며, 자체 평가 표는 자사가 선택한 데이터셋에서 이를 뒷받침한다. 8kHz 영어 고객 지원 통화에서 단어 오류율은 10.6%에서 7.1%로 떨어졌다. Grok과의 대화에서는 8.7%에서 3.3%로. 음성 자격 증명 — 계정 코드, 전화번호, 이메일 주소 — 에서는 7.2%에서 3.2%로. 19개 언어의 짧은 명령에서는 20.6%에서 6.8%로, 오류가 약 3분의 2 줄었다. 이 네 데이터셋은 SpaceXAI의 프로덕션 트래픽에서 가져온 것이며, 비교도 SpaceXAI 자체 비교다. 회사 외부에서는 아직 아무도 이를 재현하지 못했다. 이 표를 일반적인 정확도 보장이 아니라, 모델이 어디에 맞춰 튜닝되었는지를 보여주는 지도로 보라.
Artificial Analysis 결과는 벤더가 보고하지 않은 부분입니다: 약 8시간 분량의 오디오에 대해 독립적인 하네스를 실행한 것으로, 비공개 AA-AgentTalk 세트에 50%, VoxPopuli와 Earnings22에 각각 25%의 가중치를 두었습니다. 이는 "두 배 더 정확하다"보다 더 좁고 유용한 주장을 뒷받침합니다 — 즉, 그 특정 조합에서 이 모델이 측정된 스트리밍 전사기 중 가장 정확하다는 것입니다. 한 가지 짚고 넘어갈 만한 점: SpaceXAI의 게시물은 "32개 스트리밍 모델 중" 1위를 설명하지만, 리더보드 페이지 자체는 33개 모델 중 27개를 표시합니다. 순위는 사실입니다; 마케팅 문구의 경쟁 모델 수는 회사의 집계이지, 리더보드의 집계가 아닙니다.
또한 AA-WER Streaming에서 1위를 차지한다는 것이 무엇을 포함하고 무엇을 포함하지 않는지 정확히 짚고 넘어갈 필요가 있습니다. 이 리더보드는 영어 비중이 높고 상담원 발화가 많은 데이터에 치우쳐 있습니다. 여러분의 억양, 코덱, 도메인 어휘, 또는 8채널 콜센터 오디오는 측정하지 않습니다. 이 리더보드에서 1위를 차지한 모델도 여러분의 녹음에서는 크게 뒤처질 수 있으며, 바로 그래서 옵트인 기간이 중요한 것입니다.

가격은 변동이 없으며, 그것이 여기서 두 번째로 큰 사실이다
Grok Voice Transcribe 2.0의 요금은 1.0과 동일합니다: REST 엔드포인트를 통한 배치 및 녹음 파일은 오디오 1시간당 $0.10, WebSocket을 통한 스트리밍은 오디오 1시간당 $0.20입니다. Artificial Analysis의 가격표에서 스트리밍 SKU는 1,000분당 $3.33, 배치 SKU는 $1.67에 책정됩니다 — Microsoft가 MAI-Transcribe-2에 부과하는 배치 요금과 동일하며, ElevenLabs Scribe v2 Realtime이 스트리밍 1분당 청구하는 비용의 약 3분의 1입니다.
화자 분리, 신뢰도 점수가 포함된 단어 수준 타임스탬프, 핵심 용어 바이어싱은 모두 별도로 과금되지 않고 해당 요금에 포함되어 있으며, 이는 이 시장에서 보편적인 방식이 아닙니다. Gemini 3.5 Transcribe Live는 오디오 입력과 텍스트 출력 모두에 대해 토큰당 과금하므로, 비용은 오디오가 실행된 시간뿐 아니라 모델이 말하는 양에 따라 달라집니다. 시간당 정액 요금은 예측하기 쉽고 공급업체 간 비교도 더 쉽습니다. 또한 OrcaRouter가 공급업체의 정가를 0% 마크업으로 그대로 전달하기 때문에, 공급업체 측에서 해당 요금이 변경되면 재가격 책정 주기를 거친 뒤가 아니라 당일 우리 측에도 반영됩니다.
API가 실제로 제공하는 것
기능 목록은 광범위하며 대부분 새로 추가된 것이 아니라 이전부터 이어져 온 것이므로, 기능만으로 업그레이드를 평가하고 있다면 알아 둘 만한 점입니다:
• 하나의 모델에서 배치와 스트리밍 — 최대 500MB의 녹음 파일은 REST로, WebSocket은 wss://api.x.ai/v1/stt에서 약 500ms마다 중간 결과 전송
• 화자 분리 기능이 포함되어 있으며, 최대 8개의 독립 채널에 대한 다채널 전사도 지원합니다
• 신뢰도 점수를 함께 제공하는 단어 수준 타임스탬프로, 전체 전사 내용을 똑같이 신뢰하는 대신 신뢰도가 낮은 구간을 임계값으로 걸러낼 수 있습니다
• 요청당 최대 100개의 도메인 용어에 대한 핵심 용어 바이어싱, 각 용어는 최대 50자
• 숫자, 날짜, 통화, 전화번호 및 이메일 주소를 위한 역 텍스트 정규화, 25개 언어에서 지원되는 표기 형식 서식 지정 포함
• 음성 에이전트를 정면으로 겨냥한 군더더기 단어 제거 및 Smart Turn 발화 종료 감지
• 단일 패스에서 녹음 중 언어 전환을 지원하는 자동 언어 감지, 12가지 오디오 형식 및 8kHz에서 48kHz까지의 샘플 레이트 지원
• REST와 스트리밍 모두에서 초당 10회의 요청, 팀당 100개의 동시 스트리밍 세션으로 서비스가 제한되며, 호스팅 위치는 us-east-1
기능 목록에는 없는 프로덕션 참고 사항이 하나 있습니다. 서비스는 단일 리전에서 실행됩니다. 오디오가 미국 외 지역에서 발생한다면 네트워크 구간이 이제 지연 시간 예산의 일부가 되며, AA-WER Streaming은 네트워크 지연을 타이밍에 명시적으로 포함합니다. SpaceXAI는 제로 데이터 보존 조건을 제공하고 SOC 2 Type II, BAA 및 EU 데이터 상주 옵션을 제시하므로, 규정 준수 측면은 지리적 측면보다 더 발전되어 있습니다.

누가 움직여야 하며, 무엇을 지켜봐야 할까
이미 Grok Voice Transcribe 1.0을 사용 중이고 애플리케이션이 부분 전사(턴 감지, 끼어들기, 실시간 에이전트 응답)를 기반으로 동작한다면, 부분 정확도 격차가 18.3%에서 3.4%로 줄어드는 것은 2.0을 테스트하는 것이 선택 사항이 아닐 만큼 큽니다. 그 수치가 "보통 틀림"에서 "보통 맞음"으로 바뀌는 것은 라우팅에 사용할 수 있는 부분 전사와 표시만 할 수 있는 부분 전사의 차이입니다. 애플리케이션이 녹음 파일의 최종 전사를 기다린다면 개선은 실질적이지만 더 작으며, 추가되는 0.12초의 커밋 지연이 그에 대한 비용입니다.
완전히 다른 벤더를 쓰고 있다면, 이 릴리스를 볼 이유는 리더보드 순위가 아니라 한 프런티어 랩이 가격을 올리지 않고 전사 모델을 크게 개선했다는 점입니다. 이는 정확성이 더 이상 돈을 받는 대상이 아니게 될 때 시장이 어떤 모습인지를 보여줍니다. 업그레이드 경로 또한 가장 저렴한 종류입니다: 파라미터 하나, 코드 변경 없음, 새 계약 없음, 그리고 문제가 생겼을 때 사용할 수 있는 핀도 있습니다.
다음으로 주목할 것은 기본값 전환입니다. SpaceXAI가 2.0을 기본값으로 만들고 1.0을 사용 중단하기 시작하면, 모델 매개변수를 한 번도 전달하지 않은 모든 통합이 지연 시간 변화를 포함해 한꺼번에 새 모델로 이동하게 됩니다. 기존 0.25초 부분 타이밍에 의존하는 팀은 프로덕션에서 변화를 발견하기보다 지금 버전을 고정해야 합니다. 두 번째로 주목할 것은 독립적 재현입니다: Artificial Analysis 항목은 실제 측정이지만, 이는 하나의 오디오 믹스에 대한 한 개의 보드일 뿐이며, 아직 어떤 제3자도 프로덕션 오디오에서 1.0 대 2.0을 동일 조건으로 비교한 실행 결과를 공개하지 않았습니다.
