
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: 리더보드 선두 주자가 방언 전문가를 만나다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 비교에서 정직한 출발점은 Voxtral Mini 4B Realtime Arabic과 Grok Voice Transcribe 2.0이 같은 일자리를 두고 경쟁하는 모델이 아니라는 점이며, 이를 가장 빠르게 확인하는 방법은 각 벤더가 무엇을 기꺼이 공개했는지 살펴보는 것입니다. Mistral AI는 2026년 10월 8일 Voxtral Mini 4B Realtime Arabic을 아무런 발표도 없이 Hugging Face에 올렸습니다. Apache 2.0 가중치, 열여섯 가지 아랍어 변종을 명시한 모델 카드, 그리고 480밀리초 지연에서 일곱 개 아랍어 벤치마크 전반에 걸쳐 평균 문자 오류율 8.82%라는 단 하나의 정확도 수치가 전부였습니다. xAI의 Grok Voice Transcribe 2.0은 2026년 9월 18일 출시 글이자 가격, 그리고 제3자 리더보드 결과와 함께 나왔습니다. 화자가 말을 멈춘 뒤 0.49초 만에 텍스트가 확정되는 최종 전사에서 단어 오류율 2.7%를 기록했고, 출시 당시 Artificial Analysis의 스트리밍 음성-텍스트 보드에서 1위였습니다. 한 모델은 자신이 어떤 방언을 다루는지 정확히 밝히고 그 범위를 벗어나면 추측하기를 거부합니다. 다른 모델은 38개 이상의 언어를 지원한다고 말하면서 그중 단 하나도 항목별로 제시하지 않습니다.
그 비대칭성이 이 비교의 전부입니다. 혼합 언어 오디오를 위해 전사 용량을 대량으로 구매한다면, xAI 모델이 훨씬 더 완성도 높은 제품입니다. 오디오가 아랍어라면 — 특히 방송용 현대 표준 아랍어가 아니라 방언 아랍어라면 — Mistral 체크포인트는 xAI 모델이 1위를 차지한 리더보드가 측정하지 않는 문제를 겨냥하고 있으며, 그 보드에서 1위가 아니라 2위라는 사실을 판정으로 읽는 것은 실수일 것입니다.
가격 계산은, 여기서는 유난히 깔끔하기 때문에
xAI는 요금을 공개한다. Mistral은 다운로드를 공개한다. 그 차이가 이후의 모든 것을 좌우하므로, 존재하는 숫자부터 시작하라.
• Grok Voice Transcribe 2.0 — 녹음 파일의 경우 REST를 통해 오디오 1시간당 $0.10, 스트리밍 WebSocket을 통해서는 오디오 1시간당 $0.20입니다. 즉, 배치는 1,000분당 약 $1.67, 스트리밍은 1,000분당 $3.33이며, 동일한 가격대에서 Grok Voice Transcribe 1.0과 변동 없습니다.
• Voxtral Mini 4B Realtime Arabic — 공개된 가격은 없습니다. 공개된 서비스가 없기 때문입니다. 가중치는 Apache 2.0이며 BF16에서 약 44억 개의 파라미터를 갖습니다. 즉, 비용은 여기에 연결하는 GPU와 그로부터 얻는 활용률에 달려 있습니다. 지속적인 사용량에서는 저렴하지만, 사용량이 전혀 없을 때는 이 글에서 가장 비싼 옵션입니다. 유휴 하드웨어에 비용을 지불하고 있기 때문입니다.
손익분기점은 미묘하지 않다. 시간당 $0.20의 스트리밍 단가는 분당 약 0.33센트다. 당신이 4.4B 모델을 돌릴 가속기라면 어느 것이든, 지속적인 트래픽을 계속 흘려보내지 않는 한 시간당 그보다 더 많은 비용이 든다. 즉, 오픈 웨이트 경로는 머신 한 대를 계속 바쁘게 돌릴 만큼 아랍어 볼륨이 충분해진 뒤에야 비용에서 이기며, 거기에 도달하는 동안에는 다른 모든 축에서 뒤진다. API에는 자본 지출(capex), 용량 계획, 운영 부담이 없기 때문이다.

계산이 일찍 뒤집히는 단 한 곳은 컴플라이언스입니다. Mistral 체크포인트는 사용자가 통제하는 하드웨어에서 오디오를 처리하므로 네트워크 밖으로 아무것도 나가지 않으며, 모델 카드에는 정규화 모듈이 함께 제공되므로 아랍어 채점 파이프라인을 직접 감사할 수 있습니다. Grok Voice Transcribe 2.0은 xAI의 리전에서 실행되며, 문서에 따르면 오디오를 실시간으로 처리하면서 보관하거나 학습에 사용하지 않고, SOC 2 Type II 및 HIPAA 적격성의 지원을 받습니다. 두 주장 모두 방어할 수 있습니다. 다만 규제자가 코드 경로를 검사할 수 있게 하는 것은 둘 중 하나뿐입니다.
시간당 $0.20로 실제로 살 수 있는 것, 그리고 Mistral 모델은 출시되지 않는다
여기서 기능 격차는 정확도 격차보다 더 크고, 훨씬 덜 논의된다. Grok Voice Transcribe 2.0은 인터페이스를 갖춘 제품이고, Voxtral Mini 4B Realtime Arabic은 텍스트를 출력하는 체크포인트다.
• 화자 분리(speaker diarization) — Grok Voice Transcribe 2.0에 포함되어 있으며, 최대 8개의 독립 채널에 대한 다채널 전사도 지원합니다. Mistral 카드에는 화자 분리 기능이 명시되어 있지 않으며, 해당 모델은 화자를 귀속시킨 전사본이 아니라 일반 전사본을 생성합니다.
• 단어 수준 타임스탬프 — Grok은 신뢰도 점수를 함께 붙여 이를 제공하므로, 전체 전사를 똑같이 신뢰하기보다 신뢰도가 낮은 구간에 임계값을 적용할 수 있습니다. Mistral의 카드는 이 체크포인트에 대해 타임스탬프를 제공한다고 주장하지 않습니다.
• 핵심 용어 바이어싱 — Grok 엔드포인트에서는 요청당 최대 100개의 도메인 용어를 사용할 수 있으며, 이는 파인튜닝 없이 모델이 제품명, 계정 코드, 지명을 정확히 처리하게 만드는 방법입니다. 동일한 결과를 얻기 위한 Mistral 방식은 자체 데이터로 파인튜닝하는 것이며, 이는 Apache 2.0이 허용하지만 호스팅 엔드포인트는 허용하지 않습니다.
• 역 텍스트 정규화 — Grok은 숫자, 날짜, 통화, 전화번호, 이메일 주소를 25개 언어에 걸쳐 문어 형태로 변환합니다. Mistral 카드에는 정규화 스크립트가 포함되어 있지만, 명시된 목적은 아랍어 벤치마크를 채점하는 것이지 디스플레이용 출력을 포맷하는 것이 아닙니다.
• 인터페이스 표면 — 최대 500MB 파일을 위한 REST, wss://api.x.ai/v1/stt에서 약 500ms마다 중간 결과를 제공하는 WebSocket 스트리밍, 문서화된 초당 10회 요청 및 100개의 동시 스트리밍 세션, 그리고 현재로서는 단일 리전입니다. Mistral 측에서는 /v1/realtime에서 WebSocket을 사용하는 vLLM 서빙 또는 버전 5.2.0부터의 네이티브 Transformers를 제공하며, 하드웨어 외에는 속도 제한이 없습니다.
화자 분리와 타임스탬프가 필요하다면, 정확도가 문제되기도 전에 비교는 이미 끝난 것입니다. 이는 Mistral 모델을 깎아내리는 말은 아닙니다 — 정확한 방언 텍스트를 생성하도록 훈련된 4B 아랍어 전문 모델은 일반 전사 서비스와는 다른 엔지니어링 목표입니다 — 다만 두 가지가 서로 대체 가능해지는 것은 오직 당신의 파이프라인이 전사문을 자체 후처리를 위한 원자료로 취급할 때뿐이라는 뜻입니다.
언어 목록 문제
두 공급업체 모두 서로 반대 방향에서 동일한 질문을 미해결로 남기는 방식으로 언어 지원을 설명하고 있다.
• Grok Voice Transcribe 2.0 — 38개 이상 언어, 8 kHz에서 48 kHz까지 12가지 오디오 형식 전반에서 단일 패스로 녹음 중 언어 전환을 포함한 자동 언어 감지. 문서는 목록이 아니라 개수만 제공합니다. 자료 어디에도 아랍어가 개별적으로 명시되어 있지 않으며, 이는 아랍어 지원이 개수에 의해 암시될 뿐 공급업체에 의해 확인된 것은 아님을 의미합니다.
• Voxtral Mini 4B Realtime Arabic — 명시적으로 이름이 지정된 열여섯 가지 아랍어 변종: 현대 표준 아랍어; 마그레브 지역의 모로코, 리비아, 튀니지, 알제리 및 하사니야; 걸프 지역의 걸프, 나즈디, 오만 및 사나아니; 나일 계곡의 이집트 및 수단; 메소포타미아 아랍어와 남부 및 북부 레반트 아랍어 모두; 그리고 차드 아랍어. 그 집합 밖의 모든 것은 범위를 벗어나며, 카드에서는 대신 일반 실시간 모델을 사용하라고 안내합니다.
그래서 "이 중 어느 쪽이 아랍어를 더 잘 처리하는가"라는 질문은 이상한 구조를 지니고 있다. Mistral 모델은 공개된 아랍어 오류율을 갖고 있으면서 독립적 검증은 없는, 문서상의 아랍어 전문가다. xAI 모델은 문서상 리더보드 선두 주자지만, 해당 공급업체는 아랍어가 범위에 포함되는지 전혀 확인하지 않았다. 아랍어를 포함하는 38개 언어 집계와 아랍어만 포함하는 16개 방언 목록은 둘 다 "아랍어를 처리하는가"라는 질문에 답하고 있지만, 그중 하나만이 "다리자를 처리하는가"라는 질문에 답하고 있다.

리더보드는 여기서 도움이 되지 않습니다. Artificial Analysis의 음성-텍스트 평가는 영어 에이전트 발화 쪽으로 가중치가 실린 고정된 구성이며, 이는 일반 전사 순위를 매기기에는 올바른 설계지만 방언 아랍어에서의 우위를 드러내기에는 잘못된 설계입니다. 어떤 모델이 걸프 아랍어와 모로코 아랍어에서 진짜로 더 뛰어나도 그 보드에서는 그저 좋은 정도로 나타날 수 있습니다. 이것은 그 보드에 대한 비판이 아니라, 지역 배포를 위한 유일한 입력으로 그것을 사용하지 말아야 할 이유입니다.
정확도, 변환되지 않는 단위로
• Grok Voice Transcribe 2.0 — 최종 전사 단어 오류율 2.7%, 최종 결과까지 0.49초, 첫 부분 전사에서 3.4%를 기록했으며, 두 수치 모두 비공개 에이전트 대화 세트를 VoxPopuli 및 Earnings22와 혼합한 Artificial Analysis의 AA-WER v2 지수에서 측정되었습니다. 주목할 만한 것은 첫 부분 전사 수치입니다. Grok Voice Transcribe 1.0의 18.3%에서 떨어졌는데, 이는 라우팅에 활용할 수 있는 부분 전사와 표시만 할 수 있는 부분 전사의 차이입니다.
• Voxtral Mini 4B Realtime Arabic — 480밀리초 지연에서 7개 아랍어 벤치마크 전반에 걸쳐 평균 문자 오류율 8.82%를 기록했으며, 이는 함께 제공된 정규화 스크립트를 사용한 공급업체 자체 평가 결과입니다. Mistral은 이것이 같은 연구소의 오프라인 아랍어 모델인 7.91% CER의 Voxtral Transcribe Arabic에 0.91퍼센트포인트 이내로 근접한다고 보고합니다. 이 비교는 양쪽 모두 벤치마크, 정규화, 측정이 동일하기 때문에 서로 다른 공급업체 간 비교보다 더 가치가 있습니다.
2.7%를 8.82% 옆에 두는 것은 비교가 아니라 범주 오류다. 단어 오류율은 참조문에 대해 잘못된 단어를 세고, 문자 오류율은 잘못된 문자를 세는데, 아랍어 정서법은 — 같은 단어가 여러 합법적 철자를 허용하고 접어가 자유롭게 붙는 — 두 지표 사이의 격차를 라틴 문자 언어에서 나타나는 것보다 훨씬 크게 벌린다. 코퍼스도 다르고, 정규화도 다르며, 오직 하나의 수치만 제3자로부터 나온다. 두 숫자가 정당하게 알려줄 수 있는 것은 xAI 모델은 실측된, 순위가 잘 매겨진 범용 전사기이고 Mistral 모델은 주장된, 아랍어 특화 전사기라는 점이다. 두 숫자가 당신의 오디오를 어느 쪽이 더 잘 전사하는지는 말해 주지 못한다.
실제로 설득력이 있는 비교는 Mistral 자체 모델 카드 안에 있습니다: 스트리밍 8.82% 대 오프라인 7.91%, 동일한 7개 벤치마크, 동일한 정규화, 동일한 연구소. 스트리밍은 배치 모델에 비해 아랍어에서 약 1포인트의 정확도를 희생합니다. 그것이 좋은 트레이드오프인지는 여러분이 판단할 문제이며, 이제 그 판단은 정보에 기반한 것이 됩니다.
소형 모델이 이기는 지점, 그리고 그것은 점수판 위가 아니다
Mistral 체크포인트에 관한 세 가지는 숫자가 시사하는 것보다 더 가치가 있으며, 그중 어느 것도 어떤 리더보드에도 나타나지 않습니다.
첫 번째는 방언 분류 체계 자체입니다. 하사니야와 차드 아랍어를 포함해 16개 변종을 별개의 훈련 대상으로 명명하는 것은 모델의 오류가 어디에서 측정되었는지에 대한 진술입니다. 아랍어를 38개 언어 중 하나로 포함하는 일반 다국어 모델은 현대 표준 아랍어에서 먼저 개선됩니다. 훈련 신호와 벤치마크 비중의 대부분이 거기에 있기 때문입니다. 북아프리카 부처와 함께 모로코 파트너십을 위해 구축된 모델은 다른 분포에 최적화되어 있으며, 이를 측정하기 위해 특별히 만들어진 두 벤치마크 — ISMA와 Darija in the Wild — 와 공동 개발되었습니다.
두 번째는 조정 가능한 지연입니다. 8.82%라는 수치는 480밀리초 기준으로 제시되며, 지연은 고정이 아니라 조정 가능하므로 정확도는 운영자가 선택하는 곡선 위의 한 점이 됩니다. 실시간 캡션 작업에서는 지연을 줄이고 더 많은 오류를 감수할 수 있고, 통화 녹음 파이프라인에서는 지연을 늘려 정확도를 되찾을 수 있습니다. Grok Voice Transcribe 2.0은 고정된 동작점을 제시하며, 벤더 자체의 업그레이드 경로는 이것이 왜 결과를 낳는지 보여줍니다 — 1.0에서 2.0으로 옮기면서 첫 부분 및 최종 지연 모두 약 3분의 1초가 늘어났고, 이용 가능한 해결책은 다이얼을 조정하는 것이 아니라 이전 모델을 고정하는 것입니다.
세 번째는 Apache 2.0 라이선스 부여가 여러분이 보유한 가중치에 대해 무조건적이라는 점입니다. 업스트림에서 체크포인트에 무슨 일이 일어나든 — 공지되든, 가격이 매겨지든, 지원 중단되든, 다시는 언급되지 않든 — 그 아티팩트는 다운로드 가능하고, 파인튜닝 가능하며, 자체 제품 안에서 출시 가능한 상태로 남습니다. 호스팅 엔드포인트의 요금표와 모델 지원 종료 일정은 모두 공급업체가 변경할 수 있는 것이며, xAI는 이미 Grok Voice Transcribe 2.0을 기본값으로 만들고 1.0을 지원 중단하겠다는 의도를 내비쳤습니다. 그러면 모델 매개변수를 한 번도 전달한 적 없는 모든 통합이 한꺼번에 새로운 지연 시간 프로필로 옮겨지게 됩니다.
트랜스크립트 위에 있는 라우팅 계층과 관련해 실용적인 참고 사항 하나: 두 모델 모두 우리가 호스팅하는 음성-텍스트 변환 모델이 아니며, 이 글도 그렇다고 주장하지 않습니다. OrcaRouter가 담당하는 것은 스트림을 소비하는 언어 모델 계층, 즉 요약기, 분류기, 에이전트이며, 200개가 넘는 모델을 공급자 정가에 0% 마크업으로 하나의 API 키 뒤에서 이용할 수 있게 합니다. 그래서 공급업체의 가격 변경이 같은 날 여기에 반영됩니다. 언어 커버리지를 위해 두 음성 공급업체를 운영하는 팀은 이미 두 개의 계약과 두 개의 인증 경로를 안고 있습니다. 다운스트림 절반을 하나의 키로 합치는 것이 손쉬운 성과입니다.
이걸 어떻게 해야 할까요?
오디오가 다국어라면, 화자 분리, 타임스탬프 또는 핵심 용어 바이어싱을 별도 설정 없이 바로 필요로 한다면, 또는 공개된 요금과 지원 경로를 갖춘 서비스를 오늘 원한다면 Grok Voice Transcribe 2.0을 기반으로 구축하세요. 더 완성도 높은 제품이고, 제3자가 측정하며, 오디오 시간당 $0.20의 스트리밍 요금은 상당한 볼륨을 운영하기 전까지는 오픈 웨이트 비용 논리가 힘을 쓰지 못할 만큼 낮습니다.
오디오가 아랍어이고 특히 방언형이라면, 규정 준수 이유로 모델을 자체 네트워크 안에 두어야 한다면, 또는 미세 조정할 생각이라면 Voxtral Mini 4B Realtime Arabic을 기반으로 구축하라 — 이들 중 오직 하나만 그것을 허용하기 때문이다. 먼저 세 가지를 받아들여라: 화자 분리 없음, 타임스탬프 없음, 그리고 어떤 주체에 의해서도 발표된 독립적 평가가 없음. 가중치가 공개된 지 이틀 후, 마지막 항목은 경고 신호가 아니다; 그것은 단지 증거의 현황일 뿐이다.
이 비교를 가장 빠르게 바꿀 수 있는 것은 실제 방언 오디오에 대한 아랍어 특화 평가를 두 공급업체 모두의 외부에서 수행하고, 두 시스템에 동일한 정규화를 적용하는 것입니다. 그것이 존재하기 전까지는 결정이 한 공급업체의 자체 방언 목록과 다른 공급업체의 공개되지 않은 자체 목록을 견주는 데 달려 있으며, 유일하게 신뢰할 수 있는 테스트는 여러분의 녹음입니다.

두 엔드포인트 모두 우리가 제공하는 것이 아닙니다 — 이는 우리 카탈로그 밖에 있는 두 시스템을 비교한 것입니다 — 하지만 이 트랜스크립트를 사용하는 모델은 라우팅할 수 있습니다: 단일 API 키로 200개 이상의 모델을 공급자 정가에 0% 마크업으로 이용할 수 있으므로, 요약기나 분류기의 요금이 변경되면 발표되는 당일 바로 적용됩니다.
자동 장애 조치는 두 공급업체로 구성된 음성 환경이 두 개의 단일 장애점을, 그로부터 입력을 받는 언어 계층으로 끌고 들어가지 않도록 막아 줍니다.
