
Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: 방언 대 범위
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
두 개의 스트리밍 음성-텍스트 변환 모델, 전사의 어려운 부분이 무엇인지에 대한 완전히 다른 두 가지 베팅이다. Voxtral Mini 4B Realtime Arabic는 Mistral AI가 2026년 10월 8일 출시 게시물도, 블로그 글도, 회사 뉴스 색인의 한 줄도 없이 공개 저장소에 올린 44억 파라미터 파인튜닝 모델로, 현대 표준 아랍어와 이름이 명시된 열다섯 개 방언에 특화해 훈련되었으며, 다운로드 가능한 BF16 가중치와 함께 Apache 2.0으로 배포되었다. Gemini 3.5 Transcribe Live는 Google의 Gemini 3.5 Transcribe 스트리밍 엔드포인트로, 2026년 8월에 플랫폼 출시의 모든 장치를 갖추고 발표되었으며, 85개 이상의 로캘을 지원하고, 폐쇄형이다 — 가중치가 없고 10분 세션 상한이 있는 프리뷰 API다. 한 모델은 단일 언어 계열에 깊이 파고들었고 자체 한계 섹션에서 그렇게 밝혔다. 다른 모델은 넓게 갔고 악센트 수준의 보장은 명시하지 않았다. 어느 쪽을 원하는지는 어느 벤더의 마케팅도 가장 먼저 내세우지 않는 축, 즉 당신의 오디오가 실제로 어떻게 들리는지에 달려 있다.
이것은 대칭적인 비교가 아니며, 그것을 묻어두기보다 처음부터 말할 가치가 있습니다. Mistral 모델은 이 글을 쓰는 시점에 나온 지 48시간밖에 되지 않았고, 공급업체 발표도, 독립적인 평가도, 공개된 가격도 없습니다. Google 모델은 8월 말부터 공개 미리보기 상태였고, 제3자 추적기에서 측정됩니다. Mistral 쪽은 모델 카드에서 나온 일련의 주장으로, Google 쪽은 일련의 측정값에 일련의 주장을 더한 것으로 다루면 비교는 정직하게 유지됩니다.
숫자보다 먼저, 각 모델이 무엇인지
• Voxtral Mini 4B Realtime Arabic — Voxtral-Mini-4B-Realtime-2602를 미세 조정한 스트리밍 ASR 모델로, BF16 기준 약 44억 개의 파라미터를 가지며 16kHz 오디오를 인과적 오디오 인코더와 언어 디코더를 통해 처리합니다. 오디오가 도착하는 대로 텍스트를 출력하고, 전사 지연을 설정할 수 있으며, Apache 2.0 라이선스이고 가중치는 Hugging Face에 공개되어 있습니다. Mistral은 2026년 1월에 체결된 파트너십에 따라 모로코의 디지털 전환 및 행정 개혁부와 공동 개발했으며, 이 모델을 주권 AI 자산이라고 설명합니다.
• Gemini 3.5 Transcribe Live — 두 모델로 구성된 출시의 스트리밍 쪽 절반입니다. Live API 엔드포인트는 WebSocket을 통해 연속적인 마이크 오디오를 전달하고, 화자가 아직 말하는 중에도 부분 전사본을 반환하며, 각 발화가 끝난 직후 최종 전사본으로 확정됩니다. 배치형 형제 모델인 gemini-3.5-transcribe는 최대 한 시간 분량의 사전 녹음 파일을 처리합니다. 둘 다 공개 프리뷰 상태이고, 둘 다 API 전용이며, 어느 쪽도 가중치를 공개하지 않았습니다.
첫 번째 구조적 차이는 정확성이 아닙니다. 그것은 이들 중 하나는 오늘 밤 바로 다운로드할 수 있는 파일이고, 다른 하나는 사용하려면 승인을 받아야 하는 서비스라는 점입니다.

언어 지원 범위: 16개 대 85개 이상, 그리고 격차가 핵심은 아니다
언어 수를 세면 미스트랄 모델은 협소해 보이고 구글 모델은 거대해 보인다. 두 수치는 서로 다른 것을 측정하며, 이런 단서 없이 나란히 놓고 읽는 것이 이 비교가 흔히 유발하는 가장 큰 실수다.
• Voxtral Mini 4B Realtime Arabic — 16개 아랍어 변종으로, 모델 카드에서 방언 계열별로 개별 명명되어 있습니다: 현대 표준 아랍어, 그리고 마그레브의 모로코·리비아·튀니지·알제리·하사니야 아랍어; 걸프의 걸프·나즈디·오만·사나아니 아랍어; 나일강 유역의 이집트·수단 아랍어; 메소포타미아 아랍어와 남부 및 북부 레반트 아랍어; 차드 아랍어. 카드 자체의 설명에 따르면 이 모델은 아랍어 전사를 목표로 하며, 코드 스위칭—화자가 대화 중 언어를 번갈아 쓰는 것—은 부작용이 아니라 이 모델이 제대로 해내도록 만들어진 능력입니다.
• Gemini 3.5 Transcribe Live — 85개 이상의 로케일에서 자동 언어 감지, 문장 내 및 문장 간 코드 전환 지원. Google 문서에서는 아랍어를 그 집합에 포함한다고 명시하며, 로케일 표에는 아랍어 항목으로 아랍어(이집트)가 기재되어 있고, 더 넓은 아랍어 로케일 범위는 이 모델 자체 문서에 항목별로 나열되어 있지 않습니다.
솔직하게 읽어 보면 그 트레이드오프의 윤곽이 드러난다. Google의 85+는 범위에 대한 주장이다. 오디오가 아랍어가 아닌 다른 언어라면 Google 엔드포인트는 이를 커버하고 Mistral 모델은 이를 거부한다. 카드에는 다른 언어의 경우 이 체크포인트가 아니라 원래의 Voxtral Mini 4B Realtime을 사용해야 한다고 분명히 적혀 있다. Mistral의 16은 깊이에 대한 주장이다. 그것은 아랍어를 전사하겠다고 주장하는 것이 아니라 모로코 다리자, 걸프 아랍어, 이집트 아랍어, 차드 아랍어를 각각 별개의 대상으로 전사하겠다고 주장하는 것이며, 이는 현대 표준 아랍어를 전사한 뒤 그로부터 방언이 따라 나오기를 바라는 것보다 실질적으로 훨씬 어려운 문제다. 영어에 가중치를 둔, 범위 우선 벤치마크는 그 차이를 결코 보여 주지 못할 것이다. 왜냐하면 방언 세트가 그 벤치마크에는 없기 때문이다.
모로코의 콜센터나 걸프 지역의 고객 지원 라인이라면, 16개 방언만 처리하는 모델이 방언별 정확도를 밝히지 않은 채 85개 로케일을 처리하는 모델을 능가할 수 있다. 다섯 개 언어로 회의를 전사하는 유럽 기업이라면 이 공식은 즉시 뒤집힌다. 어느 벤더도 틀리지 않았다. 그들은 서로 다른 고객을 선택했을 뿐이다.

비교할 수 있는 숫자와 비교할 수 없는 숫자
바로 여기서 비대칭이 문제를 일으킨다. 두 모델은 서로 다른 단위를, 서로 다른 코퍼스에서, 서로 다른 근거를 바탕으로 보고하며, 제3자가 둘을 서로 비교 평가한 적이 없다.
• Voxtral Mini 4B Realtime Arabic — 7개 아랍어 벤치마크 전반에서 평균 문자 오류율 8.82%, 설정된 전사 지연 480밀리초 기준. Mistral 자체 모델 카드에 따른 수치이며, 독립적으로 재현되지는 않았습니다.
• 그것이 뒤쫓고 있는 모델 — 동일한 일곱 개 벤치마크에서 동일한 측정 방식으로 Voxtral Transcribe Arabic이 7.91% CER을 기록하므로, 실시간 모델은 같은 공급업체의 오프라인 아랍어 모델보다 0.91퍼센트포인트 뒤처진다. 이 격차는 Mistral 자체의 비교라는 점에서 유난히 유익하다. 공급업체가 이 언어 계열에서 스트리밍이 정확도 면에서 무엇을 대가로 치르는지 알려주고 있는 셈이다.
• Gemini 3.5 Transcribe Live — Artificial Analysis가 측정하고 Google이 인용한 4.0% 스트리밍 단어 오류율, 발화가 끝난 뒤 0.40초 만에 도착하는 최종 전사본. 또한 동일 트래커의 비스트리밍 보드에서 2.6%, Google 자체 보고에 따른 FLEURS 스트리밍에서 5.50%로 측정되었습니다.
8.82% CER을 4.0% WER 옆에 놓고 아무 결론도 내리지 마세요. 문자 오류율과 단어 오류율은 분모가 서로 다릅니다 — 아랍어 정서법은 라틴 문자 언어에서보다 이 둘 사이의 격차를 더 크게 만들며 — 말뭉치도 같지 않고, 정규화도 같지 않으며, 한 숫자는 재현 가능한 스크립트와 함께 오지만 다른 숫자는 영어 상담원 발화 쪽에 가중치가 실린 트래커의 고정된 혼합에서 나옵니다.
더 유용한 비교는 Mistral 자체 모델 카드에 있는 비교입니다: 동일한 벤치마크와 동일한 정규화 기준에서 스트리밍 8.82% 대 오프라인 7.91%입니다. 이는 저지연이 특히 아랍어에서 무엇을 얻어 주고 무엇을 치르게 하는지를 깔끔하게 측정한 결과이며, 어떤 공급업체 간 비교 백분율보다도 더 가치가 있습니다. 아무도 공개하지 않은 것은 동일한 오디오에서 Google과 Mistral 모델을 동등한 조건으로 아랍어로 실행한 결과입니다. 누군가 그렇게 하기 전까지 “아랍어에서 어느 쪽이 더 정확한가”는 미해결 질문이며, 유일하게 방어할 수 있는 답은 이것입니다: 두 모델을 당신의 녹음에서 직접 시험해 보십시오.
Mistral의 카드에 있는 한 가지 세부 사항은 언급할 가치가 있습니다. 그것은 공급업체 자신의 이익에 반하기 때문입니다. 그 카드에서는 Gemini의 안전 필터가 일부 FLEURS 오디오 샘플의 전사를 차단한다고 지적합니다. 이는 경쟁사 파이프라인에 관한 실제적이고 검증 가능한 관찰이며, 동시에 리더보드에는 결코 나타나지 않는 바로 그런 종류의 일입니다. 샘플 전사를 거부하는 모델은 실패로 처리되거나 없는 것으로 처리되는데, 어느 해석도 공정하지 않습니다. 오디오에 콘텐츠 필터가 걸러낼 수 있는 자료가 포함되어 있다면, 그것은 어떤 WER 수치로도 드러나지 않는 배포 위험입니다.
지연 시간: 고정된 숫자에 맞선 다이얼
스트리밍 모델은 대개 단일 지연 수치로 비교된다. 이 둘은 그런 수치를 공통으로 갖고 있지 않다.
• Voxtral Mini 4B Realtime Arabic — 구성 가능한 전사 지연. 8.82% CER 수치는 480밀리초에서 인용되며, 지연은 조정 가능하므로, 이 정확도 수치는 모델의 속성이 아니라 운영자가 선택하는 곡선 위의 한 점에 불과하다. 기본 모델은 240밀리초에서 최대 2.4초까지의 범위를 내세운다.
• Gemini 3.5 Transcribe Live — 발화 종료부터 최종 전사까지 0.40초, Artificial Analysis 측정 기준, 발화 중 부분 결과가 지속적으로 도착합니다. Google은 Chirp 3 대비 최종 전사까지 걸리는 시간이 70% 개선되었다고 별도로 주장하는데, 이는 공급업체 수치이며 재현되지 않았습니다.
둘 다 같은 범위, 대략 0.5초에 해당하지만 엔지니어링적 의미는 다릅니다. Mistral 모델은 지연 시간과 정확도 간의 트레이드오프를 파라미터로 당신에게 맡기므로, 1초 미만의 캡션이 정확도의 마지막 몇 포인트보다 더 중요할 때는 240ms로 실행하고, 그렇지 않을 때는 지연을 늘릴 수 있습니다. Google 엔드포인트는 Google 자체의 콘텐츠 필터 동작이 결합된 고정된 동작점을 제시합니다. 음성 에이전트의 경우, 조금 더 나은 고정 수치보다 조절 가능한 다이얼이 더 가치가 있습니다. 올바른 설정은 당신의 오디오와 사용자에 따라 달라지며, 어느 벤더도 당신을 대신해 그것을 선택할 수 없기 때문입니다.
진짜 분수령: 오픈 웨이트 대 프리뷰 엔드포인트
이 비교에서 라이선스와 배포 방식의 차이는 어떤 벤치마크 격차보다도 크며, 정확도가 논의되기도 전에 대부분의 실제 도입을 좌우한다.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, Hugging Face의 BF16 가중치, /v1/realtime에서 WebSocket을 통해 vLLM으로 서빙 가능하며, Transformers 5.2.0 버전부터 네이티브로 지원됩니다. 모델 카드에는 Python 예제와 정규화 모듈이 포함되어 있어 아랍어 CER 계산을 직접 재현할 수 있습니다. 파이프라인 어디에도 Mistral의 서버가 필요하지 않으며, 모델이 충분히 작아서 운영상의 질문은 GPU를 감당할 수 있는지가 아니라 어떤 GPU를 쓸 것인지입니다.
• Gemini 3.5 Transcribe Live — API 전용, 공개 프리뷰, 목록 요금 외에 공개된 가격 약속 없음, 그리고 10분 세션 제한으로 인해 그보다 긴 세션은 자체 코드로 분할, 재연결, 이어 붙여야 합니다. 출시와 함께 보고된 세 가지 제약은 특히 아랍어 배포에 중요합니다: 스트리밍 엔드포인트는 화자 분리와 단어 수준 타임스탬프를 반환하지 않으며, 둘 다 배치 엔드포인트에는 있지만 이 엔드포인트에는 없습니다. 아랍어 전사에서 누가 무엇을 말했는지 알아야 하거나 오디오에 시간 정렬되어야 한다면, Live 엔드포인트는 언어에 관계없이 이를 생성할 수 없습니다.
그 두 가지 제약 조건은 실제 아랍어 배포에서 소형 오픈 모델을 선택해야 하는 가장 강력한 근거이며, 정확도와는 전혀 무관합니다. 콜센터 파이프라인은 화자 귀속을 원하고, 규정 준수 파이프라인은 타임스탬프를 원하며, 사용자가 직접 제어하는 정규화 스크립트가 있는 오프라인 아랍어 모델은 엔드포인트 계약과 씨름할 필요 없이 두 가지를 모두 제공합니다. Mistral의 모델 카드도 이를 기능이 아니라 한계로 나열합니다. 이 모델은 전사를 목표로 하며, 일반 실시간 모델을 미세 조정한 것이고, 필요하다면 더 광범위한 모델이 업스트림에 존재한다는 점을 솔직히 밝히고 있습니다.
각각의 비용과 알려지지 않은 점
• Gemini 3.5 Transcribe Live — 오디오 분당 약 $0.009(혼합 기준)로, 백만 입력 토큰당 $3.50, 백만 출력 토큰당 $21의 정가에서 산출된 값입니다. 오디오는 초당 25토큰, 전사본은 분당 약 175토큰으로 산정됩니다. 배치 엔드포인트는 분당 약 $0.005입니다. 두 수치 모두 Google이 가정한 토큰화를 바탕으로 한 추정치이므로, 산정 방식이 바뀌면 달라집니다. 현재 무료 티어가 있습니다.
• Voxtral Mini 4B Realtime Arabic — 공개된 가격은 없습니다. 공개된 서비스가 없기 때문입니다. 비용은 여러분의 하드웨어에 드는 비용과 같습니다. 44억 개 매개변수의 BF16 모델은 최신 가속기 한 대에 들어가므로, 오디오 1시간당 한계 비용은 전기와 활용도이고, 고정 비용은 장비입니다. 이는 대량 사용 시에는 어떤 API당 요금보다도 저렴하고, 사용량이 0일 때는 어떤 분당 API보다도 비쌉니다. 이것이 오픈 소스 거래의 형태입니다.
미스트랄 쪽에서 가장 중요한 미지수는 가격이 아니다. 그것은 이 저장소가 제품 라인의 시작인지, 아니면 모로코 파트너십을 겨냥한 일회성 결과물인지 여부다. 발표도, 가격도, 서비스도 없이 조용히 출시되는 모델은 그 뒤에 지원 약속이 없는 모델이다. Apache 2.0은 이미 보유한 가중치에 대해 라이선스를 철회할 수 없다는 뜻이지만, 체크포인트가 유지될지 여부에 대해서는 아무것도 말해주지 않으며, 카드 자체의 베이스 모델 포인터는 범용 실시간 모델이 여전히 지원되는 라인임을 시사한다.
전사본 위의 계층에서, 라우팅 계층은 전사와는 전혀 무관한 방식으로 제값을 합니다. 이 모델들 중 어느 것도 우리가 호스팅하는 음성-텍스트 서비스가 아니며 — OrcaRouter는 어느 엔드포인트도 라우팅하지 않습니다 — 하지만 스트림을 소비하는 요약기, 의도 분류기, 에이전트는 라우팅할 수 있는 모델입니다: 하나의 API 키로 200개 이상의 모델을 제공업체 정가에 0% 마크업으로 이용할 수 있어, 공급업체 가격 인하가 같은 날 우리 쪽에도 적용되고, 제공업체 성능이 저하될 경우 자동 장애 조치도 제공됩니다. 방언 커버리지를 위해 이미 두 음성 업체를 함께 연결해 두고 있다면, 다운스트림 언어 모델을 두 개의 계약 대신 하나의 키 뒤에 두는 것이 통합에서 더 저렴한 절반입니다.
어느 것을 기반으로 해야 할까?
만약 당신의 오디오가 아랍어라면 — 하나의 방언이든, 여러 방언이든, 아니면 아랍어와 다른 언어 사이를 오가는 코드 스위칭이든 — Mistral 모델이 더 진지하게 고려할 후보이며, 그 이유는 수치적이라기보다 구조적이다. 그것은 자신이 구축된 대상 방언들을 명시하고, 자체 하드웨어에서 실행할 수 있을 만큼 작으며, 자체 정규화로 후처리할 수 있는 원시 텍스트를 반환하고, 10분 세션 제한이나 들여다볼 수 없는 콘텐츠 필터 뒤에 있지 않다. 대가는 그것이 하나의 어족만 처리하고 나머지는 거부한다는 점, 그리고 아직 아무도 그것에 대한 독립적인 평가를 발표하지 않았다는 점이다.
오디오가 여러 언어에 걸쳐 있거나, 오늘 바로 지원 경로와 공개된 요금표를 갖춘 서비스가 필요하다면, Gemini 3.5 Transcribe Live는 지금 호출할 수 있고, 제3자 트래커에서 측정되었으며, Mistral 체크포인트가 거부할 언어들을 지원합니다. 대가는 세션 상한, 스트리밍 엔드포인트에서 다이어리제이션과 타임스탬프가 빠져 있다는 점, 그리고 아랍어 특화 정확도는 직접 테스트해야 하는 주장이라는 점입니다 — 로케일 목록에는 이집트가 명시되어 있지만, 방언 성능은 항목별로 제시되지 않습니다.
주목해야 할 것은 벤치마크가 아니다. 그것은 Mistral이 이 모델을 아예 발표하는지 여부, 그리고 발표한다면 어떤 가격과 어떤 언어 로드맵을 내놓는지다. Apache 2.0 라이선스가 달린 조용한 저장소는 유용한 산출물이자 약한 약속이다. 만약 아랍어 방언 로드맵이 뒤따른다면 — 레반트, 걸프, 이집트를 각각 별도의 체크포인트로 — 소형 모델 경로는 이 지역을 위한 진정으로 완전한 답이 되고, 범위를 넓게 가져간다는 주장은 훨씬 하기 어려워진다.

이 중 어느 것도 우리가 직접 호스팅하는 음성 모델은 아니지만, 트랜스크립트 위의 레이어는 라우팅이 가능합니다 - 하나의 API 키 뒤에 200개 이상의 모델이 제공업체 정가에 0% 마크업으로 연결되어 있으므로, 트랜스크립트 다운스트림에 있는 추론 모델에 대한 벤더의 가격 인하가 같은 날 바로 반영됩니다.
자동 장애 조치는 이어 붙인 음성 파이프라인의 장애 도메인을 하나 줄여 줍니다. 전사 내용을 소비하는 요약기나 의도 분류기가 공급자와 함께 중단되는 대신 다른 경로로 우회될 수 있기 때문입니다.
