Voxtral Mini 4B Realtime Arabic와 MAI-Transcribe-2-Streaming의 비교를 위한 히어로 타이틀 카드가 생성되었습니다. 부제는 '10월에 도착한 두 제품, 두 가지 증거 문제'이고, 배지는 '2026년 10월, 둘 다 공급업체 보고'이며, 480ms에서 8.82% 아랍어 문자 오류율 대 0.13초에서 2.5% 단어 오류율, 16개 방언 대 60개 언어, Apache 2.0 가중치 대 오디오 1시간당 $0.54의 Azure 미리 보기를 표시하는 세 개의 통계 칩이 있습니다. OrcaRouter 로고는 오른쪽 아래 흰색 띠에 합성되어 있습니다.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: 10월에 등장한 두 제품, 두 가지 증거 문제

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 실시간 음성 모델은 7일 간격을 두고 서로 반대되는 방식으로 등장했다. MAI-Transcribe-2-Streaming은 Microsoft AI의 첫 스트리밍 전사 모델로, 2026년 10월 1일 출시 게시물과 Azure 미리보기 등록, 연말까지 오디오 1시간당 0.54달러의 도입 가격, 그리고 2.5% 단어 오류율로 최종 및 부분 전사 정확도 모두에서 Artificial Analysis 스트리밍 보드 1위이며 음성 종료 후 0.13초 만에 최종 텍스트가 준비된다는 주장과 함께 발표되었다. Voxtral Mini 4B Realtime Arabic은 Mistral AI의 아랍어 방언 스트리밍 모델로, 2026년 10월 8일 Hugging Face에 공개되었지만 아무런 발표도 없었다 — 블로그 글도, 가격도, 서비스도 없이, 그저 Apache 2.0 가중치와 480밀리초 지연에서 일곱 개 아랍어 벤치마크 전반에 걸쳐 평균 8.82% 문자 오류율을 보고하는 모델 카드만 있었다. Microsoft 모델은 검증할 수 없는 대표 성능을 내세운 완성품이다. Mistral 모델은 주변에 제품이 없는 검증 가능한 결과물이다. 둘 모두 이해할 가치가 있는데, 바로 둘 모두 핵심 질문 — 이것이 아랍어를 얼마나 잘 처리하는가 — 에 대한 답을 벤더만 제시하기 때문이다.

그 비교는 어쨌든 해볼 가치가 있다. 두 모델이 동일한 엔지니어링 결정을 서로 반대편에서 규정하기 때문이다. Microsoft는 폭넓은 범위와 관리형 서비스를 판매한다: Azure AI Speech 안에서 실행되고 자동 연속 언어 감지를 지원하는 60개 언어, 시간당 과금, 프리뷰 상태다. Mistral은 깊이를 무료로 내놓는다: 이름이 붙은 열여섯 가지 아랍어 변종, 하나의 가속기에서 실행할 수 있을 만큼 작고, 점수 산정을 직접 검증할 수 있게 해주는 정규화 스크립트까지 있다. 이번 달에 아랍어 전사 파이프라인을 구축한다면, 당신은 그 두 입장 중 하나를 선택하는 것이며, 그 선택은 어느 쪽이든 아직 가지고 있지 않은 증거에 달려 있다.

각 벤더가 실제로 한 말과 벤치의 말

증거 격차는 이 맞대결에서 가장 중요한 특징이므로, 가장 먼저 다룹니다.

• MAI-Transcribe-2-Streaming — 발화 종료 후 0.13초에 최종 전사 단어 오류율 2.5%, 그리고 첫 부분 전사에서도 0.12초에 동일한 2.5%를 기록했으며, 둘 모두 Artificial Analysis의 AA-WER Streaming 방법론에서 정확도 1위로 제시된다. Microsoft 자체의 표현이다. 이 글을 작성하는 시점 기준으로, 해당 트래커의 스트리밍 보드에는 이 모델에 대한 행이 아직 그려지지 않았으므로, 이 주장은 트래커가 공개한 수치의 뒷받침 없이 트래커의 방법론에 기대고 있다.

• Voxtral Mini 4B Realtime Arabic — 480밀리초로 설정된 지연에서 7개 아랍어 벤치마크 전반에 걸쳐 평균 문자 오류율 8.82%. 평가 코드가 함께 제공된 Mistral 자체 카드. 아직 제3자가 이를 재현하지 못했으며, 모델은 출시된 지 이틀밖에 되지 않았다.

그래서 이 글의 두 대표 수치는 각각 남의 자로 잰 공급업체 주장과, 자기 자를 달고 나온 공급업체 주장입니다. 둘 다 독립적인 측정치는 아닙니다. 차이는 Mistral의 수치는 다시 도출하는 데 필요한 정규화 스크립트와 함께 제공되는 반면, Microsoft의 수치는 아직 그것을 차트에 올리지 않은 리더보드와 함께 제공된다는 점입니다. 조달 결정을 내리고 있다면, 그 구분이 2.5 대 8.82 격차보다 더 중요합니다. 어차피 그 격차는 무의미합니다 — 단어 오류율과 문자 오류율은 서로 환산되지 않고, 아랍어 정서법은 둘 사이의 격차를 상당히 벌리기 때문입니다.

미스트랄의 카드 안에서 실제로 설득력이 있는 유일한 비교는 자사의 오프라인 형제 모델과의 비교다: Voxtral Transcribe Arabic은 동일한 7개 벤치마크에서 동일한 정규화로 CER 7.91%를 기록하므로, 스트리밍은 이 모델에 0.91%포인트의 비용을 초래한다. 마이크로소프트는 2026년 9월 3일 배치 MAI-Transcribe-2를 출시하며 자사 제품군에 대한 동등한 수치를 공개했는데, 단어 오류율은 2.0%였다 — 스트리밍 변형은 실시간 전달을 추가하는 대신 배치 모델에 비해 0.5%포인트를 내준다. 이 두 벤더 내부 델타를 나란히 읽어 보면 이 기사에서 유일하게 동일 조건으로 비교할 수 있는 진술을 얻게 된다: 각자의 벤치마크에서 각 연구소의 스트리밍 SKU는 배치 형제 모델에 뒤처지며, 한 경우에는 약 1%포인트, 다른 경우에는 0.5%포인트 뒤처지고, 둘은 서로 다른 언어를 측정하고 있다.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

언어 지원 범위: 60 대 16, 그리고 양쪽 모두에서 동일한 이름 없는 격차

• MAI-Transcribe-2-Streaming — 자동 연속 언어 감지를 지원하는 60개 언어로, 스트림 중간에 언어가 바뀌는 세션도 언어를 미리 선언할 필요가 없습니다. Microsoft의 출시 자료에는 개수만 나와 있을 뿐 목록은 없습니다. MAI-Transcribe 제품군에 대한 Azure 언어 지원 문서에 지원 범위가 항목별로 정리되어 있으며, 해당 제품군의 지원 언어 중 하나로 아랍어가 문서화되어 있습니다.

• Voxtral Mini 4B Realtime Arabic — 16가지 아랍어 변종으로, 각각 개별 명칭이 있습니다: 현대 표준 아랍어, 모로코 아랍어, 리비아 아랍어, 튀니지 아랍어, 알제리 아랍어와 하사니야 아랍어, 걸프 아랍어, 나즈디 아랍어, 오만 아랍어와 사나아 아랍어, 이집트 아랍어와 수단 아랍어, 메소포타미아 아랍어, 남부 및 북부 레반트 아랍어, 그리고 차드 아랍어. 이 범위를 벗어나는 경우, 이 모델은 지원 대상이 아니라고 문서에 명시되어 있으며, 일반 Voxtral Mini 4B Realtime을 참조하도록 안내합니다.

어느 숫자도 여러분에게 필요한 답을 주지 않는다. Microsoft의 60은 아랍어를 포함하지만 아랍어 성능을 설명하지는 않는 범위 집계이고, 출시 게시물은 언어 총계를 한 번 언급하고 넘어간다. Mistral의 16은 일곱 개 벤치마크 세트 전반에 걸친 단일 집계 오류율과 함께 제시된 학습 대상의 열거이므로, 다시 말해 여러분의 모로코 통화 오디오가 전사되는지를 실제로 결정하는 요소인 방언 수준의 세부 내역 역시 공개되지 않았다는 뜻이다. 두 모델, 두 공급업체, 그리고 두 경우 모두 "걸프 아랍어에서는 구체적으로 얼마나 잘하는가"에 대한 정직한 답은 다음과 같다: 명시되지 않음.

열거가 실제로 주는 것은 사전 확률(prior)이다. 차드 아랍어와 하사니야 아랍어를 명시적 대상으로 둔 모델은 북아프리카 분포에 맞춰 튜닝되었다. Mistral은 모로코의 Ministère de la Transition Numérique et de la Réforme Administrative와 함께 이를 공동 개발했고, 그 부처와 함께 일곱 개 벤치마크 중 두 개 — ISMA와 Darija in the Wild — 를 특히 어려운 사례를 측정하기 위해 구축했다. 범용 60개 언어 모델은 우선 현대 표준 아랍어에서 개선되는데, 훈련 신호의 양이 바로 거기에 있기 때문이다. 당신의 오디오가 다리자 또는 걸프 아랍어라면, 그것들은 다른 문제이며, 이 두 공급업체 중 오직 한 곳만이 둘 중 어느 하나에 대해서라도 수치를 제시했다.

지연 시간과 지연의 형태

• MAI-Transcribe-2-Streaming — 음성 종료부터 최종 전사까지 0.13초, 첫 부분 전사는 0.12초로, 부분 전사와 최종 전사가 사실상 동일한 지연 시간이라고 볼 수 있을 만큼 빠릅니다. Microsoft의 주장이며, 트래커의 방법론에 따라 측정된 수치입니다.

• Voxtral Mini 4B Realtime Arabic — 공개된 정확도 지점에서 480밀리초의 설정된 지연이며, 지연은 조정 가능합니다. 이는 대략 Microsoft 수치의 3.5배이고, 고정된 속성이 아니라 운영자가 선택하는 매개변수입니다.

0.3초는 발화 도중에 응답해야 하는 음성 에이전트에게는 실질적인 차이이고, 자막을 읽는 사람에게는 거의 보이지 않는 차이입니다. 이는 또한 다이얼과 숫자의 차이이기도 합니다. Mistral의 지연 파라미터는 더 타이트하게 운용하고 더 많은 오류를 감수하거나, 더 느슨하게 운용해 정확도를 되찾을 수 있다는 뜻입니다 — 이 체크포인트의 파인튜닝 출발점이 된 기반 모델은 240밀리초에서 2.4초까지의 범위를 제시합니다 — 반면 Microsoft의 동작점은 Azure가 제공하는 값입니다. 그래서 Microsoft의 수치는 추론하기 더 쉽고 Mistral의 수치는 튜닝하기 더 쉽습니다. 그리고 이는 두 정확도 수치를 비교하는 것이 실제로는 한 곡선 위의 선택된 두 점과 다른 곡선 위의 고정된 한 점을 비교하는 것임을 의미합니다.

기능 표면도 그에 못지않게 뚜렷이 다르므로, 정확도 논의가 흥미로워지기 전에 여러분의 파이프라인 요구사항과 대조해 확인해 볼 가치가 있습니다.

• MAI-Transcribe-2-Streaming — Azure AI Speech를 통해 제공되며, 제품군에 문서화된 기능 세트를 갖추고 있습니다: 화자 분리, 단어 수준 타임스탬프, 키워드 및 구문 바이어싱, 축어적 출력 스타일과 정제된 출력 스타일, 자동 언어 식별. 스트리밍 SKU 자체의 화자 분리 및 타임스탬프 관련 문서는 배치 모델의 문서보다 빈약하므로, 동등성을 가정하지 말고 엔드포인트별로 이를 확인하십시오.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — 이 카드는 인과적 오디오 인코더를 사용한 전사, /v1/realtime에서 WebSocket을 통한 vLLM 서빙, 버전 5.2.0부터의 네이티브 Transformers 지원, 정규화 모듈을 문서화합니다. 이 체크포인트에 대해서는 화자 분리나 단어 수준 타임스탬프를 문서화하지 않습니다.

전달 모델: 다운로드 가능한 가중치와 대비되는 프리뷰 서비스

• MAI-Transcribe-2-Streaming — Azure 프리뷰이므로 SLA가 없고, 공급업체가 프로덕션 의존을 권장하지 않습니다. 2026년 말까지 적용되는 도입 요금으로 오디오 시간당 $0.54에 책정되었으며, 표준 요금은 공개되지 않았습니다. 배치 MAI-Transcribe-2는 동일한 기간 한정 기준으로 오디오 시간당 $0.10에 출시되었습니다. 스트리밍 비용은 배치 요금의 5.4배입니다.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, BF16 기준 약 44억 개 파라미터, 다운로드 가능, 파인튜닝 가능, 단일 가속기에서 서빙 가능. 가격도, SLA도, 지원 약속도 없습니다. 그 뒤에 서비스가 없기 때문입니다.

그 두 문장에 결정이 담겨 있다. 파격적인 시작 요금과 공개되지 않은 표준 가격을 내건 프리뷰 서비스는 만료되는 약속이다. 5.4배 스트리밍 프리미엄과 2026년까지라는 기간은 모두 마이크로소프트가 바꿀 수 있는 것이며, 표준 요금이 정해질 때 주시해야 할 숫자는 배치 대 스트리밍 비율이다. 아무런 발표도 없는 Apache 2.0 가중치는 정반대다. 아무도 되돌릴 수 없는 산출물이며, 아무도 설명하지 않은 공급업체 관계에 묶여 있다. 체크포인트가 유지될지는 알 수 없지만, 오늘 가진 파일은 그와 무관하게 계속 작동한다.

업종별 제약이 바로 실무에서 이런 질문을 좌우하는 경우가 많다. 규제를 받는 기관 내부에 아랍어 콜센터를 구축하는 경우, 오디오를 프리뷰 클라우드 엔드포인트로 아예 전송할 수 없을 수도 있다. 이미 Azure AI Speech로 표준화한 팀이라면 하나의 언어군을 위해 두 번째 온프레미스 스택을 도입하고 싶지 않을 수 있다. 두 제약 모두 타당하며, 어느 쪽도 두 출시의 대표 수치인 2.5%와 8.82%와는 아무 관련이 없다.

전사 계층 위에서는 두 경우 모두에 같은 논리가 적용됩니다. OrcaRouter는 이 음성 모델들 중 어느 것도 라우팅하지 않습니다 — 이는 우리가 제공하지 않는 두 시스템의 비교입니다 — 하지만 전사본을 소비하는 요약기, 분류기 또는 에이전트는 라우팅할 수 있습니다: 하나의 API 키로 200개 이상의 모델을 공급자 정가에 0% 마크업으로 이용할 수 있으므로, 공급업체의 가격 변경이 같은 날 우리 쪽에 반영되고, 공급자가 저하되면 자동 장애 조치가 이루어집니다. 이것이 특히 여기서 도움이 되는 지점은 시험 단계입니다: 두 전사 후보를 하나의 다운스트림 파이프라인에, 하나의 키 뒤에 연결하는 것이 두 개의 통합을 구축하지 않고 일대일 비교를 실행하는 방법입니다.

이것을 판가름할 시험

어느 벤더도 아랍어 특화 성능을 발표하지 않았으며, 어느 쪽도 방언 오디오로 독립적으로 평가된 적이 없다. 따라서 비교는 세 가지 사실과 하나의 권고로 귀결된다.

사실 관계는 다음과 같습니다: Microsoft의 스트리밍 모델은 0.13초로 더 빠르며, 아직 이를 표시하지 않은 리더보드에서 더 나은 종합 정확도를 주장합니다; Mistral의 모델은 480밀리초로, 방언 목록과 아랍어 오류율, 그리고 이를 다시 도출할 수 있는 정규화 코드를 공개합니다; 그리고 두 정확도 수치는 비교할 수 없는데, 하나는 단어 오류율이고 다른 하나는 다른 말뭉치에서의 문자 오류율이기 때문입니다.

권고 사항: 이 결정을 내리는 사람은 누구든 두 모델을 자신의 오디오로 실행해 봐야 합니다. 왜냐하면 그것이 두 공급업체 모두가 열어 둔 유일한 측정이기 때문입니다. 실제 녹음으로 평가 세트를 구성하세요 — 실제로 받는 방언 구성, 실제로 사용하는 코덱, 실제로 필요한 도메인 어휘 — 그리고 신뢰하는 참조에 대해 Mistral의 정규화로 둘 다 채점하세요. 자신의 녹음으로 두 시간 테스트하면 두 출시 게시물을 합친 것보다 더 많은 것을 알 수 있으며, 0.13초 우위가 프리뷰 의존성과 5.4× 스트리밍 프리미엄을 감수할 가치가 있는지, 아니면 480밀리초의 다운로드 가능한 4.4B 모델이 이미 작업에 충분한지 알아내는 유일한 방법입니다.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter는 이 두 음성 모델 중 어느 것도 제공하지 않으며, 이 글은 그렇다고 암시하지도 않습니다. 이 글이 다루는 것은 전사 내용을 읽어들이는 언어 계층입니다: 하나의 키 뒤에 있는 200개 이상의 모델을 공급업체 정가에 0% 마크업으로 제공하므로, 다운스트림 모델의 공급업체 가격 변경이 발표되는 당일 여러분에게 전달됩니다.

자동 장애 조치를 사용하면 두 전사 후보가 두 개의 통합 대신 하나의 다운스트림 파이프라인에 공급할 수 있으며, 이는 정면 비교를 실행하는 가장 저렴한 방법이기도 합니다.