Voxtral Mini 4B Realtime Arabic과 Voxtral 4B TTS를 비교하는 히어로 타이틀 카드를 생성했습니다. 부제는 '같은 아랍어 음성 루프의 양 끝, 서로 다른 두 라이선스', 배지는 '음성 입력 대 음성 출력'이며, 세 개의 통계 칩에는 480ms에서 8.82%의 아랍어 문자 오류율 대 70ms의 첫 오디오까지 걸리는 시간, 16개 아랍어 방언 대 아랍어를 포함한 9개 언어, Apache 2.0 가중치 대 CC BY-NC 4.0 가중치가 표시되어 있고, OrcaRouter 로고가 오른쪽 아래 흰색 띠에 합성되어 있습니다.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: 같은 대화의 양 끝

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이 두 모델은 이름, 파라미터 수, 그리고 다르게 작동하는 라이선스 파일을 공유하지만, 유사점은 거기까지다. Voxtral Mini 4B Realtime Arabic은 2026년 10월 8일 별도 발표 없이 Hugging Face에 공개되었으며, 오디오를 입력받아 아랍어 텍스트를 생성한다. 현대 표준 아랍어와 15개 명명된 방언을 위해 구축된 Voxtral-Mini-4B-Realtime-2602의 스트리밍 파인튜닝 모델로, Apache 2.0이며 480밀리초 지연에서 평균 문자 오류율 8.82%를 기록한다. 2026년 3월 Mistral AI가 발표한 Voxtral 4B TTS는 그 반대다. 텍스트를 입력받아 음성을 출력하며, 20개의 사전 설정 음성과 짧은 참조 클립을 통한 적응, 아랍어를 포함한 9개 언어, 그리고 가중치 자체의 상업적 사용을 금지하는 라이선스 CC BY-NC 4.0을 갖추고 있다. 이들은 대안도 아니고 변형도 아니다. 이들은 음성 루프의 두 절반이며, 이 둘을 함께 살펴봐야 하는 이유는 한쪽에 대해 내리는 결정이 대부분의 팀이 예상하는 것보다 다른 쪽을 더 많이 제약하기 때문이다.

대부분의 비교 페이지는 이 모델들이 서로 무관하다고 말할 것입니다. 하나는 ASR이고 하나는 TTS이기 때문이죠. 그리고 거기서 끝입니다. 그 말은 사실이지만 유용하지는 않습니다. 실제로 알아 둘 가치가 있는 것은 두 모델이 만나는 지점입니다. 음성 에이전트에는 둘 다 필요하고, 두 라이선스는 서로 반대 방향을 가리키며, 두 하드웨어 요구 사양은 비슷하지만 처리량 특성은 그렇지 않고, 아랍어 지원 범위에 대한 주장은 그 형태가 완전히 다릅니다. 아래의 모든 내용은 이 네 가지 접점에 관한 것입니다.

파이프라인에서 중요한 기준으로 볼 때, 각 모델이란 무엇인가

• Voxtral Mini 4B Realtime Arabic — 스트리밍 자동 음성 인식. 16 kHz 오디오 입력, 텍스트 출력, BF16 기준 약 44억 개 파라미터, vLLM을 통해 /v1/realtime에서 WebSocket으로 제공되거나 버전 5.2.0부터 Transformers에서 네이티브로 제공됩니다. 인과적 오디오 인코더와 언어 디코더, 공개된 정확도 수치를 위해 480밀리초로 제시된 구성 가능한 전사 지연, 그리고 아랍어 문자 오류율을 다시 도출할 수 있도록 함께 제공되는 정규화 모듈. Apache 2.0.

• Voxtral 4B TTS — 스트리밍 및 배치 텍스트 음성 변환. 텍스트를 입력하면 24kHz 오디오가 WAV, PCM, FLAC, MP3, AAC 또는 Opus로 출력되며, 약 40억 개 파라미터, 20개 음성 프리셋 로스터, 그리고 3초 정도로 짧은 참조 클립으로부터의 음성 적응을 지원합니다. 단일 H200에서 vLLM-Omni 0.18.0을 실행하고 500자 입력과 10초 참조를 사용한 Mistral 자체 벤치마크는 동시성 1에서 70밀리초 지연 시간과 0.103의 실시간 계수를 보고하며, 동시성 16에서는 331밀리초와 0.237로, 동시성 32에서는 552밀리초로 증가합니다. API로 1,000자당 $0.016에 이용할 수 있습니다.

두 문단에서 나오는 첫 번째 관찰은 이 쌍이 작다는 점이다. 두 모델 모두 40억 파라미터 범위에 속하고 둘 다 BF16에서 단일 가속기에 들어가므로, 전적으로 오픈 웨이트로 구축된 아랍어 음성 에이전트는 많아야 2-GPU 배포이며, 양쪽 모두에 양자화를 적용하면 1-GPU 배포도 그럴듯하다. 이것이 이들을 두 개의 별도 제품 결정이 아니라 하나의 세트로 바라볼 실질적인 이유다.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

라이선스 비대칭성이 바로 핵심 발견이며, 각주가 아니다

같은 연구소에서 같은 명명 규칙을 사용하는 모델이면 같은 약관이 적용된다고 생각하는 사람들을 놀라게 하는 점은 바로 이것이다.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. 상업적 사용, 수정, 재배포 및 파인튜닝이 모두 허용되며, 제3자의 권리를 침해하지 않아야 한다는 표준 제한이 적용됩니다.

• Voxtral 4B TTS — CC BY-NC 4.0, 이를 뒷받침하는 참조 음성 데이터셋으로부터 승계된 라이선스입니다. 비상업적 용도. Mistral의 카드에는 이 모델이 자사의 음성 참조 자료 라이선스를 승계한다고 명시되어 있으며, 그 참조 자료는 EARS, CML-TTS, IndicVoices-R 및 아랍어 자연 오디오 세트를 포함한 출처에서 가져온 것입니다. 가중치는 다운로드할 수 있지만 라이선스는 상업용이 아닙니다.

이것은 모두가 가장 먼저 선택하는 바로 그 아키텍처에 대한 강한 제약이다. 음성-텍스트 변환 구간이 Voxtral Mini 4B Realtime Arabic이고 텍스트-음성 변환 구간이 Voxtral 4B TTS인 아랍어 음성 에이전트를 구축한다면, 구성요소 절반은 자유롭게 상업적으로 사용할 수 있고 절반은 그렇지 않은 파이프라인을 갖게 되며, 제한적인 절반이 제품을 좌우한다. ASR 모델이 Apache 2.0이라고 해서 TTS 구간이 구제되는 것은 아니다. 두 모델을 로컬에서 실행해도 라이선스는 바뀌지 않으며, 가중치를 배포하지 않는 것도 마찬가지다. 제약은 배포가 아니라 사용에 따른다.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Mistral이 음성 쪽을 위해 제공하는 상업적 경로는 1,000자당 $0.016의 호스팅 API이며, 이는 라이선스 부여가 아니라 서비스 계약입니다. 제품 팀에게 실질적인 결과는 루프에서 자유롭게 상업화할 수 있는 절반이 듣는 쪽 절반이고, 말하는 쪽 절반은 API 의존성 또는 라이선스 논의라는 점입니다. 이는 대부분의 팀이 개방형 음성 스택을 구축하려 할 때 가정하는 바를 뒤집으며, 통합을 작성한 뒤가 아니라 작성하기 전에 알아둘 가치가 있습니다.

아랍어 주장들은 서로 맞지 않으며, 그중 오직 하나만이 보장 약속입니다.

두 모델 모두 아랍어를 기재한다. 그 기재 내용은 서로 다른 의미를 지닌다.

• Voxtral Mini 4B Realtime Arabic — 아랍어가 전체 범위입니다. 훈련 대상으로 열거된 열여섯 가지 변종은 다음과 같습니다: 현대 표준 아랍어, 모로코 아랍어, 리비아 아랍어, 튀니지 아랍어, 알제리 및 하사니야 아랍어, 걸프 아랍어, 나즈디 아랍어, 오만 및 사나아니 아랍어, 이집트 및 수단 아랍어, 메소포타미아 아랍어와 남부 및 북부 레반트 아랍어 둘 다, 그리고 차드 아랍어. 그 집합 밖의 것은 범위 밖으로 문서화됩니다. 일곱 개의 아랍어 벤치마크에 걸쳐 평균된 하나의 종합 정확도 수치, 8.82% CER.

• Voxtral 4B TTS — 아랍어는 영어, 프랑스어, 스페인어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어, 힌디어와 함께 지원되는 아홉 개 언어 중 하나입니다. 이 카드에서는 해당 지원 범위 내의 "다양한 방언"을 설명하지만 이를 일일이 열거하지는 않으며, 아랍어나 나머지 여덟 개 언어에 대해 공개된 언어별 품질 수치는 없습니다.

함께 읽어 보면, 이 쌍은 시스템이 아랍어를 얼마나 잘 듣는지에 대해서는 자세히 설명해 주지만, 얼마나 잘 말하는지에 대해서는 거의 아무 설명도 해 주지 않습니다. 이러한 비대칭은 다리자 또는 걸프 아랍어 음성 에이전트에 실질적인 영향을 미칩니다. 입력 측에는 공개된 벤치마크와 비교 평가할 수 있는 방언 목록이 있고, 출력 측에는 언어 배지와 음성 명단이 있습니다. 아무도 Voxtral 4B TTS에 대한 방언 아랍어 명료도 측정치를 발표하지 않았으며, 음성 적응 기능도 이 문제를 해결하지 못합니다 — 음성을 적응시키는 것은 그 말소리가 누구처럼 들리는지를 바꿀 뿐, 어떤 방언을 생성하는지는 바꾸지 않습니다.

ASR 모델 자체의 정확도 수치에 관한, TTS 쪽으로도 이어지는 두 번째이자 더 미묘한 점이 있다. Mistral은 동일한 일곱 개 벤치마크와 동일한 정규화에서 오프라인 Voxtral Transcribe Arabic의 7.91%에 비해 스트리밍이 8.82% CER라고 보고하므로, 스트리밍은 약 1포인트의 비용을 치른다. TTS 쪽에서 이에 상응하는 맞바꿈 — 스트리밍 추론이 배치 대비 출력 품질에서 얼마의 비용을 치르는지 — 은 자료에서 전혀 정량화되지 않는다. 지연 시간 수치는 존재하지만, 품질 차이는 존재하지 않는다.

처리량: 한 모델은 한계까지 밀어붙이도록 만들어졌고, 다른 모델은 그렇지 않습니다.

Mistral은 이 모델들 중 정확히 하나에 대해서만 처리량 데이터를 공개했으며, 그 수치가 그 이유를 설명해 줍니다.

• Voxtral 4B TTS — 단일 H200에서 vLLM-Omni로 측정한 결과, 500자 입력과 10초 오디오 레퍼런스 기준으로 처리량은 동시성 1에서 GPU 시간 1초당 약 119자에서 동시성 16에서 약 879자, 동시성 32에서 약 1,431자까지 올라가며, 지연 시간은 70밀리초에서 331밀리초, 그다음 552밀리초로 증가합니다. 이는 용량 계획을 세울 수 있는 처리량 곡선이며, 프로덕션 음성 서비스를 위해 설계된 모델에서 기대할 수 있는 형태입니다.

• Voxtral Mini 4B Realtime Arabic — 이 카드에는 처리량 수치도, 동시성 동작도, 하드웨어 벤치마크도 보고되지 않습니다. 대신 명시된 것은 아키텍처입니다: 인과적 인코더와, 인코더 및 디코더 양쪽에 적용된 슬라이딩 윈도우 어텐션 방식으로, 기본 모델에서는 사실상 무한 스트리밍을 지원한다고 설명됩니다. 정확도 지점은 480밀리초 지연으로 제시되는데, 이는 적절한 하드웨어에서 모델이 실시간 오디오를 따라잡는다는 것을 의미하며, 이것이 공개된 성능 범위의 전부입니다.

이 격차는 두 모델 중 어느 쪽에 대한 비판이라기보다는 성숙도에 관한 진술에 가깝습니다. TTS 모델에는 공개된 SLO 표가 있는데, 이는 블로그 글, 데모, API, 가격과 함께 제품으로 출시되었기 때문입니다. 아랍어 ASR 모델에는 공개된 성능 범위가 없는데, 이는 모델 카드가 포함된 저장소로 등장했기 때문입니다. 오늘날 아랍어 전사 플릿의 규모를 산정하고 있다면, 필요한 처리량 수치는 아직 존재하지 않으며, 이를 얻는 유일한 방법은 자체 하드웨어에서 자체 오디오로 vLLM 서빙 경로를 실행하는 것입니다.

라우팅 계층이 단순한 과금이 아니라 배포의 형태를 바꾸는 지점도 바로 여기입니다. OrcaRouter는 이 두 모델 중 어느 것도 라우팅하지 않습니다 — 우리는 Mistral 음성 엔드포인트를 호스팅하지 않으며, 이 글도 그렇다고 주장하지 않습니다 — 하지만 두 모델 사이의 언어 모델 계층은 바로 라우팅의 이점을 누리는 계층입니다: 공급자 정가에 0% 마크업으로 200개가 넘는 모델 전반에서 하나의 API 키를 사용할 수 있으므로 벤더 가격 변경이 발표되는 당일 우리 쪽에 반영되고, 자동 장애 조치 덕분에 단일 업스트림 공급자의 안 좋은 오후가 음성 루프의 중단이 아니라 재라우팅이 됩니다. 두 개의 자체 호스팅 Mistral 모델과 하나의 호스팅된 추론 모델로 구성된 음성 에이전트에는 세 개의 장애 도메인이 있습니다. 라우팅 계층이 바로 가운데 장애 도메인을 별일 아닌 것으로 만드는 것입니다.

비용, 나란히 비교하되, 한쪽에는 가격이 없다는 전제하에

• Voxtral 4B TTS — Mistral의 API를 통해서는 1,000자당 0.016달러이며, 사용 사례가 허용하는 조건 아래 직접 호스팅한다면 GPU 비용이 듭니다. 대략적인 규모를 감잡자면 1,000자는 대략 200단어 정도이므로, 정가 기준으로 1분 분량의 음성 출력은 1센트의 낮은 몇 분의 일 수준에 해당하며, 이는 직접 실행함으로써 얻는 동시 처리 이점은 따지기도 전의 이야기입니다.

• Voxtral Mini 4B Realtime Arabic — 공개된 가격도, 호스팅 서비스도, 요금표도 없습니다. 비용은 하드웨어와 활용률입니다. 최신 가속기 한 대에서 구동되는 4.4B BF16 모델은 고정 월 비용이며, 이를 해당 장비가 처리할 수 있는 오디오 양 전체에 걸쳐 상각하게 됩니다. 이 비용은 지속적인 사용량에서는 저렴하고, 간헐적인 사용량에서는 순전한 낭비입니다.

아마 더 중요한 비교는 대신 선택하게 될 대안들과의 비교일 것입니다. 듣기 쪽에서는 아랍어 체크포인트가 요금이 공개되어 있고 낮은 시간당 스트리밍 API들과 경쟁하고 있습니다 — Microsoft의 MAI-Transcribe-2-Streaming은 오디오 시간당 $0.54의 도입가, xAI의 Grok Voice Transcribe 2.0은 오디오 시간당 $0.20의 스트리밍 요금 — 즉 아랍어 전사 서비스를 분당 1센트의 몇 할 수준으로 구매할 수 있다는 뜻이며, 오픈 웨이트의 명분은 단위 비용이 아니라 방언 정확도, 데이터 상주 또는 파인튜닝에 두어야 한다는 뜻입니다. 말하기 쪽에서는 한계 비용이 0인 자체 호스팅 TTS 모델이 대량 사용 시 문자당 과금 API보다 실질적인 이점이 되는데, 그래서 CC BY-NC 라이선스가 가격이 아니라 제약 요인이 됩니다.

가격 기반 전환을 예산에 반영하려는 분들을 위한 구조적 참고 사항 하나: 공급자 정가를 0% 마크업으로 그대로 전달하는 라우터는 공급업체 요율 변경이 다음 재가격 책정 주기가 아니라 발표 당일에 드러나는 지점입니다. 이는 말하기 측보다 듣기 측에서 더 중요합니다. 전사는 오디오 시간당 가격이 책정되며, 그것은 공급업체들이 조정하는 수치이기 때문입니다.

그들 중에서 선택하는 방법에 대해 어떻게 생각할까

당신은 그들 중에서 고르는 게 아닙니다. 문제는 루프의 어느 절반을 오픈 웨이트 위에 구축할 수 있느냐이며, 그 답은 라이선스가 내놓습니다.

요구 사항이 오디오가 인프라를 절대 벗어나지 않는 자체 포함형 아랍어 음성 에이전트라면, 듣기 부분은 조건 없이 사용할 수 있습니다: Apache 2.0, 다운로드 가능, 파인튜닝 가능, 테스트해 볼 수 있는 방언 목록과 공개된 아랍어 오류율까지 갖추고 있습니다. 말하기 부분에서 제약이 걸리며, 여기에는 두 가지 솔직한 선택지가 있습니다 — 음성 합성을 상업 계약에 따라 호스팅 서비스로 옮기거나, 아키텍처에서 Voxtral 4B TTS를 제거하고 아랍어를 위한 허용적 라이선스의 합성 모델을 찾는 것입니다.

요구 사항이 프로덕션 음성 전사 서비스이고 언어가 아랍어라면, 결정은 공개된 방언 분류 체계와 하나의 통합 오류율을 갖춘 다운로드 가능한 4.4B 체크포인트와, 공개된 요금, 공개된 지연 시간, 제3자 리더보드를 갖춘 호스팅형 스트리밍 API 사이에서 내려야 합니다. 오픈 모델은 통제력, 데이터 상주성, 파인튜닝에서 우위를 보이고, 호스팅 옵션은 근거, 지원, 운영 단순성에서 우위를 보입니다. 가중치가 공개된 지 이틀 뒤에도 Mistral 외부에서는 이를 측정한 사람이 아무도 없으며, 그것은 이 체크포인트를 무시할 이유가 아니라 직접 벤치마크를 실행할 이유입니다.

이 판도를 가장 크게 바꿀 것은 상업적 사용을 허용하는 조건으로 공개되는 아랍어 합성 릴리스입니다 — 듣기 쪽이 이미 따르고 있는 것과 같은 패턴입니다. 그것이 존재하기 전까지 루프는 반쯤 열린 채로 남아 있고, 실질적인 작업은 어느 절반을 기꺼이 빌릴지 결정하는 것입니다.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

우리는 이 Mistral 음성 모델 중 어느 것도 호스팅하지 않으며, 이 글도 그렇다고 주장하지 않습니다. 음성 루프가 그 위에서 필요로 하는 것은 언어 계층이며, 그것은 라우팅할 수 있습니다 - 200개 이상의 모델에 걸친 하나의 API 키를 공급자 정가에 0% 마크업으로 제공하므로, 공급업체의 요금 변경은 발표되는 당일 우리 쪽에 반영됩니다.

자동 장애 조치세 구성 요소로 이루어진 음성 에이전트의 중간 부분, 즉 두 개의 자체 호스팅 Mistral 모델 사이에 있는 하나의 업스트림 추론 모델이 제품을 중단시키는 부분이 되지 않도록 막아 줍니다.