Voxtral Mini 4B Realtime Arabic と Voxtral 4B TTS の比較用ヒーロータイトルカードを生成しました。サブタイトルは「同じアラビア語音声ループの両端、二つの異なるライセンス」、バッジは「音声入力 vs 音声出力」、3つの統計チップはそれぞれ、480ms 時点のアラビア語文字誤り率 8.82% 対 初回音声までの時間 70ms、アラビア語の16方言 対 アラビア語を含む9言語、Apache 2.0 の重み 対 CC BY-NC 4.0 の重みと表示し、OrcaRouter のロゴが右下の白い帯に合成されています。
Engineering & Research

Voxtral Mini 4B Realtime Arabic 対 Voxtral 4B TTS:同じ会話の両端

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これら2つのモデルは名前とパラメータ数を共有しているが、ライセンスファイルの挙動は異なり、類似点はそこまでだ。Voxtral Mini 4B Realtime Arabic は、2026年10月8日に何の発表も添えずに Hugging Face に公開されたもので、音声を入力としてアラビア語テキストを生成する — 現代標準アラビア語と15の名前付き方言向けに構築された Voxtral-Mini-4B-Realtime-2602 のストリーミング微調整版で、Apache 2.0、480ミリ秒の遅延で平均文字誤り率8.82%。Mistral AI が2026年3月に発表した Voxtral 4B TTS は逆を行い、テキストを入力し、音声を出力する。20のプリセット音声に加えて短い参照クリップからの適応、アラビア語を含む9言語、そしてライセンス — CC BY-NC 4.0 — は重み自体の商用利用を禁じている。これらは代替案ではなく、変種でもない。それらは音声ループの2つの半分であり、一緒に見るべき理由は、一方について下す決定が、ほとんどのチームが予想する以上に他方を制約するからだ。

多くの比較ページは、一方がASRで他方がTTSだからこの2つのモデルは無関係だと言って、そこで終わります。それは事実ですが、役には立ちません。本当に知る価値があるのは、両者が交わる点です。音声エージェントには両方が必要で、2つのライセンスは相反する方向を指しており、2つのハードウェアフットプリントは似ている一方でスループット特性は似ておらず、アラビア語対応の主張はまったく異なる形をしています。以下では、これら4つの接点について述べます。

パイプラインにとって重要な観点から見た、各モデルとは何か

• Voxtral Mini 4B Realtime Arabic — ストリーミング自動音声認識。入力は 16 kHz 音声、出力はテキスト、BF16 で約 44 億パラメータ、vLLM を通じて /v1/realtime の WebSocket で、またはバージョン 5.2.0 以降の Transformers でネイティブに提供されます。因果的な音声エンコーダーと言語デコーダー、公表された精度値のために 480 ミリ秒と示されている設定可能な文字起こし遅延、そしてアラビア語の文字誤り率を再導出できるよう併せて提供される正規化モジュール。Apache 2.0。

• Voxtral 4B TTS — ストリーミングおよびバッチのテキスト読み上げ。テキストを入力すると、24 kHz の音声を WAV、PCM、FLAC、MP3、AAC、Opus で出力。パラメータ数は約40億で、20種類の音声プリセットを備え、わずか3秒の参照クリップからの音声適応にも対応。Mistral自身のベンチマークでは、vLLM-Omni 0.18.0 を実行する単一の H200 上で、500文字の入力と10秒の参照を使用した場合、同時実行数1でレイテンシ70ミリ秒、リアルタイム係数0.103。同時実行数16では331ミリ秒および0.237、同時実行数32では552ミリ秒。APIとして1,000文字あたり0.016ドルで利用できます。

これら2つの段落から得られる最初の所見は、このペアが小規模だということだ。どちらのモデルも40億パラメーター規模にあり、どちらもBF16で単一のアクセラレーターに収まる。つまり、完全にオープンウェイトで構築されたアラビア語音声エージェントは、多くても2基のGPUでのデプロイであり、両側で量子化を行えば1基のGPUでのデプロイも十分現実的である。これが、2つの別個の製品判断としてではなく、ひとまとまりのセットとして両者を見る実用的な理由である。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

ライセンスの非対称性こそが発見であり、補足ではない

同じ研究所の同じ命名規則のモデルなら同じ条件が適用されると思い込んでいる人たちを驚かせるのは、この点です。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0。商用利用、改変、再配布、ファインチューニングはすべて許可されていますが、第三者の権利を侵害しないという標準的な制限が適用されます。

• Voxtral 4B TTS — CC BY-NC 4.0。これは、その背後にある参照音声データセットから継承されたライセンスであり、非商用利用に限られます。Mistralのモデルカードには、このモデルが音声参照のライセンスを継承していることが明記されており、その参照はEARS、CML-TTS、IndicVoices-R、およびアラビア語の自然音声データセットを含む情報源から取得されています。重みはダウンロード可能ですが、ライセンスは商用利用を許すものではありません。

これは、誰もがまず手を伸ばすような正確なアーキテクチャに対する厳しい制約である。音声認識の部分にVoxtral Mini 4B Realtime Arabicを使い、音声合成の部分にVoxtral 4B TTSを使うアラビア語音声エージェントを構築すると、構成要素の半分は自由に商用利用でき、半分はそうではないパイプラインが出来上がり、その制限的な半分が製品全体を支配することになる。ASRモデルがApache 2.0であることは、TTSの部分を救わない。両者をローカルで実行してもライセンスは変わらず、重みを配布しないことも同様である。この制約は配布ではなく利用に付随するものである。

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Mistralが音声側で提供している商用ルートは、1,000文字あたり0.016ドルのホスト型APIであり、これはライセンス許諾ではなくサービス契約です。製品チームにとっての実務的な帰結は、ループのうち自由に商用化できる半分は聞く側であり、話す側はAPI依存かライセンス交渉のどちらかになる、ということです。これは、オープンな音声スタックを構築しようとしているときにほとんどのチームが前提としていることを逆転させます。そして、統合を書き終えた後ではなく、書く前に知っておく価値があります。

アラビア語の主張は辻褄が合わず、そのうち補償の約束であるものは一つだけだ

どちらのモデルもアラビア語を記載しています。その記載内容はそれぞれ意味が異なります。

• Voxtral Mini 4B Realtime Arabic — アラビア語が対象範囲のすべてです。訓練対象として列挙された16の変種:現代標準アラビア語、モロッコ、リビア、チュニジア、アルジェリア、ハッサニヤ・アラビア語、湾岸、ナジド、オマーン、サナア・アラビア語、エジプト、スーダン、メソポタミア、南レヴァントと北レヴァント、チャド。その集合に含まれないものは範囲外として文書化されています。7つのアラビア語ベンチマークで平均した集計精度指標はCER 8.82%です。

• Voxtral 4B TTS — アラビア語は、英語、フランス語、スペイン語、ドイツ語、イタリア語、ポルトガル語、オランダ語、ヒンディー語と並ぶ、9つのサポート言語の1つです。カードには、そのサポートの範囲内で「多様な方言」が説明されていますが、それらは列挙されておらず、アラビア語についても、他の8言語のいずれについても、言語別の品質指標は公表されていません。

併せて読むと、このペアは、あなたのシステムがアラビア語をどれだけよく聞き取れるかについては詳細な説明を与える一方、どれだけよく話せるかについてはほとんど何も述べていない。この非対称性は、Darija や湾岸アラビア語の音声エージェントにとって現実的な影響がある。入力側には公開ベンチマークと、評価対象にできる方言リストがあるが、出力側には言語バッジと音声ロスターがあるだけだ。Voxtral 4B TTS について、方言アラビア語の了解度測定を公開した者は誰もおらず、音声適応機能もそれを解決しない——音声を適応させると変わるのは、その音声が誰のように聞こえるかであり、生成される方言ではない。

ASRモデル自身の精度指標について、TTS側にも当てはまる、より微妙な第2の点がある。Mistralは、同じ7つのベンチマークと同じ正規化で、オフラインのVoxtral Transcribe Arabicの7.91%に対して、ストリーミングのCERを8.82%と報告している。したがって、ストリーミングには約1ポイントのコストがかかる。TTS側の同等のトレードオフ — ストリーミング推論がバッチと比べて出力品質にどれほどのコストを伴うか — は、資料ではまったく定量化されていない。レイテンシの数値はあるが、品質の差分はない。

スループット:一方のモデルは限界まで追い込むことを前提に設計されており、もう一方はそうではない

Mistralはこれらのモデルのうちただ1つについてスループットデータを公開しており、その数字が理由を説明している。

• Voxtral 4B TTS — 1台のH200上でvLLM-Omniを用いて測定したところ、500文字の入力と10秒の音声リファレンスで、スループットは同時実行数1ではGPU時間1秒あたり約119文字、同時実行数16では約879文字、同時実行数32では約1,431文字となり、レイテンシーは70ミリ秒から331ミリ秒、そして552ミリ秒へと上昇します。これはキャパシティプランニングの基準にできるスループット曲線であり、本番音声サービスとして設計されたモデルから期待される通りの形です。

• Voxtral Mini 4B Realtime Arabic — カードにはスループットの数値、同時実行時の挙動、ハードウェアベンチマークは報告されていない。記載されているのはアーキテクチャである。因果エンコーダーと、エンコーダーおよびデコーダーの両方におけるスライディングウィンドウ注意方式で、ベースモデルでは事実上無制限のストリーミングをサポートすると説明されている。精度のポイントは480ミリ秒の遅延で示されており、これは適切なハードウェア上でモデルがリアルタイム音声に追随できることを示唆する。そして、公表されている性能範囲はそこまでである。

この差は、どちらかのモデルへの批判というよりも、成熟度についての言明である。TTSモデルには公開されたSLO表がある。ブログ記事、デモ、API、価格を伴って製品としてリリースされたからだ。アラビア語ASRモデルには公開された性能範囲がない。モデルカード付きのリポジトリとして登場したからだ。今日、アラビア語の文字起こしフリートをサイジングしているなら、必要とするスループットの数値はまだ存在せず、それを得る唯一の方法は、自前のハードウェアで自前の音声を使ってvLLMのサービングパスを実行することだ。

そこはまた、ルーティング層が課金だけでなくデプロイメントの形を変える場所でもある。OrcaRouterはこれらのモデルのどちらもルーティングしない — 当社はMistralの音声エンドポイントのどちらもホストしておらず、この記事はそう主張しているわけではない — しかし、それらの間にある言語モデル層こそ、ルーティングされることで恩恵を受けるまさにその層である: 1つのAPIキーで200以上のモデルにプロバイダー定価で0%のマークアップでアクセスでき、ベンダーの価格変更が発表されたその日に当社側に反映され、自動フェイルオーバーにより、単一の上流プロバイダーの不調な午後は、あなたの音声ループの停止ではなく再ルーティングになる。2つのセルフホストMistralモデルと1つのホスト型推論モデルから組み立てられた音声エージェントには3つの障害ドメインがある。ルーティング層は、真ん中のものを退屈なものにする役割を果たす。

コストを並べて比較、ただし片側には価格がないという注意点付き

• Voxtral 4B TTS — Mistral の API 経由で1,000文字あたり $0.016、または、あなたのユースケースを許可する条件のもとでセルフホストする場合は GPU のコスト。おおよその規模感として、1,000文字は200語程度なので、定価では1分の音声出力は1セントの数分の1という低い水準になり、これは自分で実行することによる並行処理の利点を考慮する前の話です。

• Voxtral Mini 4B Realtime Arabic — 公開価格も、ホスト型サービスも、料金表もありません。コストはハードウェアと稼働率です。最新のアクセラレータ1基上の4.4B BF16モデルは固定の月額コストで、それをマシンが処理できるだけの音声量にわたって償却します。これは継続的な処理量では安価であり、たまにしか使わない処理量では純粋な無駄です。

おそらくより重要な比較は、代わりに手を伸ばすことになる選択肢との比較だ。聞き取り側では、アラビア語チェックポイントは、料金が公開されていて安価な時間単位のストリーミングAPIと競合している——MicrosoftのMAI-Transcribe-2-Streamingは音声1時間あたり0.54ドル(導入価格)、xAIのGrok Voice Transcribe 2.0はストリーミングで音声1時間あたり0.20ドル——つまり、アラビア語の文字起こしサービスは1分あたり0.数セントで購入できるので、オープンウェイトを選ぶ根拠は、単価ではなく、方言の正確さ、データレジデンシー、ファインチューニングに求めなければならない。発話側では、限界費用ゼロの自己ホスト型TTSモデルは、大量利用時には文字単位課金のAPIに対する確かな優位性であり、だからこそ制約要因は価格ではなくCC BY-NCライセンスなのだ。

価格ベースの乗り換えを予算に組み込もうとしている人向けの、構造上の留意点が1つあります。プロバイダーの定価を0%のマークアップでそのまま通すルーターは、ベンダーの料率変更が次の再価格設定サイクルではなく、発表当日に反映される面です。これは、話す側よりも聞く側でより重要です。なぜなら、文字起こしは音声1時間あたりで価格設定されており、それはベンダーが動かす数値だからです。

それらの間で選ぶにはどう考えればよいか

あなたはそれらの中から選んでいるのではない。問題は、ループのどちらの半分をオープンウェイト上で構築できるかであり、その答えを出すのはライセンスだ。

あなたの要件が、音声が自社インフラから一切出ない自己完結型のアラビア語音声エージェントであるなら、聴取側は無条件に利用できます。Apache 2.0、ダウンロード可能、ファインチューニング可能で、テストできる方言リストと公開されたアラビア語エラー率を備えています。制約がかかるのは発話側であり、正直な選択肢は2つあります — 音声合成を商用契約の下でホステッドサービスへ移すか、アーキテクチャから Voxtral 4B TTS を外して、アラビア語向けの寛容なライセンスの音声合成モデルを探すかです。

要件が本番向け文字起こしサービスで、言語がアラビア語であるなら、判断は、公開された方言分類と単一の集約エラー率を伴うダウンロード可能な4.4Bチェックポイントと、公開された料金、公開されたレイテンシ、サードパーティのリーダーボードを伴うホスト型ストリーミングAPIの間で下すことになる。オープンモデルは、制御、データ所在地、ファインチューニングの点で優位に立つ。ホスト型の選択肢は、エビデンス、サポート、運用の簡素さの点で優位に立つ。重みが登場してから2日後、Mistralの外部でそれらを計測した者はいまだおらず、それはチェックポイントを却下する理由ではなく、自分自身でベンチマークを実行する理由である。

この状況を最も大きく変えるのは、商用利用を許す条件でのアラビア語音声合成のリリースだ——聴取側がすでに従っているのと同じパターンである。それが存在するまで、このループは半分開いたままで、実務上の仕事は、どちらの半分を進んで借りるかを決めることにある。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

当社はこれらのMistral音声モデルのいずれもホストしておらず、本記事もそう主張しているわけではありません。ボイスループがそれらの上位で必要とするのは言語レイヤーであり、それはルーティング可能です - 200を超えるモデルにまたがる1つのAPIキーをプロバイダー定価・マークアップ0%で提供しているため、ベンダーの料金改定は発表当日に当社側で反映されます。

自動フェイルオーバーは、3コンポーネント構成の音声エージェントの中間部分 — 2つのセルフホスト型Mistralモデルの間に位置する1つの上流推論モデル — が、製品をダウンさせる部分になるのを防ぎます。