記事のヒーローカードには「Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live」と表示され、サブタイトルは「オープンウェイト上の15のアラビア語方言 対 クローズドAPI上の85以上のロケール」で、2026年10月8日付の未発表リポジトリ公開としてMistralモデルを示すバッジと、3つの統計チップ(16のアラビア語変種 対 85以上のロケール;480msで8.82%の文字誤り率 対 0.40sで4.0%のストリーミング単語誤り率;Apache 2.0のオープンウェイト 対 APIのみ)がある。OrcaRouterのロゴは右下の白い帯にある。
Guides & Insights

Voxtral Mini 4B Realtime Arabic 対 Gemini 3.5 Transcribe Live:方言 対 広範性

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのストリーミング音声テキスト化モデル。文字起こしの難しい部分はどこにあるかについて、まったく異なる2つの賭けだ。Voxtral Mini 4B Realtime Arabic は、Mistral AI が2026年10月8日に、ローンチ投稿もブログ記事も会社のニュース索引の1行もなしに公開リポジトリへプッシュした44億パラメータのファインチューンで、現代標準アラビア語と15の名を挙げられた方言に特化して学習され、Apache 2.0 の下で公開され、ダウンロード可能な BF16 重みを備えている。Gem​ini 3.5 Transcribe Live は、G​ogle の Gem​ini 3.5 Transcribe のストリーミングエンドポイントで、2026年8月にプラットフォームリリースの本格的な発表一式とともに発表され、85以上のロケールをカバーし、クローズドだ——重みがなく、10分のセッション上限があるプレビュー API である。一方のモデルは単一の語族に深く踏み込み、それを自らの制限事項セクションで明言した。もう一方は広くカバーし、アクセントレベルの保証は明示しなかった。どちらを選ぶかは、どちらのベンダーのマーケティングも最優先にはしない軸、つまりあなたの音声が実際にどう聞こえるかにかかっている。

これは対称的な比較ではなく、それを埋もれさせるのではなく最初に言っておく価値がある。Mistralモデルは執筆時点で48時間しか経っておらず、ベンダーによる発表も、独立した評価も、公表された価格もない。Googleモデルは8月下旬から公開プレビュー中で、サードパーティのトラッカーで測定されている。Mistral側をモデルカードからの主張の集合として扱い、Google側を測定値の集合に主張の集合を加えたものとして扱えば、比較は誠実なままでいられる。

数字の前に、各モデルが何であるか

• Voxtral Mini 4B Realtime Arabic — Voxtral-Mini-4B-Realtime-2602からファインチューニングされたストリーミングASRモデルで、BF16で約44億パラメータ、16 kHz音声を因果的オーディオエンコーダーと言語デコーダーを通して処理します。音声が到着するにつれてテキストを出力し、文字起こし遅延は設定可能です。Apache 2.0で、Hugging Face上に重みが公開されています。Mistralは、2026年1月に署名されたパートナーシップの下、モロッコのMinistère de la Transition Numérique et de la Réforme Administrativeと共同でこれを開発し、このモデルを主権AI資産と説明しています。

• Gemini 3.5 Transcribe Live — 2モデル同時リリースのうち、ストリーミングを担う一方です。Live APIエンドポイントは、WebSocket経由でマイクの連続音声を送信し、話者がまだ話している間に部分的な文字起こしを返し、各発話が終わってまもなく最終的な文字起こしに確定します。バッチ処理の相方である gemini-3.5-transcribe は、最大1時間の録音済みファイルを処理します。どちらもパブリックプレビューで、どちらもAPI専用であり、どちらも重みは公開されていません。

最初の構造上の違いは精度ではない。一方は今夜ダウンロードできるファイルであり、もう一方は、利用するために承認を受けなければならないサービスだという点だ。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

言語カバレッジ:16 対 85 以上、そしてその差が本題ではない

言語の数を数えると、Mistralモデルは狭く、Googleモデルは膨大に見える。両者の数は別々のものを測っており、その但し書きなしに並べて読むことが、この比較が招く最も一般的な誤りだ。

• Voxtral Mini 4B Realtime Arabic — 16種類のアラビア語変種。モデルカードには方言ファミリーごとに個別に記載されています。現代標準アラビア語に加え、マグリブ地域のモロッコ、リビア、チュニジア、アルジェリア、ハッサニアのアラビア語。湾岸地域の湾岸、ナジュド、オマーン、サナーアのアラビア語。ナイル渓谷のエジプト、スーダンのアラビア語。メソポタミア、南レバントおよび北レバントの両方。そしてチャドのアラビア語です。カード自体の位置づけによれば、このモデルはアラビア語の文字起こしを対象としており、コードスイッチング——話者が会話の途中で言語を切り替えること——は副作用ではなく、正確に扱えるよう作られた能力です。

• Gemini 3.5 Transcribe Live — 85以上のロケールにわたる自動言語検出。文内および文をまたぐコードスイッチングに対応。Googleのドキュメントでは、そのセットにアラビア語が含まれている。ロケール表ではアラビア語の項目としてアラビア語(エジプト)が記載されており、より広範なアラビア語ロケールの対応範囲は、モデル自身のドキュメントでは個別に記載されていない。

それを正直に読めば、このトレードオフの構図が見えてくる。Googleの85以上は広さの主張だ。音声がアラビア語以外の言語であれば、Googleエンドポイントは対応し、Mistralモデルは拒否する——カードには、他の言語については、このチェックポイントではなく、オリジナルのVoxtral Mini 4B Realtimeを使うべきだと明言されている。Mistralの16は深さの主張だ。アラビア語を文字起こしすると主張しているのではない。モロッコ・ダリジャ、湾岸アラビア語、エジプト・アラビア語、チャド・アラビア語を別個の対象として文字起こしすると主張しているのであり、これは現代標準アラビア語を文字起こしして、そこから方言が自然に出てくることを期待するよりも、実質的にはるかに難しい問題だ。英語に重みを置いた、広さ優先のベンチマークでは、その違いを決して示すことはできない。なぜなら、方言のセットはそこに含まれていないからだ。

モロッコのコールセンターや湾岸地域のカスタマーサポート窓口にとって、16の方言だけを扱うモデルが、方言ごとの精度を明示していない85のロケールを扱うモデルを凌ぐことがある。5言語で会議を文字起こしする欧州企業にとっては、その方程式は瞬時に逆転する。どちらのベンダーも間違ってはいない。選んだ顧客が違うだけだ。

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

比較できる数字と、比較できない数字

ここで非対称性が効いてくる。二つのモデルは、異なるコーパス上で、それぞれ異なる根拠に基づいて、異なる単位を報告しており、両者を直接突き合わせた第三者も存在しない。

• Voxtral Mini 4B Realtime Arabic — 設定された文字起こし遅延480ミリ秒において、7つのアラビア語ベンチマーク全体で平均文字誤り率8.82%。Mistral自身のモデルカードによるもので、独立して再現されたものではない。

• それが追いかけているモデル — 同じ7つのベンチマークで同じ測定方法による Voxtral Transcribe Arabic の CER 7.91%。つまり、このリアルタイムモデルは、同じベンダーのオフラインアラビア語モデルに0.91パーセンテージポイント後れを取っています。この差は Mistral 自身の比較によるものなので、異例なほど示唆に富んでいます。ベンダーは、この言語ファミリーにおいてストリーミングが精度にどれほどの犠牲を強いるかを伝えているのです。

• Gemini 3.5 Transcribe Live — ストリーミング時の単語誤り率は4.0%。Artificial Analysisが測定し、Googleが引用。最終的な文字起こしは発話終了から0.40秒後に到着します。また、同じトラッカーの非ストリーミングボードでは2.6%、Google自身の報告によるFLEURSでのストリーミングでは5.50%という測定値もあります。

8.82% CER を 4.0% WER の隣に並べて、何かを結論づけてはいけない。文字誤り率と単語誤り率は分母が異なり——アラビア語の正書法では、ラテン文字を使う言語よりも両者の隔たりが大きくなる——うえに、コーパスも同じではなく、正規化も同じではなく、一方の数値には再現可能なスクリプトが付いているが、もう一方は、英語のエージェント発話に重みづけされたトラッカーの固定ミックスから来ている。

より有用な比較は、Mistral自身のモデルカード内にある比較だ。同一のベンチマーク、同一の正規化における、ストリーミングの8.82%対オフラインの7.91%。これは、低遅延が特にアラビア語で何をもたらし、何を犠牲にするかを明確に測ったものであり、ベンダー間のどんなパーセンテージ比較よりも価値がある。誰も公表していないのは、同じ音声でGoogleとMistralのモデルを同一条件でアラビア語実行した比較だ。誰かがそれを公表するまで、「アラビア語ではどちらがより正確か」は未解決の問いであり、唯一擁護できる答えは、自分の録音で両方を試すことだ。

Mistralのモデルカードには、一言触れておく価値のある細かい点がある。それはベンダー自身の利益に反するからだ。そこでは、Geminiの安全フィルターが一部のFLEURS音声サンプルの文字起こしをブロックすると指摘されている。これは競合のパイプラインについての、現実的で検証可能な観察であり、同時に、リーダーボードには決して現れない類のものでもある——サンプルの文字起こしを拒否するモデルは失敗として、あるいは欠測としてスコア付けされるが、どちらの解釈も公平ではない。もしあなたの音声にコンテンツフィルターが引っかかりかねない素材が含まれているなら、それはWERの数値では浮かび上がらないデプロイリスクだ。

レイテンシー:固定値に対する調整つまみ

ストリーミングモデルは通常、単一のレイテンシ値で比較される。この2つには共通する値がない。

• Voxtral Mini 4B Realtime Arabic — 設定可能な文字起こし遅延。8.82%というCER値は480ミリ秒時点のものとして引用されており、遅延は調整可能です。したがって、この精度の数値はモデルに固有の特性ではなく、運用者が選ぶ曲線上の1点です。そのベースモデルは240ミリ秒から最大2.4秒までの範囲をうたっています。

• Gemini 3.5 Transcribe Live — 発話終了から最終文字起こしまで0.40秒(Artificial Analysisによる測定)。発話中は部分的な文字起こしが継続的に届く。Googleは別途、Chirp 3と比べて最終文字起こしまでの時間が70%改善したと主張しているが、これはベンダーによる数値であり、再現されていない。

どちらも同じあたり——およそ0.5秒——に収まるが、エンジニアリング上の意味は異なる。Mistralモデルはレイテンシと精度のトレードオフをパラメータとしてあなたに委ねるので、最後の数ポイントの精度よりも1秒未満の字幕が重要なときは240 msで動かし、そうでないときは遅延を伸ばせる。Googleエンドポイントは、Google独自のコンテンツフィルターの挙動が付随した固定の動作点を提示する。音声エージェントにとっては、わずかに優れた固定値よりも調整つまみのほうが価値がある。適切な設定はあなたの音声とユーザー次第であり、どちらのベンダーもあなたに代わってそれを選べないからだ。

本当の分水嶺:オープンウェイト 対 プレビューエンドポイント

ライセンスと配布形態の違いは、この比較におけるどのベンチマークの差よりも大きく、精度が議論される前にほとんどの実際の導入を決定づける。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0、Hugging Face 上の BF16 重み、vLLM で /v1/realtime の WebSocket 経由で提供可能、Transformers バージョン 5.2.0 以降でネイティブにサポートされています。モデルカードには Python の例と正規化モジュールが同梱されているので、アラビア語 CER の計算を自分で再現できます。パイプラインのどこにも Mistral のサーバーは必要なく、モデルは十分小さいため、運用上の問題は「どの GPU を使うか」であり、「GPU を購入できる余裕があるか」ではありません。

• Gemini 3.5 Transcribe Live — APIのみ、パブリックプレビュー、リスト料金を超える公開価格の確約はなく、10分のセッション上限があるため、それより長いものは自前のコードでチャンク化し、再接続し、つなぎ合わせる必要があります。ローンチと併せて報告された3つの制約は、特にアラビア語の展開にとって重要です。ストリーミングエンドポイントは話者ダイアライゼーションと単語レベルのタイムスタンプを返しません。どちらもバッチエンドポイントには存在しますが、このエンドポイントにはありません。アラビア語の文字起こしで誰が何を言ったかを知る必要がある場合、または音声に時間整合させる必要がある場合、Liveエンドポイントは言語に関係なくそれを生成できません。

これら二つの制約は、実際のアラビア語展開において小規模なオープンモデルを支持する最も強力な論拠であり、精度とは何の関係もない。コールセンターのパイプラインは話者帰属を求め、コンプライアンスのパイプラインはタイムスタンプを求める。そして、自分で管理する正規化スクリプトを備えたオフラインのアラビア語モデルは、エンドポイントの契約と議論することなく、その両方を提供する。Mistralのモデルカードも、それを特徴ではなく制限として挙げている — 文字起こしを対象としており、汎用リアルタイムモデルのファインチューニングであり、必要なら上流にもっと広範なモデルが存在することを正直に認めている。

それぞれにかかる費用と、不明な点

• Gemini 3.5 Transcribe Live — 音声1分あたり約$0.009(ブレンド)、$3.50/100万入力トークンと$21/100万出力トークンの定価から算出。音声は毎秒25トークン、文字起こしは毎分約175トークンとして評価。バッチエンドポイントは1分あたり約$0.005。どちらの数値もGoogleが想定するトークン化に基づく推定値であり、会計方法が変われば変動する。現在は無料枠あり。

• Voxtral Mini 4B Realtime Arabic — 公開価格はありません。公開されたサービスが存在しないからです。コストは、あなたのハードウェアにかかる費用そのものです。44億パラメータのBF16モデルは単一の最新アクセラレータに収まるため、音声1時間あたりの限界費用は電気代と稼働率であり、固定費はマシン本体です。これは、大量利用時にはどの分単位課金APIよりも安く、利用量ゼロではどの分単位課金APIよりも高くつきます。これがオープンウェイト取引のありふれた形です。

Mistral側で最も重要な未知数は価格ではない。このリポジトリが製品ラインの始まりなのか、モロッコ提携に対する単発の成果物なのか、ということだ。発表も価格設定もサービスもなしにひっそりと出荷されるモデルは、背後にサポートコミットメントがないモデルである。Apache 2.0は、すでに手元にある重みについてライセンスを取り消せないことを意味するが、チェックポイントが維持されるかどうかについては何も語らない。そしてカード自体のベースモデルへのポインタは、汎用リアルタイムモデルが依然としてサポート対象のラインであることを示唆している。

文字起こしの上の層では、ルーティング層は文字起こしとは何の関係もない形でその価値を発揮します。これらのモデルはいずれも、当社がホストする音声テキスト化サービスではありません — OrcaRouter はどちらのエンドポイントもルーティングしません — しかし、ストリームを消費する要約ツール、意図分類器、あるいはエージェントは、ルーティングできるモデルです。1 つの API キーで 200 以上のモデルをプロバイダーの定価、マークアップ 0% で利用でき、ベンダーの値下げは当日にこちら側へ反映され、プロバイダーが劣化した場合の自動フェイルオーバーも利用できます。方言カバレッジのために 2 つの音声ベンダーをすでにつなぎ合わせているなら、下流の言語モデルを 2 つの契約ではなく 1 つのキーの背後に置くことは、統合の中でもコストの低い半分です。

どれを基に構築するか

音声がアラビア語の場合——一方言であれ、複数方言であれ、あるいはアラビア語と別の言語の間でコードスイッチングしていても——Mistralモデルのほうがより本格的な候補であり、その理由は数値的というより構造的だ。それは対応対象として作られた方言を明示しており、自分のハードウェアで動かせるほど小さく、独自の正規化で後処理できる生テキストを返し、10分のセッション上限や、検査できないコンテンツフィルターの背後に置かれていない。代償は、一つの語族しか扱わずそれ以外を拒むこと、そしてまだ誰もそれに関する独立した評価を公表していないことだ。

音声が複数言語にまたがる場合、あるいはサポート経路と公開された料金表を備えたサービスが今日必要な場合、Gemini 3.5 Transcribe Live は今すぐ呼び出し可能で、第三者トラッカーで計測されており、Mistral チェックポイントが拒否する言語をカバーします。コストは、セッション上限、ストリーミングエンドポイントでのダイアライゼーションとタイムスタンプの欠如、そしてアラビア語固有の精度が自分で検証しなければならない主張であるという点です — ロケール一覧にはエジプトが挙がっており、方言の性能は項目別に示されていません。

注目すべきはベンチマークではない。問題は、Mistralがこのモデルをそもそも発表するかどうか、そして発表するなら、どのような価格と言語ロードマップで出すかだ。Apache 2.0ライセンス付きのひっそりとしたリポジトリは、有用な成果物ではあるが、弱いコミットメントにすぎない。もしアラビア語方言のロードマップが続くなら——レバント方言、湾岸方言、エジプト方言を別々のチェックポイントとして——小型モデル路線はこの地域にとって真に完全な答えになり、広範性の議論ははるかに立てにくくなる。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

これらのいずれも当社がホストする音声モデルではありませんが、トランスクリプトの上位層はルーティング可能です — 1つのAPIキーの背後に200以上のモデルをプロバイダー定価・マークアップ0%で利用できるため、トランスクリプトの下流にある推論モデルについてベンダーが値下げを行えば、その当日に反映されます。

自動フェイルオーバーとは、つなぎ合わせた音声パイプラインにおいて障害ドメインが1つ減ることを意味します。なぜなら、トランスクリプトを消費する要約器や意図分類器は、プロバイダーと一緒にダウンするのではなく、ルートを変更できるからです。