Voxtral Mini 4B Realtime Arabic と MAI-Transcribe-2-Streaming の比較用に生成されたヒーロータイトルカード。サブタイトルは「10月に登場した2つ、2つの証拠問題」、バッジは「2026年10月、両方ともベンダー報告」、3つの統計チップは、480msで8.82%のアラビア語文字誤り率 対 0.13sで2.5%の単語誤り率、16方言 対 60言語、Apache 2.0の重み 対 音声1時間あたり$0.54のAzureプレビューを表示し、右下の白い帯にOrcaRouterロゴが合成されている。
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming:10月に登場した2つ、2つの証拠問題

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この2つのリアルタイム音声モデルは7日違いで登場し、その現れ方は正反対だった。MAI-Transcribe-2-StreamingはMicrosoft AI初のストリーミング文字起こしモデルで、2026年10月1日に、ローンチ投稿、Azureプレビューの掲載、年内は導入価格として音声1時間あたり0.54ドルという価格、そしてArtificial Analysisのストリーミングボードで最終および部分文字起こしの正確性の両方で1位という主張とともに発表された。単語誤り率は2.5%で、発話終了から0.13秒後に最終テキストが準備される。Voxtral Mini 4B Realtime ArabicはMistral AIのアラビア語方言ストリーミングモデルで、2026年10月8日にHugging Faceに公開されたが、告知は一切なかった — ブログ記事も価格もサービスもなく、ただApache 2.0の重みと、7つのアラビア語ベンチマークで平均文字誤り率8.82%、480ミリ秒の遅延を報告するモデルカードだけだった。Microsoftのモデルは、検証不能な触れ込みを伴う完成品だ。Mistralのモデルは、その周囲に製品が存在しない、検証可能な成果物だ。どちらも理解に値する。それはまさに、両者とも中心的な問い — これはアラビア語をどれほどうまく扱えるのか — への答えをベンダーだけに委ねているからだ。

それでもこの比較は行う価値がある。というのも、この2つのモデルは、同じエンジニアリング上の決断を正反対の両端から捉えているからだ。Microsoftは広さとマネージドサービスを売りにしている。Azure AI Speech内で動作し、60言語を自動的かつ継続的に言語検出し、時間単位で課金され、プレビュー版だ。Mistralは深さを無償で提供している。16種類の名前付きアラビア語変種があり、単一のアクセラレータで動かせるほど小さく、正規化スクリプトが付いているので自分でスコアリングを監査できる。今月アラビア語の文字起こしパイプラインを立ち上げるなら、この2つの立場のどちらかを選ぶことになり、その選択は、どちらの場合もまだ手元にない証拠にかかっている。

各ベンダーが実際に言ったこと、そして掲示板が言っていること

エビデンスの差はこの対戦における最も重要な特徴なので、まず最初に取り上げる。

• MAI-Transcribe-2-Streaming — 発話終了から0.13秒時点での最終文字起こしの単語誤り率は2.5%、最初の部分結果でも0.12秒時点で同じ2.5%であり、どちらもArtificial AnalysisのAA-WER Streaming手法において精度第1位として示されている。マイクロソフト自身の説明によるものだ。この記事の執筆時点では、トラッカーのストリーミングボードにこのモデルの行はまだプロットされていない。そのため、この主張はトラッカーが公表した数値に裏付けられないまま、トラッカーの方法論に依拠している。

• Voxtral Mini 4B Realtime Arabic — 480ミリ秒の設定遅延において、7つのアラビア語ベンチマーク全体で平均文字誤り率8.82%。Mistral自身のモデルカードであり、評価コードも提供されている。第三者による再現はなく、このモデルは登場からまだ2日しか経っていない。

この記事の2つの主要な数値は、それぞれ、他人の物差しによるベンダーの主張と、自前の物差しが添えられたベンダーの主張である。どちらも独立した測定ではない。異なるのは、Mistralの数値にはそれを再導出するために必要な正規化スクリプトが付属しているのに対し、Microsoftの数値には、まだそれをチャートに載せていないボードが付属している点だ。調達の意思決定を行っているなら、その区別は2.5対8.82という開きよりも重要である。そもそもこの開きは無意味だ——単語誤り率と文字誤り率は換算できず、アラビア語の正書法が両者の隔たりをかなり広げるからである。

Mistralのモデルカード内で実際に意味を持つ唯一の比較は、自社のオフライン版の兄弟モデルとの比較だ。同じ7つのベンチマーク、同じ正規化でVoxtral Transcribe ArabicがCER 7.91%なので、ストリーミングにするとこのモデルは0.91パーセンテージポイントを犠牲にする。マイクロソフトは、2026年9月3日にバッチ版MAI-Transcribe-2を出荷した際、自社ファミリーについて同等の数値、すなわち単語誤り率2.0%を公表した。ストリーミング版は、リアルタイム配信を追加しつつ、バッチモデルに対して0.5ポイントを譲っている。これら2つのベンダー内部の差分を並べて見れば、この記事で唯一の同一条件比較が見えてくる。各ラボの自社ベンチマーク上で、ストリーミングSKUはバッチ版の兄弟モデルに後れを取っており、一方は約1ポイント、他方は0.5ポイント。しかも両者は異なる言語を測定している。

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

言語カバレッジ:60対16、そして双方に同じ名もなき隔たり

• MAI-Transcribe-2-Streaming — 自動連続言語検出を備えた60言語対応のため、ストリーム途中で言語が切り替わるセッションでも、言語を事前に宣言する必要はありません。Microsoftの発表資料には数は記載されていますが一覧はなく、MAI-Transcribeファミリーの対応範囲が項目ごとに記載されているのはAzureの言語サポートドキュメントであり、そこでは同ファミリーのサポート対象言語にアラビア語が含まれると記載されています。

• Voxtral Mini 4B Realtime Arabic — 16種類のアラビア語変種を個別に列挙:現代標準アラビア語、モロッコ・アラビア語、リビア・アラビア語、チュニジア・アラビア語、アルジェリア・アラビア語、ハッサニヤ・アラビア語、湾岸アラビア語、ナジュド・アラビア語、オマーン・アラビア語、サナア・アラビア語、エジプト・アラビア語、スーダン・アラビア語、メソポタミア・アラビア語、南レバント・アラビア語と北レバント・アラビア語の両方、チャド・アラビア語。このセット外では、モデルは対象外と文書化されており、汎用の Voxtral Mini 4B Realtime へのポインタが付されている。

どちらの数字も、あなたに必要なことを教えてはくれない。Microsoftの60は、アラビア語を含めてはいるもののアラビア語の性能については述べていない、対応範囲の広さを示す数だ。ローンチ記事は言語の総数に一度言及するだけで、それきりだ。Mistralの16は、7つのベンチマークセットにまたがる単一の集計エラー率を伴う学習対象の列挙であり、つまり、方言レベルの内訳——あなたのモロッコの通話音声を文字起こしできるかどうかを実際に左右するもの——も公表されていないということだ。2つのモデル、2つのベンダー、そしてどちらの場合も、「湾岸アラビア語に限って言えば、どれほどうまく機能するのか」に対する正直な答えは、明記されていない、というものだ。

その列挙が実際に与えてくれるのは、事前分布だ。チャド・アラビア語とハッサニヤ・アラビア語を明示的なターゲットに持つモデルは、北アフリカの分布に照らしてチューニングされていた。Mistralはモロッコのデジタル移行・行政改革省と共同でこれを開発し、7つのベンチマークのうち2つ——ISMAとDarija in the Wild——を、難しいケースを測定するために同省とともに構築した。汎用の60言語モデルがまず改善するのは、現代標準アラビア語である。そこに訓練信号の量が集中しているからだ。あなたの音声がダリジャまたは湾岸アラビア語なら、それらは別の問題であり、この2社のうち、そのいずれかについて数値を出したのは1社だけである。

レイテンシと遅延の形

• MAI-Transcribe-2-Streaming — 発話終了から最終的な文字起こしまで0.13秒、最初の部分結果は0.12秒。これは、部分結果と最終結果が実質的に同じレイテンシーであるほど高速です。Microsoftの主張であり、トラッカーの方法論で測定されました。

• Voxtral Mini 4B Realtime Arabic — 公開されている精度ポイントにおける設定遅延は480ミリ秒で、遅延は調整可能です。これはMicrosoftの数値の約3.5倍であり、固定された特性ではなく、運用者が選ぶパラメータです。

0.3秒は、発話の途中で応答する必要がある音声エージェントにとっては実質的な違いであり、字幕を読む人間にとってはほとんど見えない違いだ。それはまた、調整可能なダイヤルと固定された数値の違いでもある。Mistral の delay パラメータを使えば、よりタイトに運用してエラーを多く受け入れることも、より緩くして精度を取り戻すこともできる——このチェックポイントのファインチューニング元であるベースモデルは、240ミリ秒から2.4秒までの範囲を謳っている——一方、Microsoft の動作点は Azure が提供するそのままの値だ。そのため、Microsoft の数値はより推論しやすく、Mistral の数値はより調整しやすくなる。そして、2つの精度数値の比較はいずれも、実際には一方の曲線上の2つの選択された点と、もう一方の曲線上の1つの固定点との比較にすぎない。

機能の表面は同じくらい際立って異なっており、精度の議論が面白くなる前に、あなたのパイプライン要件と照らし合わせて確認する価値があります。

• MAI-Transcribe-2-Streaming — Azure AI Speech を通じて提供され、同ファミリーで文書化されている機能セットを備えています。話者分離、単語レベルのタイムスタンプ、キーワードおよびフレーズのバイアス、逐語的出力とクリーン出力のスタイル、自動言語識別などです。ストリーミング SKU 自体の話者分離とタイムスタンプに関するドキュメントは、バッチモデルのものより薄いため、同等であると想定せず、エンドポイントごとに確認してください。

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — このカードには、因果的オーディオエンコーダーを用いた文字起こし、/v1/realtime での WebSocket 経由の vLLM サービング、バージョン 5.2.0 以降でのネイティブ Transformers サポート、および正規化モジュールについて記載されています。このチェックポイントの話者分離や単語レベルのタイムスタンプについては記載されていません。

提供モデル:ダウンロード可能な重みではなくプレビューサービス

• MAI-Transcribe-2-Streaming — Azureプレビュー。つまり、SLAがなく、ベンダーは本番環境での依存を推奨していません。音声1時間あたり0.54ドルの導入価格で、2026年末まで適用され、標準料金は公開されていません。バッチ版のMAI-Transcribe-2は、同じ期間限定ベースで音声1時間あたり0.10ドルで提供開始されました。ストリーミングのコストはバッチ料金の5.4倍です。

• Voxtral Mini 4B Realtime Arabic — Apache 2.0、BF16で約44億パラメータ、ダウンロード可能、ファインチューニング可能、単一のアクセラレータでサービング可能。価格もSLAもサポートコミットメントもありません。なぜなら、その背後にサービスが存在しないからです。

その2つの文には決定が含まれている。導入価格と未公開の標準価格を伴うプレビューサービスは、失効するコミットメントである。5.4倍のストリーミング割増と2026年までの期間はどちらもMicrosoftが変更できるものであり、標準価格が確定するときに注視すべき数字はバッチ対ストリーミングの比率だ。告知なしのApache 2.0の重みは正反対である。誰にも取り戻せない成果物であり、誰も説明していないベンダー関係に結びついている。チェックポイントが保守されるかどうかは知りようがないが、今日あなたが持っているファイルはそれにかかわらず動き続ける。

業界固有の制約こそが、実際にはこうした問題を決めることが多い。規制対象の機関内でのアラビア語コールセンター導入では、音声をプレビュー版のクラウドエンドポイントに送ることすらできないかもしれない。すでに Azure AI Speech に標準化しているチームは、1つの言語ファミリーのために2つ目のオンプレミススタックを望まないかもしれない。どちらの制約も正当であり、どちらも2つの発表の見出しを飾る2.5%と8.82%という数字とは何の関係もない。

文字起こしレイヤーの上位では、同じことが両方に当てはまります。OrcaRouter はこれらの音声モデルのどちらもルーティングしていません — これは当社が提供していない 2 つのシステムの比較です — ただし、要約ツール、分類器、あるいは文字起こしを利用するエージェントはルーティング可能です。1 つの API キーで 200 を超えるモデルを、プロバイダーの定価、マークアップ 0% で利用でき、ベンダーの価格変更は当日に当社側へ反映され、プロバイダーが劣化した場合には自動フェイルオーバーが働きます。これが特にここで役立つのは、トライアル段階です。両方の文字起こし候補を 1 つの下流パイプラインに向け、1 つのキーの背後に置けば、2 つの統合を立ち上げることなく直接対決を実施できます。

これを決着させるテスト

どちらのベンダーもアラビア語に特化した性能を公表しておらず、どちらも方言音声で独立に評価されたこともない。したがって、この比較は3つの事実と1つの推奨に集約される。

事実は次のとおり。Microsoftのストリーミングモデルは0.13秒とより高速で、まだそれをプロットしていないボード上でより優れた総合精度を主張している。Mistralのモデルは、方言リストとアラビア語の誤り率、そしてそれを再導出するための正規化コードを公開しており、480ミリ秒だ。そして、一方は単語誤り率、他方は異なるコーパスでの文字誤り率であるため、この2つの精度の数値は比較できない。

提案はこうだ。この決定を下す人は、両方を自分の音声で実行すべきである。なぜなら、それがどちらのベンダーも未解決のままにしている唯一の測定項目だからだ。評価セットは実際の録音から構築する — 実際に受け取る方言の混ざり具合、実際に使うコーデック、実際に必要なドメイン語彙 — そして両方を、信頼できる参照に対してMistralの正規化で採点する。自分の録音での2時間のテストは、両方のローンチ記事を合わせたよりも多くのことを教えてくれるし、0.13秒の優位がプレビュー版への依存と5.4倍のストリーミング割増に値するのか、それとも480ミリ秒で動くダウンロード可能な4.4Bモデルがすでにその用途に十分なのかを知る唯一の方法だ。

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter はこれらの音声モデルのいずれも提供しておらず、本記事もそう示唆しているわけではありません。本記事が扱うのは、文字起こしを読み取る言語レイヤーです。1つのキーの背後に200以上のモデルを、プロバイダーの定価・マークアップ0%で利用でき、下流モデルのベンダー価格の変更は発表当日にあなたのもとへ届きます。

自動フェイルオーバーにより、2つの文字起こし候補を2つの連携ではなく1つの下流パイプラインに供給できます。これは、直接対決を実行する最も安価な方法でもあります。