
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0:リーダーボード首位が方言スペシャリストと出会う
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
この比較の正直な出発点は、Voxtral Mini 4B Realtime Arabic と Grok Voice Transcribe 2.0 が同じ仕事を争っているわけではないということであり、それを最も手早く見て取る方法は、各ベンダーが何を公表しようとしたかを見ることだ。Mistral AI は、2026年10月8日に Voxtral Mini 4B Realtime Arabic を、何の告知もなく Hugging Face に公開した — Apache 2.0 の重み、16種類のアラビア語変種を挙げたモデルカード、そして480ミリ秒の遅延で7つのアラビア語ベンチマークにわたる平均文字誤り率8.82%という単一の精度数値。xAI の Grok Voice Transcribe 2.0 は、2026年9月18日に、ローンチ投稿、価格、そしてサードパーティのリーダーボード結果とともにリリースされた:最終トランスクリプトにおける単語誤り率2.7%、話者が止まってから0.49秒後にテキストが確定し、登場時点で Artificial Analysis のストリーミング音声認識ボードで1位だった。一方のモデルは、どの方言を扱うかを正確に示し、それ以外を推測することを拒む。もう一方は、38以上の言語をカバーすると述べながら、そのうちの一つも個別に挙げていない。
その非対称性こそが比較のすべてだ。多言語が混在する音声向けに文字起こし処理能力を大量に購入するのであれば、xAIモデルは大差でより完成度の高い製品だ。音声がアラビア語の場合――しかも放送用の現代標準アラビア語ではなく、方言アラビア語である場合――Mistralのチェックポイントは、xAIモデルが首位に立つリーダーボードが測定していない問題を狙っている。そして、それがそのボードで1位ではなく2位であるという事実を、判定と受け取るのは誤りだろう。
価格の計算は、ここでは異例なほど明確だからだ
xAIは料金を公開している。Mistralはダウンロードを公開している。その違いが後続のすべてを左右するので、存在する数値から始めよう。
• Grok Voice Transcribe 2.0 — 録音済みファイル向けにはREST経由で音声1時間あたり$0.10、ストリーミングWebSocket経由では音声1時間あたり$0.20です。これはバッチの場合で1,000分あたり約$1.67、ストリーミングで1,000分あたり約$3.33に相当し、Grok Voice Transcribe 1.0と同じ価格設定で変更はありません。
• Voxtral Mini 4B Realtime Arabic — 公開価格はありません。公開されているサービスが存在しないためです。重みは Apache 2.0 で、BF16 ではおよそ 44 億パラメータです。つまり、コストはそれに接続する GPU と、そこから得られる稼働率によって決まります。継続的に利用量がある場合は安価ですが、利用量がゼロの場合は、この記事の中で最も高価な選択肢になります。アイドル状態のハードウェアにお金を払うことになるからです。
損益分岐点は決して微妙な話ではない。1時間0.20ドルのストリーミング料金は、1分あたり約0.33セントにすぎない。4.4Bモデルを動かすアクセラレータはどれも、持続的なトラフィックを流し続けない限り、それ以上のコストが1時間あたりかかる。つまり、オープンウェイトの道がコストで勝るのは、1台のマシンを稼働させ続けられるだけのアラビア語のボリュームを確保できてからであり、そこに至るまでは他のあらゆる軸で負ける。APIには設備投資も容量計画も運用負担もないからだ。

唯一、早い段階で計算が覆るのはコンプライアンスです。Mistralチェックポイントは、お客様が管理するハードウェア上で音声を処理するため、何もお客様のネットワークから出ていきません。また、このカードには正規化モジュールが同梱されているため、アラビア語スコアリングパイプラインはお客様自身が監査できます。Grok Voice Transcribe 2.0はxAIのリージョン内で動作し、そのドキュメントによれば、音声をリアルタイムで処理しますが、保持もトレーニングへの利用も行いません。SOC 2 Type IIとHIPAA適格性に裏付けられています。どちらの主張も防御可能ですが、規制当局がコードパスを検査できるのは、そのうち一方だけです。
時給0.20ドルで実際に買えるもの、そしてMistralモデルは出荷されない
ここでの機能面の差は精度の差よりも大きく、しかもはるかに議論されていない。Grok Voice Transcribe 2.0 はインターフェースを備えた製品であり、Voxtral Mini 4B Realtime Arabic はテキストを出力するチェックポイントにすぎない。
• 話者ダイアリゼーション — Grok Voice Transcribe 2.0 に搭載。さらに最大8つの独立したチャンネルのマルチチャンネル文字起こしにも対応。Mistralのカードにはダイアリゼーション機能の記載はなく、このモデルが生成するのは文字起こしであり、話者帰属されたものではない。
• 単語レベルのタイムスタンプ — Grok はそれらを信頼度スコア付きで保持するため、文字起こし全体を一律に信頼するのではなく、低信頼度のスパンをしきい値で処理できます。Mistral のカードは、このチェックポイントについてタイムスタンプをうたっていません。
• キーターム・バイアシング — Grokエンドポイントでは1リクエストあたり最大100件のドメイン用語を指定でき、これによりファインチューニングなしで、モデルが製品名、アカウントコード、地名を正しく扱えるようにできます。同じ結果に至るMistralの方法は自社データでのファインチューニングで、これはApache 2.0では許可されていますが、ホスト型エンドポイントでは許可されていません。
• 逆テキスト正規化 — Grokは、数値、日付、通貨、電話番号、メールアドレスを25言語にわたって書き言葉の形式に整形します。Mistralのカードには正規化スクリプトが含まれていますが、その明記された目的はアラビア語ベンチマークの採点であり、表示用に出力を整形することではありません。
• インターフェース仕様 — 最大500 MBのファイル向けREST、wss://api.x.ai/v1/stt でのWebSocketストリーミング(中間結果はおよそ500 msごと)、ドキュメントに記載された毎秒10リクエストと100同時ストリーミングセッション、現時点では単一リージョン。Mistral側では、/v1/realtime でWebSocketを使用するvLLMサービング、またはバージョン5.2.0以降のネイティブTransformersがあり、お使いのハードウェア以外にレート制限はありません。
話者分離とタイムスタンプが必要なら、精度の話が俎上に載る前にこの比較は終わっている。これはMistralモデルをけなすものではない——正確な方言テキストを出力するよう訓練された4Bのアラビア語特化モデルは、汎用の文字起こしサービスとは異なるエンジニアリング目標だ——が、これはつまり、両者が互換可能になるのは、あなたのパイプラインが文字起こしを自前の後処理のための原材料として扱う場合に限られる、ということでもある。
言語リストの問題
両ベンダーは、正反対の方向からではあるものの、同じ疑問を未解決のままにする形で言語サポートを説明している。
• Grok Voice Transcribe 2.0 — 38以上の言語に対応し、自動言語検出と、単一パスでの録音中の言語切り替えを実現。8 kHzから48 kHzまでの12種類の音声フォーマットをカバーします。ドキュメントには数は記載されていますが、一覧はありません。資料のどこにもアラビア語が個別に記載されていないため、アラビア語対応はその数から示唆されているだけで、ベンダーによって確認されたものではありません。
• Voxtral Mini 4B Realtime Arabic — アラビア語の16変種を明示的に挙げています。現代標準アラビア語;マグリブ地方のモロッコ、リビア、チュニジア、アルジェリア、ハッサニヤ;湾岸地方の湾岸、ナジュド、オマーン、サヌア;ナイル渓谷のエジプト、スーダン;メソポタミア、南レバントと北レバントの両方;そしてチャド・アラビア語です。この集合に含まれないものはすべて対象外であり、カードには代わりに汎用リアルタイムモデルを使うよう記載されています。
「これらのうちどちらがアラビア語をより上手く扱うのか」という問いには、奇妙な構造がある。Mistralモデルは、アラビア語のエラー率が公表されている、文書化されたアラビア語専門家であり、独立した検証はない。xAIモデルは、文書化されたリーダーボード首位であり、そのベンダーはアラビア語が対象範囲に含まれることさえ確認していない。アラビア語を含む38言語の数と、アラビア語だけを含む16方言のリストは、どちらも「アラビア語を扱えるか」という問いに答えている——しかし、そのうち片方だけが「ダリジャを扱えるか」という問いに答えている。

リーダーボードはここでは役に立たない。Artificial Analysis の音声テキスト化評価は、英語のエージェント会話に重みを置いた固定の混合であり、一般的な文字起こしを順位付けするには正しい設計だが、アラビア語方言での勝利を浮き彫りにするには正しくない。モデルが湾岸アラビア語やモロッコ・アラビア語で本当に優れていても、そのボードでは単に良好なだけに見える可能性がある。これはボードへの批判ではない。地域展開における唯一の入力として使うべきでない理由である。
換算されない単位での精度
• Grok Voice Transcribe 2.0 — 最終文字起こしの単語誤り率は2.7%、最終結果までの時間は0.49秒、最初の部分結果では3.4%。いずれもArtificial AnalysisのAA-WER v2インデックスで測定されたもので、このインデックスは非公開のエージェント会話セットをVoxPopuliおよびEarnings22と組み合わせている。注目すべきは最初の部分結果の数値だ。Grok Voice Transcribe 1.0では18.3%だったのが低下したのである。これは、ルーティングに使える部分文字起こしと、表示しかできない部分文字起こしの違いを意味する。
• Voxtral Mini 4B Realtime Arabic — 480ミリ秒の遅延で、7つのアラビア語ベンチマーク全体における平均文字誤り率8.82%。ベンダー自身の評価によるもので、それとともに提供された正規化スクリプトを使用しています。Mistralは、これが同じラボのオフラインアラビア語モデルであるVoxtral Transcribe ArabicのCER 7.91%に対して0.91パーセントポイント以内に収まると報告しています。ベンチマーク、正規化、測定が双方で同一であるため、この比較はベンダー間の比較よりも価値があります。
2.7% と 8.82% を並べることは比較ではなく、カテゴリーの誤りである。単語誤り率は参照に対して誤った単語を数え、文字誤り率は誤った文字を数える。そしてアラビア語の正書法——同じ単語が複数の正当な綴りを許容し、接語が自由に付着する——は、両指標の隔たりをラテン文字言語が示すものをはるかに超えて広げる。コーパスは異なり、正規化も異なり、しかもそのうち一方の数値だけが第三者によるものだ。この二つの数字が正当に語れるのは、xAI のモデルが測定済みでランク付けされた汎用文字起こしモデルであり、Mistral のモデルが主張されたアラビア語特化モデルであるということだ。どちらがあなたの音声をよりよく文字起こしするかは、この二つからは分からない。
本当に効く比較は、Mistral自身のモデルカードの中にある。ストリーミング8.82%対オフライン7.91%、同じ7つのベンチマーク、同じ正規化、同じラボ。ストリーミングはバッチモデルと比べてアラビア語で約1ポイントの精度を犠牲にする。それが良いトレードオフかどうかはあなたの判断だが、今やそれは情報に基づいた判断だ。
小型モデルが優位に立つ場面、そしてそれはスコアボードの上ではない
Mistralチェックポイントに関する3つのことは、数字が示唆する以上に価値があり、そのどれもどのリーダーボードにも現れない。
第一は、方言の分類体系そのものです。ハッサニア語やチャド・アラビア語を含む16の変種を、それぞれ別個の訓練ターゲットとして命名することは、モデルの誤差がどこで測定されたかについての表明です。アラビア語を38言語の1つとして含む汎用多言語モデルは、まず現代標準アラビア語を改善します。そこに訓練シグナルとベンチマークの重みの大半があるからです。北アフリカの省庁とともにモロッコ・パートナーシップ向けに構築されたモデルは、別の分布に最適化されており、まさにそれを測定するために特別に作られた2つのベンチマーク——ISMA と Darija in the Wild——とともに共同開発されました。
2つ目は設定可能な遅延です。8.82%という数値は480ミリ秒時点のもので、遅延は固定ではなく調整可能であり、それによって精度の数値はオペレーターが選ぶ曲線上の一点になります。ライブ字幕の作業なら、遅延を短縮してより多くのエラーを受け入れることができます。通話録音のパイプラインなら、遅延を長くして精度を取り戻せます。Grok Voice Transcribe 2.0は固定された動作点を提示しており、ベンダー自身のアップグレード経路が、それがなぜ結果を伴うかを示しています — 1.0から2.0への移行で、初回部分結果と最終結果の両方のレイテンシに約0.3秒のコストがかかり、あなたに可能な修正は古いモデルに固定することであり、ダイヤルを調整することではありません。
第三点は、Apache 2.0 の許諾が、あなたが保有する重みに対して無条件であることです。上流のチェックポイントに何が起きようと——それが告知され、価格が付けられ、非推奨になり、あるいは二度と言及されなくなろうと——成果物はダウンロード可能で、ファインチューニング可能で、自社製品内で出荷可能なままです。ホスト型エンドポイントの料金表とモデル廃止スケジュールは、どちらもベンダーが変更できるものであり、xAI はすでに Grok Voice Transcribe 2.0 をデフォルトにし、1.0 を非推奨にする意向を示しています。これにより、モデルパラメータを一度も渡していないすべての統合が、一斉に新しいレイテンシプロファイルへ移行することになります。
文字起こしの上のルーティング層について、実用的な補足をひとつ。どちらのモデルも当社がホストする音声テキスト化ではなく、この記事もそう主張しているわけではない。OrcaRouter が担うのは、そのストリームを消費する言語モデル層だ — 要約器、分類器、エージェント — を、ひとつの API キーの背後で、200 を超えるモデルにわたり、プロバイダー定価で 0% のマークアップで提供する。だからベンダーの価格変更は同日にここへ反映される。言語カバレッジのために 2 つの音声ベンダーを運用しているチームは、すでに 2 つの契約と 2 つの認証経路を抱えている。下流の半分を 1 つのキーに集約するのが、安上がりな勝ち筋だ。
これをどうすればいいですか
音声が多言語である場合、話者分離、タイムスタンプ、キータームバイアスをすぐに使いたい場合、または公開された料金とサポート窓口を今日から利用できるサービスを求めるなら、Grok Voice Transcribe 2.0 を基盤にしてください。それはより完全な製品であり、第三者によって測定されており、音声1時間あたり$0.20というストリーミング料金は、本格的なボリュームを処理するまではオープンウェイトのコスト論が通用しないほど低いのです。
音声がアラビア語、とくに方言であり、コンプライアンス上の理由でモデルを自社ネットワーク内に置く必要がある場合、またはファインチューニングを予定しているなら、Voxtral Mini 4B Realtime Arabic を基盤にしよう —— これらのうち、それを可能にするのは一つだけだから。まず三つのことを受け入れよう:話者分離なし、タイムスタンプなし、そして誰によっても公開された独立評価なし。重みが現れてから二日後、最後のものは危険信号ではない。単に証拠が現時点でそこにあるだけだ。
この比較を最も早く変えるのは、実際の方言音声に対するアラビア語特化の評価を、両ベンダーの外部で、両システムに同じ正規化を適用して実施することだ。それが実現するまでは、判断は、一方のベンダーが自社で挙げる方言リストと、もう一方のベンダーが明言していないリストを突き合わせることに依存せざるを得ず、唯一信頼できる検証はあなたの録音である。

どちらのエンドポイントも当社が提供しているものではありません — これは当社のカタログ外にある2つのシステムの比較です — ただし、文字起こしを処理するモデルはルーティング可能です:1つのAPIキーで200以上ものモデルをプロバイダーの定価、マークアップ0%で利用できるため、要約モデルや分類モデルの料金が変更されれば、発表されたその日に反映されます。
自動フェイルオーバーとは、2ベンダーの音声構成が、それに依存する言語レイヤーへ2つの単一障害点を持ち込まないようにする仕組みです。
