生成されたヒーロータイトルカード。見出しは「StepAudio 3 ASR vs Whisper Large v3 Turbo」、サブタイトルは「1.7パーセント対4.6パーセント、そして直接対決のテストは存在しない」、その下のフッターは「StepAudioはArtificial Analysisによる;WhisperはHugging Faceによる」。
Guides & Insights

StepAudio 3 ASR 対 Whisper Large v3 Turbo:1.7% 対 4.6%、そして誰もそのテストを実施していない

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

あなたが求めている比較は存在しません。 StepAudio 3 ASRWhisper Large v3 Turboは、非ストリーミングの音声テキスト変換において同じ Artificial Analysis AA-WER インデックス上に位置しています — 単語誤り率 1.7% に対し、もう一方は 4~5.5% の範囲の数値 — そして 2026年9月下旬時点で、同一の音声を用いた直接比較を公開した者は誰もいません。StepFun も、Whisper のメンテナーも、独立系のラボも。StepFun 自身のドキュメントは Doubao ASR 2.0、Seed 2.0 Lite、HY3.0 ASR Preview を相手にベンチマークを行っており、これらはいずれも中国語の ASR 製品です。Whisper 側には、比較を公開しているベンダーがまったくありません。なぜなら Whisper Large v3 Turbo は何年も前からダウンロード可能であり、その数値は誰がそれを提供しているかによって変わるからです。

では、このページは正直な版を提示する。両方を測定している唯一のボードを読み取り、比較できるものとできないものを切り分け、証拠が尽きる地点を率直に述べる。手短に言えば、精度における差は実在し、その幅はおよそ3ポイントであり、それ以外のすべて——価格、ライセンス、導入可能性——における差は逆方向に開いており、しかもより大きい。

それぞれが実際に何なのか

StepAudio 3 ASRは、2026年9月15日にStepFunが5モデル構成のStepAudio 3オーディオファミリーの一員としてリリースしたホスト型文字起こしモデルである。デコード中に逐次テキストを返し、最後に最終的な文字起こし結果を返す単一のストリーミングエンドポイントを通じて利用する。StepFunはこれを、文脈把握のために言語モデルを組み込んだ文字起こしであり、医療、法律、金融、自動車、プログラミングの音声や、従来の認識器では対応できない入力——ささやき声、速い話し方、連続発話、歌唱、背後に音楽が流れる音声——に合わせて調整されていると説明している。公開ウェイトはなく、オンプレミスでの導入経路も、どのティアでもセルフホスティングの選択肢も存在しない。公表されているリスト料金は1時間あたり2.8元で、リーダーボード独自の価格軸では1,000分あたり約6.67ドルに相当する。

Whisper Large v3 Turboは、OpenAIがMITライセンスの下で公開したオープンウェイトモデルです。8億900万のパラメータ、99言語に対応し、Whisper large-v3を枝刈りしてファインチューニングした派生モデルで、デコーダ層が削減されています。何百万回もダウンロードされており、多数のプラットフォームで商用提供され、自分のハードウェアでも実行できます。この最後の特性こそが比較のすべてであり、精度差だけが重要な数字ではない理由でもあります。

両方を測定する唯一のボード

Artificial AnalysisのAA-WER指数は、誤って文字起こしされた単語の割合を報告しており、値が低いほど優れています。そのバージョン2は3つのデータセットを組み合わせており、AA-AgentTalkが50%、VoxPopuli-Cleaned-AAが25%、Earnings22-Cleaned-AAが25%を占めます。非ストリーミング表示では、追跡している71モデルのうち36モデルが表示されます。両モデルはそこに登場しており、これはほとんどの比較では言えないことです。

ボードに記載されているとおりに読み上げてください:

• StepAudio 3 ASR — 1.7% AA-WER、音声1,000分あたり約6.67ドル

• Whisper Large v3 Turbo、ホスト型エンドポイント1つ — AA-WER 4.6%、1,000分あたり約$0.67

• Whisper Large v3 Turbo、2つ目のホスト型エンドポイント — AA-WER 5.5%、1,000分あたり約15.00ドル

• Whisper Large v3、別のオープンウェイト世代 — あるエンドポイントでは4.1%、別のエンドポイントでは10.1%

• StepAudio 2.5 ASR、StepFunの前世代 — 4.7%

ボード上で最も示唆に富むのは最後の2行であり、それらはStepFunについてまったく述べていない。同じオープンWhisperの重みが、あるエンドポイントでは4.1%、別のエンドポイントでは10.1%を記録する。これは同一のパラメータにおける6ポイント差であり、完全にサービングの違いによって生じている。すなわち、チャンク化戦略、ハードウェア、デコーディング設定、そして各ホストが内部制限を超える音声をどう扱うかである。ボード自身の脚注も同じことを述べており、そのデータセットの1つでは、時間制限のため、一部のモデルは音声が約9分にチャンク化され、別のモデルは約30秒にチャンク化されると指摘している。

つまり、「StepAudio 3 ASR vs Whisper Large v3 Turbo」という比較は、実質的に2つの比較が重なったものだ。モデル対重みと、モデル対たまたまベンチマークした方のエンドポイント。2つ目の方が1つ目よりも大きく変動する。

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

精度ギャップはどこから生じるのか、そしてそれをどこまで信頼すべきか

単語誤り率3ポイントは、上位5システムが互いに0.6ポイント以内に収まっている分野においては大きな開きである。さらにこれは、この比較の中で第三者が測定した唯一の数値であり、どちらにも働きうる現実的な留保条件が付いている。

StepAudio 3 ASR に対する反論: この数値は混合指標であり、その混合の 50% は AA-AgentTalk——エージェント会話データセットである。文脈用に LLM を組み合わせた、ドメイン固有の文字起こしに調整されたモデルは、そのような形の音声に適している。指標の重みを朗読音声や放送ニュースに寄せれば、順位はより拮抗する可能性がある。さらに、この ASR モデルについて公表された技術報告書はなく、公開されたテストセットも、デコーディング設定も、StepFun 外部の誰かによる再現可能なプロトコルも存在しない。

Whisper Large v3 Turbo と比較して:4.6% はあるホステッドエンドポイントの数値であり、モデルの性質ではない。重みは固定され公開されているが、スコアはそうではない。同じ重みを慎重に実行するチームは、ドメインに適したチャンキングと優れたデコーダ設定を用いれば、リーダーボードの行より有意に良い結果を出せる — そして、不注意に実行するチームは、もう一方のオープンウェイト世代が記録した 10.1% より悪い結果になることもある。正直なまとめとしては、この比較のオープンウェイト側には、測定できる下限と、勝ち取らなければならない上限がある。

欠けているのは、決着をつける数字だ。すなわち、両システム、同一の音声セット、同一の復号プロトコルで、公表された数字である。誰もそれを実施しておらず、誰かが実施するまでは、「1.7% 対 4.6%」は、異なる条件下で取られた2つの測定値の比較であって、2つのシステムを互いに比較して測ったものではない。

残りの4つの次元では、Whisperがより大きな差をつけて勝利している

精度は StepFun が勝つ次元だ。リストの残りでは、オープンウェイトモデルは遠く及ばない。そして、デプロイがそもそも可能かどうかを決めるのは、まさにこれらの項目だ:

• ライセンスとウェイト — 809MパラメータのMITライセンスによるオープンウェイト対、どのティアでもウェイトが公開されていないホステッドAPI。

• デプロイメント — {{1}}セルフホスト、オンプレミス、エアギャップ、または数十の商用プラットフォームのいずれかを通じて{{/1}} 対 {{2}}StepFunのAPIのみ{{/2}}。

• コストの下限 — 1つのホスト型エンドポイントで1,000分あたり約0.67ドル、自分で運用すればさらに低く、一方、ベンダーの公表レートでは1,000分あたり約6.67ドルです。

• データレジデンシー — 音声がお客様の管理下にあるインフラストラクチャから一切出ない場合と、サードパーティのエンドポイントに送信される場合。

• 統合リスク — あなたが重みを保持しているため、モデルがあなたの管理下で撤回されたり、価格を変更されたり、非推奨にされたりすることはない。価格表次第で変わりうるホスト型の料金とは対照的である。

• 長尺音声の挙動 — チャンク分割は自身の判断で行うものであり、ファイルごとに調整できます。一方、ベンダーのエンドポイントが内部でどう処理しているかは文書化されていません。

その価格差は、より安価なWhisperエンドポイントに対しておよそ10対1であり、StepFun自身の製品ライン内で起きたことの裏返しでもある。これが置き換えるモデルであるStepAudio 2.5 ASRは1時間あたり0.15元で、現行ティアは2.8元だ。StepFunは精度を買うために文字起こし料金を約19倍に引き上げた。その結果、これはセルフホスト型オープンウェイトモデルの高価な版というより、そうしたモデルとは異なる市場に位置づけられる。

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

どちらを選ぶべきか

その分け方は、ほとんどの一対一の比較よりもはっきりしている:

• 音声が一般的な内容で、処理量が多く、データを自社インフラの外に出せず、恒久的かつ価格が安定したデプロイが必要なら、Whisper Large v3 Turbo を選ぼう。MIT ライセンスなら、その判断を覆すかどうかは自分次第であり、誰にもそれを奪うことはできない。

• 音声が本当に難しい場合——なまりがある、ささやき声、歌声、または下に音楽が重なっている——や、その分野が StepFun がチューニングした5つのうちの1つである場合は、StepAudio 3 ASR を選んでください。それがプレミアム料金で得られるものであり、そうした音声では3ポイントの精度差が、そのまま使える文字起こしと手作業での修正パスの分かれ目になります。

• 自分の音声がどちらに該当するか分からないなら、どちらか一方だけを排他的に選ぶのはやめよう。間違えたときのコストは非対称だ。オープンウェイトの道は、GPU 1時間分の費用で自分のハードウェア上で試せる。ホスト型の道は試すのは無料だが、自分では制御できない料金に縛られる。

ハイブリッドを選ぶ根拠は、ほとんどの比較対象よりもここでこそ強い。その理由は、ボード上のエンドポイントのばらつきにある。同じWhisperの重みでも、誰がそれを提供するかによってスコアが4.1%から10.1%まで幅を持つため、実践的な策は、オープンウェイトの経路を1つのホストに決め打ちするのではなく、複数のホストにまたがらせることだ。それを可能にするのが自動フェイルオーバーであり、本番経路の手前にホスト型モデルを置きつつ、その経路をそのモデルに賭けずに済むのも、同じ仕組みのおかげである。

これがスタックにどう当てはまるか、そして私たちが何を提供し、何を提供しないか

文字起こしに何を選んでも、その文字起こし結果はどこかに送られます。要約、構造化抽出、コンプライアンスチェック、検索インデックス——これらの呼び出しは通常のテキストモデルに到達し、音声の分数ではなく利用量に応じて増える請求の一部です。StepFun自身のリアルタイムモデルはツール呼び出しと長時間タスクの非同期実行をうたっており、つまりオーディオ層でさえ常にオーディオモデルではない何かに処理を渡しているということです。

範囲について明言しておきます。そうでないかのような含みを持たせるのは容易ですから。StepAudio 3 ASR も Whisper Large v3 Turbo も、OrcaRouter 上にはありません。StepAudio は StepFun 独自の API を通じて利用するもので、Whisper の重みはご自身で実行するか、ホスティングプラットフォームに持ち込むものです。OrcaRouter が提供するのは、文字起こしが流し込まれる委譲レイヤー — 1つの API の背後に約200のテキストモデルを備え、自動フェイルオーバーによって単一のプロバイダのせいで下流の呼び出しが死ぬことがなく、複数のモデルを1回の呼び出しに組み合わせるルーティング DSL、そして1つのモデルの判断では足りないときのモデル融合を実現します。プロバイダが料金を公表している場合、その定価はマークアップなしでそのまま適用されるため、価格改定は発表されたその日に請求に反映されます — この比較に、あるリリースで文字起こし料金を19倍に引き上げたベンダーが含まれていることを踏まえると、これは仮定の話の利点ではありません。

精度の問題に実際にお金を使おうとしているなら、安上がりな手順はこれだ。まず自分たちの音声でオープンウェイトを動かす。自分でできるからであり、そこで得られる数値はどのリーダーボードの数値よりも自分たちにとって意味があるからだ。次に、残ったギャップが10倍の料金に値するかどうかを決める。ほとんどのチームは、トラフィックの一部には値するが、残りには値しないとわかるだろう。そしてそれはモデル選択ではなく、ルーティングの問題だ。

それを解決するものは何だろう

公開されたテストが1つ。両システム、同じ音声、同じデコーディングプロトコル、朗読音声、会話音声、そしてStepFunがチューニングしたと主張する難しいケースの間の誠実な分割。それが存在するまでは、比較は片側がサードパーティ製インデックス、もう片側が変動するスコアを持つオープンウェイトの集合であり、それを読む唯一の責任ある方法は、答えではなく出発点として扱うことだ。

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.