見出し「StepAudio 3 ASR vs StepAudio 3」とサブタイトル「一方はモデル。もう一方は、ひとつの名を冠した5つの製品」を配した生成ヒーロータイトルカード。その下のフッターは「StepFun figures as published September 2026.」。
Guides & Insights

StepAudio 3 ASR vs StepAudio 3:そのような名前のモデルは存在しない

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

StepAudio 3」を検索すると、モデルではなくファミリーが見つかります。StepFunの2026年9月15日のオーディオリリースでは、その名の下に5つの製品が登場しました — Realtime、ASR、text-to-speech、Gen、Music — そしてその中の文字起こし製品、StepAudio 3 ASRは、それ以来リーダーボードを駆け上がっているものです。StepFun自身のドキュメントがこれまでで最大のASRモデルと呼ぶティアは、StepAudio 3 ASR Maxであり、同じバックボーンを共有する会話向けの兄弟は、StepAudio 3 Realtimeです。「StepAudio 3 ASR」と「StepAudio 3」を比較しようとしているなら、製品と製品ラインを比較していることになり、答えは実際に3つのうちどれを指していたかによってまったく変わります。

このページがそれを解決します。これはマーケティング上の比較ではありません——上記の3つの名称はそれぞれ異なる価格、異なるエンドポイント、異なる障害モードを伴うため、StepAudio 3のあらゆる仕様書を正しく読む前に必要な曖昧性の解消なのです。

なぜその名前は曖昧なのか

StepFunは音声スタック全体をわずか一日でリリースし、その命名規則によってファミリー名がすべての製品名の語幹となった。それはローンチ用のスライドでは整然としているが、それ以外のあらゆる場面では厄介だ。つまり、ファミリー名で検索すると5つの異なる製品が混在して返ってくるし、「StepAudio 3」とラベル付けされたベンチマークの行が、そのどれを指していてもおかしくはない。

実際的な帰結として、見出しからは何が測定されたのか分からない。「StepAudio 3が文字起こしリーダーボードで首位に立つ」と書かれた投稿は、StepAudio 3 ASRについて述べている。「StepAudio 3が会話のダイナミクスで勝つ」と書かれた投稿は、StepAudio 3 Realtimeについて述べている。どちらも真実であり、両者は異なる製品で、互換性はない。

特にASRラインの中には、もう一つの曖昧さがあります。StepFunのドキュメントでは、ASR Maxティアを同社史上最大のASRモデルとして言及しており、独自の価格設定と独自のエンドポイントを持っています。一方、公開リーダーボードの行には、より簡素なラベルが付いています。それらが2つの名前を持つ1つのSKUなのか、2つのSKUなのかを見極めることが、このページでできる最も有用なことです。次のセクションでそれを行います。

その名前が意味しうる三つのこと

StepAudio 3 ASR — 文字起こし製品です。デコードの進行に応じて逐次テキストを返し、最後に最終的な文字起こしを返すストリーミングエンドポイントです。StepFun はこれを、コンテキスト用の言語モデルを組み込んだ文字起こしだと説明しており、医療、法律、金融、自動車、プログラミングの音声や、ささやき声、速い話し方、連続した話し方、歌唱、背景音楽といった難しい入力に対応するよう調整されています。非ストリーミングの音声テキスト変換において、Artificial Analysis の AA-WER 指数で 1.7% の単語誤り率を記録しているモデルです。

StepAudio 3 ASR Max — StepFunのドキュメントがこれまでで最大のASRモデルと呼ぶ最上位ティアです。公表されているリスト単価は1時間あたり2.8元。安価な文字起こしツールではなく、ASRシリーズの頂点に位置するモデルです。

StepAudio 3 Realtime — 全二重の対話モデルです。文字起こしをしてから推論するという連鎖を回すのではなく、音声を直接推論し、その副産物として文字起こしを行います。ASR 製品ではなく、文字起こしタスクにおける精度は、チューニングで狙ったものではありません。

ファミリー内のその他すべて — TTS、Gen、Music — はまったく別の仕事であり、文字起こしの比較には一切登場すべきではない。

ASRとASR Maxは同じモデルですか?

証拠は「はい」を指し示しており、その確認は算数でできる。StepFunはASR Maxティアを1時間あたり2.8元と掲載している。1ドル=約7.1元で換算すると、1時間あたり約0.39ドル、つまり1,000分あたり約6.6ドルになる。Artificial Analysisはリーダーボード上でこのモデルを1,000分あたり6.67ドルと掲載している。ベンダーの価格表に由来する数字と、第三者ボードに由来する数字という、独立に公表された2つの数値が、互いに1セント以内で一致している。リーダーボードの行とASR Maxのリスト料率が同じSKUを表しているなら、まさに期待されるとおりの結果だ。

それが何を証明し、何を証明しないかについては、正確に述べておく価値がある。それは、リーダーボードの価格軸とベンダーの料金表が、同じ製品を同じ価格で記述していることを証明する。リーダーボードの1.7%が、あなたが呼び出す正確なエンドポイントで測定されたことは証明しない。なぜなら、ボードはそのデコーディング設定や、実際にアクセスしたエンドポイントを公開していないからだ。つまり、同じ製品である可能性は非常に高いが、同じ測定条件であるかは未検証である。

確かなのは、このラインにおける世代をまたぐ飛躍だ。StepAudio 2.5 ASRは同じボードで4.7%、1時間あたり0.15元。現行ティアは1.7%、1時間あたり2.8元。これは単語誤り率を64%削減する代わりに、料金がおよそ19倍になるということだ — このファミリーで最も際立ったトレードオフであり、アップグレードがそれだけの価値があるかどうかを決めるものだ。

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

{{1}}実際に異なる次元{{/1}}

名前が固まれば、比較は短いリストに絞られる。意思決定を変えるのは、これらだ:

• 精度 — StepAudio 3 ASR のノンストリーミングでの AA-WER は 1.7%、同じボード上の StepAudio 2.5 ASR は 4.7%。測定は Artificial Analysis によるもので、StepFun によるものではない。

• 価格 — 1時間あたり2.8元 対 1時間あたり0.15元。どちらもベンダーの定価で、どちらも現行。約19倍。

• ウェイト — 両方ともホスト型APIのみ。ファミリー内のどこにもオープンウェイトはなく、オンプレミスの提供経路も、どのティアでもセルフホスティングの選択肢もない。

• エンドポイントの形状 — 増分テキストと最終テキストを返す単一のストリーミング文字起こしエンドポイントという点で、前世代と同じ形状です。統合モデルに関して何も変わっていないため、移行は書き直しではなくモデル識別子の差し替えです。

• ハードオーディオ向けチューニング — StepAudio 3 ASR は、ささやき声、速い話し方、連続発話、歌唱音声、そして下に音楽が流れている音声に明示的にチューニングされています。このチューニングこそが製品そのものであり、前世代はそれを想定して作られていませんでした。

• ベンダーが主張するドメイン別の改善 — StepFunの報告によると、中国語は9.3%減、英語は25.0%減、方言は22.3%減、業種特化型は42.1%減、コードスイッチングは27.9%減と、世代ごとに減少している。ベンダーによる報告であり再現もされていないため、方向性を示す参考値として扱うこと。

そのリストに顕著に欠けているのは、コンテキスト長、音声フォーマットの対応、最大音声長、モデル識別子です。StepFunのこのモデルに関する公開ドキュメントにはそれらは記載されておらず、それらの数値を引用している人は別の何かを引用しています。

ASR対Realtimeこそ、人々が本当に必要としている比較だ

文字起こし製品を世代間ではなく製品間で選ぶのであれば、興味深い対決は ASR 対 ASR Max ではなく、ASR 対 Realtime です。StepFun 自身の技術資料によれば、両者は事前学習段階と中間学習段階を共有し、教師ありファインチューニングの段階でのみ分岐します。同じベース、異なるファインチューニング、異なる製品です。

その一つの事実には、実用的な読み方がある。1.7%という単語誤り率は、ASRファインチューニングの特性である。それは、文字起こし精度ではなく、ターン交代、割り込み処理、音声に対する推論を最適化するリアルタイムモデルについての約束ではない。もしあなたのアーキテクチャがライブ会話の副作用として文字起こしを行うのであれば、あなたは1.7%を買っているのではない。たまたまテキストを出力する会話モデルを買っているのだ。

逆もまた真であり、しかもあまり明白ではない。彼らがバックボーンを共有しているため、ASRモデルはファミリーに後付けされた小規模な専用モデルではない。同じ規模のシステムを、異なる形でファインチューニングしたものだ。だからこそ、ASRの料金は市場の安価な端に近いのではなく、ファミリーの他のモデルに近い水準になっている。

もし一つ選ぶなら、これをどうしますか

3つの問いで決着する。必要なのは文字起こしですか、それとも会話ですか? 文字起こしなら、StepAudio 3 ASRが製品であり、ファミリー名はノイズだ。会話なら、欲しいのはStepAudio 3 Realtimeであり、ASRベンチマークなど読むべきではない。そして、本当に難しい音声 — 訛りのある、囁き声、歌、あるいは下に音楽が重なったもの — の文字起こしが必要なら、19倍のプレミアムはそれ向けに調整されたティアの価格であり、正直なテストは混成インデックスではなく自分の音声だ。

間違いやすい判断は、文字起こし層を恒久的なものとして扱ってしまうことだ。何を選ぶにせよ、文字起こしは別の何かへの入力になる——要約ツール、構造化抽出、コンプライアンスチェック、検索インデックス——そしてそれらの呼び出しが届くのは、ごく普通のテキストモデルだ。利用量に応じてスケールするのは、音声の分数ではなくこの層であり、最初からポータブルに保つ価値があるのもこの層だ。OrcaRouter はほぼ200のテキストモデルを1つのAPIの背後に集約しており、プロバイダーをまたぐ自動フェイルオーバー、複数のモデルを単一の呼び出しに組み合わせるルーティングDSL、そして1つのモデルの判断では足りないときのモデルフュージョンを備えている。プロバイダーが料金を公表している場合、その定価はマークアップなしでそのまま反映されるため、テキスト側の価格変更は発表されたその日に請求へ届く。

スコープについて明確にしておきます。このページは当社が提供対象としていないファミリーに関するものなので、OrcaRouter上にStepAudio 3のエンドポイントはありません。文字起こしモデルと音声モデルには、StepFun独自のAPIを通じてアクセスします。OrcaRouterが担うのは文字起こしの下流にある推論レイヤーであり、そこでは切り替えの判断を下すのは安価で、先延ばしにするのは高くつきます。

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

誰も解決していないこと

名称は解決可能だ。性能に関する主張は、まだ解決できない。ASRモデルについて公開された技術レポートは依然としてなく、公開されたテストセットも、デコーディング設定も、StepFunの外部による再現可能なプロトコルも存在しない。そしてベンダー自身の比較は、オープンウェイトの既存の支配的モデルではなく、他の中華系ASR製品を対象にしている。1.7%は、3つのデータセットを混合した指標における実際の第三者による測定値だ。このモデルに関するそれ以外のすべては、ベンダーの主張にすぎない。

2つのことがこの状況を変えるだろう。同一音声を使ったWhisper Large v3 Turboとの直接対決。これは誰も公開していない。そして、ファミリーの残りのモデルに対する料金だ——5つのStepAudio 3モデルのうち4つは、提供開始時点で期間限定の無料プレビュー価格のままで、公開されていた料金は文字起こしと音声合成のみだった。つまり、今日確認できる価格表が対象としているのは5製品のうち2つだけということになる。

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

それは音声の分数ではなく利用量に応じてスケールする層であり、最初からポータブルに保つ価値のある層です。 プロバイダー間の自動フェイルオーバー、複数を単一の呼び出しに組み合わせるルーティング DSL、そして 1 つのモデルの判断では不十分なときのモデルフュージョンです。