StepAudio 3 Realtime vs Sesame Preview の生成ヒーロータイトルカード。キッカーは「OrcaRouter · モデルレーダー — 真っ向対決」、見出しは「StepAudio 3 Realtime vs Sesame Preview」、サブタイトルは「誰もが絶賛する声 vs リーダーボードスコアを持つ声」で、VSマークの両側に2枚の角丸モデルカードが配置されている。
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview:誰もが絶賛する音声 vs スコアを持つ音声

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年の大半を通じて、音声AIについて誰もが下せる最も強い主張は、聴いた印象にすぎなかった。Sesameのアシスタントは他の何よりも人間らしく聞こえ、そう言う人が十分に多かったため、それは基準点となった — ベンチマークも、数値も、検証する手段もないままに。2026年9月15日、StepAudio 3 RealtimeがStepFunから登場し、その品質を最も測定可能な形にしたものに数値が伴った。Artificial AnalysisのConversational Dynamics評価で98.9%、首位。Sesame Previewはそのボードに載っていない。

興味深いのは、一方が他方を打ち負かしたことではない。Sesameが名声を得るきっかけとなった品質が、今や第三者が採点する対象になっており、その評判を持つモデル自身は、それに対して一度も測定されたことがないということだ。

これらがそれぞれ実際には何なのか

それらは同じ種類の対象ではなく、そのことがどんなスコアよりも比較を大きく左右する。

Sesame Previewはコンシューマー向けの音声アシスタントです。2026年5月からiOSで、2026年8月上旬からはAndroidでも広く無料で利用できます。セッションをまたいで文脈を保持し、ウェブ検索やリマインダー設定を行う、Maya、Miles、Simone、Charlieという4つの名前付きエージェントを中心に構築されています。英語のみに対応しています。通話は最長30分で、ログアウト時は5分に短縮されます。本番用音声のAPIはなく、エンタープライズ向けプランも公開価格もありません。

StepAudio 3 Realtimeは開発者向けのサーフェスです。StepAudio 3ファミリーの5モデルのうちの1つで、すべて同日にリリースされ、すべてStepFunのオープンプラットフォーム上で商用APIとして提供されています。ネイティブな全二重会話を処理し、先に文字起こしするのではなく音声を直接推論し、会話を続けながらツール呼び出しと長時間タスクの非同期実行をサポートします。中国語優先です。オープンウェイトではなく、現在は期間限定の無料プレビュー価格で、プレビュー後の料金は発表されていません。

そのうちの片方は、その上に建てることができる。もう片方は、訪れることができる。

セサミが有名な、測定可能なもの

Conversational Dynamicsは特定のベンチマークであり、それが何を評価するのかを知る価値がある。これはターンテイキング、ポーズの処理、中断からの復帰、そしてモデルが短いあいづち——「うんうん」「なるほど」「ん」——を、会話の主導権を取ろうとする試みではなく励ましとして正しく解釈するかどうかを採点する。これらはまさに、声がロボット的ではなく人間らしく感じられると聞き手が言うときに挙げる行動であり、アシスタントを単に正確であるだけでなく、話していて心地よいものにする行動である。

StepAudio 3 Realtimeは98.9%でそのボードの首位に立ち、98.4%のQwen Audio 3.0 Realtime Plusと95.3%のGPT-Realtime-2を上回っている。また、StepFunが引用するSpeech Reasoningでも99.7%で1位となっており、その背後には、生の音声に対する推論が、文字起こしを挟むと平坦化してしまうトーンや強調を保持するというアーキテクチャ上の主張がある——皮肉に聞こえるか、褒め言葉に聞こえるかの違いである。

これが、その結果についての正直な捉え方だ。このベンチマークは、Sesameが称賛されている点を測定するものとして業界が持つ最も近いものであり、Sesameはそこにエントリーされていない。それは、StepAudio 3 RealtimeがSesameより音が良いという証拠ではない。それは、これらの主張の一方は検証可能で、もう一方は今のところ検証不能であること——そして、検証可能な方は現在、ほとんどの人が話したことのないモデルによって保持されていること——の証拠なのだ。

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

可用性の非対称性、それが本当の決定である

上記のすべては興味深い。この部分が決定的だ。

Sesameの音声——人々が絶賛しているあれ——は、SesameがAPIとして一度も公開したことのない、より大規模なクローズドの本番モデルです。それを購入することも、ライセンスを受けることも、自分の製品から呼び出すこともできません。Sesameの会話のタイミングが入手可能な中で最高だと読み、それを手に入れられると結論づけたとしても、その結論は証拠からは導かれません。

Sesameが実際にオープンソース化したのはCSM-1Bで、Apache-2.0の下で公開されている。これはアシスタントではなく、音声合成ブロックだ。Llamaバックボーンが最初のMimiコードブックを予測し、より小さなLlamaデコーダーが残りを予測し、それをMimiコーデックが24 kHzの波形にレンダリングする。英語専用で、10〜15秒の参照クリップから声をクローンし、テキスト生成はまったくできない——別の言語モデルと組み合わせて使う。両方を動かした人々は、CSM-1Bの声がPreviewアプリのものより明らかに弱いと評しており、モデルカードは、あえて言わない部分を明言している。CSMをファインチューニングした変種がインタラクティブデモを動かしており、その変種はダウンロードできるチェックポイントではない。

StepAudio 3 Realtimeには、そのような曖昧さは一切ない。背後に公開されたモデルファミリーがあり、明示された機能セットがあり、第三者が行った配置結果も調べられる商用APIだ。さらに中国語優先で、プレビュー価格であり、同じリーダーボード上で会話ダイナミクスを制する一方、初回音声までの時間は8.83秒と記録している。これに対し、Gemini 3.8 Liveは1.18秒、GPT-Live-1は1.24~1.34秒だ。会話品質で何を提供していようと、StepFun自身の配信環境の外でそれを会話速度で提供できることは、まだ実証されていない。

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

音声スタックを選んでいるなら、これをどうすればよいか

まず二つの問いを切り分けよう。「会話はどう感じられるべきか?」と「何を出荷できるか?」には異なる答えがあり、そのうち一方だけが調達の判断だ。

もしあなたが製品のテイストを調整しているなら——製品にどれだけ温かみを持たせるか、どれだけの沈黙が心地よいか、エージェントがどれほど早く発言の番を譲るべきか——Sesame Previewは無料で、本当に優れており、午後を過ごすのにうってつけの場所だ。参照点として使うといい。ただし、それを軸に統合を計画しないこと。統合できる相手が何もないのだから。

製品を出荷する立場なら、StepAudio 3 Realtime は本物の候補であり、同時に本物の注意点もある。プレビュー価格、中国語優先のカバレッジ、Artificial Analysis でのインデックススコアなし、そして未解決のレイテンシ問題だ。会話品質より先にレイテンシをテストせよ。ターンテイキングのベンチマークで勝っても、話し始めるまでに文の大半に相当する時間がかかるモデルは、その最高の品質を披露する機会を永遠に得られないかもしれないモデルだ。

そして、もしSesameのプロダクション用音声にいつかAPIが提供されれば、この比較全体が再実行される——なぜなら、それに決着をつけるベンチマークはすでに存在しており、Sesameもついにそこに登場せざるを得なくなるだろうから。

ルーティングが適する場合と、そうでない場合

音声エージェントは単一のモデルではない。StepAudio 3 Realtime を動かしていても、それ以外を使っていても、会話は絶えず通常のテキストモデルに作業を渡している — 検索、抽出、待機中のポーズの裏で実行される推論呼び出しなどだ。その委譲レイヤーこそ、コストの変動が潜む場所であり、あるプロバイダーの不調な1時間があなたのサービス停止になる場所です。

私たち自身のカバレッジについて正確に言うと、StepAudio 3ファミリーのライブおよび音声エンドポイントはOrcaRouterにはありませんし、Sesameが構築したものもありません。OrcaRouterにあるのは、音声エージェントが委任するテキストレイヤーです — 1つのAPIの背後に約200のモデル、自動フェイルオーバー、複数を1回の呼び出しに組み合わせるルーティングDSL、そして単一モデルの判断では十分でない場合のモデル融合で、プロバイダーの定価がマークアップなしでそのまま渡されます。

その分割があるおかげで、可用性の問題は見た目ほど致命的ではなくなる。音声モデルは後から見直せる判断だが、委譲レイヤーは解きほぐすのに高くつくほうであり、どの音声ベンダーにコミットする前にルーターの背後に置く価値があるのもそちらだ。

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

評決

Sesame Preview は測定できない点で勝り、購入できるあらゆる点で負ける。それは利用可能な中で最も音の良い声であり、無料であり、そして本番環境に投入することはできない —— そして今や、第三者が、それが有名な品質を採点する中で、そのスコアボードに欠けていることは、証拠の空白であり、保護された優位性ではない。

StepAudio 3 Realtimeは、可用性、測定可能性、能力の点で優位に立ち、価格、言語カバレッジ、レイテンシーについては真に未解決の課題を抱えている。2つのうち、今日実際にその上に構築できるのはこれだけであり、その事実はいかなるベンチマークよりも速く実用的な問いに決着をつける。

注目すべき点は単純で、しかもどちらにも当てはまる。Sesameのプロダクション音声のConversational Dynamicsスコアか、あるいはStepAudio 3 Realtimeのレイテンシ値で、それが現在品質で上回っているモデル群と同じ範囲に収まるものだ。どちらか一方でもあれば、これは測定値と評判の比較から、実際の直接対決へと変わるだろう。