為 StepAudio 3 Realtime 對上 Sesame Preview 所生成的主視覺標題卡,上方是引言標「OrcaRouter · model radar — head to head」、主標題「StepAudio 3 Realtime vs Sesame Preview」,以及副標題「人人稱讚的嗓音,迎戰擁有排行榜分數的那一個」,其下則有兩張圓角模型卡分列於對決符號兩側。
Guides & Insights

StepAudio 3 Realtime vs Sesame Preview:人人讚譽的聲音 vs 擁有評分的那一個

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 2026 年的大部分時間裡,任何人對語音 AI 所能提出的最強主張,都只是一種聆聽印象。Sesame 的助理聽起來比任何其他東西都更像真人,而且有足夠多人這麼說,使它成了參考基準——沒有基準測試、沒有數字,也無從查核。2026 年 9 月 15 日,StepAudio 3 Realtime由 StepFun 推出,並附上一個數字,對應到該品質最接近可測量的版本:在 Artificial Analysis 的 Conversational Dynamics 評估中拿下 98.9%,排名第一。Sesame Preview並未出現在該榜單上。

真正有意思的地方不在於其中一個擊敗了另一個,而在於Sesame賴以成名的品質,如今竟成了由第三方評分的項目,而那個享有盛名的模型,卻從未拿來與之相較過。

這些各自實際上是什麼

它們不是同一類物件,而這一點對這項比較的決定作用,比任何分數都更大。

Sesame Preview 是一款消費級語音助理。自 2026 年 5 月起在 iOS 上免費提供,自 2026 年 8 月初起在 Android 上廣泛推出,圍繞四名具名代理——Maya、Miles、Simone 和 Charlie——打造,能在不同工作階段之間保留上下文、搜尋網路並設定提醒。它僅支援英文。通話上限為 30 分鐘,登出時會降至五分鐘。其正式語音沒有 API,沒有企業方案,也沒有公開定價。

StepAudio 3 Realtime 是一項開發者介面。它是 StepAudio 3 系列五款模型之一,這五款模型同日發布,且全都以商用 API 形式在 StepFun 的開放平台上線。它支援原生全雙工對話,能直接對語音進行推理,而非先轉錄再處理,並支援工具呼叫,以及在對話持續進行的同時非同步執行長時間任務。它以中文為優先。它並非開放權重,目前採限時免費預覽定價,且尚未公布預覽結束後的費率。

其中一個你可以在上面建造,另一個你可以參觀。

Sesame 聞名的可衡量之處

Conversational Dynamics 是一項特定的基準測試,值得了解它包含哪些內容。它評估輪流發言、停頓處理、打斷後的恢復,以及模型是否能正確地將簡短的附和語——「嗯哼」、「對」、「嗯」——解讀為鼓勵,而非搶奪對話發言權的企圖。這些正是聽者在說某個語音聽起來像真人而非機械時所描述的行為,也正是讓助理令人樂於交談、而不只是準確無誤的行為。

StepAudio 3 Realtime 以 98.9% 在該排行榜上領先,領先 Qwen Audio 3.0 Realtime Plus 的 98.4% 與 GPT-Realtime-2 的 95.3%。根據 StepFun 所述,它也在語音推理項目以 99.7% 排名第一,其背後是一項架構主張:對原始音訊進行推理能保留語氣和強調,而轉錄環節會將其抹平——這正是聽出諷刺與聽出讚美之間的差別。

以下是對那個結果的誠實說明。這個基準測試是業界最接近衡量 Sesame 之所以受讚揚之處的東西,而 Sesame 並未被納入其中。這並不證明 StepAudio 3 Realtime 聽起來比 Sesame 更好。它證明的是:這些說法其中之一是可檢驗的,而另一個到目前為止則否——而且可檢驗的那一項,目前是由一個大多數人從未與之交談過的模型所持有。

Screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the AA-Speech to Speech Index bar chart and the speed and cost-per-hour charts for the voice models StepAudio 3 Realtime is measured against.

可用性不對稱,這才是真正的決策

以上一切都很有意思。這部分具有決定性。

Sesame 的語音——那個大家讚不絕口的版本——是一個規模更大、封閉的正式生產模型,Sesame 從未以 API 形式發布過它。你無法購買它、取得授權,或從你自己的產品中呼叫它。如果你讀到 Sesame 的對話節奏是目前最出色的,就據此斷定你可以擁有它,這個結論無法從證據推得。

Sesame 真正開源的是 CSM-1B,以 Apache-2.0 授權釋出。它是一個語音合成模組,而非助理:由一個 Llama 主幹預測第一個 Mimi 碼本,再由一個較小的 Llama 解碼器預測其餘部分,最後由 Mimi 編解碼器渲染成 24 kHz 的波形。它僅支援英文,能從一段 10 至 15 秒的參考音訊複製聲音,而且完全無法生成文字——你必須將它與另一個語言模型搭配使用。實際試用過兩者的人形容,CSM-1B 的聲音明顯比 Preview 應用程式來得弱,而模型卡也直言不諱地說出了大家心照不宣的事實:驅動互動式示範的是 CSM 的微調變體,而那個變體並不是你能下載的檢查點。

StepAudio 3 Realtime 完全沒有那樣的模糊空間。它是一套商業 API,背後有已公開的模型系列、明確陳述的能力組合,以及可供查閱的第三方評測名次。它同時以中文為優先、採預覽版定價,並在同一份排行榜上登錄了 8.83 秒的首次音訊延遲——而它正是在該排行榜上於對話動態方面勝出,相較之下,Gemini 3.8 Live 為 1.18 秒,GPT-Live-1 則為 1.24 至 1.34 秒。無論它在對話品質上能提供什麼,它尚未證明能在 StepFun 自家的服務環境之外,以對話速度實現那樣的水準。

Screenshot of the Sesame CSM-1B model card on Hugging Face showing the Apache-2.0 licence tag alongside English and text-to-speech tags, 2.45k likes and 1.65k followers, release notes for the 1B CSM variant, a description of the Llama backbone and smaller Mimi audio-code decoder, and a line stating that a fine-tuned variant of CSM powers the interactive voice demo shown in the blog post.

如果你正在挑選語音堆疊,這該怎麼處理?

先把這兩個問題分開來看。「對話應該給人什麼感覺?」和「我能推出什麼?」有不同的答案,而且只有其中一個是採購決策。

如果你正在校準品味——決定你的產品該有多少溫度、多少靜默才算自在、一個代理應該多快讓出發言權——Sesame Preview 免費、確實出色,而且值得花上一個下午。把它當作參考基準。不要規劃以它為核心的整合,因為根本沒有東西可以整合。

如果你正要把產品推上線,StepAudio 3 Realtime 是貨真價實的候選方案,但也有一些實實在在的注意事項:預覽版定價、以中文為優先的涵蓋範圍、在 Artificial Analysis 上沒有指數評分,以及延遲問題尚未解決。先測試延遲,再測試對話品質。一個在輪流發言基準測試中勝出,卻要花上將近一句話的時間才開始說話的模型,其最佳品質你可能永遠沒機會展現。

而如果 Sesame 的正式版語音有天推出 API,這整場比較就會重新跑過——因為能一錘定音的基準測試早已存在,而 Sesame 最終也將不得不出現在上面。

路由何處適用,何處不適用

語音代理並非單一模型。無論你跑的是 StepAudio 3 Realtime 還是其他任何方案,對話都不斷把工作交給普通的文字模型——一次查詢、一次擷取、一則在暫停等待期間於背後執行的推理呼叫。這個委派層正是成本變異的所在,也是某家供應商的一小時失常演變成你服務中斷的地方。

就我們自身的涵蓋範圍把話說清楚:StepAudio 3 系列中的即時與語音端點並不在 OrcaRouter 上,Sesame 所打造的任何東西也一樣。OrcaRouter 上提供的是語音代理所委派的文字層——單一 API 背後有近 200 個模型、自動容錯移轉,一套可將多個模型組合成單次呼叫的路由 DSL,以及在單一模型的判斷不足時進行模型融合,並以供應商定價原價傳遞、不加收任何費用。

那種區分,正是讓可用性問題看起來沒那麼致命的原因。語音模型是可以重新考慮的決定;委派層則是拆解起來會變得昂貴的那一層,也是在你決定採用任何語音供應商之前,值得先放到路由器後面的一層。

A generated scoreboard titled 'StepAudio 3 Realtime vs Sesame Preview'. The StepAudio column reads Conv. Dynamics '98.9%, first place', Callable API 'yes, commercial', Languages 'Chinese-first', Session cap 'not published', Tool execution 'tool calls, async tasks', Open artifact 'none, closed'. The Sesame column reads Conv. Dynamics 'no score published', Callable API 'no API for its voice', Languages 'English only', Session cap '30 min, 5 logged out', Tool execution 'reminders, web search only', Open artifact 'CSM-1B, Apache-2.0'. Footer: 'StepAudio 3 figures vendor-cited; Sesame naturalness is a listening impression, not a benchmark.'

裁決

Sesame Preview 勝在無法衡量的那一點,卻輸在所有可以買到的東西上。它是目前可用語音中聽感最佳的,而且免費,但你無法將它投入生產——而如今,第三方為它賴以成名的品質評分,它卻缺席那份評分表,這是證據上的缺口,而不是受保護的領先優勢。

StepAudio 3 Realtime 在可用性、可量測性與能力上勝出,並在價格、語言涵蓋範圍與延遲方面仍有真正待解的問題。它是這兩者中唯一你今天就能據以建構的,而這比任何基準測試都更快地解決了實務問題。

值得關注的重點很簡單,而且兩種方向都說得通:為 Sesame 正式上線的語音給出 Conversational Dynamics 分數,或是為 StepAudio 3 Realtime 拿出一個延遲數字,讓它落在此刻在品質上被它擊敗的模型所在的相同區間。無論是哪一種,都能讓這件事從一項測量值與一份名聲之間的比較,變成真正的正面對決。