
StepAudio 3 Realtime vs Sesame Preview:人人讚譽的聲音 vs 擁有評分的那一個
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
在 2026 年的大部分時間裡,任何人對語音 AI 所能提出的最強主張,都只是一種聆聽印象。Sesame 的助理聽起來比任何其他東西都更像真人,而且有足夠多人這麼說,使它成了參考基準——沒有基準測試、沒有數字,也無從查核。2026 年 9 月 15 日,StepAudio 3 Realtime由 StepFun 推出,並附上一個數字,對應到該品質最接近可測量的版本:在 Artificial Analysis 的 Conversational Dynamics 評估中拿下 98.9%,排名第一。Sesame Preview並未出現在該榜單上。
真正有意思的地方不在於其中一個擊敗了另一個,而在於Sesame賴以成名的品質,如今竟成了由第三方評分的項目,而那個享有盛名的模型,卻從未拿來與之相較過。
這些各自實際上是什麼
它們不是同一類物件,而這一點對這項比較的決定作用,比任何分數都更大。
Sesame Preview 是一款消費級語音助理。自 2026 年 5 月起在 iOS 上免費提供,自 2026 年 8 月初起在 Android 上廣泛推出,圍繞四名具名代理——Maya、Miles、Simone 和 Charlie——打造,能在不同工作階段之間保留上下文、搜尋網路並設定提醒。它僅支援英文。通話上限為 30 分鐘,登出時會降至五分鐘。其正式語音沒有 API,沒有企業方案,也沒有公開定價。
StepAudio 3 Realtime 是一項開發者介面。它是 StepAudio 3 系列五款模型之一,這五款模型同日發布,且全都以商用 API 形式在 StepFun 的開放平台上線。它支援原生全雙工對話,能直接對語音進行推理,而非先轉錄再處理,並支援工具呼叫,以及在對話持續進行的同時非同步執行長時間任務。它以中文為優先。它並非開放權重,目前採限時免費預覽定價,且尚未公布預覽結束後的費率。
其中一個你可以在上面建造,另一個你可以參觀。
Sesame 聞名的可衡量之處
Conversational Dynamics 是一項特定的基準測試,值得了解它包含哪些內容。它評估輪流發言、停頓處理、打斷後的恢復,以及模型是否能正確地將簡短的附和語——「嗯哼」、「對」、「嗯」——解讀為鼓勵,而非搶奪對話發言權的企圖。這些正是聽者在說某個語音聽起來像真人而非機械時所描述的行為,也正是讓助理令人樂於交談、而不只是準確無誤的行為。
StepAudio 3 Realtime 以 98.9% 在該排行榜上領先,領先 Qwen Audio 3.0 Realtime Plus 的 98.4% 與 GPT-Realtime-2 的 95.3%。根據 StepFun 所述,它也在語音推理項目以 99.7% 排名第一,其背後是一項架構主張:對原始音訊進行推理能保留語氣和強調,而轉錄環節會將其抹平——這正是聽出諷刺與聽出讚美之間的差別。
以下是對那個結果的誠實說明。這個基準測試是業界最接近衡量 Sesame 之所以受讚揚之處的東西,而 Sesame 並未被納入其中。這並不證明 StepAudio 3 Realtime 聽起來比 Sesame 更好。它證明的是:這些說法其中之一是可檢驗的,而另一個到目前為止則否——而且可檢驗的那一項,目前是由一個大多數人從未與之交談過的模型所持有。

可用性不對稱,這才是真正的決策
以上一切都很有意思。這部分具有決定性。
Sesame 的語音——那個大家讚不絕口的版本——是一個規模更大、封閉的正式生產模型,Sesame 從未以 API 形式發布過它。你無法購買它、取得授權,或從你自己的產品中呼叫它。如果你讀到 Sesame 的對話節奏是目前最出色的,就據此斷定你可以擁有它,這個結論無法從證據推得。
Sesame 真正開源的是 CSM-1B,以 Apache-2.0 授權釋出。它是一個語音合成模組,而非助理:由一個 Llama 主幹預測第一個 Mimi 碼本,再由一個較小的 Llama 解碼器預測其餘部分,最後由 Mimi 編解碼器渲染成 24 kHz 的波形。它僅支援英文,能從一段 10 至 15 秒的參考音訊複製聲音,而且完全無法生成文字——你必須將它與另一個語言模型搭配使用。實際試用過兩者的人形容,CSM-1B 的聲音明顯比 Preview 應用程式來得弱,而模型卡也直言不諱地說出了大家心照不宣的事實:驅動互動式示範的是 CSM 的微調變體,而那個變體並不是你能下載的檢查點。
StepAudio 3 Realtime 完全沒有那樣的模糊空間。它是一套商業 API,背後有已公開的模型系列、明確陳述的能力組合,以及可供查閱的第三方評測名次。它同時以中文為優先、採預覽版定價,並在同一份排行榜上登錄了 8.83 秒的首次音訊延遲——而它正是在該排行榜上於對話動態方面勝出,相較之下,Gemini 3.8 Live 為 1.18 秒,GPT-Live-1 則為 1.24 至 1.34 秒。無論它在對話品質上能提供什麼,它尚未證明能在 StepFun 自家的服務環境之外,以對話速度實現那樣的水準。

如果你正在挑選語音堆疊,這該怎麼處理?
先把這兩個問題分開來看。「對話應該給人什麼感覺?」和「我能推出什麼?」有不同的答案,而且只有其中一個是採購決策。
如果你正在校準品味——決定你的產品該有多少溫度、多少靜默才算自在、一個代理應該多快讓出發言權——Sesame Preview 免費、確實出色,而且值得花上一個下午。把它當作參考基準。不要規劃以它為核心的整合,因為根本沒有東西可以整合。
如果你正要把產品推上線,StepAudio 3 Realtime 是貨真價實的候選方案,但也有一些實實在在的注意事項:預覽版定價、以中文為優先的涵蓋範圍、在 Artificial Analysis 上沒有指數評分,以及延遲問題尚未解決。先測試延遲,再測試對話品質。一個在輪流發言基準測試中勝出,卻要花上將近一句話的時間才開始說話的模型,其最佳品質你可能永遠沒機會展現。
而如果 Sesame 的正式版語音有天推出 API,這整場比較就會重新跑過——因為能一錘定音的基準測試早已存在,而 Sesame 最終也將不得不出現在上面。
路由何處適用,何處不適用
語音代理並非單一模型。無論你跑的是 StepAudio 3 Realtime 還是其他任何方案,對話都不斷把工作交給普通的文字模型——一次查詢、一次擷取、一則在暫停等待期間於背後執行的推理呼叫。這個委派層正是成本變異的所在,也是某家供應商的一小時失常演變成你服務中斷的地方。
就我們自身的涵蓋範圍把話說清楚:StepAudio 3 系列中的即時與語音端點並不在 OrcaRouter 上,Sesame 所打造的任何東西也一樣。OrcaRouter 上提供的是語音代理所委派的文字層——單一 API 背後有近 200 個模型、自動容錯移轉,一套可將多個模型組合成單次呼叫的路由 DSL,以及在單一模型的判斷不足時進行模型融合,並以供應商定價原價傳遞、不加收任何費用。
那種區分,正是讓可用性問題看起來沒那麼致命的原因。語音模型是可以重新考慮的決定;委派層則是拆解起來會變得昂貴的那一層,也是在你決定採用任何語音供應商之前,值得先放到路由器後面的一層。

裁決
Sesame Preview 勝在無法衡量的那一點,卻輸在所有可以買到的東西上。它是目前可用語音中聽感最佳的,而且免費,但你無法將它投入生產——而如今,第三方為它賴以成名的品質評分,它卻缺席那份評分表,這是證據上的缺口,而不是受保護的領先優勢。
StepAudio 3 Realtime 在可用性、可量測性與能力上勝出,並在價格、語言涵蓋範圍與延遲方面仍有真正待解的問題。它是這兩者中唯一你今天就能據以建構的,而這比任何基準測試都更快地解決了實務問題。
值得關注的重點很簡單,而且兩種方向都說得通:為 Sesame 正式上線的語音給出 Conversational Dynamics 分數,或是為 StepAudio 3 Realtime 拿出一個延遲數字,讓它落在此刻在品質上被它擊敗的模型所在的相同區間。無論是哪一種,都能讓這件事從一項測量值與一份名聲之間的比較,變成真正的正面對決。
