
Realtime-Venus 對比 Sesame Preview:你能得到的,並非好的那一個
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus 與 Sesame Preview 出自理念截然不同的實驗室,雙方對於語音模型的用途抱持完全相反的想法,卻從相反的方向跌進了同一個陷阱。Sesame Preview 是一款免費的消費級應用程式——iOS 版自 2026 年 5 月起推出,Android 版自八月初起推出——內建四個對話代理人、通話期間的即時網路搜尋,以及被評論者譽為同類最佳的語音。Sesame 所發布的開放權重則是另一個更小的模型,該公司本身也並未把它當成你在示範中聽到的那個語音來呈現。Realtime-Venus 是螞蟻集團 Venus 團隊與清華大學合作開發的 9B 全雙工系統,它走的是另一條路:可下載的成品就是本尊,而且根本沒有產品。無論是哪一種情況,在規劃任何與之相關的事情之前,最值得先弄懂的,就是「可取得的東西」與「令人驚豔的東西」之間的落差。
每一個實際上是什麼

Sesame Preview 是一款產品。Sesame 是舊金山的一間實驗室,由 Brendan Iribe、Ankit Kumar 和 Ryan Brown 於 2023 年創立,並獲得 a16z、Sequoia、Spark 和 Matrix 投資;其消費級語音助理推出四種人格——Maya、Miles、Simone 和 Charlie——各自擁有獨特的性情與聲音。這個代理能在對話過程中搜尋網路、記筆記和設定提醒,並在通話結束後發送摘要。記憶是依各代理分別儲存的,當你登入後會在網頁與行動裝置之間同步;另有一種無痕模式,可讀取過去的記憶而不寫入新的記憶。它免費、不投放廣告,而公司也表示不會出售資料。
Realtime-Venus 是一項研究性質的發布。Hugging Face 上有兩個採用 Apache-2.0 授權的 9B 檢查點——Realtime-Venus-Omni 用於音訊視覺互動,Realtime-Venus-Audio 用於口語互動——外加一份於 2026 年 9 月 12 日提交至 arXiv 的技術報告、一個專案頁面,以及一個包含 Realtime-Venus-Harness 元件的隨附儲存庫。沒有應用程式、沒有 API、沒有價格,也沒有來自供應商的公告。該儲存庫未由任何推論供應商部署,且下載量未受追蹤。
陷阱,雙向皆然
Sesame 的版本是經典的「開放洗白」樣態,而 Sesame 對此比大多數公司都更誠實。該實驗室在 Apache-2.0 下釋出的 CSM 檢查點是一個基礎語音生成模型——由 Llama 主幹饋入 Mimi-codec 解碼器——而文件明確指出,它不是該應用程式的聲音,也不是端到端語音轉語音系統。它無法生成文字,且主要用英語資料訓練,在英語之外的能耐有限。驅動 Sesame Preview 的,是一個尚未釋出的更大規模正式生產模型。所以,如果你去尋找 demo 裡的聲音,你找到的是它的研究血統,而不是那個東西本身。當四個代理之一接聽你的通話時,你聽到的是某個你無法下載的東西。
Realtime-Venus 的版本是鏡像,而且可以說是更奇怪的那一個。所有發佈的內容都是真的:真實的權重、真實的程式碼、真實的報告、寬鬆的授權條款。所缺的是任何不必擁有 GPU 就能使用它的方法。兩個 BF16 的 9B 檢查點,各自約有十八 GB 的權重,這還不計入活化記憶體,而且兩者都設計成要搭配即時音訊與視訊輸入,執行連續的一秒串流迴圈。那是伺服器等級的部署。一個把相同能力送到手機上的消費級應用程式,正是在做這個發行版本沒有嘗試的事,而下載得到的模型與跑得起來的模型之間的落差,正是大多數想要它的人會卡住的地方。
可衡量性才是更鮮明的差異
兩個模型都沒有獨立的語音品質分數,但原因不同。
• Sesame Preview — 沒有競技場參賽紀錄,也沒有對正式版語音的公開評測。它的聲譽建立在評論者身上,以及原始示範對聽眾所產生的效果上;這算得上是某種真實證據,卻完全未經量化。
• {{1}}CSM-1B{{/1}} — 這個開放檢查點是一個基礎生成模型;它並未與對話系統進行基準比較,因為它本身並不是對話系統。
• Realtime-Venus — 一項自行報告的語音數據,VoiceBench AlpacaEval 分數為 4.81,其報告稱此分數與最佳比較數值相符。尚無第三方對其進行評估。
• 兩者都給不了你的——一個由對結果毫無利害關係的人所產出的數字。如果語音品質是你的購買準則,那麼整個比較就無法評分,而誠實的做法是親自聽聽這兩者,自己決定,而不是聽從一張表格。
輪流上陣,雙方都有必須證明自己的地方
Sesame 的聲譽正是建立在此。讓這間實驗室聲名大噪的那段示範,是一副帶著呼吸、猶豫與打斷時機的嗓音,逼真到讓聽眾以為話筒另一端是個真人。那是一項關於對話動態的主張,而這也正是這款產品所主打的賣點。
Realtime-Venus 也提出相同的說法,還附上數字。在 Full-Duplex-Bench v1.5 上,其音訊檢查點回報能回應 75% 的使用者打斷,延續率在附和訊號下為 97%、在對他人說話下為 88%、在背景語音下為 86%——並宣稱在三項延續指標上全都超越 Gemini 3.1 Live 與 GPT-4o。那些數字來自它自己的報告,而沒有人重現過。
所以這個比較,是拿一個沒有數字的示範去比一個沒有示範的數字,這確實是種很尷尬的處境,也貼切描述了這整個類別目前是如何自我報導的。唯一有把握能說的是,兩種說法都還沒經過外部第三方檢驗,而後門管道下 97% 的續留率高得足以在被引用為定論之前,先接受一次那樣的檢驗。

你實際上能打造什麼
Sesame Preview 對開發者毫無幫助。它沒有 API、沒有模型識別碼、沒有費率表,也沒有任何表明要提供這些的計畫。登入時通話上限為三十分鐘,未登入則為五分鐘;英文是唯一官方支援的語言;而這個代理會研究並記住資訊,但不會執行任務——它不會預訂航班。免費方案就是產品本身。這對消費者來說是再好不過的方案,對整合而言卻是死路一條。
Realtime-Venus 為建構者備妥了一切,唯獨沒有提供可執行它的環境。權重以寬鬆授權釋出,程式碼可用標準 Transformers 呼叫載入,只需切換一個方法即可進入全雙工串流,而文件所述的迴圈是先進行一秒的串流預填充,接著進行串流生成,如此反覆。長影片記憶透過 memory-minutes 參數啟用,且被描述為免訓練;對於通常需要微調才能具備的能力而言,這並不尋常。有兩項注意事項已載明於文件中,而非留待使用者自行發現:一項是影格上限,除非在匯入公用程式之前調高某個常數,否則它會默默截斷長影片;另一項是將非拉丁字幕算繪至雙工影片時所需的 CJK 字型要求。
這一切都不會改變的是,負責執行非同步委派的元件——也就是這套架構最具特色的部分——它所稱的 harness,存在於另一個 GitHub 儲存庫中,文件記錄遠比模型少得多,也是最難判斷其是否已具備正式上線成熟度的部分。在實際部署中,委派這條路徑不過是藏在對話式前端背後的普通文字推論。OrcaRouter 既不提供 Realtime-Venus,也不提供 Sesame Preview;這兩層語音都不在我們的服務範圍內,我們直接說明這一點,而不是暗示一種並不存在的託管關係。用一把金鑰即可取用近 200 個文字模型,依供應商定價、不加價,正是這套架構中我們確實涵蓋的那一半,並具備自動容錯移轉,讓被委派的任務能挺過上游中斷、可將多個模型組合成單次呼叫的路由 DSL,以及當單一模型的判斷不足時所採用的模型融合。這是整套設計中可購買的部分,而其中真正有趣的部分則是非賣品。

誠實的建議
如果你是消費者,想要目前市面上聽起來最自然的對話語音,又不需要將它整合進去,Sesame Preview 是免費的,兩大行動平台都有,而且它的口碑名副其實,評論者一再這麼說。儘管使用,好好享受吧。
如果你是需要一套可檢查、可微調的開放影音全雙工堆疊的研究人員或資源充足的工程團隊,Realtime-Venus 是極少數真正可行的選項之一;而它的基準測試是自我報告的這一點,並不會改變其權重確實開放、架構確實有完整文件記載的事實。
如果你是一個產品團隊,正在尋找一套能在本季推出的語音層,那麼這兩者都不是你的答案,而這組配對真正有用的啟示,就在於其原因。一家實驗室打造了卓越的東西,卻把好的部分保持封閉;另一家則公開了一切,讓你自行提供基礎設施。這個品類已經證明它能做出值得聆聽的語音,卻尚未決定這種語音是否應該以應用程式以外的任何形式供人購買。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
