主視覺標題卡,標題為「Realtime-Venus vs Sesame Preview」,副標題為「兩間實驗室,同一個陷阱,相反的方向」,並有三張卡片寫著「Sesame Preview:免費應用程式、四個代理,自 2026 年 5 月起不再提供 API」、「Realtime-Venus:Apache-2.0 權重,沒有產品,沒有發布公告」,以及「兩者皆未公布經獨立驗證的語音評分」,卡片下方是一條頁尾橫幅,寫著「Sesame 的功能依據其自家行動預覽文件;Realtime-Venus 的數據來自其技術報告,未經重現。」OrcaRouter 標誌合成於右下角。
Guides & Insights

Realtime-Venus 對比 Sesame Preview:你能得到的,並非好的那一個

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Realtime-Venus 與 Sesame Preview 出自理念截然不同的實驗室,雙方對於語音模型的用途抱持完全相反的想法,卻從相反的方向跌進了同一個陷阱。Sesame Preview 是一款免費的消費級應用程式——iOS 版自 2026 年 5 月起推出,Android 版自八月初起推出——內建四個對話代理人、通話期間的即時網路搜尋,以及被評論者譽為同類最佳的語音。Sesame 所發布的開放權重則是另一個更小的模型,該公司本身也並未把它當成你在示範中聽到的那個語音來呈現。Realtime-Venus 是螞蟻集團 Venus 團隊與清華大學合作開發的 9B 全雙工系統,它走的是另一條路:可下載的成品就是本尊,而且根本沒有產品。無論是哪一種情況,在規劃任何與之相關的事情之前,最值得先弄懂的,就是「可取得的東西」與「令人驚豔的東西」之間的落差。

每一個實際上是什麼

A screenshot of the Sesame mobile preview page, captured 18 September 2026, showing the header navigation with Blog, Team, Mobile Preview and Research Preview, the headline 'Personal agents for curious people', the line 'Preview available now on iOS and Android', and both the App Store and Google Play download badges.

Sesame Preview 是一款產品。Sesame 是舊金山的一間實驗室,由 Brendan Iribe、Ankit Kumar 和 Ryan Brown 於 2023 年創立,並獲得 a16z、Sequoia、Spark 和 Matrix 投資;其消費級語音助理推出四種人格——Maya、Miles、Simone 和 Charlie——各自擁有獨特的性情與聲音。這個代理能在對話過程中搜尋網路、記筆記和設定提醒,並在通話結束後發送摘要。記憶是依各代理分別儲存的,當你登入後會在網頁與行動裝置之間同步;另有一種無痕模式,可讀取過去的記憶而不寫入新的記憶。它免費、不投放廣告,而公司也表示不會出售資料。

Realtime-Venus 是一項研究性質的發布。Hugging Face 上有兩個採用 Apache-2.0 授權的 9B 檢查點——Realtime-Venus-Omni 用於音訊視覺互動,Realtime-Venus-Audio 用於口語互動——外加一份於 2026 年 9 月 12 日提交至 arXiv 的技術報告、一個專案頁面,以及一個包含 Realtime-Venus-Harness 元件的隨附儲存庫。沒有應用程式、沒有 API、沒有價格,也沒有來自供應商的公告。該儲存庫未由任何推論供應商部署,且下載量未受追蹤。

陷阱,雙向皆然

Sesame 的版本是經典的「開放洗白」樣態,而 Sesame 對此比大多數公司都更誠實。該實驗室在 Apache-2.0 下釋出的 CSM 檢查點是一個基礎語音生成模型——由 Llama 主幹饋入 Mimi-codec 解碼器——而文件明確指出,它不是該應用程式的聲音,也不是端到端語音轉語音系統。它無法生成文字,且主要用英語資料訓練,在英語之外的能耐有限。驅動 Sesame Preview 的,是一個尚未釋出的更大規模正式生產模型。所以,如果你去尋找 demo 裡的聲音,你找到的是它的研究血統,而不是那個東西本身。當四個代理之一接聽你的通話時,你聽到的是某個你無法下載的東西。

Realtime-Venus 的版本是鏡像,而且可以說是更奇怪的那一個。所有發佈的內容都是真的:真實的權重、真實的程式碼、真實的報告、寬鬆的授權條款。所缺的是任何不必擁有 GPU 就能使用它的方法。兩個 BF16 的 9B 檢查點,各自約有十八 GB 的權重,這還不計入活化記憶體,而且兩者都設計成要搭配即時音訊與視訊輸入,執行連續的一秒串流迴圈。那是伺服器等級的部署。一個把相同能力送到手機上的消費級應用程式,正是在做這個發行版本沒有嘗試的事,而下載得到的模型與跑得起來的模型之間的落差,正是大多數想要它的人會卡住的地方。

可衡量性才是更鮮明的差異

兩個模型都沒有獨立的語音品質分數,但原因不同。

• Sesame Preview — 沒有競技場參賽紀錄,也沒有對正式版語音的公開評測。它的聲譽建立在評論者身上,以及原始示範對聽眾所產生的效果上;這算得上是某種真實證據,卻完全未經量化。

• {{1}}CSM-1B{{/1}} — 這個開放檢查點是一個基礎生成模型;它並未與對話系統進行基準比較,因為它本身並不是對話系統。

• Realtime-Venus — 一項自行報告的語音數據,VoiceBench AlpacaEval 分數為 4.81,其報告稱此分數與最佳比較數值相符。尚無第三方對其進行評估。

• 兩者都給不了你的——一個由對結果毫無利害關係的人所產出的數字。如果語音品質是你的購買準則,那麼整個比較就無法評分,而誠實的做法是親自聽聽這兩者,自己決定,而不是聽從一張表格。

輪流上陣,雙方都有必須證明自己的地方

Sesame 的聲譽正是建立在此。讓這間實驗室聲名大噪的那段示範,是一副帶著呼吸、猶豫與打斷時機的嗓音,逼真到讓聽眾以為話筒另一端是個真人。那是一項關於對話動態的主張,而這也正是這款產品所主打的賣點。

Realtime-Venus 也提出相同的說法,還附上數字。在 Full-Duplex-Bench v1.5 上,其音訊檢查點回報能回應 75% 的使用者打斷,延續率在附和訊號下為 97%、在對他人說話下為 88%、在背景語音下為 86%——並宣稱在三項延續指標上全都超越 Gemini 3.1 Live 與 GPT-4o。那些數字來自它自己的報告,而沒有人重現過。

所以這個比較,是拿一個沒有數字的示範去比一個沒有示範的數字,這確實是種很尷尬的處境,也貼切描述了這整個類別目前是如何自我報導的。唯一有把握能說的是,兩種說法都還沒經過外部第三方檢驗,而後門管道下 97% 的續留率高得足以在被引用為定論之前,先接受一次那樣的檢驗。

A two-column comparison scoreboard titled 'Realtime-Venus vs Sesame Preview — the scoreboard'. The left column, labelled Realtime-Venus, reads 'What it is: research release, Apache-2.0 weights', 'Product: none', 'Agents or voices: one reference voice', 'Languages: English and Chinese', 'Independent voice score: none', 'Runs on: a GPU node you own'. The right column, labelled Sesame Preview, reads 'What it is: free consumer app, closed production voice', 'Product: iOS since May 2026, Android since early August', 'Agents or voices: Maya, Miles, Simone, Charlie', 'Languages: English only', 'Independent voice score: none', 'Runs on: your phone'. The footer reads 'Sesame capabilities per its own mobile preview documentation; Realtime-Venus figures from its technical report, unreproduced.'

你實際上能打造什麼

Sesame Preview 對開發者毫無幫助。它沒有 API、沒有模型識別碼、沒有費率表,也沒有任何表明要提供這些的計畫。登入時通話上限為三十分鐘,未登入則為五分鐘;英文是唯一官方支援的語言;而這個代理會研究並記住資訊,但不會執行任務——它不會預訂航班。免費方案就是產品本身。這對消費者來說是再好不過的方案,對整合而言卻是死路一條。

Realtime-Venus 為建構者備妥了一切,唯獨沒有提供可執行它的環境。權重以寬鬆授權釋出,程式碼可用標準 Transformers 呼叫載入,只需切換一個方法即可進入全雙工串流,而文件所述的迴圈是先進行一秒的串流預填充,接著進行串流生成,如此反覆。長影片記憶透過 memory-minutes 參數啟用,且被描述為免訓練;對於通常需要微調才能具備的能力而言,這並不尋常。有兩項注意事項已載明於文件中,而非留待使用者自行發現:一項是影格上限,除非在匯入公用程式之前調高某個常數,否則它會默默截斷長影片;另一項是將非拉丁字幕算繪至雙工影片時所需的 CJK 字型要求。

這一切都不會改變的是,負責執行非同步委派的元件——也就是這套架構最具特色的部分——它所稱的 harness,存在於另一個 GitHub 儲存庫中,文件記錄遠比模型少得多,也是最難判斷其是否已具備正式上線成熟度的部分。在實際部署中,委派這條路徑不過是藏在對話式前端背後的普通文字推論。OrcaRouter 既不提供 Realtime-Venus,也不提供 Sesame Preview;這兩層語音都不在我們的服務範圍內,我們直接說明這一點,而不是暗示一種並不存在的託管關係。用一把金鑰即可取用近 200 個文字模型,依供應商定價、不加價,正是這套架構中我們確實涵蓋的那一半,並具備自動容錯移轉,讓被委派的任務能挺過上游中斷、可將多個模型組合成單次呼叫的路由 DSL,以及當單一模型的判斷不足時所採用的模型融合。這是整套設計中可購買的部分,而其中真正有趣的部分則是非賣品。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge with the Any-to-Any, Transformers, Safetensors, audio, video, speech and streaming tags, and a side panel stating 'This model isn't deployed by any Inference Provider.'

誠實的建議

如果你是消費者,想要目前市面上聽起來最自然的對話語音,又不需要將它整合進去,Sesame Preview 是免費的,兩大行動平台都有,而且它的口碑名副其實,評論者一再這麼說。儘管使用,好好享受吧。

如果你是需要一套可檢查、可微調的開放影音全雙工堆疊的研究人員或資源充足的工程團隊,Realtime-Venus 是極少數真正可行的選項之一;而它的基準測試是自我報告的這一點,並不會改變其權重確實開放、架構確實有完整文件記載的事實。

如果你是一個產品團隊,正在尋找一套能在本季推出的語音層,那麼這兩者都不是你的答案,而這組配對真正有用的啟示,就在於其原因。一家實驗室打造了卓越的東西,卻把好的部分保持封閉;另一家則公開了一切,讓你自行提供基礎設施。這個品類已經證明它能做出值得聆聽的語音,卻尚未決定這種語音是否應該以應用程式以外的任何形式供人購買。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新