
Gemini 3.8 TTS 對比 Sesame Preview:其中一個是下載項目,另一個是應用程式
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
搜尋Gemini 3.8 Flash TTS與Sesame Preview的比較,你會發現有大量文章把它們當成同一類別的兩款產品。它們並不是,而這個差異並非只是技術細節。Gemini 3.8 Flash TTS 是一個 API 端點:它有模型識別碼、公開的價目表、在 Artificial Analysis Provider Voice Arena 上排名第 2 的排行榜名次,Elo 為 1,260,涵蓋 1,999 個樣本,以及有文件記載的請求格式。Sesame Preview 是一款免費的消費級語音助理應用程式,具有具名代理、多輪對話與 30 分鐘通話上限。它沒有 API、沒有模型 ID、沒有計費方案,在該排行榜上也沒有分數。
你真正能拿來開發的 Sesame 成品又是另一回事:CSM-1B,這是 Hugging Face 上一個 Apache 2.0 授權的檢查點,使用 Llama 主幹與 Mimi 音訊解碼器從文字生成音訊碼。它並不是人們在描述這款應用聽起來有多像真人時所談論的那個聲音。所以這場比較歸結為一個可以回答的問題:你想要租用語音模型,還是想要下載一個?

有兩樣東西都叫 Sesame,而其中只有一個是可建置的
命名是大部分混淆的根源,所以在繼續往下之前,先把它分開。
• Sesame Preview — 這個應用程式。免費使用,代理名為 Maya、Miles、Simone 和 Charlie,具備多輪對話,且上下文會跨輪次持續保留;功能包括網路搜尋與提醒;僅支援英文;通話上限為 30 分鐘。沒有開發者介面:沒有可驗證的對象、沒有可計量的項目,也沒有可呼叫的端點。
• CSM-1B — 檢查點。以 Apache 2.0 授權發布於 Hugging Face,位於 sesame/csm-1b 之下,採用 Llama 主幹與一個較小的解碼器來產生 Mimi 音訊碼。約 20 億參數、英文、F32 權重,並可透過 Hugging Face Transformers 執行。模型卡記載 1B 變體於 2025 年 3 月推出,原生 Transformers 支援則於 2025 年 5 月到來。
那兩者同屬一間公司,也有共同的研發淵源,而彼此的關係大概也就僅止於此。應用程式是產品;檢查點則是其前導研究留下的產物。讚賞這款應用程式對話記憶的評論者,描述的是一個以語音模型為核心、外圍具備檢索與狀態管理的系統,而不是你可以下載的 2B 檢查點本身的特性。
檢查點裡實際上包含什麼?
CSM-1B 是一款文字轉語音模型,就架構意義而言,這對任何打算執行它的人來說都很重要:它接收文字與音訊脈絡作為輸入,並輸出 RVQ 音訊碼,再由解碼器轉換成波形。以下是模型卡中的實用重點:
• 授權條款 — Apache 2.0。這是本頁最具關鍵影響力的一行。不同於僅限研究用途的權重授權條款,Apache 2.0 允許商業使用,且無需另行簽訂協議,這讓 CSM-1B 成為少數真正可用的開放語音檢查點之一。
• 大小 — 在 F32 下約 2B 參數。大到任何並行處理都需要真正的硬體,小到能在單一加速器上進行開發。
• 語言 — 英文,依卡片所示。並非多語言模型。
• 成長動能——截至撰寫本文時,過去一個月有 141,461 次下載,而該儲存庫約有 245,000 個讚。以開放語音模型的標準而言,這是個被廣泛使用的檢查點,也是最有力的論據,證明該產物擁有獨立於該應用程式媒體報導的真實使用者基礎。

這張卡沒有提供給你的,是任何能拿來與其他東西比較的品質宣稱。沒有 arena 排名列,沒有由第三方重現的廠商基準測試,也沒有已發表的評估說明該檢查點的輸出與應用程式的輸出有何關聯。任何告訴你這個可下載模型聽起來像那個應用程式的人,都只是從名稱推斷出來的。
為什麼沒有頭對頭比較,以及為什麼那並非研究缺口
排行榜上沒有 Gemini 3.8 TTS 與 Sesame Preview 的比較,因為這種比較根本不可能存在。這個競技場是透過讓聆聽者比較由代管端點產生的音訊片段來為模型排名。這組配對中的一方沒有端點,因此無法被列入。
這一點值得精確說明,因為「不存在頭對頭比較」常被寫得像是資料缺失了一樣。資料並非缺失,而是未定義。被比較的這兩者並不共享一個可量測的表面:
• Gemini 3.8 Flash TTS 的分數是依據其原生託管語音評定。Sesame Preview 在那層意義上並沒有原生語音可供評分——它有的是代理。
• Gemini 3.8 Flash TTS 以 token 為單位公布費率表。Sesame Preview 免費,且什麼都不公布,因為沒東西可計費。
• Gemini 3.8 Flash TTS 接收腳本並傳回音訊。Sesame Preview 接收對話並傳回對話,並附帶應用程式在其上疊加的任何檢索與記憶功能。
最接近正當比較的,莫過於 Gemini 3.8 Flash TTS 與 CSM-1B 之間的對照,但即便是這組比較也不對等:一方有獨立的 Elo 評分和廠商費率表,另一方兩者皆無。真正可比的是承諾的形態——按用量計費的 API 對上可下載的檢查點——而這種比較並不需要排行榜。
這是這個東西唯一有數字的一面
這個組合中所有量化的部分都落在 Google 那一方,而這本身就是重點。
在 2026 年 9 月 24 日擷取的 Artificial Analysis Provider Voice Arena 上,Gemini 3.8 Flash TTS 排名第 2,Elo 為 1,260,涵蓋 1,999 個樣本與 8 種競技場語音,於 2026 年 9 月 23 日發布。其同系列產品 Gemini 3.8 Flash-Lite TTS 則以 1,235 排名第 6。Google 對 Flash TTS 的收費為:輸入每百萬個文字 token 0.50 美元,輸出每百萬個音訊 token 9.00 美元,此價格至 2026 年 12 月 31 日止,之後為 18.00 美元;Flash-Lite TTS 則為 0.50 美元與 6.00 美元,之後為 12.00 美元;Artificial Analysis 將這些標準化為每百萬字元 16.50 美元與 11.00 美元,以便它們能與以其他單位計費的模型共用同一個排行榜。該標準化是排行榜的計算,並非 Google 的報價。
相較之下,CSM-1B 沒有價格,因為它沒有計量機制。它有的是下載次數、授權條款和參數量。如果你的決策框架需要一個 Elo 評分,這項比較不會為 Sesame 這一方提供這種分數;而誠實的結論是:這兩個選項是在不同的標準下被評估,而不是其中一個尚未經過驗證。

如果你想要的是 App 體驗
許多搜尋這項比較的人,根本不是在做模型選擇。他們用過 Sesame 應用程式,喜歡那種對話感受,並希望自己的產品也能有那樣的體驗。那是另一個問題,而下載並無法解決它。
讓這個應用程式給人這種感覺的,主要不是語音模型。跨回合的持續性上下文、在對話中途決定要搜尋網路、代理何時開口的時機——那些都是編排,而它們沒有一項存在於 2B 檢查點裡。下載 CSM-1B 會給你一副聲音。在它之上建構這個應用程式的行為,是你的工程工作,而 30 分鐘的通話上限與 API 的缺席,意味著你也無法租到完成的版本。
如果你想要的是可呼叫的語音模型,誠實的答案是:Gemini 3.8 Flash TTS 是具備文件化介面、已公開定價、獨立評分,且能在單一請求中進行雙講者對話的選項。如果你想要的是能保留的權重,那麼在 Apache 2.0 下的 CSM-1B 才是這兩者中你真正能持有的那一個——而取捨在於,硬體、服務堆疊以及所有品質保證,都得由你自己提供。
OrcaRouter 這兩者都不代管。Google 的模型是透過 Google 自家的 API,以及其 9 月 23 日公告中所指名的那些介面來呼叫;CSM-1B 則是你自己執行的檢查點。OrcaRouter 要做的,是這個選擇之上的那一層:200 多款模型只要一組金鑰就能取用,價格即供應商牌價、不加收費用,因此廠商調整費率當天就同步生效,自動容錯移轉讓實驗性路徑不至於成為正式環境的相依項目,還有一套路由 DSL,能在單一聲音不足以承擔全部工作時,把多個模型組合成一次呼叫。
簡而言之,這個比較其實稱不上是比較。一邊有價目表和 Elo;另一邊有授權和下載次數。選那個你真的填得出來的欄位吧。
