Google的快速、成本效益高的文字轉語音模型,用於即時音訊生成,通過OrcaRouter存取。
google/gemini-3.1-flash-tts-preview 是 Google 推出的文字轉語音模型,屬於 Gemini Flash 系列。它能接受文字輸入,並生成語音音訊輸出。該模型針對速度與成本進行了最佳化,適合即時應用場景。目前處於預覽階段,表示開發仍在進行中,可用性可能有所變更。透過 OrcaRouter 的 OpenAI 相容 API 存取時,模型 ID…
主要功能是將書面文字轉換為自然流暢的語音。此模型專為速度設計,採用Flash架構以降低延遲。它支援多種語言和語音?此特定預覽版的語言與語音支援細節未在提供的資訊中說明;請查閱Google文件以取得最新的語音選項。該模型能處理多種文字輸入,包括標點符號、數字與縮寫,所產生的語音輸出能反映預期的節奏與語調。
最佳使用案例包括任何對低延遲語音生成至關重要的應用:即時語音助手、即時翻譯配音、具有語音輸出的互動式聊天機器人,以及自動電話系統。它在需要快速生成大量簡短音訊片段的批次處理方面也表現出色。內容創作者可用於電玩遊戲或有聲書中的動態配音。由於輸出成本相對於輸入較高,當輸出音訊簡潔時最為經濟。
如果您的使用場景涉及極長的音訊生成(例如數小時的語音)或不需要低延遲,請考慮使用每Token輸出成本較低的批次化TTS模型。對於輸入量佔主導的應用(例如大量短提示),這種Flash模型的低成本輸入使其極具吸引力。若需要極高的輸出品質——例如情感豐富的角色配音——您可能需要評估來自Google或其他供應商的高階TTS模型。請務必持續監控Token總量與延遲需求。
作為Gemini Flash模型,此TTS變體已針對低延遲進行最佳化。可用事實中未提供具體的延遲基準(例如第一個音頻封包的時間)。實際上,Flash模型通常會在數百毫秒內回應短輸入。延遲可能因輸出長度、網路狀況和並發請求負載而異。OrcaRouter的路由可能會增加極小的開銷。對於即時應用,請使用預期的音頻持續時間在負載下進行測試。
優勢包括低輸入成本($1.00/1M tokens)、快速生成,以及 Google 強大的基礎設施。預覽狀態意味著模型品質和可用性可能會有變動。一個限制是相較於文字模型,其輸出成本較高($20.00/1M tokens)。此外,輸出音訊品質——如自然度、口音多樣性及語調——並未在此基準測試中評估。在正式部署前,您應針對特定領域(例如專業術語、情緒範圍)評估模型的語音品質。
在現有事實中未提供 google/gemini-3.1-flash-tts-preview 的基準測試分數。TTS 模型通常以自然度的平均意見分數(MOS)、可懂度的字詞錯誤率(WER)以及延遲百分位數等指標進行評估。缺乏具體數值時,你應自行使用代表性提示進行評估,以衡量其品質與速度是否符合你的需求。OrcaRouter 不會增加或修改模型效能。
可用資訊未指明此 TTS 預覽支援的語言或口音功能。Google 的廣義 TTS 模型通常支援多種語言,但此特定版本的涵蓋範圍未知。你應使用多語言文字測試以確認輸出品質。對英語而言,考量到 Google 的投入,效能很可能穩健。對較不常見的語言,建議直接聯絡 Google,或透過 OrcaRouter 的 API 以範例文字進行測試。
定價依循 Google 官方費率,OrcaRouter 不額外加價。輸入代幣(文字)每 100 萬個代幣收費 $1.00 美元。輸出代幣(音訊)每 100 萬個代幣收費 $20.00 美元。輸出代幣按音訊單位產生,確切的代幣與時間比例未指定。每個請求中使用的輸入與輸出代幣均需計費。無額外平台費用或最低消費要求。結帳透過 OrcaRouter 現有的付款方式進行。
輸入令牌比輸出令牌便宜20倍。這鼓勵在令牌限制內發送較長的文字提示,以生成比例更長的音訊輸出,因為輸入成本仍然很低。例如,生成1分鐘的音訊片段可能消耗大量輸出令牌(每100萬個$20),而文字提示可能只需幾分錢。盡可能保持輸出簡潔以優化成本。如果您的用例生成非常長的音訊,每個請求的輸出成本可能會迅速增加。
目前已掌握的事實並未提及 OrcaRouter 上此模型有任何快取或折扣方案。OrcaRouter 的定價策略為依供應商費率直接轉嫁。建議您向 OrcaRouter 查詢是否有任何適用於跨型號的批量折扣選項或保留容量。由於輸出 token 成本高昂,快取已產生的音訊片段供重複使用(例如常見回應)可以大幅降低總支出。
未直接提供比較。然而,Google Flash TTS 定位為低成本輸入、適合即時使用的具成本效益方案。其他 TTS 模型(例如 OpenAI TTS、ElevenLabs)可能有不同的定價結構,通常按字元或音頻秒數計費。此模型按 token 輸出計價,對於極長音頻可能較貴,但對於短暫、突發性生成則較便宜。請根據 OrcaRouter 目錄中的其他服務評估您預期的 token 量。
使用任何 OpenAI 相容的用戶端。將 base URL 設為 https://api.orcarouter.ai/v1,API key 來自您的 OrcaRouter 帳戶,並將模型 ID 設為 "google/gemini-3.1-flash-tts-preview"。發送一個包含需要朗讀的文字的用戶訊息聊天補全請求。回應將包含音訊內容(可能以 base64 編碼的區塊或 URL 形式)。確切的輸出格式取決於 Google 的模型實作。請參閱 OrcaRouter 的文件以了解串流支援和回應解析。
標準的聊天完成參數適用:模型、訊息(包含角色與內容),以及可選的 temperature 或 top_p 用於輸出變異性(但與 TTS 較不相關)。對於語音選擇,Google 的模型可能支援一個額外參數(例如,語音名稱)。現有資訊並未列出特定的 TTS 參數。您可能需要在請求正文中傳遞額外的欄位,例如 "voice" 或 "language"。請查閱 Google 的 API 文件,以了解預覽模型的確切選項。
TTS 模型通常支援串流音訊,即音訊片段在生成時即時發送。提供的資訊並未確認此預覽模型是否支援串流。如果啟用串流,您可以在 API 請求中將 stream 參數設為 true,並在收到片段時進行處理。OrcaRouter 支援相容模型的串流功能。請透過簡單請求測試,確認音訊是逐步回傳還是以完整區塊形式回傳。
如果你已經在使用與 OpenAI 相容的 API,請將基礎 URL 更改為 https://api.orcarouter.ai/v1 並更新模型 ID。更新你的請求參數以符合 Google 的 TTS 規格(例如語音名稱)。如果音頻格式不同(例如 MP3 與 WAV),你可能需要調整音頻輸出處理。使用範例提示詞進行測試以驗證品質。由於定價為零加成,你的成本可能會根據 token 使用量而變化。無需特殊的遷移工具。
OpenAI 提供 TTS 模型(tts-1、tts-1-hd),按字數計價(約每 1k 字 $0.015)。相比之下,Google 的模型採用基於 token 的計價方式,對於短輸入可能更經濟,但對於長輸出則較貴。OpenAI 的 TTS 支援多種語音和語言;Google 預覽版的具體細節尚未完全公開。延遲方面:Flash 和 OpenAI 的模型都設計為低延遲。品質則較為主觀,您應用自己的內容進行測試,以比較自然度和韻律。
Google也透過其Cloud Text-to-Speech API提供高階TTS模型(例如WaveNet、Studio)。這些模型通常按傳送的文字字元數收費,對於非常長的音訊可能更便宜,但每次請求的成本較高。Flash TTS速度更快,且輸入計價較簡單(按token計費),但可選語音較少。對於高保真、情感豐富的語音,高階模型可能更適合。若追求速度和較低的輸入成本,則Flash變體更具優勢。
如果您的需求是即時回應且輸入文字較短(許多小型請求),此 Flash 模型的低輸入成本與快速生成會非常理想。對於非常長的音訊生成(例如完整的有聲書),按輸入字元計費的模型(如 Google 的標準 TTS)可能更便宜,因為避免了輸出 token 成本。此外,還需考慮聲音多樣性與語言支援:如果您需要多種不同的聲音,請檢查此預覽版是否支援。在正式採用前,請先用您的工作負載測試這兩種選項。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1voice| 輸入 / 1M tokens | $1.00 |
| 輸出 / 1M tokens | $20.00 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview