Google Gemini 2.5 Pro preview 含 TTS,通過 OrcaRouter 以零加成存取。
google/gemini-2.5-pro-preview-tts 是 Google 推出的一款預覽版文字轉語音模型,基於 Gemini 2.5 Pro 基礎架構建。它能將文字輸入轉換為語音音頻輸出。此模型透過 OrcaRouter 的 OpenAI 相容 API 存取,使用模型 ID 'google/gemini-2.5-pro-preview-tts',基礎 URL 為…
google/gemini-2.5-pro-preview-tts 的主要功能是將書面文字轉換為語音音訊。該模型基於 Google 的 Gemini 2.5 Pro 構建,具備強大的語言理解能力,因此能產生自然的語句、恰當的語調以及清晰的發音。此模型僅接受文字輸入,因此在輸入端不具多模態能力,無法處理音訊輸入、圖片或影片。輸出可能是標準數位格式的音訊。作為 TTS 模型,它可支援多種語言,但此預覽版尚未公開具體支援哪些語言。該模型最佳化於語音生成,而非 Gemini 2.5 Pro 的其他功能(如推理或程式碼生成)。
此模型在需要將書面文字轉換為自然語音的應用中表現優異。最佳使用場景包括語音助手(由助手朗讀回應)、自動化有聲書與播客旁白、為視障使用者讀取螢幕文字的無障礙功能,以及提供語音回覆的客服系統。它也可用於語言學習應用(模擬正確發音),或從RSS訂閱源或文章生成語音內容。由於其處於預覽狀態,建議在投入大規模部署前,針對特定語言、領域或風格需求充分測試。
雖然 google/gemini-2.5-pro-preview-tts 提供優質的 TTS 品質,但對於簡單的嗶嗶聲或通知音效,或是對於低延遲至關重要、但模型處理時間比專用 TTS 晶片更長的應用來說,可能過於龐大。如果你只需要基本的、單調的語音,或者有極高的用量且預算嚴格受限,那麼使用 OrcaRouter 上其他供應商提供的每字符成本較低的輕量級 TTS 模型可能更為合適。此外,如果你的使用案例需要極低延遲的即時串流,請評估 Gemini 的預覽模型是否符合你的速度要求,因為較大的模型可能導致較高的首字符延遲。
截至該模型的預覽版發布,Google尚未公布gemini-2.5-pro-preview-tts變體的具體基準測試分數。底層的Gemini 2.5 Pro基礎模型在語言理解和推理任務上展現了強勁性能,但TTS變體的語音品質指標(例如平均意見分數、詞錯誤率)尚未公開分享。在缺乏官方基準的情況下,OrcaRouter建議使用您自己的文本輸入測試集來評估該模型,測量主觀音頻品質、延遲和負載下的可靠性。對於生產環境的決策,請自行與其他TTS服務進行A/B比較。
關於 google/gemini-2.5-pro-preview-tts 的具體延遲數據尚未公開揭露。作為一款基於大型語言模型架構的 TTS 模型,其延遲可能會高於針對即時串流最佳化的專門神經網路 TTS 模型。影響速度的因素包括輸入文字長度、模型內部處理時間以及與 OrcaRouter 端點之間的網路往返時間。對於低延遲至關重要的應用(例如對話式 AI),請使用典型輸入長度測試此模型,以評估其適用性。如果 API 支援,可考慮使用串流或分段文字生成來降低延遲。
優勢:基於 Google 先進的 Gemini 2.5 Pro 架構構建,它可能產生高度自然、富有表現力的語音,具有良好的韻律和發音。透過 OrcaRouter 的 OpenAI 相容 API 存取簡化了整合。提供者定價無加價,使其成本可預測。 限制:輸入模式僅限文字;無法處理音訊或其他模式。作為預覽版,可能存在未發現的邊緣情況或品質不一致。上下文視窗大小未知,限制了單次請求中可轉換的文字長度。未提供輸出格式細節。它不適用於語音辨識或語音克隆等任務。
google/gemini-2.5-pro-preview-tts 的定價基於 token 用量,每 100 萬個輸入 token 收費 $1.00,每 100 萬個輸出 token 收費 $20.00。輸入 token 包括文字提示和任何指令。輸出 token 代表生成的音訊。OrcaRouter 以供應商的確切費率計費,不收取任何加成,這意味著您只需支付 Google 收取的費用,再加上任何適用的稅金。沒有最低承諾消費或月費。用量按每次請求計算,並彙總在您的 OrcaRouter 帳單上。由於 TTS 輸出 token 數量可能很高(音訊的 token 密度高於文字),因此輸出成本是主要支出。
輸出令牌的價格(每1M $20)明顯高於輸入令牌(每1M $1)。這對於生成式模型來說是典型的,因為輸出令牌需要更多的計算資源。對於文字轉語音,音頻輸出被表示為一串令牌,而將文字轉換為語音涉及生成一長串音頻令牌。特定任務的總成本取決於輸出音頻相對於輸入文字的長度。如果需要生成較長的語音段落(例如完整的有聲書),成本可能會累積。對於簡短的提示(例如單個句子),成本則很低。請監控您的令牌使用情況以預測成本。
不,OrcaRouter 並未對 google/gemini-2.5-pro-preview-tts 的供應商費率添加任何加成。所列出的價格——每百萬輸入代幣 $1.00 美元,每百萬輸出代幣 $20.00 美元——正是 Google 收取的費用。OrcaRouter 直接將這些費用傳遞給你。這與 OrcaRouter 對許多模型的定價模式一致,平台扮演透明代理的角色。你只需為你所消耗的代幣付費。任何可選功能,例如快取或高級支援,可能會產生單獨的費用,但基礎的每代幣成本並無加成。
要使用 google/gemini-2.5-pro-preview-tts,請向 OrcaRouter 的與 OpenAI 相容 API 發出請求,基礎 URL 為 https://api.orcarouter.ai/v1。在 API 呼叫中使用模型 ID「google/gemini-2.5-pro-preview-tts」。請求格式遵循標準的 OpenAI 聊天完成結構,包含「model」欄位、包含文字提示的「messages」陣列(可包含 system 和/或 user 角色),以及標準參數如 temperature 和 max_tokens。回應將包含生成的音訊 token,您的客戶端可將其解碼為語音播放。驗證透過 OrcaRouter 提供的 API 金鑰進行。
API 支援標準的 OpenAI 相容參數,包括 'model'、'messages'(包含角色和內容的物件陣列)、'temperature'(用於控制音訊輸出的變異性)、'max_tokens'(用於限制生成音訊的長度)以及 'top_p'。作為 TTS 模型,可能有其他用於語音風格或速度的參數,但這些在現有事實中尚無文件記錄。請參閱 OrcaRouter 的 API 文件以取得最新支援的欄位。'response_format' 參數可能允許指定音訊編碼(例如 wav 或 mp3)。如果預設不支援,您可能需要解碼返回的權杖串流。
如果您目前使用不同的 TTS 服務(例如 Google Cloud Text-to-Speech、Amazon Polly),透過 OrcaRouter 遷移至 google/gemini-2.5-pro-preview-tts 需要更新您的 API 端點和請求格式。OrcaRouter 使用 OpenAI 相容端點,因此您將從特定提供者的 SDK 切換至與 OpenAI 相容的 SDK。將您現有的基礎 URL 替換為 https://api.orcarouter.ai/v1,使用模型 ID 'google/gemini-2.5-pro-preview-tts',並調整您的請求主體以符合聊天完成架構。您可能需要修改處理回應的方式:不再直接接收音訊檔案,而是獲得需要解碼的標記化輸出。使用樣本輸入進行測試。
認證是透過在 Authorization 標頭中包含 API 金鑰來完成(格式:Bearer YOUR_API_KEY)。您可以從 OrcaRouter 帳戶獲取 API 金鑰。速率限制由 OrcaRouter 根據您的方案設定,與 Google 的限制不同。若需大量使用,請聯絡 OrcaRouter 以調整限制。預覽模型可能有來自 Google 的額外限制——如果您遇到「模型不可用」等錯誤,請確認您的 OrcaRouter 方案包含此模型。此模型沒有公開的特定速率限制,但建議遵循標準最佳實踐(使用指數退避重試)。
google/gemini-2.5-pro-preview-tts 是 Gemini 2.5 Pro 系列中专為文字轉語音設計的變體版本。其他 Gemini 2.5 Pro 模型為通用型,可處理文字、圖像、音訊及影片輸入,但本身不會原生產生語音輸出。此 TTS 變體移除了多模態輸入功能,專注於從文字生成音訊。它可能使用相同的底層語言理解能力來處理語調和節奏,但不適合用於推理、撰寫程式碼或多模態分析。若需在保留多模態輸入的同時使用 TTS 功能,可將標準 Gemini 模型與獨立的 TTS 流程結合。預覽版 TTS 提供了更精簡的流程。
OrcaRouter 提供來自多家供應商的 TTS 模型。此款 Google 模型基於大型語言模型架構,相較於傳統的串接式或參數化 TTS 系統,可能產生更自然且更具上下文意識的語音。然而,相較於專為低延遲與高吞吐量設計的神經 TTS 模型,其逐 token 的運作速度可能較慢、成本也較高。許多常見的 TTS 服務是按字符或按音頻秒數計費,而非按 token 計費,因此直接比較成本較為困難。對於需要極低成本的生產部署來說,專用 TTS 模型可能更為合適。Google 模型最適合用於高輸出品質足以證明較高輸出 token 成本合理的使用場景。
如果您需要來自 Google 最新 Gemini 架構的頂尖語音品質,並希望透過標準 OpenAI 相容 API 使用而無需管理 Google Cloud 憑證,請選擇此模型。零加價定價確保了透明度。它非常適合自然度至關重要的應用,例如對話式 AI 或敘事內容。預覽狀態允許早期實驗,以評估其在您領域的品質。然而,如果您需要低於 100 毫秒延遲的即時串流,專用的串流 TTS 模型可能更合適。此外,如果您的預算敏感,請測試典型使用案例的輸出 Token 消耗量,以確保成本可接受。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1voice| 輸入 / 1M tokens | $1.00 |
| 輸出 / 1M tokens | $20.00 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts