OpenAI TTS-1 HD 1106:通過 OrcaRouter 的相容 OpenAI 之 API 實現的高清晰度文字轉語音
openai/tts-1-hd-1106 模型是 OpenAI 推出的文字轉語音模型,為 2023 年 11 月發佈的高解析度版本。它能將文字轉換為自然流暢的音訊,特別注重清晰度與表現力。該模型接受文字形式的輸入,並輸出音訊令牌。定價為每 100 萬輸入令牌 30.00 美元,每 100 萬輸出令牌 30.00 美元,按提供商費率計費,經由 OrcaRouter 不加價收取。
openai/tts-1-hd-1106 模型專為高解析度音訊輸出而設計。它能生成自然流暢的語音,具有良好的韻律和情感表現。該模型支援多種語音(由 OpenAI 提供),並允許調整速度和取樣率。根據不同配置,輸出通常為 24kHz 或 48kHz 的音訊。這使其非常適合專業應用,例如媒體製作。
最佳用途包括為影片產生配音、為有聲書創建旁白、在應用程式中建構語音介面,以及為輔助技術添加語音輸出。當輸出在面向客戶的場景中被最終用戶收聽時,高畫質品質尤其有價值。對於內部測試或低保真原型,請考慮成本較低的替代方案。
如果您的使用場景不需要高保真音訊——例如簡單的提示音、非常簡短的語句或內部記錄——那麼較低成本的TTS模型可能更經濟。每100萬Token收費30美元的價格同時適用於輸入和輸出,因此生成大量簡短片段可能會快速累積成本。在進行大規模生產時,請評估您的品質需求和預算。
是的,OpenAI 為此模型提供了幾個預設語音(例如 alloy、echo、fable、onyx、nova、shimmer)。您可以透過 API 參數選擇語音。此外,您還可以調整語速(0.5倍至2.0倍)、取樣率和輸出格式。該模型不支援自訂語音克隆或微調。OrcaRouter 會將這些參數原封不動地傳遞給 OpenAI。
雖然在現有資料中未提供 openai/tts-1-hd-1106 的具體基準測試分數,但該模型被廣泛認為是 OpenAI 截至發布日期(2023 年 11 月)品質最高的 TTS 模型。在內部評估中,它在自然度與清晰度方面均名列前茅。若要了解客觀表現,請參閱 OpenAI 的文件及第三方評測。
延遲取決於輸入文字的長度與所選的音訊格式。一般而言,模型可在數秒內回傳短輸入(例如100個字元)的音訊。較長文字的回應時間可能按比例增加。OrcaRouter 不會在供應商回應時間之外增加顯著額外負擔。串流技術可降低即時應用中的感知延遲。
此模型僅限於文字轉語音,不支援語音對話或超出語音選擇所提供的情感控制。它無法生成背景音效或音樂。輸出品質可能會因不尋常的發音、同音異義詞或外來詞而下降。此外,模型有最大輸入長度限制(通常為4096個字元)。對於非常長的文字,請分段輸入。
定價為每100萬個輸入token 30.00美元,每100萬個輸出token 30.00美元。輸入token計算您提供的文字,輸出token計算生成的音頻token。兩者費率相同。不收每分鐘或每字符費用;分詞由OpenAI處理。OrcaRouter不增加任何加價,因此您只需支付OpenAI公佈的費率。
所提供的定价是通過 OrcaRouter 的標準費率。現有資料中未提及批量折扣或緩存定價。您可以通過優化輸入文字長度來降低成本——較短的提示會生成較少的輸出令牌。對於大規模使用,建議直接與 OpenAI 協商,不過 OrcaRouter 不提供單獨的定價層級。
每1M個Token的輸入和輸出均為30美元,這個模型的定價高於許多標準TTS模型。例如,OpenAI的標準tts-1模型每1M輸入和輸出均為15美元。HD版本因更高品質而收取溢價。OrcaRouter直接傳遞這些提供商的費率,不加價,因此成本差異與直接使用OpenAI相同。
零加价意味著 OrcaRouter 不會在提供者的每代幣價格之上增加任何費用。您的成本完全等於 OpenAI 的費率:每 100 萬輸入代幣 30 美元,每 100 萬輸出代幣 30 美元。沒有任何平台附加費、隱藏費用或使用門檻。僅有的收費是按已公佈的提供者價格所產生的代幣使用量。
使用與 OpenAI 相容的 API 於 https://api.orcarouter.ai/v1。將模型參數設為 "openai/tts-1-hd-1106"。以標準訊息格式提供輸入文本(例如,role: user, content: your text)。額外的 TTS 特定參數(如 voice、speed、response_format)可以包含在請求主體中。OrcaRouter 將請求轉發至 OpenAI 並返回音訊回應。請參閱 OpenAI 的 TTS API 文件以獲取完整參數詳情。
您可以設定與OpenAI TTS API相同的參數:input(字串)、model("openai/tts-1-hd-1106")、voice(從可用語音中選取的字串)、speed(數字,範圍0.5–2.0)、response_format(例如"mp3"、"opus"、"aac"、"flac"、"wav")以及sample_rate。將這些參數放入對chat/completions端點的POST請求的JSON主體中。OrcaRouter會保留所有參數,不會對其進行修改。
是的,您可以藉由在 API 請求中將 `stream` 參數設為 `true` 來使用串流功能。模型會在生成音訊區塊時即時回傳,這對於即時應用非常實用。OrcaRouter 無需額外設定即可支援串流。請確保您的客戶端能正確處理分塊回應,這符合 OpenAI 相容串流端點的標準做法。
請將您的基礎 API URL 替換為 https://api.orcarouter.ai/v1,並將模型標識符更新為 "openai/tts-1-hd-1106"。您現有的 OpenAI API 金鑰將無法使用;您需要一個 OrcaRouter API 金鑰。請求主體格式保持不變。無需其他程式碼變更。OrcaRouter 的端點專為熟悉 OpenAI SDK 的使用者設計,可作為直接替代方案。
兩個模型皆來自OpenAI。HD版本(tts-1-hd-1106)相較於標準版tts-1(單向每100萬個Token收費15美元),能產生更高品質的音訊,語調更自然、清晰度更佳。HD模型每個Token的成本為標準版的兩倍。選擇取決於您的品質需求;若為一般用途,標準版可能已足夠。若用於專業製作,則建議使用HD版本。
與Amazon Polly、Google Cloud Text-to-Speech或Microsoft Azure Speech等供應商相比,openai/tts-1-hd-1106模型在自然度上具有競爭力,但通常每個字符的定價較高。它在表現力和透過OpenAI相容API的整合便利性方面表現出色。然而,其他供應商提供更多聲音、語言支援以及自訂語音建立功能。請根據您對語言、品質和預算的具體需求進行評估。
像 Tacotron、FastSpeech 或 Tortoise 這類開源模型需要自行設定,且輸出品質可能無法與 OpenAI 的 HD 模型相比。託管模型提供了便利性、可靠性與高品質,無需管理基礎設施。然而,開源模型可免費自架使用,但仍需負擔運算成本。對於小型專案,開源方案可能較便宜;若需穩定品質的生產環境,HD 模型則是強力選擇。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1response_formatspeedvoice| 輸入 / 1M tokens | $30.00 |
| 輸出 / 1M tokens | $30.00 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
@misc{orcarouter_tts_1_hd_1106,
title = {openai/tts-1-hd-1106 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/tts-1-hd-1106}
}openai. (n.d.). openai/tts-1-hd-1106 API. OrcaRouter. https://www.orcarouter.ai/models/openai/tts-1-hd-1106