OpenAI TTS-1 HD 1106:通过OrcaRouter的OpenAI兼容API实现高清文本转语音
openai/tts-1-hd-1106模型是OpenAI推出的文本转语音模型,具体来说是2023年11月发布的高清版本。它能够将文本转换为自然流畅的音频,注重清晰度和表现力。该模型接受文本形式的输入,并输出音频令牌。定价为每100万输入令牌30美元,每100万输出令牌30美元,通过OrcaRouter以提供商费率计费,零加价。
openai/tts-1-hd-1106 模型专为高清晰度音频输出设计。它能以良好的韵律和情感生成自然流畅的语音。该模型支持多种声音(由 OpenAI 提供),并允许调整语速和采样率。输出音频通常根据配置为 24kHz 或 48kHz。这使得它适用于媒体制作等专业应用。
最佳用途包括为视频生成配音、为有声读物创作旁白、在应用中构建语音界面,以及为辅助技术添加语音输出。在面向客户的场景中,当输出内容最终由终端用户收听时,高清质量尤为重要。对于内部测试或低保真原型,建议考虑更低成本的替代方案。
如果您的使用场景不需要高保真音频——例如简单的提示音、非常简短的语音片段或内部日志记录——那么成本更低的TTS模型可能更经济。每100万标记30美元的定价适用于输入和输出,因此生成许多短片段可能会迅速累积成本。对于大规模生产,请评估您的质量要求和预算。
是的,OpenAI 为该模型提供了几种默认语音(例如 alloy、echo、fable、onyx、nova、shimmer)。您可以通过 API 参数选择语音。此外,您还可以调整语速(0.5 倍至 2.0 倍)、采样率和输出格式。该模型不支持自定义语音克隆或微调。OrcaRouter 会将这些参数原封不动地传递给 OpenAI。
虽然现有数据未提供 openai/tts-1-hd-1106 的具体基准评分,但该模型被广泛认为是 OpenAI 截至发布日(2023年11月)质量最高的 TTS 模型。在内部评估中,它在自然度和清晰度方面位居顶级模型之列。如需客观性能数据,请查阅 OpenAI 官方文档及第三方评测。
延迟取决于输入文本的长度和所选的音频格式。通常,对于短输入(例如100个字符),模型会在几秒内返回音频。较长的文本可能需要按比例增加时间。OrcaRouter不会在提供商响应时间之外增加显著开销。对于实时应用,流式传输可以减少感知延迟。
该模型仅限于文本转语音,不支持语音对话或除语音选择之外的情感控制功能。它无法生成背景声音或音乐。对于不常见的发音、同音词或外来词,输出质量可能会下降。此外,模型有最大输入长度限制(通常为4096个字符)。对于非常长的文本,请分段输入。
定价为每100万输入token 30.00美元,每100万输出token 30.00美元。输入token统计您提供的文本,输出token统计生成的音频token。两者均按相同费率计费。无分钟或字符费用;token化由OpenAI处理。OrcaRouter不增加任何加价,您只需支付OpenAI公布的费率。
所提供的定价是通过OrcaRouter的标准费率。现有信息中未提及任何批量折扣或缓存定价。您可以通过优化输入文本长度来降低成本——更短的提示词会生成更少的输出令牌。对于大规模使用,建议直接与OpenAI协商,尽管OrcaRouter不提供单独的定价层级。
该模型输入和输出均为每100万token 30美元,定价高于许多标准TTS模型。例如,OpenAI的标准tts-1模型输入和输出各为每100万token 15美元。高清版本因质量更高而定价更高。OrcaRouter直接传递这些提供商费率而不加价,因此成本差异与直接使用OpenAI相同。
零加价意味着OrcaRouter不会在提供商的每token价格之上增加任何费用。你的成本就是OpenAI的费率:每100万输入token 30美元,每100万输出token 30美元。没有平台附加费、隐藏费用或使用门槛。唯一产生的费用就是按照公布的提供商价格根据token用量计算的费用。
使用 https://api.orcarouter.ai/v1 的兼容OpenAI的API。将模型参数设置为 "openai/tts-1-hd-1106"。以标准消息格式提供输入文本(例如,role: user, content: 你的文本)。额外的TTS特定参数(如 voice、speed、response_format)可以包含在请求体中。OrcaRouter 将请求转发给 OpenAI 并返回音频响应。完整参数详情请参阅 OpenAI 的 TTS API 文档。
您可以设置与OpenAI TTS API相同的参数:input(字符串)、model("openai/tts-1-hd-1106")、voice(可用声音中的字符串)、speed(数字0.5–2.0)、response_format(例如"mp3"、"opus"、"aac"、"flac"、"wav")和sample_rate。将它们包含在JSON正文中,通过POST请求发送到chat/completions端点。OrcaRouter保留所有参数,不进行任何更改。
是的,您可以通过在API请求中将stream参数设置为true来使用流式传输。模型会在生成音频块时实时返回,这对于实时应用非常有用。OrcaRouter支持流式传输,无需额外配置。请确保您的客户端正确处理分块响应,这是兼容OpenAI的流式端点标准做法。
将基础API URL替换为 https://api.orcarouter.ai/v1,并将模型标识符更新为"openai/tts-1-hd-1106"。你现有的OpenAI API密钥将无法使用;你需要一个OrcaRouter API密钥。请求体格式保持不变。无需其他代码更改。对于那些熟悉OpenAI SDK的用户,OrcaRouter的端点被设计为即插即用的替代方案。
两个模型均来自OpenAI。高清晰度版本(tts-1-hd-1106)相比标准版tts-1(定价为每100万 tokens 双向各15美元)可生成更高质量的音频,具有更自然的语调和清晰度。高清模型每 token 成本翻倍。选择取决于您的质量需求;日常使用中标准版可能已足够。专业制作则推荐使用高清版。
与Amazon Polly、Google Cloud Text-to-Speech或Microsoft Azure Speech等提供商相比,openai/tts-1-hd-1106模型在自然度上具有竞争力,但通常按字符计费更高。它在表现力及通过兼容OpenAI的API实现集成便利性方面表现出色。然而,其他提供商提供更多声音、语言支持及自定义语音创建。请根据您对语言、质量和预算的具体需求进行评估。
像Tacotron、FastSpeech或Tortoise这样的开源模型需要自行部署,且输出质量可能不及OpenAI的HD模型。托管模型无需管理基础设施,提供了便利性、可靠性和高质量。然而,开源模型可以免费自托管,但会带来计算成本。对于小项目,开源方案可能更经济;而对于需要稳定质量的生产环境,HD模型是更优选择。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1response_formatspeedvoice| 输入 / 1M tokens | $30.00 |
| 输出 / 1M tokens | $30.00 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_tts_1_hd_1106,
title = {openai/tts-1-hd-1106 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/tts-1-hd-1106}
}openai. (n.d.). openai/tts-1-hd-1106 API. OrcaRouter. https://www.orcarouter.ai/models/openai/tts-1-hd-1106