带TTS的Google Gemini 2.5 Pro预览版,通过OrcaRouter以零加价访问。
google/gemini-2.5-pro-preview-tts 是 Google 推出的一款预览版文本转语音模型,基于 Gemini 2.5 Pro 基础构建。它能够将文本输入转换为语音音频输出。该模型通过 OrcaRouter 的 OpenAI 兼容 API 访问,在基础 URL https://api.orcarouter.ai/v1 上使用模型 ID…
google/gemini-2.5-pro-preview-tts的主要功能是将书面文本转换为语音音频。该模型基于Google的Gemini 2.5 Pro构建,具备强大的语言理解能力,从而生成自然的措辞、恰当的语调和清晰的发音。模型仅接受文本输入,因此在输入侧不具备多模态能力,不支持音频、图像或视频输入。输出为标准数字格式的音频。作为TTS模型,它可以处理多种语言,但此预览版尚未公布具体的语言支持范围。该模型专为生成语音而优化,不具备Gemini 2.5 Pro的其他能力,如推理或代码生成。
该模型在需要将书面文本转换为自然语音的应用中表现出色。最佳使用场景包括语音助手(助手朗读回复内容)、自动有声书和播客旁白、为视障用户朗读屏幕文本的无障碍功能,以及提供语音回复的客服系统。它还可用于语言学习应用中模拟正确发音,或从RSS订阅源、文章生成语音内容。由于处于预览状态,建议在投入大规模部署之前,针对具体语言、领域或风格需求进行充分测试。
虽然 google/gemini-2.5-pro-preview-tts 提供优质的 TTS(文本转语音)效果,但对于简单的提示音或通知音,或者那些对低延迟有严格要求、但模型处理时间比专用 TTS 芯片更长的应用场景而言,它可能显得过于强大。如果你只需要基本的、音调单一的语音,或者有极高的并发量且预算严格受限,那么选择每 token 成本更低的轻量级 TTS 模型(例如 OrcaRouter 上其他供应商提供的模型)可能更为合适。此外,如果你的使用场景需要极低延迟的实时流式传输,请评估 Gemini 预览版模型是否满足你的速度要求,因为较大的模型可能会带来更高的首 token 延迟。
截至模型预览版发布,谷歌尚未公布gemini-2.5-pro-preview-tts变体的具体基准测试得分。底层Gemini 2.5 Pro基础模型在语言理解和推理任务上展现出强劲性能,但该TTS变体的语音质量指标(例如平均意见分、词错误率)尚未公开。由于缺乏官方基准,OrcaRouter建议使用你自己的文本输入测试集对模型进行评估,并主观测量音频质量、延迟和负载下的可靠性。对于生产决策,请自行与其他TTS服务进行A/B对比测试。
google/gemini-2.5-pro-preview-tts 的具体延迟数据尚未公开披露。作为基于大语言模型架构的 TTS 模型,其延迟可能高于专为实时流式传输优化的神经 TTS 模型。影响速度的因素包括输入文本长度、模型内部处理时间以及到 OrcaRouter 端点的网络往返时间。对于低延迟要求较高的应用(如对话式 AI),建议使用典型输入长度对该模型进行测试以评估其适用性。如果 API 支持,可考虑使用流式或分块文本生成。
优势:基于谷歌先进的Gemini 2.5 Pro架构,能够生成高度自然、富有表现力的语音,在韵律和发音方面表现良好。通过OrcaRouter兼容OpenAI的API进行访问,简化了集成流程。提供商定价透明,成本可预测。局限:输入仅支持文本模态,无法处理音频或其他模态。作为预览版本,可能存在未发现的边界情况或质量不一致问题。上下文窗口大小未知,限制了单次请求可转换的文本长度。未提供输出格式的详细信息。该产品并非为语音识别或语音克隆等任务设计。
google/gemini-2.5-pro-preview-tts 的定价基于Token用量,输入Token每100万个收费1.00美元,输出Token每100万个收费20.00美元。输入Token包含文本提示及任何指令,输出Token代表生成的音频。OrcaRouter 按提供商实际费率计费,无任何加价,即您只需支付Google收取的费用,另加适用税费。无最低承诺或月费。用量按每次请求计量,并汇总到您的 OrcaRouter 发票上。由于TTS输出Token数量可能较高(音频的Token密度高于文本),输出成本是主要支出。
输出的代币价格(每100万个20美元)明显高于输入的代币成本(每100万个1美元)。这在生成式模型中很常见,因为输出代币需要更多的计算量。对于文本转语音而言,音频输出以一系列代币表示,将文本转换为语音涉及生成长序列的音频代币。特定任务的总成本取决于输出音频相对于输入文本的长度。如果需要生成较长的语音片段(例如整本有声书),成本会累积。对于较短的提示(例如单个句子),成本很低。请监控你的代币使用量来预估成本。
不,OrcaRouter 不会对 google/gemini-2.5-pro-preview-tts 的提供商费率增加任何加价。所列出的每百万输入令牌 1.00 美元和每百万输出令牌 20.00 美元的价格正是 Google 收取的费用。OrcaRouter 直接将此费用传递给你。这符合 OrcaRouter 对许多模型的定价模式,平台充当透明代理。你只需为消耗的令牌付费。任何可选功能(如缓存或高级支持)可能会产生单独费用,但基本的每令牌成本没有加价。
要使用 google/gemini-2.5-pro-preview-tts,请向 OrcaRouter 的 OpenAI 兼容 API 发起请求,基础 URL 为 https://api.orcarouter.ai/v1。在 API 调用中使用模型 ID 'google/gemini-2.5-pro-preview-tts'。请求格式遵循标准的 OpenAI 聊天补全结构,包含 'model' 字段、包含文本提示(具有 system 和/或 user 角色)的 'messages' 数组,以及标准参数(如 temperature 和 max_tokens)。响应将包含生成的音频 token,你的客户端可以解码以播放为语音。身份验证通过 OrcaRouter 提供的 API 密钥完成。
该API支持标准的OpenAI兼容参数,包括'model'、'messages'(由role和content组成的对象数组)、'temperature'(用于控制音频输出的变化性)、'max_tokens'(限制生成音频的长度)以及'top_p'。作为TTS模型,可能还有用于语音风格或速度的其他参数,但这些在现有文档中尚未记载。请参考OrcaRouter的API文档以获取最新的支持字段。'response_format'参数可能允许指定音频编码(例如wav或mp3)。如果默认不支持,您可能需要解码返回的令牌流。
如果你目前正在使用不同的TTS服务(例如Google Cloud Text-to-Speech、Amazon Polly),通过OrcaRouter迁移到google/gemini-2.5-pro-preview-tts需要更新你的API端点和请求格式。OrcaRouter使用兼容OpenAI的端点,因此你需要从特定于供应商的SDK切换到兼容OpenAI的SDK。将现有基础URL替换为https://api.orcarouter.ai/v1,使用模型ID 'google/gemini-2.5-pro-preview-tts',并调整请求体以匹配聊天补全架构。你可能需要修改处理响应的方式:你将会收到需要解码的分词输出,而不是直接接收音频文件。使用示例输入进行测试。
认证方法是在Authorization标头中包含API密钥(格式:Bearer YOUR_API_KEY)。您可以从您的OrcaRouter账户获取API密钥。速率限制由OrcaRouter根据您的套餐设置,与Google的限制不同。对于大流量使用,请联系OrcaRouter调整限制。预览模型可能受到Google的额外限制——如果您遇到诸如“模型不可用”之类的错误,请检查您的OrcaRouter套餐是否包含此模型。此模型没有公开具体的速率限制,但建议采用标准的最佳实践(使用指数退避进行重试)。
google/gemini-2.5-pro-preview-tts 是 Gemini 2.5 Pro 系列中专用于文本转语音的变体。其他 Gemini 2.5 Pro 模型为通用型,可处理文本、图像、音频和视频输入,但本身不生成语音输出。此 TTS 变体去除了多模态输入能力,专注于从文本生成音频。它很可能使用相同的底层语言理解能力来优化韵律和节奏,但不适用于推理、编码或多模态分析。若需要在保留多模态输入的同时具备 TTS 功能,可将标准 Gemini 模型与独立的 TTS 流水线结合使用。预览版 TTS 提供了更精简的流水线。
OrcaRouter 提供了来自多家供应商的 TTS 模型。Google 的这款模型基于大型语言模型架构,相比传统的拼接式或参数化 TTS 系统,可能生成更自然、更具上下文感知能力的语音。然而,与针对低延迟和高吞吐量设计的专用神经 TTS 模型相比,它可能更慢,且每 token 成本更高。许多流行的 TTS 服务按字符或音频秒数收费,而非按 token 收费,这使得直接成本比较变得复杂。对于需要极低成本的生产部署,专用 TTS 模型可能更合适。Google 的模型最适合那些以较高输出 token 成本换取最高输出质量的用例。
选择此模型,如果您需要来自Google最新Gemini架构的最先进语音质量,并且希望通过标准的OpenAI兼容API访问它,而无需管理Google Cloud凭证。零加价定价确保了透明度。它非常适合自然度至关重要的应用,例如对话式AI或叙事内容。预览状态允许早期实验,以评估其质量是否适合您的领域。然而,如果您需要低于100毫秒延迟的实时流式传输,则专用的流式TTS模型可能更好。此外,如果您的预算敏感,请测试典型用例的输出token消耗,以确保成本可接受。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1voice| 输入 / 1M tokens | $1.00 |
| 输出 / 1M tokens | $20.00 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts