Google的快速、经济高效的文本转语音模型,用于实时音频生成,通过OrcaRouter访问。
google/gemini-3.1-flash-tts-preview 是 Google 推出的一款文本转语音模型,属于 Gemini Flash 系列。该模型接受文本输入并生成语音音频输出,针对速度和成本进行了优化,适合实时应用场景。目前该模型处于预览阶段,意味着开发仍在进行中,可用性可能发生变化。通过 OrcaRouter 的 OpenAI 兼容 API 访问时,模型 ID 为…
其主要功能是将书面文本转换为自然流畅的语音。该模型专为速度而设计,利用Flash架构降低延迟。它支持多种语言和语音?此特定预览版本的语言和语音支持在提供的事实中未详细说明;您应查阅Google文档以了解当前可用的语音选项。该模型可以处理各种文本输入,包括标点、数字和缩写,生成的语音输出能反映预期的节奏和语调。
最佳使用场景包括任何对低延迟语音生成至关重要的应用:实时语音助手、实时翻译配音、带语音输出的交互式聊天机器人以及自动电话系统。当需要快速生成大量短音频片段时,它在批处理方面也表现出色。内容制作者可将其用于视频游戏或有声书中的动态配音。由于输出成本相对于输入较高,因此当输出的音频简洁时最为经济。
如果你的使用场景涉及极长的音频生成(例如数小时的语音)或不需要低延迟,可以考虑采用每令牌输出成本更低的批量TTS模型。对于输入量占主导的应用(例如大量短提示),较低的输入成本使得这款Flash模型颇具吸引力。对于需要极高输出质量的场景——例如情感表达丰富的角色——你可能需要评估Google或其他提供商的高级TTS模型。务必始终监控总令牌量和延迟要求。
作为Gemini Flash模型,此TTS变体针对低延迟进行了优化。现有资料中未提供具体的延迟基准(例如首个音频数据包到达时间)。实际上,Flash模型对于短输入通常能在几百毫秒内响应。延迟可能因输出长度、网络状况和并发请求负载而异。OrcaRouter的路由可能会增加少量额外开销。对于实时应用,请在使用预期音频时长及负载条件下进行测试。
优势包括低输入成本(1.00美元/百万Token)、快速生成以及谷歌强大的基础设施。预览状态意味着模型质量和可用性可能发生变化。一个局限在于,相较于文本模型,其输出成本较高(20.00美元/百万Token)。此外,输出音频质量(如自然度、口音多样性及韵律表现)未在此处进行基准测试。您应在生产部署前,针对具体领域(如技术术语、情感范围)评估模型的语音质量。
在现有数据中未提供 google/gemini-3.1-flash-tts-preview 的基准测试分数。TTS 模型通常通过自然度平均意见分(MOS)、可懂度词错误率(WER)以及延迟百分位数等指标进行评估。由于缺乏具体数值,您应使用代表性提示自行评估模型的质量和速度,以符合您的需求。OrcaRouter 不会增加或修改模型性能。
现有事实并未明确说明此TTS预览支持的语言或口音能力。Google更广泛的TTS模型通常支持多种语言,但此特定变体的覆盖范围未知。您应使用多语言文本进行测试以确认输出质量。对于英语,鉴于Google的投入,性能可能较为稳健。对于不太常见的语言,建议直接联系Google或通过OrcaRouter的API使用样本文本进行测试。
定价遵循谷歌官方费率,OrcaRouter 不收取任何加价。输入 token(文本)每 100 万个 token 收费 1.00 美元。输出 token(音频)每 100 万个 token 收费 20.00 美元。输出 token 按音频单位生成,具体的 token 与时间比例未作说明。每次请求的输入和输出 token 均会向您收费。无额外平台费用或最低消费要求。计费通过 OrcaRouter 现有支付方式进行。
输入token的成本比输出token便宜20倍。这激励了发送更长的文本提示(在token限制内)以生成相应更长的音频输出,因为输入成本仍然很低。例如,生成1分钟的音频片段可能需要消耗大量输出token,按$20/1M计算,而文本提示可能只需几分钱。请尽可能保持输出简洁以优化成本。如果您的用例生成了非常长的音频,每次请求的输出成本可能会迅速增加。
现有资料未提及OrcaRouter上该模型存在任何缓存或折扣计划。OrcaRouter的定价按供应商费率直接传递。建议向OrcaRouter咨询是否提供跨模型适用的批量折扣选项或预留容量。由于输出token成本较高,对重复使用场景(如常见响应)生成的音频片段进行缓存可大幅降低总支出。
不直接提供比较。然而,Google 的 Flash TTS 定位于低输入成本、适合实时使用的性价比方案。其他 TTS 模型(如 OpenAI TTS、ElevenLabs)可能采用不同的定价结构——通常按字符或音频时长(每秒)收费。本模型按输出 token 计费,对于很长的音频可能更贵,但对于短促、突发性的生成更便宜。请根据您预期的 token 用量,对照 OrcaRouter 目录中的其他服务进行评估。
使用任何兼容OpenAI的客户端。将base URL设置为https://api.orcarouter.ai/v1,API密钥来自您的OrcaRouter账户,模型ID设置为"google/gemini-3.1-flash-tts-preview"。发送一个聊天完成请求,用户消息中包含要朗读的文本。响应将包含音频内容(可能以base64编码的块或URL形式)。具体输出格式取决于Google的模型实现。关于流式支持和响应解析,请参考OrcaRouter的文档。
标准聊天完成参数适用:模型、消息(包含角色和内容),以及可选的用于输出可变性的temperature或top_n(虽然对于TTS而言相关性较低)。对于语音选择,Google的模型可能支持额外参数(例如voice name)。现有资料未列出具体的TTS参数。您可能需要在请求体中传递诸如"voice"或"language"之类的附加字段。有关预览模型的确切选项,请查阅Google的API文档。
常见TTS模型支持流式音频,即生成的音频块会逐步发送。现有事实未确认此预览模型是否支持流式传输。若已启用流式功能,可在API请求中将stream参数设为true,并实时处理接收到的数据块。OrcaRouter兼容模型的流式传输。通过简单请求测试,观察音频是逐步返回还是以完整数据包形式返回。
如果你已经使用与OpenAI兼容的API,请将基础URL更改为https://api.orcarouter.ai/v1,并更新模型ID。同时更新请求参数以匹配Google的TTS规范(例如,语音名称)。如果音频格式不同(例如MP3与WAV),可能需要调整音频输出处理方式。通过示例提示进行测试以验证质量。由于定价为零加价,你的费用可能会根据token使用量而变化。无需特殊的迁移工具。
OpenAI 提供了 TTS 模型(tts-1、tts-1-hd),按字符计费(约每 1K 字符 $0.015)。相比之下,Google 的模型采用基于 token 的计费方式,对于短输入可能更经济,但对长输出则更昂贵。OpenAI 的 TTS 支持多种声音和语言;Google 预览版的详细信息尚不完全清楚。延迟方面:Flash 和 OpenAI 的模型都设计为低延迟。质量具有主观性;您应使用自己的内容进行测试,以比较自然度和韵律。
Google 还通过其 Cloud Text-to-Speech API 提供高级 TTS 模型(例如 WaveNet、Studio)。这些模型通常按发送的文本字符数收费,对于超长音频可能更便宜,但单次请求成本较高。Flash TTS 速度更快,且输入定价更简单(按 token 计费),但语音选项可能更少。对于高保真、情感丰富的语音,高级模型可能更合适;若追求速度和较低的输入成本,Flash 变体则更具优势。
如果你需要实时响应且输入文本较短(很多小请求),这款Flash模型低输入成本和快速生成非常适合。对于超长音频生成(例如完整的有声书),按字符输入收费的模型(如Google标准TTS)可能更便宜,因为避免了输出token成本。同时也要考虑语音多样性和语言支持:如果你需要多种不同的声音,请检查此预览版是否支持。在正式使用前,用你的实际工作负载测试这两个选项。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1voice| 输入 / 1M tokens | $1.00 |
| 输出 / 1M tokens | $20.00 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
@misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview