Google의 빠르고 비용 효율적인 텍스트-음성 변환 모델로, 실시간 오디오 생성을 위해 OrcaRouter를 통해 접근됩니다.
google/gemini-3.1-flash-tts-preview는 Google의 텍스트 음성 변환 모델로, Gemini Flash 제품군에 속합니다. 텍스트 입력을 받아 음성 오디오 출력을 생성합니다. 이 모델은 속도와 비용 측면에서 최적화되어 실시간 애플리케이션에 적합합니다. 현재 프리뷰 상태로, 개발이 진행 중이며 가용성은 변경될 수 있습니다.…
주요 기능은 작성된 텍스트를 자연스러운 음성으로 변환하는 것입니다. 이 모델은 속도에 최적화되어 있으며, Flash 아키텍처를 활용하여 지연 시간을 줄입니다. 여러 언어와 음성을 지원하나요? 이 특정 프리뷰의 언어 및 음성 지원 범위는 제공된 정보에 상세히 명시되지 않았으므로, 현재 음성 옵션에 대해서는 Google 문서를 참조하시기 바랍니다. 이 모델은 구두점, 숫자, 약어를 포함한 다양한 텍스트 입력을 처리할 수 있으며, 의도된 리듬과 어조를 반영한 음성 출력을 생성합니다.
최적의 사용 사례로는 실시간 음성 어시스턴트, 실시간 번역 더빙, 음성 출력이 포함된 대화형 챗봇, 자동 전화 시스템 등 저지연 음성 생성이 중요한 모든 애플리케이션이 포함됩니다. 또한 짧은 오디오 클립을 빠르게 많이 생성해야 하는 배치 처리에도 탁월합니다. 콘텐츠 제작자는 비디오 게임이나 오디오북에서 동적 음성 해설에 사용할 수 있습니다. 출력 비용이 입력에 비해 높기 때문에 출력 오디오가 간결할 때 가장 경제적입니다.
사용 사례에 극도로 긴 오디오 생성(예: 몇 시간 분량의 음성)이 포함되거나 낮은 지연 시간이 필요하지 않은 경우, 토큰당 출력 비용이 더 낮은 배치 TTS 모델을 고려하세요. 입력 볼륨이 지배적인 애플리케이션(예: 많은 짧은 프롬프트)의 경우, 저렴한 입력 비용으로 인해 이 Flash 모델이 매력적입니다. 매우 높은 출력 품질이 필요한 시나리오(예: 감정 표현이 풍부한 캐릭터)에서는 Google 또는 다른 제공업체의 프리미엄 TTS 모델을 평가할 수 있습니다. 항상 총 토큰 볼륨과 지연 시간 요구 사항을 모니터링하세요.
Gemini Flash 모델로서, 이 TTS 변형은 낮은 대기 시간에 최적화되어 있습니다. 특정 대기 시간 벤치마크(예: 첫 번째 오디오 패킷까지의 시간)는 사용 가능한 사실에 제공되지 않습니다. 실제로 Flash 모델은 짧은 입력에 대해 수백 밀리초 내에 응답하는 경우가 많습니다. 대기 시간은 출력 길이, 네트워크 조건 및 동시 요청 부하에 따라 달라질 수 있습니다. OrcaRouter의 라우팅은 최소한의 오버헤드를 추가할 수 있습니다. 실시간 애플리케이션의 경우 예상 오디오 지속 시간에 따라 부하 조건에서 테스트하십시오.
장점으로는 낮은 입력 비용 ($1.00/1M tokens), 빠른 생성 속도, 그리고 Google의 견고한 인프라가 있습니다. 미리보기 상태는 모델 품질 및 가용성이 변경될 수 있음을 의미합니다. 한계는 텍스트 모델에 비해 높은 출력 비용 ($20.00/1M tokens)입니다. 또한, 출력 오디오 품질(자연스러움, 악센트 다양성, 운율 등)은 여기서 벤치마킹되지 않았습니다. 프로덕션 배포 전에 특정 도메인(예: 기술 용어, 감정 표현 범위)에 대한 모델의 음성 품질을 평가해야 합니다.
이용 가능한 정보에는 google/gemini-3.1-flash-tts-preview에 대한 벤치마크 점수가 제공되어 있지 않습니다. TTS 모델은 일반적으로 자연스러움에 대한 평균 의견 점수(MOS), 명료성에 대한 단어 오류율(WER), 지연 시간 백분위수와 같은 지표로 평가됩니다. 구체적인 수치가 없으므로 요구 사항에 맞는 품질과 속도를 평가하기 위해 대표적인 프롬프트를 사용하여 자체 평가를 수행해야 합니다. OrcaRouter는 모델 성능을 추가하거나 수정하지 않습니다.
현재 제공된 정보로는 이 TTS 미리보기에서 지원되는 언어나 악센트 기능을 알 수 없습니다. Google의 광범위한 TTS 모델은 일반적으로 여러 언어를 지원하지만, 이 특정 변형의 지원 범위는 알려져 있지 않습니다. 다국어 텍스트로 테스트하여 출력 품질을 확인해야 합니다. 영어의 경우 Google의 투자로 인해 성능이 견고할 가능성이 높습니다. 덜 일반적인 언어의 경우 Google에 직접 문의하거나 OrcaRouter의 API를 통해 샘플 텍스트로 테스트하는 것을 고려하십시오.
가격은 OrcaRouter의 마크업 없이 Google 공식 요금제를 따릅니다. 입력 토큰(텍스트)은 100만 토큰당 $1.00입니다. 출력 토큰(오디오)은 100만 토큰당 $20.00입니다. 출력 토큰은 오디오 단위당 생성되며, 정확한 토큰-시간 비율은 명시되지 않았습니다. 각 요청에서 사용된 입력 및 출력 토큰에 대해 청구됩니다. 추가 플랫폼 수수료나 최소 사용 금액 요구 사항은 없습니다. 청구는 OrcaRouter의 기존 결제 수단을 통해 이루어집니다.
입력 토큰은 출력 토큰보다 20배 저렴합니다. 이는 (토큰 제한 내에서) 더 긴 텍스트 프롬프트를 보내 비례적으로 더 긴 오디오 출력을 생성하도록 유도하는데, 입력 비용이 낮게 유지되기 때문입니다. 예를 들어, 1분짜리 오디오 클립을 생성하면 $20/1M의 비율로 많은 출력 토큰이 소모될 수 있지만, 텍스트 프롬프트는 몇 푼에 불과할 수 있습니다. 가능하면 출력을 간결하게 유지하여 최적화하세요. 사용 사례에서 매우 긴 오디오를 생성하는 경우, 요청당 출력 비용이 빠르게 증가할 수 있습니다.
사용 가능한 사실에는 이 모델에 대한 OrcaRouter의 캐싱 또는 할인 프로그램이 언급되어 있지 않습니다. OrcaRouter의 가격은 공급업체 요율에 따른 패스스루 방식입니다. 여러 모델에 적용될 수 있는 대량 할인 옵션이나 예약된 용량에 대해 OrcaRouter에 문의하시기 바랍니다. 출력 토큰 비용이 높기 때문에, 반복 사용(예: 공통 응답)을 위해 생성된 오디오 세그먼트를 캐싱하면 전체 지출을 크게 줄일 수 있습니다.
비교는 직접 제공되지 않습니다. 그러나 Google의 Flash TTS는 낮은 입력 비용으로 실시간 사용에 비용 효율적인 위치에 있습니다. 다른 TTS 모델(예: OpenAI TTS, ElevenLabs)은 다른 가격 구조를 가질 수 있습니다—종종 문자당 또는 오디오 초당 요금을 부과합니다. 이 모델의 토큰당 출력 가격은 매우 긴 오디오의 경우 더 비쌀 수 있지만 짧고 간헐적인 생성의 경우 더 저렴할 수 있습니다. OrcaRouter의 카탈로그에서 다른 제품과 예상 토큰 볼륨을 평가하십시오.
OpenAI 호환 클라이언트를 사용하세요. 기본 URL을 https://api.orcarouter.ai/v1로 설정하고, API 키는 OrcaRouter 계정에서 가져오며, 모델 ID를 "google/gemini-3.1-flash-tts-preview"로 설정하세요. 말할 텍스트가 포함된 사용자 메시지로 채팅 완료 요청을 보내세요. 응답에는 오디오 콘텐츠(base64로 인코딩된 청크 또는 URL일 가능성이 높음)가 포함됩니다. 정확한 출력 형식은 Google의 모델 구현에 따라 달라집니다. 스트리밍 지원 및 응답 구문 분석에 대해서는 OrcaRouter의 문서를 참조하세요.
표준 채팅 완성 매개변수가 적용됩니다: model, messages (role과 content 포함), 그리고 선택적으로 temperature 또는 top_p (출력 다양성 제어, TTS에는 덜 관련됨). 음성 선택을 위해 Google의 모델은 추가 매개변수(예: voice name)를 지원할 수 있습니다. 이용 가능한 정보에는 특정 TTS 매개변수가 나열되어 있지 않습니다. 요청 본문에 "voice" 또는 "language"와 같은 추가 필드를 전달해야 할 수 있습니다. 정확한 옵션을 확인하려면 프리뷰 모델에 대한 Google API 문서를 참조하십시오.
TTS 모델이 스트리밍 오디오를 지원하는 것은 일반적이며, 오디오 청크가 생성되는 대로 전송됩니다. 제공된 사실에서는 이 프리뷰 모델의 스트리밍 지원 여부를 확인할 수 없습니다. 스트리밍이 활성화된 경우, API 요청에서 stream 매개변수를 true로 설정하고 청크가 도착하는 대로 처리할 수 있습니다. OrcaRouter는 호환되는 모델에 대해 스트리밍을 지원합니다. 간단한 요청으로 오디오가 점진적으로 반환되는지, 아니면 완전한 블롭으로 반환되는지 확인해 보십시오.
이미 OpenAI 호환 API를 사용 중인 경우, 기본 URL을 https://api.orcarouter.ai/v1로 변경하고 모델 ID를 업데이트하세요. 요청 파라미터를 Google TTS 사양(예: 음성 이름)에 맞게 수정하십시오. 오디오 출력 형식이 다른 경우(예: MP3 대 WAV) 이에 맞게 조정해야 할 수 있습니다. 샘플 프롬프트로 품질을 확인하세요. 가격이 제로 마크업이므로, 토큰 사용량에 따라 비용이 변경될 수 있습니다. 특별한 마이그레이션 도구는 필요하지 않습니다.
OpenAI는 TTS 모델(tts-1, tts-1-hd)을 제공하며 문자당 요금제를 사용합니다(1,000자당 약 $0.015). 반면 Google의 모델은 토큰 기반 요금제를 사용하며, 짧은 입력에는 더 경제적일 수 있지만 긴 출력에는 더 비쌀 수 있습니다. OpenAI의 TTS는 여러 음성과 언어를 지원합니다. Google의 미리보기 세부 사항은 완전히 알려지지 않았습니다. 지연 시간: Flash와 OpenAI 모델 모두 낮은 지연 시간을 위해 설계되었습니다. 품질은 주관적입니다. 자연스러움과 운율을 비교하려면 콘텐츠로 테스트해야 합니다.
Google은 또한 Cloud Text-to-Speech API를 통해 프리미엄 TTS 모델(예: WaveNet, Studio)을 제공합니다. 이 모델들은 일반적으로 전송된 텍스트의 문자 수에 따라 비용이 청구되며, 이는 매우 긴 오디오의 경우 더 저렴할 수 있지만 요청당 비용은 더 높습니다. Flash TTS는 더 빠르고 더 간단한 입력 가격 책정(토큰당)을 제공하지만 음성 옵션이 더 적을 수 있습니다. 고음질의 감정이 풍부한 음성을 위해서는 프리미엄 모델이 더 나을 수 있습니다. 속도와 입력당 저렴한 비용을 위해서는 Flash 변형이 유리합니다.
실시간 응답이 필요하고 짧은 입력 텍스트(많은 소규모 요청)를 처리하는 경우, 이 Flash 모델의 낮은 입력 비용과 빠른 생성 속도가 이상적입니다. 매우 긴 오디오 생성(예: 전체 오디오북)의 경우, 출력 토큰 비용이 발생하지 않으므로 입력 문자당 요금을 부과하는 모델(Google의 표준 TTS와 같은)이 더 저렴할 수 있습니다. 또한 음성 다양성과 언어 지원을 고려하세요: 다양한 목소리가 필요하다면 이 프리뷰가 이를 지원하는지 확인하세요. 결정을 내리기 전에 두 옵션을 실제 작업 부하로 테스트해보세요.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1voice| 입력 / 1M tokens | $1.00 |
| 출력 / 1M tokens | $20.00 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
GET /api/public/models/google/gemini-3.1-flash-tts-preview열기 @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview