Google Gemini 2.5 Pro preview with TTS, OrcaRouter를 통해 제로 마크업으로 액세스 가능.
google/gemini-2.5-pro-preview-tts는 Google에서 제공하는 미리보기 텍스트-음성 변환 모델로, Gemini 2.5 Pro 기반 위에 구축되었습니다. 이 모델은 텍스트 입력을 음성 오디오 출력으로 변환합니다. 이 모델은 OrcaRouter의 OpenAI 호환 API를 통해 액세스되며, 기본 URL…
google/gemini-2.5-pro-preview-tts의 주요 기능은 작성된 텍스트를 음성 오디오로 변환하는 것입니다. 이 모델은 Google의 Gemini 2.5 Pro를 기반으로 하여 강력한 언어 이해 능력을 갖추고 있어 자연스러운 구문, 적절한 억양, 명확한 발음을 제공할 것으로 예상됩니다. 입력은 텍스트만 받기 때문에 입력 측면에서는 멀티모달이 아니며, 오디오 입력, 이미지, 비디오는 처리하지 않습니다. 출력은 표준 디지털 형식의 오디오일 가능성이 높습니다. TTS 모델로서 여러 언어를 처리할 수 있지만, 이 프리뷰에서 지원하는 특정 언어는 공개되지 않았습니다. Gemini 2.5 Pro의 추론이나 코드 생성 등의 다른 기능보다는 음성 생성에 최적화되어 있습니다.
이 모델은 작성된 텍스트를 자연스러운 음성으로 변환해야 하는 응용 프로그램에서 뛰어납니다. 최적의 사용 사례로는 어시스턴트가 응답을 소리 내어 읽어주는 음성 어시스턴트, 자동 오디오북 및 팟캐스트 내레이션, 시각 장애 사용자를 위해 화면 텍스트를 읽어주는 접근성 기능, 음성 응답을 제공하는 고객 서비스 시스템이 있습니다. 또한 올바른 발음을 모델링하는 언어 학습 애플리케이션이나 RSS 피드 또는 기사에서 음성 콘텐츠를 생성하는 데 사용될 수 있습니다. 미리 보기 상태이므로 대규모 배포를 결정하기 전에 특정 언어, 도메인 또는 스타일 요구 사항에 대해 철저히 테스트하는 것이 좋습니다.
While google/gemini-2.5-pro-preview-tts는 프리미엄 TTS 품질을 제공하지만, 단순한 비프음이나 알림음, 또는 지연 시간이 중요하지만 모델의 처리 시간이 전용 TTS 칩보다 긴 애플리케이션에는 과도할 수 있습니다. 기본적이고 단조로운 음성만 필요하거나, 엄격한 예산 제약 속에서 매우 높은 볼륨을 처리해야 하는 경우, OrcaRouter의 다른 제공업체에서 제공하는) 토큰당 비용이 더 낮은 가벼운 TTS 모델이 더 적합할 수 있습니다. 또한, 사용 사례에서 매우 낮은 지연 시간의 실시간 스트리밍이 필요한 경우, Gemini의 미리보기 모델이 속도 요구 사항을 충족하는지 평가하세요. 모델이 클수록 첫 번째 토큰 지연 시간이 더 길어질 수 있기 때문입니다.
해당 모델의 프리뷰 릴리스 기준으로, Google은 gemini-2.5-pro-preview-tts 변형에 대한 특정 벤치마크 점수를 공개하지 않았습니다. 기본 Gemini 2.5 Pro 베이스 모델은 언어 이해 및 추론 작업에서 강력한 성능을 입증했지만, TTS 변형의 음성 품질 지표(예: Mean Opinion Score, Word Error Rate)는 공개적으로 공유되지 않았습니다. 공식 벤치마크가 없으므로, OrcaRouter는 자체 텍스트 입력 테스트 세트로 모델을 평가하고 주관적인 오디오 품질, 지연 시간, 부하 상태에서의 신뢰성을 측정할 것을 권장합니다. 프로덕션 결정을 위해서는 다른 TTS 서비스와의 자체 A/B 비교를 수행하십시오.
Google/gemini-2.5-pro-preview-tts의 구체적인 지연 시간 수치는 공개적으로 알려져 있지 않습니다. 대형 언어 모델 아키텍처를 기반으로 한 TTS 모델로서, 실시간 스트리밍에 최적화된 전용 신경망 TTS 모델에 비해 지연 시간이 더 높을 수 있습니다. 속도에 영향을 미치는 요소로는 입력 텍스트의 길이, 모델 내부 처리 시간, OrcaRouter 엔드포인트까지의 네트워크 왕복 시간 등이 있습니다. 지연 시간이 중요한 애플리케이션(예: 대화형 AI)에서는 일반적인 입력 길이로 이 모델을 테스트하여 적합성을 평가하세요. API가 지원하는 경우 스트리밍 또는 청크 단위 텍스트 생성을 고려하세요.
장점: Google의 고급 Gemini 2.5 Pro 아키텍처를 기반으로 하여, 자연스럽고 표현력이 풍부한 음성을 생성하며 좋은 운율과 발음을 제공할 가능성이 높습니다. OrcaRouter의 OpenAI 호환 API를 통한 액세스는 통합을 간소화합니다. 제공업체 가격에 마크업이 없어 비용 예측이 가능합니다. 제한 사항: 입력 모드는 텍스트 전용입니다. 오디오나 다른 모드를 처리할 수 없습니다. 미리보기 버전이므로 발견되지 않은 에지 케이스나 일관되지 않은 품질이 있을 수 있습니다. 컨텍스트 윈도우 크기가 알려지지 않아 단일 요청으로 변환할 수 있는 텍스트 길이가 제한됩니다. 출력 형식 세부 정보는 제공되지 않습니다. 음성 인식이나 음성 복제와 같은 작업을 위해 설계되지 않았습니다.
google/gemini-2.5-pro-preview-tts의 가격은 토큰 사용량에 따라 책정되며, 입력 토큰 100만 개당 $1.00, 출력 토큰 100만 개당 $20.00이 청구됩니다. 입력 토큰에는 텍스트 프롬프트와 모든 지침이 포함됩니다. 출력 토큰은 생성된 오디오를 나타냅니다. OrcaRouter는 정확한 제공업체 요율로 청구하며 마크업이 전혀 없으므로 Google이 청구하는 금액에 적용 가능한 세금만 더하여 지불하면 됩니다. 최소 약정이나 월 사용료는 없습니다. 사용량은 요청별로 측정되며 OrcaRouter 청구서에 합산됩니다. TTS 출력 토큰 수는 (오디오가 텍스트보다 토큰 밀도가 높기 때문에) 많을 수 있으므로 출력 비용이 주요 지출 항목입니다.
출력 토큰 가격(100만 개당 $20)은 입력 토큰(100만 개당 $1)보다 상당히 높습니다. 이는 출력 토큰이 더 많은 컴퓨팅을 필요로 하기 때문에 생성형 모델에서 일반적인 현상입니다. 텍스트 음성 변환의 경우, 오디오 출력은 일련의 토큰으로 표현되며, 텍스트를 음성으로 변환하는 것은 긴 오디오 토큰 시퀀스를 생성하는 과정을 수반합니다. 특정 작업의 총 비용은 입력 텍스트 대비 출력 오디오 길이에 따라 달라집니다. 긴 음성(예: 전체 오디오북)을 생성해야 하는 경우 비용이 누적될 수 있습니다. 짧은 프롬프트(예: 한 문장)의 경우 비용이 최소화됩니다. 비용을 예측하려면 토큰 사용량을 모니터링하세요.
아니요, OrcaRouter는 google/gemini-2.5-pro-preview-tts의 제공업체 요금에 어떤 인상도 추가하지 않습니다. 입력 토큰 100만 개당 $1.00, 출력 토큰 100만 개당 $20.00으로 표시된 가격은 정확히 Google이 청구하는 금액입니다. OrcaRouter는 이를 그대로 사용자에게 전달합니다. 이는 OrcaRouter가 투명한 프록시 역할을 하는 많은 모델의 가격 책정 방식과 일치합니다. 사용자는 소비한 토큰에 대해서만 비용을 지불합니다. 캐싱이나 프리미엄 지원과 같은 선택적 기능에는 별도의 수수료가 발생할 수 있지만, 기본 토큰당 비용에는 인상분이 없습니다.
`google/gemini-2.5-pro-preview-tts`를 사용하려면 기본 URL `https://api.orcarouter.ai/v1`에서 OrcaRouter의 OpenAI 호환 API로 요청을 보내세요. API 호출 시 모델 ID로 `'google/gemini-2.5-pro-preview-tts'`를 사용하세요. 요청 형식은 표준 OpenAI 채팅 완료 구조를 따르며, `model` 필드, 텍스트 프롬프트(시스템 및/또는 사용자 역할 포함)가 포함된 `messages` 배열, 그리고 `temperature` 및 `max_tokens` 같은 표준 매개변수를 포함합니다. 응답에는 생성된 오디오 토큰이 포함되며, 클라이언트에서 이를 디코딩하여 음성으로 재생할 수 있습니다. 인증은 OrcaRouter가 제공하는 API 키를 통해 이루어집니다.
API는 'model', 'messages'(role과 content를 가진 객체 배열), 'temperature'(오디오 출력 변동성 제어), 'max_tokens'(생성된 오디오 길이 제한), 'top_p'를 포함한 표준 OpenAI 호환 파라미터를 지원합니다. TTS 모델로서 음성 스타일이나 속도를 위한 추가 파라미터가 있을 수 있으나, 제공된 정보에는 문서화되지 않았습니다. 최신 지원 필드는 OrcaRouter의 API 문서를 참조하세요. 'response_format' 파라미터는 오디오 인코딩(예: wav 또는 mp3)을 지정할 수 있습니다. 기본적으로 지원되지 않는 경우 반환된 토큰 스트림을 디코딩해야 할 수 있습니다.
현재 다른 TTS 서비스(예: Google Cloud Text-to-Speech, Amazon Polly)를 사용 중이라면 OrcaRouter를 통해 google/gemini-2.5-pro-preview-tts로 마이그레이션할 때 API 엔드포인트와 요청 형식을 업데이트해야 합니다. OrcaRouter는 OpenAI 호환 엔드포인트를 사용하므로, 공급자별 SDK에서 OpenAI 호환 SDK로 전환하게 됩니다. 기존 기본 URL을 https://api.orcarouter.ai/v1로 변경하고, 모델 ID 'google/gemini-2.5-pro-preview-tts'를 사용하며, 요청 본문을 채팅 완료 스키마에 맞게 조정하세요. 응답 처리 방식도 수정해야 할 수 있습니다. 오디오 파일을 직접 수신하는 대신 디코딩해야 할 토큰화된 출력을 받게 됩니다. 샘플 입력으로 테스트해 보세요.
인증은 Authorization 헤더에 API 키를 포함하여 수행됩니다(형식: Bearer YOUR_API_KEY). API 키는 OrcaRouter 계정에서 얻을 수 있습니다. 속도 제한은 OrcaRouter가 요금제에 따라 설정하며, Google의 제한과 동일하지 않습니다. 대량 사용의 경우 OrcaRouter에 문의하여 제한을 조정하세요. 미리보기 모델은 Google의 추가 제약이 있을 수 있습니다. '모델을 사용할 수 없음'과 같은 오류가 발생하면 OrcaRouter 요금제에 이 모델이 포함되어 있는지 확인하세요. 이 모델에 대한 특정 속도 제한은 공개되지 않았지만, 표준 모범 사례(지수 백오프를 사용한 재시도)가 권장됩니다.
google/gemini-2.5-pro-preview-tts는 텍스트-음성 변환에 특화된 Gemini 2.5 Pro 제품군의 변형입니다. 다른 Gemini 2.5 Pro 모델은 범용 모델로 텍스트, 이미지, 오디오, 비디오 입력을 처리하지만 기본적으로 음성 출력을 생성하지 않습니다. 이 TTS 변형은 멀티모달 입력을 제거하고 텍스트에서 오디오를 생성하는 데 집중합니다. 운율과 속도에 대해 동일한 기본 언어 이해를 사용할 가능성이 높지만 추론, 코딩 또는 멀티모달 분석에는 적합하지 않습니다. 멀티모달 입력을 포기하지 않고 TTS 기능이 필요한 경우 표준 Gemini 모델과 별도의 TTS 파이프라인을 결합하면 됩니다. 미리보기 TTS는 더 간소화된 파이프라인을 제공합니다.
OrcaRouter는 다양한 제공업체의 TTS 모델에 대한 액세스를 제공합니다. Google의 이 모델은 대규모 언어 모델 아키텍처를 기반으로 하여, 기존의 연쇄적 또는 파라메트릭 TTS 시스템보다 더 자연스럽고 맥락을 인식하는 음성을 생성할 수 있습니다. 그러나 낮은 지연 시간과 높은 처리량을 위해 설계된 특화된 신경망 TTS 모델에 비해 토큰당 속도가 느리고 비용이 더 많이 들 수 있습니다. 많은 인기 있는 TTS 서비스는 토큰당이 아닌 문자당 또는 오디오 초당 요금을 부과하므로 직접적인 비용 비교가 까다롭습니다. 매우 낮은 비용이 필요한 프로덕션 배포의 경우, 전용 TTS 모델이 더 적합할 수 있습니다. Google의 모델은 가장 높은 출력 품질이 더 높은 출력 토큰 비용을 정당화하는 사용 사례에 가장 적합합니다.
Google의 최신 Gemini 아키텍처에서 최첨단 음성 품질이 필요하고, Google Cloud 자격 증명을 관리하지 않고 표준 OpenAI 호환 API를 통해 액세스하려는 경우 이 모델을 선택하세요. 제로 마크업 가격 책정은 투명성을 보장합니다. 대화형 AI나 내러티브 콘텐츠와 같이 자연스러움이 중요한 애플리케이션에 이상적입니다. 미리보기 상태를 통해 귀하의 도메인에 대한 품질을 평가하기 위한 초기 실험이 가능합니다. 그러나 100ms 미만의 지연 시간으로 실시간 스트리밍이 필요한 경우 전용 스트리밍 TTS 모델이 더 나을 수 있습니다. 또한 예산에 민감한 경우 일반적인 사용 사례에 대한 출력 토큰 소비를 테스트하여 비용이 수용 가능한지 확인하세요.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1voice| 입력 / 1M tokens | $1.00 |
| 출력 / 1M tokens | $20.00 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
GET /api/public/models/google/gemini-2.5-pro-preview-tts열기 @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts