Google Gemini 2.5 Pro preview z TTS, dostępny przez OrcaRouter z zerową marżą.
google/gemini-2.5-pro-preview-tts to eksperymentalny model zamiany tekstu na mowę (text-to-speech) firmy Google, zbudowany na bazie Gemini 2.5 Pro. Przekształca on wprowadzony tekst na mówiony…
Podstawową funkcją google/gemini-2.5-pro-preview-tts jest zamiana tekstu pisanego na mowę. Model opiera się na Google Gemini 2.5 Pro, co zapewnia zaawansowane rozumienie języka, a w konsekwencji naturalne frazowanie, odpowiednią intonację i wyraźną wymowę. Model przyjmuje wyłącznie tekst wejściowy, więc nie jest multimodalny po stronie wejścia – nie obsługuje wejścia audio, obrazów ani wideo. Wynikiem jest najprawdopodobniej audio w standardowym cyfrowym formacie. Jako model TTS może obsługiwać wiele języków, jednak konkretna lista wspieranych języków dla tej wersji preview nie została ujawniona. Model jest zoptymalizowany do generowania mowy, a nie do innych możliwości Gemini 2.5 Pro, takich jak wnioskowanie czy generowanie kodu.
Model sprawdza się w zastosowaniach wymagających konwersji tekstu pisanego na naturalnie brzmiącą mowę. Najlepsze przypadki użycia obejmują asystentów głosowych, gdzie asystent odczytuje odpowiedzi na głos, automatyczną narrację audiobooków i podcastów, funkcje ułatwień dostępu odczytujące tekst na ekranie dla osób niedowidzących oraz systemy obsługi klienta dostarczające odpowiedzi głosowe. Może być również używany w aplikacjach do nauki języków, gdzie modelowana jest poprawna wymowa, lub do generowania treści głosowych z kanałów RSS lub artykułów. Ze względu na status podglądu, zaleca się dokładne przetestowanie pod kątem konkretnego języka, domeny lub wymagań stylistycznych przed przystąpieniem do wdrożenia na dużą skalę.
Chociaż google/gemini-2.5-pro-preview-tts oferuje najwyższą jakość TTS, może być przesadą w przypadku prostych dźwięków lub dźwięków powiadomień, albo aplikacji, gdzie niskie opóźnienie jest krytyczne, ale czas przetwarzania modelu jest dłuższy niż w przypadku dedykowanych układów TTS. Jeśli potrzebujesz tylko podstawowej, monotonnej mowy lub masz bardzo dużą liczbę zapytań przy ścisłych ograniczeniach budżetowych, lżejszy model TTS (np. od innych dostawców na OrcaRouter) z niższym kosztem na token może być bardziej odpowiedni. Ponadto, jeśli Twój przypadek użycia wymaga strumieniowania w czasie rzeczywistym z bardzo niskim opóźnieniem, oceń, czy model preview Gemini spełnia Twoje wymagania dotyczące szybkości, ponieważ większe modele mogą wprowadzać wyższe opóźnienie pierwszego tokena.
Od czasu wydania wersji zapoznawczej modelu, Google nie opublikowało konkretnych wyników testów porównawczych dla wariantu gemini-2.5-pro-preview-tts. Podstawowy model Gemini 2.5 Pro wykazał się wysoką wydajnością w zadaniach związanych z rozumieniem języka i wnioskowaniem, ale wskaźniki jakości mowy wariantu TTS (np. Mean Opinion Score, Word Error Rate) nie zostały publicznie udostępnione. Bez oficjalnych testów porównawczych, OrcaRouter zaleca ocenę modelu na własnym zestawie testowym danych wejściowych tekstu, mierząc subiektywną jakość dźwięku, opóźnienia i niezawodność pod obciążeniem. W przypadku decyzji produkcyjnych przeprowadź własne porównania A/B z innymi usługami TTS.
Szczegółowe dane dotyczące opóźnień dla google/gemini-2.5-pro-preview-tts nie zostały publicznie ujawnione. Jako model TTS oparty na architekturze dużego modelu językowego może wykazywać wyższe opóźnienia w porównaniu do wyspecjalizowanych neuronowych modeli TTS zoptymalizowanych do strumieniowania w czasie rzeczywistym. Czynniki wpływające na szybkość obejmują długość tekstu wejściowego, wewnętrzny czas przetwarzania modelu oraz opóźnienie sieciowe do punktów końcowych OrcaRouter. W zastosowaniach, w których niskie opóźnienia są kluczowe (np. konwersacyjna AI), przetestuj ten model z typowymi długościami wejścia, aby ocenić jego przydatność. Rozważ użycie strumieniowania lub generowania tekstu w fragmentach, jeśli API to obsługuje.
Mocne strony: Zbudowany na zaawansowanej architekturze Google Gemini 2.5 Pro, prawdopodobnie generuje bardzo naturalną, ekspresyjną mowę z dobrą prozodią i wymową. Dostęp za pośrednictwem zgodnego z OpenAI API OrcaRouter upraszcza integrację. Brak narzutów na ceny dostawcy sprawia, że koszty są przewidywalne. Ograniczenia: Modalność wejściowa ograniczona wyłącznie do tekstu; nie może przetwarzać dźwięku ani innych modalności. Jako wersja zapoznawcza może zawierać nieodkryte przypadki brzegowe lub charakteryzować się nierówną jakością. Rozmiar okna kontekstowego jest nieznany, co ogranicza długość tekstu, który można przekonwertować w pojedynczym żądaniu. Nie podano szczegółów dotyczących formatu wyjściowego. Nie jest przeznaczony do zadań takich jak rozpoznawanie mowy czy klonowanie głosu.
Cennik dla google/gemini-2.5-pro-preview-tts opiera się na użyciu tokenów, kosztuje 1,00 USD za 1 milion tokenów wejściowych i 20,00 USD za 1 milion tokenów wyjściowych. Tokeny wejściowe obejmują podpowiedź tekstową oraz wszelkie instrukcje. Tokeny wyjściowe reprezentują wygenerowane audio. OrcaRouter rozlicza według dokładnej stawki dostawcy bez marży, co oznacza, że płacisz tylko tyle, ile pobiera Google, plus wszelkie obowiązujące podatki. Nie ma minimalnych zobowiązań ani miesięcznych opłat. Zużycie jest mierzone na żądanie i sumowane na fakturze OrcaRouter. Ponieważ liczba tokenów wyjściowych TTS może być wysoka (audio jest bardziej gęste tokenowo niż tekst), koszt wyjściowy jest głównym wydatkiem.
Cena tokenów wyjściowych ($20 za 1M) jest znacznie wyższa niż tokenów wejściowych ($1 za 1M). Jest to typowe dla modeli generatywnych, ponieważ tokeny wyjściowe wymagają więcej mocy obliczeniowej. W przypadku text-to-speech dźwięk wyjściowy jest reprezentowany jako seria tokenów, a konwersja tekstu na mowę polega na generowaniu długiej sekwencji tokenów dźwiękowych. Całkowity koszt konkretnego zadania zależy od długości wyjściowego dźwięku w stosunku do wejściowego tekstu. Jeśli trzeba wygenerować długie fragmenty mowy (np. cały audiobook), koszty mogą się kumulować. W przypadku krótkich podpowiedzi (np. pojedyncze zdanie) koszty są minimalne. Monitoruj użycie tokenów, aby prognozować koszty.
Nie, OrcaRouter nie dodaje żadnego narzutu do stawki dostawcy dla google/gemini-2.5-pro-preview-tts. Podane ceny 1,00 USD za 1M tokenów wejściowych i 20,00 USD za 1M tokenów wyjściowych to dokładnie to, co pobiera Google. OrcaRouter przekazuje je bezpośrednio Tobie. Jest to zgodne z modelem cenowym OrcaRouter dla wielu modeli, w którym platforma działa jako przezroczyste proxy. Płacisz tylko za tokeny, które zużywasz. Wszelkie opcjonalne funkcje, takie jak buforowanie lub wsparcie premium, mogą wiązać się z dodatkowymi opłatami, ale podstawowy koszt za token nie zawiera narzutu.
Aby użyć google/gemini-2.5-pro-preview-tts, wysyłaj żądania do API OrcaRouter kompatybilnego z OpenAI pod adresem bazowym https://api.orcarouter.ai/v1. Używaj identyfikatora modelu 'google/gemini-2.5-pro-preview-tts' w swoich wywołaniach API. Format żądania jest zgodny ze standardową strukturą OpenAI chat completions z polem 'model', tablicą 'messages' zawierającą prompt tekstowy (z rolą system i/lub user) oraz standardowymi parametrami, takimi jak temperature i max_tokens. Odpowiedź będzie zawierać wygenerowane tokeny audio, które klient może zdekodować, aby odtworzyć jako mowę. Autoryzacja odbywa się za pomocą klucza API dostarczonego przez OrcaRouter.
API obsługuje standardowe parametry zgodne z OpenAI, w tym 'model', 'messages' (tablica obiektów z rolami i treścią), 'temperature' (do kontrolowania zmienności wyjścia audio), 'max_tokens' (aby ograniczyć długość generowanego audio) oraz 'top_p'. Jako model TTS, mogą istnieć dodatkowe parametry dla stylu głosu lub prędkości, ale nie zostały one udokumentowane w dostępnych faktach. Aby uzyskać najnowsze obsługiwane pola, zapoznaj się z dokumentacją API OrcaRouter. Parametr 'response_format' może umożliwiać określenie kodowania audio (np. wav lub mp3). Jeśli nie jest obsługiwany domyślnie, może być konieczne zdekodowanie zwróconego strumienia tokenów.
Jeśli obecnie korzystasz z innej usługi TTS (np. Google Cloud Text-to-Speech, Amazon Polly), migracja do google/gemini-2.5-pro-preview-tts za pośrednictwem OrcaRouter wymaga aktualizacji punktu końcowego (endpoint) API i formatu żądań. OrcaRouter używa punktów końcowych kompatybilnych z OpenAI, więc przejdziesz z dostawcy-specyficznego SDK na SDK kompatybilne z OpenAI. Zastąp swój dotychczasowy podstawowy URL adresem https://api.orcarouter.ai/v1, użyj identyfikatora modelu 'google/gemini-2.5-pro-preview-tts' i dostosuj treści swoich żądań do schematu chat completions. Może być konieczna modyfikacja sposobu obsługi odpowiedzi: zamiast bezpośredniego odbierania plików audio otrzymasz tokenizowane wyjście, które będziesz musiał zdekodować. Przetestuj na przykładowych danych wejściowych.
Uwierzytelnianie odbywa się poprzez dodanie klucza API w nagłówku Authorization (format: Bearer YOUR_API_KEY). Klucz API uzyskujesz ze swojego konta OrcaRouter. Limity zapytań są ustawiane przez OrcaRouter na podstawie Twojego planu – nie są takie same jak limity Google. W przypadku dużego użycia skontaktuj się z OrcaRouter w celu dostosowania limitów. Model w wersji preview może podlegać dodatkowym ograniczeniom ze strony Google – jeśli napotkasz błędy takie jak 'model not available', sprawdź, czy Twój plan OrcaRouter obejmuje ten model. Dla tego modelu nie są określone konkretne limity zapytań, ale zalecane są standardowe dobre praktyki (ponawianie prób z wykładniczym opóźnieniem).
google/gemini-2.5-pro-preview-tts to wyspecjalizowany wariant rodziny Gemini 2.5 Pro przeznaczony do zamiany tekstu na mowę. Inne modele Gemini 2.5 Pro są ogólnego przeznaczenia i obsługują tekst, obrazy, audio oraz wejście wideo; nie generują natywnie wyjścia mowy. Ten wariant TTS usuwa obsługę multimodalnego wejścia i koncentruje się na generowaniu dźwięku z tekstu. Prawdopodobnie wykorzystuje to samo bazowe rozumienie języka do prozodii i tempa, ale nie nadaje się do wnioskowania, kodowania ani analizy multimodalnej. Jeśli potrzebujesz możliwości TTS bez rezygnowania z multimodalnego wejścia, można połączyć standardowy model Gemini z osobnym potokiem TTS. Wersja preview TTS zapewnia bardziej usprawniony potok.
OrcaRouter oferuje dostęp do modeli TTS od różnych dostawców. Ten model od Google oparty jest na architekturze dużego modelu językowego, co może generować bardziej naturalną i kontekstowo świadomą mowę niż starsze systemy TTS oparte na konkatenacji lub parametryczne. Może być jednak wolniejszy i droższy w przeliczeniu na token w porównaniu do wyspecjalizowanych neuronowych modeli TTS zaprojektowanych z myślą o niskim opóźnieniu i wysokiej przepustowości. Wiele popularnych usług TTS nalicza opłaty za znak lub za sekundę audio, a nie za token, co utrudnia bezpośrednie porównanie kosztów. W przypadku wdrożeń produkcyjnych wymagających ekstremalnie niskich kosztów lepszym wyborem mogą być dedykowane modele TTS. Model Google najlepiej sprawdza się w przypadkach użycia, gdzie najwyższa jakość wyjściowa uzasadnia wyższy koszt tokena wyjściowego.
Wybierz ten model, jeśli potrzebujesz najnowocześniejszej jakości mowy z najnowszej architektury Gemini od Google i chcesz uzyskać do niej dostęp za pomocą standardowego API zgodnego z OpenAI, bez zarządzania poświadczeniami Google Cloud. Ceny bez marży zapewniają przejrzystość. Jest idealny do zastosowań, w których naturalność jest kluczowa, takich jak konwersacyjna AI czy treści narracyjne. Status wersji zapoznawczej umożliwia wczesne eksperymenty, aby ocenić jej jakość dla Twojej domeny. Jeśli jednak potrzebujesz strumieniowania w czasie rzeczywistym z opóźnieniem poniżej 100 ms, lepszym wyborem może być dedykowany model TTS do strumieniowania. Ponadto, jeśli Twój budżet jest wrażliwy, przetestuj zużycie tokenów wyjściowych dla typowych przypadków użycia, aby upewnić się, że koszt jest akceptowalny.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1voice| Wejście / 1M tokenów | $1.00 |
| Wyjście / 1M tokenów | $20.00 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/google/gemini-2.5-pro-preview-ttsOtwórz @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts