Google Gemini 2.5 Pro pratinjau dengan TTS, diakses melalui OrcaRouter tanpa markup.
google/gemini-2.5-pro-preview-tts adalah model text-to-speech pratinjau buatan Google, dibangun di atas fondasi Gemini 2.5 Pro. Model ini mengubah input teks menjadi output audio ucapan. Model ini…
Kemampuan utama dari google/gemini-2.5-pro-preview-tts adalah mengonversi teks tertulis menjadi audio ucapan. Model ini dibangun di atas Gemini 2.5 Pro milik Google, yang menunjukkan pemahaman bahasa yang kuat, sehingga seharusnya menghasilkan frasa yang alami, intonasi yang tepat, dan pelafalan yang jelas. Model ini hanya menerima input teks, sehingga tidak multimodal pada sisi input. Model ini tidak menangani input audio, gambar, atau video. Outputnya kemungkinan berupa audio dalam format digital standar. Sebagai model TTS, model ini dapat menangani banyak bahasa, tetapi dukungan bahasa spesifik belum diungkapkan untuk pratinjau ini. Model ini dioptimalkan untuk menghasilkan ucapan, bukan untuk kemampuan Gemini 2.5 Pro lainnya seperti penalaran atau pembuatan kode.
Model ini unggul dalam aplikasi yang memerlukan konversi teks tertulis menjadi ucapan yang terdengar alami. Kasus penggunaan terbaik meliputi asisten suara di mana asisten membacakan respons dengan lantang, narasi audiobook dan podcast otomatis, fitur aksesibilitas yang membacakan teks di layar untuk pengguna tunanetra, serta sistem layanan pelanggan yang menyampaikan respons secara lisan. Model ini juga dapat digunakan untuk aplikasi pembelajaran bahasa yang memodelkan pelafalan yang benar, atau untuk menghasilkan konten suara dari feed RSS atau artikel. Karena status pratinjaunya, disarankan untuk menguji secara menyeluruh sesuai kebutuhan bahasa, domain, atau gaya spesifik Anda sebelum berkomitmen pada penerapan skala besar.
Meskipun google/gemini-2.5-pro-preview-tts menawarkan kualitas TTS premium, ia mungkin berlebihan untuk bunyi bip sederhana atau suara notifikasi, atau untuk aplikasi yang mengutamakan latensi rendah tetapi waktu pemrosesan model lebih lama daripada chip TTS khusus. Jika Anda hanya membutuhkan ucapan dasar yang monoton atau memiliki volume sangat tinggi dengan batasan anggaran yang ketat, model TTS yang lebih ringan (misalnya, dari penyedia lain di OrcaRouter) dengan biaya per token yang lebih rendah mungkin lebih sesuai. Selain itu, jika kasus penggunaan Anda memerlukan streaming real-time dengan latensi yang sangat rendah, evaluasi apakah model pratinjau Gemini memenuhi persyaratan kecepatan Anda, karena model yang lebih besar dapat menyebabkan latensi token pertama yang lebih tinggi.
Mulai dari rilis pratinjau model, Google belum menerbitkan skor benchmark spesifik untuk varian gemini-2.5-pro-preview-tts. Model dasar Gemini 2.5 Pro yang mendasarinya telah menunjukkan kinerja yang kuat dalam tugas pemahaman bahasa dan penalaran, tetapi metrik kualitas ucapan varian TTS (mis., Mean Opinion Score, Word Error Rate) belum dibagikan secara publik. Tanpa benchmark resmi, OrcaRouter merekomendasikan mengevaluasi model pada set uji input teks Anda sendiri, mengukur kualitas audio subjektif, latensi, dan keandalan saat dibebani. Untuk keputusan produksi, lakukan perbandingan A/B Anda sendiri terhadap layanan TTS lainnya.
Angka latensi spesifik untuk google/gemini-2.5-pro-preview-tts belum diungkapkan secara publik. Sebagai model TTS yang didasarkan pada arsitektur model bahasa besar, model ini mungkin memiliki latensi yang lebih tinggi dibandingkan dengan model TTS saraf khusus yang dioptimalkan untuk streaming real-time. Faktor yang memengaruhi kecepatan meliputi panjang teks masukan, waktu pemrosesan internal model, dan perjalanan pulang-pergi jaringan ke titik akhir OrcaRouter. Untuk aplikasi di mana latensi rendah sangat penting (misalnya, AI percakapan), uji model ini dengan panjang masukan tipikal untuk menilai kesesuaiannya. Pertimbangkan untuk menggunakan streaming atau pembuatan teks terpotong jika API mendukungnya.
Kelebihan: Dibangun di atas arsitektur Gemini 2.5 Pro canggih milik Google, kemungkinan menghasilkan ucapan yang sangat alami dan ekspresif dengan prosodi dan pengucapan yang baik. Akses melalui API kompatibel OpenAI milik OrcaRouter menyederhanakan integrasi. Tidak ada markup pada harga penyedia membuat biaya dapat diprediksi. Keterbatasan: Modalitas input hanya teks; tidak dapat memproses audio atau modalitas lainnya. Sebagai pratinjau, mungkin memiliki kasus tepi yang belum ditemukan atau kualitas yang tidak konsisten. Ukuran jendela konteks tidak diketahui, membatasi panjang teks yang dapat dikonversi dalam satu permintaan. Detail format keluaran tidak disediakan. Ini tidak dirancang untuk tugas-tugas seperti pengenalan suara atau kloning suara.
Harga untuk google/gemini-2.5-pro-preview-tts berdasarkan penggunaan token, dikenakan biaya $1,00 per 1 juta token input dan $20,00 per 1 juta token output. Token input mencakup teks perintah dan instruksi apa pun. Token output mewakili audio yang dihasilkan. OrcaRouter menagih dengan tarif penyedia yang tepat tanpa markup, artinya Anda hanya membayar apa yang dikenakan Google, ditambah pajak yang berlaku. Tidak ada komitmen minimum atau biaya bulanan. Penggunaan diukur per permintaan dan digabungkan pada faktur OrcaRouter Anda. Karena jumlah token output TTS bisa tinggi (audio lebih padat token daripada teks), biaya output adalah pengeluaran utama.
Harga token output ($20 per 1M) secara signifikan lebih tinggi daripada token input ($1 per 1M). Ini tipikal untuk model generatif karena token output memerlukan lebih banyak komputasi. Untuk text-to-speech, output audio direpresentasikan sebagai serangkaian token, dan mengonversi teks menjadi ucapan melibatkan pembuatan urutan panjang token audio. Total biaya untuk tugas tertentu tergantung pada panjang output audio relatif terhadap teks input. Jika Anda perlu menghasilkan ucapan panjang (misalnya, buku audio penuh), biaya dapat bertambah. Untuk perintah pendek (misalnya, satu kalimat), biaya minimal. Pantau penggunaan token Anda untuk memproyeksikan biaya.
Tidak, OrcaRouter tidak menambahkan markup apa pun pada tarif penyedia untuk google/gemini-2.5-pro-preview-tts. Harga yang tercantum sebesar $1.00 per 1M token input dan $20.00 per 1M token output adalah persis seperti yang dikenakan oleh Google. OrcaRouter meneruskannya langsung kepada Anda. Ini konsisten dengan model harga OrcaRouter untuk banyak model di mana platform bertindak sebagai proxy transparan. Anda hanya membayar untuk token yang Anda gunakan. Fitur opsional seperti caching atau dukungan premium mungkin dikenakan biaya terpisah, tetapi biaya dasar per token tidak memiliki markup.
Untuk menggunakan google/gemini-2.5-pro-preview-tts, buat permintaan ke API kompatibel OpenAI milik OrcaRouter di base URL https://api.orcarouter.ai/v1. Gunakan ID model 'google/gemini-2.5-pro-preview-tts' dalam panggilan API Anda. Format permintaan mengikuti struktur chat completions standar OpenAI dengan kolom 'model', array 'messages' yang berisi teks prompt Anda (dengan peran sistem dan/atau pengguna), serta parameter standar seperti temperature dan max_tokens. Respons akan berisi token audio yang dihasilkan, yang dapat didekode oleh klien Anda untuk diputar sebagai ucapan. Autentikasi dilakukan melalui kunci API yang disediakan oleh OrcaRouter.
API ini mendukung parameter standar yang kompatibel dengan OpenAI termasuk 'model', 'messages' (array objek dengan peran dan konten), 'temperature' (untuk mengontrol variabilitas keluaran audio), 'max_tokens' (untuk membatasi panjang audio yang dihasilkan), dan 'top_p'. Sebagai model TTS, mungkin terdapat parameter tambahan untuk gaya atau kecepatan suara, tetapi ini belum didokumentasikan dalam fakta yang tersedia. Lihat dokumentasi API OrcaRouter untuk bidang yang didukung terbaru. Parameter 'response_format' mungkin memungkinkan menentukan pengkodean audio (misalnya, wav atau mp3). Jika tidak didukung secara default, Anda mungkin perlu mendekode aliran token yang dikembalikan.
Jika Anda saat ini menggunakan layanan TTS yang berbeda (misalnya, Google Cloud Text-to-Speech, Amazon Polly), migrasi ke google/gemini-2.5-pro-preview-tts melalui OrcaRouter melibatkan pembaruan endpoint API dan format permintaan Anda. OrcaRouter menggunakan endpoint yang kompatibel dengan OpenAI, sehingga Anda akan beralih dari SDK khusus penyedia ke endpoint yang kompatibel dengan OpenAI. Ganti base URL Anda yang ada dengan https://api.orcarouter.ai/v1, gunakan model ID 'google/gemini-2.5-pro-preview-tts', dan sesuaikan body permintaan Anda agar sesuai dengan skema chat completions. Anda mungkin perlu mengubah cara menangani respons: alih-alih menerima file audio secara langsung, Anda akan mendapatkan output tokenized yang perlu Anda dekode. Uji dengan input sampel.
Autentikasi dilakukan dengan menyertakan kunci API di header Authorization (format: Bearer YOUR_API_KEY). Anda mendapatkan kunci API dari akun OrcaRouter Anda. Batas kecepatan ditetapkan oleh OrcaRouter berdasarkan paket Anda; batas tersebut tidak sama dengan batas Google. Untuk penggunaan volume tinggi, hubungi OrcaRouter untuk menyesuaikan batas. Model pratinjau mungkin memiliki batasan tambahan dari Google – jika Anda menemui kesalahan seperti 'model tidak tersedia', periksa apakah paket OrcaRouter Anda mencakup model ini. Tidak ada batas kecepatan khusus yang diungkapkan untuk model ini, tetapi praktik terbaik standar (coba ulang dengan backoff eksponensial) direkomendasikan.
google/gemini-2.5-pro-preview-tts adalah varian khusus dari keluarga Gemini 2.5 Pro yang disesuaikan untuk text-to-speech. Model Gemini 2.5 Pro lainnya bersifat serbaguna dan menangani input teks, gambar, audio, dan video; mereka tidak secara native menghasilkan output ucapan. Varian TTS ini menghilangkan input multimodal dan berfokus pada menghasilkan audio dari teks. Kemungkinan menggunakan pemahaman bahasa yang sama untuk prosodi dan kecepatan, tetapi tidak cocok untuk penalaran, pengkodean, atau analisis multimodal. Jika Anda membutuhkan kemampuan TTS tanpa melepaskan input multimodal, Anda akan menggabungkan model Gemini standar dengan pipeline TTS terpisah. TTS pratinjau menyediakan pipeline yang lebih sederhana.
OrcaRouter menawarkan akses ke model TTS dari berbagai penyedia. Model dari Google ini didasarkan pada arsitektur model bahasa besar, yang dapat menghasilkan ucapan yang lebih natural dan sadar konteks dibandingkan sistem TTS konkatenatif atau parametrik yang lebih lama. Namun, model ini mungkin lebih lambat dan lebih mahal per token dibandingkan model TTS neural khusus yang dirancang untuk latensi rendah dan throughput tinggi. Banyak layanan TTS populer mengenakan biaya per karakter atau per detik audio, bukan per token, sehingga perbandingan biaya langsung menjadi rumit. Untuk deployments produksi yang membutuhkan biaya sangat rendah, model TTS khusus mungkin lebih disukai. Model Google paling cocok untuk kasus penggunaan di mana kualitas output tertinggi sepadan dengan biaya token output yang lebih tinggi.
Pilih model ini jika Anda memerlukan kualitas suara mutakhir dari arsitektur Gemini terbaru Google dan ingin mengaksesnya melalui API standar yang kompatibel dengan OpenAI tanpa perlu mengelola kredensial Google Cloud. Penetapan harga tanpa markup memastikan transparansi. Model ini ideal untuk aplikasi yang mengutamakan kewajaran, seperti AI percakapan atau konten naratif. Status pratinjau memungkinkan eksperimen awal untuk mengevaluasi kualitasnya di domain Anda. Namun, jika Anda memerlukan streaming waktu nyata dengan latensi di bawah 100 ms, model TTS streaming khusus mungkin lebih baik. Selain itu, jika anggaran Anda sensitif, ujilah konsumsi token output untuk kasus penggunaan umum guna memastikan biaya dapat diterima.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1voice| Input / 1M token | $1.00 |
| Output / 1M token | $20.00 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/google/gemini-2.5-pro-preview-ttsBuka @misc{orcarouter_gemini_2_5_pro_preview_tts,
title = {google/gemini-2.5-pro-preview-tts API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts}
}google. (n.d.). google/gemini-2.5-pro-preview-tts API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-pro-preview-tts