Model text-to-speech Google yang cepat dan efisien biaya untuk pembuatan audio secara real-time, diakses melalui OrcaRouter.
google/gemini-3.1-flash-tts-preview adalah model text-to-speech dari Google, bagian dari keluarga Gemini Flash. Model ini menerima input teks dan menghasilkan output audio ucapan. Model ini…
Kemampuan utamanya adalah mengubah teks tertulis menjadi suara yang terdengar alami. Model ini dirancang untuk kecepatan, memanfaatkan arsitektur Flash untuk mengurangi latensi. Apakah model ini mendukung banyak bahasa dan suara? Dukungan bahasa dan suara pratinjau spesifik ini tidak dirinci dalam fakta yang diberikan; Anda harus berkonsultasi dengan dokumentasi Google untuk opsi suara terkini. Model ini dapat menangani berbagai masukan teks termasuk tanda baca, angka, dan singkatan, menghasilkan keluaran ucapan yang mencerminkan ritme dan nada yang dimaksudkan.
Kasus penggunaan terbaik termasuk aplikasi apa pun di mana generasi ucapan latensi rendah sangat penting: asisten suara real-time, dubbing terjemahan langsung, chatbot interaktif dengan keluaran suara, dan sistem telepon otomatis. Ini juga unggul untuk pemrosesan batch ketika Anda perlu menghasilkan banyak klip audio pendek dengan cepat. Produsen konten dapat menggunakannya untuk sulih suara dinamis dalam video game atau buku audio. Karena biaya keluaran tinggi relatif terhadap masukan, ini paling ekonomis ketika audio keluaran ringkas.
Jika kasus penggunaan Anda melibatkan pembuatan audio yang sangat panjang (misalnya, ucapan berjam-jam) atau tidak memerlukan latensi rendah, pertimbangkan model TTS batch dengan biaya output per token yang lebih rendah. Untuk aplikasi di mana volume input mendominasi (misalnya, banyak prompt pendek), biaya input yang murah membuat model Flash ini menarik. Untuk skenario yang memerlukan kualitas output yang sangat tinggi—seperti karakter yang ekspresif secara emosional—Anda dapat mengevaluasi model TTS premium dari Google atau penyedia lainnya. Selalu pantau volume token total dan persyaratan latensi.
Sebagai model Gemini Flash, varian TTS ini dioptimalkan untuk latensi rendah. Tolok ukur latensi spesifik (misalnya, waktu hingga paket audio pertama) tidak disediakan dalam fakta yang tersedia. Dalam praktiknya, model Flash sering merespons dalam hitungan ratusan milidetik untuk input pendek. Latensi dapat bervariasi berdasarkan panjang keluaran, kondisi jaringan, dan beban permintaan bersamaan. Perutean OrcaRouter dapat menambahkan overhead minimal. Untuk aplikasi waktu nyata, uji dengan durasi audio yang Anda harapkan dalam kondisi beban.
Kekuatan termasuk biaya input rendah ($1.00/1M tokens), generasi cepat, dan infrastruktur tangguh Google. Status pratinjau berarti kualitas dan ketersediaan model dapat berubah. Keterbatasannya adalah biaya output yang tinggi ($20.00/1M tokens) dibandingkan model teks. Selain itu, kualitas audio output—seperti kealamian, variasi aksen, dan prosodi—tidak di-benchmark di sini. Anda harus mengevaluasi kualitas suara model untuk domain spesifik Anda (misalnya, jargon teknis, rentang emosional) sebelum penerapan produksi.
Tidak ada skor tolok ukur untuk google/gemini-3.1-flash-tts-preview yang disediakan dalam fakta yang tersedia. Model TTS sering dievaluasi pada metrik seperti Mean Opinion Score (MOS) untuk naturalitas, word error rate (WER) untuk kejelasan, dan persentil latensi. Tanpa angka spesifik, Anda harus menjalankan evaluasi Anda sendiri menggunakan prompt representatif untuk menilai kualitas dan kecepatan relatif terhadap kebutuhan Anda. OrcaRouter tidak menambah atau mengubah kinerja model.
Fakta yang tersedia tidak menyebutkan bahasa yang didukung atau kemampuan aksen untuk pratinjau TTS ini. Model TTS Google yang lebih luas biasanya mendukung banyak bahasa, tetapi cakupan varian spesifik ini tidak diketahui. Anda harus menguji dengan teks multibahasa untuk memastikan kualitas keluaran. Untuk bahasa Inggris, kinerja kemungkinan kuat mengingat investasi Google. Untuk bahasa yang kurang umum, pertimbangkan untuk menghubungi Google secara langsung atau menguji dengan teks sampel melalui API OrcaRouter.
Harga mengikuti tarif resmi Google tanpa markup dari OrcaRouter. Token masukan (teks) berharga $1.00 per 1 juta token. Token keluaran (audio) berharga $20.00 per 1 juta token. Token keluaran dihasilkan per unit audio; rasio token-ke-waktu yang tepat tidak ditentukan. Anda ditagih untuk token masukan dan keluaran yang digunakan dalam setiap permintaan. Tidak ada biaya platform tambahan atau persyaratan pengeluaran minimum. Penagihan dilakukan melalui metode pembayaran OrcaRouter yang sudah ada.
Token masukan 20 kali lebih murah daripada token keluaran. Hal ini mendorong pengiriman perintah teks yang lebih panjang (dalam batas token) untuk menghasilkan keluaran audio yang lebih panjang secara proporsional, karena biaya masukan tetap rendah. Contohnya, menghasilkan klip audio berdurasi 1 menit dapat menghabiskan banyak token keluaran seharga $20/1M, sementara perintah teks mungkin hanya memakan biaya beberapa sen. Optimalkan dengan membuat keluaran singkat sedapat mungkin. Jika kasus penggunaan Anda menghasilkan audio yang sangat panjang, biaya keluaran per permintaan dapat bertambah dengan cepat.
Fakta yang tersedia tidak menyebutkan adanya program caching atau diskon untuk model ini di OrcaRouter. Harga OrcaRouter adalah pass-through pada tarif penyedia. Anda mungkin ingin mengecek dengan OrcaRouter untuk opsi diskon massal atau kapasitas cadangan yang dapat diterapkan di berbagai model. Karena biaya token output tinggi, menyimpan segmen audio yang dihasilkan untuk penggunaan berulang (misalnya, respons umum) dapat mengurangi total pengeluaran secara signifikan.
Perbandingan tidak disediakan secara langsung. Namun, Google Flash TTS diposisikan sebagai solusi hemat biaya untuk penggunaan real-time dengan biaya masukan rendah. Model TTS lainnya (misalnya, OpenAI TTS, ElevenLabs) mungkin memiliki struktur harga yang berbeda—sering kali mengenakan biaya per karakter atau per detik audio. Harga keluaran per token model ini mungkin lebih mahal untuk audio yang sangat panjang, tetapi lebih murah untuk pembangkitan singkat dan sporadis. Evaluasi perkiraan volume token Anda terhadap penawaran lain di katalog OrcaRouter.
Gunakan klien apa pun yang kompatibel dengan OpenAI. Setel URL dasar ke https://api.orcarouter.ai/v1, kunci API dari akun OrcaRouter Anda, dan ID model menjadi "google/gemini-3.1-flash-tts-preview". Kirim permintaan penyelesaian chat dengan pesan pengguna yang berisi teks yang akan diucapkan. Respons akan menyertakan konten audio (kemungkinan sebagai potongan yang dienkode base64 atau URL). Format output yang tepat tergantung pada implementasi model Google. Lihat dokumentasi OrcaRouter untuk dukungan streaming dan penguraian respons.
Parameter penyelesaian obrolan standar berlaku: model, pesan (dengan peran dan konten), dan secara opsional temperature atau top_p untuk variabilitas keluaran (meskipun kurang relevan untuk TTS). Untuk pemilihan suara, model Google mungkin mendukung parameter tambahan (misalnya, nama suara). Fakta yang tersedia tidak mencantumkan parameter TTS tertentu. Anda mungkin perlu meneruskan kolom tambahan seperti 'voice' atau 'language' di badan permintaan. Konsultasikan dokumentasi API Google untuk model pratinjau untuk opsi yang tepat.
Umum bagi model TTS untuk mendukung streaming audio, di mana potongan audio dikirim saat dihasilkan. Fakta yang diberikan tidak mengonfirmasi dukungan streaming untuk model pratinjau ini. Jika streaming diaktifkan, Anda dapat menggunakan parameter stream yang disetel ke true dalam permintaan API Anda dan memproses potongan saat tiba. OrcaRouter mendukung streaming untuk model yang kompatibel. Uji dengan permintaan sederhana untuk melihat apakah audio dikembalikan secara bertahap atau sebagai blob lengkap.
Jika Anda sudah menggunakan API yang kompatibel dengan OpenAI, ubah URL dasar menjadi https://api.orcarouter.ai/v1 dan perbarui ID model. Perbarui parameter permintaan Anda agar sesuai dengan spesifikasi TTS Google (misalnya, nama suara). Anda mungkin perlu menyesuaikan penanganan output audio jika formatnya berbeda (misalnya, MP3 vs WAV). Uji dengan contoh prompt untuk memverifikasi kualitas. Karena penetapan harga adalah tanpa markup, biaya Anda dapat berubah berdasarkan penggunaan token. Tidak diperlukan alat migrasi khusus.
OpenAI menawarkan model TTS (tts-1, tts-1-hd) dengan harga per karakter (~$0.015 per 1k karakter). Sebaliknya, model Google menggunakan harga berbasis token, yang bisa lebih ekonomis untuk input pendek tetapi lebih mahal untuk output panjang. TTS OpenAI mendukung berbagai suara dan bahasa; spesifikasi pratinjau Google belum sepenuhnya diketahui. Latensi: baik model Flash maupun OpenAI dirancang untuk latensi rendah. Kualitas bersifat subjektif; Anda harus menguji dengan konten Anda untuk membandingkan kealamian dan prosodi.
Google juga menyediakan model TTS premium (misalnya, WaveNet, Studio) melalui Cloud Text-to-Speech API. Model-model tersebut biasanya mengenakan biaya per karakter teks yang dikirim, yang dapat lebih murah untuk audio yang sangat panjang tetapi memiliki biaya per permintaan yang lebih tinggi. Flash TTS lebih cepat dan memiliki penetapan harga input yang lebih sederhana (per token) tetapi mungkin memiliki lebih sedikit pilihan suara. Untuk ucapan berkualitas tinggi dan kaya emosi, model premium mungkin lebih baik. Untuk kecepatan dan biaya rendah per input, varian Flash lebih menguntungkan.
Jika Anda memerlukan respons waktu nyata dan memiliki teks input pendek (banyak permintaan kecil), model Flash ini dengan biaya input rendah dan generasi cepat sangat ideal. Untuk pembuatan audio yang sangat panjang (misalnya, buku audio penuh), model yang membebankan biaya per karakter input (seperti TTS standar Google) mungkin lebih murah, karena biaya token keluaran dihindari. Juga pertimbangkan variasi suara dan dukungan bahasa: jika Anda memerlukan banyak suara yang berbeda, periksa apakah pratinjau ini mendukungnya. Uji kedua opsi dengan beban kerja Anda sebelum memutuskan.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1voice| Input / 1M token | $1.00 |
| Output / 1M token | $20.00 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/google/gemini-3.1-flash-tts-previewBuka @misc{orcarouter_gemini_3_1_flash_tts_preview,
title = {google/gemini-3.1-flash-tts-preview API},
author = {google},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview}
}google. (n.d.). google/gemini-3.1-flash-tts-preview API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-tts-preview