
Gemini 3.8 TTS vs VoxCPM2: Menyewa Suara atau Menjalankannya Sendiri, dalam Angka Nyata
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Tidak ada baris papan peringkat yang menempatkan Gemini 3.8 Flash TTS dan VoxCPM2 berdampingan, dan ketidakhadiran itu adalah fakta paling berguna dalam perbandingan ini. Gemini 3.8 Flash TTS adalah endpoint terkelola dengan Elo 1.260 di peringkat 2 pada Artificial Analysis Provider Voice Arena dan daftar tarif yang dipublikasikan dalam token. VoxCPM2 adalah checkpoint OpenBMB — 2 miliar parameter, Apache 2.0, dirilis April 2026 — yang tidak dihosting oleh penyedia inferensi mana pun. Anda tidak bisa menyewanya. Anda menjalankannya sendiri.
Jadi pertanyaannya bukan model mana yang terdengar lebih baik. Pertanyaannya adalah apakah beban kerja Anda lebih baik dilayani dengan membayar per karakter untuk GPU milik orang lain atau dengan memiliki GPU-nya sendiri dan membayarnya baik saat bekerja maupun tidak. Itu pertanyaan aritmetika, dan tidak seperti kebanyakan perbandingan model, pertanyaan itu punya jawaban yang bisa Anda hitung sebelum berkomitmen.

Salah satunya Anda sewa, yang lainnya Anda operasikan.
Mulailah dari apa yang sebenarnya diberikan masing-masing kepada Anda.
• Akses — Gemini 3.8 Flash TTS hanya tersedia sebagai API, dipanggil melalui Gemini API dan permukaan Google yang disebutkan dalam pengumumannya pada 23 September 2026. VoxCPM2 tidak memiliki endpoint pihak pertama yang digunakan dalam produksi dan tidak ada penyedia inferensi yang melayaninya; checkpoint-nya adalah produknya.
• Lisensi — VoxCPM2 dirilis di bawah Apache 2.0, yang mengizinkan penggunaan komersial tanpa perjanjian terpisah. Itu adalah lisensi yang benar-benar permisif, dan itu bukan standar untuk bobot suara terbuka, beberapa di antaranya dirilis dengan ketentuan hanya untuk riset yang mengarahkan penggunaan komersial kembali melalui API yang dihosting.
• Ukuran — VoxCPM2 memiliki 2B parameter dan muat dalam sekitar 8 GB VRAM pada presisi yang dikurangi untuk pengembangan, dengan puncak penyajian sekitar 22 GB pada kartu 24 GB. Google tidak mempublikasikan jumlah parameter untuk kedua model Gemini 3.8 TTS.
• Pembuatan suara — Gemini 3.8 Flash TTS melakukan desain suara dari deskripsi tertulis, replikasi suara dari sampel 30 detik, dan dialog dua pembicara dalam satu panggilan. VoxCPM2 adalah model text-to-speech suara tunggal; percakapan adalah dua proses yang disatukan.
• Skor independen — Flash TTS memilikinya. VoxCPM2 tidak muncul di antara baris-baris berperingkat pada Provider Voice Arena yang diambil pada 24 September 2026. Tidak adanya entri di papan peringkat bukanlah putusan atas kualitas — biasanya itu berarti belum ada yang memasukkan model tersebut — tetapi itu memang berarti tidak ada angka preferensi pihak ketiga untuk ditimbang.

Poin terakhir itu berlaku dua arah dan layak dinyatakan secara terus terang alih-alih ditutup-tutupi: jika Anda memerlukan sinyal kualitas independen sebelum Anda berkomitmen, hanya satu dari dua ini yang menyediakannya.
Angka yang menentukan: faktor waktu nyata
Menghosting model suara sendiri mengubah tagihan per karakter menjadi tagihan per jam GPU, dan nilai tukar antara kedua unit tersebut adalah faktor waktu nyata model — berapa detik komputasi yang dibutuhkan untuk menghasilkan satu detik audio.
Angka yang dipublikasikan VoxCPM2 adalah 0,30 pada PyTorch biasa dan 0,13 di bawah Nano-VLLM. Bacalah itu sebagai throughput, bukan latensi: pada 0,13, satu jam GPU waktu dinding menghasilkan sekitar 7,7 jam audio jadi. Pada 0,30, jam GPU yang sama menghasilkan mendekati 3,3 jam. Itu adalah angka dari kartu model itu sendiri, yang diukur oleh OpenBMB, dan merupakan input tunggal yang paling penting dalam keputusan membangun-versus-membeli di sini.
Tiga hal mengikuti dari itu.
• Stack penyajian lebih penting daripada modelnya. Beralih dari PyTorch biasa ke Nano-VLLM lebih dari menggandakan throughput pada perangkat keras yang identik. Model biaya apa pun yang dibangun berdasarkan angka 0,30 akan melebih-lebihkan biaya self-hosted dengan faktor sekitar 2,3.
• Utilisasi adalah segalanya. GPU sewaan yang menganggur 90% dari waktu tidak lebih murah daripada API, berapa pun harganya. Titik impas baru muncul ketika Anda menjaga kartu tersebut tetap sibuk.
• Batching mengubah aritmetikanya lagi. Faktor waktu nyata diukur per aliran; server yang menangani permintaan bersamaan mengamortisasi biaya tetap ke seluruh permintaan tersebut, dan justru itulah kondisi ketika self-hosting mulai menang.
Berapa biaya satu jam audio, dua arah
Letakkan kedua model penagihan pada sumbu yang sama. Satu jam audio final adalah 3.600 detik keluaran.
Di sisi penyewaan, Google menagih berdasarkan token, bukan karakter: $0,50 per juta token teks masukan dan $9,00 per juta token audio keluaran hingga 31 Desember 2026, lalu $18,00; Flash-Lite TTS adalah $0,50 dan $6,00, lalu $12,00. Batch dan Flex mengenakan $0,25 dan $4,50 untuk Flash TTS, dibandingkan $0,25 dan $3,00 untuk Flash-Lite TTS, dan Priority mengenakan $0,90 dan $16,00. Artificial Analysis menormalkan tarif standar menjadi $16,50 dan $11,00 per juta karakter, yang merupakan konversi papan skor tersebut, bukan kutipan Google, dan angka itulah yang harus digunakan saat membandingkan dengan model yang menagih berdasarkan karakter.
Di sisi yang dimiliki sendiri, sama sekali tidak ada tarif per karakter. Biayanya adalah jam-GPU, dikalikan berapa pun jam yang Anda butuhkan pada throughput di atas, ditambah stack penyajian, ditambah orang-orang yang menjaganya tetap berjalan. Keunggulan VoxCPM2 adalah biaya marginal jam ke-seribu sama dengan jam pertama — dan kelemahannya adalah biaya marginal jam pertama adalah satu GPU.
Itulah sebabnya keputusan ini begitu jelas:
• Di bawah volume tertentu, API lebih unggul, dan selisihnya tidak tipis. Anda membayar dolar satu digit per jam audio dibandingkan dengan biaya modal, dan tarif promosi Google membuat selisih itu makin lebar hingga 1 Januari 2027.
• Di atas volume tersebut, pada perangkat keras yang sudah Anda miliki dan dapat terus dimanfaatkan, checkpoint Apache 2.0 menang secara meyakinkan — dan tidak seperti checkpoint berlisensi riset, tidak ada apa pun dalam lisensinya yang menghalangi Anda untuk merilisnya.
• Sebagai jalan tengah, jawaban jujurnya adalah bahwa Anda membeli opsionalitas, bukan penghematan. Hosting mandiri memberi Anda kemampuan untuk mengunci versi, menyimpan audio di infrastruktur Anda sendiri, dan berhenti mengkhawatirkan perubahan tarif vendor.
Di mana masing-masing adalah jawaban yang benar
Pilih Gemini 3.8 Flash TTS saat Anda menginginkan produk dengan dokumentasi yang lebih baik. Produk ini memiliki skor independen, harga yang dipublikasikan, dialog dua pembicara dalam satu panggilan, desain dan replikasi suara, serta tidak ada permukaan operasional selain kunci API. Saudaranya, Flash-Lite TTS, memberi Anda titik harga kedua di dalam antarmuka yang sama pada $11,00 yang dinormalisasi per juta karakter. Yang Anda terima sebagai gantinya adalah tarif yang menjadi dua kali lipat pada 1 Januari 2027 dan tidak ada kemampuan untuk menjalankan model di mana pun.
Pilih VoxCPM2 ketika pekerjaan operasional adalah intinya. Apache 2.0 berarti penggunaan komersial diizinkan sepenuhnya, ukuran 2B berarti satu akselerator sudah cukup, dan faktor real-time 0,13 di bawah Nano-VLLM berarti kartu berspesifikasi sederhana menghasilkan beberapa jam audio per jam waktu berjalan. Yang Anda terima adalah bahwa tidak ada orang lain yang akan menjalankannya untuk Anda: tidak ada endpoint yang dihosting, tidak ada baris arena, tidak ada kartu tarif vendor, dan setiap jaminan kualitas yang Anda dapatkan adalah jaminan yang Anda bangun dan ukur sendiri.

Tidak ada dari kedua model itu yang dihosting oleh OrcaRouter, dan itu layak dikatakan secara langsung alih-alih menyiratkan sebaliknya. Tempat untuk memanggil Gemini 3.8 Flash TTS adalah API milik Google sendiri dan permukaan yang disebutkan Google; VoxCPM2 adalah checkpoint yang Anda deploy. Yang dicakup OrcaRouter adalah lapisan di atas keputusan itu — lebih dari 200 model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan harga vendor langsung berlaku di sisi kami pada hari yang sama alih-alih pada siklus penagihan berikutnya, failover otomatis sehingga model yang sedang dievaluasi tidak pernah harus menjadi dependensi produksi, dan DSL routing yang menggabungkan beberapa model menjadi satu panggilan ketika satu suara tidak mampu menangani seluruh pekerjaan.
Tontonan Berikutnya
Dua hal akan mengubah perbandingan ini secara signifikan, dan tidak satu pun dari keduanya telah terjadi.
Yang pertama adalah seseorang yang menghosting VoxCPM2. Ketidakhadirannya dari pasar inferensi adalah alasan utama kedua model dibandingkan berdasarkan ekonomi ketimbang kualitas — jika ada penyedia yang mengadopsinya, aritmetika sewa-versus-miliki berhenti menjadi faktor penentu dan baris arena yang hilang menjadi hal yang ingin Anda isi.
Yang kedua adalah perubahan tarif Januari di pihak Google. Pada tarif promosi, API cukup murah sehingga sebagian besar beban kerja sebaiknya tidak melakukan hosting mandiri untuk apa pun; pada tarif pasca-promosi, selisihnya menyempit ke titik di mana tim yang sudah memiliki kapasitas GPU dan volume tetap harus menghitung ulang angkanya daripada menganggap API masih tetap unggul.
Sampai salah satu dari hal itu berubah, input penentunya bukanlah papan peringkat. Melainkan berapa jam audio per bulan yang Anda produksi, dan apakah kartu tersebut sibuk.
