
Gemini 3.8 TTS vs Sesame Preview: Salah Satunya Adalah Unduhan, yang Lainnya Adalah Aplikasi
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Cari perbandingan antara Gemini 3.8 Flash TTS dan Sesame Preview dan Anda akan menemukan banyak tulisan yang menganggap keduanya sebagai dua produk dalam kategori yang sama. Tidak demikian, dan perbedaannya bukan sekadar hal teknis. Gemini 3.8 Flash TTS adalah endpoint API: ia memiliki pengenal model, daftar tarif yang dipublikasikan, baris papan peringkat pada peringkat 2 dengan Elo 1.260 dari 1.999 sampel di Artificial Analysis Provider Voice Arena, dan format permintaan yang terdokumentasi. Sesame Preview adalah aplikasi asisten suara konsumen gratis dengan agen bernama, percakapan multi-giliran, dan batas panggilan 30 menit. Aplikasi ini tidak memiliki API, ID model, paket penagihan, maupun skor di papan tersebut.
Satu-satunya artefak Sesame yang benar-benar dapat Anda bangun di atasnya adalah hal yang berbeda lagi: CSM-1B, sebuah checkpoint Apache 2.0 di Hugging Face yang menghasilkan kode audio dari teks menggunakan backbone Llama dan dekoder audio Mimi. Itu bukan suara yang orang bicarakan ketika mereka menggambarkan betapa manusiawinya aplikasi itu terdengar. Jadi perbandingan ini bermuara pada pertanyaan yang bisa dijawab: apakah Anda ingin menyewa model ucapan, atau ingin mengunduhnya?

Dua hal yang disebut Sesame, dan hanya satu di antaranya yang dapat dibangun
Penamaan adalah sumber sebagian besar kebingungan, jadi pisahkan itu sebelum melangkah lebih jauh.
• Sesame Preview — aplikasinya. Gratis digunakan, agen bernama Maya, Miles, Simone, dan Charlie, percakapan multi-giliran dengan konteks yang tetap tersimpan antar giliran, penelusuran web dan pengingat sebagai kapabilitas, hanya bahasa Inggris, batas 30 menit per panggilan. Tidak ada permukaan pengembang: tidak ada yang perlu diautentikasi, tidak ada yang perlu diukur, tidak ada endpoint yang bisa dipanggil.
• CSM-1B — checkpoint tersebut. Dipublikasikan di Hugging Face dengan nama sesame/csm-1b di bawah lisensi Apache 2.0, dengan backbone Llama dan decoder yang lebih kecil yang menghasilkan kode audio Mimi. Sekitar 2 miliar parameter, berbahasa Inggris, bobot F32, dan dijalankan melalui Hugging Face Transformers. Kartu model mencatat varian 1B yang dirilis pada Maret 2025 dan dukungan native untuk Transformers yang hadir pada Mei 2025.
Keduanya berbagi perusahaan dan garis keturunan riset, dan kurang lebih di situlah hubungan itu berakhir. Aplikasi tersebut adalah sebuah produk; checkpoint adalah artefak dari riset yang mendahuluinya. Para pengulas yang memuji memori percakapan aplikasi itu sedang menggambarkan sistem dengan pengambilan dan pengelolaan status di sekitar model ucapan, bukan properti dari checkpoint 2B yang dapat Anda unduh.
Apa yang sebenarnya ada di dalam checkpoint
CSM-1B adalah model text-to-speech dalam pengertian arsitektural yang penting bagi siapa pun yang berencana menjalankannya: model ini menerima teks dan konteks audio sebagai masukan dan menghasilkan kode audio RVQ, yang kemudian diubah oleh decoder menjadi bentuk gelombang. Fakta praktis dari kartu model:
• Lisensi — Apache 2.0. Ini adalah baris tunggal yang paling konsekuensial di halaman ini. Tidak seperti lisensi bobot yang hanya untuk riset, Apache 2.0 mengizinkan penggunaan komersial tanpa perjanjian terpisah, yang menjadikan CSM-1B salah satu dari sedikit checkpoint suara terbuka yang benar-benar dapat digunakan.
• Ukuran — sekitar 2B parameter pada F32. Cukup besar untuk memerlukan perangkat keras sungguhan untuk apa pun yang bersifat konkuren, cukup kecil untuk dijalankan pada satu akselerator untuk pengembangan.
• Bahasa — Inggris, sesuai kartu. Bukan model multibahasa.
• Traksi — 141.461 unduhan dalam sebulan terakhir pada saat penulisan, dengan sekitar 245.000 suka di repositori. Itu adalah checkpoint yang banyak digunakan menurut standar model ucapan terbuka, dan itulah argumen terkuat bahwa artefak tersebut memiliki basis pengguna nyata yang independen dari publisitas aplikasinya.

Yang tidak diberikan kartu ini kepada Anda adalah klaim kualitas yang dapat Anda bandingkan dengan apa pun. Tidak ada baris arena, tidak ada tolok ukur vendor yang direproduksi oleh pihak ketiga, dan tidak ada evaluasi yang dipublikasikan tentang bagaimana keluaran checkpoint tersebut berkaitan dengan keluaran aplikasinya. Siapa pun yang memberi tahu Anda bahwa model yang dapat diunduh terdengar seperti aplikasi itu sedang menyimpulkannya dari namanya.
Mengapa tidak ada head-to-head, dan mengapa itu bukan kesenjangan penelitian
Tidak ada perbandingan Gemini 3.8 TTS versus Sesame Preview di papan peringkat karena memang tidak mungkin ada. Arena memeringkat model dengan membuat para pendengar membandingkan klip yang dihasilkan oleh endpoint yang dihosting. Salah satu sisi dari pasangan ini tidak memiliki endpoint, jadi tidak bisa dimasukkan.
Hal itu layak untuk dibuat presisi, karena "tidak ada head-to-head" sering ditulis seolah-olah datanya tidak ada. Data itu tidak hilang. Data itu tidak terdefinisi. Dua hal yang dibandingkan tidak berbagi permukaan yang dapat diukur:
• Gemini 3.8 Flash TTS dinilai berdasarkan suara native yang dihosting miliknya. Sesame Preview tidak memiliki suara native untuk dinilai dalam pengertian itu — ia memiliki agen.
• Gemini 3.8 Flash TTS menerbitkan daftar tarif dalam token. Sesame Preview gratis dan tidak menerbitkan apa pun, karena tidak ada yang perlu ditagih.
• Gemini 3.8 Flash TTS menerima skrip dan mengembalikan audio. Sesame Preview menerima percakapan dan mengembalikan percakapan, dengan pengambilan dan memori apa pun yang dilapiskan aplikasi di atasnya.
Hal yang paling mendekati perbandingan yang sah adalah antara Gemini 3.8 Flash TTS dan CSM-1B, dan bahkan itu pun tidak seimbang: yang satu memiliki Elo independen dan daftar tarif vendor, yang lain tidak memiliki keduanya. Yang dapat Anda bandingkan adalah bentuk komitmennya — API berbasis pengukuran pemakaian versus checkpoint yang dapat diunduh — dan perbandingan itu tidak memerlukan papan peringkat.
Satu-satunya sisi dari ini yang ada angkanya.
Segala sesuatu yang bersifat kuantitatif dalam pasangan ini berada di sisi Google, dan itulah intinya.
Pada Artificial Analysis Provider Voice Arena, yang diambil pada 24 September 2026, Gemini 3.8 Flash TTS berada di peringkat 2 dengan Elo 1.260 dari 1.999 sampel dan 8 suara arena, dirilis pada 23 September 2026. Saudaranya, Gemini 3.8 Flash-Lite TTS, berada di peringkat 6 dengan 1.235. Google menagih Flash TTS sebesar $0,50 per juta token teks masuk dan $9,00 per juta token audio keluar hingga 31 Desember 2026, lalu $18,00, dengan Flash-Lite TTS sebesar $0,50 dan $6,00, lalu $12,00; Artificial Analysis menormalkan angka-angka itu menjadi $16,50 dan $11,00 per juta karakter agar keduanya dapat berbagi papan dengan model yang menagih dalam satuan lain. Normalisasi itu adalah aritmetika papan tersebut, bukan kutipan dari Google.
Sebaliknya, CSM-1B tidak memiliki harga karena tidak memiliki meter. Ia memiliki jumlah unduhan, lisensi, dan jumlah parameter. Jika kerangka keputusan Anda memerlukan Elo, perbandingan ini tidak akan menyediakannya untuk sisi Sesame, dan kesimpulan jujurnya adalah bahwa kedua opsi tersebut dievaluasi berdasarkan kriteria yang berbeda, bukan bahwa salah satunya belum terbukti.

Jika yang Anda inginkan adalah pengalaman aplikasi
Banyak orang yang mencari perbandingan ini sebenarnya tidak sedang memilih model sama sekali. Mereka menggunakan aplikasi Sesame, menyukai bagaimana percakapan itu terasa, dan menginginkan hal itu ada di produk mereka. Itu masalah yang berbeda, dan unduhan itu tidak akan menyelesaikannya.
Yang membuat aplikasi ini terasa seperti itu sebagian besar bukanlah model ucapannya. Konteks yang bertahan antar giliran, keputusan untuk mencari di web di tengah percakapan, waktu kapan agen berbicara — itu semua adalah orkestrasi, dan tidak satu pun dari itu berada dalam checkpoint 2B. Mengunduh CSM-1B memberimu sebuah suara. Membangun perilaku aplikasi di atasnya adalah pekerjaan rekayasa Anda, dan batas panggilan 30 menit serta tidak adanya API berarti Anda juga tidak bisa menyewa versi jadinya.
Jika yang Anda inginkan adalah model ucapan yang dapat Anda panggil, jawaban jujurnya adalah Gemini 3.8 Flash TTS adalah opsi dengan antarmuka yang terdokumentasi, harga yang dipublikasikan, skor independen, dan dialog dua pembicara dalam satu permintaan. Jika yang Anda inginkan adalah bobot yang dapat Anda simpan, CSM-1B di bawah Apache 2.0 adalah pilihan di antara keduanya yang benar-benar dapat Anda pegang — dan komprominya adalah Anda harus menyediakan sendiri perangkat keras, stack penyajian, dan setiap jaminan kualitasnya.
OrcaRouter tidak menjadi host untuk salah satu pun dari keduanya. Model Google dipanggil melalui API milik Google sendiri dan permukaan yang disebutkan dalam pengumuman 23 September-nya; CSM-1B adalah checkpoint yang Anda jalankan. Fungsi OrcaRouter adalah lapisan di atas pilihan itu: lebih dari 200 model di balik satu kunci dengan harga daftar penyedia tanpa markup, sehingga perubahan tarif vendor langsung berlaku pada hari yang sama, failover otomatis sehingga rute eksperimental tidak menjadi ketergantungan produksi, dan DSL perutean yang menyusun model menjadi satu panggilan ketika satu suara bukanlah keseluruhan pekerjaan.
Versi singkat dari perbandingan ini adalah bahwa ini sebenarnya bukan perbandingan. Satu sisi memiliki rate card dan Elo; sisi lain memiliki lisensi dan jumlah unduhan. Pilih yang kolomnya benar-benar bisa Anda isi.
