Kartu hero yang dihasilkan untuk ElevenLabs Eleven v4 dengan dua panel: di sebelah kiri, blok skrip yang menampilkan tag audio inline seperti [laughs], [whispers], dan [said angrily in French accent]; di sebelah kanan, panel yang menampilkan peringkat 1, Elo 1.319, $80,00 per 1 juta karakter, dan 1.674 kemunculan di Provider Voice Arena milik Artificial Analysis, dengan footer bertuliskan 'Peringkat Provider Voice, Elo, dan harga menurut Artificial Analysis, September 2026; sintaks tag dan latensi didokumentasikan vendor.' Logo OrcaRouter berada di sudut kanan bawah.
Engineering & Research

Audio Tags Eleven v4 dan Klon Sepuluh Detik: Apa yang Berubah dalam Pipeline Anda

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Hal yang paling berdampak dari ElevenLabs Eleven v4 bukanlah Elo-nya. Melainkan bahwa model ini membaca arahan yang dituliskan ke dalam naskah — [tertawa], [berbisik], [menghela napas], [diucapkan dengan marah dalam aksen Prancis], bahkan [hujan ringan] — dan bahwa ElevenLabs Eleven v4 Turbo, saudara berlatensi rendah yang dirilis pada hari yang sama, mengikuti tag yang sama dengan median waktu hingga ucapan pertama yang menurut vendor sekitar 150 ms. Keduanya tersedia secara umum pada 28 September 2026. Provider Voice Arena dari Artificial Analysis sudah menempatkan Eleven v4 di peringkat 1 dengan Elo 1.319 dari 1.674 kemunculan, dengan harga papan $80,00 per juta karakter. Peringkat itu adalah sorotan utamanya. Sintaks arahan dan kloning sepuluh detik adalah bagian yang mengubah apa yang harus Anda bangun.

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

Dua model, satu peluncuran, tugas yang berbeda

ElevenLabs merilis dua endpoint pada 28 September 2026, dan keduanya bukan produk yang sama dengan tombol pengubah kecepatan. ElevenLabs Eleven v4 adalah model ekspresif: lebih dari 90 bahasa, batas 10.000 karakter per permintaan, dukungan International Phonetic Alphabet yang ditingkatkan untuk pengucapan kustom, dan dialog multi-pembicara yang menurut perusahaan mempertahankan identitas pembicara di seluruh adegan. ElevenLabs Eleven v4 Turbo mempertahankan lebih dari 90 bahasa dan batas 10.000 karakter tetapi disetel untuk agen — pengumuman tersebut menyebutkan latensi inferensi median sekitar 100 ms dan waktu median hingga ucapan pertama sekitar 150 ms, yang diukur oleh ElevenLabs pada September 2026.

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

Pertanyaan reaktif — apakah model unggulan cukup cepat untuk agen telepon — belum memiliki jawaban yang dipublikasikan. ElevenLabs memberikan angka latensi untuk Turbo, bukan untuk Eleven v4 itu sendiri, dan keduanya merupakan endpoint yang berbeda, bukan satu model dengan dua nama. Jika anggaran agen Anda adalah 200 ms hingga audio pertama, Turbo adalah endpoint yang tercantum dalam dokumentasi, sedangkan model unggulan bukan.

Tag adalah antarmuka yang nyata, dan dependensi yang nyata

Tag audio inline bukan hal baru untuk sintesis ucapan, tetapi perubahan yang berguna di sini adalah akurasi kepatuhannya. Pengumuman tersebut menyatakan bahwa Eleven v4 mengikuti tag audio dan prompt arahan berbahasa alami dengan lebih presisi daripada model sebelumnya, dan bahwa dengan cara inilah Anda mengarahkan tawa, bisikan, atau penyampaian dalam aksen tertentu tanpa mengedit audio setelahnya.

Tiga konsekuensi praktis menyusul, dan hal-hal ini lebih penting daripada video demo:

• Naskah Anda menjadi artefak bertemplat, bukan string. Tag adalah token dalam pipeline konten Anda: tag perlu di-escape jika teks yang tidak tepercaya pernah dilewatkan, dan tag perlu tetap utuh melewati CMS Anda, lapisan terjemahan Anda, serta tinjauan diff Anda. Penerjemah yang menghilangkan [berbisik] telah mengubah sebuah pertunjukan, secara diam-diam.

• Kepatuhan tag adalah klaim vendor dengan versi yang disertakan. Klaim bahwa generasi ini mengikuti tag lebih baik daripada generasi sebelumnya adalah klaim ElevenLabs sendiri, diuji oleh ElevenLabs, dan tidak akan berlaku sama persis di semua bahasa. Validasi pada skrip Anda sendiri dan lokal Anda sendiri sebelum Anda membangun panduan gaya berdasarkan itu.

• Tag efek suara seperti [hujan ringan] atau [ponsel berdengung] memindahkan sedikit pekerjaan pascaproduksi audio ke dalam prompt teks. Itu adalah pergeseran biaya yang layak diukur: jika sebuah tag menggantikan satu proses foley, itu murah; jika tidak menggantikan apa pun dan hanya menambah variabilitas, itu adalah mode kegagalan baru dalam QA Anda.

Sepuluh detik adalah angka yang mengubah proses onboarding

Instant Voice Cloning dalam rilis ini menangkap suara dengan fidelitas tinggi dari sepuluh detik audio, dengan tingkat cloning profesional tetap tersedia di atasnya. Sepuluh detik cukup singkat sehingga memangkas satu langkah alur kerja: pengambilan persetujuan, pengunggahan sampel, dan sintesis pertama dapat terjadi dalam sekali duduk, di ponsel, tanpa studio.

Masalah persetujuan tidak menyusut seiring dengan sampel. Masalah itu justru membesar, karena ambang untuk menghasilkan klon yang meyakinkan telah turun menjadi sekadar klip yang bisa dibuat siapa saja. Jika Anda mengkloning suara yang bukan milik Anda, pertanyaan kepatuhan kini sepenuhnya menjadi tanggung jawab Anda untuk dijawab di hulu API — model akan melakukan apa yang Anda minta. Perlakukan angka sepuluh detik sebagai ambang operasional, bukan surat izin.

Berapa biayanya selama jendela terbuka

ElevenLabs mengubah harga saat peluncuran, dan tarif promosi itulah yang tertera di halaman hari ini. Pada tabel harga API, Eleven v4 tercatat sebesar $0.022 per 1.000 karakter dibandingkan harga daftar yang dinyatakan sebesar $0.08, dan Eleven v4 Turbo sebesar $0.011 dibandingkan $0.04. Keduanya memiliki label yang sama: diskon 72% hingga 12 Oktober. Halaman yang sama menetapkan harga flagship sebelumnya, Eleven v3, sebesar $0.08 per 1.000 karakter.

• Harga papan di arena, per juta karakter — Eleven v4 $80,00, tertinggi di sepuluh besar papan tersebut.

• Kartu tarif vendor, per seribu karakter — $0,022 hingga 12 Oktober, lalu $0,08.

• Artinya dalam praktik — sebulan yang berat skrip dengan lima juta karakter dikenai biaya $110 selama periode tersebut dan $400 setelahnya, pada endpoint yang sama dengan kode yang sama.

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

Siapa pun yang menyusun anggaran untuk Q1 berdasarkan angka di halaman hari ini sedang menyusun anggaran berdasarkan angka yang akan kedaluwarsa dalam dua minggu. Gunakan $0.08.

Di mana router membuktikan perannya dalam peluncuran seperti ini

OrcaRouter tidak menyediakan hosting untuk ElevenLabs, jadi tidak ada apa pun dalam peluncuran ini yang bisa dipanggil melalui kami, dan kami tidak akan menyiratkan hal sebaliknya — tempat untuk memanggil Eleven v4 adalah API milik ElevenLabs sendiri. Hal yang benar-benar berguna dari satu kunci dalam dua minggu setelah peluncuran adalah perbandingan. Jika Anda sedang menentukan apakah model unggulan baru mengalahkan yang sudah Anda jalankan, Anda ingin melakukan uji A/B terhadap keduanya pada skrip Anda sendiri, bukan pada papan peringkat, dan melakukannya di dua vendor berarti dua akun, dua hubungan penagihan, dan dua jalur integrasi sebelum Anda mendapatkan jawaban.

Itulah kasus yang kami tangani: satu API key di seluruh lebih dari 200 model dengan harga daftar penyedia yang diteruskan pada markup 0%, sehingga perubahan harga vendor — termasuk jendela promosi dengan tanggal kedaluwarsa — langsung berlaku di sisi kami pada hari yang sama, bukan pada siklus tagihan berikutnya. Jika jalur suara berhadapan langsung dengan pelanggan, failover otomatis memindahkan lalu lintas ke upstream yang sehat saat salah satu endpoint menurun, itulah cara Anda menguji model yang benar-benar baru tanpa mempertaruhkan rilis pada model itu.

Apa yang harus diuji terlebih dahulu, dan apa yang harus diabaikan

Tiga pemeriksaan akan memberi tahu Anda lebih banyak daripada peringkat mana pun. Pertama, jalankan skrip realistis terpanjang Anda melalui batas 10.000 karakter dan lihat di mana sambungannya muncul — batas ini berlaku per permintaan, dan dialog multi-pembicara adalah fitur yang paling mungkin terpecah olehnya. Kedua, masukkan lima kalimat Anda sendiri dengan tag ke v4 dan v4 Turbo lalu dengarkan pergeseran kepatuhan antara endpoint ekspresif dan latensi rendah; keduanya adalah model terpisah, dan tag yang berhasil di satu model mungkin tidak menghasilkan efek yang sama persis di model lainnya. Ketiga, hitung volume karakter bulanan aktual Anda pada $0.08, bukan $0.022, karena itulah angka yang menjadi dasar kuartal berikutnya Anda.

Angka preferensi buta ~75% dalam pengumuman itu adalah pengukuran vendor dan kami tidak akan mencucinya menjadi hal lain. Angka independen dalam peluncuran ini adalah angka yang ada di papan peringkat: peringkat pertama pada 1.319 Elo dengan 1.674 kemunculan, dan interval sekitar ±19 poin di sekitarnya. Itu hasil yang kuat di papan sungguhan. Itu bukan spesifikasi, dan tidak akan memberi tahu Anda apakah sintaks tag Anda bertahan melewati proses penerjemahan.