
Kebocoran Claude Voice: Tab "Preview" Tersembunyi di Aplikasi Claude, dan Opt-In Data Suara yang Muncul di Sampingnya
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 82 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Pada suatu waktu sebelum 4 Oktober 2026, item navigasi yang seharusnya belum terlihat muncul di antarmuka web Claude: sebuah Suara tab terpisah yang membawa label Pratinjau internal. Tidak ada pengumuman untuknya, tidak ada kartu model, tidak ada baris harga, tidak ada entri API, dan tidak ada tanggal. Di sekitar periode yang sama — dilaporkan pada 5 Oktober — vendor diam-diam menambahkan hal lain yang belum dipublikasikannya: opt-in konsumen yang memungkinkan pengguna menyerahkan rekaman suara dan data obrolan suara "untuk meningkatkan model AI kami," terpisah dari persetujuan yang sudah dimintanya untuk percakapan teks. Jajaran yang tersedia masih empat model dengan keluaran teks — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 dan Claude Haiku 5.5 — dan perusahaan ini belum pernah merilis model ucapan sendiri. Jadi pertanyaan berguna yang muncul dari kebocoran ini bukanlah "apakah perusahaan ini meluncurkan model suara." Pertanyaannya lebih sempit: tab itu membuktikan bahwa sebuah antarmuka sedang dibangun, dan opt-in itu adalah bukti kuat pertama yang dimiliki siapa pun bahwa perusahaan menginginkan data pelatihan ucapan. Itu dua klaim yang berbeda, dan hanya yang kedua yang bisa diberi tanggal.
Semua di bawah ini dikelompokkan menjadi apa yang telah dikonfirmasi, apa yang dilaporkan dan belum diverifikasi, serta apa yang merupakan inferensi. Anthropic sama sekali tidak mengatakan apa pun tentang tab tersebut, yang berarti sumber untuk fakta intinya adalah tangkapan layar dan bukan siaran pers.
Apa yang sebenarnya terlihat, dan apa yang tidak diberitahukannya kepada kita
Temuan ini berasal dari @testingcatalog di X, diposting pada 4 Oktober 2026, dan ditulis di outlet yang sama pada 10 Oktober. Dalam tulisan itu, "item Voice terpisah telah muncul di navigasi web Claude dengan label Preview internal," dan "kemampuan serta ketersediaan publiknya masih belum diketahui." Itulah seluruh bukti langsungnya. Laporan tersebut secara eksplisit membingkai label itu sebagai menunjuk ke lingkungan pratinjau internal, bukan peluncuran.
Tiga hal mengikuti dari artefak tersebut, dan tidak satu pun darinya merupakan spesifikasi:
• Cakupannya — label pratinjau internal mengatakan bahwa ada sebuah build di suatu tempat di dalam Anthropic. Itu tidak mengatakan build tersebut berisi model baru. Tab navigasi adalah UI.
• Penyedianya — laporan mencatat Anthropic "belum mengonfirmasi penyedia suara yang mendasarinya," belum merilis model text-to-speech khusus melalui API-nya, dan belum meluncurkan model audio real-time end-to-end native. Dua poin terakhir dapat diverifikasi dan benar. Dokumentasi model publik Anthropic mencantumkan empat model saat ini dan mendeskripsikan keempatnya dengan cara yang sama: input teks dan gambar, output teks.
• Soal waktu — belum ada tanggal yang dilaporkan atau disiratkan. "Tidak ada kabar tentang waktu ketersediaan publik," menurut tulisan itu.
Ada preseden yang perlu diketahui, karena hal itu bisa ditafsirkan dari dua arah. Anthropic pernah merilis sesuatu di bawah banner pratinjau sebelumnya — lini Mythos dirilis sebagai pratinjau sebelum akses umum — jadi label Preview internal tidak otomatis menjadi petunjuk palsu. Tetapi Anthropic juga pernah memiliki flag mode suara yang tidak dirilis dan tertinggal di kode produksi selama berbulan-bulan: kebocoran April 2026 atas paket sumber Claude Code memunculkan serangkaian flag fitur yang belum dirilis, termasuk mode suara, bersama pekerjaan bridge dan background-agent. Voice telah terlihat sedang dikerjakan di Anthropic selama lebih dari setahun tanpa model suara yang muncul. Tab itu konsisten dengan riwayat tersebut dan tidak memajukannya.
Opt-in adalah sinyal yang disertai tanggal.
Paruh kedua kebocoran itu lebih kuat, karena ini merupakan perubahan privasi, bukan tangkapan layar. Dilaporkan pada 5 Oktober 2026 oleh beberapa media, Anthropic menambahkan pengaturan opsional yang memungkinkan pengguna menyumbangkan rekaman suara dan data obrolan suara untuk peningkatan model. Teks prompt sebagaimana dilaporkan adalah "Izinkan kami menggunakan data suara Anda untuk meningkatkan model AI kami," dengan bahasa pendamping yang menyatakan bahwa data audio dan obrolan suara membantu meningkatkan cara model menangani ucapan. Rincian yang dilaporkan, semuanya dari kelompok liputan yang sama:
• Di mana letaknya — di Setelan Claude, di bawah Privasi, ditampilkan sebagai tombol persetujuan eksplisit.
• Defaultnya — nonaktif. Pengguna ditanya; mereka tidak didaftarkan.
• Cakupannya — terpisah dari mekanisme persetujuan yang sudah ada untuk percakapan teks, yang merupakan detail paling penting.
• Dapat dibalik — dapat dimatikan setelahnya dan data suara dihapus dari pengaturan, sesuai cakupan.
Mengapa persetujuan terpisah itu penting: jika seluruh pipeline suara adalah integrasi vendor tanpa model Anthropic yang terlibat, tempat alami untuk menyatukan persetujuan sebenarnya sudah ada. Membuat saluran data suara yang terpisah adalah yang Anda lakukan ketika Anda berniat melatih pada ucapan — untuk model baru, atau untuk lapisan ucapan khusus di dalam model yang sudah ada. Itu adalah argumen dari insentif, bukan dari bukti, dan seharusnya dibaca seperti itu. Pembacaan balik yang jujur adalah bahwa perusahaan yang menjalankan fitur suara dalam skala besar memerlukan korpus evaluasinya sendiri dan analisis kegagalannya sendiri terlepas dari siapa yang memasok audio, dan opt-in yang dirancang untuk dimatikan nanti juga merupakan cara termurah untuk tetap patuh selagi Anda memutuskan.
Satu bagian konteks lagi, karena itu membuat perubahan ini tampak lebih tajam daripada sebenarnya. Dokumentasi privasi Anthropic sendiri untuk produk komersial menyatakan secara blak-blakan, dalam artikel tertanggal 16 Maret 2026, bahwa "kami tidak menggunakan suara Anda untuk melatih model kami," dan bahwa setelah ucapan ditranskripsikan, rekaman audionya dihapus. Artikel itu ditujukan untuk Claude for Work, Anthropic API, dan permukaan komersial serupa. Opt-in baru ini adalah pengaturan di sisi konsumen. Kedua pernyataan itu bisa sama-sama benar — dan itulah persisnya bentuk sebuah perusahaan yang membangun pipeline data pelatihan di satu sisi bisnis sambil menepati janji kontraktual di sisi lain.

Anthropic telah memiliki produk suara selama setahun dan tidak memiliki model suara selama itu
Inilah bagian yang cenderung dilewatkan oleh liputan kebocoran, dan inilah konteks yang Anda butuhkan untuk membaca tab tersebut dengan benar.
Mode suara Claude diluncurkan pada Mei 2025 sebagai fitur percakapan lisan di aplikasi seluler. Sejak awal, itu hanyalah pembungkus: model bahasa Anthropic menangani penalaran, dan suara itu sendiri berasal dari tempat lain. Stack-nya tidak pernah diungkapkan. Ketika TechCrunch meliput peningkatan mode suara 23 Juli 2026, laporan itu mencatat dua hal: bahwa "Anthropic tidak membuat perubahan apa pun pada model suara dengan rilis ini" dan bahwa perusahaan "belum merinci jenis stack suara yang digunakannya." Pelaporan sejak 2025 mengarah pada ElevenLabs sebagai vendor suara, yang sebagian besar disimpulkan dari pengungkapan subprosesor Anthropic, bukan dari apa pun yang dikonfirmasi Anthropic. Anggap vendor tersebut belum terverifikasi.
Pembaruan Juli 2026 ini memberi pelajaran karena apa yang tidak disertakannya. Pembaruan itu menambahkan pilihan model — Anda bisa memilih antara Claude Opus, Claude Sonnet, dan Claude Haiku alih-alih hanya Haiku — plus konektor ke Gmail, Calendar, Slack, Canva, dan Notion, percakapan yang lebih panjang, serta dukungan multibahasa yang dirilis sebagai beta. Setiap perubahan itu berada di hulu audio. Audio tidak bergerak.
Mode suara apa yang berlaku saat ini, di dokumentasi bantuan Anthropic sendiri:
• Model — "Mode Suara dapat menggunakan model Claude yang sama seperti yang Anda gunakan di obrolan teks," dan mode ini "dimulai dengan model yang terakhir Anda gunakan di obrolan teks." Satu pengecualian disebutkan: Claude Fable tidak tersedia di mode Suara.
• Ketersediaannya — fitur beta di semua paket, Free hingga Enterprise, di Claude Mobile, Desktop, dan web, meskipun dirancang agar bekerja paling baik dari ponsel.
• Suara — "pilihan prasetel yang terbatas," secara eksplisit untuk mencegah kloning atau peniruan suara.
• Penagihan — percakapan suara dihitung terhadap batas paket normal Anda. Tidak ada pengukur suara terpisah.
• Batasan — dikte tersedia di Claude Cowork dan Claude Code, tetapi mode suara tidak.
• Bahasa — Inggris plus lainnya, dengan set non-Inggris yang masih dilabeli beta.
Masing-masing baris tersebut menggambarkan produk yang membungkus ucapan orang lain. Tidak ada satu pun dari baris-baris itu yang menggambarkan model wicara.
Tiga hal yang mungkin menjadi tab Voice, dan hanya satu di antaranya yang merupakan model
Alasan bocoran ini mudah ditafsirkan secara berlebihan adalah karena ketiga kemungkinan masa depan yang masuk akal tampak identik di bilah navigasi.
• Perubahan antarmuka — layar suara khusus, tombol suara di bilah prompt, pemilih suara di pengaturan. Anthropic sudah dilaporkan sedang menyiapkan sesuatu seperti ini pada Februari 2026. Jika hanya itu yang dimaksud, tab ini hanyalah desain ulang dan stack audio yang mendasarinya tidak tersentuh.
• Pergantian penyedia — arsitektur kaskade yang sama, vendor suara berbeda di baliknya. Tak terlihat dari luar. Ini sendiri dapat menjelaskan persetujuan penggunaan data pelatihan, karena Anda tidak dapat mengevaluasi pergantian vendor tanpa audio yang boleh Anda simpan.
• Model ucapan-ke-ucapan native — Anthropic melatih model audionya sendiri dan meninggalkan kaskade. Ini adalah penafsiran yang mahal, yang akan penting bagi siapa pun yang membangun di atas Claude, dan satu-satunya yang membutuhkan korpus ucapan yang disetujui. Ini juga penafsiran yang belum didukung oleh bukti.
Tab itu tidak dapat membedakan keduanya. Dua hal berikutnya yang dapat diperiksa akan membedakannya: ID model audio muncul di daftar model Anthropic, atau entri speech baru di halaman subprosesornya. Tidak satu pun dari keduanya telah terjadi.
Di mana Anthropic tidak berada
Cara paling jelas untuk melihat seberapa jauh Anthropic dari menguasai lapisan ini adalah dengan melihat di mana ia tidak muncul, lalu pada apa yang ia terbitkan. Perbandingan ucapan-ke-ucapan independen — Artificial Analysis memelihara satu perbandingan yang mencakup sekitar empat puluh model dalam hal penalaran, dinamika percakapan, dan performa agentik — diisi oleh model audio native dari Gemini 3.8 Live, GPT-Realtime-2 dan GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai, dan sejumlah upaya terbuka. Anthropic tidak muncul sama sekali dalam daftar semacam itu. Satu set entri terpisah mencakup pipeline agen suara bertingkat — model ucapan-ke-teks, LLM, dan model teks-ke-ucapan yang dirangkai bersama — yang merupakan arsitektur yang paling mirip dengan mode suara Anthropic sendiri. Sebaliknya, dokumentasi model Anthropic sendiri tidak ambigu: empat model saat ini, semuanya dijelaskan dengan cara yang sama — input teks dan gambar, output teks, tanpa ID model audio di mana pun di halaman itu.

Itu bukan kritik terhadap produk tersebut. Itu adalah pernyataan tentang di mana nilai itu ditangkap saat ini, dan itu menjelaskan mengapa tab Voice menarik sama sekali: suara adalah satu-satunya modalitas di mana setiap lab terdepan lainnya memiliki model first-party dan Anthropic tidak.
Apa yang harus dilakukan tentang hal itu bulan ini, yang tidak ada bedanya
Terjemahan praktis dari semua ini adalah bahwa tidak ada yang berubah bagi seorang pengembang pada 4 Oktober. Mode Suara adalah produk yang sama seperti pada Juli. Tidak ada ID model yang ditambahkan atau dipensiunkan. Tidak ada harga yang berubah. Jika Anda merilis suara di Claude hari ini, Anda merilis sebuah kaskade: model Claude untuk berpikir, model terpisah untuk berbicara, dan perekat di antaranya. Kebocoran itu tidak mengubah hal itu, dan membangun di sekitar tab yang bertuliskan Preview adalah cara tim berakhir dengan ketergantungan roadmap pada cabang internal seseorang.
Yang justru ia perjuangkan adalah menjaga separuh stack bagian tutur tetap bisa ditukar, karena cascade-lah tempat lock-in sebenarnya berada — bukan pada model Claude, yang bisa Anda panggil dari mana saja, melainkan pada perekat yang Anda tulis ke vendor tutur. Secara konkret, sisi Claude sudah dapat dirutekan: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, dan Claude Haiku 4.5 ada di katalog OrcaRouter pada harga daftar Anthropic dengan markup 0% — harga daftar penyedia diteruskan apa adanya, jadi jika Anthropic memotong harga, itu langsung berlaku di sisi kami pada hari yang sama — dan model text-to-speech yang akan Anda pasangkan dengannya (pratinjau TTS Gemini, tts-1-hd, antara lain) berada di balik kunci yang sama. Satu endpoint untuk kedua bagian pipeline suara berarti mengganti vendor hanyalah perubahan string model, bukan kontrak kedua, dan failover otomatis berarti separuh pipeline Anda yang belum terbukti akan turun ke fallback yang berfungsi alih-alih menggagalkan panggilan.
Apa yang sebenarnya akan mengonfirmasinya?
Lewati spekulasi dan perhatikan empat tempat spesifik yang dapat diperiksa. Masing-masing adalah peristiwa yang dapat diberi tanggal, dan salah satu saja akan mengubah ini dari bocoran menjadi berita:
• Entri baru dalam dokumentasi model Anthropic atau daftar Models API dengan input audio atau output audio. Itu satu-satunya artefak yang membuktikan bahwa model ucapan pihak pertama ada.
• Tambahan terkait suara pada halaman subprosesor Anthropic. Itu justru membuktikan sebaliknya — pemasok eksternal baru, bukan model internal.
• Tab Voice kehilangan label Preview-nya di aplikasi konsumen. Itulah peluncurannya, dan itulah momen ketika fitur tersebut menjadi dapat ditinjau, bukan sekadar dapat diamati.
• Perdebatan harga. Anthropic menetapkan harga untuk apa yang dijualnya; harga per menit untuk ucapan akan menyelesaikan pertanyaan arsitektur lebih cepat daripada tolok ukur apa pun.
Sampai salah satu dari hal-hal itu terwujud, ringkasan akurat untuk Oktober 2026 adalah ini: Anthropic sedang membangun antarmuka suara, untuk pertama kalinya mengumpulkan data ucapan yang disetujui, dan masih belum pernah merilis model ucapan. Tab adalah yang paling tidak informatif dari ketiga fakta itu dan yang paling jauh menyebar.

Pertanyaan yang belum terjawab bukanlah apakah Anthropic menginginkan pengalaman suara yang lebih baik — opt-in menjawabnya. Pertanyaannya adalah apakah "suara yang lebih baik" di Anthropic berarti model yang dimilikinya sendiri atau vendor yang dikelolanya dengan lebih hati-hati. Kedua jalur itu tampak sama dari luar untuk sementara waktu, lalu terlihat sangat berbeda.
