
Ringkasan AI Harian, 19 September: Grok Voice Transcribe 2.0 Resmi Diluncurkan dan Meta Membuka Muse untuk Pengembang
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 telah aktif di Grok Voice API per 18 September 2026, dengan tarif $0,10 per jam audio untuk transkripsi rekaman dan $0,20 per jam untuk streaming — tarif yang sama yang dikenakan SpaceXAI untuk versi 1.0. Pada minggu yang sama, Meta membuka platform konektor Muse kepada pengembang eksternal, memungkinkan layanan mana pun mengekspos API-nya yang sudah ada dan membuat agen Muse milik Meta memanggilnya atas nama pengguna. Itu tampak seperti judul berita yang tidak saling berkaitan dari dua perusahaan berbeda tentang dua produk berbeda, dan selama sebagian besar dua tahun terakhir, memang demikianlah adanya. Jika dibaca bersama, keduanya adalah cerita yang sama: transkripsi sedang berubah menjadi masukan, dan pertarungan telah bergeser ke siapa yang memiliki panggilan yang mengonsumsinya.
Mulai dari harga, karena itu bagian yang bisa ditindaklanjuti pembaca hari ini. Lalu akurasi, yang nyata tetapi lebih sempit daripada yang disiratkan oleh framing peluncuran. Kemudian bagian Meta, yang akan menjadi penting dalam enam bulan.
Harga tetap, dan apa artinya jika Anda sudah membayar untuk transkripsi
Biaya Grok Voice Transcribe 2.0 sama dengan 1.0. Bukan "mulai dari" yang sama, bukan tarif promosi yang akan berakhir — identik, yaitu US$0,10 per jam audio untuk pekerjaan batch dan US$0,20 per jam untuk streaming, yang setara dengan US$1,67 dan US$3,33 per 1.000 menit. Diarisasi pembicara, stempel waktu tingkat kata dengan skor keyakinan, normalisasi teks invers, penghapusan kata pengisi, dan pembobotan istilah kunci semuanya sudah termasuk dalam harga tersebut, bukan dijual kembali sebagai fitur tambahan, yang bukan hal lazim untuk kategori ini.
Efek praktisnya bersifat aritmetis, bukan dramatis. Tim yang mentranskripsikan 5.000 jam audio pusat kontak per bulan membayar $500 untuk jalur batch, apa pun pilihannya, dan model baru menghasilkan volume yang sama dengan tingkat kesalahan yang jauh lebih rendah. Tidak ada bagian dari migrasi ini yang mengubah apa yang Anda bayarkan, dan itulah tepatnya alasan migrasi ini mudah dibenarkan: tidak ada keputusan biaya yang perlu dibuat, hanya keputusan kualitas, dan kualitasnya meningkat.
Integrasi yang sudah ada beralih dengan meneruskan grok-voice-transcribe-2.0 sebagai parameter model pada /v1/stt, atau dengan memilihnya saat sesi WebSocket dibuka untuk streaming. Tidak ada perubahan skema, tidak ada endpoint baru, tidak ada pengodean ulang pipeline audio Anda. SpaceXAI masih membiarkan 1.0 sebagai default untuk saat ini, jadi integrasi yang tidak pernah menyentuh parameter model akan terus mendapatkan versi lama sampai perusahaan mengalihkannya — yang katanya akan terjadi dalam beberapa minggu mendatang, bersamaan dengan penghentian dukungan 1.0. Jendela itu layak dimanfaatkan secara sengaja: arahkan salinan bayangan audio produksi Anda ke 2.0 dan bandingkan transkripnya dengan yang Anda kirimkan hari ini, karena begitu default dialihkan, Anda akan menjalankannya entah Anda mengujinya atau tidak.
Sisa lembar spesifikasi itu tidak berubah bentuknya dan penting untuk diketahui jika Anda memperkirakan ukuran deployment, bukan sekadar mengevaluasi akurasi: 12 format audio masukan dari audio telepon 8 kHz hingga 48 kHz, hingga delapan kanal audio independen dalam satu permintaan, 100 istilah kunci per permintaan untuk kosakata domain, deteksi bahasa otomatis dengan pergantian di tengah perekaman, dan normalisasi teks invers di 25 bahasa sehingga tanggal, mata uang, nomor telepon, dan alamat email yang diucapkan kembali tertulis seperti cara manusia menulisnya. Batas layanannya adalah 10 permintaan per detik dan 100 sesi streaming bersamaan per tim, dan layanan ini berjalan di satu region — us-east-1 — yang merupakan satu-satunya baris pada lembar itu yang seharusnya membuat tim produksi berpikir dua kali, karena API wicara satu region berarti gangguan layanan satu region.
Ke mana akurasi sebenarnya bergerak
Klaim peluncurannya adalah "dua kali lebih akurat", dan angka-angka yang mendasarinya lebih spesifik serta kurang seragam daripada frasa itu. Di papan AA-WER Streaming milik Artificial Analysis, yang merupakan pengukuran independen di sini, kedua versi itu terpisah seperti ini:
• Akurasi transkrip akhir — Grok Voice Transcribe 2.0 pada tingkat kesalahan kata 2,7% dibandingkan Grok Voice Transcribe 1.0 pada 3,9%, keduanya diukur setelah pembicara berhenti
• Akurasi transkrip parsial pertama — 3,4% WER dibandingkan 18,3%, yang merupakan selisih tunggal terbesar antara kedua versi dengan margin yang jauh
• Waktu hingga transkrip akhir — 0,49 detik dibandingkan 0,37 detik, jadi 2.0 lebih lambat pada ukuran ini, bukan lebih cepat
• Waktu hingga parsial pertama — 0,49 detik berbanding 0,25 detik, perdagangan yang sama pada arah sebaliknya
Pasangan terakhir itu adalah hal paling menarik di lembar tersebut. Grok Voice Transcribe 2.0 membeli akurasinya dengan latensi sekitar seperempat detik, di kedua arah. Bagi agen suara, itu adalah biaya nyata — inilah perbedaan antara jeda alami dan jeda yang disadari penelepon — dan bagi pipeline batch, itu tidak terlihat. Peningkatan pada parsial pertama adalah yang mengubah apa yang dapat Anda bangun, karena transkrip parsial adalah teks yang dapat digunakan agen untuk bernalar saat penelepon masih berbicara. Turun dari 18,3% ke 3,4% pada angka itu adalah perbedaan antara parsial yang hanya berupa petunjuk kasar dan parsial yang dapat digunakan. Transkrip akhir yang turun dari 3,9% ke 2,7% adalah peningkatan bagus yang tidak akan disadari pengguna.

SpaceXAI juga menerbitkan empat evaluasi internal, dan semuanya layak dibaca dengan label yang menyertainya — ini adalah angka milik perusahaan itu sendiri tentang audionya sendiri, bukan hasil reproduksi independen:
• Panggilan dukungan pelanggan 8 kHz — 10,6% WER di 1.0 turun menjadi 7,1% di 2.0
• Percakapan dengan Grok — 8,7% turun menjadi 3,3%
• Kredensial lisan, yaitu nama, email, dan detail akun yang dibacakan dengan lantang — 7,2% turun menjadi 3,2%
• Frasa pendek di 19 bahasa — 20,6% turun menjadi 6,8%
Baris 8 kHz adalah baris yang perlu dijadikan pegangan. Audio telepon adalah input umum tersulit dalam kategori ini dan input yang paling banyak benar-benar dimiliki oleh pembeli pusat kontak, dan penurunan dari 10,6% menjadi 7,1% pada baris itu lebih berarti bagi para pembeli tersebut daripada angka utama di papan peringkat.
Klaim papan peringkat, dibaca secara jujur
SpaceXAI mengatakan model tersebut menempati peringkat pertama dari 32 model streaming dalam hal akurasi. Papan Artificial Analysis memang menempatkannya di peringkat pertama pada peringkat transkrip final maupun parsial pertama — tetapi halaman papan tersebut menampilkan 27 dari 33 model, jadi "32" adalah hitungan perusahaan sendiri, dan peringkat tersebut mencakup sekumpulan model yang bentuknya perlu dipahami pembaca. AA-WER Streaming adalah komposit berbobot dari tiga set berbahasa Inggris: AA-AgentTalk 50%, VoxPopuli 25%, dan Earnings22 25%, totalnya sekitar delapan jam audio, dan bobotnya sangat besar pada tuturan percakapan bergaya agen. Metrik ini tidak mengukur aksen, codec teleponi, kosakata domain, atau audio pusat panggilan multisaluran dengan cara yang terstruktur.
Semua itu tidak membuat angkanya salah. Justru membuatnya spesifik. Model yang memimpin papan bahasa Inggris berbobot agent-talk adalah pilihan tepat untuk audio bahasa Inggris yang berbentuk agent-talk, dan alasan jujur untuk meyakini hasil 8 kHz adalah evaluasi internal vendor, bukan papan publik. Pembeli dengan profil audio yang berbeda sebaiknya menguji pada audio mereka sendiri, bukan membaca peringkat itu sebagai putusan umum — hal ini benar sebelum peluncuran ini dan akan tetap benar setelah peluncuran berikutnya.

Meta membuka konektor Muse untuk pengembang
Berita kedua minggu ini adalah tentang Meta. Muse, agen personal yang diluncurkan Meta pada 8 September di iOS, Android, muse.ai, dan WhatsApp, kini menerima konektor pihak ketiga: sebuah layanan mengekspos API-nya, dan Muse menyediakan agen, peramban, dan konteks pengguna yang mengubah API itu menjadi sesuatu yang dapat dipanggil seseorang hanya dengan memintanya. Kerangka yang Meta berikan adalah pembagian kerja — Anda membawa API, kami membawa niat dan pengguna. Konektor pertama yang disebutkan adalah Notion dan alat catatan rapat Granola, selain yang sudah dirilis Meta sendiri.
Perlu bersikap tepat tentang apa ini dan bukan apa. Ini bukan protokol lintas-agen yang terbuka. Membangun konektor memberi Anda distribusi di dalam basis pengguna Muse sendiri dan tidak di tempat lain; membangun berdasarkan protokol terbuka memberi Anda jangkauan di setiap agen yang kompatibel dan tidak pada basis pengguna tertentu. Meta juga belum menerbitkan bagian-bagian yang diperlukan pengembang untuk merencanakan — proses peninjauan konektor, permukaan integrasi teknis, bagaimana Muse memilih antara dua konektor yang tumpang tindih, atau bagaimana pengembang mengukur apakah konektor benar-benar mendorong penggunaan apa pun.
Yang tidak diragukan adalah arahnya. Muse menjalankan agen setiap pengguna di mesin virtualnya sendiri dengan peramban sendiri dan lapisan tinjauan terpisah di depan tindakan keluar, dan ia menyimpan token pengganti, bukan kunci API asli. Arsitektur itu hanya masuk akal jika rencananya adalah agar agen memanggil banyak hal. API transkripsi termasuk hal-hal yang dipanggil agen, dan Meta memiliki miliknya sendiri — Muse Voice Transcribe, model waktu nyata yang dirilis Meta pada awal September dengan harga $0,18 per jam audio. Platform yang memiliki agen sekaligus model ucapan punya alasan jelas untuk mengarahkan lalu lintasnya sendiri ke modelnya sendiri, dan pengembang yang membangun di atas konektor semestinya mengasumsikan bahwa itu adalah default kecuali ada sesuatu yang membuatnya tidak menjadi default.

Apa yang sebenarnya harus dilakukan oleh tim yang merilis fitur suara bulan ini
Kedua cerita menunjuk ke arah yang sama. Akurasi pengenalan suara sedang menyatu — tiga model berada dalam selisih satu setengah poin satu sama lain di papan peringkat yang sama dalam tiga minggu — dan faktor pembeda yang tersisa adalah harga, latensi, lisensi, dan siapa yang mengendalikan perutean. Hal itu membuat pilihan tentang ke mana panggilan transkripsi Anda diarahkan lebih berdampak besar daripada pilihan model mana yang menjawabnya, karena Anda akan ingin mengubah jawaban itu beberapa kali sepanjang tahun mendatang.
Inilah lapisan tempat OrcaRouter berada. Satu kunci API mencakup 200+ model di balik endpoint yang kompatibel dengan OpenAI, dengan failover otomatis antarpenyedia, sehingga layanan speech satu region yang sedang bermasalah tidak lagi menjadi outage Anda. Kami meneruskan harga daftar penyedia dengan markup 0%, yang berarti penurunan harga vendor atau versi model baru langsung aktif di sisi kami pada hari yang sama, alih-alih menunggu penetapan harga ulang. Dan karena setiap model berada di balik satu kontrak, memindahkan beban kerja transkripsi dari satu model ke model lain hanyalah perubahan string model, bukan pengadaan kedua.
Tiga tindakan konkret untuk minggu ini. Jika Anda memakai Grok Voice Transcribe 1.0, lakukan uji bayangan terhadap 2.0 pada audio Anda sendiri sekarang, selagi 1.0 masih menjadi default dan Anda masih mengendalikan peralihannya. Jika Anda sedang mengevaluasi speech streaming untuk agen, ukur waktu hingga parsial pertama berdasarkan anggaran latensi Anda sendiri, bukan memercayai papan skor siapa pun — seperempat detik yang dikeluarkan model ini untuk membeli akurasi bisa jadi tidak berarti apa-apa atau fatal, tergantung pada apa yang dilakukan agen Anda dengan teks itu. Dan jika Anda membangun apa pun yang mungkin suatu hari dipanggil oleh agen pribadi, perhatikan program konektor Muse dengan saksama, karena argumen distribusi yang diajukannya lebih kuat daripada detail teknis yang dirilis bersamanya.
