
Grok Voice Think Fast 2.0: Agen Suara Tercepat dan Termahal dari xAI, Dijelaskan
- qwenBARUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 juta token · 56 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 201 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Kecerdasan61Koding61Matematika
xAI merilis Grok Voice Think Fast 2.0 pada 29 Juli 2026 — yang mereka sebut sendiri sebagai "model suara-ke-suara paling mumpuni" dan andalan baru dari lini agen suaranya. Model ini merespons lebih cepat daripada pesaing mana pun di lima besar (0,70 detik hingga audio pertama), menempati posisi teratas dalam benchmark suara agen, dan mentranskripsi lebih akurat daripada generasi sebelumnya. Model ini juga 60% lebih mahal per menit daripada model yang digantikannya, hadir dengan meteran per menit yang secara diam-diam menaikkan tagihan Anda, dan dilengkapi dengan sakelar alias versi yang beralih secara otomatis dalam seminggu. Panduan ini menjelaskan apa sebenarnya Think Fast 2.0, apa yang diubah xAI di balik layar, bagaimana cerita benchmark terbagi menjadi skor independen dan klaim yang dilaporkan vendor, berapa biaya sebenarnya setelah dihitung, dan cara memanggilnya — ditambah peringatan yang sebaiknya Anda baca sebelum mengalihkan alur panggilan produksi melaluinya.
Catatan akurasi: detail peluncuran, harga, serta akurasi judul dan klaim bisnis berasal dari pengumuman dan dokumentasi xAI (29-07-2026). Skor komposit Artificial Analysis diukur secara independen oleh pihak ketiga. Klaim yang dilaporkan xAI — hasil Starlink A/B, pengali transkripsi, "60% lebih sedikit token penalaran," dan bingkai "hampir 5x lebih cepat" — belum memublikasikan data pendukungnya; perlakukan sebagai angka vendor yang bersifat indikatif dan jalankan evaluasi Anda sendiri. Spesifikasi, harga, dan perilaku alias dapat berubah; verifikasi sebelum Anda membangun.
TL;DR. Grok Voice Think Fast 2.0 adalah model speech-to-speech end-to-end dari xAI untuk agen suara: audio masuk, audio keluar melalui WebSocket, tanpa pipeline ASR→LLM→TTS yang terpisah. Model ini benar-benar cepat (0,70 detik time-to-first-audio, satu-satunya model lima besar di bawah satu detik) dan benar-benar kuat dalam pekerjaan suara agentic, menempati peringkat pertama pada benchmark agen τ-Voice milik Artificial Analysis (56,5%) sementara menempati peringkat kedua secara keseluruhan pada indeks kualitas speech-to-speech (82,9%), di belakang Qwen Audio 3.0 Realtime Plus (84,1%). Ia bernalar sambil berbicara — memangkas penggunaan token penalaran median menjadi sekitar 40% dari model lama — dan biayanya $0,08 per menit, naik dari $0,05. Masalahnya ada pada meteran: suara ditagih per menit audio waktu nyata (wall-clock), sehingga kenaikan harga 60% pada model yang lebih murah untuk disajikan langsung tercermin di tagihan Anda. Dan pada 5 Agustus, alias grok-voice-latest mulai mengarahkan ke 2.0 secara otomatis, sehingga tim yang menggunakan versi lama perlu menguncinya secara sengaja sebelum tanggal tersebut.
Poin-poin penting
• Ucapan-ke-ucapan native: satu model dari mikrofon ke speaker, tanpa rantai ASR→LLM→TTS — itulah sebabnya audio pertama tiba dalam 0,70 detik.
• Pemimpin agentik: #1 pada benchmark agen τ-Voice milik Artificial Analysis (56,5%), jauh di depan GPT-Realtime-2.1 (45,7%) dan Gemini 3.1 Flash (37,7%).
• Bukan pemimpin keseluruhan: #2 pada indeks kualitas ucapan-ke-ucapan (82.9%), di belakang Qwen Audio 3.0 Realtime Plus (84.1%); OpenAI masih unggul dalam dinamika percakapan (95.7% vs 95.1%).
• 60% lebih mahal: $0,08/menit (~$4,80/jam) vs $0,05/menit untuk Think Fast 1.0 — meskipun model tersebut dilaporkan menggunakan ~60% lebih sedikit token penalaran.
• Pergantian alias pada 5 Agustus: grok-voice-latest mengarah ke 2.0 secara otomatis; sematkan grok-voice-think-fast-1.0 sebelum itu agar tetap menggunakan versi yang lebih murah.
• Beri label pada setiap klaim: skor Artificial Analysis bersifat independen; Starlink A/B, pengali transkripsi, dan pembingkaian kecepatan dilaporkan oleh xAI dan tidak dipublikasikan.
Apa itu Grok Voice Think Fast 2.0
Grok Voice adalah keluarga model real-time speech-to-speech dari xAI. "Think Fast" adalah lini respons cepat, yang awalnya diluncurkan dengan Voice Agent Builder pada April 2026; Think Fast 2.0 adalah generasi kedua dari lini tersebut, dirilis pada 29 Juli 2026. Model ini bersifat end-to-end: ia memproses audio mentah, bernalar, dan mengeluarkan audio secara langsung, alih-alih menjalankan pipeline model pengenalan ucapan yang memberi masukan ke LLM teks yang memberi masukan ke model text-to-speech. Pilihan arsitektur itulah yang menjadi akar keunggulan latensinya — tidak ada lompatan serial dan tidak ada teks perantara, sehingga model dapat memulai respons saat masih mendengarkan.
xAI memposisikannya secara eksplisit untuk agen suara AI: jalur dukungan pelanggan, penjualan telepon, resepsionis, teleponi, dan aplikasi lain di mana sistem berbicara dengan seseorang secara real-time dan perlu benar-benar menyelesaikan sesuatu — memesan panggilan, mengkualifikasi prospek, memperbarui catatan, mencari web — bukan sekadar mengobrol. Penekanan agenik, bukan transkripsi atau sintesis mentah, adalah medan pertempuran yang menjadi sasaran peluncuran ini.
Apa yang baru dibandingkan Think Fast 1.0
Peningkatan dari 1.0 lebih dari sekadar kenaikan angka; xAI menjelaskan tiga perubahan struktural:
• Penalaran ucapan paralel. Model menalar melalui kueri sambil berbicara, bukan berpikir dulu lalu berbicara setelahnya. Secara praktis, panggilan alat dapat dipicu sebelum agen selesai dengan kalimat pertamanya — hal yang besar untuk alur suara yang sensitif terhadap latensi.
• Token penalaran jauh lebih sedikit. xAI melaporkan penggunaan token penalaran median turun menjadi sekitar 0,4x dari pendahulunya (kurang lebih 60% lebih sedikit), yang merupakan bagian dari alasan mengapa model ini disebut lebih murah untuk dioperasikan meskipun harganya naik.
* Gaya percakapan hasil reinforcement learning. RL membentuk ulang cara ia berbicara: kalimat lebih pendek, satu pertanyaan dalam satu waktu, tanpa basa-basi — gaya panggilan yang lebih ringkas dan "manusiawi" yang cocok untuk pekerjaan telepon di mana bertele-tele membuang menit (dan, jika dihitung per menit, membuang uang).
Dalam hal kecepatan terukur, waktu hingga audio pertama turun dari 1,25 detik di versi 1.0 menjadi 0,70 detik di versi 2.0. Untuk transkripsi, xAI melaporkan peningkatan sekitar 1,4x di 24 bahasa (dilaporkan vendor, di bawah). translationNotes: - "time-to-first-audio" rendered as "waktu hingga audio pertama" (more natural than literal "waktu-ke-audio-pertama") - "fell" translated as "turun" (dropped/fell) - "1.25s → 0.70s" decimal points converted to Indonesian comma format, "detik" added for clarity - "xAI" kept as-is (brand name) - "1.4x improvement" → "peningkatan sekitar 1,4x" (added "sekitar" for "about") - "vendor-reported" → "dilaporkan vendor" (clear and natural) - "below" → "di bawah" (referring to content below in the original document)

Tolok ukurnya, tolok ukur demi tolok ukur
Peluncuran ini berlandaskan pada Artificial Analysis, sebuah lembaga benchmark pihak ketiga yang independen. Hal itu penting: tidak seperti kebanyakan angka lain dalam pengumuman tersebut, angka-angka ini diukur oleh pihak netral, dan angka-angka itulah yang layak dibandingkan secara setara. Gambaran gabungannya lebih baik daripada satu judul utama.
Indeks Kualitas Ucapan-ke-Ucapan: 82.9% (peringkat kedua). Ini adalah gabungan keseluruhan ucapan-ke-ucapan, naik dari 75.7% untuk Think Fast 1.0. Angka ini mengungguli GPT-Realtime-2.1 (79.1%) dan Gemini 3.1 Flash (69.5%) — tetapi bukan yang pertama. Qwen Audio 3.0 Realtime Plus memimpin dengan 84.1%. Jadi "model suara terbaik secara keseluruhan" adalah pernyataan berlebihan yang tidak didukung data; "model suara agentik tercepat di tingkat teratas" adalah akurat.
Tolok ukur agen suara τ-Voice: 56,5% (tempat pertama). Ini adalah metrik yang paling dipedulikan xAI, dan peringkatnya nyata: 56,5% mengungguli Think Fast 1.0 (52,1%), GPT-Realtime-2.1 (45,7%), dan Gemini 3.1 Flash (37,7%). τ-Voice mengukur performa suara agenik — seberapa baik model menyelesaikan tugas melalui saluran suara, termasuk penggunaan alat di tengah percakapan. Pada sumbu sempit "bisakah ia melakukan pekerjaan itu", Grok memimpin. Musk mempromosikan peringkat ini.
Big Bench Audio: 97.2%. Tolok ukur penalaran wicara; kuat, meskipun Qwen mencatat rekor 99.2%.
Full Duplex Bench: 95,1%. Dinamika percakapan — penanganan interupsi, pengambilan giliran, penyelaan. Ini lompatan besar dari 77,8% pada 1.0, tetapi OpenAI masih mengunggulinya dengan 95,7%, dan Qwen memimpin dengan 98,4%.
Waktu hingga audio pertama: 0.70s. Angka terpenting untuk produk suara nyata. Angka ini turun dari 1.25s dan merupakan satu-satunya nilai di bawah satu detik di antara lima model peringkat teratas; pengujian independen secara luas mendukung respons di bawah satu detik. Latensi token pertama TTS streaming sekitar 285ms. Untuk penggunaan telepon dan real-time, latensi adalah metrik yang dirasakan pengguna di setiap giliran, dan di sinilah 2.0 jelas terbaik.
Membaca baris per baris, profilnya spesifik: paling cepat berbicara, terbaik dalam menyelesaikan tugas, terbaik kedua secara keseluruhan, ketiga dalam kehalusan percakapan. Itu adalah model agen suara yang sangat baik, dan klaim "suara chatbot terbaik" yang biasa-biasa saja. Pilih untuk pekerjaan yang cocok dengan baris teratas.
Akurasi transkripsi
Di luar percakapan, xAI mengklaim transkripsi yang jauh lebih baik. Evaluasi internalnya terhadap 24 bahasa dan ribuan frasa dilaporkan menunjukkan akurasi sekitar 1.4x lipat dibandingkan Think Fast 1.0, dan 1.5–2x lipat akurasi model transkripsi khusus seperti Deepgram Nova 3 dan ElevenLabs Scribe v2. Dalam kondisi dunia nyata yang bising — kebisingan latar, kompresi telepon, panggilan bandwidth rendah — kesenjangan akurasi yang dilaporkan dibandingkan model STT khusus melebar hingga sekitar 10x.
Inilah klaim-klaim yang perlu disikapi dengan hati-hati. Klaim-klaim tersebut dilaporkan oleh xAI; perangkat evaluasi, kumpulan frasa, dan profil kebisingan tidak dipublikasikan. Pengujian independen terhadap transkripsi panggilan telepon bising versi 2.0 dibandingkan dengan Deepgram atau ElevenLabs akan sangat berharga dan, pada saat tulisan ini dibuat, belum dipublikasikan. Secara arah, model end-to-end yang menyerap lebih banyak data telepon dalam pelatihan merupakan peningkatan nyata yang masuk akal — tetapi "10x" harus diverifikasi, bukan diulang sebagai fakta.
Harga: $0.08 per menit dan pertanyaan 60%
Di sinilah peluncuran menjadi kontroversial. Think Fast 2.0 berbiaya $0.08 per menit audio — sekitar $4.80 per jam — ditambah $0.004 per pesan input teks. Think Fast 1.0 adalah $0.05 per menit ($3.00/jam). Itu adalah kenaikan 60%, dan terjadi pada bulan yang sama ketika OpenAI memangkas harga GPT-5.6 Luna sebesar 80% dan Terra sebesar 20%, dengan alasan biaya penyajian yang menurun yang sama seperti yang diklaim xAI untuk model ini.
Meter adalah inti ceritanya. Model teks ditagih per token, jadi ketika model menjadi lebih efisien, tagihan pelanggan otomatis menyusut. Model suara ditagih per menit audio, dan panjang percakapan ditentukan oleh orang yang berbicara, bukan oleh modelnya. Keuntungan efisiensi pada produk per menit menjadi milik vendor, bukan pembeli. Itulah sebabnya model yang dilaporkan menggunakan ~60% lebih sedikit token penalaran — dan karenanya lebih murah untuk dilayani xAI — biaya sewanya 60% lebih mahal.
Lakukan aritmetika pada alur panggilan nyata. Panggilan 4 menit dengan 1.0 berbiaya $0.20; panggilan yang sama dengan 2.0 berbiaya $0.32. Sepuluh ribu panggilan seperti itu per bulan adalah 40.000 menit: $2,000/bulan untuk 1.0 dibandingkan $3,200/bulan untuk 2.0 — perbedaan $1,200/bulan, atau sekitar $14,400/tahun, yang berasal dari perubahan rute saja, bukan dari volume panggilan. Bahkan kemenangan kecepatan yang besar pun nyaris tidak memengaruhinya: memangkas 10 detik penuh dari setiap panggilan menghemat sekitar $0.013 sementara kenaikan harga menambah $0.12 — Anda memulihkan kira-kira sepersembilan dari kenaikan tersebut. Kasus bisnis apa pun yang menjual 2.0 sebagai model yang lebih murah telah mengacaukan "lebih cepat" dengan "lebih murah."
Sebagai konteks, 2.0 masih kira-kira 2,2x lebih murah daripada GPT-Realtime-2.1 High dengan sekitar $10,75/jam. Jadi, tidak mahal secara absolut — ia mahal jika dibandingkan dengan pendahulunya sendiri dan dengan arah yang dituju setiap vendor model lain pada bulan itu.
Jebakan migrasi 5 Agustus
Ada tenggat waktu yang terkait. Pada 5 Agustus 2026, alias grok-voice-latest akan otomatis mulai mengarahkan ke Think Fast 2.0. Jika Anda aktif di Think Fast 1.0 melalui alias tersebut, "tidak melakukan apa pun" akan memutakhirkan Anda — dan tagihan Anda — ke versi baru pada tanggal tersebut. Untuk tetap di 1.0, Anda harus secara eksplisit menyematkan id model grok-voice-think-fast-1.0 sebelum 5 Agustus.
Kedua posisi yang dapat dipertahankan sama-sama memerlukan tindakan sebelum tenggat waktu: entah mengunci 1.0 secara sengaja karena alur skrip Anda berfungsi baik pada $3,00/jam, atau pindah ke 2.0 secara sengaja dan membuat perkiraan ulang pada $4,80/jam, yang dibenarkan atas dasar kualitas, bukan penghematan. Yang tidak dapat dipertahankan adalah mengetahui perubahan tersebut dari faktur bulan September. Aturan yang baik: perlakukan setiap alias yang diakhiri dengan "latest" sebagai instruksi tetap untuk menerima apa pun yang dikirim vendor berikutnya — termasuk harganya.
Cara mengakses dan menggunakannya
Think Fast 2.0 tersedia melalui API Speech-to-Speech dari xAI dengan id model grok-voice-think-fast-2.0, dengan grok-voice-latest sebagai alias bergulir. Model ini realtime, full-duplex melalui WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, diautentikasi dengan header Authorization: Bearer pada saat handshake. Untuk aplikasi browser, buat token sementara di sisi server melalui endpoint sesi realtime sehingga kunci API utama tidak pernah sampai ke klien.
API ini kompatibel dengan OpenAI Realtime, sehingga kode realtime-voice yang ada umumnya hanya perlu mengganti base URL dan kunci. Pengaturan sesi dilakukan melalui event session.update: pilih suara preset (eve, ara, rex, sal, leo), atur format audio input dan output (PCM16 pada 24kHz secara default; μ-law untuk telepon), aktifkan deteksi aktivitas suara di sisi server, dan daftarkan alat — termasuk alat pencarian web bawaan — sehingga agen dapat bertindak di tengah percakapan. Alur event mengikuti pola standar: klien menambahkan frame buffer audio, server mengalirkan delta audio respons, dan event argumen pemanggilan alat dipicu ketika model memutuskan untuk bertindak, dengan hasil dikirim kembali sebagai output pemanggilan fungsi. Model ini mendukung 25+ bahasa dan kloning suara kustom dari sekitar satu menit ucapan.
Catat apa yang bukan: ini adalah model agen ucapan-ke-ucapan, bukan layanan transkripsi atau terjemahan umum. Jika tugas inti produk Anda adalah mengubah audio menjadi teks dengan murah, model STT khusus adalah alat yang berbeda — dan dengan tarif per menit, Anda membayar untuk seluruh percakapan, sehingga beban kerja yang hanya transkripsi menjadi mahal dengan cepat.

Bagaimana ini cocok dengan stack agen suara
Think Fast 2.0 adalah model suara real-time khusus yang diakses melalui API khusus xAI, bukan LLM tujuan umum yang dihosting oleh router model. Jalur suara berjalan langsung di WebSocket xAI — di situlah latensi sub-detik berada, dan itu tidak bertahan pada lompatan perantara.
Segala hal lain di sekitar produk suara — {{1}}logika bahasa alami yang tidak kritis terhadap waktu, penalaran cadangan saat percakapan keluar dari skenario, peringkasan, analitik, email tindak lanjut yang dipicu oleh agen setelah panggilan{{/1}} — adalah pekerjaan teks dan multimodal tujuan umum. Untuk bagian itu, endpoint yang netral terhadap vendor seperti {{KEEP}}OrcaRouter gives you one OpenAI-compatible API across many LLMs, so you're not locked into one vendor for the parts of the stack that don't need the realtime voice lane{{/KEEP}}. Pemisahan yang bersih: API khusus xAI untuk streaming suara itu sendiri, OrcaRouter (atau sejenisnya) untuk penalaran teks dan multimodal di sekitarnya.
Kompetisi: kecepatan agen vs kecerdasan mentah
Think Fast 2.0 hadir di tengah pasar paling kompetitif dalam AI saat ini — agen suara real-time — dan tabel benchmark membuat tradeoff terlihat sangat jelas.
Qwen Audio 3.0 Realtime Plus adalah pemimpin kecerdasan: 84.1% pada indeks kualitas ucapan-ke-ucapan (pertama), rekor 99.2% pada Big Bench Audio, dan 98.4% pada full duplex. Namun rata-rata waktu-ke-audio-pertama sekitar 4.02 detik — kira-kira 5.7x lebih lambat daripada 0.70 detik milik Grok. Untuk percakapan di dalam mobil, perangkat yang dapat dikenakan, dan telepon, perbedaan itu bukan "cepat vs lambat," melainkan dapat digunakan vs tidak dapat digunakan. Qwen juga terbagi menjadi tingkatan Plus (kualitas) dan tingkatan Flash (paket pertama sekitar 300ms) untuk berbagai skenario, yang merupakan jawaban bijaksana atas ketegangan yang sama.
GPT-Realtime-2.1 menempati posisi tengah pada sebagian besar baris (kualitas 79,1%, agentik 45,7%) dan unggul dalam dinamika percakapan (95,7%). Tier High-nya kira-kira 2,2 kali lipat harga per jam Grok. Bagi tim yang sudah mendalami ekosistem OpenAI, ini tetap menjadi default dengan hambatan paling rendah.
Gemini 3.1 Flashtertinggal pada komposit kualitas dan agentik (69.5%, 37.7%) tetapi merupakan bagian dari tumpukan suara Gemini yang lebih luas dan ekosistem Google yang lebih disukai banyak tim karena alasan lain.
Kesimpulan praktis: pilih berdasarkan beban kerja. Jika agen suara Anda harus terasa instan dan harus andal menyelesaikan tugas berbasis alat (dukungan, kualifikasi, pemesanan), Think Fast 2.0 adalah opsi terkuat yang terukur saat ini. Jika prioritas Anda adalah penalaran terdalam dan Anda bisa menerima latensi beberapa detik, Qwen Plus menang. Jika kehalusan percakapan dan kecocokan ekosistem yang paling utama, GPT-Realtime-2.1 tetap menjadi pemimpin yang harus dikalahkan.

Tiga skenario yang cocok
1. Dukungan telepon dan teleponi
Kombinasi yang paling penting: audio pertama dalam waktu kurang dari satu detik, transkripsi telepon berisik yang kuat (dilaporkan vendor), dan penanganan interupsi full-duplex. Saluran dukungan yang agennya mulai berbicara hampir seketika dan dapat menggali info akun di tengah giliran bicara adalah persis yang disetel untuk 2.0. Gaya bicara RL-nya yang lebih pendek, satu pertanyaan pada satu waktu, juga sangat cocok untuk teleponi, di mana menit adalah unit yang dapat ditagih — di meteran vendor mana pun.
2. Kualifikasi prospek dan tindak lanjut pasca-panggilan
{{1}}Suara agenik adalah tempat 2.0 benar-benar menjadi yang pertama, dan kualifikasi prospek adalah tugas kanonik suara agenik:{{/1}} kualifikasi, arahkan, dan picu tindak lanjut selagi minat masih segar. {{2}}Pemanggilan alatnya dapat terpicu sebelum kalimat pertama berakhir, sehingga agen dapat membuat catatan CRM selagi masih berbicara dengan prospek.{{/2}} {{3}}Rencanakan atribusi tingkat sesi dan izin alat yang ketat — agen suara dapat berbuat salah secara real-time, dan pembersihannya ada di tangan Anda.{{/3}}
3. Produk voice-agent yang sedang dalam pengembangan aktif
Bagi pengembang yang meluncurkan agen suara mereka sendiri — integrasi Tradecraft dan GrokTerm yang dikutip xAI persis seperti bentuk ini — kecepatan 2.0 dan API yang kompatibel dengan OpenAI menjadikannya pengganti langsung (drop-in) yang mulus untuk kode GPT-Realtime. Kunci versinya, jalankan uji coba terbatas dengan kondisi keberhasilan yang jelas (misalnya, "kualifikasi dan arahkan pengunjung halaman harga"), dan ukur biaya per hasil yang selesai, bukan biaya per menit.
Keterbatasan dan peringatan
Think Fast 2.0 baru berusia lima hari saat tulisan ini dibuat, dan itu tampak dari berbagai catatan peringatan. Hasil A/B Starlink (konversi lebih tinggi dan penahanan dukungan) dilaporkan oleh xAI tanpa angka yang dipublikasikan; pengganda transkripsi dan penggambaran "hampir 5x lebih cepat" juga merupakan klaim vendor, bukan tolok ukur independen. Satu-satunya artikel yang akan Anda lihat menuduh "regresi performa dan laporan pengujian yang dibuat-buat" merujuk pada ketidakverifikasian yang sama — angka yang dipublikasikan xAI belum direproduksi secara independen, dan komunitas voice yang peka terhadap keandalan memang curiga terhadap metrik vendor yang tidak dipublikasikan. Tolok ukur juga tidak dapat mengukur panggilan terburuk Anda: respons 0,70 detik tidak berguna jika agen dengan yakin mengarahkan calon pelanggan ke tim yang salah. Penagihan voice bersifat per menit dengan kenaikan harga yang sudah diperhitungkan, sehingga eksposur biayanya nyata. Dan seperti halnya model real-time yang baru dirilis, perkirakan API akan sering berubah. Verifikasi klaim akurasi pada audio Anda sendiri, kunci versi di produksi, dan siapkan eskalasi serta perekaman sebelum panggilan langsung pertama.
FAQ
Apa itu Grok Voice Think Fast 2.0?
Model speech-to-speech unggulan xAI untuk agen suara, dirilis 29 Juli 2026: audio-ke-audio end-to-end asli melalui WebSocket, dengan waktu-ke-audio-pertama 0,70 detik dan peringkat pertama pada benchmark agen τ-Voice.
Berapa biaya Grok Voice Think Fast 2.0?
$0.08 per menit audio (sekitar $4.80/jam) ditambah $0.004 per pesan teks masukan — peningkatan 60% dibandingkan $0.05/menit Think Fast 1.0.
Apakah Think Fast 2.0 adalah model suara terbaik?
Ini yang tercepat dan terbaik dalam tugas-tugas agenik (56.5% τ-Voice, peringkat pertama) dan peringkat kedua secara keseluruhan pada indeks kualitas ucapan-ke-ucapan (82.9%), di belakang Qwen Audio 3.0 Realtime Plus (84.1%). "Terbaik" bergantung pada beban kerja.
Apa yang berubah dari Think Fast 1.0?
Penalaran ucapan paralel (berpikir sambil berbicara), sekitar 60% lebih sedikit token penalaran, gaya percakapan lebih pendek yang disetel-RL, peningkatan transkripsi 1,4x (dilaporkan vendor), dan waktu hingga audio pertama dipangkas dari 1,25 detik menjadi 0,70 detik.
Apakah traffic switch Think Fast 1.0 saya akan beralih secara otomatis?
Ya, pada 5 Agustus 2026, jika Anda menggunakan alias grok-voice-latest. Kunci grok-voice-think-fast-1.0 sebelum itu untuk tetap pada 1.0, atau ambil 2.0 secara sengaja dan perhitungkan ulang biayanya.
Bagaimana cara memanggil Grok Voice Think Fast 2.0?
Melalui API Speech-to-Speech milik xAI — WebSocket real-time (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) yang kompatibel dengan OpenAI Realtime API, dengan suara preset, VAD server, dan pemanggilan alat.
Model suara apa saja yang menjadi pesaingnya?
Qwen Audio 3.0 Realtime Plus (lebih cerdas, jauh lebih lambat dengan audio pertama 4,02 detik), GPT-Realtime-2.1 (dinamika percakapan yang lebih baik, ~2,2x lebih mahal di tingkat High), dan Gemini 3.1 Flash.
Apakah klaim benchmark tersebut dapat diandalkan?
Skor Artificial Analysis bersifat independen dan solid. Hasil A/B Starlink, pengali transkripsi, dan pembingkaian kecepatan dilaporkan oleh xAI tanpa data yang dipublikasikan — anggap sebagai indikasi dan verifikasi pada audio Anda sendiri.
Apakah Grok Voice bagus untuk transkripsi?
Ia dapat mentranskripsi dalam suatu percakapan, dan xAI mengklaim peningkatan besar dibandingkan model STT khusus dalam kondisi bising — tetapi layanan ini ditagih per menit percakapan, sehingga beban kerja transkripsi khusus lebih baik dilayani oleh model STT tersendiri.
Intinya
Grok Voice Think Fast 2.0 adalah model suara agentik terkuat yang terukur sejauh ini, dan yang tercepat di kelas teratas dengan selisih yang lebar — 0,70 detik hingga audio pertama adalah kemenangan nyata, independen, dan berorientasi pengguna, serta peringkat pertama di τ-Voice adalah peringkat yang sesungguhnya. Ringkasan jujurnya spesifik: ini alat terbaik di kelasnya untuk agen suara real-time yang didukung perangkat, bukan model suara terbaik di semua lini — Qwen unggul dalam kecerdasan dan OpenAI dalam kehalusan percakapan. Kontroversinya bukan tentang kecepatan. Kontroversinya tentang ukuran: kenaikan harga 60% pada model yang menurut xAI lebih murah untuk disajikan, migrasi alias otomatis dengan tenggat waktu mutlak, dan klaim utama yang bertumpu pada angka vendor yang tidak dipublikasikan. Gunakan untuk kecepatan agentiknya, kunci versi Anda, beri label pada klaim vendor, dan verifikasi akurasi pada panggilan Anda sendiri — serta pertahankan teks tujuan umum dan penalaran di sekitar produk suara Anda pada endpoint netral-vendor seperti OrcaRouter.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
