Kartu judul hero untuk 'Realtime-Venus vs Grok Voice Think Fast 2.0', dengan subjudul 'Yang satu bisa dibeli sore ini. Yang satu lagi cuma unduhan.', dengan tiga kartu bertuliskan 'Grok Voice Think Fast 2.0: $0,08 per menit audio, 0,70 dtk hingga audio pertama', 'Realtime-Venus: bobot Apache-2.0, tanpa API, tanpa daftar tarif', dan 'Taruhan bersama: bernalar sambil berbicara, bukan sebelumnya', di atas strip footer bertuliskan 'Angka Grok menurut Artificial Analysis dan dokumentasi xAI; angka Realtime-Venus dari laporan teknisnya, belum direproduksi.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Hanya Satu dari Ini yang Memiliki Harga

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Letakkan Realtime-Venus dan Grok Voice Think Fast 2.0 berdampingan dan perbedaan pertama bukanlah tolok ukur, melainkan pesanan pembelian. Grok Voice Think Fast 2.0 adalah model speech-to-speech yang dihosting yang mulai dijual pada 29 Juli 2026 dengan harga $0,08 per menit audio dengan waktu hingga audio pertama yang dipublikasikan 0,70 detik dan skor tolok ukur dari pihak ketiga. Realtime-Venus adalah sistem full-duplex 9B dari Tim Venus Ant Group dan Universitas Tsinghua yang ada sebagai bobot Apache-2.0, laporan teknis bertanggal 12 September 2026, dan tidak ada apa pun yang bisa Anda hubungi. Salah satunya dapat Anda sambungkan ke saluran telepon sebelum akhir minggu ini. Yang lainnya dapat Anda baca. Asimetri itu ternyata menjadi perbandingan yang jauh lebih berguna daripada papan skor, karena kedua model membuat taruhan arsitektural yang hampir sama lalu sepenuhnya berbeda dalam hal apa yang harus dilakukan dengannya.

Jawaban singkatnya

Pilih Grok Voice Think Fast 2.0 jika Anda memerlukan agen suara yang berfungsi sekarang, di produksi, dengan daftar tarif yang dapat Anda masukkan ke anggaran dan jaminan latensi yang dapat Anda uji. Pilih Realtime-Venus jika Anda perlu memiliki stack sendiri — jika data Anda tidak boleh meninggalkan infrastruktur Anda, jika Anda perlu menyetel front end, atau jika Anda sedang mengevaluasi arsitektur alih-alih merilis produk. Tidak ada kasus ketiga tempat keduanya bersaing, karena yang satu memiliki API dan yang lain tidak.

Mereka sepakat tentang masalah sulit itu.

Yang menarik adalah betapa miripnya diagnosisnya. Kedua model ada karena kontradiksi yang sama: kendali percakapan harus berjalan pada granularitas subdetik, sementara penalaran membutuhkan waktu beberapa detik. Model yang berhenti untuk berpikir berhenti terasa hadir.

Grok Voice Think Fast 2.0 mengatasinya dengan bernalar sambil berbicara. Lini Think Fast dibangun atas gagasan bahwa model tidak boleh menyimpulkan lebih dulu lalu menghasilkan ucapan belakangan; sebagai gantinya, model menstrimkan ucapan dan berpikir secara paralel, sehingga panggilan alat dapat dipicu sebelum agen menyelesaikan kalimat pertamanya. xAI melaporkan bahwa versi 2.0 menggunakan sekitar 0,4 kali token penalaran dibandingkan pendahulunya, yang disajikan sebagai peningkatan dari sisi biaya dan latensi, bukan peningkatan kualitas.

Realtime-Venus mengatasinya dengan tidak mengatasinya di frontend sama sekali. Runtime dual-loop-nya menjaga loop interaksi satu detik tetap berjalan — persepsi, kontrol giliran, generasi ucapan — dan menyerahkan apa pun yang berat ke komponen terpisah bernama Realtime-Venus-Harness melalui penanda delegasi asinkron yang dipancarkan dalam urutan tersembunyi model itu sendiri. Percakapan latar depan tidak pernah berhenti. Hasil latar belakang diintegrasikan kembali saat tiba.

Itu adalah jawaban rekayasa yang berbeda untuk pertanyaan yang sama, dan keduanya memiliki mode kegagalan yang berbeda. Bernalar sambil berbicara menempatkan beban pada model untuk menjaga kedua alur tetap koheren. Delegasi menempatkan beban pada runtime untuk mencegah kedua loop saling merusak — itulah sebabnya causal task capture dari makalah Realtime-Venus, yakni snapshot status terisolasi per tugas yang didelegasikan, adalah detail yang menopang desain tersebut.

Satu-satunya metrik yang dapat digunakan untuk mengukur keduanya

Benchmark full-duplex adalah satu-satunya tempat keduanya tumpang tindih, dan keduanya tidak tumpang tindih secara rapi.

• Penanganan interupsi — Realtime-Venus melaporkan merespons 75% interupsi pengguna pada Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 mencetak skor 95,1% pada Full Duplex Bench menurut Artificial Analysis, naik dari 77,8% untuk versi 1.0.

• Kelanjutan dalam kondisi tumpang tindih — Realtime-Venus melaporkan kelanjutan sebesar 97% pada backchannel, 88% pada ujaran yang ditujukan kepada orang lain, dan 86% pada ujaran latar belakang, serta menyatakan bahwa model ini melampaui Gemini 3.1 Live dan GPT-4o pada ketiga kondisi tersebut.

• Instrumen yang berbeda, penulis yang berbeda — angka Realtime-Venus berasal dari laporan teknisnya sendiri tanpa reproduksi eksternal. Angka Grok berasal dari pihak ketiga yang menjalankan model tersebut. Membandingkan angka yang dilaporkan sendiri dengan angka yang diukur secara independen bukanlah sebuah perbandingan, dan selisih di atas sama mungkinnya bersifat metodologis maupun nyata.

Pembacaan yang jujur: berdasarkan bukti yang tersedia, Grok Voice Think Fast 2.0 adalah satu-satunya dari keduanya yang perilaku full-duplex-nya telah diukur oleh seseorang yang tidak memiliki kepentingan atas hasilnya.

Di mana angka independen menempatkan Grok Voice Think Fast 2.0

Pembacaan terkini yang paling jelas berasal dari Speech Agent Arena milik Artificial Analysis, yang menilai model berdasarkan preferensi buta dalam percakapan suara langsung pada tugas seperti memesan janji temu dokter gigi dan memesan makanan bawa pulang. Per 18 September 2026, Grok Voice Think Fast 2.0 High berada di peringkat ketujuh dari lebih dari dua puluh entri dengan Elo 1.011 dari 552 sampel — di belakang Gemini 3.1 Flash Live Minimal milik Google pada 1.096, Gemini 3.8 Live pada 1.083, dan GPT-Live-1 pada 1.053, serta jauh di atas pendahulunya sendiri, Grok Voice Think Fast 1.0, pada 908.

Kolom di sebelah Elo adalah yang lebih menarik. Pada tingkat keberhasilan tugas, Grok Voice Think Fast 2.0 mencatat 94,6%, angka tertinggi di mana pun dalam dua puluh besar yang terlihat — di atas 93,2% milik Gemini 3.8 Live, 91,5% milik GPT-Realtime-2.1 High, dan 90,9% milik GPT-Live-1. Peringkat ketujuh berdasarkan preferensi, pertama berdasarkan penyelesaian tugas, adalah profil yang tidak biasa dan cukup spesifik: pendengar tidak menyukai suaranya, tetapi ia menyelesaikan pekerjaannya. Jika produk Anda melakukan sesuatu alih-alih mengobrol, itulah kolom yang memprediksi hasil Anda, dan itu adalah bukti independen terkuat yang dimiliki masing-masing dari kedua model ini.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Angka-angka yang dipublikasikan xAI saat peluncuran adalah instrumen yang berbeda dan harus dibaca secara terpisah: 82,9% pada indeks kualitas speech-to-speech milik Artificial Analysis, peringkat pertama pada benchmark agentic τ-Voice dengan 56,5%, 97,2% pada Big Bench Audio dan 95,1% pada Full Duplex Bench. Itu adalah peringkat saat model dirilis pada akhir Juli 2026, dan papan peringkat di kategori ini bergerak setiap bulan — yang justru menjadi alasan mengapa tabel arena di atas, jika dibaca hari ini, lebih bernilai daripada angka-angka peluncuran.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Tagihan, dan bagian-bagiannya yang tidak ada pada tagihan

Grok Voice Think Fast 2.0 dikenai biaya $0,08 per menit audio, sekitar $4,80 per jam, ditambah $0,004 untuk setiap pesan masukan teks. Itu merupakan kenaikan 60% dibandingkan $0,05 per menit yang dikenakan versi 1.0 saat peluncuran, dan xAI memindahkan alias bergulir grok-voice-latest ke 2.0 secara otomatis pada 5 Agustus 2026, sehingga tim yang ingin tetap pada harga lama harus menyematkan versi eksplisit sebelum tanggal itu. Model per menit juga berarti peningkatan efisiensi menguntungkan vendor: jika model menjadi lebih baik dalam menyelesaikan panggilan dengan lebih cepat, tagihan Anda per panggilan turun, tetapi biaya per menit Anda tidak.

Realtime-Venus tidak punya tagihan, karena tidak punya layanan. Yang dimilikinya sebagai gantinya adalah dasar perangkat keras. Dua checkpoint 9B dalam BF16 masing-masing berukuran sekitar delapan belas gigabyte untuk bobotnya sebelum memori aktivasi, dan kartu itu mendokumentasikan loop streaming per detik yang harus berjalan terus-menerus. Node GPU yang mampu melakukan itu memiliki biaya bulanan, dan biaya itu tetap — Anda membayarnya entah ada yang memanggil atau tidak. Untuk produk dengan lalu lintas yang stabil, itu lebih murah daripada $4,80 per jam. Untuk produk dengan lalu lintas yang terputus-putus, biayanya jauh lebih mahal, dan titik persilangan adalah satu-satunya pertanyaan finansial yang penting di sini.

Bobot, kontrol, dan apa yang dapat diubah oleh masing-masing

Di sinilah kedua model tidak lagi bisa dibandingkan sama sekali.

• Fine-tuning — Realtime-Venus menyertakan bobot. Anda dapat menyempurnakannya, mengkuantisasinya, menjalankannya secara air-gapped, dan memeriksa setiap lapisan. Grok Voice Think Fast 2.0 adalah model hosted tertutup; yang dapat Anda ubah adalah prompt, pilihan suara, dan alat yang Anda daftarkan.

• Suara — Grok Voice Think Fast 2.0 hadir dengan suara preset dan mendukung kloning suara kustom dari sekitar satu menit ucapan. Realtime-Venus menyertakan suara referensi dan dekoder token-ke-waveform bawaan, dan apa pun di luar itu menjadi tanggung jawab Anda.

• Jangkauan — Grok Voice Think Fast 2.0 mendukung lebih dari 25 bahasa dan secara default berbicara PCM16 pada 24 kHz dengan μ-law untuk teleponi, melalui sesi WebSocket yang kompatibel dengan OpenAI Realtime. Kompatibilitas itu adalah aset migrasi yang nyata: sebagian besar kode suara realtime yang ada hanya memerlukan perubahan base URL dan kunci. Realtime-Venus mendokumentasikan bahasa Inggris dan Mandarin.

• Video — Realtime-Venus-Omni memproses video streaming dan gambar melalui encoder SigLIP2 serta melakukan persepsi visual berkelanjutan. Grok Voice Think Fast 2.0 bersifat audio dan teks; tidak ada jalur kamera.

• Konteks panjang — Realtime-Venus memiliki konteks 40.960 token dan memori video panjang tanpa pelatihan yang dapat diaktifkan pada jendela empat puluh menit. Grok Voice Think Fast 2.0 adalah model sesi tanpa fitur memori terpublikasi yang sebanding.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Di mana masing-masing rusak

Kegagalan yang perlu diantisipasi justru berlawanan. Eksposur Grok Voice Think Fast 2.0 adalah konsentrasi vendor dan pemasaran yang tidak dapat diverifikasi: hasil A/B Starlink dari xAI, pengali akurasi transkripsinya, dan pembingkaian kecepatannya semuanya dilaporkan perusahaan tanpa data dasar yang dipublikasikan, dan model per menit yang mengubah harga sebesar 60% antarversi telah menunjukkan bahwa harganya akan berubah. Sematkan versi Anda dan jalankan evaluasi Anda sendiri pada audio Anda sendiri.

Titik lemah Realtime-Venus adalah bahwa belum ada yang menjalankannya. Tolok ukurnya dilaporkan sendiri, harness-nya tidak terdokumentasi relatif terhadap kepentingannya, dan latensinya dalam penerapan nyata tidak diketahui — laporan tersebut menggambarkan irama interaksi satu detik, yang merupakan parameter desain, bukan waktu sampai audio pertama yang terukur. Model tanpa API dan tanpa reproduksi tidak punya rekam jejak, hanya spesifikasi.

Ada jalan tengah yang layak dinyatakan secara terus terang, karena itulah yang sebenarnya akan dilakukan sebagian besar tim. Jika Anda membangun sistem berbasis delegasi — pilih front end Anda sendiri, serahkan pekerjaan mahal ke model teks — front end dan jalur penalaran tidak harus berasal dari tempat yang sama. OrcaRouter tidak menyediakan Realtime-Venus maupun Grok Voice Think Fast 2.0; kedua lapisan suara itu berada di luar apa yang kami layani, dan kami mengatakannya secara terbuka alih-alih memberi kesan sebaliknya. Jalur yang didelegasikan adalah urusan yang berbeda. Hampir 200 model teks berada di balik satu kunci dengan harga daftar penyedia tanpa markup, dengan failover otomatis sehingga gangguan pada penyedia hulu tidak membuat panggilan aktif terputus, sebuah DSL routing untuk menggabungkan beberapa model ke dalam satu panggilan, dan fusi model untuk keputusan yang layak mendapat lebih dari satu pendapat. Itulah separuh dari agen suara yang diuntungkan karena bisa ditukar, dan itulah separuh yang dapat Anda ubah tanpa menyentuh model yang sedang memegang percakapan.

Mana yang harus dipilih

Pilih Grok Voice Think Fast 2.0 kuartal ini. Produk ini tersedia, tolok ukurnya independen, menempati peringkat pertama pada evaluasi agentic yang memprediksi apakah agen Anda dapat melakukan sesuatu yang berguna, dan 0,70 detik ke audio pertama adalah angka yang dapat Anda jadikan dasar pengalaman pengguna. Anggarkan kenaikan harga 60% dibandingkan 1.0 dan kunci versi model Anda.

Pilih Realtime-Venus hanya jika kendalanya adalah kepemilikan. Jika penerapan Anda tidak dapat memanggil API eksternal, jika Anda perlu melakukan fine-tuning pada front end percakapan, atau jika Anda memerlukan kamera — ketiga kasus itu adalah keseluruhan kasusnya, dan itu alasan yang kuat ketika berlaku.

Yang seharusnya tidak menentukan hal itu adalah tabel benchmark, karena kedua sisi tabel tersebut dihasilkan oleh orang yang berbeda dalam kondisi yang berbeda. Angka-angka Grok Voice Think Fast 2.0 diukur oleh orang lain. Angka Realtime-Venus tidak diukur oleh orang lain. Sampai itu berubah, perbandingan yang benar-benar tersedia adalah antara sebuah produk dan sebuah makalah.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari