
Realtime-Venus vs SeedRealtime: Dua Cara yang Bertolak Belakang untuk Menjadi Tidak Tersedia
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus dan SeedRealtime adalah dua bagian dari kisah 2026 yang sama, dan keduanya gagal dalam uji yang berlawanan. SeedRealtime adalah model full-duplex audio-visual native milik ByteDance, diaktifkan di dalam aplikasi Doubao pada 5 Agustus 2026 secara gratis, menjangkau audiens yang oleh pembuatnya digambarkan dalam hitungan ratusan juta — tanpa API, tanpa pengenal model, tanpa harga, dan tanpa target latensi. Realtime-Venus adalah sepasang checkpoint 9B dari Tim Venus Ant Group dan Universitas Tsinghua, diterbitkan pada 12 September 2026 di bawah Apache-2.0 dengan laporan teknis dan tanpa pengumuman, berada di repositori yang dapat diunduh oleh insinyur mana pun dan hampir tidak ada yang dapat men-deploy-nya secara realistis. Salah satunya tidak dapat Anda panggil. Yang lainnya dapat Anda unduh lalu menyadari bahwa tidak ada apa pun yang bisa dipakai untuk memanggilnya. Keduanya benar-benar berada di garis depan kemampuan yang sama, dan tak satu pun memiliki benchmark yang telah direproduksi oleh siapa pun di luar penulisnya sendiri.
Dua ragam dari "kamu tidak bisa memilikinya"
Ada baiknya bersikap tepat, karena frasa "tidak tersedia" menyembunyikan perbedaan yang nyata.
SeedRealtime tidak tersedia sebagaimana sebuah produk konsumen tidak tersedia: ia ada, berfungsi, memiliki pengguna, dan pintunya sekadar tertutup bagi para pengembang. Tidak ada API, tidak ada daftar tarif, tidak ada portal dokumentasi, dan tidak ada jadwal yang dinyatakan untuk itu. Jalur ByteDance ke pasar adalah aplikasi, dan aplikasi itu sudah cukup. Yang Anda dapatkan sebagai pengembang adalah demo yang bisa Anda coba dan tidak bisa Anda integrasikan.
Realtime-Venus tidak tersedia sebagaimana sebuah artefak riset tidak tersedia: bobotnya publik, lisensinya permisif, kodenya ada, dan tidak ada yang menjalankannya. Repositori itu tidak di-deploy oleh penyedia inferensi mana pun, dan unduhan sama sekali tidak dilacak, jadi tidak ada sinyal publik mengenai adopsi, baik yang mendukung maupun tidak. Ia tersedia dalam pengertian yang penting bagi seorang peneliti dan tidak tersedia dalam pengertian yang penting bagi seorang manajer produk.
Jika digabungkan, keduanya membingkai pertanyaan yang saat ini membuat seluruh kategori ini terhenti: model yang berfungsi berada di balik aplikasi konsumen, dan model yang dapat Anda jalankan tidak ada dalam produksi di mana pun.
Keduanya berada di tingkat yang benar-benar membedakan 2026
Cara yang berguna untuk membaca bidang realtime adalah dalam tiga tingkatan. Yang pertama adalah suara half-duplex dengan visi yang ditempelkan — asisten berbasis giliran yang bisa melihat tetapi tetap harus bergiliran. Yang kedua adalah audio full-duplex, mendengarkan dan berbicara sekaligus tanpa kamera: Seeduplex milik ByteDance sendiri, GPT-Live milik OpenAI, Grok Voice Think Fast 2.0 milik xAI. Yang ketiga adalah audio-visual full-duplex, ketika persepsi dan ekspresi mencakup video dan audio secara berkelanjutan.
SeedRealtime adalah model pertama pada tingkat ketiga yang mencapai penerapan komersial skala besar. Realtime-Venus adalah pendatang open-weight pada tingkat yang sama — video melalui encoder SigLIP2, audio melalui Whisper-Medium, tulang punggung Qwen3-8B, dan loop interaksi satu detik yang tidak pernah berhenti mempersepsi. Kartu modelnya menyatakan bahwa model ini diadaptasi dari MiniCPM-o 4.5, model omni-modal OpenBMB yang dirilis lebih awal pada 2026, yang menempatkan kontribusi Ant Group pada pasca-pelatihan dan runtime, bukan pada arsitektur dasar.
Kesamaan keduanya, dan hal yang menempatkan mereka satu tingkat di atas sistem yang hanya mengandalkan audio, adalah bahwa tidak satu pun berhenti untuk melihat. Persepsi visual berkelanjutan saat berbicara adalah kemampuan yang benar-benar berbeda dari mendeskripsikan satu frame, dan kedua model dibangun dengan kemampuan itu sebagai inti.
Berapa nilai angka masing-masing

Tidak ada model yang memiliki tolok ukur pihak ketiga. Namun, buktinya tidak setara, dan perbedaannya penting.
• SeedRealtime sama sekali tidak menerbitkan benchmark apa pun. Yang ditawarkan ByteDance hanyalah klaim bahwa masalah ritme dialog — menyerobot pembicaraan pengguna, merespons terlambat, terpicu oleh suara orang asing — turun sekitar setengah dibandingkan dengan sistem kaskade, berdasarkan evaluasi manusia end-to-end. Data yang mendasarinya tidak dipublikasikan.
• Angka pendahulunya memiliki pola yang sama. Seeduplex, model khusus audio yang dikirim ByteDance ke Doubao pada April 2026, dilaporkan memangkas separuh tingkat respons palsu dan interupsi palsu, memangkas latensi endpoint sekitar 250 milidetik, mengurangi respons prematur sebesar 40%, dan menaikkan kepuasan panggilan sebesar 8,34 poin dalam uji A/B berskala besar. Semua dilaporkan vendor.
• Realtime-Venus menerbitkan sebuah tabel. Laporannya mengklaim skor terbaik pada enam dari delapan benchmark video, termasuk StreamingBench 70,2, OVO-Bench 64,7, dan Daily-Omni 81,3, serta memimpin pada MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, dan Speech CMMLU 67,8 untuk checkpoint audio.
• Keduanya belum direproduksi. Tabel yang dipublikasikan yang belum diperiksa siapa pun dan A/B yang tidak dipublikasikan yang tidak dapat diperiksa siapa pun adalah dua jenis hal yang belum terverifikasi yang berbeda. Tidak satu pun merupakan bukti yang dapat Anda jadikan dasar keputusan pengadaan.
Satu-satunya perbandingan yang layak dilakukan di dalam angka-angka Realtime-Venus adalah dengan basisnya sendiri. MiniCPM-o 4.5 melaporkan 80,2 pada Daily-Omni; Realtime-Venus-Omni melaporkan 81,3. Kenaikan satu poin dibandingkan model yang menjadi dasar adaptasinya, pada tolok ukur yang sudah ditangani model itu, adalah hasil yang masuk akal untuk upaya pascapelatihan dan runtime — dan klaim yang jauh lebih kecil daripada kesan yang ditimbulkan oleh "terbaik pada enam dari delapan" jika dibaca sendiri.

Masalah pengambilan giliran, tempat full-duplex berada
Dupleks penuh bukan fitur latensi. Ini adalah serangkaian perilaku: mengetahui kapan jeda berarti "saya sedang berpikir", bukan "saya sudah selesai"; membedakan percakapan orang di sekitar dari orang yang berbicara kepada Anda; dan tetap diam saat ada umpan balik singkat alih-alih menganggap "mm-hm" sebagai interupsi.
Pendekatan SeedRealtime adalah memodelkan keadaan percakapan secara native dan sepenuhnya menghilangkan detektor aktivitas suara eksternal, sehingga giliran bicara menjadi perilaku yang dipelajari di dalam jaringan alih-alih ambang batas yang diterapkan pada aliran audio. Itu adalah komitmen arsitektural yang sama yang dibuat Realtime-Venus, dan keduanya diposisikan melawan sistem kaskade yang memerlukan komponen terpisah untuk memutuskan siapa yang berbicara.
Perbedaan buktinya terletak pada kenyataan bahwa klaim SeedRealtime adalah tentang penerapan dalam skala besar — ratusan juta pengguna, ruangan nyata, kebisingan nyata — sedangkan klaim Realtime-Venus adalah tentang sebuah tolok ukur. Hasil Full-Duplex-Bench v1.5 untuk Realtime-Venus-Audio — 75% respons terhadap interupsi, kelanjutan sebesar 97% dalam kondisi backchannel, 88% dalam ujaran yang ditujukan kepada orang lain, dan 86% dalam pembicaraan latar belakang, melampaui Gemini 3.1 Live dan GPT-4o dalam hal kelanjutan — adalah angka-angka yang paling relevan secara langsung yang telah dipublikasikan oleh masing-masing model untuk masalah ini. Angka-angka itu juga sepenuhnya dilaporkan sendiri, dan kelanjutan 97% dalam kondisi backchannel adalah angka yang mencolok yang layak mendapat peninjau kedua sebelum siapa pun mengutipnya sebagai fakta.
Di mana masing-masing meninggalkan seorang pembangun
Kesenjangan praktisnya bukanlah kualitas, melainkan bentuk tawarannya.
• SeedRealtime — Anda dapat mencobanya di Doubao secara gratis dan tidak akan pernah mengintegrasikannya. Tidak ada jalur dari "ini mengesankan" menuju "ini ada di produk saya."
• Realtime-Venus — Anda dapat mengunduhnya, melakukan fine-tune, menjalankannya secara air-gapped, dan memeriksa setiap lapisan. Biayanya adalah dua checkpoint 9B dalam BF16 dengan bobot masing-masing sekitar delapan belas gigabita, ditambah loop streaming berkelanjutan per detik, yang berarti node GPU yang tetap ditagih apakah ada yang memanggil atau tidak.
• Tidak satu pun memiliki opsi hosted. Tidak satu pun dapat dicoba hanya dengan kunci dan waktu satu sore.
Poin terakhir itulah alasan kedua model tersebut lebih berguna sebagai pasangan daripada sebagai lawan. Di antara keduanya, mereka menunjukkan bahwa kedua bagian dari masalah ini telah terpecahkan — kemampuannya berfungsi, dan bobotnya dapat dirilis — sekaligus menunjukkan bahwa belum ada yang menggabungkan keduanya menjadi sesuatu yang benar-benar dapat dipanggil oleh pengembang.
Ada solusi sementara yang akan digunakan banyak tim, dan ada baiknya memperjelas apa yang dicakup dan tidak dicakupnya. Jika Anda tidak bisa mendapatkan lapisan suara, Anda tetap bisa membangun bagian yang berpikir. Realtime-Venus mendelegasikan pekerjaan mahalnya — retrieval, penalaran sulit, panggilan API bisnis — ke harness latar belakang melalui penanda delegasi asinkron, dan bagian yang didelegasikan itu adalah inferensi teks biasa. OrcaRouter tidak membawa Realtime-Venus maupun SeedRealtime; kedua lapisan dupleks berada di luar apa yang kami layani, dan kami tidak menghosting keduanya. Hampir 200 model teks di balik satu kunci dengan harga daftar penyedia tanpa markup adalah separuh arsitektur yang memang kami cakup, dengan failover otomatis sehingga tugas latar belakang tidak gagal karena satu upstream mengalami hari yang buruk, DSL perutean untuk menggabungkan beberapa model menjadi satu panggilan, dan fusi model ketika penilaian satu model saja tidak cukup. Ini bukan bagian yang sulit dari sistem-sistem ini. Ini adalah bagian yang benar-benar dapat dibeli.

Apa yang akan mengubah perbandingan ini?
Tiga perkembangan akan menyelesaikannya, dan belum satu pun dari ketiganya terjadi. Tolok ukur independen untuk Realtime-Venus, karena tabel tanpa pembaca kedua hanyalah klaim, bukan hasil. API untuk SeedRealtime, karena model dengan bukti penerapan terkuat saat ini justru model yang tidak bisa digunakan siapa pun. Dan angka latensi yang dipublikasikan dari salah satu di antaranya — time-to-first-audio adalah metrik yang menjadi dasar pembelian kategori ini, dan sampai tulisan ini dibuat, tidak ada satu pun dari kedua model itu yang menyebutkannya.
Sampai saat itu, ringkasan jujurnya adalah bahwa SeedRealtime adalah bukti bahwa dupleks penuh audio-visual berfungsi pada skala konsumen dan Realtime-Venus adalah bukti bahwa bobotnya dapat dibuka, dan tak satu pun dari fakta itu membuat seorang pembangun produk lebih dekat untuk merilis produk. Itu bukan kritik terhadap lab mana pun. Itu adalah deskripsi tentang sebuah kategori yang telah memecahkan masalah riset dan belum memecahkan masalah distribusinya.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
