Kartu judul hero untuk 'Realtime-Venus', dengan subjudul 'Sebuah makalah, dua checkpoint, dan tanpa pengumuman', dengan tiga kartu bertuliskan 'Realtime-Venus-Omni: 9B, audio-visual, Apache-2.0', 'Realtime-Venus-Audio: 9B, interaksi lisan', dan 'Masih belum ada: API, harga, postingan peluncuran, benchmark independen', di atas strip footer bertuliskan 'Semua angka benchmark berasal dari laporan teknis; tidak ada yang direproduksi secara independen.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Realtime-Venus: Model Full-Duplex 9B Milik Ant Group Dirilis Tanpa Peluncuran

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 12 September 2026, sebuah laporan teknis diunggah ke arXiv yang menjelaskan Realtime-Venus, sistem interaksi dupleks penuh yang dibangun dari dua model 9B yang dilatih secara terpisah — Realtime-Venus-Omni untuk interaksi audio-visual dan Realtime-Venus-Audio untuk interaksi lisan — dikreditkan kepada Tim Venus di Ant Group yang bekerja sama dengan Tsinghua University. Dalam hitungan hari, repositori Apache-2.0 di bawah inclusionAI/Realtime-Venus di Hugging Face memuat kedua checkpoint sebagai safetensors BF16 yang dapat diunduh, bersama halaman proyek dan repositori GitHub pendamping. Yang tidak muncul justru bagian yang layak diperhatikan: tidak ada postingan peluncuran, tidak ada halaman produk, tidak ada API, tidak ada daftar harga, dan tidak ada apa pun di kanal milik Ant Group sendiri yang mengumumkan bahwa semua itu ada. Ini adalah rilis yang mengirimkan semuanya kecuali pengumumannya, yang membuat pemisahan fakta yang sudah mapan dari klaim menjadi inti pekerjaannya.

Apa yang sebenarnya ada di disk

Repositori ini bukan stub. Repositori ini berisi dua direktori model, masing-masing dengan bobot safetensors yang di-shard, sebuah konfigurasi, dan kode Hugging Face Transformers kustom yang diinstruksikan kartu untuk Anda muat dengan trust_remote_code=True. Ada file requirements, folder assets yang menyimpan sumber daya token-ke-waveform dan suara referensi, serta lisensi Apache-2.0 di tingkat atas. Kartu tersebut mendokumentasikan instalasi untuk Python 3.10 dengan CUDA dan FFmpeg, serta jalur unduhan ModelScope mirror dan Hugging Face. Bobotnya nyata, kodenya ada, dan tidak ada yang menghalangi Anda mengunduhnya hari ini.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Dua ketiadaan sama informatifnya dengan isinya. Yang pertama adalah bahwa repositori tersebut menyatakan secara terang-terangan bahwa model ini tidak di-deploy oleh penyedia inferensi mana pun — tidak ada endpoint yang di-hosting, tidak ada opsi serverless, tidak ada platform pihak ketiga yang menghostingnya. Yang kedua adalah bahwa unduhan sama sekali tidak dilacak, yang berarti tidak ada sinyal publik tentang berapa banyak orang yang telah mengunduhnya. Sebuah model bisa tampak diadopsi atau diabaikan di Hugging Face; yang ini tidak bisa dibaca seperti itu.

Dua pos pemeriksaan, dan apa yang memisahkan keduanya

Keduanya 9B, keduanya berbagi tulang punggung streaming, dan perbedaannya terletak pada apa yang dapat mereka persepsikan.

• Realtime-Venus-Omni — checkpoint audio-visual. Encoder visual SigLIP2 untuk frame streaming, encoder audio Whisper-Medium, dan tulang punggung bahasa Qwen3-8B. Menerima video atau gambar, audio, dan teks; mengembalikan teks dan, secara opsional, bentuk gelombang ucapan.

• Realtime-Venus-Audio — tulang punggung yang sama dengan kemampuan visi dimatikan saat waktu pemuatan. Masukan berupa audio dan teks, keluaran berupa teks dan ucapan. Ini hadir untuk kasus ketika kamera tidak relevan dan Anda menginginkan jejak memori yang lebih kecil serta jalur yang lebih sederhana.

• Spesifikasi bersama — konteks 40.960 token pada keduanya, bobot BF16 pada keduanya, ucapan dihasilkan sebagai token S3 diskret yang didekodekan oleh dekoder flow-matching streaming, bukan model teks-ke-ucapan terpisah yang dipasang di bagian akhir.

• Asal-usul — kartu model menyatakan bahwa checkpoint Omni diadaptasi dari MiniCPM-o 4.5, model omni-modal 9B yang dirilis open source oleh OpenBMB pada awal 2026. Itu bukan catatan kaki. Artinya, kontribusi Ant Group adalah post-training, runtime, dan desain delegasi yang dilapiskan ke backbone streaming milik orang lain, yang merupakan klaim berbeda dan lebih spesifik daripada "model omni 9B baru."

Satu-satunya gagasan yang benar-benar baru: delegasi sebagai peristiwa stream kelas satu

Setiap sistem full-duplex pada tahun 2026 harus menyelesaikan kontradiksi yang sama. Kontrol percakapan berjalan pada granularitas milidetik hingga satu detik. Pemanggilan alat, pengambilan, dan penalaran berat memerlukan waktu dari detik hingga puluhan detik. Model yang berjeda untuk berpikir tidak lagi menjadi full-duplex; model yang tidak pernah berjeda tidak dapat menggunakan alat.

Realtime-Venus menjawab dengan runtime dua loop. Loop interaksi berjalan dalam potongan tetap satu detik, terus-menerus menyerap fitur audio dan video, memperbarui status percakapan, dan memutuskan apakah akan mendengarkan atau berbicara, sambil melakukan streaming teks dan ucapan yang selaras. Loop ini tidak berhenti saat pekerjaan latar sedang berlangsung. Loop kedua adalah penjadwal yang oleh makalah disebut Realtime-Venus-Harness: ketika frontend memutuskan suatu tugas melebihi apa yang dapat dilakukannya secara inline, ia mengeluarkan delegasi asinkron melalui penanda privat yang disematkan dalam urutan tersembunyinya sendiri, dan harness menjalankan tugas tersebut di latar belakang serta mengintegrasikan kembali hasilnya ke dalam dialog yang sedang berlangsung.

Detail yang membuat ini lebih dari sekadar diagram adalah apa yang disebut makalah itu sebagai perekaman tugas kausal — tugas yang didelegasikan dieksekusi terhadap snapshot terisolasi dari keadaan percakapan, sehingga tugas latar belakang yang berjalan lama tidak dapat dirusak oleh percakapan yang terus berlanjut saat tugas itu berjalan. Itulah mode kegagalan yang membuat sebagian besar desain "delegasikan dan terus berbicara" tumbang dalam praktik, dan itulah hal yang paling menarik dalam laporan tersebut.

Harness tidak ada di dalam bobot. Ia berada di repositori GitHub sebagai komponen terpisah, yang berarti bagian yang membuat arsitektur ini khas adalah bagian yang harus Anda rakit dan percayai sendiri.

Angka-angkanya, dan tepatnya milik siapa angka-angka itu.

Setiap angka di bawah ini berasal dari laporan teknis dan kartu model. Tidak ada satu pun yang telah direproduksi oleh siapa pun di luar para penulis, tidak ada pihak ketiga yang menerbitkan evaluasi, dan tidak ada entri papan peringkat untuk membandingkannya. Bacalah semua itu sebagai pengukuran dari para penulis sendiri.

• Benchmark video, Realtime-Venus-Omni — skor terbaik pada enam dari delapan benchmark yang digunakan laporan, termasuk StreamingBench 70.2, OVO-Bench 64.7, dan Daily-Omni 81.3.

• Benchmark audio, Realtime-Venus-Audio — MMAU 78,0, MMAU-Pro 63,2, Llama Questions 83,8, Speech CMMLU 67,8, dan skor AlpacaEval VoiceBench sebesar 4,81 yang menurut laporan tersebut menyamai angka pembanding terbaik.

• Full-Duplex-Bench v1.5 — respons terhadap 75% interupsi pengguna, dengan tingkat kelanjutan 97% pada backchannel, 88% pada ujaran yang ditujukan kepada orang lain, dan 86% pada ujaran latar belakang. Laporan tersebut menyatakan bahwa ini melampaui Gemini 3.1 Live dan GPT-4o pada ketiga metrik kelanjutan.

Angka Daily-Omni adalah yang patut direnungkan. MiniCPM-o 4.5, model asal yang diadaptasi menjadi checkpoint ini, melaporkan 80,2 pada benchmark yang sama. Realtime-Venus-Omni melaporkan 81,3. Jika kedua angka itu bertahan, peningkatan dari upaya besar dalam pascapelatihan dan runtime adalah sekitar satu poin pada benchmark yang sudah menjadi kekuatan model dasar — hasil yang realistis untuk pekerjaan semacam ini dan cerita yang jauh lebih tidak dramatis daripada judul "terbaik pada enam dari delapan".

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

Apa yang belum ditetapkan

Daftar pertanyaan terbuka lebih panjang daripada daftar pertanyaan yang sudah tuntas, dan itulah keadaan jujur sebuah model yang baru berusia enam hari.

• Tidak ada evaluasi independen. Bukan penempatan arena, bukan reproduksi pihak ketiga, bukan satu pun kelompok luar yang telah menerbitkan sebuah angka.

• Tidak ada angka latensi dalam milidetik. Laporan tersebut menjelaskan irama interaksi satu detik dan kartu itu mendokumentasikan panggilan streaming per detik, tetapi tidak ada angka waktu-ke-audio-pertama yang dipublikasikan, yang merupakan metrik yang sebenarnya menjadi dasar pembelian kategori ini.

• Tidak ada API dan tidak ada harga, dan tidak ada pernyataan bahwa salah satunya akan segera hadir. Apakah ini produk yang tengah dinanti atau artefak riset yang akan tetap berupa unduhan, sungguh tidak diketahui.

• Tidak ada pernyataan niat dari vendor. Tidak adanya pengumuman bukanlah bukti adanya strategi peluncuran senyap; itu juga konsisten dengan repositori yang diterbitkan untuk sebuah makalah dan tidak lebih.

• Tidak ada bukti produksi untuk harness. Komponen ini adalah penopang utama arsitektur dan yang paling minim didokumentasikan.

Mengapa jalur sunyi terus terjadi

Ini adalah kali kedua tahun ini karya model Ant Group sampai ke publik melalui repositori, bukan peluncuran. UI-Venus-2-9B, agen GUI milik lab tersebut, muncul di Hugging Face pada akhir Agustus 2026 tanpa makalah, tanpa halaman proyek, dan tanpa pengumuman — dan sejak itu disusul oleh sebuah laporan. Realtime-Venus hadir dalam urutan yang berlawanan: laporan lebih dulu, repositori menyertainya, pengumuman masih ditahan.

Pola ini tidak unik bagi Ant Group. Lab-lab Tiongkok khususnya telah merilis artefak riset dan penerapan konsumen ke dunia sambil menunda pengumuman yang ditujukan untuk pengembang, atau melewatinya sama sekali. Bagi siapa pun yang mengikuti bidang ini, hal itu merepotkan, karena sinyal yang biasa — postingan peluncuran, kartu tarif, situs dokumentasi — justru bagian yang hilang. Artefaknya kini menjadi pengumumannya, dan membacanya dengan cermat adalah satu-satunya cara untuk mengetahui apa yang telah dirilis.

Jika Anda ingin menjalankannya

Kartu ini luar biasa praktis untuk rilis yang sebaru ini. Pemuatan standar: AutoModel.from_pretrained di direktori checkpoint lokal dengan kode remote yang dipercaya, atensi SDPA, dan bfloat16. Streaming full-duplex dimasuki dengan satu panggilan yang mengalihkan model ke mode dupleks, setelah itu loop yang didokumentasikan adalah satu detik dari streaming_prefill diikuti oleh streaming_generate, diulang. Memori video panjang diaktifkan dengan parameter memory-minutes yang diatur ke empat puluh dan digambarkan sebagai training-free, yang patut dicatat untuk kemampuan yang biasanya memerlukan fine-tuning. Dua peringatan didokumentasikan alih-alih ditemukan: batas frame yang diam-diam memotong video panjang kecuali sebuah konstanta dinaikkan sebelum mengimpor utilitas, dan persyaratan font CJK untuk subtitle non-Latin yang dirender ke dalam video dupleks.

Yang tidak diberikan oleh kartu ini adalah batas minimum perangkat keras. Model 9B dalam BF16 memiliki sekitar delapan belas gigabita bobot sebelum memori aktivasi apa pun, yang menempatkan inferensi dupleks waktu nyata pada GPU kelas berat dan di luar jangkauan penerapan laptop yang sebagian menjadi sasaran desain keluarga MiniCPM-o yang menjadi asal model ini.

Ada sebuah sambungan di sini yang layak diberi nama, karena di situlah sebuah router benar-benar pas. Realtime-Venus mendelegasikan kerja beratnya — pengambilan, penalaran kompleks, panggilan API bisnis — ke model latar belakang. Bagian yang didelegasikan itu adalah inferensi teks biasa, dan bagian itulah yang menentukan apakah antarmuka percakapan Anda berguna atau sekadar lancar. OrcaRouter tidak membawa Realtime-Venus sama sekali; lapisan dupleks di sini adalah unduhan yang dihosting sendiri dan kami tidak menyediakannya. Penalaran yang dialihkannya adalah bagian yang kami cakup: hampir 200 model di balik satu kunci dengan harga daftar penyedia tanpa markup, failover otomatis ketika upstream mengalami hari buruk, DSL perutean yang menyusun beberapa model menjadi satu panggilan, dan fusi model untuk kasus-kasus ketika penilaian satu model tidak cukup. Penanda delegasi adalah keputusan frontend; model mana yang menjawabnya adalah pilihan konfigurasi, dan menjaga pilihan itu di luar bobot adalah hal yang memungkinkan Anda mengubahnya tanpa melatih ulang apa pun.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

Apa yang bisa menyelesaikannya

Tiga hal akan membawa Realtime-Venus dari makalah yang menyertakan bobot menjadi model yang dapat dievaluasi siapa pun. Sebuah kelompok independen yang mereproduksi angka kelanjutan Full-Duplex-Bench, karena 97% pada backchannel adalah angka yang luar biasa dan angka luar biasa memerlukan pembaca kedua. Angka latensi yang dipublikasikan, karena sistem full-duplex hidup atau mati pada waktu sampai audio pertama dan yang ini belum menetapkan target. Dan dokumentasi untuk harness, karena desain delegasi asinkron adalah satu-satunya bagian dari rilis ini yang benar-benar baru, dan saat ini itulah bagian yang dapat Anda baca tetapi tidak mudah diadopsi.

Sampai saat itu, deskripsi yang akurat memang sempit dan tidak menggairahkan, dan justru itulah sebabnya layak dicatat: rilis Apache-2.0 sungguhan dari dua checkpoint full-duplex 9B, dibangun di atas backbone terbuka, dengan benchmark kuat yang dilaporkan sendiri, tanpa verifikasi independen, tanpa API, dan tanpa pengumuman. Segala hal di atas garis itu adalah inferensi.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari