Kartu hero yang dihasilkan untuk artikel 'Muse Realtime Avatar vs GPT-Live-1', menampilkan dua kartu membulat di kedua sisi judul. Kartu kiri bertuliskan 'Muse Realtime Avatar' di atas ikon avatar potret dan baris 'video + suara, satu stream' serta 'tanpa API, tanpa harga, tanpa tanggal'; kartu kanan bertuliskan 'GPT-Live-1' di atas ikon balon percakapan dan baris '$0,05 per menit, ditagih per detik' serta 'sesi bersamaan, WebRTC'. Subjudulnya berbunyi 'Yang satu menjual menit. Yang lain menjual kehadiran.' Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1: Kehadiran Melawan Percakapan

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Satuan penagihan memberi tahu Anda apa yang menurut masing-masing perusahaan sedang dijualnya. GPT-Live-1, model suara dupleks penuh milik OpenAI, menagih tarif tetap $0,05 per menit suara yang dihitung per detik, dan batas lajunya dinyatakan dalam sesi bersamaan — 25 pada Tier 1, naik menjadi 500 pada Tier 5. Itu satuan sebuah saluran telepon. Muse Realtime Avatar, yang diumumkan oleh Meta pada 23 September 2026, tidak memiliki satuan penagihan, karena tidak ada yang bisa ditagih: tidak ada API, tidak ada endpoint, tidak ada harga, tidak ada tanggal. Sebagai gantinya, satuan yang dipublikasikannya adalah angka perangkat keras — 12 sesi real-time bersamaan pada satu NVIDIA GB200. Satu perusahaan menjual percakapan per menit. Perusahaan lainnya menunjukkan kepada Anda berapa biaya untuk merender sebuah wajah, dan belum memutuskan untuk menjualnya.

Kedua model ini terbilang baru dan tidak satu pun merupakan peluncuran dalam pengertian yang biasanya dibawa kata itu. GPT-Live-1 dirilis di dalam ChatGPT pada 8 Juli 2026 dan baru mencapai API pengembang pada 10 September — dua bulan selama mana ia menjadi suara default sebuah produk konsumen dan tidak tersedia bagi siapa pun yang sedang membangun. Muse Realtime Avatar diumumkan pada 23 September 2026 di Meta Connect, didemonstrasikan dalam postingan riset Meta sendiri, dan tetap merupakan kemampuan dari agen Muse, bukan sebuah produk. Membandingkan keduanya berarti membandingkan dua tahap berbeda dari ide yang sama: apa yang terjadi ketika model percakapan cukup baik sehingga pertanyaan berikutnya adalah apa yang sedang dilihat pengguna saat model itu berbicara.

Apa yang dibangun OpenAI: percakapan yang tidak pernah terhenti

GPT-Live-1 bersifat full-duplex dalam arti yang penting secara operasional — ia tidak menunggu Anda selesai sebelum mulai bekerja. Ia menjangkau API pengembang melalui tepat satu endpoint, yaitu endpoint Live Sessions, di bawah tepat satu ID model, gpt-live-1, tanpa snapshot bertanggal untuk dipin dan tanpa endpoint saudara yang diaktifkan. Tidak ada Chat Completions, tidak ada Responses, tidak ada Realtime, tidak ada fine-tuning, tidak ada endpoint transkripsi audio atau ucapan. Input gambar dan video secara eksplisit tidak didukung.

Keputusan desain yang membentuk segala hal di hilir adalah delegasi. GPT-Live-1 tidak melakukan penalaran beratnya sendiri. Dokumentasi OpenAI memasangkan lapisan suara dengan backend penalaran terpisah, dan dalam contoh WebRTC yang dipublikasikan, backend tersebut adalah GPT-5.6 Terra. Jadi sesi GPT-Live-1 adalah dua meteran yang berjalan sekaligus: $0,05 per menit untuk suara, ditambah tarif token normal model backend untuk setiap panggilan alat, pencarian, dan langkah penalaran yang dilimpahkannya. Pada Speech to Speech Index, kepribadian ganda itu muncul sebagai model yang sama mencetak skor dua kali — 81,5 dengan GPT-6 Astra yang melakukan pemikiran pada upaya sedang, 80,1 dengan GPT-5.6 Sol pada upaya rendah. Selisih 1,4 poin antara kedua konfigurasi tersebut lebih lebar daripada margin 0,2 poin yang menempatkan konfigurasi terbaik GPT-Live-1 di posisi pertama.

Itulah bentuk jujur dari model ini. Front end suara bersifat tetap; kecerdasannya adalah parameter yang Anda tetapkan, dan itu menggerakkan skor lebih besar daripada model pesaing mana pun.

Apa yang Meta bangun: wajah yang bergerak mengikuti suara

Muse Realtime Avatar menyerang masalah yang tidak dimiliki GPT-Live-1 — menjaga video hasil generasi tetap selaras dengan ucapan hasil generasi. Jawaban Meta adalah menjadikannya aliran yang sama: Muse Realtime Voice memancarkan token ucapan yang membawa konten sekaligus prosodi, dan avatar tersebut adalah Diffusion Transformer yang digerakkan audio yang mengonsumsi token yang sama, dikondisikan pada gambar referensi dan jendela bergulir dari laten video terkini. Tidak ada yang disinkronkan bibir setelahnya, karena tidak ada "setelahnya" — suara, mulut, dan ekspresi keluar dari satu proses.

Angka-angka yang dipublikasikan adalah milik Meta sendiri, diukur terhadap baseline yang dipilih Meta, dan tidak satu pun telah direproduksi di luar perusahaan. 870 ms dari akhir giliran Anda hingga byte pertama balasan suara-dan-video yang tersinkronisasi. Video potret 448×768 pada 25 frame per detik, diberi watermark dengan lapisan transparan agar penonton dapat mengetahui bahwa itu bukan kamera. Dua belas sesi bersamaan pada satu GB200, peningkatan kapasitas 8× dibandingkan baseline BF16 dua langkah milik Meta sendiri, dari pelatihan sadar kuantisasi empat bit, cache KV persisten, dan batching dinamis yang sadar latensi. Dan hasil preferensi yang dilaporkan Meta naik dari 45% menjadi 55% dibandingkan baseline tersebut, dengan dua kemenangan yang diungkap terhadap sistem avatar komersial — plus pengungkapan bahwa pada gerak-gerik khas, hasil terhadap salah satunya tidak dapat dibedakan secara statistik dari paritas.

Tidak ada dalam daftar itu yang merupakan tarif, endpoint, atau tanggal.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

Tagihan dua meter, dan di mana perutean layak mendapat tempatnya.

Struktur biaya GPT-Live-1 bukanlah satu angka, dan memperlakukannya sebagai satu angka adalah cara model suara yang terdengar murah menghasilkan tagihan bulanan yang mahal. Suara dikenai $0,05 per menit, ditagih per detik tanpa pembulatan ke atas, dan 15 detik pertama dalam satu sesi ditagih di muka tetapi dikreditkan terhadap durasi berikutnya, bukan ditumpuk di atasnya. Semua yang didelegasikan sesi — penalaran, panggilan alat, pencarian apa pun — ditagih secara terpisah sesuai tarif model backend itu sendiri. Arahkan delegasi ke model penalaran terdepan dan biarkan ia mencari di setiap giliran, maka Anda telah membuat saluran terbuka senilai $3 per jam dengan model premium di belakangnya.

Meter kedua itu adalah separuh yang dapat dirutekan. Di OrcaRouter, backend dari sesi GPT-Live-1 hanyalah panggilan model lain: 196 model dari 15 penyedia di balik satu kunci, dengan harga daftar penyedia yang diteruskan tanpa markup, dengan failover otomatis saat model yang Anda pilih mengalami error atau timeout. Anda tidak dapat merutekan lapisan suara — Live Sessions adalah endpoint milik Open​AI saja — tetapi semua yang didelegasikan lapisan suara berada pada satu kunci, yang berarti bagian tagihan yang skalanya bergantung pada seberapa keras penelepon Anda berpikir juga merupakan bagian yang dapat Anda ubah tanpa kontrak.

Sebaliknya, Muse Realtime Avatar tidak memiliki meter yang perlu dirutekan. Itu adalah fitur dari sebuah aplikasi.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Dua taruhan tentang untuk apa agen suara itu

Jika spesifikasinya dikesampingkan, kedua perusahaan itu tidak sepakat tentang produknya. Open​AI bertaruh bahwa percakapan adalah produknya — bahwa agen suara adalah saluran telepon, dan pekerjaannya adalah membuatnya terasa seperti itu: tidak pernah tersendat, menyerahkan penalaran berat ke model di belakangnya, menagih per menit, menskalakan berdasarkan panggilan bersamaan. Setiap pilihan pada permukaan API GPT-Live-1 merupakan konsekuensi dari itu. Batas laju berbasis konkurensi, transportasi khusus WebRTC, endpoint tunggal yang sengaja dibuat sempit, tanpa video masuk atau keluar.

Taruhan Meta adalah bahwa kehadiran adalah produknya — bahwa pengguna yang dapat melihat agen adalah pengguna yang tetap bertahan dalam percakapan, dan bahwa rekayasa yang menarik bukanlah giliran bicara, melainkan menjaga karakter yang dirender tetap koheren sepanjang durasi panggilan. Pilihan-pilihan itu menghasilkan sistem yang dioptimalkan untuk laju bingkai dan kepadatan sesi pada GPU, tanpa permukaan komersial sama sekali.

Ada kemungkinan nyata keduanya benar dan keduanya digabungkan. Sebuah produk dapat menjalankan percakapannya pada model suara dupleks penuh dan lapisan visualnya pada perender avatar, dan satu-satunya yang menghalangi hal itu saat ini adalah perender avatar tidak memiliki endpoint. Yang tidak masuk akal adalah memperlakukannya sebagai dua versi dari pembelian yang sama.

Siapa yang harus bertindak, dan siapa yang harus menunggu

Jika Anda sedang membangun produk suara sekarang, GPT-Live-1 dapat dipanggil dan Muse Realtime Avatar tidak, dan itu mengakhiri keputusan. Pilihan menarik di dalam GPT-Live-1 adalah backend yang Anda delegasikan, karena di situlah skor dan tagihan benar-benar bergerak — dan itulah satu-satunya bagian dari stack yang dapat Anda rutekan, tukar, dan failover tanpa menyentuh integrasi suara.

Jika yang Anda inginkan adalah avatar, menunggu bukanlah tindakan pasif. Hal-hal yang layak diperhatikan bersifat spesifik: apakah Meta menerbitkan kartu tarif dan endpoint, apakah tanggal yang disebutkan muncul, dan apakah 870 ms tetap bertahan saat dihadapkan pada ponsel dengan koneksi seluler, bukan pada demo Connect. Pos Meta sendiri mencatat bahwa demo-demonya tidak semuanya mencerminkan avatar yang tersedia di aplikasi Muse, dan itulah kalimat yang perlu dipegang.

Sampai salah satu dari itu berubah, perbandingannya cukup dijawab dengan satu baris. GPT-Live-1 adalah saluran telepon dengan otak yang bisa Anda pilih. Muse Realtime Avatar adalah wajah tanpa nomor telepon.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.