Kartu judul hero bertuliskan 'GPT-Live-1 vs Gemini 3.5 Live Translate' dengan subjudul 'Generalis yang sudah dirilis melawan spesialis pratinjau' dan baris 'GA pada $0,05 per menit vs pratinjau sekitar $0,037 per menit', di atas dua panel: panel kiri menampilkan bentuk gelombang audio dupleks penuh dengan panah melengkung ke kedua arah dan lencana 'GA' solid, panel kanan menampilkan bola dunia dengan dua balon percakapan dan lencana 'PREVIEW' bergaris tepi, dengan logo OrcaRouter dikompositkan di sudut.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: Generalis yang Sudah Dirilis Melawan Spesialis Pratinjau

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kedua model ini dibandingkan karena keduanya menempatkan ucapan real-time di dalam API, dan perbandingan itu tidak lagi berlaku begitu Anda membaca kartu modelnya. GPT-Live-1 adalah model suara full-duplex serbaguna yang dipindahkan OpenAI ke API pengembang pada 10 September 2026, tiga bulan setelah dirilis di dalam ChatGPT pada 8 Juli. Gemini 3.5 Live Translate adalah model terjemahan audio-ke-audio khusus yang dirilis Google DeepMind pada 9 Juni 2026, dan ID modelnya masih menyertakan kata preview. Salah satu dari ini dapat Anda hadapkan kepada pelanggan berbayar hari ini dengan tarif yang dipublikasikan. Yang lainnya dapat diubah Google secara sepihak tanpa pemberitahuan penghentian. Asimetri itulah, bukan lembar benchmark, yang seharusnya menentukan pilihan.

Dua mesin berbeda yang memakai label yang sama

Patut untuk bersikap blak-blakan tentang betapa kecilnya tumpang tindih hal-hal ini. Gemini 3.5 Live Translate melakukan penerjemahan. Ia menerima audio streaming dalam satu bahasa dan mengembalikan audio streaming dalam bahasa lain, mempertahankan suara dan nada pembicara, di lebih dari 70 bahasa dan lebih dari 2.000 pasangan bahasa, dengan deteksi bahasa otomatis dan operasi dua arah. Ia tidak melakukan percakapan, memanggil fungsi, atau menjawab pertanyaan. Ia adalah mesin interpretasi simultan.

GPT-Live-1 memiliki bentuk yang berlawanan. Ini adalah model percakapan: ia mendengarkan dan berbicara sekaligus, memutuskan berkali-kali per detik apakah akan terus mendengarkan, berhenti sejenak, menyela, atau memanggil alat, dan menyerahkan pekerjaan berat — penelusuran web, penalaran yang lebih mendalam, tugas agentik — kepada model penalaran terpisah melalui Responses API sementara percakapan berlanjut. Contoh WebRTC yang diterbitkan OpenAI sendiri menghubungkan delegasi itu ke GPT-5.6 Terra. Penerjemahan adalah salah satu hal yang dapat dilakukannya; itu bukan fitur yang memiliki padanan apa pun pada model Google dalam arah sebaliknya.

Jadi pertanyaan praktisnya lebih sempit daripada yang disiratkan oleh adu utama: jika yang Anda bangun adalah interpretasi, model Goo​gle dibuat khusus dan milik Ope​nAI bersifat serbaguna. Jika yang Anda bangun adalah agen suara yang sesekali menerjemahkan, GPT-Live-1 adalah satu-satunya di antara keduanya yang bahkan berada dalam kategori produk yang tepat.

Berapa biaya masing-masing per menit audio

Di sinilah spesialis itu membuktikan nilainya, dan hitungannya sungguh merepotkan bagi OpenAI.

• GPT-Live-1 — $0.05 per menit suara, ditagih per detik, bukan dibulatkan ke atas ke menit penuh berikutnya. Penalaran dan panggilan alat yang dilakukan oleh backend yang didelegasikan ditagih secara terpisah dengan tarif normal model tersebut.

• Gem​ini 3.5 Live Translate — $3,50 per juta token masukan audio dan $21,00 per juta token keluaran audio, dengan penagihan dihitung pada 25 token per detik audio. Jika digabungkan, totalnya sekitar $0,037 per menit audio yang diterjemahkan.

Pada menit terjemahan murni, Goo​gle sekitar seperempat lebih murah. Itu bukan perbedaan pembulatan pada skala besar: 10.000 menit interpretasi per bulan menelan biaya sekitar $500 pada lapisan suara GPT-Live-1, dibandingkan dengan sekitar $368 pada Gem​ini 3.5 Live Translate. Dan selisih itu nyata, bukan artefak dari perubahan pengukuran, karena kedua model menagih berdasarkan unit yang benar-benar berbeda.

Ada jebakan di arah sebaliknya. Angka $0.05 untuk GPT-Live-1 hanyalah harga lapisan suara saja. Jika agen Anda menerjemahkan sekaligus mencari sesuatu, atau mengeskalasi kalimat yang sulit ke model penalaran, Anda membayar delegasi itu sebagai tambahan — dan model yang didelegasikan dihargai per token seperti model terdepan lainnya. Beban kerja khusus terjemahan tidak pernah memicu hal itu. Beban kerja terjemahan plus apa pun memicunya, dan pemenang dalam perbandingan per menit tidak lagi jelas.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

Label pratinjau adalah risiko yang tidak diperhitungkan oleh siapa pun

ID model Gemini 3.5 Live Translate adalah gemini-3.5-live-translate-preview. Fitur ini dirilis ke Gemini Live API dan Google AI Studio sebagai pratinjau publik, dan secara bersamaan masuk ke aplikasi Google Translate di Android dan iOS serta pratinjau privat di Google Meet untuk pelanggan Workspace tertentu. Pratinjau berarti seperti yang selalu dimaksudkan di Google: tidak ada jaminan stabilitas, tidak ada jendela penghentian yang dipublikasikan, tidak ada komitmen bahwa tarif yang Anda bayarkan akan bertahan sampai rilis berikutnya.

Untuk aplikasi konsumen, itu tidak masalah. Untuk beban kerja yang sebenarnya menjadi sasaran model ini — interpretasi langsung di pusat panggilan, produk rapat, produk perjalanan — ini adalah risiko integrasi terbesar di stack. Anda sedang membangun ketergantungan produksi pada model yang secara eksplisit belum dijanjikan oleh Goo​gle.

GPT-Live-1 memiliki masalah terbalik, dan lebih kecil tetapi tidak nol. Layanan ini tersedia secara umum, dengan tarif yang dipublikasikan, endpoint yang didokumentasikan, dan tidak akan dihentikan. Namun cakupan API-nya sempit dengan cara yang mengejutkan tim yang menganggapnya bisa langsung masuk ke integrasi OpenAI yang sudah ada: hanya ada satu ID model, satu endpoint, dan tidak ada jalur melalui Chat Completions, Responses, Realtime, Batch, Assistants, atau fine-tuning. Satu-satunya cara masuk adalah endpoint Live Sessions di v1/live/sessions melalui WebRTC, dengan penanganan peristiwa pada kanal data. Itu adalah integrasi baru, bukan perubahan parameter.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Bahasa, dan di mana generalis itu benar-benar lebih lemah

Jumlah bahasa Goo​gle adalah 70 lebih, dengan mempertahankan suara dan nada. Dokumentasi Ope​nAI sendiri jauh kurang percaya diri tentang cakupannya sendiri: materi peluncuran mencatat bahwa untuk bahasa tertentu model mungkin membawa aksen non-native atau menunjukkan celah dalam kelancaran, dan tidak menerbitkan jumlah bahasa yang menyaingi Goo​gle.

Itu bukan vendor yang berkelit — itulah wujud model percakapan generalis jika disandingkan dengan spesialis yang dilatih untuk masalah tersebut. Jika proposisi nilai produk Anda adalah "kami menafsirkan 40 bahasa dengan baik," spesialis adalah pilihan yang jujur dan generalis akan mempermalukan Anda di ekor panjang. Jika produk Anda adalah agen suara untuk pasar berbahasa Inggris dengan fitur terjemahan yang ditempelkan begitu saja, celah bahasa si generalis tidak akan pernah muncul.

Kedua model membubuhkan watermark dengan SynthID pada audio yang dihasilkan, dan ini penting jika Anda berada di yurisdiksi atau terikat kontrak pelanggan yang mensyaratkan keterlacakan asal atas ucapan sintetis. Yang itu imbang.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Di mana arsitektur delegasi mengubah build

Perbedaan struktural antara keduanya adalah bahwa GPT-Live-1 sebenarnya terdiri dari dua model dengan sambungan di tengahnya. Lapisan suara menjaga percakapan tetap hidup; model penalaran terpisah yang melakukan proses berpikir. Sambungan itulah tempat upaya rekayasa Anda diarahkan, dan di situlah model biaya menjadi rumit.

Perlu diketahui bahwa bagian yang didelegasikan adalah model teks biasa yang dapat Anda rutekan seperti model lainnya. GPT-5.6 Terra, backend dalam contoh milik OpenAI sendiri, dilayani melalui OrcaRouter dengan $2,00 per juta token input dan $12,00 per juta output, dengan jendela konteks 1 juta token serta tersedianya /v1/chat/completions dan /v1/responses. Jika Anda ingin menukar otak penalaran di balik agen suara — untuk model yang lebih murah pada panggilan sederhana, atau model yang lebih kuat saat eskalasi — separuh tumpukan itu punya opsi, karena ini adalah panggilan API normal yang berada bersama sekitar 190 model lain dalam satu kunci.

Bagian suara tidak demikian. GPT-Live-1 tidak ada di OrcaRouter, dan Gem​ini 3.5 Live Translate juga tidak; keduanya hanya tersedia dari vendor yang membuatnya. Yang membuat router layak menempati posisinya dalam arsitektur seperti ini adalah semua hal di hilir audio: model teks yang melakukan pengambilan, peringkasan, penulisan balik ke CRM, dan eskalasi, yang merupakan separuh tagihan yang benar-benar dapat Anda konsolidasikan ke dalam satu kunci dan satu invoice.

Apa yang sebenarnya harus dipilih

• Pilih Gemini 3.5 Live Translate jika terjemahan adalah produknya, harga per menit lebih penting daripada stabilitas kontrak, dan Anda dapat menoleransi model pratinjau yang berubah sewaktu-waktu. Anggarkan sekitar $0,037 per menit dan pertahankan lapisan abstraksi di atas panggilan agar model GA dapat menggantikannya tanpa penulisan ulang.

• Pilih GPT-Live-1 jika Anda memerlukan agen percakapan yang kebetulan menerjemahkan, jika Anda memerlukan pemanggilan fungsi dan penggunaan alat di dalam loop suara, atau jika tim pengadaan akan bertanya apa yang terjadi saat model dipensiunkan dan Anda memerlukan jawaban yang lebih baik daripada "tidak ada apa-apa, mungkin."

• Jangan memilih salah satu hanya karena ia memenangkan tolok ukur. Tolok ukur di kedua sisi tidak dapat dibandingkan — angka dupleks penuh Ope​nAI adalah miliknya sendiri, tidak direproduksi oleh pihak ketiga mana pun, dan klaim bahasa Goo​gle belum diuji terhadap model generalis pada set audio yang sama.

Satu catatan yang berorientasi ke depan: kedua permukaan itu justru menyatu, bukan bertabrakan. Model terjemahan Goo​gle sudah berada di dalam Gem​ini Live, dan lapisan suara GPT-Live-1 secara eksplisit dirancang agar model-model frontier baru dapat ditempatkan di belakangnya. Ekspektasi yang wajar adalah bahwa dalam beberapa siklus rilis, terjemahan generalis tersebut membaik dan cerita integrasi spesialis menjadi tidak terlalu berisiko. Jika Anda membangun hari ini dan keputusannya tipis, itu menjadi argumen untuk opsi yang lebih murah dan lebih mudah diganti, serta untuk menjaga jalur audio tetap terisolasi di balik antarmuka, apa pun pilihannya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari