Kartu judul bertuliskan 'Utopai X Debut di #2 dalam Teks-ke-Video', dengan subjudul 'Pasca-pelatihan MiniMax H3 oleh sebuah studio film - Elo 1.150, hanya kalah dari Wan 3.0', dengan label pil bertuliskan 'Elo 1.150', '5.455 suara', dan 'Tanpa API'.
Guides & Insights

Utopai X Debut di Peringkat #2 dalam Text-to-Video: Di Balik Post-Train MiniMax H3 oleh Sebuah Studio Film

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Utopai X adalah model video yang belum ada minggu lalu, tidak dilatih dari awal oleh laboratorium perintis, dan tidak dijual melalui API — dan saat ini menempati peringkat kedua dunia untuk text-to-video. Model ini berasal dari Utopai Studios, studio film dan televisi yang berbasis AI di Mountain View, dan merupakan post-train dari MiniMax H3, model video omni-modal milik MiniMax. Di papan peringkat text-to-video dengan audio dari Artificial Analysis (papan yang kini dilabeli Artificial Analysis sebagai AA-Video-T2V v2.0, hasil 29 September 2026), Utopai X berada di Elo 1,150 — hanya di belakang Aliba​sba Wan 3.0 pada 1,157, dan di depan ByteDance Dreamina Seedance 2.5 pada 1,143 serta MiniMax H3 (768p) model dasar yang menjadi asal penyetelannya pada 1,138. Model ini hadir pada 2026-09-30, hari yang sama ketika papan peringkat diperbarui, dan tersedia tepat di satu tempat: di dalam PAI, platform produksi milik Utopai sendiri. Tidak ada API publik, dan kolom harga Artificial Analysis untuk baris tersebut berbunyi "Tidak ada API yang tersedia."

Kombinasi itu — peringkat kedua di dunia, satu kanal distribusi, tidak ada daftar tarif per detik dalam pengertian biasa — adalah keseluruhan ceritanya. Studio yang membuat film mengambil model dasar milik orang lain, menyetelnya berdasarkan pertimbangan produksinya sendiri, dan menyerobot antrean. Apakah itu hasil yang bertahan lama atau potret sesaat dari arena yang benar-benar baru adalah pertanyaan yang layak diajukan, dan jawabannya bergantung pada membaca papan peringkat, bukan siaran pers.

Apa yang sebenarnya ditunjukkan papan tersebut

Artificial Analysis memeringkat model video menggunakan Elo yang berasal dari pemungutan suara preferensi manusia secara buta dan berpasangan. Pemilih melihat dua klip yang dihasilkan dari prompt yang sama dan memilih klip yang mereka sukai, tanpa mengetahui model mana yang menghasilkan salah satunya. Papan peringkat berubah seiring bertambahnya suara, dan setiap baris membawa interval kepercayaan yang menunjukkan seberapa besar posisinya boleh bergerak. Diambil pada 2026-10-01, papan text-to-video dengan audio berbunyi:

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1.157 (±10), 6.391 sampel, dirilis Agu 2026, $12,00/menit.

• #2 Utopai X (berdasarkan MiniMax H3) — Elo 1.150 (±11), 5.455 sampel, dirilis Sep 2026, tidak ada API yang tersedia.

• #3 Dreamina Seedance 2.5 — Elo 1.143 (±10), 6.375 sampel, dirilis Jul 2026, $34,12/menit.

• #4 MiniMax H3 (768p) — Elo 1.138 (±10), 6.343 sampel, dirilis Jul 2026, $4,80/menit.

• #5 FLUX 3 — Elo 1.129 (±10), 5.628 sampel, dirilis Jul 2026, $17,40/menit.

Dua detail lebih penting daripada urutannya. Pertama, selisih antara peringkat pertama dan kedua adalah tujuh poin Elo, dan kedua interval tersebut secara eksplisit tumpang tindih — Artificial Analysis mencantumkan rentang Utopai X sebagai 1.139 hingga 1.161, yang mencakup estimasi titik Wan 3.0 sebesar 1.157. Papan peringkat melabeli peringkat Utopai X sebagai rentang, #1–3, bukan posisi tetap. Kedua, selisih antara Utopai X dan model yang menjadi asal pasca-pelatihannya adalah dua belas poin dengan masalah tumpang tindih yang sama, sehingga "hasil pasca-pelatihan mengalahkan induknya" benar secara arah dan lemah secara statistik. Uraian Utopai sendiri lebih hati-hati daripada sebagian besar postingan peluncuran tentang hal ini: uraian itu menyatakan hasil Elo "memberikan penilaian independen tentang bagaimana orang menanggapi rekaman yang dihasilkannya," yang merupakan pembacaan yang wajar atas apa yang diukur oleh arena preferensi manusia dan bukan klaim tentang pembuatan film.

Lapisan yang dilaporkan vendor, sebaliknya, menunjukkan keyakinan. Utopai menggambarkan keunggulan dalam refleksi dan kaustik — pola terkonsentrasi yang terbentuk saat cahaya dipantulkan atau dibiaskan — dan dalam konsistensi spasial di dalam sebuah klip, yang keduanya merupakan target pengembangan, bukan hasil benchmark. Itu perkataan vendor, bukan pengukuran Artificial Analysis.

Sebuah studio alih-alih laboratorium

Utopai Studios mengembangkan, membiayai, dan memproduksi proyek film dan televisinya sendiri, serta membangun modelnya di dalam bisnis itu, bukan di sampingnya. Mekanisme yang dinyatakan adalah umpan balik: produksi menghasilkan skenario, desain karakter dan lokasi yang disetujui, rencana pengambilan gambar, dan take berturut-turut, dan para sutradara, sinematografer, serta seniman studio mencatat bukan hanya take mana yang dipertahankan, tetapi juga mengapa take lainnya ditolak. Catatan itu menjadi sinyal pelatihan dan evaluasi. Tim riset juga menjalankan sistem Elo internal yang menggabungkan penilaian preferensi manusia dengan pemungutan suara otomatis oleh model visi-bahasa, dengan para seniman berpartisipasi di sisi manusia.

Ini adalah keunggulan yang masuk akal dan tidak dapat diverifikasi dari luar. Pasca-pelatihan dapat menggerakkan model video umum menuju preferensi pengguna film dan periklanan tanpa menggantikan model dasar — sejauh itu konsisten dengan papan peringkat. Berapa banyak dari pergerakan dua belas poin dibandingkan MiniMax H3 yang berasal dari data pelatihan, optimalisasi preferensi, penanganan prompt, pengaturan inferensi, atau perubahan pada waktu penyajian tidak disebutkan dalam materi peluncuran. Utopai tidak menerbitkan pengungkapan data pasca-pelatihan, tidak ada metode optimalisasi, tidak ada anggaran komputasi, dan tidak ada evaluasi keselamatan. Peneliti independen tidak dapat mereproduksi peningkatan tersebut, dan tidak ada laporan teknis untuk diperdebatkan.

Lapisan distribusi adalah tempat tesis studio menjadi konkret. PAI — Production Assistive Intelligence — adalah platform yang diluncurkan Utopai bersama model tersebut, dan platform ini menyimpan konteks proyek: pemecahan naskah menjadi adegan dan shot, pustaka produksi berisi karakter, lokasi, dan objek, riwayat versi, persetujuan bersama untuk tim enterprise, serta timeline yang dapat diekspor ke Premiere Pro atau DaVinci Resolve. Nilai jualnya adalah bahwa menghasilkan klip adalah bagian yang murah dan menjaga shot tetap konsisten dengan bagian lain film adalah bagian yang mahal. Utopai X menghasilkan rekaman di dalam ruang kerja tersebut "saat dipilih oleh pembuat film," dalam frasa perusahaan sendiri — model itu adalah salah satu opsi di antara beberapa model gambar, video, dan audio yang tersedia di PAI, bukan satu-satunya.

Berapa biaya Utopai X, dan bagaimana cara membacanya

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

PAI dijual sebagai langganan dengan kredit, bukan sebagai API per detik. Tingkat yang dipublikasikan adalah $15/bulan untuk 1.000 kredit, $49/bulan untuk 3.500 kredit, $129/bulan untuk 10.000 kredit, dan $379/bulan untuk 35.000 kredit, dengan penagihan tahunan yang memberikan diskon sekitar 8 hingga 10 persen, plus top-up seharga $15 per 1.000 kredit. Utopai X memiliki barisnya sendiri dalam tabel kredit PAI: 93 kredit per detik video pada 1080p. Model video lain di platform ini berada lebih rendah — 50 kredit per detik pada 1080p di tier standar dan 76 di tier pro.

Mengubahnya menjadi angka per menit adalah aritmetika yang bisa dilakukan siapa saja dan hampir tidak ada yang seharusnya mengutipnya sebagai harga. Pada 93 kredit per detik, satu menit keluaran Utopai X membutuhkan 5,580 kredit. Paket $15 tingkat awal membeli 1,000 kredit per bulan, yang kira-kira setara dengan 10.8 detik rekaman jika setiap kredit digunakan untuk model ini. Dengan menskalakan tarif kredit tingkat awal secara linear, biaya tersirat berada di kisaran $80-plus per menit video yang dihasilkan. Angka itu hanya layak disebutkan dengan disertai catatannya: angka ini mengasumsikan konversi kredit-ke-dolar yang sepenuhnya linear, mengabaikan bahwa kredit dikumpulkan di semua model di PAI dan kedaluwarsa atau tidak terpakai, mengabaikan diskon tahunan dan bundel isi ulang, serta tidak menjelaskan apa pun tentang batas resolusi atau durasi, yang belum ditetapkan secara terpisah oleh Utopai untuk Utopai X. Ini adalah perkiraan besaran yang berguna, bukan daftar tarif.

Sebagai perbandingan, di papan Artificial Analysis yang sama, MiniMax H3 (768p) tercatat $4,80 per menit dan Wan 3.0 $12,00, sedangkan Dreamina Seedance 2.5 tercatat $34,12. Itu adalah feed harga otomatis dari API milik vendor sendiri, bukan estimasi yang diturunkan dari langganan, jadi perbandingannya paling banter hanya bersifat indikatif — tetapi arahnya jelas: pada tier entry, generasi di dalam platform studio berbasis kredit tidak bersaing dengan harga API per detik. Yang dibayar pembeli adalah ruang kerja di sekitar model, bukan detik marginal model.

Bagian yang tidak publik

Ada tiga kesenjangan yang layak disebutkan, karena masing-masing menghambat keputusan yang berbeda.

• Tidak ada API, dan tidak ada jalur integrasi. Utopai X saat ini tidak memiliki rute integrasi langsung. Tim produk yang ingin memanggilnya dalam sebuah pipeline tidak bisa melakukannya. Artificial Analysis mencantumkannya sebagai "No API available," dan materi peluncuran tidak menjelaskan adanya akses untuk pengembang.

• Tidak ada spesifikasi terpisah. MiniMax H3 menghasilkan klip berdurasi 4 hingga 15 detik hingga 2K dengan audio stereo native. Utopai belum menerbitkan durasi maksimum atau resolusinya sendiri untuk Utopai X, yang berarti angka 1080p dalam tabel kredit adalah satu-satunya pernyataan resolusi yang tersedia dan panjang klipnya tidak diketahui.

• Tidak ada evaluasi di luar arena. Hasil Elo adalah pengukuran independen atas preferensi manusia terhadap klip pendek. Ini bukan ukuran apakah rekaman dapat memenuhi shot yang dimaksudkan, dapat menyatu ke dalam sebuah editan, atau bertahan melewati revisi. Unggahan Utopai sendiri mengakui hal ini secara langsung — "evaluasi juga terus berlanjut setelah klip dihasilkan" — sebuah kerangka yang luar biasa jujur untuk sebuah peluncuran dan sekaligus peringatan tentang seberapa jauh peringkat itu menjangkau.

Di sisi studio, ada lebih banyak sejarah yang bisa dirujuk. Utopai meluncurkan PAI 2.0 pada 2026-06-02 dan saat itu mengatakan bahwa platform tersebut telah mencapai pendapatan berulang tahunan sebesar $11 juta kurang dari dua bulan setelah debutnya pada April, didorong oleh lisensi komersial yang dijual ke perusahaan produksi. Perusahaan mengatakan pihaknya memiliki tiga film layar lebar dan dua seri yang dijadwalkan untuk 2027 dan menerapkan PAI dan Utopai X pada produksinya sendiri, termasuk The Most Serious Fart, film animasi yang ditulis dan disutradarai oleh Mike Bender. Itu adalah angka dan jadwal studio, dan itulah alasan sebuah post-train tanpa API layak untuk ditulis sama sekali: model ini digunakan untuk membuat film yang ingin dirilis perusahaan, yang merupakan ujian yang lebih sulit daripada papan peringkat.

Ketika model dasar masih menjadi pilihan yang praktis

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

Bagi siapa pun yang benar-benar perlu menghasilkan video minggu ini, bagian yang dapat dirutekan dari keluarga ini adalah model dasarnya. MiniMax H3 tersedia di OrcaRouter pada harga daftar penyedia — $0.08 per detik pada 768p, yaitu $4.80 per menit, angka yang sama seperti yang tercantum di Artificial Analysis — dengan markup 0%, sehingga setiap penurunan harga vendor langsung berlaku di hari yang sama alih-alih setelah siklus penetapan harga ulang, dan failover otomatis antar penyedia sehingga satu gangguan endpoint tidak akan membuat pipeline Anda mati. Layanan ini menerima referensi teks, gambar, video, dan audio sebagai satu konteks terpadu dan mengembalikan klip berdurasi 4 hingga 15 detik pada 768P atau 2K dengan audio stereo native, ditagih per detik output yang dihasilkan.

Utopai X tidak dirutekan, dan tidak ada apa pun dalam artikel ini yang boleh dibaca sebagai klaim bahwa ia dirutekan. Apa yang diberikan model dasar kepada Anda adalah cara untuk menguji karakteristik estetika dan gerak keluarga H3 — fondasi yang sama yang menjadi titik awal Utopai, sebelum pasca-pelatihan apa pun yang diterapkannya — melalui satu kunci API bersama lebih dari 200 model lainnya, tanpa langganan PAI. Jika Utopai X suatu saat mencapai penyedia yang dapat dirutekan, ia akan muncul pada harga daftar pada hari yang sama, dengan tarif vendor diteruskan, bukan dinaikkan. Sampai saat itu, pembagian yang jujur adalah: Utopai X untuk studio di dalam PAI, MiniMax H3 untuk semua orang yang menyusun pipeline.

Apa yang menentukan apakah ini sebuah debut atau sebuah momen

Ada tiga hal yang layak dicermati sepanjang kuartal berikutnya. Pertama, apakah selisih tujuh poin di puncak bertahan setelah beberapa ribu suara lagi — intervalnya saat ini tumpang tindih, dan papan peringkat yang berubah susunan ketika kumpulan perbandingan baru masuk belum menetapkan apa pun. Kedua, apakah Utopai membuka akses pengembang sama sekali; model yang menduduki peringkat kedua dunia yang hanya dapat dipanggil oleh pelanggan PAI adalah keputusan produk, dan itu dapat dibalik. Ketiga, apakah kompetisi bergerak ke arah sebaliknya. Wan 3.0 sudah menghasilkan hingga 30 detik 1080p dengan audio native dan menerima teks, gambar, video, audio, dokumen, dan halaman web sebagai referensi, serta memimpin papan peringkat dalam hal pencahayaan, material, dan kontrol kamera pada rincian kasus penggunaan. Keunggulan dua belas poin pasca-pelatihan dibandingkan model dasar itu memberi petunjuk; mempertahankan posisi kedua melawan model fondasi dengan cakupan input yang lebih luas adalah pekerjaan yang berbeda.

Yang benar-benar baru di sini bukanlah Elo. Melainkan bentuk klaimnya: sebuah studio dengan alur produksi berpendapat bahwa memiliki keputusan di balik rekaman — take mana, referensi mana, revisi mana — lebih bernilai daripada memiliki proses pre-training. Argumen itu dapat diuji, dan box office untuk daftar film 2027 adalah salah satu ujiannya.