Kartu hero yang dihasilkan untuk HiDream-O1-Video-1.0 dengan kicker 'OrcaRouter · model radar — video' di atas headline 'Keenam di papan peringkat, satu input di API', kartu kiri 'Papan peringkat' yang mencantumkan AA image-to-video peringkat 6 dari 80+, Elo 1.175 ±10, 3.231 sampel dan 0,80 per menit, kartu kanan 'API yang terdokumentasi' yang mencantumkan satu gambar referensi, prompt opsional, hanya force_10s, dan video, resolusi serta audio tidak diekspos, dan empat chip bertuliskan Dirilis Agu 2026, Diumumkan 17 Sep 2026, Bobot: tidak ada yang dipublikasikan, dan tidak ada entri di papan T2V atau penyuntingan.
Engineering & Research

HiDream-O1-Video-1.0 Debut di Urutan Keenam di Artificial Analysis — dan API Publiknya Jauh Lebih Kecil daripada Peluncurannya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

HiDream-O1-Video-1.0 berada di peringkat keenam pada papan peringkat Image-to-Video Artificial Analysis, dengan Elo 1.175 dari 3.231 suara pada $5,80 per menit video yang dihasilkan. Itulah posisi yang diumumkan oleh pembuatnya — kecuali rilis peluncuran HiDream.ai, bertanggal 17 September 2026, menyebut nomor empat. Kedua angka itu benar dan keduanya menggambarkan hal yang berbeda: rilis tersebut mengutip peringkat yang dimiliki model itu pada hari ia diumumkan, dan papan peringkatnya telah bergeser sejak saat itu. Jika dibaca pada 10 Oktober 2026 dengan filter audio aktif, HiDream V1 berada di belakang MiniMax H3 Max, MiniMax H3, Vidu Q4 Preview, Omni Flash, dan Dreamina Seedance 2.0 720p, dalam urutan tersebut.

Kisah yang lebih menarik bukanlah peringkatnya. Melainkan bahwa HiDream-O1-Video-1.0 diumumkan sebagai model yang menerima teks, gambar, dan video serta mengembalikan rekaman 1080p berdurasi lima hingga dua puluh detik dengan audio yang tersinkronisasi secara native — dan bahwa apa yang benar-benar dapat Anda panggil hari ini hanya menerima tepat satu gambar referensi dan prompt teks opsional, dan tidak ada yang lain. Kedua pernyataan itu didokumentasikan. Kesenjangan di antara keduanya adalah hal yang layak diketahui sebelum Anda membangun di atas model ini.

Papan itu, dibaca dengan benar.

Artificial Analysis menjalankan papan peringkat videonya dalam beberapa tingkatan, masing-masing dengan skala Elo dan kumpulan suaranya sendiri, sehingga skor tidak berpindah di antara tingkatan tersebut. Pada AA-Video-I2V v1.0 dengan audio yang tetap disertakan, enam teratas dipisahkan oleh dua puluh poin Elo dan interval kepercayaannya selebar antara tujuh hingga sepuluh poin. Enam teratas itu, per 10 Oktober 2026:

• MiniMax H3 Max — 1.195 ±9 dari 5.894 sampel, Agustus 2026, $4,80/menit

• MiniMax H3 — 1.181 ±8 dari 7.284 sampel, Juli 2026, $7,80/menit

• Vidu Q4 Preview — 1,179 ±10 dari 5,543 sampel, Oktober 2026, $5.04/min

• Gemini Omni Flash — 1.178 ±7 dari 12.327 sampel, Mei 2026, $6,00/menit

• Dreamina Seedance 2.0 720p — 1.176 ±7 dari 15.721 sampel, Maret 2026, $9,07/menit

• HiDream-O1-Video-1.0 — 1.175 ±10 dari 3.231 sampel, Agustus 2026, $5,80/menit

Bacalah interval-interval itu sebagai satu kelompok dan ringkasan yang jujur adalah bahwa posisi satu sampai enam, secara statistik, merupakan satu kontes dengan ekor seri yang sangat panjang. Celah yang tidak berada di dalam derau adalah celah antara HiDream V1 dan peserta lainnya: peringkat ketujuh, Wan 3.0 dari Alibaba, berada di 1.164 — sebelas poin dan satu interval penuh di bawah peringkat keenam, dan hampir tiga ratus suara di depannya. Jumlah sampel HiDream sendiri adalah yang terkecil di enam besar itu, yang berarti intervalnya termasuk yang paling lebar dan posisinya paling belum mapan.

A generated scoreboard titled 'HiDream-O1-Video-1.0 — announced versus served', contrasting the vendor's launch claims (inputs: text, image and video; output: 1080p, 5 to 20 seconds; audio: natively synchronised; duration planned from narrative; generation as one joint multimodal process; physics of gravity, collision and inertia) against the HiHarness request surface (one reference image; aspect ratio preserved; no audio parameter; force_10s boolean only; no resolution selector documented; physics not exposed as a control), with a footer stating the launch claims are vendor-reported.

Dua hal yang dinyatakan Artificial Analysis tentang papan itu sendiri patut dibawa ke depan. Papan itu mencatat satu model yang ditambahkan dalam 30 hari terakhir, dan menyebutkan bahwa AA-Video-I2V v2.0 akan datang, selaras dengan taksonomi AA-Video-T2V v2.0 dengan 1080p di seluruhnya. Itu penting bagi model yang klaim peluncurannya adalah tentang 1080p dan tentang pengondisian teks dan video: papan tempat ia debut secara eksplisit bersifat transisional, dan penggantinya mengubah apa yang diukur.

Di mana model tersebut tidak berada

HiDream-O1-Video-1.0 muncul di tepat satu papan video Artificial Analysis. Model ini tidak ada di AA-Video-T2V v2.0, papan text-to-video, maupun di papan penyuntingan video. Saya memeriksa keduanya pada 10 Oktober 2026 — Wan 3.0 memimpin text-to-video dengan 1.156 dan penyuntingan video dengan 1.157, FLUX 3 berada di peringkat keenam pada text-to-video dengan 1.128, dan HiDream tidak muncul di peringkat mana pun dari keduanya.

Ketiadaan itu adalah sinyal, bukan diskualifikasi. Model yang hanya mengonsumsi gambar referensi tidak dapat diikutsertakan dalam voting text-to-video, dan model yang hanya menganimasikan tidak dapat masuk ke dalam perbandingan editing. Konsekuensi praktisnya adalah tidak ada pengukuran independen atas HiDream V1 yang melakukan text-to-video atau video editing, yang tepatnya merupakan dua dari tiga mode input yang diiklankan dalam rilis peluncurannya.

Dua tanggal, dan sembilan puluh hari di antara keduanya

Ada kejanggalan dalam penanggalan yang harus ditangani dengan hati-hati oleh siapa pun yang mengutip angka-angka ini. Artificial Analysis mencatat tanggal rilis HiDream-O1-Video-1.0 sebagai 28 Agustus 2026 dan tanggal diperkenalkannya ke papan sebagai 10 September 2026. Pengumuman peluncuran HiDream sendiri bertanggal 17 September. Referensi model pihak ketiga yang sejak itu muncul menggambarkannya sebagai diterbitkan pada 15 September dan diverifikasi pada 17 September.

Apa yang digambarkan oleh pola itu adalah model yang mencapai alur evaluasi sebelum mencapai siaran pers — cukup normal, dan itu berarti tanggal rilis di papan peringkat adalah yang lebih awal di antara keduanya, bukan kesalahan. Pola itu tidak menggambarkan model Maret yang diumumkan ulang pada Agustus, yang merupakan mode kegagalan yang pernah membuat blog ini celaka sebelumnya. HiDream-O1-Video-1.0 benar-benar baru: infrastruktur papan peringkat itu sendiri mencatat kedatangannya dalam dua bulan terakhir.

Apa yang diklaim peluncuran itu, dan siapa yang mengatakannya

Kisah arsitekturnya berasal dari HiDream dan belum direproduksi secara independen. Menurut vendor: HiDream-O1-Video-1.0 — HiDream V1, atau HD-V1 — memodelkan teks, video, dan audio secara bersama dalam satu proses generasi alih-alih menghasilkan gambar lalu menambahkan suara setelahnya, sehingga gerakan bibir, suara ambien, dan aksi fisik berbagi satu garis waktu. Durasi direncanakan, bukan tetap, dengan model memilih panjang antara lima hingga dua puluh detik dari peristiwa yang dijelaskan. Perilaku fisik — gravitasi, tumbukan, inersia, deformasi, peluruhan cahaya — dilatih sebagai batasan generasi. Pasca-pelatihan menggunakan pembelajaran penguatan difusi terhadap model imbalan multimodal yang selaras dengan persepsi manusia. Generasi berjalan dalam tiga tahap yang perusahaan gambarkan sebagai perencanaan terlebih dahulu, generasi bersama kedua, penyelarasan ketiga.

HiDream memposisikan model ini di dalam portofolio empat keluarga yang dibangun di atas fondasi unified-transformer bersama — HiDream-O1-Image, HiDream-O1-Video, HiDream-O1-World dan HiDream-O1-Embodied — dan mengutip hasil benchmark sebelumnya untuk model-model saudaranya, termasuk HiDream-O1-Image 1.5 di peringkat kedua secara global pada papan text-to-image Artificial Analysis dan HiDream-O1-World di peringkat pertama pada WBench. Itu adalah angka vendor untuk model lain dalam keluarga tersebut, yang dinyatakan di sini tanpa konfirmasi independen. Materi korporat perusahaan juga menjelaskan tumpukan teknologi model fondasi dengan "lebih dari 200 miliar" parameter; itu adalah pernyataan tingkat platform, bukan spesifikasi HiDream-O1-Video-1.0, dan tidak ada sumber yang menerbitkan jumlah parameter untuk checkpoint ini. Tidak ada bobot terbuka yang dirilis untuknya.

A screenshot of the Artificial Analysis AA-Video-I2V v1.0 image-to-video leaderboard with the audio filter applied, captured 10 October 2026, headed by MiniMax H3 Max at Elo 1,195 and .80 per minute, with HiDream-O1-Video-1.0 sixth at Elo 1,175 over 3,231 samples, released August 2026 at .80 per minute, and a banner noting that AA-Video-I2V v2.0 is coming soon with 1080p videos throughout.

Apa yang sebenarnya bisa kamu sebut

Di sini dokumentasinya luar biasa jelas, dan cakupannya lebih sempit daripada pengumuman. HiDream menyediakan model tersebut melalui HiHarness, platform MaaS-nya. Endpoint video adalah POST ke /api/maas/gw/v1/videos/generations dengan pengenal model HiDream-O1-Video-1.0. Input yang diperlukan tepatnya satu gambar referensi — URL publik, atau Base64 tanpa awalan data-URL, antara 40 KB dan 20 MB. Prompt teks bersifat opsional dan secara default kosong. Generasinya asinkron: Anda mengirimkan, menerima task_id, lalu melakukan polling ke /api/maas/gw/v1/videos/generations/results hingga result.status bernilai 1.

Tiga penghilangan dalam skema itu patut disebutkan secara eksplisit, karena masing-masing merupakan kemampuan yang diiklankan oleh rilis peluncuran.

• Video referensi — pengumuman mencantumkan video sebagai salah satu input model; permintaan yang didokumentasikan tidak memiliki field untuk itu.

• Resolusi eksplisit — pengumuman tersebut mengklaim 1080p; permintaan yang didokumentasikan tidak memiliki pemilih resolusi, dan hasilnya justru mempertahankan rasio aspek gambar referensi.

• Kontrol audio — pengumuman tersebut mengklaim audio tersinkronisasi native; permintaan yang didokumentasikan tidak mengekspos parameter input audio maupun parameter pembuatan audio.

Yang sebenarnya diungkapkan skema adalah force_10s, sebuah boolean yang defaultnya false. Jika dibiarkan false, model yang memilih durasi. Jika diatur true, Anda mendapat sepuluh detik. Tidak ada kolom durasi numerik, sehingga rentang lima hingga dua puluh detik yang diiklankan adalah klaim tingkat model yang tidak memungkinkan Anda mengarahkan permukaan permintaan publik kecuali dengan memilih salah satu dari dua mode.

A screenshot of the HiHarness documentation page for the HiDream-O Series video models, captured 10 October 2026, describing HiDream-O1-Video-1.0 as a single-image-to-video model that generates a video from one reference image and a text prompt, with Model ID HiDream-O1-Video-1.0, input as one reference image by public URL or Base64, output of one video, resolution that preserves the input aspect ratio, a dynamic or fixed ten-second duration, and an asynchronous workflow of submitting a task and polling the result endpoint until result.status is 1.

Ada satu detail implementasi dalam kontrak respons itu yang akan menjebak integrasi yang ditulis dengan mencocokkan pola API video lain. result.status = 1 berarti setiap subtugas telah mencapai status terminal — bukan berarti pembuatannya berhasil. Anda tetap harus membaca sub_task_results[].task_status, di mana 1 berarti sukses, 3 adalah kegagalan pembuatan, dan 4 adalah kegagalan peninjauan keamanan. Klien yang menganggap status terminal sebagai keberhasilan akan memberi Anda URL video yang tidak ada.

Harga, dalam konteks

Pada catatan Artificial Analysis sebesar $5.80 per menit, HiDream V1 berharga menengah untuk kelasnya, bukan murah. Dalam enam besar papan peringkat, model ini lebih murah daripada MiniMax H3 ($7.80) dan Dreamina Seedance 2.0 ($9.07) serta lebih mahal daripada MiniMax H3 Max dan Vidu Q4 Preview. Dibandingkan dengan model yang paling sering dibandingkan dengannya, selisihnya lebih besar: Google Veo 3.1 adalah $24.00 per menit, Kling 3.0 1080p Pro $20.16, Alibaba Wan 2.7 $9.00 dan Wan 3.0 $12.00, sedangkan Grok Imagine Video 1.5 berada di $8.40.

Tarif per menit itu tidak dapat dibandingkan secara langsung, karena satu menit keluaran pada resolusi apa dan dengan audio apa justru merupakan hal yang tidak ditentukan oleh dokumentasi API untuk model ini. Anggap angka itu sebagai titik awal untuk perhitungan Anda sendiri, bukan sebagai daftar tarif.

Mencoba jalur yang belum terbukti tanpa mempertaruhkan pipeline pada jalur itu.

Alasan untuk berhati-hati di sini bukanlah bahwa modelnya buruk. Alasannya adalah bahwa antarmuka penyajian bertipe pratinjau — satu input, satu durasi, flag terminal dua status — adalah tempat yang salah untuk meng-hardcode rute. HiDream-O1-Video-1.0 bukan model yang kami layani di OrcaRouter saat ini, jadi tidak ada yang di bawah ini merupakan klaim tentang menghosting-nya: tempat produk kami benar-benar membantu adalah di sisi lain dari keputusan itu, ketika Anda ingin menguji rute video baru terhadap rute yang sudah ada dan dapat meninggalkannya kapan saja. Satu endpoint yang kompatibel dengan OpenAI untuk lebih dari 200 model, failover otomatis sehingga rute yang mulai gagal secara diam-diam bukan rute yang Anda rilis, harga daftar penyedia diteruskan tanpa markup tambahan, dan DSL perutean yang memungkinkan Anda membandingkan dua model dalam satu permintaan alih-alih dua integrasi. Tidak ada dari semua itu yang secara khusus membutuhkan model HiDream.

Apa yang akan mengubah bagian ini?

Tiga perkembangan akan mengubah gambaran tersebut, dalam urutan kemungkinan dari yang terbesar ke yang terkecil.

Pertama, kontrak penyajian yang lebih luas. Jika HiHarness menambahkan bidang video referensi, pemilih resolusi, atau kontrol audio yang didokumentasikan, kesenjangan antara pengumuman dan API akan menutup dan klaim 1080p serta text-to-video menjadi dapat diuji. Itu adalah perubahan dokumentasi, bukan perubahan model, dan bisa terjadi kapan saja.

Kedua, papan AA-Video-I2V v2.0. Artificial Analysis telah mengatakan bahwa papan ini akan hadir, selaras dengan taksonomi T2V v2.0 dengan 1080p secara menyeluruh. Papan yang hanya 1080p akan menjadi lingkungan independen pertama di mana klaim resolusi HiDream V1 benar-benar berarti — dan jika model tersebut masih tidak dapat dimasukkan ke papan text-to-video di bawah taksonomi baru, ketidakhadirannya di sana menjadi temuan substantif, bukan artefak dari kategori lama.

Ketiga, jumlah sampel. 3.231 suara adalah pengukuran yang nyata dan masih baru, yang paling tipis di antara enam teratas. Intervalnya kini ±10 dan akan menyempit ke arah mana pun yang didorong oleh para pemilih. Siapa pun yang mengutip "keenam" sebagai fakta yang sudah pasti harus menyebutkan tanggal mereka membacanya, karena keenam adalah satu seri dalam seri enam pihak.

Pertanyaan yang layak dipertahankan bukanlah apakah HiDream-O1-Video-1.0 kompetitif — pada satu-satunya papan tempat model ini dapat diukur, jelas ia kompetitif, dan dengan harga per menit yang dapat dipertanggungjawabkan. Pertanyaannya adalah apakah model yang akhirnya mencapai API yang luas adalah model yang diumumkan. Berdasarkan dokumentasi saat ini, keduanya masih merupakan dua produk yang berbeda.

HiDream-O1-Video-1.0 bukan salah satu rute yang kami layani saat ini, tetapi jenis permukaan yang sama berada di balik lebih dari 200 model dengan harga daftar dari penyedia yang diteruskan apa adanya dan tanpa tambahan markup.