Kartu judul untuk Odyssey-3, dengan subjudul “model dunia interaktif Odyssey, pratinjau riset publik dibuka 8 Okt 2026”, dengan dua panel statistik: Odyssey-3 pada 832x480 dan 16 fps di tier dasar, Physics-IQ +9,99 pp peringkat 03 pada prompt khusus, biaya ternormalisasi $0,139 per video; dan Odyssey-3 Pro pada 1280x720 di tier Pro, Physics-IQ +11,15 pp peringkat 02, dan 66,1 pada jalur video-ke-video, biaya ternormalisasi $0,267 per video.
Guides & Insights

Odyssey-3: Model Dunia Baru Odyssey Merebut Takhta Physics-IQ dan Membuka Pratinjau Publik

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Odyssey-3 Pro memperoleh skor 66,1 pada jalur video-ke-video Physics-IQ Verified, dan Odyssey menerbitkan angka itu pada 8 Oktober 2026 di samping hal yang benar-benar penting bagi pengembang: pratinjau riset publik Odyssey-3, sebuah transformer difusi autoregresif yang dibangun untuk menghasilkan lingkungan dari prompt lalu terus memprediksinya secara real time saat seseorang berjalan di dalamnya, menggerakkan kamera, atau memicu suatu peristiwa. Odyssey-3 adalah modelnya; Odyssey-3 Pro adalah tier 720p-nya, berjalan pada 1280×720 dibandingkan 832×480 milik model dasar. Keduanya dirilis pada hari yang sama, ke dalam pratinjau yang dapat Anda jalankan sendiri di experience.odyssey.systems, dengan jalur kontak terpisah untuk akses API.

Pasangan itulah yang membuat ini lebih dari sekadar postingan benchmark. Model dunia interaktif sudah menjadi demo-ware selama dua tahun; model yang menghasilkan beberapa frame gerakan masuk akal pada lintasan tetap bukanlah artefak yang sama dengan model yang menjaga prediksinya tetap koheren setelah Anda mengutak-atik kontrolnya. Odyssey mengklaim hal yang kedua, dan membiarkan siapa pun menguji klaim itu.

Apa yang dirilis, tepatnya

Dua checkpoint, satu arsitektur, tanpa bobot.

• Odyssey-3 — tier 480p, output 832×480, 16 fps pada harness benchmark, terdaftar pada $0,139 per video yang dihasilkan di kolom biaya ternormalisasi papan peringkat.

• Odyssey-3 Pro — tier 720p, 1280×720, terdaftar pada $0,267 per video dengan dasar yang sama.

• Akses — pratinjau riset di peramban dengan navigasi orang pertama, navigasi orang ketiga, dan pergerakan kamera independen. Akses API berupa formulir kontak, bukan kunci swalayan.

• Keterbukaan — tidak ada. Tidak ada bobot, tidak ada lisensi, tidak ada harga per token yang dipublikasikan. Halaman ketentuan API di situs yang sama terakhir diperbarui pada 2026-01-22 dan masih mengatur "prototipe Odyssey-2 API," yang memberi tahu Anda seberapa baru sisi komersialnya.

Arsitektur ini diuraikan dalam tulisan Odyssey sendiri sebagai transformer difusi video multi-langkah yang diperluas secara autoregresif melalui teacher forcing dan causal masking, dengan pipeline pasca-pelatihan yang menggabungkan pencocokan distribusi dan distilasi adversarial menjadi varian terdistilasi beberapa langkah — bagian yang membuat interaksi real-time mungkin terjadi. Difusi memberi Anda fidelitas; autoregresi memberi Anda model yang bertahan terhadap urutan aksi; distilasi memberi Anda kecepatan clock. Ketiganya merupakan komponen penopang, dan ketiganya adalah keterangan vendor tentang sistemnya sendiri, bukan keterangan independen.

Tolok ukur itu, dibaca sebagaimana dewan sebenarnya membacanya.

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified dijalankan oleh Anates Labs bersama DeepMind, dan ini adalah tolok ukur yang benar-benar sulit untuk dimanipulasi: ia memperlihatkan video eksperimen fisika nyata kepada model — dinamika fluida, optik, mekanika padat, magnetisme, termodinamika — dan menilai kelanjutannya terhadap apa yang sebenarnya terjadi. Saat ini ia memeringkat 41 model dari 16 laboratorium. Skor 66,1 dari Odyssey-3 Pro adalah skor mentah tertinggi pada jalur video-ke-video yang dilaporkan Odyssey, dan kolom peningkatan bersih di papan peringkat yang sama, yang menceritakan kisah yang sedikit berbeda:

• Peningkatan bersih dibandingkan rata-rata track — FLUX 3 [large] memimpin dengan +12,27 pp; Odyssey-3 Pro berada di urutan kedua dengan +11,15 pp; Odyssey-3 berada di urutan ketiga dengan +9,99 pp.

• Biaya per video yang dihasilkan — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, dibandingkan FLUX 3 [large] pada $0.868 dan Seedance 2.5 pada $2.838. (Biaya dinormalisasi ke 24 fps dan output lebar 1280 jika papan peringkat memungkinkan, sehingga dapat dibandingkan antar model yang tidak memiliki frame rate yang sama.)

• Keunggulan submetrik — Odyssey-3 meraih peringkat pertama pada submetrik spasiotemporal dengan 44,70, di depan Odyssey-3 Pro pada 42,97; FLUX 3 [large] meraih peringkat pertama untuk spasial dengan 64,36 dan spasial berbobot dengan 53,25, dengan kedua entri Odyssey berada di posisi kedua dan keempat untuk spasial.

Jadi, pembacaan yang jujur bukanlah "Odyssey-3 adalah model video terbaik di dunia." Melainkan: model dunia yang dibangun untuk interaksi telah mendarat di dekat puncak papan kelayakan fisik yang sebelumnya menjadi milik generator sinematik, dan melakukannya dengan sekitar sepertiga dari biaya ternormalisasi FLUX 3. Klaim terpisah Odyssey — 54,7 untuk Odyssey-3 Pro pada jalur image-to-video, best-of-8 — berada di papan yang sama, dan catatan yang sama berlaku: ini adalah konfigurasi yang dikirim sendiri, dan papan peringkat mencampur entri yang dikirim dengan prompt khusus dan entri yang dijalankan dengan prompt milik benchmark itu sendiri. Odyssey muncul di kedua kolom, yang luar biasa transparan dan juga berarti kedua barisnya tidak mengukur hal yang sama.

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

Mengapa "world model" bukan sinonim dari "video model"

Perbedaan inilah yang menjadi inti argumen produk, jadi layak dinyatakan secara gamblang. Generator klip menerima prompt dan mengembalikan objek tetap; hasilnya sama bagi siapa pun. Odyssey-3 menerima prompt dan mengembalikan sistem yang di dalamnya Anda bertindak — mode kamera orang pertama dan orang ketiga pada pratinjau serta kemampuannya menerima peristiwa di tengah proses pembuatan adalah mekanisme yang dengannya ia memprediksi apa yang terjadi selanjutnya berdasarkan apa yang baru saja Anda lakukan, bukan berdasarkan apa yang dikatakan prompt.

Sifat itulah yang membuat hasil sistem fisik dalam materi peluncuran Odyssey terlihat seperti itu. Perusahaan melaporkan bahwa dekoder aksi yang dipasang pada model dunia yang dibekukan, yang dilatih dengan puluhan jam demonstrasi robot, menghasilkan perilaku pemulihan yang tidak pernah ada dalam demonstrasi — mengorientasikan ulang gripper setelah genggaman meleset, mengambil kembali objek yang jatuh dalam orientasi tidak biasa. Perusahaan melaporkan kebijakan humanoid yang dibangun Flexion di atas Odyssey-3 dengan puluhan jam data teleoperasi yang terus menjalankan tugas di bawah perubahan pencahayaan yang membuat baseline VLA yang dibandingkan dengannya gagal. Perusahaan melaporkan kebijakan mengemudi yang dilatih pada 20 jam data simulasi yang mengemudi dalam loop tertutup di jalan nyata, dengan jarak tempuh di antara intervensi pengemudi keselamatan sekitar 77% dari jarak yang ditempuh kebijakan yang dilatih pada rekaman nyata. Perusahaan melaporkan navigasi drone dari data penerbangan simulasi dan permainan GTA V yang mengalihkan pergerakan ke Red Dead Redemption 2 dan berkendara sepeda motor ke Sleeping Dogs tanpa pelatihan tambahan.

Masing-masing dari semua itu adalah hasil yang dilaporkan vendor tanpa replikasi independen, dan dua di antaranya secara eksplisit dibingkai oleh Odyssey sebagai pengamatan kualitatif, bukan pengukuran. Namun, itu adalah jenis bukti yang tepat untuk klaim tersebut: bagian yang menarik bukanlah bahwa model dapat mengerjakan tugas yang dilatih untuknya. Yang menarik adalah bahwa backbone beku ditambah adapter kecil menghasilkan hasil yang berarti dari beberapa puluh data, dan kadang-kadang menggeneralisasi melampauinya.

Apa yang masih belum terbukti?

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

Tiga hal, dan itu bukan hal kecil.

Pertama, belum ada evaluator independen yang menjalankan Odyssey-3. Entri Physics-IQ adalah sebuah submission, dan sumber penilaian kedua dalam tulisan Odyssey sendiri — WorldMark, yang menempatkan Odyssey-3 di peringkat pertama pada tiga dari empat split — adalah evaluasi vendor yang menggunakan caption milik benchmark itu sendiri dan, dalam penyebutan Odyssey, "rata-rata dari 13 skor metrik yang dilaporkannya." Itu adalah perusahaan yang menilai dirinya sendiri pada dataset milik orang lain. Itu lebih dari yang ditawarkan sebagian besar peluncuran. Itu bukan pihak ketiga.

Kedua, satu bagian yang tidak dimenangkan Odyssey-3 dalam evaluasi itu adalah bagian yang paling dekat dengan klaim pemasaran. Dalam lingkungan nyata orang pertama, ia menempati peringkat ketiga dengan 80,6, di belakang Lyra 2.0 dengan 84,4 dan AlayaWorld dengan 83,0. Keunggulan model ini dalam evaluasi yang sama terkonsentrasi pada lingkungan bergaya dan orang ketiga — 77,2 pada orang pertama bergaya, 79,0 pada orang ketiga nyata, 76,3 pada orang ketiga bergaya. Jika Anda membangun untuk perwujudan orang pertama yang fotorealistis, peringkat yang harus Anda pedulikan adalah peringkat di mana Odyssey-3 tidak berada di puncak.

Ketiga, ketersediaan. "Research preview" benar-benar memainkan peran penting dalam kalimat itu. Tidak ada halaman harga, tidak ada dokumentasi batas laju, dan tidak ada kunci yang bisa didapat sendiri. Jika Anda ingin ini ada dalam sebuah produk, Anda berada dalam antrean.

Membandingkannya tanpa kontrak kedua

Inilah masalah praktis dengan peluncuran seperti ini: Odyssey-3 adalah hal paling menarik dalam pembuatan video minggu ini, tetapi Anda masih belum bisa memanggilnya. Model-model yang sebenarnya akan Anda jadikan tolok ukur pembandingnya justru cerita yang berbeda.

OrcaRouter tidak menghosting Odyssey-3, dan tidak ada harga yang dipublikasikan untuk diteruskan bahkan jika kami menghostingnya. Yang dapat dijangkau oleh satu kunci adalah bagian lain dari set perbandingan — minimax/minimax-h3 dengan $0,08 per detik video yang dihasilkan pada 768P, lini video Kling, dan lebih dari 200 model di balik satu endpoint — pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor muncul di faktur Anda pada hari yang sama, bukan pada perpanjangan berikutnya. Failover otomatis antar penyedia berarti rangkaian evaluasi tidak mati karena satu upstream sedang mengalami gangguan, dan DSL perutean memungkinkan Anda menempatkan beberapa model di balik satu antarmuka sehingga perbandingan langsung cukup dengan perubahan konfigurasi, bukan integrasi kedua. Jika Odyssey membuka API swalayan, itulah bentuk yang tepat untuk memasukkannya.

Apa yang bisa menyelesaikannya

Pengujian independen Odyssey-3 pada harness yang tidak dipilihnya. Selusin praktisi dengan akses pratinjau yang menjelaskan di mana lingkungan tersebut tetap utuh setelah satu menit pergerakan kamera yang agresif dan di mana tidak. Harga. Salah satu saja dari hal-hal itu mengubah ini dari peluncuran yang kuat menjadi titik acuan.

Apa yang sudah benar itu lebih sempit dan tetap penting: pada satu-satunya papan peringkat publik yang mengukur apakah sebuah model generatif memahami fisika, bukan seberapa bagus ia memotret, sebuah model yang tujuannya adalah interaksi menempati posisi kedua dan ketiga, dengan biaya ternormalisasi di bawah model yang berada di posisi pertama.