Kartu judul yang dihasilkan untuk Odyssey-3 dengan subjudul "Model dunia yang bertindak, bukan sekadar merender" dan enam kartu berlabel — Lengan robot, Humanoid, Mengemudi, Drone, Gim, Pelatihan — masing-masing tertaut ke satu simpul yang ditandai "satu backbone", dengan catatan kaki berbunyi "Dipratinjau 2026-09-15; dilaporkan vendor, tidak diuji tolok ukur secara independen."
Engineering & Research

Pratinjau Odyssey-3: Model Dunia Odyssey Bergeser dari Mengamati Dunia menjadi Bertindak di Dalamnya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Odyssey-3 adalah model dunia fondasi terbaru dari Odyssey, yang dipratinjau oleh perusahaan pada 15 September 2026 dan dijelaskan dalam pengumumannya sendiri sebagai model yang dimaksudkan untuk menggerakkan "robot, mengendarai mobil, melatih AI, menerbangkan drone, dan bahkan memainkan video game." Yang membuat pratinjau ini layak dibaca secara cermat bukanlah daftar bentuk fisiknya — melainkan mekanismenya. Odyssey-3 adalah transformer difusi autoregresif yang dilatih untuk menyimulasikan beragam skenario dari pengamatan visual, dan perusahaan memasang sebuah dekoder aksi terlatih ke dalamnya, sebuah komponen yang menerjemahkan representasi internal model tentang suatu adegan menjadi perintah motorik yang dibutuhkan oleh perangkat keras tertentu. Itulah perbedaan antara model yang menghasilkan klip yang masuk akal tentang lengan robot dan model yang diminta menggerakkannya. Odyssey menyebut kelas sistem yang dimungkinkan oleh hal ini sebagai "agen fisik" — model yang, dalam frasa perusahaan, "berbicara dalam bahasa dunia." Jika pembingkaian itu terdengar dekat dengan label "physics agent" yang beredar dalam liputan tentang pratinjau ini, itu adalah pembacaan yang wajar atas klaim yang sama, meskipun itu bukan frasa Odyssey sendiri dan, pada tahap ini, itu adalah deskripsi tentang maksud, bukan hasil yang terukur.

Apa yang sebenarnya diumumkan Odyssey

Pos ini adalah pratinjau, bukan peluncuran. Odyssey mengatakan bahwa mereka “antusias untuk merilisnya secara publik dalam beberapa minggu mendatang” dan tidak menyebutkan tanggal, harga, maupun kanal akses. Tidak ada laporan teknis Odyssey-3 yang ditautkan dari pengumuman tersebut — satu-satunya makalah yang ditunjuk oleh halaman itu adalah PROWL-1, karya pembelajaran penguatan perusahaan, dan satu-satunya PDF adalah milik Starchild-1. Ketiadaan itu patut dinyatakan secara gamblang, karena hal itu membentuk semua yang berikut: setiap klaim kemampuan dalam artikel ini berasal dari Odyssey, belum direproduksi, dan belum ada pihak ketiga yang menerbitkan angka untuk Odyssey-3 yang tidak dipasok oleh Odyssey.

Apa yang memang disebutkan dalam postingan itu adalah arsitektur dan filosofi pelatihan. Modelnya adalah transformer difusi autoregresif. Model ini dilatih pada pengamatan visual terhadap dunia, bukan pada label yang spesifik untuk tugas tertentu, yang menurut Odyssey memberinya pemahaman yang dipelajari tentang "fisika, dinamika, sebab-akibat, perilaku manusia" — dan, menurut klaimnya, kebutuhan data yang lebih rendah daripada sistem yang tidak dilatih sebelumnya dengan cara ini. Taruhan yang mendasarinya adalah taruhan yang dibuat oleh seluruh bidang model dunia: bahwa memprediksi keadaan berikutnya dari suatu adegan dalam skala besar memaksa model untuk menginternalisasi bagaimana objek fisik sebenarnya berperilaku, karena model yang salah memahami fisika akan melenceng ke ketidakkonsistenan sepanjang rollout yang panjang dan tidak dapat pulih.

A generated single-column scoreboard for Odyssey-3 listing: what it is, foundation world model; output, world state plus motor actions; embodiments, arms, humanoid, car, drone, games; price, not published; availability, preview in the coming weeks; independent benchmarks, none yet. The footer reads "All figures Odyssey-reported; no independent evaluation published."

Satu tulang punggung, enam badan

Bukti paling konkret dalam pengumuman tersebut adalah penyebaran berbagai perwujudan yang digerakkan oleh model dasar yang sama. Odyssey melaporkan:

Lengan robot — belajar mengendalikan berbagai lengan dan menyelesaikan tugas-tugas kompleks hanya dari "beberapa puluh jam demonstrasi robot", termasuk perilaku pemulihan yang sama sekali tidak ada dalam demonstrasi, seperti mengorientasikan kembali gripper setelah gagal menggenggam.

Humanoid — pekerjaan yang dilakukan bersama Flexion, dengan kebijakan yang dibangun di atas puluhan jam data teleoperasi humanoid yang berjalan secara real time, yang diklaim Odyssey mampu digeneralisasi terhadap perubahan pencahayaan lebih baik daripada baseline vision-language-action yang diujinya.

Mengemudi — backbone beku yang menghasilkan waypoint real-time untuk pengemudian loop tertutup, dilatih dengan "hanya 20 jam data simulasi mengemudi."

Drone — penerbangan dalam ruangan yang menghindari hambatan berdasarkan puluhan jam data penerbangan simulasi, plus rollout kualitatif dengan backbone yang dibekukan.

Permainan video — sesi Grand Theft Auto V yang diperpanjang, dengan transfer ke Red Dead Redemption 2 dan Sleeping Dogs tanpa pelatihan kebijakan tambahan pada judul-judul tersebut.

Lingkungan pelatihan AI — dunia yang dihasilkan yang digunakan sebagai tempat pelatihan bagi agen lain, terkait dengan pekerjaan PROWL-1.

Pola di seluruh baris tersebut adalah klaim yang sesungguhnya: bukan bahwa Odyssey-3 unggul dalam salah satu di antaranya, melainkan bahwa satu set bobot, dengan adaptor keluaran kecil yang dipelajari, mampu menjangkau semuanya. Model serbaguna tentang bagaimana dunia bergerak adalah aset yang sangat berbeda dari kebijakan per robot, dan itulah alasan pratinjau tersebut berakhir seperti sekarang.

Satu angka itu, dan apa yang tidak dibuktikannya

Odyssey menerbitkan tepat satu angka perbandingan untuk Odyssey-3: kebijakan mengemudi yang dilatih murni dalam simulasi menempuh jarak antara intervensi pengemudi keselamatan sekitar 77% dari jarak yang ditempuh kebijakan yang dilatih pada rekaman nyata, dengan menggunakan 20 jam data simulasi yang sama. Itu adalah angka sim-to-real, dan itu sungguh menarik — menutup bahkan sebagian saja dari kesenjangan antara mengemudi yang dilatih simulasi dan yang dilatih data nyata adalah bagian tersulit dari masalah ini. Itu juga satu-satunya angka dalam postingan tersebut.

Tidak ada tabel akurasi, tidak ada tingkat keberhasilan, tidak ada tolok ukur lintas tubuh, dan tidak ada perbandingan terhadap model dunia lain yang disebutkan namanya dalam evaluasi bersama. Kartu footer halaman tersebut menyatakan bahwa Odyssey-3 memajukan "kemajuan terkini dalam akurasi fisik model dunia," tetapi tidak ada apa pun di halaman itu yang mendukungnya dengan sebuah angka. Odyssey juga menyebutkan kemitraan evaluasi dengan Poke & Wiggle yang mencakup "berbagai tubuh, sudut pandang, dan kontrol" — dan belum menerbitkan hasil apa pun darinya. Semua yang ada di sini adalah klaim vendor, dan angka 77% harus dibaca persis seperti itu sampai pihak luar menjalankannya ulang.

Apa artinya tabel benchmark yang hilang

Akan mudah menganggap tidak adanya tolok ukur sebagai tanda bahaya. Lebih baik membacanya sebagai kondisi bidang ini. Model dunia belum memiliki padanan MMLU atau GPQA — evaluasi bersama, murah, dan dipercaya luas yang menjadi acuan pelaporan semua orang. Kerangka Odyssey sendiri mengakui masalah skala dari arah sebaliknya: postingan tersebut menyatakan model dunia terdepan masih "sekitar dua orde magnitudo di belakang model bahasa." Ketika standar evaluasi itu sendiri belum mapan, postingan pratinjau yang mengedepankan arsitektur dan sebaran perwujudan alih-alih papan skor menggambarkan garis terdepan secara jujur, dan pembaca sebaiknya memperlakukan klaim kualitatif sebagai petunjuk arah, bukan sebagai hal yang sudah final. Kemitraan Poke & Wiggle adalah hal yang perlu dicermati: evaluasi lintas-tubuh dan lintas-sudut pandang dengan angka yang dipublikasikan akan menjadi bacaan independen pertama atas semua ini.

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

"Dalam beberapa minggu mendatang" adalah berita utamanya yang sebenarnya.

Bagi siapa pun yang perlu mengambil keputusan kuartal ini, kalimat inti dalam pengumuman itu adalah soal ketersediaan. Odyssey-3 tidak tersedia secara umum, tidak memiliki harga yang dipublikasikan, tidak memiliki dokumentasi API, dan tidak memiliki tanggal yang ditetapkan — hanya "beberapa minggu mendatang." Itu menempatkannya dalam kategori yang berbeda dari model yang dapat Anda evaluasi hari ini. Ini juga berarti bahwa halaman-halaman perbandingan yang pasti akan dibuat dengan Odyssey-3 sebagai pembanding, untuk saat ini, adalah perbandingan antara produk yang sudah dirilis dan pratinjau riset, yang merupakan perbedaan nyata dan bukan sekadar hal teknis: sebuah pratinjau bisa sangat baik dan tetap bukan sesuatu yang dapat Anda masukkan ke dalam pipeline pada hari Senin.

Ada alasan kedua mengapa waktu ini penting. Odyssey mengumpulkan $310M dalam pendanaan Seri B dengan valuasi $1.45B, dengan AWS menjadi penyedia cloud pilihannya — perusahaan ini memiliki daya komputasi untuk mendorong model dunia frontier, dan pratinjau yang hadir beberapa bulan sebelum rilis publik adalah cara kerja itu ditunjukkan. Bacalah pengumuman itu sebagai pernyataan tentang arah perkembangan, bukan tentang kemampuan.

Apa yang harus dilakukan dengan ini jika Anda melakukan build hari ini?

Odyssey-3 sendiri bukanlah sesuatu yang bisa Anda panggil, dan OrcaRouter tidak melayaninya — tidak ada lapisan routing yang melayaninya, karena belum ada yang bisa dirutekan. Yang layak dilakukan sekarang adalah memisahkan keputusan ini menjadi dua bagian. Bagian pertama adalah world model, dan untuk itu jawaban jujurnya adalah menunggu rilis publik dan evaluasi independen yang pertama. Bagian kedua adalah segala hal di sekitarnya: model bahasa yang mengubah sebuah tugas menjadi sesuatu yang bisa dikonsumsi oleh policy, model visi yang membaca sebuah adegan, model transkripsi yang memberi label pada demonstrasi yang direkam. Tumpukan di sekitarnya itu adalah pekerjaan routed yang biasa, dan sudah tersedia hari ini di satu API untuk lebih dari 200 model dengan harga daftar penyedia dan markup 0%, dengan failover otomatis saat penyedia mengalami penurunan kinerja. Alasan untuk merutekan lapisan itu sekarang alih-alih nanti adalah karena itulah lapisan yang akan tetap Anda jalankan saat Odyssey-3 dirilis, dan mengganti model prompt hanyalah perubahan konfigurasi, sedangkan menulis ulang integrasi bukan.

Ada baiknya juga menjaga pertanyaan tentang model dunia tetap terbuka dengan cara yang semurah mungkin. Ketika model seperti Odyssey-3 benar-benar tersedia di penyedia yang dirutekan, model itu muncul dengan harga daftar penyedia pada hari yang sama, jadi mencobanya hanya memerlukan satu panggilan API, bukan kontrak. Membangun pipeline di sekitarnya agar model baru dapat langsung dipasang merupakan persiapan praktis untuk garis terdepan yang masih terus bergerak.

Apa yang akan mengubah pembacaannya

Tiga hal akan mengubah pratinjau ini menjadi fakta yang mapan. Laporan teknis yang diterbitkan dengan rincian arsitektur dan pelatihan akan memungkinkan kelompok luar mereproduksi apa pun. Tolok ukur independen pertama — idealnya karya lintas tubuh Poke & Wiggle — akan menggantikan klaim vendor dengan angka yang diukur oleh orang lain. Dan rilis publik yang sudah diberi tanggal dan harga akan membuat setiap perbandingan dengan Odyssey-3 menjadi perbandingan antara dua hal yang benar-benar dapat dijalankan oleh pembaca.

Sampai saat itu, ringkasan yang dapat dipertahankan adalah ini: Odyssey-3 adalah klaim yang kredibel atas hal yang benar-benar sulit — satu model dunia, banyak tubuh, kontrol ketimbang rendering — dari lab dengan pendanaan besar yang punya rekam jejak di bidang ini, disajikan dengan hampir tanpa angka dan tanpa tanggal ketersediaan. Seperti itulah wujud pratinjau terdepan. Perlakukan klaim kemampuan sebagai indikatif, arsitektur sebagai bagian yang menarik, dan tanggal rilis sebagai satu-satunya baris yang mengubah rencana Anda.

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.