Thẻ tiêu đề cho Odyssey-3, với phụ đề “mô hình thế giới tương tác của Odyssey, bản xem trước nghiên cứu công khai mở ngày 8 tháng 10 năm 2026”, cùng hai bảng số liệu: Odyssey-3 ở 832x480 và 16 fps trên gói cơ bản, Physics-IQ +9.99 pp xếp hạng 03 trên các prompt tùy chỉnh, chi phí chuẩn hóa $0.139 mỗi video; và Odyssey-3 Pro ở 1280x720 trên gói Pro, Physics-IQ +11.15 pp xếp hạng 02, và 66.1 trên hạng mục video-to-video, chi phí chuẩn hóa $0.267 mỗi video.
Guides & Insights

Odyssey-3: Mô hình Thế giới Mới của Odyssey giành ngôi vương Physics-IQ và mở bản xem trước công khai

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Odyssey-3 Pro đạt 66,1 trên hạng mục video-to-video của Physics-IQ Verified, và Odyssey đã công bố con số đó vào ngày 8 tháng 10 năm 2026 bên cạnh điều thực sự quan trọng đối với một nhà phát triển: một bản xem trước nghiên cứu công khai của Odyssey-3, một transformer khuếch tán tự hồi quy được xây dựng để tạo ra một môi trường từ prompt rồi tiếp tục dự đoán nó trong thời gian thực khi ai đó đi bộ xuyên qua nó, di chuyển camera, hoặc kích hoạt một sự kiện. Odyssey-3 là mô hình; Odyssey-3 Pro là phiên bản 720p của nó, chạy ở 1280×720 so với 832×480 của mô hình cơ sở. Cả hai đều được đưa lên cùng ngày, dưới dạng một bản xem trước mà bạn có thể tự điều khiển tại experience.odyssey.systems, với một kênh liên hệ riêng để truy cập API.

Sự kết hợp đó là điều khiến bài này không chỉ là một bài đăng benchmark. Các mô hình thế giới tương tác đã là đồ demo suốt hai năm qua; những mô hình tạo ra vài khung hình chuyển động trông hợp lý trên một quỹ đạo cố định không phải cùng một thứ như một mô hình vẫn giữ được dự đoán của nó mạch lạc sau khi bạn gõ vào các nút điều khiển. Odyssey đang tuyên bố điều thứ hai, và nó đang để bất kỳ ai kiểm chứng tuyên bố đó.

Chính xác thì đã phát hành những gì

Hai checkpoint, một kiến trúc, không có trọng số.

• Odyssey-3 — hạng 480p, đầu ra 832×480, 16 fps trên benchmark harness, được niêm yết ở mức 0,139 USD cho mỗi video được tạo trong cột chi phí chuẩn hóa của bảng xếp hạng.

• Odyssey-3 Pro — phân khúc 720p, 1280×720, được niêm yết ở mức 0,267 USD mỗi video theo cùng một cách tính.

• Truy cập — bản xem trước nghiên cứu trên trình duyệt với điều hướng góc nhìn thứ nhất, điều hướng góc nhìn thứ ba và di chuyển camera độc lập. Truy cập API thông qua biểu mẫu liên hệ, không phải khóa tự phục vụ.

• Tính mở — không có. Không có trọng số, không có giấy phép, không có giá mỗi token được công bố. Trang điều khoản API trên cùng trang web được cập nhật lần cuối vào 2026-01-22 và vẫn điều chỉnh "nguyên mẫu của Odyssey-2 API," điều này cho bạn thấy bề mặt thương mại còn mới đến mức nào.

Kiến trúc này được mô tả trong chính bài viết của Odyssey như một transformer khuếch tán video nhiều bước được mở rộng theo hướng tự hồi quy thông qua teacher forcing và causal masking, với một quy trình hậu huấn luyện kết hợp khớp phân phối và chưng cất đối kháng thành một biến thể chưng cất vài bước — phần khiến tương tác thời gian thực trở nên khả thi. Khuếch tán cho bạn độ trung thực; tự hồi quy cho bạn một mô hình trụ được qua một chuỗi hành động; chưng cất cho bạn tốc độ xung nhịp. Cả ba đều có vai trò trụ cột, và cả ba đều là lời kể của nhà cung cấp về hệ thống của chính họ, chứ không phải một mô tả độc lập.

Chuẩn đối sánh, được đọc theo đúng cách mà hội đồng quản trị thực sự đọc nó

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified được Anates Labs điều hành cùng với DeepMind, và đây là một benchmark thực sự khó để gian lận: nó cho các mô hình xem video về các thí nghiệm vật lý thực tế — động lực học chất lưu, quang học, cơ học vật rắn, từ học, nhiệt động lực học — và chấm điểm phần tiếp diễn so với những gì thực sự đã xảy ra. Hiện tại nó xếp hạng 41 mô hình từ 16 phòng thí nghiệm. Điểm 66.1 của Odyssey-3 Pro là điểm thô cao nhất trên track video-to-video mà Odyssey báo cáo, và cột cải thiện ròng của cùng bảng xếp hạng đó, đo lường mức tăng so với trung bình track theo điểm phần trăm, lại kể một câu chuyện tinh tế khác:

• Cải thiện ròng so với mức trung bình của track — FLUX 3 [large] dẫn đầu với +12.27 pp; Odyssey-3 Pro đứng thứ hai với +11.15 pp; Odyssey-3 đứng thứ ba với +9.99 pp.

• Chi phí cho mỗi video được tạo — Odyssey-3 Pro $0.267, Odyssey-3 $0.139, so với FLUX 3 [large] ở mức $0.868 và Seedance 2.5 ở mức $2.838. (Chi phí được chuẩn hóa về 24 fps và đầu ra rộng 1280 khi bảng xếp hạng có thể, do đó chúng có thể so sánh được giữa các mô hình không dùng chung tốc độ khung hình.)

• Vị trí dẫn đầu theo tiểu chỉ số — Odyssey-3 đứng đầu ở tiểu chỉ số không-thời gian với 44.70, trên Odyssey-3 Pro ở 42.97; FLUX 3 [large] đứng đầu ở chỉ số không gian với 64.36 và không gian có trọng số với 53.25, với hai mục Odyssey đứng thứ hai và thứ tư về không gian.

Vậy nên cách đọc trung thực không phải là “Odyssey-3 là mô hình video tốt nhất trên thế giới.” Mà là: một mô hình thế giới được xây dựng cho tương tác đã tiến sát vị trí đầu của một bảng xếp hạng về tính hợp lý vật lý mà trước đây vốn thuộc về các mô hình tạo sinh điện ảnh, và nó đạt được điều đó với chi phí chỉ bằng khoảng một phần ba chi phí chuẩn hóa của FLUX 3. Tuyên bố riêng của Odyssey — 54,7 cho Odyssey-3 Pro ở hạng mục image-to-video, best-of-8 — nằm trên cùng bảng xếp hạng đó, và lưu ý tương tự cũng áp dụng: đây là những cấu hình do bên tham gia tự gửi, và bảng xếp hạng trộn lẫn các mục được gửi với prompt tùy chỉnh và các mục chạy trên prompt của chính benchmark. Odyssey xuất hiện ở cả hai cột, điều này minh bạch một cách bất thường và cũng có nghĩa là hai hàng của nó không đo cùng một thứ.

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

Tại sao "world model" không phải là từ đồng nghĩa với "video model"

Sự khác biệt này chính là toàn bộ luận điểm của sản phẩm, nên đáng được nói rõ ràng. Một trình tạo clip nhận một câu lệnh và trả về một đối tượng cố định; kết quả đầu ra giống hệt nhau cho mọi người yêu cầu. Odyssey-3 nhận một câu lệnh và trả về một hệ thống mà bạn hành động bên trong — các chế độ camera góc nhìn thứ nhất và thứ ba của bản xem trước cùng khả năng tiếp nhận một sự kiện ngay giữa quá trình tạo là cơ chế mà qua đó nó dự đoán điều gì xảy ra tiếp theo dựa trên điều bạn vừa làm, chứ không dựa trên điều mà câu lệnh đã nói.

Chính đặc tính đó là điều khiến các kết quả hệ vật lý trong tài liệu ra mắt của Odyssey trông như vậy. Công ty báo cáo rằng một bộ giải mã hành động gắn vào mô hình thế giới đóng băng, được huấn luyện trên hàng chục giờ dữ liệu trình diễn robot, đã tạo ra những hành vi phục hồi chưa từng xuất hiện trong dữ liệu trình diễn — xoay lại đầu kẹp sau một lần kẹp trượt, nhặt lại một vật bị đánh rơi ở tư thế lạ. Công ty báo cáo một chính sách humanoid do Flexion xây dựng trên nền Odyssey-3 với hàng chục giờ dữ liệu điều khiển từ xa, vẫn tiếp tục thực thi dưới những thay đổi ánh sáng vốn làm sụp đổ các baseline VLA mà nó được so sánh cùng. Công ty báo cáo một chính sách lái xe được huấn luyện trên 20 giờ dữ liệu mô phỏng, đã lái vòng kín trên đường thực, đi được quãng đường giữa các lần can thiệp của tài xế an toàn bằng khoảng 77% so với một chính sách được huấn luyện trên cảnh quay thực. Công ty báo cáo khả năng điều hướng drone từ dữ liệu bay mô phỏng và việc chơi game trong GTA V, chuyển được khả năng di chuyển sang Red Dead Redemption 2 và khả năng lái mô tô sang Sleeping Dogs mà không cần huấn luyện thêm.

Mỗi một kết quả trong số đó đều do nhà cung cấp báo cáo và không có sự tái lập độc lập, và hai trong số đó được Odyssey diễn giải rõ ràng như những quan sát định tính chứ không phải các phép đo. Nhưng chúng là loại bằng chứng phù hợp cho tuyên bố này: phần thú vị không phải là mô hình có thể làm một nhiệm vụ mà nó đã được huấn luyện. Mà là một backbone đóng băng cộng với một adapter nhỏ tạo ra hành vi có ý nghĩa từ chỉ vài chục giờ dữ liệu, và đôi khi khái quát hóa vượt ra ngoài dữ liệu đó.

Điều gì vẫn chưa được chứng minh?

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

Ba điều, và chúng không hề nhỏ.

Đầu tiên, chưa có đơn vị đánh giá độc lập nào chạy Odyssey-3. Mục Physics-IQ là một bài nộp, và nguồn chấm điểm thứ hai trong bài viết của chính Odyssey — WorldMark, nơi Odyssey-3 đứng đầu ở ba trong bốn phần chia — là đánh giá của nhà cung cấp sử dụng chính phần chú thích của bộ chuẩn và, theo cách diễn đạt của Odyssey, "trung bình của 13 điểm số chỉ số được báo cáo của nó." Đó là việc công ty tự chấm điểm chính mình trên tập dữ liệu của người khác. Điều đó nhiều hơn những gì hầu hết các đợt ra mắt cung cấp. Nó không phải là một bên thứ ba.

Thứ hai, phân khúc duy nhất mà Odyssey-3 không giành chiến thắng trong đánh giá đó lại là phân khúc gần nhất với tuyên bố tiếp thị. Trong môi trường thực tế góc nhìn thứ nhất, nó đứng thứ ba với 80,6, sau Lyra 2.0 với 84,4 và AlayaWorld với 83,0. Lợi thế của mô hình trong cùng đánh giá tập trung ở các môi trường cách điệu và góc nhìn thứ ba — 77,2 ở góc nhìn thứ nhất cách điệu, 79,0 ở góc nhìn thứ ba thực tế, 76,3 ở góc nhìn thứ ba cách điệu. Nếu bạn đang xây dựng cho trải nghiệm nhập thân góc nhìn thứ nhất chân thực như ảnh chụp, thứ hạng bạn nên quan tâm là thứ hạng mà Odyssey-3 không đứng đầu.

Thứ ba, tính khả dụng. “Bản xem trước nghiên cứu” đang thực sự đóng một vai trò quan trọng trong câu đó. Không có trang định giá, không có tài liệu về giới hạn tốc độ, và không có khóa tự phục vụ. Nếu bạn muốn đưa thứ này vào một sản phẩm, bạn đang ở trong hàng đợi.

So sánh nó mà không có hợp đồng thứ hai

Đây là vấn đề thực tế với một màn ra mắt như thế này: Odyssey-3 là thứ thú vị nhất trong lĩnh vực tạo video tuần này, vậy mà bạn vẫn không thể gọi nó. Còn những mô hình mà bạn thực sự sẽ đem ra đánh giá so sánh với nó lại là một câu chuyện khác.

OrcaRouter không vận hành Odyssey-3, và không có mức giá công bố nào để chuyển tiếp ngay cả khi chúng tôi có vận hành. Điều mà một key với tới được là phần còn lại của nhóm so sánh — minimax/minimax-h3 ở mức $0.08 cho mỗi giây video được tạo ở 768P, dòng video K​ling, và hơn 200 mô hình phía sau một endpoint duy nhất — theo giá niêm yết của nhà cung cấp với 0% markup, nên thay đổi giá của nhà cung cấp sẽ xuất hiện trên hóa đơn của bạn ngay trong ngày thay vì vào kỳ gia hạn tiếp theo. Chuyển đổi dự phòng tự động giữa các nhà cung cấp nghĩa là một đợt đánh giá hàng loạt sẽ không chết chỉ vì một upstream đang dở chứng, và DSL định tuyến cho phép bạn đặt nhiều mô hình phía sau một giao diện, nên một màn đối đầu trực tiếp chỉ là một thay đổi cấu hình thay vì một tích hợp thứ hai. Nếu Odyssey mở một API tự phục vụ, đó chính là dạng mà bạn muốn ghép nó vào.

Điều gì sẽ giải quyết được nó?

Một lượt chạy độc lập Odyssey-3 trên một bộ khung kiểm thử mà nó không tự chọn. Mười hai chuyên gia thực hành có quyền truy cập bản xem trước mô tả chỗ môi trường còn đứng vững sau một phút thao tác camera dồn dập và chỗ nào thì không. Một mức giá. Bất kỳ điều nào trong số đó cũng biến thứ này từ một màn ra mắt mạnh mẽ thành một điểm tham chiếu.

Điều vốn đã đúng thì hẹp hơn và vẫn đáng chú ý: trên bảng xếp hạng duy nhất đo lường việc một mô hình tạo sinh có hiểu hay không, chứ không phải việc nó tạo ảnh đẹp đến đâu, một mô hình có mục đích là tương tác đang đứng thứ hai và thứ ba, với chi phí chuẩn hóa thấp hơn mô hình đứng thứ nhất.