
Odyssey-3 Xem trước: Mô hình Thế giới của Odyssey chuyển từ quan sát thế giới sang hành động trong đó
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Odyssey-3 là mô hình thế giới nền tảng mới nhất của Odyssey, được công ty giới thiệu trước vào ngày 15 tháng 9 năm 2026 và được mô tả trong thông báo của chính hãng như một mô hình nhằm cung cấp sức mạnh cho "robot, điều khiển ô tô, huấn luyện AI, điều khiển máy bay không người lái và thậm chí cả chơi trò chơi điện tử." Điều khiến bản xem trước này đáng đọc kỹ không phải là danh sách các thân máy — mà là cơ chế. Odyssey-3 là một transformer khuếch tán tự hồi quy được huấn luyện để mô phỏng nhiều tình huống đa dạng từ quan sát thị giác, và công ty gắn vào đó một bộ giải mã hành độngđã được học, một thành phần chuyển dịch biểu diễn nội bộ của mô hình về một cảnh thành các lệnh động cơ mà một phần cứng cụ thể cần có. Đó là khác biệt giữa một mô hình tạo ra một đoạn clip trông hợp lý về một cánh tay robot và một mô hình được yêu cầu di chuyển cánh tay đó. Odyssey gọi nhóm hệ thống mà điều này cho phép là "tác nhân vật lý" — những mô hình mà, theo cách diễn đạt của công ty, "nói ngôn ngữ của thế giới." Nếu cách định hình này nghe có vẻ gần với nhãn "physics agent" đang lưu hành trong các bài đưa tin về bản xem trước, thì đó là một cách hiểu hợp lý cho cùng một tuyên bố, dù đây không phải là cụm từ của chính Odyssey và, ở giai đoạn này, nó là một mô tả về ý định chứ không phải một kết quả đã được đo lường.
Odyssey thực sự đã công bố điều gì
Bài đăng là một bản xem trước, không phải một màn ra mắt. Odyssey nói rằng họ "rất háo hức được công bố nó ra công chúng trong những tuần tới" và không nêu ngày, không giá, cũng không kênh truy cập nào. Không có báo cáo kỹ thuật nào về Odyssey-3 được liên kết từ thông báo — bài báo duy nhất mà trang trỏ tới là PROWL-1, công trình học tăng cường của công ty, và tệp PDF duy nhất là của Starchild-1. Việc thiếu vắng đó đáng được nói rõ, bởi vì nó định hình mọi điều bên dưới: mọi tuyên bố về năng lực trong bài viết này đều là của Odyssey, chưa được tái lập, và chưa có bên thứ ba nào công bố một con số về Odyssey-3 mà Odyssey không cung cấp.
Điều mà bài đăng thực sự nêu rõ là kiến trúc và một triết lý huấn luyện. Mô hình là một transformer khuếch tán tự hồi quy. Nó được huấn luyện trên quan sát trực quan về thế giới thay vì trên các nhãn theo từng tác vụ, điều mà Odyssey lập luận là mang lại cho nó khả năng nắm bắt đã học được về "vật lý, động lực học, nhân quả, hành vi con người" — và, theo cách diễn giải của mình, một yêu cầu dữ liệu thấp hơn so với các hệ thống không được tiền huấn luyện theo cách này. Canh bạc nằm bên dưới chính là canh bạc mà toàn bộ lĩnh vực mô hình thế giới đang đặt cược: rằng việc dự đoán trạng thái tiếp theo của một cảnh ở quy mô lớn buộc một mô hình phải nội hóa cách các vật thể vật lý thực sự hành xử, bởi vì một mô hình hiểu sai vật lý sẽ dần trở nên không mạch lạc qua một lần rollout dài và không thể phục hồi.

Một xương sống, sáu thân máy
Bằng chứng cụ thể nhất trong thông báo là sự lan rộng của các dạng hiện thân khác nhau được dẫn dắt bởi cùng một mô hình nền tảng. Odyssey báo cáo:
• Cánh tay robot — học được cách điều khiển nhiều loại cánh tay khác nhau và hoàn thành các nhiệm vụ phức tạp chỉ từ "vài chục giờ dữ liệu minh họa của robot", bao gồm cả những hành vi khắc phục vốn hoàn toàn không có trong dữ liệu minh họa, chẳng hạn như xoay lại bộ kẹp sau khi gắp trượt.
• Robot hình người — công việc được thực hiện cùng Flexion, với các chính sách được xây dựng dựa trên hàng chục giờ dữ liệu điều khiển từ xa robot hình người chạy trong thời gian thực, mà Odyssey tuyên bố đã tổng quát hóa tốt hơn trước những thay đổi về ánh sáng so với các baseline vision-language-action mà họ đã kiểm thử.
• Driving — một backbone đóng băng tạo ra các waypoint thời gian thực cho việc lái xe vòng kín, được huấn luyện trên "chỉ 20 giờ dữ liệu lái xe mô phỏng."
• Máy bay không người lái — bay trong nhà có khả năng tránh vật cản từ hàng chục giờ dữ liệu bay mô phỏng, cùng các rollout định tính với backbone được đóng băng.
• Trò chơi điện tử — các phiên chơi Grand Theft Auto V kéo dài, với việc chuyển sang Red Dead Redemption 2 và Sleeping Dogs mà không cần huấn luyện chính sách bổ sung ở những tựa game đó.
• Môi trường huấn luyện AI — những thế giới được tạo ra để làm nơi huấn luyện cho các tác nhân khác, gắn với công trình PROWL-1.
Quy luật xuyên suốt các hàng đó mới chính là điều được khẳng định: không phải rằng Odyssey-3 xuất sắc ở bất kỳ một trong số chúng, mà là một bộ trọng số duy nhất, cùng một bộ thích ứng đầu ra nhỏ được học, vươn tới được tất cả chúng. Một mô hình đa dụng về cách thế giới vận động là một tài sản rất khác biệt so với một chính sách riêng cho từng robot, và đó là lý do bản xem trước lại ở đúng vị trí như vậy.
Con số duy nhất, và điều nó không chứng minh
Odyssey công bố đúng một con số so sánh cho Odyssey-3: các chính sách lái xe được huấn luyện hoàn toàn trong mô phỏng đi được quãng đường giữa các lần can thiệp của tài xế an toàn bằng khoảng 77% so với các chính sách được huấn luyện trên cảnh quay thực tế, khi sử dụng cùng 20 giờ dữ liệu mô phỏng. Đó là một con số sim-to-real, và nó thực sự thú vị — thu hẹp dù chỉ một phần khoảng cách giữa lái xe được huấn luyện bằng mô phỏng và bằng dữ liệu thực chính là phần khó của bài toán. Đó cũng là con số duy nhất trong bài viết.
Không có bảng độ chính xác, không có tỷ lệ thành công, không có benchmark xuyên cơ thể, và không có so sánh với một mô hình thế giới được nêu tên khác trên một đánh giá chung. Thẻ ở chân trang của trang này khẳng định Odyssey-3 đưa "trình độ tiên tiến nhất về độ chính xác vật lý của các mô hình thế giới" tiến thêm một bước, nhưng không có gì trên trang chứng minh điều đó bằng một con số. Odyssey cũng nêu tên một quan hệ đối tác đánh giá với Poke & Wiggle bao gồm "các cơ thể, góc nhìn và điều khiển khác nhau" — và chưa công bố kết quả nào từ đó. Mọi thứ ở đây đều là tuyên bố của nhà cung cấp, và con số 77% nên được hiểu đúng như vậy cho đến khi một bên bên ngoài chạy lại đánh giá đó.
Bảng benchmark bị thiếu có ý nghĩa gì
Sẽ rất dễ để coi việc thiếu các benchmark là một dấu hiệu đáng ngại. Nhưng tốt hơn nên hiểu đó là hiện trạng của lĩnh vực này. Các mô hình thế giới vẫn chưa có thứ tương đương với MMLU hay GPQA — một phép đánh giá chung, rẻ, được tin cậy rộng rãi mà tất cả mọi người đều lấy đó làm chuẩn để báo cáo. Cách diễn đạt của chính Odyssey cũng thừa nhận vấn đề quy mô từ hướng ngược lại: bài viết nói rằng các mô hình thế giới tiên phong vẫn còn "kém khoảng hai bậc độ lớn so với các mô hình ngôn ngữ". Khi bản thân tiêu chuẩn đánh giá còn chưa ngã ngũ, một bài viết giới thiệu mở đầu bằng kiến trúc và phạm vi hiện thân thay vì một bảng điểm lại đang mô tả đường biên một cách trung thực, và người đọc nên xem các tuyên bố định tính là mang tính định hướng chứ chưa phải điều đã ngã ngũ. Sự hợp tác Poke & Wiggle là thứ đáng theo dõi: một phép đánh giá xuyên cơ thể, xuyên góc nhìn với các con số được công bố sẽ là cách đánh giá độc lập đầu tiên về bất kỳ điều nào trong số này.

“Trong những tuần tới” mới là tiêu đề thật sự.
Với bất kỳ ai cần đưa ra quyết định trong quý này, câu then chốt trong thông báo là câu về tính sẵn có. Odyssey-3 chưa được phát hành rộng rãi, không có giá công bố, không có tài liệu API và không có ngày được nêu — chỉ là “những tuần tới”. Điều đó đặt nó vào một nhóm khác với một mô hình bạn có thể đánh giá ngay hôm nay. Nó cũng có nghĩa là những trang so sánh chắc chắn sẽ được viết để đối chiếu với nó, trong lúc này, là so sánh giữa một sản phẩm đã phát hành và một bản xem trước nghiên cứu, và đó là một khác biệt thực sự chứ không phải một chi tiết kỹ thuật vụn vặt: một bản xem trước có thể xuất sắc và vẫn không phải là thứ bạn có thể đưa vào pipeline vào thứ Hai.
Có một lý do thứ hai khiến thời điểm này quan trọng. Odyssey đã huy động vòng Series B trị giá 310 triệu USD với mức định giá 1,45 tỷ USD, khi AWS trở thành nhà cung cấp đám mây ưu tiên của công ty — công ty có đủ năng lực tính toán để thúc đẩy một mô hình thế giới tiên phong, và một bản xem trước ra mắt vài tháng trước bản phát hành công khai chính là cách công việc đó được thể hiện. Hãy đọc thông báo này như một tuyên bố về quỹ đạo phát triển hơn là về năng lực.
Làm gì với cái này nếu bạn xây dựng ngay hôm nay
Bản thân Odyssey-3 không phải là thứ bạn có thể gọi, và OrcaRouter cũng không phục vụ nó — không một lớp định tuyến nào làm được điều đó, vì chưa có gì để định tuyến. Điều đáng làm lúc này là tách quyết định thành hai phần. Phần thứ nhất là mô hình thế giới, và với phần đó, câu trả lời trung thực là hãy chờ bản phát hành công khai cùng đánh giá độc lập đầu tiên. Phần thứ hai là mọi thứ xoay quanh nó: mô hình ngôn ngữ biến một nhiệm vụ thành thứ mà một chính sách có thể tiêu thụ, mô hình thị giác đọc một cảnh, mô hình phiên âm dán nhãn cho một bản trình diễn đã ghi. Ngăn xếp bao quanh đó là công việc định tuyến thông thường, và nó đã sẵn có ngay hôm nay trên một API duy nhất xuyên hơn 200 mô hình ở mức giá niêm yết của nhà cung cấp với markup 0%, cùng với chuyển đổi dự phòng tự động khi một nhà cung cấp suy giảm. Lý do để định tuyến lớp đó ngay bây giờ thay vì để sau là vì đó chính là lớp bạn vẫn sẽ đang chạy khi Odyssey-3 ra mắt, và việc đổi một mô hình prompt chỉ là thay đổi cấu hình, còn viết lại một tích hợp thì không.
Việc giữ câu hỏi về mô hình thế giới luôn để ngỏ theo cách rẻ nhất có thể cũng là điều đáng làm. Khi một mô hình như Odyssey-3 tiếp cận được một nhà cung cấp định tuyến, nó xuất hiện với mức giá niêm yết của nhà cung cấp ngay trong cùng ngày, nên việc thử nó tốn một lệnh gọi API thay vì một hợp đồng. Xây dựng pipeline xung quanh để có thể đưa một mô hình mới vào là sự chuẩn bị thiết thực cho một biên giới vẫn đang dịch chuyển.
Điều gì sẽ thay đổi cách hiểu
Ba điều sẽ biến bản xem trước này thành một sự thật đã được xác lập. Một báo cáo kỹ thuật được công bố với kiến trúc và chi tiết huấn luyện sẽ cho phép các nhóm bên ngoài tái tạo bất cứ thứ gì. Một phép đánh giá chuẩn độc lập đầu tiên — lý tưởng nhất là công trình cross-body của Poke & Wiggle — sẽ thay thế lời khẳng định của nhà cung cấp bằng một con số do người khác đo được. Và một bản phát hành công khai có ngày tháng, có giá sẽ khiến mọi so sánh với Odyssey-3 trở thành so sánh giữa hai thứ mà người đọc thực sự có thể chạy.
Cho đến lúc đó, bản tóm tắt có thể bảo vệ được là thế này: Odyssey-3 là một tuyên bố đáng tin về một thứ thực sự khó — một mô hình thế giới, nhiều thân, điều khiển thay vì kết xuất — đến từ một phòng thí nghiệm được đầu tư mạnh với thành tích trong lĩnh vực này, được trình bày với gần như không có số liệu và không có ngày ra mắt. Đó là dáng vẻ của một bản xem trước tiên phong. Hãy coi các tuyên bố về năng lực là mang tính định hướng, kiến trúc là phần thú vị, và ngày phát hành là dòng duy nhất làm thay đổi kế hoạch của bạn.

