
Odyssey-3 vs Seedance 2.5: Vài giây cảnh quay so với hàng giờ mô phỏng
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Hỏi Seedance 2.5 giá bao nhiêu thì bạn nhận được câu trả lời tính bằng đô-la mỗi giây. Hỏi Odyssey-3 giá bao nhiêu thì bạn chẳng nhận được gì cả — không có bảng giá, không có endpoint, không có giấy phép, bởi vì mô hình được công bố ngày 15 tháng 9 năm 2026 vẫn chưa được phát hành và nhà phát triển của nó chỉ mới công khai hứa hẹn rằng nó sẽ ra mắt "trong vài tuần tới". Khoảng cách đó trông giống như một khác biệt về độ trưởng thành, nhưng phần lớn lại là một khác biệt về phạm trù. Seedance 2.5, được nhóm Seed của ByteDance phát hành ngày 31 tháng 7 năm 2026, là một cỗ máy sản xuất được bán theo từng giây cảnh quay hoàn thiện cho những người cần cảnh quay. Odyssey-3 là một world model với giao diện hành động, và người mua mà nó nhắm tới hoàn toàn không muốn cảnh quay — họ muốn một môi trường phản hồi chính xác khi có thứ gì đó tác động vào bên trong nó. Hai mô hình này đang được hướng tới một số vấn đề giống nhau, bao gồm dữ liệu robot và dữ liệu lái xe, và đó chính xác là lý do vì sao sự phân biệt này đáng được vạch ra thật cẩn thận.
Seedance 2.5 là một cỗ máy sản xuất, và các đối tác ra mắt đã cho thấy điều đó
Khả năng nổi bật nhất là thời lượng. Seedance 2.5 tạo ra ba mươi giây trong một lượt duy nhất, gấp đôi mười lăm giây của phiên bản tiền nhiệm, với khả năng mở rộng nhiều vòng cho các chuỗi dài hơn và một chế độ beta siêu dài được báo cáo là còn vươn xa hơn nữa. Chỉ riêng điều đó đã thay đổi mục đích của mô hình: ba mươi giây là một cảnh chứ không chỉ là một cú máy, và hoạt động tiếp thị của ByteDance dựa vào cụm từ "one-take" chính vì lý do đó.
Xoay quanh thời lượng là những tính năng giúp một lần tạo có thể dùng được trong dựng phim thực tế. Mô hình chấp nhận tham chiếu đa phương thức mạnh mẽ — các báo cáo đưa ra con số lên tới ba mươi hình ảnh, mười clip video và mười clip âm thanh mỗi lần tạo, với video và âm thanh tham chiếu mỗi loại được giới hạn ở khoảng ba mươi giây, và tham chiếu chỉ âm thanh là điểm mới trong phiên bản này. Có các chế độ tham chiếu mới cho bản render white-model hoặc clay, các bản nền phông xanh, tham chiếu chuyển động và sáng tạo. Khả năng kiểm soát ở cấp mốc thời gian, cho phép prompt nhắm đến tường thuật, máy quay hoặc chuyển động trong một khoảng thời gian cụ thể, và chỉnh sửa ở cấp vùng sau khi tạo giữ được tính liên tục thay vì buộc phải roll lại. Âm thanh và video được tạo cùng nhau trong một lượt, nên đồng bộ khẩu hình bám theo lời thoại được trích dẫn, và hơn mười ngôn ngữ được hỗ trợ native.
Danh sách những đơn vị áp dụng đã nói lên tất cả. Vào ngày ra mắt, XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei và Qiongche Intelligence đã xác nhận hợp tác, và các trường hợp sử dụng được nêu trải dài từ dữ liệu huấn luyện AI hiện thân và các tình huống biên của xe tự hành cho đến video đào tạo SOP công nghiệp, quảng cáo giáo dục và thương mại điện tử. Một phần trong đó là công việc sáng tạo. Một phần là tạo dữ liệu cho những hệ thống mà sau này sẽ hành động lên thế giới — đây chính là phần chồng lấn với Odyssey-3.
Một giây của Seedance 2.5 tốn bao nhiêu
Giá đã được công bố, và được tính theo token thay vì theo giây, điều này tạo ra một bước quy đổi đáng làm trước khi bạn chốt. Các con số được báo cáo cho endpoint ModelArk là $10,70 mỗi triệu token khi không có đầu vào video và $6,40 mỗi triệu token khi có bao gồm đầu vào video. Trên thực tế, con số đó tương đương khoảng $0,51 cho một clip 16:9 dài năm giây ở 480p và khoảng $1,16 cho cùng clip đó ở 720p. Đó là mức giá được nhà cung cấp công bố như đã báo cáo tại thời điểm ra mắt; hãy coi chúng là giá niêm yết hiện hành chứ không phải chi phí đo lường trên mỗi sản phẩm bàn giao, vì cả độ phân giải và thời lượng đều làm thay đổi mức giá này.
Tính khả dụng có những ranh giới thực tế. Quyền truy cập cho người tiêu dùng đi qua các ứng dụng của chính ByteDance, trong khi quyền truy cập API chia tách giữa Volcano Engine Ark ở Trung Quốc và BytePlus ModelArk trên phạm vi quốc tế. Ít nhất một nhà phân phối tuyên bố mô hình không khả dụng tại Hoa Kỳ, và các nguồn không thống nhất về việc liệu các độ phân giải được hỗ trợ có tối đa là 720p hay mở rộng đến 1080p — một sự khác biệt đáng để giải quyết dựa trên tài liệu của chính nhà cung cấp trước khi bạn thiết kế xoay quanh một độ phân giải.
Đây là kiểu mô hình mà ở đó một lớp định tuyến khẳng định được vị trí của mình vì một lý do cụ thể: giá thay đổi. Một mức giá video theo token từng thay đổi một lần khi ra mắt rồi sẽ lại thay đổi, và sự khác biệt giữa một mô hình chi phí dựa trên con số của hôm nay với một mô hình dựa trên con số của quý trước chính là sự khác biệt giữa một khoản lợi nhuận và một cú bất ngờ. OrcaRouter chuyển tiếp nguyên mức giá niêm yết của nhà cung cấp với 0% chênh lệch, nhờ đó việc nhà cung cấp giảm giá được cập nhật ngay phía chúng tôi trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo, và tính năng chuyển đổi dự phòng tự động giúp hàng đợi tạo sinh tiếp tục chạy khi một endpoint của nhà cung cấp bị suy giảm — một vấn đề về lập lịch chứ không phải chuyện lý thuyết đối với khối lượng công việc video. Bản thân Seedance 2.5 không được OrcaRouter định tuyến; nó được phục vụ thông qua các nền tảng riêng của ByteDance và các endpoint ModelArk của họ.

Odyssey-3 không được bán theo giây
Odyssey-3 chưa có đơn vị bán hàng nào, và đó chính là mấu chốt. Nó được mô tả là một mô hình thế giới nền tảng có thể cấp năng lượng cho robot, lái ô tô, huấn luyện AI, điều khiển máy bay không người lái và chơi trò chơi điện tử — một transformer khuếch tán tự hồi quy được huấn luyện trên một tập hợp lớn các quan sát thị giác, mà nhà sản xuất nói rằng mang lại hiểu biết đã học về vật lý, động lực học, nhân-quả và hành vi con người. Việc thích ứng với một tác vụ mới được thực hiện bằng cách huấn luyện một bộ giải mã hành động trên các cặp quan sát-hành động và giữ đóng băng mô hình thế giới đã huấn luyện trước, để một chính sách nhỏ đọc biểu diễn đóng băng và phát ra các lệnh động cơ.
Các cuộc trình diễn, tất cả đều do nhà cung cấp báo cáo và không có cuộc nào được tái tạo độc lập, trải dài trên sáu dạng thể hiện: cánh tay robot từ hàng chục giờ trình diễn, bao gồm các hành vi phục hồi không có trong dữ liệu; các chính sách hình người được xây dựng bằng Flexion từ hàng chục giờ điều khiển từ xa, mà Odyssey nói rằng tổng quát hóa tốt hơn so với các đường cơ sở VLA mà nó đã thử nghiệm mà không công bố một con số; lái xe vòng kín ở Ấn Độ từ hai mươi giờ dữ liệu mô phỏng; bay drone trong nhà từ dữ liệu mô phỏng; các chính sách Grand Theft Auto V được chuyển sang Red Dead Redemption 2 và Sleeping Dogs mà không cần huấn luyện thêm, khoảng hai giờ cảnh quay GTA tạo ra chuyển động cưỡi ngựa trong RDR2; và tạo môi trường để huấn luyện các AI khác thông qua công trình PROWL.
Con số cứng duy nhất là 77% — các chính sách lái xe được huấn luyện bằng mô phỏng đã đi được quãng đường giữa các lần can thiệp của người lái an toàn bằng khoảng chừng ấy tỷ lệ so với các chính sách được huấn luyện trên cảnh quay thực tế. Đó là con số do nhà cung cấp đưa ra, không có báo cáo kỹ thuật và không có xác minh bên ngoài nào đứng sau.

Đơn vị bán hàng quyết định điều gì được tối ưu hóa
Một khi bạn nhìn hai mô hình như những thước đo hơn là những năng lực, thì sự khác biệt giữa chúng không còn giống như việc cái này đang vượt trước cái kia nữa.
Một mô hình được tính phí theo từng giây đầu ra được tối ưu hóa cho đầu ra làm hài lòng người xem. Đó không phải là một tham vọng thấp hơn; đó là một mục tiêu khác với những bài toán khó riêng. Seedance 2.5 tạo ra ba mươi giây mạch lạc với đối thoại được đồng bộ và khả năng kiểm soát đến cấp dấu thời gian là một kết quả thực sự khó, và những kiểu lỗi mà nó bị đánh giá — khuôn mặt nhân vật bị trôi, một cú cắt không đạt, một câu thoại lệch đồng bộ — là những điều một người trong phòng dựng sẽ nhận ra.
Một mô hình được yêu cầu dự đoán điều gì xảy ra tiếp theo khi một bộ điều khiển hành động được tối ưu hoá cho một thứ mà người xem sẽ không bao giờ kiểm tra: liệu động học có đứng vững qua một chuỗi quyết định hay không, kể cả những quyết định mà không ai từng trình diễn. Đó là lý do Odyssey báo cáo hành vi phục hồi nổi lên từ hàng chục giờ dữ liệu thay vì báo cáo độ trung thực, và vì sao tuyên bố định lượng duy nhất của nó được đo bằng số lần can thiệp của tài xế an toàn thay vì bằng chất lượng hình ảnh. Một trình kết xuất có thể sai theo những cách mà khán giả bỏ qua. Một trình mô phỏng có thể sai theo những cách mà bộ điều khiển hành động dựa vào, và loại lỗi thứ hai tích luỹ dần qua một lần chạy.
Sự trùng lặp trong các trường hợp sử dụng được công bố — dữ liệu huấn luyện robot, các tình huống biên của lái xe tự động — chính là nơi hai bên gặp nhau, và đó là một cuộc cạnh tranh thực sự về ngân sách chứ không phải về vị trí trên benchmark. Câu hỏi mà một nhóm robotics thực sự phải đối mặt là nên mua những giây render của một thế giới đáng tin hay mua một mô hình động lực học với giao diện hành động, và câu trả lời phụ thuộc vào việc bên tiêu thụ hạ nguồn là người đánh giá con người hay một vòng lặp huấn luyện.
Kề bên nhau
• Đơn vị bán — Seedance 2.5: token, quy đổi thành khoảng 0,51 USD cho mỗi clip 5 giây ở 480p và 1,16 USD ở 720p. Odyssey-3: không công bố.
• Bạn nhận được gì cho mỗi đơn vị — Seedance 2.5: cảnh quay hoàn chỉnh, tối đa 30 giây chỉ trong một lần chạy, với âm thanh và hội thoại được đồng bộ. Odyssey-3: dự đoán trạng thái thế giới tiếp theo cùng các hành động động cơ cho phần cứng đi kèm.
• Đầu vào — Seedance 2.5: văn bản cùng tối đa ~30 hình ảnh, 10 video và 10 clip âm thanh. Odyssey-3: một bộ giải mã hành động được huấn luyện trên các cặp quan sát – hành động, dựa trên một backbone đóng băng.
• Kiểm soát chỉnh sửa — Seedance 2.5: nhắm mục tiêu ở cấp dấu thời gian và chỉnh sửa sau khi tạo ở cấp vùng. Odyssey-3: không áp dụng; không có bề mặt chỉnh sửa.
• Các đối tác được công bố — Seedance 2.5: XCMG, XPeng và ba đối tác khác khi ra mắt. Odyssey-3: Flexion về các chính sách robot hình người; chưa công bố khách hàng thương mại.
• Tình trạng phát hành — Seedance 2.5: đã ra mắt từ ngày 31 tháng 7 năm 2026, tùy thuộc vào giới hạn theo khu vực. Odyssey-3: được công bố ngày 15 tháng 9 năm 2026, phát hành công khai "trong vài tuần tới", chưa có ngày cụ thể và chưa có giá.
Cái nào phù hợp với stack của bạn?
Nếu sản phẩm bàn giao là một video mà một người sẽ xem, thì Seedance 2.5 là một sản phẩm đã phát hành với mức giá đã công bố và bộ tính năng rộng, và quyết định là kiểu tự xây dựng so với mua sẵn thông thường — với hai lưu ý đáng kiểm tra trước: liệu các độ phân giải bạn cần có thực sự khả dụng trên endpoint bạn có thể truy cập hay không, và liệu khu vực của bạn có được phục vụ hay không. Thời lượng một lần chạy dài hơn và khả năng kiểm soát timestamp của nó là những tính năng thay đổi quy trình làm việc nhiều nhất, vì chúng loại bỏ các bước ghép nối thay vì cải thiện một khung hình.
Nếu thứ được bàn giao là một policy đã qua huấn luyện hay một bộ điều khiển, thì Seedance 2.5 không phải là thứ thay thế được, bất kể đoạn phim trông đẹp đến đâu, còn Odyssey-3 thì nhắm thẳng vào vấn đề của bạn mà chẳng có gì để mua. Tuyên bố đáng để theo dõi là phần backbone đóng băng: một mô hình tiền huấn luyện duy nhất vươn tới cánh tay máy, robot hình người, một chiếc ô tô, một drone và ba trò chơi thông qua một decoder nhỏ là một phát biểu về việc bao nhiêu hiểu biết vật lý được chuyển giao giữa các dạng thân thể, và nếu nó đứng vững thì nó thay đổi những gì một đội ngũ robot phải thu thập. Nó chưa được bất kỳ ai ngoài Odyssey kiểm nghiệm, và không có báo cáo kỹ thuật, không có giấy phép, cũng không có giá.
Điều đáng để quan tâm thì chẳng hào nhoáng: với Seedance 2.5, một mức giá đã ổn định và một tuyên bố rõ ràng về khả năng cung cấp theo khu vực; với Odyssey-3, một kho lưu trữ, một giấy phép, và một bên thứ ba tái lập được 77%. Cho đến khi danh sách thứ hai tồn tại, khác biệt giữa hai mô hình này không nằm ở chất lượng. Mà là một trong hai là sản phẩm, còn cái kia là một lập luận.

OrcaRouter chứa hơn 200 mô hình đằng sau một khóa API duy nhất, vì vậy mô hình video bạn chọn không phải là mô hình duy nhất bạn có thể gọi.
