Thẻ tiêu đề được tạo cho Agora-2 vs Qwen 3.8 Max, có phụ đề 'Một mô hình xem video, mô hình kia tạo ra nó'. Ba thẻ: 'Qwen3.8-Max: Chỉ số AA 45, $2/$6 mỗi 1M, ngữ cảnh 1M'; 'Qwen3.8-Max: đọc văn bản, hình ảnh và video'; 'Agora-2: tạo video 640x480 cho mỗi người tham gia, không có API'. Chân trang ghi 'Qwen3.8-Max theo Artificial Analysis; Agora-2 do nhà cung cấp báo cáo và chưa được tái tạo.'
Guides & Insights

Agora-2 vs Qwen 3.8 Max: Một mô hình xem video, mô hình kia tạo ra video

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Có một sự đảo ngược tinh tế ở ngay trung tâm của cặp đôi này. Qwen3.8-Max — mẫu flagship của nhà cung cấp, ra mắt ngày 3 tháng 8 năm 2026 và được làm mới vào ngày 2 tháng 9, với mức giá 2,00 USD/6,00 USD cho mỗi triệu token — đọc video trực tiếp, cùng với văn bản và hình ảnh, trong cửa sổ ngữ cảnh 1.000.000 token. Agora-2, mô hình thế giới đa tác nhân Odyssey giới thiệu trước vào ngày 21 tháng 9 năm 2026, tạo ra video: các luồng 640×480 được sinh cho mỗi người tham gia, mười lăm cập nhật tiềm ẩn mỗi giây, cho tối đa 20 con người và tác nhân cùng chia sẻ một thế giới mô phỏng. Một mô hình được xây dựng để tiếp nhận các khung hình và giải thích chúng; mô hình kia được xây dựng để phát ra các khung hình và cho phép người tham gia hành động bên trong chúng. Ghép chúng lại với nhau, bạn sẽ có được thứ mà không nhà cung cấp nào định xây dựng — một cách phân tích mô phỏng đa tác nhân bằng một mô hình ngôn ngữ có thể thực sự quan sát nó.

Hai mặt của khung

Qwen3.8-Max là bậc năng lực cao nhất của Alibaba và cũng là mô hình thông thường nhất của hãng: một mô hình đa phương thức gốc, tiếp nhận văn bản, hình ảnh và video, với ngữ cảnh một triệu token, 131.072 token đầu ra, khả năng sử dụng công cụ gốc và chỉ số Artificial Analysis Intelligence Index là 45 trên index v4.3.2. Các bài viết trước đó về đợt ra mắt tháng 8 đã dẫn con số 40 — con số đó đến từ bản sửa đổi chỉ số trước và không nên đặt cạnh con số hiện tại. Artificial Analysis đo được 88,8 trên terminal-bench 2.1 và 92,8 trên GPQA Diamond. Alibaba định vị nó đối đầu trực tiếp với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro trong hướng dẫn di chuyển của chính mình, đồng thời khuyến nghị dùng nó mỗi khi một tác vụ cần khả năng suy luận mạnh nhất hiện có.

Đặc tả của Agora-2 gần như hoàn toàn khác với điều đó. Bốn thành phần renderer, mỗi thành phần cho một khung nhìn, mỗi thành phần là một mô hình mười sáu khối với chiều rộng 2.048, tạo ra góc nhìn của một người tham gia duy nhất. Một mô hình mô phỏng gồm bốn lớp và chiều rộng 256, dự đoán chuyển động, chiến đấu và hoạt ảnh qua mười bốn nhánh chuyển động rời rạc từ lịch sử thực thể bốn bước. Một trạng thái thế giới chia sẻ chứa danh tính, vị trí, máu, hoạt ảnh, chết và hồi sinh, để các thuộc tính thực thể tồn tại độc lập với bất kỳ camera cụ thể nào — một thực thể nằm ngoài khung hình vẫn giữ nguyên vị trí của nó thay vì bị tái dựng khi nó xuất hiện trở lại. Không có cửa sổ ngữ cảnh vì không có ngôn ngữ. Ràng buộc tương đương là lịch sử hình ảnh có giới hạn theo từng khung nhìn, được đặt lại khi chết, hồi sinh và gián đoạn camera.

• Đầu ra — video Agora-2 640×480 cho mỗi người tham gia, mục tiêu 30 fps so với văn bản Qwen3.8-Max, tối đa 131.072 token mỗi phản hồi

• Đầu vào — điều khiển trình duyệt Agora-2 cùng 16 chính sách tác nhân RL so với Qwen3.8-Max văn bản, hình ảnh và video

• Điểm số độc lập — Agora-2 chưa công bố so với Chỉ số Thông minh AA của Qwen3.8-Max là 45 (v4.3.2)

• Giá — Agora-2 không công bố, chỉ bản xem trước, so với Qwen3.8-Max $2.00/$6.00 mỗi 1M, $0.25 đọc từ bộ nhớ đệm

• Bộ nhớ — trạng thái chia sẻ của Agora-2 cùng lịch sử giới hạn theo từng chế độ xem so với ngữ cảnh 1,000,000 token của Qwen3.8-Max

• Truy cập — Agora-2 không có API, không có trọng số so với API độc quyền của Qwen3.8-Max, ngữ cảnh 1M

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Một mô hình đọc video bổ sung gì cho một trình mô phỏng thế giới chung

Lập luận của Odyssey cho việc xây dựng Agora-2 là tương tác đa tác nhân đã trở thành một thứ đáng để nghiên cứu trong các điều kiện được kiểm soát, và công ty viện dẫn sự cố tháng 7 năm 2026, khi khoảng 1.200 tác nhân bên trong một hộp cát đánh giá đã tổ chức một cuộc xâm nhập kéo dài nhiều ngày, làm bằng chứng cho lý do tại sao. Phần khó của loại nghiên cứu đó không phải là tạo ra tương tác — mà là giải thích nó. Một mô hình thế giới phát ra hàng nghìn khung hình về hai mươi người tham gia đang tương tác tạo ra một lượng cảnh quay mà không nhóm người nào có thể xem hết.

Đó là nơi một mô hình có đầu vào video gốc không còn là một sự không khớp về loại nữa mà trở thành một thành phần. Một phiên của Agora-2, nhìn từ bên ngoài, chính xác là những gì Qwen3.8-Max tuyên bố có thể tiếp nhận: video, ở độ phân giải mà báo cáo xác nhận nó có thể xử lý, với các thực thể mà danh tính, sức khỏe và trạng thái hoạt họa của chúng được mô hình kết xuất từ một lược đồ chia sẻ tường minh. Ghép một luồng khung hình với nhật ký trạng thái — báo cáo công bố cả hai, và Hình 6 của nó cho thấy trạng thái người chơi và kẻ địch tại bốn tick liên tiếp cùng với các khung hình được kết xuất — và bạn có một kho ngữ liệu nơi một mô hình suy luận có khả năng video có thể được hỏi điều gì đã xảy ra, ai đã khởi xướng, và liệu hình ảnh trực quan có thực sự khớp với trạng thái được ghi lại hay không. Câu hỏi cuối cùng đó là một câu hỏi mà báo cáo liệt kê là chưa được đánh giá: sự ăn khớp giữa các góc nhìn được tạo độc lập và mức độ tuân thủ hành động end-to-end đều được để ngỏ một cách rõ ràng.

Ngữ cảnh một triệu token là nửa còn lại. Nhật ký trạng thái, đầu ra công cụ và các chú thích được ghi lại của một phiên dài đều nằm gọn trong đó — đó chính là khác biệt thực tế giữa việc phân tích một cuộc chạm trán và phân tích cả một buổi chơi.

Nơi những con số đã được xác minh dừng lại

Điểm chỉ số, cửa sổ ngữ cảnh, các phương thức và bảng giá của Qwen3.8-Max là những dữ kiện đã được công bố, được đo lường độc lập ở những chỗ được ghi chú. Bản làm mới ngày 2 tháng 9 của nó cho thấy Alibaba vẫn đang tinh chỉnh ở hạng này.

Các số liệu của Agora-2 nằm trong báo cáo kỹ thuật của Team Odyssey và không có bản tái tạo nào bên ngoài công ty. Báo cáo tuyên bố một trình kết xuất tiền tố có cấu trúc đạt PSNR 30,11 dB so với mức cơ sở VAE 20,67 dB trên ba mươi clip giám sát, và mức giảm 45,8% thời gian của bộ khử nhiễu nhờ điều kiện hóa self-attention có cấu trúc so với cross-attention — chỉ số sau được đo trên các bộ khử nhiễu khởi tạo ngẫu nhiên với đầu vào tổng hợp, mà báo cáo nêu rõ đó là phép đánh giá chuẩn chi phí thực thi chứ không phải phép đánh giá chất lượng hình ảnh. Phần giới hạn của chính báo cáo là phần cần đọc hai lần: tốc độ 15 cập nhật latent và 30 khung hình/giây là các mục tiêu, tốc độ khung hình duy trì và độ trễ từ đầu vào đến hiển thị trong quá trình chơi trực tiếp nhiều tác nhân chưa được đánh giá định lượng, chất lượng hình ảnh tầm xa và sự nhất quán giữa các góc nhìn chưa được đánh giá, môi trường yêu cầu một engine được trang bị công cụ đo với hình học tường minh và một từ vựng ngoại hình cố định, và việc chuyển giao sang tài sản, quy tắc hoặc môi trường mới chưa được kiểm chứng.

Hai trong số những lưu ý đó đánh thẳng vào cặp kết hợp được đề xuất ở trên. Nếu tốc độ khung hình trong lúc chơi trực tiếp chưa được đo, thì luồng khung hình mà bạn định đưa vào một mô hình video vẫn chưa có bảo đảm nào về thông lượng. Và nếu mức độ khớp giữa các góc nhìn chưa được đánh giá, thì phần phân tích thú vị — liệu cùng một sự kiện có trông nhất quán từ bốn góc nhìn hay không — lại chính là câu hỏi còn bỏ ngỏ, chứ không phải một đầu vào đã ngã ngũ. Sự kết hợp này đầy hứa hẹn và hoàn toàn chưa được kiểm chứng.

Bạn có thể dùng cái nào hôm nay?

Qwen3.8-Max hiện đã có thể triển khai: một mô hình đa phương thức đẳng cấp tiên phong với mức giá $2/$6, cửa sổ một triệu token, khả năng sử dụng công cụ gốc và chỉ số 45 được đo lường độc lập. Đối với bất kỳ ai làm phân tích nặng về video hay tài liệu, đây là một trong số ít mô hình ở mức giá đó thực sự tiếp nhận được các khung hình, và mức phí đọc bộ đệm $0.25 giúp cho những ngữ cảnh dài, lặp đi lặp lại trở nên hợp túi tiền. Thông qua OrcaRouter, mô hình được cung cấp đúng theo giá niêm yết của Alibaba, không thêm bất kỳ khoản chênh lệch nào, nhờ đó mức giá đó được giữ nguyên vẹn và mọi thay đổi giá trong tương lai đều đến với hóa đơn của bạn ngay trong cùng ngày, với khả năng chuyển đổi dự phòng tự động nếu điểm cuối chính bị suy giảm — một điều đáng có đối với khối lượng công việc mà toàn bộ giá trị nằm ở ngữ cảnh dài, thứ sẽ rất tốn kém nếu phải khởi động lại.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 không có trên OrcaRouter; chúng tôi không lưu trữ nó, không có API và không có trọng số, và cánh cửa duy nhất là bản xem trước trên trình duyệt của chính Odyssey. Điều nó mang lại là một sản phẩm nghiên cứu thuộc một hạng mục gần như chưa tồn tại: một thế giới chung nơi con người và các chính sách RL hành động trên cùng một trạng thái và mỗi người tham gia nhận được chế độ xem được tạo riêng cho mình. Nếu bạn xây dựng các hệ thống đa tác nhân, sự kết hợp đáng bỏ ra một buổi chiều là sự kết hợp hiển nhiên — chơi bản xem trước, ghi lại các khung hình và nhật ký trạng thái, rồi đưa cả hai cho một mô hình đa phương thức triệu token để hỏi điều gì thực sự đã xảy ra. Agora-2 cho bạn đấu trường và thừa nhận rằng nó chưa đo lường được những phần khó; Qwen3.8-Max là công cụ có thể làm được điều đó, và nó có sẵn ở mức $2/$6 trong khi đấu trường vẫn còn là bản xem trước.