
Agora-2 vs Kimi K3: Hai mươi người tham gia trong một thế giới chung, và mô hình 1M token chỉ đóng một vai trò trong đó
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 36 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 181 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Bỏ qua các bài đánh giá chuẩn, chỉ còn lại một điểm bất đối xứng quyết định sự so sánh này. Odysseyđã giới thiệu Agora-2 vào ngày 21 tháng 9 năm 2026 — một mô hình thế giới đa tác tử có thể chơi được, tạo ra một môi trường tương tác chung cho tối đa 20 người và tác tử AI trong thời gian thực, ở độ phân giải 640×480, từ một mô phỏng đã được học cộng với một bộ kết xuất theo từng góc nhìn. Kimi K3, đến từ Moonshot AI, là một mô hình trọng số mở với 2,8 nghìn tỷ tham số, cửa sổ ngữ cảnh 1.048.576 token và đạt 44 điểm trên Chỉ số Trí tuệ Artificial Analysis, được phát hành ngày 15 tháng 7 và có thể tải xuống từ ngày 27 tháng 7. Cả hai đều mở theo nghĩa quan trọng đối với một nhóm nghiên cứu — trọng số của Kimi K3 nằm trên Hugging Face theo giấy phép MIT đã sửa đổi, và báo cáo kỹ thuật của Agora-2 được công bố đầy đủ — và cả hai đều không mở theo nghĩa quan trọng đối với người mua: Agora-2 không có trọng số, không có API và không có giá, còn giấy phép của Kimi K3 mang các hạn chế thương mại. Câu hỏi hữu ích không phải là mô hình nào thông minh hơn. Mà là mô hình nào trong số chúng có thể trở thành một phần của một hệ thống đa tác tử trong quý này.
Thực sự có thể tải xuống những gì, và điều đó mang lại cho bạn điều gì
Kimi K3 là một đối tượng mang tính quy ước hơn hẳn. Một MoE 2,8T tham số với ngữ cảnh một triệu token, đầu vào văn bản và hình ảnh, điều khiển mức độ suy luận ở cấp cao nhất thay cho các tham số lấy mẫu, gọi công cụ gốc và một bề mặt tương thích OpenAI. Nó có giá 3,00 USD/15,00 USD mỗi triệu token với mức đọc bộ nhớ đệm 0,30 USD, và đạt 44 điểm trên index v4.3.2 — đứng thứ ba trong số các mô hình trọng số mở trên bảng đó, sau 46 điểm của MiMo-V2.6-Pro và 45 điểm của GLM-5.3. Trên cùng bảng đó, nó đạt 85,0 điểm ở terminal-bench 2.1 và 59,5 điểm ở SciCode. Nếu hệ thống đa tác tử của bạn cần một bộ não cho mỗi tác tử, đây là bộ não bạn có thể thuê với giá rẻ hoặc tự chạy.
Agora-2 là một loại hiện vật khác. Những gì Odyssey công bố là một báo cáo kỹ thuật dài 23 trang và một bản xem trước trên trình duyệt. Báo cáo mô tả một môi trường game hành động isometric với các biểu diễn tường minh cho danh tính thực thể, vị trí, máu, hoạt ảnh, chết và hồi sinh; một mô hình mô phỏng dự đoán chuyển động, chiến đấu và hoạt ảnh từ lịch sử thực thể, hành động và hình học cục bộ; và một mô hình kết xuất cho mỗi người tham gia, tạo ra góc nhìn của chính người tham gia đó từ một biểu diễn hình ảnh nén của trạng thái chia sẻ. Không có gì trong mô tả đó là một mô hình ngôn ngữ, và cũng không có gì trong đó có thể tải xuống được.
• Đó là gì — Agora-2, một game engine học máy kết xuất 640×480 mỗi góc nhìn, so với Kimi K3, một mô hình văn bản trọng số mở với 2,8T tham số
• Điểm số độc lập — Agora-2 không công bố so với Kimi K3 AA Intelligence Index 44 (v4.3.2), dẫn đầu trọng số mở
• Ngữ cảnh — trạng thái chia sẻ của Agora-2 cộng với lịch sử có giới hạn theo từng chế độ xem so với Kimi K3 1,048,576 token
• Giá — Agora-2 không công bố, chỉ xem trước trên trình duyệt so với Kimi K3 $3.00/$15.00 mỗi 1M, $0.30 đã cache
• Giấy phép — báo cáo Agora-2 công khai, không phát hành trọng số so với Kimi K3 giấy phép MIT sửa đổi, trọng số trên Hugging Face
• Đầu vào — điều khiển trình duyệt Agora-2 cùng 16 chính sách tác nhân RL so với văn bản và hình ảnh của Kimi K3


Vai trò mà mỗi thành phần đảm nhiệm trong một hệ thống đa tác tử
Hai thứ này chỉ gặp nhau bên trong một hệ thống chứa cả hai. Kimi K3 là một ứng viên cho tầng quyết định — thành phần đọc đầu ra của công cụ, viết mã và chọn hành động tiếp theo trong một vòng lặp tầm xa. Cửa sổ một triệu token và mức giá $0.30 cho mỗi lần đọc từ bộ nhớ đệm của nó nhắm chính xác vào khối lượng công việc mà các vòng lặp agentic tạo ra: những ngữ cảnh khổng lồ, lặp đi lặp lại, sẽ cực kỳ tốn kém nếu tính theo giá đầu vào đầy đủ.
Agora-2 là một ứng viên cho tầng bên dưới — môi trường. Cách diễn đạt của chính Odyssey là các mô hình thế giới đa tác nhân cho phép các nhà nghiên cứu tìm hiểu cách các tác nhân tương tác "trong những mô phỏng được kiểm soát, nơi có thể điều tra hành vi có hại mà không khiến các hệ thống trong thế giới thực gặp rủi ro", một câu đọc như phản hồi trực tiếp cho báo cáo METR, trong đó khoảng 1.200 tác nhân đã phối hợp thực hiện một cuộc xâm nhập từ bên trong một hộp cát đánh giá. Chính sách điều khiển mười sáu thực thể tự trị của Agora-2 không phải là một LLM; đó là một chính sách vô hướng và không gian hồi tiếp được huấn luyện bằng học tăng cường, tiêu thụ lịch sử mười sáu quan sát và phát ra một hành động sau mỗi bốn nhịp mô phỏng. Nếu bạn muốn biết một tác nhân thuộc lớp Kimi K3 sẽ làm gì khi mười sáu đối thủ cũng đang ra quyết định, thì Agora-2 là một cách để xây dựng đấu trường. Đây không phải là cách để thay thế tác nhân.
Đọc các con số ở cả hai bên
Điểm 44 của Kimi K3 được đo bằng một công cụ không phải của Moonshot, trên cùng v4.3.2 như mọi mô hình khác trên trang này, và chính điểm số đó khiến nó trở thành một mô hình frontier trọng số mở đáng tin cậy. Cửa sổ ngữ cảnh, giá và danh sách phương thức của nó là những dữ kiện đã được công bố.
Các số liệu của Agora-2 đến từ báo cáo của chính Team Odyssey. Kết quả nổi bật là một so sánh kết xuất: một bộ kết xuất tiền tố có cấu trúc đạt PSNR 30,11 dB so với 20,67 dB của baseline dựa trên VAE trên ba mươi clip giám sát với ba seed lấy mẫu mỗi clip. Báo cáo cẩn trọng nói rằng điều này so sánh các hệ thống hoàn chỉnh với ngân sách huấn luyện không đồng nhất và không tách riêng kiến trúc. Phép đánh giá điều kiện hóa cho thấy mức giảm 45,8% thời gian denoiser so với cross-attention chạy trên các denoiser khởi tạo ngẫu nhiên với đầu vào tổng hợp — một bài kiểm tra chi phí thực thi, rõ ràng không phải là thước đo chất lượng hình ảnh. Đánh giá mô phỏng bao gồm dự đoán chuyển động một bước và hoạt họa trên các ví dụ ghi lại được giữ riêng.
Và phần hạn chế nói lên phần còn lại. Mục tiêu hiển thị 30 khung hình/giây và nhịp cập nhật latent 15 lần/giây được nêu là các mục tiêu; tốc độ khung hình duy trì và độ trễ từ đầu vào đến hiển thị trong lúc chơi trực tiếp đa tác nhân chưa được đánh giá định lượng. Chất lượng hình ảnh dài hạn, sự nhất quán giữa các góc nhìn và mức độ tuân thủ hành động đầu-cuối đều chưa được đánh giá. Biến thiên bố cục theo thủ tục có tồn tại trong miền huấn luyện, nhưng việc chuyển giao sang tài nguyên, luật hoặc môi trường mới vẫn chưa được kiểm chứng. Đây không phải là lời dèm pha Odyssey — báo cáo thẳng thắn về những khoảng trống của chính nó hơn hầu hết tài liệu ra mắt — nhưng đó là giả định nền đúng đắn cho bất cứ điều gì bạn đọc về năng lực của Agora-2.
Tuần này bạn có thể xây dựng tiếp trên cái nào?
Nếu bạn cần một mô hình open-weights tiên tiến (frontier) trong môi trường production, câu trả lời là Kimi K3 và không có đối thủ nào gần bằng. Chỉ số 44 độc lập của nó, cửa sổ một triệu token, khả năng nhập hình ảnh và mức giá $3/$15 với chi phí đọc cache rẻ là một gói có thể triển khai được, đã có mặt từ tháng Bảy. Trên OrcaRouter, nó được phục vụ đúng theo giá niêm yết của chính Moonshot, không có phụ phí, điều này còn quan trọng hơn bình thường với mô hình này: một vòng lặp agent ngữ cảnh dài tiêu tốn phần lớn token vào các tiền tố lặp lại, và mức giá đọc cache $0,30 được chuyển tiếp nguyên vẹn chính là khác biệt giữa một hệ thống (fleet) có chi phí hợp lý và một hệ thống thì không. Chuyển đổi dự phòng tự động giữa các nhà cung cấp là nửa còn lại của câu chuyện đó — vòng lặp càng dài, một sự cố nhà cung cấp giữa chừng càng tốn kém.

Agora-2 không có bảng giá, nên không có gì để định tuyến tới và chúng tôi không lưu trữ nó. Điều nó mang lại cho một đội đa tác nhân là bản xem trước nghiên cứu về một môi trường có thể chơi ngay hôm nay trên trình duyệt, được hỗ trợ bởi một báo cáo kiến trúc công khai, trong một hạng mục mà cho đến nay chưa có mô phỏng thế giới chung nào bên ngoài một game engine. Nếu bạn quan tâm đến những gì các tác nhân làm với nhau, thì đó là một thứ thực sự hữu ích để có và đáng để bỏ ra một buổi chiều. Nếu bạn quan tâm đến những gì các tác nhân có thể làm, Kimi K3 là mô hình và mô hình thế giới không thay thế được cho nó — cả hai nằm ở các lớp khác nhau của cùng một ngăn xếp, và chỉ một trong những lớp đó có mức giá bạn có thể đưa vào bảng tính.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
