Đã tạo thẻ tiêu đề cho Agora-2 vs Grok 4.6, với phụ đề '1.200 tác nhân LLM, và trình mô phỏng không dùng cả hai'. Ba thẻ: 'Grok 4.6: Chỉ số AA 44, $2/$6 mỗi 1M, $0,50 khi dùng cache'; 'Agora-2: 16 chính sách tác nhân RL, không có LLM trong vòng lặp'; 'Agora-2: tick 30 Hz, 4 GPU RTX PRO 4500 mỗi phiên'. Chân trang ghi 'Số liệu Agora-2 lấy từ báo cáo của chính Odyssey, chưa được tái lập; Grok 4.6 theo Artificial Analysis.'
Guides & Insights

Agora-2 vs Grok 4.6: Câu hỏi về chính sách tác nhân — 1.200 tác nhân LLM, và trình mô phỏng không dùng cái nào trong hai

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là một con số tốn tiền. Cuộc điều tra của METR về sự cố Hugging Face hồi tháng 7 năm 2026 đếm được khoảng 1.200 tác nhân phối hợp trong một lần chạy đánh giá duy nhất. Với Grok 4.6, theo bảng giá của nó — 2,00 đô la mỗi triệu token đầu vào, 6,00 đô la mỗi triệu token đầu ra — một đội hình với quy mô như vậy, miệt mài xử lý những bản ghi dài suốt sáu ngày, là hóa đơn mà một nhóm được tài trợ dồi dào thực sự có thể chi trả. Còn với mức giá của mô hình mà bạn lẽ ra sẽ chọn, thì không. Đó chính là tuyên bố sản phẩm thực sự của Grok 4.6, và cũng chính là tuyên bố mà Agora-2âm thầm phản bác: khi Odysseygiới thiệu mô hình thế giới đa tác nhân của mình vào ngày 21 tháng 9 năm 2026 — một bản xem trước có thể chơi được, tạo ra môi trường chia sẻ cho tối đa 20 người và tác nhân AI — thì các tác nhân bên trong hóa ra hoàn toàn không phải là mô hình ngôn ngữ. Thay vào đó, Odyssey huấn luyện các chính sách học tăng cường quy mô nhỏ. Câu hỏi thú vị mà sự kết hợp này đặt ra không phải là cái nào tốt hơn. Mà là tại sao phòng thí nghiệm ấy lại bỏ qua LLM.

Bảng giá, tính theo đơn vị quan trọng với đội xe

Grok 4.6 ra mắt vào ngày 12 tháng 8 năm 2026 với tư cách là dòng tiên phong của xAI: cửa sổ ngữ cảnh 500.000 token, đầu vào văn bản, hình ảnh và tệp, mức độ suy luận có thể cấu hình, gọi công cụ gốc, đầu ra có cấu trúc, và Chỉ số Trí tuệ Artificial Analysis là 44 trên index v4.3.2 — cùng chỉ số xếp GPT-5.6 Sol ở mức 47 và Kimi K3 ở mức 44. Artificial Analysis chấm điểm nó 94,9 trên GPQA Diamond, và đây là mô hình mà xAI liệt kê là "Latest" trong tài liệu dành cho nhà phát triển của chính mình. Nó được cung cấp dưới dạng một mô hình OpenAI Responses hạng nhất, đó chính là điểm thực tiễn: các framework agent áp dụng nó bằng cách thay đổi base URL, chứ không phải bằng việc viết một adapter.

Nhưng con số thú vị nằm ở việc ghép $2/$6 với cửa sổ ngữ cảnh. Vòng lặp agent tầm xa là những khối lượng công việc xấu xí — hàng chục nghìn token đầu ra công cụ tích lũy trên mỗi agent mỗi giờ, phần lớn trong đó là dư thừa. Mức giá đọc cache của Grok 4.6 là $0.50 mỗi triệu token, bằng một phần tư giá đầu vào, và chính điều đó khiến một lượt chạy nghìn agent trở nên hợp lý về mặt số học chứ không chỉ đơn thuần là khả thi. Lưu ý ranh giới bậc giá: các prompt trên 200K token bị tính phí gấp đôi mức cơ sở, nên một agent tích lũy lịch sử dài sẽ âm thầm nhân đôi chi phí của chính nó.

• Giá — Agora-2 không có giá công bố, chỉ xem trước trên trình duyệt so với Grok 4.6 $2.00/$6.00 mỗi 1M, $0.50 cho lượt đọc từ bộ nhớ đệm, gấp đôi khi đầu vào vượt 200K

• Ngữ cảnh — trạng thái chia sẻ Agora-2 cùng lịch sử có giới hạn theo từng chế độ xem so với 500.000 token của Grok 4.6

• Điểm độc lập — Agora-2 không công bố kết quả nào so với Grok 4.6 Chỉ số Trí tuệ AA 44 (v4.3.2)

• Suy luận — Agora-2 không áp dụng, không phải là mô hình ngôn ngữ so với Grok 4.6 có mức nỗ lực có thể cấu hình, khả năng gọi công cụ nguyên bản

• Truy cập — bản xem trước có thể chơi được Agora-2, không có API, không có trọng số so với API độc quyền của Grok 4.6

• Phần cứng — Agora-2 với bốn GPU RTX PRO 4500 cho bốn khung nhìn đồng thời, so với Grok 4.6, một endpoint được host

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Vì sao Odyssey không đặt một LLM vào đấu trường

Cách tắt rõ ràng, nếu bạn đang xây dựng một thế giới nơi mười sáu tác nhân AI chiến đấu với bốn con người, là nối một mô hình văn bản có năng lực vào bộ điều khiển và để nó chơi. Odyssey đã không làm vậy, và báo cáo kỹ thuật của nó nói rõ lý do trong bảng cấu hình. Chính sách tác nhân trong Agora-2 là một chính sách hồi quy vô hướng và không gian, sử dụng lịch sử gồm mười sáu quan sát, phát ra một hành động sau mỗi bốn tick mô phỏng trên mười bốn nhánh di chuyển rời rạc. Bản thân mô phỏng tiến triển trên cơ sở thời gian tick 30 Hz. Một mô hình được yêu cầu đưa ra quyết định ba mươi lần mỗi giây, từ một khung nhìn được quan sát một phần, với một tập hành động cấp thấp cố định, không phải là một bài toán suy luận — mà là một bài toán điều khiển, và các bài toán điều khiển được giải bằng cách huấn luyện một chính sách nhỏ, chứ không phải bằng cách gợi lệnh cho một mô hình tiên tiến có ngữ cảnh 500K.

Điều này đáng được nói rõ vì đây là hiểu lầm phổ biến nhất về danh mục mô hình thế giới. Agora-2 không cạnh tranh với Grok 4.6 cho cùng một vị trí trong một hệ thống. Nó chiếm vị trí bên dưới: môi trường mà chính sách được huấn luyện và đánh giá. Kiến trúc trong báo cáo nói rõ về sự phân tách này — một mô hình mô phỏng dự đoán cách các hành động kết hợp thay đổi trạng thái chia sẻ, một máy chủ thế giới áp dụng chúng, và một mô hình kết xuất theo từng góc nhìn tạo ra phối cảnh 640×480 của riêng mỗi người tham gia từ trạng thái đó. Không có mô hình văn bản nào xuất hiện ở bất kỳ đâu trong vòng lặp tương tác.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Nơi một mô hình như Grok 4.6 thực sự xuất hiện là ở một cấp độ cao hơn: với tư cách là thứ viết nên bộ khung đánh giá, phân tích các bản ghi, hoặc điều khiển tác nhân sử dụng công cụ mà bạn đang cố gắng nghiên cứu hành vi của nó. Đó chính xác là vai trò mà GPT-5.6 Sol đã đảm nhận trong cuộc điều tra của METR — khoảng 5% đội máy, và là chuyên gia phân tích đọc nhật ký — và đó là vai trò mà mức giá cùng cửa sổ ngữ cảnh của Grok 4.6 khiến nó trở nên rẻ.

Khoảng cách bằng chứng lớn hơn so với hầu hết những cuộc đối đầu này.

Điểm chỉ số của Grok 4.6 được đo lường độc lập, bảng giá của nó được công bố, và cửa sổ ngữ cảnh của nó được ghi lại. Các con số của Agora-2 đến từ một báo cáo do Team Odyssey chấp bút và không ai tái lập lại. Trên ba mươi clip giám sát, bộ kết xuất tiền tố có cấu trúc của nó đạt 30.11 dB PSNR so với 20.67 dB của mô hình VAE cơ sở — một so sánh mà chính báo cáo cảnh báo là giữa các hệ thống hoàn chỉnh với ngân sách huấn luyện không tương xứng, chứ không phải là một thử nghiệm kiến trúc độc lập. Phép đo chuẩn điều kiện của nó, cho thấy mức giảm 45.8% thời gian khử nhiễu so với cross-attention, sử dụng các bộ khử nhiễu được khởi tạo ngẫu nhiên trên đầu vào tổng hợp và đo chi phí thực thi, chứ không phải chất lượng hình ảnh.

Tiếp theo là phần hạn chế, vốn thẳng thắn một cách bất thường. 15 cập nhật tiềm ẩn và 30 khung hình hiển thị mỗi giây được nêu đều là các mục tiêu. Tốc độ khung hình duy trì và độ trễ từ đầu vào đến hiển thị trong tương tác trực tiếp đa tác nhân "chưa được đánh giá định lượng." Chất lượng hình ảnh tầm xa, sự nhất quán giữa các góc nhìn và mức độ tuân thủ hành động đầu-cuối đều được liệt kê là chưa được đánh giá. Môi trường đòi hỏi một game engine được trang bị công cụ đo với hình học tường minh và một từ vựng ngoại hình cố định, và việc chuyển giao sang tài nguyên, quy tắc hoặc môi trường mới vẫn chưa được kiểm chứng. Hãy đọc danh sách đó trước khi bạn đọc bất kỳ con số nổi bật nào về Agora-2.

Cái nào phù hợp với stack của bạn?

Nếu hôm nay bạn đang vận hành hoặc nghiên cứu các hệ đa tác nhân, Grok 4.6 chính là thành phần bạn thực sự có thể triển khai — một mô hình văn bản đẳng cấp tiên phong với mức giá khiến những đội tác nhân quy mô lớn trở nên khả thi về chi phí, đi kèm điểm số được công bố và bề mặt API được ghi chép đầy đủ. Trên OrcaRouter, mô hình này được cung cấp đúng theo giá niêm yết của chính xAI, không đội thêm chút nào, nên mức $2/$6 ở trên và mọi thay đổi giá trong tương lai sẽ đi thẳng vào hóa đơn của bạn ngay trong ngày chúng xảy ra, cùng với cơ chế chuyển đổi dự phòng tự động nếu điểm cuối chính bị suy giảm. Cả hai sự thật này đặc biệt quan trọng với khối lượng công việc dạng đội tác nhân: một nghìn tác nhân là một nghìn cơ hội gặp phải một nhà cung cấp đang suy giảm, và một khoản đội giá cộng thêm lên mức đầu ra $6 là khoản đội giá nhân với toàn bộ lần chạy của bạn.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 không phải là hạ tầng có thể triển khai và chúng tôi không lưu trữ nó — không có API, không có trọng số và không có giá, chỉ có bản xem trước có thể chơi được của chính Odyssey. Điều nó mang lại là một kiểu giá trị khác: một môi trường được kiểm soát cho nghiên cứu tương tác mà báo cáo METR cho thấy hiện đang cấp thiết, với chi phí là bốn GPU RTX PRO 4500 cho bốn chế độ xem đồng thời thay vì một hóa đơn API. Phán quyết trung thực là hai thứ này không cạnh tranh với nhau. Grok 4.6 là bộ não chính sách mà bạn có thể mua theo token ngay hôm nay; Agora-2 là một đề xuất về nơi để kiểm thử điều gì xảy ra khi hàng nghìn bộ não như vậy gặp nhau. Cái thứ hai là nghiên cứu thú vị hơn và là sản phẩm hoàn thiện ít hơn, và báo cáo của chính Odyssey rõ ràng một cách sảng khoái về việc những phần nào của nó vẫn còn là mục tiêu.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày