
Agora-2 vs MiniMax M3: Một GPU cho mỗi người tham gia, hay mười ba xu mỗi triệu token
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 36 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 181 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Hai cách để vận hành một đám đông tác nhân, được định giá bằng hai loại tiền tệ khác nhau. MiniMax M3 có giá 0,30 đô la cho mỗi triệu token đầu vào và 1,20 đô la cho mỗi triệu token đầu ra — một mức giá biến một thử nghiệm với một nghìn tác nhân thành một khoản mục chi phí thay vì một vòng gọi vốn. Agora-2, mô hình thế giới đa tác nhân mà Odyssey đã giới thiệu trước vào ngày 21 tháng 9 năm 2026, có giá một NVIDIA RTX PRO 4500 cho mỗi góc nhìn người tham gia: một phiên bốn người chạy trên bốn GPU, với một mô hình kết xuất trên mỗi thẻ tạo ra góc nhìn 640×480 của người chơi đó, và một trong bốn thẻ đó cũng đảm nhiệm mô phỏng dùng chung cùng mười sáu chính sách tác nhân tự chủ. Con số của MiniMax M3 tính theo token và tỷ lệ thuận với việc các tác nhân của bạn suy nghĩ nhiều đến đâu. Con số của Agora-2 tính theo mỗi người xem và tỷ lệ thuận với số lượng người tham gia đồng thời mà bạn đưa vào thế giới. So sánh chúng là so sánh ngân sách suy luận với ngân sách kết xuất, và với bất kỳ ai đang lên kế hoạch cho một nghiên cứu đa tác nhân vào năm 2026, hóa ra đó lại là việc hữu ích nên làm.
Phía token của sổ cái
MiniMax M3 là mô hình chủ lực trọng số mở của MiniMax, ra mắt ngày 31 tháng 5 năm 2026: một mô hình mixture-of-experts thưa với 428 tỷ tham số, khoảng 23 tỷ tham số hoạt động trên mỗi token, cửa sổ ngữ cảnh 1.048.576 token trong đó MiniMax đảm bảo 512K dùng được, đầu vào văn bản, hình ảnh và video, cùng điểm 29 trên Artificial Analysis Intelligence Index v4.3.2. Mô hình báo cáo 83,5 trên BrowseComp và 76,1 trên BankerToolBench theo số liệu của nhà cung cấp — con số của chính MiniMax, chưa được tái lập ở đây — và Artificial Analysis đo được 145 token đầu ra mỗi giây, mô hình nhanh thứ mười trên bảng xếp hạng đó.
Tuy nhiên, con số liên quan đối với các đội tác nhân là mức giá đọc bộ nhớ đệm: 0,06 đô la cho mỗi triệu token được lưu trong bộ nhớ đệm, bằng một phần năm giá đầu vào. Các vòng lặp tác nhân bị chi phối bởi tiền tố — cùng một lời nhắc hệ thống, cùng các lược đồ công cụ, cùng lịch sử tích lũy, được gửi lại mỗi lượt — vì vậy chi phí hiệu dụng của một vòng lặp gần với 0,06 đô la hơn nhiều so với 0,30 đô la đối với phần lớn token của nó. Đó là phép tính khiến một lần chạy 1.200 tác nhân, thuộc loại mà METR đã ghi nhận trong đánh giá ExploitGym tháng 7 năm 2026 của OpenAI, trở thành thứ mà một nhóm nghiên cứu thực sự có thể tái tạo chứ không chỉ đọc về nó.
Phía GPU của sổ cái
Cấu trúc chi phí của Agora-2 được công bố trong phụ lục triển khai của chính nó, và nó cụ thể một cách đáng mừng. Một RTX PRO 4500 Blackwell Server Edition cho mỗi khung nhìn. Bốn chiếc cho một phiên bốn người chơi. Những card đó tạo ra khung nhìn của từng người tham gia ở mục tiêu mười lăm cập nhật tiềm ẩn và ba mươi khung hình hiển thị mỗi giây ở 640×480, và mô phỏng tiến triển theo nhịp 30 Hz. Báo cáo cũng đưa ra quy mô huấn luyện cho công việc xung quanh: một batch toàn cục hiệu dụng là 128 trên 32 GPU B200.
Quy đổi sang cùng đơn vị như MiniMax M3, tức là một GPU trung tâm dữ liệu cho mỗi người tham gia đồng thời, cộng thêm mô phỏng dùng chung chạy kèm trên một trong số đó. Đây là chi phí cố định, không quan tâm các tác nhân của bạn cân nhắc trong bao lâu và không giảm khi chúng im lặng. Hai hệ quả kéo theo, và chúng chỉ về hai hướng trái ngược nhau. Khi số người tham gia thấp với suy luận nặng cho mỗi tác nhân, mô hình token rõ ràng rẻ hơn — bạn chỉ trả vài xu cho việc suy nghĩ và không tốn gì cho tác nhân thứ hai trong phòng. Khi số người tham gia cao với tương tác dày đặc, phép tính đảo ngược: hai mươi người tham gia đồng thời trong một thế giới dùng chung là hai mươi GPU, con số không tăng theo số token mà mỗi người chi ra.
• Đơn vị chi phí — Agora-2 một RTX PRO 4500 cho mỗi lượt xem của người tham gia so với MiniMax M3 $0.30/$1.20 mỗi 1 triệu token
• Đọc cache — Agora-2 không áp dụng, không tính phí token so với MiniMax M3 $0.06 mỗi 1M được cache
• Điểm số độc lập — Agora-2 không công bố so với MiniMax M3 AA Intelligence Index 29 (v4.3.2)
Ngữ cảnh — trạng thái dùng chung của Agora-2 cùng lịch sử có giới hạn theo từng khung nhìn so với MiniMax M3 1.048.576 token, 512K được đảm bảo
• Đầu ra — video Agora-2 640×480 ở mức mục tiêu 30 fps so với văn bản MiniMax M3
• Truy cập — bản xem trước trên trình duyệt Agora-2, không API, không trọng số so với MiniMax M3 trọng số mở, giấy phép cộng đồng, API


Tại sao hai chi phí này không thể thay thế cho nhau
Việc đọc điều này như một lựa chọn "hoặc cái này hoặc cái kia" là điều dễ mắc phải, nhưng nó không phải là như vậy. MiniMax M3 là một bộ não chính sách: nó đọc một tình huống được quan sát một phần, suy luận, gọi các công cụ và phát ra một hành động. Agora-2 là một môi trường trong đó các hành động có hệ quả mà những người tham gia khác có thể thấy — một mô hình mô phỏng dự đoán cách các hành động kết hợp làm thay đổi trạng thái chung, một máy chủ thế giới thi hành chúng, và các bộ kết xuất theo từng góc nhìn để mỗi người tham gia nhìn thấy cùng một thế giới từ góc nhìn của riêng mình. Mười sáu thực thể tự trị của Odyssey không được điều khiển bởi bất kỳ mô hình ngôn ngữ nào; chúng là các chính sách vô hướng và không gian dạng hồi quy được huấn luyện bằng học tăng cường, tiêu thụ một lịch sử gồm mười sáu quan sát và hành động mỗi bốn nhịp mô phỏng. Lựa chọn thiết kế đó chính là dấu hiệu nhận biết. Với tốc độ ba mươi nhịp một giây, việc quyết định làm gì là một bài toán điều khiển, và các bài toán điều khiển được giải quyết bằng cách huấn luyện một chính sách nhỏ thay vì gọi một API.
Vậy nên cách diễn đạt trung thực cho một nhóm đang lên kế hoạch cho công việc đa tác nhân là những thứ này nằm ở các tầng khác nhau và bạn cần ngân sách cho từng tầng. Tầng suy luận thì rẻ và co giãn, và bạn có thể chọn mua. Tầng môi trường, nếu bạn muốn thứ gì đó không phải game engine, hiện là bản xem trước nghiên cứu với dấu chân kiểu GPU và không có API nào được công bố. Cả hai sự kiện đều đủ mới — M3 từ tháng 5, Agora-2 từ tháng 9 — đến mức gần như chưa ai có mô hình chi phí cho sự kết hợp này.
Cái gì được xác minh và cái gì là mục tiêu
Điểm số độc lập, cửa sổ ngữ cảnh, các phương thức và giá của MiniMax M3 là những dữ kiện đã công bố, có thể kiểm chứng ngay hôm nay. Các số liệu BrowseComp và BankerToolBench của nó là do nhà cung cấp báo cáo và nên được ghi nhãn như vậy mỗi khi bạn trích dẫn chúng.
Các con số của Agora-2 hoàn toàn đến từ báo cáo kỹ thuật của Team Odyssey và chưa được bất kỳ ai bên ngoài công ty tái lập. Kết quả kết xuất của nó — 30.11 dB PSNR đối với bộ kết xuất tiền tố có cấu trúc so với 20.67 dB đối với đường cơ sở VAE trên ba mươi clip giám sát — là sự so sánh giữa các hệ thống hoàn chỉnh với ngân sách huấn luyện không tương xứng, như chính báo cáo đã lưu ý. Mức giảm 45.8% thời gian denoiser so với cross-attention của nó đến từ các denoiser được khởi tạo ngẫu nhiên trên đầu vào tổng hợp và đo chi phí thực thi chứ không phải chất lượng hình ảnh. Và phần hạn chế của nó nói rõ rằng tốc độ mười lăm lần cập nhật mỗi giây và ba mươi khung hình mỗi giây chỉ là mục tiêu; rằng tốc độ khung hình duy trì và độ trễ từ đầu vào đến hiển thị trong tương tác trực tiếp đa tác nhân “chưa được đánh giá định lượng”; rằng chất lượng hình ảnh tầm xa, sự nhất quán giữa các góc nhìn và mức độ tuân thủ hành động đầu-cuối vẫn chưa được đánh giá; rằng môi trường cần một engine được trang bị đo lường với hình học tường minh và một từ vựng ngoại hình cố định; và rằng khả năng chuyển giao ra ngoài miền huấn luyện chưa được kiểm chứng. Bất kỳ ai xây dựng mô hình chi phí trên một GPU cho mỗi góc nhìn nên đọc phần đó trước, bởi vì thông lượng trên mỗi GPU chính xác là thứ chưa được đo lường.
Cuộc gọi
Nếu bạn đang xây dựng các đội tác nhân — nhiều mô hình, vòng lặp dài, gọi công cụ, không cần render — thì MiniMax M3 là cách rẻ nhất đáng tin cậy để làm điều đó ở quy mô lớn, và mức giá đọc bộ nhớ đệm là con số quyết định hóa đơn của bạn. Nó được định tuyến trên OrcaRouter theo đúng giá niêm yết của chính MiniMax mà không tăng giá, vì vậy mức giá $0.06 cho bộ nhớ đệm là mức bạn phải trả, với khả năng chuyển đổi dự phòng giữa các nhà cung cấp nếu một endpoint suy giảm giữa chừng khi chạy. Đối với các đội tác nhân cụ thể, việc chuyển thẳng chi phí quan trọng hơn bình thường: biên lợi nhuận của nhà bán lại trên token được lưu trong bộ nhớ đệm sẽ được nhân lên theo từng lượt của từng tác nhân.

Agora-2 không phải là thứ bạn có thể định tuyến tới — không có API, không có giá và không có trọng số, chỉ có bản xem trước trên trình duyệt của Odyssey — và chúng tôi không lưu trữ nó. Nó chính là trình mô phỏng thế giới chia sẻ đầu tiên được xây dựng riêng để nhiều người tham gia, cả con người lẫn tổng hợp, có thể được quan sát khi tương tác trong những điều kiện có kiểm soát, và báo cáo bên dưới nó thẳng thắn một cách bất thường về việc hiện tại nó còn cách một sản phẩm bao xa. Nếu vấn đề của bạn là suy luận ở quy mô lớn, MiniMax M3 hiện đã có sẵn và rẻ. Nếu vấn đề của bạn là điều gì xảy ra khi một nghìn bộ suy luận như vậy cùng chia sẻ một thế giới, Odyssey đã xây đấu trường và để phần đo lường khó nhằn lại cho người khác chạy.
