สร้างการ์ดชื่อเรื่องสำหรับ Agora-2 กับ MiniMax M3 พร้อมคำบรรยายใต้ภาพว่า 'หนึ่ง GPU ต่อผู้เข้าร่วม หรือสิบสามเซนต์ต่อล้านโทเคน' การ์ดสามใบ: 'MiniMax M3: $0.30/$1.20 ต่อ 1M, $0.06 เมื่อแคช'; 'MiniMax M3: ดัชนี AA 29, คอนเท็กซ์ 1M, น้ำหนักแบบเปิด'; 'Agora-2: RTX PRO 4500 หนึ่งตัวต่อวิว, ไม่มีราคาที่เผยแพร่' ส่วนท้ายระบุ 'MiniMax M3 ตาม Artificial Analysis; Agora-2 เป็นข้อมูลจากผู้ขายและยังไม่ได้ทำซ้ำ'
Guides & Insights

Agora-2 เทียบกับ MiniMax M3: หนึ่ง GPU ต่อผู้เข้าร่วม หรือสิบสามผู้เข้าร่วมต่อ GPU

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สองวิธีในการรันฝูงเอเจนต์ โดยคิดราคาเป็นสองสกุลเงินที่ต่างกัน MiniMax M3มีค่าใช้จ่าย $0.30 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $1.20 ต่อเอาต์พุตหนึ่งล้านโทเคน — อัตราที่ทำให้การทดลองกับเอเจนต์หนึ่งพันตัวกลายเป็นแค่รายการค่าใช้จ่ายบรรทัดเดียว มากกว่ารอบระดมทุน Agora-2 โมเดลโลกแบบหลายเอเจนต์ที่เปิดพรีวิวเมื่อวันที่ 21 กันยายน 2026 Odysseyมีค่าใช้จ่ายเป็น NVIDIA RTX PRO 4500 หนึ่งตัวต่อมุมมองของผู้เข้าร่วมหนึ่งราย: เซสชันสี่ผู้เล่นจะรันบน GPU สี่ตัว โดยมีการ์ดละหนึ่งโมเดลเรนเดอริงที่สร้างมุมมอง 640×480 ของผู้เล่นรายนั้น และหนึ่งในสี่การ์ดนั้นยังรับภาระการจำลองที่ใช้ร่วมกันและนโยบายเอเจนต์อัตโนมัติสิบหกตัวอีกด้วย ตัวเลขของ MiniMax M3 คิดต่อโทเคนและปรับตามปริมาณที่เอเจนต์ของคุณคิด ส่วนตัวเลขของ Agora-2 คิดต่อสายตาหนึ่งคู่และปรับตามจำนวนผู้เข้าร่วมพร้อมกันที่คุณใส่เข้าไปในโลก การเปรียบเทียบทั้งสองจึงเป็นการเปรียบเทียบงบประมาณด้านการให้เหตุผลกับงบประมาณด้านการเรนเดอริง และสำหรับใครก็ตามที่วางแผนจะทำการศึกษาระบบหลายเอเจนต์ในปี 2026 นั่นกลายเป็นสิ่งที่มีประโยชน์ที่ควรทำ

ด้านโทเคนของบัญชีแยกประเภท

MiniMax M3 เป็นโมเดลเรือธงแบบเปิดน้ำหนัก (open-weight) ของ MiniMax เปิดตัวเมื่อวันที่ 31 พฤษภาคม 2026 เป็น sparse mixture-of-experts ขนาด 428,000 ล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ใช้งานจริงประมาณ 23,000 ล้านตัวต่อโทเคน มีหน้าต่างบริบท 1,048,576 โทเคน ซึ่ง MiniMax รับประกันว่าใช้งานได้ 512K รองรับอินพุตข้อความ รูปภาพ และวิดีโอ และได้คะแนน 29 บน Artificial Analysis Intelligence Index v4.3.2 โดยรายงานว่าได้ 83.5 บน BrowseComp และ 76.1 บน BankerToolBench ในตัวเลขจากผู้พัฒนา — ตัวเลขของ MiniMax เอง ซึ่งไม่ได้ถูกทำซ้ำที่นี่ — และ Artificial Analysis วัดได้ 145 โทเคนเอาต์พุตต่อวินาที เป็นโมเดลที่เร็วเป็นอันดับสิบในบอร์ดนั้น

อย่างไรก็ตาม ตัวเลขที่relevantสำหรับฝูงเอเจนต์คืออัตราการอ่านแคช: $0.06 ต่อโทเคนที่แคชไว้หนึ่งล้านโทเคน ซึ่งเป็นหนึ่งในห้าของราคาอินพุต ลูปของเอเจนต์ขึ้นกับพรีฟิกซ์เป็นหลัก — พรอมป์ต์ระบบเดียวกัน สคีมาเครื่องมือเดียวกัน ประวัติที่สะสมเพิ่มขึ้นชุดเดียวกัน ซึ่งถูกส่งซ้ำทุกเทิร์น — ดังนั้นต้นทุนที่แท้จริงของลูปจึงใกล้เคียงกับ $0.06 มากกว่า $0.30 สำหรับโทเคนส่วนใหญ่ของมัน นั่นคือเลขคณิตที่ทำให้การรันเอเจนต์ 1,200 ตัว แบบที่ METR บันทึกไว้ในงานประเมิน ExploitGym ของ OpenAI เมื่อเดือนกรกฎาคม 2026 กลายเป็นสิ่งที่กลุ่มวิจัยสามารถทำซ้ำได้จริง ไม่ใช่แค่อ่านเกี่ยวกับมันเท่านั้น

ด้าน GPU ของบัญชี

ค่าใช้จ่ายของ Agora-2 ถูกเปิดเผยไว้ในส่วนเฉพาะของตัวเอง และเป็นรูปธรรมอย่างน่าสดชื่น โดยใช้ RTX PRO 4500 Server Edition หนึ่งตัวต่อหนึ่งมุมมอง และสี่ตัวสำหรับเซสชันผู้เล่นสี่คน รายงานยังระบุว่าการฝึกอบรมใช้ effective global batch ขนาด 128 บน B200 GPU จำนวน 32 ตัว

เมื่อแปลงเป็นหน่วยเดียวกับ MiniMax M3 นั่นคือ GPU ศูนย์ข้อมูลหนึ่งตัวต่อผู้เข้าร่วมพร้อมกันหนึ่งคน บวกกับการจำลองที่ใช้ร่วมกันซึ่งวิ่งอยู่บนหนึ่งในนั้น มันเป็นต้นทุนคงที่ที่ไม่สนใจว่าเอเจนต์ของคุณจะครุ่นคิดนานแค่ไหน และไม่ลดลงเมื่อพวกมันเงียบไป ผลที่ตามมาสองประการจึงเกิดขึ้น และมันชี้ไปในทิศทางตรงกันข้าม เมื่อจำนวนผู้เข้าร่วมต่ำและแต่ละเอเจนต์ใช้การให้เหตุผลหนัก โมเดลแบบโทเคนย่อมถูกกว่าอย่างเห็นได้ชัด — คุณจ่ายแค่ไม่กี่เซนต์สำหรับการคิด และไม่ต้องจ่ายอะไรเลยสำหรับเอเจนต์ตัวที่สองในห้อง เมื่อจำนวนผู้เข้าร่วมสูงและมีปฏิสัมพันธ์หนาแน่น การคำนวณกลับทิศ: ผู้เข้าร่วมพร้อมกัน 20 คนในโลกที่ใช้ร่วมกันคือ 20 GPU ซึ่งเป็นตัวเลขที่ไม่เพิ่มขึ้นตามจำนวนโทเคนที่แต่ละตัวใช้ไป

• หน่วยต้นทุน — Agora-2 ใช้ RTX 4500 หนึ่งตัวต่อการรับชมของผู้เข้าร่วมหนึ่งครั้ง เทียบกับ MiniMax M3 $0.30/$1.20 ต่อ 1M โทเคน

• การอ่านแคช — Agora-2 ใช้ไม่ได้ ไม่มีการคิดค่าบริการโทเคน เทียบกับ MiniMax M3 0.06 ดอลลาร์ต่อ 1 ล้านโทเคนที่แคชไว้

• คะแนนอิสระ — Agora-2 ยังไม่มีข้อมูลเผยแพร่ เทียบกับ MiniMax M3 AA Intelligence Index 29 (v4.3.2)

• บริบท — สถานะที่ใช้ร่วมกันของ Agora-2 บวกกับประวัติต่อมุมมองแบบมีขอบเขต เทียบกับ MiniMax M3 1,048,576 โทเคน รับประกัน 512K

• เอาต์พุต — วิดีโอ Agora-2 640×480 ที่เป้าหมาย 30 fps เทียบกับข้อความ MiniMax M3

• การเข้าถึง — Agora-2 พรีวิวบนเบราว์เซอร์ ไม่มี API ไม่มีเวท เทียบกับ MiniMax M3 เวทเปิด สัญญาอนุญาตชุมชน API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

ทำไมต้นทุนทั้งสองจึงไม่ใช่สิ่งทดแทนกัน

การตีความสิ่งนี้ว่าเป็นอย่างใดอย่างหนึ่งนั้นชวนให้ทำ แต่แท้จริงแล้วมันไม่ใช่เช่นนั้น MiniMax M3 คือสมองเชิงนโยบาย: มันอ่านสถานการณ์ที่สังเกตได้เพียงบางส่วน ให้เหตุผล เรียกใช้เครื่องมือ และส่งออกการกระทำ Agora-2 คือสภาพแวดล้อมที่การกระทำส่งผล consequences ที่ผู้เข้าร่วมคนอื่นมองเห็นได้ — โมเดลจำลองที่ทำนายว่าการกระทำที่รวมกันเปลี่ยนแปลงสถานะร่วมอย่างไร เซิร์ฟเวอร์โลกที่นำการกระทำเหล่านั้นไปใช้ และตัวเรนเดอร์แยกตามมุมมอง เพื่อให้ผู้เข้าร่วมแต่ละคนเห็นโลกเดียวกันจากมุมมองของตนเอง เอนทิตีอิสระสิบหกตัวของ Odyssey ไม่ได้ขับเคลื่อนด้วยโมเดลภาษาใด ๆ พวกมันคือนโยบายสเกลาร์และเชิงพื้นที่แบบเกิดซ้ำซึ่งฝึกด้วยการเรียนรู้แบบเสริมกำลัง รับประวัติการสังเกตสิบหกค่า และลงมือทุกสี่ติ๊กของการจำลอง ทางเลือกในการออกแบบนั้นคือสิ่งที่บอกใบ้ความจริง ที่อัตราสามสิบติ๊กต่อวินาที การตัดสินใจว่าจะทำอะไรคือปัญหาด้านการควบคุม และปัญหาด้านการควบคุมแก้ไขได้ด้วยการฝึกนโยบายขนาดเล็ก แทนที่จะเป็นการเรียก API

ดังนั้นการวางกรอบอย่างตรงไปตรงมาสำหรับทีมที่วางแผนงานแบบหลายเอเจนต์ก็คือ สิ่งเหล่านี้อยู่คนละชั้นกัน และคุณต้องมีงบประมาณสำหรับแต่ละชั้น ชั้นการให้เหตุผลนั้นถูกและยืดหยุ่น และคุณหาซื้อได้ ส่วนชั้นสภาพแวดล้อม หากคุณต้องการอะไรที่ไม่ใช่เกมเอนจิน ตอนนี้มันเป็นพรีวิวงานวิจัยที่มีฟุตพรินต์แบบ GPU และยังไม่มี API ที่เผยแพร่ ข้อเท็จจริงทั้งสองข้อใหม่พอ — M3 ตั้งแต่เดือนพฤษภาคม, Agora-2 ตั้งแต่เดือนกันยายน — จนแทบไม่มีใครมีโมเดลต้นทุนสำหรับการรวมกันนี้เลย

อะไรคือสิ่งที่ตรวจสอบแล้ว และอะไรคือเป้าหมาย

คะแนนอิสระ หน้าต่างบริบท โมดัลลิตี้ และราคาของ MiniMax M3 เป็นข้อเท็จจริงที่เผยแพร่และตรวจสอบได้ในวันนี้ ส่วนตัวเลข BrowseComp และ BankerToolBench ของโมเดลนี้เป็นข้อมูลที่ผู้ขายรายงานเอง จึงควรระบุกำกับไว้เช่นนั้นทุกครั้งที่คุณอ้างอิง

ตัวเลขของ Agora-2 มาจากรายงานทางเทคนิคของ Team Odyssey ทั้งหมด และยังไม่มีใครนอกบริษัททำซ้ำได้ ผลลัพธ์การเรนเดอร์ของมัน — PSNR 30.11 dB สำหรับตัวเรนเดอร์แบบ structured-prefix เทียบกับ 20.67 dB สำหรับ VAE baseline บนคลิปมอนิเตอร์ 30 คลิป — เป็นการเปรียบเทียบระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่ากัน ดังที่รายงานเองระบุ การลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention มาจาก denoiser ที่เริ่มต้นแบบสุ่มบนอินพุตสังเคราะห์ และเป็นการวัดต้นทุนการประมวลผลมากกว่าคุณภาพของภาพ และส่วนข้อจำกัดของมันระบุไว้ตรง ๆ ว่า อัตรา 15 อัปเดตต่อวินาทีและ 30 เฟรมต่อวินาทีเป็นเป้าหมาย; ว่าอัตราเฟรมที่รักษาได้ต่อเนื่องและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการโต้ตอบแบบหลายเอเจนต์แบบสด "ยังไม่ได้รับการประเมินเชิงปริมาณ"; ว่าคุณภาพภาพระยะยาว ความสอดคล้องข้ามมุมมอง และการปฏิบัติตามการกระทำแบบ end-to-end ยังคงไม่ได้รับการประเมิน; ว่าสภาพแวดล้อมจำเป็นต้องมีเอนจินที่ติดตั้งเครื่องมือวัดพร้อมเรขาคณิตที่ชัดเจนและคำศัพท์ด้านรูปลักษณ์ที่คงที่; และว่าการถ่ายโอนไปนอกโดเมนการฝึกยังไม่ได้รับการทดสอบ ใครก็ตามที่กำลังสร้างโมเดลต้นทุนโดยใช้ GPU หนึ่งตัวต่อหนึ่งมุมมอง ควรอ่านส่วนนั้นก่อน เพราะอัตราการประมวลผลต่อ GPU คือสิ่งที่ยังไม่ได้รับการวัดอย่างแท้จริง

การโทร

หากคุณกำลังสร้างฝูงเอเจนต์ — โมเดลจำนวนมาก ลูปยาว การเรียกใช้เครื่องมือ ไม่มีการเรนเดอร์ — MiniMax M3 เป็นวิธีที่ถูกที่สุดและน่าเชื่อถือในการทำเช่นนี้ในระดับสเกล และอัตราการอ่านแคชคือตัวเลขที่กำหนดค่าใช้จ่ายของคุณ มันถูกส่งผ่านบน OrcaRouter ในราคาตามรายการของ MiniMax เองโดยไม่มีมาร์กอัปดังนั้นอัตราแคช $0.06 คือสิ่งที่คุณจ่าย โดยมี การสลับสำรองข้ามผู้ให้บริการหากปลายทางเสื่อมสภาพระหว่างการทำงาน. สำหรับฝูงเอเจนต์โดยเฉพาะ การส่งผ่านราคามีความสำคัญมากกว่าปกติ: ส่วนต่างกำไรของผู้ขายต่อบนโทเค็นแคชคือส่วนต่างที่คูณด้วยทุกเทิร์นของเอเจนต์ทุกตัว.

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2 ไม่ใช่สิ่งที่คุณจะกำหนดเส้นทางไปใช้งานได้ — ไม่มี API ไม่มีราคา และไม่มีเวตต์ มีเพียงพรีวิวบนเบราว์เซอร์ของ Odyssey เท่านั้น — และเราไม่ได้โฮสต์มัน สิ่งที่มันเป็นก็คือเครื่องจำลองโลกที่ใช้ร่วมกันตัวแรกที่สร้างขึ้นโดยเฉพาะเพื่อให้สามารถเฝ้าดูผู้เข้าร่วมจำนวนมาก ทั้งมนุษย์และสังเคราะห์ ปฏิสัมพันธ์กันภายใต้เงื่อนไขควบคุม และรายงานที่อยู่เบื้องหลังมันก็ตรงไปตรงมาอย่างผิดปกติเกี่ยวกับว่าปัจจุบันมันห่างไกลจากความเป็นผลิตภัณฑ์เพียงใด หากปัญหาของคุณคือการให้เหตุผลในปริมาณมาก MiniMax M3 มีให้ใช้แล้วและราคาถูก หากปัญหาของคุณคือสิ่งที่เกิดขึ้นเมื่อตัวให้เหตุผลเหล่านั้นหนึ่งพันตัวใช้โลกเดียวกัน Odyssey ได้สร้างสนามประลองไว้แล้ว และปล่อยการวัดที่ยากลำบากไว้ให้คนอื่นเป็นคนดำเนินการ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube