
Agora-2 เทียบกับ MiniMax M3: หนึ่ง GPU ต่อผู้เข้าร่วม หรือสิบสามผู้เข้าร่วมต่อ GPU
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
สองวิธีในการรันฝูงเอเจนต์ โดยคิดราคาเป็นสองสกุลเงินที่ต่างกัน MiniMax M3มีค่าใช้จ่าย $0.30 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $1.20 ต่อเอาต์พุตหนึ่งล้านโทเคน — อัตราที่ทำให้การทดลองกับเอเจนต์หนึ่งพันตัวกลายเป็นแค่รายการค่าใช้จ่ายบรรทัดเดียว มากกว่ารอบระดมทุน Agora-2 โมเดลโลกแบบหลายเอเจนต์ที่เปิดพรีวิวเมื่อวันที่ 21 กันยายน 2026 Odysseyมีค่าใช้จ่ายเป็น NVIDIA RTX PRO 4500 หนึ่งตัวต่อมุมมองของผู้เข้าร่วมหนึ่งราย: เซสชันสี่ผู้เล่นจะรันบน GPU สี่ตัว โดยมีการ์ดละหนึ่งโมเดลเรนเดอริงที่สร้างมุมมอง 640×480 ของผู้เล่นรายนั้น และหนึ่งในสี่การ์ดนั้นยังรับภาระการจำลองที่ใช้ร่วมกันและนโยบายเอเจนต์อัตโนมัติสิบหกตัวอีกด้วย ตัวเลขของ MiniMax M3 คิดต่อโทเคนและปรับตามปริมาณที่เอเจนต์ของคุณคิด ส่วนตัวเลขของ Agora-2 คิดต่อสายตาหนึ่งคู่และปรับตามจำนวนผู้เข้าร่วมพร้อมกันที่คุณใส่เข้าไปในโลก การเปรียบเทียบทั้งสองจึงเป็นการเปรียบเทียบงบประมาณด้านการให้เหตุผลกับงบประมาณด้านการเรนเดอริง และสำหรับใครก็ตามที่วางแผนจะทำการศึกษาระบบหลายเอเจนต์ในปี 2026 นั่นกลายเป็นสิ่งที่มีประโยชน์ที่ควรทำ
ด้านโทเคนของบัญชีแยกประเภท
MiniMax M3 เป็นโมเดลเรือธงแบบเปิดน้ำหนัก (open-weight) ของ MiniMax เปิดตัวเมื่อวันที่ 31 พฤษภาคม 2026 เป็น sparse mixture-of-experts ขนาด 428,000 ล้านพารามิเตอร์ โดยมีพารามิเตอร์ที่ใช้งานจริงประมาณ 23,000 ล้านตัวต่อโทเคน มีหน้าต่างบริบท 1,048,576 โทเคน ซึ่ง MiniMax รับประกันว่าใช้งานได้ 512K รองรับอินพุตข้อความ รูปภาพ และวิดีโอ และได้คะแนน 29 บน Artificial Analysis Intelligence Index v4.3.2 โดยรายงานว่าได้ 83.5 บน BrowseComp และ 76.1 บน BankerToolBench ในตัวเลขจากผู้พัฒนา — ตัวเลขของ MiniMax เอง ซึ่งไม่ได้ถูกทำซ้ำที่นี่ — และ Artificial Analysis วัดได้ 145 โทเคนเอาต์พุตต่อวินาที เป็นโมเดลที่เร็วเป็นอันดับสิบในบอร์ดนั้น
อย่างไรก็ตาม ตัวเลขที่relevantสำหรับฝูงเอเจนต์คืออัตราการอ่านแคช: $0.06 ต่อโทเคนที่แคชไว้หนึ่งล้านโทเคน ซึ่งเป็นหนึ่งในห้าของราคาอินพุต ลูปของเอเจนต์ขึ้นกับพรีฟิกซ์เป็นหลัก — พรอมป์ต์ระบบเดียวกัน สคีมาเครื่องมือเดียวกัน ประวัติที่สะสมเพิ่มขึ้นชุดเดียวกัน ซึ่งถูกส่งซ้ำทุกเทิร์น — ดังนั้นต้นทุนที่แท้จริงของลูปจึงใกล้เคียงกับ $0.06 มากกว่า $0.30 สำหรับโทเคนส่วนใหญ่ของมัน นั่นคือเลขคณิตที่ทำให้การรันเอเจนต์ 1,200 ตัว แบบที่ METR บันทึกไว้ในงานประเมิน ExploitGym ของ OpenAI เมื่อเดือนกรกฎาคม 2026 กลายเป็นสิ่งที่กลุ่มวิจัยสามารถทำซ้ำได้จริง ไม่ใช่แค่อ่านเกี่ยวกับมันเท่านั้น
ด้าน GPU ของบัญชี
ค่าใช้จ่ายของ Agora-2 ถูกเปิดเผยไว้ในส่วนเฉพาะของตัวเอง และเป็นรูปธรรมอย่างน่าสดชื่น โดยใช้ RTX PRO 4500 Server Edition หนึ่งตัวต่อหนึ่งมุมมอง และสี่ตัวสำหรับเซสชันผู้เล่นสี่คน รายงานยังระบุว่าการฝึกอบรมใช้ effective global batch ขนาด 128 บน B200 GPU จำนวน 32 ตัว
เมื่อแปลงเป็นหน่วยเดียวกับ MiniMax M3 นั่นคือ GPU ศูนย์ข้อมูลหนึ่งตัวต่อผู้เข้าร่วมพร้อมกันหนึ่งคน บวกกับการจำลองที่ใช้ร่วมกันซึ่งวิ่งอยู่บนหนึ่งในนั้น มันเป็นต้นทุนคงที่ที่ไม่สนใจว่าเอเจนต์ของคุณจะครุ่นคิดนานแค่ไหน และไม่ลดลงเมื่อพวกมันเงียบไป ผลที่ตามมาสองประการจึงเกิดขึ้น และมันชี้ไปในทิศทางตรงกันข้าม เมื่อจำนวนผู้เข้าร่วมต่ำและแต่ละเอเจนต์ใช้การให้เหตุผลหนัก โมเดลแบบโทเคนย่อมถูกกว่าอย่างเห็นได้ชัด — คุณจ่ายแค่ไม่กี่เซนต์สำหรับการคิด และไม่ต้องจ่ายอะไรเลยสำหรับเอเจนต์ตัวที่สองในห้อง เมื่อจำนวนผู้เข้าร่วมสูงและมีปฏิสัมพันธ์หนาแน่น การคำนวณกลับทิศ: ผู้เข้าร่วมพร้อมกัน 20 คนในโลกที่ใช้ร่วมกันคือ 20 GPU ซึ่งเป็นตัวเลขที่ไม่เพิ่มขึ้นตามจำนวนโทเคนที่แต่ละตัวใช้ไป
• หน่วยต้นทุน — Agora-2 ใช้ RTX 4500 หนึ่งตัวต่อการรับชมของผู้เข้าร่วมหนึ่งครั้ง เทียบกับ MiniMax M3 $0.30/$1.20 ต่อ 1M โทเคน
• การอ่านแคช — Agora-2 ใช้ไม่ได้ ไม่มีการคิดค่าบริการโทเคน เทียบกับ MiniMax M3 0.06 ดอลลาร์ต่อ 1 ล้านโทเคนที่แคชไว้
• คะแนนอิสระ — Agora-2 ยังไม่มีข้อมูลเผยแพร่ เทียบกับ MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• บริบท — สถานะที่ใช้ร่วมกันของ Agora-2 บวกกับประวัติต่อมุมมองแบบมีขอบเขต เทียบกับ MiniMax M3 1,048,576 โทเคน รับประกัน 512K
• เอาต์พุต — วิดีโอ Agora-2 640×480 ที่เป้าหมาย 30 fps เทียบกับข้อความ MiniMax M3
• การเข้าถึง — Agora-2 พรีวิวบนเบราว์เซอร์ ไม่มี API ไม่มีเวท เทียบกับ MiniMax M3 เวทเปิด สัญญาอนุญาตชุมชน API


ทำไมต้นทุนทั้งสองจึงไม่ใช่สิ่งทดแทนกัน
การตีความสิ่งนี้ว่าเป็นอย่างใดอย่างหนึ่งนั้นชวนให้ทำ แต่แท้จริงแล้วมันไม่ใช่เช่นนั้น MiniMax M3 คือสมองเชิงนโยบาย: มันอ่านสถานการณ์ที่สังเกตได้เพียงบางส่วน ให้เหตุผล เรียกใช้เครื่องมือ และส่งออกการกระทำ Agora-2 คือสภาพแวดล้อมที่การกระทำส่งผล consequences ที่ผู้เข้าร่วมคนอื่นมองเห็นได้ — โมเดลจำลองที่ทำนายว่าการกระทำที่รวมกันเปลี่ยนแปลงสถานะร่วมอย่างไร เซิร์ฟเวอร์โลกที่นำการกระทำเหล่านั้นไปใช้ และตัวเรนเดอร์แยกตามมุมมอง เพื่อให้ผู้เข้าร่วมแต่ละคนเห็นโลกเดียวกันจากมุมมองของตนเอง เอนทิตีอิสระสิบหกตัวของ Odyssey ไม่ได้ขับเคลื่อนด้วยโมเดลภาษาใด ๆ พวกมันคือนโยบายสเกลาร์และเชิงพื้นที่แบบเกิดซ้ำซึ่งฝึกด้วยการเรียนรู้แบบเสริมกำลัง รับประวัติการสังเกตสิบหกค่า และลงมือทุกสี่ติ๊กของการจำลอง ทางเลือกในการออกแบบนั้นคือสิ่งที่บอกใบ้ความจริง ที่อัตราสามสิบติ๊กต่อวินาที การตัดสินใจว่าจะทำอะไรคือปัญหาด้านการควบคุม และปัญหาด้านการควบคุมแก้ไขได้ด้วยการฝึกนโยบายขนาดเล็ก แทนที่จะเป็นการเรียก API
ดังนั้นการวางกรอบอย่างตรงไปตรงมาสำหรับทีมที่วางแผนงานแบบหลายเอเจนต์ก็คือ สิ่งเหล่านี้อยู่คนละชั้นกัน และคุณต้องมีงบประมาณสำหรับแต่ละชั้น ชั้นการให้เหตุผลนั้นถูกและยืดหยุ่น และคุณหาซื้อได้ ส่วนชั้นสภาพแวดล้อม หากคุณต้องการอะไรที่ไม่ใช่เกมเอนจิน ตอนนี้มันเป็นพรีวิวงานวิจัยที่มีฟุตพรินต์แบบ GPU และยังไม่มี API ที่เผยแพร่ ข้อเท็จจริงทั้งสองข้อใหม่พอ — M3 ตั้งแต่เดือนพฤษภาคม, Agora-2 ตั้งแต่เดือนกันยายน — จนแทบไม่มีใครมีโมเดลต้นทุนสำหรับการรวมกันนี้เลย
อะไรคือสิ่งที่ตรวจสอบแล้ว และอะไรคือเป้าหมาย
คะแนนอิสระ หน้าต่างบริบท โมดัลลิตี้ และราคาของ MiniMax M3 เป็นข้อเท็จจริงที่เผยแพร่และตรวจสอบได้ในวันนี้ ส่วนตัวเลข BrowseComp และ BankerToolBench ของโมเดลนี้เป็นข้อมูลที่ผู้ขายรายงานเอง จึงควรระบุกำกับไว้เช่นนั้นทุกครั้งที่คุณอ้างอิง
ตัวเลขของ Agora-2 มาจากรายงานทางเทคนิคของ Team Odyssey ทั้งหมด และยังไม่มีใครนอกบริษัททำซ้ำได้ ผลลัพธ์การเรนเดอร์ของมัน — PSNR 30.11 dB สำหรับตัวเรนเดอร์แบบ structured-prefix เทียบกับ 20.67 dB สำหรับ VAE baseline บนคลิปมอนิเตอร์ 30 คลิป — เป็นการเปรียบเทียบระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่ากัน ดังที่รายงานเองระบุ การลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention มาจาก denoiser ที่เริ่มต้นแบบสุ่มบนอินพุตสังเคราะห์ และเป็นการวัดต้นทุนการประมวลผลมากกว่าคุณภาพของภาพ และส่วนข้อจำกัดของมันระบุไว้ตรง ๆ ว่า อัตรา 15 อัปเดตต่อวินาทีและ 30 เฟรมต่อวินาทีเป็นเป้าหมาย; ว่าอัตราเฟรมที่รักษาได้ต่อเนื่องและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการโต้ตอบแบบหลายเอเจนต์แบบสด "ยังไม่ได้รับการประเมินเชิงปริมาณ"; ว่าคุณภาพภาพระยะยาว ความสอดคล้องข้ามมุมมอง และการปฏิบัติตามการกระทำแบบ end-to-end ยังคงไม่ได้รับการประเมิน; ว่าสภาพแวดล้อมจำเป็นต้องมีเอนจินที่ติดตั้งเครื่องมือวัดพร้อมเรขาคณิตที่ชัดเจนและคำศัพท์ด้านรูปลักษณ์ที่คงที่; และว่าการถ่ายโอนไปนอกโดเมนการฝึกยังไม่ได้รับการทดสอบ ใครก็ตามที่กำลังสร้างโมเดลต้นทุนโดยใช้ GPU หนึ่งตัวต่อหนึ่งมุมมอง ควรอ่านส่วนนั้นก่อน เพราะอัตราการประมวลผลต่อ GPU คือสิ่งที่ยังไม่ได้รับการวัดอย่างแท้จริง
การโทร
หากคุณกำลังสร้างฝูงเอเจนต์ — โมเดลจำนวนมาก ลูปยาว การเรียกใช้เครื่องมือ ไม่มีการเรนเดอร์ — MiniMax M3 เป็นวิธีที่ถูกที่สุดและน่าเชื่อถือในการทำเช่นนี้ในระดับสเกล และอัตราการอ่านแคชคือตัวเลขที่กำหนดค่าใช้จ่ายของคุณ มันถูกส่งผ่านบน OrcaRouter ในราคาตามรายการของ MiniMax เองโดยไม่มีมาร์กอัปดังนั้นอัตราแคช $0.06 คือสิ่งที่คุณจ่าย โดยมี การสลับสำรองข้ามผู้ให้บริการหากปลายทางเสื่อมสภาพระหว่างการทำงาน. สำหรับฝูงเอเจนต์โดยเฉพาะ การส่งผ่านราคามีความสำคัญมากกว่าปกติ: ส่วนต่างกำไรของผู้ขายต่อบนโทเค็นแคชคือส่วนต่างที่คูณด้วยทุกเทิร์นของเอเจนต์ทุกตัว.

Agora-2 ไม่ใช่สิ่งที่คุณจะกำหนดเส้นทางไปใช้งานได้ — ไม่มี API ไม่มีราคา และไม่มีเวตต์ มีเพียงพรีวิวบนเบราว์เซอร์ของ Odyssey เท่านั้น — และเราไม่ได้โฮสต์มัน สิ่งที่มันเป็นก็คือเครื่องจำลองโลกที่ใช้ร่วมกันตัวแรกที่สร้างขึ้นโดยเฉพาะเพื่อให้สามารถเฝ้าดูผู้เข้าร่วมจำนวนมาก ทั้งมนุษย์และสังเคราะห์ ปฏิสัมพันธ์กันภายใต้เงื่อนไขควบคุม และรายงานที่อยู่เบื้องหลังมันก็ตรงไปตรงมาอย่างผิดปกติเกี่ยวกับว่าปัจจุบันมันห่างไกลจากความเป็นผลิตภัณฑ์เพียงใด หากปัญหาของคุณคือการให้เหตุผลในปริมาณมาก MiniMax M3 มีให้ใช้แล้วและราคาถูก หากปัญหาของคุณคือสิ่งที่เกิดขึ้นเมื่อตัวให้เหตุผลเหล่านั้นหนึ่งพันตัวใช้โลกเดียวกัน Odyssey ได้สร้างสนามประลองไว้แล้ว และปล่อยการวัดที่ยากลำบากไว้ให้คนอื่นเป็นคนดำเนินการ
