
Agora-2: โมเดลโลกที่เล่นได้ของ Odyssey รันผู้เข้าร่วม 20 คนบน GPU สี่ตัว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Agora-2 นำผู้เข้าร่วมยี่สิบคนมาอยู่ในสถานการณ์จำลองเดียว และเรียกมันว่าพรีวิวงานวิจัยที่เล่นได้ Odyssey เผยแพร่มันเมื่อวันที่ 21 กันยายน 2026 ในโพสต์ชื่อ "แนะนำ Agora-2: ก้าวหน้าสู่การจำลองโลกแบบหลายเอเจนต์" ซึ่งลงนามโดย Oliver Cameron และตัวเลขที่ถูกส่งต่อกันคือยี่สิบ ตัวเลขที่สำคัญคือการแบ่งสัดส่วนภายในนั้น หนึ่งเซสชันรองรับผู้ควบคุมที่เป็นมนุษย์พร้อมกันได้สูงสุดสี่คน ควบคู่กับเอนทิตีอิสระสิบหกตัว และสิ่งเหล่านี้ไม่ใช่ผู้เข้าร่วมประเภทเดียวกัน — คนสี่คนพิมพ์คำสั่งการเคลื่อนที่ ส่วนนโยบายสิบหกตัวเป็นผู้รันคำสั่งเหล่านั้น Odyssey ฝึกนโยบายเหล่านี้ด้วยตัวเอง บนด่านต่าง ๆ ของเกมที่它也ฝึกด้วยเช่นกัน: บทความระบุว่าโลกนี้เรียนรู้จากภาพบันทึกของ Diablo II
ความแตกต่างระหว่างผู้เข้าร่วมที่ถูกควบคุมกับผู้เข้าร่วมที่ถูกจำลอง คือจุดที่เรื่องน่าสนใจแทบทั้งหมดเกี่ยวกับ Agora-2 ดำรงอยู่ และยังเป็นจุดที่การรายงานข่าวส่วนใหญ่จะพร่ามัว เพราะ "ผู้เล่น 20 คน" เป็นประโยคที่สะอาดกว่าประโยค "ผู้เล่นสี่คนกับเอเจนต์ที่เรียนรู้แล้วสิบหกตัวซึ่งแบ่งปันสถานะที่คงอยู่ต่อไปแม้อยู่นอกจอ" สิ่งที่ Odyssey กำลังเปิดตัวไม่ใช่เครื่องสร้างวิดีโอที่เอาความสามารถผู้เล่นหลายคนมาต่อพ่วง มันใกล้เคียงกับเซิร์ฟเวอร์เกมที่ฟิสิกส์ แอนิเมชัน และการเรนเดอร์ถูกแทนที่ทั้งหมดด้วยองค์ประกอบที่เรียนรู้ได้ และมีแหล่งเนื้อหาจริงเพียงแหล่งเดียวคือชุดข้อมูลของการเล่นที่บันทึกไว้
ยี่สิบผู้เข้าร่วมคือคนสี่คนและนโยบายสิบหกข้อ
Odyssey ระบุไว้อย่างชัดเจนว่า Agora-2 รองรับผู้เข้าร่วมได้มากกว่า Agora-1 ถึงห้าเท่า และเปลี่ยนจากการจำลองสภาพแวดล้อมเดียวมาเป็นการจำลองหลายสภาพแวดล้อมที่มีพฤติกรรมในระยะยาวขึ้น โครงสร้างต่อเซสชันมีลักษณะดังนี้:
• ผู้ควบคุมที่เป็นมนุษย์ — สูงสุด 4 คนพร้อมกัน โดยแต่ละคนป้อนอินพุตการเคลื่อนไหวและการกระทำ
• เอนทิตีอัตโนมัติ — 16 ต่อเซสชัน ขับเคลื่อนด้วยนโยบายมอนสเตอร์และคู่หูที่เรียนรู้แล้ว แทนที่จะเป็นผู้เล่น
• ผู้เข้าร่วมทั้งหมด — 20 คนในสถานะโลกที่ใช้ร่วมกันเพียงหนึ่งเดียว ซึ่งเป็นตัวเลขที่ Odyssey ยกมาเป็นจุดนำเสนอหลัก
• สภาพแวดล้อม — หลายรายการ เพิ่มขึ้นจากสภาพแวดล้อมเดียวที่ Agora-1 สามารถจำลองได้
• พื้นฐานเนื้อหา — แคปเจอร์จาก Diablo II ดังนั้นโลก แอสเซ็ต และกฎทั้งหมดจึงสืบทอดมาจากคลังข้อมูลที่บันทึกไว้ชุดเดียว
• รูปแบบการเปิดตัว — พรีวิวงานวิจัยที่เล่นได้ ไม่ใช่ผลิตภัณฑ์ โดยไม่มีน้ำหนักโมเดล ไม่มีสัญญาอนุญาต และไม่มีราคา
สิบหกตัวที่ทำงานอัตโนมัติไม่ใช่ของประดับ รายงานของ Odyssey อธิบายถึงการฝึกนโยบายแยกสำหรับมอนสเตอร์และเพื่อนร่วมทาง และตัวเลขในการประเมินก็เจาะจง: ตัวอย่างนโยบายมอนสเตอร์ในระยะสุดท้ายจำนวน 23,771 ตัวอย่าง ซึ่งดึงมาจากครูฐานบวกกับข้อมูลการฟื้นตัวและการรักษา และ 128,005 ตัวอย่างสำหรับนโยบายเพื่อนร่วมทาง โดยให้คะแนนเทียบกับตอนการประเมิน 252 ตอนและกรณีการประเมิน 24 กรณีตามลำดับ นโยบายเหล่านี้คือสิ่งที่ทำให้เซสชันสำหรับสี่คนรู้สึกมีผู้คนอยู่เต็มไปหมด พวกมันยังเป็นเหตุผลที่จำนวนผู้เข้าร่วมเป็นทางเลือกด้านการออกแบบมากกว่าการอ้างขีดความสามารถ — สิบหกคือจำนวนเอเจนต์ที่เซิร์ฟเวอร์โลกถูกฝึกให้รองรับควบคู่ไปกับมนุษย์สี่คน ไม่ใช่จำนวนที่มันรองรับได้ในทางทฤษฎี
สถาปัตยกรรมนี้ประกอบด้วยโมเดลขนาดเล็กหนึ่งตัวและโมเดลขนาดใหญ่หนึ่งตัว
Agora-2 แยกสิ่งที่ตัดสินใจว่าเกิดอะไรขึ้นออกจากสิ่งที่ตัดสินใจว่ามันมีหน้าตาอย่างไร และช่องว่างด้านขนาดระหว่างทั้งสองคือตัวเลขที่สะดุดตาที่สุดในงานวิจัยนี้ โมเดลจำลองมีพารามิเตอร์ 4,457,777 ตัว — ประมาณ 4.46 ล้านตัว ลึกสี่ชั้น ความกว้าง 256 มีสี่หัว หน้าต่างประวัติย้อนหลังสี่ขั้น สาขาการเคลื่อนไหวสิบสี่สาขา และหัวแยกต่างหากสำหรับการหันหน้า ส่วนตัวเรนเดอร์เป็นทรานส์ฟอร์เมอร์แบบ flow-matching ที่มีพารามิเตอร์ประมาณหนึ่งพันล้านตัว สิบหกบล็อกที่ความกว้าง 2,048 โดยห้าบล็อกมี causal temporal attention และรันห้าขั้นของ solver ต่อการอัปเดตหนึ่งครั้ง
ตัวเรนเดอร์ถูกกำหนดเงื่อนไขด้วย 342 โทเคน {{1}}และ{{/1}} โลกดิบ:
• แผนที่ — 144 โทเคน ตารางไทล์ท้องถิ่นขนาด 12×12 รอบจุดมอง
• เอนทิตี — 36 โทเคน โดยสี่โทเคนสำหรับผู้เข้าร่วมที่ผู้ใช้ควบคุม และ 32 โทเคนสำหรับสล็อตเอนทิตีอื่น ๆ
• เอฟเฟกต์ชั่วคราว — 160 โทเค็นสำหรับเอฟเฟกต์ที่ไม่ใช่ทั้งแผนที่และเอนทิตี
• ดูและรายชื่อ — หนึ่งโทเคนสำหรับการทำงานของกล้อง และหนึ่งโทเคนสำหรับรายชื่อเซสชัน
• ต่อการอัปเดต — โทเคนภาพ 300 โทเคนที่ให้ความสนใจกับโทเคนกำหนดเงื่อนไข 342 โทเคนเหล่านั้น
โคเดก — เลเทนต์ที่อิง RAE ที่ 2 เฟรมให้เป็น 15×20×32 จากนั้นจึงใช้ x264 CRF 18 หรือ NVENC QP 18 ตอนส่งออก
Odyssey ระบุเหตุผลที่การกำหนดเงื่อนไขถูกจัดโครงสร้างแบบนี้: โลกที่เรียนรู้แล้วจำเป็นต้องเก็บคุณสมบัติของเอนทิตีไว้ในสถานะที่อยู่ยืนยาวกว่ากล้องตัวใดตัวหนึ่งโดยเฉพาะ โพสต์พูดตรงๆ ว่า — เนื่องจากคุณสมบัติของเอนทิตีถูกเก็บรักษาไว้โดยเป็นอิสระจากมุมมองใดๆ โดยเฉพาะ พวกมันจึงยังคงพร้อมใช้งานเมื่อเอนทิตีอยู่นอกเฟรม นั่นคือประโยคที่แยก Agora-2 ออกจากโมเดลวิดีโอ ตัวสร้างที่กำหนดเงื่อนไขจากเฉพาะเฟรมล่าสุดจะสูญเสียสัตว์ประหลาดไปในทันทีที่คุณหันไปจากมัน ส่วนโมเดลโลกที่เก็บสถานะอย่างชัดเจนจะไม่เป็นเช่นนั้น

GPU สี่ตัวซื้อผู้เล่นสี่คน
แผนการให้บริการในรายงานเป็นส่วนที่มีการเผยแพร่สู่สาธารณะน้อยที่สุดของ Agora-2 และมีประโยชน์ที่สุดสำหรับใครก็ตามที่ประเมินว่าค่าใช้จ่ายของโลกแบบนี้จะเป็นเท่าใด การกำหนดค่าของ Odyssey สำหรับเซสชันผู้เล่นสี่คนคือการ์ด NVIDIA RTX PRO 4500 สี่ใบ โดยมีตัวเรนเดอร์หนึ่งตัวต่อ GPU หนึ่งตัว และ GPU หนึ่งในนั้นยังโฮสต์โมเดลการจำลองและนโยบายของเอเจนต์ด้วย เป้าหมายที่ระบุไว้คือการอัปเดต latent 15 ครั้งต่อวินาที พร้อมด้วยเฟรมที่แสดงผล 30 เฟรมต่อวินาที
ตัวเลขสองตัวในภาคผนวกทำให้การกำหนดค่านั้นเป็นรูปธรรมชัดเจน ที่ 165 วัตต์ ทีมวัดได้ว่าการอนุมานลดลง 9.9% จากการเปลี่ยนแปลงตัวเรนเดอร์ — จาก 62.92 มิลลิวินาที ลดลงเหลือ 56.69 มิลลิวินาที ในการเรียก 3,200 ครั้งต่อการอิมพลีเมนต์หนึ่งครั้ง และการฝึกของเรนเดอร์เรอร์ก็เจาะจงไม่แพ้กัน: การอัปเดต 60,000 ครั้งบน 4,232,000 เซกเมนต์ ตามด้วยอีก 60,000 ครั้งบน 4,332,800 เซกเมนต์, AdamW ที่อัตราการเรียนรู้ 1e-4, แบตช์ 128, EMA 0.9999, รันบน B200 GPU จำนวน 32 ตัว คลังข้อมูลนั้นถูกแจกแจงเป็นรายการ — เซกเมนต์การต่อสู้แบบจัดรายชื่อเต็ม 1,200,000 เซกเมนต์, เซกเมนต์ความสามารถพิเศษแบบแบ่งชั้น 2,016,000 เซกเมนต์, เซกเมนต์การเคลื่อนที่ผ่านซากศพ 504,000 เซกเมนต์, เซกเมนต์การเคลื่อนไหวที่ไม่มีเอนทิตีอัตโนมัติ 512,000 เซกเมนต์ และเซกเมนต์วงจรชีวิตของพอร์ทัลบอส 100,800 เซกเมนต์
อ่านสองย่อหน้านั้นควบคู่กัน แล้วรูปทรงของผลิตภัณฑ์ก็ชัดเจน ตัวเรนเดอร์คือครึ่งที่แพงกว่า โดยในแง่พารามิเตอร์ต่างกันถึงสามอันดับขนาด ในการให้บริการใช้ GPU หนึ่งตัวต่อผู้ชมที่รับชมพร้อมกันหนึ่งราย และใช้ B200s สามสิบสองตัวในการเทรน โมเดลจำลอง — ส่วนที่ตัดสินใจจริง ๆ ว่าเกิดอะไรขึ้นในโลก — มีพารามิเตอร์สี่ล้านห้าแสนตัว ซึ่งเล็กกว่าตาราง embedding ส่วนใหญ่ Agora-2 เป็นปัญหาการเรนเดอร์ที่สวมชุดเกมเอนจิน
ตัวเลขที่เผยแพร่ และสิ่งหนึ่งที่พวกมันไม่ได้แสดงให้เห็น
ผลลัพธ์เชิงปริมาณของรายงานฉบับนี้ หากมองตามกรอบของ Odyssey เองแล้ว ถือเป็นการทดสอบแบบ ablation ต่อการเลือกการออกแบบของตัวเอง มากกว่าที่จะเป็นคะแนน benchmark เชิงการแข่งขัน และควรอ่านในมุมนั้น:
• คำนำหน้าแบบมีโครงสร้าง เทียบกับ VAE baseline — ค่าคลาดเคลื่อนกำลังสองเฉลี่ย 0.001279 และ PSNR 30.11 dB เทียบกับ 0.010272 และ 20.67 dB, เพิ่มขึ้น 9.44 dB, มากกว่า 90 คู่จาก 30 คลิปและ 3 ซีด
• Renderer attention — 20.09 มิลลิวินาทีต่อการอัปเดตดีนอยเซอร์แบบสองเฟรมด้วย structured prefix เทียบกับ 37.06 ด้วย cross-attention และ 18.82 ด้วย pooled AdaLN ซึ่งลดลง 45.8% สำหรับดีนอยเซอร์ และ 34.1% สำหรับแกนหลัก
• การดรอปเอาต์ประวัติที่ 50% — ข้อผิดพลาดแบบสตรีมมิง 0.05695 และคอลด์สตาร์ท 0.19535 เทียบกับ 0.06041 และ 0.21082 เมื่อไม่มีการดรอปเอาต์ โดยความเที่ยงตรงของ map-perturbation แย่ลงเล็กน้อย
• ความแม่นยำของการจำลอง — 85.17% ในการทำนายสาขาการเคลื่อนไหว, 68.17% ในชุดย่อยตัวอย่างแบบถูกบล็อกที่ยากกว่า และ 95.84% ในโหมดแอนิเมชัน โดยมีการสลับโหมดที่ทำนายไว้ที่ 7.49% เทียบกับ 3.54% ที่บันทึกไว้
ตัวเลขทุกตัวเหล่านั้นวัดเทียบกับการกำหนดค่าอื่นของ Agora-2 ไม่มีตัวใดเป็นการเปรียบเทียบกับระบบที่วางจำหน่ายแล้ว และไม่มีตัวใดอธิบายการเล่นแบบสด หมวดที่ 8 ของรายงานเปิดเผยตรงไปตรงมาเกี่ยวกับช่องว่างนี้ การถ่ายโอนไปยังแอสเซต กฎ หรือสภาพแวดล้อมใหม่ยังไม่ผ่านการทดสอบ ข้อผิดพลาดสะสม ภาพที่สร้างขึ้นอย่างอิสระยังอาจขัดแย้งกันในด้านรูปลักษณ์ การมองเห็น หรือจังหวะเวลาเหตุการณ์ และประโยคที่ควรยกมาทั้งหมด: อัตราเฟรมที่ต่อเนื่องและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการโต้ตอบแบบสดของหลายเอเจนต์ยังไม่ได้รับการประเมินเชิงปริมาณ 15 การอัปเดตต่อวินาทีและ 30 เฟรมต่อวินาทีข้างต้นเป็นเป้าหมาย ไม่ใช่ผลการวัด

ตำแหน่งที่ตัวอย่างอยู่ และสิ่งที่ไม่รวมอยู่
ตัวอย่างที่เล่นได้อยู่ที่เว็บไซต์ของ Odyssey เอง เข้าถึงผ่านที่อยู่เดโม agora.odyssey.ml ซึ่งเปลี่ยนเส้นทางไปยัง agora.odyssey.systems รายงานทางเทคนิคคือไฟล์ PDF ที่ลิงก์จากประกาศเดียวกัน สิ่งที่ไม่ได้เผยแพร่ก็มีความสำคัญพอๆ กับสิ่งที่เผยแพร่: ไม่มีน้ำหนักโมเดล ไม่มีรีพอซิทอรี ไม่มีสัญญาอนุญาต ไม่มี API สำหรับการอนุมาน และไม่มีราคา Odyssey อธิบายการเปิดตัวนี้ว่าเป็นตัวอย่างสำหรับการวิจัย และมองว่าเส้นทางสู่อันตรกิริยาระหว่างหลายเอเจนต์ภายในโมเดลโลกพื้นฐานของบริษัทเป็นงานในอนาคต โดยมี PROWL ระบุไว้เป็นสายวิจัยที่กำลังขยาย และ Odyssey-3 ถูกระบุชื่อเป็นจุดหมายปลายทางในที่สุด
เรื่องนี้สำคัญสำหรับใครก็ตามที่วางแผนจะสร้างบน Agora-2 เพราะคำตอบที่ใช้ได้จริงในตอนนี้คือคุณทำไม่ได้ — ไม่ว่าจะผ่านเรา หรือผ่าน endpoint ที่โฮสต์โดยใครก็ตาม OrcaRouter ไม่ให้บริการ Agora-2, Agora-1 หรือ Odyssey-3 เส้นทางโมเดลเหล่านั้นไม่มีอยู่ในแค็ตตาล็อกของเรา สิ่งที่แพลตฟอร์มของเรามีให้คือส่วนอื่น ๆ ของการสร้างที่อาจอยู่รอบ ๆ โลกที่เรียนรู้มา: endpoint เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ โดยคิดราคาตามอัตราที่ผู้ให้บริการแต่ละรายกำหนดแบบไม่บวกเพิ่ม ดังนั้นเมื่อผู้ให้บริการรายใดลดราคา การเปลี่ยนแปลงจะมีผลที่นี่ในวันเดียวกัน และชั้นการจัดเส้นทางที่จะสลับคำขอไปยังเส้นทางอื่นโดยอัตโนมัติเมื่อผู้ให้บริการมีปัญหา หากคุณต้องใช้โมเดลเพื่อสร้างเลย์เอาต์ด่าน เขียนโค้ดนโยบาย หรือใส่คำบรรยายให้กับการเล่นที่บันทึกไว้ นั่นคือส่วนที่เราช่วยได้จริง
ดูอะไรดี
Agora-2 เป็นผลลัพธ์จริงที่มีข้อแม้จริง และสองสิ่งนี้ก็ทำให้สับสนกันได้ง่าย ผลลัพธ์ก็คือ โลกที่ใช้ร่วมกัน คงอยู่ถาวร และมีหลายสภาพแวดล้อม สามารถจำลองและเรนเดอร์ให้ผู้เข้าร่วมยี่สิบคนได้ โดยอาศัยคลังข้อมูลการเล่นที่บันทึกไว้ และ Odyssey สามารถชี้ไปที่การตัดสินใจเชิงออกแบบที่เฉพาะเจาะจง — สถานะที่ชัดแจ้ง (explicit state) คำนำการปรับเงื่อนไขแบบมีโครงสร้าง (structured conditioning prefix) และแบบจำลองการจำลองขนาดจิ๋ว — ซึ่งทำให้มันทำงานได้ ส่วนข้อแม้ก็คือ หมวดที่ 8 ของตัวบทความเองได้ระบุว่า latency สด อัตราเฟรมที่ต่อเนื่อง การถ่ายโอนข้ามสภาพแวดล้อม และการสะสมข้อผิดพลาด ยังไม่ได้ถูกประเมิน จนกว่าจะมีใครเผยแพร่บันทึกอัตราเฟรมจากการเล่นจริงของผู้เล่นสี่คน สรุปที่ซื่อตรงก็คือ Agora-2 พิสูจน์สถาปัตยกรรมได้ และปล่อยให้ประสบการณ์ยังไม่ถูกวัด
สิ่งที่สองที่ต้องจับตาคือทิศทางที่กำลังเป็นไป การวางกรอบของ Odyssey เองวางให้ Agora-2 เป็นก้าวหนึ่งบนเส้นทางสู่การนำปฏิสัมพันธ์แบบหลายเอเจนต์เข้าไปไว้ในเวิลด์โมเดลพื้นฐาน โดยมี PROWL เป็นการขยายด้านวิจัย และ Odyssey-3 เป็นเป้าหมายที่ระบุชื่อไว้ หากสิ่งนั้นเกิดขึ้น คำถามที่น่าสนใจก็จะไม่ใช่ต่อไปว่าเวิลด์โมเดลหนึ่งรองรับผู้เข้าร่วมยี่สิบคนได้หรือไม่ แต่จะกลายเป็นว่าเวิลด์โมเดลหนึ่งพาพวกเขาเข้าไปในโลกที่มันไม่เคยถูกฝึกมาก่อนได้หรือไม่ — ซึ่งนั่นก็คือคำถามเรื่องการถ่ายโอนที่รายงานฉบับปัจจุบันเลือกที่จะไม่ตอบ

