
Agora-2 กับ Kimi K3: ผู้เข้าร่วมยี่สิบคนในโลกที่ใช้ร่วมกัน และโมเดล 1M-Token ที่รับบทหนึ่งบทบาทในนั้น
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
ถ้าตัดเกณฑ์วัดประสิทธิภาพออกไป จะเหลือความไม่สมดุลอยู่หนึ่งอย่างที่ชี้ขาดการเปรียบเทียบนี้ Odysseyเปิดตัว Agora-2 เมื่อวันที่ 21 กันยายน 2026 — โมเดลโลกแบบหลายเอเจนต์ที่เล่นได้ ซึ่งสร้างสภาพแวดล้อมแบบโต้ตอบที่ใช้ร่วมกันให้กับมนุษย์และเอเจนต์ AI ได้สูงสุด 20 รายแบบเรียลไทม์ ที่ความละเอียด 640×480 จากแบบจำลองที่เรียนรู้มา บวกกับตัวเรนเดอร์แบบแยกตามมุมมอง Kimi K3 จาก Moonshot AI เป็นโมเดลน้ำหนักเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ มีหน้าต่างบริบท 1,048,576 โทเคน และได้คะแนน 44 บน Artificial Analysis Intelligence Index เปิดตัวเมื่อวันที่ 15 กรกฎาคม และดาวน์โหลดได้ตั้งแต่วันที่ 27 กรกฎาคม ทั้งคู่เป็นแบบเปิดในความหมายที่สำคัญต่อทีมวิจัย — น้ำหนักของ Kimi K3 อยู่บน Hugging Face ภายใต้สัญญาอนุญาต MIT ฉบับดัดแปลง และรายงานทางเทคนิคของ Agora-2 ก็เผยแพร่ฉบับเต็ม — และทั้งคู่ก็ไม่ใช่แบบเปิดในความหมายที่สำคัญต่อผู้ซื้อ: Agora-2 ไม่มีน้ำหนัก ไม่มี API และไม่มีราคา ส่วนสัญญาอนุญาตของ Kimi K3 มีข้อจำกัดในเชิงพาณิชย์ คำถามที่มีประโยชน์ไม่ใช่ว่าตัวไหนฉลาดกว่า แต่คือตัวไหนในสองตัวนี้ที่สามารถเป็นส่วนหนึ่งของระบบหลายเอเจนต์ได้ภายในไตรมาสนี้
อะไรที่ดาวน์โหลดได้จริง และสิ่งนั้นให้อะไรกับคุณ
Kimi K3 เป็นโมเดลที่ยึดแนวทางเดิมมากกว่าอย่างชัดเจน เป็น MoE ขนาด 2.8T พารามิเตอร์ มีบริบทหนึ่งล้านโทเคน รับอินพุตทั้งข้อความและรูปภาพ มีตัวควบคุมระดับความพยายามในการให้เหตุผลระดับบนสุดแทนที่พารามิเตอร์การสุ่ม มีการเรียกใช้เครื่องมือแบบเนทีฟ และมีอินเทอร์เฟซที่เข้ากันได้กับ OpenAI ราคาอยู่ที่ $3.00/$15.00 ต่อล้านโทเคน โดยมีอัตราการอ่านแคช $0.30 และทำคะแนนได้ 44 บน index v4.3.2 — เป็นอันดับสามในบรรดาโมเดล open-weights บนบอร์ดนั้น ตามหลัง 46 ของ MiMo-V2.6-Pro และ 45 ของ GLM-5.3 บนบอร์ดเดียวกันนี้ยังได้คะแนน 85.0 ใน terminal-bench 2.1 และ 59.5 ใน SciCode หากระบบ multi-agent ของคุณต้องการสมองให้แต่ละเอเจนต์ นี่คือสมองที่คุณเช่าได้ในราคาถูกหรือรันเองได้
Agora-2 เป็นอาร์ติแฟกต์อีกประเภทหนึ่ง สิ่งที่ Odyssey เผยแพร่คือรายงานทางเทคนิคความยาว 23 หน้าและตัวอย่างบนเบราว์เซอร์ รายงานนี้อธิบายสภาพแวดล้อมเกมแอ็กชันแบบไอโซเมตริกที่มีการแทนค่าอย่างชัดเจนสำหรับเอกลักษณ์ของเอนทิตี ตำแหน่ง พลังชีวิต แอนิเมชัน การตาย และการเกิดใหม่; โมเดลการจำลองที่ทำนายการเคลื่อนไหว การต่อสู้ และแอนิเมชันจากประวัติของเอนทิตี การกระทำ และเรขาคณิตเฉพาะที่; และโมเดลการเรนเดอร์สำหรับผู้เข้าร่วมแต่ละรายที่สร้างมุมมองของผู้เข้าร่วมรายนั้นจากการแทนค่าทางภาพแบบบีบอัดของสถานะที่ใช้ร่วมกัน ไม่มีสิ่งใดในคำอธิบายนั้นที่เป็นโมเดลภาษา และไม่มีสิ่งใดในนั้นที่ดาวน์โหลดได้
• มันคืออะไร — Agora-2 เอนจินเกมแบบเรียนรู้ที่เรนเดอร์ 640×480 ต่อหนึ่งมุมมอง เทียบกับ Kimi K3 โมเดลข้อความน้ำหนักเปิดขนาด 2.8T พารามิเตอร์
• คะแนนอิสระ — Agora-2 ไม่มีการเผยแพร่ เทียบกับ Kimi K3 AA Intelligence Index 44 (v4.3.2) ผู้นำกลุ่มโมเดลน้ำหนักเปิด
• บริบท — สถานะที่ใช้ร่วมกันของ Agora-2 บวกกับประวัติแบบมีขอบเขตต่อมุมมอง เทียบกับ Kimi K3 1,048,576 โทเคน
• ราคา — Agora-2 ไม่มีเผยแพร่, เฉพาะตัวอย่างในเบราว์เซอร์ เทียบกับ Kimi K3 $3.00/$15.00 ต่อ 1M, $0.30 แคช
• สัญญาอนุญาต — Agora-2 เผยแพร่รายงานต่อสาธารณะ ไม่เปิดเผยเวตโมเดล เทียบกับ Kimi K3 ที่ใช้ MIT แบบดัดแปลง เผยแพร่เวตบน Hugging Face
• อินพุต — ตัวควบคุมเบราว์เซอร์ Agora-2 พร้อมนโยบายของเอเจนต์ RL จำนวน 16 รายการ เทียบกับข้อความและรูปภาพของ Kimi K3


บทบาทที่แต่ละตัวมีในระบบหลายเอเจนต์
สองสิ่งนี้จะมาบรรจบกันเฉพาะภายในระบบที่ประกอบด้วยทั้งสองเท่านั้น Kimi K3 เป็นตัวเลือกสำหรับชั้นตัดสินใจ — ส่วนประกอบที่อ่านเอาต์พุตของเครื่องมือ เขียนโค้ด และเลือกการกระทำถัดไปในลูประยะยาว หน้าต่างขนาดหนึ่งล้านโทเคนและอัตราการอ่านแคชที่ $0.30 ของมันถูกออกแบบมาเพื่อรองรับปริมาณงานที่ลูปแบบเอเจนต์สร้างขึ้นโดยเฉพาะ: บริบทขนาดมหึมาที่ซ้ำซากซึ่งจะสร้างความเสียหายอย่างมหาศาลหากคิดราคาอินพุตเต็ม
Agora-2 เป็นตัวเลือกสำหรับเลเยอร์ที่อยู่ต่ำลงมา — สภาพแวดล้อม กรอบแนวคิดของ Odyssey เองก็คือ โมเดลโลกแบบหลายเอเจนต์ช่วยให้นักวิจัยศึกษาได้ว่าเอเจนต์มีปฏิสัมพันธ์กันอย่างไร "ภายในสถานการณ์จำลองที่ควบคุมได้ ซึ่งสามารถตรวจสอบพฤติกรรมที่เป็นอันตรายได้โดยไม่ต้องนำระบบในโลกจริงไปเสี่ยง" ประโยคนี้ดูเหมือนเป็นการตอบสนองโดยตรงต่อรายงาน METR ซึ่งเอเจนต์ราว 1,200 ตัวร่วมมือกันบุกรุกจากภายในแซนด์บ็อกซ์สำหรับการประเมิน นโยบายที่ขับเคลื่อนสิบหกเอนทิตีอิสระของ Agora-2 ไม่ใช่ LLM แต่เป็นนโยบายแบบรีเคอร์เรนต์ทั้งเชิงสเกลาร์และเชิงพื้นที่ ซึ่งฝึกด้วยการเรียนรู้แบบเสริมกำลัง โดยรับประวัติการสังเกตสิบหกค่า และส่งออกการกระทำทุก ๆ สี่ติ๊กของการจำลอง หากคุณต้องการรู้ว่าเอเจนต์ระดับ Kimi K3 ทำอะไรเมื่อคู่ต่อสู้สิบหกตัวกำลังตัดสินใจเช่นกัน Agora-2 เป็นวิธีหนึ่งในการสร้างอารีนา มันไม่ใช่วิธีที่จะแทนที่เอเจนต์
อ่านตัวเลขทั้งสองด้าน
คะแนน 44 ของ Kimi K3 วัดโดยหน่วยงานที่ไม่ทำงานให้ Moonshot บนดัชนี v4.3.2 เดียวกันกับโมเดลอื่นทุกตัวในหน้านี้ และเป็นคะแนนที่ทำให้มันเป็นโมเดลฟรอนเทียร์แบบเปิดน้ำหนักที่น่าเชื่อถือ หน้าต่างบริบท ราคา และรายการโมดัลลิตีของมันเป็นข้อเท็จจริงที่เปิดเผยต่อสาธารณะ
ตัวเลขของ Agora-2 มาจากรายงานของ Team Odyssey เอง ผลลัพธ์พาดหัวคือการเปรียบเทียบการเรนเดอร์: ตัวเรนเดอร์แบบ structured-prefix ทำได้ 30.11 dB PSNR เทียบกับ 20.67 dB ของ baseline ที่ใช้ VAE บนคลิปมอนิเตอร์ 30 คลิป โดยแต่ละคลิปใช้ sampling seed สามค่า รายงานระบุอย่างระมัดระวังว่านี่เป็นการเปรียบเทียบระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่าเทียมกัน และไม่ได้แยกผลของสถาปัตยกรรมออกมา benchmark ด้าน conditioning ที่แสดงการลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention นั้นรันบน denoiser ที่เริ่มต้นแบบสุ่มด้วยอินพุตสังเคราะห์ — เป็นการทดสอบต้นทุนการประมวลผล ซึ่งไม่ใช่การวัดคุณภาพภาพอย่างชัดเจน การประเมินด้วย simulation ครอบคลุมการเคลื่อนที่แบบขั้นเดียวและการทำนายแอนิเมชันบนตัวอย่างที่บันทึกไว้ซึ่งถูกกันออกจากชุดทดสอบ
และส่วนข้อจำกัดก็บอกส่วนที่เหลือไว้ เป้าหมายการแสดงผล 30 เฟรมต่อวินาที และจังหวะการอัปเดตเลเทนต์ 15 ครั้งต่อวินาที ถูกระบุไว้เป็นเป้าหมายเท่านั้น อัตราเฟรมที่รักษาไว้ได้ต่อเนื่องและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการเล่นแบบหลายเอเจนต์แบบสดยังไม่ได้รับการประเมินเชิงปริมาณ คุณภาพภาพในระยะยาว ความสอดคล้องระหว่างมุมมอง และการปฏิบัติตามการกระทำแบบต้นทางถึงปลายทางยังไม่ถูกประเมิน ความหลากหลายของเลย์เอาต์แบบโพรซีเจอรัลมีอยู่ภายในโดเมนการฝึก แต่การถ่ายโอนไปยังแอสเซต กฎ หรือสภาพแวดล้อมใหม่ยังไม่ได้รับการทดสอบ นี่ไม่ใช่การตำหนิ Odyssey — รายงานฉบับนี้ตรงไปตรงมาเกี่ยวกับจุดอ่อนของตัวเองมากกว่าเอกสารเปิดตัวส่วนใหญ่ — แต่เป็นไพรเออร์ที่ถูกต้องสำหรับทุกสิ่งที่คุณอ่านเกี่ยวกับความสามารถของ Agora-2
อันไหนที่คุณสามารถต่อยอดได้ในสัปดาห์นี้
หากคุณต้องการโมเดล open-weights ระดับแนวหน้าไปใช้งานจริง คำตอบคือ Kimi K3 และไม่มีใครใกล้เคียง คะแนนอิสระ 44 คะแนน หน้าต่างบริบทหนึ่งล้านโทเคน การรับรูปภาพเป็นอินพุต และอัตราค่าใช้จ่าย $3/$15 พร้อมการอ่านแคชราคาถูก ล้วนเป็นแพ็กเกจที่พร้อมใช้งานจริงซึ่งเปิดตัวมาตั้งแต่เดือนกรกฎาคมบน OrcaRouter โมเดลนี้ให้บริการในราคาตามที่ Moonshot ประกาศไว้โดยไม่บวกเพิ่มเลย ซึ่งสำคัญกว่าปกติสำหรับโมเดลนี้ เพราะลูปของเอเจนต์ที่ใช้บริบทยาวจะใช้โทเคนส่วนใหญ่ไปกับคำนำหน้าที่ซ้ำ ๆ และอัตราการอ่านแคชที่ $0.30 ซึ่งส่งต่อมาโดยไม่เปลี่ยนแปลง คือความแตกต่างระหว่างคลัสเตอร์ที่จ่ายไหวกับคลัสเตอร์ที่จ่ายไม่ไหว การสลับผู้ให้บริการอัตโนมัติเมื่อเกิดข้อขัดข้องคืออีกครึ่งหนึ่งของเรื่องนี้ — ยิ่งลูปยาวเท่าไร ความเสียหายจากผู้ให้บริการล่มกลางทางก็ยิ่งแพงขึ้นเท่านั้น

Agora-2 ไม่มีเรตการ์ด จึงไม่มีปลายทางให้เราเตอร์ไปถึง และเราไม่ได้โฮสต์มัน สิ่งที่มันมอบให้ทีมหลายเอเจนต์คือพรีวิวเชิงวิจัยของสภาพแวดล้อมที่เล่นได้ในเบราว์เซอร์ตั้งแต่วันนี้ โดยมีรายงานสถาปัตยกรรมที่เปิดเผยต่อสาธารณะรองรับ ในหมวดหมู่ที่จนถึงตอนนี้ยังไม่มีตัวจำลองโลกที่ใช้ร่วมกันนอกเกมเอนจิน หากคุณสนใจว่าบรรดาเอเจนต์ทำอะไรต่อกัน นั่นคือสิ่งที่มีประโยชน์จริง ๆ และคุ้มค่ากับเวลาหนึ่งบ่าย หากคุณสนใจว่าเอเจนต์ทำอะไรได้ Kimi K3 คือโมเดล และเวิลด์โมเดลไม่ใช่สิ่งทดแทนมัน — ทั้งสองอยู่คนละเลเยอร์ของสแต็กเดียวกัน และมีเพียงเลเยอร์เดียวในนั้นที่มีราคาซึ่งคุณใส่ลงในสเปรดชีตได้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
