การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Agora-2 กับ Kimi K3 โดยมีคำบรรยายใต้ภาพว่า 'ผู้เข้าร่วม 20 คนในโลกที่ใช้ร่วมกัน และโมเดลที่เล่นบทบาทหนึ่งในนั้น' การ์ดสามใบ: 'Kimi K3: AA Index 44, $3/$15 ต่อ 1M, คอนเท็กซ์ 1M'; 'Kimi K3: น้ำหนักเปิด, สัญญาอนุญาต MIT แบบดัดแปลง'; 'Agora-2: รายงานสาธารณะ, ไม่มีน้ำหนัก, ไม่มี API' ส่วนท้ายระบุว่า 'Kimi K3 ตามข้อมูลจาก Artificial Analysis; Agora-2 รายงานโดยผู้ขายและยังไม่มีการทำซ้ำ'
Guides & Insights

Agora-2 กับ Kimi K3: ผู้เข้าร่วมยี่สิบคนในโลกที่ใช้ร่วมกัน และโมเดล 1M-Token ที่รับบทหนึ่งบทบาทในนั้น

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ถ้าตัดเกณฑ์วัดประสิทธิภาพออกไป จะเหลือความไม่สมดุลอยู่หนึ่งอย่างที่ชี้ขาดการเปรียบเทียบนี้ Odysseyเปิดตัว Agora-2 เมื่อวันที่ 21 กันยายน 2026 — โมเดลโลกแบบหลายเอเจนต์ที่เล่นได้ ซึ่งสร้างสภาพแวดล้อมแบบโต้ตอบที่ใช้ร่วมกันให้กับมนุษย์และเอเจนต์ AI ได้สูงสุด 20 รายแบบเรียลไทม์ ที่ความละเอียด 640×480 จากแบบจำลองที่เรียนรู้มา บวกกับตัวเรนเดอร์แบบแยกตามมุมมอง Kimi K3 จาก Moonshot AI เป็นโมเดลน้ำหนักเปิดขนาด 2.8 ล้านล้านพารามิเตอร์ มีหน้าต่างบริบท 1,048,576 โทเคน และได้คะแนน 44 บน Artificial Analysis Intelligence Index เปิดตัวเมื่อวันที่ 15 กรกฎาคม และดาวน์โหลดได้ตั้งแต่วันที่ 27 กรกฎาคม ทั้งคู่เป็นแบบเปิดในความหมายที่สำคัญต่อทีมวิจัย — น้ำหนักของ Kimi K3 อยู่บน Hugging Face ภายใต้สัญญาอนุญาต MIT ฉบับดัดแปลง และรายงานทางเทคนิคของ Agora-2 ก็เผยแพร่ฉบับเต็ม — และทั้งคู่ก็ไม่ใช่แบบเปิดในความหมายที่สำคัญต่อผู้ซื้อ: Agora-2 ไม่มีน้ำหนัก ไม่มี API และไม่มีราคา ส่วนสัญญาอนุญาตของ Kimi K3 มีข้อจำกัดในเชิงพาณิชย์ คำถามที่มีประโยชน์ไม่ใช่ว่าตัวไหนฉลาดกว่า แต่คือตัวไหนในสองตัวนี้ที่สามารถเป็นส่วนหนึ่งของระบบหลายเอเจนต์ได้ภายในไตรมาสนี้

อะไรที่ดาวน์โหลดได้จริง และสิ่งนั้นให้อะไรกับคุณ

Kimi K3 เป็นโมเดลที่ยึดแนวทางเดิมมากกว่าอย่างชัดเจน เป็น MoE ขนาด 2.8T พารามิเตอร์ มีบริบทหนึ่งล้านโทเคน รับอินพุตทั้งข้อความและรูปภาพ มีตัวควบคุมระดับความพยายามในการให้เหตุผลระดับบนสุดแทนที่พารามิเตอร์การสุ่ม มีการเรียกใช้เครื่องมือแบบเนทีฟ และมีอินเทอร์เฟซที่เข้ากันได้กับ OpenAI ราคาอยู่ที่ $3.00/$15.00 ต่อล้านโทเคน โดยมีอัตราการอ่านแคช $0.30 และทำคะแนนได้ 44 บน index v4.3.2 — เป็นอันดับสามในบรรดาโมเดล open-weights บนบอร์ดนั้น ตามหลัง 46 ของ MiMo-V2.6-Pro และ 45 ของ GLM-5.3 บนบอร์ดเดียวกันนี้ยังได้คะแนน 85.0 ใน terminal-bench 2.1 และ 59.5 ใน SciCode หากระบบ multi-agent ของคุณต้องการสมองให้แต่ละเอเจนต์ นี่คือสมองที่คุณเช่าได้ในราคาถูกหรือรันเองได้

Agora-2 เป็นอาร์ติแฟกต์อีกประเภทหนึ่ง สิ่งที่ Odyssey เผยแพร่คือรายงานทางเทคนิคความยาว 23 หน้าและตัวอย่างบนเบราว์เซอร์ รายงานนี้อธิบายสภาพแวดล้อมเกมแอ็กชันแบบไอโซเมตริกที่มีการแทนค่าอย่างชัดเจนสำหรับเอกลักษณ์ของเอนทิตี ตำแหน่ง พลังชีวิต แอนิเมชัน การตาย และการเกิดใหม่; โมเดลการจำลองที่ทำนายการเคลื่อนไหว การต่อสู้ และแอนิเมชันจากประวัติของเอนทิตี การกระทำ และเรขาคณิตเฉพาะที่; และโมเดลการเรนเดอร์สำหรับผู้เข้าร่วมแต่ละรายที่สร้างมุมมองของผู้เข้าร่วมรายนั้นจากการแทนค่าทางภาพแบบบีบอัดของสถานะที่ใช้ร่วมกัน ไม่มีสิ่งใดในคำอธิบายนั้นที่เป็นโมเดลภาษา และไม่มีสิ่งใดในนั้นที่ดาวน์โหลดได้

• มันคืออะไร — Agora-2 เอนจินเกมแบบเรียนรู้ที่เรนเดอร์ 640×480 ต่อหนึ่งมุมมอง เทียบกับ Kimi K3 โมเดลข้อความน้ำหนักเปิดขนาด 2.8T พารามิเตอร์

• คะแนนอิสระ — Agora-2 ไม่มีการเผยแพร่ เทียบกับ Kimi K3 AA Intelligence Index 44 (v4.3.2) ผู้นำกลุ่มโมเดลน้ำหนักเปิด

• บริบท — สถานะที่ใช้ร่วมกันของ Agora-2 บวกกับประวัติแบบมีขอบเขตต่อมุมมอง เทียบกับ Kimi K3 1,048,576 โทเคน

• ราคา — Agora-2 ไม่มีเผยแพร่, เฉพาะตัวอย่างในเบราว์เซอร์ เทียบกับ Kimi K3 $3.00/$15.00 ต่อ 1M, $0.30 แคช

• สัญญาอนุญาต — Agora-2 เผยแพร่รายงานต่อสาธารณะ ไม่เปิดเผยเวตโมเดล เทียบกับ Kimi K3 ที่ใช้ MIT แบบดัดแปลง เผยแพร่เวตบน Hugging Face

• อินพุต — ตัวควบคุมเบราว์เซอร์ Agora-2 พร้อมนโยบายของเอเจนต์ RL จำนวน 16 รายการ เทียบกับข้อความและรูปภาพของ Kimi K3

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

บทบาทที่แต่ละตัวมีในระบบหลายเอเจนต์

สองสิ่งนี้จะมาบรรจบกันเฉพาะภายในระบบที่ประกอบด้วยทั้งสองเท่านั้น Kimi K3 เป็นตัวเลือกสำหรับชั้นตัดสินใจ — ส่วนประกอบที่อ่านเอาต์พุตของเครื่องมือ เขียนโค้ด และเลือกการกระทำถัดไปในลูประยะยาว หน้าต่างขนาดหนึ่งล้านโทเคนและอัตราการอ่านแคชที่ $0.30 ของมันถูกออกแบบมาเพื่อรองรับปริมาณงานที่ลูปแบบเอเจนต์สร้างขึ้นโดยเฉพาะ: บริบทขนาดมหึมาที่ซ้ำซากซึ่งจะสร้างความเสียหายอย่างมหาศาลหากคิดราคาอินพุตเต็ม

Agora-2 เป็นตัวเลือกสำหรับเลเยอร์ที่อยู่ต่ำลงมา — สภาพแวดล้อม กรอบแนวคิดของ Odyssey เองก็คือ โมเดลโลกแบบหลายเอเจนต์ช่วยให้นักวิจัยศึกษาได้ว่าเอเจนต์มีปฏิสัมพันธ์กันอย่างไร "ภายในสถานการณ์จำลองที่ควบคุมได้ ซึ่งสามารถตรวจสอบพฤติกรรมที่เป็นอันตรายได้โดยไม่ต้องนำระบบในโลกจริงไปเสี่ยง" ประโยคนี้ดูเหมือนเป็นการตอบสนองโดยตรงต่อรายงาน METR ซึ่งเอเจนต์ราว 1,200 ตัวร่วมมือกันบุกรุกจากภายในแซนด์บ็อกซ์สำหรับการประเมิน นโยบายที่ขับเคลื่อนสิบหกเอนทิตีอิสระของ Agora-2 ไม่ใช่ LLM แต่เป็นนโยบายแบบรีเคอร์เรนต์ทั้งเชิงสเกลาร์และเชิงพื้นที่ ซึ่งฝึกด้วยการเรียนรู้แบบเสริมกำลัง โดยรับประวัติการสังเกตสิบหกค่า และส่งออกการกระทำทุก ๆ สี่ติ๊กของการจำลอง หากคุณต้องการรู้ว่าเอเจนต์ระดับ Kimi K3 ทำอะไรเมื่อคู่ต่อสู้สิบหกตัวกำลังตัดสินใจเช่นกัน Agora-2 เป็นวิธีหนึ่งในการสร้างอารีนา มันไม่ใช่วิธีที่จะแทนที่เอเจนต์

อ่านตัวเลขทั้งสองด้าน

คะแนน 44 ของ Kimi K3 วัดโดยหน่วยงานที่ไม่ทำงานให้ Moonshot บนดัชนี v4.3.2 เดียวกันกับโมเดลอื่นทุกตัวในหน้านี้ และเป็นคะแนนที่ทำให้มันเป็นโมเดลฟรอนเทียร์แบบเปิดน้ำหนักที่น่าเชื่อถือ หน้าต่างบริบท ราคา และรายการโมดัลลิตีของมันเป็นข้อเท็จจริงที่เปิดเผยต่อสาธารณะ

ตัวเลขของ Agora-2 มาจากรายงานของ Team Odyssey เอง ผลลัพธ์พาดหัวคือการเปรียบเทียบการเรนเดอร์: ตัวเรนเดอร์แบบ structured-prefix ทำได้ 30.11 dB PSNR เทียบกับ 20.67 dB ของ baseline ที่ใช้ VAE บนคลิปมอนิเตอร์ 30 คลิป โดยแต่ละคลิปใช้ sampling seed สามค่า รายงานระบุอย่างระมัดระวังว่านี่เป็นการเปรียบเทียบระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่าเทียมกัน และไม่ได้แยกผลของสถาปัตยกรรมออกมา benchmark ด้าน conditioning ที่แสดงการลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention นั้นรันบน denoiser ที่เริ่มต้นแบบสุ่มด้วยอินพุตสังเคราะห์ — เป็นการทดสอบต้นทุนการประมวลผล ซึ่งไม่ใช่การวัดคุณภาพภาพอย่างชัดเจน การประเมินด้วย simulation ครอบคลุมการเคลื่อนที่แบบขั้นเดียวและการทำนายแอนิเมชันบนตัวอย่างที่บันทึกไว้ซึ่งถูกกันออกจากชุดทดสอบ

และส่วนข้อจำกัดก็บอกส่วนที่เหลือไว้ เป้าหมายการแสดงผล 30 เฟรมต่อวินาที และจังหวะการอัปเดตเลเทนต์ 15 ครั้งต่อวินาที ถูกระบุไว้เป็นเป้าหมายเท่านั้น อัตราเฟรมที่รักษาไว้ได้ต่อเนื่องและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการเล่นแบบหลายเอเจนต์แบบสดยังไม่ได้รับการประเมินเชิงปริมาณ คุณภาพภาพในระยะยาว ความสอดคล้องระหว่างมุมมอง และการปฏิบัติตามการกระทำแบบต้นทางถึงปลายทางยังไม่ถูกประเมิน ความหลากหลายของเลย์เอาต์แบบโพรซีเจอรัลมีอยู่ภายในโดเมนการฝึก แต่การถ่ายโอนไปยังแอสเซต กฎ หรือสภาพแวดล้อมใหม่ยังไม่ได้รับการทดสอบ นี่ไม่ใช่การตำหนิ Odyssey — รายงานฉบับนี้ตรงไปตรงมาเกี่ยวกับจุดอ่อนของตัวเองมากกว่าเอกสารเปิดตัวส่วนใหญ่ — แต่เป็นไพรเออร์ที่ถูกต้องสำหรับทุกสิ่งที่คุณอ่านเกี่ยวกับความสามารถของ Agora-2

อันไหนที่คุณสามารถต่อยอดได้ในสัปดาห์นี้

หากคุณต้องการโมเดล open-weights ระดับแนวหน้าไปใช้งานจริง คำตอบคือ Kimi K3 และไม่มีใครใกล้เคียง คะแนนอิสระ 44 คะแนน หน้าต่างบริบทหนึ่งล้านโทเคน การรับรูปภาพเป็นอินพุต และอัตราค่าใช้จ่าย $3/$15 พร้อมการอ่านแคชราคาถูก ล้วนเป็นแพ็กเกจที่พร้อมใช้งานจริงซึ่งเปิดตัวมาตั้งแต่เดือนกรกฎาคมบน OrcaRouter โมเดลนี้ให้บริการในราคาตามที่ Moonshot ประกาศไว้โดยไม่บวกเพิ่มเลย ซึ่งสำคัญกว่าปกติสำหรับโมเดลนี้ เพราะลูปของเอเจนต์ที่ใช้บริบทยาวจะใช้โทเคนส่วนใหญ่ไปกับคำนำหน้าที่ซ้ำ ๆ และอัตราการอ่านแคชที่ $0.30 ซึ่งส่งต่อมาโดยไม่เปลี่ยนแปลง คือความแตกต่างระหว่างคลัสเตอร์ที่จ่ายไหวกับคลัสเตอร์ที่จ่ายไม่ไหว การสลับผู้ให้บริการอัตโนมัติเมื่อเกิดข้อขัดข้องคืออีกครึ่งหนึ่งของเรื่องนี้ — ยิ่งลูปยาวเท่าไร ความเสียหายจากผู้ให้บริการล่มกลางทางก็ยิ่งแพงขึ้นเท่านั้น

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2 ไม่มีเรตการ์ด จึงไม่มีปลายทางให้เราเตอร์ไปถึง และเราไม่ได้โฮสต์มัน สิ่งที่มันมอบให้ทีมหลายเอเจนต์คือพรีวิวเชิงวิจัยของสภาพแวดล้อมที่เล่นได้ในเบราว์เซอร์ตั้งแต่วันนี้ โดยมีรายงานสถาปัตยกรรมที่เปิดเผยต่อสาธารณะรองรับ ในหมวดหมู่ที่จนถึงตอนนี้ยังไม่มีตัวจำลองโลกที่ใช้ร่วมกันนอกเกมเอนจิน หากคุณสนใจว่าบรรดาเอเจนต์ทำอะไรต่อกัน นั่นคือสิ่งที่มีประโยชน์จริง ๆ และคุ้มค่ากับเวลาหนึ่งบ่าย หากคุณสนใจว่าเอเจนต์ทำอะไรได้ Kimi K3 คือโมเดล และเวิลด์โมเดลไม่ใช่สิ่งทดแทนมัน — ทั้งสองอยู่คนละเลเยอร์ของสแต็กเดียวกัน และมีเพียงเลเยอร์เดียวในนั้นที่มีราคาซึ่งคุณใส่ลงในสเปรดชีตได้

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube