การ์ดชื่อเรื่องที่สร้างขึ้นสำหรับ Agora-2 vs Grok 4.6 โดยมีคำบรรยายใต้ภาพว่า 'เอเจนต์ LLM 1,200 ตัว และซิมูเลเตอร์ที่ไม่ได้ใช้ทั้งคู่' การ์ดสามใบ: 'Grok 4.6: AA Index 44, $2/$6 ต่อ 1M, $0.50 เมื่อแคช'; 'Agora-2: นโยบายเอเจนต์ RL 16 รายการ, ไม่มี LLM ในลูป'; 'Agora-2: tick 30 Hz, GPU RTX PRO 4500 4 ตัวต่อเซสชัน' ส่วนท้ายระบุว่า 'ตัวเลขของ Agora-2 มาจากรายงานของ Odyssey เอง ยังไม่มีการทำซ้ำ; Grok 4.6 อ้างอิงจาก Artificial Analysis'
Guides & Insights

Agora-2 ปะทะ Grok 4.6: คำถามเรื่องนโยบายของเอเจนต์ — เอเจนต์ LLM 1,200 ตัว และซิมูเลเตอร์ที่ไม่ได้ใช้ทั้งสองอย่าง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือตัวเลขที่คิดออกมาเป็นเงินได้ การสืบสวนของ METR ต่อเหตุการณ์ Hugging Face ในเดือนกรกฎาคม 2026 นับพบเอเจนต์ที่ประสานงานกันราว 1,200 ตัวภายในรอบการประเมินเพียงรอบเดียวGrok 4.6 ที่เรต 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้าน และ 6.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้าน ฝูงเอเจนต์ขนาดนั้นที่ปั่นบทสนทนายาว ๆ ติดต่อกันหกวัน คือบิลที่ทีมทุนหนารับไหวจริง ๆ แต่ที่ราคาของโมเดลที่คุณคงเอื้อมไปหยิบเป็นปกติ มันไม่ไหว นั่นคือคำอ้างเชิงผลิตภัณฑ์ที่แท้จริงของ Grok 4.6 และเป็นคำอ้างเดียวกันกับที่Agora-2แย้งอย่างเงียบ ๆ ว่า เมื่อOdysseyเปิดตัวแบบจำลองโลกแบบหลายเอเจนต์ของตนเมื่อวันที่ 21 กันยายน 2026 — พรีวิวที่เล่นได้ซึ่งสร้างสภาพแวดล้อมร่วมให้มนุษย์และเอเจนต์ AI สูงสุด 20 ราย — เอเจนต์ที่อยู่ข้างในกลับไม่ใช่แบบจำลองภาษาเลย Odyssey ฝึกนโยบายแบบการเรียนรู้แบบเสริมกำลังขนาดเล็กแทน คำถามที่น่าสนใจที่การจับคู่นี้ยกขึ้นมาไม่ใช่ว่าอันไหนดีกว่า แต่คือทำไมห้องแล็บจึงข้าม LLM ไป

ใบอัตราค่าใช้จ่าย ในหน่วยที่สำคัญสำหรับฝูงรถ

Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 ในฐานะระดับแนวหน้าของ xAI: หน้าต่างบริบทขนาด 500,000 โทเค็น, อินพุตข้อความ รูปภาพ และไฟล์, ความพยายามในการให้เหตุผลที่กำหนดค่าได้, การเรียกใช้เครื่องมือแบบเนทีฟ, เอาต์พุตแบบมีโครงสร้าง, และดัชนี Artificial Analysis Intelligence Index ที่ 44 บน index v4.3.2 — ดัชนีเดียวกันกับที่จัดให้ GPT-5.6 Sol อยู่ที่ 47 และ Kimi K3 อยู่ที่ 44 Artificial Analysis ให้คะแนน 94.9 บน GPQA Diamond และเป็นโมเดลที่ xAI ระบุว่า "Latest" ในเอกสารสำหรับนักพัฒนาของตัวเอง มันถูกให้บริการในฐานะโมเดล OpenAI Responses ระดับชั้นหนึ่ง ซึ่งเป็นประเด็นในทางปฏิบัติ: เฟรมเวิร์กเอเจนต์นำไปใช้โดยการเปลี่ยน base URL ไม่ใช่การเขียนอะแดปเตอร์

แต่ตัวเลขที่น่าสนใจคือการจับคู่ของ $2/$6 กับหน้าต่างบริบท ลูปของเอเจนต์ระยะยาวเป็นภาระงานที่ยุ่งเหยิง — หลายหมื่นโทเค็นของเอาต์พุตเครื่องมือที่สะสมต่อเอเจนต์ต่อชั่วโมง ส่วนใหญ่ซ้ำซ้อน อัตราการอ่านแคชของ Grok 4.6 คือ $0.50 ต่อล้าน ซึ่งเป็นหนึ่งในสี่ของราคาอินพุต ซึ่งเป็นสิ่งที่ทำให้การรันเอเจนต์หนึ่งพันตัวเป็นไปได้ในเชิงคณิตศาสตร์ ไม่ใช่แค่มีความเป็นไปได้ สังเกตขอบเขตระดับ: พรอมต์ที่เกิน 200K โทเค็นจะถูกคิดเงินในอัตราสองเท่าของอัตราฐาน ดังนั้นเอเจนต์ที่สะสมประวัติยาวขึ้นจะเพิ่มค่าใช้จ่ายของตัวเองเป็นสองเท่าอย่างเงียบๆ

• ราคา — Agora-2 ไม่มีราคาเปิดเผย แสดงตัวอย่างผ่านเบราว์เซอร์เท่านั้น เทียบกับ Grok 4.6 ที่ $2.00/$6.00 ต่อ 1M, อ่านจากแคช $0.50, เพิ่มเป็นสองเท่าเมื่ออินพุตเกิน 200K

• บริบท — สถานะที่แชร์ร่วมกันของ Agora-2 บวกกับประวัติต่อมุมมองที่มีขอบเขตจำกัด เทียบกับ Grok 4.6 จำนวน 500,000 โทเคน

• คะแนนอิสระ — Agora-2 ยังไม่มีการเผยแพร่ เทียบกับ Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• การให้เหตุผล — Agora-2 ใช้ไม่ได้ ไม่ใช่โมเดลภาษา เทียบกับ Grok 4.6 ที่ปรับระดับความพยายามได้และการเรียกใช้เครื่องมือแบบเนทีฟ

• การเข้าถึง — Agora-2 พรีวิวที่เล่นได้ ไม่มี API ไม่มีเวตโมเดล เทียบกับ Grok 4.6 ที่เป็น API แบบกรรมสิทธิ์

• ฮาร์ดแวร์ — Agora-2 ใช้ GPU RTX PRO 4500 สี่ตัวสำหรับมุมมองพร้อมกันสี่มุมมอง เทียบกับ Grok 4.6 ซึ่งเป็นเอนด์พอยต์แบบโฮสต์

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

ทำไม Odyssey ถึงไม่ส่ง LLM ลงสนามแข่ง

ทางลัดที่เห็นได้ชัด หากคุณกำลังสร้างโลกที่เอเจนต์ AI 16 ตัวต่อสู้กับมนุษย์ 4 คน คือการต่อโมเดลข้อความที่มีความสามารถเข้ากับตัวควบคุมแล้วปล่อยให้มันเล่น Odyssey ไม่ได้ทำเช่นนั้น และรายงานทางเทคนิคของมันบอกเหตุผลไว้ในตารางการกำหนดค่า นโยบายของเอเจนต์ใน Agora-2 เป็นนโยบายแบบรีเคอร์เรนต์ทั้งค่าสเกลาร์และเชิงพื้นที่ ซึ่งใช้ประวัติการสังเกต 16 รายการ ปล่อยการกระทำหนึ่งอย่างทุก ๆ สี่ติ๊กการจำลอง โดยเลือกจากสาขาการเคลื่อนไหวแบบไม่ต่อเนื่อง 14 สาขา ตัวการจำลองเองเดินหน้าบนฐานเวลาติ๊ก 30 Hz โมเดลที่ถูกขอให้ตัดสินใจ 30 ครั้งต่อวินาที จากมุมมองที่สังเกตเห็นได้เพียงบางส่วน ด้วยชุดการกระทำระดับล่างที่คงที่ ไม่ใช่ปัญหาการให้เหตุผล — แต่มันเป็นปัญหาการควบคุม และปัญหาการควบคุมแก้ไขได้ด้วยการฝึกนโยบายขนาดเล็ก ไม่ใช่ด้วยการพรอมป์โมเดลแนวหน้าขนาดบริบท 500K

เรื่องนี้ควรพูดให้ชัดเจน เพราะมันเป็นความเข้าใจผิดที่พบบ่อยที่สุดเกี่ยวกับหมวดหมู่เวิลด์โมเดล Agora-2 ไม่ได้แข่งขันกับ Grok 4.6 เพื่อชิงตำแหน่งเดียวกันในระบบ หากแต่อยู่ในตำแหน่งที่ต่ำลงไป: สภาพแวดล้อมที่นโยบายได้รับการฝึกและประเมินภายใน สถาปัตยกรรมของรายงานระบุการแยกส่วนนี้ไว้อย่างชัดเจน — โมเดลจำลองคาดการณ์ว่าการกระทำที่รวมกันจะเปลี่ยนสถานะที่ใช้ร่วมกันอย่างไร เวิลด์เซิร์ฟเวอร์นำการกระทำเหล่านั้นไปใช้ และโมเดลเรนเดอร์แบบแยกตามมุมมองสร้างมุมมอง 640×480 ของผู้เข้าร่วมแต่ละคนจากสถานะนั้น ไม่มีโมเดลข้อความปรากฏอยู่ที่ใดในลูปการโต้ตอบเลย

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

จุดที่โมเดลอย่าง Grok 4.6 ปรากฏตัวขึ้นคือในระดับที่สูงขึ้นไปหนึ่งชั้น: ในฐานะสิ่งที่เขียนโครงสร้างการประเมิน วิเคราะห์บทบันทึก หรือขับเคลื่อนเอเจนต์ที่ใช้เครื่องมือซึ่งคุณกำลังพยายามศึกษาพฤติกรรมของมัน นั่นคือบทบาทที่ GPT-5.6 Sol รับบทในงานสืบสวนของ METR อย่างแม่นยำ — ประมาณ 5% ของฝูง และเป็นนักวิเคราะห์ที่อ่านบันทึก — และเป็นบทบาทที่ราคาและหน้าต่างบริบทของ Grok 4.6 ทำให้มีต้นทุนต่ำ

ช่องว่างของหลักฐานตรงนี้กว้างกว่าในคู่แข่งขันเหล่านี้ส่วนใหญ่

คะแนน index ของ Grok 4.6 ถูกวัดอย่างอิสระ rate card ของมันถูกเผยแพร่ และ context window ของมันถูกบันทึกไว้เป็นเอกสาร ตัวเลขของ Agora-2 มาจากรายงานที่เขียนโดย Team Odyssey และไม่มีใครทำซ้ำ บนคลิป monitoring สามสิบคลิป renderer แบบ structured-prefix ของมันทำได้ 30.11 dB PSNR เทียบกับ 20.67 dB สำหรับ VAE baseline — การเปรียบเทียบที่รายงานเองเตือนว่าเป็นระหว่างระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่ากัน ไม่ใช่การทดสอบสถาปัตยกรรมแบบแยกส่วน benchmark conditioning ของมัน ซึ่งแสดงการลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention ใช้ denoiser ที่เริ่มต้นแบบสุ่มบนอินพุตสังเคราะห์ และวัดต้นทุนการประมวลผล ไม่ใช่คุณภาพภาพ

จากนั้นก็เป็นส่วนข้อจำกัด ซึ่งตรงไปตรงมาอย่างผิดปกติ ค่า 15 latent updates และ 30 เฟรมต่อวินาทีที่ระบุไว้เป็นเพียงเป้าหมายเท่านั้น อัตราเฟรมที่คงที่และความหน่วงจากอินพุตไปยังจอแสดงผลระหว่างการโต้ตอบแบบหลายเอเจนต์สด ๆ “ยังไม่ได้รับการประเมินเชิงปริมาณ” คุณภาพภาพในระยะยาว ความสอดคล้องระหว่างมุมมอง และการยึดตามการกระทำแบบต้นทางถึงปลายทาง ล้วนถูกระบุว่ายังไม่ได้ประเมิน สภาพแวดล้อมนี้ต้องใช้เกมเอนจินที่มีการติดตั้งเครื่องมือวัด พร้อมเรขาคณิตที่ชัดเจนและชุดคำศัพท์ลักษณะปรากฏที่ตายตัว และการถ่ายโอนไปยังแอสเซต กฎ หรือสภาพแวดล้อมอื่นยังไม่ได้ทดสอบ อ่านรายการนั้นก่อนที่คุณจะอ่านตัวเลขพาดหัวใด ๆ เกี่ยวกับ Agora-2

อันไหนที่ควรอยู่ในสแต็กของคุณ

หากคุณกำลังรันหรือศึกษาระบบหลายเอเจนต์อยู่ในตอนนี้ Grok 4.6 คือองค์ประกอบที่คุณนำไปดีพลอยได้จริง — โมเดลข้อความระดับแนวหน้าในอัตราที่ทำให้ฝูงเอเจนต์ขนาดใหญ่จ่ายไหว พร้อมคะแนนที่เผยแพร่และพื้นผิว API ที่มีเอกสารกำกับบน OrcaRouter มันให้บริการในราคาตามที่ xAI ประกาศเองโดยไม่มีการบวกเพิ่มเลย ดังนั้นราคา $2/$6 ข้างต้นและการเปลี่ยนแปลงอัตราค่าใช้จ่ายในอนาคตจะไปถึงบิลของคุณในวันที่เกิดขึ้นจริง พร้อมกับการสลับไปปลายทางสำรองอัตโนมัติหากปลายทางหลักเสื่อมประสิทธิภาพ ทั้งสองข้อนี้สำคัญเป็นพิเศษกับงานระดับฝูง: เอเจนต์หนึ่งพันตัวคือหนึ่งพันโอกาสที่จะเจอผู้ให้บริการที่เสื่อมประสิทธิภาพ และการบวกเพิ่มบนผลลัพธ์ราคา $6 คือการบวกเพิ่มที่คูณกับทั้งการรันของคุณ

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 ไม่ใช่โครงสร้างพื้นฐานที่พร้อมนำไปใช้งานได้จริง และเราไม่ได้โฮสต์มัน — ไม่มี API ไม่มีเวต และไม่มีราคา มีเพียงตัวอย่างที่เล่นได้ของ Odyssey เองเท่านั้น สิ่งที่มันมอบให้คือคุณค่าในแบบที่แตกต่างออกไป: สภาพแวดล้อมที่ควบคุมได้สำหรับการวิจัยปฏิสัมพันธ์ ซึ่งรายงานของ METR ชี้ว่าตอนนี้เป็นเรื่องเร่งด่วน ด้วยต้นทุนการ์ด RTX PRO 4500 สี่ใบสำหรับการดูพร้อมกันสี่มุมมอง แทนที่จะเป็นบิลค่า API คำตัดสินอย่างตรงไปตรงมาคือ สองสิ่งนี้ไม่ได้แข่งขันกัน Grok 4.6 คือสมองด้านนโยบายที่คุณซื้อได้เป็นโทเคนวันนี้ ส่วน Agora-2 เป็นข้อเสนอสำหรับสถานที่ทดสอบว่าเกิดอะไรขึ้นเมื่อสมองเหล่านั้นหลายพันตัวมาพบกัน อันที่สองเป็นงานวิจัยที่น่าสนใจกว่าและเป็นผลิตภัณฑ์ที่สมบูรณ์น้อยกว่า และรายงานของ Odyssey เองก็ชัดเจนอย่างน่าสดชื่นว่าส่วนใดของมันยังเป็นเป้าหมายอยู่

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube