
Agora-2 ปะทะ Grok 4.6: คำถามเรื่องนโยบายของเอเจนต์ — เอเจนต์ LLM 1,200 ตัว และซิมูเลเตอร์ที่ไม่ได้ใช้ทั้งสองอย่าง
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
นี่คือตัวเลขที่คิดออกมาเป็นเงินได้ การสืบสวนของ METR ต่อเหตุการณ์ Hugging Face ในเดือนกรกฎาคม 2026 นับพบเอเจนต์ที่ประสานงานกันราว 1,200 ตัวภายในรอบการประเมินเพียงรอบเดียวGrok 4.6 ที่เรต 2.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้าน และ 6.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้าน ฝูงเอเจนต์ขนาดนั้นที่ปั่นบทสนทนายาว ๆ ติดต่อกันหกวัน คือบิลที่ทีมทุนหนารับไหวจริง ๆ แต่ที่ราคาของโมเดลที่คุณคงเอื้อมไปหยิบเป็นปกติ มันไม่ไหว นั่นคือคำอ้างเชิงผลิตภัณฑ์ที่แท้จริงของ Grok 4.6 และเป็นคำอ้างเดียวกันกับที่Agora-2แย้งอย่างเงียบ ๆ ว่า เมื่อOdysseyเปิดตัวแบบจำลองโลกแบบหลายเอเจนต์ของตนเมื่อวันที่ 21 กันยายน 2026 — พรีวิวที่เล่นได้ซึ่งสร้างสภาพแวดล้อมร่วมให้มนุษย์และเอเจนต์ AI สูงสุด 20 ราย — เอเจนต์ที่อยู่ข้างในกลับไม่ใช่แบบจำลองภาษาเลย Odyssey ฝึกนโยบายแบบการเรียนรู้แบบเสริมกำลังขนาดเล็กแทน คำถามที่น่าสนใจที่การจับคู่นี้ยกขึ้นมาไม่ใช่ว่าอันไหนดีกว่า แต่คือทำไมห้องแล็บจึงข้าม LLM ไป
ใบอัตราค่าใช้จ่าย ในหน่วยที่สำคัญสำหรับฝูงรถ
Grok 4.6 เปิดตัวเมื่อวันที่ 12 สิงหาคม 2026 ในฐานะระดับแนวหน้าของ xAI: หน้าต่างบริบทขนาด 500,000 โทเค็น, อินพุตข้อความ รูปภาพ และไฟล์, ความพยายามในการให้เหตุผลที่กำหนดค่าได้, การเรียกใช้เครื่องมือแบบเนทีฟ, เอาต์พุตแบบมีโครงสร้าง, และดัชนี Artificial Analysis Intelligence Index ที่ 44 บน index v4.3.2 — ดัชนีเดียวกันกับที่จัดให้ GPT-5.6 Sol อยู่ที่ 47 และ Kimi K3 อยู่ที่ 44 Artificial Analysis ให้คะแนน 94.9 บน GPQA Diamond และเป็นโมเดลที่ xAI ระบุว่า "Latest" ในเอกสารสำหรับนักพัฒนาของตัวเอง มันถูกให้บริการในฐานะโมเดล OpenAI Responses ระดับชั้นหนึ่ง ซึ่งเป็นประเด็นในทางปฏิบัติ: เฟรมเวิร์กเอเจนต์นำไปใช้โดยการเปลี่ยน base URL ไม่ใช่การเขียนอะแดปเตอร์
แต่ตัวเลขที่น่าสนใจคือการจับคู่ของ $2/$6 กับหน้าต่างบริบท ลูปของเอเจนต์ระยะยาวเป็นภาระงานที่ยุ่งเหยิง — หลายหมื่นโทเค็นของเอาต์พุตเครื่องมือที่สะสมต่อเอเจนต์ต่อชั่วโมง ส่วนใหญ่ซ้ำซ้อน อัตราการอ่านแคชของ Grok 4.6 คือ $0.50 ต่อล้าน ซึ่งเป็นหนึ่งในสี่ของราคาอินพุต ซึ่งเป็นสิ่งที่ทำให้การรันเอเจนต์หนึ่งพันตัวเป็นไปได้ในเชิงคณิตศาสตร์ ไม่ใช่แค่มีความเป็นไปได้ สังเกตขอบเขตระดับ: พรอมต์ที่เกิน 200K โทเค็นจะถูกคิดเงินในอัตราสองเท่าของอัตราฐาน ดังนั้นเอเจนต์ที่สะสมประวัติยาวขึ้นจะเพิ่มค่าใช้จ่ายของตัวเองเป็นสองเท่าอย่างเงียบๆ
• ราคา — Agora-2 ไม่มีราคาเปิดเผย แสดงตัวอย่างผ่านเบราว์เซอร์เท่านั้น เทียบกับ Grok 4.6 ที่ $2.00/$6.00 ต่อ 1M, อ่านจากแคช $0.50, เพิ่มเป็นสองเท่าเมื่ออินพุตเกิน 200K
• บริบท — สถานะที่แชร์ร่วมกันของ Agora-2 บวกกับประวัติต่อมุมมองที่มีขอบเขตจำกัด เทียบกับ Grok 4.6 จำนวน 500,000 โทเคน
• คะแนนอิสระ — Agora-2 ยังไม่มีการเผยแพร่ เทียบกับ Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• การให้เหตุผล — Agora-2 ใช้ไม่ได้ ไม่ใช่โมเดลภาษา เทียบกับ Grok 4.6 ที่ปรับระดับความพยายามได้และการเรียกใช้เครื่องมือแบบเนทีฟ
• การเข้าถึง — Agora-2 พรีวิวที่เล่นได้ ไม่มี API ไม่มีเวตโมเดล เทียบกับ Grok 4.6 ที่เป็น API แบบกรรมสิทธิ์
• ฮาร์ดแวร์ — Agora-2 ใช้ GPU RTX PRO 4500 สี่ตัวสำหรับมุมมองพร้อมกันสี่มุมมอง เทียบกับ Grok 4.6 ซึ่งเป็นเอนด์พอยต์แบบโฮสต์

ทำไม Odyssey ถึงไม่ส่ง LLM ลงสนามแข่ง
ทางลัดที่เห็นได้ชัด หากคุณกำลังสร้างโลกที่เอเจนต์ AI 16 ตัวต่อสู้กับมนุษย์ 4 คน คือการต่อโมเดลข้อความที่มีความสามารถเข้ากับตัวควบคุมแล้วปล่อยให้มันเล่น Odyssey ไม่ได้ทำเช่นนั้น และรายงานทางเทคนิคของมันบอกเหตุผลไว้ในตารางการกำหนดค่า นโยบายของเอเจนต์ใน Agora-2 เป็นนโยบายแบบรีเคอร์เรนต์ทั้งค่าสเกลาร์และเชิงพื้นที่ ซึ่งใช้ประวัติการสังเกต 16 รายการ ปล่อยการกระทำหนึ่งอย่างทุก ๆ สี่ติ๊กการจำลอง โดยเลือกจากสาขาการเคลื่อนไหวแบบไม่ต่อเนื่อง 14 สาขา ตัวการจำลองเองเดินหน้าบนฐานเวลาติ๊ก 30 Hz โมเดลที่ถูกขอให้ตัดสินใจ 30 ครั้งต่อวินาที จากมุมมองที่สังเกตเห็นได้เพียงบางส่วน ด้วยชุดการกระทำระดับล่างที่คงที่ ไม่ใช่ปัญหาการให้เหตุผล — แต่มันเป็นปัญหาการควบคุม และปัญหาการควบคุมแก้ไขได้ด้วยการฝึกนโยบายขนาดเล็ก ไม่ใช่ด้วยการพรอมป์โมเดลแนวหน้าขนาดบริบท 500K
เรื่องนี้ควรพูดให้ชัดเจน เพราะมันเป็นความเข้าใจผิดที่พบบ่อยที่สุดเกี่ยวกับหมวดหมู่เวิลด์โมเดล Agora-2 ไม่ได้แข่งขันกับ Grok 4.6 เพื่อชิงตำแหน่งเดียวกันในระบบ หากแต่อยู่ในตำแหน่งที่ต่ำลงไป: สภาพแวดล้อมที่นโยบายได้รับการฝึกและประเมินภายใน สถาปัตยกรรมของรายงานระบุการแยกส่วนนี้ไว้อย่างชัดเจน — โมเดลจำลองคาดการณ์ว่าการกระทำที่รวมกันจะเปลี่ยนสถานะที่ใช้ร่วมกันอย่างไร เวิลด์เซิร์ฟเวอร์นำการกระทำเหล่านั้นไปใช้ และโมเดลเรนเดอร์แบบแยกตามมุมมองสร้างมุมมอง 640×480 ของผู้เข้าร่วมแต่ละคนจากสถานะนั้น ไม่มีโมเดลข้อความปรากฏอยู่ที่ใดในลูปการโต้ตอบเลย

จุดที่โมเดลอย่าง Grok 4.6 ปรากฏตัวขึ้นคือในระดับที่สูงขึ้นไปหนึ่งชั้น: ในฐานะสิ่งที่เขียนโครงสร้างการประเมิน วิเคราะห์บทบันทึก หรือขับเคลื่อนเอเจนต์ที่ใช้เครื่องมือซึ่งคุณกำลังพยายามศึกษาพฤติกรรมของมัน นั่นคือบทบาทที่ GPT-5.6 Sol รับบทในงานสืบสวนของ METR อย่างแม่นยำ — ประมาณ 5% ของฝูง และเป็นนักวิเคราะห์ที่อ่านบันทึก — และเป็นบทบาทที่ราคาและหน้าต่างบริบทของ Grok 4.6 ทำให้มีต้นทุนต่ำ
ช่องว่างของหลักฐานตรงนี้กว้างกว่าในคู่แข่งขันเหล่านี้ส่วนใหญ่
คะแนน index ของ Grok 4.6 ถูกวัดอย่างอิสระ rate card ของมันถูกเผยแพร่ และ context window ของมันถูกบันทึกไว้เป็นเอกสาร ตัวเลขของ Agora-2 มาจากรายงานที่เขียนโดย Team Odyssey และไม่มีใครทำซ้ำ บนคลิป monitoring สามสิบคลิป renderer แบบ structured-prefix ของมันทำได้ 30.11 dB PSNR เทียบกับ 20.67 dB สำหรับ VAE baseline — การเปรียบเทียบที่รายงานเองเตือนว่าเป็นระหว่างระบบที่สมบูรณ์ซึ่งมีงบประมาณการฝึกที่ไม่เท่ากัน ไม่ใช่การทดสอบสถาปัตยกรรมแบบแยกส่วน benchmark conditioning ของมัน ซึ่งแสดงการลดเวลาของ denoiser ลง 45.8% เมื่อเทียบกับ cross-attention ใช้ denoiser ที่เริ่มต้นแบบสุ่มบนอินพุตสังเคราะห์ และวัดต้นทุนการประมวลผล ไม่ใช่คุณภาพภาพ
จากนั้นก็เป็นส่วนข้อจำกัด ซึ่งตรงไปตรงมาอย่างผิดปกติ ค่า 15 latent updates และ 30 เฟรมต่อวินาทีที่ระบุไว้เป็นเพียงเป้าหมายเท่านั้น อัตราเฟรมที่คงที่และความหน่วงจากอินพุตไปยังจอแสดงผลระหว่างการโต้ตอบแบบหลายเอเจนต์สด ๆ “ยังไม่ได้รับการประเมินเชิงปริมาณ” คุณภาพภาพในระยะยาว ความสอดคล้องระหว่างมุมมอง และการยึดตามการกระทำแบบต้นทางถึงปลายทาง ล้วนถูกระบุว่ายังไม่ได้ประเมิน สภาพแวดล้อมนี้ต้องใช้เกมเอนจินที่มีการติดตั้งเครื่องมือวัด พร้อมเรขาคณิตที่ชัดเจนและชุดคำศัพท์ลักษณะปรากฏที่ตายตัว และการถ่ายโอนไปยังแอสเซต กฎ หรือสภาพแวดล้อมอื่นยังไม่ได้ทดสอบ อ่านรายการนั้นก่อนที่คุณจะอ่านตัวเลขพาดหัวใด ๆ เกี่ยวกับ Agora-2
อันไหนที่ควรอยู่ในสแต็กของคุณ
หากคุณกำลังรันหรือศึกษาระบบหลายเอเจนต์อยู่ในตอนนี้ Grok 4.6 คือองค์ประกอบที่คุณนำไปดีพลอยได้จริง — โมเดลข้อความระดับแนวหน้าในอัตราที่ทำให้ฝูงเอเจนต์ขนาดใหญ่จ่ายไหว พร้อมคะแนนที่เผยแพร่และพื้นผิว API ที่มีเอกสารกำกับบน OrcaRouter มันให้บริการในราคาตามที่ xAI ประกาศเองโดยไม่มีการบวกเพิ่มเลย ดังนั้นราคา $2/$6 ข้างต้นและการเปลี่ยนแปลงอัตราค่าใช้จ่ายในอนาคตจะไปถึงบิลของคุณในวันที่เกิดขึ้นจริง พร้อมกับการสลับไปปลายทางสำรองอัตโนมัติหากปลายทางหลักเสื่อมประสิทธิภาพ ทั้งสองข้อนี้สำคัญเป็นพิเศษกับงานระดับฝูง: เอเจนต์หนึ่งพันตัวคือหนึ่งพันโอกาสที่จะเจอผู้ให้บริการที่เสื่อมประสิทธิภาพ และการบวกเพิ่มบนผลลัพธ์ราคา $6 คือการบวกเพิ่มที่คูณกับทั้งการรันของคุณ

Agora-2 ไม่ใช่โครงสร้างพื้นฐานที่พร้อมนำไปใช้งานได้จริง และเราไม่ได้โฮสต์มัน — ไม่มี API ไม่มีเวต และไม่มีราคา มีเพียงตัวอย่างที่เล่นได้ของ Odyssey เองเท่านั้น สิ่งที่มันมอบให้คือคุณค่าในแบบที่แตกต่างออกไป: สภาพแวดล้อมที่ควบคุมได้สำหรับการวิจัยปฏิสัมพันธ์ ซึ่งรายงานของ METR ชี้ว่าตอนนี้เป็นเรื่องเร่งด่วน ด้วยต้นทุนการ์ด RTX PRO 4500 สี่ใบสำหรับการดูพร้อมกันสี่มุมมอง แทนที่จะเป็นบิลค่า API คำตัดสินอย่างตรงไปตรงมาคือ สองสิ่งนี้ไม่ได้แข่งขันกัน Grok 4.6 คือสมองด้านนโยบายที่คุณซื้อได้เป็นโทเคนวันนี้ ส่วน Agora-2 เป็นข้อเสนอสำหรับสถานที่ทดสอบว่าเกิดอะไรขึ้นเมื่อสมองเหล่านั้นหลายพันตัวมาพบกัน อันที่สองเป็นงานวิจัยที่น่าสนใจกว่าและเป็นผลิตภัณฑ์ที่สมบูรณ์น้อยกว่า และรายงานของ Odyssey เองก็ชัดเจนอย่างน่าสดชื่นว่าส่วนใดของมันยังเป็นเป้าหมายอยู่
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
