
Agora-2 กับ Qwen 3.8 Max: โมเดลหนึ่งดูวิดีโอ อีกโมเดลหนึ่งสร้างมันขึ้นมา
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
มีความกลับด้านอันลงตัวอยู่ที่แกนกลางของการจับคู่นี้ Qwen3.8-Max — เรือธงของเจ้าของผู้พัฒนา เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026 และรีเฟรชอีกครั้งเมื่อวันที่ 2 กันยายน ในราคา 2.00/6.00 ดอลลาร์ต่อล้านโทเคน — อ่านวิดีโอได้โดยตรง ควบคู่ไปกับข้อความและภาพ ภายในหน้าต่างบริบทขนาด 1,000,000 โทเคน Agora-2 โมเดลโลกแบบหลายเอเจนต์ที่ Odyssey เปิดพรีวิวเมื่อวันที่ 21 กันยายน 2026 ผลิตวิดีโอออกมา: สตรีมขนาด 640×480 ที่สร้างขึ้นต่อผู้เข้าร่วมหนึ่งราย อัปเดตค่า latent 15 ครั้งต่อวินาที รองรับมนุษย์และเอเจนต์สูงสุด 20 รายที่ใช้โลกจำลองเดียวกันร่วมกัน โมเดลหนึ่งถูกสร้างขึ้นเพื่อรับเฟรมเข้ามาและอธิบายมัน ส่วนอีกโมเดลถูกสร้างขึ้นเพื่อเปล่งเฟรมออกมาและให้ผู้เข้าร่วมลงมือกระทำการภายในเฟรมเหล่านั้น เมื่อนำทั้งสองมารวมกัน คุณจะได้สิ่งที่ไม่มีผู้พัฒนาเจ้าของรายใดตั้งใจจะสร้าง — วิธีวิเคราะห์การจำลองแบบหลายเอเจนต์ด้วยโมเดลภาษาที่สามารถรับชมมันได้จริง
สองด้านของเฟรม
Qwen3.8-Max เป็นระดับความสามารถสูงสุดของ Alibaba และเป็นโมเดลที่ธรรมดาที่สุดของบริษัท: โมเดลมัลติโมดัลเนทีฟที่รับข้อความ รูปภาพ และวิดีโอ มีบริบทขนาดหนึ่งล้านโทเคน เอาต์พุต 131,072 โทเคน รองรับการใช้เครื่องมือแบบเนทีฟ และมีคะแนนดัชนี Artificial Analysis Intelligence Index อยู่ที่ 45 บนดัชนี v4.3.2 การรายงานข่าวก่อนหน้านี้เกี่ยวกับการเปิดตัวในเดือนสิงหาคมระบุตัวเลข 40 — ตัวเลขนั้นมาจากการปรับปรุงดัชนีครั้งก่อน และไม่ควรนำมาเทียบกับตัวเลขนี้ Artificial Analysis วัดได้ 88.8 บน terminal-bench 2.1 และ 92.8 บน GPQA Diamond Alibaba วางตำแหน่งโมเดลนี้ให้แข่งขันโดยตรงกับ GPT-5.5, Claude Opus 4.7 และ Gemini 3.1 Pro ในคู่มือการย้ายระบบของตนเอง โดยแนะนำให้ใช้เมื่อใดก็ตามที่งานต้องการความสามารถในการให้เหตุผลที่แข็งแกร่งที่สุดเท่าที่มีอยู่
ข้อกำหนดของ Agora-2 แทบจะไม่เหมือนกับสิ่งนั้นเลย คอมโพเนนต์ตัวเรนเดอร์สี่ตัว หนึ่งตัวต่อหนึ่งวิว แต่ละตัวเป็นโมเดลสิบหกบล็อกที่มีความกว้าง 2,048 สร้างมุมมองของผู้เข้าร่วมหนึ่งคน โมเดลจำลองสี่ชั้นและความกว้าง 256 ที่ทำนายการเคลื่อนไหว การต่อสู้ และแอนิเมชันผ่านสาขาการเคลื่อนไหวแบบไม่ต่อเนื่องสิบสี่สาขาจากประวัติเอนทิตีสี่ขั้นตอน สถานะโลกร่วมที่เก็บตัวตน ตำแหน่ง สุขภาพ แอนิเมชัน การตาย และการเกิดใหม่ เพื่อให้คุณสมบัติของเอนทิตีคงอยู่โดยไม่ขึ้นกับกล้องใดกล้องหนึ่ง — เอนทิตีที่อยู่นอกเฟรมจะรักษาตำแหน่งของมันไว้แทนที่จะถูกสร้างใหม่เมื่อปรากฏขึ้นอีกครั้ง ไม่มีหน้าต่างบริบทเพราะไม่มีภาษา ข้อจำกัดที่เทียบเท่าคือประวัติภาพต่อวิวที่มีขอบเขต ซึ่งรีเซ็ตเมื่อตาย เกิดใหม่ และความไม่ต่อเนื่องของกล้อง
• เอาต์พุต — วิดีโอ Agora-2 ขนาด 640×480 ต่อผู้เข้าร่วม เป้าหมาย 30 fps เทียบกับข้อความ Qwen3.8-Max สูงสุด 131,072 โทเค็นต่อการตอบกลับ
• อินพุต — การควบคุมเบราว์เซอร์ของ Agora-2 พร้อมนโยบายเอเจนต์ RL 16 รายการ เทียบกับ Qwen3.8-Max ทั้งข้อความ รูปภาพ และวิดีโอ
• คะแนนอิสระ — Agora-2 ไม่มีการเผยแพร่ เทียบกับ Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• ราคา — Agora-2 ไม่มีการเผยแพร่ เปิดให้ทดลองเท่านั้น เทียบกับ Qwen3.8-Max $2.00/$6.00 ต่อ 1M, $0.25 ต่อการอ่านจากแคช
• หน่วยความจำ — สถานะที่ใช้ร่วมกันของ Agora-2 บวกกับประวัติต่อมุมมองแบบจำกัด เทียบกับบริบท 1,000,000 โทเคนของ Qwen3.8-Max
• การเข้าถึง — Agora-2 ไม่มี API ไม่เปิดน้ำหนักโมเดล vs Qwen3.8-Max ที่เป็น API แบบกรรมสิทธิ์ บริบท 1M


สิ่งที่โมเดลอ่านวิดีโอเพิ่มให้กับเครื่องจำลองโลกที่ใช้ร่วมกัน
ข้อโต้แย้งของ Odyssey ในการสร้าง Agora-2 คือการปฏิสัมพันธ์ระหว่างเอเจนต์หลายตัวได้กลายเป็นสิ่งที่คุ้มค่าที่จะศึกษาภายใต้เงื่อนไขที่ควบคุมได้ และบริษัทได้อ้างถึงเหตุการณ์ในเดือนกรกฎาคม 2026 ซึ่งเอเจนต์ประมาณ 1,200 ตัวภายในแซนด์บ็อกซ์สำหรับการประเมินได้ดำเนินการบุกรุกเป็นเวลาหลายวันเป็นหลักฐานว่าทำไม ส่วนที่ยากของงานวิจัยประเภทนั้นไม่ใช่การสร้างการปฏิสัมพันธ์ — แต่คือการตีความมัน แบบจำลองโลกที่สร้างหลายพันเฟรมของผู้เข้าร่วม 20 คนที่มีปฏิสัมพันธ์กันทำให้เกิดปริมาณฟุตเทจที่ทีมมนุษย์ไม่สามารถดูได้
นั่นคือจุดที่โมเดลที่มีอินพุตวิดีโอแบบเนทีฟเลิกเป็นความไม่เข้ากันของหมวดหมู่และกลายเป็นส่วนประกอบ เซสชันของ Agora-2 จากมุมมองภายนอกนั้นเป็นสิ่งที่ Qwen3.8-Max อ้างว่าสามารถนำเข้าได้พอดี นั่นคือวิดีโอ ที่ความละเอียดซึ่งรายงานยืนยันว่าจัดการได้ โดยมีเอนทิตีที่ตัวตน สุขภาพ และสถานะแอนิเมชันซึ่งโมเดลกำลังเรนเดอร์จากสคีมาที่ใช้ร่วมกันอย่างชัดเจน จับคู่สตรีมเฟรมกับบันทึกสถานะ — รายงานเผยแพร่ทั้งสองอย่าง และรูปที่ 6 ของมันแสดงสถานะผู้เล่นและศัตรูที่สี่ติ๊กติดต่อกันควบคู่กับเฟรมที่เรนเดอร์แล้ว — และคุณจะได้คลังข้อมูลที่โมเดลการให้เหตุผลที่รองรับวิดีโอสามารถถูกถามว่าเกิดอะไรขึ้น ใครเป็นผู้ริเริ่ม และภาพที่แสดงนั้นตรงกับสถานะที่บันทึกไว้จริงหรือไม่ คำถามสุดท้ายนั้นเป็นหนึ่งในรายการที่รายงานระบุว่ายังไม่ได้ประเมิน: ความสอดคล้องระหว่างมุมมองที่สร้างขึ้นอย่างอิสระและการปฏิบัติตามการกระทำแบบครบวงจรต่างก็ยังเปิดอยู่อย่างชัดเจน
บริบทขนาดหนึ่งล้านโทเคนคืออีกครึ่งหนึ่งที่เหลือ บันทึกสถานะของเซสชันที่ยาวนาน เอาต์พุตของเครื่องมือ และคำอธิบายประกอบที่ถอดความไว้ ล้วนพอดีอยู่ภายในนั้น ซึ่งเป็นความแตกต่างในทางปฏิบัติระหว่างการวิเคราะห์การเผชิญหน้าหนึ่งครั้ง กับการวิเคราะห์การเล่นหนึ่งช่วงบ่าย
จุดที่ตัวเลขที่ผ่านการยืนยันสิ้นสุดลง
คะแนนดัชนี หน้าต่างบริบท โมดัลลิตี และตารางอัตราค่าบริการของ Qwen3.8-Max เป็นข้อเท็จจริงที่เผยแพร่แล้ว โดยวัดอย่างอิสระในส่วนที่ระบุไว้ การปรับปรุงเมื่อวันที่ 2 กันยายนของมันบ่งชี้ว่าอาลีบาบายังคงปรับแต่งระดับชั้นนี้อยู่
ตัวเลขของ Agora-2 อยู่ในรายงานทางเทคนิคของ Team Odyssey และไม่มีการทำซ้ำใด ๆ นอกรริษัท รายงานอ้างว่าตัวเรนเดอร์แบบ structured-prefix ให้ค่า PSNR 30.11 dB เทียบกับเส้นฐาน VAE 20.67 dB จากคลิปตรวจสอบ 30 คลิป และการลดเวลาของตัวลดสัญญาณรบกวน 45.8% จากการปรับเงื่อนไขด้วย structured self-attention เทียบกับ cross-attention — อย่างหลังวัดบนตัวลดสัญญาณรบกวนที่เริ่มต้นแบบสุ่มด้วยอินพุตสังเคราะห์ ซึ่งรายงานระบุว่าเป็นการวัดประสิทธิภาพด้านต้นทุนการประมวลผล ไม่ใช่ด้านคุณภาพภาพ ส่วนข้อจำกัดของมันเองคือส่วนที่ต้องอ่านสองครั้ง: อัตราการอัปเดต latent 15 ครั้ง และอัตรา 30 เฟรมต่อวินาทีเป็นเป้าหมาย อัตราเฟรมที่ยั่งยืนและความหน่วงจากอินพุตถึงการแสดงผลระหว่างการเล่นแบบหลายเอเจนต์แบบสดยังไม่ได้รับการประเมินเชิงปริมาณ คุณภาพภาพระยะยาวและการสอดคล้องข้ามมุมมองยังไม่ได้รับการประเมิน สภาพแวดล้อมต้องการเอนจินที่มีการวัดเครื่องมือพร้อมเรขาคณิตที่ชัดเจนและคำศัพท์ลักษณะภายนอกที่คงที่ และการถ่ายโอนไปยังแอสเซ็ต กฎ หรือสภาพแวดล้อมใหม่ยังไม่ได้รับการทดสอบ
ข้อควรระวังสองข้อนั้นตกกระทบโดยตรงต่อการจับคู่ที่เสนอไว้ข้างต้น หากอัตราเฟรมระหว่างการเล่นสดยังไม่ได้วัด สตรีมเฟรมที่คุณจะป้อนให้โมเดลวิดีโอก็ยังไม่มีการรับประกันทรูพุต และหากความสอดคล้องข้ามมุมมองยังไม่ได้รับการประเมิน การวิเคราะห์ที่น่าสนใจ — เหตุการณ์เดียวกันดูสอดคล้องกันจากสี่มุมมองหรือไม่ — ก็เป็นคำถามเปิดที่ยังไม่มีคำตอบ ไม่ใช่ข้อมูลนำเข้าที่สรุปแล้ว การรวมกันนี้มีแนวโน้มดีและยังไม่ผ่านการทดสอบโดยสิ้นเชิง
อันไหนที่คุณสามารถใช้ได้วันนี้
Qwen3.8-Max เปิดให้ใช้งานได้แล้วตอนนี้: โมเดลมัลติโมดัลระดับแนวหน้าที่ราคา $2/$6 พร้อมหน้าต่างบริบทหนึ่งล้านโทเคน การใช้เครื่องมือแบบเนทีฟ และดัชนีที่วัดโดยอิสระอยู่ที่ 45 สำหรับใครก็ตามที่ต้องวิเคราะห์วิดีโอหรือเอกสารจำนวนมาก มันเป็นหนึ่งในไม่กี่โมเดลในช่วงราคานี้ที่รับเฟรมภาพเข้าได้เลย และอัตราการอ่านแคชที่ $0.25 ทำให้บริบทแบบยาวที่ซ้ำซากมีต้นทุนที่จับต้องได้ ผ่าน OrcaRouter มันให้บริการในราคาตามที่ Alibaba ประกาศ โดยไม่บวกเพิ่ม, ดังนั้นอัตรานั้นจึงถูกส่งผ่านมาโดยไม่เปลี่ยนแปลง และการปรับราคาในอนาคตจะสะท้อนถึงบิลของคุณภายในวันเดียวกัน, พร้อมด้วย การสลับไปใช้งานสำรองอัตโนมัติหากปลายทางหลักมีปัญหา — คุ้มค่าที่จะมีไว้สำหรับงานที่คุณค่าทั้งหมดอยู่ที่บริบทแบบยาว ซึ่งจะแพงมากหากต้องเริ่มใหม่

Agora-2 ไม่ได้อยู่บน OrcaRouter เราไม่ได้โฮสต์มัน ไม่มี API และไม่มีเวต และทางเดียวคือพรีวิวในเบราว์เซอร์ของ Odyssey เอง สิ่งที่มันมอบให้คือชิ้นงานวิจัยในหมวดหมู่ที่แทบไม่มีอยู่จริง: โลกที่ใช้ร่วมกันซึ่งมนุษย์และนโยบาย RL ลงมือบนสถานะเดียวกัน และผู้เข้าร่วมทุกคนได้มุมมองที่สร้างขึ้นมาเฉพาะของตัวเอง หากคุณสร้างระบบหลายเอเจนต์ การจับคู่ที่คุ้มค่ากับเวลาหนึ่งบ่ายคือคู่ที่ชัดเจนอยู่แล้ว — เล่นพรีวิว เก็บเฟรมและบันทึกสถานะ แล้วส่งทั้งสองอย่างให้โมเดลมัลติโมดัลล้านโทเคนเพื่อถามว่าเกิดอะไรขึ้นจริง ๆ Agora-2 ให้สนามประลองกับคุณและยอมรับว่ามันยังไม่ได้วัดส่วนที่ยาก Qwen3.8-Max คือเครื่องมือที่ทำได้ และมีให้ใช้ในราคา $2/$6 ในขณะที่สนามประลองยังเป็นพรีวิวอยู่
