
Odyssey-3: เวิลด์โมเดลตัวใหม่ของ Odyssey คว้ามงกุฎ Physics-IQ พร้อมเปิดให้ทดลองใช้แบบสาธารณะ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Odyssey-3 Pro ทำคะแนนได้ 66.1 ในแทร็ก video-to-video ของ Physics-IQ Verified และ Odyssey ได้เผยแพร่ตัวเลขนั้นเมื่อวันที่ 8 ตุลาคม 2026 เคียงข้างกับสิ่งที่นักพัฒนาสนใจจริง ๆ นั่นคือ พรีวิวงานวิจัยสาธารณะของ Odyssey-3 ซึ่งเป็น autoregressive diffusion transformer ที่สร้างขึ้นเพื่อสร้างสภาพแวดล้อมจากพรอมต์ แล้วคอยทำนายสภาพแวดล้อมนั้นต่อไปแบบเรียลไทม์ขณะที่มีคนเดินผ่านไปมา ขยับกล้อง หรือกระตุ้นเหตุการณ์บางอย่าง Odyssey-3 คือโมเดล ส่วน Odyssey-3 Pro คือระดับ 720p ของมัน ซึ่งทำงานที่ 1280×720 เทียบกับ 832×480 ของโมเดลฐาน ทั้งสองจะเปิดให้ใช้ในวันเดียวกัน ผ่านพรีวิวที่คุณขับเคลื่อนเองได้ที่ experience.odyssey.systems พร้อมช่องทางติดต่อแยกต่างหากสำหรับการเข้าถึง API
การจับคู่นั้นคือสิ่งที่ทำให้สิ่งนี้เป็นมากกว่าโพสต์เบนช์มาร์ก โมเดลโลกแบบอินเทอร์แอกทีฟเป็นแค่ของสาธิตมาสองปีแล้ว ตัวที่สร้างภาพเคลื่อนไหวดูสมจริงเพียงไม่กี่เฟรมบนเส้นทางตายตัวไม่ใช่ชิ้นงานเดียวกันกับโมเดลที่รักษาคำทำนายให้สอดคล้องกันหลังคุณกดปุ่มควบคุมรัว ๆ Odyssey กำลังอ้างถึงสิ่งอย่างหลัง และปล่อยให้ใครก็ได้ทดสอบข้ออ้างนั้น
ปล่อยอะไรออกไปกันแน่
สองเช็กพอยต์ สถาปัตยกรรมเดียว ไม่มีเวต
• Odyssey-3 — ระดับ 480p เอาต์พุต 832×480 ทำได้ 16 fps บนชุดทดสอบ benchmark โดยมีราคาอยู่ที่ $0.139 ต่อวิดีโอที่สร้างขึ้น ในคอลัมน์ต้นทุนที่ปรับมาตรฐานแล้วของลีดเดอร์บอร์ด
• Odyssey-3 Pro — ระดับ 720p, 1280×720 ระบุราคาไว้ที่ $0.267 ต่อวิดีโอในเกณฑ์เดียวกัน
• การเข้าถึง — พรีวิวสำหรับงานวิจัยในเบราว์เซอร์ พร้อมการนำทางแบบบุคคลที่หนึ่ง การนำทางแบบบุคคลที่สาม และการเคลื่อนกล้องอิสระ การเข้าถึง API เป็นแบบฟอร์มติดต่อ ไม่ใช่คีย์แบบบริการตนเอง
• ความเปิดกว้าง — ไม่มี ไม่มีค่าน้ำหนัก ไม่มีใบอนุญาต ไม่มีราคาต่อโทเค็นที่เผยแพร่ หน้าเงื่อนไข API บนเว็บไซต์เดียวกันได้รับการอัปเดตล่าสุดเมื่อ 2026-01-22 และยังคงใช้กับ "the prototype of Odyssey-2 API," ซึ่งบอกคุณว่าส่วนเชิงพาณิชย์ใหม่เพียงใด
สถาปัตยกรรมนี้อธิบายไว้ในบันทึกของ Odyssey เองว่าเป็นทรานส์ฟอร์เมอร์แบบดิฟฟิวชันวิดีโอหลายขั้นตอน ซึ่งขยายแบบออโตเรเกรสซีฟผ่าน teacher forcing และ causal masking โดยมีไปป์ไลน์หลังการฝึกที่ผสมผสาน distribution matching เข้ากับ adversarial distillation เป็นตัวแปรกลั่นแบบไม่กี่ขั้นตอน — ส่วนที่ทำให้การโต้ตอบแบบเรียลไทม์เป็นไปได้เลยทีเดียว ดิฟฟิวชันให้ความสมจริง ออโตเรเกรสชันให้โมเดลที่ทนทานต่อลำดับการกระทำ ส่วนการกลั่นให้ความเร็วระดับสัญญาณนาฬิกา ทั้งสามส่วนล้วนเป็นองค์ประกอบสำคัญ และทั้งสามส่วนนี้เป็นคำอธิบายของผู้ขายเกี่ยวกับระบบของตนเอง ไม่ใช่คำอธิบายจากแหล่งที่เป็นอิสระ
เกณฑ์มาตรฐาน — อ่านในแบบที่บอร์ดอ่านจริง ๆ
![The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.](https://cms.orcarouter.ai/api/media/file/2-1765.png)
Physics-IQ Verified ดำเนินการโดย Anates Labs ร่วมกับ DeepMind และเป็นเบนช์มาร์กที่ยากจะปั่นคะแนนได้อย่างแท้จริง: มันให้โมเดลดูวิดีโอของการทดลองทางฟิสิกส์จริง — พลศาสตร์ของไหล ทัศนศาสตร์ กลศาสตร์ของแข็ง แม่เหล็ก อุณหพลศาสตร์ — และให้คะแนนการต่อเนื่องเทียบกับสิ่งที่เกิดขึ้นจริง ปัจจุบันจัดอันดับ 41 โมเดลจาก 16 แล็บ คะแนน 66.1 ของ Odyssey-3 Pro เป็นคะแนนดิบสูงสุดในแทร็ก video-to-video ที่ Odyssey รายงาน และคอลัมน์ net-improvement ของบอร์ดเดียวกัน ซึ่งวัดการเพิ่มขึ้นเหนือค่าเฉลี่ยของแทร็กในหน่วยจุดเปอร์เซ็นต์ สะท้อนเรื่องที่ต่างออกไปอย่างแนบเนียน:
• การปรับปรุงสุทธิเมื่อเทียบกับค่าเฉลี่ยของแทร็ก — FLUX 3 [large] อยู่ในอันดับหนึ่งที่ +12.27 pp; Odyssey-3 Pro เป็นอันดับสองที่ +11.15 pp; Odyssey-3 เป็นอันดับสามที่ +9.99 pp
• ค่าใช้จ่ายต่อวิดีโอที่สร้างขึ้น — Odyssey-3 Pro $0.267, Odyssey-3 $0.139 เทียบกับ FLUX 3 [large] ที่ $0.868 และ Seedance 2.5 ที่ $2.838 (ค่าใช้จ่ายถูกปรับให้เป็นมาตรฐานที่ 24 fps และเอาต์พุตความกว้าง 1280 เท่าที่ลีดเดอร์บอร์ดทำได้ เพื่อให้เปรียบเทียบได้ข้ามโมเดลที่ไม่ได้ใช้เฟรมเรตเดียวกัน)
• ความเป็นผู้นำระดับเมตริกย่อย — Odyssey-3 ครองอันดับหนึ่งในเมตริกย่อยเชิงพื้นที่และเวลา ด้วยคะแนน 44.70 นำหน้า Odyssey-3 Pro ที่ 42.97; FLUX 3 [large] ครองอันดับหนึ่งด้านพื้นที่ ด้วย 64.36 และด้านพื้นที่แบบถ่วงน้ำหนัก ด้วย 53.25 โดยสองรายการ Odyssey อยู่ในอันดับสองและสี่ด้านพื้นที่:
ดังนั้นการตีความอย่างตรงไปตรงมาจึงไม่ใช่ "Odyssey-3 เป็นโมเดลวิดีโอที่ดีที่สุดในโลก" แต่คือ: โมเดลโลกที่สร้างขึ้นเพื่อการโต้ตอบได้ขึ้นมาอยู่ใกล้จุดสูงสุดของบอร์ดความสมเหตุสมผลทางกายภาพซึ่งก่อนหน้านี้เป็นสมบัติของเครื่องกำเนิดภาพยนตร์ และมันทำได้ด้วยต้นทุนที่ปรับมาตรฐานแล้วของ FLUX 3 ประมาณหนึ่งในสาม การอ้างแยกต่างหากของ Odyssey — 54.7 สำหรับ Odyssey-3 Pro ในแทร็กภาพเป็นวิดีโอ, best-of-8 — อยู่บนบอร์ดเดียวกัน และข้อแม้เดียวกันก็ใช้: สิ่งเหล่านี้คือการกำหนดค่าที่ส่งด้วยตนเอง และลีดเดอร์บอร์ดผสมรายการที่ส่งด้วยพรอมต์ที่กำหนดเองกับรายการที่รันด้วยพรอมต์ของเบนช์มาร์กเอง Odyssey ปรากฏในทั้งสองคอลัมน์ ซึ่งโปร่งใสอย่างผิดปกติ และยังหมายความว่าสองแถวของมันไม่ได้วัดสิ่งเดียวกัน

ทำไม "world model" ถึงไม่ใช่คำที่มีความหมายเหมือนกับ "video model"
ความแตกต่างนี้คือข้อโต้แย้งหลักของผลิตภัณฑ์ทั้งหมด จึงควรพูดให้ชัดเจน เครื่องมือสร้างคลิปจะรับพรอมป์ต์แล้วคืนผลลัพธ์แบบตายตัว ผลลัพธ์จะเหมือนกันสำหรับทุกคนที่ขอ ส่วน Odyssey-3 จะรับพรอมป์ต์แล้วคืนระบบที่คุณเข้าไปลงมือทำภายใน — โหมดกล้องมุมมองบุคคลที่หนึ่งและบุคคลที่สามของพรีวิว รวมถึงความสามารถในการรับเหตุการณ์ระหว่างการสร้าง คือกลไกที่มันใช้คาดการณ์ว่าจะเกิดอะไรขึ้นต่อไปจากสิ่งที่คุณเพิ่งทำ ไม่ใช่จากสิ่งที่พรอมป์ต์บอก
คุณสมบัตินั้นคือสิ่งที่ทำให้ผลลัพธ์ของระบบทางกายภาพในสื่อเปิดตัวของ Odyssey ดูเป็นเช่นนั้น บริษัทรายงานว่าตัวถอดรหัสการกระทำที่ติดตั้งกับแบบจำลองโลกที่ถูกแช่แข็ง ซึ่งฝึกฝนด้วยข้อมูลการสาธิตของหุ่นยนต์หลายสิบชั่วโมง ได้สร้างพฤติกรรมการกู้คืนที่ไม่เคยมีอยู่ในข้อมูลการสาธิต เช่น การปรับทิศทางของตัวจับใหม่หลังจากจับพลาด การเก็บวัตถุที่ตกในทิศทางที่ผิดปกติ บริษัทรายงานว่านโยบายหุ่นยนต์ฮิวแมนนอยด์ที่สร้างโดย Flexion บนพื้นฐานของ Odyssey-3 ด้วยข้อมูลการควบคุมระยะไกลหลายสิบชั่วโมง ยังคงทำงานภายใต้การเปลี่ยนแปลงของแสงซึ่งทำให้พื้นฐาน VLA ที่มันถูกเปรียบเทียบด้วยนั้นล้มเหลว บริษัทรายงานว่านโยบายการขับขี่ที่ฝึกฝนด้วยข้อมูลจำลอง 20 ชั่วโมง ซึ่งขับขี่แบบวงปิดบนถนนจริง โดยเดินทางได้ประมาณ 77% ของระยะทางระหว่างการแทรกแซงของผู้ขับขี่เพื่อความปลอดภัย เมื่อเทียบกับนโยบายที่ฝึกฝนด้วยภาพจริง บริษัทรายงานการนำทางโดรนจากข้อมูลการบินจำลอง และการเล่นเกมใน GTA V ที่ถ่ายโอนการเคลื่อนไหวไปยัง Red Dead Redemption 2 และการขี่มอเตอร์ไซค์ไปยัง Sleeping Dogs โดยไม่ต้องฝึกฝนเพิ่มเติม
ผลลัพธ์ทั้งหมดนั้นเป็นผลที่ผู้ขายรายงานเอง โดยไม่มีการทำซ้ำอย่างอิสระ และในสองรายการนั้น Odyssey ระบุไว้อย่างชัดเจนว่าเป็นข้อสังเกตเชิงคุณภาพมากกว่าการวัด แต่หลักฐานเหล่านี้เป็นหลักฐานประเภทที่เหมาะสมสำหรับข้อกล่าวอ้างนี้ ส่วนที่น่าสนใจไม่ใช่ว่าโมเดลสามารถทำงานที่มันถูกฝึกมาได้ แต่คือการที่ backbone ที่ถูก freeze ไว้บวกกับ adapter ขนาดเล็กทำให้เกิดพฤติกรรมที่มีความหมายได้จากข้อมูลเพียงไม่กี่สิบชั่วโมง และบางครั้งก็ generalize เกินกว่าข้อมูลนั้น
อะไรที่ยังไม่ได้รับการพิสูจน์

สามสิ่ง และมันไม่ใช่เรื่องเล็ก
ประการแรก ยังไม่มีผู้ประเมินอิสระรายใดรัน Odyssey-3 รายการ Physics-IQ เป็นเพียงผลงานที่ส่งเข้ามา และแหล่งให้คะแนนแหล่งที่สองในบันทึกของ Odyssey เอง — WorldMark ซึ่ง Odyssey-3 ครองอันดับหนึ่งในสามจากสี่ split — เป็นการประเมินโดยผู้ขายที่ใช้คำบรรยายของ benchmark เอง และตามถ้อยคำของ Odyssey เองคือ "ค่าเฉลี่ยของคะแนนตัวชี้วัด 13 รายการที่รายงานไว้" นั่นคือบริษัทให้คะแนนตัวเองบนชุดข้อมูลของคนอื่น มันมากกว่าที่การเปิดตัวส่วนใหญ่มีให้ แต่มันไม่ใช่บุคคลที่สาม
ประการที่สอง การแบ่งเพียงหนึ่งเดียวที่ Odyssey-3 ไม่ชนะในการประเมินนั้น คือการแบ่งที่ใกล้เคียงกับคำกล่าวอ้างทางการตลาดมากที่สุด ในสภาพแวดล้อมจริงแบบบุคคลที่หนึ่ง มันอยู่อันดับสามที่ 80.6 ตามหลัง Lyra 2.0 ที่ 84.4 และ AlayaWorld ที่ 83.0 ความได้เปรียบของโมเดลในการประเมินเดียวกันนี้กระจุกตัวอยู่ในสภาพแวดล้อมแบบมีสไตล์และแบบบุคคลที่สาม — 77.2 ในบุคคลที่หนึ่งแบบมีสไตล์, 79.0 ในบุคคลที่สามแบบจริง, 76.3 ในบุคคลที่สามแบบมีสไตล์ หากคุณกำลังสร้างสำหรับการมีตัวตนแบบบุคคลที่หนึ่งที่สมจริงเหมือนภาพถ่าย อันดับที่คุณควรใส่ใจคืออันดับที่ Odyssey-3 ไม่ได้อยู่บนสุด
ประการที่สาม ความพร้อมใช้งาน “Research preview” มีความหมายจริงจังในประโยคนั้น ไม่มีหน้าราคา ไม่มีเอกสารเรื่อง rate limit และไม่มีคีย์แบบ self-serve ถ้าคุณต้องการใช้สิ่งนี้ในผลิตภัณฑ์ คุณต้องต่อคิว
การเปรียบเทียบโดยไม่มีสัญญาฉบับที่สอง
นี่คือปัญหาที่เกิดขึ้นจริงกับการเปิดตัวแบบนี้: Odyssey-3 เป็นสิ่งที่น่าสนใจที่สุดในวงการสร้างวิดีโอในสัปดาห์นี้ และคุณก็ยังไม่สามารถเรียกใช้งานมันได้ ส่วนโมเดลที่คุณจะใช้เปรียบเทียบกับมันจริง ๆ นั้นเป็นอีกเรื่องหนึ่ง
OrcaRouter ไม่ได้โฮสต์ Odyssey-3 และไม่มีราคาที่ประกาศไว้ให้ส่งต่อได้แม้ว่าเราจะโฮสต์ก็ตาม สิ่งที่คีย์เดียวเข้าถึงได้คือส่วนที่เหลือของชุดเปรียบเทียบ — minimax/minimax-h3 ที่ราคา $0.08 ต่อวินาทีของวิดีโอที่สร้างขึ้นที่ 768P ไลน์วิดีโอ Kling และโมเดลมากกว่า 200 รายการที่อยู่เบื้องหลัง endpoint เดียว — ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายเปลี่ยนราคา ก็จะปรากฏบนใบแจ้งหนี้ของคุณในวันเดียวกัน แทนที่จะเป็นตอนต่ออายุครั้งถัดไป การสลับสำรองอัตโนมัติระหว่างผู้ให้บริการ หมายความว่าการรันประเมินผลแบบเป็นชุดจะไม่ล้มเหลวเพียงเพราะผู้ให้บริการต้นทางรายหนึ่งกำลังมีปัญหาช่วงบ่าย และ routing DSL ช่วยให้คุณวางหลายโมเดลไว้เบื้องหลังอินเทอร์เฟซเดียว การเทียบกันแบบตัวต่อตัวจึงเป็นการแก้ไขคอนฟิกแทนที่จะเป็นการผสานรวมครั้งที่สอง หาก Odyssey เปิด API แบบ self-serve นั่นคือรูปแบบที่คุณอยากเสียบมันเข้าไป
อะไรจะยุติเรื่องนี้ได้
การรัน Odyssey-3 แบบอิสระบนฮาร์เนสที่มันไม่ได้เลือกเอง ผู้ปฏิบัติงานราวสิบสองคนที่มีสิทธิ์เข้าถึงพรีวิวอธิบายว่าสภาพแวดล้อมยังยึดโยงกันได้ตรงไหนหลังจากใช้กล้องอย่างหนักหนึ่งนาที และตรงไหนที่มันไม่ไหว ราคา สิ่งใดสิ่งหนึ่งในนั้นเปลี่ยนสิ่งนี้จากการเปิดตัวที่แข็งแกร่งให้กลายเป็นจุดอ้างอิง
สิ่งที่เป็นจริงอยู่แล้วนั้นมีขอบเขตแคบกว่าและยังน่าสนใจ: บนกระดานจัดอันดับสาธารณะเพียงแห่งเดียวที่วัดว่าโมเดลเชิงสร้างเข้าใจฟิสิกส์หรือไม่ แทนที่จะวัดว่ามันถ่ายภาพออกมาดีแค่ไหน โมเดลที่มีวัตถุประสงค์เพื่อการโต้ตอบกำลังอยู่ในอันดับที่สองและสาม โดยมีต้นทุนที่ปรับมาตรฐานแล้วต่ำกว่าโมเดลที่อยู่ในอันดับหนึ่ง
