
Odyssey-3 vs Kandinsky 6.0 Video: โอเพนเวตส์และเสียง ปะทะพรีวิวเชิงโต้ตอบแบบปิด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Kandinsky 6.0 Video เปิดตัวเมื่อวันที่ 6 ตุลาคม 2026 พร้อมกับสิ่งหนึ่งที่การเปิดตัวโมเดลแบบเปิดแทบไม่เคยได้ในวันแรก นั่นคือการรองรับใน Diffusers, ComfyUI, vLLM-Omni, SGLang และ FastVideo ซึ่งทั้งหมดบันทึกไว้ในบันทึกการอัปเดตของรีโพเอง พร้อมกับรายงาน arXiv ที่ส่งเมื่อวันที่ 4 ตุลาคม และเช็กพอยต์ที่ใช้สัญญาอนุญาต MIT บน Hugging Face Odyssey-3 มาถึงสองวันถัดมา เมื่อวันที่ 8 ตุลาคม ในฐานะพรีวิวงานวิจัยสาธารณะของออโตเรเกรสซีฟดิฟฟิวชันทรานส์ฟอร์เมอร์ที่สร้างสภาพแวดล้อมจากพรอมป์ต์และคาดการณ์การเปลี่ยนแปลงแบบเรียลไทม์ขณะที่คุณเคลื่อนที่ผ่านมัน ตัวหนึ่งคือโมเดล 29 พันล้านพารามิเตอร์ที่คุณดาวน์โหลดและรันบน GPU ของคุณเองได้คืนนี้ อีกตัวคือระบบโต้ตอบที่คุณเข้าถึงได้เพียงผ่านพรีวิวในเบราว์เซอร์ของ Odyssey และแบบฟอร์มติดต่อ ทั้งสองคือสองขั้วของสิ่งที่คำว่า "โมเดลวิดีโอ" หมายถึงในสัปดาห์เดียวกันของเดือนตุลาคม 2026 และการเลือกระหว่างทั้งสองไม่ได้ขึ้นอยู่กับเบนช์มาร์กมากเท่ากับว่าใครถือเวตโมเดลอยู่
พวกมันยังต้องการสิ่งที่แตกต่างจากคุณด้วย Kandinsky 6.0 Video เป็นโมเดลสร้างสรรค์: ป้อนพรอมป์ต์เข้าไป ได้คลิปความยาวห้าวินาทีพร้อมเสียงที่ซิงก์ออกมา Odyssey-3 เป็นโมเดลพยากรณ์: ลงมือทำ แล้วดูว่าโลกตอบสนองอย่างไร ไม่มีตัวใดแทนที่อีกตัวได้ และการที่ทั้งสองเปิดตัวห่างกัน 48 ชั่วโมงคือบริบทที่มีประโยชน์ที่สุดที่แต่ละตัวมี
สถาปัตยกรรมทั้งสอง ในถ้อยคำของผู้ขายเอง
Kandinsky 6.0 Videoเป็นตระกูลของโมเดลการแพร่กระจายพื้นฐานสำหรับการสร้างเสียงและวิดีโอที่ซิงค์กัน ประกอบด้วย Kandinsky 6.0 Video Lite ที่มี 3B พารามิเตอร์ และ Kandinsky 6.0 Video Pro ที่ 29B ทั้งสองรุ่นสร้างคลิปความยาวห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงค์กัน รวมถึงการขยับปากให้ตรงกับเสียง ในโหมดข้อความเป็นเสียง-วิดีโอและภาพเป็นเสียง-วิดีโอ และโมเดลซูเปอร์เรโซลูชันแบบปลั๊กอินจะยกระดับเอาต์พุตเป็น Full HD 1920×1080 เทคนิคนี้คือ CrossDiT แบบสองสตรีมที่เชื่อมสตรีมวิดีโอที่ผ่านการฝึกมาก่อนเข้ากับสตรีมเสียงที่ฝึกใหม่ผ่าน cross-attention แบบสองทิศทาง เพื่อให้ทั้งสองโมดัลลิตี้สอดคล้องกันในด้านเวลาและความหมาย แทนที่จะสร้างแยกกันแล้วนำมารวมกันภายหลัง สูตรการฝึกเป็นแบบต่อเนื่อง: สตรีมเสียงถูกฝึกตั้งแต่เริ่มต้นบนคลังเสียงขนาดใหญ่ จากนั้นทั้งสองสตรีมถูกฝึกพร้อมกันบนข้อมูลเสียง-วิดีโอที่จับคู่กัน โดยยังคงรักษาคุณภาพของโมดัลเดียวไว้ ตามด้วยการปรับละเอียดแบบมีผู้สอน การฝึกหลังการฝึกด้วยการเรียนรู้แบบเสริมกำลัง และการกลั่นรู้
Odyssey-3 เป็นทรานส์ฟอร์มเมอร์แบบดิฟฟิวชันออโตเรเกรสซีฟที่ Odyssey อธิบายว่าเป็นโมเดลดิฟฟิวชันวิดีโอแบบหลายขั้นตอน ซึ่งขยายผ่านการบังคับด้วยครู (teacher forcing) และการมาสก์เชิงสาเหตุ (causal masking) ถูกฝึกให้ต่อเนื่องจากสิ่งที่สังเกตเห็นก่อนหน้าและทำนายสถานะในอนาคตโดยมีเงื่อนไขจากอินพุตการกระทำ จากนั้นจึงกลั่นด้วยการจับคู่การแจกแจงและการกลั่นแบบปรปักษ์ให้เป็นเวอร์ชันไม่กี่ขั้นตอนที่เร็วพอจะโต้ตอบด้วยได้ มันทำงานที่ 832×480 โดย Odyssey-3 Pro อยู่ที่ 1280×720 ไม่มีเสียง และจุดประสงค์ทั้งหมดของมันคือผลลัพธ์ที่ขึ้นอยู่กับสิ่งที่คุณทำเมื่อสักครู่นี้
การสนับสนุนตั้งแต่วันแรกคือความแตกต่างที่ไม่มีใครวัดเป็นมาตรฐาน

อ่านบันทึกการอัปเดตของ Kandinsky 6.0 อีกครั้ง เพราะมันเป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบนี้ เมื่อวันที่ 6 ตุลาคม โครงการได้บันทึกความพร้อมใช้งานใน Diffusers, ComfyUI node registry, vLLM-Omni, SGLang และ FastVideo รวมถึง Hugging Face Space สำหรับโมเดล Pro ที่กลั่นแล้ว นั่นคือห้าสแต็กการอนุมานอิสระในหนึ่งวัน สำหรับใครก็ตามที่รอเป็นเดือนเพื่อให้เช็คพอยต์ไปถึงเฟรมเวิร์กสำหรับให้บริการ นั่นคือตัวเลขที่ตัดสินว่าโมเดลนั้นใช้งานได้หรือไม่
ตอนนี้ลองวางมันเทียบกับเรื่องการเข้าถึงของ Odyssey-3 พรีวิวทำงานที่ experience.odyssey.systems พร้อมการนำทางแบบบุคคลที่หนึ่ง การนำทางแบบบุคคลที่สาม และการเคลื่อนกล้องอิสระ การเข้าถึง API เป็นแบบฟอร์มติดต่อ ไม่มีหน้าราคา ไม่มีเอกสารประกอบเกี่ยวกับขีดจำกัดอัตราการเรียกใช้งาน และไม่มีคีย์แบบบริการตนเอง ข้อกำหนด API ของเว็บไซต์อัปเดตล่าสุดเมื่อ 2026-01-22 และยังคงใช้ควบคุม "ต้นแบบของ Odyssey-2 API" — พื้นผิวเชิงพาณิชย์ยังไม่ได้รับการเขียนใหม่สำหรับโมเดลที่เปิดตัวในเดือนนี้
• รันที่ไหน — บน GPU ของคุณเอง พร้อมเวตและโค้ดภายใต้ MIT เทียบกับเซิร์ฟเวอร์ของ Odyssey เท่านั้น
• วิธีที่คุณผสานรวมมัน — ไพป์ไลน์ Diffusers, โหนด ComfyUI, vLLM-Omni, SGLang, FastVideo เทียบกับตัวอย่างพรีวิวบนเบราว์เซอร์และฟอร์มติดต่อ
• สิ่งที่คุณตรวจสอบได้ — สถาปัตยกรรม สูตรการฝึก และขนาดเช็กพอยต์ในรายงานสาธารณะ เทียบกับคำอธิบายของผู้ขายเกี่ยวกับไปป์ไลน์การฝึกที่ไม่มีน้ำหนักโมเดลและไม่มีเปเปอร์
• สิ่งที่คุณปรับเปลี่ยนได้ — ไฟน์จูน, LoRA, การควอนไทซ์และการกลั่น ซึ่งชุมชนเผยแพร่บน Hugging Face กันอยู่แล้วในวันถัดจากวันเปิดตัว เทียบกับไม่มีอะไรเลย
ทีละมิติ

• เอาต์พุต — คลิปความยาวห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์แล้วสำหรับทั้งสองระดับของ Kandinsky เทียบกับสภาพแวดล้อมแบบอินเทอร์แอกทีฟที่ไม่มีเสียงสำหรับ Odyssey-3
• ความละเอียด — Full HD 1920×1080 ผ่านโมเดลซูเปอร์เรโซลูชันแบบปลั๊กอินสำหรับ Kandinsky 6.0 Video เทียบกับ 832×480 สำหรับ Odyssey-3 และ 1280×720 สำหรับ Odyssey-3 Pro
• โมดัลลิตีอินพุต — ข้อความและภาพสำหรับ Kandinsky ในโหมดข้อความสู่เสียง-วิดีโอและภาพสู่เสียง-วิดีโอ; พร้อมต์พร้อมอินพุตควบคุมแบบสดสำหรับ Odyssey-3
• พารามิเตอร์ — 3B และ 29B ที่เปิดเผยสำหรับระดับ Lite และ Pro เทียบกับที่ไม่เปิดเผยสำหรับระดับ Odyssey-3 ทั้งสอง
• ฮาร์ดแวร์ — NVIDIA GPU และ Python 3.13 หรือ 3.14 พร้อมพรีเซ็ตที่จัดส่งมาสำหรับ H100/H200 ไปจนถึงการ์ดระดับ RTX 5090 สำหรับ Kandinsky; เบราว์เซอร์สำหรับ Odyssey-3
• ราคา — $0 ต่อคลิปสำหรับ Kandinsky 6.0 Video หากคุณมี GPU เทียบกับ Odyssey-3 ที่ไม่มีราคาเผยแพร่ใดๆ ส่วนค่าประมาณต้นทุนแบบปรับมาตรฐานของบอร์ดสำหรับ Odyssey-3 และ Odyssey-3 Pro อยู่ที่ $0.139 และ $0.267 ต่อวิดีโอที่สร้างขึ้น โดยไม่รวมการจัดการพรอมป์ต
• การให้คะแนนโดยบุคคลที่สาม — ผลงานที่สร้างโดยโมเดลเองของทั้งสองโมเดลไม่ได้อยู่ในการเปรียบเทียบแบบตัวต่อตัวที่เป็นอิสระ รายงานของ Kandinsky อาศัยการประเมินโดยมนุษย์แบบเคียงข้างกับรุ่นก่อนหน้า ส่วนตัวเลขของ Odyssey-3 มาจากการส่งผลการทดสอบ benchmark บวกกับการประเมินที่ดำเนินการโดยผู้ขายเอง
• สัญญาอนุญาต — MIT สำหรับ Kandinsky 6.0 Video เทียบกับไม่มีสัญญาอนุญาตที่เผยแพร่ เนื่องจากไม่มีเวทให้อนุญาต
สิ่งที่เกณฑ์มาตรฐานบอกและไม่ได้บอก
Kandinsky 6.0 Video ไม่ปรากฏบน Physics-IQ Verified ซึ่งเป็นกระดานของ Anates Labs และ DeepMind ที่ให้คะแนนการทำนายความต่อเนื่องของผลการทดลองทางกายภาพจริงครอบคลุม 41 โมเดล คู่เปรียบเทียบแบบตัวต่อตัวของ Odyssey-3 ในที่นี้ก็ไม่ปรากฏเช่นกัน เพราะกระดานนี้ให้คะแนนโมเดลที่สร้างคลิป และทั้งสองตัวนี้ก็สร้างคลิปเช่นกัน สิ่งที่กระดานนี้มีอยู่จริงคือสายโมเดลโลก (world-model) รุ่นก่อนของ Kandinsky อย่าง Kandinsky-WM 1.0 ซึ่งอยู่อันดับ 20 และ −8.02 pp เทียบกับค่าเฉลี่ยของแทร็ก — เป็นตระกูลที่ต่างกัน จุดประสงค์ที่ต่างกัน และเป็นรายการ Kandinsky เพียงหนึ่งเดียวบนกระดาน
แถวของ Odyssey-3 เพื่อเปรียบเทียบ: อันดับ 8 ที่ +2.15 pp บนพรอมป์ของ benchmark เอง และ $0.129 ต่อวิดีโอ และอันดับ 3 ที่ +9.99 pp บนพรอมป์ที่กำหนดเอง โดย Odyssey-3 Pro อยู่อันดับสองโดยรวมที่ +11.15 pp ตัวเลขเหล่านี้ดีกว่าอะไรก็ตามที่สาย Kandinsky มีในการทดสอบนั้น และยังเป็นการวัดความสามารถที่แตกต่างออกไป — Odyssey-3 ถูกให้คะแนนจากสิ่งที่มันคาดการณ์หลังการรบกวน ซึ่งเป็นสิ่งเดียวกับที่พรีวิวของมันนำเสนอขาย
หลักฐานของ Kandinsky เองคือการประเมินโดยมนุษย์ในรายงานทางเทคนิค: Kandinsky 6.0 Video Pro เอาชนะรุ่นก่อนอย่าง Kandinsky 5.0 Video Pro ได้อย่างชัดเจน และยังคงแข่งขันได้กับโมเดลสร้างเสียงและวิดีโอชั้นนำ โดยเฉพาะด้านคุณภาพเสียงพูด นั่นเป็นการเปรียบเทียบแบบเคียงข้างที่ผู้ขายจัดทำขึ้นเอง และเป็นข้ออ้างประเภทที่โมเดลเช็กพอยต์ที่เผยแพร่แล้วสามารถถูกตรวจสอบเทียบได้โดยใครก็ตามที่มี 5090 และมีเวลาช่วงบ่ายสักหนึ่งช่วง ข้ออ้างในลักษณะเดียวกันของ Odyssey-3 ไม่มีใครตรวจสอบได้หากไม่มีคีย์ API

การเข้าถึงพวกเขา
OrcaRouter ไม่ได้โฮสต์โมเดลใดในสองตัวนี้ และจะไม่มีวันทำให้เข้าใจเป็นอย่างอื่น: Odyssey-3 ไม่มีอัตราค่าบริการที่ประกาศไว้ให้ใครนำไปกำหนดเส้นทางได้ และ Kandinsky 6.0 Video เป็น open weights ซึ่งหมายความว่าวิธีที่ถูกต้องในการรันคือการตั้งค่าของรีโพซิทอรีเองบน GPU ของคุณเอง ไม่ใช่ปลายทางแบบโฮสต์ (hosted endpoint)
จุดที่คีย์ OrcaRouter เพียงคีย์เดียวเข้าไปเสียบอยู่คือชั้นที่ล้อมรอบการทดลองนี้เอง repository ของ Kandinsky สมมติว่าคุณเป็นคนจัดหา GPU สภาพแวดล้อม และการเปรียบเทียบให้เอง สิ่งที่มันไม่ได้จัดหาให้คือวิธีเรียกโมเดลที่คุณต้องการนำมาเป็นคู่เปรียบเทียบ โมเดลกว่า 200 ตัวอยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% — รวมถึง minimax/minimax-h3 โมเดลวิดีโอแบบเปิดน้ำหนักที่ MiniMax เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 ในราคา $0.08 ต่อวินาทีของเอาต์พุต 768P — ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ใบแจ้งหนี้ของคุณก็รับผลในวันเดียวกัน การสลับไปใช้ระบบสำรองอัตโนมัติช่วยไม่ให้การรันประเมินผลทั้งชุดล่มสลายเพราะชั่วโมงแย่ ๆ ของ upstream รายใดรายหนึ่ง และ routing DSL ช่วยให้คุณวางโมเดลวิดีโอแบบโฮสต์และโมเดลวิชันไว้เบื้องหลังอินเทอร์เฟซเดียวได้ เมื่องานคือการสร้างแล้วจึงให้คะแนน คุณยังต้องโคลน repo และรันการตั้งค่าเองอยู่ดี แค่คุณไม่จำเป็นต้องสร้างอีกครึ่งหนึ่งของชุดอุปกรณ์เอง
คุณอยากได้อันไหนจริงๆ
หากคุณต้องการผลลัพธ์ที่เป็นของคุณเอง — เงื่อนไขเชิงพาณิชย์ที่คุณอ่านได้ น้ำหนักที่คุณปรับแต่งได้ และไปป์ไลน์ที่ทำงานได้โดยไม่ต้องรอให้ API ของคนอื่นออนไลน์ — Kandinsky 6.0 Video คือคำตอบ และการรองรับเฟรมเวิร์กตั้งแต่วันแรกหมายความว่าคุณไม่ได้เดิมพันกับชิ้นงานวิจัยชิ้นหนึ่ง หากคุณต้องการเสียงบนวิดีโอ มันเป็นตัวเดียวในสองตัวที่สร้างเสียงออกมาได้
ถ้าปัญหาคือการพยากรณ์มากกว่าการผลิต — นโยบายที่ต้องตอบสนอง สภาพแวดล้อมการฝึก หรืออะไรก็ตามที่สถานะถัดไปขึ้นอยู่กับการกระทำครั้งล่าสุด — Odyssey-3 เป็นเพียงตัวเดียวในสองตัวที่ทำสิ่งนั้นได้ และยังเป็นตัวที่คุณซื้อไม่ได้ด้วย นั่นคือภาพที่ตรงไปตรงมาของการเปรียบเทียบนี้ในสัปดาห์ที่ทั้งคู่เปิดตัว: โมเดลเปิดที่คุณดาวน์โหลดได้ กับโมเดลแบบโต้ตอบที่คุณทำได้เพียงลองใช้ โดยหลักฐานจากการวัดมาตรฐานสนับสนุนตัวแบบปิด และหลักฐานในทางปฏิบัติสนับสนุนตัวแบบเปิด
