ไทเทิลการ์ดสำหรับ Odyssey-3 vs Kandinsky 6.0 Video โดยมีแผงด้านซ้ายหัวข้อ Odyssey-3 ระบุว่าเป็นสภาพแวดล้อมแบบอินเทอร์แอกทีฟ พรีวิวงานวิจัยที่เปิดตัวเมื่อวันที่ 8 ต.ค. 2026 รองรับ 832x480 หรือ 1280x720 Pro ไม่มีเวตและไม่มีราคา; และแผงด้านขวาหัวข้อ Kandinsky 6.0 Video ระบุว่าเป็นเวตเปิด เมื่อวันที่ 6 ต.ค. 2026 ภายใต้สัญญาอนุญาต MIT คลิป 5 วินาที พร้อมเสียง 44 kHz Full HD 1920x1080 ไม่ได้ส่ง Physics-IQ
Guides & Insights

Odyssey-3 vs Kandinsky 6.0 Video: โอเพนเวตส์และเสียง ปะทะพรีวิวเชิงโต้ตอบแบบปิด

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Kandinsky 6.0 Video เปิดตัวเมื่อวันที่ 6 ตุลาคม 2026 พร้อมกับสิ่งหนึ่งที่การเปิดตัวโมเดลแบบเปิดแทบไม่เคยได้ในวันแรก นั่นคือการรองรับใน Diffusers, ComfyUI, vLLM-Omni, SGLang และ FastVideo ซึ่งทั้งหมดบันทึกไว้ในบันทึกการอัปเดตของรีโพเอง พร้อมกับรายงาน arXiv ที่ส่งเมื่อวันที่ 4 ตุลาคม และเช็กพอยต์ที่ใช้สัญญาอนุญาต MIT บน Hugging Face Odyssey-3 มาถึงสองวันถัดมา เมื่อวันที่ 8 ตุลาคม ในฐานะพรีวิวงานวิจัยสาธารณะของออโตเรเกรสซีฟดิฟฟิวชันทรานส์ฟอร์เมอร์ที่สร้างสภาพแวดล้อมจากพรอมป์ต์และคาดการณ์การเปลี่ยนแปลงแบบเรียลไทม์ขณะที่คุณเคลื่อนที่ผ่านมัน ตัวหนึ่งคือโมเดล 29 พันล้านพารามิเตอร์ที่คุณดาวน์โหลดและรันบน GPU ของคุณเองได้คืนนี้ อีกตัวคือระบบโต้ตอบที่คุณเข้าถึงได้เพียงผ่านพรีวิวในเบราว์เซอร์ของ Odyssey และแบบฟอร์มติดต่อ ทั้งสองคือสองขั้วของสิ่งที่คำว่า "โมเดลวิดีโอ" หมายถึงในสัปดาห์เดียวกันของเดือนตุลาคม 2026 และการเลือกระหว่างทั้งสองไม่ได้ขึ้นอยู่กับเบนช์มาร์กมากเท่ากับว่าใครถือเวตโมเดลอยู่

พวกมันยังต้องการสิ่งที่แตกต่างจากคุณด้วย Kandinsky 6.0 Video เป็นโมเดลสร้างสรรค์: ป้อนพรอมป์ต์เข้าไป ได้คลิปความยาวห้าวินาทีพร้อมเสียงที่ซิงก์ออกมา Odyssey-3 เป็นโมเดลพยากรณ์: ลงมือทำ แล้วดูว่าโลกตอบสนองอย่างไร ไม่มีตัวใดแทนที่อีกตัวได้ และการที่ทั้งสองเปิดตัวห่างกัน 48 ชั่วโมงคือบริบทที่มีประโยชน์ที่สุดที่แต่ละตัวมี

สถาปัตยกรรมทั้งสอง ในถ้อยคำของผู้ขายเอง

Kandinsky 6.0 Videoเป็นตระกูลของโมเดลการแพร่กระจายพื้นฐานสำหรับการสร้างเสียงและวิดีโอที่ซิงค์กัน ประกอบด้วย Kandinsky 6.0 Video Lite ที่มี 3B พารามิเตอร์ และ Kandinsky 6.0 Video Pro ที่ 29B ทั้งสองรุ่นสร้างคลิปความยาวห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงค์กัน รวมถึงการขยับปากให้ตรงกับเสียง ในโหมดข้อความเป็นเสียง-วิดีโอและภาพเป็นเสียง-วิดีโอ และโมเดลซูเปอร์เรโซลูชันแบบปลั๊กอินจะยกระดับเอาต์พุตเป็น Full HD 1920×1080 เทคนิคนี้คือ CrossDiT แบบสองสตรีมที่เชื่อมสตรีมวิดีโอที่ผ่านการฝึกมาก่อนเข้ากับสตรีมเสียงที่ฝึกใหม่ผ่าน cross-attention แบบสองทิศทาง เพื่อให้ทั้งสองโมดัลลิตี้สอดคล้องกันในด้านเวลาและความหมาย แทนที่จะสร้างแยกกันแล้วนำมารวมกันภายหลัง สูตรการฝึกเป็นแบบต่อเนื่อง: สตรีมเสียงถูกฝึกตั้งแต่เริ่มต้นบนคลังเสียงขนาดใหญ่ จากนั้นทั้งสองสตรีมถูกฝึกพร้อมกันบนข้อมูลเสียง-วิดีโอที่จับคู่กัน โดยยังคงรักษาคุณภาพของโมดัลเดียวไว้ ตามด้วยการปรับละเอียดแบบมีผู้สอน การฝึกหลังการฝึกด้วยการเรียนรู้แบบเสริมกำลัง และการกลั่นรู้

Odyssey-3 เป็นทรานส์ฟอร์มเมอร์แบบดิฟฟิวชันออโตเรเกรสซีฟที่ Odyssey อธิบายว่าเป็นโมเดลดิฟฟิวชันวิดีโอแบบหลายขั้นตอน ซึ่งขยายผ่านการบังคับด้วยครู (teacher forcing) และการมาสก์เชิงสาเหตุ (causal masking) ถูกฝึกให้ต่อเนื่องจากสิ่งที่สังเกตเห็นก่อนหน้าและทำนายสถานะในอนาคตโดยมีเงื่อนไขจากอินพุตการกระทำ จากนั้นจึงกลั่นด้วยการจับคู่การแจกแจงและการกลั่นแบบปรปักษ์ให้เป็นเวอร์ชันไม่กี่ขั้นตอนที่เร็วพอจะโต้ตอบด้วยได้ มันทำงานที่ 832×480 โดย Odyssey-3 Pro อยู่ที่ 1280×720 ไม่มีเสียง และจุดประสงค์ทั้งหมดของมันคือผลลัพธ์ที่ขึ้นอยู่กับสิ่งที่คุณทำเมื่อสักครู่นี้

การสนับสนุนตั้งแต่วันแรกคือความแตกต่างที่ไม่มีใครวัดเป็นมาตรฐาน

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

อ่านบันทึกการอัปเดตของ Kandinsky 6.0 อีกครั้ง เพราะมันเป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบนี้ เมื่อวันที่ 6 ตุลาคม โครงการได้บันทึกความพร้อมใช้งานใน Diffusers, ComfyUI node registry, vLLM-Omni, SGLang และ FastVideo รวมถึง Hugging Face Space สำหรับโมเดล Pro ที่กลั่นแล้ว นั่นคือห้าสแต็กการอนุมานอิสระในหนึ่งวัน สำหรับใครก็ตามที่รอเป็นเดือนเพื่อให้เช็คพอยต์ไปถึงเฟรมเวิร์กสำหรับให้บริการ นั่นคือตัวเลขที่ตัดสินว่าโมเดลนั้นใช้งานได้หรือไม่

ตอนนี้ลองวางมันเทียบกับเรื่องการเข้าถึงของ Odyssey-3 พรีวิวทำงานที่ experience.odyssey.systems พร้อมการนำทางแบบบุคคลที่หนึ่ง การนำทางแบบบุคคลที่สาม และการเคลื่อนกล้องอิสระ การเข้าถึง API เป็นแบบฟอร์มติดต่อ ไม่มีหน้าราคา ไม่มีเอกสารประกอบเกี่ยวกับขีดจำกัดอัตราการเรียกใช้งาน และไม่มีคีย์แบบบริการตนเอง ข้อกำหนด API ของเว็บไซต์อัปเดตล่าสุดเมื่อ 2026-01-22 และยังคงใช้ควบคุม "ต้นแบบของ Odyssey-2 API" — พื้นผิวเชิงพาณิชย์ยังไม่ได้รับการเขียนใหม่สำหรับโมเดลที่เปิดตัวในเดือนนี้

• รันที่ไหน — บน GPU ของคุณเอง พร้อมเวตและโค้ดภายใต้ MIT เทียบกับเซิร์ฟเวอร์ของ Odyssey เท่านั้น

• วิธีที่คุณผสานรวมมัน — ไพป์ไลน์ Diffusers, โหนด ComfyUI, vLLM-Omni, SGLang, FastVideo เทียบกับตัวอย่างพรีวิวบนเบราว์เซอร์และฟอร์มติดต่อ

• สิ่งที่คุณตรวจสอบได้ — สถาปัตยกรรม สูตรการฝึก และขนาดเช็กพอยต์ในรายงานสาธารณะ เทียบกับคำอธิบายของผู้ขายเกี่ยวกับไปป์ไลน์การฝึกที่ไม่มีน้ำหนักโมเดลและไม่มีเปเปอร์

• สิ่งที่คุณปรับเปลี่ยนได้ — ไฟน์จูน, LoRA, การควอนไทซ์และการกลั่น ซึ่งชุมชนเผยแพร่บน Hugging Face กันอยู่แล้วในวันถัดจากวันเปิดตัว เทียบกับไม่มีอะไรเลย

ทีละมิติ

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• เอาต์พุต — คลิปความยาวห้าวินาทีพร้อมเสียง 44 kHz ที่ซิงโครไนซ์แล้วสำหรับทั้งสองระดับของ Kandinsky เทียบกับสภาพแวดล้อมแบบอินเทอร์แอกทีฟที่ไม่มีเสียงสำหรับ Odyssey-3

• ความละเอียด — Full HD 1920×1080 ผ่านโมเดลซูเปอร์เรโซลูชันแบบปลั๊กอินสำหรับ Kandinsky 6.0 Video เทียบกับ 832×480 สำหรับ Odyssey-3 และ 1280×720 สำหรับ Odyssey-3 Pro

• โมดัลลิตีอินพุต — ข้อความและภาพสำหรับ Kandinsky ในโหมดข้อความสู่เสียง-วิดีโอและภาพสู่เสียง-วิดีโอ; พร้อมต์พร้อมอินพุตควบคุมแบบสดสำหรับ Odyssey-3

• พารามิเตอร์ — 3B และ 29B ที่เปิดเผยสำหรับระดับ Lite และ Pro เทียบกับที่ไม่เปิดเผยสำหรับระดับ Odyssey-3 ทั้งสอง

• ฮาร์ดแวร์ — NVIDIA GPU และ Python 3.13 หรือ 3.14 พร้อมพรีเซ็ตที่จัดส่งมาสำหรับ H100/H200 ไปจนถึงการ์ดระดับ RTX 5090 สำหรับ Kandinsky; เบราว์เซอร์สำหรับ Odyssey-3

• ราคา — $0 ต่อคลิปสำหรับ Kandinsky 6.0 Video หากคุณมี GPU เทียบกับ Odyssey-3 ที่ไม่มีราคาเผยแพร่ใดๆ ส่วนค่าประมาณต้นทุนแบบปรับมาตรฐานของบอร์ดสำหรับ Odyssey-3 และ Odyssey-3 Pro อยู่ที่ $0.139 และ $0.267 ต่อวิดีโอที่สร้างขึ้น โดยไม่รวมการจัดการพรอมป์ต

• การให้คะแนนโดยบุคคลที่สาม — ผลงานที่สร้างโดยโมเดลเองของทั้งสองโมเดลไม่ได้อยู่ในการเปรียบเทียบแบบตัวต่อตัวที่เป็นอิสระ รายงานของ Kandinsky อาศัยการประเมินโดยมนุษย์แบบเคียงข้างกับรุ่นก่อนหน้า ส่วนตัวเลขของ Odyssey-3 มาจากการส่งผลการทดสอบ benchmark บวกกับการประเมินที่ดำเนินการโดยผู้ขายเอง

• สัญญาอนุญาต — MIT สำหรับ Kandinsky 6.0 Video เทียบกับไม่มีสัญญาอนุญาตที่เผยแพร่ เนื่องจากไม่มีเวทให้อนุญาต

สิ่งที่เกณฑ์มาตรฐานบอกและไม่ได้บอก

Kandinsky 6.0 Video ไม่ปรากฏบน Physics-IQ Verified ซึ่งเป็นกระดานของ Anates Labs และ DeepMind ที่ให้คะแนนการทำนายความต่อเนื่องของผลการทดลองทางกายภาพจริงครอบคลุม 41 โมเดล คู่เปรียบเทียบแบบตัวต่อตัวของ Odyssey-3 ในที่นี้ก็ไม่ปรากฏเช่นกัน เพราะกระดานนี้ให้คะแนนโมเดลที่สร้างคลิป และทั้งสองตัวนี้ก็สร้างคลิปเช่นกัน สิ่งที่กระดานนี้มีอยู่จริงคือสายโมเดลโลก (world-model) รุ่นก่อนของ Kandinsky อย่าง Kandinsky-WM 1.0 ซึ่งอยู่อันดับ 20 และ −8.02 pp เทียบกับค่าเฉลี่ยของแทร็ก — เป็นตระกูลที่ต่างกัน จุดประสงค์ที่ต่างกัน และเป็นรายการ Kandinsky เพียงหนึ่งเดียวบนกระดาน

แถวของ Odyssey-3 เพื่อเปรียบเทียบ: อันดับ 8 ที่ +2.15 pp บนพรอมป์ของ benchmark เอง และ $0.129 ต่อวิดีโอ และอันดับ 3 ที่ +9.99 pp บนพรอมป์ที่กำหนดเอง โดย Odyssey-3 Pro อยู่อันดับสองโดยรวมที่ +11.15 pp ตัวเลขเหล่านี้ดีกว่าอะไรก็ตามที่สาย Kandinsky มีในการทดสอบนั้น และยังเป็นการวัดความสามารถที่แตกต่างออกไป — Odyssey-3 ถูกให้คะแนนจากสิ่งที่มันคาดการณ์หลังการรบกวน ซึ่งเป็นสิ่งเดียวกับที่พรีวิวของมันนำเสนอขาย

หลักฐานของ Kandinsky เองคือการประเมินโดยมนุษย์ในรายงานทางเทคนิค: Kandinsky 6.0 Video Pro เอาชนะรุ่นก่อนอย่าง Kandinsky 5.0 Video Pro ได้อย่างชัดเจน และยังคงแข่งขันได้กับโมเดลสร้างเสียงและวิดีโอชั้นนำ โดยเฉพาะด้านคุณภาพเสียงพูด นั่นเป็นการเปรียบเทียบแบบเคียงข้างที่ผู้ขายจัดทำขึ้นเอง และเป็นข้ออ้างประเภทที่โมเดลเช็กพอยต์ที่เผยแพร่แล้วสามารถถูกตรวจสอบเทียบได้โดยใครก็ตามที่มี 5090 และมีเวลาช่วงบ่ายสักหนึ่งช่วง ข้ออ้างในลักษณะเดียวกันของ Odyssey-3 ไม่มีใครตรวจสอบได้หากไม่มีคีย์ API

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

การเข้าถึงพวกเขา

OrcaRouter ไม่ได้โฮสต์โมเดลใดในสองตัวนี้ และจะไม่มีวันทำให้เข้าใจเป็นอย่างอื่น: Odyssey-3 ไม่มีอัตราค่าบริการที่ประกาศไว้ให้ใครนำไปกำหนดเส้นทางได้ และ Kandinsky 6.0 Video เป็น open weights ซึ่งหมายความว่าวิธีที่ถูกต้องในการรันคือการตั้งค่าของรีโพซิทอรีเองบน GPU ของคุณเอง ไม่ใช่ปลายทางแบบโฮสต์ (hosted endpoint)

จุดที่คีย์ OrcaRouter เพียงคีย์เดียวเข้าไปเสียบอยู่คือชั้นที่ล้อมรอบการทดลองนี้เอง repository ของ Kandinsky สมมติว่าคุณเป็นคนจัดหา GPU สภาพแวดล้อม และการเปรียบเทียบให้เอง สิ่งที่มันไม่ได้จัดหาให้คือวิธีเรียกโมเดลที่คุณต้องการนำมาเป็นคู่เปรียบเทียบ โมเดลกว่า 200 ตัวอยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศ โดยบวกเพิ่ม 0% — รวมถึง minimax/minimax-h3 โมเดลวิดีโอแบบเปิดน้ำหนักที่ Mini​Max เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 ในราคา $0.08 ต่อวินาทีของเอาต์พุต 768P — ดังนั้นเมื่อผู้ให้บริการเปลี่ยนราคา ใบแจ้งหนี้ของคุณก็รับผลในวันเดียวกัน การสลับไปใช้ระบบสำรองอัตโนมัติช่วยไม่ให้การรันประเมินผลทั้งชุดล่มสลายเพราะชั่วโมงแย่ ๆ ของ upstream รายใดรายหนึ่ง และ routing DSL ช่วยให้คุณวางโมเดลวิดีโอแบบโฮสต์และโมเดลวิชันไว้เบื้องหลังอินเทอร์เฟซเดียวได้ เมื่องานคือการสร้างแล้วจึงให้คะแนน คุณยังต้องโคลน repo และรันการตั้งค่าเองอยู่ดี แค่คุณไม่จำเป็นต้องสร้างอีกครึ่งหนึ่งของชุดอุปกรณ์เอง

คุณอยากได้อันไหนจริงๆ

หากคุณต้องการผลลัพธ์ที่เป็นของคุณเอง — เงื่อนไขเชิงพาณิชย์ที่คุณอ่านได้ น้ำหนักที่คุณปรับแต่งได้ และไปป์ไลน์ที่ทำงานได้โดยไม่ต้องรอให้ API ของคนอื่นออนไลน์ — Kandinsky 6.0 Video คือคำตอบ และการรองรับเฟรมเวิร์กตั้งแต่วันแรกหมายความว่าคุณไม่ได้เดิมพันกับชิ้นงานวิจัยชิ้นหนึ่ง หากคุณต้องการเสียงบนวิดีโอ มันเป็นตัวเดียวในสองตัวที่สร้างเสียงออกมาได้

ถ้าปัญหาคือการพยากรณ์มากกว่าการผลิต — นโยบายที่ต้องตอบสนอง สภาพแวดล้อมการฝึก หรืออะไรก็ตามที่สถานะถัดไปขึ้นอยู่กับการกระทำครั้งล่าสุด — Odyssey-3 เป็นเพียงตัวเดียวในสองตัวที่ทำสิ่งนั้นได้ และยังเป็นตัวที่คุณซื้อไม่ได้ด้วย นั่นคือภาพที่ตรงไปตรงมาของการเปรียบเทียบนี้ในสัปดาห์ที่ทั้งคู่เปิดตัว: โมเดลเปิดที่คุณดาวน์โหลดได้ กับโมเดลแบบโต้ตอบที่คุณทำได้เพียงลองใช้ โดยหลักฐานจากการวัดมาตรฐานสนับสนุนตัวแบบปิด และหลักฐานในทางปฏิบัติสนับสนุนตัวแบบเปิด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube