
MAGI-2-preview กำลังจะมาสู่ SGLang: สิ่งที่ PR การให้บริการใหม่เผยให้เห็น
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
MAGI-2-preview โมเดลสร้างวิดีโอแบบ mixture-of-experts ขนาด 114 พันล้านพารามิเตอร์ของ Sand.ai เปิดเป็นโอเพนซอร์สเมื่อวันที่ 5 สิงหาคม 2026 — และสิบเอ็ดวันต่อมา สัญญาณแรกที่บ่งบอกว่ามันกำลังจะได้โครงสร้างพื้นฐานการให้บริการระดับโปรดักชันก็ปรากฏขึ้น เมื่อวันที่ 16 สิงหาคม มีการเปิด pull request ในคลังเก็บ SGLang ซึ่งมีชื่อว่า [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014) และชื่อนั้นก็ถูกต้อง: มันเชื่อมต่อการรองรับการให้บริการแบบเนทีฟสำหรับโมเดลนี้เข้ากับสแตก diffusion ของ SGLang และในขณะที่เขียนบทความนี้ มันก็ยังคงเป็นเพียง pull request — เปิดอยู่ รอการรีวิวจาก code-owner และมี CI checks ที่ล้มเหลว ยังไม่มีอะไรถูก merge ดังนั้นยังไม่มีอะไรที่ให้บริการได้ แต่สำหรับใครก็ตามที่กำลังพิจารณาว่า MAGI-2-preview จะย้ายออกจากการตั้งค่า Docker-and-torchrun อ้างอิงของ Sand.ai ไปสู่รันไทม์การให้บริการกระแสหลักได้หรือไม่ PR นี้คือแผนที่โดยละเอียด
ดังนั้น โปรดมองข้อความนี้เป็นบทสรุปสิ่งที่เรารู้จนถึงตอนนี้ ไม่ใช่หมายเหตุการเปิดตัว โมเดลนี้เป็นของจริงและเปิดให้ใช้งานแล้ว — เกิดขึ้นเมื่อวันที่ 5 สิงหาคม โดยมีน้ำหนักโมเดลบน Hugging Face และโค้ดบน GitHub ภายใต้ลิขสิทธิ์ Apache-2.0 สิ่งที่ยังไม่ได้รับการยืนยันคืองานด้านการ serving: การบูรณาการ SGLang เป็นเพียง pull request แบบเปิดหนึ่งรายการ รายละเอียดอาจเปลี่ยนแปลงได้ระหว่างการ review และจนกว่ามันจะได้รับการรวมเข้า SGLang ก็ยังไม่สามารถรัน MAGI-2-preview ได้จริง คุณค่าอยู่ที่สิ่งที่ PR เปิดเผยเกี่ยวกับโมเดลและเส้นทางสู่การรันมันใน runtime จริง
โมเดลที่ PR นี้ทำขึ้นเพื่อ ในย่อหน้าเดียว
MAGI-2-preview คือความพยายามของ Sand.ai ในการขยายขนาดการสร้างวิดีโอเช่นเดียวกับที่โมเดลภาษาถูกขยายขนาด นั่นคือด้วย mixture of experts และเป็นตัวสืบทอดต่อจาก MAGI-1 โอเพนซอร์ส (โมเดลวิดีโอแบบ autoregressive ขนาด 24B จากเดือนเมษายน 2025) โมเดลใหม่นี้มีพารามิเตอร์รวมประมาณ 114B แต่เปิดใช้งานเพียงประมาณ 6B ต่อโทเคน โดยใช้ multi-head MoE แบบละเอียดพิเศษ: สถานะซ่อนเร้นขนาด 3,072 มิติถูกแบ่งออกเป็น 12 เฮด แต่ละเฮดมีขนาด 256 มิติ แต่ละเฮดจัดเส้นทางไปยังเอ็กซ์เพิร์ต 6 จาก 256 ตัว ซึ่งรวมเป็นหน่วยเอ็กซ์เพิร์ต 3,072 หน่วยต่อ MoE เลเยอร์ และเปิดใช้งานเอ็กซ์เพิร์ต 72 ตัวต่อโทเคนใน 36 เลเยอร์ มันเป็นโมเดลเสียง-วิดีโอแบบสตรีมเดียวที่รวมเป็นหนึ่งเดียว โดยข้อความ วิดีโอ และเสียงผ่านทรานส์ฟอร์เมอร์ตัวเดียวกันและแลกเปลี่ยนข้อมูลกันผ่าน self-attention ในทุกเลเยอร์ แทนที่จะผ่านไปป์ไลน์ cross-attention แยกต่างหาก มันรองรับ text-to-video และ image-to-video และสร้างคลิปความยาว 10 วินาที ซึ่งเป็นความยาวเดียวที่รองรับ พร้อมกับแทร็กเสียงสเตอริโอที่ซิงโครไนซ์กัน ซึ่งถูกสร้างขึ้นในเส้นทาง denoising เดียวกันและถูกผสมรวมเข้าไปในไฟล์เอาต์พุต
การสร้างดำเนินการในสองขั้นตอน ได้แก่ magi2_preview ซึ่งเป็นขั้นตอนที่ลดสัญญาณรบกวนที่ความละเอียด 512×896 จากนั้น magi2_refiner ซึ่งเป็นขั้นตอนที่ขยายความละเอียดเป็น 1088×1920 รุ่นฐานใช้ขั้นตอนการลดสัญญาณรบกวน 100 ครั้งสำหรับ preview และ 5 ครั้งสำหรับ refiner Sand.ai ระบุว่าเวอร์ชันกลั่นที่ใช้ขั้นตอนน้อยกว่ามากกำลังจะเปิดตัว ชุด checkpoint เป็นพื้นที่เก็บข้อมูล Hugging Face เดียวขนาดประมาณ 307 GB ประกอบด้วย ขั้นตอน preview ขนาด 228 GB, ตัวเข้ารหัสข้อความ Qwen3.5-27B, ตัว refiner ขนาด 14 GB, VAE เสียงขนาด 5 GB, VAE วิดีโอที่ยืมมาจาก Wan2.2-TI2V-5B และตัวถอดรหัส turbo VAE แบบกลั่นที่ใช้เป็นค่าเริ่มต้น ข้อกำหนดด้านฮาร์ดแวร์คือ GPU NVIDIA Hopper (ระดับ H100) จำนวนแปดตัว โดยตัวเปิดใช้งานอ้างอิงช่วยให้คุณถ่ายโอนตัวเข้ารหัสข้อความ ตัว preview ตัว refiner และ VAE ระหว่าง CPU และ GPU ในแต่ละเฟสได้
ในด้านประสิทธิภาพ {{1}}ตัวเลขที่เผยแพร่กันอยู่นี้เป็นข้อมูลที่รายงานมาเท่านั้น ไม่ได้ถูกตรวจสอบซ้ำอย่างอิสระ{{/1}} คำกล่าวอ้าง — {{2}}คะแนน VBench ที่ 86.54% สูงกว่า Sora 2 (84.37%) และ Kling 2.0 (84.20%) ในการรายงานข่าวของสื่อจีนฉบับเดียวกัน และอันดับที่ 6 บนกระดานจัดอันดับการแปลงภาพเป็นวิดีโอของ Artificial Analysis ด้วย Elo ประมาณ 1106{{/2}} — ล้วนมาจากผู้พัฒนาและรายงานการเปิดตัว และไม่มีข้อมูลใดในนี้ที่ผ่านการทดสอบโดยบุคคลที่สามอย่างอิสระในช่วงสิบเอ็ดวันหลังการเปิดตัว Sand.ai ยังระบุต้นทุนการอนุมานที่ประมาณ 0.5 หยวน (ราว 0.07 ดอลลาร์สหรัฐ) ต่อคลิป 1080p ความยาว 10 วินาทีบน H100 แปดตัว หรือประมาณหนึ่งในสิบของโมเดลวิดีโอกระแสหลัก ให้ถือว่าทั้งหมดนี้เป็นเพียงข้อมูลที่รายงานโดยผู้พัฒนาและสื่อ จนกว่าจะมีใครสักคนวัดผลจริง

ทำไมการส่ง pull request ถึงเป็นข่าวจริง
จนถึงตอนนี้ มีวิธีที่รองรับเพียงวิธีเดียวเท่านั้นในการรัน MAGI-2-preview นั่นคือชุดซอฟต์แวร์อ้างอิงของ Sand.ai เอง ซึ่งประกอบด้วย Docker image พร้อมกับ torchrun บน NVIDIA Hopper H100 จำนวนแปดตัว นั่นเป็นเส้นทางที่ใช้งานได้แต่สร้างขึ้นเฉพาะกิจ — คุณต้องใช้ launcher ของ Sand.ai การตัดสินใจเรื่อง offload และวิธีการเฉพาะของเขาในการจัดวาง text encoder, preview, refiner และ VAE ระหว่างชั้นหน่วยความจำต่างๆ การมี pull request ที่เพิ่มโมเดลนี้เข้าไปใน SGLang จึงมีความสำคัญ เพราะ SGLang คือ runtime สำหรับให้บริการ (serving runtime) ที่โลกของ generative-AI แบบ self-hosted ส่วนใหญ่ใช้งานจริงในระบบ production การรองรับระดับเฟิร์สคลาสหมายความว่า MAGI-2-preview จะสามารถรันได้ใน runtime กระแสหลักพร้อมกลไกของ SGLang หนุนหลังอยู่ ไม่ว่าจะเป็น Ulysses sequence parallelism, expert parallelism, activation offload, VAE, scheduler และโครงสร้างพื้นฐานของ pipeline-stage นี่คือความแตกต่างระหว่าง "ฉันรันมันบนสแต็กของพวกเขาได้" กับ "ฉันรันมันบนสแต็กที่ทีมฉันใช้งานอยู่แล้ว"
สิ่งที่ PR สร้างขึ้นจริง
การผสานรวมนี้สร้างบนกลไก SGLang ที่มีอยู่แล้ว ไม่ใช่บนเส้นทางอ้างอิงของ torchrun PR นี้เพิ่มเลเยอร์ MoE แบบ multi-head, ระบบท่อส่ง attention-sink, local attention แบบ block-window สำหรับขั้นตอน refiner, และการเชื่อมต่อหลายสตรีมแบบ hyper-connections — ซึ่งเป็นชิ้นส่วนสถาปัตยกรรมของ MagiMoE ที่เลเยอร์ทั่วไปไม่สามารถแสดงออกได้ ครอบคลุมรอบๆ ชิ้นส่วนเหล่านั้น มันนำกลับมาใช้ parallelism ลำดับแบบ Ulysses, expert parallelism, offload, VAE, scheduler, และคอมโพเนนต์ pipeline-stage ที่มีอยู่แล้วของ SGLang นอกจากนี้ยังมาพร้อมกับเอกสารประกอบ (หน้า cookbook ของ MAGI-2 ในเอกสาร diffusion ของ SGLang) และการทดสอบ unit test จำนวน 47 รายการที่ไม่ต้องใช้ GPU ซึ่งเป็นสัญญาณที่ดีว่าพฤติกรรมของโมเดลส่วนใหญ่สามารถตรวจสอบได้โดยไม่ต้องเช่า H100 แปดเครื่อง
PR ยังทำให้ข้อจำกัดของโมเดลชัดเจน:
• ฮาร์ดแวร์ — NVIDIA Hopper H100 จำนวนแปดตัว โดยโหมด offload ของ CPU/GPU/roundtrip ของสแตกอ้างอิงจะถูกแมปไปยังตำแหน่งที่ text encoder, preview, refiner และ VAE อยู่ระหว่างแต่ละเฟส
• ความขนาน — --num-gpus ต้องหารทุก head axis ได้ลงตัว ในขณะที่ --tp-size, --ring-degree และ --enable-cfg-parallel จะถูกปฏิเสธ นี่คือโมเดลที่มีมิติการจัดเส้นทางจำนวนมาก และเค้าโครงความขนานต้องสอดคล้องกับมิติเหล่านั้น
• ผลลัพธ์ — ยอมรับเฉพาะความละเอียด 1920×1088 และ 896×512 เท่านั้น และคลิปความยาวเพียง 10 วินาที; ไม่รองรับ torch.compile
ชุดสุดท้ายนั้นคุ้มค่าที่จะอ่านสองรอบหากคุณกำลังวางแผนจะใช้งานจริง: นี่คือโมเดลที่ อย่างน้อยในการผสานรวมในระยะแรกนี้ ถูกจำกัดให้ใช้ได้กับความละเอียดสองแบบและระยะเวลาหนึ่งแบบ
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
อะไรที่ยังไม่ได้รับการยืนยัน
ทุกอย่างเกี่ยวกับงาน serving PR เปิดอยู่ รอการตรวจสอบจาก code-owner และการตรวจ CI ก็ล้มเหลว ณ วันที่ 16 สิงหาคม pull request ขนาดนี้สามารถนั่งรอการรีวิวได้เป็นวันหรือเป็นสัปดาห์ ไม่มีสถานะ merged ไม่มี release และไม่มีการประกาศจาก SGLang และการอ้างสิทธิ์ฝั่งโมเดล — คะแนน VBench อันดับจาก Artificial Analysis ตัวเลขต้นทุน 0.5 หยวน — เป็นข้อมูลที่รายงานโดยผู้ขายและสื่อ ไม่ได้ถูกทำซ้ำอย่างอิสระ ถ้าคุณสร้างเวิร์กโฟลว์บน PR นี้วันนี้ คุณกำลังสร้างบน roadmap ไม่ใช่ runtime
มันหมายความว่าอย่างไรต่อการคำนวณต้นทุน
เหตุผลที่ MAGI-2-preview ดึงดูดความสนใจก็คือเรื่องเศรษฐศาสตร์ต้นทุนของมัน โมเดลที่เปิดใช้งานพารามิเตอร์ 6B ต่อโทเคน ขณะที่มีความจุ 114B นั้นมีต้นทุนต่ำในการรันต่อคลิป — Sand.ai ระบุตัวเลขไว้ที่ประมาณ 0.5 หยวนต่อคลิป 1080p ความยาว 10 วินาทีบน H100 แปดตัว — และนั่นคือตัวเลขประเภทที่ชี้ขาดว่าทีมเล็ก ๆ จะสามารถเอื้อมถึงการสร้างวิดีโอได้หรือไม่ แต่ตัวเลข 0.5 หยวนนั้นตั้งอยู่บนสมมติฐานของ reference stack คลัสเตอร์ H100 และไม่มีค่าใช้จ่ายในการเสิร์ฟ (serving overhead) หนทางปกติที่โมเดลโอเพนซอร์สแบบนี้จะกลายเป็นอะไรที่ใช้ได้อย่างกว้างขวางคือผ่าน managed API: มีคนโฮสต์ให้ ตั้งราคาต่อคลิป และคุณก็ไม่ต้องเช่า H100 แปดตัว

เมื่อมีเส้นทางแบบโฮสต์อยู่ มุมของการจัดเส้นทางก็จะมีความเกี่ยวข้อง บนแพลตฟอร์มการจัดเส้นทาง ราคาที่ผู้ขายกำหนดไว้สำหรับคลิปพรีวิว MAGI-2 ก็คือราคาที่คุณจ่าย — OrcaRouter ส่งต่อราคารายการของผู้ให้บริการผ่านไปโดยไม่มีมาร์กอัปเป็นศูนย์ ดังนั้นการลดราคาของผู้ขายจะปรากฏบนฝั่งเราในวันเดียวกับที่ปล่อย โดยไม่ต้องเจรจาใหม่ และเช็คพอยต์แบบโอเพนเวทที่มีอายุสิบเอ็ดวันและไม่มีเกณฑ์วัดอิสระ ก็เป็นโมเดลประเภทที่คุณอยากให้อยู่เบื้องหลังการเฟลโอเวอร์อัตโนมัติ: ชี้เส้นทางไปที่มันเพื่อประเมินผล เก็บทางเลือกที่พิสูจน์แล้วไว้บนเอนด์พอยต์เดียวกัน และเมื่อเช็คพอยต์ช่วงแรกชะงักหรือให้ผลลัพธ์ที่ใช้งานไม่ได้ การเรียกก็จะเฟลโอเวอร์แทนไปยังทางเลือกนั้น แทนที่จะทำให้ไปป์ไลน์ของคุณล่ม นี่คือวิธีที่คุณลองโมเดลที่ยังไม่ผ่านการพิสูจน์โดยไม่ต้องเดิมพันเส้นทางการผลิตทั้งหมดไว้กับมัน
สิ่งที่เรากำลังดูอยู่ตอนนี้
• ไม่ว่า PR จะถูกผสานหรือไม่ และมีการเปลี่ยนแปลงอะไรบ้างในการตรวจสอบ รายการข้อจำกัด — สองความละเอียด หนึ่งระยะเวลา ไม่มี torch.compile — อาจยังไม่เป็นที่สิ้นสุด
• เช็คพอยต์ที่ผ่านการกลั่น Sand.ai กล่าวว่าน้ำหนักแบบใช้ขั้นตอนน้อยกว่ากำลังจะมา และนั่นคือสิ่งที่เปลี่ยนตัวเลข 0.5 หยวนจากการวัดในห้องปฏิบัติการให้เป็นต้นทุนต่อคลิปที่สมจริง
• การวัดประสิทธิภาพอิสระครั้งแรก ตัวเลข VBench และลีดเดอร์บอร์ดเป็นข้อมูลที่ผู้จำหน่ายและสื่อรายงานไว้ การทดสอบโดยบุคคลที่สามจะช่วยชี้ขาดว่าข้อกล่าวอ้างเรื่อง 6B-active จะยังคงเป็นจริงหรือไม่
ไม่ว่ารันไทม์อื่นๆ จะตามมาหรือไม่ SGLang เป็นรันไทม์ให้บริการหลักรายแรกที่รองรับ MAGI-2-preview; vLLM และรันไทม์อื่นๆ อาจตามมาไม่ไกลนัก
ไม่ว่า managed API จะปรากฏขึ้นหรือไม่ จุดขายหลักทั้งหมดของโมเดลคือต้นทุนต่ำเมื่อขยายขนาด ทันทีที่มี hosted route เกิดขึ้น ราคาแบบ pass-through ที่คำนวณไว้ข้างต้นก็จะเริ่มมีผลจริง
สรุปอย่างตรงไปตรงมา: MAGI-2-preview คือโมเดลโอเพนซอร์สที่มีอายุเพียงสิบเอ็ดวัน ซึ่งโครงสร้างต้นทุนอาจมีความสำคัญ และ PR ของ SGLang เป็นสัญญาณที่ชัดเจนที่สุดว่าอีโคซิสเต็มกำลังให้ความสำคัญกับมันจริง ๆ แต่การรองรับการให้บริการยังเป็นเพียง pull request ที่เปิดอยู่ ไม่ใช่ความสามารถที่เปิดให้ใช้งานแล้ว ให้ถือว่าโรดแมปเป็นเรื่องจริงแต่รันไทม์ยังมาไม่ถึง — และเมื่อโมเดลนี้ถูกปล่อยผ่าน API จริงในที่สุด แนวทางแบบ failover-first คือวิธีที่คุณจะนำไปใช้โดยไม่ต้องเดิมพันเส้นทางการผลิตกับ checkpoint ที่ยังไม่มีใคร benchmark อย่างอิสระ
