การ์ดชื่อเรื่องสำหรับบทความ 'MAGI-2-preview กำลังจะไปยัง SGLang' พร้อมคำบรรยายใต้ชื่อ 'สิ่งที่ PR การ serving ใหม่เผยให้เห็น' แสดงลวดลายแถบฟิล์มที่แปรเปลี่ยนเป็นโหนดเซิร์ฟเวอร์และเครือข่ายที่สะอาดตาบนพื้นหลังสีขาวพร้อมเฉดสีไล่โทนน้ำเงิน-ไซอัน โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

MAGI-2-preview กำลังจะมาสู่ SGLang: สิ่งที่ PR การให้บริการใหม่เผยให้เห็น

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MAGI-2-preview โมเดลสร้างวิดีโอแบบ mixture-of-experts ขนาด 114 พันล้านพารามิเตอร์ของ Sand.ai เปิดเป็นโอเพนซอร์สเมื่อวันที่ 5 สิงหาคม 2026 — และสิบเอ็ดวันต่อมา สัญญาณแรกที่บ่งบอกว่ามันกำลังจะได้โครงสร้างพื้นฐานการให้บริการระดับโปรดักชันก็ปรากฏขึ้น เมื่อวันที่ 16 สิงหาคม มีการเปิด pull request ในคลังเก็บ SGLang ซึ่งมีชื่อว่า [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014) และชื่อนั้นก็ถูกต้อง: มันเชื่อมต่อการรองรับการให้บริการแบบเนทีฟสำหรับโมเดลนี้เข้ากับสแตก diffusion ของ SGLang และในขณะที่เขียนบทความนี้ มันก็ยังคงเป็นเพียง pull request — เปิดอยู่ รอการรีวิวจาก code-owner และมี CI checks ที่ล้มเหลว ยังไม่มีอะไรถูก merge ดังนั้นยังไม่มีอะไรที่ให้บริการได้ แต่สำหรับใครก็ตามที่กำลังพิจารณาว่า MAGI-2-preview จะย้ายออกจากการตั้งค่า Docker-and-torchrun อ้างอิงของ Sand.ai ไปสู่รันไทม์การให้บริการกระแสหลักได้หรือไม่ PR นี้คือแผนที่โดยละเอียด

ดังนั้น โปรดมองข้อความนี้เป็นบทสรุปสิ่งที่เรารู้จนถึงตอนนี้ ไม่ใช่หมายเหตุการเปิดตัว โมเดลนี้เป็นของจริงและเปิดให้ใช้งานแล้ว — เกิดขึ้นเมื่อวันที่ 5 สิงหาคม โดยมีน้ำหนักโมเดลบน Hugging Face และโค้ดบน GitHub ภายใต้ลิขสิทธิ์ Apache-2.0 สิ่งที่ยังไม่ได้รับการยืนยันคืองานด้านการ serving: การบูรณาการ SGLang เป็นเพียง pull request แบบเปิดหนึ่งรายการ รายละเอียดอาจเปลี่ยนแปลงได้ระหว่างการ review และจนกว่ามันจะได้รับการรวมเข้า SGLang ก็ยังไม่สามารถรัน MAGI-2-preview ได้จริง คุณค่าอยู่ที่สิ่งที่ PR เปิดเผยเกี่ยวกับโมเดลและเส้นทางสู่การรันมันใน runtime จริง

โมเดลที่ PR นี้ทำขึ้นเพื่อ ในย่อหน้าเดียว

MAGI-2-preview คือความพยายามของ Sand.ai ในการขยายขนาดการสร้างวิดีโอเช่นเดียวกับที่โมเดลภาษาถูกขยายขนาด นั่นคือด้วย mixture of experts และเป็นตัวสืบทอดต่อจาก MAGI-1 โอเพนซอร์ส (โมเดลวิดีโอแบบ autoregressive ขนาด 24B จากเดือนเมษายน 2025) โมเดลใหม่นี้มีพารามิเตอร์รวมประมาณ 114B แต่เปิดใช้งานเพียงประมาณ 6B ต่อโทเคน โดยใช้ multi-head MoE แบบละเอียดพิเศษ: สถานะซ่อนเร้นขนาด 3,072 มิติถูกแบ่งออกเป็น 12 เฮด แต่ละเฮดมีขนาด 256 มิติ แต่ละเฮดจัดเส้นทางไปยังเอ็กซ์เพิร์ต 6 จาก 256 ตัว ซึ่งรวมเป็นหน่วยเอ็กซ์เพิร์ต 3,072 หน่วยต่อ MoE เลเยอร์ และเปิดใช้งานเอ็กซ์เพิร์ต 72 ตัวต่อโทเคนใน 36 เลเยอร์ มันเป็นโมเดลเสียง-วิดีโอแบบสตรีมเดียวที่รวมเป็นหนึ่งเดียว โดยข้อความ วิดีโอ และเสียงผ่านทรานส์ฟอร์เมอร์ตัวเดียวกันและแลกเปลี่ยนข้อมูลกันผ่าน self-attention ในทุกเลเยอร์ แทนที่จะผ่านไปป์ไลน์ cross-attention แยกต่างหาก มันรองรับ text-to-video และ image-to-video และสร้างคลิปความยาว 10 วินาที ซึ่งเป็นความยาวเดียวที่รองรับ พร้อมกับแทร็กเสียงสเตอริโอที่ซิงโครไนซ์กัน ซึ่งถูกสร้างขึ้นในเส้นทาง denoising เดียวกันและถูกผสมรวมเข้าไปในไฟล์เอาต์พุต

การสร้างดำเนินการในสองขั้นตอน ได้แก่ magi2_preview ซึ่งเป็นขั้นตอนที่ลดสัญญาณรบกวนที่ความละเอียด 512×896 จากนั้น magi2_refiner ซึ่งเป็นขั้นตอนที่ขยายความละเอียดเป็น 1088×1920 รุ่นฐานใช้ขั้นตอนการลดสัญญาณรบกวน 100 ครั้งสำหรับ preview และ 5 ครั้งสำหรับ refiner Sand.ai ระบุว่าเวอร์ชันกลั่นที่ใช้ขั้นตอนน้อยกว่ามากกำลังจะเปิดตัว ชุด checkpoint เป็นพื้นที่เก็บข้อมูล Hugging Face เดียวขนาดประมาณ 307 GB ประกอบด้วย ขั้นตอน preview ขนาด 228 GB, ตัวเข้ารหัสข้อความ Qwen3.5-27B, ตัว refiner ขนาด 14 GB, VAE เสียงขนาด 5 GB, VAE วิดีโอที่ยืมมาจาก Wan2.2-TI2V-5B และตัวถอดรหัส turbo VAE แบบกลั่นที่ใช้เป็นค่าเริ่มต้น ข้อกำหนดด้านฮาร์ดแวร์คือ GPU NVIDIA Hopper (ระดับ H100) จำนวนแปดตัว โดยตัวเปิดใช้งานอ้างอิงช่วยให้คุณถ่ายโอนตัวเข้ารหัสข้อความ ตัว preview ตัว refiner และ VAE ระหว่าง CPU และ GPU ในแต่ละเฟสได้

ในด้านประสิทธิภาพ {{1}}ตัวเลขที่เผยแพร่กันอยู่นี้เป็นข้อมูลที่รายงานมาเท่านั้น ไม่ได้ถูกตรวจสอบซ้ำอย่างอิสระ{{/1}} คำกล่าวอ้าง — {{2}}คะแนน VBench ที่ 86.54% สูงกว่า Sora 2 (84.37%) และ Kling 2.0 (84.20%) ในการรายงานข่าวของสื่อจีนฉบับเดียวกัน และอันดับที่ 6 บนกระดานจัดอันดับการแปลงภาพเป็นวิดีโอของ Artificial Analysis ด้วย Elo ประมาณ 1106{{/2}} — ล้วนมาจากผู้พัฒนาและรายงานการเปิดตัว และไม่มีข้อมูลใดในนี้ที่ผ่านการทดสอบโดยบุคคลที่สามอย่างอิสระในช่วงสิบเอ็ดวันหลังการเปิดตัว Sand.ai ยังระบุต้นทุนการอนุมานที่ประมาณ 0.5 หยวน (ราว 0.07 ดอลลาร์สหรัฐ) ต่อคลิป 1080p ความยาว 10 วินาทีบน H100 แปดตัว หรือประมาณหนึ่งในสิบของโมเดลวิดีโอกระแสหลัก ให้ถือว่าทั้งหมดนี้เป็นเพียงข้อมูลที่รายงานโดยผู้พัฒนาและสื่อ จนกว่าจะมีใครสักคนวัดผลจริง

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

ทำไมการส่ง pull request ถึงเป็นข่าวจริง

จนถึงตอนนี้ มีวิธีที่รองรับเพียงวิธีเดียวเท่านั้นในการรัน MAGI-2-preview นั่นคือชุดซอฟต์แวร์อ้างอิงของ Sand.ai เอง ซึ่งประกอบด้วย Docker image พร้อมกับ torchrun บน NVIDIA Hopper H100 จำนวนแปดตัว นั่นเป็นเส้นทางที่ใช้งานได้แต่สร้างขึ้นเฉพาะกิจ — คุณต้องใช้ launcher ของ Sand.ai การตัดสินใจเรื่อง offload และวิธีการเฉพาะของเขาในการจัดวาง text encoder, preview, refiner และ VAE ระหว่างชั้นหน่วยความจำต่างๆ การมี pull request ที่เพิ่มโมเดลนี้เข้าไปใน SGLang จึงมีความสำคัญ เพราะ SGLang คือ runtime สำหรับให้บริการ (serving runtime) ที่โลกของ generative-AI แบบ self-hosted ส่วนใหญ่ใช้งานจริงในระบบ production การรองรับระดับเฟิร์สคลาสหมายความว่า MAGI-2-preview จะสามารถรันได้ใน runtime กระแสหลักพร้อมกลไกของ SGLang หนุนหลังอยู่ ไม่ว่าจะเป็น Ulysses sequence parallelism, expert parallelism, activation offload, VAE, scheduler และโครงสร้างพื้นฐานของ pipeline-stage นี่คือความแตกต่างระหว่าง "ฉันรันมันบนสแต็กของพวกเขาได้" กับ "ฉันรันมันบนสแต็กที่ทีมฉันใช้งานอยู่แล้ว"

สิ่งที่ PR สร้างขึ้นจริง

การผสานรวมนี้สร้างบนกลไก SGLang ที่มีอยู่แล้ว ไม่ใช่บนเส้นทางอ้างอิงของ torchrun PR นี้เพิ่มเลเยอร์ MoE แบบ multi-head, ระบบท่อส่ง attention-sink, local attention แบบ block-window สำหรับขั้นตอน refiner, และการเชื่อมต่อหลายสตรีมแบบ hyper-connections — ซึ่งเป็นชิ้นส่วนสถาปัตยกรรมของ MagiMoE ที่เลเยอร์ทั่วไปไม่สามารถแสดงออกได้ ครอบคลุมรอบๆ ชิ้นส่วนเหล่านั้น มันนำกลับมาใช้ parallelism ลำดับแบบ Ulysses, expert parallelism, offload, VAE, scheduler, และคอมโพเนนต์ pipeline-stage ที่มีอยู่แล้วของ SGLang นอกจากนี้ยังมาพร้อมกับเอกสารประกอบ (หน้า cookbook ของ MAGI-2 ในเอกสาร diffusion ของ SGLang) และการทดสอบ unit test จำนวน 47 รายการที่ไม่ต้องใช้ GPU ซึ่งเป็นสัญญาณที่ดีว่าพฤติกรรมของโมเดลส่วนใหญ่สามารถตรวจสอบได้โดยไม่ต้องเช่า H100 แปดเครื่อง

PR ยังทำให้ข้อจำกัดของโมเดลชัดเจน:

• ฮาร์ดแวร์ — NVIDIA Hopper H100 จำนวนแปดตัว โดยโหมด offload ของ CPU/GPU/roundtrip ของสแตกอ้างอิงจะถูกแมปไปยังตำแหน่งที่ text encoder, preview, refiner และ VAE อยู่ระหว่างแต่ละเฟส

• ความขนาน — --num-gpus ต้องหารทุก head axis ได้ลงตัว ในขณะที่ --tp-size, --ring-degree และ --enable-cfg-parallel จะถูกปฏิเสธ นี่คือโมเดลที่มีมิติการจัดเส้นทางจำนวนมาก และเค้าโครงความขนานต้องสอดคล้องกับมิติเหล่านั้น

• ผลลัพธ์ — ยอมรับเฉพาะความละเอียด 1920×1088 และ 896×512 เท่านั้น และคลิปความยาวเพียง 10 วินาที; ไม่รองรับ torch.compile

ชุดสุดท้ายนั้นคุ้มค่าที่จะอ่านสองรอบหากคุณกำลังวางแผนจะใช้งานจริง: นี่คือโมเดลที่ อย่างน้อยในการผสานรวมในระยะแรกนี้ ถูกจำกัดให้ใช้ได้กับความละเอียดสองแบบและระยะเวลาหนึ่งแบบ

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

อะไรที่ยังไม่ได้รับการยืนยัน

ทุกอย่างเกี่ยวกับงาน serving PR เปิดอยู่ รอการตรวจสอบจาก code-owner และการตรวจ CI ก็ล้มเหลว ณ วันที่ 16 สิงหาคม pull request ขนาดนี้สามารถนั่งรอการรีวิวได้เป็นวันหรือเป็นสัปดาห์ ไม่มีสถานะ merged ไม่มี release และไม่มีการประกาศจาก SGLang และการอ้างสิทธิ์ฝั่งโมเดล — คะแนน VBench อันดับจาก Artificial Analysis ตัวเลขต้นทุน 0.5 หยวน — เป็นข้อมูลที่รายงานโดยผู้ขายและสื่อ ไม่ได้ถูกทำซ้ำอย่างอิสระ ถ้าคุณสร้างเวิร์กโฟลว์บน PR นี้วันนี้ คุณกำลังสร้างบน roadmap ไม่ใช่ runtime

มันหมายความว่าอย่างไรต่อการคำนวณต้นทุน

เหตุผลที่ MAGI-2-preview ดึงดูดความสนใจก็คือเรื่องเศรษฐศาสตร์ต้นทุนของมัน โมเดลที่เปิดใช้งานพารามิเตอร์ 6B ต่อโทเคน ขณะที่มีความจุ 114B นั้นมีต้นทุนต่ำในการรันต่อคลิป — Sand.ai ระบุตัวเลขไว้ที่ประมาณ 0.5 หยวนต่อคลิป 1080p ความยาว 10 วินาทีบน H100 แปดตัว — และนั่นคือตัวเลขประเภทที่ชี้ขาดว่าทีมเล็ก ๆ จะสามารถเอื้อมถึงการสร้างวิดีโอได้หรือไม่ แต่ตัวเลข 0.5 หยวนนั้นตั้งอยู่บนสมมติฐานของ reference stack คลัสเตอร์ H100 และไม่มีค่าใช้จ่ายในการเสิร์ฟ (serving overhead) หนทางปกติที่โมเดลโอเพนซอร์สแบบนี้จะกลายเป็นอะไรที่ใช้ได้อย่างกว้างขวางคือผ่าน managed API: มีคนโฮสต์ให้ ตั้งราคาต่อคลิป และคุณก็ไม่ต้องเช่า H100 แปดตัว

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

เมื่อมีเส้นทางแบบโฮสต์อยู่ มุมของการจัดเส้นทางก็จะมีความเกี่ยวข้อง บนแพลตฟอร์มการจัดเส้นทาง ราคาที่ผู้ขายกำหนดไว้สำหรับคลิปพรีวิว MAGI-2 ก็คือราคาที่คุณจ่าย — OrcaRouter ส่งต่อราคารายการของผู้ให้บริการผ่านไปโดยไม่มีมาร์กอัปเป็นศูนย์ ดังนั้นการลดราคาของผู้ขายจะปรากฏบนฝั่งเราในวันเดียวกับที่ปล่อย โดยไม่ต้องเจรจาใหม่ และเช็คพอยต์แบบโอเพนเวทที่มีอายุสิบเอ็ดวันและไม่มีเกณฑ์วัดอิสระ ก็เป็นโมเดลประเภทที่คุณอยากให้อยู่เบื้องหลังการเฟลโอเวอร์อัตโนมัติ: ชี้เส้นทางไปที่มันเพื่อประเมินผล เก็บทางเลือกที่พิสูจน์แล้วไว้บนเอนด์พอยต์เดียวกัน และเมื่อเช็คพอยต์ช่วงแรกชะงักหรือให้ผลลัพธ์ที่ใช้งานไม่ได้ การเรียกก็จะเฟลโอเวอร์แทนไปยังทางเลือกนั้น แทนที่จะทำให้ไปป์ไลน์ของคุณล่ม นี่คือวิธีที่คุณลองโมเดลที่ยังไม่ผ่านการพิสูจน์โดยไม่ต้องเดิมพันเส้นทางการผลิตทั้งหมดไว้กับมัน

สิ่งที่เรากำลังดูอยู่ตอนนี้

• ไม่ว่า PR จะถูกผสานหรือไม่ และมีการเปลี่ยนแปลงอะไรบ้างในการตรวจสอบ รายการข้อจำกัด — สองความละเอียด หนึ่งระยะเวลา ไม่มี torch.compile — อาจยังไม่เป็นที่สิ้นสุด

• เช็คพอยต์ที่ผ่านการกลั่น Sand.ai กล่าวว่าน้ำหนักแบบใช้ขั้นตอนน้อยกว่ากำลังจะมา และนั่นคือสิ่งที่เปลี่ยนตัวเลข 0.5 หยวนจากการวัดในห้องปฏิบัติการให้เป็นต้นทุนต่อคลิปที่สมจริง

• การวัดประสิทธิภาพอิสระครั้งแรก ตัวเลข VBench และลีดเดอร์บอร์ดเป็นข้อมูลที่ผู้จำหน่ายและสื่อรายงานไว้ การทดสอบโดยบุคคลที่สามจะช่วยชี้ขาดว่าข้อกล่าวอ้างเรื่อง 6B-active จะยังคงเป็นจริงหรือไม่

ไม่ว่ารันไทม์อื่นๆ จะตามมาหรือไม่ SGLang เป็นรันไทม์ให้บริการหลักรายแรกที่รองรับ MAGI-2-preview; vLLM และรันไทม์อื่นๆ อาจตามมาไม่ไกลนัก

ไม่ว่า managed API จะปรากฏขึ้นหรือไม่ จุดขายหลักทั้งหมดของโมเดลคือต้นทุนต่ำเมื่อขยายขนาด ทันทีที่มี hosted route เกิดขึ้น ราคาแบบ pass-through ที่คำนวณไว้ข้างต้นก็จะเริ่มมีผลจริง

สรุปอย่างตรงไปตรงมา: MAGI-2-preview คือโมเดลโอเพนซอร์สที่มีอายุเพียงสิบเอ็ดวัน ซึ่งโครงสร้างต้นทุนอาจมีความสำคัญ และ PR ของ SGLang เป็นสัญญาณที่ชัดเจนที่สุดว่าอีโคซิสเต็มกำลังให้ความสำคัญกับมันจริง ๆ แต่การรองรับการให้บริการยังเป็นเพียง pull request ที่เปิดอยู่ ไม่ใช่ความสามารถที่เปิดให้ใช้งานแล้ว ให้ถือว่าโรดแมปเป็นเรื่องจริงแต่รันไทม์ยังมาไม่ถึง — และเมื่อโมเดลนี้ถูกปล่อยผ่าน API จริงในที่สุด แนวทางแบบ failover-first คือวิธีที่คุณจะนำไปใช้โดยไม่ต้องเดิมพันเส้นทางการผลิตกับ checkpoint ที่ยังไม่มีใคร benchmark อย่างอิสระ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube