
MAGI-2-preview menuju ke SGLang: yang diungkap oleh PR serving baru
- DeepSeekBARUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
MAGI-2-preview, model generasi video mixture-of-experts dengan 114 miliar parameter milik Sand.ai, dirilis sebagai sumber terbuka pada 5 Agustus 2026 — dan sebelas hari kemudian, tanda pertama bahwa model ini akan segera mendapatkan infrastruktur penyajian kelas produksi telah muncul. Pada 16 Agustus, sebuah pull request dibuka di repositori SGLang dengan judul [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), dan judulnya akurat: pull request tersebut menghubungkan dukungan penyajian native untuk model ini ke dalam tumpukan difusi SGLang. Hingga tulisan ini dibuat, ini juga masih berupa pull request — terbuka, menunggu peninjauan pemilik kode, dengan pemeriksaan CI yang gagal. Belum ada yang digabungkan, jadi belum ada yang dapat disajikan. Namun bagi siapa pun yang mempertimbangkan apakah MAGI-2-preview dapat berpindah dari pengaturan referensi Docker-dan-torchrun milik Sand.ai ke runtime penyajian arus utama, PR tersebut adalah peta jalan yang terperinci.
Jadi perlakukan ini sebagai tulisan "apa yang kita ketahui sejauh ini", bukan catatan rilis. Modelnya nyata dan sudah dirilis — itu terjadi pada 5 Agustus, dengan bobot di Hugging Face dan kode di GitHub dengan lisensi Apache-2.0. Yang belum terverifikasi adalah pekerjaan penyajiannya: integrasi SGLang masih berupa satu pull request terbuka, detailnya bisa berubah saat peninjauan, dan hingga pull request itu digabung, SGLang tidak benar-benar dapat menjalankan MAGI-2-preview. Nilainya terletak pada apa yang diungkapkan PR tersebut tentang model dan tentang jalur untuk menjalankannya di runtime nyata.
Model yang menjadi subjek PR, dalam satu paragraf.
MAGI-2-preview adalah upaya Sand.ai untuk menskalakan generasi video seperti cara model bahasa diskalakan — dengan campuran pakar, dan merupakan penerus dari MAGI-1 sumber terbuka (model video autoregresif 24B dari April 2025). Model baru ini memiliki total sekitar 114B parameter tetapi hanya mengaktifkan sekitar 6B per token, menggunakan MoE multi-kepala berbutir sangat halus: state tersembunyi berdimensi 3.072 dipecah menjadi 12 kepala berdimensi 256, masing-masing menuju ke enam dari 256 pakar, yang menghasilkan 3.072 unit pakar per lapisan MoE dan 72 pakar yang diaktifkan per token di seluruh 36 lapisan. Model ini adalah model audio-video aliran tunggal yang terpadu — teks, video, dan audio melewati transformer yang sama dan bertukar informasi melalui self-attention di setiap lapisan, bukan melalui pipeline cross-attention yang terpisah. Ia mendukung teks-ke-video dan gambar-ke-video, serta menghasilkan klip 10 detik — satu-satunya durasi yang didukung — dengan soundtrack stereo tersinkronisasi yang dihasilkan dalam lintasan denoising yang sama dan digabungkan ke dalam file keluaran.
Generasi berjalan dalam dua tahap. Tahap magi2_preview melakukan denoising pada 512×896, lalu tahap magi2_refiner meningkatkan skala menjadi 1088×1920. Rilis dasar menggunakan 100 langkah denoising untuk preview dan 5 untuk refiner; Sand.ai mengatakan versi terdistilasi dengan langkah yang jauh lebih sedikit akan segera dirilis. Set checkpoint berupa satu repositori Hugging Face sekitar 307 GB: tahap preview 228 GB, encoder teks Qwen3.5-27B, refiner 14 GB, VAE audio 5 GB, VAE video yang dipinjam dari Wan2.2-TI2V-5B, dan decoder VAE turbo terdistilasi yang digunakan secara default. Persyaratan perangkat keras adalah delapan GPU NVIDIA Hopper (kelas H100), dengan peluncur referensi yang memungkinkan Anda memindahkan encoder teks, preview, refiner, dan VAE antara CPU dan GPU di berbagai fase.
Mengenai performa, angka-angka yang beredar hanyalah laporan, bukan hasil reproduksi independen. Klaim-klaim — skor VBench 86.54%, unggul dari Sora 2 (84.37%) dan Kling 2.0 (84.20%) dalam liputan pers Tiongkok yang sama, serta peringkat ke-6 di papan peringkat image-to-video Artificial Analysis dengan Elo sekitar 1106 — berasal dari vendor dan liputan peluncuran, dan tak satu pun telah diuji secara independen oleh pihak ketiga dalam sebelas hari sejak rilis. Sand.ai juga menyebut biaya inferensi sekitar 0.5 yuan (kira-kira $0.07) per klip 1080p 10 detik pada delapan H100, atau sekitar sepersepuluh biaya model video arus utama. Anggap saja semua itu sebagai laporan vendor dan pers sampai ada pihak yang benar-benar mengukurnya.

Mengapa pull request yang aktif adalah berita yang sebenarnya
Sampai saat ini, hanya ada satu cara yang didukung untuk menjalankan MAGI-2-preview: tumpukan referensi milik Sand.ai sendiri, yaitu image Docker plus torchrun, pada delapan NVIDIA Hopper H100. Itu adalah jalur yang berfungsi tetapi khusus — Anda mewarisi peluncur Sand.ai, keputusan offload-nya, dan cara khasnya dalam menempatkan text encoder, preview, refiner, dan VAE di antara tingkat memori. Pull request yang menambahkan model ini ke SGLang penting karena SGLang adalah runtime penyajian yang digunakan oleh sebagian besar dunia AI generatif yang di-host sendiri dalam produksi. Dukungan kelas satu berarti MAGI-2-preview dapat dijalankan di runtime utama dengan mekanisme SGLang di belakangnya — paralelisme urutan Ulysses, paralelisme pakar, offload aktivasi, VAE, penjadwal, dan infrastruktur tahap pipeline. Itulah perbedaan antara "Saya bisa menjalankannya di tumpukan mereka" dan "Saya bisa menjalankannya di tumpukan yang sudah dioperasikan tim saya."
Apa yang sebenarnya dibangun PR tersebut.
Integrasi ini dibangun di atas mekanisme SGLang yang sudah ada, bukan pada jalur referensi torchrun. PR ini menambahkan lapisan MoE multi-kepala, plumbing attention-sink, perhatian lokal blok-window untuk tahap refiner, dan hyper-koneksi multi-stream — bagian-bagian arsitektural MagiMoE yang belum diekspresikan oleh lapisan generik. Di sekitarnya, PR ini menggunakan kembali paralelisme sekuens Ulysses milik SGLang, paralelisme pakar, offload, VAE, penjadwal, dan komponen tahap pipeline yang sudah ada. PR ini juga menyertakan dokumentasi (halaman buku masak MAGI-2 untuk dokumen difusi SGLang) dan 47 unit test tanpa GPU, yang merupakan pertanda baik untuk seberapa banyak perilaku model yang dapat diverifikasi tanpa menyewa delapan H100.
PR tersebut juga membuat kendala model menjadi eksplisit:
• Perangkat keras — delapan NVIDIA Hopper H100, dengan mode offload cpu / gpu / roundtrip dari tumpukan referensi yang memetakan penempatan text encoder, preview, refiner, dan VAE di antara fase-fase.
• Paralelisme — --num-gpus harus membagi setiap sumbu head, sementara --tp-size, --ring-degree, dan --enable-cfg-parallel ditolak. Ini adalah model dengan banyak dimensi routing, dan tata letak paralelisme harus selaras dengannya.
• Keluaran — hanya resolusi 1920×1088 dan 896×512 yang diterima, dan hanya klip 10 detik; torch.compile tidak didukung.
Kumpulan terakhir itu layak dibaca dua kali jika Anda berencana melakukan penerapan: ini adalah model yang, setidaknya dalam integrasi awal ini, terkunci pada dua resolusi dan satu durasi.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
Apa yang masih belum terverifikasi
Semua hal tentang pekerjaan serving. PR tersebut masih terbuka, menunggu peninjauan code-owner, dan pemeriksaan CI gagal per 16 Agustus. Pull request sebesar ini bisa tertahan dalam peninjauan selama berhari-hari atau berminggu-minggu; tidak ada status merge, tidak ada rilis, dan tidak ada pengumuman dari SGLang. Dan klaim di sisi model — skor VBench, peringkat Artificial Analysis, angka biaya 0,5 yuan — dilaporkan oleh vendor dan pers, bukan direproduksi secara independen. Jika Anda membangun alur kerja di atas PR ini hari ini, Anda membangun di atas roadmap, bukan runtime.
Apa artinya bagi perhitungan biaya
Alasan MAGI-2-preview menarik perhatian adalah ekonomisnya. Model yang mengaktifkan 6B parameter per token sambil membawa kapasitas 114B murah untuk dijalankan per klip — Sand.ai menyebut angka tersebut sekitar 0,5 yuan per klip 1080p 10 detik pada delapan H100 — dan angka seperti itulah yang menentukan apakah tim kecil mampu membiayai pembuatan video sama sekali. Tetapi 0,5 yuan itu mengasumsikan tumpukan referensi, kluster H100, dan tanpa overhead penyajian. Cara umum sebuah model terbuka seperti ini menjadi dapat digunakan secara luas adalah melalui API terkelola: seseorang menghostingnya, menetapkan harga per klip, dan Anda tidak perlu menyewa delapan H100.

Ketika ada rute yang di-host, sudut pandang routing menjadi relevan. Pada platform routing, berapa pun harga daftar yang ditetapkan vendor untuk klip MAGI-2-preview, itulah yang Anda bayar — OrcaRouter meneruskan harga daftar penyedia tanpa markup, jadi pemotongan harga vendor langsung aktif di sisi kami pada hari yang sama saat dirilis, tanpa negosiasi ulang. Dan checkpoint open-weight yang baru berusia sebelas hari tanpa benchmark independen adalah jenis model yang justru Anda inginkan di balik failover otomatis: arahkan rute ke model itu untuk evaluasi, pertahankan fallback yang sudah terbukti di endpoint yang sama, dan begitu checkpoint awal macet atau menghasilkan sesuatu yang tidak dapat digunakan, panggilan akan failover alih-alih pipeline Anda. Itulah cara mencoba model yang belum terbukti tanpa mempertaruhkan jalur produksi padanya.
Yang sedang kami tonton sekarang
• Apakah PR tersebut digabungkan, dan apa yang berubah dalam peninjauan. Daftar batasan — dua resolusi, satu durasi, tanpa torch.compile — mungkin belum final.
• Titik pemeriksaan yang disuling. Sand.ai mengatakan bahwa bobot dengan langkah lebih sedikit akan segera hadir; itulah yang mengubah angka 0,5 yuan dari pengukuran laboratorium menjadi biaya per-klip yang realistis.
• Tolok ukur independen pertama. Angka VBench dan leaderboard dilaporkan oleh vendor dan pers; uji pihak ketiga akan memastikan seberapa kuat klaim 6B-active tersebut.
Apakah runtime lain akan mengikuti. SGLang adalah runtime penyajian utama pertama yang mengadopsi MAGI-2-preview; vLLM dan lainnya mungkin tidak akan ketinggalan jauh.
• Apakah API terkelola muncul. Daya tarik utama model ini adalah biaya rendah dalam skala besar; begitu rute yang dihosting tersedia, perhitungan harga pass-through di atas mulai berlaku.
Ringkasan yang jujur: MAGI-2-preview adalah model terbuka yang baru berusia sebelas hari yang struktur biayanya bisa menjadi penting, dan PR SGLang adalah sinyal paling jelas sejauh ini bahwa ekosistem mulai menganggapnya serius. Namun dukungan penyajiannya masih berupa pull request terbuka, bukan kemampuan yang sudah dirilis. Anggap peta jalan itu nyata dan runtime-nya belum ada — dan ketika model tersebut benar-benar hadir di balik API yang sesungguhnya, pendekatan failover-pertama adalah cara Anda mengadopsinya tanpa mempertaruhkan jalur produksi pada checkpoint yang belum di-benchmark secara independen oleh siapa pun.
