
Microsoft Mage-VL: Model Video 4B Codec-Native, Dirilis Tanpa Pengumuman
- qwenBARUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 juta token · 56 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 201 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Kecerdasan61Koding61Matematika
Tidak ada posting blog Microsoft tentang Mage-VL. Tidak ada entri ruang berita Azure, tidak ada daftar katalog Foundry, tidak ada utas peluncuran, tidak ada apa pun di saluran produk yang biasanya digunakan Microsoft untuk memperkenalkan model. Yang ada justru repositori Hugging Face — microsoft/Mage-VL, enam commit, bobot 10,8 GB, Apache-2.0 — folder GitHub berisi skrip inferensi, halaman proyek yang dikelola oleh sesuatu yang menyebut dirinya Microsoft Mage Team, serta laporan arXiv dengan 23 penulis. Jika dibaca bersama, artefak-artefak tersebut menggambarkan model visi-bahasa berskala 4B dengan gagasan inti yang benar-benar tidak biasa: alih-alih mendekode video menjadi bingkai-bingkai berjarak sama dan mengalirkan kisi-kisi padat patch melalui encoder pra-terlatih web, Mage-VL membaca bitstream terkompresi itu sendiri, menggunakan encoder buatan dari nol bernama Mage-ViT untuk mempertahankan hanya patch yang bit-nya dihabiskan codec. Microsoft melaporkan bahwa hal ini memangkas token visual lebih dari 75% dan memberikan percepatan wall-clock hingga 3,5x, sekaligus menyamai Qwen3-VL-4B pada gambar statis dan mengungguli Phi-4-Reasoning-Vision 15B milik Microsoft sendiri pada video.
Kalimat terakhir itulah bagian yang patut dijaga jarak. Setiap angka performa dalam artikel ini bersumber dari makalah, model card, atau halaman proyek milik Microsoft sendiri. Sepuluh hari setelah bobot model muncul, belum ada pihak independen yang mereproduksinya, tidak ada papan peringkat pihak ketiga yang mencantumkan model tersebut, dan — sebagaimana dinyatakan dengan jelas di halaman Hugging Face — model ini "tidak digunakan oleh Inference Provider mana pun," sehingga bahkan tidak ada endpoint yang di-hosting yang bisa di-benchmark secara sembarangan. Apa yang berikut ini memisahkan apa yang dibuktikan oleh repositori dari apa yang sekadar diklaim oleh Microsoft, karena pada rilis tanpa pengumuman, kedua hal tersebut adalah kategori yang sangat berbeda.
Apa yang sebenarnya ada, sepuluh hari berjalan.
Cakupan yang dapat diverifikasi dari rilis ini kecil dan layak untuk diperinci secara tepat.
• Bobot, tertanggal 26 Juli 2026. Dua shard safetensors berukuran 4,97 GB dan 4,52 GB, ditambah file terpisah 1,07 GB bernama streammind_gate.safetensors. Pembaca milik Hugging Face sendiri melaporkan 5 miliar parameter pada BF16 — 4 miliar di decoder bahasa, sisanya terbagi antara encoder visual dan gerbang tersebut.
• Laporan teknis, diajukan pada 27 Juli 2026 (arXiv 2607.24904), satu versi, 23 penulis, berjudul "Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model."
• Kode yang dapat dijalankan, bukan sekadar bobot. Repo ini menyertakan modeling_mage_vl.py, processing_mage_vl.py, dua pemroses video termasuk codec_video_processing_mage_vl.py yang khusus, dan streammind_gate.py — sekitar 175 KB Python kustom. auto_map di config.json mengarahkan enam kelas Transformers ke berkas-berkas tersebut, itulah sebabnya repo ini menyandang tag custom_code.
• Dua lisensi, bukan satu. Mage-VL adalah Apache-2.0; encoder Mage-ViT yang berdiri sendiri diterbitkan secara terpisah di bawah MIT.
• Demo yang berfungsi tanpa perlu Anda instal. Microsoft menjalankan microsoft/mage-vl-demo sebagai Hugging Face Space di ZeroGPU, dan dua Space komunitas sudah menggunakan model ini.
• Traksi komunitas awal, yang terbentuk lebih cepat daripada komunikasi vendor itu sendiri. 268 suka, 435.784 unduhan tercatat selama bulan terakhir, sembilan kuantisasi komunitas dan dua finetune di pohon model. Penghitung unduhan mencakup penarikan otomatis dan mirror, jadi perlakukan angka mentah sebagai sinyal perhatian, bukan sebagai penerapan.
• Saudara. Mage-Flow, model teks-ke-gambar dan penyunting instruksi yang dibangun dengan anggaran tetap 4B yang sama, hadir empat hari lebih awal pada 22 Juli. Repositori GitHub menyajikan Mage sebagai "sekeluarga model multimodal yang ringan dan ramah penelitian," yang merupakan hal yang paling mendekati pernyataan posisi yang pernah dipublikasikan siapa pun.
Sebagai perbandingan, daftar hal-hal yang tidak ada sama informatifnya. Tidak ada postingan blog atau siaran pers dari Microsoft. Tidak ada entri di Azure AI Foundry, yang berarti tidak ada jalur dukungan perusahaan, tidak ada SLA, tidak ada endpoint terkelola. Tidak ada penyedia inferensi yang menyediakannya. Tidak ada dukungan vLLM atau SGLang: permintaan komunitas untuk menambahkan Mage-VL ke SGLang diajukan pada 28 Juli sebagai issue #32646 dan, hingga tulisan ini dibuat, masih terbuka tanpa pull request tertaut dan tanpa tanggapan pemelihara. Dan tidak ada evaluasi independen dalam bentuk apa pun — model tersebut tidak ada di papan peringkat netral tempat klaim seperti "mengalahkan model 15B pada video" biasanya diuji.

Satu ide: baca codec-nya, bukan frame-frame-nya.
Hampir setiap VLM yang mampu memproses video dalam produksi melakukan hal yang sama. Video didekode menjadi bingkai RGB, lalu diambil sampelnya secara seragam — satu per detik, atau 32 sepanjang klip, atau sesuai anggaran yang tersedia — dan setiap bingkai sampel dilewatkan melalui vision transformer sebagai kisi-kisi tambalan yang padat. Setiap tambalan dari setiap bingkai sampel menjadi token. Dinding latar belakang yang statis memerlukan token sebanyak orang yang berjalan di depannya, dan token tersebut diperlukan lagi di bingkai berikutnya, dan berikutnya.
Itu adalah komputasi redundan yang sangat besar, dan codec video modern sudah memecahkan masalah mendasarnya beberapa dekade lalu. H.264 dan HEVC tidak menyimpan setiap frame; mereka menyimpan frame anchor (I) sesekali secara penuh, lalu menggambarkan frame-frame di antaranya sebagai vektor gerak plus residual — "blok ini berpindah ke sini, dan inilah yang berubah." Bagian menarik dari sebuah video, hampir secara otomatis, adalah bagian yang paling banyak menghabiskan bit dari encoder.
Mage-ViT memanfaatkan itu secara langsung. Beroperasi pada granularitas patch 16x16, ia menyimpan setiap patch dari bingkai jangkar dan, untuk bingkai yang diprediksi, hanya mempertahankan patch yang ditandai sebagai menonjol oleh vektor gerak dan energi residual milik codec itu sendiri — wilayah yang membawa informasi nyata, gerak, atau perubahan adegan — sementara membuang patch yang redundansinya rendah dan sepenuhnya redundan. Microsoft memperkirakan pengurangannya mencapai lebih dari 75% token visual, dengan konteks spatio-temporal tetap terjaga karena bingkai jangkar masih membawa seluruh adegan. Desainnya tidak bergantung pada codec: jalur tradisional menerima H.264 atau HEVC, dan jalur neural menerima DCVC-RT.
Keindahannya adalah estimasi gerak sebenarnya sudah dilakukan. Setiap video terkompresi di internet datang dengan peta yang menunjukkan di mana aksi terjadi, dihitung oleh encoder dan dibayar oleh siapa pun yang mengunggahnya. Pipeline konvensional membuang peta itu begitu video didekode ke RGB, lalu menghabiskan waktu GPU untuk menemukan kembali informasi yang sama. Mage-VL dengan sederhana menolak untuk membuangnya. Terlepas dari apakah angka-angka benchmark bertahan, pengamatan itulah kontribusi yang bertahan lama di sini — dan itulah alasan rilis ini layak dibaca meskipun Anda tidak pernah mengunduh bobotnya.

Hal yang paling bersih tentang eksperimen itu
Tersembunyi dalam pengaturan adalah keputusan desain yang membuat hasilnya jauh lebih mudah diinterpretasikan daripada peluncuran model pada umumnya, dan hampir tidak ada yang meliput rilis ini yang menyorotinya: model bahasa dipertahankan tetap.
Decoder Mage-VL adalah Qwen3-4B-Instruct-2507, tanpa modifikasi. Baseline perbandingannya, Qwen3-VL-4B, menggunakan backbone Qwen3 4B yang sama dengan encoder visual pra-latih web konvensional. Jadi ketika Mage-VL meningkatkan performa dibandingkan Qwen3-VL-4B, selisihnya dapat diatribusikan pada encoder dan tokenisasi native-codec, bukan pada model bahasa yang lebih besar atau yang dilatih lebih baik. Itu adalah ablasi terkontrol yang dikemas sebagai perbandingan produk, dan merupakan fitur metodologis terkuat dari rilis ini.
Ini juga berlaku sebaliknya, dan kejujuran menuntut untuk mengatakannya. Perbandingan dengan backbone yang sama adalah uji paling adil terhadap gagasan encoder dan sekaligus pembingkaian yang paling mungkin membuatnya tampak baik — Microsoft memilih baseline yang mengisolasi kontribusinya sendiri. Perbandingan Phi-4 tidak memiliki sifat itu: Phi-4-Reasoning-Vision-15B dan Phi-4-MM-5.6B memiliki backbone yang berbeda, resep pelatihan yang berbeda, post-training yang berbeda. "Mengalahkan model 15B kami pada video" adalah hasil nyata tetapi jauh lebih longgar, dan itu juga merupakan perbandingan terhadap karya lama Microsoft sendiri, yang merupakan jenis perbandingan paling mudah untuk dimenangkan.
Skala pelatihan adalah tempat lain di mana makalah ini membuat klaim yang benar-benar mengejutkan. Mage-ViT dilatih dari awal pada sekitar 560M gambar tanpa label dan 100M bingkai video tanpa label — korpus yang besar secara absolut, tetapi jauh di bawah miliaran pasangan gambar-teks kurasi yang mendasari encoder yang bersaing dengannya. Temuan pertama yang dinyatakan dalam makalah adalah bahwa encoder VLM yang kuat tidak memerlukan data supervisi berskala web. Jika hal itu bertahan di bawah pengawasan independen, hal itu jauh lebih penting daripada baris tolok ukur mana pun.
Angka-angka itu, dan milik siapa angka-angka tersebut.
Yang berikut ini seluruhnya dilaporkan oleh Microsoft, pada kerangka evaluasi milik Microsoft sendiri, terhadap garis dasar yang dipilih Microsoft. Tidak ada satu pun dari ini yang direproduksi oleh pihak ketiga. Bacalah sebagai hipotesis dengan batas kesalahan yang luar biasa spesifik, bukan sebagai papan skor.
• Video-MME — Mage-VL-4B 64.0 vs Qwen3-VL-4B 59.7 vs Phi-4-Reasoning-Vision-15B 55.3
• NExT-QA — 83.1 vs 79.8 vs 69.0
• LongVideoBench — 61.3 vs 57.7 vs 51.2
• VideoEval-Pro — 45.2 berbanding 20.7 untuk Phi-4
• Timelens-QVHighlight (penambatan temporal) — 57,4 vs 34,9 vs 11,6
• Ref-DAVIS17 (pelacakan rujukan) — 25.83 vs 7.48 vs 2.15
• DocVQA-val — 95.14 vs 94.69 vs 92.79 (Phi-4-MM-5.6B)
• OCRBench — 81.80 vs 81.60 vs 81.70
• ChartQA — 84.88 vs 83.96 vs 83.40
• MMStar — 67.32 vs 62.04 vs 59.63
• RealWorldQA — 70.46 vs 70.85 vs 70.72, salah satu baris yang Mage-VL kalah
• MMBench-EN-dev — 84.02 berbanding 83.25, dengan Phi-4-Reasoning-Vision-15B unggul dari keduanya pada 84.19
• CV-Bench-3D / CV-Bench-2D — 94.75 vs 92.30, dan 82.13 vs 81.00
• EmbSpatial — 82.67 berbanding 77.50
• OVO-Bench (streaming) — 64,00 secara keseluruhan, disebut sebagai yang tercanggih di antara arsitektur streaming; subkumpulan persepsi visual waktu nyata rata-rata 79,84% dibandingkan 72,8% untuk Qwen3-VL-4B, pada 1 fps
• Mage-ViT sebagai encoder mandiri — di atas 86.3% pada ImageNet dengan anggaran 676 token, di atas 96.1% pada Food-101

Tiga pembacaan atas meja itu lebih berharga daripada meja itu sendiri.
Untuk gambar, "paritas" adalah istilah yang jujur.DocVQA sebesar 0.45, OCRBench sebesar 0.20, ChartQA sebesar 0.92, MMBench sebesar 0.77 — angka-angka ini berada dalam rentang di mana templat prompt atau seed decoding yang berbeda dapat membalikkan urutan, dan RealWorldQA sebenarnya dimenangkan oleh Qwen3-VL-4B. Microsoft mengatakannya demikian, menggambarkan kinerja gambar sebagai paritas, bukan kemenangan, dan penggambaran itu benar. Jika beban kerja Anda adalah tanya jawab dokumen dan gambar, rilis ini tidak memberi Anda alasan untuk berpindah.
Pada video dan temporal grounding, kesenjangannya besar dan konsisten. Timelens-QVHighlight hampir menggandakan baseline; Video-MME, NExT-QA, dan LongVideoBench semuanya bergerak 3,6 hingga 4,3 poin ke arah yang sama dengan backbone yang tetap. Konsistensi di antara benchmark yang menguji hal-hal yang berbeda adalah pola yang Anda harapkan jika perubahan encoder itu nyata, bukan artefak tuning.
Dua baris tidak boleh dikutip tanpa konteks. Ref-DAVIS17 pada 25.83 berbanding 7.48 tampak seperti penghancuran 3.5x, dan delta spasial utama dalam makalah mencakup +11.0 pada VSI-Bench dan +53.1 pada CrossPoint. Ketika baseline mendapat skor mendekati batas bawah pada suatu tugas, delta tersebut sebagian besar mengukur model mana yang dilatih untuk memahami format tugas — bukan model mana yang lebih mumpuni. Kehati-hatian yang sama berlaku untuk hasil streaming secara absolut: pada SoccerNet, angka yang dilaporkan Mage-VL adalah 55.54 TimVal, 83.14 ROC-AUC, dan F1 sebesar 16.35. F1 sebesar 16.35 adalah angka state-of-the-art dalam evaluasi yang masih muda, bukan masalah yang telah terpecahkan. Persepsi streaming proaktif masih tahap awal, dan skor absolut pemimpinnya menunjukkan hal itu.
Gerbang: sebuah model yang memutuskan kapan harus berbicara
Ide arsitektur kedua adalah ide dengan implikasi produk yang paling jelas, dan ide itu menjelaskan file misterius 1.07 GB tersebut.
Mage-VL membagi streaming menjadi dua proses, yang dalam makalah disebut sebagai System 1 dan System 2. System 1 adalah "gerbang kognisi" ringan yang mengamati setiap jendela berjalan dari fitur codec dan memperkirakan probabilitas bahwa sesuatu yang layak dibicarakan baru saja selesai terjadi. Di bawah ambang batas, ia tetap diam dan bagian model yang mahal tidak pernah dijalankan. Di atas ambang batas, decoder penuh dipanggil untuk menghasilkan respons. Konfigurasi demo menggunakan jendela kausal 30 detik pada 1 fps, CLI mengekspos ambang batas secara langsung sebagai --gate_threshold, dan titik masuk streaming memproses video segmen demi segmen (inference_streaming.py --video_backend codec --segment_sec 8). Hanya gerbang yang dilatih pada tahap akhir, dengan 3,35 juta sampel streaming.
Ada dua hal yang patut dicermati. Pertama, gate tersebut bukanlah kepala klasifikasi kecil yang ditempelkan di bagian atas: bobot BF16 sebesar 1,07 GB kira-kira setengah miliar parameter, sebuah model sungguhan yang dirilis sebagai checkpoint terpisah. Kedua, nama filenya adalah streammind_gate.safetensors — penamaan tersebut menunjukkan bahwa komponen ini merupakan turunan dari karya streaming-perception sebelumnya, bukan diciptakan untuk makalah ini, meskipun repositori itu sendiri tidak menjelaskan silsilah tersebut secara eksplisit.
Mengapa ini penting secara komersial: untuk video yang selalu aktif, biaya dominannya bukanlah latensi per panggilan, melainkan frekuensi panggilan. Umpan kamera yang berjalan 24/7 melalui VLM konvensional pada 1 fps berarti 86.400 forward pass per hari baik terjadi sesuatu maupun tidak. Gerbang yang tetap diam selama 99% rekaman di mana tidak terjadi apa-apa mengubah bentuk tagihan tersebut, bukan hanya ukurannya. Apakah gerbang Microsoft cukup akurat untuk dipercaya mengambil keputusan itu adalah hal yang belum diuji oleh siapa pun di luar laboratorium.
Bisakah kamu benar-benar menjalankannya hari ini?
Ya, jika Anda memiliki GPU dan kesabaran. Hambatannya nyata dan sebagian besar terletak pada pipeline video, bukan pada modelnya.
Memori.Microsoft tidak memublikasikan persyaratan VRAM. Dari indeks bobot: 9,49 GB shard ditambah 1,07 GB gate sekitar 10,6 GB parameter BF16, sehingga kartu 16 GB adalah batas bawah yang realistis untuk pekerjaan gambar dan 24 GB atau lebih adalah target yang masuk akal setelah Anda menambahkan cache KV untuk video panjang atau jendela streaming. Itu adalah perhitungan dari ukuran file, bukan spesifikasi vendor—ukur sebelum Anda menyediakan.
Kode kustom wajib digunakan. auto_map mengarahkan setiap titik masuk Transformers ke modul milik repo itu sendiri, sehingga trust_remote_code diperlukan. Anda menjalankan Python milik Microsoft, bukan sekadar memuat tensor. Belum ada jalur vLLM atau SGLang, yang berarti tidak ada paged attention, tidak ada continuous batching, tidak ada stack serving produksi — sebuah kesenjangan signifikan jika Anda berharap menempatkannya di belakang sebuah endpoint.
Jalur codec memerlukan perkakas sistem. FFmpeg dan ffprobe harus ada di PATH Anda. Backend codec tradisional bergantung pada paket codec-video-prep yang menyediakan langkah cv-preinfer; jalur neural memerlukan DCVC-RT; backend frame biasa memerlukan Decord. Persyaratan tersebut juga menyertakan flash-attn dan mamba-ssm, yang mengompilasi ekstensi CUDA — instal build PyTorch yang sesuai dengan toolkit Anda terlebih dahulu atau alokasikan waktu satu sore untuk proses build.
Apa yang konfigurasi beri tahukan kepada Anda yang tidak dilakukan kartu.Posisi embeddings maksimum adalah 262,144, sehingga dekoder mewarisi konteks panjang Qwen3-4B. Sisi visi berjalan pada input 448 piksel dengan patch 16x16, encoder 24 lapis dengan 1024 hidden, penggabungan spasial 2x2, satu token per detik video, dan jendela empat bingkai. Pelatihan mencapai 384 bingkai panjang temporal pada tahap ketiga. Batas atas 262K tidak sama dengan 262K perilaku tervalidasi, dan 384 bingkai adalah panjang yang sebenarnya diajarkan untuk ditangani model.
Kekurangan yang diketahui. Sebuah diskusi terbuka di repositori, diajukan pada 4 Agustus dan masih belum dijawab, melaporkan ketidaksejajaran token ketika gambar dan video dikirim dalam permintaan yang sama. Perangkat lunak hari kesepuluh memang berperilaku seperti perangkat lunak hari kesepuluh. Jika Anda ingin mencobanya tanpa semua ini, Space yang dikelola Microsoft di ZeroGPU adalah opsi tanpa instalasi.
Baris lisensi kurang sederhana daripada "Apache-2.0"
Kartu model menyebutkan Apache-2.0. Enkoder Mage-ViT menyebutkan MIT. Keduanya sama permisifnya dengan lisensi bobot terbuka pada umumnya. Namun repositori keluarga menyatakan bahwa "model-model ini dirilis hanya untuk tujuan penelitian," dengan penekanan pada tinjauan AI yang bertanggung jawab dan pengawasan manusia — dan kalimat itu terasa janggal di samping lisensi Apache-2.0 yang tidak membatasi penggunaan komersial. Selain itu, dependensi: DCVC-RT dan perkakas persiapan codec memiliki ketentuan sendiri, terlepas dari modelnya.
Untuk proyek hobi, ini sepele. Untuk apa pun yang dikirim ke pelanggan, ini adalah jenis ambiguitas yang seharusnya diserahkan ke penasihat hukum sebelum masuk ke produksi, dan jenis pertanyaan yang layak ditanyakan di repositori itu sendiri — di mana, perlu dicatat, saat ini tidak ada perwakilan Microsoft yang menjawab.
Haruskah Anda membangun di atas ini?
Keputusan ini terbagi dengan jelas menurut satu garis: apakah masalah Anda adalah aliran atau permintaan.
Jika Anda melakukan persepsi yang selalu aktif — umpan kamera, siaran langsung, bidang pandang robot, rapat yang berlangsung selama satu jam — Mage-VL memang ditujukan tepat untuk Anda, dan ekonomi self-hosting berpihak pada Anda. Harga API per token meningkat seiring bertambahnya frame, sebuah model yang kejam untuk video berkelanjutan; model 4B di perangkat keras Anda sendiri dengan gerbang yang tetap diam selama rekaman tanpa peristiwa penting adalah kurva biaya yang secara fundamental berbeda. Kendalanya adalah Anda juga bersedia menjadi orang pertama di luar Microsoft yang mencari tahu apakah penilaian gerbang tersebut benar-benar bisa diandalkan.
Jika masalah Anda berbentuk permintaan — pengguna mengunggah dokumen, PDF, tangkapan layar, atau klip pendek dan mengharapkan jawaban — kasusnya jauh lebih lemah. Pada tugas-tugas itulah Mage-VL setara dengan model yang masih harus Anda hosting sendiri, dan endpoint multimodal terhosting hanya berjarak satu panggilan API tanpa GPU, tanpa build ffmpeg, dan tanpa trust_remote_code. Di OrcaRouter, Gemini 3.6 Flash berharga $1,50 per juta token masukan dan $7,50 per juta token keluaran, yang merupakan harga daftar penyedia yang diteruskan langsung — kami mengambil markup 0%, jadi ketika vendor memangkas harga, pemangkasan itu aktif di pihak kami pada hari yang sama, bukan setelah tinjauan harga. Satu kunci menjangkau lebih dari 200 model dengan failover otomatis jika penyedia menurun, yang merupakan alasan praktis untuk menjadikan endpoint terhosting sebagai default dan mencadangkan self-hosting untuk beban kerja yang benar-benar membutuhkannya.
Agar lebih jelas, karena perbedaannya penting: kami tidak menghosting Mage-VL, dan tidak ada pihak lain yang menghostingnya. Halaman model Hugging Face sendiri menyatakan bahwa tidak ada penyedia inferensi yang menerapkannya. Saat ini, menjalankannya berarti menjalankannya sendiri.
Apa yang akan mengubah pembacaan ini?
Empat hal, dalam urutan kasar berdasarkan seberapa besar pengaruhnya.
Evaluasi independen adalah yang utama. Setiap angka di atas adalah klaim, dan klaim yang paling perlu diuji bukanlah skor tolok ukur melainkan percepatan 3,5x, yang diukur terhadap pengambilan sampel bingkai seragam pada NExT-QA tanpa detail perangkat keras, resolusi, atau jumlah bingkai yang dipublikasikan. Prapemrosesan codec memindahkan kerja nyata ke CPU dan ke ffmpeg; kemenangan waktu nyata yang diukur dari awal hingga akhir pada perangkat orang lain adalah satu-satunya versi angka yang layak untuk direncanakan.
Kedua, dukungan penyajian. Implementasi vLLM atau SGLang yang digabungkan akan mengubah ini dari checkpoint riset menjadi sesuatu yang dapat Anda letakkan di belakang penyeimbang beban. Isu SGLang terbuka dan belum diklaim; itulah utas yang perlu dipantau.
Ketiga, sebuah pencatatan di Azure AI Foundry, yang akan menandakan bahwa Microsoft bermaksud menjadikan ini sebagai produk, bukan sekadar makalah. Tidak ada apa pun dalam rilis saat ini yang menunjukkan bahwa hal itu akan segera terjadi.
Keempat, dan yang paling aneh: apakah Microsoft akan mengatakan sesuatu. Laporan teknis dengan 23 penulis, halaman proyek yang terpelihara, Space demo yang dihosting, dan model generatif saudara empat hari sebelumnya tidak menggambarkan kebocoran atau kecelakaan — mereka menggambarkan publikasi riset yang disengaja yang sepenuhnya melewatkan pengeras suara produk. Komunitas tetap mengisi keheningan itu, dengan sembilan kuantisasi dan dua finetune dalam sepuluh hari.
Bagi sebagian besar tim, langkah yang tepat adalah membaca makalahnya, bukan mengunduh bobotnya. Ide codec-native adalah inti yang bisa dibawa, dan itu portabel: jika menggunakan kembali vektor gerak yang sudah dihitung encoder benar-benar menghasilkan pengurangan token sebesar 75% pada akurasi yang setara, teknik itu akan muncul di model dengan posting peluncuran, dukungan penyedia, dan tolok ukur yang direproduksi. Jika Anda menjalankan video kontinu saat ini, perhitungannya berbeda — klon repositori, jalankan klip Anda sendiri melalui kedua backend, dan ukur sendiri percepatannya, karena saat ini Anda akan menjadi yang pertama.
Pertanyaan yang benar-benar layak ditanyakan
Apakah Mage-VL hanyalah Qwen3-VL dengan label Microsoft di atasnya?
Tidak, meskipun kebingungan itu dapat dipahami. Dekoder bahasa adalah Qwen3-4B-Instruct-2507, digunakan sebagaimana adanya — Microsoft tidak melatih LLM baru. Semua yang lain adalah baru: Mage-ViT dipretrain dari nol, tokenisasi asli codec tidak memiliki padanan di Qwen3-VL, dan gerbang streaming adalah model tambahan dengan setengah miliar parameter. Menggunakan kembali backbone terbuka dan mengganti front-end visual adalah strategi penelitian yang sah dan semakin umum, dan di sini hal itu juga yang membuat perbandingan head-to-head dapat diinterpretasikan. Jika Anda memiliki persyaratan kepatuhan terkait asal-usul model, perhatikan bahwa garis keturunannya melalui bobot Qwen3 milik Alibaba dan periksa kedua lisensi tersebut.
Apakah "3.5x lebih cepat" berarti 3.5x lebih murah untuk dilayani?
Tidak bisa diandalkan. Angka tersebut adalah percepatan wall-clock pada NExT-QA dibandingkan dengan pengambilan sampel frame seragam, dan Microsoft membingkainya sebagai "hingga." Ada dua hal yang menguranginya dalam praktik. Inferensi codec-native memerlukan lintasan persiapan — ffmpeg, ffprobe, dan langkah cv-preinfer, atau pengodean ulang DCVC-RT untuk jalur neural — yang menghabiskan waktu CPU yang tidak dihabiskan oleh pipeline frame naif, dan yang tidak muncul dalam pengukuran di sisi GPU. Dan keuntungannya berasal dari pengurangan token, sehingga skalanya bergantung pada seberapa redundan rekaman Anda: kamera keamanan yang sebagian besar statis seharusnya menghasilkan lebih baik daripada angka yang dikutip, sementara video editan potongan cepat yang hampir setiap patch-nya berubah seharusnya lebih buruk. Ukurlah pada klip Anda sendiri.
Apakah saya memerlukan file video khusus untuk menggunakan jalur codec?
Sebagian besar tidak, dan ini adalah kejutan yang menyenangkan. File MP4 biasa sudah merupakan H.264 atau HEVC, yang persis seperti yang dikonsumsi oleh backend codec tradisional — vektor gerak yang dibutuhkannya sudah ada di file yang sudah Anda miliki. Yang perlu Anda tambahkan hanyalah peralatannya: FFmpeg dan ffprobe di PATH Anda, plus paket persiapan codec. Backend neural adalah pengecualian; DCVC-RT mengharapkan video yang dienkode dengan codec tersebut, jadi Anda perlu melakukan pengodean ulang. Dan backend bingkai biasa tetap tersedia sebagai cadangan yang berperilaku seperti VLM lainnya, yang juga merupakan cara yang jujur untuk menguji sendiri klaim codec tersebut secara A/B.
Bisakah saya menggunakannya secara komersial?
Lisensi menyebutkan Apache-2.0, yang mengizinkan penggunaan komersial, modifikasi, dan redistribusi. Repositori tersebut juga menyatakan bahwa model-model dirilis "hanya untuk tujuan penelitian." Kedua pernyataan itu berbeda arah, dan kesenjangan ini belum diklarifikasi oleh siapa pun di Microsoft — yang, pada rilis tanpa pengumuman, tanpa daftar produk, dan tanpa kehadiran vendor dalam diskusi repositori, tidak mengherankan. Jika uang bergantung pada jawabannya, mintalah pengacara untuk membaca kedua dokumen dan lisensi dependensi daripada hanya mempercayai lencana lisensi.
