การ์ดชื่อเรื่องที่สร้างขึ้นในสไตล์ประจำของ OrcaRouter ซึ่งอ่านว่า “PixelUMM vs Microsoft Mage-VL” พร้อมไทล์สถิติสี่ไทล์: “>75%” (การลดโทเค็นภาพที่ Mage-VL รายงาน), “3.5×” (ความเร็วตามเวลาจริงที่รายงาน เมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ), “15.2B vs 4B” (ยอดรวมของ PixelUMM เทียบกับโครงหลัง Qwen3-4B ของ Mage-VL) และ “0 / 1” (ความสามารถในการสร้างที่เป็นศูนย์ของ Mage-VL เทียบกับหนึ่งโมเดลของ PixelUMM ที่ครอบคลุมทั้งภาพและวิดีโอ) บรรทัดส่วนท้ายอ่านว่า “ตัวเลขของทั้งสองแล็บเอง; ไม่มีการรันซ้ำอย่างอิสระของโมเดลใดทั้งสอง” โลโก้ OrcaRouter ถูกประกอบเข้ากับแถบขอบด้านล่างขวา
Guides & Insights

PixelUMM กับ Microsoft Mage-VL: ตัวหนึ่งลบ Visual Tokenizer ทิ้ง ส่วนอีกตัวเขียนมันขึ้นมาใหม่

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทั้ง PixelUMM และ Microsoft Mage-VLถูกสร้างโดยทีมที่เชื่อว่าวิธีที่ภาพถูกแปลงเป็นโทเค็นคือคอขวดที่ผิด — และพวกเขาแก้มันในทิศทางที่ตรงกันข้าม Mage-VL โมเดลสตรีมมิงแบบ codec-native ของ Microsoft ยังคงใช้ tokenizer และทำให้มันดุดันขึ้นมาก: มันทำตามโครงสร้างของวิดีโอโคเดกสมัยใหม่ เก็บทุก anchor frame และเฉพาะแพตช์ของ predicted frame ที่โคเดกใช้บิต และรายงานว่าลดโทเค็นภาพลงมากกว่า 75% พร้อมได้ความเร็ว wall-clock สูงสุดถึง 3.5× เมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ PixelUMM โมเดลแบบรวมที่ไร้เอนโคเดอร์ของ NVIDIA ตัด tokenizer ออกไปทั้งหมด — ทุกแพตช์ 16×16 ของพิกเซลดิบไปถึงแบ็กโบนผ่านการฉายเชิงเส้นเพียงครั้งเดียว โดยไม่มี VAE และไม่มี vision transformer อยู่ที่ไหนเลย ตัวหนึ่งบีบอัดได้แน่นกว่า อีกตัวปฏิเสธที่จะบีบอัดเลย และมีเพียงตัวเดียวเท่านั้นที่สามารถสร้างอะไรได้

ความแตกต่างข้อสุดท้ายนี่แหละที่ทำให้การจับคู่นี้น่าสนใจยิ่งกว่าการทะเลาะกันเรื่องสเปก Mage-VL เป็นผู้เฝ้ามอง — โมเดลรับรู้แบบสตรีมมิ่งที่มีเกตเชิงรุกคอยตัดสินใจว่าควรพูดเมื่อไร PixelUMM เป็นนักอ่านที่วาดภาพได้ด้วย: เวตชุดเดียวกันตอบคำถามเกี่ยวกับภาพและสร้างวิดีโอใหม่จากพรอมป์ต์ข้อความ พวกมันเป็นคำตอบสองแบบที่เข้ากันไม่ได้ต่อคำถามที่ว่า "โมเดลวิสัยทัศน์แบบรวมเป็นหนึ่งควรเป็นแบบไหน" และตัวเลขของแต่ละแล็บก็เป็นของตัวเอง

จุดที่เกิดการบีบอัด

หลักคิดตั้งต้นของ Mage-VL คือปฏิทรรศน์ของโมราเวกฉบับสมัยใหม่: โมเดลภาพ–ภาษาเก่งในการให้เหตุผลออฟไลน์ที่ยาก แต่กลับช้าและกินพลังประมวลผลสูงในการรับรู้แบบเรียลไทม์ที่ง่าย ทางแก้ของมันคือการจัดแนวให้สอดคล้องกับโคเด็ก แทนที่จะถอดรหัสสตรีมให้เป็นเฟรมที่สุ่มตัวอย่างสม่ำเสมอ และส่งกริดหนาแน่นผ่าน ViT ที่ถูกฝึกมาก่อนบนเว็บและถูกแช่แข็ง Mage-VL แยกสตรีมออกเป็นเฟรมหลัก (I) และเฟรมที่ทำนาย (P) เก็บแพตช์หลักทั้งหมดไว้ และเก็บเฉพาะแพตช์ของเฟรมที่ทำนายซึ่งมีการเคลื่อนไหวจริงหรือรายละเอียดใหม่ ตัวเข้ารหัส Mage-ViT ถูกฝึกตั้งแต่เริ่มต้นบนกริดแพตช์ขนาด 16×16 ด้วยการเข้ารหัสตำแหน่งแบบ Rotary 3 มิติ และไม่ขึ้นกับโคเด็กใดโดยเฉพาะอย่างชัดเจน — อินเทอร์เฟซเดียวกันรองรับเวกเตอร์การเคลื่อนไหวและพลังงานส่วนเหลือของ H.264/AVC หรือ HEVC หรือแผนที่อัตราที่เรียนรู้ได้ของโคเด็กแบบนิวรอล โดยไม่ต้องเปลี่ยนสถาปัตยกรรมหรือฝึกใหม่

ข้อตั้งของ PixelUMM คือตัวเอ็นโคเดอร์เองคือปัญหา ไม่ใช่ประสิทธิภาพของมัน บทความของ PixelUMM โต้แย้งว่าโมเดลอย่าง BAGEL มีอินเทอร์เฟซเชิงภาพสองแบบ — ViT สำหรับคุณลักษณะเชิงความหมาย และ VAE สำหรับค่าแฝงเพื่อการสร้างใหม่ — ซึ่งเพิ่มบริบทเชิงภาพต่อภาพที่ใช้กำหนดเงื่อนไขเป็นราวสองเท่า และบังคับให้ไปป์ไลน์การพรีเทรนแบบเห็น-ภาษา (vision-language) ต้องสร้างใหม่โดยยึดสตรีมที่สอง PixelUMM ลบทั้งสองทิ้ง: ภาพกลายเป็นแพตช์เชิงพื้นที่ขนาด 16×16 วิดีโอกลายเป็นทูบเล็ตเชิงปริภูมิ-เวลา 4 เฟรม และพิกเซลดิบเข้าสู่ Transformer แบบ decoder-only ผ่านการฉายเชิงเส้นชั้นเดียว ความเข้าใจคือข้อความแบบออโตเรเกรสซีฟ; การสร้างคือ flow matching ในปริภูมิพิกเซล

• กลยุทธ์การบีบอัด — Mage-VL: เชิงเวลา ซึ่งได้มาจากโคเดก; เก็บแองเคอร์ไว้ ทำให้เฟรมที่ทำนายมีความเบาบาง PixelUMM: ไม่มี; เก็บทุกแพตช์ของพิกเซลดิบ

• สิ่งที่ฝึกฝนตั้งแต่เริ่มต้น — Mage-VL: สแต็กวิชวลทั้งหมด บนภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ PixelUMM: ตัวฝังและตัวถอดรหัสพิกเซล บนพื้นฐานของแกนหลักภาษาศาสตร์ Qwen3-8B

• โครงข่ายหลัก — Mage-VL: Qwen3-4B-Instruct-2507 ซึ่งเป็นองค์ประกอบเดียวที่ผ่านการพรีเทรน อยู่เบื้องหลังโปรเจกเตอร์ MLP สองชั้น PixelUMM: Qwen3-8B มีพารามิเตอร์ทั้งหมดประมาณ 15.2B

• พฤติกรรมการสตรีมมิ่ง — Mage-VL: เกตการรู้คิดจะให้คะแนนแต่ละหน้าต่างแบบเลื่อน และจะเงียบไว้จนกว่าเหตุการณ์ที่ควรค่าแก่การตอบสนองจะเสร็จสมบูรณ์ จึงจะเรียกใช้โมเดลเต็มรูปแบบในตอนนั้นเท่านั้น PixelUMM: ไม่มีโหมดสตรีมมิ่ง; คำขอเป็นการเรียกสำหรับการสร้างหรือการทำความเข้าใจ

A headless-browser capture of the Hugging Face model card for the Microsoft Mage-VL repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

แต่ละอย่างทำอะไร และไม่ทำอะไร

Mage-VL คือ checkpoint เดียวที่ให้ทั้งความเข้าใจภาพและวิดีโอ พร้อมกับ proactive streaming gate ไปในตัว — น้ำหนักชุดเดียวกันตอบคำถามแบบออฟไลน์และขับเคลื่อนคอมเมนตารีที่ถูกกระตุ้นด้วยเหตุการณ์ โดยรวม codec processor, แพ็กเกจ neural codec และ gate ไว้ด้วยกัน การเปิดตัวครั้งที่สอง microsoft/Mage-ViTคือ visual encoder แบบสแตนด์อโลนจากขั้นตอนการพรีเทรนตั้งแต่เริ่มต้น โดยนำเสนอเป็น front end แบบ drop-in สำหรับการฝึกโมเดลมัลติโมดัลอื่น ๆ สิ่งที่ Mage-VL ไม่ได้ทำคือการสร้าง มันอ่านเท่านั้น

PixelUMM ครอบคลุม text-to-image, text-to-video ที่ 96 เฟรมและ 24 fps และข้อความที่มีภาพและวิดีโอเป็นเงื่อนไข มีเช็กพอยต์ให้ใช้งานสี่ตัว — S8-F22-R05 เป็นค่าเริ่มต้นที่ครอบคลุมทั้งสี่งาน S8-F18-R01ปรับแต่งมาเพื่อให้ได้ text-to-video ที่ดีขึ้นที่ 480p และ 720p แต่ไม่สามารถทำ video understanding ได้ และมีสเตจระดับกลางอีกสองตัว สิ่งที่มันไม่ทำคือ streaming, editing หรือ 3D หากคุณต้องการโมเดลที่คอยดูฟีดสดและพูดเมื่อมีบางอย่างเกิดขึ้น PixelUMM มีสถาปัตยกรรมที่ผิดไปโดยสิ้นเชิง และไม่มีคอลัมน์ benchmark ใดจะบอกคุณได้เรื่องนั้น

ช่องว่างการนำไปใช้คือสัญญาณแรกที่ตรงไปตรงมา

สองรีลีสนี้ไม่ได้มีความสมบูรณ์เท่ากัน และตัวนับดาวน์โหลดก็บอกเรื่องนั้นได้ตรงไปตรงมามากกว่าโพสต์เปิดตัวใด ๆ

• Mage-VL — เผยแพร่บน Hugging Face เมื่อวันที่ 25 กรกฎาคม 2026 ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคที่เผยแพร่คู่กันและตัวระบุ arXiv เมื่อต้นเดือนตุลาคม มันมียอดดาวน์โหลดราว 13,800 ครั้งและ 414 ไลก์ และระบบนิเวศเล็ก ๆ ของงานจากชุมชนได้เติบโตขึ้นรอบ ๆ มัน

• PixelUMM — เผยแพร่บน Hugging Face เมื่อวันที่ 1 ตุลาคม 2026 ภายใต้สัญญาอนุญาตเช็กพอยต์แบบไม่ใช้ในเชิงพาณิชย์ จำนวนการดาวน์โหลดเป็นศูนย์ และจำนวนไลก์เป็นสาม ณ เวลาที่เขียนสิ่งนี้ มันเพิ่งมีอายุเพียงไม่กี่วัน

ยังไม่มีการประกาศจากทั้งสองแล็บสำหรับการเปิดตัวของแต่ละรายการ — Mage-VL เปิดตัวในเดือนกรกฎาคมโดยไม่มีประกาศ และ PixelUMM เปิดตัวในเดือนตุลาคมโดยไม่มีประกาศ ความสมมาตรนี้มีอยู่จริง แต่การตีความว่าทั้งสองเป็นอาร์ติแฟกต์ที่เทียบเท่ากันจะเป็นความผิดพลาด Mage-VL ได้รับความสนใจจากชุมชนมาแล้วสิบสัปดาห์ ส่วน PixelUMM เพิ่งมีมาไม่กี่วัน โมเดลที่ไม่มีใครภายนอกแล็บเคยรันเป็นคนละเรื่องกับโมเดลที่คนไม่กี่พันคนดาวน์โหลดไปแล้ว และมีเพียงหนึ่งในสองนี้เท่านั้นที่อยู่ในหมวดที่สอง

A generated scoreboard card titled “PixelUMM vs Microsoft Mage-VL — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual tokenizer, backbone, trained from scratch, streaming, generation and licence. Mage-VL's column shows a codec-native sparse token grid, a Qwen3-4B-Instruct-2507 backbone, a Mage-ViT pretrained from scratch on about 100M unlabeled media, proactive streaming with a cognition gate, no generation, and Apache-2.0; PixelUMM's column shows no tokenizer at all, a Qwen3-8B backbone at 15.2B total, pixel embedders and decoders trained on top of it, no streaming mode, text-to-image and text-to-video plus understanding, and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

กระดานคะแนน พร้อมที่มา

ตัวเลขทุกตัวเป็นของห้องแล็บที่พัฒนาขึ้นเอง ของ Mage-VL มาจากการ์ดและรายงานทางเทคนิคของ Microsoft; ของ PixelUMM มาจาก preprint ของมัน ทั้งสองยังไม่ได้รับการทำซ้ำอย่างอิสระ

• โทเคนภาพ — Mage-VL: รายงานการลดลงมากกว่า 75% เมื่อเทียบกับการสุ่มตัวอย่างเฟรมแบบหนาแน่น PixelUMM: ไม่มีการลดลง; ข้อโต้แย้งคือแพตช์ดิบเป็นการขจัดการเข้ารหัสครั้งที่สองออกไป มากกว่าที่จะย่อขนาดการเข้ารหัสครั้งแรก

• ความเร็วตามเวลาจริง (wall-clock speed) — Mage-VL: เร็วกว่าการสุ่มเฟรมแบบสม่ำเสมอถึง 3.5 เท่า ที่ความแม่นยำเท่ากัน ตามรายงานของ Microsoft ส่วน PixelUMM: ไม่มีการกล่าวอ้างเชิงเปรียบเทียบเรื่องความเร็วในงานวิจัย

• คุณภาพตัวเข้ารหัส — Mage-VL: Mage-ViT รายงานผล CIFAR-10 ที่ 99.33% และ ImageNet ที่ 85.69% ภายใต้งบประมาณ 256 โทเคน จากสื่อที่ไม่มีป้ายกำกับประมาณ 100M รายการ PixelUMM: ไม่มีเกณฑ์มาตรฐานตัวเข้ารหัสที่เทียบเท่า เนื่องจากไม่มีตัวเข้ารหัสให้วัดประสิทธิภาพ

• การเข้าใจวิดีโอ — Mage-VL: รายงานการเพิ่มขึ้นเมื่อเทียบกับ Qwen3-VL-4B บนทุกเกณฑ์มาตรฐานด้านวิดีโอและการระบุตำแหน่งเชิงเวลา ที่รายงาน รวมถึง +22.5 บน QVHighlight และ +17.1 บน ActivityNet PixelUMM: MVBench 70.53, Video-MME 57.33 โดยไม่มีคำบรรยาย, LongVideoBench 59.61, LVBench 40.41

• ความเข้าใจภาพ — Mage-VL: ทัดเทียมกับ Qwen3-VL-4B บนภาพนิ่ง ตามที่ Microsoft รายงาน PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96

• การสร้าง — Mage-VL: ไม่มี PixelUMM: GenEval ภาพรวม 0.83 ด้วยตัวเขียนพรอมต์ใหม่, DPG-Bench 85.74, VBench Part 1 คุณภาพ 84.10

• สตรีมมิ่ง — Mage-VL: การเกตเหตุการณ์เชิงรุกพร้อมรายงานค่า TimVal, F1, ROC-AUC และ PR-AUC ที่ดีที่สุดบน SoccerNet แบบสตรีมมิ่ง ส่วน PixelUMM: ไม่รองรับ

• สัญญาอนุญาต — Mage-VL: Apache-2.0 โค้ดและเวต PixelUMM: โค้ด Apache-2.0, NVIDIA One-Way Noncommercial License สำหรับเช็กพอยต์

สองคอลัมน์นี้ทับซ้อนกันไม่มากพอที่จะจัดอันดับ Mage-VL รายงานว่าเอนโคเดอร์ประสิทธิภาพสูงเอาชนะคู่แข่งในระดับเดียวกันได้ ส่วน PixelUMM รายงานว่าโมเดลขนาด 15B อยู่ในช่วงเดียวกับระบบเฉพาะทางรอบ ๆ ตัว และระบุตรง ๆ ในบทความของตนเองว่า เนื่องจากข้อมูลการฝึกที่แตกต่างกัน ผลลัพธ์จึง “ไม่สามารถยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า”

การแบ่งแยกเชิงปฏิบัติ

เลือกตามงาน ไม่ใช่ตามคะแนน หากคุณกำลังสร้างการรับรู้วิดีโอแบบเรียลไทม์ — มอนิเตอร์ที่เฝ้าดูสตรีมและคอมเมนต์เมื่อมีบางอย่างเกิดขึ้น โดยมีต้นทุนโทเค็นเป็นข้อจำกัดที่ผูกมัด — Mage-VL เป็นหนึ่งเดียวในสองตัวที่ทำได้ มันเป็น Apache-2.0 และขนาดระดับ 4B ของมันหมายความว่าโหนดเดียวสามารถให้บริการมันได้ หากคุณต้องการโมเดลเดียวที่อ่านภาพและวิดีโอและยังสร้างมันได้ PixelUMM เป็นหนึ่งเดียวในสองตัวที่ทำเช่นนั้น แต่มันเป็นผลงานวิจัยภายใต้สัญญาอนุญาตที่ไม่ใช่เชิงพาณิชย์ เวทของมันคือ 128 ชาร์ดเช็กพอยต์แบบกระจายที่อยู่เบื้องหลังดัชนีที่ซ่อนอยู่ และ text-to-video จะรันการ์ดเรลของ Cosmos โดยค่าเริ่มต้น พร้อมสภาพแวดล้อม Python แยกต่างหากสำหรับเกต

สำหรับทีมที่ต้องการความสามารถทั้งสองอย่าง เหตุผลในการเข้าถึงทั้งสองผ่านเลเยอร์การจัดเส้นทางเพียงชั้นเดียวแทนที่จะเป็นการผสานรวมโดยตรงสองรายการนั้นตรงไปตรงมา แม้ว่าทั้งคู่จะยังไม่ถูกโฮสต์ในวันนี้ก็ตาม: คีย์เดียว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยบวกกำไร 0% และกฎการสลับสำรองที่ให้คุณนำโมเดล Apache-2.0 ที่เพิ่งเปิดให้ใช้มาไว้ข้างหน้าเศษเสี้ยวหนึ่งของทราฟฟิก ขณะที่โมเดลที่ผ่านการพิสูจน์แล้วดูแลส่วนที่เหลือ OrcaRouter ถูกสร้างมาเพื่อปัญหารูปแบบนั้น — และเพื่อให้ชัดเจน ตอนนี้เราไม่ได้จัดเส้นทางให้ทั้ง PixelUMM และ Mage-VL ดังนั้นนี่จึงเป็นคำอธิบายของเวิร์กโฟลว์ ไม่ใช่รายการ

อะไรจะยุติเรื่องนี้ได้

มีสองเหตุการณ์ที่สำคัญ เหตุการณ์แรกคือการรันซ้ำอย่างอิสระของตัวเลข encoder ของ Mage-ViT หรือผลลัพธ์วิดีโอของ Mage-VL โดยผู้ที่ไม่มีส่วนได้ส่วนเสียกับสิ่งเหล่านั้น — การดาวน์โหลดเป็นเวลาสิบสัปดาห์ยังไม่ก่อให้เกิดการรันซ้ำดังกล่าวเลย เหตุการณ์ที่สองคือการเปลี่ยนแปลงใด ๆ ต่อสัญญาอนุญาตเช็กพอยต์ของ PixelUMM ซึ่งเป็นข้อเท็จจริงเพียงหนึ่งเดียวที่ในตอนนี้แบ่งแยกระหว่างงานวิจัยชิ้นหนึ่งกับสิ่งที่พร้อมนำไปใช้งานจริง จนกว่าอย่างใดอย่างหนึ่งจะเกิดขึ้นจริง สิ่งที่มีประโยชน์ซึ่งพูดได้เกี่ยวกับคู่นี้คือ Microsoft เดิมพันกับการทำให้อินเทอร์เฟซภาพมีต้นทุนถูกลง และ NVIDIA เดิมพันกับการเอามันออกไป และไม่มีการเดิมพันใดได้รับการประเมินโดยใครก็ตามนอกห้องแล็บที่วางเดิมพันนั้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube