
PixelUMM กับ Microsoft Mage-VL: ตัวหนึ่งลบ Visual Tokenizer ทิ้ง ส่วนอีกตัวเขียนมันขึ้นมาใหม่
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ทั้ง PixelUMM และ Microsoft Mage-VLถูกสร้างโดยทีมที่เชื่อว่าวิธีที่ภาพถูกแปลงเป็นโทเค็นคือคอขวดที่ผิด — และพวกเขาแก้มันในทิศทางที่ตรงกันข้าม Mage-VL โมเดลสตรีมมิงแบบ codec-native ของ Microsoft ยังคงใช้ tokenizer และทำให้มันดุดันขึ้นมาก: มันทำตามโครงสร้างของวิดีโอโคเดกสมัยใหม่ เก็บทุก anchor frame และเฉพาะแพตช์ของ predicted frame ที่โคเดกใช้บิต และรายงานว่าลดโทเค็นภาพลงมากกว่า 75% พร้อมได้ความเร็ว wall-clock สูงสุดถึง 3.5× เมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ PixelUMM โมเดลแบบรวมที่ไร้เอนโคเดอร์ของ NVIDIA ตัด tokenizer ออกไปทั้งหมด — ทุกแพตช์ 16×16 ของพิกเซลดิบไปถึงแบ็กโบนผ่านการฉายเชิงเส้นเพียงครั้งเดียว โดยไม่มี VAE และไม่มี vision transformer อยู่ที่ไหนเลย ตัวหนึ่งบีบอัดได้แน่นกว่า อีกตัวปฏิเสธที่จะบีบอัดเลย และมีเพียงตัวเดียวเท่านั้นที่สามารถสร้างอะไรได้
ความแตกต่างข้อสุดท้ายนี่แหละที่ทำให้การจับคู่นี้น่าสนใจยิ่งกว่าการทะเลาะกันเรื่องสเปก Mage-VL เป็นผู้เฝ้ามอง — โมเดลรับรู้แบบสตรีมมิ่งที่มีเกตเชิงรุกคอยตัดสินใจว่าควรพูดเมื่อไร PixelUMM เป็นนักอ่านที่วาดภาพได้ด้วย: เวตชุดเดียวกันตอบคำถามเกี่ยวกับภาพและสร้างวิดีโอใหม่จากพรอมป์ต์ข้อความ พวกมันเป็นคำตอบสองแบบที่เข้ากันไม่ได้ต่อคำถามที่ว่า "โมเดลวิสัยทัศน์แบบรวมเป็นหนึ่งควรเป็นแบบไหน" และตัวเลขของแต่ละแล็บก็เป็นของตัวเอง
จุดที่เกิดการบีบอัด
หลักคิดตั้งต้นของ Mage-VL คือปฏิทรรศน์ของโมราเวกฉบับสมัยใหม่: โมเดลภาพ–ภาษาเก่งในการให้เหตุผลออฟไลน์ที่ยาก แต่กลับช้าและกินพลังประมวลผลสูงในการรับรู้แบบเรียลไทม์ที่ง่าย ทางแก้ของมันคือการจัดแนวให้สอดคล้องกับโคเด็ก แทนที่จะถอดรหัสสตรีมให้เป็นเฟรมที่สุ่มตัวอย่างสม่ำเสมอ และส่งกริดหนาแน่นผ่าน ViT ที่ถูกฝึกมาก่อนบนเว็บและถูกแช่แข็ง Mage-VL แยกสตรีมออกเป็นเฟรมหลัก (I) และเฟรมที่ทำนาย (P) เก็บแพตช์หลักทั้งหมดไว้ และเก็บเฉพาะแพตช์ของเฟรมที่ทำนายซึ่งมีการเคลื่อนไหวจริงหรือรายละเอียดใหม่ ตัวเข้ารหัส Mage-ViT ถูกฝึกตั้งแต่เริ่มต้นบนกริดแพตช์ขนาด 16×16 ด้วยการเข้ารหัสตำแหน่งแบบ Rotary 3 มิติ และไม่ขึ้นกับโคเด็กใดโดยเฉพาะอย่างชัดเจน — อินเทอร์เฟซเดียวกันรองรับเวกเตอร์การเคลื่อนไหวและพลังงานส่วนเหลือของ H.264/AVC หรือ HEVC หรือแผนที่อัตราที่เรียนรู้ได้ของโคเด็กแบบนิวรอล โดยไม่ต้องเปลี่ยนสถาปัตยกรรมหรือฝึกใหม่
ข้อตั้งของ PixelUMM คือตัวเอ็นโคเดอร์เองคือปัญหา ไม่ใช่ประสิทธิภาพของมัน บทความของ PixelUMM โต้แย้งว่าโมเดลอย่าง BAGEL มีอินเทอร์เฟซเชิงภาพสองแบบ — ViT สำหรับคุณลักษณะเชิงความหมาย และ VAE สำหรับค่าแฝงเพื่อการสร้างใหม่ — ซึ่งเพิ่มบริบทเชิงภาพต่อภาพที่ใช้กำหนดเงื่อนไขเป็นราวสองเท่า และบังคับให้ไปป์ไลน์การพรีเทรนแบบเห็น-ภาษา (vision-language) ต้องสร้างใหม่โดยยึดสตรีมที่สอง PixelUMM ลบทั้งสองทิ้ง: ภาพกลายเป็นแพตช์เชิงพื้นที่ขนาด 16×16 วิดีโอกลายเป็นทูบเล็ตเชิงปริภูมิ-เวลา 4 เฟรม และพิกเซลดิบเข้าสู่ Transformer แบบ decoder-only ผ่านการฉายเชิงเส้นชั้นเดียว ความเข้าใจคือข้อความแบบออโตเรเกรสซีฟ; การสร้างคือ flow matching ในปริภูมิพิกเซล
• กลยุทธ์การบีบอัด — Mage-VL: เชิงเวลา ซึ่งได้มาจากโคเดก; เก็บแองเคอร์ไว้ ทำให้เฟรมที่ทำนายมีความเบาบาง PixelUMM: ไม่มี; เก็บทุกแพตช์ของพิกเซลดิบ
• สิ่งที่ฝึกฝนตั้งแต่เริ่มต้น — Mage-VL: สแต็กวิชวลทั้งหมด บนภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ PixelUMM: ตัวฝังและตัวถอดรหัสพิกเซล บนพื้นฐานของแกนหลักภาษาศาสตร์ Qwen3-8B
• โครงข่ายหลัก — Mage-VL: Qwen3-4B-Instruct-2507 ซึ่งเป็นองค์ประกอบเดียวที่ผ่านการพรีเทรน อยู่เบื้องหลังโปรเจกเตอร์ MLP สองชั้น PixelUMM: Qwen3-8B มีพารามิเตอร์ทั้งหมดประมาณ 15.2B
• พฤติกรรมการสตรีมมิ่ง — Mage-VL: เกตการรู้คิดจะให้คะแนนแต่ละหน้าต่างแบบเลื่อน และจะเงียบไว้จนกว่าเหตุการณ์ที่ควรค่าแก่การตอบสนองจะเสร็จสมบูรณ์ จึงจะเรียกใช้โมเดลเต็มรูปแบบในตอนนั้นเท่านั้น PixelUMM: ไม่มีโหมดสตรีมมิ่ง; คำขอเป็นการเรียกสำหรับการสร้างหรือการทำความเข้าใจ

แต่ละอย่างทำอะไร และไม่ทำอะไร
Mage-VL คือ checkpoint เดียวที่ให้ทั้งความเข้าใจภาพและวิดีโอ พร้อมกับ proactive streaming gate ไปในตัว — น้ำหนักชุดเดียวกันตอบคำถามแบบออฟไลน์และขับเคลื่อนคอมเมนตารีที่ถูกกระตุ้นด้วยเหตุการณ์ โดยรวม codec processor, แพ็กเกจ neural codec และ gate ไว้ด้วยกัน การเปิดตัวครั้งที่สอง microsoft/Mage-ViTคือ visual encoder แบบสแตนด์อโลนจากขั้นตอนการพรีเทรนตั้งแต่เริ่มต้น โดยนำเสนอเป็น front end แบบ drop-in สำหรับการฝึกโมเดลมัลติโมดัลอื่น ๆ สิ่งที่ Mage-VL ไม่ได้ทำคือการสร้าง มันอ่านเท่านั้น
PixelUMM ครอบคลุม text-to-image, text-to-video ที่ 96 เฟรมและ 24 fps และข้อความที่มีภาพและวิดีโอเป็นเงื่อนไข มีเช็กพอยต์ให้ใช้งานสี่ตัว — S8-F22-R05 เป็นค่าเริ่มต้นที่ครอบคลุมทั้งสี่งาน S8-F18-R01ปรับแต่งมาเพื่อให้ได้ text-to-video ที่ดีขึ้นที่ 480p และ 720p แต่ไม่สามารถทำ video understanding ได้ และมีสเตจระดับกลางอีกสองตัว สิ่งที่มันไม่ทำคือ streaming, editing หรือ 3D หากคุณต้องการโมเดลที่คอยดูฟีดสดและพูดเมื่อมีบางอย่างเกิดขึ้น PixelUMM มีสถาปัตยกรรมที่ผิดไปโดยสิ้นเชิง และไม่มีคอลัมน์ benchmark ใดจะบอกคุณได้เรื่องนั้น
ช่องว่างการนำไปใช้คือสัญญาณแรกที่ตรงไปตรงมา
สองรีลีสนี้ไม่ได้มีความสมบูรณ์เท่ากัน และตัวนับดาวน์โหลดก็บอกเรื่องนั้นได้ตรงไปตรงมามากกว่าโพสต์เปิดตัวใด ๆ
• Mage-VL — เผยแพร่บน Hugging Face เมื่อวันที่ 25 กรกฎาคม 2026 ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคที่เผยแพร่คู่กันและตัวระบุ arXiv เมื่อต้นเดือนตุลาคม มันมียอดดาวน์โหลดราว 13,800 ครั้งและ 414 ไลก์ และระบบนิเวศเล็ก ๆ ของงานจากชุมชนได้เติบโตขึ้นรอบ ๆ มัน
• PixelUMM — เผยแพร่บน Hugging Face เมื่อวันที่ 1 ตุลาคม 2026 ภายใต้สัญญาอนุญาตเช็กพอยต์แบบไม่ใช้ในเชิงพาณิชย์ จำนวนการดาวน์โหลดเป็นศูนย์ และจำนวนไลก์เป็นสาม ณ เวลาที่เขียนสิ่งนี้ มันเพิ่งมีอายุเพียงไม่กี่วัน
ยังไม่มีการประกาศจากทั้งสองแล็บสำหรับการเปิดตัวของแต่ละรายการ — Mage-VL เปิดตัวในเดือนกรกฎาคมโดยไม่มีประกาศ และ PixelUMM เปิดตัวในเดือนตุลาคมโดยไม่มีประกาศ ความสมมาตรนี้มีอยู่จริง แต่การตีความว่าทั้งสองเป็นอาร์ติแฟกต์ที่เทียบเท่ากันจะเป็นความผิดพลาด Mage-VL ได้รับความสนใจจากชุมชนมาแล้วสิบสัปดาห์ ส่วน PixelUMM เพิ่งมีมาไม่กี่วัน โมเดลที่ไม่มีใครภายนอกแล็บเคยรันเป็นคนละเรื่องกับโมเดลที่คนไม่กี่พันคนดาวน์โหลดไปแล้ว และมีเพียงหนึ่งในสองนี้เท่านั้นที่อยู่ในหมวดที่สอง

กระดานคะแนน พร้อมที่มา
ตัวเลขทุกตัวเป็นของห้องแล็บที่พัฒนาขึ้นเอง ของ Mage-VL มาจากการ์ดและรายงานทางเทคนิคของ Microsoft; ของ PixelUMM มาจาก preprint ของมัน ทั้งสองยังไม่ได้รับการทำซ้ำอย่างอิสระ
• โทเคนภาพ — Mage-VL: รายงานการลดลงมากกว่า 75% เมื่อเทียบกับการสุ่มตัวอย่างเฟรมแบบหนาแน่น PixelUMM: ไม่มีการลดลง; ข้อโต้แย้งคือแพตช์ดิบเป็นการขจัดการเข้ารหัสครั้งที่สองออกไป มากกว่าที่จะย่อขนาดการเข้ารหัสครั้งแรก
• ความเร็วตามเวลาจริง (wall-clock speed) — Mage-VL: เร็วกว่าการสุ่มเฟรมแบบสม่ำเสมอถึง 3.5 เท่า ที่ความแม่นยำเท่ากัน ตามรายงานของ Microsoft ส่วน PixelUMM: ไม่มีการกล่าวอ้างเชิงเปรียบเทียบเรื่องความเร็วในงานวิจัย
• คุณภาพตัวเข้ารหัส — Mage-VL: Mage-ViT รายงานผล CIFAR-10 ที่ 99.33% และ ImageNet ที่ 85.69% ภายใต้งบประมาณ 256 โทเคน จากสื่อที่ไม่มีป้ายกำกับประมาณ 100M รายการ PixelUMM: ไม่มีเกณฑ์มาตรฐานตัวเข้ารหัสที่เทียบเท่า เนื่องจากไม่มีตัวเข้ารหัสให้วัดประสิทธิภาพ
• การเข้าใจวิดีโอ — Mage-VL: รายงานการเพิ่มขึ้นเมื่อเทียบกับ Qwen3-VL-4B บนทุกเกณฑ์มาตรฐานด้านวิดีโอและการระบุตำแหน่งเชิงเวลา ที่รายงาน รวมถึง +22.5 บน QVHighlight และ +17.1 บน ActivityNet PixelUMM: MVBench 70.53, Video-MME 57.33 โดยไม่มีคำบรรยาย, LongVideoBench 59.61, LVBench 40.41
• ความเข้าใจภาพ — Mage-VL: ทัดเทียมกับ Qwen3-VL-4B บนภาพนิ่ง ตามที่ Microsoft รายงาน PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96
• การสร้าง — Mage-VL: ไม่มี PixelUMM: GenEval ภาพรวม 0.83 ด้วยตัวเขียนพรอมต์ใหม่, DPG-Bench 85.74, VBench Part 1 คุณภาพ 84.10
• สตรีมมิ่ง — Mage-VL: การเกตเหตุการณ์เชิงรุกพร้อมรายงานค่า TimVal, F1, ROC-AUC และ PR-AUC ที่ดีที่สุดบน SoccerNet แบบสตรีมมิ่ง ส่วน PixelUMM: ไม่รองรับ
• สัญญาอนุญาต — Mage-VL: Apache-2.0 โค้ดและเวต PixelUMM: โค้ด Apache-2.0, NVIDIA One-Way Noncommercial License สำหรับเช็กพอยต์
สองคอลัมน์นี้ทับซ้อนกันไม่มากพอที่จะจัดอันดับ Mage-VL รายงานว่าเอนโคเดอร์ประสิทธิภาพสูงเอาชนะคู่แข่งในระดับเดียวกันได้ ส่วน PixelUMM รายงานว่าโมเดลขนาด 15B อยู่ในช่วงเดียวกับระบบเฉพาะทางรอบ ๆ ตัว และระบุตรง ๆ ในบทความของตนเองว่า เนื่องจากข้อมูลการฝึกที่แตกต่างกัน ผลลัพธ์จึง “ไม่สามารถยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า”
การแบ่งแยกเชิงปฏิบัติ
เลือกตามงาน ไม่ใช่ตามคะแนน หากคุณกำลังสร้างการรับรู้วิดีโอแบบเรียลไทม์ — มอนิเตอร์ที่เฝ้าดูสตรีมและคอมเมนต์เมื่อมีบางอย่างเกิดขึ้น โดยมีต้นทุนโทเค็นเป็นข้อจำกัดที่ผูกมัด — Mage-VL เป็นหนึ่งเดียวในสองตัวที่ทำได้ มันเป็น Apache-2.0 และขนาดระดับ 4B ของมันหมายความว่าโหนดเดียวสามารถให้บริการมันได้ หากคุณต้องการโมเดลเดียวที่อ่านภาพและวิดีโอและยังสร้างมันได้ PixelUMM เป็นหนึ่งเดียวในสองตัวที่ทำเช่นนั้น แต่มันเป็นผลงานวิจัยภายใต้สัญญาอนุญาตที่ไม่ใช่เชิงพาณิชย์ เวทของมันคือ 128 ชาร์ดเช็กพอยต์แบบกระจายที่อยู่เบื้องหลังดัชนีที่ซ่อนอยู่ และ text-to-video จะรันการ์ดเรลของ Cosmos โดยค่าเริ่มต้น พร้อมสภาพแวดล้อม Python แยกต่างหากสำหรับเกต
สำหรับทีมที่ต้องการความสามารถทั้งสองอย่าง เหตุผลในการเข้าถึงทั้งสองผ่านเลเยอร์การจัดเส้นทางเพียงชั้นเดียวแทนที่จะเป็นการผสานรวมโดยตรงสองรายการนั้นตรงไปตรงมา แม้ว่าทั้งคู่จะยังไม่ถูกโฮสต์ในวันนี้ก็ตาม: คีย์เดียว ราคาตามรายการของผู้ให้บริการที่ส่งต่อโดยบวกกำไร 0% และกฎการสลับสำรองที่ให้คุณนำโมเดล Apache-2.0 ที่เพิ่งเปิดให้ใช้มาไว้ข้างหน้าเศษเสี้ยวหนึ่งของทราฟฟิก ขณะที่โมเดลที่ผ่านการพิสูจน์แล้วดูแลส่วนที่เหลือ OrcaRouter ถูกสร้างมาเพื่อปัญหารูปแบบนั้น — และเพื่อให้ชัดเจน ตอนนี้เราไม่ได้จัดเส้นทางให้ทั้ง PixelUMM และ Mage-VL ดังนั้นนี่จึงเป็นคำอธิบายของเวิร์กโฟลว์ ไม่ใช่รายการ
อะไรจะยุติเรื่องนี้ได้
มีสองเหตุการณ์ที่สำคัญ เหตุการณ์แรกคือการรันซ้ำอย่างอิสระของตัวเลข encoder ของ Mage-ViT หรือผลลัพธ์วิดีโอของ Mage-VL โดยผู้ที่ไม่มีส่วนได้ส่วนเสียกับสิ่งเหล่านั้น — การดาวน์โหลดเป็นเวลาสิบสัปดาห์ยังไม่ก่อให้เกิดการรันซ้ำดังกล่าวเลย เหตุการณ์ที่สองคือการเปลี่ยนแปลงใด ๆ ต่อสัญญาอนุญาตเช็กพอยต์ของ PixelUMM ซึ่งเป็นข้อเท็จจริงเพียงหนึ่งเดียวที่ในตอนนี้แบ่งแยกระหว่างงานวิจัยชิ้นหนึ่งกับสิ่งที่พร้อมนำไปใช้งานจริง จนกว่าอย่างใดอย่างหนึ่งจะเกิดขึ้นจริง สิ่งที่มีประโยชน์ซึ่งพูดได้เกี่ยวกับคู่นี้คือ Microsoft เดิมพันกับการทำให้อินเทอร์เฟซภาพมีต้นทุนถูกลง และ NVIDIA เดิมพันกับการเอามันออกไป และไม่มีการเดิมพันใดได้รับการประเมินโดยใครก็ตามนอกห้องแล็บที่วางเดิมพันนั้น
