
InternLumina-U2 vs Microsoft Mage-VL: สองแล็บเงียบๆ เดิมพันว่าโทเค็นภาพควรแบกรับข้อมูลมากกว่านี้
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
Microsoft Mage-VL และ InternLumina-U2 ต่างก็ถูกปล่อยออกมาในแบบที่ห้องวิจัยปล่อยผลงานเมื่อพวกเขายังไม่แน่ใจว่าผลลัพธ์นั้นเป็นผลิตภัณฑ์แล้วหรือยัง: อย่างเงียบเชียบ Microsoft เผยแพร่น้ำหนักและโค้ดของ Mage-VL บน Hugging Face เมื่อวันที่ 25 กรกฎาคม 2026 โดยไม่มีการประกาศใดๆ ขณะที่องค์กร InternLM ของ Shanghai AI Laboratory เผยแพร่โค้ดอนุมานของ InternLumina-U2 บน GitHub เมื่อวันที่ 1 กันยายน 2026 โดยไม่มีการประกาศเช่นกัน ห่างกันห้าสัปดาห์ ห้องวิจัยที่ใหญ่ที่สุดสองแห่งของโลกปล่อยโมเดลที่แฝงความเชื่อร่วมกันอย่างเงียบๆ — ว่าวิธีที่เราแปลงภาพเป็นโทเค็นคือคอขวด — แล้วปล่อยให้ชุมชนเป็นผู้สังเกตเห็นเอง หนึ่งในนั้นคุณสามารถดาวน์โหลดและรันได้ในวันนี้ อย่างงุ่มง่าม อีกหนึ่งคุณไม่สามารถรันได้เลย เพราะน้ำหนักของมันยังไม่มีอยู่จริง นี่คือแผนที่อันตรงไปตรงมาของทั้งสอง และเหตุผลว่าทำไม "ทั้งคู่รายงานโดยผู้ผลิต ทั้งคู่ยังไม่ผ่านการพิสูจน์" จึงไม่ใช่ประโยคเดียวกันสำหรับทั้งคู่
ห้าสัปดาห์ สองการเดิมพันด้านประสิทธิภาพของการนำเสนอ
แนวคิดหลักนี้มีจริง ไม่ใช่เพียงวาทศิลป์ Mage-VL เป็นโมเดลวิดีโอแบบ codec-native กล่าวคือ แทนที่จะถอดรหัสสตรีมออกเป็นเฟรมที่สุ่มตัวอย่างอย่างสม่ำเสมอ แล้วส่งกริดแพตช์หนาแน่นผ่านวิทัศน์ทรานส์ฟอร์มเมอร์ที่ผ่านการฝึกจากข้อมูลเว็บและตรึงค่าไว้ มันกลับดำเนินตามโครงสร้างของโคเดกวิดีโอสมัยใหม่ โดยแยกสตรีมออกเป็นเฟรมอ้างอิงกับข้อมูลการเคลื่อนไหวที่บีบอัดระหว่างเฟรมเหล่านั้น แล้วนำการนำเสนอแบบกระชับนั้นเข้าไปประมวลผลโดยตรง ประโยชน์ที่ไมโครซอฟต์รายงานคือการลดจำนวนโทเค็นภาพลงอย่างมาก และเส้นทางการรับรู้แบบสตรีมมิ่งที่เร็วขึ้นอย่างมีนัยสำคัญ — บริษัทตีกรอบว่าเป็นการแก้ปฏิทรรศน์แบบ Moravec สำหรับโมเดลภาษาวิดีโอ ซึ่งงานรับรู้แบบเรียลไทม์เล็กๆ กลับใช้พลังคำนวณมากพอๆ กับการใช้เหตุผลออฟไลน์ที่ยากลำบาก Mage-VL คือผู้เฝ้าดู: มันบริโภควิดีโออย่างมีประสิทธิภาพและตอบคำถามเกี่ยวกับสิ่งที่มันเห็นได้ในเวลาเกือบเรียลไทม์
InternLumina-U2 คือการเดิมพันกับคอขวดเดียวกันจากอีกทิศทางหนึ่ง ในขณะที่ Mage-VL บีบอัดวิดีโอโดยทำตามโคเดก InternLumina-U2 บีบอัดอินพุตภาพทุกชนิดโดยบรรยายแต่ละตำแหน่งด้วยโค้ดแยกเสริมกันแปดชุดแทนที่จะเป็นหนึ่งชุด โดยใช้โทเคไนเซอร์ที่ห้องแล็บเรียกว่า AToken ข้อสมมติคือโค้ดบุ๊กเดี่ยวจำกัดปริมาณข้อมูลที่โทเคนภาพหนึ่งตัวจะบรรทุกได้ ดังนั้นคำศัพท์หลายโค้ดบุ๊กจึงทำให้โมเดล diffusion ขนาด 16B พารามิเตอร์ตัวหนึ่งทำงานทั้งความเข้าใจและการสร้างผ่านอินเทอร์เฟซเดียวกัน ไม่ว่าจะอ่านแผนภูมิ ตอบคำถามเกี่ยวกับวิดีโอ บรรยายสินทรัพย์ 3D สร้างภาพจากข้อความ หรือแก้ไขภาพตามคำสั่ง โดยไม่ต้องมีสแต็กการสร้างแยกต่างหาก Mage-VL ต้องการรับรู้สตรีมอย่างประหยัด ส่วน InternLumina-U2 ต้องการรับรู้และวาดด้วยน้ำหนักชุดเดียว
กระดานคะแนน
ตัวเลขของทั้งสองรุ่นนั้นมาจากรายงานของผู้จำหน่ายและไม่ผ่านการตรวจสอบซ้ำ ดังนั้นกระดานคะแนนจึงติดป้ายกำกับที่มาของทุกแถวไว้
Shape — Mage-VL: โมเดล vision-language แบบ codec-native ขนาดกะทัดรัด (มีพารามิเตอร์ประมาณ 5 พันล้านตัวในรูปแบบ BF16) ซึ่งใช้ text backbone ของ Qwen เป็นแกนหลัก ฝึกฝนมาเพื่อความเข้าใจภาพและวิดีโอ InternLumina-U2: โมเดล MoE ขนาด 16 พันล้านพารามิเตอร์ โดยใช้พารามิเตอร์พร้อมใช้งาน 1 พันล้านตัว (16B-A1B) เป็น sparse diffusion LLM ที่ครอบคลุมทั้งความเข้าใจ การสร้าง และการแก้ไข
• การแทนค่าทางภาพ — Mage-VL: โทเคนแบบ codec-native ที่เป็นไปตามโครงสร้างวิดีโอโคเดก (anchor บวกกับ motion); มีรายงานว่าลดโทเคนภาพได้มากกว่า 75% สำหรับวิดีโอสตรีมมิง InternLumina-U2: โทเคนแบบไม่ต่อเนื่องโดยสมบูรณ์จากโค้ดบุ๊กแปดตัว ซึ่งสร้างโดยโทเคไนเซอร์ AToken
• สิ่งที่มันทำ — Mage-VL: ดูภาพและวิดีโอที่รับเข้า แล้วตอบเป็นข้อความ; สร้างขึ้นสำหรับการรับรู้แบบสตรีมมิง InternLumina-U2: อ้างว่ารองรับข้อความ, การเข้าใจภาพ, การสร้างภาพจากข้อความ, การแก้ไขภาพ, การเข้าใจวิดีโอ และการเข้าใจแบบ 3D
• น้ำหนัก — Mage-VL: เผยแพร่ต่อสาธารณะบน Hugging Face ตั้งแต่วันที่ 25 กรกฎาคม 2026 (microsoft/Mage-VL, Apache-2.0) InternLumina-U2: ยังไม่เป็นสาธารณะ — ที่เก็บ Hugging Face เป็นเพียงสตับว่างเปล่า น้ำหนักระบุว่า "เร็วๆ นี้"
• ตัวเลขเด่น — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0 ทั้งหมดรายงานโดย Microsoft InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81 ทั้งหมดรายงานโดยแล็บ เป็นผลลัพธ์เบื้องต้นและเพียงบางส่วน
• ความเป็นจริงในการให้บริการ — Mage-VL: ดาวน์โหลดได้ แต่ไม่มีเส้นทาง vLLM หรือ SGLang มาตรฐาน โค้ดต้องใช้ trust_remote_code และไม่มีผู้ให้บริการ inference รายใดปรับใช้ในปัจจุบัน InternLumina-U2: ไม่มีใครสามารถให้บริการได้ — น้ำหนักโมเดลไม่มีอยู่ในที่สาธารณะ และแม้แต่ไดรเวอร์ inference ที่เผยแพร่ก็ยังคาดหวังไฟล์ checkpoint ที่ไม่ได้อยู่ใน repository

“มีอยู่แต่ก็ไม่สะดวก” ไม่เหมือนกับ “ไม่มี”
นี่คือความแตกต่างที่สำคัญที่สุด หากคุณตั้งใจจะสร้างอะไรสักอย่างขึ้นมาจริง ๆ Mage-VL เป็นของจริงในแบบที่นับเป็นอันดับแรก: น้ำหนักโมเดลอยู่บน Hugging Face การ์ดโมเดลของมันมียอดดาวน์โหลดหนาแน่นตั้งแต่ปลายเดือนกรกฎาคม และมีระบบนิเวศเล็ก ๆ ของ quantized โมเดลจากคอมมูนิตี้เกิดขึ้นรอบตัวมัน “จริง” ไม่ได้แปลว่า “ง่าย” การ์ดโมเดลระบุแท็ก custom-code ตัวเข้ารหัสภาพ (visual encoder) ไม่ใช่ frozen ViT มาตรฐานที่ serving stacks ที่มีอยู่สันนิษฐานไว้ และ repo ของ Microsoft เองก็แสดงผลเชิงปฏิบัติที่ตามมาให้เห็นชัดเจน นั่นคือ การจะรันมันต้องใช้ trust_remote_code และไม่มีการ deploy แบบ turnkey จากผู้ให้บริการ แต่ทีมที่มุ่งมั่นและมี GPU ก็สามารถโหลดมันขึ้นมา หันมันไปที่วิดีโอสตรีม แล้วดูว่าข้อสมมุติฐานเรื่อง codec-native ใช้ได้กับข้อมูลของตนหรือไม่ นี่คือความแตกต่างอย่างมหาศาศาลจาก InternLumina-U2 ตรงที่ประโยคเดียวกันกลับจบลงคนละแบบ: ทีมที่มุ่งมั่นอ่านโค้ด inference ได้ แล้วก็ต้องหยุดอยู่แค่นั้น เพราะไม่มีน้ำหนักโมเดลให้โหลด

บัตรข้อมูล Hugging Face ของ microsoft/Mage-VL ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — คำอธิบายการสตรีมแบบโคเดกเนทีฟ, สัญญาอนุญาต Apache-2.0, แท็ก arXiv และส่วนผู้ให้บริการอินเฟอเรนซ์ที่แสดงว่าไม่มีผู้ให้บริการรายใดปรับใช้โมเดลนี้ในปัจจุบัน
ความไม่สมมาตรของ benchmark ก็ไปในแนวเดียวกัน ตัวเลขของทั้งสองโมเดลยังเป็นเพียงคำกล่าวอ้างจากผู้พัฒนา ยังไม่มีการรันซ้ำโดยอิสระจากภายนอก แต่คำกล่าวอ้างของ Mage-VL อย่างน้อยก็ตั้งอยู่บน artifact ที่ดาวน์โหลดได้จริง ซึ่งหมายความว่าช่องว่างระหว่างคำกล่าวอ้างกับการตรวจสอบพิสูจน์เป็นเพียงเรื่องของการให้ใครสักคนเอามันไปรันเท่านั้น ส่วนคำกล่าวอ้างของ InternLumina-U2 กลับตั้งอยู่บนรายการในโรดแมป — “ตารางเปรียบเทียบฉบับเต็มจะปรากฏในรายงานทางเทคนิคที่จะเผยแพร่เร็วๆ นี้” — และไม่มี artifact ใดที่ใช้ตรวจสอบคำกล่าวอ้างเหล่านี้ได้ ยิ่งไปกว่านั้น ตารางบางส่วนของแล็บเองยังแสดงให้เห็นว่าโมเดลดังกล่าวตามหลังคู่แข่งอย่างน้อยหนึ่งรายที่มันอ้างว่าตนเหนือกว่า (GenEval 0.81 เทียบกับ LLaDA2.0-Uni ที่ 0.89) ซึ่งเป็นเครื่องเตือนใจที่ดีให้อ่านคำกำกับ “preliminary, partial” ของมันตามตัวอักษร
ที่ที่พวกเขาสามารถประพันธ์เพลงแทนที่จะแข่งขันกัน
วิธีที่มีประโยชน์ที่สุดในการมองสองสิ่งนี้ คือมองเป็นขั้นบันไดที่อยู่ติดกัน ไม่ใช่มองเป็นคู่แข่งที่ทำงานเดียวกัน ตัวเฝ้าดูแบบโคเดกเนทีฟอย่าง Mage-VL น่าสนใจตรงที่ต้นทุนต่ำพอจะรันต่อเนื่องได้ — มันเฝ้าดูทุกเฟรมของสตรีม แล้วจะส่งต่อเรื่องก็ต่อเมื่อมีบางสิ่งซึ่งคู่ควรต่อความสนใจของโมเดลที่ใหญ่กว่าปรากฏขึ้น โมเดลที่ใหญ่กว่าที่มันส่งต่อให้นั้น ในหลักการแล้ว อาจเป็นโมเดลรวมแบบที่ InternLumina-U2 อ้างว่าจะเป็น: เกตที่ทำงานตลอดเวลาเพื่อตัดสินใจว่าควรมองอะไร และโมเดลเชิงลึกที่อ่านกราฟจริง ติดตามฉาก 3 มิติ หรือสร้างภาพที่แก้ไขแล้วจริง ๆ ทั้งคู่ยังไม่ได้รับการพิสูจน์ — Mage-VL ยังไม่ผ่านการพิสูจน์แต่รันได้ ส่วน InternLumina-U2 ยังไม่ผ่านการพิสูจน์และยังไม่ถูกปล่อยออกมา — ดังนั้นการวางกรอบที่ตรงไปตรงมาก็คือการประกอบกันของทั้งสองฝั่ง ซึ่งจะสร้างขึ้นได้เมื่อแต่ละข้างได้รับการตรวจสอบอย่างเป็นอิสระแล้ว ไม่ใช่การแข่งขันแบบตัวต่อตัวที่รันได้ในวันนี้

ที่เก็บ GitHub ของ InternLM/InternLumina-U2 ที่ถูกบันทึกภาพเมื่อวันที่ 2 กันยายน 2026 — หน้าแรกของที่เก็บซึ่งแสดงคำอธิบายการกระจายแบบ multi-codebook, ป้ายสัญญาอนุญาต Apache-2.0 และสคริปต์จุดเริ่มต้นสำหรับอินเฟอเรนซ์ (inference) ที่ประกอบกันเป็นการเผยแพร่สู่สาธารณะ ขณะที่ไฟล์น้ำหนักไม่ได้รวมอยู่ในโครงสร้างไฟล์ของที่เก็บ
เลเยอร์การกำหนดเส้นทางทำอะไรกับจุดตรวจสอบที่ไม่ได้รับการพิสูจน์
โมเดลทั้งสองนี้ไม่ได้ถูกโฮสต์บน OrcaRouter และเราจะไม่ทำให้ดูเหมือนเป็นเช่นนั้น — Mage-VL ไม่มีเส้นทางการให้บริการมาตรฐานที่ใดเลย และ InternLumina-U2 ไม่มี weights ที่เปิดเผย สิ่งที่ routing DSL มีประโยชน์จริง ๆ ในสถานการณ์นี้คือการแสดงองค์ประกอบข้างต้นเป็นการเรียกครั้งเดียวแทนที่จะเป็นโค้ดเชื่อมต่อเฉพาะกิจ: โมเดล perception ราคาถูกที่ทำงานตลอดเวลาป้อนให้โมเดลที่ลึกกว่า ต่อกันเป็นลูกโซ่เพื่อให้โมเดลแพงทำงานเฉพาะเมื่อโมเดลราคาถูกบอกว่ามีบางอย่างเปลี่ยนไป และสำหรับปัญหา checkpoint ที่ยังไม่ผ่านการพิสูจน์ — ซึ่งเป็นความเสี่ยงทั้งหมดของทั้งสองตัวนี้ — automatic failover คือกลไกที่ทำให้ทีมสามารถลองโมเดลอย่าง Mage-VL บนเส้นทางจริงได้โดยไม่ต้องเดิมพันเส้นทางนั้นกับมัน: ครั้งแรกที่ checkpoint ใหม่ค้าง คืนค่าขยะ หรือ throw error การเรียกนั้นก็จะส่งต่อไปยังโมเดลที่พิสูจน์แล้วโดยอัตโนมัติ และไม่มีวิศวกรคนไหนต้องถูกปลุกขึ้นมากดสวิตช์ API เดียวครอบคลุม 200+ โมเดล ราคารายการจากผู้ให้บริการถูกส่งผ่านโดยคิดมาร์กอัป 0% และสิ่งใหม่นี้ถูกทดลองภายใต้ safety net แทนที่จะอยู่ตรงหน้าภาคการผลิตจริง
สรุป
หากคุณต้องการทดสอบทฤษฎี codec-native-video ในวันนี้ มีเพียง Mage-VL เท่านั้นที่มีอยู่จริง — และคำว่า "มีอยู่จริง" ก็มาพร้อมข้อแม้เกี่ยวกับโค้ดแบบกำหนดเองและการเซิร์ฟแบบ DIY หากคุณต้องการทดสอบทฤษฎี unified-model แบบ multi-codebook คุณไม่สามารถทำได้ เพราะ InternLumina-U2 ยังคงเป็นเพียงสเปกที่รอคอยน้ำหนัก (weights) ของมันอยู่ สิ่งที่คุณทำได้คืออ่านสถาปัตยกรรมของมันตั้งแต่วันนี้ เพื่อให้คุณพร้อมในทันทีที่ stub บน Hugging Face ถูกเติมเต็ม จงมองโมเดลของ Microsoft ว่าเป็นสิ่งประดิษฐ์ที่ดูเทอะทะแต่มีอยู่จริง และมองโมเดลของ Shanghai AI Lab ว่าเป็นคำสัญญาที่มีการบันทึกไว้อย่างดี และจำไว้ว่าในการประลองครั้งนี้ "รายงานโดยผู้ผลิตและไม่เคยถูกพิสูจน์ซ้ำ" ใช้ได้กับทั้งคู่ — เพียงแต่มันมีความหมายที่แตกต่างกันเมื่อมีไฟล์ที่คุณสามารถดาวน์โหลดได้อยู่ตรงหน้า
