การ์ดไตเติลฮีโร่สำหรับการเปรียบเทียบ 'InternLumina-U2 vs Microsoft Mage-VL' พร้อมคำบรรยายย่อย 'สองแล็บเงียบ ๆ สองเดิมพันบนโทเค็นภาพที่ชาญฉลาดขึ้น' และชิปสถิติสามรายการ — 'InternLumina-U2: 16B-A1B diffusion MoE', 'Microsoft Mage-VL: ~5B codec-native VLM', 'ทั้งสองรายงานโดยผู้ผลิต ยังไม่มีการตรวจสอบซ้ำ' — พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

InternLumina-U2 vs Microsoft Mage-VL: สองแล็บเงียบๆ เดิมพันว่าโทเค็นภาพควรแบกรับข้อมูลมากกว่านี้

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Microsoft Mage-VL และ InternLumina-U2 ต่างก็ถูกปล่อยออกมาในแบบที่ห้องวิจัยปล่อยผลงานเมื่อพวกเขายังไม่แน่ใจว่าผลลัพธ์นั้นเป็นผลิตภัณฑ์แล้วหรือยัง: อย่างเงียบเชียบ Microsoft เผยแพร่น้ำหนักและโค้ดของ Mage-VL บน Hugging Face เมื่อวันที่ 25 กรกฎาคม 2026 โดยไม่มีการประกาศใดๆ ขณะที่องค์กร InternLM ของ Shanghai AI Laboratory เผยแพร่โค้ดอนุมานของ InternLumina-U2 บน GitHub เมื่อวันที่ 1 กันยายน 2026 โดยไม่มีการประกาศเช่นกัน ห่างกันห้าสัปดาห์ ห้องวิจัยที่ใหญ่ที่สุดสองแห่งของโลกปล่อยโมเดลที่แฝงความเชื่อร่วมกันอย่างเงียบๆ — ว่าวิธีที่เราแปลงภาพเป็นโทเค็นคือคอขวด — แล้วปล่อยให้ชุมชนเป็นผู้สังเกตเห็นเอง หนึ่งในนั้นคุณสามารถดาวน์โหลดและรันได้ในวันนี้ อย่างงุ่มง่าม อีกหนึ่งคุณไม่สามารถรันได้เลย เพราะน้ำหนักของมันยังไม่มีอยู่จริง นี่คือแผนที่อันตรงไปตรงมาของทั้งสอง และเหตุผลว่าทำไม "ทั้งคู่รายงานโดยผู้ผลิต ทั้งคู่ยังไม่ผ่านการพิสูจน์" จึงไม่ใช่ประโยคเดียวกันสำหรับทั้งคู่

ห้าสัปดาห์ สองการเดิมพันด้านประสิทธิภาพของการนำเสนอ

แนวคิดหลักนี้มีจริง ไม่ใช่เพียงวาทศิลป์ Mage-VL เป็นโมเดลวิดีโอแบบ codec-native กล่าวคือ แทนที่จะถอดรหัสสตรีมออกเป็นเฟรมที่สุ่มตัวอย่างอย่างสม่ำเสมอ แล้วส่งกริดแพตช์หนาแน่นผ่านวิทัศน์ทรานส์ฟอร์มเมอร์ที่ผ่านการฝึกจากข้อมูลเว็บและตรึงค่าไว้ มันกลับดำเนินตามโครงสร้างของโคเดกวิดีโอสมัยใหม่ โดยแยกสตรีมออกเป็นเฟรมอ้างอิงกับข้อมูลการเคลื่อนไหวที่บีบอัดระหว่างเฟรมเหล่านั้น แล้วนำการนำเสนอแบบกระชับนั้นเข้าไปประมวลผลโดยตรง ประโยชน์ที่ไมโครซอฟต์รายงานคือการลดจำนวนโทเค็นภาพลงอย่างมาก และเส้นทางการรับรู้แบบสตรีมมิ่งที่เร็วขึ้นอย่างมีนัยสำคัญ — บริษัทตีกรอบว่าเป็นการแก้ปฏิทรรศน์แบบ Moravec สำหรับโมเดลภาษาวิดีโอ ซึ่งงานรับรู้แบบเรียลไทม์เล็กๆ กลับใช้พลังคำนวณมากพอๆ กับการใช้เหตุผลออฟไลน์ที่ยากลำบาก Mage-VL คือผู้เฝ้าดู: มันบริโภควิดีโออย่างมีประสิทธิภาพและตอบคำถามเกี่ยวกับสิ่งที่มันเห็นได้ในเวลาเกือบเรียลไทม์

InternLumina-U2 คือการเดิมพันกับคอขวดเดียวกันจากอีกทิศทางหนึ่ง ในขณะที่ Mage-VL บีบอัดวิดีโอโดยทำตามโคเดก InternLumina-U2 บีบอัดอินพุตภาพทุกชนิดโดยบรรยายแต่ละตำแหน่งด้วยโค้ดแยกเสริมกันแปดชุดแทนที่จะเป็นหนึ่งชุด โดยใช้โทเคไนเซอร์ที่ห้องแล็บเรียกว่า AToken ข้อสมมติคือโค้ดบุ๊กเดี่ยวจำกัดปริมาณข้อมูลที่โทเคนภาพหนึ่งตัวจะบรรทุกได้ ดังนั้นคำศัพท์หลายโค้ดบุ๊กจึงทำให้โมเดล diffusion ขนาด 16B พารามิเตอร์ตัวหนึ่งทำงานทั้งความเข้าใจและการสร้างผ่านอินเทอร์เฟซเดียวกัน ไม่ว่าจะอ่านแผนภูมิ ตอบคำถามเกี่ยวกับวิดีโอ บรรยายสินทรัพย์ 3D สร้างภาพจากข้อความ หรือแก้ไขภาพตามคำสั่ง โดยไม่ต้องมีสแต็กการสร้างแยกต่างหาก Mage-VL ต้องการรับรู้สตรีมอย่างประหยัด ส่วน InternLumina-U2 ต้องการรับรู้และวาดด้วยน้ำหนักชุดเดียว

กระดานคะแนน

ตัวเลขของทั้งสองรุ่นนั้นมาจากรายงานของผู้จำหน่ายและไม่ผ่านการตรวจสอบซ้ำ ดังนั้นกระดานคะแนนจึงติดป้ายกำกับที่มาของทุกแถวไว้

Shape — Mage-VL: โมเดล vision-language แบบ codec-native ขนาดกะทัดรัด (มีพารามิเตอร์ประมาณ 5 พันล้านตัวในรูปแบบ BF16) ซึ่งใช้ text backbone ของ Qwen เป็นแกนหลัก ฝึกฝนมาเพื่อความเข้าใจภาพและวิดีโอ InternLumina-U2: โมเดล MoE ขนาด 16 พันล้านพารามิเตอร์ โดยใช้พารามิเตอร์พร้อมใช้งาน 1 พันล้านตัว (16B-A1B) เป็น sparse diffusion LLM ที่ครอบคลุมทั้งความเข้าใจ การสร้าง และการแก้ไข

• การแทนค่าทางภาพ — Mage-VL: โทเคนแบบ codec-native ที่เป็นไปตามโครงสร้างวิดีโอโคเดก (anchor บวกกับ motion); มีรายงานว่าลดโทเคนภาพได้มากกว่า 75% สำหรับวิดีโอสตรีมมิง InternLumina-U2: โทเคนแบบไม่ต่อเนื่องโดยสมบูรณ์จากโค้ดบุ๊กแปดตัว ซึ่งสร้างโดยโทเคไนเซอร์ AToken

• สิ่งที่มันทำ — Mage-VL: ดูภาพและวิดีโอที่รับเข้า แล้วตอบเป็นข้อความ; สร้างขึ้นสำหรับการรับรู้แบบสตรีมมิง InternLumina-U2: อ้างว่ารองรับข้อความ, การเข้าใจภาพ, การสร้างภาพจากข้อความ, การแก้ไขภาพ, การเข้าใจวิดีโอ และการเข้าใจแบบ 3D

• น้ำหนัก — Mage-VL: เผยแพร่ต่อสาธารณะบน Hugging Face ตั้งแต่วันที่ 25 กรกฎาคม 2026 (microsoft/Mage-VL, Apache-2.0) InternLumina-U2: ยังไม่เป็นสาธารณะ — ที่เก็บ Hugging Face เป็นเพียงสตับว่างเปล่า น้ำหนักระบุว่า "เร็วๆ นี้"

• ตัวเลขเด่น — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0 ทั้งหมดรายงานโดย Microsoft InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81 ทั้งหมดรายงานโดยแล็บ เป็นผลลัพธ์เบื้องต้นและเพียงบางส่วน

• ความเป็นจริงในการให้บริการ — Mage-VL: ดาวน์โหลดได้ แต่ไม่มีเส้นทาง vLLM หรือ SGLang มาตรฐาน โค้ดต้องใช้ trust_remote_code และไม่มีผู้ให้บริการ inference รายใดปรับใช้ในปัจจุบัน InternLumina-U2: ไม่มีใครสามารถให้บริการได้ — น้ำหนักโมเดลไม่มีอยู่ในที่สาธารณะ และแม้แต่ไดรเวอร์ inference ที่เผยแพร่ก็ยังคาดหวังไฟล์ checkpoint ที่ไม่ได้อยู่ใน repository

A comparison scoreboard for InternLumina-U2 and Microsoft Mage-VL: InternLumina-U2 with Shape 16B-A1B sparse MoE, Visual rep. 8-codebook discrete (AToken), Weights not public 'coming soon', Job understand/generate/edit, Headline ChartQA 86.5 GenEval 0.81, Serving none — weights absent; Microsoft Mage-VL with Shape ~5B codec-native VLM, Visual rep. codec-native stream tokens, Weights public since Jul 25 2026, Job watch video answer in text, Headline Video-MME 64.0 (reported), Serving trust_remote_code DIY, with a footer noting both sets of figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

“มีอยู่แต่ก็ไม่สะดวก” ไม่เหมือนกับ “ไม่มี”

นี่คือความแตกต่างที่สำคัญที่สุด หากคุณตั้งใจจะสร้างอะไรสักอย่างขึ้นมาจริง ๆ Mage-VL เป็นของจริงในแบบที่นับเป็นอันดับแรก: น้ำหนักโมเดลอยู่บน Hugging Face การ์ดโมเดลของมันมียอดดาวน์โหลดหนาแน่นตั้งแต่ปลายเดือนกรกฎาคม และมีระบบนิเวศเล็ก ๆ ของ quantized โมเดลจากคอมมูนิตี้เกิดขึ้นรอบตัวมัน “จริง” ไม่ได้แปลว่า “ง่าย” การ์ดโมเดลระบุแท็ก custom-code ตัวเข้ารหัสภาพ (visual encoder) ไม่ใช่ frozen ViT มาตรฐานที่ serving stacks ที่มีอยู่สันนิษฐานไว้ และ repo ของ Microsoft เองก็แสดงผลเชิงปฏิบัติที่ตามมาให้เห็นชัดเจน นั่นคือ การจะรันมันต้องใช้ trust_remote_code และไม่มีการ deploy แบบ turnkey จากผู้ให้บริการ แต่ทีมที่มุ่งมั่นและมี GPU ก็สามารถโหลดมันขึ้นมา หันมันไปที่วิดีโอสตรีม แล้วดูว่าข้อสมมุติฐานเรื่อง codec-native ใช้ได้กับข้อมูลของตนหรือไม่ นี่คือความแตกต่างอย่างมหาศาศาลจาก InternLumina-U2 ตรงที่ประโยคเดียวกันกลับจบลงคนละแบบ: ทีมที่มุ่งมั่นอ่านโค้ด inference ได้ แล้วก็ต้องหยุดอยู่แค่นั้น เพราะไม่มีน้ำหนักโมเดลให้โหลด

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the multi-codebook diffusion description, and the per-task inference scripts that make up the public release.

บัตรข้อมูล Hugging Face ของ microsoft/Mage-VL ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — คำอธิบายการสตรีมแบบโคเดกเนทีฟ, สัญญาอนุญาต Apache-2.0, แท็ก arXiv และส่วนผู้ให้บริการอินเฟอเรนซ์ที่แสดงว่าไม่มีผู้ให้บริการรายใดปรับใช้โมเดลนี้ในปัจจุบัน

ความไม่สมมาตรของ benchmark ก็ไปในแนวเดียวกัน ตัวเลขของทั้งสองโมเดลยังเป็นเพียงคำกล่าวอ้างจากผู้พัฒนา ยังไม่มีการรันซ้ำโดยอิสระจากภายนอก แต่คำกล่าวอ้างของ Mage-VL อย่างน้อยก็ตั้งอยู่บน artifact ที่ดาวน์โหลดได้จริง ซึ่งหมายความว่าช่องว่างระหว่างคำกล่าวอ้างกับการตรวจสอบพิสูจน์เป็นเพียงเรื่องของการให้ใครสักคนเอามันไปรันเท่านั้น ส่วนคำกล่าวอ้างของ InternLumina-U2 กลับตั้งอยู่บนรายการในโรดแมป — “ตารางเปรียบเทียบฉบับเต็มจะปรากฏในรายงานทางเทคนิคที่จะเผยแพร่เร็วๆ นี้” — และไม่มี artifact ใดที่ใช้ตรวจสอบคำกล่าวอ้างเหล่านี้ได้ ยิ่งไปกว่านั้น ตารางบางส่วนของแล็บเองยังแสดงให้เห็นว่าโมเดลดังกล่าวตามหลังคู่แข่งอย่างน้อยหนึ่งรายที่มันอ้างว่าตนเหนือกว่า (GenEval 0.81 เทียบกับ LLaDA2.0-Uni ที่ 0.89) ซึ่งเป็นเครื่องเตือนใจที่ดีให้อ่านคำกำกับ “preliminary, partial” ของมันตามตัวอักษร

ที่ที่พวกเขาสามารถประพันธ์เพลงแทนที่จะแข่งขันกัน

วิธีที่มีประโยชน์ที่สุดในการมองสองสิ่งนี้ คือมองเป็นขั้นบันไดที่อยู่ติดกัน ไม่ใช่มองเป็นคู่แข่งที่ทำงานเดียวกัน ตัวเฝ้าดูแบบโคเดกเนทีฟอย่าง Mage-VL น่าสนใจตรงที่ต้นทุนต่ำพอจะรันต่อเนื่องได้ — มันเฝ้าดูทุกเฟรมของสตรีม แล้วจะส่งต่อเรื่องก็ต่อเมื่อมีบางสิ่งซึ่งคู่ควรต่อความสนใจของโมเดลที่ใหญ่กว่าปรากฏขึ้น โมเดลที่ใหญ่กว่าที่มันส่งต่อให้นั้น ในหลักการแล้ว อาจเป็นโมเดลรวมแบบที่ InternLumina-U2 อ้างว่าจะเป็น: เกตที่ทำงานตลอดเวลาเพื่อตัดสินใจว่าควรมองอะไร และโมเดลเชิงลึกที่อ่านกราฟจริง ติดตามฉาก 3 มิติ หรือสร้างภาพที่แก้ไขแล้วจริง ๆ ทั้งคู่ยังไม่ได้รับการพิสูจน์ — Mage-VL ยังไม่ผ่านการพิสูจน์แต่รันได้ ส่วน InternLumina-U2 ยังไม่ผ่านการพิสูจน์และยังไม่ถูกปล่อยออกมา — ดังนั้นการวางกรอบที่ตรงไปตรงมาก็คือการประกอบกันของทั้งสองฝั่ง ซึ่งจะสร้างขึ้นได้เมื่อแต่ละข้างได้รับการตรวจสอบอย่างเป็นอิสระแล้ว ไม่ใช่การแข่งขันแบบตัวต่อตัวที่รันได้ในวันนี้

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026), showing the codec-native streaming description, the Apache-2.0 license, the arxiv tag, and an inference-provider section showing no provider currently deploys the model.

ที่เก็บ GitHub ของ InternLM/InternLumina-U2 ที่ถูกบันทึกภาพเมื่อวันที่ 2 กันยายน 2026 — หน้าแรกของที่เก็บซึ่งแสดงคำอธิบายการกระจายแบบ multi-codebook, ป้ายสัญญาอนุญาต Apache-2.0 และสคริปต์จุดเริ่มต้นสำหรับอินเฟอเรนซ์ (inference) ที่ประกอบกันเป็นการเผยแพร่สู่สาธารณะ ขณะที่ไฟล์น้ำหนักไม่ได้รวมอยู่ในโครงสร้างไฟล์ของที่เก็บ

เลเยอร์การกำหนดเส้นทางทำอะไรกับจุดตรวจสอบที่ไม่ได้รับการพิสูจน์

โมเดลทั้งสองนี้ไม่ได้ถูกโฮสต์บน OrcaRouter และเราจะไม่ทำให้ดูเหมือนเป็นเช่นนั้น — Mage-VL ไม่มีเส้นทางการให้บริการมาตรฐานที่ใดเลย และ InternLumina-U2 ไม่มี weights ที่เปิดเผย สิ่งที่ routing DSL มีประโยชน์จริง ๆ ในสถานการณ์นี้คือการแสดงองค์ประกอบข้างต้นเป็นการเรียกครั้งเดียวแทนที่จะเป็นโค้ดเชื่อมต่อเฉพาะกิจ: โมเดล perception ราคาถูกที่ทำงานตลอดเวลาป้อนให้โมเดลที่ลึกกว่า ต่อกันเป็นลูกโซ่เพื่อให้โมเดลแพงทำงานเฉพาะเมื่อโมเดลราคาถูกบอกว่ามีบางอย่างเปลี่ยนไป และสำหรับปัญหา checkpoint ที่ยังไม่ผ่านการพิสูจน์ — ซึ่งเป็นความเสี่ยงทั้งหมดของทั้งสองตัวนี้ — automatic failover คือกลไกที่ทำให้ทีมสามารถลองโมเดลอย่าง Mage-VL บนเส้นทางจริงได้โดยไม่ต้องเดิมพันเส้นทางนั้นกับมัน: ครั้งแรกที่ checkpoint ใหม่ค้าง คืนค่าขยะ หรือ throw error การเรียกนั้นก็จะส่งต่อไปยังโมเดลที่พิสูจน์แล้วโดยอัตโนมัติ และไม่มีวิศวกรคนไหนต้องถูกปลุกขึ้นมากดสวิตช์ API เดียวครอบคลุม 200+ โมเดล ราคารายการจากผู้ให้บริการถูกส่งผ่านโดยคิดมาร์กอัป 0% และสิ่งใหม่นี้ถูกทดลองภายใต้ safety net แทนที่จะอยู่ตรงหน้าภาคการผลิตจริง

สรุป

หากคุณต้องการทดสอบทฤษฎี codec-native-video ในวันนี้ มีเพียง Mage-VL เท่านั้นที่มีอยู่จริง — และคำว่า "มีอยู่จริง" ก็มาพร้อมข้อแม้เกี่ยวกับโค้ดแบบกำหนดเองและการเซิร์ฟแบบ DIY หากคุณต้องการทดสอบทฤษฎี unified-model แบบ multi-codebook คุณไม่สามารถทำได้ เพราะ InternLumina-U2 ยังคงเป็นเพียงสเปกที่รอคอยน้ำหนัก (weights) ของมันอยู่ สิ่งที่คุณทำได้คืออ่านสถาปัตยกรรมของมันตั้งแต่วันนี้ เพื่อให้คุณพร้อมในทันทีที่ stub บน Hugging Face ถูกเติมเต็ม จงมองโมเดลของ Microsoft ว่าเป็นสิ่งประดิษฐ์ที่ดูเทอะทะแต่มีอยู่จริง และมองโมเดลของ Shanghai AI Lab ว่าเป็นคำสัญญาที่มีการบันทึกไว้อย่างดี และจำไว้ว่าในการประลองครั้งนี้ "รายงานโดยผู้ผลิตและไม่เคยถูกพิสูจน์ซ้ำ" ใช้ได้กับทั้งคู่ — เพียงแต่มันมีความหมายที่แตกต่างกันเมื่อมีไฟล์ที่คุณสามารถดาวน์โหลดได้อยู่ตรงหน้า

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube