การ์ดชื่อเรื่องฮีโร่ที่สร้างขึ้นสำหรับ 'MiniCPM-V 4.7 vs Microsoft Mage-VL' พร้อมคำบรรยายย่อย 'สองวิธีในการลดต้นทุนของการดูวิดีโอ' การ์ดด้านซ้ายอ่านว่า 'Mage-VL: ความเบาบางของโทเค็นแบบเนทีฟของโคเดก โทเค็นภาพลดลง 75%' การ์ดด้านขวาอ่านว่า 'MiniCPM-V 4.7: แอตเทนชันเชิงเส้น, KV cache คงที่ตลอด 256K' และป้ายอ่านว่า 'บีบอัดอินพุต หรือบีบอัดสถานะ' โดยมีโลโก้ OrcaRouter ที่มุมล่างขวา
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL: สองการเดิมพันที่แตกต่างกันอย่างมากว่าควรให้โมเดลวิชันมีต้นทุนต่อเฟรมเท่าใด

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MiniCPM-V 4.7 และ Microsoft Mage-VL ต่างเป็นโมเดลที่เข้าใจภาพและภาษา (vision-language) ซึ่งอ้างว่าช่วยประหยัดโทเค็นของคุณ และทั้งสองไปถึงจุดนั้นด้วยเส้นทางที่ตรงกันข้าม Mage-VL ซึ่ง Microsoft เปิดตัวเมื่อวันที่ 25 กรกฎาคม 2026 โจมตีฝั่งวิดีโอ: มันยืมโครงสร้างของตัวแปลงรหัสวิดีโอ (video codec) มาใช้ เก็บแพตช์ของทุกเฟรมหลัก (anchor-frame patch) และเก็บเฉพาะแพตช์ของเฟรมที่ทำนายไว้ (predicted-frame patch) ที่มีการเคลื่อนไหวจริง แล้วอ้างว่าลดจำนวนโทเค็นภาพได้มากกว่า 75% พร้อมความเร็ว wall-clock สูงสุดถึง 3.5 เท่าเมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ MiniCPM-V 4.7 ซึ่ง OpenBMB อัปโหลดเมื่อวันที่ 6 ตุลาคม 2026 โจมตีฝั่งลำดับ: เป็น MoE แบบ sparse ขนาด 35.2 พันล้านพารามิเตอร์ โดย 30 จาก 40 เลเยอร์ของมันอยู่ในเส้นทาง linear attention ซึ่งทำให้ KV cache เติบโตช้า ๆ ตลอดความยาว 256K โมเดลหนึ่งบีบอัดสิ่งที่มันมองเห็น อีกโมเดลบีบอัดสิ่งที่มันจดจำ และมีเพียงหนึ่งในนั้นเท่านั้นที่มาพร้อมกับสิ่งที่คุณประเมินผลได้

แต่ละอย่างคืออะไร

Microsoft Mage-VL เป็นโมเดลพื้นฐานแบบมัลติโมดัลที่ทำงานสตรีมมิ่งเชิงรุกและเป็นโคเดกเนทีฟในระดับ 4B เผยแพร่ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคและส่วนการประเมินผลอย่างละเอียด มันถูกสร้างขึ้นอย่างจงใจเพื่อรับมือกับสิ่งที่ผู้เขียนเรียกว่า Moravec's paradox สำหรับ VLM — เก่งในการให้เหตุผลแบบออฟไลน์ แต่ช้าในการรับรู้แบบเรียลไทม์ ตัวเข้ารหัสภาพ Mage-ViT ถูกฝึกตั้งแต่ต้นใหม่ทั้งหมดด้วยภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ แทนที่จะเริ่มต้นจาก ViT ที่ผ่านการฝึกมาก่อนจากเว็บ และองค์ประกอบเดียวในสแต็กที่ผ่านการฝึกมาก่อนคือแกนภาษาศาสตร์ Qwen3-4B-Instruct-2507 เช็คพอยต์แบบเต็มเป็นโมเดลรวมเป็นหนึ่งเดียวที่ทำงานทำความเข้าใจภาพ การให้เหตุผลวิดีโอแบบออฟไลน์ และคำบรรยายสตรีมมิ่งที่ถูกกระตุ้นด้วยเหตุการณ์ โดยไม่มีตัวแปรแยกต่างหาก และมีคู่หูmicrosoft/Mage-ViTที่เปิดตัวให้ตัวเข้ารหัสแยกต่างหาก มันมียอดดาวน์โหลดประมาณ 10,600 ครั้งและถูกใจ 420 ครั้งนับตั้งแต่เปิดตัว

MiniCPM-V 4.7 คือ openbmb/MiniCPM-V-4.7-35B-A3B ซึ่งเป็นเช็กพอยต์ BF16 ขนาด 35,212,875,824 พารามิเตอร์ ในสิบหกชาร์ด รวมทั้งหมด 70.4 GB เขียนโดย Transformers 5.2.0 และอัปโหลดเมื่อวันที่ 6 ตุลาคม 2026 โดยไม่มีโมเดลการ์ด

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

การตั้งค่าข้อความของมันถูกติดแท็กว่า qwen3_5_moe_text โดยมีผู้เชี่ยวชาญ 256 ตัวและเปิดใช้งาน 8 ตัวต่อโทเคน; layer_types อาร์เรย์ของมันรันเลเยอร์ความสนใจเชิงเส้นสามชั้นต่อเลเยอร์ความสนใจเต็มหนึ่งชั้นตลอด 40 เลเยอร์; ทาวเวอร์ภาพของมันคือตัวที่พัฒนาเองภายใน minicpmv4_7_vision ที่ 27 เลเยอร์พร้อมการดาวน์แซมปลิง 16× และสไลซ์ภาพได้สูงสุดเก้าชิ้น ความยาวบริบทคือ 256K รีโพซิทอรีมียอดดาวน์โหลดเป็นศูนย์ ถูกใจ 3 ครั้ง ไม่มีเบนช์มาร์ก และไม่มีใบอนุญาต

หกแถวที่ผู้อ่านสามารถตรวจสอบได้

มิติทั้งหกแบบเดียวกันในทั้งสองด้าน ตรงจุดที่ไม่มีตัวเลข ช่องว่างจะยังคงมองเห็นได้

• พารามิเตอร์ — Mage-VL: 4.74B, แบบ dense, active ทั้งหมดต่อโทเค็น MiniCPM-V 4.7: 35.2B ทั้งหมด, แบบ sparse, 8 จาก 256 experts ต่อโทเค็น ตัวเลขของ MiniCPM ไม่สามารถเทียบเคียงกับแบบ dense ได้

• ใบอนุญาต — Mage-VL: Apache-2.0 ระบุไว้ใน Model Card และแท็กของ repo MiniCPM-V 4.7: ไม่ได้ประกาศไว้

• การประหยัดโทเคนมาจากไหน — Mage-VL: ความเบาบางของโทเคนภาพที่ตัวเข้ารหัส (encoder) ซึ่งสอดคล้องกับตัวแปลงรหัส (codec) โดยอ้างว่าลดได้มากกว่า 75% MiniCPM-V 4.7: แอตเทนชันเชิงเส้นที่ตัวถอดรหัส (decoder) ซึ่งช่วยลดการเติบโตของ KV-cache ในลำดับยาว แต่ไม่ได้ลดจำนวนโทเคนที่คุณป้อนให้มัน

• บริบท — Mage-VL: ผ่านการฝึกด้วยขั้นตอนบริบทความยาว (long-context) บนวิดีโอ 350K รายการ ในรูปแบบหน้าต่างตัวแปลงรหัสแบบเลื่อน (rolling codec windows) ความยาวสูงสุด 384 หรือ 768 เฟรม MiniCPM-V 4.7: max_position_embeddings: 262144.

• ที่มาของวิชันเอนโคเดอร์ — Mage-VL: สร้างจากศูนย์ ฝึกบนเฟรมที่ไม่มีป้ายกำกับประมาณ 100 ล้านเฟรม; การ์ดรายงานว่าได้ 85.69% บน ImageNet ด้วย 256 โทเคน และมีการปรับปรุงที่ดีขึ้นอย่างต่อเนื่อง (monotonic) ตามงบโทเคน MiniCPM-V 4.7: ทาวเวอร์ที่สืบทอดสายการออกแบบ (lineage tower) ถูกนำกลับมาใช้จากดีไซน์ของ MiniCPM-V 4.6 ที่รูปทรง 1152-hidden, 27-layer แบบเดียวกัน โดยค่าเริ่มต้นใช้การดาวน์แซมเปิล 16x

• หลักฐาน — Mage-VL: การ์ดเต็มรูปแบบที่มี DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 และช่องว่าง CrossPoint +53.1 เหนือ Qwen3-VL-4B ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเทียบกับแบ็กโบนที่จับคู่กัน MiniCPM-V 4.7: ไม่มี

• พฤติกรรมการสตรีมมิง — Mage-VL: ประตูการรับรู้ (cognition gate) ที่ให้คะแนนแต่ละหน้าต่างแบบเลื่อน และจะเงียบจนกว่าเหตุการณ์จะเสร็จสมบูรณ์ ฝึกด้วยตัวอย่างสตรีมมิงประมาณ 3.3 ล้านตัวอย่าง MiniCPM-V 4.7: ไม่มีคำอธิบายไว้ที่ใดเลย

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

ส่วนที่ทุกคนเข้าใจผิดเกี่ยวกับตัวเลขของ Mage-VL

ตาราง benchmark บนการ์ดของ Mage-VL นั้นแข็งแกร่ง และตารางที่แข็งแกร่งที่สุดก็เป็นตารางที่ถูกตีความผิดได้ง่ายที่สุดด้วย แถวเปรียบเทียบนำ Mage-VL-4B มาวัดกับ Qwen3-VL-4B, Phi-4-Multimodal-Instruct และ Phi-4-Reasoning-Vision และตัวเลขการเพิ่มขึ้นที่พาดหัว — +22.5 บน QVHighlight, +24.5 บน VideoEval-Pro, +53.1 บน CrossPoint — เป็นของจริงในแง่ที่ว่ามันปรากฏอยู่ในตารางของผู้ขาย พวกมันยังเป็นการวัดของผู้ขายเอง ที่ผลิตโดยทีมที่ฝึกโมเดล บนฮาร์เนสเดียวกัน ยังไม่มีบุคคลภายนอกที่เป็นอิสระรายใดทำซ้ำผลเหล่านี้ได้ นั่นเป็นเรื่องปกติสำหรับโมเดลอายุสี่เดือน และไม่ถือเป็นจุดด้อยของมัน แต่ก็หมายความว่าคำกริยาที่ถูกต้องคือ “รายงาน” ไม่ใช่ “ได้คะแนน”

สองสิ่งนี้น่าจะได้รับการยกเครดิตนอกเหนือจากตารางผลลัพธ์ อย่างแรก การออกแบบแบบจับคู่แบ็กโบน — การตรึงดีโคเดอร์ Qwen3-4B ไว้และสลับเฉพาะ ViT — เป็นหลักฐานที่ชัดเจนกว่าตำแหน่งบนลีดเดอร์บอร์ด เพราะมันแยกชั้นการประมวลผลภาพออกมาโดด ๆ แทนที่จะเป็นทั้งระบบ อย่างที่สอง คลังข้อมูลฝึกของ Mage-ViT มีเฟรมที่ไม่มีป้ายกำกับประมาณ 100 ล้านเฟรม เทียบกับคู่ภาพ-ข้อความหลายพันล้านคู่ที่เอนโคเดอร์ซึ่งพรีเทรนจากเว็บใช้ ดังนั้นการทำได้เทียบเท่าพฤติกรรมระดับ SigLIP2-at-10B ในการแยกแยะคลัสเตอร์จึงเป็นข้อกล่าวอ้างที่เฉพาะเจาะจงและตรวจสอบได้เกี่ยวกับประสิทธิภาพการใช้ข้อมูล มากกว่าจะเป็นการโอ้อวดทั่วไป

MiniCPM-V 4.7 ไม่มีสิ่งเหล่านี้เลย ไม่ใช่เวอร์ชันที่อ่อนแอกว่า — แต่ไม่มีเลย

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

ไม่มีตารางใด ๆ ไม่ว่าจะเป็นของผู้ขายหรือแหล่งอื่น และไฟล์คอนฟิกที่อธิบายสถาปัตยกรรมนั้นได้ระบุไว้อย่างชัดเจนว่าตัวเองไม่กล่าวถึงความแม่นยำใด ๆ

สถาปัตยกรรม: สองคำตอบสำหรับคำถามเดียวกัน

โมเดลทั้งสองต่างพยายามตอบคำถามว่า "จะทำให้การอนุมานแบบหลายรูปแบบมีต้นทุนต่ำได้อย่างไร" และความแตกต่างนี้ก็ให้ข้อคิดที่เป็นประโยชน์ เพราะคำตอบทั้งสองนั้นประกอบเข้าหากันมากกว่าแข่งขันกัน

Mage-VL ลดขนาดอินพุต 16×16กริดแพตช์ถูกใช้ร่วมกันระหว่างเฟรมแองเคอร์และเฟรมที่ทำนาย และเฟรมที่ทำนายจะส่งแพตช์เฉพาะจุดที่โคเดกกำลังใช้บิต ซึ่งเป็นจุดที่มีการเคลื่อนไหวและรายละเอียดใหม่ ผลลัพธ์คือสตรีมโทเค็นความยาวแปรผันต่อเฟรม ซึ่งเป็นเหตุผลว่าทำไมสแต็กจึงต้องมีโปรเจกเตอร์ที่สามารถส่งลำดับความยาวแปรผันไปยังตัวถอดรหัสเชิงสาเหตุ และเหตุใดอินเทอร์เฟซเดียวกันจึงสามารถรับเวกเตอร์การเคลื่อนไหว H.264/HEVC หรือแผนที่อัตราที่เรียนรู้ของโคเดกประสาทได้โดยไม่ต้องฝึกใหม่ จากนั้นการเข้ารหัสแบบโรตารี 3D จะรักษาตำแหน่งเชิงพื้นที่-เวลาให้สอดคล้องกันทั่วทั้งความเบาบาง งบประมาณโทเค็นคือปริมาณที่กำลังถูกจัดการ

MiniCPM-V 4.7 ลดขนาดสถานะ เลเยอร์ linear-attention ของมันเก็บสถานะ recurrent ขนาดคงที่แทนที่จะเป็น key-value cache ที่ขยายตัว ทำให้ต้นทุนหน่วยความจำของการสนทนายาวไม่เพิ่มขึ้นเชิงเส้นตามจำนวนโทเคนอีกต่อไป งบประมาณลำดับคือปริมาณที่ถูกจัดการ และบริบท 256K คือผลลัพธ์ที่คุ้มค่า เป็นที่น่าสังเกตว่า config ของ MiniCPM-V 4.7 ระบุถึงการดาวน์แซมเปิลภาพ 16x — ซึ่งบีบอัดอินพุตด้วย — แต่ไม่กล่าวถึงว่ายังคงโหมด 4x ที่สลับได้ซึ่ง MiniCPM-V 4.6 เปิดตัวไว้หรือไม่

พูดง่าย ๆ ก็คือ เคล็ดลับของ Mage-VL ให้ผลดีกับวิดีโอที่เฟรมส่วนใหญ่แทบจะเหมือนกับเฟรมข้างเคียง เคล็ดลับของ MiniCPM-V 4.7 ให้ผลดีกับเอกสารยาวและเซสชันแบบหลายรอบที่ยาวนานซึ่งมีโทเค็นสะสมเพิ่มขึ้น ไปป์ไลน์ที่รับสตรีมสดเข้ามาแล้วจากนั้นสนทนายาว ๆ เกี่ยวกับสตรีมนั้นจะได้ประโยชน์จากทั้งสองอย่าง และยังไม่มีโมเดลใดทำหน้าที่ของอีกฝ่ายได้

นำสิ่งเหล่านั้นไปให้บริการในเวิร์กโฟลว์จริง

Mage-VL นำไปลองใช้ได้จริงในวันนี้: เช็กพอยต์เดียว สถาปัตยกรรมที่มีเอกสารกำกับ Apache-2.0 และการ์ดที่บอกคุณว่ารีโพซิทอรีนั้นรวมอะไรไว้บ้าง มันเปิดตัวมาตั้งแต่เดือนกรกฎาคม และเครื่องมือที่เกี่ยวข้องก็มีเวลาเพียงพอที่จะลงตัวแล้ว

MiniCPM-V 4.7 ยังไม่สมจริงที่จะลองใช้ในวันนี้ ด้วยเหตุผลที่แสนน่าเบื่อ 70 GB ใน BF16 โดยไม่มีการควอนไทซ์ หมายความว่าหน่วยความจำของตัวเร่งที่คุณคงไม่มีเหลือว่าง และการไม่มีสัญญาอนุญาตหมายความว่าคำถามเรื่องว่าคุณจะใช้งานมันได้หรือไม่นั้นยังคงเปิดอยู่ เส้นทางโค้ดที่กำหนดเองนั้นต้องใช้ trust_remote_code และยังไม่ได้ทดสอบว่าการผสม MoE เข้ากับ linear attention มีเคอร์เนลในสแต็กการให้บริการของคุณหรือไม่

สิ่งที่จริงสำหรับทั้งสองกรณีคือ โมเดลวิชันที่โฮสต์เองเป็นเพียงองค์ประกอบหนึ่งของระบบที่ยังต้องเรียกใช้โมเดลระดับแนวหน้าอยู่ดี ซึ่งนั่นคือเหตุผลที่ควรวางครึ่งที่เป็นโฮสต์ไว้หลังเราเตอร์ตัวเดียว แทนที่จะเป็นสัญญาอีกฉบับและ SDK อีกตัว: OrcaRouter เข้าถึงโมเดลกว่า 200 รุ่นด้วยคีย์เดียว ส่งต่อราคาตามที่ผู้ให้บริการแต่ละรายประกาศไว้โดยเราไม่บวกเพิ่ม และสลับไปใช้ตัวสำรองโดยอัตโนมัติเมื่อผู้ให้บริการรายใดมีประสิทธิภาพลดลง ทั้ง Mage-VL และ MiniCPM-V 4.7 ต่างไม่ใช่โมเดลที่โฮสต์อยู่บนบริการนั้น — ทั้งคู่เป็นเวตที่คุณต้องให้บริการเอง — ดังนั้นให้มองว่านี่คือระบบท่อฝั่งปลายทางของการส่งต่อ ไม่ใช่ช่องทางความพร้อมใช้งานของโมเดลใดโมเดลหนึ่ง

คำตัดสิน

Mage-VL เป็นโมเดลที่เสร็จสมบูรณ์ มีสัญญาอนุญาต และผ่านการวัดประสิทธิภาพแล้ว พร้อมปรัชญาการออกแบบที่เฉพาะเจาะจงและมีเหตุผลรองรับชัดเจน โดยจุดแข็งของมันอยู่ที่การสตรีมวิดีโอและการให้เหตุผลเชิงพื้นที่ ซึ่งเอนโคเดอร์แบบเนทีฟกับโคเดกของมันทำสิ่งที่แตกต่างเชิงโครงสร้างจากเจ้าอื่นทั้งหมด MiniCPM-V 4.7 เป็นเช็กพอยต์ที่ใหญ่กว่า ไม่มีสัญญาอนุญาต และยังไม่ได้วัดประสิทธิภาพ ปรัชญาการออกแบบพออ่านออก แต่พฤติกรรมยังเป็นช่องว่าง ในทุกสิ่งที่ผู้อ่านนำไปใช้ตัดสินใจได้ในวันนี้ Mage-VL ชนะโดยปริยาย — ไม่ใช่เพราะมันดีกว่า แต่เพราะมันเป็นเพียงหนึ่งในสองตัวนี้ที่สามารถถูกประเมินได้เลย กลับมาทบทวนการเปรียบเทียบนี้เมื่อ README ของ MiniCPM-V 4.7 ปรากฏขึ้น หากวันนั้นนำมาซึ่งการวัดประสิทธิภาพและสัญญาอนุญาต คำถามที่น่าสนใจจะเป็นว่า MoE แบบ linear attention ที่มีบริบท 256K จะเอาชนะเอนโคเดอร์แบบสแปร์ซิตีที่เนทีฟกับโคเดกบนวิดีโอยาวได้หรือไม่ และนั่นคือการต่อสู้ที่เปิดกว้างอย่างแท้จริง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube