
MiniCPM-V 4.7 vs Microsoft Mage-VL: สองการเดิมพันที่แตกต่างกันอย่างมากว่าควรให้โมเดลวิชันมีต้นทุนต่อเฟรมเท่าใด
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
MiniCPM-V 4.7 และ Microsoft Mage-VL ต่างเป็นโมเดลที่เข้าใจภาพและภาษา (vision-language) ซึ่งอ้างว่าช่วยประหยัดโทเค็นของคุณ และทั้งสองไปถึงจุดนั้นด้วยเส้นทางที่ตรงกันข้าม Mage-VL ซึ่ง Microsoft เปิดตัวเมื่อวันที่ 25 กรกฎาคม 2026 โจมตีฝั่งวิดีโอ: มันยืมโครงสร้างของตัวแปลงรหัสวิดีโอ (video codec) มาใช้ เก็บแพตช์ของทุกเฟรมหลัก (anchor-frame patch) และเก็บเฉพาะแพตช์ของเฟรมที่ทำนายไว้ (predicted-frame patch) ที่มีการเคลื่อนไหวจริง แล้วอ้างว่าลดจำนวนโทเค็นภาพได้มากกว่า 75% พร้อมความเร็ว wall-clock สูงสุดถึง 3.5 เท่าเมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ MiniCPM-V 4.7 ซึ่ง OpenBMB อัปโหลดเมื่อวันที่ 6 ตุลาคม 2026 โจมตีฝั่งลำดับ: เป็น MoE แบบ sparse ขนาด 35.2 พันล้านพารามิเตอร์ โดย 30 จาก 40 เลเยอร์ของมันอยู่ในเส้นทาง linear attention ซึ่งทำให้ KV cache เติบโตช้า ๆ ตลอดความยาว 256K โมเดลหนึ่งบีบอัดสิ่งที่มันมองเห็น อีกโมเดลบีบอัดสิ่งที่มันจดจำ และมีเพียงหนึ่งในนั้นเท่านั้นที่มาพร้อมกับสิ่งที่คุณประเมินผลได้
แต่ละอย่างคืออะไร
Microsoft Mage-VL เป็นโมเดลพื้นฐานแบบมัลติโมดัลที่ทำงานสตรีมมิ่งเชิงรุกและเป็นโคเดกเนทีฟในระดับ 4B เผยแพร่ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคและส่วนการประเมินผลอย่างละเอียด มันถูกสร้างขึ้นอย่างจงใจเพื่อรับมือกับสิ่งที่ผู้เขียนเรียกว่า Moravec's paradox สำหรับ VLM — เก่งในการให้เหตุผลแบบออฟไลน์ แต่ช้าในการรับรู้แบบเรียลไทม์ ตัวเข้ารหัสภาพ Mage-ViT ถูกฝึกตั้งแต่ต้นใหม่ทั้งหมดด้วยภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ แทนที่จะเริ่มต้นจาก ViT ที่ผ่านการฝึกมาก่อนจากเว็บ และองค์ประกอบเดียวในสแต็กที่ผ่านการฝึกมาก่อนคือแกนภาษาศาสตร์ Qwen3-4B-Instruct-2507 เช็คพอยต์แบบเต็มเป็นโมเดลรวมเป็นหนึ่งเดียวที่ทำงานทำความเข้าใจภาพ การให้เหตุผลวิดีโอแบบออฟไลน์ และคำบรรยายสตรีมมิ่งที่ถูกกระตุ้นด้วยเหตุการณ์ โดยไม่มีตัวแปรแยกต่างหาก และมีคู่หูmicrosoft/Mage-ViTที่เปิดตัวให้ตัวเข้ารหัสแยกต่างหาก มันมียอดดาวน์โหลดประมาณ 10,600 ครั้งและถูกใจ 420 ครั้งนับตั้งแต่เปิดตัว
MiniCPM-V 4.7 คือ openbmb/MiniCPM-V-4.7-35B-A3B ซึ่งเป็นเช็กพอยต์ BF16 ขนาด 35,212,875,824 พารามิเตอร์ ในสิบหกชาร์ด รวมทั้งหมด 70.4 GB เขียนโดย Transformers 5.2.0 และอัปโหลดเมื่อวันที่ 6 ตุลาคม 2026 โดยไม่มีโมเดลการ์ด

การตั้งค่าข้อความของมันถูกติดแท็กว่า qwen3_5_moe_text โดยมีผู้เชี่ยวชาญ 256 ตัวและเปิดใช้งาน 8 ตัวต่อโทเคน; layer_types อาร์เรย์ของมันรันเลเยอร์ความสนใจเชิงเส้นสามชั้นต่อเลเยอร์ความสนใจเต็มหนึ่งชั้นตลอด 40 เลเยอร์; ทาวเวอร์ภาพของมันคือตัวที่พัฒนาเองภายใน minicpmv4_7_vision ที่ 27 เลเยอร์พร้อมการดาวน์แซมปลิง 16× และสไลซ์ภาพได้สูงสุดเก้าชิ้น ความยาวบริบทคือ 256K รีโพซิทอรีมียอดดาวน์โหลดเป็นศูนย์ ถูกใจ 3 ครั้ง ไม่มีเบนช์มาร์ก และไม่มีใบอนุญาต
หกแถวที่ผู้อ่านสามารถตรวจสอบได้
มิติทั้งหกแบบเดียวกันในทั้งสองด้าน ตรงจุดที่ไม่มีตัวเลข ช่องว่างจะยังคงมองเห็นได้
• พารามิเตอร์ — Mage-VL: 4.74B, แบบ dense, active ทั้งหมดต่อโทเค็น MiniCPM-V 4.7: 35.2B ทั้งหมด, แบบ sparse, 8 จาก 256 experts ต่อโทเค็น ตัวเลขของ MiniCPM ไม่สามารถเทียบเคียงกับแบบ dense ได้
• ใบอนุญาต — Mage-VL: Apache-2.0 ระบุไว้ใน Model Card และแท็กของ repo MiniCPM-V 4.7: ไม่ได้ประกาศไว้
• การประหยัดโทเคนมาจากไหน — Mage-VL: ความเบาบางของโทเคนภาพที่ตัวเข้ารหัส (encoder) ซึ่งสอดคล้องกับตัวแปลงรหัส (codec) โดยอ้างว่าลดได้มากกว่า 75% MiniCPM-V 4.7: แอตเทนชันเชิงเส้นที่ตัวถอดรหัส (decoder) ซึ่งช่วยลดการเติบโตของ KV-cache ในลำดับยาว แต่ไม่ได้ลดจำนวนโทเคนที่คุณป้อนให้มัน
• บริบท — Mage-VL: ผ่านการฝึกด้วยขั้นตอนบริบทความยาว (long-context) บนวิดีโอ 350K รายการ ในรูปแบบหน้าต่างตัวแปลงรหัสแบบเลื่อน (rolling codec windows) ความยาวสูงสุด 384 หรือ 768 เฟรม MiniCPM-V 4.7: max_position_embeddings: 262144.
• ที่มาของวิชันเอนโคเดอร์ — Mage-VL: สร้างจากศูนย์ ฝึกบนเฟรมที่ไม่มีป้ายกำกับประมาณ 100 ล้านเฟรม; การ์ดรายงานว่าได้ 85.69% บน ImageNet ด้วย 256 โทเคน และมีการปรับปรุงที่ดีขึ้นอย่างต่อเนื่อง (monotonic) ตามงบโทเคน MiniCPM-V 4.7: ทาวเวอร์ที่สืบทอดสายการออกแบบ (lineage tower) ถูกนำกลับมาใช้จากดีไซน์ของ MiniCPM-V 4.6 ที่รูปทรง 1152-hidden, 27-layer แบบเดียวกัน โดยค่าเริ่มต้นใช้การดาวน์แซมเปิล 16x
• หลักฐาน — Mage-VL: การ์ดเต็มรูปแบบที่มี DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 และช่องว่าง CrossPoint +53.1 เหนือ Qwen3-VL-4B ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเทียบกับแบ็กโบนที่จับคู่กัน MiniCPM-V 4.7: ไม่มี
• พฤติกรรมการสตรีมมิง — Mage-VL: ประตูการรับรู้ (cognition gate) ที่ให้คะแนนแต่ละหน้าต่างแบบเลื่อน และจะเงียบจนกว่าเหตุการณ์จะเสร็จสมบูรณ์ ฝึกด้วยตัวอย่างสตรีมมิงประมาณ 3.3 ล้านตัวอย่าง MiniCPM-V 4.7: ไม่มีคำอธิบายไว้ที่ใดเลย

ส่วนที่ทุกคนเข้าใจผิดเกี่ยวกับตัวเลขของ Mage-VL
ตาราง benchmark บนการ์ดของ Mage-VL นั้นแข็งแกร่ง และตารางที่แข็งแกร่งที่สุดก็เป็นตารางที่ถูกตีความผิดได้ง่ายที่สุดด้วย แถวเปรียบเทียบนำ Mage-VL-4B มาวัดกับ Qwen3-VL-4B, Phi-4-Multimodal-Instruct และ Phi-4-Reasoning-Vision และตัวเลขการเพิ่มขึ้นที่พาดหัว — +22.5 บน QVHighlight, +24.5 บน VideoEval-Pro, +53.1 บน CrossPoint — เป็นของจริงในแง่ที่ว่ามันปรากฏอยู่ในตารางของผู้ขาย พวกมันยังเป็นการวัดของผู้ขายเอง ที่ผลิตโดยทีมที่ฝึกโมเดล บนฮาร์เนสเดียวกัน ยังไม่มีบุคคลภายนอกที่เป็นอิสระรายใดทำซ้ำผลเหล่านี้ได้ นั่นเป็นเรื่องปกติสำหรับโมเดลอายุสี่เดือน และไม่ถือเป็นจุดด้อยของมัน แต่ก็หมายความว่าคำกริยาที่ถูกต้องคือ “รายงาน” ไม่ใช่ “ได้คะแนน”
สองสิ่งนี้น่าจะได้รับการยกเครดิตนอกเหนือจากตารางผลลัพธ์ อย่างแรก การออกแบบแบบจับคู่แบ็กโบน — การตรึงดีโคเดอร์ Qwen3-4B ไว้และสลับเฉพาะ ViT — เป็นหลักฐานที่ชัดเจนกว่าตำแหน่งบนลีดเดอร์บอร์ด เพราะมันแยกชั้นการประมวลผลภาพออกมาโดด ๆ แทนที่จะเป็นทั้งระบบ อย่างที่สอง คลังข้อมูลฝึกของ Mage-ViT มีเฟรมที่ไม่มีป้ายกำกับประมาณ 100 ล้านเฟรม เทียบกับคู่ภาพ-ข้อความหลายพันล้านคู่ที่เอนโคเดอร์ซึ่งพรีเทรนจากเว็บใช้ ดังนั้นการทำได้เทียบเท่าพฤติกรรมระดับ SigLIP2-at-10B ในการแยกแยะคลัสเตอร์จึงเป็นข้อกล่าวอ้างที่เฉพาะเจาะจงและตรวจสอบได้เกี่ยวกับประสิทธิภาพการใช้ข้อมูล มากกว่าจะเป็นการโอ้อวดทั่วไป
MiniCPM-V 4.7 ไม่มีสิ่งเหล่านี้เลย ไม่ใช่เวอร์ชันที่อ่อนแอกว่า — แต่ไม่มีเลย

ไม่มีตารางใด ๆ ไม่ว่าจะเป็นของผู้ขายหรือแหล่งอื่น และไฟล์คอนฟิกที่อธิบายสถาปัตยกรรมนั้นได้ระบุไว้อย่างชัดเจนว่าตัวเองไม่กล่าวถึงความแม่นยำใด ๆ
สถาปัตยกรรม: สองคำตอบสำหรับคำถามเดียวกัน
โมเดลทั้งสองต่างพยายามตอบคำถามว่า "จะทำให้การอนุมานแบบหลายรูปแบบมีต้นทุนต่ำได้อย่างไร" และความแตกต่างนี้ก็ให้ข้อคิดที่เป็นประโยชน์ เพราะคำตอบทั้งสองนั้นประกอบเข้าหากันมากกว่าแข่งขันกัน
Mage-VL ลดขนาดอินพุต 16×16กริดแพตช์ถูกใช้ร่วมกันระหว่างเฟรมแองเคอร์และเฟรมที่ทำนาย และเฟรมที่ทำนายจะส่งแพตช์เฉพาะจุดที่โคเดกกำลังใช้บิต ซึ่งเป็นจุดที่มีการเคลื่อนไหวและรายละเอียดใหม่ ผลลัพธ์คือสตรีมโทเค็นความยาวแปรผันต่อเฟรม ซึ่งเป็นเหตุผลว่าทำไมสแต็กจึงต้องมีโปรเจกเตอร์ที่สามารถส่งลำดับความยาวแปรผันไปยังตัวถอดรหัสเชิงสาเหตุ และเหตุใดอินเทอร์เฟซเดียวกันจึงสามารถรับเวกเตอร์การเคลื่อนไหว H.264/HEVC หรือแผนที่อัตราที่เรียนรู้ของโคเดกประสาทได้โดยไม่ต้องฝึกใหม่ จากนั้นการเข้ารหัสแบบโรตารี 3D จะรักษาตำแหน่งเชิงพื้นที่-เวลาให้สอดคล้องกันทั่วทั้งความเบาบาง งบประมาณโทเค็นคือปริมาณที่กำลังถูกจัดการ
MiniCPM-V 4.7 ลดขนาดสถานะ เลเยอร์ linear-attention ของมันเก็บสถานะ recurrent ขนาดคงที่แทนที่จะเป็น key-value cache ที่ขยายตัว ทำให้ต้นทุนหน่วยความจำของการสนทนายาวไม่เพิ่มขึ้นเชิงเส้นตามจำนวนโทเคนอีกต่อไป งบประมาณลำดับคือปริมาณที่ถูกจัดการ และบริบท 256K คือผลลัพธ์ที่คุ้มค่า เป็นที่น่าสังเกตว่า config ของ MiniCPM-V 4.7 ระบุถึงการดาวน์แซมเปิลภาพ 16x — ซึ่งบีบอัดอินพุตด้วย — แต่ไม่กล่าวถึงว่ายังคงโหมด 4x ที่สลับได้ซึ่ง MiniCPM-V 4.6 เปิดตัวไว้หรือไม่
พูดง่าย ๆ ก็คือ เคล็ดลับของ Mage-VL ให้ผลดีกับวิดีโอที่เฟรมส่วนใหญ่แทบจะเหมือนกับเฟรมข้างเคียง เคล็ดลับของ MiniCPM-V 4.7 ให้ผลดีกับเอกสารยาวและเซสชันแบบหลายรอบที่ยาวนานซึ่งมีโทเค็นสะสมเพิ่มขึ้น ไปป์ไลน์ที่รับสตรีมสดเข้ามาแล้วจากนั้นสนทนายาว ๆ เกี่ยวกับสตรีมนั้นจะได้ประโยชน์จากทั้งสองอย่าง และยังไม่มีโมเดลใดทำหน้าที่ของอีกฝ่ายได้
นำสิ่งเหล่านั้นไปให้บริการในเวิร์กโฟลว์จริง
Mage-VL นำไปลองใช้ได้จริงในวันนี้: เช็กพอยต์เดียว สถาปัตยกรรมที่มีเอกสารกำกับ Apache-2.0 และการ์ดที่บอกคุณว่ารีโพซิทอรีนั้นรวมอะไรไว้บ้าง มันเปิดตัวมาตั้งแต่เดือนกรกฎาคม และเครื่องมือที่เกี่ยวข้องก็มีเวลาเพียงพอที่จะลงตัวแล้ว
MiniCPM-V 4.7 ยังไม่สมจริงที่จะลองใช้ในวันนี้ ด้วยเหตุผลที่แสนน่าเบื่อ 70 GB ใน BF16 โดยไม่มีการควอนไทซ์ หมายความว่าหน่วยความจำของตัวเร่งที่คุณคงไม่มีเหลือว่าง และการไม่มีสัญญาอนุญาตหมายความว่าคำถามเรื่องว่าคุณจะใช้งานมันได้หรือไม่นั้นยังคงเปิดอยู่ เส้นทางโค้ดที่กำหนดเองนั้นต้องใช้ trust_remote_code และยังไม่ได้ทดสอบว่าการผสม MoE เข้ากับ linear attention มีเคอร์เนลในสแต็กการให้บริการของคุณหรือไม่
สิ่งที่จริงสำหรับทั้งสองกรณีคือ โมเดลวิชันที่โฮสต์เองเป็นเพียงองค์ประกอบหนึ่งของระบบที่ยังต้องเรียกใช้โมเดลระดับแนวหน้าอยู่ดี ซึ่งนั่นคือเหตุผลที่ควรวางครึ่งที่เป็นโฮสต์ไว้หลังเราเตอร์ตัวเดียว แทนที่จะเป็นสัญญาอีกฉบับและ SDK อีกตัว: OrcaRouter เข้าถึงโมเดลกว่า 200 รุ่นด้วยคีย์เดียว ส่งต่อราคาตามที่ผู้ให้บริการแต่ละรายประกาศไว้โดยเราไม่บวกเพิ่ม และสลับไปใช้ตัวสำรองโดยอัตโนมัติเมื่อผู้ให้บริการรายใดมีประสิทธิภาพลดลง ทั้ง Mage-VL และ MiniCPM-V 4.7 ต่างไม่ใช่โมเดลที่โฮสต์อยู่บนบริการนั้น — ทั้งคู่เป็นเวตที่คุณต้องให้บริการเอง — ดังนั้นให้มองว่านี่คือระบบท่อฝั่งปลายทางของการส่งต่อ ไม่ใช่ช่องทางความพร้อมใช้งานของโมเดลใดโมเดลหนึ่ง
คำตัดสิน
Mage-VL เป็นโมเดลที่เสร็จสมบูรณ์ มีสัญญาอนุญาต และผ่านการวัดประสิทธิภาพแล้ว พร้อมปรัชญาการออกแบบที่เฉพาะเจาะจงและมีเหตุผลรองรับชัดเจน โดยจุดแข็งของมันอยู่ที่การสตรีมวิดีโอและการให้เหตุผลเชิงพื้นที่ ซึ่งเอนโคเดอร์แบบเนทีฟกับโคเดกของมันทำสิ่งที่แตกต่างเชิงโครงสร้างจากเจ้าอื่นทั้งหมด MiniCPM-V 4.7 เป็นเช็กพอยต์ที่ใหญ่กว่า ไม่มีสัญญาอนุญาต และยังไม่ได้วัดประสิทธิภาพ ปรัชญาการออกแบบพออ่านออก แต่พฤติกรรมยังเป็นช่องว่าง ในทุกสิ่งที่ผู้อ่านนำไปใช้ตัดสินใจได้ในวันนี้ Mage-VL ชนะโดยปริยาย — ไม่ใช่เพราะมันดีกว่า แต่เพราะมันเป็นเพียงหนึ่งในสองตัวนี้ที่สามารถถูกประเมินได้เลย กลับมาทบทวนการเปรียบเทียบนี้เมื่อ README ของ MiniCPM-V 4.7 ปรากฏขึ้น หากวันนั้นนำมาซึ่งการวัดประสิทธิภาพและสัญญาอนุญาต คำถามที่น่าสนใจจะเป็นว่า MoE แบบ linear attention ที่มีบริบท 256K จะเอาชนะเอนโคเดอร์แบบสแปร์ซิตีที่เนทีฟกับโคเดกบนวิดีโอยาวได้หรือไม่ และนั่นคือการต่อสู้ที่เปิดกว้างอย่างแท้จริง
