
MiniCPM-V 4.7 vs Microsoft Mage-VL: Hai canh bạc rất khác nhau về việc một mô hình thị giác nên tốn bao nhiêu chi phí cho mỗi khung hình
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
MiniCPM-V 4.7 và Microsoft Mage-VL đều là những mô hình thị giác-ngôn ngữ tự nhận sẽ giúp bạn tiết kiệm token, và chúng đạt được điều đó bằng những con đường trái ngược nhau. Mage-VL, được Microsoft phát hành ngày 25 tháng 7 năm 2026, tấn công vào phía video: nó mượn cấu trúc của một codec video, giữ mọi patch của khung neo và chỉ những patch của khung dự đoán mang chuyển động thực, đồng thời tuyên bố giảm hơn 75% token thị giác với tốc độ nhanh hơn tối đa 3,5× theo thời gian thực so với lấy mẫu khung đồng đều. MiniCPM-V 4.7, được OpenBMB đăng tải ngày 6 tháng 10 năm 2026, tấn công vào phía chuỗi: một MoE thưa 35,2 tỷ tham số với 30 trong số 40 lớp nằm trên đường attention tuyến tính, khiến bộ đệm KV tăng chậm trong ngữ cảnh 256K. Một mô hình nén thứ nó nhìn vào. Mô hình kia nén thứ nó ghi nhớ. Và chỉ một trong hai đi kèm thứ gì đó bạn có thể đánh giá.
Mỗi loại là gì
Microsoft Mage-VL là một mô hình nền tảng đa phương thức quy mô 4B, gốc codec, truyền phát chủ động, được phát hành theo giấy phép Apache-2.0 kèm một báo cáo kỹ thuật và một phần đánh giá đồ sộ. Mô hình được xây dựng một cách có chủ đích để đối đầu với thứ mà các tác giả gọi là nghịch lý Moravec của các VLM — mạnh khi suy luận ngoại tuyến, chậm khi cảm nhận theo thời gian thực. Bộ mã hóa thị giác, Mage-ViT, được huấn luyện hoàn toàn từ đầu trên khoảng 100 triệu ảnh và video không gán nhãn thay vì khởi tạo từ một ViT đã tiền huấn luyện trên web, và thành phần tiền huấn luyện duy nhất trong toàn bộ hệ thống là xương sống ngôn ngữ Qwen3-4B-Instruct-2507. Checkpoint đầy đủ là một mô hình hợp nhất duy nhất có thể hiểu ảnh, suy luận video ngoại tuyến và bình luận truyền phát theo sự kiện mà không cần các biến thể riêng biệt, và một bản phát hành microsoft/Mage-ViT đi kèm cung cấp riêng bộ mã hóa. Mô hình đã tích lũy khoảng 10.600 lượt tải xuống và 420 lượt thích kể từ khi phát hành.
MiniCPM-V 4.7 là openbmb/MiniCPM-V-4.7-35B-A3B, một checkpoint BF16 có 35.212.875.824 tham số trong mười sáu phân đoạn với tổng dung lượng 70,4 GB, được ghi bởi Transformers 5.2.0 và được tải lên vào ngày 6 tháng 10 năm 2026 mà không có thẻ mô hình.

Cấu hình văn bản của nó được gắn thẻ qwen3_5_moe_text với 256 chuyên gia và 8 chuyên gia hoạt động trên mỗi token; mảng layer_types của nó chạy ba lớp attention tuyến tính cho mỗi một lớp attention đầy đủ trên 40 lớp; tháp thị giác của nó là sản phẩm nội bộ minicpmv4_7_vision với 27 lớp, giảm mẫu 16× và tối đa chín lát ảnh. Ngữ cảnh là 256K. Kho lưu trữ không có lượt tải xuống nào, có ba lượt thích, không có benchmark và không có giấy phép.
Sáu hàng mà người đọc có thể kiểm tra
Sáu chiều kích giống nhau, ở cả hai phía. Nơi nào không có con số, khoảng trống vẫn được để lộ ra.
• Tham số — Mage-VL: 4,74B, dày đặc, tất cả đều hoạt động trên mỗi token. MiniCPM-V 4.7: tổng cộng 35,2B, thưa, 8 trong số 256 chuyên gia mỗi token. Con số của MiniCPM không thể so sánh được với một mô hình dày đặc.
• Giấy phép — Mage-VL: Apache-2.0, được nêu trong card và các tag repo. MiniCPM-V 4.7: không khai báo gì.
• Tiết kiệm token đến từ đâu — Mage-VL: độ thưa thớt của token thị giác ở encoder, căn chỉnh theo codec, được tuyên bố giảm hơn 75%. MiniCPM-V 4.7: attention tuyến tính ở decoder, giúp thu hẹp mức tăng KV-cache trên các chuỗi dài nhưng không làm giảm số token mà bạn đưa vào.
• Ngữ cảnh — Mage-VL: được huấn luyện qua một giai đoạn ngữ cảnh dài trên 350K video dưới dạng các cửa sổ codec trượt lên đến 384 hoặc 768 khung hình. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Nguồn gốc bộ mã hóa thị giác — Mage-VL: xây dựng từ đầu, được huấn luyện trên ~100 triệu khung không gán nhãn; thẻ mô hình báo cáo 85,69% ImageNet với 256 token và cải thiện đơn điệu theo ngân sách token. MiniCPM-V 4.7: tower kế thừa được tái sử dụng từ thiết kế của MiniCPM-V 4.6 với cùng dạng ẩn 1152, 27 lớp, cùng mặc định downsample 16x.
• Bằng chứng — Mage-VL: một bảng đầy đủ với DocVQA 95.14, InfoVQA 80.33, OCRBench 81.80, ChartQAPro 32.57, MMStar 67.32, CV-Bench-3D 94.75 và mức chênh lệch CrossPoint +53.1 so với Qwen3-VL-4B, tất cả đều do nhà cung cấp báo cáo trên một backbone tương ứng. MiniCPM-V 4.7: không có.
• Hành vi truyền phát — Mage-VL: một cổng nhận thức chấm điểm từng cửa sổ trượt và giữ im lặng cho đến khi một sự kiện hoàn tất, được huấn luyện trên ~3,3 triệu mẫu truyền phát. MiniCPM-V 4.7: không được mô tả ở bất kỳ đâu.

Điều mà mọi người đều hiểu sai về những con số của Mage-VL
Các bảng benchmark của thẻ Mage-VL rất mạnh, và những bảng mạnh nhất cũng là những bảng dễ bị đọc sai nhất. Các hàng so sánh đặt Mage-VL-4B đối đầu với Qwen3-VL-4B, Phi-4-Multimodal-Instruct và Phi-4-Reasoning-Vision, còn những mức tăng nổi bật — +22.5 trên QVHighlight, +24.5 trên VideoEval-Pro, +53.1 trên CrossPoint — là thật theo nghĩa chúng xuất hiện trong các bảng của nhà cung cấp. Chúng cũng là các phép đo của chính nhà cung cấp, do nhóm đã huấn luyện mô hình thực hiện, trên cùng một harness. Chưa có bên độc lập nào tái lập chúng. Điều đó là bình thường với một mô hình bốn tháng tuổi và không phải là điểm trừ đối với nó, nhưng nó có nghĩa là động từ đúng là “báo cáo”, không phải “đạt điểm”.
Có hai điều đáng ghi nhận ngoài các bảng biểu. Thứ nhất, thiết kế matched-backbone — giữ nguyên bộ giải mã Qwen3-4B và chỉ thay thế ViT — là một bằng chứng rõ ràng hơn một vị trí trên bảng xếp hạng, vì nó cô lập phần xử lý thị giác thay vì toàn bộ hệ thống. Thứ hai, tập dữ liệu huấn luyện cho Mage-ViT chỉ khoảng 100 triệu khung chưa gán nhãn, so với hàng tỷ cặp ảnh-văn bản mà các bộ mã hóa tiền huấn luyện trên web sử dụng, nên việc đạt được hành vi tương đương SigLIP2-at-10B-class về phân biệt cụm là một tuyên bố cụ thể, có thể kiểm chứng về hiệu quả dữ liệu chứ không phải một lời khoe khoang chung chung.
MiniCPM-V 4.7 không có bất kỳ thứ nào trong số này. Không phải là một phiên bản yếu hơn — mà là không có gì cả.

Không có bảng nào, dù là của nhà cung cấp hay nguồn nào khác, và tệp cấu hình mô tả kiến trúc tự nó nói rõ rằng nó không đề cập bất cứ điều gì về độ chính xác.
Kiến trúc: hai câu trả lời cho cùng một câu hỏi
Cả hai mô hình đều đang cố trả lời câu hỏi “làm thế nào để suy luận đa phương thức trở nên rẻ,” và sự tương phản này rất đáng chú ý vì hai câu trả lời bổ trợ cho nhau thay vì cạnh tranh.
Mage-VL giảm đầu vào. Lưới patch 16×16 của nó được chia sẻ giữa khung neo và khung dự đoán, và các khung dự đoán chỉ đóng góp các patch ở nơi codec đang tiêu tốn bit — tức là nơi có chuyển động và chi tiết mới. Kết quả là các luồng token có độ dài thay đổi trên mỗi khung, đó là lý do ngăn xếp cần một bộ chiếu có thể đưa một chuỗi có độ dài thay đổi cho bộ giải mã nhân quả, và lý do cùng một giao diện có thể nhận vector chuyển động H.264/HEVC hoặc bản đồ tốc độ đã học của codec nơ-ron mà không cần huấn luyện lại. Sau đó, mã hóa quay 3D giữ cho các vị trí không-thời gian nhất quán xuyên suốt độ thưa thớt. Ngân sách token là đại lượng đang được quản lý.
MiniCPM-V 4.7 giảm trạng thái. Các lớp attention tuyến tính của nó giữ một trạng thái hồi quy có kích thước cố định thay vì bộ đệm key-value tăng dần, vì vậy chi phí bộ nhớ của một cuộc hội thoại dài không còn tăng tuyến tính theo số lượng token. Ngân sách chuỗi của nó là đại lượng được quản lý, và ngữ cảnh 256K là thành quả. Đáng chú ý, cấu hình của MiniCPM-V 4.7 quảng cáo khả năng downsample thị giác 16x — nó cũng nén đầu vào — nhưng không đề cập đến việc liệu nó có giữ lại chế độ 4x có thể chuyển đổi mà MiniCPM-V 4.6 đã tiết lộ hay không.
Nói một cách đơn giản: chiêu của Mage-VL phát huy tác dụng với video, nơi hầu hết các khung hình gần như giống hệt những khung hình bên cạnh. Chiêu của MiniCPM-V 4.7 lại phát huy tác dụng với các tài liệu dài và những phiên trò chuyện nhiều lượt kéo dài, nơi các token tích lũy dần. Một pipeline tiếp nhận luồng trực tiếp rồi sau đó duy trì một cuộc trò chuyện dài về nó sẽ hưởng lợi từ cả hai, và hiện chưa mô hình nào làm được công việc của mô hình kia.
Đưa chúng vào một quy trình làm việc thực tế
Mage-VL rất thiết thực để dùng thử ngay hôm nay: một checkpoint, một kiến trúc được tài liệu hóa, Apache-2.0, và một thẻ cho bạn biết kho lưu trữ bao gồm những gì. Nó đã ra mắt từ tháng Bảy và bộ công cụ xung quanh nó đã có thời gian để ổn định.
MiniCPM-V 4.7 không thực tế để thử ngay hôm nay, vì những lý do nhàm chán. 70 GB ở BF16 không lượng tử hóa nghĩa là bộ nhớ tăng tốc mà bạn có lẽ không có sẵn đang rảnh, và việc thiếu giấy phép nghĩa là câu hỏi liệu bạn có được phép dùng nó hay không vẫn còn bỏ ngỏ. Các đường dẫn mã tùy chỉnh yêu cầu trust_remote_code, và liệu tổ hợp MoE cộng cơ chế chú ý tuyến tính có kernel trong ngăn xếp phục vụ của bạn hay không vẫn chưa được kiểm chứng.
Điều đúng với cả hai là một mô hình thị giác tự lưu trữ chỉ là một thành phần của một hệ thống mà còn phải gọi các mô hình tiên tiến. Đó là lý do để đặt nửa phần lưu trữ phía sau một router duy nhất thay vì một hợp đồng thứ hai và một SDK thứ hai: OrcaRouter tiếp cận hơn 200 mô hình chỉ với một khóa, chuyển nguyên giá niêm yết của từng nhà cung cấp mà chúng tôi không thêm phụ phí, và tự động chuyển đổi dự phòng khi một nhà cung cấp gặp sự cố. Cả Mage-VL lẫn MiniCPM-V 4.7 đều không phải là mô hình được lưu trữ trên dịch vụ đó — cả hai đều là trọng số mà bạn tự phục vụ — nên hãy coi đây là phần hạ tầng ở phía bên kia của điểm bàn giao, chứ không phải là một kênh khả dụng cho một trong hai mô hình.
Phán quyết
Mage-VL là một mô hình đã hoàn thiện, đã được cấp phép, đã được đánh giá chuẩn, với một triết lý thiết kế cụ thể và được lập luận chặt chẽ, và lý lẽ ủng hộ nó dựa trên truyền phát video cùng suy luận không gian, nơi bộ mã hóa gốc codec của nó làm được điều gì đó khác biệt về mặt cấu trúc so với mọi người khác. MiniCPM-V 4.7 là một checkpoint lớn hơn, chưa được cấp phép, chưa được đo lường, có triết lý thiết kế dễ hiểu nhưng hành vi thì vẫn là một khoảng trống. Trên mọi thứ mà người đọc có thể dựa vào để hành động hôm nay, Mage-VL thắng theo mặc định — không phải vì nó tốt hơn, mà vì nó là mô hình duy nhất trong hai có thể được đánh giá chút nào. Hãy xem lại so sánh này khi README của MiniCPM-V 4.7 xuất hiện; nếu ngày đó mang đến các đánh giá chuẩn và một giấy phép, câu hỏi thú vị sẽ là liệu một MoE attention tuyến tính với ngữ cảnh 256K có đánh bại được một bộ mã hóa thưa gốc codec trên video dài hay không, và đó là một cuộc đối đầu thực sự còn bỏ ngỏ.
