
MiniCPM-V 4.7 與 Microsoft Mage-VL:對視覺模型每幀成本該是多少的兩種截然不同押注
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
MiniCPM-V 4.7 和 Microsoft Mage-VL 都是宣稱能節省你 token 的視覺語言模型,但它們達成的方式卻截然相反。Mage-VL 由 Microsoft 於 2026 年 7 月 25 日發布,它從影片方面著手:借用影片編碼器的結構,保留每個錨定幀的 patch,以及僅保留帶有真實運動的預測幀 patch,並宣稱可將視覺 token 減少超過 75%,相較於均勻幀取樣,實際運行時間加速最高可達 3.5 倍。MiniCPM-V 4.7 由 OpenBMB 於 2026 年 10 月 6 日上傳,它從序列方面著手:一個擁有 352 億參數的稀疏 MoE,其 40 層中有 30 層採用線性注意力路徑,這使得 KV 快取在 256K 上下文中緩慢增長。一個模型壓縮它所看到的內容。另一個模型壓縮它所記住的內容。而且只有其中一個附帶了任何你可以評估的東西。
每一項是什麼
微軟 Mage-VL 是一個編解碼器原生、主動式串流的多模態基礎模型,規模為 4B,以 Apache-2.0 釋出,並附有技術報告與內容豐富的評估章節。它的打造刻意針對作者所稱的 VLM 莫拉維克悖論——擅長離線推理,卻在即時感知上緩慢。視覺編碼器 Mage-ViT 完全從零開始訓練,使用約 1 億張未標註圖像與影片,而非從網路預訓練的 ViT 初始化;整個堆疊中唯一的預訓練元件是 Qwen3-4B-Instruct-2507 語言主幹。完整檢查點是單一統一模型,能進行圖像理解、離線影片推理,以及事件觸發的串流評論,無需不同變體;以及搭配的 microsoft/Mage-ViT 發布版本則單獨提供該編碼器。自發布以來,它已累積約 10,600 次下載與 420 個讚。
MiniCPM-V 4.7 是openbmb/MiniCPM-V-4.7-35B-A3B,一個擁有 35,212,875,824 個參數的 BF16 檢查點,分為十六個分片、總計 70.4 GB,由 Transformers 5.2.0 寫入,並於 2026 年 10 月 6 日上傳,且沒有模型卡。

其文字配置標記為 qwen3_5_moe_text,擁有 256 個專家、每個 token 啟用 8 個;其 layer_types 陣列在 40 層中每三層線性注意力搭配一層完整注意力;其視覺塔為自家研發的 minicpmv4_7_vision,共 27 層,具備 16× 下採樣,最多可處理九個影像切片。上下文為 256K。該儲存庫的下載次數為零、有三個讚、沒有任何基準測試,也沒有授權條款。
讀者可以檢查的六行
同樣的六個維度,兩邊皆同。若某項數字不存在,缺口便任其顯露。
• 參數 — Mage-VL:4.74B,稠密,每個 token 全部啟用。MiniCPM-V 4.7:總計 35.2B,稀疏,每個 token 使用 256 個專家中的 8 個。MiniCPM 的數字與稠密模型無法相提並論。
• 授權條款 — Mage-VL:Apache-2.0,已在模型卡與 repo 標籤中載明。MiniCPM-V 4.7:未宣告任何內容。
• 節省下來的 token 從何而來——Mage-VL:編碼器端的視覺 token 稀疏化,與編解碼器對齊,宣稱可減少超過 75%。MiniCPM-V 4.7:解碼器端的線性注意力,這能縮小 KV-cache 在長序列中的成長,但不會減少你餵給它的 token 數量。
• 上下文 — Mage-VL:在 35 萬部影片上,以最多 384 或 768 個影格的滾動式編解碼視窗形式,經過長上下文階段訓練。MiniCPM-V 4.7:max_position_embeddings: 262144。
• 視覺編碼器來源 — Mage-VL:從零開始訓練,使用約 1 億個未標註影格;模型卡報告在 256 個 token 下達到 85.69% ImageNet,且隨著 token 預算增加呈單調提升。MiniCPM-V 4.7:沿用 MiniCPM-V 4.6 設計的血統塔,維持相同的 1152 隱藏維度、27 層結構,並預設採用 16x 下採樣。
• 證據 — Mage-VL:一份完整成績單,包含 DocVQA 95.14、InfoVQA 80.33、OCRBench 81.80、ChartQAPro 32.57、MMStar 67.32、CV-Bench-3D 94.75,以及相較 Qwen3-VL-4B 的 +53.1 CrossPoint 差距,全部都是在匹配的骨幹模型上由廠商回報的結果。MiniCPM-V 4.7:無。
• 串流行為 — Mage-VL:一個認知閘門,會對每個滾動視窗評分,並在事件完成前保持靜默,以約 330 萬筆串流樣本訓練。MiniCPM-V 4.7:未在任何地方描述。

大家對 Mage-VL 數據最常搞錯的地方
Mage-VL 模型卡上的基準測試表相當亮眼,而其中最亮眼的幾項,也最容易被誤讀。對照列把 Mage-VL-4B 與 Qwen3-VL-4B、Phi-4-Multimodal-Instruct 及 Phi-4-Reasoning-Vision 擺在一起比較,而最受矚目的增益——QVHighlight 上 +22.5、VideoEval-Pro 上 +24.5、CrossPoint 上 +53.1——就它們確實出現在廠商表格裡這層意義而言是真的。它們同時也是廠商自行測得的數據,由訓練該模型的團隊在同一套測試框架上產出。沒有任何獨立第三方重現過這些結果。對一個問世四個月的模型而言這很正常,也不是什麼扣分項,但這確實意味著正確的動詞是「回報」,而不是「得分」。
除了表格之外,還有兩點值得讚許。首先,匹配主幹的設計——將 Qwen3-4B 解碼器固定,僅替換 ViT——是比排行榜名次更乾淨的證據,因為它隔離了視覺堆疊,而非整個系統。其次,Mage-ViT 的訓練語料約為 1 億個未標註幀,而網路預訓練編碼器使用的是數十億個圖像-文字對,因此於聚類判別上匹配 SigLIP2-at-10B-class 的行為,是關於資料效率的一項具體、可檢驗的主張,而非泛泛的自誇。
MiniCPM-V 4.7 完全沒有這些。不是較弱的版本——完全沒有。

並沒有任何表格,無論是廠商提供的還是其他來源的;而描述該架構的設定檔也明確將自身排除在對準確性作出任何說明之外。
架構:同一個問題的兩個答案
這兩個模型都在試圖回答「如何讓多模態推論變得便宜」,而這個對比很具啟發性,因為這兩個答案相輔相成,而非彼此競爭。
Mage-VL 會縮減輸入。它的 16×16 補丁網格由錨定幀與預測幀共用,而預測幀只在編解碼器花費位元的地方貢獻補丁——也就是運動與新細節所在之處。結果是每幀可變長度的符元串流,這就是為何這個堆疊需要一個投影器,能將可變序列交給因果解碼器,也是為何同一個介面可以接受 H.264/HEVC 運動向量或神經編解碼器學到的速率圖,而無需重新訓練。接著,三維旋轉編碼讓時空位置在稀疏性之中保持連貫。符元預算正是被管理的那個量。
MiniCPM-V 4.7 縮減了狀態。它的線性注意力層維持固定大小的遞迴狀態,而非持續增長的鍵值快取,因此長對話的記憶體成本不再隨 token 數量線性增長。其序列預算才是被管理的量,而 256K 上下文就是回報。值得注意的是,MiniCPM-V 4.7 的設定標示了 16 倍視覺降採樣——它也壓縮輸入——但未說明是否保留 MiniCPM-V 4.6 所具備的可切換 4x 模式。
簡單來說:Mage-VL 的技巧在影片上能發揮效益,因為影片中大多數影格都與相鄰影格幾乎相同。MiniCPM-V 4.7 的技巧則在長文件和長時間的多輪工作階段中奏效,因為 token 會在其中不斷累積。一套先接收即時串流、再針對它進行長時間對話的管線,將能同時受益於兩者,而目前這兩個模型都還做不到對方擅長的工作。
將它們導入實際工作流程中
Mage-VL 現在就能實際試用:單一檢查點、有文件記錄的架構、Apache-2.0,還有一張說明儲存庫內含哪些內容的模型卡。它自七月推出至今,周邊工具鏈已有時間沉澱穩定。
基於一些無趣的理由,MiniCPM-V 4.7 今天並不適合實際嘗試。BF16 下 70 GB 且未量化,意味著你大概沒有閒置的加速器記憶體可用;缺少授權則讓「你究竟能否使用它」這個問題仍懸而未決。自訂程式碼路徑需要 trust_remote_code,而 MoE 加線性注意力的組合在你的服務堆疊中是否有對應的核心,則尚未經過驗證。
對兩者同樣成立的是:自架(self-hosted)視覺模型只是整個系統中的一個元件,而這個系統還必須呼叫前沿模型。這正是把代管的那一半放在單一路由器後方、而非再簽一份合約與再導入一套 SDK 的理由:OrcaRouter 用一組金鑰就能觸及 200 多個模型,以各家供應商的定價原樣轉遞、我們不額外加價,並在供應商服務品質下滑時自動容錯移轉。Mage-VL 與 MiniCPM-V 4.7 都不是該服務上的代管模型——兩者都是你自己部署的權重——因此請把這看成交接之後另一側的管線基礎設施,而不是這兩個模型各自的可用性通道。
裁決
Mage-VL 是一個已完成、已授權、已做過基準測試的模型,具有明確且論證充分的設計哲學;而它的立論基礎在於影片串流與空間推理,因為其原生於編解碼器的編碼器在這些領域的結構性做法與其他所有人截然不同。MiniCPM-V 4.7 則是更大、未授權、未經測量的檢查點,其設計哲學尚可辨識,但實際行為仍是一片空白。就讀者今天能據以行動的一切而言,Mage-VL 預設勝出——不是因為它更好,而是因為它是兩者中唯一至少還能被評判的。等 MiniCPM-V 4.7 的 README 出現時,再回頭檢視這項比較;如果那一天帶來了基準測試與授權條款,有趣的問題將是:一個具備 256K 上下文、線性注意力的 MoE,能否在長影片上勝過原生於編解碼器的稀疏編碼器——而那是一場真正未分勝負的較量。
