
PixelUMM 對決 North Micro Vision Instruct:非商業研究模型對上可正式推出的 2.4B 閱讀器
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把North Micro Vision Instruct和PixelUMM並排放在一起,體量差距幾乎成了一種干擾:Cohere 的原生解析度閱讀器有 24 億個參數,NVIDIA 的統一模型則有 152 億個。真正有意思的比較軸是編碼器。North Micro Vision Instruct 走的是傳統路線——一個 4 億參數的視覺編碼器,以 SigLIP 2 SO400M 初始化,接上一個 20 億參數的語言模型,外裹 262,144 個詞元的詞彙表,並以 Apache-2.0 授權發布。PixelUMM 則建立在一個論點上:正是這種配置本身構成了瓶頸,於是它直接刪掉了編碼器——原始的 16×16 像素區塊透過單層線性投影送入 Qwen3-8B 主幹,而同一組權重既能生成影片,也能回答關於影片的問題。一個是今天就能下載部署的專用閱讀器具,另一個則是一篇附有下載連結的研究論文,而它的授權條款讓它進不了產品。
下方兩個模型的數字都出自各自的實驗室。兩者都未經獨立重現,且兩家發表的基準測試套件不同,因此重疊範圍比看上去更窄。
為無聊架構辯護
North Micro Vision Instruct 於 2026 年 8 月 10 日在 Hugging Face 上發布,至今已有八週時間累積使用者,到了十月初,下載量約為 180,000 次、按讚數約 150 次——受到的關注度比 PixelUMM 才上線幾天的儲存庫高出一個數量級。它的訴求明確且不花俏:大多數視覺模型會將影像縮小到固定網格,因而流失文件所仰賴的精細細節,而這個模型則以原生解析度處理影像,保留長寬比與小字。
• 參數 — 總計 24 億:20 億參數的語言模型,加上一個以 SigLIP 2 SO400M 為基礎自訂訓練的 4 億參數視覺編碼器。
• 上下文 — 一個 128K token 的語言主幹,但經過驗證的多模態運作範圍約為 8K token。模型卡明確指出,更長的多模態上下文仰賴外推,且尚未經過基準測試。
• 輸入與輸出——交錯的文字與圖像輸入,文字輸出。支援十一種以上語言的多語言處理。不進行任何形式的生成。
• 報告分數 — DocVQA 0.921、ChartQA 0.808、OCRBench 0.792,全數由 Cohere 自行報告且未經重現驗證。MMMU 0.329,而模型卡並未隱瞞這點:這是個閱讀專才,而非推理通才。
• 部署 — Transformers 5.16.0 與加速器,單張現代 GPU 以 bfloat16 執行 2.4B 模型,Flash Attention 2 為選用而非必要。
那個設計毫無新穎之處。這也是它本週就能被下載、微調,並用在真實文件上的原因。

反對它的理由,由另一方提出
PixelUMM 的預印本開篇即點出該架構的代價。一個凍結的、經網路預訓練的視覺轉換器提供理解所需的語意特徵;另一個獨立的 VAE 則提供面向重建的潛在表示以供生成之用;同時承載兩者,會讓每張條件圖像的視覺脈絡大致加倍,並迫使視覺語言預訓練流程圍繞第二條串流重建。North Micro Vision Instruct 之所以能避免這種加倍,只因它完全拒絕了第二項工作——它不進行生成,因此只需要一個介面,而非兩個。
PixelUMM 把這個論點推向了極致。沒有編碼器、沒有 VAE、沒有分詞器:影像用 16×16 的像素區塊,影片用 4 幀的時空管狀單元,兩者都透過單層線性投影送入僅含解碼器的 Transformer,理解靠自迴歸文字,生成靠像素空間流匹配。它的八個實證章節研究的是設計取捨,而非排行榜上的勝負——區塊大小、區塊偽影、像素空間與 VAE 空間的訓練動態、運算規模擴展——這是一篇追問該範式是否站得住腳的論文,而不是宣稱它已經勝出的論文。
• 視覺路徑 — North Micro Vision Instruct:原生解析度下 400M 的預訓練視覺編碼器。PixelUMM:無編碼器;原始 patch 經由線性投影處理。
• 它能做什麼 — North Micro Vision Instruct:可讀取圖像與文件、以文字回答,並進行定位與生成描述。PixelUMM:可讀取圖像與影片,並從文字生成圖像與 4 秒影片。
• 規模 — 在 Qwen3-8B 主幹上,稠密參數為 2.4B,總參數約 15.2B,在論文自身的表格中標示為「8B MoT」。
• 授權條款——程式碼與權重採用 Apache-2.0,對比程式碼採用 Apache-2.0,而檢查點則採用 NVIDIA One-Way Noncommercial License。

誠實地解讀這兩個計分板
這兩個模型發布了不同的基準測試,而在兩者重疊的部分,其評分標準也不相同。
• DocVQA — North Micro Vision Instruct 為準確率分數 0.921。PixelUMM 為百分比 90.42。相同的基準名稱、不同的資料切分與提示設定,而兩者之中只有一方以原生解析度處理作為理由。
• ChartQA — North Micro Vision Instruct 0.808。PixelUMM 82.96。再次,一旦不再比較原始字串,大致上就落在同一個區間。
• OCRBench — North Micro Vision Instruct 0.792。PixelUMM 78.00。
• MMMU——North Micro Vision Instruct 0.329、PixelUMM 41.67。以大型視覺語言模型的標準而言,兩者都偏低,而兩個實驗室都未加修飾地回報這些結果。
• 僅限 PixelUMM — MVBench 70.53、Video-MME 57.33、LongVideoBench 59.61、搭配提示詞改寫器的 GenEval 0.83、VBench 第一部分品質 84.10。
• North Micro Vision Instruct-only — 視覺定位、圖像描述與多圖任務;有文獻記載其缺乏工具呼叫功能,且明確不具備代理行為。
這種重疊之中最引人注目的地方,在於一個 2.4B 的專門模型在文件與圖表閱讀上,竟能如此接近一個 15.2B 的通用模型。這並不是無編碼器(encoder-free)做法失敗的證據——而是說明文件閱讀正是緊湊型原生解析度編碼器非常合適的一項任務,而 PixelUMM 的架構所針對的是另一套論點。PixelUMM 自己的論文以一句值得引述的話承認了這一點:由於各模型的訓練資料不同,其結果「無法確立哪一種架構更優越」。
決策真正落定的地方
如果你有文件、圖表、表單或螢幕截圖,而你需要在這個月內得到答案,North Micro Vision Instruct 是務實的選擇,而且差距毫不接近:Apache-2.0、2.4B、標準 Transformers 載入路徑、沒有護欄環境、沒有分散式檢查點索引、沒有第二套 Python 堆疊。在你自己的文件分布上微調它,你就擁有一位專家。但要注意範圍——把它指向推理任務,MMMU 的數字就會找上你。
PixelUMM 提供的是廣度,以及一個研究問題。它能以一組權重同時讀取與生成影像和影片,而且明顯是更值得一讀的那一方。但它的檢查點採用非商業授權,其權重是 128 個分散式檢查點分片,藏在一個總計約 30 GB 的隱藏中繼資料索引之後,還需要搭配從原始碼編譯的 FlashAttention 的 CUDA 13 工具組,而且它的文字轉影片路徑會執行 Cosmos 護欄,需要一個閘控儲存庫和一個獨立環境。那是實驗室工作臺,不是部署環境。
路由這個切入點會晚點才出現,如果它真會出現的話。目前這兩款模型都無法透過任何託管 API 使用—— OrcaRouter 兩者皆不提供路由——而且在它們的授權允許之前,兩者也都不會。當像 North Micro Vision Instruct 這樣的模型確實出現在共用端點之後,偏好這種方式而非直接整合的理由很普通:一組金鑰就能使用 200+ 個模型、供應商定價以 0% 加成直接轉嫁、容錯移轉會把表現不如其模型卡的模型降級,以及當你想對替代方案做 A/B 測試時,無須再協商第二份合約。這是在描述工作流程,而不是對可用性作出主張。
唯一能將它們區分開的測試
在相同的解析度下,對同一組文件分別執行兩者,並針對小字案例評分,然後只改變一個變數:讓 PixelUMM 接收原生解析度的輸入,把視覺編碼器從比較中移除。如果這個無編碼器模型能以一小部分的參數成本,在密集文字上依然站得住腳,那就是對該論點最強而有力的證據——而且這是任何有閒置顯卡的人都能跑的測試,因為兩個檢查點都可下載。在有人這麼做之前,務實的結論仍然成立:小型的 Apache-2.0 讀取器是你部署的那個,而大型的非商業通用模型是你研究的那個。
