一張生成的分割面板主視覺卡片,比較 NVIDIA NemotronLabs AI for Media - Sports Tennis 與 North Micro Vision Instruct,左半部標示為 31B 網球閱讀器,並在網球得分片段圖示旁有一個僅限英文的標籤;右半部標示為 2.4B 文件專家,並在文件與長條圖圖示旁有一個 11+ 語言標籤,右下角則有 OrcaRouter 標誌。
Guides & Insights

Nemotron Sports Tennis 對比 North Micro Vision Instruct:31B 網球閱讀器對上 2.4B 文件專家

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

先說結論:{{1}}NVIDIA NemotronLabs AI for Media - Sports Tennis{{/1}} 和 {{2}}North Micro Vision Instruct{{/2}} 並不是彼此的替代品,而會在這兩者之間做選擇的人,其實根本不是在兩者之間做選擇。前者是 NVIDIA 為了回答網球得分問題而微調的 31B 多模態模型,需要約 80 GB 的 GPU 記憶體,而且只讀得懂英文。後者是來自 {{3}}Cohere{{/3}} 的 2.4B 視覺語言模型,單張工作站顯示卡就能裝得下,支援十一種語言,而且最重要的建構目的就是讀取文件——頁面、圖表、表格、OCR。

它們同屬一個廣泛類別,除此之外幾乎毫無共通點。以下是這項比較的誠實版本:兩者真正分歧之處、各家廠商已公布與尚未公布的內容,以及唯一一種選擇確實存在的情況。

每個模型被打造來做的事

North Micro Vision Instruct 將一個 2B 語言模型——Cohere 的 North Micro LLM,採用 Command A+ 架構——與一個以 SigLIP 2 SO400M 為基礎客製訓練的 400M 參數視覺編碼器配對,總計 2.4B。其視覺路徑採用原生解析度,保留長寬比,而非縮放至固定網格;而 DeepStack 投影器會將來自多個編碼器層的 patch 嵌入注入對應的早期語言層,而非在前面加上單一表示。Cohere 所闡明的定位是作為原型開發與特定任務微調的精簡基礎,並以文件理解為旗艦能力。模型卡對其能力上限異常坦率:North Micro Vision Instruct 明確不是推理模型、不具備工具呼叫功能,且未以系統提示詞進行訓練。

Sports Tennis 在各個維度上都是相反的形態。NVIDIA 從自家的 Nemotron 3 Nano Omni 30B-A3B-Reasoning 檢查點開始 —— 一個 Mamba2-Transformer 混合專家模型,總計 31B,每個 token 約有 3B 活躍參數 —— 並在專有的、人工標註的網球語料庫上對其進行微調。視覺編碼器(C-RADIOv4-H)和語音編碼器(Parakeet)都被凍結;只有語言模型參數被調整。結果是一個設計上就專精的模型:它針對完整的網球分數片段,回答結構化的選擇題和開放式問題,涵蓋擊球力學、場上定位、球員移動、比賽事實、規則知識和音頻線索。NVIDIA 描述它的最佳運作方式是當整個分數 —— 從發球到回合結束 —— 作為輸入傳入時。

真正將它們區分開來的維度

• 參數 — North Micro Vision Instruct:2.4B(2B 語言、400M 視覺)。Sports Tennis:總計 31B,每個 token 約 3B 活躍參數。

• 輸入 — North Micro Vision Instruct:交錯的文字與圖片、原生解析度、多圖片。Sports Tennis:影片最長 2 分鐘、音訊最長 1 小時、圖片、文字。

• 輸出 — 兩者皆回傳文字。North Micro Vision Instruct 另會回傳以正規化 0–1000 尺度表示的 grounding 邊界框。

• 語言 — North Micro Vision Instruct:十一種以上,包括英語、德語、法語、西班牙語、義大利語、葡萄牙語、印地語、日語、韓語、中文和阿拉伯語。Sports Tennis:僅英語。

• 上下文 — North Micro Vision Instruct:一個 128K-token 的語言主幹,但 Cohere 標示經驗證的多模態範圍最高為 8K token,而更長的多模態上下文則仰賴外推且未經基準測試。Sports Tennis:最高可達 256k token。

• 記憶體佔用量 — North Micro Vision Instruct:BF16 下約 4.97 GB,4-bit 下約 2.17 GB。Sports Tennis:BF16 下約 62 GB,需一張 80 GB GPU。

• 授權條款 — North Micro Vision Instruct:Apache 2.0。Sports Tennis:OpenMDW-1.1,且其卡片註明可供商業及非商業用途。

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

基準測試:一個模型有它們,另一個則有協定

這正是兩張卡在姿態上截然不同之處。

Cohere 公布了 North Micro Vision Instruct 的數據。DocVQA 0.921、ChartQA 0.808、OCRBench 0.792 —— 以及 MMMU 0.329。這些全數為供應商自行回報,沒有任何一項經過獨立重現,而 Cohere 本身也指出 OCR 結果會因資料分割而有劇烈差異。最後那個數字值得停下來想一想:MMMU 分數 0.329 偏低,而且這與該模型設計說明卡上其他所有內容一致。這是閱讀專門模型,不是通用推理模型,而打造它的公司也這樣說。這種揭露比一個漂亮數字更有用。

NVIDIA 什麼都沒公布。Sports Tennis 的模型卡詳盡描述其評估方式——由 12 場完全留出的比賽構成的測試分割、2,689 個球點層級片段,以及來自與訓練無重疊之比賽的 80,872 個問題,透過自動化多選題準確率,以及 LLM-as-judge pass@9 對開放式回答評分,並明確將已見比賽分割排除於所回報的測試之外——接著卻未從中回報任何結果。訓練方面也同樣詳盡:1,312,129 個問答範例,其中 1,226,081 個多選題與 86,048 個開放式題目,取自橫跨 239 場比賽的 43,084 個球點層級片段,並依 38 個標註類別加以標記。

即使 NVIDIA 公布了分數,兩者也不具可比性。沒有任何一項基準測試會讓文件理解模型與網球得分模型同時出現。這兩套評估敘事之間的重疊是零。

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

部署:實際差異之所在

{{1}}2.4B 模型{{/1}}以大幅差距成為更容易操作的一方。大約 5 GB 的 BF16 權重意味著單一現代工作站 GPU 就能處理,而約 2.17 GB 的 {{2}}4 位元版本{{/2}}還能更小。已有針對 {{3}}Apple's Core AI runtime{{/3}} 的獨立移植版本,據報導在 iPhone 17 Pro 上以 int8 執行時約為 18.2 tokens/s,而 int4 量化則完全失敗。障礙在於軟體:{{4}}North Micro Vision Instruct{{/4}} 需要 {{5}}Transformers 5.16.0{{/5}}——在登上 PyPI 前可從原始碼安裝——而公開的 vLLM 支援在模型卡上仍被描述為即將推出。微調可透過 {{6}}Axolotl{{/6}} 獲得支援。沒有第一方託管的 API;實際可行的途徑是自行託管。

Sports Tennis 是更難操作的那一個,而且這點無可迴避。一張 80 GB GPU、以 BF16 執行,沒有發布量化檢查點,僅支援英文、僅限 Linux,而且只能在 PyTorch/Transformers 或 NeMo 或 Megatron 上跑。NVIDIA 在 A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor 與 RTX 5090 上都測過——這份硬體清單與其說反映了正常團隊能取得的資源,不如說反映了 NVIDIA 想驗證什麼。這張卡的預設推論策略也同樣陽春:每秒 2 幀、最多 128 幀、256 個新 token、貪婪解碼。

這兩個模型都沒有在 OrcaRouter 上提供服務。North Micro Vision Instruct 沒有第一方端點,也不在我們的目錄中;Sports Tennis 則在任何地方都沒有端點,因為 NVIDIA 只發布了權重,並未提供託管服務。兩者都屬於自行託管的決定。

路由層真正有幫助的地方,在於它們周圍的管線——無論你在本地執行其中哪一項,圍繞它的轉錄、摘要、檢索與應用模型都是託管的,而將這些置於一個具備自動容錯移轉的 API 金鑰之後,可避免為每一項建立個別的憑證組與合約。對於我們有提供的模型,我們以 0% 加價直接傳遞供應商的定價,因此你未自行託管的技術堆疊部分,仍維持在廠商價格。

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

當選擇是真實的

有一種情境,在兩者之間做選擇確實是個真正的決定,而這件事值得具體說明,因為它並不明顯。

這是媒體或體育組織的情況:他們已經處理文件,並想加入逐分層級的影片理解。擁有檔案管線的廣播商、擁有比賽報告和統計 PDF 的聯盟、同時握有文字與影片素材的版權持有者——對他們而言,North Micro Vision Instruct 很可能早已在技術堆疊中用於 OCR 和圖表擷取,而 Sports Tennis 則是他們將新增的能力。問題不是「哪一個」,而是「第二個會讓我在基礎設施上付出什麼成本」,而答案是資料中心 GPU 以及僅限英文的限制。

在那種情況之外,這些模型根本不會互相競爭。如果你需要的是在工作站顯示卡上閱讀十一種語言的文件,North Micro Vision Instruct 就是首選,而 Sports Tennis 對你來說毫不相關。如果你需要搭配音訊脈絡,針對網球得分提出結構化問題,Sports Tennis 是兩者中唯一能做到這點的,而它缺乏公開基準測試這件事,是你會接受的風險,而不是選擇另一個模型的理由。

該選哪個

如果你的工作涉及文件、圖表、OCR、grounding 或多語言圖像理解,而且你重視一家會將弱項數據與強項數據一同公布的廠商,就選擇 North Micro Vision Instruct。它規模小、以 Apache 2.0 授權、文件完善,且誠實面對自己不是推理模型。它的 MMMU 為 0.329,這不是日後才發現的缺陷;Cohere 一開始就告訴你。

只有在您特別需要具備音訊的逐分網球推理、有多餘的 80 GB GPU,並且願意成為第一個評估它的人時,才選擇 NVIDIA NemotronLabs AI for Media - Sports Tennis。沒有人發表過這個模型的分數,所以下載本身就是那場實驗。這並不是避開它的理由——一個擁有精心標註的 43,084 個片段訓練集的窄領域專家,正是那種能在自身任務上擊敗通才的模型——但這是把首次部署視為試用而非承諾的理由。

你絕對不該做的一件事,就是因為兩張卡上都寫著「視覺語言模型」,就把它們當成可以互換的東西。文件閱讀器和網球分析師從來就不是同一種產品,而在這一對裡,它們做什麼的差異,遠遠大於它們做得多好的差異。