
Nemotron Sports Tennis 對比 North Micro Vision Instruct:31B 網球閱讀器對上 2.4B 文件專家
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
先說結論:{{1}}NVIDIA NemotronLabs AI for Media - Sports Tennis{{/1}} 和 {{2}}North Micro Vision Instruct{{/2}} 並不是彼此的替代品,而會在這兩者之間做選擇的人,其實根本不是在兩者之間做選擇。前者是 NVIDIA 為了回答網球得分問題而微調的 31B 多模態模型,需要約 80 GB 的 GPU 記憶體,而且只讀得懂英文。後者是來自 {{3}}Cohere{{/3}} 的 2.4B 視覺語言模型,單張工作站顯示卡就能裝得下,支援十一種語言,而且最重要的建構目的就是讀取文件——頁面、圖表、表格、OCR。
它們同屬一個廣泛類別,除此之外幾乎毫無共通點。以下是這項比較的誠實版本:兩者真正分歧之處、各家廠商已公布與尚未公布的內容,以及唯一一種選擇確實存在的情況。
每個模型被打造來做的事
North Micro Vision Instruct 將一個 2B 語言模型——Cohere 的 North Micro LLM,採用 Command A+ 架構——與一個以 SigLIP 2 SO400M 為基礎客製訓練的 400M 參數視覺編碼器配對,總計 2.4B。其視覺路徑採用原生解析度,保留長寬比,而非縮放至固定網格;而 DeepStack 投影器會將來自多個編碼器層的 patch 嵌入注入對應的早期語言層,而非在前面加上單一表示。Cohere 所闡明的定位是作為原型開發與特定任務微調的精簡基礎,並以文件理解為旗艦能力。模型卡對其能力上限異常坦率:North Micro Vision Instruct 明確不是推理模型、不具備工具呼叫功能,且未以系統提示詞進行訓練。
Sports Tennis 在各個維度上都是相反的形態。NVIDIA 從自家的 Nemotron 3 Nano Omni 30B-A3B-Reasoning 檢查點開始 —— 一個 Mamba2-Transformer 混合專家模型,總計 31B,每個 token 約有 3B 活躍參數 —— 並在專有的、人工標註的網球語料庫上對其進行微調。視覺編碼器(C-RADIOv4-H)和語音編碼器(Parakeet)都被凍結;只有語言模型參數被調整。結果是一個設計上就專精的模型:它針對完整的網球分數片段,回答結構化的選擇題和開放式問題,涵蓋擊球力學、場上定位、球員移動、比賽事實、規則知識和音頻線索。NVIDIA 描述它的最佳運作方式是當整個分數 —— 從發球到回合結束 —— 作為輸入傳入時。
真正將它們區分開來的維度
• 參數 — North Micro Vision Instruct:2.4B(2B 語言、400M 視覺)。Sports Tennis:總計 31B,每個 token 約 3B 活躍參數。
• 輸入 — North Micro Vision Instruct:交錯的文字與圖片、原生解析度、多圖片。Sports Tennis:影片最長 2 分鐘、音訊最長 1 小時、圖片、文字。
• 輸出 — 兩者皆回傳文字。North Micro Vision Instruct 另會回傳以正規化 0–1000 尺度表示的 grounding 邊界框。
• 語言 — North Micro Vision Instruct:十一種以上,包括英語、德語、法語、西班牙語、義大利語、葡萄牙語、印地語、日語、韓語、中文和阿拉伯語。Sports Tennis:僅英語。
• 上下文 — North Micro Vision Instruct:一個 128K-token 的語言主幹,但 Cohere 標示經驗證的多模態範圍最高為 8K token,而更長的多模態上下文則仰賴外推且未經基準測試。Sports Tennis:最高可達 256k token。
• 記憶體佔用量 — North Micro Vision Instruct:BF16 下約 4.97 GB,4-bit 下約 2.17 GB。Sports Tennis:BF16 下約 62 GB,需一張 80 GB GPU。
• 授權條款 — North Micro Vision Instruct:Apache 2.0。Sports Tennis:OpenMDW-1.1,且其卡片註明可供商業及非商業用途。

基準測試:一個模型有它們,另一個則有協定
這正是兩張卡在姿態上截然不同之處。
Cohere 公布了 North Micro Vision Instruct 的數據。DocVQA 0.921、ChartQA 0.808、OCRBench 0.792 —— 以及 MMMU 0.329。這些全數為供應商自行回報,沒有任何一項經過獨立重現,而 Cohere 本身也指出 OCR 結果會因資料分割而有劇烈差異。最後那個數字值得停下來想一想:MMMU 分數 0.329 偏低,而且這與該模型設計說明卡上其他所有內容一致。這是閱讀專門模型,不是通用推理模型,而打造它的公司也這樣說。這種揭露比一個漂亮數字更有用。
NVIDIA 什麼都沒公布。Sports Tennis 的模型卡詳盡描述其評估方式——由 12 場完全留出的比賽構成的測試分割、2,689 個球點層級片段,以及來自與訓練無重疊之比賽的 80,872 個問題,透過自動化多選題準確率,以及 LLM-as-judge pass@9 對開放式回答評分,並明確將已見比賽分割排除於所回報的測試之外——接著卻未從中回報任何結果。訓練方面也同樣詳盡:1,312,129 個問答範例,其中 1,226,081 個多選題與 86,048 個開放式題目,取自橫跨 239 場比賽的 43,084 個球點層級片段,並依 38 個標註類別加以標記。
即使 NVIDIA 公布了分數,兩者也不具可比性。沒有任何一項基準測試會讓文件理解模型與網球得分模型同時出現。這兩套評估敘事之間的重疊是零。

部署:實際差異之所在
{{1}}2.4B 模型{{/1}}以大幅差距成為更容易操作的一方。大約 5 GB 的 BF16 權重意味著單一現代工作站 GPU 就能處理,而約 2.17 GB 的 {{2}}4 位元版本{{/2}}還能更小。已有針對 {{3}}Apple's Core AI runtime{{/3}} 的獨立移植版本,據報導在 iPhone 17 Pro 上以 int8 執行時約為 18.2 tokens/s,而 int4 量化則完全失敗。障礙在於軟體:{{4}}North Micro Vision Instruct{{/4}} 需要 {{5}}Transformers 5.16.0{{/5}}——在登上 PyPI 前可從原始碼安裝——而公開的 vLLM 支援在模型卡上仍被描述為即將推出。微調可透過 {{6}}Axolotl{{/6}} 獲得支援。沒有第一方託管的 API;實際可行的途徑是自行託管。
Sports Tennis 是更難操作的那一個,而且這點無可迴避。一張 80 GB GPU、以 BF16 執行,沒有發布量化檢查點,僅支援英文、僅限 Linux,而且只能在 PyTorch/Transformers 或 NeMo 或 Megatron 上跑。NVIDIA 在 A100、H100、H200、B200、GB200 NVL72、RTX PRO 6000 SE、L40S、DGX Spark、Jetson Thor 與 RTX 5090 上都測過——這份硬體清單與其說反映了正常團隊能取得的資源,不如說反映了 NVIDIA 想驗證什麼。這張卡的預設推論策略也同樣陽春:每秒 2 幀、最多 128 幀、256 個新 token、貪婪解碼。
這兩個模型都沒有在 OrcaRouter 上提供服務。North Micro Vision Instruct 沒有第一方端點,也不在我們的目錄中;Sports Tennis 則在任何地方都沒有端點,因為 NVIDIA 只發布了權重,並未提供託管服務。兩者都屬於自行託管的決定。
路由層真正有幫助的地方,在於它們周圍的管線——無論你在本地執行其中哪一項,圍繞它的轉錄、摘要、檢索與應用模型都是託管的,而將這些置於一個具備自動容錯移轉的 API 金鑰之後,可避免為每一項建立個別的憑證組與合約。對於我們有提供的模型,我們以 0% 加價直接傳遞供應商的定價,因此你未自行託管的技術堆疊部分,仍維持在廠商價格。

當選擇是真實的
有一種情境,在兩者之間做選擇確實是個真正的決定,而這件事值得具體說明,因為它並不明顯。
這是媒體或體育組織的情況:他們已經處理文件,並想加入逐分層級的影片理解。擁有檔案管線的廣播商、擁有比賽報告和統計 PDF 的聯盟、同時握有文字與影片素材的版權持有者——對他們而言,North Micro Vision Instruct 很可能早已在技術堆疊中用於 OCR 和圖表擷取,而 Sports Tennis 則是他們將新增的能力。問題不是「哪一個」,而是「第二個會讓我在基礎設施上付出什麼成本」,而答案是資料中心 GPU 以及僅限英文的限制。
在那種情況之外,這些模型根本不會互相競爭。如果你需要的是在工作站顯示卡上閱讀十一種語言的文件,North Micro Vision Instruct 就是首選,而 Sports Tennis 對你來說毫不相關。如果你需要搭配音訊脈絡,針對網球得分提出結構化問題,Sports Tennis 是兩者中唯一能做到這點的,而它缺乏公開基準測試這件事,是你會接受的風險,而不是選擇另一個模型的理由。
該選哪個
如果你的工作涉及文件、圖表、OCR、grounding 或多語言圖像理解,而且你重視一家會將弱項數據與強項數據一同公布的廠商,就選擇 North Micro Vision Instruct。它規模小、以 Apache 2.0 授權、文件完善,且誠實面對自己不是推理模型。它的 MMMU 為 0.329,這不是日後才發現的缺陷;Cohere 一開始就告訴你。
只有在您特別需要具備音訊的逐分網球推理、有多餘的 80 GB GPU,並且願意成為第一個評估它的人時,才選擇 NVIDIA NemotronLabs AI for Media - Sports Tennis。沒有人發表過這個模型的分數,所以下載本身就是那場實驗。這並不是避開它的理由——一個擁有精心標註的 43,084 個片段訓練集的窄領域專家,正是那種能在自身任務上擊敗通才的模型——但這是把首次部署視為試用而非承諾的理由。
你絕對不該做的一件事,就是因為兩張卡上都寫著「視覺語言模型」,就把它們當成可以互換的東西。文件閱讀器和網球分析師從來就不是同一種產品,而在這一對裡,它們做什麼的差異,遠遠大於它們做得多好的差異。
