Thẻ hero chia đôi được tạo tự động, so sánh NVIDIA NemotronLabs AI for Media - Sports Tennis với North Micro Vision Instruct, nửa bên trái được dán nhãn trình đọc tennis 31B và một chip chỉ tiếng Anh bên cạnh biểu tượng clip điểm tennis, còn nửa bên phải được dán nhãn chuyên gia tài liệu 2.4B và một chip 11+ ngôn ngữ bên cạnh biểu tượng tài liệu và biểu đồ cột, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: Một trình đọc quần vợt 31B đối đầu với một chuyên gia tài liệu 2.4B

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Câu trả lời ngắn gọn trước: NVIDIA NemotronLabs AI for Media - Sports Tennis và North Micro Vision Instruct không phải là sản phẩm thay thế cho nhau, và không ai đang chọn giữa hai sản phẩm này thực sự lại đang chọn giữa hai sản phẩm này. Một cái là mô hình đa phương thức 31B được NVIDIA tinh chỉnh để trả lời các câu hỏi về điểm tennis, cần khoảng 80 GB bộ nhớ GPU và chỉ đọc được tiếng Anh. Cái còn lại là mô hình thị giác-ngôn ngữ 2.4B từ Cohere, vừa trên một card máy trạm duy nhất, xử lý mười một ngôn ngữ và được xây dựng trên hết để đọc tài liệu — các trang, biểu đồ, bảng, OCR.

Chúng cùng nằm trong một phạm trù rộng và hầu như không ở đâu khác. Phần tiếp theo là phiên bản trung thực của sự so sánh: nơi hai bên thực sự khác biệt, những gì mỗi nhà cung cấp đã và chưa công bố, và tình huống duy nhất mà lựa chọn ấy là thật.

Mỗi mô hình được xây dựng để làm gì

North Micro Vision Instruct kết hợp một mô hình ngôn ngữ 2B — North Micro LLM của Cohere, theo kiến trúc Command A+ — với một bộ mã hóa thị giác 400M tham số được huấn luyện tùy chỉnh từ SigLIP 2 SO400M, tổng cộng 2,4B. Đường thị giác của nó có độ phân giải gốc, giữ nguyên tỷ lệ khung hình thay vì thay đổi kích thước về một lưới cố định, và một bộ chiếu DeepStack đưa các embedding patch từ nhiều lớp mã hóa vào các lớp ngôn ngữ đầu tương ứng thay vì thêm một biểu diễn duy nhất vào trước. Cách định vị mà Cohere đưa ra là một nền tảng nhỏ gọn để tạo nguyên mẫu và tinh chỉnh theo tác vụ cụ thể, với hiểu tài liệu là năng lực chủ lực. Thẻ mô hình tỏ ra thẳng thắn một cách bất thường về giới hạn: North Micro Vision Instruct rõ ràng không phải là một mô hình suy luận, không có khả năng gọi công cụ, và không được huấn luyện với prompt hệ thống.

Quần vợt thể thao có hình dạng đối lập ở mọi chiều. NVIDIA khởi đầu từ checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning của chính mình — một mô hình hỗn hợp chuyên gia lai Mamba2-Transformer, tổng cộng 31B với khoảng 3B hoạt động mỗi token — và tinh chỉnh nó trên một kho ngữ liệu quần vợt độc quyền, được dán nhãn thủ công. Bộ mã hóa thị giác (C-RADIOv4-H) và bộ mã hóa giọng nói (Parakeet) đều bị đóng băng; chỉ các tham số mô hình ngôn ngữ thay đổi. Kết quả là một mô hình có phạm vi hẹp theo thiết kế: nó trả lời các câu hỏi trắc nghiệm có cấu trúc và câu hỏi mở trên một clip trọn một điểm quần vợt, bao trùm cơ học cú đánh, vị trí trên sân, chuyển động của người chơi, dữ kiện trận đấu, kiến thức luật và tín hiệu âm thanh. NVIDIA mô tả nó hoạt động tốt nhất khi toàn bộ một điểm — từ giao bóng đến khi kết thúc pha bóng — được truyền làm đầu vào.

Những khía cạnh thực sự phân biệt chúng

• Tham số — North Micro Vision Instruct: 2,4B (2B ngôn ngữ, 400M thị giác). Sports Tennis: tổng cộng 31B, ~3B hoạt động trên mỗi token.

• Đầu vào — North Micro Vision Instruct: văn bản và hình ảnh xen kẽ, độ phân giải gốc, nhiều hình ảnh. Sports Tennis: video tối đa 2 phút, âm thanh tối đa một giờ, hình ảnh, văn bản.

• Đầu ra — cả hai đều trả về văn bản. {{1}}North Micro Vision Instruct{{/1}} còn trả về thêm các hộp bao định vị theo thang đo chuẩn hóa 0–1000.

• Ngôn ngữ — North Micro Vision Instruct: từ mười một trở lên, bao gồm tiếng Anh, tiếng Đức, tiếng Pháp, tiếng Tây Ban Nha, tiếng Ý, tiếng Bồ Đào Nha, tiếng Hindi, tiếng Nhật, tiếng Hàn, tiếng Trung và tiếng Ả Rập. Thể thao Quần vợt: chỉ tiếng Anh.

• Ngữ cảnh — North Micro Vision Instruct: một backbone ngôn ngữ 128K token, nhưng Cohere gắn cờ phạm vi đa phương thức đã được xác thực là tối đa 8K token, với các ngữ cảnh đa phương thức dài hơn phụ thuộc vào ngoại suy và chưa được đánh giá chuẩn. Thể thao Quần vợt: tối đa 256k token.

• Mức sử dụng bộ nhớ — North Micro Vision Instruct: khoảng 4,97 GB ở BF16, ước chừng 2,17 GB ở 4-bit. Sports Tennis: khoảng 62 GB ở BF16, cần một GPU 80 GB.

• Giấy phép — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, với thẻ ghi rõ việc sử dụng cho mục đích thương mại và phi thương mại.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Điểm chuẩn: một mô hình có chúng, mô hình kia có một giao thức

Đây là điểm mà hai thẻ không thể khác nhau hơn về tư thế.

Cohere công bố các con số cho North Micro Vision Instruct. DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 — và MMMU 0.329. Tất cả đều do nhà cung cấp báo cáo, không có con số nào được tái lập độc lập, và chính Cohere cũng lưu ý rằng kết quả OCR thay đổi rõ rệt tùy theo split. Con số cuối cùng đó đáng để dừng lại suy ngẫm: điểm MMMU 0.329 là thấp, và nó nhất quán với mọi thứ khác mà thẻ mô hình nói về thiết kế của mô hình. Đây là một mô hình chuyên về đọc hiểu, không phải một mô hình suy luận tổng quát, và chính công ty đã tạo ra nó cũng nói như vậy. Kiểu công bố minh bạch như thế hữu ích hơn một con số được tô hồng.

NVIDIA không công bố gì cả. Thẻ Sports Tennis mô tả kỹ lưỡng cách đánh giá của nó — một phân vùng kiểm thử gồm 12 trận đấu được giữ tách biệt hoàn toàn, 2.689 clip ở cấp điểm và 80.872 câu hỏi từ các trận đấu không trùng lặp với huấn luyện, được chấm bằng độ chính xác trắc nghiệm tự động và pass@9 do LLM làm giám khảo trên các phản hồi mở, với phần chia tách các trận đã thấy được loại trừ rõ ràng khỏi kiểm thử được báo cáo — rồi không báo cáo kết quả nào từ bất kỳ phần nào trong đó. Phía huấn luyện cũng chi tiết không kém: 1.312.129 ví dụ hỏi đáp, 1.226.081 ví dụ trắc nghiệm và 86.048 ví dụ mở, được rút ra từ 43.084 clip ở cấp điểm trải khắp 239 trận đấu, được gán nhãn theo 38 hạng mục chú thích.

Ngay cả khi NVIDIA đã công bố điểm số, chúng cũng sẽ không thể so sánh được. Không có benchmark nào mà ở đó cả một mô hình hiểu tài liệu và một mô hình tính điểm quần vợt đều xuất hiện. Mức độ trùng lặp giữa hai câu chuyện đánh giá này là bằng không.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Triển khai: nơi khác biệt thực tiễn thể hiện

Mô hình 2.4B là thứ dễ vận hành hơn hẳn. Khoảng 5 GB trọng số BF16 nghĩa là một GPU máy trạm hiện đại duy nhất có thể xử lý nó, và bản dựng 4-bit ở khoảng 2.17 GB thậm chí còn nhỏ hơn nữa. Đã có các bản chuyển độc lập cho runtime Core AI của Apple, với báo cáo đạt ~18.2 token/giây ở int8 trên iPhone 17 Pro, còn lượng tử hóa int4 thì thất bại hoàn toàn. Điểm rắc rối nằm ở phần mềm: North Micro Vision Instruct yêu cầu Transformers 5.16.0 — có thể cài từ mã nguồn cho đến khi nó lên PyPI — và hỗ trợ vLLM công khai vẫn được mô tả là sắp ra mắt trên thẻ mô hình. Việc tinh chỉnh được hỗ trợ thông qua Axolotl. Không có API lưu trữ chính chủ; con đường thực tế là tự lưu trữ.

Sports Tennis là thứ khó vận hành hơn, và không có cách nào lách được điều đó. Một GPU 80 GB ở BF16, không có checkpoint lượng tử hóa nào được công bố, chỉ tiếng Anh, chỉ Linux, chạy trên PyTorch/Transformers hoặc NeMo hoặc Megatron. NVIDIA đã thử nghiệm trên A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor và RTX 5090 — một danh sách phần cứng nói lên nhiều hơn về những gì NVIDIA muốn kiểm chứng so với những gì một đội ngũ bình thường có thể trang bị. Chính sách suy luận mặc định của card cũng rất sơ sài: 2 khung hình mỗi giây tối đa 128 khung hình, 256 token mới, giải mã tham lam.

Không mô hình nào được phục vụ trên OrcaRouter. North Micro Vision Instruct không có endpoint first-party và không nằm trong danh mục của chúng tôi; Sports Tennis không có endpoint ở bất kỳ đâu, vì NVIDIA đã công bố trọng số và không có dịch vụ được host. Cả hai đều là quyết định tự host.

Điểm mà một lớp định tuyến thực sự hữu ích chính là pipeline xung quanh chúng — dù bạn chạy cái nào trong số này cục bộ, thì các mô hình phiên âm, tóm tắt, truy xuất và ứng dụng bao quanh nó đều được host, và việc đặt những thứ đó phía sau một khóa API với cơ chế chuyển đổi dự phòng tự độnggiúp tránh phải dựng một bộ thông tin xác thực và hợp đồng riêng cho từng cái. Chúng tôi chuyển nguyên giá niêm yết của nhà cung cấp với mức markup 0% đối với các mô hình mà chúng tôi thực sự có cung cấp, nên những phần của stack mà bạn không tự host vẫn giữ nguyên giá của nhà cung cấp.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Khi sự lựa chọn là thật

Có một tình huống mà việc chọn giữa hai thứ này là một quyết định thực sự, và đáng để nói cụ thể về điều đó vì nó không hề hiển nhiên.

Đây là trường hợp của một tổ chức truyền thông hoặc thể thao vốn đã xử lý tài liệu và muốn bổ sung khả năng hiểu video ở cấp độ điểm. Một đài truyền hình với quy trình lưu trữ, một giải đấu với các báo cáo trận đấu và PDF thống kê, một đơn vị nắm giữ bản quyền với cả văn bản lẫn tư liệu hình ảnh — đối với họ, North Micro Vision Instruct có khả năng đã nằm trong hệ thống cho OCR và trích xuất biểu đồ, còn Sports Tennis là năng lực mới mà họ sẽ bổ sung. Câu hỏi không phải là "cái nào" mà là "cái thứ hai khiến tôi tốn kém gì về hạ tầng", và câu trả lời là một GPU trung tâm dữ liệu cùng một ràng buộc chỉ dùng tiếng Anh.

Ngoài trường hợp đó, các mô hình đơn giản là không cạnh tranh với nhau. Nếu bạn cần đọc tài liệu bằng mười một ngôn ngữ trên một card máy trạm, North Micro Vision Instruct là câu trả lời và Sports Tennis không liên quan đến bạn. Nếu bạn cần đặt những câu hỏi có cấu trúc về các điểm tennis với ngữ cảnh âm thanh, Sports Tennis là mô hình duy nhất trong hai mô hình làm được điều đó, và việc nó thiếu các benchmark được công bố là một rủi ro mà bạn sẽ chấp nhận chứ không phải là lý do để chọn mô hình kia.

Nên chọn cái nào

Chọn North Micro Vision Instruct nếu công việc của bạn liên quan đến tài liệu, biểu đồ, OCR, grounding hoặc hiểu hình ảnh đa ngôn ngữ, và nếu bạn coi trọng một nhà cung cấp công bố cả những con số yếu lẫn những con số mạnh của mình. Nó nhỏ gọn, Apache 2.0, được ghi tài liệu đầy đủ và trung thực về việc không phải là một mô hình suy luận. MMMU 0.329 của nó không phải là khuyết điểm mà bạn phát hiện sau này; Cohere nói rõ với bạn ngay từ đầu.

Chỉ chọn NVIDIA NemotronLabs AI for Media - Sports Tennis nếu bạn thực sự cần suy luận quần vợt ở cấp độ điểm với âm thanh, bạn có một GPU 80 GB dư dùng, và bạn thấy thoải mái khi là người đầu tiên đánh giá nó. Chưa ai công bố điểm số cho mô hình này, nên việc tải xuống chính là thử nghiệm. Đó không phải là lý do để tránh nó — một chuyên gia hẹp với tập huấn luyện gồm 43.084 clip được dán nhãn tỉ mỉ đúng là kiểu mô hình có thể đánh bại một mô hình tổng quát trong chính nhiệm vụ của nó — nhưng đó là lý do để coi lần triển khai đầu tiên như một thử nghiệm thay vì một cam kết.

Điều duy nhất bạn không nên làm là coi chúng là thay thế được cho nhau chỉ vì cả hai đều ghi “vision-language model” trên thẻ. Một trình đọc tài liệu và một nhà phân tích quần vợt chưa bao giờ là cùng một sản phẩm, và trong cặp này, khác biệt về những gì chúng làm lớn hơn nhiều so với khác biệt về mức độ chúng làm những việc đó tốt đến đâu.