Một thẻ hero được tạo tự động so sánh NVIDIA NemotronLabs AI for Media - Sports Tennis và Microsoft Mage-VL, hiển thị một clip điểm tennis có giới hạn ở một bên và một dải phim liên tục với điểm đánh dấu sự kiện được làm nổi bật ở bên kia, cùng với ba chip đối chiếu ghi clip so với luồng, không có điểm số được công bố so với điểm số SoccerNet, và mức sàn 80 GB so với mức sàn 16 GB, và logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

Nemotron Sports Tennis vs Microsoft Mage-VL: Hai cách để đọc một chương trình phát sóng thể thao

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Microsoft Mage-VL có một con số để dẫn ra: trên benchmark thời gian phản hồi SoccerNet, nó đạt TimVal 55,54 và PR-AUC 9,30, tốt nhất trên các chỉ số nhạy cảm với precision dù chưa từng được huấn luyện trên tập dữ liệu đó, và các tác giả của nó chứng minh nó ngồi xem suốt một buổi phát sóng World Cup 2026, vẫn im lặng cho đến 29,36 giây, khi một cầu thủ bứt phá và mô hình tung ra bình luận trực tiếp. NVIDIA NemotronLabs AI for Media - Sports Tennis hoàn toàn không có con số nào. Đây là một mô hình đa phương thức 31B được tinh chỉnh trên 43.084 clip pha bóng quần vợt, do NVIDIA công bố vào tháng 9 năm 2026 với đầy đủ quy trình đánh giá trên model card của nó và không có một kết quả nào từ đó.

Vậy nên đây không phải là một cuộc đối đầu mà bạn có thể chấm điểm. Dù sao thì đó vẫn là một so sánh thực sự hữu ích, bởi vì hai mô hình trả lời cùng một câu hỏi — liệu một mô hình thị giác-ngôn ngữ có thể theo dõi thể thao trực tiếp hay không — bằng những đặt cược kiến trúc trái ngược nhau, và một trong những đặt cược đó được chống đỡ bằng bằng chứng trong khi cái kia được chống đỡ bằng một mô tả dữ liệu. Sự bất đối xứng đó chính là bài viết.

Ngã rẽ: một luồng, hay một clip

Sự khác biệt về thiết kế quan trọng hơn số lượng tham số, và nó giải thích gần như mọi thứ khác về hai mô hình này.

Microsoft Mage-VL được xây dựng xoay quanh video liên tục. Bộ mã hóa thị giác của nó, Mage-ViT, được huấn luyện từ đầu và đọc video theo cách một codec làm: nó chia luồng thành các khung neo (I), được giữ nguyên vẹn, và các khung được dự đoán (P), trong đó chỉ những patch mang chuyển động thực sự hoặc chi tiết mới được giữ lại, trên một lưới patch 16×16 dùng chung. Điều đó cắt giảm hơn 75% token thị giác và, theo Microsoft, mang lại tốc độ suy luận nhanh hơn tối đa 3,5× theo đồng hồ thực tế so với việc lấy mẫu khung đồng đều. Trên hết là sự phân tách System 1 / System 2: một cổng nhận thức nhẹ chấm điểm từng cửa sổ trượt và im lặng với nội dung thông thường, chỉ gọi mô hình đầy đủ khi một sự kiện đáng phản hồi hoàn tất. Đó là một mô hình đảm nhiệm cả hai nhiệm vụ, không phải một pipeline.

Mô hình quần vợt của NVIDIA lại đặt cược theo hướng hoàn toàn khác. Thẻ mô hình của nó nói rõ rằng nó “hoạt động tốt nhất khi toàn bộ clip một điểm quần vợt được truyền vào làm đầu vào” — từ giao bóng đến hết pha bóng, tối đa hai phút mp4, kèm âm thanh. Chính sách suy luận mặc định là 2 khung hình mỗi giây, tối đa 128 khung hình, 256 token mới, giải mã tham lam, video cộng âm thanh. Không có cổng gác, không có chế độ truyền phát, không có kích hoạt sự kiện. Đây là một mô hình hỏi–đáp trên một clip có độ dài giới hạn: bạn đưa nó một điểm, bạn hỏi chuyện gì đã xảy ra, nó nói cho bạn biết.

Đó không phải là hai cách triển khai của cùng một ý tưởng. Nhận thức dạng luồng và suy luận cấp clip là những sản phẩm khác nhau. Một đài truyền hình muốn có bình luận trực tiếp cần hình dạng của Mage-VL. Một nhà phân tích muốn truy vấn một kho lưu trữ gồm 43.084 điểm cần hình dạng của Sports Tennis. Không mô hình nào có thể thay thế trực tiếp cho công việc của mô hình kia.

Cả hai đều được xây dựng trên một xương sống lai — với một điểm khác biệt quan trọng

• Tham số — Sports Tennis: tổng cộng 31B, khoảng 3B hoạt động mỗi token, MoE lai Mamba2-Transformer. Mage-VL: tổng cộng 4B, một Mage-ViT 316M kết hợp với bộ giải mã Qwen3-4B-Instruct-2507.

• Bộ mã hóa — Sports Tennis đóng băng cả bộ mã hóa thị giác C-RADIOv4-H và bộ mã hóa giọng nói Parakeet và chỉ tinh chỉnh các tham số của mô hình ngôn ngữ. Mage-VL huấn luyện toàn bộ chồng thị giác của nó từ đầu trên khoảng 100 triệu hình ảnh và video không gán nhãn, với mô hình ngôn ngữ Qwen3 là thành phần duy nhất được tiền huấn luyện.

• Âm thanh — Sports Tennis coi âm thanh là đầu vào hạng nhất và liệt kê diễn giải tín hiệu âm thanh trong số 38 danh mục chú thích của mình. Pipeline được công bố của Mage-VL là thị giác; còn công trình SoccerNet nói về định thời phản hồi trên các khung hình.

• Đầu ra phương thức — cả hai chỉ tạo ra văn bản.

• Hiệu ứng số nhân — vì Mage-ViT có chi phí tiền huấn luyện rẻ hơn so với một tháp thị giác quy mô web, Microsoft báo cáo việc huấn luyện trên video dài hơn gấp 8 lần với cùng ngân sách. Thay vào đó, tuyên bố về hiệu quả của NVIDIA mang tính kiến trúc: 3 tỷ tham số hoạt động mỗi token trong tổng số 31 tỷ.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

Nơi bằng chứng nằm

Đây là phần của sự so sánh mà không hề sát nút, và điều đó đáng được nói thẳng ra.

Microsoft Mage-VL là một mô hình đã được công bố, với báo cáo kỹ thuật, trang dự án, kho GitHub và một loạt benchmark trải rộng bao quát hiểu hình ảnh, hiểu video, định vị thời gian, suy luận không gian và streaming. So với Qwen3-VL-4B — cùng backbone ngôn ngữ 4B, chỉ thay bộ mã hóa thị giác — Mage-VL cải thiện trên mọi benchmark video và định vị thời gian được báo cáo, với mức tăng lớn nhất ở các tác vụ nặng về định vị: +22,5 trên Timelens-QVHighlight, +17,1 trên ActivityNet, +11,0 trên VSI-Bench, +24,5 trên VideoEval-Pro. Nó báo cáo DocVQA 95,14, MMStar 67,32 và CrossPoint 80,00 ở phần hình ảnh, VideoMME 64,0 và LongVideoBench 61,3 ở video, và điểm tổng thể 64,00 trên OVO-Bench trong số các kiến trúc streaming. Tất cả những con số đó đều do Microsoft báo cáo và chưa có con số nào được tái lập độc lập — nhưng chúng tồn tại, chúng rất nhiều, và chúng nhất quán nội bộ trên một tập tác vụ rộng bất thường.

Sports Tennis không báo cáo kết quả nào. Thẻ mô hình của nó ghi lại một phân vùng kiểm thử gồm 12 trận hoàn toàn được giữ kín với 2.689 clip ở cấp điểm và 80.872 câu hỏi, mô tả cách chấm điểm bằng độ chính xác trắc nghiệm tự động và LLM-as-judge pass@9, lưu ý rằng chỉ phần chia tách gồm các trận chưa từng thấy mới được dùng cho kiểm thử được báo cáo — rồi sau đó không công bố kết quả nào. Kho ngữ liệu huấn luyện của nó là có thật và cụ thể: 1.312.129 ví dụ hỏi đáp, 1.226.081 câu trắc nghiệm và 86.048 câu hỏi mở, từ 43.084 clip thuộc 239 trận, được gán nhãn theo 38 danh mục chú thích từ cảnh quay phát sóng và ghi hình sân đấu năm 2025. Không có thông tin nào trong số đó có thể được kiểm chứng từ bên ngoài, và những con số có thể giúp kiểm chứng nó thì lại đang thiếu.

Một lưu ý lại đi theo hướng ngược lại, và đáng được nêu rõ để điều này không bị hiểu như một thắng lợi trọn vẹn cho Microsoft. SoccerNet không phải quần vợt. Uy tín phát trực tuyến của Mage-VL đến từ dữ liệu phát sóng bóng đá theo một giao thức cụ thể, và màn trình diễn tại World Cup 2026 của nó chỉ là một màn trình diễn. Liệu cổng gốc codec có chuyển giao gọn gàng sang quần vợt hay không — nơi các điểm ngắn, thường xuyên và có cấu trúc chặt chẽ — vẫn chưa được kiểm chứng. Điểm khác biệt là tuyên bố của Mage-VL ít nhất có thể bị bên thứ ba chứng minh là sai, còn tuyên bố của Sports Tennis thì không ai có thể chứng minh là sai nếu không có bộ dữ liệu của NVIDIA.

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

Những gì cần thiết để vận hành chúng

Khoảng cách ở đây là khoảng năm lần về phần cứng, và nó quyết định ai thực tế có thể thử từng mô hình.

• Sports Tennis — một GPU với khoảng 80 GB ở BF16, trọng số khoảng 62 GB. Mức tối thiểu là A100 80GB hoặc H100 80GB, khuyến nghị dùng B200 hoặc H200. Không có checkpoint lượng tử hóa nào được công bố, nên không có con đường rẻ hơn để hạ cấp. Chỉ hỗ trợ tiếng Anh. Môi trường chạy là PyTorch/Transformers cùng với NeMo và Megatron.

• Mage-VL — khoảng 10,6 GB ở BF16, nghĩa là GPU 16 GB là mức tối thiểu thực tế để xử lý hình ảnh, còn 24 GB trở lên cho video dài và phát trực tuyến. Apache-2.0 dành cho Mage-VL và MIT dành cho Mage-ViT, tuy nhiên kho lưu trữ của dòng mô hình này nêu rõ rằng các mô hình chỉ được phát hành cho mục đích nghiên cứu. Xin lưu ý những điểm gai góc: trust_remote_code là bắt buộc, hiện vẫn chưa có đường phục vụ nào cho vLLM hay SGLang, và pipeline codec cần FFmpeg hoặc ffprobe — trong đó đường neural-codec còn cần thêm DCVC-RT.

Nếu bạn muốn đánh giá một mô hình video thể thao trong tháng này trên một card workstation đơn lẻ, thì Mage-VL là mẫu duy nhất trong hai mẫu mà bạn thực sự có thể nạp được. Đó là một kết luận mang tính thực tiễn, ngay cả khi chưa có kết luận benchmark.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

Bạn sẽ chọn cái nào

Với bất kỳ thứ gì trực tiếp — bình luận, phát hiện sự kiện trên luồng đang chạy, cảnh báo độ trễ thấp trên video phát sóng — Microsoft Mage-VL là lựa chọn có thể bảo vệ được vào lúc này: nó được thiết kế chính xác cho việc đó, nó có điểm chuẩn streaming để lập luận ủng hộ, và nó vừa với phần cứng mà hầu hết các nhóm đã sở hữu. Với công việc nặng về lưu trữ, có dạng truy vấn, đối với quần vợt nói riêng — xây dựng một chỉ mục có thể tìm kiếm các điểm, chạy phân tích có cấu trúc trên hàng nghìn pha bóng qua lại, đặt câu hỏi mà toàn bộ clip điểm là đơn vị ý nghĩa — mô hình của NVIDIA là mô hình duy nhất trong hai mô hình được xây dựng cho việc đó. Liệu nó có làm tốt công việc hay không, tính đến tháng 9 năm 2026, thực sự vẫn chưa được biết.

Còn một lựa chọn thứ ba đáng để gọi tên, vì đó là nơi mà hầu hết các pipeline thực tế đều kết thúc. Nếu bạn muốn thử mô hình chuyên biệt chưa được kiểm chứng mà không đặt cược cả một luồng production vào nó, hãy giữ nó phía sau cùng một giao diện như những mô hình bạn tin cậy. OrcaRouter không cung cấp mô hình nào trong hai cái này — NVIDIA công bố trọng số mà không có endpoint, còn Mage-VL không có đường phục vụ được host sẵn — nên cả hai đều là quyết định tự host. Điều mà một khóa duy nhất bao phủ hơn 200 mô hình được host mang lại cho bạn là phần còn lại của stack: các mô hình phiên âm, tóm tắt và ứng dụng xung quanh thành phần video thể thao vẫn nằm sau một endpoint duy nhất, với khả năng chuyển đổi dự phòng tự động nếu một nhà cung cấp bị suy giảm, và hai mô hình chuyên biệt mà bạn tự chạy là những thành phần động duy nhất bạn phải tự quản.

Bản án

Microsoft Mage-VL và NVIDIA NemotronLabs AI for Media - Sports Tennis không phải là đối thủ theo nghĩa mà một trang so sánh đối đầu thường muốn nói. Mage-VL là một mô hình streaming 4B đã được công bố, đã được đánh giá benchmark, chạy trên máy trạm và có một bản demo thực tế về bình luận thể thao được kích hoạt theo sự kiện. Sports Tennis là một mô hình chuyên dụng cấp clip 31B, chưa được công bố, chưa được đánh giá benchmark, cần GPU trung tâm dữ liệu và không có bằng chứng công bố nào cho thấy nó hoạt động.

Xét về bằng chứng, Mage-VL thắng do đối phương bỏ cuộc. Xét về phạm vi, chúng không hề chồng lấn. Nhưng có một lý do để tiếp tục theo dõi mô hình của NVIDIA: một bản tinh chỉnh với encoder đóng băng trên 43.084 điểm tennis được gán nhãn chính xác đúng là kiểu tập huấn luyện dọc, hẹp và chất lượng cao mà các mô hình tổng quát không có, và nếu NVIDIA có công bố kết quả trên tập giữ lại, câu hỏi chuyên gia so với tổng quát trong video thể thao sẽ lần đầu có câu trả lời thực sự. Cho đến lúc đó, Mage-VL là mô hình có bằng chứng, còn Sports Tennis là mô hình có một lời hứa.