การ์ดฮีโร่ที่สร้างขึ้นซึ่งเปรียบเทียบ NVIDIA NemotronLabs AI for Media - Sports Tennis และ Microsoft Mage-VL โดยแสดงคลิปแต้มเทนนิสที่มีขอบเขตอยู่ด้านหนึ่ง และฟิล์มสตริปต่อเนื่องที่มีเครื่องหมายเหตุการณ์ที่ไฮไลต์อยู่อีกด้านหนึ่ง พร้อมชิปเปรียบเทียบสามชิ้นที่อ่านว่า คลิป vs สตรีม, ไม่มีคะแนนที่เผยแพร่ vs คะแนน SoccerNet, และค่าต่ำสุด 80 GB vs ค่าต่ำสุด 16 GB และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Nemotron Sports Tennis กับ Microsoft Mage-VL: สองวิธีในการอ่านการถ่ายทอดสดกีฬา

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Microsoft Mage-VL มีตัวเลขให้ชี้ได้: บนเกณฑ์มาตรฐานการจับเวลาการตอบสนองของ SoccerNet มันทำได้ TimVal 55.54 และ PR-AUC 9.30 ดีที่สุดในเมตริกที่ไวต่อความแม่นยำ (precision-sensitive) แม้ไม่เคยถูกฝึกบนชุดข้อมูลนั้น และผู้เขียนของมันสาธิตการที่มันนั่งดูการถ่ายทอดสดฟุตบอลโลก 2026 โดยเงียบไปจนถึงวินาทีที่ 29.36 เมื่อผู้เล่นบุกฝ่าแนวรับและโมเดลก็ปล่อยคำบรรยายสดทันที NVIDIA NemotronLabs AI for Media - Sports Tennis ไม่มีตัวเลขเลยแม้แต่ตัวเดียว มันเป็นโมเดลมัลติโมดัลขนาด 31B ที่ถูกไฟน์จูนบนคลิปแต้มเทนนิส 43,084 คลิป ซึ่ง NVIDIA เผยแพร่ในเดือนกันยายน 2026 พร้อมโปรโตคอลการประเมินแบบครบถ้วนบนการ์ดของโมเดล และไม่มีผลลัพธ์แม้แต่รายการเดียวจากโปรโตคอลนั้น

ดังนั้นนี่จึงไม่ใช่การเปรียบเทียบแบบตัวต่อตัวที่คุณให้คะแนนได้ แต่มันก็ยังเป็นการเปรียบเทียบที่มีประโยชน์จริง ๆ เพราะโมเดลทั้งสองตอบคำถามเดียวกัน — โมเดลภาษาภาพสามารถติดตามกีฬาสดได้หรือไม่ — ด้วยการเดิมพันเชิงสถาปัตยกรรมที่ตรงกันข้าม และหนึ่งในการเดิมพันนั้นมีหลักฐานรองรับ ขณะที่อีกการเดิมพันมีเพียงคำอธิบายข้อมูลรองรับ ความไม่สมมาตรนั้นคือสิ่งที่บทความนี้พูดถึง

ทางแยก: สตรีม หรือ คลิป

ความแตกต่างด้านการออกแบบสำคัญกว่าจำนวนพารามิเตอร์ และมันอธิบายAlmostทุกสิ่งทุกอย่างเกี่ยวกับสองโมเดลนี้

Microsoft Mage-VL ถูกสร้างขึ้นโดยอิงกับวิดีโอต่อเนื่อง ตัวเข้ารหัสภาพของมันอย่าง Mage-ViT ถูกฝึกตั้งแต่ต้นและอ่านวิดีโอแบบเดียวกับที่โคเดกทำ คือแบ่งสตรีมออกเป็นเฟรมหลัก (I) ซึ่งเก็บไว้ทั้งหมด และเฟรมที่ทำนาย (P) โดยเก็บเฉพาะแพตช์ที่มีการเคลื่อนไหวจริงหรือรายละเอียดใหม่ไว้ บนกริดแพตช์ขนาด 16×16 ที่ใช้ร่วมกัน วิธีนี้ลดโทเค็นภาพได้มากกว่า 75% และจากข้อมูลของ Microsoft ให้ความเร็วในการอนุมานตามเวลาจริงสูงสุดถึง 3.5 เท่า เมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ นอกจากนั้นยังมีการแยก System 1 / System 2 โดยเกตการรับรู้ขนาดเบาจะให้คะแนนแต่ละหน้าต่างเลื่อน และเงียบต่อเนื้อหาตามปกติ โดยเรียกใช้โมเดลเต็มรูปแบบเฉพาะเมื่อเหตุการณ์ที่ควรค่าแก่การตอบสนองจบลงเท่านั้น มันเป็นโมเดลเดียวที่ทำงานทั้งสองอย่าง ไม่ใช่ไปป์ไลน์

โมเดลเทนนิสของ NVIDIA เดินคนละเส้นทางโดยสิ้นเชิง การ์ดของมันระบุชัดเจนว่า "ทำงานได้ดีที่สุดเมื่อป้อนคลิปคะแนนเทนนิสเต็ม ๆ เป็นอินพุต" — ตั้งแต่เสิร์ฟจนจบการแรลลี่ นานถึงสองนาทีในรูปแบบ mp4 พร้อมเสียง นโยบายการอนุมานเริ่มต้นคือ 2 เฟรมต่อวินาที สูงสุด 128 เฟรม, 256 โทเค็นใหม่, การถอดรหัสแบบ greedy, วิดีโอพร้อมเสียง ไม่มีเกต ไม่มีโหมดสตรีมมิ่ง ไม่มีทริกเกอร์เหตุการณ์ มันเป็นโมเดลตอบคำถามบนคลิปที่มีขอบเขตจำกัด: คุณป้อนคะแนนหนึ่งแต้มให้มัน คุณถามว่าเกิดอะไรขึ้น มันก็บอกคุณ

สองสิ่งนี้ไม่ใช่สองวิธีนำแนวคิดเดียวกันไปใช้ การรับรู้แบบสตรีมมิ่งและการให้เหตุผลระดับคลิปเป็นผลิตภัณฑ์ที่แตกต่างกัน ผู้แพร่ภาพที่ต้องการคำบรรยายสดจำเป็นต้องใช้รูปแบบของ Mage-VL นักวิเคราะห์ที่ต้องการสืบค้นคลังข้อมูล 43,084 พอยต์จำเป็นต้องใช้รูปแบบของ Sports Tennis ไม่มีโมเดลใดใช้แทนกันได้ทันทีสำหรับงานของอีกฝ่าย

ทั้งสองสร้างขึ้นบนแบ็กโบนแบบไฮบริด — โดยมีความแตกต่างสำคัญหนึ่งประการ

• พารามิเตอร์ — Sports Tennis: ทั้งหมด 31B โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 3B ต่อโทเคน เป็น MoE แบบไฮบริด Mamba2-Transformer Mage-VL: ทั้งหมด 4B เป็น Mage-ViT ขนาด 316M ที่จับคู่กับดีโคเดอร์ Qwen3-4B-Instruct-2507

• ตัวเข้ารหัส — Sports Tennis ตรึงทั้งตัวเข้ารหัสภาพ C-RADIOv4-H และตัวเข้ารหัสเสียง Parakeet และปรับแต่งเฉพาะพารามิเตอร์ของโมเดลภาษาเท่านั้น Mage-VL ฝึกสแตกการมองเห็นทั้งหมดของตนตั้งแต่เริ่มต้นบนภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ โดยมีโมเดลภาษา Qwen3 เป็นองค์ประกอบเดียวที่ผ่านการฝึกมาก่อน

• เสียง — Sports Tennis มองเสียงเป็นอินพุตระดับสำคัญและจัดให้การตีความสัญญาณเสียงอยู่ในหนึ่งใน 38 หมวดหมู่คำอธิบายประกอบของตน ไปป์ไลน์ที่เผยแพร่ของ Mage-VL เป็นแบบภาพ งานของ SoccerNet เกี่ยวกับการจับเวลาการตอบสนองบนเฟรม

• โมดัลลิตีขาออก — ทั้งคู่ให้ผลลัพธ์เป็นข้อความเท่านั้น

• เอฟเฟกต์ตัวคูณ — เนื่องจาก Mage-ViT มีต้นทุนการฝึกก่อน (pretrain) ที่ถูกกว่าหอคอยวิสัยทัศน์ระดับเว็บ Microsoft รายงานว่าฝึกบนวิดีโอได้นานขึ้น 8 เท่าภายใต้งบประมาณเดียวกัน ข้ออ้างเรื่องประสิทธิภาพของ NVIDIA เป็นเชิงสถาปัตยกรรมแทน: พารามิเตอร์ที่ใช้งาน 3B ต่อโทเคน จากทั้งหมด 31B

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs Microsoft Mage-VL — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Design clip-at-a-time, Audio first-class input, Published scores none, GPU floor about 80 GB. Right column lists Release July 2026, Parameters 4B, Design codec-native streaming with an event gate, Audio not in the published pipeline, Published scores SoccerNet TimVal 55.54 and PR-AUC 9.30, GPU floor about 16 GB. Footer reads 'NVIDIA figures from its model card with no published results; Microsoft figures vendor-reported.'

ที่ซึ่งหลักฐานตั้งอยู่

นี่คือส่วนของการเปรียบเทียบที่ไม่ได้ใกล้เคียงกันเลย และเป็นเรื่องที่ควรกล่าวอย่างตรงไปตรงมา

Microsoft Mage-VL เป็นโมเดลที่เผยแพร่แล้ว โดยมีรายงานทางเทคนิค หน้าโปรเจกต์ ที่เก็บ GitHub และชุดเบนช์มาร์กที่ครอบคลุมความเข้าใจภาพ ความเข้าใจวิดีโอ การระบุตำแหน่งเชิงเวลา การให้เหตุผลเชิงพื้นที่ และสตรีมมิ่ง เมื่อเทียบกับ Qwen3-VL-4B — ซึ่งใช้แกนภาษา 4B เดียวกัน โดยสลับเฉพาะตัวเข้ารหัสภาพ — Mage-VL ดีขึ้นบนทุกเบนช์มาร์กด้านวิดีโอและการระบุตำแหน่งเชิงเวลาที่รายงาน โดยได้กำไรสูงสุดในงานที่เน้นการระบุตำแหน่ง: +22.5 บน Timelens-QVHighlight, +17.1 บน ActivityNet, +11.0 บน VSI-Bench, +24.5 บน VideoEval-Pro โดยรายงาน DocVQA 95.14, MMStar 67.32 และ CrossPoint 80.00 ในด้านภาพ, VideoMME 64.0 และ LongVideoBench 61.3 ในด้านวิดีโอ และคะแนนรวม 64.00 บน OVO-Bench ในกลุ่มสถาปัตยกรรมแบบสตรีมมิ่ง ทั้งหมดนี้เป็นผลที่ Microsoft รายงาน และยังไม่มีใครทำซ้ำได้อย่างอิสระ — แต่ผลเหล่านี้มีอยู่จริง มีจำนวนมาก และมีความสอดคล้องกันภายในครอบคลุมชุดงานที่กว้างอย่างผิดปกติ

Sports Tennis ไม่รายงานผลลัพธ์อะไรเลย การ์ดของมันบันทึกพาร์ทิชันทดสอบของ 12 แมตช์ที่กันออกไว้ทั้งหมด พร้อมคลิประดับแต้ม 2,689 คลิปและคำถาม 80,872 ข้อ อธิบายการให้คะแนนด้วยความแม่นยำแบบปรนัยอัตโนมัติและ LLM-as-judge pass@9 ระบุว่าใช้เฉพาะสปลิตแมตช์ที่ไม่เคยเห็นสำหรับการทดสอบที่รายงานไว้ แล้วก็ไม่เผยแพร่ผลลัพธ์ใด ๆ คอร์ปัสการฝึกของมันเป็นของจริงและเจาะจง: ตัวอย่างถาม-ตอบ 1,312,129 รายการ เป็นแบบปรนัย 1,226,081 และแบบปลายเปิด 86,048 จาก 43,084 คลิป ครอบคลุม 239 แมตช์ ติดป้ายตาม 38 หมวดหมู่คำอธิบายประกอบจากฟุตเทจถ่ายทอดและฟุตเทจบันทึกจากคอร์ตปี 2025 ไม่มีสิ่งใดในนั้นที่ตรวจสอบยืนยันได้จากภายนอก และตัวเลขที่จะทำให้ตรวจสอบยืนยันได้ก็หายไป

มีข้อแม้หนึ่งข้อที่ให้ผลตรงกันข้าม และควรเอ่ยถึงไว้เพื่อไม่ให้เรื่องนี้อ่านเป็นชัยชนะแบบหมดจดของ Microsoft. SoccerNet ไม่ใช่เทนนิส ความน่าเชื่อถือด้านสตรีมมิงของ Mage-VL มาจากข้อมูลการถ่ายทอดฟุตบอลภายใต้โปรโตคอลเฉพาะ และการสาธิต World Cup 2026 ของมันก็เป็นเพียงการสาธิต ว่าเกตแบบ codec-native จะถ่ายโอนไปยังเทนนิสได้อย่างราบรื่นหรือไม่ — ซึ่งเทนนิสมีแต้มที่สั้น เกิดบ่อย และมีโครงสร้างหนาแน่น — ยังไม่ได้รับการทดสอบ ความแตกต่างคือ ข้อกล่าวอ้างของ Mage-VL อย่างน้อยก็สามารถถูกพิสูจน์ว่าผิดได้โดยบุคคลที่สาม ส่วนข้อกล่าวอ้างของ Sports Tennis นั้นไม่มีใครสามารถพิสูจน์ว่าผิดได้หากไม่มีชุดข้อมูลของ NVIDIA

A screenshot of the Hugging Face model card for microsoft/Mage-VL, captured September 11, 2026, showing the model described as a codec-native proactive-streaming multimodal foundation model at 4B scale, the claim that codec-aligned sparsity cuts visual tokens by over 75% and yields up to 3.5x wall-clock inference speedup, the pairing of Mage-ViT with a Qwen3-4B-Instruct-2507 decoder, and the SoccerNet streaming table listing Mage-VL-4B at TriggerAcc 79.21, TimVal 55.54, F1 16.35, ROC-AUC 83.14 and PR-AUC 9.30.

สิ่งที่ต้องใช้ในการดำเนินการกับพวกมัน

ช่องว่างตรงนี้อยู่ที่ประมาณห้าเท่าในด้านฮาร์ดแวร์ และมันเป็นตัวกำหนดว่าใครจะลองใช้แต่ละโมเดลได้จริง ๆ บ้าง

• Sports Tennis — ใช้ GPU หนึ่งตัวที่มี VRAM ประมาณ 80 GB เมื่อใช้ BF16 โดยมีน้ำหนักโมเดลประมาณ 62 GB A100 80GB หรือ H100 80GB เป็นสเปกขั้นต่ำ แนะนำ B200 หรือ H200 ยังไม่มีการเผยแพร่เช็กพอยต์แบบควอนไทซ์ จึงไม่มีทางเลือกที่ถูกกว่าในการลดสเปก รองรับเฉพาะภาษาอังกฤษ รันไทม์คือ PyTorch/Transformers ร่วมกับ NeMo และ Megatron

• Mage-VL — ประมาณ 10.6 GB ที่ BF16 ซึ่งทำให้ GPU ขนาด 16 GB เป็นขั้นต่ำที่ใช้ได้จริงสำหรับงานด้านภาพ และ 24 GB หรือมากกว่าสำหรับวิดีโอความยาวมากและการสตรีมมิ่ง Apache-2.0 สำหรับ Mage-VL และ MIT สำหรับ Mage-ViT แม้ว่าที่เก็บโค้ดของตระกูลนี้ระบุว่าโมเดลเหล่านี้เผยแพร่เพื่อวัตถุประสงค์ด้านการวิจัยเท่านั้น โปรดสังเกตข้อจำกัดที่สำคัญ: trust_remote_code จำเป็นต้องใช้ ยังไม่มีเส้นทางสำหรับให้บริการผ่าน vLLM หรือ SGLang และไปป์ไลน์ตัวแปลงสัญญาณต้องใช้ FFmpeg หรือ ffprobe — โดยเส้นทางนิวรัลโคเดกยังต้องใช้ DCVC-RT เพิ่มเติม

ถ้าคุณต้องการประเมินโมเดลวิดีโอการกีฬาในเดือนนี้บนการ์ดเวิร์กสเตชันเพียงใบเดียว Mage-VL คือตัวเดียวในสองตัวนี้ที่คุณโหลดได้จริง นี่ถือเป็นคำตัดสินเชิงปฏิบัติ แม้จะยังไม่มีคำตัดสินจากเบนช์มาร์กก็ตาม

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input and text output, and a minimum GPU of one A100 80GB or H100 80GB, with the sidebar showing two downloads last month and no inference provider deployment.

อันไหนที่คุณจะเอื้อมหยิบ

สำหรับงานที่เป็นเรียลไทม์ทุกอย่าง — ทั้งการบรรยาย การตรวจจับเหตุการณ์บนฟีดที่กำลังทำงานอยู่ หรือการแจ้งเตือนที่มีความหน่วงต่ำบนวิดีโอออกอากาศ — Microsoft Mage-VL คือตัวเลือกที่ปกป้องได้ในวันนี้: มันถูกออกแบบมาเพื่อสิ่งนั้นโดยเฉพาะ มีเบนช์มาร์กด้านสตรีมมิ่งมาสนับสนุน และรันได้บนฮาร์ดแวร์ที่ทีมส่วนใหญ่มีอยู่แล้ว สำหรับงานที่เน้นคลังเก็บข้อมูลและมีลักษณะเป็นการค้นหา โดยเฉพาะกับเทนนิส — การสร้างดัชนีแต้มที่ค้นหาได้ การวิเคราะห์แบบมีโครงสร้างข้ามการแรลลี่หลายพันครั้ง การถามคำถามที่คลิปแต้มทั้งคลิปเป็นหน่วยของความหมาย — ในบรรดาสองตัวนี้ มีเพียงโมเดลของ NVIDIA เท่านั้นที่ถูกสร้างมาเพื่อสิ่งนั้น ส่วนว่ามันทำงานได้ดีเพียงใดนั้น ณ เดือนกันยายน 2026 ยังไม่เป็นที่ทราบกันอย่างแท้จริง

ยังมีตัวเลือกที่สามที่ควรค่าแก่การเอ่ยถึง เพราะมันคือจุดที่ไปป์ไลน์จริงส่วนใหญ่ลงเอย หากคุณอยากลองโมเดลเฉพาะทางที่ยังไม่ผ่านการพิสูจน์ โดยไม่เดิมพันเส้นทางการผลิตกับมัน ให้เก็บมันไว้หลังอินเทอร์เฟซเดียวกันกับโมเดลที่คุณเชื่อถือ OrcaRouter ไม่มีให้บริการทั้งสองตัวนี้ — NVIDIA เผยแพร่น้ำหนักโดยไม่มีเอนด์พอยต์ และ Mage-VL ไม่มีเส้นทางการให้บริการแบบโฮสต์ — ดังนั้นทั้งคู่จึงเป็นการตัดสินใจเรื่องการโฮสต์เอง สิ่งที่ คีย์เดียวที่ครอบคลุมโมเดลแบบโฮสต์กว่า 200 รายการมอบให้คุณคือส่วนที่เหลือของสแตก: โมเดลถอดเสียง สรุปความ และโมเดลแอปพลิเคชันรอบ ๆ องค์ประกอบวิดีโอเกี่ยวกับกีฬาจะอยู่หลังเอนด์พอยต์เดียว พร้อมการสลับสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง และโมเดลเฉพาะทางสองตัวที่คุณรันเองคือชิ้นส่วนที่เคลื่อนไหวเพียงอย่างเดียวที่คุณเป็นเจ้าของ

คำตัดสิน

Microsoft Mage-VL และ NVIDIA NemotronLabs AI for Media - Sports Tennis ไม่ใช่คู่แข่งกันในความหมายที่หน้าเปรียบเทียบแบบ versus โดยทั่วไปหมายถึง Mage-VL เป็นโมเดลสตรีมมิ่งขนาด 4B ที่เผยแพร่และผ่านการวัดประสิทธิภาพแล้ว ทำงานบนเวิร์กสเตชัน และมีเดโมจริงของการบรรยายกีฬาที่กระตุ้นตามเหตุการณ์ ส่วน Sports Tennis เป็นผู้เชี่ยวชาญระดับคลิปขนาด 31B ที่ยังไม่ประกาศเปิดตัวและยังไม่ผ่านการวัดประสิทธิภาพ ต้องใช้ GPU สำหรับดาต้าเซ็นเตอร์ และไม่มีหลักฐานเผยแพร่ใด ๆ ว่ามันทำงานได้จริง

หากตัดสินด้วยหลักฐาน Mage-VL ชนะโดยปริยาย หากตัดสินด้วยขอบเขต ทั้งสองก็ไม่ทับซ้อนกัน แต่ก็มีเหตุผลที่ควรจับตาโมเดลของ NVIDIA ต่อไป: การไฟน์จูนด้วยเอนโคเดอร์แบบแช่แข็งบนแต้มเทนนิส 43,084 แต้มที่ติดป้ายกำกับอย่างถูกต้อง คือชุดข้อมูลฝึกเฉพาะทางแนวตั้งที่แคบและมีคุณภาพสูงแบบที่โมเดลอเนกประสงค์ไม่มี และหาก NVIDIA เผยแพร่ผลลัพธ์จากชุดทดสอบที่กันไว้เมื่อไร คำถามว่าโมเดลเฉพาะทางกับโมเดลอเนกประสงค์แบบไหนดีกว่าในวิดีโอการกีฬาก็จะได้คำตอบจริงเป็นครั้งแรก จนกว่าจะถึงตอนนั้น Mage-VL คือโมเดลที่มีหลักฐานยืนยันผลงาน และ Sports Tennis คือโมเดลที่มีเพียงคำสัญญา

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube