
Nemotron Sports Tennis กับ Microsoft Mage-VL: สองวิธีในการอ่านการถ่ายทอดสดกีฬา
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Microsoft Mage-VL มีตัวเลขให้ชี้ได้: บนเกณฑ์มาตรฐานการจับเวลาการตอบสนองของ SoccerNet มันทำได้ TimVal 55.54 และ PR-AUC 9.30 ดีที่สุดในเมตริกที่ไวต่อความแม่นยำ (precision-sensitive) แม้ไม่เคยถูกฝึกบนชุดข้อมูลนั้น และผู้เขียนของมันสาธิตการที่มันนั่งดูการถ่ายทอดสดฟุตบอลโลก 2026 โดยเงียบไปจนถึงวินาทีที่ 29.36 เมื่อผู้เล่นบุกฝ่าแนวรับและโมเดลก็ปล่อยคำบรรยายสดทันที NVIDIA NemotronLabs AI for Media - Sports Tennis ไม่มีตัวเลขเลยแม้แต่ตัวเดียว มันเป็นโมเดลมัลติโมดัลขนาด 31B ที่ถูกไฟน์จูนบนคลิปแต้มเทนนิส 43,084 คลิป ซึ่ง NVIDIA เผยแพร่ในเดือนกันยายน 2026 พร้อมโปรโตคอลการประเมินแบบครบถ้วนบนการ์ดของโมเดล และไม่มีผลลัพธ์แม้แต่รายการเดียวจากโปรโตคอลนั้น
ดังนั้นนี่จึงไม่ใช่การเปรียบเทียบแบบตัวต่อตัวที่คุณให้คะแนนได้ แต่มันก็ยังเป็นการเปรียบเทียบที่มีประโยชน์จริง ๆ เพราะโมเดลทั้งสองตอบคำถามเดียวกัน — โมเดลภาษาภาพสามารถติดตามกีฬาสดได้หรือไม่ — ด้วยการเดิมพันเชิงสถาปัตยกรรมที่ตรงกันข้าม และหนึ่งในการเดิมพันนั้นมีหลักฐานรองรับ ขณะที่อีกการเดิมพันมีเพียงคำอธิบายข้อมูลรองรับ ความไม่สมมาตรนั้นคือสิ่งที่บทความนี้พูดถึง
ทางแยก: สตรีม หรือ คลิป
ความแตกต่างด้านการออกแบบสำคัญกว่าจำนวนพารามิเตอร์ และมันอธิบายAlmostทุกสิ่งทุกอย่างเกี่ยวกับสองโมเดลนี้
Microsoft Mage-VL ถูกสร้างขึ้นโดยอิงกับวิดีโอต่อเนื่อง ตัวเข้ารหัสภาพของมันอย่าง Mage-ViT ถูกฝึกตั้งแต่ต้นและอ่านวิดีโอแบบเดียวกับที่โคเดกทำ คือแบ่งสตรีมออกเป็นเฟรมหลัก (I) ซึ่งเก็บไว้ทั้งหมด และเฟรมที่ทำนาย (P) โดยเก็บเฉพาะแพตช์ที่มีการเคลื่อนไหวจริงหรือรายละเอียดใหม่ไว้ บนกริดแพตช์ขนาด 16×16 ที่ใช้ร่วมกัน วิธีนี้ลดโทเค็นภาพได้มากกว่า 75% และจากข้อมูลของ Microsoft ให้ความเร็วในการอนุมานตามเวลาจริงสูงสุดถึง 3.5 เท่า เมื่อเทียบกับการสุ่มเฟรมแบบสม่ำเสมอ นอกจากนั้นยังมีการแยก System 1 / System 2 โดยเกตการรับรู้ขนาดเบาจะให้คะแนนแต่ละหน้าต่างเลื่อน และเงียบต่อเนื้อหาตามปกติ โดยเรียกใช้โมเดลเต็มรูปแบบเฉพาะเมื่อเหตุการณ์ที่ควรค่าแก่การตอบสนองจบลงเท่านั้น มันเป็นโมเดลเดียวที่ทำงานทั้งสองอย่าง ไม่ใช่ไปป์ไลน์
โมเดลเทนนิสของ NVIDIA เดินคนละเส้นทางโดยสิ้นเชิง การ์ดของมันระบุชัดเจนว่า "ทำงานได้ดีที่สุดเมื่อป้อนคลิปคะแนนเทนนิสเต็ม ๆ เป็นอินพุต" — ตั้งแต่เสิร์ฟจนจบการแรลลี่ นานถึงสองนาทีในรูปแบบ mp4 พร้อมเสียง นโยบายการอนุมานเริ่มต้นคือ 2 เฟรมต่อวินาที สูงสุด 128 เฟรม, 256 โทเค็นใหม่, การถอดรหัสแบบ greedy, วิดีโอพร้อมเสียง ไม่มีเกต ไม่มีโหมดสตรีมมิ่ง ไม่มีทริกเกอร์เหตุการณ์ มันเป็นโมเดลตอบคำถามบนคลิปที่มีขอบเขตจำกัด: คุณป้อนคะแนนหนึ่งแต้มให้มัน คุณถามว่าเกิดอะไรขึ้น มันก็บอกคุณ
สองสิ่งนี้ไม่ใช่สองวิธีนำแนวคิดเดียวกันไปใช้ การรับรู้แบบสตรีมมิ่งและการให้เหตุผลระดับคลิปเป็นผลิตภัณฑ์ที่แตกต่างกัน ผู้แพร่ภาพที่ต้องการคำบรรยายสดจำเป็นต้องใช้รูปแบบของ Mage-VL นักวิเคราะห์ที่ต้องการสืบค้นคลังข้อมูล 43,084 พอยต์จำเป็นต้องใช้รูปแบบของ Sports Tennis ไม่มีโมเดลใดใช้แทนกันได้ทันทีสำหรับงานของอีกฝ่าย
ทั้งสองสร้างขึ้นบนแบ็กโบนแบบไฮบริด — โดยมีความแตกต่างสำคัญหนึ่งประการ
• พารามิเตอร์ — Sports Tennis: ทั้งหมด 31B โดยมีพารามิเตอร์ที่ทำงานจริงประมาณ 3B ต่อโทเคน เป็น MoE แบบไฮบริด Mamba2-Transformer Mage-VL: ทั้งหมด 4B เป็น Mage-ViT ขนาด 316M ที่จับคู่กับดีโคเดอร์ Qwen3-4B-Instruct-2507
• ตัวเข้ารหัส — Sports Tennis ตรึงทั้งตัวเข้ารหัสภาพ C-RADIOv4-H และตัวเข้ารหัสเสียง Parakeet และปรับแต่งเฉพาะพารามิเตอร์ของโมเดลภาษาเท่านั้น Mage-VL ฝึกสแตกการมองเห็นทั้งหมดของตนตั้งแต่เริ่มต้นบนภาพและวิดีโอที่ไม่มีป้ายกำกับประมาณ 100 ล้านรายการ โดยมีโมเดลภาษา Qwen3 เป็นองค์ประกอบเดียวที่ผ่านการฝึกมาก่อน
• เสียง — Sports Tennis มองเสียงเป็นอินพุตระดับสำคัญและจัดให้การตีความสัญญาณเสียงอยู่ในหนึ่งใน 38 หมวดหมู่คำอธิบายประกอบของตน ไปป์ไลน์ที่เผยแพร่ของ Mage-VL เป็นแบบภาพ งานของ SoccerNet เกี่ยวกับการจับเวลาการตอบสนองบนเฟรม
• โมดัลลิตีขาออก — ทั้งคู่ให้ผลลัพธ์เป็นข้อความเท่านั้น
• เอฟเฟกต์ตัวคูณ — เนื่องจาก Mage-ViT มีต้นทุนการฝึกก่อน (pretrain) ที่ถูกกว่าหอคอยวิสัยทัศน์ระดับเว็บ Microsoft รายงานว่าฝึกบนวิดีโอได้นานขึ้น 8 เท่าภายใต้งบประมาณเดียวกัน ข้ออ้างเรื่องประสิทธิภาพของ NVIDIA เป็นเชิงสถาปัตยกรรมแทน: พารามิเตอร์ที่ใช้งาน 3B ต่อโทเคน จากทั้งหมด 31B

ที่ซึ่งหลักฐานตั้งอยู่
นี่คือส่วนของการเปรียบเทียบที่ไม่ได้ใกล้เคียงกันเลย และเป็นเรื่องที่ควรกล่าวอย่างตรงไปตรงมา
Microsoft Mage-VL เป็นโมเดลที่เผยแพร่แล้ว โดยมีรายงานทางเทคนิค หน้าโปรเจกต์ ที่เก็บ GitHub และชุดเบนช์มาร์กที่ครอบคลุมความเข้าใจภาพ ความเข้าใจวิดีโอ การระบุตำแหน่งเชิงเวลา การให้เหตุผลเชิงพื้นที่ และสตรีมมิ่ง เมื่อเทียบกับ Qwen3-VL-4B — ซึ่งใช้แกนภาษา 4B เดียวกัน โดยสลับเฉพาะตัวเข้ารหัสภาพ — Mage-VL ดีขึ้นบนทุกเบนช์มาร์กด้านวิดีโอและการระบุตำแหน่งเชิงเวลาที่รายงาน โดยได้กำไรสูงสุดในงานที่เน้นการระบุตำแหน่ง: +22.5 บน Timelens-QVHighlight, +17.1 บน ActivityNet, +11.0 บน VSI-Bench, +24.5 บน VideoEval-Pro โดยรายงาน DocVQA 95.14, MMStar 67.32 และ CrossPoint 80.00 ในด้านภาพ, VideoMME 64.0 และ LongVideoBench 61.3 ในด้านวิดีโอ และคะแนนรวม 64.00 บน OVO-Bench ในกลุ่มสถาปัตยกรรมแบบสตรีมมิ่ง ทั้งหมดนี้เป็นผลที่ Microsoft รายงาน และยังไม่มีใครทำซ้ำได้อย่างอิสระ — แต่ผลเหล่านี้มีอยู่จริง มีจำนวนมาก และมีความสอดคล้องกันภายในครอบคลุมชุดงานที่กว้างอย่างผิดปกติ
Sports Tennis ไม่รายงานผลลัพธ์อะไรเลย การ์ดของมันบันทึกพาร์ทิชันทดสอบของ 12 แมตช์ที่กันออกไว้ทั้งหมด พร้อมคลิประดับแต้ม 2,689 คลิปและคำถาม 80,872 ข้อ อธิบายการให้คะแนนด้วยความแม่นยำแบบปรนัยอัตโนมัติและ LLM-as-judge pass@9 ระบุว่าใช้เฉพาะสปลิตแมตช์ที่ไม่เคยเห็นสำหรับการทดสอบที่รายงานไว้ แล้วก็ไม่เผยแพร่ผลลัพธ์ใด ๆ คอร์ปัสการฝึกของมันเป็นของจริงและเจาะจง: ตัวอย่างถาม-ตอบ 1,312,129 รายการ เป็นแบบปรนัย 1,226,081 และแบบปลายเปิด 86,048 จาก 43,084 คลิป ครอบคลุม 239 แมตช์ ติดป้ายตาม 38 หมวดหมู่คำอธิบายประกอบจากฟุตเทจถ่ายทอดและฟุตเทจบันทึกจากคอร์ตปี 2025 ไม่มีสิ่งใดในนั้นที่ตรวจสอบยืนยันได้จากภายนอก และตัวเลขที่จะทำให้ตรวจสอบยืนยันได้ก็หายไป
มีข้อแม้หนึ่งข้อที่ให้ผลตรงกันข้าม และควรเอ่ยถึงไว้เพื่อไม่ให้เรื่องนี้อ่านเป็นชัยชนะแบบหมดจดของ Microsoft. SoccerNet ไม่ใช่เทนนิส ความน่าเชื่อถือด้านสตรีมมิงของ Mage-VL มาจากข้อมูลการถ่ายทอดฟุตบอลภายใต้โปรโตคอลเฉพาะ และการสาธิต World Cup 2026 ของมันก็เป็นเพียงการสาธิต ว่าเกตแบบ codec-native จะถ่ายโอนไปยังเทนนิสได้อย่างราบรื่นหรือไม่ — ซึ่งเทนนิสมีแต้มที่สั้น เกิดบ่อย และมีโครงสร้างหนาแน่น — ยังไม่ได้รับการทดสอบ ความแตกต่างคือ ข้อกล่าวอ้างของ Mage-VL อย่างน้อยก็สามารถถูกพิสูจน์ว่าผิดได้โดยบุคคลที่สาม ส่วนข้อกล่าวอ้างของ Sports Tennis นั้นไม่มีใครสามารถพิสูจน์ว่าผิดได้หากไม่มีชุดข้อมูลของ NVIDIA

สิ่งที่ต้องใช้ในการดำเนินการกับพวกมัน
ช่องว่างตรงนี้อยู่ที่ประมาณห้าเท่าในด้านฮาร์ดแวร์ และมันเป็นตัวกำหนดว่าใครจะลองใช้แต่ละโมเดลได้จริง ๆ บ้าง
• Sports Tennis — ใช้ GPU หนึ่งตัวที่มี VRAM ประมาณ 80 GB เมื่อใช้ BF16 โดยมีน้ำหนักโมเดลประมาณ 62 GB A100 80GB หรือ H100 80GB เป็นสเปกขั้นต่ำ แนะนำ B200 หรือ H200 ยังไม่มีการเผยแพร่เช็กพอยต์แบบควอนไทซ์ จึงไม่มีทางเลือกที่ถูกกว่าในการลดสเปก รองรับเฉพาะภาษาอังกฤษ รันไทม์คือ PyTorch/Transformers ร่วมกับ NeMo และ Megatron
• Mage-VL — ประมาณ 10.6 GB ที่ BF16 ซึ่งทำให้ GPU ขนาด 16 GB เป็นขั้นต่ำที่ใช้ได้จริงสำหรับงานด้านภาพ และ 24 GB หรือมากกว่าสำหรับวิดีโอความยาวมากและการสตรีมมิ่ง Apache-2.0 สำหรับ Mage-VL และ MIT สำหรับ Mage-ViT แม้ว่าที่เก็บโค้ดของตระกูลนี้ระบุว่าโมเดลเหล่านี้เผยแพร่เพื่อวัตถุประสงค์ด้านการวิจัยเท่านั้น โปรดสังเกตข้อจำกัดที่สำคัญ: trust_remote_code จำเป็นต้องใช้ ยังไม่มีเส้นทางสำหรับให้บริการผ่าน vLLM หรือ SGLang และไปป์ไลน์ตัวแปลงสัญญาณต้องใช้ FFmpeg หรือ ffprobe — โดยเส้นทางนิวรัลโคเดกยังต้องใช้ DCVC-RT เพิ่มเติม
ถ้าคุณต้องการประเมินโมเดลวิดีโอการกีฬาในเดือนนี้บนการ์ดเวิร์กสเตชันเพียงใบเดียว Mage-VL คือตัวเดียวในสองตัวนี้ที่คุณโหลดได้จริง นี่ถือเป็นคำตัดสินเชิงปฏิบัติ แม้จะยังไม่มีคำตัดสินจากเบนช์มาร์กก็ตาม

อันไหนที่คุณจะเอื้อมหยิบ
สำหรับงานที่เป็นเรียลไทม์ทุกอย่าง — ทั้งการบรรยาย การตรวจจับเหตุการณ์บนฟีดที่กำลังทำงานอยู่ หรือการแจ้งเตือนที่มีความหน่วงต่ำบนวิดีโอออกอากาศ — Microsoft Mage-VL คือตัวเลือกที่ปกป้องได้ในวันนี้: มันถูกออกแบบมาเพื่อสิ่งนั้นโดยเฉพาะ มีเบนช์มาร์กด้านสตรีมมิ่งมาสนับสนุน และรันได้บนฮาร์ดแวร์ที่ทีมส่วนใหญ่มีอยู่แล้ว สำหรับงานที่เน้นคลังเก็บข้อมูลและมีลักษณะเป็นการค้นหา โดยเฉพาะกับเทนนิส — การสร้างดัชนีแต้มที่ค้นหาได้ การวิเคราะห์แบบมีโครงสร้างข้ามการแรลลี่หลายพันครั้ง การถามคำถามที่คลิปแต้มทั้งคลิปเป็นหน่วยของความหมาย — ในบรรดาสองตัวนี้ มีเพียงโมเดลของ NVIDIA เท่านั้นที่ถูกสร้างมาเพื่อสิ่งนั้น ส่วนว่ามันทำงานได้ดีเพียงใดนั้น ณ เดือนกันยายน 2026 ยังไม่เป็นที่ทราบกันอย่างแท้จริง
ยังมีตัวเลือกที่สามที่ควรค่าแก่การเอ่ยถึง เพราะมันคือจุดที่ไปป์ไลน์จริงส่วนใหญ่ลงเอย หากคุณอยากลองโมเดลเฉพาะทางที่ยังไม่ผ่านการพิสูจน์ โดยไม่เดิมพันเส้นทางการผลิตกับมัน ให้เก็บมันไว้หลังอินเทอร์เฟซเดียวกันกับโมเดลที่คุณเชื่อถือ OrcaRouter ไม่มีให้บริการทั้งสองตัวนี้ — NVIDIA เผยแพร่น้ำหนักโดยไม่มีเอนด์พอยต์ และ Mage-VL ไม่มีเส้นทางการให้บริการแบบโฮสต์ — ดังนั้นทั้งคู่จึงเป็นการตัดสินใจเรื่องการโฮสต์เอง สิ่งที่ คีย์เดียวที่ครอบคลุมโมเดลแบบโฮสต์กว่า 200 รายการมอบให้คุณคือส่วนที่เหลือของสแตก: โมเดลถอดเสียง สรุปความ และโมเดลแอปพลิเคชันรอบ ๆ องค์ประกอบวิดีโอเกี่ยวกับกีฬาจะอยู่หลังเอนด์พอยต์เดียว พร้อมการสลับสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง และโมเดลเฉพาะทางสองตัวที่คุณรันเองคือชิ้นส่วนที่เคลื่อนไหวเพียงอย่างเดียวที่คุณเป็นเจ้าของ
คำตัดสิน
Microsoft Mage-VL และ NVIDIA NemotronLabs AI for Media - Sports Tennis ไม่ใช่คู่แข่งกันในความหมายที่หน้าเปรียบเทียบแบบ versus โดยทั่วไปหมายถึง Mage-VL เป็นโมเดลสตรีมมิ่งขนาด 4B ที่เผยแพร่และผ่านการวัดประสิทธิภาพแล้ว ทำงานบนเวิร์กสเตชัน และมีเดโมจริงของการบรรยายกีฬาที่กระตุ้นตามเหตุการณ์ ส่วน Sports Tennis เป็นผู้เชี่ยวชาญระดับคลิปขนาด 31B ที่ยังไม่ประกาศเปิดตัวและยังไม่ผ่านการวัดประสิทธิภาพ ต้องใช้ GPU สำหรับดาต้าเซ็นเตอร์ และไม่มีหลักฐานเผยแพร่ใด ๆ ว่ามันทำงานได้จริง
หากตัดสินด้วยหลักฐาน Mage-VL ชนะโดยปริยาย หากตัดสินด้วยขอบเขต ทั้งสองก็ไม่ทับซ้อนกัน แต่ก็มีเหตุผลที่ควรจับตาโมเดลของ NVIDIA ต่อไป: การไฟน์จูนด้วยเอนโคเดอร์แบบแช่แข็งบนแต้มเทนนิส 43,084 แต้มที่ติดป้ายกำกับอย่างถูกต้อง คือชุดข้อมูลฝึกเฉพาะทางแนวตั้งที่แคบและมีคุณภาพสูงแบบที่โมเดลอเนกประสงค์ไม่มี และหาก NVIDIA เผยแพร่ผลลัพธ์จากชุดทดสอบที่กันไว้เมื่อไร คำถามว่าโมเดลเฉพาะทางกับโมเดลอเนกประสงค์แบบไหนดีกว่าในวิดีโอการกีฬาก็จะได้คำตอบจริงเป็นครั้งแรก จนกว่าจะถึงตอนนั้น Mage-VL คือโมเดลที่มีหลักฐานยืนยันผลงาน และ Sports Tennis คือโมเดลที่มีเพียงคำสัญญา
