การ์ดฮีโร่ที่สร้างขึ้นสำหรับการเปรียบเทียบระหว่าง NVIDIA NemotronLabs AI for Media - Sports Tennis กับ InternLumina U2 โดยแสดงไอคอนคลิปแต้มเทนนิสอยู่ด้านหนึ่ง และสแต็กเอาต์พุตแบบข้อความพร้อมรูปภาพอยู่อีกด้านหนึ่ง ระบุว่าเป็นรุ่นเฉพาะทาง 31B ที่ส่งออกเฉพาะข้อความ เทียบกับรุ่นรวม 16B ที่ส่งออกทั้งข้อความและรูปภาพ โดยมีโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Nemotron Sports Tennis vs InternLumina U2: การเปรียบเทียบที่ไม่มีโมเดลใดแพ้ได้

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ถามว่าอันไหนดีกว่ากัน — NVIDIA NemotronLabs AI for Media - Sports Tennis หรือ InternLumina U2 — และคำตอบที่ตรงไปตรงมาคือคำถามนี้ไม่มีคำตอบที่ชัดเจน รีโพซิทอรีทั้งสองปรากฏบน Hugging Face ในเดือนกันยายน 2026 ทั้งคู่เป็นโมเดลมัลติโหมดแบบ mixture-of-experts ที่สร้างโดยแล็บที่มีเงินทุนหนา และแทบไม่มีอะไรเหมือนกันเลย โมเดลของ NVIDIA เป็นผู้เชี่ยวชาญขนาด 31B ที่อ่านคะแนนเทนนิสหนึ่งแต้มและตอบคำถามเกี่ยวกับมัน InternLumina U2 จากทีม InternLM ของ Shanghai AI Laboratory และเผยแพร่ในชื่อ internlm/InternLumina-U2 เป็นโมเดลแบบรวมขนาด 16B ที่เข้าใจภาพ วิดีโอ และ 3D และยัง สร้างและแก้ไข ภาพ ทั้งสองไม่มี benchmark ร่วมกัน ไม่มีกลุ่มผู้ใช้เป้าหมายร่วมกัน และไม่มีโปรไฟล์การติดตั้งใช้งานร่วมกัน การเปรียบเทียบทั้งสองจึงไม่เหมือนการเลือกโทรศัพท์ แต่เหมือนการเลือกระหว่างเครื่องฟังตรวจกับเครื่องพิมพ์ 3D

สิ่งที่ทำให้การจับคู่นี้ยังน่าที่จะเขียนถึงก็คือรูปแบบหนึ่งที่ทั้งสองโมเดลมีร่วมกัน นั่นคือไม่มีตัวไหนเลยที่ได้รับการประเมินอย่างเป็นอิสระ และทั้งคู่ก็ถูกผู้ขายของตัวเองบรรยายว่าเป็นอะไรบางอย่างที่ยังไม่ใช่ของที่เสร็จสมบูรณ์ นั่นแหละคือการเปรียบเทียบที่แท้จริง ไม่ใช่ว่ารุ่นไหนจะชนะ แต่เป็นว่าคุณตรวจสอบได้จริงมากแค่ไหนจากทั้งสองตัวในวันนี้

สองงานที่แตกต่างกันแต่ใช้คำเดียวกัน

"Multimodal" ครอบคลุมทั้งสองสิ่งนี้และไม่ได้บอกอะไรกับคุณเลย นี่คือการแบ่งแยก:

• สิ่งที่รองรับเป็นอินพุต — Sports Tennis: วิดีโอ (mp4 สูงสุด 2 นาที), เสียง (wav/mp3), รูปภาพ, ข้อความ. InternLumina U2: ข้อความ, รูปภาพ, วิดีโอ และ 3D. โมเดลเทนนิสเป็นหนึ่งเดียวในสองตัวที่มีทางกายภาพ เส้นทางเสียง ซึ่งเชื่อมต่อผ่านตัวเข้ารหัสคำพูด Parakeet ที่อ่านเสียงฝูงชนและเสียงกระทบไปพร้อมกับเฟรม

• สิ่งที่ได้กลับมา — Sports Tennis: ข้อความเท่านั้น InternLumina U2: ข้อความ และภาพที่สร้างหรือแก้ไข ผ่านการแทนค่าภาพแบบไม่ต่อเนื่องเต็มรูปแบบโดยใช้ 8 codebook ซึ่งสร้างบน AToken

• สิ่งที่ผู้ใช้ถาม — Sports Tennis: "เกิดอะไรขึ้นในแต้มนี้ ผู้เล่นยืนอยู่ตรงไหน ลูกบอลตกในหรือไม่" InternLumina U2: "อธิบายแผนภูมินี้ แล้ววาดเวอร์ชันใหม่ของมันให้ฉันหน่อย"

• สถาปัตยกรรม — Sports Tennis: MoE แบบไฮบริด Mamba2-Transformer ขนาดรวม 31B โดยมีพารามิเตอร์ที่ใช้งานจริงประมาณ 3B ต่อโทเคน สืบทอดโครงหลังและตัวเข้ารหัสมาจาก Nemotron 3 Nano Omni InternLumina U2: sparse MoE ขนาด 16B ที่มีพารามิเตอร์ใช้งานจริง 1B สร้างขึ้นเป็นโมเดลภาษาดิฟฟิวชันแบบหลายโค้ดบุ๊ก แทนที่จะเป็นแบบ autoregressive ทั่วไป

• บริบท — Sports Tennis เปิดเผยได้สูงสุด 256k โทเค็น การ์ดของ InternLumina U2 ไม่ได้โฆษณาตัวเลขบริบท

• สัญญาอนุญาต — Sports Tennis เผยแพร่ภายใต้ OpenMDW-1.1 โดยการ์ดระบุว่าใช้ได้ทั้งเชิงพาณิชย์และไม่ใช่เชิงพาณิชย์ ส่วน InternLumina U2 ใช้ Apache 2.0

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs InternLumina U2 — the scoreboard.' Left column lists Release September 2026, Parameters 31B (about 3B active), Inputs video audio image text, Output text only, Published benchmarks none, GPU floor 1 x 80 GB. Right column lists Release September 2026, Parameters 16B (about 1B active), Inputs text image video 3D, Output text and generated images, Published benchmarks partial and vendor-reported, GPU floor not specified. Footer reads 'NVIDIA figures from its model card; InternLumina figures vendor-reported and preliminary. No independent evaluation of either.'

สิ่งที่ทำให้พวกมันเทียบกันไม่ได้จริง ๆ

ไม่มีกระดานคะแนนที่ใช้ร่วมกัน และคุ้มค่าที่จะระบุให้ชัดเจนว่าทำไม แทนที่จะปล่อยให้เป็นเพียงการยักไหล่แบบคลุมเครือ

Sports Tennis ผ่านการปรับละเอียดบนชุดข้อมูลเทนนิสอันเป็นกรรมสิทธิ์ของ NVIDIA — ตัวอย่าง Q&A 1,312,129 รายการ จากคลิประดับแต้ม 43,084 คลิปจาก 239 แมตช์ ติดป้ายกำกับตามหมวดหมู่คำอธิบายประกอบ 38 หมวด ทั้งหมดถูกรวบรวมในปี 2025 ชุดทดสอบของมันเป็นพาร์ติชันที่กันไว้ซึ่งประกอบด้วย 12 แมตช์ 2,689 คลิป และ 80,872 คำถาม อาร์ติแฟกต์ทั้งหมดเหล่านั้นเป็นของ NVIDIA เอง ไม่มีกลุ่มภายนอกใดมีข้อมูลนี้ ดังนั้นจึงไม่มีกลุ่มภายนอกใดสามารถทำซ้ำคะแนนได้ — และปรากฏว่า NVIDIA ไม่ได้เผยแพร่คะแนนใด ๆ ให้ทำซ้ำ การ์ดนี้บันทึกระเบียบวิธีการประเมินอย่างละเอียด แล้วก็ไม่รายงานผลลัพธ์ใด ๆ จากมันเลย ไม่มีอะไรเกี่ยวกับความแม่นยำ ไม่มีอะไรแยกตามหมวดหมู่ ไม่มีอะไรเลย

InternLumina U2 ตั้งอยู่อีกด้านหนึ่งของกำแพงเดียวกันนั้น มันเผยแพร่ตัวเลข แต่ระบุชัดว่าเป็นเพียงบางส่วน การ์ดโมเดลเขียนไว้บรรทัดหนึ่งว่า “ผลลัพธ์เบื้องต้นและเป็นเพียงบางส่วน ตารางเปรียบเทียบฉบับเต็มจะปรากฏในรายงานทางเทคนิคที่กำลังจะเผยแพร่” สิ่งที่มีอยู่คือชุดตัวเลขที่ผู้ขายรายงาน ซึ่งกระจายอยู่ตามความสามารถที่แตกต่างกันมาก ได้แก่ ChartQA 86.52 และ CharXiv-DQ 83.65 ในงานเอกสาร, MathVision 33.22 และ DynaMath 56.37 ในคณิตศาสตร์เชิงภาพ, VideoMME 51.26 และ MVBench 59.74 ในวิดีโอ, 3D MM-Vet 41.8, DPG-Bench 87.10 และ GenEval 0.81 ในการสร้าง, ImgEdit 3.83 ในการแก้ไข และตารางของหน้าโปรเจกต์เองแสดงว่าโมเดลตามหลังคู่แข่งที่มีชื่ออย่างน้อยหนึ่งรายในตัวชี้วัดหลักอย่างน้อยหนึ่งรายการ: GenEval 0.81 เทียบกับ 0.89 ของ LLaDA2.0-Uni

ดังนั้น โมเดลหนึ่งมีการประเมินที่บันทึกไว้เป็นเอกสารแต่ไม่มีผลลัพธ์ ส่วนอีกโมเดลมีผลลัพธ์และการประเมินที่ระบุไว้อย่างชัดเจนว่ายังไม่สมบูรณ์ ไม่มีโมเดลใดให้ตัวเลขที่คุณนำมาวางเทียบเคียงกันได้ หน้าเว็บใดก็ตามที่จัดอันดับสองโมเดลนี้ล้วนกุอันดับขึ้นมาเองทั้งนั้น

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table listing 31B total parameters, about 3B active per token, a 256k-token maximum context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips from 239 matches, and a minimum of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

ตรงที่พวกมันทับซ้อนกันอย่างแท้จริง และสิ่งที่มันแสดงให้เห็น

การทำความเข้าใจวิดีโอเป็นเพียงดินแดนเดียวที่ทั้งสองฝ่ายอ้างสิทธิ์ และแม้แต่ตรงนั้นความทับซ้อนก็ยังบางกว่าที่เห็น InternLumina U2 รายงาน VideoMME 51.26 และ MLVU 57.03 และ MVBench 59.74 — คะแนนความเข้าใจวิดีโอทั่วไปที่ผู้ขายรายงานเอง Sports Tennis ไม่รายงานอะไรเลย แต่การ์ดของมันอธิบายงานที่แคบกว่ามากและลึกกว่ามาก: การให้เหตุผลระดับแต้มตลอดการแรลลี่หนึ่งครั้งเต็มรูปแบบพร้อมเสียง ครอบคลุม 38 หมวดหมู่คำอธิบายประกอบแบบละเอียด ซึ่งรวมถึงกลไกการตีลูก ตำแหน่งบนคอร์ต การเคลื่อนที่ และสถานะคะแนน

ข้ออนุมานที่สมเหตุสมผลคือ InternLumina U2 น่าจะเป็นนักทั่วไปที่ดีกว่า และ Sports Tennis น่าจะเป็นตัวอ่านเทนนิสที่ดีกว่า แต่สิ่งนั้นเป็นข้ออนุมานจากรูปร่างของงาน ไม่ใช่จากข้อมูล ซึ่งอาจผิดได้ง่ายไม่ว่าจะไปในทิศทางใดก็ตาม สิ่งที่มิใช่ข้ออนุมานก็คือ เบนช์มาร์กวิดีโอทั่วไปและเบนช์มาร์กเทนนิสระดับแต้มที่เป็นกรรมสิทธิ์ไม่สามารถวางบนแกนเดียวกันได้ และตัวสร้างแบบรวมขนาด 16B กับผู้เชี่ยวชาญแบบตัวเข้ารหัสแช่แข็งขนาด 31B ไม่ได้ถูกสร้างขึ้นมาเพื่อตอบคำถามเดียวกัน

การรันอันใดอันหนึ่งถือเป็นโปรเจกต์อีกประเภทหนึ่งที่แตกต่างออกไป

การนำไปใช้งานจริงคือจุดที่ช่องว่างเลิกเป็นเรื่องเชิงปรัชญา

Sports Tennis ระบุว่าต้องมี GPU อย่างน้อยหนึ่งตัวที่มีหน่วยความจำประมาณ 80 GB ที่ BF16 โดยมีน้ำหนักประมาณ 62 GB ทดสอบบน A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor และ RTX 5090 ไม่มีเช็กพอยต์แบบควอนไทซ์ ดังนั้นข้อกำหนด 80 GB จึงไม่สามารถเจรจาลดลงได้ในปัจจุบัน นอกจากนี้ยังรองรับเฉพาะภาษาอังกฤษเท่านั้น

ปัญหาที่น่าสนใจกว่าของ InternLumina U2 ไม่ใช่หน่วยความจำ แต่เป็นซิลิคอน รีโพซิทอรีนี้โฮสต์เช็กพอยต์ที่แยกตามฮาร์ดแวร์ที่ใช้ฝึก: ไดเรกทอรี ascend/ที่สมบูรณ์ซึ่งมีไฟล์ safetensors เจ็ดชาร์ดที่ฝึกบน Huawei Ascend NPUs และไดเรกทอรี nvidia/ที่ระบุว่า "เร็ว ๆ นี้" หากคุณใช้งานฮาร์ดแวร์ NVIDIA — ซึ่งสำหรับโมเดลที่มีโมเดลพี่น้องเป็นเวอร์ชันไฟน์จูนสำหรับเทนนิสของ Nemotron นั่นคือผู้อ่านส่วนใหญ่ของข้อความนี้ — เช็กพอยต์ที่คุณต้องการคือเช็กพอยต์ที่ยังไม่เผยแพร่ โค้ดอินเฟอเรนซ์และคำแนะนำการตั้งค่าอยู่ในรีโพซิทอรี GitHub ของ InternLM ไม่ใช่บน Hub และรายงานทางเทคนิคยังอยู่ระหว่างดำเนินการ

นั่นพลิกความคาดหวังตามปกติ โมเดลกรรมสิทธิ์ ที่ยังไม่ผ่านการทดสอบประสิทธิภาพ และมีรูปแบบเป็นเครื่องใช้สำเร็จรูป คือโมเดลที่คุณสามารถดาวน์โหลดและรันได้ทันทีตั้งแต่วันแรก ส่วนโมเดลวิจัยแบบเปิด Apache-2.0 คือโมเดลที่ต้องรอการบิลด์ที่จำเพาะกับฮาร์ดแวร์

A screenshot of the Hugging Face model card for internlm/InternLumina-U2, captured September 11, 2026, showing the Apache 2.0 licence, the description as a 16B-parameter MoE with 1B active parameters and an 8-codebook fully-discrete visual representation, the note that the repository hosts checkpoints split by training hardware with ascend/ trained on Huawei Ascend NPUs and nvidia/ marked coming soon, and the benchmarks section stating preliminary, partial results pending the technical report.

จุดที่เราเตอร์เหมาะสม — และจุดที่มันไม่เหมาะสม

ไม่มีโมเดลใดในสองตัวนี้ที่โฮสต์อยู่บน OrcaRouter และไม่มีวิธีเขียนเลี่ยงประเด็นนั้นอย่างซื่อสัตย์ Sports Tennis ไม่มีเอนด์พอยต์อยู่ที่ใดเลย NVIDIA เผยแพร่เพียงค่าน้ำหนักเท่านั้น และไม่มีสิ่งอื่น รีโพซิทอรีของ InternLumina U2 เองระบุว่าเช็กพอยต์ของ NVIDIA ยังคงค้างอยู่ ดังนั้นทางฝั่งเราจึงไม่มีอะไรให้เสิร์ฟเช่นกัน นี่เป็นการตัดสินใจเรื่องการโฮสต์เองในทั้งสองกรณี ไม่ใช่เรื่องการกำหนดเส้นทาง

คำถามเรื่องการกำหนดเส้นทางปรากฏขึ้นในอีกระดับหนึ่ง ทีมที่ต้องการประเมินผู้เชี่ยวชาญอย่าง Sports Tennis เทียบกับโมเดลอเนกประสงค์อย่าง InternLumina U2 ไม่ได้ทำแบบแยกส่วน — แต่ทำในฐานะผู้สมัครรายหนึ่งในไปป์ไลน์ที่ยังต้องมีการถอดเสียงเป็นข้อความ การจัดการเอกสาร การสรุปความ และตรรกะของแอปพลิเคชันที่อยู่รอบๆ สิ่งเหล่านั้น องค์ประกอบเหล่านี้ถูกโฮสต์ไว้ และเป็นส่วนที่ คีย์ API เดียวที่ครอบคลุมโมเดลกว่า 200 รายการ พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง ช่วยประหยัดเวลางานการผสานรวมไปได้หนึ่งสัปดาห์ คีย์เดียวสำหรับโมเดลที่คุณเรียกใช้ได้ ดังนั้นโมเดลที่คุณต้องรันเองจึงเป็นสิ่งเดียวที่คุณต้องดูแลจริงๆ

คำถามที่เปิดอยู่

เมื่อวางเทียบกัน NVIDIA NemotronLabs AI for Media - Sports Tennis และ InternLumina U2 ถือเป็นตัวอย่างที่พอใช้ได้ของสองวิธีในการเปิดตัวโมเดลมัลติโมดัลต่อสาธารณะได้อย่างแย่ รายหนึ่งจัดทำเอกสารการประเมินของตนแต่ไม่เปิดเผยผลลัพธ์ ส่วนอีกรายเผยแพร่ผลลัพธ์แต่ระบุว่าการประเมินของตนยังไม่สมบูรณ์ ณ เดือนกันยายน 2026 ทั้งสองเป็นข้อกล่าวอ้างที่ไม่สามารถพิสูจน์หักล้างได้

สิ่งที่น่าสนใจติดตามไม่ใช่ตัวว่าใครจะออกมาแข็งแกร่งกว่า — ทั้งสองจะไม่มีวันถูกทดสอบบนสิ่งเดียวกัน สิ่งนั้นคือห้องแล็บไหนจะปิดช่องว่างของตัวเองได้ก่อน หาก NVIDIA เผยตัวเลขเทนนิสออกมา ก็แสดงว่ามันแก้ปัญหาที่ยากกว่าได้แล้ว เพราะเบนช์มาร์กแบบ held-out ที่เป็นกรรมสิทธิ์ซึ่งมี 12 แมตช์ที่ยังไม่เคยเห็น เป็นวิธีเดียวที่ซื่อตรงในการให้คะแนนไฟน์จูนเฉพาะโดเมน และ NVIDIA ก็สร้างสปลิตไว้แล้ว หาก InternLM ปล่อยเช็กพอยต์ของ NVIDIA พร้อมรายงานทางเทคนิค ก็แสดงว่ามันทำให้โมเดล Apache-2.0 ของตนใช้งานได้จริงบนฮาร์ดแวร์ที่ผู้ใช้ของตนเป็นเจ้าของ ไม่ว่าจะเกิดอะไรขึ้น การเปรียบเทียบนี้จะคุ้มค่าที่จะกลับมาอ่านอีกครั้ง — เพราะตอนนี้ สิ่งที่ปกป้องได้มากที่สุดที่การ์ดของโมเดลใดก็ตามรองรับได้คือการยักไหล่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube