
Nemotron Sports Tennis vs InternLumina U2: Perbandingan yang Tidak Bisa Membuat Model Mana Pun Kalah
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 juta token
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Tanya mana yang lebih baik — NVIDIA NemotronLabs AI for Media - Sports Tennis atau InternLumina U2 — dan jawaban jujurnya adalah pertanyaan itu tidak bisa diselesaikan. Kedua repositori sama-sama muncul di Hugging Face pada September 2026, keduanya adalah model multimodal mixture-of-experts yang dibangun oleh laboratorium berpendanaan besar, dan hampir tidak ada kesamaan lain di antara keduanya. Model NVIDIA adalah spesialis 31B yang membaca satu poin tenis dan menjawab pertanyaan tentangnya. InternLumina U2, dari tim InternLM Shanghai AI Laboratory dan dipublikasikan sebagai internlm/InternLumina-U2, adalah model terpadu 16B yang memahami gambar, video, dan 3D serta juga menghasilkan dan mengedit gambar. Keduanya tidak berbagi benchmark, pengguna target, maupun profil penerapan yang sama. Membandingkan keduanya lebih tidak seperti memilih ponsel dan lebih seperti memilih antara stetoskop dan printer 3D.
Lagipula, yang membuat pasangan ini layak dibahas adalah pola yang dimiliki kedua model: tidak satu pun telah dievaluasi secara independen, dan keduanya digambarkan oleh vendor masing-masing sebagai sesuatu yang belum selesai. Itulah perbandingan yang sebenarnya — bukan model mana yang menang, melainkan seberapa banyak dari masing-masing model yang benar-benar dapat Anda verifikasi hari ini.
Dua pekerjaan berbeda yang memakai kata yang sama
"Multimodal" mencakup keduanya dan tidak memberi tahu Anda apa pun. Inilah pembagiannya:
• Apa yang diterimanya — Sports Tennis: video (mp4 hingga 2 menit), audio (wav/mp3), gambar, teks. InternLumina U2: teks, gambar, video, dan 3D. Model tenis adalah satu-satunya dari keduanya dengan material jalur audio, yang terhubung melalui encoder ucapan Parakeet yang membaca suara kerumunan dan tumbukan bersamaan dengan frame.
• Apa yang diberikannya kembali — Sports Tennis: hanya teks. InternLumina U2: teks dan gambar yang dihasilkan atau diedit, melalui representasi visual sepenuhnya diskret 8-codebook yang dibangun di atas AToken.
• Apa yang pengguna tanyakan — Olahraga Tenis: "apa yang terjadi pada poin ini, di mana pemain berdiri, apakah bola masuk." InternLumina U2: "jelaskan bagan ini, lalu gambarkan versi barunya untuk saya."
• Arsitektur — Sports Tennis: MoE hibrida Mamba2-Transformer, total 31B dengan sekitar 3B aktif per token, mewarisi backbone dan encoder-nya dari Nemotron 3 Nano Omni. InternLumina U2: MoE sparse 16B dengan 1B parameter aktif, dibangun sebagai model bahasa difusi multi-codebook alih-alih model autoregresif konvensional.
• Konteks — Sports Tennis mempublikasikan hingga 256k token. Kartu InternLumina U2 tidak mencantumkan angka konteks.
• Lisensi — Sports Tennis dirilis di bawah OpenMDW-1.1 dengan kartu yang menyatakan penggunaan komersial dan non-komersial. InternLumina U2 adalah Apache 2.0.

Hal yang sebenarnya membuat mereka tidak bisa dibandingkan
Tidak ada papan skor bersama, dan ada baiknya kita bersikap tepat soal alasannya daripada membiarkannya sebagai angkat bahu yang kabur.
Sports Tennis di-fine-tune pada kumpulan data tenis NVIDIA yang bersifat proprietary — 1.312.129 contoh tanya jawab yang mencakup 43.084 klip tingkat poin dari 239 pertandingan, dilabeli menurut 38 kategori anotasi, semuanya dikumpulkan pada 2025. Himpunan ujinya adalah partisi yang disisihkan dari 12 pertandingan, 2.689 klip, dan 80.872 pertanyaan. Setiap artefak tersebut milik NVIDIA sendiri. Tidak ada kelompok luar yang memiliki datanya, sehingga tidak ada kelompok luar yang dapat mereproduksi skor — dan ternyata, NVIDIA tidak menerbitkan skor apa pun untuk direproduksi. Kartu tersebut mendokumentasikan protokol evaluasi secara terperinci lalu tidak melaporkan hasil apa pun darinya. Tidak ada apa pun tentang akurasi, tidak ada apa pun per kategori, tidak ada apa pun.
InternLumina U2 berada di sisi berlawanan dari dinding yang sama. Ia memublikasikan angka, tetapi angka-angka itu secara eksplisit bersifat sebagian. Kartu model menyatakannya dalam satu baris: "Hasil awal, sebagian. Tabel perbandingan lengkap akan muncul dalam laporan teknis mendatang." Yang ada adalah sebaran angka yang dilaporkan vendor di berbagai kemampuan yang sangat berbeda — ChartQA 86.52 dan CharXiv-DQ 83.65 pada dokumen, MathVision 33.22 dan DynaMath 56.37 pada matematika visual, VideoMME 51.26 dan MVBench 59.74 pada video, 3D MM-Vet 41.8, DPG-Bench 87.10 dan GenEval 0.81 pada pembuatan, ImgEdit 3.83 pada penyuntingan. Dan tabel halaman proyek itu sendiri menunjukkan model tertinggal dari setidaknya satu pesaing yang disebutkan pada setidaknya satu metrik utama: GenEval 0.81 dibandingkan 0.89 milik LLaDA2.0-Uni.
Jadi satu model memiliki evaluasi yang terdokumentasi tetapi tanpa hasil, dan model lainnya memiliki hasil serta evaluasi yang secara eksplisit belum lengkap. Tidak satu pun memberi Anda angka yang dapat Anda bandingkan secara berdampingan dengan yang lain. Halaman mana pun yang memeringkatkan keduanya telah mengarang peringkatnya.

Di mana mereka benar-benar tumpang tindih, dan apa yang ditunjukkannya
Pemahaman video adalah satu wilayah yang keduanya klaim, dan bahkan di sana tumpang tindihnya lebih tipis daripada yang terlihat. InternLumina U2 melaporkan VideoMME 51,26 dan MLVU 57,03 dan MVBench 59,74 — skor pemahaman video umum, yang dilaporkan vendor. Sports Tennis tidak melaporkan apa pun, tetapi kartunya menjelaskan tugas yang jauh lebih sempit dan jauh lebih mendalam: penalaran tingkat poin atas reli penuh dengan audio, di 38 kategori anotasi terperinci termasuk mekanika pukulan, posisi lapangan, pergerakan, dan status skor.
Inferensi yang wajar adalah bahwa InternLumina U2 akan menjadi generalis yang lebih baik dan Sports Tennis pembaca tenis yang lebih baik, tetapi itu adalah inferensi dari bentuk tugas, bukan dari data. Itu bisa saja salah ke arah mana pun. Yang bukan inferensi adalah bahwa tolok ukur video umum dan tolok ukur tenis tingkat poin proprietari tidak dapat ditempatkan pada sumbu yang sama, dan bahwa generator terpadu 16B dan spesialis encoder yang dibekukan 31B tidak dibangun untuk menjawab pertanyaan yang sama.
Menjalankan salah satu dari keduanya adalah jenis proyek yang berbeda
Deployment adalah titik ketika kesenjangan itu berhenti bersifat filosofis.
Sports Tennis menyatakan batas minimum keras satu GPU dengan memori sekitar 80 GB pada BF16, dengan bobot sekitar 62 GB, diuji pada A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor, dan RTX 5090. Tidak ada checkpoint terkuantisasi, jadi persyaratan 80 GB tidak dapat ditawar turun saat ini. Ini juga hanya berbahasa Inggris.
Masalah yang lebih menarik dari InternLumina U2 bukanlah memori, melainkan silikon. Repositori ini menyimpan checkpoint yang dipisahkan berdasarkan perangkat keras pelatihan: sebuah ascend/ direktori lengkap dengan tujuh shard safetensors yang dilatih pada NPU Huawei Ascend, dan sebuah nvidia/ direktori yang ditandai "segera hadir." Jika Anda menjalankan perangkat keras NVIDIA — yang, untuk model yang saudaranya adalah fine-tune tenis dari Nemotron, adalah sebagian besar pembaca ini — checkpoint yang Anda inginkan adalah yang belum tiba. Kode inferensi dan instruksi penyiapan berada di repositori GitHub InternLM, bukan di Hub, dan laporan teknisnya masih tertunda.
Itu membalik ekspektasi yang biasa. Model proprietary, tanpa benchmark, dan berbentuk appliance adalah model yang dapat Anda unduh dan jalankan sekarang juga pada hari pertama. Model riset terbuka Apache-2.0 justru yang menunggu build khusus perangkat keras.

Di mana router cocok — dan di mana tidak
Tidak satu pun dari model-model ini dihosting di OrcaRouter, dan tidak ada cara jujur untuk menulis dengan mengelak dari hal itu. Sports Tennis tidak memiliki endpoint di mana pun; NVIDIA hanya menerbitkan bobot dan tidak ada yang lain. Repositori InternLumina U2 sendiri mencatat bahwa checkpoint NVIDIA masih tertunda, jadi tidak ada yang bisa di-serve dari sisi kami juga. Ini adalah keputusan self-hosting untuk kedua hal tersebut, bukan keputusan routing.
Pertanyaan tentang perutean muncul satu lapisan di atasnya. Tim yang ingin mengevaluasi spesialis seperti Sports Tennis terhadap generalis seperti InternLumina U2 tidak melakukannya secara terpisah — mereka melakukannya sebagai salah satu kandidat dalam pipeline yang juga membutuhkan transkripsi ucapan, penanganan dokumen, peringkasan, dan logika aplikasi di sekitarnya. Komponen-komponen tersebut dihosting, dan itulah bagian di mana satu kunci API yang mencakup lebih dari 200 model dengan failover otomatis antar penyedia menghemat waktu kerja integrasi selama seminggu. Satu kunci untuk model yang dapat Anda panggil, sehingga model yang harus Anda jalankan sendiri adalah satu-satunya hal yang benar-benar Anda kelola.
Pertanyaan terbuka
Jika disandingkan, NVIDIA NemotronLabs AI for Media - Sports Tennis dan InternLumina U2 cukup menggambarkan dua cara merilis model multimodal secara buruk di depan publik. Yang satu mendokumentasikan evaluasinya dan menahan hasilnya; yang lain mempublikasikan hasil dan melabeli evaluasinya tidak lengkap. Keduanya, per September 2026, adalah klaim yang tidak dapat dibuktikan salah.
Yang menarik untuk dicermati bukanlah mana yang ternyata lebih kuat — keduanya tidak akan pernah diuji pada hal yang sama. Yang menarik adalah lab mana yang menutup kesenjangannya lebih dulu. Jika NVIDIA merilis angka tenis, itu berarti ia telah memecahkan masalah yang lebih sulit, karena tolok ukur eksklusif yang disisihkan dari 12 pertandingan yang belum pernah dilihat adalah satu-satunya cara jujur untuk menilai fine-tune domain, dan NVIDIA sudah membangun pembagian datanya. Jika InternLM merilis checkpoint NVIDIA dan laporan teknisnya, itu berarti ia telah membuat model Apache-2.0-nya benar-benar dapat digunakan pada perangkat keras yang dimiliki penggunanya. Apa pun yang terjadi, perbandingan ini akan layak dibaca ulang — karena saat ini, hal paling dapat dipertahankan yang didukung oleh kartu model mana pun di antara keduanya adalah angkat bahu.
