Kartu hero panel terpisah yang dihasilkan, yang membandingkan NVIDIA NemotronLabs AI for Media - Sports Tennis dan North Micro Vision Instruct, dengan separuh kiri dilabeli pembaca tenis 31B dan chip hanya Bahasa Inggris di samping ikon klip poin tenis, serta separuh kanan dilabeli spesialis dokumen 2.4B dan chip 11+ bahasa di samping ikon dokumen dan diagram batang, dengan logo OrcaRouter di sudut kanan bawah.
Guides & Insights

Nemotron Sports Tennis vs North Micro Vision Instruct: Pembaca Tenis 31B Melawan Spesialis Dokumen 2.4B

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jawaban singkat lebih dulu: NVIDIA NemotronLabs AI for Media - Sports Tennis dan North Micro Vision Instruct bukanlah pengganti satu sama lain, dan tidak ada orang yang memilih di antara keduanya yang sebenarnya sedang memilih di antara keduanya. Yang satu adalah model multimodal 31B yang di-fine-tune NVIDIA untuk menjawab pertanyaan tentang poin tenis, membutuhkan sekitar 80 GB memori GPU, dan hanya membaca bahasa Inggris. Yang lainnya adalah model visi-bahasa 2,4B dari Cohere yang muat pada satu kartu workstation, menangani sebelas bahasa, dan dibangun terutama untuk membaca dokumen — halaman, bagan, tabel, OCR.

Keduanya berada dalam kategori besar yang sama dan hampir tidak di tempat lain. Berikut ini versi jujur dari perbandingan tersebut: di mana keduanya benar-benar berbeda, apa yang sudah dan belum diterbitkan oleh masing-masing vendor, dan satu situasi di mana pilihan itu benar-benar nyata.

Untuk apa setiap model dibuat

North Micro Vision Instruct memasangkan model bahasa 2B — North Micro LLM dari Cohere, mengikuti arsitektur Command A+ — dengan encoder visi 400M parameter yang dilatih khusus dari SigLIP 2 SO400M, total 2,4B. Jalur visinya beresolusi native, mempertahankan rasio aspek alih-alih mengubah ukuran ke grid tetap, dan proyektor DeepStack menyuntikkan embedding patch dari beberapa lapisan encoder ke lapisan bahasa awal yang sesuai alih-alih menambahkan satu representasi di depan. Kerangka yang dinyatakan Cohere adalah fondasi ringkas untuk prototipe dan penyempurnaan khusus tugas, dengan pemahaman dokumen sebagai kemampuan unggulan. Kartu modelnya sangat terbuka tentang batas atasnya: North Micro Vision Instruct secara eksplisit bukan model penalaran, tidak memiliki pemanggilan alat, dan tidak dilatih dengan prompt sistem.

Sports Tennis adalah bentuk yang berlawanan di setiap dimensi. NVIDIA memulai dari checkpoint Nemotron 3 Nano Omni 30B-A3B-Reasoning miliknya sendiri — sebuah campuran pakar hibrida Mamba2-Transformer, total 31B dengan sekitar 3B aktif per token — dan melakukan fine-tuning pada korpus tenis eksklusif yang dilabeli secara manual. Encoder visi (C-RADIOv4-H) dan encoder ucapan (Parakeet) keduanya dibekukan; hanya parameter model bahasa yang berubah. Hasilnya adalah model sempit secara desain: model ini menjawab pertanyaan pilihan ganda terstruktur dan pertanyaan terbuka atas klip satu poin tenis penuh, mencakup mekanika pukulan, posisi di lapangan, pergerakan pemain, fakta pertandingan, pengetahuan aturan, dan isyarat audio. NVIDIA menjelaskannya bekerja paling baik ketika satu poin utuh — mulai dari servis hingga akhir rally — diberikan sebagai input.

Dimensi-dimensi yang benar-benar memisahkan mereka

• Parameter — North Micro Vision Instruct: 2.4B (2B bahasa, 400M visi). Sports Tennis: total 31B, ~3B aktif per token.

• Masukan — North Micro Vision Instruct: teks dan gambar berselang-seling, resolusi asli, multi-gambar. Sports Tennis: video hingga 2 menit, audio hingga satu jam, gambar, teks.

• Keluaran — keduanya mengembalikan teks. North Micro Vision Instruct juga mengembalikan kotak pembatas grounding pada skala ternormalisasi 0–1000.

• Bahasa — North Micro Vision Instruct: 11+, termasuk bahasa Inggris, Jerman, Prancis, Spanyol, Italia, Portugis, Hindi, Jepang, Korea, Mandarin, dan Arab. Sports Tennis: hanya bahasa Inggris.

• Konteks — North Micro Vision Instruct: backbone bahasa 128K token, tetapi Cohere menandai rentang multimodal tervalidasi sebagai hingga 8K token, dengan konteks multimodal yang lebih panjang mengandalkan ekstrapolasi dan belum diuji tolok ukur. Olahraga Tenis: hingga 256k token.

• Jejak — North Micro Vision Instruct: sekitar 4,97 GB pada BF16, kira-kira 2,17 GB pada 4-bit. Sports Tennis: sekitar 62 GB pada BF16, diperlukan satu GPU 80 GB.

• Lisensi — North Micro Vision Instruct: Apache 2.0. Sports Tennis: OpenMDW-1.1, dengan kartu yang menyatakan penggunaan komersial dan non-komersial.

A generated two-column scoreboard titled 'NVIDIA NemotronLabs AI for Media - Sports Tennis vs North Micro Vision Instruct — the scoreboard.' Left column lists Parameters 31B (about 3B active), Inputs video audio image text, Languages English only, Published benchmarks none, Footprint about 62 GB, GPU floor 1 x 80 GB. Right column lists Parameters 2.4B, Inputs interleaved text and images at native resolution, Languages eleven or more, Published benchmarks DocVQA 0.921 / ChartQA 0.808 / OCRBench 0.792 / MMMU 0.329, Footprint about 5 GB at BF16, GPU floor a single workstation card. Footer reads 'NVIDIA figures from its model card with no published results; Cohere figures vendor-reported.'

Benchmark: satu model memilikinya, model lainnya punya protokol

Di sinilah kedua kartu itu tidak bisa lebih berbeda lagi dalam hal postur.

Cohere menerbitkan angka untuk North Micro Vision Instruct. DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — dan MMMU 0,329. Semuanya dilaporkan vendor, tidak ada yang direproduksi secara independen, dan Cohere sendiri menandai bahwa hasil OCR sangat bervariasi bergantung pada split. Angka terakhir itu patut direnungkan sejenak: skor MMMU 0,329 itu rendah, dan konsisten dengan semua hal lain yang dikatakan kartu tersebut tentang desain model. Ini spesialis membaca, bukan model penalaran umum, dan perusahaan yang membangunnya mengatakan demikian. Pengungkapan semacam itu lebih berguna daripada angka yang menyanjung.

NVIDIA tidak menerbitkan apa pun. Kartu Sports Tennis menjelaskan evaluasinya dengan hati-hati — partisi pengujian berisi 12 pertandingan yang sepenuhnya di-hold-out, 2.689 klip tingkat poin, dan 80.872 pertanyaan dari pertandingan tanpa tumpang tindih pelatihan, dinilai dengan akurasi pilihan ganda otomatis dan LLM-as-judge pass@9 pada respons terbuka, dengan pemisahan pertandingan yang pernah dilihat secara eksplisit dikecualikan dari pengujian yang dilaporkan — lalu tidak melaporkan hasil apa pun dari semua itu. Sisi pelatihannya sama rincinya: 1.312.129 contoh Q&A, 1.226.081 pilihan ganda dan 86.048 respons terbuka, yang diambil dari 43.084 klip tingkat poin di 239 pertandingan, dilabeli menurut 38 kategori anotasi.

Bahkan jika NVIDIA telah menerbitkan skor, skor itu tidak akan sebanding. Tidak ada tolok ukur yang di dalamnya model pemahaman dokumen dan model poin tenis sama-sama muncul. Tumpang tindih antara kedua cerita evaluasi ini adalah nol.

A screenshot of the Hugging Face model card for CohereLabs/North-Micro-Vision-Instruct, captured September 11, 2026, showing the description as a 2.4B-parameter open-weight vision-language model with native-resolution image support under Apache 2.0, model details listing a 2B language model and a 400M vision encoder custom-trained from SigLIP 2 SO400M, a 128K-token language backbone context with an 8K validated multimodal range, eleven listed languages, and the note that public vLLM support is coming soon.

Deployment: di sinilah letak perbedaan praktisnya

Model 2.4B jauh lebih mudah dioperasikan. Bobot BF16 sekitar 5 GB berarti satu GPU workstation modern dapat menanganinya, dan build 4-bit di sekitar 2,17 GB bahkan lebih kecil lagi. Port independen tersedia untuk runtime Core AI Apple, dengan laporan sekitar 18,2 token/detik pada int8 di iPhone 17 Pro dan kuantisasi int4 yang gagal total. Hambatannya ada di perangkat lunak: North Micro Vision Instruct memerlukan Transformers 5.16.0 — dapat dipasang dari sumber sampai tersedia di PyPI — dan dukungan vLLM publik masih digambarkan akan segera hadir di kartu model. Fine-tuning didukung melalui Axolotl. Tidak ada API hosting pihak pertama; jalur praktisnya adalah hosting mandiri.

Olahraga tenis adalah hal yang lebih sulit untuk dioperasikan dan tidak ada jalan keluarnya. Satu GPU 80 GB pada BF16, tidak ada checkpoint terkuantisasi yang dipublikasikan, hanya bahasa Inggris, hanya Linux, di PyTorch/Transformers, NeMo, atau Megatron. NVIDIA menguji pada A100, H100, H200, B200, GB200 NVL72, RTX PRO 6000 SE, L40S, DGX Spark, Jetson Thor, dan RTX 5090 — daftar perangkat keras yang lebih banyak berbicara tentang apa yang ingin divalidasi NVIDIA daripada tentang apa yang dapat disediakan tim biasa. Kebijakan inferensi bawaan kartu ini juga sangat minimal: 2 frame per detik hingga 128 frame, 256 token baru, dekode greedy.

Tidak ada dari kedua model tersebut yang dilayani di OrcaRouter. North Micro Vision Instruct tidak memiliki endpoint pihak pertama dan tidak ada dalam katalog kami; Sports Tennis tidak memiliki endpoint di mana pun, karena NVIDIA menerbitkan bobot dan tidak ada layanan yang dihosting. Keduanya merupakan keputusan self-hosting.

Yang benar-benar membantu dari lapisan routing adalah pipeline di sekitarnya — mana pun dari ini yang Anda jalankan secara lokal, model transkripsi, peringkasan, pengambilan, dan aplikasi yang mengelilinginya di-hosting, dan menempatkannya di balik satu kunci API dengan failover otomatis menghindari perlunya menyiapkan set kredensial dan kontrak terpisah untuk masing-masing. Kami meneruskan harga daftar penyedia dengan markup 0% untuk model yang kami sediakan, sehingga bagian-bagian dari stack yang tidak Anda hosting sendiri tetap pada harga vendor.

A screenshot of the Hugging Face model card for nvidia/NVIDIA-NemotronLabs-AI-for-Media-Sports-Tennis, captured September 11, 2026, showing the At a Glance table with 31B total parameters, about 3B active, a 256k-token context, video/audio/image/text input, text output, 1.31M Q&A pairs over 43k point clips, and a minimum GPU of one A100 80GB or H100 80GB, alongside a sidebar showing two downloads last month and no inference provider deployment.

Ketika pilihan itu nyata

Ada satu skenario di mana memilih di antara keduanya benar-benar merupakan keputusan, dan ada baiknya kita bersikap konkret tentang hal itu karena tidak jelas.

Ini adalah kasus organisasi media atau olahraga yang sudah memproses dokumen dan ingin menambahkan pemahaman video tingkat poin. Sebuah penyiar dengan pipeline arsip, liga dengan laporan pertandingan dan PDF statistik, pemegang hak dengan teks maupun rekaman — bagi mereka, North Micro Vision Instruct masuk akal sudah ada dalam stack untuk OCR dan ekstraksi bagan, dan Sports Tennis adalah kemampuan baru yang akan mereka tambahkan. Pertanyaannya bukan "yang mana" melainkan "berapa biaya infrastruktur untuk yang kedua bagi saya," dan jawabannya adalah GPU pusat data dan batasan hanya bahasa Inggris.

Di luar kasus itu, model-model tersebut sama sekali tidak bersaing. Jika Anda membutuhkan kemampuan membaca dokumen dalam sebelas bahasa pada kartu workstation, North Micro Vision Instruct adalah jawabannya dan Sports Tennis tidak relevan bagi Anda. Jika Anda perlu mengajukan pertanyaan terstruktur tentang poin tenis dengan konteks audio, Sports Tennis adalah satu-satunya dari keduanya yang dapat melakukannya, dan fakta bahwa model itu tidak memiliki tolok ukur yang dipublikasikan adalah risiko yang akan Anda terima, bukan alasan untuk memilih model lainnya.

Mana yang harus dipilih

Pilih North Micro Vision Instruct jika pekerjaan Anda melibatkan dokumen, bagan, OCR, grounding, atau pemahaman gambar multibahasa, dan jika Anda menghargai vendor yang mempublikasikan angka lemahnya bersama angka kuatnya. Model ini kecil, Apache 2.0, terdokumentasi dengan baik, dan jujur bahwa dirinya bukan model penalaran. MMMU-nya sebesar 0,329 bukanlah kekurangan yang baru Anda temukan belakangan; Cohere memberitahukannya sejak awal.

Pilih NVIDIA NemotronLabs AI for Media - Sports Tennis hanya jika Anda secara spesifik membutuhkan penalaran tenis tingkat poin dengan audio, Anda memiliki GPU 80 GB yang bisa disisihkan, dan Anda nyaman menjadi orang pertama yang mengevaluasinya. Belum ada yang memublikasikan skor untuk model ini, jadi mengunduhnya adalah eksperimennya. Itu bukan alasan untuk menghindarinya — spesialis sempit dengan set pelatihan 43.084 klip yang dilabeli secara teliti justru adalah jenis model yang dapat mengalahkan generalis pada tugasnya sendiri — tetapi itu adalah alasan untuk memperlakukan penerapan pertama sebagai uji coba, bukan komitmen.

Satu hal yang tidak boleh Anda lakukan adalah memperlakukan keduanya sebagai bisa dipertukarkan karena keduanya sama-sama bertuliskan "vision-language model" di kartunya. Pembaca dokumen dan analis tenis tidak pernah menjadi produk yang sama, dan pada pasangan ini perbedaan dalam apa yang mereka lakukan jauh lebih besar daripada perbedaan dalam seberapa baik mereka melakukannya.