
NVIDIA-Nemotron-Parse-2.0: NVIDIA Diam-diam Meluncurkan Parser Dokumen yang Lebih Cerdas
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenBARUQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 591 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3055Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1653Kecerdasan69Koding60Matematika
NVIDIA-Nemotron-Parse-2.0 muncul di Hugging Face pada 3 Agustus 2026, dan hingga tulisan ini dibuat, lima hari kemudian, NVIDIA masih belum mengumumkannya — tidak ada posting blog, tidak ada siaran pers, tidak ada unggahan di X. Repo-nya lengkap: sebuah vision-encoder-decoder 0.9B, kartu model dengan tabel benchmark lengkap terhadap NVIDIA-Nemotron-Parse-v1.2, konfigurasi, Dockerfile, rangkaian pengujian, dan bahkan sebuah pull request vLLM yang sudah merujuk kepala tambahan model baru tersebut. Rilis lengkap tanpa kemeriahan apa pun adalah jenis sinyal yang layak untuk dilihat sebagai "apa yang kita ketahui sejauh ini", dan itulah yang dimaksud di sini: fakta-fakta yang ditetapkan repo tersebut, angka-angka yang masih dilaporkan vendor, dan pertanyaan terbuka yang biasanya akan dijawab oleh sebuah pengumuman.
Apa itu NVIDIA-Nemotron-Parse-2.0
Nemotron Parse adalah model pengurai dokumen dari NVIDIA: Anda memberinya halaman yang dipindai atau dirender, dan ia mengembalikan teks dalam urutan baca, kotak pembatas dan kelas semantik setiap region, serta markdown — termasuk tabel, dalam pilihan Anda: LaTeX, HTML, markdown, JSON, JSON hierarkis, atau CSV. Model ini bukan LLM tujuan umum dan bukan sekadar mesin OCR biasa. Posisinya berada di antara keduanya: ekstraksi yang peka terhadap tata letak, dirancang untuk memberi masukan pada pipeline RAG, ekstraksi, dan intelijen dokumen.
Versi 2.0 mempertahankan keluarga arsitektur yang sama dengan v1.2, sesuai dengan konfigurasi repo. Enkoder visi adalah ViT-H yang dibangun di atas backbone C-RADIOv2 milik NVIDIA, dekodernya adalah dekoder bergaya mBART sepuluh lapis, dan totalnya sekitar 0,9 miliar parameter. Halaman input dapat mencapai 2048×1664, pembangkitan berjalan hingga batas 9.000 token, dan model memberi tag wilayah dengan serangkaian kelas semantik (teks, judul, tajuk bagian, item daftar, tabel, formula, gambar, keterangan, catatan kaki, kepala/kaki halaman, dan lainnya). Model ini cukup kecil untuk di-host sendiri di satu GPU, yang penting karena itulah satu-satunya cara menjalankannya saat ini.
Apa yang berubah dari v1.2
Bagian menarik dari kartu ini bukanlah modelnya — melainkan delta-nya. NVIDIA-Nemotron-Parse-v1.2 dirilis di Hugging Face pada Februari 2026 dengan kosakata 52.329 token. Versi 2.0 memperluasnya menjadi 72.256 token, lonjakan sekitar 20 ribu token, dan kartu tersebut menjelaskan alasannya secara eksplisit: token tambahan tersebut membeli OCR multibahasa, dengan peningkatan terbesar pada aksara CJK dan Indic. Kartu model juga mencantumkan tiga perubahan lainnya:
• Penguraian yang sadar bagan — sebuah token kelas class_Chart> yang baru, sehingga wilayah bagan mendapatkan kelas semantiknya sendiri alih-alih digabungkan dengan gambar atau tabel.
• Peningkatan ekstraksi teks tulisan tangan — kartu tersebut melaporkan jarak edit teks pada set OmniDocBench Notes turun dari 0,9739 pada v1.2 menjadi 0,3395 (semakin rendah semakin baik), sebuah perubahan besar untuk apa yang secara historis merupakan kasus terlemah bagi model-model ini.
• Penanganan tabel yang lebih baik, digabungkan ke dalam peningkatan ParseBench secara keseluruhan, bukan dilaporkan sebagai angka tersendiri.
Satu detail pelatihan yang perlu diperhatikan: kartu model menyebutkan bahwa 2.0 adalah sup checkpoint berbobot sama dari checkpoint pelatihan dari langkah 58k hingga 66k, yang merupakan resep umum untuk rilis titik yang tenang — ini cenderung membeli ketahanan tanpa pelatihan ulang penuh.
Angka-angka yang dilaporkan kartu
Semua angka berikut berasal dari kartu model milik NVIDIA sendiri, diukur terhadap v1.2, dan belum ada satu pun yang dijalankan secara independen oleh pihak ketiga. Anggaplah angka-angka tersebut sebagai laporan vendor dan bersifat indikatif:
• Skor keseluruhan ParseBench — dari 0.5782 pada v1.2 menjadi 0.6391 pada 2.0. ParseBench adalah benchmark milik NVIDIA yang mencakup fidelitas teks, pemformatan semantik, tabel, bagan, dan penjejakan visual.
• MOSCAR multibahasa BoC F1 — 0.4410 hingga 0.9102. Ini adalah lompatan terbesar di kartu tersebut, dan ini sejalan dengan perluasan kosakata; MOSCAR mencakup Latin, Arab, Sirilik, Tionghoa, Hangul, Jepang, Indik, Ibrani, Thai, Yunani, dan lainnya.
• IndicVisionBench ANLS-character keseluruhan — 0.0612 hingga 0.7203, pada sepuluh bahasa Indic (Bengali, Gujarati, Hindi, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu).
• OmniDocBench Notes jarak edit teks tulisan tangan — 0.9739 hingga 0.3395 (semakin rendah semakin baik).

Skala delta ini adalah alasan mengapa rilis ini penting bahkan tanpa pengumuman. Pergerakan 0.44→0.91 pada metrik F1 OCR multibahasa bukan sekadar rilis minor; sepertinya ini adalah pekerjaan multibahasa yang biasanya menjadi sorotan utama dalam sebuah peluncuran. Apakah peningkatan tersebut bertahan di bawah evaluasi independen adalah pertanyaan yang justru dibiarkan terbuka oleh kurangnya liputan.
Apa yang tidak diceritakan repo kepada kita
Jujur tentang batas-batas adalah inti dari sebuah pos kapal tenang. Repo tersebut tidak mengonfirmasi:
• Apakah 2.0 tersedia (atau akan tersedia) sebagai layanan mikro NVIDIA NIM — v1.2 dilayani melalui API NIM milik NVIDIA sendiri, kartu 2.0 tidak mencantumkan tag NIM dan tidak ada endpoint penerapan, dan halaman repositorinya mencatat bahwa model tersebut "tidak diterapkan oleh Penyedia Inferensi mana pun."
• Harga, jika ada — bobot tidak dikenakan biaya penggunaan, tetapi opsi yang dihosting belum ditentukan harganya atau diumumkan.
• Benchmark independen — belum ada entri Artificial Analysis, LMArena, atau OmniDocBench untuk 2.0, jadi tidak ada yang bisa dipakai untuk memverifikasi angka-angka vendor.
Peta jalan — apakah 2.0 merupakan batu loncatan atau tujuan akhir, dan apakah tindak lanjut bergaya 2.1 akan hadir, tidak diketahui.
Satu hal yang pasti adalah lisensinya: model ini berada di bawah NVIDIA Open Model License, yang mengizinkan penggunaan komersial dan non-komersial, dengan tokenizer di bawah CC-BY-4.0. Jika Anda ingin menggunakannya dalam sebuah produk, hal itu sudah terpenuhi.
Menjalankannya hari ini
Self-hosting adalah satu-satunya opsi saat ini, dan ada beberapa hambatan yang perlu Anda ketahui sebelum merencanakan untuk menggunakannya. Model dimuat di Hugging Face Transformers dengan trust_remote_code, dan vLLM dapat melayaninya — tetapi hanya dengan build vLLM yang menyertakan dukungan remote-code Nemotron Parse. Pada perangkat keras kelas A100/A10, NVIDIA merekomendasikan untuk memaksa backend attention Triton, dan Anda memerlukan empat dependensi tambahan: albumentations, timm, open_clip_torch, dan einops. Ada juga keanehan tied-output-head: 2.0 menjaga head LM tetap terikat dengan embedding decoder, sementara beberapa build vLLM mewujudkan output head terpisah kecuali Anda menambahkan patch runtime bawaan NVIDIA ke PYTHONPATH.
Dua detail penyajian dari ekosistem ini melengkapi hal tersebut. Pertama, sebuah pull request vLLM yang kini terbuka (dalam peninjauan sejak awal Agustus) memungkinkan decoding spekulatif untuk NVIDIA-Nemotron-Parse-2.0 dengan menggunakan kepala prediksi tambahan yang disimpan dalam sidecar auxiliary_prediction_heads.safetensors.extra pada repositori — dokumentasi kartu itu sendiri menyebutkan file tersebut tidak digunakan dalam inferensi standar, sehingga PR ini adalah hal pertama yang benar-benar mengonsumsinya. Pada H100 melalui sensus ParseBench sebanyak 1.005 halaman, penulis melaporkan peningkatan throughput output median sekitar 45% pada konkurensi 1, 41% pada konkurensi 8, dan 40% pada konkurensi 32 dibandingkan dengan decoding token tunggal — semua angka berasal dari PR, belum digabungkan atau direproduksi secara independen. Kedua, sebuah isu Dynamo menandai kendala nyata dalam tokenizer 2.0: ia menyertakan tokenizer.json berseri dengan padding yang sudah tertanam yang mengisi setiap encode menjadi 9.000 token, sehingga tumpukan penyajian yang memuat tokenizer berpadding tersebut dapat menggelembungkan prompt multimodal enam token menjadi 54.000 ID token. Jika Anda melakukan self-host, pastikan jalur penyajian Anda melakukan tokenisasi daring daripada memuat artefak berpadding tersebut.

Di mana posisinya di pasar parsing 2026
Nemotron Parse 2.0 memasuki arena yang ramai dan bergerak cepat. Para pemimpin parsing dokumen open-source saat ini mencakup MinerU 2.5-Pro (model 1.2B dari Shanghai AI Lab) dan PaddleOCR-VL (varian 0.9B dan 7B), yang keduanya mencatatkan skor komposit di kisaran 90-an bawah di papan peringkat OmniDocBench, serta GOT-OCR 2.0 dari StepFun sebagai opsi ringan 580M; di sisi API, Mistral OCR adalah penawaran komersial utama. Ada dua peringatan sebelum Anda mencoba menempatkan 2.0 ke dalam peringkat tersebut. Pertama, angka-angkanya tidak dapat dibandingkan: Parse 2.0 melaporkan ParseBench, rangkaian pengujian milik NVIDIA sendiri, sementara skor para pesaing adalah komposit OmniDocBench — tugasnya berbeda, pembobotannya berbeda, dan belum ada angka yang sebanding secara langsung. Kedua, Anda tidak boleh mengacaukan NVIDIA-Nemotron-Parse-2.0 dengan NVIDIA-Nemotron-OCR-v2, model terpisah dari NVIDIA, yaitu model OCR padat tingkat kata yang dibangun untuk pipeline NeMo Curator. Parse 2.0 adalah parser yang peka terhadap tata letak dan kelas; OCR v2 adalah ekstraktor per kata. Keduanya adalah alat yang saling melengkapi, bukan model yang sama.
Dengan posisi yang jujur, tawaran Parse 2.0 bukanlah "mengungguli semua metrik parsing." Ini adalah parser 0.9B, berlisensi permisif, yang sadar tata letak dan klaimnya menunjukkan lompatan multibahasa yang sangat besar dibanding pendahulunya — dan garis keturunannya (v1.1 pada November 2025, v1.2 pada Februari 2026, 2.0 pada Agustus 2026) menunjukkan NVIDIA merilis parser baru kira-kira setiap kuartal. Bagi tim yang sudah terstandarisasi pada keluarga Nemotron Parse, 2.0 adalah peningkatan pengganti langsung dengan bentuk API yang sama dan kemampuan multibahasa yang jauh lebih kuat. Bagi yang lain, pertanyaannya adalah apakah klaim model yang belum diumumkan ini bertahan dalam pengujian independen.
Peran Lapisan Routing dalam Pipeline Parsing
Model pengurai dokumen biasanya merupakan salah satu tahap dalam pipeline yang lebih panjang, dan tahap-tahap di sekitarnya adalah tempat routing menunjukkan nilainya. Bentuk umumnya adalah: Parse 2.0 mengubah halaman menjadi potongan-potongan terstruktur, kemudian sebuah LLM merangkum, menjawab pertanyaan, mengekstrak entitas, atau menstrukturkan hasil untuk penyimpanan hilir. Tahap LLM itulah tempat platform routing mengubah ekonomi. OrcaRouter menempatkan 200+ model di belakang satu API dengan harga daftar penyedia — markup 0%, sehingga penurunan harga vendor muncul di sisi kami pada hari yang sama saat diumumkan — dengan failover otomatis jika salah satu penyedia mengalami penurunan. Secara konkret, itu berarti parser dapat tetap sementara model yang menafsirkan keluarannya dapat ditukar, dibandingkan, atau dialihkan melalui failover tanpa kontrak kedua atau perubahan kode. Jika tahap parsing menjadi penghambat, Anda menginginkan model yang dapat Anda sesuaikan dan hosting sendiri, yang diberikan Parse 2.0; jika tahap interpretasi adalah biaya variabel, maka itulah tahap yang harus dikelola router. Kami tidak menghosting Parse 2.0 sendiri — ini adalah model self-hosted, bukan API — tetapi parser yang memberi makan LLM justru merupakan pengaturan di mana satu endpoint untuk lapisan LLM terbayar.

Intinya
NVIDIA-Nemotron-Parse-2.0 adalah rilis asli, lengkap, dan belum diumumkan dari 3 Agustus 2026. Repo tersebut menampilkan parser peka-layout 0.9B yang klaim kartunya menunjukkan peningkatan yang sangat besar dalam multibahasa dan tulisan tangan dibandingkan v1.2, dirilis dengan lisensi permisif dan hambatan self-hosting yang nyata di sekitarnya. Tidak ada satu pun angka tersebut yang terverifikasi secara independen, dan tidak ada opsi hosted maupun harga. Langkah yang tepat bergantung pada toleransi risiko Anda: jika Anda mengurai dokumen multibahasa saat ini dan metrik multibahasa adalah yang Anda pedulikan, pergerakan MOSCAR 0,44→0,91 yang diklaim cukup besar untuk membenarkan uji akhir pekan pada korpus Anda sendiri — delta semacam itu adalah tipe yang bisa terulang atau runtuh, dan rilis yang senyap adalah cara termurah untuk mengetahuinya. Jika Anda membutuhkan tolok ukur untuk dikutip atau API yang didukung untuk dijadikan andalan jalur produksi, tunggulah pengumuman atau uji independen. Sementara itu, beginilah penampakan rilis senyap, dan layak untuk diperhatikan.
FAQ
Apakah NVIDIA-Nemotron-Parse-2.0 merupakan sebuah kebocoran atau rilis resmi?
Tidak ada satu pun label yang benar-benar pas. Ini bukan kebocoran dalam arti bobot acak atau parsial — repositori sudah terakit lengkap, dengan kartu model yang terperinci, file konfigurasi, Dockerfile, rangkaian pengujian dengan golden outputs, serta skrip inferensi untuk Transformers dan vLLM. Tetapi ini juga bukan peluncuran dalam arti biasa: NVIDIA tidak mengeluarkan pengumuman apa pun, dan kemasan NIM serta endpoint ter-hosting yang menyertai rilis Nemotron Parse sebelumnya tidak ada. Deskripsi yang akurat adalah rilis lengkap yang belum dipilih vendor untuk dipromosikan — itulah sebabnya label yang jujur di sini adalah "quiet ship," dan itulah mengapa hal-hal yang biasanya diputuskan oleh sebuah pengumuman (harga, peta jalan, ketersediaan ter-hosting) masih menjadi pertanyaan terbuka.
Bagaimana benchmark vendor dibandingkan dengan angka OmniDocBench yang dikutip orang untuk parser lain?
Mereka tidak, secara langsung. Angka-angka pada kartu NVIDIA-Nemotron-Parse-2.0 berasal dari ParseBench, tolok ukur milik NVIDIA sendiri yang mencakup kesetiaan teks, pemformatan semantik, tabel, bagan, dan grounding visual, ditambah MOSCAR, IndicVisionBench, dan subset tulisan tangan OmniDocBench — sementara skor unggulan pasar (MinerU 2.5-Pro, PaddleOCR-VL, Mistral OCR) adalah komposit OmniDocBench. Tugas berbeda, metrik berbeda, belum ada perbandingan apel-ke-apel yang dipublikasikan. Satu-satunya angka yang memang tumpang tindih dengan ekosistem — angka tulisan tangan OmniDocBench Notes — dilaporkan sebagai jarak edit teks terhadap v1.2, bukan sebagai skor komposit, sehingga tetap tidak dapat diperingkatkan dibandingkan yang lain. Sampai evaluasi independen hadir, anggap klaim Parse 2.0 bersifat indikatif dan belum terverifikasi.
Apa yang harus diuji oleh tim sebelum memasukkan ke produksi?
Tiga hal. Pertama, korpus multibahasa Anda sendiri: seluruh daya tarik 2.0 adalah lompatan multibahasa, dan rilis yang tenang adalah situasi yang tepat di mana keuntungan yang diklaim dapat terulang pada data Anda atau tidak — jalankan bahasa yang benar-benar Anda parse sebelum mempercayai kartu tersebut. Kedua, tumpukan self-hosting: pastikan build vLLM Anda memiliki dukungan remote-code Nemotron Parse, terapkan patch tied-output-head, dan verifikasi bahwa jalur serving Anda melakukan tokenisasi online, bukan memuat tokenizer.json yang sudah di-padding, yang dapat memperluas prompt pendek menjadi 9.000 token. Ketiga, soal lisensi dan layanan: bobot (weights) gratis di bawah NVIDIA Open Model License, tetapi tidak ada NIM yang diumumkan, tidak ada harga, dan tidak ada kontrak dukungan — jadi rencanakanlah seputar self-hosting, dan arahkan tahap LLM di hilir melalui lapisan yang memungkinkan Anda mengganti model dan fail-over tanpa rekayasa ulang, yang merupakan bagian platform routing memang dibangun.
