Kartu judul untuk 'Nemotron Parse 2.0 vs olmOCR': judul utama 'Nemotron Parse 2.0 vs olmOCR', subjudul 'Dua pekerjaan, sama-sama disebut parsing', dengan ilustrasi terbelah — sisi kiri berupa halaman dokumen yang diurai menjadi kotak-kotak pembatas berlabel di bawah keterangan 'layout semantics', sisi kanan berupa baris-baris teks mengalir dengan simbol markdown di bawah keterangan 'linearized markdown'. Logo OrcaRouter dikompositkan di kanan bawah.
Guides & Insights

Nemotron Parse 2.0 vs olmOCR: Dua Pekerjaan, Keduanya Disebut Parsing

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada tanggal 3 Agustus 2026, NVIDIA mengunggah model pengurai dokumen baru ke Hugging Face dan tidak memberi tahu siapa pun. NVIDIA-Nemotron-Parse-2.0 adalah vision-encoder-decoder 0.9B yang kartu modelnya mengklaim lompatan dalam multibahasa dan pemahaman grafik dibanding pendahulunya dari Februari 2026, dan ia mendarat di sudut ekosistem yang sama dengan olmOCR — lebih tepatnya olmOCR-2-7B-1025, linearizer 7B dari Allen Institute for AI yang secara diam-diam menjadi cara default untuk mengubah PDF menjadi data pelatihan LLM. Menyebut ini sebagai head-to-head sama sekali justru jebakannya: kedua model digambarkan sebagai "pengurai dokumen," tetapi keduanya mengembalikan artefak yang berbeda, memasok pipeline yang berbeda, dan angka benchmark mereka tidak pernah benar-benar saling berhadapan. Pertanyaan sebenarnya adalah pekerjaan mana dari dua pekerjaan yang Anda pekerjakan parser untuk melakukannya.

Kedua artefak

Nemotron Parse 2.0 adalah mesin semantik tata letak. Berikan gambar halaman dan perintah tugas, maka ia akan mengembalikan teks plus lapisan semantik di atasnya: kelas tata letak untuk setiap wilayah (judul, bagian, keterangan, tabel, bagan, tajuk, catatan kaki, entri bibliografi), kotak pembatas untuk masing-masing, dan urutan baca di antara semuanya — dengan markdown sebagai salah satu serialisasi opsional di atasnya. olmOCR 2 adalah linierizer. Ia mengambil halaman yang sama dan mengembalikan markdown terlinierisasi yang bersih dengan frontmatter YAML pendek yang mencatat metadata tingkat halaman seperti bahasa utama, koreksi rotasi, dan apakah halaman tersebut berupa tabel atau diagram. Tanpa kotak, tanpa kelas, tanpa geometri: satu proses, teks dalam urutan dokumen.

Artefak menentukan pekerjaannya. Jika pipeline Anda perlu mengutip suatu fakta kembali ke wilayah halaman, menyoroti tabel pada pindaian, atau mengekstrak semantik tata letak untuk kecerdasan dokumen, Anda memerlukan geometri — itulah ruang keluaran Nemotron Parse 2.0. Jika Anda membangun data pelatihan atau memberi makan LLM teks yang hanya mengonsumsi token, geometri hanyalah derau dan markdown linear sudah tepat — itulah keseluruhan desain olmOCR. Anda dapat memasang deteksi tata letak pada keluaran olmOCR dengan detektor terpisah, dan Anda dapat membuang kotak-kotak Nemotron Parse 2.0 dan hanya menyimpan markdown-nya, tetapi setiap model dibangun untuk menjadikan salah satu dari pekerjaan tersebut sebagai kemampuan bawaannya.

Kapal yang tenang: apa yang ditunjukkan repo, apa yang tidak dikonfirmasi

NVIDIA-Nemotron-Parse-2.0 muncul di Hugging Face pada 3 Agustus 2026 tanpa pengumuman, tanpa posting blog, dan tanpa kemasan NIM. Yang dapat diketahui adalah repo tersebut. Ini adalah vision-encoder-decoder 0.9B: encoder gambar ViT-H yang dibangun di atas backbone C-RADIO milik NVIDIA, adapter konvolusi-1D ringan, dan decoder bergaya mBART sepuluh lapis. Tokenizer bertambah sekitar 20.000 entri menjadi sekitar 72.000 total, secara eksplisit untuk dukungan multibahasa yang lebih efisien, dan kartu model mencantumkan penguraian sadar-bagan sebagai fitur utama melalui token class_Chart baru, ditambah keluarga serialisasi tabel (LaTeX, HTML, markdown, JSON, JSON hierarkis, CSV). Dua prosesor logits opsional disertakan: satu yang menghentikan keluaran terstruktur berulang, dan satu yang memaksa struktur tabel pada potongan tabel. Resolusi input yang direkomendasikan berkisar sekitar 1024×1280 hingga 1664×2048, generasi berjalan hingga batas 9.000 token, dan kartu model mencantumkan Transformers, vLLM, SGLang, dan Docker Model Runner sebagai runtime pada perangkat keras Ampere, Hopper, Blackwell, dan Turing.

Namun, klaim-klaim tersebut semuanya berasal dari NVIDIA sendiri, dan belum ada satu pun yang direproduksi secara independen. Kartu tersebut melaporkan ParseBench secara keseluruhan pada 0.6391 (naik dari 0.5782 milik v1.2), MOSCAR OCR multibahasa pada 0.9102 BoC-F1 (naik dari 0.4410), IndicVisionBench pada 0.7203 ANLS-karakter (naik dari 0.0612), dan subset tulisan tangan OmniDocBench yang membaik dari 0.9739 menjadi 0.3395 pada jarak edit teks. Itu adalah lompatan terbesar, dan juga yang paling tidak terverifikasi: ParseBench adalah rangkaian milik NVIDIA sendiri, dan belum ada pihak ketiga yang menjalankan Parse 2.0 terhadap korpus independen. Yang belum dikonfirmasi melampaui skor — tidak ada inferensi yang di-host (kartu tersebut menyatakan model tidak di-deploy oleh penyedia inferensi mana pun), tidak ada harga, dan tidak ada jadwal yang diumumkan untuk keduanya.

Screenshot of the Hugging Face repository page for nvidia/NVIDIA-Nemotron-Parse-2.0, showing the model card description (document images into structured text, layout classes, bounding boxes, reading order), the note that 2.0 adds a roughly 20k-token vocabulary expansion over v1.2 for multilingual support plus chart-aware parsing with the class_Chart token, the nvidia-open-model-license tag, 0.9B params, 2,156 downloads last month, and the line 'This model isn't deployed by any Inference Provider.'

olmOCR 2: standar yang sudah menjadi tolok ukur semua orang

olmOCR adalah model yang menciptakan tolok ukur yang kini menjadi perdebatan kategori ini. olmOCR-2-7B-1025, dirilis pada 22 Oktober 2025, adalah model visi-bahasa 7B yang disetel halus dari Qwen2.5-VL-7B-Instruct pada korpus olmOCR-mix-1025 yang terdiri dari 270.000 halaman, kemudian disempurnakan dengan pembelajaran penguatan GRPO terhadap imbalan "unit test" otomatis — pemeriksaan deterministik bahwa tabel mempertahankan strukturnya, formula ditranskripsikan dengan tepat, dan urutan baca terjaga. Kerangka unit test itu menjadi olmOCR-Bench, sekitar 1.400 PDF dan lebih dari 7.000 pemeriksaan, dan telah menjadi tolok ukur industri de facto: Marker, MinerU, dan belasan model OCR komersial kini mempublikasikan hasilnya di sana. olmOCR 2 sendiri mencetak skor 82,4 secara keseluruhan di tolok ukur tersebut, sekitar empat poin di atas rilis sebelumnya dan di atas angka Marker (76,1) dan MinerU (75,8) yang dikutip AI2 di halaman yang sama.

olmOCR juga merupakan opsi yang lebih matang dalam pasangan ini. Ia berlisensi Apache-2.0, bobotnya telah diunduh sekitar 218.000 kali dalam sebulan terakhir, dan toolkit olmOCR menangani rendering, rotasi, dan percobaan ulang dalam skala besar di backend vLLM — menurut estimasi batch AI2, biaya pipeline sekitar $176–190 per juta halaman pada GPU sewaan, dan build FP8 berjalan sekitar 3.400 token keluaran per detik pada satu H100, cukup cepat sehingga postingan rilisnya mengutip "10.000 halaman untuk kurang dari $2." Komprominya adalah bahasa: olmOCR secara eksplisit dibangun dan di-benchmark untuk cetakan digital berbahasa Inggris, dan kartu modelnya menandainya sebagai bahasa Inggris. Seluruh daya tarik Nemotron Parse 2.0 justru kebalikannya — klaim peningkatannya terkonsentrasi pada aksara CJK dan Indic.

Screenshot of the Hugging Face repository page for allenai/olmOCR-2-7B-1025, showing the Apache-2.0 license tag, the English language tag, 217,859 downloads last month, 8B params, the description that it is the BF16 release fine-tuned from Qwen2.5-VL-7B-Instruct on the olmOCR-mix-1025 dataset with additional GRPO RL training for math equations and tables, the note that the best way to use it is the olmOCR toolkit via vLLM, and the line 'This model isn't deployed by any Inference Provider.'

Enam baris di mana trade-off-nya terlihat

Kedua model bersifat open-weight, keduanya berjalan di Transformers, vLLM, atau SGLang, dan keduanya dapat di-host sendiri saat ini. Pada dimensi yang penting untuk memilih di antara keduanya:

• Ukuran — Nemotron Parse 2.0 adalah 0.9B; olmOCR 2 adalah 7B. Kira-kira delapan kali parameternya, kira-kira delapan kali batas bawah VRAM.

• Output — Nemotron Parse 2.0 mengembalikan teks, kelas tata letak, kotak pembatas, urutan pembacaan, dan markdown; olmOCR 2 mengembalikan markdown terlinearisasi dengan blok metadata YAML.

• Multibahasa — Nemotron Parse 2.0 mengklaim dukungan CJK dan Indic yang kuat (MOSCAR 0.9102, IndicVisionBench 0.7203, dilaporkan vendor); olmOCR 2 mengutamakan bahasa Inggris.

• Skor unggulan — Nemotron Parse 2.0 melaporkan ParseBench 0.6391 (milik NVIDIA sendiri, tidak diaudit); olmOCR 2 memperoleh 82.4 pada olmOCR-Bench (milik AI2 sendiri, sepuluh bulan digunakan ulang oleh komunitas).

• Lisensi — Nemotron Parse 2.0 dilisensikan di bawah NVIDIA Open Model License; olmOCR 2 adalah Apache-2.0.

• Dikirim — Nemotron Parse 2.0 tiba pada 3 Agustus 2026, tanpa pengumuman; olmOCR 2 dikirim pada 22 Oktober 2025, dengan pos peluncuran.

Two-column comparison scoreboard titled 'Nemotron Parse 2.0 vs olmOCR — the scoreboard'. Left column 'Nemotron Parse 2.0': Size 0.9B vision-encoder-decoder, Output bboxes, classes, reading order + markdown, Multilingual CJK + Indic strong, Score ParseBench 0.6391 (vendor), License NVIDIA Open Model, Shipped Aug 3, 2026 unannounced. Right column 'olmOCR 2': Size 7B VLM (Qwen2.5-VL), Output linearized markdown + YAML metadata, Multilingual English-first, Score olmOCR-bench 82.4, License Apache 2.0, Shipped Oct 22, 2025. Footer: 'Nemotron scores vendor-reported (NVIDIA); olmOCR scores per AI2's olmOCR-bench.' OrcaRouter logo composited bottom-right.

Tiga tempat di mana keputusan itu benar-benar berdampak

Skala dan latensi. Decoder 0.9B jauh lebih murah untuk disajikan daripada VLM 7B: GPU yang lebih kecil, VRAM yang lebih sedikit, lebih banyak halaman per detik pada perangkat keras yang sama, dan biaya per halaman yang lebih rendah setelah Anda membayar waktu GPU. Jika Anda sudah menjalankan infrastruktur GPU dan korpus Anda besar, itu adalah perbedaan bulanan yang nyata. Angka olmOCR sendiri menunjukkan seberapa cepat model 7B dapat dibuat dengan kuantisasi FP8 — tetapi model tersebut masih membutuhkan GPU kelas H100 untuk mencapainya; batas minimum perangkat keras Nemotron Parse 2.0 adalah kartu era Ampere.

Multibahasa. Ini adalah baris yang paling asimetris. Nemotron Parse 2.0 memperluas tokenizer-nya sekitar 20.000 entri khusus untuk OCR multibahasa, dan klaim peningkatan pada kartunya terkonsentrasi pada skrip Indic dan CJK. olmOCR 2 tidak membuat klaim semacam itu — tag bahasanya adalah bahasa Inggris. Jika korpus Anda adalah bahasa Hindi, Tamil, Bengali, Jepang, atau skrip campuran, angka Nemotron Parse 2.0 adalah angka yang layak diuji, justru karena angka tersebut dilaporkan oleh vendor dan masih baru.

Realitas penyajian (serving). olmOCR 2 sudah sepuluh bulan dan toolchain-nya membosankan dengan cara yang baik. Nemotron Parse 2.0 baru berumur lima hari dan kisah penyajiannya masih terlihat muda: vLLM membutuhkan build dengan dukungan remote-code Nemotron Parse, output head yang terikat membuat sebagian build vLLM 0.20 tersandung (repo menyertakan patch runtime), dan tokenizer.json membawa padding terserialisasi hingga 9.000 token — salah satu stack penyajian pernah mengalami prompt enam token yang meluas menjadi 54.000 token ID sebelum ditambal. Tidak ada yang fatal, tetapi ini persis jenis gesekan yang Anda anggarkan untuk model baru.

Pilih satu untuk pipeline Anda

Pilih olmOCR 2 jika Anda membangun data pelatihan LLM atau pipeline ekstraksi teks bervolume tinggi untuk dokumen berbahasa Inggris. Anda mendapatkan toolkit yang matang, lisensi Apache-2.0, tolok ukur yang kini menjadi acuan industri, dan jalur batch yang sudah mapan. Mode kegagalan yang diterimanya adalah cakupan bahasa.

Pilih Nemotron Parse 2.0 jika pipeline Anda membutuhkan {{1}}geometri — kelas tata letak, kotak pembatas, dan urutan pembacaan untuk pengambilan tertambat atau intelijen dokumen —{{/1}} atau jika korpus Anda banyak berisi {{2}}halaman Indic, CJK, atau tulisan tangan,{{/2}} di mana {{3}}klaim keunggulannya berada.{{/3}} {{4}}Ukuran 0.9B membuat pengujian akhir pekan menjadi murah bahkan jika Anda tidak yakin.{{/4}} Mode kegagalan yang diterima adalah bahwa {{5}}setiap angka pada kartu adalah milik NVIDIA sendiri dan dapat berubah di bawah evaluasi independen.{{/5}}

Jika input Anda sebagian besar berupa PDF digital berbahasa Inggris dan yang Anda butuhkan hanyalah markdown yang bersih, {{1}}olmOCR 2{{/1}} adalah default dengan risiko lebih rendah. Jika Anda sudah self-hosting dan kasus penggunaan multibahasa atau berbasis tata letak memang nyata, {{2}}Nemotron Parse 2.0{{/2}} adalah taruhan yang lebih menarik — uji pada halaman Anda sendiri sebelum berkomitmen.

Cegah pilihan parser agar tidak menjadi pengunci.

Pipeline dokumen memiliki tahap parser dan kemudian tahap LLM, dan parser biasanya menjadi tahap termurah setelah volume benar-benar ada — LLM yang mengubah markdown hasil parsing menjadi ringkasan, rekaman terstruktur, atau jawaban adalah tempat biaya meningkat. Itulah tahap yang diubah oleh lapisan routing. OrcaRouter menempatkan 200+ model di belakang satu API dengan harga daftar penyedia tanpa markup, sehingga penurunan harga vendor langsung berlaku pada hari yang sama, dan failover otomatis mencegah satu penyedia yang mengalami penurunan kinerja menghentikan pekerjaan batch. Tidak ada parser dalam perbandingan ini yang ada di katalog kami — kedua model card menyatakan bahwa keduanya tidak digunakan oleh penyedia inferensi mana pun, jadi ini adalah keputusan self-host — tetapi alasan untuk menjaga parser tetap terpisah dari tumpukan model Anda adalah persis apa yang diperoleh dari routing di sisi hilir: ganti Nemotron Parse 2.0 dengan olmOCR 2, atau sebaliknya, tanpa menyentuh satu integrasi pun, karena lapisan LLM tetap berada di belakang API satu-kunci yang sama.

FAQ

Model mana yang menang pada benchmark?

Bukan keduanya — angka-angka tersebut tidak saling berhadapan. Nemotron Parse 2.0 melaporkan ParseBench, MOSCAR, IndicVisionBench, dan subset tulisan tangan OmniDocBench, semuanya milik NVIDIA dan tidak ada satu pun yang direproduksi secara independen. olmOCR 2 melaporkan olmOCR-Bench, tolok ukur milik AI2 yang kini digunakan oleh industri lainnya. Tidak ada pihak ketiga yang menjalankan kedua model pada korpus yang sama, sehingga klaim "pemenang" secara langsung hanyalah ekstrapolasi. Secara arah: angka-angka olmOCR telah bertahan sepuluh bulan digunakan komunitas; angka Nemotron Parse 2.0 masih baru dan bisa berubah.

Apakah Nemotron Parse 2.0 benar-benar lebih baik dalam menangani dokumen non-Inggris?

Itulah klaimnya — perluasan kosakata sekitar 20.000 token, plus MOSCAR pada 0,9102 dan IndicVisionBench pada 0,7203, keduanya dilaporkan vendor dan keduanya naik tajam dari v1.2. olmOCR 2 tidak membuat klaim multibahasa dan diberi label English. Namun, sampai ada hasil uji independen, anggap keunggulan multibahasa Nemotron Parse 2.0 sebagai hal yang menjanjikan namun belum terverifikasi, dan uji pada halaman Indic atau CJK Anda sendiri sebelum mengandalkannya.

Apakah saya perlu GPU yang lebih besar untuk salah satunya?

Ya, dan ini melacak perbedaan ukuran. Nemotron Parse 2.0 dengan 0.9B muat di kartu era Ampere yang sederhana dan merupakan opsi per halaman yang lebih murah pada perangkat keras yang sudah Anda miliki. VLM 7B dari olmOCR 2 membutuhkan GPU yang jauh lebih besar; build FP8-nya mencapai sekitar 3.400 token output per detik pada H100, menurut AI2.

Mana yang lebih baik untuk preprocessing RAG?

Tergantung pada kebutuhan retriever Anda. Jika Anda menautkan jawaban kembali ke wilayah halaman, memerlukan kelas tata letak, atau ingin mengindeks tabel dan bagan sebagai unit tersendiri, bounding boxes dan kelas Nemotron Parse 2.0 memberikan itu secara native. Jika tumpukan RAG Anda hanya mengonsumsi teks bersih dan korpus Anda berbahasa Inggris, markdown linear olmOCR 2 sudah terbukti, lebih sederhana, dan didukung oleh toolkit yang matang.

Intinya

NVIDIA merilis parser sungguhan minggu ini dan tidak memberi tahu siapa pun; AI2 merilisnya sepuluh bulan lalu dan memberikan tolok ukur untuk kategori tersebut. Nemotron Parse 2.0 adalah {{1}}pilihan yang lebih cocok{{/1}} saat Anda memerlukan semantik tata letak, cakupan multibahasa, atau ekstraksi tulisan tangan dengan anggaran kecil — dan area yang angkanya paling belum terverifikasi justru merupakan area yang diklaimnya menang. olmOCR 2 adalah {{2}}pilihan yang lebih cocok{{/2}} saat Anda memerlukan teks linear berskala besar untuk dokumen berbahasa Inggris dan menginginkan toolchain yang stabil selama sepuluh bulan. Keduanya belum di-deploy di mana pun, jadi ini tetap keputusan self-host; {{3}}cara termurah{{/3}} untuk melakukannya adalah menjalankan keduanya pada halaman-halaman tersulit Anda sendiri dan mengamati di mana masing-masing gagal.