
Nemotron Parse 2.0 vs MinerU: Penantang yang Tidak Diumumkan vs Standar Sumber Terbuka
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA-Nemotron-Parse-2.0 dan MinerU memecahkan masalah yang sama dari arah yang berlawanan. Keduanya menerima halaman hasil pindaian atau render dan mengembalikan markdown bersih dan terstruktur dengan tabel, formula, dan urutan baca yang utuh. Namun MinerU adalah pilihan sumber terbuka yang umum — puluhan ribu bintang GitHub, lisensi Apache-2.0, dan API terkelola dengan kuota harian gratis, pilihan pertama yang aman bagi sebagian besar tim dokumentasi. Nemotron Parse 2.0 justru kebalikan dari yang sudah mapan: ia muncul di Hugging Face pada 3 Agustus 2026, NVIDIA belum merilis pengumuman apa pun untuknya, dan kartu modelnya menyertakan serangkaian klaim tolok ukur yang, jika terbukti benar, akan menjadi hal terbesar yang terjadi pada penguraian dokumen terbuka tahun ini. Pasangan ini sengaja dibuat timpang — petahana versus penantang yang tak diumumkan — dan pertanyaan utamanya adalah seberapa berharga tawaran masing-masing pihak sebenarnya.
Apa sebenarnya masing-masing pihak itu
MinerU adalah sistem penguraian dokumen lengkap dari OpenDataLab, kelompok data di balik rilis terbuka Shanghai AI Laboratory. Produk unggulan saat ini adalah MinerU 2.5-Pro, model visi-bahasa 1.2B dalam lini rilis titik 2604/2605 (model 2604 dirilis pada April 2026, disusul pembaruan 2605 setelahnya). Sistem ini bertumpu pada mesin dua tahap — analisis tata letak global kasar, lalu pengenalan yang ditargetkan pada potongan resolusi asli — dan proyek ini membungkus model tersebut dalam pemrosesan PDF, DOCX, PPTX, dan XLSX, deteksi tata letak, pengenalan rumus dan tabel, serta rekonstruksi urutan baca. Sistem ini adalah parser sumber terbuka referensi untuk pra-pemrosesan RAG, dan memiliki komunitas yang membuktikannya.
Nemotron Parse 2.0 adalah vision-encoder-decoder 0.9B dari NVIDIA dalam keluarga yang sama dengan NVIDIA-Nemotron-Parse-v1.2, yang dirilis pada Februari 2026. Model ini menggunakan vision encoder ViT-H yang dibangun di atas backbone C-RADIOv2 milik NVIDIA dan decoder bergaya mBART sepuluh lapis. Input halaman maksimal 2048×1664, generasi berjalan hingga batas 9.000 token, dan menghasilkan keluaran terstruktur yang sama dengan MinerU: markdown atau teks biasa, plus tabel dalam LaTeX, HTML, markdown, JSON, JSON hierarkis, atau CSV, dengan kelas tata letak, kotak pembatas, dan urutan pembacaan. Reponya lengkap—konfigurasi, Dockerfile, rangkaian pengujian dengan keluaran emas—tetapi NVIDIA tidak mempromosikannya, tidak ada pengemasan NIM, dan tidak ada penyedia inferensi yang menghostingnya. Self-hosting adalah satu-satunya opsi saat ini.

Kisah harga: "gratis" berarti dua hal yang berbeda.
Perbedaan praktis terbesar adalah bahwa MinerU gratis untuk dipanggil dan Nemotron Parse 2.0 hanya gratis untuk dijalankan. API resmi MinerU di mineru.net menyediakan tingkatan gratis harian — sekitar 1.000 halaman prioritas tinggi per hari tergantung promosi saat ini — tanpa biaya per panggilan di dalamnya, dan file hingga 200 halaman setiap kali. Di luar kuota, pekerjaan diprioritaskan lebih rendah daripada dikenai biaya, dan host komersial memberi harga model yang dihosting sendiri sekitar sepersepuluh sen per halaman. Jika pipeline Anda membutuhkan ribuan halaman per hari dan Anda tidak ingin mengoperasikan apa pun, MinerU memiliki jalur yang biayanya hampir tidak ada.
Nemotron Parse 2.0 tidak memiliki jalur seperti itu. Bobotnya gratis di bawah NVIDIA Open Model License, tetapi kartu model menyatakan bahwa model ini tidak disebarkan oleh penyedia inferensi mana pun, dan NVIDIA belum menetapkan harga atau mengumumkan opsi hosted. Menggunakannya berarti menyewa atau memiliki GPU, menyiapkan build Transformers atau vLLM dengan dukungan remote-code Nemotron Parse, dan menangani keanehan deployment di bawah ini. Untuk proyek bervolume kecil, itu adalah biaya nyata — GPU jauh lebih mahal daripada tier API gratis untuk beberapa ratus halaman per bulan. Bagi tim yang sudah menjalankan infrastruktur GPU, bobot yang gratis adalah keunggulan sejati; pertanyaannya adalah apakah beban operasional sebanding dengan nilai tambah yang diklaim model.
Kesenjangan tolok ukur: angka-angka ini tidak saling berhadapan
Ini adalah bagian di mana sebagian besar perbandingan diam-diam keliru, jadi mari kita perjelas. Kartu Nemotron Parse 2.0 melaporkan empat tolok ukur: ParseBench keseluruhan pada 0.6391 (naik dari 0.5782 pada v1.2), MOSCAR OCR multibahasa pada 0.9102 BoC F1 (naik dari 0.4410), IndicVisionBench pada 0.7203 ANLS-karakter (naik dari 0.0612), dan subset tulisan tangan OmniDocBench yang diukur sebagai jarak edit teks yang membaik dari 0.9739 menjadi 0.3395. MinerU 2.5-Pro melaporkan rangkaian yang berbeda: skor keseluruhan OmniDocBench v1.6 sebesar 95.69 — mutakhir, di atas model yang jauh lebih besar — ditambah 97.29 pada penguraian formula padat dan jarak edit teks 0.036 pada pengujian OmniDocBench miliknya sendiri.
Kedua model berbagi nama "OmniDocBench," yang membuat keduanya tampak sebanding, padahal metriknya tidak demikian. NVIDIA melaporkan subset khusus tulisan tangan sebagai jarak edit; OpenDataLab melaporkan komposit keseluruhan pada versi tolok ukur yang berbeda. ParseBench adalah suite milik NVIDIA sendiri dan tidak memiliki entri MinerU. MOSCAR dan IndicVisionBench tidak memiliki entri MinerU. Setiap angka di kedua sisi dilaporkan oleh vendor, dan tidak ada satu pun model yang memiliki hasil uji pihak ketiga independen yang dipublikasikan yang memuat model lainnya. Artinya, saat ini belum ada angka yang benar-benar setara yang memeringkatkan Nemotron Parse 2.0 melawan MinerU — siapa pun yang memberi tahu Anda bahwa satu model "menang" dalam perbandingan tolok ukur sedang mengekstrapolasi dari pengujian yang berbeda. Yang bisa Anda katakan secara arah: klaim MinerU sudah matang dan bertahan selama satu tahun digunakan komunitas, sementara klaim Nemotron Parse 2.0 masih baru, belum diaudit, dan — jika lonjakan MOSCAR dan IndicVision-nya terulang — merupakan hal besar khususnya untuk penguraian multibahasa.

Di mana keduanya berbeda pada beban kerja nyata

Kesampingkan tolok ukur tersebut, dan perbedaan yang muncul dalam sebuah pipeline berkaitan dengan cakupan, latensi, dan cakupan multibahasa.
• Cakupan input — MinerU memproses PDF lengkap hingga 200 halaman per file melalui API-nya dan menggabungkan tabel lintas halaman; Nemotron Parse 2.0 menerima gambar halaman hingga 2048×1664 per panggilan, sehingga dokumen 200 halaman membutuhkan 200 permintaan. Jika input Anda adalah PDF, itu adalah perbedaan alur kerja sebelum persoalan akurasi.
• Kematangan penyajian — MinerU menghadirkan backend vLLM dan SGLang dengan throughput yang dipublikasikan (sekitar 2 halaman per detik pada satu A100 melalui mesin asinkronnya), runner Docker, dan API yang dihosting. Kisah penyajian Nemotron Parse 2.0 masih baru dan belum mulus: vLLM memerlukan dukungan kode jarak jauh dan, pada perangkat keras A100/A10, backend atensi Triton; tokenizer menyertakan tokenizer.json yang diserialisasi dengan padding bawaan hingga 9.000 token, yang dalam satu tumpukan penyajian menyebabkan prompt enam token meledak menjadi 54.000 ID token; dan repositori membawa tambalan runtime untuk build vLLM yang tidak mendukung output head terikatnya. Semua ini masih bisa diatasi, tetapi merupakan gesekan yang nyata.
• Multibahasa — di sinilah kartu terkuat Nemotron Parse 2.0. Rilis 2.0 memperluas kosakata dari sekitar 52.000 menjadi 72.000 token, khusus untuk OCR multibahasa, dan peningkatan yang diklaim terkonsentrasi di sana: MOSCAR naik dari 0,44 menjadi 0,91, dan IndicVisionBench (Bengali, Hindi, Tamil, dan tujuh aksara Indic lainnya) naik dari 0,06 menjadi 0,72. MinerU mendukung 109 bahasa sebagai fitur unggulan, tetapi buktinya adalah gabungan OmniDocBench, bukan rincian per aksara. Jika korpus Anda sarat dengan aksara Indic atau aksara bersumber daya rendah, angka-angka Nemotron Parse 2.0 adalah klaim yang lebih menarik untuk diuji — angka-angka tersebut juga yang paling sedikit diverifikasi secara independen.
• Tulisan tangan — delta tunggal terbesar pada kartu NVIDIA adalah tulisan tangan: jarak edit pada subset catatan OmniDocBench turun dari 0.97 menjadi 0.34. Jarak edit teks MinerU sendiri sebesar 0.036 adalah pada keseluruhan proses OmniDocBench, bukan subset tulisan tangan, jadi sekali lagi angka-angka tersebut tidak saling berhadapan. Tetapi catatan tulisan tangan adalah mode kegagalan klasik bagi keduanya, dan ini adalah satu-satunya area di mana peningkatan yang diklaim oleh Nemotron Parse 2.0 cukup besar untuk membenarkan pengujian langsung pada halaman-halaman Anda sendiri.
Siapa yang harus memilih yang mana
Pilih MinerU jika Anda menginginkan parser yang dapat langsung digunakan hari ini: tier harian gratis, penyajian yang matang, input PDF lengkap, lisensi Apache-2.0 tanpa tinjauan kepatuhan, dan komunitas yang cukup besar sehingga jawaban untuk pertanyaan pengaturan sudah tersedia. Ini adalah pilihan default karena suatu alasan, dan untuk sebagian besar beban kerja prapemrosesan RAG, ini adalah pilihan dengan risiko lebih rendah.
Pilih Nemotron Parse 2.0 jika Anda sudah nyaman melakukan self-hosting model — terutama jika Anda berkecimpung di dunia NVIDIA NIM atau NeMo, karena v1.2 disajikan sebagai NIM dan 2.0 tampaknya menjadi penerusnya — dan jika kebutuhan spesifik korpus Anda adalah multibahasa atau tulisan tangan. Tes akhir pekan pada halaman Indic atau halaman yang sarat catatan milik Anda sendiri akan memberi tahu Anda lebih banyak daripada tabel tolok ukur mana pun, karena klaim-klaim tersebut akan terbukti atau runtuh saat diuji dengan data independen. Namun, jangan merencanakan jalur produksi di sekitar model yang belum diumumkan sampai Anda menjalankan pengujian tersebut dan memastikan bahwa keanehan tokenizer dan penyajiannya sudah ditangani dalam tumpukan teknologi Anda.
Mengapa parser bukan satu-satunya biaya dalam pipeline
Apa pun yang Anda pilih, parser biasanya merupakan tahap termurah dalam alur dokumen setelah volumenya benar-benar nyata. Tahap yang mahal adalah LLM yang mengubah markdown yang sudah diurai menjadi ringkasan, catatan terstruktur, atau jawaban — dan di tahap itulah lapisan perutean mengubah kalkulasi biayanya. OrcaRouter menempatkan 200+ model di belakang satu API dengan harga daftar penyedia tanpa markup, sehingga pemotongan harga vendor langsung aktif di hari yang sama saat diumumkan, dan failover otomatis berarti satu penyedia yang mengalami penurunan kinerja tidak menghentikan seluruh pekerjaan ekstraksi. Secara konkret: Anda dapat menguji klaim pengenalan tulisan tangan Nemotron Parse 2.0 terhadap MinerU pada korpus Anda sendiri tanpa mengikat tumpukan model hilir Anda ke salah satu parser, karena pertukaran parser dan lapisan LLM dipisahkan. Kami tidak menghosting salah satu parser tersebut saat ini — Nemotron Parse 2.0 adalah model yang dihosting sendiri dan MinerU berjalan di layanannya sendiri — tetapi lapisan perutean pada tahap LLM justru yang menjaga keputusan parser agar tidak menjadi keputusan yang mengunci.
Intinya
MinerU adalah pilihan default yang rasional: matang, gratis dipanggil dalam skala kecil, berlisensi permisif, dan terbukti di produksi. Nemotron Parse 2.0 adalah taruhan yang menarik: model NVIDIA 0,9B yang diam-diam dirilis lima hari lalu, dengan kartu spesifikasi yang mengklaim lompatan dramatis dalam multibahasa dan tulisan tangan yang belum diverifikasi siapa pun secara independen. Jika Anda banyak mengurai dokumen teknis berbahasa Inggris dalam volume besar, MinerU adalah jawabannya dan risiko Nemotron Parse 2.0 tidak sebanding. Jika Anda mengurai aksara Indic atau aksara dengan sumber daya rendah, atau catatan tulisan tangan, klaimnya cukup besar — dan bobotnya cukup gratis — sehingga menjalankan pengujian sendiri itu murah. NVIDIA yang merilis parser baru setiap kuartal (v1.1 pada November 2025, v1.2 pada Februari 2026, 2.0 sekarang) mengindikasikan bahwa pengumuman mungkin akan segera datang; sampai itu terjadi, anggaplah angka 2.0 sebagai indikatif dan uji pada korpus Anda sendiri.
FAQ
Apakah Nemotron Parse 2.0 tersedia melalui API mana pun?
Bukan melalui layanan yang dihosting. Kartu Hugging Face menyatakan bahwa model tersebut tidak diterapkan oleh penyedia inferensi mana pun, dan NVIDIA belum mengumumkan pengemasan atau harga NIM untuk model tersebut, hingga awal Agustus 2026. Satu-satunya cara untuk menjalankannya adalah dengan meng-host sendiri bobotnya melalui Hugging Face Transformers dengan trust_remote_code, atau melalui build vLLM yang menyertakan dukungan kode jarak jauh Nemotron Parse. Sebaliknya, MinerU memiliki API resmi dengan kuota halaman gratis harian.
Model mana yang lebih baik untuk pra-pemrosesan RAG?
{{1}}Untuk pipeline RAG pada umumnya — dokumen teknis berbahasa Inggris dan CJK, tabel, serta tata letak campuran — MinerU adalah pilihan yang lebih aman dan lebih terbukti: ia menerima PDF lengkap, menggabungkan tabel lintas halaman, memiliki layanan yang matang, dan tidak berbiaya apa pun dalam skala kecil melalui tier gratisnya.{{/1}} {{2}}Nemotron Parse 2.0 baru menjadi pilihan yang tepat jika korpus Anda didominasi oleh aksara Indic atau aksara berdaya rendah, catatan tulisan tangan, atau halaman yang sarat grafik yang menjadi pusat klaim keunggulannya — dan meski begitu, verifikasi pada dokumen Anda sendiri sebelum berkomitmen.{{/2}}
Apakah angka-angka benchmark pada dua kartu model tersebut dapat dibandingkan secara langsung?
Tidak. Nemotron Parse 2.0 melaporkan ParseBench (rangkaian milik NVIDIA), MOSCAR, IndicVisionBench, dan subset tulisan tangan OmniDocBench sebagai jarak edit. MinerU 2.5-Pro melaporkan komposit keseluruhan OmniDocBench v1.6 serta metrik formula dan edit teks. Nama tolok ukur yang tumpang tindih tersebut bukan metrik yang sama, tidak ada pengujian independen yang menempatkan kedua model pada tes yang sama, dan semua angka pada kedua kartu dilaporkan oleh vendor. Perlakukan keduanya sebagai indikasi arah, bukan sebagai hal yang dapat dibandingkan secara langsung.
