Kartu judul hero untuk perbandingan 'EVIE-8B vs EVIE-Preview-4.5B' dengan subjudul 'Peningkatan 1,39 Poin untuk Vektor 32x Lebih Lebar', menampilkan visual datar dua panel: di kiri terdapat tumpukan tinggi halaman dokumen di samping label 4096D, di kanan terdapat halaman dokumen kompak di samping ikon hard drive kecil dengan label 128D, garis timbangan tipis di tengah antara kedua panel, teks footer 'Dengan retriever dokumen visual Tencent mana sebaiknya Anda mengindeks?' dan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

EVIE-8B vs EVIE-Preview-4.5B: Peningkatan 1,39 Poin untuk Vektor 32× Lebih Luas

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tiga minggu setelah Tencent merilis EVIE-Preview-4.5B dan menyebutnya sebagai retriever dokumen visual paling akurat di papan ViDoRe, Tencent merilis EVIE-8B dan diam-diam menggeser patokan yang menjadi pijakan model 128 dimensi buatannya sendiri. EVIE-8B adalah model guru andalan berukuran 8.41B dengan embedding per token 4096 dimensi; sementara EVIE-Preview-4.5B adalah retriever ringkas berukuran 4.54B yang jualan utamanya adalah bahwa 128 dimensi sudah cukup untuk mengalahkan model yang ukurannya empat kali lebih besar. Pada papan peringkat terbaru di dalam kartu EVIE-8B, EVIE-Preview-4.5B kini duduk di posisi ketiga dalam keluarganya sendiri—di belakang EVIE-8B yang baru dan di belakang EVIE-4.5B, sebuah model murid yang diluncurkan Tencent pada pagi yang sama. Jika Anda memilih di antara dua model yang disebutkan untuk mengindeks korpus dokumen, angka-angka pada kartu Tencent menunjukkan bahwa EVIE-8B lebih baik sekitar 1,39 poin pada ViDoRe V3 dan 3,36 poin pada ViDoRe V2—dan untuk mencapai itu, ia membutuhkan ruang indeks 32 kali lebih besar per vektor. Tulisan ini membahas apakah pertukaran (trade-off) itu layak dilakukan, dan dimulai dengan catatan jujur bahwa kedua kartu skor tersebut adalah milik Tencent sendiri, dan belum ada satu pun yang direproduksi secara independen.

Versi singkatnya

• Pilih EVIE-8B jika akurasi pengambilan adalah hambatan utama dan korpus Anda cukup kecil sehingga ukuran indeks mentah tidak masalah — Anda mengukur dalam ribuan halaman, bukan jutaan, dan Anda menginginkan retriever terbuka terbaik yang pernah diterbitkan Tencent.

• Pilih EVIE-Preview-4.5B jika biaya indeks, latensi per halaman, atau anggaran GPU merupakan kendala nyata — vektor 128D-nya adalah alasan utama ia ada, dan kesenjangan akurasi terhadap 8B kecil di ViDoRe V1 dan sedang di V3.

• Periksa ulang keduanya terhadap EVIE-4.5B sebelum Anda berkomitmen: Tencent merilis model student pada hari yang sama dengan vektor yang dapat dipotong saat runtime dan kompresi token yang mengungguli keduanya pada batas efisiensi, dan perbandingan apa pun yang mengabaikannya sudah usang.

• Perlakukan setiap angka di sini sebagai angka yang dilaporkan vendor. EVIE-8B belum pernah dijalankan oleh siapa pun di luar Tencent; angka-angka EVIE-Preview-4.5B berasal dari skrip reproduksi milik Tencent sendiri.

Di mana mereka sebenarnya berbeda

• Parameter — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• Backbone — Qwen3.5-9B dengan attention dua arah penuh vs Qwen3.5-4B dengan attention linear GatedDeltaNet yang diselingi dan attention penuh.

• Embedding — multi-vektor per-token 4096-dimensi vs multi-vektor per-token 128-dimensi asli, keduanya dinilai dengan interaksi akhir MaxSim.

• ViDoRe V1 (10 tugas, nDCG@5) — 92.18 vs 91.73.

• ViDoRe V2 (4 tugas, nDCG@5) — 74.23 vs 70.87. Ini adalah kesenjangan relatif terbesar.

• ViDoRe V3 (48 tugas, nDCG@10) — 66.75 vs 65.36.

• Anggaran token visual di balik angka-angka headline tersebut — 1.024 token per halaman untuk evaluasi EVIE-8B vs 1.792 token per halaman untuk tingkatan headline EVIE-Preview-4.5B (pada tingkatan pelatihan 768 token, preview tersebut mencatat 64.56).

• Indeks BF16 mentah per 1 juta halaman — tidak dipublikasikan untuk EVIE-8B vs 179.2 GiB pada 768 token/halaman dan 420.5 GiB pada 1,792 untuk pratinjau.

• Lisensi dan rilis — Apache-2.0, rilis senyap 2026-09-04 vs Apache-2.0, rilis senyap 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Papan skor di atas mengulang potret yang sama. Perhatikan dua catatan penting saat membacanya: kolom {{1}}EVIE-8B{{/1}} dan kolom {{2}}EVIE-Preview-4.5B{{/2}} berasal dari dua kartu model Tencent yang berbeda, serta angka utama V3 milik 8B diukur dengan anggaran token visual per halaman yang lebih rendah daripada angka utama versi pratinjau.

Dua kartu Tencent, berbicara satu sama lain

Kerangka yang jujur untuk pertandingan ini adalah bahwa ini adalah pertengkaran keluarga, bukan kontes independen. Kartu EVIE-Preview-4.5B yang diterbitkan pada 17 Agustus mengklaim "Rank #1 on ViDoRe V3" dengan skor 65.36 nDCG@10, mengalahkan webAI-ColVec1.1-8b dengan selisih 0.04. Kartu EVIE-8B yang diterbitkan pada 4 September mencantumkan kembali 65.36 yang sama sebagai angka terbaik ketiga di halaman tersebut, di bawah EVIE-8B dengan 66.75 dan EVIE-4.5B dengan 66.02, serta menunjukkan bahwa 8B memenangkan seluruh delapan domain publik ViDoRe V3 melawan versi preview. Kedua papan skor diproduksi dengan kerangka evaluasi milik Tencent sendiri, dan belum ada satu pun model yang memiliki hasil uji independen di literatur mana pun. Jadi perbandingan yang Anda baca adalah laporan Tencent tentang Tencent yang mengalahkan Tencent — konsisten secara internal, kemungkinan dirancang seperti itu dengan sengaja, dan belum diverifikasi oleh siapa pun yang tidak memiliki kepentingan atas hasilnya.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

Kartu tencent/EVIE-8B di atas adalah tampilan publik penantang: guru unggulan 8.41B dengan embedding 4096D dan tabel ViDoRe terbaru keluarga di bagian atas.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

Kartu tencent/EVIE-Preview-4.5B di atas adalah milik petahana: sebuah retriever 4.54B yang vektor asli 128D dan perhitungan biaya indeks yang dipublikasikan masih menjadi fitur utamanya.

Pertanyaan bernilai 1,39 poin

Selisih mentah pada ViDoRe V3 memang kecil — hanya 1,39 poin nDCG@10 antara 66,75 milik EVIE-8B dan 65,36 milik EVIE-Preview-4.5B — dan hal itu disertai catatan kaki mengenai anggaran token yang penting untuk deployment. Protokol evaluasi EVIE-8B membatasi dokumen hingga 1.024 token visual per halaman; versi pratinjau membutuhkan 1.792 token per halaman untuk mencatatkan skor utamanya 65,36, dan hanya mencetak 64,56 pada anggaran pelatihan 768 token miliknya sendiri. Berdasarkan angka-angka itu, EVIE-8B bukan sekadar lebih akurat pada anggaran yang sebanding — ia lebih akurat pada anggaran yang lebih kecil, dan itulah arah yang Anda inginkan untuk latensi per halaman. Kemenangan relatif yang lebih besar ada di ViDoRe V2, tempat EVIE-8B melaporkan 74,23 berbanding 70,87 milik versi pratinjau — lompatan 3,36 poin pada papan peringkat yang mencakup tugas-tugas dokumen sintetis yang lebih sulit. ViDoRe V1, papan peringkat tertua dan paling jenuh, nyaris tidak bergerak: 92,18 berbanding 91,73. Pola tersebut — datar di tempat semua model sudah mendekati batas atas, mencolok di tempat tugas-tugasnya lebih baru dan lebih sulit — adalah profil peningkatan kapabilitas yang sesungguhnya, bukan sekadar noise papan peringkat. Namun, itu tetaplah hasil pengukuran Tencent sendiri.

Indeks adalah lawan yang sesungguhnya.

Akurasi hanyalah separuh dari keputusan ini, karena kedua model membuat janji yang sangat berbeda tentang apa yang Anda simpan. Alasan keberadaan EVIE-Preview-4.5B adalah vektor token 128-dimensi aslinya: kartu tersebut memublikasikan perhitungan indeks yang tepat (179.2 GiB indeks BF16 mentah per juta halaman pada anggaran pelatihannya, 420.5 GiB pada tingkat ekstrapolasi) dan menunjukkan bahwa vektor yang lebih sempit memangkas ruang penyimpanan dan kerja penilaian MaxSim secara proporsional langsung. Vektor token EVIE-8B berdimensi 4096 — 32 kali lebih lebar per vektor — dan kartu EVIE-8B tidak memublikasikan angka ukuran indeks sama sekali. Kelalaian itu sendiri adalah informasi: pada jumlah token per halaman yang sama, indeks EVIE-8B BF16 mentah berada pada urutan 32× milik pratinjau, yang menempatkan korpus sejuta halaman dalam rentang multi-terabyte sebelum kuantisasi dan menjadikan model unggulan ini sesuatu yang Anda arahkan ke beberapa ratus ribu halaman, bukan sesuatu yang dengan santai Anda hosting dalam skala besar. Lebar model unggulan membeli ketepatan penelusuran; ia tidak membeli kemampuan penyebaran.

Opsi ketiga yang Tencent kirim pada hari yang sama.

Tidak ada versi jujur dari perbandingan ini yang berhenti pada dua model yang disebutkan, karena rilis yang memuat EVIE-8B juga memuat EVIE-4.5B — sebuah student model 4.61B yang disuling dari teacher 8B, dengan satu proyeksi 2048 dimensi yang pada saat runtime dipangkas menjadi 64, 128, 256, 512, 1024, atau 2048 dimensi, plus lintasan kompresi token tanpa pelatihan yang oleh Tencent disebut HAC, yang mengelompokkan token visual sebuah halaman menjadi 32–64 vektor dan, menurut kartu modelnya, jejak indeks sebesar 3,81 GiB per juta halaman. Pada tabel Tencent sendiri, EVIE-4.5B mencetak skor 66,02 di ViDoRe V3 — hanya tertinggal 0,73 dari teacher 8B dan unggul 0,66 atas EVIE-Preview-4.5B — yang menjadikannya jawaban atas dilema persis yang diajukan perbandingan ini. Jika yang Anda inginkan adalah "sebagian besar akurasi 8B tanpa indeks 8B," Tencent sudah mengirimkan model itu, dan model tersebut bukan salah satu dari dua model yang menjadi judul halaman ini. Kasus EVIE-Preview-4.5B yang tersisa memang sempit tetapi nyata: model itu adalah checkpoint yang sudah dipakai di produksi oleh siapa pun yang menyebarkannya pada bulan Agustus, dan profil 128D tetapnya lebih mudah dipahami daripada matryoshka yang meminta Anda memilih dimensi saat runtime.

Dengan yang mana sebaiknya Anda mengindeks?

{{1}}Cocokkan model dengan kendala yang benar-benar mengikat:{{/1}}

• Gunakan indeks EVIE-8B jika Anda membangun titik acuan akurasi — sebuah tolok ukur, korpus hukum atau ilmiah bernilai tinggi dengan ratusan ribu halaman, atau sistem di mana kegagalan pengambilan data berbiaya mahal dan penyimpanan murah. Anda membayar untuk puncak kurva keluarga ini, dan keluarga tersebut memang merancang model student 4.5B sebagai hal yang nanti Anda skalakan.

• Tetap menggunakan EVIE-Preview-4.5B jika Anda sudah mengindeks dengannya dan kualitas terukur masih dapat diterima — indeks ulang adalah biaya nyata, dan gain V3 yang ingin Anda kejar hanya 1,39 poin pada kartu vendor yang belum dikonfirmasi secara independen oleh siapa pun.

• Evaluasi EVIE-4.5B sebelum keduanya jika Anda memulai dari awal pada skala yang berarti. Pemotongan Prefix-MRL dan kompresi HAC ditujukan langsung pada perhitungan penyimpanan di atas, dan angka-angka Tencent sendiri menempatkannya dalam jarak dekat dari guru.

Tidak satu pun dari ketiganya memiliki API yang dihosting di platform mana pun, termasuk OrcaRouter. Jadi, tahap retrieval tetap menjadi keputusan self-hosted apa pun pilihan Anda. Tahap setelahnya tidak harus demikian. Router seperti yang dijalankan OrcaRouter di 200+ model menjaga model yang membaca halaman hasil retrieval dan menulis jawaban tetap berada di balik satu API, dengan failover otomatis di seluruh penyedia dan harga daftar penyedia diteruskan dengan markup 0% — yang memang merupakan pengaturan yang Anda inginkan ketika retriever yang memberinya masukan adalah checkpoint berumur tiga hari dengan klaim yang belum terverifikasi. Bangun indeks dengan retriever yang sesuai dengan penyimpanan Anda, dan biarkan seluruh pipeline lainnya tetap dapat ditukar sampai seseorang di luar Tencent mengonfirmasi kartu skor mana yang sungguh asli.