Thẻ tiêu đề chính cho phép so sánh 'EVIE-8B vs EVIE-Preview-4.5B' với phụ đề 'Mức tăng 1,39 điểm cho vector rộng hơn 32 lần', thể hiện bố cục hai bảng phẳng: bên trái là một chồng trang tài liệu cao bên cạnh nhãn 4096D, bên phải là một trang tài liệu nhỏ gọn bên cạnh biểu tượng ổ cứng nhỏ có nhãn 128D, một đường cân bằng mảnh nằm chính giữa hai bảng, dòng chân trang 'Bạn nên lập chỉ mục bằng bộ truy xuất tài liệu trực quan Tencent nào?' và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

EVIE-8B so với EVIE-Preview-4.5B: Mức tăng 1,39 điểm cho các vector rộng hơn 32 lần

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ba tuần sau khi Tencent phát hành EVIE-Preview-4.5B và gọi đây là bộ truy xuất tài liệu trực quan chính xác nhất trên bảng xếp hạng ViDoRe, Tencent tiếp tục phát hành EVIE-8B và âm thầm dời cột gôn mà chính mô hình 128 chiều của họ từng đứng. EVIE-8B là mô hình giáo viên chủ lực 8.41B với embedding 4096 chiều cho mỗi token; EVIE-Preview-4.5B là bộ truy xuất gọn nhẹ 4.54B mà toàn bộ điểm nhấn của nó là 128 chiều đã đủ để đánh bại các mô hình lớn gấp bốn lần. Trên bảng xếp hạng được làm mới trong thẻ EVIE-8B, EVIE-Preview-4.5B hiện đứng thứ ba trong chính gia đình của mình — sau EVIE-8B mới và sau EVIE-4.5B, một mô hình học trò mà Tencent phát hành cùng buổi sáng. Nếu bạn đang chọn một trong hai mô hình được nêu tên để lập chỉ mục cho một kho tài liệu, các con số trên thẻ của Tencent cho thấy bản 8B tốt hơn khoảng 1,39 điểm trên ViDoRe V3 và 3,36 điểm trên ViDoRe V2 — và để đạt được điều đó, nó tiêu tốn không gian chỉ mục gấp 32 lần cho mỗi vector. Bài viết này bàn về việc liệu sự đánh đổi đó có đáng giá hay không, và bắt đầu từ lời cảnh báo trung thực rằng cả hai bảng điểm đều do chính Tencent công bố và chưa một bảng nào được kiểm chứng độc lập.

Phiên bản ngắn

• Chọn EVIE-8B nếu độ chính xác truy hồi là nút thắt và kho ngữ liệu của bạn đủ nhỏ để kích thước chỉ mục thô không thành vấn đề — bạn đang đo ở quy mô hàng nghìn trang, chứ không phải hàng triệu, và bạn muốn bộ truy hồi mở tốt nhất mà Tencent từng công bố.

• Hãy chọn EVIE-Preview-4.5B nếu chi phí lập chỉ mục, độ trễ mỗi trang, hoặc ngân sách GPU là ràng buộc thực sự — vectơ 128D chính là lý do tồn tại của nó, và khoảng cách độ chính xác so với bản 8B là nhỏ trên ViDoRe V1 và vừa phải trên V3.

• Hãy kiểm tra lại cả hai so với EVIE-4.5B trước khi bạn cam kết: Tencent đã phát hành một mô hình học sinh ra cùng ngày với vectơ có thể cắt ngắn trong thời gian chạy và nén token, thứ vượt trội cả hai trên biên hiệu quả, và bất kỳ sự so sánh nào bỏ qua nó đều đã lỗi thời.

• Hãy coi mọi số liệu ở đây là do nhà cung cấp báo cáo. EVIE-8B chưa được ai ngoài Tencent chạy; số liệu của EVIE-Preview-4.5B đến từ các tập lệnh tái tạo của chính Tencent.

Nơi chúng thực sự khác biệt

• Tham số — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• Backbone — Qwen3.5-9B với attention hai chiều đầy đủ so với Qwen3.5-4B với attention tuyến tính GatedDeltaNet xen kẽ và attention đầy đủ.

• Embedding — đa-vector 4096 chiều/token so với đa-vector gốc 128 chiều/token, cả hai đều được chấm điểm bằng MaxSim với cơ chế tương tác muộn.

• ViDoRe V1 (10 tác vụ, nDCG@5) — 92.18 so với 91.73.

• ViDoRe V2 (4 tác vụ, nDCG@5) — 74.23 so với 70.87. Đây là khoảng cách tương đối lớn nhất.

• ViDoRe V3 (48 nhiệm vụ, nDCG@10) — 66.75 so với 65.36.

• Ngân sách token thị giác đằng sau các con số chính đó — 1.024 token/trang cho bản đánh giá của EVIE-8B so với 1.792 token/trang cho bậc chính của EVIE-Preview-4.5B (ở bậc huấn luyện 768 token, bản preview đạt 64,56).

• Chỉ mục BF16 thô trên mỗi 1 triệu trang — không được công bố cho EVIE-8B so với 179.2 GiB ở mức 768 token/trang và 420.5 GiB ở mức 1,792 cho bản xem trước.

• Giấy phép và phát hành — Apache-2.0, phát hành thầm lặng 2026-09-04 so với Apache-2.0, phát hành thầm lặng 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Bảng điểm bên trên lặp lại cùng một bức chân dung. Hãy ghi nhớ hai lưu ý khi đọc: cột EVIE-8B và cột EVIE-Preview-4.5B đến từ hai bảng thông số mô hình Tencent khác nhau, và con số V3 tiêu đề của bản 8B được đo ở ngân sách token thị giác trên mỗi trang thấp hơn so với con số tiêu đề của bản preview.

Hai thẻ Tencent, đang trò chuyện với nhau

Cách nhìn thẳng thắn về cuộc so tài này là đây là chuyện nội bộ gia đình, chứ không phải một cuộc thi độc lập. Thẻ mô hình của EVIE-Preview-4.5B, công bố ngày 17 tháng 8, tuyên bố "Rank #1 trên ViDoRe V3" với 65.36 nDCG@10, vượt webAI-ColVec1.1-8b đúng 0.04. Thẻ mô hình của EVIE-8B, công bố ngày 4 tháng 9, liệt kê lại chính con số 65.36 đó ở vị trí tốt thứ ba trên trang, xếp dưới mức 66.75 của EVIE-8B và 66.02 của EVIE-4.5B, đồng thời cho thấy bản 8B thắng bản preview ở cả tám miền công khai của ViDoRe V3. Cả hai thẻ đều được tạo ra bằng hệ thống đánh giá của riêng Tencent, và cả hai mô hình vẫn chưa có kết quả chạy độc lập nào trong các công bố khoa học. Vậy so sánh bạn đang đọc chỉ là lời tường thuật của Tencent về việc Tencent đánh bại Tencent — nhất quán nội bộ, có vẻ được dàn dựng có chủ đích, và chưa được bất kỳ ai đứng ngoài cuộc xác minh.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

Thẻ mô hình tencent/EVIE-8B ở trên là bề mặt công khai của bên thách thức: một mô hình giáo viên chủ lực 8.41B với embedding 4096 chiều và bảng ViDoRe mới được làm mới của dòng mô hình nằm ở vị trí đầu trang.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

Thẻ tencent/EVIE-Preview-4.5B ở trên là của mô hình đang dẫn đầu: một bộ truy hồi 4.54B mà các vector 128D nguyên bản và phép tính chi phí đánh chỉ mục đã công bố vẫn là đặc trưng cốt lõi của nó.

Câu hỏi 1.39 điểm

Chênh lệch thô trên ViDoRe V3 là nhỏ — 1,39 điểm nDCG@10 giữa mức 66,75 của EVIE-8B và mức 65,36 của EVIE-Preview-4.5B — và nó kèm theo một dấu hoa thị về ngân sách token đáng lưu ý khi triển khai. Giao thức đánh giá của EVIE-8B giới hạn tài liệu ở mức tối đa 1.024 token thị giác mỗi trang; bản preview cần 1.792 token mỗi trang để đạt được mức 65,36 như công bố, và chỉ đạt 64,56 khi dùng đúng ngân sách huấn luyện 768 token của chính nó. Với những con số này, EVIE-8B không chỉ chính xác hơn ở ngân sách tương đương — mà còn chính xác hơn ở ngân sách nhỏ hơn, và đây là hướng bạn mong muốn khi xét đến độ trễ mỗi trang. Mức vượt trội tương đối lớn hơn nằm ở ViDoRe V2, nơi EVIE-8B đạt 74,23 so với 70,87 của bản preview — một bước nhảy 3,36 điểm trên bảng xếp hạng vốn bao gồm các tác vụ tài liệu tổng hợp khó hơn. ViDoRe V1, bảng xếp hạng cũ nhất và bão hòa nhất, gần như không đổi: 92,18 so với 91,73. Khuôn mẫu đó — bằng phẳng nơi mọi mô hình đã gần chạm trần, khác biệt rõ rệt nơi tác vụ mới hơn và khó hơn — là dấu hiệu của sự gia tăng năng lực thực chất chứ không phải nhiễu bảng xếp hạng, nhưng đó vẫn là phép đo do chính Tencent thực hiện.

Chỉ số mới chính là đối thủ thực sự.

Độ chính xác chỉ là một nửa quyết định này, vì hai mô hình đưa ra những cam kết khác hẳn nhau về những gì bạn lưu trữ. Lý do tồn tại của EVIE-Preview-4.5B là vector token 128 chiều nguyên bản của nó: thẻ mô hình công bố phép toán chỉ mục chính xác (179,2 GiB chỉ mục BF16 thô trên mỗi triệu trang ở ngân sách huấn luyện của nó, 420,5 GiB ở bậc ngoại suy) và chỉ ra rằng một vector hẹp hơn sẽ cắt giảm dung lượng lưu trữ và khối lượng tính toán MaxSim theo tỷ lệ thuận trực tiếp. Vector token của EVIE-8B có 4096 chiều — rộng gấp 32 lần mỗi vector — và thẻ EVIE-8B không công bố con số kích thước chỉ mục nào cả. Bản thân sự thiếu sót đó đã là thông tin: ở cùng số token trên mỗi trang, một chỉ mục EVIE-8B BF16 thô lớn gấp khoảng 32 lần bản xem trước, đưa một kho ngữ liệu triệu trang vào phạm vi nhiều terabyte trước khi lượng tử hóa và biến mô hình chủ lực thành thứ bạn hướng vào vài trăm nghìn trang, chứ không phải thứ bạn có thể thoải mái lưu trữ ở quy mô lớn. Chiều rộng của mô hình chủ lực mua được độ tin cậy truy hồi; nó không mua được khả năng triển khai.

Lựa chọn thứ ba mà Tencent phát hành cùng ngày

Không có cách so sánh trung thực nào chỉ dừng lại ở hai mô hình được nêu tên, vì bản phát hành chứa EVIE-8B cũng chứa EVIE-4.5B — một mô hình học sinh 4,61B được chưng cất từ mô hình giáo viên 8B. Mô hình này có một phép chiếu 2048 chiều duy nhất, có thể thu gọn lúc chạy xuống còn 64, 128, 256, 512, 1024 hoặc 2048 chiều, cùng bước nén token không cần huấn luyện mà Tencent gọi là HAC, để gom token thị giác của một trang xuống còn 32–64 vector. Theo model card, mức chiếm dụng chỉ mục của mô hình là 3,81 GiB mỗi triệu trang. Trên chính bảng điểm của Tencent, EVIE-4.5B đạt 66,02 trên ViDoRe V3 — chỉ kém mô hình giáo viên 8B 0,73 và vượt EVIE-Preview-4.5B 0,66 — khiến nó trở thành câu trả lời cho đúng thế lưỡng nan mà cuộc so sánh này đặt ra. Nếu thứ bạn muốn là “phần lớn độ chính xác của 8B mà không cần chỉ mục của 8B,” Tencent đã phát hành mô hình đó, và nó không phải là một trong hai mô hình mà tiêu đề trang này được đặt theo. Lý do còn lại để dùng EVIE-Preview-4.5B tuy hẹp nhưng có thật: đây là checkpoint đã chạy trong sản xuất cho những ai đã triển khai nó từ tháng 8, và cấu hình 128D cố định của nó dễ nắm bắt hơn một matryoshka buộc bạn phải chọn số chiều lúc chạy.

Bạn nên lập chỉ mục bằng gì?

Khớp mô hình với ràng buộc thực sự có hiệu lực:

• Hãy lập chỉ mục tại EVIE-8B nếu bạn đang xây dựng điểm tham chiếu độ chính xác — một benchmark, một kho ngữ liệu pháp lý hoặc khoa học có giá trị cao với hàng trăm nghìn trang, hoặc một hệ thống nơi việc bỏ sót khi truy xuất gây tốn kém và lưu trữ lại rẻ. Bạn đang trả tiền cho phần đỉnh của đường cong dòng mô hình, và dòng mô hình này dự định mô hình student 4.5B sẽ là thứ bạn mở rộng quy mô về sau.

• Hãy tiếp tục sử dụng EVIE-Preview-4.5B nếu bạn đã lập chỉ mục với nó và chất lượng đo được vẫn ở mức chấp nhận được — việc lập chỉ mục lại là một chi phí thực sự, và mức tăng V3 mà bạn đang theo đuổi chỉ là 1.39 điểm trên một bảng điểm nhà cung cấp chưa được ai xác nhận độc lập.

• Hãy đánh giá EVIE-4.5B trước khi chọn một trong hai nếu bạn đang bắt đầu lại ở quy mô đáng kể. Phép cắt ngắn Prefix-MRL và nén HAC nhắm trực tiếp vào phép tính lưu trữ nêu trên, và số liệu của chính Tencent cho thấy nó đã nằm trong khoảng cách có thể đạt tới mô hình giáo viên.

Cả ba đều không có API lưu trữ trên bất kỳ nền tảng nào, kể cả OrcaRouter, vì vậy giai đoạn truy xuất dù thế nào cũng là một quyết định tự lưu trữ. Giai đoạn sau đó thì không nhất thiết phải như vậy. Một bộ định tuyến như loại OrcaRouter vận hành trên hơn 200 mô hình giữ cho mô hình đọc các trang bạn đã truy xuất và viết ra câu trả lời đằng sau một API duy nhất, với khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và giá niêm yết của nhà cung cấp được truyền thẳng với mức chênh lệch 0% — đây chính xác là thiết lập bạn cần khi bộ truy xuất cung cấp dữ liệu cho nó là một checkpoint mới ba ngày tuổi với những tuyên bố chưa được xác minh. Hãy xây dựng chỉ mục bằng bộ truy xuất phù hợp với hệ thống lưu trữ của bạn, và giữ phần còn lại của pipeline có thể hoán đổi linh hoạt cho đến khi ai đó bên ngoài Tencent xác nhận bảng đánh giá nào trong số này là thật.