
EVIE-8B: Tencent âm thầm ra mắt bộ truy xuất tài liệu trực quan chính xác nhất từ trước đến nay
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Ba tuần trước, EVIE-Preview-4.5B của Tencent là bộ truy hồi tài liệu trực quan nguồn mở chính xác nhất trên bảng xếp hạng ViDoRe, dựa trên chính số liệu mà Tencent tự báo cáo. Vào ngày 4 tháng 9, Tencent lặng lẽ thay thế mô hình đó ở vị trí đầu bảng xếp hạng của chính mình — không phải bằng một đối thủ bên ngoài, mà bằng một mô hình anh em lớn hơn được phát hành cùng buổi sáng hôm đó. EVIE-8B, một bộ truy hồi tương tác muộn (late-interaction) 8,41 tỷ tham số dựa trên nền tảng Qwen3.5-9B với các embedding 4096 chiều cho từng token, đã xuất hiện dưới dạng trọng số kèm mã nguồn trên Hugging Face và GitHub mà không có thông báo, bài viết blog hay bài nghiên cứu nào. Một checkpoint thứ ba, EVIE-4.5B, xuất hiện trong cùng một phút và hiện nằm giữa hai mô hình kia. Mọi tuyên bố gắn liền với bản phát hành này — điểm số, kiến trúc, thậm chí cả mục đích sử dụng của các mô hình — hiện chỉ dựa trên những gì kho lưu trữ của chính Tencent cho biết, vì chưa ai bên ngoài Tencent công bố bất kỳ điều gì về EVIE-8B. Đây là những gì thực sự có thể biết được từ kho lưu trữ, và những gì chưa được xác nhận.
Tencent đã phát hành gì vào ngày 4 tháng 9?
Vào ngày 2026-09-04, hai kho lưu trữ mới xuất hiện trong tổ chức tencent trên Hugging Face cách nhau khoảng một phút: tencent/EVIE-8B và tencent/EVIE-4.5B. Một kho GitHub tổng hợp, Tencent/EVIE, được đăng tải cùng thời điểm, chứa mã huấn luyện, công cụ suy luận ColQwen3.5 và bộ đánh giá 138 nhiệm vụ. Cả hai kho mô hình đều có giấy phép Apache-2.0, cả hai đều sử dụng thư viện colpali-engine và đều mang thẻ quy trình truy xuất tài liệu trực quan. Phiên bản EVIE-Preview-4.5B cũ hơn từ ngày 17 tháng 8 vẫn còn trên Hugging Face dưới tên "Preview", nhưng không còn là mô hình hàng đầu của dòng sản phẩm này nữa: trong bảng xếp hạng được cập nhật bên trong thẻ EVIE-8B, Tencent liệt kê ba checkpoint của chính mình ở vị trí đầu — EVIE-8B đạt 66,75 ViDoRe V3 nDCG@10, EVIE-4.5B đạt 66,02 và EVIE-Preview-4.5B đạt 65,36.
Chưa có thông báo nào ở bất kỳ đâu. Ghi chú phát hành của thẻ EVIE-8B cho biết các trọng số, quy trình suy luận và bộ đánh giá được mã nguồn mở, sau đó nói thêm rằng "chi tiết kỹ thuật đầy đủ, các thử nghiệm kiến trúc (architectural ablations) và bài nghiên cứu chính thức sẽ được cập nhật trong bản phát hành sắp tới." Kho lưu trữ GitHub mới chỉ có bốn commit và chưa có bản phát hành nào tại thời điểm viết bài. Cả hai kho lưu trữ mới đều chưa cho thấy sự tiếp nhận đáng kể nào — không có fork từ cộng đồng với kết quả độc lập, không có đánh giá từ bên thứ ba, và bộ đếm lượt tải vẫn gần bằng không hai ngày sau khi các kho lưu trữ được công khai. Dựa trên bằng chứng, đây là một bản phát hành ưu tiên đăng trọng số trước, viết bài nghiên cứu sau đến từ Tencent, theo cùng một kiểu âm thầm mà phòng thí nghiệm đã sử dụng cho EVIE-Preview-4.5B và UI-Mate-9B vào tháng Tám.

Thẻ mô hình tencent/EVIE-8B ở trên là bề mặt công khai của bản phát hành: một checkpoint truy xuất tài liệu trực quan được gắn thẻ cho thư viện colpali-engine, có giấy phép Apache-2.0, với embedding tương tác muộn 4096 chiều và bảng ViDoRe đã làm mới của chính dòng mô hình nằm ở gần đầu thẻ.
EVIE-8B, giáo viên chủ lực
Về mặt kiến trúc, EVIE-8B thuộc họ tương tác muộn (late-interaction) ColPali/ColBERT. Thay vì nén cả một trang thành một vector embedding duy nhất — thao tác gây mất mát thông tin mà phương pháp truy hồi dày đặc một vector thực hiện — mô hình chạy một backbone vision-language trên ảnh của trang và duy trì một biểu diễn đa vector theo từng token, sau đó chấm điểm mức độ liên quan bằng toán tử MaxSim: mỗi token truy vấn lấy kết quả khớp tốt nhất của nó trên các token của trang, và các giá trị cực đại đó được cộng lại thành điểm liên quan. Các lựa chọn cụ thể của EVIE-8B là backbone Qwen3.5-9B được chạy với cơ chế chú ý hai chiều đầy đủ (mô hình được “encoder hóa”, nên mặt nạ nhân quả bị tắt trên toàn bộ chuỗi vision-text) cùng một phép chiếu rộng 4096 chiều cho mỗi token. Mục đích của độ rộng này là tính trung thực: bố cục không gian, kiểu chữ, cấu trúc biểu đồ và các quan hệ dạng bảng vẫn được giữ lại trong biểu diễn thay vì bị san bằng đi bởi phép trung bình hóa.
Tencent định vị EVIE-8B một cách tường minh như "giáo viên chủ lực" (flagship teacher). Mô hình học sinh EVIE-4.5B được huấn luyện từ mô hình này bằng một công thức mà Tencent gọi là EVIE-ARD — chưng cất quan hệ bảo toàn anchor và nhận biết dung lượng, truyền tải tô-pô quan hệ token và sử dụng giám sát biên với mẫu âm khó. Nói cách khác, mô hình 8B có hai nhiệm vụ: đặt trần độ chính xác cho dòng sản phẩm và đóng vai trò là mốc chất lượng để mô hình học sinh gọn nhẹ chưng cất từ đó. Về phía huấn luyện, thẻ mô hình báo cáo 775.635 cặp tài liệu–truy vấn, trong đó các mẫu âm khó thu được từ khai thác được bộ đánh giá đa phương thức xét lại — bộ đánh giá này xếp các ứng viên trả lời được vào mẫu dương, che các mẫu mơ hồ khỏi hàm mất mát, và chỉ giữ các trang hoàn toàn không liên quan làm mẫu âm thực sự. Checkpoint "a40" được phát hành tự nó là một phép trộn trong không gian trọng số, tại α = 0.40, của hai nhánh được huấn luyện độc lập.
Bảng điểm mà Tencent tự viết cho chính mình
Tất cả các con số dưới đây đều do nhà cung cấp báo cáo. Chúng đến từ thẻ mô hình của chính Tencent và được tạo ra bằng bộ công cụ đánh giá mà Tencent phân phối trong kho lưu trữ của mình; không có con số nào được tái lập một cách độc lập, và EVIE-8B vẫn chưa được bất kỳ ai bên ngoài phòng thí nghiệm chạy thử.
• Tham số / backbone — 8.41B, Qwen3.5-9B, cơ chế attention song phương toàn phần.
• Embedding — multi-vector 4096 chiều trên mỗi token, tương tác muộn MaxSim.
• ViDoRe V1 (10 nhiệm vụ, nDCG@5) — 92,18.
• ViDoRe V2 (4 nhiệm vụ, nDCG@5) — 74.23.
• ViDoRe V3 (48 tác vụ, nDCG@10) — 66,75, với việc quét tham số theo từng miền, thẻ này tuyên bố thắng cả tám miền công khai.
• JinaVDR (76 nhiệm vụ, nDCG@10) — 83.30; nDCG@10 trung bình macro của bốn bảng — 79.51 trên toàn bộ bộ 138 nhiệm vụ.
• Giấy phép — Apache-2.0; trọng số, suy luận và mã đánh giá đều mở.

Hàng thú vị nhất trong bảng của Tencent là hàng mà Tencent đánh bại chính Tencent. Thẻ EVIE-Preview-4.5B ra mắt từ tháng 8 từng tuyên bố "Rank #1 trên ViDoRe V3" với 65.36 nDCG@10, nhỉnh hơn mức 65.32 của webAI-ColVec1.1-8b. Trong bảng được làm mới bên trong thẻ EVIE-8B, con số 65.36 đó giờ chỉ xếp thứ ba tổng thể, sau 66.75 của EVIE-8B và 66.02 của EVIE-4.5B. Số liệu phân theo từng miền của EVIE-8B vượt bản preview cũ ở cả tám miền công khai của ViDoRe V3 — CompSci 81.86 so với 80.65, Finance EN 71.23 so với 70.50, Pharma 70.81 so với 69.20, v.v. — với mức tăng trung bình 1.39 điểm. Liệu mức tăng đó có đứng vững qua một lần chạy độc lập hay không chính là câu hỏi còn bỏ ngỏ; nhưng tính nhất quán nội bộ rất đáng chú ý, bởi một mô hình thầy không thể đánh bại được học trò của chính mình thì quả là một thứ kỳ lạ khi đem phát hành.

Biểu đồ họ mô hình ở trên trình bày lại bảng xếp hạng ba checkpoint mà Tencent công bố trong thẻ EVIE-8B vào ngày 4 tháng 9 — EVIE-8B đạt 66.75, EVIE-4.5B đạt 66.02, EVIE-Preview-4.5B đạt 65.36 trên ViDoRe V3 nDCG@10 — với bản preview 128D nhường chỗ cho teacher 4096D và student Prefix-MRL.
Tại sao flagship không phải là mô hình triển khai?
Có một lý do khiến mô hình dẫn đầu về độ chính xác được gọi là teacher thay vì default. Vector càng rộng thì chi phí lưu trữ và tính toán khi chấm điểm càng cao, mà 4096 chiều mỗi token là rất rộng. Ở định dạng BF16, mỗi vector token của EVIE-8B chiếm 8 KiB trước khi áp dụng bất kỳ lượng tử hóa nào, và một trang dày đặc có thể tạo ra hàng trăm vector token — giao thức đánh giá của chính model card giới hạn tài liệu ở mức 1.024 token thị giác mỗi trang. Tencent không công bố con số kích thước chỉ mục cho EVIE-8B, điều này rất đáng chú ý vì model card của EVIE-Preview-4.5B đã công bố con số chính xác cho chỉ mục 128 chiều của mình: 179,2 GiB chỉ mục BF16 thô cho mỗi triệu trang ở ngân sách 768 token huấn luyện, và 420,5 GiB ở mức ngoại suy 1.792 token. Xét từng vector, embedding của EVIE-8B rộng gấp 32 lần so với bản preview, nên một chỉ mục EVIE-8B thô ở cùng ngân sách token sẽ lên tới phạm vi nhiều terabyte cho mỗi triệu trang — mà chưa cần bàn đến hệ thống truy xuất vốn phải giữ chỉ mục đó trong RAM.
Việc phát hành EVIE-4.5B cùng ngày cho thấy Tencent kỳ vọng sự căng thẳng đó sẽ được giải quyết theo cách nào. EVIE-4.5B là mô hình học sinh 4,61B tham số với một phép chiếu 2048 chiều duy nhất, khi chạy có thể cắt giảm xuống còn 64, 128, 256, 512, 1024 hoặc 2048 chiều (Tencent gọi sơ đồ này là Prefix-MRL), cùng với một bước nén token không cần huấn luyện mà họ gọi là HAC, giúp gom khoảng 750 token hình ảnh của một trang xuống còn 32–64 vector. Điểm nhấn của Tencent cho mô hình này là dung lượng chỉ mục 3,81 GiB trên mỗi triệu trang — con số này, giống như những con số còn lại, do chính nhà cung cấp tự báo cáo. Nhìn tổng thể, bản phát hành này không giống "một mô hình 8B mới" mà giống một dòng sản phẩm được thiết kế có chủ đích: mô hình 8B đặt ra trần năng lực và huấn luyện mô hình học sinh, còn mô hình học sinh mới là mô hình có kích thước phù hợp để thực sự đứng sau một chỉ mục sản xuất.
Cách chạy EVIE-8B ngay hôm nay
EVIE-8B được cung cấp chỉ dưới dạng trọng số (weights). Không có API lưu trữ sẵn trên bất kỳ nền tảng nào — kể cả OrcaRouter — vì vậy con đường duy nhất hiện nay là tự lưu trữ (self-host) checkpoint và chạy nó qua đường dẫn ColQwen3.5 trong colpali-engine. Phần khởi động nhanh trên thẻ mô hình rất ngắn gọn: nạp mô hình ở định dạng BF16 với flash-attention, gọi enable_bidirectional_attention(), nhúng (embed) hình ảnh trang và truy vấn văn bản, sau đó chấm điểm bằng MaxSim của bộ xử lý. Bước hai chiều không phải là chi tiết trang trí tùy chọn — các bản colpali-engine được phát hành mặc định dựng ColQwen3.5 với mặt nạ nhân quả (causal mask), và thẻ của mô hình xem trước đã ghi nhận rằng giữ nguyên mặt nạ làm giảm khoảng 1,1 điểm trên MaxSim top-hit. Hàm trợ giúp tương tự cũng được cung cấp cho EVIE-8B. Một checkpoint BF16 8,41B tham số có dung lượng trọng số vào khoảng 17 GB theo nguyên tắc ước lượng hai byte mỗi tham số, vì vậy đây là bài toán dành cho một GPU có dư địa (headroom) chứ không phải một mô hình edge, và kho ngữ liệu (corpus) nằm ở nơi bạn lưu chỉ mục (index), chứ không nằm trên mô hình.
Những gì EVIE-8B thay đổi cho một stack RAG tài liệu
Đối với bất kỳ ai đang xây dựng hệ thống truy xuất trên tài liệu quét, hồ sơ, biểu đồ hoặc biểu mẫu, thay đổi thực tế là trần chất lượng cho truy xuất tài liệu trực quan mã nguồn mở vừa được nâng lên — và nó nằm trong một dòng sản phẩm hiện có ba mức giá/hiệu năng khác nhau. Tuy nhiên, một bộ truy xuất chỉ giúp bạn lấy được các trang. Mô hình đọc các trang đó và viết ra câu trả lời là một quyết định riêng biệt, và chính tại lớp này, khả năng định tuyến thể hiện giá trị của nó: OrcaRouter cung cấp một API duy nhất truy cập hơn 200 mô hình với giá niêm yết của nhà cung cấp, không cộng thêm phí phần trăm nào, nhờ đó mô hình đọc phía sau bộ truy xuất của bạn có thể được thay đổi mà không cần viết lại mã, và bất kỳ đợt giảm giá nào từ nhà cung cấp trên một mô hình được định tuyến sẽ có hiệu lực ngay trong ngày công bố. Sự tách biệt này càng quan trọng hơn khi nửa truy xuất là một checkpoint hoàn toàn mới, chưa được kiểm chứng — bạn có thể áp dụng EVIE-8B cho bước lập chỉ mục trong khi vẫn giữ lớp sinh nội dung phía sau một giao diện không ràng buộc bạn với bất kỳ mô hình đơn lẻ nào.
Xem gì tiếp theo
Ba điều sẽ biến bản phát hành repo thầm lặng này thành một câu chuyện hoàn chỉnh. Thứ nhất, một lần chạy độc lập: cho đến khi ai đó bên ngoài Tencent tái tạo được số liệu ViDoRe và JinaVDR, cả "hạng #1" của EVIE-8B lẫn "hạng #1" của bản xem trước cũ đều là những tuyên bố tự công bố — và chúng lại đang mâu thuẫn với nhau. Thứ hai, bài báo và các phép thử nghiệm loại trừ (ablation) đã được hứa hẹn — lựa chọn chiều 4096, checkpoint trộn trọng số, và công thức chưng cất (distillation) hiện tại đều chỉ là những khẳng định mà chưa có bài viết nào chứng minh. Thứ ba, vấn đề đặt tên: khi EVIE-4.5B hiện đang chiếm vị trí mà EVIE-Preview-4.5B nắm giữ ba tuần trước, câu hỏi mở là liệu Tencent giữ dòng "Preview" sống tiếp hay gộp nó vào gia đình đã được đổi tên. Với nhịp độ hiện tại — ba checkpoint truy xuất tài liệu hình ảnh trong ba tuần — giả định hữu ích hơn là dòng sản phẩm này đang được đầu tư mạnh, và các bản phát hành thầm lặng chính là cách phòng thí nghiệm phát hành sản phẩm trước khi bài báo ra mắt.
