การ์ดไตเติ้ลหลักสำหรับการเปรียบเทียบ 'EVIE-8B vs EVIE-Preview-4.5B' พร้อมคำบรรยายใต้ไตเติ้ล 'การเพิ่มขึ้น 1.39 จุดสำหรับเวกเตอร์ที่กว้างขึ้น 32 เท่า' แสดงเป็นภาพสองแผงแบบแบน: ด้านซ้ายเป็นกองเอกสารสูงๆ ถัดจากป้าย 4096D ด้านขวาเป็นหน้าเอกสารขนาดกะทัดรัดถัดจากไอคอนฮาร์ดไดรฟ์ขนาดเล็กพร้อมป้าย 128D มีเส้นตาชั่งบางๆ อยู่กึ่งกลางระหว่างสองแผง ข้อความท้ายภาพ 'คุณควรทำดัชนีกับตัวดึงเอกสารภาพของ Tencent ตัวใด?' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

EVIE-8B เทียบกับ EVIE-Preview-4.5B: การเพิ่มขึ้น 1.39 จุดสำหรับเวกเตอร์ที่กว้างขึ้น 32 เท่า

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สามสัปดาห์หลังจาก Tencent เปิดตัว EVIE-Preview-4.5B พร้อมประกาศว่าเป็นตัวดึงค้นเอกสารภาพที่แม่นยำที่สุดบนกระดาน ViDoRe Tencent ก็เปิดตัว EVIE-8B และแอบขยับเป้าหมายที่โมเดล 128 มิติของตัวเองเคยยืนอยู่ EVIE-8B คือโมเดลครูรุ่นธงขนาด 8.41B พร้อมเอมเบดดิ้ง 4096 มิติต่อโทเคน ส่วน EVIE-Preview-4.5B คือตัวดึงค้นขนาดกะทัดรัด 4.54B ที่จุดขายทั้งหมดคือการบอกว่า 128 มิติเพียงพอที่จะชนะโมเดลที่ใหญ่กว่าถึงสี่เท่า บนลีดเดอร์บอร์ดที่รีเฟรชใหม่ในการ์ดโมเดลของ EVIE-8B ตอนนี้ EVIE-Preview-4.5B รั้งอันดับสามในตระกูลเดียวกันเอง — ตามหลัง EVIE-8B ตัวใหม่ และตามหลัง EVIE-4.5B โมเดลลูกที่ Tencent ปล่อยเช้าวันเดียวกัน หากคุณกำลังเลือกว่าจะใช้โมเดลสองตัวที่ถูกเอ่ยชื่อนี้ตัวใดในการทำดัชนีคลังเอกสาร ตัวเลขบนการ์ดของ Tencent บอกว่า EVIE-8B ดีกว่าประมาณ 1.39 จุดบน ViDoRe V3 และดีกว่า 3.36 จุดบน ViDoRe V2 — และต้องแลกด้วยพื้นที่ดัชนีต่อเวกเตอร์ที่มากกว่า 32 เท่าเพื่อให้ได้ผลลัพธ์นั้น บทความนี้พูดถึงว่าข้อแลกเปลี่ยนนี้คุ้มค่าหรือไม่ โดยเริ่มจากคำเตือนตามตรงที่ว่าสกอร์การ์ดทั้งสองใบเป็นของ Tencent เอง และยังไม่มีการตรวจสอบซ้ำโดยอิสระ

เวอร์ชันสั้น

• เลือก EVIE-8B หากความแม่นยำในการค้นคืนเป็นคอขวด และคลังเอกสารของคุณเล็กพอจนขนาดของดัชนีดิบไม่สำคัญ — คุณกำลังวัดกันที่ระดับหลายพันหน้า ไม่ใช่หลายล้านหน้า และคุณต้องการตัวค้นคืนแบบเปิดที่ดีที่สุดที่ Tencent เคยเผยแพร่

• เลือกใช้ EVIE-Preview-4.5B หาก {{1}}ต้นทุนดัชนี ความหน่วงต่อหน้า หรืองบประมาณ GPU เป็นข้อจำกัดที่แท้จริง{{/1}} — {{2}}เวกเตอร์ 128D คือเหตุผลทั้งหมดที่มันถูกสร้างขึ้นมา{{/2}} และ {{3}}ความแม่นยำต่ำกว่ารุ่น 8B เพียงเล็กน้อยบน ViDoRe V1 และปานกลางบน V3{{/3}}

• ตรวจสอบทั้งคู่กับ EVIE-4.5B อีกครั้งก่อนที่คุณจะตัดสินใจ: Tencent เปิดตัว student model ในวันเดียวกันที่มีเวกเตอร์แบบตัดทอนได้ขณะรันไทม์และการบีบอัดโทเค็น ซึ่งเหนือกว่าทั้งคู่บนเส้นประสิทธิภาพ และการเปรียบเทียบใดก็ตามที่ไม่คำนึงถึงมันถือว่าล้าสมัยแล้ว

• จงถือว่าตัวเลขทุกตัวที่นี่เป็นข้อมูลที่รายงานโดยผู้ผลิต EVIE-8B ยังไม่เคยถูกเรียกใช้งานโดยใครนอกเหนือจาก Tencent; ตัวเลขของ EVIE-Preview-4.5B มาจากสคริปต์การทำซ้ำของ Tencent เอง

ตรงที่พวกเขาต่างกันจริงๆ

• พารามิเตอร์ — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• แบ็คโบน — Qwen3.5-9B พร้อมแอตเทนชันสองทิศทางแบบเต็มรูปแบบ เทียบกับ Qwen3.5-4B พร้อมการสลับระหว่างแอตเทนชันเชิงเส้น GatedDeltaNet และแอตเทนชันเต็มรูปแบบ

• Embedding — มัลติเวกเตอร์ต่อโทเคน 4096 มิติ เทียบกับมัลติเวกเตอร์ต่อโทเคน 128 มิติแบบเนทีฟ โดยให้คะแนนทั้งคู่ด้วย MaxSim ซึ่งเป็นวิธีปฏิสัมพันธ์ช่วงปลาย (late interaction)

• ViDoRe V1 (10 งาน, nDCG@5) — 92.18 เทียบกับ 91.73.

• ViDoRe V2 (4 งาน, nDCG@5) — 74.23 เทียบกับ 70.87 นี่คือช่องว่างสัมพัทธ์ที่ใหญ่ที่สุด

• ViDoRe V3 (48 งาน, nDCG@10) — 66.75 เทียบกับ 65.36.

• งบประมาณโทเคนภาพที่อยู่เบื้องหลังตัวเลขหลักเหล่านั้น — 1,024 โทเคน/หน้าสำหรับการประเมินของ EVIE-8B เทียบกับ 1,792 โทเคน/หน้าสำหรับระดับเด่นของ EVIE-Preview-4.5B (ที่ระดับการฝึกแบบ 768 โทเคน รุ่นพรีวิวให้ผลลัพธ์ 64.56)

• ดัชนี BF16 ดิบต่อ 1 ล้านหน้า — ยังไม่ได้เผยแพร่สำหรับ EVIE-8B เทียบกับ 179.2 GiB ที่ 768 โทเค็น/หน้า และ 420.5 GiB ที่ 1,792 สำหรับรุ่นตัวอย่าง

• ใบอนุญาตและการเปิดตัว — Apache-2.0, การเปิดตัวแบบเงียบ 2026-09-04 เทียบกับ Apache-2.0, การเปิดตัวแบบเงียบ 2026-08-17

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

กระดานคะแนนด้านบนเป็นการกล่าวย้ำภาพเดียวกัน ขอให้คำนึงถึงข้อควรระวังสองข้อขณะอ่าน: คอลัมน์ EVIE-8B และคอลัมน์ EVIE-Preview-4.5B มาจากการ์ดโมเดลของ Tencent ที่แยกกันสองรายการ และตัวเลขหลัก V3 ของ 8B นั้นวัดด้วยงบประมาณโทเค็นภาพต่อหน้าที่ต่ำกว่าตัวเลขหลักของรุ่นพรีวิว

บัตร Tencent สองใบกำลังคุยกันเอง

กรอบการนำเสนอที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ มันเป็นข้อโต้แย้งในครอบครัว มิใช่การแข่งขันที่เป็นอิสระ การ์ดของ EVIE-Preview-4.5B เอง ซึ่งเผยแพร่เมื่อวันที่ 17 สิงหาคม อ้างว่า "ครองอันดับ #1 บน ViDoRe V3" ที่ 65.36 nDCG@10 เอาชนะ webAI-ColVec1.1-8b ไปได้ 0.04 ส่วนการ์ดของ EVIE-8B ซึ่งเผยแพร่เมื่อวันที่ 4 กันยายน นำตัวเลข 65.36 ชุดเดียวกันนั้นมาแสดงเป็นผลลัพธ์ที่ดีเป็นอันดับสามบนหน้าเว็บ รองจาก 66.75 ของ EVIE-8B และ 66.02 ของ EVIE-4.5B และแสดงให้เห็นว่าโมเดล 8B ชนะทั้งแปดโดเมนสาธารณะของ ViDoRe V3 ต่อรุ่นพรีวิว สกอร์การ์ดทั้งสองชุดผลิตขึ้นด้วยชุดเครื่องมือประเมินผลของ Tencent เอง และไม่มีโมเดลใดเลยที่มีการรันแบบอิสระปรากฏในเอกสารวิชาการใด ๆ จนถึงขณะนี้ ดังนั้นการเปรียบเทียบที่คุณกำลังอ่านอยู่จึงเป็นเรื่องเล่าของ Tencent ที่ว่า Tencent เอาชนะ Tencent — มีความสอดคล้องภายใน พลิกแพลงด้วยวิธีนั้นอย่างมีเจตนาได้ plausibly และไม่ได้รับการตรวจสอบโดยใครก็ตามที่ไม่มีส่วนได้ส่วนเสียในผลลัพธ์นี้

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

การ์ด tencent/EVIE-8B ด้านบนคือพื้นผิวสาธารณะของผู้ท้าชิง: ครูเรือธงขนาด 8.41B พร้อม embedding แบบ 4096D และตาราง ViDoRe ที่รีเฟรชแล้วของตระกูลที่อยู่ด้านบน

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

การ์ด tencent/EVIE-Preview-4.5B ด้านบนคือการ์ดของผู้ครองตำแหน่งปัจจุบัน: รีทรีฟเวอร์ขนาด 4.54B ซึ่งเวกเตอร์ 128D ดั้งเดิมและคณิตศาสตร์ต้นทุนดัชนีที่เผยแพร่ยังคงเป็นคุณลักษณะที่นิยามตัวมัน

คำถาม 1.39 คะแนน

ช่องว่างดิบบน ViDoRe V3 นั้นเล็กมาก — ห่างกันเพียง 1.39 จุด nDCG@10 ระหว่าง EVIE-8B ที่ 66.75 กับ EVIE-Preview-4.5B ที่ 65.36 — และยังมาพร้อมเชิงอรรถเรื่องงบประมาณโทเคนซึ่งมีนัยสำคัญต่อการนำไปใช้งานจริง โปรโตคอลการประเมินของ EVIE-8B จำกัดเอกสารไว้ที่ 1,024 โทเคนภาพต่อหน้า ขณะที่รุ่นพรีวิวต้องใช้ถึง 1,792 โทเคนต่อหน้าเพื่อทำ 65.36 อันเป็นตัวเลขหลักที่รายงาน แต่กลับทำได้เพียง 64.56 เมื่อใช้ภายในงบประมาณการฝึกของตัวเองที่ 768 โทเคน จากตัวเลขดังกล่าว EVIE-8B จึงไม่ได้แค่แม่นยำกว่าในงบประมาณที่เทียบเคียงกันได้ หากยังแม่นยำกว่าในงบประมาณที่เล็กกว่าด้วย ซึ่งเป็นทิศทางที่ต้องการสำหรับเวลาแฝงต่อหน้า ส่วนชัยชนะในเชิงเทียบเคียงที่ใหญ่กว่าคือบน ViDoRe V2 ซึ่ง EVIE-8B ได้ 74.23 เทียบกับ 70.87 ของรุ่นพรีวิว หรือขยับขึ้น 3.36 จุดบนกระดานอันดับที่รวมงานเอกสารสังเคราะห์ที่ยากกว่าไว้ด้วย ส่วน ViDoRe V1 ซึ่งเป็นกระดานอันดับที่เก่าแก่และอิ่มตัวที่สุดแทบไม่ขยับ: 92.18 เทียบกับ 91.73 รูปแบบดังกล่าว — ที่ผลต่างนิ่งเรียบในจุดที่ทุกคนเกือบแตะเพดานแล้ว และขาดชัดเจนในจุดที่โจทย์ใหม่กว่าและยากกว่า — คือลักษณะเฉพาะที่บ่งบอกถึงการเพิ่มขีดความสามารถอย่างแท้จริง ไม่ใช่แค่สัญญาณรบกวนบนลีดเดอร์บอร์ด แต่อย่างไรก็ตาม นี่ยังคงเป็นการวัดผลโดย Tencent เอง

ดัชนีคือคู่ต่อสู้ที่แท้จริง

ความแม่นยำเป็นเพียงครึ่งหนึ่งของการตัดสินใจนี้ เพราะทั้งสองโมเดลให้คำมั่นสัญญาที่แตกต่างกันอย่างสิ้นเชิงเกี่ยวกับสิ่งที่คุณจัดเก็บ เหตุผลที่ EVIE-Preview-4.5B ถูกสร้างขึ้นมาก็คือเวกเตอร์โทเคนแบบ 128 มิติโดยตรง: การ์ดโมเดลเผยแพร่ตัวเลขดัชนีที่แน่นอน (179.2 GiB ของดัชนี BF16 ดิบต่อล้านหน้าที่งบประมาณการฝึกของมัน และ 420.5 GiB ในระดับการขยายที่คาดประมาณ) พร้อมทั้งชี้ว่าเวกเตอร์ที่แคบกว่าจะลดพื้นที่จัดเก็บและงานประมวลผล MaxSim ลงในสัดส่วนโดยตรง เวกเตอร์โทเคนของ EVIE-8B มี 4096 มิติ — กว้างกว่า 32 เท่าต่อเวกเตอร์ — และการ์ดโมเดลของ EVIE-8B ไม่ได้เผยแพร่ตัวเลขขนาดดัชนีเลยแม้แต่น้อย การละเว้นนั้นคือข้อมูลในตัวเอง: ด้วยจำนวนโทเคนต่อหน้าที่เท่ากัน ดัชนี BF16 ดิบของ EVIE-8B จะมีขนาดราว 32 เท่าของรุ่นพรีวิว ซึ่งทำให้คลังเอกสารล้านหน้าอยู่ในช่วงหลายเทราไบต์ก่อนการควอนไทซ์ และทำให้รุ่นเรือธงเป็นสิ่งที่คุณใช้กับเอกสารเพียงไม่กี่แสนหน้า มากกว่าจะเป็นสิ่งที่คุณโฮสต์อย่างง่ายดายในระดับใหญ่ ความกว้างของเวกเตอร์ในรุ่นเรือธงให้ความเที่ยงตรงในการค้นคืนมา แต่ไม่ได้ให้ความสามารถในการปรับใช้

ตัวเลือกที่สามที่ Tencent เปิดตัวในวันเดียวกัน

การเปรียบเทียบอย่างตรงไปตรงมาใดๆ จะไม่หยุดอยู่ที่โมเดลสองตัวที่ถูกตั้งชื่อไว้ เพราะรีลีสที่บรรจุ EVIE-8B ยังบรรจุ EVIE-4.5B อยู่ด้วย — ซึ่งเป็นโมเดลนักเรียน (student) ขนาด 4.61B ที่ถูกกลั่นจากโมเดลครูขนาด 8B โดยมีโปรเจกชันขนาด 2048 มิติเพียงชุดเดียวที่ตัดทอนได้ในขณะรันไทม์เหลือ 64, 128, 256, 512, 1024 หรือ 2048 มิติ ประกอบกับขั้นตอนบีบอัดโทเคนแบบไม่ต้องฝึกที่ Tencent เรียกมันว่า HAC ซึ่งจัดกลุ่มโทเคนภาพของหน้าเว็บหนึ่งๆ ให้เหลือเพียง 32–64 เวกเตอร์ และตามที่ระบุในโมเดลการ์ด มีพื้นที่ดัชนี (index footprint) อยู่ที่ 3.81 GiB ต่อล้านหน้า บนตารางผลลัพธ์ของ Tencent เอง EVIE-4.5B ทำคะแนนได้ 66.02 ในชุดทดสอบ ViDoRe V3 ซึ่งตามหลังโมเดลครู 8B อยู่เพียง 0.73 และนำหน้า EVIE-Preview-4.5B อยู่ 0.66 ดังนั้นจึงเป็นคำตอบของภาวะกลืนไม่เข้าคายไม่ออกที่การจับคู่ครั้งนี้ตั้งไว้อย่างแท้จริง หากสิ่งที่คุณต้องการคือ “ความแม่นยำส่วนใหญ่ของรุ่น 8B โดยไม่ต้องมีดัชนีเท่ารุ่น 8B” Tencent ได้ส่งมอบโมเดลนั้นออกไปแล้ว และมันไม่ใช่หนึ่งในสองรุ่นที่หน้านี้ตั้งชื่อตาม กรณีที่เหลืออยู่ของ EVIE-Preview-4.5B นั้นแคบแต่มีจริง: มันคือเช็คพอยต์ที่ใช้งานในโปรดักชันอยู่แล้วสำหรับผู้ที่ปรับใช้ในเดือนสิงหาคม และโปรไฟล์แบบมิติคงที่ 128D ของมันนั้นง่ายต่อการพิจารณากว่า matryoshka ที่บังคับให้คุณต้องเลือกมิติของคุณในขณะรันไทม์

คุณควรใช้ตัวใดในการจัดทำดัชนี

จับคู่โมเดลกับข้อจำกัดที่มีผลผูกพันจริง:

• ใช้ดัชนีที่ EVIE-8B หากคุณกำลังสร้างจุดอ้างอิงความแม่นยำ — เกณฑ์มาตรฐาน คลังข้อมูลทางกฎหมายหรือวิทยาศาสตร์มูลค่าสูงที่มีหลายแสนหน้า หรือระบบที่การพลาดการดึงข้อมูลมีต้นทุนสูงและการจัดเก็บข้อมูลมีต้นทุนต่ำ คุณกำลังจ่ายเพื่อจุดสูงสุดของเส้นโค้งของตระกูล และตระกูลตั้งใจให้ student ขนาด 4.5B เป็นสิ่งที่คุณจะขยายขนาดในภายหลัง

• หากคุณได้จัดทำดัชนีด้วย EVIE-Preview-4.5B อยู่แล้ว และคุณภาพที่วัดได้อยู่ในระดับที่ยอมรับได้ ก็ให้ใช้รุ่นนี้ต่อไป — การจัดทำดัชนีใหม่มีต้นทุนที่แท้จริง และการเพิ่มประสิทธิภาพของ V3 ที่คุณจะไล่ตามนั้นมีค่าเพียง 1.39 จุดบนการ์ดของผู้จำหน่ายที่ยังไม่มีใครยืนยันอย่างเป็นอิสระ

• ประเมิน EVIE-4.5B ก่อนตัวเลือกใด หากคุณเริ่มต้นใหม่ในระดับที่มีนัยสำคัญ การตัดทอน Prefix-MRL และการบีบอัด HAC มุ่งเป้าไปที่เลขคณิตการจัดเก็บข้อมูลข้างต้นโดยตรง และตัวเลขของ Tencent เองก็ทำให้มันอยู่ในระยะที่ไล่ทันโมเดลครูได้

ไม่มีตัวใดในสามตัวนี้ที่มี hosted API บนแพลตฟอร์มใดๆ เลย แม้แต่บน OrcaRouter ก็ไม่มี ดังนั้นขั้นตอน retrieval จึงเป็นการตัดสินใจแบบ self-hosted อยู่ดี ไม่ว่าจะเลือกแบบใด {{1}}แต่ขั้นตอนถัดจากนั้นไม่จำเป็นต้องเป็นแบบ self-hosted ก็ได้{{/1}} เราเตอร์แบบเดียวกับที่ OrcaRouter ใช้ครอบคลุมโมเดลมากกว่า 200 ตัว จะทำให้โมเดลที่อ่านหน้าที่ดึงมาและเขียนคำตอบถูกเรียกใช้งานผ่าน API เพียงตัวเดียว พร้อม failover อัตโนมัติข้ามผู้ให้บริการ และราคา list price ของผู้ให้บริการที่ส่งผ่านด้วย markup 0% ซึ่งเป็นการตั้งค่าที่คุณต้องการพอดีเมื่อ retriever ที่ป้อนข้อมูลให้โมเดลดังกล่าวเป็น checkpoint ที่เพิ่งสร้างเมื่อสามวันก่อนพร้อมคำกล่าวอ้างที่ยังไม่ได้รับการยืนยัน {{2}}สร้าง index ด้วย retriever ที่เหมาะสมกับระบบจัดเก็บข้อมูลของคุณ และทำให้ pipeline ส่วนที่เหลือสลับเปลี่ยนได้{{/2}} จนกว่าจะมีคนนอก Tencent ออกมายืนยันว่า scorecard ตัวใดในบรรดานี้เป็นของจริง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube