
EVIE-8B เทียบกับ EVIE-Preview-4.5B: การเพิ่มขึ้น 1.39 จุดสำหรับเวกเตอร์ที่กว้างขึ้น 32 เท่า
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
สามสัปดาห์หลังจาก Tencent เปิดตัว EVIE-Preview-4.5B พร้อมประกาศว่าเป็นตัวดึงค้นเอกสารภาพที่แม่นยำที่สุดบนกระดาน ViDoRe Tencent ก็เปิดตัว EVIE-8B และแอบขยับเป้าหมายที่โมเดล 128 มิติของตัวเองเคยยืนอยู่ EVIE-8B คือโมเดลครูรุ่นธงขนาด 8.41B พร้อมเอมเบดดิ้ง 4096 มิติต่อโทเคน ส่วน EVIE-Preview-4.5B คือตัวดึงค้นขนาดกะทัดรัด 4.54B ที่จุดขายทั้งหมดคือการบอกว่า 128 มิติเพียงพอที่จะชนะโมเดลที่ใหญ่กว่าถึงสี่เท่า บนลีดเดอร์บอร์ดที่รีเฟรชใหม่ในการ์ดโมเดลของ EVIE-8B ตอนนี้ EVIE-Preview-4.5B รั้งอันดับสามในตระกูลเดียวกันเอง — ตามหลัง EVIE-8B ตัวใหม่ และตามหลัง EVIE-4.5B โมเดลลูกที่ Tencent ปล่อยเช้าวันเดียวกัน หากคุณกำลังเลือกว่าจะใช้โมเดลสองตัวที่ถูกเอ่ยชื่อนี้ตัวใดในการทำดัชนีคลังเอกสาร ตัวเลขบนการ์ดของ Tencent บอกว่า EVIE-8B ดีกว่าประมาณ 1.39 จุดบน ViDoRe V3 และดีกว่า 3.36 จุดบน ViDoRe V2 — และต้องแลกด้วยพื้นที่ดัชนีต่อเวกเตอร์ที่มากกว่า 32 เท่าเพื่อให้ได้ผลลัพธ์นั้น บทความนี้พูดถึงว่าข้อแลกเปลี่ยนนี้คุ้มค่าหรือไม่ โดยเริ่มจากคำเตือนตามตรงที่ว่าสกอร์การ์ดทั้งสองใบเป็นของ Tencent เอง และยังไม่มีการตรวจสอบซ้ำโดยอิสระ
เวอร์ชันสั้น
• เลือก EVIE-8B หากความแม่นยำในการค้นคืนเป็นคอขวด และคลังเอกสารของคุณเล็กพอจนขนาดของดัชนีดิบไม่สำคัญ — คุณกำลังวัดกันที่ระดับหลายพันหน้า ไม่ใช่หลายล้านหน้า และคุณต้องการตัวค้นคืนแบบเปิดที่ดีที่สุดที่ Tencent เคยเผยแพร่
• เลือกใช้ EVIE-Preview-4.5B หาก {{1}}ต้นทุนดัชนี ความหน่วงต่อหน้า หรืองบประมาณ GPU เป็นข้อจำกัดที่แท้จริง{{/1}} — {{2}}เวกเตอร์ 128D คือเหตุผลทั้งหมดที่มันถูกสร้างขึ้นมา{{/2}} และ {{3}}ความแม่นยำต่ำกว่ารุ่น 8B เพียงเล็กน้อยบน ViDoRe V1 และปานกลางบน V3{{/3}}
• ตรวจสอบทั้งคู่กับ EVIE-4.5B อีกครั้งก่อนที่คุณจะตัดสินใจ: Tencent เปิดตัว student model ในวันเดียวกันที่มีเวกเตอร์แบบตัดทอนได้ขณะรันไทม์และการบีบอัดโทเค็น ซึ่งเหนือกว่าทั้งคู่บนเส้นประสิทธิภาพ และการเปรียบเทียบใดก็ตามที่ไม่คำนึงถึงมันถือว่าล้าสมัยแล้ว
• จงถือว่าตัวเลขทุกตัวที่นี่เป็นข้อมูลที่รายงานโดยผู้ผลิต EVIE-8B ยังไม่เคยถูกเรียกใช้งานโดยใครนอกเหนือจาก Tencent; ตัวเลขของ EVIE-Preview-4.5B มาจากสคริปต์การทำซ้ำของ Tencent เอง
ตรงที่พวกเขาต่างกันจริงๆ
• พารามิเตอร์ — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• แบ็คโบน — Qwen3.5-9B พร้อมแอตเทนชันสองทิศทางแบบเต็มรูปแบบ เทียบกับ Qwen3.5-4B พร้อมการสลับระหว่างแอตเทนชันเชิงเส้น GatedDeltaNet และแอตเทนชันเต็มรูปแบบ
• Embedding — มัลติเวกเตอร์ต่อโทเคน 4096 มิติ เทียบกับมัลติเวกเตอร์ต่อโทเคน 128 มิติแบบเนทีฟ โดยให้คะแนนทั้งคู่ด้วย MaxSim ซึ่งเป็นวิธีปฏิสัมพันธ์ช่วงปลาย (late interaction)
• ViDoRe V1 (10 งาน, nDCG@5) — 92.18 เทียบกับ 91.73.
• ViDoRe V2 (4 งาน, nDCG@5) — 74.23 เทียบกับ 70.87 นี่คือช่องว่างสัมพัทธ์ที่ใหญ่ที่สุด
• ViDoRe V3 (48 งาน, nDCG@10) — 66.75 เทียบกับ 65.36.
• งบประมาณโทเคนภาพที่อยู่เบื้องหลังตัวเลขหลักเหล่านั้น — 1,024 โทเคน/หน้าสำหรับการประเมินของ EVIE-8B เทียบกับ 1,792 โทเคน/หน้าสำหรับระดับเด่นของ EVIE-Preview-4.5B (ที่ระดับการฝึกแบบ 768 โทเคน รุ่นพรีวิวให้ผลลัพธ์ 64.56)
• ดัชนี BF16 ดิบต่อ 1 ล้านหน้า — ยังไม่ได้เผยแพร่สำหรับ EVIE-8B เทียบกับ 179.2 GiB ที่ 768 โทเค็น/หน้า และ 420.5 GiB ที่ 1,792 สำหรับรุ่นตัวอย่าง
• ใบอนุญาตและการเปิดตัว — Apache-2.0, การเปิดตัวแบบเงียบ 2026-09-04 เทียบกับ Apache-2.0, การเปิดตัวแบบเงียบ 2026-08-17

กระดานคะแนนด้านบนเป็นการกล่าวย้ำภาพเดียวกัน ขอให้คำนึงถึงข้อควรระวังสองข้อขณะอ่าน: คอลัมน์ EVIE-8B และคอลัมน์ EVIE-Preview-4.5B มาจากการ์ดโมเดลของ Tencent ที่แยกกันสองรายการ และตัวเลขหลัก V3 ของ 8B นั้นวัดด้วยงบประมาณโทเค็นภาพต่อหน้าที่ต่ำกว่าตัวเลขหลักของรุ่นพรีวิว
บัตร Tencent สองใบกำลังคุยกันเอง
กรอบการนำเสนอที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ มันเป็นข้อโต้แย้งในครอบครัว มิใช่การแข่งขันที่เป็นอิสระ การ์ดของ EVIE-Preview-4.5B เอง ซึ่งเผยแพร่เมื่อวันที่ 17 สิงหาคม อ้างว่า "ครองอันดับ #1 บน ViDoRe V3" ที่ 65.36 nDCG@10 เอาชนะ webAI-ColVec1.1-8b ไปได้ 0.04 ส่วนการ์ดของ EVIE-8B ซึ่งเผยแพร่เมื่อวันที่ 4 กันยายน นำตัวเลข 65.36 ชุดเดียวกันนั้นมาแสดงเป็นผลลัพธ์ที่ดีเป็นอันดับสามบนหน้าเว็บ รองจาก 66.75 ของ EVIE-8B และ 66.02 ของ EVIE-4.5B และแสดงให้เห็นว่าโมเดล 8B ชนะทั้งแปดโดเมนสาธารณะของ ViDoRe V3 ต่อรุ่นพรีวิว สกอร์การ์ดทั้งสองชุดผลิตขึ้นด้วยชุดเครื่องมือประเมินผลของ Tencent เอง และไม่มีโมเดลใดเลยที่มีการรันแบบอิสระปรากฏในเอกสารวิชาการใด ๆ จนถึงขณะนี้ ดังนั้นการเปรียบเทียบที่คุณกำลังอ่านอยู่จึงเป็นเรื่องเล่าของ Tencent ที่ว่า Tencent เอาชนะ Tencent — มีความสอดคล้องภายใน พลิกแพลงด้วยวิธีนั้นอย่างมีเจตนาได้ plausibly และไม่ได้รับการตรวจสอบโดยใครก็ตามที่ไม่มีส่วนได้ส่วนเสียในผลลัพธ์นี้

การ์ด tencent/EVIE-8B ด้านบนคือพื้นผิวสาธารณะของผู้ท้าชิง: ครูเรือธงขนาด 8.41B พร้อม embedding แบบ 4096D และตาราง ViDoRe ที่รีเฟรชแล้วของตระกูลที่อยู่ด้านบน

การ์ด tencent/EVIE-Preview-4.5B ด้านบนคือการ์ดของผู้ครองตำแหน่งปัจจุบัน: รีทรีฟเวอร์ขนาด 4.54B ซึ่งเวกเตอร์ 128D ดั้งเดิมและคณิตศาสตร์ต้นทุนดัชนีที่เผยแพร่ยังคงเป็นคุณลักษณะที่นิยามตัวมัน
คำถาม 1.39 คะแนน
ช่องว่างดิบบน ViDoRe V3 นั้นเล็กมาก — ห่างกันเพียง 1.39 จุด nDCG@10 ระหว่าง EVIE-8B ที่ 66.75 กับ EVIE-Preview-4.5B ที่ 65.36 — และยังมาพร้อมเชิงอรรถเรื่องงบประมาณโทเคนซึ่งมีนัยสำคัญต่อการนำไปใช้งานจริง โปรโตคอลการประเมินของ EVIE-8B จำกัดเอกสารไว้ที่ 1,024 โทเคนภาพต่อหน้า ขณะที่รุ่นพรีวิวต้องใช้ถึง 1,792 โทเคนต่อหน้าเพื่อทำ 65.36 อันเป็นตัวเลขหลักที่รายงาน แต่กลับทำได้เพียง 64.56 เมื่อใช้ภายในงบประมาณการฝึกของตัวเองที่ 768 โทเคน จากตัวเลขดังกล่าว EVIE-8B จึงไม่ได้แค่แม่นยำกว่าในงบประมาณที่เทียบเคียงกันได้ หากยังแม่นยำกว่าในงบประมาณที่เล็กกว่าด้วย ซึ่งเป็นทิศทางที่ต้องการสำหรับเวลาแฝงต่อหน้า ส่วนชัยชนะในเชิงเทียบเคียงที่ใหญ่กว่าคือบน ViDoRe V2 ซึ่ง EVIE-8B ได้ 74.23 เทียบกับ 70.87 ของรุ่นพรีวิว หรือขยับขึ้น 3.36 จุดบนกระดานอันดับที่รวมงานเอกสารสังเคราะห์ที่ยากกว่าไว้ด้วย ส่วน ViDoRe V1 ซึ่งเป็นกระดานอันดับที่เก่าแก่และอิ่มตัวที่สุดแทบไม่ขยับ: 92.18 เทียบกับ 91.73 รูปแบบดังกล่าว — ที่ผลต่างนิ่งเรียบในจุดที่ทุกคนเกือบแตะเพดานแล้ว และขาดชัดเจนในจุดที่โจทย์ใหม่กว่าและยากกว่า — คือลักษณะเฉพาะที่บ่งบอกถึงการเพิ่มขีดความสามารถอย่างแท้จริง ไม่ใช่แค่สัญญาณรบกวนบนลีดเดอร์บอร์ด แต่อย่างไรก็ตาม นี่ยังคงเป็นการวัดผลโดย Tencent เอง
ดัชนีคือคู่ต่อสู้ที่แท้จริง
ความแม่นยำเป็นเพียงครึ่งหนึ่งของการตัดสินใจนี้ เพราะทั้งสองโมเดลให้คำมั่นสัญญาที่แตกต่างกันอย่างสิ้นเชิงเกี่ยวกับสิ่งที่คุณจัดเก็บ เหตุผลที่ EVIE-Preview-4.5B ถูกสร้างขึ้นมาก็คือเวกเตอร์โทเคนแบบ 128 มิติโดยตรง: การ์ดโมเดลเผยแพร่ตัวเลขดัชนีที่แน่นอน (179.2 GiB ของดัชนี BF16 ดิบต่อล้านหน้าที่งบประมาณการฝึกของมัน และ 420.5 GiB ในระดับการขยายที่คาดประมาณ) พร้อมทั้งชี้ว่าเวกเตอร์ที่แคบกว่าจะลดพื้นที่จัดเก็บและงานประมวลผล MaxSim ลงในสัดส่วนโดยตรง เวกเตอร์โทเคนของ EVIE-8B มี 4096 มิติ — กว้างกว่า 32 เท่าต่อเวกเตอร์ — และการ์ดโมเดลของ EVIE-8B ไม่ได้เผยแพร่ตัวเลขขนาดดัชนีเลยแม้แต่น้อย การละเว้นนั้นคือข้อมูลในตัวเอง: ด้วยจำนวนโทเคนต่อหน้าที่เท่ากัน ดัชนี BF16 ดิบของ EVIE-8B จะมีขนาดราว 32 เท่าของรุ่นพรีวิว ซึ่งทำให้คลังเอกสารล้านหน้าอยู่ในช่วงหลายเทราไบต์ก่อนการควอนไทซ์ และทำให้รุ่นเรือธงเป็นสิ่งที่คุณใช้กับเอกสารเพียงไม่กี่แสนหน้า มากกว่าจะเป็นสิ่งที่คุณโฮสต์อย่างง่ายดายในระดับใหญ่ ความกว้างของเวกเตอร์ในรุ่นเรือธงให้ความเที่ยงตรงในการค้นคืนมา แต่ไม่ได้ให้ความสามารถในการปรับใช้
ตัวเลือกที่สามที่ Tencent เปิดตัวในวันเดียวกัน
การเปรียบเทียบอย่างตรงไปตรงมาใดๆ จะไม่หยุดอยู่ที่โมเดลสองตัวที่ถูกตั้งชื่อไว้ เพราะรีลีสที่บรรจุ EVIE-8B ยังบรรจุ EVIE-4.5B อยู่ด้วย — ซึ่งเป็นโมเดลนักเรียน (student) ขนาด 4.61B ที่ถูกกลั่นจากโมเดลครูขนาด 8B โดยมีโปรเจกชันขนาด 2048 มิติเพียงชุดเดียวที่ตัดทอนได้ในขณะรันไทม์เหลือ 64, 128, 256, 512, 1024 หรือ 2048 มิติ ประกอบกับขั้นตอนบีบอัดโทเคนแบบไม่ต้องฝึกที่ Tencent เรียกมันว่า HAC ซึ่งจัดกลุ่มโทเคนภาพของหน้าเว็บหนึ่งๆ ให้เหลือเพียง 32–64 เวกเตอร์ และตามที่ระบุในโมเดลการ์ด มีพื้นที่ดัชนี (index footprint) อยู่ที่ 3.81 GiB ต่อล้านหน้า บนตารางผลลัพธ์ของ Tencent เอง EVIE-4.5B ทำคะแนนได้ 66.02 ในชุดทดสอบ ViDoRe V3 ซึ่งตามหลังโมเดลครู 8B อยู่เพียง 0.73 และนำหน้า EVIE-Preview-4.5B อยู่ 0.66 ดังนั้นจึงเป็นคำตอบของภาวะกลืนไม่เข้าคายไม่ออกที่การจับคู่ครั้งนี้ตั้งไว้อย่างแท้จริง หากสิ่งที่คุณต้องการคือ “ความแม่นยำส่วนใหญ่ของรุ่น 8B โดยไม่ต้องมีดัชนีเท่ารุ่น 8B” Tencent ได้ส่งมอบโมเดลนั้นออกไปแล้ว และมันไม่ใช่หนึ่งในสองรุ่นที่หน้านี้ตั้งชื่อตาม กรณีที่เหลืออยู่ของ EVIE-Preview-4.5B นั้นแคบแต่มีจริง: มันคือเช็คพอยต์ที่ใช้งานในโปรดักชันอยู่แล้วสำหรับผู้ที่ปรับใช้ในเดือนสิงหาคม และโปรไฟล์แบบมิติคงที่ 128D ของมันนั้นง่ายต่อการพิจารณากว่า matryoshka ที่บังคับให้คุณต้องเลือกมิติของคุณในขณะรันไทม์
คุณควรใช้ตัวใดในการจัดทำดัชนี
จับคู่โมเดลกับข้อจำกัดที่มีผลผูกพันจริง:
• ใช้ดัชนีที่ EVIE-8B หากคุณกำลังสร้างจุดอ้างอิงความแม่นยำ — เกณฑ์มาตรฐาน คลังข้อมูลทางกฎหมายหรือวิทยาศาสตร์มูลค่าสูงที่มีหลายแสนหน้า หรือระบบที่การพลาดการดึงข้อมูลมีต้นทุนสูงและการจัดเก็บข้อมูลมีต้นทุนต่ำ คุณกำลังจ่ายเพื่อจุดสูงสุดของเส้นโค้งของตระกูล และตระกูลตั้งใจให้ student ขนาด 4.5B เป็นสิ่งที่คุณจะขยายขนาดในภายหลัง
• หากคุณได้จัดทำดัชนีด้วย EVIE-Preview-4.5B อยู่แล้ว และคุณภาพที่วัดได้อยู่ในระดับที่ยอมรับได้ ก็ให้ใช้รุ่นนี้ต่อไป — การจัดทำดัชนีใหม่มีต้นทุนที่แท้จริง และการเพิ่มประสิทธิภาพของ V3 ที่คุณจะไล่ตามนั้นมีค่าเพียง 1.39 จุดบนการ์ดของผู้จำหน่ายที่ยังไม่มีใครยืนยันอย่างเป็นอิสระ
• ประเมิน EVIE-4.5B ก่อนตัวเลือกใด หากคุณเริ่มต้นใหม่ในระดับที่มีนัยสำคัญ การตัดทอน Prefix-MRL และการบีบอัด HAC มุ่งเป้าไปที่เลขคณิตการจัดเก็บข้อมูลข้างต้นโดยตรง และตัวเลขของ Tencent เองก็ทำให้มันอยู่ในระยะที่ไล่ทันโมเดลครูได้
ไม่มีตัวใดในสามตัวนี้ที่มี hosted API บนแพลตฟอร์มใดๆ เลย แม้แต่บน OrcaRouter ก็ไม่มี ดังนั้นขั้นตอน retrieval จึงเป็นการตัดสินใจแบบ self-hosted อยู่ดี ไม่ว่าจะเลือกแบบใด {{1}}แต่ขั้นตอนถัดจากนั้นไม่จำเป็นต้องเป็นแบบ self-hosted ก็ได้{{/1}} เราเตอร์แบบเดียวกับที่ OrcaRouter ใช้ครอบคลุมโมเดลมากกว่า 200 ตัว จะทำให้โมเดลที่อ่านหน้าที่ดึงมาและเขียนคำตอบถูกเรียกใช้งานผ่าน API เพียงตัวเดียว พร้อม failover อัตโนมัติข้ามผู้ให้บริการ และราคา list price ของผู้ให้บริการที่ส่งผ่านด้วย markup 0% ซึ่งเป็นการตั้งค่าที่คุณต้องการพอดีเมื่อ retriever ที่ป้อนข้อมูลให้โมเดลดังกล่าวเป็น checkpoint ที่เพิ่งสร้างเมื่อสามวันก่อนพร้อมคำกล่าวอ้างที่ยังไม่ได้รับการยืนยัน {{2}}สร้าง index ด้วย retriever ที่เหมาะสมกับระบบจัดเก็บข้อมูลของคุณ และทำให้ pipeline ส่วนที่เหลือสลับเปลี่ยนได้{{/2}} จนกว่าจะมีคนนอก Tencent ออกมายืนยันว่า scorecard ตัวใดในบรรดานี้เป็นของจริง
