Een hero-titelkaart voor de vergelijking 'EVIE-8B vs EVIE-Preview-4.5B' met de ondertitel 'Een 1,39-puntenwinst voor 32x bredere vectoren', die een platte visual met twee panelen toont: links een hoge stapel documentpagina's naast het label '4096D', rechts een compacte documentpagina naast een klein pictogram van een harde schijf met het label '128D', een dunne weegschaallijn gecentreerd tussen de panelen, de voettekst 'Met welke visuele documentretriever van Tencent moet je indexeren?' en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

EVIE-8B vs EVIE-Preview-4.5B: een 1,39-puntswinst voor 32× bredere vectoren

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Drie weken nadat Tencent EVIE-Preview-4.5B had uitgebracht en het de meest nauwkeurige visuele documentretriever op de ViDoRe-ranglijsten had genoemd, bracht Tencent EVIE-8B uit en verplaatste stilletjes de doelpalen waaraan zijn eigen 128-dimensionale model zich had gemeten. EVIE-8B is het vlaggenschip-teachermodel van 8,41B met 4096-dimensionale per-token-embeddings; EVIE-Preview-4.5B is de compacte retriever van 4,54B waarvan het hele verhaal was dat 128 dimensies genoeg waren om modellen te verslaan die vier keer zo groot waren. Op de bijgewerkte ranglijst in de EVIE-8B-modelcard staat EVIE-Preview-4.5B nu op de derde plaats binnen zijn eigen familie — achter de nieuwe EVIE-8B en achter EVIE-4.5B, een studentmodel dat Tencent diezelfde ochtend uitbracht. Als je moet kiezen aan de hand van welk van de twee genoemde modellen je een documentcorpus indexeert, zeggen de cijfers op de modelcards van Tencent dat de 8B ongeveer 1,39 punt beter scoort op ViDoRe V3 en 3,36 punt beter op ViDoRe V2 — en dat het 32 keer meer indexruimte per vector kost om daar te komen. Dit stuk gaat over de vraag of die ruil de moeite waard is, en het begint met het eerlijke voorbehoud dat beide scorekaarten van Tencent zelf zijn en dat geen van beide onafhankelijk is gereproduceerd.

De korte versie

• Kies EVIE-8B als de retrievalnauwkeurigheid de bottleneck is en uw corpus klein genoeg is dat de ruwe indexgrootte er niet toe doet — u meet in duizenden pagina's, niet in miljoenen, en u wilt de beste open retriever die Tencent heeft gepubliceerd.

Kies EVIE-Preview-4.5B als indexkosten, latentie per pagina of GPU-budget een echte beperking is — de 128D-vectoren zijn de hele reden dat het bestaat, en het nauwkeurigheidsverschil met de 8B is klein op ViDoRe V1 en bescheiden op V3.

• Controleer beide opnieuw tegen EVIE-4.5B voordat je je vastlegt: Tencent heeft dezelfde dag een studentmodel uitgebracht met tijdens runtime afkapbare vectoren en tokencompressie, dat beide onderbiedt op de efficiëntiegrens, en elke vergelijking die dit negeert is al achterhaald.

• Beschouw elk getal hier als door de leverancier gerapporteerd. EVIE-8B is door niemand buiten Tencent gedraaid; de cijfers van EVIE-Preview-4.5B komen uit de eigen reproductiescripts van Tencent.

Waar ze daadwerkelijk verschillen

• Parameters — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• Backbone — Qwen3.5-9B met volledige bidirectionele aandacht versus Qwen3.5-4B met afgewisselde GatedDeltaNet lineaire aandacht en volledige aandacht.

• Embedding — 4096-dimensionale multi-vector per token versus native 128-dimensionale multi-vector per token, beide gescoord met MaxSim late-interactie.

• ViDoRe V1 (10 taken, nDCG@5) — 92.18 vs 91.73.

• ViDoRe V2 (4 taken, nDCG@5) — 74.23 vs 70.87. Dit is het grootste relatieve verschil.

• ViDoRe V3 (48 taken, nDCG@10) — 66,75 versus 65,36.

• Budget voor visuele tokens achter die kerncijfers — 1.024 tokens/pagina voor de evaluatie van EVIE-8B versus 1.792 tokens/pagina voor de koptier van EVIE-Preview-4.5B (op de trainingstier van 768 tokens scoort de preview 64,56).

• Ruwe BF16-index per 1M pagina's — niet gepubliceerd voor EVIE-8B versus 179,2 GiB bij 768 tokens/pagina en 420,5 GiB bij 1.792 voor de preview.

• Licentie en release — Apache-2.0, stille release op 2026-09-04 vs Apache-2.0, stille release op 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Het scorebord hierboven herhaalt hetzelfde beeld. Houd twee kanttekeningen in gedachten terwijl u dit leest: de kolom {{1}}EVIE-8B{{/1}} en de kolom {{2}}EVIE-Preview-4.5B{{/2}} komen van twee verschillende Tencent-modelkaarten, en het belangrijkste V3-cijfer van de 8B is gemeten bij een lager budget aan visuele tokens per pagina dan het belangrijkste cijfer van de preview.

Twee Tencent-kaarten praten met elkaar.

De eerlijke framing van deze vergelijking is dat het een familieruzie is, geen onafhankelijke competitie. De eigen kaart van EVIE-Preview-4.5B, gepubliceerd op 17 augustus, claimt "Rank #1 on ViDoRe V3" met 65,36 nDCG@10, waarmee webAI-ColVec1.1-8b met 0,04 wordt verslagen. De kaart van EVIE-8B, gepubliceerd op 4 september, vermeldt diezelfde 65,36 opnieuw als het op twee na beste getal op de pagina, onder de 66,75 van EVIE-8B en de 66,02 van EVIE-4.5B, en toont dat de 8B de preview verslaat op alle acht openbare ViDoRe V3-domeinen. Beide scorekaarten zijn opgesteld met de eigen evaluatieomgeving van Tencent, en voor geen van beide modellen staat er tot nu toe een onafhankelijke run in de literatuur. Dus de vergelijking die je leest is het relaas van Tencent over Tencent die Tencent verslaat — intern consistent, vermoedelijk bewust zo geconstrueerd, en door niemand zonder belang bij de uitkomst geverifieerd.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

De tencent/EVIE-8B-kaart hierboven is het publieke gezicht van de uitdager: een 8,41B-vlaggenschip-teacher met 4096D-embeddings en de ververste ViDoRe-tabel van de familie bovenaan.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

De tencent/EVIE-Preview-4.5B-kaart hierboven is die van de huidige houder: een 4,54B-retriever waarvan de native 128D-vectoren en de gepubliceerde indexkostenberekening nog steeds het onderscheidende kenmerk vormen.

De vraag van 1,39 punten

De ruwe kloof op ViDoRe V3 is klein — 1,39 punt op nDCG@10 tussen de 66,75 van EVIE-8B en de 65,36 van EVIE-Preview-4.5B — en er zit een asterisk bij het tokenbudget die voor de implementatie van belang is. Het evaluatieprotocol van EVIE-8B beperkt documenten tot 1024 visuele tokens per pagina; de preview had 1792 tokens per pagina nodig om zijn headline-score van 65,36 te halen en scoorde slechts 64,56 binnen zijn eigen trainingsbudget van 768 tokens. Op basis van die cijfers is de 8B niet alleen nauwkeuriger bij een vergelijkbaar budget — hij is nauwkeuriger bij een kleiner budget, en dat is de richting die je wilt voor de latentie per pagina. De grotere relatieve winst wordt geboekt op ViDoRe V2, waar EVIE-8B 74,23 rapporteert tegen 70,87 van de preview: een sprong van 3,36 punten op de ranglijst met de moeilijkere gesynthetiseerde documenttaken. ViDoRe V1, de oudste en meest verzadigde ranglijst, beweegt nauwelijks: 92,18 tegen 91,73. Dat patroon — vlak waar iedereen al dicht bij het plafond zit, uitgesproken waar de taken nieuwer en moeilijker zijn — past bij een echte uitbreiding van de mogelijkheden in plaats van bij ruis op de ranglijst, maar het blijft wel de eigen meting van Tencent.

De index is de echte tegenstander.

Nauwkeurigheid is slechts de helft van deze beslissing, want de twee modellen doen radicaal verschillende beloften over wat je opslaat. De bestaansreden van EVIE-Preview-4.5B is zijn native 128-dimensionale tokenvector: de modelkaart publiceert exacte indexberekeningen (179,2 GiB aan ruwe BF16-index per miljoen pagina's bij zijn trainingsbudget, 420,5 GiB bij het geëxtrapoleerde niveau) en wijst erop dat een smallere vector opslag en MaxSim-scorewerk in directe verhouding vermindert. De tokenvectoren van EVIE-8B zijn 4096-dimensionaal — 32 keer zo breed per vector — en de modelkaart van EVIE-8B publiceert geen enkel cijfer voor de indexomvang. Die weglating is op zichzelf informatie: bij hetzelfde aantal tokens per pagina ligt een ruwe BF16-index van EVIE-8B in de orde van 32× die van de preview, wat een corpus van een miljoen pagina's vóór kwantisatie in het multi-terabytebereik plaatst en van het vlaggenschip iets maakt dat je op een paar honderdduizend pagina's richt, niet iets dat je zomaar op grote schaal host. De breedte van het vlaggenschip levert retrievalgetrouwheid op; het levert geen inzetbaarheid op.

De derde optie die Tencent dezelfde dag uitbracht.

Geen eerlijke versie van deze vergelijking stopt bij de twee genoemde modellen, want de release die EVIE-8B bevatte, bevatte ook EVIE-4.5B — een student van 4,61B die is gedestilleerd uit de 8B-leraar, met een enkele 2048-dimensionale projectie die tijdens runtime wordt afgekapt tot 64, 128, 256, 512, 1024 of 2048 dimensies, plus een trainingsvrije tokencompressiestap die Tencent HAC noemt en die de visuele tokens van een pagina clustert tot 32–64 vectoren en, volgens de modelkaart, een indexvoetafdruk van 3,81 GiB per miljoen pagina's. Op Tencent's eigen tabel scoort EVIE-4.5B 66,02 op ViDoRe V3 — slechts 0,73 achter de 8B-leraar en 0,66 voor op EVIE-Preview-4.5B — wat het het antwoord maakt op het exacte dilemma dat deze vergelijking oproept. Als je wilt hebben “het grootste deel van de nauwkeurigheid van de 8B zonder de index van de 8B”, dan heeft Tencent dat model al uitgebracht, en het is geen van de twee modellen waarnaar deze pagina is vernoemd. Het resterende argument voor EVIE-Preview-4.5B is beperkt maar reëel: het is de checkpoint die al in productie is voor iedereen die hem in augustus heeft uitgerold, en het vaste 128D-profiel is eenvoudiger te doorgronden dan een matryoshka die je vraagt om je dimensie tijdens runtime te kiezen.

Met welke moet je indexeren?

Match het model aan de beperking die daadwerkelijk bindend is:

• Indexeer op EVIE-8B als je het referentiepunt voor nauwkeurigheid bouwt — een benchmark, een hoogwaardig juridisch of wetenschappelijk corpus van honderdduizenden pagina's, of een systeem waar retrieval-missers duur zijn en opslag goedkoop is. Je betaalt voor de top van de familiecurve, en de familie bedoelt de 4.5B-student als het model dat je later opschaalt.

• Blijf op EVIE-Preview-4.5B als je er al mee geïndexeerd hebt en de gemeten kwaliteit aanvaardbaar is — een herindexering vormt een echte kostenpost, en de V3-winst die je zou najagen is 1,39 punten op een leverancierskaart die niemand onafhankelijk heeft bevestigd.

• Als je vanaf nul begint op een betekenisvolle schaal, evalueer EVIE-4.5B dan vóór een van beide. De Prefix-MRL-truncatie en HAC-compressie zijn direct gericht op de bovenstaande opslagberekeningen, en de eigen cijfers van Tencent plaatsen het op een steenworp afstand van het docentmodel.

Geen van de drie heeft een gehoste API op welk platform dan ook, inclusief OrcaRouter, dus de retrievalfase moet hoe dan ook zelf worden gehost. De fase daarna hoeft dat niet te zijn. Een router zoals die van OrcaRouter, die over 200+ modellen draait, houdt het model dat uw opgehaalde pagina's leest en het antwoord schrijft achter één enkele API met automatische failover tussen providers en met lijstprijzen van providers die zonder opslag (0% markup) worden doorgegeven — wat precies de opzet is die u wilt wanneer de retriever die het voedt een drie dagen oud checkpoint is met niet-geverifieerde claims. Bouw de index met de retriever die bij uw dataopslag past en houd de rest van de pipeline verwisselbaar totdat iemand buiten Tencent bevestigt welke van deze scorecards echt is.