Een hero-titelkaart voor het nieuwsartikel 'EVIE-8B' met de ondertitel 'Tencent brengt stilletjes zijn meest nauwkeurige visuele documentzoeker tot nu toe uit', met een platte redactionele illustratie van een vergrootglas boven een stapel documentpagina's (één pagina met een kleine gegevenstabel, een andere met een eenvoudig lijndiagram) waaruit kleine vierkante tokenvectoren stromen naar een 4096D-pillabel, met de voettekst 'Stilletjes uitgebracht op 4 september 2026 — gewichten op Hugging Face, nog geen aankondiging' en het OrcaRouter-logo in de rechteronderhoek.
Engineering & Research

EVIE-8B: Tencent lanceert stilletjes zijn meest nauwkeurige visuele documentzoeker tot nu toe

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Drie weken geleden was Tencent's EVIE-Preview-4.5B de meest accurate open visuele documentretriever op de ViDoRe-ranglijsten, op basis van cijfers die Tencent zelf had gerapporteerd. Op 4 september verving Tencent dat model stilletjes bovenaan zijn eigen leaderboard — niet met een externe uitdager, maar met een grotere broer die diezelfde ochtend was uitgebracht. EVIE-8B, een late-interaction retriever met 8,41 miljard parameters op een Qwen3.5-9B-basis met 4096-dimensionale per-token-embeddings, verscheen als weights plus code op Hugging Face en GitHub, zonder aankondiging, zonder blogpost en zonder paper. Een derde checkpoint, EVIE-4.5B, verscheen in dezelfde minuut en staat nu tussen de twee in. Elke claim die aan deze release hangt — de scores, de architectuur, zelfs waarvoor de modellen dienen — berust momenteel op wat Tencent's eigen repositories beweren, omdat niemand buiten Tencent nog iets over EVIE-8B heeft gepubliceerd. Dit is wat er daadwerkelijk te weten valt uit de repo, en wat nog niet is bevestigd.

Wat Tencent op 4 september uitbracht

Op 2026-09-04 verschenen er twee nieuwe repositories in de tencent-organisatie op Hugging Face, met ongeveer een minuut verschil: tencent/EVIE-8B en tencent/EVIE-4.5B. Tegelijkertijd verscheen er een geconsolideerde GitHub-repository, Tencent/EVIE, met daarin de trainingscode, de ColQwen3.5-inferentie-engine en de evaluatieharness voor 138 taken. Beide modelrepositories vallen onder Apache-2.0, beide gebruiken de colpali-engine-bibliotheek en beide dragen de tag visual-document-retrieval-pipeline. De oudere EVIE-Preview-4.5B van 17 augustus staat nog op Hugging Face onder de naam 'Preview', maar is niet langer het vlaggenschip van de familie: in het bijgewerkte leaderboard in de EVIE-8B-kaart zet Tencent drie eigen checkpoints bovenaan — EVIE-8B met 66,75 ViDoRe V3 nDCG@10, EVIE-4.5B met 66,02 en EVIE-Preview-4.5B met 65,36.

Overal is er geen aankondiging geweest. Het releasebericht van de EVIE-8B-kaart vermeldt dat de weights, inferentiepijplijnen en evaluatiesuites open-source zijn gemaakt, en voegt daaraan toe dat "volledige technische details, architecturale ablatiestudies en het formele onderzoekspaper in een aanstaande release zullen worden bijgewerkt." De GitHub-repository had op het moment van schrijven vier commits en geen releases. Geen van beide nieuwe repositories toont tot nu toe betekenisvolle adoptie — geen community-forks met onafhankelijke resultaten, geen evaluaties door derden, en downloadtellingen staan twee dagen nadat de repositories openbaar werden nog steeds op bijna nul. Op basis van het bewijs is dit een release van Tencent waarbij eerst de weights worden uitgebracht en het paper later wordt geschreven, in hetzelfde stille patroon dat het lab in augustus gebruikte voor EVIE-Preview-4.5B en UI-Mate-9B.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

De modelkaart van tencent/EVIE-8B hierboven is het publieke gezicht van de release: een checkpoint voor visuele documentretrieval, getagd voor de colpali-engine-bibliotheek, met een Apache-2.0-licentie, een 4096-dimensionale late-interaction-embedding en de eigen bijgewerkte ViDoRe-tabel van de familie bovenaan de kaart.

EVIE-8B, het vlaggenschip-leraarmodel

Architectonisch gezien behoort EVIE-8B tot de late-interactiefamilie van ColPali/ColBERT. In plaats van een pagina samen te persen tot één embedding-vector — de verliesgevende zet die single-vector dense retrieval maakt — draait het een vision-language-backbone over de pagina-afbeelding en behoudt het een multi-vectorrepresentatie per token. Vervolgens scoort het relevantie met de MaxSim-operator: elk querytoken neemt de beste match over de tokens van de pagina, en die maxima worden opgeteld tot de relevantiescore. De specifieke keuzes van EVIE-8B zijn een Qwen3.5-9B-backbone die met volledige bidirectionele aandacht draait (het model is als encoder opgezet, dus het causale masker is uitgeschakeld over de beeld-tekstsequentie) en een brede 4096-dimensionale projectie per token. De breedte dient de getrouwheid: ruimtelijke lay-out, typografie, grafiekstructuur en tabelrelaties blijven in de representatie behouden in plaats van door middeling verloren te gaan.

Tencent positioneert EVIE-8B expliciet als de "vlaggenschip-leraar". De EVIE-4.5B-leerling wordt op basis van dit model getraind volgens een recept dat Tencent EVIE-ARD noemt — ankerbehoudende, capaciteitsbewuste relatiedistillatie die de topologie van tokenrelaties overdraagt en gebruikmaakt van supervisie met een marge voor harde negatieven. Met andere woorden, het 8B-model heeft twee taken: het nauwkeurigheidsplafond voor de productlijn bepalen en dienen als kwaliteitsanker waarvan de compacte leerling distilleert. Aan de trainingskant vermeldt de modelkaart 775.635 document-queryparen, met gemijnde harde negatieven die opnieuw zijn beoordeeld door een multimodale beoordelaar die beantwoordbare kandidaten opwaardeert tot positieven, dubbelzinnige voorbeelden weglaat uit de verliesfunctie en alleen strikt irrelevante pagina's als echte negatieven behoudt. De vrijgegeven "a40"-checkpoint is zelf een mix in de gewichtsruimte, met α = 0,40, van twee onafhankelijk getrainde armen.

Het scorebord dat Tencent voor zichzelf schreef

Alle onderstaande cijfers zijn door de leverancier gerapporteerd. Ze komen uit Tencent's eigen modelkaart en zijn geproduceerd met de evaluatie-harness die Tencent in zijn repository meelevert; geen enkele is onafhankelijk gereproduceerd, en EVIE-8B is nog niet door iemand buiten het lab uitgevoerd.

• Parameters / backbone — 8.41B, Qwen3.5-9B, volledige bidirectionele aandacht.

• Embedding — 4096-dimensionale per-token multi-vector, MaxSim late-interactie.

• ViDoRe V1 (10 taken, nDCG@5) — 92.18.

• ViDoRe V2 (4 taken, nDCG@5) — 74.23.

ViDoRe V3 (48 taken, nDCG@10) — 66,75, en met een per-domein-sweep claimt de kaart alle acht openbare domeinen te winnen.

• JinaVDR (76 taken, nDCG@10) — 83.30; macro-gemiddelde nDCG@10 over vier boards — 79.51 over de suite van 138 taken.

• Licentie — Apache-2.0; gewichten, inferentie en evaluatiecode zijn open.

A single-column scoreboard for EVIE-8B reading: Params 8.41B, Backbone Qwen3.5-9B, Embedding 4096D per token, ViDoRe V1 (nDCG@5) 92.18, ViDoRe V3 (nDCG@10) 66.75, License Apache-2.0, with a footer noting all figures are vendor-reported from the tencent/EVIE-8B card and not independently reproduced, and the OrcaRouter logo in the bottom-right corner.

De interessantste rij in de tabel van Tencent is die waarin Tencent Tencent verslaat. De EVIE-Preview-4.5B-modelkaart van augustus claimde 'Rank #1 op ViDoRe V3' met 65,36 nDCG@10, net boven de 65,32 van webAI-ColVec1.1-8b. In de bijgewerkte tabel in de EVIE-8B-modelkaart staat diezelfde 65,36 nu op de derde plaats overall, achter de 66,75 van EVIE-8B en de 66,02 van EVIE-4.5B. De uitsplitsing per domein van EVIE-8B verslaat de oude preview in alle acht publieke ViDoRe V3-domeinen — CompSci 81,86 tegen 80,65, Finance EN 71,23 tegen 70,50, Pharma 70,81 tegen 69,20, enzovoort — met een gemiddelde winst van 1,39 punten. Of die winst een onafhankelijke run overleeft, is precies de open vraag; maar de interne consistentie is het vermelden waard, want een teacher die zijn eigen student niet kan verslaan, zou een vreemd ding zijn om uit te brengen.

A family graphic titled 'Three EVIE checkpoints, one self-published leaderboard' showing three stacked rows each with a ViDoRe V3 nDCG@10 value: EVIE-8B 66.75 with a gold rank-1 badge and the tag '4096D teacher', EVIE-4.5B 66.02 with a silver rank-2 badge and the tag 'Prefix-MRL student', and EVIE-Preview-4.5B 65.36 with a bronze rank-3 badge and the tag '128D preview', with a footer noting the ranking is vendor-reported from the EVIE-8B card of September 4, 2026, and the OrcaRouter logo in the bottom-right corner.

De bovenstaande familiegrafiek herhaalt de drie-checkpoint-ranglijst die Tencent op 4 september in de EVIE-8B-modelkaart publiceerde — EVIE-8B op 66.75, EVIE-4.5B op 66.02, EVIE-Preview-4.5B op 65.36 op ViDoRe V3 nDCG@10 — waarbij de 128D-preview plaatsmaakt voor de 4096D-teacher en de Prefix-MRL-student.

Waarom het vlaggenschip niet het implementatiemodel is

Er is een reden waarom de nauwkeurigheidsleider een 'teacher' wordt genoemd in plaats van een 'default'. Breedte kost opslag en rekenkracht bij het scoren, en 4096 dimensies per token is erg breed. In BF16 weegt één tokenvector van EVIE-8B 8 KiB vóór kwantisering, en een dense pagina kan honderden tokenvectors opleveren – terwijl het eigen evaluatieprotocol van de modelcard documenten begrenst tot 1.024 visuele tokens per pagina. Tencent maakt voor EVIE-8B geen indexomvang bekend, wat opvallend is, want de modelcard van EVIE-Preview-4.5B maakte voor zijn 128-dimensionale index wél exacte cijfers bekend: 179,2 GiB aan ruwe BF16-index per miljoen pagina's bij een trainingsbudget van 768 tokens, en 420,5 GiB bij het geëxtrapoleerde niveau van 1.792 tokens. Vector voor vector zijn de embeddings van EVIE-8B 32 keer breder dan die van de preview, dus een ruwe EVIE-8B-index met hetzelfde tokenbudget loopt per miljoen pagina's op tot meerdere terabytes – nog voordat het retrievalsysteem dat de index in het RAM-geheugen moet vasthouden, ook maar ter sprake is gekomen.

Dat EVIE-4.5B op dezelfde dag verschijnt, zegt veel over hoe Tencent verwacht dat die spanning wordt opgelost. EVIE-4.5B is de 4,61B-student met een enkele 2048-dimensionale projectie die tijdens runtime wordt afgekapt tot 64, 128, 256, 512, 1024 of 2048 dimensies (Tencent noemt deze methode Prefix-MRL), plus een trainingsvrije tokencompressiestap die het bedrijf HAC noemt en die de ~750 visuele tokens van een pagina clustert tot 32–64 vectoren. Tencents voornaamste claim voor dat model is een indexvoetafdruk van 3,81 GiB per miljoen pagina's — een getal dat, net als de rest, door de leverancier is gerapporteerd. Alles bij elkaar genomen lijkt de release minder op "één nieuw 8B-model" en meer op een doelbewuste familie: de 8B bepaalt de bovengrens en traint de student, en de student is degene die qua omvang daadwerkelijk achter een productie-index past.

Hoe voer je EVIE-8B vandaag uit

EVIE-8B wordt uitsluitend als gewichten geleverd. Er is geen gehoste API op enig platform — inclusief OrcaRouter — dus de enige route vandaag is om de checkpoint zelf te hosten en deze via het ColQwen3.5-pad in colpali-engine te draaien. De quickstart van de modelkaart is kort: laad het model in BF16 met flash-attention, roep enable_bidirectional_attention() aan, embed de paginabeelden en de tekstquery, en score daarna met de MaxSim van de processor. De bidirectionele stap is geen optionele versiering — de uitgebrachte colpali-engine bouwt ColQwen3.5 standaard met causale masks, en de kaart van het previewmodel documenteerde dat het masker laten staan ruwweg 1,1 punt kost op top-hit MaxSim. Dezelfde helper wordt ook voor EVIE-8B meegeleverd. Een 8.41B BF16-checkpoint is volgens de vuistregel van twee bytes per parameter in de orde van 17 GB aan gewichten, dus dit is een propositie voor een enkele GPU met headroom in plaats van een edge-model, en de corpus bevindt zich waar je de index bewaart, niet op het model.

Wat EVIE-8B verandert voor een document-RAG-stack

Voor wie retrieval bouwt over scans, ingediende documenten, grafieken of formulieren, is de praktische verandering dat het kwaliteitsplafond voor open visuele documentretrieval net is verschoven, en dat binnen een familie die nu drie prijs-prestatiepunten omvat. Een retriever levert echter alleen de pagina's aan. Het model dat die pagina's leest en het antwoord schrijft, is een afzonderlijke beslissing, en dat is de laag waar routing zijn waarde bewijst: OrcaRouter biedt één API aan voor 200+ modellen tegen de lijstprijs van de provider met 0% opslag, zodat het leesmodel achter je retriever kan worden gewisseld zonder herschrijving, en een prijsverlaging van een leverancier op een gerouteerd model is dezelfde dag live als deze wordt aangekondigd. Die scheiding is des te belangrijker wanneer de retrievalhelft een gloednieuw, onbewezen checkpoint is — je kunt EVIE-8B inzetten voor indexering terwijl je de generatielaag achter een interface houdt die je aan geen enkel model koppelt.

Wat nu te kijken

Drie dingen zouden deze stille repo-drop veranderen in een afgerond verhaal. Ten eerste, een onafhankelijke run: {{1}}totdat iemand buiten Tencent de ViDoRe- en JinaVDR-cijfers reproduceert, zijn zowel de "rank #1" van EVIE-8B als die van het oude preview-model zelfgerapporteerde claims die toevallig met elkaar op gespannen voet staan{{/1}}. Ten tweede, het beloofde paper en de ablatiestudies — {{2}}de keuze voor 4096 dimensies, het weight-mix-checkpoint en het distillatierecept zijn momenteel allemaal beweringen zonder de bijbehorende publicatie om ze te onderbouwen{{/2}}. Ten derde, de naamgeving: {{3}}nu EVIE-4.5B de plek inneemt die EVIE-Preview-4.5B drie weken geleden bezette, is het een open vraag of Tencent de "Preview"-lijn in leven houdt of haar in de hernoemde familie laat opgaan{{/3}}. Gezien het tempo — drie checkpoints voor visuele documentretrieval in drie weken — is het zinvoller om aan te nemen dat er zwaar in deze lijn wordt geïnvesteerd en dat het lab met stille releases alvast vóór het paper uitkomt.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube