
EVIE-8B: Tencent lanserar i det tysta sin mest träffsäkra visuella dokumentsökare hittills
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
För tre veckor sedan var Tencents EVIE-Preview-4.5B den mest exakta öppna visuella dokumentretrievern på ViDoRe-topplistorna, baserat på siffror som Tencent själva rapporterade. Den 4 september ersatte Tencent tyst den modellen överst på sin egen topplista – inte med en extern utmanare, utan med ett större syskon som släpptes samma morgon. EVIE-8B, en late-interaction-retriever med 8,41 miljarder parametrar på en Qwen3.5-9B-stomme med 4096-dimensionella embeddingar per token, publicerades som vikter och kod på Hugging Face och GitHub utan tillkännagivande, blogginlägg eller forskningsartikel. En tredje checkpoint, EVIE-4.5B, dök upp i samma minut och ligger nu mellan de två. Varje påstående kopplat till denna lansering – resultaten, arkitekturen, till och med vad modellerna är till för – vilar för närvarande på vad Tencents egna repositories säger, eftersom ingen utanför Tencent har publicerat något om EVIE-8B ännu. Detta är vad som faktiskt går att utläsa ur repot, och vad som ännu inte har bekräftats.
Vad Tencent släppte den 4 september
Den 4 september 2026 dök två nya repositories upp i tencent-organisationen på Hugging Face med ungefär en minuts mellanrum: tencent/EVIE-8B och tencent/EVIE-4.5B. Ett konsoliderat GitHub-repository, Tencent/EVIE, publicerades samtidigt och innehöll träningskoden, ColQwen3.5-inferensmotorn och utvärderingsramverket med 138 uppgifter. Båda modellrepositoryerna är Apache-2.0-licensierade, båda använder colpali-engine-biblioteket och båda bär taggen visual-document-retrieval-pipeline. Det äldre EVIE-Preview-4.5B från 17 augusti finns kvar på Hugging Face under namnet ”Preview”, men det är inte längre familjens flaggskepp: i den uppdaterade leaderboarden i EVIE-8B-kortet listar Tencent tre av sina egna checkpoints överst — EVIE-8B med 66,75 i ViDoRe V3 nDCG@10, EVIE-4.5B med 66,02 och EVIE-Preview-4.5B med 65,36.
Det har inte gjorts något tillkännagivande någonstans. I releasesedeln för EVIE-8B-kortet står det att vikterna, inferenspipelinerna och utvärderingssviterna är öppen källkod, och tillägger att "fullständiga tekniska detaljer, arkitekturella ablationsstudier och den formella forskningsartikeln kommer att uppdateras i en kommande release." GitHub-förvaret hade fyra commits och inga releases vid skrivande stund. Inget av de nya förvaren visar ännu någon meningsfull användning – inga community-forks med oberoende resultat, inga tredjepartsutvärderingar, och nedladdningsräknarna ligger fortfarande nära noll två dagar efter att förvaren blev offentliga. Av allt att döma är detta en release från Tencent där man först släpper vikterna och skriver forskningsartikeln senare, i samma tysta mönster som labbet använde för EVIE-Preview-4.5B och UI-Mate-9B i augusti.

Modellkortet för tencent/EVIE-8B ovan är utgåvans publika presentationsyta: en kontrollpunkt för visuell dokumentåtervinning, taggad för colpali-engine-biblioteket, licensierad under Apache-2.0, med en 4096-dimensionell late-interaction-embedding och familjens egen uppdaterade ViDoRe-tabell nära toppen av kortet.
EVIE-8B, flaggskeppsläraren
Arkitekturellt sett tillhör EVIE-8B familjen ColPali/ColBERT med sen interaktion (late interaction). Istället för att pressa en sida till en enda inbäddningsvektor – den förlustbringande manöver som enkelvektor-dense retrieval gör – kör den en vision-språk-stomme över sidbilden och behåller en multi-vektorrepresentation per token, för att sedan poängsätta relevans med MaxSim-operatorn: varje frågetoken tar sin bästa matchning över sidans tokener, och dessa maxvärden summeras till relevanspoängen. EVIE-8B:s specifika val är en Qwen3.5-9B-stomme som körs med full bidirektionell uppmärksamhet (modellen är omgjord till encoder, så den kausala masken är avstängd över vision-text-sekvensen) och en bred 4096-dimensionell projektion per token. Poängen med bredden är trohet: rumslig layout, typografi, diagramstruktur och tabellrelationer överlever i representationen istället för att medelvärderas bort.
Tencent positionerar EVIE-8B uttryckligen som den ”ledande läraren”. EVIE-4.5B-studenten tränas från den med en metod som Tencent kallar EVIE-ARD – ankarbevarende, kapacitetsmedveten relationsdestillation som överför tokenrelationstopologi och använder hård-negativ marginalövervakning. Med andra ord har 8B-modellen två uppgifter: att sätta noggrannhetstaket för produktlinjen och att vara det kvalitetsankare som den kompakta studenten destilleras från. På träningssidan rapporterar kortet 775 635 dokument–frågepar, där utvinnade hårda negativ ombedöms av en multimodal domare som befordrar svarbara kandidater till positiva, maskerar tvetydiga sådana ur förlustfunktionen och behåller endast strikt irrelevanta sidor som sanna negativ. Den släppta ”a40”-kontrollpunkten är i sig en viktrymdsmix, vid α = 0,40, av två oberoende tränade armar.
Poängtavlan som Tencent skrev åt sig själv
Alla siffror nedan är leverantörsrapporterade. De kommer från Tencents eget modellkort och togs fram med den utvärderingsmiljö som Tencent tillhandahåller i sitt repository; ingen av dem har oberoende reproducerats, och EVIE-8B har ännu inte körts av någon utanför labbet.
• Parametrar / backbone — 8,41B, Qwen3.5-9B, full dubbelriktad uppmärksamhet.
• Inbäddning — 4096-dimensionell multivektor per token, MaxSim-seninteraktion.
• ViDoRe V1 (10 uppgifter, nDCG@5) — 92.18.
• ViDoRe V2 (4 uppgifter, nDCG@5) — 74,23.
• ViDoRe V3 (48 uppgifter, nDCG@10) — 66,75, med en svepning per domän hävdar kortet att det vinner alla åtta offentliga domäner.
• JinaVDR (76 uppgifter, nDCG@10) — 83,30; makro-medelvärdet för nDCG@10 över fyra delsviter — 79,51 i den 138 uppgifter omfattande testsviten.
• Licens — Apache-2.0; vikter, inferens och utvärderingskod är öppna.

Den mest intressanta raden i Tencents tabell är den där Tencent slår Tencent. EVIE-Preview-4.5B-modellkortet från augusti hävdade "Rank #1 on ViDoRe V3" med 65,36 nDCG@10, en hårsmån före webAI-ColVec1.1-8b:s 65,32. I den uppdaterade tabellen i EVIE-8B-kortet är samma 65,36 nu på tredje plats totalt, bakom EVIE-8B:s 66,75 och EVIE-4.5B:s 66,02. EVIE-8B:s uppdelning per domän slår den gamla förhandsversionen i alla åtta offentliga ViDoRe V3-domäner — CompSci 81,86 mot 80,65, Finance EN 71,23 mot 70,50, Pharma 70,81 mot 69,20 och så vidare — med en genomsnittlig förbättring på 1,39 poäng. Huruvida den förbättringen håller vid en oberoende körning är precis den öppna frågan; men den interna konsistensen är värd att notera, eftersom en lärare som inte kan slå sin egen elev vore en märklig sak att lansera.

Familjegrafiken ovan återger rankningen av de tre checkpoints som Tencent publicerade i EVIE-8B-kortet den 4 september — EVIE-8B på 66.75, EVIE-4.5B på 66.02, EVIE-Preview-4.5B på 65.36 på ViDoRe V3 nDCG@10 — där 128D-förhandsversionen har fått ge vika för 4096D-teachern och Prefix-MRL-studenten.
Varför flaggskeppet inte är distributionsmodellen
Det finns en anledning till att precisionsledaren kallas en lärare snarare än en standardmodell. Bredd kostar lagrings- och scoringsberäkningsresurser, och 4 096 dimensioner per token är mycket brett. I BF16 är en EVIE-8B-tokenvektor 8 KiB före eventuell kvantisering, och en tät sida kan producera hundratals tokenvektorer – kortets eget utvärderingsprotokoll begränsar dokument till 1 024 visuella token per sida. Tencent publicerar ingen indexstorlekssiffra för EVIE-8B, vilket är anmärkningsvärt eftersom EVIE-Preview-4.5B-kortet publicerade exakta siffror för sitt 128-dimensionella index: 179,2 GiB rå BF16-index per miljon sidor med sin 768-token-träningsbudget, 420,5 GiB i det extrapolerade 1 792-token-läget. Vektor för vektor är EVIE-8B:s embeddingar 32 gånger bredare än förhandsversionens, så ett rå EVIE-8B-index med samma tokenbudget hamnar i multi-terabyteklassen per miljon sidor – innan hämtningssystemet som måste hålla det i RAM ens har kommit på tal.
Samtidssl äppet av EVIE-4.5B är tecknet på hur Tencent förväntar sig att den spänningen ska lösas. EVIE-4.5B är studentmodellen på 4,61B parametrar med en enda 2048-dimensionell projektion som vid körning trunkeras till 64, 128, 256, 512, 1024 eller 2048 dimensioner (Tencent kallar metoden Prefix-MRL), plus ett träningsfritt tokenkomprimeringssteg som företaget kallar HAC och som klustrar en sidas ~750 visuella tokens ner till 32–64 vektorer. Tencents huvudnummer för den modellen är ett indexavtryck på 3,81 GiB per miljon sidor – en siffra som, liksom resten, är leverantörsrapporterad. Sammantaget framstår releasen mindre som ”en ny 8B-modell” och mer som en genomtänkt familj: 8B sätter taket och tränar eleven, och eleven är den som faktiskt är dimensionerad för att sitta bakom ett produktionsindex.
Så här kör du EVIE-8B idag
EVIE-8B levereras endast som vikter. Det finns ingen värdbaserad API på någon plattform — inklusive OrcaRouter — så den enda vägen idag är att själv hosta checkpointen och köra den genom ColQwen3.5-sökvägen i colpali-engine. Modellkortets snabbstart är kortfattad: ladda modellen i BF16 med flash-attention, anropa enable_bidirectional_attention(), bädda in sidbilderna och textfrågan, och poängsätt sedan med processorns MaxSim. Det bidirektionella steget är inte valfri dekoration — den publicerade colpali-engine bygger ColQwen3.5 med kausala masker som standard, och förhandsmodellens kort dokumenterade att om masken lämnas kvar kostar det ungefär 1,1 poäng på toppträffens MaxSim. Samma hjälpfunktion följer med EVIE-8B. En 8,41B BF16-checkpoint är i storleksordningen 17 GB vikter enligt tumregeln två byte per parameter, så detta är ett fall för en GPU med marginal snarare än en edge-modell, och korpusen bor där du håller indexet, inte på modellen.
Vad EVIE-8B förändrar för en dokumentbaserad RAG-stack
För den som bygger hämtning över skanningar, arkivhandlingar, diagram eller formulär är den praktiska förändringen att kvalitetstaket för öppen visuell dokumenthämtning precis har flyttats – och det har flyttats inom en familj som nu spänner över tre pris-prestandanivåer. En retriever ger dig dock bara sidorna. Modellen som läser de sidorna och skriver svaret är ett separat beslut, och det är i det lagret som routing gör skäl för sig: OrcaRouter exponerar ett API mot 200+ modeller till leverantörens listpris med 0 % påslag, så läsmodellen bakom din retriever kan bytas utan omskrivning, och en leverantörs prissänkning på valfri dirigerad modell är live samma dag som den tillkännages. Den separationen betyder mer när hämtningsdelen är en helt ny, obeprövad checkpoint – du kan använda EVIE-8B för indexering medan du håller genereringslagret bakom ett gränssnitt som inte kopplar dig till någon enskild modell.
Vad du ska titta på härnäst
Tre saker skulle förvandla detta från ett tyst repo-släpp till en etablerad historia. För det första: en oberoende körning – tills någon utanför Tencent reproducerar ViDoRe- och JinaVDR-siffrorna är både "rank #1" för EVIE-8B och "rank #1" för den gamla förhandsversionen självrapporterade påståenden som råkar stå i konflikt med varandra. För det andra: den utlovade forskningsartikeln och ablationsstudierna – valet av 4096 dimensioner, weight-mix-checkpointen och destillationsreceptet – är alla för närvarande bara påståenden utan den skriftliga redogörelse som skulle stödja dem. För det tredje: namngivningen – med EVIE-4.5B som nu innehar den plats som EVIE-Preview-4.5B hade för tre veckor sedan är det en öppen fråga om Tencent håller "Preview"-linjen vid liv eller integrerar den i den omdöpta modellfamiljen. Med tanke på takten – tre checkpoints för visuell dokumenthämtning på tre veckor – är det mer användbara antagandet att man satsar hårt på den här linjen, och att de tysta releaserna är labbets sätt att leverera före forskningsartikeln.
