
EVIE-8B mot EVIE-Preview-4.5B: En 1,39-poängs förbättring för 32× bredare vektorer
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tre veckor efter att Tencent släppte EVIE-Preview-4.5B och kallade det för den mest exakta visuella dokumenthämtaren på ViDoRe-listorna, släppte Tencent EVIE-8B och flyttade tyst målstolparna som dess egen 128-dimensionella modell hade stått på. EVIE-8B är den 8,41B stora flaggskepps-lärarmodellen med 4096-dimensionella inbäddningar per token; EVIE-Preview-4.5B är den kompakta hämtaren på 4,54B vars hela koncept var att 128 dimensioner räckte för att slå modeller fyra gånger så stora. På den uppdaterade topplistan i EVIE-8B-kortet ligger EVIE-Preview-4.5B nu på tredje plats inom sin egen familj – bakom nya EVIE-8B och bakom EVIE-4.5B, en elevmodell som Tencent släppte samma morgon. Om du väljer vilken av de två namngivna modellerna du ska indexera en dokumentkorpus mot, säger siffrorna på Tencents kort att 8B är ungefär 1,39 poäng bättre på ViDoRe V3 och 3,36 poäng bättre på ViDoRe V2 – och att det kostar 32 gånger mer indexutrymme per vektor för att komma dit. Den här texten handlar om huruvida det är värt att göra den avvägningen, och den utgår från den ärliga reservationen att båda resultatkorten är Tencents egna och att ingetdera har oberoende reproducerats.
Den korta versionen
• Välj EVIE-8B om retrievalträffsäkerheten är flaskhalsen och din korpus är tillräckligt liten för att råindexstorleken inte spelar någon roll — du mäter i tusentals sidor, inte miljoner, och du vill ha den bästa öppna retrievern som Tencent har publicerat.
• Välj EVIE-Preview-4.5B om indexkostnad, latenstid per sida eller GPU-budget är en verklig begränsning — dess 128D-vektorer är hela anledningen till att den finns, och noggrannhetsgapet till 8B är litet på ViDoRe V1 och måttligt på V3.
• Dubbelkolla båda mot EVIE-4.5B innan du förbinder dig: Tencent släppte samma dag en studentmodell med vektorer som kan trunkeras vid körning och tokenkomprimering, som överträffar båda på effektivitetsfronten, och en jämförelse som ignorerar den är redan föråldrad.
Betrakta varje siffra här som leverantörsrapporterad. EVIE-8B har inte körts av någon utanför Tencent; EVIE-Preview-4.5B:s siffror kommer från Tencents egna reproduktionsskript.
Där de faktiskt skiljer sig åt.
• Parametrar — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• Backbone — Qwen3.5-9B med full bidirektionell attention jämfört med Qwen3.5-4B med interfolierad GatedDeltaNet-linjär attention och full attention.
• Embedding — 4096-dimensionell per-token-multivektor vs. nativ 128-dimensionell per-token-multivektor, båda poängsatta med MaxSim late interaction.
• ViDoRe V1 (10 uppgifter, nDCG@5) — 92.18 vs 91.73.
• ViDoRe V2 (4 uppgifter, nDCG@5) — 74.23 vs 70.87. Detta är det största relativa gapet.
• ViDoRe V3 (48 uppgifter, nDCG@10) — 66,75 jämfört med 65,36.
• Budgeten för visuella token bakom dessa rubriksiffror — 1 024 token per sida för utvärderingen av EVIE-8B jämfört med 1 792 token per sida för huvudnivån hos EVIE-Preview-4.5B (vid dess 768-token-träningsnivå uppnår förhandsversionen 64,56).
• Rå BF16-index per 1M sidor — ej publicerat för EVIE-8B, medan det för förhandsversionen är 179,2 GiB vid 768 tokens/sida och 420,5 GiB vid 1 792.
• Licens och utgivning — Apache-2.0, tyst lansering 2026-09-04 jämfört med Apache-2.0, tyst lansering 2026-08-17.

Poängtavlan ovan upprepar samma porträtt. Tänk på två förbehåll när du läser den: EVIE-8B-kolumnen och EVIE-Preview-4.5B-kolumnen kommer från två olika Tencent-modellkort, och 8B:ans huvudsiffra V3 mäts med en lägre budget för visuella token per sida än förhandsversionens huvudsiffra.
Två Tencent-kort som pratar med varandra
Det ärligaste sättet att se på denna jämförelse är att det är ett familjegräl, inte en oberoende tävling. EVIE-Preview-4.5B:s eget resultatkort, publicerat den 17 augusti, hävdar ”Rank #1 on ViDoRe V3” med 65,36 nDCG@10, och slår webAI-ColVec1.1-8b med 0,04. EVIE-8B:s resultatkort, publicerat den 4 september, listar samma 65,36 som det tredje bästa värdet på sidan, under EVIE-8B:s 66,75 och EVIE-4.5B:s 66,02, och visar att 8B vinner mot previewmodellen i alla åtta offentliga ViDoRe V3-domäner. Båda resultatkorten producerades med Tencents eget utvärderingsramverk, och ingen av modellerna har ännu någon oberoende körning någonstans i litteraturen. Så den jämförelse du läser är Tencents redogörelse för Tencent som slår Tencent — internt konsekvent, troligen medvetet konstruerad så, och overifierad av någon som inte har ett eget intresse i utgången.

tencent/EVIE-8B-kortet ovan är utmanarens publika ansikte: en flaggskeppslärare på 8.41B med 4096D-embeddingar och familjens uppdaterade ViDoRe-tabell högst upp.

Modellkortet för tencent/EVIE-Preview-4.5B ovan är den nuvarande modellens: en 4.54B-retriever vars inbyggda 128D-vektorer och publicerade indexkostnadsberäkningar fortfarande är dess definierande egenskap.
1,39-poängsfrågan
Det råa gapet på ViDoRe V3 är litet – 1,39 nDCG@10-poäng mellan EVIE-8B:s 66,75 och EVIE-Preview-4.5B:s 65,36 – och det kommer med en asterisk för tokenbudget som spelar roll för driftsättning. EVIE-8B:s utvärderingsprotokoll begränsar dokument till 1 024 visuella tokens per sida; förhandsversionen behövde 1 792 tokens per sida för att nå sin rubriksiffra 65,36 och fick bara 64,56 med sin egen träningsbudget på 768 tokens. Med de siffrorna är 8B inte bara mer exakt vid en jämförbar budget – den är mer exakt vid en mindre sådan, vilket är den riktning du vill ha för latens per sida. Den större relativa vinsten finns på ViDoRe V2, där EVIE-8B rapporterar 74,23 mot förhandsversionens 70,87, ett hopp på 3,36 poäng på den tavla som inkluderar de svårare syntetiserade dokumentuppgifterna. ViDoRe V1, den äldsta och mest mättade tavlan, rör sig knappt: 92,18 mot 91,73. Det mönstret – platt där alla redan är nära taket, avgörande där uppgifterna är nyare och svårare – är profilen av en verklig kapacitetsökning snarare än leaderboardbrus, men det är fortfarande Tencents egen mätning av det.
Indexet är den verkliga motståndaren
Noggrannhet är bara hälften av detta beslut, eftersom de två modellerna ger radikalt olika löften om vad du lagrar. EVIE-Preview-4.5B:s existensberättigande är dess inbyggda 128-dimensionella tokenvektor: modellkortet publicerar exakt indexmatematik (179,2 GiB rå BF16-index per miljon sidor vid dess träningsbudget, 420,5 GiB vid den extrapolerade nivån) och påpekar att en smalare vektor minskar lagring och MaxSim-poängsättningsarbete i direkt proportion. EVIE-8B:s tokenvektorer är 4096-dimensionella — 32 gånger bredare per vektor — och EVIE-8B-kortet publicerar ingen indexstorlekssiffra alls. Den utelämningen är i sig information: vid samma tokenantal per sida är ett rått BF16 EVIE-8B-index i storleksordningen 32 gånger preview-modellens, vilket placerar en korpus på en miljon sidor i multi-terabyte-intervallet före kvantisering och gör flaggskeppet till något du riktar mot några hundra tusen sidor, inte något du utan vidare hostar i stor skala. Flaggskeppets bredd köper sökträffsäkerhet; den köper inte driftsättbarhet.
Det tredje alternativet som Tencent skickade samma dag.
Ingen ärlig version av denna jämförelse stannar vid de två namngivna modellerna, eftersom releasen som innehöll EVIE-8B också innehöll EVIE-4.5B — en studentmodell på 4,61 miljarder parametrar, destillerad från 8B-läraren, med en enda 2048-dimensionell projektion som vid körning trunkeras till 64, 128, 256, 512, 1024 eller 2048 dimensioner, samt ett träningsfritt token-komprimeringssteg som Tencent kallar HAC, vilket klustrar en sidas visuella tokens till 32–64 vektorer; enligt modellkortet har modellen ett indexfotavtryck på 3,81 GiB per miljon sidor. I Tencents egen tabell får EVIE-4.5B 66,02 på ViDoRe V3 — bara 0,73 bakom 8B-läraren och 0,66 före EVIE-Preview-4.5B — vilket gör den till svaret på det exakta dilemma som denna jämförelse ger upphov till. Om det du vill ha är ”större delen av 8B-modellens noggrannhet utan 8B-modellens index”, så har Tencent redan släppt den modellen, och den är ingen av de två som denna sida är uppkallad efter. EVIE-Preview-4.5B:s återstående argument är smalt men verkligt: det är den checkpoint som redan är i produktion för alla som rullade ut den i augusti, och dess fasta 128D-profil är enklare att resonera kring än en matryoshka som ber dig välja dimension vid körning.
Vilken bör du indexera med
Matcha modellen med det bivillkor som faktiskt binder:
• Indexera med EVIE-8B om du bygger referenspunkten för noggrannhet — ett riktmärke, en värdefull juridisk eller vetenskaplig korpus på hundratusentals sidor, eller ett system där hämtningsmissar är kostsamma och lagring är billig. Du betalar för toppen av familjens kurva, och familjen avser att 4.5B-studenten ska vara den du skalar ut senare.
• Stanna kvar på EVIE-Preview-4.5B om du redan har indexerat med den och den uppmätta kvaliteten är acceptabel — en omindexering är en verklig kostnad, och den V3-vinst du skulle jaga är 1,39 poäng på ett leverantörskort som ingen oberoende har bekräftat.
Utvärdera EVIE-4.5B före något av dem om du börjar om på en meningsfull skala. Prefix-MRL-trunkeringen och HAC-komprimeringen är direkt inriktade på lagringsaritmetiken ovan, och Tencent's egna siffror placerar den inom slående avstånd från läraren.
Ingen av de tre har ett hostat API på någon plattform, inklusive OrcaRouter, så hämtningssteget är självhostat oavsett vilken av dem du väljer. Steget efter det behöver inte vara det. En router likt den som OrcaRouter driver över 200+ modeller håller modellen som läser dina hämtade sidor och skriver svaret bakom ett enda API med automatisk failover mellan leverantörer, där leverantörernas listpriser skickas vidare med 0 % påslag — vilket är precis det upplägg du vill ha när retrievern som matar modellen är en tre dagar gammal kontrollpunkt med overifierade påståenden. Bygg indexet med den retriever som passar din lagring och håll resten av pipelinen utbytbar tills någon utanför Tencent bekräftar vilket av dessa resultatkort som är äkta.
