Una card del titolo hero per il confronto 'EVIE-8B vs EVIE-Preview-4.5B' con il sottotitolo 'Un guadagno di 1,39 punti per vettori 32 volte più ampi', che mostra una visuale piatta a due pannelli: a sinistra una pila alta di pagine di documenti accanto a un'etichetta 4096D, a destra una pagina di documento compatta accanto a una piccola icona di disco rigido con un'etichetta 128D, una sottile linea di bilancia centrata tra i pannelli, il testo a piè di pagina 'Con quale retriever di documenti visivi Tencent dovresti indicizzare?' e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

EVIE-8B vs EVIE-Preview-4.5B: Un guadagno di 1,39 punti per vettori 32× più ampi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tre settimane dopo che Tencent ha rilasciato EVIE-Preview-4.5B definendolo il visual document retriever più accurato delle classifiche ViDoRe, Tencent ha rilasciato EVIE-8B e ha spostato silenziosamente i paletti su cui poggiava il suo stesso modello a 128 dimensioni. EVIE-8B è il teacher di punta da 8,41 miliardi di parametri con embedding per token a 4096 dimensioni; EVIE-Preview-4.5B è il retriever compatto da 4,54 miliardi di parametri il cui cavallo di battaglia era che 128 dimensioni bastassero per battere modelli quattro volte più grandi. Nella classifica aggiornata all'interno della scheda di EVIE-8B, EVIE-Preview-4.5B ora è al terzo posto nella propria famiglia — dietro al nuovo EVIE-8B e dietro a EVIE-4.5B, un modello studente rilasciato da Tencent quella stessa mattina. Se state scegliendo quale dei due modelli citati usare per indicizzare un corpus di documenti, i numeri sulle schede di Tencent dicono che il modello da 8B è migliore di circa 1,39 punti su ViDoRe V3 e di 3,36 punti su ViDoRe V2 — e che per arrivarci costa 32 volte più spazio di indicizzazione per vettore. Questo articolo parla di se valga la pena fare questo compromesso, e parte dall'onesta premessa che entrambe le schede dei punteggi sono di Tencent e nessuna delle due è stata riprodotta in modo indipendente.

La versione breve

• Scegli EVIE-8B se la precisione del recupero è il collo di bottiglia e il tuo corpus è abbastanza piccolo da rendere irrilevante la dimensione grezza dell'indice — stai parlando di migliaia di pagine, non di milioni, e vuoi il miglior retriever open source pubblicato da Tencent.

• Scegli EVIE-Preview-4.5B se il costo dell'indice, la latenza per pagina o il budget GPU è un vincolo concreto: i suoi vettori 128D sono la ragione stessa per cui esiste, e il divario di accuratezza rispetto al modello 8B è contenuto su ViDoRe V1 e modesto su V3.

• Ricontrolla entrambi rispetto a EVIE-4.5B prima di impegnarti: Tencent ha rilasciato lo stesso giorno un modello studente con vettori troncabili a runtime e compressione dei token, che supera entrambi sulla frontiera dell’efficienza, e qualsiasi confronto che lo ignora è già superato.

• Considera ogni numero qui come riportato dal fornitore. EVIE-8B non è stato eseguito da nessuno al di fuori di Tencent; i dati di EVIE-Preview-4.5B provengono dagli script di riproduzione di Tencent.

Dove effettivamente differiscono

• Parametri — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

Backbone — Qwen3.5-9B con attenzione bidirezionale completa vs Qwen3.5-4B con attenzione lineare GatedDeltaNet e attenzione completa intervallate.

• Embedding — multi-vettore per token a 4096 dimensioni vs multi-vettore nativo per token a 128 dimensioni, entrambi valutati con MaxSim a interazione tardiva.

• ViDoRe V1 (10 compiti, nDCG@5) — 92.18 contro 91.73.

• ViDoRe V2 (4 attività, nDCG@5) — 74.23 contro 70.87. Questo è il divario relativo più ampio.

• ViDoRe V3 (48 task, nDCG@10) — 66.75 vs 65.36.

Il budget di token visivi alla base di quei numeri in evidenza — 1.024 token/pagina per la valutazione di EVIE-8B rispetto a 1.792 token/pagina per il livello principale di EVIE-Preview-4.5B (al suo livello di addestramento a 768 token, la preview registra 64,56).

• Indice BF16 grezzo per 1M di pagine — non pubblicato per EVIE-8B; per l'anteprima: 179,2 GiB a 768 token/pagina e 420,5 GiB a 1.792.

• Licenza e rilascio — Apache-2.0, rilascio silenzioso 2026-09-04 vs Apache-2.0, rilascio silenzioso 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Il tabellone qui sopra ribadisce lo stesso quadro. Tieni presenti due avvertenze mentre lo leggi: la colonna EVIE-8B e la colonna EVIE-Preview-4.5B provengono da due diverse schede modello Tencent, e il numero principale V3 della 8B è misurato con un budget di token visivi per pagina inferiore rispetto al numero principale dell'anteprima.

Due carte Tencent che parlano tra loro.

L'inquadramento onesto di questo confronto è che si tratta di una lite in famiglia, non di una gara indipendente. La card di EVIE-Preview-4.5B, pubblicata il 17 agosto, dichiara "Rank #1 su ViDoRe V3" con 65,36 nDCG@10, battendo webAI-ColVec1.1-8b di 0,04. La card di EVIE-8B, pubblicata il 4 settembre, ripropone quello stesso 65,36 come terzo miglior punteggio della pagina, dietro al 66,75 di EVIE-8B e al 66,02 di EVIE-4.5B, e mostra il modello 8B vincitore in tutti gli otto domini pubblici di ViDoRe V3 nel confronto con la preview. Entrambe le scorecard sono state prodotte con l'harness di valutazione della stessa Tencent, e per nessuno dei due modelli esiste ancora una run indipendente in alcun punto della letteratura. Quindi il confronto che stai leggendo è il racconto di Tencent in cui Tencent batte Tencent — internamente coerente, plausibilmente costruito apposta in questo modo e non verificato da nessuno che non abbia un interesse nell'esito.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

La scheda di tencent/EVIE-8B qui sopra è la facciata pubblica dello sfidante: un teacher model di punta da 8,41B con embedding a 4096D e la tabella ViDoRe aggiornata della famiglia in cima.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

La scheda del modello tencent/EVIE-Preview-4.5B qui sopra è quella dell'incumbent: un retriever da 4,54 miliardi di parametri che ha ancora come caratteristica distintiva i vettori nativi a 128D e la matematica pubblicata dei costi di indicizzazione.

La domanda da 1,39 punti

Il divario grezzo su ViDoRe V3 è piccolo — 1,39 punti nDCG@10 tra i 66,75 di EVIE-8B e i 65,36 di EVIE-Preview-4.5B — e arriva con un asterisco sul budget di token che conta per il deployment. Il protocollo di valutazione di EVIE-8B limita i documenti a 1.024 token visivi per pagina; la preview ha richiesto 1.792 token per pagina per registrare il suo 65,36 di punta, e ha ottenuto solo 64,56 con il proprio budget di addestramento di 768 token. Con questi numeri, la 8B non è solo più accurata a un budget paragonabile — è più accurata con un budget inferiore, che è la direzione che si vuole per la latenza per pagina. Il vantaggio relativo maggiore è su ViDoRe V2, dove EVIE-8B registra 74,23 contro i 70,87 della preview, un balzo di 3,36 punti sulla classifica che include i compiti di documento sintetico più difficili. ViDoRe V1, la classifica più vecchia e più satura, si muove appena: 92,18 contro 91,73. Questo pattern — piatto dove tutti sono già vicini al tetto, decisivo dove i compiti sono più nuovi e più difficili — è il profilo di un reale aumento di capacità piuttosto che di rumore da leaderboard, ma si tratta comunque di una misurazione effettuata da Tencent stessa.

L'indice è il vero avversario

L'accuratezza è solo metà di questa decisione, perché i due modelli fanno promesse radicalmente diverse su ciò che archivi. La ragion d'essere di EVIE-Preview-4.5B è il suo vettore dei token nativo a 128 dimensioni: la scheda del modello pubblica i calcoli esatti dell'indice (179,2 GiB di indice BF16 grezzo per milione di pagine al suo budget di addestramento, 420,5 GiB al livello estrapolato) e fa notare che un vettore più stretto riduce lo spazio di archiviazione e il lavoro di scoring MaxSim in proporzione diretta. I vettori dei token di EVIE-8B sono a 4096 dimensioni — 32 volte più ampi per vettore — e la scheda di EVIE-8B non pubblica alcuna cifra sulla dimensione dell'indice. Questa omissione è di per sé un'informazione: a parità di numero di token per pagina, un indice BF16 grezzo di EVIE-8B è dell'ordine di 32 volte quello dell'anteprima, il che porta un corpus di un milione di pagine nell'ordine dei multi-terabyte prima della quantizzazione e rende il modello di punta qualcosa da usare su poche centinaia di migliaia di pagine, non qualcosa da ospitare alla leggera su larga scala. La larghezza del modello di punta compra fedeltà nel recupero; non compra distribuibilità.

La terza opzione che Tencent ha rilasciato lo stesso giorno

Nessuna versione onesta di questo confronto si ferma ai due modelli nominati, perché la release che conteneva EVIE-8B conteneva anche EVIE-4.5B — un modello studente da 4.61B distillato dal modello insegnante da 8B, con un'unica proiezione a 2048 dimensioni che a runtime viene troncata a 64, 128, 256, 512, 1024 o 2048 dimensioni, più un passaggio di compressione dei token senza addestramento che Tencent chiama HAC e che raggruppa i token visivi di una pagina in 32–64 vettori e, secondo la scheda, un'occupazione dell'indice di 3.81 GiB per milione di pagine. Nella tabella di Tencent, EVIE-4.5B ottiene 66.02 su ViDoRe V3 — solo 0.73 dietro al modello insegnante da 8B e 0.66 davanti a EVIE-Preview-4.5B — il che la rende la risposta all'esatto dilemma che questo confronto pone. Se ciò che vuoi è "gran parte dell'accuratezza dell'8B senza l'indice dell'8B", Tencent ha già rilasciato quel modello, e non è nessuno dei due a cui è intitolata questa pagina. Il caso residuo di EVIE-Preview-4.5B è ristretto ma reale: è il checkpoint già in produzione per chiunque lo abbia distribuito ad agosto, e il suo profilo fisso a 128D è più semplice da ragionare rispetto a una matrioska che ti chiede di scegliere la dimensione a runtime.

Con quale dovresti indicizzare?

Abbina il modello al vincolo effettivamente vincolante:

• Indicizza su EVIE-8B se stai costruendo il punto di riferimento per l'accuratezza — un benchmark, un corpus legale o scientifico di alto valore con centinaia di migliaia di pagine, o un sistema in cui i mancati recuperi sono costosi e lo storage è economico. Stai pagando per il vertice della curva della famiglia, e la famiglia intende che lo studente 4.5B sia ciò che scalerai in seguito.

• Rimani su EVIE-Preview-4.5B se hai già indicizzato con esso e la qualità misurata è accettabile — una re-indicizzazione è un costo reale, e il guadagno V3 che inseguiresti è di 1.39 punti su una scheda del fornitore che nessuno ha confermato in modo indipendente.

• Valuta EVIE-4.5B prima di entrambi se stai iniziando da zero su una scala significativa. La troncatura Prefix-MRL e la compressione HAC mirano direttamente all'aritmetica dello storage sopra descritta, e i numeri di Tencent la collocano a distanza ravvicinata dal modello insegnante.

Nessuno dei tre ha un'API hosted su alcuna piattaforma, incluso OrcaRouter, quindi la fase di retrieval è comunque una decisione self-hosted. La fase successiva non deve esserlo per forza. Un router come quello che OrcaRouter esegue su oltre 200 modelli tiene il modello che legge le pagine recuperate e scrive la risposta dietro una singola API, con failover automatico tra i provider e prezzi di listino dei provider pass-through con markup allo 0% — che è esattamente la configurazione che vuoi quando il retriever che lo alimenta è un checkpoint di tre giorni con affermazioni non verificate. Costruisci l'indice con il retriever che si adatta al tuo storage e mantieni il resto della pipeline sostituibile finché qualcuno al di fuori di Tencent non conferma quale di queste scorecard sia reale.