
EVIE-8B contre EVIE-Preview-4.5B : Un gain de 1,39 point pour des vecteurs 32 fois plus larges
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Trois semaines après que Tencent a publié EVIE-Preview-4.5B et l'a présenté comme le récupérateur de documents visuels le plus précis des classements ViDoRe, Tencent a publié EVIE-8B et a discrètement déplacé les objectifs sur lesquels son propre modèle à 128 dimensions reposait. EVIE-8B est l'enseignant phare de 8,41B avec des embeddings par jeton de 4096 dimensions ; EVIE-Preview-4.5B est le récupérateur compact de 4,54B dont tout l'argument était que 128 dimensions suffisaient pour battre des modèles quatre fois plus gros que lui. Sur le classement actualisé figurant dans la fiche d'EVIE-8B, EVIE-Preview-4.5B se retrouve désormais en troisième place au sein de sa propre famille — derrière le nouveau EVIE-8B et derrière EVIE-4.5B, un étudiant que Tencent a lancé le même matin. Si vous choisissez lequel des deux modèles nommés utiliser pour indexer un corpus de documents, les chiffres des fiches de Tencent indiquent que le 8B est environ 1,39 point meilleur sur ViDoRe V3 et 3,36 points meilleur sur ViDoRe V2 — et qu'il coûte 32 fois plus d'espace d'index par vecteur pour y parvenir. Cet article porte sur la question de savoir si cet échange en vaut la peine, et il part de l'avertissement honnête selon lequel les deux tableaux de résultats sont ceux de Tencent elle-même, et qu'aucun n'a été reproduit de manière indépendante.
La version courte
• Choisissez EVIE-8B si la précision de la récupération est le goulot d'étranglement et que votre corpus est suffisamment petit pour que la taille de l'index brut n'ait pas d'importance — vous mesurez en milliers de pages, pas en millions, et vous voulez le meilleur récupérateur ouvert que Tencent ait publié.
• Choisissez EVIE-Preview-4.5B si le coût d'indexation, la latence par page ou le budget GPU est une véritable contrainte — ses vecteurs 128D sont la raison même de son existence, et l'écart de précision avec le 8B est faible sur ViDoRe V1 et modéré sur V3.
• Re-vérifiez les deux par rapport à EVIE-4.5B avant de vous engager : Tencent a publié le même jour un modèle élève avec des vecteurs tronquables à l’exécution et une compression de tokens, qui les surpasse tous les deux sur le front de l’efficacité, et toute comparaison qui l’ignore est déjà obsolète.
Considérez tous les chiffres ici comme rapportés par le fournisseur. EVIE-8B n'a été exécuté par personne en dehors de Tencent ; les chiffres d'EVIE-Preview-4.5B proviennent des scripts de reproduction de Tencent.
Là où ils diffèrent réellement
• Paramètres — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• Backbone — Qwen3.5-9B avec attention bidirectionnelle complète par rapport à Qwen3.5-4B avec attention linéaire GatedDeltaNet et attention complète entrelacées.
• Embedding — multi-vecteur par jeton de 4096 dimensions vs multi-vecteur natif par jeton de 128 dimensions, tous deux évalués avec l'interaction tardive MaxSim.
• ViDoRe V1 (10 tâches, nDCG@5) — 92.18 vs 91.73.
• ViDoRe V2 (4 tâches, nDCG@5) — 74.23 vs 70.87. C'est le plus grand écart relatif.
• ViDoRe V3 (48 tâches, nDCG@10) — 66.75 vs 65.36.
Budget de jetons visuels derrière ces chiffres clés — 1 024 jetons/page pour l’évaluation d’EVIE-8B contre 1 792 jetons/page pour le palier principal d’EVIE-Preview-4.5B (à son palier d’entraînement de 768 jetons, l’aperçu atteint 64,56).
• Index BF16 brut par million de pages — non publié pour EVIE-8B vs 179,2 Gio à 768 tokens/page et 420,5 Gio à 1 792 pour l'aperçu.
• Licence et version — Apache-2.0, sortie discrète le 2026-09-04 vs Apache-2.0, sortie discrète le 2026-08-17.

Le tableau de bord ci-dessus dresse le même portrait. Gardez deux mises en garde à l'esprit en le lisant : la colonne EVIE-8B et la colonne EVIE-Preview-4.5B proviennent de deux fiches de modèles Tencent différentes, et le chiffre vedette V3 de la 8B est mesuré avec un budget de jetons visuels par page inférieur à celui du chiffre vedette de l'aperçu.
Deux cartes Tencent, qui se parlent
Le cadrage honnête de cette confrontation, c'est qu'il s'agit d'une querelle de famille, et non d'un concours indépendant. La fiche d'EVIE-Preview-4.5B, publiée le 17 août, revendique « Rank #1 on ViDoRe V3 » avec un score de 65.36 en nDCG@10, battant webAI-ColVec1.1-8b de 0.04. Celle d'EVIE-8B, publiée le 4 septembre, présente ce même 65.36 comme le troisième meilleur score de la page, derrière le 66.75 d'EVIE-8B et le 66.02 d'EVIE-4.5B, et montre la 8B gagnante sur les huit domaines publics de ViDoRe V3 face à la preview. Les deux fiches de résultats ont été produites à l'aide du banc d'évaluation interne de Tencent, et aucun des deux modèles n'a encore fait l'objet d'une évaluation indépendante dans la littérature. La comparaison que vous lisez est donc un récit produit par Tencent, où Tencent bat Tencent — cohérent en interne, vraisemblablement construit ainsi à dessein, et non vérifié par une tierce partie indépendante.

La carte tencent/EVIE-8B ci-dessus est la vitrine publique du challenger : un enseignant phare de 8.41B avec embeddings 4096D, et la table ViDoRe rafraîchie de la famille en tête.

La fiche tencent/EVIE-Preview-4.5B ci-dessus est celle du titulaire : un retriever de 4,54B dont les vecteurs natifs 128D et les calculs de coût d’index publiés restent sa caractéristique déterminante.
La question à 1,39 point
L'écart brut sur ViDoRe V3 est faible — 1,39 point de nDCG@10 entre les 66,75 d'EVIE-8B et les 65,36 d'EVIE-Preview-4.5B — et il s'accompagne d'un astérisque de budget de tokens qui compte pour le déploiement. Le protocole d'évaluation d'EVIE-8B plafonne les documents à 1 024 tokens visuels par page ; l'aperçu (preview) a eu besoin de 1 792 tokens par page pour afficher son 65,36 de titre, et n'a obtenu que 64,56 avec son propre budget d'entraînement de 768 tokens. Sur ces chiffres, le modèle 8B n'est pas seulement plus précis à budget comparable — il est plus précis à budget inférieur, ce qui est la direction que l'on souhaite pour la latence par page. Le gain relatif le plus important se situe sur ViDoRe V2, où EVIE-8B annonce 74,23 contre 70,87 pour l'aperçu, soit un bond de 3,36 points sur le tableau qui inclut les tâches documentaires synthétiques les plus difficiles. ViDoRe V1, le tableau le plus ancien et le plus saturé, bouge à peine : 92,18 contre 91,73. Ce schéma — plat là où tout le monde est déjà proche du plafond, décisif là où les tâches sont plus récentes et plus difficiles — est le profil d'une véritable augmentation de capacité plutôt que d'un bruit de classement, mais il reste la mesure qu'en fait Tencent elle-même.
L'indice est le véritable adversaire.
La précision n'est que la moitié de cette décision, car les deux modèles font des promesses radicalement différentes sur ce que vous stockez. La raison d'être d'EVIE-Preview-4.5B est son vecteur de token natif de 128 dimensions : la fiche publie les calculs exacts de l'index (179,2 GiB d'index BF16 brut par million de pages pour son budget d'entraînement, 420,5 GiB au palier extrapolé) et souligne qu'un vecteur plus étroit réduit le stockage et le travail de scoring MaxSim en proportion directe. Les vecteurs de tokens d'EVIE-8B comptent 4096 dimensions — 32 fois plus larges par vecteur — et la fiche d'EVIE-8B ne publie aucun chiffre sur la taille de l'index. Cette omission est en elle-même une information : pour un même nombre de tokens par page, un index BF16 brut d'EVIE-8B est de l'ordre de 32× celui d'EVIE-Preview-4.5B, ce qui place un corpus d'un million de pages dans une fourchette de plusieurs téraoctets avant quantification et fait du modèle phare quelque chose que l'on destine à quelques centaines de milliers de pages, pas quelque chose que l'on héberge à grande échelle sans y réfléchir. La largeur du modèle phare apporte la fidélité de récupération ; elle n'apporte pas la déployabilité.
La troisième option expédiée par Tencent le jour même.
{{1}}Aucune version honnête de cette comparaison ne s'arrête aux deux modèles nommés, car la version qui contenait EVIE-8B contenait aussi EVIE-4.5B — un élève de 4,61B distillé à partir du professeur de 8B, avec une projection unique à 2048 dimensions qui se tronque au moment de l'exécution à 64, 128, 256, 512, 1024 ou 2048 dimensions, plus un passage de compression de jetons sans entraînement que Tencent appelle HAC, qui regroupe les jetons visuels d'une page en 32 à 64 vecteurs et, selon la fiche technique, une empreinte d'index de 3,81 Gio par million de pages. Sur le propre tableau de Tencent, EVIE-4.5B obtient 66,02 sur ViDoRe V3 — seulement 0,73 derrière le professeur de 8B et 0,66 devant EVIE-Preview-4.5B — ce qui en fait la réponse au dilemme exact que pose ce face-à-face. Si ce que vous voulez, c'est « l'essentiel de la précision du 8B sans l'index du 8B », Tencent a déjà commercialisé ce modèle, et ce n'est ni l'un ni l'autre de ceux qui figurent dans le titre de cette page. Le cas restant d'EVIE-Preview-4.5B est étroit mais réel : c'est le point de contrôle déjà en production pour quiconque l'a déployé en août, et son profil fixe à 128D est plus simple à appréhender qu'une matriochka qui vous demande de choisir votre dimension à l'exécution.{{/1}}
Avec lequel devriez-vous indexer ?
Faites correspondre le modèle à la contrainte qui s'applique réellement :
• Indexez sur EVIE-8B si vous construisez le point de référence de précision — un benchmark, un corpus juridique ou scientifique de grande valeur comptant des centaines de milliers de pages, ou un système où les échecs de récupération sont coûteux et où le stockage est peu coûteux. Vous payez pour le sommet de la courbe de la famille, et la famille prévoit que le modèle étudiant de 4,5B soit celui que vous ferez passer à l’échelle plus tard.
• Restez sur EVIE-Preview-4.5B si vous avez déjà indexé avec ce modèle et que la qualité mesurée est acceptable — une ré-indexation représente un coût réel, et le gain V3 que vous chercheriez à obtenir est de 1,39 points sur une fiche fournisseur que personne n'a indépendamment confirmée.
• Évaluez EVIE-4.5B avant l'un ou l'autre si vous partez de zéro à une échelle significative. La troncature Prefix-MRL et la compression HAC visent directement l'arithmétique de stockage ci-dessus, et les chiffres de Tencent la placent à une distance frappante du modèle enseignant.
Aucun des trois ne propose d'API hébergée sur une plateforme, y compris OrcaRouter ; l'étape de récupération est donc, dans tous les cas, un choix d'auto-hébergement. L'étape suivante, elle, ne l'est pas forcément. Un routeur comme celui qu'OrcaRouter fait tourner sur plus de 200 modèles garde le modèle qui lit vos pages récupérées et rédige la réponse derrière une API unique, avec basculement automatique entre fournisseurs et tarifs catalogue des fournisseurs répercutés à 0 % de marge — exactement la configuration qu'il vous faut lorsque le récupérateur qui l'alimente est un point de contrôle de trois jours aux affirmations non vérifiées. Construisez l'index avec le récupérateur adapté à votre stockage, et gardez le reste du pipeline interchangeable jusqu'à ce que quelqu'un d'extérieur à Tencent confirme laquelle de ces fiches de résultats est réelle.
