
EVIE-8B vs EVIE-Preview-4.5B: Una ganancia de 1.39 puntos para vectores 32× más anchos
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Tres semanas después de que Tencent lanzara EVIE-Preview-4.5B y lo calificara como el recuperador de documentos visuales más preciso en las tablas de ViDoRe, Tencent publicó EVIE-8B y movió silenciosamente el listón sobre el que se sostenía su propio modelo de 128 dimensiones. EVIE-8B es el modelo profesor insignia de 8.41B con incrustaciones por token de 4096 dimensiones; EVIE-Preview-4.5B es el recuperador compacto de 4.54B cuya propuesta era que 128 dimensiones bastaban para superar a modelos cuatro veces más grandes. En el ranking actualizado dentro de la ficha de EVIE-8B, EVIE-Preview-4.5B ahora ocupa el tercer lugar dentro de su propia familia: por detrás del nuevo EVIE-8B y de EVIE-4.5B, un estudiante que Tencent lanzó esa misma mañana. Si usted está decidiendo cuál de los dos modelos nombrados usar para indexar un corpus de documentos, las cifras en las fichas de Tencent indican que el de 8B es aproximadamente 1.39 puntos mejor en ViDoRe V3 y 3.36 puntos mejor en ViDoRe V2, y que para lograrlo cuesta 32 veces más espacio de índice por vector. Este artículo trata sobre si ese intercambio merece la pena, y parte de la advertencia honesta de que ambas tarjetas de resultados son de Tencent y ninguna ha sido reproducida de forma independiente.
La versión corta
• Elige EVIE-8B si la precisión de la recuperación es el cuello de botella y tu corpus es lo suficientemente pequeño como para que el tamaño bruto del índice no importe — mides en miles de páginas, no en millones, y quieres el mejor recuperador abierto que Tencent haya publicado.
• Elige EVIE-Preview-4.5B si el costo del índice, la latencia por página o el presupuesto de GPU son una limitación real: sus vectores de 128D son la razón misma de su existencia, y la brecha de precisión frente al modelo de 8B es pequeña en ViDoRe V1 y moderada en V3.
• Revisa ambos contra EVIE-4.5B antes de comprometerte: Tencent lanzó el mismo día un modelo estudiante con vectores truncables en tiempo de ejecución y compresión de tokens que supera a ambos en la frontera de eficiencia, y cualquier comparación que lo ignore ya está desactualizada.
• Trate cada número aquí como reportado por el proveedor. EVIE-8B no ha sido ejecutado por nadie fuera de Tencent; las cifras de EVIE-Preview-4.5B provienen de los scripts de reproducción propios de Tencent.
Donde realmente difieren
• Parámetros — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• Red troncal — Qwen3.5-9B con atención bidireccional completa frente a Qwen3.5-4B con atención lineal GatedDeltaNet y atención completa intercaladas.
• Embedding: multi-vector de 4096 dimensiones por token frente a multi-vector nativo de 128 dimensiones por token, ambos puntuados con interacción tardía de MaxSim.
• ViDoRe V1 (10 tareas, nDCG@5) — 92.18 vs 91.73.
• ViDoRe V2 (4 tareas, nDCG@5) — 74.23 frente a 70.87. Esta es la mayor brecha relativa.
• ViDoRe V3 (48 tareas, nDCG@10) — 66.75 vs 65.36.
• Presupuesto de tokens visuales que respaldan esas cifras principales — 1,024 tokens/página para la evaluación de EVIE-8B frente a 1,792 tokens/página para el nivel principal de EVIE-Preview-4.5B (en su nivel de entrenamiento de 768 tokens, la vista previa obtiene 64.56).
• Índice BF16 bruto por 1M de páginas — no publicado para EVIE-8B frente a 179.2 GiB a 768 tokens/página y 420.5 GiB a 1,792 para la vista previa.
Licencia y lanzamiento — Apache-2.0, quiet ship 2026-09-04 vs Apache-2.0, quiet ship 2026-08-17.

El marcador superior reitera el mismo retrato. Ten en cuenta dos advertencias al leerlo: la columna EVIE-8B y la columna EVIE-Preview-4.5B provienen de dos tarjetas de modelo distintas de Tencent, y el número principal V3 de la 8B se mide con un presupuesto de tokens visuales por página inferior al del número principal de la vista previa.
Dos tarjetas de Tencent, hablando entre sí.
El marco honesto para este enfrentamiento es que se trata de una disputa familiar, no de una competición independiente. La propia ficha de EVIE-Preview-4.5B, publicada el 17 de agosto, afirma «Rank #1 on ViDoRe V3» con 65.36 nDCG@10, superando a webAI-ColVec1.1-8b por 0.04. La ficha de EVIE-8B, publicada el 4 de septiembre, vuelve a enumerar ese mismo 65.36 como el tercer mejor número de la página, por debajo de los 66.75 de EVIE-8B y los 66.02 de EVIE-4.5B, y muestra que la 8B gana en los ocho dominios públicos de ViDoRe V3 contra la versión preliminar. Ambas fichas de resultados se produjeron con el propio sistema de evaluación de Tencent, y ninguno de los dos modelos tiene todavía una ejecución independiente en la literatura. Así que la comparación que estás leyendo es el relato de Tencent sobre Tencent venciendo a Tencent: internamente coherente, plausiblemente diseñado así a propósito, y no verificado por nadie sin intereses en el resultado.

La {{1}}ficha de tencent/EVIE-8B{{/1}} de arriba es la {{2}}superficie pública del retador{{/2}}: un {{3}}maestro insignia de 8.41B{{/3}} con {{4}}incrustaciones de 4096D{{/4}} y la {{5}}tabla ViDoRe actualizada de la familia{{/5}} {{6}}en la parte superior{{/6}}.

La tarjeta de tencent/EVIE-Preview-4.5B que aparece arriba es la del titular: un recuperador de 4.54B cuyos vectores nativos de 128D y sus matemáticas de coste de indexación publicadas siguen siendo su característica definitoria.
La pregunta de 1.39 puntos
La diferencia bruta en ViDoRe V3 es pequeña — 1,39 puntos de nDCG@10 entre los 66,75 de EVIE-8B y los 65,36 de EVIE-Preview-4.5B — y viene con un asterisco sobre el presupuesto de tokens, algo que importa para el despliegue. El protocolo de evaluación de EVIE-8B limita los documentos a un máximo de 1.024 tokens visuales por página; el preview necesitó 1.792 tokens por página para lograr su anunciado 65,36, y obtuvo solo 64,56 con su propio presupuesto de entrenamiento de 768 tokens. Con esas cifras, el 8B no solo es más preciso con un presupuesto comparable, sino que lo es con uno más pequeño, que es justo lo que conviene para la latencia por página. La mayor ventaja relativa se da en ViDoRe V2, donde EVIE-8B reporta 74,23 frente a los 70,87 del preview: un salto de 3,36 puntos en la tabla que incluye las tareas de documentos sintéticos más difíciles. ViDoRe V1, la tabla más antigua y más saturada, apenas se mueve: 92,18 frente a 91,73. Ese patrón — plano donde todos están ya cerca del techo, decisivo donde las tareas son más nuevas y más difíciles — es el perfil de un aumento genuino de capacidad más que de ruido de tabla, pero sigue siendo la medición que hace el propio Tencent.
El índice es el verdadero oponente
La precisión es solo la mitad de esta decisión, porque los dos modelos hacen promesas radicalmente diferentes sobre lo que almacenas. La razón de ser de EVIE-Preview-4.5B es su vector de tokens nativo de 128 dimensiones: la ficha publica el cálculo exacto del índice (179,2 GiB de índice BF16 bruto por millón de páginas en su presupuesto de entrenamiento; 420,5 GiB en el nivel extrapolado) y señala que un vector más estrecho reduce el almacenamiento y el trabajo de puntuación MaxSim en proporción directa. Los vectores de tokens de EVIE-8B son de 4096 dimensiones —32 veces más anchos por vector— y la ficha de EVIE-8B no publica ninguna cifra del tamaño del índice. Esa omisión es en sí misma información: con el mismo número de tokens por página, un índice BF16 bruto de EVIE-8B es del orden de 32 veces el de la versión preliminar, lo que sitúa un corpus de un millón de páginas en el rango de varios terabytes antes de la cuantización y convierte al modelo insignia en algo que se aplica a unos cientos de miles de páginas, no en algo que se pueda alojar a gran escala sin más. La anchura del modelo insignia compra fidelidad de recuperación; no compra capacidad de despliegue.
La tercera opción que Tencent lanzó el mismo día
Ninguna versión honesta de esta comparación se limita a los dos modelos mencionados, porque el lanzamiento que contenía EVIE-8B también contenía EVIE-4.5B — un modelo alumno de 4.61B destilado del modelo maestro de 8B, con una única proyección de 2048 dimensiones que se trunca en tiempo de ejecución a 64, 128, 256, 512, 1024 o 2048 dimensiones, además de una pasada de compresión de tokens sin entrenamiento que Tencent denomina HAC, que agrupa los tokens visuales de una página en 32–64 vectores y, según la ficha del modelo, una huella de índice de 3.81 GiB por millón de páginas. En la propia tabla de Tencent, EVIE-4.5B obtiene 66.02 en ViDoRe V3 — solo 0.73 puntos por detrás del modelo maestro de 8B y 0.66 puntos por delante de EVIE-Preview-4.5B —, lo que lo convierte en la respuesta al dilema exacto que plantea esta comparativa. Si lo que quieres es «la mayor parte de la precisión del 8B sin el índice del 8B», Tencent ya ha lanzado ese modelo, y no es ninguno de los dos que dan título a esta página. El caso restante a favor de EVIE-Preview-4.5B es reducido pero real: es el checkpoint que ya está en producción para cualquiera que lo haya desplegado en agosto, y su perfil fijo de 128D es más sencillo de razonar que una matrioshka que te pide elegir tu dimensión en tiempo de ejecución.
¿Con cuál deberías indexar?
Empareja el modelo con la restricción que realmente es vinculante.
• Indexa con EVIE-8B si estás construyendo el punto de referencia de precisión — un benchmark, un corpus legal o científico de alto valor con cientos de miles de páginas, o un sistema donde las recuperaciones fallidas son costosas y el almacenamiento es barato. Estás pagando por la cima de la curva de la familia, y la familia concibe al estudiante de 4.5B como aquello que escalarás más adelante.
• Quédate con EVIE-Preview-4.5B si ya indexaste con él y la calidad medida es aceptable — un reindexado es un costo real, y la ganancia de V3 que perseguirías es de 1.39 puntos en una tarjeta de proveedor que nadie ha confirmado de forma independiente.
• Evalúa EVIE-4.5B antes que cualquiera de los dos si empiezas desde cero a una escala significativa. La truncación Prefix-MRL y la compresión HAC apuntan directamente a la aritmética de almacenamiento mencionada, y los propios números de Tencent lo colocan a una distancia muy cercana del profesor.
Ninguno de los tres tiene una API alojada en ninguna plataforma, incluido OrcaRouter, por lo que la etapa de recuperación es una decisión de autoalojamiento de cualquier manera. La etapa posterior no tiene por qué serlo. Un router como el que OrcaRouter ejecuta en más de 200 modelos mantiene el modelo que lee tus páginas recuperadas y escribe la respuesta detrás de una sola API con conmutación automática por error entre proveedores y los precios de lista de los proveedores transmitidos con un margen del 0 %, que es precisamente la configuración que deseas cuando el recuperador que lo alimenta es un checkpoint de tres días con afirmaciones no verificadas. Construye el índice con el recuperador que se ajuste a tu almacenamiento y mantén el resto del pipeline intercambiable hasta que alguien fuera de Tencent confirme cuál de estas tarjetas de puntuación es real.
