
EVIE-8B vs EVIE-Preview-4.5B: Um ganho de 1,39 pontos para vetores 32× mais largos
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Três semanas depois de lançar o EVIE-Preview-4.5B e apresentá-lo como o recuperador visual de documentos mais preciso nos rankings ViDoRe, a Tencent lançou o EVIE-8B e moveu silenciosamente as balizas sobre as quais seu próprio modelo de 128 dimensões se apoiava. O EVIE-8B é o principal modelo professor de 8,41B, com embeddings por token de 4096 dimensões; o EVIE-Preview-4.5B é o recuperador compacto de 4,54B cuja proposta era justamente que 128 dimensões eram suficientes para vencer modelos quatro vezes maiores. No ranking atualizado dentro do card do EVIE-8B, o EVIE-Preview-4.5B agora ocupa o terceiro lugar dentro da própria família — atrás do novo EVIE-8B e atrás do EVIE-4.5B, o modelo aluno que a Tencent lançou na mesma manhã. Se você está decidindo qual dos dois modelos citados usar para indexar um corpus de documentos, os números nos cards da Tencent indicam que o 8B é cerca de 1,39 pontos melhor no ViDoRe V3 e 3,36 pontos melhor no ViDoRe V2 — e que chegar lá custa 32 vezes mais espaço de índice por vetor. Este artigo analisa se vale a pena fazer essa troca e parte da ressalva honesta de que as duas tabelas de pontuação são da própria Tencent, e nenhuma delas foi reproduzida de forma independente.
A versão curta
• Escolha EVIE-8B se a precisão da recuperação for o gargalo e o seu corpus for pequeno o suficiente para que o tamanho bruto do índice não importe — você está medindo em milhares de páginas, não em milhões, e quer o melhor retriever aberto que a Tencent já publicou.
• Escolha EVIE-Preview-4.5B se o custo do índice, a latência por página ou o orçamento de GPU for uma restrição real — seus vetores 128D são exatamente o motivo de ele existir, e a diferença de precisão para o 8B é pequena no ViDoRe V1 e moderada no V3.
• Reavalie ambos contra o EVIE-4.5B antes de se comprometer: a Tencent lançou um modelo aluno no mesmo dia, com vetores truncáveis em tempo de execução e compressão de tokens, que supera ambos na fronteira de eficiência, e qualquer comparação que o ignore já está desatualizada.
• Trate todos os números aqui como reportados pelo fornecedor. O EVIE-8B não foi executado por ninguém fora da Tencent; os números do EVIE-Preview-4.5B vêm dos próprios scripts de reprodução da Tencent.
Onde eles realmente diferem
• Parâmetros — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• Backbone — Qwen3.5-9B com atenção bidirecional completa vs Qwen3.5-4B com atenção linear GatedDeltaNet intercalada com atenção completa.
• Embedding — multivetor por token com 4096 dimensões vs multivetor por token nativo com 128 dimensões, ambos pontuados com interação tardia MaxSim.
• ViDoRe V1 (10 tarefas, nDCG@5) — 92,18 vs 91,73.
• ViDoRe V2 (4 tarefas, nDCG@5) — 74.23 vs 70.87. Esta é a maior diferença relativa.
ViDoRe V3 (48 tarefas, nDCG@10) — 66.75 vs 65.36.
• Orçamento de tokens visuais por trás desses números de destaque — 1.024 tokens/página para a avaliação do EVIE-8B vs 1.792 tokens/página para o nível de destaque do EVIE-Preview-4.5B (no nível de treinamento de 768 tokens, o preview registra 64,56).
• Índice bruto em BF16 por 1M de páginas — não publicado para o EVIE-8B; no preview, os valores foram 179,2 GiB a 768 tokens/página e 420,5 GiB a 1.792 tokens/página.
• Licença e lançamento — Apache-2.0, lançamento silencioso 2026-09-04 vs Apache-2.0, lançamento silencioso 2026-08-17.

O placar acima reafirma o mesmo retrato. Tenha duas ressalvas em mente ao lê-lo: a coluna EVIE-8B e a coluna EVIE-Preview-4.5B vêm de dois cartões de modelo distintos da Tencent, e o número principal V3 do modelo de 8B é medido com um orçamento de tokens visuais por página menor do que o número principal da prévia.
Dois cartões Tencent, conversando entre si
A moldura honesta para este confronto é que se trata de uma discussão de família, não de uma competição independente. A própria ficha da EVIE-Preview-4.5B, publicada em 17 de agosto, afirma "Rank #1 no ViDoRe V3" com 65,36 nDCG@10, superando a webAI-ColVec1.1-8b por 0,04. A ficha da EVIE-8B, publicada em 4 de setembro, lista novamente esse mesmo 65,36 como o terceiro melhor número da página, abaixo dos 66,75 da EVIE-8B e dos 66,02 da EVIE-4.5B, e mostra a 8B vencendo todos os oito domínios públicos do ViDoRe V3 contra a preview. Ambos os placares foram produzidos com a própria plataforma de avaliação da Tencent, e nenhum dos modelos tem uma execução independente em qualquer lugar da literatura até agora. Portanto, a comparação que você está lendo é o relato da Tencent sobre a Tencent vencendo a Tencent — internamente consistente, plausivelmente projetada dessa maneira de propósito, e não verificada por ninguém que não tenha interesse no resultado.

O cartão tencent/EVIE-8B acima é a superfície pública do desafiante: um professor principal de 8,41B com embeddings de 4096D e a tabela ViDoRe atualizada da família no topo.

O cartão tencent/EVIE-Preview-4.5B acima é o do atual titular: um recuperador de 4.54B cujos vetores nativos de 128D e a matemática de custo de índice publicada ainda são sua característica definidora.
A pergunta de 1,39 pontos.
A diferença bruta no ViDoRe V3 é pequena — 1,39 pontos de nDCG@10 entre os 66,75 do EVIE-8B e os 65,36 do EVIE-Preview-4.5B — e vem acompanhada de um asterisco no orçamento de tokens que importa para a implantação. O protocolo de avaliação do EVIE-8B limita os documentos a 1.024 tokens visuais por página; o preview precisou de 1.792 tokens por página para registrar seu 65,36 de destaque, e obteve apenas 64,56 com seu próprio orçamento de treinamento de 768 tokens. Com esses números, o 8B não é apenas mais preciso com um orçamento comparável — é mais preciso com um orçamento menor, que é a direção desejada para a latência por página. A maior vantagem relativa está no ViDoRe V2, onde o EVIE-8B registra 74,23 contra os 70,87 do preview, um salto de 3,36 pontos na tabela que inclui as tarefas mais difíceis de documentos sintetizados. O ViDoRe V1, a tabela mais antiga e mais saturada, quase não se move: 92,18 contra 91,73. Esse padrão — estável onde todos já estão perto do teto, decisivo onde as tarefas são mais novas e difíceis — é o perfil de um aumento genuíno de capacidade, e não ruído de leaderboard, mas ainda é a própria medição da Tencent.
O índice é o verdadeiro adversário.
A precisão é apenas metade desta decisão, porque os dois modelos fazem promessas radicalmente diferentes sobre o que você armazena. A razão de existir do EVIE-Preview-4.5B é o seu vetor de token nativo de 128 dimensões: a ficha técnica publica a matemática exata do índice (179,2 GiB de índice BF16 bruto por milhão de páginas no orçamento de treinamento; 420,5 GiB no nível extrapolado) e ressalta que um vetor mais estreito reduz o armazenamento e o trabalho de pontuação MaxSim em proporção direta. Os vetores de token do EVIE-8B têm 4096 dimensões — 32 vezes mais largos por vetor — e a ficha técnica do EVIE-8B não publica nenhum valor de tamanho de índice. Essa omissão é, por si só, uma informação: com a mesma contagem de tokens por página, um índice BF16 bruto do EVIE-8B é da ordem de 32× o do EVIE-Preview-4.5B, o que coloca um corpus de um milhão de páginas na faixa de vários terabytes antes da quantização e faz do carro-chefe algo que você direciona a algumas centenas de milhares de páginas, não algo que você simplesmente hospeda em escala. A largura do carro-chefe compra fidelidade de recuperação; não compra facilidade de implantação.
A terceira opção que a Tencent lançou no mesmo dia
Nenhuma versão honesta desta comparação se limita aos dois modelos nomeados, porque o lançamento que continha o EVIE-8B também continha o EVIE-4.5B — um estudante de 4,61B destilado a partir do professor de 8B, com uma única projeção de 2048 dimensões que pode ser truncada em tempo de execução para 64, 128, 256, 512, 1024 ou 2048 dimensões; além de uma passada de compressão de tokens sem treinamento, chamada pela Tencent de HAC, que agrupa os tokens visuais de uma página em 32–64 vetores; e, de acordo com o card, uma pegada de índice de 3,81 GiB por milhão de páginas. Na própria tabela da Tencent, o EVIE-4.5B obtém 66,02 no ViDoRe V3 — apenas 0,73 ponto abaixo do professor de 8B e 0,66 ponto acima do EVIE-Preview-4.5B — o que o torna a resposta para o dilema exato que este confronto coloca. Se o que você quer é “a maior parte da precisão do 8B sem o índice do 8B”, a Tencent já lançou esse modelo, e ele não é nenhum dos dois que dão título a esta página. A justificativa remanescente do EVIE-Preview-4.5B é limitada, mas real: trata-se do checkpoint já em produção para quem o implantou em agosto, e seu perfil fixo de 128D é mais simples de entender do que uma matryoshka que pede que você escolha a dimensão em tempo de execução.
Com qual você deve indexar?
Relacione o modelo à restrição que realmente limita:
• Indexe no EVIE-8B se você está construindo o ponto de referência de precisão — um benchmark, um corpus jurídico ou científico de alto valor com centenas de milhares de páginas, ou um sistema onde erros de recuperação são caros e o armazenamento é barato. Você está pagando pelo topo da curva da família, e a família pretende que o aluno de 4.5B seja o que você escala depois.
• Continue com o EVIE-Preview-4.5B se você já fez a indexação com ele e a qualidade medida for aceitável — uma reindexação é um custo real, e o ganho do V3 que você buscaria é de 1,39 pontos em uma ficha técnica do fornecedor que ninguém confirmou de forma independente.
• Avalie o EVIE-4.5B antes de qualquer um deles se você estiver começando do zero em uma escala significativa. A truncagem Prefix-MRL e a compressão HAC visam diretamente a aritmética de armazenamento acima, e os próprios números da Tencent o colocam a uma distância impressionante do professor.
Nenhum dos três tem uma API hospedada em qualquer plataforma, incluindo OrcaRouter, então o estágio de recuperação é, de qualquer forma, uma decisão de auto-hospedagem. O estágio seguinte não precisa ser. Um roteador como o que a OrcaRouter opera em mais de 200 modelos mantém o modelo que lê as suas páginas recuperadas e escreve a resposta atrás de uma única API, com failover automático entre provedores e preços de tabela dos provedores repassados com margem de 0% — que é exatamente a configuração que você quer quando o recuperador que o alimenta é um checkpoint de três dias com afirmações não verificadas. Construa o índice com o recuperador que se adapte ao seu armazenamento e mantenha o restante do pipeline intercambiável até que alguém de fora da Tencent confirme qual desses scorecards é real.
