'EVIE-8B vs EVIE-Preview-4.5B' 비교를 위한 히어로 타이틀 카드로, 부제는 '32배 더 넓은 벡터를 위한 1.39포인트 향상'이며, 평면적인 2패널 비주얼을 보여줍니다. 왼쪽에는 4096D 라벨 옆에 높게 쌓인 문서 페이지 더미가 있고, 오른쪽에는 128D 라벨이 있는 작은 하드 드라이브 아이콘 옆에 컴팩트한 문서 페이지가 있으며, 패널 사이 중앙에는 얇은 저울대 선이 있습니다. 바닥글 텍스트는 '어떤 Tencent 비주얼 문서 검색기로 인덱싱해야 할까요?'이고, 오른쪽 하단 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

EVIE-8B vs EVIE-Preview-4.5B: 32배 더 넓은 벡터에서의 1.39포인트 향상

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

텐센트가 EVIE-Preview-4.5B를 출시하고 이를 ViDoRe 보드에서 가장 정확한 시각 문서 검색기라고 부른 지 3주 만에, 텐센트는 EVIE-8B를 출시하며 자사의 128차원 모델이 서 있던 골대를 조용히 옮겼다. EVIE-8B는 4096차원의 토큰당 임베딩을 갖춘 8.41B 플래그십 티처 모델이고, EVIE-Preview-4.5B는 자기 크기의 4배에 달하는 모델을 이기기에는 128차원이면 충분하다는 것이 핵심 포인트였던 4.54B 컴팩트 검색기다. EVIE-8B 카드 안의 새로 고쳐진 리더보드에서 EVIE-Preview-4.5B는 이제 같은 패밀리 내에서 3위에 위치한다. 새로운 EVIE-8B와, 텐센트가 같은 날 출시한 스튜던트 모델인 EVIE-4.5B 뒤에 있는 것이다. 두 이름 붙은 모델 중 어느 것으로 문서 코퍼스를 인덱싱할지 고른다면, 텐센트 카드에 적힌 수치는 8B가 ViDoRe V3에서 약 1.39포인트, ViDoRe V2에서 3.36포인트 더 낫고, 그 성과를 얻기 위해 벡터당 인덱스 공간을 32배 더 사용한다고 말한다. 이 글은 그 트레이드오프가 감수할 만한 가치가 있는지에 관한 것이며, 두 스코어카드 모두 텐센트 자체의 것이고 어느 쪽도 독립적으로 재현되지 않았다는 솔직한 단서에서 출발한다.

간략 버전

• 검색 정확도가 병목이고, 말뭉치가 원시 인덱스 크기가 문제되지 않을 만큼 작다면 EVIE-8B를 선택하세요 — 수백만 페이지가 아니라 수천 페이지 단위로 측정하고 있으며, Tencent가 공개한 최고의 오픈 리트리버를 원하는 경우입니다.

• 인덱스 비용, 페이지당 지연 시간, 또는 GPU 예산이 실질적인 제약이라면 EVIE-Preview-4.5B를 선택하세요. 128D 벡터가 바로 이 모델이 존재하는 이유이며, ViDoRe V1에서는 8B 모델과의 정확도 차이가 작고 V3에서는 그 차이가 다소 있습니다.

커밋하기 전에 둘 다 EVIE-4.5B와 대조해 다시 확인하세요. Tencent는 런타임에서 절단 가능한 벡터와 토큰 압축을 갖춘 같은 날 출시된 학생 모델을 공개하여, 효율 경계에서 둘 모두를 능가합니다. 이를 무시한 비교는 이미 시대에 뒤떨어진 것입니다.

• 여기의 모든 수치는 공급업체가 보고한 것으로 간주하세요. EVIE-8B는 Tencent 외부에서 실행된 적이 없으며, EVIE-Preview-4.5B의 수치는 Tencent 자체 재현 스크립트에서 나온 것입니다.

그들이 실제로 다른 점

• 파라미터 — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• 백본 — 전체 양방향 어텐션을 사용하는 Qwen3.5-9B vs 인터리브된 GatedDeltaNet 선형 어텐션과 전체 어텐션을 사용하는 Qwen3.5-4B

• 임베딩 — 토큰당 4096차원 멀티-벡터 vs 토큰당 네이티브 128차원 멀티-벡터, 둘 다 MaxSim 후기 상호작용(레이드 인터랙션)으로 스코어링됨.

• ViDoRe V1 (10개 과제, nDCG@5) — 92.18 대 91.73.

• ViDoRe V2 (4개 작업, nDCG@5) — 74.23 대 70.87. 이것이 가장 큰 상대적 격차입니다.

• ViDoRe V3 (48개 태스크, nDCG@10) — 66.75 vs 65.36.

• 헤드라인 수치 뒤에 숨은 시각 토큰 예산 — EVIE-8B 평가는 페이지당 1,024토큰, EVIE-Preview-4.5B의 헤드라인 계층은 페이지당 1,792토큰(768토큰 학습 계층에서는 프리뷰가 64.56을 기록).

• 1M 페이지당 Raw BF16 인덱스 — EVIE-8B의 경우 미공개, 프리뷰의 경우 768 토큰/페이지에서 179.2 GiB, 1,792 토큰/페이지에서 420.5 GiB

• 라이선스 및 출시 — Apache-2.0, 조용한 출시 2026-09-04 vs Apache-2.0, 조용한 출시 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

위의 점수판은 동일한 결과를 다시 제시합니다. 이를 읽을 때 두 가지 유의사항을 염두에 두시기 바랍니다: EVIE-8B 열과 EVIE-Preview-4.5B 열은 서로 다른 두 개의 Tencent 모델 카드에서 가져온 것이며, 8B의 헤드라인 V3 수치는 EVIE-Preview-4.5B의 헤드라인 수치보다 페이지당 더 낮은 시각적 토큰 예산으로 측정되었습니다.

텐센트 카드 두 장, 서로 대화 중

솔직하게 말하자면, 이 맞대결은 독립적인 대회가 아니라 가족 간의 논쟁입니다. EVIE-Preview-4.5B의 자체 카드는 8월 17일에 발행되었으며, nDCG@10 65.36으로 "ViDoRe V3 랭크 1위"를 주장하고 webAI-ColVec1.1-8b를 0.04 차이로 이겼다고 밝힙니다. 9월 4일에 발행된 EVIE-8B의 카드는 같은 65.36을 페이지에서 세 번째로 좋은 수치로 다시 나열하며, EVIE-8B의 66.75와 EVIE-4.5B의 66.02 아래에 둡니다. 또한 프리뷰 모델과 비교해 8B가 공개된 ViDoRe V3의 8개 도메인 모두에서 이겼다고 보여줍니다. 두 스코어카드 모두 Tencent 자체 평가 하네스로 제작되었으며, 두 모델 모두 아직 어떤 문헌에도 독립적인 실행 기록이 없습니다. 따라서 지금 읽고 계신 비교는 Tencent가 Tencent를 이겼다는 Tencent의 설명입니다. 내부적으로는 일관성이 있고, 의도적으로 그렇게 설계되었을 가능성도 있으며, 결과에 이해관계가 없는 누구에게도 검증되지 않았습니다.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

위의 tencent/EVIE-8B 카드는 도전자가 공개한 외관입니다: 4096D 임베딩을 갖춘 8.41B 플래그십 티처와, 맨 위에 자리한 해당 모델군의 업데이트된 ViDoRe 테이블로 구성됩니다.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

위의 tencent/EVIE-Preview-4.5B 카드는 현재 선두 주자(incumbent)의 것입니다: 기본 128D 벡터와 공개된 인덱스 비용 계산이 여전히 핵심 특징으로 남아 있는 4.54B 리트리버입니다.

1.39점짜리 질문

ViDoRe V3에서의 단순 점수 차이는 작습니다. EVIE-8B의 66.75와 EVIE-Preview-4.5B의 65.36 사이의 nDCG@10 차이는 1.39포인트이며, 여기에는 배포에 중요한 토큰 예산이라는 단서가 붙습니다. EVIE-8B의 평가 프로토콜은 페이지당 문서를 1,024개의 시각 토큰으로 제한합니다. 프리뷰 모델은 대표 점수인 65.36을 기록하기 위해 페이지당 1,792개의 토큰이 필요했으며, 자체 768-토큰 훈련 예산에서는 64.56에 그쳤습니다. 이 수치로 볼 때 8B는 비슷한 예산에서 더 정확할 뿐만 아니라 더 작은 예산에서도 더 정확합니다. 이는 페이지당 지연 시간 측면에서 바람직한 방향입니다. 더 큰 상대적 우위는 ViDoRe V2에서 나타납니다. EVIE-8B는 74.23을 보고한 반면 프리뷰 모델은 70.87에 그쳐, 더 어려운 합성 문서 작업이 포함된 보드에서 3.36포인트 상승을 기록했습니다. 가장 오래되고 가장 포화된 보드인 ViDoRe V1은 거의 변동이 없습니다: 92.18 대 91.73. 모두가 이미 한계에 근접한 곳에서는 평평하고, 작업이 더 새롭고 어려운 곳에서는 결정적 차이를 보이는 이러한 패턴은 리더보드 노이즈가 아닌 진정한 능력 향상의 특징입니다. 하지만 이는 여전히 텐센트가 자체적으로 측정한 결과입니다.

진짜 상대는 지수다

정확도는 이 결정의 절반에 불과합니다. 두 모델이 저장하는 내용에 대해 근본적으로 다른 약속을 하고 있기 때문입니다. EVIE-Preview-4.5B가 존재하는 이유는 고유한 128차원 토큰 벡터에 있습니다. 모델 카드는 정확한 인덱스 수치를 공개합니다(학습 예산 기준 백만 페이지당 179.2GiB, 외삽 티어 기준 420.5GiB의 원시 BF16 인덱스). 그리고 더 좁은 벡터는 저장 공간과 MaxSim 점수 계산 작업을 정비례로 줄여 준다고 지적합니다. EVIE-8B의 토큰 벡터는 4096차원으로, 벡터당 32배 더 넓습니다. 그런데 EVIE-8B 카드는 인덱스 크기 수치를 전혀 공개하지 않습니다. 그 생략 자체가 정보입니다. 페이지당 토큰 수가 같다면, EVIE-8B의 원시 BF16 인덱스는 프리뷰 모델의 약 32배입니다. 이는 백만 페이지 분량의 코퍼스를 양자화 이전에 수 테라바이트 범위로 만들며, 플래그십을 수십만 페이지를 대상으로 삼는 모델로 만들 뿐, 대규모로 부담 없이 호스팅할 수 있는 모델로 만들지는 않습니다. 플래그십의 벡터 폭은 검색 충실도를 사지만, 배포 용이성을 사지는 않습니다.

같은 날 텐센트가 출시한 세 번째 옵션

{{1}}이 비교에 대한 정직한 평가는 제목에 오른 두 모델에서 멈추지 않습니다. EVIE-8B가 포함된 릴리스에는 EVIE-4.5B도 함께 포함되어 있었기 때문입니다{{/1}} — {{2}}8B 교사 모델에서 증류된 4.61B 학생 모델로, 런타임에 64, 128, 256, 512, 1024, 2048 차원으로 축소할 수 있는 단일 2048차원 프로젝션을 갖추고 있으며{{/2}}, {{3}}Tencent가 HAC라고 부르는 학습이 필요 없는 토큰 압축 패스를 통해 페이지의 시각 토큰을 32~64개 벡터로 클러스터링합니다{{/3}}. {{4}}그리고 카드에 따르면 인덱스 풋프린트는 백만 페이지당 3.81GiB입니다{{/4}}. {{5}}Tencent 자체 평가표에서 EVIE-4.5B는 ViDoRe V3에서 66.02점을 기록했습니다{{/5}} — {{6}}8B 교사보다 0.73점 뒤지고 EVIE-Preview-4.5B보다 0.66점 앞선 수치입니다{{/6}} — {{7}}이로써 EVIE-4.5B는 이 대결 구도가 제기하는 바로 그 딜레마에 대한 답이 됩니다{{/7}}. {{8}}"8B의 인덱스 없이 8B 정확도의 대부분"을 원한다면, Tencent는 이미 그런 모델을 출시했습니다{{/8}}. {{9}}그리고 그것은 이 페이지 제목에 오른 두 모델 중 어느 쪽도 아닙니다{{/9}}. {{10}}EVIE-Preview-4.5B의 남은 근거는 좁지만 분명합니다:{{/10}} {{11}}8월에 그 모델을 배포한 모든 이에게는 이미 프로덕션에 있는 체크포인트라는 점,{{/11}} {{12}}그리고 고정된 128D 프로파일은 런타임에 차원을 선택하라고 요구하는 마트료시카보다 추론하기가 더 단순하다는 점입니다{{/12}}.

어떤 것으로 인덱싱해야 하나요?

모델을 실제로 구속하는 제약 조건에 연결하십시오:

• 정확도 기준점(accuracy reference point)을 구축하는 경우 — 벤치마크, 수십만 페이지 규모의 고부가가치 법률·과학 말뭉치, 또는 검색 누락 비용이 크고 저장 공간이 저렴한 시스템 — EVIE-8B에서 인덱싱하세요. 이는 제품군 성능 곡선의 정점에 비용을 지불하는 것이며, 제품군은 이후 4.5B 학생 모델을 확장 대상으로 의도하고 있습니다.

• 이미 EVIE-Preview-4.5B로 인덱싱했고 측정된 품질이 수용 가능하다면 해당 모델을 계속 사용하십시오. 재인덱싱은 실질적인 비용이 들며, 쫓아가려는 V3의 이득은 누구도 독립적으로 확인하지 못한 벤더 카드에서의 1.39포인트에 불과합니다.

• 의미 있는 규모로 새로 시작한다면, 둘 중 무엇을 하기 전에 EVIE-4.5B를 먼저 평가하세요. Prefix-MRL 잘림과 HAC 압축은 위의 저장 산술을 정확히 겨냥하며, Tencent 자체 수치에 따르면 교사 모델에 근접한 성능을 보여줍니다.

세 가지 중 어떤 것도 OrcaRouter를 포함한 어느 플랫폼에서도 호스팅 API를 제공하지 않으므로, 검색 단계는 어느 경우든 자체 호스팅으로 결정해야 합니다. 그 이후 단계는 자체 호스팅일 필요가 없습니다. OrcaRouter가 200개 이상의 모델에 걸쳐 운영하는 것과 같은 라우터는, 검색된 페이지를 읽고 답변을 작성하는 모델을 단일 API 뒤에 두고, 공급자 간 자동 장애 조치를 지원하며 공급자 목록 가격을 0% 마크업으로 그대로 전달합니다. 이는 그 라우터에 자료를 공급하는 검색기가 검증되지 않은 주장을 담은 3일 된 체크포인트일 때 정확히 원하는 구성입니다. 스토리지에 맞는 검색기로 인덱스를 구축하고, Tencent 외부의 누군가가 이 스코어카드 중 어떤 것이 진짜인지 확인할 때까지 파이프라인의 나머지 부분을 교체 가능한 상태로 유지하십시오.