Титульная hero-карточка для сравнения 'EVIE-8B vs EVIE-Preview-4.5B' с подзаголовком 'A 1.39-Point Gain for 32x Wider Vectors', на которой изображено плоское двухпанельное визуальное решение: слева высокая стопка страниц документов рядом с подписью 4096D, справа компактная страница документа рядом с маленькой иконкой жёсткого диска с подписью 128D, по центру между панелями — тонкая линия весов, внизу — текст 'Which Tencent visual document retriever should you index with?' и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

EVIE-8B против EVIE-Preview-4.5B: прирост на 1,39 пункта для векторов в 32 раза шире

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Через три недели после того, как Tencent выпустила EVIE-Preview-4.5B и назвала её самым точным визуальным документальным ретривером на лидербордах ViDoRe, компания выпустила EVIE-8B и тихо передвинула планку, на которой стояла её собственная модель с размерностью 128. EVIE-8B — это флагманская модель-учитель на 8,41 млрд параметров с 4096-мерными эмбеддингами на токен; EVIE-Preview-4.5B — это компактный ретривер на 4,54 млрд параметров, вся концепция которого заключалась в том, что 128 измерений достаточно, чтобы превзойти модели в четыре раза большего размера. На обновлённом лидерборде в карточке EVIE-8B модель EVIE-Preview-4.5B теперь занимает третье место внутри собственного семейства — уступая новой EVIE-8B и EVIE-4.5B, студенческой модели, которую Tencent выпустила тем же утром. Если вы выбираете, какую из двух названных моделей использовать для индексации корпуса документов, цифры на карточках Tencent говорят, что 8B примерно на 1,39 балла лучше на ViDoRe V3 и на 3,36 балла лучше на ViDoRe V2 — и что для этого требуется в 32 раза больше дискового пространства на вектор. Этот материал о том, стоит ли такой обмен того, и начинается он с честной оговорки: обе карточки результатов принадлежат самой Tencent, и ни одна из них не была независимо воспроизведена.

Краткая версия

• Выберите EVIE-8B, если точность поиска является узким местом, а ваш корпус достаточно мал, чтобы размер необработанного индекса не имел значения — вы измеряете объём в тысячах страниц, а не в миллионах, и вам нужен лучший открытый ретривер, опубликованный Tencent.

• Выбирайте EVIE-Preview-4.5B, если стоимость индексации, задержка на страницу или бюджет GPU действительно ограничены — 128-мерные векторы здесь и есть основная причина его существования, а разрыв по точности с 8B невелик на ViDoRe V1 и умеренный на V3.

• Перепроверьте обе модели в сравнении с EVIE-4.5B, прежде чем фиксировать решение: Tencent выпустила вышедшую в тот же день студенческую модель с усекаемыми в рантайме векторами и сжатием токенов, которая опережает обе на границе эффективности — и любое сравнение, игнорирующее её, уже устарело.

• Относитесь к каждому числу здесь как к данным, предоставленным вендором. EVIE-8B не запускалась никем за пределами Tencent; показатели EVIE-Preview-4.5B получены по собственным скриптам воспроизведения Tencent.

Где они на самом деле различаются

• Параметры — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.

• Базовая модель — Qwen3.5-9B с полным двунаправленным вниманием против Qwen3.5-4B с чередующимися слоями линейного внимания GatedDeltaNet и полного внимания.

• Эмбеддинг — 4096-мерный мультивектор на токен против исходного 128-мерного мультивектора на токен, оба оцениваются с помощью позднего взаимодействия MaxSim.

• ViDoRe V1 (10 задач, nDCG@5) — 92.18 против 91.73.

• ViDoRe V2 (4 tasks, nDCG@5) — 74.23 против 70.87. Это самый большой относительный разрыв.

• ViDoRe V3 (48 задач, nDCG@10) — 66.75 против 65.36.

• Бюджет визуальных токенов, стоящий за указанными в заголовке цифрами: 1 024 токена на страницу для оценки EVIE-8B против 1 792 токенов на страницу для флагманского уровня EVIE-Preview-4.5B (при тренировочном уровне в 768 токенов превью набирает 64.56).

Сырой индекс BF16 на 1 млн страниц — не опубликован для EVIE-8B, в отличие от предварительной версии, где он составляет 179.2 ГиБ при 768 токенах/страницу и 420.5 ГиБ при 1,792.

• Лицензия и выпуск — Apache-2.0, тихий выпуск 2026-09-04 против Apache-2.0, тихий выпуск 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Приведенная выше таблица повторяет ту же картину. Читая её, помните о двух оговорках: колонка EVIE-8B и колонка EVIE-Preview-4.5B взяты из двух разных карточек моделей Tencent, а заявленное в заголовке значение V3 для 8B измерено при меньшем бюджете визуальных токенов на страницу, чем заявленное в заголовке значение для превью-версии.

Две карты Tencent, разговаривающие друг с другом

Честная постановка этого сравнения такова: это семейный спор, а не независимое состязание. В карточке самой EVIE-Preview-4.5B, опубликованной 17 августа, заявлено «Rank #1 on ViDoRe V3» с результатом 65.36 nDCG@10, что на 0.04 опережает webAI-ColVec1.1-8b. В карточке EVIE-8B, опубликованной 4 сентября, тот же показатель 65.36 перечислен как третий результат на странице — ниже 66.75 у EVIE-8B и 66.02 у EVIE-4.5B, — и показано, что 8B выигрывает у превью-версии по всем восьми публичным доменам ViDoRe V3. Обе карточки подготовлены с помощью собственного оценочного инструментария Tencent, и ни у одной из моделей пока нет независимых прогонов в литературе. Так что сравнение, которое вы читаете, — это отчёт Tencent о том, как Tencent побеждает Tencent: внутренне непротиворечивый, правдоподобно намеренно сконструированный и никем не проверенный из тех, у кого нет заинтересованности в исходе.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

Приведённая выше карточка tencent/EVIE-8B — это публичная витрина претендента: флагманский «учитель» с 8,41 млрд параметров, эмбеддингами размерности 4096 и обновлённой таблицей ViDoRe семейства в верхней части.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

Карточка tencent/EVIE-Preview-4.5B выше принадлежит действующему лидеру: это ретривер на 4.54B параметров, чьи собственные 128D-векторы и опубликованные расчёты стоимости индексации по-прежнему остаются его определяющей особенностью.

Вопрос на 1,39 пункта

Разрыв в показателях на ViDoRe V3 невелик — 1,39 пункта nDCG@10 между 66,75 у EVIE-8B и 65,36 у EVIE-Preview-4.5B, — и он сопровождается оговоркой про бюджет токенов, которая важна для развёртывания. Протокол оценки EVIE-8B ограничивает документы 1024 визуальными токенами на страницу; превью-версии требовалось 1792 токена на страницу, чтобы показать заявленные 65,36, а при собственном тренировочном бюджете в 768 токенов она набрала лишь 64,56. Судя по этим цифрам, 8B не просто точнее при сопоставимом бюджете — она точнее при меньшем, а это как раз то направление, которое нужно для снижения задержки на страницу. Более значительный относительный выигрыш — на ViDoRe V2, где EVIE-8B сообщает о 74,23 против 70,87 у превью-версии: скачок на 3,36 пункта на доске, включающей более сложные задачи с синтезированными документами. ViDoRe V1, самая старая и наиболее насыщенная доска, почти не движется: 92,18 против 91,73. Такая картина — ровно там, где все уже близки к потолку, и решительный отрыв там, где задачи новее и сложнее, — характерна для реального прироста возможностей, а не для шума на лидерборде, но это всё же собственная оценка Tencent.

Индекс — вот настоящий противник.

Точность — лишь половина этого выбора, поскольку эти две модели дают принципиально разные обещания насчёт того, что вы храните. Смысл существования EVIE-Preview-4.5B — её нативный 128-мерный вектор токена: в карточке модели публикуются точные расчёты размера индекса (179,2 ГиБ сырого индекса BF16 на миллион страниц при её бюджете обучения и 420,5 ГиБ на экстраполированном уровне), а также указывается, что более узкий вектор сокращает объём хранилища и объём вычислений при MaxSim-скоринге прямо пропорционально. Векторы токенов EVIE-8B имеют размерность 4096, то есть в 32 раза шире, чем у превью-модели; при этом карточка EVIE-8B не приводит вообще никаких цифр о размере индекса. Само это умолчание — уже информация: при том же числе токенов на страницу сырой индекс BF16 модели EVIE-8B примерно в 32 раза больше, чем у превью-модели, так что корпус из миллиона страниц ещё до квантования займёт несколько терабайт, а флагманская модель будет предназначена для нескольких сотен тысяч страниц, а не для того, чтобы её можно было запросто развернуть в масштабе. Ширина векторов флагмана даёт точность поиска; развёртываемость она не даёт.

Третий вариант Tencent выпустила в тот же день.

Ни одна честная версия этого сравнения не останавливается на двух названных моделях: релиз, содержавший EVIE-8B, также содержал EVIE-4.5B — модель-студента с 4,61 млрд параметров, дистиллированную из учителя 8B, с единственной 2048-мерной проекцией, которая в рантайме усекается до 64, 128, 256, 512, 1024 или 2048 измерений, плюс не требующий обучения проход сжатия токенов, который Tencent называет HAC и который кластеризует визуальные токены страницы до 32–64 векторов; согласно карточке модели, индекс занимает 3,81 ГиБ на миллион страниц. В собственной таблице Tencent EVIE-4.5B набирает 66,02 на ViDoRe V3 — всего на 0,73 меньше, чем учитель 8B, и на 0,66 больше, чем EVIE-Preview-4.5B, — что делает её ответом на ту самую дилемму, которую ставит это сопоставление. Если вам нужно «бо́льшая часть точности 8B без индекса 8B», Tencent уже выпустила такую модель, и это ни одна из двух моделей, вынесенных в заголовок этой страницы. Оставшийся довод в пользу EVIE-Preview-4.5B узок, но реален: это чекпоинт, который уже стоит в продакшене у всех, кто развернул его в августе, а его фиксированный профиль 128D проще осмыслить, чем матрёшку, требующую выбирать размерность в рантайме.

Что следует использовать для индексации

Сопоставьте модель с ограничением, которое действительно является активным:

• Если вы создаёте эталон точности — бенчмарк, высокоценный юридический или научный корпус объёмом в сотни тысяч страниц либо систему, где промахи поиска обходятся дорого, а хранение — дёшево, — для индексации берите EVIE-8B. Вы платите за верхнюю точку кривой семейства, и семейство подразумевает, что масштабировать в дальнейшем вы будете именно студента 4.5B.

• Оставайтесь на EVIE-Preview-4.5B, если вы уже индексировали с его помощью и измеренное качество вас устраивает — повторная индексация стоит реальных ресурсов, а прирост от V3, за которым вы бы гнались, составляет 1,39 балла на вендорской карточке, которую никто независимо не подтвердил.

• Если вы начинаете с нуля в значительном масштабе, прежде чем выбирать любой из двух, оцените EVIE-4.5B. Усечение Prefix-MRL и сжатие HAC напрямую нацелены на приведённую выше арифметику хранения, и собственные данные Tencent показывают, что она вплотную приблизилась к учителю.

Ни одна из трёх не имеет размещённого API ни на одной платформе, включая OrcaRouter, так что этап поиска в любом случае означает выбор самостоятельного хостинга. Следующий за ним этап — не обязательно. Маршрутизатор, подобный тому, что OrcaRouter использует поверх более чем 200 моделей, держит модель, которая читает ваши найденные страницы и пишет ответ, за одним API с автоматическим переключением между провайдерами и публичными ценами провайдеров без наценки (0%) — это именно та конфигурация, которая вам нужна, когда питающий её поисковик — это трёхдневной давности чекпойнт с непроверенными утверждениями. Стройте индекс с тем поисковиком, который подходит под ваше хранилище, и держите остальную часть конвейера заменяемой, пока кто-то за пределами Tencent не подтвердит, какая из этих оценочных таблиц настоящая.