新闻文章《EVIE-8B》的主视觉标题卡片,副标题为“腾讯悄然推出迄今最精准的视觉文档检索器”,展示一幅扁平化编辑风格的插画:一枚放大镜置于一叠文档页上方(其中一页带有小型数据表,另一页带有简单折线图),从文档页中流出的小方块 token 向量流向一个 4096D 胶囊形标签;页脚文字为“2026年9月4日悄然发布——权重已上传至 Hugging Face,尚无公告”,右下角为 OrcaRouter 标志。
Engineering & Research

EVIE-8B:腾讯悄然推出迄今最精准的视觉文档检索器

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

三周前,腾讯的EVIE-Preview-4.5B凭借腾讯自行报告的数据,成为ViDoRe榜单上最准确的开源视觉文档检索器。9月4日,腾讯悄然将其自有排行榜榜首的模型替换——并非换上了外部挑战者,而是当天上午发布的一个更大的同门模型。EVIE-8B,一个基于Qwen3.5-9B骨干、拥有8.41B参数和4096维逐token嵌入的后期交互检索器,以权重加代码的形式登陆Hugging Face和GitHub,没有任何公告、没有博客文章、也没有论文。第三个检查点EVIE-4.5B在同一分钟出现,如今位列两者之间。与这次发布相关的每一项声明——分数、架构,甚至这些模型的用途——目前都仅基于腾讯自家仓库的说法,因为腾讯之外还没有任何人发布过关于EVIE-8B的任何内容。以下是从仓库中实际可以得知的信息,以及尚未得到确认的部分。

腾讯在9月4日发布了什么

2026年9月4日,Hugging Face 上的 tencent 组织下几乎相隔一分钟出现了两个新仓库:tencent/EVIE-8B 和 tencent/EVIE-4.5B。一个整合后的 GitHub 仓库 Tencent/EVIE 也随之上线,其中包含训练代码、ColQwen3.5 推理引擎和 138 项任务的评测框架。两个模型仓库均采用 Apache-2.0 许可,都使用 colpali-engine 库,并且都带有 visual-document-retrieval(视觉文档检索)流水线标签。8月17日发布的较早模型 EVIE-Preview-4.5B 仍以“Preview”名称保留在 Hugging Face 上,但它已不再是该系列的主打旗舰:在 EVIE-8B 模型卡内更新后的排行榜中,腾讯将自己的三个检查点列于榜首——EVIE-8B 以 66.75 的 ViDoRe V3 nDCG@10 领先,EVIE-4.5B 为 66.02,EVIE-Preview-4.5B 为 65.36。

目前任何地方都没有发布公告。EVIE-8B 模型卡的发布说明称,权重、推理流水线和评估套件均已开源,随后补充道:“完整的技术细节、架构消融实验和正式研究论文将在后续版本中更新。”截至撰写本文时,该 GitHub 仓库仅有四次提交,没有任何发布版本。两个新仓库目前均未展现出有意义的采用迹象——没有带独立结果的社区 fork,没有第三方评估,而且仓库公开两天后,下载计数仍接近于零。从现有证据来看,这是腾讯一次“先发布权重、后撰写论文”的发布,与该实验室在 8 月份发布 EVIE-Preview-4.5B 和 UI-Mate-9B 时采用的悄然模式一致。

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

上面的tencent/EVIE-8B模型卡是本次发布的公开呈现:一个为colpali-engine库标记的视觉文档检索检查点,采用Apache-2.0许可证,具有4096维晚期交互嵌入,并且该模型系列自身刷新的ViDoRe表格位于卡片顶部附近。

EVIE-8B,旗舰教师

架构上,EVIE-8B 属于 ColPali/ColBERT 晚期交互(late-interaction)家族。它不是像单向量密集检索那样,通过有损的方式将页面压缩成一个嵌入向量,而是用一个视觉-语言骨干网络对页面图像进行处理,并为每个 token 保留多向量表示,然后使用 MaxSim 算子计算相关性:每个查询 token 在页面所有 token 中找到其最佳匹配,再将这些最大值相加得到相关性分数。EVIE-8B 的具体选择是采用 Qwen3.5-9B 骨干网络,并运行完整的双向注意力(该模型被编码器化,因此在视觉-文本序列上关闭了因果掩码),每个 token 还有一个宽达 4096 维的投影。这样做的意义在于保真度:空间布局、排版、图表结构和表格关系能够在表示中保留下来,而不是被平均抹掉。

腾讯明确将 EVIE-8B 定位为“旗舰教师”。EVIE-4.5B 学生模型使用腾讯称之为 EVIE-ARD 的方法从该教师模型训练而来——这是一种保留锚点、容量感知的关系蒸馏,它传递 token 关系拓扑,并采用难负样本边际监督。换句话说,8B 模型有两个职责:为产品线设定准确率上限,以及作为紧凑学生模型蒸馏所依赖的质量锚点。在训练方面,模型卡报告了 775,635 个文档-查询对,其中挖掘出的难负样本由多模态裁判重新判定:可将回答的候选提升为正样本,将模糊样本从损失中屏蔽,仅将严格不相关的页面保留为真正负样本。发布的 'a40' 检查点本身就是两个独立训练分支在 α = 0.40 下的权重空间混合。

腾讯为自己写的记分牌

以下所有数字均为供应商报告。它们来自腾讯自己的模型卡,并使用腾讯在其代码库中随附的评估工具链生成;这些结果均未经独立复现,且 EVIE-8B 尚未被该实验室以外的任何人运行过。

• 参数 / 骨干网络 — 84.1亿,Qwen3.5-9B,双向全注意力。

• Embedding — 每个 token 的 4096 维多向量,MaxSim 后期交互。

• ViDoRe V1(10个任务,nDCG@5)— 92.18。

• ViDoRe V2 (4 项任务, nDCG@5) — 74.23.

• ViDoRe V3(48个任务,nDCG@10)——66.75,通过按领域扫描,该模型卡声称在所有八个公共领域均获胜。

• JinaVDR(76项任务,nDCG@10)— 83.30;在138项任务套件中,四个板块的宏平均nDCG@10 — 79.51。

• 许可证 — Apache-2.0;权重、推理和评估代码均开放。

A single-column scoreboard for EVIE-8B reading: Params 8.41B, Backbone Qwen3.5-9B, Embedding 4096D per token, ViDoRe V1 (nDCG@5) 92.18, ViDoRe V3 (nDCG@10) 66.75, License Apache-2.0, with a footer noting all figures are vendor-reported from the tencent/EVIE-8B card and not independently reproduced, and the OrcaRouter logo in the bottom-right corner.

腾讯榜单中最有趣的一行,是腾讯击败腾讯的那一行。八月份的 EVIE-Preview-4.5B 模型卡声称以 65.36 的 nDCG@10“位列 ViDoRe V3 第一”,以微弱优势压过 webAI-ColVec1.1-8b 的 65.32。在 EVIE-8B 模型卡内更新的榜单中,同一项 65.36 如今总体排名第三,落后于 EVIE-8B 的 66.75 和 EVIE-4.5B 的 66.02。EVIE-8B 的分领域表现全面胜过旧预览版,在全部八个公开 ViDoRe V3 领域中均是如此——CompSci 81.86 对 80.65,Finance EN 71.23 对 70.50,Pharma 70.81 对 69.20,等等——平均提升 1.39 分。这一提升能否在独立运行中站稳脚跟,正是那个悬而未决的问题;不过,其内部一致性值得留意,因为一个连自己的学生都赢不了的教师模型,发布出来就太奇怪了。

A family graphic titled 'Three EVIE checkpoints, one self-published leaderboard' showing three stacked rows each with a ViDoRe V3 nDCG@10 value: EVIE-8B 66.75 with a gold rank-1 badge and the tag '4096D teacher', EVIE-4.5B 66.02 with a silver rank-2 badge and the tag 'Prefix-MRL student', and EVIE-Preview-4.5B 65.36 with a bronze rank-3 badge and the tag '128D preview', with a footer noting the ranking is vendor-reported from the EVIE-8B card of September 4, 2026, and the OrcaRouter logo in the bottom-right corner.

上方的系列图重述了腾讯于9月4日在EVIE-8B模型卡中发布的三检查点排名——EVIE-8B为66.75,EVIE-4.5B为66.02,EVIE-Preview-4.5B为65.36(ViDoRe V3 nDCG@10指标)——128D预览版让位于4096D教师模型与前缀MRL学生模型。

为什么旗舰不是部署模型

精度领先者被称为教师而不是默认,是有原因的。宽度会增加存储和评分算力开销,而每个 token 4096 维已经非常宽。在 BF16 下,任何量化之前,一个 EVIE-8B token 向量就有 8 KiB;一个稠密页面可以产生数百个 token 向量——该模型卡自带的评估协议将每页文档限制为 1,024 个视觉 token。腾讯没有公布 EVIE-8B 的索引大小,这很扎眼,因为 EVIE-Preview-4.5B 的模型卡公布过其 128 维索引的精确数字:在 768 token 的训练预算下,每百万页原始 BF16 索引为 179.2 GiB;在外推的 1,792 token 档位下则为 420.5 GiB。逐向量看,EVIE-8B 的嵌入宽度是 preview 版的 32 倍,因此在同样的 token 预算下,原始 EVIE-8B 索引每百万页就会达到数 TB 级别——这还没把必须将其保存在 RAM 中的检索系统考虑进来。

EVIE-4.5B 当日同步发布,恰恰说明腾讯预期这一张力将如何化解。EVIE-4.5B 是一个 4.61B 参数的学生模型,配备单一的 2048 维投影,可在运行时截断为 64、128、256、512、1024 或 2048 维(腾讯称该方案为 Prefix-MRL),外加一步名为 HAC 的免训练词元压缩流程,能将页面约 750 个视觉词元聚类为 32–64 个向量。腾讯为这一模型主打的宣传指标是每百万页 3.81 GiB 的索引占用——与文中其他数字一样,这也是厂商自行报告的数据。综合来看,这次发布与其说是一个"新 8B 模型",不如说是一个有意为之的模型家族:8B 模型设定上限并训练学生模型,而真正体量合适、足以实际支撑生产索引的,正是这个学生模型。

如今如何运行 EVIE-8B

EVIE-8B 仅以权重形式提供。任何平台都未提供托管 API——包括 OrcaRouter——因此目前唯一的路径是自行托管该检查点,并通过 colpali-engine 中的 ColQwen3.5 路径运行它。模型卡的快速入门很简短:以 BF16 格式加载模型并使用 flash-attention,调用 enable_bidirectional_attention(),对页面图像和文本查询进行嵌入,然后用处理器的 MaxSim 进行评分。双向步骤并非可有可无的装饰——已发布的 colpali-engine 在默认情况下以因果掩码构建 ColQwen3.5,而预览模型的模型卡记录表明,保留掩码会使 top-hit MaxSim 损失约 1.1 个点。EVIE-8B 也随附了同样的辅助函数。按照每参数两字节的经验法则估算,8.41B 的 BF16 检查点权重约为 17 GB,因此这属于需要单 GPU 并留足显存余量的方案,而非边缘模型;语料库存放在你保存索引的任何位置,而不是在模型本身上。

EVIE-8B 为文档 RAG 技术栈带来的变化

对于任何在扫描件、备案文件、图表或表格之上构建检索系统的人来说,实际的变化在于:开放视觉文档检索的质量上限刚刚被抬高了,而且是被一个如今横跨三个性价比档位的模型家族所抬高。不过,检索器只能帮你拿到页面。真正阅读这些页面并撰写答案的模型,是另一个独立的决策,而正是在这一层,路由才真正体现出价值:OrcaRouter 以供应商列表价格、0%加成,通过一个API接入200多个模型,因此你检索器背后的阅读模型可以在不重写代码的情况下随时更换,而且任何被路由模型的价格下调,都会在公告当天立即生效。当检索这一半还是全新、未经充分验证的检查点时,这种分离就显得更加重要——你可以采用EVIE-8B进行索引,同时将生成层保留在一个不会让你绑定任何单一模型的接口之后。

接下来看什么

三件事能让这次安静的仓库发布变成一个尘埃落定的故事。第一,独立的复现实验:在腾讯以外的人复现ViDoRe和JinaVDR的数据之前,EVIE-8B的"排名第一"和旧预览版的"排名第一"都只是自我报告的说法,而且这两者恰好还相互矛盾。第二,承诺的论文和消融实验——4096维的选择、权重混合检查点,以及蒸馏方案,目前都只是断言,缺少相应的论文来支撑。第三,命名问题:随着EVIE-4.5B如今占据了EVIE-Preview-4.5B三周前的位置,腾讯是继续保留"Preview"产品线,还是将其并入改名后的家族,这个问题悬而未决。考虑到这样的发布节奏——三周内三个视觉文档检索检查点——更有用的假设是,这条产品线正在被大力投入,而安静的发布是实验室赶在论文之前先出货的方式。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube