Ein Hero-Titelbild für den Nachrichtenartikel „EVIE-8B“ mit dem Untertitel „Tencent veröffentlicht leise seinen bisher genauesten visuellen Dokument-Retriever“, das eine flache redaktionelle Illustration einer Lupe über einem Stapel Dokumentseiten zeigt (eine Seite mit einer kleinen Datentabelle, eine andere mit einem einfachen Liniendiagramm), aus denen kleine quadratische Token-Vektoren zu einem 4096D-Pill-Tag fließen, mit dem Fußzeilentext „Still veröffentlicht am 4. September 2026 — Gewichte auf Hugging Face, noch keine Ankündigung“ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

EVIE-8B: Tencent bringt still und leise seinen bislang genauesten visuellen Dokument-Retriever auf den Markt

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Vor drei Wochen war Tencents EVIE-Preview-4.5B der genaueste offene visuelle Dokumenten-Retriever auf den ViDoRe-Leaderboards – gestützt auf Zahlen, die Tencent selbst gemeldet hatte. Am 4. September ersetzte Tencent dieses Modell stillschweigend an der Spitze seines eigenen Leaderboards – nicht durch einen externen Herausforderer, sondern durch einen größeren Ableger, der am selben Morgen veröffentlicht wurde. EVIE-8B, ein Late-Interaction-Retriever mit 8,41 Milliarden Parametern auf einem Qwen3.5-9B-Backbone mit 4096-dimensionalen Token-Embeddings, wurde als Gewichte plus Code auf Hugging Face und GitHub veröffentlicht – ohne Ankündigung, ohne Blogbeitrag und ohne Paper. Ein dritter Checkpoint, EVIE-4.5B, erschien in derselben Minute und steht nun zwischen den beiden. Alle mit dieser Veröffentlichung verbundenen Behauptungen – die Werte, die Architektur, sogar der Zweck der Modelle – beruhen derzeit allein auf dem, was Tencents eigene Repositories sagen, denn niemand außerhalb von Tencent hat bisher etwas über EVIE-8B veröffentlicht. Das ist das, was sich dem Repo tatsächlich entnehmen lässt, und das, was noch nicht bestätigt ist.

Was Tencent am 4. September veröffentlicht hat

Am 04.09.2026 erschienen in der tencent-Organisation auf Hugging Face im Abstand von etwa einer Minute zwei neue Repositories: tencent/EVIE-8B und tencent/EVIE-4.5B. Parallel dazu ging ein konsolidiertes GitHub-Repository, Tencent/EVIE, online, das den Trainingscode, die ColQwen3.5-Inferenz-Engine und die Evaluierungsumgebung für 138 Aufgaben enthält. Beide Modell-Repositories sind unter Apache-2.0 lizenziert, nutzen die Bibliothek colpali-engine und tragen das Tag für die visuelle Dokumenten-Retrieval-Pipeline. Das ältere EVIE-Preview-4.5B vom 17. August bleibt unter dem Namen „Preview“ auf Hugging Face, ist aber nicht mehr das Flaggschiff der Familie: In der aktualisierten Bestenliste in der EVIE-8B-Modellkarte listet Tencent drei eigene Checkpoints ganz oben auf — EVIE-8B mit 66.75 ViDoRe V3 nDCG@10, EVIE-4.5B mit 66.02 und EVIE-Preview-4.5B mit 65.36.

Es hat nirgendwo eine Ankündigung gegeben. Der Release-Hinweis zur EVIE-8B-Modellkarte besagt, dass die Gewichte, Inferenzpipelines und Evaluierungssuiten als Open Source veröffentlicht werden, und ergänzt: „Vollständige technische Details, architektonische Ablationen und das formale Forschungspapier werden in einem kommenden Release aktualisiert.“ Das GitHub-Repository hatte zum Zeitpunkt des Schreibens vier Commits und keine Releases. Keines der neuen Repos zeigt bisher eine nennenswerte Adoption – keine Community-Forks mit unabhängigen Ergebnissen, keine Evaluierungen durch Dritte, und die Download-Zähler stehen zwei Tage nach der öffentlichen Freigabe der Repos weiterhin bei nahezu null. Angesichts dieser Indizien handelt es sich um ein Release von Tencent nach dem Motto „Erst die Gewichte, dann das Papier“ – in demselben unauffälligen Stil, den das Labor im August bei EVIE-Preview-4.5B und UI-Mate-9B verwendete.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

Die oben gezeigte Modellkarte von tencent/EVIE-8B ist die öffentliche Oberfläche des Releases: ein Visual-Document-Retrieval-Checkpoint, der für die colpali-engine-Bibliothek getaggt ist, unter Apache-2.0-Lizenz, mit einem 4096-dimensionalen Late-Interaction-Embedding und der eigenen aktualisierten ViDoRe-Tabelle der Familie weit oben auf der Karte.

EVIE-8B, der Flaggschiff-Lehrer

Architektonisch gehört EVIE-8B zur ColPali/ColBERT-Familie der Late-Interaction-Modelle. Anstatt eine Seite zu einem einzigen Embedding-Vektor zu verdichten – was der verlustbehaftete Schritt des Single-Vektor-Dense-Retrievals ist – führt es ein Vision-Language-Backbone über das Seitenbild aus und behält eine Multi-Vektor-Repräsentation pro Token bei. Anschließend bewertet es die Relevanz mit dem MaxSim-Operator: Jeder Query-Token nimmt seinen besten Treffer über alle Tokens der Seite, und diese Maxima summieren sich zum Relevanzwert. EVIE-8B trifft dabei spezifische Entscheidungen: ein Qwen3.5-9B-Backbone mit voller bidirektionaler Aufmerksamkeit (das Modell ist encoderisiert, daher ist die kausale Maske über die gesamte Vision-Text-Sequenz hinweg deaktiviert) sowie eine breite 4096-dimensionale Projektion pro Token. Der Sinn der Breite liegt in der Detailtreue: Räumliches Layout, Typografie, Diagrammstruktur und tabellarische Beziehungen bleiben in der Repräsentation erhalten, anstatt weggemittelt zu werden.

Tencent positioniert EVIE-8B ausdrücklich als den "Flaggschiff-Lehrer". Das EVIE-4.5B-Schülermodell wird aus dem 8B-Modell mit einem Rezept trainiert, das Tencent EVIE-ARD nennt – eine ankererhaltende, kapazitätsbewusste Relations-Distillation, die die Topologie der Token-Relationen überträgt und eine Hard-Negative-Margin-Supervision verwendet. Mit anderen Worten hat das 8B-Modell zwei Aufgaben: die Genauigkeitsobergrenze für die Produktlinie festzulegen und als Qualitätsanker zu dienen, aus dem das kompakte Schülermodell destilliert wird. Für das Training berichtet die Modellkarte von 775.635 Dokument-Abfrage-Paaren, wobei durch Mining gewonnene Hard Negatives von einem multimodalen Richter neu bewertet werden, der beantwortbare Kandidaten zu Positiven hochstuft, mehrdeutige aus der Verlustfunktion ausblendet und nur strikt irrelevante Seiten als echte Negative behält. Der veröffentlichte "a40"-Checkpoint ist selbst eine Gewichtsraum-Mischung zweier unabhängig trainierter Modelle, bei α = 0,40.

Die Punktetafel, die Tencent sich selbst schrieb

Alle unten aufgeführten Zahlen wurden vom Anbieter gemeldet. Sie stammen aus Tencents eigenem Modellblatt und wurden mit der Evaluationsumgebung erzeugt, die Tencent in seinem Repository bereitstellt; keine davon wurde unabhängig reproduziert, und EVIE-8B wurde noch von niemandem außerhalb des Labors ausgeführt.

• Parameter / Backbone — 8.41B, Qwen3.5-9B, bidirektionale vollständige Aufmerksamkeit.

• Embedding — 4096-dimensionaler Multi-Vektor pro Token, MaxSim-Late-Interaction.

• ViDoRe V1 (10 Aufgaben, nDCG@5) — 92,18.

• ViDoRe V2 (4 Aufgaben, nDCG@5) — 74,23.

• ViDoRe V3 (48 Aufgaben, nDCG@10) — 66,75, mit einem Pro-Domänen-Sweep behauptet die Karte, alle acht öffentlichen Domänen zu gewinnen.

• JinaVDR (76 Aufgaben, nDCG@10) — 83,30; Makro-Durchschnitt nDCG@10 über vier Boards — 79,51 bei der 138-Aufgaben-Suite.

• Lizenz — Apache-2.0; Gewichte, Inferenz und Evaluierungscode offen.

A single-column scoreboard for EVIE-8B reading: Params 8.41B, Backbone Qwen3.5-9B, Embedding 4096D per token, ViDoRe V1 (nDCG@5) 92.18, ViDoRe V3 (nDCG@10) 66.75, License Apache-2.0, with a footer noting all figures are vendor-reported from the tencent/EVIE-8B card and not independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Die interessanteste Zeile in Tencent-Tabelle ist die, in der Tencent gegen Tencent gewinnt. Die EVIE-Preview-4.5B-Karte vom August beanspruchte mit 65,36 nDCG@10 „Rang #1 auf ViDoRe V3" und lag damit knapp vor webAI-ColVec1.1-8b mit 65,32. In der aktualisierten Tabelle innerhalb der EVIE-8B-Karte belegt derselbe Wert von 65,36 nun den dritten Platz insgesamt, hinter EVIE-8B mit 66,75 und EVIE-4.5B mit 66,02. Die Aufschlüsselung nach Domänen bei EVIE-8B übertrifft die alte Vorschau in allen acht öffentlichen ViDoRe-V3-Domänen – CompSci 81,86 gegenüber 80,65, Finance EN 71,23 gegenüber 70,50, Pharma 70,81 gegenüber 69,20 und so weiter – was einem durchschnittlichen Zuwachs von 1,39 Punkten entspricht. Ob dieser Zuwachs einem unabhängigen Lauf standhält, ist genau die offene Frage; doch die interne Konsistenz ist erwähnenswert, denn ein Lehrer, der seinen eigenen Schüler nicht schlagen kann, wäre eine seltsame Sache, die man ausliefert.

A family graphic titled 'Three EVIE checkpoints, one self-published leaderboard' showing three stacked rows each with a ViDoRe V3 nDCG@10 value: EVIE-8B 66.75 with a gold rank-1 badge and the tag '4096D teacher', EVIE-4.5B 66.02 with a silver rank-2 badge and the tag 'Prefix-MRL student', and EVIE-Preview-4.5B 65.36 with a bronze rank-3 badge and the tag '128D preview', with a footer noting the ranking is vendor-reported from the EVIE-8B card of September 4, 2026, and the OrcaRouter logo in the bottom-right corner.

Die obige Grafik der Modellfamilie gibt die Drei-Checkpoint-Rangliste wieder, die Tencent am 4. September in der EVIE-8B-Modellkarte veröffentlicht hat — EVIE-8B bei 66,75, EVIE-4.5B bei 66,02, EVIE-Preview-4.5B bei 65,36 im ViDoRe-V3-nDCG@10 — wobei die 128D-Vorschau durch den 4096D-Teacher und den Prefix-MRL-Studenten ersetzt wird.

Warum das Flaggschiff nicht das Bereitstellungsmodell ist.

Es gibt einen Grund, warum der Genauigkeitsspitzenreiter als Lehrer und nicht als Standard bezeichnet wird. Die Breite kostet Speicher und Rechenleistung beim Scoring, und 4096 Dimensionen pro Token sind sehr breit. In BF16 ist ein einzelner EVIE-8B-Token-Vektor vor jeglicher Quantisierung 8 KiB groß, und eine dichte Seite kann Hunderte von Token-Vektoren erzeugen – das eigene Evaluierungsprotokoll der Modellkarte begrenzt Dokumente auf 1.024 visuelle Token pro Seite. Tencent veröffentlicht keine Indexgrößenangabe für EVIE-8B, was auffällig ist, weil die Modellkarte von EVIE-Preview-4.5B genaue Werte für ihren 128-dimensionalen Index veröffentlichte: 179,2 GiB roher BF16-Index pro Million Seiten bei einem Trainingsbudget von 768 Tokens, 420,5 GiB bei der extrapolierten Stufe mit 1.792 Tokens. Vektor für Vektor sind die Einbettungen von EVIE-8B 32-mal breiter als die der Vorschauversion, sodass ein roher EVIE-8B-Index bei gleichem Token-Budget einen Multi-Terabyte-Bereich pro Million Seiten erreicht – bevor das Retrieval-System, das den Index im RAM halten muss, überhaupt zur Sprache gekommen ist.

Die zeitgleiche Veröffentlichung von EVIE-4.5B ist der Hinweis darauf, wie Tencent erwartet, dass diese Spannung aufgelöst wird. EVIE-4.5B ist das 4,61B-Studentenmodell mit einer einzelnen 2048-dimensionalen Projektion, die zur Laufzeit auf 64, 128, 256, 512, 1024 oder 2048 Dimensionen gekürzt wird (Tencent nennt das Schema Prefix-MRL), ergänzt um einen trainingsfreien Token-Komprimierungsschritt namens HAC, der die rund 750 visuellen Token einer Seite zu 32–64 Vektoren zusammenfasst. Tencent nennt für dieses Modell als zentrale Kennzahl einen Index-Fußabdruck von 3,81 GiB pro Million Seiten – eine Zahl, die wie alle übrigen Angaben vom Anbieter stammt. Zusammengenommen wirkt die Veröffentlichung weniger wie „ein neues 8B-Modell“ und eher wie eine bewusst zusammengestellte Familie: Das 8B-Modell setzt die Obergrenze und trainiert das Studentenmodell, und genau das Studentenmodell ist dasjenige, das dafür dimensioniert ist, tatsächlich hinter einem Produktionsindex zu sitzen.

So führen Sie EVIE-8B heute aus

EVIE-8B wird nur als Gewichte ausgeliefert. Es gibt keine gehostete API auf irgendeiner Plattform – einschließlich OrcaRouter –, daher ist der einzige Weg heute, den Checkpoint selbst zu hosten und ihn über den ColQwen3.5-Pfad in colpali-engine auszuführen. Der Schnellstart der Karte ist kurz: Modell in BF16 mit Flash-Attention laden, enable_bidirectional_attention() aufrufen, die Seitenbilder und die Textabfrage einbetten und dann mit dem MaxSim des Prozessors bewerten. Der bidirektionale Schritt ist keine optionale Deko – veröffentlichte colpali-engine-Builds erstellen ColQwen3.5 standardmäßig mit kausalen Masken, und die Karte des Vorschaumodells dokumentierte, dass das Belassen der Maske etwa 1,1 Punkte beim Top-Treffer-MaxSim kostet. Derselbe Helfer wird auch für EVIE-8B mitgeliefert. Ein BF16-Checkpoint mit 8,41B Parametern liegt nach der Faustregel von zwei Bytes pro Parameter in der Größenordnung von etwa 17 GB Gewichten, also ist dies eher ein Fall für eine einzelne GPU mit Headroom als ein Edge-Modell, und der Korpus lebt dort, wo du den Index aufbewahrst, nicht auf dem Modell.

Was EVIE-8B für einen Dokument-RAG-Stack verändert

Für alle, die Retrieval über Scans, Einreichungen, Diagramme oder Formulare aufbauen, hat sich praktisch Folgendes geändert: Die Qualitätsobergrenze für offenes visuelles Dokumenten-Retrieval hat sich gerade verschoben – und zwar innerhalb einer Familie, die nun drei Preis-Leistungs-Stufen abdeckt. Ein Retriever liefert Ihnen allerdings nur die Seiten. Das Modell, das diese Seiten liest und die Antwort generiert, ist eine separate Entscheidung – und genau auf dieser Ebene zahlt sich Routing aus: OrcaRouter stellt eine einzige API für über 200 Modelle zum Listenpreis der Anbieter mit 0 % Aufschlag bereit, sodass das Lesemodell hinter Ihrem Retriever ohne Neuschreiben ausgetauscht werden kann und eine Preissenkung eines Anbieters für ein geroutetes Modell noch am selben Tag aktiv ist, an dem sie angekündigt wird. Diese Trennung ist umso wichtiger, wenn die Retrieval-Seite ein brandneuer, unbewährter Checkpoint ist – Sie können EVIE-8B für die Indexierung übernehmen und die Generierungsebene gleichzeitig hinter einer Schnittstelle belassen, die Sie nicht an ein einzelnes Modell koppelt.

Was als Nächstes ansehen

Drei Dinge würden aus diesem stillen Repo-Drop eine gefestigte Geschichte machen. Erstens ein unabhängiger Durchlauf: Solange niemand außerhalb von Tencent die ViDoRe- und JinaVDR-Zahlen reproduziert, sind sowohl die „rank #1“-Meldung von EVIE-8B als auch die des alten Previews selbstberichtete Behauptungen, die zufällig im Widerspruch zueinander stehen. Zweitens das versprochene Paper samt Ablationsstudien – die Wahl der 4096 Dimensionen, der Weight-Mix-Checkpoint und das Destillationsrezept sind derzeit allesamt Behauptungen ohne die schriftliche Ausarbeitung, die sie untermauert. Drittens die Namensgebung: Da EVIE-4.5B nun den Platz einnimmt, den EVIE-Preview-4.5B vor drei Wochen innehatte, ist es eine offene Frage, ob Tencent die „Preview“-Linie weiterführt oder sie in die umbenannte Familie aufgehen lässt. Angesichts des Rhythmus – drei Visual-Document-Retrieval-Checkpoints in drei Wochen – ist die sinnvollere Annahme, dass in diese Linie hart investiert wird und die stillen Releases die Art des Labs sind, vor dem Paper auszuliefern.