Ein Hero-Titelbild für den Vergleich 'EVIE-8B vs EVIE-Preview-4.5B' mit dem Untertitel 'Ein Punktezuwachs von 1,39 für 32x breitere Vektoren', das ein flaches Zwei-Panel-Layout zeigt: links einen hohen Stapel Dokumentseiten neben einem 4096D-Label, rechts eine kompakte Dokumentseite neben einem kleinen Festplatten-Symbol mit einem 128D-Label, mittig zwischen den Panels eine dünne Balkenwaagen-Linie, den Fußzeilentext 'Mit welchem visuellen Dokumenten-Retriever von Tencent sollten Sie indexieren?' sowie das OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

EVIE-8B vs EVIE-Preview-4.5B: Ein Gewinn von 1,39 Punkten für 32× breitere Vektoren

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Drei Wochen nachdem Tencent EVIE-Preview-4.5B veröffentlicht und es als den genauesten visuellen Dokumenten-Retriever auf den ViDoRe-Bestenlisten bezeichnet hatte, veröffentlichte Tencent EVIE-8B und verschob leise die Torpfosten, auf denen sein eigenes 128-dimensionales Modell gestanden hatte. EVIE-8B ist das 8,41B schwere Flaggschiff-Lehrermodell mit 4096-dimensionalen Einbettungen pro Token; EVIE-Preview-4.5B ist der kompakte 4,54B-Retriever, dessen ganzes Verkaufsargument darin bestand, dass 128 Dimensionen ausreichen, um Modelle zu schlagen, die viermal so groß sind. Auf der aktualisierten Bestenliste in der EVIE-8B-Karte liegt EVIE-Preview-4.5B nun auf dem dritten Platz innerhalb seiner eigenen Familie – hinter dem neuen EVIE-8B und hinter EVIE-4.5B, einem Schülermodell, das Tencent am selben Morgen veröffentlicht hat. Wenn Sie sich also entscheiden, mit welchem der beiden genannten Modelle Sie einen Dokumentenkorpus indexieren, besagen die Zahlen auf Tencents Karten, dass das 8B auf ViDoRe V3 etwa 1,39 Punkte besser ist und auf ViDoRe V2 3,36 Punkte besser – und dass es 32-mal mehr Indexspeicher pro Vektor kostet, um dorthin zu gelangen. Dieser Beitrag behandelt die Frage, ob sich dieser Tausch lohnt, und er beginnt mit dem ehrlichen Vorbehalt, dass beide Bewertungsübersichten von Tencent selbst stammen und keine davon unabhängig reproduziert wurde.

Die Kurzfassung

• Wählen Sie EVIE-8B, wenn die Retrieval-Genauigkeit der Engpass ist und Ihr Korpus klein genug ist, dass die rohe Indexgröße keine Rolle spielt — Sie messen in Tausenden von Seiten, nicht in Millionen, und Sie möchten den besten offenen Retriever, den Tencent veröffentlicht hat.

• Wählen Sie EVIE-Preview-4.5B, wenn Indexkosten, Latenz pro Seite oder GPU-Budget eine echte Einschränkung darstellen — seine 128-dimensionalen Vektoren sind der eigentliche Grund für seine Existenz, und die Genauigkeitslücke zur 8B-Variante ist bei ViDoRe V1 klein und bei V3 moderat.

• Überprüfen Sie beide erneut gegen EVIE-4.5B, bevor Sie sich festlegen: Tencent hat am selben Tag ein Studentenmodell mit zur Laufzeit abschneidbaren Vektoren und Token-Komprimierung veröffentlicht, das beide an der Effizienzgrenze unterbietet, und jeder Vergleich, der es ignoriert, ist bereits überholt.

• Behandeln Sie jede hier genannte Zahl als vom Anbieter gemeldet. EVIE-8B wurde von niemandem außerhalb von Tencent ausgeführt; die Zahlen von EVIE-Preview-4.5B stammen aus Tencents eigenen Reproduktionsskripten.

Worin sie sich tatsächlich unterscheiden

• Parameter — EVIE-8B: 8,41 Mrd. EVIE-Preview-4.5B: 4,54 Mrd.

• Backbone — Qwen3.5-9B mit vollständiger bidirektionaler Attention vs. Qwen3.5-4B mit verschachtelter GatedDeltaNet-Linear-Attention und vollständiger Attention.

• Embedding — 4096-dimensionaler Multi-Vektor pro Token vs. nativer 128-dimensionaler Multi-Vektor pro Token, beide bewertet mit MaxSim-Late-Interaction.

• ViDoRe V1 (10 Aufgaben, nDCG@5) — 92.18 vs 91.73.

• ViDoRe V2 (4 Aufgaben, nDCG@5) — 74.23 vs. 70.87. Dies ist die größte relative Differenz.

• ViDoRe V3 (48 Aufgaben, nDCG@10) — 66,75 vs. 65,36.

• Visual-Token-Budget hinter diesen Schlagzeilenzahlen – 1.024 Token/Seite für das Eval von EVIE-8B gegenüber 1.792 Token/Seite für die Schlagzeilen-Stufe von EVIE-Preview-4.5B (bei ihrer 768-Token-Trainingsstufe erreicht die Preview 64,56).

• Roher BF16-Index pro 1 Mio. Seiten — für EVIE-8B nicht veröffentlicht, im Vergleich zu 179,2 GiB bei 768 Tokens/Seite und 420,5 GiB bei 1.792 für die Vorschau.

• Lizenz und Veröffentlichung — Apache-2.0, stilles Release 2026-09-04 gegenüber Apache-2.0, stilles Release 2026-08-17.

A two-column comparison scoreboard for EVIE-8B vs EVIE-Preview-4.5B: left column EVIE-8B with Params 8.41B, Embedding 4096D, ViDoRe V1 92.18, ViDoRe V2 74.23, ViDoRe V3 66.75 and Index per 1M pages 'not published'; right column EVIE-Preview-4.5B with Params 4.54B, Embedding 128D, ViDoRe V1 91.73, ViDoRe V2 70.87, ViDoRe V3 65.36 and Index per 1M pages 179.2 GiB, with a footer noting both columns come from Tencent's own model cards and neither model is independently reproduced, and the OrcaRouter logo in the bottom-right corner.

Die Anzeigetafel oben gibt dasselbe Bild wieder. Behalten Sie beim Lesen zwei Einschränkungen im Blick: Die Spalte EVIE-8B und die Spalte EVIE-Preview-4.5B stammen von zwei verschiedenen Tencent-Modellkarten, und die V3-Headline-Zahl der 8B wird bei einem niedrigeren visuellen Token-Budget pro Seite gemessen als die Headline-Zahl der Vorschau.

Zwei Tencent-Karten, die miteinander sprechen

Die ehrliche Einordnung dieses Vergleichs ist, dass es sich um einen Familienstreit handelt, nicht um einen unabhängigen Wettbewerb. Die Modellkarte von EVIE-Preview-4.5B, veröffentlicht am 17. August, beansprucht „Rank #1 auf ViDoRe V3“ mit 65,36 nDCG@10 und schlägt damit webAI-ColVec1.1-8b um 0,04. Die Modellkarte von EVIE-8B, veröffentlicht am 4. September, listet dieselbe 65,36 erneut als drittbesten Wert auf der Seite, unter den 66,75 von EVIE-8B und den 66,02 von EVIE-4.5B, und zeigt, dass die 8B bei allen acht öffentlichen ViDoRe-V3-Domänen gegen die Preview gewinnt. Beide Modellkarten wurden mit Tencents eigener Evaluierungsumgebung erstellt, und keines der Modelle hat bisher einen unabhängigen Testlauf in der Fachliteratur. Der Vergleich, den Sie hier lesen, ist also Tencents Bericht darüber, wie Tencent Tencent schlägt – intern konsistent, plausiblerweise absichtlich so konstruiert und von niemandem ohne Eigeninteresse am Ausgang verifiziert.

A screenshot of the Hugging Face model page for tencent/EVIE-8B, showing the Tencent org, the visual-document-retrieval pipeline tag, the colpali-engine, qwen3_5, late-interaction and multi-vector tags, the Apache-2.0 license, and the start of the model card titled 'EVIE-8B: The Most Accurate Visual Document Retriever' (captured September 7, 2026).

Die oben gezeigte tencent/EVIE-8B-Karte ist die öffentliche Oberfläche des Herausforderers: ein 8,41B-Flaggschiff-Lehrer mit 4096D-Embeddings und die aktualisierte ViDoRe-Tabelle der Familie an der Spitze.

A screenshot of the Hugging Face model page for tencent/EVIE-Preview-4.5B, showing the Tencent org, the visual-document-retrieval pipeline tag, the sentence-transformers and ColPali tags, the qwen3_5, late-interaction, multi-vector and vidore tags, and the start of the model card titled 'EVIE-Preview-4.5B' (captured September 7, 2026).

Die tencent/EVIE-Preview-4.5B-Karte oben ist die des bisherigen Spitzenreiters: ein 4.54B-Retriever, dessen native 128D-Vektoren und veröffentlichte Indexkosten-Mathematik weiterhin sein prägendes Merkmal sind.

Die 1,39-Punkte-Frage

Der unbereinigte Abstand auf ViDoRe V3 ist klein – 1,39 nDCG@10-Punkte zwischen EVIE-8Bs 66,75 und EVIE-Preview-4.5Bs 65,36 – und er kommt mit einem Sternchen beim Token-Budget daher, das für den Einsatz relevant ist. EVIE-8Bs Evaluationsprotokoll begrenzt Dokumente auf 1.024 visuelle Token pro Seite; die Preview benötigte 1.792 Token pro Seite, um ihren beworbenen Wert von 65,36 zu erzielen, und erreichte bei ihrem eigenen Trainingsbudget von 768 Token nur 64,56. Bei diesen Zahlen ist die 8B nicht nur genauer bei einem vergleichbaren Budget – sie ist genauer bei einem kleineren, und genau das ist die Richtung, die man für die Latenz pro Seite möchte. Der größere relative Gewinn zeigt sich auf ViDoRe V2, wo EVIE-8B 74,23 gegenüber 70,87 der Preview meldet – ein Sprung von 3,36 Punkten auf der Tafel, die auch die schwierigeren synthetischen Dokumentaufgaben umfasst. ViDoRe V1, die älteste und am stärksten gesättigte Tafel, bewegt sich kaum: 92,18 gegenüber 91,73. Dieses Muster – flach, wo alle ohnehin nahe der Decke liegen, entscheidend, wo die Aufgaben neuer und schwieriger sind – ist das Profil einer echten Leistungssteigerung statt Leaderboard-Rauschen, aber es ist immer noch Tencents eigene Messung davon.

Der Index ist der wahre Gegner.

Genauigkeit ist nur die halbe Entscheidung, denn die beiden Modelle machen radikal unterschiedliche Versprechungen darüber, was Sie speichern. EVIE-Preview-4.5B verdankt seine Existenz seinem nativen 128-dimensionalen Token-Vektor: Die Modellkarte veröffentlicht die exakte Index-Mathematik (179,2 GiB roher BF16-Index pro Million Seiten bei seinem Trainingsbudget, 420,5 GiB in der extrapolierten Stufe) und weist darauf hin, dass ein schmalerer Vektor Speicher- und MaxSim-Scoring-Aufwand direkt proportional reduziert. Die Token-Vektoren von EVIE-8B sind 4096-dimensional – 32-mal breiter pro Vektor – und die Modellkarte von EVIE-8B veröffentlicht überhaupt keine Zahl zur Indexgröße. Diese Auslassung ist selbst eine Information: Bei gleicher Tokenzahl pro Seite ist ein roher BF16-Index von EVIE-8B etwa 32-mal so groß wie der der Vorschauversion, was einen Korpus mit einer Million Seiten vor der Quantisierung in den Multi-Terabyte-Bereich bringt und das Flaggschiff zu etwas macht, das man für ein paar hunderttausend Seiten einsetzt, nicht etwas, das man beiläufig in großem Maßstab hostet. Die Breite des Flaggschiffs erkauft Retrieval-Genauigkeit; sie erkauft keine Bereitstellbarkeit.

Die dritte Option, die Tencent am selben Tag auslieferte.

Keine ehrliche Fassung dieses Vergleichs bleibt bei den beiden genannten Modellen stehen, denn das Release, das EVIE-8B enthielt, enthielt auch EVIE-4.5B: ein 4,61B-Schülermodell, destilliert aus dem 8B-Lehrermodell, mit einer einzigen 2048-dimensionalen Projektion, die zur Laufzeit auf 64, 128, 256, 512, 1024 oder 2048 Dimensionen gekürzt wird, sowie einem trainingsfreien Token-Komprimierungsschritt namens HAC, der die visuellen Token einer Seite auf 32–64 Vektoren bündelt; laut Modellkarte hat es zudem einen Index-Fußabdruck von 3,81 GiB pro Million Seiten. In Tencents eigener Tabelle erzielt EVIE-4.5B 66,02 bei ViDoRe V3 – nur 0,73 hinter dem 8B-Lehrer und 0,66 vor EVIE-Preview-4.5B – was es zur Antwort auf genau das Dilemma macht, das dieser Vergleich aufwirft. Wenn man also „den Großteil der Genauigkeit des 8B ohne den Index des 8B“ haben möchte, hat Tencent dieses Modell bereits ausgeliefert – und es ist keines der beiden, nach denen diese Seite benannt ist. Das verbleibende Argument für EVIE-Preview-4.5B ist schmal, aber real: Es ist der Checkpoint, der bei allen, die ihn im August ausgerollt haben, bereits in Produktion ist, und sein festes 128D-Profil ist einfacher nachzuvollziehen als eine Matrjoschka, die einen auffordert, die Dimension zur Laufzeit zu wählen.

Womit sollten Sie indizieren?

Ordnen Sie das Modell der tatsächlich bindenden Randbedingung zu.

• Verwenden Sie EVIE-8B für den Index, wenn Sie den Genauigkeits-Referenzpunkt aufbauen — ein Benchmark, ein hochwertiges Rechts- oder Wissenschaftskorpus mit Hunderttausenden Seiten oder ein System, bei dem Fehltreffer beim Retrieval teuer und Speicherplatz günstig ist. Sie zahlen für die Spitze der Kurve der Modellfamilie, und die Familie sieht das 4.5B-Studentenmodell als das vor, das Sie später skalieren.

• Bleiben Sie bei EVIE-Preview-4.5B, wenn Sie bereits damit indexiert haben und die gemessene Qualität akzeptabel ist — eine erneute Indexierung verursacht echte Kosten, und der V3-Gewinn, den Sie anstreben, beträgt 1,39 Punkte auf einer Anbieterkarte, die niemand unabhängig bestätigt hat.

• Bewerten Sie EVIE-4.5B vor beiden, wenn Sie bei sinnvoller Größenordnung neu beginnen. Die Prefix-MRL-Trunkierung und die HAC-Kompression zielen direkt auf die obige Speicherarithmetik ab, und Tencents eigene Zahlen bringen es in Schlagdistanz zum Lehrermodell.

Keines der drei hat eine gehostete API auf irgendeiner Plattform, einschließlich OrcaRouter, daher ist die Retrieval-Phase in jedem Fall eine Self-Hosting-Entscheidung. Die darauffolgende Stufe muss das nicht sein. Ein Router wie der, den OrcaRouter über 200+ Modelle betreibt, hält das Modell, das Ihre abgerufenen Seiten liest und die Antwort verfasst, hinter einer einzigen API mit automatischem Failover über Anbieter hinweg, wobei die Listenpreise der Anbieter mit 0 % Aufschlag durchgereicht werden – genau das Setup, das Sie möchten, wenn der Retriever, der es speist, ein drei Tage alter Checkpoint mit unbestätigten Behauptungen ist. Bauen Sie den Index mit dem Retriever, der zu Ihrem Speicher passt, und halten Sie den Rest der Pipeline austauschbar, bis jemand außerhalb von Tencent bestätigt, welche dieser Scorecards echt ist.