
EVIE-8B vs EVIE-Preview-4.5B: wzrost o 1,39 punktu przy 32× szerszych wektorach
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Trzy tygodnie po tym, jak Tencent wypuścił EVIE-Preview-4.5B i nazwał go najdokładniejszym wizualnym retrieverem dokumentów na listach ViDoRe, Tencent wypuścił EVIE-8B i po cichu przesunął poprzeczkę, na której stał jego własny model o 128 wymiarach. EVIE-8B to flagowy nauczyciel o wielkości 8,41B z 4096-wymiarowymi embeddingami dla każdego tokenu; EVIE-Preview-4.5B to kompaktowy retriever o wielkości 4,54B, którego całym przekazem było to, że 128 wymiarów wystarczy, aby pokonać modele cztery razy większe. Na odświeżonej liście liderów w karcie EVIE-8B, EVIE-Preview-4.5B zajmuje teraz trzecie miejsce we własnej rodzinie — za nowym EVIE-8B i za EVIE-4.5B, uczniem, którego Tencent wypuścił tego samego ranka. Jeśli wybierasz, który z tych dwóch wymienionych modeli wykorzystać do indeksowania korpusu dokumentów, liczby na kartach Tencenta wskazują, że model 8B jest o około 1,39 punktu lepszy na ViDoRe V3 i o 3,36 punktu lepszy na ViDoRe V2 — a osiągnięcie tego kosztuje 32 razy więcej miejsca w indeksie na wektor. Ten artykuł dotyczy tego, czy ten kompromis jest wart zachodu, i zaczyna się od uczciwego zastrzeżenia, że obie karty wyników są dziełem samego Tencenta i żadna z nich nie została niezależnie odtworzona.
Krótka wersja
• Wybierz EVIE-8B, jeśli dokładność wyszukiwania jest wąskim gardłem, a Twój zbiór tekstów jest na tyle mały, że rozmiar surowego indeksu nie ma znaczenia — mierzysz w tysiącach stron, nie w milionach, i chcesz najlepszego otwartego retrievera opublikowanego przez Tencent.
• Wybierz EVIE-Preview-4.5B, jeśli koszt indeksu, opóźnienie na stronę lub budżet GPU jest realnym ograniczeniem — jego 128-wymiarowe wektory są całym powodem jego istnienia, a różnica w dokładności względem 8B jest niewielka na ViDoRe V1 i umiarkowana na V3.
• Sprawdź ponownie oba względem EVIE-4.5B, zanim się zobowiążesz: Tencent wydał tego samego dnia model ucznia z wektorami skracalnymi w czasie działania i kompresją tokenów, który podcina oba na granicy wydajności, a każde porównanie, które go ignoruje, jest już nieaktualne.
• Traktuj każdą liczbę tutaj jako deklarację producenta. EVIE-8B nie była uruchamiana przez nikogo spoza Tencent; wyniki EVIE-Preview-4.5B pochodzą ze skryptów reprodukcyjnych samego Tencent.
Gdzie faktycznie się różnią
• Parametry — EVIE-8B: 8.41B. EVIE-Preview-4.5B: 4.54B.
• Szkielet — Qwen3.5-9B z pełną dwukierunkową uwagą vs Qwen3.5-4B z przeplataną uwagą liniową GatedDeltaNet i pełną uwagą.
• Embedding — 4096-wymiarowy multi-wektor per token vs natywny 128-wymiarowy multi-wektor per token, oba oceniane za pomocą późnej interakcji MaxSim.
• ViDoRe V1 (10 zadań, nDCG@5) — 92.18 vs 91.73.
• ViDoRe V2 (4 zadania, nDCG@5) — 74.23 vs 70.87. To największa względna różnica.
• ViDoRe V3 (48 zadań, nDCG@10) — 66,75 vs 65,36.
• Budżet tokenów wizualnych stojący za tymi liczbami z nagłówków — 1 024 tokeny na stronę w ewaluacji EVIE-8B wobec 1 792 tokenów na stronę w głównym wariancie EVIE-Preview-4.5B (na poziomie treningu z 768 tokenami wersja preview osiąga 64,56).
Surowy indeks BF16 na 1M stron — dla EVIE-8B nie opublikowano; dla wersji zapoznawczej wynosi on 179,2 GiB przy 768 tokenach na stronę i 420,5 GiB przy 1 792 tokenach na stronę.
• Licencja i wydanie — Apache-2.0, ciche wydanie 2026-09-04 vs Apache-2.0, ciche wydanie 2026-08-17.

Powyższa tabela wyników przedstawia ten sam obraz. Czytając ją, miej na uwadze dwa zastrzeżenia: kolumny EVIE-8B i EVIE-Preview-4.5B pochodzą z dwóch różnych kart modeli Tencent, a główna liczba V3 dla modelu 8B jest mierzona przy niższym budżecie tokenów wizualnych na stronę niż główna liczba dla wersji preview.
Dwie karty Tencent rozmawiające ze sobą.
Uczciwe ujęcie tego pojedynku to stwierdzenie, że jest to kłótnia rodzinna, a nie niezależny konkurs. Karta samego EVIE-Preview-4.5B, opublikowana 17 sierpnia, twierdzi, że osiąga „Rank #1 on ViDoRe V3" z wynikiem 65.36 nDCG@10, pokonując webAI-ColVec1.1-8b o 0.04. Karta EVIE-8B, opublikowana 4 września, ponownie podaje to samo 65.36 jako trzeci najlepszy wynik na stronie, poniżej 66.75 EVIE-8B i 66.02 EVIE-4.5B, i pokazuje, że 8B wygrywa we wszystkich ośmiu publicznych domenach ViDoRe V3 z wersją preview. Obie karty wyników powstały przy użyciu własnego harnessu ewaluacyjnego Tencenta, a żaden z modeli nie doczekał się jeszcze niezależnego przebiegu ewaluacji nigdzie w literaturze. Zatem porównanie, które czytasz, to relacja Tencenta o Tencente pokonującym Tencenta — wewnętrznie spójna, prawdopodobnie celowo tak skonstruowana i niezweryfikowana przez nikogo, kto nie ma interesu w wyniku.

Powyższa karta tencent/EVIE-8B to publiczna wizytówka pretendenta: flagowy nauczyciel o 8.41B parametrów z embeddingami 4096D i odświeżoną tabelą ViDoRe rodziny na górze.

Karta tencent/EVIE-Preview-4.5B powyżej należy do obecnego lidera: retrievera o 4,54 mld parametrów, którego natywne wektory 128D i opublikowane wyliczenia kosztów indeksowania wciąż stanowią jego cechę definiującą.
Pytanie za 1,39 punktu.
Surowa różnica na ViDoRe V3 jest niewielka — 1,39 punktu nDCG@10 między 66,75 EVIE-8B a 65,36 EVIE-Preview-4.5B — ale towarzyszy jej gwiazdka dotycząca budżetu tokenów, która ma znaczenie dla wdrożenia. Protokół ewaluacyjny EVIE-8B ogranicza dokumenty do 1024 tokenów wizualnych na stronę; wersja preview potrzebowała 1792 tokenów na stronę, by osiągnąć swój raportowany wynik 65,36, a przy własnym budżecie treningowym wynoszącym 768 tokenów uzyskała tylko 64,56. Na podstawie tych liczb model 8B jest nie tylko dokładniejszy przy porównywalnym budżecie — jest dokładniejszy przy mniejszym, co jest pożądanym kierunkiem w kontekście opóźnień na stronę. Większa względna przewaga jest na ViDoRe V2, gdzie EVIE-8B podaje 74,23 wobec 70,87 wersji preview, czyli skok o 3,36 punktu w rankingu obejmującym trudniejsze syntetyczne zadania dokumentowe. ViDoRe V1, najstarszy i najbardziej nasycony ranking, ledwo się zmienia: 92,18 wobec 91,73. Taki wzorzec — płaski tam, gdzie wszyscy są już blisko sufitu, a wyraźny tam, gdzie zadania są nowsze i trudniejsze — to profil rzeczywistego wzrostu możliwości, a nie szumu rankingowego, ale wciąż jest to pomiar dokonany przez samo Tencent.
Indeks jest prawdziwym przeciwnikiem.
Dokładność to tylko połowa tej decyzji, bo te dwa modele radykalnie różnią się obietnicami co do tego, co przechowujesz. Racją bytu EVIE-Preview-4.5B jest jego natywny 128-wymiarowy wektor tokenów: karta modelu publikuje dokładne wyliczenia indeksu (179.2 GiB surowego indeksu BF16 na milion stron przy jego budżecie treningowym, 420.5 GiB na poziomie ekstrapolowanym) i wskazuje, że węższy wektor proporcjonalnie zmniejsza pamięć potrzebną na indeks oraz koszt obliczeń MaxSim. Wektory tokenów EVIE-8B są 4096-wymiarowe — 32 razy szersze na wektor — a karta EVIE-8B nie podaje żadnej liczby dotyczącej rozmiaru indeksu. To pominięcie samo w sobie jest informacją: przy tej samej liczbie tokenów na stronę surowy indeks BF16 EVIE-8B jest około 32 razy większy niż indeks wersji podglądowej, co przy milionie stron daje przed kwantyzacją rozmiary wieloterabajtowe i sprawia, że flagowy model jest czymś, co kierujesz do kilkuset tysięcy stron, a nie czymś, co ot tak hostujesz na dużą skalę. Szerokość flagowego modelu zapewnia wierność wyszukiwania; nie zapewnia natomiast możliwości wdrożenia.
Trzecia opcja, którą Tencent wydał tego samego dnia
Żadna uczciwa wersja tego porównania nie kończy się na dwóch wymienionych modelach, ponieważ w wydaniu, w którym znalazł się EVIE-8B, znalazł się także EVIE-4.5B – uczeń o 4,61 mld parametrów, wydestylowany z 8-miliardowego nauczyciela, z pojedynczą projekcją o 2048 wymiarach, przycinaną w trakcie działania do 64, 128, 256, 512, 1024 lub 2048 wymiarów, a także z niewymagającym uczenia etapem kompresji tokenów, który Tencent nazywa HAC i który grupuje wizualne tokeny strony do 32–64 wektorów, oraz – według karty modelu – z rozmiarem indeksu 3,81 GiB na milion stron. We własnej tabeli Tencenta EVIE-4.5B uzyskuje w ViDoRe V3 wynik 66,02 – tylko 0,73 za nauczycielem EVIE-8B i 0,66 przed EVIE-Preview-4.5B – co czyni go odpowiedzią na dokładnie ten dylemat, który stawia to zestawienie. Jeśli zależy ci na „większości dokładności 8B bez indeksu 8B”, Tencent już wypuścił taki model i nie jest to żaden z dwóch modeli, o których mowa w tytule tej strony. Pozostały argument przemawiający za EVIE-Preview-4.5B jest wąski, ale realny: to checkpoint, który każdy, kto wdrożył go w sierpniu, ma już na produkcji, a jego stały profil 128D jest łatwiejszy do zrozumienia niż matrioszka, która każe wybierać wymiar w trakcie działania.
Którym powinieneś indeksować?
Dopasuj model do ograniczenia, które faktycznie jest wiążące:
• Indeksuj w EVIE-8B, jeśli budujesz punkt odniesienia dla dokładności — benchmark, wysokowartościowy korpus prawniczy lub naukowy liczący setki tysięcy stron, albo system, w którym chybienia w wyszukiwaniu są kosztowne, a przechowywanie danych jest tanie. Płacisz za szczyt krzywej rodziny, a rodzina zakłada, że to właśnie student 4.5B będzie tym, co skalować później.
• Pozostań przy EVIE-Preview-4.5B, jeśli już na nim indeksowałeś, a zmierzona jakość jest akceptowalna — ponowne indeksowanie to realny koszt, a zysk z V3, za którym byś gonił, to 1.39 punktu na karcie dostawcy, której nikt niezależnie nie potwierdził.
• Oceń EVIE-4.5B, zanim wybierzesz którekolwiek z nich, jeśli zaczynasz od zera na sensowną skalę. Skracanie Prefix-MRL i kompresja HAC są wymierzone bezpośrednio w powyższą arytmetykę przechowywania, a własne wyniki Tencent plasują ten model w zasięgu nauczyciela.
Żaden z tych trzech nie ma hostowanego API na żadnej platformie, w tym w OrcaRouter, więc na etapie wyszukiwania i tak trzeba zdecydować się na self-hosting. Kolejny etap już nie musi. Router taki jak ten, który OrcaRouter uruchamia na ponad 200 modelach, trzyma model czytający pobrane strony i generujący odpowiedź za jednym API, z automatycznym przełączaniem awaryjnym między dostawcami i cenami katalogowymi dostawców przekazywanymi dalej z 0% narzutu — czyli dokładnie taką konfigurację, jakiej potrzebujesz, gdy retriever zasilający ten model to checkpoint sprzed trzech dni z niezweryfikowanymi twierdzeniami. Indeks zbuduj z retrieverem pasującym do twojego magazynu danych, a resztę potoku trzymaj wymienną, dopóki ktoś spoza Tencent nie potwierdzi, który z tych scorecardów jest prawdziwy.
