
EVIE-8B vs EVIE-Preview-4.5B:32倍広いベクトルで1.39ポイントの向上
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
TencentがEVIE-Preview-4.5Bをリリースし、ViDoReボード上で最も正確な視覚文書検索モデルと呼んでから3週間後、TencentはEVIE-8Bをリリースし、自社の128次元モデルが立っていたゴールポストを静かに動かした。EVIE-8Bは、4096次元のトークン単位埋め込みを持つ84.1億パラメータの旗艦ティーチャーモデルである。EVIE-Preview-4.5Bは、45.4億パラメータのコンパクトな検索モデルであり、128次元で自分の4倍のサイズのモデルに勝てるというのがその売り文句だった。EVIE-8Bのカード内の更新されたリーダーボードでは、EVIE-Preview-4.5Bは現在、同じファミリー内で3位に位置している——新しいEVIE-8Bと、同じ朝にTencentがリリースした生徒モデルであるEVIE-4.5Bの後ろである。2つの名前付きモデルのどちらをドキュメントコーパスのインデックス対象に選ぶ場合、Tencentのカード上の数字によれば、8BはViDoRe V3で約1.39ポイント、ViDoRe V2で3.36ポイント優れており、そのためにベクトルあたりのインデックス領域が32倍かかる。この記事は、そのトレードオフを行う価値があるかどうかについてであり、両方のスコアカードはTencent自身のものであり、どちらも独立して再現されていないという正直な注意書きから始まる。
短いバージョン
• 検索精度がボトルネックであり、コーパスが生のインデックスサイズを気にしなくてよいほど小さい場合、つまりページ数が数百万ではなく数千単位で測定している場合、そしてTencentが公開した中で最高のオープンリトリーバーを求めるなら、EVIE-8Bを選択してください。
• インデックスコスト、ページごとのレイテンシ、またはGPU予算が実際の制約となる場合は、EVIE-Preview-4.5Bを選択してください。128Dベクトルこそがこのモデルの存在理由であり、8Bとの精度差はViDoRe V1では小さく、V3では中程度です。
• 採用を決める前に、両方をEVIE-4.5Bと照らし合わせて再確認してください。Tencentは同日、実行時に切り詰め可能なベクトルとトークン圧縮を備えた生徒モデルをリリースしており、それは効率フロンティア上で両者を凌駕しています。それを無視した比較は、すでに時代遅れです。
• ここに記載されている数値はすべてベンダー報告によるものです。{{1}}EVIE-8B{{/1}}は{{2}}Tencent{{/2}}外部の誰も実行しておらず、{{3}}EVIE-Preview-4.5B{{/3}}の数値は{{4}}Tencent{{/4}}自身の再現スクリプトに基づいています。
実際に異なる点
• パラメータ — EVIE-8B: 8.41B。EVIE-Preview-4.5B: 4.54B。
• バックボーン — 完全双方向アテンションを備えたQwen3.5-9Bと、GatedDeltaNet線形アテンションとフルアテンションを交互に配置したQwen3.5-4Bの比較
Embedding — 4096次元のトークンごとマルチベクター vs ネイティブ128次元のトークンごとマルチベクター。両方ともMaxSimレイトインタラクションでスコアリングされます。
• ViDoRe V1 (10タスク, nDCG@5) — 92.18 vs 91.73.
• ViDoRe V2(4タスク、nDCG@5)— 74.23 vs 70.87。これは最大の相対的差です。
• ViDoRe V3 (48タスク、nDCG@10) — 66.75 vs 65.36.
• それらのヘッドライン数値の背後にあるビジュアルトークン予算 — EVIE-8Bの評価では1ページあたり1,024トークン、EVIE-Preview-4.5Bのヘッドライン層では1ページあたり1,792トークン(768トークンのトレーニング層では、プレビューは64.56を記録)。
• 1MページあたりのRaw BF16インデックス — EVIE-8Bについては未公表。プレビュー版では768トークン/ページで179.2 GiB、1,792トークン/ページで420.5 GiB。
• ライセンスとリリース — Apache-2.0、2026-09-04に静かにリリース vs Apache-2.0、2026-08-17に静かにリリース。

上記のスコアボードは、同じモデルの特徴を別の形で示したものです。これを読む際には、2つの注意点を心に留めておいてください。EVIE-8B列とEVIE-Preview-4.5B列は、それぞれ異なるTencentモデルカードに由来しており、8Bの見出しに示されたV3の数値は、プレビューの見出し数値よりも、1ページあたりのビジュアルトークン予算が低い状態で測定されています。
おしゃべりしている2枚のTencentカード
正直に言えば、この対決は独立した競争ではなく、身内同士の言い争いに過ぎない。EVIE-Preview-4.5B自身のモデルカード(8月17日公開)は、webAI-ColVec1.1-8bを0.04上回る65.36 nDCG@10で「Rank #1 on ViDoRe V3」を主張している。EVIE-8Bのモデルカード(9月4日公開)は、その同じ65.36を、EVIE-8Bの66.75とEVIE-4.5Bの66.02に次ぐページ上第3位の数値として再掲し、プレビュー版に対して8Bが公開されているViDoRe V3の全8ドメインで勝利していることを示している。両方のスコアカードはTencent自身の評価ハーネスで作成されており、どちらのモデルについても、文献中に独立した実行結果はまだどこにも存在しない。つまり、あなたが今読んでいる比較は、TencentがTencentに勝つというTencentの説明であり、内部的に一貫していて、そのように意図的に設計された可能性が高いが、結果に利害関係のない誰にも検証されていない。

上記のtencent/EVIE-8Bカードは、挑戦者の公開サーフェスです:8.41Bのフラッグシップ教師モデルであり、4096Dの埋め込みを備え、上部には同ファミリーの更新済みViDoReテーブルが掲載されています。

上記のtencent/EVIE-Preview-4.5Bカードは現行モデルのものです。4.54Bのリトリーバーであり、ネイティブ128Dベクトルと公開済みのインデックスコスト計算が、今もなおその特徴を定義づけています。
1.39ポイントの問題
ViDoRe V3の生のギャップは小さい。EVIE-8Bの66.75とEVIE-Preview-4.5Bの65.36の差はわずか1.39 nDCG@10ポイントにすぎず、しかも導入にはトークン予算という注意書きが伴う。EVIE-8Bの評価プロトコルはページあたりのビジュアルトークンを1,024に制限している。一方、プレビュー版は見出しの65.36を出すためにページあたり1,792トークンを必要とし、自身の768トークンのトレーニング予算では64.56しか取れなかった。この数値からすると、8Bは同等の予算で単により正確なだけでなく、より少ない予算でも正確であり、これはページあたりのレイテンシにとって望ましい方向性である。より大きな相対的勝利はViDoRe V2で、EVIE-8Bは74.23を報告し、プレビューの70.87に対して3.36ポイントのジャンプを記録している。このボードにはより難しい合成文書タスクが含まれる。最も古く、最も飽和したボードであるViDoRe V1では、92.18対91.73とほとんど動かない。このパターン——誰もが天井に近い場所では横ばい、タスクが新しく難しい場所では決定的——は、リーダーボードのノイズではなく、真の能力向上のプロファイルである。ただし、これは依然としてTencent自身による測定結果である。
指数こそが本当の敵だ
精度はこの判断の半分にすぎない。なぜなら、これら2つのモデルは、何を保存するかについて根本的に異なる約束をしているからだ。EVIE-Preview-4.5Bの存在理由は、ネイティブの128次元トークンベクトルにある。モデルカードは正確なインデックス計算を公開している(トレーニング予算では100万ページあたり179.2 GiBの生BF16インデックス、外挿した段階では420.5 GiB)。そして、ベクトルが狭いほどストレージとMaxSimスコアリングの処理量が正比例して削減されると指摘する。一方、EVIE-8Bのトークンベクトルは4096次元で、ベクトルあたり32倍の幅がある。にもかかわらず、EVIE-8Bのモデルカードにはインデックスサイズの数字が一切載っていない。この省略自体が情報である。同じ1ページあたりのトークン数で比較すれば、生BF16のEVIE-8Bインデックスはプレビューの約32倍の規模になり、100万ページのコーパスでは量子化前の時点で数テラバイトの領域に達する。つまり、フラッグシップは数十万ページを対象にするものであり、大規模に気軽にホストできるものではない。フラッグシップのベクトルの広さがもたらすのは検索の忠実度であって、導入しやすさではない。
Tencentが同じ日にリリースした3つ目の選択肢
この比較を正直に行うなら、名前を挙げた2つのモデルだけで終わることはない。EVIE-8Bを含むリリースにはEVIE-4.5Bも含まれていたからだ。EVIE-4.5Bは、8Bの教師モデルから蒸留された4.61Bパラメータの生徒モデルであり、単一の2048次元射影を持ち、実行時に64、128、256、512、1024、または2048次元に切り詰められる。さらに、TencentがHACと呼ぶ訓練不要のトークン圧縮処理を備えており、ページの視覚トークンを32〜64ベクトルにクラスタリングする。カードによれば、100万ページあたりのインデックス占有容量は3.81 GiBである。Tencent自身の表では、EVIE-4.5BはViDoRe V3で66.02を記録しており、8Bの教師モデルよりわずか0.73低く、EVIE-Preview-4.5Bより0.66高い。つまり、この対戦が突きつけるまさにそのジレンマへの答えがこのモデルなのだ。「8Bのインデックスなしで8Bの精度の大部分」が欲しいのであれば、Tencentはすでにそのモデルを出荷している。そしてそれは、このページのタイトルに挙げられた2つのモデルのどちらでもない。EVIE-Preview-4.5Bの残された適用場面は狭いが現実にある。すなわち、8月にそれをデプロイした人にとっては、すでに本番稼働しているチェックポイントであり、その固定128Dプロファイルは、実行時に次元を選ばせるマトリョーシカよりも把握しやすい。
どれを使ってインデックスすべきですか?
モデルを実際に拘束する制約に一致させてください:
• 正確性の基準点を構築する場合、つまりベンチマーク、数十万ページ規模の高価値な法律・科学コーパス、あるいは検索ミスのコストが高くストレージが安価なシステムを構築する場合は、EVIE-8Bでインデックスを作成してください。ファミリーの性能曲線の頂点にコストを払っていることになりますが、このファミリーは、後でスケールアウトする対象として4.5Bスチューデントを想定しています。
• すでにEVIE-Preview-4.5Bでインデックスを作成済みで、測定品質が許容範囲内なら、そのままEVIE-Preview-4.5Bを使い続けてください。再インデックスは実際にコストがかかりますし、追い求めようとしているV3での向上は、誰も独立に確認していないベンダーカード上の1.39ポイントにすぎません。
• 有意義な規模で新しく始めるのであれば、まずEVIE-4.5Bを評価してください。Prefix-MRLの切り詰めとHAC圧縮は、まさに上記のストレージ計算を狙ったものであり、Tencent自身の数値はそれが教師モデルに肉薄していることを示しています。
3つのいずれも、OrcaRouterを含むどのプラットフォームでもホスト型APIを提供していないため、検索段階はどのみちセルフホストを選ぶことになります。しかし、その次の段階はセルフホストである必要はありません。OrcaRouterのように200以上のモデルにわたって動作するルーターは、取得したページを読んで回答を書くモデルを単一のAPIの背後に置きます。このAPIは、プロバイダー間で自動フェイルオーバーし、プロバイダーのリスト価格を0%マークアップでそのまま通します。これは、そのモデルに供給するリトリーバーが、検証されていない主張を含む3日前のチェックポイントであるときに、まさに望ましい構成です。ストレージに合ったリトリーバーでインデックスを構築し、Tencentの外部の誰かがこれらのスコアカードのどれが本物かを確認するまで、パイプラインの残りの部分は交換可能なままにしておきましょう。
