Wygenerowana karta tytułowa hero dla „MiniCPM-V 4.7 vs Microsoft Mage-VL" z podtytułem „Dwa sposoby na obniżenie kosztu patrzenia na wideo", lewa karta z napisem „Mage-VL: natywna dla kodeka rzadkość tokenów, o 75% mniej tokenów wizualnych", prawa karta z napisem „MiniCPM-V 4.7: liniowa uwaga, płaski KV cache powyżej 256K" oraz pigułka z napisem „Skompresuj dane wejściowe albo skompresuj stan", z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

MiniCPM-V 4.7 vs Microsoft Mage-VL: Dwa bardzo różne zakłady o to, ile powinien kosztować model wizyjny na klatkę

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniCPM-V 4.7 i Microsoft Mage-VL to oba modele wizyjno-językowe, które twierdzą, że oszczędzają tokeny, i osiągają to przeciwstawnymi drogami. Mage-VL, wydany przez Microsoft 25 lipca 2026 r., bierze na warsztat stronę wideo: zapożycza strukturę kodeka wideo, zachowuje każdy patch klatki odniesienia i tylko te patche klatek przewidywanych, które niosą rzeczywisty ruch, i deklaruje redukcję liczby tokenów wizualnych o ponad 75% oraz nawet 3,5× przyspieszenie rzeczywistego czasu działania względem równomiernego próbkowania klatek. MiniCPM-V 4.7, udostępniony przez OpenBMB 6 października 2026 r., bierze na warsztat stronę sekwencji: rzadki MoE o 35,2 mld parametrów, którego 30 z 40 warstw działa na ścieżce uwagi liniowej, co sprawia, że pamięć podręczna KV rośnie powoli w całym kontekście 256K. Jeden model kompresuje to, na co patrzy. Drugi kompresuje to, co pamięta. I tylko jeden z nich ma cokolwiek, co można ocenić.

Czym jest każdy z nich

Microsoft Mage-VL to natywny dla kodeków, proaktywnie strumieniujący multimodalny model bazowy w skali 4B, wydany na licencji Apache-2.0 wraz z raportem technicznym i obszerną sekcją ewaluacji. Został celowo zbudowany w odpowiedzi na to, co jego autorzy nazywają paradoksem Moraveca dla VLM — mocny w rozumowaniu offline, powolny w percepcji w czasie rzeczywistym. Enkoder wizualny Mage-ViT jest trenowany w całości od zera na około 100 milionach nieoznaczonych obrazów i filmów, a nie inicjalizowany z ViT wstępnie wytrenowanego na danych internetowych, a jedynym wstępnie wytrenowanym komponentem w stosie jest szkielet językowy Qwen3-4B-Instruct-2507. Pełny checkpoint to jeden ujednolicony model, który wykonuje rozumienie obrazów, rozumowanie wideo offline i komentarz strumieniowy bramkowany zdarzeniami bez osobnych wariantów, a towarzyszące microsoft/Mage-ViT wydanie udostępnia sam enkoder. Od wydania zgromadził około 10 600 pobrań i 420 polubień.

MiniCPM-V 4.7 to openbmb/MiniCPM-V-4.7-35B-A3B, checkpoint BF16 z 35 212 875 824 parametrami, podzielony na szesnaście shardów o łącznym rozmiarze 70,4 GB, zapisany przez Transformers 5.2.0 i przesłany 6 października 2026 roku bez karty modelu.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs Microsoft Mage-VL — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, Licence none declared, Token savings linear attention, Context 256K, Vision 16x downsample, Evidence no card no benchmarks. Right column 'Mage-VL' lists Parameters 4.74B dense, Licence Apache-2.0, Token savings 75% fewer visual tokens, Context up to 768 frame windows, Vision from-scratch Codec-ViT, Evidence full card with tables. The footer reads 'Mage-VL figures vendor-reported; MiniCPM-V 4.7 figures read from config.json.'

Jej konfiguracja tekstowa ma znacznik qwen3_5_moe_text z 256 ekspertami i 8 aktywnymi na token, a jej tablica layer_types obejmuje trzy warstwy uwagi liniowej na każdą warstwę pełnej uwagi w 30 warstwach; jej wieża wizyjna to własna minicpmv4_7_vision z 27 warstwami, podpróbkowaniem 16× i maksymalnie dziewięcioma fragmentami obrazu. Kontekst wynosi 256K. Repozytorium ma zero pobrań, trzy polubienia, brak benchmarków i brak licencji.

Sześć wierszy, które czytelnik może sprawdzić

Te same sześć wymiarów, po obu stronach. Tam, gdzie liczba nie istnieje, luka pozostaje widoczna.

• Parametry — Mage-VL: 4,74 mld, gęsty, wszystkie aktywne na token. MiniCPM-V 4.7: łącznie 35,2 mld, rzadki, 8 z 256 ekspertów na token. Liczby dla MiniCPM nie jest współmierna z liczbą dla modelu gęstego.

• Licencja — Mage-VL: Apache-2.0, podana w karcie i tagach karty. MiniCPM-V 4.7: nic nie zadeklarowano.

• Skąd pochodzą oszczędności tokenów — Mage-VL: rzadkość tokenów wizualnych na poziomie enkodera, dopasowana do kodeka, deklarowana redukcja ponad 75%. MiniCPM-V 4.7: uwaga liniowa na poziomie dekodera, która ogranicza wzrost KV-cache w długich sekwencjach, ale nie zmniejsza liczby tokenów, które się do niego podaje.

• Kontekst — Mage-VL: trenowany na etapie długiego kontekstu na 350 tys. filmów jako przesuwne okna kodeka o długości do 384 lub 768 klatek. MiniCPM-V 4.7: max_position_embeddings: 262144.

• Pochodzenie enkodera wizyjnego — Mage-VL: od zera, wytrenowany na ~100 mln nieetykietowanych klatek; karta podaje 85,69% ImageNet przy 256 tokenach i monotoniczną poprawę wraz ze wzrostem budżetu tokenów. MiniCPM-V 4.7: wieża z linii rozwojowej ponownie wykorzystana z projektu MiniCPM-V 4.6 o tym samym 1152-hidden, 27-warstwowym kształcie, z domyślnym 16x downsamplingiem.

• Dowody — Mage-VL: pełna karta z DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 oraz przewagą CrossPoint +53,1 nad Qwen3-VL-4B — wszystko raportowane przez dostawcę względem dopasowanego backbone’u. MiniCPM-V 4.7: brak.

• Zachowanie strumieniowe — Mage-VL: brama poznawcza, która ocenia każde okno kroczące i milczy, aż zdarzenie się zakończy, wytrenowana na ~3,3 mln próbek strumieniowych. MiniCPM-V 4.7: nigdzie nie opisano.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

To, co wszyscy mylą w liczbach Mage-VL

Tabele benchmarków na karcie Mage-VL są mocne, a te najmoćniejsze są też najłatwiej błędnie odczytać. Wiersze porównawcze zestawiają Mage-VL-4B z Qwen3-VL-4B, Phi-4-Multimodal-Instruct i Phi-4-Reasoning-Vision, a kluczowe przyrosty — +22,5 w QVHighlight, +24,5 w VideoEval-Pro, +53,1 w CrossPoint — są prawdziwe w tym sensie, że pojawiają się w tabelach dostawcy. Są to również pomiary samego dostawcy, wykonane przez zespół, który trenował model, w tym samym środowisku testowym. Żaden niezależny podmiot ich nie odtworzył. To normalne w przypadku czteromiesięcznego modelu i nie jest to zarzut wobec niego, ale oznacza, że właściwym czasownikiem jest „raportuje”, a nie „uzyskuje wynik”.

Poza tabelami warto docenić dwie rzeczy. Po pierwsze, projekt z dopasowanym backbone'em — z unieruchomionym dekoderem Qwen3-4B i wymianą wyłącznie ViT — jest czystszym dowodem niż pozycja w rankingu, ponieważ izoluje stos wizualny, a nie cały system. Po drugie, korpus treningowy dla Mage-ViT to około 100 mln nieetykietowanych klatek wobec miliardów par obraz-tekst, których używają enkodery wstępnie trenowane na danych z sieci, więc dorównywanie zachowaniu klasy SigLIP2-at-10B w dyskryminacji klastrów jest konkretnym, sprawdzalnym twierdzeniem o efektywności danych, a nie ogólną przechwałką.

MiniCPM-V 4.7 nie ma nic z tego. Nie słabszą wersję — nic.

A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured 7 October 2026) showing the model header, the mage_vl and video-understanding tags, the Apache-2.0 licence badge, the project page and GitHub links, and the opening of the Mage-VL card describing it as a codec-native, proactive-streaming multimodal foundation model at a 4B scale.

Nie ma żadnej tabeli, dostawcy ani niczego podobnego, a plik konfiguracyjny opisujący architekturę wyraźnie wyklucza sam siebie z mówienia czegokolwiek o dokładności.

Architektura: dwie odpowiedzi na to samo pytanie

Oba modele próbują odpowiedzieć na pytanie „jak sprawić, by wnioskowanie multimodalne było tanie”, a kontrast ten jest pouczający, ponieważ obie odpowiedzi wzajemnie się uzupełniają, a nie konkurują ze sobą.

Mage-VL redukuje dane wejściowe. Jego 16×16 siatka patchy jest współdzielona między klatkami odniesienia a predykowanymi, a klatki predykowane wnoszą patche tylko tam, gdzie kodek wydaje bity — czyli tam, gdzie występuje ruch i nowe szczegóły. Wynikiem są strumienie tokenów o zmiennej długości na klatkę, dlatego stos potrzebuje projektora, który może przekazać zmienną sekwencję do dekodera przyczynowego, i dlatego ten sam interfejs może przyjmować wektory ruchu H.264/HEVC albo wyuczoną mapę przepływności kodeka neuronowego bez ponownego trenowania. Następnie rotacyjne kodowanie 3D utrzymuje spójność pozycji czasoprzestrzennych mimo rzadkości. Budżet tokenów jest wielkością, którą się zarządza.

MiniCPM-V 4.7 redukuje stan. Jego warstwy liniowej uwagi utrzymują stan rekurencyjny o stałym rozmiarze zamiast rosnącego bufora kluczy i wartości, dzięki czemu koszt pamięciowy długiej rozmowy przestaje skalować się liniowo wraz z liczbą tokenów. Zarządzaną wielkością jest jego budżet sekwencji, a nagrodą jest kontekst 256K. Warto zauważyć, że konfiguracja MiniCPM-V 4.7 reklamuje 16x downsampling wizualny — kompresuje też dane wejściowe — ale milczy na temat tego, czy zachowuje przełączalny tryb 4x, który udostępniał MiniCPM-V 4.6.

Mówiąc wprost: sztuczka Mage-VL opłaca się w przypadku wideo, w którym większość klatek jest niemal identyczna z sąsiednimi. Sztuczka MiniCPM-V 4.7 opłaca się w przypadku długich dokumentów i długich sesji wielotur, w których tokeny się kumulują. Pipeline, który pobiera strumień na żywo, a następnie prowadzi na jego temat długą rozmowę, skorzystałby z obu, a żaden model nie wykonuje jeszcze zadania drugiego.

Wprowadzanie ich do rzeczywistego przepływu pracy

Mage-VL warto wypróbować już dziś: jeden checkpoint, udokumentowana architektura, licencja Apache-2.0 i karta, która mówi, co zawiera repozytorium. Jest dostępny od lipca, a narzędzia wokół niego miały czas się ustabilizować.

MiniCPM-V 4.7 nie jest dziś praktyczny do wypróbowania, z tych nudnych powodów. 70 GB w BF16 bez kwantyzacji oznacza pamięć akceleratora, której prawdopodobnie nie masz wolnej, a brak licencji sprawia, że kwestia, czy w ogóle możesz go używać, pozostaje otwarta. Własne ścieżki kodu wymagają trust_remote_code, a to, czy kombinacja MoE i uwagi liniowej ma kernele w twoim stosie serwowania, nie została przetestowana.

To, co jest prawdą w przypadku obu, to fakt, że samodzielnie hostowany model wizyjny jest jednym z elementów systemu, który musi także wywoływać modele frontier. To przemawia za umieszczeniem hostowanej połowy za jednym routerem, a nie za drugim kontraktem i drugim SDK: OrcaRouter daje dostęp do ponad 200 modeli za pomocą jednego klucza, przekazuje cennik każdego dostawcy bez doliczania przez nas marży i automatycznie przełącza się awaryjnie, gdy dostawca zaczyna działać gorzej. Ani Mage-VL, ani MiniCPM-V 4.7 nie są modelami hostowanymi w tej usłudze — oba to wagi, które hostujesz samodzielnie — więc traktuj to jako instalację po drugiej stronie przekazania, a nie jako kanał dostępności dla któregokolwiek z tych modeli.

Werdykt

Mage-VL to ukończony, licencjonowany, poddany benchmarkom model o konkretnej i dobrze uargumentowanej filozofii projektowej, a jego argumentacja opiera się na strumieniowaniu wideo i rozumowaniu przestrzennym, w których jego natywny dla kodeka enkoder robi coś strukturalnie odmiennego od wszystkich innych. MiniCPM-V 4.7 to większy, nielicencjonowany, niepoddany pomiarom checkpoint, którego filozofia projektowa jest czytelna, ale którego zachowanie pozostaje białą plamą. W odniesieniu do wszystkiego, na czym czytelnik może dziś oprzeć swoje działania, Mage-VL wygrywa domyślnie — nie dlatego, że jest lepszy, ale dlatego, że jako jedyny z tej dwójki w ogóle da się ocenić. Wróć do tego porównania, gdy pojawi się README MiniCPM-V 4.7; jeśli ten dzień przyniesie benchmarki i licencję, ciekawym pytaniem będzie, czy MoE z liniową uwagą i kontekstem 256K pokona natywny dla kodeka enkoder rzadkościowy na długim wideo, i to jest naprawdę otwarta walka.