
MiniCPM-V 4.7 vs Microsoft Mage-VL: Dwa bardzo różne zakłady o to, ile powinien kosztować model wizyjny na klatkę
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
MiniCPM-V 4.7 i Microsoft Mage-VL to oba modele wizyjno-językowe, które twierdzą, że oszczędzają tokeny, i osiągają to przeciwstawnymi drogami. Mage-VL, wydany przez Microsoft 25 lipca 2026 r., bierze na warsztat stronę wideo: zapożycza strukturę kodeka wideo, zachowuje każdy patch klatki odniesienia i tylko te patche klatek przewidywanych, które niosą rzeczywisty ruch, i deklaruje redukcję liczby tokenów wizualnych o ponad 75% oraz nawet 3,5× przyspieszenie rzeczywistego czasu działania względem równomiernego próbkowania klatek. MiniCPM-V 4.7, udostępniony przez OpenBMB 6 października 2026 r., bierze na warsztat stronę sekwencji: rzadki MoE o 35,2 mld parametrów, którego 30 z 40 warstw działa na ścieżce uwagi liniowej, co sprawia, że pamięć podręczna KV rośnie powoli w całym kontekście 256K. Jeden model kompresuje to, na co patrzy. Drugi kompresuje to, co pamięta. I tylko jeden z nich ma cokolwiek, co można ocenić.
Czym jest każdy z nich
Microsoft Mage-VL to natywny dla kodeków, proaktywnie strumieniujący multimodalny model bazowy w skali 4B, wydany na licencji Apache-2.0 wraz z raportem technicznym i obszerną sekcją ewaluacji. Został celowo zbudowany w odpowiedzi na to, co jego autorzy nazywają paradoksem Moraveca dla VLM — mocny w rozumowaniu offline, powolny w percepcji w czasie rzeczywistym. Enkoder wizualny Mage-ViT jest trenowany w całości od zera na około 100 milionach nieoznaczonych obrazów i filmów, a nie inicjalizowany z ViT wstępnie wytrenowanego na danych internetowych, a jedynym wstępnie wytrenowanym komponentem w stosie jest szkielet językowy Qwen3-4B-Instruct-2507. Pełny checkpoint to jeden ujednolicony model, który wykonuje rozumienie obrazów, rozumowanie wideo offline i komentarz strumieniowy bramkowany zdarzeniami bez osobnych wariantów, a towarzyszące microsoft/Mage-ViT wydanie udostępnia sam enkoder. Od wydania zgromadził około 10 600 pobrań i 420 polubień.
MiniCPM-V 4.7 to openbmb/MiniCPM-V-4.7-35B-A3B, checkpoint BF16 z 35 212 875 824 parametrami, podzielony na szesnaście shardów o łącznym rozmiarze 70,4 GB, zapisany przez Transformers 5.2.0 i przesłany 6 października 2026 roku bez karty modelu.

Jej konfiguracja tekstowa ma znacznik qwen3_5_moe_text z 256 ekspertami i 8 aktywnymi na token, a jej tablica layer_types obejmuje trzy warstwy uwagi liniowej na każdą warstwę pełnej uwagi w 30 warstwach; jej wieża wizyjna to własna minicpmv4_7_vision z 27 warstwami, podpróbkowaniem 16× i maksymalnie dziewięcioma fragmentami obrazu. Kontekst wynosi 256K. Repozytorium ma zero pobrań, trzy polubienia, brak benchmarków i brak licencji.
Sześć wierszy, które czytelnik może sprawdzić
Te same sześć wymiarów, po obu stronach. Tam, gdzie liczba nie istnieje, luka pozostaje widoczna.
• Parametry — Mage-VL: 4,74 mld, gęsty, wszystkie aktywne na token. MiniCPM-V 4.7: łącznie 35,2 mld, rzadki, 8 z 256 ekspertów na token. Liczby dla MiniCPM nie jest współmierna z liczbą dla modelu gęstego.
• Licencja — Mage-VL: Apache-2.0, podana w karcie i tagach karty. MiniCPM-V 4.7: nic nie zadeklarowano.
• Skąd pochodzą oszczędności tokenów — Mage-VL: rzadkość tokenów wizualnych na poziomie enkodera, dopasowana do kodeka, deklarowana redukcja ponad 75%. MiniCPM-V 4.7: uwaga liniowa na poziomie dekodera, która ogranicza wzrost KV-cache w długich sekwencjach, ale nie zmniejsza liczby tokenów, które się do niego podaje.
• Kontekst — Mage-VL: trenowany na etapie długiego kontekstu na 350 tys. filmów jako przesuwne okna kodeka o długości do 384 lub 768 klatek. MiniCPM-V 4.7: max_position_embeddings: 262144.
• Pochodzenie enkodera wizyjnego — Mage-VL: od zera, wytrenowany na ~100 mln nieetykietowanych klatek; karta podaje 85,69% ImageNet przy 256 tokenach i monotoniczną poprawę wraz ze wzrostem budżetu tokenów. MiniCPM-V 4.7: wieża z linii rozwojowej ponownie wykorzystana z projektu MiniCPM-V 4.6 o tym samym 1152-hidden, 27-warstwowym kształcie, z domyślnym 16x downsamplingiem.
• Dowody — Mage-VL: pełna karta z DocVQA 95,14, InfoVQA 80,33, OCRBench 81,80, ChartQAPro 32,57, MMStar 67,32, CV-Bench-3D 94,75 oraz przewagą CrossPoint +53,1 nad Qwen3-VL-4B — wszystko raportowane przez dostawcę względem dopasowanego backbone’u. MiniCPM-V 4.7: brak.
• Zachowanie strumieniowe — Mage-VL: brama poznawcza, która ocenia każde okno kroczące i milczy, aż zdarzenie się zakończy, wytrenowana na ~3,3 mln próbek strumieniowych. MiniCPM-V 4.7: nigdzie nie opisano.

To, co wszyscy mylą w liczbach Mage-VL
Tabele benchmarków na karcie Mage-VL są mocne, a te najmoćniejsze są też najłatwiej błędnie odczytać. Wiersze porównawcze zestawiają Mage-VL-4B z Qwen3-VL-4B, Phi-4-Multimodal-Instruct i Phi-4-Reasoning-Vision, a kluczowe przyrosty — +22,5 w QVHighlight, +24,5 w VideoEval-Pro, +53,1 w CrossPoint — są prawdziwe w tym sensie, że pojawiają się w tabelach dostawcy. Są to również pomiary samego dostawcy, wykonane przez zespół, który trenował model, w tym samym środowisku testowym. Żaden niezależny podmiot ich nie odtworzył. To normalne w przypadku czteromiesięcznego modelu i nie jest to zarzut wobec niego, ale oznacza, że właściwym czasownikiem jest „raportuje”, a nie „uzyskuje wynik”.
Poza tabelami warto docenić dwie rzeczy. Po pierwsze, projekt z dopasowanym backbone'em — z unieruchomionym dekoderem Qwen3-4B i wymianą wyłącznie ViT — jest czystszym dowodem niż pozycja w rankingu, ponieważ izoluje stos wizualny, a nie cały system. Po drugie, korpus treningowy dla Mage-ViT to około 100 mln nieetykietowanych klatek wobec miliardów par obraz-tekst, których używają enkodery wstępnie trenowane na danych z sieci, więc dorównywanie zachowaniu klasy SigLIP2-at-10B w dyskryminacji klastrów jest konkretnym, sprawdzalnym twierdzeniem o efektywności danych, a nie ogólną przechwałką.
MiniCPM-V 4.7 nie ma nic z tego. Nie słabszą wersję — nic.

Nie ma żadnej tabeli, dostawcy ani niczego podobnego, a plik konfiguracyjny opisujący architekturę wyraźnie wyklucza sam siebie z mówienia czegokolwiek o dokładności.
Architektura: dwie odpowiedzi na to samo pytanie
Oba modele próbują odpowiedzieć na pytanie „jak sprawić, by wnioskowanie multimodalne było tanie”, a kontrast ten jest pouczający, ponieważ obie odpowiedzi wzajemnie się uzupełniają, a nie konkurują ze sobą.
Mage-VL redukuje dane wejściowe. Jego 16×16 siatka patchy jest współdzielona między klatkami odniesienia a predykowanymi, a klatki predykowane wnoszą patche tylko tam, gdzie kodek wydaje bity — czyli tam, gdzie występuje ruch i nowe szczegóły. Wynikiem są strumienie tokenów o zmiennej długości na klatkę, dlatego stos potrzebuje projektora, który może przekazać zmienną sekwencję do dekodera przyczynowego, i dlatego ten sam interfejs może przyjmować wektory ruchu H.264/HEVC albo wyuczoną mapę przepływności kodeka neuronowego bez ponownego trenowania. Następnie rotacyjne kodowanie 3D utrzymuje spójność pozycji czasoprzestrzennych mimo rzadkości. Budżet tokenów jest wielkością, którą się zarządza.
MiniCPM-V 4.7 redukuje stan. Jego warstwy liniowej uwagi utrzymują stan rekurencyjny o stałym rozmiarze zamiast rosnącego bufora kluczy i wartości, dzięki czemu koszt pamięciowy długiej rozmowy przestaje skalować się liniowo wraz z liczbą tokenów. Zarządzaną wielkością jest jego budżet sekwencji, a nagrodą jest kontekst 256K. Warto zauważyć, że konfiguracja MiniCPM-V 4.7 reklamuje 16x downsampling wizualny — kompresuje też dane wejściowe — ale milczy na temat tego, czy zachowuje przełączalny tryb 4x, który udostępniał MiniCPM-V 4.6.
Mówiąc wprost: sztuczka Mage-VL opłaca się w przypadku wideo, w którym większość klatek jest niemal identyczna z sąsiednimi. Sztuczka MiniCPM-V 4.7 opłaca się w przypadku długich dokumentów i długich sesji wielotur, w których tokeny się kumulują. Pipeline, który pobiera strumień na żywo, a następnie prowadzi na jego temat długą rozmowę, skorzystałby z obu, a żaden model nie wykonuje jeszcze zadania drugiego.
Wprowadzanie ich do rzeczywistego przepływu pracy
Mage-VL warto wypróbować już dziś: jeden checkpoint, udokumentowana architektura, licencja Apache-2.0 i karta, która mówi, co zawiera repozytorium. Jest dostępny od lipca, a narzędzia wokół niego miały czas się ustabilizować.
MiniCPM-V 4.7 nie jest dziś praktyczny do wypróbowania, z tych nudnych powodów. 70 GB w BF16 bez kwantyzacji oznacza pamięć akceleratora, której prawdopodobnie nie masz wolnej, a brak licencji sprawia, że kwestia, czy w ogóle możesz go używać, pozostaje otwarta. Własne ścieżki kodu wymagają trust_remote_code, a to, czy kombinacja MoE i uwagi liniowej ma kernele w twoim stosie serwowania, nie została przetestowana.
To, co jest prawdą w przypadku obu, to fakt, że samodzielnie hostowany model wizyjny jest jednym z elementów systemu, który musi także wywoływać modele frontier. To przemawia za umieszczeniem hostowanej połowy za jednym routerem, a nie za drugim kontraktem i drugim SDK: OrcaRouter daje dostęp do ponad 200 modeli za pomocą jednego klucza, przekazuje cennik każdego dostawcy bez doliczania przez nas marży i automatycznie przełącza się awaryjnie, gdy dostawca zaczyna działać gorzej. Ani Mage-VL, ani MiniCPM-V 4.7 nie są modelami hostowanymi w tej usłudze — oba to wagi, które hostujesz samodzielnie — więc traktuj to jako instalację po drugiej stronie przekazania, a nie jako kanał dostępności dla któregokolwiek z tych modeli.
Werdykt
Mage-VL to ukończony, licencjonowany, poddany benchmarkom model o konkretnej i dobrze uargumentowanej filozofii projektowej, a jego argumentacja opiera się na strumieniowaniu wideo i rozumowaniu przestrzennym, w których jego natywny dla kodeka enkoder robi coś strukturalnie odmiennego od wszystkich innych. MiniCPM-V 4.7 to większy, nielicencjonowany, niepoddany pomiarom checkpoint, którego filozofia projektowa jest czytelna, ale którego zachowanie pozostaje białą plamą. W odniesieniu do wszystkiego, na czym czytelnik może dziś oprzeć swoje działania, Mage-VL wygrywa domyślnie — nie dlatego, że jest lepszy, ale dlatego, że jako jedyny z tej dwójki w ogóle da się ocenić. Wróć do tego porównania, gdy pojawi się README MiniCPM-V 4.7; jeśli ten dzień przyniesie benchmarki i licencję, ciekawym pytaniem będzie, czy MoE z liniową uwagą i kontekstem 256K pokona natywny dla kodeka enkoder rzadkościowy na długim wideo, i to jest naprawdę otwarta walka.
