
MiniCPM-V 4.7 kontra North Micro Vision Instruct: Cohere wydał udokumentowany model 2,4B; OpenBMB wydał 70 GB pustki
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
MiniCPM-V 4.7 i North Micro Vision Instruct to odpowiedzi małych laboratoriów na to samo zadanie — kompaktowy model językowo-wizyjny, który można samodzielnie dostroić i wdrożyć — ale tylko jeden z nich jest ukończony. North Micro Vision Instruct od Cohere pojawił się 10 sierpnia 2026 jako model o natywnej rozdzielczości i 2,4 miliarda parametrów na licencji Apache-2.0, z wpisem technicznym na blogu wyjaśniającym architekturę oraz kartą modelu opisującą, do czego służy. MiniCPM-V 4.7 pojawił się 6 października 2026 jako checkpoint rzadkiej mieszaniny ekspertów o 35,2 miliarda parametrów, z szesnastoma shardami, bez README, bez pola licencji i bez jakiegokolwiek benchmarku. Ciekawe porównanie nie polega na tym, „który jest mądrzejszy”. Polega na tym, że te dwa wydania reprezentują przeciwstawne postawy wobec społeczności, która musi z nich korzystać.
Dwa wydania i co zostało dostarczone z każdym z nich
North Micro Vision Instruct to model wizyjno-językowy z otwartymi wagami o 2,4 mld parametrów od CohereLabs, udostępniony na licencji Apache-2.0. Jest wprost pozycjonowany jako kompaktowy fundament do prototypowania, dostrajania do konkretnych zadań i specjalistycznej pracy multimodalnej. Jego cechą charakterystyczną jest przetwarzanie obrazów w natywnej rozdzielczości, które zachowuje proporcje i drobne szczegóły wizualne, zamiast ponownego próbkowania do stałej siatki, a karta modelu deklaruje możliwości w zakresie VQA, opisywania obrazów, groundingu, OCR, wykresów i dokumentów. Obsługuje wiele obrazów w jednej rozmowie oraz jedenaście języków — angielski, niemiecki, francuski, hiszpański, włoski, portugalski, hindi, japoński, koreański, chiński i arabski. Wagi modelu to 2 484 847 856 parametrów w BF16, a od czasu premiery społeczność MLX opracowała konwersje 4-bitowe, 5-bitowe, 6-bitowe, 8-bitowe, mxfp8, mxfp4, nvfp4 i bf16, co pokazuje, jak wygląda zdrowe wydanie małego modelu po kilku miesiącach. Ma około 166 500 pobrań i 150 polubień.
MiniCPM-V 4.7 to openbmb/MiniCPM-V-4.7-35B-A3B: 35 212 875 824 parametrów w BF16, 70,4 GB w szesnastu shardach safetensors, klasa MiniCPMV4_7ForConditionalGeneration, zapisany przez Transformers 5.2.0 i przesłany 6 października 2026.

Jego szkielet tekstowy to pochodzący z Qwen3.5 rzadki MoE — 256 ekspertów, 8 wybieranych na token — z 40 warstwami działającymi według stałego wzorca attention trzy liniowe do jednego pełnego, kontekstem 256K i własną 27-warstwową wieżą wizyjną z 16-krotnym podpróbkowaniem. Nie ma karty modelu. Repozytorium ma trzy polubienia i zero pobrań.
Obok siebie, w sześciu kwestiach, które mają znaczenie
• Parametry — North Micro Vision Instruct: 2,48 mld gęstych, każdy parametr aktywny na token. MiniCPM-V 4.7: łącznie 35,2 mld, 8 z 256 rzadkich. To nie jest liczba porównywalna jeden do jednego.
• Licencja — North Micro Vision Instruct: Apache-2.0, oznaczona i podana. MiniCPM-V 4.7: brak zadeklarowanej, co domyślnie oznacza wszelkie prawa zastrzeżone.
• Możliwości dostrajania — North Micro Vision Instruct: zaprojektowany wyraźnie jako podstawa do dostrajania pod konkretne zadania, z już dostępnymi kwantyzacjami społeczności. MiniCPM-V 4.7: 70 GB checkpoint BF16 bez kwantyzacji i bez podanego przepisu treningowego.
• Obsługa rozdzielczości — North Micro Vision Instruct: rozdzielczość natywna, zachowująca proporcje. MiniCPM-V 4.7: downsample_mode: "16x" z max_slice_nums: 9, ścieżka wysokiej rozdzielczości oparta na slicerze.
• Pokrycie językowe — North Micro Vision Instruct: jedenaście języków wymienionych na karcie. MiniCPM-V 4.7: nigdzie nie podano.
• Kontekst — North Micro Vision Instruct: rozmiar dostosowany do klasy wdrożeniowej 2,4B. MiniCPM-V 4.7: max_position_embeddings: 262144, 256K.
• Dowody jakości — North Micro Vision Instruct: opublikowana karta, techniczny wpis na blogu, konwersje społeczności i szerokie przyjęcie. MiniCPM-V 4.7: nie ma nic do przytoczenia.

Asymetria, która sprawia, że to porównanie jest nierówne
Istnieje pewien rodzaj artykułu porównawczego, który łatwo byłoby tu napisać: wyciągnąć liczby MiniCPM-V 4.6 z GitHuba OpenBMB, zauważyć, że biją równoważną klasę małych modeli, i zasugerować, że 4.7 je dziedziczy. To byłoby nieuczciwe, a powód warto podać precyzyjnie. MiniCPM-V 4.7 nie jest większą wersją 4.6. Porzuca 1.3B gęsty backbone Qwen3.5-0.8B na rzecz 35B rzadkiego Qwen-MoE, zmienia wzorzec uwagi na 3:1 liniowy-do-pełnego i przełącza domyślną kompresję wizji na 16x. Każda z tych zmian dotyczy tej części modelu, która decyduje o dokładności. Pochodzenie rodzinne to nie benchmark.
Inny kierunek nieuczciwości jest subtelniejszy: traktowanie braku karty jako dowodu na problem. Nim nie jest. OpenBMB wypuściło dziewięć generacji MiniCPM-V od 2024 roku, z których kilka jest naprawdę znakomitych jak na swoje rozmiary, a dwunastominutowe okno między utworzeniem repozytorium a ostatnim commitem to obraz artefaktu przygotowanego, a następnie opublikowanego, a nie zepsutego. Prawidłowe odczytanie MiniCPM-V 4.7 to „nieznane”, a nieznane to coś odrębnego od „złego”.
Strona Cohere ma własne wymagania dotyczące uczciwości.

Twierdzenia o jakości karty North Micro Vision to własne pomiary Cohere, a techniczne dogłębne omówienie napisał ten sam zespół. To, że społeczność zbudowała szesnaście kwantyzacji MLX w ciągu kilku dni, jest dowodem na adopcję, a nie na dokładność — ludzie konwertują modele, które łatwo się konwertuje, a czyste wydanie 2.4B na licencji Apache-2.0 jest łatwe do skonwertowania. Ani liczby pobrań, ani rozrzutu kwantyzacji nie należy odczytywać jako oceny.
Do czego właściwie służy każdy z nich
North Micro Vision Instruct to cel dostrajania. To cały zarys projektu, wyrażony słowami samej karty: kompaktowa podstawa do prototypowania i specjalistycznych zastosowań. Jeśli masz wąskie zadanie parsowania dokumentów, ekstrakcji wykresów lub wielojęzycznego opisywania obrazów oraz kilka tysięcy oznaczonych przykładów, model 2.4B Apache-2.0 z wejściem w rozdzielczości natywnej i kwantyzacjami ośmiobitowymi i wyższymi jest rozsądnym punktem wyjścia, a gdy zacznie działać, możesz przenieść go na urządzenie brzegowe lub pojedynczy GPU średniej klasy.
MiniCPM-V 4.7, jeśli okaże się użyteczny, nie jest tym. Przy 70 GB bez kwantyzacji to model serwerowy, a jego cechy wyróżniające — okno 256K i liniowa uwaga, która utrzymuje stały rozmiar KV cache — wskazują na multimodalne obciążenia z długim kontekstem: godzinne transkrypcje wideo, duże zbiory dokumentów, rozszerzoną analizę wielotutową z obrazami w historii. To są realne obciążenia, a architektura jest rozsądnym zakładem na nie. Zakład po prostu nie został jeszcze rozstrzygnięty.
Jest niuans dotyczący obu strategii kompresji, wart zapamiętania. Rozdzielczość natywna i 16-krotny downsampling nie są po prostu lepsze i gorsze. Koder w rozdzielczości natywnej zużywa tokeny, aby zachować drobne szczegóły, których potrzebują OCR i grounding. 16-krotny downsampling zużywa mniej tokenów i ryzykuje utratę dokładnie tych szczegółów. To, która z nich jest właściwa, zależy od tego, czy Twoim zadaniem jest odczytywanie gęstego formularza, czy opisywanie sceny, a przełączalny tryb 4x/16x w MiniCPM-V 4.6 istniał właśnie dlatego, że odpowiedź zmienia się w zależności od zadania. To, czy 4.7 zachował ten przełącznik, jest jedną z rzeczy, o których konfiguracja nie mówi.
Gdzie router pasuje, a gdzie nie
Oba te modele to wagi, które hostujesz samodzielnie. Ani North Micro Vision Instruct, ani MiniCPM-V 4.7 nie jest modelem hostowanym w OrcaRouter i nic tutaj nie powinno być odczytywane jako twierdzenie, że nim jest. Kwestia routingu pojawia się o krok później, gdy mały model hostowany samodzielnie wykonuje rutynową pracę, a coś większego musi obsłużyć przypadki, w których sobie nie radzi. To przekazanie jest tym, do czego służy router z jednym kluczem — ponad 200 modeli u różnych dostawców, każdy w swojej cenie katalogowej, bez doliczania marży po naszej stronie, z automatycznym przełączaniem awaryjnym, gdy wydajność jednego z dostawców spada — i warto mieć ten interfejs ustalony, zanim będzie potrzebny, bo dzień, w którym twoja ocena 4.7 się powiedzie, jest dniem, w którym chcesz drugi endpoint bez drugiej umowy.
Werdykt i co by go zmieniło
Cohere udostępniło model. OpenBMB udostępniło checkpoint. W każdym wymiarze, na którym czytelnik może oprzeć decyzję — licencja, jasność licencji, udokumentowane zachowanie, gotowość do dostrajania, kwantyzacja, pokrycie językowe — North Micro Vision Instruct jest dziś odpowiedzią i nie jest nawet blisko. To nie jest twierdzenie o możliwościach, ponieważ porównanie możliwości nie jest możliwe. MiniCPM-V 4.7 ma około dziesięciokrotnie więcej parametrów niż model, z którym jest porównywany, i nie opublikowano niczego, co uzasadniałoby lub podważało ten rozmiar. Uczciwym stanowiskiem jest traktowanie go jako oczekującego: prawdziwy artefakt z laboratorium o prawdziwym dorobku, leżący w repozytorium, w którym brakuje jednego pliku, który zmieniłby wszystko — README.
