Wygenerowana karta tytułowa hero dla „MiniCPM-V 4.7” z podtytułem „Model wizyjny 35B-A3B przesłany bez karty modelu, licencji i benchmarków”, karta z napisem „Przesłano 6 paź 2026”, karta listy kontrolnej z napisem „Brak: karta modelu, licencja, benchmarki, kwantyzacje”, plakietka z napisem „35,2 mld parametrów łącznie” i plakietka z napisem „kontekst 256K”, z logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

MiniCPM-V 4.7: OpenBMB opublikowało model wizyjno-językowy 35B-A3B bez karty modelu, bez licencji i bez benchmarków

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MiniCPM-V 4.7 pojawił się na Hugging Face wieczorem 6 października 2026 r. jako repozytorium openbmb/MiniCPM-V-4.7-35B-A3B — i jest to jedna z najdziwniejszych rzeczy, jakie seria MiniCPM kiedykolwiek wypuściła, bo niemal nic nie zostało wypuszczone razem z nim. Nie ma karty modelu. Nie ma README. Nie ma zadeklarowanej licencji. Nie ma tabel z benchmarkami, wpisu o premierze, raportu technicznego ani pozycji w dokumentacji GitHub samego OpenBMB, która — według stanu na ten tydzień — wciąż nazywa MiniCPM-V 4.6 „najnowszym i najbardziej wydajnym modelem w serii MiniCPM-V”. Istnieje natomiast 16 shardów wag bfloat16, ważących 70,4 GB, opisujących model językowo-wizualny typu mixture-of-experts o 35,2 miliarda parametrów, z oknem kontekstowym 256K i niezwykle agresywną konstrukcją hybrydowej uwagi. To wystarcza, by powiedzieć, czym ten model jest. To jeszcze nie wystarcza, by powiedzieć, w czym jest dobry, a ten tekst ściśle rozdziela te dwie rzeczy.

Co faktycznie dotarło, bajt po bajcie

Repozytorium zostało utworzone o 18:36 UTC 6 października 2026 r., a jego ostatni commit miał miejsce dwanaście minut później, o 18:48 UTC. W międzyczasie osoba wysyłająca wypchnęła pliki wag oraz konfigurację potrzebną loaderowi Transformers i na tym poprzestała. Pełna lista plików liczy osiemnaście pozycji:

• Wagi — szesnaście safetensors-shardów o nazwach model-00001-of-00016 do model-00016-of-00016, z plikiem indeksu model.safetensors.index.json, który podaje łączny rozmiar tensorów wynoszący 70 425 751 648 bajtów.

• Liczba parametrów — API Hugging Face odczytuje 35 212 875 824 parametry, wszystkie w formacie BF16. Zauważ, że jest to całkowita liczba, która w przypadku rzadkiego MoE nie jest liczbą parametrów aktywnych dla dowolnego tokenu.

• Konfiguracja — config.json (2,984 bajtów), generation_config.json (186 bajtów), preprocessor_config.json, processor_config.json.

• Tokenizator — tokenizer.json (20 MB), tokenizer_config.json i chat_template.jinja (7 250 bajtów).

• Brak — README.md. Bezpośrednie pobranie surowego pliku zwraca HTTP 404. Na Hugging Face brak README oznacza brak karty modelu, co oznacza brak pola licencji, co oznacza, że repozytorium nie zawiera license:żadnego tagu

Repozytorium ma trzy polubienia, zero pobrań i pustą zakładkę dyskusji. Wgranie przez społeczność checkpointu o rozmiarze 70 GB zwykle przyciąga komentarze w ciągu kilku godzin — pytania o kwantyzacje, o serwowanie, o to, jaka jest licencja. W tym przypadku jednak nie, co jest spójne z tym, że dostrzegła go garstka osób obserwujących organizację openbmb, a nie że został ogłoszony komukolwiek.

A generated single-column scoreboard titled 'MiniCPM-V 4.7 — the scoreboard' with six rows: Total parameters 35.2B, 8 of 256 experts; Context 256K tokens; Text backbone Qwen3.5 sparse MoE; Attention 30 of 40 layers linear; Vision 16x downsample, 9 slices; Benchmarks none published, with the footer 'Figures read from config.json and the weight index; no vendor benchmarks exist.'

Architektura odczytana wprost z config.json

Ponieważ nie ma karty modelu do sparafrazowania, plik konfiguracyjny jest głównym źródłem i jest wyjątkowo bogaty w informacje. Klasa to MiniCPMV4_7ForConditionalGeneration, typ modelu to minicpmv4_7, a został zapisany przez Transformers 5.2.0 — wszystko to wskazuje, że jest to oficjalny checkpoint OpenBMB w głównej linii MiniCPM-V, a nie społecznościowy fine-tune podszywający się pod tę nazwę.

• Szkielet językowy — model_type: qwen3_5_moe_text. Rzadki MoE wywodzący się z Qwen3.5, pierwszy raz, gdy w linii MiniCPM-V wykorzystano stos tekstowy Qwen-MoE zamiast gęstych małych wariantów Qwen, które napędzały MiniCPM-V 4.5 i 4.6.

• Rzadkość — 256 ekspertów, 8 wybieranych na token, z rozmiarem pośrednim eksperta 512 i wspólnym ekspertem o tym samym rozmiarze. Łączny checkpoint 35B przy wzorcu routingu 8 z 256 aktywuje niewielki ułamek tego w każdym przebiegu w przód, co jest całym sensem nazwy A3B: wagi są duże, a obliczenia nie.

• Głębokość i szerokość — 40 warstw ukrytych, rozmiar ukryty 2048, 16 głów uwagi z 2 głowami klucza/wartości i wymiarem głowy 256.

• Hybrydowa uwaga — layer_types to tablica o długości 40 elementów i obejmuje trzy warstwy linear_attention na każdą jedną full_attention warstwę w stałym interwale 4. Dziesięć z czterdziestu warstw stosuje konwencjonalną uwagę; pozostałe trzydzieści korzysta z liniowej ścieżki w stylu Mamba z jądrem konwolucji o rozmiarze 4. To najbardziej brzemienna w skutki decyzja projektowa w pliku i jest to ten sam kierunek, w którym przez 2026 rok podążała szersza dziedzina.

• Kodowanie pozycyjne — RoPE z wartością theta równą 10 000 000 i partial_rotary_factor: 0.25, co oznacza, że tylko jedna czwarta wymiarów każdej głowy jest obracana. Multimodal RoPE jest włączony z mrope_interleaved: true, podziałem na sekcje [11, 11, 10] oraz mrope_mode: canvas.

• Kontekst — max_position_embeddings: 262144, a tokenizera model_max_length się zgadza. 256K tokenów.

• Predykcja wielu tokenów — mtp_num_hidden_layers: 1, pojedyncza głowa dekodowania spekulacyjnego, ten sam trik, który zastosował MiniCPM-V 4.6.

• Wieża wizyjna — minicpmv4_7_vision, rozmiar ukryty 1152, 27 warstw, aktywacje GELU-tanh, rozmiar patcha 14 z image_size o wartości 980 oraz insert_layer_id o wartości 6, gdzie osadzenia wizualne są wstawiane do stosu językowego. Kształt wieży jest zbliżony do tego w MiniCPM-V 4.6, więc strona wizyjna to ewolucja, a nie przebudowa.

• Kompresja wizji — downsample_mode: "16x" i max_slice_nums: 9 w procesorze obrazu. MiniCPM-V 4.6 wprowadził przełączalny schemat kompresji tokenów 4x/16x; konfiguracja 4.7 wskazuje ustawienie 16x jako domyślne, a slicer pozwala na maksymalnie dziewięć podobrazów dla danych wejściowych o wysokiej rozdzielczości.

• Słownik — 248 144 tokenów, w tym <|image_pad|> o identyfikatorze 248 056 i <|video_pad|> o identyfikatorze 248 057. Wideo jest wejściem pierwszej klasy, dokładnie tak, jak ma to miejsce od wersji MiniCPM-V 4.5.

• Ciekawa pozostałość — konfiguracja tokenizatora wciąż deklaruje <|audio_start|>, <|audio_end|> i <|audio_pad|>. To niemal na pewno oznacza, że słownik jest współdzielony z gałęzią omni MiniCPM-o, a nie że MiniCPM-V 4.7 obsługuje audio. Odczytanie tego jako funkcji audio byłoby błędem, którego sama konfiguracja nie może wykluczyć.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tag chips safetensors, minicpmv4_7 and region:us, and the repository file listing beginning with .gitattributes, chat_template.jinja, config.json and generation_config.json, with no README or model card rendered.

Co rodzina mówi nam, czego nie mówi to repozytorium

Generacja 4.6 jest punktem odniesienia, a sedno tkwi w kontraście. MiniCPM-V 4.6 został wydany 11 maja 2026 roku jako model o 1,3 miliarda parametrów, zbudowany na enkoderze wizyjnym SigLIP2-400M i modelu językowym Qwen3.5-0.8B, na licencji Apache-2.0, z wyraźnym przesłaniem: osiąga 13 punktów w Artificial Analysis Intelligence Index — co jest wartością podaną przez dostawcę — zużywając przy tym dramatycznie mniej tokenów niż porównywalne małe modele, i działa na iOS, Androidzie i HarmonyOS, a kod adaptacji brzegowej jest otwartoźródłowy. Cała jego tożsamość opierała się na haśle „mały, wydajny, działający na urządzeniu”.

MiniCPM-V 4.7 to 1,3B pomnożone przez około 27. Nazwa 35B-A3B stawia go w klasie zajmowanej przez flagowce o rzadkiej architekturze, a nie telefony. Nie jest nigdzie podane, czy OpenBMB zamierza go użyć jako towarzysza po stronie serwera dla linii edge, jako nauczyciela dla przyszłego małego modelu, czy jako test pułapu możliwości, a repozytorium nie zawiera żadnej wskazówki w tę czy inną stronę.

Tym, co jest naprawdę nowe i co warto podkreślić dla każdego, kto śledzi tę serię, jest szkielet Qwen-MoE oraz proporcja uwagi liniowej do pełnej wynosząca 3:1. Oba te elementy to odstępstwa. Wszystko, co OpenBMB publikuje na temat tej rodziny, wciąż koncentruje się wokół 4.6, więc ten checkpoint wyprzedza własną dokumentację.

A screenshot of the GitHub repository OpenBMB/MiniCPM-V (captured 7 October 2026) showing the repository header and README, whose model table lists MiniCPM-V 4.6 as the latest and most efficient model in the MiniCPM-V series — with no mention of MiniCPM-V 4.7 anywhere on the page.

Co nie jest jeszcze poznawalne — i dlaczego ta lista ma znaczenie

Warto powiedzieć wprost, jak wielka jest tu luka, bo przy checkpoincie o rozmiarze 70 GB kusi, żeby wypełnić ją wiarygodnym wnioskowaniem.

• Brak licencji. To nie jest formalność. MiniCPM-V 4.6 jest na licencji Apache-2.0, a społeczność zaczęła oczekiwać tego po tej linii. Repozytorium bez tagu license: jest domyślnie objęte wszystkimi prawami zastrzeżonymi w większości jurysdykcji — nie możesz bezpiecznie na nim budować, dopóki tag się nie pojawi. Ten pojedynczy brakujący plik to najbardziej brzemienna w skutkach nieobecność w repozytorium.

• Żadnych benchmarków, ani raportowanych przez producenta, ani żadnych innych. Nie ma ani jednej liczby, o którą można by się spierać. Każdy, kto dziś cytuje wynik MMMU lub OCRBench dla MiniCPM-V 4.7, cytuje coś, co nie istnieje w źródle.

• Brak niezależnej oceny. Artificial Analysis i podobne trackery indeksują modele po nazwie; checkpoint bez karty i ogłoszenia zwykle przez jakiś czas pozostaje niezmierzony.

• Brak przepisu na serwowanie. To, czy udostępnione wagi działają bez zmian w vLLM, SGLang lub llama.cpp, nie zostało przetestowane przez nikogo spoza OpenBMB. Własne ścieżki kodu (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) wymagają wszystkie trust_remote_code, a połączenie MoE z uwagą liniową to nie jest kształt, dla którego każdy silnik wnioskowania ma kernel.

• Brak kwantyzacji. MiniCPM-V 4.6 został wydany w wariantach GGUF, AWQ, GPTQ i BNB oraz trafił do biblioteki Ollama w czerwcu 2026 r. Dla 4.7 nie istnieje żaden z nich. W przypadku modelu 35B to różnica między laptopem a klastrem.

• Nie podano żadnego związku z 4.6. OpenBMB może zastępować linię edge, rozszerzać ją lub testować coś ortogonalnego. Repozytorium tego nie mówi, podobnie jak README na GitHubie, które nadal wymienia 4.6 jako bieżące wydanie według stanu na commit z 8 września 2026 r.

Istnieje również wiarygodna, lecz niepotwierdzona interpretacja osi czasu: dwunastominutowa przerwa między utworzeniem repozytorium a ostatnim commitem, brak karty i brak jakiegokolwiek wpisu to obraz punktu kontrolnego, gdy jest on przygotowywany na premierę, a nie po niej. To hipoteza dotycząca intencji, a nie fakt dotyczący artefaktu, i należy ją tak traktować.

Jak właściwie byś to uruchomił, kiedy jest coś do uruchomienia

Nic tutaj nie jest jeszcze możliwe do przywołania jako wspierana ścieżka, ale konfiguracja jednak ogranicza opcje. Checkpoint BF16 z 35 mld parametrów potrzebuje około 70 GB pamięci akceleratora jeszcze przed pamięcią podręczną KV, więc hobbystyczne wdrożenie na pojedynczym GPU jest wykluczone, dopóki nie pojawią się kwantyzacje. Kontekst 256K i proporcja uwagi liniowej 3:1 sprawiają, że pamięć podręczna KV rośnie znacznie wolniej niż w konwencjonalnym transformerze o tej samej głębokości — i właśnie dlatego ta architektura jest warta złożoności: to w pracy multimodalnej z długim kontekstem projekt zwraca się z nawiązką. Gdy pojawi się karta, najpierw trzeba sprawdzić licencję, czy opublikowano oficjalny przepis dla vLLM lub SGLang oraz czy domyślne podpróbkowanie 16x można zamienić na ustawienie 4x, które ujawniła wersja 4.6.

Dla zespołów, które chcą ocenić taki model w momencie, gdy tylko stanie się użyteczny, praktycznym problemem nie są same wagi, lecz cała otaczająca je infrastruktura. Model działający na własnym GPU i tak potrzebuje wokół siebie wszystkiego — routera, który stawia ponad 200 modeli hostowanych za jednym kluczem, w cenie katalogowej każdego dostawcy, bez doliczanej przez nas marży, i który automatycznie przełącza się na zapas, gdy któryś dostawca zaczyna zawodzić. Do tego właśnie służy OrcaRouter i warto powiedzieć wprost, że sam MiniCPM-V 4.7 nie jest modelem hostowanym: to checkpoint z otwartymi wagami, który uruchamiasz na własnym sprzęcie. Router ma tu znaczenie jako druga połowa architektury — model frontier, któremu twoja maszyna z 4.7 przekazuje trudne przypadki, dostępny przez tego samego klienta, którego już napisałeś.

Stan rzeczy i ten jeden plik do odświeżenia

MiniCPM-V 4.7 istnieje. Jego wagi można pobrać już dziś, liczba parametrów jest dokładna, a decyzje projektowe z epoki treningu — rzadki MoE, 3:1 uwagi liniowej, kontekst 256K, 16-krotna kompresja wizualna — są w pełni czytelne z pliku konfiguracyjnego. Nie istnieje natomiast żadne oświadczenie od OpenBMB o tym, co ten model robi, ile kosztuje jego praktyczne uruchomienie ani co wolno z nim robić. Jak na laboratorium, którego ostatni model wizyjny był wydaniem edge o 1,3 mld parametrów na licencji Apache-2.0 z pełną tabelą porównawczą, to rażąca luka, a rozsądną postawą jest obserwowanie repozytorium, a nie dyskursu. Jedynym plikiem, który warto odświeżać, jest README.md: w chwili, gdy się pojawi, będzie zawierać licencję, benchmarki i prawdopodobnie wyjaśnienie, co robi 35B MiniCPM-V w serii zbudowanej na małych modelach.

Do tego czasu uczciwe podsumowanie jest nudne. To prawdziwy checkpoint z prawdziwego laboratorium, wgrany po cichu, a ciekawe pytanie — czy jest coś wart — nie ma opublikowanej odpowiedzi.

OrcaRouter zapewnia dostęp do ponad 200 hostowanych modeli za pomocą jednego klucza, a cena katalogowa każdego dostawcy jest przekazywana bezpośrednio przy 0% marży, z automatycznym przełączaniem awaryjnym między dostawcami.cena katalogowa dostawcy przekazywana bezpośrednio przy 0% marży MiniCPM-V 4.7 nie jest jednym z nich – to checkpoint z otwartymi wagami, który samodzielnie hostujesz, a router to element znajdujący się po drugiej stronie przekazania.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie