Ett genererat hero-titelkort för 'MiniCPM-V 4.7' med undertexten 'En 35B-A3B-visionmodell uppladdad utan modellkort, utan licens och utan benchmarks', ett kort med texten 'Uppladdad 6 oktober 2026', ett checklistkort med texten 'Saknas: modellkort, licens, benchmarks, kvantiseringar', en pill med texten '35,2B parametrar totalt' och en pill med texten '256K kontext', med OrcaRouter-logotypen i nedre högra hörnet.
Engineering & Research

MiniCPM-V 4.7: OpenBMB har laddat upp en 35B-A3B vision-language-modell utan modellkort, utan licens och utan benchmarks

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MiniCPM-V 4.7 dök upp på Hugging Face på kvällen den 6 oktober 2026 som repot openbmb/MiniCPM-V-4.7-35B-A3B – och det är en av de märkligaste sakerna MiniCPM-serien någonsin har släppt, eftersom nästan ingenting släpptes med den. Det finns inget modellkort. Det finns ingen README. Det finns ingen deklarerad licens. Det finns inga benchmark-tabeller, inget lanseringsinlägg, ingen teknisk rapport och ingen post i OpenBMB:s egen GitHub-dokumentation, som i denna vecka fortfarande kallar MiniCPM-V 4.6 för "den senaste och mest effektiva modellen i MiniCPM-V-serien." Det som däremot finns är 16 shards av bfloat16-vikter, 70,4 GB av dem, som beskriver en bild- och språkmodell av mixture-of-experts-typ med 35,2 miljarder parametrar, ett 256K-kontextfönster och en ovanligt aggressiv hybrid-attention-design. Det räcker för att säga vad modellen är. Det räcker ännu inte för att säga vad den är bra på, och den här artikeln håller de två sakerna strikt åtskilda.

Vad som faktiskt landade, byte för byte

Repositoriet skapades kl. 18:36 UTC den 6 oktober 2026 och hade sin sista commit tolv minuter senare kl. 18:48 UTC. Däremellan pushade uppladdaren viktfilerna och den konfiguration som en Transformers-laddare behöver, och slutade. Den fullständiga fillistan består av arton poster:

• Vikter — sexton safetensors-delar med namnen model-00001-of-00016 till model-00016-of-00016, med indexfilen model.safetensors.index.json som anger en total tensorstorlek på 70 425 751 648 byte.

• Parameterantal — Hugging Face-API:et läser 35 212 875 824 parametrar, alla i BF16. Observera att detta är det totala antalet, vilket för en gles MoE inte är antalet parametrar som är aktiva för en given token.

• Konfiguration — config.json (2 984 byte), generation_config.json (186 byte), preprocessor_config.json, processor_config.json.

• Tokenizer — tokenizer.json (20 MB), tokenizer_config.json, och chat_template.jinja (7 250 byte).

• Saknas — README.md. En direkt hämtning av råfilen returnerar HTTP 404. På Hugging Face innebär en saknad README att det inte finns något modellkort, vilket innebär att det inte finns något licensfält, vilket innebär att repot inte har någon license:-tagg alls.

Repositoriet har tre gillamarkeringar, noll nedladdningar och en tom diskussionsflik. En communityuppladdning av en 70 GB-checkpoint brukar dra till sig kommentarer inom några timmar — frågor om kvantiseringar, om servering, om vad licensen är. Den här har inte gjort det, vilket stämmer med att den upptäckts av en handfull personer som bevakar openbmb-organisationen snarare än annonserats till någon.

A generated single-column scoreboard titled 'MiniCPM-V 4.7 — the scoreboard' with six rows: Total parameters 35.2B, 8 of 256 experts; Context 256K tokens; Text backbone Qwen3.5 sparse MoE; Attention 30 of 40 layers linear; Vision 16x downsample, 9 slices; Benchmarks none published, with the footer 'Figures read from config.json and the weight index; no vendor benchmarks exist.'

Arkitekturen, avläst direkt från config.json

Eftersom det inte finns något kort att parafrasera är konfigurationsfilen den primära källan, och den är ovanligt informativ. Klassen är MiniCPMV4_7ForConditionalGeneration, modelltypen är minicpmv4_7, och den sparades av Transformers 5.2.0 — vilket allt säger att detta är en förstaparts-checkpoint från OpenBMB i MiniCPM-V:s huvudlinje, inte en community-fintunad modell som bär namnet.

• Språklig bas — model_type: qwen3_5_moe_text. En Qwen3.5-baserad gles MoE, första gången MiniCPM-V-serien har använt en Qwen-MoE-textstack i stället för de små täta Qwen-varianterna som drev MiniCPM-V 4.5 och 4.6.

• Sparsitet — 256 experter, 8 väljs per token, med en mellanliggande expertstorlek på 512 och en delad expert av samma storlek. En total checkpoint på 35B med ett 8-av-256-routningsmönster aktiverar en liten del av detta per framåtpassning, vilket är hela poängen med namnet A3B: vikterna är stora, beräkningsbehovet är det inte.

• Djup och bredd — 40 dolda lager, dold storlek 2048, 16 uppmärksamhetshuvuden med 2 nyckel-/värdhuvuden och en huvuddimension på 256.

• Hybrid uppmärksamhet — layer_types-arrayen är 40 poster lång och kör tre linear_attention-lager för varje full_attention-lager med ett fast intervall på 4. Tio av de fyrtio lagren använder konventionell uppmärksamhet; de övriga trettio använder en Mamba-liknande linjär väg med en faltningskärna på 4. Detta är det enskilt mest betydelsefulla designvalet i filen, och det är samma riktning som det bredare fältet rörde sig i under 2026.

• Positionskodning – RoPE med ett theta på 10 000 000 och partial_rotary_factor: 0.25, vilket innebär att endast en fjärdedel av dimensionerna för varje head roteras. Multimodal RoPE är aktiverad med mrope_interleaved: true, en sektionsuppdelning på [11, 11, 10] och mrope_mode: canvas.

• Kontext — max_position_embeddings: 262144, och tokenizerns model_max_length stämmer överens. 256K tokens.

• Prediktion av flera token — mtp_num_hidden_layers: 1, ett enda spekulativt avkodningshuvud, samma trick som MiniCPM-V 4.6 använde.

• Vision-torn — minicpmv4_7_vision, dold storlek 1152, 27 lager, GELU-tanh-aktiveringar, patchstorlek 14 med en image_size på 980, och ett insert_layer_id på 6, vilket är där de visuella inbäddningarna skarvas in i språkstacken. Tornets form ligger nära den i MiniCPM-V 4.6, så visionsidan är en vidareutveckling snarare än en ombyggnad.

• Visionskomprimering — downsample_mode: "16x" och max_slice_nums: 9 i bildprocessorn. MiniCPM-V 4.6 introducerade ett omkopplingsbart 4x/16x-schema för tokenkomprimering; 4.7-konfigurationen anger 16x-inställningen som standard, där slicern tillåter upp till nio delbilder för högupplösta indata.

• Vokabulär — 248 144 tokens, med <|image_pad|> vid id 248 056 och <|video_pad|> vid 248 057. Video är en förstklassig indata, precis som det har varit sedan MiniCPM-V 4.5.

• En märklig kvarleva – tokenizer-konfigurationen deklarerar fortfarande <|audio_start|>, <|audio_end|> och <|audio_pad|>. Detta betyder nästan säkert att vokabulären delas med omni-grenen MiniCPM-o snarare än att MiniCPM-V 4.7 talar ljud. Att tolka det som en ljudfunktion vore ett misstag som enbart konfigurationen inte kan utesluta.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tag chips safetensors, minicpmv4_7 and region:us, and the repository file listing beginning with .gitattributes, chat_template.jinja, config.json and generation_config.json, with no README or model card rendered.

Vad familjen berättar för oss som detta arkiv inte gör

4.6-generationen är referenspunkten, och kontrasten är berättelsen. MiniCPM-V 4.6 släpptes den 11 maj 2026 som en modell med 1,3 miljarder parametrar, byggd på en SigLIP2-400M vision-encoder och en Qwen3.5-0.8B språkmodell, under Apache-2.0, med ett uttalat säljargument: den får 13 poäng på Artificial Analysis Intelligence Index — en siffra som rapporterats av leverantören — samtidigt som den använder dramatiskt färre tokens än jämförbara små modeller, och den körs på iOS, Android och HarmonyOS med edge-anpassningskoden som öppen källkod. Hela dess identitet var "liten, effektiv, på enheten."

MiniCPM-V 4.7 är 1,3B multiplicerat med ungefär 27. Namnet 35B-A3B placerar den i den klass som upptas av sparsamma flaggskepp, inte telefoner. Huruvida OpenBMB avser den som en serversidig följeslagare till edge-linjen, som en lärare åt en framtida liten modell eller som ett test av kapacitetstaket anges ingenstans, och förvaret innehåller ingen ledtråd åt något håll.

Det som verkligen är nytt, och värt att uppmärksamma för alla som följer serien, är Qwen-MoE-stommen plus förhållandet 3:1 mellan linjär och full uppmärksamhet. Båda är avsteg. Allt som OpenBMB publicerar om familjen är fortfarande skrivet runt 4.6, så denna checkpoint ligger före sin egen dokumentation.

A screenshot of the GitHub repository OpenBMB/MiniCPM-V (captured 7 October 2026) showing the repository header and README, whose model table lists MiniCPM-V 4.6 as the latest and most efficient model in the MiniCPM-V series — with no mention of MiniCPM-V 4.7 anywhere on the page.

Vad som ännu inte går att veta – och varför den listan spelar roll

Det är värt att vara medveten om hur stort hålet är här, eftersom frestelsen med en 500B-checkpoint är att fylla det med trovärdig data.

• Ingen licens. Detta är inte en formalitet. MiniCPM-V 4.6 är Apache-2.0, och gemenskapen har kommit att förvänta sig det från den här serien. Ett repo utan licens:-tagg är som standard alla rättigheter förbehållna i de flesta jurisdiktioner — du kan inte säkert bygga vidare på det förrän taggen dyker upp. Den där enda saknade filen är den mest betydelsefulla frånvaron i repot.

• Inga benchmarks, vare sig leverantörsrapporterade eller andra. Det finns inte en enda siffra att argumentera om. Den som idag citerar en MMMU- eller OCRBench-poäng för MiniCPM-V 4.7 citerar något som inte finns i källan.

• Ingen oberoende utvärdering. Artificial Analysis och liknande spårare indexerar modeller efter namn; en checkpoint utan kort och utan tillkännagivande förblir vanligtvis omätt ett tag.

• Inget serveringsrecept. Huruvida de släppta vikterna körs omodifierat i vLLM, SGLang eller llama.cpp har inte testats av någon utanför OpenBMB. De anpassade kodvägarna (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) kräver samtliga trust_remote_code, och kombinationen av MoE och linjär attention är inte en form som varje inferensmotor har en kernel för.

• Inga kvantiseringar. MiniCPM-V 4.6 släpptes i GGUF-, AWQ-, GPTQ- och BNB-varianter och nådde Ollamas bibliotek i juni 2026. Det finns inga för 4.7. För en 35B-modell är detta skillnaden mellan en laptop och ett kluster.

• Ingen koppling till 4.6 anges. OpenBMB kan ersätta edge-linjen, förlänga den eller testa något ortogonalt. Repositoriet säger inget om det, och inte heller GitHub-README-filen, som fortfarande listar 4.6 som aktuell utgåva i och med sin commit från den 8 september 2026.

Det finns också en rimlig men obekräftad tolkning av tidslinjen: tolvminutersgapet mellan att repot skapades och den senaste commiten, avsaknaden av ett kort och avsaknaden av ett inlägg är vad en kontrollpunkt ser ut som när den förbereds för en lansering snarare än efter en. Det är en hypotes om avsikt, inte ett faktum om artefakten, och den bör behandlas som en sådan.

Hur du faktiskt skulle köra det, när det finns något att köra

Inget här är ännu citerbart som en väg som stöds, men konfigurationen begränsar ändå alternativen. En BF16-checkpoint med 35B parametrar behöver ungefär 70 GB acceleratorminne innan KV-cachen räknas in, så driftsättning på en enda GPU för hobbybruk är inte aktuellt förrän kvantiseringarna finns. 256K-kontexten och 3:1-kvoten för linjär attention innebär att KV-cachen växer mycket långsammare än i en konventionell transformer med samma djup, vilket är precis varför den arkitekturen är värd komplexiteten – långkontextuellt multimodalt arbete är där designen betalar sig. När ett kort dyker upp är det första man bör kontrollera licensen, om ett officiellt vLLM- eller SGLang-recept har publicerats, och om standardinställningen för 16x nedsampling kan bytas mot den 4x-inställning som 4.6 exponerade.

För team som vill utvärdera en modell som denna i samma stund som den blir användbar är det praktiska problemet inte vikterna, utan infrastrukturen runt dem. En modell som ligger på din egen GPU behöver fortfarande allt runt omkring sig – en router som sätter över 200 hostade modeller bakom en enda nyckel, till varje leverantörs listpris utan vårt eget påslag ovanpå, och som automatiskt växlar över när en leverantör försämras. Det är vad OrcaRouter är till för, och det är värt att säga rakt ut att MiniCPM-V 4.7 i sig inte är en hostad modell: det är en checkpoint med öppna vikter som du serverar själv. Routern har betydelse här som den andra halvan av arkitekturen – frontiermodellen som din 4.7-box överlämnar de svåra fallen till, nåbar genom samma klient som du redan har skrivit.

Nuläget, och den enda filen att uppdatera

MiniCPM-V 4.7 existerar. Dess vikter går att ladda ner idag, antalet vikter är exakt, och dess designval från träningstiden — gles MoE, 3:1 linjär attention, 256K kontext, 16x visuell komprimering — är alla läsbara från konfigurationsfilen. Vad som inte existerar är något uttalande från OpenBMB om vad modellen gör, vad den kostar att köra i praktiken, eller vad du får göra med den. För ett labb vars senaste visionsmodell var en 1,3B Apache-2.0 edge-utgåva med en fullständig jämförelsetabell är det ett störande gap, och den kloka hållningen är att bevaka repositoriet snarare än diskursen. Den enda filen att fortsätta uppdatera är README.md: i samma stund den dyker upp kommer den att innehålla licensen, benchmarks och förmodligen förklaringen till vad en 35B MiniCPM-V gör i en serie byggd på små modeller.

Fram till dess är den ärliga sammanfattningen den tråkiga. Det här är en riktig checkpoint från ett riktigt labb, uppladdad i tysthet, och den intressanta frågan – är den något att ha – har inget publicerat svar.

OrcaRouter når över 200 hostade modeller via en enda nyckel, med varje leverantörs listpris som förs vidare direkt med 0 % påslag och automatisk redundansväxling mellan leverantörer. leverantörens listpris förs vidare med 0 % påslag MiniCPM-V 4.7 är inte en av dem – det är en checkpoint med öppna vikter som du själv serverar, och routern är det som sitter på andra sidan överlämningen.