Kartu judul hero yang dihasilkan untuk 'MiniCPM-V 4.7' dengan subjudul 'Model visi 35B-A3B yang diunggah tanpa kartu model, tanpa lisensi, dan tanpa tolok ukur', kartu bertuliskan 'Diunggah 6 Okt 2026', kartu daftar periksa bertuliskan 'Tidak ada: kartu model, lisensi, tolok ukur, kuantisasi', pil bertuliskan 'total parameter 35,2B' dan pil bertuliskan 'konteks 256K', dengan logo OrcaRouter di sudut kanan bawah.
Engineering & Research

MiniCPM-V 4.7: OpenBMB Mengunggah Model Visi-Bahasa 35B-A3B Tanpa Kartu Model, Tanpa Lisensi, dan Tanpa Tolok Ukur

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

MiniCPM-V 4.7 muncul di Hugging Face pada malam tanggal 6 Oktober 2026 sebagai repositori openbmb/MiniCPM-V-4.7-35B-A3B — dan ini salah satu hal teraneh yang pernah dirilis seri MiniCPM, karena hampir tidak ada apa pun yang dirilis bersamanya. Tidak ada kartu model. Tidak ada README. Tidak ada lisensi yang dinyatakan. Tidak ada tabel benchmark, tidak ada tulisan peluncuran, tidak ada laporan teknis, dan tidak ada entri dalam dokumentasi GitHub OpenBMB sendiri, yang hingga pekan ini masih menyebut MiniCPM-V 4.6 sebagai "model terbaru dan paling efisien dalam seri MiniCPM-V." Yang ada hanyalah 16 shard bobot bfloat16, 70,4 GB, yang mendeskripsikan model vision-language mixture-of-experts berparameter 35,2 miliar dengan jendela konteks 256K dan desain hybrid-attention yang luar biasa agresif. Itu sudah cukup untuk mengatakan seperti apa model ini. Itu belum cukup untuk mengatakan apa keunggulannya, dan artikel ini menjaga kedua hal itu tetap terpisah secara tegas.

Apa yang sebenarnya terkirim, byte demi byte

Repositori tersebut dibuat pada 18:36 UTC tanggal 6 Oktober 2026 dan memiliki commit terakhir dua belas menit kemudian, pada 18:48 UTC. Di sela-sela waktu itu, pengunggah mengirim file bobot dan konfigurasi yang dibutuhkan oleh pemuat Transformers, lalu berhenti. Daftar file lengkapnya terdiri dari delapan belas entri:

• Bobot — enam belas safetensors shard bernama model-00001-of-00016 hingga model-00016-of-00016, dengan file indeks model.safetensors.index.json yang melaporkan total ukuran tensor sebesar 70,425,751,648 byte.

• Jumlah parameter — API Hugging Face membaca 35.212.875.824 parameter, semuanya dalam BF16. Perhatikan bahwa ini adalah total jumlah, yang untuk MoE sparse bukanlah jumlah parameter yang aktif pada token mana pun.

• Konfigurasi — config.json (2.984 byte), generation_config.json (186 byte), preprocessor_config.json, processor_config.json.

• Tokenizer — tokenizer.json (20 MB), tokenizer_config.json, dan chat_template.jinja (7.250 byte).

• Tidak ada — README.md. Pengambilan langsung file mentah mengembalikan HTTP 404. Di Hugging Face, README yang hilang berarti tidak ada kartu model, yang berarti tidak ada bidang lisensi, yang berarti repositori tidak membawa license: tag sama sekali.

Repositori ini memiliki tiga suka, nol unduhan, dan tab diskusi yang kosong. Unggahan komunitas berupa checkpoint 70 GB biasanya menarik komentar dalam hitungan jam — pertanyaan tentang kuantisasi, tentang serving, tentang apa lisensinya. Yang ini tidak, yang konsisten dengan fakta bahwa ini ditemukan oleh segelintir orang yang mengamati organisasi openbmb alih-alih diumumkan kepada siapa pun.

A generated single-column scoreboard titled 'MiniCPM-V 4.7 — the scoreboard' with six rows: Total parameters 35.2B, 8 of 256 experts; Context 256K tokens; Text backbone Qwen3.5 sparse MoE; Attention 30 of 40 layers linear; Vision 16x downsample, 9 slices; Benchmarks none published, with the footer 'Figures read from config.json and the weight index; no vendor benchmarks exist.'

Arsitekturnya, dibaca langsung dari config.json

Karena tidak ada kartu yang bisa diparafrasekan, file konfigurasi menjadi sumber utama, dan isinya sangat informatif. Kelasnya adalah MiniCPMV4_7ForConditionalGeneration, tipe modelnya adalah minicpmv4_7, dan model ini disimpan oleh Transformers 5.2.0 — semuanya menunjukkan bahwa ini adalah checkpoint pihak pertama OpenBMB dalam garis keturunan utama MiniCPM-V, bukan fine-tune komunitas yang memakai nama tersebut.

• Tulang punggung bahasa — model_type: qwen3_5_moe_text. MoE sparse turunan Qwen3.5, pertama kalinya lini MiniCPM-V menggunakan stack teks Qwen-MoE alih-alih varian Qwen kecil dense yang menggerakkan MiniCPM-V 4.5 dan 4.6.

• Sparsitas — 256 expert, 8 dipilih per token, dengan ukuran intermediate expert 512 dan expert bersama dengan ukuran yang sama. Checkpoint total 35B pada pola routing 8-dari-256 mengaktifkan sebagian kecil dari itu per forward pass, yang merupakan inti dari nama A3B: bobotnya besar, komputasinya tidak.

• Kedalaman dan lebar — 40 lapisan tersembunyi, ukuran tersembunyi 2048, 16 kepala atensi dengan 2 kepala kunci/nilai dan dimensi kepala 256.

• Atensi hybrid — layer_types array tersebut panjangnya 40 entri dan menggunakan tiga lapisan linear_attention untuk setiap satu lapisan full_attention pada interval tetap 4. Sepuluh dari empat puluh lapisan melakukan atensi konvensional; tiga puluh lainnya menggunakan jalur linear bergaya Mamba dengan kernel konvolusi 4. Ini adalah pilihan desain yang paling berdampak dalam file, dan ini adalah arah yang sama yang ditempuh bidang yang lebih luas sepanjang 2026.

• Pengodean posisi — RoPE dengan theta 10.000.000 dan partial_rotary_factor: 0.25, yang berarti hanya seperempat dari dimensi setiap head yang dirotasi. RoPE multimodal diaktifkan dengan mrope_interleaved: true, pemisahan bagian [11, 11, 10], dan mrope_mode: canvas.

• Konteks — max_position_embeddings: 262144, dan model_max_length tokenizer sesuai. 256K token.

• Prediksi multi-token — mtp_num_hidden_layers: 1, satu head speculative-decoding, trik yang sama yang dibawa MiniCPM-V 4.6.

• Menara visi — minicpmv4_7_vision, ukuran tersembunyi 1152, 27 lapisan, aktivasi GELU-tanh, ukuran patch 14 dengan sebuah image_size sebesar 980, dan sebuah insert_layer_id sebesar 6, yaitu tempat embedding visual disambungkan ke dalam stack bahasa. Bentuk menara ini mendekati yang ada di MiniCPM-V 4.6, jadi sisi visi merupakan evolusi, bukan pembangunan ulang.

• Vision compression — downsample_mode: "16x" dan max_slice_nums: 9 di pemroses gambar. MiniCPM-V 4.6 memperkenalkan skema kompresi token 4x/16x yang dapat dialihkan; konfigurasi 4.7 mengiklankan pengaturan 16x sebagai default, dengan slicer yang memungkinkan hingga sembilan sub-gambar untuk input resolusi tinggi.

• Kosakata — 248.144 token, dengan <|image_pad|> pada id 248.056 dan <|video_pad|> pada 248.057. Video adalah input kelas satu, persis seperti sejak MiniCPM-V 4.5.

• Sisa yang menarik — konfigurasi tokenizer masih mendeklarasikan <|audio_start|>, <|audio_end|> dan <|audio_pad|>. Ini hampir pasti berarti kosakata tersebut digunakan bersama dengan cabang omni MiniCPM-o, bukan bahwa MiniCPM-V 4.7 mampu menangani audio. Menafsirkannya sebagai fitur audio akan menjadi kesalahan yang tidak dapat dikesampingkan hanya oleh konfigurasi.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tag chips safetensors, minicpmv4_7 and region:us, and the repository file listing beginning with .gitattributes, chat_template.jinja, config.json and generation_config.json, with no README or model card rendered.

Apa yang keluarga sampaikan kepada kita yang tidak disampaikan oleh repositori ini

Generasi 4.6 adalah titik acuannya, dan kontrasnya adalah inti ceritanya. MiniCPM-V 4.6 dirilis pada 11 Mei 2026 sebagai model 1,3 miliar parameter yang dibangun di atas encoder visi SigLIP2-400M dan model bahasa Qwen3.5-0.8B, di bawah lisensi Apache-2.0, dengan klaim eksplisit: model ini mencetak skor 13 pada Artificial Analysis Intelligence Index — angka yang dilaporkan vendor — sekaligus menggunakan token yang jauh lebih sedikit dibandingkan model kecil sebanding, dan berjalan di iOS, Android, serta HarmonyOS dengan kode adaptasi edge yang open-source. Seluruh identitasnya adalah "kecil, efisien, di perangkat."

MiniCPM-V 4.7 adalah 1,3B dikalikan kira-kira 27. Nama 35B-A3B menempatkannya di kelas yang ditempati oleh model-model unggulan sparse, bukan ponsel. Apakah OpenBMB memaksudkannya sebagai pendamping sisi server untuk lini edge, sebagai guru bagi model kecil masa depan, atau sebagai uji plafon kemampuan tidak dinyatakan di mana pun, dan repositori tidak memuat petunjuk ke arah mana pun.

Apa yang benar-benar baru, dan layak disorot bagi siapa pun yang mengikuti seri ini, adalah tulang punggung Qwen-MoE plus rasio attention linear-ke-penuh 3:1. Keduanya merupakan penyimpangan. Semua yang OpenBMB publikasikan tentang keluarga ini masih ditulis seputar 4.6, jadi checkpoint ini berjalan mendahului dokumentasinya sendiri.

A screenshot of the GitHub repository OpenBMB/MiniCPM-V (captured 7 October 2026) showing the repository header and README, whose model table lists MiniCPM-V 4.6 as the latest and most efficient model in the MiniCPM-V series — with no mention of MiniCPM-V 4.7 anywhere on the page.

Apa yang belum dapat diketahui — dan mengapa daftar itu penting

Ada baiknya bersikap terus terang tentang besarnya lubang di sini, karena godaan dengan checkpoint 70 GB adalah mengisinya dengan inferensi yang masuk akal.

• Tidak ada lisensi. Ini bukan formalitas. MiniCPM-V 4.6 adalah Apache-2.0, dan komunitas sudah mengharapkan hal itu dari lini ini. Repo tanpa lisensi: tag secara default berada dalam status seluruh hak dilindungi di sebagian besar yurisdiksi — Anda tidak dapat membangun di atasnya dengan aman sampai tag tersebut muncul. File tunggal yang hilang itu adalah ketiadaan yang paling berdampak di repositori ini.

• Tidak ada tolok ukur, baik yang dilaporkan vendor maupun sebaliknya. Tidak ada satu pun angka yang bisa diperdebatkan. Siapa pun yang mengutip skor MMMU atau OCRBench untuk MiniCPM-V 4.7 hari ini sedang mengutip sesuatu yang tidak ada di sumbernya.

• Tidak ada evaluasi independen. Artificial Analysis dan pelacak serupa mengindeks model berdasarkan nama; checkpoint yang tidak punya kartu model dan tidak diumumkan biasanya tidak terukur untuk sementara waktu.

• Tidak ada resep penyajian. Apakah bobot yang dirilis dapat berjalan standar di vLLM, SGLang, atau llama.cpp belum diuji oleh siapa pun di luar OpenBMB. Jalur kode kustom (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) semuanya memerlukan trust_remote_code, dan kombinasi MoE plus linear-attention bukanlah bentuk yang sudah tersedia kernel-nya di setiap mesin inferensi.

• Tidak ada kuantisasi. MiniCPM-V 4.6 merilis varian GGUF, AWQ, GPTQ, dan BNB, serta masuk ke pustaka Ollama pada Juni 2026. Tidak ada yang tersedia untuk 4.7. Bagi model 35B, ini adalah perbedaan antara laptop dan klaster.

• Tidak ada hubungan dengan 4.6 yang dinyatakan. OpenBMB mungkin menggantikan lini edge, memperluasnya, atau menguji sesuatu yang ortogonal. Repositori tidak menyebutkannya, dan README GitHub juga tidak, yang masih mencantumkan 4.6 sebagai rilis terkini per commit 8 September 2026-nya.

Ada pula pembacaan lini masa yang masuk akal tetapi belum terkonfirmasi: jeda dua belas menit antara pembuatan repo dan commit terakhir, tidak adanya kartu, dan tidak adanya postingan apa pun adalah bentuk sebuah checkpoint ketika disiapkan untuk peluncuran, bukan setelahnya. Itu adalah hipotesis tentang niat, bukan fakta tentang artefak, dan harus diperlakukan sebagai hipotesis.

Bagaimana Anda sebenarnya akan menjalankannya, ketika ada sesuatu untuk dijalankan

Belum ada yang dapat dikutip sebagai jalur yang didukung, tetapi konfigurasi ini memang membatasi opsi. Checkpoint BF16 berparameter 35B membutuhkan sekitar 70 GB memori akselerator sebelum KV cache, jadi penerapan oleh penghobi dengan satu GPU tidak mungkin dilakukan sampai kuantisasi tersedia. Konteks 256K dan rasio linear-attention 3:1 berarti KV cache bertambah jauh lebih lambat daripada transformer konvensional dengan kedalaman yang sama, dan justru itulah alasan arsitektur tersebut layak menanggung kompleksitasnya — pekerjaan multimodal konteks panjanglah yang membuat desain ini terbayar dengan sendirinya. Saat sebuah kartu muncul, hal pertama yang perlu diperiksa adalah lisensi, apakah resep resmi vLLM atau SGLang sudah dipublikasikan, dan apakah default downsample 16x dapat ditukar dengan pengaturan 4x yang diungkap oleh 4.6.

Bagi tim yang ingin mengevaluasi model seperti ini begitu model tersebut layak digunakan, masalah praktisnya bukanlah bobotnya, melainkan infrastruktur di sekitarnya. Model yang berjalan di GPU Anda sendiri tetap membutuhkan segala hal di sekelilingnya — router yang menempatkan 200-an model terkelola di balik satu kunci, pada harga daftar masing-masing penyedia tanpa tambahan markup dari kami, dan yang otomatis melakukan failover saat penyedia mengalami penurunan layanan. Itulah fungsi OrcaRouter, dan perlu dikatakan secara gamblang bahwa MiniCPM-V 4.7 sendiri bukanlah model terkelola: ia adalah checkpoint berbobot terbuka yang Anda jalankan sendiri. Router berperan penting di sini sebagai separuh lain dari arsitektur — model frontier yang menjadi tujuan kotak 4.7 Anda untuk menyerahkan kasus-kasus sulit, yang dapat dijangkau melalui klien yang sama yang sudah Anda tulis.

Situasi terkini, dan satu file yang perlu di-refresh

MiniCPM-V 4.7 sudah ada. Bobotnya dapat diunduh hari ini, jumlah bobotnya tepat, dan pilihan desain era pelatihannya — MoE sparse, atensi linear 3:1, konteks 256K, kompresi visual 16x — semuanya terbaca dari file konfigurasi. Yang tidak ada adalah pernyataan apa pun dari OpenBMB tentang apa yang dilakukan model ini, berapa biaya menjalankannya dalam praktik, atau apa yang boleh Anda lakukan dengannya. Bagi sebuah laboratorium yang model visi terakhirnya adalah rilis edge 1.3B Apache-2.0 dengan tabel perbandingan lengkap, itu adalah celah yang mengganggu, dan sikap yang masuk akal adalah memantau repositori alih-alih wacana. Satu file yang perlu terus dimuat ulang adalah README.md: begitu file itu muncul, ia akan memuat lisensi, tolok ukur, dan mungkin penjelasan tentang apa yang dilakukan MiniCPM-V 35B dalam seri yang dibangun di atas model-model kecil.

Sampai saat itu, ringkasan yang jujur adalah yang membosankan. Ini adalah checkpoint nyata dari lab nyata, diunggah secara diam-diam, dan pertanyaan yang menarik — apakah kualitasnya bagus — belum memiliki jawaban yang dipublikasikan.

OrcaRouter menjangkau lebih dari 200 model terkelola melalui satu kunci, dengan harga daftar setiap penyedia diteruskan langsung pada markup 0% dan failover otomatis antar penyedia. harga daftar penyedia diteruskan pada markup 0% MiniCPM-V 4.7 bukan salah satunya - ini adalah checkpoint berbobot terbuka yang Anda layani sendiri, dan router-lah yang berada di sisi jauh dari serah terima tersebut.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari