
MiniCPM-V 4.7: OpenBMB đã tải lên một mô hình ngôn ngữ-thị giác 35B-A3B không có thẻ mô hình, không có giấy phép và không có benchmark
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
MiniCPM-V 4.7 xuất hiện trên Hugging Face vào tối ngày 6 tháng 10 năm 2026 dưới dạng kho lưu trữ openbmb/MiniCPM-V-4.7-35B-A3B — và đây là một trong những thứ kỳ lạ nhất mà dòng MiniCPM từng phát hành, bởi vì gần như chẳng có gì được phát hành kèm theo nó. Không có model card. Không có README. Không có giấy phép nào được công bố. Không có bảng benchmark, không có bài đăng ra mắt, không có báo cáo kỹ thuật, và không có mục nào trong tài liệu GitHub của chính OpenBMB, nơi tính đến tuần này vẫn gọi MiniCPM-V 4.6 là "mô hình mới nhất và hiệu quả nhất trong dòng MiniCPM-V". Thứ thực sự tồn tại là 16 phân đoạn trọng số bfloat16, tổng cộng 70,4 GB, mô tả một mô hình ngôn ngữ - thị giác dạng hỗn hợp chuyên gia 35,2 tỷ tham số với cửa sổ ngữ cảnh 256K và một thiết kế attention lai mạnh mẽ đến mức bất thường. Ngần ấy đủ để nói mô hình là gì. Vẫn chưa đủ để nói nó giỏi ở điểm nào, và bài viết này giữ hai điều đó tách biệt hoàn toàn.
Điều gì thực sự đã được triển khai, chính xác đến từng byte
Kho lưu trữ được tạo lúc 18:36 UTC ngày 6 tháng 10 năm 2026 và có lần commit cuối cùng mười hai phút sau đó, vào lúc 18:48 UTC. Trong khoảng thời gian đó, người tải lên đã đẩy các tệp trọng số và cấu hình mà bộ nạp Transformers cần, rồi dừng lại. Danh sách tệp đầy đủ dài mười tám mục:
• Trọng số — mười sáu safetensors phân đoạn được đặt tên model-00001-of-00016 đến model-00016-of-00016, với tệp chỉ mục model.safetensors.index.json báo cáo tổng kích thước tensor là 70,425,751,648 byte.
• Số lượng tham số — API Hugging Face đọc được 35.212.875.824 tham số, tất cả đều ở định dạng BF16. Lưu ý rằng đây là tổng số lượng, mà đối với một MoE thưa thì không phải là số tham số hoạt động trên bất kỳ token cụ thể nào.
• Cấu hình — config.json (2.984 byte), generation_config.json (186 byte), preprocessor_config.json, processor_config.json.
• Tokenizer — tokenizer.json (20 MB), tokenizer_config.json, và chat_template.jinja (7.250 byte).
• Thiếu — README.md. Việc tải trực tiếp tệp raw sẽ trả về HTTP 404. Trên Hugging Face, thiếu README nghĩa là không có model card, nghĩa là không có trường giấy phép, nghĩa là repo hoàn toàn không mang thẻ license: nào.
Kho lưu trữ có ba lượt thích, không có lượt tải xuống nào và một tab thảo luận trống trơn. Một bản tải lên cộng đồng với checkpoint 70 GB thường thu hút bình luận trong vòng vài giờ — các câu hỏi về các bản quant, về cách phục vụ, về giấy phép là gì. Bản này thì không, điều đó khớp với việc nó đã được phát hiện bởi một số ít người đang theo dõi openbmb – một tổ chức – chứ không phải được thông báo cho bất kỳ ai.

Kiến trúc, đọc thẳng từ config.json
Vì không có card nào để diễn giải lại, tệp cấu hình chính là nguồn thông tin chính, và nó chứa thông tin đặc biệt hữu ích. Lớp là MiniCPMV4_7ForConditionalGeneration, kiểu mô hình là minicpmv4_7, và nó được lưu bởi Transformers 5.2.0 — tất cả những điều này đều cho thấy đây là một checkpoint chính chủ của OpenBMB thuộc dòng MiniCPM-V chính thống, chứ không phải một bản fine-tune của cộng đồng khoác lên cái tên đó.
• Trụ cột ngôn ngữ — model_type: qwen3_5_moe_text. Một MoE thưa (sparse) bắt nguồn từ Qwen3.5, đánh dấu lần đầu tiên dòng MiniCPM-V sử dụng ngăn xếp văn bản Qwen-MoE thay vì các biến thể Qwen nhỏ dạng dense vốn đã vận hành MiniCPM-V 4.5 và 4.6.
Độ thưa — 256 chuyên gia, 8 chuyên gia được chọn cho mỗi token, với kích thước trung gian của chuyên gia là 512 và một chuyên gia chia sẻ có cùng kích thước. Một checkpoint tổng 35B trên mẫu định tuyến 8-trong-256 chỉ kích hoạt một phần nhỏ trong số đó mỗi lượt truyền xuôi, và đó chính là toàn bộ ý nghĩa của tên A3B: trọng số thì lớn, còn khối lượng tính toán thì không.
• Độ sâu và độ rộng — 40 lớp ẩn, kích thước ẩn 2048, 16 đầu chú ý với 2 đầu khóa/giá trị và số chiều mỗi đầu là 256.
• Attention lai — layer_types là một mảng dài 40 phần tử và cứ ba lớp linear_attention thì có một lớp full_attention theo chu kỳ cố định là 4. Mười trong số bốn mươi lớp dùng attention thông thường; ba mươi lớp còn lại dùng đường tuyến tính kiểu Mamba với hạt nhân tích chập bằng 4. Đây là lựa chọn thiết kế hệ trọng nhất trong tệp, và nó cùng hướng với việc cả lĩnh vực rộng lớn hơn đã chuyển dịch trong suốt năm 2026.
• Mã hóa vị trí — RoPE với theta là 10.000.000 và partial_rotary_factor: 0.25, nghĩa là chỉ một phần tư số chiều của mỗi head được xoay. RoPE đa phương thức được bật với mrope_interleaved: true, phân tách phần là [11, 11, 10], và mrope_mode: canvas.
• Ngữ cảnh — max_position_embeddings: 262144, và model_max_length của tokenizer khớp. 256K token.
• Dự đoán đa token — mtp_num_hidden_layers: 1, một đầu giải mã suy đoán duy nhất, cũng chính là thủ thuật mà MiniCPM-V 4.6 đã áp dụng.
• Tháp thị giác — minicpmv4_7_vision, kích thước ẩn 1152, 27 lớp, hàm kích hoạt GELU-tanh, kích thước patch 14 với image_size là 980, và insert_layer_id là 6, đây là nơi các embedding thị giác được ghép vào ngăn xếp ngôn ngữ. Hình dạng của tháp gần giống với phiên bản trong MiniCPM-V 4.6, nên phần thị giác là một bước tiến hóa chứ không phải là một bản dựng lại từ đầu.
• Nén thị giác — downsample_mode: "16x" và max_slice_nums: 9 trong bộ xử lý hình ảnh. MiniCPM-V 4.6 đã giới thiệu một cơ chế nén token 4x/16x có thể chuyển đổi; cấu hình 4.7 công bố cài đặt 16x là mặc định, với bộ cắt cho phép tối đa chín ảnh con cho đầu vào độ phân giải cao.
• Từ vựng — 248,144 token, với <|image_pad|> ở id 248,056 và <|video_pad|> ở id 248,057. Video là một đầu vào hạng nhất, đúng như nó đã từng như vậy kể từ MiniCPM-V 4.5.
• Một chi tiết thừa đáng tò mò — cấu hình tokenizer vẫn khai báo <|audio_start|>, <|audio_end|> và <|audio_pad|>. Điều này gần như chắc chắn có nghĩa là từ vựng được dùng chung với nhánh omni MiniCPM-o chứ không phải rằng MiniCPM-V 4.7 biết xử lý âm thanh. Diễn giải nó như một đặc trưng âm thanh sẽ là một sai lầm mà chỉ riêng cấu hình không thể loại trừ.

Những gì gia đình kể cho chúng ta mà kho lưu trữ này không có
Thế hệ 4.6 là điểm tham chiếu, và sự tương phản chính là câu chuyện. MiniCPM-V 4.6 được phát hành vào ngày 11 tháng 5 năm 2026 dưới dạng mô hình 1,3 tỷ tham số, được xây dựng trên bộ mã hóa thị giác SigLIP2-400M và mô hình ngôn ngữ Qwen3.5-0.8B, theo Apache-2.0, với một lời giới thiệu rõ ràng: nó đạt 13 điểm trên Artificial Analysis Intelligence Index — một con số do nhà cung cấp báo cáo — trong khi sử dụng ít token hơn đáng kể so với các mô hình nhỏ tương đương, và nó chạy trên iOS, Android và HarmonyOS với mã thích ứng biên được mã nguồn mở. Toàn bộ bản sắc của nó là “nhỏ gọn, hiệu quả, chạy trên thiết bị”.
MiniCPM-V 4.7 là 1,3B nhân với khoảng 27. Cái tên 35B-A3B đặt nó vào cùng hạng với các mẫu flagship thưa, chứ không phải điện thoại. Liệu OpenBMB có ý định dùng nó như một người bạn đồng hành phía máy chủ cho dòng edge, như một giáo viên cho một mô hình nhỏ trong tương lai, hay như một phép thử trần năng lực thì không được nêu ở đâu cả, và kho mã nguồn cũng không có gợi ý nào theo bất kỳ hướng nào.
Điều thực sự mới, và đáng để lưu ý cho bất kỳ ai đang theo dõi loạt này, là xương sống Qwen-MoE cùng với tỷ lệ 3:1 giữa attention tuyến tính và attention đầy đủ. Cả hai đều là những hướng đi khác. Mọi thứ OpenBMB công bố về họ mô hình này vẫn được viết xoay quanh 4.6, nên checkpoint này đang vượt trước tài liệu của chính nó.

Điều gì vẫn chưa thể biết được — và vì sao danh sách đó lại quan trọng
Đáng để nói thẳng về kích thước của lỗ hổng ở đây, bởi vì với một checkpoint 70 GB, cám dỗ là lấp đầy nó bằng suy luận nghe có vẻ hợp lý.
• Không có giấy phép. Đây không phải là chuyện hình thức. MiniCPM-V 4.6 dùng Apache-2.0, và cộng đồng đã quen kỳ vọng điều đó ở dòng sản phẩm này. Một repo không có license: tag thì theo mặc định sẽ bảo lưu toàn bộ quyền ở hầu hết các khu vực tài phán — bạn không thể yên tâm xây dựng dựa trên nó cho đến khi tag đó xuất hiện. Chỉ một tệp bị thiếu đó thôi đã là sự thiếu vắng hệ trọng nhất trong repository.
• Không có benchmark nào, dù do nhà cung cấp báo cáo hay từ bất kỳ nguồn nào khác. Không có một con số nào để tranh cãi. Bất kỳ ai hôm nay trích dẫn điểm MMMU hay OCRBench cho MiniCPM-V 4.7 đều đang trích dẫn một thứ không tồn tại trong nguồn.
Không có đánh giá độc lập. Artificial Analysis và các trình theo dõi tương tự lập chỉ mục mô hình theo tên; một checkpoint không có card mô hình và không có thông báo thường sẽ nằm đó không được đo lường trong một thời gian.
• Không có công thức phục vụ nào. Việc các trọng số được phát hành có chạy nguyên bản trên vLLM, SGLang hay llama.cpp hay không thì chưa được bất kỳ ai ngoài OpenBMB kiểm thử. Các đường dẫn mã tùy chỉnh (MiniCPMV4_7ForConditionalGeneration, MiniCPMV4_7Processor, MiniCPMV4_7ImageProcessor, MiniCPMV4_7VideoProcessor) đều yêu cầu trust_remote_code, và sự kết hợp MoE cùng linear-attention không phải là dạng mà mọi engine suy luận đều có kernel cho.
• Không có lượng tử hóa. MiniCPM-V 4.6 đã phát hành các biến thể GGUF, AWQ, GPTQ và BNB, và có mặt trong thư viện của Ollama vào tháng 6 năm 2026. Không có bản nào dành cho 4.7. Với một mô hình 35B, đây là sự khác biệt giữa một chiếc laptop và một cụm máy chủ.
• Không có mối liên hệ nào với 4.6 được nêu rõ. OpenBMB có thể đang thay thế dòng edge, mở rộng nó, hoặc thử nghiệm một thứ gì đó trực giao. Kho lưu trữ không nói rõ, và README trên GitHub cũng vậy, vẫn liệt kê 4.6 là bản phát hành hiện tại tính đến commit ngày 8 tháng 9 năm 2026.
Cũng có một cách lý giải hợp lý nhưng chưa được xác nhận về dòng thời gian: khoảng cách mười hai phút giữa lúc tạo repo và lần commit cuối cùng, việc không có card, và việc không có bất kỳ bài đăng nào chính là dáng vẻ của một checkpoint khi nó được dàn dựng cho một đợt ra mắt thay vì sau một đợt ra mắt. Đó là một giả thuyết về ý định, không phải một sự thật về hiện vật, và nó nên được xem là như vậy.
Cách bạn thực sự sẽ chạy nó, khi có thứ gì đó để chạy
Chưa có gì ở đây có thể được trích dẫn như một lộ trình được hỗ trợ, nhưng cấu hình thì có ràng buộc các lựa chọn. Một checkpoint BF16 35 tỷ tham số cần khoảng 70 GB bộ nhớ accelerator trước cả KV cache, nên triển khai single-GPU cho người dùng nghiệp dư là không khả thi cho đến khi các bản lượng tử hóa ra mắt. Ngữ cảnh 256K và tỷ lệ linear-attention 3:1 khiến KV cache tăng chậm hơn nhiều so với một transformer thông thường có cùng độ sâu, và đó chính xác là lý do kiến trúc này đáng để chấp nhận độ phức tạp — công việc đa phương thức ngữ cảnh dài là nơi thiết kế này tự hoàn vốn. Khi một card xuất hiện, những điều đầu tiên cần kiểm tra là giấy phép, liệu có recipe vLLM hoặc SGLang chính thức nào được công bố hay không, và liệu mặc định downsample 16x có thể được đổi sang thiết lập 4x mà 4.6 đã tiết lộ hay không.
Đối với các nhóm muốn đánh giá một mô hình như thế này ngay khi nó trở nên dùng được, vấn đề thực tế không nằm ở trọng số, mà ở phần hạ tầng kết nối xung quanh chúng. Một mô hình chạy trên GPU của chính bạn vẫn cần mọi thứ xung quanh nó — một router đưa hơn 200 mô hình được lưu trữ đằng sau một khóa, ở mức giá niêm yết của từng nhà cung cấp mà không cộng thêm khoản chênh lệch nào của chúng tôi, và tự động chuyển đổi dự phòng khi một nhà cung cấp bị suy giảm. Đó là mục đích của OrcaRouter, và cần nói thẳng rằng bản thân MiniCPM-V 4.7 không phải là mô hình được lưu trữ: nó là một checkpoint trọng số mở do bạn tự phục vụ. Router ở đây quan trọng với vai trò nửa còn lại của kiến trúc — mô hình tiên tiến mà cỗ máy 4.7 của bạn chuyển những ca khó cho, có thể truy cập qua chính client bạn đã viết.
Tình hình hiện tại và tệp duy nhất cần làm mới
MiniCPM-V 4.7 đã tồn tại. Trọng số của nó có thể tải về ngay hôm nay, số lượng trọng số của nó là chính xác, và những lựa chọn thiết kế từ thời huấn luyện — MoE thưa, attention tuyến tính theo tỉ lệ 3:1, ngữ cảnh 256K, nén thị giác 16x — đều có thể đọc được từ tệp cấu hình. Điều không tồn tại là bất kỳ tuyên bố nào từ OpenBMB về việc mô hình làm được gì, chi phí vận hành trên thực tế ra sao, hay bạn được phép làm gì với nó. Với một phòng thí nghiệm mà mô hình thị giác gần nhất là bản phát hành biên 1.3B theo giấy phép Apache-2.0 kèm bảng so sánh đầy đủ, đó là một khoảng trống đáng giật mình, và thái độ hợp lý là theo dõi kho lưu trữ thay vì theo dõi những lời bàn tán. Tệp duy nhất cần liên tục làm mới là README.md: ngay khi nó xuất hiện, nó sẽ mang theo giấy phép, các benchmark, và có lẽ cả lời giải thích về việc một MiniCPM-V 35B đang làm gì trong một dòng sản phẩm vốn được xây dựng trên các mô hình nhỏ.
Cho đến lúc đó, bản tóm tắt trung thực vẫn chỉ là một điều nhàm chán. Đây là một checkpoint thật từ một lab thật, được tải lên một cách âm thầm, và câu hỏi thú vị — liệu nó có tốt hay không — vẫn chưa có câu trả lời nào được công bố.
OrcaRouter truy cập hơn 200 mô hình được lưu trữ chỉ qua một khóa, với giá niêm yết của từng nhà cung cấp được chuyển thẳng qua ở mức 0% phụ trội và tự động chuyển đổi dự phòng giữa các nhà cung cấp. giá niêm yết của nhà cung cấp được chuyển thẳng qua ở mức 0% phụ trội MiniCPM-V 4.7 không nằm trong số đó - đây là một checkpoint trọng số mở do bạn tự triển khai, và router chính là thành phần nằm ở phía bên kia của quá trình bàn giao.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
