Thẻ tiêu đề hero được tạo cho 'MiniCPM-V 4.7 vs LFM2.5-VL 3B' với phụ đề '70 GB trọng số so với một mô hình 3B bạn có thể chạy trên laptop', một thẻ bên trái ghi 'MiniCPM-V 4.7: 35.2B sparse, không giấy phép, không có model card', một thẻ bên phải ghi 'LFM2.5-VL 3B: 3.1B dense, LFM Open License v1.0' và một nhãn dạng viên ghi 'Một cái được đo lường, một cái thì không', với logo OrcaRouter ở góc dưới cùng bên phải.
Guides & Insights

MiniCPM-V 4.7 vs LFM2.5-VL 3B: Một bí ẩn 70 GB đối đầu với mô hình 3B bạn có thể chạy trên laptop

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

MiniCPM-V 4.7 và LFM2.5-VL 3B được bán như cùng một loại sản phẩm — những mô hình ngôn ngữ-thị giác nhỏ gọn mà bạn tự chạy — nhưng trên thực tế chúng gần như khác biệt một trời một vực. LFM2.5-VL 3B là một sản phẩm hoàn chỉnh: một checkpoint 3,1 tỷ tham số có tài liệu từ Liquid AI với giấy phép, model card, các bản lượng tử hóa GGUF đã lưu hành rộng rãi, và số lý do chính đáng để không tải nó về dùng thử đang ngày càng ít đi. MiniCPM-V 4.7 là một checkpoint mixture-of-experts thưa 35,2 tỷ tham số mà OpenBMB đã tải lên Hugging Face vào ngày 6 tháng 10 năm 2026 mà không có model card, không có giấy phép và không có bất kỳ benchmark nào. So sánh chúng không phải là so sánh hai mô hình. Đó là so sánh một mô hình với một tạo tác mà rất có thể sẽ trở thành một mô hình.

Cuộc đối đầu, nói thẳng thắn ngay từ đầu

Trang này có thể cho bạn bức tranh toàn cảnh về LFM2.5-VL 3B, vì Liquid AI đã công bố một trang như vậy. Nó có thể cho bạn bức tranh toàn cảnh về hình dạng của MiniCPM-V 4.7 và không có gì cả về hành vi của nó, vì OpenBMB đã công bố một config.json rồi dừng lại. Mọi thứ bên dưới về phía MiniCPM đều được đọc từ tệp cấu hình đó và chỉ mục trọng số; mọi thứ về phía Liquid đều từ thẻ mô hình, và các tuyên bố hiệu năng của chính thẻ đó là do nhà cung cấp báo cáo và được dán nhãn như vậy. Ở đâu có một con số cho một mô hình mà không có cho mô hình kia, điều trung thực là để khoảng trống hiện rõ thay vì che lấp nó.

Mỗi loại là gì

LFM2.5-VL-3B được phát hành vào ngày 11 tháng 8 năm 2026. Đây là một biến thể đa phương thức của dòng LFM2.5, được xây dựng để triển khai trên thiết bị, và nó không bắt đầu từ con số không: nó lấy xương sống ngôn ngữ LFM2.5-2.6B rồi kết hợp với bộ mã hóa thị giác SigLIP2 NaFlex. NaFlex chính là phần quan trọng đối với công việc xử lý tài liệu — nó giữ nguyên tỷ lệ khung hình và độ phân giải gốc thay vì buộc mọi hình ảnh vào một hình vuông cố định, đó là lý do những cải tiến nổi bật của model card là khả năng grounding với truy vấn ngôn ngữ tự nhiên và OCR toàn trang kèm chú thích bố cục. Nó được phát hành theo LFM Open License v1.0 và hỗ trợ mười sáu ngôn ngữ bao gồm tiếng Anh, tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Ả Rập, tiếng Hindi, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Ý, tiếng Ba Lan, tiếng Nga, tiếng Thái, tiếng Việt và tiếng Indonesia. Vì chỉ là 3B, các bản dựng GGUF đã xuất hiện trong vòng một ngày sau khi phát hành và một biến thể DSpark ra mắt tiếp sau đó vào tháng Chín, nên hệ sinh thái quanh nó là có thật: bạn có thể tải một bản quant và chạy nó trên laptop ngay hôm nay.

MiniCPM-V 4.7 là một checkpoint BF16 với 35.212.875.824 tham số, 70,4 GB trải rộng trên mười sáu shard, lớp MiniCPMV4_7ForConditionalGeneration, được tải lên openbmb/MiniCPM-V-4.7-35B-A3B vào ngày 6 tháng 10 năm 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs LFM2.5-VL 3B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, On disk 70.4 GB BF16, Licence none declared, Vision 16x downsample, Context 256K, Benchmarks none, Quants none. Right column 'LFM2.5-VL 3B' lists Parameters 3.12B dense, On disk 6 GB BF16, Licence LFM Open v1.0, Vision SigLIP2 NaFlex, Context on-device class, Benchmarks vendor card, Quants GGUF and MLX. The footer reads 'LFM figures vendor-reported; MiniCPM figures read from config.json.'

Trụ cột ngôn ngữ của nó được gắn thẻ qwen3_5_moe_text — một MoE thưa bắt nguồn từ Qwen3.5 với 256 expert và 8 expert được chọn cho mỗi token — và 40 lớp của nó chạy theo một kiểu attention cố định là ba lớp tuyến tính trên một lớp đầy đủ, nên 30 trong số 40 lớp dùng đường tuyến tính kiểu Mamba thay vì attention thông thường. Ngữ cảnh là 256K. Tháp thị giác là của riêng dòng MiniCPM-V, với hình dạng gần giống như MiniCPM-V 4.6 đã dùng. Không có README trong kho lưu trữ, mà trên Hugging Face nghĩa là không có giấy phép.

Sự so sánh mà thực sự có thể

Sáu chiều, cả hai phía, và một ghi chú trên mỗi chiều về mức độ quan trọng của con số.

• Tổng số tham số — LFM2.5-VL 3B: 3.12B, tất cả đều hoạt động trên mỗi token. MiniCPM-V 4.7: tổng 35.2B, thưa, 8 trong số 256 chuyên gia hoạt động trên mỗi token. Con số của MiniCPM không thể so sánh với số lượng tham số của mô hình dense và ngân sách tham số hoạt động thực tế không được công bố; hãy coi "A3B" là một cái tên, không phải một phép đo.

• Kích thước hiệu dụng trên đĩa — LFM2.5-VL 3B: một tệp safetensors ~6 GB duy nhất ở định dạng BF16, hoặc chỉ một phần nhỏ của mức đó dưới dạng GGUF. MiniCPM-V 4.7: 70.4 GB trải khắp mười sáu shard, chỉ hỗ trợ BF16.

• Giấy phép — LFM2.5-VL 3B: LFM Open License v1.0, được công bố và liên kết từ card. MiniCPM-V 4.7: không có tuyên bố nào. Nếu thiếu thẻ license: thì vị trí mặc định là bảo lưu mọi quyền, nên đây là vấn đề chặn, không phải chú thích nhỏ.

• Phương pháp thị giác — LFM2.5-VL 3B: SigLIP2 NaFlex, độ phân giải gốc có bảo toàn tỷ lệ khung hình, card khẳng định OCR toàn trang kèm chú thích bố cục. MiniCPM-V 4.7: tùy chỉnh minicpmv4_7_vision tower với downsample_mode: "16x" và max_slice_nums: 9.

• Ngữ cảnh — LFM2.5-VL 3B: các ví dụ phục vụ của thẻ khá khiêm tốn so với thiết kế ngữ cảnh dài, và dòng mô hình này nhắm đến ngân sách bộ nhớ trên thiết bị. MiniCPM-V 4.7: max_position_embeddings: 262144, với tokenizer model_max_length khớp ở 256K.

• Bằng chứng về chất lượng — LFM2.5-VL 3B: một card đã được công bố với các cải tiến do nhà cung cấp báo cáo so với LFM2-VL-3B, các bản lượng tử hóa của bên thứ ba, và lịch sử trên Hugging Face với khoảng 25.900 lượt tải xuống. MiniCPM-V 4.7: không có lượt tải xuống nào, ba lượt thích, không có card, không có benchmark, không có đánh giá độc lập. Không có gì để trích dẫn.

• Công cụ — LFM2.5-VL 3B: các bản dựng GGUF và MLX từ bên thứ ba, cùng một biến thể DSpark. MiniCPM-V 4.7: không có. Chưa tồn tại bất kỳ hình thức lượng tử hóa nào.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

Hai phần ba còn thiếu của trang này

Mọi bài viết so sánh trong lĩnh vực này đều kèm một đoạn benchmark. Bài này thì không. Không có MMMU, không có OCRBench, không có DocVQA, không có chỉ số grounding, không có đo độ trễ và không có con số VRAM nào cho MiniCPM-V 4.7 — không phải vì chúng bất tiện để tra cứu, mà vì không có gì trong kho chứa chúng và chưa bên thứ ba nào tạo ra chúng. Một mô hình được tải lên mà không có card, xét theo góc độ đánh giá, là chưa được đo lường. Bất kỳ ai nói khác đi đều đang suy diễn từ tên dòng họ hoặc từ số lượng tham số, cả hai đều là những yếu tố dự báo tồi về chất lượng đa phương thức.

Điều tương tự cũng đúng với một câu hỏi tinh tế hơn: liệu MoE thưa có thực sự giúp ích hay không. Thiết kế 35B-A3B đánh đổi tổng bộ nhớ lấy tính toán trên mỗi token, và chất lượng tuân thủ chỉ dẫn của một mô hình thưa phụ thuộc hoàn toàn vào việc router được huấn luyện tốt đến đâu. Cấu hình cho thấy hệ số mất mát phụ trợ định tuyến là 0.001 và một chuyên gia chia sẻ bên cạnh 256 chuyên gia được định tuyến, đây là một thiết lập thông thường — nhưng thiết lập thông thường không phải là bằng chứng cho việc định tuyến tốt.

Về phía Liquid, phần còn thiếu lại khác: những tuyên bố về chất lượng của thẻ là do chính nhà cung cấp đưa ra.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-VL-3B (captured 7 October 2026) showing the model header, the image-text-to-text pipeline tag, the lfm2_vl architecture tag, the multilingual language tags and the opening of the model card explaining that LFM2.5-VL-3B builds on LFM2-VL-3B with a SigLIP2 NaFlex vision encoder.

Những cải thiện về OCR và grounding được mô tả bởi chính những người đã huấn luyện mô hình, và dù các bản lượng tử hóa của bên thứ ba cùng lượng tải xuống cho thấy cộng đồng thấy nó đủ hữu ích để chuyển đổi, đó là bằng chứng về mức độ được đón nhận chứ không phải bằng chứng về chất lượng. Chưa ai công bố một so sánh đối đầu độc lập.

Cái nào bạn thực sự sẽ chọn?

Cây quyết định ở đây rõ ràng đến lạ thường, vì hai mô hình không cạnh tranh cho cùng một nhiệm vụ.

Nếu bạn cần một mô hình thị giác - ngôn ngữ chạy trên laptop, điện thoại, Jetson hay một GPU khiêm tốn duy nhất, LFM2.5-VL 3B là mô hình duy nhất trong hai mô hình trả lời được câu hỏi đó. Nó đủ nhỏ để lượng tử hóa, có giấy phép cho phép công việc này, và ai đó đã thực hiện sẵn phần chuyển đổi cho bạn. Đối với bố cục tài liệu, phân tích ảnh chụp màn hình và mô tả đối tượng có căn cứ trên một dấu chân về kích thước và ngôn ngữ phù hợp với ngân sách thiết bị biên, những điểm mạnh được nêu của thẻ khớp với mục tiêu triển khai.

MiniCPM-V 4.7 không phải là ứng viên cho công việc đó ở mức 70 GB trong BF16. Nó là ứng viên cho công việc ngược lại: một mô hình đa phương thức có ngữ cảnh dài, thông lượng cao trên phần cứng máy chủ, trong những khối lượng công việc mà cửa sổ 256K và khoản tiết kiệm KV-cache nhờ attention tuyến tính chính là mấu chốt. Việc nó có làm tốt công việc đó hay không thì chưa ai biết, và câu hỏi về giấy phép phải được giải đáp trước khi nó có thể đảm nhận công việc đó trong bất kỳ bối cảnh thương mại nào.

Có một lựa chọn thứ ba đáng để gọi tên, đó là bạn có thể không cần phải chọn. Nếu kiến trúc là “một mô hình cục bộ nhỏ xử lý phần lớn lưu lượng và chuyển các trường hợp khó cho một thứ được host,” thì nửa cục bộ của nó là quyết định bạn có thể đưa ra ngay hôm nay, còn nửa được host là một quyết định định tuyến. OrcaRouter bao phủ vài trăm mô hình được host sau một khóa duy nhất với mức giá niêm yết của từng nhà cung cấp và không cộng thêm gì, có chuyển đổi dự phòng khi một nhà cung cấp bị suy giảm — nhưng hãy rõ rằng đó không phải là gì: cả LFM2.5-VL 3B lẫn MiniCPM-V 4.7 đều không phải là mô hình được host trên bộ định tuyến đó. Cả hai đều là những trọng số mà bạn tự phục vụ. Bộ định tuyến là thứ nằm phía sau chúng.

Tình hình hiện tại và những gì cần làm mới

Liquid AI đã phát hành một mô hình nhỏ hoàn chỉnh. OpenBMB đã phát hành một mô hình lớn chưa hoàn chỉnh. Phép so sánh mà độc giả mong muốn — độ chính xác so với độ trễ, OCR so với OCR — vẫn chưa thể viết được cho phía MiniCPM, và bài viết sẽ là không trung thực nếu lấp đầy khoảng trống bằng phép tính đếm số tham số. Hãy theo dõi README của kho lưu trữ. Ngày nó xuất hiện, nó sẽ mang theo giấy phép và những con số thực đầu tiên, và vào ngày đó, đây sẽ trở thành một cuộc đối đầu trực tiếp thực sự thay vì một bảng thông số kỹ thuật đặt cạnh một sản phẩm.

Phần được host của mô hình đó là một quyết định định tuyến chứ không phải là một hợp đồng thứ hai. giá niêm yết của từng nhà cung cấp, không cộng thêm bất kỳ khoản nào từ phía chúng tôi Cả LFM2.5-VL 3B lẫn MiniCPM-V 4.7 đều không phải là mô hình được host trên OrcaRouter - cả hai đều là trọng số mà bạn tự vận hành phục vụ.