
MiniCPM-V 4.7 so với UI-Venus 2.9B: Mô hình thị giác tổng quát đối đầu với một tác nhân GUI chuyên dụng
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
MiniCPM-V 4.7 và UI-Venus 2.9B đều là những mô hình thị giác-ngôn ngữ, đều nhìn vào ảnh chụp màn hình và tạo ra văn bản, và đến đó thì sự tương đồng kết thúc — bởi vì một trong hai được xây dựng chính xác cho công việc đó. UI-Venus 2.9B là một tác nhân GUI đa dụng của inclusionAI, phát hành ngày 26 tháng 8 năm 2026, với toàn bộ thiết kế xoay quanh việc quan sát một giao diện, lập luận về trạng thái tác vụ, đưa ra một hành động và tiếp nhận phản hồi thu được; nó đi kèm một báo cáo kỹ thuật, các bảng benchmark trên những tác vụ GUI grounding, di động, web, sử dụng máy tính và CAPTCHA, cùng một đánh giá rõ ràng về tần suất nó có thể bị dụ dỗ thực hiện một hành động nguy hiểm. MiniCPM-V 4.7 là một checkpoint mixture-of-experts thưa 35,2 tỷ tham số do OpenBMB tải lên ngày 6 tháng 10 năm 2026 mà không có card, không có giấy phép và không có benchmark. Việc so sánh một chuyên gia với một mô hình tổng quát chưa được đo lường là một bài tập có phần bất thường, và trang này nói rõ ở đâu phép so sánh còn giá trị và ở đâu thì không.
Hai kiểu phát hành rất khác biệt
UI-Venus 2.9B là inclusionAI/UI-Venus-2-9B, một mô hình 9B tham số được khởi tạo từ Qwen3.5-9B và được huấn luyện hậu kỳ chuyên biệt để trở thành một tác nhân GUI. Thẻ mô hình mô tả một vòng lặp khép kín — quan sát giao diện, suy luận về trạng thái tác vụ, thực thi hành động, gộp phản hồi vào quyết định kế tiếp — được huấn luyện qua ba giai đoạn: huấn luyện trung gian đa phương thức trên các quỹ đạo mô phỏng quy mô lớn về di động, web và máy tính để bàn; học tăng cường ngoại tuyến chia thành năm nhóm tác vụ; và chưng cất on-policy đa giáo viên, hợp nhất các giáo viên chuyên biệt theo lĩnh vực thành một chính sách duy nhất. Mô hình được đánh giá trên các benchmark GUI grounding, di động, web, sử dụng máy tính và CAPTCHA, cùng đánh giá riêng về an toàn của các hành động có hệ quả: thẻ mô hình báo cáo tỷ lệ tấn công thành công là 11,3% trên OSHarm và 48,8% trên OSBlind, so với 25,3% và 79,4% ở mô hình nền Qwen3.5-9B. Nhân đây, người anh em cùng nhà của OpenBMB cũng đã nhìn vào vùng đất tương tự: tổ chức MiniCPM có dự án AgentCPM-GUI từ tháng 1 năm 2026, vậy đây là một hướng đi mà cả hai phòng thí nghiệm đều đã dấn bước.
MiniCPM-V 4.7 là openbmb/MiniCPM-V-4.7-35B-A3B, mô hình 35.212.875.824 tham số BF16, dung lượng 70,4 GB gồm mười sáu shard, được tải lên ngày 6 tháng 10 năm 2026.

Xương sống văn bản MoE thưa được gắn thẻ qwen3_5_moe_text — 256 chuyên gia, 8 chuyên gia mỗi token — trên 40 lớp với kiểu chú ý ba tuyến tính trên một đầy đủ, một tháp thị giác nội bộ 27 lớp với giảm mẫu 16× và tối đa chín lát ảnh, cùng cửa sổ ngữ cảnh 256K. Không có README, do đó không có giấy phép và không có điểm chuẩn. Ba lượt thích, không lượt tải xuống nào, phần thảo luận trống.
Sự so sánh, với những khoảng trống được để ngỏ
• Mục đích — UI-Venus 2.9B: một tác nhân GUI, được huấn luyện end-to-end cho tương tác giao diện. MiniCPM-V 4.7: một mô hình thị giác-ngôn ngữ tổng quát; không nêu rõ nó được tối ưu hóa cho điều gì.
• Tham số — UI-Venus 2.9B: 9,41B, dày đặc. MiniCPM-V 4.7: tổng 35,2B, thưa, 8 trong số 256 chuyên gia mỗi token.
• Mô hình cơ sở — UI-Venus 2.9B: được khởi tạo từ Qwen3.5-9B, một ngăn xếp văn bản Qwen dày đặc. MiniCPM-V 4.7: một ngăn xếp văn bản MoE bắt nguồn từ Qwen3.5, lớp qwen3_5_moe_text. Những nhánh khác nhau của cùng một cây gia phả.
• Định vị giao diện — UI-Venus 2.9B: năng lực cốt lõi, với các họ tác vụ định vị và CAPTCHA chuyên biệt trong huấn luyện cùng một hệ thống xác minh dựa trên keypoint sử dụng bỏ phiếu đa mô hình. MiniCPM-V 4.7: không có tuyên bố dành riêng cho định vị, và không có định dạng đầu ra tọa độ nào được tài liệu hóa.
• Đánh giá an toàn — UI-Venus 2.9B: báo cáo ASR là 11,3% trên OSHarm và 48,8% trên OSBlind. MiniCPM-V 4.7: không có.
• Bằng chứng — UI-Venus 2.9B: một báo cáo kỹ thuật trên arXiv, một trang dự án, một kho GitHub và các bảng đánh giá chuẩn. MiniCPM-V 4.7: một tệp cấu hình.
• Công cụ — UI-Venus 2.9B: khởi động nhanh với vLLM cùng cờ reasoning-parser, cộng thêm các bản chuyển đổi GGUF từ cộng đồng. MiniCPM-V 4.7: vẫn chưa có gì.

Vì sao một tác nhân GUI không chỉ đơn thuần là "một VLM nhìn vào màn hình"
Khoảng cách giữa hai mô hình này không chủ yếu nằm ở số lượng tham số, và điều đó đáng được nói rõ bởi vì chính nó là thứ khiến cuộc đối đầu trở nên thú vị chứ không chỉ đơn thuần là một sự lệch hẳn về một phía.
Một tác vụ chụp ảnh màn hình có một đặc tính mà hầu hết các benchmark thị giác đều không có: đầu ra phải có thể thực thi. Khi UI-Venus 2.9B được yêu cầu nhấn vào một nút, nó phải đưa ra một tọa độ hoặc một hành động có cấu trúc mà môi trường thực sự có thể áp dụng, và một lỗi nhỏ trong định vị không phải là một câu trả lời sai trên bảng xếp hạng, mà là một tác vụ thất bại và một trạng thái bị hỏng. Đó là lý do tại sao thẻ UI-Venus 2 dành phần lớn nội dung của nó cho việc xác minh: việc hoàn thành tác vụ được đánh giá dựa trên các keypoint thị giác liên quan đến tác vụ thay vì một cái nhìn tổng thể vào màn hình cuối cùng, và các giám khảo không đồng nhất bỏ phiếu để giảm thiên lệch của một giám khảo duy nhất. Mục đích của bộ máy đó là làm cho tín hiệu phần thưởng học tăng cường trở nên mạnh mẽ trước reward hacking — một mô hình học cách thỏa mãn một bộ xác minh lười biếng thay vì hoàn thành tác vụ.
Nó cũng giải thích phần an toàn.

Một agent có thể vận hành điện thoại hoặc máy tính để bàn có bề mặt tấn công mà một mô hình tạo chú thích không có, và việc báo cáo tỷ lệ tấn công thành công là mức tối thiểu mà một phòng thí nghiệm nên làm khi phát hành một agent như vậy. UI-Venus 2.9B báo cáo 11,3% trên OSHarm và 48,8% trên OSBlind — con số thứ hai là cao về mặt tuyệt đối, và cách diễn đạt trong thẻ mô hình là so sánh với mô hình cơ sở của nó chứ không phải một tuyên bố tuyệt đối về độ bền vững. Hãy hiểu đó là “tốt hơn đáng kể so với điểm xuất phát”, chứ không phải là “an toàn”.
Kiến trúc của MiniCPM-V 4.7 không có gì để nói về bất kỳ điều nào trong số này. Attention tuyến tính trên một ngữ cảnh dài sẽ giúp ích cho một tác nhân phải ghi nhớ một lịch sử tương tác dài, và MoE thưa sẽ giúp cải thiện thông lượng nếu bạn đang chạy nhiều episode. Nhưng một kiến trúc hữu ích cho một tác nhân thì không phải là một tác nhân, và không phần nào của sản phẩm được phát hành ghi lại đầu ra hành động, độ chính xác grounding, hay hành vi an toàn.
Đánh giá trung thực về phía MiniCPM
Thật hấp dẫn khi lấp đầy phần này bằng các con số của 4.6. Đừng làm vậy. MiniCPM-V 4.6 là một mô hình dense 1,3B trên backbone Qwen3.5-0.8B với cơ chế nén thị giác 4x/16x có thể chuyển đổi, và các kết quả được quảng cáo của nó — điểm 13 trên Artificial Analysis Intelligence Index, do nhà cung cấp báo cáo, với chi phí token chỉ bằng một phần nhỏ so với các mô hình nhỏ tương đương — mô tả chính mô hình đó. MiniCPM-V 4.7 thay đổi backbone, thay đổi kiểu attention, và thay đổi cơ chế nén thị giác mặc định. Không có phép đo nào của 4.6 chuyển sang được, và xét cho cùng, không có phép đo nào trong số đó mô tả một tác nhân GUI.
Điều có thể được nói một cách trung thực về MiniCPM-V 4.7 thì hẹp và mang tính thực tế: các trọng số tồn tại, hình dạng là bất thường đối với dòng họ này, cửa sổ ngữ cảnh dài, và bản phát hành chưa hoàn chỉnh. Việc thiếu giấy phép là rào cản thực tiễn; việc thiếu benchmark là rào cản mang tính đánh giá. Và có một lý do khiêm tốn để quan tâm thay vì thờ ơ — OpenBMB xây dựng công cụ GUI, trong đó có AgentCPM-GUI, nên một mô hình thị giác MoE thưa ngữ cảnh dài từ phòng thí nghiệm đó không phải là không hợp lý như một xương sống agent trong tương lai. Đó là một giả thuyết về ý định, và kho mã không xác nhận điều đó.
Bạn sẽ chọn gì, và khi nào
Đối với bất cứ việc gì liên quan đến ảnh chụp màn hình và một hành động — chạm, gõ, cuộn, điều hướng ứng dụng hoặc trang web, trích xuất dữ liệu từ giao diện người dùng — UI-Venus 2.9 là cái duy nhất trong hai cái giải quyết được tác vụ đó. Nó có dữ liệu huấn luyện, bộ máy xác minh, các số liệu an toàn được báo cáo, và đủ công cụ để triển khai nó trên vLLM ngay hôm nay. Không có gì ở MiniCPM-V 4.7 cho thấy nó đang cạnh tranh ở đó, và nếu không có thẻ mô hình, bạn thậm chí không thể kiểm tra liệu nó có xuất ra tọa độ hay không.
Đối với công việc đa phương thức nói chung — mô tả hình ảnh, đọc tài liệu, phân tích ngữ cảnh dài trên tư liệu nhiều hình ảnh — việc so sánh vẫn chưa thể ngã ngũ, vì một bên chưa có bằng chứng chất lượng nào được công bố. Nếu bạn cần điều đó ngay hôm nay, UI-Venus 2.9B ít nhất là có thể đo lường được, mặc dù nó được tinh chỉnh cho giao diện thay vì cho suy luận tài liệu và cũng không phải là lựa chọn đầu tiên hiển nhiên cho công việc đó.
Mô thức trong cả hai trường hợp đều giống nhau: một mô hình tự vận hành đảm nhận phần việc thường nhật, và một mô hình tiên tiến chạy trên nền tảng được lưu trữ dành cho những ca khó mà nó chuyển giao lại. Chính ở điểm chuyển giao đó, một router mới khẳng định được vị trí của mình — một khóa duy nhất dùng cho hơn 200 mô hình được lưu trữ, mỗi mô hình đều được tính đúng theo giá niêm yết của nhà cung cấp, không có phụ phí nào từ phía chúng tôi, và tự động chuyển sang phương án dự phòng khi một nhà cung cấp gặp suy giảm. Cả UI-Venus 2.9B lẫn MiniCPM-V 4.7 đều không được lưu trữ trên OrcaRouter; cả hai đều là các trọng số mà bạn tự chạy. Router chính là thứ mà agent của bạn giao tiếp khi nó xác định rằng mô hình cục bộ là chưa đủ.
Điều này đưa bạn đến đâu
Đây không phải là một lựa chọn sát nút, và lý do mang tính cấu trúc chứ không phải là đánh giá về chất lượng. UI-Venus 2.9B là một chuyên gia với báo cáo, giấy phép, bảng điểm chuẩn, đánh giá an toàn và công thức phục vụ. MiniCPM-V 4.7 là một mô hình đa dụng với một tệp cấu hình. Một trong hai là sản phẩm còn cái kia là lời hứa, và cách có trách nhiệm duy nhất để so sánh chúng là nói thẳng điều đó. Hãy theo dõi kho lưu trữ: nếu OpenBMB công bố một thẻ mô hình thể hiện khả năng bám giao diện và đầu ra hành động, thì một MoE thưa ngữ cảnh 256K đối đầu với một tác nhân 9B đã chưng cất sẽ trở thành một câu hỏi thực sự thú vị. Cho đến lúc đó, câu trả lời cho "nên dùng cái nào" là cái đang tồn tại.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
