Một thẻ tiêu đề chính cho 'UI-Venus-2-9B vs Microsoft Mage-VL' với phụ đề 'Agent chụp màn hình đấu với trình theo dõi luồng codec', hiển thị huy hiệu màu xanh dương '9B · SCREENSHOT AGENT' với viên 'acts' và huy hiệu màu xanh lơ '4B · STREAM WATCHER' với viên 'describes', cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

UI-Venus-2-9B vs Microsoft Mage-VL: Agent chụp màn hình vs Trình quan sát luồng Codec

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

UI-Venus-2-9B và Microsoft Mage-VL đều ra mắt lặng lẽ, cách nhau trong vòng một tháng — kho lưu trữ của Mage-VL xuất hiện vào ngày 26 tháng 7 năm 2026, còn UI-Venus-2-9B vào ngày 26 tháng 8 năm 2026 — cả hai đều có trọng số mở theo giấy phép Apache-2.0 và đều xây dựng trên backbone dòng Qwen. Điểm tương đồng gần như dừng lại ở đó; khác biệt không phải là chuyện mức độ mà là chuyện mỗi mô hình nằm ở phía nào của màn hình. Microsoft Mage-VL là mô hình nhận thức luồng bản địa codec: nó theo dõi video nén, giữ im lặng xuyên suốt các cảnh quay thông thường, và xuất văn bản khi một sự kiện hoàn tất. UI-Venus-2-9B là một tác tử GUI: nó tiếp nhận một ảnh chụp màn hình tĩnh, suy luận về trạng thái, và xuất ra một hành động có cấu trúc. Một bên quan sát màn hình và mô tả nó; bên kia quan sát màn hình và vận hành nó. Chọn giữa chúng không phải là quyết định dựa trên benchmark, vì chúng không dùng chung một benchmark nào — mà là quyết định xem quy trình tự động hóa của bạn kết thúc ở một câu trả lời hay một hành động.

Mỗi mô hình thực sự là gì

Microsoft Mage-VL, được phát hành trong kho lưu trữ microsoft/Mage-VL mà không kèm thông báo chính thức, là một mô hình đa phương thức có khoảng 4 tỷ tham số, được xây dựng từ bộ giải mã ngôn ngữ Qwen3-4B-Instruct-2507, một bộ mã hóa thị giác được xây dựng từ đầu có tên Mage-ViT, cùng một cổng streaming riêng biệt khoảng 0,5 tỷ tham số. Thiết kế của nó mang bản chất codec video: thay vì lấy mẫu khung hình đồng đều, mô hình giữ nguyên toàn bộ các khung hình mốc (I) và chỉ giữ lại các patch nổi bật về chuyển động của các khung hình dự đoán (P). Theo báo cáo của Microsoft, cách tiếp cận này cắt giảm hơn 75% lượng token thị giác tiêu thụ và giúp tăng tốc suy luận theo thời gian thực tế lên tới 3,5 lần so với lấy mẫu đồng đều. Nhờ thiết kế hai tiến trình — cổng nhận thức System 1 theo dõi từng cửa sổ codec trượt, còn VLM System 2 chỉ kích hoạt khi có sự kiện đáng để phản hồi — mô hình trở thành một trình theo dõi video luôn bật, rẻ chính xác vì nó gần như im lặng.

UI-Venus-2-9B, được phát hành bởi inclusionAI (phòng thí nghiệm Ant Group của nhóm Venus Team), là một tác tử GUI đa dụng 9B khởi tạo từ Qwen3.5-9B. Mô hình này quan sát giao diện, suy luận về trạng thái nhiệm vụ, thực thi hành động và tiếp nhận phản hồi — tạo thành một vòng lặp khép kín quan sát–suy luận–hành động–phản hồi — và thẻ mô hình của nó tuyên bố phạm vi huấn luyện bao phủ cả ứng dụng di động, nền tảng web và hệ điều hành máy tính để bàn trong một checkpoint duy nhất. Trên thẻ mô hình của chính mình, nó báo cáo AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 và ScreenSpot-Pro 73.0, tất cả đều do nhà cung cấp công bố và chưa có con số nào được tái lập một cách độc lập.

Khoảng trống đầu vào: pixel bạn chụp được so với luồng bạn giữ lại

Sự khác biệt mang tính minh họa nhất là mỗi mô hình "tiêu thụ" loại dữ liệu nào. UI-Venus-2-9B là một tác nhân chụp màn hình: đầu vào của nó là màn hình hiện tại, từng khung hình một, và cửa sổ ngữ cảnh 256K token chính là cách nó lưu giữ lịch sử các khung hình đó xuyên suốt một tác vụ dài. Mage-VL là một tác nhân luồng dữ liệu: đầu vào của nó là video nén, và hiệu quả của nó đến từ việc xem chuyển động giữa các khung hình như dữ liệu — vector chuyển động và năng lượng dư cho codec truyền thống, bản đồ tốc độ học được cho codec neural. Đây là sự khác biệt giữa một mô hình nhìn thấy những khoảnh khắc và một mô hình nhìn thấy một dòng thời gian liên tục. Một tác nhân chụp màn hình bị mù về mặt cấu trúc đối với 100 mili giây giữa các lần chụp — vòng xoay tải, quá trình chuyển tiếp tải, trạng thái hover chỉ tồn tại trên màn hình trong chốc lát. Một kẻ quan sát luồng dữ liệu sống bên trong khoảng trống đó. Đó không phải là khiếm khuyết của thiết kế nào; đó là lý do vì sao một tác nhân GUI cần hành động trên màn hình trực tiếp và một mô hình nhận thức cần tóm tắt một nguồn cấp dữ liệu lại là những sản phẩm khác nhau với các hợp đồng đầu vào khác nhau.

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

Khoảng cách sản lượng: hành động so với bình luận

Phía đầu ra là nơi hai mô hình không còn có thể so sánh được. Đầu ra của UI-Venus-2-9B là một hành động có cấu trúc trong một không gian hành động xác định — chuột, bàn phím, cuộn, điều hướng — được xuất ra sau các token suy luận kiểu Qwen3, và quá trình huấn luyện của nó được xây dựng quanh các tác vụ grounding và CAPTCHA, vốn khen thưởng khả năng định vị phần tử chính xác trong môi trường thị giác lộn xộn. Đầu ra của Mage-VL là văn bản: bình luận theo sự kiện về những gì nó nhìn thấy. Nó không có không gian hành động, không có gọi hàm, và không có vòng lặp tác tử. Đọc hai thẻ mô hình cạnh nhau, bạn đang nhìn vào hai phía đối lập của ranh giới nhận thức–hành động — Mage-VL kết thúc bằng một mô tả, UI-Venus-2-9B kết thúc bằng một cú nhấp chuột.

Công việc — UI-Venus-2-9B: tác tử GUI, vận hành giao diện. Microsoft Mage-VL: nhận thức trực tuyến, mô tả giao diện.

Đầu vào — UI-Venus-2-9B: ảnh chụp màn hình tĩnh, lịch sử 256K token. Microsoft Mage-VL: luồng codec video nén, độ thưa token nổi bật theo chuyển động.

Đầu ra — UI-Venus-2-9B: các hành động chuột/bàn phím/điều hướng có cấu trúc. Microsoft Mage-VL: bình luận văn bản theo sự kiện.

Kích thước — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B cổng streaming.

Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 cùng với Mage-ViT được xây dựng từ đầu.

Giấy phép — cả hai đều là Apache-2.0 (ghi chú trên thẻ Mage-VL nêu rõ chỉ dùng cho mục đích nghiên cứu trong repo của nó).

Khoảng cách phục vụ

Ở đây, mô hình mới hơn, lớn hơn lại là mô hình dễ chạy hơn. UI-Venus-2-9B mô tả một lệnh vLLM duy nhất với cửa sổ ngữ cảnh 256K và API tương thích OpenAI tiêu chuẩn. Mage-VL yêu cầu trust_remote_code để thực thi Python tùy chỉnh của Microsoft, cùng với FFmpeg, một đường dẫn neural-codec cho video, và các phụ thuộc như mamba-ssm, và nó vẫn chưa có ngăn xếp phục vụ vLLM hay SGLang — không có paged attention, không có đường dẫn phục vụ sản xuất. Microsoft báo cáo tổng cộng khoảng 10,6 GB tham số BF16, nghĩa là GPU 16 GB là mức tối thiểu thực tế cho công việc xử lý hình ảnh và 24 GB+ cho video dài. Đối với một nhóm muốn đưa thứ gì đó vào vận hành hôm nay, UI-Venus-2-9B có lộ trình khởi đầu rõ ràng hơn; còn đối với một nhóm xây dựng pipeline giám sát hoặc tóm tắt luôn bật, ngăn xếp phục vụ của Mage-VL là thứ bạn phải chấp nhận dù thế nào đi nữa, kể cả Python tùy chỉnh và tất cả.

Một bảng điểm không tồn tại

Không có điểm chuẩn chung nào giữa hai mô hình này, và việc bịa ra một điểm chuẩn như vậy sẽ là không trung thực. Các con số của UI-Venus-2-9B nằm trên các bảng đánh giá về GUI-grounding, di động, web và computer-use (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, tất cả do nhà cung cấp công bố). Các con số của Mage-VL nằm trên các bảng đánh giá về hiểu video và không gian (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 so với Qwen3-VL-4B, tất cả do nhà cung cấp công bố). Cách đọc đúng cuộc đối đầu này là như một ngã rẽ: nếu nhiệm vụ là "hiểu điều gì đang xảy ra trên màn hình này theo thời gian," thì Mage-VL là công cụ phù hợp còn UI-Venus-2-9B không được thiết kế cho việc đó; nếu nhiệm vụ là "khiến màn hình này thực hiện điều gì đó," thì điều ngược lại là đúng.

Nơi hai thứ giao hòa.

{{1}}Cách diễn giải thú vị của sự so sánh này không phải là kiểu chọn một trong hai.{{/1}} {{2}}Một tác tử GUI vận hành một ứng dụng đang chạy có một điểm mù thực sự — khoảng thời gian giữa các lần chụp màn hình, và bất kỳ thay đổi trạng thái nào không bao giờ ổn định thành một khung hình tĩnh{{/2}} — {{3}}và một bộ theo dõi luồng gốc codec chính là loại mô hình có thể đóng vai trò là lớp nhận thức trong khoảng trống đó, phát hiện rằng một trang web đã tải xong hoặc một cửa sổ modal đã hoàn tất hiệu ứng động trước lượt neo trạng thái tiếp theo của tác tử.{{/3}} {{4}}Microsoft đã không xây dựng Mage-VL cho công việc đó{{/4}}, {{5}}và Ant Group đã không xây dựng UI-Venus-2-9B để được điều hướng bởi một mô hình thứ hai{{/5}}, {{6}}nhưng sự phù hợp này là có thật.{{/6}} {{7}}Đối với những phần của một stack như vậy đã đạt chuẩn production — LLM lập kế hoạch phân rã một tác vụ, mô hình thị giác xác minh trạng thái màn hình, mô hình phiên âm ghi lại phiên làm việc của tác tử — một API với giá chuyển tiếp trực tiếp và chuyển đổi dự phòng tự động chính là thứ khiến thử nghiệm trở nên rẻ{{/7}}, {{8}}và đó là mục đích của một bộ định tuyến.{{/8}} {{9}}Cả UI-Venus-2-9B lẫn Microsoft Mage-VL hiện không được phục vụ qua OrcaRouter; cả hai đều là các dự án tự lưu trữ với trọng số mở{{/9}}, {{10}}và cả hai sẽ xuất hiện ở mức giá niêm yết của nhà cung cấp nếu chúng từng đến được một nhà cung cấp được định tuyến.{{/10}}

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

Ai nên chọn cái nào

Hãy chọn Microsoft Mage-VL khi vấn đề của bạn là nhận thức liên tục — một nguồn camera, một bản ghi màn hình, một luồng dữ liệu bạn cần tóm tắt hoặc giám sát theo thời gian thực, với chi phí đủ rẻ để duy trì hoạt động. Hãy chọn UI-Venus-2-9B khi vấn đề của bạn là điều khiển — một tác vụ kết thúc bằng một hành động hoàn tất, một biểu mẫu được điền, một quy trình được điều hướng, một ứng dụng được vận hành. Và nếu quy trình tự động hóa của bạn thực sự cần cả hai — nhận thức luồng dữ liệu, rồi hành động trên khung hình tĩnh — hãy chạy chúng thành một cặp và coi trình giám sát luồng là bộ phát hiện sự kiện, chuyển cho tác nhân chụp màn hình những khoảnh khắc đáng hành động. Chúng là hai nửa của cùng một màn hình, không phải đối thủ cạnh tranh cho cùng một công việc.