
UI-Venus-2-9B vs Microsoft Mage-VL: Agent chụp màn hình vs Trình quan sát luồng Codec
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
UI-Venus-2-9B và Microsoft Mage-VL đều ra mắt lặng lẽ, cách nhau trong vòng một tháng — kho lưu trữ của Mage-VL xuất hiện vào ngày 26 tháng 7 năm 2026, còn UI-Venus-2-9B vào ngày 26 tháng 8 năm 2026 — cả hai đều có trọng số mở theo giấy phép Apache-2.0 và đều xây dựng trên backbone dòng Qwen. Điểm tương đồng gần như dừng lại ở đó; khác biệt không phải là chuyện mức độ mà là chuyện mỗi mô hình nằm ở phía nào của màn hình. Microsoft Mage-VL là mô hình nhận thức luồng bản địa codec: nó theo dõi video nén, giữ im lặng xuyên suốt các cảnh quay thông thường, và xuất văn bản khi một sự kiện hoàn tất. UI-Venus-2-9B là một tác tử GUI: nó tiếp nhận một ảnh chụp màn hình tĩnh, suy luận về trạng thái, và xuất ra một hành động có cấu trúc. Một bên quan sát màn hình và mô tả nó; bên kia quan sát màn hình và vận hành nó. Chọn giữa chúng không phải là quyết định dựa trên benchmark, vì chúng không dùng chung một benchmark nào — mà là quyết định xem quy trình tự động hóa của bạn kết thúc ở một câu trả lời hay một hành động.
Mỗi mô hình thực sự là gì
Microsoft Mage-VL, được phát hành trong kho lưu trữ microsoft/Mage-VL mà không kèm thông báo chính thức, là một mô hình đa phương thức có khoảng 4 tỷ tham số, được xây dựng từ bộ giải mã ngôn ngữ Qwen3-4B-Instruct-2507, một bộ mã hóa thị giác được xây dựng từ đầu có tên Mage-ViT, cùng một cổng streaming riêng biệt khoảng 0,5 tỷ tham số. Thiết kế của nó mang bản chất codec video: thay vì lấy mẫu khung hình đồng đều, mô hình giữ nguyên toàn bộ các khung hình mốc (I) và chỉ giữ lại các patch nổi bật về chuyển động của các khung hình dự đoán (P). Theo báo cáo của Microsoft, cách tiếp cận này cắt giảm hơn 75% lượng token thị giác tiêu thụ và giúp tăng tốc suy luận theo thời gian thực tế lên tới 3,5 lần so với lấy mẫu đồng đều. Nhờ thiết kế hai tiến trình — cổng nhận thức System 1 theo dõi từng cửa sổ codec trượt, còn VLM System 2 chỉ kích hoạt khi có sự kiện đáng để phản hồi — mô hình trở thành một trình theo dõi video luôn bật, rẻ chính xác vì nó gần như im lặng.
UI-Venus-2-9B, được phát hành bởi inclusionAI (phòng thí nghiệm Ant Group của nhóm Venus Team), là một tác tử GUI đa dụng 9B khởi tạo từ Qwen3.5-9B. Mô hình này quan sát giao diện, suy luận về trạng thái nhiệm vụ, thực thi hành động và tiếp nhận phản hồi — tạo thành một vòng lặp khép kín quan sát–suy luận–hành động–phản hồi — và thẻ mô hình của nó tuyên bố phạm vi huấn luyện bao phủ cả ứng dụng di động, nền tảng web và hệ điều hành máy tính để bàn trong một checkpoint duy nhất. Trên thẻ mô hình của chính mình, nó báo cáo AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 và ScreenSpot-Pro 73.0, tất cả đều do nhà cung cấp công bố và chưa có con số nào được tái lập một cách độc lập.
Khoảng trống đầu vào: pixel bạn chụp được so với luồng bạn giữ lại
Sự khác biệt mang tính minh họa nhất là mỗi mô hình "tiêu thụ" loại dữ liệu nào. UI-Venus-2-9B là một tác nhân chụp màn hình: đầu vào của nó là màn hình hiện tại, từng khung hình một, và cửa sổ ngữ cảnh 256K token chính là cách nó lưu giữ lịch sử các khung hình đó xuyên suốt một tác vụ dài. Mage-VL là một tác nhân luồng dữ liệu: đầu vào của nó là video nén, và hiệu quả của nó đến từ việc xem chuyển động giữa các khung hình như dữ liệu — vector chuyển động và năng lượng dư cho codec truyền thống, bản đồ tốc độ học được cho codec neural. Đây là sự khác biệt giữa một mô hình nhìn thấy những khoảnh khắc và một mô hình nhìn thấy một dòng thời gian liên tục. Một tác nhân chụp màn hình bị mù về mặt cấu trúc đối với 100 mili giây giữa các lần chụp — vòng xoay tải, quá trình chuyển tiếp tải, trạng thái hover chỉ tồn tại trên màn hình trong chốc lát. Một kẻ quan sát luồng dữ liệu sống bên trong khoảng trống đó. Đó không phải là khiếm khuyết của thiết kế nào; đó là lý do vì sao một tác nhân GUI cần hành động trên màn hình trực tiếp và một mô hình nhận thức cần tóm tắt một nguồn cấp dữ liệu lại là những sản phẩm khác nhau với các hợp đồng đầu vào khác nhau.

Khoảng cách sản lượng: hành động so với bình luận
Phía đầu ra là nơi hai mô hình không còn có thể so sánh được. Đầu ra của UI-Venus-2-9B là một hành động có cấu trúc trong một không gian hành động xác định — chuột, bàn phím, cuộn, điều hướng — được xuất ra sau các token suy luận kiểu Qwen3, và quá trình huấn luyện của nó được xây dựng quanh các tác vụ grounding và CAPTCHA, vốn khen thưởng khả năng định vị phần tử chính xác trong môi trường thị giác lộn xộn. Đầu ra của Mage-VL là văn bản: bình luận theo sự kiện về những gì nó nhìn thấy. Nó không có không gian hành động, không có gọi hàm, và không có vòng lặp tác tử. Đọc hai thẻ mô hình cạnh nhau, bạn đang nhìn vào hai phía đối lập của ranh giới nhận thức–hành động — Mage-VL kết thúc bằng một mô tả, UI-Venus-2-9B kết thúc bằng một cú nhấp chuột.
• Công việc — UI-Venus-2-9B: tác tử GUI, vận hành giao diện. Microsoft Mage-VL: nhận thức trực tuyến, mô tả giao diện.
• Đầu vào — UI-Venus-2-9B: ảnh chụp màn hình tĩnh, lịch sử 256K token. Microsoft Mage-VL: luồng codec video nén, độ thưa token nổi bật theo chuyển động.
• Đầu ra — UI-Venus-2-9B: các hành động chuột/bàn phím/điều hướng có cấu trúc. Microsoft Mage-VL: bình luận văn bản theo sự kiện.
• Kích thước — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B cổng streaming.
• Backbone — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 cùng với Mage-ViT được xây dựng từ đầu.
• Giấy phép — cả hai đều là Apache-2.0 (ghi chú trên thẻ Mage-VL nêu rõ chỉ dùng cho mục đích nghiên cứu trong repo của nó).
Khoảng cách phục vụ
Ở đây, mô hình mới hơn, lớn hơn lại là mô hình dễ chạy hơn. UI-Venus-2-9B mô tả một lệnh vLLM duy nhất với cửa sổ ngữ cảnh 256K và API tương thích OpenAI tiêu chuẩn. Mage-VL yêu cầu trust_remote_code để thực thi Python tùy chỉnh của Microsoft, cùng với FFmpeg, một đường dẫn neural-codec cho video, và các phụ thuộc như mamba-ssm, và nó vẫn chưa có ngăn xếp phục vụ vLLM hay SGLang — không có paged attention, không có đường dẫn phục vụ sản xuất. Microsoft báo cáo tổng cộng khoảng 10,6 GB tham số BF16, nghĩa là GPU 16 GB là mức tối thiểu thực tế cho công việc xử lý hình ảnh và 24 GB+ cho video dài. Đối với một nhóm muốn đưa thứ gì đó vào vận hành hôm nay, UI-Venus-2-9B có lộ trình khởi đầu rõ ràng hơn; còn đối với một nhóm xây dựng pipeline giám sát hoặc tóm tắt luôn bật, ngăn xếp phục vụ của Mage-VL là thứ bạn phải chấp nhận dù thế nào đi nữa, kể cả Python tùy chỉnh và tất cả.
Một bảng điểm không tồn tại
Không có điểm chuẩn chung nào giữa hai mô hình này, và việc bịa ra một điểm chuẩn như vậy sẽ là không trung thực. Các con số của UI-Venus-2-9B nằm trên các bảng đánh giá về GUI-grounding, di động, web và computer-use (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8, tất cả do nhà cung cấp công bố). Các con số của Mage-VL nằm trên các bảng đánh giá về hiểu video và không gian (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 so với Qwen3-VL-4B, tất cả do nhà cung cấp công bố). Cách đọc đúng cuộc đối đầu này là như một ngã rẽ: nếu nhiệm vụ là "hiểu điều gì đang xảy ra trên màn hình này theo thời gian," thì Mage-VL là công cụ phù hợp còn UI-Venus-2-9B không được thiết kế cho việc đó; nếu nhiệm vụ là "khiến màn hình này thực hiện điều gì đó," thì điều ngược lại là đúng.
Nơi hai thứ giao hòa.
{{1}}Cách diễn giải thú vị của sự so sánh này không phải là kiểu chọn một trong hai.{{/1}} {{2}}Một tác tử GUI vận hành một ứng dụng đang chạy có một điểm mù thực sự — khoảng thời gian giữa các lần chụp màn hình, và bất kỳ thay đổi trạng thái nào không bao giờ ổn định thành một khung hình tĩnh{{/2}} — {{3}}và một bộ theo dõi luồng gốc codec chính là loại mô hình có thể đóng vai trò là lớp nhận thức trong khoảng trống đó, phát hiện rằng một trang web đã tải xong hoặc một cửa sổ modal đã hoàn tất hiệu ứng động trước lượt neo trạng thái tiếp theo của tác tử.{{/3}} {{4}}Microsoft đã không xây dựng Mage-VL cho công việc đó{{/4}}, {{5}}và Ant Group đã không xây dựng UI-Venus-2-9B để được điều hướng bởi một mô hình thứ hai{{/5}}, {{6}}nhưng sự phù hợp này là có thật.{{/6}} {{7}}Đối với những phần của một stack như vậy đã đạt chuẩn production — LLM lập kế hoạch phân rã một tác vụ, mô hình thị giác xác minh trạng thái màn hình, mô hình phiên âm ghi lại phiên làm việc của tác tử — một API với giá chuyển tiếp trực tiếp và chuyển đổi dự phòng tự động chính là thứ khiến thử nghiệm trở nên rẻ{{/7}}, {{8}}và đó là mục đích của một bộ định tuyến.{{/8}} {{9}}Cả UI-Venus-2-9B lẫn Microsoft Mage-VL hiện không được phục vụ qua OrcaRouter; cả hai đều là các dự án tự lưu trữ với trọng số mở{{/9}}, {{10}}và cả hai sẽ xuất hiện ở mức giá niêm yết của nhà cung cấp nếu chúng từng đến được một nhà cung cấp được định tuyến.{{/10}}


Ai nên chọn cái nào
Hãy chọn Microsoft Mage-VL khi vấn đề của bạn là nhận thức liên tục — một nguồn camera, một bản ghi màn hình, một luồng dữ liệu bạn cần tóm tắt hoặc giám sát theo thời gian thực, với chi phí đủ rẻ để duy trì hoạt động. Hãy chọn UI-Venus-2-9B khi vấn đề của bạn là điều khiển — một tác vụ kết thúc bằng một hành động hoàn tất, một biểu mẫu được điền, một quy trình được điều hướng, một ứng dụng được vận hành. Và nếu quy trình tự động hóa của bạn thực sự cần cả hai — nhận thức luồng dữ liệu, rồi hành động trên khung hình tĩnh — hãy chạy chúng thành một cặp và coi trình giám sát luồng là bộ phát hiện sự kiện, chuyển cho tác nhân chụp màn hình những khoảnh khắc đáng hành động. Chúng là hai nửa của cùng một màn hình, không phải đối thủ cạnh tranh cho cùng một công việc.
