
PixelUMM vs UI-Mate-27B: Một mô hình vẽ những gì nó thấy, mô hình kia nhấp vào nó
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Trên bản thông số kỹ thuật, Tencent UI-Mate-27B và NVIDIA PixelUMM trông có vẻ tương đương — 27 tỷ tham số so với khoảng 15,2 tỷ, cả hai đều cho tải xuống mở, cả hai đều được xây dựng trên nền tảng Qwen — nhưng chúng hoàn toàn không thể so sánh với nhau. UI-Mate-27B là một tác nhân GUI nền tảng: nó quan sát ảnh chụp màn hình trực tiếp, lập kế hoạch từ những gì đang hiển thị trên màn hình, và phát ra các hành động chuột và bàn phím có cấu trúc cho một máy tính để bàn thật. PixelUMM là một mô hình đa phương thức hợp nhất không dùng encoder, đọc hình ảnh và video trong không gian pixel thô và tạo ra hình ảnh cùng video từ văn bản — nó cảm nhận và nó sáng tạo, nhưng nó không có không gian hành động, không có con trỏ và không có cách nào chạm vào màn hình. Một bên hành động lên thế giới. Bên kia mô tả và khắc họa thế giới ấy. Mọi điều dưới đây đều bắt nguồn từ sự phân chia đó, và khoảng cách về giấy phép giữa chúng là điều thứ hai bạn cần biết.
Cả hai phòng thí nghiệm đều tự báo cáo các con số của riêng mình và không bên nào có đánh giá độc lập. Cả hai đều công bố một cách âm thầm — cách công bố mới chính là chỗ mà sự tương đồng thực sự kết thúc.
Người hành động và người nhận thức
UI-Mate-27B thực thi một tác vụ chỉ từ một chỉ dẫn bằng ngôn ngữ tự nhiên và ảnh chụp màn hình trực tiếp. Nó lập luận dựa trên trạng thái hiển thị, lập kế hoạch lại khi giao diện thay đổi, và xuất ra lập luận, mô tả hành động ngắn gọn cùng các lệnh gọi công cụ sử dụng máy tính có cấu trúc trên chuột, bàn phím, cuộn, chờ, tương tác người dùng và hoàn thành tác vụ. Đặc điểm nổi bật của nó là thực thi có hướng dẫn bằng minh họa: chỉ cho nó xem một quy trình một lần và nó sẽ thích ứng bản minh họa đã ghi lại với tác vụ trước mắt, coi ảnh chụp màn hình hiện tại là nguồn chân lý khi giao diện đã thay đổi. Nó được tinh chỉnh từ Qwen3.6-27B bằng tinh chỉnh có giám sát, tiếp theo là học tăng cường trực tuyến trong các môi trường GUI có thể thực thi, và được phục vụ thông qua vLLM với giao diện tương thích OpenAI.
• Các benchmark được báo cáo — Trung bình OSWorld-Verified 77.0, trung bình WindowsAgentArena 66.2, OSWorkerBench thành công nghiêm ngặt 41.00 và tiến độ 76.86. Tất cả đều do Tencent báo cáo và chưa được tái lập.
• Không gian hành động — chuột, bàn phím, cuộn, chờ, tương tác người dùng, hoàn thành tác vụ, trong không gian tọa độ chuẩn hóa với các lời gọi có cấu trúc tương thích pyautogui.
• Thực tế về phần cứng — 27B dense, được phục vụ với tensor parallelism trên hai GPU trong quick-start của chính Tencent, theo giấy phép Apache-2.0.
• Một lưu ý quan trọng về chính tấm thẻ — UI-Mate-27B là một checkpoint dạng agent chứ không phải một mô hình trò chuyện thị giác độc lập. Tencent khuyến nghị dùng prompt chính thức, trình phân tích phản hồi và khung tương tác từ kho lưu trữ của họ. Nếu bạn yêu cầu nó "mô tả hình ảnh này" thì tức là bạn đang dùng sai công cụ.
PixelUMM nằm ở cực đối lập. Toàn bộ kiến trúc của nó là một lập luận về biểu diễn: không có VAE, không có bộ mã hóa thị giác, hình ảnh là các patch pixel 16×16 và video là các tubelet không-thời gian 4 khung hình, đi thẳng vào một Transformer chỉ có decoder thông qua các phép chiếu tuyến tính một lớp, với thiết kế Mixture-of-Transformers kết hợp attention dùng chung với các tham số riêng theo tác vụ. Hiểu là văn bản tự hồi quy; sinh là flow matching trong không gian pixel. Bốn checkpoint được phát hành, S8-F22-R05 làm mặc định, bao quát chuyển văn bản thành hình ảnh, chuyển văn bản thành video ở 96 khung hình và 24 fps, cùng cả hai hướng hiểu.

Hai mô hình phát hành là một sự tương phản điển hình.
UI-Mate-27B xuất hiện trên Hugging Face vào ngày 14 tháng 8 năm 2026 với một thẻ mô hình, một bản tiền ấn phẩm arXiv mang số 2608.15930, một trang dự án, một kho GitHub và một hướng dẫn phục vụ đã được ghi lại. Từ đó đến đầu tháng 10, nó đã tích lũy được khoảng 780 lượt tải xuống và 93 lượt thích — khiêm tốn, nhưng là một bản phát hành tác nhân nghiên cứu thông thường với giấy tờ đầy đủ.
Dấu vết của PixelUMM mang tính chất khác biệt. Kho lưu trữ GitHub được tạo vào ngày 4 tháng 9 năm 2026; bản tiền in arXiv đề ngày 29 tháng 9; kho lưu trữ Hugging Face được tạo lúc 21:40 UTC ngày 1 tháng 10 năm 2026, chỉ vài phút sau commit cuối cùng của kho lưu trữ. Không có bài đăng blog, thông cáo báo chí hay luồng thông báo ra mắt nào của NVIDIA xuất hiện dành cho nó. Đường dẫn URL của chính trang dự án vẫn ghi là pixelumm-project-page-preview. Số lượt tải xuống của nó là 0 vào thời điểm bài viết này được thực hiện.
Suy diễn ý đồ từ đó là một sai lầm — một phòng thí nghiệm có thể công bố một sản phẩm nghiên cứu và lên lịch ra mắt sau đó. Điều có thể biết được thì hẹp hơn và hữu ích hơn: một mô hình có đường phục vụ chính thức và mười tuần lượt tải xuống; mô hình kia có một bài báo, một kho mã, và không có tuyên bố nào từ nhà cung cấp cả.

Bảng điểm không chồng lên nhau
Không có một benchmark nào mà cả hai mô hình đều báo cáo, và điều đó tự nó đã là điểm mấu chốt: chúng không giải quyết cùng một vấn đề.
• Sử dụng máy tính dạng tác tử — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: không có không gian hành động, nên không thể có điểm số.
• Hiểu hình ảnh — UI-Mate-27B: lấy ảnh chụp màn hình làm đầu vào cho tác nhân, không được đánh giá như một VLM tổng quát. PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00.
• Video — UI-Mate-27B: không có. PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41.
• Tạo sinh — UI-Mate-27B: không có. PixelUMM: GenEval 0.83 với bộ viết lại prompt, DPG-Bench 85.74, chất lượng VBench Part 1 84.10.
• Chi phí triển khai — UI-Mate-27B: 27B dense trải trên khoảng hai GPU thông qua vLLM, cùng với harness chính thức. PixelUMM: khoảng 30 GB các shard checkpoint phân tán, CUDA 13 với FlashAttention được build từ mã nguồn, một mô hình guardrail yêu cầu cấp quyền truy cập cho luồng video và một môi trường Python thứ hai dành cho nó.
• Giấy phép — UI-Mate-27B: Apache-2.0, mã nguồn và trọng số. PixelUMM: mã nguồn Apache-2.0, Giấy phép Phi thương mại Một chiều của NVIDIA áp dụng cho checkpoint.
• Quy mô — 27B dense so với tổng khoảng 15,2B, được ghi là "8B MoT" trong các bảng trong bài báo của chính PixelUMM.
Tuyên bố duy nhất thực sự có thể so sánh được là về nguồn gốc, và nó áp dụng cho cả hai: mọi con số ở trên đều là của chính nhà cung cấp, không con số nào được chạy lại bên ngoài phòng thí nghiệm đã tạo ra nó, và một trong hai mô hình tự gắn nhãn rõ ràng cho kết quả của chính nó là sơ bộ.
Xây dựng với chúng, và lý do bạn có thể dùng cả hai
Hai cái này kết hợp với nhau thì tốt hơn là cạnh tranh. Một ngăn xếp tự động hóa máy tính để bàn cần UI-Mate-27B cho lớp hành động cùng một thứ có thể suy luận trên những gì nó đã thấy; còn một pipeline nội dung hoặc kiểm tra lại cần khả năng đọc và tạo sinh của PixelUMM và chẳng dùng đến con trỏ. Điểm chồng lấn nằm ở ranh giới tri giác, nơi khả năng bám neo vào ảnh chụp màn hình của UI-Mate-27B là chuyên biệt theo tác vụ còn của PixelUMM thì mang tính tổng quát — cùng một điểm ảnh, hai công việc hoàn toàn khác nhau.
Khi bạn thực sự chạy nhiều mô hình đối chiếu với nhau — agent với một VLM đa dụng, hoặc một checkpoint nghiên cứu mới với cái đã có trong production — chi phí của việc so sánh thường nằm ở khâu tích hợp, chứ không phải ở suy luận: hai dạng API, hai cơ chế xác thực, hai hợp đồng. Đó là vấn đề mà một lớp định tuyến được tạo ra để loại bỏ, và đó là lúc thiết kế của OrcaRouter phát huy tác dụng: một khóa duy nhất dùng cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng với mức markup 0%, tự động chuyển đổi dự phòng giữa các nhà cung cấp, cùng một DSL định tuyến và tính năng hợp nhất mô hình để kết hợp nhiều mô hình vào một lời gọi duy nhất. Hiện nay, cả PixelUMM lẫn UI-Mate-27B đều chưa có trên bất kỳ endpoint được host nào, và OrcaRouter không định tuyến mô hình nào trong hai — vậy nên đây là nói về quy trình làm việc khi chúng có mặt, không phải một tuyên bố về tính khả dụng ở thời điểm hiện tại.
Cái nào cho việc nào?
Nếu tác vụ kết thúc bằng một cú nhấp chuột, một lần gõ phím hay một biểu mẫu được điền, thì ở đây chỉ có một ứng viên duy nhất và đó là UI-Mate-27B. Nó theo giấy phép Apache-2.0, có một bài báo trên arXiv và một harness chính thức, và điểm số OSWorld cùng WindowsAgentArena được báo cáo của nó thuộc dạng tuyên bố mà bất kỳ ai có hai GPU và một ảnh kiểm thử Windows hoặc Ubuntu đều có thể kiểm chứng — chính điều đó khiến nó đáng để kiểm chứng thay vì tin tưởng.
Nếu tác vụ kết thúc bằng một câu trả lời hoặc một hình ảnh, PixelUMM là thứ có thể làm được, và trước hết nó là một sản phẩm nghiên cứu. Bài báo của nó trung thực một cách bất thường về những giới hạn của chính mình, thừa nhận rằng dữ liệu huấn luyện khác nhau khiến cho so sánh benchmark của nó "không thể xác lập kiến trúc nào là vượt trội". Checkpoint của nó mang tính phi thương mại. Điểm mạnh của nó là tính mới lạ về kiến trúc và độ bao quát, chứ không phải những con số tiên tiến nhất, và giá trị trước mắt của nó là dành cho bất kỳ ai đang nghiên cứu liệu các mô hình thống nhất không dùng encoder có hoạt động ở quy mô video hay không. Hãy tải nó về để đọc mã và chạy các bản demo; đừng tải nó về để phát hành một tính năng.
Bản tóm tắt hai dòng cũng chính là điều mà bằng chứng đưa ra: một mô hình có thể hành động và không thể sáng tạo, mô hình kia có thể sáng tạo và không thể hành động, và khoảng cách về cấp phép và độ trưởng thành giữa chúng quan trọng hơn bất kỳ số lượng tham số nào.
