ไทเทิลการ์ดที่สร้างขึ้นในสไตล์ประจำของ OrcaRouter ข้อความว่า “PixelUMM vs UI-Mate-27B” พร้อมไทล์สถิติสี่ไทล์: “77.0” (ค่าเฉลี่ย OSWorld-Verified ที่ UI-Mate-27B รายงาน) “66.2” (ค่าเฉลี่ย WindowsAgentArena ของมัน) “ไม่มี” (สเปซการกระทำของ PixelUMM) และ “Apache-2.0” (สัญญาอนุญาตของ UI-Mate-27B สำหรับโค้ดและเวต เทียบกับเช็กพอยต์แบบห้ามใช้เชิงพาณิชย์ของ PixelUMM) บรรทัดส่วนท้ายระบุว่า “คะแนนเอเจนต์ที่ Tencent รายงาน; ตัวเลขของ PixelUMM มาจากพรีพรินต์ของมัน ไม่มีการรันซ้ำโดยอิสระ” โลโก้ OrcaRouter ถูกคอมโพสิตเข้าไปในแถบที่มีระยะขอบด้านล่างขวา
Guides & Insights

PixelUMM กับ UI-Mate-27B: โมเดลหนึ่งวาดสิ่งที่มันเห็น อีกตัวคลิกมัน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Tencen​t UI-Mate-27B และ NVIDIA PixelUMM ดูเทียบเคียงกันได้บนสเปกชีต — 27,000 ล้านพารามิเตอร์เทียบกับราว 15,200 ล้านพารามิเตอร์ ทั้งคู่เปิดให้ดาวน์โหลด ทั้งคู่สร้างบนแกนหลัก Qwe​n — และแท้จริงแล้วพวกมันเทียบกันไม่ได้เลย UI-Mate-27Bเป็น foundation GUI agent คือมันสังเกตภาพหน้าจอแบบสด วางแผนจากสิ่งที่ปรากฏอยู่บนหน้าจอในขณะนั้น และส่งการกระทำของเมาส์และคีย์บอร์ดแบบมีโครงสร้างสำหรับเดสก์ท็อปจริง PixelUMMเป็นโมเดลมัลติโมดัลแบบรวมที่ไม่มีตัวเข้ารหัส ซึ่งอ่านภาพและวิดีโอในพื้นที่พิกเซลดิบ และสร้างภาพและวิดีโอจากข้อความ — มันรับรู้และสร้างสรรค์ แต่ไม่มีพื้นที่การกระทำ ไม่มีเคอร์เซอร์ และไม่มีทางแตะหน้าจอได้ ตัวหนึ่งลงมือกับโลก อีกตัวบรรยายและพรรณนาถึงมัน ทุกสิ่งด้านล่างนี้สืบเนื่องมาจากความแตกต่างนั้น และช่องว่างด้านการอนุญาตสิทธิ์ระหว่างทั้งสองคือสิ่งสำคัญอันดับสองที่คุณต้องรู้

ทั้งสองแล็บรายงานตัวเลขของตัวเอง และไม่มีฝ่ายใดมีการประเมินที่เป็นอิสระ ทั้งคู่เปิดตัวแบบเงียบ ๆ — รูปแบบการเปิดตัวคือจุดที่ความคล้ายคลึงกันสิ้นสุดลงจริง ๆ

ผู้กระทำและผู้รับรู้

UI-Mate-27B ทำงานตามคำสั่งภาษาธรรมชาติและภาพหน้าจอสดเท่านั้น โดยใช้เหตุผลบนสถานะที่มองเห็น วางแผนใหม่เมื่ออินเทอร์เฟซเปลี่ยนไป และส่งออกเหตุผล คำอธิบายการกระทำอย่างกระชับ และการเรียกเครื่องมือใช้งานคอมพิวเตอร์แบบมีโครงสร้าง ครอบคลุมเมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบกับผู้ใช้ และการทำงานให้เสร็จสิ้น คุณสมบัติที่โดดเด่นคือการทำงานที่นำโดยการสาธิต: แสดงเวิร์กโฟลว์ให้ดูเพียงครั้งเดียว แล้วมันจะปรับการสาธิตที่บันทึกไว้ให้เข้ากับงานตรงหน้า โดยถือภาพหน้าจอปัจจุบันเป็นข้อมูลอ้างอิงหลักเมื่ออินเทอร์เฟซเปลี่ยนไปแล้ว มันผ่านการปรับละเอียดจาก Qwen3.6-27B ด้วยการปรับละเอียดแบบมีผู้สอน ตามด้วยการเรียนรู้แบบเสริมกำลังออนไลน์ในสภาพแวดล้อม GUI ที่รันได้ และให้บริการผ่าน vLLM ด้วยอินเทอร์เฟซที่เข้ากันได้กับ OpenAI

• เกณฑ์มาตรฐานที่มีการรายงาน — ค่าเฉลี่ย OSWorld-Verified 77.0, ค่าเฉลี่ย WindowsAgentArena 66.2, OSWorkerBench ความสำเร็จแบบเข้มงวด 41.00 และความคืบหน้า 76.86 ทั้งหมดเป็นข้อมูลที่ Tencent รายงานและยังไม่ได้รับการตรวจสอบซ้ำ

• พื้นที่การดำเนินการ — เมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบของผู้ใช้ การทำงานให้เสร็จสมบูรณ์ ในพื้นที่พิกัดแบบนอร์มัลไลซ์พร้อมการเรียกแบบมีโครงสร้างที่เข้ากันได้กับ pyautogui

• ความเป็นจริงด้านฮาร์ดแวร์ — โมเดล dense 27B ให้บริการด้วย tensor parallelism ผ่าน GPU สองตัวในคู่มือเริ่มต้นใช้งานอย่างรวดเร็วของ Tencent เอง ภายใต้ Apache-2.0

• ข้อควรระวังสำคัญบนตัวการ์ด — UI-Mate-27B เป็นเช็กพอยต์ของเอเจนต์ ไม่ใช่โมเดลแชตภาพแบบสแตนด์อโลน Tencent แนะนำให้ใช้พรอมป์ต์ ตัวแยกวิเคราะห์การตอบกลับ และฮาร์เนสการโต้ตอบอย่างเป็นทางการจากรีโพซิทอรีของโปรเจกต์ หากคุณใช้มันกับ “อธิบายภาพนี้” คุณกำลังใช้เครื่องมือผิด

PixelUMM อยู่ที่ขั้วตรงกันข้าม สถาปัตยกรรมทั้งหมดของมันคือข้อโต้แย้งเกี่ยวกับการแทนค่า: ไม่มี VAE ไม่มีตัวเข้ารหัสภาพ ภาพเป็นแพตช์พิกเซลขนาด 16×16 และวิดีโอเป็นทิวบ์เล็ตเชิงกาล-อวกาศ 4 เฟรม เข้าสู่ Transformer แบบ decoder-only โดยตรงผ่านการฉายเชิงเส้นชั้นเดียว ด้วยการออกแบบ Mixture-of-Transformers ที่จับคู่ความสนใจที่ใช้ร่วมกันกับพารามิเตอร์เฉพาะงาน การเข้าใจคือข้อความแบบ autoregressive; การสร้างคือ flow matching ในปริภูมิพิกเซล มี checkpoint สี่ตัวที่พร้อมใช้งาน, S8-F22-R05 เป็นค่าเริ่มต้นที่ครอบคลุม text-to-image, text-to-video ที่ 96 เฟรมและ 24 fps และทั้งสองทิศทางของการเข้าใจ

A headless-browser capture of the Hugging Face model card for the Tencent UI-Mate-27B repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

รูปแบบการเปิดตัวทั้งสองแบบเป็นตัวอย่างที่ตัดกันอย่างชัดเจน

UI-Mate-27B ปรากฏบน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 พร้อมการ์ดโมเดล, arXiv preprint หมายเลข 2608.15930, หน้าโปรเจกต์, ที่เก็บ GitHub และสูตรการให้บริการที่มีเอกสารประกอบ ระหว่างนั้นจนถึงต้นเดือนตุลาคม มันมีดาวน์โหลดราว 780 ครั้งและถูกกดไลก์ 93 ครั้ง — ไม่มากนัก แต่เป็นการเปิดตัวเอเจนต์วิจัยตามปกติที่มีเอกสารครบถ้วน

ร่องรอยของ PixelUMM แตกต่างออกไปในเชิงประเภท รีโพซิทอรี GitHub ถูกสร้างขึ้นเมื่อวันที่ 4 กันยายน 2026; บทความ preprint ของ arXiv ลงวันที่ 29 กันยายน; รีโพซิทอรี Hugging Face ถูกสร้างขึ้นเมื่อเวลา 21:40 UTC ของวันที่ 1 ตุลาคม 2026 ไม่กี่นาทีหลังจากคอมมิตสุดท้ายของรีโพซิทอรี ไม่มีบล็อกโพสต์ ข่าวประชาสัมพันธ์ หรือเธรดเปิดตัวของ NVIDIA ปรากฏขึ้นสำหรับมัน เส้นทาง URL ของหน้าโปรเจกต์เองยังคงอ่านว่า pixelumm-project-page-previewจำนวนการดาวน์โหลดของมันเป็นศูนย์ ณ เวลาที่เขียนสิ่งนี้

การตีความว่าสิ่งนั้นสื่อถึงเจตนาเป็นเรื่องที่ผิดพลาด — ห้องแล็บแห่งหนึ่งสามารถเผยแพร่ผลงานวิจัยและกำหนดการเปิดตัวไว้ภายหลังได้ สิ่งที่พอจะรู้ได้นั้นแคบกว่าและมีประโยชน์กว่า นั่นคือ โมเดลหนึ่งมีช่องทางให้บริการอย่างเป็นทางการและยอดดาวน์โหลดสิบสัปดาห์ ส่วนอีกโมเดลหนึ่งมีเปเปอร์ มีที่เก็บโค้ด และไม่มีแถลงการณ์จากผู้ขายเลยแม้แต่ฉบับเดียว

A generated scoreboard card titled “PixelUMM vs UI-Mate-27B — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: role, backbone, headline benchmarks, action space, deployment and licence. UI-Mate-27B's column shows a foundation GUI agent, a Qwen3.6-27B fine-tune, OSWorld-Verified 77.0 with WindowsAgentArena 66.2, mouse, keyboard, scrolling, waiting and task-completion calls, 27B dense across roughly two GPUs under vLLM, and Apache-2.0; PixelUMM's column shows an encoder-free perceiver and generator, about 15.2B total on a Qwen3-8B backbone, MMMU 41.67 with GenEval 0.83 and VBench Part 1 quality 84.10, no action space, about 30 GB of distributed-checkpoint shards behind a hidden index, and a noncommercial checkpoint licence. A footer notes the agent scores are Tencent-reported and the generation scores are from the PixelUMM preprint, with no independent rerun of either.

สกอร์บอร์ดที่ไม่ทับซ้อนกัน

ไม่มีเกณฑ์มาตรฐานใดที่ทั้งสองโมเดลรายงาน ซึ่งนั่นเองคือประเด็น: พวกมันไม่ได้แก้ปัญหาเดียวกัน

• การใช้คอมพิวเตอร์แบบเอเจนต์ — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: ไม่มีปริภูมิการกระทำ จึงไม่สามารถมีคะแนนได้

• ความเข้าใจภาพ — UI-Mate-27B: รับภาพหน้าจอเป็นอินพุตของเอเจนต์ ไม่ได้ประเมินในฐานะ VLM ทั่วไป PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00

• วิดีโอ — UI-Mate-27B: ไม่มี PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41

• การสร้าง — UI-Mate-27B: ไม่มี PixelUMM: GenEval 0.83 พร้อมตัวเขียนพรอมต์ใหม่, DPG-Bench 85.74, คุณภาพ VBench Part 1 84.10

• ต้นทุนการปรับใช้ — UI-Mate-27B: โมเดล dense ขนาด 27B กระจายอยู่บน GPU ประมาณสองตัวผ่าน vLLM พร้อมด้วยฮาร์เนสอย่างเป็นทางการ PixelUMM: ประมาณ 30 GB ของชิ้นส่วน distributed-checkpoint, CUDA 13 กับ FlashAttention ที่คอมไพล์จากซอร์ส, โมเดล guardrail แบบ gated สำหรับเส้นทางวิดีโอ และสภาพแวดล้อม Python ที่สองสำหรับมัน

• สัญญาอนุญาต — UI-Mate-27B: Apache-2.0 สำหรับโค้ดและน้ำหนักโมเดล PixelUMM: โค้ด Apache-2.0, สัญญาอนุญาต NVIDIA One-Way Noncommercial สำหรับเช็กพอยต์

• ขนาด — 27B แบบ dense เทียบกับจำนวนรวมประมาณ 15.2B โดยแสดงเป็น "8B MoT" ในตารางบทความของ PixelUMM เอง

ข้อความเดียวที่เปรียบเทียบกันได้อย่างแท้จริงคือข้อความเกี่ยวกับแหล่งที่มา และใช้ได้กับทั้งสองกรณี: ตัวเลขทุกตัวข้างต้นเป็นของผู้ขายเอง ไม่มีตัวใดถูกนำไปรันซ้ำนอกห้องแล็บที่สร้างมันขึ้นมา และหนึ่งในสองโมเดลนั้นระบุผลลัพธ์ของตนเองว่าเป็นผลเบื้องต้นอย่างชัดเจน

การสร้างด้วยพวกมัน และเหตุผลที่คุณอาจใช้ทั้งคู่

สองสิ่งนี้ทำงานร่วมกันได้ดีกว่าแข่งขันกัน สแต็กระบบอัตโนมัติบนเดสก์ท็อปต้องการ UI-Mate-27B สำหรับเลเยอร์การลงมือปฏิบัติ และต้องการบางสิ่งที่สามารถใช้เหตุผลกับสิ่งที่มันเห็น ขณะที่ไปป์ไลน์ด้านเนื้อหาหรือการตรวจสอบต้องการความสามารถในการอ่านและสร้างของ PixelUMM และไม่มีความจำเป็นใด ๆ กับเคอร์เซอร์ จุดทับซ้อนอยู่ที่ขอบเขตการรับรู้ โดยที่การยึดโยงกับภาพหน้าจอของ UI-Mate-27B นั้นเฉพาะต่องาน ขณะที่ของ PixelUMM เป็นแบบทั่วไป — พิกเซลเดียวกัน แต่งานสองอย่างที่ต่างกันโดยสิ้นเชิง

เมื่อคุณรันหลายโมเดลเทียบกันจริง ๆ — เอเจนต์เทียบกับ VLM ทั่วไป หรือ checkpoint งานวิจัยใหม่เทียบกับตัวที่ใช้งานจริงอยู่แล้ว — ต้นทุนของการเปรียบเทียบมักอยู่ที่การผสานรวม ไม่ใช่การอินเฟอเรนซ์: รูปแบบ API สองแบบ รูปแบบการยืนยันตัวตนสองแบบ สัญญาสองฉบับ นั่นคือปัญหาที่เลเยอร์ routing ถูกสร้างขึ้นมาเพื่อขจัด และนั่นคือจุดที่การออกแบบของ OrcaRouter คุ้มค่า: คีย์เดียวใช้กับ 200+ โมเดล ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกกำไร 0% failover อัตโนมัติข้ามผู้ให้บริการ และ routing DSL พร้อม model fusion สำหรับประกอบหลายโมเดลให้เป็นการเรียกครั้งเดียว ทั้ง PixelUMM และ UI-Mate-27B ยังไม่อยู่บน hosted endpoint ใดในวันนี้ และ OrcaRouter ไม่ได้ route โมเดลทั้งสองนี้ — ดังนั้นนี่จึงเป็นเรื่องเกี่ยวกับเวิร์กโฟลว์เมื่อทั้งสองพร้อมใช้งาน ไม่ใช่คำกล่าวอ้างเกี่ยวกับความพร้อมใช้งานในตอนนี้

อันไหนสำหรับงานไหน

ถ้างานจบลงด้วยการคลิก การกดคีย์ หรือแบบฟอร์มที่กรอกข้อมูลแล้ว ที่นี่มีเพียงตัวเลือกเดียวเท่านั้น และนั่นคือ UI-Mate-27B มันเป็น Apache-2.0 มีเปเปอร์บน arXiv และฮาร์เนสอย่างเป็นทางการ และคะแนน OSWorld กับ WindowsAgentArena ที่รายงานไว้นั้นเป็นคำอ้างประเภทที่ใครก็ตรวจสอบได้ด้วย GPU สองตัวกับอิมเมจทดสอบ Windows หรือ Ubuntu — ซึ่งนั่นแหละคือสิ่งที่ทำให้มันคุ้มค่าที่จะตรวจสอบมากกว่าจะเชื่อใจ

ถ้างานนั้นจบลงด้วยคำตอบหรือรูปภาพ PixelUMM คือตัวที่ทำได้ และอันดับแรกมันคือผลงานวิจัย เปเปอร์ของมันซื่อตรงต่อขีดจำกัดของตัวเองอย่างผิดปกติ โดยยอมรับว่าข้อมูลฝึกที่แตกต่างกันทำให้การเปรียบเทียบ benchmark ของมัน “ไม่สามารถยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า” เช็กพอยต์ของมันใช้เชิงพาณิชย์ไม่ได้ จุดแข็งของมันคือความแปลกใหม่เชิงสถาปัตยกรรมและความกว้าง ไม่ใช่ตัวเลขระดับ state-of-the-art และคุณค่าทันทีของมันคือสำหรับใครก็ตามที่ศึกษาว่าโมเดลแบบรวมที่ไม่มีเอนโคเดอร์ทำงานในระดับวิดีโอได้หรือไม่ ดาวน์โหลดไปเพื่ออ่านโค้ดและรันเดโม; อย่าดาวน์โหลดไปเพื่อปล่อยฟีเจอร์

สรุปสองบรรทัดนี้ก็เป็นแบบเดียวกับที่หลักฐานบ่งชี้ โมเดลหนึ่งลงมือทำได้แต่สร้างไม่ได้ อีกโมเดลสร้างได้แต่ลงมือทำไม่ได้ และช่องว่างด้านการอนุญาตและความสมบูรณ์ระหว่างทั้งสองสำคัญกว่าจำนวนพารามิเตอร์ใด ๆ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube