
PixelUMM กับ UI-Mate-27B: โมเดลหนึ่งวาดสิ่งที่มันเห็น อีกตัวคลิกมัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Tencent UI-Mate-27B และ NVIDIA PixelUMM ดูเทียบเคียงกันได้บนสเปกชีต — 27,000 ล้านพารามิเตอร์เทียบกับราว 15,200 ล้านพารามิเตอร์ ทั้งคู่เปิดให้ดาวน์โหลด ทั้งคู่สร้างบนแกนหลัก Qwen — และแท้จริงแล้วพวกมันเทียบกันไม่ได้เลย UI-Mate-27Bเป็น foundation GUI agent คือมันสังเกตภาพหน้าจอแบบสด วางแผนจากสิ่งที่ปรากฏอยู่บนหน้าจอในขณะนั้น และส่งการกระทำของเมาส์และคีย์บอร์ดแบบมีโครงสร้างสำหรับเดสก์ท็อปจริง PixelUMMเป็นโมเดลมัลติโมดัลแบบรวมที่ไม่มีตัวเข้ารหัส ซึ่งอ่านภาพและวิดีโอในพื้นที่พิกเซลดิบ และสร้างภาพและวิดีโอจากข้อความ — มันรับรู้และสร้างสรรค์ แต่ไม่มีพื้นที่การกระทำ ไม่มีเคอร์เซอร์ และไม่มีทางแตะหน้าจอได้ ตัวหนึ่งลงมือกับโลก อีกตัวบรรยายและพรรณนาถึงมัน ทุกสิ่งด้านล่างนี้สืบเนื่องมาจากความแตกต่างนั้น และช่องว่างด้านการอนุญาตสิทธิ์ระหว่างทั้งสองคือสิ่งสำคัญอันดับสองที่คุณต้องรู้
ทั้งสองแล็บรายงานตัวเลขของตัวเอง และไม่มีฝ่ายใดมีการประเมินที่เป็นอิสระ ทั้งคู่เปิดตัวแบบเงียบ ๆ — รูปแบบการเปิดตัวคือจุดที่ความคล้ายคลึงกันสิ้นสุดลงจริง ๆ
ผู้กระทำและผู้รับรู้
UI-Mate-27B ทำงานตามคำสั่งภาษาธรรมชาติและภาพหน้าจอสดเท่านั้น โดยใช้เหตุผลบนสถานะที่มองเห็น วางแผนใหม่เมื่ออินเทอร์เฟซเปลี่ยนไป และส่งออกเหตุผล คำอธิบายการกระทำอย่างกระชับ และการเรียกเครื่องมือใช้งานคอมพิวเตอร์แบบมีโครงสร้าง ครอบคลุมเมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบกับผู้ใช้ และการทำงานให้เสร็จสิ้น คุณสมบัติที่โดดเด่นคือการทำงานที่นำโดยการสาธิต: แสดงเวิร์กโฟลว์ให้ดูเพียงครั้งเดียว แล้วมันจะปรับการสาธิตที่บันทึกไว้ให้เข้ากับงานตรงหน้า โดยถือภาพหน้าจอปัจจุบันเป็นข้อมูลอ้างอิงหลักเมื่ออินเทอร์เฟซเปลี่ยนไปแล้ว มันผ่านการปรับละเอียดจาก Qwen3.6-27B ด้วยการปรับละเอียดแบบมีผู้สอน ตามด้วยการเรียนรู้แบบเสริมกำลังออนไลน์ในสภาพแวดล้อม GUI ที่รันได้ และให้บริการผ่าน vLLM ด้วยอินเทอร์เฟซที่เข้ากันได้กับ OpenAI
• เกณฑ์มาตรฐานที่มีการรายงาน — ค่าเฉลี่ย OSWorld-Verified 77.0, ค่าเฉลี่ย WindowsAgentArena 66.2, OSWorkerBench ความสำเร็จแบบเข้มงวด 41.00 และความคืบหน้า 76.86 ทั้งหมดเป็นข้อมูลที่ Tencent รายงานและยังไม่ได้รับการตรวจสอบซ้ำ
• พื้นที่การดำเนินการ — เมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบของผู้ใช้ การทำงานให้เสร็จสมบูรณ์ ในพื้นที่พิกัดแบบนอร์มัลไลซ์พร้อมการเรียกแบบมีโครงสร้างที่เข้ากันได้กับ pyautogui
• ความเป็นจริงด้านฮาร์ดแวร์ — โมเดล dense 27B ให้บริการด้วย tensor parallelism ผ่าน GPU สองตัวในคู่มือเริ่มต้นใช้งานอย่างรวดเร็วของ Tencent เอง ภายใต้ Apache-2.0
• ข้อควรระวังสำคัญบนตัวการ์ด — UI-Mate-27B เป็นเช็กพอยต์ของเอเจนต์ ไม่ใช่โมเดลแชตภาพแบบสแตนด์อโลน Tencent แนะนำให้ใช้พรอมป์ต์ ตัวแยกวิเคราะห์การตอบกลับ และฮาร์เนสการโต้ตอบอย่างเป็นทางการจากรีโพซิทอรีของโปรเจกต์ หากคุณใช้มันกับ “อธิบายภาพนี้” คุณกำลังใช้เครื่องมือผิด
PixelUMM อยู่ที่ขั้วตรงกันข้าม สถาปัตยกรรมทั้งหมดของมันคือข้อโต้แย้งเกี่ยวกับการแทนค่า: ไม่มี VAE ไม่มีตัวเข้ารหัสภาพ ภาพเป็นแพตช์พิกเซลขนาด 16×16 และวิดีโอเป็นทิวบ์เล็ตเชิงกาล-อวกาศ 4 เฟรม เข้าสู่ Transformer แบบ decoder-only โดยตรงผ่านการฉายเชิงเส้นชั้นเดียว ด้วยการออกแบบ Mixture-of-Transformers ที่จับคู่ความสนใจที่ใช้ร่วมกันกับพารามิเตอร์เฉพาะงาน การเข้าใจคือข้อความแบบ autoregressive; การสร้างคือ flow matching ในปริภูมิพิกเซล มี checkpoint สี่ตัวที่พร้อมใช้งาน, S8-F22-R05 เป็นค่าเริ่มต้นที่ครอบคลุม text-to-image, text-to-video ที่ 96 เฟรมและ 24 fps และทั้งสองทิศทางของการเข้าใจ

รูปแบบการเปิดตัวทั้งสองแบบเป็นตัวอย่างที่ตัดกันอย่างชัดเจน
UI-Mate-27B ปรากฏบน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 พร้อมการ์ดโมเดล, arXiv preprint หมายเลข 2608.15930, หน้าโปรเจกต์, ที่เก็บ GitHub และสูตรการให้บริการที่มีเอกสารประกอบ ระหว่างนั้นจนถึงต้นเดือนตุลาคม มันมีดาวน์โหลดราว 780 ครั้งและถูกกดไลก์ 93 ครั้ง — ไม่มากนัก แต่เป็นการเปิดตัวเอเจนต์วิจัยตามปกติที่มีเอกสารครบถ้วน
ร่องรอยของ PixelUMM แตกต่างออกไปในเชิงประเภท รีโพซิทอรี GitHub ถูกสร้างขึ้นเมื่อวันที่ 4 กันยายน 2026; บทความ preprint ของ arXiv ลงวันที่ 29 กันยายน; รีโพซิทอรี Hugging Face ถูกสร้างขึ้นเมื่อเวลา 21:40 UTC ของวันที่ 1 ตุลาคม 2026 ไม่กี่นาทีหลังจากคอมมิตสุดท้ายของรีโพซิทอรี ไม่มีบล็อกโพสต์ ข่าวประชาสัมพันธ์ หรือเธรดเปิดตัวของ NVIDIA ปรากฏขึ้นสำหรับมัน เส้นทาง URL ของหน้าโปรเจกต์เองยังคงอ่านว่า pixelumm-project-page-previewจำนวนการดาวน์โหลดของมันเป็นศูนย์ ณ เวลาที่เขียนสิ่งนี้
การตีความว่าสิ่งนั้นสื่อถึงเจตนาเป็นเรื่องที่ผิดพลาด — ห้องแล็บแห่งหนึ่งสามารถเผยแพร่ผลงานวิจัยและกำหนดการเปิดตัวไว้ภายหลังได้ สิ่งที่พอจะรู้ได้นั้นแคบกว่าและมีประโยชน์กว่า นั่นคือ โมเดลหนึ่งมีช่องทางให้บริการอย่างเป็นทางการและยอดดาวน์โหลดสิบสัปดาห์ ส่วนอีกโมเดลหนึ่งมีเปเปอร์ มีที่เก็บโค้ด และไม่มีแถลงการณ์จากผู้ขายเลยแม้แต่ฉบับเดียว

สกอร์บอร์ดที่ไม่ทับซ้อนกัน
ไม่มีเกณฑ์มาตรฐานใดที่ทั้งสองโมเดลรายงาน ซึ่งนั่นเองคือประเด็น: พวกมันไม่ได้แก้ปัญหาเดียวกัน
• การใช้คอมพิวเตอร์แบบเอเจนต์ — UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2. PixelUMM: ไม่มีปริภูมิการกระทำ จึงไม่สามารถมีคะแนนได้
• ความเข้าใจภาพ — UI-Mate-27B: รับภาพหน้าจอเป็นอินพุตของเอเจนต์ ไม่ได้ประเมินในฐานะ VLM ทั่วไป PixelUMM: MMMU 41.67, AI2D 80.12, DocVQA 90.42, ChartQA 82.96, OCRBench 78.00
• วิดีโอ — UI-Mate-27B: ไม่มี PixelUMM: MVBench 70.53, Video-MME 57.33, LongVideoBench 59.61, LVBench 40.41
• การสร้าง — UI-Mate-27B: ไม่มี PixelUMM: GenEval 0.83 พร้อมตัวเขียนพรอมต์ใหม่, DPG-Bench 85.74, คุณภาพ VBench Part 1 84.10
• ต้นทุนการปรับใช้ — UI-Mate-27B: โมเดล dense ขนาด 27B กระจายอยู่บน GPU ประมาณสองตัวผ่าน vLLM พร้อมด้วยฮาร์เนสอย่างเป็นทางการ PixelUMM: ประมาณ 30 GB ของชิ้นส่วน distributed-checkpoint, CUDA 13 กับ FlashAttention ที่คอมไพล์จากซอร์ส, โมเดล guardrail แบบ gated สำหรับเส้นทางวิดีโอ และสภาพแวดล้อม Python ที่สองสำหรับมัน
• สัญญาอนุญาต — UI-Mate-27B: Apache-2.0 สำหรับโค้ดและน้ำหนักโมเดล PixelUMM: โค้ด Apache-2.0, สัญญาอนุญาต NVIDIA One-Way Noncommercial สำหรับเช็กพอยต์
• ขนาด — 27B แบบ dense เทียบกับจำนวนรวมประมาณ 15.2B โดยแสดงเป็น "8B MoT" ในตารางบทความของ PixelUMM เอง
ข้อความเดียวที่เปรียบเทียบกันได้อย่างแท้จริงคือข้อความเกี่ยวกับแหล่งที่มา และใช้ได้กับทั้งสองกรณี: ตัวเลขทุกตัวข้างต้นเป็นของผู้ขายเอง ไม่มีตัวใดถูกนำไปรันซ้ำนอกห้องแล็บที่สร้างมันขึ้นมา และหนึ่งในสองโมเดลนั้นระบุผลลัพธ์ของตนเองว่าเป็นผลเบื้องต้นอย่างชัดเจน
การสร้างด้วยพวกมัน และเหตุผลที่คุณอาจใช้ทั้งคู่
สองสิ่งนี้ทำงานร่วมกันได้ดีกว่าแข่งขันกัน สแต็กระบบอัตโนมัติบนเดสก์ท็อปต้องการ UI-Mate-27B สำหรับเลเยอร์การลงมือปฏิบัติ และต้องการบางสิ่งที่สามารถใช้เหตุผลกับสิ่งที่มันเห็น ขณะที่ไปป์ไลน์ด้านเนื้อหาหรือการตรวจสอบต้องการความสามารถในการอ่านและสร้างของ PixelUMM และไม่มีความจำเป็นใด ๆ กับเคอร์เซอร์ จุดทับซ้อนอยู่ที่ขอบเขตการรับรู้ โดยที่การยึดโยงกับภาพหน้าจอของ UI-Mate-27B นั้นเฉพาะต่องาน ขณะที่ของ PixelUMM เป็นแบบทั่วไป — พิกเซลเดียวกัน แต่งานสองอย่างที่ต่างกันโดยสิ้นเชิง
เมื่อคุณรันหลายโมเดลเทียบกันจริง ๆ — เอเจนต์เทียบกับ VLM ทั่วไป หรือ checkpoint งานวิจัยใหม่เทียบกับตัวที่ใช้งานจริงอยู่แล้ว — ต้นทุนของการเปรียบเทียบมักอยู่ที่การผสานรวม ไม่ใช่การอินเฟอเรนซ์: รูปแบบ API สองแบบ รูปแบบการยืนยันตัวตนสองแบบ สัญญาสองฉบับ นั่นคือปัญหาที่เลเยอร์ routing ถูกสร้างขึ้นมาเพื่อขจัด และนั่นคือจุดที่การออกแบบของ OrcaRouter คุ้มค่า: คีย์เดียวใช้กับ 200+ โมเดล ราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยบวกกำไร 0% failover อัตโนมัติข้ามผู้ให้บริการ และ routing DSL พร้อม model fusion สำหรับประกอบหลายโมเดลให้เป็นการเรียกครั้งเดียว ทั้ง PixelUMM และ UI-Mate-27B ยังไม่อยู่บน hosted endpoint ใดในวันนี้ และ OrcaRouter ไม่ได้ route โมเดลทั้งสองนี้ — ดังนั้นนี่จึงเป็นเรื่องเกี่ยวกับเวิร์กโฟลว์เมื่อทั้งสองพร้อมใช้งาน ไม่ใช่คำกล่าวอ้างเกี่ยวกับความพร้อมใช้งานในตอนนี้
อันไหนสำหรับงานไหน
ถ้างานจบลงด้วยการคลิก การกดคีย์ หรือแบบฟอร์มที่กรอกข้อมูลแล้ว ที่นี่มีเพียงตัวเลือกเดียวเท่านั้น และนั่นคือ UI-Mate-27B มันเป็น Apache-2.0 มีเปเปอร์บน arXiv และฮาร์เนสอย่างเป็นทางการ และคะแนน OSWorld กับ WindowsAgentArena ที่รายงานไว้นั้นเป็นคำอ้างประเภทที่ใครก็ตรวจสอบได้ด้วย GPU สองตัวกับอิมเมจทดสอบ Windows หรือ Ubuntu — ซึ่งนั่นแหละคือสิ่งที่ทำให้มันคุ้มค่าที่จะตรวจสอบมากกว่าจะเชื่อใจ
ถ้างานนั้นจบลงด้วยคำตอบหรือรูปภาพ PixelUMM คือตัวที่ทำได้ และอันดับแรกมันคือผลงานวิจัย เปเปอร์ของมันซื่อตรงต่อขีดจำกัดของตัวเองอย่างผิดปกติ โดยยอมรับว่าข้อมูลฝึกที่แตกต่างกันทำให้การเปรียบเทียบ benchmark ของมัน “ไม่สามารถยืนยันได้ว่าสถาปัตยกรรมใดเหนือกว่า” เช็กพอยต์ของมันใช้เชิงพาณิชย์ไม่ได้ จุดแข็งของมันคือความแปลกใหม่เชิงสถาปัตยกรรมและความกว้าง ไม่ใช่ตัวเลขระดับ state-of-the-art และคุณค่าทันทีของมันคือสำหรับใครก็ตามที่ศึกษาว่าโมเดลแบบรวมที่ไม่มีเอนโคเดอร์ทำงานในระดับวิดีโอได้หรือไม่ ดาวน์โหลดไปเพื่ออ่านโค้ดและรันเดโม; อย่าดาวน์โหลดไปเพื่อปล่อยฟีเจอร์
สรุปสองบรรทัดนี้ก็เป็นแบบเดียวกับที่หลักฐานบ่งชี้ โมเดลหนึ่งลงมือทำได้แต่สร้างไม่ได้ อีกโมเดลสร้างได้แต่ลงมือทำไม่ได้ และช่องว่างด้านการอนุญาตและความสมบูรณ์ระหว่างทั้งสองสำคัญกว่าจำนวนพารามิเตอร์ใด ๆ
