
Tencent UI-Mate-27B: เอเจนต์ GUI แบบ Open-Weight ผู้เงียบสงบที่คว้าอันดับต้น ๆ ใน WindowsAgentArena
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
เมื่อวันที่ 14 สิงหาคม 2026 ทีม HY Frontier Multimodal Agent ของ Tencent ได้อัปโหลด checkpoint สามตัวไปยัง Hugging Face ภายใต้สังกัด tencent/ — ได้แก่ UI-Mate-27B, UI-Mate-9B รุ่นเล็กกว่า และ UI-Mate-democua-27B ที่ใช้การสาธิตเป็นแนวทาง สี่วันต่อมายังไม่มีการประกาศใด ๆ: ไม่มีโพสต์เปิดตัว ไม่มีข่าวประชาสัมพันธ์ ไม่มีทวีตผลิตภัณฑ์ สิ่งที่ปล่อยออกมาแทนกลับมีความสมบูรณ์ผิดปกติสำหรับการปล่อยแบบเงียบ ๆ: หน้าโปรเจกต์, พื้นที่เก็บ GitHub พร้อมฮาร์เนสที่ใช้งานได้ และบทความ arXiv ที่ส่งเมื่อสองวันก่อน ซึ่งระบุให้โมเดลขนาดใหญ่กว่าเป็น open-weight state of the art ตัวใหม่ในการควบคุม GUI บนเดสก์ท็อป
ทุกอย่างในชิ้นนี้อ้างอิงจาก model cards, พื้นที่เก็บ GitHub, หน้าโปรเจกต์ และเปเปอร์นั้น — ยังไม่มีใครทำซ้ำผลลัพธ์อย่างอิสระเลย จุดตรวจสอบ (checkpoints) มียอดดาวน์โหลดเป็นศูนย์บน Hugging Face ณ เวลาที่เขียนนี้ ซึ่งหมายความว่าเราอาจเป็นกลุ่มคนกลุ่มแรกนอก Tencent ที่ให้ความสำคัญกับพวกมันในเชิงเอกสาร นี่คือสิ่งที่ทราบได้จริงจากพื้นที่เก็บ และสิ่งที่ยังไม่ได้รับการยืนยันจนกว่าคนอื่นจะรันมัน
สารบัญ
• สิ่งที่ออกมาแล้ว และสิ่งที่ยังไม่มีการประกาศ
• UI-Mate-27B แท้จริงคืออะไร
• คุณสมบัติที่แตกต่าง: การดำเนินการที่นำทางด้วยการสาธิต
• ตัวเลขทั้งหมด — รายงานโดยผู้ขาย
• ตัวเลขเหล่านั้นจะอยู่ตรงไหน — ถ้ามันยังคงอยู่
• วิธีเรียกใช้งาน
• สแต็กที่อยู่รอบเอเจนต์ GUI ใหม่
• สิ่งที่ควรดูต่อไป
• คำถามที่พบบ่อย
สิ่งที่เปิดตัวไปแล้ว และสิ่งที่ยังไม่มีการประกาศ
เทนเซ็นต์เผยแพร่ UI-Mate-27B (พารามิเตอร์ 27 พันล้าน, Apache-2.0, safetensors ในรูปแบบ BF16) เมื่อวันที่ 14 สิงหาคม 2026 พร้อมกับรุ่นน้องขนาด 9B และ checkpoint ที่ขับเคลื่อนด้วยการสาธิต UI-Mate-democua-27B checkpoint ขนาด 27B ทั้งสองตัวสร้างบน Qwen3.6-27B — ซึ่งเป็นโมเดลมัลติโมดัลภายใต้สัญญาอนุญาต Apache-2.0 ที่เผยแพร่ในเดือนเมษายน 2026 — ซึ่งหมายความว่าทั้งสแตก ไม่ว่าจะเป็นโมเดลฐานหรือไฟน์จูน สามารถนำไปใช้เชิงพาณิชย์ได้ ที่เก็บโค้ด (repos) มีการประทับเวลาแก้ไขล่าสุดจากสัปดาห์นี้ — checkpoint ที่ขับเคลื่อนด้วยการสาธิตถูกแก้ไขล่าสุดเมื่อวันนี้ — ดังนั้นเทนเซ็นต์ยังคงพัฒนาพวกมันอย่างต่อเนื่อง

สิ่งที่เปิดเผยต่อสาธารณะในตอนนี้:
• น้ำหนักของ UI-Mate-27B, UI-Mate-9B และ UI-Mate-democua-27B บน Hugging Face โดยแต่ละรุ่นมีการ์ดโมเดล ตารางการประเมินผล และสูตรการให้บริการ (serving recipe)
• หน้าโปรเจกต์ที่ ui-mate.github.io พร้อมวิดีโอสาธิต คู่มือการใช้งาน และแอป macOS Apple Silicon (DMG v0.2.4)
• GitHub repository (github.com/Tencent/UI-Mate) ที่มี official prompt, response parser และ interaction harness — การ์ดระบุชัดเจนว่าสิ่งนี้คือ "agent checkpoint มากกว่าเป็น standalone visual-chat model" และแนะนำให้ใช้ harness สำหรับการใช้งานจริงใดๆ
• พรีปรินต์ arXiv (2608.15930) ส่งเมื่อวันที่ 16 สิงหาคม ภายใต้ชื่อ "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."
สิ่งที่ยังไม่เปิดเผยต่อสาธารณะ: Tencent เองยังไม่ได้พูดอะไรเลย — นี่คือการปล่อยผ่าน repo ก่อน ไม่ใช่การเปิดตัวอย่างเป็นทางการ ตัวแปรแบบสาธิตนำทาง (demonstration-guided) ที่หน้าโปรเจกต์เคยระบุว่ายังไม่เปิดเผยต่อสาธารณะ ตอนนี้มีน้ำหนัก (weights) ที่ใช้งานได้จริงบน Hugging Face แล้ว: repo ชื่อ tencent/UI-Mate-democua-27B ซึ่งสร้างขึ้นใน push เดียวกันกับวันที่ 14 สิงหาคม ถูกแท็กอย่างชัดเจนว่าเป็น checkpoint แบบสาธิตนำทางของตระกูลโมเดลนี้ — เป็นโมเดลที่แยกต่างหาก ไม่ใช่การรีแบรนด์ของรุ่น 27B และยังคงไม่มี hosted API ที่ใดเลย สิ่งนี้สำคัญ: วิธีเดียวที่จะรัน UI-Mate ในตอนนี้คือดาวน์โหลดน้ำหนักและนำไปให้บริการด้วยตัวเอง
UI-Mate-27B แท้จริงแล้วคืออะไร
UI-Mate-27B เป็นเอเจนต์ GUI พื้นฐานสำหรับ "การทำงานระยะยาวข้ามแอปพลิเคชันและระบบปฏิบัติการ" โดยจะสังเกตภาพหน้าจอแบบเรียลไทม์ ให้เหตุผลจากสถานะที่มองเห็นได้ และสร้างคำสั่งคีย์บอร์ดและเมาส์ที่มีโครงสร้างสำหรับการโต้ตอบกับเดสก์ท็อปโดยตรง การฝึกใช้การปรับแต่งแบบมีผู้ดูแล (supervised fine-tuning) ตามด้วยการเรียนรู้แบบเสริมกำลังแบบออนไลน์ในสภาพแวดล้อม GUI ที่ทำงานได้จริง — โมเดลเรียนรู้จากการขับเคลื่อนเดสก์ท็อปจริง ไม่ใช่จากภาพหน้าจอแบบนิ่งเพียงอย่างเดียว
พื้นที่แอคชันคือส่วนที่นักพัฒนาจะให้ความสำคัญ: เมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบกับผู้ใช้ และการทำงานให้เสร็จสมบูรณ์ โดยผลลัพธ์เข้ากันได้กับ pyautogui โมเดลใช้เหตุผลในพื้นที่พิกัดปกติ 1000×1000 และเอเจนต์อ้างอิงจะปรับขนาดการคาดการณ์กลับไปเป็นความละเอียดจริงของภาพหน้าจอ ดังนั้นการกระทำจึงยังคงทำงานได้แม้มีความแตกต่างของสเกลการแสดงผลระหว่างเครื่อง README ของโมเดลแนะนำให้ให้บริการด้วย vLLM ผ่าน endpoint ที่เข้ากันได้กับ OpenAI
ฟีเจอร์ที่แตกต่าง: การทำงานที่นำทางด้วยการสาธิต
ตัวแทน GUI ส่วนใหญ่รับอินพุตหนึ่งอย่าง: คำสั่ง UI-Mate รับอินพุตที่สองซึ่งหายากมากในโอเพนเช็คพอยต์ — การสาธิต "แสดงเวิร์กโฟลว์หนึ่งครั้ง ให้ตัวแทนปรับใช้กับงานที่ทำอยู่" ตามที่หน้าของโปรเจกต์กล่าวไว้
กลไกนี้ไม่ใช่วิดีโอในบริบทหรือสคริปต์การกระทำแบบตายตัว การสาธิตจะบันทึกภาพหน้าจอทันทีก่อนและหลังการกระทำแต่ละครั้ง ไม่ว่าจะเป็นการกดแป้นพิมพ์หรือการชี้ pointer จากนั้นไปป์ไลน์จะปรับบันทึกให้เป็นมาตรฐานเป็นการแสดงผลแบบแอ็กชันและเฟรมที่สอดคล้องกัน ใส่คำอธิบายประกอบด้วยข้อสังเกต เจตนา การกระทำ และหลักฐานการยืนยัน พร้อมแบ่งเป็นงานย่อยที่ตั้งชื่อพร้อมเกณฑ์ความสำเร็จ ในเวลาอนุมาน ข้อมูลดังกล่าวจะกลายเป็นเวิร์กโฟลว์ขนาดกะทัดรัดที่ถูกใส่ไว้สำหรับงานย่อยที่กำลังทำงาน แต่ภาพหน้าจอแบบเรียลไทม์ยังคงเป็นหลักตลอดกระบวนการ ดังนั้นเมื่อสถานะของแอปพลิเคชันแตกต่างจากที่สาธิตไว้ โมเดลจะวางแผนใหม่แทนที่จะเล่นซ้ำตามเดิม
เทนเซ็นต์ได้ทำให้ checkpoint ที่อยู่เบื้องหลังเวิร์กโฟลว์นี้กลายเป็นโมเดลสาธารณะของตัวเอง: การ์ด UI-Mate-democua-27B {{1}}จับคู่ผลลัพธ์แบบ instruction-only และแบบมีตัวอย่างเดียวบนชุดการประเมินเดียวกัน และ schema เครื่องมือของมันเพิ่มแอ็กชัน subtask_complete ซึ่งเป็นกลไกเบื้องหลัง subtask ที่มีชื่อเหล่านั้น{{/1}} บนชุดย่อย self-demo ของ OSWorkerBench {{2}}ตัวอย่างเดียวช่วยเพิ่มความสำเร็จแบบเข้มงวดจาก 17.17 เป็น 35.35 และความคืบหน้าจาก 67.85 เป็น 81.14{{/2}}; บนชุดย่อย OSWorld ความคืบหน้าเพิ่มจาก 40.27 เป็น 65.75; ในชุดการประเมิน GameDev คะแนนเฉลี่ยเพิ่มจาก 76.76 เป็น 81.15 ขณะที่ความยาวเส้นทางเฉลี่ยลดลงจาก 303.6 เป็น 253.1 ขั้นตอน — ตัวอย่างช่วยทำให้งานสั้นลงและดีขึ้นพร้อมกัน การ์ดรายงานว่าตัวอย่างปรับปรุง 28 จาก 33 งาน self-demo และทำสำเร็จสี่งานที่ได้คะแนนศูนย์เมื่อไม่มีคำแนะนำ ข้อควรระวังคือสิ่งเดียวกับที่ปรากฏตลอดทั้งบทความนี้: สิ่งเหล่านี้คือการประเมินแบบจับคู่ของทีมงานเอง เฉลี่ยจากการรันสามถึงห้าครั้ง และยังไม่มีใครทำซ้ำผลลัพธ์เหล่านี้ได้
ตัวเลข — ทั้งหมดนั้นรายงานโดยผู้ขาย
ดำเนินการตามคำสั่งเท่านั้น ตรงจากบัตรโมเดล:
• คะแนนเฉลี่ย OSWorld-Verified — 77.0
• WindowsAgentArena คะแนนเฉลี่ย — 66.2
• OSWorkerBench ผ่านอย่างเคร่งครัด — 41.00
• ความคืบหน้าของ OSWorkerBench — 76.86

OSWorkerBench เองก็เป็นหนึ่งในสามส่วนสนับสนุนในบทความนี้: ชุดเกณฑ์มาตรฐานใหม่ของงานสำนักงานระยะยาว 100 งานจาก 41 แอปพลิเคชัน โดยมีชุดย่อยแบบสาธิตด้วยตนเอง 33 ชุด และแบบสาธิตหลากหลาย 45 ชุด เป็นการประเมินแบบใหม่ จึงไม่มีงานวิจัยก่อนหน้าให้เทียบคะแนนทั้งสองค่านั้นได้ เมื่อเทียบกับโมเดลพื้นฐานของตัวเอง UI-Mate-27B ถูกอ้างว่าชนะ Qwen3.6-27B ด้วยคะแนนความสำเร็จแบบเข้มงวด 17.7 จุด และความคืบหน้า 24.5 จุดบน OSWorkerBench ซึ่งเป็นตัวเลขที่เทียบได้แบบตรงไปตรงมาที่สุดในการเปิดตัวทั้งหมด เนื่องจากทั้งสองโมเดลจะถูกทดสอบผ่านระบบเดียวกัน
ตัวเลขทุกตัวด้านบนเป็นการประเมินของทีมเอง ยังไม่มีคะแนนอิสระ ไม่มีการทดสอบซ้ำโดยบุคคลที่สาม และด้วยยอดดาวน์โหลดเป็นศูนย์ จึงไม่มีการทำซ้ำโดยชุมชนเช่นกัน โปรดถือว่าตัวเลขทุกตัวที่นี่เป็นการกล่าวอ้าง ไม่ใช่ข้อเท็จจริง
ว่าตัวเลขเหล่านั้นจะอยู่ตรงไหน — ถ้าพวกมันยังคงอยู่
WindowsAgentArena คือสิ่งที่จะเป็นพาดหัวข่าวจริงๆ ผลลัพธ์ WAA ที่รายงานต่อสาธารณะดีที่สุดช่วงต้นปี 2026 รวมกันอยู่ที่ประมาณ 61.0 (ระบบโมดูลาร์ที่ชื่อ VLAA-GUI, เมษายน 2026); โมเดลแบบเปิดน้ำหนัก EvoCUA-32B จาก Meituan อยู่ที่ 56.5 และ UI-TARS-2 แบบปิดของ ByteDance อยู่ในช่วง 50 ต้นๆ ถึงกลางบนกระดานเดียวกัน คะแนน 66.2 จากการประเมินของ UI-Mate-27B เองจะทำให้มันอยู่เหนือทุกอย่างที่เคยรายงานบน benchmark นี้ในปีนี้ — ทั้งแบบเปิดหรือปิด นั่นเป็นการกล่าวอ้างที่แข็งแกร่ง และจำเป็นต้องมีการทดสอบซ้ำอย่างอิสระ
OSWorld-Verified ที่ 77.0 ถือว่าแข็งแกร่ง แต่ไม่ใช่สถิติใหม่สำหรับโมเดล open-weight บนกระดานคะแนนสาธารณะ บนภาพรวมลีดเดอร์บอร์ด OSWorld-Verified จากช่วงต้นเดือนสิงหาคม 2026 โมเดล open-weight อย่าง Holo3-35B-A3B อยู่ที่ 82.6 โดยมีโมเดลปิดระดับแนวหน้าหลายตัวอยู่เหนือกว่า (Qwen3.8 Max ที่ 86.1, Claude Mythos 5 และ Claude Fable 5 ที่ 85.0, Claude Opus 4.8 ที่ 83.4) ดังนั้น คำว่า "state of the art" ในรายงานจึงเป็นเพียงข้อกล่าวอ้างเกี่ยวกับการตั้งค่าการประเมินของตนเอง ไม่ใช่ข้อเท็จจริงที่ยุติแล้ว — ฮาร์เนสที่ต่างกัน ตัวแยกแอ็กชัน และความคลาดเคลื่อนของการรายงานผลด้วยตนเอง ล้วนทำให้การเปรียบเทียบระหว่าง 77.0 กับ 82.6 เป็นคำถามที่มีเพียงการรันซ้ำอย่างอิสระเท่านั้นที่จะตอบได้ สำหรับบริบทว่าโมเดลเปิดขนาด 27B ที่ทำคะแนน 77.0 หมายความว่าอย่างไร: มันจะอยู่เหนือเกณฑ์พื้นฐานผู้เชี่ยวชาญมนุษย์ที่ ~72.4 และเหนือระบบแนวหน้าขนาดใหญ่หลายระบบบนกระดานเดียวกันนั้น รวมถึง Claude Opus 4.6 ที่ 72.7 และ Kimi K2.6 ที่ 73.1
Tencent ไม่ใช่หน้าใหม่ในวงการนี้ — บริษัทได้เปิดตัว POINTS-GUI-G ซึ่งเป็นโมเดล GUI-grounding ขนาด 8B ในเดือนกุมภาพันธ์ 2026 เปิดตัวผู้ช่วยระบบปฏิบัติการ Marvis OS ในเดือนพฤษภาคม และมีส่วนร่วมในโปรเจกต์ GUICrafter สำหรับการใช้งานคอมพิวเตอร์ในเดือนมิถุนายน UI-Mate เป็นสายผลิตภัณฑ์ที่แยกออกมาโดยเฉพาะสำหรับการควบคุมเดสก์ท็อปแบบเต็มรูปแบบ และเป็นเอเจนต์ GUI ตัวแรกของ Tencent ที่เปิดตัวเป็นโมเดลพื้นฐานแบบเปิด แทนที่จะเป็นส่วนประกอบสำหรับการยึดโยงหรือผลิตภัณฑ์
วิธีเรียกใช้งาน
โมเดลนี้ถูกออกแบบมาสำหรับ vLLM และการ์ดโมเดลระบุคำสั่งที่ชัดเจนไว้ — vllm serve tencent/UI-Mate-27B พร้อม tensor-parallel size 2 และเทมเพลตแชทที่เข้ากันได้กับ OpenAI รายละเอียดเชิงปฏิบัติอย่างหนึ่งที่โดดเด่นคือ: เอเจนต์จะเก็บภาพหน้าจอไว้ห้าภาพในบริบทโดยค่าเริ่มต้น ดังนั้นเซิร์ฟเวอร์ต้องรองรับอย่างน้อยหกภาพต่อพรอมพ์ เพราะภาพหน้าจอใหม่ล่าสุดจะมาถึงก่อนที่ภาพเก่าที่สุดจะถูกยุบรวม แฟล็กที่แนะนำคือ --limit-mm-per-prompt พร้อมหกภาพและวิดีโอเป็นศูนย์ เช็คพอยต์ที่ใช้การสาธิตเป็นแนวทางก็ทำงานในลักษณะเดียวกัน — การ์ดของมันระบุ vLLM และ SGLang ไว้เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI

เมื่อให้บริการแล้ว คลาสเอเจนต์ Python (UIMateAgent) จะรับภาพหน้าจอและคำสั่ง แล้วส่งคืนการตอบสนองพร้อมการดำเนินการที่มีโครงสร้าง โดยปรับขนาดพิกัด 1000×1000 กลับเป็นความละเอียดของคุณ หน้าโครงการยังมีแอป macOS Apple Silicon สำหรับโหมดแนะนำผ่านการสาธิต ซึ่งเป็นวิธีที่ง่ายที่สุดในการลองใช้ขั้นตอน "แสดงครั้งเดียว" โดยไม่ต้องสร้าง harness ขึ้นมาเอง ลิขสิทธิ์เป็น Apache-2.0 ทั้งหมด ดังนั้นจึงอนุญาตให้ใช้งานในเครื่อง ปรับแต่งละเอียด และผสานรวมเชิงพาณิชย์ได้ทั้งหมด
คำเตือนสองข้อควรอยู่เคียงข้างคำแนะนำ "วิธีเรียกใช้งาน" สำหรับเอเจนต์ใช้งานคอมพิวเตอร์ และทั้งคู่มาจากการ์ดโมเดลเอง ควรใช้สภาพแวดล้อมแบบแยกส่วนหรือแบบใช้แล้วทิ้ง กำหนดให้ต้องมีการยืนยันจากมนุษย์ก่อนดำเนินการใดๆ ที่ละเอียดอ่อน ตรวจสอบเส้นทางการทำงาน และอย่าถือว่าความสำเร็จที่โมเดลรายงานเป็นหลักฐานว่าผลลัพธ์ที่ตั้งใจไว้นั้นเกิดขึ้นจริง เอเจนต์ GUI คลิกพลาดได้ และการฉีดพรอมพ์ต์ผ่านเนื้อหาบนหน้าจอเป็นภัยคุกคามจริง ไม่ใช่เพียงสมมติฐาน
สแตกที่อยู่รอบๆ เอเจนต์ GUI ตัวใหม่
ยังไม่มี checkpoint ใดของ UI-Mate อยู่บน OrcaRouter เลย — กลุ่มโมเดลนี้เพิ่งเกิดได้ไม่กี่วันและมียอดดาวน์โหลดเป็นศูนย์ และโมเดลพื้นฐาน Qwen3.6-27B ก็ยังไม่มีเช่นกัน ไม่มี API แบบโฮสต์ ดังนั้นถ้าคุณต้องการรันโมเดลหนึ่งในสัปดาห์นี้ คุณต้องรันเซิร์ฟเวอร์ vLLM เอง นั่นใช้ได้สำหรับห้องแล็บ แต่มันไม่ใช่รูปแบบที่เหมาะสมสำหรับโปรดักชัน
ไปป์ไลน์การใช้งานคอมพิวเตอร์ในระดับโปรดักชันแทบจะไม่เคยเป็นเช็คพอยต์เดียว แต่คือโมเดลพลานเนอร์ที่ตัดสินใจอินเทนต์ถัดไป โมเดลกราวด์ดิงหรือวิชันโมเดลที่อ่านหน้าจอ ตัว GUI เอเจนต์เอง และฟอลแบ็กต้นทุนต่ำเมื่อขั้นตอนย่อยล้มเหลว — และชิ้นส่วนเหล่านี้ล้วนเป็นโมเดลที่ถูกเสิร์ฟผ่านเซิร์ฟเวอร์ แม้ว่า GUI เอเจนต์จะทำงานในเครื่องก็ตาม ส่วนผสมแบบนี้คือสิ่งที่เลเยอร์การจัดเส้นทาง (routing layer) มีไว้: API เดียวสำหรับโมเดลโฮสต์มากกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการส่งผ่านโดยไม่บวกเพิ่ม (0% markup) และฟอลแบ็กอัตโนมัติ เพื่อให้บริการขัดข้องชั่วคราวของผู้ให้บริการรายหนึ่งไม่หยุดการรันเอเจนต์ระยะยาว ดีเอสแอลการจัดเส้นทางยังช่วยให้คุณประกอบโมเดลหลายตัวในการเรียกครั้งเดียว — พลานเนอร์นำหน้า ตัวตรวจสอบราคาถูกที่ท้ายสุด — โดยไม่ต้องต่อผู้ให้บริการเข้าด้วยกันในโค้ดของคุณเอง สรุปอย่างตรงไปตรงมาก็ง่ายๆ: เอเจนต์ที่ขับเคลื่อนเดสก์ท็อปนั้นอยู่ในเครื่อง แต่โมเดลที่ตัดสินใจว่าจะทำอะไรรอบๆ ตัวนั้นสามารถจัดเส้นทางได้ และการทดลองเช็คพอยต์ใหม่ๆ ที่ยังไม่ผ่านการพิสูจน์อย่างปลอดภัยก็คือสิ่งที่ฟอลแบ็กมีไว้เพื่อการนั้นโดยเฉพาะ
สิ่งที่ควรดูต่อไป
สี่สิ่งที่จะเปลี่ยนภาพรวมของ UI-Mate-27B โดยเรียงตามลำดับความสำคัญโดยคร่าวๆ:
• การรันซ้ำอย่างอิสระของ OSWorld-Verified และ WindowsAgentArena โดยเฉพาะตัวเลข WAA นั้น ไม่ว่าจะเป็นเรื่องใหญ่หรือเป็นเพียงสิ่งประดิษฐ์จากชุดทดสอบ และมีเพียงการประเมินจากภายนอกเท่านั้นที่จะชี้ขาดได้
• รายงานทางเทคนิคอย่างเป็นทางการ การอ้างอิงปัจจุบันเป็นเพียงตัวยึดตำแหน่ง และรายงานฉบับเต็มน่าจะเปิดเผยรายละเอียดของเอนจินข้อมูลซึ่งบทคัดย่อร่างไว้เพียงคร่าวๆ
• ประกาศของ Tencent เอง การปล่อยแบบ repo-first แบบนี้มักจะนำไปสู่บางสิ่ง — การผสานรวมกับ Marvis, บริการแบบ hosted หรือการผลักดันโมเดลเปิดที่กว้างขึ้น
• API ที่โฮสต์ไว้ น้ำหนักของ checkpoints ทั้งสามเปิดเป็นสาธารณะแล้ว แต่ก็ยังไม่มีอะไรถูกให้บริการที่ใดเลย — ไม่มี Tencent endpoint ไม่มีผู้ให้บริการ inference จากบุคคลที่สาม — ดังนั้นการ self-host จึงยังเป็นหนทางเดียว และมีเพียงการประกาศจาก Tencent หรือการที่ผู้ให้บริการรายใดรับไปให้บริการเท่านั้นที่จะเปลี่ยนสิ่งนั้น
คำถามที่พบบ่อย
Tencent UI-Mate-27B คืออะไร?
UI-Mate-27B เป็นเอเจนต์ GUI พื้นฐานขนาด 27,000 ล้านพารามิเตอร์ภายใต้สัญญาอนุญาต Apache-2.0 จากทีม HY Frontier Multimodal Agent ของ Tencent ซึ่งปรับแต่งเพิ่มเติมจาก Qwen3.6-27B มันเฝ้าดูภาพหน้าจอเดสก์ท็อปแบบเรียลไทม์ ใช้เหตุผลวิเคราะห์ภาพเหล่านั้น และส่งออกการกระทำของเมาส์และคีย์บอร์ดที่เข้ากันได้กับ pyautogui มันถูกปล่อยออกมาอย่างเงียบ ๆ บน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 — พร้อมกับรุ่นพี่น้องขนาด 9B และ UI-Mate-democua-27B ที่แนะนำโดยการสาธิต — โดยไม่มีการประกาศ และเกณฑ์มาตรฐานของมันทั้งหมดรายงานโดยผู้พัฒนาจนถึงตอนนี้
การดำเนินการที่แนะนำโดยการสาธิตแตกต่างจากการเล่นซ้ำสคริปต์อย่างไร
แทนที่จะเรียกใช้แมโครที่บันทึกไว้ UI-Mate ถือว่าการสาธิตเป็นเวิร์กโฟลว์ที่มีคำบรรยายและจัดโครงสร้างเป็นงานย่อย ซึ่งถูกสอดแทรกเป็นแนวทาง ภาพหน้าจอแบบเรียลไทม์ยังคงเป็นหลักอ้างอิงที่เชื่อถือได้ ดังนั้นเมื่อเค้าโครง เนื้อหา หรือสถานะของแอปแตกต่างจากที่แสดงไว้ โมเดลจะวางแผนใหม่แทนที่จะเล่นซ้ำพิกัดเก่าที่ล้าสมัย นี่คือกลไกเบื้องหลังการอ้างว่าความสำเร็จแบบเข้มงวดเพิ่มขึ้นจาก 17.2 เป็น 35.4 ในชุดย่อยการสาธิตตนเอง — และยังคงเป็นการกล่าวอ้างของผู้จำหน่ายจนกว่าจะมีผู้ทำซ้ำผลดังกล่าวได้
{{1}}UI-Mate-27B{{/1}} เป็นโมเดลระดับแนวหน้าสำหรับเอเจนต์ GUI แบบเปิดน้ำหนักจริงหรือ?
สิ่งนี้ขึ้นอยู่กับการตั้งค่าการประเมินเป็นอย่างมาก คะแนน WindowsAgentArena 66.2 ของมันจะสูงกว่าผลลัพธ์ WAA ที่ดีที่สุดที่รายงานต่อสาธารณะในช่วงต้นปี 2026 แต่คะแนน OSWorld-Verified 77.0 ของมันอยู่ต่ำกว่า Holo3-35B-A3B แบบ open-weight ที่ได้ 82.6 บนกระดานคะแนนสาธารณะ เอกสารวิจัยเรียกมันว่าเป็น open-weight state of the art ใหม่ การรันซ้ำอย่างอิสระบนระบบทดสอบที่สอดคล้องกันเท่านั้นที่จะให้คำตอบได้
วันนี้ฉันสามารถรัน UI-Mate-27B ได้ไหม
ใช่ หากคุณให้บริการมันด้วยตัวเอง: ดาวน์โหลดน้ำหนักจาก Hugging Face — เช็คพอยต์ทั่วไป 27B, เช็คพอยต์ 9B หรือ UI-Mate-democua-27B แบบสาธิตนำทาง — รันคำสั่ง vLLM ตามการ์ดโมเดล (tensor-parallel size 2, หกภาพต่อพรอมป์) และควบคุมด้วยเอเจนต์ Python หรือแอป macOS ไม่มี API ที่โฮสต์ไว้ และเช็คพอยต์ใดๆ ก็ยังไม่อยู่บน OrcaRouter — ซึ่งสำหรับโมเดลที่ใหม่และยังไม่ได้รับการยืนยันขนาดนี้ ก็เป็นเหตุผลที่สมเหตุสมผลที่จะเก็บไว้ในสภาพแวดล้อมที่แยกออกไปในตอนนี้
การอ่านที่ถูกต้องเกี่ยวกับ UI-Mate-27B ไม่ใช่ 'ผู้ชนะ' แต่เป็น 'น่าจับตามอง' โมเดลโอเพนขนาด 27B ที่อ้างความนำด้าน WAA และมาพร้อมเวิร์กโฟลว์สาธิตแบบครั้งเดียว ถือเป็นจุดข้อมูลที่มีความหมายในปีที่เอเจนต์ใช้งานคอมพิวเตอร์แบบโอเพนเวตเปลี่ยนจากเรื่องตลกไปสู่การเอื้อมถึงระดับแนวหน้า ตอนนี้ที่เช็กพอยต์ซึ่งขับเคลื่อนด้วยการสาธิตกลายเป็นน้ำหนักสาธารณะแทนที่จะเป็นตัวยึดตำแหน่งบนหน้าโปรเจกต์ เวิร์กโฟลว์ 'โชว์ครั้งเดียว' จึงเป็นสิ่งที่คุณรันได้จริง Tencent ระมัดระวังเรื่องการปล่อยผลงานมาก่อน และตัวนี้มีลักษณะของงานที่กำลังดำเนินอยู่ซึ่งถูกเปิดสู่สาธารณะ ลองรันในแซนด์บ็อกซ์ รันเบนช์มาร์กซ้ำ แล้วเฝ้าดูประกาศต่อไปเรื่อย ๆ — ส่วนที่น่าสนใจของเรื่องนี้ยังอยู่ข้างหน้า
