การ์ดไตเติ้ลฮีโร่สำหรับ UI-Mate-27B เอเจนต์ GUI พื้นฐานแบบเปิดน้ำหนัก (open-weight) ของ Tencent ที่เปิดตัวเมื่อวันที่ 14 สิงหาคม 2026 แสดงจอภาพเดสก์ท็อปพร้อมเคอร์เซอร์เมาส์และลูกศรอัตโนมัติ คำบรรยายใต้ 'Open-Weight Foundation GUI Agent' ชิปป้ายกำกับ 'Apache-2.0', '27B params', 'vLLM ready' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Tencent UI-Mate-27B: เอเจนต์ GUI แบบ Open-Weight ผู้เงียบสงบที่คว้าอันดับต้น ๆ ใน WindowsAgentArena

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 14 สิงหาคม 2026 ทีม HY Frontier Multimodal Agent ของ Tencent ได้อัปโหลด checkpoint สามตัวไปยัง Hugging Face ภายใต้สังกัด tencent/ — ได้แก่ UI-Mate-27B, UI-Mate-9B รุ่นเล็กกว่า และ UI-Mate-democua-27B ที่ใช้การสาธิตเป็นแนวทาง สี่วันต่อมายังไม่มีการประกาศใด ๆ: ไม่มีโพสต์เปิดตัว ไม่มีข่าวประชาสัมพันธ์ ไม่มีทวีตผลิตภัณฑ์ สิ่งที่ปล่อยออกมาแทนกลับมีความสมบูรณ์ผิดปกติสำหรับการปล่อยแบบเงียบ ๆ: หน้าโปรเจกต์, พื้นที่เก็บ GitHub พร้อมฮาร์เนสที่ใช้งานได้ และบทความ arXiv ที่ส่งเมื่อสองวันก่อน ซึ่งระบุให้โมเดลขนาดใหญ่กว่าเป็น open-weight state of the art ตัวใหม่ในการควบคุม GUI บนเดสก์ท็อป

ทุกอย่างในชิ้นนี้อ้างอิงจาก model cards, พื้นที่เก็บ GitHub, หน้าโปรเจกต์ และเปเปอร์นั้น — ยังไม่มีใครทำซ้ำผลลัพธ์อย่างอิสระเลย จุดตรวจสอบ (checkpoints) มียอดดาวน์โหลดเป็นศูนย์บน Hugging Face ณ เวลาที่เขียนนี้ ซึ่งหมายความว่าเราอาจเป็นกลุ่มคนกลุ่มแรกนอก Tencent ที่ให้ความสำคัญกับพวกมันในเชิงเอกสาร นี่คือสิ่งที่ทราบได้จริงจากพื้นที่เก็บ และสิ่งที่ยังไม่ได้รับการยืนยันจนกว่าคนอื่นจะรันมัน

สารบัญ

• สิ่งที่ออกมาแล้ว และสิ่งที่ยังไม่มีการประกาศ

• UI-Mate-27B แท้จริงคืออะไร

• คุณสมบัติที่แตกต่าง: การดำเนินการที่นำทางด้วยการสาธิต

• ตัวเลขทั้งหมด — รายงานโดยผู้ขาย

• ตัวเลขเหล่านั้นจะอยู่ตรงไหน — ถ้ามันยังคงอยู่

• วิธีเรียกใช้งาน

• สแต็กที่อยู่รอบเอเจนต์ GUI ใหม่

• สิ่งที่ควรดูต่อไป

• คำถามที่พบบ่อย

สิ่งที่เปิดตัวไปแล้ว และสิ่งที่ยังไม่มีการประกาศ

เทนเซ็นต์เผยแพร่ UI-Mate-27B (พารามิเตอร์ 27 พันล้าน, Apache-2.0, safetensors ในรูปแบบ BF16) เมื่อวันที่ 14 สิงหาคม 2026 พร้อมกับรุ่นน้องขนาด 9B และ checkpoint ที่ขับเคลื่อนด้วยการสาธิต UI-Mate-democua-27B checkpoint ขนาด 27B ทั้งสองตัวสร้างบน Qwen3.6-27B — ซึ่งเป็นโมเดลมัลติโมดัลภายใต้สัญญาอนุญาต Apache-2.0 ที่เผยแพร่ในเดือนเมษายน 2026 — ซึ่งหมายความว่าทั้งสแตก ไม่ว่าจะเป็นโมเดลฐานหรือไฟน์จูน สามารถนำไปใช้เชิงพาณิชย์ได้ ที่เก็บโค้ด (repos) มีการประทับเวลาแก้ไขล่าสุดจากสัปดาห์นี้ — checkpoint ที่ขับเคลื่อนด้วยการสาธิตถูกแก้ไขล่าสุดเมื่อวันนี้ — ดังนั้นเทนเซ็นต์ยังคงพัฒนาพวกมันอย่างต่อเนื่อง

A screenshot of the official Hugging Face model card for tencent/UI-Mate-27B (captured August 18 2026), showing the Tencent organization, the model name, tags including computer-use-agent and License apache-2.0, the title 'UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations', and the opening lines of the Overview.

สิ่งที่เปิดเผยต่อสาธารณะในตอนนี้:

• น้ำหนักของ UI-Mate-27B, UI-Mate-9B และ UI-Mate-democua-27B บน Hugging Face โดยแต่ละรุ่นมีการ์ดโมเดล ตารางการประเมินผล และสูตรการให้บริการ (serving recipe)

• หน้าโปรเจกต์ที่ ui-mate.github.io พร้อมวิดีโอสาธิต คู่มือการใช้งาน และแอป macOS Apple Silicon (DMG v0.2.4)

• GitHub repository (github.com/Tencent/UI-Mate) ที่มี official prompt, response parser และ interaction harness — การ์ดระบุชัดเจนว่าสิ่งนี้คือ "agent checkpoint มากกว่าเป็น standalone visual-chat model" และแนะนำให้ใช้ harness สำหรับการใช้งานจริงใดๆ

• พรีปรินต์ arXiv (2608.15930) ส่งเมื่อวันที่ 16 สิงหาคม ภายใต้ชื่อ "UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations."

สิ่งที่ยังไม่เปิดเผยต่อสาธารณะ: Tencent เองยังไม่ได้พูดอะไรเลย — นี่คือการปล่อยผ่าน repo ก่อน ไม่ใช่การเปิดตัวอย่างเป็นทางการ ตัวแปรแบบสาธิตนำทาง (demonstration-guided) ที่หน้าโปรเจกต์เคยระบุว่ายังไม่เปิดเผยต่อสาธารณะ ตอนนี้มีน้ำหนัก (weights) ที่ใช้งานได้จริงบน Hugging Face แล้ว: repo ชื่อ tencent/UI-Mate-democua-27B ซึ่งสร้างขึ้นใน push เดียวกันกับวันที่ 14 สิงหาคม ถูกแท็กอย่างชัดเจนว่าเป็น checkpoint แบบสาธิตนำทางของตระกูลโมเดลนี้ — เป็นโมเดลที่แยกต่างหาก ไม่ใช่การรีแบรนด์ของรุ่น 27B และยังคงไม่มี hosted API ที่ใดเลย สิ่งนี้สำคัญ: วิธีเดียวที่จะรัน UI-Mate ในตอนนี้คือดาวน์โหลดน้ำหนักและนำไปให้บริการด้วยตัวเอง

UI-Mate-27B แท้จริงแล้วคืออะไร

UI-Mate-27B เป็นเอเจนต์ GUI พื้นฐานสำหรับ "การทำงานระยะยาวข้ามแอปพลิเคชันและระบบปฏิบัติการ" โดยจะสังเกตภาพหน้าจอแบบเรียลไทม์ ให้เหตุผลจากสถานะที่มองเห็นได้ และสร้างคำสั่งคีย์บอร์ดและเมาส์ที่มีโครงสร้างสำหรับการโต้ตอบกับเดสก์ท็อปโดยตรง การฝึกใช้การปรับแต่งแบบมีผู้ดูแล (supervised fine-tuning) ตามด้วยการเรียนรู้แบบเสริมกำลังแบบออนไลน์ในสภาพแวดล้อม GUI ที่ทำงานได้จริง — โมเดลเรียนรู้จากการขับเคลื่อนเดสก์ท็อปจริง ไม่ใช่จากภาพหน้าจอแบบนิ่งเพียงอย่างเดียว

พื้นที่แอคชันคือส่วนที่นักพัฒนาจะให้ความสำคัญ: เมาส์ คีย์บอร์ด การเลื่อน การรอ การโต้ตอบกับผู้ใช้ และการทำงานให้เสร็จสมบูรณ์ โดยผลลัพธ์เข้ากันได้กับ pyautogui โมเดลใช้เหตุผลในพื้นที่พิกัดปกติ 1000×1000 และเอเจนต์อ้างอิงจะปรับขนาดการคาดการณ์กลับไปเป็นความละเอียดจริงของภาพหน้าจอ ดังนั้นการกระทำจึงยังคงทำงานได้แม้มีความแตกต่างของสเกลการแสดงผลระหว่างเครื่อง README ของโมเดลแนะนำให้ให้บริการด้วย vLLM ผ่าน endpoint ที่เข้ากันได้กับ OpenAI

ฟีเจอร์ที่แตกต่าง: การทำงานที่นำทางด้วยการสาธิต

ตัวแทน GUI ส่วนใหญ่รับอินพุตหนึ่งอย่าง: คำสั่ง UI-Mate รับอินพุตที่สองซึ่งหายากมากในโอเพนเช็คพอยต์ — การสาธิต "แสดงเวิร์กโฟลว์หนึ่งครั้ง ให้ตัวแทนปรับใช้กับงานที่ทำอยู่" ตามที่หน้าของโปรเจกต์กล่าวไว้

กลไกนี้ไม่ใช่วิดีโอในบริบทหรือสคริปต์การกระทำแบบตายตัว การสาธิตจะบันทึกภาพหน้าจอทันทีก่อนและหลังการกระทำแต่ละครั้ง ไม่ว่าจะเป็นการกดแป้นพิมพ์หรือการชี้ pointer จากนั้นไปป์ไลน์จะปรับบันทึกให้เป็นมาตรฐานเป็นการแสดงผลแบบแอ็กชันและเฟรมที่สอดคล้องกัน ใส่คำอธิบายประกอบด้วยข้อสังเกต เจตนา การกระทำ และหลักฐานการยืนยัน พร้อมแบ่งเป็นงานย่อยที่ตั้งชื่อพร้อมเกณฑ์ความสำเร็จ ในเวลาอนุมาน ข้อมูลดังกล่าวจะกลายเป็นเวิร์กโฟลว์ขนาดกะทัดรัดที่ถูกใส่ไว้สำหรับงานย่อยที่กำลังทำงาน แต่ภาพหน้าจอแบบเรียลไทม์ยังคงเป็นหลักตลอดกระบวนการ ดังนั้นเมื่อสถานะของแอปพลิเคชันแตกต่างจากที่สาธิตไว้ โมเดลจะวางแผนใหม่แทนที่จะเล่นซ้ำตามเดิม

เทนเซ็นต์ได้ทำให้ checkpoint ที่อยู่เบื้องหลังเวิร์กโฟลว์นี้กลายเป็นโมเดลสาธารณะของตัวเอง: การ์ด UI-Mate-democua-27B {{1}}จับคู่ผลลัพธ์แบบ instruction-only และแบบมีตัวอย่างเดียวบนชุดการประเมินเดียวกัน และ schema เครื่องมือของมันเพิ่มแอ็กชัน subtask_complete ซึ่งเป็นกลไกเบื้องหลัง subtask ที่มีชื่อเหล่านั้น{{/1}} บนชุดย่อย self-demo ของ OSWorkerBench {{2}}ตัวอย่างเดียวช่วยเพิ่มความสำเร็จแบบเข้มงวดจาก 17.17 เป็น 35.35 และความคืบหน้าจาก 67.85 เป็น 81.14{{/2}}; บนชุดย่อย OSWorld ความคืบหน้าเพิ่มจาก 40.27 เป็น 65.75; ในชุดการประเมิน GameDev คะแนนเฉลี่ยเพิ่มจาก 76.76 เป็น 81.15 ขณะที่ความยาวเส้นทางเฉลี่ยลดลงจาก 303.6 เป็น 253.1 ขั้นตอน — ตัวอย่างช่วยทำให้งานสั้นลงและดีขึ้นพร้อมกัน การ์ดรายงานว่าตัวอย่างปรับปรุง 28 จาก 33 งาน self-demo และทำสำเร็จสี่งานที่ได้คะแนนศูนย์เมื่อไม่มีคำแนะนำ ข้อควรระวังคือสิ่งเดียวกับที่ปรากฏตลอดทั้งบทความนี้: สิ่งเหล่านี้คือการประเมินแบบจับคู่ของทีมงานเอง เฉลี่ยจากการรันสามถึงห้าครั้ง และยังไม่มีใครทำซ้ำผลลัพธ์เหล่านี้ได้

ตัวเลข — ทั้งหมดนั้นรายงานโดยผู้ขาย

ดำเนินการตามคำสั่งเท่านั้น ตรงจากบัตรโมเดล:

• คะแนนเฉลี่ย OSWorld-Verified — 77.0

• WindowsAgentArena คะแนนเฉลี่ย — 66.2

• OSWorkerBench ผ่านอย่างเคร่งครัด — 41.00

• ความคืบหน้าของ OSWorkerBench — 76.86

A scoreboard titled 'UI-Mate-27B — the scoreboard' with six rows: Params 27B, Base Qwen3.6-27B, License Apache-2.0, OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench 41.0, with a footer stating all figures are vendor-reported with no independent scores yet, and the OrcaRouter logo in the bottom-right corner.

OSWorkerBench เองก็เป็นหนึ่งในสามส่วนสนับสนุนในบทความนี้: ชุดเกณฑ์มาตรฐานใหม่ของงานสำนักงานระยะยาว 100 งานจาก 41 แอปพลิเคชัน โดยมีชุดย่อยแบบสาธิตด้วยตนเอง 33 ชุด และแบบสาธิตหลากหลาย 45 ชุด เป็นการประเมินแบบใหม่ จึงไม่มีงานวิจัยก่อนหน้าให้เทียบคะแนนทั้งสองค่านั้นได้ เมื่อเทียบกับโมเดลพื้นฐานของตัวเอง UI-Mate-27B ถูกอ้างว่าชนะ Qwen3.6-27B ด้วยคะแนนความสำเร็จแบบเข้มงวด 17.7 จุด และความคืบหน้า 24.5 จุดบน OSWorkerBench ซึ่งเป็นตัวเลขที่เทียบได้แบบตรงไปตรงมาที่สุดในการเปิดตัวทั้งหมด เนื่องจากทั้งสองโมเดลจะถูกทดสอบผ่านระบบเดียวกัน

ตัวเลขทุกตัวด้านบนเป็นการประเมินของทีมเอง ยังไม่มีคะแนนอิสระ ไม่มีการทดสอบซ้ำโดยบุคคลที่สาม และด้วยยอดดาวน์โหลดเป็นศูนย์ จึงไม่มีการทำซ้ำโดยชุมชนเช่นกัน โปรดถือว่าตัวเลขทุกตัวที่นี่เป็นการกล่าวอ้าง ไม่ใช่ข้อเท็จจริง

ว่าตัวเลขเหล่านั้นจะอยู่ตรงไหน — ถ้าพวกมันยังคงอยู่

WindowsAgentArena คือสิ่งที่จะเป็นพาดหัวข่าวจริงๆ ผลลัพธ์ WAA ที่รายงานต่อสาธารณะดีที่สุดช่วงต้นปี 2026 รวมกันอยู่ที่ประมาณ 61.0 (ระบบโมดูลาร์ที่ชื่อ VLAA-GUI, เมษายน 2026); โมเดลแบบเปิดน้ำหนัก EvoCUA-32B จาก Meituan อยู่ที่ 56.5 และ UI-TARS-2 แบบปิดของ ByteDance อยู่ในช่วง 50 ต้นๆ ถึงกลางบนกระดานเดียวกัน คะแนน 66.2 จากการประเมินของ UI-Mate-27B เองจะทำให้มันอยู่เหนือทุกอย่างที่เคยรายงานบน benchmark นี้ในปีนี้ — ทั้งแบบเปิดหรือปิด นั่นเป็นการกล่าวอ้างที่แข็งแกร่ง และจำเป็นต้องมีการทดสอบซ้ำอย่างอิสระ

OSWorld-Verified ที่ 77.0 ถือว่าแข็งแกร่ง แต่ไม่ใช่สถิติใหม่สำหรับโมเดล open-weight บนกระดานคะแนนสาธารณะ บนภาพรวมลีดเดอร์บอร์ด OSWorld-Verified จากช่วงต้นเดือนสิงหาคม 2026 โมเดล open-weight อย่าง Holo3-35B-A3B อยู่ที่ 82.6 โดยมีโมเดลปิดระดับแนวหน้าหลายตัวอยู่เหนือกว่า (Qwen3.8 Max ที่ 86.1, Claude Mythos 5 และ Claude Fable 5 ที่ 85.0, Claude Opus 4.8 ที่ 83.4) ดังนั้น คำว่า "state of the art" ในรายงานจึงเป็นเพียงข้อกล่าวอ้างเกี่ยวกับการตั้งค่าการประเมินของตนเอง ไม่ใช่ข้อเท็จจริงที่ยุติแล้ว — ฮาร์เนสที่ต่างกัน ตัวแยกแอ็กชัน และความคลาดเคลื่อนของการรายงานผลด้วยตนเอง ล้วนทำให้การเปรียบเทียบระหว่าง 77.0 กับ 82.6 เป็นคำถามที่มีเพียงการรันซ้ำอย่างอิสระเท่านั้นที่จะตอบได้ สำหรับบริบทว่าโมเดลเปิดขนาด 27B ที่ทำคะแนน 77.0 หมายความว่าอย่างไร: มันจะอยู่เหนือเกณฑ์พื้นฐานผู้เชี่ยวชาญมนุษย์ที่ ~72.4 และเหนือระบบแนวหน้าขนาดใหญ่หลายระบบบนกระดานเดียวกันนั้น รวมถึง Claude Opus 4.6 ที่ 72.7 และ Kimi K2.6 ที่ 73.1

Tencent ไม่ใช่หน้าใหม่ในวงการนี้ — บริษัทได้เปิดตัว POINTS-GUI-G ซึ่งเป็นโมเดล GUI-grounding ขนาด 8B ในเดือนกุมภาพันธ์ 2026 เปิดตัวผู้ช่วยระบบปฏิบัติการ Marvis OS ในเดือนพฤษภาคม และมีส่วนร่วมในโปรเจกต์ GUICrafter สำหรับการใช้งานคอมพิวเตอร์ในเดือนมิถุนายน UI-Mate เป็นสายผลิตภัณฑ์ที่แยกออกมาโดยเฉพาะสำหรับการควบคุมเดสก์ท็อปแบบเต็มรูปแบบ และเป็นเอเจนต์ GUI ตัวแรกของ Tencent ที่เปิดตัวเป็นโมเดลพื้นฐานแบบเปิด แทนที่จะเป็นส่วนประกอบสำหรับการยึดโยงหรือผลิตภัณฑ์

วิธีเรียกใช้งาน

โมเดลนี้ถูกออกแบบมาสำหรับ vLLM และการ์ดโมเดลระบุคำสั่งที่ชัดเจนไว้ — vllm serve tencent/UI-Mate-27B พร้อม tensor-parallel size 2 และเทมเพลตแชทที่เข้ากันได้กับ OpenAI รายละเอียดเชิงปฏิบัติอย่างหนึ่งที่โดดเด่นคือ: เอเจนต์จะเก็บภาพหน้าจอไว้ห้าภาพในบริบทโดยค่าเริ่มต้น ดังนั้นเซิร์ฟเวอร์ต้องรองรับอย่างน้อยหกภาพต่อพรอมพ์ เพราะภาพหน้าจอใหม่ล่าสุดจะมาถึงก่อนที่ภาพเก่าที่สุดจะถูกยุบรวม แฟล็กที่แนะนำคือ --limit-mm-per-prompt พร้อมหกภาพและวิดีโอเป็นศูนย์ เช็คพอยต์ที่ใช้การสาธิตเป็นแนวทางก็ทำงานในลักษณะเดียวกัน — การ์ดของมันระบุ vLLM และ SGLang ไว้เบื้องหลังเอนด์พอยต์ที่เข้ากันได้กับ OpenAI

A deployment card titled 'UI-Mate-27B — running it' with four rows: vLLM serve — 2 GPUs BF16, Python agent — pyautogui actions, macOS app — DMG v0.2.4, One-shot demos — live-screen re-plan, with a footer noting actions rescale from a 1000x1000 reasoning space, and the OrcaRouter logo in the bottom-right corner.

เมื่อให้บริการแล้ว คลาสเอเจนต์ Python (UIMateAgent) จะรับภาพหน้าจอและคำสั่ง แล้วส่งคืนการตอบสนองพร้อมการดำเนินการที่มีโครงสร้าง โดยปรับขนาดพิกัด 1000×1000 กลับเป็นความละเอียดของคุณ หน้าโครงการยังมีแอป macOS Apple Silicon สำหรับโหมดแนะนำผ่านการสาธิต ซึ่งเป็นวิธีที่ง่ายที่สุดในการลองใช้ขั้นตอน "แสดงครั้งเดียว" โดยไม่ต้องสร้าง harness ขึ้นมาเอง ลิขสิทธิ์เป็น Apache-2.0 ทั้งหมด ดังนั้นจึงอนุญาตให้ใช้งานในเครื่อง ปรับแต่งละเอียด และผสานรวมเชิงพาณิชย์ได้ทั้งหมด

คำเตือนสองข้อควรอยู่เคียงข้างคำแนะนำ "วิธีเรียกใช้งาน" สำหรับเอเจนต์ใช้งานคอมพิวเตอร์ และทั้งคู่มาจากการ์ดโมเดลเอง ควรใช้สภาพแวดล้อมแบบแยกส่วนหรือแบบใช้แล้วทิ้ง กำหนดให้ต้องมีการยืนยันจากมนุษย์ก่อนดำเนินการใดๆ ที่ละเอียดอ่อน ตรวจสอบเส้นทางการทำงาน และอย่าถือว่าความสำเร็จที่โมเดลรายงานเป็นหลักฐานว่าผลลัพธ์ที่ตั้งใจไว้นั้นเกิดขึ้นจริง เอเจนต์ GUI คลิกพลาดได้ และการฉีดพรอมพ์ต์ผ่านเนื้อหาบนหน้าจอเป็นภัยคุกคามจริง ไม่ใช่เพียงสมมติฐาน

สแตกที่อยู่รอบๆ เอเจนต์ GUI ตัวใหม่

ยังไม่มี checkpoint ใดของ UI-Mate อยู่บน OrcaRouter เลย — กลุ่มโมเดลนี้เพิ่งเกิดได้ไม่กี่วันและมียอดดาวน์โหลดเป็นศูนย์ และโมเดลพื้นฐาน Qwen3.6-27B ก็ยังไม่มีเช่นกัน ไม่มี API แบบโฮสต์ ดังนั้นถ้าคุณต้องการรันโมเดลหนึ่งในสัปดาห์นี้ คุณต้องรันเซิร์ฟเวอร์ vLLM เอง นั่นใช้ได้สำหรับห้องแล็บ แต่มันไม่ใช่รูปแบบที่เหมาะสมสำหรับโปรดักชัน

ไปป์ไลน์การใช้งานคอมพิวเตอร์ในระดับโปรดักชันแทบจะไม่เคยเป็นเช็คพอยต์เดียว แต่คือโมเดลพลานเนอร์ที่ตัดสินใจอินเทนต์ถัดไป โมเดลกราวด์ดิงหรือวิชันโมเดลที่อ่านหน้าจอ ตัว GUI เอเจนต์เอง และฟอลแบ็กต้นทุนต่ำเมื่อขั้นตอนย่อยล้มเหลว — และชิ้นส่วนเหล่านี้ล้วนเป็นโมเดลที่ถูกเสิร์ฟผ่านเซิร์ฟเวอร์ แม้ว่า GUI เอเจนต์จะทำงานในเครื่องก็ตาม ส่วนผสมแบบนี้คือสิ่งที่เลเยอร์การจัดเส้นทาง (routing layer) มีไว้: API เดียวสำหรับโมเดลโฮสต์มากกว่า 200 ตัว ราคาตามรายการของผู้ให้บริการส่งผ่านโดยไม่บวกเพิ่ม (0% markup) และฟอลแบ็กอัตโนมัติ เพื่อให้บริการขัดข้องชั่วคราวของผู้ให้บริการรายหนึ่งไม่หยุดการรันเอเจนต์ระยะยาว ดีเอสแอลการจัดเส้นทางยังช่วยให้คุณประกอบโมเดลหลายตัวในการเรียกครั้งเดียว — พลานเนอร์นำหน้า ตัวตรวจสอบราคาถูกที่ท้ายสุด — โดยไม่ต้องต่อผู้ให้บริการเข้าด้วยกันในโค้ดของคุณเอง สรุปอย่างตรงไปตรงมาก็ง่ายๆ: เอเจนต์ที่ขับเคลื่อนเดสก์ท็อปนั้นอยู่ในเครื่อง แต่โมเดลที่ตัดสินใจว่าจะทำอะไรรอบๆ ตัวนั้นสามารถจัดเส้นทางได้ และการทดลองเช็คพอยต์ใหม่ๆ ที่ยังไม่ผ่านการพิสูจน์อย่างปลอดภัยก็คือสิ่งที่ฟอลแบ็กมีไว้เพื่อการนั้นโดยเฉพาะ

สิ่งที่ควรดูต่อไป

สี่สิ่งที่จะเปลี่ยนภาพรวมของ UI-Mate-27B โดยเรียงตามลำดับความสำคัญโดยคร่าวๆ:

• การรันซ้ำอย่างอิสระของ OSWorld-Verified และ WindowsAgentArena โดยเฉพาะตัวเลข WAA นั้น ไม่ว่าจะเป็นเรื่องใหญ่หรือเป็นเพียงสิ่งประดิษฐ์จากชุดทดสอบ และมีเพียงการประเมินจากภายนอกเท่านั้นที่จะชี้ขาดได้

• รายงานทางเทคนิคอย่างเป็นทางการ การอ้างอิงปัจจุบันเป็นเพียงตัวยึดตำแหน่ง และรายงานฉบับเต็มน่าจะเปิดเผยรายละเอียดของเอนจินข้อมูลซึ่งบทคัดย่อร่างไว้เพียงคร่าวๆ

• ประกาศของ Tencent เอง การปล่อยแบบ repo-first แบบนี้มักจะนำไปสู่บางสิ่ง — การผสานรวมกับ Marvis, บริการแบบ hosted หรือการผลักดันโมเดลเปิดที่กว้างขึ้น

• API ที่โฮสต์ไว้ น้ำหนักของ checkpoints ทั้งสามเปิดเป็นสาธารณะแล้ว แต่ก็ยังไม่มีอะไรถูกให้บริการที่ใดเลย — ไม่มี Tencent endpoint ไม่มีผู้ให้บริการ inference จากบุคคลที่สาม — ดังนั้นการ self-host จึงยังเป็นหนทางเดียว และมีเพียงการประกาศจาก Tencent หรือการที่ผู้ให้บริการรายใดรับไปให้บริการเท่านั้นที่จะเปลี่ยนสิ่งนั้น

คำถามที่พบบ่อย

Tencent UI-Mate-27B คืออะไร?

UI-Mate-27B เป็นเอเจนต์ GUI พื้นฐานขนาด 27,000 ล้านพารามิเตอร์ภายใต้สัญญาอนุญาต Apache-2.0 จากทีม HY Frontier Multimodal Agent ของ Tencent ซึ่งปรับแต่งเพิ่มเติมจาก Qwen3.6-27B มันเฝ้าดูภาพหน้าจอเดสก์ท็อปแบบเรียลไทม์ ใช้เหตุผลวิเคราะห์ภาพเหล่านั้น และส่งออกการกระทำของเมาส์และคีย์บอร์ดที่เข้ากันได้กับ pyautogui มันถูกปล่อยออกมาอย่างเงียบ ๆ บน Hugging Face เมื่อวันที่ 14 สิงหาคม 2026 — พร้อมกับรุ่นพี่น้องขนาด 9B และ UI-Mate-democua-27B ที่แนะนำโดยการสาธิต — โดยไม่มีการประกาศ และเกณฑ์มาตรฐานของมันทั้งหมดรายงานโดยผู้พัฒนาจนถึงตอนนี้

การดำเนินการที่แนะนำโดยการสาธิตแตกต่างจากการเล่นซ้ำสคริปต์อย่างไร

แทนที่จะเรียกใช้แมโครที่บันทึกไว้ UI-Mate ถือว่าการสาธิตเป็นเวิร์กโฟลว์ที่มีคำบรรยายและจัดโครงสร้างเป็นงานย่อย ซึ่งถูกสอดแทรกเป็นแนวทาง ภาพหน้าจอแบบเรียลไทม์ยังคงเป็นหลักอ้างอิงที่เชื่อถือได้ ดังนั้นเมื่อเค้าโครง เนื้อหา หรือสถานะของแอปแตกต่างจากที่แสดงไว้ โมเดลจะวางแผนใหม่แทนที่จะเล่นซ้ำพิกัดเก่าที่ล้าสมัย นี่คือกลไกเบื้องหลังการอ้างว่าความสำเร็จแบบเข้มงวดเพิ่มขึ้นจาก 17.2 เป็น 35.4 ในชุดย่อยการสาธิตตนเอง — และยังคงเป็นการกล่าวอ้างของผู้จำหน่ายจนกว่าจะมีผู้ทำซ้ำผลดังกล่าวได้

{{1}}UI-Mate-27B{{/1}} เป็นโมเดลระดับแนวหน้าสำหรับเอเจนต์ GUI แบบเปิดน้ำหนักจริงหรือ?

สิ่งนี้ขึ้นอยู่กับการตั้งค่าการประเมินเป็นอย่างมาก คะแนน WindowsAgentArena 66.2 ของมันจะสูงกว่าผลลัพธ์ WAA ที่ดีที่สุดที่รายงานต่อสาธารณะในช่วงต้นปี 2026 แต่คะแนน OSWorld-Verified 77.0 ของมันอยู่ต่ำกว่า Holo3-35B-A3B แบบ open-weight ที่ได้ 82.6 บนกระดานคะแนนสาธารณะ เอกสารวิจัยเรียกมันว่าเป็น open-weight state of the art ใหม่ การรันซ้ำอย่างอิสระบนระบบทดสอบที่สอดคล้องกันเท่านั้นที่จะให้คำตอบได้

วันนี้ฉันสามารถรัน UI-Mate-27B ได้ไหม

ใช่ หากคุณให้บริการมันด้วยตัวเอง: ดาวน์โหลดน้ำหนักจาก Hugging Face — เช็คพอยต์ทั่วไป 27B, เช็คพอยต์ 9B หรือ UI-Mate-democua-27B แบบสาธิตนำทาง — รันคำสั่ง vLLM ตามการ์ดโมเดล (tensor-parallel size 2, หกภาพต่อพรอมป์) และควบคุมด้วยเอเจนต์ Python หรือแอป macOS ไม่มี API ที่โฮสต์ไว้ และเช็คพอยต์ใดๆ ก็ยังไม่อยู่บน OrcaRouter — ซึ่งสำหรับโมเดลที่ใหม่และยังไม่ได้รับการยืนยันขนาดนี้ ก็เป็นเหตุผลที่สมเหตุสมผลที่จะเก็บไว้ในสภาพแวดล้อมที่แยกออกไปในตอนนี้

การอ่านที่ถูกต้องเกี่ยวกับ UI-Mate-27B ไม่ใช่ 'ผู้ชนะ' แต่เป็น 'น่าจับตามอง' โมเดลโอเพนขนาด 27B ที่อ้างความนำด้าน WAA และมาพร้อมเวิร์กโฟลว์สาธิตแบบครั้งเดียว ถือเป็นจุดข้อมูลที่มีความหมายในปีที่เอเจนต์ใช้งานคอมพิวเตอร์แบบโอเพนเวตเปลี่ยนจากเรื่องตลกไปสู่การเอื้อมถึงระดับแนวหน้า ตอนนี้ที่เช็กพอยต์ซึ่งขับเคลื่อนด้วยการสาธิตกลายเป็นน้ำหนักสาธารณะแทนที่จะเป็นตัวยึดตำแหน่งบนหน้าโปรเจกต์ เวิร์กโฟลว์ 'โชว์ครั้งเดียว' จึงเป็นสิ่งที่คุณรันได้จริง Tencent ระมัดระวังเรื่องการปล่อยผลงานมาก่อน และตัวนี้มีลักษณะของงานที่กำลังดำเนินอยู่ซึ่งถูกเปิดสู่สาธารณะ ลองรันในแซนด์บ็อกซ์ รันเบนช์มาร์กซ้ำ แล้วเฝ้าดูประกาศต่อไปเรื่อย ๆ — ส่วนที่น่าสนใจของเรื่องนี้ยังอยู่ข้างหน้า

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube