การ์ดไตเติลแบบฮีโร่สำหรับการเปรียบเทียบ 'InternLumina-U2 vs Tencent UI-Mate-27B' โดยมีคำบรรยายใต้ไตเติลว่า 'เอเจนต์เดสก์ท็อปที่รันได้เลยตอนนี้ เทียบกับโมเดลวิทัศน์ที่อ่านได้เพียงอย่างเดียว' มีชิปสถิติสามตัว — 'UI-Mate-27B: ควบคุมเดสก์ท็อปได้แล้ววันนี้' · 'InternLumina-U2: วิทัศน์แบบรวม ไม่มีน้ำหนัก' · 'ทั้งคู่เป็น Apache-2.0 ทั้งคู่ยังไม่ผ่านการพิสูจน์' — และมีโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

InternLumina-U2 ปะทะ Tencent UI-Mate-27B: เอเจนต์เดสก์ท็อปที่รันได้เลยตอนนี้ เทียบกับโมเดลวิชันแบบรวมที่ได้แต่อ่าน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Tencent UI-Mate-27B และ InternLumina-U2 เป็นสองโมเดลจากแล็บจีนที่ปล่อยออกมาอย่างเงียบ ๆ ภายใต้สัญญาอนุญาต Apache-2.0 โดยเผยแพร่ห่างกันสองสัปดาห์ และทั้งคู่ไม่ใช่คู่แข่งกัน — ซึ่งเป็นเหตุผลที่ควรนำมาเปรียบเทียบกัน Tencent UI-Mate-27B เปิดตัวเป็น open weights เมื่อวันที่ 14 สิงหาคม 2026 เป็นเอเจนต์เดสก์ท็อป: มันเฝ้าดูหน้าจอและส่งการกระทำของเมาส์และคีย์บอร์ด InternLumina-U2 เผยแพร่เป็น inference code เมื่อวันที่ 1 กันยายน 2026 โดย Shanghai AI Laboratory เป็นโมเดลวิทัศน์แบบรวมที่ตั้งใจไว้: มันอ้างว่าสามารถอ่านภาพ วิดีโอ และ 3D และสร้างและแก้ไขภาพได้ ตัวหนึ่งลงมือกระทำกับสิ่งที่เห็น; อีกตัวหนึ่ง เมื่อน้ำหนักของมันมีอยู่จริงในที่สุด จะพูดและวาดเกี่ยวกับสิ่งที่เห็น หากงานของคุณคือการใช้งานเดสก์ท็อป มีเพียงหนึ่งในสองตัวนี้เท่านั้นที่ทำได้ในวันนี้ — และไม่ใช่ตัวที่มีสถาปัตยกรรมอลังการกว่า

เอเจนต์ที่ลงมือทำ: Tencent UI-Mate-27B

UI-Mate-27B คือเอเจนต์ GUI พื้นฐาน (foundation GUI agent) แบบ open-weight ขนาด 27 พันล้านพารามิเตอร์ จากทีม multimodal agent ของ HY Frontier ในเครือ Tencent ซึ่งถูก fine-tune มาจาก Qwen3.6-27B มันจะสังเกตสกรีนช็อตสด ให้เหตุผลกับสถานะของหน้าจอ ณ เวลาปัจจุบัน แล้วส่งออกการกระทำทางคีย์บอร์ดและเมาส์แบบมีโครงสร้างในระบบพิกัดที่ปรับมาตรฐานแล้ว (normalized coordinate space) — ซึ่งเป็นผลจากโมเดลที่ถูกฝึกให้ใช้งานเดสก์ท็อปจริง ไม่ใช่ให้สนทนาเกี่ยวกับมัน จุดเด่นที่ทำให้มันแตกต่างคือการทำงานแบบมีตัวอย่างสาธิตนำทาง (demonstration-guided execution): เมื่อโชว์เวิร์กโฟลว์ให้มันดูเพียงครั้งเดียว มันจะปรับการสาธิตที่บันทึกไว้ให้เข้ากับงานตรงหน้า โดยถือว่าสกรีนช็อตสดคือสิ่งที่ถูกต้องที่สุดเมื่ออินเทอร์เฟซที่พบไม่ตรงกับตอนที่บันทึกไว้ คะแนนหลักที่ Tencent รายงานคือ OSWorld-Verified 77.0 และ WindowsAgentArena 66.2 — ซึ่งเป็นตัวเลขที่จะครองตำแหน่งสูงสุดบนลีดเดอร์บอร์ดปี 2026 นั้นได้ หากมีการทดสอบซ้ำอย่างเป็นอิสระ — รวมถึงตัวเลขจาก OSWorkerBench อีกหลายรายการ ตัวน้ำหนักของโมเดลมีจริงและดาวน์โหลดได้: safetensors shards 12 ชิ้นบน Hugging Face โฮสต์เองได้ผ่าน vLLM หรือ SGLang บน GPU สองสามตัว และการ์ดโมเดล (model card) ก็ระบุข้อควรระวังสำคัญเอาไว้ว่ามันคือ agent checkpoint ไม่ใช่โมเดล visual-chat แบบ standalone — หากคุณสั่งให้มันทำ “describe this image” แสดงว่าคุณใช้มันผิดวิธี

ดวงตาที่ถูกสัญญาไว้: InternLumina-U2

InternLumina-U2 เป็นโมเดลคนละสายพันธุ์โดยสิ้นเชิง มันคือโมเดล diffusion แบบ sparse mixture-of-experts ขนาด 16,000 ล้านพารามิเตอร์ (ใช้งานจริง 1,000 ล้านพารามิเตอร์) ซึ่งห้องแล็บตั้งใจให้เป็นโมเดลเดียวสำหรับความเข้าใจภาพรอบด้าน การสร้างภาพ และการแก้ไขภาพ — ดีไซน์แบบ fully-discrete ที่ใช้โค้ดบุ๊กแปดชุด โดย backbone ตัวเดียวทั้งอ่านภาพ แผนภูมิ วิดีโอ หรือสินทรัพย์ 3D และเขียนพิกเซลใหม่ได้ในตัว หากคุณจินตนาการโมเดลแบบ GUI agent InternLumina-U2 คือขั้วตรงข้าม: มันไม่ต้องการคลิกอะไรเลย แต่ต้องการเข้าใจทุกอย่างและวาดให้เมื่อถูกขอ สิ่งที่เผยแพร่ในวันที่ 1 กันยายน 2026 คือโค้ดสำหรับ inference และสถาปัตยกรรม — จุดเริ่มต้นงานหกจุดในคลัง GitHub หน้าโปรเจกต์ที่มีตาราง benchmark เบื้องต้น และ stub ว่างๆ ของ Hugging Face — ส่วน weights โค้ดเทรน และรายงานเทคนิคทั้งหมดยังคงระบุว่า coming soon ยังไม่มีใครสามารถรันมันได้ ช่องว่างระหว่างสองโมเดลนี้ไม่ใช่เรื่องคุณภาพ แต่เป็นเรื่องของการมีอยู่จริง

กระดานคะแนน

{{1}}ตัวเลขของ UI-Mate-27B อ้างอิงจากรายงานของ Tencent และยังไม่มีการทำซ้ำทดสอบ ส่วนตัวเลขของ InternLumina-U2{{/1}} {{2}}เป็นผลจากห้องปฏิบัติการ ยังเป็นข้อมูลเบื้องต้นและไม่ครบถ้วน{{/2}} {{3}}ทุกแถวระบุที่มาของข้อมูลไว้อย่างชัดเจน{{/3}}

• งาน — Tencent UI-Mate-27B: ควบคุมเดสก์ท็อป — อ่านภาพหน้าจอแบบเรียลไทม์ และสร้างการทำงานของเมาส์และคีย์บอร์ด InternLumina-U2: รับรู้และสร้างสรรค์ — เข้าใจภาพ/วิดีโอ/3D และสร้าง/แก้ไขภาพ

• น้ำหนักโมเดล — Tencent UI-Mate-27B: เผยแพร่สู่สาธารณะตั้งแต่วันที่ 14 สิงหาคม 2026, safetensors สิบสองชาร์ด, ใช้ใบอนุญาต Apache-2.0. InternLumina-U2: ยังไม่เปิดเผยต่อสาธารณะ — รีโป Hugging Face ว่างเปล่า, น้ำหนัก "เร็วๆ นี้"

• สเกล — โมเดล dense ขนาด 27B ปรับแต่งจาก Qwen3.6-27B เทียบกับโมเดลดิฟฟิวชันแบบ sparse MoE ขนาดรวม 16B / ใช้งานจริง 1B

• เอาต์พุต — Tencent UI-Mate-27B: แอ็กชันแบบมีโครงสร้างที่เข้ากันได้กับ pyautogui ในพื้นที่พิกัดที่นอร์แมลไลซ์. InternLumina-U2: รองรับข้อความ, การสร้างภาพจากข้อความสูงสุด 1024×1024, และการแก้ไขภาพตามคำสั่ง

• ตัวเลขสำคัญ — Tencent UI-Mate-27B: OSWorld-Verified 77.0, WindowsAgentArena 66.2, OSWorkerBench ปรับปรุงขึ้นด้วยการสาธิต (รายงานโดย Tencent ทั้งหมด). InternLumina-U2: ChartQA 86.52, GenEval 0.81, MathVision 33.22 (รายงานโดยแล็บ ยังเป็นข้อมูลเบื้องต้น).

• ข้อควรระวังเรื่องแหล่งที่มา — Tencent UI-Mate-27B: การ์ดของโมเดลเองเตือนว่ามันเป็น checkpoint ของ agent ไม่ใช่โมเดล visual-chat แบบอิสระ InternLumina-U2: หน้าโปรเจกต์ระบุว่าผลลัพธ์ของตัวเองเป็น "preliminary, partial"

• สถานะการใช้งานจริง — Tencent UI-Mate-27B: โฮสต์เองผ่าน vLLM หรือ SGLang บน GPU ประมาณ 2 ตัว; ปัจจุบันยังไม่มีผู้ให้บริการอินเฟอเรนซ์แบบโฮสต์ใดที่ปรับใช้โมเดลนี้ InternLumina-U2: ไม่มีผู้ให้บริการใดรองรับ — ตัวขับเคลื่อนที่เผยแพร่ออกมาคาดหวัง checkpoints ที่ไม่ได้อยู่ใน repository

A comparison scoreboard for InternLumina-U2 and Tencent UI-Mate-27B: InternLumina-U2 with Job perceive & create visuals, Weights not public 'soon', Output text/images/edits, Headline ChartQA 86.5 (reported), Caveat untestable no weights, Serving no one can run it; Tencent UI-Mate-27B with Job operate a desktop, Weights public since Aug 14 2026, Output mouse & keyboard actions, Headline OSWorld 77.0 WAA 66.2, Caveat agent not visual chat, Serving self-host vLLM ~2 GPUs, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

สิ่งที่ยังไม่ได้รับการพิสูจน์สองรสชาติที่แตกต่างกัน

ทั้งสองโมเดลยังไม่ผ่านการพิสูจน์ และคำคำนี้ไม่ได้หมายความเหมือนกันในทั้งสองกรณี Tencent UI-Mate-27B ยังไม่ผ่านการพิสูจน์ในความหมายทั่วไปของโมเดลใหม่: คะแนนเด่นๆ ที่ถูกโปรยไว้เป็นพาดหัวเป็นของผู้พัฒนาขึ้นเอง ไม่มีใครนำไปทดสอบซ้ำอย่างอิสระ และยอดดาวน์โหลดก็เล็กน้อยเมื่อเทียบกับคำกล่าวอ้าง — ท่าทีปกติของ checkpoint ที่เมื่อมองผ่านๆ ดูเหมือนเพิ่งเกิดขึ้นได้สี่วัน และต่อมาได้มีชุมชนผู้ใช้เติบโตขึ้นพอสมควร แต่มันยังไม่ผ่านการพิสูจน์ในแบบที่ทดสอบได้ เพราะค่าน้ำหนักของโมเดลมีอยู่จริง ตัวเลข 66.2 และ 77.0 จึงสามารถตรวจสอบได้ในสัปดาห์นี้โดยใครก็ตามที่มี GPU สองตัวและสภาพแวดล้อมการทดสอบบน Windows และคำกล่าวอ้างที่ชี้นำโดยการสาธิตก็สามารถทำซ้ำหรือหักล้างได้บนเวิร์กโฟลว์จริง InternLumina-U2 ยังไม่ผ่านการพิสูจน์ในความหมายที่เข้มงวดกว่า: มันทดสอบไม่ได้ สถาปัตยกรรมของมันเปิดเผยและอ่านได้ แต่ตัวเลขของมันไม่เปิดเผย — ไม่มีอาร์ติแฟกต์ใดที่ยืนยันตัวเลขเหล่านั้นได้ และตารางบางส่วนของห้องแล็บเองก็แสดงให้เห็นอยู่แล้วว่ามันตามหลังคู่แข่งที่มีชื่อในเกณฑ์ชี้วัดด้านการสร้างเนื้อหาอย่างน้อยหนึ่งรายการ ตัวเลขจากผู้พัฒนาที่ผูกกับไฟล์ที่ดาวน์โหลดได้คือคำกล่าวอ้างที่รอผู้ตรวจประเมิน ตัวเลขจากผู้พัฒนาที่ผูกกับโรดแมปคือความหวัง

A screenshot of the Hugging Face model page for tencent/UI-Mate-27B (captured August 27 2026), showing the Qwen3.6-27B base model, the vendor-reported OSWorld and WindowsAgentArena benchmark tags, and the note that no inference provider currently deploys the model.

การ์ด Hugging Face ของ tencent/UI-Mate-27B ซึ่งบันทึกเมื่อวันที่ 27 สิงหาคม 2026 — ฐาน Qwen3.6-27B คะแนน OSWorld และ WindowsAgentArena ที่ผู้พัฒนารายงาน และข้อความระบุว่าปัจจุบันยังไม่มีผู้ให้บริการอินференซ์รายใดนำโมเดลนี้ไปใช้งาน

การแบ่งงานตามธรรมชาติ: นักแสดงและดวงตาของมัน

เมื่อวางเคียงข้างกัน โมเดลทั้งสองนี้แสดงให้เห็นเค้าโครงของไปป์ไลน์อัตโนมัติที่เชื่อถือได้ ปัญหาที่ยากของเอเจนต์ GUI ไม่ใช่กรณีเฉลี่ย แต่คือการที่เอเจนต์ทำผิดอย่างเงียบ ๆ บนสถานะหน้าจอที่ไม่คาดคิด โดยไม่มีใครสังเกตเห็น และนั่นคืองานที่โมเดลวิทัศน์ราคาถูกและน่าเชื่อถือมีไว้ — ตรวจสอบสถานะหน้าจอก่อนและหลังทุกการกระทำ ยืนยันว่าไดอะล็อกที่ปรากฏคือไดอะล็อกที่เอเจนต์คิดว่าปรากฏ และหยุดการวนซ้ำเมื่อความเป็นจริงกับแบบจำลองความเป็นจริงของเอเจนต์แตกต่างกัน Tencent UI-Mate-27B คือผู้ลงมือ ในขณะที่โมเดลวิทัศน์แบบรวมซึ่ง InternLumina-U2 อ้างว่าเป็น คือผู้ตรวจสอบตามธรรมชาติ ที่สามารถอ่านภาพหน้าจอเดียวกันกับที่เอเจนต์ใช้ลงมือได้ เมื่อ — และเฉพาะเมื่อ — น้ำหนักของ InternLumina-U2 เผยแพร่จริงและการกล่าวอ้างด้านความเข้าใจของมันผ่านการทดสอบอย่างอิสระ นั่นคือบทบาทที่มันจะเติมเต็มได้ควบคู่ไปกับเอเจนต์ ไม่ใช่ต่อต้านเอเจนต์ ทั้งสองไม่ใช่คู่แข่งสำหรับงานเดียวกัน แต่เป็นสองซีกของงานเดียวกัน

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page and the per-task inference scripts, including the image-understanding entry point that would underpin a screen-state verifier.

พื้นที่เก็บข้อมูล GitHub ของ InternLM/InternLumina-U2 ซึ่งบันทึกไว้เมื่อวันที่ 2 กันยายน 2026 — หน้าหลักของพื้นที่เก็บข้อมูลแสดงสคริปต์การอนุมานสำหรับแต่ละงาน รวมถึงจุดเริ่มต้นสำหรับงานทำความเข้าใจภาพ ซึ่งตัวตรวจสอบสถานะหน้าจอจะถูกสร้างขึ้นจากจุดนี้ น้ำหนักโมเดลที่จะทำให้มันทำงานได้ไม่ได้อยู่ในแผนผังไฟล์ของพื้นที่เก็บข้อมูล

ชั้นการกำหนดเส้นทางทำหน้าที่อะไรสำหรับสแตกที่ประกอบด้วยเอเจนต์และระบบการมองเห็น

ไม่มีโมเดลใดถูกโฮสต์บน OrcaRouter และเราจะไม่สื่อเป็นนัยในทางตรงกันข้าม — Tencent UI-Mate-27B ไม่มีผู้ให้บริการใดโฮสต์โมเดลนี้อยู่เลย และ InternLumina-U2 ไม่มี weights ให้ผู้ให้บริการรายใดนำไปโฮสต์ รูปแบบการจัดเส้นทางที่ใช้นั้นตรงกับสถาปัตยกรรมนี้พอดี: เอเจนต์ที่ลงมือทำกับโมเดลวิทัศน์ที่คอยตรวจสอบ ถูกประกอบให้ขั้นตอนที่แพงหรือเสี่ยงต้องผ่านด่านของขั้นตอนที่ถูกและเชื่อถือได้ก่อน DSL การจัดเส้นทางแสดงสิ่งนั้นเป็นการเรียกเชิงตรรกะเดียว — ลงมือทำ จากนั้นตรวจสอบ จากนั้นเดินหน้าหรือหยุด — แทนที่จะเป็นตัวเชื่อมเฉพาะกิจระหว่างผู้ให้บริการโมเดลสองราย และเฟลโอเวอร์อัตโนมัติรองรับโหมดความล้มเหลวที่เกิดขึ้นจริง: เอเจนต์ GUI อย่าง UI-Mate-27B คือจุดตรวจสอบที่ยังไม่ผ่านการพิสูจน์ซึ่งคุณต้องทดลองบนเส้นทางทดสอบก่อน โดยการเรียกจะตกไปยังโมเดลที่ผ่านการพิสูจน์แล้วทันทีที่โมเดลใหม่เริ่มทำงานผิดปกติ API เดียวครอบคลุมโมเดลที่โฮสต์กว่า 200 รายการ ราคารายการของผู้ให้บริการถูกส่งผ่านโดยมาร์กอัป 0% และชิ้นส่วนของสแตกที่ยังไม่ผ่านการพิสูจน์ถูกเก็บไว้หลังแนวป้องกันด้านความปลอดภัยจนกว่าจะสร้างความไว้วางใจได้

สรุป

หากคุณกำลังสร้างสิ่งที่ทำงานบนเดสก์ท็อป {{1}}Tencent UI-Mate-27B{{/1}} เป็นเพียงหนึ่งในสองตัวนี้ที่ใช้งานได้จริง — รันได้ตั้งวันนี้บน GPU ของคุณเอง พร้อมคะแนนที่น่าประทับใจแต่ยังไม่มีการยืนยันซ้ำ ซึ่งคุณสามารถไปทดสอบได้จริง หากคุณกำลังสร้างสิ่งที่ต้องการโมเดลเพื่อเข้าใจและวาดเกี่ยวกับสิ่งที่มันเห็น {{2}}InternLumina-U2{{/2}} เป็นสถาปัตยกรรมที่มีอนาคตซึ่งกำลังรอ weights ของมัน — คุ้มค่าที่จะอ่านตอนนี้ คุ้มค่าที่จะไม่พึ่งพาในฐานะ dependency จนกว่า safetensors จะออกมา จับตาดูทั้งสองตัวไว้สำหรับวันที่การแบ่งงานกันทำจะเป็นไปได้: {{3}}นักแสดง{{/3}} บน {{4}}เดสก์ท็อป{{/4}} ของคุณ, {{5}}ชุดดวงตาที่ได้รับการตรวจสอบแล้ว{{/5}} คอยเฝ้ามองมัน และ {{6}}เลเยอร์จัดเส้นทาง{{/6}} ที่คอยทำให้พวกมัน{{7}}ซื่อสัตย์{{/7}}

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube