
UI-Venus-2-9B เทียบกับ Microsoft Mage-VL: เอเจนต์จับภาพหน้าจอ เทียบกับ ผู้เฝ้าดูสตรีมโคเดก
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
UI-Venus-2-9B และ Microsoft Mage-VL ต่างเปิดตัวเงียบ ๆ ภายในห่างกันไม่ถึงเดือน — รีโพของ Mage-VL ปรากฏเมื่อวันที่ 26 กรกฎาคม 2026 ส่วน UI-Venus-2-9B ในวันที่ 26 สิงหาคม 2026 — ทั้งคู่เป็นโอเพนเวตภายใต้สัญญา Apache-2.0 และทั้งคู่สร้างบนแกนหลักตระกูล Qwen ความคล้ายคลึงกันจบลงประมาณนั้น และความแตกต่างไม่ใช่เรื่องระดับ แต่เป็นเรื่องที่แต่ละโมเดลอยู่คนละฝั่งของหน้าจอ Microsoft Mage-VL เป็นโมเดลการรับรู้สตรีมมิงแบบเนทีฟโคเดก: มันดูวิดีโอที่ถูกบีบอัด เงียบผ่านฟุตเทจทั่วไป และปล่อยข้อความเมื่อเหตุการณ์เสร็จสิ้น UI-Venus-2-9B เป็นเอเจนต์ GUI: มันรับภาพนิ่ง ให้เหตุผลเกี่ยวกับสถานะ และปล่อยแอ็กชันที่มีโครงสร้าง ตัวหนึ่งดูหน้าจอแล้วอธิบาย อีกตัวดูหน้าจอแล้วปฏิบัติการ การเลือกระหว่างพวกมันไม่ใช่การตัดสินใจเรื่องเบนช์มาร์ก เพราะพวกมันไม่มีเบนช์มาร์กร่วมกันแม้แต่ตัวเดียว — มันคือการตัดสินใจว่าระบบอัตโนมัติของคุณจะจบที่คำตอบหรือที่การกระทำ
แต่ละโมเดลจริงๆ แล้วคืออะไร
Microsoft Mage-VL ซึ่งเผยแพร่ภายใต้คลัง microsoft/Mage-VL โดยไม่มีการประกาศ เป็นโมเดลมัลติโมดัลขนาดประมาณ 4 พันล้านพารามิเตอร์ สร้างจากตัวถอดรหัสภาษา Qwen3-4B-Instruct-2507 ตัวเข้ารหัสภาพที่สร้างจากศูนย์ชื่อ Mage-ViT และเกตสตรีมมิ่งแยกต่างหากขนาดประมาณ 0.5 พันล้านพารามิเตอร์ การออกแบบนี้เป็นแบบเนทีฟกับโคเดกวิดีโอ: แทนที่จะสุ่มตัวอย่างเฟรมอย่างสม่ำเสมอ มันจะเก็บเฟรมหลัก (I) ไว้ทั้งหมด และเก็บเฉพาะแพตช์ที่เกี่ยวข้องกับการเคลื่อนไหวของเฟรมที่ทำนาย (P) ซึ่ง Microsoft รายงานว่าลดการใช้โทเค็นภาพลงมากกว่า 75% และให้ความเร็วในการอนุมานเร็วกว่าการสุ่มตัวอย่างแบบสม่ำเสมอถึง 3.5 เท่า การออกแบบแบบสองกระบวนการ — เกตการรู้คิดระบบที่ 1 คอยดูหน้าต่างโคเดกแบบเลื่อนแต่ละอัน ส่วน VLM ระบบที่ 2 จะทำงานเฉพาะเมื่อมีเหตุการณ์ที่ควรตอบสนอง — ทำให้เป็นตัวเฝ้าดูวิดีโอที่เปิดตลอดเวลา ซึ่งมีต้นทุนต่ำก็เพราะว่าส่วนใหญ่แล้วมันเงียบ
UI-Venus-2-9B ซึ่งเผยแพร่โดย inclusionAI (ห้องแล็บ Ant Group ของทีม Venus) เป็นเอเจนต์ GUI อเนกประสงค์ขนาด 9B ที่เริ่มต้นจาก Qwen3.5-9B โดยมันจะสังเกตอินเทอร์เฟซ ให้เหตุผลเกี่ยวกับสถานะของงาน ดำเนินการ และรับฟีดแบ็ก — เป็นวงรอบปิดของสังเกต–ให้เหตุผล–ลงมือ–รับฟีดแบ็ก — และการ์ดโมเดลระบุว่าครอบคลุมการฝึกอบรมบนแอปมือถือ แพลตฟอร์มเว็บ และระบบปฏิบัติการเดสก์ท็อปในเช็คพอยต์เดียว ในการ์ดโมเดลของตัวเอง รายงานว่าได้คะแนน AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 และ ScreenSpot-Pro 73.0 ซึ่งทั้งหมดเป็นตัวเลขที่ผู้พัฒนารายงานและไม่มีการตรวจสอบซ้ำโดยอิสระ
ช่องว่างอินพุต: พิกเซลที่คุณคว้า เทียบกับสตรีมที่คุณเก็บ
ความแตกต่างที่ให้บทเรียนมากที่สุดคือสิ่งที่โมเดลแต่ละตัวกินเข้าไป UI-Venus-2-9B เป็นเอเจนต์ที่ทำงานกับภาพหน้าจอ: อินพุตของมันคือหน้าจอปัจจุบัน ทีละเฟรม และหน้าต่างบริบทขนาด 256K โทเคนคือวิธีที่มันเก็บประวัติของเฟรมเหล่านั้นตลอดงานยาวๆ ส่วน Mage-VL เป็นเอเจนต์ที่ทำงานกับสตรีม: อินพุตของมันคือวิดีโอที่บีบอัด และประสิทธิภาพของมันมาจากการปฏิบัติต่อการเคลื่อนไหวระหว่างเฟรมเป็นข้อมูล — เวกเตอร์การเคลื่อนไหวและพลังงานตกค้างสำหรับโคเดกแบบดั้งเดิม แผนที่อัตราการเรียนรู้สำหรับโคเดกแบบนิวรัล นี่คือความแตกต่างระหว่างโมเดลที่มองเห็นช่วงขณะ กับโมเดลที่มองเห็นเส้นเวลาต่อเนื่อง เอเจนต์ภาพหน้าจอตาบอดต่อ 100 มิลลิวินาทีระหว่างการจับภาพโดยโครงสร้าง — สปินเนอร์ การเปลี่ยนผ่านขณะโหลด สถานะโฮเวอร์ที่ปรากฏบนหน้าจอเพียงชั่วครู่ ผู้ดูสตรีมอยู่ในช่องว่างนั้น นี่ไม่ใช่ข้อบกพร่องของการออกแบบใดๆ มันคือเหตุผลที่เอเจนต์ GUI ที่ต้องลงมือบนหน้าจอสด กับโมเดลการรับรู้ที่ต้องสรุปฟีด เป็นผลิตภัณฑ์ที่แตกต่างกันโดยมีสัญญาอินพุตต่างกัน

ช่องว่างผลผลิต: การกระทำเทียบกับคำพูด
ด้านเอาต์พุตคือจุดที่ทั้งสองไม่สามารถเปรียบเทียบกันได้อีกต่อไป เอาต์พุตของ UI-Venus-2-9B คือการกระทำที่มีโครงสร้างในพื้นที่การกระทำที่กำหนดไว้ — เมาส์ คีย์บอร์ด การเลื่อน การนำทาง — ซึ่งมันปล่อยออกมาหลังจากโทเค็นการให้เหตุผลแบบ Qwen3 และการฝึกของมันสร้างขึ้นรอบงาน grounding และ CAPTCHA ที่ให้รางวัลกับการระบุตำแหน่งองค์ประกอบที่แม่นยำภายใต้ความรกทางภาพ เอาต์พุตของ Mage-VL คือข้อความ: คำบรรยายที่ควบคุมด้วยเหตุการณ์เกี่ยวกับสิ่งที่มันเห็น มันไม่มีพื้นที่การกระทำ ไม่มีการเรียกใช้ฟังก์ชัน และไม่มีลูปเอเจนต์ อ่านโมเดลการ์ดทั้งสองข้างเคียงกัน แล้วคุณจะเห็นคนละด้านของเส้นแบ่งการรับรู้–การกระทำ — Mage-VL จบด้วยคำอธิบาย ส่วน UI-Venus-2-9B จบด้วยการคลิก
• งาน — UI-Venus-2-9B: ตัวแทน GUI ทำหน้าที่ควบคุมอินเทอร์เฟซ Microsoft Mage-VL: การรับรู้แบบสตรีมมิง อธิบายอินเทอร์เฟซ
• อินพุต — UI-Venus-2-9B: ยังคงเป็นภาพหน้าจอนิ่ง ประวัติ 256K โทเค็น Microsoft Mage-VL: สตรีมโคเดกวิดีโอแบบบีบอัด ความเบาบางของโทเค็นที่เน้นการเคลื่อนไหว
• ผลลัพธ์ — UI-Venus-2-9B: การดำเนินการเมาส์/คีย์บอร์ด/การนำทางแบบมีโครงสร้าง Microsoft Mage-VL: คำอธิบายข้อความที่ควบคุมด้วยเหตุการณ์
• ขนาด — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B สตรีมมิงเกต.
• แกนหลัก — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 บวกกับ Mage-ViT ที่สร้างจากศูนย์
• ใบอนุญาต — ทั้งคู่เป็น Apache-2.0 (การ์ดของ Mage-VL ใน repo ระบุว่าใช้สำหรับการวิจัยเท่านั้น).
ช่องว่างในการให้บริการ
ในที่นี้ โมเดลที่ใหม่กว่าและใหญ่กว่าเป็นตัวที่รันได้ง่ายกว่า UI-Venus-2-9B ระบุคำสั่ง vLLM คำสั่งเดียวพร้อมหน้าต่างบริบท 256K และ API ที่เข้ากันได้กับ OpenAI มาตรฐาน Mage-VL ต้องใช้ trust_remote_codeเพื่อเรียกใช้ Python ที่กำหนดเองของ Microsoft รวมถึง FFmpeg เส้นทาง neural-codec สำหรับวิดีโอ และ dependencies เช่น mamba-ssm และยังไม่มี serving stack ของ vLLM หรือ SGLang — ไม่มี paged attention ไม่มีเส้นทาง serving สำหรับการผลิต Microsoft รายงานพารามิเตอร์ BF16 รวมประมาณ 10.6 GB ซึ่งหมายความว่า GPU 16 GB เป็นจุดเริ่มต้นที่สมจริงสำหรับงานภาพ และ 24 GB+ สำหรับวิดีโอยาว สำหรับทีมที่ต้องการนำสิ่งหนึ่งไปใช้งานจริงในวันนี้ UI-Venus-2-9B มีทางเข้าที่ง่ายและสะอาดกว่า สำหรับทีมที่สร้างไปป์ไลน์สำหรับการเฝ้าติดตามหรือสรุปผลที่ทำงานตลอดเวลา serving stack ของ Mage-VL คือสิ่งที่คุณต้องจัดการไม่ทางใดก็ทางหนึ่ง รวมถึง Python ที่กำหนดเองด้วย
กระดานคะแนนที่ไม่มีอยู่จริง
ไม่มีเกณฑ์วัดร่วมกันระหว่างโมเดลทั้งสองนี้ และการคิดค้นเกณฑ์วัดใหม่ขึ้นมาจะไม่ซื่อสัตย์ ตัวเลขของ UI-Venus-2-9B อยู่บนกระดานวัดด้านการยึดเกาะกับ GUI, มือถือ, เว็บ และการใช้งานคอมพิวเตอร์ (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8 ทั้งหมดรายงานโดยผู้พัฒนา) ตัวเลขของ Mage-VL อยู่บนกระดานวัดด้านความเข้าใจวิดีโอและเชิงพื้นที่ (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 เหนือ Qwen3-VL-4B ทั้งหมดรายงานโดยผู้พัฒนา) วิธีที่ถูกต้องในการอ่านการเปรียบเทียบนี้คือการมองเป็นทางแยก: หากงานคือ "ทำความเข้าใจว่าเกิดอะไรขึ้นบนหน้าจอนี้เมื่อเวลาผ่านไป" Mage-VL คือเครื่องมือที่เกี่ยวข้อง และ UI-Venus-2-9B ไม่ได้ถูกสร้างมาเพื่อสิ่งนี้; หากงานคือ "ทำให้หน้าจอนี้ทำอะไรสักอย่าง" สิ่งที่ตรงกันข้ามก็เป็นจริง
ที่ทั้งสองประกอบกัน
การเปรียบเทียบในแง่มุมที่น่าสนใจไม่ใช่แบบเอาอย่างใดอย่างหนึ่ง เอเจนต์ GUI ที่ควบคุมแอปพลิเคชันจริงมีจุดบอดจริง — ช่วงเวลาระหว่างการจับภาพหน้าจอ และการเปลี่ยนแปลงสถานะใด ๆ ที่ไม่เคยหยุดนิ่งเป็นเฟรมคงที่ — และตัวเฝ้าดูสตรีมแบบ codec-native ก็เป็นโมเดลประเภทที่เหมาะจะทำหน้าที่เป็นชั้นการรับรู้ในช่องว่างนั้น ตรวจจับว่าหน้าโหลดเสร็จแล้ว หรือว่า modal อนิเมชันเสร็จก่อนที่เอเจนต์จะทำ grounding รอบถัดไป Microsoft ไม่ได้สร้าง Mage-VL สำหรับงานนั้น และ Ant Group ก็ไม่ได้สร้าง UI-Venus-2-9B เพื่อให้ถูกควบคุมโดยโมเดลตัวที่สอง แต่ความเหมาะสมนั้นมีจริง สำหรับส่วนต่าง ๆ ของสแต็กดังกล่าวที่พร้อมใช้งานในระดับโปรดักชันแล้ว — planner LLM ที่แยกย่อยงาน, vision model ที่ตรวจสอบสถานะหน้าจอ, transcription model ที่บันทึกเซสชันของเอเจนต์ — API เดียวที่มีราคาแบบ pass-through และ failover อัตโนมัติ คือสิ่งที่ทำให้การทดลองมีต้นทุนต่ำ และนั่นคือหน้าที่ของเราเตอร์ ทั้ง UI-Venus-2-9B และ Microsoft Mage-VL ต่างก็ไม่ได้ให้บริการผ่าน OrcaRouter ในขณะนี้ ทั้งคู่เป็นโปรเจกต์โอเพนเวตที่โฮสต์เอง และทั้งคู่จะแสดงราคาตามรายการของผู้ให้บริการ หากทั้งคู่ไปถึงผู้ให้บริการที่เชื่อมต่อผ่านเราเตอร์


ใครควรเลือกอันไหน
เลือก Microsoft Mage-VL เมื่อปัญหาของคุณคือการรับรู้แบบต่อเนื่อง (continuous perception) — ฟีดกล้อง การบันทึกหน้าจอ หรือสตรีมที่คุณต้องการสรุปหรือเฝ้าติดตามแบบเรียลไทม์ ในต้นทุนที่ต่ำพอจะรันต่อไปได้เรื่อยๆ เลือก UI-Venus-2-9B เมื่อปัญหาของคุณคือการควบคุม (control) — งานที่จบลงด้วยการกระทำที่สำเร็จ ฟอร์มที่ถูกกรอก ฟลอว์ที่นำทางได้ หรือแอปพลิเคชันที่ถูกใช้งาน และหากระบบอัตโนมัติของคุณต้องการทั้งสองอย่างจริงๆ — รับรู้สตรีม แล้วลงมือกับภาพนิ่ง — ให้รันทั้งคู่เป็นคู่กัน และมองตัวเฝ้าสตรีมเป็นตัวตรวจจับเหตุการณ์ (event detector) ที่ส่งช่วงเวลาที่ควรลงมือให้กับเอเจนต์จับภาพหน้าจอ (screenshot agent) ทั้งสองเป็นครึ่งหนึ่งของหน้าจอเดียวกัน ไม่ใช่คู่แข่งสำหรับงานเดียวกัน
