การ์ดไตเติลหลักสำหรับ 'UI-Venus-2-9B vs Microsoft Mage-VL' พร้อมคำบรรยาย 'เอเจนต์จับภาพหน้าจอ vs ผู้เฝ้าดูสตรีมโคเดก' แสดงแบดจ์สีน้ำเงิน '9B · เอเจนต์จับภาพหน้าจอ' พร้อมพิล 'แอ็กต์' และแบดจ์สีไซอัน '4B · ผู้เฝ้าดูสตรีม' พร้อมพิล 'บรรยาย' และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

UI-Venus-2-9B เทียบกับ Microsoft Mage-VL: เอเจนต์จับภาพหน้าจอ เทียบกับ ผู้เฝ้าดูสตรีมโคเดก

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

UI-Venus-2-9B และ Microsoft Mage-VL ต่างเปิดตัวเงียบ ๆ ภายในห่างกันไม่ถึงเดือน — รีโพของ Mage-VL ปรากฏเมื่อวันที่ 26 กรกฎาคม 2026 ส่วน UI-Venus-2-9B ในวันที่ 26 สิงหาคม 2026 — ทั้งคู่เป็นโอเพนเวตภายใต้สัญญา Apache-2.0 และทั้งคู่สร้างบนแกนหลักตระกูล Qwen ความคล้ายคลึงกันจบลงประมาณนั้น และความแตกต่างไม่ใช่เรื่องระดับ แต่เป็นเรื่องที่แต่ละโมเดลอยู่คนละฝั่งของหน้าจอ Microsoft Mage-VL เป็นโมเดลการรับรู้สตรีมมิงแบบเนทีฟโคเดก: มันดูวิดีโอที่ถูกบีบอัด เงียบผ่านฟุตเทจทั่วไป และปล่อยข้อความเมื่อเหตุการณ์เสร็จสิ้น UI-Venus-2-9B เป็นเอเจนต์ GUI: มันรับภาพนิ่ง ให้เหตุผลเกี่ยวกับสถานะ และปล่อยแอ็กชันที่มีโครงสร้าง ตัวหนึ่งดูหน้าจอแล้วอธิบาย อีกตัวดูหน้าจอแล้วปฏิบัติการ การเลือกระหว่างพวกมันไม่ใช่การตัดสินใจเรื่องเบนช์มาร์ก เพราะพวกมันไม่มีเบนช์มาร์กร่วมกันแม้แต่ตัวเดียว — มันคือการตัดสินใจว่าระบบอัตโนมัติของคุณจะจบที่คำตอบหรือที่การกระทำ

แต่ละโมเดลจริงๆ แล้วคืออะไร

Microsoft Mage-VL ซึ่งเผยแพร่ภายใต้คลัง microsoft/Mage-VL โดยไม่มีการประกาศ เป็นโมเดลมัลติโมดัลขนาดประมาณ 4 พันล้านพารามิเตอร์ สร้างจากตัวถอดรหัสภาษา Qwen3-4B-Instruct-2507 ตัวเข้ารหัสภาพที่สร้างจากศูนย์ชื่อ Mage-ViT และเกตสตรีมมิ่งแยกต่างหากขนาดประมาณ 0.5 พันล้านพารามิเตอร์ การออกแบบนี้เป็นแบบเนทีฟกับโคเดกวิดีโอ: แทนที่จะสุ่มตัวอย่างเฟรมอย่างสม่ำเสมอ มันจะเก็บเฟรมหลัก (I) ไว้ทั้งหมด และเก็บเฉพาะแพตช์ที่เกี่ยวข้องกับการเคลื่อนไหวของเฟรมที่ทำนาย (P) ซึ่ง Microsoft รายงานว่าลดการใช้โทเค็นภาพลงมากกว่า 75% และให้ความเร็วในการอนุมานเร็วกว่าการสุ่มตัวอย่างแบบสม่ำเสมอถึง 3.5 เท่า การออกแบบแบบสองกระบวนการ — เกตการรู้คิดระบบที่ 1 คอยดูหน้าต่างโคเดกแบบเลื่อนแต่ละอัน ส่วน VLM ระบบที่ 2 จะทำงานเฉพาะเมื่อมีเหตุการณ์ที่ควรตอบสนอง — ทำให้เป็นตัวเฝ้าดูวิดีโอที่เปิดตลอดเวลา ซึ่งมีต้นทุนต่ำก็เพราะว่าส่วนใหญ่แล้วมันเงียบ

UI-Venus-2-9B ซึ่งเผยแพร่โดย inclusionAI (ห้องแล็บ Ant Group ของทีม Venus) เป็นเอเจนต์ GUI อเนกประสงค์ขนาด 9B ที่เริ่มต้นจาก Qwen3.5-9B โดยมันจะสังเกตอินเทอร์เฟซ ให้เหตุผลเกี่ยวกับสถานะของงาน ดำเนินการ และรับฟีดแบ็ก — เป็นวงรอบปิดของสังเกต–ให้เหตุผล–ลงมือ–รับฟีดแบ็ก — และการ์ดโมเดลระบุว่าครอบคลุมการฝึกอบรมบนแอปมือถือ แพลตฟอร์มเว็บ และระบบปฏิบัติการเดสก์ท็อปในเช็คพอยต์เดียว ในการ์ดโมเดลของตัวเอง รายงานว่าได้คะแนน AndroidWorld 80.2, OSWorld-Verified 70.8, WebVoyager 90.8 และ ScreenSpot-Pro 73.0 ซึ่งทั้งหมดเป็นตัวเลขที่ผู้พัฒนารายงานและไม่มีการตรวจสอบซ้ำโดยอิสระ

ช่องว่างอินพุต: พิกเซลที่คุณคว้า เทียบกับสตรีมที่คุณเก็บ

ความแตกต่างที่ให้บทเรียนมากที่สุดคือสิ่งที่โมเดลแต่ละตัวกินเข้าไป UI-Venus-2-9B เป็นเอเจนต์ที่ทำงานกับภาพหน้าจอ: อินพุตของมันคือหน้าจอปัจจุบัน ทีละเฟรม และหน้าต่างบริบทขนาด 256K โทเคนคือวิธีที่มันเก็บประวัติของเฟรมเหล่านั้นตลอดงานยาวๆ ส่วน Mage-VL เป็นเอเจนต์ที่ทำงานกับสตรีม: อินพุตของมันคือวิดีโอที่บีบอัด และประสิทธิภาพของมันมาจากการปฏิบัติต่อการเคลื่อนไหวระหว่างเฟรมเป็นข้อมูล — เวกเตอร์การเคลื่อนไหวและพลังงานตกค้างสำหรับโคเดกแบบดั้งเดิม แผนที่อัตราการเรียนรู้สำหรับโคเดกแบบนิวรัล นี่คือความแตกต่างระหว่างโมเดลที่มองเห็นช่วงขณะ กับโมเดลที่มองเห็นเส้นเวลาต่อเนื่อง เอเจนต์ภาพหน้าจอตาบอดต่อ 100 มิลลิวินาทีระหว่างการจับภาพโดยโครงสร้าง — สปินเนอร์ การเปลี่ยนผ่านขณะโหลด สถานะโฮเวอร์ที่ปรากฏบนหน้าจอเพียงชั่วครู่ ผู้ดูสตรีมอยู่ในช่องว่างนั้น นี่ไม่ใช่ข้อบกพร่องของการออกแบบใดๆ มันคือเหตุผลที่เอเจนต์ GUI ที่ต้องลงมือบนหน้าจอสด กับโมเดลการรับรู้ที่ต้องสรุปฟีด เป็นผลิตภัณฑ์ที่แตกต่างกันโดยมีสัญญาอินพุตต่างกัน

A generated two-column scoreboard for 'UI-Venus-2-9B vs Microsoft Mage-VL': left column UI-Venus-2-9B — Job GUI agent acts on screens, Input still screenshots, Output structured actions, Size 9B, Serving vLLM OpenAI-compatible, Context 256K; right column Microsoft Mage-VL — Job stream watcher describes screens, Input compressed video codec streams, Output event-gated text, Size ~4B + 0.5B gate, Serving trust_remote_code custom, Context rolling codec window; footer 'Both vendor-reported; no shared benchmark.'

ช่องว่างผลผลิต: การกระทำเทียบกับคำพูด

ด้านเอาต์พุตคือจุดที่ทั้งสองไม่สามารถเปรียบเทียบกันได้อีกต่อไป เอาต์พุตของ UI-Venus-2-9B คือการกระทำที่มีโครงสร้างในพื้นที่การกระทำที่กำหนดไว้ — เมาส์ คีย์บอร์ด การเลื่อน การนำทาง — ซึ่งมันปล่อยออกมาหลังจากโทเค็นการให้เหตุผลแบบ Qwen3 และการฝึกของมันสร้างขึ้นรอบงาน grounding และ CAPTCHA ที่ให้รางวัลกับการระบุตำแหน่งองค์ประกอบที่แม่นยำภายใต้ความรกทางภาพ เอาต์พุตของ Mage-VL คือข้อความ: คำบรรยายที่ควบคุมด้วยเหตุการณ์เกี่ยวกับสิ่งที่มันเห็น มันไม่มีพื้นที่การกระทำ ไม่มีการเรียกใช้ฟังก์ชัน และไม่มีลูปเอเจนต์ อ่านโมเดลการ์ดทั้งสองข้างเคียงกัน แล้วคุณจะเห็นคนละด้านของเส้นแบ่งการรับรู้–การกระทำ — Mage-VL จบด้วยคำอธิบาย ส่วน UI-Venus-2-9B จบด้วยการคลิก

งาน — UI-Venus-2-9B: ตัวแทน GUI ทำหน้าที่ควบคุมอินเทอร์เฟซ Microsoft Mage-VL: การรับรู้แบบสตรีมมิง อธิบายอินเทอร์เฟซ

อินพุต — UI-Venus-2-9B: ยังคงเป็นภาพหน้าจอนิ่ง ประวัติ 256K โทเค็น Microsoft Mage-VL: สตรีมโคเดกวิดีโอแบบบีบอัด ความเบาบางของโทเค็นที่เน้นการเคลื่อนไหว

ผลลัพธ์ — UI-Venus-2-9B: การดำเนินการเมาส์/คีย์บอร์ด/การนำทางแบบมีโครงสร้าง Microsoft Mage-VL: คำอธิบายข้อความที่ควบคุมด้วยเหตุการณ์

ขนาด — UI-Venus-2-9B: 9B. Microsoft Mage-VL: ~4B + ~0.5B สตรีมมิงเกต.

แกนหลัก — UI-Venus-2-9B: Qwen3.5-9B. Microsoft Mage-VL: Qwen3-4B-Instruct-2507 บวกกับ Mage-ViT ที่สร้างจากศูนย์

ใบอนุญาต — ทั้งคู่เป็น Apache-2.0 (การ์ดของ Mage-VL ใน repo ระบุว่าใช้สำหรับการวิจัยเท่านั้น).

ช่องว่างในการให้บริการ

ในที่นี้ โมเดลที่ใหม่กว่าและใหญ่กว่าเป็นตัวที่รันได้ง่ายกว่า UI-Venus-2-9B ระบุคำสั่ง vLLM คำสั่งเดียวพร้อมหน้าต่างบริบท 256K และ API ที่เข้ากันได้กับ OpenAI มาตรฐาน Mage-VL ต้องใช้ trust_remote_codeเพื่อเรียกใช้ Python ที่กำหนดเองของ Microsoft รวมถึง FFmpeg เส้นทาง neural-codec สำหรับวิดีโอ และ dependencies เช่น mamba-ssm และยังไม่มี serving stack ของ vLLM หรือ SGLang — ไม่มี paged attention ไม่มีเส้นทาง serving สำหรับการผลิต Microsoft รายงานพารามิเตอร์ BF16 รวมประมาณ 10.6 GB ซึ่งหมายความว่า GPU 16 GB เป็นจุดเริ่มต้นที่สมจริงสำหรับงานภาพ และ 24 GB+ สำหรับวิดีโอยาว สำหรับทีมที่ต้องการนำสิ่งหนึ่งไปใช้งานจริงในวันนี้ UI-Venus-2-9B มีทางเข้าที่ง่ายและสะอาดกว่า สำหรับทีมที่สร้างไปป์ไลน์สำหรับการเฝ้าติดตามหรือสรุปผลที่ทำงานตลอดเวลา serving stack ของ Mage-VL คือสิ่งที่คุณต้องจัดการไม่ทางใดก็ทางหนึ่ง รวมถึง Python ที่กำหนดเองด้วย

กระดานคะแนนที่ไม่มีอยู่จริง

ไม่มีเกณฑ์วัดร่วมกันระหว่างโมเดลทั้งสองนี้ และการคิดค้นเกณฑ์วัดใหม่ขึ้นมาจะไม่ซื่อสัตย์ ตัวเลขของ UI-Venus-2-9B อยู่บนกระดานวัดด้านการยึดเกาะกับ GUI, มือถือ, เว็บ และการใช้งานคอมพิวเตอร์ (ScreenSpot-Pro 73.0, AndroidWorld 80.2, WebVoyager 90.8, OSWorld-Verified 70.8 ทั้งหมดรายงานโดยผู้พัฒนา) ตัวเลขของ Mage-VL อยู่บนกระดานวัดด้านความเข้าใจวิดีโอและเชิงพื้นที่ (Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, VSI-Bench +11.0 เหนือ Qwen3-VL-4B ทั้งหมดรายงานโดยผู้พัฒนา) วิธีที่ถูกต้องในการอ่านการเปรียบเทียบนี้คือการมองเป็นทางแยก: หากงานคือ "ทำความเข้าใจว่าเกิดอะไรขึ้นบนหน้าจอนี้เมื่อเวลาผ่านไป" Mage-VL คือเครื่องมือที่เกี่ยวข้อง และ UI-Venus-2-9B ไม่ได้ถูกสร้างมาเพื่อสิ่งนี้; หากงานคือ "ทำให้หน้าจอนี้ทำอะไรสักอย่าง" สิ่งที่ตรงกันข้ามก็เป็นจริง

ที่ทั้งสองประกอบกัน

การเปรียบเทียบในแง่มุมที่น่าสนใจไม่ใช่แบบเอาอย่างใดอย่างหนึ่ง เอเจนต์ GUI ที่ควบคุมแอปพลิเคชันจริงมีจุดบอดจริง — ช่วงเวลาระหว่างการจับภาพหน้าจอ และการเปลี่ยนแปลงสถานะใด ๆ ที่ไม่เคยหยุดนิ่งเป็นเฟรมคงที่ — และตัวเฝ้าดูสตรีมแบบ codec-native ก็เป็นโมเดลประเภทที่เหมาะจะทำหน้าที่เป็นชั้นการรับรู้ในช่องว่างนั้น ตรวจจับว่าหน้าโหลดเสร็จแล้ว หรือว่า modal อนิเมชันเสร็จก่อนที่เอเจนต์จะทำ grounding รอบถัดไป Microsoft ไม่ได้สร้าง Mage-VL สำหรับงานนั้น และ Ant Group ก็ไม่ได้สร้าง UI-Venus-2-9B เพื่อให้ถูกควบคุมโดยโมเดลตัวที่สอง แต่ความเหมาะสมนั้นมีจริง สำหรับส่วนต่าง ๆ ของสแต็กดังกล่าวที่พร้อมใช้งานในระดับโปรดักชันแล้ว — planner LLM ที่แยกย่อยงาน, vision model ที่ตรวจสอบสถานะหน้าจอ, transcription model ที่บันทึกเซสชันของเอเจนต์ — API เดียวที่มีราคาแบบ pass-through และ failover อัตโนมัติ คือสิ่งที่ทำให้การทดลองมีต้นทุนต่ำ และนั่นคือหน้าที่ของเราเตอร์ ทั้ง UI-Venus-2-9B และ Microsoft Mage-VL ต่างก็ไม่ได้ให้บริการผ่าน OrcaRouter ในขณะนี้ ทั้งคู่เป็นโปรเจกต์โอเพนเวตที่โฮสต์เอง และทั้งคู่จะแสดงราคาตามรายการของผู้ให้บริการ หากทั้งคู่ไปถึงผู้ให้บริการที่เชื่อมต่อผ่านเราเตอร์

A screenshot of the Hugging Face model page for inclusionAI/UI-Venus-2-9B (captured August 27 2026) showing the model header with one like, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, multimodal, gui, and the opening of the UI-Venus-2 model card.A screenshot of the Hugging Face model page for microsoft/Mage-VL (captured August 27 2026) showing the model header, the tags image-text-to-text, Transformers, Safetensors, mage_vl, multimodal, vision-language-model, and the opening of the Mage-VL model card.

ใครควรเลือกอันไหน

เลือก Microsoft Mage-VL เมื่อปัญหาของคุณคือการรับรู้แบบต่อเนื่อง (continuous perception) — ฟีดกล้อง การบันทึกหน้าจอ หรือสตรีมที่คุณต้องการสรุปหรือเฝ้าติดตามแบบเรียลไทม์ ในต้นทุนที่ต่ำพอจะรันต่อไปได้เรื่อยๆ เลือก UI-Venus-2-9B เมื่อปัญหาของคุณคือการควบคุม (control) — งานที่จบลงด้วยการกระทำที่สำเร็จ ฟอร์มที่ถูกกรอก ฟลอว์ที่นำทางได้ หรือแอปพลิเคชันที่ถูกใช้งาน และหากระบบอัตโนมัติของคุณต้องการทั้งสองอย่างจริงๆ — รับรู้สตรีม แล้วลงมือกับภาพนิ่ง — ให้รันทั้งคู่เป็นคู่กัน และมองตัวเฝ้าสตรีมเป็นตัวตรวจจับเหตุการณ์ (event detector) ที่ส่งช่วงเวลาที่ควรลงมือให้กับเอเจนต์จับภาพหน้าจอ (screenshot agent) ทั้งสองเป็นครึ่งหนึ่งของหน้าจอเดียวกัน ไม่ใช่คู่แข่งสำหรับงานเดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube