
MiniCPM-V 4.7 vs UI-Venus 2.9B: โมเดลวิชันทั่วไปเทียบกับเอเจนต์ GUI ที่สร้างขึ้นเพื่อจุดประสงค์เฉพาะ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
MiniCPM-V 4.7 และ UI-Venus 2.9B ต่างก็เป็นโมเดลภาษาภาพที่ดูภาพหน้าจอและสร้างข้อความ และความคล้ายคลึงกันก็จบลงเพียงเท่านั้น — เพราะหนึ่งในนั้นถูกสร้างขึ้นสำหรับงานนั้นโดยเฉพาะ UI-Venus 2.9B เป็นเอเจนต์ GUI อเนกประสงค์จาก inclusionAI เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ซึ่งการออกแบบทั้งหมดเน้นไปที่การสังเกตอินเทอร์เฟซ การให้เหตุผลเกี่ยวกับสถานะของงาน การส่งการกระทำ และการนำผลตอบรับที่ได้มาใช้ โดยมาพร้อมกับรายงานทางเทคนิค ตารางเกณฑ์มาตรฐานสำหรับงาน GUI grounding, มือถือ, เว็บ, การใช้คอมพิวเตอร์ และ CAPTCHA รวมถึงการประเมินอย่างชัดเจนว่าบ่อยครั้งเพียงใดที่它可以ถูกโน้มน้าวให้ทำการกระทำที่เป็นอันตราย MiniCPM-V 4.7 เป็นเช็กพอยต์ sparse mixture-of-experts ขนาด 35.2 พันล้านพารามิเตอร์ที่อัปโหลดโดย OpenBMB เมื่อวันที่ 6 ตุลาคม 2026 โดยไม่มีบัตรกำกับ ไม่มีใบอนุญาต และไม่มีเกณฑ์มาตรฐาน การเปรียบเทียบโมเดลเฉพาะทางกับโมเดลอเนกประสงค์ที่ยังไม่ได้วัดผลถือเป็นกิจกรรมที่ค่อนข้างแปลก และหน้านี้ชัดเจนว่าการเปรียบเทียบนั้นใช้ได้ตรงไหนและไม่ใช้ตรงไหน
การเปิดตัวสองประเภทที่แตกต่างกันอย่างมาก
UI-Venus 2.9B คือinclusionAI/UI-Venus-2-9B โมเดลขนาด 9B พารามิเตอร์ที่เริ่มต้นจาก Qwen3.5-9B และผ่านการฝึกภายหลัง (post-training) โดยเฉพาะเพื่อทำหน้าที่เป็น GUI agent การ์ดของโมเดลนี้อธิบายถึงวงจรปิด — สังเกตอินเทอร์เฟซ วิเคราะห์สถานะของงาน ลงมือดำเนินการ แล้วนำผลตอบกลับมาหลอมรวมในการตัดสินใจครั้งถัดไป — ซึ่งฝึกผ่านสามขั้นตอน ได้แก่ การฝึกกลางทางแบบมัลติโมดัลบนวิถีการใช้งานจำลองขนาดใหญ่ทั้งบนมือถือ เว็บ และเดสก์ท็อป การเรียนรู้แบบเสริมกำลังแบบออฟไลน์ที่แบ่งออกเป็นห้าตระกูลงาน และการกลั่นแบบ on-policy จากครูหลายราย (multi-teacher on-policy distillation) ที่หลอมรวมครูผู้เชี่ยวชาญเฉพาะด้านให้เป็นนโยบายเดียว มีการประเมินบนเบนช์มาร์กด้าน GUI grounding มือถือ เว็บ การใช้คอมพิวเตอร์ และ CAPTCHA และแยกประเมินอีกชุดในด้านความปลอดภัยของการกระทำที่มีผลกระทบสำคัญ โดยการ์ดรายงานอัตราความสำเร็จในการโจมตีที่ 11.3% บน OSHarm และ 48.8% บน OSBlind เทียบกับ 25.3% และ 79.4% สำหรับฐาน Qwen3.5-9B ของมัน อนึ่ง โครงการในเครือของ OpenBMB เองก็ได้สำรวจพื้นที่ใกล้เคียงกันมาแล้ว องค์กร MiniCPM มีโปรเจกต์ AgentCPM-GUI ตั้งแต่เดือนมกราคม 2026 ดังนั้นนี่จึงเป็นเลนที่ทั้งสองแล็บต่างเข้ามาแล้ว
MiniCPM-V 4.7 คือ openbmb/MiniCPM-V-4.7-35B-A3B พารามิเตอร์ BF16 จำนวน 35,212,875,824 ตัว กระจายอยู่บน 70.4 GB และสิบหกชาร์ด อัปโหลดเมื่อวันที่ 6 ตุลาคม 2026

โครงข่ายหลักข้อความ Sparse MoE ที่ติดแท็ก qwen3_5_moe_text — ผู้เชี่ยวชาญ 256 ตัว, 8 ตัวต่อโทเค็น — มากกว่า 40 เลเยอร์ที่มีรูปแบบ attention แบบสามเชิงเส้นต่อหนึ่งเต็ม, วิชันทาวเวอร์ 27 เลเยอร์ที่พัฒนาเองภายในด้วยการดาวน์แซมปลิง 16 เท่าและสูงสุด 9 สไลซ์ภาพ, และหน้าต่างบริบทขนาด 256K ไม่มี README ดังนั้นจึงไม่มีสัญญาอนุญาตและไม่มีเกณฑ์มาตรฐาน ถูกใจ 3 ครั้ง, ดาวน์โหลด 0 ครั้ง, การสนทนาว่างเปล่า
การเปรียบเทียบ โดยเว้นช่องว่างไว้
• วัตถุประสงค์ — UI-Venus 2.9B: เอเจนต์ GUI ที่ฝึกแบบ end-to-end สำหรับการโต้ตอบกับอินเทอร์เฟซ MiniCPM-V 4.7: โมเดล vision-language ทั่วไป โดยไม่ได้ระบุว่าถูกปรับให้เหมาะสมกับสิ่งใด
• พารามิเตอร์ — UI-Venus 2.9B: 9.41B, แบบหนาแน่น. MiniCPM-V 4.7: 35.2B ทั้งหมด, แบบกระจาย, 8 จาก 256 ผู้เชี่ยวชาญต่อโทเค็น.
• โมเดลพื้นฐาน — UI-Venus 2.9B: เริ่มต้นจาก Qwen3.5-9B ซึ่งเป็นสแตกข้อความ Qwen แบบ dense MiniCPM-V 4.7: สแตกข้อความ MoE ที่มีที่มาจาก Qwen3.5 คลาส qwen3_5_moe_textเป็นคนละสาขาของแผนภูมิตระกูลเดียวกัน
• การยึดโยงอินเทอร์เฟซ — UI-Venus 2.9B: ความสามารถหลัก โดยมีตระกูลงานด้านการยึดโยงและ CAPTCHA โดยเฉพาะอยู่ในการฝึก และมีระบบตรวจสอบยืนยันที่อิงกับจุดสำคัญโดยใช้การโหวตจากหลายโมเดล MiniCPM-V 4.7: ไม่มีการกล่าวอ้างเฉพาะด้านการยึดโยง และไม่มีเอกสารระบุรูปแบบเอาต์พุตพิกัด
• การประเมินความปลอดภัย — UI-Venus 2.9B: รายงานค่า ASR ที่ 11.3% บน OSHarm และ 48.8% บน OSBlind MiniCPM-V 4.7: ไม่มี
• หลักฐาน — UI-Venus 2.9B: รายงานทางเทคนิคบน arXiv, หน้าโปรเจกต์, repo บน GitHub และตาราง benchmark MiniCPM-V 4.7: ไฟล์คอนฟิก
• เครื่องมือ — UI-Venus 2.9B: คู่มือเริ่มต้นอย่างรวดเร็วสำหรับ vLLM พร้อมแฟล็ก reasoning-parser และการแปลงเป็น GGUF จากชุมชน MiniCPM-V 4.7: ยังไม่มี

ทำไม GUI agent จึงไม่ใช่แค่ "VLM ที่มองหน้าจอ"
ช่องว่างระหว่างสองโมเดลนี้ไม่ได้อยู่ที่จำนวนพารามิเตอร์เป็นหลัก และมันคุ้มค่าที่จะอธิบายให้ชัดเจน เพราะนั่นคือสิ่งที่ทำให้การจับคู่นี้มีความน่าสนใจ แทนที่จะเป็นเพียงความได้เปรียบเสียเปรียบแบบเอียงข้างเดียว
งานสกรีนช็อตมีคุณสมบัติหนึ่งที่ benchmark ด้าน vision ส่วนใหญ่ไม่มี นั่นคือผลลัพธ์ต้องนำไปปฏิบัติได้จริง เมื่อ UI-Venus 2.9B ถูกสั่งให้แตะปุ่ม มันต้องปล่อยพิกัดหรือการกระทำแบบมีโครงสร้างที่สภาพแวดล้อมสามารถนำไปใช้ได้จริง และข้อผิดพลาดเล็กน้อยในการ grounding ไม่ใช่คำตอบที่ผิดบน leaderboard แต่เป็นงานที่ล้มเหลวและสถานะที่เสียหาย นี่คือเหตุผลที่การ์ด UI-Venus 2 ใช้ความยาวมากมายกับเรื่องการตรวจสอบยืนยัน: ความสำเร็จของงานถูกตัดสินจาก keypoint ด้านภาพที่เกี่ยวข้องกับงาน แทนที่จะเป็นการมองภาพรวมครั้งเดียวที่หน้าจอสุดท้าย และผู้ตัดสินที่หลากหลายจะโหวตเพื่อลดอคติจากผู้ตัดสินเพียงรายเดียว จุดประสงค์ของกลไกนั้นคือทำให้สัญญาณรางวัลจาก reinforcement learning มีความทนทานต่อ reward hacking ซึ่งก็คือโมเดลที่เรียนรู้ที่จะทำให้ผู้ตรวจสอบแบบมักง่ายพอใจ แทนที่จะทำงานให้สำเร็จ
นอกจากนี้ยังอธิบายส่วนความปลอดภัยด้วย

เอเจนต์ที่สามารถควบคุมโทรศัพท์หรือเดสก์ท็อปมีพื้นผิวการโจมตีที่โมเดลสร้างคำบรรยายภาพไม่มี และการรายงานอัตราความสำเร็จในการโจมตีเป็นสิ่งขั้นต่ำที่แล็บควรทำเมื่อปล่อยมันออกมา UI-Venus 2.9B รายงาน 11.3% บน OSHarm และ 48.8% บน OSBlind — ตัวเลขที่สองสูงในเชิงสัมบูรณ์ และการวางกรอบของการ์ดเป็นการเปรียบเทียบกับโมเดลฐานของมัน มากกว่าจะเป็นการอ้างความทนทานแบบสัมบูรณ์ ให้อ่านมันว่า “ดีขึ้นอย่างมีความหมายเมื่อเทียบกับจุดเริ่มต้น” ไม่ใช่ “ปลอดภัย”
สถาปัตยกรรมของ MiniCPM-V 4.7 ไม่ได้บอกอะไรเกี่ยวกับเรื่องนี้เลย ความสนใจเชิงเส้น (linear attention) บนบริบทที่ยาวจะช่วยเอเจนต์ที่ต้องจดจำประวัติการโต้ตอบที่ยาว และ sparse MoE จะช่วยเรื่องปริมาณงาน (throughput) หากคุณรันหลาย episode แต่สถาปัตยกรรมที่มีประโยชน์ต่อเอเจนต์ก็ไม่ใช่ตัวเอเจนต์ และไม่มีส่วนใดของชิ้นงานที่เปิดตัวออกมาเลยที่บันทึกผลลัพธ์ของการกระทำ ความแม่นยำในการยึดโยงกับข้อมูลจริง (grounding accuracy) หรือพฤติกรรมด้านความปลอดภัย
การประเมินอย่างตรงไปตรงมาของฝั่ง MiniCPM
มันน่าดึงดูดใจที่จะเติมส่วนนี้ด้วยตัวเลขของ 4.6 อย่าไปทำตาม MiniCPM-V 4.6 เป็นโมเดล dense ขนาด 1.3B บนโครงหลัก Qwen3.5-0.8B พร้อมรูปแบบการบีบอัดภาพแบบ 4x/16x ที่สลับได้ และผลลัพธ์ที่โฆษณาไว้ — คะแนน 13 บน Artificial Analysis Intelligence Index ซึ่งรายงานโดยผู้ขาย ด้วยต้นทุนโทเค็นเพียงเศษเสี้ยวของโมเดลขนาดเล็กที่เทียบเคียงได้ — อธิบายโมเดลนั้น MiniCPM-V 4.7 เปลี่ยนโครงหลัก เปลี่ยนรูปแบบ attention และเปลี่ยนการบีบอัดภาพเริ่มต้น ไม่มีการวัดใดของ 4.6 ที่ถ่ายโอนมาได้ และไม่มีสิ่งใดในนั้นที่อธิบาย GUI agent ตั้งแต่แรกอยู่แล้ว
สิ่งที่พูดได้อย่างตรงไปตรงมาเกี่ยวกับ MiniCPM-V 4.7 นั้นมีขอบเขตแคบและเป็นข้อเท็จจริง: เวตมีอยู่จริง โครงสร้างของมันแปลกไปจากตระกูลนี้ หน้าต่างบริบทยาว และการเปิดตัวยังไม่สมบูรณ์ การไม่มีสัญญาอนุญาตเป็นอุปสรรคในทางปฏิบัติ ส่วนการไม่มีเบนช์มาร์กเป็นอุปสรรคด้านการประเมิน และมีเหตุผลเล็กน้อยเพียงข้อเดียวที่ชวนให้สนใจมากกว่าเฉยเมย — OpenBMB สร้างเครื่องมือ GUI โดยมี AgentCPM-GUI รวมอยู่ด้วย ดังนั้นโมเดลวิชันแบบ sparse MoE ที่มีบริบทยาวจากแล็บนั้นจึงไม่ใช่เรื่องเหลือเชื่อหากจะเป็นแกนหลักของเอเจนต์ในอนาคต นั่นเป็นสมมติฐานเกี่ยวกับเจตนา และรีโพซิทอรีไม่ได้ยืนยันเรื่องนั้น
สิ่งที่คุณจะเลือก และเมื่อไหร่
สำหรับงานใดก็ตามที่เกี่ยวข้องกับภาพหน้าจอและการกระทำ — การแตะ การพิมพ์ การเลื่อน การนำทางในแอปหรือเว็บไซต์ การดึงข้อมูลจาก UI — UI-Venus 2.9B เป็นเพียงตัวเดียวในสองตัวนี้ที่ตอบโจทย์งานดังกล่าว มันมีทั้งการฝึก กลไกการตรวจสอบ ตัวเลขความปลอดภัยที่มีการรายงานไว้ และเครื่องมือมากพอที่จะรันมันบน vLLM ได้ตั้งแต่วันนี้ ไม่มีอะไรเกี่ยวกับ MiniCPM-V 4.7 ที่บ่งชี้ว่ามันกำลังแข่งขันในด้านนี้ และหากไม่มีการ์ด คุณก็ไม่อาจตรวจสอบได้ด้วยซ้ำว่ามันส่งพิกัดออกมาหรือไม่
สำหรับงานมัลติโมดัลทั่วไป — การอธิบายภาพ การอ่านเอกสาร การวิเคราะห์บริบทแบบยาวบนเนื้อหาที่มีภาพจำนวนมาก — การเปรียบเทียบยังไม่อาจตัดสินได้ เนื่องจากฝ่ายหนึ่งยังไม่มีหลักฐานด้านคุณภาพที่เผยแพร่ หากคุณต้องการสิ่งนั้นในตอนนี้ UI-Venus 2.9B อย่างน้อยก็วัดผลได้ แม้ว่ามันจะถูกปรับมาเพื่ออินเทอร์เฟซมากกว่าการให้เหตุผลเชิงเอกสาร และก็ไม่ใช่ตัวเลือกแรกที่ชัดเจนสำหรับงานนั้นเช่นกัน
รูปแบบในทั้งสองกรณีเหมือนกัน: โมเดลที่โฮสต์เองซึ่งรับงานทั่วไป และโมเดลฟรอนเทียร์แบบโฮสต์สำหรับเคสยากที่มันส่งต่อออกไป จุดที่เราเตอร์พิสูจน์คุณค่าของตัวเองก็คือการส่งต่อนั้น — คีย์เดียวใช้กับโมเดลแบบโฮสต์กว่า 200 ตัว โดยแต่ละตัวส่งผ่านในราคาตามที่ผู้ให้บริการกำหนด เราไม่บวกเพิ่ม และสลับให้อัตโนมัติเมื่อผู้ให้บริการมีปัญหา. ทั้ง UI-Venus 2.9B และ MiniCPM-V 4.7 ต่างไม่ได้โฮสต์บน OrcaRouter ทั้งคู่เป็นเวตที่คุณรันเอง เราเตอร์คือสิ่งที่เอเจนต์ของคุณคุยด้วยเมื่อมันตัดสินว่าโมเดลโลคัลยังไม่พอ
สิ่งนี้ทำให้คุณอยู่ตรงไหน
นี่ไม่ใช่กรณีที่สูสี และเหตุผลเป็นเชิงโครงสร้างมากกว่าจะเป็นการตัดสินเกี่ยวกับคุณภาพ UI-Venus 2.9B เป็นผู้เชี่ยวชาญที่มีรายงาน ใบอนุญาต ตาราง benchmark การประเมินความปลอดภัย และสูตรการให้บริการ MiniCPM-V 4.7 เป็นโมเดลอเนกประสงค์ที่มีไฟล์การกำหนดค่า หนึ่งในนั้นเป็นผลิตภัณฑ์ ส่วนอีกอันเป็นเพียงคำสัญญา และวิธีเดียวที่รับผิดชอบในการเปรียบเทียบทั้งสองคือการพูดเช่นนั้น จับตาดูรีโพซิทอรี: หาก OpenBMB เผยแพร่การ์ดที่แสดงการยึดโยงอินเทอร์เฟซและเอาต์พุตการกระทำ เมื่อนั้น sparse MoE แบบบริบท 256K เมื่อเทียบกับเอเจนต์ 9B ที่ผ่านการกลั่นจะกลายเป็นคำถามที่น่าสนใจอย่างแท้จริง จนกว่าจะถึงตอนนั้น คำตอบสำหรับ "ฉันควรใช้อันไหน" คืออันที่มีอยู่จริง
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
