כרטיס Hero עם הקיקר "שתי עבודות שונות" והכותרת "DSpark מול UI-Venus 2.9B", עם כותרת משנה "מכפיל מהירות של 279.5M מול סוכן GUI של 9B - ההשוואה הופכת להגיונית רק כשמפסיקים להתייחס אליהם כתחליפים." שלושה כרטיסים מציגים "דראפטר של 279.5M - הופך את LFM2.5-VL-3B למהיר יותר; לא מייצר דבר בעצמו", "סוכן GUI של 9B - inclusionAI של Ant Group; לוחץ, מקליד, מנווט" ו"לא תחליפים - האחד הוא אופטימיזציה של זמן ריצה, והשני הוא המדיניות". כותרת תחתונה מציינת "נתוני המהירות נמדדו על ידי הספק Liquid AI; ציוני הסוכן דווחו על ידי הספק Ant Group. אף אחד מהם לא שוחזר באופן בלתי תלוי." הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Engineering & Research

LFM2.5-VL-3B-DSpark לעומת UI-Venus 2.9B: מכפיל מהירות מול סוכן GUI

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

LFM2.5-VL-3B-DSpark ו-UI-Venus 2.9B מתויקים תחת אותה כותרת מעורפלת — מודלי ראייה קטנים — ואז משווים זה לזה, וזו שגיאת קטגוריה שראוי לתקן לפני שהיא תעלה למישהו שבוע של אינטגרציה. LFM2.5-VL-3B-DSpark הוא מודל טיוטה בעל 279.5 מיליון פרמטרים שמאיץ את LFM2.5-VL-3B של Liquid AI. UI-Venus 2.9B, ממעבדת inclusionAI של Ant Group, הוא סוכן GUI של 9B שקורא צילומי מסך, מחליט על פעולה ומבצע אותה בסביבות נייד, אינטרנט ושולחן עבודה. האחד הופך מודל קיים למהיר יותר. האחר הוא הדבר שעושה את העבודה. אם מה שאתה צריך הוא סוכן GUI, מודל הטיוטה אינו אפשרות זולה יותר — הוא אינו אפשרות בכלל.

ההשוואה המועילה אינה איזו מהן טובה יותר, אלא איזו בעיה כל אחת פותרת, ומה המחיר שכל אחת גובה ממך בדרך. שתיהן גם הגיעו לאחרונה, והמערכת האקולוגית הרחבה טרם הדביקה אותן, והפער בין מה שמאגרי הקוד שלהן מצהירים לבין מה שמישהו אחר אימת גדול יותר באחת מהן מאשר באחרת.

מה בדיוק כל אחד מהם

התחל מהצורות, כי הן מסבירות את רוב השאר.

• מה זה — LFM2.5-VL-3B-DSpark הוא מנסח פענוח ספקולטיבי; UI-Venus 2.9B הוא מדיניות סוכן GUI לשימוש כללי

• פרמטרים — 279.5M BF16 עבור הדרפטר, לעומת 9B עבור UI-Venus 2.9B מאותחל מ-Qwen3.5-9B

• יכולת עצמאית — המנסח אינו מייצר דבר שמיש לבדו ואינו ניתן להערכה בבידוד; UI-Venus 2.9B פועל כסוכן שלם

• קלטים — מנסח הטיוטה לעולם אינו רואה את התמונה עצמה, אלא רק את המצבים החבויים של מודל היעד; UI-Venus 2.9B צורך צילומי מסך ישירות ונבנה כולו סביבם

• פלטים — המנסח מציע טוקנים לאימות; UI-Venus 2.9B פולט פעולות מעוגנות עם תיבות תוחמות מול ממשק חי

• בסיס — הדרפטר קשור ל-LiquidAI/LFM2.5-VL-3B במטא-דאטה שלו; UI-Venus 2.9B מבוסס על Qwen3.5-9B

• הקשר — מנסח הטיוטה יורש כל מה שמודל היעד מספק; UI-Venus 2.9B מוגש במקסימום של 262,144 אסימונים במתכון ה-vLLM של הספק עצמו

• רישיון — שניהם לא פתורים בדרכים שונות; Liquid מופץ תחת רישיון LFM1.0, והכרטיס של UI-Venus 2.9B מציין במפורש שרישיון המשקולות שלו ממתין לאישור סופי

A two-panel card titled 'Drafter vs agent - different units', subtitled 'One column measures seconds saved. The other measures tasks completed. They are not on the same axis.' The left panel 'LFM2.5-VL-3B-DSpark' has rows: What it is 'Speculative-decoding drafter', Parameters '279.5M BF16', Base 'LiquidAI/LFM2.5-VL-3B', Runs alone 'No, by construction', Its number '2.04x-3.13x decode', License 'LFM1.0, not OSI'. The right panel 'UI-Venus 2.9B' has rows: What it is 'GUI agent policy', Parameters '9B, from Qwen3.5-9B', Base 'Ant Group inclusionAI', Runs alone 'Yes - a complete agent', Its number '80.2 AndroidWorld', License 'Pending final confirmation'. A strip beneath reads 'Neither figure has been reproduced outside the lab that published it. Treat both as ceilings, not expectations.' The OrcaRouter logo is composited in the bottom-right corner.

הנקודה האחרונה היא זו שכדאי לקחת בה את הזמן. הסיקור שלנו עצמנו של UI-Venus-2-9B בסוף אוגוסט תיאר את השחרור כ-Apache-2.0, משום שזה מה שחומרי הפרויקט הציגו באותו זמן. כרטיס המודל היום אומר משהו שונה וחזק יותר: שרישיון משקולות המודל ממתין לאישור סופי ויתווסף לפני שחרור פומבי, ושהצהרת Apache-2.0 לא הועברה בכוונה מכיוון שחומרי מעלה הזרם הנוכחיים מכילים הצהרות רישיון סותרות. אם אתם מתכננים פריסה מסחרית של UI-Venus 2.9B, שאלת הרישיון פתוחה לפי הודאת הספק עצמו, וזהו סיכון מהותי ולא הערת שוליים.

המספרים שכל צד פרסם בפועל

שני המאגרים מודדים דברים שונים, וזה בדיוק העניין. Liquid מפרסמת תפוקה; Ant Group מפרסמת הצלחה במשימות.

עבור הדרפטר, לפי ההרנס של Liquid עצמה: האצת פענוח של פי 2.66 במקרה הטוב על H100 80GB בודד ב-BF16 דרך SGLang, פי 3.13 במקרה הטוב עם MLX-VLM על Apple M5 Max, ופי 2.14 במקרה הטוב עם llama.cpp על M3 Ultra. מקצה לקצה, אותן הרצות מגיעות בין פי 1.30 ל-2.62 בהתאם לסטאק ולמשימה. שיעור קבלת הטיוטות עומד על כ-3.2 עד 4.5 טוקנים לכל סבב אימות. כל אחד מאלה נמדד על ידי הספק ללא שחזור חיצוני.

עבור UI-Venus 2.9B, הטבלאות של הכרטיס עצמו מדווחות על 80.2 ב-AndroidWorld, 65.8 ב-MobileWorld בתקציב של 50 צעדים, 70.8 ב-OSWorld-Verified, 48.0 ב-DeskCraft, 90.8 ב-WebVoyager על פני הפיצול המחודש של 595 משימות, 74.0 ב-Online-Mind2Web, 73.0 ב-ScreenSpot-Pro ו-77.1 ב-VenusBench-GD. ב-CAPTCHA היא מדווחת על 78.1 ב-VenusBench-CAPTCHA ו-75.7 ב-MCA-Bench. בצד הבטיחות היא מדווחת על שיעור הצלחת תקיפה של 11.3% ב-OSHarm לעומת 25.3% עבור בסיס ה-Qwen3.5-9B שלה. כל אלה מדווחים על ידי הספק, חלק מקווי הבסיס נושאים כוכבית שמשמעותה שמחברי UI-Venus העריכו אותם לפי הפרוטוקול הנקוב, והכרטיס עצמו מזהיר שהשוואות OSWorld-Verified משתמשות במבני פעולה (action scaffolds) ייעודיים למודל, ויש לקרוא אותן כהפניות ברמת בנצ'מרק ולא כאבלציות מבוקרות.

שימו לב למה שחסר משתי הרשימות: כל דבר שנמדד על ידי צד שלישי. אצל הדרפטר זה מפני שהצ'קפוינט בן כמה ימים. אצל UI-Venus 2.9B זה מפני שבנצ'מרקים של סוכני GUI יקרים לשחזור, ותוצאות הסביבה החיה משתנות עם מצב הסביבה בתאריך ההערכה — הסתייגות שהכרטיס מציין מיוזמתו.

היכן ששני אלה למעשה נפגשים

A screenshot of the Hugging Face model card for inclusionAI/UI-Venus-2-9B showing 'Like 34' and 'Downloads last month 8,423'. The card describes UI-Venus-2 as a general-purpose foundation GUI agent covering 170+ multilingual apps and 4,000+ domains across 19 categories, evaluated on OSWorld, AndroidWorld and MobileWorld, and reports an OSHarm attack success rate of 11.3% against 25.3% for its Qwen3.5-9B base and an OSBlind figure of 48.8% against 79.4% for that base.

יש חפיפה ממשית, והיא צרה יותר ממה ששם הקטגוריה מרמז. שניהם רלוונטיים אם אתם בונים סוכן חזותי על־המכשיר או בקצה, ושניהם עוסקים בעלות של העברת פיקסלים דרך מודל. הם תוקפים אותה משני קצוות מנוגדים.

UI-Venus 2.9B תוקף זאת באמצעות אימון: צינור תלת-שלבי של אימון-ביניים מולטימודלי על סביבות מדומות של מובייל, ווב ו-OS, RL לא-מקוון לכל תחום, ואז זיקוק on-policy מרובה-מורים למדיניות אחת. היכולת שפורסמה היא התוצאה. המודל הוא 9B, קטן עבור סוכן GUI וגדול עבור התקן קצה, ותצורת ההגשה המיועדת של הכרטיס היא פריסת vLLM — אותו תיעוד מציין שתצורה זו לא אומתה בקנרית חיה כחלק מעדכון הכרטיס ומורה לך לנעול ולאמת את גרסת ה-vLLM שלך עבור Qwen3.5 לפני הפריסה.

LFM2.5-VL-3B-DSpark תוקף זאת בזמן ריצה: הוא משאיר את המשקולות של מודל היעד ללא שינוי ומשיג מהירות באמצעות הכנת טיוטות ואימות של טוקנים. במכשיר ברמת טלפון, העסקה חד-צדדית לטובת מנסח הטיוטות, מפני שהפלט הוא באופן מוכח של מודל היעד, והזיכרון הנוסף הוא פחות מעשירית ממודל.

ההשלכה למי שבוחר: לולאת סוכן מבצעת קריאות מודל רבות לכל משימה, וכל קריאה משלמת על prefill עבור צילום מסך חדש. קידוד חזותי ו-prefill הם בדיוק השלבים שפענוח ספקולטיבי אינו מאיץ — ההכרזה של Liquid עצמה מעלה טיעון זה נגד פרשנות בלתי מוגבלת של נתוני הכותרת שלה. אז היתרון של ה-drafter מצטמצם בדיוק בעומס העבודה ש-UI-Venus 2.9B פועל בו. לעומת זאת, היתרון של UI-Venus 2.9B — השלמת המשימה בפועל — אינו משהו ש-drafter מספק בכל מהירות.

הרצת השניים

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention plus a Markov head and a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'.

אף אחד מהם אינו נקודת קצה מתארחת ב-OrcaRouter. גם LFM2.5-VL-3B-DSpark וגם UI-Venus 2.9B דורשים ממך למשוך משקלות ולהגיש אותם בעצמך, וסיפורי ההגשה שלהם מעוצבים על ידי תפקידיהם השונים מאוד. הדרפטר זקוק ל-SGLang v0.5.19 או חדש יותר עם דגל אלגוריתם ספקולטיבי DSPARK וגודל בלוק של 9, או ל-MLX-VLM v0.7.2 או חדש יותר כאשר הדרפטר מועבר כמודל טיוטה והטמפרטורה נכפית לאפס, או ל-llama.cpp עם F16 GGUF בנפח 567 MB המותאם ליעד מכומת. UI-Venus 2.9B זקוק לשרת vLLM גדול מספיק עבור מודל 9B באורך מקסימלי של 262,144 טוקנים, בתוספת הפרומפטים לדוגמה ומפרסרי הפעולות ממאגר הקוד של הפרויקט — הכרטיס מציין במפורש שהפעלת השרת לבדה לא נותנת לך סוכן GUI בלולאה סגורה שעובד.

שניהם גם מותירים את אותו פער בשוליים של מה שהם מסוגלים לעשות. מודל ראייה־שפה קטן בשילוב עם דרפטר עדיין נתקל במסכים ובמשימות שאינו יכול להתמודד איתם, וסוכן GUI עדיין נכשל בסביבות שמחוץ להתפלגות האימון שלו. השאילתות שנופלות בין הכיסאות נוחתות במקום כלשהו, וברבות מתצורות הייצור זהו מודל כללי גדול יותר. ניתוב שלהן דרך נקודת קצה אחת המכסה למעלה מ-200 מודלים במחיר המחירון של כל ספק, עם מעבר אוטומטי לגיבוי כאשר ספק נחלש, משאיר את מסלול הגיבוי מחוץ לרשימת האינטגרציות הקריטיות במקום להפוך אותו לפרויקט פריסה שני עם מפתחות וחוזים משלו.

איך להחליט בתוך דקה אחת

אם אתה זקוק לתוכנה שמפעילה ממשק משתמש — לוחצת, מקלידה, מנווטת באפליקציה שמעולם לא ראתה — אתה קונה מדיניות, וזו UI-Venus 2.9B. הקצה תקציב לפריסת vLLM של 9B, קרא את שאלת הרישיון הממתינה לפני שאתה מתחייב מסחרית, והתייחס לטבלת הבנצ'מרק של הספק כאל השערת מוצא חזקה ולא כתוצאה מוחלטת, במיוחד להשוואות OSWorld-Verified שאותן הכרטיס עצמו מסמן כתלויות ב-scaffold.

אם אתם כבר מריצים את LFM2.5-VL-3B ורוצים אותו מהיר יותר על חומרה שבבעלותכם, אתם קונים אופטימיזציית ריצה, וזו LFM2.5-VL-3B-DSpark. בדקו שלושה דברים תחילה: שעומסי העבודה שלכם עתירי פענוח (decode) ולא עתירי מילוי מוקדם (prefill), שאתם מגישים ב-16-bit ולא בייצוא 4-bit, ושסביבת הריצה שלכם עומדת ברצפות הגרסה. אם כל השלושה מתקיימים, עלות הזיכרון היא 8.9% והפלט נשאר ללא שינוי מעצם הבנייה.

הדבר היחיד שלא שורד מפגש עם מי מהמאגרים הוא ההתייחסות אליהם כתחליפים. הם מכפיל מהירות וסוכן, והתרחיש היחיד שבו הם מתחרים הוא זה שבו כבר החלטת מה אתה בונה ומחפש סיבה לבנות משהו זול יותר במקום.

OrcaRouter מגיע ל-200+ מודלים דרך מפתח אחד במחיר המחירון של הספק עם 0% תוספת, עם מדיניות ניתוב ומעבר אוטומטי לגיבוי עבור שאילתות שמודל קצה או סוכן לא אמורים לטפל בהן. API אחד לנתיב הגיבויאף אחד משני המודלים בעמוד זה לא מתארח שם - שניהם מוגשים מהמשקלים שלך - אבל נתיב הגיבוי הוא החלק שאתה לא צריך לבנות.