כרטיס כותרת שנוצר עבור 'ARTEMIS vs LFM2.5-2.6B-Base', עם כותרת משנה 'רתמה מוגמרת, נקודת ביקורת לא מוגמרת', תוך השוואה בין ARTEMIS כרתמת אוטומציה ל-Android תחת Apache 2.0, לבין LFM2.5-2.6B-Base כמשקלים מאומנים מראש של 2.69B, ללא כיוונון הוראות וללא בנצ'מרקים, עם הערת שוליים שהמודל הבסיסי משוחרר תחת רישיון LFM Open ולא תחת Apache 2.0.
Guides & Insights

ARTEMIS מול LFM2.5-2.6B-Base: הצ'קפוינט שלא יכול לבצע את העבודה, וההרנס שזקוק לו כדי לעשות זאת

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ארבעה פריטים נמצאים במפת הדרכים של ARTEMIS של גוגל, ואחד מהם בדיוק דורש מודל שככל הנראה עדיין אינו קיים: מודלים חזותיים-לשוניים קלים במכשיר, עבור אוטומציה בעלת השהיה נמוכה ודגש על פרטיות. המועמד המובן מאליו למשימה כזו הוא משהו בסדר הגודל של LFM2.5-2.6B-Base — צ'ק-פוינט מאומן-מראש בן 2.69 מיליארד פרמטרים של Liquid AI, שפורסם כמשקולות פתוחות עם חלון הקשר של 131,072 טוקנים וטביעת רגל קטנה מספיק לטלפון. היא גם, כפי שהיא מסופקת, אינה מסוגלת למלא את המשבצת הזו, והסיבות לכך שוות הבנה לפני שמישהו שם את השניים בטבלת השוואה. ARTEMIS של גוגל היא רתמת אוטומציה לאנדרואיד בשפה טבעית, שנפתחה בקוד פתוח תחת Apache 2.0 באוגוסט 2026, שמפעילה מכשיר אמיתי דרך ADB וטוענת לשיעור השלמה של 99%+ במדד AndroidWorld של Google Research. LFM2.5-2.6B-Base היא חומר גלם מאומן-מראש ללא כיוונון הוראות, ללא תבנית צ'אט, וללא — במכוון — מדדים מפורסמים, ומיועדת לצוותים שיבצעו בה אימון-המשך בעצמם. האחד הוא תוכנה גמורה עם בעיית מודל לא גמורה. האחר הוא משקולות לא גמורות עם בעיית רישיון גמורה. אף אחד מהם אינו תחליף לאחר, והמקום שבו הם באמת נפגשים אינו המקום שהייתם מנחשים.

מה בעצם LFM2.5-2.6B-Base

אם מסירים את המיתוג, זהו בסיס שנבנה בקפידה לעבודה על המכשיר, עם מפרטים שנשמעים כאילו מישהו עשה אופטימיזציה לרוחב הפס של הזיכרון ולא למיקום בטבלת המובילים.

גודל — 2.69B פרמטרים ב-bfloat16 בשרד בודד בגודל ~5.39 GB, משווק כ-"2.6B".

ארכיטקטורה — 30 שכבות בפיצול היברידי: 22 בלוקים של קונבולוציה קצרה עם שער כפול מעל 8 שכבות קשב של שאילתות מקובצות, רוחב חבוי 2048, 32 ראשי קשב מול 8 ראשי KV, הטמעות קשורות. אותה code>Lfm2ForCausalLM/code> מחלקה כמו בדור הקודם, כך שאין צורך בקוד מידול מותאם אישית.

אימון — כ-34 טריליון טוקנים, עם שלב אימון ביניים ייעודי להרחבת ההקשר.

אוצר מילים — 128,000 טוקנים, הוכפל בדור הזה כדי לטפל טוב יותר בכתבים שאינם לטיניים. כ-262 מיליון פרמטרים, בערך עשירית מהמודל, נמצאים בהטמעה הקשורה.

הקשר — כרטיס המודל והקונפיגורציה אינם מתיישבים כאן, וכדאי לדעת: התיעוד מפרסם 131,072 אסימונים בעוד code>config.json/code> מגדיר code>max_position_embeddings/code> ל-128,000. תקצב 128K והתייחס לכל דבר מעל זה כלא מאומת.

שפות — שש עשרה: אנגלית, ערבית, סינית, צרפתית, גרמנית, הינדי, אינדונזית, איטלקית, יפנית, קוריאנית, פולנית, פורטוגזית, רוסית, ספרדית, תאית, וייטנאמית.

בנצ'מרקים — אין. Liquid אינה מפרסמת כל הערכה עבור ה-checkpoint הבסיסי, וכרטיס המודל מציג את ההשמטה כמכוונת: ארטיפקט זה קיים כדי לעבור אימון-המשך, ולא כדי להימדד במצבו הגולמי.

השורה האחרונה היא כל מטרת השחרור, והיא גם הסיבה לכך שהשוואה של "X מול LFM2.5-2.6B-Base" צריכה להיות מטופלת בזהירות. לצ'קפוינט בסיס אין דעה על שום דבר. בקשו ממנו לתכנן זרימת עבודה לאנדרואיד והוא ימשיך את הטקסט שלכם באופן הסתברותי, כי מעולם לא לימדו אותו לענות. הכרטיס ממליץ עליו רק למקרים שדורשים כוונון עדין כבד: עוזר ספציפי לשפה, עוזר ספציפי לתחום אנכי מוסדר, אימון על נתונים קנייניים, או כתלמיד זיקוק. לכל דבר מחוץ לקופסה, כולל קריאה לכלים, Liquid מפנה אתכם ל-LFM2.5-2.6B שעבר אימון לאחר.

A screenshot of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the lfm1.0 licence, 16 languages, the lfm2.5, liquid and edge tags, BF16 tensor type, 27,908 downloads in the last month, 13 finetunes and 10 quantizations, and a model table listing the base as a pre-trained base model for fine-tuning alongside its post-trained sibling for agentic workloads.

מה ARTEMIS צריך ממודל, וזה לא מה שצ׳קפוינט בסיסי מציע

ARTEMIS היא לולאת בקרה עם שני מצבים. Flash הוא מחזור תגובתי של צפייה-ופעולה בקצב של בערך 3–5 שניות לכל צעד. Pro הוא גרף רב-סוכני בקצב של בערך 15–40 שניות לכל צעד, עם Planner שמחזיק תוכנית Markdown חיה, Operator עם מערכת הכלים המלאה, ו-Checker לקריאה בלבד שמאמת נקודות ביקורת בארבעה רמות מ-code>off/code> עד code>strict/code>. שני המצבים דורשים את אותו הדבר מהמודל שמתחת: להסתכל על צילום מסך, לבחור פעולה אחת מתוך מערכת כלים קבועה, ולעשות זאת שוב בעוד שנייה או שתיים, מאה פעמים, בלי לאבד את החוט.

זו בקשה תובענית — ציות להוראות תחת סכימה נוקשה, הבנה חזותית מעוגנת, וקוהרנטיות לטווח ארוך — וזה בדיוק מכלול הכישורים שצ'קפוינט בסיסי לא קיבל. הבקאנדים שנבדקו של ARTEMIS עצמה הם מודלים מתארחים: Gemini, Claude, GPT-4o, Qwen-VL. כל אחד מהם מכוונן להוראות לשימוש בכלים, וכל אחד מהם גדול.

אז הפער אינו בגודל. מודל מאומן-לאחר-אימון של 2.6B יכול להחזיק לולאת קריאה לכלים — האח המאומן-לאחר-אימון של Liquid עצמה טוען שהוא עולה בביצועיו על Gemma 4 E2B-it ו-E4B-it בכל הערכות ביצוע ההוראות שלו וכמעט בכל אלה של השימוש בכלים שלו, אם כי אלה מספרים מטעם הספק ללא אימות בלתי תלוי. הפער הוא שבסיס צ'קפוינט לא עבר כלל את האימון הזה, כך שלא ניתן להכניסו להרנס כלל.

הרישיון הוא ההבדל החד יותר

כאן ההתמודדות למעשה מוכרעת, וזה החלק שרוב ההשוואות מדלגות עליו.

ARTEMIS — Apache 2.0. השתמשו בו מסחרית, עשו לו פורק, שלבו אותו בתוך מוצר, בלי תנאי הכנסה. החובה היחידה היא לשמר הודעות ולציין את השינויים שלכם, חובה שהפרויקט עצמו נאלץ לתקן בפומבי בספטמבר 2026 לאחר ש-Minitap טענה ש-228 מתוך 229 הקבצים של ARTEMIS תאמו את פרויקט ה-Apache-2.0 code>mobile-use/code> שלה, וששמות המחברים הוסרו בדחיפת כפייה. המאגר נושא כעת שורת קרדיט ל-Minitap.

LFM2.5-2.6B-Base — ה-LFM Open License, רישיון מותאם אישית ולא Apache או MIT. מתחת ל-10 מיליון דולר בהכנסות שנתיות, ההענקה רחבה, נצחית וללא תמלוגים. בסף זה ומעלה, הרישיון אינו חל על שימוש מסחרי כלל, ועליך ליצור קשר עם Liquid. הפרט החשוב למי שבונה עליו: יצירות נגזרות יורשות את אותם תנאים. הצ'קפוינט שאתה מאמן בהמשך אינו דבר חדש שבבעלותך הבלעדית — הוא נושא עמו את הרישיון המותנה בהכנסות, עם החרגה עבור מוסדות ללא כוונת רווח זכאים.

הצב את שתי העובדות הללו זו לצד זו, וההחלטה מתהפכת בהתאם למי שאתה. לחברה ממומנת שרוצה לשלוח סוכן בצד הטלפון יש רתמת Apache-2.0 שהיא יכולה להשתמש בה בחופשיות, וצ'קפוינט שאולי לא תוכל להשתמש בו מסחרית כלל. למפתח יחיד או לסטארטאפ שמתחת לסף יש את שניהם, והרישיון הוא הערת שוליים. אף אחד מהספקים אינו נוהג בחוסר הגיון — Liquid היא חברה שמגנה על השכבה המסחרית שלה, Google משחררת כלי בדיקה בקוד פתוח — אבל "משקלים פתוחים" ו"משקלים פתוחים" אינם אותו היתר, והשוואה שנעצרת במספרי פרמטרים לא תגיד לך איזה מהם יש לך.

A generated licence comparison: ARTEMIS under Apache 2.0 with commercial use, no revenue gate, freedom to fork and ship, and a keep-notices obligation, against LFM2.5-2.6B-Base under the LFM Open License, where commercial use applies below $10M revenue, derivatives inherit the same terms, and organisations above the threshold must contact Liquid.

המשפחה, כי נקודת הביקורת הבסיסית היא הדלת הלא נכונה לתוכה.

אם המטרה היא סוכן Android על-המכשיר, שלושה אחים חשובים יותר מהבסיס, והאחד שמפת הדרכים של ARTEMIS באמת זקוקה לו אינו המובן מאליו.

LFM2.5-2.6B — האח האג'נטי שעבר אימון-המשך. התפוקה המדווחת על ידי הספק היא כ-30 טוקנים לשנייה על חומרה ברמת טלפון, 113 על Ryzen AI Max+ 395 ו-220 על Apple M5 Max, כשהוא פועל בפחות מ-2.5 GB.

LFM2.5-VL-3B — מודל הקצה לחזון-שפה, שנבנה על אותו בסיס עם מקודד SigLIP2 400M NaFlex, עם דיוק קרקוע precision@1 מדווח על ידי הספק שעלה מ-57.1 ל-87.9 ב-RefCOCO, ולפי Liquid, ביצועים על רכיבי ממשק משתמש על המסך שמכים מודלי Gemma גדולים בהרבה ומגיעים לפער של 0.7% בלבד מ-Qwen 3.5 עם 4.7B. לא מאומת, אבל זה החבר היחיד במשפחה הזו שיכול לראות מסך.

LFM2.5-230M — שכבת החילוץ והסיווג, במפורש אינה מומלצת לעבודה עתירת הסקה.

מהי המסקנה הלא־נוחה לגבי צ'קפוינט הבסיס בהתמודדות הזו: פריט מפת הדרכים של ARTEMIS הוא דרישת ראייה, הבסיס הוא טקסט בלבד, והחבר במשפחה שממלא את המשבצת הוא גרסת ה-VL שכבר הוחלו עליה גם מקודד הראייה וגם הפוסט־אימון. תפקידו של צ'קפוינט הבסיס בסטאק האוטומציה של Android אינו להפעיל את הטלפון. הוא אמור להיות חומר הגלם שמתחת לכל מודל קטן שבסופו של דבר יעשה זאת.

היכן שהם כן נפגשים: גלגל התנופה שאף אחד עוד לא בנה

הנה הקשר האחד שהוא אמיתי ולא רטורי, והוא פועל בכיוון ההפוך מהכיוון הרגיל. התכונה הכי לא מוערכת של ARTEMIS היא לא הסוכן — אלא הפליטה. כל ריצה לוכדת מחסניות קריסה, צילומי מסך של פריימים מרכזיים, יומן סשן של צעדים דחוסים ודוח אבחון, ו-Pro פותח "תקרית ביצוע" בכל פעם שפעולה נכשלת ומשאיר אותה בהקשר עד שהצלחה מאוחרת יותר פותרת אותה. זהו קורפוס מתויג של בדיוק אותם רגעים שבהם התפיסה של סוכן UI הייתה שגויה.

שלבו את זה עם צ'קפוינט שכל מטרתו היא פוסט-אימון, וקיבלתם לופ מובן מאליו: הריצו את ההרנס על מודל מתארח, אספו את העקבות שבהן הוא מעד באפליקציה שלכם, ובצעו כוונון עדין של מודל 2.6B בדיוק על הפריימים האלה. זהו בדיוק סוג מערך הנתונים הקנייני שהכרטיס של Liquid עצמה מציין כהצדקה לשחרור צ'קפוינט בסיס מלכתחילה — "אימון על הנתונים שלכם" — והרישיון המותנה בהכנסות אומר שזהו מסלול הגיוני עבור צוותים שמתחת לסף ודורש שיחה עבור צוותים שמעליו.

כדי להיות מפורש לגבי מעמדו של הרעיון הזה: איש לא פרסם את הלולאה הזו, אף אחד מהספקים לא מציע אותה, ואין ראיות לכך שאף אחד מהצדדים בדק אותה. זו הצעה, לא תוצאה, ויש לקרוא אותה ככזו. אבל זהו המסגור היחיד שבו שני הארטיפקטים האלה הם משתפי פעולה ולא טעות קטגורית.

אם תגיע עד לשלב הכיוונון העדין, סט ההשוואה הוא החצי השני של הבעיה. LFM2.5-2.6B-Base אינו בקטלוג שלנו — גם לא אף וריאנט של LFM2.5 — כך שה-checkpoint הזה מגיע מההפצה של Liquid עצמה ומהמארחים הרגילים של צד שלישי. המקום שבו קטלוג מנותב מצדיק את עצמו הוא בהשוואת הכיוונון העדין שלך למודלים שעליו לנצח בשימוש בכלים, במפתח אחד ובחשבון אחד, עם מעבר כשל כך שאחר צהריים רע של ספק לא יהפוך לאחר צהריים רע של ההערכה שלך. זה דבר שימושי באמת ככל שמטרת התרגיל כולו היא עימות ישיר שאתה מתכוון לפעול לפיו.

A generated scoreboard comparing ARTEMIS and LFM2.5-2.6B-Base across six dimensions: type (Android automation harness vs pre-trained text checkpoint), whether it runs a phone (yes through ADB vs no), instruction tuning (not applicable vs none), vision (from the configured model vs none, text only), context (compressed session history vs 128,000 tokens) and licence (Apache 2.0 vs LFM Open License with a revenue threshold).

אז איזה מהם הוא הבעיה שלך?

אם יש לך אפליקציית Android ואתה רוצה שהיא תיבדק אוטומטית ברבעון הזה, אתה רוצה את ARTEMIS, ו־LFM2.5-2.6B-Base אינו חלק מהתשובה — תריץ את ARTEMIS מול מודל ראייה מתארח, תשלם לפי שלב, ופריט מפת הדרכים על מודלי VLM במכשיר יגיע בסופו של דבר ויפתור בעיית עלות שעוד לא מדדת.

אם אתה בונה מוצר שחייב לפעול על מכשיר נייד ללא רשת, אתה רוצה את מסלול המודל הקטן, ו-LFM2.5-2.6B-Base הוא ההתחלה של אותו פרויקט ולא חלק כלשהו מהפתרון שלו: תבצע לו אימון-המשך, תקרא את רישיון LFM Open מול תחזית ההכנסות שלך לפני שתכתוב את סקריפט האימון הראשון, ואם הסוכן שלך צריך לראות מסך — תמצא את עצמך על גרסת ה-VL במקום.

הדבר האחד שאסור לעשות הוא להעמיד את שני אלה זה לצד זה, להכריז שהארנס בעל יכולות גבוהות יותר, ולהמשיך הלאה. ההשוואה המועילה היא בין שתי המערכות המלאות — מודל מתארח בתוספת ארנס, לעומת מודל קטן מכוונן בתוספת פריימוורק שאתם בונים — ורק לאחת מהן יש שיעור הצלחה מפורסם בבנצ'מרק ציבורי, ששווה בדיוק כמו העובדה שלאחרת אין חשבון ענן בכלל.

המקום שבו קטלוג מנותב מוכיח את ערכו הוא בהשוואה של הכיוונון העדין שלך למודלים שעליו לנצח בשימוש בכלים, על מפתח אחד וחשבון אחד, עם מנגנון failover כך שאחר צהריים רע של ספק לא יהפוך לאחר צהריים רע של ההערכה שלך.

LFM2.5-2.6B-Base אינו נמצא בקטלוג שלנו — אין אף גרסה של LFM2.5 — כך שנקודת הביקורת הזו מגיעה מההפצה העצמית של Liquid ומהמארחים הרגילים של צד שלישי.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית