כרטיס כותרת שנוצר, שכותרתו 'TwIL-LM3-Pro vs LFM2.5 2.6B Base', עם כותרת משנה 'אחד גמור, האחר הוא נקודת התחלה', עם שני כרטיסים מעוגלים שעליהם כתוב 'TwIL-LM3-Pro - עבר אימון-המשך ומוזג' ו-'LFM2.5 2.6B Base - צ'קפוינט מאומן מראש'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

TwIL-LM3-Pro לעומת LFM2.5 2.6B Base: האחד מוגמר, האחר הוא נקודת התחלה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדבר החושפני ביותר בהשוואה שפורסמה בין TwIL-LM3-Pro ל-LFM2.5 2.6B Base הוא ש-webAI לא פרסמה השוואה נגד ה-2.6B בכלל. הטבלאות Track A ו-Track B של webAI מעמידות את המומחה ללוגיקה פורמלית בגודל 3.66B שלה מול מגוון מתחרים — ה-Granite base שלה, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — והנציג של Liquid AI שבחרה הוא LFM2.5-8B-A1B, לא ה-2.6B. ה-2.6B שכן מופיע בטבלה הוא `LFM2-2.6B`, הדור הקודם, שהוא מודל שונה עם אימון מקדים שונה. ההשמטה הזו אינה מקרית. LFM2.5 2.6B Base הוא צ'קפוינט מאומן מראש ללא כיוונון הוראות, ומבחני עמידה בהוראות אינם מבחן שהוא נבנה לעבור.

אז הדף הזה משווה תוצר גמור מול חומר גלם. המסגור בסגנון Aion — למודל אחד יש ציון ולשני אין — מתאים, אבל הסיבה ספציפית יותר ומעניינת יותר: אחד עבר אימון-המשך ומוזג, השני עוצר בכוונה לפני אימון-המשך, ושני המסמכים שמתארים אותם עונים בכוונה על שאלות שונות.

שני מספרי פרמטרים שאינם אותה מדידה

TwIL-LM3-Pro הוא בעל 3.66B פרמטרים, צפוף, וכולם פעילים בכל טוקן. הוא נגזר מ-`ibm-granite/granite-4.2-3b` באמצעות כיוונון עדין LoRA, זיקוק רב-מסלולי, מיזוג נקודות ביקורת, מיזוג WiSE-FT בחזרה אל הבסיס, ושלב GRPO משוקלל אנטרופיה — והתוצר ש-webAI הפיצה הוא המדיניות הממוזגת, לא מתאם LoRA, כך שהוא פועל באופן עצמאי.

LFM2.5 2.6B Base הוא מודל בעל 2.69 מיליארד פרמטרים על פני 30 שכבות: 22 בלוקים של קונבולוציה קצרה עם שער כפול, המשולבים לסירוגין עם 8 שכבות קשב של שאילתות מקובצות. תכנון היברידי זה של קונבולוציה/קשב הוא הארכיטקטורה של Liquid להתקנים, והוא הסיבה לכך שנתוני התפוקה של המשפחה הם כפי שהם ולא פונקציה של מספר הפרמטרים בלבד. הוא אומן על 34 טריליון טוקנים עם אוצר מילים של 128,000 טוקנים, ויש לו חלון הקשר של 131,072 טוקנים.

שני המונים נמצאים בפער של כ-36% זה מזה ומתקבלים באמצעות ארכיטקטורות שונות לחלוטין, ולכן אף אחד מהכיוונים — לא "3.66B מנצח את 2.69B" ולא ההפך — אינו אומר דבר כטענת איכות. כרטיס המודל של webAI עצמו מעלה נקודה זו בעקיפין כשהוא נמנע מלהשוות פרפלקסיית קורפוס בין טוקנייזרים — אוצר המילים של TwIL-LM3-Pro הוא 100,352, זה של LFM2.5-2.6B הוא 128,000, ופרפלקסיה נמדדת לכל טוקן.

מה "Base" מסיר, ולמה זה משנה את לוח התוצאות

Liquid AI מפרסמת את LFM2.5 2.6B בשתי צורות: צ׳קפוינט שעבר אימון-המשך, מכוונן לעומסי עבודה סוכניים בסביבות סוכנים נפוצות, וה-Base, שמתואר בכרטיס שלו עצמו כ"צ׳קפוינט המאומן מראש, טקסט בלבד, שמשמש ליצירת כל הווריאנטים של LFM2.5-2.6B". ה-Base הוא הקלט לכוונון עדין, לא מוצר. אין לו כוונון להוראות, אין תבנית צ׳אט הראויה לשמה, ואין הערכה מפורסמת — כי הערכה של מודל בסיס במשימות מילוי הוראות מודדת את הדבר הלא נכון.

מעמדו של TwIL-LM3-Pro הוא ההפוך. כל ערכו טמון במערך הפוסט-אימון: webAI מדווחת שבהרנס שלה, הצינור העלה את שער המאקרו בתוך התחום מ-0.4313 של הבסיס שלו ל-0.5539, בעוד שמאקרו 10 מערכי הנתונים המוחזקים נשאר יציב (מ-0.7942 ל-0.7901) במקום לקרוס. שימור הביצועים על מערכי הנתונים המוחזקים הוא החלק הקשה של פוסט-אימון מתמחה, והוא החלק שה-Base לא יכול להשיב עליו.

זה גם המקום שבו השוואת הגדלים בטבלאות של webAI משתלמת. מדווח כי TwIL-LM3-Pro מקדים את LFM2.5-8B-A1B בשני מדדי המאקרו שנשמרו לבדיקה — 0.7901 לעומת 0.7884 בסט של עשרה מערכי נתונים, 0.7425 לעומת 0.7378 בסט של ארבעה־עשר — עם פחות ממחצית ממספר הפרמטרים של אותו מודל MoE. זו תוצאה אמיתית של השוואה בתנאים זהים, והיא זמינה בדיוק משום ש-LFM2.5-8B-A1B הוא מודל post-trained שניתן להריץ דרך הרנס הוראות. המודל Base לא יכול, ולכן ה-2.6B מעולם לא קיבל טור.

הממדים ששווה ליישר

• פרמטרים — TwIL-LM3-Pro 3.66B צפוף לעומת LFM2.5 2.6B Base 2.69B (30 שכבות: 22 קונבולוציה + 8 GQA).

• אימון לאחר — LoRA SFT, זיקוק, מיזוג WiSE-FT ו-GRPO בצעד 2580 לעומת ללא; ה-Base הוא פלט האימון המקדים מעצם התכנון.

• חלון הקשר — 131,072 טוקנים בשניהם, בירושה מהבסיסים המתאימים להם.

• אוצר מילים — 100,352 טוקנים לעומת 128,000, ולכן הפרפלקסיות שלהן אינן ברות השוואה.

• שפות — אנגלית בלבד לעומת שבע־עשרה, כולל ערבית, סינית, יפנית, קוריאנית, ספרדית ותאית.

• פורמט חשיבה — TwIL-LM3-Pro פולט בלוק `<think>` כברירת מחדל ומנמק באריכות (1,902 טוקנים בממוצע בתחום, 24.2% מהפלטים מגיעים לתקרת האורך) לעומת צ'קפוינט בסיס ללא פורמט הוראות כלל.

• רישיון — webAI Non-Commercial License ver. 1.0 לעומת Liquid's LFM Open License v1.0.

• למה זה מיועד — נקודת קצה להסקה בלוגיקה פורמלית לעומת נקודת מוצא לכיוונון עדין.

שורות ההקשר ראויות להערת שוליים ששני המודלים מספקים: כל אחד מהם מעביר הלאה 131,072 טוקנים מהאימון המוקדם, ואף אחד מהספקים לא אימת התנהגות של הקשר ארוך — בכרטיס של TwIL-LM3-Pro נכתב שכל ציון שפורסם נמדד בתוך חלון של 8,192 טוקנים. המספרים התואמים כאן הם בירושה, לא מוכחים.

רישיון, ולמה כל אחד מהם מיועד מבחינה חוקית

רישיון webAI Non-Commercial של TwIL-LM3-Pro מתיר שימוש למטרות מחקר ולשימוש אישי, ודורש הסכם נפרד עם webAI לצורך פריסה שמייצרת הכנסות. LFM2.5 2.6B Base מופץ תחת רישיון LFM Open License v1.0 של Liquid עצמה, שאותו Hugging Face API מדווח בתור `license: other` ולא כמזהה SPDX תקני — יש לקרוא את קובץ הרישיון לפני שמתכננים על בסיסו, מכיוון שהתנאים הם של Liquid עצמה ולא תבנית מוכרת.

אף אחד משני הרישיונות אינו Apache 2.0, וזו טעות להתייחס ל"משקלים פתוחים" כמילה נרדפת ל"מתירני מבחינה מסחרית". ההבדל המעשי בין השניים הוא במה שהרישיונות מגנים עליו: חוקר לא-מסחרי יכול להשתמש בשניהם, חברה שבונה מוצר צריכה לבדוק את שניהם, והתכלית כולה של Base — לעבור כיוונון עדין ולהשתלב במוצר של מישהו אחר — הופכת את תנאיו המדויקים למשמעותיים יותר מכפי שהם נראים.

היכן כל אחד מהם שייך במחסנית

ה-Base הוא הבחירה הנכונה כשאתה מתכוון לאמן. אם הבעיה שלך היא משימת תיוג צרה, ראש סיווג ייעודי לתחום, או כיוונון עדין על כמה אלפי דוגמאות מתויגות, התחלה מנקודת ביקורת מאומנת מראש בת 2.69B עם אוצר מילים רב-לשוני רחב וארכיטקטורת קונבולוציה היברידית שתוכננה לתפוקה היא החלטה הנדסית מוצקה, והעלות של ה-post-training שתדלג עליו היא העלות שאתה משלם במקום זאת במכוון.

TwIL-LM3-Pro הוא הבחירה הנכונה כאשר אינך מתכוון לאמן והמשימה היא כבר לוגיקה פורמלית. תוויות הסקה, פורמליזציה של הצהרות Lean, ניתוחים סמנטיים וביקורת הוכחות הם המשימות שכל ה-pipeline שלו נועד עבורן, והתחלה מ-checkpoint שכבר עבר את שלב המיזוג ואת שלב החיזוק חוסכת לך את החלק היחיד בזה שבאמת קשה לשחזר — לשמור על רמת סוויטת ה-held-out תוך השגת שיפור בתוך התחום.

הטעות היא לקרוא ל"מומחה שעבר אימון-המשך של 3.66B" כאל טוב בהחלט מ"נקודת ביקורת בסיס של 2.69B". הם נמצאים בשלבים שונים של אותו קו ייצור.

לשרת אותם, או לשרת סביבם

אף אחד מהמודלים אינו מסלול בקטלוג של OrcaRouter היום, והסיבה שונה בכל מקרה. ל-TwIL-LM3-Pro יש רישיון לא-מסחרי ואין לו נקודת קצה מתארחת; LFM2.5 2.6B Base הוא תוצר כיוונון עדין שאיש לא היה מגיש אותו כנקודת קצה להסקה בכוונה. המקום שבו ראוטר מצדיק את עצמו הוא שכבה אחת למעלה, בעבודה שסובבת סביב מומחה: יצירת וסינון נתוני האימון שעליהם היית מכוונן את ה-Base, הרחבת הפרומפטים שהיית מזין למודל לוגיקה פורמלית, ודירוג הפלטים. אלה קריאות טקסט, והן פועלות דרך נקודת קצה אחת תואמת OpenAI מול יותר מ-200 מודלים במחיר המחירון של הספק עם תוספת של 0%, כך שהורדת מחיר של ספק נכנסת לתוקף באותו היום, והחלפה ממודל יצירת נתונים אחד לאחר היא עריכת קונפיגורציה ולא קשר עם ספק שני.

מעבר אוטומטי לגיבוי חשוב יותר מהרגיל בצינור כיוונון עדין, כי עבודת אצווה שנכשלת ב-80% מבזבזת את כל הריצה. מפתח אחד בכל מודלי היצירה, עם גיבוי ששולח מחדש במקרה של שגיאת ספק, הוא חלק תשתית קטן יותר משלוש אינטגרציות API.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs LFM2.5 2.6B Base - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Post-training SFT, merge, GRPO; Context 131,072 tokens; Vocabulary 100,352; Languages English; Licence non-commercial. LFM2.5 2.6B Base: Parameters 2.69B (30 layers); Post-training none by design; Context 131,072 tokens; Vocabulary 128,000; Languages 17; Licence LFM Open License v1.0. A footer line reads 'Both vendor-reported; neither model has a third-party evaluation.' The OrcaRouter logo is composited in the bottom-right corner.

איזה מהם, נקבע לפי הכוונה שלך

אם אתה מאמן, בחר ב-Base. אם אתה מבצע היסק בלוגיקה פורמלית והרישיון מתיר לך להשתמש, בחר ב-TwIL-LM3-Pro. אם אתה צריך היום מודל קטן שעוקב אחרי הוראות ואף אחת מהמגבלות לא מתאימה, השתמש באח שעבר אימון-המשך של LFM2.5 2.6B — המודל ש-Liquid באמת מפרסמת למטרה הזו — והשאר את ה-Base לכוונון העדין שתכננת ממילא.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing the Liquid AI author line, the 16-languages tag, the LFM2 and liquid tags, and the card's opening description of LFM2.5 as a family of hybrid models designed for on-device deployment, built on the LFM2 architecture with extended pre-training and reinforcement learning.A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B, the post-trained sibling, showing the 16-languages and LFM2 tags and the card's description of LFM2.5-2.6B as part of the LFM2.5 family with a 128K context window and agentic post-training.