LFM2.5-2.6B-Base-1
Engineering & Research

LFM2.5-2.6B-Base: השחרור השקט ביותר של Liquid AI הוא זה שמכווני-העדין באמת רצו

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לפי המונים של Hugging Face ב-5 באוגוסט 2026, קשה לפספס את הפער: LFM2.5-2.6B, המודל הסוכני-על-המכשיר של Liquid AI שהושק ב-4 באוגוסט, עומד על 47,393 הורדות. LFM2.5-2.6B-Base, ה-checkpoint המאומן מראש שכל אחד מאותם משקלים נגזר ממנו, עומד על 151. אותו ארגון, אותה ארכיטקטורה, אותו שבוע, פער של 314 ל-1. שבוע לאחר מכן, פער הגישה מצביע על אותו כיוון: ב-11 באוגוסט, המודל שעבר אימון נוסף LFM2.5-2.6B קיבל נקודת קצה API מתארחת — ללא תשלום — בעוד ש LFM2.5-2.6B-Base נשאר ה-checkpoint ללא נקודת קצה.

נקודת הביקורת הבסיסית לא דלפה ולא הוסתרה. היא הופיעה בפוסט ההשקה של Liquid בדיוק בהערת סוגריים אחת — "המודלים הבסיסיים (LFM2.5-2.6B-Base) והמודלים שעברו אימון המשך (LFM2.5-2.6B) זמינים היום ב-Hugging Face" — וזה כל מה שפורסם עליה. אין בנצ'מרקים משלה, אין מדור, אין כרטיס נפרד. כל מה שלהלן נלקח ישירות מהמאגר — כרטיס המודל, config.json, קובץ ה-LICENSE וה-API של Hugging Face — ועוד חישובים שעשינו בעצמנו. כאשר מספר מגיע מההערכות של Liquid עצמה, אנו מציינים זאת, כי לגבי נקודת הביקורת הספציפית הזו, העובדה החשובה ביותר היא כמה מעט נמדד בפועל.

לזה יש משקל רב יותר ממה שהערת שוליים מרמזת. מודל שעבר פוסט-אימון אפשר לבחון על ידי ניסיון. נקודת בסיס היא הצעה להשקיע שבועיים ותקציב GPU לפני שלומדים משהו, ולכן תנאי ההצעה — מה יש בה, תחת איזה רישיון היא ניתנת, ומה הוערך — הם כל ההחלטה.

מה נמצא בפועל במאגר

תשעה קבצים, רסיס אחד של משקולות, אין קוד מידול. רשימת המפרט של הכרטיס, שאומתה מול config.json:

• 2.69B פרמטרים בסך הכול, bfloat16, בקובץ יחיד בגודל 5.39 GB בשם model.safetensors. תכננו אחסון ו-VRAM לפי המספר הזה, לא לפי "2.6B".

• 30 שכבות, היברידיות. הכרטיס אומר 22 בלוקי קונבולוציה קצרים עם שער כפול ועוד 8 שכבות קשב GQA. הlayer_typesמערך ב-config.jsonמאשר זאת בדיוק: 22 רשומות של conv ו-8 של full_attention, כששכבות הקשב מרווחות בערך כל בלוק שלישי או רביעי ולא מרוכזות.

• רוחב חבוי של 2048, שכבת ביניים של 10752, 32 ראשי קשב על פני 8 ראשי מפתח-ערך — יחס GQA של 4 ל-1 — עם מטביעות קלט ופלט קשורות ותטא (rope theta) של 10,000,000.

• אוצר מילים של 128,000 טוקנים, וטוקניזר בגודל 18MB שמתלווה אליו. Liquid הכפיל את אוצר המילים בדור הזה, שזו עלות משמעותית ב-2.6B: עם אמבדינגים קשורים, טבלת אוצר המילים לבדה מהווה בערך 262M מתקציב הפרמטרים, קרוב לעשירית מהמודל.

• 34 טריליון טוקני אימון. זוהי ריצת טרום-אימון ארוכה במיוחד עבור מחלקת גודל זו, והיא הסיבה החזקה ביותר לבחון את נקודת הבידוק בכלל.

• 16 שפות מוצהרות: אנגלית, ערבית, סינית, צרפתית, גרמנית, הינדי, אינדונזית, איטלקית, יפנית, קוריאנית, פולנית, פורטוגזית, רוסית, ספרדית, תאילנדית ווייטנאמית.

חוסר עקביות אחד לכל מי שמתכנן עבודה עם הקשר ארוך: הכרטיס מפרסם אורך הקשר של 131,072 טוקנים, בעוד config.json קובע את max_position_embeddings ל-128,000. הבלוג והמסמכים של Liquid עצמם אומרים 128K. ההפרש של 3,072 טוקנים לא ישנה לרוב האנשים, אבל אם אתה כותב סקריפט אימון שאורז רצפים למקסימום המפורסם, סמוך על קובץ התצורה יותר מאשר על הכרטיס.

מחרוזת הארכיטקטורה היא הכותרת המעשית: model_type הוא lfm2 והמחלקה היא Lfm2ForCausalLM — אותה מחלקה ש-LFM2 נשלח איתה. LFM2.5 הוא אימון מקדים מורחב ואימון עוקב חדש על ארכיטקטורה קיימת, לא חדשה, ולכן שום דבר כאן לא דורש קוד מודלים מותאם אישית. זו הסיבה ש-llama.cpp, vLLM, MLX, ONNX Runtime, SGLang ו-LM Studio תמכו כולם במשפחה הזו מהיום הראשון, ולכן מסלול הכיוונון העדין דרך Unsloth ו-TRL עובד ללא טלאים. אתה כן צריך transformers>=5.0.0.

הכרטיס שאתה מקבל הוא הכרטיס של הדגם האחר.

פתחו את המאגר הבסיסי והכותרת הראשונה היא "LFM2.5-2.6B" — שמו של המודל שעבר פוסט-אימון, לא של המודל שאתם מסתכלים עליו. לא מדובר בקטנוניות; הדף כולו נראה כמו כרטיס ה-instruct עם פסקת base שהושתלה לתוכו, ושלושה מהארטיפקטים שנותרו מאחור יכולים לעלות לכם זמן יקר.

LFM2.5-2.6B-Base-2

• כותרת ה-YAML מציינת base_mode: LiquidAI/LFM2.5-2.6B-Base. שתי בעיות בשורה אחת: המפתח הוא שגיאת כתיב של Hugging Face base_model, והוא מפנה את מאגר הבסיס אל עצמו. שום דבר לא נשבר, אבל קישורי עץ המודל שהיית מצפה להם משושלת שהוצהרה כראוי אינם נוצרים מכך.

• המאגר מתויג כ-conversational ומגיע עם קובץ chat_template.jinja, ולכן Hugging Face מציג תג "Chat template" על checkpoint שמעולם לא עבר כיוונון לפי הוראות. התבנית קיימת משום שתצורת הטוקנייזר עברה בירושה, ולא משום שהמשקלים יודעים מה לעשות איתה.

• קטע הקוד של ההתחלה המהירה משתמש לאחר מכן בתבנית הזו.דוגמת הפייתון בכרטיס הבסיס קוראת ל-tokenizer.apply_chat_template עם {"role": "user"} הודעה ושואלת: "מה זה C. elegans?" — הדרך הקלאסית לגרום למודל בסיסי להיראות שבור. עוטפים checkpoint מאומן מראש בסיבובי צ'אט ומקבלים טקסט נודד, חוזר על עצמו וממשיך את עצמו, וקל לקרוא את זה כמודל גרוע ולא כפורמט פרומפט שגוי. תפעילו את המודל הזה כמשלים טקסט, עם דוגמאות בודדות, ועם רצפי עצירה שבשליטתכם.

• טבלת הווריאנטים מפרטת רק את הקו שעבר אימון נוסף— LFM2.5-2.6B, יחד עם גרסאות ה-GGUF, ה-ONNX וה-MLX שלו. אין גרסת GGUF או MLX של נקודת הביקורת הבסיסית בכלל, לכן "להריץ אותו מקומית הערב ב-LM Studio" לא בא בחשבון בלי להמיר אותו בעצמך.

Hugging Face עדיין מדווח שאף ספק אינפרנס לא משרת את המאגר הזה, וזה לא השתנה מאז ההשקה. מה שכן השתנה הוא החצי השני של הצמד: ב-11 באוגוסט המודל שעבר אימון נוסף LFM2.5-2.6B קיבל נקודת קצה מתארחת על API מסחרי לניתוב מודלים — הרישום פעיל במרשם המודלים הציבורי של הפלטפורמה, מוגש בחינם כשהפרומפט וההשלמה שניהם ב-$0, קונטקסט מלא של 128K נחשף. בדקנו את המרשם ישירות, כך שהרישום עצמו אומת באופן עצמאי; המחיר $0 הוא הנתון הנוכחי של הפלטפורמה ועשוי להשתנות. שום דבר מזה לא נוגע לבסיס: LFM2.5-2.6B-Base עדיין אין לו נקודת קצה מתארחת בשום מקום, כך שאם אתה רוצה את הלוגיטים שלו, אתה עדיין שוכר את ה-GPU.

מדור ה-benchmark שאינו קיים

לא פורסם ולו מספר הערכה אחד עבור LFM2.5-2.6B-Base. אין MMLU, אין MMLU-Pro, אין GPQA, אין HellaSwag, אין ARC, אין נתון perplexity — כלום, באף אחד משלושת המקומות של Liquid (כרטיס המודל, פוסט ההשקה, המסמכים). עבור צ'קפוינט בסיסי זהו היעדר בולט, כי הציונים האלה של ידע והגיון הם בדיוק הדרך שבה שופטים אם 34T טוקנים של אימון מקדים הותירו לך משהו ששווה כיוונון עדין.

מה שקיים שייך לאח שעבר פוסט-אימון, מדווח על ידי Liquid, ולא שוכפל באופן עצמאי. בהערכות של Liquid עצמה, LFM2.5-2.6B משיג 51.87 ב-AIME25, 59.17 ב-IFBench, 80.07 ב-Multi-IF, 56.88 ב-BFCLv4, 77.83 ב-ToolSandbox ו-26.89 ב-BrowseComp+ בתוך סביבת OpenClaw, בהשוואה ל-gemma-4-E2B-it (5.1B), gemma-4-E4B-it (8B), Qwen3.5-4B (4.7B) ו-Qwen3.5-9B (9.7B). הסיכום של Liquid הוא שהוא מוביל בכל מדדי ביצוע-ההוראות וכמעט בכל מדדי השימוש-בכלים, והתרשים של Liquid עצמו כנה לגבי היוצאים מן הכלל: Qwen3.5-9B מקדים ב-AIME25 עם 56.07 וב-BFCLv4 עם 60.13. טענות המהירות פועלות לפי אותו כלל: 220 טוקנים/שנייה בדקוד על M5 Max, 113 על Ryzen AI Max+ 395, כ-30 בטלפון, פחות מ-2.5GB זיכרון, וכ-15 אלף טוקני פלט/שנייה במקביליות גבוהה על H100 אחד — כולן נמדדו על ידי היצרן, ואף אחת לא אומתה עדיין על ידי אף גורם אחר.

המלכודת היא להניח שמשהו מכל זה עובר. הציונים האלה הם תוצר של פייפליין ארבע-שלבי המופעל על גבי נקודת הביקורת הזו: שני סבבים של כוונון עדין מפוקח, התמחות של מורה לכל תחום, זיקוק על-מדיניות רב-תחומי, ולאחר מכן למידת חיזוק אג'נטית עם GRPO שמריצים בתוך רתמות אמיתיות. קריאה לכלים ומעקב אחר הוראות הם בדיוק ההתנהגויות שהפייפליין מתקין. קחו את משקלי הבסיס ואתם מתחילים מלפני כל זה. מה שאתם יורשים הוא הפרה-אימון — השפות, ידע העולם, יכולת ההקשר הארוך, הארכיטקטורה ההיברידית היעילה — וכדאי לכם להניח שאינכם יורשים שום דבר מלוח התוצאות האג'נטי.

151 הורדות זה לא רק מוקדם — זה מחוץ לדפוס של המשפחה עצמה.

Liquid שולח באופן שגרתי נקודות ביקורת בסיסיות, כך שמהדורה זו אינה יוצאת דופן במינה. ההזנחה היא מה שניתן למדוד. השוואת כל מאגר LFM2.5 בסיסי אל מול אחיו ה-instruct באותו יום חושפת נורמת בית ברורה — וחריג אחד ברור.

LFM2.5-2.6B-Base-3

• LFM2.5-230M — 58,676 הורדות לעומת 6,982 עבור הבסיס: בערך 8 ל-1.

• LFM2.5-350M — 94,526 לעומת 9,397: בערך 10 ל-1.

• LFM2.5-1.2B — 583,914 עבור גרסת Instruct לעומת 17,867 עבור גרסת הבסיס: בערך 33 ל-1.

• LFM2.5-8B-A1B — 171,520 לעומת 3,996: בערך 43 ל-1.

• LFM2.5-2.6B — 47,393 לעומת 151: בערך 314 ל-1.

חלק מזה הוא פשוט גיל; המאגר הבסיסי נוצר ב-1 באוגוסט, ומודל ה-instruct קיבל יתרון של ארבעה ימים, בתוספת פוסט השקה. אבל נקודות הביקורת הבסיסיות הישנות יותר במשפחה זו התייצבו בין {{1}}8-to-1{{/1}} ל-{{2}}43-to-1{{/2}}, כך שפער של סדר גודל מעבר לגרועה שבהן הוא אנומליה אמיתית, ולא תוצר עיגול של מאגר חדש.

הלייקים מספרים סיפור עדין יותר. במאגר הבסיס יש 28 לייקים לעומת 151 הורדות — בערך סימנייה אחת לכל חמש משיכות. למודל ה-instruct יש 232 לייקים לעומת 47,393, בערך אחד לכל 204. אנשים מסמנים את נקודת הביקורת הבסיסית כדי לחזור אליה, לא כדי למשוך אותה. בעץ המודל שלה כבר קיימים שני כיוונונים עדינים של הקהילה ושבעה כימות, וזה מה שנראה כמו חוד החנית של האימוץ לפני שהנפח מגיע.

"ללא הגבלות" אינו מה שהרישיון אומר

דף ההשקה של Liquid מתאר את המהדורה כבעלת משקל פתוח: "הורידו, כווננו ופרסו ללא הגבלות."הקובץ במאגר אומר משהו מצומצם יותר, וזהו הקטע שכדאי לקרוא פעמיים אם אתם שוקלים לבנות מוצר על משקלים אלה.

LFM2.5-2.6B-Base-4

הרישיון הוא LFM Open License v1.0 — לא Apache-2.0, לא MIT, ולא אותם תנאים כמו ברוב המודלים הקטנים עם המשקל הפתוח שאתה כנראה משווה אליהם. בציטוט ישיר מהקובץ, סעיף 5 נקרא "הגבלת שימוש מסחרי" ונוסחו: "הזכויות המוענקות במסגרת רישיון זה לשימוש מסחרי מותנות בכך שאתה או הישות המשפטית שלך לא תחרוג מהסף," ולאחר מכן "כל שימוש מסחרי ביצירה או ביצירה נגזרת על ידי ישות משפטית שחורגת מהסף אינו מורשה במסגרת הסכם זה." סעיף 1 מגדיר את הסף כ- "הכנסה שנתית של 10 מיליון דולר אמריקאי ($10,000,000) או יותר."

אז הקריאה הפרקטית:

• הכנסות שנתיות של פחות מ-10 מיליון דולר — יש לך רישיון רחב, תמידי וללא תמלוגים המכסה העתקה, יצירות נגזרות, הפצה ורישוי משנה, כולל שימוש מסחרי.

• בסך 10 מיליון דולר ומעלה — שימוש מסחרי הוא לא מורשה לפי הסכם זה. לא "דורש ייחוס," לא "דורש הודעה." אתה צריך לדבר עם Liquid, וזו ככל הנראה הסיבה שהכרטיס מסתיים בקישור לצוות המכירות שלהם.

• יצירות נגזרות יורשות את המגבלה. הכוונון העדין שביצעת על נקודת הביקורת הזו הוא יצירה נגזרת, ולכן מודל שעל אימונו השקעת רבעון נושא את אותה הענקת זכויות מותנית בהכנסות. אם החברה שלך חוצה את הסף — או נרכשת על ידי חברה שכבר חצתה אותו — התנאים שהמוצר שלך תלוי בהם משתנים מתחת לרגליו.

• ארגונים ללא מטרות רווח מוסמכים פטורים: הסף אינו חל על ארגון 501(c)(3) או מקבילו הזר המשתמש ביצירה למטרות לא מסחריות או מחקר. חובות רגילות חלות גם כן — העבירו את הרישיון הלאה, שמרו על הודעות הייחוס, סמנו קבצים ששיניתם.

שום דבר מזה לא הופך את השחרור לקמצני; סף של 10 מיליון דולר פוטר כמעט כל סטארטאפ וכל חוקר, וזו דרך לגיטימית לפרסם משקלים. אבל "ללא הגבלות" הוא טקסט שיווקי שהרישיון סותר, ואי-ההתאמה נוגסת הכי חזק דווקא כאן. כוונון עדין של נקודת בסיס הוא הדרך היקרה ביותר והכי פחות הפיכה לאמץ מודל. זה המקום הגרוע ביותר לגלות סעיף הכנסות.

מי בעצם צריך לקחת את נקודת הביקורת הזו?

ההנחיה של Liquid עצמה צרה באופן מרענן, וכדאי לעקוב אחריה: הכרטיס אומר שנקודת הבידוק המאומנת מראש היא "מומלצת רק למשימות שדורשות כוונון עדין כבד, כמו עוזרים ספציפיים לשפה (למשל, יפנית) או ספציפיים לתחום (למשל, רפואי), אימון על נתונים קנייניים, או ניסוי בגישות פוסט-אימון חדשניות." המילה "רק" עושה כאן עבודה אמיתית. אם אתה רוצה סוכן על-המכשיר שקורא לכלים, ה-LFM2.5-2.6B המאומן לאחר-אימון הוא נקודת ההתחלה הטובה יותר באופן מובהק, ונקודת הבידוק הבסיסית תבזבז לך את החודש.

המקרים שבהם זו באמת הבחירה הנכונה:

• שפה שהפוסט־טריינינג לא נותן לה מענה מספק.34T טוקנים ב־16 שפות הם בסיס רב־לשוני חזק, ו־Liquid כבר הוכיחה את התבנית בבית עם גרסה יפנית בקו ה־1.2B. המשך פרה־טריינינג על השפה שלך ולאחר מכן כיוונון הוראות משלך מונעים מאבק נגד פרסונה שעברה פוסט־טריינינג וממוקדת באנגלית.

• מגזר מוסדר עם נתונים קנייניים. מתחת ל-2.5 ג'יגה-בייט בזמן הסקה, ללא תלות בענן, ורישיון מתירני מספיק מתחת לסף ההכנסות מהווים שילוב נדיר לפריסות רפואיות, משפטיות או תעשייתיות שבהן הנתונים אינם יכולים לצאת מהמכשיר.

• מחקר פוסט-אימון.Liquid פרסמה את המתכון שלה — SFT, התמחות מורה, MOPD, RL אייג'נטית — ולאחר מכן מסרה את הקלט המדויק לאותו מתכון לצד הפלט. היכולת להריץ את השיטה שלך על אותם משקלי התחלה ולהשוות מול מימוש ייחוס חזק היא דבר נדיר ובעל ערך.

• מטרות זיקוק. היברידי של 2.6B שמפענח ב-220 אסימונים לשנייה על מחשב נייד הוא תלמיד אטרקטיבי לדחיסת מורה גדול בהרבה למשהו שניתן לשחרר.

הזוג האחרון הוא המקום שבו העלות באמת נוחתת, וזה לא שעות GPU — אלה נתונים. הצינור של Liquid מתבסס על התמחות מורים וזיקוק on-policy, כלומר התנאי המוקדם האמיתי לשחזור משהו דומה הוא נפח גדול של נתונים שנוצרו ממודלים חזקים יותר, בתוספת זוגות העדפה והרצות עם תגמול בר-אימות. זו עבודה של מודלים רבים לפני שהיא עבודת אימון: אתה רוצה להשוות מורים מועמדים בתחום שלך, ואז לייצר בנפחים גדולים מהמודל שמנצח. זה החלק בעבודה שהמוצר שלנו מכוון אליו — OrcaRouter מעמיד 200+ מודלים מאחורי מפתח API אחד בתוספת מחיר של 0%, כך שמה שאתה משלם עבור ערכת SFT סינתטית הוא המחיר הרשמי של הספק במקום פרמיית ניתוב (וכשספק מוריד מחירים, זה נוחת אצלנו באותו היום), מעבר אוטומטי לגיבוי (failover) שומר על ריצת יצירה של עשרים שעות מליפול בשעה רעה של ספק אחד, ו-DSL הניתוב מאפשר לפזר הנחיה בודדת על פני כמה מורים ולשמור את התשובה הטובה ביותר. כדי שנהיה ברורים לגבי מה שאנחנו לא מציעים: LFM2.5-2.6B-Base לא נמצא ב-OrcaRouter ואף ספק inference לא מארח אותו — את המשקלים האלה אתה מריץ בעצמך. אנחנו מועילים למורים, לא לתלמיד.

{{1}}כדאי לזכור את אותו הפיצול גם לגבי כל מה שאתם משחררים.{{/1}} {{2}}הפוסט של Liquid טוען שסוכנים מקומיים הופכים את ההסקה ללא עלות ומסירים את עלות האסימון הבודד כמגבלה, מה שנכון לגבי האסימון השולי ולא לגבי החשבון הכולל — עליו שילמתם מראש בחומרה, ולדגם 2.6B עדיין יש תקרה.{{/2}} {{3}}Liquid אומרת זאת בעצמה, וממליצה שלא להשתמש במשפחה זו לעבודה אגנטית עתירת קוד או עתירת ידע.{{/3}} {{4}}הדפוס בר-הקיימא הוא דגם מקומי מכוונן המטפל בנתיב הנפוץ עתיר-הנפח במכשיר עצמו ומסלים את מיעוט המקרים הקשים לדגם מתקדם (frontier) דרך API, מה ששומר על יתרונות הפרטיות והשהיה היכן שהם חשובים, בלי להעמיד פנים ש-2.6B פרמטרים יכולים לעשות הכול.{{/4}}

הדרך מהמשקלים הללו למשהו שמיש

פוסט ההשקה לא אומר על זה כלום, אבל כרטיס הבסיס נושא בשקט את הדבר הכי פרקטי בכל המאגר: שבעה מחברות Colab מוכנות להרצה שמכסות את שלבי ה-pipeline המדויקים שצ'קפוינט בסיסי צריך לעבור. שתיים מהן הן pre-training המשכי — אחת ל-text completion ואחת לתרגום — שזה השלב שהגיוני רק מ-base weights וזה השלב שאף אחד לא כותב עליו מדריכים. השאר מכסות supervised fine-tuning דרך Unsloth ו-TRL, DPO דרך TRL, ו-GRPO דרך שניהם. Liquid גם שולחת את LEAP Finetune כערימת אימון משלה אם אתה מעדיף לא להרכיב אחת בעצמך.

קריאת מסמכי הכוונון העדין של Liquid מול המבנה של המודל הזה, הרצף הריאלי נראה כך:

• תחילה הנח אותו כמשלים, לפני שתאמן משהו. התעלם מתבנית הצ'אט שבכרטיס. Few-shot, טקסט גולמי, רצפי עצירה משלך. כך תגלה אם האימון המקדים כבר מכסה את התחום והשפה שלך, וזה יקבע אם אתה צריך המשך אימון מקדים בכלל או שאפשר לדלג ישר ל-SFT.

• המשך אימון מקדים רק אם אתה מוסיף ידע או שפה. זהו הענף היקר — בקנה מידה של קורפוס, לא בקנה מידה של דוגמה — והדבר היחיד שהאח שעבר אימון עוקב באמת לא יכול לתת לך.

• לאחר מכן SFT עם LoRA, על 500 עד 5,000 דוגמאות.ההנחיה של Liquid עצמה היא שאיכות והתפלגות גוברות על כמות, ושהדוגמאות צריכות להתאים לקלטי הייצור. ב-2.6B מעבר LoRA הוא קצר: לפי התיעוד, ריצה של 1.2B אורכת דקות עד עשרות דקות על GPU מודרני אחד, כך שהגודל הזה עדיין מאפשר לולאה באותו אחר צהריים.

• הקפיאו קבוצת נתונים מוחזקת לפני שאתם מאמנים. זה בוטה, וחשוב לחזור על כך דווקא בנקודת הביקורת הזו, כי אין קו בסיס שפורסם להשוואה — סט ההערכה שלך הוא המספר היחיד שקיים.

• שלבי ההעדפה או ה-RL מגיעים אחרונים, ורק אם ההתנהגות היא הבעיה. קיימים מתכוני DPO ו-GRPO למשפחה, אבל הם שכלול על גבי מודל שכבר עונה; הפנייה אליהם לפני ש-SFT נוחת היא הדרך שבה פרויקטים של base-checkpoint נתקעים.

שימו לב מה לא נמצא ברשימה הזו: שום דבר כאן לא דורש קרנל מותאם אישית, מאמן מתוקן או קובץ מידול. מכיוון ש-LFM2.5 עושה שימוש חוזר בארכיטקטורת LFM2, ה-checkpoint הבסיסי משתלב במחסנית הסטנדרטית, וכל העלות של הפרויקט הזה היא הקורפוס ומערך ההערכה שאתם בונים עבורו.

מה היה משנה את התמונה

שלושה דברים שכדאי לעקוב אחריהם, כולם זולים עבור Liquid לפתור, ואף אחד מהם לא נפתר היום.

הראשון הוא הערכות בסיס. מספר MMLU-Pro או GPQA יחיד על הצ'קפוינט המאומן מראש היה אומר למכוונני-העדין יותר מכל אמות-המידה האייג'נטיות בפוסט ההשקה גם יחד, והעובדה שנכנסו 34T טוקנים הופכת את היעדרו למוזר יותר, לא פחות. השני הוא הכרטיס עצמו — מאגר בסיס שכותרתו נוקבת בשם מודל אחר, שההתחלה המהירה שלו מחילה תבנית צ'אט על מודל שאינו צ'אט, ושהפרונט-מאטר שלו מאיית לא נכון את base_model — תיקון של עשר דקות שיעצור אנשים מלהסיק שהמשקלים שבורים כשההוראות הן אלה ששבורות. השלישי הוא הדוח הטכני של LFM2.5. גוש הציטוט מצביע על arXiv 2511.23404, שהוא הדוח הטכני של LFM2 מנובמבר 2025; המאמר של דור ה-2.5 עצמו לא יצא, כך שתמהיל נתוני האימון המקדים מאחורי אותם 34T טוקנים נותר בלתי-גלוי.

עד אז, {{1}}הסיכום הכנה הוא שמדובר במודל יסוד של 2.6B מוגדר היטב, מאומן לאורך זמן, ובעל מבנה יעיל, עם קהל יעד ברור בצורה יוצאת דופן, שפורסם ללא מדידות ועם רישיון מוגבל הכנסות,{{/1}} ובינתיים כמעט אף אחד לא הוציא אותו מהקופסה. אם אתה בתוך קהל היעד שהכרטיס מתאר, {{2}}זה שווה את זמן ה-GPU שלך — ואתה תהיה בין הראשונים בכל מקום שיידעו עד כמה הוא באמת טוב.{{/2}}

שאלות ששווה לענות עליהן

האם זו אותה נקודת ביקורת שממנה בוצע הפוסט-אימון של LFM2.5-2.6B, או ריצת פרה-אימון נפרדת?

הכרטיס קובע ש-LFM2.5-2.6B-Base "הוא נקודת ביקורת (checkpoint) מאומנת מראש של טקסט בלבד, המשמשת ליצירת כל גרסאות LFM2.5-2.6B", ולכן הוא הקלט בפועל של הצינור שפורסם, לא מהדורה מקבילה או מצומצמת. זה מה שהופך אותו לשימושי למחקר של אימון-מאוחר (post-training): השיטה שלך וארבעת השלבים של Liquid מתחילים ממשקלים זהים, כך שהשוואה ביניהם משמעותית. ראוי לציין שמאגר הבסיס נוצר ב-1 באוגוסט ושונה לאחרונה ב-4 באוגוסט, יום ההשקה — בדוק את היסטוריית ה-commit לפני שמניחים שהקובץ שהורדת מוקדם הוא הקובץ ששוחרר.

האם אני יכול לכוונן אותו ולמכור את התוצאה?

אם ההכנסה השנתית של הישות המשפטית שלך נמוכה מ־10,000,000 דולר, כן — מענק LFM1.0 מכסה שימוש מסחרי ביצירות נגזרות, בכפוף לשמירה על הרישיון והודעות הייחוס על כנן ולסימון קבצים ששונו. בסף זה ומעלה, שימוש מסחרי במודל או בכל דבר הנגזר ממנו נופל מחוץ לתחום הרישיון ודורש הסדר נפרד עם Liquid. הסף נקבע לפי הכנסות הישות שלך, ולא לפי המודל או ההכנסות שהוא מייצר, כך שאותו כוונון עדין יכול להיות מורשה לחברה אחת ולא לאחרת, וחברה שחוצה את הקו אינה שומרת על המענק שהיה לה.

מדוע לא פשוט לבצע כוונון עדין על ה-LFM2.5-2.6B שכבר עבר אימון במקום?

ברוב הפרויקטים כדאי לעשות זאת, והכרטיס של Liquid אומר זאת למעשה. הסיבה להתחיל מנקודת הביקורת הבסיסית היא כאשר הפוסט-אימון פועל נגדך ולא בעדך: המשך אימון מקדים כבד על שפה חדשה או על קורפוס תחומי נוטה לפגוע בהתנהגות המותאמת להוראות בכל מקרה, ודפוסי הסירוב, מוסכמות קריאת הכלים וסגנון התגובה שמובנים על ידי SFT ו-RL קשים להסרה וקלים להתנגש עמם. אם אתה מוסיף ידע או שפה, התחל מהבסיס. אם אתה מכוונן התנהגות בשוליים, התחל מהמודל שעבר פוסט-אימון ושמור על ארבעת שלבי העבודה שמישהו כבר שילם עליהם.