
LFM2.5-8B-A1B-DSpark לעומת LFM2.5-2.6B-Base: חלק המהירות מול חומר הגלם
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
כשממיינים את משפחת LFM2.5 לפי מה שכל checkpoint יכול לעשות בעצמו, LFM2.5-8B-A1B-DSpark ו-LFM2.5-2.6B-Base נוחתים בקצוות מנוגדים של הסקאלה — ואף קצה לא יכול לענות על שאלה. הראשון הוא מודל דראפט עם 327.7M פרמטרים, שקיים אך ורק כדי לגרום למודל ה-mixture-of-experts הקצה של Liquid AI לייצר טוקנים מהר יותר. השני הוא checkpoint גולמי מאומן מראש עם 2.69B פרמטרים, שקיים אך ורק כדי שיכווננו אותו למשהו אחר. שניהם שוחררו באוגוסט 2026 תחת רישיון ה-LFM Open License v1.0 של Liquid, שניהם במרחק הורדה אחת ב-Hugging Face, ושניהם קל מאוד לתפוס בטעות — כי השמות שלהם נשמעים כמו שתי גרסאות של אותו דבר.
השמות הם המלכודת. "DSpark" נשמע כמו ספינת הדגל החדשה והנוצצת של המשפחה, ו-"Base" נשמע כמו ברירת המחדל הפשוטה שאפשר באמת להריץ. אף אחד מהם אינו נכון. נקודת הביקורת DSpark לא יכולה לענות על שום דבר בפני עצמה — היא רק מציעה טוקנים עבור LFM2.5-8B-A1B כדי לאמת. גם ה-Base לא יכולה לענות על שום דבר, אבל מהסיבה ההפוכה — היא בסיס לא מכוונן שחוזה טקסט, אך מעולם לא אומן לאחר מכן כדי להפוך למודל צ'אט או סוכן. זו לא יריבות; זהו צינור. נקודת ביקורת אחת יושבת ממש בסופו של סטאק השירות, והשנייה ממש בתחילתו של ריצת אימון.
שני מחסומים שחולקים שם, לא תפקיד
LFM2.5-8B-A1B-DSpark (שוחרר ב-20 באוגוסט 2026) הוא מודל טיוטה לפענוח ספקולטיבי: רשת מבוססת-אטנשן בלבד בת חמש שכבות, בלוק של תשעה טוקנים מוצעים בכל צעד, וראש מרקוב על אוצר המילים בן 128,000 הטוקנים של המודל המטרה. אתה טוען אותו לצד ה-LFM2.5-8B-A1B — מודל MoE עם סה"כ 8.3 מיליארד פרמטרים וכ־1.5 מיליארד פעילים, ששוחרר עוד ב-28 במאי — הטיוטה מנחשת את הטוקנים הבאים, והמטרה מאמתת את כל הבלוק במעבר קדימה אחד, ושומרת על כל מה שהיא מקבלת. כיוון שהמטרה בודקת כל טוקן, הפלט בתנאי פענוח חמדן (greedy decoding) זהה להרצת LFM2.5-8B-A1B לבדו: "ללא אובדן מעצם הבנייה," כניסוח של Liquid. הטיוטה היא רכיב מהירות, לא מוח. הוא שוחרר לצד טיוטות אחיות עבור LFM2.5-1.2B-Instruct ו-LFM2.5-2.6B, כל אחת בפורמטים Safetensors ו-GGUF, עם תמיכה מהיום הראשון ב-SGLang וב-llama.cpp.
LFM2.5-2.6B-Base (שוחרר ב-4 באוגוסט 2026) הוא הקצה השני של הצינור: מודל יסוד עם 2.69B פרמטרים במבנה היברידי של 30 שכבות — 22 בלוקי קונבולוציה קצרה עם שער כפול ועוד 8 בלוקי קשב מקובץ-קבוצות — מאומן מראש על כ־34 טריליון טוקנים, עם שלב אימון ביניים שמרחיב את ההקשר ל־128K. אין לו תבנית צ'אט, אין כוונון הוראות, ואין אמות מידה שפורסמו, וכרטיס המודל של Liquid עצמו ממליץ עליו רק לכוונון עדין מקיף. כל מטרתו היא לשמש חומר גלם שצינור פוסט-אימון בן ארבעה שלבים — שני סבבי SFT, התמחות מורה, זיקוק על-פי מדיניות, ולאחר מכן למידת חיזוק אייג'נטית — הופך לסוכן קריאת הכלים LFM2.5-2.6B. אותה משפחה, אותו רישיון, אותו דף הורדה. עבודות שונות לחלוטין.
זה לצד זה: שבעה ממדים, שתי עבודות
מכיוון ששני המחסומים משרתים תפקידים שונים, ההשוואה הכנה משאירה את תפקידיהם של שני הצדדים ברורים:
• מה זה — LFM2.5-8B-A1B-DSpark הוא מודל טיוטה לפענוח ספקולטיבי בגודל 0.3B; LFM2.5-2.6B-Base הוא מודל בסיס גולמי מאומן מראש בגודל 2.69B.
• עם מה הוא רץ — דראפט ה-DSpark משתלב עם ה-LFM2.5-8B-A1B MoE (8.3B סה"כ, ~1.5B פעיל לכל טוקן); ה-Base רץ לבדו, אבל רק כניבוי טקסט לא מכוונן.
• שימוש עצמאי — DSpark לא מייצר דבר בעצמו; הוא רק מאיץ מטרה. Base מייצר טקסט, אבל אין התנהגות מוצר שימושית — ללא מענה להוראות, ללא קריאה לכלים, ללא תבנית צ'אט.
• איכות הפלט — DSpark יורשת את הפלט הגרידי המדויק של היעד, מכיוון שכל טוקן מוצע מאומת; ל-Base יש אפס אמות מידה שפורסמו על כל משימה, במכוון.
• מהירות — DSpark מוסיף ליעד שלו ממוצע שנמדד על ידי היצרן של פי 2.54 על H100 (עד פי 3.18 על MATH500) ופי 1.18 על M4 Max, שלא שוחזר; ל-Base אין שום טענת מהירות הסקה.
• טביעת רגל בזיכרון — DSpark מוסיף כ-0.3GB של משקלי דראפט לצד היעד; Base הוא ה-2.69B המלא, רץ מתחת ל-2.5GB, הבסיס הרציני הקטן ביותר במשפחה.
{{1}}פורמטים וזמינות{{/1}} — {{2}}DSpark מגיע בפורמטים Safetensors ו-GGUF עם תמיכה ב-SGLang וב-llama.cpp מהיום הראשון{{/2}}; {{3}}Base מגיע בפורמטים Safetensors, GGUF, ONNX ו-MLX ופועל על Transformers, vLLM, SGLang, llama.cpp ו-MLX{{/3}}. {{4}}אף אחד משניהם אינו מסופק כיום על ידי ספק inference — שניהם checkpoints באירוח עצמי{{/4}}.

המספרים היחידים בהתמודדות הזו הגיעו ממעבדה אחת.
כל מה שכמותי כאן הוא מדידה של ספק יחיד, שנעשתה ביום פרסום הטיוטה וטרם שוחזרה באופן בלתי תלוי — יש לקרוא את זה כמבטיח, לא כמאומת. Liquid מדדה את LFM2.5-8B-A1B-DSpark בגודל אצווה 1, בטמפרטורה 0, על H100 יחיד של 80GB ב-BF16 תחת SGLang ועל MacBook Pro עם M4 Max ב-FP16 GGUF תחת הקרנלים הניסיוניים של Metal ב-llama.cpp. על ה-H100 הצמד השיג בממוצע 2.54× (418 → 1,074 אסימונים לשנייה), עם תוצאה בודדת טובה ביותר של 3.18× על MATH500 (428 → 1,362 tok/s) ושיעור קבלה ממוצע של כ-7 מתוך 10 אסימונים מוצעים. על ה-M4 Max אותו צמד השיג בממוצע רק 1.18× (90 → 106 tok/s) — מקרה הקצה על-גבי המכשיר ש-Liquid עצמה סימנה, משום שאימות בלוק מפעיל יותר מומחים בקצה האחורי הנוכחי של MoE ב-Metal ומעביר יותר תעבורת משקולות על פני אפיק הזיכרון.
בצד הבסיסי של התמודדות זו אין מספרים כלל, והעדר זה הוא עצמו המפרט. LFM2.5-2.6B-Base אומן מראש, לא עבר אימון משלים; הוא מעולם לא הוערך לשיחות, שימוש בכלים או התנהגות סוכן, משום שאיש לא התכוון שישמש כך. הנתונים המשמעותיים שלו הם ארכיטקטוניים: 2.69B פרמטרים, הקשר של 128K, טוקנייזר ל-16 שפות, פחות מ-2.5GB להרצה. אין מבצעים אמת מידה לבסיס; מבצעים אמת מידה למה שמכווננים אותו אליו.
יש אירוניה משפחתית אחת שכדאי להזכיר לפני שמחליטים משהו. הטיוטה שהמאמר הזה עוסק בה — זו של 8B-A1B — היא דווקא זו שמשיגה את השיפור הקטן ביותר על מחשב נייד (1.18×), בעוד שטיוטת האחות למשפחת ה‑2.6B, שמאיצה את האחות הפוסט‑מאומנת של אותו Base ממש, מגיעה לממוצע של 2.27× על M4 Max עם קיצוץ של 57% בהשהיית קריאות פונקציה מרובות כלים. אם המכשיר המדובר הוא טלפון או מחשב נייד ולא מארז GPU, סיפור המהירות נמצא בנתיב של ה‑2.6B.

אז איזה מהם אתה מוריד?
אתה אף פעם לא צריך לבחור ישירות בין השניים, כי הם לא חלופות — אבל אתה כן צריך לדעת באיזו עבודה אתה נמצא:
אם אתה משרת את LFM2.5-8B-A1B על GPUs שבבעלותך ורוצה יותר טוקנים לשנייה מאותה חומרה, ה-LFM2.5-8B-A1B-DSpark הוא תוסף הפיך: בנה את SGLang או llama.cpp עם האינטגרציות של DSpark מ-20 באוגוסט, ציין את ה-draft בפקודת ההשקה, שמור על פענוח חמדן (greedy decoding), וגודל הבלוק נקרא אוטומטית מהקונפיג של ה-draft. היתרון הוא בערך תפוקה גבוהה פי 2.5 ללא כל שינוי בפלטים; החיסרון הוא 0.3GB של משקלים נוספים ו-build חדש מספיק כדי להכיל את ה-PRs. הסר את שני הדגלים הספקולטיביים ותחזור ל-target הרגיל.
אם אתה רוצה לבנות מומחה משלך — מודל תחומי, עוזר בשפה מותאמת אישית, כיוונון עדין על נתונים קנייניים — ה־LFM2.5-2.6B-Base הוא אחת מנקודות הפתיחה הרציניות הזולות ביותר במערכת המשקלים הפתוחה: 2.6B, פחות מ־2.5GB, הקשר של 128K, טוקנייזר רב־לשוני. הצ'קפוינט של DSpark לא יכול לעזור לך בזה כלל, כי הוא אינו base.
אם אתה באמת רוצה את הסוכן המותאם למכשיר של Liquid — קריאות לכלים, משימות מרובות שלבים — אז אתה לא רוצה אף אחד משני אלה. אתה רוצה את LFM2.5-2.6B שעבר אימון המשך, ואתה יכול להחליט לאחר מכן אם לחבר אליו את ה-draft שלו. ה-Base הוא חומר גלם לאנשים שרוצים לאמן; ה-draft 8B-A1B הוא רכיב מהירות לאנשים שכבר פורסים את ה-MoE. הצעד הלא נכון הוא להוריד את ה-Base כי רצית סוכן מהיר יותר, או את ה-draft כי רצית בסיס לאימון.

היכן שהשניים מתחברים — והיכן שהנתב משתלב
שני ה-checkpoints הם סיפורי אירוח עצמי. ה-draft הוא אביזר של שכבת השרת שקיים רק בתוך מחסנית SGLang או llama.cpp שלך; ה-Base הוא תוצר אימון. אף אחד מהם לא מופיע בקטלוג מתארח, ולאף אחד מהם אין מחירון לפי טוקן. מה שזה אומר בפועל הוא שכל אחד מהמסלולים האלה יושב בסופו של דבר לצד המודלים המתארחים שאתה כבר קורא להם — והשילוב הזה הוא בדיוק התשתית ששכבת ניתוב קיימת כדי לצמצם.
בצד השרת, הכלכלה של הטיוטה פשוטה ואמיתית: פי 2.5 יותר טוקנים לשנייה מאותו GPU משמעותם פי 2.5 פחות זמן ובערך פי 2.5 פחות GPU עבור אותה עומסה, ללא שינוי באיכות. אבל המנוף הזה קיים רק אם אתה הבעלים של ההסקה. ברגע שאתה קורא ל-8B-A1B דרך API, הספק שומר לעצמו את ההאצה – וזה המקום שבו ההשוואה בצד ה-API הופכת להיות החשובה: מה ספק גובה, והאם הפחתת מחיר מגיעה אליך באותו יום שבו היא הוכרזה. זו התכלית של ראוטר מעביר: API אחד ליותר מ-200 מודלים, מחירי המחירון של הספקים מועברים ב-0% תוספת, כך שהנחת ספק פעילה אצלך מיד, וגיבוי אוטומטי (failover) כך שקפיצת חביון של ספק בודד לא הופכת לחביון שלך. אתה יכול גם לחבר את ערימת ה-LFM שאתה מארח בעצמך דרך אותה נקודת קצה, וכך לנסות מודל טיוטה חדש לגמרי מול תנועה אמיתית בלי לסכן מסלול ייצור עליו.
LFM2.5-8B-A1B-DSpark ו-LFM2.5-2.6B-Base חולקים שם משפחה ותפקידים הפוכים: אחד הוא רכיב האצה המחובר ל-MoE הקצה, השני הוא המוח הבלתי-מכוונן שממנו מתפתח הסוכן 2.6B. אף אחד מהם אינו פועל לבדו. בחר בדראפטר כדי להאיץ MoE שאתה כבר משרת על GPUs, בחר ב-Base כדי לכוונן מודל בסיס של 2.6B למשהו משלך, ודלג על שניהם אם מה שרצית היה סוכן מתפקד — כי הדבר היחיד המשותף לשני ה-checkpoints הוא שאף אחד מהם, בפני עצמו, אינו עושה שום דבר שמיש.
שאלות נפוצות
האם אני יכול להריץ את LFM2.5-8B-A1B-DSpark לבד?
לא. זהו מודל טיוטה ללא פלט עצמאי — הוא מציע טוקנים מועמדים שהיעד LFM2.5-8B-A1B מאמת לאחר מכן, ולכן הוא קיים רק בתוך ערמת שרת לפענוח ספקולטיבי הבנויה על האינטגרציות של SGLang או llama.cpp מתאריך 20 באוגוסט. הורדה שלו לבד לא נותנת לך שום דבר שתוכל לשאול.
האם LFM2.5-2.6B-Base הוא ה-checkpoint שפועל על המכשיר כסוכן?
לא כמו שהוא. ה-Base הוא התשתית הגולמית המאומנת מראש, ללא כוונון הוראות וללא תבנית צ'אט. המודל שפועל כסוכן המקומי של Liquid הוא LFM2.5-2.6B שעבר אימון מאוחר, אשר מופק מה-Base בתהליך האימון המאוחר בן ארבעת השלבים — ואם רוצים אותו מהיר יותר, הוא משויך לטיוטת LFM2.5-2.6B-DSpark.
