
LFM2.5-2.6B-DSpark: דראפטר ה-328M שגורם לסוכן העל-מכשיר של Liquid לרוץ מהר פי 2.3×
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
אף אחד מחוץ ל-Liquid AI לא הריץ את LFM2.5-2.6B-DSpark על החומרה שלו ופרסם מספר עדיין. זו נקודת ההתחלה הכנה עם המודל הזה, כי כל העניין הוא טענת ביצועים: זה לא 2.6B טוב יותר, אלא מודל דראפט עם 328M פרמטרים שיושב מול המודל הסוכני LFM2.5-2.6B ומציע לו טוקנים לאימות, כך שהסוכן רץ בערך פי שניים מהר יותר בלי לשנות את הפלט שלו.
שוחרר ב־20 באוגוסט 2026 עם תיאור טכני ב־Hugging Face ופוסט נלווה בבלוג של Liquid עצמה. LFM2.5-2.6B-DSpark הוא ספינת הדגל של משפחה קטנה של צ'קפוינטים לדראפטר פענוח ספקולטיבי ש־Liquid פרסמה באותו היום. כל מה שבעמודת המהירות להלן נמדד על ידי הספק וטרם אושר באופן בלתי תלוי; כל מה שבמאגר הקוד, הפורמטים ותמיכת המסגרת פשוט שם כדי לעבור בדיקה.
מה זה DSpark, בנשימה אחת
דיקוד ספקולטיבי הוא הטריק של הרצת מודל טיוטה זול לפני המודל האמיתי: מודל הטיוטה מנחש את קומץ הטוקנים הבא, מודל המטרה בודק את כל האצווה במעבר קדימה יחיד, ושומר על הטוקנים שהוא מסכים איתם. כשהניחושים נכונים, מתקדמים כמה טוקנים במחיר של אחד, כך שקצב התפוקה עולה מבלי לגעת במשקלים של מודל המטרה. DSpark — הטכניקה שהוצעה במקור על ידי חוקרי DeepSeek ביולי 2026 וכבר מוטמעת ב-DeepSeek-V4 — היא גרסה של הטריק הזה המכוונת למודלים קטנים הפועלים על המכשיר. Liquid מכנה זאת דיקוד ספקולטיבי עם תזמון ביטחון (confidence-scheduled speculative decoding), ויש לו שלושה חלקים נעים: שלד מקבילי שמפיק מצבים חבויים עבור כל טוקני הטיוטה במעבר אחד, ראש סדרתי קל משקל שממפה תלות בין טוקנים שכנים כדי ששיעור הקבלה לא יקרוס לקראת סוף הבלוק, ומאמת שגוזם סיומות עם ביטחון נמוך כשבדיקתן עולה יותר ממה שהיא חוסכת.

החלק האחרון הזה הוא מה שגורם ל-DSpark להרגיש שונה ממנסח פשוט: הוא לא תמיד דוחף בלוק שלם דרך אימות. כאשר הביטחון העצמי של הטיוטה אומר שסיומת לא צפויה להתקבל, הוא מקצר את הבלוק וחוסך את החישוב המבוזבז. בלוק הטיוטה הוא תשעה טוקנים, כך שהמטרה מאמתת עד עשרה בכל פעם.
המנסח, לפי המספרים
ה-checkpoint LFM2.5-2.6B-DSpark הוא מודל דראפט קטן של 0.3B פרמטרים, המבוסס על attention בלבד: חמש שכבות attention מלאות (גודל מוסתר 2,048, grouped-query attention עם 32 ראשים ו-8 ראשי key-value), אוצר מילים של 128K טוקנים, ראש Markov עם דרגה 256, וראש ביטחון (confidence). Liquid אימנה אותו במשך 15 תקופות (epochs) על תערובת של נתוני הוראות, שיחות, קוד וקריאות פונקציות — על חומרה של AMD — ובחרה את התקופה לפי שיעור הקבלה הגבוה ביותר ולא לפי ה-loss הנמוך ביותר.
שיעור הקבלה הזה {{1}}הוא המספר שקובע כמה שווה הדרפטר{{/1}}. {{3}}בחמישה benchmarks, עם batch size 1 וטמפרטורה 0,{{/3}} {{4}}LFM2.5-2.6B-DSpark השיג בממוצע 4.83 tokens מקובלים לכל צעד decoding על H100 ו-4.42 על M4 Max{{/4}} — {{5}}בערך חצי מהבלוק התקבל,{{/5}} {{6}}וזה המקור להאצה של פי שניים{{/6}}.
ההאצות, המתויגות
כל הנתונים הבאים מגיעים מהמדידה של Liquid AI עצמה — SGLang על H100 80GB יחיד ב-BF16, ו-llama.cpp עם ה-backend של Metal על M4 Max MacBook Pro ב-FP16 GGUF, גודל אצווה 1, טמפרטורה 0 — ואף אחד מהם לא שוכפל על ידי גורם בלתי תלוי נכון לכתיבת שורות אלה:
H100 ממוצע — פי 2.67, מ-323 ל-864 אסימונים/שנייה. לפי מדד: MATH500 פי 3.06, HumanEval פי 2.56, MBPP פי 2.64, GSM8K פי 2.22, MT-Bench פי 2.87.
• ממוצע M4 Max — פי 2.27, מ-61 ל-139 אסימונים/שנייה. לפי מדד: MATH500 פי 2.25, HumanEval פי 2.63, MBPP פי 2.11, GSM8K פי 2.36, MT-Bench פי 1.99.
קריאת כלים {{1}}— בתרחישי קריאת פונקציות מרובי כלים, השהייה הממוצעת ירדה ב-57%{{/1}}.
• הקשר משפחתי — הדראפטר הגדול ביותר במשפחה, LFM2.5-8B-A1B-DSpark, הגיע עד 3.18× על H100, והדראפטר 1.2B עד 2.87× על M4 Max; המספרים של 2.6B לעיל הם באמצע הטווח.

שני דברים לגבי הנתונים האלה חשובים מעבר לממוצעים. ראשית, הם נמדדים בטמפרטורה 0 ובגודל אצווה 1 — התצורה המעודדת ספקולציה והתצורה שבה מרבית עבודת הסוכן האינטראקטיבית על-גבי המכשיר מתבצעת. גם שם הבטחת הזהות מתקיימת: פענוח ספקולטיבי מאמת כל טוקן מוצע, ולכן תחת פענוח חמדן הטקסט המופק הוא בדיוק מה שמודל המטרה היה מייצר לבדו. שנית, הפער מצטמצם ככל שהמקביליות עולה: על H100 בודד, Liquid מדווחת שהיתרון של DSpark מתכנס סביב גודל אצווה 128, כך שהדראפטר הוא יתרון חביון עבור עומסי עבודה אינטראקטיביים ועתירי-כלים, ולא פתרון קסם לתפוקה גולמית עבור שרת מנוצל עד תום.
מה מאומת, ומה לא
מאושר, במובן שהמאגר פומבי וניתן לבדיקה: הדראפטר מופץ כ-Safetensors (BF16) ו-GGUF; הוא מזווג עם LFM2.5-2.6B המאומן-בתוך-הזרם, לא עם גרסת הבסיס; תמיכה מיום הראשון נוספה במעלה הזרם ב-llama.cpp (עם ליבות Metal ניסיוניות) וב-SGLang; הוא מורשה תחת רישיון Liquid's LFM Open License v1.0; ו— חשוב לכל מי שמתכנן סביבו — כרטיס המודל מציין שאין אף ספק אינפרנס שמשרת אותו, כך שמדובר ברכיב שאתה מריץ בעצמך.
עדיין לא אושר: שההאצות משתחזרות על חומרה ותצורות אחרות (אף אחד מחוץ ל‑Liquid לא פרסם מדידה), כיצד הדראפטר מתנהג תחת דגימה במקום פענוח חמדן, והאם נתון השהיית קריאות הכלים של 57% מחזיק מעמד ברתמות סוכן אמיתיות מעבר לרתמת הבדיקה שבה השתמשה Liquid. אף אחת מאלה אינה האשמה — השחרור בן יום — אבל הן ההבדל בין מספר מבטיח למספר מאומת.

מריץ את זה
ב-SGLang אתה משתמש בגרסה עם תמיכה ב-DSpark, מפעיל את השרת מול מודל היעד, ומגדיר את הדראפטר: האלגוריתם הספקולטיבי הוא DSPARK, נתיב מודל הדראפט מצביע על LiquidAI/LFM2.5-2.6B-DSpark, וגודל הבלוק נקרא מתוך config.json של הדראפט. ב-llama.cpp אתה טוען את ה-GGUF של היעד עם ה-GGUF של הדראפט כמודל דראפט ומגדיר את סוג הספקולציה ל-draft-dspark, כאשר גודל הבלוק נקרא מהמטא-דאטה הצדדי. שתי האינטגרציות שולבו במאגר הראשי (upstream), כך שלא נדרשים פורקים — רק build חדש מספיק כדי להכיל אותן.
מתי כדאי להוסיף
LFM2.5-2.6B-DSpark מרוויח את כ-0.3GB של הזיכרון הנוסף שלו כשאתה בעצם פורס את הסוכן 2.6B במקום ש־Liquid תכננה אותו לחיות — על טלפון, מחשב נייד או תיבת קצה — עבור עומסי עבודה אינטראקטיביים או של קריאות כלים שמוגבלים על־ידי השהיה ורצים ב־greedy. זה בדיוק הפרופיל שבו נתון ה־2.27× במכשיר וקיצור של 57% בהשהיית קריאות הכלים עושים את העבודה. זה פחות מעניין אם אתה משרת באצווה גבוהה על שרת (ההאצה מתכנסת לכיוון 1×), או אם עומס העבודה שלך רץ בטמפרטורה מעל אפס, שם המספרים המדווחים מפסיקים לחול. ואם אתה על גרסת ה־8B-A1B של המשפחה, שים לב למקרה הקצה: ההאצה על־גבי המכשיר שלו היא רק כ־1.18× כיום, כי אימות טוקני טיוטה מפעיל יותר מומחים ב־backend של Metal ב־llama.cpp — Liquid מסמנת זאת כידוע.
שום דבר ב-DSpark לא משנה היכן רץ הסוכן 2.6B — זהו סיפור של אירוח עצמי מהתכנון, והוא יישב לצד המודלים המתארחים שכבר אתם קוראים אליהם. השילוב הזה של מנסח מקומי ותריסר נקודות קצה של API הוא בדיוק מסוג הצנרת ששכבת ניתוב קיימת כדי לחסל: מפתח API אחד על פני 200+ מודלים, מעבר אוטומטי (failover) כשספק מתדרדר, ומחירי הרשימה של הספקים מועברים ללא כל תוספת (0%), כך שהשוואת העלויות בין מקומי למתארח עבור סוכן מסוג 2.6B נותרת ברורה במקום לחיות בגיליון אלקטרוני.
הדרך הנכונה לקרוא את LFM2.5-2.6B-DSpark כיום היא כטענת מהירות מבטיחה, שנמדדה על ידי הספק, שעדיין לא אומתה באופן בלתי תלוי, המחוברת לנקודת ביקורת אמיתית, ניתנת להורדה וניתנת להרצה. אם אתה פורס את סוכן ה-2.6B על המכשיר, מודל הטיוטה זול לנסיון וקל להסרה — הוסף את שני דגלי הספקולציה לפקודת SGLang, שמור על פענוח חמדן, ומדוד מול עומס העבודה שלך לפני שתסמוך על ה-2.3×. הריפו נמצא שם; האימות הבלתי תלוי הוא הפריט הפתוח.
