כרטיס כותרת ראשי עבור LFM2.5-2.6B-DSpark, מודל הטיוטה לפענוח ספקולטיבי בגודל 328M של Liquid AI, שיצא ב-20 באוגוסט 2026, עם כותרת המשנה 'The 328M drafter that makes Liquid's on-device agent run 2.3x faster', תרשים של שבב קטן 'Draft 328M' השולח שורה של שבבי טוקנים לתוך תיבה גדולה יותר 'LFM2.5-2.6B verifies', מד מהירות ואייקון טלפון המרמזים על מהירות על-המכשיר, ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

LFM2.5-2.6B-DSpark: דראפטר ה-328M שגורם לסוכן העל-מכשיר של Liquid לרוץ מהר פי 2.3×

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אף אחד מחוץ ל-Liquid AI לא הריץ את LFM2.5-2.6B-DSpark על החומרה שלו ופרסם מספר עדיין. זו נקודת ההתחלה הכנה עם המודל הזה, כי כל העניין הוא טענת ביצועים: זה לא 2.6B טוב יותר, אלא מודל דראפט עם 328M פרמטרים שיושב מול המודל הסוכני LFM2.5-2.6B ומציע לו טוקנים לאימות, כך שהסוכן רץ בערך פי שניים מהר יותר בלי לשנות את הפלט שלו.

שוחרר ב־20 באוגוסט 2026 עם תיאור טכני ב־Hugging Face ופוסט נלווה בבלוג של Liquid עצמה. LFM2.5-2.6B-DSpark הוא ספינת הדגל של משפחה קטנה של צ'קפוינטים לדראפטר פענוח ספקולטיבי ש־Liquid פרסמה באותו היום. כל מה שבעמודת המהירות להלן נמדד על ידי הספק וטרם אושר באופן בלתי תלוי; כל מה שבמאגר הקוד, הפורמטים ותמיכת המסגרת פשוט שם כדי לעבור בדיקה.

מה זה DSpark, בנשימה אחת

דיקוד ספקולטיבי הוא הטריק של הרצת מודל טיוטה זול לפני המודל האמיתי: מודל הטיוטה מנחש את קומץ הטוקנים הבא, מודל המטרה בודק את כל האצווה במעבר קדימה יחיד, ושומר על הטוקנים שהוא מסכים איתם. כשהניחושים נכונים, מתקדמים כמה טוקנים במחיר של אחד, כך שקצב התפוקה עולה מבלי לגעת במשקלים של מודל המטרה. DSpark — הטכניקה שהוצעה במקור על ידי חוקרי DeepSeek ביולי 2026 וכבר מוטמעת ב-DeepSeek-V4 — היא גרסה של הטריק הזה המכוונת למודלים קטנים הפועלים על המכשיר. Liquid מכנה זאת דיקוד ספקולטיבי עם תזמון ביטחון (confidence-scheduled speculative decoding), ויש לו שלושה חלקים נעים: שלד מקבילי שמפיק מצבים חבויים עבור כל טוקני הטיוטה במעבר אחד, ראש סדרתי קל משקל שממפה תלות בין טוקנים שכנים כדי ששיעור הקבלה לא יקרוס לקראת סוף הבלוק, ומאמת שגוזם סיומות עם ביטחון נמוך כשבדיקתן עולה יותר ממה שהיא חוסכת.

A diagram titled 'How DSpark decodes in one pass': a small box labeled 'Draft model - 328M, 5 layers' on the left with an arrow '9 draft tokens proposed' pointing to a larger box labeled 'Target LFM2.5-2.6B verifies in one pass' in the center, an output arrow labeled '~4.8 tokens accepted on average', and a note card reading 'Greedy output is identical to the target alone'.

החלק האחרון הזה הוא מה שגורם ל-DSpark להרגיש שונה ממנסח פשוט: הוא לא תמיד דוחף בלוק שלם דרך אימות. כאשר הביטחון העצמי של הטיוטה אומר שסיומת לא צפויה להתקבל, הוא מקצר את הבלוק וחוסך את החישוב המבוזבז. בלוק הטיוטה הוא תשעה טוקנים, כך שהמטרה מאמתת עד עשרה בכל פעם.

המנסח, לפי המספרים

ה-checkpoint LFM2.5-2.6B-DSpark הוא מודל דראפט קטן של 0.3B פרמטרים, המבוסס על attention בלבד: חמש שכבות attention מלאות (גודל מוסתר 2,048, grouped-query attention עם 32 ראשים ו-8 ראשי key-value), אוצר מילים של 128K טוקנים, ראש Markov עם דרגה 256, וראש ביטחון (confidence). Liquid אימנה אותו במשך 15 תקופות (epochs) על תערובת של נתוני הוראות, שיחות, קוד וקריאות פונקציות — על חומרה של AMD — ובחרה את התקופה לפי שיעור הקבלה הגבוה ביותר ולא לפי ה-loss הנמוך ביותר.

שיעור הקבלה הזה {{1}}הוא המספר שקובע כמה שווה הדרפטר{{/1}}. {{3}}בחמישה benchmarks, עם batch size 1 וטמפרטורה 0,{{/3}} {{4}}LFM2.5-2.6B-DSpark השיג בממוצע 4.83 tokens מקובלים לכל צעד decoding על H100 ו-4.42 על M4 Max{{/4}} — {{5}}בערך חצי מהבלוק התקבל,{{/5}} {{6}}וזה המקור להאצה של פי שניים{{/6}}.

ההאצות, המתויגות

כל הנתונים הבאים מגיעים מהמדידה של Liquid AI עצמה — SGLang על H100 80GB יחיד ב-BF16, ו-llama.cpp עם ה-backend של Metal על M4 Max MacBook Pro ב-FP16 GGUF, גודל אצווה 1, טמפרטורה 0 — ואף אחד מהם לא שוכפל על ידי גורם בלתי תלוי נכון לכתיבת שורות אלה:

H100 ממוצע — פי 2.67, מ-323 ל-864 אסימונים/שנייה. לפי מדד: MATH500 פי 3.06, HumanEval פי 2.56, MBPP פי 2.64, GSM8K פי 2.22, MT-Bench פי 2.87.

• ממוצע M4 Max — פי 2.27, מ-61 ל-139 אסימונים/שנייה. לפי מדד: MATH500 פי 2.25, HumanEval פי 2.63, MBPP פי 2.11, GSM8K פי 2.36, MT-Bench פי 1.99.

קריאת כלים {{1}}— בתרחישי קריאת פונקציות מרובי כלים, השהייה הממוצעת ירדה ב-57%{{/1}}.

• הקשר משפחתי — הדראפטר הגדול ביותר במשפחה, LFM2.5-8B-A1B-DSpark, הגיע עד 3.18× על H100, והדראפטר 1.2B עד 2.87× על M4 Max; המספרים של 2.6B לעיל הם באמצע הטווח.

A scoreboard titled 'LFM2.5-2.6B-DSpark - the scoreboard': H100 mean speedup 2.67x (323 to 864 tok/s), M4 Max mean speedup 2.27x (61 to 139 tok/s), multi-tool latency -57%, draft params 328M (0.3B), formats Safetensors + GGUF, served by providers none (self-host), with a footer reading 'All speed figures vendor-measured Aug 20 2026; not independently reproduced.'

שני דברים לגבי הנתונים האלה חשובים מעבר לממוצעים. ראשית, הם נמדדים בטמפרטורה 0 ובגודל אצווה 1 — התצורה המעודדת ספקולציה והתצורה שבה מרבית עבודת הסוכן האינטראקטיבית על-גבי המכשיר מתבצעת. גם שם הבטחת הזהות מתקיימת: פענוח ספקולטיבי מאמת כל טוקן מוצע, ולכן תחת פענוח חמדן הטקסט המופק הוא בדיוק מה שמודל המטרה היה מייצר לבדו. שנית, הפער מצטמצם ככל שהמקביליות עולה: על H100 בודד, Liquid מדווחת שהיתרון של DSpark מתכנס סביב גודל אצווה 128, כך שהדראפטר הוא יתרון חביון עבור עומסי עבודה אינטראקטיביים ועתירי-כלים, ולא פתרון קסם לתפוקה גולמית עבור שרת מנוצל עד תום.

מה מאומת, ומה לא

מאושר, במובן שהמאגר פומבי וניתן לבדיקה: הדראפטר מופץ כ-Safetensors (BF16) ו-GGUF; הוא מזווג עם LFM2.5-2.6B המאומן-בתוך-הזרם, לא עם גרסת הבסיס; תמיכה מיום הראשון נוספה במעלה הזרם ב-llama.cpp (עם ליבות Metal ניסיוניות) וב-SGLang; הוא מורשה תחת רישיון Liquid's LFM Open License v1.0; ו— חשוב לכל מי שמתכנן סביבו — כרטיס המודל מציין שאין אף ספק אינפרנס שמשרת אותו, כך שמדובר ברכיב שאתה מריץ בעצמך.

עדיין לא אושר: שההאצות משתחזרות על חומרה ותצורות אחרות (אף אחד מחוץ ל‑Liquid לא פרסם מדידה), כיצד הדראפטר מתנהג תחת דגימה במקום פענוח חמדן, והאם נתון השהיית קריאות הכלים של 57% מחזיק מעמד ברתמות סוכן אמיתיות מעבר לרתמת הבדיקה שבה השתמשה Liquid. אף אחת מאלה אינה האשמה — השחרור בן יום — אבל הן ההבדל בין מספר מבטיח למספר מאומת.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-DSpark, showing the description of the LFM2.5-DSpark speculative-decoding draft family, the target model LFM2.5-2.6B, 327.7M draft parameters, and the lfm1.0 license.

מריץ את זה

ב-SGLang אתה משתמש בגרסה עם תמיכה ב-DSpark, מפעיל את השרת מול מודל היעד, ומגדיר את הדראפטר: האלגוריתם הספקולטיבי הוא DSPARK, נתיב מודל הדראפט מצביע על LiquidAI/LFM2.5-2.6B-DSpark, וגודל הבלוק נקרא מתוך config.json של הדראפט. ב-llama.cpp אתה טוען את ה-GGUF של היעד עם ה-GGUF של הדראפט כמודל דראפט ומגדיר את סוג הספקולציה ל-draft-dspark, כאשר גודל הבלוק נקרא מהמטא-דאטה הצדדי. שתי האינטגרציות שולבו במאגר הראשי (upstream), כך שלא נדרשים פורקים — רק build חדש מספיק כדי להכיל אותן.

מתי כדאי להוסיף

LFM2.5-2.6B-DSpark מרוויח את כ-0.3GB של הזיכרון הנוסף שלו כשאתה בעצם פורס את הסוכן 2.6B במקום ש־Liquid תכננה אותו לחיות — על טלפון, מחשב נייד או תיבת קצה — עבור עומסי עבודה אינטראקטיביים או של קריאות כלים שמוגבלים על־ידי השהיה ורצים ב־greedy. זה בדיוק הפרופיל שבו נתון ה־2.27× במכשיר וקיצור של 57% בהשהיית קריאות הכלים עושים את העבודה. זה פחות מעניין אם אתה משרת באצווה גבוהה על שרת (ההאצה מתכנסת לכיוון 1×), או אם עומס העבודה שלך רץ בטמפרטורה מעל אפס, שם המספרים המדווחים מפסיקים לחול. ואם אתה על גרסת ה־8B-A1B של המשפחה, שים לב למקרה הקצה: ההאצה על־גבי המכשיר שלו היא רק כ־1.18× כיום, כי אימות טוקני טיוטה מפעיל יותר מומחים ב־backend של Metal ב־llama.cpp — Liquid מסמנת זאת כידוע.

שום דבר ב-DSpark לא משנה היכן רץ הסוכן 2.6B — זהו סיפור של אירוח עצמי מהתכנון, והוא יישב לצד המודלים המתארחים שכבר אתם קוראים אליהם. השילוב הזה של מנסח מקומי ותריסר נקודות קצה של API הוא בדיוק מסוג הצנרת ששכבת ניתוב קיימת כדי לחסל: מפתח API אחד על פני 200+ מודלים, מעבר אוטומטי (failover) כשספק מתדרדר, ומחירי הרשימה של הספקים מועברים ללא כל תוספת (0%), כך שהשוואת העלויות בין מקומי למתארח עבור סוכן מסוג 2.6B נותרת ברורה במקום לחיות בגיליון אלקטרוני.

הדרך הנכונה לקרוא את LFM2.5-2.6B-DSpark כיום היא כטענת מהירות מבטיחה, שנמדדה על ידי הספק, שעדיין לא אומתה באופן בלתי תלוי, המחוברת לנקודת ביקורת אמיתית, ניתנת להורדה וניתנת להרצה. אם אתה פורס את סוכן ה-2.6B על המכשיר, מודל הטיוטה זול לנסיון וקל להסרה — הוסף את שני דגלי הספקולציה לפקודת SGLang, שמור על פענוח חמדן, ומדוד מול עומס העבודה שלך לפני שתסמוך על ה-2.3×. הריפו נמצא שם; האימות הבלתי תלוי הוא הפריט הפתוח.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube