
LFM2.5-8B-A1B-DSpark מול Qwen3-8B: הדראפט שמאיץ מודל, מול ה-8B שכולם כבר מריצים
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
Liquid AI שחררה את ה-draft checkpoint של LFM2.5-8B-A1B-DSpark ב-20 באוגוסט 2026 — עזר פענוח ספקולטיבי עם 327.7M פרמטרים שגורם ל-edge MoE של LFM2.5-8B-A1B לייצר מהר פי 3.18 על H100 בודד. לפני שההשוואה הזו יכולה להיות כנה, עובדה אחת חייבת להיות מונחת על השולחן: ה-checkpoint של DSpark אינו מודל שאפשר לקרוא לו. הוא רק מאיץ מודל אחר. אז שאלת הפריסה האמיתית שהשחרור הזה מזין היא זו שרוב הצוותים שוקלים כל השנה — LFM2.5-8B-A1B או Qwen3-8B, שני מודלים עם משקלים פתוחים מסוג 8B ברגעים שונים מאוד בחייהם.
המסגור חשוב כאן יותר מהרגיל, כי שני הצדדים אינם מאותו סוג. Qwen3-8B הוא מודל שלם וניתן לפריסה, שתוכלו לארח בעצמכם או לרכוש עבורו אסימונים כבר היום. גם LFM2.5-8B-A1B הוא מודל שלם וניתן לפריסה — טיוטת DSpark היא תוספת לו, לא גרסה שלו. כל מה שהטיוטה מבטיחה נמדד על ידי הספק והוא בן יום אחד; כל מה שקשור למאגרי הקוד ולפורמטים פשוט שם כדי לבדוק. המאמר הזה שומר על שתי הקטגוריות האלה נפרדות.
ראשית, המילה "DSpark" אינה שם העצם במשפט הזה.
דיקוד ספקולטיבי מריץ מודל טיוטה זול לפני המודל האמיתי: מודל הטיוטה מנחש את קומץ הטוקנים הבא, מודל המטרה מאמת את כל הבלוק במעבר קדימה יחיד, ושומר על מה שהוא מסכים לגביו. כשהניחושים טובים, מתקדמים בכמה טוקנים במחיר של מעבר טעינת משקולות אחד, כך שהתפוקה עולה מבלי לגעת במשקולות של מודל המטרה — ומכיוון שמודל המטרה בודק כל טוקן שמוצע, הפלט תחת דיקוד חמדן זהה להרצת LFM2.5-8B-A1B לבדו. Liquid קוראת לזה "ללא אובדן מעצם הבנייה", וזו הסיבה כולה שבגללה בטוח לחבר מודל טיוטה.
ה-LFM2.5-8B-A1B-DSpark של Liquid הוא דראפטר (drafter) קטן במכוון: חמש שכבות attention בלבד, בלוק של תשעה טוקנים מוצעים לכל צעד, וראש מרקוב (Markov head) על אוצר המילים בן 128,000 הטוקנים של המטרה, שאומן במשך 15 עידנים על תערובת של נתוני צ'אט, קוד וקריאות פונקציות, עם נקודות ביקורת שנבחרו לפי שיעור קבלה (acceptance rate) ולא לפי loss. זהו אחד משלושת הדראפטים שהספק שחרר באותו יום, לצד LFM2.5-1.2B-Instruct ו-LFM2.5-2.6B, כל אחד בפורמטים Safetensors ו-GGUF עם תמיכה ב-SGLang וב-llama.cpp מהיום הראשון. בנוסף, וזה חשוב לכל מי שקורא השוואה עם מודל ברמה של 8B: הוא אינו מוגש על ידי אף ספק Inference ואין לו מחיר לטוקן. הוא מתקיים רק בתוך מחסנית ה-speculative-decoding שלך.

שני המודלים שנפרסים בפועל
הפשט את הטיוטה וההשוואה האמיתית היא בין המודל שהיא מאיצה לבין המודל המכהן. שניהם בעלי משקלים פתוחים ובקירוב בסדר גודל 8B, ושם מסתיים הדמיון:
• ארכיטקטורה — LFM2.5-8B-A1B הוא מודל MoE דליל (Sparse) עם 8.3B פרמטרים בסך הכול, אך רק ~1.5B פעילים בכל טוקן; Qwen3-8B הוא מודל צפוף (Dense) עם 8.2B פרמטרים שמפעיל את כל הפרמטרים בכל טוקן.
• שחרור — LFM2.5-8B-A1B שוחרר ב-28 במאי 2026; Qwen3-8B שוחרר באפריל 2025, בן יותר משנה, וכבר מוגדר כמיושן בחלק מפלטפורמות ההגשה.
• הקשר — LFM2.5-8B-A1B מציע הקשר מקורי של 128K עם אוצר מילים של 128K טוקנים; Qwen3-8B מציע 32K מקורי, הניתן להרחבה לכ-128K באמצעות YaRN.
• Reasoning — LFM2.5-8B-A1B הוא מודל חשיבה המפיק שרשרת חשיבה מפורשת; Qwen3-8B עובר בין מצבי חשיבה ומצבים שאינם חשיבה לפי בקשה.
• אינטליגנציה — לפי Artificial Analysis, LFM2.5-8B-A1B מקבל מדד אינטליגנציה של 8 ו-Qwen3-8B מקבל 8–8.3, שניהם מתחת לחציון של 9 עבור מודלים דומים בעלי משקל פתוח; אף אחד מהם אינו מוח חזיתי, ושניהם כנים בעניין זה.
• מהירות — לפי Artificial Analysis, LFM2.5-8B-A1B מייצר בערך 340 טוקנים לשנייה על פני ספקים; Qwen3-8B עומד על כ-37–40 טוקנים לשנייה, בין האיטיים ביותר בקטגוריה שלו.
• רישיון — LFM2.5-8B-A1B כפוף ל-LFM Open License v1.0 של Liquid; Qwen3-8B תחת Apache-2.0.

המהירות היא הנקודה שבה זה מפסיק להיות צמוד.
הסיבה הגדולה ביותר לכך שהשיחה על מודלים פתוחים במחלקת 8B התקדמה היא מהירות ליחידת זיכרון. Qwen3-8B הוא מודל דחוס: כל טוקן שהוא מייצר מזרים את כל 8.2B המשקלים על פני אפיק הזיכרון, וזו הסיבה שהוא איטי ביחס לגודלו ולמה הוא צריך VRAM אמיתי. LFM2.5-8B-A1B מנתב כל טוקן דרך כ-1.5B פרמטרים פעילים, שזו כל נקודת העיצוב — MoE על-המכשיר שנשאר מהיר וקטן. הטענות של Liquid עצמה מרחיקות לכת: בערך 253 טוקנים בשנייה על מעבד M5 Max עם פחות מ-6GB זיכרון, לפי דיווח היצרן. בתפוקה גולמית עבור המודל הניתן לפריסה, הטיוטה אפילו לא משנה בחלק הזה של הסיפור — ה-MoE כבר מהיר פי כמה מהמודל הדחוס 8B לפני שמוסיפים ספקולציה.
בעניין המחיר, לשניהם משקלים פתוחים, כך שהאירוח העצמי של כל אחד עולה בדיוק מה שעולה החומרה שלך. השוואת אפשרויות האירוח המנוהל היא חד־צדדית בזמינות: Qwen3-8B מוגש דרך ה־API של אליבאבא במחיר מחירון של $0.18 למיליון טוקני קלט ו־$2.10 למיליון טוקני פלט, ובנוסף על ידי מגוון רחב של מארחי מודלים פתוחים מצד שלישי; ל־LFM2.5-8B-A1B אין תמחור טוקנים מנוהל של הצד הראשון שראוי לציון, ול־draft אין כזה כלל. מה שאומר שהדרך המעשית שבה רוב הצוותים יריצו היום את ה־edge MoE של Liquid היא אירוח עצמי, על מחשב נייד, קופסת קצה (edge box), או GPU שבבעלותם — וזו בדיוק התצורה שבה ה־DSpark draft הופך למשתנה הרלוונטי.
מה הטיוטה בעצם משנה לגבי החלטה זו
הטיוטה משנה ציר אחד בלבד: כמה מהר LFM2.5-8B-A1B מייצר טוקנים במחסנית הגשה שבשליטתך. היא אינה הופכת את המודל לחכם יותר, ואינה משנה את מה שהוא משיב — הפלט הגרידי זהה ביט-לביט למודל היעד לבדו. המקום שבו היא עוזרת הוא הגשת GPU בתפוקת בקשה בודדת: Liquid מדדה ממוצע של 2.54× על H100 יחיד על פני חמישה בנצ'מרקים (418 → 1,074 טוקנים לשנייה), עם שיא של 3.18× על MATH500, בגודל אצווה 1 וטמפרטורה 0. המקום שבו היא בקושי עוזרת הוא Apple silicon: אותו מודל השיג בממוצע רק 1.18× על M4 Max (90 → 106 tok/s), משום שאימות בלוק של טוקני טיוטה מפעיל יותר מומחים בבקאנד Metal MoE הנוכחי של llama.cpp ומעביר יותר תעבורת משקלים — בדיוק העלות שפענוח ספקולטיבי נועד לקזז. כל אלה נתוני ספק מיום ההשקה, שלא שוכפלו באופן בלתי תלוי.
החלוקה הזו מתמפה ישירות לכלל החלטה. אם אתה משרת את LFM2.5-8B-A1B על GPU שבבעלותך, ה-draft הוא מנוף עלות אמיתי — בערך פי 2.5 יותר טוקנים בשנייה מאותו סיליקון, עם אפס שינוי בפלט, ואתה צריך רק build עם האינטגרציות של DSpark מ-20 באוגוסט. אם אתה קורא למודל דרך API במקום, הספק שומר על ההאצה וה-draft לא רלוונטי עבורך. ואם המכשיר הוא מחשב נייד או טלפון, ה-draft עבור המודל המסוים הזה קרוב ללא-פעולה כיום; ה-drafts האחיים עבור המודלים הצפופים LFM2.5-1.2B-Instruct ו-LFM2.5-2.6B הם אלה עם ההישגים על-המכשיר, בפי 2.54 ופי 2.27 בהתאמה. Qwen3-8B, מצדו, לא צריך draft כלל — הוא פשוט מודל איטי יותר וצפוף יותר שאינו דורש פענוח ספקולטיבי כדי להיות פריס.

הבחירה, שנה לחייו של Qwen3-8B
Qwen3-8B הוא ברירת המחדל המשעממת והנכונה: בוגר, Apache-2.0, 119 שפות, מצבי חשיבה וחוסר חשיבה, זמין בכל מקום, ועדיין כללי מצוין לצ'אט, קוד וטקסט מובנה. הבעיות שלו הן גיל ומהירות — 8B צפוף בן 16 חודשים שאיטי ביחס למעמדו וכבר הוצא משימוש בחלק מהפלטפורמות, וזהו אות תחזוקה ראוי להתייחסות אם אתה מקים פרויקט חדש היום.
LFM2.5-8B-A1B הוא ההימור החדש והצר יותר: {{1}}MoE ממוקד-קצה שנבנה לקריאות לכלים ולביצוע הוראות במהירות על חומרה צרכנית{{/1}}, עם מודל ה-Draft של DSpark כהאצת שרת אופציונלית לתרחיש האירוח העצמי על GPU. הוא לא מודל חכם יותר — {{2}}שניהם נמצאים מתחת לחציון של מודלי המשקלים הפתוחים ב-Artificial Analysis{{/2}} — אבל הוא מהיר באופן דרמטי בשבריר מהזיכרון לכל טוקון, {{3}}וזו הפשרה שחשובה לסוכנים על-גבי המכשיר{{/3}}. ההסתייגויות שלו הן תמונת ראי של אלה של Qwen3-8B: {{4}}שחרור צעיר יותר, ללא תמחור אירוח מצד הספק עצמו, וסיפור פענוח ספקולטיבי (Speculative Decoding) שהמספרים שלו טרם שוחזרו על-ידי איש מחוץ לספק{{/4}}.
שכבת הניתוב הבסיסית נשארת זהה בכל מקרה. לא LFM2.5-8B-A1B ולא Qwen3-8B נמצאים כיום בקטלוג המתארח של OrcaRouter, ולכן המסגור הכנה הוא מה שראוטר עושה עבור התמהיל: API אחד על פני 200+ מודלים מתארחים, כשמחירי המחירון של הספק מועברים ב-0% תוספת, כך שהנחת מחיר של ספק פעילה בפלטפורמה באותו היום שבו היא מוכרזת; מעבר אוטומטי (failover), כך שמודל חדש שלא הוכח הוא משהו שבודקים מול תעבורה אמיתית במקום משהו שמהמרים עליו בנתיב ייצור; ו-DSL לניתוב שיכול לשמש ממשק קדמי למודל שאתה משרת בעצמך, וכך ערימת LFM2.5-8B-A1B באחסון עצמי מתקיימת לצד נקודות קצה מתארחות מאחורי מפתח אחד.
אם אתם בונים למחשב נייד או לקופסת קצה ואכפת לכם ממהירות קריאה לכלים, LFM2.5-8B-A1B הוא הכיוון שכדאי לבדוק, והטיוטה נותנת 2.5× בחינם בנתיב הגשת ה-GPU כשהזמן יגיע. אם אתם רוצים מודל כללי שלא צריך לחשוב עליו, Qwen3-8B עדיין עובד — רק דעו שמדובר במודל מתחילת 2025 שהמערכת האקולוגית מתחילה להחליף. הדבר היחיד שאף לא הטיוטה ולא היעד משנים הוא מצב הראיות הכנות: כל מה שמהיר במהדורת DSpark הוא מדידה של ספק יחיד מיום יחיד, ומדדי ביצוע עצמאיים הם הנושא הפתוח שמכריע כמה מזה אתם באמת סומכים עליו.
