כרטיס כותרת ראשי להשוואת LFM2.5-8B-A1B-DSpark מול Qwen3-8B, עם כותרת משנה 'הטיוטה שמאיצה מודל, מול ה-8B שכולם כבר מריצים', המציג בצד שמאל תיבת 'טיוטה 327M' השולחת שבבי טוקנים אל כרטיס MoE 'LFM2.5-8B-A1B' בעל אריחים מוערמים, עם מחוג מד-מהירות גבוה תחת התווית 'פענוח ספקולטיבי', ובצד ימין כרטיס בועת צ'אט הנושא את השם 'Qwen3-8B' עם ניצוץ ואייקון שעון תחת התווית 'מודל גנרליסט', עם תג תאריך 'אוגוסט 2026' ולוגו OrcaRouter המורכב בפינה הימנית התחתונה.
Guides & Insights

LFM2.5-8B-A1B-DSpark מול Qwen3-8B: הדראפט שמאיץ מודל, מול ה-8B שכולם כבר מריצים

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Liquid AI שחררה את ה-draft checkpoint של LFM2.5-8B-A1B-DSpark ב-20 באוגוסט 2026 — עזר פענוח ספקולטיבי עם 327.7M פרמטרים שגורם ל-edge MoE של LFM2.5-8B-A1B לייצר מהר פי 3.18 על H100 בודד. לפני שההשוואה הזו יכולה להיות כנה, עובדה אחת חייבת להיות מונחת על השולחן: ה-checkpoint של DSpark אינו מודל שאפשר לקרוא לו. הוא רק מאיץ מודל אחר. אז שאלת הפריסה האמיתית שהשחרור הזה מזין היא זו שרוב הצוותים שוקלים כל השנה — LFM2.5-8B-A1B או Qwen3-8B, שני מודלים עם משקלים פתוחים מסוג 8B ברגעים שונים מאוד בחייהם.

המסגור חשוב כאן יותר מהרגיל, כי שני הצדדים אינם מאותו סוג. Qwen3-8B הוא מודל שלם וניתן לפריסה, שתוכלו לארח בעצמכם או לרכוש עבורו אסימונים כבר היום. גם LFM2.5-8B-A1B הוא מודל שלם וניתן לפריסה — טיוטת DSpark היא תוספת לו, לא גרסה שלו. כל מה שהטיוטה מבטיחה נמדד על ידי הספק והוא בן יום אחד; כל מה שקשור למאגרי הקוד ולפורמטים פשוט שם כדי לבדוק. המאמר הזה שומר על שתי הקטגוריות האלה נפרדות.

ראשית, המילה "DSpark" אינה שם העצם במשפט הזה.

דיקוד ספקולטיבי מריץ מודל טיוטה זול לפני המודל האמיתי: מודל הטיוטה מנחש את קומץ הטוקנים הבא, מודל המטרה מאמת את כל הבלוק במעבר קדימה יחיד, ושומר על מה שהוא מסכים לגביו. כשהניחושים טובים, מתקדמים בכמה טוקנים במחיר של מעבר טעינת משקולות אחד, כך שהתפוקה עולה מבלי לגעת במשקולות של מודל המטרה — ומכיוון שמודל המטרה בודק כל טוקן שמוצע, הפלט תחת דיקוד חמדן זהה להרצת LFM2.5-8B-A1B לבדו. Liquid קוראת לזה "ללא אובדן מעצם הבנייה", וזו הסיבה כולה שבגללה בטוח לחבר מודל טיוטה.

ה-LFM2.5-8B-A1B-DSpark של Liquid הוא דראפטר (drafter) קטן במכוון: חמש שכבות attention בלבד, בלוק של תשעה טוקנים מוצעים לכל צעד, וראש מרקוב (Markov head) על אוצר המילים בן 128,000 הטוקנים של המטרה, שאומן במשך 15 עידנים על תערובת של נתוני צ'אט, קוד וקריאות פונקציות, עם נקודות ביקורת שנבחרו לפי שיעור קבלה (acceptance rate) ולא לפי loss. זהו אחד משלושת הדראפטים שהספק שחרר באותו יום, לצד LFM2.5-1.2B-Instruct ו-LFM2.5-2.6B, כל אחד בפורמטים Safetensors ו-GGUF עם תמיכה ב-SGLang וב-llama.cpp מהיום הראשון. בנוסף, וזה חשוב לכל מי שקורא השוואה עם מודל ברמה של 8B: הוא אינו מוגש על ידי אף ספק Inference ואין לו מחיר לטוקן. הוא מתקיים רק בתוך מחסנית ה-speculative-decoding שלך.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

שני המודלים שנפרסים בפועל

הפשט את הטיוטה וההשוואה האמיתית היא בין המודל שהיא מאיצה לבין המודל המכהן. שניהם בעלי משקלים פתוחים ובקירוב בסדר גודל 8B, ושם מסתיים הדמיון:

• ארכיטקטורה — LFM2.5-8B-A1B הוא מודל MoE דליל (Sparse) עם 8.3B פרמטרים בסך הכול, אך רק ~1.5B פעילים בכל טוקן; Qwen3-8B הוא מודל צפוף (Dense) עם 8.2B פרמטרים שמפעיל את כל הפרמטרים בכל טוקן.

• שחרור — LFM2.5-8B-A1B שוחרר ב-28 במאי 2026; Qwen3-8B שוחרר באפריל 2025, בן יותר משנה, וכבר מוגדר כמיושן בחלק מפלטפורמות ההגשה.

• הקשר — LFM2.5-8B-A1B מציע הקשר מקורי של 128K עם אוצר מילים של 128K טוקנים; Qwen3-8B מציע 32K מקורי, הניתן להרחבה לכ-128K באמצעות YaRN.

• Reasoning — LFM2.5-8B-A1B הוא מודל חשיבה המפיק שרשרת חשיבה מפורשת; Qwen3-8B עובר בין מצבי חשיבה ומצבים שאינם חשיבה לפי בקשה.

• אינטליגנציה — לפי Artificial Analysis, LFM2.5-8B-A1B מקבל מדד אינטליגנציה של 8 ו-Qwen3-8B מקבל 8–8.3, שניהם מתחת לחציון של 9 עבור מודלים דומים בעלי משקל פתוח; אף אחד מהם אינו מוח חזיתי, ושניהם כנים בעניין זה.

• מהירות — לפי Artificial Analysis, LFM2.5-8B-A1B מייצר בערך 340 טוקנים לשנייה על פני ספקים; Qwen3-8B עומד על כ-37–40 טוקנים לשנייה, בין האיטיים ביותר בקטגוריה שלו.

• רישיון — LFM2.5-8B-A1B כפוף ל-LFM Open License v1.0 של Liquid; Qwen3-8B תחת Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

המהירות היא הנקודה שבה זה מפסיק להיות צמוד.

הסיבה הגדולה ביותר לכך שהשיחה על מודלים פתוחים במחלקת 8B התקדמה היא מהירות ליחידת זיכרון. Qwen3-8B הוא מודל דחוס: כל טוקן שהוא מייצר מזרים את כל 8.2B המשקלים על פני אפיק הזיכרון, וזו הסיבה שהוא איטי ביחס לגודלו ולמה הוא צריך VRAM אמיתי. LFM2.5-8B-A1B מנתב כל טוקן דרך כ-1.5B פרמטרים פעילים, שזו כל נקודת העיצוב — MoE על-המכשיר שנשאר מהיר וקטן. הטענות של Liquid עצמה מרחיקות לכת: בערך 253 טוקנים בשנייה על מעבד M5 Max עם פחות מ-6GB זיכרון, לפי דיווח היצרן. בתפוקה גולמית עבור המודל הניתן לפריסה, הטיוטה אפילו לא משנה בחלק הזה של הסיפור — ה-MoE כבר מהיר פי כמה מהמודל הדחוס 8B לפני שמוסיפים ספקולציה.

בעניין המחיר, לשניהם משקלים פתוחים, כך שהאירוח העצמי של כל אחד עולה בדיוק מה שעולה החומרה שלך. השוואת אפשרויות האירוח המנוהל היא חד־צדדית בזמינות: Qwen3-8B מוגש דרך ה־API של אליבאבא במחיר מחירון של $0.18 למיליון טוקני קלט ו־$2.10 למיליון טוקני פלט, ובנוסף על ידי מגוון רחב של מארחי מודלים פתוחים מצד שלישי; ל־LFM2.5-8B-A1B אין תמחור טוקנים מנוהל של הצד הראשון שראוי לציון, ול־draft אין כזה כלל. מה שאומר שהדרך המעשית שבה רוב הצוותים יריצו היום את ה־edge MoE של Liquid היא אירוח עצמי, על מחשב נייד, קופסת קצה (edge box), או GPU שבבעלותם — וזו בדיוק התצורה שבה ה־DSpark draft הופך למשתנה הרלוונטי.

מה הטיוטה בעצם משנה לגבי החלטה זו

הטיוטה משנה ציר אחד בלבד: כמה מהר LFM2.5-8B-A1B מייצר טוקנים במחסנית הגשה שבשליטתך. היא אינה הופכת את המודל לחכם יותר, ואינה משנה את מה שהוא משיב — הפלט הגרידי זהה ביט-לביט למודל היעד לבדו. המקום שבו היא עוזרת הוא הגשת GPU בתפוקת בקשה בודדת: Liquid מדדה ממוצע של 2.54× על H100 יחיד על פני חמישה בנצ'מרקים (418 → 1,074 טוקנים לשנייה), עם שיא של 3.18× על MATH500, בגודל אצווה 1 וטמפרטורה 0. המקום שבו היא בקושי עוזרת הוא Apple silicon: אותו מודל השיג בממוצע רק 1.18× על M4 Max (90 → 106 tok/s), משום שאימות בלוק של טוקני טיוטה מפעיל יותר מומחים בבקאנד Metal MoE הנוכחי של llama.cpp ומעביר יותר תעבורת משקלים — בדיוק העלות שפענוח ספקולטיבי נועד לקזז. כל אלה נתוני ספק מיום ההשקה, שלא שוכפלו באופן בלתי תלוי.

החלוקה הזו מתמפה ישירות לכלל החלטה. אם אתה משרת את LFM2.5-8B-A1B על GPU שבבעלותך, ה-draft הוא מנוף עלות אמיתי — בערך פי 2.5 יותר טוקנים בשנייה מאותו סיליקון, עם אפס שינוי בפלט, ואתה צריך רק build עם האינטגרציות של DSpark מ-20 באוגוסט. אם אתה קורא למודל דרך API במקום, הספק שומר על ההאצה וה-draft לא רלוונטי עבורך. ואם המכשיר הוא מחשב נייד או טלפון, ה-draft עבור המודל המסוים הזה קרוב ללא-פעולה כיום; ה-drafts האחיים עבור המודלים הצפופים LFM2.5-1.2B-Instruct ו-LFM2.5-2.6B הם אלה עם ההישגים על-המכשיר, בפי 2.54 ופי 2.27 בהתאמה. Qwen3-8B, מצדו, לא צריך draft כלל — הוא פשוט מודל איטי יותר וצפוף יותר שאינו דורש פענוח ספקולטיבי כדי להיות פריס.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

הבחירה, שנה לחייו של Qwen3-8B

Qwen3-8B הוא ברירת המחדל המשעממת והנכונה: בוגר, Apache-2.0, 119 שפות, מצבי חשיבה וחוסר חשיבה, זמין בכל מקום, ועדיין כללי מצוין לצ'אט, קוד וטקסט מובנה. הבעיות שלו הן גיל ומהירות — 8B צפוף בן 16 חודשים שאיטי ביחס למעמדו וכבר הוצא משימוש בחלק מהפלטפורמות, וזהו אות תחזוקה ראוי להתייחסות אם אתה מקים פרויקט חדש היום.

LFM2.5-8B-A1B הוא ההימור החדש והצר יותר: {{1}}MoE ממוקד-קצה שנבנה לקריאות לכלים ולביצוע הוראות במהירות על חומרה צרכנית{{/1}}, עם מודל ה-Draft של DSpark כהאצת שרת אופציונלית לתרחיש האירוח העצמי על GPU. הוא לא מודל חכם יותר — {{2}}שניהם נמצאים מתחת לחציון של מודלי המשקלים הפתוחים ב-Artificial Analysis{{/2}} — אבל הוא מהיר באופן דרמטי בשבריר מהזיכרון לכל טוקון, {{3}}וזו הפשרה שחשובה לסוכנים על-גבי המכשיר{{/3}}. ההסתייגויות שלו הן תמונת ראי של אלה של Qwen3-8B: {{4}}שחרור צעיר יותר, ללא תמחור אירוח מצד הספק עצמו, וסיפור פענוח ספקולטיבי (Speculative Decoding) שהמספרים שלו טרם שוחזרו על-ידי איש מחוץ לספק{{/4}}.

שכבת הניתוב הבסיסית נשארת זהה בכל מקרה. לא LFM2.5-8B-A1B ולא Qwen3-8B נמצאים כיום בקטלוג המתארח של OrcaRouter, ולכן המסגור הכנה הוא מה שראוטר עושה עבור התמהיל: API אחד על פני 200+ מודלים מתארחים, כשמחירי המחירון של הספק מועברים ב-0% תוספת, כך שהנחת מחיר של ספק פעילה בפלטפורמה באותו היום שבו היא מוכרזת; מעבר אוטומטי (failover), כך שמודל חדש שלא הוכח הוא משהו שבודקים מול תעבורה אמיתית במקום משהו שמהמרים עליו בנתיב ייצור; ו-DSL לניתוב שיכול לשמש ממשק קדמי למודל שאתה משרת בעצמך, וכך ערימת LFM2.5-8B-A1B באחסון עצמי מתקיימת לצד נקודות קצה מתארחות מאחורי מפתח אחד.

אם אתם בונים למחשב נייד או לקופסת קצה ואכפת לכם ממהירות קריאה לכלים, LFM2.5-8B-A1B הוא הכיוון שכדאי לבדוק, והטיוטה נותנת 2.5× בחינם בנתיב הגשת ה-GPU כשהזמן יגיע. אם אתם רוצים מודל כללי שלא צריך לחשוב עליו, Qwen3-8B עדיין עובד — רק דעו שמדובר במודל מתחילת 2025 שהמערכת האקולוגית מתחילה להחליף. הדבר היחיד שאף לא הטיוטה ולא היעד משנים הוא מצב הראיות הכנות: כל מה שמהיר במהדורת DSpark הוא מדידה של ספק יחיד מיום יחיד, ומדדי ביצוע עצמאיים הם הנושא הפתוח שמכריע כמה מזה אתם באמת סומכים עליו.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube