
LFM2.5-VL-3B-DSpark: ה-Drafter 279.5M של Liquid AI שוחרר שישה ימים לפני שמישהו הכריז עליו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 181 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
יש גרסה של הסיפור הזה שבה LFM2.5-VL-3B-DSpark הוא מודל חדש. הוא לא. הוא מודל טיוטה לפענוח ספקולטיבי עם 279.5 מיליון פרמטרים שקיים בדיוק למטרה אחת — להאיץ את הפענוח של המודל החזותי-לשוני LFM2.5-VL-3B של Liquid AI עצמה — והוא לא יכול לייצר תשובה שמישה בכוחות עצמו. הסיבה שכדאי לקרוא עליו בכל זאת היא ציר הזמן: המשקלים נחתו ב-Hugging Face ב-18 בספטמבר 2026, בלי שום הודעה מצורפת, ישבו שם שישה ימים, וקיבלו פוסט בבלוג של הספק רק ב-24 בספטמבר. Radar תפס את המאגר בפער.
הפער הזה הוא גם הגבול של מה שניתן לדעת כרגע. כל דבר במאגר — פירוט הפרמטרים, גודל הבלוק, אינטגרציות הפריימוורקים, הרישיון — הוא קובץ על הדיסק שאתה או אני יכולים לפתוח. כל נתון של האצה נמדד על ידי הספק, מתוך מערכת הבנצ'מרק של Liquid עצמה, ואף אחד מחוץ לחברה לא פרסם שחזור. הקטע הזה מפריד בכוונה בין שתי הערימות האלה.
מה המאגר מכיל בפועל
פתח את כרטיס המודל וצורת הדבר אינה משתמעת לשתי פנים. LFM2.5-VL-3B-DSpark הוא מודל טיוטה שהיעד שלו קבוע במטא-נתונים שלו: base_model: LiquidAI/LFM2.5-VL-3B. אין להפנות אותו למודל אחר ואין לשרת אותו לבדו.
• סך פרמטרי הטיוטה — 279.5M, BF16, מתוכם 193.0M הם מחסנית מפענח בת 4 שכבות, 65.5M הם ראש מרקוב, 21.0M הם הטלה של מצב חבוי, ו-6.4k הם נורמות בתוספת ראש ביטחון
• עמוד שדרה — 4 שכבות קשב מלאות, גודל מוסתר 2,144, גודל ביניים 6,144 עם SiLU/SiLU
• ראשים נוספים — ראש מרקוב בדרג 256 וראש ודאות, וזה מה שמבדיל בין ניסוח הטיוטה של DSpark לבין מנסח מקבילי פשוט
• גודל בלוק — 9 במהלך האימון; 8 או 9 בזמן הסקה בהתאם לחומרה, ו-8 במיוחד על Apple silicon
• אוצר מילים — 128,000, קשור ליעד ולא נישא על ידי הטיוטה
• משקל בסטאק הפרוס — Liquid מציינת שה-drafter מגדיל את מספר הפרמטרים הפרוסים ב-8.9%

המספר 8.9% הוא זה שכדאי להיאחז בו. המסר השיווקי עבור סוג זה של מודלים הוא לעולם לא „הסקה מהירה יותר היא בחינם”; הוא „הסקה מהירה יותר עולה לך בכמות זיכרון השווה לעשירית ממודל”. עם 279.5M פרמטרים נוספים מעל מודל יעד של 3.1B, זהו מס קטן יותר מכפי שגודלו של מודל הטיוטה לבדו היה מרמז, מכיוון שההטמעה וראש ה-LM קשורים למודל היעד ואינם משוכפלים.
DSpark היא טכניקה של DeepSeek לפני שהיא מודל של Liquid
השמות הללו מזמינים בלבול, ולכן כדאי להיות מדויקים. DSpark אינו המצאה של Liquid AI ואינו משפחת מודלים. זוהי מסגרת לפענוח ספקולטיבי (speculative decoding) מקו מחקר נפרד, שתוארה במאמר מיולי 2026 כפענוח ספקולטיבי מתוזמן-לפי-ביטחון (confidence-scheduled) עם יצירה חצי-אוטורגרסיבית. שלושת הרעיונות שלה: עמוד שדרה מקבילי שמנסח טיוטה של בלוק שלם במעבר קדימה אחד, מודול סדרתי קל-משקל שמשחזר תלות מסוימת בין אסימוני טיוטה שכנים כך ששיעור הקבלה לא קורס בסוף הבלוק, ומאמת שמקצר את חלון האימות לכל בקשה כאשר רמת הביטחון של הטיוטה עצמה מרמזת שהזנב יידחה.
מה ש-Liquid עשתה הוא להחיל את המתכון הזה על מודלים חזותיים-לשוניים ולשחרר צ'קפוינט. הכרטיס גלוי לב בכך שההעברה הזו פחות דרמטית מכפי שהיא נשמעת: מנקודת המבט של מודל הטיוטה, המודאליות אינה רלוונטית, מפני שעד שהטוקנים מגיעים לשכבות הנסתרות, גם פאטץ' תמונה וגם טוקן טקסט הם בסך הכול טנזורים. זו הסיבה שטכניקה שפותחה על מודלים של טקסט עוברת ל-VLM בלי להיות מומצאת מחדש — וזו גם הסיבה שלא ניתן למכור את מודל הטיוטה כיכולת חדשה.
Liquid כבר הוציאה מודלי טיוטה DSpark לטקסט — הגרסאות הנלוות 2.6B, 8B-A1B ו-1.2B-Instruct עלו באוגוסט 2026, כאשר ייצואי GGUF באו בעקבותיהן ב-19 באוגוסט. מודל הטיוטה החזותי הוא אותו רעיון שהורחב לענף הרב-מודלי, והפריט הרביעי או החמישי בסדרה, לא הופעת בכורה.
מספרי ההאצה, ומי מדד אותם
כל נתון להלן הוא של Liquid עצמה, שנאסף בתשתית הבנצ'מרק של Liquid, ואף אחד מהם לא שוחזר באופן בלתי תלוי. התייחסו אליהם כתקרת ספק, לא כתוצאה צפויה. הכרטיס מפריד בין האצת פענוח להאצה מקצה לקצה, וזה חשוב יותר מהכותרת.
• האצת הפענוח הטובה ביותר — פי 3.13 על COCO, נמדד עם MLX-VLM על Apple M5 Max בגודל בלוק 8, FP16, גודל אצווה 1, טמפרטורה 0
• האצת הפענוח הטובה ביותר ב-GPU — פי 2.66 על COCO, SGLang על H100 80GB בודד, BF16, גודל בלוק 9
• ההאצה הטובה ביותר לפענוח של llama.cpp — פי 2.14 ב-COCO, Apple M3 Ultra, גודל בלוק 8
• טווח הפענוח של H100 על פני שש משימות ראייה — פי 2.04 עד פי 2.66, כאשר מקצה לקצה עומד על פי 1.64 עד פי 2.27
• טווח הפענוח של M5 Max — 2.30× עד 3.13×, מקצה לקצה 1.56× עד 2.62×
• טווח הפענוח של M3 Ultra — 1.57× עד 2.14×, מקצה לקצה 1.30× עד 1.77×
• קבלת טיוטה — בערך 3.2 עד 4.5 אסימונים מתקבלים לכל מעבר אימות של היעד, בכל שלוש הערימות
הדפוס בטווחים האלה הוא החלק הישר. הרווחים מקצה לקצה הם באופן עקבי החצי הקטן יותר של כל זוג, מפני שהמנסח מאיץ רק את הפענוח ולא דבר אחר. שימו לב גם שאותו מנסח באותו גודל בלוק מגיע ל-3.13× בסטאק אחד ול-1.57× בסטאק אחר — שיעור הקבלה הוא תכונה של המנסח ושל עומס העבודה, אבל הרווח בזמן הקיר הוא תכונה של החומרה ושל תקורת סביבת ההרצה. טענה של "מהיר פי 2.66" בלי סטאק מצורף היא לא טענה שאפשר לפעול לפיה.
שתי נקודות דיוק מהכרטיס ראויות להיאמר בפשטות, משום שהן מה שהופך מודל טיוטה לקביל בייצור בכלל. תחת פענוח חמדני, פענוח ספקולטיבי הוא מדויק: היעד מאמת כל טוקן מוצע, כך שהטקסט הוא מה שהיעד היה מייצר לבדו. תחת הגדרות דגימה מותאמות בטמפרטורה שאינה אפס, הוא משמר את התפלגות הפלט של היעד. הניסוח של Liquid — אתה מקבל את האצת הביצועים, לא מודל אחר — מדויק עד כמה שהוא הולך, והכרטיס כנה בכך שהעלאת הטמפרטורה מפחיתה את שיעור הקבלה ולכן שוחקת את יתרון התפוקה.
מה שהפוסט של Liquid עצמו מודה בו

הפוסט בבלוג מ-24 בספטמבר שימושי יותר מכרטיס המודל מסיבה אחת: הוא נוקב במגבלה במפורש. אינפרנס חזותי-לשוני משלם עלות מילוי מקדים שאינפרנס טקסטואלי אינו משלם — התמונה צריכה לעבור דרך מקודד חזותי, ולאחר מכן עמוד השדרה הלשוני צריך לעבד את מאות הטוקנים החזותיים שהמקודד מייצר. בהתקן, אותו מילוי מקדים שולט בהשהיה מקצה לקצה. פענוח ספקולטיבי מאיץ רק את שלב הפענוח. הקידוד החזותי והמילוי המקדים נשארים ללא שינוי. Liquid מפעילה את חוק אמדייל נגד המוצר שלה עצמה ומציינת שכאשר המילוי המקדים מהווה נתח גדול מזמן הקיר, האצת פענוח גדולה מניבה רק שיפור מקצה לקצה צנוע.
זהו אילוץ על החלטת הרכישה, והוא מסביר מדוע הזמן עד לאסימון הראשון אינו ברשימת הדברים שזה משפר באופן דרסטי. זה גם מרמז שעומסי העבודה שמפיקים את מירב התועלת הם אלה שמייצרים פלטים ארוכים מתמונה צנועה — כיתוב, תמלול OCR ארוך, שיחה מרובת תורות עם תמונה אחת שנשמרת לאורך השיחה — ולא אלה שעונים על שאלה קצרה על תמונה גדולה.
הפוסט מוסיף שתי מגבלות היקף נוספות. כל המספרים משתמשים בעיבוד של 16 סיביות הן במקודד הראייה והן בשלד הלשוני, והאצה של מודלים מכומתים אינה בתחום המהדורה הזו. בהתחשב בכך שנקודת המכירה כולה של 3B edge VLM היא ריצה בכמה גיגה-בייטים, "ההאצות נמדדות ב-FP16" היא הסתייגות משמעותית לכל מי שתכנן לשלב אותו עם ייצוא של 4 סיביות. Liquid גם מציינת שמודל הטיוטה אומן כולו על חומרת AMD.
מריץ את זה

תמיכה מיום הראשון היא אמיתית ומכסה שלוש סביבות ריצה, וזה יותר ממה שרוב מודלי הטיוטה מקבלים. SGLang על NVIDIA דורש v0.5.19 או חדש יותר ומעביר את מודל הטיוטה דרך --speculative-algorithm DSPARK עם נתיב הטיוטה וגודל בלוק של 9. MLX-VLM על Apple silicon דורש v0.7.2 או חדש יותר ומזהה את מודל הטיוטה כאשר הוא מועבר עם --draft-model; יש כאן מלכוד אחד — פענוח DSpark ב-MLX-VLM משתמש כעת בדגימה חמדנית, לכן יש להגדיר את הטמפרטורה ל-0. עבור llama.cpp קיים מאגר GGUF נפרד, עם ייצוא F16 בודד בנפח של כ-567 MB, והכרטיס מבהיר במפורש שעליך לצמד את מודל הטיוטה המכומת עם היעד המכומת ולא עם צ'קפוינט safetensors המקורי.
המקום שבו שכבת ניתוב מצדיקה את עצמה כאן אינו על המודל הזה — OrcaRouter אינו מנתב את LFM2.5-VL-3B-DSpark או את LFM2.5-VL-3B, וזו התאמת drafter בהארחה עצמית שאותה מורידים ומגישים בעצמכם. הוא טמון בשאר הסטאק שמסביבו. אותה אפליקציה שמריצה מודל ראייה קטן בקוד פתוח על המכשיר כוללת בדרך כלל נתיב גיבוי לשאילתות שהמודל הקטן אינו מסוגל להתמודד איתן, והפניית אותו נתיב אל נקודת קצה אחת המכסה למעלה מ-200 מודלים — בחיוב לפי מחיר המחירון של כל ספק ללא תוספת, עם מעבר אוטומטי לגיבוי כאשר ספק נחלש — היא אינטגרציה קטנה יותר מאשר הקמת חוזה שני עם ספק. ה-drafter משפר רגל אחת של הארכיטקטורה הזו; ה-router הוא מה שמונע מהרגל השנייה להפוך לפרויקט שני.
מה שעדיין לא ידוע
בעת כתיבת הדברים, במאגר יש 37 הורדות ו-6 לייקים. אין רשומה ל-drafter הזה באף אגרגטור בנצ'מרקים ציבורי, אין שחזור מצד שלישי של אף אחד מטווחי ההאצה, ואין מדידה עצמאית של שיעור הקבלה על חומרה ש-Liquid לא בדקה. כמו כן, אין בנצ'מרקים לאיכות בכרטיס מהסיבות הברורות — ה-drafter משמר פלט מעצם מבנהו, כך שמספרי האיכות שייכים ל-LFM2.5-VL-3B, והכרטיס מפנה לבנצ'מרקים של אותו מודל במקום להמציא משלו.
פרט אחד במטא-דאטה מסגיר במידה מסוימת עד כמה זה חדש: המודל נושא תג ספריית SGLang ודגל אלגוריתם SGLang שקיים במיוחד כדי להפעיל אותו. התמיכה במסגרת הייתה חייבת לנחות לפני ההכרזה, מה שתואם את הפער של שישה ימים בין המאגר לפוסט בבלוג.
אז: עבודת הנדסה אמיתית, שימושית ובעלת היקף מצומצם, שהוכרזה שבוע לאחר שיצאה, שכל הצעת הערך שלה היא מספר שנמדד על ידי הספק על חומרה שאולי אינה בבעלותכם. אם אתם מריצים את LFM2.5-VL-3B על H100 או על Mac מסדרת M ועומס העבודה שלכם עתיר פענוח, עלות הזיכרון היא 8.9% והחיסרון קרוב לאפס כי ניתן להוכיח שהפלט הוא של היעד. אם זמן השהיה שלכם נשלט על ידי שלב ה-prefill, או שהסתמכתם על ייצוא 4-ביט, הפוסט של Liquid עצמה אומר לכם שזה לא יעזור. השחזור, כשיגיע, הוא הדבר שכדאי לחכות לו.
OrcaRouter מעמיד 200+ מודלים מאחורי מפתח אחד במחיר המחירון של הספק עם 0% תוספת, ומבטא את מסלול הגיבוי כשכבת ניתוב ולא כקוד אפליקציה. המנסח מתארח באופן עצמאי כך או כך - הנתב הוא זה שמונע מהמקטע שאליו המודל הקטן שלך מעביר את הטיפול להפוך לפרויקט שני.
