כרטיס Hero עם כיתוב מקדים 'מודל אחד, שתי תצורות' והכותרת 'DSpark מול LFM2.5-VL-3B', עם כותרת משנה 'לא שני מודלים שצריך לבחור ביניהם - מודל ראייה-שפה אחד בגודל 3.1B, והדרפטר בגודל 279.5M שמצרפים לפניו.' שלושה כרטיסים מציינים 'יעד 3.1B - מייצר טקסט ועונה על שאלות לגבי תמונות', 'דרפטר 279.5M - מציע טוקנים; אינו מייצר דבר שמיש לבדו' ו'הפלט ללא שינוי - מדויק תחת פענוח חמדני, מעצם הבנייה'. כותרת תחתונה מציינת 'ההאצות נמדדו על ידי הספק, Liquid AI; אין עדיין שחזור בלתי תלוי של אף נתון.' הלוגו של OrcaRouter מוטמע בפינה הימנית התחתונה.
Engineering & Research

LFM2.5-VL-3B-DSpark לעומת LFM2.5-VL-3B: לא בוחרים אחד, מצרפים אחד

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

החיפוש שמביא אנשים לכאן הוא השוואה, אבל התשובה הכנה היא ש-LFM2.5-VL-3B-DSpark ו-LFM2.5-VL-3B אינם שני דברים שבוחרים ביניהם. השני הוא מודל שפה-חזות בגודל 3.1B שאפשר להוריד ולהריץ כשירות. הראשון הוא מודל טיוטה בעל 279.5M פרמטרים שקיים רק כדי לשבת לפני השני ולגרום לו לפענח מהר יותר. תוציאו את מודל הטיוטה מהמערך והוא לא מפיק דבר; אי אפשר להריץ עליו בנצ'מרק בפני עצמו, מפני ש"בפני עצמו" אינו תצורה שהוא תומך בה. ההשוואה האמיתית היא בין LFM2.5-VL-3B שפועל לבדו לבין אותו מודל שפועל עם מודל הטיוטה מחובר.

קרא את זה כך וההחלטה מצטמצמת לשאלה אחת: האם הזיכרון הנוסף ומורכבות זמן הריצה הנוספת קונים לך מספיק השהיה כדי שיהיה לזה משמעות לעומס העבודה שלך? המספרים של Liquid AI עצמה אומרים כן לעבודה עתירת פענוח ואומרים במפורש לא כאשר השלב המקדים שולט. אף אחד מהצדדים של זה לא שוחזר מחוץ לחברה.

שתי נקודות הביקורת, זו לצד זו

מה שמבדיל ביניהם הוא כל הסיפור, ולכן כדאי להעמיד את שני המאגרים זה לצד זה לפני שהוויכוח על המהירות מתחיל.

• תפקיד — LFM2.5-VL-3B מייצר טקסט ומשיב בנוגע לתמונות; LFM2.5-VL-3B-DSpark מציע טוקנים כדי שהוא יאמת אותם ואינו מייצר דבר שמיש בעצמו

• פרמטרים — 3.1B עבור היעד, 279.5M BF16 עבור המנסח, אשר Liquid מציבה כעלייה של 8.9% במספר הפרמטרים הפרוסים

• ארכיטקטורה — היעד הוא מודל היברידי הבנוי על עמוד שדרה LFM2.5-2.6B עם מקודד חזותי SigLIP2 NaFlex; המנסח הוא 4 שכבות קשב מלאות בגודל מוסתר 2,048 עם קשב מקובץ-שאילתה בתוספת ראש Markov וראש ביטחון

• חלון הקשר — 32,768 טוקנים עבור היעד; המנסח אינו נושא הקשר משל עצמו, ויורש את זה של היעד

• מקודד חזותי — SigLIP2 NaFlex 400M על היעד; למנסח אין כזה והוא לעולם אינו רואה את התמונה ישירות

• אוצר מילים — 128,000, וההטמעה וראש ה-LM של המנסח קשורים למודל היעד במקום להיות משוכפלים, ולכן נטל הזיכרון קטן ממה ש-279.5M פרמטרים היו מרמזים

• רישיון — שניהם מופצים תחת רישיון LFM1.0 של Liquid, שהוא "אחר" ב-Hugging Face ולא רישיון OSI, לכן קראו את התנאים לפני פריסה מסחרית

• פורמטים — היעד מסופק כיחידות קוונטיזציה מסוג safetensors, GGUF, ONNX ו-MLX; ה-drafter מסופק כ-safetensors וכ-GGUF F16 בודד של כ-567 MB

A two-panel comparison card titled 'One model, two configurations', subtitled 'You do not choose between them - you attach one to the other'. The left panel is 'LFM2.5-VL-3B alone' with rows: Role 'Generates text and image answers', Parameters '3.1B', Context '32,768 tokens', Vision 'SigLIP2 NaFlex 400M', Runtime 'Any supported stack'. The right panel is 'With DSpark attached' with rows: Role 'Same model, drafted', Parameters '3.1B + 279.5M', Context 'Unchanged, inherited', Vision 'Unchanged, drafter sees no image', Runtime 'SGLang 0.5.19+, MLX-VLM 0.7.2+'. A strip beneath reads 'The target's weights are untouched. Nothing about quality changes - only the wall-clock cost of a decoded token.' The OrcaRouter logo is composited in the bottom-right corner.

שורה אחת ברשימה הזו ראויה להדגשה, מפני שהיא הסיבה המכנית לכך שהציוות הזה עובד בכלל: המנסח אינו מודל ראייה קטן. אין לו מקודד ראייה והוא אינו נוגע בתמונה כלל. עד שהטוקנים מגיעים לשכבות הנסתרות שמהן הוא מנסח, גם פיסת תמונה וגם טוקן טקסט הם פשוט טנסורים, כך שהמודאליות אינה נראית לחישוב הניסוח. זה מה שאיפשר ל-Liquid להעביר טכניקה שפותחה עבור מודלי טקסט אל VLM בלי לעצב אותה מחדש.

מה המנסח משנה, ומה הוא משאיר ללא שינוי

מודל היעד אינו משתנה. זו אינה הצהרת שיווק — זוהי תכונת הנכונות של פענוח ספקולטיבי. תחת פענוח חמדני, כל אסימון טיוטה מאומת על ידי היעד, כך שהפלט הוא בדיוק מה שהיעד היה מייצר לבדו. תחת הגדרות דגימה מותאמות בטמפרטורה שאינה אפס, התפלגות הפלט תואמת את זו של היעד. מנסח הטיוטות מחליף זיכרון בזמן ואינו נוגע בשום דבר אחר.

מה שאומר שכל נתון איכות שתוכל למצוא עבור LFM2.5-VL-3B חל ללא שינוי על התצורה המזווגת. לפי ההערכה של Liquid עצמה, מודל היעד משיג 80.7 ב-ScreenSpot-v2, 61.5 ב-BLINK, 58.3 ב-MuirBench, 73.1 ב-MME, 63.3 ב-MMStar, 81.3 ב-ChartQA ו-88.7 ב-POPE — כולם מדווחים על ידי הספק, אף אחד מהם לא שוחזר באופן עצמאי, וכולם נכונים באותה מידה בין אם מודל הטיוטה מחובר ובין אם לא. אין כאן פשרה בין איכות למהירות שצריך לשקול, וכל דף השוואה שמציג פשרה כזו פירש את המודל לא נכון.

מה שכן משתנה הוא העלות של טוקן בזמן שעון־קיר. Liquid מודדת שיפורי מהירות פענוח מ-2.04× עד 2.66× על H100 בודד ב-BF16 דרך SGLang בגודל בלוק 9, מ-2.30× עד 3.13× על Apple M5 Max דרך MLX-VLM בגודל בלוק 8, ומ-1.57× עד 2.14× על M3 Ultra דרך llama.cpp. מקצה לקצה, אותן הרצות מגיעות ל-1.64×–2.27×, ל-1.56×–2.62× ול-1.30×–1.77× בהתאמה. הזוגות האלה הם כל הטיעון: הפענוח משתפר בערך פי שניים יותר מאשר מקצה לקצה, והפער הוא החלק של עומס העבודה שמודל הטיוטה לא יכול לגעת בו.

בעיית ה-prefill, כפי שנוסחה על ידי הספק

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62'.

המשפט השימושי ביותר בהכרזה של Liquid עצמה הוא זה שמתווכח נגד קריאה בלתי מוגבלת של הכותרת שלה. הסקה חזותית-לשונית משלמת עלות prefill שהסקת טקסט אינה משלמת: התמונה עוברת דרך מקודד חזותי, ועמוד השדרה הלשוני מעבד לאחר מכן את מאות הטוקנים החזותיים שהמקודד פולט. בהתקן קצה, ה-prefill הזה מהווה חלק גדול מהשהיה מקצה לקצה. פענוח ספקולטיבי מאיץ רק את הפענוח — קידוד חזותי ו-prefill נשארים ללא שינוי. כאשר prefill דומיננטי, האצת פענוח פי 3 מתורגמת לרווח קטן בהרבה מקצה לקצה.

זהו חוק אמאדל שמיושם על ידי הספק על המוצר של הספק עצמו, והוא אמור לעצב מי קורא את העמוד הזה. תמלול ארוך של עמוד סרוק בודד, כיתוב, שיחה מרובת תורות שנושאת תמונה אחת קדימה — עומס עתיר פענוח, ומודל הטיוטה מצדיק את 279.5 מיליון הפרמטרים שלו. שאלה קצרה על תמונה גדולה ברזולוציה גבוהה — עומס עתיר prefill, והוא אינו מצדיק אותם. הציבו את אותו מודל יעד על שרת במקביליות גבוהה והתמונה משתנה שוב: Liquid מודדת חזית של תפוקה–אינטראקטיביות ולא מספר בודד, ומדווחת ש-DSpark שומרת על היתרון שלה בכל רמת מקביליות שנבדקה, בעוד שהפער מצטמצם ככל שהמקביליות עולה.

שתי הערות היקף קטנות יותר מאותו מקור. כל המדידות משתמשות בעיבוד של 16 סיביות הן במקודד הראייה והן בעמוד השדרה הלשוני, והאצת מודלים מכומתים נמצאת מחוץ להיקף המהדורה. אם התוכנית שלך הייתה לצמד ייצוא יעד של 4 סיביות עם מודל הטיוטה, כי כל המשיכה של VLM בגודל 3B היא להיכנס לכמה גיגה-בייטים, השילוב הזה אינו מה שנמדד.

מה זה עולה לך לצרף את זה

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B showing 'Like 211' and 'Downloads last month 24,660', the license 'lfm1.0', and 'Model size 3B params  Tensor type BF16'. The model card prose describes LFM2.5-VL-3B as the multimodal variant of LFM2.5, building on LFM2-VL-3B with an LFM2.5-2.6B language backbone and a SigLIP2 NaFlex vision encoder, reporting 228 tokens per second on an Apple M5 Max and 116 tokens per second on an AMD Ryzen AI Max+ 395 while running in under 3.3 GB, and noting it requires a recent Transformers build ('Model tree for LiquidAI/LFM2.5-VL-3B' is visible in the file listing).

הזיכרון הוא העלות הנראית לעין, והכרטיס מכמת אותה: 8.9% יותר פרמטרים במערך הפרוס. מורכבות זמן הריצה היא הבלתי נראית. SGLang דורש v0.5.19 ואילך ושורת הפעלה הנושאת --speculative-algorithm DSPARK, נתיב מודל הטיוטה וגודל בלוק; הדוגמה של הכרטיס עצמו גם משביתה את מטמון הרדיקס ומקבעת חלק זיכרון סטטי, ואלו החלטות הגשה שעליך כעת לשקול. MLX-VLM דורש v0.7.2 ואילך ומקבל את המנסח דרך --draft-model, אך פענוח DSpark שם משתמש כעת בדגימה חמדנית, לכן הטמפרטורה חייבת להיות מאולצת ל-0 — אילוץ ממשי אם היישום שלך מסתמך על מגוון דגימה. llama.cpp עובד דרך מנסח ה-GGUF המזווג עם יעד ה-GGUF, ולא עם נקודת הביקורת המקורית מסוג safetensors.

יש עלות נוספת אחת שמופיעה בייצור ולא בבנצ'מרק: מודל הטיוטה ומודל היעד חייבים לנסוע יחד. אי-התאמת גרסאות ביניהם היא מצב כשל שלא קיים בפריסה של מודל בודד, ושדרוג של כל אחד מהם בנפרד הוא כעת בעיה של שני ארטיפקטים.

זיווג זה הוא בהתארחות עצמית. OrcaRouter אינו מנתב את LFM2.5-VL-3B או את ה-drafter שלו — אתם מורידים את שניהם ומגישים אותם בעצמכם — כך ששאלת הניתוב נוגעת לכל מה שהמודל הקטן מעביר הלאה. רוב הפריסות שמזווגות VLM קצה מסוג 3B עם ה-drafter עדיין כוללות שאילתות שהמודל הקטן לא אמור לענות עליהן, ושליחתן אל נקודת קצה אחת ובה 200+ מודלים במחיר המחירון של כל ספק, עם מעבר אוטומטי לגיבוי אם ביצועי ספק נפגעים, היא אינטגרציה אחת במקום אחת לכל ספק. זה גם אומר שברגע שספק מוריד את המחיר, התעריף שלכם משקף זאת באותו יום ולא בחידוש החוזה הבא.

איזה מהם להוריד?

אם עומס העבודה שלך כבד בפענוח והחומרה שלך היא אחת משלוש ש-Liquid בדקה, חבר את מודל הטיוטה — החיסרון מוגבל, מפני שניתן להוכיח שהפלט הוא של היעד ועלות הזיכרון נמוכה מעשירית ממודל. אם זמן השהיה שלך נשלט על ידי prefill, או שאתה מריץ יעד מכומת, או שאתה תלוי בדגימה לא חמדנית בסביבת ריצה שלא הסירה את המגבלה הזו, הרץ את LFM2.5-VL-3B לבדו. הוא מהיר במונחים שלו: 228 טוקנים לשנייה על M5 Max, 116 על AMD Ryzen AI Max+ 395, ו-20 על Galaxy S26 Ultra, הכול נתוני יצרן, בכ-3 GB של זיכרון.

מה שאף אחד עדיין לא יכול לומר לך הוא אם המספרים של Liquid מחזיקים מעמד בחומרה שלך. לדרפטר היו 37 הורדות ב-Hugging Face בזמן כתיבת הדברים, ולא היה שחזור עצמאי של אף נתון בטבלאות שלו. ההנדסה מוצקה וטיעון הנכונות הוא הוכחה ולא טענה, אבל הגודל הוא מדידה — ומדידות ממעבדה אחת על סט אחד של מכונות הן בדיוק מסוג המספרים שכדאי לאמת בעצמך לפני שמכניסים אותם לתוכנית קיבולת.

OrcaRouter מגיע ל-200+ מודלים דרך מפתח אחד, כאשר מחיר המחירון של כל ספק מועבר ישירות ללא תוספת (0%) ומעבר אוטומטי בין ספקים. מחיר מחירון של ספק מועבר ישירות ללא תוספת (0%) הזיווג בעמוד זה הוא באירוח עצמי בכל מקרה - הנתב מיועד לכל מה שהמודל הקטן מעביר הלאה, וזה אומר שהורדת מחיר של ספק תופיע בתעריף שלך באותו יום.