
LFM2.5-VL-3B: מודל הראייה-שפה החדש של Liquid AI בגודל 3B למחשוב קצה
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
הדבר הראשון שצריך לדעת על LFM2.5-VL-3B הוא שהוא שוחרר בשני חצי-שלבים. המשקלים הופיעו ב-Hugging Face ב-11 באוגוסט 2026 — נקודת ביקורת (checkpoint) מלאה של bf16, כרטיס מודל עם טבלת בנצ'מרקים ו-README ב-16 שפות, וללא הודעה מצורפת. הכרטיס הראה אפס הורדות. למחרת, ב-12 באוגוסט, Liquid AI פרסמה את הכתבה הרשמית, "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge," והשחרור השקט הפך לשחרור אמיתי. אם אתה קורא את זה באותו שבוע, אתה קורא את אחד מהסיקורים העצמאיים המוקדמים ביותר של מודל שכמעט אף אחד מחוץ למעבדה של Liquid עדיין לא הריץ — אז הנה מה שבאמת אפשר לדעת מהרפו, ומה לא.
מה זה LFM2.5-VL-3B
LFM2.5-VL-3B הוא מודל ראייה-שפה — תמונה וטקסט פנימה, טקסט החוצה — הבנוי על שלד הטקסט LFM2.5 של Liquid AI. במדויק: מודל השפה הוא LFM2.5-2.6B, המזווג עם מקודד ראייה SigLIP2 NaFlex 400M, ובסך הכול כ-3.1 מיליארד פרמטרים. הוא שומר על הארכיטקטורה ההיברידית של המשפחה: בלוקי קונבולוציה מגודרים לטווח קצר המשולבים עם קשב לקבוצות, אוצר מילים של 128,000 אסימונים, וחלון הקשר של 32,768 אסימונים. הוא תומך בשש עשרה שפות (אנגלית, ערבית, סינית, צרפתית, גרמנית, הינדית, אינדונזית, איטלקית, יפנית, קוריאנית, פולנית, פורטוגזית, רוסית, ספרדית, תאית, וייטנאמית), מופץ בפורמט bfloat16, ומורשה תחת רישיון הקוד הפתוח lfm1.0 של Liquid.
זה אינו מודל שנבנה מאפס. כרטיס המודל מתאר אותו כגרסה רב-מודאלית של LFM2.5, המבוססת על LFM2-VL-3B המוקדם יותר, עם אימון ביניים ואימון משלים נוספים. השושלת הזאת חשובה: יכולות הראייה מונחות על גבי מודל טקסט שכבר אומן מראש על כ-34 טריליון טוקנים, כך שהצד הלשוני אינו צעצוע — הוא אותו מנוע משפחתי שמודלי הטקסט משתמשים בו, עם מקודד ראייה שמרותך אליו ואומן מחדש לעבודת ראייה.
מה זה יכול לעשות
הכתבה של Liquid מציינת ארבעה שיפורים לעומת ה-LFM2-VL-3B הקודם: הבנת מסך וממשק משתמש, קריאת פונקציות, עיגון (grounding), וקלט מרובה תמונות. במילים פשוטות, זה אומר:
• עיגון — הפנה לעצמים באמצעות שאילתות בשפה טבעית ("תמרור העצירה," "עמודת המחיר") וקבל מיקום מנורמל בחזרה.
• הבנת מסך — מענה על שאלות לגבי מה שמופיע על המסך ומיקומו, עם אמת מידה (benchmark) על ScreenSpot-v2.
• OCR עם הערות פריסה — OCR בעמוד מלא שמחזיר גם את מבנה המסמך, עם 23 תוויות פריסה (טקסט, כותרת, רשימה, טבלה, כיתוב טבלה, תרשים, משוואה, קוד, כותרות עליונות ותחתונות של עמוד, ועוד) כקואורדינטות שלמות מנורמלות.
• שימוש בכלים — זרימת קריאה לפונקציות בארבעה שלבים שמקבלת הגדרות כלים כ-JSON, פולטת קריאות בסגנון פייתון בין אסימוני קריאה לכלים, ומחזירה תשובה סופית בטקסט פשוט.
• קלט מרובה-תמונות — ניתוח על פני מספר תמונות בסיבוב אחד.
ההנחיות של Liquid עצמה לגבי המקרים שבהם המודל אינו מתאים ספציפיות באופן יוצא דופן. הכרטיס ממליץ עליו למשימות חד-סיבוביות, בעלות תפוקה גבוהה וזמן השהיה נמוך — זיהוי אובייקטים כמעט בזמן אמת בתעשיית הרכב, זיהוי תווים אופטי (OCR) בכמות גדולה של מסמכים סרוקים, ותרגום תפריטים ושלטי דרך על גבי המכשיר — ומזהיר במפורש מפני משימות כבדות בהסקת מסקנות עם הקשר ארוך, עיצוב אתרים ויזואלי, ושאלות טכניות הדורשות שרטוטים הנדסיים.
המספרים — כולם מדווחים על ידי הספק
כל נתון בסעיף זה מגיע מכרטיס המודל ומהפוסט בבלוג של Liquid AI עצמו. שום דבר ממנו לא שוכפל באופן בלתי תלוי, ועד שצד שלישי יריץ את ה-checkpoint, עליך להתייחס לאלה כאל טענות, לא כאל עובדות. התווית הזו עושה כאן עבודה אמיתית, כי הרשומה אכן חזקה על הנייר:
• עיגון — דיוק מקרו (macro precision@1) של 87.9 ב-RefCOCO, לעומת 57.1 ב-LFM2-VL-3B הקודם — קפיצה של כשלושים נקודות, ש-Liquid מייחסת לאימון הפוסט-טריינינג על הראייה.
• הבנת מסך — ממוצע של 80.7 ב-ScreenSpot-v2, ש-Liquid מדווחת כגבוה מה-78.5 המיוחס ל-Qwen3.5-4B.
• שימוש בכלים — ToolSandbox 59.5, יותר מכפול מה-26.4 שמדד Liquid על LFM2-VL-3B; BFCLv4 32.5, עלייה מ-20.5.
• הנמקת ראייה כללית — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (תת-קבוצה באנגלית) 47.5, עלייה מ-43.9.
• חשיבה רב-מודאלית קשה — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — הנקודה החלשה יותר, כצפוי עבור מודל 3B.
• מהירות, ריצת ספק — 228 אסימונים/שנייה על Apple M5 Max, 116 אסימונים/שנייה על AMD Ryzen AI Max+ 395, ו-20 אסימונים/שנייה על Galaxy S26 Ultra, הכול בתוך כ-3.3 GB של זיכרון. על H100 עם vLLM, Liquid טוענת לכ-11K אסימוני פלט/שנייה בקונקורנטיות גבוהה וזמן עד אסימון ראשון של כ-34 אלפיות השנייה על קליפ בן חמש פריימים, מה שהיא מייחסת לכך שהמודל עונה ישירות במקום לחשוב.

אלה הרבה טענות למודל 3B אחד, וכדאי לחזור על האזהרה שבתחתית הכרטיס של המודל עצמו: אלה המספרים של Liquid. הפער בין "משיג ציונים טובים בהערכת מעבדה" לבין "מחזיק מעמד על הנתונים שלך" הוא בדיוק המקום שבו מודל חדש כזה בדרך כלל מועד.
מה שעוד לא ידוע
הרשימה הכנה של שאלות פתוחות:
• אין בנצ'מרק עצמאי — נכון לכתיבת שורות אלה, LFM2.5-VL-3B אינו מופיע באף טבלת דירוג של צד שלישי. כל הציונים שלעיל הם דיווח עצמי של היצרן.
• אין נקודת קצה מתארחת — אף ספק inference לא מגיש אותה עדיין. זהו סיפור של self-host, נקודה.
• אין נתוני שימוש — אפס הורדות ביום הראשון משמעותו אין משוב מהקהילה, אין כיוונונים עדינים, אין "הרצתי את זה על X וזה נשבר ב-Y." הדיווחים הראשונים מהשטח עוד לפנינו.
• תכונה ניסיונית — פלט הערות הפריסה מסומן על ידי Liquid עצמו כ"ניסיוני" ו"עלול להשתנות, עלול להיות לא אמין, ועלול להיות לא טריוויאלי לפרסור." אל תבנה את הפרסר שלך סביבו עדיין.
• סיקור צד-שלישי דל — העיתונות בשבוע הראשון היא בעיקר תקצירי חדשות קצרים. אף אחד לא ערך בדיקה עצמאית מעמיקה.

שום דבר מזה לא אומר שהמודל גרוע. זה אומר שהוא לא מוכח, כמו שכל מודל לא מוכח בימים שלאחר השחרור.
איך להריץ את זה בעצמך
עבור מודל כל כך צעיר, סיפור המערכת האקולוגית טוב בצורה יוצאת דופן. גרסאות פורמט נחתו באותו יום כמו המשקלים: GGUF עבור llama.cpp, ONNX, וחמש קוונטיזציות של MLX עבור Apple Silicon, לצד checkpoint המקורי מסוג bf16 עבור Transformers, vLLM ו-SGLang. Liquid מציינת תמיכה מיום ראשון ב-llama.cpp, MLX, vLLM, SGLang ו-ONNX, בנוסף להדגמת דפדפן WebGPU. פרמטרי הדגימה המומלצים הם טמפרטורה 0.2, top_k 50, קנס חזרתיות 1.0, כשראייה מטופלת על ידי תצורת ה-processor של המודל. אם אתם רוצים לנסות את זה על מחשב נייד הערב, הגרסאות של MLX או GGUF הן הדרך הקצרה ביותר.
מה לצפות
שני דברים קובעים אם LFM2.5-VL-3B משמעותי מעבר למחזור ההייפ. ראשית, האם מספרי העגינה והבנת המסך שורדים שכפול בלתי-תלוי — {{1}}80.7 ב-ScreenSpot-v2 ו-87.9 ב-RefCOCO{{/1}} הם שתי הטענות שהכי כדאי לבדוק, כי הן אלה שיהפכו אותו למודל קצה משבש באמת. שנית, האם יופיע endpoint מתארח, כי זה משנה את החישוב מ-{{2}}"פרויקט self-host מעניין" ל-"ניתן לשחרור היום."{{/2}} וזה בדיוק הרגע שבו שכבת ניתוב (routing layer) מוכיחה את ערכה: {{3}}API אחד על פני 200+ מודלים{{/3}} אומר שביום ש-{{4}}Liquid או ספק כלשהו מקים endpoint{{/4}}, אתה מוסיף את LFM2.5-VL-3B לצד המודלים שאתה כבר קורא להם {{5}}בלי לשנות את האינטגרציה שלך{{/5}}, במחיר המחירון של הספק עם {{6}}אפס תוספת{{/6}}, ו-failover אוטומטי מאפשר לך לכוון {{7}}תנועה אמיתית{{/7}} אליו בזמן ש-{{8}}מודל מוכח מכסה את הקריאות שהוא מפספס{{/8}}. עד אז זה סיפור self-host מבטיח — ובשביל מודל בן שבוע, זה כבר יותר ממה שרוב השחרורים זוכים לו.

