כרטיס כותרת הירו שכותרתו 'אחד מחליט, אחד מתאר' עם כותרת המשנה 'Liquid AI d1-omni-600M מול LFM2.5-VL-3B - משקולות פתוחות, אוקטובר 2026', ושני כרטיסים: Liquid AI d1-omni-600M עם 587M פרמטרים שמחזיר תווית או ציון עם 0 טוקני פלט, לעומת LFM2.5-VL-3B עם 3.1B פרמטרים שכותב טקסט וקורא תמונות כדי להחזיר פרוזה.
Guides & Insights

Liquid AI d1-omni-600M לעומת LFM2.5-VL-3B: אחד מחליט, אחד מתאר

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Liquid AI d1-omni-600M ו-LFM2.5-VL-3B הם שניהם קטנים, שניהם פורסמו על ידי אותה מעבדה ב-Hugging Face תחת אותו רישיון lfm1.0 — ושילוב ביניהם הוא שגיאת קטגוריה שמסתבר שהיא שימושית. LFM2.5-VL-3B נחת ב-12 באוגוסט 2026 כמודל החזותי-לשוני לקצה של Liquid AI: 3.1B פרמטרים, חלון של 32,768 טוקנים, ופלט שהוא פרוזה. תנו לו עמוד סרוק והוא יחזיר את התעתיק, עם הפריסה, כטקסט. Liquid AI d1-omni-600M הועלה ב-7 באוקטובר 2026 עם שאר משפחת d1 הפתוחה, והוא עושה את הדבר ההפוך עם אותם קלטים. זהו מודל החלטות עם 587M פרמטרים: אתם מצרפים שאלות בעלות שם למצב והוא מדווח את מה שהוא כבר מאמין בו — P(yes), תווית נבחרת עם רמת ביטחון, מיקום על סולם סדור של שתיים עד עשר — במעבר קדימה אחד, עם אפס טוקני פלט וכלום במורד הזרם לפרסר. אם חיפשתם "המודל ה-Liquid הרב-מודאלי הקטן", יש לפניכם כעת שתי צורות, והצורה היא ההחלטה.

העמוד הזה הוא מה ששני כרטיסי המודל, פוסט ההשקה מ-7 באוקטובר והמאגרים עצמם קובעים למעשה. הוא גם מפורש לגבי היכן הם עוצרים. שום דבר בהשוואה הזו לא שוחזר מחוץ ל-Liquid AI, ולאחד משני המודלים לספק אין כלל בנצ'מרק דיוק ספציפי ליכולת הדגל של עצמו.

שתי נקודות הביקורת, זו לצד זו

דפי המפרט נבדלים כמעט בכל ציר, וזה בדיוק מה שהייתם מצפים לו משני דגמים שמעולם לא נועדו להתחרות על אותה משבצת.

• מה זה — LFM2.5-VL-3B הוא מודל חזותי-לשוני גנרטיבי שכותב טקסט; Liquid AI d1-omni-600M הוא מודל החלטות שמחזיר תשובות מובנות ואינו פולט טוקנים

• פרמטרים — 3.1B ב-BF16 עבור LFM2.5-VL-3B לעומת 587M עבור Liquid AI d1-omni-600M, שהוא עצמו גזע משותף וראש החלטה של 381M בתוספת מקודד חזותי של 94M ומקודד אודיו של 112M

• עמוד שדרה — LFM2.5-VL-3B מצמיד מודל שפה LFM2.5-2.6B עם מקודד חזותי SigLIP2 NaFlex 400M מאופטם לצורה; Liquid AI d1-omni-600M מאומן מ-LFM2.5-Encoder-350M, מקודד דו-כיווני, עם מגדל SigLIP2 שנלקח מ-LFM2.5-VL-450M ו-FastConformer בן 17 שכבות לשמע

• קלטים — טקסט ותמונות עבור LFM2.5-VL-3B; טקסט בתוספת תמונות או טקסט בתוספת עד 30 שניות של דיבור עבור Liquid AI d1-omni-600M, מה שמעלה ValueError אם תמונות ואודיו מגיעים באותה בקשה

• הקשר — 32,768 טוקנים עבור LFM2.5-VL-3B לעומת 16,384 מיקומים משולבים של טקסט, תמונה ואודיו עבור Liquid AI d1-omni-600M, שהכרטיס שלו מוסיף כי כאשר יש תמונות, המצב וטקסט השאלה מקוצצים ל-896 טוקנים כדי להתאים לאימון.

• אוצר מילים — 128,000 טוקנים עבור LFM2.5-VL-3B, 65,536 עבור Liquid AI d1-omni-600M

• זמן ריצה — LFM2.5-VL-3B פועל ב-transformers וב-vLLM ויש לו מודל טיוטה נפרד DSpark לפענוח ספקולטיבי; Liquid AI d1-omni-600M מסופק עם קוד מותאם אישית, דורש trust_remote_code=True, והכרטיס שלו ממליץ על float16 ב-GPU תוך אזהרה ש-bfloat16 שינה את התשובה המובילה בחלק מהשורות

• רישיון — lfm1.0 עבור שניהם, המאפשר כוונון עדין ופריסה

שורה אחת ברשימה ההיא עושה יותר עבודה מהשאר. Liquid AI d1-omni-600M בנוי על מקודד דו-כיווני ולא על מפענח. זה אינו צמצום בגודל של LFM2.5-VL-3B; זו שושלת אחרת, וזו הסיבה הארכיטקטונית לכך שלא ניתן להחליף את שני המודלים זה בזה, לא משנה כיצד קוראים את טבלאות הבנצ'מרק.

חוזה הפלט קובע יותר מאשר הבנצ'מרקים.

שאל את LFM2.5-VL-3B שאלה על תמונה ותקבל בחזרה טקסט. זה שווה כסף כשהתשובה צריכה להיקרא על ידי אדם, להיות מתועדת כמחרוזת, או להיות מוזנת לשלב שמצפה לפרוזה. זו גם מגבלה שצריך להנדס סביבה: פלט שנוצר עלול לסטות, בקשה בצורת JSON עלולה לחזור בצורה שונה מזו שביקשת, וכל טוקן מחויב וממתינים לו. המודל מיועד במפורש לעבודת ראייה של תור בודד, תפוקה גבוהה והשהיה נמוכה — OCR באצוות של מסמכים סרוקים, זיהוי בזמן אמת ברכב, תרגום שילוט במכשיר — ומופנה במפורש הרחק משאלות ארוכות הקשר ועתירות הסקה, כגון "מה לא בסדר בשרטוט הזה."

Liquid AI d1-omni-600M עונה על שאלה צרה יותר באופן מובהק במעטפת אמינה יותר באופן מובהק. הממשק שלו הוא מצב — טקסט, JSON, תמונה אחת או יותר, או עד 30 שניות של דיבור — בתוספת קבוצה של שאלות בעלות שמות, שכל אחת מהן מצהירה על הטיפוס שלה. שאלת noul היא כן/לא וחוזרת כ-P(yes) בין 0 ל-1. שאלת choice בוחרת תווית אחת מתוך קבוצה שאתה נותן לה שם ומחזירה את התווית, רמת ביטחון, ואת ההסתברות של כל אפשרות. שאלת score מציבה את המצב על סולם סדור של שתיים עד עשר רמות ומחזירה את הרמה הצפויה עם ההתפלגות שלה. כמה שאלות יכולות להיות תלויות במצב אחד ולהיקרא במעבר אחד, כך שמונה השימוש בכרטיס הדגם מדווח output_tokens: 0. אין שלב יצירה, כלומר אין דבר כזה פלט שנכשל בפענוח.

מה שאתה מוותר עליו הוא כל מה שתשובה מיוצרת נושאת ותווית לא: ההנמקה, ההסתייגות, המשפט שאפשר להדביק לכרטיס, והיכולת לשאול שאלת המשך באותה שיחה. Liquid אומרת זאת בבירור — המודל אינו מודל צ'אט ואינו כותב טקסט. אם ה-pipeline שלך זקוק להסבר לצד הפסיקה, Liquid AI d1-omni-600M הוא החצי הלא נכון של הצמד, והתשובה הכנה היא להריץ את שניהם: LFM2.5-VL-3B כדי להפיק את הקריאה של התמונה, ו-Liquid AI d1-omni-600M כדי להפיק את ההחלטה לגביה.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

אין מספר ראייה ראש בראש, וזהו הממצא

המהלך האינסטינקטיבי הבא הוא להעמיד את מדדי הראייה זה מול זה. אינך יכול. עבור LFM2.5-VL-3B הספק מפרסם סט מלא — RefCOCO Macro Precision@1 ב-87.9, ScreenSpot-v2 ב-80.7, ChartQA ב-81.3, POPE ב-88.7, MMStar ב-63.3, BLINK ב-61.5, MuirBench ב-58.3, ToolSandBox ב-59.5, OCRBench v2 English ב-47.5, ו-RealWorldQA של 73.1 שעולה במעט על ה-71.1 של LFM2-VL-3B הקודם. כל אלה מדווחים על ידי הספק, אף אחד מהם לא הורץ מחדש באופן בלתי תלוי, ואף על פי כן אלה טענות ספציפיות לגבי יכולות ספציפיות שהקורא יכול לחייב את המעבדה לעמוד בהן.

בנוגע ל-Liquid AI d1-omni-600M, פוסט ההשקה אומר כי Decision Index v0.3 כולל פיצול ראייה פרטי "שאיננו מדווחים עליו במהדורה הזו", ובמקום זאת Liquid AI אימתה שהצ'קפוינט 600M "מטפל בכל שלוש המודליות", כאשר הראיות הוצגו בהדגמות playground. זהו כל התיעוד המפורסם בנושא ראייה. אין מספר ביינצ'מרק לתמונות עבור הצ'קפוינט הזה, לא בכרטיס המודל שלו ולא בפוסט ההשקה. אותו פוסט מאשר מה שחסר בצד האודיו אף ביתר ישירות: ביינצ'מרקים ייעודיים להחלטות אודיו הם, במילותיו של הספק עצמו, "כרגע בעיה פתוחה".

אז הקריאה הנכונה של העימות היא א-סימטרית, ויש לתאר אותה ככזו. LFM2.5-VL-3B הדגים יכולת ראייה עם מספרים שמאחוריה. ל-Liquid AI d1-omni-600M יש מקודד ראייה שאול ממודל אחים, מתאם שאומן מול עמוד שדרה קפוא, הדגמה, והבטחה. אם הפריסה שלך צריכה שהמודל יהיה צודק לגבי תמונות החודש, ה-3B הוא היחיד מבין השניים שיש לו על מה להסתמך.

מהירות: רק אחד מאלה נמדד

מכיוון שמודל החלטה אינו מייצר דבר, זמן השהיה הוא המספר שחשוב, ושוב רק צד אחד מתועד. LFM2.5-VL-3B מצוטט ב-228 אסימונים לשנייה על Apple M5 Max וב-116 אסימונים לשנייה על AMD Ryzen AI Max+ 395, שניהם בתוך 3.3 GB של זיכרון, עם כ-20 אסימונים לשנייה על Galaxy S26 Ultra וכ-11,000 אסימונים לשנייה על H100 בודד תחת vLLM. נתונים אלה מתארים תפוקת פענוח, שהיא המדידה הנכונה עבור מודל שכותב.

עבור Liquid AI d1-omni-600M, כרטיס המודל מציין שמספרי הסקה אינם מדווחים מכיוון שהמודל הוא מהדורת מחקר מוקדמת ונמצא בפיתוח פעיל. לאח d1-3B באותה משפחה כן יש טבלאות השהיה — 8 ms לשאלה אחת על RTX 4090, 16 ms על Jetson AGX Thor, 26 ms על Jetson AGX Orin 64 GB, 50 ms על Orin Nano, כאשר שלוש שאלות על מצב אחד עולות בערך פי 1.3 מהזמן של שאלה אחת. המספרים האלה שייכים למודל ההחלטות 3B ואסור להחילם על ה-600M. עבור Liquid AI d1-omni-600M, העמדה הכנה היא שהארכיטקטורה מרמזת על מודל קטן ומהיר, ואף אחד מחוץ למעבדה לא פרסם נתון במילישניות.

ניתן לכל הפחות להעריך את טביעת הרגל של המשקלים. ברמת הדיוק float16 שהכרטיס ממליץ עליה, 587M פרמטרים הם בערך 1.2 GB של משקלים לפני אקטיבציות — חישוב על סמך מספר הפרמטרים שפורסם, לא מדידה של ספק — לעומת פחות מ-3.3 GB ש-Liquid מדווחת עבור LFM2.5-VL-3B. במכשיר שבו המגה-בייטים הם האילוץ, ההבדל הזה הוא הטיעון לטובת ה-600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

איך לבחור ביניהם

הבחירה נפתרת באופן נקי ברגע שחוזה הפלט נתפס כקבוע ולא כנתון למשא ומתן.

פנה אל LFM2.5-VL-3B כאשר התוצר הוא טקסט: OCR של עמוד שלם עם תיוג פריסה, עיגון וזיהוי מתוך שאילתות בשפה טבעית, תרגום שלטים במכשיר, כל שלב שבו אדם או מודל שפה במורד הזרימה צורך את התשובה. יש לו גם את ההקשר הרחב יותר של 32,768 טוקנים ואת כיסוי השפה העמוק יותר בפועל, כי התשובות שלו הן שפה ולא תוויות.

פנה אל Liquid AI d1-omni-600M כאשר התוצר הוא החלטה: ניתוב כרטיס, מיון פריים, פיקוח על קליפ, החלת שער על guardrail, דירוג תגובה בסולם של שתיים עד עשר — ובאופן ייחודי מבין השניים, כאשר הקלט הוא דיבור. זהו היחיד מבין השניים שמקבל אודיו בכלל, עד 30 שניות לבקשה, אם כי הכרטיס שלו מציין שהאודיו אומן על חילופי דברים בין דובר אנגלית לבין עוזר, וזהו תיאור צר של העולם שממנו יגיעו הקריאות שלך.

אל תבחר באף אחד מהשניים, והישאר עם מודל חזותי-לשוני כללי, אם המשימה מחייבת הסקה על התמונה ולא קריאה או הכרעה לגביה. שני כרטיסי המודל מצביעים הרחק ממקרה השימוש הזה, ול-Liquid AI d1-omni-600M אין מנגנון לנסות זאת.

מנסה צ'קפוינט ניסיוני בלי להמר את הפייפליין עליו

Liquid AI d1-omni-600M הוא, לפי התיוג של הספק עצמו, מהדורת מחקר מוקדמת, והתנהגות הראייה והאודיו שלו לא נבחנה בבנצ'מרקים. זה בדיוק הפרופיל של מודל שתרצו להעריך מאחורי מנגנון גיבוי ולא מול לקוחות. OrcaRouter מנתב יותר מ-200 מודלים דרך מפתח API אחד עם מעבר אוטומטי לגיבוי בין ספקים, וזו הדרך הזולה להציב צ'קפוינט כזה על מסלול חי: אם המסלול הניסיוני נפגע או שספק נופל, הבקשה נוחתת על הגיבוי בלי שינוי בקוד. אותו מפתח נושא כל מודל שהצינור מעביר אליו, במחיר המחירון של כל ספק כפי שהוא, עם תוספת של 0%, כך שהורדת מחיר של ספק היא המחיר שלכם באותו היום.

הסתייגות אחת, שנאמרת משום שהיא מהותית: המודלים open d1 ומשפחת LFM2.5-VL אינם בקטלוג שלנו היום. אירוח עצמי של המשקולות הוא הדרך שהספק ממליץ עליה עבור שניהם, עם תמיכת llama.cpp מהיום הראשון על פני חומרה של Apple, AMD, Qualcomm ו-NVIDIA, והרצתם על נקודת קצה מתארחת משמעה ה-API של הספק עצמו או פלטפורמות של צד שלישי. קריאת העמוד הזה כטענת זמינות תהיה טעות.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

מה לצפות

השאלה המעניינת אינה אם ה-600M בסופו של דבר יגבר על ה-3B במשהו — הוא לא יעשה זאת, וזה גם לא מה שהוא נבנה בשבילו. השאלה היא אם Liquid AI תפרסם את פיצול הראייה הפרטי שהיא נמנעה מלפרסם, ואם מישהו יבנה את בנצ'מרק ההחלטות מבוסס האודיו שהמעבדה אומרת שעדיין אינו קיים. עד שאחד מאלה יקרה, השוואה בין Liquid AI d1-omni-600M ל-LFM2.5-VL-3B היא השוואה בין מודל מדוד למודל סביר. בעבודה לא מדודה — דיבור נכנס, הכרעה יוצאת, קטן מספיק כדי לשכון על המכשיר — ה-600M הוא הצ'קפוינט היחיד עם משקולות פתוחות במשפחה הזו שמנסה זאת, ולהיות ראשון בלי לוח תוצאות הוא עדיין להיות ראשון.

OrcaRouter מנתב 200+ מודלים דרך מפתח API אחד, עם מחיר המחירון של כל ספק מועבר הלאה עם 0% תוספת כך שהורדת מחיר של ספק היא המחיר שלך באותו היום.