
Liquid AI d1-3B ו-d1-omni-600M: משקלים פתוחים למודלים שלעולם לא כותבים מילה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Liquid AI d1-3B ו-Liquid AI d1-omni-600M הועלו ל-Hugging Face ב-7 באוקטובר 2026, ולשני הצ'קפוינטים יש תכונה שהופכת כל טבלת השוואה שקראתם השנה לטבלה בצורה הלא נכונה. אף אחד מהם לא מייצר טקסט. אתם מוסרים ל-Liquid AI d1-3B מצב — כרטיס תמיכה, מטען JSON, תמונה, או את שלושתם בבת אחת — וקבוצה של שאלות בעלות שמות, והוא מחזיר תשובות שנשלפו ישירות מההתפלגות של המודל על האפשרויות שלכם. כן/לא כהסתברות. בחירה מבין תוויות עם רמת ביטחון ווקטור הסתברויות מלא. מיקום על סולם סדור. אין שלב דגימה, אין JSON לפרסר, אין יצירה משתוללת, ומונה השימוש של הספק עצמו מדווח את הדבר בפשטות: output_tokens: 0. מודל ה-3B הוא הכותרת — הוא מציג 48.57 ב-Decision 0.2.1 המדורג על ידי הספק, לפני כל מה שמתחת ל-10B ולפני מודל החלטות שגדול ממנו פי שנים עשר. ה-600M, ה"אח" שלו, הוא זה ששווה לעקוב אחריו: הוא קורא תמונות ועד שלושים שניות של דיבור דרך אותן משקולות trunk, והוא מסומן כמהדורת מחקר מוקדמת.
מהו מודל החלטה, בפסקה אחת
הקטגוריה הזו נבנית כבר שנה תחת שמות כמו מודלים מסוג system-one ומסווגים-שאינם-מסווגים, וצמד ה-d1 הוא ההצהרה הנקייה ביותר שלה עד כה. מודל גנרטיבי נשאל שאלה וכותב תשובה; את התשובה יש לנתח, הניתוח יכול להיכשל, וכל טוקן שהוא כותב עולה לך כסף וזמן. מודל החלטה נשאל שאלה ומדווח מה הוא כבר מאמין בו. השאלות של Liquid מגיעות בשלושה סוגים. noul היא שאלת כן/לא, שנענית עם P(yes) בין 0 ל-1. choice בוחרת תווית אחת מתוך קבוצה בעלת שם ומחזירה את התווית, רמת ביטחון, ואת ההסתברות של כל אפשרות. score מציב את המצב על סולם סדור של שתיים עד עשר רמות ומחזיר את הרמה הצפויה עם ההתפלגות והמקרא שלה. מצב אחד יכול לשאת כמה שאלות בעת ובעונה אחת, והמצב והתמונות שלו נקראים פעם אחת עבור כולן.
התכונה האחרונה הזו היא כל ההצדקה העסקית. שלוש שאלות על פנייה אחת גובות פי 1.3 מהזמן של שאלה אחת, ולא פי 3, כי המודל מבצע מעבר קדימה אחד על הקלט וקורא ממנו כמה תשובות. אין מה לכתוב, ולכן אין מה לכתוב בצורה גרועה.
ה-3B וה-600M בנויים מכיוונים מנוגדים
כאן ההשחרור הופך למעניין מבחינה טכנית, וזה החלק שסיקור ההשקה פסח עליו ברובו. שני המודלים אינם חולקים אותה שושלת.
Liquid AI d1-3B נובע מ-LFM2.5-VL-3B, מודל הראייה-שפה מבוסס-פענוח בלבד של הספק. הוא מכיל 3.12 מיליארד פרמטרים, מקודד ראייה SigLIP2 NaFlex בעל 400M פרמטרים ומותאם-צורה, חלון הקשר של 32,768 טוקנים, אוצר מילים של 128,000 טוקנים, ושש-עשרה שפות מתועדות. כדי לבנות אותו, Liquid חישבה ממוצע של המשקלים של LFM2.5-2.6B ושל עמוד השדרה הטקסטואלי של LFM2.5-VL-3B, ערכה כיוונון עדין לנקודות ביקורת ממספר זרעים אקראיים ותערובות נתונים, ואז מיזגה שוב את התוצאות. הסיכום של הספק עצמו לגבי מה שהיה חשוב הוא מרענן ולא זוהר: אימון על קלטים ארוכים, ערבוב סדר אפשרויות התשובה, ואיתור קיצורי דרך בנתוני האימון תרמו יותר למספר הסופי מכל טכניקה מתקדמת.
Liquid AI d1-omni-600M נובע מ-LFM2.5-Encoder-350M, מקודד דו-כיווני — מין אחר לגמרי של רשת. סך הכול 587M פרמטרים, המחולקים לגזע משותף ולראש החלטה בהיקף 381M, מקודד חזותי של 94M שאול מ-LFM2.5-VL-450M, ומקודד אודיו של 112M הבנוי מ-FastConformer בעל 17 שכבות. כל מודאליות עוברת דרך אותם משקלי גזע. ההקשר שלו הוא 16,384 אסימונים המכסים יחד עמדות של טקסט, תמונה ואודיו, וכאשר תמונות מצורפות טקסט המצב והשאלה נחתך ל-896 אסימונים, משום שזה מה שעליו הוא אומן. האודיו מקבל אזהרה אחת שהכרטיס מציין ללא סייג: היכולת אומנה על בקשות בין דובר אנגלית לבין עוזר, והקטעים נחתכים בשלושים שניות.
אז המשפחה היא לא מודל אחד בשני גדלים. היא מפענח ומקודד, שעברו אימון לאחר מכן כדי לבצע את אותה משימה בשני מנגנונים שונים לחלוטין, שאחד מהם רואה ואחד מהם שומע.

המספרים, ולמי הם שייכים
כל נתון בסעיף זה הוא של Liquid עצמה. שורות ה-Decision Index עבור מודלי d1 קיבלו ניקוד מהספק באמצעות כלי הניקוד הרשמי — ולא הוגשו ללוח המובילים — ואילו כל שורה מתחרה מגיעה מלוח המובילים הציבורי ב-v0.2.1. אף מעבדה עצמאית לא שחזרה דבר מכך עדיין, והמודלים בני יומיים נכון לכתיבת שורות אלו.
• Decision Index 0.2.1 — Liquid AI d1-3B מקבל ציון 48.57 עם ציוני משנה: ידע 23.8, שפה 56.4, אחזור 52.8, כלים 74.5 ואמנויות 36.3. Liquid AI d1-omni-600M מקבל 15.95, כאשר ציון כלים עומד על 15.1.
• המקום של 48.57 — ראשון מבין כל מה שמתחת ל-10B בטבלה שהספק פרסם, ומקדים את Decider 35-A3B עם 47.11. הוא שני בסך הכול, אחרי Winnow-12B עם 50.02, שגודלו פי ארבעה.
• מדדי טקסט, לפי דיווח הספק — d1-3B מגיע לממוצע של 82.9 בשבעה מדדים ציבוריים, ומעל ה-81.1 של Decider 4B; d1-omni-600M מגיע לממוצע של 78.4, אשר עוקף את ה-77.1 של Decider 2B בכרבע בערך ממספר הפרמטרים. ה-600M מציג את ציון הרעילות הטוב ביותר בטבלה (Civil Comments 95.8) ואת ציון הפרפרזה הטוב ביותר שלו (PAWS-X 79.5).
• ראייה, לפי דיווח הספק — d1-3B משיג בממוצע 74.1 על פני אחד-עשר מבחני תמונות ציבוריים, הנקראים כהחלטות בין האפשרויות של כל מבחן, לעומת 73.9 עבור עמוד השדרה LFM2.5-VL-3B שלו. הסרת התמונות מורידה את אותן שאלות ל-45.1, וכך הספק מראה שהתשובות מגיעות מהפיקסלים.
• השהיה, כפי שנמדדה על ידי הספק — שאלה אחת אורכת 8 מילישניות על RTX 4090 ו-9 מילישניות על AMD MI325X; 16 מילישניות על Jetson AGX Thor, 26 מילישניות על Jetson AGX Orin 64 GB, 50 מילישניות על Jetson Orin Nano הקטן ביותר, ו-30 מילישניות על Apple M5 Pro. שישים וארבעה מצבים ארוזים במעבר בודד פועלים בקצב של 475 לשנייה על ה-4090.
• מה חסר — ל-d1-omni-600M אין כלל טבלת הסקה. Liquid מציינת שהוא נמצא בפיתוח פעיל ופשוט אינה מדווחת על השהיה עבורו. כמו כן, אין שום בנצ'מרק להחלטות אודיו בשום מקום במהדורה, מכיוון שלדברי הספק, בנצ'מרקים ייעודיים להחלטות אודיו הם כיום בעיה פתוחה.
הטענה שההודעה באמת מעלה
יומיים לפני שהמשקלים עלו, Liquid פרסמה את הגרסה המתארחת של המודל הזה והריצה אותה מול GPT-6.1 Sol ו-Claude Opus 5.5 על שישה יישומים. הסיכום שלה: d1 משתווה ל-GPT-6.1 Sol או עולה עליו בארבעה מתוך השישה, עלותו נמוכה פי 19 עד פי 200, והוא עונה מהר יותר בכל משימה. המתודולוגיה שפורסמה שווה קריאה לפני שחוזרים על משהו מזה — כל יישום הורץ פעם אחת לכל מודל ב-5 באוקטובר 2026, מודלי הצ'אט ענו ב-JSON בהגדרת החשיבה שלהם כברירת מחדל, והעלות של d1 חושבה לפי $0.04 למיליון טוקנים בקלט.
ההדגמות הן החצי המשכנע יותר. מיון חלקים תקינים ופגומים מארבעה קווי ייצור — לוחות מעגלים, נרות, קשיו, מסטיק — בדיוק של 85 עד 97%, על מודל שמעולם לא אומן למשימה והבין אותה מתיאור קצר. פרדיקט SQL שעונה כן או לא עבור כל אחד מ-150 כרטיסי תמיכה. לולאת דחיסת הקשר שקוראת כל פלט כלי בסשן של סוכן קידוד ושומרת, מקצרת או משליכה אותו, ומסירה 52% מהטוקנים תוך שמירה על כל פלט שהמשימה צריכה. ב-Tetris, הוספת המסך למשחק שניתן לתאר כולו בטקסט העלתה את הניקוד מ-70 שורות שנמחקו ל-81 — תוצאת ראייה שלא ניתן להשיג ממסווג טקסטואלי בלבד, לא משנה כמה הוא טוב.
אלה הדגמות שמפעילים ספקים, עם משימות שנבחרו על ידי הספק, וכך כתוב בפרק המתודולוגיה. הן עדיין התמונה הבהירה ביותר שמישהו פרסם של המטרה שלשמה נועד מודל החלטות.

היכן הוא פועל, ומה העלות של קריאה אליו
המשקלים הפתוחים נבנו להרצה מקומית, והספק ביצע את עבודת האינטגרציה מראש: תמיכה מיום הראשון ב-llama.cpp, מלוא מחסנית NVIDIA מ-DGX ועד Jetson, כימות NVFP4, וגרסת משקלים/אקטיבציות של 8 סיביות שפורסמה לצד נקודת הביקורת הבסיסית. המרות GGUF כבר זמינות ב-Hugging Face. אם אתם מעדיפים שלא לארח דבר בעצמכם, Liquid מגישה את d1 המתארח דרך ה-API שלה — טוקנים של קלט בלבד, ללא טוקנים של פלט, כאשר תמונות מחויבות כקלט בקצב של 1.5 טוקנים לכל רבב של 32×32 פיקסלים, מה שהופך תמונה בגודל 1024×1024 ל-1,536 טוקנים. גישה בטקסט בלבד זמינה גם דרך פלטפורמות צד שלישי.
הערת הניתוב הכנה: לא Liquid AI d1-3B ולא Liquid AI d1-omni-600M נמצאים בקטלוג שלנו, והמאמר הזה אינו טענת זמינות לאף אחד מהם. מה שצמד ה-d1 משנה עבור נתב הוא צורת הפייפליין סביבו. מודל החלטה שמשיב במילישניות ולא עולה כלום בטוקני פלט הוא מסנן, לא תחליף — המיון של תקינים ופגומים וטריאז' הכרטיסים מתרחשים לפני הקריאה הגנרטיבית, והקריאה הגנרטיבית היא המקום שבו נקודת קצה אחת על פני יותר מ-200 מודלים, מחירי רשימה המועברים הלאה בתוספת של 0%, ומעבר אוטומטי באמת מצדיקים את עצמם. שכבה אחרת, אותו פייפליין.
מה יכריע את הוויכוח
שלושה דברים נותרו בלתי פתורים, וכל שלושתם מהסוג שרק הזמן סוגר.
הראשון הוא שחזור בלתי־תלוי. מספרי Decision Index הופקו על ידי הספק עם הכלי הרשמי לחישוב ניקוד, וכל שורת מתחרה נלקחה מלוח מובילים ציבורי, וזו שיטה שאפשר להגן עליה ואינה אותו דבר כמו צד שלישי שמריץ את המודל שלך. השני הוא אודיו. נקודת ביקורת (checkpoint) של 600M שמנתבת פקודת קול במעבר קדימה אחד היא יכולת חדשה ממש, ואין בנמצא מדד שבוחן אם היא עושה זאת היטב. השלישי הוא הקטגוריה עצמה: כשהתשובה נקראת מתוך התפלגות ולא נכתבת במפורש, אופני הכשל הרגילים של מודל קטן — לופים, סטייה, סירוב, הזיית פורמט — פשוט לא יכולים להתרחש, ואיש לא פרסם תיאור טוב של מה שמחליף אותם. שגיאת כיול היא המועמדת המובנת מאליה, והיא בדיוק מה ששדה הביטחון בכל תשובה מזמין אותך למדוד בעצמך.
עשר הדגמות מריצות את Liquid AI d1-3B בלולאה על קלט מצלמה חי במרחב Hugging Face ציבורי, וזו הדרך הזולה ביותר לגבש לעצמכם דעה. המשקלים חופשיים והשאלות ספציפיות. זו נקודת פתיחה טובה יותר מזו שרוב ההשקות של השנה מציעות.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
