
Liquid AI d1-3B מול Granite 4.2 3B: שני מודלים של 3B שלעולם אינם עושים את אותה עבודה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
העמד את Liquid AI d1-3B ואת Granite 4.2 3B על אותו GPU בודד, ושניהם ייכנסו בנוחות — 3.12B פרמטרים מצד אחד, 3B מצד שני. הם גם יתנהגו כאילו באו מתחומים שונים. Granite 4.2 3B, שכרטיס המודל של IBM עצמה מתארך אותו ל-25 באוגוסט 2026, הוא מודל הסקה: שלושה מצבי חשיבה, <think> בלוק, ותשובה שאתה קורא. Liquid AI d1-3B, שהועלה ל-Hugging Face ב-5 באוקטובר 2026 והוכרז על ידי Liquid יומיים לאחר מכן, הוא מודל החלטה: הוא מקבל מצב בתוספת קבוצה מפורשת של שאלות עם טיפוסים ומחזיר הסתברות, תווית או מיקום על סקאלה במעבר קדימה אחד, ומדווח output_tokens: 0 כי הוא אף פעם לא כותב דבר. השאלה השימושית היא לא איזה מהם טוב יותר. היא איזו מהקריאות שלך היא בעצם החלטה, כי שני המאגרים בנויים לשני החצאים המנוגדים של הפיצול הזה.
מה בעצם יש בכל מאגר?
כל מה שלהלן מגיע משני כרטיסי המודל ומפוסט ההכרזה של Liquid. שום דבר כאן לא שוחזר באופן עצמאי, שום צד שלישי לא דירג אף אחד מהמודלים על אותה מערכת בדיקה, והמספרים בכרטיסים הם של הספקים עצמם.
• גודל — Liquid AI d1-3B, 3.12B בסך הכול, מבוסס על LFM2.5-VL-3B של Liquid; Granite 4.2 3B, טרנספורמר צפוף decoder-only בעל 3B המבוסס על granite-4.1-3b-base
• פלט — d1-3B מחזיר הסתברויות, תוויות ורמות ביטחון ואינו כותב טקסט כלל; Granite 4.2 3B מייצר טוקנים, כולל שרשרת מחשבה אופציונלית בתוך <think> תגיות
• הקשר — d1-3B 32,768 טוקנים; Granite 4.2 3B 128K באופן מקורי, עם הרחבת הקשר ארוך ל-512K בכרטיס
• קלט — טקסט d1-3B, JSON, תמונות או שילוב, דרך מקודד חזותי SigLIP2 NaFlex 400M; Granite 4.2 3B טקסט בלבד
• רישיון — d1-3B תחת רישיון LFM Open של Liquid גרסה 1.0; Granite 4.2 3B תחת Apache 2.0
• שפות — d1-3B מפרט 16; Granite 4.2 3B מפרט שתים עשרה שנבדקו, כאשר הכרטיס מציין שאחרות לא נבדקו
• הגשה — d1-3B מגיע עם קוד מותאם אישית (trust_remote_code=True, transformers>=5.14), עם מאגרי GGUF ו-w8a8 באותה משפחה וכרטיסים מתועדים עבור llama.cpp, Ollama ו-LM Studio; Granite 4.2 3B פועל תחת vLLM 0.20+ או SGLang 0.5.18+ עם מנתח חשיבה מותאם אישית
שתיים מהשורות האלה עושות יותר עבודה מהשאר. שורת הפלט היא כל הטיעון של המאמר הזה, ושורת הרישיון היא זו שאף אחד לא מכניס לטבלת ההשוואה.

אחד כותב שרשרת מחשבות, והשני מסרב לכתוב
Granite 4.2 3B מצדיק את עצמו בכך שהוא חושב בקול רם. הכרטיס שלו מתעד שלושה מצבים: חשיבה פעילה כברירת מחדל, ללא חשיבה, ומצב במאמץ נמוך ששומר על מסלול ההיסק אך מקצר אותו. מערכי ההגשה מפרידים בין מסלול ההיסק לבין התשובה הסופית, כך שהיישום שלך מקבל תוכן נקי בתוספת שדה היסק נפרד. זהו עיצוב טוב לשאלה שצריכה להיפתר — בעיית מתמטיקה, ענף בלוגיקה, קטע קוד שצריך לכתוב לפני שאפשר לשפוט אותו.
ל-d1-3B אין מצב כזה, והכרטיס שלו אומר זאת באופן בוטה: "זה אינו מודל צ'אט ואינו כותב טקסט." קריאה מצהירה על שאלות עם סוג. noul הוא כן/לא שמחזיר P(yes) בין 0 ל-1. choice בוחר תווית אחת מתוך קבוצת אפשרויות בעלת שם ומחזיר את התווית, רמת ביטחון והסתברות לכל אפשרות. score מציב את המצב על סקאלה סדורה של שתיים עד עשר ומחזיר את הרמה הצפויה עם ההתפלגות והמקרא שלה. האות נקרא מהלוגיטים במיקום מציין מקום במעבר אחד, ולא נדגם אסימון אחר אסימון, ולכן בלוק השימוש יכול לדווח על אפס אסימוני פלט בלי לשקר.
ההבדל הזה משנה את החשבון שלך לפני שהוא משנה את הדיוק שלך. קריאת סיווג של Granite שחושבת במשך 400 טוקנים היא קריאה שאתה משלם עליה 400 טוקני פלט, והתווית שרצית קבורה בפרוזה שמנתח צריך אחר כך לחלץ. קריאה של d1-3B מחייבת רק קלט. אם רוב התעבורה שלך היא תווית עם כלל מצורף, שילמת על החשיבה בין אם היא שינתה את התווית ובין אם לא.
היכן ש-Granite 4.2 3B הוא בבירור הבחירה הטובה יותר
קבלו את בנצ'מרקים ההיסק כפשוטם — הם של IBM עצמה, הורצו דרך פייפליין פנימי של NeMo Evaluator, ואף גורם חיצוני לא שחזר אותם — וה-3B חזק באופן יוצא דופן ביחס לגודלו: AIME25 78.33, HMMT February 2025 66.67, GPQA 54.80, LiveCodeBench v6 69.71, MMLU-Pro 67.84, IFBench 74.33, BFCL v4 52.41, tau3-bench 45.78, ו-RULER 64K 67.52 שיורד ל-55.30 ב-128K.
ארבע משרות נובעות מהרשימה הזו, ו-d1-3B אינו נכלל באף אחת מהן.
• הקשר מקורי של 128K, הניתן להרחבה ל-512K, לעומת 32,768 טוקנים ב-d1-3B — אם המצב שלך הוא מסמך ארוך, הבחירה נעשית עבורך
• קריאה אגנטית לכלים עם מנתח מתועד ואינטגרציות הרנס עבור OpenCode, Pi ו-OpenHands, שלדגם החלטה אין מקבילה לכך
• כל משימה שתשובתה היא פסקה: סיכום, ניסוח, חילוץ למבנה חופשי, יצירת קוד
• כיוונון עדין והפצה מחדש ללא תקרת הכנסות, מכיוון של-Apache 2.0 אין סעיף סף
שימו לב למה שלא מופיע בכרטיס של Granite: השורות של SWE-Bench ו-Terminal-Bench מסומנות NA עבור דגם ה-3B. שלב למידת החיזוק הסוכנית (agentic RL) של IBM הוחל רק על חברי המשפחה בדגמים 8B ו-30B, ולכן המודל הקטן ביותר אינו נושא את הציונים הסוכניים שנשאים אחיו הגדולים. צוות שקורא "Granite 4.2" ומניח שה-3B יורש את הפרופיל הסוכני של המשפחה — צפויה לו הפתעה.

איפה d1-3B מנצח לפני ש-Granite מסיים לחשוב
טבלת השיהוי של Liquid עצמה, הנמדדת במצב חם, בקשה אחת בכל פעם, היא החלק החזק ביותר בטיעון שלה: שאלה בודדת תוך 8 מילי-שניות על RTX 4090 ו-9 מילי-שניות על AMD MI325X, 16 מילי-שניות על Jetson AGX Thor ו-26 מילי-שניות על Jetson AGX Orin 64GB, כאשר 64 מצבים נדחסים למעבר אחד בקצב של 475/s על ה-4090 ו-1,106/s על ה-MI325X. כדי להמחיש את קנה המידה, זה בערך הזמן ש-Granite 4.2 3B צריך כדי לפלוט כמה טוקנים ממסלול החשיבה שלו.
שלושה סוגי שאלות על מצב אחד עולים ל-d1-3B 21 מ"ש על ה-4090 במקום שלוש קריאות נפרדות, מכיוון שהמצב והתמונות שלו נקראים פעם אחת עבור כל השאלות. במערכת מודרציה או ניתוב שהייתה שולחת בקשת HTTP אחת לכל כלל, זה ההבדל בין תור של קריאות לאחת.
הוא גם רואה. d1-3B משיג ממוצע של 74.1 ב-11 בנצ'מרקים ציבוריים לתמונות, לעומת 73.9 של מודל הבסיס שלו, והכרטיס מציין שבלי התמונות אותן שאלות מקבלות 45.1 — התשובות מגיעות מהתמונה, לא מהנחיית הטקסט. שורות בודדות נעות לשני הכיוונים (CV-Bench 82.1 לעומת 87.6 של מודל הבסיס, POPE 88.5 לעומת 90.1), כך שטענת הראייה היא "ברמה של מודל הבסיס", לא "טובה יותר ממנו".
המשקל הנגדי ההוגן: 48.57 של d1-3B ב-Decision Index 0.2.1 הופק על ידי Liquid שהריצה בעצמה את כלי הניקוד הרשמי, ולא על ידי הגשה ללוח התוצאות, והשורות המתחרות מגיעות מלוח התוצאות הציבורי. הממוצע שלו, 77.1, על פני שמונה משימות benchmark-as-decision, וה-71.8 שלו ב-DecisionBench, הם אף הם ממקור ראשון. כל מה שבצד d1 של ההשוואה הזו אינו מאומת.

מדוע מודל הסקה של 3B אינו מודל קבלת החלטות של 3B
המהלך המפתה הוא להתייחס ל-Granite 4.2 3B כתחליף זול יותר ל-d1-3B, או להיפך. שניהם נכשלים, והכישלון הוא מבני ולא עניין של איכות.
אם תבקש מ-Granite להחליט, תקבל פלט שעליך לפרסר, חיוב שמשתנה בהתאם למידת הקושי שבה המודל ראה את השאלה, וזמן השהיה שתלוי במצב החשיבה שבחרת. אם תבקש מ-d1-3B לחשוב, לא תקבל דבר כלל — אין לו זרם טוקנים שבו יוכל לחשוב. שני המודלים נמצאים משני צדדיו של קו שרוב הפייפליינים חוצים כמה פעמים בכל בקשה: משהו צריך להחליט, ומשהו צריך לדבר. d1-3B שייך בחזית, שם כלל טריאז' בוחר מסלול ומחזיר רמת ביטחון מכוילת. Granite 4.2 3B שייך מאחוריו, בענף שצריך לכתוב בו תשובה.
ישנה מלכודת שנייה, שקטה יותר. הערך של מודל קבלת החלטות הוא כיול — רמת ביטחון של 0.9 שנכונה בתשע פעמים מתוך עשר. הכרטיס של Granite 4.2 3B אינו מפרסם מדדי כיול ואינו מפרסם הסתברויות; הוא מפרסם ציוני דיוק והסקה. השוואה בין השניים בלוח דירוג של בנצ'מרק לא מלמדת אותך דבר על מי מהשניים כדאי לסמוך עליו כשקובעים סף.
שורת הרישיון שאיש לא מכניס לטבלה
Granite 4.2 3B מופץ תחת Apache 2.0. d1-3B מופץ תחת LFM Open License v1.0, שנראה מתירני עד סעיף 5: שימוש מסחרי ניתן בתנאי שאתה או הישות המשפטית שלך תישארו מתחת לסף המוגדר באותו מסמך כהכנסה שנתית של עשרה מיליון דולר אמריקאיים או יותר, וכל שימוש מסחרי מעל לקו הזה פשוט אינו בר-רישיון. ארגונים ללא כוונת רווח ומשתמשים למטרות מחקר מוחרגים.
לחובב או לסטארטאפ זה לא מהווה בעיה. עבור חברה שחוצה את הקו הזה באמצע השנה — או שעלולה להירכש על ידי חברה כזו — שני המאגרים אינם ארטיפקטים שקולים, לא משנה עד כמה דומים נראים מספרי הפרמטרים שלהם, ובדיקת הרישיון מתרחשת זמן רב לאחר שמישהו כבר הוציא את האבטיפוס. זה הדבר הזול ביותר לבדוק מוקדם מבין כל מה שבדף הזה.
הרצת הזוג כצינור אחד
אף אחד מהמודלים אינו בקטלוג שלנו היום, כך שזו אינה הצהרת זמינות: שניהם ארטיפקטים באירוח עצמי, ול-Granite 4.2 3B בפרט אין בכלל ספקי הסקה הרשומים בכרטיס שלו. אבל הדפוס שצוות באמת מגיע אליו הוא קריאה אחת שמחליטה ואחרת שמדברת, והדפוס הזה הוא המקום שבו שכבת ניתוב זוכה למקומה. OrcaRouter מציב יותר מ-200 מודלים מאחורי מפתח API אחד עם מחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, כך שהורדת מחיר של ספק מגיעה לחשבון שלך באותו יום ולא בחידוש החוזה הבא, ומעבר אוטומטי בין ספקים בעת כשל פירושו שהרכיב המשותף באמצע צינור העיבוד אינו הופך לנקודת כשל יחידה בזמן שאתה עדיין מעריך אותו. אם אתה רוצה להשוות A/B בין d1-3B לבין מודל כללי באירוח על התעבורה שלך לפני שאתה מתחייב לפריסה באירוח עצמי, השכן המנותב הקרוב ביותר לשושלת של Granite הוא Gemma 4 31B במחיר של $0.13 למיליון טוקני קלט ו-$0.38 למיליון טוקני פלט — מודל גדול בהרבה, אבל אותו תפקיד של "כללי שכותב" בצינור העיבוד.
פסק הדין, כפי שנוסח ככלל
אם מה שאתה צריך הוא שיפוט — ספאם או לא, לאיזה תור, כמה דחוף, האם התמונה הזו תואמת את התיאור — d1-3B הוא היחיד מבין השניים שמבצע את העבודה במעבר אחד, והוא עושה זאת במילי-שניות חד-ספרתיות. אם מה שאתה צריך הוא תשובה כתובה, קריאה של מסמך ארוך, קריאה לכלי או קטע קוד, Granite 4.2 3B הוא זה שיש לו זרם טוקנים בכלל, וציוני ההיסק של ה-3B באמת מרשימים ביחס לגודלו — לפי ההערכות של IBM עצמה, כשאף אחד עוד לא בדק אותן.
מה שישנה את התמונה אינו שורת בנצ'מרק חדשה. אלא צד שלישי שמדרג את שני המודלים על אותה רתמת כיול, מפני שהתכונה שקובעת אם אפשר להציב סף על מודל היא זו שאף אחד מהכרטיסים לא מאפשר לך להשוות היום.
