כרטיס כותרת הירו שכותרתו 'Liquid AI d1-3B מול Intern-Decision-4B' עם כותרת המשנה 'איזה מכריע מכויל דרוש לך?', שמציג כרטיס שמאלי שכותרתו d1-3B הנושא את הצ'יפים '32,768 אסימונים' ו-'8 מילישניות על RTX 4090', כרטיס ימני שכותרתו Intern-Decision-4B הנושא את הצ'יפים 'מגבלת 8,192 אסימונים' ו-'44 מילישניות על RTX 4090', ורצועה רחבה מתחת לשניהם שעליה כתוב 'שניהם מחזירים הסתברויות, לא טקסט'.
Guides & Insights

Liquid AI d1-3B לעומת Intern-Decision-4B: איזה מכריע מכויל אתה באמת צריך?

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני מודלים עם משקולות פתוחות עונים כעת על שאלות בכך שהם לא כותבים דבר, ועד שמניחים את סכמות הקלט/פלט שלהם זו לצד זו הם נראים כמו אותו רעיון פעמיים. Liquid AI d1-3B, שהועלה ל-Hugging Face ב-5 באוקטובר 2026 והוכרז על ידי Liquid יומיים לאחר מכן, הוא מודל החלטות מולטימודלי בגודל 3.12B שכרטיס המודל שלו אומר בפשטות שהוא "אינו מודל צ'אט ואינו כותב טקסט". Intern-Decision-4B של InternLM, שהועלה בשקט לארגון InternLM ב-26 בספטמבר 2026 בלי פוסט בבלוג, בלי ציוץ ובלי דף השקה מאחוריו, הוא מודל החלטות בגודל 4B שעבר כוונון עדין מ-Qwen3.5-4B ואשר באופן דומה מחזיר התפלגות תשובות לכל שאלה במעבר קדימה אחד. אותו חוזה על פני השטח. ההבדלים שמתחת — רישיון שיסבך אתכם, חוזה שיכול לכתוב טקסט בטעות, ומכונות שאף אחד לא השווה — הם שקובעים איזה מהם שייך לסטאק שלכם.

עד כמה השניים באמת קרובים

הדבר הראשון שצריך להבהיר הוא כמה מההשוואה הזו מסתכם בתיקו. שני המודלים מקבלים מצב וסכימה של שאלות בעלות שמות, שניהם קוראים את הסיגנל מהלוגיטים במיקום של מציין מקום במקום לדגום, שניהם מולטימודליים, ושניהם מדווחים שלא כתבו דבר. בצורת הקריאה הם כמעט זהים, וההבדלים המעניינים נמצאים בפרטים שבשוליים.

• גודל — Liquid AI d1-3B, ‏3.12B בסך הכול, מבוסס על LFM2.5-VL-3B של Liquid; Intern-Decision-4B, ‏4B (כ-4.54B לפי ספירת הטנסורים שמודפסת בכרטיס), עבר כיוונון עדין מ-Qwen3.5-4B

• סוגי שאלות — d1-3B ו-Intern-Decision-4B משתמשים באותם שלושה: noul עבור כן/לא, choice עבור אחד מתוך קבוצה בעלת שם, score עבור נקודה על סולם סדור

• שדות תשובה — d1-3B מחזיר את התשובה בתוספת ציון ביטחון והסתברויות; סכמת InternLM מחזירה התפלגויות בתוספת ערך ביטחון שכרטיס המודל מזהיר כי אינו הסתברות מכוילת

• מגבלת קלט — d1-3B 32,768 טוקנים של הקשר; Intern-Decision-4B תקרה של 8,192 טוקנים שמסרבת לבקשות ארוכות יותר באופן מוחלט במקום לקצץ, כאשר תמונות נספרות כנגדה

• רישיון — d1-3B תחת רישיון LFM Open License v1.0 של Liquid, ו-Apache 2.0 מצד InternLM

• שפות — d1-3B מפרט 16; הכרטיס של Intern-Decision-4B אינו מציין אף אחת

• ממשק — d1-3B מגיע כמודל שאתה טוען וקורא לו עם trust_remote_code=True; Intern-Decision-4B מגיע כספריית Python שאתה מתקין עם pip install, עם backend אחד מיושם, ושדה ה-model של הבקשה עצמה אינו יכול במפורש להחליף צ'קפוינטים

• הציון של הספקים עצמם — d1-3B ‏48.57 ב-Decision Index 0.2.1, חלוקה ציבורית; Intern-Decision-4B ‏90.02 בממוצע על פני טבלת שבע הקבוצות של עצמו, עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065

שני המספרים האחרונים האלה אינם ברי-השוואה, והתייחסות אליהם כלוח תוצאות תהיה הטעות הקלה ביותר לעשייה בעמוד הזה. הם מגיעים ממערכי בדיקה שונים, מקבוצות שאלות שונות וממעריכים שונים.

A two-column scoreboard for Liquid AI d1-3B and Intern-Decision-4B. The d1-3B column reads: Decision Index 48.57; parameters 3.12B; context 32,768 tokens; licence LFM Open License v1.0; calibration metric not published; one question 8 ms on an RTX 4090. The Intern-Decision-4B column reads: Decision Index not scored on it; parameters about 4.54B; context 8,192-token cap; licence Apache 2.0; calibration metric Brier 0.347, ECE 0.065; one question 44 ms on an RTX 4090. The footer reads 'Both columns vendor-reported from different harnesses; not comparable, not independently scored.'

הכיול הוא המוצר כולו, ורק אחד מהם עומד מאחוריו בכתב.

מודל החלטה שווה את זמן ההשהיה שלו רק אם המספר שהוא מחזיר לצד התשובה אומר משהו. זה מה שכיול הוא: רמת ביטחון מוצהרת של 0.9 אמורה להיות נכונה בערך תשע פעמים מתוך עשר, ומודל שבטוח וטועה גרוע ממודל שאומר שהוא לא יודע.

InternLM הוא זה שמתמודד עם זה. הכרטיס שלו מתעד טמפרטורה מותאמת של 1.99241824, שנגזרה ממזעור לוג-נראות שלילית על פני 1,728 מקרי כיול מיועדים, כאשר 1,693 הופרשו לאימות, ומודפסת עד שמונה ספרות עשרוניות כדי שניתן יהיה לשחזר אותה. הוא גם מפרסם פיילוט לפני ואחרי על 96 מקרים שמראה את המנגנון בפעולה במקום להצהיר על כך: Brier 0.628 ו-ECE 0.213 לפני כיול לעומת 0.550 ו-0.089 אחרי. Brier ו-ECE הם שני המדדים התקניים לשאלה אם הסתברויות מוצהרות הן כנות, וכיוון השינוי גדול.

Liquid אינה מפרסמת מקבילה לכך. הכרטיס של d1-3B עצמו מציג בנצ'מרקים בסגנון דיוק — SQuAD 2.0 ‏85.3, Civil Comments ‏93.0, MASSIVE intent ‏87.3, PubMedQA ‏66.0, BoolQ ‏86.7, XNLI ‏85.0, PAWS-X ‏76.9, ממוצע של 77.1 — לצד 48.57 ב-Decision Index, ונקודת המכירה המוצהרת של המודל היא תשובות מכוילות בעלות טיפוס. אבל אין שורה של ECE, אין שורה של Brier, ואין טמפרטורה מותאמת שפורסמה.

האסימטריה הזו לא אומרת שהצאצא של Qwen3.5-4B מכויל טוב יותר מאשר 3B שנבנה על LFM2.5-VL-3B; היא אומרת שבין שני הכרטיסים האלה, אחד מהם נותן לך את האריתמטיקה כדי לשחזר את הטענה והאחר נותן לך את הטענה. אם ה-pipeline שלך מציב סף על רמת ביטחון — לנתב מעל 0.8, להסלים מתחת ל-0.4 — אתה יכול לאמת את הצד של InternLM הלילה ואתה יכול רק לבדוק באופן נקודתי את הצד של Liquid.

ההסתייגות חלה בשני הכיוונים. שתי קבוצות המספרים הן ממקור ראשון. אף אחד מהמודלים לא הוערך על ידי גורם בלתי תלוי, וטענות הכיול של InternLM נשענות על פיילוט בן 96 מקרים של InternLM עצמו מול ההתאמה של InternLM עצמו.

הרישיון שמבקש ממך מספר

Intern-Decision-4B הוא תחת Apache 2.0, בירושה מ-Qwen3.5-4B, עם ההתראות במעלה הזרם נשמרות — שימוש מסחרי, הפצה מחדש, כיוונון עדין, בלי שאלת הכנסות בשום מקום בו.

d1-3B נמצא תחת רישיון LFM Open License v1.0 של Liquid, וסעיף 5 הוא החלק שאף אחד לא קורא עד שמחלקת הרכש קוראת אותו. שימוש מסחרי ניתן רק בתנאי שאתה או הישות המשפטית שלך נשארים מתחת לסף (Threshold), המוגדר באותו מסמך כהכנסה שנתית של עשרה מיליון דולר אמריקאי או יותר; שימוש מעליו פשוט אינו מורשה. מוסדות ללא כוונת רווח ומשתמשי מחקר מוחרגים.

עבור אדם יחיד או צוות קטן, שניהם בחינם. עבור כל דבר שיש לו מחלקת כספים, שני המאגרים הם מוצרים שונים, וההבדל הוא מספר — או שאתה נמצא מעליו, או שאתה לא.

הזנב של טבלת הבנצ'מרק של d1-3B הוא הטענה האמיתית שלו

הנתון הראשי בכרטיס של Liquid הוא 48.57 ב-Decision Index 0.2.1, לפני שאר השורות של מודלים מתחת ל-10B בטבלה שנעה מ-Winnow-12B ב-50.02 ועד Decider 2B ב-28.97. מה שהופך את המספר הזה לראוי לציטוט הוא מדד ההבחנה שנמצא מתחתיו. בתתי-הציונים של Decision Index עצמו, d1-3B משיג 74.5 ב-Tools ו-36.3 ב-Arts, בעוד שהוא מצליח להשיג רק 23.8 ב-Knowledge — לעומת Decider 35B-A3B, מודל mixture-of-experts של 36B, גדול פי 12 ממנו, שמשיג 56.5 ב-Tools, 32.6 ב-Arts ו-31.8 ב-Knowledge.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the paragraph that releases d1-3B and d1-omni-600M as open-weight models, the Decision Index v0.2.1 score of 48.57 with the claim that it is ahead of every model under 10B and on par with Decider 35B-A3B, and the 8 ms RTX 4090 latency line.

במילים אחרות, ה-3B אינו מודל קטן שהוא קצת גרוע יותר באופן אחיד. הוא מודל קטן שחזק באופן יוצא דופן בהחלטות מובנות בסגנון כלי עבודה, וחלש באופן יוצא דופן בשאלות שדורשות ידע עולם, והוא מנצח את ה-36B בשתי הקטגוריות שהכי דומות למשימה שלשמה הוא נבנה. אם ההחלטות שלך הן "איזו מבין חמש הפעולות הנקובות האלה" ו"האם זה מעוגן בקטע שאוחזר", פער הגודל עושה פחות עבודה ממה שהיית מצפה. אם ההחלטות שלך נשענות על עובדות שהמודל חייב כבר להחזיק, צפה שה-23.8 יופיע.

יש גרסה שנייה של הטיעון הזה בצד הראייה. d1-3B משיג בממוצע 74.1 על פני אחד-עשר מבחני תמונה ציבוריים, לעומת 73.9 עבור מודל הבסיס של עצמו, וכאשר מסירים את התמונות, אותן שאלות מקבלות ציון 45.1 — כך שבשאלות תמונה התשובות באמת מגיעות מהתמונה. הוא ברמה של מודל הבסיס שלו ולא טוב ממנו, והשורות לפי מבחן חותכות לשני הכיוונים: CV-Bench 82.1 לעומת 87.6, POPE 88.5 לעומת 90.1, BLINK 59.2 לעומת 58.7.

כדאי לציין גם את ההשהיה בכרטיס של InternLM: המצטבר הגבוה שלו נובע ממשימות מבוססות שאלות כגון Typed Decision 80.55 ו-ToolACE 96.45, בעוד Jevbench-Hard עומד על 73.87. במקום שבו הסכימה נעשית קשה, הציון יורד.

מהירות: הפער לא נמצא במקום שבו אתם מצפים לו

d1-3B מפרט 8 ms לשאלה בודדת על RTX 4090 ו-9 ms על MI325X, 21 ms עבור שלוש שאלות החולקות מצב אחד, 16 ms על Jetson AGX Thor, ותפוקה ארוזה של 475 החלטות בשנייה על ה-4090 ו-1,106 על ה-MI325X.

הכרטיס של Intern-Decision-4B מודד 44.16 ms בממוצע מקצה לקצה על אותו RTX 4090, עם חציון של 44.03 ms ו-44.60 ms ב-P95.

זה נראה כמו שיפור של פי 5, וזה לא, כי השניים מודדים דברים שונים. המספרים של Liquid הם קריאות מודל חמות, בקשה אחת בכל פעם, כאשר בחירת הקרנלים והקומפילציה משולמות מראש — הכרטיס אומר במפורש ששאלה בודדת עולה 16 מ״ש על ה-4090 ללא קומפילציה של CUDA graph, ושהקריאה הראשונה עם צורה חדשה משלמת את מחיר הקומפילציה. 44 המ״ש של InternLM הם מקצה לקצה לכל שאילתה דרך ספריית Python שהבקאנד היחיד שמיושם בה הוא הסקה מקומית של Hugging Face, כך שהיא נושאת את המנגנון שמסביב. אף אחד מהמספרים אינו שגוי. העמידו את שניהם תחת אותה מערכת בדיקה, על אותה מכונה, עם אותה צורת בקשה, והפער יתכווץ למשהו שתרצו למדוד במקום להניח.

מה שלא עומד לדיון הוא התקרה. 8,192 טוקנים הם סירוב מוחלט בצד של InternLM, וטוקנים של תמונות נגבים מאותו תקציב, כך שמסמך ארוך בתוספת צילום מסך הוא בקשה שחוזרת נדחית ולא מקוצרת. d1-3B נותן לך 32,768 טוקנים לעבוד איתם. אם המצבים שלך הם פניות והחלפות קצרות, הפער הזה אף פעם לא נושך. אם הם בגודל של עמוד, זה מכריע את השאלה לפני כל בנצ'מרק.

הרץ אותם כפאנל, לא כהחלפה

לענות על שאלת כן/לא ספציפית ולענות על "איזה מששת הדברים הנקובים זה, ובאיזו מידה אתה בטוח" הם מטלות שונות, ושני הכרטיסים שונים דיים בצורתם — האחד עם תקרת קלט קשיחה והתאמת כיול שפורסמה, האחר עם 32K של הקשר וזנב ניקוד טוב יותר — כך שהפריסה השימושית עבור צוות שמעריך את שניהם היא לעתים קרובות לא החלפה אלא פאנל: אותו מצב מוצג בפני שני המודלים, כאשר אי-הסכמות מנותבות לאדם או למודל גדול יותר.

אף אחד מהמודלים אינו בקטלוג שלנו, וזו אינה הצהרה על זמינות; שניהם תוצרים באירוח עצמי. אבל פאנל הוא בדיוק הצורה שבה שכבת ניתוב עושה את העבודה ולא את הניירת. OrcaRouter חושף יותר מ-200 מודלים מאחורי מפתח API אחד עם מחירי מחירון של הספקים מועברים הלאה במרווח של 0% — כך שכאשר ספק שאתה מנתב דרכנו מוריד את מחירו, החשבון שלך משתנה באותו היום — ומעבר אוטומטי בין ספקים בעת כשל מונע מפאנל של שני מודלים להפוך לשתי נקודות כשל בודדות. המודלים שאתה מנתב היום אינם שני אלה; הם הג'נרליסטים המתארחים שאותם היית מחליף, כגון Qwen3.5-27B במחיר של $0.086 למיליון טוקני קלט ו-$0.688 למיליון טוקני פלט, וזה המספר שמודל 3B באירוח עצמי צריך לגבור עליו לאחר שהבאת בחשבון את ה-GPU.

מה לעשות השבוע

אם ההחלטות שלך הן מצבים קצרים, הרישיון חייב לשרוד את הסקירה של החברה שלך, ואתה רוצה את המגוון הרחב ביותר של יעדי בנייה — llama.cpp, Ollama, LM Studio, מסלול אצווה דחוס שמריץ 64 מצבים במעבר אחד — d1-3B הוא היותר ממוצר מבין השניים, וההבחנה שלו בין כלים לאומנויות היא הדבר החזק ביותר שאחד משני הכרטיסים מפגין. אם ההחלטות שלך נמשכות על פני מצבים ארוכים, או שאתה צריך רישיון בלי סעיף הכנסות, או שאתה רוצה התאמת כיול שאתה יכול לשחזר וסביבת בדיקה שבה העלות הסובבת כבר נספרת, Intern-Decision-4B הוא זה שאת הניירת שלו אתה באמת יכול לבדוק.

A capture of the Hugging Face model card for internlm/Intern-Decision-4B, showing the Apache 2.0 licence, the 5B safetensors file size, the description of a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution for every question in one forward pass, the download count of 2,756 for the last month, and the tags qwen3_5, decision-making and multimodal.

החלק הלא נוח זהה לשניהם: אף גורם בלתי תלוי לא הריץ את אף אחד מהמודלים, ולא קיימת השוואת כיול שלא הוזמנה על ידי הספק שכתב את הכרטיס. עבור סוג מודל שכל ערכו הוא המשמעות של מספר לצד תשובה, זהו הפער שכדאי לסגור לפני שמציבים סף על משהו.