כרטיס כותרת ראשי שכותרתו 'Liquid AI d1-3B vs Qwen 3 8B' עם כותרת המשנה 'האם עומס סיווג של 8B צריך לרדת?', המציג צינור של בקשה נכנסת המתפצלת לתיבה קטנה של d1-3B המסומנת 8 ms ו-0 אסימוני פלט ולתיבה גדולה יותר של Qwen 3 8B המסומנת 'כותב תשובה', כאשר צ'יפים של תווית וציון יוצאים מהתיבה הקטנה וצ'יפ פרוזה יוצא מהגדולה.
Guides & Insights

Liquid AI d1-3B לעומת Qwen 3 8B: האם עומס סיווג של 8B צריך לעבור למודל החלטה?

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Somewhere in most production stacks there is a Qwen 3 8B being paid to answer yes or no. It moderates a comment, tags a support ticket, decides whether a retrieved passage is relevant, or scores another model's output against a rubric — and it does that by generating text which something downstream then parses. Liquid AI d1-3B, the 3.12B decision model Liquid AI open-weighted on October 7, 2026, exists to do exactly that job without generating anything: a state in, a set of named questions in, and probabilities, labels and confidences out in a single forward pass with zero output tokens. Qwen 3 8B is the vendor's April 2025 open-weights workhorse — roughly 8.2B dense parameters, 119 languages, thinking on or off per request, and sixteen months of community deployment behind it. The question this pairing actually asks is narrow and practical: for the slice of your traffic that is a classification, is an 8B generalist the cheapest way to get a label in 2026, or has the shape of that job changed underneath it?

מה שאתה למעשה מבקש מ-8B לעשות

הנח את שני חוזי הפלט זה לצד זה, והאי־יעילות היא מבנית ולא מצטברת.

קריאת סיווג של Qwen 3 8B היא הפקה. אתה כותב פרומפט שמתאר את התוויות, המודל מנמק באופן אופציונלי על הקלט — ובמודל הזה אתה יכול להפעיל או לכבות את הנימוק הזה לכל בקשה בנפרד, וזהו הכפתור השימושי ביותר שיש לו לעבודה מסוג זה — ואז הוא כותב בחזרה תשובה. התשובה הזו היא טקסט. אם ביקשת JSON, תקבל בדרך כלל JSON, ולפעמים תקבל JSON בתוך משפט, או הקדמה, או הסבר בסוף שלא רצית. התווית שאכפת לך ממנה נמצאת איפשהו בזרם הטוקנים, ומנתח מחלץ אותה. אתה מחויב בעבור כל טוקן שהמודל כותב, כולל אלה שאתה זורק.

ל-Liquid AI d1-3B אין זרם טוקנים. שאלות מוצהרות עם סוג: noul עבור כן/לא, נענות כ-P(yes) בין 0 ל-1; choice עבור תווית אחת מתוך קבוצת אפשרויות בעלת שם, נענות בתור התווית בתוספת רמת ביטחון והסתברות לכל אפשרות; score עבור מיקום על סולם סדור מ-2 עד 10, נענות כרמה הצפויה עם ההתפלגות והמקרא שלה. התגובה נושאת סכום מצטבר שכתוב בו output_tokens: 0. אין מה לפרסר כי שום דבר לא נכתב, ויש מאחזר גולמי של probabilities כאשר רוצים את ההתפלגות הלא-מעוגלת ולא את ה-argmax.

החלק שמשנה את החשבון שלך הוא מה שקורה עם כמה שאלות. מצב אחד יכול להכיל הרבה: האם זו בקשת החזר, איזה צוות צריך לטפל בזה, עד כמה זה דחוף. המצב והתמונות שלו נקראים פעם אחת, ו-Liquid מדווחת ששלוש שאלות על מצב אחד עולות פי 1.3 מהזמן של שאלה אחת ולא פי 3. מה שזה לא מקפל הוא חיוב הקלט — הערת החיוב של הספק מפורשת שכל שאלה מחויבת כפרומפט נפרד משלה, כולל הטקסט שלה וכל התמונות שלה. פחות השהיה, אותם טוקני קלט. זו כוכבית כנה על הכותרת, וזה מסוג הדברים שאפשר למצוא רק בקריאת פסקת התמחור ולא בבנצ'מרק.

A two-column scoreboard for Liquid AI d1-3B and Qwen 3 8B. The d1-3B column reads: job a closed question answered; 3.12B parameters; output tokens billed 0; 32,768-token context; image input yes; one question in 8 ms on an RTX 4090. The Qwen 3 8B column reads: job text in, text out; about 8.2B dense parameters; output tokens billed every one it writes; 32,768 native context extending to 131,072 via YaRN; image input no; one answer as long as the answer is. The footer reads 'd1-3B figures vendor-reported; Qwen 3 8B figures per Alibaba, April 2025.'

מה נותנים לך שישה־עשר חודשים של Qwen 3 8B

לפני שמתייחסים למודל הקטן יותר כשדרוג, יש לדייק לגבי מה שהמודל הקיים מביא, כי מדובר ביותר ממספר פרמטרים.

• הקשר — Qwen 3 8B פועל עם 32,768 טוקנים באופן מובנה, ומתפרס עד 131,072 טוקנים מאומתים באמצעות YaRN. Liquid AI d1-3B פועל עם 32,768 טוקנים ללא הרחבה, ללא מסלול הרחבה מתועד. עבור מצב שהוא מסמך ארוך, ה-8B הוא היחיד מבין השניים שיכול להכיל אותו.

• שפות — 119 שפות וניבים עבור Qwen 3 8B לעומת שישה-עשר מתועדים עבור Liquid AI d1-3B.

• שליטה בחשיבה — Qwen 3 8B מאפשר לך להפעיל או לכבות את החשיבה בכל בקשה. ל-Liquid AI d1-3B אין מצב חשיבה לשלוט בו, וזה או פישוט או מגבלה, תלוי למה השתמשת בחשיבה.

• רוחב — ה-8B כותב, מסביר, מסכם, מתרגם ומתכנת. Liquid AI d1-3B לא עושה אף אחד מהדברים האלה. הכרטיס שלו מציין זאת בבירור: הוא אינו מודל צ'אט והוא אינו כותב טקסט.

• ראיות — ל-Qwen 3 8B יש שישה־עשר חודשים של בנצ׳מרק ציבורי, קוונטיזציה, כיונון עדין ושימוש בפרודקשן. ציון ה-Decision Index של 48.57 של Liquid AI d1-3B הופק על ידי Liquid באמצעות הסקורר הרשמי במקום להיות מוגש ללוח המובילים הציבורי, והוא בן ימים ספורים ללא שחזור מצד שלישי.

• ראייה — השורה הזו הולכת בכיוון ההפוך. Liquid AI d1-3B מקבל תמונות, כאשר הספק מדווח על 74.1 באחד-עשר מבחני תמונות ציבוריים, המתפרשים כהחלטות על מערך האפשרויות של כל מבחן, ומדווח שהסרת התמונות מצמצמת את אותן השאלות ל-45.1. ה-Qwen 3 8B, שהוא טקסט בלבד, זקוק למודל ראייה נפרד לפניו כדי לעשות משהו מכל זה.

• מהירות — שאלה אחת ב-8 מ״ש על RTX 4090, 16 מ״ש על Jetson AGX Thor, 50 מ״ש על Jetson Orin Nano, ו-64 מצבים ארוזים במעבר בקצב של 475 לשנייה על ה-4090. למסווג מבוסס ג׳נרציה אין מספר בר-השוואה, מכיוון שהשהייתו תלויה באורך התשובה.

הסיכום הכנה הוא ש-8B הוא הכלי הכללי הטוב יותר, ומודל ההחלטות 3B הוא המודל המיוחד הטוב יותר, והשאלה היחידה שחשובה היא כמה מהתעבורה שלך היא המקרה המיוחד.

חשבון העלויות, שנעשה בקפידה

זה המקום שבו ההשוואה או שמחזירה את עצמה או שלא, ולכן כדאי לעשות אותה עם מבנה אמיתי ולא עם סלוגן.

הטענה ש-Liquid פרסמה יומיים לפני שחרור המשקלים הפתוחים היא שמודל ההחלטות המתארח שלה משתווה ל-GPT-6.1 Sol או עולה עליו בארבע מתוך שש אפליקציות אמיתיות, בעלות נמוכה פי 19 עד פי 200, ומשיב מהר יותר בכל משימה. יש לקרוא את המתודולוגיה לפני שחוזרים על כך: כל אפליקציה הורצה פעם אחת לכל מודל ב-5 באוקטובר 2026, מודלי הצ'אט השיבו ב-JSON בהגדרת החשיבה שלהם כברירת מחדל, והעלות של d1 חושבה לפי $0.04 למיליון טוקנים של קלט. נתון ה-$0.04 הזה הוא המתארח d1 שיעור הקלט, וזהו השיעור היחיד שקיים — אין שורת פלט להוסיף.

כעת בנו אומדן באותו מבנה עבור מסווג Qwen 3 8B, ואי-הסימטריה נראית לעין בלי לצטט מחיר ספק של מישהו. ל-8B יש שתי שורות לחיוב בעוד שלמודל ההחלטה יש אחת, והשורה השנייה היא זו שגדלה: סיווג שמבצע הסקה תחילה משלם על ההסקה, וסיווג שמוסיף ריפוד ל-JSON שלו משלם על הריפוד. החיוב על הקלט של מודל ההחלטה נקבע לפי המצב והשאלות. זה של 8B אינו נקבע על ידי שום דבר שאפשר לחזות מהמצב בלבד.

שני משקולות נגד מונעים מכך להפוך לתבוסה מוחצת. ראשית, מודל ההחלטות מחייב כל שאלה כפרומפט בפני עצמו, כך שחמש שאלות על מסמך ארוך אחד מכפילות את הקלט פי חמישה — ה-8B שואל את כל החמש בקריאה אחת ומשלם על המסמך פעם אחת. שנית, וגדול יותר, מודל החלטות יכול לענות רק על שאלות שאומן לענות עליהן בצורה הזו. כל דבר שדורש הסבר, סיכום או שיפוט המבוטא במילים מחזיר אותך לג'נרליסט, ובפועל, גם למצב שבו אתה משלם על שניהם.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and its latency of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

מה ששניהם באמת טובים בו

הוצא את הבנצ'מרקינג מהתמונה, והפיצול נקי יותר ממה שמספרי הפרמטרים מרמזים.

Liquid AI d1-3B מיועד למשימות של כן/לא, בחירה מתוך רשימה ודירוג, ברצפת השהיה שאף מערכת גנרטיבית לא מגיעה אליה, על חומרה שכוללת Jetson Orin Nano בהשהיה של 50 מילישניות ומחשב נייד. היישומים שהדגימה Liquid באוקטובר היו כולם גרסאות של אותה תבנית — פרדיקט SQL שמשיב כן או לא עבור 150 פניות תמיכה, לולאת דחיסת הקשר של סוכן ששומרת, מקצצת או משליכה כל פלט של כלי ומסירה 52% מהטוקנים, ואפליקציית בדיקה שממיינת חלקים תקינים ופגומים מארבעה קווי ייצור בדיוק של 85% עד 97% במשימה שמעולם לא אומנה עליה, ושאותה הבינה מתיאור קצר. ההדגמה האחרונה היא ההצהרה הברורה ביותר למה שהקטגוריה נועדה לו: משימה שבה התשובה היא אחת מכמה אפשרויות, המצב הוא תמונה, ומעולם לא התבקש הסבר.

Qwen 3 8Bמיועד לעבודה שצריכה לחזור כלשון, או לפרוש על פני 119 שפות, או להכיל מסמך ארוך מ-32 אלף טוקנים, או לנמק בקול רם לפני שמתחייבים. זו גם התשובה הנכונה כשהסיווג אינו אחד משלושת הצורות שלמעלה — כשמערך התגיות פתוח, כשהקריטריונים מעודנים מספיק שרצית את החשיבה, כשאותה קריאה צריכה לטפל במקרה הקל ובמקרה הקשה בלי שתנתב בין שני מודלים. וזו הבחירה הבטוחה כשסוקר שואל אילו מבחני השוואה בלתי־תלויים קיימים, כי התשובה היא: הרבה, עד שנה וחצי אחורה.

הצוותים שעושים את זה נכון לא בוחרים. הם שמים את מודל קבלת ההחלטות לפני המודל הכללי, על החלק בתעבורה שבו התשובה היא מספר, ומשאירים ל-8B להתמודד עם כל מה שדורש משפט. המסנן הוא 3B ו-8 מ״ש; ה-8B נשאר בשביל המטען.

פריסת הזוג

Liquid AI d1-3B מגיע כקבצי משקולות כשעבודת הפריסה כבר נעשתה: תמיכה ב-llama.cpp כבר מהיום הראשון, מחסנית NVIDIA המלאה מ-DGX ועד Jetson, כימות NVFP4, גרסת 8 ביט למשקולות ולהפעלות, והמרות GGUF ב-Hugging Face. ל-Qwen 3 8B יש מערכת האקולוגית העשירה ביותר לאירוח עצמי מכל מודל במשקל הזה. אף אחד מהשניים אינו בקטלוג שלנו, ושום דבר כאן אינו מהווה הצהרת זמינות לגבי מי מהם — המסלול המאוחסן עבור Liquid AI d1-3B הוא ה-API של הספק עצמו ופלטפורמות צד שלישי, שבהן ה-d1 המאוחסן מתומחר לפי טוקני קלט בלבד ב-0.04 דולר למיליון, כאשר תמונות מחויבות לפי 1.5 טוקנים לכל טלאי של 32×32 פיקסלים.

ברגע ששניהם נמצאים באותו צינור עיבוד, בעיית הניתוב מפסיקה להיות תיאורטית. יש לך מודל קטן בבעלותך, מודל 8B שאולי תארח או תשכיר, ואת הקריאות הגנרטיביות שאתה בוודאות שוכר — ולהחליט עבור כל בקשה לאיזה מהם קלט נתון צריך להגיע זו בדיוק ההחלטה ששכבת ניתוב נועדה לקבל. נקודת קצה אחת על פני יותר מ-200 מודלים, מחירי המחירון של הספקים מועברים הלאה בתוספת של 0% כך ששינוי מחיר של ספק נכנס לתוקף אצלך באותו יום, מעבר אוטומטי לגיבוי כך שאחר צהריים רע של ספק במעלה הזרם לא הופך להשבתה אצלך. כשתעבורת הסיווג שלך נמדדת במיליארדי קריאות בשנה, השכבה הזו היא המקום שבו החיסכון ממודל החלטה של 3B באמת מתממש.

פסק הדין

אם ה-8B שלך נשאל שאלות סגורות — האם זה רעיל, האם זה רלוונטי, לאיזו תור זה שייך, כמה זה דחוף — אתה משלם את החשבון הדו-שורתי של גנרליסט ואת השהיית הדור עבור תווית, ו-Liquid AI d1-3B הוא תחליף ישיר עם שרשרת ראיות חלשה יותר והבדל רישיון אמיתי שיש לשקול. קבל את תקרת ההקשר של 32K, את שש עשרה השפות, ואת העובדה שאף אחד מחוץ ל-Liquid עדיין לא העריך אותו.

אם ה-8B שלך מתבקש להסביר, לסכם, לתרגם, להחזיק מסמך ארוך או לחשוב בהיגיון לפני קבלת החלטה, ההשוואה הזו לא חלה עליך. הישאר עם ה-8B, ושקול את מודל קבלת ההחלטות רק כמסנן מקדים לתעבורה שאתה יכול לזהות מראש כסוג הקל.

המספר המעניין שכדאי לשים לב אליו אינו ציון הבנצ׳מרק של מי מהמודלים. הוא כמה מהר יגיע השחזור העצמאי הראשון של d1 Decision Index, מפני שזה הרגע שבו ההשוואה מפסיקה להיות טענה של ספק והופכת לעובדה שאפשר לתכנן לפיה.

A capture of our own catalogue page for Qwen3 VL 8B Instruct, showing the model id qwen/qwen3-vl-8b-instruct, a release date of 2025-10-14, text, image and video input, a 131,072-token context window with 32K max output, a P50 time-to-first-token of 3.59 seconds, and pricing of $0.18 per million input tokens against $0.70 per million output tokens.