כרטיס כותרת ראשי שכותרתו 'Liquid AI d1-3B מול Gemma 4 12B' עם כותרת המשנה 'מודל החלטות מול גנרליסט', המציג כרטיס רשימת בדיקה קטן של 3.12B עם צ'יפ הסתברות לצד כרטיס גדול יותר של 11.96B הנושא אייקונים של מסמך, צורת גל ופריים סרט וצ'יפ של תשובה כתובה.
Guides & Insights

Liquid AI d1-3B מול Gemma 4 12B: מודל החלטות לעומת מודל כללי

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדרך המהירה ביותר לטעות בהשוואה הזאת היא להריץ את Liquid AI d1-3B ואת Ge​mma 4 12B על אותו בנצ'מרק ולחכות למנצח. הם לא עונים על אותה שאלה. Liquid AI d1-3B הוא מודל החלטות בגודל 3.12B שפורסם במשקלים פתוחים ב-7 באוקטובר 2026: נותנים לו מצב וקבוצה של שאלות בעלות שמות, והוא מחזיר הסתברויות, תווית נבחרת ורמת ביטחון, עם אפס טוקנים בפלט וללא שלב ייצור. Ge​mma 4 12B הוא הג'נרליסט any-to-any נטול האנקודר של Goo​gle, צ'קפוינט בגודל 11.96B שלוקח טקסט, תמונה, אודיו וווידאו וכותב תשובה בחלון של 256,000 טוקנים ביותר מ-140 שפות. אחד מהם אומר לך איזה מבין ארבעה דברים הוא לוח מעגלים. האחר אומר לך למה. השוו אותם רק על איכות ולא תלמדו דבר, כי הפלטים אינם ברי-השוואה — והספקים מעולם לא ערכו להם בנצ'מרק זה מול זה. השוו אותם לפי מה שקריאה באמת מחזירה, מה היא עולה, והיכן כל אחד מהם מגיע לקצה הדרך, והציוות הופך למבחן גבול שימושי באמת.

שני חוזי פלט שונים

ההבחנה שעושה כאן את כל העבודה היא מה שחוזר על החוט.

Liquid AI d1-3B מחזיר אובייקט תשובה מובנה. כל שאלה בבקשה מצהירה על סוג — noul עבור כן/לא עם P(yes), choice עבור אחת מתוך קבוצת אפשרויות בעלת שם עם רמת ביטחון והסתברות לכל אפשרות, או score עבור מיקום על סולם סדור של שתיים עד עשר רמות עם הרמה הצפויה וההתפלגות שלה. המודל מדווח output_tokens: 0 כי שום דבר לא נכתב. מספר שאלות על מצב אחד נקראות במעבר קדימה יחיד, והמצב והתמונות שלו מקודדים פעם אחת עבור כולן.

Gemma 4 12B מחזיר פרוזה. לפעמים הוא מחזיר JSON שביקשתם, לפעמים הוא מחזיר JSON שלא ביקשתם בדיוק, והוא יכול לנמק לפני שהוא עונה. זה בראש ובראשונה מודל שפה: כל מה שהוא יודע לסווג, הוא מבטא כטקסט. זה יתרון כשצריך להסביר את התשובה לאדם או להזין אותה לשלב המשך שמצפה לשפה, וזה מחיר כשהדבר היחיד שהייתם צריכים הוא הסתברות.

הכול בהמשך נובע מכך. תגובה של d1-3B לא יכולה להיכשל בפענוח. הוא גם אינו יכול להסביר את עצמו, וכרטיס המודל אומר זאת ישירות: הוא אינו מודל צ'אט והוא אינו כותב טקסט.

היכן עומדים שובלי הראיות

מקורן של שתי קבוצות המספרים אינו שקול, ולכך יש כאן חשיבות גדולה יותר מאשר למספרים עצמם.

• Decision Index 0.2.1 — Liquid AI d1-3B מקבל ציון 48.57, שנמדד על ידי הספק עם המעריך הרשמי, ראשון מבין מודלים מתחת ל-10B ולפני Decider 35B-A3B עם 47.11. Gemma 4 12B אינו מדורג ב-Decision Index כלל, ולכן לשורה הזו אין מקבילה.

• מדדי הסקה — Ge​mma 4 12B משיג 77.5 ב-AIME 2026, 78.8 ב-GPQA Diamond ו-1,659 Codeforces ELO, ומדד ה-Artificial Analysis Intelligence Index שלו הוא 22 במצב הסקה ו-13 כשמצב ההסקה כבוי. ל-Liquid AI d1-3B אין מדד הסקה, מכיוון שמודל החלטות אינו מפיק עקבות הסקה שאפשר לנקד.

• הקשר ארוך — Gemma 4 12B מקבל 256,000 טוקנים ומשיג 43.4% ב-MRCR v2 eight-needle ב-128k לפי הכרטיס של Google עצמה. Liquid AI d1-3B מקבל 32,768 טוקנים. אם ה"state" שלך הוא מסמך בן ארבעים עמודים בתוספת סריקות, הפער הזה הוא כל ההחלטה וזה לא צמוד.

• ראייה — Liquid AI d1-3B משיג בממוצע 74.1 על פני אחד-עשר מבחני ביצועים ציבוריים לתמונות, המפורשים כהחלטות מתוך מערך האפשרויות של כל מבחן, לעומת 73.9 עבור עמוד השדרה LFM2.5-VL-3B שממנו הוא נבנה, והספק מדווח כי הסרת התמונות מורידה את אותן השאלות ל-45.1. הראייה של Ge​mma 4 12B חזקה ורחבה יותר, אך היא מדווחת כאיכות יצירה, ולא כדיוק החלטות על אפשרויות נקובות בשם.

• שפות — שש עשרה מתועדות עבור Liquid AI d1-3B; יותר מ-140 עבור Ge​mma 4 12B.

• מהירות — Liquid AI d1-3B עונה על שאלה אחת ב-8 מילישניות על RTX 4090, ב-16 מילישניות על Jetson AGX Thor, ב-26 מילישניות על Jetson AGX Orin 64 GB וב-50 מילישניות על Jetson Orin Nano, ואורז 64 מצבים במעבר יחיד בקצב של 475 לשנייה על ה-4090. Ge​mma 4 12B מייצר, לכן מהירותו היא פונקציה של מספר הטוקנים שהוא כותב.

• איכות הראיות — התוצאות של Gemma 4 12B הן של Google, פורסמו ביוני 2026 ומאז נבדקו, עברו קוונטיזציה והורצו מחדש על ידי קהילה גדולה. התוצאות של Liquid AI d1-3B הן של Liquid, פורסמו לפני יומיים, ולא שוחזרו על ידי איש מחוץ למעבדה. קראו את העמודה השנייה בהתאם.

A two-column scoreboard for Liquid AI d1-3B and Gemma 4 12B. The d1-3B column reads: output a label, a confidence, zero tokens; 3.12B parameters; 32,768-token context; text and image input; 8 ms per question; Decision Index 48.57 (vendor). The Gemma 4 12B column reads: output generated text; 11.96B parameters; 256,000-token context; text, image, audio and video input; latency that scales with output length; Decision Index not scored. The footer reads 'd1-3B figures vendor-reported and unreproduced; Gemma 4 12B figures per Google, June 2026.'

המקום היחיד שבו הם באמת מתחרים

יש חפיפה אמיתית, והיא לא על לוח מובילים. היא בקריאת ה-LLM-as-a-judge.

לא מעט צינורות ייצור כבר משתמשים בג'נרליסט בגודל בינוני כשכבת הערכה: לתת ציון לדחיפות של פנייה זו, להחליט אם פלט זה עומד ברובריקה, לבחור באיזה כלי הסוכן צריך להפעיל בשלב הבא, לבדוק אם קטע שנשלף עונה על השאלה. כיום רוב הקריאות האלה הולכות למודל גנרטיבי שמתבקש לפלוט מספר או תווית כטקסט, והמספר שהוא פולט הוא מה שהסמפלר ייצר ולא softmax על קבוצת האפשרויות שלך. זהו תהליך העבודה שאותו Liquid AI d1-3B עבר אימון המשך כדי להחליף, והדמואים שפורסמו הם כולם גרסאות שלו — פרדיקט SQL שעונה כן או לא עבור 150 פניות תמיכה, לולאת דחיסת הקשר של סוכן שמשאירה, מקצרת או מפילה כל פלט של כלי ומסירה 52% מהטוקנים, אפליקציית בדיקה חזותית שמיינה חלקים תקינים ופגומים מארבעה קווי ייצור בדיוק של 85 עד 97 אחוזים במשימה שהיא מעולם לא אומנה עבורה.

Gemma 4 12B מבצע את כל העבודות האלה, ומבצע יותר מהן. הוא יכול גם לכתוב את הסיכום, להחזיק מסמך של 256K בתצוגה, לקבל שיחת טלפון מוקלטת כקלט, ולענות באחת מיותר מ-140 שפות. אם צינור העיבוד שלך צריך הערכה וקריינות, ה-12B מבצע שתי עבודות בקריאה אחת ומודל ההחלטה 3B מבצע אחת מהן.

הגבול הוא אורך ההקשר וצורת הפלט. מצב ארוך, קלט מדובר, שפות רבות, או הסבר שהקורא מצפה לו — Ge​mma 4 12B, בלי תחרות. מצב קצר, סט אפשרויות קבוע, תקציב השהיה לכל בקשה במילי־שניות חד־ספרתיות, או ערובה מוחלטת שהתשובה תעבור פרסור — זו העמודה של d1-3B, והמודל הגנרלי משלם על יכולת שלא תשתמש בה.

כמה עולה להתקשר לכל אחד מהם

אף אחד מהמודלים אינו נמצא בקטלוג שלנו, ולכן אין מחיר ניתוב להציע עבור אף אחד מהם — Gemma 4 12B אינו בין גדלי Gemma שאנו מספקים, ו-Liquid AI d1-3B הוא משקולות פתוחות שאותן אתם מארחים בעצמכם או שאליהן מגיעים דרך ה-API של הספק עצמו ופלטפורמות צד שלישי. לשם הקשר על הצד הסמוך ל-Gemini של אותה משפחה, שני גדלי Gemma 4 שאנחנו כן מנתבים רשומים במחיר של $0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט עבור Gemma 4 26B A4B, ושל $0.13 ו-$0.38 עבור Gemma 4 31B, שניהם עם הקשר של 262,144 טוקנים וקלט טקסט, תמונה וווידאו. מחיר הספק החציוני שצוטט עבור Gemma 4 12B במקומות אחרים עומד על כ-$0.10 ו-$0.30.

המתארח של Liquidd1 מחייב טוקני קלט בלבד, במחיר $0.04 למיליון, כאשר תמונות נספרות כקלט בקצב של 1.5 טוקנים לכל טלאי של 32×32 פיקסלים. לכן לבקשת החלטה אין כלל שורת טוקני פלט, וזו הסיבה המבנית לכך שהשוואת העלויות של הספק עצמו מול מודלים גדולים בהרבה מגיעה לאן שהיא מגיעה. למשקלים הפתוחים אין מחיר לפי קריאה; משלמים בחומרה. שניהם צריכים לשבת באותו צינור עיבוד כמו כל דבר אחר שאתם קוראים לו, וזו השכבה שראוטר נועד עבורה — API אחד על פני 200+ מודלים, מחירי המחירון של הספקים מועברים הלאה ב-0% תוספת, ומעבר אוטומטי לגיבוי כך שתקלה רגעית אחת במעלה הזרם לא תהפוך להפסקת השירות שלכם. זה הצנרת סביב ההשוואה, לא ההשוואה עצמה.

A capture of Liquid AI's blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph announcing d1-3B and d1-omni-600M as open-weight models, the d1-3B Decision Index score of 48.57, and the latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

איך להחליט, בכנות

התחל מפורמט התשובה ולא מהמודל. אם המערכת במורד הזרם יכולה לצרוך הסתברות, תווית ורמת ביטחון, וקבוצת התשובות קטנה וידועה, Liquid AI d1-3B אינו נסיגה מ־12B — הוא כלי שונה, ונתוני ההשהיה הופכים אותו לפריסה שונה מהותית: 50 ms על Jetson Orin Nano הוא מכשיר שאין לו שום עסק להריץ 12B בכלל.

אם התשובה חייבת להיות משפט, או שהמצב ארוך יותר משלושים ושניים אלף טוקנים, או שמישהו עומד להשמיע אותו בקול, או ששפת הפלט היא בנגלית, אז Ge​mma 4 12B הוא היחיד מבין השניים שיכול לעשות את העבודה, וההשוואה נגמרת עוד לפני שהיא מתחילה.

העמדה המועילה באמת עבור רוב הצוותים היא לשלב את שניהם, במקומות שונים. מודל החלטה לפני הקריאה היקרה, שמבצע את המיון, הניתוב ובדיקות מעקות הבטיחות שאינן דורשות שפה; ומודל כללי מאחוריו לעבודה שכן דורשת שפה. אלו אותו צינור עיבוד, האחד מסנן והשני המטען — והצוותים שיפיקו את המרב מהשחרור של d1 הם אלו שכבר משלמים על 12B כדי לענות כן או לא.

A capture of our own catalogue page for Google Gemma 4 31B, showing the model id google/gemma-4-31b-it, a release date of 2026-04-02, a 30.7B dense multimodal description with a 256K token context window, and headline pricing of $0.13 per million input tokens and $0.38 per million output tokens.