כרטיס כותרת שנוצר עבור Microsoft-Decision-1 מול Gemma 4 12B, עם כותרת משנה 'מודד בלי טוקני פלט מול כותב בלי קבוצה סגורה', ועם צ'יפים שמציגים הסתברויות מול פרוזה, הקשר של 32,768 טוקנים מול 256,000, טקסט בלבד מול טקסט, תמונה, אודיו וווידאו, ו-API מתארח מול משקולות פתוחות.
Guides & Insights

Microsoft-Decision-1 מול Gemma 4 12B: אחד בוחר מהשלך, אחד כותב לך אחד חדש

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

העמידו את Microsoft-Decision-1 ואת Gemma 4 12B זה לצד זה, וההבדל שמכריע את הכול אינו גודל, דיוק או רישיון — אלא מה שקורה לאחר שהמודל קרא את הקלט שלכם. Gemma 4 12B, המודל המולטימודלי נטול המקודד של DeepMind, בעל 11.96 מיליארד פרמטרים, שיצא ב-3 ביוני 2026 תחת Apache 2.0, קורא טקסט, תמונות, אודיו או וידאו, ואז כותב לכם תשובה, טוקן אחר טוקן, על פני חלון של 256,000 טוקנים ויותר מ-140 שפות. Microsoft-Decision-1 הפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026 כמעריך טקסט בלבד שעבר אימון המשך על Qwen3.5-9B: אתם מוסרים לו מצב ושאלה שאת תשובותיה כבר פירטתם, והוא מחזיר הסתברות מכוילת לכל אפשרות במעבר יחיד על פני עד 32,768 טוקנים, בלי לייצר דבר. מודל אחד אומר לכם איזו מהאפשרויות שלכם נכונה. האחר אומר לכם מה האפשרויות היו צריכות להיות — ומחייב אתכם על כל מילה של זה.

למסגר את זה כתחרות יהיה שגיאה קטגוריאלית, וכדאי לומר זאת לפני שורות המפרט ולא אחריהן. שני אלה אינם תחליפים; הם נמצאים בשני קצוות מנוגדים של תהליך עבודה. השאלה המועילה היא איזה קצה אתה בעצם בונה, משום שהתשובה קובעת אם אתה קונה שופט או כותב.

החשבון הוא המקום שבו ההבדל מפסיק להיות פילוסופי

Gemma 4 12B מחויב באותו אופן שבו מחויב כל מודל גנרטיבי: אסימוני קלט ואסימוני פלט, שניהם. כאשר אתה מבקש ממנו JSON מובנה, כל תו ב-JSON הזה נוצר, נדגם ומשולם עבורו — וככל שהסכמה שלך מקוננת יותר, כך התשובה ארוכה יותר וסעיף החיוב הזה גדול יותר. זה אינו פגם של המודל. זה מה שמפענח עושה, וזה בדיוק סעיף החיוב שראשי ההחלטה נועדו למחוק.

ל-Microsoft-Decision-1 אין צד פלט לחיוב. הוא מריץ מעבר קדימה בודד על המצב שלך, השאלה שלך וקבוצת האפשרויות שלך, קורא ציון עבור כל מועמד, ומחזיר. ההשלכה מצטברת עם נפח ולא עם גודל הפרומפט: פייפליין שמתייג עשרת אלפים רשומות עם Gemma 4 12B מייצר עשרת אלפים מסמכי JSON, ואותו פייפליין על מעריך החלטות מייצר עשרת אלפים פרומפטים ושום דבר אחר. האם החיסכון המוחלט גדול תלוי לחלוטין בנפח שלך ובשמנות הסכמה שלך, וכל מי שיש לו תקציב לפי טוקן יכול להכריע בכך בגיליון אלקטרוני. הכיוון אינו שנוי במחלוקת.

קיימת א-סימטריה שנייה וקטנה יותר: Microsoft אינה מפרסמת תעריף בעמוד המודל Microsoft-Decision-1. התמחור מקשר החוצה אל משטח התמחור של Microsoft עצמה, ולכן העלות לכל החלטה היא משהו שקוראים מ-Azure ולא מהכרטיס. מה שכן העמוד קובע הוא ש-0% מהקריאה הם טוקני פלט, ושהסקה באצווה מושבתת — לא ניתן לפרוס עלות של ריצת ניקוד גורפת דרך ערוץ אצווה כפי שהייתם עושים עם מודל גנרטיבי.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Gemma 4 12B. Left column Microsoft-Decision-1 rows read: parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; output probabilities with zero output tokens; modalities in text only; weights hosted, not distributed. Right column Gemma 4 12B rows read: parameters 11.96B encoder-free multimodal; context 256,000 tokens; output generated text billed per token; modalities in text, image, audio, video; weights Apache 2.0 and self-serve. A footer line reads that the Gemma 4 12B figures are Google-reported and Microsoft-Decision-1 has published no benchmark figures.

אותו קלט, שתי תשובות שונות

תנו לשני המודלים כרטיס תמיכת לקוחות ושאלה. Microsoft-Decision-1 מחזיר משהו כמו 0.83 עבור "חיוב", 0.11 עבור "טכני", 0.04 עבור "ביטול", 0.02 עבור "לא ניתן לדעת". יש לכם תווית שאפשר לתת לה שם, מספר שאפשר להשוות לסף, ונתיב הימנעות — Microsoft מתעדת שאפשרות בסגנון "לא ניתן לדעת" נתמכת כאשר הראיות שסופקו אינן מספיקות, וזה מה שמאפשר ללוגיקת ההסלמה לעבוד. מה שאתם לא מקבלים הוא סיבה.

תנו את הפנייה ל-Gemma 4 12B ותקבלו פסקה. הוא יכול לנמק לגבי הבקשה עם חשיבה ניתנת להגדרה, לבצע קריאות לפונקציות, לקרוא חשבונית סרוקה המצורפת לפנייה, לתמלל את ההודעה הקולית המוצמדת אליה, ולענות בשפתו של הלקוח. כל אחד מאלה הוא משהו ש-Decision-1 לא יכול לעשות בשום רמת דיוק: משטח הקלט שלו הוא טקסט ותו לא, והוא אינו מיועד במפורש למענה על שאלות פתוחות, לשיחה, לתרגום או לסיכום.

שום דבר בפלט של Gemma 4 12B אינו הסתברות. בקשו ממנו החלטת ניתוב עם רמת ביטחון ותקבלו טקסט פרוזאי שמכיל מספר, והמספר הזה הוא מה שהסמפלר הפיק, ולא softmax מעל קבוצת האפשרויות שסיפקתם. אם סף במורד הזרם תלוי בכך שלמספר הזה יש משמעות, יש לכם פרויקט כיול על הידיים, לא כלי ניקוד.

האם לשאלתך יש קבוצה סגורה — זה כל ההחלטה.

זהו המבחן שצריך ליישם לפני כל דבר אחר, והוא אורך כעשר דקות עם לוח מחיק.

• אם התשובה שלך שאובה מרשימה שאתה יכול למנות מראש — תווית, דירוג, כן/לא, ציון רובריקה, מסלול — Microsoft-Decision-1 הוא הכלי הנכון, ו-Gemma 4 12B הוא דרך בזבזנית ופחות אמינה לבחור מאותה רשימה. היית משלם למפענח כדי לנחש מספר שכבר הצבת לו גבולות.

• אם התשובה שלך אינה קבוצה סגורה — לסכם את זה, להסביר את זה, לכתוב את התשובה, לתאר את התרשים — Microsoft-Decision-1 לא יכול לעזור בשום מחיר. אין לו נתיב לפרוזה, אין שדה הנמקה, ואין מנגנון להפיק משהו שלא מנית כאפשרות.

• אם זה גם וגם, יש לך צינור של שני מודלים ולא בחירה, והשאלה העיצובית המעניינת הופכת להיות למי שייך סף ההסלמה. הסוקר קובע אותו; הכותב ממלא את מה שקורה מעליו ומתחתיו.

כאשר Gemma 4 12B הוא פשוט ליגה אחרת

מחוץ למסגור ההחלטה, Gemma 4 12B לא מקדימה בקו כלשהו — היא משחקת משחק אחר, ולהעמיד פנים אחרת יהיה חוסר יושר.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.

• מודאליות — Microsoft-Decision-1 הוא טקסט בלבד בקלט ומספרי בפלט. Gemma 4 12B מקבל טקסט, תמונה, אודיו ווידאו באופן נייטיבי דרך תכנון נטול מקודד שמקרין טלאים גולמיים וצורות גל היישר אל מרחב ההטמעות, עם קלט משורג בכל סדר.

• הקשר — 32,768 טוקנים עבור Microsoft-Decision-1 לעומת 256,000 עבור Gemma 4 12B, שמשיג 43.4% ב-MRCR v2 eight-needle ב-128k בכרטיס של Google עצמה.

• שפה — 25 שפות נתמכות עבור Microsoft-Decision-1, כאשר Microsoft מזהירה שכיסוי, איכות וכיול "עשויים להשתנות לפי שפה" ומציינת שפות שאינן אנגלית עם משאבים מועטים כנקודת חולשה; 140+ עבור Gemma 4 12B, עם נתון MMMLU מוערך של 83.4 בגודל זה.

• ביצועים מפורסמים — הלשונית Benchmarks של Microsoft-Decision-1 מכילה מתודולוגיה וללא נתונים מספריים; Google מפרסמת 77.2% MMLU Pro, ‏77.5% AIME 2026 ללא כלים, ‏72.0% LiveCodeBench v6, ‏78.8% GPQA Diamond, ‏69.1% MMMU Pro ו-79.7% MATH-Vision עבור Gemma 4 12B.

• הפצה — Microsoft-Decision-1 הוא API מתארח ב-Foundry בלבד, ללא משקלים, ללא הורדה וללא מסלול כיוונון עדין. Gemma 4 12B הוא משקלים ברישיון Apache 2.0 שיצאו אל אקוסיסטם של יום ראשון שכלל את LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang ו-Unsloth.

• זמן ריצה — ניקוד החלטות הוא מעבר אחד ללא לולאת פענוח, כך שהשהיה משתנה לפי הפרומפט ולא לפי אורך התשובה; Gemma 4 12B מייצר טוקן אחר טוקן, וחומרי ההשקה של Google ממקמים אותו ב-16 GB של VRAM או זיכרון מאוחד.

שורת הבנצ'מרק היא זו שכדאי להתעכב עליה, בכיוון שהכי פחות מחמיא למיקרוסופט. המספרים של Gemma 4 12B גם הם מדווחים על ידי הספק — אבל מאחוריהם עומדים חודשים של שימוש מצד צד שלישי, במערכי בדיקה ציבוריים, על חומרה שאנשים אחרים מחזיקים בבעלותם. הכניסה של מיקרוסופט בקטגוריה הזו היא החדשה ביותר והפחות ניתנת לאימות מבין השתיים, למרות שהיא מגיעה מהחברה הגדולה יותר.

כמה כל אחד עולה לך כדי להתקשר בפועל

Gemma 4 12B בצורתו כ-12B אינו נמצא בקטלוג שלנו — אם זה הגודל שאתם רוצים, אתם מורידים 11.96 מיליארד פרמטרים ב-BF16 ומארחים אותו בעצמכם. מה שכן יש בקטלוג שלנו הוא שאר סדרת Gemma 4, והיא לא יקרה: Gemma 4 26B A4B במחיר של 0.06$ למיליון טוקני קלט ו-0.33$ למיליון טוקני פלט, וכן Gemma 4 31B במחיר של 0.13$ ו-0.38$, שניהם רשומים עם חלון הקשר של 262,144 טוקנים. אלה הם מחירי מחירון של הספקים המועברים הלאה ללא תוספת רווח מצדנו, מאחורי מפתח אחד תואם-OpenAI לצד יותר מ-200 דגמים אחרים. אם מסתבר שהבעיה שלכם היא הסקה כללית ולא החלטה מתוך קבוצה סגורה, אחד משני הגדלים האלה הוא הדבר הזול למדוד מולו מנקד שאתם מפעילים בעצמכם — ואם אתם מעדיפים לא להתחייב לכותב יחיד, מעבר אוטומטי לספק חלופי (failover) משמר את פעימת היצירה של לולאת ניקוד כאשר ספק אחד נפגע.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

Microsoft-Decision-1 הוא פריסת Foundry שאתה מקצה בעצמך, והוא אינו זמין דרכנו. דבר במאמר זה אינו מהווה הצהרת זמינות לגביו, משני צדי הקריאה.

שורה תחתונה

Microsoft-Decision-1 הפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026: מודל ניקוד טקסטואלי בלבד, בן 32,768 אסימונים, המבוסס על Qwen3.5-9B, שמחזיר הסתברויות מכוילות על פני אפשרויות שאתם מפרטים, עם אפס אסימוני פלט, ללא משקלים וללא נתוני בנצ'מרק מפורסמים. Gemma 4 12B הוא מודל כללי מולטימודלי ללא מקודד בנפח 11.96B, שיצא ב-3 ביוני 2026 תחת Apache 2.0, שמבצע הסקה, קורא תמונות ואודיו וכותב תשובות על פני 256,000 אסימונים. בחרו לפי צורת התשובה שלכם, ולא לפי מספרי הפרמטרים: קבוצה סגורה שייכת למודל הניקוד, קבוצה פתוחה שייכת לכותב, והדרך הנפוצה ביותר שבה צוותים מוציאים פי עשרה ממה שעולה החלטה היא לשלם למפענח כדי לבחור מתוך רשימה שכבר כתבתם.

מה שהקטלוג שלנו כן כולל הוא שאר סדרת Gemma 4, והוא לא יקר: Gemma 4 26B A4B במחיר $0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט , וגם Gemma 4 31B ב-$0.13 ו-$0.38.