כרטיס כותרת שנוצר עם הכיתוב "Ember-1 מול Gemma 4 12B" וכותרת משנה "פחות טוקנים על נקודת קצה שכורה, או המשקולות שלכם", מעל שני כרטיסים: Ember-1 — "נגזרת של Kimi K3" ו"אין משקולות, אין מחיר מפורסם"; Gemma 4 12B — "11.95B צפוף, Apache 2.0" ו"הקשר של 256K, מולטימודלי".
Guides & Insights

Ember-1 vs Gemma 4 12B: האחד משכיר לך פחות טוקנים, והאחר מוסר לידיך את המשקולות

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ember-1 ו-Gemma 4 12B אינם מתחרים על אותה שורה בהזמנת רכש, והדרך המהירה ביותר לראות למה היא לשאול מה יהיה בבעלותך בסוף כל חודש. Gemma 4 12B הוא המודל המולטימודלי הצפוף של Google עם 11.95 מיליארד פרמטרים, ששוחרר ב-3 ביוני 2026 תחת Apache 2.0 — אתה מוריד אותו, והצ'קפוינט הוא שלך. Ember-1 הוא נגזרת מתמחה של Fireworks Research ל-Kimi K3 של Moonshot AI, שפורסמה ב-23 בספטמבר 2026 כתצוגה מקדימה למחקר בפלטפורמת ה-serverless של הספק עצמו — אתה קורא לו, ואין בבעלותך דבר מלבד החשבונית. האחד הוא טיעון של שכירות-לבעלות בנוגע לטוקנים; האחר הוא רכישה הונית. אם תעמיד אותם זה לצד זה, ההשוואה המועילה אינה איזה מודל טוב יותר, מפני ששום דבר שפורסם לא מאפשר להכריע בכך. היא איזו משתי צורות הרכש מתאימה לדבר שאתה בונה.

שני החוזים, בניסוח פשוט

Gemma 4 12B הוא מהדורה מוגמרת של משקולות פתוחות. Google מפרסמת את המשקולות, את הארכיטקטורה, את גיליון הבנצ'מרקים ואת הרישיון, וקהילה של סביבות הרצה — llama.cpp, vLLM, MLX, SGLang, Transformers — מריצה אותו על חומרה שבשליטתך. עלות הטוקן לאחר הרכישה היא חשמל ופחת, ולא סעיף חיוב מספק. הדברים שאתה מוותר עליהם הם מה שמשקולות פתוחות תמיד גובות: תכנון הקיבולת הוא באחריותך, ותקרת האיכות שלך קבועה על 11.95 מיליארד פרמטרים.

Ember-1 היא ההופכית. אין משקלים להורדה — היא קיימת כאפשרות הגשה בפלטפורמה של הספק עצמו — ואין מחיר מפורסם. מה שהיא מציעה במקום זאת הוא טענה צרה יותר, המיושמת על גבי מודל גדול בהרבה: הדיוק של Kimi K3, עם כ-40% פחות טוקנים שמושקעים כדי להגיע לשם. Fireworks Research אימנה אותה במיוחד לקצר עקבות חשיבה בלי לשנות תשובות, ומדווחת שאורך החשיבה יכול להיחתך ב-35–50% בלי אובדן דיוק על פני שבעה מבחני ביצועים ושני מבחני A/B בייצור של לקוחות. כל נתון שם מדווח על ידי הספק ולא שוחזר.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

הערך של טיעון הטוקן תלוי לחלוטין במי שמשלם עבור הטוקנים

הפיץ' של Ember-1 מניח חיוב לפי טוקן. ההנחה הזו נכונה עבור קהל היעד שעבורו הוא תוכנן — צוותים שמריצים לופים ארוכים של סוכנים מול מודל חזית מתארח, שבהם Fireworks Research מציינת ש-Kimi K3 יכול להוציא יותר מ-90% מהטוקנים שנוצרו על הסקה פנימית, ושבהם כל סבב משחזר סבבים קודמים כך שההסקה המוקדמת נקראת מחדש ומחויבת מחדש. בהקשר הזה, קיצור אורך ה-trace הוא קיצוץ ישיר בחשבון החודשי, והתוצאה של A/B של 29.9K טוקני פלט מול 49.3K של K3 היא המספר שחשוב.

הרץ את אותו מודל לפי התנאים של Gemma 4 12B והטיעון מתמוסס. כאשר אתה מארח בעצמך צ'קפוינט Apache-2.0, אסימוני חשיבה נוספים עולים בזמן שעון ובתפוסת GPU, לא בדולרים למיליון. מסלול חשיבה מפורט על המחשב הנייד שלך עם 16GB הוא תשובה איטית יותר, לא חשבון גדול יותר. זה לא הופך את חוסר היעילות לבלתי מזיק — בלולאת סוכן הוא עדיין מצטבר, והוא עדיין מופיע כהשהיה — אבל שער החליפין שונה, והתייחסות להפחתה של 40% בטוקנים כאל חיסכון של 40% בחומרה באירוח עצמי היא שגיאת קטגוריה.

דף המפרט, שורה אחת לכל ממד

• מה זה — Ember-1: נגזרת בגרסת תצוגה מוקדמת למחקר של Kimi K3, שאומנה מחדש לחשיבה קצרה יותר. Gemma 4 12B: מודל מולטימודאלי צפוף עם משקולות פתוחות בנפח 11.95B ממשפחת Gemma 4 של Google.

• משקלים — Ember-1: לא פורסמו; מוגשים רק דרך הפלטפורמה של הספק. Gemma 4 12B: Apache 2.0, ניתנים להורדה, ללא הגבלת גישה.

• גודל — Ember-1: לא נחשף; בירושה מארכיטקטורת Kimi K3. Gemma 4 12B: 11.95B צפוף, 48 שכבות, כ-18GB של משקלים ב-BF16.

• חלון הקשר — Ember-1: לא פורסם עבור התצוגה המקדימה; מודל הבסיס שלה מכיל 1,048,576 טוקנים. Gemma 4 12B: 256 אלף טוקנים.

• קלטים — Ember-1: טקסט. Gemma 4 12B: טקסט, תמונה ואודיו באמצעות עיצוב מאוחד נטול מקודד, כאשר וידאו מופיע ברשימות של חלק מהמקורות.

• מחיר — Ember-1: לא פורסם; הדולרים בגיליון הבנצ'מרק מחושבים לפי כרטיס התעריפים של Kimi K3. Gemma 4 12B: חינם להורדה; אתה משלם על החומרה.

• רצפת חומרה — Ember-1: מה שהספק מתכנן. Gemma 4 12B: 16GB של VRAM או זיכרון מאוחד, לפי המיצוב של Google.

• ראיות — Ember-1: בנצ'מרקים של הספק ושני מבחני A/B שהספק הריץ, ללא שחזור. Gemma 4 12B: הערכות שדווחו על ידי Google בתוספת אקוסיסטם עצמאי של הרצות מקומיות.

מה Gemma 4 12B מפרסם, ואיך הוא קורא

המספרים של Google עצמה עבור Gemma 4 12B מציבים אותו בין Gemma 4 E4B בגודל edge לבין ה-26B MoE הגדול יותר: GPQA Diamond 78.8%, MMLU Pro 77.2%, AIME 2026 ללא כלים 77.5%, LiveCodeBench v6 72.0, Codeforces ELO 1659, ממוצע τ-2 69.0%, MMMU Pro 69.1%, DocVQA 94.9 ו-BigBench Extra Hard 53.0%. גם אלה דווחו על ידי הספק — Google העריכה את המודל של עצמה ופרסמה את הטבלה — אבל יש להם היתרון בכך שהם מתארים checkpoint שכל אחד יכול להוריד ולהריץ מחדש, ולכן טענות בדבר משקלים פתוחים נוטות לזכות באימות מצד שלישי במהירות, בעוד שטענות של תצוגה מקדימה סגורה אינן זוכות לכך.

ההבחנה האמיתית של המודל היא מבנית ולא מספרית. ל-Gemma 4 12B אין מקודד חזותי או קולי נפרד: טלאי תמונה וצורות גל של שמע מוקרנים ישירות אל מרחב הטוקנים, וזה מה שמאפשר למודל 12B לקבל צילום מסך או הקלטה כקלט בכלל. הוא גם מגיע עם מודלי טיוטה לחיזוי רב-טוקני עבור פענוח ספקולטיבי, שזה מאפיין השהיה ולא מאפיין איכות — מהסוג שמשנה כשאתה מריץ את המודל בעצמך וכל אלפית שנייה של prefill היא על חשבונך.

היכן שהשניים למעשה מתנגשים

שני המודלים נמכרים לקידוד סוכני ולשימוש בכלים, וזהו השטח היחיד שבו קיימת בחירה אמיתית. הנתון של Ember-1 ב-Terminal Bench 2.1 הוא 82.0% לעומת 80.9% של Kimi K3 Max, עם 51.9% פחות טוקנים; התוצאה שלו ב-SWE-bench Verified היא 92.2% לעומת 93.2% של K3 Max. ל-Gemma 4 12B אין כלל נתון של Terminal Bench או SWE-bench בסט המפורסם של Goog​le — הראיה הסוכנית שלה היא τ-2 ב-69.0%. לכן אי אפשר להעמיד את השניים זה מול זה על מדד משותף, וכל מאמר שעושה זאת פשוט ממציא את ההשוואה.

מה שאפשר לומר הוא שהם נמצאים בנקודות שונות על עקומת עלות. אם עומס העבודה של הסוכן שלך פועל מול מודל frontier מתארח והחשבון נשלט על ידי טוקנים של הסקה, Ember-1 תוקף בדיוק את המונח הזה — במחיר של חלון גישה של שבועיים וללא תעריף מפורסם. אם עומס העבודה שלך צריך לרוץ על חומרה שאתה שולט בה, להתמודד עם צילום מסך, או לשרוד מצב שבו ספק מחליט לא להמשיך תצוגה מקדימה, Gemma 4 12B הוא היחיד מבין השניים שעונה על השאלה בכלל.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

דרך אמצעית, והיכן למצוא אותה

יש אפשרות שלישית ששיווק של אף אחד מהמודלים עצמו אינו בנוי סביבה: להשתמש בשכבות ה-Gemma 4 הגדולות יותר כחצי המתארח של היברידי. OrcaRouter מנתב את Gemma 4 26B-A4B של Google ו-Gemma 4 31Bלצד יותר מ-200 מודלים אחריםמאחורי API אחד במחיר המחירון של הספקעם 0% תוספת מחיר, כך שאותו מפתח שמגיע ל-Gemma בינוני מגיע גם למודלים המובילים שהייתם זקוקים עבורם לחוזה שני. Gemma 4 12B עצמו אינו נמצא בפלטפורמה שלנו, וגם Ember-1 לא — אם אתם צריכים את ה-12B באופן מקומי, הורידו אותו; אם אתם רוצים לבדוק תחילה אם Gemma גדול יותר סוגר את הפער, הבדיקה הזו עולה נקודת קצה אחת.

סידור כזה הוא גם הדרך ההגונה להעריך תצוגה מקדימה מחקרית. מעבר אוטומטי בין ספקים בעת כשל פירושו שמודל שנעלם מחלון התצוגה המקדימה לא גורר איתו את היישום שלך, וזה הסיכון הספציפי שמצב ההשחרור של Ember-1 מכניס, והסיכון הספציפי ששום דבר בטבלת הבנצ'מרקים שלו לא מתייחס אליו.

איזה מהם שייך למפת הדרכים שלך?

בחרו ב-Gemma 4 12B אם בעלות היא דרישה — פרטיות, פעולה לא־מקוונת, רצפת עלות קבועה, או מוצר שחייב להמשיך לעבוד אם ספק משנה את דעתו. התקרה המוצהרת שלו נמוכה מזו של נגזרת של מודל חזית, והקלט הרב־מודלי שלו אכן מבדל, ושתי העובדות האלה אינן תלויות במפת הדרכים של אף אחד אחר.

בחר ב-Ember-1 אם הבעיה שלך היא חיוב לפי טוקן בריצות סוכנים ארוכות ואתה יכול לספוג את הסיכון שבגרסת תצוגה מקדימה. הרץ אותו במצב צל מול הפתרון הקיים שלך במשך השבועיים שיש לך, מדוד טוקנים לכל משימה שהושלמה בתעבורה שלך, והתייחס ל-40% כהשערה ולא כשיעור. מה שאתה לא צריך לעשות הוא לבחור ביניהם על סמך איכות, כי אף אחד — כולל המעבדה שבנתה את Ember-1 — לא פרסם השוואה שתאפשר לך זאת.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

הנקודה הגדולה יותר היא ששתי מהדורות אלו מייצגות את שתי הדרכים שבהן נמכרת יכולת בסוף 2026. מעבדה אחת מפרסמת נקודת ביקורת ומניחה למערכת האקולוגית למצוא את הרמה שלה; אחרת לוקחת מודל שמישהו אחר אימן, משפרת ציר אחד בהתנהגותו, ומוכרת את השיפור כשירות. שתיהן לגיטימיות, והן נכשלות בדרכים שונות: משקלים פתוחים נכשלים לאט ובפומבי, תצוגות מקדימות נכשלות לפתע ובאמצעות הכרזה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית