
Ember-1 vs Gemma 4 12B: האחד משכיר לך פחות טוקנים, והאחר מוסר לידיך את המשקולות
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
Ember-1 ו-Gemma 4 12B אינם מתחרים על אותה שורה בהזמנת רכש, והדרך המהירה ביותר לראות למה היא לשאול מה יהיה בבעלותך בסוף כל חודש. Gemma 4 12B הוא המודל המולטימודלי הצפוף של Google עם 11.95 מיליארד פרמטרים, ששוחרר ב-3 ביוני 2026 תחת Apache 2.0 — אתה מוריד אותו, והצ'קפוינט הוא שלך. Ember-1 הוא נגזרת מתמחה של Fireworks Research ל-Kimi K3 של Moonshot AI, שפורסמה ב-23 בספטמבר 2026 כתצוגה מקדימה למחקר בפלטפורמת ה-serverless של הספק עצמו — אתה קורא לו, ואין בבעלותך דבר מלבד החשבונית. האחד הוא טיעון של שכירות-לבעלות בנוגע לטוקנים; האחר הוא רכישה הונית. אם תעמיד אותם זה לצד זה, ההשוואה המועילה אינה איזה מודל טוב יותר, מפני ששום דבר שפורסם לא מאפשר להכריע בכך. היא איזו משתי צורות הרכש מתאימה לדבר שאתה בונה.
שני החוזים, בניסוח פשוט
Gemma 4 12B הוא מהדורה מוגמרת של משקולות פתוחות. Google מפרסמת את המשקולות, את הארכיטקטורה, את גיליון הבנצ'מרקים ואת הרישיון, וקהילה של סביבות הרצה — llama.cpp, vLLM, MLX, SGLang, Transformers — מריצה אותו על חומרה שבשליטתך. עלות הטוקן לאחר הרכישה היא חשמל ופחת, ולא סעיף חיוב מספק. הדברים שאתה מוותר עליהם הם מה שמשקולות פתוחות תמיד גובות: תכנון הקיבולת הוא באחריותך, ותקרת האיכות שלך קבועה על 11.95 מיליארד פרמטרים.
Ember-1 היא ההופכית. אין משקלים להורדה — היא קיימת כאפשרות הגשה בפלטפורמה של הספק עצמו — ואין מחיר מפורסם. מה שהיא מציעה במקום זאת הוא טענה צרה יותר, המיושמת על גבי מודל גדול בהרבה: הדיוק של Kimi K3, עם כ-40% פחות טוקנים שמושקעים כדי להגיע לשם. Fireworks Research אימנה אותה במיוחד לקצר עקבות חשיבה בלי לשנות תשובות, ומדווחת שאורך החשיבה יכול להיחתך ב-35–50% בלי אובדן דיוק על פני שבעה מבחני ביצועים ושני מבחני A/B בייצור של לקוחות. כל נתון שם מדווח על ידי הספק ולא שוחזר.

הערך של טיעון הטוקן תלוי לחלוטין במי שמשלם עבור הטוקנים
הפיץ' של Ember-1 מניח חיוב לפי טוקן. ההנחה הזו נכונה עבור קהל היעד שעבורו הוא תוכנן — צוותים שמריצים לופים ארוכים של סוכנים מול מודל חזית מתארח, שבהם Fireworks Research מציינת ש-Kimi K3 יכול להוציא יותר מ-90% מהטוקנים שנוצרו על הסקה פנימית, ושבהם כל סבב משחזר סבבים קודמים כך שההסקה המוקדמת נקראת מחדש ומחויבת מחדש. בהקשר הזה, קיצור אורך ה-trace הוא קיצוץ ישיר בחשבון החודשי, והתוצאה של A/B של 29.9K טוקני פלט מול 49.3K של K3 היא המספר שחשוב.
הרץ את אותו מודל לפי התנאים של Gemma 4 12B והטיעון מתמוסס. כאשר אתה מארח בעצמך צ'קפוינט Apache-2.0, אסימוני חשיבה נוספים עולים בזמן שעון ובתפוסת GPU, לא בדולרים למיליון. מסלול חשיבה מפורט על המחשב הנייד שלך עם 16GB הוא תשובה איטית יותר, לא חשבון גדול יותר. זה לא הופך את חוסר היעילות לבלתי מזיק — בלולאת סוכן הוא עדיין מצטבר, והוא עדיין מופיע כהשהיה — אבל שער החליפין שונה, והתייחסות להפחתה של 40% בטוקנים כאל חיסכון של 40% בחומרה באירוח עצמי היא שגיאת קטגוריה.
דף המפרט, שורה אחת לכל ממד
• מה זה — Ember-1: נגזרת בגרסת תצוגה מוקדמת למחקר של Kimi K3, שאומנה מחדש לחשיבה קצרה יותר. Gemma 4 12B: מודל מולטימודאלי צפוף עם משקולות פתוחות בנפח 11.95B ממשפחת Gemma 4 של Google.
• משקלים — Ember-1: לא פורסמו; מוגשים רק דרך הפלטפורמה של הספק. Gemma 4 12B: Apache 2.0, ניתנים להורדה, ללא הגבלת גישה.
• גודל — Ember-1: לא נחשף; בירושה מארכיטקטורת Kimi K3. Gemma 4 12B: 11.95B צפוף, 48 שכבות, כ-18GB של משקלים ב-BF16.
• חלון הקשר — Ember-1: לא פורסם עבור התצוגה המקדימה; מודל הבסיס שלה מכיל 1,048,576 טוקנים. Gemma 4 12B: 256 אלף טוקנים.
• קלטים — Ember-1: טקסט. Gemma 4 12B: טקסט, תמונה ואודיו באמצעות עיצוב מאוחד נטול מקודד, כאשר וידאו מופיע ברשימות של חלק מהמקורות.
• מחיר — Ember-1: לא פורסם; הדולרים בגיליון הבנצ'מרק מחושבים לפי כרטיס התעריפים של Kimi K3. Gemma 4 12B: חינם להורדה; אתה משלם על החומרה.
• רצפת חומרה — Ember-1: מה שהספק מתכנן. Gemma 4 12B: 16GB של VRAM או זיכרון מאוחד, לפי המיצוב של Google.
• ראיות — Ember-1: בנצ'מרקים של הספק ושני מבחני A/B שהספק הריץ, ללא שחזור. Gemma 4 12B: הערכות שדווחו על ידי Google בתוספת אקוסיסטם עצמאי של הרצות מקומיות.
מה Gemma 4 12B מפרסם, ואיך הוא קורא
המספרים של Google עצמה עבור Gemma 4 12B מציבים אותו בין Gemma 4 E4B בגודל edge לבין ה-26B MoE הגדול יותר: GPQA Diamond 78.8%, MMLU Pro 77.2%, AIME 2026 ללא כלים 77.5%, LiveCodeBench v6 72.0, Codeforces ELO 1659, ממוצע τ-2 69.0%, MMMU Pro 69.1%, DocVQA 94.9 ו-BigBench Extra Hard 53.0%. גם אלה דווחו על ידי הספק — Google העריכה את המודל של עצמה ופרסמה את הטבלה — אבל יש להם היתרון בכך שהם מתארים checkpoint שכל אחד יכול להוריד ולהריץ מחדש, ולכן טענות בדבר משקלים פתוחים נוטות לזכות באימות מצד שלישי במהירות, בעוד שטענות של תצוגה מקדימה סגורה אינן זוכות לכך.
ההבחנה האמיתית של המודל היא מבנית ולא מספרית. ל-Gemma 4 12B אין מקודד חזותי או קולי נפרד: טלאי תמונה וצורות גל של שמע מוקרנים ישירות אל מרחב הטוקנים, וזה מה שמאפשר למודל 12B לקבל צילום מסך או הקלטה כקלט בכלל. הוא גם מגיע עם מודלי טיוטה לחיזוי רב-טוקני עבור פענוח ספקולטיבי, שזה מאפיין השהיה ולא מאפיין איכות — מהסוג שמשנה כשאתה מריץ את המודל בעצמך וכל אלפית שנייה של prefill היא על חשבונך.
היכן שהשניים למעשה מתנגשים
שני המודלים נמכרים לקידוד סוכני ולשימוש בכלים, וזהו השטח היחיד שבו קיימת בחירה אמיתית. הנתון של Ember-1 ב-Terminal Bench 2.1 הוא 82.0% לעומת 80.9% של Kimi K3 Max, עם 51.9% פחות טוקנים; התוצאה שלו ב-SWE-bench Verified היא 92.2% לעומת 93.2% של K3 Max. ל-Gemma 4 12B אין כלל נתון של Terminal Bench או SWE-bench בסט המפורסם של Google — הראיה הסוכנית שלה היא τ-2 ב-69.0%. לכן אי אפשר להעמיד את השניים זה מול זה על מדד משותף, וכל מאמר שעושה זאת פשוט ממציא את ההשוואה.
מה שאפשר לומר הוא שהם נמצאים בנקודות שונות על עקומת עלות. אם עומס העבודה של הסוכן שלך פועל מול מודל frontier מתארח והחשבון נשלט על ידי טוקנים של הסקה, Ember-1 תוקף בדיוק את המונח הזה — במחיר של חלון גישה של שבועיים וללא תעריף מפורסם. אם עומס העבודה שלך צריך לרוץ על חומרה שאתה שולט בה, להתמודד עם צילום מסך, או לשרוד מצב שבו ספק מחליט לא להמשיך תצוגה מקדימה, Gemma 4 12B הוא היחיד מבין השניים שעונה על השאלה בכלל.

דרך אמצעית, והיכן למצוא אותה
יש אפשרות שלישית ששיווק של אף אחד מהמודלים עצמו אינו בנוי סביבה: להשתמש בשכבות ה-Gemma 4 הגדולות יותר כחצי המתארח של היברידי. OrcaRouter מנתב את Gemma 4 26B-A4B של Google ו-Gemma 4 31Bלצד יותר מ-200 מודלים אחריםמאחורי API אחד במחיר המחירון של הספקעם 0% תוספת מחיר, כך שאותו מפתח שמגיע ל-Gemma בינוני מגיע גם למודלים המובילים שהייתם זקוקים עבורם לחוזה שני. Gemma 4 12B עצמו אינו נמצא בפלטפורמה שלנו, וגם Ember-1 לא — אם אתם צריכים את ה-12B באופן מקומי, הורידו אותו; אם אתם רוצים לבדוק תחילה אם Gemma גדול יותר סוגר את הפער, הבדיקה הזו עולה נקודת קצה אחת.
סידור כזה הוא גם הדרך ההגונה להעריך תצוגה מקדימה מחקרית. מעבר אוטומטי בין ספקים בעת כשל פירושו שמודל שנעלם מחלון התצוגה המקדימה לא גורר איתו את היישום שלך, וזה הסיכון הספציפי שמצב ההשחרור של Ember-1 מכניס, והסיכון הספציפי ששום דבר בטבלת הבנצ'מרקים שלו לא מתייחס אליו.
איזה מהם שייך למפת הדרכים שלך?
בחרו ב-Gemma 4 12B אם בעלות היא דרישה — פרטיות, פעולה לא־מקוונת, רצפת עלות קבועה, או מוצר שחייב להמשיך לעבוד אם ספק משנה את דעתו. התקרה המוצהרת שלו נמוכה מזו של נגזרת של מודל חזית, והקלט הרב־מודלי שלו אכן מבדל, ושתי העובדות האלה אינן תלויות במפת הדרכים של אף אחד אחר.
בחר ב-Ember-1 אם הבעיה שלך היא חיוב לפי טוקן בריצות סוכנים ארוכות ואתה יכול לספוג את הסיכון שבגרסת תצוגה מקדימה. הרץ אותו במצב צל מול הפתרון הקיים שלך במשך השבועיים שיש לך, מדוד טוקנים לכל משימה שהושלמה בתעבורה שלך, והתייחס ל-40% כהשערה ולא כשיעור. מה שאתה לא צריך לעשות הוא לבחור ביניהם על סמך איכות, כי אף אחד — כולל המעבדה שבנתה את Ember-1 — לא פרסם השוואה שתאפשר לך זאת.

הנקודה הגדולה יותר היא ששתי מהדורות אלו מייצגות את שתי הדרכים שבהן נמכרת יכולת בסוף 2026. מעבדה אחת מפרסמת נקודת ביקורת ומניחה למערכת האקולוגית למצוא את הרמה שלה; אחרת לוקחת מודל שמישהו אחר אימן, משפרת ציר אחד בהתנהגותו, ומוכרת את השיפור כשירות. שתיהן לגיטימיות, והן נכשלות בדרכים שונות: משקלים פתוחים נכשלים לאט ובפומבי, תצוגות מקדימות נכשלות לפתע ובאמצעות הכרזה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
