כרטיס כותרת שנוצר עם הכיתוב "Ember-1" וכותרת המשנה "איכות Kimi K3, כ-40% פחות טוקני חשיבה" ושלושה כרטיסים: הפחתת חשיבה 35-50%, Terminal Bench 2.1 82.0%, שחרור תצוגה מקדימה למחקר. שורת כותרת תחתונה מציינת: נתונים שדווחו על ידי Fireworks, לא שוחזרו; פורסם ב-23 בספטמבר 2026.
Guides & Insights

Ember-1 מקצץ ב-40% את יכולות החשיבה של Kimi K3 — והאותיות הקטנות הן הסיפור

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המספר שיצוטט הוא 40%. Fireworks Research פרסמה את Ember-1 ב-23 בספטמבר 2026, ותיארה אותו כנגזרת מתמחה של Kimi K3 מבית Moonshot AI, ששומרת על הדיוק של K3 תוך צריכת כ-40% פחות טוקנים כדי להגיע לשם. זו טענה אמיתית וספציפית באופן יוצא דופן, והיא מגיעה עם שלושה דברים מצורפים: גיליון בנצ'מרקים מלא עם עמודות של הפחתת טוקנים, שני מבחני A/B של לקוחות מתעבורת קוד בייצור, ומצב הפצה שאינו זמינות כללית. Ember-1 זמין כתצוגה מקדימה מחקרית, בפלטפורמת serverless של הספק עצמו, עם חלון גישה של שבועיים והחלטה לגבי קביעות שתלויה בביקוש. להבין איזה חלק מזה הוא מוצר ששוחרר ואיזה חלק הוא תוצאת מחקר מנומקת היטב — זה כל התרגיל.

יש גם התנגשות שמות שכדאי להבהיר לפני כל דבר אחר. פרויקט מחקר פתוח נפרד בשם Ember (v0.1.5, מבית Slow Lit Labs) הקדיש את 2026 לפרסום הערכות של קוהרנטיות ארוכת טווח, והוא אינו קשור למודל הזה בשום צורה. כל דבר שתקראו על כך ש-Ember לא הצליח לנצח את Qwen3-8B בהגדרות הסקה תואמות עוסק באותו פרויקט. Ember-1, הנדון כאן, הוא נגזרת של Kimi K3 מבית Fireworks Research.

מה Ember-1 באמת

Ember-1 אינו ארכיטקטורה חדשה ואינו מודל בסיס חדש. זהו Kimi K3, שאומן מחדש להסיק בצורה תמציתית יותר. Fireworks Research ביצעה יותר מ-50 ניסויי אימון ויותר מ-200 הערכות על תשתית האימון ללא שרת שלה, בתחומי מתמטיקה, כתיבת קוד, עמידה בהוראות, שיחה, חיפוש, שימוש בכלים והנדסת תוכנה, במטרה מפורשת להסיר חשיבה שאינה משנה את התשובה. המעבדה אומרת שאפשר לקצץ את אורך החשיבה ב-35–50% ללא אובדן דיוק בשבעה מבחני בנצ'מרק ובשתי קבוצות תעבורת ייצור של לקוחות. כל אחד מהנתונים האלה מדווח על ידי הספק ולא שוחזר באופן עצמאי; נכון למועד הכתיבה, אף צד שלישי לא פרסם הרצה של Ember-1.

המסגור חשוב כי החלופה הברורה כבר הייתה קיימת. Kimi K3 מגיע עם הגדרות מאמץ חשיבה, והדרך הזולה להוציא פחות טוקנים היא להנמיך את המאמץ. Fireworks Research אומרת שניסתה זאת וההגדרה הנמוכה ויתרה על יותר מדי איכות — תוצאה מוכרת לכל מי שכיוונן רמות מאמץ במודל היסק. הטענה של Ember-1 היא שחוגת המאמץ גסה ואימון מחדש הוא עדין.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

מדוע אסימוני הסקה שווים כל כך הרבה מאמץ

החשבון של מודל חשיבה אינו נקבע בעיקר לפי התשובה שלו. Fireworks Research מציינת ש-K3 יכול להוציא יותר מ-90% מהטוקנים שהוא מייצר על חשיבה פנימית לפני שהוא כותב משהו שהמשתמש רואה. בבקשה בודדת זה רק יקר. בלולאת סוכן רב-תורית זה מצטבר, כי כל תור משחזר את השיחה הקודמת, כך שעקבות החשיבה מתורים קודמים נקראות מחדש ונגבות מחדש בכל קריאה עוקבת. Fireworks Research מתארת שההקשר גדל בערך באופן ריבועי עם מספר התורים. זהו היעד האמיתי של השחרור הזה, ולכן המדד הראשי הוא כ-40% פחות טוקנים ולא זינוק באיכות.

המנגנון גם מסביר את הסיכון. דחיסה שמסירה התלבטות מיותרת היא ללא עלות; דחיסה שמסירה שלב שהמודל נזקק לו אינה. אופן הכשל המדווח בהרחבה של צמצום חשיבה אגרסיבי מדי הוא מודל שמדלג על בדיקת ביניים וקופץ למסקנה, שבסוכן מתבטא הרבה יותר מאוחר כקריאה שגויה לכלי ולא כמשפט שגוי. ההדגשה החוזרת של Fireworks Research על איכות שקולה נקראת כתשובה לחשש הזה, ומספרי ה-A/B הם הדבר הקרוב ביותר לראיות לכך — עם ההסתייגות הרגילה שקבוצות הבדיקה, קריטריוני המעבר וגדלי המדגם נבחרו כולם על ידי הגורם שמציג את הטענה.

גיליון הבנצ'מרק, בצירוף מקורו

אלה הנתונים של Fireworks Research, שלא שוחזרו. העמודה הימנית היא החלק שכדאי לקרוא בעיון: היא מצמידה לכל ציון כמה טוקנים וכמה דולרים הוא דרש ביחס ל-K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82.0% לעומת K3 Max 80.9%, K3 High 77.6%, K3 Low 76.4%; 51.9% פחות טוקנים, $23.10 פחות לכל משימה.

• SWE-bench Verified (n=500) — Ember-1 92.2% לעומת K3 Max 93.2%; 15.5% פחות טוקנים, $68.10 פחות לכל משימה.

• SWE-Interact (n=75) — Ember-1 20.0% לעומת K3 Max 21.3%, K3 High 13.3%, K3 Low 6.7%; 32.5% פחות טוקנים.

• DeepSWE 1.1 (n=113) — Ember-1 75.2% לעומת K3 Max 66.4%; 23.7% פחות טוקנים, $126.90 פחות לכל משימה.

• τ-2 Bench Airline (n=50) — Ember-1 66% לעומת K3 Max 64%, K3 High ו-Low שניהם 64%; 5.9% פחות טוקנים, $0.30 פחות לכל משימה.

שני דברים בולטים. ראשית, Ember-1 מנצח באופן מובהק ב-Terminal Bench 2.1 וב-DeepSWE 1.1, בעוד שהוא מפסיד בפער קטן ב-SWE-bench Verified וב-SWE-Interact — דפוס שתואם מודל שלא איבד יכולת אלא שינה את סוג המשימות שעליהן הוא משקיע שיקול דעת. שנית, החיסכון בטוקנים אינו אחיד באופן קיצוני: 51.9% ב-Terminal Bench לעומת 5.9% ב-τ-2 Airline. לא משנה מה Ember-1 למד, זה לא קיצוץ אחיד של 40% בחשיבה. הנתון "בערך 40%" שבכותרת הוא ממוצע על פני טווח שנע מכ-6% לכ-52% בקירוב, וצוות שעומס העבודה שלו דומה ל-τ-2 Airline לא צריך לצפות להרגיש אותו.

מבחני A/B בייצור הם הראיות המשכנעות יותר, דווקא משום שהם לא נבנו כדי להיות בנצ'מרקים. בעומס קידוד של לקוח אחד, Ember-1 קיבל ציון 0.753 לעומת 0.751 של K3, לקח 21.4 צעדים לעומת 23.8, והפיק 29.9K אסימוני פלט לעומת 49.3K — הפחתה של 71.3% באסימוני החשיבה ו-39% בסך האסימונים, עם איכות שקולה בקירוב. לקוח שני ראה כ-35% פחות אסימונים לכל משימה באיכות דומה, ו-Fireworks Research אומרת שהיא הפעילה את המעבר תחילה על תעבורת הקידוד והעבודה המשותפת הפנימית שלה, כאשר התוצאה המדווחת היא שאיש לא שם לב. התייחסו לכל זה כמידע מדווח על ידי ספק, אך התייחסו אליו כצורה החזקה ביותר של מידע מדווח על ידי ספק: קשה יותר לשחק עם נתוני העדפה של A/B והשלמת משימות מאשר עם לוח דירוג.

יש הערכה אחת נוספת, על ה-Bedside Bench של Doximity — 500 מקרים קליניים שאומתו על ידי רופאים בעשר קטגוריות — שבה Fireworks Research טוענת ש-Ember-1 הציבה חזית פרטו חדשה בעלות לכל משימה, תוך השוואתה למודלים פתוחים וסגורים כולל GPT-5.6 Sol, GPT-6 Astra ו-Claude Opus 5. זוהי טענה של ספק בדבר מיקום בפרטו, כלומר טענה על פשרה דו-ממדית ולא על ציון בודד, והיא טובה רק כמו הנחות העלויות שמאחוריה. הנחות אלו הגיעו ממחירון ה-API הציבורי של Kimi K3. מה שמביא אותנו לחלק בסיפור שהקורא יכול למעשה לאמת היום.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

מודל הבסיס הוא החלק שאתה כבר יכול לנתב.

כל טיעון העלות של Ember-1 נמדד מול התעריפים המפורסמים של Kimi K3. Kimi K3 זמין ב-OrcaRouter במחיר של $3.00 למיליון אסימוני קלט, $0.30 למיליון אסימוני קלט במטמון ו-$15.00 למיליון אסימוני פלט, עם חלון הקשר של 1,048,576 אסימונים. זהו אותו כרטיס תעריפים שבו משתמשת השוואת Fireworks Research, וכדאי לדעת שהחיסכון בעמודות הפחתת האסימונים הללו מחושב מול מספרים שאפשר לראות בעצמכם ולא מול מודל עלויות פנימי של ספק.

Ember-1 עצמו אינו נמצא ב-OrcaRouter. הוא זמין רק דרך פלטפורמת ה-serverless של הספק עצמו, כתצוגה מקדימה למחקר, ו-Fireworks Research לא פרסמה עבורו מחיר — לכן המספרים בדולרים בטבלת הבנצ'מרק נגזרים משיעורי K3 ומספירות טוקנים, ולא מכרטיס תעריפים של Ember-1 שקיים. אם האריתמטיקה היא מה שמעניין אותך, סדר הפעולות הכנה הוא לתמחר את עומס העבודה במסלול של K3 היום, לקחת את אחוזי הפחתת הטוקנים כגבול העליון של מה שהחלפה עשויה להשיג, ולהמתין לתעריף מפורסם לפני שמודלים את החיסכון ככסף.

היכן ש-OrcaRouter כן עוזר כאן הוא בגידור הסיכון. תצוגה מקדימה מחקרית עם חלון גישה של שבועיים היא בדיוק סוג המודל שתרצו לנסות בלי להמר על נתיב ייצור, והדרך לעשות זאת בלי חוזה נוסף היא להציב אותו מאחורי אותה נקודת קצה שדרכה אתם קוראים לכל השאר. OrcaRouter מגיש 200+ מודלים מאחורי API אחד עם failover אוטומטי, כך שמודל תצוגה מקדימה שמתברר כלא זמין בחודש הבא הוא שינוי בניתוב ולא מיגרציה. שום דבר ב-Ember-1 לא דורש זאת — אבל גם שום דבר בחלון של שבועיים לא יוצא נגד זה.

מה לעשות עם הגרסה הזו

אם אתם כבר מריצים את Kimi K3 בלולאת סוכנים, המספרים של Ember-1 מתארים את החשבון שלכם. בעיית ההרצה החוזרת של ריבוי תורות היא אמיתית, היא העלות הדומיננטית בהרצות סוכנים ארוכות, ומודל שמקצר את העקבות שלו בלי לשנות את תשובותיו שווה את זמן ההערכה. המבחן הנכון אינו טבלת הבנצ'מרקים; הוא התעבורה שלכם, בהרצה בצל — שלחו חלק מהבקשות האמיתיות לשני המודלים, השוו את הפלטים, והשאירו את התוצאות החיות ללא שינוי במשך שבוע או שבועיים לפני שאתם משנים משהו. זו גם העצה שקהל הקוראים הביקורתי של ההשקה עצמו נותן, והיא מוצקה.

אם אתה מריץ עומס עבודה בעל שיקול דעת נמוך, או כזה שנשלט על ידי קריאות קצרות של סבב בודד, החיסכון ברובו מתאדה ושורת τ-2 Airline היא הציפייה הריאלית שלך. ואם אתה זקוק להתחייבות ברמת ייצור — מחיר, רמת שירות, ערובה שנקודת הקצה תתקיים בעוד שישה חודשים — Ember-1 עדיין לא מציע כזו. זהו תצוגה מקדימה מחקרית ש-Fireworks Research תולה במפורש את קביעותה בביקוש. השאלה המעניינת בחודש הקרוב היא אם חלון השבועיים יהפוך לאפשרות שירות קבועה ואם צד שלישי ישחזר חלק מהמספרים. עד שאחד מאלה יקרה, זו תוצאה חזקה לקריאה, אך חלשה שעליה לבנות תקציב.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

אין לפרש את כל זה כמעיט בערך העבודה. הסרת החשיבה בלי הסרת הדיוק היא בעיה קשה יותר מהוספתה, ולעשות זאת על גבי מודל חזית של מישהו אחר במקום לאמן מודל משלך — זו הצורה שחלק ניכר מעבודת היכולות של 2026 לבש. Ember-1 הוא השחרור הראשון בסדרה שלדברי Fireworks Research תימשך, והתבנית — לקחת מודל שכבר טוב, לאמן מחדש ציר אחד בהתנהגותו, ולמכור את הדלתא בטוקנים — היא אחת ששווה לעקוב אחריה, ללא קשר לאיך שהתצוגה המקדימה המסוימת הזו תתקבל.