כרטיס כותרת שנוצר ועליו הכיתוב "Ember-1 נגד Qwen3.8-Max" עם כותרת המשנה "נגזרת חסכונית בטוקנים מול ספינת הדגל", מעל שני כרטיסים: Ember-1 — "נטען כי 40% פחות טוקנים" ו"אין מחיר מפורסם"; Qwen3.8-Max — "2 דולר בקלט, 6 דולר בפלט" ו"הקשר של 1M טוקנים".
Guides & Insights

Ember-1 מול Qwen3.8-Max: הנגזרת החסכונית בטוקנים נגד ספינת הדגל

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לשני המודלים בהתמודדות הזו יש מספר אמיתי על אותו בנצ'מרק, וזה עדיין לא מכריע דבר. Ember-1 הוא נגזרת ייעודית של Fireworks Research מתוך Kimi K3 של Moonshot AI, שפורסמה ב-23 בספטמבר 2026, ומדווחת על 82.0% ב-Terminal Bench 2.1 עם בערך חצי מהטוקנים שמודל הבסיס שלה מוציא. Qwen3.8-Max הוא מודל הדגל של Alibaba — מודל תערובת מומחים דלילה עם בערך 2.4 טריליון פרמטרים, מתוכם כ-95 מיליארד פעילים לכל טוקן — זמין באופן כללי מאז 3 באוגוסט 2026, ומדווח על 86.6% באותו בנצ'מרק. שני הנתונים האלה מדווחים על ידי הספקים, שתי המעבדות הריצו מערכת בדיקה משלהן, ופער של 4.6 נקודות בין שתי מערכי הערכה שלא פורסמו אינו הכרעה. מה שכן ניתן להשוות הוא הכסף, ושם ההתמודדות הזו נעשית מעניינת: כל התזה של מודל אחד היא שלא צריך לשלם על טוקנים שאין בהם צורך, והאחר הוא מודל דגל במחיר של 2 דולר למיליון בקלט ו-6 דולר למיליון בפלט.

מה כל מודל הוא בפועל

Ember-1 אינו מודל חדש בשום מובן ארכיטקטוני. מדובר ב-Kimi K3 שאומן מחדש לחשוב בצורה תמציתית יותר, שנבנה על ידי Fireworks Research במהלך יותר מ-50 ניסויי אימון ויותר מ-200 הערכות על תשתית האימון נטולת השרתים שלה. טענת המעבדה היא שהחשיבה של K3 ארוכה יותר ממה שהמשימות דורשות, וניתן להסיר את העודף מבלי לשנות את התשובות — אורך החשיבה ירד ב-35–50% ללא אובדן דיוק בשבעה בנצ'מרקים ושתי בדיקות A/B בייצור של לקוחות. הוא זמין כתצוגה מקדימה למחקר בפלטפורמה נטולת השרתים של הספק עצמו, ללא משקלים מפורסמים וללא מחיר מפורסם.

Qwen3.8-Max הוא סוג שונה לחלוטין של אובייקט. זו שכבת החזית של Alibaba, מולטימודאלית באופן מובנה לקלט טקסט, תמונה וווידאו, עם חלון הקשר של מיליון טוקנים, ורועננה פעמיים מאז ההשקה: עדכון פוסט-אימון ב-2 בספטמבר 2026 שמכוון לקידוד ולעבודה משרדית מקצועית, ושכבת שירות מהירה יותר שהוכרזה ב-22 בספטמבר 2026. Alibaba מציבה אותו מול GPT-5.5, Claude Opus 4.7 ו-Gemini 3.1 Pro, וגיליון ההערכה המפורסם שלה משקף את השאיפה הזו — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 ו-Humanity's Last Exam ב-43.6, הכול לפי דיווח הספק.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

כרטיסי התעריפים, זה לצד זה

לאחד מאלה יש מחיר ולשני אין — זו האסימטריה המעשית הראשונה.

• קלט — Ember-1: לא פורסם דבר; גיליון הבנצ'מרק מחשב דולרים לפי המחירון של Kimi K3. Qwen3.8-Max: $2.00 למיליון טוקנים ב-OrcaRouter.

• פלט — Ember-1: לא פורסם. Qwen3.8-Max: ‏$6.00 למיליון טוקנים.

קלט שמור במטמון — Ember-1: לא רלוונטי. Qwen3.8-Max: $0.25 למיליון טוקנים עבור קריאות מהמטמון, שהם שמינית מתעריף הקלט ומשמעותיים מאוד בלולאות סוכנים שבהן אותו הקשר נשלח מחדש בכל תור.

• חלון הקשר — Ember-1: לא פורסם עבור התצוגה המקדימה; מודל הבסיס שלו מכיל 1,048,576 טוקנים. Qwen3.8-Max: 1,000,000 טוקנים.

• רב-מודאליות — Ember-1: טקסט. Qwen3.8-Max: טקסט, תמונה ווידאו בכניסה, טקסט ביציאה.

• משקולות — Ember-1: אין. Qwen3.8-Max: קיימת גרסה עם משקולות פתוחות, אך היא טקסטואלית בלבד וחסרים לה חלון ההקשר המלא וקלט הראייה של נקודת הקצה המוגשת.

• גישה — Ember-1: תצוגה מקדימה למחקר, חלון ללא שרת של שבועיים, קביעוּת מותנית בביקוש. Qwen3.8-Max: זמין לכלל ומתומחר.

שים לב לדבר אחד לגבי התעריפים של Qwen3.8-Max לפני שאתה מדגמן משהו: Aliba​ba שינתה את אריזת המודל הזה שוב ושוב מאז ההשקה, וכרטיס התעריפים הבינלאומי לא תמיד תאם את המחיר הכותרתי של אוגוסט. התייחס ל-$2.00 ול-$6.00 כמחיר המסלול הנוכחי בפלטפורמה שלנו — שמעבירה את מחיר המחירון של הספק כמו שהוא, ללא תוספת — כך ששינוי אצל ספק מופיע באותו יום — ובדוק את הכרטיס לפני שאתה מקצה לו תקציב.

מדוע השוואת הבנצ'מרק אינה עובדת

ה-82.0% של Ember-1 וה-86.6% של Qwen3.8-Max הם שניהם מ-Terminal Bench 2.1, מה שגורם להם להיראות ברי-השוואה אך אינו הופך אותם לברי-השוואה. בגיליון של Ember-1, המספר מוצג מול וריאנטים של Kimi K3 שנבחנו על ידי Fireworks Research, על 89 דגימות, עם דלתאות של טוקנים ועלות מצורפות. המספר של Qwen3.8-Max מגיע מגיליון ההערכה של Aliba​ba עצמה. מעבדות שונות, הרנסים שונים, שלדי סוכנים שונים, ובבנצ'מרק שציוניו זזים בכמה נקודות רק בשל בחירת השלד, פער של 4.6 נקודות נמצא בתוך רצפת הרעש של המתודולוגיה.

מה שאפשר לקרוא מהגיליון של Ember-1 הוא עמודת הטוקנים, וזה הדבר היחיד שהמודל אומן לשנות. מול הבסיס של עצמו, Ember-1 מוציא 51.9% פחות טוקנים ב-Terminal Bench 2.1, 32.5% פחות ב-SWE-Interact, 23.7% פחות ב-DeepSWE 1.1 ורק 5.9% פחות ב-τ-2 Bench Airline. הפיזור הזה הוא הכותרת הכנה. מודל שמקצץ בהתלבטות שווה הרבה מאוד בבנצ'מרקים שבהם מודל הבסיס חושב יותר מדי, וכמעט כלום במקומות שבהם הוא לא, ואין לך דרך לדעת איזה סוג של עומס יש לך בלי למדוד את שלך.

עלות לכל משימה שהושלמה, מחושבת במלואה

הנה החשבון שלמעשה מכריע את העניין, תוך שימוש בתעריפים המפורסמים של Kimi K3 כמייצג לעלות של Ember-1, מאחר של-Ember-1 אין כזו. Kimi K3 עומד על $3.00 למיליון אסימוני קלט, $0.30 במטמון ו-$15.00 פלט — בדיוק לוח התעריפים ש-Fireworks Research השתמשה בו בהשוואה שלה. Qwen3.8-Max עומד על $2.00 בקלט ו-$6.00 בפלט, עם קריאות מטמון ב-$0.25.

בצד הקלט, Qwen3.8-Max כבר זול יותר, בשליש. בצד הפלט הוא זול יותר פי 2.5 לכל טוקן. המשמעות היא שהצמצום בטוקנים של Ember-1 לא מתחרה בחשבון סטטי — הוא מתחרה במודל דגל שזול יותר לכל טוקן עוד לפני שנעשתה עבודת יעילות כלשהי. בבדיקת A/B בייצור של Fireworks Research עצמה, טוקני הפלט ירדו מ-49.3K ל-29.9K, צמצום כולל של 39%; אם מחילים זאת על תעריף הפלט של Qwen3.8-Max, מתקבל אותו חיסכון של 39%, וזה ניצחון מוחלט קטן יותר מאשר אותו אחוז המיושם על התעריף של $15 של K3.

מכאן שהטיעון בדבר היעילות של Ember-1 הוא החזק ביותר כשהוא נמדד מול מודל הבסיס של עצמו, וזה בדיוק הטיעון שההשקה מציגה. מול Qwen3.8-Max ההשוואה עוברת ליכולת לכל דולר, שבה ההקשר הרחב יותר של דגם הדגל, קלט מולטימודלי וזמינות מתומחרת הם הנגד-טיעונים — ושבה איש לא פרסם השוואה ראש בראש שתכריע.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

מה שנתוני הניתוב שלנו מראים

שניים מבין שלושת המודלים המעורבים כאן הם נתיבים פעילים ב-OrcaRouter, מה שמספק תצוגה שאף גיליון בנצ'מרק לא מכיל. Qwen3.8-Max מוגש עם 1,000,000 טוקנים של הקשר, עם השהיית טוקן ראשון חציונית של כ-2.0 שניות וכ-52.7 טוקני פלט לשנייה בשבעת הימים האחרונים, עם שיעור שגיאות של כ-4.2%. Kimi K3 — המודל הבסיסי של Ember-1, ונקודת הייחוס לכל חיסכון ש-Ember-1 טוען לו — פועל עם 1,048,576 טוקנים של הקשר, השהיה חציונית של קרוב ל-8.0 שניות, כ-43.6 טוקני פלט לשנייה ושיעור שגיאות של כ-0.27%, בתעבורה גבוהה משמעותית. Ember-1 עצמו אינו נמצא ב-OrcaRouter.

המספרים האלה מציגים את ההחלטה באור אחר. Kimi K3 איטי במידה ניכרת עד לאסימון הראשון ויקר בערך פי שניים לכל אסימון פלט לעומת Qwen3.8-Max, בעוד ששיעור השגיאות שלו נמוך בהרבה תחת עומס כבד בהרבה. נגזרת חסכנית באסימונים של K3 מצמצמת את פער העלויות אך אינה סוגרת את פער השהיה, מפני שקיצור ההיסק מקצר את שלב היצירה, לא את התור. אם עומס העבודה שלך רגיש לשהיה יותר מאשר להוצאות, דגם הדגל הוא המסלול הטוב יותר היום, וסיפור היעילות אינו לעניין.

איזה מהם לנתב

נתבו אל Qwen3.8-Max כשאתם זקוקים לחלון ההקשר, לקלט הרב-מודאלי, למחיר מפורסם ולשירות שאפשר לתקצב מולו. הוא הבטוח מבין השניים מעצם הגדרתו: זמין באופן כללי, מתומחר, ומתרענן פעמיים בחודשיים בידי ספק עם רקורד של שמירה על נקודת הקצה מעודכנת.

נסו את Ember-1 כשהחשבון שלכם נשלט על ידי טוקני הסקה בלולאות סוכנים ארוכות ואתם פועלים מול מודל מתארח ולא מול חומרה משלכם. המבחן הנכון הוא השבועיים שהתצוגה המקדימה נותנת לכם, בהרצת צל מול תעבורת הייצור, ומדידת טוקנים לכל משימה שהושלמה ולא טוקנים לכל בקשה. מה שאסור לכם לעשות הוא להחליף אותו כתחליף אחד-לאחד למודל דגל על סמך נתון של 40% שנע בין 6% ל-52% בהתאם לעומס העבודה.

אם השאלה האמיתית היא אם להמשיך להריץ את Kimi K3 בכלל, על זו אתה יכול לענות כבר היום בלי שום תצוגה מקדימה: גם Kimi K3 וגם Qwen3.8-Max נמצאים ב-OrcaRouter מאחורי מפתח אחד, במחיר המחירון של הספק בלי תוספת, עם מעבר אוטומטי בין ספקים. השוואת העלות של עומס העבודה שלך על שניהם היא שינוי בניתוב, לא פרויקט רכש — והיא נותנת לך את קו הבסיס שהופך כל טענת יעילות לגבי Ember-1 למדידה במספרים שלך ולא במספרים של המעבדה.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

הסיכום הישר הוא ששני המודלים האלה מאופטמים אל מול אילוצים שונים. Qwen3.8-Max בנוי להיות הדבר היכול ביותר שזמין, ומתומחר בהתאם; Ember-1 בנוי להפוך מודל יקר ממילא לזול יותר להרצה. שניהם לגיטימיים, והסיבה שהעימות הזה לא מאפשר הכרעה נקייה היא שהחיסכון של המודל הנגזר מוגדר ביחס למחירון שמחירי דגם הדגל נמוכים ממנו באופן מהותי.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית