
Muse Spark 1.2 לעומת Muse Spark 1.1: האם כדאי לשדרג?
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1653אינטליגנציה69כתיבת קוד60מתמטיקה
Meta החליפה את Muse Spark 1.1 ב-Muse Spark 1.2 ב-5 באוגוסט 2026, מבלי לשנות את המחיר, את חלון ההקשר, את רשימת המודאליות, את הפרמטרים הנתמכים או את חוגת ההיגיון. לכן ההעברה נראית חינמית — אותה משפחת מחרוזות מודל, אותו חיוב, אין מה לנהל משא ומתן. אבל היא לא חינמית. מדידה בלתי תלויה מעמידה את הזמן עד לטוקן הראשון של הגרסה החדשה על 26.12 שניות, לעומת 2.90 בגרסה הישנה, ואת התפוקה הרציפה שלה על 165 טוקנים לשנייה, לעומת 213.5. אתה קונה שלוש נקודות של אינטליגנציה נמדדת תמורת המתנה ארוכה פי תשעה בערך לפני שמשהו חוזר.
האם כדאי לעשות את זה תלוי כמעט לחלוטין בכמה זמן המשימות שלך פועלות. הנה מה שבאמת שונה, מה שנשאר זהה, ומה שאף אחד עדיין לא יכול לספר לך.
ההחלטה בארבע שורות
• מדד אינטליגנציה: 51 → 54, נמדד באופן עצמאי על ידי Artificial Analysis בהגדרת ה-xhigh של כל גרסה.
• זמן לטוקן הראשון: 2.90s → 26.12s, אותו מקור, אותם תנאים.
• העלות להרצת ערכת הבדיקות הזהה: $548.07 → $637.85, בתמחור זהה לכל אסימון. התוספת של 16% היא שריפת טוקנים טהורה.
• כל מה שטופס רכש שואל עליו: ללא שינוי.

מה שבאמת זהה
כדאי לפרט את זה, כי זו הסיבה שמיגרציה נראית טריוויאלית על הנייר, וכיוון שהבדל שאינו קיים הוא דבר שאין צורך לבדוק.
• מחיר — $1.25 דולר למיליון טוקני קלט, $4.25 דולר למיליון טוקני פלט, $0.15 דולר למיליון במקרה של פגיעה בקאש, $2.50 דולר לאלף חיפושי אינטרנט מובנים. כל אחד מהנתונים הללו זהה בשתי הגרסאות.
• הקשר — 1,048,576 טוקנים בשניהם, ללא דרגת חיוב נוספת עבור הקשר ארוך באף אחד מהם.
• אופני קלט — טקסט, תמונות, וידאו, אודיו ו-PDF כקלט; טקסט כפלט. שני הרישומים מציגים את אותם חמישה סוגי קלט.
• מחוון חשיבה — חובה בשתי הגרסאות, חמש רמות (מינימלי, נמוך, בינוני, גבוה, גבוה מאוד), ברירת המחדל היא בינוני בשתיהן. אין הגדרה באף אחת מהגרסאות שמכבה את החשיבה.
• פרמטרים — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. רשימות זהות.
• הגשה — ספק אחד, מטא עצמה, בשניהם. אין מארחים של צד שלישי, אין גרסאות קוונטיזציה.
• מחיר משולב — Artificial Analysis מעמידה את שניהם על $0.78 למיליון טוקנים בשקלול המשולב שלה, וזה מה שהיית מצפה מכרטיסי תעריף זהים.
אם קיווית שהשדרוג יביא איתו יותר הקשר, הבטחה לאורך השלמה, או מטמון זול יותר — זה לא קרה. זהו שחרור של משקלים ופוסט-אימון, עם כרטיס תעריפים שהועתק-הודבק מקודמו.
מה בעצם זז
Artificial Analysis הוא כיום הגוף העצמאי היחיד שהעריך את שתי הגרסאות, והוא העריך את שתיהן ברמת המאמץ החשיבתי הגבוהה ביותר, כך שמדובר בהשוואה הוגנת.
• מדד האינטליגנציה — 51 עבור 1.1 (מקום #22 מתוך 185) עד 54 עבור 1.2 (מקום #13). תשעה מקומות בלוח שבו החציון של הכיתה הוא 32, כך שהרווח קונה מיקום אמיתי, לא רק שבר עשרוני.
• זמן עד לטוקן הראשון — מ-2.90 עד 26.12 שניות. זוהי הרגרסיה המרכזית והיא אינה שולית.
• מהירות פלט — מ-213.5 ל-165.0 אסימונים לשנייה. עדיין מדורגת #16 מתוך 185 ועדיין מתוארת על ידי Artificial Analysis כ"מהירה במיוחד", אך איטית ב-23% מהמודל שהיא מחליפה.
• מילוליות — 94 מיליון טוקני פלט כדי לעבור את המדד, לעומת 95 מיליון. למעשה ללא שינוי, ושניהם כ-45% מעל החציון של 65 מיליון.
• סה"כ הוצאות הערכהמכיוון שהאריכות בקושי השתנתה והמחירים לא השתנו כלל, העלייה של 16% מגיעה ממקום אחר מאשר הפלט הנראה לעין: שרשראות חשיבה פנימיות ארוכות יותר, יותר ניסיונות חוזרים, או יותר פניות כלים למשימה.
התבנית קוהרנטית. מטה לא הפכה את המודל לזול יותר, מהיר יותר או גדול יותר. היא גרמה למודל להתלבט זמן רב יותר לפני שהוא מתחייב, וההתלבטות הנוספת מתבטאת כחביון, כסטרימינג מעט איטי יותר, וכחשבון גבוה ב-16% עבור אותה עבודה. שלוש נקודות מדד זה מה שזה קנה.
כמה רעה ההשהיה באמת
הנתון של 26.12 שניות יצוטט מחוץ להקשר, אז התייחסו אליו נכון: הוא נמדד ב-xhigh, שהיא היקרה ביותר מבין חמש רמות המאמץ, על חבילת בנצ'מרק שתוכננה להיות קשה. ברירת המחדל של ה-API היא medium.
כדי לקבל תחושה איך ברירת המחדל מרגישה בפועל, Muse Spark 1.1 על OrcaRouter — המשרתת מתקשרים אמיתיים בכל רמת מאמץ שהם מבקשים — מציגה זמן p50 עד לטוקן ראשון של 1.84 שניות ו-p95 של 6.00 שניות לאורך שבוע מתגלגל. אלו נתוני ייצור ברמות מאמץ ייצוריות, והם נמוכים ביותר מסדר גודל אחד מהנתון ב-benchmark. לגרסה 1.2 אין עדיין טלמטריית ייצור.

אז הקריאה הכנה אינה "1.2 דורש 26 שניות כדי להגיב." היא: בהגדרה שבה 1.2 זוכה בשלוש הנקודות הנוספות שלו, הטוקן הראשון עולה לך 26 שניות, ובאותה הגדרה המודל הישן עלה לך שלוש. אם כבר רצת ב-xhigh — שהיא בדיוק ההגדרה שבה קיים הרווח השכלי — זה המספר שאתה יורש. אם אתה רץ ב-medium או מתחת, תראה משהו קצר בהרבה, ותראה גם פחות מהשיפור.
הצימוד הזה {{1}}הוא המלכודת האמיתית{{/1}} בשדרוג הזה. אי אפשר לקחת את התבונה {{2}}בלי ההתבוננות,{{/2}} כי ההתבוננות היא המקור שממנו מגיעה התבונה.
המיקום מחדש מאחורי המספרים
Meta לא פרסמה פוסט השקה עבור 1.2 — עמוד ההכרזה של Muse Spark עדיין מתאר את 1.1 — אבל היא כתבה מחדש את תיאור המוצר, והגרסה החדשה מסבירה את ההתפשרות.
Muse Spark 1.1 שווק כמודל חשיבה מולטי־מודאלי עם משטח קלט רחב במיוחד, שנועד עבור "סוכנים מולטי־מודאליים, מחקר מעמיק על מדיה מעורבת, וניתוח הקשר ארוך": דוחות ארוכים, ספריות מדיה, הקלטות ווידאו לצד טקסט.
התיאור של Muse Spark 1.2 משמיט כמעט את כל זה ומציין במקום זאת הנדסת תוכנה — רפקטורינג של קבצים מרובים, סשנים ממושכים של ניפוי באגים, יצירת מאגר קוד שלם — ואז מוסיף טענה מפורשת על רב־סוכנים: המודל יכול לפעול כסוכן הראשי שאוסף הקשר, מתכנן ומאציל משימות, או כסוכן משנה שפועל במקביל תחתיו. הוא גם טוען ששמירת פרומפטים במטמון יכולה להפחית את העלות האפקטיבית ב־60–80%, תלוי בכמה הקשר חוזר בין קריאות. הנתון האחרון הוא הערכה של Meta ולא תוצאה שנמדדה, אם כי תעריף המטמון של $0.15 הופך אותו לסביר מבחינה אריתמטית.
קרא את רגרסיית החביון ביחס למיקום המחדש הזה, וזה מפסיק להיראות כמו טעות. אף אחד שמבצע ריפקטורינג לתריסר קבצים לא מתעניין ב-26 שניות של תכנון. Meta בחרה לקוח, וזה לא הלקוח שאליו נמכרה הגרסה 1.1.
מה שעדיין יש ב־1.1 שאין ב־1.2
ארבעה שבועות של קיום אינם מספיקים כדי לצבור רקורד, ובשלוש דרכים קונקרטיות הדגם הישן יותר הוא כיום המוצר המתועד טוב יותר.
• שיא זירה.ל-Muse Spark 1.1 יש היסטוריה משמעותית ב-Design Arena: 1334 Elo במקום 5 בפיתוח משחקים, 1334 במקום 7 ברכיבי UI, 1320 במקום 3 באמנות ASCII, 1318 בהדמיית נתונים, 1309 בקטגוריות קוד כלליות, בנוסף לסולם agents-arena מלא המכסה אפליקציות ווב, מצגות HTML ופיתוח משחקים ב-Godot. ל-Muse Spark 1.2 אין רשומות כלל. בציר ש-Meta משווקת כרגע הכי חזק, אין נתוני ראש-בראש עבור הדגם החדש.
• ציוני תת-מדדים.Artificial Analysis מפרסם מדד קידוד של 71.3 ומדד אג'נטיק של 37.5 עבור 1.1. אין מקבילה שפורסמה עבור 1.2. מכיוון שציון האג'נטיק היה הממד החלש ביותר של 1.1 בפער גדול, ויכולת אג'נטיק היא בדיוק מה ש-1.2 טוענת לשפר, זה המספר שהיה מיישב את שאלת השדרוג — והוא עדיין לא קיים.
• טלמטריית פרודקשן. ל-1.1 יש שבוע של אחזור p50 ו-p95 אמיתי מאחוריה ו-4.4M טוקנים של תעבורה חיה על OrcaRouter. ל-1.2 אין אף אחד מאלה; נקודת הקצה שלה כרגע לא מדווחת על סטטיסטיקות אחזור או תפוקה כלל, כי נפח התעבורה נמוך מכדי לדגום.
• איפה לשכור אותו מלבד Meta. Muse Spark 1.1 נמצא בקטלוג OrcaRouter במחיר של $1.25 ו-$4.25 — מחיר המחירון של Meta עצמה, שמועבר ללא תוספת מחיר (0%). Muse Spark 1.2 עדיין לא שם, ולכן היום מדובר באינטגרציה ישירה של Meta עם ספק יחיד וללא נתיב גיבוי.

שום דבר מזה לא אומר ש-1.2 גרוע יותר. זה אומר שהראיות ל-1.2 מורכבות מציון מורכב אחד ממעריך אחד, בעוד שהראיות ל-1.1 הן חודש של זירות, מדדי משנה ותעבורה חיה. האסימטריה הזו אמורה להשפיע על אופן ביצוע ההגירה, לא על השאלה אם לנסות אותה.
רשימת בדיקות הגירה שבאמת קצרה
מכיוון שכרטיס התעריפים ומשטח הפרמטרים זהים, ההחלפה היא שינוי במחרוזת המודל. העבודה היא באימות שלושת הדברים שכן השתנו.
• מדוד את הזמן שלך עד לטוקן הראשון בהגדרת המאמץ שלך. אל תקבל אף אחד מהנתונים — לא את 2.90s ולא את 26.12s. הרץ את הפרומפטים האמיתיים שלך עם כל reasoning_effort שאתה באמת מעביר והשווה ישירות. זה המספר היחיד שיכול להרוג את ההעברה כליל.
• בדוק את הגדרות ה-timeout והסטרימינג שלך. עלייה של פי 9 בחביון האסימון הראשון במאמץ גבוה תחרוג מגבולות ה-timeout של הלקוח שכוונו מול 1.1, ותגרום לכל אינטגרציה שאינה סטרימינג להיראות כמו תקיעה.
• חשב מחדש את העלות מספירת הטוקנים שנמדדו, לא מהמחירון. המחירים זהים, כך שכל שינוי בעלות הוא התנהגותי. Artificial Analysis ראתה הוצאה גבוהה ב-16% עבור אותה עבודה; האם תראה זאת תלוי בתמהיל המשימות שלך.
• ודא קודם את יציבות מפתח המטמון. עם קידומת יציבה של 60,000 טוקנים, שלב סוכן טיפוסי יורד מכ-8.8 סנט לכ-2.2 סנט בשתי הגרסאות. התנודה של 75% גדולה יותר מכל מה ששינוי הגרסה עושה, והיא לגמרי בשליטתך.
• בדוק מחדש את נתיבי האודיו והווידאו במפורש.שתי הרשימות מפרסמות את אותם חמישה אופני קלט, אך כרטיס המפרט של Artificial Analysis עבור גרסה 1.2 מתעד רק טקסט ותמונה כפי שהוערכו. Meta כתבה מחדש את המסר השיווקי והרחיקה אותו מעבודה במדיה מעורבת. אף גורם בלתי תלוי לא בדק אם היכולת נשמרה.
• השאר את 1.1 נגישה כגיבוי. הרצת שתיהן מאחורי מפתח אחד פירושה שגלגול לאחור הוא שינוי תצורה ולא אירוע, וזה מאפשר לך לבצע A/B בין השתיים על תעבורה חיה במקום להתווכח על בנצ'מרק.
מי זז עכשיו, מי מחכה
עבור עכשיו אם אתה מריץ סוכני קידוד ארוכי טווח במאמץ חשיבה גבוה. המשימות כבר אורכות דקות, כך שקנס ההשהיה נעלם בתוך זה, רווח האינטליגנציה נמדד על ידי צד שלישי ולא נטען על ידי Meta, ושלוש נקודות מדד הן קפיצה משמעותית בדרג הזה — תשעה מקומות בלוח של 185 דגמים.
רגע אם משהו שאתם מגישים הוא אינטראקטיבי. אין תצורה שבה 1.2 מגיב יותר מהר מ-1.1, וחשיבה חובה פירושה שאי אפשר לקנות בחזרה מהירות תגובה על ידי השבתת החשיבה. גרסה 1.1 נותרה המודל המהיר יותר בכל רמת מאמץ ועולה בדיוק אותו דבר.
רגע אם עומס העבודה שלך הוא ניתוח מדיה מעורבת — מקרה השימוש של דוח ארוך, וידאו ואודיו, שעבורו 1.1 נבנה ושווק במפורש. Meta הפסיקה לפרסם את זה, וההערכה הבלתי תלויה היחידה של 1.2 מכסה טקסט ותמונות. ייתכן מאוד שהיכולת עדיין שלמה; פשוט אין שום ראיה לכאן או לכאן, ול-1.1 יש חודש של זה.
רגע אם אתה צריך את נתוני הזירה. מודל שמשווק על בסיס יצירת מאגר קוד שלם, ללא ערכים ב-Design Arena וללא תת-מדד אייג'נטי שפורסם, מבקש ממך לסמוך על דבריה של מטה בנוגע לדבר שהיא שינתה. תן לזה שלושה או ארבעה שבועות וזה לא יהיה נכון עוד — בשלב זה ההחלטה הזו תהיה קלה הרבה יותר לקבל על סמך ראיות ולא על סמך מספר מורכב יחיד.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
