Muse Spark 1.2 ו-Muse Code-1
Guides & Insights

Muse Spark 1.2 ו-Muse Code: המודל השלישי של Meta בארבעה חודשים משיג תיקו עם Grok 4.5

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Meta שחררה את Muse Spark 1.2 ב־5 באוגוסט 2026, ארבעה שבועות לאחר Muse Spark 1.1 וכ־ארבעה חודשים לאחר ה-Muse Spark הראשון. הגרסה הזו הגיעה עם משהו ששתי הגרסאות הקודמות לא הכילו: סוכן קידוד של Meta עצמה, Muse Code, ששוחרר בגרסת בטא ואומן יחד עם המודל שהוא רץ עליו. ובמדד היחיד שגם Meta וגם מתחרותיה לא שולטות בו, ההשקה מעמידה את Meta בשוויון מוחלט עם SpaceXAI — Muse Spark 1.2 ו־Grok 4.5 מקבלים כעת שניהם ציון 54 במדד Artificial Analysis Intelligence Index. חמישה ימים לאחר מכן הגיע הפיתוח הגדול יותר: ב־10 באוגוסט אמרה Meta שתפתח את המשקולות של Muse Spark 1.2 — הודעה שאם תתממש, תהפוך את המודל לחזק ביותר מבין המתחרים האמריקאיים הנוכחיים בעלי המשקולות הפתוחים מול המודלים הסיניים.

שני דברים כדאי להפריד לפני שלמספרים שלהלן יש משמעות כלשהי. ציון מדד האינטליגנציה, נתוני השהיה וספירות הטוקנים מגיעים מ-Artificial Analysis, שמריצה הערכות משלה ומפרסמת את החשבון; אלה בלתי תלויים. תוצאות הקידוד שמטה הובילה איתן את ההכרזה — Terminal-Bench 2.1, DeepSWE v1.1 ובדיקת אמת פנימית — הורצו על ידי מטה, על גבי התשתית של מטה, כשכל מודל מתחרה צוות למוצר הסוכן שלו. שני סוגי המספרים שימושיים. הם אינם אותו סוג של ראיות, ומאמר זה מפריד ביניהם.

מה מטא באמת שחררה

Muse Spark 1.2 and Muse Code-2

ההודעה, שפורסמה בבלוג מחקר הבינה המלאכותית של Meta ותוארכה ל-5 באוגוסט, מכסה שני מוצרים בבת אחת.

Muse Spark 1.2 — עדכון ממוקד קוד למשפחת Muse Spark. Meta אומרת שהגדילה את היקף מחשוב האימון במשימות קידוד והרחיבה את מגוון סביבות האימון, תוך שמירה על יכולת הסוכן הכללי שבזכותה שווקה גרסת 1.1. יעדי האימון המוצהרים הם ארוכי-טווח: יצירת מאגר קוד מלא, פרויקטים גדולים מקצה לקצה, ומה ש-Meta מכנה מחקר אוטומטי, עם תכנון לסידור העבודה, התניית מטרות לשמירת כיוון לאורך שלבים רבים, ודחיסת הקשר כדי לשמור על המצב הרלוונטי חי ככל שהסשן מתארך.

Muse Code — סוכן קוד מבוסס טרמינל בגרסת בטא, המותקן באמצעות סקריפט מעטפת של שורה אחת מהדומיין למפתחים של Meta. הוא מריץ סוכני רקע אסינכרוניים מתמשכים ששורדים לאורך סשן, על רכיב זמן ריצה מקומי של יומן אירועים ש־Meta מתארת כמדויק לשחזור ובטוח להפעלה מחדש, והוא מתאם מספר תת־סוכנים לכל משימה בעצי עבודה מבודדים. הוא מגיע עם שלוש מיומנויות מובנות: /plan לתכנון מבוקר־אישור, /grill לבדיקת עמידות של עבודה שכבר נעשתה, ו־/goal להבאת משימה להשלמה.

הצימוד אינו מקרי. Meta אומרת שהשניים אומנו יחד — המודל כוונן על מסלולים מדגימת דחייה שהופקו מהרתמה, עם אופטימיזציות במתכון האימון למטרות, דחיסה ותת-סוכנים. זהו אותו מהלך אימון משותף שהפיק את Claude Code ואת Codex, ויש לו השלכה לכל מי שקורא נתוני מדדים: ציוני התכנות הבולטים של המודל הופקו בתוך הרתמה שאומן בה. אין זו רמאות — כך עובדת הערכה סוכנית כיום. עם זאת, המשמעות היא שציון 1.2 שהושג באמצעות שלד אחר הוא שאלה פתוחה, ולא הנחה בטוחה.

שאר המפרט ללא שינוי מגרסה 1.1, שהיא עצמה אינפורמטיבית בלבד. חלון ההקשר נשאר על 1,048,576 טוקנים. יכולת החשיבה (Reasoning) נותרה חובה בחמש רמות מאמץ — minimal, low, medium, high, xhigh — כאשר medium היא ברירת המחדל; אין תצורה שבה מקבלים את המשקולות בלי לשלם במידה מסוימת של עיון. בהשקה המשקולות היו סגורות, ללא מאגר Hugging Face, ו-Model API של מטא הוא המקום היחיד של הצד הראשון לקריאה אליו. כעת מתוכנן שינוי: ב-10 באוגוסט הודיעה מטא שתפתח את המשקולות, ובכך תהפוך את מדיניות המשקולות הסגורות ששלטה בשלוש המהדורות הראשונות של Muse Spark.

43, ואז 51, ואז 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis מדרגת את Muse Spark 1.2 בציון 54 במדד האינטליגנציה שלה בהגדרת החשיבה xhigh, וממקמת אותה במקום ה-13 מתוך 185 מודלים, לעומת חציון של 32 בקטגוריה. המדד הוא הרכב משוקלל של תשע הערכות — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ו-AA-LCR — המחולקות באופן שווה בין סוכנים, תכנות, יכולת כללית וחשיבה מדעית.

כאשר קוראים אותה כסדרה ולא כתמונת מצב, המסלול של Meta הוא הסיפור האמיתי. ה-Muse Spark המקורי השיג 43 באפריל. ב-9 ביולי, Muse Spark 1.1 הגיע ל-51, עלייה של שמונה נקודות ברבעון. Muse Spark 1.2 מוסיף שלוש נוספות בתוך פחות מחודש. Meta נעה 11 נקודות מדד בארבעה חודשים, וכעת היא משחררת גרסאות מהר יותר מכפי שמערכת ההערכה יכולה לעמוד בקצב — עדיין אין פירוט מפורסם לפי benchmark עבור 1.2, ואין שום רשומה ב-Design Arena עבורו, בעוד של-1.1 יש את שניהם.

חמישים וארבע ממקמים את Meta באותה רמה עם Grok 4.5, המודל ש-SpaceXAI שחררה יום לפני Muse Spark 1.1, ומאחורי קבוצת חוד החנית הצמודה: Claude Opus 5 עם 61, Claude Fable 5 עם 60, GPT-5.6 Sol עם 59. הפער לפסגה הוא שש או שבע נקודות. הפער מהמקום שבו Meta פתחה את השנה הוא אחת עשרה. האם הוא ייסגר תלוי בשמירה על הקצב, וכרגע Meta נמצאת על מחזור שחרור של ארבעה שבועות.

עם זאת, תיקו במדד מורכב אינו תיקו במשימה, וכדאי לומר מה ה־54 קובע ומה לא. הוא קובע ש־Muse Spark 1.2 שייך לאותה קטגוריה כמו Grok 4.5 מבחינת יכולת כוללת. הוא לא אומר לך מי כותב תיקונים טובים יותר, משום שמדד המשנה לקידוד שהיה אמור לענות על כך טרם פורסם עבור 1.2.

מספרי הקידוד של Meta, קראו בעיון

ההודעה של מטה מובילה בשלושה תרשימים. בריצות שלה, המדווחות כ-pass@1 על פני חמישה ניסיונות, כאשר כל מודל מתחרה משויך למוצר הסוכן שלו:

Terminal-Bench 2.1 — 82.9% עבור Muse Spark 1.2, עלייה מ-76.2% עבור 1.1. Claude Opus 5 מוצג לפני עם 86.7%.

DeepSWE v1.1 — 59.3%, עלייה מ-53.0%.

מדד הקידוד הפנימי של Meta — 70.6%, עלייה מ-68.3%.

ההפרשים הם החלק האמין. עלייה של 6.7 נקודות ב-Terminal-Bench ו-6.3 ב-DeepSWE, שנמדדה באותה דרך על אותה רתמת בדיקות על ידי אותו צוות בהפרש של חודש, היא קריאה סבירה של עד כמה 1.2 השתפר לעומת 1.1 במה ש-Meta ייעלה. המיקום הבין-ספקי הוא החלק שצריך לקחת בערבון מוגבל: צימוד הרתמות הוא משתנה חופשי גדול, ומעבדה שמכווננת את הרתמה שלה לצד המודל שלה אינה מסוגלת לכוון את זו של כולם באותה מידה. Meta הייתה שנייה בשקופית של עצמה, מה שלפחות אינו הצורה הרגילה של בנצ'מרק של ספק, אך אף גורם שלישי לא שחזר אף אחד מהתוצאות נכון לכתיבת שורות אלה.

רשימת המחירים השנייה

הדבר המשמעותי ביותר במהדורה זו אינו נמצא בתרשימי הביצועים. Muse Spark 1.2 מגיע עם שתי רשימות מחירים.

שכבת סטנדרט — $1.25 למיליון טוקי קלט, $0.15 למיליון בפגיעת מטמון, $4.25 למיליון פלט. ללא שינוי מ-1.1, עד לסנט. מגבלת קצב של כ-3,000 בקשות לדקה. ביסוס על חיפוש אינטרנט מחויב בנפרד ב-$2.50 לאלף שאילתות.

דרגת תורם — $0.10 לקלט, $0.002 לקלט במטמון, $0.20 לפלט. כלומר, זה זול פי 12.5 בקלט ופי 21.25 בפלט. מחיר הכניסה הוא מתן רשות למטה לאמן מודלים עתידיים על התעבורה שלך, ומגבלת קצב של 60 בקשות לדקה — 2% מהתקציב הסטנדרטי.

במחירים של 0.10$ ו-0.20$, Muse Spark 1.2 היה מציע מחיר נמוך יותר מכמעט כל דגם קרוב-חזית בשוק, כולל שכבת התקציב עם המשקלים הפתוחים,שהוא מפסיד לה במחיר אחרת. זהו המספר המעניין בהשקה הזו, וזה לא באמת החלטת תמחור. הקצב של שישים בקשות לדקה פוסל מעצמו את רוב תבניות ה-fan-out בייצור, ולכן השכבה מיועדת לניסויים ולעבודה של צוותים קטנים במקום לשרת. ו"אנחנו עשויים לאמן על התעבורה שלך" היא שאלה למי שמאשר את ממשל הנתונים בארגון שלך, לא למי שבוחר מודלים. התייחסו לזה כאל בדיקה משפטית עם הנחה צמודה, לא כאל SKU זול יותר.

כמה עולה לייצר את ה-54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis מפרסמת מה עולות ריצות ההערכה שלה עצמה, ובטור הזה נראית הצורה של Muse Spark 1.2. השלמת חבילת תשעת המדדים עלתה 637.85 דולר וצרכה 95 מיליון טוקני פלט, לעומת 548.07 דולר ו-94 מיליון עבור Muse Spark 1.1 — במחיר זהה לטוקן. ה-16% הנוספים הם חשיבה טהורה.

נתוני ההשהיה נעים באותו כיוון. במדידה ב‑xhigh, זמן הטוקן הראשון הוא 26.12 שניות עבור 1.2 לעומת 2.90 שניות עבור 1.1, ומהירות הפלט יורדת מ‑213.5 ל‑165.0 טוקנים לשנייה. Meta קנתה שלוש נקודות אינדקס עם זמן חשיבה, והעיצוב המחייב‑חשיבה פירושו שאינך יכול לסרב לרכישה — רק לבחור כמה ממנה תבצע.

הנתון של 26 שניות יצוטט שלא כהלכה, אז הנה התיקון מראש: מדובר במדידה ברמת המאמץ היקרה ביותר שהמודל מציע, וברירת המחדל של ה-API היא בינונית. כנקודת ייחוס מתעבורה אמיתית ולא ממסגרת בדיקות benchmark, Muse Spark 1.1 המוגש דרך OrcaRouter — בכל רמת מאמץ שהלקוחות מבקשים בפועל — מציג על פני 7 ימים p50 של 1.84 שניות לזמן עד הטוקן הראשון ו-p95 של 6.00 שניות, עם 519 טוקנים לשנייה ושיעור שגיאות אפס. השהיית ה-benchmark במאמץ מקסימלי והשהיית הייצור במאמץ ברירת המחדל הם גדלים שונים, ובדרך כלל הם נבדלים בסדר גודל. קראו את 26.12 שניות כתקרה לחשיבה עמוקה, לא כתחושה של בקשה בפועל.

איפה אפשר להתקשר אליו היום

Muse Spark 1.2 מסופק דרך ה-Model API של מטא עצמה, וכעת, בשום מקום אחר — עדיין אין מאגר Hugging Face והוא לא בקטלוג OrcaRouter. זה מה שההודעה מ-10 באוגוסט אמורה לשנות: מטא אומרת שהמשקולות ייפתחו 'בשבועות הקרובים', וברגע שזה יקרה, שאלת הזמינות עוברת מ'איפה זה מסופק?' ל'אילו משקולות, תחת איזה רישיון, ובאילו סביבות ריצה'. Muse Spark 1.1 נמצא בקטלוג OrcaRouter, במחיר של $1.25 ו-$4.25 — אותם מספרים שמטא גובה, כי OrcaRouter לוקחת 0% עמלה ומעבירה את מחיר המחירון של הספק ישירות.

זה חשוב יותר להשוואה מאשר למודל עצמו. אם אתם בונים מודל עלויות לגרסה הזו, המודלים שהייתם משווים מולה — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — נגישים כולם דרך מפתח יחיד במחיר המחירון, כך שהנתון בגיליון האלקטרוני שלכם הוא הנתון בחשבונית, והפחתת מחיר של ספק נכנסת לתוקף באותו היום במקום לאחר חידוש חוזה. לגבי Muse Spark 1.2 ספציפית, התשובה כיום היא נקודת הקצה של Meta, חוזה שני וחשבונית נפרדת — וברגע שהמשקלים ישוחררו, התקנה עצמית תהפוך לאפשרות שלישית.

מה השתנה ב-10 באוגוסט

חמישה ימים לאחר ההשקה, עמדתה של מטא כלפי הדגל שלה עצמה התהפכה. בהכרזה מיום 10 באוגוסט, מטא אמרה שתפתח את המשקלים של Muse Spark 1.2 "בשבועות הקרובים", ובכך תהפוך אותו לגרסת Muse Spark הראשונה שצוות יכול להריץ בעצמו. ההצהרה היא ברמת ההנהלה, לא מוצר ששוחרר: עדיין אין מאגר Hugging Face, והתאריך המדויק, מספר הפרמטרים והרישיון – כולם לא מאושרים.

ההימור הוא מירוץ משקלי החזית. Muse Spark 1.2 משיג ציון 54 במדד Artificial Analysis Intelligence Index — מעל לכל דגם אמריקאי בעל משקלים פתוחים שזמין להורדה כיום — כך שאם המשקלים יגיעו כפי שהובטח, הוא יהיה המתחרה האמריקאי החזק ביותר במשקלים פתוחים מול המעבדות הסיניות. זו המסגרת שצוקרברג טען באריכות ב-10 באוגוסט במאמר בן 6,500 מילה, שבו האשים את מגבלות ארצות הברית על נתוני האימון בכך שהן מוסרות את ההובלה במשקלים פתוחים לידי מעבדות זרות. לפנייה זו כבר יש משלוח ראשון: Muse Glimmer, מודל בעל 30 מיליארד פרמטרים ששוחרר באותו היום תחת רישיון Apache 2.0, מזוקק מ-Muse Spark ומיועד לעומסי עבודה סוכניים מקומיים. מדדי ההשוואה של Meta עצמה מציבים אותו לפני Gemma4-31B של גוגל ו-Qwen3.6-27B במשימות סוכניות; המספרים האלה מבוצעים על ידי היצרן וטרם שוחזרו על ידי גורם חיצוני.

מה שההכרזה לא ענתה

אין מספר קידוד עצמאי. Artificial Analysis מפרסמת מדד משולב עבור 1.2, אך עדיין לא את תתי-מדדי הקידוד והאייג'נטיים שפרסמה עבור 1.1 (71.3 ו-37.5 בהתאמה). מכיוון שעבודה אייג'נטית הייתה הממד החלש ביותר של 1.1 בפער גדול, וקידוד אייג'נטי הוא בדיוק מה ש-1.2 טוען שתיקן, זהו המספר שיכריע לגבי השחרור.

אין שכפול של תוצאות מסגרת הבדיקות. כל נתון קידוד בהכרזה הוא ריצה של Meta. איש עוד לא פרסם ציוני Muse Spark 1.2 ממסגרת ניטרלית.

אין אימות רב-מודאלי. הרישום של Muse Spark מפרסם קלט של טקסט, תמונה, וידאו, אודיו ו-PDF. ההערכה העצמאית מכסה טקסט ותמונה. המסרים של Meta בגרסה 1.2 עברו כמעט לחלוטין לעבודה תוכנתית, ומקרה השימוש במדיה מעורבת 1.1, שנמכר במפורש לעת עתה, אין מאחוריו לא שיווק ולא מדידה.

אין היסטוריית תפוקה.נפח הפעילות בנקודת הקצה עדיין נמוך מדי מכדי שסטטיסטיקות השהיה הנעות הרגילות יתמלאו.

מה לצפות בארבעת השבועות הקרובים

ארבעה דברים יכריעו אם השחרור הזה הוא מה שמטה אומרת שהוא. הראשון הוא ציון סוכנותי בלתי-תלוי עבור 1.2 — אם מדד המשנה שהיה 37.5 ב-1.1 זז משמעותית, טענת הקידוד אמיתית. השני הוא אם מישהו משחזר את תוצאת Terminal-Bench מחוץ ל-Muse Code; מודל שמצליח רק בתוך הרתמה שלו הוא מוצר, לא יכולת. השלישי הוא מה יקרה לשכבת התורמים: אם תקרת 60 הבקשות משתחררת, מודל סמוך לחזית במחיר $0.10 פנימה ו-$0.20 החוצה משנה את האריתמטיקה של שכבת התקציב בדרך שעלייה של שלוש נקודות במדד לעולם לא הייתה משנה. הרביעי הוא הבטחת המשקלים: מטה אומרת שהמשקלים של Muse Spark 1.2 ייפתחו "בשבועות הקרובים", והאם המאגר ינחת על לוח הזמנים הזה — תחת איזה רישיון וכמה מהר סביבות ריצה מקומיות יאמצו אותו — יכריע אם המפנה למשקלים פתוחים אמיתי.

ואם הקצב הזה יימשך, Muse Spark 1.3 צפויה לצאת בתחילת ספטמבר. לאור הראיות הללו, המספר שחשוב לעקוב אחריו כשהיא תנחת אינו ציון המדד. השאלה היא אם Meta תוכל להוסיף יכולת בלי להוסיף עוד עשרים שניות של חשיבה לפתיחה של כל בקשה. הפרי הראשון של המפנה הזה כבר בחוץ: Muse Glimmer, מודל פתוח במשקל 30 מיליארד פרמטרים ש-Meta שחררה ב-10 באוגוסט תחת רישיון Apache 2.0, שנבנה להריץ סוכנים מקומית — התצוגה המקדימה הקרובה ביותר עד כה למה ש-Muse Spark 1.2 פתוחה תיראה.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית