Muse Spark 1.2 ו-Muse Code-1
Guides & Insights

Muse Spark 1.2 ו-Muse Code: המודל השלישי של Meta בארבעה חודשים משיג תיקו עם Grok 4.5

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Meta שחררה את Muse Spark 1.2 ב-5 באוגוסט 2026, ארבעה שבועות אחרי Muse Spark 1.1 וכארבעה חודשים אחרי ה-Muse Spark הראשון. הגרסה הזו הגיעה עם משהו שלא היה לשתי הגרסאות הקודמות: סוכן קוד משלה, Muse Code, ששוחרר בגרסת בטא ואומן יחד עם המודל שעליו הוא רץ. ובמדד היחיד שאין ל-Meta ולא ליריבותיה שליטה בו, השחרור הזה מעביר את Meta לשוויון מוחלט עם SpaceXAI — Muse Spark 1.2 ו-Grok 4.5 מקבלים כעת שניהם ציון 54 במדד Artificial Analysis Intelligence Index.

שני דברים כדאי להפריד לפני שלמספרים שלהלן יש משמעות כלשהי. ציון מדד האינטליגנציה, נתוני השהיה וספירות הטוקנים מגיעים מ-Artificial Analysis, שמריצה הערכות משלה ומפרסמת את החשבון; אלה בלתי תלויים. תוצאות הקידוד שמטה הובילה איתן את ההכרזה — Terminal-Bench 2.1, DeepSWE v1.1 ובדיקת אמת פנימית — הורצו על ידי מטה, על גבי התשתית של מטה, כשכל מודל מתחרה צוות למוצר הסוכן שלו. שני סוגי המספרים שימושיים. הם אינם אותו סוג של ראיות, ומאמר זה מפריד ביניהם.

מה מטא באמת שחררה

Muse Spark 1.2 and Muse Code-2

ההודעה, שפורסמה בבלוג מחקר הבינה המלאכותית של Meta ותוארכה ל-5 באוגוסט, מכסה שני מוצרים בבת אחת.

Muse Spark 1.2 — עדכון ממוקד קוד למשפחת Muse Spark. Meta אומרת שהגדילה את היקף מחשוב האימון במשימות קידוד והרחיבה את מגוון סביבות האימון, תוך שמירה על יכולת הסוכן הכללי שבזכותה שווקה גרסת 1.1. יעדי האימון המוצהרים הם ארוכי-טווח: יצירת מאגר קוד מלא, פרויקטים גדולים מקצה לקצה, ומה ש-Meta מכנה מחקר אוטומטי, עם תכנון לסידור העבודה, התניית מטרות לשמירת כיוון לאורך שלבים רבים, ודחיסת הקשר כדי לשמור על המצב הרלוונטי חי ככל שהסשן מתארך.

Muse Code — סוכן קוד מבוסס טרמינל בגרסת בטא, המותקן באמצעות סקריפט מעטפת של שורה אחת מהדומיין למפתחים של Meta. הוא מריץ סוכני רקע אסינכרוניים מתמשכים ששורדים לאורך סשן, על רכיב זמן ריצה מקומי של יומן אירועים ש־Meta מתארת כמדויק לשחזור ובטוח להפעלה מחדש, והוא מתאם מספר תת־סוכנים לכל משימה בעצי עבודה מבודדים. הוא מגיע עם שלוש מיומנויות מובנות: /plan לתכנון מבוקר־אישור, /grill לבדיקת עמידות של עבודה שכבר נעשתה, ו־/goal להבאת משימה להשלמה.

הצימוד אינו מקרי. Meta אומרת שהשניים אומנו יחד — המודל כוונן על מסלולים מדגימת דחייה שהופקו מהרתמה, עם אופטימיזציות במתכון האימון למטרות, דחיסה ותת-סוכנים. זהו אותו מהלך אימון משותף שהפיק את Claude Code ואת Codex, ויש לו השלכה לכל מי שקורא נתוני מדדים: ציוני התכנות הבולטים של המודל הופקו בתוך הרתמה שאומן בה. אין זו רמאות — כך עובדת הערכה סוכנית כיום. עם זאת, המשמעות היא שציון 1.2 שהושג באמצעות שלד אחר הוא שאלה פתוחה, ולא הנחה בטוחה.

שאר המפרט לא השתנה מ-1.1, שהוא עצמו אינפורמטיבי. ההקשר נשאר על 1,048,576 טוקנים. החשיבה נותרת חובה על פני חמש רמות מאמץ — מינימלית, נמוכה, בינונית, גבוהה, גבוהה-מאוד — כשהבינונית היא ברירת המחדל; אין תצורה שבה אתה מקבל את המשקולות בלי לשלם על קצת התלבטות. המשקולות סגורות, ללא מאגר Hugging Face, ו-API המודל של Meta עצמה נותר המקום היחיד מהצד הראשון לקרוא אליו.

43, ואז 51, ואז 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis מדרגת את Muse Spark 1.2 בציון 54 במדד האינטליגנציה שלה בהגדרת החשיבה xhigh, וממקמת אותה במקום ה-13 מתוך 185 מודלים, לעומת חציון של 32 בקטגוריה. המדד הוא הרכב משוקלל של תשע הערכות — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience ו-AA-LCR — המחולקות באופן שווה בין סוכנים, תכנות, יכולת כללית וחשיבה מדעית.

כאשר קוראים אותה כסדרה ולא כתמונת מצב, המסלול של Meta הוא הסיפור האמיתי. ה-Muse Spark המקורי השיג 43 באפריל. ב-9 ביולי, Muse Spark 1.1 הגיע ל-51, עלייה של שמונה נקודות ברבעון. Muse Spark 1.2 מוסיף שלוש נוספות בתוך פחות מחודש. Meta נעה 11 נקודות מדד בארבעה חודשים, וכעת היא משחררת גרסאות מהר יותר מכפי שמערכת ההערכה יכולה לעמוד בקצב — עדיין אין פירוט מפורסם לפי benchmark עבור 1.2, ואין שום רשומה ב-Design Arena עבורו, בעוד של-1.1 יש את שניהם.

חמישים וארבע ממקמים את Meta באותה רמה עם Grok 4.5, המודל ש-SpaceXAI שחררה יום לפני Muse Spark 1.1, ומאחורי קבוצת חוד החנית הצמודה: Claude Opus 5 עם 61, Claude Fable 5 עם 60, GPT-5.6 Sol עם 59. הפער לפסגה הוא שש או שבע נקודות. הפער מהמקום שבו Meta פתחה את השנה הוא אחת עשרה. האם הוא ייסגר תלוי בשמירה על הקצב, וכרגע Meta נמצאת על מחזור שחרור של ארבעה שבועות.

עם זאת, תיקו במדד מורכב אינו תיקו במשימה, וכדאי לומר מה ה־54 קובע ומה לא. הוא קובע ש־Muse Spark 1.2 שייך לאותה קטגוריה כמו Grok 4.5 מבחינת יכולת כוללת. הוא לא אומר לך מי כותב תיקונים טובים יותר, משום שמדד המשנה לקידוד שהיה אמור לענות על כך טרם פורסם עבור 1.2.

מספרי הקידוד של Meta, קראו בעיון

ההודעה של מטה מובילה בשלושה תרשימים. בריצות שלה, המדווחות כ-pass@1 על פני חמישה ניסיונות, כאשר כל מודל מתחרה משויך למוצר הסוכן שלו:

Terminal-Bench 2.1 — 82.9% עבור Muse Spark 1.2, עלייה מ-76.2% עבור 1.1. Claude Opus 5 מוצג לפני עם 86.7%.

DeepSWE v1.1 — 59.3%, עלייה מ-53.0%.

מדד הקידוד הפנימי של Meta — 70.6%, עלייה מ-68.3%.

ההפרשים הם החלק האמין. עלייה של 6.7 נקודות ב-Terminal-Bench ו-6.3 ב-DeepSWE, שנמדדה באותה דרך על אותה רתמת בדיקות על ידי אותו צוות בהפרש של חודש, היא קריאה סבירה של עד כמה 1.2 השתפר לעומת 1.1 במה ש-Meta ייעלה. המיקום הבין-ספקי הוא החלק שצריך לקחת בערבון מוגבל: צימוד הרתמות הוא משתנה חופשי גדול, ומעבדה שמכווננת את הרתמה שלה לצד המודל שלה אינה מסוגלת לכוון את זו של כולם באותה מידה. Meta הייתה שנייה בשקופית של עצמה, מה שלפחות אינו הצורה הרגילה של בנצ'מרק של ספק, אך אף גורם שלישי לא שחזר אף אחד מהתוצאות נכון לכתיבת שורות אלה.

רשימת המחירים השנייה

הדבר המשמעותי ביותר במהדורה זו אינו נמצא בתרשימי הביצועים. Muse Spark 1.2 מגיע עם שתי רשימות מחירים.

שכבת סטנדרט — $1.25 למיליון טוקי קלט, $0.15 למיליון בפגיעת מטמון, $4.25 למיליון פלט. ללא שינוי מ-1.1, עד לסנט. מגבלת קצב של כ-3,000 בקשות לדקה. ביסוס על חיפוש אינטרנט מחויב בנפרד ב-$2.50 לאלף שאילתות.

Contributor tier — $0.10 input, $0.002 cached input, $0.20 output. That is 12.5× cheaper on input and 21.25× cheaper on output. The price of admission is permission for Meta to train future models on your traffic, and a rate cap of 60 requests per minute — 2% of the standard budget.

במחירים של 0.10$ ו-0.20$, Muse Spark 1.2 היה מציע מחיר נמוך יותר מכמעט כל דגם קרוב-חזית בשוק, כולל שכבת התקציב עם המשקלים הפתוחים,שהוא מפסיד לה במחיר אחרת. זהו המספר המעניין בהשקה הזו, וזה לא באמת החלטת תמחור. הקצב של שישים בקשות לדקה פוסל מעצמו את רוב תבניות ה-fan-out בייצור, ולכן השכבה מיועדת לניסויים ולעבודה של צוותים קטנים במקום לשרת. ו"אנחנו עשויים לאמן על התעבורה שלך" היא שאלה למי שמאשר את ממשל הנתונים בארגון שלך, לא למי שבוחר מודלים. התייחסו לזה כאל בדיקה משפטית עם הנחה צמודה, לא כאל SKU זול יותר.

כמה עולה לייצר את ה-54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis מפרסמת מה עולות ריצות ההערכה שלה עצמה, ובטור הזה נראית הצורה של Muse Spark 1.2. השלמת חבילת תשעת המדדים עלתה 637.85 דולר וצרכה 95 מיליון טוקני פלט, לעומת 548.07 דולר ו-94 מיליון עבור Muse Spark 1.1 — במחיר זהה לטוקן. ה-16% הנוספים הם חשיבה טהורה.

נתוני ההשהיה נעים באותו כיוון. במדידה ב‑xhigh, זמן הטוקן הראשון הוא 26.12 שניות עבור 1.2 לעומת 2.90 שניות עבור 1.1, ומהירות הפלט יורדת מ‑213.5 ל‑165.0 טוקנים לשנייה. Meta קנתה שלוש נקודות אינדקס עם זמן חשיבה, והעיצוב המחייב‑חשיבה פירושו שאינך יכול לסרב לרכישה — רק לבחור כמה ממנה תבצע.

הנתון של 26 שניות יצוטט שלא כהלכה, אז הנה התיקון מראש: מדובר במדידה ברמת המאמץ היקרה ביותר שהמודל מציע, וברירת המחדל של ה-API היא בינונית. כנקודת ייחוס מתעבורה אמיתית ולא ממסגרת בדיקות benchmark, Muse Spark 1.1 המוגש דרך OrcaRouter — בכל רמת מאמץ שהלקוחות מבקשים בפועל — מציג על פני 7 ימים p50 של 1.84 שניות לזמן עד הטוקן הראשון ו-p95 של 6.00 שניות, עם 519 טוקנים לשנייה ושיעור שגיאות אפס. השהיית ה-benchmark במאמץ מקסימלי והשהיית הייצור במאמץ ברירת המחדל הם גדלים שונים, ובדרך כלל הם נבדלים בסדר גודל. קראו את 26.12 שניות כתקרה לחשיבה עמוקה, לא כתחושה של בקשה בפועל.

איפה אפשר להתקשר אליו היום

Muse Spark 1.2 מוגש באמצעות Model API של Meta עצמה, ובזמן כתיבת שורות אלה, לא דרך שום מקום אחר — הוא לא היה מנותב ב-OpenRouter בעת ההשקה, אין מאגר Hugging Face עבורו, והוא לא מופיע בקטלוג של OrcaRouter. Muse Spark 1.1 עומד על $1.25 ו-$4.25 — אותם המספרים ש-Meta גובה, מכיוון ש-OrcaRouter לא לוקחת שום עמלה ומעבירה את מחיר הספק כפי שהוא.

זה חשוב יותר להשוואה מאשר למודל עצמו. אם אתה בונה מודל עלויות למהדורה הזו, המודלים שתשווה אליהם — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — יושבים מאחורי מפתח יחיד במחיר מחירון, כך שהנתון בגיליון האלקטרוני שלך הוא הנתון בחשבונית, וקיצוץ מחיר של ספק נכנס לתוקף באותו היום ולא לאחר חידוש. לגבי Muse Spark 1.2 ספציפית, היום התשובה היא נקודת הקצה של Meta, חוזה שני, וחשבונית נפרדת.

מה שההכרזה לא ענתה

אין מספר קידוד עצמאי. Artificial Analysis מפרסמת מדד משולב עבור 1.2, אך עדיין לא את תתי-מדדי הקידוד והאייג'נטיים שפרסמה עבור 1.1 (71.3 ו-37.5 בהתאמה). מכיוון שעבודה אייג'נטית הייתה הממד החלש ביותר של 1.1 בפער גדול, וקידוד אייג'נטי הוא בדיוק מה ש-1.2 טוען שתיקן, זהו המספר שיכריע לגבי השחרור.

אין שכפול של תוצאות מסגרת הבדיקות. כל נתון קידוד בהכרזה הוא ריצה של Meta. איש עוד לא פרסם ציוני Muse Spark 1.2 ממסגרת ניטרלית.

אין אימות רב-מודאלי. הרישום של Muse Spark מפרסם קלט של טקסט, תמונה, וידאו, אודיו ו-PDF. ההערכה העצמאית מכסה טקסט ותמונה. המסרים של Meta בגרסה 1.2 עברו כמעט לחלוטין לעבודה תוכנתית, ומקרה השימוש במדיה מעורבת 1.1, שנמכר במפורש לעת עתה, אין מאחוריו לא שיווק ולא מדידה.

אין היסטוריית תפוקה.נפח הפעילות בנקודת הקצה עדיין נמוך מדי מכדי שסטטיסטיקות השהיה הנעות הרגילות יתמלאו.

מה לצפות בארבעת השבועות הקרובים

שלושה דברים יכריעו אם השחרור הזה הוא מה שמטה טוענת שהוא. הראשון הוא ציון אגנטי בלתי תלוי עבור 1.2 — אם תת-המדד שעמד על 37.5 ב-1.1 זז משמעותית, הטענה בנוגע לקידוד אמיתית. השני הוא האם מישהו ישחזר את תוצאת ה-Terminal-Bench מחוץ ל-Muse Code; מודל שמצליח רק בתוך המסגרת שלו הוא מוצר, לא יכולת. השלישי הוא מה יקרה למדרגת התורמים: אם מכסת 60 הבקשות תוקל, מודל הקרוב לגבול היכולות במחיר 0.10 דולר לקלט ו-0.20 דולר לפלט משנה את החישוב של מדרגת התקציב, באופן שעלייה של שלוש נקודות במדד לעולם לא הייתה עושה.

ואם הקצב יימשך, Muse Spark 1.3 צפוי בתחילת ספטמבר. על סמך ראיות אלו, המספר שחשוב לעקוב אחריו כשהוא יגיע אינו ציון המדד, אלא האם מטא תוכל להוסיף יכולות מבלי להוסיף עוד עשרים שניות של חשיבה לפני כל בקשה.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube