
סקירת Meta Muse Spark 1.1: עדיין המהיר, כבר לא הזול
- metaחדשMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 לכל 1M טוקנים · 705 tok/s
- qwenחדשQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 לכל 1M טוקנים · 57 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3150אינטליגנציה69כתיבת קוד
- qwenחדשQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 201 tok/s
- orcaחדשOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicחדשAnthropic: Claude Opus 52026-07-2461אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2150אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1651אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1557אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0951אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0955אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0959אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0854אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0641אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3053אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
- z-aiZ.ai: GLM 5.22026-06-1651אינטליגנציה69כתיבת קוד60מתמטיקה
במשך ארבעה שבועות, ההצדקה ל־Meta Muse Spark 1.1 הייתה אריתמטית. $1.25 למיליון טוקנים בקלט, $4.25 בפלט, עבור מודל מולטימודאלי מטבעו שהפעיל כלים טוב יותר כמעט מכל דבר אחר במחיר דומה. אז ב־5 באוגוסט 2026, Meta השיקה את Muse Spark 1.2 לצד Muse Code — סוכן הקידוד הטרמינלי הראשון שלה — וצירפה למודל החדש משהו ש־1.1 מעולם לא קיבל: מסלול תורם, במחיר של $0.10 בקלט ו־$0.20 בפלט. זול פי 12 בקלט, זול פי 21 בפלט, בתמורה לכך שתאפשר ל־Meta לאמן על ההנחיות שלך. המחיר של Muse Spark 1.1 לא זז אפילו סנט. אבל מעמדו כן.
זו המסגרת הכנה לסקירת המודל הזה כעת. Muse Spark 1.1 לא הוצא משימוש, לא קיבל תמחור מחדש, והוא עדיין המהיר יותר והמתועד טוב יותר מבין שתי נקודות הביקורת להסקה של Meta — אבל הוא כבר לא הדרך הזולה ביותר לשכור מודל של Meta, והסוכן ש־Meta דוחפת הכי חזק לא רץ עליו. סקירה זו מכסה מה זה 1.1, במה הוא טוב באופן מדיד, מה השינוי שההשקה באוגוסט הביאה, ואת קבוצת המשימות המצומצמת יותר שבה הוא עדיין הבחירה הנכונה. כשמספר מגיע מההערכות של Meta עצמה, המשפט אומר זאת; כשהוא מגיע מ־Artificial Analysis או מתעבורת ייצור, הוא אומר גם את זה.
פסק דין מהיר
• מה זהמודל חשיבה מולטימודלי באופן טבעי (טקסט, תמונה, וידאו, PDF ואודיו כקלט, טקסט כפלט) עם מאמץ חשיבה ניתן להגדרה, שנועד להריץ כלים ולתפעל מחשב. משקלים סגורים, מסופק על ידי Meta.
• מחיר — $1.25 לקלט / $4.25 לפלט למיליון טוקנים, $0.15 בפגיעת מטמון. לא השתנה מאז ההשקה, ועדיין בערך רבע ממחיר הפלט של GPT-5.6 Sol ($5/$30) ושישית מזה של Claude Opus 4.8 ($5/$25).
• אינטליגנציה — 51 במדד ה-Artificial Analysis Intelligence Index, דירוג #22 מתוך 185 בקטגוריה שלו, לעומת חציון קטגורייתי של 32. מדידה עצמאית, לא טענה של Meta.
• עוצמה — שימוש בכלים וחשיבה אג'נטית, בתוספת מהירות אמיתית: 213.5 אסימוני פלט לשנייה, ש-Artificial Analysis מדרג במקום ה-2 מתוך 185.
• חולשה — היגיון טהור וקידוד גולמי הם ברמה בינונית, שליפה מהקשר ארוך אינה בחזית, והוא מילולי: 94M אסימוני פלט כדי להשלים את ה-Intelligence Index לעומת חציון של 65M.
• ההסתייגות החדשה — ציונו של Muse Spark 1.2 גבוה כעת בשלוש נקודות, ובדרגת התורמים שלו הוא עולה רק אחד מעשרים. היתרון הנותר של 1.1 הוא זמן ההשהיה, והוא יתרון משמעותי.
מה Meta שחררה ב-5 באוגוסט — ומה היא עשתה ל-1.1
Muse Code is a terminal coding agent, currently in beta, that installs from a one-line shell script on macOS and Linux (no Windows build) and runs as the muse binary. It takes complete software-engineering tasks across large repositories: planning the change, writing the code, validating the result. Meta's pitch is architectural cohesion — the agent and the model were trained together rather than bolted together — and the feature list is aimed squarely at Claude Code and Codex: background agents that keep working after you close the terminal, event-log resume, parallel sub-agent worktrees, and an OS sandbox with approvals enabled by default. The demo Meta published for it is a GPU kernel optimisation loop running more than 1,000 tool calls over as much as 24 hours on NVIDIA Hopper hardware.
Muse Code מריץ את Muse Spark 1.2, לא 1.1. זוהי ההשלכה המעשית הראשונה עבור כל מי שקורא את הסקירה הזו: אם אתה רוצה את הסוכן של Meta, אתה על הצ'קפוינט החדש.
ההשלכה השנייה היא התמחור, והיא המעניינת יותר. Meta שחררה את 1.2 עם שני מזההי מודל נפרדים במקום אחד:
• רגיל(muse-spark-1.2) — $1.25 קלט, $0.15 קלט שמור במטמון, $4.25 פלט למיליון טוקנים. זהה ל-Muse Spark 1.1. Meta מתחייבת שהנחיות והשלמות בדרג זה לא ישמשו לשיפור מוצריה.
• תורם (muse-spark-1.2-contributor) — קלט $0.10, קלט במטמון $0.002, פלט $0.20. בתמורה, אתה מעניק ל־Meta הרשאה לאמן מודלים עתידיים על ההנחיות וההשלמות שלך.
• Muse Spark 1.1 — לא קיימת שכבת תורמים. הוא נשאר במחיר הסטנדרטי, ומטה לא הכריזה על הפסקת תמיכה.
המסגור של Meta עצמה לגבי שכבת התורם הוא שהיא "זולה פי יותר מעשרה אפילו משכבת התשלום-לפי-שימוש", וזו למעשה הערכה נמוכה: המכפלות האמיתיות הן פי 12.5 בקלט ופי 21.25 בפלט, עם קלט מאוחסן במחיר כמעט אפסי של $0.002. זו כותרת ה"מחיר הנמוך" שנוצרה בהשקה, והיא שייכת ל-1.2 בלבד.

סיפור המחיר, נכתב מחדש
לפני שתבנה מחדש את התקציב סביב $0.20 לאסימוני פלט, קרא את שאר התנאים של שכבת התורם, כי הם מה שהופך אותה לזולה. מגבלות הקצב יורדות מ-3,000 בקשות לדקה מתועדות בשכבה הסטנדרטית ל-60 בשכבת התורם — תקרה שמאפשרת למפתח שמתנסה על מחשב נייד ואוסרת על צי סוכני ייצור. ועסקת הנתונים אינה פורמליות: ההנחיות שלך וההשלמות של המודל שלך הופכות לחומר אימון. לכל מי שמטפל בנתוני לקוחות, קוד קנייני, או כל דבר שתחת חובת סודיות, שכבת התורם אינה גרסה זולה יותר של אותו מוצר; היא מוצר שונה. מטה הכירה בכך באותה השקה בכך שהוסיפה אפשרות של אפס-שמירת-נתונים ללקוחות ארגוניים במסלול בתשלום.
אז ההשוואה הכנה אינה "1.1 ב-4.25 דולר לעומת 1.2 ב-0.20 דולר." היא: בתמחור רגיל, שני הדגמים עולים בדיוק אותו דבר, ו-1.2 הוא זה שמקבל ציון גבוה יותר. הרמה של 0.20 דולר היא הצעה אמיתית ואגרסיבית, אך היא מיועדת ליחידים ולניסויים, והיא זמינה רק בדגם החדש יותר.
מה שבעצם קובע את גובה החשבון בשני המודלים הוא שמירה במטמון, לא התעריף הרשמי. קחו לדוגמה שלב סוכן מייצג: 60,000 טוקנים של הקשר ממאגר או מסמך בכניסה, ו-3,000 טוקנים של תכנון-ותשובה ביציאה. במצב קר, זה $0.075 עבור קלט ועוד $0.013 עבור פלט — בערך 8.8 סנט, או $88 על פני אלף שלבים. שמרו על קידומת הקשר יציבה כך שהיא פוגעת במטמון במחיר של $0.15 למיליון, והקלט קורס ל-$0.009, מה שמעמיד את השלב על בערך 2.2 סנט ואת ריצת אלף השלבים על $22. תנודה של 75%, הנשלטת לחלוטין על ידי האם מסגרת הסוכן שלכם עושה שימוש חוזר בקידומת יציבה או בונה את ההנחיה מחדש בכל תור. אם תבצעו פעולה הנדסית אחת לאחר קריאת הסקירה הזו, הפכו אותה ליציבות מפתח המטמון במקום בחירת מודל.
הערה מבנית אחת לגבי המקום שבו אתה שוכר אותו. {{1}}Muse Spark 1.1 נמצא בקטלוג של OrcaRouter במחיר של $1.25 ו-$4.25 עם קריאת מטמון של $0.15 — אותם מספרים ש-Meta גובה, מכיוון ש-OrcaRouter מפעיל תוספת מחיר של 0% ומעביר את מחיר הרשימה של הספק ישירות, כך ששינוי מחיר של ספק מגיע לכאן ביום שבו הוא מגיע לשם.{{/1}} {{2}}Muse Spark 1.2 עדיין לא בקטלוג ומסופק ישירות על ידי Meta.{{/2}} {{3}}לזה יש חשיבות להשוואה שאתה כנראה עומד להריץ: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 ו-Gemini 3.1 Pro כולם יושבים מאחורי מפתח אחד במחיר רשימה, כך שאתה יכול למדוד אותם מול Muse Spark 1.1 על סט הערכה אחד ללא חוזה שני, והמספר בגיליון האלקטרוני שלך הוא המספר בחשבונית.{{/3}}
מה זה בעצם Muse Spark 1.1
Muse Spark היא סדרת ההיגיון הדגלית של Meta Superintelligence Labs, הקבוצה שמארק צוקרברג הקים תחת אלכסנדר וואנג. היא מסמנת היפוך אסטרטגי: בעוד שמודלי Llama של Meta היו בעלי משקלים פתוחים, משפחת Muse — Spark, יחד עם מחוללי התמונה והווידאו — היא סגורה ומועברת כמוצר וכפי API. Spark 1.0 הגיעה ב-8 באפריל 2026; גרסה 1.1 הגיעה ב-9 ביולי לצד התצוגה המקדימה הציבורית של Meta Model API. השינוי המעשי עבור מפתחים הוא שמטא היא כעת ספקית API מהשורה הראשונה שמתחרה ישירות ב-OpenAI וב-Anthropic, ולא רק מפרסמת משקלים — וההשקה ב-5 באוגוסט של סוכן קידוד היא האישור הברור ביותר לכך עד כה.
גרסה 1.1 הייתה קפיצת מדרגה מהותית, ולא עדכון נקודתי בלבד. ב-Artificial Analysis היא צברה שמונה נקודות במדד האינטליגנציה בשלושה חודשים, מ-43 ל-51. מדד הקידוד שלה עלה ב-12 נקודות ל-71, SciCode השתפר ל-58%, ו-Humanity's Last Exam עלתה ל-45%. Meta מסרה שהשיפורים הגדולים ביותר היו בשימוש בכלים, שימוש במחשב, קידוד והבנה מולטי-מודאלית — עקבי עם מודל שכוונן לפעול, ולא רק לענות.
בנוגע להקשר, הבלבול הקודם התיישב: Artificial Analysis ו-OrcaRouter מציינים שניהם שהחלון הוא 1,048,576 טוקנים, ו-Meta מתארת חלון שהמודל דוחס באופן פעיל. עם זאת, להחזיק מיליון טוקנים אינו אותו דבר כמו לשלוף מתוכם, וציון שליפת ההקשר הארוך של 1.1, שעומד על כ-54.1, אומר שהשליפה רגילה. התייחסו אל החלון כאל קיבולת, לא כאל הבטחה.
מאמץ חשיבה: מיידי, מעמיק, והחוגה שמתחת
במשטח הצרכני של Meta, Muse Spark חושף שני מצבים בעלי שם: Instant answers משיב מיידית ללא חשיבה מורחבת, כמו שיחת צ'אט רגילה; Contemplating מריץ מספר סוכנים במקביל באמצעות טכניקת "דחיסת מחשבה" השאובה מלמידת חיזוקים, ו-Meta ממקמת אותו מול DeepMind Deep Think ו-GPT-5.4 Pro בעבודה מדעית ואנליטית תובענית. דרך ה-API אותה יכולת מופיעה כפרמטר מאמץ חשיבה ניתן להגדרה — Artificial Analysis מפרסמת את הציונים שלו בהגדרת xhigh של המודל, היקרה ביותר שהוא חושף.
תייחסו לחוגה הזו כמנוף עלויות, לא כמחוון איכות. חשיבה של סוכנים מקבילים שורפת הרבה יותר טוקנים מאשר מעבר יחיד, ומספרי ה-benchmark שקראתם הופקו במאמץ מרבי. ברירת המחדל צריכה להיות בקצה הנמוך עבור קריאות שגרתיות, ושמרו מאמץ גבוה למקרים שבהם תשובה ראשונה שגויה עולה ביוקר.
איך הוא קולע: חזק עם כלים, בינוני בלעדיהם
הדרך הבהירה ביותר לקרוא את Muse Spark 1.1 היא עם כלים לעומת ללא כלים. עם כלים, הוא מוביל במבחני הסוכנים: MCP Atlas 88.1 לעומת 82.2 של Claude Opus 4.8, JobBench 54.7 לעומת 48.4, Legal Agent Bench 20.0 לעומת 12.9 של Grok 4.5, ו-Humanity's Last Exam עם כלים 62.1 לעומת 57.9. ללא כלים הוא רגיל — Humanity's Last Exam הפשוט נוחת סביב 45, הרבה מאחורי כ-77 של Gemini 3.1 Pro באותו מבחן.
{{1}}במדד דיוק הביצוע הוא גם מפגר אחרי המובילים: OSWorld-Verified לשימוש במחשב: 80.8 לעומת 83.4 של Opus 4.8, SWE-Bench Pro לקידוד: 61.5 לעומת 69.2, DeepSWE 1.1 לקידוד ארוך-טווח: 53.3 לעומת 67.0 של GPT-5.5, ו-BabyVision להנמקה חזותית: 76.3 לעומת 83.6.{{/1}} {{2}}רבים מהנתונים הללו מדווחים על-ידי הספקים, כמה מהם מההערכות של Meta עצמה, והם רצים על תשתיות שונות — התייחסו אליהם כנתונים כיווניים ובחנו אותם מחדש על המשימות שלכם.{{/2}}

התמונה העצמאית מ-Artificial Analysis היא קומפקטית ושימושית יותר. Intelligence Index 51, דירוג #22 מתוך 185, לעומת חציון כיתה של 32. מהירות 213.5 אסימוני פלט לשנייה, דירוג #2 מתוך 185 — זהו מודל מהיר באמת. דירוג מחיר #31, מחיר פגיעת מטמון $0.15 בהנחה של 88%. מילוליות 94M אסימוני פלט כדי לעבור את המדד לעומת חציון של 65M, וזה המקום שמגיעה ממנו חלק ניכר מהחשבון האמיתי. הסכום הכולל להערכתו על כל הסוויטה: $548.07.
אזהרה אחת שכדאי לקחת בחשבון: Meta מפרסמת קלט של טקסט, תמונה, וידאו, אודיו ו-PDF, אבל כרטיס המפרט הטכני של Artificial Analysis עבור 1.1 מתעד רק טקסט ותמונה כמוערכים. שני הדברים יכולים להיות נכונים — ה-API מקבל יותר ממה שמסגרת ההשוואה בדקה — אבל אף אחד מחוץ ל-Meta לא פרסם תוצאות על עומס עבודה של וידאו או אודיו. אם ניתוח מדיה מעורבת הוא הסיבה שאתה כאן, הקדש זמן לאמת זאת בעצמך.
האם כדאי לעבור ל-1.2? תשובת השהיה
בקידוד, Meta אומרת כן, והמספרים שלה עקביים פנימית: Terminal-Bench 2.1 עולה מ-76.2% ל-82.9%, DeepSWE v1.1 מ-53.0% ל-59.3%, ובנצ'מרק הקידוד הפנימי שלה מ-68.3% ל-70.6%. אלה הערכות שבוצעו על ידי Meta, עם ניקוד pass@1 על פני חמישה ניסיונות במסגרת הבדיקה של Meta עצמה — האזהרה הסטנדרטית חלה, והיא שמודלים מתחרים במסגרת של ספק נוטים להיות מכווננים פחות. באופן עצמאי, Artificial Analysis העבירה את Muse Spark 1.2 ל-54 במדד האינטליגנציה, דרגה #13 מתוך 185, שלוש נקודות מעל 1.1.
מה שמטה קנתה את הנקודות הללו הוא שיקול דעת, והוא ניכר בכל מדידת תזמון. Artificial Analysis מודד את הזמן עד לטוקן הראשון ב־26.12 שניות עבור 1.2 לעומת 2.90 שניות עבור 1.1 — שניהם במאמץ החשיבה הגבוה ביותר של כל מודל. מהירות הפלט ירדה מ־213.5 ל־165 טוקנים בשנייה. המילוליות עלתה מעט, 95M לעומת 94M טוקנים, ועלות הרצת חבילת המבחנים הזהה עלתה מ־$548.07 ל־$637.85 במחיר זהה לטוקן. הנתון האחרון הוא ההצהרה הבהירה ביותר של המחיר: אותו מחירון, 16% יותר טוקנים שנצרכו, ועוד שלוש נקודות מדד.
קרא בעיון את נתון 26 השניות, כי קל לקרוא אותו לא נכון. מדובר במדידת benchmark במאמץ מקסימלי, וה-API כברירת מחדל פועל בהגדרה בינונית. כנקודת ייחוס לתעבורה אמיתית, Muse Spark 1.1 על OrcaRouter — שמשרת כל רמת מאמץ שהמתקשרים מבקשים בפועל — מציג p50 של זמן עד הטוקן הראשון של 1.84 שניות ו-p95 של 6.00 שניות על פני שבוע של תעבורת production, עם שיעור שגיאות אפס. זמן השהיה ב-benchmark במאמץ מקסימלי וזמן השהיה ב-production במאמץ ברירת מחדל הם גדלים שונים, והפער ביניהם בדרך כלל גדול מסדר גודל אחד.
אז ההכרעה מתבהרת בצורה נקייה לפי צורת עומס העבודה. אם אתה מריץ סוכני קידוד לטווח ארוך שמחזיקים מאגר קוד בהקשר ועובדים במשך דקות בכל פעם, 1.2 הוא המודל הטוב יותר, וקנס ההשהיה מתקזז על פני משימה שממילא לא הייתה אמורה להרגיש מיידית. אם אתה משרת משהו אינטראקטיבי — ממשק צ'אט, לולאת קריאה לכלים עם בן אדם שממתין, SLO השהיה שנמדד בשניות — Muse Spark 1.1 נשאר המודל בעל הצורה הטובה יותר במשפחה, ודירוג המהירות שלו אינו שגיאת עיגול. שום דבר בהשקה של אוגוסט לא משנה את זה.
חוויית מפתח ומגבלות
ה-Meta Model API נשאר בתצוגה מקדימה ציבורית, אף שההשקה באוגוסט הרחיבה את הגישה הגלובלית והוסיפה את אפשרות אי-שמירת הנתונים (zero-data-retention) הארגונית. Meta מספקת ממשק בסגנון OpenAI וגישת SDK, ו-Spark זמין לצרכנים במצב "Thinking" של Meta AI. מגבלות הקצב מפורסמות כעת במקום משוערות — 3,000 בקשות לדקה מתועדות לדרגה הסטנדרטית — אבל סטטוס תצוגה מקדימה הוא עדיין סטטוס תצוגה מקדימה, לכן שמרו נתיב גיבוי לימים שבהם הקיבולת מוגבלת. מעבר אוטומטי בין ספקים הוא בדיוק סוג התשתית שנקודת קצה ברמת תצוגה מקדימה מצדיקה, וזו הסיבה שניתוב מודל בתצוגה מקדימה דרך שער גישה לא עולה לכם כלום ומשיג לכם מסלול שני.

באמצעות OrcaRouter, מזהה המודל הוא meta/muse-spark-1.1, וגם /v1/chat/completions וגם /v1/responses זמינים, כך שלקוח OpenAI קיים צריך רק כתובת בסיס (base URL) ומחרוזת מודל (model string), וזהו:
from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "תכנן והרץ את הכלים כדי לתקן את הבעיה."}])
print(response.choices[0].message.content)
היכן שזה מתאים — והיכן שלא
התאמה טובה: אוטומציה של הפעלת כלים ושימוש במחשב, כאשר זמן התגובה נראה לעין המשתמש; חשיבה רגישה לעלות בקנה מידה גדול על נתונים שאי אפשר להעביר לסט אימון; זרימות עבודה המשלבות טקסט עם תמונות, וידאו, PDF או אודיו, עם אימות משלך בנתיב המדיה; וצוותים שרוצים ברירת מחדל מהירה וזולה, עם מודל פרימיום שמור לשלבים הקשים ביותר.
התאמה חלשה: דיוק קידוד בראש טבלת המובילים והנדסת גרינפילד הקשה ביותר, שעדיין שייכים ל-Claude Opus 4.8 ול-GPT-5.6 Sol; בעיות היגיון טהורות ללא כלים; משימות הדורשות דיוק חזותי, שבהן Gemini 3.1 Pro מוביל; עבודת מאגר קוד ארוכת טווח, שהיא כעת באופן מפורש התפקיד של 1.2 ו-Muse Code; וכל מה שצריך עבורו את הטוקן הזול ביותר של Meta, כי הדרגה הזו לא קיימת בדגם הזה.
שאלות נפוצות
האם Muse Spark 1.1 עדיין זמין עכשיו ש-1.2 כבר יצא?
כן. מטה לא הכריזה על התיישנות ולא על שינוי מחירים בהשקה של 5 באוגוסט — 1.1 נשארת ב-API של Meta Model ב-$1.25 ו-$4.25 למיליון טוקנים, והיא בקטלוג OrcaRouter באותם מספרים. הסיקור של ההשקה מתאר אותה בעקביות כמי שממשיכה במחירי ה-API הקיימים. עם זאת, תשומת הלב ההנדסית של מטה עברה באופן ניכר: סוכן הקידוד, המדדים החדשים והדרג הזול — כולם קשורים ל-1.2.
האם אני יכול לקבל את Muse Spark 1.1 בדרגת התורם של $0.10?
לא. דרגת התורם היא מזהה מודל נפרד בנקודת הבידוק החדשה יותר, muse-spark-1.2-contributor. אין מקבילה ל-1.1, ולכן אסימוני ההיגיון הזולים ביותר של Meta דורשים מעבר בין גרסאות — וקבלת מגבלה של 60 בקשות לדקה, וכן הרשאה ל-Meta לאמן על ההנחיות וההשלמות שלך.
האם כדאי לי לשדרג ל-Muse Spark 1.2?
אם עומס העבודה שלך הוא קידוד ארוך-טווח או עבודת סוכן בקנה מידה של מאגר, כן: הוא מקבל ציון גבוה יותר גם בהערכות הקידוד של Meta עצמה וגם במדד העצמאי של Artificial Analysis, באותו מחיר סטנדרטי. אם עומס העבודה שלך אינטראקטיבי או רגיש לשהייה, לא: 1.2 נותן בערך פי תשעה מהזמן עד לטוקן הראשון ו-23% ממהירות הפלט, תמורת שלוש נקודות מדד, ואי אפשר לכבות את החשיבה שלו. שניהם יושבים על אותו API, כך שהמעבר הוא מחרוזת מודל בכל מקרה — וזה מבחן ה-A/B הזול ביותר האפשרי, וכדאי להריץ אותו על התעבורה שלך לפני שמחליטים.
האם Muse Spark 1.1 הוא קוד פתוח?
לא, וזו הנקודה של הקו. בניגוד למודלי Llama של Meta, משפחת Muse היא בעלת משקלים סגורים ומוצעת כמוצר וכפי API. אין משקלים ב-Hugging Face, אין מסלול לאירוח עצמי, ואין ספקי צד שלישי — Meta היא הגורם היחיד שמשרת את המודל הזה, מה שהופך שכבת ניתוב עם failover לתשובה המעשית לסיכון של ספק יחיד, במקום ספק שני.
פסק הדין, גרסה אחת אחר כך
Muse Spark 1.1 הוא מודל סוכן מהיר, זול, ורב-מודאלי באמת, שחזק בשימוש בכלים, ולמען האמת בינוני בקידוד ובהסקה טהורים. שום דבר שנמדד בו לא החמיר באוגוסט. מה שהשתנה הוא צורת המשפחה סביבו: ל-Meta יש עכשיו מודל עם ציון גבוה יותר באותו מחיר סטנדרטי, שכבה זולה בהרבה למפתחים שמוכנים לסחור בנתונים שלהם, ומוצר סוכן שאינו רץ על 1.1, ולא על שום דבר שניתן להצביע עליו כעל 1.1.
מה שנותר הוא המלצה מצומצמת יותר אך אמיתית. אם אתה זקוק לאיכות החשיבה של Meta במהירות שמורגשת לאדם — שנייה עד הטוקן הראשון בייצור, ו-213 טוקנים בשנייה לאחר מכן — 1.1 היא עדיין הגרסה שצריך לבחור, ושלוש נקודות המדד ש-1.2 מוסיפה אינן שוות המתנה של פי תשע. אם אינך זקוק למהירות הזו, אין עוד סיבה של ממש להישאר. כך או כך מדובר במחרוזת מודל אחת, ולכן העצה הכנה היא להריץ את שתי הגרסאות על ערכת ההערכה שלך במשך יום ולתת לתקציב ההשהיה שלך להכריע.
השוואות במאמר הזה4
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
