
Muse Glimmer: דגם הסוכן הפתוח בגודל 30B של Meta טוען שעולה על Gemma4-31B ו-Qwen3.6-27B
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 לכל 1M טוקנים · 23 tok/s
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1348 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 283 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
פוסט אחד ב-X בבוקר 10 באוגוסט 2026 אמר זאת בצורה בוטה יותר מכל הודעה לעיתונות: "Holy meta is back." ההודעה שהפוסט הגיב עליה — Muse Glimmer, הדגם הראשון של Meta במשקלים פתוחים מאז Llama 4 — פורסמה באותו יום, וההודעה הרשמית של Meta היא כמעט אגרסיבית כמו הציוץ. טבלת ההשוואה של הדגם בעל 30 מיליארד הפרמטרים טוענת שהוא מנצח את Gemma4-31B של Google ב-19 מתוך 24 שורות ואת Qwen3.6-27B של עליבאבא ב-14 מתוך 24, כשבכותרת הראשית במדד הסוכן MCP-Atlas, Meta מדווחת על 75.5 לעומת 54.2 ו-62.5 בהתאמה.
לפני ש-"smoked" מתקבעת בראשך כעובדה, שים לב מי הפיק את המספרים האלה. כל ציון בטבלה של Meta הופק על ידי Meta, כנגד מודלים מתחרים ש-Meta עצמה הודתה שלא כווננה את התצורות שלהם. ל-Muse Glimmer אין עדיין רישום ב-Artificial Analysis, לוח הדירוג העצמאי שאכן עוקב אחרי מחלקת הגודל המדויקת הזו — שבו Qwen3.6-27B מחזיק כיום במדד אינטליגנציה של 46 ו-Gemma4-31B עומד על 39. מדובר אפוא בשני סיפורים בבת אחת: שחרור במשקל פתוח משמעותי באמת מ-Meta, וטענת בנצ'מרק שתידרש שבועות כדי לאמת. כתבה זו מפרידה ביניהם.
מהו Muse Glimmer באמת
Muse Glimmer הוא מודל צפוף (dense) רב-מודאלי בגודל 30B — קלט טקסט ותמונה באמצעות מקודד תפיסה ייעודי — שאומן על יותר מ-100 שפות ושוחרר תחת רישיון Apache 2.0 המתירני. משקלי המודל נמצאים ב-Hugging Face תחת meta-models/Muse-Glimmer-30B. זוהי גרסה מזוקקת (distilled) של דגל הדגל הקנייני הגדול יותר של Meta, Muse Spark 1.2, ומתכון האימון מראה זאת: זיקוק לוגיטים (logit distillation) מהמורה בשלב ה-pre-training, אימון ביניים על נתונים עם הקשר ארוך יותר ועתירי סוכן (agent-heavy), ולאחר מכן כיוונון עדין מפוקח (supervised fine-tuning) המשולב עם זיקוק on-policy ולמידת חיזוק (reinforcement learning).
מפרט המוצר מדויק כמו הטכנולוגיה עצמה. Meta בנתה את Glimmer עבור "זרימות עבודה מקומיות של סוכן שפעיל תמיד" — סוכן שחי על המכשיר שלך ויכול לקרוא לכלים, לעקוב אחר תוכניות רב-שלביות, להתאושש כשקריאת כלי נכשלת במקום לעצור, ולכוונן את עוצמת החשיבה למעלה או למטה. התפקידים המיועדים הם הלא-זוהרים: קידוד מקומי, קריאות פונקציות, ניהול לוח זמנים, ארגון קבצים, והערכה מסוג LLM-כשופט. הוא תואם לפריימוורקים של תיאום סוכנים כמו OpenClaw, שזו הדרך שבה הרבה אנשים בפועל יריצו אותו.
סיפור החומרה הוא החצי השני של ההצעה. ברמת דיוק מלאה, מודל 30B זקוק ליותר מ-55GB של זיכרון; הקוונטיזציה של Meta ב-~4-bit מצמצמת את זה לכ-17–20GB, שמתאים לכרטיס צרכני של 24GB או 32GB (RTX 5090 הוא ההתייחסות) ולמחשבי Mac מתקדמים עם זיכרון מאוחד. מנסח פענוח ספקולטיבי — מודל נלווה קטן ש-Meta מכנה DFlash — מאיץ את היצירה: Meta מדווחת על כ-3.1x ב-RTX 5090 (מ-74.9 ל-233 טוקנים בשנייה ב-llama.cpp), פי 1.8 ב-M5 Max, ופי 1.5 ב-M4 Max, שם הזיכרון המאוחד כבר פחות מוגבל ברוחב פס.
למה השחרור הזה חשוב מעבר לגיליון המפרט
הצייץ קלט את הצורה נכון. מאז Llama 4 באביב 2025, Meta השתתקה בנושא משקלים פתוחים, ונסוגה לקו מודלים קנייני מתקדם תחת Meta Superintelligence Labs ו-Chief AI Officer אלכסנדר וואנג. Muse Glimmer הוא החזרה הפומבית לאסטרטגיית המשקלים הפתוחים שהפכה את Llama למשפחת המודלים המוכרת ביותר בבינה מלאכותית — והוא הגיע עטוף באות הכוונה החזק ביותר עד כה: צוקרברג פרסם חיבור בן 14 עמודים, "העתיד שייך לכולם", לצד ההשקה, בטענה שהסיכון האמיתי בבינה מלאכותית הוא שליטה מרוכזת, ושמשקלים פתוחים הם הדרך שבה אמריקה נשארת תחרותית מול מעבדות המודלים הפתוחים של סין. הוא קרא להקל ברגולציה האמריקאית על בינה מלאכותית בקוד פתוח, ו-Meta הכריזה על קרן של מיליארד דולר בשם "Future is for Everyone Fund". Meta גם אמרה שהיא מתכננת לשחרר את המשקלים של Muse Spark 1.2, הגדול בהרבה, "בשבועות הקרובים".
ההקשר הזה משנה כיצד כדאי לקרוא את טבלת אמות המידה.这不是 מחקר-מעבדה שמשוחרר בשקט; זו הצהרת אסטרטגיה עם מודל צמוד. Glimmer הוא התפקיד של "סוכן מקומי זול" במערך של Meta, ומערער בכוונה את הטענה שעבודה רצינית של סוכנים דורשת ממשק API בענן. האם הוא אכן מספק זאת — זו בדיוק השאלה שבה עוסקת בדיקת האימות.

הטענה "מעושן", שורה אחר שורה
הטבלה של מטא משווה את Muse Glimmer מול Gemma4-31B ו-Qwen3.6-27B על פני 24 שורות מדד. היכן שהיא טוענת לניצחונות הגדולים ביותר, הדפוס עקבי: חשיבה סוכנותית כללית וחיפוש.
• MCP-Atlas (שימוש בכלים אגנטיים) — Muse Glimmer 75.5, Gemma4-31B 54.2, Qwen3.6-27B 62.5. זוהי שורת הכותרת והפער הגדול ביותר בסט.
• DeepSearch QA — 74.6 לעומת 61.7 ו-71.1.
• GAIA2 (עוזר כללי) — 43.3 לעומת 36.4 ו-40.0.
• WildClawBench (agentic suite) — 47.6 לעומת 37.6 ו-43.2.
• SWE-Bench Pro — 51.2 לעומת 36.9 ו-50.2. שימו לב למספר השלישי: 50.2 הוא המדידה של Meta עצמה ל-Qwen3.6-27B, בעוד שהנתון שפרסמה Alibaba עצמה הוא 53.5. אותו דגם, שני ציונים שונים, תלוי מי ביצע את המדידה.
• AIME 2026 — 94.7, IFBench 77.0, ו-AA-LCR 80.0 לעומת 68.3 של Gemma.
זו שורה חזקה. אבל הטבלה אינה ניצחון מוחלט, והשורות שבהן Muse Glimmer מפסידה אינפורמטיביות לא פחות מאלה שבהן היא מנצחת. Qwen3.6-27B מחזיק במעמד בתחום השימוש המעשי במחשב ועבודה כבדה בטרמינל: SWE-Bench Verified 77.2 לעומת 76.0 של Glimmer, OSWorld-Verified 75.6 לעומת 65.9, ו-TerminalBench 2.1 60.7 לעומת 51.7, ובנוסף יתרון עקבי במבחנים מולטי-מודאליים כמו ScreenSpot Pro, OmniDocBench ו-MMMU-Pro. Gemma4-31B, מצדו, מציג רקורד בטיחות טוב יותר בשני המדדים ש-Meta מדווחת — שיעור ההפרות הנמוך ביותר ב-CI Memories ושיעור ההתקפות המוצלחות הנמוך ביותר ב-Siren AgentDojo — וגובר במבחני ההיגיון הצרים (GPQA Diamond, Humanity's Last Exam).
אם קוראים את זה כפשוטו, הטענה של מטה היא ש"מנצחת את השתיים האחרות ברוב מדדי הסוכנות", ובטבלה שלה עצמה זה בערך נכון. ההסתייגויות הן הנקודה. מטה הרצה בעצמה כל שורה והודתה שתצורות הבדיקה עבור המודלים המתחרים לא כוונונו כמו זו של המודל שלה. זו אינה האשמת הונאה — תצורות מתחרים שאינן מכווננות הן חטא שגרתי, אפילו צפוי, בענף הזה — אבל זו בדיוק הסיבה שטבלאות שמופעלות על ידי ספקים זוכות לאישור בלתי תלוי. הפער של Qwen SWE-Bench Pro שהוצג לעיל הוא כל הבעיה במיניאטורה.
מה אומר לוח התוצאות העצמאי
Artificial Analysis עדיין לא מציגה את Muse Glimmer — המודל בן ימים ספורים בלבד, והמדד של AA מבוסס על הרצות משלה, שלוקחות זמן. אבל AA כן עוקבת אחרי שתי המתחרות, וזה נותן לך את השדה הנמדד שהחדשה טוענת שהיא נכנסת אליו. נכון למדד הנוכחי, Qwen3.6-27B נושאת מדד אינטליגנציה של 46, ש-AA מתארת כמודל בעל המשקולות הפתוחים האינטליגנטי ביותר מתחת ל-150 מיליארד פרמטרים; Gemma4-31B עומדת על 39. אלה מספרים בלתי תלויים, לא טענות של ספקים.
התמונה העצמאית חושפת גם קמט עלויות שהמספרים הבולטים מסתירים. נתוני היעילות של AA מראים ש-Qwen3.6-27B מייצר כ-54.6 אסימונים לשנייה לעומת 34.8 של Gemma4-31B, כשזמן ההמתנה לאסימון הראשון של Gemma מהיר יותר — אך Qwen משתמשת בפי 3.7 יותר אסימוני פלט כדי להריץ את המדד המלא, מה שהופך אותה ליקרה פי 21 בערך להערכה מקצה לקצה. מודלים רעבי אסימונים יקרים יותר בעולם האמיתי גם כשציוני הבנצ'מרק שלהם טובים יותר, וזהו נתון החלטה שאף טבלת ספקים לא תציע מרצונה.
אז התמונה הכנה של העולם, נכון לכתיבת שורות אלה, היא: תוצאה חזקה המדווחת על ידי הספק, אין עדיין שום תוצאה בלתי-תלויה עבור Muse Glimmer, ושדה מתחרים שנמדד באופן בלתי-תלוי ומחולק לפי משימה. הטענה "עישן את Gemma ואת Qwen" היא טענה לגיטימית; עדיין לא מדובר בתוצאה מאומתת. סמני האימות שכדאי לעקוב אחריהם הם ערך במדד AA, Elo של LMArena ושחזורים קהילתיים — וכל אלה בדרך כלל נוחתים תוך שבועות משחרור שכזה.

כמה זה באמת עולה להפעיל
Muse Glimmer הוא חינמי — Apache 2.0, ללא דמי טוקן, ללא תשלום למטא. העלות היא החומרה שמתחתיו. מודל 30B ב-4-bit דורש כ-17–20GB של זיכרון פעיל, בתוספת מקום ל-KV cache, למקודד התפיסה ול-DFlash drafter, ולכן ההנחיה של מטא עצמה היא כרטיס של 24GB או 32GB או Mac מתקדם. אם החומרה הזו ברשותך, העלות השולית של הפעלת סוכן מקומי פעיל תמידית היא למעשה חשמל. אם לא, GPU של 24GB או Mac מסדרת M במפרט מירבי הוא סעיף עלות ממשי — ומאז 9 באוגוסט יש אפשרות שלישית: לשכור אותו. הרישומים הראשונים של API מתארח, הפעילים מאותו תאריך, מתמחרים את Muse Glimmer ב-$0.35 למיליון טוקני קלט ו-$1.50 למיליון טוקני פלט בחלון הקשר של 131K. זהו תעריף שוק שפורסם על ידי ספק, ולא מחיר של מטא, אבל זה המספר שאפשר בפועל לשלם היום אם אתה מעדיף לא לקנות חומרה.
זו ההשוואה שכדאי לעשות בקפידה, כי "משקלים פתוחים, מחיר אפס" פוגש "API מתארח, מחיר לפי טוקן" בתנאים שונים מאוד. כשמריצים את המספרים, מתמחרים את שני הצדדים ביושר. בצד שלנו ב-OrcaRouter, המחיר שרואים עבור כל אחד מ-200+ המודלים המתארחים הוא מחיר המחירון של הספק שמועבר ב-0% תוספת, כך שהנחת מחיר של ספק נכנסת לתוקף כאן באותו היום ולא אחרי חישוב מחדש של מרווחים — מה שהופך את ההשוואה בין מקומי למתארח לפשוטה וישירה. Muse Glimmer עצמו עדיין אינו אחד מ-200+ המודלים האלה, ולכן העברת המחיר הזו לא חלה עליו היום. אבל המשמעת היא הנקודה: הדרך לתמחר מודל פתוח-משקלים שלא הוכח היא התנועה שלך, לא טבלת הספק, ו-DSL הניתוב קיים כדי להריץ בדיוק את ההשוואה הזו ברגע שמודל זמין דרך API שאפשר לקרוא לו.
איך בעצם היית משתמש בזה השבוע
מכיוון שהוא מופץ עם משקלים פתוחים, "גישה" אינה הרשמה — היא הורדה. המאגר הבסיסי הוא meta-models/Muse-Glimmer-30B ב-Hugging Face, עם גרסת GGUF שכבר פורסמה וגרסאות קוונטיזציה שמגיעות מצדדים שלישיים. תמיכת ריצה ביום הראשון כללה את llama.cpp, MLX ו-ExecuTorch, כשהאינטגרציות עם Ollama, LM Studio, vLLM ו-SGLang נחתו בימים שלאחר ההשקה, ועבודות אופטימיזציית חומרה רשומות עבור AMD, Arm, Dell, Intel ו-Nvidia. הנתיב המעשי עבור רוב האנשים הוא: להוריד את ה-GGUF, לטעון אותו ב-llama.cpp או ברץ מקומי, ולכוון אליו שלד של סוכן. Meta לא מארחת API ציבורי ל-Glimmer עצמו, והנתיב המקומי הוא זה שהמודל נבנה סביבו — אבל הנתיב המאוחסן אינו עוד היפותטי: פלטפורמות צד שלישי החלו לשרת אותו ב-9 באוגוסט, כך ש"הורד והרץ" ו"קריאה ל-API" הם שניהם אפשרויות פעילות כעת.
הערה כנה אחת לגבינו ספציפית: Muse Glimmer עדיין לא זמין דרך OrcaRouter. אנו מנתבים API מתארחים, ונכון לעדכון זה המודל עדיין לא נחת בקטלוג שלנו — עסקת 0% הריווח ומפתח אחד להכל חלה על 200+ המודלים שאנו אכן מנתבים, וזה עדיין לא אחד מהם. כשהוא יהיה זמין, אותו מפתח שמגיע לשאר הקטלוג יגיע אליו ללא חוזה חדש, ומעבר אוטומטי (failover) הוא המנגנון שהופך את זה לבטוח להפנות תעבורה אמיתית למודל חדש לגמרי שדווח על ידי ספק, לפני שיש לו רקורד עצמאי. זו אותה סיבה שה-DSL לניתוב קיים: מודל שלא הוכח צריך להרוויח נתיב ייצור על הנתונים שלך, לא על ההודעה לעיתונות של עצמו.
צילום המסך שלהלן הוא הכרטיס של Hugging Face כפי שנקרא ביום ההשקה — השורה "לא נפרס על ידי אף ספק inference" המופיעה בו מתייחסת לשירות ה-inference של Hugging Face עצמה, שהוא דבר נפרד מרשימות ה-API המתארחות של צד שלישי שעלו לאוויר ב-9 באוגוסט.

מה לצפות
שלושה דברים יכריעו את הסיפור הזה, בערך לפי סדר המהירות. ראשית, שחרור המשקלים הפתוחים המובטח של Muse Spark 1.2 — אם ה"מורה" ישוגר "בשבועות הקרובים," גלימר מפסיק להיות חד-פעמי והופך לקצה הדק של מערך משקלים פתוחים מלא, שזו הקריאה האסטרטגית האמיתית של "מטה חזרה." שנית, מדידה בלתי תלויה: ערך במדד Artificial Analysis, מיקום ב-LMArena, ושחזורים קהילתיים יגידו לכם אם הטענה של 19-מתוך-24 שורדת מגע עם מישהו שאינו מטה. שלישית, גל האירוח — זה כבר התחיל. ספקים החלו לשרת את גלימר ב-9 באוגוסט, אז שאלת המקומי-מול-מתארח היא עכשיו בחירה אמיתית שאפשר לבצע עם מפתח API אחד; מה שנותר לראות הוא כמה רחבה תתפשט זמינות האירוח ומה יעשה המחיר לטוקן ברגע שהחידוש של שבוע ההשקה ימוג.
הציוץ צדק לגבי החדשות. בין אם הוא צדק לגבי פסק הדין – זו שאלה של שבועות, והעמדה הכנה כרגע היא שאיש מחוץ ל-Meta לא הריץ מספיק כדי לדעת. מה שכבר נכון הוא שמודל סוכן בגודל 30B ברישיון Apache-2.0 שמתאים ל-GPU לצרכן ונתמך בדחיפת אסטרטגיה מלאה הוא שחרור שצריך לתכנן סביבו, מה שלא יהיו הציונים העצמאיים שלו.
שאלות שבאמת שווה לענות עליהן
האם Muse Glimmer הוא באמת קוד פתוח?
זה משקלים פתוחים תחת רישיון Apache 2.0 המתירני — כל אחד יכול להוריד, לשנות, לכוונן ולפרוס אותו לשימוש מסחרי ללא תשלום ל-Meta. הניסוח הזהיר הוא "משקלים פתוחים" ולא קוד פתוח מלא במובן של OSI, מכיוון שנתוני האימון, המשקלים של המודל המורה Muse Spark, וחלק מהכלים אינם כלולים. למטרות מעשיות — אפשר להריץ אותו, לשלוח אותו, ולמכור מוצר המבוסס עליו — מדובר באותה עסקה שהפכה את Llama למשפחה הפתוחה הפרוסה ביותר ב-AI.
האם Muse Glimmer באמת מנצח את Gemma4-31B ואת Qwen3.6-27B?
בטבלה של מטא עצמה, כן, ברוב מדדי הביצועים הסוכניים והחיפוש, עם הסתייגות ש{{1}}מטא ערכה את ההשוואה בעצמה ולא כיוונה את ההגדרות של המתחרים{{/1}}. התמונה הכנה מדויקת יותר: מטא זוכה ב{{2}}שורות ההיגיון הסוכני{{/2}}, Qwen3.6-27B זוכה ב{{3}}שימוש מעשי במחשב ובעבודה בטרמינל, ובנוסף ברוב בדיקות המולטי-מודאליות{{/3}}, ו-Gemma4-31B מציגה {{4}}רקורד בטיחות טוב יותר{{/4}}. נכון ליום ההשקה {{5}}אין כלל רישום אינדקס בלתי-תלוי עבור Muse Glimmer{{/5}}, ולכן {{6}}יש להתייחס לטענת 19-מתוך-24 כדיווח יצרן עד שמישהו אחר יריץ אותה{{/6}}.
האם אפשר להריץ את זה על מחשב נייד?
רק אם "מחשב נייד" פירושו כזה עם GPU בדיד של 24GB או 32GB, או Mac מסדרת M גבוהה עם מספיק זיכרון אחיד — Muse Glimmer ברמת 4-bit דורשת בערך 17–20GB בתוספת מרווח ל-KV cache, מקודד התפיסה (perception encoder) ו-DFlash drafter. זו קנייה אמיתית עבור רוב האנשים, וזה העלות הנסתרת בתוך מודל "חינמי". על גרפיקה משולבת או מחשב עם 16GB, תסתכלו על קוונטיזציה כבדה ופלט איטי במקום הסוכן שתמיד פועל שהשחרור הזה בנוי סביבו.
מאיפה אני משיג את זה — האם זה דרך API?
המשקלים נמצאים ב-Hugging Face בכתובת meta-models/Muse-Glimmer-30B (עם גרסת GGUF), ואתה מריץ אותו מקומית דרך llama.cpp, MLX, ExecuTorch, או הרצים המקומיים שמשתלבים עכשיו. גישת API מתארחת פעילה גם היא, החל מ-9 באוגוסט, דרך פלטפורמות צד שלישי במחיר רשום של $0.35 למיליון טוקי קלט ו-$1.50 למיליון טוקי פלט — כך שאינך צריך עוד להיות בעל GPU של 24GB כדי לקרוא לו. מטה עצמה עדיין לא מארחת API ציבורי ל-Glimmer, והוא גם לא ב-OrcaRouter עדיין. כשהוא יגיע לקטלוג שלנו, אותו מפתח שמגיע לשאר הקטלוג יגיע גם אליו; עד אז, שתי הדרכים הכנות הן אינפרנס מקומי או פלטפורמה מתארחת של צד שלישי.
