
מוז גלימר מגיע ל-230 אסימונים/שנייה על RTX 5090 יחיד: תמיכת Day-0 של SGLang היא סיפור ההשקה האמיתי
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
{{1}}מאתיים ושלושים טוקנים בשנייה הוא מספר מהיר לכל מודל.{{/1}} עבור Muse Glimmer — {{2}}הגרסה הצפופה (dense) בעלת 30B פרמטרים במשקלים פתוחים של Meta, מבית Meta Superintelligence Labs, ששוחררה ב-10 באוגוסט 2026 תחת רישיון Apache 2.0{{/2}} — זהו המספר שמפריד בין מודל ש{{3}}"רץ על ה-GPU שלי"{{/3}} לבין מודל ש{{4}}"משרת סוכן אמיתי"{{/4}}. {{5}}SGLang הכריזה על תמיכה ביום הראשון (day-0) ב-Muse Glimmer באותו יום שבו עלו המשקלים, והמדידה שפרסמה על GeForce RTX 5090 יחיד היא 236.4 טוקנים לשנייה למשתמש ב-batch 1, עם קוונטיזציית NVFP4 ודראפטר ה-speculative decoding של Meta, DFlash, כששניהם פעילים.{{/5}}
הנתון האחד הזה עושה את רוב הסיפור של המהדורה הזו, אבל כדאי להאט ולהתבונן בשאר המהדורה, כי החלק המעניין אינו מהירות הכותרת. החלק המעניין הוא שהמודל עובד גם ישירות מהקופסה על RTX PRO 6000, על NVIDIA DGX Spark ועל Apple silicon דרך MLX — ושה-SGLang מכנה את העבודה שיתוף פעולה עם Meta Superintelligence Labs ולא מחשבה שלאחר מעשה של הקהילה. זהו מודל Meta הראשון מזה זמן רב שהוא מסוג “קרוב לחזית” (frontier-adjacent), שתוכנן סביב ערימת ההגשה, ולא רק סביב המשקולות.
מה המשמעות האמיתית של "תמיכה ב-day-0" כאן
תמיכה ב-Day-0 ב-SGLang v0.5.17 פירושה שהמודל לא חובר לאחר מעשה: עבודת ה-runtime נחתה באותו חלון שחרור כמו המשקלים, עם מסלול ייעודי לחומרה שמטא באמת מכוונת אליה. ה-backend SM120 של SGLang מכסה את קו Blackwell למחשבים שולחניים ותחנות עבודה — ה-RTX 5090, ה-RTX PRO 6000 וה-DGX Spark כולם מריצים את אותו מסלול מותאם — בעוד ששבבי אפל מקבלים backend MLX מקורי במקום פורט איטי.
הסטאק שסנגלאנג ומטה כוונו אליו הוא ספציפי. המודל רץ כצ'קפוינט של 18GB מסוג NVFP4, יחד עם דרפטר של 5GB מסוג BF16 DFlash, שהוא מודל הלווין לפענוח ספקולטיבי שמטה אימנה עבור Muse Glimmer. השילוב הזה נכנס בכרטיס של 32GB עם מקום פנוי, וכל נתיב הקוונטיזציה המעורבת NVFP4-plus-MXFP8 מגיע לכ-19.5GB בזיכרון. בצד של SGLang, הערות השחרור מציינות שלושה מנגנוני אמינות כחלק מאותו סיפור: פענוח ספקולטיבי DFlash, RadixAttention לאחסון במטמון של קידומות, ו-CUDA graphs הניתנים להפרעה.
המספר, ומה הוא ומה לא
הנתונים שפרסם SGLang עבור RTX 5090, כולם עם NVFP4 ונתיב SM120, מתפרקים כך:
• פענוח למשתמש יחיד (אצווה 1) — 63.9 אסימונים/שנייה רגיל, 236.4 אסימונים/שנייה עם פענוח ספקולטיבי DFlash. ההאצה פי 3.7 היא המספר האינטראקטיבי, זה שמכריע אם סוכן מקומי מרגיש כמו שיחה או כמו תור.
• תפוקה מצטברת (אצווה 8) — 501 אסימונים/שנייה רגיל, 1,452 אסימונים/שנייה עם DFlash. זהו מספר התפוקה עבור שרת מקומי המשרת מספר בקשות בו-זמנית.
לשם השוואה, GGUF q4_k_m על אותו GPU — הנתיב שרוב האנשים ישתמשו בו עם ריצות בסגנון llama.cpp — מגיע ל-72.6 אסימונים/שנייה רגיל ול-140.7 אסימונים/שנייה עם DFlash. נתיב ה-NVFP4 מקדים באופן משמעותי.
אלה הנתונים שפורסמו על ידי SGLang ו-Meta ביום ההשקה, לא שחזורים בלתי תלויים — בכנות, מדובר בדיווח עצמי של הספק והמסגרת, ואימות קהילתי צפוי בשבועות הקרובים. אבל הדפוס בשתי הערימות שפרסמו נתונים עקבי. ב-llama.cpp, Meta דיווחה על 74.9 עד 233.4 אסימונים/שנייה על RTX 5090 עם DFlash, שיפור של פי 3.1; ה-M5 Max עובר מ-26.6 ל-50.2; ה-M4 Max מ-23.7 ל-37.8. שתי סביבות ריצה שונות, שתי שיטות מדידה שונות, אותו סדר גודל: מודל 30B מפענח ביותר מ-200 אסימונים לשנייה על GPU צרכני יחיד, ו-DFlash מכפיל בערך פי שלושה את התפוקה בכל מערך Nvidia שפרסם נתונים.
למה "הגשות" חשובות יותר מ"ריצות"
הבלוג החומרה של Meta טוען טענה חדה יותר ממספרי המחשבים השולחניים. על NVIDIA Blackwell Ultra — דור מרכזי הנתונים, לא הכרטיס השולחני — הבלוג מצטט מעל 20,000 אסימונים בשנייה ל-GPU ב-BF16/NVF4, כאשר SGLang ו-vLLM מוזכרות שתיהן כמחסני טכנולוגיה בקוד פתוח נתמכים. זו ליגה אחרת, וזה הסימן המובהק למה Meta באמת בונה: אותם משקלים מיועדים לרוץ בכל מקום, ממחשב נייד ועד מתלה שרתי GPU, ומסגרות השרתת טופלו כאזרחיות מדרגה ראשונה מהיום הראשון, ולא כהתאמות שייכתבו מאוחר יותר.
צד האמינות של הסיפור חשוב לא פחות מהמהירות. סוכן מקומי שקורס באמצע משימה בגלל ששכבת ההגשה גמגמה אינו טוב משמעותית יותר מסוכן ענן שקיבל הגבלת קצב. המנגנונים בסטאק היום-0 — {{1}}פענוח ספקולטיבי בר-הפרעה{{/1}}, {{2}}מטמון קידומות שמשאיר הקשרי סוכנים ארוכים זולים לכניסה חוזרת{{/2}}, ו-{{3}}דראפטר מכוונן למודל הבסיס{{/3}} — הם בדיוק החלקים שמאפשרים לסוכנים מקומיים פעילים תמיד לשרוד. זו "המהירות והאמינות" שההשקה הצביעה עליהן, וזו עמדה הנדסית אמיתית, לא ביטוי שיווקי.

מה בעצם אפשר לעשות עם זה
Muse Glimmer הוא מודל מולטי-מודאלי צפוף בגודל 30B — קלט טקסט ותמונה דרך מקודד תפיסה קפוא, פלט טקסט — שאומן על יותר מ-100 שפות, עם חלון הקשר של 131,072 טוקנים וחתך ידע מ-4 בינואר 2026. הייעוד שלו הוא העבודה הלא-זוהרת של סוכנים: קריאות פונקציות, שימוש בכלים, ניהול לוח זמנים וקבצים, הערכת LLM-as-a-judge, ומשימות מרובות-שלבים עם התאוששות מכישלון — כאשר קריאת כלי נכשלת, המודל מאומן לאבחן ולנסות שוב במקום לעצור. הוא חושף רמות מאמץ חשיבה (מ-low ועד xhigh) שאתם מגדירים בהנחיית המערכת, וכך אתם מאזנים בין זמן השהייה לעומק על אותם משקלים.
הנתון של 230 אסימונים בשנייה הוא מה שהופך את כל זה לשימושי על מכונה אחת. מתחת לכ-50 אסימונים בשנייה, סוכן אינטראקטיבי מרגיש כמו סשן ניפוי שגיאות מרחוק; ב-200 ומעלה, הוא מרגיש כמו כלי מקומי. זה כל הטיעון בעד המודל במספר אחד, וזו הסיבה שרשימת החומרה — RTX 5090, RTX PRO 6000, DGX Spark, MLX Macs — נקראת כמו מדריך קניות לעידן הסוכנים המקומיים ולא כמו הערת שוליים של תאימות.
כמה זה עולה
Muse Glimmer עצמו חינמי — משקלי Apache 2.0 ב־Hugging Face תחת הנתיב meta-models/Muse-Glimmer-30B, עם קוונטיזציות GGUF שכבר פורסמו לריצות בסגנון llama.cpp וללא API ציבורי של Meta. העלות האמיתית היא החומרה שמתחתיו: checkpoint של 18GB מסוג NVFP4 ועוד הדראפטר של 5GB, כלומר אתה צריך כרטיס של 24GB או 32GB, או מק מסדרת M גבוהה. אם אתה כבר בעלים של זה, העלות השולית של סוכן מקומי פעיל תמיד היא חשמל. אם לא, ה־GPU הוא סעיף העלות, וזו הדרך הכנה להשוות "מודל חינמי" מול API מתארח.
כשאתה עושה את ההשוואה הזו, תמחר את שני הצדדים ישר. ב-OrcaRouter, המחיר שאתה רואה עבור כל אחד מ-200+ המודלים המתארחים הוא מחיר המחירון של הספק המועבר ב-0% תוספת, כך שהנחת מחיר של ספק נכנסת כאן לתוקף באותו היום — מה ששומר על הגינות החשבון בין פתרון מקומי למתארח. Muse Glimmer עצמו אינו נמצא ב-OrcaRouter כיום, מכיוון שאף ספק אינפרנס עדיין לא מגיש אותו; הוא נמסר כהורדה. ברגע שספק אכן יתחיל להגיש אותו, אותו מפתח שמגיע לשאר הקטלוג יגיע גם אליו, ומעבר אוטומטי הוא המנגנון שהופך את זה לבטוח להפנות תעבורת ייצור למודל חדש לגמרי המדווח על ידי הספק, לפני שיש לו רקורד עצמאי.

הסיפור הגדול יותר מאחורי המהירות
קראו את {{1}}עבודת היום-0 של SGLang{{/1}} כאות, והשחרור מפסיק להיות מודל בודד. Muse Glimmer היא גרסה מזוקקת של מודל הדגל הקנייני של Meta, Muse Spark 1.2, ומטא אמרה שמשקלי המודל המורה יגיעו {{2}}"בשבועות הקרובים."{{/2}} סוכן מקומי של 30B עם מחסנית הגשה מכווננת, מודל מורה שעומד להפוך למודל פתוח, ו{{3}}קרן קהילתית של מיליארד דולר שהוכרזה לצידו{{/3}} — זה לא שחרור משני. זה {{4}}הקצה הדק של מערך דגמים במשקלים פתוחים{{/4}} המכוון ישירות לשוק הסוכנים המקומיים, ו{{5}}תמיכת הפריימוורקים שמגיעה ביום הראשון{{/5}} היא החלק שאומר ש{{6}}מטא מתכוונת שאנשים יריצו אותו בפועל, לא רק יורידו אותו.{{/6}}
ההסתייגות שצריך לזכור: {{1}}כל נתון מהירות וביצועים שצורף להשקה הזו עד כה מגיע מספק או מפריימוורק{{/1}}. {{2}}נתוני התפוקה עקביים בשני מחסני טכנולוגיה עצמאיים, וזה מרגיע{{/2}}, אבל {{3}}בדיקות מידה עצמאיות, ערך ב-Artificial Analysis ושכפולים בעולם האמיתי הם מה שיאשרו את סיפור ה-230 טוקנים לשנייה{{/3}} — וגם {{4}}הם בדרך כלל מגיעים תוך שבועות מהשקה כזו{{/4}}.
מה לצפות, בסדר גס של מהירות: שחרור המשקולות הפתוחות של Muse Spark 1.2 (הקריאה האסטרטגית על "Meta חזרה" תלויה בכך); שחזורי התפוקה העצמאיים הראשונים על חומרה שאינה של Nvidia, כשהנתיב של MLX הוא זה שכדאי לעקוב אחריו; וספק האינפרנס הראשון שמקים נקודת קצה של Glimmer — זה הרגע שבו הטיעונים של "מודל מקומי חינמי" ו"API מתארח" מפסיקים להיות היפותטיים והופכים לבחירה שאתה יכול לעשות עם מקש אחד.

