
Step 5 Preview לעומת Muse Glimmer: ה-Frontier API ודגם המחשב הנייד
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
בלוח דירוג, Step 5 Preview ו-Muse Glimmer אינם קרובים: 44 לעומת 17 במדד ה-Artificial Analysis Intelligence Index — פער של עשרים ושבע נקודות בסולם שהמוביל הנוכחי בו נמצא בשנות החמישים המאוחרות — שאין שום כיוונון שיסגור אותו. בשאלה שצוות באמת צריך לענות עליה — איפה הטוקנים שלי רצים — הם מתחרים ישירים. Step 5 Preview הוא מודל הדגל של StepFun, שהוכרז ב-20 בספטמבר 2026, עם כ-600 מיליארד פרמטרים בסך הכול, מתוכם 27 מיליארד פעילים, חלון הקשר של 1M טוקנים, ותמחור של $1.00 למיליון טוקני קלט ו-$2.70 למיליון טוקני פלט, ונגיש רק דרך רשת. Muse Glimmer הוא המודל הסוכני במשקולות פתוחות בעל 30 מיליארד פרמטרים של Meta Superintelligence Labs, שיצא ב-10 באוגוסט 2026 תחת Apache 2.0, מסופק כשהוא מכומת ל-4 ביט כך שהוא נכנס לזיכרון של פחות מ-20 GB ורץ על כרטיס מסך צרכני בודד כשהרשת מנותקת. הדרך הנכונה לקרוא את הצימוד הזה היא לא "מי חכם יותר". אלא "איזו משתי המגבלות — יכולת או היקף — היא זו שהעומס שלך לא יכול להזיז."
ההשוואה היא גם תיקון מועיל להרגל שהשוק הזה אימץ: להתייחס לציון של מדד מורכב כאל כל ערכו של מודל. הפער של עשרים ושבע נקודות הוא אמיתי, והוא אינו המספר היחיד בקובץ. באחזור בהקשר ארוך, אותו לוח דירוג עצמאי מציב את Muse Glimmer בפער של עד חצי נקודה ממודלים עם משקולות פתוחות ממחלקת משקל גדולה בהרבה, ומדדי הסוכנים של Meta עצמה מכובדים עבור מודל שרץ על מחשב נייד. בינתיים, החולשה המצוטטת ביותר של Step 5 Preview אינה היכולת כלל וכלל אלא אריכות דברים, והוא סגור עד שהמשקולות המובטחות שלו יגיעו ב-15 באוקטובר.
שני דגמים, שני אובייקטים שונים לחלוטין
Step 5 Preview היא מערכת mixture-of-experts המוגשת מהתשתית של StepFun: כ-600B פרמטרים בסך הכול, 27B פעילים לכל טוקן, קלט טקסט ותמונה, חלון הקשר של מיליון טוקנים, וציון Intelligence Index עצמאי של 44 לעומת חציון של 26 בדגמים דומים. הפלט שלה רץ בקצב של 87 טוקנים לשנייה לעומת ממוצע של 78 באותה מדידה של אותו לוח, והיא הפיקה כ-160 מיליון טוקני פלט across מערך משימות המדד, כאשר הדגם החציוני פולט כ-82 מיליון — בערך כפול טקסט לכל יחידת עבודה, בחיוב של $2.70 למיליון. משקולות BF16 הובטחו ל-15 באוקטובר 2026 ועדיין אינן במאגר, כך שהיום הדגם קיים עבורך רק כ-API.
Muse Glimmer הוא הדבר ההפוך. זהו מודל בן 30 מיליארד פרמטרים שאומן באמצעות זיקוק לוגיטים מהמורה Muse Spark הגדול יותר של Meta, ואז עבר כוונון עדין על נתוני סוכנים בעלי הקשר ארוך וחוזק לשימוש בכלים. Meta מספקת אותו מכומת ל-4 סיביות, מה שמפחית את הזיכרון מיותר מ-55 GB בדיוק מלא לפחות מ-20 GB — בתוך מעטפת VRAM של 24 GB או 32 GB — והוא נבדק על ידי Meta על Nvidia RTX 5090 ועל שבבי Apple M4 Max ו-M5 Max. הוא מקבל קלט טקסט ותמונה ביותר ממאה שפות, תומך בהקשר של 131,072 טוקנים הניתן להרחבה ל-262,144, ונבנה לקבל מטרה, לפרק אותה לשלבים, לקרוא לכלים ולנסות שוב קריאה שנכשלה במקום לעצור. הוא ברישיון Apache 2.0, והוא פועל באופן לא מקוון.
• ציון עצמאי — Step 5 Preview: 44 מול חציון של 26 בקטגוריה שלו, לעומת Muse Glimmer: 17 באותו מדד בתצורה הגבוהה שלו.
• קנה מידה — Step 5 Preview: כ-600B בסך הכל, 27B פעילים ל-StepFun לעומת Muse Glimmer: 30B בסך הכל, מכומת ל-4-bit מתחת ל-20GB.
• חלון הקשר — Step 5 Preview: מיליון טוקנים לעומת Muse Glimmer: 131,072 ניתן להרחבה עד 262,144, לפי Meta.
• מחיר — Step 5 Preview: $1.00 בקלט / $2.70 בפלט למיליון טוקנים, מחיר מפורסם לעומת Muse Glimmer: ללא חיוב לפי טוקן; אתם מספקים את ה-GPU.
• היכן זה פועל — תצוגה מקדימה של שלב 5: השרתים של הספק, דרך HTTP לעומת Muse Glimmer: החומרה שלך, במצב לא מקוון.
• רישיון — Step 5 Preview: תצוגה מקדימה סגורה, משקלים מובטחים ל-15 באוקטובר 2026 לעומת Muse Glimmer: Apache 2.0, ניתן להורדה כעת.
• אחזור בהקשר ארוך — Muse Glimmer צובר 80.0 בהערכת החשיבה בהקשר ארוך של לוח האינדקס, בפער של חצי נקודה בלבד מדגמים יקרים ממנו פי כמה, וקרוב מספיק לתוצאה של Step 5 Preview עד שההבדל אינו רלוונטי להחלטה בעבודת איתור עובדות.
עשרים ושבע הנקודות, ומה שהן אינן מודדות
מודל 30B שעבר זיקוק כדי לפעול בזיכרון של 20 GB יפסיד למודל דגל 600B במדד אינטליגנציה כללית, והחומר של Meta עצמה אינו טוען אחרת — באחת מהצגותיה נאמר באופן בוטה ש-Glimmer לא נועד להשתוות לעוצמת החשיבה הגולמית של מודלים בענן בקנה מידה מלא. לכן הציון 17 אינו פסק דין על ההנדסה; הוא התוצאה הצפויה של שקילת מטרה אחרת. השאלה הנכונה היא אילו מהמשימות שלך הפער הזה באמת מכסה.
הקריאה בהקשר ארוך היא המקום שבו השניים מתקרבים ביותר ושבו האינטואיציה מתערערת. Muse Glimmer מקבל 80.0 בהערכת החשיבה בהקשר ארוך של לוח התוצאות — ציון שהיה שגרתי עבור מודל חזיתי ומרשים עבור מודל שרץ על GPU צרכני. אם עומס העבודה שלך הוא אחזור, סיכום או חילוץ ממסמכים ארוכים, מודל מקומי ברמה כזו אינו בהכרח הכלי הלא נכון, והעובדה שהבקשה לעולם אינה יוצאת מהמכונה שלך היא תכונה שאי אפשר לקנות מ-API בשום מחיר.
ואז ישנו החלק בהשוואה שהמספרים של Meta אינם מציגים. מחקר שעבר ביקורת עמיתים בנושא תזמור מרובה-סוכנים בחן את Muse-Glimmer-30B בהגדרה מבוקרת — אותה משימה, אותו הרנס, אותם יועצים — ומצא שהוא לא שחזר אף אחד מהמועמדים שהפיקו מודלי חזית גדולים יותר, ונכשל בכל שלושת הניסיונות בכל הגדרה. זהו מחקר בודד של תצורה אחת, וזה מסוג הראיות שדף מודל לעולם אינו חושף. עבור צינורות סוכניים שבהם מתזמר חלש יותר נדרש להתאושש מכישלון של מודל חזק יותר, זוהי התוצאה הרלוונטית ביותר להחלטה בטקסט הזה, וכדאי לקרוא אותה לפני כל אחד מהמדדים המדווחים על ידי הספק של Meta.
מבחני הביצוע האלה, לשם שלמות התמונה, הם של מטא עצמה ולא שוחזרו: 76.0% ב-SWE-Bench Verified, 51.2% ב-SWE-Bench Pro, 51.7% ב-TerminalBench 2.1, 65.9% ב-OSWorld-Verified, 83.5% ב-GPQA Diamond, 22% ב-Humanity's Last Exam ו-75.5 ב-MCP-Atlas. הם נמדדים מול מודלים באותה מחלקת גודל שלה, והם מתארים סוכן מקומי בעל יכולת ולא מודל הסקה בחזית.

היכן שהגבול למעשה עובר
היתרון המבני של Step 5 Preview הוא שהוא עושה את העבודה שאינך יכול לעשות באופן מקומי. חלון הקשר של 1M טוקנים, קלט תמונות, ציון מדוד הסמוך לחזית וקצב של 87 טוקני פלט בשנייה בלי לקנות חומרה: לניסוח טיוטות, לתכנון, לסקירת קוד על פני מאגר גדול, או לכל דבר שבו תקרת המודל היא צוואר הבקבוק — ה-API מנצח, ועשרים ושבע הנקודות הן הטיעון כולו. העלות של זה היא ההפך מזו של Muse Glimmer: ההנחיות יוצאות מחוץ לגבולות שלך, המחיר חל מחדש על כל טוקן, והמילוליות של המודל הופכת עומסי פלט ארוכים ליקרים יותר ממה שתעריף $2.70 מרמז.

היתרון של Muse Glimmer הוא בכך שהוא עושה את העבודה שלא יכולה לצאת. אם הנתונים כפופים לרגולציה, אם תקציב השיהוי הוא כמה מילישניות, אם המכונה לא מקוונת, או אם העלות השולית של הבקשה המיליון חייבת להיות אפס — אז אף API אינו מועמד, לא זה ולא אחר. המחיר של זה הוא יכולת: אתה בוחר 17 במקום שבו קיים 44, ובתזמור סוכני ייתכן שאתה בוחר מתאם שלא יכול להתאושש מטעויות של מודל חזק יותר.
עבור רוב הצוותים התשובה אינה בחירה אלא פיצול, והפיצול צריך מקום לחיות בו. OrcaRouter מנתב יותר מ-200 מודלים מאחורי מפתח API אחד וחשבונית אחת במרווח של 0% כאשר מחיר המחירון של הספק מועבר במלואו, ובנוסף מעבר אוטומטי לגיבויו-DSL לניתוב להפניית תעבורה לפי משימה, עלות או השהיה. לא Step 5 Preview ולא Muse Glimmer נמצאים בקטלוג הזה — הדגל של StepFun אינו מנותב דרכנו ו-Glimmer הוא הורדה מקומית — כך שהערך המוצע אינו גישה לאף אחד מהשניים. הוא הסט שמולו הייתם מריצים להם בנצ'מרק, שזמין לקריאה במפתח אחד כבר היום, כך שההחלטה בין מקומי למרוחק תוכרע לפי התפלגות המשימות שלכם ולא לפי הדף של הספק שקראתם אחרון.

איך להחליט
בחר ב-Step 5 Preview כאשר התקרה היא המגבלה. אם המשימות שלך פתוחות, רב-מודאליות, בעלות הקשר ארוך או סוכניות במובן של צורך במתכנן בעל יכולת, מודל ה-API הוא היחיד מבין השניים שיכול לבצע אותן, ומחירו נמוך מספיק עבור הקטגוריה שלו כך שהרצת פיילוט עליו היא תקציב ולא פרויקט. הקצה תקציב למילוליות, תכנן שתאריך המשקולות של 15 באוקטובר יידחה, והשאר מחוץ לזה את מה שאסור שיצא מהבניין.
בחר ב-Muse Glimmer כאשר ההיקף הוא האילוץ. אם אין לשלוח את הנתונים שלך, אם אתה צריך להריץ על מטוס או במפעל, או אם נפחי השימוש שלך הופכים תמחור לפי טוקן לאבסורדי, מודל 30B ברישיון Apache-2.0 שנכנס ל-20 GB הוא הבחירה המעשית, ותוצאת אחזור ההקשר הארוך שלו טובה מספיק כך שפער היכולות לא יופיע בכל עומס עבודה. בדוק אותו באורקסטרציה לפני שאתה סומך עליו שם, כי שם הראיות הבלתי-תלויות הן החלשות ביותר.
אם שני האילוצים חלים בו-זמנית, הרץ את שניהם: מקומי עבור הנתונים שאי אפשר להזיז, API עבור המשימות שזקוקות למודל גדול יותר, ותן להחלטת הניתוב להיות שינוי תצורה ולא מיגרציה. ההשוואה שחשובה היא לא 44 מול 17. היא איזו מהבקשות שלך יכולה להרשות לעצמה לצאת מהמכונה, וזו שאלה שרק התעבורה שלך עצמה יכולה לענות עליה.
