כרטיס hero שנוצר בכותרת 'Reflection Beam: 501B פרמטרים, 23B פעילים', עם שורת משנה 'MoE דליל / 23.8T טוקנים של אימון מקדים / הקשר API של 256K טוקנים / משקולות מובטחות החודש / כל נתון לפי דיווח הספק'. שלושה אייקוני קו שטוחים מונחים מתחת לטקסט: תרשים שכבות מוערם שרוב שכבותיו מעומעמות ואחת מודגשת, מתלה של תשעה לבני שרת, ומתאר מסמך עם מנעול קטן. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

Reflection Beam, מוסבר: 501B פרמטרים, 23B פעילים, ומשקלים שטרם יצאו

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-5 באוקטובר 2026 Reflection הכריזה Reflection Beam, מודל שפה מסוג תערובת-מומחים דלילה עם 501 מיליארד פרמטרים בסך הכל, שמפעיל 23 מיליארד מהם לכל טוקן, והציבה לצידו נקודת קצה בגרסת בטא, תואמת OpenAI, כבר באותו יום. זה 4.6 אחוזים מהמודל ערים בכל רגע — יחס אגרסיבי אפילו לפי הסטנדרטים של תחום המשקולות הפתוחות הנוכחי — וזה המספר שכל ההשקה תלויה בו. Reflection אומרת שהמשקולות המלאות, דוח טכני וכרטיס מודל יגיעו בהמשך החודש תחת Apache 2.0. נכון להיום הם לא כאן, מחיר לא פורסם בשום מקום בנכסים של Reflection עצמה, ול-Artificial Analysis אין שורה עבור המודל. אז הסיכום הכנה של ההשקה הוא זה: טענה מאוד ספציפית לגבי יעילות, שנעשתה על ידי המעבדה שאימנה את המודל, כשכל מספר תומך סופק על ידי אותה מעבדה.

טבלאות ההשוואה של Reflection עצמה מציבות את Reflection Beam מול Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max ו-DeepSeek V4.1 Flash, שזו תמונה הוגנת של הדרג שאליו הוא מכוון: מודלים פתוחים וחצי-פתוחים שהם חזקים אך לא חזיתיים, כמה מהם מהווים שבריר מגודלו של Beam. Beam לא מנצח את התחום הזה ביכולת גולמית, ואנחנו נראה לכם בדיוק היכן הוא מפסיד. מה שהוא טוען לעשות הוא להגיע סמוך לראשו תוך הוצאת בערך פי שלושה עד ארבעה פחות מחשוב הסקה מ-GLM 5.2 בציוני חשיבה דומים. הטענה הזו היא המאמר.

מה בעצם קיים היום

כל מה שמופיע בסעיף הזה לקוח מהתיעוד של Reflection עצמה, כפי שנקרא ב-6 באוקטובר 2026. ה-API פעיל בגרסת בטא מאחורי רשימת המתנה; המשקולות טרם יצאו לאור.

• מזהה דגם — Beam-501B-A23B, נוצר ב-5 באוקטובר 2026.

• ממשק — משטח תואם OpenAI בכתובת api.reflection.ai/openai/v1, שחושף Chat Completions ואת רשימת Models, ותו לא. אין Completions, אין embeddings, אין batches.

• הקשר — 256,000 טוקנים, עם הערת שוליים המצורפת לנתון עצמו: "חלון ההקשר עשוי להשתנות במהלך הבטא." הפלט המרבי הוא 128,000 טוקנים.

• הסקה — פרמטר reasoning_effort עם חמישה ערכים: low, medium, high, xhigh ו-max. ברירת המחדל היא medium, והמודל תמיד מבצע הסקה ללא קשר להגדרה — אין מתג כיבוי.

• מודאליות — טקסט נכנס, טקסט יוצא. אין קלט תמונה או אודיו בהשקה, וזהו הבדל של ממש מ-Inkling, המודל שמעמיד את המולטימודאליות במקום הראשון, שהשיקה Thinking Machines של מירה מוראטי ביולי.

• נקודת קטיעת הידע — 30 ביוני 2026.

• מחיר — לא פורסם. הפוסט בבלוג של Reflection, התיעוד שלו ורשימת המודלים שלו — כולם משמיטים אותו, וקונסולת הפלטפורמה נמצאת מאחורי חומת הרשמה.

השורה האחרונה הזו חשובה יותר מכפי שהיא נראית. לכל מודל אחר בקבוצת ההשוואה של Beam יש מחיר מחירון ציבורי שאפשר להזין היום בגיליון אלקטרוני. ל-Beam אין, מה שאומר שכל טיעון עלות לגביו כרגע הוא טיעון על מחשוב, לא על דולרים.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

היחס 501 ל-23 הוא הטיעון

דלילות אינה חדשה; השאלה היא עד כמה רחוק מעבדה מוכנה לדחוף אותה. GLM 5.2 מפעיל כ-40 מיליארד פרמטרים פעילים מתוך סך מדווח של כ-744 מיליארד — כ-5.4 אחוזים. Reflection Beam עומד על 4.6 אחוזים מתוך 501 מיליארד. על הנייר זהו צעד נוסף צנוע, ו-Reflection נזהרת בטענותיה לגביו.

נתון היעילות בפוסט ההשקה מגיע מגרף שנבנה על נתוני Artificial Analysis ו-DataCurve, המשרטט ציון חשיבה מול הערכת FLOPs של הסקה, כאשר FLOPs מקורבים כמכפלה כפולה של מספר הפרמטרים הפעילים במספר הממוצע של הטוקנים שנוצרו. הנוסחה הזו מחריגה במכוון prefill של הפרומפט, עלות attention ותקורת שירות. זהו מודל מסוג חישוב על גב מעטפה, לא מדידה, ו-Reflection אינה מציגה אותו ככזו — אבל זה גם התימוך הכמותי היחיד לטענה של "פי 3 עד 4 יותר זול באותו ציון", והוא נכתב על ידי הספק. התייחסו אליו כאל השערה שהמשקלים, כשיגיעו, יאפשרו למישהו אחר לבחון.

מה שהארכיטקטורה נותנת בפועל הוא פרופיל הגשה. עשרים ושלושה מיליארד פרמטרים פעילים הם מודל שאפשר להריץ על מספר קטן יחסית של כרטיסי GPU בחביון אינטראקטיבי, וזהו מוצר שונה ממודל צפוף עם 501 מיליארד פרמטרים, אף שמספר הפרמטרים על הכרטיס זהה. זו הסיבה ש-Reflection יכולה לדבר על חשיבה בסמוך לחזית בלי לדבר על פריסה בקנה מידה של מרכז נתונים.

פחות מארבעה שבועות של אימון מקדים, והגילוי ספציפי באופן יוצא דופן

הדיווח על האימון הוא החלק בפרסום שנקרא כאינפורמטיבי באמת, כי Reflection פרסמה מספרים שרוב המעבדות שומרות לעצמן.

• אימון מקדים — 23.8 טריליון טוקנים על 6,144 שבבי GB300 בארונות NVL72, שהסתיים בפחות מארבעה שבועות בתפוקה שימושית מדווחת של 92.3 אחוזים, עם תשע חזרות אחורה מנקודות ביקורת לאורך הדרך.

• למידת חיזוק — 10,500 שבבי GB300 למשך ארבעה שבועות, יותר מ-100 מיליון הרצות, הקשר הרצה מרבי של 256,000 טוקנים, כ-1.3 מיליארד ארגזי חול וכמיליון סביבות שונות, עם ממוצע של 110,000 הרצות הפועלות במקביל.

• אימון ביניים — מרחיב את ההקשר האפקטיבי של המודל ל-1 מיליון טוקנים.

• יציבות — גרדיאנטים של מדיניות אסינכרוניים שנשארים יציבים גם עם התיישנות בסדר גודל של ימים, בתוספת קנס אורך שניתן לשליטה כך שאורך ההסקה יכול להיות מכוונן ללא אימון מחדש.

קראו את שורות ה-pre-training וה-RL יחד, וצורת הטענה מתגלה. סיפור היעילות אינו נוגע רק בפרמטרים פעילים בזמן inference; הוא נוגע גם בכמה מהר אומן המודל ובכמה מהמחשוב הופנה ל-RL התלוי בסביבה במקום לעוד טוקנים. מיליון סביבות ו-1.3 מיליארד sandboxes הם הצהרה על תשתית אימון לשימוש בכלים ולסוכנים, והיא מתיישבת עם הבנצ'מרקים ש-Reflection בחרה להוביל איתם.

מספר אחד ראוי לדגל. הבלוג אומר שאימון ביניים מרחיב את ההקשר האפקטיבי למיליון טוקנים; התיעוד של ה-API מפרט מגבלת הגשה של 256,000 טוקנים עם הערת שוליים של בטא מצורפת. אלה יכולת בצד האימון ומגבלה בצד ההגשה, לא סתירה — אבל הפער הוא בדיוק מסוג הדברים שהופכים לכותרות של "הקשר של 1M" אם אף אחד לא קורא את המסמך השני, ומי שכותב על Beam בשבוע הבא צריך לקרוא את המסמך השני.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

בנצ'מרקים: היכן Reflection Beam מנצח, והיכן הוא לא

כל נתון להלן מדווח על ידי הספק, מהטבלאות בפוסט ההשקה של Reflection, ואף אחד מהם לא שוחזר באופן עצמאי. עמודות ההשוואה הן אותם מספרים ש-Reflection פרסמה עבור המודלים האחרים; כאשר תא מציג "NR" במקור, המודל לא הורץ. אין שורה של Artificial Analysis עבור Beam, כך ששום דבר כאן לא עבר דרך מערכת בדיקה של צד שלישי.

קידוד סוכני

• Terminal-Bench v2.1 — Beam 80.1 לעומת GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen3.8 Max 86.6, DeepSeek V4.1 Flash 90.6, Inkling 63.8, Nemotron 3 Ultra 56.4.

• SWE-Bench Pro v1 — Beam 65.5 לעומת Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77.2 לעומת Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9.

• SWE-Bench Verified — Beam 80.9 מול Inkling 77.6, Nemotron 3 Ultra 70.7.

• SWE-Bench Multilingual — Beam 78.0 לעומת Nemotron 3 Ultra 67.7.

• DeepSWE v1.1 — Beam 44.4 לעומת DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.2 44.0.

• שאלות ותשובות על בסיס הקוד של SWE Atlas — Beam 34.6 לעומת Kimi K3 68.0, GLM 5.3 61.0.

השורה האחרונה היא זו שכדאי לעצור עליה. מענה לשאלות על מאגרי קוד בטווח ארוך הוא תחום שבו מודל חייב להחזיק בסיס קוד בראשו לאורך אינטראקציה ארוכה, ו-34.6 מול 68.0 הוא לא הבדל שנובע מעיגול. DeepSWE מספר סיפור דומה: 44.4 מציב את Beam באותה רמה של GLM 5.2 והרחק מאחורי DeepSeek V4.1 Flash.

חשיבה

• AIME 2026 — Beam 97.8 לעומת GLM 5.2 99.2, Inkling 97.1.

• HLE, ללא כלים — Beam 36.2 לעומת Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 לעומת Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.4 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 לעומת GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16.3 לעומת Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

פרופיל החשיבה של Beam הוא בטווח הבינוני, והדפוס עקבי: בנוחות לפני שני המודלים מהדור הקודם ברשימה של Reflection, ומאחורי הנוכחי. GPQA Diamond עם 90.5 הוא ציון מוצק שארבעה מודלים אחרים עולים עליו.

• MCP Atlas — Beam 78.7 לעומת Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.

• AutomationBench, חלוקה ציבורית — Beam 37.0 מול DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 בנקאות — Beam 38.0 לעומת Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• BrowseComp עם ניהול הקשר — Beam 77.4 לעומת Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• DeepSearchQA עם ניהול הקשר — Beam 80.1 לעומת Kimi K3 95.0.

Reflection הציג גם שתי הדגמות יכולות בפוסט: שיעור פתרון של 95.5 אחוז בפאזל "Land or Water", רשת בגודל 180 על 90 עם 16,200 נקודות שמצריכה להחזיק מצב לוח גדול — נתון שנמצא בין 92.5 ל-97.8 אחוזים ש-Reflection מייחס ל-Opus 5 ול-Fable 5 באותה משימה — וכיוונון עדין ל-Text2SQL של ה-Gemma-4 הקטן ביותר, שהעלה את הדיוק על נתונים שלא נכללו באימון ל-66.5 אחוז. ההדגמות נערכות בקפידה; הן מראות שהמודל מסוגל לעשות משהו, לא באיזו תדירות.

מה אתה יכול לעשות עם זה היום, ומה לא כדאי לתכנן סביבו

היום, בדיוק דבר אחד אפשרי בדרך כלל: לבקש גישת בטא ולקרוא ל-Beam-501B-A23B דרך נקודת הקצה של Reflection עם לקוח בצורת OpenAI. אין מחיר מפורסם, כך שאין דרך למדל את העלות של עומס עבודה עליו. אין משקולות, כך שאין אירוח עצמי, אין קוונטיזציה, אין כיוונון עדין ואין יכולת שחזור על ידי צד שלישי. אין שורת בנצ'מרק בלתי תלויה, כך שכל תמונת הביצועים שלמעלה נשענת על הטבלאות של מעבדה אחת.

Reflection Beam אינו אחד מהמסלולים שלנו. אנחנו לא נתיימר אחרת, ולא נפנה אתכם למשווק משנה שאולי יש לו אותו. מה שכן נוכל לומר לכם הוא מה עולה סט ההשוואה, כי אנחנו מנתבים ארבעה מהמודלים האלה והמספרים שלמטה נקראים בזמן אמת מהקטלוג שלנו הבוקר: GLM 5.2 ב-$1.40 לקלט ו-$4.40 לפלט למיליון טוקנים, GLM 5.3 ב-$1.26 ו-$3.96, Qwen3.8 Max ב-$2.00 ו-$6.00, ו-DeepSeek V4.1 Flash ב-$0.15 ו-$0.60. זהו פער אמיתי — DeepSeek V4.1 Flash זול כמעט פי עשרה בקלט מ-GLM 5.2 — וזו הסיבה שמודל בטא בלי מחיר קשה לשבץ לתוך החלטה. OrcaRouter מריץ מפתח אחד תואם OpenAI על פני אלה ועל יותר מ-200 מודלים נוספים כשמחיר המחירון של הספק מועבר כמו שהוא בלי שום תוספת, מה שאומר ששינוי מחיר של ספק מתעדכן אצלנו באותו יום ולא בכל פעם שמשווק משנה מרענן את הנתונים. ומכיוון ש-מעבר אוטומטי לגיבוי הוא חלק מהניתוב ולא משהו שאתם בונים, מודל חדש ושאינו מוכח הוא בדיוק מסוג הדברים שאפשר לשים על חלק מהתעבורה במקום על הנתיב הקריטי שלכם — וזו הדרך האחראית היחידה להשתמש במשהו שאף אחד עוד לא שחזר את מדדי הביצועים שלו.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

למה לשים לב לפני שמתייחסים ברצינות לטענת היעילות

שלושה דברים יכריעו את השאלה, ושניים מהם הובטחו בתוך החודש.

הראשון הוא המשקלים. רישיון Apache 2.0 ודוח טכני יאפשרו לכל מי שיש לו כמה צמתים למדוד את הדבר שבאמת חשוב — אסימונים לשנייה לכל GPU ברף איכות קבוע, והאם 23 מיליארד פרמטרים פעילים באמת מספקים את יחס הניקוד ל-FLOP שהתרשים מרמז עליו. עד אז, טיעון היעילות הוא אריתמטיקה על מפית.

השני הוא מחיר. למודל בלי מחיר מחירון אין מקום בהשוואת עלויות, ואם Beam מתמקם מעל לרמת GLM ו-DeepSeek, סיפור החישוב מפסיק להיות רלוונטי למי שיש לו תקציב. אם הוא מתמקם מתחת, התמונה משתנה במהירות.

השלישי הוא צד שלישי שמריץ את הסוויטה. כל מספר שלמעלה מגיע מאותו מסמך, וטבלה שדווחה בידי ספק, שמציבה את המודל שלה עצמה מאחור בשבעה מתוך שישה עשר שורות, היא סימן טוב ליושרה של המעבדה — אבל זו עדיין מעבדה אחת, רתמה אחת, סט פרומפטים אחד.

אם אתה צריך היום מקודד אג'נטי מוכשר ואתה צריך לדעת מה העלות שלו, התשובה היא עדיין לא Reflection Beam. אולי היא תהיה בעוד שלושה שבועות. המודל שטענת יעילות שווה להמר עליה הוא זה שאת המשקולות שלו אפשר להוריד ואת ה-FLOPs שלו אפשר לספור בעצמך — ובמבחן הזה, Reflection נתנה לנו תאריך ולא מודל.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית