
Reflection Beam משחררת API בגרסת בטא, והמשקלים עדיין שבועיים מלצאת
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
המודל הראשון של Reflection נקרא Reflection Beam, והדבר המעניין בו הבוקר אינו שהוא קיים — אלא שרק מחצית ממנו קיימת. החברה הכריזה על Beam ב-5 באוקטובר 2026 כמודל תערובת-מומחים דליל עם 501 מיליארד פרמטרים בסך הכול ו-23 מיליארד פעילים לכל טוקן, והעמידה לרשותו נקודת קצה בתצורת בטא, תואמת OpenAI, באותו יום. המשקולות מובטחות להמשך החודש תחת Apache 2.0, לצד דוח טכני, כרטיס מודל ומערכת ההגשה. עד שהן יגיעו, האנשים היחידים שיכולים להריץ את Beam-501B-A23B הם אלה ש-Reflection מוסרת להם מפתח מרשימת המתנה, וכל נתון ביצועים שנמצא בתפוצה מגיע מהטבלאות של מעבדה אחת בלבד.
זה מקום מוזר לעצור בו השקה, וכדאי להיות מדויקים לגבי איזה חצי יש לנו. Reflection השיקה תצוגה מקדימה שאפשר להירשם אליה וסט טבלאות בנצ'מרק שאיש לא שיחזר. היא לא השיקה את הדבר שאליו מתייחס המונח "open-weight" בכותרת.
מה בעצם משודר בשידור חי הבוקר
כל מה שמופיע בסעיף זה מקורו בפוסט בבלוג ובתיעוד של Reflection עצמה, אשר נקראו ב-6 באוקטובר 2026.
• מזהה מודל — Beam-501B-A23B, נוצר ב-5 באוקטובר 2026, מוגש בכתובת api.reflection.ai/openai/v1 עם Chat Completions ורשימת Models ותו לא.
• צורה — 501 מיליארד פרמטרים בסך הכול, 23 מיליארד פעילים לכל טוקן, מה שנותן יחס הפעלה של כ-4.6 אחוזים. לשם השוואה, GLM 5.2 נמצא קרוב ל-5.4 אחוזים.
• הקשר — 256,000 טוקנים ב-API, עם הערת שוליים המצורפת לנתון עצמו המזהירה שהחלון עשוי להשתנות במהלך תקופת הבטא. הפלט המקסימלי הוא 128,000 טוקנים.
• חשיבה — פרמטר reasoning_effort עם חמש הגדרות: low, medium, high, xhigh ו-max. medium הוא ברירת המחדל, והמודל תמיד מבצע חשיבה. אין מתג כיבוי ואין מצב ללא חשיבה.
• מודאליות — טקסט נכנס, טקסט יוצא. אין קלט של תמונה, אודיו או וידאו בעת ההשקה.
• מחיר — לא פורסם. הפוסט בבלוג לא כולל אותו, התיעוד לא כולל אותו, וקונסולת הפלטפורמה נמצאת מאחורי חומת הרשמה.
• גישה — רשימת המתנה. אין מסלול בשירות עצמי ואין משקולות, ולכן אין הורדה, אין קוונטיזציה ואין כיוונון עדין.
שורת המחיר היא זו שמשנה את האופן שבו אתה קורא את כל השאר. לארבעה מתוך שבעת המודלים ש-Beam מושווה להם בטבלאות של Reflection עצמה יש מחירי מחירון פומביים שאפשר להזין לגיליון אלקטרוני כבר היום. ל-Beam אין כאלה, ולכן כל טענת עלות לגביו כרגע היא טענה על מחשוב, לא על דולרים.

המספר שההשקה תלויה בו
הפיץ' של Reflection הוא יעילות הסקה, והוא ספציפי באופן יוצא דופן לגבי מה זה אומר: במבחני בנצ'מרק להסקה מתקדמת, Beam משיג ציונים דומים ל-GLM 5.2 תוך שימוש בפי 3 עד 4 פחות כוח חישוב להסקה. הרווחים מתוארים כגדולים עוד יותר לעומת מודלים במשפחת 2 טריליון הפרמטרים, שבה נמצא Qwen 3.8-Max.
התרשים שמאחורי הטענה הזו ראוי לקריאה מדוקדקת, משום שהוא הראיה הנושאת במשקל של כל הפוסט. הוא מתווה ציון הסקה מול הערכת FLOPs של אינפרנס על פני DeepSWE, Humanity's Last Exam ו-Terminal-Bench 2.1, והוא מעריך את ה-FLOPs כבערך פי שניים ממספר הפרמטרים הפעילים כפול המספר הממוצע של טוקנים שנוצרו לכל ניסיון. הנוסחה הזו מוציאה במכוון מן החשבון את ה-prefill של הפרומפט, פעולות קשב תלויות הקשר ותקורה של הגשה — Reflection מציינת זאת בכתובית. זהו השוואה עקבית בין מודלים ולא מדידה של החשבון של מישהו, והיא גם התמיכה הכמותית היחידה לטענת היעילות, שנכתבה בידי המעבדה שבנתה את המודל. התייחסו אליו כאל השערה שהמשקלים יאפשרו למישהו אחר לבחון.
מה שהארכיטקטורה כן משיגה בפועל הוא פרופיל שירות. עשרים ושלושה מיליארד פרמטרים פעילים הם מודל שאפשר להריץ באופן סביר על מספר קטן יחסית של GPUs בהשהיה אינטראקטיבית, וזה מוצר שונה ממודל צפוף עם 501 מיליארד פרמטרים, למרות שהמספר על הכרטיס זהה. זו הסיבה ש-Reflection יכולה לדבר על הסקה בסמוך לחזית בלי לדבר על פריסה בקנה מידה של מרכז נתונים — ולמה שחרור המשקולות בסופו של דבר הוא האירוע שחשוב יותר ממפתח הבטא.
היכן Beam נוחת על הטבלאות של Reflection עצמה
כל נתון למטה הוא כפי שדווח על ידי הספק, מהטבלאות בפוסט ההשקה של Reflection, ואף אחד ממנו לא שוחזר באופן עצמאי. במקום שבו Reflection לא פרסמה מספר עבור מודל, התא מציג NR במקור. עמודות ההשוואה הן של Reflection, לא שלנו ולא של צד שלישי.
קידוד ועבודה בטרמינל
• Terminal-Bench v2.1 — Reflection Beam 80.1 מול GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6 ו-DeepSeek V4.1 Flash 90.6. Beam נמצא מתחת לכל אחד מהם.
• SWE-Bench Verified — Reflection Beam 80.9 לעומת Inkling 77.6 ו-Nemotron 3 Ultra 70.7. זה המקום שבו Beam נראה הכי חזק, אבל שים לב שרק שני המודלים החלשים ביותר ברשימה הורצו עליו.
SWE-Bench Pro v1 — Reflection Beam 65.5 מול Qwen 3.8-Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 לעומת Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. פער של עשר נקודות מהצמרת של הטבלה.
• DeepSWE v1.1 — Reflection Beam 44.4 מול DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen 3.8-Max 51.0, GLM 5.2 44.0. Beam נוחת באותה רמה כמו הדור הקודם ושלושים נקודות מאחורי המוביל.
• SWE Atlas Codebase QnA — Reflection Beam 34.6 לעומת Kimi K3 68.0 ו-GLM 5.3 61.0. להחזיק מאגר גדול בראש לאורך אינטראקציה ארוכה הוא הדבר הקשה ביותר ברשימה הזו, והנתון 34.6 של Beam אינו הבדל של עיגול.
חשיבה ומדע
• AIME 2026 — Reflection Beam 97.8 לעומת GLM 5.2 99.2 ו-Inkling 97.1.
• HLE ללא כלים — Reflection Beam 36.2 לעומת Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7. באמצע החבילה, ומקדים רק את שני הדגמים מהדור הקודם.
• GPQA Diamond — Reflection Beam 90.5 מול Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.
• SciCode — Reflection Beam 49.7 לעומת GLM 5.3 59.0, Kimi K3 58.7, Qwen 3.8-Max 52.1, DeepSeek V4.1 Flash 52.0.
• CriPT AA — Reflection Beam 16.3 מול Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
כלים, חיפוש והקשר ארוך
• MCP Atlas — Reflection Beam 78.7 לעומת Qwen 3.8-Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8.
• AutomationBench, פיצול ציבורי — Reflection Beam 37.0 לעומת DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2.
• בנקאות tau3 — Reflection Beam 38.0 לעומת Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• BrowseComp עם ניהול הקשר — Reflection Beam 77.4 לעומת Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.
• DeepSearchQA עם ניהול הקשר — Reflection Beam 80.1 לעומת Kimi K3 95.0.
AA-LCR — Reflection Beam 79.3 מול Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. שליפה בהקשר ארוך היא השורה היחידה ביכולת כללית שבה Beam תחרותי באמת ולא בינוני.
קראו את ארבע הטבלאות יחד ודפוס עקבי מתגלה: Beam מנצח את שני הדגמים מהדור הקודם ברשימה של Reflection ומפסיד לדגם הנוכחי, כמעט בכל שורה, בפערים שנעים מקטנים ועד פוסלים. ספק שמפרסם טבלאות שמציבות את הדגם שלו מאחור בכל כך הרבה שורות הוא סימן טוב לגבי יושרה של המעבדה. זה אינו סימן לכך שהדגם נמצא בחזית.

הקול העצמאי היחיד עד כה, ומה שהוא לא אומר
ההערכה היחידה של צד שלישי שתועדה היא זו של Artificial Analysis, שאמרה ב-5 באוקטובר כי Reflection העניקה לה גישה וכי היא עורכת בנצ'מרק עצמאי ל-Beam, והוסיפה כי אינדיקציות מוקדמות מצביעות על כך ש-Beam יהיה אחד המודלים הפתוחים החסכוניים ביותר בטוקנים שהיא ראתה ברמת האינטליגנציה שלו.
זו הצהרה משמעותית מהארגון שהאינדקס שלו הוא זה שרוב הקונים למעשה קוראים, והיא גם הצהרה בלי מספר בתוכה. נכון לבוקר זה אין שורת Beam בלוח המובילים של Artificial Analysis — עמודי המודלים מחזירים 404 ומטען לוח המובילים אינו כולל רשומת Beam — כך שהטענה ליעילות טוקנים היא, לעת עתה, הבטחה מצד צד שלישי שהוא יפרסם משהו. שום דבר באינדקס עדיין לא עבר חישוב מחדש על Beam.
גילוי ההדרכה, שהוא החלק החזק ביותר בהוצאה
החלק ההנדסי בפוסט של Reflection מכיל מספרים שרוב המעבדות שומרות לעצמן, וכדאי לתעד אותם, מפני שהם החלק מהשחרור שעדיין יהיה מעניין בעוד חודש.
• אימון מקדים — 23.8 טריליון טוקנים מאוצרים על 6,144 שבבי NVIDIA GB300 בארונות NVL72, הושלם מקצה לקצה בפחות מארבעה שבועות, בתפוקה אפקטיבית מדווחת של 92.3 אחוזים, עם תשע חזרות לאחור חצי-אוטומטיות לאורך הדרך, המיוחסות לעליות חדות בנורמת הגרדיאנט או לחשד לשחיתות נתונים שקטה.
• למידת חיזוק — 10,500 שבבי GB300 למשך ארבעה שבועות, יותר מ-100 מיליון רולאאוטים, הקשר רולאאוט מקסימלי של 256,000 טוקנים, בערך 1.3 מיליארד ארגזי חול וכמיליון סביבות נפרדות שנאספו עבור משימות קידוד, אג'נטיות ו-STEM.
• הגשה — משקלים חדשים הגיעו לצי ההסקה בחציון של כ-12 שניות, כאשר הפצה היררכית חתכה את התעבורה חוצת-הראקים ב-75 אחוזים והפכה את האימוץ בכל הצי למהיר פי 2.2 מאשר כל רפליקה שמושכת משקלים בעצמה.
• יציבות — גרדיאנטי מדיניות אסינכרוניים לחלוטין שנשארים יציבים מספרית כאשר לומדים מאינטראקציות בנות יממה, בתוספת קנס אורך ניתן לשליטה לאיזון בין אורך החשיבה לבין הציון ללא אימון מחדש.
• נתונים — כ-95 אחוזים מהטוקנים הגולמיים מהאינטרנט סולקו באמצעות פענוח, הסרת כפילויות ואוצרות, עם הטענה שמסננים קונבנציונליים היו מפספסים כ-1.8 טריליון מהטוקנים ש-Reflection שמרה, כולל 87 אחוזים מטוקני קוד הווב המאוצרים שלה.
שני משפטים ראויים לסימון. הפוסט אומר שאימון-ביניים (midtraining) מרחיב את ההקשר האפקטיבי של Beam ל-1 מיליון טוקנים, בעוד שתיעוד ה-API מפרט מגבלת שירות של 256,000 טוקנים עם הערת שוליים על בטא. אלה יכולת בצד האימון ומגבלה בצד השירות ולא סתירה, אבל הפער הוא בדיוק מה שהופך לכותרות של "1M context" אם אף אחד לא קורא את המסמך השני. ונתון ה-RL של יותר מ-100 מיליון רולאאוטים מוצג כאחת ההרצות הגדולות מסוגה של כל מעבדה פתוחה, וזו טענה על קנה מידה, לא על מה שקנה המידה הזה הניב — עקומת הציון מול הרולאאוטים היא של הספק עצמו והיא נעצרת במקום שבו הספק הפסיק לשרטט אותה.

מה אפשר לעשות עם Reflection Beam היום
דבר אחד: הצטרפו לרשימת ההמתנה ואם תקבלו מפתח, בצעו קריאה אל Beam-501B-A23B דרך נקודת הקצה הייעודית של Reflection עם לקוח בתצורת OpenAI. אין מחיר מפורסם, ולכן אין דרך למדל את העלות של עומס עבודה עליו. אין משקלים, ולכן אין אירוח עצמי, אין קוונטיזציה ואין שחזור על ידי צד שלישי. אין שורת בנצ'מרק עצמאית, ולכן כל תמונת הביצועים שלמעלה נשענת על הטבלאות של מעבדה אחת בלבד.
Reflection Beam אינו אחד מהמסלולים שלנו, ואנחנו לא מתכוונים לרמוז שהוא כן. מה שכן נוכל לתת לכם הוא המחיר של התחום שאליו הוא מנסה להיכנס, כפי שנקרא בזמן אמת מהקטלוג שלנו הבוקר: GLM 5.2 ב-$1.40 לקלט ו-$4.40 לפלט למיליון טוקנים, GLM 5.3 ב-$1.26 ו-$3.96, Qwen 3.8-Max ב-$2.00 ו-$6.00, ו-DeepSeek V4.1 Flash ב-$0.15 ו-$0.60. זהו פער של יותר מפי תשעה בין הזול ביותר ליקר ביותר בקלט בלבד — ולכן מודל בטא בלי מחיר מחירון הוא באמת קשה לשיבוץ לתוך החלטה, לא משנה כמה טוב נראה תרשים היעילות שלו.
OrcaRouter מריץ מפתח אחד תואם-OpenAI על פני אותם ארבעה ועוד יותר מ-200 מודלים אחרים, ומעביר הלאה את מחיר המחירון של הספק בלי להוסיף עליו דבר, כך ששינוי מחיר של ספק מתעדכן אצלנו כבר באותו יום ולא רק כשמשווק מחדש מרענן איזו טבלה. מעבר אוטומטי בעת תקלה הוא חלק מהניתוב ולא משהו שאתה בונה סביב כל ספק בנפרד, כלומר מודל שטרם הוכח — בלי יכולת שחזור, בלי ציון בלתי תלוי ובלי מחיר — הוא בדיוק מסוג הדברים שמפנים לנתח מהתעבורה במקום לנתיב הקריטי שלך.
כאשר הטענה הופכת לניתנת לבדיקה
שלושה דברים מכריעים את זה, ו-Reflection הכניסה שניים מהם בתוך החודש.
הראשון הוא המשקלים. Apache 2.0 בתוספת דוח טכני מאפשר לכל מי שיש לו כמה צמתים למדוד את הדבר שחשוב — טוקנים לשנייה ל-GPU ברף איכות קבוע, והאם 23 מיליארד פרמטרים פעילים באמת מספקים את הציון ל-FLOP שהתרשים מרמז עליו. עד אז טיעון היעילות הוא חשבון על מפית, וכל מי שחוזר על זה חוזר על הכיתוב של Reflection.
השני הוא מחיר. למודל בלי מחיר מחירון אין מקום בהשוואת עלויות. אם Beam ממוקם מעל לדרג של GLM ו-DeepSeek, סיפור החישוב מפסיק להיות משנה למי שיש לו תקציב; אם הוא ממוקם מתחת, התמונה משתנה במהירות.
השלישי הוא האינדקס. Artificial Analysis אמרה שהיא מבצעת בנצ'מרק על Beam ולא פרסמה מספר. כאשר השורה הזו תופיע, הוא יהיה הנתון הראשון בסיפור הזה ש-Reflection לא חישבה.
אם אתה צריך היום מתכנת אייג'נטי מוכשר, ואתה צריך לדעת כמה זה עולה, התשובה היא עדיין לא Reflection Beam. אולי בעוד שלושה שבועות. המודל ששווה להמר על טענת יעילות לגביו הוא זה שאפשר להוריד את המשקולות שלו ולספור בעצמך את ה-FLOPs שלו — ובמבחן הזה, Reflection נתנה לנו תאריך ורשימת המתנה, לא מודל.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
