
Reflection Beam לעומת Kimi K3: אותו שם בנצ'מרק, שתי רתמות שונות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Reflection Beam משיגה 80.1 ב-Terminal-Bench 2.1. Kimi K3 משיגה 88.3. העמידו את שני הנתונים זה לצד זה, כפי שעושה רוב הסיקור של השבוע, ותסיקו ש-Beam נמצאת בפער של כשמונה נקודות מהמודל הפתוח הטוב ביותר בתחום. אבל שני המספרים האלה לא מגיעים מאותו חדר. הציון 80.1 של Beam מדווח על ידי הספק, ונלקח מהטבלה בפוסט ההשקה של Reflection עצמה. הציון 88.3 של Kimi K3 גם הוא מדווח על ידי הספק, הפעם מהטבלה של Moonshot עצמה — והטבלה של ספק מציגה את הציון של המתחרה רק כאשר הוא הורץ בהרנס של אותו ספק, תחת סט הפרומפטים של אותו ספק, ובהגדרת המאמץ של אותו ספק. צד שלישי, Artificial Analysis, הריץ מאז את Kimi K3 על בנצ'מרק באותו שם ופרסם 85.0. זהו פער של 4.9 נקודות, לא 8.2 — וכיוון התיקון צפוי לחלוטין, מפני שהמספר שנשחק הוא תמיד זה שהגיע מהמעבדה עם משהו להוכיח.
זו כל הבעיה עם ההשוואה שהכותרת של המאמר הזה מבטיחה, וזו הסיבה שהקטע הזה מקדיש את המחצית הראשונה שלו למקור ולא לציונים. Reflection Beamהוא מודל mixture-of-experts דליל עם 501 מיליארד פרמטרים, שבו 23 מיליארד פרמטרים פעילים לכל טוקן, שהוכרז ב-5 באוקטובר 2026 על ידי Reflection AI, עם נקודת קצה תואמת OpenAI בגרסת בטא שפעילה באותו יום. Kimi K3הוא מודל הדגל הפתוח של Moonshot AI, הרשום בקטלוג שלנו עם תאריך שחרור של 15 ביולי 2026, וקיבל ציון בלתי תלוי מ-Artificial Analysis. אחד מהם הוא מוצר זמין עם מחירון והרצת harness של צד שלישי; האחר הוא בטא ברשימת המתנה שהמשקלים, הדוח הטכני והמחיר שלה טרם קיימים. השוואה ביניהם אינה תרגיל סימטרי, והעמדת פנים אחרת תייצר עמוד שנראה מדויק ושהוא שגוי.
הגרסה בת 30 השניות
• Beam מהיר יותר לכל FLOP על הנייר, אינו מתומחר בפועל, ולא שוחזר. Kimi K3 נמדד על ידי צד שלישי, מתומחר ב-3.00 דולר לקלט ו-15.00 דולר לפלט למיליון טוקנים, וזמין באופן כללי.
• במדד היחיד ששניהם הורצו עליו — Terminal-Bench 2.1 — הפער האמיתי הוא כחמש נקודות, לא שמונה, ברגע שהמספרים של כל צד מגיעים מהרנס ניטרלי.
• היתרונות האמיתיים של Beam הם מבניים, לא מספריים: פרופיל הגשה עם 23B פרמטרים פעילים ורישיון Apache 2.0 מובטח. אף אחד מהם אינו שמיש כיום.
• אם אתה צריך מודל השבוע, זה לא הימור. זה מודל אחד שנשלח ורשימת המתנה אחת.
מה Reflection למעשה פרסם, ונגד מי
פוסט ההשקה של Reflection מציג לוח תוצאות אחד מול שבעה מודלים אחרים: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max ו-DeepSeek V4.1 Flash. כל נתון בטבלה מדווח על ידי הספק, אף אחד מהם לא שוחזר באופן בלתי תלוי, ואין עמוד Artificial Analysis עבור Reflection Beam — עמוד המודל מחזיר 404 באתר שלהם נכון ל-6 באוקטובר 2026. כמה תאים במקור מסומנים NR משום שהמודל לא הורץ.
הנה כל הקטע של Beam מול K3 מהטבלה ההיא, שורה אחת לכל ממד:
• Terminal-Bench 2.1 — Beam 80.1 לעומת Kimi K3 88.3
• SWE-Bench Pro v2-Hard — Beam 77.2 לעומת Kimi K3 88.2
• DeepSWE v1.1 — Beam 44.4 מול Kimi K3 68.0
• שו״ת על בסיס הקוד של SWE Atlas — Beam 34.6 לעומת Kimi K3 68.0
• HLE, ללא כלים — Beam 36.2 מול Kimi K3 46.9
• GPQA Diamond — Beam 90.5 לעומת Kimi K3 93.5
• SciCode — Beam 49.7 לעומת Kimi K3 58.7
• MCP Atlas — Beam 78.7 לעומת Kimi K3 82.3
• BrowseComp עם ניהול הקשר — Beam 77.4 לעומת Kimi K3 91.2
• DeepSearchQA עם ניהול הקשר — Beam 80.1 לעומת Kimi K3 95.0
קראו את הרשימה הזו ביושר, וצורת ההשקה מתגלה. Reflection אינה טוענת לניצחון על K3 בשום מקום. היא טוענת להגיע קרוב לראש הדרג, תוך שהיא מוציאה שלוש עד ארבע פעמים פחות כוח חישוב להסקה מ-GLM 5.2 בציוני חשיבה דומים — והשורה היחידה שבה שני המודלים קרובים, Terminal-Bench 2.1, היא השורה שבה ההשוואה היא הפחות מהימנה.
למה הרתמה חשובה יותר מהציון
שם של בנצ'מרק הוא תווית, לא מפרט. Terminal-Bench 2.1 פירושו קבוצה מסוימת של משימות שרצות תחת שלד סוכן מסוים, עם מדיניות ניסיונות חוזרים מסוימת, תקציב טוקנים מסוים והגדרת מאמץ חשיבה מסוימת. שתי מעבדות יכולות שתיהן לדווח ביושר על נתון "Terminal-Bench 2.1" ולהפיק מספרים שאינם ברי השוואה, כי השלד והגדרת המאמץ הם המקום שבו נמצאת רוב השונות. Artificial Analysis קיימת כארגון בדיוק בגלל זה: היא מריצה הרנס אחד, בתצורה אחת, על פני מודלים רבים, כך שאפשר לחסר את המספרים שלה זה מזה.
אז ה-80.1 ש-Reflection מדפיסה עבור Beam הוא מספר ספק בהרנס של ספק, וה-88.3 שהיא מדפיסה עבור K3 הוא גםמספר ספק — כשהספק הוא Reflection, שמודדת את המתחרה של עצמה. הנתון השני הוא המספר הפחות אמין בשורה: למעבדה שמריצה משקולות של מתחרה על התשתית של עצמה אין תמריץ להריץ אותן בתצורה הטובה ביותר של המתחרה, ואין לה חובה לחשוף את זו שהיא בחרה. אין בכך שום חוסר יושר; זה פשוט מספר שהמקור שלו אינו מצדיק את המשקל שהסיקור שם עליו.
ההרצה של Artificial Analysis עצמה מציבה את Kimi K3 על 85.02 ב-Terminal-Bench 2.1, לצד 12.6 ב-Terminal-Bench v4.0 — מבחן שונה וקשה יותר — AA Coding Index של 76.2 (מקום 9 מבין המודלים בלוח), Intelligence Index של 43.6, GPQA Diamond 93.5, HLE 46.9, SciCode 59.5, tau-banking 45.98 ו-Long-Context Recall של 88.7. אלה נלקחים מכרטיס הקטלוג של K3 במערכת שלנו, עם מקור ב-artificialanalysis.ai, כשתמונת המצב של ההערכה מתוארכת ל-15 ביולי 2026. ל-Beam יש מספר אחד ביקום של הרשימה הזו, והוא מגיע מ-Reflection. ההיעדרות הזו אמורה להיות זמנית ולא קבועה: Artificial Analysis מסרה ש-Reflection העניקה לה גישה ושהיא מבצעת בנצ'מרק למודל, והניסוח המוקדם שלה עצמה — ש-Beam "יהיה אחד המודלים הפתוחים החסכוניים ביותר בטוקנים שראינו עבור רמת האינטליגנציה שלו" — הוא בית בנצ'מרקים שמאותת על ציפייה, ולא מדווח על תוצאה. עד שהציון הזה יודפס, המספרים של המאמר הזה אינם ניתנים לגריעה, ולא בכוונתנו להעמיד פנים אחרת.

כמה עולה כל אחד, ומה כל אחד הוא
השוואת העלויות אינה צמודה, ולמעשה אין זו כלל השוואה, משום שצד אחד שלה ריק.
• מחיר — Kimi K3: $3.00 קלט / $15.00 פלט למיליון טוקנים, עם קריאות מטמון ב-$0.30, לעומת Reflection Beam: אין מחיר מפורסם בשום מקום בבלוג של Reflection, בתיעוד או ברשימת המודלים, כשקונסולת הפלטפורמה נמצאת מאחורי חומת הרשמה.
• הקשר — 1,048,576 טוקנים ב-Kimi K3 לעומת 256,000 ב-Beam בטא, עם הערת שוליים בתיעוד של Beam עצמה שנוסחה כך: "חלון ההקשר עשוי להשתנות במהלך הבטא."
• מודאליות — Kimi K3 מקבל טקסט ותמונות; Reflection Beam הוא טקסט-נכנס, טקסט-יוצא, ללא נתיב לתמונות או לשמע בהשקה.
• זמינות — Kimi K3 זמין באופן כללי היום; Reflection Beam הוא בטא ברשימת המתנה, כשהמשקלים מובטחים להמשך אוקטובר תחת רישיון Apache 2.0.
• ציונים עצמאיים — ל-K3 יש שורת Artificial Analysis מלאה; ל-Beam אין.
• פרופיל הגשה — Kimi K3 הוא מודל פרונטיאלי גדול וצפוף-למדי, עם 46.8 אסימוני פלט לשנייה לפי מדידה שלנו ב-playground במהלך השבוע האחרון; 23B הפרמטרים הפעילים של Beam הם טיעון ארכיטקטוני אמיתי לטובת השהיה נמוכה יותר ועלות נמוכה יותר לכל אסימון, אך אין נקודת קצה פתוחה לציבור שעליה ניתן למדוד אותו.
הטענת היעילות ראויה לעוד משפט אחד של זהירות, מפני שהיא הכותרת של ההשקה והיא עושה יותר עבודה ממה שהיא יכולה לשאת. ההצהרה של Reflection, "מחשוב הסקה קטן פי 3 עד 4", מגיעה מתרשים שמקרב FLOPs כפעמיים מספר הפרמטרים הפעילים כפול המספר הממוצע של הטוקנים שנוצרים. הנוסחה הזו מוציאה במכוון מחוץ לחשבון את מילוי הפרומפט המקדים, את עלות הקשב ואת תקורת ההגשה — החלקים בחשבון ששולטים בעבודה סוכנית עם הקשר ארוך. זהו אומדן גס של מחשוביחס, לא מדידה, לא סכום בדולרים, והוא נבנה על ידי הספק. התייחסו אליו כאל השערה שהמשקלים יאפשרו למישהו אחר לבחון אותה.
איפה OrcaRouter ממוקם בזה
Kimi K3 הוא אחד מהנתיבים שלנו. הוא מוצע במחיר של $3.00 לקלט ו-$15.00 לפלט למיליון טוקנים עם קריאות מטמון ב-$0.30, שזה תעריף הספק של Moonshot שמועבר הלאה בלי שום תוספת — כך שאם Moonshot משנה את מחירון התעריפים שלה, הנתון בעמוד שלנו משתנה באותו יום ולא מתי שמשווק מרענן. ניתן לקרוא לו באמצעות מפתח אחד תואם OpenAI לצד יותר מ-200 מודלים אחרים, וזה חשוב כאן מסיבה ספציפית: התשובה הכנה לשאלה "Beam או K3?" היא שצוות שמפזר סיכונים לא צריך לבחור. מכיוון שמעבר אוטומטי במקרה כשל הוא חלק מהניתוב ולא משהו שאתם בונים, מודל כמו Beam — בטא, ללא תמחור, ללא דירוג על ידי שום צד שלישי — הוא בדיוק הדבר ששמים על חלק מהתעבורה ולא על הנתיב הקריטי שלכם. אתם מנתבים את העבודה ל-K3 כברירת מחדל, שולחים ל-Beam פרוסה כשההזמנה שלכם מרשימת ההמתנה מגיעה, ונותנים לניתוב לחזור ל-K3 במקרה של שגיאה. זו החלטה שאפשר לקבל לגבי מודל לא מוכח. להמר על נתיב ייצור על אחד כזה זה לא.

מה היה משנה את פסק הדין הזה?
שלושה דברים, בסדר יורד של מידת חשיבותם.
מחיר. הנחיתה של Beam מתחת לדרגת K3 תהפוך את טיעון היעילות למוחשי במקום תיאורטי. שנית, המשקלים. Apache 2.0 בתוספת דוח טכני יאפשר לכל מי שיש לו כמה צמתים למדוד טוקנים לשנייה לכל GPU ברף איכות קבוע — הבדיקה שבאמת מכריעה טענת מחשוב. שלישית, הרצת רתמה של צד שלישי. Reflection העניקה ל-Artificial Analysis גישה, וציון צפוי לצאת מכך; עד שהמספר הזה יודפס, כל נתון של Beam מול K3 שנמצא בתפוצה מתחקה אחרי מסמך שנכתב בידי אחד משני הספקים.
שתי שאלות ששווה לענות עליהן ישירות
האם Reflection Beam טוב יותר מ-Kimi K3?
על פי הראיות הזמינות כיום, לא — ואיש לא פרסם ראיות שזה כך. בטבלה של Reflection עצמה K3 מוביל בכל עשרת השורות המשותפות שלמעלה, כמה מהן בפערים (SWE Atlas 34.6 לעומת 68.0, DeepSearchQA 80.1 לעומת 95.0) שאינם צמודים. הטיעון של Beam הוא עלות ליחידת יכולת, והטיעון הזה הוא תרשים שצייר ספק עד שיהיו משקולות ומחיר.
האם כדאי לי להמתין למשקולות של Beam לפני שאני בונה על K3?
רק אם אירוח עצמי הוא דרישה ולא העדפה, מפני שזהו הציר היחיד שבו השניים אינם תחליפים — K3 הוא API בלבד בעוד Beam מבטיח משקלים ב-Apache 2.0. אם אתם קוראים ל-API, K3 זמין, עם ציונים ומחירים, ו-Beam הוא רשימת המתנה. אין שום גרסה של ההחלטה הזו ששווה לעכב בגללה פרויקט.

Reflection נתנה לנו תאריך ותרשים, ותאריך אינו מודל. הדבר היחיד שההשקה אכן מבססת הוא שמודל 501B המפעיל 23B פרמטרים יכול להתאמן כך שיהיה בטווח של כמה נקודות מהחזית הפתוחה — וזה, אם המשקלים יגיעו והמספרים יחזיקו מעמד, תוצאה משמעותית בנוגע ליעילות. זה עדיין לא סיבה להעביר עבודה ממודל שצד שלישי מדד אותו בפועל.
