
Reflection Beam מול Gemini 3.1 Pro Preview: אחד קורא וידאו, אחד קורא טקסט
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
נתחיל עם האסימטריה שאף טבלת בנצ'מרקים במפגש הזה לא מזכירה. Reflection Beam, שהוכרז ב-5 באוקטובר 2026, הוא מודל sparse mixture-of-experts עם 501 מיליארד פרמטרים, שבו 23 מיליארד פרמטרים פעילים לכל טוקן, והוא קולט טקסט ומחזיר טקסט. שום דבר אחר. Gemini 3.1 Pro Preview, המודל המולטימודלי המוביל של הספק מאז 19 בפברואר 2026, מקבל טקסט, תמונות, וידאו, אודיו וקבצים, והוא המודל היחיד בהשוואה הזו שבו לשאלה "האם הוא יכול לראות את הדבר שאני רוצה לשאול עליו" יש תשובה שונה לכל צד. כל השאר — יחסי הדלילות, חלונות ההקשר, רמות התמחור — הוא ויכוח. זו מפרט.
זה גם אומר שזהו הצמד הפחות סימטרי בקבוצה, והשימושי ביותר, מפני שהוא חושף לשם מה באמת נועדה השוואת מודלים. אם עומס העבודה שלך הוא טקסט, Beam ו-Gemini 3.1 Pro הם שתי אפשרויות על ספקטרום שנע מזול ולא מדוד ועד יקר ומדורג ביסודיות. אם עומס העבודה שלך כולל פריים של וידאו, אין מה להשוות.
מהו כל מודל
Gemini 3.1 Pro Preview הוא ספינת הדגל בדרגת ה-Preview של Google: 1,048,576 אסימונים של הקשר, פלט מרבי של 65,536 אסימונים, חמש מודאליות קלט, וחלון של מיליון אסימונים המושג דרך סולם מחירים ולא בתעריף אחיד. Google ממקמת אותו כמיועד להנדסת תוכנה משופרת, אמינות סוכנית משופרת ושימוש יעיל יותר באסימונים בתהליכי עבודה מורכבים. הוא אינו מודל במשקולות פתוחות. שמו עדיין כולל את "Preview", סטטוס ש-Google מחזיקה עבור המודל הזה מאז פברואר.
Reflection Beam הוא המודל הראשון של Reflection ותחילתה של סדרת משקולות פתוחות. חמש מאות ואחד מיליארד פרמטרים בסך הכל, 23 מיליארד פעילים — כ-4.6 אחוז מהמודל ער לכל טוקן. 23.8 טריליון טוקנים של אימון מקדים על 6,144 שבבי GB300 בפחות מארבעה שבועות, לאחר מכן קמפיין למידת חיזוק על 10,500 שבבי GB300 במשך ארבעה שבועות עם יותר מ-100 מיליון הרצות על פני כמיליון סביבות. ה-API שלו תואם OpenAI בכתובת api.reflection.ai/openai/v1 עם Chat Completions ורשימת מודלים, ההקשר שלו הוא 256,000 טוקנים עם הערת שוליים בטא, לפרמטר reasoning_effort שלו יש חמש רמות ואין מתג כיבוי, והמשקולות שלו מובטחות להמשך החודש תחת Apache 2.0.
• מודאליות — Gemini 3.1 Pro Preview קולט טקסט, תמונה, וידאו, אודיו וקובץ; Reflection Beam קולט טקסט בלבד.
• הקשר ופלט — 1,048,576 טוקנים בקלט ו-65,536 בפלט עבור Gemini, לעומת 256,000 בקלט ו-128,000 בפלט עבור Beam.
• מחיר — Gemini 3.1 Pro Preview ב-$2.00 קלט ו-$12.00 פלט למיליון טוקנים עד 200,000 טוקנים, עולה ל-$4.00 ו-$18.00 מעל זה, עם קריאות מטמון ב-$0.20; ל-Reflection Beam אין מחיר מפורסם.
• משטח הכלים — קריאה נייטיבית לכלים, פלטים מובנים ועיגון חיפוש בצד של Google; קריאה לכלים ופלטים מובנים בצד של Beam, עם נקודת קצה המוגבלת ל-Chat Completions.
• משקלים — קנייניים עבור Gemini; Apache 2.0 הובטח עבור Beam, טרם שוחררו.
• ציון עצמאי — ל-Gemini 3.1 Pro Preview יש מדד Artificial Analysis; ל-Beam אין שורה בלוח.
פער המודאליות הוא כל הטיעון
כדאי להיות קונקרטיים במקום לרמוז ל"רב-מודאלי", כי ההשלכות המעשיות ספציפיות.
עומס עבודה שקולט הקלטת מסך, תמונת מוצר, חוזה סרוק או קובץ אודיו של מוקד שירות אינו יכול להיות מטופל על ידי Beam בכל מחיר, עם כל פרומפט, בכל תוכנית. אין פתרון עוקף בשכבת ה-API: התיעוד של Beam מתאר מודאליות קלט אחת ומודאליות פלט אחת, ולא מפורט בו נתיב לתמונה או לאודיו. Gemini 3.1 Pro Preview מטפל בכל החמישה, מה שאומר שזה המודל היחיד כאן שאפשר להכניס לתוך זרימת עבודה שבה הקלט אינו כבר טקסט.
גם המקרה ההפוך ראוי לציון, כי זה המקרה שאנשים טועים בו. אם הקלט שלך הוא טקסט והוא יישאר טקסט, חמשת המודאליות של Gemini לא קונות לך דבר, ואתה משלם מחיר של מודל רב־מודאלי כדי להריץ עומס עבודה טקסטואלי. זו אינה טענה בעד Beam — זו טענה שיש להשיב על שאלת המודאליות לפני שאלת הבנצ'מרק, כי היא מבטלת אפשרויות בזול יותר ובאופן מהימן יותר מכל השוואת ציונים.
שתי תצוגות מקדימות, שתי משמעויות שונות
שני שמות הדגמים נושאים הסתייגות, וההסתייגויות אינן דומות זו לזו, וזה הדבר המעניין ביותר בשילוב הזה.
ה"Preview" של Gemini 3.1 Pro הוא מוסכמת שמות על מודל שניתן לקרוא לו באופן כללי מאז פברואר, עם ציון עצמאי, מחירון מפורסם הכולל שכבת הקשר ארוך מתועדת, ומשטח כלים מלא. בפועל, "preview" כאן משמעו שגוגל שומרת לעצמה את הזכות להחליף אותו, ולא שקשה להשיג אותו או שהוא ללא ציון.
הבטא של Beam היא שער של ממש. הגישה היא רשימת המתנה, מזהה המודל נוצר ב-5 באוקטובר 2026, אין מחירון, אין ציון של צד שלישי, והארטיפקטים שיאפשרו לכל אחד לאמת את הטענה המרכזית — משקלים, דוח טכני, כרטיס מודל — מובטחים ולא מסופקים. נתון ההקשר נושא הערת שוליים המזהירה שהוא עשוי להשתנות במהלך הבטא, וזהו סייג שאף מודל זמין באופן כללי לא זקוק לו.
ההשלכה אינה סימטרית באופן שיש לו משמעות לרכש. צוות שמאמץ את Gemini 3.1 Pro Preview נוטל על עצמו סיכון של תחלופה במודל. צוות שמאמץ את Beam היום נוטל על עצמו מחיר לא ידוע, ציון עצמאי לא ידוע, והיעדר יכולת להריץ את המודל בעצמו. אלה קטגוריות שונות של סיכון, והמחיר הוא זה שלרוב מכריע.

בנצ'מרקים, ובעיית הציטוט
טבלאות ההשקה של Reflection אינן כוללות את Gemini 3.1 Pro Preview או כל מודל של Google. מערך ההשוואה שלה הוא פתוח ופתוח-למחצה בלבד: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max ו-DeepSeek V4.1 Flash. כך ששני המודלים מעולם לא הורצו זה מול זה בטבלה שפורסמה, והנתונים שלהלן מגיעים מרנסים שונים משני הצדדים.
• מדד האינטליגנציה של Artificial Analysis — Gemini 3.1 Pro Preview רושם 29.7, ומדורג במקום ה-58 מתוך 147 בהרצה שלו. ל-Beam אין כלל שורת מדד.
• GPQA Diamond — Gemini 3.1 Pro Preview ב-94.1 לפי Artificial Analysis, לעומת 90.5 כפי שדווח על ידי הספק Beam.
• SciCode — 58.7 עבור Gemini לעומת 49.7 של Beam כפי שדווח על ידי הספק.
• Humanity's Last Exam — 47.0 עבור Gemini לעומת 36.2 כפי שדווח על ידי הספק של Beam, כאשר האחרון במפורש ללא כלים.
• Terminal-Bench v2.1 — 73.8 עבור Gemini לפי Artificial Analysis מול 80.1 כפי שדווח על ידי הספק של Beam. זו השורה החזקה ביותר של Beam בהתמודדות, והיא קציר מול מודל שנמצא בשוק מאז פברואר.
• אחזור הקשר ארוך — 82.0 עבור Gemini לעומת 79.3 המדווח על ידי הספק של Beam ב-AA-LCR.
• tau-squared Bench — 95.6 ל-Gemini לעומת 78.7 של Beam ב-MCP Atlas ו-38.0 ב-tau3 banking. אלו הערכות משיקות של שימוש בכלים סוכניים, לא אותה הערכה, ולהבדל בשם יש משמעות.
קיימת בעיית יושר נפרדת בצד של Gemini בטבלה הזו, שראויה למשפט משלה. ציוני אינדקס בלתי־תלויים עבור Gemini 3.1 Pro Preview צוטטו כ־30, 46, 47.7 ו־57 במקורות שונים, ו-Artificial Analysis מציגה גרסאות אינדקס שונות בעמודי מודלים שונים באותו רגע. הנתון 29.7 שלמעלה הוא זה שבעמוד שקראנו ב-6 באוקטובר 2026, והוא היחיד שנצטט — אבל כל מאמר שמציב מספר אינדקס בודד של Gemini לצד מתחרה בלי לומר מאיזו תמונת מצב הוא נלקח מציג מספר צף כקבוע. אותה זהירות חלה באופן הפוך על Beam, שבו אין תמונת מצב כלל.
מחיר, והדרגה שאיש לא מתכנן
Gemini 3.1 Pro Preview עולה $2.00 בקלט ו-$12.00 בפלט למיליון טוקנים עד 200,000 טוקנים, ו-$4.00 ו-$18.00 מעל זה. קריאות מטמון הן $0.20 למיליון וכתיבות מטמון $0.375. גבול השכבה הוא החלק שכדאי לתכנן סביבו: נקודת המכירה הבולטת של המודל היא חלון של 1,048,576 טוקנים, וברגע שבקשה חוצה 200,000 טוקנים תעריף הקלט מוכפל ותעריף הפלט עולה בחצי. עומס עבודה שתוכנן סביב חלון מיליון הטוקנים הוא אפוא עומס עבודה שמתומחר לפי השכבה השנייה ברוב התעבורה שלו, ולא לפי הראשונה.
ל-Beam אין כרטיס תעריפים, ולכן אין דרג לדמות ואין עם מה להשוות. היעדר זה אינו ניטרלי: פירושו שההצהרה הזולה ביותר שניתן להגן עליה בנוגע לעלות של Beam היא שהיא בלתי ידועה, והתמיכה הכמותית היחידה למיצוב היעילות שלה היא התרשים של Reflection עצמו, אשר מעריך FLOPs מיוצרים כמכפלה של פי שניים ממספר הפרמטרים הפעילים כפול מספר הטוקנים הממוצעים המיוצרים לכל ניסיון על פני DeepSWE, HLE ו-Terminal-Bench 2.1 — עם כיתוב המודה ש-prompt prefill, attention ו-serving overhead מוחרגים. בעומסי העבודה שבהם הקשר של מיליון טוקנים חשוב, prefill אינו שגיאת עיגול, והוא בדיוק האיבר שהנוסחה משמיטה.

שימוש בכלים, חיפוש והיכן שני העיצובים נבדלים
היתרונות המפורסמים של Gemini 3.1 Pro Preview הם הנדסת תוכנה, אמינות סוכנית ויעילות טוקנים, ומשטח הכלים המפורסם שלו כולל קריאה לפונקציות, פלטים מובנים ועיגון חיפוש. הפריט האחרון הוא זה שכדאי לשים לב אליו לכל מי שמשווה מערכות סוכנים: חיפוש מעוגן הוא יכולת צד ראשון מצד Google, והוא משנה את מה שסוכן המשתמש בכלים יכול לעשות ללא שירות אחזור חיצוני מחובר.
סיפור הכלים של Beam מעניין יותר ממה שמשתמע משורת מפרט, וקשה יותר להערכה. Reflection מדווחת על MCP Atlas בציון 78.7, AutomationBench הציבורי ב-37.0, tau3 banking ב-38.0, BrowseComp עם ניהול הקשר ב-77.4 ו-DeepSearchQA עם ניהול הקשר ב-80.1 — ומציינת שבמהלך למידת חיזוק המודל למד באופן אורגני לשאול מודלי שפה אחרים ולקרוא ל-API של OCR כאשר ניתן לו גישה לאינטרנט, למרות שמשימות גלישה נעדרו מתערובת האימון. אם ההכללה הזו מחזיקה, זהו אות אמיתי לגבי העברה אג'נטית. זה גם, בנקודה זו, תצפית ספק מהרצת אימון, ללא בדיקה בלתי תלויה.
בשורות השימוש בכלים שבהן לשני הצדדים יש מספרים, התמונה מעורבת ולא חד־צדדית. טבלת הספקים של Beam מציבה אותו לפני GLM 5.2 ב־MCP Atlas, ובאותה רמה כמו GLM 5.2 ו-Kimi K3 ב־tau3 banking, בעוד שנתון ה־tau-squared Bench של Gemini, 95.6, הוא המספר הסוכני הגבוה ביותר שכל אחד מהצדדים פרסם. חבילות שונות, מערכי בדיקה שונים, ואין הערכה משותפת — וזו הבעיה החוזרת בהשוואה הזו.
בחירה, וכיצד לגדר
כלל ההחלטה שנובע מהאמור לעיל פשוט מספיק כדי לנסח אותו בשורה אחת: אם קלט כלשהו אינו טקסט, Beam אינה אפשרות וההשוואה תמה. אם כל הקלט הוא טקסט, השאלה הופכת להיות האם טענת היעילות שאינה מיוחסת של Beam שווה מחיר לא ידוע והיעדר ציון עצמאי, לעומת מודל שעולה $2.00 ו-$12.00 עם סולם מתועד ומשטח כלים מלא.
Gemini 3.1 Pro Preview נמצא בקטלוג שלנו, כאשר תעריף המחירון של הספק מועבר כמו שהוא ובלי שום תוספת, מאחורי מפתח אחד תואם OpenAI בכתובת api.orcarouter.ai/v1 לצד יותר מ-200 מודלים אחרים — ואותו מפתח מגיש גם את המודלים ש-Beam מתחרה בהם במחיר, מ-GLM 5.3 ב-$1.26 ו-$3.96 ועד DeepSeek V4.1 Flash ב-$0.15 ו-$0.60, כפי שנקראו בזמן אמת הבוקר. מכיוון שהגבול בין השכבות ב-200,000 טוקנים הוא בעיית ניתוב ולא בעיית מודל, ה-DSL לניתוב מאפשר לך לבטא זאת ישירות: להשאיר בקשות קצרות בשכבה הזולה ולהצמיד את הארוכות באמת למקום שבו החלון הוא הסיבה שבחרת במודל, בקריאה אחת ולא בקוד האפליקציה.
Reflection Beam אינו אחד מהמסלולים שלנו, ולא נפנה אותך לאף אחד שטוען שיש לו אותו. אם משקלי Apache 2.0 יגיעו החודש כמובטח, אירוח עצמי הופך לאפשרות שלישית לעבודה בטקסט בלבד, וטענת היעילות הופכת לניתנת לבדיקה על החומרה שלך.

מה ישנה את התשובה
הטיעון של Beam נגד Gemini נשען על אותם שני דברים שכל השוואה של Beam נשענת עליהם, וההתמודדות הזו מוסיפה דבר שלישי.
מחיר. בלי מחיר, לא ניתן להמיר את טיעון היעילות להחלטת תקציב, והמודל מתחרה על בסיס תרשים ולא על בסיס כרטיס תעריפים.
ציון עצמאי. Artificial Analysis אמרה ב-5 באוקטובר ש-Reflection נתנה לה גישה ושהיא עורכת בנצ'מרק ל-Beam, ותיארה אינדיקטורים מוקדמים כמעידים ש-Beam יהיה אחד המודלים הפתוחים היעילים ביותר מבחינת טוקנים שהיא ראתה ברמת האינטליגנציה שלו. זהו המקור הנכון שאומר את הדבר הנכון, ועדיין אין שורה של Beam בלוח — דפי המודל מחזירים 404 וללוח המובילים אין רשומת Beam נכון להבוקר.
והדבר שלא משתנה: Beam הוא טקסט בלבד. שום שחרור משקלים, שום הורדת מחיר ושום ציון אינדקס לא משנה זאת, מה שאומר שעבור סוג שלם של עומסי עבודה ההשוואה הזו לעולם לא תהפוך להשוואה כלל. אם בצינור העיבוד שלך יש וידאו, התשובה הייתה Gemini 3.1 Pro Preview עוד לפני שהבנצ'מרק הראשון נטען.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
