
ريبليكشن بيم تطلق واجهة برمجية في النسخة التجريبية، والأوزان لا تزال بعيدة أسبوعين
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 150 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أول نموذج من Reflection يُسمى Reflection Beam، والأمر المثير للاهتمام بشأنه هذا الصباح ليس كونه موجودًا — بل أن نصفه فقط موجود. أعلنت الشركة عن Beam في 5 أكتوبر 2026 كنموذج خليط خبراء متناثر بإجمالي 501 مليار معامل و23 مليار معامل نشط لكل رمز، وأتاحت له في اليوم نفسه نقطة نهاية تجريبية متوافقة مع OpenAI. ومن المقرر إتاحة الأوزان في وقت لاحق من هذا الشهر بموجب رخصة Apache 2.0، إلى جانب تقرير تقني وبطاقة نموذج ومكدس الخدمة. وحتى تتوفر، فإن الأشخاص الوحيدين القادرين على تشغيل Beam-501B-A23B هم من تمنحهم Reflection مفتاح قائمة انتظار، وكل رقم أداء متداول يأتي من جداول المختبر نفسه.
هذا مكان غريب ليتوقف عنده الإطلاق، ويستحق أن نكون دقيقين بشأن أي نصفٍ بحوزتنا. لقد أطلقت Reflection نسخة معاينة يمكنك التسجيل للحصول عليها، ومجموعة من جداول القياس لم يكرّرها أحد. لكنها لم تُطلق الشيء الذي تشير إليه عبارة «open-weight» في العنوان.
ما الذي يُبَث مباشرةً فعلاً هذا الصباح
كل ما في هذا القسم مأخوذ من منشور مدونة Reflection ووثائقه الخاصة، وتمت قراءته في 6 أكتوبر 2026.
• معرّف النموذج — Beam-501B-A23B، أُنشئ في 5 أكتوبر 2026، ويُقدَّم على api.reflection.ai/openai/v1 مع Chat Completions وقائمة النماذج ولا شيء آخر.
• Shape — 501 مليار معامل إجمالي، 23 مليار معامل نشط لكل رمز، مما يعطي نسبة تنشيط تبلغ حوالي 4.6 في المائة. للمقارنة، يقع GLM 5.2 بالقرب من 5.4 في المائة.
• السياق — 256,000 توكن على API، مع حاشية مرتبطة بالرقم نفسه تحذّر من أن النافذة قد تتغير أثناء النسخة التجريبية. الحد الأقصى للإخراج هو 128,000 توكن.
• الاستدلال — معامل reasoning_effort بخمسة إعدادات: low وmedium وhigh وxhigh وmax. الإعداد الافتراضي هو medium، والنموذج يفكّر دائمًا. لا يوجد مفتاح إيقاف ولا وضع بدون استدلال.
• النمط — نص إلى نص. لا إدخال للصور أو الصوت أو الفيديو عند الإطلاق.
• السعر — غير منشور. فلا تحمله التدوينة، ولا تحمله الوثائق، وتقع لوحة تحكّم المنصّة خلف جدار تسجيل.
• الوصول — قائمة انتظار. لا يوجد مسار للخدمة الذاتية ولا توجد أوزان، لذا لا يوجد تنزيل، ولا تكميم، ولا ضبط دقيق.
سطر السعر هو الذي يغيّر طريقة قراءتك لكل ما عداه. أربعة من النماذج السبعة التي تُقارَن بها Beam في جداول Reflection الخاصة به لديها أسعار قائمة علنية يمكنك وضعها في جدول بيانات اليوم. أما Beam فليس لديها ذلك، لذا فإن أي ادعاء حول تكلفتها الآن هو ادعاء حول الحوسبة، وليس حول الدولارات.

الرقم الذي يتوقف عليه الإطلاق
تتمحور رسالة Reflection الترويجية حول كفاءة الاستدلال، وهي محددة على نحو غير معتاد في ما يعنيه ذلك: في اختبارات الاستدلال المتقدمة، يحقق Beam نتائج مماثلة لـ GLM 5.2 بينما يستخدم حوسبة استدلال أقل بمقدار 3 إلى 4 أضعاف. وتُوصف المكاسب بأنها أكبر بعد ذلك مقابل النماذج في فئة الـ2 تريليون معامل، حيث يقع Qwen 3.8-Max.
الرسم البياني وراء ذلك الادعاء يستحق قراءة متأنية، لأنه الدليل الذي يقوم عليه المنشور بأكمله. وهو يرسم درجة الاستدلال مقابل عمليات FLOPs المقدَّرة للاستدلال عبر DeepSWE وHumanity's Last Exam وTerminal-Bench 2.1، ويقدّر الـ FLOPs بأنها تساوي تقريبًا حاصل ضرب ضعف عدد المعاملات النشطة في متوسط عدد الرموز المولَّدة لكل محاولة. وتستبعد هذه الصيغة عمدًا التعبئة المسبقة للمطالبة، وعمليات الانتباه المعتمدة على السياق، وأعباء الخدمة — ويقول Reflection ذلك في التعليق أسفل الرسم. إنها مقارنة متسقة بين النماذج وليست قياسًا لفاتورة أي طرف، وهي أيضًا الدعم الكمي الوحيد لادعاء الكفاءة، وقد كتبها المختبر الذي بنى النموذج. تعامل معه كفرضية ستتيح الأوزان لشخص آخر اختبارها.
ما تجلبه هذه البنية عمليًا هو ملف خدمة. فثلاثة وعشرون مليار معامل نشط هو نموذج يمكن تشغيله بشكل معقول على عدد صغير نسبيًا من وحدات معالجة الرسومات بزمن استجابة تفاعلي، وهو منتج مختلف عن نموذج كثيف يضم 501 مليار معامل، حتى لو كان الرقم على البطاقة هو نفسه. ولهذا تستطيع Reflection الحديث عن استدلال قريب من الحدود دون الحديث عن نطاق مراكز البيانات — كما أن إطلاق الأوزان في نهاية المطاف هو الحدث الذي يهم أكثر من مفتاح النسخة التجريبية.
أين يستقر Beam على جداول Reflection الخاصة؟
كل رقم أدناه مُبلَّغ عنه من المورّد، من الجداول الواردة في منشور إطلاق Reflection، ولم يُعَد إنتاج أيٍّ منه بشكل مستقل. وحيث لم تنشر Reflection أي رقم لطراز ما، تظهر الخلية بالرمز NR في الأصل. أما أعمدة المقارنة فهي أعمدة Reflection، وليست خاصتنا ولا خاصة بطرف ثالث.
البرمجة والعمل في الطرفية
• Terminal-Bench v2.1 — Reflection Beam 80.1 مقابل GLM 5.2 81.0، وGLM 5.3 88.2، وKimi K3 88.3، وQwen 3.8-Max 86.6، وDeepSeek V4.1 Flash 90.6. ويقع Beam أدنى من كل واحد منها.
• SWE-Bench Verified — Reflection Beam 80.9 مقابل Inkling 77.6 وNemotron 3 Ultra 70.7. هنا يبدو Beam في أقوى حالاته، لكن انتبه إلى أن أضعف نموذجين فقط في القائمة هما اللذان جرى تشغيلهما عليه.
• SWE-Bench Pro v1 — Reflection Beam 65.5 مقابل Qwen 3.8-Max 67.7، GLM 5.2 62.1، Inkling 54.3، Nemotron 3 Ultra 46.4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 مقابل Kimi K3 88.2، وGLM 5.3 84.3، وInkling 56.9. فجوة بعشر نقاط عن صدارة الجدول.
• DeepSWE v1.1 — Reflection Beam 44.4 مقابل DeepSeek V4.1 Flash 74.2، وKimi K3 68.0، وGLM 5.3 61.0، وQwen 3.8-Max 51.0، وGLM 5.2 44.0. ويحلّ Beam في مستوى الجيل السابق، متخلفًا بثلاثين نقطة عن المتصدر.
• SWE Atlas Codebase QnA — Reflection Beam 34.6 مقابل Kimi K3 68.0 وGLM 5.3 61.0. إن الاحتفاظ بمستودع كبير في الذهن خلال تفاعل طويل هو أصعب شيء في هذه القائمة، و34.6 التي حققها Beam ليست مجرد فارق تقريب.
الاستدلال والعلوم
• AIME 2026 — Reflection Beam 97.8 مقابل GLM 5.2 بنتيجة 99.2 و Inkling 97.1.
• HLE بدون أدوات — Reflection Beam 36.2 مقابل Kimi K3 46.9، وQwen 3.8-Max 43.6، وGLM 5.3 42.3، وGLM 5.2 40.5، وDeepSeek V4.1 Flash 39.1، وInkling 29.7، وNemotron 3 Ultra 26.7. في منتصف المجموعة، ومتقدّم فقط على الطرازين من الجيل السابق.
• GPQA Diamond — Reflection Beam 90.5 مقابل Kimi K3 93.5، وQwen 3.8-Max 92.6، وGLM 5.3 91.7، وGLM 5.2 91.2، وDeepSeek V4.1 Flash 90.9.
• SciCode — Reflection Beam 49.7 مقابل GLM 5.3 59.0، وKimi K3 58.7، وQwen 3.8-Max 52.1، وDeepSeek V4.1 Flash 52.0.
• CriPT AA — Reflection Beam 16.3 مقابل Kimi K3 23.4، GLM 5.2 20.9، Qwen 3.8-Max 20.0، GLM 5.3 19.1، DeepSeek V4.1 Flash 14.3، Inkling 5.4، Nemotron 3 Ultra 3.1.
الأدوات والبحث والسياق الطويل
• MCP Atlas — Reflection Beam 78.7 مقابل Qwen 3.8-Max 84.5، وGLM 5.3 84.2، وKimi K3 82.3، وGLM 5.2 77.8.
• AutomationBench، Reflection 37.0 مقابل DeepSeek V4 54.8، GLM 5.3 48.6، Kimi K3 46.7، Qwen 3.8-Max 39.8 52.2.
• tau3 banking — Reflection Beam 38.0 مقابل Qwen 3.8-Max 55.2، GLM 5.2 37.1، Kimi K3 37.1.
• BrowseComp مع إدارة السياق — Reflection Beam 77.4 مقابل Kimi K3 91.2، وInkling 77.1، وNemotron 3 Ultra 44.4.
• DeepSearchQA مع إدارة السياق — Reflection Beam 80.1 مقابل Kimi K3 95.0.
• AA-LCR — Reflection Beam 79.3 مقابل Kimi K3 88.7، وDeepSeek V4.1 Flash 84.0، وQwen 3.8-Max 80.3، وGLM 5.3 79.7، وNemotron 3 Ultra 79.3، وGLM 5.2 78.3، وInkling 77.3. استرجاع السياق الطويل هو صف القدرات العامة الوحيد الذي يكون فيه Beam منافسًا حقيقيًا لا متوسط المستوى.
اقرأ الجداول الأربعة معًا، فيظهر نمط متسق: يتفوق Beam على النموذجين من الجيل السابق في قائمة Reflection ويخسر أمام النموذج الحالي، في كل صف تقريبًا، بفوارق تتراوح بين ضئيلة ومانعة من التأهل. إن مورّدًا ينشر جداول تضع نموذجه الخاص في مرتبة أدنى في هذا العدد الكبير من الصفوف هو علامة جيدة على أمانة المختبر. وهو ليس علامة على أن النموذج في الطليعة.

الصوت المستقل الوحيد حتى الآن، وما لا يقوله
التقييم الوحيد الموثّق من طرف ثالث هو Artificial Analysis، الذي قال في 5 أكتوبر إن Reflection منحته حق الوصول وإنه كان يقيس أداء Beam بشكل مستقل، مضيفًا أن المؤشرات المبكرة تشير إلى أن Beam سيكون أحد أكثر النماذج المفتوحة كفاءة في استخدام الرموز التي رآها بالنسبة إلى مستوى ذكائه.
هذا تصريح ذو مغزى من المنظمة التي يُعد مؤشرها المؤشر الذي يقرأه فعليًا معظم المشترين، وهو أيضًا تصريح لا يحتوي على أي رقم. حتى صباح هذا اليوم، لا يوجد صف لـ Beam على لوحة الصدارة الخاصة بـ Artificial Analysis — فصفحات النماذج تُرجع 404 ولا تحمل بيانات لوحة الصدارة أي إدخال لـ Beam — لذا فإن ادعاء كفاءة الرموز هو، في الوقت الحالي، وعد من طرف ثالث بأنه سينشر شيئًا. لم يُعَد حساب أي شيء في المؤشر على Beam بعد.
الإفصاح عن التدريب، وهو أقوى جزء في الإصدار
يحتوي القسم الهندسي في منشور Reflection على أرقام تحتفظ معظم المختبرات بها داخليًا، وهي جديرة بالتوثيق لأنها الجزء من الإصدار الذي سيظل مثيرًا للاهتمام حتى بعد شهر.
• التدريب المسبق — 23.8 تريليون رمز منسق على 6,144 شريحة NVIDIA GB300 في رفوف NVL72، اكتمل من البداية إلى النهاية في أقل من أربعة أسابيع، بمعدل إنتاجية صالحة مُبلَّغ عنه 92.3 في المائة، مع تسع عمليات إرجاع شبه تلقائية على طول الطريق تُعزى إلى ارتفاعات في معيار التدرج أو اشتباه في تلف صامت للبيانات.
• التعلم المعزز — 10,500 شريحة GB300 لمدة أربعة أسابيع، وأكثر من 100 مليون عملية تشغيل، وسياق تشغيل أقصى يبلغ 256,000 رمز، ونحو 1.3 مليار بيئة اختبار معزولة وما يقرب من مليون بيئة مميزة تم تجميعها لمهام البرمجة والوكلاء والعلوم والتكنولوجيا والهندسة والرياضيات.
• الخدمة — وصلت الأوزان الجديدة إلى أسطول الاستدلال في زمن وسيط قدره نحو 12 ثانية، مع خفض التوزيع الهرمي لحركة المرور العابرة للرفوف بنسبة 75 في المئة، وجعل الاعتماد على مستوى الأسطول أسرع بمقدار 2.2× من قيام كل نسخة طبق الأصل بسحب الأوزان بنفسها.
• الاستقرار — تدرجات سياسة غير متزامنة بالكامل تظل مستقرة عدديًا عند التعلم من تفاعلات مضى عليها يوم، بالإضافة إلى عقوبة طول قابلة للتحكم للمقايضة بين طول الاستدلال والنتيجة دون إعادة تدريب.
• البيانات — يتم استبعاد نحو 95 في المئة من رموز الإنترنت الخام عبر التحليل وإزالة التكرار والتنقية، مع الادعاء بأن المرشحات التقليدية كانت ستفوتها نحو 1.8 تريليون من الرموز التي احتفظت بها Reflection، بما في ذلك 87 في المئة من رموز الويب والكود المنتقاة الخاصة بها.
يستحق سطران أن يُرفع بشأنهما علم تنبيه. يقول المنشور إن التدريب الوسيط (midtraining) يوسّع السياق الفعّال لنموذج Beam إلى مليون رمز، بينما تُدرج وثائق واجهة البرمجة حدًّا للخدمة عند 256,000 رمز مع حاشية تفيد بأنها نسخة تجريبية. وهذان أمران لا يتناقضان: قدرة على جانب التدريب وحدّ على جانب الخدمة، لكن الفجوة بينهما هي بالضبط ما يتحوّل إلى عنوان "1M context" إن لم يقرأ أحد الوثيقة الثانية. ويُقدَّم رقم التعلّم المعزّز الذي يتجاوز 100 مليون عملية تنفيذ باعتباره واحدًا من أكبر هذه العمليات في أي مختبر مفتوح، وهو ادّعاء يتعلق بالحجم لا بما اشتراه هذا الحجم — فمنحنى النتيجة مقابل عمليات التنفيذ هو منحنى المورّد نفسه، ويتوقف عند النقطة التي توقف فيها المورّد عن رسمه.

ما يمكنك فعله باستخدام Reflection Beam اليوم
شيء واحد: انضم إلى قائمة الانتظار، وإذا حصلت على مفتاح، فاستدعِ Beam-501B-A23B عبر نقطة النهاية الخاصة بـ Reflection باستخدام عميل على غرار OpenAI. لا يوجد سعر معلن، لذا لا توجد طريقة لنمذجة تكلفة عبء عمل عليه. لا توجد أوزان، لذا لا توجد استضافة ذاتية، ولا تكميم، ولا إعادة إنتاج من طرف ثالث. لا يوجد صف اختبار أداء مستقل، لذا فإن صورة الأداء بأكملها أعلاه تستند إلى جداول مختبر واحد فقط.
Reflection Beam ليس أحد مساراتنا، ولن نُلمّح إلى أنه كذلك. ما يمكننا تقديمه لك هو سعر المجال الذي يحاول دخوله، مقروءًا مباشرةً من كتالوجنا الخاص هذا الصباح: GLM 5.2 بسعر 1.40 دولار للمدخلات و4.40 دولار للمخرجات لكل مليون رمز، وGLM 5.3 بسعر 1.26 و3.96، وQwen 3.8-Max بسعر 2.00 و6.00، وDeepSeek V4.1 Flash بسعر 0.15 و0.60. وهذا فارق يزيد على تسعة أضعاف بين الأرخص والأغلى في المدخلات وحدها — ولهذا يصعب حقًا إدراج نموذج تجريبي بلا سعر مُدرَج في قرار، مهما بدا مخطط كفاءته جيدًا.
يشغّل OrcaRouter مفتاحًا واحدًا متوافقًا مع OpenAI عبر تلك النماذج الأربعة وأكثر من 200 نموذج آخر، وتمرير سعر القائمة الخاص بالمزوّد دون إضافة أي شيء، بحيث يصبح أي تغيير في سعر البائع ساريًا لدينا في نفس اليوم بدلاً من أن يحدث ذلك كلما قام أحد الموزّعين بتحديث جدول. يُعدّ التجاوز التلقائي للفشل جزءًا من التوجيه بدلاً من كونه شيئًا تبنيه حول كل مزوّد، مما يعني أن نموذجًا غير مُثبت — بدون إمكانية إعادة إنتاجه، ولا تقييم مستقل، ولا سعر — هو بالضبط النوع الذي تضعه على حصة من حركة المرور بدلاً من مسارك الحرج.
عندما يصبح الادعاء قابلاً للاختبار
ثلاثة أمور تحسم هذا، وقد وضع Reflection اثنين منهما داخل الشهر.
الأول هو الأوزان. يتيح Apache 2.0 بالإضافة إلى تقرير فني لأي شخص لديه عقدتان أن يقيس ما يهم — التوكنات في الثانية لكل GPU عند معيار جودة ثابت، وما إذا كانت 23 مليار معامل نشط تحقق فعلاً النتيجة لكل FLOP التي يوحي بها الرسم البياني. وحتى ذلك الحين، فإن حجة الكفاءة ليست سوى حسابات على منديل، وكل من يكرّرها إنما يكرّر تعليق Reflection.
العامل الثاني هو السعر. نموذج بلا سعر معلن لا مكان له في مقارنة تكاليف. إذا جاء Beam فوق فئة GLM وDeepSeek، فإن قصة الحوسبة تكفّ عن كونها مهمة لأي شخص لديه ميزانية؛ وإذا جاء دونها، تتغير الصورة بسرعة.
الثالث هو المؤشر. قالت Artificial Analysis إنها تُجري تقييمًا مرجعيًا لـ Beam ولم تنشر أي رقم. وعندما يظهر ذلك الصف، سيكون أول رقم في هذه القصة لم تحسبه Reflection.
إذا كنت بحاجة اليوم إلى مبرمج وكيلي قادر، وتريد أن تعرف تكلفته، فالجواب ليس Reflection Beam بعد. قد يكون بعد ثلاثة أسابيع. النموذج الذي يستحق ادعاء الكفاءة المراهنةَ عليه هو النموذج الذي يمكنك تنزيل أوزانه وعدّ الـFLOPs الخاصة به بنفسك — وفي هذا الاختبار، أعطتنا Reflection موعدًا وقائمة انتظار، لا نموذجًا.
مقارنات في هذه المقالة3
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
