بطاقة hero مُولّدة بعنوان «Reflection Beam: 501B معامل، 23B نشط»، مع سطر فرعي «MoE متناثر / 23.8T توكن تدريب مسبق / سياق API بحجم 256K توكن / أوزان موعودة هذا الشهر / كل رقم وفق ما أبلغ عنه المورّد». تظهر أسفل النص ثلاث أيقونات خطية مسطحة: مخطط طبقات متراكبة معظم طبقاته باهتة وواحدة مُبرزة، ورف من تسع لبنات خوادم، ومخطط مستند مع قفل صغير. شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

شرح Reflection Beam: 501B معامل، و23B نشط، وأوزان لم تصدر بعد

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 5 أكتوبر 2026، أعلنت Reflection عن Reflection Beam، نموذج لغوي متناثر قائم على مزيج الخبراء بإجمالي 501 مليار معلمة، يُنشّط 23 مليارًا منها لكل رمز، وأطلقت في نفس اليوم نقطة نهاية تجريبية متوافقة مع OpenAI. وهذا يعني أن 4.6 بالمائة من النموذج نشطة في أي لحظة — وهي نسبة عدوانية حتى بمعايير مجال الأوزان المفتوحة الحالي — وهو الرقم الذي يتوقف عليه الإطلاق بأكمله. تقول Reflection إن الأوزان الكاملة والتقرير الفني وبطاقة النموذج ستأتي في وقت لاحق من هذا الشهر تحت رخصة Apache 2.0. وحتى اليوم، لم تصل بعد، ولم يُنشر أي سعر في أي من مواقع Reflection الخاصة، ولا يوجد لدى Artificial Analysis أي صف لهذا النموذج. لذا فإن الملخص الصادق لهذا الإطلاق هو: ادعاء محدد للغاية حول الكفاءة، قدمه المختبر الذي درب النموذج، مع كل رقم داعم قدمه ذلك المختبر.

تضع جداول المقارنة الخاصة بـ Reflection نموذج Reflection Beam في مواجهة Inkling، Nemotron 3 Ultra، GLM 5.2، GLM 5.3، Kimi K3، Qwen3.8 Max وDeepSeek V4.1 Flash، وهو صورة عادلة للفئة التي يستهدفها: نماذج مفتوحة وشبه مفتوحة قوية لكنها ليست في الطليعة، ويبلغ حجم بعضها جزءاً صغيراً من حجم Beam. لا يتفوق Beam على هذا الميدان في القدرة الخام، وسنوضح لك بالضبط أين يخسر. ما يدّعي أنه يفعله هو أن يحلّ قرب قمة هذا الميدان، مع استهلاك حوسبة استدلالية أقل بنحو ثلاث إلى أربع مرات من GLM 5.2 عند درجات استدلال مماثلة. هذا الادعاء هو المقال.

ما الذي يوجد فعليًا اليوم

كل ما في هذا القسم مأخوذ من وثائق Reflection الخاصة، وقد اطُّلعت عليها في 6 أكتوبر 2026. واجهة API متاحة الآن في نسخة بيتا خلف قائمة انتظار؛ أما الأوزان فلم تصدر بعد.

• مُعرّف الطراز — Beam-501B-A23B، أُنشئ في 5 أكتوبر 2026.

• الواجهة — واجهة متوافقة مع OpenAI على api.reflection.ai/openai/v1، تكشف عن Chat Completions وقائمة Models، ولا شيء آخر. لا Completions، ولا embeddings، ولا batches.

• السياق — 256,000 رمز، مع حاشية سفلية مرفقة بالرقم نفسه: «قد تتغير نافذة السياق أثناء النسخة التجريبية». الحد الأقصى للإخراج هو 128,000 رمز.

• الاستدلال — معامل reasoning_effort بخمس قيم: low وmedium وhigh وxhigh وmax. القيمة الافتراضية هي medium، ويستدل النموذج دائمًا بغض النظر عن الإعداد — لا يوجد مفتاح إيقاف.

• الوسائط — نص مدخل ونص مخرج. لا إدخال للصور أو الصوت عند الإطلاق، وهو فرق حقيقي عن Inkling، النموذج الذي يضع تعدد الوسائط أولًا، والذي أطلقته Thinking Machines، الشركة التي أسستها Mira Murati، في يوليو.

• تاريخ انتهاء المعرفة — 30 يونيو 2026.

• السعر — غير مُعلن. لا تذكره تدوينة Reflection ولا وثائقه ولا قائمة طرازه، ولوحة تحكم المنصة تقع خلف جدار تسجيل.

هذا السطر الأخير أهم مما يبدو. كل نموذج آخر في مجموعة مقارنة Beam لديه سعر مدرج علني يمكنك إدخاله في جدول بيانات اليوم. أما Beam فليس لديه ذلك، ما يعني أن أي جدال حول تكلفته الآن هو جدال حول الحوسبة، وليس حول الدولارات.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

نسبة 501 إلى 23 هي الحجة

التناثر ليس جديدًا؛ السؤال هو إلى أي مدى يستعد مختبر لدفعه. يشغّل GLM 5.2 حوالي 40 مليار معامل نشط من إجمالي يُذكر أنه في حدود 744 مليار — أي نحو 5.4 في المائة. يستقر Reflection Beam عند 4.6 في المائة من 501 مليار. على الورق، هذه خطوة إضافية متواضعة، وReflection حذِر بشأن ما يدّعيه له.

رقم الكفاءة في منشور الإطلاق يأتي من مخطط مبني على بيانات Artificial Analysis وDataCurve، يرسم درجة الاستدلال مقابل تقديرات FLOPs للاستدلال، حيث تُقدَّر FLOPs على أنها ضعف عدد المعاملات النشطة مضروبًا في متوسط عدد الرموز المولدة. هذه الصيغة تستبعد عمدًا التعبئة المسبقة للمطالبة، وتكلفة الانتباه، والنفقات العامة للخدمة. إنه نموذج تقديري سريع، وليس قياسًا، ولا تقدمه Reflection على هذا النحو — لكنه أيضًا الدعم الكمي الوحيد لادعاء "أرخص بثلاث إلى أربع مرات عند نفس الدرجة"، وقد كتبه المورّد. اعتبره فرضية، فالأوزان، عندما تصدر، ستتيح لشخص آخر اختبارها.

ما تحققه هذه البنية عمليًا هو ملف تعريف خدمة. إن امتلاك ثلاثة وعشرين مليار معامل نشط يعني نموذجًا يمكن تشغيله على عدد صغير نسبيًا من وحدات معالجة الرسوميات بزمن استجابة تفاعلي، وهذا منتج مختلف عن نموذج كثيف بـ501 مليار معامل حتى لو كان عدد المعاملات على البطاقة هو نفسه. وهذا هو السبب الذي يتيح لـ Reflection الحديث عن استدلال يقترب من الحدود المتقدمة دون الحديث عن نشر بحجم مركز بيانات.

في أقل من أربعة أسابيع للتدريب المسبق، والإفصاح محدد على نحو غير معتاد

يُعدّ تقرير التدريب الجزء الأكثر إفادة في الإصدار، إذ نشرت Reflection أرقامًا تُبقيها معظم المختبرات داخلية.

• التدريب المسبق — 23.8 تريليون رمز على 6,144 شريحة GB300 في رفوف NVL72، اكتمل في أقل من أربعة أسابيع بمعدل إنتاجية فعّالة مُبلَّغ عنه 92.3 في المائة، مع تسع عمليات إرجاع من نقاط التحقق على طول الطريق.

• التعلم المعزز — 10,500 شريحة GB300 لمدة أربعة أسابيع، أكثر من 100 مليون عملية تدحرج، الحد الأقصى لسياق التدحرج 256,000 رمز، حوالي 1.3 مليار صندوق رمل وحوالي مليون بيئة مميزة، بمتوسط 110,000 عملية تدحرج تعمل بشكل متزامن.

• التدريب الأوسط — يوسّع السياق الفعّال للنموذج إلى مليون رمز.

• الاستقرار — تدرجات سياسة غير متزامنة تظل مستقرة مع تقادم على مقياس الأيام، بالإضافة إلى عقوبة طول قابلة للتحكم بحيث يمكن ضبط طول الاستدلال دون إعادة التدريب.

اقرأ سطري التدريب المسبق والتعلم المعزز (RL) معًا، فتظهر ملامح الادعاء. فحكاية الكفاءة لا تتعلق فقط بالمعاملات النشطة عند الاستدلال؛ بل تتعلق أيضًا بمدى سرعة تدريب النموذج، وبمقدار الحوسبة التي ذهبت إلى التعلم المعزز المرتبط بالبيئة بدلًا من مزيد من الرموز. إن مليون بيئة و1.3 مليار صندوق رمل هي عبارة عن تصريح حول البنية التحتية لاستخدام الأدوات والتدريب الوكيلي، وهي تتوافق مع المعايير المرجعية التي اختارت Reflection أن تتصدر بها.

رقم واحد يستحق الإشارة. تقول المدونة إن التدريب المتوسط يوسع السياق الفعّالإلى مليون رمز؛ وتُدرج وثائق واجهة برمجة التطبيقات حدًا للخدمة يبلغ 256,000 رمز مع حاشية بيتا مرفقة. هذه قدرة من جهة التدريب وحد من جهة الخدمة، وليس تناقضًا — لكن الفجوة هي بالضبط النوع الذي يصبح عنوانًا "سياق 1M" إذا لم يقرأ أحد المستند الثاني، ومن يكتب عن Beam الأسبوع المقبل عليه أن يقرأ المستند الثاني.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

مقاييس الأداء: أين يتفوق Reflection Beam، وأين لا

كل رقم أدناه مُبلَّغ عنه من المورّد، من الجداول في منشور إطلاق Reflection، ولم يُعَد إنتاج أي منه بشكل مستقل. أعمدة المقارنة هي الأرقام نفسها التي نشرتها Reflection للنماذج الأخرى؛ وحيث تُظهر خلية "NR" في الأصل، لم يتم تشغيل النموذج. لا يوجد صف لـ Beam في Artificial Analysis، لذا لم يخضع أي شيء هنا لأداة اختبار تابعة لطرف ثالث.

البرمجة الوكيلية

• Terminal-Bench v2.1 — Beam 80.1 مقابل GLM 5.2 81.0، GLM 5.3 88.2، Kimi K3 88.3، Qwen3.8 Max 86.6، DeepSeek V4.1 Flash 90.6، Inkling 63.8، Nemotron 3 Ultra 56.4.

• SWE-Bench Pro v1 — Beam 65.5 مقابل Qwen3.8 Max 67.7، وGLM 5.2 62.1، وInkling 54.3، وNemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77.2 مقابل Kimi K3 88.2، GLM 5.3 84.3، Inkling 56.9.

• SWE-Bench Verified — Beam 80.9 مقابل Inkling 77.6، Nemotron 3 Ultra 70.7.

• SWE-Bench Multilingual — Beam 78.0 مقابل Nemotron 3 Ultra 67.7.

• DeepSWE v1.1 — Beam 44.4 مقابل DeepSeek V4.1 Flash 74.2، Kimi K3 68.0، GLM 5.3 61.0، Qwen3.8 Max 51.0، GLM 5.2 44.0.

• SWE Atlas Codebase QnA — Beam 34.6 مقابل Kimi K3 68.0، GLM 5.3 61.0.

هذا الصف الأخير هو الذي يستحق التوقف عنده. الإجابة عن أسئلة المستودعات طويلة الأفق هي المجال الذي يتعين على النموذج فيه أن يحتفظ بقاعدة شفرات كاملة في ذهنه عبر تفاعل طويل، و34.6 مقابل 68.0 ليس فرقًا ناتجًا عن تقريب. ويحكي DeepSWE قصة مشابهة: 44.4 يضع Beam في مستوى GLM 5.2 نفسه، وعلى مسافة بعيدة خلف DeepSeek V4.1 Flash.

الاستدلال

• AIME 2026 — Beam 97.8 مقابل GLM 5.2 بـ99.2، وInkling 97.1.

• HLE، بدون أدوات — Beam 36.2 مقابل Kimi K3 46.9، Qwen3.8 Max 43.6، GLM 5.3 42.3، GLM 5.2 40.5، DeepSeek V4.1 Flash 39.1، Inkling 29.7، Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 مقابل Kimi K3 93.5، Qwen3.8 Max 92.6، GLM 5.3 91.7، GLM 5.2 91.2، DeepSeek V4.1 Flash 90.9، Inkling 87.2، Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 مقابل GLM 5.3 59.0، Kimi K3 58.7، Qwen3.8 Max 52.1، DeepSeek V4.1 Flash 52.0، Inkling 46.1، Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16.3 مقابل Kimi K3 23.4، GLM 5.2 20.9، Qwen3.8 Max 20.0، GLM 5.3 19.1، DeepSeek V4.1 Flash 14.3، Inkling 5.4، Nemotron 3 Ultra 3.1.

يقع ملف Beam الاستدلالي في منتصف المجموعة، والنمط ثابت: متقدّم بفارق مريح على النموذجين من الجيل السابق في قائمة Reflection، ومتأخر عن النموذج الحالي. ودرجة GPQA Diamond عند 90.5 نتيجة قوية تجاوزتها أربعة نماذج أخرى.

• MCP Atlas — Beam 78.7 مقابل Qwen3.8 Max 84.5، GLM 5.3 84.2، Kimi K3 82.3، GLM 5.2 77.8، Inkling 76.0، Nemotron 3 Ultra 63.1.

• AutomationBench، التقسيم العام — Beam 37.0 مقابل DeepSeek V4.1 Flash 54.8، وGLM 5.3 48.2، وKimi K3 46.7، وQwen3.8 Max 39.8، وGLM 5.2 26.2.

• tau3 المصرفية — Beam 38.0 مقابل Qwen3.8 Max 55.2، GLM 5.2 37.1، Kimi K3 37.1، Inkling 25.0، Nemotron 3 Ultra 22.6.

• إدارة السياق في BrowseComp — Beam 77 مقابل Kimi K3 91.2، Inkling 77.1، Nemotron 3 Ultra 44.4.

• DeepSearchQA مع إدارة السياق — Beam 80.1 مقابل Kimi K3 95.0.

كشف Reflection أيضًا عن عرضين توضيحيين لقدراته في المنشور: معدل حل 95.5 بالمئة في أحجية «Land or Water»، وهي شبكة 180×90 تضم 16,200 نقطة وتتطلب الاحتفاظ بحالة لوحة كبيرة — رقم يقع بين 92.5 و97.8 بالمئة التي ينسبها Reflection إلى Opus 5 وFable 5 في المهمة نفسها — وضبط دقيق Text2SQL لأصغر إصدار من Gemma-4 رفع دقة العينات المحجوزة إلى 66.5 بالمئة. العروض التوضيحية منتقاة بعناية؛ فهي تُظهر أن النموذج قادر على إنجاز أمر ما، لا عدد مرات قيامه بذلك.

ما يمكنك فعله به اليوم، وما لا ينبغي أن تخطط بناءً عليه

اليوم، هناك أمر واحد فقط ممكن عمومًا: طلب الوصول التجريبي واستدعاء Beam-501B-A23B عبر نقطة النهاية الخاصة بـ Reflection باستخدام عميل على شكل OpenAI. لا يوجد سعر منشور، لذا لا توجد طريقة لنمذجة تكلفة عبء عمل عليه. لا توجد أوزان، لذا لا توجد استضافة ذاتية، ولا تكميم، ولا ضبط دقيق، ولا قابلية إعادة إنتاج من طرف ثالث. لا يوجد صف معياري مستقل، لذا فإن صورة الأداء بأكملها أعلاه تعتمد على جداول مختبر واحد.

Reflection Beam ليس أحد مساراتنا. لن نلمّح إلى غير ذلك، ولن نوجّهك إلى موزّع قد يكون لديه. ما يمكننا إخبارك به هو تكلفة مجموعة المقارنة، لأننا نوجّه أربعة من تلك النماذج، والأرقام أدناه مقروءة مباشرة من كتالوجنا هذا الصباح: GLM 5.2 بسعر $1.40 للإدخال و$4.40 للإخراج لكل مليون رمز، وGLM 5.3 بسعر $1.26 و$3.96، وQwen3.8 Max بسعر $2.00 و$6.00، وDeepSeek V4.1 Flash بسعر $0.15 و$0.60. هذا فارق سعري حقيقي — DeepSeek V4.1 Flash أرخص بنحو عشرة أضعاف في الإدخال من GLM 5.2 — وهو السبب في أن نموذجاً تجريبياً بلا سعر يصعب إدراجه في قرار. يشغّل OrcaRouter مفتاحاً واحداً متوافقاً مع OpenAI عبر تلك النماذج وأكثر من 200 نموذج آخر مع تمرير سعر القائمة الخاص بالمزوّد دون أي إضافة، ما يعني أن تغيير سعر البائع يصبح سارياً لدينا في اليوم نفسه بدلاً من انتظار تحديث أي موزّع. ولأن التبديل التلقائي عند الفشل جزء من التوجيه وليس شيئاً تبنيه، فإن نموذجاً جديداً وغير مُثبت هو الشيء الذي يمكنك وضعه على حصة من الحركة بدلاً من مسارك الحرج — وهو السبيل الوحيد المسؤول لاستخدام شيء لم يكرّر أحد معاييره بعد.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

ما يجب الانتباه إليه قبل أن تأخذ ادعاء الكفاءة على محمل الجد

ثلاثة أمور ستحسم المسألة، واثنان منها موعودان خلال الشهر.

أولها الأوزان. كان بإمكان Apache 2.0 وتقرير تقني أن يتيحا لأي شخص يملك بضع عقد أن يقيس الشيء الذي يهم فعلاً — الرموز في الثانية لكل GPU عند حد جودة ثابت، وما إذا كانت 23 مليار معامل نشط تحقق فعلاً النتيجة لكل FLOP التي يوحي بها المخطط. وحتى ذلك الحين، تظل حجة الكفاءة مجرد حساب على منديل.

الثاني هو السعر. النموذج الذي لا يحتوي على سعر قائمة لا مكان له في مقارنة التكاليف، وإذا جاء Beam أعلى من فئة GLM وDeepSeek، لم تعد قصة الحوسبة تهم أي شخص لديه ميزانية. وإذا جاء أدنى من ذلك، تتغير الصورة بسرعة.

الثالث هو طرف ثالث يشغّل مجموعة الاختبارات. كل رقم أعلاه يأتي من الوثيقة نفسها، وجدول مُبلَّغ عنه من مورّد يضع نموذجه الخاص متأخرًا في سبعة من أصل ستة عشر صفًا هو علامة جيدة على أمانة المختبر — لكنه يظل مختبرًا واحدًا، وأداة اختبار واحدة، ومجموعة توجيهات واحدة.

إذا كنت تحتاج اليوم إلى مبرمج وكيلي قدير وتريد أن تعرف كم يكلّف، فالجواب ليس Reflection Beam بعد. قد يكون خلال ثلاثة أسابيع. النموذج الذي يستحق ادعاءُ الكفاءة أن يُراهَن عليه هو النموذج الذي يمكنك تنزيل أوزانه وعدّ FLOPs بنفسك — ووفق هذا الاختبار، أعطتنا Reflection موعدًا لا نموذجًا.

مقارنات في هذه المقالة4

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا