
Reflection Beam مقابل Kimi K3: الاسم نفسه للمعيار، وأداتا تقييم مختلفتان
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
يسجّل Reflection Beam نتيجة 80.1 على Terminal-Bench 2.1. ويسجّل Kimi K3 نتيجة 88.3. ضع هذين الرقمين جنبًا إلى جنب، كما فعلت معظم تغطية هذا الأسبوع، لتستنتج أن Beam متأخر بنحو ثماني نقاط عن أفضل نموذج مفتوح في المجال. لكن هذين الرقمين لا يأتيان من الغرفة نفسها. فرقم Beam البالغ 80.1 مُبلَّغ عنه من المورّد، مأخوذ من الجدول الوارد في منشور الإطلاق الخاص بـ Reflection. ورقم Kimi K3 البالغ 88.3 مُبلَّغ عنه من المورّد أيضًا، وهذه المرة من جدول Moonshot نفسه — وجدول المورّد لا يُدرج نتيجة منافسه إلا عندما تكون قد شُغّلت على إطار الاختبار الخاص بالمورّد نفسه، وفق مجموعة المطالبات الخاصة به، وعند إعداد الجهد الخاص به. وقد شغّل طرف ثالث، هو Artificial Analysis، منذ ذلك الحين Kimi K3 على معيار بالاسم نفسه، ونشر نتيجة 85.0. هذا فارق قدره 4.9 نقاط، وليس 8.2 — واتجاه التصحيح متوقع تمامًا، لأن الرقم الذي يتآكل هو دائمًا الرقم الذي جاء من المختبر الذي لديه ما يثبته.
تلك هي المشكلة كلها في المقارنة التي يَعِد بها عنوان هذا المقال، وهي السبب في أن هذا المقال يُخصّص نصفه الأول للتحقق من المصدر لا للنتائج. Reflection Beamهو نموذج خليط خبراء متناثر (sparse mixture-of-experts) يضم 501 مليار معامل، مع 23 مليار معامل نشط لكل رمز (token)، أعلنت عنه شركة Reflection AI في 5 أكتوبر 2026 مع نقطة وصول تجريبية متوافقة مع OpenAI تعمل في اليوم نفسه. Kimi K3هو النموذج المفتوح الرائد لشركة Moonshot AI، مُدرَج في كتالوجنا الخاص بتاريخ إصدار 15 يوليو 2026، ومُقيَّم بشكل مستقل من Artificial Analysis. أحدهما منتج مطروح فعليًا مع قائمة أسعار وتشغيل على منصة تقييم خارجية؛ والآخر نسخة تجريبية بقائمة انتظار لا توجد أوزانها ولا تقريرها الفني ولا سعرها بعد. والمقارنة بينهما ليست تمرينًا متماثلًا، والتظاهر بغير ذلك سيُنتج صفحة تبدو دقيقة وهي خاطئة.
نسخة الـ30 ثانية
• Beam أسرع لكل فلوب على الورق، وغير مسعّر عمليًا، ولم يُعَد إنتاجه. أما Kimi K3 فيُقيَّم من طرف ثالث، وبسعر 3.00 دولارات للمدخلات و15.00 دولارًا للمخرجات لكل مليون رمز، ومتاح عمومًا.
• في المعيار الوحيد الذي جرى تشغيل كلا الطرفين فيه — Terminal-Bench 2.1 — تكون الفجوة الحقيقية نحو خمس نقاط، لا ثمانيًا، حالما تصدر أرقام كل طرف عن أداة اختبار محايدة.
• مزايا Beam الحقيقية بنيوية، وليست رقمية: ملف تعريف خدمة ذو 23 مليار معامل نشط، ورخصة Apache 2.0 موعودة. لا يمكن استخدام أي منهما اليوم.
• إذا كنت بحاجة إلى نموذج هذا الأسبوع، فهذا ليس ضربة حظ. إنه نموذج واحد للشحن وقائمة انتظار واحدة.
ما الذي نشرته Reflection فعليًا، وضد مَن
ينشر منشور إطلاق Reflection بطاقة أداء واحدة في مواجهة سبعة نماذج أخرى: Inkling، وNemotron 3 Ultra، وGLM 5.2، وGLM 5.3، وKimi K3، وQwen 3.8 Max، وDeepSeek V4.1 Flash. كل رقم في الجدول مُبلَّغ عنه من المورّد، ولم يُعَد إنتاج أيٍّ منه بشكل مستقل، ولا توجد صفحة لـ Reflection Beam على Artificial Analysis — فصفحة النموذج تُرجع خطأ 404 على موقعهم اعتبارًا من 6 أكتوبر 2026. عِدَّة خلايا في النسخة الأصلية موسومة بـ NR لأن النموذج لم يُشغَّل.
هذه هي شريحة Beam مقابل K3 كاملة من ذلك الجدول، سطر واحد لكل بُعد:
• Terminal-Bench 2.1 — Beam 80.1 مقابل Kimi K3 88.3
• SWE-Bench Pro v2-Hard — Beam 77.2 مقابل Kimi K3 88.2
• DeepSWE v1.1 — Beam 44.4 مقابل Kimi K3 68.0
• SWE Atlas Codebase QnA — Beam 34.6 مقابل Kimi K3 68.0
• HLE، بدون أدوات — Beam 36.2 مقابل Kimi K3 46.9
• GPQA Diamond — Beam 90.5 مقابل Kimi K3 93.5
• SciCode — Beam 49.7 مقابل Kimi K3 58.7
• إم سي بي أطلس — Beam 78.7 مقابل Kimi K3 82.3
• BrowseComp مع إدارة السياق — Beam 77.4 مقابل Kimi K3 91.2
• DeepSearchQA مع إدارة السياق — Beam 80.1 مقابل Kimi K3 95.0
اقرأ تلك القائمة بصدق، وستظهر ملامح الإطلاق. لا يدّعي Reflection تحقيق فوز على K3 في أي مكان. إنه يدّعي أنه يحلّ قريبًا من قمة إحدى الفئات بينما ينفق موارد حوسبة استدلال أقل بثلاث إلى أربع مرات من GLM 5.2 عند درجات استدلال مماثلة — والصف الوحيد الذي يكون فيه النموذجان متقاربين، Terminal-Bench 2.1، هو الصف الذي تكون فيه المقارنة أقل موثوقية.
لماذا تهمّ منصة الاختبار أكثر من النتيجة؟
اسم المعيار مجرد تسمية، وليس مواصفة. تعني Terminal-Bench 2.1 مجموعة محددة من المهام تُشغَّل ضمن هيكل وكيل محدد، وبسياسة محددة لإعادة المحاولة، وميزانية محددة للرموز، وإعداد محدد لجهد الاستدلال. يمكن لمختبرين اثنين أن يُبلغا بصدق عن رقم «Terminal-Bench 2.1» وأن ينتجا أرقامًا غير قابلة للمقارنة، لأن هيكل التشغيل وإعداد الجهد هما حيث يكمن معظم التباين. توجد Artificial Analysis كمنظمة لهذا السبب تحديدًا: فهي تشغّل أداة اختبار واحدة، بإعداد واحد، عبر نماذج كثيرة، بحيث يمكن طرح أرقامها بعضها من بعض.
إذن، الرقم 80.1 الذي تُصدره Reflection لـ Beam هو رقم مورّد على منصة اختبار مورّد، والرقم 88.3 الذي تُصدره لـ K3 هو أيضًا رقم مورّد — والمورّد هو Reflection، وهو يقيس منافسه. هذا الرقم الثاني هو الرقم الأقل موثوقية في الصف: فمختبر يشغّل أوزان منافس على منصته الخاصة ليس لديه حافز لتشغيلها بأفضل إعدادات المنافس، ولا التزام بالكشف عن الإعداد الذي اختاره. لا شيء غير نزيه فيه؛ إنه مجرد رقم لا يدعم مصدره الوزن الذي أولته إياه التغطية.
تشغيل Artificial Analysis الخاص يضع Kimi K3 عند 85.02 على Terminal-Bench 2.1، إلى جانب 12.6 على Terminal-Bench v4.0 — اختبار مختلف وأصعب — وAA Coding Index عند 76.2 (المرتبة 9 بين النماذج على اللوحة)، وIntelligence Index عند 43.6، وGPQA Diamond 93.5، وHLE 46.9، وSciCode 59.5، وtau-banking 45.98، وLong-Context Recall 88.7. هذه الأرقام مقروءة من بطاقة كتالوج K3 في نظامنا الخاص، ومصدرها artificialanalysis.ai، مع لقطة تقييم بتاريخ 15 يوليو 2026. لدى Beam رقم واحد في عالم تلك القائمة وهو يأتي من Reflection. ينبغي أن يكون ذلك الغياب مؤقتًا لا دائمًا: فقد قالت Artificial Analysis إن Reflection منحتها حق الوصول وإنها تقوم باختبار النموذج وفق معايير، وصياغتها المبكرة الخاصة — بأن Beam "سيكون واحدًا من أكثر النماذج المفتوحة كفاءة في استخدام الرموز التي رأيناها لمستواها من الذكاء" — هي إشارة من دار اختبارات معيارية إلى توقع، وليست إبلاغًا عن نتيجة. وحتى تُطبع تلك النتيجة، فإن أرقام هذا المقال غير قابلة للطرح، ولن نتظاهر بخلاف ذلك.

كم يكلف كل واحد، وما هو كل واحد
مقارنة التكلفة ليست متقاربة، بل إنها ليست مقارنة حقًّا على الإطلاق، لأن أحد طرفيها فارغ.
• السعر — Kimi K3 بسعر 3.00 دولارات للمُدخلات / 15.00 دولارًا للمُخرجات لكل مليون رمز، مع قراءات الذاكرة المؤقتة بسعر 0.30 دولار، مقابل Reflection Beam: لا يوجد سعر منشور في أي مكان على مدونة Reflection أو وثائقها أو قائمة طرازاتها، مع بقاء وحدة تحكم المنصة خلف جدار تسجيل.
• السياق — 1,048,576 توكنًا على Kimi K3 مقابل 256,000 على Beam beta، مع حاشية سفلية في وثائق Beam الخاصة تقول "قد تتغير نافذة السياق أثناء الإصدار التجريبي."
• الوسائط — يقبل Kimi K3 النصوص والصور؛ أما Reflection Beam فهو نصّي الإدخال ونصّي الإخراج، دون مسار للصور أو الصوت عند الإطلاق.
• التوفر — Kimi K3 متاح بشكل عام اليوم؛ Reflection Beam نسخة تجريبية بقائمة انتظار، مع الوعد بإتاحة الأوزان في وقت لاحق من أكتوبر بموجب Apache 2.0.
• درجات مستقلة — K3 لديه صف كامل في Artificial Analysis؛ Beam ليس لديه أي صف.
• ملف الخدمة — Kimi K3 نموذج حدودي كبير شبه كثيف بمعدل 46.8 رمز إخراج في الثانية وفق قياسنا الخاص على playground خلال الأسبوع الماضي؛ وتُعد المعاملات النشطة البالغة 23B لدى Beam حجة معمارية حقيقية لزمن استجابة أقل وتكلفة أقل لكل رمز، لكن لا توجد نقطة نهاية مفتوحة للعامة لقياسه عليها.
يستحق ادّعاء الكفاءة جملةً إضافية من العناية، لأنه عنوان الإطلاق الرئيسي، وهو يقوم بعمل أكثر مما يستطيع تحمّله. تأتي عبارة Reflection «حوسبة استدلال أقل بنحو 3 إلى 4 مرات» من مخطط يقدّر FLOPs بأنها ضعف عدد المعاملات النشطة مضروبًا في متوسط عدد الرموز المولّدة. تستبعد تلك الصيغة عمدًا التعبئة المسبقة للمُوجّه، وتكلفة الانتباه، وأعباء الخدمة — وهي بنود الفاتورة التي تهيمن على العمل الوكيلي ذي السياق الطويل. إنه تقدير تقريبي سريع لنسبة الحوسبة، وليس قياسًا، وليس رقمًا بالدولار، وقد بناه المورّد. تعامل معه كفرضية ستسمح الأوزان لشخص آخر باختبارها.
أين يقع OrcaRouter في هذا
Kimi K3 هو أحد مساراتنا. وهو مُدرج بسعر 3.00 دولارات للمدخلات و15.00 دولارًا للمخرجات لكل مليون رمز مع قراءات ذاكرة التخزين المؤقت بسعر 0.30 دولار، وهو سعر مزوّد Moonshot الممرَّر كما هو دون أي إضافة — فإذا غيّرت Moonshot قائمة أسعارها، يتغيّر الرقم على صفحتنا في اليوم نفسه بدلًا من انتظار تحديث أي موزّع. ويمكن استدعاؤه من مفتاح واحد متوافق مع OpenAI إلى جانب أكثر من 200 طراز آخر، وهذا مهم هنا لسبب محدّد: الإجابة الصادقة على سؤال «Beam أم K3؟» هي أنه لا ينبغي لفريق يتحوّط أن يختار. لأن التحويل التلقائي عند الفشل جزء من التوجيه وليس شيئًا تبنيه بنفسك، فإن طرازًا مثل Beam — نسخة تجريبية، بلا سعر، وغير مُقيَّم من أي طرف ثالث — هو بالضبط ما تضعه على حصة من حركة المرور لا على مسارك الحرج. توجّه العمل إلى K3 افتراضيًا، وترسل لـ Beam شريحة عندما تصل دعوة قائمة الانتظار، وتدع التوجيه يعود إلى K3 عند حدوث خطأ. هذا قرار يمكنك اتخاذه بشأن طراز غير مُثبت. أما المراهنة بمسار إنتاجي على واحدٍ منه، فلا.

ما الذي قد يغيّر هذا الحكم؟
ثلاثة أشياء، بترتيب تنازلي من حيث أهميتها.
السعر. إن نزوله إلى ما دون فئة K3 سيجعل حجة الكفاءة ملموسة بدلًا من كونها نظرية. ثانيًا، الأوزان. إن Apache 2.0 بالإضافة إلى تقرير تقني سيتيح لأي شخص يمتلك عقدتين قياس الرموز في الثانية لكل GPU عند معيار جودة ثابت — وهو الاختبار الذي يحسم فعليًا مسألة الحوسبة. ثالثًا، تشغيل من طرف ثالث. لقد منحت Reflection شركة Artificial Analysis إمكانية الوصول، ويُتوقع صدور تقييم عنها؛ وحتى يظهر ذلك الرقم، فإن كل رقم يقارن Beam بـK3 في تلك الوثيقة يعود إلى وثيقة كتبها أحد المورّدين الاثنين.
سؤالان يستحقان الإجابة عليهما مباشرة
هل Reflection Beam أفضل من Kimi K3؟
استنادًا إلى الأدلة المتاحة اليوم، لا — ولم ينشر أحد أدلة على أنه كذلك. جدول Reflection نفسه يضع K3 في المقدمة على جميع الصفوف العشرة المشتركة أعلاه، والعديد منها بفوارق (SWE Atlas 34.6 مقابل 68.0، وDeepSearchQA 80.1 مقابل 95.0) ليست متقاربة. حجة Beam هي التكلفة لكل وحدة من القدرة، وهذه الحجة مجرد مخطط رسمه المورّد حتى تتوفر الأوزان ويوجد سعر.
هل ينبغي أن أنتظر أوزان Beam قبل البناء على K3؟
فقط إذا كانت الاستضافة الذاتية شرطًا لا مجرد تفضيل، لأن هذا هو المحور الوحيد الذي لا يكون فيه الاثنان بديلين عن بعضهما — فـ K3 يعمل عبر API فقط، بينما يَعِد Beam بأوزان Apache 2.0. إذا كنت تستدعي API، فإن K3 متاح ومُقيَّم ومسعَّر، أما Beam فهو قائمة انتظار. لا توجد صيغة من ذلك القرار تستحق تأجيل مشروع من أجلها.

لقد أعطتنا Reflection تاريخًا ومخططًا، والتاريخ ليس نموذجًا. الشيء الوحيد الذي يثبته الإطلاق حقًا هو أن نموذجًا بحجم 501B يفعّل 23B معلمة يمكن تدريبه ليستقر في حدود بضع نقاط من الطليعة المفتوحة — وهو، إذا وصلت الأوزان وصمدت الأرقام، نتيجة ذات دلالة بشأن الكفاءة. لكنه ليس بعد سببًا لنقل العمل بعيدًا عن نموذج قام طرف ثالث بقياسه فعليًا.
