
نموذج DeepSeek ثلاثي التريليونات: التوسّع الذي يتعيّن عليه انتظار المجموعات الحاسوبية
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
في 14 سبتمبر، ستسحب DeepSeek من الخدمة DeepSeek V4 Pro — الطراز الرائد ذا 1.6 تريليون معامل الذي أتاحته للاستخدام العام في 13 أغسطس — وستستجيب لكل نداء إلى deepseek-v4-pro بـDeepSeek V4.1 Flash، وهو النموذج ذو 552 مليار معامل الذي أصدرته في 10 سبتمبر. وقبل أربعة أيام من الإعلان عن ذلك التحول، نشر أحد مراقبي DeepSeek المجهولين شيئًا لاذعًا في الاتجاه المعاكس: أن المختبر كان يعمل على نموذج ذي 3 تريليونات معامل، "على الأرجح Engram آخر بـ1 تريليون معامل"، وأن السبب في عدم إطلاقه اقتصادي وليس قدراتيًا.
لم يتأكد أي شيء يخص ذلك النموذج. فلا اسم، ولا مستودع، ولا ملف إعدادات، ولا معيار تقييم، ولا نافذة إصدار — مجرد منشور واحد على X، منسوب إلى «مصدر موثوق»، مع إشارة مؤلفه صراحةً إلى التفصيل الأكثر إثارة فيه باعتباره تخمينًا. تعامل معه كإشارة، لا كحقيقة. ومع ذلك فهو يستحق القراءة، لأن نصفَي الادعاء يشدّان في اتجاهين متعاكسين، ومن المرجح أن ينجو واحد منهما فقط من التماس مع خارطة طريق DeepSeek نفسها.
ما يقوله التسريب في الواقع، وما لا يقوله.
المنشور صادر عن حساب teortaxesTex، وهو مراقب لـ DeepSeek منذ زمن طويل يصف نفسه بأنه من معجبي المختبر منذ 2023. وجاء فيه بالكامل: "في الواقع، لديّ من مصدر موثوق أن DeepSeek كان يعمل على نموذج 3T (العمود الفقري، وربما Engram آخر بمعاملات 1T، لكن هذا تخميني). كل ما في الأمر أنهم لم يكونوا متأكدين من أنه سيكون اقتصاديًا لتدريبه لاحقًا وتقديمه. عندما تكبر عناقيدهم، سنرى بعضًا..."
أربعة أمور في هاتين الجملتين تحمل وزنًا، وأحدها ليس حقيقة إطلاقًا. «السلطة الموثوقة» غير مسمّاة. عدد المعاملات يأتي كرقم واحد دون تقسيم بين الإجمالي والنشط. الملاحظة الجانبية حول «إنغرام» مُوصوفة بأنها تخمين من الشخص الذي يخمّن. و«عندما تنمو مجموعاتهم» جملة شرطية بلا تاريخ مرتبط بها.
• ما الذي يُزعم — أن نموذج DeepSeek بثلاثة تريليونات معامل موجود في مرحلة ما من التطوير.
• ما هو تخمين المؤلف نفسه صراحةً — أن ما يقارب 1T منه هو ذاكرة إنغرام.
• ما هو غير معروف — اسمه، بنيته المعمارية، عدد المعاملات النشطة، نافذة السياق، حالة التدريب، وما إذا كان يُطرح كمنتج على الإطلاق.
• ما الذي يمكن التحقق منه الآن — لا شيء. لا يذكره أي مستودع DeepSeek، ولا بطاقة نموذج، ولا صف تسعير، ولا مدخل في الوثائق.
حتى الحساب نفسه غامض. فعبارة «نموذج 3T (عمود فقري، وربما 1T أخرى من معاملات Engram)» تحتمل قراءتين: إما نموذج 3T يتضمن نحو 1T من Engram، أو عمود فقري بحجم 3T إلى جانبه 1T إضافية من Engram ليصبح المجموع قرابة 4T. هذه الفجوة بعرض تريليون معامل، وتغيّر فاتورة التشغيل بمبلغ يفوق ما تنفقه معظم المختبرات على تشغيل تدريبي واحد.
يجدر التذكير أيضًا بأن سجل هذا الحساب متفاوت وليس بمستوى العرّاف. فقد قرأ إشعار DeepSeek الصادر في 9 سبتمبر بشأن إعادة توجيه حركة V4 Pro باعتباره دليلًا على أن المختبر قد «حلّ المشكلات المعمارية لعائلة V4» — وهو استنتاج معقول، لكنه يظل استنتاجًا. وفي أوائل سبتمبر، طرح أيضًا فكرة أن نموذجًا خفيًا مجهول الهوية على منصة برمجة تابعة لطرف ثالث كان MiMo-V3-Flash من Xiaomi، وهو ما لم يؤكده أحد. إشارة مبكرة مفيدة؛ لكنها ليست مصدرًا مرجعيًا موثوقًا.
النصف المثير للاهتمام هو جدول الذاكرة، وليس عدد المعلمات
Engram حقيقي، وهو السبب في أن ادعاء 3T أكثر معقولية مما يبدو في البداية. نشرت DeepSeek بنية الذاكرة الشرطية في يناير 2026 مع كود مفتوح المصدر مرفق، وهي تفعل شيئًا غير معتاد: فهي تفصل استرجاع المعرفة الساكنة عن الاستدلال الديناميكي. فبدلًا من إنفاق حوسبة GPU على تذكّر الحقائق، يجزّئ النموذج سياقه إلى جداول تضمين محفوظة في DRAM ويسترجع في زمن ثابت، دون أي عمل لـ GPU في مسار البحث، إضافة إلى آلية بوابة تكبت ذاكرة مسترجَعة عندما تتعارض مع السياق المحيط.
الأرقام التي أبلغت عنها DeepSeek لتكوين الاختبار الخاص بها هي التي ينبغي التمسك بها: جدول تضمينات يحتوي على 100 مليار معامل يُنقل إلى DRAM بتراجع في الإنتاجية يقل عن 3%، ودقة 97% في العثور على إبرة في كومة قش عند 1M توكن، مقابل 84.2% للانتباه القياسي. هذه أرقام المختبر نفسه، ولسنا من أعاد إنتاجها. ويُقال إن تقييمات أولية مستقلة سجّلت نطاق 93–96% عند طول السياق نفسه — متجاوزةً خط الأساس، لكنها دون الادعاء.
قم بتوسيع هذه الفكرة عشرة أضعاف وسيتغير شكل التسريب. إذا كانت معظم المعاملات الإضافية لنموذج 3T عبارة عن ذاكرة جدول تجزئة موجودة في DRAM بدلاً من خبراء يتنافسون على HBM، فإن "3T" تتوقف عن كونها مؤشرًا على "غير قابل للتقديم". إجمالي عدد المعاملات وتكلفة التقديم ينفصلان. هذه هي الفكرة الجديدة حقًا في هذا التسريب، وهي الجزء الذي يدعمه البحث المنشور فعليًا.
التحذير هنا هو أن ورقة Engram لا تتناول، وفقًا للتقارير، الحمل الإضافي في وقت الاستدلال — زمن الاستجابة والإنتاجية — وهو بالتحديد المكان الذي سيظهر فيه جدول بحث مقيم في ذاكرة DRAM إذا ظهر في أي مكان. الذاكرة التي يتعين عليك جلبها ليست ذاكرة تحصل عليها مجانًا.

لماذا يجادل سبتمبر الخاص بـ DeepSeek في الاتجاه المعاكس
الحجة ضد إطلاق منتج 3T قريبًا هي أن DeepSeek أجرى التجربة للتو عند 1.6T وأجاب عن سؤاله الخاص بشيء أصغر. سلسلة V4 كما هي عليه اليوم:
• DeepSeek-V4-Flash-0731 — إجمالي المعلمات 284 مليارًا، و13 مليارًا نشطة لكل رمز.
DeepSeek-V4-Pro-0813 — إجمالي 1.6 تريليون، 49 مليار نشط، أوزان مفتوحة بموجب ترخيص MIT.
• DeepSeek V4.1 Flash — بنية أساسية بحجم 552B على تصميم ترميز-فك ترميز سببي ينشط 8B معاملًا لكل رمز أثناء مرحلة ما قبل الملء و16B أثناء فك الترميز.
في 14 سبتمبر عند الظهر بتوقيت بكين، يُطرح المستوى الأوسط. يوقف DeepSeek تشغيل V4 Pro ويوجّه طلبات deepseek-v4-pro إلى V4.1 Flash، وتُحتسب بسعر Flash، حتى يتوفر V4.1 Pro. تعرض صفحة الأسعار الرسمية اليوم صفّين، ولا يمثل أي منهما خليفة الموديل المتقاعد من حيث الحجم: deepseek-flash بسعر 0.30 دولار لكل مليون رمز إدخال و1.20 دولار لكل مليون رمز إخراج في وقت الذروة، deepseek-v4-pro بسعر 1.32 و3.96 دولار، مع أسعار وقت الخمول بنصف هذه الأرقام. يدرج كلاهما نافذة سياق تبلغ مليون رمز وسقف إخراج يبلغ 384,000 رمز.
اتجاه التطور ليس خفيًا. مختبر يوقف تشغيل أكبر نموذج له لصالح نموذج ينشّط عُشر عدد المعاملات لكل توكن قد خلص بالفعل إلى أن الوحدة الاقتصادية للقدرة الحدودية ليست أكبر نقطة تفتيش يمكنه تدريبها. نموذج بـ3 تريليونات معامل، يشكّ بانيه في إمكانية "تدريبه لاحقًا وتشغيله اقتصاديًا"، ليس مجرد شائعة عن التردد؛ بل يصف مختبرًا لديه الآن بيانات مُقاسة عن البديل.
ما بعد التدريب هو الجزء الأكثر حدة من تلك المشكلة. تم الإبلاغ عن التدريب اللاحق الكامل المعلمات لخط DeepSeek-V4-Pro على منصة CloudMatrix384 SuperPOD من هواوي من قبل مشروع SLAI T-Rex التابع لجهة خارجية عند 34.22% من MFU، أي ما يقرب من 2.93 ضعف وصفة الأساس المفتوحة. هذا رقم مشجع — رقم من جهة خارجية، على نموذج بحجم 1.6T. مضاعفة العمود الفقري تضاعف التكلفة تقريبًا قبل أن يتم تقديم رمز واحد.

عندما تنمو عناقيدها
الجملة الأساسية في التسريب هي الأخيرة، لأنها الجزء الوحيد الذي له أثر موثّق علني. يُقال إن DeepSeek تخطط لاستخدام ما لا يقل عن 160,000 من مسرّعات Ascend 950DT من هواوي في مركز بيانات جديد في أولانقاب، منغوليا الداخلية، في طلب تبلغ قيمته نحو 2.56 مليار دولار — وهو أحد أكبر تجمعات السيليكون الذكي الصيني الصنع التي حاول أي طرف بناؤها.
التحذيرات المرتبطة بذلك المخطط تهم أكثر من العنوان الرئيسي. من المخطط استخدام الشرائح للاستدلال، لا للتدريب: فقد جرّبت DeepSeek التدريب على شرائح هواوي من قبل، لكنها لا تزال تدرّب على مسرّعات Nvidia، وهي الخطوة التي سيحتاجها نموذج بحجم 3T فعلاً. وقد يستغرق التسليم أكثر من عام. ومن المتوقع أن تدخل قدرة جزئية حيز التشغيل في أواخر 2027 وحتى أوائل 2028. ومن المتوقع أن يحدّ عرض ذاكرة النطاق الترددي العالي، لا المنطق، من عدد وحدات 950DT التي يمكن لـ Huawei بناؤها هذا العام.
إذن، القراءة المتفائلة لعبارة "عندما تنمو عناقيدهم" تضع نموذجًا بحجم 3T على جدول زمني 2027–2028 في أقرب تقدير، أما القراءة المتشائمة — القائلة إنه يبقى نتاجًا بحثيًا ولا يصبح منتجًا أبدًا — فتتفق مع كل ما أطلقته DeepSeek في 2026. كذلك فإن بيئة الحوسبة المحيطة بالمختبر هي سياسة متنازع عليها وليست مسألة عرض بحتة: في 8–9 سبتمبر، ادّعت NSA وFBI وCISA بشكل مشترك أن ستة مختبرات صينية من بينها DeepSeek قطّرت نماذج أمريكية حدودية على "نطاق صناعي"، وهو اتهام رفضته وزارة التجارة الصينية. ومهما كان موقف المرء من هذا الاتهام، فإن إصدارًا يعتمد على نمو العناقيد يعتمد على قرارات لا يتحكم بها أحد داخل DeepSeek.
ما الذي سيحوّل هذا من تسريب إلى إطلاق؟
قائمة التحقق قصيرة ومحددة، ولم يُفعَّل أي منها بعد:
• مستودع ضمن منظمة deepseek-ai على Hugging Face، باسم نقطة تحقق مُرقّمة بدلاً من معرّف عائلة.
• صف جديد في صفحة النماذج والأسعار الخاصة بـ DeepSeek.
• إدخال مؤرخ في موجز أخبار توثيقات API، بالصيغة المعتادة للمختبر newsYYMMDD.
• مُعرّف نموذج، لا اسم عائلة — فإصدارات DeepSeek هي نقاط حفظ، وقد كان المُعرّف المجرّد للعائلة يعني حتى الآن معاينةً.
المعلَم الأقرب هو V4.1 Pro، الذي أشار إليه أحد أعضاء فريق DeepSeek في 9 سبتمبر باعتباره نقطة نهاية نافذة التوجيه. ليس لديه مواصفات منشورة، ولا عدد معاملات، ولا سعر، ولا تاريخ أيضًا. من جهة، يُعدّ V4.1 Pro اختبارًا لهذا التسريب: إذا ظهر الطراز الرائد التالي عند نحو 1.6T الخاص بـ V4 Pro أو أقل، فإن ادعاء 3T يكون قد تأخر جيلًا واحدًا على الأقل.
ماذا يعني أي من هذا إذا كنت تختار نموذجًا هذا الأسبوع
نموذج 3T ليس قرارًا شرائيًا في 2026، والدرس العملي لشهر سبتمبر لدى DeepSeek ليس عن الحجم على الإطلاق. إنه أن النموذج خلف نقطة النهاية يمكن أن يتغير بينما يبقى اسم نقطة النهاية كما هو تمامًا. أي شخص يستدعي deepseek-v4-pro عبر طبقة تجريد يحصل على نموذج مختلف، أصغر، وأرخص في 14 سبتمبر دون لمس شفرته. أي شخص متصل مباشرة بتطبيق مزود واحد لهذا المعرف يحصل على ما يقرر ذلك المزود فعله.
يتوفر كل من DeepSeek V4.1 Flash وDeepSeek V4 Pro على OrcaRouter تحت مفتاح واحد بهامش ربح 0% — سعر قائمة المزوّد يُمرَّر كما هو، مما يعني أن تغيير أسعار DeepSeek في 10 سبتمبر يسري هنا في نفس اليوم بسعر القائمة بدلاً من نسخة مُبالغ في سعرها منه. تظهر صفحة النموذج 0.15 دولار لكل مليون رمز إدخال و0.60 دولار لكل مليون رمز إخراج في نطاق خارج أوقات الذروة، وهو رقم DeepSeek الخاص خارج أوقات الذروة ولا شيء يضاف فوقه. يُعد التحويل التلقائي عند الفشل عبر المزوّدين الميزة غير البرّاقة الأكثر أهمية في أسبوع مثل هذا: عندما يستبدل أحد البائعين النموذج من تحت نقطة نهاية، فإن طبقة التوجيه هي حيث يصبح ذلك تغييرًا في الإعدادات بدلاً من عملية ترحيل.
إذا طُرح نموذج 3T DeepSeek يوماً ما، فسيقدّمه من يملكون العناقيد القادرة على استيعابه، بسعر تمليه الحوسبة. وطبقة التوجيه نفسها هي المكان الذي ستلقاه فيه — من دون عقد ثانٍ ومن دون إعادة بناء أي شيء.

السؤال المطروح ليس ما إذا كانت DeepSeek قادرة على بناء نموذج بثلاثة تريليونات معامل. ثلاث أوراق منشورة عن البنية، وتصميم ذاكرة عملي، ونموذج بحجم 552B يقول صانعه إنه يتفوق على سابقه بحجم 1.6T، كلها تشير إلى أن المختبر يعرف كيف يفعل ذلك. السؤال هو ما إذا كان أي شخص سيدفع مقابل تشغيله — ووفقًا لأدلة الأسبوعين الماضيين، فإن DeepSeek نفسها ليست متأكدة. راقب العنقود، لا عدد المعاملات. ستخبرك صفحة التسعير بما تطلقه DeepSeek فعليًا، وذلك أسرع مما سيخبرك به أي تسريب.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
