{{1}}نموذج DeepSeek من فئة 3T{{/1}} مع العنوان الفرعي {{2}}"ادعاء بمعاملات تبلغ 3 تريليونات، وجدول ذاكرة Engram بسعة 1T، ومجموعة حوسبية لن تتوفر قبل 2027"{{/2}}، وفوقها ثلاثة بلاطات أيقونات تقرأ {{3}}"3T — المعاملات: غير مؤكدة"{{/3}}، {{4}}"~1T — Engram: تقدير شخصي من المؤلف"{{/4}} و{{5}}"المجموعة الحوسبية — أواخر 2027 على أقرب تقدير"{{/5}}، مع سطر سفلي يقرأ {{6}}"تسريب من مصدر واحد؛ لا يوجد مستودع أو بطاقة نموذج أو صف تسعير."{{/6}}
Guides & Insights

نموذج DeepSeek ثلاثي التريليونات: التوسّع الذي يتعيّن عليه انتظار المجموعات الحاسوبية

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 14 سبتمبر، ستسحب Deep​Seek من الخدمة DeepSeek V4 Pro — الطراز الرائد ذا 1.6 تريليون معامل الذي أتاحته للاستخدام العام في 13 أغسطس — وستستجيب لكل نداء إلى deepseek-v4-pro بـDeepSeek V4.1 Flash، وهو النموذج ذو 552 مليار معامل الذي أصدرته في 10 سبتمبر. وقبل أربعة أيام من الإعلان عن ذلك التحول، نشر أحد مراقبي Deep​Seek المجهولين شيئًا لاذعًا في الاتجاه المعاكس: أن المختبر كان يعمل على نموذج ذي 3 تريليونات معامل، "على الأرجح Engram آخر بـ1 تريليون معامل"، وأن السبب في عدم إطلاقه اقتصادي وليس قدراتيًا.

لم يتأكد أي شيء يخص ذلك النموذج. فلا اسم، ولا مستودع، ولا ملف إعدادات، ولا معيار تقييم، ولا نافذة إصدار — مجرد منشور واحد على X، منسوب إلى «مصدر موثوق»، مع إشارة مؤلفه صراحةً إلى التفصيل الأكثر إثارة فيه باعتباره تخمينًا. تعامل معه كإشارة، لا كحقيقة. ومع ذلك فهو يستحق القراءة، لأن نصفَي الادعاء يشدّان في اتجاهين متعاكسين، ومن المرجح أن ينجو واحد منهما فقط من التماس مع خارطة طريق DeepSeek نفسها.

ما يقوله التسريب في الواقع، وما لا يقوله.

المنشور صادر عن حساب teortaxesTex، وهو مراقب لـ DeepSeek منذ زمن طويل يصف نفسه بأنه من معجبي المختبر منذ 2023. وجاء فيه بالكامل: "في الواقع، لديّ من مصدر موثوق أن DeepSeek كان يعمل على نموذج 3T (العمود الفقري، وربما Engram آخر بمعاملات 1T، لكن هذا تخميني). كل ما في الأمر أنهم لم يكونوا متأكدين من أنه سيكون اقتصاديًا لتدريبه لاحقًا وتقديمه. عندما تكبر عناقيدهم، سنرى بعضًا..."

أربعة أمور في هاتين الجملتين تحمل وزنًا، وأحدها ليس حقيقة إطلاقًا. «السلطة الموثوقة» غير مسمّاة. عدد المعاملات يأتي كرقم واحد دون تقسيم بين الإجمالي والنشط. الملاحظة الجانبية حول «إنغرام» مُوصوفة بأنها تخمين من الشخص الذي يخمّن. و«عندما تنمو مجموعاتهم» جملة شرطية بلا تاريخ مرتبط بها.

• ما الذي يُزعم — أن نموذج Deep​Seek بثلاثة تريليونات معامل موجود في مرحلة ما من التطوير.

• ما هو تخمين المؤلف نفسه صراحةً — أن ما يقارب 1T منه هو ذاكرة إنغرام.

• ما هو غير معروف — اسمه، بنيته المعمارية، عدد المعاملات النشطة، نافذة السياق، حالة التدريب، وما إذا كان يُطرح كمنتج على الإطلاق.

• ما الذي يمكن التحقق منه الآن — لا شيء. لا يذكره أي مستودع DeepSeek، ولا بطاقة نموذج، ولا صف تسعير، ولا مدخل في الوثائق.

حتى الحساب نفسه غامض. فعبارة «نموذج 3T (عمود فقري، وربما 1T أخرى من معاملات Engram)» تحتمل قراءتين: إما نموذج 3T يتضمن نحو 1T من Engram، أو عمود فقري بحجم 3T إلى جانبه 1T إضافية من Engram ليصبح المجموع قرابة 4T. هذه الفجوة بعرض تريليون معامل، وتغيّر فاتورة التشغيل بمبلغ يفوق ما تنفقه معظم المختبرات على تشغيل تدريبي واحد.

يجدر التذكير أيضًا بأن سجل هذا الحساب متفاوت وليس بمستوى العرّاف. فقد قرأ إشعار Deep​Seek الصادر في 9 سبتمبر بشأن إعادة توجيه حركة V4 Pro باعتباره دليلًا على أن المختبر قد «حلّ المشكلات المعمارية لعائلة V4» — وهو استنتاج معقول، لكنه يظل استنتاجًا. وفي أوائل سبتمبر، طرح أيضًا فكرة أن نموذجًا خفيًا مجهول الهوية على منصة برمجة تابعة لطرف ثالث كان MiMo-V3-Flash من Xiaomi، وهو ما لم يؤكده أحد. إشارة مبكرة مفيدة؛ لكنها ليست مصدرًا مرجعيًا موثوقًا.

النصف المثير للاهتمام هو جدول الذاكرة، وليس عدد المعلمات

Engram حقيقي، وهو السبب في أن ادعاء 3T أكثر معقولية مما يبدو في البداية. نشرت DeepSeek بنية الذاكرة الشرطية في يناير 2026 مع كود مفتوح المصدر مرفق، وهي تفعل شيئًا غير معتاد: فهي تفصل استرجاع المعرفة الساكنة عن الاستدلال الديناميكي. فبدلًا من إنفاق حوسبة GPU على تذكّر الحقائق، يجزّئ النموذج سياقه إلى جداول تضمين محفوظة في DRAM ويسترجع في زمن ثابت، دون أي عمل لـ GPU في مسار البحث، إضافة إلى آلية بوابة تكبت ذاكرة مسترجَعة عندما تتعارض مع السياق المحيط.

الأرقام التي أبلغت عنها Deep​Seek لتكوين الاختبار الخاص بها هي التي ينبغي التمسك بها: جدول تضمينات يحتوي على 100 مليار معامل يُنقل إلى DRAM بتراجع في الإنتاجية يقل عن 3%، ودقة 97% في العثور على إبرة في كومة قش عند 1M توكن، مقابل 84.2% للانتباه القياسي. هذه أرقام المختبر نفسه، ولسنا من أعاد إنتاجها. ويُقال إن تقييمات أولية مستقلة سجّلت نطاق 93–96% عند طول السياق نفسه — متجاوزةً خط الأساس، لكنها دون الادعاء.

قم بتوسيع هذه الفكرة عشرة أضعاف وسيتغير شكل التسريب. إذا كانت معظم المعاملات الإضافية لنموذج 3T عبارة عن ذاكرة جدول تجزئة موجودة في DRAM بدلاً من خبراء يتنافسون على HBM، فإن "3T" تتوقف عن كونها مؤشرًا على "غير قابل للتقديم". إجمالي عدد المعاملات وتكلفة التقديم ينفصلان. هذه هي الفكرة الجديدة حقًا في هذا التسريب، وهي الجزء الذي يدعمه البحث المنشور فعليًا.

التحذير هنا هو أن ورقة Engram لا تتناول، وفقًا للتقارير، الحمل الإضافي في وقت الاستدلال — زمن الاستجابة والإنتاجية — وهو بالتحديد المكان الذي سيظهر فيه جدول بحث مقيم في ذاكرة DRAM إذا ظهر في أي مكان. الذاكرة التي يتعين عليك جلبها ليست ذاكرة تحصل عليها مجانًا.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

لماذا يجادل سبتمبر الخاص بـ DeepSeek في الاتجاه المعاكس

الحجة ضد إطلاق منتج 3T قريبًا هي أن DeepSeek أجرى التجربة للتو عند 1.6T وأجاب عن سؤاله الخاص بشيء أصغر. سلسلة V4 كما هي عليه اليوم:

DeepSeek-V4-Flash-0731 — إجمالي المعلمات 284 مليارًا، و13 مليارًا نشطة لكل رمز.

DeepSeek-V4-Pro-0813 — إجمالي 1.6 تريليون، 49 مليار نشط، أوزان مفتوحة بموجب ترخيص MIT.

• DeepSeek V4.1 Flash — بنية أساسية بحجم 552B على تصميم ترميز-فك ترميز سببي ينشط 8B معاملًا لكل رمز أثناء مرحلة ما قبل الملء و16B أثناء فك الترميز.

في 14 سبتمبر عند الظهر بتوقيت بكين، يُطرح المستوى الأوسط. يوقف DeepSeek تشغيل V4 Pro ويوجّه طلبات deepseek-v4-pro إلى V4.1 Flash، وتُحتسب بسعر Flash، حتى يتوفر V4.1 Pro. تعرض صفحة الأسعار الرسمية اليوم صفّين، ولا يمثل أي منهما خليفة الموديل المتقاعد من حيث الحجم: deepseek-flash بسعر 0.30 دولار لكل مليون رمز إدخال و1.20 دولار لكل مليون رمز إخراج في وقت الذروة، deepseek-v4-pro بسعر 1.32 و3.96 دولار، مع أسعار وقت الخمول بنصف هذه الأرقام. يدرج كلاهما نافذة سياق تبلغ مليون رمز وسقف إخراج يبلغ 384,000 رمز.

اتجاه التطور ليس خفيًا. مختبر يوقف تشغيل أكبر نموذج له لصالح نموذج ينشّط عُشر عدد المعاملات لكل توكن قد خلص بالفعل إلى أن الوحدة الاقتصادية للقدرة الحدودية ليست أكبر نقطة تفتيش يمكنه تدريبها. نموذج بـ3 تريليونات معامل، يشكّ بانيه في إمكانية "تدريبه لاحقًا وتشغيله اقتصاديًا"، ليس مجرد شائعة عن التردد؛ بل يصف مختبرًا لديه الآن بيانات مُقاسة عن البديل.

ما بعد التدريب هو الجزء الأكثر حدة من تلك المشكلة. تم الإبلاغ عن التدريب اللاحق الكامل المعلمات لخط DeepSeek-V4-Pro على منصة CloudMatrix384 SuperPOD من هواوي من قبل مشروع SLAI T-Rex التابع لجهة خارجية عند 34.22% من MFU، أي ما يقرب من 2.93 ضعف وصفة الأساس المفتوحة. هذا رقم مشجع — رقم من جهة خارجية، على نموذج بحجم 1.6T. مضاعفة العمود الفقري تضاعف التكلفة تقريبًا قبل أن يتم تقديم رمز واحد.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

عندما تنمو عناقيدها

الجملة الأساسية في التسريب هي الأخيرة، لأنها الجزء الوحيد الذي له أثر موثّق علني. يُقال إن DeepSeek تخطط لاستخدام ما لا يقل عن 160,000 من مسرّعات Ascend 950DT من هواوي في مركز بيانات جديد في أولانقاب، منغوليا الداخلية، في طلب تبلغ قيمته نحو 2.56 مليار دولار — وهو أحد أكبر تجمعات السيليكون الذكي الصيني الصنع التي حاول أي طرف بناؤها.

التحذيرات المرتبطة بذلك المخطط تهم أكثر من العنوان الرئيسي. من المخطط استخدام الشرائح للاستدلال، لا للتدريب: فقد جرّبت DeepSeek التدريب على شرائح هواوي من قبل، لكنها لا تزال تدرّب على مسرّعات Nvidia، وهي الخطوة التي سيحتاجها نموذج بحجم 3T فعلاً. وقد يستغرق التسليم أكثر من عام. ومن المتوقع أن تدخل قدرة جزئية حيز التشغيل في أواخر 2027 وحتى أوائل 2028. ومن المتوقع أن يحدّ عرض ذاكرة النطاق الترددي العالي، لا المنطق، من عدد وحدات 950DT التي يمكن لـ Huawei بناؤها هذا العام.

إذن، القراءة المتفائلة لعبارة "عندما تنمو عناقيدهم" تضع نموذجًا بحجم 3T على جدول زمني 2027–2028 في أقرب تقدير، أما القراءة المتشائمة — القائلة إنه يبقى نتاجًا بحثيًا ولا يصبح منتجًا أبدًا — فتتفق مع كل ما أطلقته Deep​Seek في 2026. كذلك فإن بيئة الحوسبة المحيطة بالمختبر هي سياسة متنازع عليها وليست مسألة عرض بحتة: في 8–9 سبتمبر، ادّعت NSA وFBI وCISA بشكل مشترك أن ستة مختبرات صينية من بينها Deep​Seek قطّرت نماذج أمريكية حدودية على "نطاق صناعي"، وهو اتهام رفضته وزارة التجارة الصينية. ومهما كان موقف المرء من هذا الاتهام، فإن إصدارًا يعتمد على نمو العناقيد يعتمد على قرارات لا يتحكم بها أحد داخل Deep​Seek.

ما الذي سيحوّل هذا من تسريب إلى إطلاق؟

قائمة التحقق قصيرة ومحددة، ولم يُفعَّل أي منها بعد:

• مستودع ضمن منظمة deepseek-ai على Hugging Face، باسم نقطة تحقق مُرقّمة بدلاً من معرّف عائلة.

• صف جديد في صفحة النماذج والأسعار الخاصة بـ Deep​Seek.

• إدخال مؤرخ في موجز أخبار توثيقات API، بالصيغة المعتادة للمختبر newsYYMMDD.

• مُعرّف نموذج، لا اسم عائلة — فإصدارات DeepSeek هي نقاط حفظ، وقد كان المُعرّف المجرّد للعائلة يعني حتى الآن معاينةً.

المعلَم الأقرب هو V4.1 Pro، الذي أشار إليه أحد أعضاء فريق DeepSeek في 9 سبتمبر باعتباره نقطة نهاية نافذة التوجيه. ليس لديه مواصفات منشورة، ولا عدد معاملات، ولا سعر، ولا تاريخ أيضًا. من جهة، يُعدّ V4.1 Pro اختبارًا لهذا التسريب: إذا ظهر الطراز الرائد التالي عند نحو 1.6T الخاص بـ V4 Pro أو أقل، فإن ادعاء 3T يكون قد تأخر جيلًا واحدًا على الأقل.

ماذا يعني أي من هذا إذا كنت تختار نموذجًا هذا الأسبوع

نموذج 3T ليس قرارًا شرائيًا في 2026، والدرس العملي لشهر سبتمبر لدى DeepSeek ليس عن الحجم على الإطلاق. إنه أن النموذج خلف نقطة النهاية يمكن أن يتغير بينما يبقى اسم نقطة النهاية كما هو تمامًا. أي شخص يستدعي deepseek-v4-pro عبر طبقة تجريد يحصل على نموذج مختلف، أصغر، وأرخص في 14 سبتمبر دون لمس شفرته. أي شخص متصل مباشرة بتطبيق مزود واحد لهذا المعرف يحصل على ما يقرر ذلك المزود فعله.

يتوفر كل من DeepSeek V4.1 Flash وDeepSeek V4 Pro على OrcaRouter تحت مفتاح واحد بهامش ربح 0% — سعر قائمة المزوّد يُمرَّر كما هو، مما يعني أن تغيير أسعار DeepSeek في 10 سبتمبر يسري هنا في نفس اليوم بسعر القائمة بدلاً من نسخة مُبالغ في سعرها منه. تظهر صفحة النموذج 0.15 دولار لكل مليون رمز إدخال و0.60 دولار لكل مليون رمز إخراج في نطاق خارج أوقات الذروة، وهو رقم DeepSeek الخاص خارج أوقات الذروة ولا شيء يضاف فوقه. يُعد التحويل التلقائي عند الفشل عبر المزوّدين الميزة غير البرّاقة الأكثر أهمية في أسبوع مثل هذا: عندما يستبدل أحد البائعين النموذج من تحت نقطة نهاية، فإن طبقة التوجيه هي حيث يصبح ذلك تغييرًا في الإعدادات بدلاً من عملية ترحيل.

إذا طُرح نموذج 3T Deep​Seek يوماً ما، فسيقدّمه من يملكون العناقيد القادرة على استيعابه، بسعر تمليه الحوسبة. وطبقة التوجيه نفسها هي المكان الذي ستلقاه فيه — من دون عقد ثانٍ ومن دون إعادة بناء أي شيء.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

السؤال المطروح ليس ما إذا كانت DeepSeek قادرة على بناء نموذج بثلاثة تريليونات معامل. ثلاث أوراق منشورة عن البنية، وتصميم ذاكرة عملي، ونموذج بحجم 552B يقول صانعه إنه يتفوق على سابقه بحجم 1.6T، كلها تشير إلى أن المختبر يعرف كيف يفعل ذلك. السؤال هو ما إذا كان أي شخص سيدفع مقابل تشغيله — ووفقًا لأدلة الأسبوعين الماضيين، فإن DeepSeek نفسها ليست متأكدة. راقب العنقود، لا عدد المعاملات. ستخبرك صفحة التسعير بما تطلقه DeepSeek فعليًا، وذلك أسرع مما سيخبرك به أي تسريب.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا