כרטיס כותרת המציג "דגם ה-3T של DeepSeek" עם כתובית "טענת פרמטרים של 3 טריליון, טבלת זיכרון Engram בנפח 1T, ואשכול מחשוב שלא יגיע לפני 2027", מעל שלושה כרטיסי אייקונים המציגים "3T — פרמטרים: לא מאומת", "~1T — Engram: ניחוש אישי של המחבר" ו"אשכול — לכל המוקדם סוף 2027", עם שורת תחתית "הדלפה ממקור יחיד; אין מאגר קוד, כרטיס מודל או שורת מחירון."
Guides & Insights

מודל ה-3T של DeepSeek: הגדלת המודל שצריכה לחכות לאשכולות

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-14 בספטמבר, Deep​Seek תוציא משימוש את DeepSeek V4 Pro — דגם הדגל בעל 1.6 טריליון פרמטרים שהשיקה לזמינות כללית ב-13 באוגוסט — ותענה לכל קריאה אל deepseek-v4-pro עם DeepSeek V4.1 Flash, המודל בעל 552 מיליארד הפרמטרים ששחררה ב-10 בספטמבר. ארבעה ימים לפני שהוכרז המעבר הזה, עוקב של Deep​Seek תחת שם בדוי פרסם משהו שהצביע לכיוון ההפוך: שהמעבדה עבדה על מודל בעל 3 טריליון פרמטרים, "כנראה עוד Engram עם 1T פרמטרים," ושהסיבה שהוא לא שוחרר היא שיקולים כלכליים, לא חוסר יכולת.

שום דבר על המודל הזה לא אושר. אין שם, אין מאגר, אין קובץ תצורה, אין מדד ביצועים, אין חלון שחרור — פוסט אחד ברשת X, שמקורו ב"סמכות טובה", כשהפרט המעניין ביותר בו מסומן במפורש על ידי מחברו כהשערה. התייחסו אליו כאל אות, לא כעובדה. עדיין כדאי לקרוא אותו, כי שני חלקי הטענה מושכים לכיוונים מנוגדים ורק אחד מהם צפוי לשרוד מגע עם מפת הדרכים של Deep​Seek.

מה שההדלפה אומרת בפועל, ומה שהיא לא אומרת

הפוסט מגיע מחשבון teortaxesTex, צופה ותיק של Deep​Seek שמתאר את עצמו כמעריץ של המעבדה מאז 2023. הוא נכתב במלואו: "למעשה, יש לי מידע מהימן ש-Deep​Seek עבדה על מודל 3T (backbone, כנראה עוד Engram עם 1T פרמטרים, אבל זה השערה שלי). הם פשוט לא היו בטוחים שזה יהיה כדאי כלכלית לבצע post-train ולשרת אותו. כשהאשכולות שלהם יגדלו, נראה..."

לארבעה דברים בשני המשפטים האלה יש משקל, ואחד מהם אינו עובדה כלל. "סמכות טובה" אינה נוקבת בשם. מספר הפרמטרים מגיע כמספר יחיד ללא פיצול בין סה"כ לפעילים. הערת האגב על Engram מתויגת כהשערה על ידי מי שמעלה אותה. ו"כשהאשכולות שלהם גדלים" הוא תנאי ללא תאריך מצורף.

• מה שנטען — שקיים מודל Deep​Seek עם 3 טריליון פרמטרים בשלב כלשהו של פיתוח.

• מה שהוא במפורש הניחוש של המחבר עצמו — שכ־1T ממנו הוא זיכרון אנגרם.

• מה שאינו ידוע — שמו, הארכיטקטורה שלו, מספר הפרמטרים הפעילים, חלון ההקשר, מצב האימון, והאם הוא משווק כמוצר בכלל.

• מה שניתן לאמת כרגע — כלום. אין שום מאגר Deep​Seek, כרטיס מודל, שורת מחיר או ערך תיעוד שמזכיר את זה.

אפילו החשבון עצמו מעורפל. "מודל 3T (backbone, כנראה עוד 1T פרמטרים של Engram)" תומך בשתי קריאות: מודל 3T שמתוכו כ-1T הוא Engram, או backbone של 3T עם עוד 1T של Engram לצידו, כלומר בערך 4T בסך הכול. הפער הזה הוא טריליון פרמטרים, והוא משנה את חשבון ה-serving ביותר ממה שרוב המעבדות מוציאות על ריצת אימון.

כדאי גם לזכור שהרקורד של חשבון זה מעורב ולא ברמת אורקל. הוא קרא את ההודעה של Deep​Seek מ-9 בספטמבר על ניתוב מחדש של תעבורת V4 Pro כראיה לכך שהמעבדה "פתרה בעיות ארכיטקטוניות של משפחת V4" — מסקנה סבירה, ועדיין מסקנה בלבד. בתחילת ספטמבר הוא גם העלה את הרעיון שמודל חמקן אנונימי בפלטפורמת קידוד של צד שלישי הוא Xiaomi MiMo-V3-Flash, שאיש לא אישר. אות מוקדם שימושי; לא מקור מוסמך.

החצי המעניין הוא טבלת הזיכרון, לא מספר הפרמטרים

אנגרמה היא אמיתית, והיא הסיבה לכך שטענת 3T היא סבירה יותר ממה שהיא נשמעת בהתחלה. Deep​Seek פרסמה את הארכיטקטורה של זיכרון מותנה בינואר 2026 עם קוד פתוח מצורף, והיא עושה משהו יוצא דופן: היא מפרידה בין אחזור ידע סטטי לבין חשיבה דינמית. במקום לבזבז כוח חישוב של GPU על אחזור עובדות, המודל מבצע גיבוב (hashing) של ההקשר שלו לטבלאות אמבדינג (embedding) השמורות ב-DRAM ומאחזר בזמן קבוע, ללא עבודת GPU בנתיב החיפוש, ובנוסף מנגנון שער (gating) שמדכא זיכרון שאוחזר כאשר הוא מתנגש עם ההקשר הסובב.

הנתונים ש-Deep​Seek דיווחה על תצורת הבדיקה שלה הם אלה שכדאי לזכור: טבלת הטמעות עם 100 מיליארד פרמטרים שהועברה ל-DRAM עם פגיעה של פחות מ-3% בתפוקה, ודיוק של 97% במבחן "מחט בערמת שחת" ב-1M טוקנים, לעומת 84.2% בקשב סטנדרטי. אלה המספרים של המעבדה עצמה, לא שוחזרו על ידינו. הערכות מוקדמות בלתי תלויות הגיעו, לפי הדיווחים, לטווח של 93–96% באותו אורך הקשר — ברור מעל קו הבסיס, אך מתחת להצהרה.

תגדיל את הרעיון הזה פי עשר וצורת ההדלפה משתנה. אם רוב הפרמטרים הנוספים של מודל 3T הם זיכרון טבלת גיבוב השוכן ב-DRAM, במקום מומחים שמתחרים על HBM — אז "3T" מפסיק להיות סמן מקורב ל"לא ניתן לשרת". מספר הפרמטרים הכולל ועלות הסרווינג מתפצלים. זהו הרעיון החדש באמת בהדלפה הזו, וזה החלק שהמחקר שפורסם תומך בו בפועל.

ההסתייגות היא שהמאמר של Engram, לפי הדיווחים, אינו מתייחס לעומס בזמן ההסקה — זמן השהיה ותפוקה — וזה בדיוק המקום שבו טבלת חיפוש השוכנת ב-DRAM תופיע, אם היא תופיע בכלל. זיכרון שצריך ללכת ולהביא אינו זיכרון שמקבלים בחינם.

A single-column scoreboard titled "DeepSeek's scale ladder — the scoreboard" with six rows: DeepSeek-V4-Flash-0731 at 284B total / 13B active; DeepSeek-V4-Pro-0813 at 1.6T total / 49B active; DeepSeek V4.1 Flash at 552B backbone / 8B prefill, 16B decode; Leaked successor at ~3T, unverified; Engram memory table at ~1T claimed, unverified; and Serving status reading "V4 Pro retired Sept 14; 3T has no cluster date". Footer reads "V4 figures per DeepSeek model cards; 3T and Engram figures unverified, single-source."

מדוע הספטמבר של Deep​Seek עצמו מצביע לכיוון ההפוך

הטענה נגד מוצר 3T שישוחרר בקרוב היא ש־Deep​Seek בדיוק ערכה את הניסוי ב־1.6T וענתה על השאלה של עצמה עם משהו קטן יותר. סולם ה־V4 כפי שהוא עומד היום:

DeepSeek-V4-Flash-0731 — 284B פרמטרים בסך הכל, 13B אקטיביים לכל טוקן.

DeepSeek-V4-Pro-0813 — סך הכול 1.6T, 49B פעילים, משקלים פתוחים תחת רישיון MIT.

DeepSeek V4.1 Flash — עיצוב מקודד-מפענח סיבתי עם 552B פרמטרים בבסיס, המפעיל 8B פרמטרים לכל טוקן בזמן prefill ו-16B בזמן decode.

ב-14 בספטמבר בצהריים לפי שעון בייג'ינג, הדרגה האמצעית יוצאת. Deep​Seek מורידה את V4 Pro מהשירות ומנתבת בקשות עבור deepseek-v4-pro אל V4.1 Flash, בחיוב לפי תעריפי Flash, עד שיהיה V4.1 Pro. דף התמחור הרשמי כולל היום שתי שורות, ואף אחת מהן אינה היורשת של הדגם שהוצא מהשירות מבחינת גודל: deepseek-flash ב-0.30 דולר למיליון טוקנים בקלט ו-1.20 דולר למיליון טוקנים בפלט בשעות השיא, deepseek-v4-pro ב-1.32 ו-3.96 דולר, עם תעריפי שפל במחצית מהנתונים הללו. שתיהן מציינות חלון הקשר של מיליון טוקנים ותקרת פלט של 384,000 טוקנים.

כיוון ההתקדמות אינו עדין. מעבדה שמפרישה את המודל הגדול ביותר שלה לטובת מודל שמפעיל עשירית מהפרמטרים לטוקן כבר הסיקה שהיחידה הכלכלית של יכולת החזית אינה הצ'קפוינט הגדול ביותר שביכולתה לאמן. מודל 3T שבונהו אינו בטוח שניתן "לבצע בו אימון המשך ולשרתו כלכלית" אינו שמועה על היסוס; הוא מתאר מעבדה שיש בידיה כעת נתונים מדודים על החלופה.

פוסט-אימון הוא החצי החד יותר של הבעיה. פוסט-אימון בכל הפרמטרים של סדרת DeepSeek-V4-Pro על גבי CloudMatrix384 SuperPOD של Huawei דווח על ידי פרויקט הצד השלישי SLAI T-Rex ב-MFU של 34.22%, בערך פי 2.93 מתכון הבסיס הפתוח. זה מספר מעודד — מספר של צד שלישי, על מודל של 1.6T. הכפלת ה-backbone מכפילה בקירוב את החשבון לפני שמוגש אסימון בודד.

Screenshot of DeepSeek's official API documentation "Models & Pricing" page, captured September 10 2026, in English, showing two model columns: deepseek-flash (model version DeepSeek-V4.1-Flash) and deepseek-v4-pro (model version DeepSeek-V4-Pro-0813), both listing a 1M context length and a 384K maximum output, a features block where Vision is supported on flash and marked "Not supported" on v4-pro, and a pricing block with peak and off-peak rates including input cache-miss at $0.3 / $1.32 per million tokens and output at $1.2 / $3.96 per million tokens.

כשהאשכולות שלהם גדלים

הסעיף הקריטי בהדלפה הוא האחרון, כי הוא החלק היחיד עם תיעוד פומבי. על פי הדיווחים, Deep​Seek מתכננת לפחות 160,000 מאיצי Ascend 950DT של Huawei במרכז נתונים חדש באולנקאב, מונגוליה הפנימית, בהזמנה המוערכת בכ-2.56 מיליארד דולר — אחד המקבצים הגדולים ביותר של סיליקון בינה מלאכותית מתוצרת סינית שאי פעם נוסו.

ההסתייגויות המצורפות לתוכנית הזו חשובות יותר מהכותרת הראשית. השבבים מיועדים להסקה (inference), לא לאימון: DeepSeek כבר ניסתה לאמן על שבבים של Huawei ועדיין מאמנת על מאיצים של Nvidia, וזה השלב שמודל 3T באמת היה צריך. אספקה עשויה להימשך יותר משנה. קיבולת חלקית צפויה לעלות לרשת בסוף 2027 עד תחילת 2028. בנוסף, אספקת זיכרון בעל רוחב פס גבוה (HBM), לא הלוגיקה, היא שצפויה להגביל כמה יחידות 950DT תוכל Huawei לבנות השנה.

אז הקריאה האופטימית של "כאשר האשכולות שלהם גדלים" מציבה מודל 3T על ציר זמן של 2027–2028 לכל המוקדם, והקריאה הפסימית — שהוא נשאר חפץ מחקרי ולעולם לא הופך למוצר — עקבית עם כל מה ש-Deep​Seek שיחררה ב-2026. סביבת המחשוב סביב המעבדה היא גם מדיניות שנויה במחלוקת ולא שאלה של היצע טהור: ב-8–9 בספטמבר טענו במשותף NSA, FBI ו-CISA כי שש מעבדות סיניות, כולל Deep​Seek, ביצעו זיקוק של מודלים אמריקאיים מתקדמים בקנה מידה תעשייתי, האשמה שמשרד המסחר הסיני דחה. ככל שיחליטו לחשוב על ההאשמה, שחרור שתלוי בגידול האשכולות תלוי בהחלטות שאיש בתוך Deep​Seek אינו שולט בהן.

מה יהפוך את זה מדליפה להשקה?

הרשימה קצרה וממוקדת, ואף אחד מהפריטים בה לא הופעל עדיין:

• מאגר תחת ארגון deepseek-ai ב-Hugging Face, עם שם checkpoint מגרסה ולא slug של משפחה.

• שורה חדשה בעמוד המודלים והתמחור של DeepSeek.

• רשומה מתוארכת בפיד החדשות של תיעוד ה-API, בפורמט newsYYMMDD הרגיל של המעבדה.

• מזהה דגם, לא שם משפחה — גרסאות DeepSeek הן נקודות ביקורת, ומזהה משפחה חשוף פירושו עד כה תצוגה מקדימה.

אבן הדרך הקרובה יותר היא V4.1 Pro, שחבר צוות Deep​Seek התייחס אליה ב-9 בספטמבר כאל נקודת הסיום של חלון הניתוב. אין לה מפרטים שפורסמו, אין ספירת פרמטרים, אין מחיר ואין גם תאריך. במובן מסוים, V4.1 Pro הוא המבחן של ההדלפה הזו: אם הדגם הדגל הבא יגיע בערך ל־1.6T של V4 Pro או מתחת, הטענה של 3T החליקה לפחות דור אחד.

מה כל זה אומר אם אתם בוחרים דגם השבוע

מודל 3T אינו החלטת רכישה ב-2026, והלקח המעשי מספטמבר של DeepSeek אינו נוגע לגודל כלל. הוא שהמודל שמאחורי נקודת קצה יכול להשתנות בעוד שמה של נקודת הקצה נשאר זהה לחלוטין. כל מי שקורא deepseek-v4-pro דרך שכבת הפשטה מקבל מודל שונה, קטן יותר וזול יותר ב-14 בספטמבר מבלי לגעת בקוד שלהם. כל מי שמחובר ישירות למימוש של ספק יחיד עבור אותו מזהה מקבל כל מה שהספק הזה מחליט לעשות.

גם DeepSeek V4.1 Flash וגם DeepSeek V4 Pro זמינים ב־OrcaRouter תחת מפתח אחד עם 0% markup — מחיר הרשימה של הספק מועבר ישירות, מה שאומר ששינוי התמחור של DeepSeek מ־10 בספטמבר פעיל כאן באותו היום במחיר הרשימה, לא בגרסה עם תוספת מחיר כלשהי. עמוד המודל מציג $0.15 למיליון אסימוני קלט ו־$0.60 למיליון אסימוני פלט בחגורת השפל, וזה המספר של DeepSeek עצמו ללא כל תוספת. failover אוטומטי בין ספקים הוא התכונה הלא־זוהרת שהכי חשובה בשבוע כמו זה: כשספק מחליף את המודל מתחת לנקודת קצה, שכבת הניתוב היא מה שהופך את זה לשינוי קונפיגורציה במקום למיגרציה.

אם מודל Deep​Seek 3T אי פעם יישלח, הוא יוגש על ידי מי שיש לו את המקבצים להחזיק אותו, במחיר שהחישוב קובע. אותה שכבת ניתוב היא המקום שבו תפגוש אותו — בלי חוזה שני ובלי לבנות מחדש דבר.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, captured September 10 2026, in English, showing a p50 time-to-first-token of 287 milliseconds, an OpenAI-compatible base URL of api.orcarouter.ai/v1, a Python code sample calling the model by that ID, and an off-peak price block reading input $0.150 per million tokens, output $0.600 per million tokens and cache read $0.0030 per million tokens.

השאלה הפתוחה אינה האם Deep​Seek יכול לבנות מודל עם 3 טריליון פרמטרים. שלושה מאמרי ארכיטקטורה שפורסמו, עיצוב של זיכרון עבודה ומודל 552B שלפי יוצריו עולה על קודמו בעל 1.6T — כל אלה מצביעים על כך שהמעבדה יודעת איך. השאלה היא אם מישהו ישלם כדי לשרת אותו — ולפי הראיות של השבועיים האחרונים, Deep​Seek עצמה לא בטוחה. צפו באשכול המחשוב, לא במספר הפרמטרים. עמוד התמחור יאמר לכם מה Deep​Seek בעצם שולחת, מהר יותר מכל הדלפה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית