
מודל ה-3T של DeepSeek: הגדלת המודל שצריכה לחכות לאשכולות
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
ב-14 בספטמבר, DeepSeek תוציא משימוש את DeepSeek V4 Pro — דגם הדגל בעל 1.6 טריליון פרמטרים שהשיקה לזמינות כללית ב-13 באוגוסט — ותענה לכל קריאה אל deepseek-v4-pro עם DeepSeek V4.1 Flash, המודל בעל 552 מיליארד הפרמטרים ששחררה ב-10 בספטמבר. ארבעה ימים לפני שהוכרז המעבר הזה, עוקב של DeepSeek תחת שם בדוי פרסם משהו שהצביע לכיוון ההפוך: שהמעבדה עבדה על מודל בעל 3 טריליון פרמטרים, "כנראה עוד Engram עם 1T פרמטרים," ושהסיבה שהוא לא שוחרר היא שיקולים כלכליים, לא חוסר יכולת.
שום דבר על המודל הזה לא אושר. אין שם, אין מאגר, אין קובץ תצורה, אין מדד ביצועים, אין חלון שחרור — פוסט אחד ברשת X, שמקורו ב"סמכות טובה", כשהפרט המעניין ביותר בו מסומן במפורש על ידי מחברו כהשערה. התייחסו אליו כאל אות, לא כעובדה. עדיין כדאי לקרוא אותו, כי שני חלקי הטענה מושכים לכיוונים מנוגדים ורק אחד מהם צפוי לשרוד מגע עם מפת הדרכים של DeepSeek.
מה שההדלפה אומרת בפועל, ומה שהיא לא אומרת
הפוסט מגיע מחשבון teortaxesTex, צופה ותיק של DeepSeek שמתאר את עצמו כמעריץ של המעבדה מאז 2023. הוא נכתב במלואו: "למעשה, יש לי מידע מהימן ש-DeepSeek עבדה על מודל 3T (backbone, כנראה עוד Engram עם 1T פרמטרים, אבל זה השערה שלי). הם פשוט לא היו בטוחים שזה יהיה כדאי כלכלית לבצע post-train ולשרת אותו. כשהאשכולות שלהם יגדלו, נראה..."
לארבעה דברים בשני המשפטים האלה יש משקל, ואחד מהם אינו עובדה כלל. "סמכות טובה" אינה נוקבת בשם. מספר הפרמטרים מגיע כמספר יחיד ללא פיצול בין סה"כ לפעילים. הערת האגב על Engram מתויגת כהשערה על ידי מי שמעלה אותה. ו"כשהאשכולות שלהם גדלים" הוא תנאי ללא תאריך מצורף.
• מה שנטען — שקיים מודל DeepSeek עם 3 טריליון פרמטרים בשלב כלשהו של פיתוח.
• מה שהוא במפורש הניחוש של המחבר עצמו — שכ־1T ממנו הוא זיכרון אנגרם.
• מה שאינו ידוע — שמו, הארכיטקטורה שלו, מספר הפרמטרים הפעילים, חלון ההקשר, מצב האימון, והאם הוא משווק כמוצר בכלל.
• מה שניתן לאמת כרגע — כלום. אין שום מאגר DeepSeek, כרטיס מודל, שורת מחיר או ערך תיעוד שמזכיר את זה.
אפילו החשבון עצמו מעורפל. "מודל 3T (backbone, כנראה עוד 1T פרמטרים של Engram)" תומך בשתי קריאות: מודל 3T שמתוכו כ-1T הוא Engram, או backbone של 3T עם עוד 1T של Engram לצידו, כלומר בערך 4T בסך הכול. הפער הזה הוא טריליון פרמטרים, והוא משנה את חשבון ה-serving ביותר ממה שרוב המעבדות מוציאות על ריצת אימון.
כדאי גם לזכור שהרקורד של חשבון זה מעורב ולא ברמת אורקל. הוא קרא את ההודעה של DeepSeek מ-9 בספטמבר על ניתוב מחדש של תעבורת V4 Pro כראיה לכך שהמעבדה "פתרה בעיות ארכיטקטוניות של משפחת V4" — מסקנה סבירה, ועדיין מסקנה בלבד. בתחילת ספטמבר הוא גם העלה את הרעיון שמודל חמקן אנונימי בפלטפורמת קידוד של צד שלישי הוא Xiaomi MiMo-V3-Flash, שאיש לא אישר. אות מוקדם שימושי; לא מקור מוסמך.
החצי המעניין הוא טבלת הזיכרון, לא מספר הפרמטרים
אנגרמה היא אמיתית, והיא הסיבה לכך שטענת 3T היא סבירה יותר ממה שהיא נשמעת בהתחלה. DeepSeek פרסמה את הארכיטקטורה של זיכרון מותנה בינואר 2026 עם קוד פתוח מצורף, והיא עושה משהו יוצא דופן: היא מפרידה בין אחזור ידע סטטי לבין חשיבה דינמית. במקום לבזבז כוח חישוב של GPU על אחזור עובדות, המודל מבצע גיבוב (hashing) של ההקשר שלו לטבלאות אמבדינג (embedding) השמורות ב-DRAM ומאחזר בזמן קבוע, ללא עבודת GPU בנתיב החיפוש, ובנוסף מנגנון שער (gating) שמדכא זיכרון שאוחזר כאשר הוא מתנגש עם ההקשר הסובב.
הנתונים ש-DeepSeek דיווחה על תצורת הבדיקה שלה הם אלה שכדאי לזכור: טבלת הטמעות עם 100 מיליארד פרמטרים שהועברה ל-DRAM עם פגיעה של פחות מ-3% בתפוקה, ודיוק של 97% במבחן "מחט בערמת שחת" ב-1M טוקנים, לעומת 84.2% בקשב סטנדרטי. אלה המספרים של המעבדה עצמה, לא שוחזרו על ידינו. הערכות מוקדמות בלתי תלויות הגיעו, לפי הדיווחים, לטווח של 93–96% באותו אורך הקשר — ברור מעל קו הבסיס, אך מתחת להצהרה.
תגדיל את הרעיון הזה פי עשר וצורת ההדלפה משתנה. אם רוב הפרמטרים הנוספים של מודל 3T הם זיכרון טבלת גיבוב השוכן ב-DRAM, במקום מומחים שמתחרים על HBM — אז "3T" מפסיק להיות סמן מקורב ל"לא ניתן לשרת". מספר הפרמטרים הכולל ועלות הסרווינג מתפצלים. זהו הרעיון החדש באמת בהדלפה הזו, וזה החלק שהמחקר שפורסם תומך בו בפועל.
ההסתייגות היא שהמאמר של Engram, לפי הדיווחים, אינו מתייחס לעומס בזמן ההסקה — זמן השהיה ותפוקה — וזה בדיוק המקום שבו טבלת חיפוש השוכנת ב-DRAM תופיע, אם היא תופיע בכלל. זיכרון שצריך ללכת ולהביא אינו זיכרון שמקבלים בחינם.

מדוע הספטמבר של DeepSeek עצמו מצביע לכיוון ההפוך
הטענה נגד מוצר 3T שישוחרר בקרוב היא ש־DeepSeek בדיוק ערכה את הניסוי ב־1.6T וענתה על השאלה של עצמה עם משהו קטן יותר. סולם ה־V4 כפי שהוא עומד היום:
• DeepSeek-V4-Flash-0731 — 284B פרמטרים בסך הכל, 13B אקטיביים לכל טוקן.
• DeepSeek-V4-Pro-0813 — סך הכול 1.6T, 49B פעילים, משקלים פתוחים תחת רישיון MIT.
• DeepSeek V4.1 Flash — עיצוב מקודד-מפענח סיבתי עם 552B פרמטרים בבסיס, המפעיל 8B פרמטרים לכל טוקן בזמן prefill ו-16B בזמן decode.
ב-14 בספטמבר בצהריים לפי שעון בייג'ינג, הדרגה האמצעית יוצאת. DeepSeek מורידה את V4 Pro מהשירות ומנתבת בקשות עבור deepseek-v4-pro אל V4.1 Flash, בחיוב לפי תעריפי Flash, עד שיהיה V4.1 Pro. דף התמחור הרשמי כולל היום שתי שורות, ואף אחת מהן אינה היורשת של הדגם שהוצא מהשירות מבחינת גודל: deepseek-flash ב-0.30 דולר למיליון טוקנים בקלט ו-1.20 דולר למיליון טוקנים בפלט בשעות השיא, deepseek-v4-pro ב-1.32 ו-3.96 דולר, עם תעריפי שפל במחצית מהנתונים הללו. שתיהן מציינות חלון הקשר של מיליון טוקנים ותקרת פלט של 384,000 טוקנים.
כיוון ההתקדמות אינו עדין. מעבדה שמפרישה את המודל הגדול ביותר שלה לטובת מודל שמפעיל עשירית מהפרמטרים לטוקן כבר הסיקה שהיחידה הכלכלית של יכולת החזית אינה הצ'קפוינט הגדול ביותר שביכולתה לאמן. מודל 3T שבונהו אינו בטוח שניתן "לבצע בו אימון המשך ולשרתו כלכלית" אינו שמועה על היסוס; הוא מתאר מעבדה שיש בידיה כעת נתונים מדודים על החלופה.
פוסט-אימון הוא החצי החד יותר של הבעיה. פוסט-אימון בכל הפרמטרים של סדרת DeepSeek-V4-Pro על גבי CloudMatrix384 SuperPOD של Huawei דווח על ידי פרויקט הצד השלישי SLAI T-Rex ב-MFU של 34.22%, בערך פי 2.93 מתכון הבסיס הפתוח. זה מספר מעודד — מספר של צד שלישי, על מודל של 1.6T. הכפלת ה-backbone מכפילה בקירוב את החשבון לפני שמוגש אסימון בודד.

כשהאשכולות שלהם גדלים
הסעיף הקריטי בהדלפה הוא האחרון, כי הוא החלק היחיד עם תיעוד פומבי. על פי הדיווחים, DeepSeek מתכננת לפחות 160,000 מאיצי Ascend 950DT של Huawei במרכז נתונים חדש באולנקאב, מונגוליה הפנימית, בהזמנה המוערכת בכ-2.56 מיליארד דולר — אחד המקבצים הגדולים ביותר של סיליקון בינה מלאכותית מתוצרת סינית שאי פעם נוסו.
ההסתייגויות המצורפות לתוכנית הזו חשובות יותר מהכותרת הראשית. השבבים מיועדים להסקה (inference), לא לאימון: DeepSeek כבר ניסתה לאמן על שבבים של Huawei ועדיין מאמנת על מאיצים של Nvidia, וזה השלב שמודל 3T באמת היה צריך. אספקה עשויה להימשך יותר משנה. קיבולת חלקית צפויה לעלות לרשת בסוף 2027 עד תחילת 2028. בנוסף, אספקת זיכרון בעל רוחב פס גבוה (HBM), לא הלוגיקה, היא שצפויה להגביל כמה יחידות 950DT תוכל Huawei לבנות השנה.
אז הקריאה האופטימית של "כאשר האשכולות שלהם גדלים" מציבה מודל 3T על ציר זמן של 2027–2028 לכל המוקדם, והקריאה הפסימית — שהוא נשאר חפץ מחקרי ולעולם לא הופך למוצר — עקבית עם כל מה ש-DeepSeek שיחררה ב-2026. סביבת המחשוב סביב המעבדה היא גם מדיניות שנויה במחלוקת ולא שאלה של היצע טהור: ב-8–9 בספטמבר טענו במשותף NSA, FBI ו-CISA כי שש מעבדות סיניות, כולל DeepSeek, ביצעו זיקוק של מודלים אמריקאיים מתקדמים בקנה מידה תעשייתי, האשמה שמשרד המסחר הסיני דחה. ככל שיחליטו לחשוב על ההאשמה, שחרור שתלוי בגידול האשכולות תלוי בהחלטות שאיש בתוך DeepSeek אינו שולט בהן.
מה יהפוך את זה מדליפה להשקה?
הרשימה קצרה וממוקדת, ואף אחד מהפריטים בה לא הופעל עדיין:
• מאגר תחת ארגון deepseek-ai ב-Hugging Face, עם שם checkpoint מגרסה ולא slug של משפחה.
• שורה חדשה בעמוד המודלים והתמחור של DeepSeek.
• רשומה מתוארכת בפיד החדשות של תיעוד ה-API, בפורמט newsYYMMDD הרגיל של המעבדה.
• מזהה דגם, לא שם משפחה — גרסאות DeepSeek הן נקודות ביקורת, ומזהה משפחה חשוף פירושו עד כה תצוגה מקדימה.
אבן הדרך הקרובה יותר היא V4.1 Pro, שחבר צוות DeepSeek התייחס אליה ב-9 בספטמבר כאל נקודת הסיום של חלון הניתוב. אין לה מפרטים שפורסמו, אין ספירת פרמטרים, אין מחיר ואין גם תאריך. במובן מסוים, V4.1 Pro הוא המבחן של ההדלפה הזו: אם הדגם הדגל הבא יגיע בערך ל־1.6T של V4 Pro או מתחת, הטענה של 3T החליקה לפחות דור אחד.
מה כל זה אומר אם אתם בוחרים דגם השבוע
מודל 3T אינו החלטת רכישה ב-2026, והלקח המעשי מספטמבר של DeepSeek אינו נוגע לגודל כלל. הוא שהמודל שמאחורי נקודת קצה יכול להשתנות בעוד שמה של נקודת הקצה נשאר זהה לחלוטין. כל מי שקורא deepseek-v4-pro דרך שכבת הפשטה מקבל מודל שונה, קטן יותר וזול יותר ב-14 בספטמבר מבלי לגעת בקוד שלהם. כל מי שמחובר ישירות למימוש של ספק יחיד עבור אותו מזהה מקבל כל מה שהספק הזה מחליט לעשות.
גם DeepSeek V4.1 Flash וגם DeepSeek V4 Pro זמינים ב־OrcaRouter תחת מפתח אחד עם 0% markup — מחיר הרשימה של הספק מועבר ישירות, מה שאומר ששינוי התמחור של DeepSeek מ־10 בספטמבר פעיל כאן באותו היום במחיר הרשימה, לא בגרסה עם תוספת מחיר כלשהי. עמוד המודל מציג $0.15 למיליון אסימוני קלט ו־$0.60 למיליון אסימוני פלט בחגורת השפל, וזה המספר של DeepSeek עצמו ללא כל תוספת. failover אוטומטי בין ספקים הוא התכונה הלא־זוהרת שהכי חשובה בשבוע כמו זה: כשספק מחליף את המודל מתחת לנקודת קצה, שכבת הניתוב היא מה שהופך את זה לשינוי קונפיגורציה במקום למיגרציה.
אם מודל DeepSeek 3T אי פעם יישלח, הוא יוגש על ידי מי שיש לו את המקבצים להחזיק אותו, במחיר שהחישוב קובע. אותה שכבת ניתוב היא המקום שבו תפגוש אותו — בלי חוזה שני ובלי לבנות מחדש דבר.

השאלה הפתוחה אינה האם DeepSeek יכול לבנות מודל עם 3 טריליון פרמטרים. שלושה מאמרי ארכיטקטורה שפורסמו, עיצוב של זיכרון עבודה ומודל 552B שלפי יוצריו עולה על קודמו בעל 1.6T — כל אלה מצביעים על כך שהמעבדה יודעת איך. השאלה היא אם מישהו ישלם כדי לשרת אותו — ולפי הראיות של השבועיים האחרונים, DeepSeek עצמה לא בטוחה. צפו באשכול המחשוב, לא במספר הפרמטרים. עמוד התמחור יאמר לכם מה DeepSeek בעצם שולחת, מהר יותר מכל הדלפה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
