כרטיס כותרת הירו עם הכיתוב DeepSeek V4.1 Flash ב-OpenCode, מעל כותרת עליונה של Coding-agent playbook - ספטמבר 2026 וכתובית משנה על שלוש אינטגרציות שאומתו היום וחוגת המאמץ שמחליטה אם זה יסתיים, עם ארבעה צ'יפים עם הכיתוב OpenCode Go $10/חודש, off-peak $0.15 / $0.60 לכל 1M, פריסטים של מאמץ: נמוך 50, גבוה 75, מקסימום 100, ו-AA Intelligence Index 40, ובתחתית הערה שהפריסטים של המאמץ מדווחים על ידי הקהילה.
Guides & Insights

DeepSeek V4.1 Flash ב־OpenCode: הגדרות, עלות והחוגה למאמץ שאיש לא מזכיר

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

DeepSeek V4.1 Flash יושב ב-OpenCode Go מאז 10 בספטמבר, ולמכפיל ש-OpenCode הצמיד לו יש תאריך סיום מפורסם: 20 בספטמבר. זה בעוד ארבעה ימים. החלק המעניין אינו המועד האחרון — אלא שההגדרה שקובעת אם נעים לכתוב קוד עם המודל הזה חסרה מכל מדריך הגדרה בעמוד הראשון של התוצאות, ולפחות בשני הרנסים היא מושמטת בשקט. זהו פלייבוק להפניית סוכן קידוד אל DeepSeek V4.1 Flash: מזהי המודל המדויקים, שלוש האינטגרציות שאומתו היום, בקרת מאמץ החשיבה שדווחה על ידי הקהילה, ומצב הכשל של חשיבת יתר עם מנגנוני ההקלה שבאמת עובדים.

למה אתה בעצם מכוון את הסוכן שלך

DeepSeek V4.1 Flash שוחרר ב-2026-09-10 — הודעת השחרור בתיעוד ה-API של DeepSeek עצמה מתוארכת לאותו יום, והוא המודל הקטן ביותר במשפחת הארכיטקטורה החדשה של הספק. DeepSeek מדווחת על עמוד שדרה מבוסס mixture-of-experts עם 552B פרמטרים, הבנוי על מה שהיא מכנה תכנון Causal Encoder–Decoder, אשר מפעיל בערך 8B פרמטרים לטוקן במהלך prefill ו-16B במהלך decode. הוא מקבל טקסט ותמונות כקלט ומחזיר טקסט, מציע חלון הקשר של עד מיליון טוקנים, ויייצר עד 384,000 טוקנים בתגובה אחת — תקרות ההקשר והפלט מגיעות שתיהן מדף המודל של OrcaRouter עבור המודל, שבו רשומים 1,048,576 ו-384,000 בהתאמה.

הבנצ'מרקים של הספק, מהתרשים בדף ההשקה של DeepSeek ולכן הם מדווחים על ידי הספק ואינם מבוקרים: 30.0 ב-Terminal-Bench 3.0, 74.2 ב-DeepSWE v1.1, 88.1 ב-CyberGym, 54.8 ב-Automation-Bench, ו-90.9 ב-GPQA Diamond. הניקוד הבלתי תלוי דליל יותר, אך הוא קיים — Artificial Analysis, כפי שנקרא ישירות היום, מציב את DeepSeek V4.1 Flash על 40 במדד האינטליגנציה שלו, מדורג שישי מבין 113 בקטגוריית ההשוואה שלו. שורה אחת מאותו עמוד חשובה לקורא של סוכן קוד יותר מאשר הדירוג: Artificial Analysis מתייגת את המודל כרב-מלל מאוד, לאחר שצרך 250 מיליון טוקני פלט כדי להשלים את הרצת מדד האינטליגנציה שלו, לעומת חציון של 140 מיליון. נחזור לכך.

שתי עובדות בנוגע לשמות חוסכות זמן איתור באגים אמיתי. מזהה מודל ה-API הקנוני של DeepSeek הוא כעת code>deepseek-flash/code>. המחרוזות הישנות יותר code>deepseek-v4-flash/code> ו-code>deepseek-v4-flash-vision-exp/code> עדיין מתקבלות, אבל המודלים שמאחוריהן הוצאו מכלל שימוש, והבקשות מוגשות על ידי V4.1 Flash במחיר של Flash. לחוד, DeepSeek V4 Pro לא נעלם: התיעוד של DeepSeek מציין ששירות ה-API של V4 Pro ממשיך גם אחרי 2026-09-14 עם חיוב ללא שינוי. אם אמרו לך שספינת הדגל כובתה, זה לא מה שהמסמכים של הספק עצמו אומרים.

Single-column scoreboard titled DeepSeek V4.1 Flash in coding agents, with six rows reading Released 2026-09-10, Context window 1,048,576, Max output 384,000, Price per 1M $0.15 / $0.60 off-peak, Peak price per 1M $0.30 / $1.20, and AA Intelligence Index 40, #6 of 113, over a footer citing DeepSeek and OpenCode Go documentation for price and limits and Artificial Analysis for the index.

OpenCode: שני נתיבים פנימה, וה-ID שצריך להקליד בפועל

ישנן שתי דרכים להציב את DeepSeek V4.1 Flash מאחורי OpenCode, ולכל אחת מהן כלכלה שונה.

מסלול המנוי הוא OpenCode Go, תוכנית של 10$ בחודש ש-OpenCode מתארת כאוסף נבחר של מודלים פתוחים לקידוד שהיא בחנה ומדדה. ההגדרה היא בארבעה שלבים ואין קובץ קונפיגורציה לערוך ידנית: התחברו ל-OpenCode Zen, הירשמו ל-Go, העתיקו את מפתח ה-API, ואז הריצו code>/connect/code> ב-TUI, בחרו OpenCode Go והדביקו את המפתח. לאחר מכן code>/models/code> מציג את מה שזמין. הפניות למודלים בקונפיגורציה הן מהצורה code>opencode-go/<model-id>/code>.

איזה מזהה מודל? שניהם. רשימת המודלים של שער ה-Go עצמו, שנשלפה היום מ-code>https://opencode.ai/zen/go/v1/models/code>, מחזירה code>deepseek-flash/code> ו-code>deepseek-v4.1-flash/code> כשני ערכים נפרדים, לצד הוותיקים code>deepseek-v4-flash/code> ו-code>deepseek-v4-pro/code>. כל אחד משני השמות הראשונים מפנה למודל הרצוי; code>deepseek-flash/code> הוא השם הקנוני והבחירה הבטוחה יותר לכל דבר שאתם מתכוונים להמשיך להריץ.

המסלול הישיר מדלג לחלוטין על המנוי: הרץ code>/connect/code>, חפש את DeepSeek, והדבק מפתח פלטפורמה של DeepSeek. לאחר מכן תחויב על ידי DeepSeek במחיר המחירון, במקום למשוך ממכסת Go. DeepSeek מפרסמת את מחיר המחירון כך: בשעות שפל $0.15 לכל 1M טוקני קלט ו-$0.60 לכל 1M טוקני פלט, עם קריאות ממטמון ב-$0.003 לכל 1M — וכפול בדיוק מכך בשעות עומס. גם התיעוד של OpenCode Go וגם עמוד המודל של OrcaRouter, כפי שנקראו היום, מסכימים על הנתונים האלה.

מה ש-OpenCode Go מוסיף הוא מבנה המכסה, וכאן כדאי לקרוא את המספרים בקפידה, מפני שהם הסיבה שלמועד האחרון יש חשיבות. במסמכים של OpenCode עצמו מופיע DeepSeek V4.1 Flash עם מגבלה חודשית של $15, שכרגע מוכפלת פי 4 ל-$60 במסגרת מבצע ש-OpenCode מסמן כ"מסתיים ב-20 בספטמבר". מספרי הבקשות המשוערים מפורסמים בשתי עמודות: 6,500 לכל 5 שעות / 16,250 לשבוע / 32,500 לחודש בתעריף הרגיל, או 26,000 / 65,000 / 130,000 כשמכפיל ה-4× מיושם. צורת המכסה עקבית בין המודלים — מגבלת 5 השעות היא 20% מהנתון החודשי, המגבלה השבועית היא 50%, והמגבלה החודשית היא מלוא הכמות.

אלה המספרים ש-OpenCode פרסמה, כפי שנקראו היום מתיעוד ה-Go שלה. סיום המבצע נתון להחלטת OpenCode, ויש לו תאריך.

Screenshot of the OpenCode Go documentation pricing table showing the DeepSeek V4.1 Flash off-peak row at $0.15 input, $0.60 output and $0.003 cached read per 1M tokens with a monthly limit of $15 raised to $60 under a 4x promotion ending Sep 20, the DeepSeek V4.1 Flash peak row at $0.30 input, $1.20 output and $0.006 cached read with the same $15 to $60 limit, and a footnote stating peak hours are 01:00-04:00 and 06:00-10:00 UTC Monday through Friday with all other hours including weekends off-peak.

Command Code: עדיין פעיל, ודיווח באג שכדאי להכיר

הקטלוג של Command Code עצמו עדיין מציג את המודל נכון להיום, תחת המזהה code>deepseek-v4-1-flash/code>, עם חלון הקשר של מיליון טוקנים ואותה כלכלת תמחור ישירה: $0.15 / $0.60 בשעות שפל, $0.30 / $1.20 בשעות שיא, $0.003 לקריאה מהמטמון. המחירים הזהים בשני הרנסים בלתי־תלויים אינם צירוף מקרים — שניהם מעבירים הלאה את מחיר המחירון של DeepSeek במקום לקבוע מחיר משלהם.

המכניקה פשוטה. התקן עם code>npm i -g command-code/code>, הרץ אותו מתיקיית הפרויקט שלך, והזדהה עם code>/login/code>, והשתמש ב code>/connect/code> אם ברצונך להביא מפתח ספק משלך. code>/model <id>/code> מחיל שינוי מודל ישירות, בעוד ש code>/model/code> בלבד פותח בורר, ו code>/effort/code> מגדיר מאמץ חשיבה עבור המודל הנוכחי — הדגל שהכי חשוב כאן.

דיווח באג אחד מהקהילה שווה לשמור בראש לפני שאתם מדבגים את השכבה הלא נכונה. תקלה פתוחה נגד שכבת ניתוב של צד שלישי מתארת מטמון שחזור של תוכן חשיבה שלעולם אינו מופעל עבור המזהה code>command-code/deepseek-v4.1-flash/code>, מכיוון שהתבנית ששכבת הניתוב מתאימה לה מצפה ל-code>v4./code> או code>v4-/code> כמקטע, והמחרוזת היא code>v4.1/code>. התסמין המדווח הוא שגיאות 400 מהמעלה שמתלוננות שתוכן חשיבה שנוצר במצב חשיבה חייב להיות מוחזר בחזרה ל-API. זהו דיווח באג של הקהילה על מנגנון התאמה בצד הלקוח, לא הנחיות של הספק ולא בעיה במודל — אבל זה בדיוק מסוג הדברים שנראים כמו תקלה במודל בשתיים לפנות בוקר.

Claude Code, Codex, והלקוחות ש-OpenCode עצמו אימת

OpenCode Go אינו מיועד ל-OpenCode בלבד, והתיעוד שלהם אומר זאת במפורש: הוא מיועד ל-OpenCode ולסוכני קוד אחרים שמייצרים דפוסי בקשות דומים, עם רשימה שפורסמה של לקוחות שאומתו לעבוד. הרשימה הזו מציינת כיום את Hermes, Claude Code, Codex, ZCode ו-Pi — ועבור Claude Code ההערה היא שהוא "מזהה את כותרת הסשן המקורית שלו. אין צורך בעטיפת כותרת מותאמת אישית." עם זה מגיעות שתי דרישות: לזהות את הלקוח שלך עם ה-user agent שלו ולא עם שם SDK גנרי, ולשלוח מזהה סשן יציב בכותרת code>x-opencode-session/code> בכל שיחה, וזה מה שמאפשר לניתוב ולמטמון הפרומפטים שלהם לעבוד. עבור Hermes הבילד המאומת חשוב — תיקון הכותרת מוזג לאחר v0.21.0, כך שהגרסה הזו לבדה אינה כוללת אותו.

קיים גם מסלול ללא מנוי כלל, תוך שימוש ישיר בנקודת הקצה התואמת ל-Anthropic של DeepSeek. יש להגדיר את code>ANTHROPIC_BASE_URL/code> לערך code>https://api.deepseek.com/anthropic/code>, code>ANTHROPIC_AUTH_TOKEN/code> למפתח ה-DeepSeek שלך, ולהצביע את משתני המודל על המודל. שמות המודלים של Claude ממופים מחדש בדרך פנימה: כל דבר שמתחיל ב-code>claude-opus/code> מופנה ל-DeepSeek V4 Pro ומחויב לפי מחיר V4 Pro, ואילו code>claude-sonnet/code> ושמות code>claude-haiku/code> מופנים למודל Flash. הסיומת code>[1m]/code> במחרוזת המודל מבקשת את וריאנט ההקשר של מיליון טוקנים. המדריך של DeepSeek עצמו להגדרה זו מגדיר גם code>CLAUDE_CODE_EFFORT_LEVEL=max/code> ומקבע את חלון הדחיסה האוטומטית על 786432 טוקנים.

המשתנה האחרון הזה הוא המקום שבו נמצא תיקון קהילתי. קיים פרוקסי עוקף משום שבניות אחרונות של Claude Code שולחות code>thinking: {"type": "disabled"}/code> בבקשות של תת-סוכן בעוד שcode>CLAUDE_CODE_EFFORT_LEVEL=max/code> מוסיף פרמטר של מאמץ חשיבה, ונקודת הקצה של DeepSeek בפורמט Anthropic דוחה את הצירוף הזה עם הודעה שלפיה לא ניתן להשבית אפשרויות חשיבה כאשר מוגדר מאמץ חשיבה. העקיפה המדווחת היא צרה — להסיר את פרמטר המאמץ רק מבקשות של תת-סוכן, ולהשאיר את הסוכן הראשי ללא שינוי. התייחס לכך כממצא קהילתי על אי-התאמה בחוזה שבין לקוח לשרת, וצפה שגבול הגרסה המדויק יזוז.

חוגת המאמץ: 1–100, ולמה "נמוך" פירושו 50

כל מה שמופיע בסעיף הזה הוא ממצא קהילתי ולא הנחיות של ספק. DeepSeek אינה מפרסמת מיפוי של preset למספר שאותו נוכל לאמת, והמספרים שלהלן מגיעים מפרסומים של אנשי מקצוע ומתיעוד של רתמות בדיקה של צד שלישי. הם עקביים מספיק בין המקורות כדי להיות שימושיים, אך לא מאומתים מספיק, כך שכדאי לבדוק אותם בעבודה שלך.

DeepSeek V4.1 Flash מאומן עם סקלר רציף של מאמץ חשיבה מ-1 עד 100. זה אינו תקרת טוקנים — הוא מזיז את המקום שבו המודל יושב על עקומה שתהליך האימון למד, כאשר מאמץ נמוך יותר מפעיל יותר לחץ להיות תמציתי ומאמץ גבוה יותר הופך חשיבה נוספת לזולה יותר. שלושה פריסטים ציבוריים ממופים לסקאלה הזו:

• נמוך — 50, המסלול הקצר ביותר, והפריסט שמעניק לבקרה את המוניטין שלה כזולה.

• גבוה — 75, והרמה שרוב מקורות הקהילה מתארים כתקרה השפויה לעבודת סוכנים.

• Max — 100, כאשר הקנס על אורך ההיסק מוסר לחלוטין.

מה שהדיאל קונה הוא אמיתי אך פוחת בחדות. סבב בנצ'מרק קהילתי אחד דיווח שהעלאת המאמץ מ-25 ל-100 הזיזה את Terminal-Bench 2.1 מ-82.4 ל-90.6, תוך הגדלה של פי כ-2.5 באסימוני הפלט בסך הכול. הדיווחים מתכנסים לכך שמאמץ שבין 60 ל-80 לוכד את רוב הדיוק הזמין בפחות ממחצית מתקציב האסימונים, כאשר מקסימום מוסיף פי 1.6–1.8 נוספים למסלולי הסוכן עבור רווח שולי.

ברירת המחדל היא החלק שאיש אינו מסכים עליו. חלק מתיעוד ה-harness ודיווחים של מתרגלים אומרים ש-effort שלא הוגדר מתפרש כ-high; אחרים מתארים את ברירת המחדל של השרת כפשוט לא ידועה. מה שמתועד ולא נתון לוויכוח הוא ששתי אינטגרציות harness לא שולחות את הפרמטר כלל — פרופיל הספק OpenCode Go ופרופיל DeepSeek נייטיבי, שניהם לא פלטו את code>reasoning_effort/code> עבור ה־code>deepseek-flash/code> slug, מפני שבדיקת ההתאמה שלהם ציפתה לקידומת code>deepseek-v…/code> שאין למזהה הקנוני. בשני המקרים ההגדרה שנבחרה על ידי המשתמש הוחלפה בשקט בברירת המחדל של הספק. אם הלקוח שלך מציג בקרת effort, אין בכך ראיה שהיא נשלחת בפועל. רשום גוף בקשה אחד ובדוק.

עוד דבר מוזר מאותם דוחות: נקודת הקצה של OpenCode Go מקבלת code>low/code>, code>medium/code>, code>high/code> וcode>max/code>, אבל דוחה effort כמספר שלם — דווח שערך של 80 מחזיר HTTP 400. החוגה 1–100 קיימת במודל, אבל היא לא נחשפת כמספר גולמי בכל מקום, כך ש״הגדר effort ל-65״ עשוי לא להיות ניתן לביטוי בלקוח שלך.

מצב הכשל של חשיבת יתר, ומה שבאמת מתקן אותו

זהו מצב הכשל שמכריע אם תשאירו את המודל בלולאה שלכם. דיווחים מהקהילה מתארים כי DeepSeek V4.1 Flash ממשיך לנמק לאחר שהעבודה כבר הסתיימה: מנמק מחדש נקודה שכבר ענה עליה נכון, מתאר בקול את תיקון ההנחות השגויות של עצמו, ומייצר שרשראות נימוק ארוכות עם צפיפות מידע נמוכה. מתרגל אחד דיווח על פלט נימוקים שנמשך למעלה משעה בתוך סשן CLI לכתיבת קוד. אחר דיווח שלא הצליח לגרום לו להשלים ריצת בנצ'מרק ארוכה כלל.

הערת מקור על הדוח השני הזה, כי זה סוג הטענה שעוברת הלבנה. היא מגיעה משרשור קהילתי על הרצת המודל באופן אמין, ו-Reddit חוסם את המלקט שלנו, כך שלא יכולנו לקרוא את השרשור ישירות — אנו מעבירים את הדוח ולא מצטטים עמוד שפתחנו. מה שיכולנו לאמת באופן עצמאי הוא צורת הבעיה, ושם הראיות החיצוניות נקיות באופן יוצא דופן: Artificial Analysis, בעמוד שלה עצמו, מסמן את המודל כמילולי מאוד, כשהוא צורך 250M אסימוני פלט כדי להשלים הרצה שמודל ההשוואה החציוני שלו מסיים ב-140M. זה בערך פי 1.8, כפי שנמדד על ידי צד שלישי, על מערך משימות קבוע. דיווחי הפורום והמדד העצמאי מתארים את אותה התנהגות.

אמצעי ההקלה שיוצאים מאותם דוחות, כולם מקורם בקהילה:

• קבע את המאמץ על high או נמוך ממנו, וסרב לאפשר לו להסלים בהדרגה. התיקון המפורש ביותר שנצפה בשטח הוא תוסף ניתוב שנכתב במיוחד כדי לעצור הסלמת מאמץ: עומק הסבב אינו תורם דבר לציון ההסלמה, רק תוצאת כלי שנכשלה או ניסיון חוזר זהה נספרים, ההסלמה מוגבלת בתקרה, ו-max דורש בחירה מפורשת ומורד כברירת מחדל. אם מסגרת ההרצה שלך מאפשרת לסוכן להעלות את המאמץ של עצמו ככל שההרצה מתארכת, זה המנגנון שיש לכבות.

• אל תריץ max כברירת מחדל. מתרגלים רבים מדווחים ש-max מסתובב במקום להתכנס לעבודה שגרתית, ומעבר חזרה ל-high פותר זאת.

• הגבל code>max_tokens/code> בנתיבים אינטראקטיביים. תקרת פלט של 384,000 טוקנים היא גבול, לא יעד, ולולאה שלא תסתיים היא יקרה בתקרה הזו.

• ודא שהפרמטר נשלח. בהתחשב בכך שנמצאו שתי רתמות שמפילות אותו בשקט, "הגדרתי אותו ל-high" ו"high הגיע ל-API" הן טענות שונות.

• סביבת ההרצה חשובה יותר ממה שהייתם מצפים. מתרגלים שמריצים את אותם משקלים מדווחים על התנהגות שונה בתכלית בין מעטפות — אותו מודל שמתווכח עם עצמו וקובר את האות בסביבת הרצה אחת, אינו מעורר אף אחת מהתלונות האלה באחרת. זו תצפית קהילתית על התנהגות סביבת ההרצה, לא טענה של ספק על המודל, אך היא העצה הנשנית ביותר בדוחות.

כמה באמת עולה לולאת קידוד בתעריפים האלה

מחיר המחירון של DeepSeek הוא 0.15$ לכל מיליון טוקני קלט ו-0.60$ לכל מיליון טוקני פלט בשעות שפל — הפלט הוא פי ארבעה מהקלט, וזה הדבר הראשון שצריך להפנים לגבי סוכן שמייצר גם חשיבה וגם קוד.

קחו תור סוכן ריאלי: 60,000 טוקנים של הקשר (הנחיית מערכת, סכמות של כלים, פרוסת מאגר קוד, היסטוריית שיחה) בכניסה, ו-3,000 טוקנים של חשיבה בתוספת פאץ' ביציאה. זה 60,000 × $0.15/1M = $0.009 בכניסה, ועוד 3,000 × $0.60/1M = $0.0018 ביציאה, כך שזה בערך 1.1 סנט לתור. מאתיים תורים כאלה ביום עבודה הם בערך $2.16, או כ-$47 לאורך חודש של ימי חול בתעריף השפל. זו האריתמטיקה שגורמת לקצבה חודשית של $15 עם מבצע 4× עליה להיראות נדיבה — וזו האריתמטיקה שגורמת למילוליות להיות הדבר שצריך לשים לב אליו.

כי הנה המנוף שמסתתר במספר הזה של Artificial Analysis. העובדה שהמודל משתמש בפי 1.8 ממספר טוקני הפלט החציוני על סט משימות קבוע משמעה שללולאה המוגבלת בפלט עולה פי 1.8 ממה שמחיר הטוקן לבדו מרמז. ומחוון המאמץ הוא הבקרה בדיוק לכך. דיווחים מהקהילה אומדים את המעבר מ־max ל־high בכמחצית מטוקני הפלט — תנודה גדולה בהרבה מכל מה שלוח הזמנים של שיא/שפל יעשה לך. הגדרת המאמץ היא המנוף הגדול; לוח הזמנים הוא החינמי.

מה שכדאי לדעת לפני שאתם מתכננים משהו: שעות שיא הן 01:00–04:00 ו-06:00–10:00 UTC, מיום שני עד יום שישי, וכל השאר כולל סופי שבוע הוא מחוץ לשעות שיא. צוות אירופי שעובד 09:00–18:00 CET לעולם לא נוגע בשעות השיא. צוות בבייג'ינג שעובד באותן שעות מקומיות פוגע בשעות שיא מ-09:00 עד 12:00 ומ-14:00 עד 18:00 — שבע מתוך תשע שעות עבודה במחיר כפול. אותו מודל, אותו קוד, חשבון כפול, שנקבע כולו לפי אזור זמן.

החיסכון החינמי האחר הוא תעריף הקריאה מהמטמון, ‏$0.003 לכל מיליון מול $0.15 עבור קלט טרי — אחד מחמישים. הפרומפט של סוכן קידוד הוא ברובו קידומת יציבה: הוראות המערכת, הגדרות הכלים, החלקים במאגר הקוד שאינם משתנים. השאירו את החומר היציב בהתחלה ותנו לתוכן המשתנה להיגרר אחריו, והמטמון בצד הספק יעשה את השאר. האם קלט מהמטמון בהנחה חל, ובאילו תנאים, נקבע על ידי DeepSeek ולא על ידי הלקוח, לכן ודאו זאת בתיעוד העדכני לפני שאתם בונים על זה תקציב — עמוד המודל שלנו עבור code>deepseek/deepseek-v4.1-flash/code> אומר את אותו הדבר, שתעריף הקלט מהמטמון כפוף לתנאי הספק.

אם אתה מעדיף שלא להוסיף מנוי שני כדי להעריך את המודל, אותו מזהה זמין דרך נקודת קצה אחת תואמת OpenAI שמוצבת לפני כל הקטלוג שלנו, בתעריף של הספק עם 0% תוספת — כך ששינוי מחיר מצד DeepSeek נכנס לתוקף כאן באותו יום ולא בתמחור מחדש הבא. זה חשוב במיוחד בדיוק למצב שהמאמר הזה מתאר: מודל עם נטייה מתועדת להמשיך, במסלול שטרם סיימת להעריך. שרשרת גיבוי משמעה שתור שמשתבש נוחת על מודל אחר לפני שהתגובה מתחילה, במקום שהבקשה תיכשל.

552B, 748B או 763B — שאלת הגודל באמת פתוחה

אל תחזור על מספר פרמטרים עבור המודל הזה כעל דבר מוסכם, מפני ששלושה מספרים שונים נמצאים במחזור ואף אחד מהם אינו פשוט שגוי.

כרטיס המודל של DeepSeek עצמה מתאר מודל בעל "552B פרמטרי backbone", וזהו הנתון כפי שדווח על ידי הספק — זה גם המספר שמופיע בלוח המפרט בעמוד המודל שלנו. אותו כרטיס מפרט בנפרד מודול "Engram conditional memory" של 196B פרמטרים, "שננגש בדלילות באמצעות אחזור מבוסס טוקנים". חברו את השניים ותקבלו 748B, וזו האריתמטיקה שאליה הגיע ניתוח הקהילה בתוך שעות מהשחרור. ומטא-נתוני הקבצים באותו מאגר מודל מפרטים גודל מודל של 763B פרמטרים, שזהו שוב נתון שלישי.

המחלוקת לכאורה היא הגדרתית ולא סתירה. פרמטרי Engram נשלפים עולים בזיכרון אך כמעט ואינם עולים בחישוב לכל טוקן, ואילו פרמטרי backbone מחושבים עולים בזמן בכל טוקן — וזו בדיוק הסיבה לכך שהספק מדווח עליהם בנפרד, ולכך שהשוואת המספרים הכותרתיים של שני מודלים עם ארכיטקטורות שונות אומרת לך מעט מאוד.

מה שלא נתון במחלוקת רצינית הוא מספר הפרמטרים הפעילים: בערך 8 מיליארד לכל טוקן בשלב ה-prefill ו-16 מיליארד בשלב ה-decode, וזה המספר שלמעשה קובע את עלות ההסקה. המשקלים פתוחים תחת רישיון MIT אם ברצונך לבדוק כל אחד מהפרטים האלה בעצמך. התייחס ל-552 מיליארד כאל נתון מדווח על ידי הספק, ל-748 מיליארד כאל סך קהילתי מהימן, ולכל טענה ששאלת הגודל סגורה כאל מוקדמת מדי.

Screenshot of DeepSeek's own API documentation release page for DeepSeek-V4.1-Flash, dated 2026-09-10, showing the headline claim of a 552B-parameter MoE on a new Causal Encoder-Decoder architecture with 8B active parameters for input and 16B for output, a bar chart comparing DeepSeek V4.1 Flash against Kimi K3, GLM-5.3, Opus 5 and GPT-5.6 Sol on Terminal-Bench 3.0, DeepSWE v1.1, CyberGym and Automation-Bench, and the start of a vendor benchmark table with GPQA Diamond at 90.9 and HLE at 36.8.

מה לעשות לפני ה-20

אם אתם מתכוונים לנסות את DeepSeek V4.1 Flash בסוכן קידוד, הסדר שמבזבז את הזמן המועט ביותר הוא: לבחור קודם את הרנס, ואז לקבע את המאמץ, ואז למדוד.

על ה-harness, הסיכום הכנה של האימות של היום הוא שכל שלושת המסלולים עובדים והם נבדלים זה מזה במה שהם דורשים ממך. OpenCode Go הוא מנוי של $10 לחודש עם מכפיל מבצעי שפג תוקפו ב-20 בספטמבר, וההגדרה היא code>/connect/code> ועוד code>/models/code> בלי שום קובץ לעריכה. Command Code מציג את המודל בזמן אמת בקטלוג שלו, ומחליף עם code>/model <id>/code>, וחושף את effort כפקודה ממדרגה ראשונה. Claude Code מגיע אליו או דרך מסלול הלקוחות המאומתים של OpenCode Go — שבו הוא לא זקוק לעטיפת כותרת מותאמת אישית — או ישירות מול נקודת הקצה של DeepSeek בפורמט Anthropic, שבה הקונפליקט של effort בתת-סוכן הוא הקצה המחוספס הידוע.

בנוגע ל-effort, הגדר אותו במפורש והגדר אותו די נמוך: high, או ברירת המחדל של המודל אם מתברר שזה high, ולא max. ואז ודא שהוא יצא מהמכונה שלך, כי נמצאו שני הרנסים שמפילים אותו.

במדידה, שים לב לטוקני פלט ולא לשעון קיר. אריכות המילים היא העלות, חוגת המאמץ היא הבקרה, ולוח הזמנים של השיא הוא תאונת אזור זמן שאפשר להימנע ממנה בחינם.

ולגבי טענות הגודל שתראה מצוטטות בפניך השבוע — 552B, 748B, 763B — התגובה המועילה היא שהספק מדווח על ה-backbone שלו, הקהילה מוסיפה את מודול הזיכרון, והמטא-דאטה של המאגר אומרת שוב משהו אחר. כל מי שמציג אחד מאלה כתשובה סופית בחר מספר במקום לבדוק אותו.