כרטיס כותרת הירו עם הכיתוב 'תמחור DeepSeek V4.1 Flash' ולצידו השורה '$0.15 קלט, $0.60 פלט, $0.003 פגיעת מטמון', הכיתוב 'לכל 1M טוקנים, בשעות שפל. שעות השיא מכפילות כל תעריף.', ושלושה כרטיסים עם הכיתוב 'פגיעת מטמון: זול פי 50 מהחמצה', 'הקשר של 1M טוקנים' ו'משקולות פתוחות, רישיון MIT'
Guides & Insights

תמחור DeepSeek V4.1 Flash: כרטיס התעריפים המלא, ומספר ה-Cache-Hit שקובע את החשבון שלך

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

DeepSeek V4.1 Flash זמין באופן כללי מאז 2026-09-10, ונכון להיום לוח המחירים המפורסם שלו הוא הדבר הזול ביותר בדרגה העליונה של שוק המודלים: $0.15 למיליון טוקנים בקלט, $0.60 למיליון בפלט, ו-$0.003 למיליון בפגיעות מטמון. שלושת הנתונים האלה הם העמודה של שעות השפל. במהלך חלונות השיא של ימי החול אצל DeepSeek כל אחד מהם מוכפל, כולל פגיעות מטמון. ההשוואה שחשובה אינה מול ספינת הדגל המזדקנת של DeepSeek עצמה — DeepSeek-V4-Pro-0813 רשום ב-$0.66 / $1.98 למיליון בשעות שפל, כך ש-Flash חותך את מחיר אחיה בכ-4x בקלט — אלא מול שכבת החזית הסגורה שמולה הקונים באמת מתמחרים: GPT-5.6 Sol, Claude Opus 5 ו-Gemini 3.8 Flash, שכל אחד מהם גובה סדר גודל יותר לטוקן.

תיקון אחד לפני המספרים, מפני שההדלפה שקדמה להשקה הזו עדיין מסתובבת. הנתונים שנפוצו לפני GA תיארו הורדת מחיר שאמורה להיכנס לתוקף "מחר". המחירים אמיתיים; המסגור לא. V4.1 Flash שוחרר ב-2026-09-10 כשהתעריפים האלה כבר בתוקף, ויומן השינויים של DeepSeek עצמה מתעד את ההפחתה כחלק מהשחרור ולא כקיצוץ מאוחר יותר. כל מה שלהלן נקרא ישירות מדף התמחור החי של DeepSeek היום, 2026-09-16.

כרטיס התעריפים המלא, נכון ל-2026-09-16

DeepSeek מפרסמת גיליון אחד המכסה את ה-SKUs הנוכחיים, כאשר כל שורת פריט מפוצלת לעמודת שיא ועמודת שפל. עבור מזהה המודל deepseek-flash, אשר משרת את DeepSeek-V4.1-Flash, התעריפים המפורסמים הם:

קלט, החמצת מטמון — $0.15 לכל 1M טוקנים מחוץ לשעות שיא; $0.30 לכל 1M בשעות שיא

קלט, פגיעת מטמון — $0.003 לכל מיליון טוקנים בשעות שפל; $0.006 לכל מיליון בשעות שיא

פלט — $0.60 למיליון טוקנים בשעות שפל; $1.20 למיליון בשעות עומס

חלון הקשר — 1M אסימונים, עם פלט מקסימלי של 384K

מגבלת מקביליות — 2,500 בקשות מקבילות ב-Flash SKU

מזהי מודלים מדור קודםdeepseek-v4-flash וdeepseek-v4-flash-vision-exp הוצאו משימוש כמוצרים נפרדים, אך עדיין מנותבים אל V4.1 Flash ומחויבים במחירי Flash

הפער בין שתי השורות הראשונות הוא כל הסיפור של הגיליון הזה. עלות פגיעת מטמון נמוכה פי 50 מעלות החמצת מטמון בשעות שפל — הנחה של 98%, וכך גם Artificial Analysis מציגה זאת במודל העלויות שלה. שום דבר אחר בכרטיס לא מזיז חשבון עד כדי כך.

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

שיא אינו שגיאת עיגול, והוא מתוזמן לבייג'ינג

חלונות השיא של DeepSeek הם מיום שני עד יום שישי, 01:00–04:00 UTC ו-06:00–10:00 UTC. כל מה שמחוץ להם — כולל כל שעות סוף השבוע — מחויב בחצי תעריף. ההכפלה חלה על כל שלושת השורות, כך שפספוס מטמון בשעת שיא עולה $0.30 ופלט בשעת שיא עולה $1.20.

היכן שהחלונות האלה נופלים תלוי לחלוטין היכן שאתם נמצאים. בבייג'ינג הם 09:00–12:00 ו-14:00–18:00 — שני מקטעי עבודה, וזה בדיוק העניין. בברלין, בספטמבר, החלון השני הוא 08:00–12:00 CEST: הבוקר כולו של צוות אירופי הוא שעת שיא. בניו יורק אותו חלון הוא 02:00–06:00 EDT. צוות שבסיסו בארה"ב ופועל בשעות רגילות למעשה לעולם לא מחויב בתעריף שיא, וצוות מהאיחוד האירופי משלם כפול בכל בוקר לפני ארוחת הצהריים. אם אתם בוחרים מתי להריץ עבודת אצווה, זו החלטה ששווה $0.15 למיליון טוקנים, וקבלתה לא עולה כלום.

מה תמחור פגיעת מטמון באמת עושה לחשבון של סוכן

פגיעות מטמון הן אוטומטיות ב-DeepSeek — המסמכים אומרים ששמירה במטמון דיסק מופעלת כברירת מחדל עבור כל המשתמשים ללא שינוי בקוד — כך שההנחה אינה משהו שצריך לתכנן עבורו ארכיטקטורה. היא גם בגדר מאמץ מיטבי, ולא מובטחת: DeepSeek מציינת שאין TTL קבוע, מטמון שאינו בשימוש נמחק "בדרך כלל בתוך כמה שעות עד כמה ימים", והמערכת אינה מבטיחה שיעור פגיעות של 100%. כדאי לקרוא את השדות של התגובה: prompt_cache_hit_tokens וprompt_cache_miss_tokens לפני שמבססים על זה משהו.

החשבון חשוב יותר מהתואר. קחו סוכן קידוד עם קידומת יציבה של 40,000 טוקנים — הנחיית מערכת, סכמות כלים, הקשר מאגר — שפועל במפגש של 60 תורות, שבו כל תור מוסיף כ-2,000 טוקנים של פלט כלים והמודל מפיק כ-1,200 טוקנים. סך הקלט לאורך המפגש הוא 5.94M טוקנים וסך הפלט 72,000 טוקנים.

בחיוב ללא מטמון כלל, מחוץ לשעות העומס: קלט של 5.94M ב-$0.15 הוא $0.891, בתוספת פלט של 72,000 ב-$0.60 הוא $0.043 — בערך $0.93 עבור הסשן.

בחיוב עם הקידומת במטמון, וזה מה שקורה בפועל כברירת מחדל: 5.782 מיליון מאותם אסימוני קלט מגיעים כפגיעות מטמון במחיר $0.003 ($0.017), 158,000 מגיעים כהחמצות מטמון במחיר $0.15 ($0.024), ואותם 72,000 אסימוני פלט עולים $0.043. כ-$0.084 — זול יותר פי 11 בקירוב. הקלט יורד מ-95% מהחשבון ל-49% ממנו, החלק שבמטמון בלבד הוא 21%, ואסימוני הפלט הופכים לסעיף הגדול ביותר. אותו מודל, אותו סשן, אותו פלט — הדבר היחיד שהשתנה הוא אם הקידומת נוצלה מחדש.

שימו לב למה שלא מופיע בגיליון של DeepSeek: שורת חיוב של כתיבה למטמון. Anthropic גובה פי 1.25 מהקלט הבסיסי כדי לאכלס מטמון של 5 דקות ופי 2 לשעה; הכרטיס של DeepSeek מפרט רק פגיעה והחמצה, והמדריך שלו למטמון אינו מתאר עמלת כתיבה או אחסון. אם אתם משווים את כלכלת המטמון בין ספקים ולא את תעריפי הטוקנים הכותרתיים, היעדרות זו שווה יותר מכפי שהנחת הפגיעה של פי 50 מרמזת.

זו גם הסיבה לכך שפרט ה-pass-through של DeepSeek V4.1 Flash on OrcaRouter חשוב כאן. אנו מחייבים לפי מחיר המחירון של הספק עצמו ללא תוספת, כך ששינוי מחיר מצד ספק נכנס לתוקף אצלנו באותו יום במקום להמתין לסבב תימחור מחדש — ועמודות ה-cache-hit וה-peak/off-peak שאתם רואים למעלה הן אלו שלפיהן אתם מחויבים בפועל, ולא קירוב משוקלל שלהן.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

לעומת DeepSeek-V4-Pro-0813: פער של פי 4, ופרישה שלא התרחשה

ההשוואה הפנימית הברורה היא ה-SKU המוביל, והיא פחות דרמטית ממה שקצב הכותרת מרמז. DeepSeek-V4-Pro-0813, מזהה המודל deepseek-v4-pro, מתומחר ב-$0.66 ל-1M קלט בהחמצת מטמון וב-$1.98 ל-1M פלט בשעות שפל, ומכפיל את עצמו בשעות עומס ל-$1.32 ו-$3.96. פגיעות המטמון שלו עולות $0.022 בשעות שפל — יותר מפי 7 משל Flash.

קלט בהחמצת מטמון — $0.15 לעומת $0.66 בשעות שפל, כך ש-Flash זול פי 4.4

פלט — $0.60 לעומת $1.98 מחוץ לשעות השיא, כך ש-Flash זול פי 3.3

קלט עם פגיעת מטמון — $0.003 לעומת $0.022 מחוץ לשעות שיא, כך ש-Flash זול פי 7.3

הקשר ותקרת הפלט — זהה ב-1M וב-384K בשני ה-SKU-ים

מקביליות — 2,500 ב-Flash לעומת 500 ב-V4 Pro, פער של פי 5 שנעלם לחלוטין מגיליון המחירים

שלושה דברים בהשוואה הזו קל לטעות בהם. ראשית, טיעון השימוש החוזר חזק יותר בדגם הדגל במונחים מוחלטים, אף ש-Flash נושא במכפיל הגדול יותר: שמירה במטמון של מיליון טוקנים חוסכת $0.638 ב-V4 Pro ו-$0.147 ב-Flash, מפני ששיעור ההחמצה של דגם הדגל גבוה בהרבה מלכתחילה. שנית, המודל שכולם ציפו שייעלם — לא נעלם: DeepSeek הודיעה שתפסיק לשרת את V4 Pro ב-2026-09-14 ותנתב את הבקשות הללו ל-Flash, ספגה מחאה מצד מפתחים על החלפת מודל backend תחת תהליכי עבודה בסביבת ייצור, וביטלה את ההחלטה ב-2026-09-11. V4 Pro עדיין מוגש, בחיוב ללא שינוי. שלישית, וזו המלכודת שסיקור ההדלפה נפל לתוכה — אין V4.1 Pro שהושק. DeepSeek-V4-Pro-0813 נותר ה-SKU של דגם הדגל, והספק לא השיק יורש בשם הזה. כל מי שמתמחר מעבר ל-"V4.1 Pro" מתמחר מודל שלא קיים.

לעומת שכבת החזית הסגורה

מול המודלים הסגורים שהקונים מכניסים בפועל לרשימה הקצרה, המכפיל הוא הכותרת. כל הנתונים שלהלן לקוחים מדף התמחור המפורסם של כל ספק עצמו נכון להיום.

GPT-5.6 Sol — בשכבת ההקשר הקצר של OpenAI הוא מתומחר ב-$5.00 לכל 1M קלט וב-$30.00 לכל 1M פלט, כאשר כיום חל עליו מחיר מבצע של $4.00 / $20.00 שלדברי OpenAI זמין לפחות עד 2026-11-21, עם קלט במטמון ב-$0.40. לעומת המחיר המבצעי, DeepSeek V4.1 Flash זול פי 26.7 בקלט ופי 33.3 בפלט; לעומת מחיר המחירון, פי 33 ופי 50. פגיעת המטמון של Sol עולה פי 133 מזו של Flash.

Claude Opus 5 — $5.00 לכל 1M קלט ו-$25.00 לכל 1M פלט, עם פגיעות מטמון ב-$0.50 לכל 1M בגיליון המפורסם של Anthropic. זה פי 33 מתעריף הקלט של Flash, פי 42 מתעריף הפלט של Flash, ופי 167 מתעריף פגיעות המטמון של Flash. כתיבות מטמון של 5 דקות של Anthropic מוסיפות עוד פי 1.25 על כך; בגיליון של DeepSeek אין שורה מקבילה.

Gemini 3.8 Flash — $0.75 לכל 1M קלט ו-$3.75 לכל 1M פלט עד 2026-12-31, כששני התעריפים מתוכננים להכפיל את עצמם ב-2027-01-01, קלט במטמון ב-$0.075, ו — זו השורה שמופיעה שוב ושוב בחשבון אמיתי — מטמון-אחסון בעלות של $0.50 לכל 1M טוקנים לשעה. Flash זול פי 5 בקלט, פי 6.25 בפלט ופי 25 בפגיעות מטמון לעומתו, ו-DeepSeek לא גובה דבר עבור החזקת מטמון.

ההקשר של היכולות הוא מה ששומר על זה כן. במדד Intelligence Index v4.3 של Artificial Analysis, DeepSeek V4.1 Flash (reasoning, max effort) מקבל ציון 40 ומדורג במקום ה-6 מתוך 113 מודלים, במחיר של $0.27 לכל משימת מדד ובקצב של 214.4 אסימוני פלט לשנייה. זהו מיקום הסמוך באמת לחזית, במחיר נמוך פי 26 מהדרג שאליו הוא מושווה — אבל אותה מדידה מראה שהוא אחד מהמודלים הרברבניים ביותר ש-AA בחנה, כשהוא מייצר 250M אסימוני פלט לאורך הרצת המדד לעומת חציון של 140M. הרברבנות לא משנה את המחיר לכל אסימון, אבל היא כן משנה את החשבון. מודל שכותב 62% יותר אסימונים מהחציון עדיין עולה כאן הרבה פחות, אבל "זול לכל אסימון" ו"זול לכל משימה" הם טענות שונות, ורק השנייה היא מה שאתם משלמים עליו.

האם יש מסלול חינמי?

לא. עמוד התמחור של DeepSeek עצמה אינו מתעד מסלול API חינמי, אין מכסה חודשית חינמית ואין מודל חינמי — החיוב הוא בתשלום לפי שימוש כנגד יתרה שנטענה או הוענקה, כאשר היתרה שהוענקה נצרכת ראשונה. אפליקציית הצ'אט לצרכנים היא חינמית; ה-API שמאחורי deepseek-flash אינו חינמי, ואין נקודת קצה חינמית עבורו בפלטפורמה של DeepSeek. מספר שערים של צדדים שלישיים מפרסמים גישה חינמית או גישת ניסיון למודל הזה, והיינו מתייחסים לכולם כמשטחי אב-טיפוס ולא כבקאנדים לייצור, מכיוון שהתנאים האלה משתנים ללא הודעה מוקדמת ואף אחד מהם אינו נושא את מחירון הספק עצמו.

טענות היעילות שמאחורי המחיר

המחיר אינו סבסוד, לפחות לפי החשבון של DeepSeek עצמה. כרטיס המודל והדוח הטכני של הספק מתארים את V4.1 Flash כמודל תערובת-מומחים (mixture-of-experts) בעל 552 מיליארד פרמטרים בפריסת Causal Encoder-Decoder, שמפעיל בערך 8 מיליארד פרמטרים לכל טוקן במהלך prefill ו-16 מיליארד במהלך decode — א-סימטרי בתכנון, זול לקריאה איתו ויקר יותר לכתיבה איתו. בצד הזיכרון, DeepSeek מדווחת על מטמון KV גלובלי של כ-890 בייטים לכל טוקן, בערך רבע מזה של DeepSeek-V4-Flash, ועל טביעת רגל של מטמון מתמיד בסביבות שמינית ממנו תחת עומסי עבודה זהים, שהושגה באמצעות השלכת מצב החלון המחליק וביצוע replay ל-128 הטוקנים האחרונים בעת פגיעה במטמון. אלו מדידות כפי שדווחו על ידי הספק, על החומרה של הספק עצמו, והדוח הטכני אינו טוען לשקילות מתמטית לחישוב מלא במסלול ה-replay.

ספירת הפרמטרים היא הנתון היחיד במהדורה הזו שבאמת לא סגור, וכדאי להיות מדויקים לגבי הסיבה. התיעוד של DeepSeek מדווח על 552B, וזהו עמוד השדרה — החלק שמבצע את החישוב. לצידו נמצא Engram, טבלת חיפוש של זיכרון מותנה, שכרטיס המודל מעריך אותה ב-196B פרמטרים, שאליה ניגשים באמצעות חיפוש טוקנים ולא מחשבים אותה. אם מחברים אותם מגיעים לקרוב ל-748B, זה המספר שניתוח קהילתי נקרא בהרחבה ב-r/LocalLLaMA טען לו בתוך שעות מהעלאת המשקלים, ואשר פאנל הקבצים של מאגר Hugging Face דוחף אותו אף גבוה יותר, לעבר 763B. תיאורי פריסה קהילתיים ספרו את הצ'קפוינט בכ-510 GB על פני 48 רסיסים, משוגרים ככימות מקורי כמשקלים צפופים FP8 עם מומחי FP4. התייחסו לסכום הכולל כשנוי במחלוקת ולנתון עמוד השדרה כמדווח על ידי הספק. ספירות הפרמטרים הפעילים הן אלו שקובעות את המהירות; המשקלים השוהים הם אלו שקובעים אם המודל בכלל מתחיל.

אירוח עצמי הוא חלופה אמיתית למחיר הזה, תחת MIT

המשקלים נמצאים ב־deepseek-ai/DeepSeek-V4.1-Flash תחת רישיון MIT, המתיר שימוש מסחרי, שינוי והפצה מחדש. זה הופך את מחירון ה-API לבחירה ולא לאגרה: תחת MIT, שום דבר ברישיון אינו מונע ממך להריץ את המודל הזה בעצמך ולשלם עבור מחשוב במקום עבור טוקנים.

מה שזה לא עושה זה להפוך את זה לזול לביצוע. ה-checkpoint הוא כ-510 GB של משקלים resident לפני מטמון ואקטיבציות, DeepSeek לא מציינת דרישת GPU בשום מקום במאגר, ותיאורי פריסה מהקהילה מציבים את המינימום המעשי בצומת עם ריבוי GPUs ולא בתחנת עבודה. שלוש ערימות הגשה סיפקו תמיכת day-0 ב-2026-09-10 — vLLM, SGLang עם Miles, והתאמת NeuWare מבוססת vLLM של Cambricon למאיצים שלה — אך ביום ההשקה vLLM ו-SGLang סיפקו אימג'ים ייעודיים לתצוגה מקדימה ולא חבילות רשמיות, וב-llama.cpp תמיכת הארכיטקטורה של V4.1 טרם מוזגה. אירוח עצמי על חומרת צרכן אינו החלופה למחיר ה-API כיום; צומת שכור עם 8 GPUs הוא החלופה. אם הנפח שלך גדול מספיק כדי לפרוס את העלות הזו, הרישיון מתיר לך לעשות זאת; אם לא, $0.15 למיליון טוקנים הוא התשובה הזולה יותר, וזה לא מתקרב.

מה שכרטיס התעריפים בעצם מבקש ממך להחליט

שלושה דברים, לפי סדר כמות הכסף שהם מזיזים. החזיקו קידומת פרומפט יציבה ותנו למטמון לעשות את שלו — הוא אוטומטי, הוא הנחה של פי 50, ובלולאת סוכן של 60 סבבים הוא הופך סשן של $0.93 לכזה של $0.084. הריצו את תעבורת הבאטצ' שלכם מחוץ לשעות 01:00–04:00 ו-06:00–10:00 UTC בימי חול, שזה עבור צוות אמריקאי חסר משמעות ועבור צוות אירופאי פירושו להעביר את משימת הבוקר לצהריים. ואם אתם מתמחרים את זה מול הדגל של DeepSeek עצמה, זכרו שהדגל עדיין במבצע — הפרישה המתוכננת בוטלה ב-2026-09-11, שני ה-SKU-ים יושבים מאחורי מפתח אחד, והמעבר ביניהם הוא שינוי של model-id ולא מיגרציה.

מה שכרטיס התעריפים לא אומר לך הוא אם המודל טוב מספיק לעומס העבודה שלך, והנתונים לכך חדשים ודלילים יותר מגיליון המחירים. המיקום במדד Artificial Analysis הוא מדידה בודדת במאמץ החשיבה המרבי, שורות הבנצ'מרק של הספק הן דיווח של הספק, ומספר הפרמטרים שנוי במחלוקת. המחיר הוא החלק המוסכם בהשקה הזו. תמחר את ההגירה שלך לפיו, ובחן את היכולת לפני שאתה מתחייב לה.

השוואות במאמר הזה4

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית