כרטיס כותרת ראשי עבור DeepSeek V4.1 Flash, עם כותרת משנה: 'בטא בת יומיים ל-API: מה ידוע לנו עד כה', תגיות בצורת גלולה עם הכיתוב 'גרסת ביניים' ו-'בדיקת API – פגה ב-09-10', שורת תחתית: 'פוסט השחרור הרשמי צפוי בקרוב מאוד', ולוגו OrcaRouter משולב בפינה הימנית-תחתונה.
Guides & Insights

DeepSeek V4.1 Flash משיקה בטא API בת יומיים: ארכיטקטורה חדשה, מולטימודאליות מובנית ושאיפות ברמת Pro

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

DeepSeek V4.1 Flash הופיעה בדיוק במקום שבו DeepSeek בודקת דברים לפני שהיא מכריזה עליהם: בתוך ה-API החי, תחת מזהה מודל שנושא את תאריך התפוגה שלו. המזהה — deepseek-v4.1-flash-expires-on-0910 — החל לשרת ב-8 בספטמבר 2026, לאחר שצוות DeepSeek פרסם בקבוצות הקהילה הרשמיות שלו בדיקה פנימית של "גרסת ביניים", וה-0910 שבסוף הוא הסיפור בזעיר אנפין. מדובר בבנייה שהוחדרה לסביבת ה-API האמיתית לבדיקה מוגבלת, שאמורה לרדת מהאוויר בסביבות 10 בספטמבר, לפני פוסט ההשקה הרשמי שהחושפים שמסמנים את המודל צופים שיבוא "בקרוב מאוד". זו לא השקה. אין כרטיס מודל, אין דוח טכני, אין רשומת יומן שינויים, ונכון לערב זה עמוד ה-Models & Pricing הציבורי של DeepSeek עדיין מציג רק את DeepSeek V4 Flash, DeepSeek V4 Pro ו-DeepSeek-V4-Flash-Vision-Exp.

יש לקרוא את כל מה שלהלן תוך התחשבות בכוכבית הזו. הערוץ הרשמי כאן הוא הודעה של קבוצת קהילה וטופס משוב נלווה, לא הערת שחרור. להלן איחוד של אותה הודעה, הסיקור של התקשורת הסינית בתוך שעות ממנה, ומדידות של היום הראשון ממפתחים שכיוונו מפתחות משלהם אל הנקודה — כשטענות הספק ומספרי הקהילה מסומנים כפי שהם.

מה בעצם קרה היום

בסביבות השעה 15:00 שעון בייג'ינג ב-8 בספטמבר, צוות Deep​Seek הודיע לקבוצות הקהילה הרשמיות שלו שגרסת ביניים — המתוארת בסינית כ"中间版本", כלומר נקודת ביניים — נפתחה לבדיקות מוגבלות בסביבת ה-API האמיתית לפני שחרור הגרסה הסופית. כל מי שיש לו מפתח API של Deep​Seek יכול לקרוא לה: יש לשמור על ה-base URL והמפתח הקיימים, ולהגדיר את שם המודל ל-deepseek-v4.1-flash-expires-on-0910. זה כל סיפור הגישה — אין נקודת קצה נפרדת, אין רשימת המתנה, ואין קונסולה חדשה.

המסגרת המעשית הדוקה. הסיומת מקודדת את התוכנית: גרסת הבדיקה "תפוג ותרד מהאינטרנט אוטומטית ב־10 בספטמבר", ותישאר פעילה כיומיים בלבד. כל חשבון מוגבל ל־20 בקשות במקביל — לעומת מגבלת 2,500 הבקשות בו־זמנית ש־DeepSeek מפרסם עבור deepseek-v4-flash — וזה רמז חזק לגבי הכוונה: זה מיועד לבדיקות פונקציונליות והערכה, לא להפניית תעבורת ייצור אליו.

• מה זה — נקודת ביקורת של "גרסת ביניים" המוצבת ב-API החי לבדיקות קצרות טווח לפני הבנייה הרשמית.

• היכן זה רץ — ה-API של DeepSeek עצמו; כתובת ה-URL הבסיסית והמפתח נותרו ללא שינוי, ושם המודל הוחלף ל-deepseek-v4.1-flash-expires-on-0910.

כמה זמן — השם אומר expires-on-0910; הבדיקה צפויה לרדת מהאוויר בסביבות 10 בספטמבר.

• מי יכול לקרוא לו — כל חשבון עם מפתח Deep​Seek, עד 20 בקשות במקביל לחשבון.

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Model ID deepseek-v4.1-flash-expires-on-0910, Status 2-day API beta - expires 09-10, Concurrency 20 req/account (V4 Flash: 2,500), Billing same rate card as DeepSeek V4 Flash, Speed (community) ~420 tok/s peaks 500+, Native multimodal text + image (official claim), with a footer reading 'Speed is community-measured; no official benchmarks or specs published yet.'

מה גובה הבטא: כרטיס התעריפים של DeepSeek V4 Flash

Deep​Seek אמרה שהבדיקה מחויבת באותם תעריפים כמו deepseek-v4-flash, וכרטיס התעריפים הנוכחי של המודל הזה הוא זה שחל. מאז עדכון התמחור מיום 16 באוגוסט 2026, Deep​Seek מפעילה תמחור של שעות שיא/שפל; המספרים המדויקים הם הרשמיים עבור דרגת ה-Flash:

• קלט, פגיעת מטמון — $0.007 לכל מיליון טוקנים בשעות לא שיא, $0.014 בשעות שיא

• קלט, פספוס מטמון — $0.22 לכל מיליון אסימונים בשעות לא שיא, $0.44 בשעות שיא

• פלט — $0.66 למיליון טוקנים בשעות שפל, $1.32 בשעות שיא

• שעות שיא — 01:00–04:00 ו-06:00–10:00 UTC, בימי שני–שישי; בכל שאר השעות חל תעריף שפל, במחצית מתעריף השיא

A screenshot of the DeepSeek API docs Models & Pricing page (captured September 8, 2026) showing the current public lineup — deepseek-v4-flash, deepseek-v4-pro and deepseek-v4-flash-vision-exp — with 1M context and 384K max output, the off-peak/peak price columns (deepseek-v4-flash: $0.007 cache-hit input, $0.22 cache-miss input and $0.66 output off-peak, doubled at peak), and published concurrency limits of 2,500 / 500 / 2,500.

שימו לב מה לא השתנה: המחיר לכל טוקן. לכן הטענה של DeepSeek ש־V4.1 Flash הוא "בעל עלות נמוכה יותר" היא טענת יעילות, לא הורדת תעריף — נקודה שכמה בודקים מיום ההשקה גילו בדרך היקרה, כשראו שסשן של חמש דקות מרוקן מהיתרה שלהם באופן ניכר יותר מאשר אותו זמן שעון על DeepSeek V4 Flash, משום שהמודל צורך טוקנים הרבה יותר מהר. האם העלות לכל משימה אכן יורדת תלוי בשאלה אם הוא מסיים את העבודה עם פחות טוקנים ופחות ניסיונות חוזרים, דבר שאיש אינו יכול לשפוט מיומיים של מבחני מהירות.

מה פירוש "ארכיטקטורה חדשה, רב-מודאלית מובנית" — עד כה, לא אומת.

התיאור הרשמי של Deep​Seek ל־V4.1 Flash מסתכם בארבע טענות: מבנה מודל חדש, תמיכה מולטימודלית מובנית, יכולת חזקה יותר, ויצירה מהירה יותר. הטענה בדבר הארכיטקטורה היא זו שבולטת, משום שהיא שוברת תבנית. העדכון הקודם, DeepSeek V4 Flash 0731, היה עדכון שלאחר אימון ששמר על אותה ארכיטקטורה ועל אותו קנה מידה כמו התצוגה המקדימה שלו; הניסוח כאן של Deep​Seek מצביע על שינוי מבני, וכמה כלי תקשורת פירשו זאת כסימן לכך שהמודל עבר אימון מקדים מחדש, ולא רק כוונון עדין. מעבר לכך, כל השאר הוא ספקולציה. הספקולציות בקהילה בדבר מנגנוני קשב ששונו, רשתות מומחים, או מודול ראייה משולב, הן בדיוק זה — ספקולציה. לא פורסם דבר: לא מספר פרמטרים, לא נתון על חלון ההקשר, לא טבלת מדדים, ולא דו"ח טכני.

הניסוח "מולטי-מודאלי מובנה" חשוב מסיבה ספציפית. DeepSeek-V4-Flash-Vision-Exp, שהושק ב-21 באוגוסט ומשקלותיו פתוחים מאז 31 באוגוסט, הצמיד מקודד ראייה לבסיס הטקסט של DeepSeek V4 Flash — החומרים של Deep​Seek עצמה תיארו את הצמד כמודל טקסט עם נתיב ראייה חיצוני. V4.1 Flash מתואר כמולטי-מודאלי מהיסוד, והמודל הבסיסי עצמו מטפל בקלט של תמונה וטקסט. עקרונית, מדובר בהבדל ארכיטקטוני אמיתי, אך מפרט המודאליות לא פורסם: מה שהבודקים בחנו בפועל הוא טקסט בתוספת תמונות, וקורא צריך להתייחס ל"מולטי-מודאלי" כמאומת אך ורק במובן הזה של טקסט ותמונה, עד שיופיע כרטיס מודל. האם קבוצת קלט רחבה יותר כלולה בתוכנית — נכון לכתיבת שורות אלה — לא ידוע ולא מאומת.

המהירות היא הכותרת — והיא מדידה קהילתית

המספר שמסתובב ביום הראשון הוא בערך 420 אסימוני פלט בשנייה בהפקות ארוכות, עם דיווחים על שיאים של מעל 500 אסימונים/שנייה בריצות בודדות. מבחן אחד שנפוץ מאוד יצר יותר מ-71,000 אסימונים בפחות משלוש דקות. שום דבר מזה אינו רשמי: אלה מדידות של מפתחים מול נקודת הקצה הבטא, בתנאים לא מבוקרים, ו-Deep​Seek לא פרסם מדד מהירות משלו. להקשר, Artificial Analysis מודד את נקודת הקצה הציבורית של DeepSeek V4 Flash 0731 בכ-128 אסימונים/שנייה, כך שהדיווחים המוקדמים מצביעים על קפיצת תפוקה גולמית בסדר גודל של פי שלושה או יותר — עם האזהרה הרגילה שתפוקה תלויה באורך הקלט, במקביליות ובתנאי השרת.

ההשוואות מקצה לקצה מול DeepSeek-V4-Flash-Vision-Exp הן המקום שבו הפער נראה הכי רחב, מכיוון שהן מודדות את אותה המשימה גב אל גב. הבודקים דיווחו על מהירות מקצה לקצה גבוהה פי 6 בערך במשימת יצירת קוד SVG, פי 5.2 בערך במשימת אחזור בהקשר ארוך של 49k טוקנים, פי 5 בערך במשימה גדולה של יצירה ואופטימיזציה של SQL, פי 4.6 בבעיה אלגוריתמית, ופי 3.9 במשימת ריפקטור אסינכרוני. התייחסו אליהם כאינדיקטיביים, לא מדויקים: מספרי מקצה לקצה של אותה משימה כוללים בתוכם זמן חשיבה, זמן השהיה עד לטוקן הראשון, ומהירות יצירה, והם מגיעים מבודקים בודדים, לא ממערך בדיקות מבוקר. הכיוון העקבי בכולם הוא האות המעניין, ולא שום מכפיל בודד.

השאלה שבלב הבטא

הפרט האסטרטגי ביותר מסתתר בטופס המשוב ש-Deep​Seek צירף לבדיקה. לצד שאלות על מסגרות סוכנים ותרחישים מהעולם האמיתי, הוא שואל את הבודקים ישירות האם גרסת הביניים של DeepSeek V4.1 Flash “יכולה להחליף לחלוטין את DeepSeek V4 Pro המקוון”. זו שאלה יוצאת דופן שחברה מציבה בפני משתמשים, מכיוון ש-DeepSeek V4 Pro ממוקם שלוש דרגות מחיר מעל Flash: בתעריפים הרשמיים הנוכחיים, מודל ה-Pro גובה $0.66 לכל מיליון טוקני קלט (cache miss) ו-$1.98 לכל מיליון טוקני פלט בשעות השפל, לעומת $0.22 ו-$0.66 עבור DeepSeek V4 Flash — פי 3 בדיוק בכל שורה. אם מודל בדרגת Flash באמת מתקרב ליכולות ברמת Pro במחירים של דרגת Flash, השאלה עונה על עצמה עבור חלק גדול של משתמשים, ו-Deep​Seek יודע זאת.

בקריאה יחד עם הניסוח "מבנה חדש", השאלון רומז ש-V4.1 Flash הוא הצעד הנראה הראשון של משהו גדול יותר מרענון נקודתי — מיצוב מחדש של קו Flash כדי לצמצם את הפער לדגל, בדרך שבה Deep​Seek השתמשה שוב ושוב במודל זול ומהיר יותר כדי לאפס את ציפיות השוק לגבי מה שמתקבל ברמת מחיר מסוימת. שום דבר מזה לא מאושר על ידי benchmark; זו קריאה אסטרטגית של שאלה בת שני משפטים. אבל זה הדבר המעניין ביותר ש-Deep​Seek אמרה על V4.1 Flash כל היום.

היכן לנסות את זה, ומה להריץ בייצור בינתיים

בחלון הבדיקה, המקום היחיד לגשת ל-V4.1 Flash הוא ה-API של Deep​Seek עצמו — אין אירוח של צד שלישי לגרסה שתוקפה יפוג בעוד יומיים, ואף אחד לא צריך לחבר נתיב ייצור למזהה מודל שצפוי להפסיק לענות. השימוש ההגיוני ביומיים הקרובים הוא הערכה: הריצו את עומסי העבודה המייצגים שלכם, מדדו איכות וכלכלת טוקנים אמיתית, והתייחסו לכל מספר מהירות שאתם רואים כאנקדוטלי עד שתצא גרסה רשמית עם כרטיס מודל.

עבור תעבורה שחייבת להמשיך ולעבוד, מערך הדגמים הציבורי של Deep​Seek לא השתנה — וכאן בדיוק שכבת ניתוב מוכיחה את ערכה. ב-OrcaRouter, DeepSeek V4 Flash, DeepSeek V4 Pro ו-DeepSeek-V4-Flash-Vision-Exp כולם נגישים דרך API אחד, במחיר המחירון של Deep​Seek, כשהמחיר מועבר הלאה ללא כל תוספת — כלומר, קיצוץ המחירים של אוגוסט פעיל בצד שלנו מהיום שבו נכנס לתוקף, לא רק כשגיליון מרווחים אי־שם התפנה לטפל בו. כש-V4.1 Flash יגיע בסופו של דבר לספקים במהדורה רשמית, אותה תצורה היא הדרך לאמץ אותו בעלות מעבר נמוכה: שלחו נתח תעבורה למודל החדש, השאירו את DeepSeek V4 Flash או V4 Pro כגיבוי אוטומטי, ותנו ל-DSL של הנתב להחליט אילו קריאות ראויות למודל שעדיין לא הוכח ואילו צריכות להישאר על המודל המנוסה. אתם לא חייבים לסכן נתיב ייצור על סמך בטא של יומיים כדי לגלות אם המודל טוב.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash (captured September 5, 2026) showing the Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, text input, a p50 time-to-first-token of 434 ms, and the description 'DeepSeek V4 Flash efficient MoE — 284B total / 13B active params, 1M context, optimized for fast everyday workloads.'

שאלות פתוחות

• מתי יגיע השחרור הרשמי? הסיגנל שסימן את המודל הזה אומר שפוסט שחרור צפוי "בקרוב מאוד"; תוחלת החיים של הבטא, יומיים בלבד, מרמזת ש-DeepSeek לא מתכוונת לגרום לעולם לחכות זמן רב.

• האם המבנה הסופי תואם לזה? בודקים בלתי תלויים העוקבים אחר מחזורי הבדיקות של Deep​Seek מציינים כי החברה נראית כמריצה מספר מבני מועמד במקביל, והמועמד המהיר ביותר בבדיקה מוקדמת אינו תמיד זה שיוצא לשוק — כך שמספרי המהירות של היום עשויים שלא לתאר את דגם ה-GA.

• מהם המפרטים? מספר הפרמטרים, פרטי הארכיטקטורה, אורך ההקשר, ורשימת סוגי הקלט המלאה — כולם לא פורסמו, וכולם הם הדברים הראשונים שביקורת אמיתית צריכה.

• האם המחיר עומד, והאם "עלות נמוכה יותר" שורדת מגע עם עומסי עבודה אמיתיים? הבטא מחויבת בתעריפי DeepSeek V4 Flash; השקה עשויה להביא כרטיס תעריפים חדש, והעלות לכל משימה אינה נמדדת.

• האם הוא באמת יכול לעמוד בתפקיד ה-Pro? השאלון שואל את השאלה, אבל רק הערכות עצמאיות על סוויטות אייג'נטיות והסקה — אמות המידה שמפרידות כיום בין רמת ה-Flash לרמת ה-Pro — יכולות לענות עליה.

אם יש לך מפתח Deep​Seek, הסיפור הוא שעון של יומיים: קרא ל-deepseek-v4.1-flash-expires-on-0910 לפני שהוא נעלם, הרץ עומסי עבודה משלך, ותעד את המספרים תחת "community-measured, conditions vary". עבור כל השאר, הדבר שכדאי לעקוב אחריו הוא פוסט ההשקה, והשאלה שמאחוריו — האם השכבה הזולה ביותר של Deep​Seek רק החלה לכוון אל היקרה ביותר שלה?

בעוד שהבטא בת היומיים מסדרת את עצמה, מודל ה-Flash היציב שאתה יכול להריץ בפועל היום נמצא במרחק קריאת API אחת: DeepSeek V4 Flash על OrcaRouter — במחיר המחירון של Deep​Seek, מועבר עם 0% תוספת.

ושאלון הבטא הראשי ממשיך לבקש מהבודקים להשוות את V4.1 Flash מול: DeepSeek V4 Pro on OrcaRouter.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית