ההשקה הרשמית של DeepSeek V4 Flash: המודל הזול, המהיר והסוכני עם הקשר של 1M — הסבר
Guides & Insights

ההשקה הרשמית של DeepSeek V4 Flash: המודל הזול, המהיר והסוכני עם הקשר של 1M — הסבר

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

DeepSeek V4 Flashהוא החצי הזול של סולם ה-V4 של DeepSeek, והנתונים העצמאיים סוף סוף השיגו אותו: בסט AIME 2026 של MathArena הוא קולע 95.83%, בלתי ניתן להבחנה סטטיסטית מ-96.67% של DeepSeek V4 Pro, בבערך תשיעית מהמחיר לבעיה. הגרסה הרשמית של הבטא הציבורית, -0731, שוחררה ב-31 ביולי 2026 עם אותה ארכיטקטורה כמו התצוגה המקדימה של אפריל — מודל mixture-of-experts עם 284 מיליארד פרמטרים, 13B פעילים, עם קונטקסט של מיליון טוקנים — אבל עם סבב נוסף של פוסט-אימון ששיפר משמעותית את היכולות האג׳נטיות, הקידוד והקריאה לכלים, בתוספת תמיכה מקורית ב-Responses-API והתאמות ספציפיות לסוכנים בסגנון Codex. המדריך הזה מכסה מה המהדורה שינתה בפועל, מה אומרות ההערכות של הספק ושל הגורמים העצמאיים, מה העלות כשמביאים בחשבון כמה הוא חושב, ואיך להפעיל אותו.

הערת דיוק: פרטי השחרור וציוני ה-agentic הראשיים להלן מגיעים מיומן השינויים הרשמי של ה-API של DeepSeek (מיום 2026-07-31) ומדווחים על ידי הספק, רצו על תשתית הבדיקה של DeepSeek עצמה — יש להתייחס אליהם כאל אינדיקציה בלבד ולהריץ הערכות משלכם. נתונים בלתי תלויים מיוחסים היכן שהם מופיעים: Artificial Analysis עבור מדד האינטליגנציה ומרכיביו, MathArena עבור AIME 2026, ומחירון DeepSeek עצמו עבור התמחור. במקרים שבהם משהו מסתמך על דיווח של מתרגל יחיד ולא על הערכה שפורסמה, המשפט מציין זאת. המפרטים והמחירים משתנים; יש לוודא לפני הבנייה.

TL;DR. V4 Flash הוא האח החסכוני של הענק DeepSeek V4 Pro: מודל MoE עם 284B פרמטרים (13B פעילים), הקשר של 1M טוקנים ופלט של עד 384K, המכוון לעבודה סוכנית בנפח גבוה ובזמן השהיה נמוך. השחרור הרשמי מ-31 ביולי הוא שדרוג שלאחר אימון — באותו גודל, עם סוכנים וקידוד משופרים משמעותית — ומוסיף גם תמיכה מובנית ב-Responses-API וב-Codex. DeepSeek מדווחת על ציונים חזקים במשימות סוכנים/קידוד (למשל Terminal-Bench 2.1 82.7, Toolathlon 70.3), ומאז העניקה Artificial Analysis לגרסת -0731 ציון 50 במדד האינטליגנציה שלה: עשר נקודות מעל התצוגה המקדימה של אפריל, שש מעל ה-V4 Pro הגדול בהרבה, ושווה ל-Gemini 3.6 Flash. העלות היא כ-0.15$ / 0.29$ למיליון טוקני קלט/פלט, כשליש ממחירו של V4 Pro. רק ה-API של Flash שודרג; V4 Pro ואפליקציית/אתר DeepSeek נותרו ללא שינוי. ב-OrcaRouter אתה מקבל את זה במרווח של 0% דרך נקודת קצה אחת תואמת OpenAI.

נקודות עיקריות

• שחרור רשמי (build -0731, 31 ביולי 2026): שדרוג פוסט-אימון של התצוגה המקדימה — אותה ארכיטקטורה, סוכנים, קידוד ושימוש בכלים חזקים בהרבה.

• הארכיטקטורה ללא שינוי: סה"כ 284B / 13B פעילים (MoE), חלון הקשר של 1M טוקנים (1,048,576), פלט של עד 384K, קלט טקסט בלבד, עם חשיבה, כלים ו-JSON.

• חדש: תמיכה מקורית ב-Responses API, בתוספת התאמה ספציפית ל-Codex; ממשיך לתמוך בממשקי OpenAI ChatCompletions ובממשקים בסגנון Anthropic. מזהה מודל deepseek-v4-flash.

• השגים שדיווח DeepSeek בתחום סוכני/קידוד: Terminal-Bench 2.1 82.7, Toolathlon (מאומת) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.

• זול מאוד: בערך $0.15 / $0.29 למיליון טוקני קלט/פלט — בערך שליש מהמחיר של V4 Pro ($0.44 / $0.88) — ו-DeepSeek מתמחרה פגיעות מטמון ב-$0.0028 למיליון, כ-98% מתחת לקלט חדש. רק ה-Flash API השתנה; Pro והאפליקציה/האתר נשארו זהים.

מה שהגרסה הרשמית שדרגה בפועל

V4 Flash הופיע לראשונה כתצוגה מקדימה ב-24 באפריל 2026. השחרור הרשמי מ-31 ביולי 2026 (ה--0731 build, לפי יומן השינויים של ה-API של DeepSeek) הוא במפורש לא ארכיטקטורה חדשה: הפרמטרים הכוללים והפעילים (284B / 13B) והקשר של 1M לא השתנו. מה שהשתנה הוא הפוסט-טריינינג — כוונון עדין נוסף ש-DeepSeek אומרת ששיפר משמעותית את יכולות הליבה הסוכניות, הקידוד והקריאה לכלים. שתי תוספות מעשיות חשובות: V4 Flash תומך כעת באופן מובנה ב-Responses API ומותאם ספציפית לסוכני קידוד בסגנון Codex, תוך שהוא ממשיך לתמוך בממשקי OpenAI ChatCompletions ו-Anthropic. חשוב לציין, רק ה-Flash API שודרג בשחרור זה; V4 Pro וחוויות האפליקציה והאינטרנט של DeepSeek לא השתנו. עבור צוותים, זה אומר שיפור שניתן להטמיע ישירות (drop-in) לעומסי עבודה סוכניים באותו מחיר, ללא מיגרציה.

{{1}}ארכיטקטורה{{/1}}: {{2}}MoE קטן-אקטיבי הבנוי לתפוקה{{/2}}

V4 Flash הוא מודל תערובת מומחים עם כ-284 מיליארד פרמטרים בסך הכול, אבל רק כ-13 מיליארד פעילים לכל טוקן. מספר הפרמטרים הפעילים הנמוך הזה הוא כל העניין: הוא שומר על הסקה מהירה וזולה, בעוד מאגר מומחים גדול משמר את האיכות. חלון ההקשר הוא 1,048,576 טוקנים מלאים (כמיליון), עם פלט מקסימלי גדול מאוד של 384K, והמודל תומך בחשיבה (חשיבה מורחבת), קריאה לכלים, ו-JSON מובנה. הקלט הוא טקסט בלבד. מטרת העיצוב — עבודה בנפח גבוה, זמן השהיה נמוך ופעילות אוטונומית — באה לידי ביטוי בנתוני השירות: p50 זמן עד לטוקן ראשון בסביבות 394 מילישניות ותפוקה של כ-184 טוקנים בשנייה במדידות של OrcaRouter.

מדדים: מה שהמספרים הרשמיים אומרים

השחרור הרשמי נשען בכבדות על הערכות agentic וקידוד, שמרוצות עם ה-harness של DeepSeek עצמו (הגדרות minimal-mode / max-effort). הנה איך לקרוא את התוצאות המרכזיות, כולן מדווחות על ידי DeepSeek:

• Terminal-Bench 2.1: 82.7 — משימות שורת פקודה/תוכנה אייג'נטיות בטרמינל אמיתי. ציון גבוה כאן מצביע על מודל שבאמת יכול להפעיל כלים ומעטפות, ולא רק לענות על שאלות.

• Toolathlon (מאומת): 70.3 ו- Automation Bench (ציבורי): 25.1 — רוחב ואמינות של שימוש בכלים ואוטומציה מקצה לקצה. אמינות קריאת כלים היא התכונה הקריטית להצלחת סוכנים.

• Cybergym: 76.7 — פתרון בעיות סוכני בסגנון אבטחה/CTF.

• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — הנדסת תוכנה וקידוד Full-Stack, מיצירה ברמת מאגר קוד ועד משימות מדע נתונים קשות. הציון הגבוה ב-DSBench-FullStack (68.7) מצביע על מיומנות קידוד מעשית ורב-קבצית.

• Agent Last Exam: 25.2 — מבחן חשיבה אייג'נטית קשה במיוחד, שבו אפילו המודלים המובילים מקבלים ציון נמוך; שימושי כאות יחסי, לא כמוחלט.

לצורך הקשר בלתי תלוי, Artificial Analysis העריכה כעת את מבנה ה-0731 עצמו ומדרגת אותו 50 במדד ה-Artificial Analysis Intelligence Index — עשר נקודות מעל תצוגת אפריל שהוא מחליף, שש נקודות מעל ה-V4 Pro הגדול בהרבה, ובשורה אחת עם Gemini 3.6 Flash. התוצאות המרכיבות אותו: GPQA Diamond 91%, AA-LCR 66%, Humanity's Last Exam 37%, SciCode 50%, τ³-Bench Banking 31%, CritPt 17%, ו-Elo של 1559 ב-GDPval-AA v2. שניים מאלה ראויים לעיון נוסף. Artificial Analysis מדדה את Terminal-Bench 2.1 ב-79% לעומת 82.7 ש-DeepSeek דיווחה — קרוב, אבל נמוך יותר, וזה הכיוון שמספרי ה-vendor-harness בדרך כלל מחמיצים בו. ובבדיקת AA-Omniscience המודל מגיע ל-16- עם שיעור הזיות מדוד גבוה, כך שהסיפור של זול-ואגנטי אינו משתרע לשליפה עובדתית בלתי מפוקחת. זוהי הדרך החדה יותר לקרוא את המודל הזה: חשיבה חזקה לכל דולר, ידע חלש לכל שאילתה.

מתמטיקה תחרותית: המקום היחיד שבו Flash משתווה ל-Pro.

הקריאה העצמאית השימושית ביותר על החשיבה של V4 Flash מגיעה מ-MathArena, שמריצה כל מודל ארבע פעמים על כל בעיה מתחרות שפורסמה לאחרונה ומפרסמת את הרשת לפי בעיה. ב-AIME 2026 — שני הגיליונות, 30 בעיות, ארבע הרצות לכל אחד — V4 Flash במצב חשיבה מרבית מקבל 95.83% ±3.58%, לעומת DeepSeek V4 Pro עם 96.67% ±3.21%. המרווחים האלה חופפים כמעט לחלוטין: בקריטריון זה המודל הקטן אינו גרוע באופן מדיד מהדגל. עמודת העלות היא המקום שבו הם נפרדים. MathArena מעמידה הרצה אחת של V4 Flash על $0.009 לבעיה לעומת $0.082 עבור V4 Pro — זול בערך פי תשע עבור אותה דיוק, וזה טיעון חזק יותר לשכבת היעילות מכל מה שהכריזה DeepSeek עצמה.

יש להזכיר שתי הסתייגויות באותה נשימה. MathArena מסמנת את שתי הגרסאות של DeepSeek באזהרת זיהום, התווית שהיא נותנת למודל ששוחרר לאחר שהתחרות הופיעה, כך שחלק מהדיוק הזה עשוי להיות זכרון (recall) ולא חשיבה. והגרסה ש-MathArena בדקה מתוארכת ל-2026-04-24 — התצוגה המקדימה של אפריל, לא המבנה -0731. נכון לכתיבת שורות אלה אין ציון AIME 2026 בלתי תלוי לגרסה הרשמית, וכרטיס המודל של DeepSeek עצמו לא מפרסם שום benchmark מתמטי עבורה, אלא רק כאלה של סוכנים.

הטבלה גם מראה היכן נמצא התקרה. כמעט כל מודל על הלוח עובר את רוב AIME 2026; הבעיה שממיינת אותם היא בעיה 15. רק שתי כניסות פותרות אותה בכל ארבעת הריצות — GPT-5.5 במאמץ גבוה במיוחד ו-Claude Opus 4.8 במקסימום. V4 Flash קולע אפס מתוך ארבע שם, וכך גם V4 Pro, יחד עם GLM-5.2, Gemini 3.6 Flash, Kimi K2.6 ו-Claude Opus 4.7.

הפרט האחרון הזה הוא מה שהופך דיווח אחד מ-5 באוגוסט 2026 לראוי לציון. פרשן הבינה המלאכותית @teortaxesTex פרסם שה-build -0731 אכן פתר את בעיה 15 של AIME 2026, בכ-1,006 שניות ובכ-100,000 טוקנים של פלט, ותיאר את המודל כשהוא נראה מתחיל לשחק עם הבעיה, לפני שנטש את קיצור הדרך ועבד עליה ביושר. מדובר בריצה בודדת של משתמש אחד, לא בתוצאת benchmark: היא לא שוחזרה, אין לוח תוצאות ציבורי שדירג את ה-build -0731, ותמליל בודד אינו הערכה. מה שאפשר לבדוק הוא עקביות פנימית, והיא מחזיקה מעמד — Artificial Analysis מודדת את הפלט של המודל הזה בכ-116 טוקנים בשנייה, ו-1,006 שניות בקצב הזה הן כ-117,000 טוקנים — אותו טווח בערך של הספירה המדווחת. תשובה של 100,000 טוקנים נמצאת גם היא היטב בתוך מה ש-DeepSeek מצפה לו, שכן החברה ממליצה לאפשר עד 384K טוקנים של פלט במאמץ חשיבה גבוה או מקסימלי. שני הנתונים גבוהים בערך פי שלושה מהממוצעים שמדדה MathArena למודל הזה (33,588 טוקנים של פלט ו-6 דקות ו-50 שניות לתשובה), וזה מה שמצפים לראות בבעיה הקשה ביותר בסט. אז: סביר בצורתו, לא מאומת בתוצאותיו, ואם הוא ישוכפל, מדובר בקפיצה אמיתית לעומת build התצוגה המקדימה, שנכשל בבעיה הזו ארבע פעמים מתוך ארבע.

תמחור: המספר שמשנה תקציבים

ב-OrcaRouter, שמעביר את תמחור הספקים ללא מרווח, V4 Flash עולה בערך $0.15 למיליון אסימוני קלט ו-$0.29 למיליון אסימוני פלט, ו-DeepSeek השאיר את המחיר ללא שינוי עבור השדרוג הזה. זה בערך שליש מהמחיר של DeepSeek V4 Pro שהוא $0.44 / $0.88. פגיעות מטמון (cache hits) זולות יותר ממה שרוב האנשים חושבים: DeepSeek מציג מחיר של $0.0028 למיליון עבור קלט ממטמון, כ-98% מתחת לקלט חדש, וזה מה שהופך סוכנים וצ'אט עם system prompt יציב לכדאיים כל כך להפעלה. במונחים אמיתיים, 10 מיליון אסימונים בחודש בפיצול של 70% קלט / 30% פלט מגיעים לסדר גודל של כמה דולרים; תגדיל למיליארד אסימונים והפער מול דגם דגל הופך לסעיף שורה שחשבונאות שמה לב אליו.

עם זאת, במודל חשיבה, התעריף הוא הצד הפחות מעניין של החשבון — מה שמזיז תקציבים הוא כמה טוקנים המודל בוחר לבזבז. Artificial Analysis נזקקה לכ־206 מיליון טוקני פלט כדי להריץ את מדד האינטליגנציה המלא שלה על V4 Flash, בערך פי שניים מהחציון של כ־100 מיליון בקרב המודלים שהיא בודקת, והיא מתארת אותו כמהיר אבל מילולי מאוד. בחישוב תעריף, תשובה אחת של 100,000 טוקנים עולה כשלושה סנטים, ותקרת הפלט של 384K מגבילה תשובה אחת לקרוב לאחד־עשר סנטים. זול במונחים מוחלטים, אבל פי כמה מאות מהעלות של תשובה קצרה — וזו הסיבה שמאמץ החשיבה הוא מנוף תקציבי, לא חוגת איכות שמשאירים על מקסימום. הסקירה המעשית של סיימון וויליסון מצביעה על אותה נקודה מהכיוון ההפוך: בהגדרות ברירת המחדל, יצירת הטקסט שלו הייתה מאכזבת, והעלאת מאמץ החשיבה לגבוה שיפרה אותה באופן משמעותי. מדוד את הבקשות הקשות שלך בעצמך לפני שאתה מניח שהתעריף הרשמי הוא העלות שלך.

היכן V4 Flash משתלב: סולם ה-DeepSeek V4

קו ה-V4 של דיפ-סיק הוא סולם. V4 Pro הוא ספינת הדגל — מודל חשיבה וקוד גדול בהרבה, מהשורה הראשונה. V4 Flash הוא מדרגת היעילות: הרבה פחות כוח חישוב פעיל, שבריר מהמחיר, ולאחר שדרוג הפוסט-טריינינג הזה, יכולות אייג'נט וקוד חזקות באמת. העובדה שדיפ-סיק השקיעה בלהפוך את פלאש לטוב יותרכסוכן (Responses API, התאמת Codex, מדדי שימוש בכלים) מלמדת אותך איפה היא מצפה שהנפח ירוץ. אבל התוצאות של AIME 2026 מסבכות את התמונה המסודרת הזו לטובת פלאש: במתמטיקה תחרותית, שני המודלים נמצאים בתוך פסי השגיאה אחד של השני, ולכן "לשלוח את הבעיות הקשות ל-Pro" אינו נכון אוטומטית. החלוקה הכנה היא שפרו מספק רוחב ידע ואת עבודת האייג'נט הקשה ביותר, לא סיכוי טוב יותר לפתרון בעיית מתמטיקה קשה — וזו הסיבה שניתוב לפי קושי מדוד במשימות שלך עדיף על ברירת מחדל של שימוש במודל הגדול ביותר.

שלושה תרחישים מהעולם האמיתי

1. סוכני קידוד וזרימות עבודה בסגנון Codex

התמיכה המובנית של גרסת -0731 ב-Responses-API וב-Codex, ובנוסף הציונים שלה ב-Terminal-Bench (82.7) וב-DSBench-FullStack (68.7), הופכים את V4 Flash למנוע חזק וזול לסוכני קוד אוטונומיים — תיקון בעיות, רפקטורינג, יצירת טסטים ושימוש רב-שלבי בכלים.

2. סוכנים המשתמשים בכלים בנפח גבוה

מהירות ראשונית של טוקנים (~394 ms), תפוקה גבוהה (~184 tok/s), הקשר של 1M, ואמינות חזקה ב-Toolathlon (70.3) מתאימים לסוכני ייצור שמפעילים כלים בקנה מידה גדול — אחזור מידע, אוטומציה ותזמור.

3. עיבוד מסמכים ארוכים בתקציב מוגבל

ההקשר המלא של 1M טוקנים ופלט של 384K מטפלים בסיכום, ניתוח או המרה של קלטים גדולים מאוד — לוגים, בסיסי קוד, דוחות ארוכים — במעבר אחד ובעלות נמוכה.

איך לגשת ל-V4 Flash

אתה יכול לקרוא ל-V4 Flash ישירות ב-API של DeepSeek (מזהה המודל deepseek-v4-flash; הוא תומך ב-Responses API, ב-OpenAI ChatCompletions ובממשקים בסגנון Anthropic), או דרך נקודת קצה ניטרלית מבחינת ספק. OrcaRouter חושף את V4 Flash בתוספת רווח של 0% דרך נקודת קצה אחת תואמת OpenAI (deepseek/deepseek-v4-flash) לצד יותר מ-200 מודלים אחרים — כך שאתה יכול להשוות אותו ל-GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen3.8-Max ו-Kimi K3 במקום אחד, ולנתב כל בקשה למודל הזול ביותר עבור המשימה. מכיוון שהתמחור מועבר ישירות ללא תוספת רווח, שינוי מחיר של DeepSeek מגיע לחשבונית שלך ביום שבו הוא נכנס לתוקף. ובגלל שהממשק תואם OpenAI, אימוץ V4 Flash — או מעבר ממנו אחרי שבוע של מדידה — הוא שינוי תצורה, לא אינטגרציה מחדש.

מגבלות והסתייגויות כנות

V4 Flash הוא מודל יעילות, לא מודל דגל, אבל הנתונים הבלתי-תלויים הפכו את הגבול הזה לספציפי יותר מ"גרוע יותר בדברים קשים". ב-AIME 2026 הוא תואם את V4 Pro בתוך רווחי סמך; היכן שהוא מפגר בבירור הוא ברוחב הידע — AA-Omniscience ‎-16‎ וקצב הזיות גבוה שנמדד — ובעבודה הסוכנתית התובענית ביותר. הקלט הוא טקסט בלבד, ללא קלט תמונה מקורי. ציוני הסוכנות הבולטים הם דיווחים של DeepSeek על ה-harness שלה, והנתון היחיד שמעבדה בלתי-תלויה הריצה שוב הגיע נמוך יותר (Artificial Analysis מדדה Terminal-Bench 2.1 ב-79% לעומת 82.7 שדווח), ולכן יש להתייחס למספרי הספק ככיווניים. ו"זול לטוקן" אינו "זול למשימה": המודל הזה מלל-יתר במידה מדידה, אז יש להגביל את מאמץ החשיבה ואת איטרציות הכלים בקריאות פשוטות במקום להשאיר מאמץ מרבי כברירת מחדל. עליך לוודא על עומס העבודה שלך לפני שמחייבים תעבורת ייצור.

שאלות נפוצות

מה זה DeepSeek V4 Flash?

מודל היעילות של DeepSeek בקו V4: מודל mixture-of-experts עם 284B / 13B פרמטרים פעילים, עם הקשר של 1M טוקנים, עד 384K פלט, מכוון לעבודה מהירה, בנפח גבוה, אייג'נטית וקוד. הגרסה הרשמית שלו (build -0731) שוחררה ב-31 ביולי 2026.

מה השתנה בגרסה הרשמית?

הארכיטקטורה לא השתנתה; מדובר בשדרוג שלאחר אימון שמשפר משמעותית את היכולות הסוכניות, הקידוד וקריאה לכלים, ומוסיף תמיכה מקורית ב-Responses-API עם התאמת Codex. רק ה-Flash API שודרג — V4 Pro והאפליקציה והאתר נותרו ללא שינוי.

כמה עולה V4 Flash?

בערך $0.15 למיליון אסימוני קלט ו-$0.29 למיליון אסימוני פלט ב-OrcaRouter (תוספת של 0%) — בערך שליש מ-$0.44 / $0.88 של V4 Pro — עם פגיעות מטמון במחיר של $0.0028 למיליון, בערך 98% מתחת לקלט טרי. המחירים נשארו יציבים במהדורה זו. תקצבו גם נפח אסימונים וגם קצב: זהו מודל חשיבה מפורט, ותשובה של 100,000 אסימונים עולה כשלושה סנטים.

עד כמה V4 Flash טוב במשימות סוכן ובקוד?

DeepSeek מדווחת על ציונים גבוהים: Terminal-Bench 2.1 82.7, Toolathlon (מאומת) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — כל הנתונים הם מ-harness של הספק, אז בדקו על המשימות שלכם.

האם V4 Flash טוב במתמטיקה תחרותית?

טוב יותר ממה שמחירה מרמז. ברשת AIME 2026 של MathArena, גרסת התצוגה המקדימה של אפריל משיגה 95.83% בארבע ריצות של 30 בעיות — בתוך רווח הסמך של 96.67% של V4 Pro, בכתשיעית מהעלות לבעיה — אף ש-MathArena מציינת את שני הדגמים כחשודים לזיהום אפשרי, ועדיין לא נתנה ציון לגרסת -0731. הבעיה היחידה שהיא אף פעם לא פותרת היא בעיה 15, שרק GPT-5.5 במאמץ גבוה במיוחד ו-Claude Opus 4.8 ברמת פתרון מקסימלית פותרים אותה באופן אמין.

איך V4 Flash משתווה ל-V4 Pro?

Pro הוא ספינת הדגל הגדולה בהרבה עבור החשיבה והקידוד הקשים ביותר; Flash הוא שכבת היעילות בכשליש מהמחיר עם יכולת סוכנית/קידוד חזקה. נתב משימות קשות ל-Pro, ואת כל השאר ל-Flash.

מהו חלון ההקשר?

1,048,576 אסימונים מלאים (כ-1M), עם עד 384K אסימוני פלט.

האם V4 Flash הוא רב-מודאלי?

לא — הקלט הוא טקסט בלבד. הוא תומך בחשיבה, הפעלת כלים ופלט JSON.

האם V4 Flash עובד עם ה-API של Responses ועם Codex?

כן — מהדורת -0731 מוסיפה תמיכה מקורית ב-Responses-API והתאמה ספציפית ל-Codex, לצד ממשקי OpenAI ChatCompletions וסגנון Anthropic.

איך אני משתמש ב-V4 Flash?

ישירות דרך ה-API של DeepSeek, או דרך נקודת הקצה של OrcaRouter, שתואמת ל-OpenAI, בעמלה של 0% (deepseek/deepseek-v4-flash), שם ניתן גם להשוות ולנתב בין מודלים מתחרים.

השורה התחתונה

השחרור הרשמי של DeepSeek V4 Flash שומר על המתכון הזול והמהיר והופך אותו לסוכן טוב בהרבה: אותו MoE עם 284B / 13B פעילים והקשר של 1M, אומן מחדש לקידוד חזק יותר ושימוש בכלים, עם תמיכה מקורית ב-Responses-API וב-Codex, באותו מחיר של ~$0.15 / $0.29. הנתונים העצמאיים תומכים כעת ברוב ההבטחה — Artificial Analysis ממקמת את ה-build -0731 באותה רמת אינטליגנציה כמו Gemini 3.6 Flash, ו-MathArena מוצא שה-build המקדים תואם את V4 Pro ב-AIME 2026 בעלות של תשיעית לכל בעיה. מה שהתעריף הנמוך לא קונה הוא רוחב ידע או פטור מאריכות יתר: המודל הזה חושב בערך בכפול מתקציב הטוקנים של מודל ממוצע, כך שהחשבון שלך לכל משימה תלוי יותר במאמץ החשיבה שאתה מרשה מאשר במחיר הנקוב. הפעל אותו דרך נקודת קצה תואמת-OpenAI ללא תוספת מחיר כמו OrcaRouter, מדוד מה הבקשות הקשות שלך באמת עולות, ונתב למודל דגל רק היכן שהמדידה אומרת שצריך.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית