כרטיס כותרת גיבור עבור DeepSeek-V4-Flash-Vision-Exp עם כתובית 'אותו מחיר כמו V4-Flash, עכשיו עם עיניים', אייקון קו של עין ותג מחיר, תג מעוגל קטן עם הכיתוב 'EXPERIMENTAL • API • 2026-08-21', ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

DeepSeek V4 Flash Vision (Exp) מושק ב-API: באותו מחיר כמו V4-Flash, עכשיו עם עיניים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

DeepSeek V4 Flash Vision (Exp) הושק בפלטפורמת ה-API של Deep​Seek היום, 21 באוגוסט 2026, והמספר החשוב ביותר בהכרזה אינו מדד ביצועים — אלא המחיר: מודל הראייה הניסיוני הזה מחויב בדיוק באותם תעריפי טוקנים כמו DeepSeek V4 Flash, סוס העבודה הטקסטואלי, שביכולת הטקסט הטהור שלו הוא משתווה במלואו. זה הופך את זה לפעם הראשונה שה-API של Deep​Seek עצמו קיבל תמונות בכלל, וזה אומר שהדרך הזולה ביותר להריץ סוכן עם הקשר של 1M הפכה זה עתה לרב-מודאלית בחינם.

מה שנשלח בפועל

DeepSeek V4 Flash Vision (Exp) הוא מודל מולטימודלי ניסיוני, הנגיש באמצעות מזהה המודל deepseek-v4-flash-vision-exp. הוא מקבל טקסט ותמונות כקלט ומפיק טקסט כפלט, על פני חלון הקשר של 1M אסימונים עם פלט מקסימלי של 384K, במצבי חשיבה ואי-חשיבה גם יחד. הוא תומך בפורמט Chat Completions, בפורמט Messages בסגנון Anthropic, ובפורמט Responses – שהם השלישייה שפריימוורק סוכן צריך כדי לחבר אותו ללא מתאם מותאם אישית.

בקלט תמונות, Deep​Seek מקבל JPEG, PNG, GIF ו-WebP, המועברים בשלוש דרכים: base64 מוטבע, כתובת URL חיצונית, או קובץ שהועלה דרך ה-API החדש של Files. אין עדיין קלט וידאו או אודיו — ה"ראייה" כאן היא של תמונות סטילס בלבד.

A screenshot of the DeepSeek API docs news page (captured August 21 2026) showing 'DeepSeek-V4-Flash-Vision-Exp Release 2026/08/21' at the top of the news list and the release post opening: 'This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities — including agents, reasoning, and world knowledge.'

המיצוב של Deep​Seek עצמו, בהערות השחרור שלו: יכולת טקסט טהור — סוכנים, חשיבה, ידע עולמי — ברמה של שחרור DeepSeek V4 Flash הרשמי, בעוד יכולת סוכן מולטי-מודאלית עושה קפיצה משמעותית ומתקרבת ל-Opus-4.8. זו טענה של ספק, שלא שוחזרה, וכדאי לקרוא אותה בעיון, כי פרטי ה-benchmark שמאחוריה מעניינים יותר מהכותרת הראשית.

למה הזינוק במדדים גדול יותר ממה שנדמה

כל הנתונים הבאים הם של Deep​Seek עצמה, שפורסמו היום בהודעת ההשקה, ולא אומתו באופן עצמאי. במדדי הסוכן הכוללים צילומי מסך ותמונות, DeepSeek V4 Flash הטקסטואלי בלבד אינו קורא אותם — הוא פשוט מתעלם מהחלקים הרב-מודאליים של המשימה. DeepSeek V4 Flash Vision (Exp) אכן מסתכל, ולכן הפערים כה גדולים:

• ApexBench Pass@1 — Vision-Exp 36.5 לעומת V4-Flash 26.2 (Opus-4.8 39.4)

• המבחן האחרון של סוכנים — Vision-Exp 27.3 לעומת V4-Flash 25.2 (Opus-4.8 25.7)

• Terminal-Bench 2.1 — Vision-Exp 83.9 לעומת V4-Flash 82.7 (Opus-4.8 85.0)

• NL2Repo — Vision-Exp 57.7 לעומת V4-Flash 54.2 (Opus-4.8 69.7)

• DeepSWE — Vision-Exp 59.3 לעומת V4-Flash 54.4 (Opus-4.8 58.0)

• Chartography — Vision-Exp 64.3 (V4-Flash לטקסט בלבד אינו יכול לנסות זאת)

• ZeroBench Pass@5 — Vision-Exp 35.0 (V4-Flash לטקסט בלבד אינו יכול לנסות זאת)

A single-column scoreboard titled 'DeepSeek-V4-Flash-Vision-Exp — the scoreboard' listing Context 1M tokens, Max output 384K tokens, Input text + images, Image billing up to 384 tokens each, ApexBench Pass@1 36.5, Status experimental — no GA date, with a footer reading 'All benchmark figures vendor-reported; no independent scores yet.'

שניים מהמספרים האלה ראויים למבט שני. ב-Agents' Last Exam, Vision-Exp (27.3) גוברת בקושי על Opus-4.8 (25.7), ובעצם גם ב-DeepSWE היא מנצחת את Opus-4.8 (59.3 לעומת 58.0). על זה נשען הביטוי "קרוב ל-Opus-4.8" — לא תוצאה אחת בולטת, אלא סדרה של מדדי סוכנים שבהם ראיית המסך סוגרת את רוב הפער מול המודל המולטימודאלי המוביל, תוך שהיא נמכרת במחיר נמוך בסדר גודל בערך.

כמה עולה תמונה, עד הספרה העשרונית

תמונות עוברות טוקניזציה לצורכי חיוב — עד 384 טוקנים כל אחת — ולאחר מכן מחויבות באותם תעריפים לכל טוקן כמו DeepSeek V4 Flash. מכיוון ש-Deep​Seek העבירה את כל המודלים שלה לתמחור שיא/שפל ב-16 באוגוסט 2026, המספרים המדויקים תלויים במועד הקריאה:

• קלט, פספוס מטמון — $0.22 לכל מיליון אסימונים בשעות לא שיא, $0.44 בשעות שיא

• קלט, פגיעת מטמון — $0.007 לכל מיליון טוקנים בשעות לא שיא, $0.014 בשעות שיא

• פלט — $0.66 למיליון טוקנים בשעות שפל, $1.32 בשעות שיא

שעות שיא — 01:00–04:00 ו-06:00–10:00 UTC (כל שאר השעות אינן שעות שיא)

עשו את החשבון ועלות הראייה כמעט נעלמת. תמונה אחת במכסת 384 הטוקנים שלה עולה בערך 0.0085 סנט בשעות השפל ו-0.017 סנט בשעות השיא, כקלט. סוכן שקורא 50 צילומי מסך בריצה אחת מוסיף בערך חצי סנט של טוקני קלט — לפני שהמודל כותב אפילו את טוקן הפלט הראשון שלו. Deep​Seek גם מגביל את הרזולוציה לפני ההסקה: רמת הפירוט הנמוכה משנה את הגודל ל-512×512, ורמה גבוהה/מקורית משנה את קנה המידה של התמונה מראש (קטנות מוגדלות עד בערך 384×384, וגדולות מוקטנות עד בערך 800×800), כך שמקור ברזולוציה גבוהה לעולם לא מוזן למודל במספר הפיקסלים המקורי שלו.

שחקני המשנה: Files API חינמי ו-Harness 0.1.1

שני רכיבי תשתית שוחררו יחד עם המודל. ה-Files API פעיל וחינמי: העלו תמונה פעם אחת, הפנו אליה באמצעות file_id, והשתמשו בה שוב בבקשות שונות מבלי לשלוח מחדש את הבתים — דבר משמעותי עבור סוכן גלישה שמחזיק דף בהקשר לאורך כמה סבבים. ו-Deep​Seek Harness 0.1.1, ששוחרר באותו יום, מגיע עם תמיכה מובנית במודל החדש, כך שה-Harness שמריץ benchmark ומניע עומסי עבודה סוכנותיים של Deep​Seek יכול לכוון אליו מיד.

הסתייגות הייצור, במילים פשוטות

זהו מודל ניסיוני. {{1}}Deep​Seek מגדיר אותו במפורש ככזה, לא הכריז על תאריך GA, וממליץ לא להריץ אותו ישירות בסביבת ייצור;{{/1}} התוכנית המוצהרת היא לבצע איטרציות על בסיס משוב ולשחרר גרסה יציבה מאוחר יותר. {{2}}ההשלכה המעשית היא שמוח הטקסט מוכח — הוא אותה משפחת משקלים שמפעילה את V4-Flash — אבל מסלול הראייה הוא קוד חדש, ואף אחד מחוץ ל-Deep​Seek לא ערך לו מבחני עומס בקנה מידה נרחב.{{/2}}

זו בדיוק הסיטואציה שבה שכבת ניתוב מוכיחה את ערכה. ב-OrcaRouter, גם deepseek/deepseek-v4-flash-vision-exp וגם deepseek/deepseek-v4-flash פעילים מאחורי API אחד, במחיר הרשום של Deep​Seek, שמועבר הלאה ללא כל תוספת. אפשר לנתב תעבורה עם תמונות אל המודל הניסיוני, ובאותה תצורה להגדיר מעבר אוטומטי למודל גיבוי ברגע שהוא שוגה או חורג מהזמן הקצוב — מה שמפחית את הסיכון הכרוך בכל בעיית "הקוד החדש". ה-DSL של הניתוב גם מאפשר לשלוח רק את הקריאות שמכילות תמונות בפועל אל מודל הראייה, ולהשאיר תעבורת טקסט בלבד על DeepSeek V4 Flash, וכך להשיג את שיפורי הביצועים במדדים היכן שהם קיימים, בלי לשלם תוספת כלשהי היכן שהם לא.

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash-vision-exp showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context, 384K max output, 'Input: text + Image', 'Output: text', p50 TTFT 275 ms, and the model description 'Experimental vision-enabled variant of DeepSeek V4 Flash: text + image in, text out'.

מה לצפות בהמשך

{{1}}השאלות הפתוחות הן השאלות הרגילות להשקה ניסיונית.{{/1}} {{2}}מתי DeepSeek V4 Flash Vision (Exp) יגיע ל-GA, והאם המחיר יחזיק מעמד?{{/2}} {{3}}האם בהמשך יגיע קלט וידאו או אודיו — המודל כיום תומך רק בתמונות, מה שמותיר את מודלי הפרונטיר המולטימודליים הגדולים ללא תחרות במדיה נעה.{{/3}} {{4}}והאם ההערכות העצמאיות (הריצה הראשונה של צד שלישי על ApexBench או Terminal-Bench) משחזרות את המספרים שפורסמו?{{/4}} {{5}}הדבר המעניין הוא שגם אם כל benchmark יירד, הטענה היחידה שכבר חסכונית — ראייה במחירי טקסט — היא עובדה תמחורית, לא טענת benchmark, ואינה דורשת שחזור.{{/5}}

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube