
בנצ'מרקים של DeepSeek V4 Pro: כרטיס הניקוד המלא של 0813, כל בדיקה עצמאית, ומה שאיש עוד לא אימת
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
התשובה במשפט אחד: DeepSeek V4 Pro מציג כרטיס ביצועים סוכני חזק באמת לפי המספרים של DeepSeek עצמו — Terminal-Bench 2.1 עם 87.9, DeepSWE עם 62.7, CyberGym עם 83.3 — אבל כמעט כל נתון מרכזי מדווח על-ידי הספק, והתמונה העצמאית קרירה יותר. Artificial Analysis ממקם את המבנה הרשמי 0813 על 53 במדד האינטליגנציה שלו, בשוויון עם GLM-5.2, ארבע נקודות מאחורי GPT-5.6 Terra ושבע מאחורי Kimi K3; Vals AI מדרג אותו במקום 12, מתחת ל-GPT-5.5 מהדור הקודם. המאמר הזה הוא האיגום המלא שאיש אחר לא כתב: כרטיס הביצועים השלם של 0813, סט הקידוד המורחב מהדוח הטכני, כל בדיקה עצמאית שקיימת, וספר חשבונות כנה של אילו מספרים שוחזרו ואילו עדיין מבוססים על דברתה בלבד של DeepSeek.
כרטיס הניקוד הרשמי של 0813 — המספרים של DeepSeek עצמו, כולם
ההודעה הרשמית של DeepSeek (תיעוד API, news260813, 13 באוגוסט 2026) מדווחת על גרסת הייצור לעומת תצוגת אפריל. כל נתון בסעיף זה הוא דיווח של הספק — אף נתון לא שוחזר באופן עצמאי נכון ל-16 באוגוסט 2026:
• Terminal-Bench 2.1 — 87.9 (תצוגה מקדימה: 72.1).
• DeepSWE — 62.7 (תצוגה מקדימה: 12.8) — קפיצה של פי 5 בערך, שהיא הטענה הבולטת ביותר בכרטיס.
• CyberGym — 83.3 (תצוגה מקדימה: 52.7).
• Humanity's Last Exam — 42.7 ללא כלים, 60.0 עם כלים (תצוגה מקדימה: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (תצוגה מקדימה: 55.9).
• AutomationBench (ציבורי) — 31.8 (תצוגה מקדימה: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (תצוגה מקדימה: 41.8 / 31.1).
• NL2Repo — 61.5 (תצוגה מקדימה: 38.5).
• הבחינה האחרונה של הסוכנים — 25.7 (תצוגה מקדימה: 16.5).
הדפוס שכדאי לשים לב אליו הוא היכן מתרכזות העליות: במדדי אייג׳נט ובמדדי אבטחת סייבר. זה בדיוק סוג כרטיס הניקוד שמעבדה מפיקה כשהיא רוצה לשווק מודל סוכן — ובדיוק הסוג שדורש ריצה חוזרת נייטרלית לפני שמשקיעים בו כסף לייצור.

מערך הקידוד המורחב מהדוח הטכני של DeepSeek
מעבר לכרטיס הסוכני, הדו"ח הטכני של DeepSeek (כפי שאוגד על ידי BenchLM ב-16 באוגוסט 2026) מוסיף סט רחב יותר של קידוד והקשר ארוך. כמו כן, מדווח על ידי הספק, ומתויג כ-"Provider exact" על ידי BenchLM — ללא בדיקה עצמאית:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — הטוב ביותר שאומת בקטלוג של BenchLM.
• דירוג Codeforces — 3206 — גם הטוב ביותר המאומת בקטלוג.
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — שניהם הטובים ביותר בקטלוג לאחזור של 1M טוקנים, וזה חשוב למודל שמפרסם חלון הקשר של 1M טוקנים.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (מופיע בדף המודל של OrcaRouter).
מה באמת מודדים מעריכים בלתי תלויים
שלושה מקורות בלתי תלויים הריצו את DeepSeek V4 Pro, וההערכות שלהם מתרכזות מתחת לכרטיס הספק:
• Artificial Analysis Intelligence Index — 53 (דיווח של SCMP, אוגוסט 2026; עמוד המודל של OrcaRouter מציג 53.2, מדורג 20 מתוך 132). באותה רמה כמו GLM-5.2, ארבע נקודות מאחורי GPT-5.6 Terra, ושבע מאחורי Kimi K3.
• Artificial Analysis Coding — 68.8, מדורג 24 מתוך 130 (לפי דף המודל של OrcaRouter).
• Vals AI Index — המקום ה-12, בפיגור אחרי GPT-5.5 מהדור הקודם, והרבה מאחורי Kimi K3 ו-Claude Opus 5 (SCMP). הבדיקות של Vals AI עצמה איתרו שתי נקודות תורפה קונקרטיות: השלמת משימות בתוך סביבת טרמינל מבודדת, ובניית מודלים פיננסיים מורכבים בגיליונות אלקטרוניים של Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, הריצה העצמאית היחידה "Benchmark exact" בקבוצה).
הפנקס הכנה — מה ששוחזר לעומת מה שעדיין אינו אלא המילה של DeepSeek
זה הקטע שמאמר השוואת ביצועים קיים כדי לספק, והסיבה לסמן דף זה כמועדף במקום הסיקור של ההשקה. חלק כל ציון לאחת משתי קבוצות:
• ממקור בלתי תלוי: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI מדורג 12, Vibe Code Bench 49.93 — וריצה ממקור בלתי תלוי של Terminal-Bench 2.1 עם תוצאה 78.7 שמופיעה לצד 87.9 של DeepSeek בעמוד המודל של OrcaRouter. פער תשע הנקודות בין המספר של הספק לבין ריצה בלתי תלויה הוא הנתון החשוב ביותר בעמוד זה: זהו פער השחזור, מכומת.
• דווח על ידי הספק בלבד, לא שוחזר באופן עצמאי: כל נתון בכרטיס 0813 הרשמי שלמעלה (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) וכל סט הקידוד המורחב (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). המסמכים של DeepSeek עצמם מגדירים את הנתון של Terminal-Bench 2.1 כ'הרצת ספק'.
אם קוראים את זה כך, הסיפור קוהרנטי: DeepSeek V4 Pro הוא מודל frontier אמיתי באמצע החבילה — AA 53, מדורג בשנות העשרה והעשרים — עם כרטיס ניקוד של הספק שטוען לביצועי סוכן וקידוד כמעט מהמובילים. שתי ההצהרות נכונות, ואין ביניהן סתירה; האחת נמדדת, והאחרת היא טענה.

מה העלות של כרטיס הניקוד
DeepSeek V4 Pro הוא דגם הדגל MoE עם סה"כ 1.6T / 49B פעילים, עם חלון הקשר של 1M טוקנים ותפוקה מקסימלית של 384K. ב-OrcaRouter הוא מתומחר במחיר הרשום של DeepSeek ללא תוספת מרווח: $0.435 למיליון טוקני קלט ו-$0.87 למיליון טוקני פלט (קריאת מטמון $0.060 למיליון), לפי המדריך שנבדק ב-15 באוגוסט 2026 ואושר בעמוד המודל החי. בקצב הזה, חישוב המחיר-לנקודה הוא הטיעון החזק ביותר עבור המודל: הוא בערך עשירית ממחיר הפלט של המודלים שמדורגים קרוב אליו במדד העצמאי, כך שאתה משלם מחירי ביניים עבור כרטיס ניקוד שאם טענות החברה נכונות, הוא קרוב לצמרת. אזהרה אחת: DeepSeek הכריזה על לוח זמנים של תמחור שיא/שפל (שפל ב-50% מהשיא) שייכנס לתוקף ב-17 באוגוסט, שעון בייג'ין, כך שהתעריף עשוי לזוז — המספרים כאן הם המחיר הרשום העדכני נכון לכתיבת מאמר זה.

כשההמלצה הזו שגויה
המקרים שבהם, בכנות, DeepSeek V4 Pro לא צריך להיות הבחירה שלך:
• אתה צריך חשיבה חלוצית שאושרה באופן בלתי-תלוי.AA Index 53 נמצא באמצע החבילה — Kimi K3 (60) ו-GPT-5.6 Terra (57) מקדימים ואומתו. אם ההחלטה שלך תלויה בתקרה הנמדדת, כרטיס הספק לא משנה אותה.
• אתה מהמר את הייצור על DeepSWE 62.7 לפני שמישהו יריץ את זה שוב. קפיצה מ-12.8 ל-62.7 בגרסה אחת היא טענה, לא עובדה. חכה לשחזור ניטרלי — פער ה-87.9 מול 78.7 ב-Terminal-Bench מראה מה אפשר למצוא.
• עומס העבודה שלך הוא אוטומציית מסוף בסביבת ארגז חול או מודלים פיננסיים באקסל. Vals AI אומרת שאלה בדיוק המקומות שבהם המודל מתקשה, ללא תלות בציון של ספק כלשהו.
• אתה מקבל החלטת אבטחת סייבר על סמך CyberGym 83.3. כלומר, DeepSeek בודקת את המודל שלה על הבנצ'מרק שלה — ספק אבטחה שקונה על סמך המספר הזה, קונה נתונים שלא עברו ביקורת.
השורה התחתונה
DeepSeek V4 Pro 0813 הוא מודל חלוצי אמיתי עם כרטיס ניקוד של ספק שעוקף את הרקורד הבלתי תלוי שלו. מהדורת 0813 הפכה תצוגה מקדימה מבוססת טקסט למתחרה רצינית בתחום הסוכנים (סיקרנו את המהדורה עצמה בנפרד), ואם תרצו להעריך אותו היום, הוא מפתח אחד תואם OpenAI ב-OrcaRouter במחיר המחירון של DeepSeek, עם מעבר אוטומטי אם הספק נתקע. פשוט קראו את כרטיס הניקוד בדרך שבה המאמר הזה מפצל אותו: הבדיקות הבלתי תלויות (AA 53, Vals במקום ה-12, ריצת ה-78.7 ב-Terminal-Bench) הן מה שאפשר לסמוך עליהן היום; התוצאות 87.9 ו-62.7 הן מה שכדאי לאמת לפני שבונים עליהן. קנו אותו בזכות יחס מחיר-ביצועים וקונטקסט של מיליון טוקנים, לא בזכות המספרים שבכותרת שלא שוחזרו.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
