כרטיס כותרת ראשי למאמר 'DeepSeek V4 Pro Benchmarks': לוח תוצאות עם מחוון גדול, כותרת ראשית 'DeepSeek V4 Pro — כרטיס הניקוד של המדדים', כותרת משנה 'הציונים הרשמיים של 0813, בדיקות עצמאיות, ומה שעדיין לא שוחזר', ותגיות הנושאות את הטקסט 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. לוגו OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

בנצ'מרקים של DeepSeek V4 Pro: כרטיס הניקוד המלא של 0813, כל בדיקה עצמאית, ומה שאיש עוד לא אימת

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

תשובה בשורה אחת: Deep​Seek V4 Pro מציג תמונת מדדים אגנטית חזקה באמת לפי המספרים של Deep​Seek עצמו — Terminal-Bench 2.1 ב-87.9, DeepSWE ב-62.7, CyberGym ב-83.3 — אבל כמעט כל נתון כותרת הוא דיווח של הספק, והתמונה העצמאית קרירה יותר.Artificial Analysis ממקמת את גרסת ה-0813 הרשמית על 53 במדד האינטליגנציה שלה, בשוויון עם GLM 5.2, ארבע נקודות מאחורי GPT-5.6 Terra ושבע מאחורי Kimi K3; Vals AI מדרגת אותה במקום ה-12, מתחת ל-GPT-5.5 של הדור הקודם. מאמר זה הוא האיסוף המלא שאיש אחר לא כתב: כרטיס הניקוד השלם של 0813, מערך הקידוד המורחב מהדו"ח הטכני, כל בדיקה עצמאית שקיימת, ומאזן כנה של אילו מספרים שוחזרו ואילו עדיין מבוססים על דבר Deep​Seek בלבד. שבוע אחרי הכרטיס, תמונת השרתים החלה להתמלא גם היא — ב-19 באוגוסט 2026 פרסמו LMSYS ו-Ant Group מחסנית שירות H20 שמגיעה ל-271 אסימוני פלט לשנייה בגודל אצווה 1, המתוארת בחלק משלה להלן ומסווגת, כמו כל מה בצד הספק של עמוד זה, כמוצהר עצמי עד שמישהו ישחזר אותה.

כרטיס הניקוד הרשמי של 0813 — המספרים של Deep​Seek עצמו, כולם

ההודעה הרשמית של Deep​Seek (תיעוד API, news260813, 13 באוגוסט 2026) מדווחת על גרסת הייצור ביחס לתצוגה המקדימה של אפריל. כל נתון בקטע זה הוא דיווח של הספק — אף אחד מהם לא שוחזר באופן עצמאי נכון ל-16 באוגוסט 2026:

• Terminal-Bench 2.1 — 87.9 (תצוגה מקדימה: 72.1).

• DeepSWE — 62.7 (תצוגה מקדימה: 12.8) — קפיצה של פי 5 בערך, שהיא הטענה הבולטת ביותר בכרטיס.

• CyberGym — 83.3 (תצוגה מקדימה: 52.7).

• Humanity's Last Exam — 42.7 ללא כלים, 60.0 עם כלים (תצוגה מקדימה: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (תצוגה מקדימה: 55.9).

• AutomationBench (ציבורי) — 31.8 (תצוגה מקדימה: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (תצוגה מקדימה: 41.8 / 31.1).

• NL2Repo — 61.5 (תצוגה מקדימה: 38.5).

• הבחינה האחרונה של הסוכנים — 25.7 (תצוגה מקדימה: 16.5).

הדפוס שכדאי לשים לב אליו הוא היכן מתרכזות העליות: במדדי אייג׳נט ובמדדי אבטחת סייבר. זה בדיוק סוג כרטיס הניקוד שמעבדה מפיקה כשהיא רוצה לשווק מודל סוכן — ובדיוק הסוג שדורש ריצה חוזרת נייטרלית לפני שמשקיעים בו כסף לייצור.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

ערכת הקידוד המורחבת מהדוח הטכני של Deep​Seek

מעבר לכרטיס האגנטי, הדו"ח הטכני של DeepSeek (כפי שסוכם על ידי BenchLM ב-16 באוגוסט 2026) מוסיף מערך רחב יותר של קידוד והקשר ארוך. כמו כן, מדווח על ידי ספק, ומסומן כ-"Provider exact" על ידי BenchLM — ללא בדיקה עצמאית:

• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

• LiveCodeBench Pass@1-CoT — 93.5% — הטוב ביותר שאומת בקטלוג של BenchLM.

• דירוג Codeforces — 3206 — גם הטוב ביותר המאומת בקטלוג.

• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — שניהם הטובים ביותר בקטלוג לאחזור של 1M טוקנים, וזה חשוב למודל שמפרסם חלון הקשר של 1M טוקנים.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (מופיע בדף המודל של OrcaRouter).

מה באמת מודדים מעריכים בלתי תלויים

שלושה מקורות בלתי תלויים הריצו את DeepSeek V4 Pro, וההערכות שלהם מתרכזות מתחת לכרטיס הספק:

• Artificial Analysis Intelligence Index — 53 (הדיווח של SCMP, אוגוסט 2026; עמוד המודל של OrcaRouter מציג 53.2, מדורג 20 מתוך 132). בשורה אחת עם GLM 5.2, ארבע נקודות מאחורי GPT-5.6 Terra, ושבע מאחורי Kimi K3.

• Artificial Analysis Coding — 68.8, מדורג 24 מתוך 130 (לפי דף המודל של OrcaRouter).

• Vals AI Index — המקום ה-12, בפיגור אחרי GPT-5.5 מהדור הקודם, והרבה מאחורי Kimi K3 ו-Claude Opus 5 (SCMP). הבדיקות של Vals AI עצמה איתרו שתי נקודות תורפה קונקרטיות: השלמת משימות בתוך סביבת טרמינל מבודדת, ובניית מודלים פיננסיים מורכבים בגיליונות אלקטרוניים של Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, הריצה העצמאית היחידה "Benchmark exact" בקבוצה).

ספר החשבונות הכנה — מה ששוחזר לעומת מה שעדיין רק מילתו של Deep​Seek

זה הקטע שמאמר השוואת ביצועים קיים כדי לספק, והסיבה לסמן דף זה כמועדף במקום הסיקור של ההשקה. חלק כל ציון לאחת משתי קבוצות:

• ממקור עצמאי: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI במקום ה-12, Vibe Code Bench 49.93 — וריצת Terminal-Bench 2.1 ממקור נפרד של 78.7 המופיעה לצד התוצאה 87.9 של Deep​Seek בדף המודל של OrcaRouter. פער תשע הנקודות בין המספר של הספק לבין הריצה העצמאית הוא הנתון החשוב ביותר בעמוד זה: זהו פער השחזור, במונחים כמותיים.

• דיווח ספק בלבד, לא שוחזר באופן בלתי תלוי: כל נתון בכרטיס הרשמי 0813 למעלה (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) וכל מערך הקידוד המורחב (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). המסמכים של Deep​Seek עצמה מגדירים את הנתון Terminal-Bench 2.1 כ"ריצת ספק".

אם קוראים את זה כך, הסיפור קוהרנטי: DeepSeek V4 Pro הוא מודל frontier אמיתי באמצע החבילה — AA 53, מדורג בשנות העשרה והעשרים — עם כרטיס ניקוד של הספק שטוען לביצועי סוכן וקידוד כמעט מהמובילים. שתי ההצהרות נכונות, ואין ביניהן סתירה; האחת נמדדת, והאחרת היא טענה.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

מה העלות של כרטיס הניקוד

DeepSeek V4 Pro הוא דגם הדגל מסוג MoE עם סך של 1.6T / 49B פעילים, עם חלון הקשר של 1M טוקנים ותפוקה מקסימלית של 384K. ב-OrcaRouter הוא מתומחר לפי מחירון Deep​Seek ללא כל תוספת: $0.435 למיליון טוקני קלט ו-$0.87 למיליון טוקני פלט (קריאת מטמון $0.060 למיליון), לפי המדריך שנבדק ב-15 באוגוסט 2026 ואושר בעמוד המודל החי. בתעריף זה, חישוב המחיר לנקודה הוא הטיעון החזק ביותר בעד המודל: הוא בערך עשירית ממחיר הפלט של המודלים שמדורגים בסמוך לו במדד העצמאי, כך שאתה משלם מחירים של שכבה בינונית עבור כרטיס ניקוד שאם טענות הספק נכונות, הוא קרוב לפסגה. אזהרה אחת: Deep​Seek הכריזה על לוח תמחור שיא/שפל (שפל ב-50% מהשיא) שייכנס לתוקף ב-17 באוגוסט, שעון בייג'ינג, כך שהתעריף עשוי להשתנות — המספרים כאן הם מחיר המחירון החי נכון למועד כתיבת מאמר זה.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

הגשת DeepSeek V4 Pro: 271 טוקני פלט לשנייה על H20

מדדים בוחנים מה המודל יודע; מדדי הגשה בוחנים כמה בזול אפשר לגרום לו לחשוב. ב-19 באוגוסט 2026, LMSYS — הארגון שמאחורי Chatbot Arena — והצוות הפתוח של Ant Group פרסמו את עבודת ההגשה הרצינית הראשונה על בניית 0813: "מחסנית הגשה ספציפית לתרחיש" הבנויה על SGLang, מנוע ההגשה הפתוח ש-LMSYS מתחזקת. הנתון המרכזי הוא 271 אסימוני פלט לשנייה בגודל אצווה 1 על NVIDIA H20שהצוות מעריך ב-פי 1.42 מ-B300 — שהושג על שבב עם ללא Tensor Cores מקוריים של FP4. אלה מדידות משלהם של LMSYS ושל Ant Group, שהוכרזו בבלוג שלהם וב-X; אף אחת מהן לא שוחזרה באופן בלתי תלוי.

שאר המספרים של הסטאק, כולם דווחו עצמית על ידי LMSYS ו-Ant Group על הסטאק שלהם:

• השהיית פענוח — רכיב "optimized DSpark" מפחית את הזמן לכל אסימון פלט (TPOT) ב-74.8–78.0% בגודל אצווה 1.

• מילוי מוקדם — מילוי מוקדם של מיליון טוקנים מסתיים ב-43.7 שניות, גידול של 36.5% בממוצע הגיאומטרי בתפוקת המילוי המוקדם.

• KV cache — שיטה שהצוות מכנה "Humming MXFP4AFP8 + Online C128" מרחיבה את קיבולת מטמון ה-KV המלא פי 10.14, המנוף שהופך עומסי עבודה של סוכנים עם מיליון טוקנים למעשיים על סיליקון מסוג זה.

• פענוח לכל GPU — בהקשר של 4K, תפוקת הפענוח לכל GPU עולה מ-319.9 ל-703.2 אסימונים/שנייה/GPU, שיפור של פי 2.20.

קראו את ההסתייגויות לפני שמתכננים את גודל הצי על סמך זה. Batch size 1 הוא משטר של זרם יחיד — מה שסוכן אינטראקטיבי או צ'אט נתקלים בו, לא API עם מקביליות גבוהה — וההשוואה של 1.42× מול B300 היא יחס ש-LMSYS מציינת בלי לפרסם את ה-tokens/s המוחלט של B300, כך שהפער הוא טענה שאינה ניתנת לבדיקה. התוצאה גם מודדת את הערימה, לא את השבב: הרווחים האלה מגיעים מאופטימיזציה ברמת SGLang על חומרה שאחרת הייתה נראית חלשה מדי עבור MoE בהיקף כולל של 1.6T. לצורך הקשר, דף המודל החי של OrcaRouter מודד את DeepSeek V4 Pro בקצב פלט של 80.8 tokens/s דרך נקודת קצה API משותפת — נתון ה-H20 הוא בנצ'מרק של זרם יחיד על ערימה ייעודית, מספר שונה עם משמעות שונה.

אם עומס העבודה שלך מוגש דרך API, כל זה לא משנה את הדרך שבה אתה קורא למודל: DeepSeek V4 Pro הוא מפתח אחד תואם-OpenAI ב-OrcaRouter במחיר המחירון של DeepSeek, עם מעבר אוטומטי למקרה שהספק יתקע. מספרי H20 חשובים ביותר אם אתה בצוות ששוקל להריץ צי H20 בעצמו מול תשלום עבור ה-API — הפער שעבודת LMSYS ו-Ant Group סוגרת הוא החלטת רכישת חומרה, לא החלטת בחירת מודל.

כשההמלצה הזו שגויה

המקרים שבהם, בכנות, DeepSeek V4 Pro לא צריך להיות הבחירה שלך:

• אתה צריך חשיבה חלוצית שאושרה באופן בלתי-תלוי.AA Index 53 נמצא באמצע החבילה — Kimi K3 (60) ו-GPT-5.6 Terra (57) מקדימים ואומתו. אם ההחלטה שלך תלויה בתקרה הנמדדת, כרטיס הספק לא משנה אותה.

• אתה מהמר את הייצור על DeepSWE 62.7 לפני שמישהו יריץ את זה שוב. קפיצה מ-12.8 ל-62.7 בגרסה אחת היא טענה, לא עובדה. חכה לשחזור ניטרלי — פער ה-87.9 מול 78.7 ב-Terminal-Bench מראה מה אפשר למצוא.

• עומס העבודה שלך הוא אוטומציית מסוף בסביבת ארגז חול או מודלים פיננסיים באקסל. Vals AI אומרת שאלה בדיוק המקומות שבהם המודל מתקשה, ללא תלות בציון של ספק כלשהו.

• אתה מקבל החלטת אבטחת סייבר על CyberGym 83.3. זה Deep​Seek שבודקת את המודל שלה על הבנצ'מרק שלה — ספק אבטחה שקונה על סמך המספר הזה קונה נתונים שלא עברו ביקורת.

• אתה קונה את ה-H20s על סמך המספר 271 tokens/s בלבד.הנתון הזה הוא בנצ'מרק של מחסנית יחידה, בדיווח עצמי, בגודל batch של 1 — מבטיח, לא שוחזר, ונקודה אחת על עקומת עלות שכוללת גם ניצולת, צריכת חשמל, וכל מחסנית סרווינג שהיית מריץ בפועל.

שורה תחתונה

DeepSeek V4 Pro 0813 הוא מודל חזיתי אמיתי עם כרטיס ניקוד של הספק שעולה על התוצאות העצמאיות שלו. מהדורת 0813 הפכה תצוגה מקדימה טקסטואלית למתמודד סוכני רציני — סיקרנו את המהדורה עצמה בנפרד — ואם תרצו להעריך אותה היום, מדובר במפתח אחד תואם-OpenAI ב-OrcaRouter במחיר המחירון של DeepSeek, עם מעבר אוטומטי אם הספק נתקע. פשוט קראו את כרטיס הניקוד כפי שהמאמר מפצל אותו: הבדיקות העצמאיות (AA 53, Vals במקום ה-12, ריצת ה-78.7 ב-Terminal-Bench) הן מה שאפשר לסמוך עליו היום; ה-87.9 וה-62.7 הם מה שצריך לאמת לפני שבונים עליהם. אותה משמעת מתרחבת כעת גם להגשה: 271 הטוקנים לשנייה בתפוקה של LMSYS ו-Ant Group על H20 היא תמונת התפוקה הטובה ביותר שיש לנו, וזו עדיין המילה שלהם עד שריצה ניטרלית תאשר אותה. קנו אותו בגלל יחס המחיר-ביצועים והקשר של מיליון טוקנים, לא בגלל מספרי הכותרת שלא שוחזרו.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית