
DeepSeek Harness: הלוויתן השחור צץ — מה ידוע עד כה על המתחרה של DeepSeek ל-Claude Code
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123אינטליגנציה49כתיבת קוד
DeepSeek Harness v0.1 יצא לאור, ודוח השטח הראשון שחשוב הגיע פחות מיום לאחר מכן. ב-14 באוגוסט, אותו חשבון X שקבע את שעון השחרור — teortaxesTex — תיאר סשן שנראה מת בעוד שבפועל היה מסתיים: הזרמת הטוקנים האטה "בקצב אקספוננציאלי" עד לזחילה, הממשק הראה חמישה מתוך תשעה משימות שהושלמו, ורענון עמוד גילה שכל התשעה הושלמו. הממשק הראה מצב מלפני כחמישים דקות. "האם זו... כוונתכם ב'קומפוזיציוליות מרחבית-זמנית'?" — עקיצה הוגנת, כי התשתית שעליה DeepSeek בנה את הדבר הזה מחזיקה ממש בתיאוריה על הזמן. הפוסט הזה התחיל ככתבה על עקבות הדלפה; העקבה נפתרה ב-13 באוגוסט, כאשר DeepSeek פרסמה את ה-harness כקוד פתוח. בהמשך מובא מה שנשלח בפועל, ומה היום הראשון של שימוש אמיתי מלמד על שכבת הסוכן שנבנית סביב DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro.
המסגור הכנה השתנה מאז שהפוסט הזה פורסם לראשונה. בזמן הפרסום, שום דבר בשם "DeepSeek Harness" לא שוחרר, והראיות היו ערימה של פירורי לחם ציבוריים — חשבון WeChat מאומת, מודעות דרושים, הערת שוליים במדד ביצועים (benchmark), ושיחת בדיקה פנימית. זה כבר לא נכון. בערב ה-13 באוגוסט, לפי שעון בייג'ינג, DeepSeek פרסמה גרסת v0.1 של ה-harness כתצוגת מפתחים ברישיון MIT ב-github.com/deepseek-ai/deepseek-harness, הניתנת להרצה בפקודת npm אחת, והמאגר משך יותר מ-30,000 כוכבי GitHub תוך שעות. ההדלפה הפכה למוצר. מה שאינו מאומת כעת אינו האם ה-harness קיים, אלא כיצד הוא מתנהג בשטח — ודוחות השטח המוקדמים הם הראיות החדשות.
מודל + רתמה = סוכן: מה זה בעצם "רתמה"
הנוסחה ש-DeepSeek משתמשת בה פנימית היא מודל + רתמה = סוכן. המודל הוא המוח; הרתמה היא כל השאר שגורם לסוכן לעבוד בפועל — ניהול קונטקסט וזיכרון, קריאה לכלים, תכנון משימות, קריאה וכתיבת קבצים, הרצת פקודות בטרמינל, הזנת פלט שגיאות בחזרה ללולאה, ושיפוט האם משימה אכן הושלמה.
המונח זכה לפופולריות על ידי Anthropic והפך למסגרת התעשייתית להבנת מדוע סוכני קוד הם יותר מאשר LLM טוב. מודל שמשיג ציונים גבוהים במדדים עדיין יכול להיכשל בלולאת סוכן אם התשתית שמסביב — איך הוא מזמן כלים, איך הוא זוכר מה עשה לפני עשר דקות, איך הוא מתאושש כשפקודה נכשלת — חלשה. DeepSeek הפך את התשתית הזו לאסטרטגיית המוצר המפורשת שלו, וצוות Harness הוא הגורם הארגוני שמבצע זאת. המודלים שמתחת כבר שוחררו: DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro, ושניהם נושאים ציוני מדד מכווננים לסוכנים ש-DeepSeek הפיק בתוך ה-harness שלו, אפילו עד לשם "DeepSeek Harness minimal mode."
שובל הדליפות שהסתיים ב-13 באוגוסט
זו מעולם לא הייתה הדלפה אחת; זה היה ערימה של פירורי לחם ציבוריים שהצטברו מאז מרץ ולבסוף התגבשו לתאריך שחרור. בסדר משוער:
• מרץ 2026 — דיווחים מקשרים את Cui Tianyi (崔添翼), בוגר מדעי המחשב מאוניברסיטת ג'ג'יאנג ומהנדס לשעבר במשך תשע שנים ב-Jane Street, לעבודת ה-Agent של DeepSeek; העיתונות מזהה אותו מאוחר יותר כראש צוות Harness. דווח, אך לא אושר על ידי DeepSeek באותה העת.
• 24 באפריל 2026 — DeepSeek V4 חושפת תצוגה מקדימה, ממוקמת במפורש למשימות סוכן ומותאמת לכלי סוכן כמו Claude Code.
• מאי 2026 — DeepSeek מפרסמת שתי משרות Harness ב-Moka — מנהל מוצר של Agent Harness ומהנדס מחקר, שניהם מבוססי בייג'ינג. חוקר DeepSeek, Chen Deli, כותב בפומבי שהמטרה, בקיצור, היא לבצע בנצ'מרק ל-Claude Code ולבנות "DeepSeek Code Harness."
• יוני 2026 — מאמצי הגיוס נמשכים; ראש הצוות מתאר את המחלקה כחסרת כוח אדם, עם "יעדים שאפתניים ועומס עבודה כבד."
• 6–7 ביולי 2026 — חשבון ה-WeChat של "צוות DeepSeek Harness" נרשם ואושר תחת הישות הבייג'ינגית של DeepSeek, עם לוגו של לוויתן שחור. איש מבחוץ עדיין לא שם לב.
• 31 ביולי 2026 — ה-API הרשמי של DeepSeek V4 Flash נכנס לבטא ציבורית, והתיעוד של ה-API של DeepSeek חושף — לראשונה — שמשימות CodeAgent במדדים הציבוריים שלו הורצו על "DeepSeek Harness minimal mode", עם ההערה "בקרוב".
• 1 באוגוסט 2026 — ראש צוות Harness פותח גיוס לבדיקות פנימיות המיועד למפתחי פרויקטי agent-harness בקוד פתוח. העיתונות הטכנולוגית הסינית מדווחת על 769 מועמדים, 712 מאגרים ייחודיים ולמעלה מ-1.2 מיליון כוכבי GitHub מצטברים.
• 11 באוגוסט 2026 — סיקור החשבון מתרחב; הלוויתן השחור עולה לפני השטח.
• 13 באוגוסט 2026 — v0.1 מושק: ברישיון MIT, פתוח ב-GitHub, ניתן להריץ עם npx @deepseek-ai/dsh web. השביל פוענח.

מה v0.1 שחררה בפועל
התצוגה המקדימה למפתחים היא רץ סוכן לשולחן העבודה ולממשק שורת הפקודה במרחב השמות של Node, הבנויה על מסגרת-העל Cordis עם עקרון העיצוב המוצהר "הכל הוא תוסף." מודלים, כלים, מיומנויות, הפעלות, ארגזי חול, אחסון, לולאת הסוכן, תזמון וממשק המשתמש — כולם תוספי Cordis הניתנים להחלפה. ארבע קביעות מוגדרות מראש כלולות: Standard (ערכת הכלים המלאה של סוכן קוד), PTC (המודל כותב תוכניות TypeScript כדי לתאם קריאות כלים מרובות-שלבים), Minimal (כלי מעטפת ועורך קבצים — המצב שבו רצו מבחני ה-V4), ו-Creation (לבניית קביעות מותאמות אישית). תצוגת Trajectory כותבת את כל מה שהמודל רואה לרישום הפעלה המוסף בלבד, הניתן להפעלה חוזרת מקור אחר מקור — מענה של DeepSeek לתלונת "הקופסה השחורה" על היסטוריית סוכן מסוכמת.
האזהרה החשובה היא של DeepSeek עצמו: זו תצוגה מקדימה למפתחים, המאגר נושא הודעה על בדיקות פנימיות, וצפויים שינויים שוברי תאימות בזמן שתוספי הליבה וממשקי ה-API הבסיסיים מתפתחים. אזהרה זו התגלתה כמוצדקת תוך שעות — והיא מסגרת את דיווחי השטח להלן.
מה שמראים דיווחי השטח הראשונים
הדו"ח שחיבר את העדכון הזה הוא חשבון של משתמש יחיד ויש לקרוא אותו ככזה: teortaxesTex, ב-14 באוגוסט, תיאר סשן של DeepSeek Harness שבו הזרמת הטוקנים האטה בהדרגה עד לזחילה, ממשק המשתמש הראה חמישה מתוך תשעה מטלות שהושלמו, ורענון גילה שלמעשה כל תשע הושלמו — הממשק הציג מצב מלפני כחמישים דקות. זה פוסט X אחד, לא אישור של ספק, וטרם שוחזר באופן בלתי תלוי. אבל מחלקת התסמינים מאומתת ברישום הציבורי של הפרויקט עצמו, וזה מה שהופך אותה לראויה להתייחסות רצינית.
הדיון #483 ב-GitHub של המאגר הרשמי, שהוגש ב-13 באוגוסט, מתעד בדיוק את משפחת התקלות הזו. תוכן השיחה נשמר באמצעות קבוצת כתיבה נדחית חסומה (bounded write-behind batch) — האירועים יושבים בתור ממתין בזיכרון עד שטיימר של 200 אלפיות שנייה מפעיל כתיבה עמידה — והממשק מציג רק את המצב המאושר (committed). תחת עומס מקבילי כבד, החלון נמתח מאוד; לאחר כיבוי לא נקי, הזנב שבזיכרון לעולם לא נשטף, ומסד הנתונים של JSONL או SQLite טוען מחדש רק את הקידומת המאושרת, כך שמידע שהזין המשתמש מופיע באיחור או בכלל לא, והיסטוריה שהייתה גלויה קודם נעלמת. הדיון מקשר זאת לשתי בעיות פתוחות: #477 (קלט טקסט של המשתמש מתעכב זמן רב תחת עומס מקבילי כבד) ו-#479 (בקשות חדשות ממשתמשים לא מופיעות בתצוגת השיחה כלל). הביטוי בדו"ח השטח — "5/9 על המסך, 9/9 בוצעו" — הוא אותו פער בין המצב המאושר למצב בפועל שמתבטא בסשן חי.
המשוב הרחב יותר על v0.1 מקוטב בצורה הולמת. חלק מהבודקים משבחים את ארכיטקטורת התוספים כ"מחשב שולחני בהרכבה עצמית עם יציאות אוניברסליות" בהשוואה למתחרים סגורים; אחרים מתעדים קצוות גסים — נתיב רב-מודאלי מקודד קשיח, ובאג מתועד במדיניות הסוכן שבו הרתמה מאלצת את המודל לחקור כל קוד יציאה שאינו אפס, בעוד שקוד היציאה 1 של grep עבור 'אין התאמה' הופך בדיקות שעוברות לכישלונות לכאורה, ומניע לולאת אימות-יתר שמחזקת את עצמה (61 בקשות לעומת 32, ו-0.17$ לעומת 0.05$, על אותה משימה בהשוואה המדווחת). ביקורות מהיום הראשון נקראות כמו תצוגת מקדימה למפתחים עם שאפתנות אמיתית ובעיות שכבת-מצב אמיתיות, לא כמו מתחרה מוגמר ל-Claude Code.
קומפוזביליות מרחבית-זמנית אינה רק שורת מחץ.
מאחורי בדיחת הסיום של דוח השטח עומד מאמר. DeepSeek Harness בנוי על Cordis, שעיצובו מגיע מ־"A Programming Paradigm for Spatiotemporal Composability" — מחקר פורמלי בן 88 עמודים, שחובר במשותף על ידי אוניברסיטת פקין ו־DeepSeek, כשהכותב הראשי הוא Yifan Shi (יוצר מסגרת הצ'אטבוט Koishi), יחד עם Wei Zhang וראש צוות Harness, Cui Tianyi. המאמר מפרק קומפוזיציה דינמית לשני צירים אורתוגונליים: קומפוזיציה זמנית (temporal composability), שבה הסרת רכיב מבטלת באופן נקי את תופעות הלוואי שלו כאילו מעולם לא היה קיים; וקומפוזיציה מרחבית (spatial composability), שבה רכיבים מצהירים על תלויות, והרצת־הזמן (runtime) מפעילה ומשביתה אותן באופן ריאקטיבי לפי הופעתן והיעלמותן של ספקיות.
הבדיחה עובדת משום שמצב רינדור של ממשק משתמש מלפני חמישים דקות הוא כשל הרכבה טמפורלית במובן המילולי ביותר: זמן הריצה המשיך להתבצע בעוד שהמצב הנראה לעין התחייב מאחוריו. פער ההתמדה שמתועד ב-Discussion #483 — אצוות כתיבה מושהית שעלולה לפגר הרבה אחרי לולאת הריצה — הוא בדיוק מסוג הדברים שהבטחות המאמר אמורות למנוע. האם שכבת המצב של הרתמה תכבד בסופו של דבר את ההבטחות הללו בפועל היא אחת השאלות הפתוחות באמת של המהדורה הזו, ודיווחי היום הראשון הם הראיה הראשונה לכאן או לכאן.
המודלים שמתחת
המעטפת היא המוצר; המודלים הם המנוע. שני המודלים ש-DeepSeek ככל הנראה תציב תחתיה כבר פעילים, ושניהם ניתנים לקריאה דרך OrcaRouter כבר היום:
• DeepSeek V4 Flash 0731 — המהדורה הרשמית המאומנת מחדש (re-post-trained) של ה-MoE היעיל של DeepSeek (284B סה"כ / 13B פעילים), עם קונטקסט של 1M טוקנים, פלט מקסימלי של 384K, מצב חשיבה מופעל כברירת מחדל, ושליטה שוטפת באופן טבעי ב-OpenAI Responses API — הניב שבו מדברים סוכנים בסגנון Codex. הנתונים שפרסמה DeepSeek עצמה במדדי ה-agent-benchmark עבור גרסת 0731: 82.7 ב-Terminal-Bench 2.1, 76.7 ב-Cybergym, 70.3 ב-Toolathlon Verified, 68.7 ב-DSBench-FullStack, 59.6 ב-DSBench-Hard. המספרים האלה מדווחים על ידי היצרן ולא שוחזרו, אבל הם מה ש-DeepSeek בחרה להוביל איתם, והם עולים אפילו על DeepSeek V4 Pro Preview באותה קבוצה.
• DeepSeek V4 Pro — דגם הדגל עם 1.6T בסך הכול / 49B פעילים (MoE), אותו הקשר של מיליון טוקנים, משקלים פתוחים (שוחרר באפריל 2026), במחיר של $0.44 / $0.87 למיליון טוקנים.
בנוגע למחיר, כל העניין הוא ש-DeepSeek זול. DeepSeek V4 Flash 0731 פועל בערך ב-$0.147 למיליון טוקני קלט וב-$0.295 למיליון טוקני פלט — מחירי מחירון ספק, שאותם OrcaRouter מעביר ללא תוספת מחיר. כשה-harness יבשיל, תוכל לכוון אותו לאותם מודלים שאתה כבר יכול לקרוא היום, והחלפת ה-harness פנימה או החוצה בהמשך היא שינוי תצורה, לא הגירה. אתה לא צריך את DeepSeek Harness כדי להריץ אף אחד מהמודלים עכשיו.

מלחמת המחירים שהיא נכנסת אליה
זה לא שוק שולי. Claude Code דווח כמי שנמצא בקצב הכנסות שנתי (ARR) העולה על 2.5 מיליארד דולר בתחילת 2026, ושוק הקידוד הסוכני (agentic-coding) מוערך במיליארדי דולרים בודדים. כניסה של שחקנית ממעבדה סינית שחותכת במחיר ה-API — והמודלים שלה כבר רצים בתוך Claude Code עצמו — היא מהלך מהסוג שמתמחר מחדש את כל הקטגוריה.
בנושא עלות, בחירת ה-harness חשובה לא פחות מהמודל. בדיקה אופקית של Composio שהריצה את DeepSeek V4 Flash על שמונה harnesses מצאה שהזול ביותר (ה-harness הפתוח "Pi") עולה בערך $0.028 של אינפרנס לכל משימה מוצלחת, לעומת כ-$0.195 עבור Claude Code באותה בדיקה — פער של כמעט פי 7 על אותו סוג של עבודה. הוסיפו את הנחת ה-prefix-cache המדווחת של DeepSeek ואת שיעורי ה-cache-hit של 99.93% ש-harnesses של צד שלישי מדווחים איתו, והעלות האפקטיבית למשימה עבור סוכן המופעל על ידי DeepSeek הופכת לקטנה מאוד במהירות רבה.
כדאי גם לזכור מה שכבר נכון היום: DeepSeek חושפת נקודת קצה תואמת Anthropic (כתובת בסיס https://api.deepseek.com/anthropic), והתיעוד שלה מדריך כיצד לכוון את Claude Code למודלים של DeepSeek V4. מוצר ה-harness הוא DeepSeek שמנסה להחזיק בשכבה הזו במקום לשכור אותה — ו-DeepSeek הודיעה כי מתוכננת עליית מחירים משמעותית בכל קו ה-V4. מכיוון ש-OrcaRouter מעבירה את מחירי המחירון של הספקים ללא מרווח, התעריף החדש פעיל אצלנו באותו היום שבו הוא יוצא, ללא משא ומתן מחדש.

מדוע הרתמה היא שדה הקרב החדש
המעבר הוא מיכולת מודל למסירת משימות. מודל מתקדם הוא כעת תנאי בסיס; מה שמכריע אם צוות אכן משחרר סוכן הוא התשתית שמסביב — והנתונים שהיא מייצרת. אנליסטים שמנתחים את המהלך של DeepSeek, בהם CITIC Securities, טוענים שרתמה בוגרת היא חפיר הגנה משתי סיבות מצטברות: היא סוגרת את הלולאה המסחרית מנקודת הכניסה ועד למשימה שהושלמה, ומייצרת נתוני מסלול משימה לטווח ארוך שמזינים את אימון המודל. רתמות קהילה כמו Pi או DeepSeek-TUI מוכיחות ביקוש, אבל הן לא מזינות את הנתונים האלה בחזרה למודל. הרתמה של DeepSeek עצמה הייתה עושה זאת — ותכונת ה-Trajectory שמגיעה ב-v0.1 היא נתיב הנתונים הזה שהופך לגלוי.
זו גם הסיבה לכך שקריאה של "רק לבנצ'מרק את המודל" אינה מספקת. ציוני האג'נט של DeepSeek V4 Flash חזקים, אבל הארנס הוא המקום שבו DeepSeek מצפה לבנות את היתרון המתמשך — מה שהופך את הבאגים בשכבת המצב בדיווחי היום הראשון ליותר מסתם קוסמטיים. ארנס שה-UI שלו יכול לפגר חמישים דקות אחרי הלולאה הוא עדיין תצוגה מקדימה למפתחים; הוא עדיין לא החפיר.
מה אנחנו צופים בו עכשיו
• האם שכבת המצב עומדת בקצב. פיגור הכתיבה הנדחית מתועד, ניתן לשחזור, ומוגש כבאג נגד ה-repo הרשמי; יש לעקוב אם נתיב ה-flush יתוקן במהירות, והאם העיצוב "הממשק מציג רק מצב שעבר commit" ישתנה כשסשן נמצא באמצע.
• מבחן השחזור המקומי. כל הסיבה שהמהדורה הייתה חשובה היא שציוני הסוכן V4 של DeepSeek נוצרו על "DeepSeek Harness minimal mode" — כעת כל אחד יכול להתקין את התצוגה המקדימה ולהריץ את המשימות הללו מקומית. אם המספרים 82.7 / 87.9 משוחזרים, שתי הגרסאות האחרונות נקראות כמערכת אחת קוהרנטית; אם לא, פער מדדי הספק הופך למדיד.
• האם המערכת האקולוגית של הפלאגינים תעמוד על רגליים. משטח הפלאגינים המתויגים ב-#dsh הוא אמיתי, אבל האם צדדים שלישיים יוציאו משהו ששווה להתקין - עדיין פתוח.
רשימת המחירים. DeepSeek לא אמרה דבר על כמה תעלה המסגרת עצמה, והעלאת המחירים המוכרזת של ה-API של V4 היא אי-הידוע הגדול השני.
• האם "קומפוזביליות מרחבית־זמנית" הופכת לרשימת תיקונים או לסיסמה. המאמר מעניק ל־DeepSeek אוצר מילים קפדני לכשל המדויק שדוח השטח חשף; השאלה אם שכבת המצב v0.1 מתכנסת להבטחות הללו היא המבחן.
הקריאה הכנה: האות החזק ביותר לפני ההפצה מ-DeepSeek הוא כעת מוצר אמיתי, אבל תצוגה מקדימה למפתחים עם קצוות גסים מתועדים. מה שיציב כיום הוא צמד המודלים שמתחתיו — DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro, שניהם פעילים ב-OrcaRouter במחיר המחירון של הספק ללא תוספת, ושניהם ניתנים לשימוש בלולאות סוכן דרך API סטנדרטי אחד. כשמסגרת הבדיקות תבשיל, הדרך להעריך אותה מבלי לסכן מסלול ייצור על v0.1 היא לנתב: להעמיד את מסגרת הבדיקות בחזית לצורך הערכה, לשמור על אותם מודלים מאחורי נקודת קצה אחת, ולבצע מעבר חירום לשילוב מוכח ברגע שהיא נתקעת. המעבר הזה הוא שינוי של שורה אחת.
השוואות במאמר הזה2
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
