כרטיס כותרת עבור 'DeepSeek Harness: The Black Whale Surfaces': כותרת ראשית 'DeepSeek Harness', כותרת משנה 'The Black Whale Surfaces — What We Know So Far About DeepSeek's Claude Code Competitor', תגית 'Model + Harness = Agent', תוויות עבור 'DeepSeek V4 Flash' ו-'DeepSeek V4 Pro', וכותרת תחתונה 'Leak / what-we-know-so-far — nothing has shipped yet'. לוגו OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

DeepSeek Harness: הלוויתן השחור צץ — מה ידוע עד כה על המתחרה של DeepSeek ל-Claude Code

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

D​eepSeek Harness v0.1 יצא לאור, ודוח השטח הראשון שחשוב הגיע פחות מיום לאחר מכן. ב-14 באוגוסט, אותו חשבון X שקבע את שעון השחרור — teortaxesTex — תיאר סשן שנראה מת בעוד שבפועל היה מסתיים: הזרמת הטוקנים האטה "בקצב אקספוננציאלי" עד לזחילה, הממשק הראה חמישה מתוך תשעה משימות שהושלמו, ורענון עמוד גילה שכל התשעה הושלמו. הממשק הראה מצב מלפני כחמישים דקות. "האם זו... כוונתכם ב'קומפוזיציוליות מרחבית-זמנית'?" — עקיצה הוגנת, כי התשתית שעליה D​eepSeek בנה את הדבר הזה מחזיקה ממש בתיאוריה על הזמן. הפוסט הזה התחיל ככתבה על עקבות הדלפה; העקבה נפתרה ב-13 באוגוסט, כאשר D​eepSeek פרסמה את ה-harness כקוד פתוח. בהמשך מובא מה שנשלח בפועל, ומה היום הראשון של שימוש אמיתי מלמד על שכבת הסוכן שנבנית סביב DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro.

המסגור הכנה השתנה מאז שהפוסט הזה פורסם לראשונה. בזמן הפרסום, שום דבר בשם "D​eepSeek Harness" לא שוחרר, והראיות היו ערימה של פירורי לחם ציבוריים — חשבון WeChat מאומת, מודעות דרושים, הערת שוליים במדד ביצועים (benchmark), ושיחת בדיקה פנימית. זה כבר לא נכון. בערב ה-13 באוגוסט, לפי שעון בייג'ינג, D​eepSeek פרסמה גרסת v0.1 של ה-harness כתצוגת מפתחים ברישיון MIT ב-github.com/deepseek-ai/deepseek-harness, הניתנת להרצה בפקודת npm אחת, והמאגר משך יותר מ-30,000 כוכבי GitHub תוך שעות. ההדלפה הפכה למוצר. מה שאינו מאומת כעת אינו האם ה-harness קיים, אלא כיצד הוא מתנהג בשטח — ודוחות השטח המוקדמים הם הראיות החדשות.

מודל + רתמה = סוכן: מה זה בעצם "רתמה"

הנוסחה ש-DeepSeek משתמשת בה פנימית היא מודל + רתמה = סוכן. המודל הוא המוח; הרתמה היא כל השאר שגורם לסוכן לעבוד בפועל — ניהול קונטקסט וזיכרון, קריאה לכלים, תכנון משימות, קריאה וכתיבת קבצים, הרצת פקודות בטרמינל, הזנת פלט שגיאות בחזרה ללולאה, ושיפוט האם משימה אכן הושלמה.

המונח זכה לפופולריות על ידי A​nthropic והפך למסגרת התעשייתית להבנת מדוע סוכני קוד הם יותר מאשר LLM טוב. מודל שמשיג ציונים גבוהים במדדים עדיין יכול להיכשל בלולאת סוכן אם התשתית שמסביב — איך הוא מזמן כלים, איך הוא זוכר מה עשה לפני עשר דקות, איך הוא מתאושש כשפקודה נכשלת — חלשה. D​eepSeek הפך את התשתית הזו לאסטרטגיית המוצר המפורשת שלו, וצוות Harness הוא הגורם הארגוני שמבצע זאת. המודלים שמתחת כבר שוחררו: DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro, ושניהם נושאים ציוני מדד מכווננים לסוכנים ש-D​eepSeek הפיק בתוך ה-harness שלו, אפילו עד לשם "D​eepSeek Harness minimal mode."

שובל הדליפות שהסתיים ב-13 באוגוסט

זו מעולם לא הייתה הדלפה אחת; זה היה ערימה של פירורי לחם ציבוריים שהצטברו מאז מרץ ולבסוף התגבשו לתאריך שחרור. בסדר משוער:

• מרץ 2026 — דיווחים מקשרים את Cui Tianyi (崔添翼), בוגר מדעי המחשב מאוניברסיטת ג'ג'יאנג ומהנדס לשעבר במשך תשע שנים ב-Jane Street, לעבודת ה-Agent של D​eepSeek; העיתונות מזהה אותו מאוחר יותר כראש צוות Harness. דווח, אך לא אושר על ידי D​eepSeek באותה העת.

• 24 באפריל 2026 — D​eepSeek V4 חושפת תצוגה מקדימה, ממוקמת במפורש למשימות סוכן ומותאמת לכלי סוכן כמו Claude Code.

• מאי 2026 — D​eepSeek מפרסמת שתי משרות Harness ב-Moka — מנהל מוצר של Agent Harness ומהנדס מחקר, שניהם מבוססי בייג'ינג. חוקר D​eepSeek, Chen Deli, כותב בפומבי שהמטרה, בקיצור, היא לבצע בנצ'מרק ל-Claude Code ולבנות "D​eepSeek Code Harness."

• יוני 2026 — מאמצי הגיוס נמשכים; ראש הצוות מתאר את המחלקה כחסרת כוח אדם, עם "יעדים שאפתניים ועומס עבודה כבד."

• 6–7 ביולי 2026 — חשבון ה-WeChat של "צוות D​eepSeek Harness" נרשם ואושר תחת הישות הבייג'ינגית של D​eepSeek, עם לוגו של לוויתן שחור. איש מבחוץ עדיין לא שם לב.

• 31 ביולי 2026 — ה-API הרשמי של DeepSeek V4 Flash נכנס לבטא ציבורית, והתיעוד של ה-API של DeepSeek חושף — לראשונה — שמשימות CodeAgent במדדים הציבוריים שלו הורצו על "DeepSeek Harness minimal mode", עם ההערה "בקרוב".

• 1 באוגוסט 2026 — ראש צוות Harness פותח גיוס לבדיקות פנימיות המיועד למפתחי פרויקטי agent-harness בקוד פתוח. העיתונות הטכנולוגית הסינית מדווחת על 769 מועמדים, 712 מאגרים ייחודיים ולמעלה מ-1.2 מיליון כוכבי GitHub מצטברים.

• 11 באוגוסט 2026 — סיקור החשבון מתרחב; הלוויתן השחור עולה לפני השטח.

• 13 באוגוסט 2026 — v0.1 מושק: ברישיון MIT, פתוח ב-GitHub, ניתן להריץ עם npx @deepseek-ai/dsh web. השביל פוענח.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

מה v0.1 שחררה בפועל

התצוגה המקדימה למפתחים היא רץ סוכן לשולחן העבודה ולממשק שורת הפקודה במרחב השמות של Node, הבנויה על מסגרת-העל Cordis עם עקרון העיצוב המוצהר "הכל הוא תוסף." מודלים, כלים, מיומנויות, הפעלות, ארגזי חול, אחסון, לולאת הסוכן, תזמון וממשק המשתמש — כולם תוספי Cordis הניתנים להחלפה. ארבע קביעות מוגדרות מראש כלולות: Standard (ערכת הכלים המלאה של סוכן קוד), PTC (המודל כותב תוכניות TypeScript כדי לתאם קריאות כלים מרובות-שלבים), Minimal (כלי מעטפת ועורך קבצים — המצב שבו רצו מבחני ה-V4), ו-Creation (לבניית קביעות מותאמות אישית). תצוגת Trajectory כותבת את כל מה שהמודל רואה לרישום הפעלה המוסף בלבד, הניתן להפעלה חוזרת מקור אחר מקור — מענה של D​eepSeek לתלונת "הקופסה השחורה" על היסטוריית סוכן מסוכמת.

האזהרה החשובה היא של D​eepSeek עצמו: זו תצוגה מקדימה למפתחים, המאגר נושא הודעה על בדיקות פנימיות, וצפויים שינויים שוברי תאימות בזמן שתוספי הליבה וממשקי ה-API הבסיסיים מתפתחים. אזהרה זו התגלתה כמוצדקת תוך שעות — והיא מסגרת את דיווחי השטח להלן.

מה שמראים דיווחי השטח הראשונים

הדו"ח שחיבר את העדכון הזה הוא חשבון של משתמש יחיד ויש לקרוא אותו ככזה: teortaxesTex, ב-14 באוגוסט, תיאר סשן של D​eepSeek Harness שבו הזרמת הטוקנים האטה בהדרגה עד לזחילה, ממשק המשתמש הראה חמישה מתוך תשעה מטלות שהושלמו, ורענון גילה שלמעשה כל תשע הושלמו — הממשק הציג מצב מלפני כחמישים דקות. זה פוסט X אחד, לא אישור של ספק, וטרם שוחזר באופן בלתי תלוי. אבל מחלקת התסמינים מאומתת ברישום הציבורי של הפרויקט עצמו, וזה מה שהופך אותה לראויה להתייחסות רצינית.

הדיון #483 ב-GitHub של המאגר הרשמי, שהוגש ב-13 באוגוסט, מתעד בדיוק את משפחת התקלות הזו. תוכן השיחה נשמר באמצעות קבוצת כתיבה נדחית חסומה (bounded write-behind batch) — האירועים יושבים בתור ממתין בזיכרון עד שטיימר של 200 אלפיות שנייה מפעיל כתיבה עמידה — והממשק מציג רק את המצב המאושר (committed). תחת עומס מקבילי כבד, החלון נמתח מאוד; לאחר כיבוי לא נקי, הזנב שבזיכרון לעולם לא נשטף, ומסד הנתונים של JSONL או SQLite טוען מחדש רק את הקידומת המאושרת, כך שמידע שהזין המשתמש מופיע באיחור או בכלל לא, והיסטוריה שהייתה גלויה קודם נעלמת. הדיון מקשר זאת לשתי בעיות פתוחות: #477 (קלט טקסט של המשתמש מתעכב זמן רב תחת עומס מקבילי כבד) ו-#479 (בקשות חדשות ממשתמשים לא מופיעות בתצוגת השיחה כלל). הביטוי בדו"ח השטח — "5/9 על המסך, 9/9 בוצעו" — הוא אותו פער בין המצב המאושר למצב בפועל שמתבטא בסשן חי.

המשוב הרחב יותר על v0.1 מקוטב בצורה הולמת. חלק מהבודקים משבחים את ארכיטקטורת התוספים כ"מחשב שולחני בהרכבה עצמית עם יציאות אוניברסליות" בהשוואה למתחרים סגורים; אחרים מתעדים קצוות גסים — נתיב רב-מודאלי מקודד קשיח, ובאג מתועד במדיניות הסוכן שבו הרתמה מאלצת את המודל לחקור כל קוד יציאה שאינו אפס, בעוד שקוד היציאה 1 של grep עבור 'אין התאמה' הופך בדיקות שעוברות לכישלונות לכאורה, ומניע לולאת אימות-יתר שמחזקת את עצמה (61 בקשות לעומת 32, ו-0.17$ לעומת 0.05$, על אותה משימה בהשוואה המדווחת). ביקורות מהיום הראשון נקראות כמו תצוגת מקדימה למפתחים עם שאפתנות אמיתית ובעיות שכבת-מצב אמיתיות, לא כמו מתחרה מוגמר ל-Claude Code.

קומפוזביליות מרחבית-זמנית אינה רק שורת מחץ.

מאחורי בדיחת הסיום של דוח השטח עומד מאמר. D​eepSeek Harness בנוי על Cordis, שעיצובו מגיע מ־"A Programming Paradigm for Spatiotemporal Composability" — מחקר פורמלי בן 88 עמודים, שחובר במשותף על ידי אוניברסיטת פקין ו־D​eepSeek, כשהכותב הראשי הוא Yifan Shi (יוצר מסגרת הצ'אטבוט Koishi), יחד עם Wei Zhang וראש צוות Harness, Cui Tianyi. המאמר מפרק קומפוזיציה דינמית לשני צירים אורתוגונליים: קומפוזיציה זמנית (temporal composability), שבה הסרת רכיב מבטלת באופן נקי את תופעות הלוואי שלו כאילו מעולם לא היה קיים; וקומפוזיציה מרחבית (spatial composability), שבה רכיבים מצהירים על תלויות, והרצת־הזמן (runtime) מפעילה ומשביתה אותן באופן ריאקטיבי לפי הופעתן והיעלמותן של ספקיות.

הבדיחה עובדת משום שמצב רינדור של ממשק משתמש מלפני חמישים דקות הוא כשל הרכבה טמפורלית במובן המילולי ביותר: זמן הריצה המשיך להתבצע בעוד שהמצב הנראה לעין התחייב מאחוריו. פער ההתמדה שמתועד ב-Discussion #483 — אצוות כתיבה מושהית שעלולה לפגר הרבה אחרי לולאת הריצה — הוא בדיוק מסוג הדברים שהבטחות המאמר אמורות למנוע. האם שכבת המצב של הרתמה תכבד בסופו של דבר את ההבטחות הללו בפועל היא אחת השאלות הפתוחות באמת של המהדורה הזו, ודיווחי היום הראשון הם הראיה הראשונה לכאן או לכאן.

המודלים שמתחת

המעטפת היא המוצר; המודלים הם המנוע. שני המודלים ש-D​eepSeek ככל הנראה תציב תחתיה כבר פעילים, ושניהם ניתנים לקריאה דרך OrcaRouter כבר היום:

• DeepSeek V4 Flash 0731 — המהדורה הרשמית המאומנת מחדש (re-post-trained) של ה-MoE היעיל של D​eepSeek (284B סה"כ / 13B פעילים), עם קונטקסט של 1M טוקנים, פלט מקסימלי של 384K, מצב חשיבה מופעל כברירת מחדל, ושליטה שוטפת באופן טבעי ב-O​penAI Responses API — הניב שבו מדברים סוכנים בסגנון Codex. הנתונים שפרסמה D​eepSeek עצמה במדדי ה-agent-benchmark עבור גרסת 0731: 82.7 ב-Terminal-Bench 2.1, 76.7 ב-Cybergym, 70.3 ב-Toolathlon Verified, 68.7 ב-DSBench-FullStack, 59.6 ב-DSBench-Hard. המספרים האלה מדווחים על ידי היצרן ולא שוחזרו, אבל הם מה ש-D​eepSeek בחרה להוביל איתם, והם עולים אפילו על DeepSeek V4 Pro Preview באותה קבוצה.

• DeepSeek V4 Pro — דגם הדגל עם 1.6T בסך הכול / 49B פעילים (MoE), אותו הקשר של מיליון טוקנים, משקלים פתוחים (שוחרר באפריל 2026), במחיר של $0.44 / $0.87 למיליון טוקנים.

בנוגע למחיר, כל העניין הוא ש-D​eepSeek זול. DeepSeek V4 Flash 0731 פועל בערך ב-$0.147 למיליון טוקני קלט וב-$0.295 למיליון טוקני פלט — מחירי מחירון ספק, שאותם OrcaRouter מעביר ללא תוספת מחיר. כשה-harness יבשיל, תוכל לכוון אותו לאותם מודלים שאתה כבר יכול לקרוא היום, והחלפת ה-harness פנימה או החוצה בהמשך היא שינוי תצורה, לא הגירה. אתה לא צריך את D​eepSeek Harness כדי להריץ אף אחד מהמודלים עכשיו.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

מלחמת המחירים שהיא נכנסת אליה

זה לא שוק שולי. Claude Code דווח כמי שנמצא בקצב הכנסות שנתי (ARR) העולה על 2.5 מיליארד דולר בתחילת 2026, ושוק הקידוד הסוכני (agentic-coding) מוערך במיליארדי דולרים בודדים. כניסה של שחקנית ממעבדה סינית שחותכת במחיר ה-API — והמודלים שלה כבר רצים בתוך Claude Code עצמו — היא מהלך מהסוג שמתמחר מחדש את כל הקטגוריה.

בנושא עלות, בחירת ה-harness חשובה לא פחות מהמודל. בדיקה אופקית של Composio שהריצה את DeepSeek V4 Flash על שמונה harnesses מצאה שהזול ביותר (ה-harness הפתוח "Pi") עולה בערך $0.028 של אינפרנס לכל משימה מוצלחת, לעומת כ-$0.195 עבור Claude Code באותה בדיקה — פער של כמעט פי 7 על אותו סוג של עבודה. הוסיפו את הנחת ה-prefix-cache המדווחת של D​eepSeek ואת שיעורי ה-cache-hit של 99.93% ש-harnesses של צד שלישי מדווחים איתו, והעלות האפקטיבית למשימה עבור סוכן המופעל על ידי D​eepSeek הופכת לקטנה מאוד במהירות רבה.

כדאי גם לזכור מה שכבר נכון היום: D​eepSeek חושפת נקודת קצה תואמת A​nthropic (כתובת בסיס https://api.deepseek.com/anthropic), והתיעוד שלה מדריך כיצד לכוון את Claude Code למודלים של D​eepSeek V4. מוצר ה-harness הוא D​eepSeek שמנסה להחזיק בשכבה הזו במקום לשכור אותה — ו-D​eepSeek הודיעה כי מתוכננת עליית מחירים משמעותית בכל קו ה-V4. מכיוון ש-OrcaRouter מעבירה את מחירי המחירון של הספקים ללא מרווח, התעריף החדש פעיל אצלנו באותו היום שבו הוא יוצא, ללא משא ומתן מחדש.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

מדוע הרתמה היא שדה הקרב החדש

המעבר הוא מיכולת מודל למסירת משימות. מודל מתקדם הוא כעת תנאי בסיס; מה שמכריע אם צוות אכן משחרר סוכן הוא התשתית שמסביב — והנתונים שהיא מייצרת. אנליסטים שמנתחים את המהלך של D​eepSeek, בהם CITIC Securities, טוענים שרתמה בוגרת היא חפיר הגנה משתי סיבות מצטברות: היא סוגרת את הלולאה המסחרית מנקודת הכניסה ועד למשימה שהושלמה, ומייצרת נתוני מסלול משימה לטווח ארוך שמזינים את אימון המודל. רתמות קהילה כמו Pi או D​eepSeek-TUI מוכיחות ביקוש, אבל הן לא מזינות את הנתונים האלה בחזרה למודל. הרתמה של D​eepSeek עצמה הייתה עושה זאת — ותכונת ה-Trajectory שמגיעה ב-v0.1 היא נתיב הנתונים הזה שהופך לגלוי.

זו גם הסיבה לכך שקריאה של "רק לבנצ'מרק את המודל" אינה מספקת. ציוני האג'נט של DeepSeek V4 Flash חזקים, אבל הארנס הוא המקום שבו D​eepSeek מצפה לבנות את היתרון המתמשך — מה שהופך את הבאגים בשכבת המצב בדיווחי היום הראשון ליותר מסתם קוסמטיים. ארנס שה-UI שלו יכול לפגר חמישים דקות אחרי הלולאה הוא עדיין תצוגה מקדימה למפתחים; הוא עדיין לא החפיר.

מה אנחנו צופים בו עכשיו

• האם שכבת המצב עומדת בקצב. פיגור הכתיבה הנדחית מתועד, ניתן לשחזור, ומוגש כבאג נגד ה-repo הרשמי; יש לעקוב אם נתיב ה-flush יתוקן במהירות, והאם העיצוב "הממשק מציג רק מצב שעבר commit" ישתנה כשסשן נמצא באמצע.

• מבחן השחזור המקומי. כל הסיבה שהמהדורה הייתה חשובה היא שציוני הסוכן V4 של D​eepSeek נוצרו על "D​eepSeek Harness minimal mode" — כעת כל אחד יכול להתקין את התצוגה המקדימה ולהריץ את המשימות הללו מקומית. אם המספרים 82.7 / 87.9 משוחזרים, שתי הגרסאות האחרונות נקראות כמערכת אחת קוהרנטית; אם לא, פער מדדי הספק הופך למדיד.

• האם המערכת האקולוגית של הפלאגינים תעמוד על רגליים. משטח הפלאגינים המתויגים ב-#dsh הוא אמיתי, אבל האם צדדים שלישיים יוציאו משהו ששווה להתקין - עדיין פתוח.

רשימת המחירים. DeepSeek לא אמרה דבר על כמה תעלה המסגרת עצמה, והעלאת המחירים המוכרזת של ה-API של V4 היא אי-הידוע הגדול השני.

• האם "קומפוזביליות מרחבית־זמנית" הופכת לרשימת תיקונים או לסיסמה. המאמר מעניק ל־D​eepSeek אוצר מילים קפדני לכשל המדויק שדוח השטח חשף; השאלה אם שכבת המצב v0.1 מתכנסת להבטחות הללו היא המבחן.

הקריאה הכנה: האות החזק ביותר לפני ההפצה מ-DeepSeek הוא כעת מוצר אמיתי, אבל תצוגה מקדימה למפתחים עם קצוות גסים מתועדים. מה שיציב כיום הוא צמד המודלים שמתחתיו — DeepSeek V4 Flash 0731 ו-DeepSeek V4 Pro, שניהם פעילים ב-OrcaRouter במחיר המחירון של הספק ללא תוספת, ושניהם ניתנים לשימוש בלולאות סוכן דרך API סטנדרטי אחד. כשמסגרת הבדיקות תבשיל, הדרך להעריך אותה מבלי לסכן מסלול ייצור על v0.1 היא לנתב: להעמיד את מסגרת הבדיקות בחזית לצורך הערכה, לשמור על אותם מודלים מאחורי נקודת קצה אחת, ולבצע מעבר חירום לשילוב מוכח ברגע שהיא נתקעת. המעבר הזה הוא שינוי של שורה אחת.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית