
DeepSeek Harness: Чёрный кит всплывает — что нам известно о конкуренте Claude Code от DeepSeek
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Интеллект49Кодинг
DeepSeek Harness v0.1 вышел, и первый значимый полевой отчёт появился менее чем через день. 14 августа тот же аккаунт в X, который задал отсчёт времени релиза, — teortaxesTex — описал сеанс, который выглядел зависшим, хотя на самом деле завершался: поток токенов замедлялся «экспоненциально» до ползущего темпа, интерфейс показывал пять из девяти выполненных задач, а перезагрузка страницы показала, что все девять выполнены. Интерфейс показывал состояние примерно пятидесятиминутной давности. «Это… то, что вы имеете в виду под пространственно-временной композируемостью?» — справедливый укол, потому что фреймворк, на котором DeepSeek построил эту штуку, буквально содержит теорию времени. Этот пост начинался как статья о следах утечки; след замкнулся 13 августа, когда DeepSeek открыл исходный код harness. Ниже — что именно было выпущено и что первый день реального использования показывает о слое агентов, строящемся вокруг DeepSeek V4 Flash 0731 и DeepSeek V4 Pro.
Честная подача изменилась с момента первой публикации этого поста. Когда он был опубликован, ничего под названием «DeepSeek Harness» ещё не выпускалось, а доказательства представляли собой набор публичных улик — верифицированный аккаунт в WeChat, объявления о вакансиях, сноска в бенчмарке, звонок о внутреннем тестировании. Это больше не так. Вечером 13 августа по пекинскому времени DeepSeek опубликовала v0.1 харнесса как предварительную версию для разработчиков под лицензией MIT на github.com/deepseek-ai/deepseek-harness, запускаемую одной npm-командой, и за несколько часов репозиторий собрал более 30 000 звёзд на GitHub. Утечка стала продуктом. Сейчас непроверенным является не то, существует ли харнесс, а то, как он ведёт себя в реальных условиях, — и ранние полевые отчёты и есть новые доказательства.
Модель + Харнес = Агент: что такое «харнес» на самом деле
Формула, которую DeepSeek использует внутри, — это Модель + Обвязка = Агент. Модель — это мозг; обвязка — это всё остальное, что обеспечивает работу агента на практике: управление контекстом и памятью, вызов инструментов, планирование задач, чтение и запись файлов, выполнение команд в терминале, возврат вывода об ошибках обратно в цикл и оценка того, действительно ли задача завершена.
Термин был популяризирован компанией Anthropic и стал в отрасли общепринятым объяснением того, почему кодинг-агенты — это больше, чем просто хорошая LLM. Модель, которая хорошо показывает себя в бенчмарках, всё равно может провалить агентный цикл, если окружающая машинерия — как она вызывает инструменты, как она помнит, что делала десять минут назад, как она восстанавливается после сбоя команды — слаба. DeepSeek превратил эту машинерию в свою явную продуктовую стратегию, и команда Harness — это оргструктура, которая этим занимается. Базовые модели уже поставлялись: DeepSeek V4 Flash 0731 и DeepSeek V4 Pro обе несут агентно-заточенные показатели бенчмарков, которые DeepSeek получил внутри собственного харнеса, вплоть до названия «DeepSeek Harness minimal mode».
След утечки, который закончился 13 августа.
Это никогда не было единичной утечкой; это была груда публичных улик, которые копились с марта, а затем вылились в дату релиза. Если примерно по порядку:
• Март 2026 — Согласно сообщениям, Цуй Тяньи (崔添翼), выпускник Чжэцзянского университета по специальности «компьютерные науки» и бывший инженер Jane Street с девятилетним стажем, связан с работой DeepSeek над агентами; позже пресса называет его руководителем команды Harness. Сообщалось, но не было подтверждено DeepSeek на тот момент.
• 24 апреля 2026 года — DeepSeek V4 представлен в предварительной версии, явно ориентированной на задачи агентов и настроенной на агентские инструменты, такие как Claude Code.
• Май 2026 года — DeepSeek размещает на Moka две вакансии Harness — продакт-менеджера Agent Harness и инженера-исследователя, обе на базе в Пекине. Исследователь DeepSeek Чэнь Дэли публично пишет, что цель, вкратце, — провести бенчмаркинг Claude Code и создать «DeepSeek Code Harness».
• Июнь 2026 — Набор персонала продолжается; руководитель команды описывает отдел как недоукомплектованный, с «амбициозными целями и высокой нагрузкой».
• 6–7 июля 2026 года — аккаунт WeChat «DeepSeek Harness team» зарегистрирован и сертифицирован в пекинском юридическом лице DeepSeek, с логотипом в виде чёрного кита. Пока что никто за пределами компании этого не замечает.
• 31 июля 2026 года — официальный API DeepSeek V4 Flash выходит в публичную бета-версию, и документация API DeepSeek раскрывает — впервые — что задачи CodeAgent в его публичных бенчмарках выполнялись в «DeepSeek Harness minimal mode» с пометкой «скоро».
• 1 августа 2026 года — руководитель команды Harness объявляет набор на внутреннее тестирование для разработчиков open-source проектов agent-harness. Китайские технологические СМИ сообщают о 769 заявках, 712 уникальных репозиториях и более чем 1,2 миллиона совокупных звёзд на GitHub.
• 11 августа 2026 года — Освещение аккаунта получает широкое распространение; всплывает чёрный кит.
• 13 августа 2026 — выходит v0.1: лицензия MIT, открытый код на GitHub, запуск через npx @deepseek-ai/dsh web. След распутан.

Что на самом деле вошло в v0.1
Предварительная версия для разработчиков — это агентная среда выполнения для рабочего стола и CLI в пространстве пакетов Node, построенная на мета-фреймворке Cordis с заявленным принципом проектирования «всё является плагином». Модели, инструменты, навыки, сессии, песочницы, хранилище, цикл агента, планировщик и UI — всё это заменяемые плагины Cordis. Поставляются четыре пресета: Standard (полный набор инструментов агента-кодера), PTC (модель пишет программы на TypeScript для координации многошаговых вызовов инструментов), Minimal (инструмент оболочки плюс редактор файлов — режим, в котором запускались бенчмарки V4) и Creation (для создания пользовательских пресетов). Представление Trajectory записывает всё, что видит модель, в журнал сессии с добавлением только в конец, воспроизводимый источник за источником, — ответ DeepSeek на жалобу о «чёрном ящике» в отношении сокращённой истории агента.
Важная оговорка принадлежит самому DeepSeek: это предварительная версия для разработчиков, в репозитории указано, что это внутреннее тестирование, и ожидаются критические изменения, пока развиваются основные плагины и базовые API. Это предупреждение оправдалось в течение нескольких часов — и оно задаёт контекст для приведённых ниже полевых отчётов.
Что показывают первые полевые отчеты
Отчёт, на основе которого собрано это обновление, — это рассказ одного пользователя, и к нему следует относиться именно так: teortaxesTex 14 августа описал сеанс DeepSeek Harness, в котором потоковая генерация токенов постепенно замедлялась до черепашьей скорости, интерфейс показывал пять из девяти выполненных задач, а после перезагрузки выяснилось, что все девять фактически завершились — интерфейс отображал состояние примерно пятидесятиминутной давности. Это один пост в X, а не признание со стороны вендора, и он ещё не был воспроизведён независимо. Но класс симптомов подтверждается публичной историей самого проекта, и именно поэтому к нему стоит отнестись серьёзно.
В официальном репозитории обсуждение GitHub #483, созданное 13 августа, документирует именно этот класс сбоев. Содержимое сеансов сохраняется с помощью ограниченной отложенной пакетной записи — события находятся в очереди ожидания в памяти, пока таймер на 200 миллисекунд не запустит устойчивую запись — а интерфейс отображает только зафиксированное состояние. При высокой конкурентной нагрузке это окно сильно растягивается; после некорректного завершения работы хвост данных в памяти так и не сбрасывается, и бэкенд JSONL или SQLite перезагружает только зафиксированный префикс, поэтому пользовательский ввод появляется с опозданием или не появляется вообще, а ранее видимая история исчезает. Обсуждение связывает это с двумя открытыми проблемами: #477 (пользовательский текстовый ввод надолго задерживается при высокой конкурентной нагрузке) и #479 (новые пользовательские запросы вообще не появляются в представлении беседы). Фраза «5/9 on screen, 9/9 done» из полевого отчёта — это как раз тот разрыв между зафиксированным и фактическим состоянием, который проявляется в реальной сессии.
Более широкие отзывы о v0.1 поляризованы, и это закономерно. Одни тестировщики хвалят плагинную архитектуру как «самосборный настольный ПК с универсальными портами» в сравнении с закрытыми конкурентами; другие перечисляют шероховатости — жестко заданный мультимодальный путь и задокументированный баг в политике агента, где каркас заставляет модель исследовать каждый ненулевой код возврата, а код возврата grep 1 для «нет совпадений» превращает проходящие тесты в видимые сбои, порождая самоподкрепляющийся цикл избыточной валидации (61 запрос против 32 и $0,17 против $0,05 на одной и той же задаче в приведенном сравнении). Отзывы первого дня читаются как предварительная версия для разработчиков с реальными амбициями и реальными проблемами слоя состояния, а не как готовый соперник Claude Code.
Пространственно-временная композиционность — это не просто шутка.
За заключительной шуткой полевого отчёта стоит научная статья. DeepSeek Harness построен на Cordis, чей дизайн восходит к «A Programming Paradigm for Spatiotemporal Composability» — формальному исследованию объёмом 88 страниц, написанному в соавторстве с Пекинским университетом и DeepSeek. Первый автор — Ифань Ши (создатель чат-бот-фреймворка Koishi), соавторы — Вэй Чжан и руководитель команды Harness Цуй Тяньи. В статье динамическая композиция разбивается на две ортогональные оси: темпоральную композируемость, когда удаление компонента полностью отменяет его побочные эффекты, как будто его никогда не было, и пространственную композируемость, когда компоненты объявляют зависимости, а среда выполнения реактивно активирует и деактивирует их по мере появления и исчезновения провайдеров.
Шутка попадает в цель, потому что состояние рендеринга интерфейса, созданное пятьдесят минут назад, — это сбой темпоральной композиции в самом буквальном смысле: среда выполнения продолжала работать, пока видимое состояние фиксировалось позади неё. Разрыв сохраняемости, описанный в обсуждении #483 — пакет отложенной записи, который может сильно отставать от выполняющегося цикла, — это как раз то, что гарантии из статьи должны предотвращать. Выполнит ли слой состояния испытательной среды эти гарантии на практике, — один из по-настоящему открытых вопросов этого релиза, и отчёты первого дня — первое свидетельство в ту или иную сторону.
Модели, лежащие в основе
Обвязка — это продукт; модели — это двигатель. Обе модели, которые DeepSeek, предположительно, поместит под неё, уже работают, и обе доступны для вызова через OrcaRouter сегодня:
• DeepSeek V4 Flash 0731 — официальный релиз DeepSeek после повторного пост-обучения, эффективная MoE-модель (284B всего / 13B активных) с контекстом на 1M токенов, максимумом в 384K токенов на выходе, включённым по умолчанию режимом мышления и нативной поддержкой OpenAI Responses API — того самого диалекта, на котором говорят агенты в стиле Codex. Опубликованные самим DeepSeek показатели агентных бенчмарков для ревизии 0731: 82,7 на Terminal-Bench 2.1, 76,7 на Cybergym, 70,3 на Toolathlon Verified, 68,7 на DSBench-FullStack, 59,6 на DSBench-Hard. Эти цифры предоставлены вендором и независимо не воспроизведены, но именно их DeepSeek решил вынести на первый план, и они превосходят по баллам даже DeepSeek V4 Pro Preview на том же наборе.
• DeepSeek V4 Pro — флагманская MoE с 1,6 трлн параметров / 49 млрд активных, тот же контекст на 1 млн токенов, открытые веса (релиз в апреле 2026 года), цена $0,44 / $0,87 за миллион токенов.
Что касается цены, весь смысл в том, что DeepSeek дёшев. DeepSeek V4 Flash 0731 стоит примерно $0.147 за миллион входных токенов и $0.295 за миллион выходных токенов — цены по прайс-листу вендора, которые OrcaRouter передаёт без наценки. Когда харнес созреет, вы сможете направить его на те же модели, которые уже можете вызывать сегодня, а замена харнеса позже — это изменение конфигурации, а не миграция. Вам не нужен DeepSeek Harness для запуска любой из этих моделей сейчас.

Ценовая война, в которую оно ввязывается
Это не второстепенный рынок. По сообщениям, в начале 2026 года годовой темп выручки Claude Code превысил $2,5 млрд, а объем рынка агентного кодинга оценивается в однозначные миллиарды долларов. Выход китайской лаборатории, которая демпингует по цене API — и чьи модели уже работают внутри самого Claude Code, — это шаг, который переоценивает всю категорию.
Что касается затрат, выбор харнеса важен не меньше, чем выбор модели. В горизонтальном тесте Composio, прогонявшем DeepSeek V4 Flash на восьми харнесах, самый дешёвый вариант (открытый харнес "Pi") обошёлся примерно в $0,028 инференса за успешную задачу, тогда как Claude Code в том же тесте — около $0,195, то есть разрыв почти в 7 раз на одном и том же классе работ. Добавьте сюда заявленную скидку DeepSeek на префиксный кэш и 99,93% попаданий в кэш, о которых сообщают сторонние харнесы при работе с ним, — и эффективная стоимость задачи для агента на базе DeepSeek становится очень маленькой очень быстро.
Стоит также помнить, что уже сегодня DeepSeek предоставляет эндпоинт, совместимый с Anthropic (базовый URL https://api.deepseek.com/anthropic), и в его документации есть пошаговое руководство по подключению Claude Code к моделям DeepSeek V4. Harness-продукт — это попытка DeepSeek владеть этим уровнем, а не арендовать его. И DeepSeek объявил, что по всей линейке V4 грядёт существенное повышение цен. Поскольку OrcaRouter передаёт цены провайдера без наценки, новый тариф появляется на нашей стороне в тот же день, когда он вводится, без повторных переговоров.

Почему упряжь — это новое поле битвы
Происходит сдвиг от возможностей модели к выполнению задач. Передовая модель теперь — это лишь входной билет; что действительно определяет, выпустит ли команда агента, — это окружающая инфраструктура и данные, которые она производит. Аналитики, оценивающие шаг DeepSeek, в их числе CITIC Securities, утверждают, что зрелая обвязка является конкурентным рвом по двум взаимосвязанным причинам: она замыкает коммерческий цикл от точки входа до выполненной задачи и генерирует данные о траекториях долгосрочных задач, которые питают обучение модели. Общественные обвязки вроде Pi или DeepSeek-TUI подтверждают спрос, но не возвращают эти данные в модель. Собственная обвязка DeepSeek возвращала бы их — и функция Trajectory, поставляемая в v0.1, делает этот путь данных видимым.
Это также причина, по которой прочтение «просто пробенчмаркать модель» неполно. Результаты агента DeepSeek V4 Flash высоки, но именно на харнессе DeepSeek рассчитывает построить устойчивое преимущество — что делает ошибки в слое состояния в отчётах первого дня более чем косметическими. Харнесс, чей интерфейс может отставать от цикла на пятьдесят минут, — это всё ещё предварительная версия для разработчиков; это ещё не защитный ров.
Что мы сейчас смотрим
• Успевает ли слой состояния. Задержка отложенной записи документирована, воспроизводима, и по ней подаётся issue в официальный репозиторий; следите, насколько быстро исправят путь сброса и изменится ли принцип «UI показывает только зафиксированное состояние», когда сеанс находится в процессе выполнения.
Нативный тест воспроизведения. Весь смысл релиза в том, что результаты агента V4 от DeepSeek были получены в «DeepSeek Harness minimal mode» — теперь любой может установить предварительную версию и запустить эти задачи нативно. Если показатели 82.7 / 87.9 воспроизводятся, последние два релиза выглядят как одна связная система; если нет — разрыв между вендорскими и фактическими показателями становится измеримым.
• Получит ли экосистема плагинов развитие. Поверхность плагинов с тегом #dsh реальна, но остаётся открытым вопрос, выпустят ли третьи стороны что-то действительно стоящее для установки.
• Прейскурант. DeepSeek ничего не сказал о том, сколько будет стоить сама обвязка, а объявленное повышение цен на API V4 — ещё одна большая неизвестность.
• Станет ли «пространственно-временная композиционность» списком исправлений или лозунгом. Статья даёт DeepSeek строгий словарь для описания именно того сбоя, который выявил полевой отчёт; станет ли слой состояния v0.1 сходиться к этим гарантиям — вот проверка.
The honest read: the strongest pre-release signal DeepSeek has given is now a real product, but a developer preview with documented rough edges. What's solid today is the pair of models under it — DeepSeek V4 Flash 0731 and DeepSeek V4 Pro, both live on OrcaRouter at provider list price with zero markup, both usable in agent loops through one standard API. When the harness matures, the way to evaluate it without betting a production path on a v0.1 is to route: put the harness in front for evaluation, keep the same models behind one endpoint, and fail over to a proven combination the moment it stalls. That switch is a one-line change.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
