Karta tytułowa dla 'DeepSeek Harness: Czarny wieloryb wynurza się': nagłówek 'DeepSeek Harness', podtytuł 'Czarny wieloryb wynurza się — Co wiemy do tej pory o konkurencie Claude Code od DeepSeek', slogan 'Model + Harness = Agent', chipy dla 'DeepSeek V4 Flash' i 'DeepSeek V4 Pro', oraz stopka 'Przeciek / co-wiemy-do-tej-pory — nic jeszcze nie zostało wydane'. Logo OrcaRouter wkomponowane w prawym dolnym rogu.
Guides & Insights

DeepSeek Harness: Czarny Wieloryb wynurza się — Co wiemy do tej pory o konkurencie DeepSeek dla Claude Code

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

D​eepSeek Harness v0.1 właśnie się ukazał, a pierwszy ważny raport z praktyki pojawił się niecałą dobę później. 14 sierpnia to samo konto X, które ustawiło zegar premiery — teortaxesTex — opisało sesję, która wyglądała na martwą, choć w rzeczywistości wciąż trwała: strumieniowanie tokenów spowolniło „wykładniczo” do pełzania, interfejs pokazywał pięć z dziewięciu wykonanych zadań, a odświeżenie strony ujawniło, że wszystkie dziewięć zostało ukończonych. UI pokazywało stan sprzed mniej więcej pięćdziesięciu minut. „Czy o to chodzi, gdy mówicie o kompozycyjności czasoprzestrzennej?” — celna przytyka, bo framework, na którym D​eepSeek to zbudował, dosłownie zawiera teorię czasu. Ten post zaczynał się jako tekst o śladach przecieków; trop rozwikłał się 13 sierpnia, gdy D​eepSeek udostępnił harness jako open source. Poniżej opisuję to, co faktycznie trafiło do wydania, oraz to, co pierwszy dzień rzeczywistego użytkowania mówi o warstwie agentowej budowanej wokół DeepSeek V4 Flash 0731 i DeepSeek V4 Pro.

Uczciwe przedstawienie sprawy zmieniło się od czasu pierwszej publikacji tego wpisu. Gdy się ukazał, nic, co nazywałoby się „D​eepSeek Harness”, nie trafiło jeszcze do odbiorców, a dowody stanowił zbiór publicznych poszlak — certyfikowane konto WeChat, ogłoszenia o pracę, przypis w benchmarku, wewnętrzna rozmowa o testach. To już nieprawda. Wieczorem 13 sierpnia czasu pekińskiego D​eepSeek opublikował v0.1 tego harnessu jako wersję deweloperską na licencji MIT pod adresem github.com/deepseek-ai/deepseek-harness, uruchamianą jednym poleceniem npm, a repozytorium w ciągu kilku godzin zdobyło ponad 30 000 gwiazdek na GitHubie. Wyciek stał się produktem. To, co pozostaje niezweryfikowane, to nie to, czy harness istnieje, lecz jak zachowuje się w praktyce — a wczesne raporty terenowe są nowymi dowodami.

Model + Harness = Agent: czym naprawdę jest „harness”

Wzór, którego D​eepSeek używa wewnętrznie, to Model + Harness = Agent. Model to mózg; harness to wszystko inne, co sprawia, że agent działa w praktyce — zarządzanie kontekstem i pamięcią, wywoływanie narzędzi, planowanie zadań, czytanie i zapisywanie plików, wykonywanie poleceń terminala, wprowadzanie komunikatów o błędach z powrotem do pętli oraz ocenianie, czy zadanie rzeczywiście zostało ukończone.

Termin został spopularyzowany przez A​nthropic i stał się branżowym ujęciem tego, dlaczego agenty kodujące to coś więcej niż dobry LLM. Model, który osiąga dobre wyniki w benchmarkach, wciąż może zawieść w pętli agentowej, jeśli otaczająca go machineria — jak wywołuje narzędzia, jak pamięta, co robił dziesięć minut temu, jak odzyskuje sprawność po nieudanym poleceniu — jest słaba. D​eepSeek uczynił tę machinerię swoją wyraźną strategią produktową, a zespół Harness jest strukturą organizacyjną, która to realizuje. Modele leżące u podstaw były już wydawane: DeepSeek V4 Flash 0731 i DeepSeek V4 Pro mają wyniki benchmarków dostrojone pod agentów, które D​eepSeek wygenerował we własnym harnessie, aż po nazwę „D​eepSeek Harness minimal mode”.

Trop przecieku, który zakończył się 13 sierpnia

To nigdy nie był pojedynczy przeciek; to był stos publicznych okruszków, które narastały od marca, by ostatecznie sprowadzić się do daty premiery. W przybliżonej kolejności:

• Marzec 2026 — Według doniesień Cui Tianyi (崔添翼), absolwent informatyki na Uniwersytecie Zhejiang i były inżynier Jane Street z dziewięcioletnim stażem, jest łączony z pracami nad agentami D​eepSeek; później prasa identyfikuje go jako lidera zespołu Harness. Doniesienia nie zostały wówczas potwierdzone przez D​eepSeek.

• 24 kwietnia 2026 — Wersje zapoznawcze DeepSeek V4, wyraźnie pozycjonowane pod zadania agentowe i dostrojone pod narzędzia agentowe takie jak Claude Code.

• Maj 2026 — D​eepSeek publikuje na Moka dwie role Harness — product managera Agent Harness i inżyniera badawczego, obie w Pekinie. Badacz D​eepSeek, Chen Deli, pisze publicznie, że celem jest, w skrócie, porównanie z Claude Code i zbudowanie „D​eepSeek Code Harness.”

• Czerwiec 2026 — Rekrutacja trwa nadal; kierownik zespołu opisuje dział jako niedostatecznie obsadzony, z "ambitnymi celami i dużym obciążeniem pracą."

• 6–7 lipca 2026 r. — Konto WeChat „D​eepSeek Harness team" zostaje zarejestrowane i certyfikowane przez pekiński podmiot D​eepSeek, z logo czarnego wieloryba. Nikt z zewnątrz jeszcze tego nie zauważa.

• 31 lipca 2026 r. — oficjalne API D​eepSeek V4 Flash wchodzi w publiczną betę, a dokumentacja API D​eepSeek po raz pierwszy ujawnia, że zadania CodeAgent w publicznych benchmarkach tej firmy były uruchamiane w „trybie minimalnym D​eepSeek Harness” z dopiskiem „wkrótce”.

• 1 sierpnia 2026 — Lider zespołu Harness otwiera rekrutację do testów wewnętrznych skierowaną do twórców otwartoźródłowych projektów agent-harness. Chińska prasa technologiczna donosi o 769 kandydatach, 712 unikalnych repozytoriach i ponad 1,2 miliona łącznych gwiazdek na GitHubie.

• 11 sierpnia 2026 r. — Sprawa konta nabiera rozgłosu; czarny wieloryb wypływa.

• 13 sierpnia 2026 — v0.1 debiutuje: na licencji MIT, open source na GitHubie, uruchamiane przez npx @deepseek-ai/dsh web. Trop rozwikłany.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

Co tak naprawdę trafiło do v0.1

Podgląd dla programistów to środowisko uruchomieniowe agenta dla komputera stacjonarnego i CLI w przestrzeni nazw pakietów Node, zbudowane na meta-strukturze Cordis z zadeklarowaną zasadą projektową „wszystko jest wtyczką”. Modele, narzędzia, umiejętności, sesje, piaskownice, pamięć masowa, pętla agenta, harmonogramowanie i interfejs użytkownika — wszystko to jest wymiennymi wtyczkami Cordis. Dostępne są cztery presety: Standard (pełny zestaw narzędzi agenta kodującego), PTC (model pisze programy w TypeScript, aby koordynować wieloetapowe wywołania narzędzi), Minimal (narzędzie powłoki plus edytor plików — tryb, w którym działały benchmarki V4) oraz Creation (do budowania niestandardowych presetów). Widok Trajectory zapisuje wszystko, co widzi model, w dzienniku sesji z możliwością jedynie dopisywania, który można odtwarzać źródło po źródle — to odpowiedź firmy D​eepSeek na zarzut „czarnej skrzynki” dotyczący streszczonej historii agenta.

Kluczowe zastrzeżenie pochodzi od samego D​eepSeeka: to wersja developerska, repozytorium zawiera notę o testach wewnętrznych, a zmian łamiących kompatybilność należy się spodziewać, gdy ewoluują podstawowe wtyczki i bazowe API. To ostrzeżenie okazało się słuszne już po kilku godzinach — i stanowi ramę dla poniższych raportów z pola.

Co pokazują pierwsze raporty terenowe

Raport, który posłużył do przygotowania tej aktualizacji, to relacja jednego użytkownika i należy ją tak właśnie odczytywać: teortaxesTex 14 sierpnia opisał sesję D​eepSeek Harness, podczas której strumieniowanie tokenów stopniowo zwalniało niemal do zera, interfejs pokazywał pięć z dziewięciu zadań jako ukończone, a po odświeżeniu okazało się, że wszystkie dziewięć faktycznie zostało ukończonych — interfejs renderował stan sprzed około pięćdziesięciu minut. To jeden post na X — nie potwierdzenie ze strony dostawcy — i nie został jeszcze niezależnie zreprodukowany. Ta klasa objawów znajduje jednak potwierdzenie w publicznych danych samego projektu, co sprawia, że warto ją potraktować poważnie.

Dyskusja GitHub #483 w oficjalnym repozytorium, otwarta 13 sierpnia, dokumentuje dokładnie tę rodzinę awarii. Zawartość sesji jest utrwalana za pomocą ograniczonej partii zapisu opóźnionego — zdarzenia czekają w kolejce oczekujących w pamięci, dopóki licznik 200 milisekund nie wyzwoli trwałego zapisu — a interfejs renderuje wyłącznie stan zatwierdzony. Przy dużym obciążeniu współbieżnym to okno znacznie się wydłuża; po nieczystym zamknięciu końcówka w pamięci nigdy nie jest opróżniana, a backend JSONL lub SQLite wczytuje ponownie tylko zatwierdzony prefiks, więc dane wprowadzone przez użytkownika pojawiają się późno lub wcale, a wcześniej widoczna historia znika. Dyskusja wiąże to z dwoma otwartymi zgłoszeniami: #477 (wprowadzanie tekstu przez użytkownika opóźnione przez długi czas przy dużym obciążeniu współbieżnym) i #479 (nowe żądania użytkownika w ogóle nie pojawiają się w widoku rozmowy). Raport terenowy „5/9 na ekranie, 9/9 zrobione" to właśnie ta luka między stanem zatwierdzonym a rzeczywistym ujawniająca się w sesji na żywo.

Szersze opinie o wersji v0.1 są spolaryzowane w sposób, który pasuje do sytuacji. Niektórzy testerzy chwalą architekturę wtyczek jako „samodzielnie złożony pecet z uniwersalnymi portami” na tle zamkniętych rywali; inni wyliczają niedoróbki — zaszyty na sztywno szlak multimodalny oraz udokumentowany błąd polityki agenta, w którym harness zmusza model do analizowania każdego niezerowego kodu wyjścia, a kod wyjścia 1 dla grepa oznaczający „brak dopasowania” zamienia przechodzące testy w pozorne porażki, co napędza samowzmacniającą się pętlę nadmiernej walidacji (61 żądań wobec 32 i 0,17 dolara wobec 0,05 dolara przy tym samym zadaniu w cytowanym porównaniu). Recenzje z pierwszego dnia przypominają podgląd deweloperski z realnymi ambicjami i realnymi problemami warstwy stanu, a nie gotowego rywala dla Claude Code.

"Kompozycyjność czasoprzestrzenna" to nie tylko puenta.

Za końcowym żartem raportu terenowego stoi praca naukowa. DeepSeek Harness jest zbudowane na Cordis, którego projekt wywodzi się z "A Programming Paradigm for Spatiotemporal Composability" — 88-stronicowego formalnego opracowania napisanego wspólnie przez Uniwersytet Pekiński i DeepSeek, którego pierwszym autorem jest Yifan Shi (twórca frameworku chatbotowego Koishi) wraz z Wei Zhang i liderem zespołu Harness, Cui Tianyi. Artykuł rozkłada dynamiczną kompozycję na dwie ortogonalne osie: kompozycję temporalną, w której usunięcie komponentu czysto cofa jego efekty uboczne, jakby nigdy nie istniał, oraz kompozycję przestrzenną, w której komponenty deklarują zależności, a środowisko uruchomieniowe reaktywnie je aktywuje i dezaktywuje w miarę pojawiania się i znikania dostawców.

Żart trafia w sedno, ponieważ stan renderowania UI sprzed pięćdziesięciu minut to błąd kompozycji czasowej w najbardziej dosłownym sensie: środowisko wykonawcze kontynuowało działanie, podczas gdy widoczny stan był zatwierdzany z opóźnieniem względem niego. Luka w trwałości udokumentowana w Discussion #483 — wsadowy zapis z opóźnieniem (write-behind), który może pozostawać daleko w tyle za pętlą wykonawczą — jest dokładnie tym, czemu mają zapobiegać gwarancje opisane w artykule. To, czy warstwa stanu harnessa ostatecznie respektuje te gwarancje w praktyce, jest jednym z prawdziwie otwartych pytań tego wydania, a raporty z pierwszego dnia są pierwszym dowodem na którąkolwiek z możliwości.

Modele leżące u podstaw

Uprząż to produkt; modele to silnik. Oba modele, które D​eepSeek prawdopodobnie pod nią umieści, są już aktywne i oba można dziś wywoływać przez OrcaRouter:

• DeepSeek V4 Flash 0731 — ponownie dotrenowana oficjalna wersja wydajnego modelu MoE DeepSeek (284B łącznie / 13B aktywnych), z kontekstem 1M tokenów, maksymalnym wyjściem 384K, domyślnie włączonym trybem myślenia i natywnie płynną obsługą OpenAI Responses API — dialektu, którym posługują się agenci w stylu Codex. Opublikowane przez DeepSeek własne wyniki testów agentowych dla rewizji 0731: 82.7 w Terminal-Bench 2.1, 76.7 w Cybergym, 70.3 w Toolathlon Verified, 68.7 w DSBench-FullStack, 59.6 w DSBench-Hard. Są to dane podawane przez producenta i niepotwierdzone niezależnie, ale to właśnie nimi DeepSeek postanowił się wyróżnić — i wypadają one lepiej nawet od DeepSeek V4 Pro Preview na tym samym zestawie.

• DeepSeek V4 Pro — flagowy model MoE o łącznej wielkości 1,6T / 49B aktywnych parametrów, ten sam kontekst 1M tokenów, otwarte wagi (wydany w kwietniu 2026), wyceniony na 0,44 USD / 0,87 USD za milion tokenów.

Jeśli chodzi o cenę, cały sens polega na tym, że D​eepSeek jest tani. DeepSeek V4 Flash 0731 kosztuje mniej więcej 0,147 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych — ceny listowe producenta, które OrcaRouter przekazuje z zerową marżą. Gdy harness dojrzeje, będziesz mógł wskazać mu te same modele, które już dziś możesz wywoływać, a późniejsza podmiana harnessu to zmiana konfiguracji, a nie migracja. Nie potrzebujesz D​eepSeek Harness, aby teraz uruchomić którykolwiek z tych modeli.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

Wojna kosztów, w którą wchodzi.

To nie jest marginalny rynek. Claude Code podobno osiągnął roczny wskaźnik przychodów (run rate) przekraczający 2,5 miliarda dolarów na początku 2026 roku, a rynek kodowania agentowego szacowany jest na kilka miliardów dolarów. Chińskie laboratorium, które konkuruje niższymi cenami API — i którego modele już działają wewnątrz samego Claude Code — to ruch, który przecenia całą kategorię.

Jeśli chodzi o koszt, wybór platformy jest równie ważny jak wybór modelu. Poziomy test przeprowadzony przez Composio, uruchamiający DeepSeek V4 Flash na ośmiu platformach, wykazał, że najtańsza z nich (platforma open-source "Pi") kosztuje około 0,028 USD za inferencję na jedno pomyślnie wykonane zadanie, podczas gdy Claude Code w tym samym teście osiągnął około 0,195 USD — czyli niemal 7-krotną różnicę w przypadku tej samej klasy zadań. Dodając do tego zgłaszaną przez D​eepSeek zniżkę na pamięć podręczną prefiksów oraz osiągane z nim przez platformy innych producentów wskaźniki trafień w pamięci podręcznej na poziomie 99,93%, efektywny koszt pojedynczego zadania dla agenta opartego na D​eepSeek staje się bardzo szybko bardzo niski.

Warto też pamiętać, co już dziś jest faktem: D​eepSeek udostępnia endpoint kompatybilny z A​nthropic (adres bazowy: https://api.deepseek.com/anthropic), a jego własna dokumentacja opisuje, jak skierować Claude Code na modele D​eepSeek V4. Produkt harness to próba D​eepSeek, by przejąć tę warstwę na własność zamiast ją wynajmować — a D​eepSeek zapowiedział znaczącą podwyżkę cen w całej linii V4. Ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez żadnej marży, nowa stawka jest aktywna po naszej stronie tego samego dnia, w którym wejdzie w życie, bez renegocjacji.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Dlaczego uprząż to nowe pole bitwy

Przesunięcie akcentu z możliwości modelu na dostarczanie zadań. Model klasy frontier to dziś stawka wejścia; o tym, czy zespół faktycznie wypuści agenta, decyduje otaczająca go infrastruktura — oraz dane, które ona wytwarza. Analitycy, w tym CITIC Securities, interpretujący ruch D​eepSeek, twierdzą, że dojrzała platforma wykonawcza (harness) stanowi rów obronny z dwóch kumulujących się powodów: zamyka komercyjną pętlę od punktu wejścia do ukończonego zadania, a także generuje dane o długoterminowych trajektoriach zadań, które zasilają trening modeli. Platformy tworzone przez społeczność, takie jak Pi czy D​eepSeek-TUI, dowodzą popytu, ale nie przekazują tych danych z powrotem do modelu. Własna platforma D​eepSeek już by to robiła — a funkcja Trajectory, dostępna w wersji v0.1, to ten przepływ danych uwidoczniony.

To także dlatego interpretacja „wystarczy zrobić benchmark modelu" jest niepełna. Wyniki DeepSeek V4 Flash w zadaniach agentowych są mocne, ale to właśnie w harnessie DeepSeek liczy na zbudowanie trwałej przewagi — co sprawia, że błędy warstwy stanu w raportach z pierwszego dnia to coś więcej niż kosmetyka. Harness, którego interfejs potrafi opóźnić się o pięćdziesiąt minut względem pętli, to wciąż developer preview; to jeszcze nie fosa obronna.

Co teraz oglądamy

• Czy warstwa stanu dotrzymuje kroku. Opóźnienie zapisu write-behind jest udokumentowane, odtwarzalne i zgłaszane do oficjalnego repozytorium; obserwuj, czy ścieżka opróżniania bufora (flush) zostanie szybko naprawiona, oraz czy projekt, w którym „UI pokazuje tylko stan zatwierdzony”, zmieni się, gdy sesja jest w toku.

• Test natywnej reprodukcji. Cały powód, dla którego to wydanie miało znaczenie, jest taki, że wyniki agenta V4 D​eepSeek zostały wygenerowane w trybie „D​eepSeek Harness minimal mode” — teraz każdy może zainstalować wersję zapoznawczą i uruchomić te zadania natywnie. Jeśli wartości 82.7 / 87.9 się odtworzą, ostatnie dwa wydania stanowią jeden spójny system; jeśli nie, luka między benchmarkiem dostawcy a rzeczywistością staje się mierzalna.

• Czy ekosystem wtyczek stanie na nogi. Powierzchnia wtyczek oznaczonych #dsh jest realna, ale to, czy strony trzecie dostarczą cokolwiek wartego zainstalowania, pozostaje otwarte.

• Lista cen. D​eepSeek nie powiedział nic o tym, ile będzie kosztować sam harness, a ogłoszona podwyżka cen API V4 to kolejna wielka niewiadoma.

• Czy „kompozycyjność czasoprzestrzenna" stanie się listą poprawek, czy też sloganem. Artykuł daje D​eepSeekowi rygorystyczny słownik dla dokładnie tego błędu, który ujawnił raport terenowy; testem jest to, czy warstwa stanu v0.1 zbiega się do tych gwarancji.

Szczera ocena: najsilniejszy przedpremierowy sygnał, jaki dał DeepSeek, stał się teraz prawdziwym produktem, ale w wersji developerskiej z udokumentowanymi niedoskonałościami. To, co dziś jest solidne, to para modeli leżących u jego podstaw — DeepSeek V4 Flash 0731 i DeepSeek V4 Pro, oba dostępne na OrcaRouter w cenie katalogowej dostawcy, z zerową marżą, oba nadające się do pętli agenta przez jedno standardowe API. Gdy środowisko ewaluacyjne dojrzeje, sposobem na jego ocenę bez stawiania ścieżki produkcyjnej na wersji v0.1 jest routing: postaw środowisko z przodu do ewaluacji, trzymaj te same modele za jednym endpointem i przełącz się na sprawdzoną kombinację w momencie, gdy zacznie się zacinać. Ta zmiana to modyfikacja w jednej linijce.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie