
DeepSeek Harness: Czarny Wieloryb wynurza się — Co wiemy do tej pory o konkurencie DeepSeek dla Claude Code
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencja49Kod
DeepSeek Harness v0.1 właśnie się ukazał, a pierwszy ważny raport z praktyki pojawił się niecałą dobę później. 14 sierpnia to samo konto X, które ustawiło zegar premiery — teortaxesTex — opisało sesję, która wyglądała na martwą, choć w rzeczywistości wciąż trwała: strumieniowanie tokenów spowolniło „wykładniczo” do pełzania, interfejs pokazywał pięć z dziewięciu wykonanych zadań, a odświeżenie strony ujawniło, że wszystkie dziewięć zostało ukończonych. UI pokazywało stan sprzed mniej więcej pięćdziesięciu minut. „Czy o to chodzi, gdy mówicie o kompozycyjności czasoprzestrzennej?” — celna przytyka, bo framework, na którym DeepSeek to zbudował, dosłownie zawiera teorię czasu. Ten post zaczynał się jako tekst o śladach przecieków; trop rozwikłał się 13 sierpnia, gdy DeepSeek udostępnił harness jako open source. Poniżej opisuję to, co faktycznie trafiło do wydania, oraz to, co pierwszy dzień rzeczywistego użytkowania mówi o warstwie agentowej budowanej wokół DeepSeek V4 Flash 0731 i DeepSeek V4 Pro.
Uczciwe przedstawienie sprawy zmieniło się od czasu pierwszej publikacji tego wpisu. Gdy się ukazał, nic, co nazywałoby się „DeepSeek Harness”, nie trafiło jeszcze do odbiorców, a dowody stanowił zbiór publicznych poszlak — certyfikowane konto WeChat, ogłoszenia o pracę, przypis w benchmarku, wewnętrzna rozmowa o testach. To już nieprawda. Wieczorem 13 sierpnia czasu pekińskiego DeepSeek opublikował v0.1 tego harnessu jako wersję deweloperską na licencji MIT pod adresem github.com/deepseek-ai/deepseek-harness, uruchamianą jednym poleceniem npm, a repozytorium w ciągu kilku godzin zdobyło ponad 30 000 gwiazdek na GitHubie. Wyciek stał się produktem. To, co pozostaje niezweryfikowane, to nie to, czy harness istnieje, lecz jak zachowuje się w praktyce — a wczesne raporty terenowe są nowymi dowodami.
Model + Harness = Agent: czym naprawdę jest „harness”
Wzór, którego DeepSeek używa wewnętrznie, to Model + Harness = Agent. Model to mózg; harness to wszystko inne, co sprawia, że agent działa w praktyce — zarządzanie kontekstem i pamięcią, wywoływanie narzędzi, planowanie zadań, czytanie i zapisywanie plików, wykonywanie poleceń terminala, wprowadzanie komunikatów o błędach z powrotem do pętli oraz ocenianie, czy zadanie rzeczywiście zostało ukończone.
Termin został spopularyzowany przez Anthropic i stał się branżowym ujęciem tego, dlaczego agenty kodujące to coś więcej niż dobry LLM. Model, który osiąga dobre wyniki w benchmarkach, wciąż może zawieść w pętli agentowej, jeśli otaczająca go machineria — jak wywołuje narzędzia, jak pamięta, co robił dziesięć minut temu, jak odzyskuje sprawność po nieudanym poleceniu — jest słaba. DeepSeek uczynił tę machinerię swoją wyraźną strategią produktową, a zespół Harness jest strukturą organizacyjną, która to realizuje. Modele leżące u podstaw były już wydawane: DeepSeek V4 Flash 0731 i DeepSeek V4 Pro mają wyniki benchmarków dostrojone pod agentów, które DeepSeek wygenerował we własnym harnessie, aż po nazwę „DeepSeek Harness minimal mode”.
Trop przecieku, który zakończył się 13 sierpnia
To nigdy nie był pojedynczy przeciek; to był stos publicznych okruszków, które narastały od marca, by ostatecznie sprowadzić się do daty premiery. W przybliżonej kolejności:
• Marzec 2026 — Według doniesień Cui Tianyi (崔添翼), absolwent informatyki na Uniwersytecie Zhejiang i były inżynier Jane Street z dziewięcioletnim stażem, jest łączony z pracami nad agentami DeepSeek; później prasa identyfikuje go jako lidera zespołu Harness. Doniesienia nie zostały wówczas potwierdzone przez DeepSeek.
• 24 kwietnia 2026 — Wersje zapoznawcze DeepSeek V4, wyraźnie pozycjonowane pod zadania agentowe i dostrojone pod narzędzia agentowe takie jak Claude Code.
• Maj 2026 — DeepSeek publikuje na Moka dwie role Harness — product managera Agent Harness i inżyniera badawczego, obie w Pekinie. Badacz DeepSeek, Chen Deli, pisze publicznie, że celem jest, w skrócie, porównanie z Claude Code i zbudowanie „DeepSeek Code Harness.”
• Czerwiec 2026 — Rekrutacja trwa nadal; kierownik zespołu opisuje dział jako niedostatecznie obsadzony, z "ambitnymi celami i dużym obciążeniem pracą."
• 6–7 lipca 2026 r. — Konto WeChat „DeepSeek Harness team" zostaje zarejestrowane i certyfikowane przez pekiński podmiot DeepSeek, z logo czarnego wieloryba. Nikt z zewnątrz jeszcze tego nie zauważa.
• 31 lipca 2026 r. — oficjalne API DeepSeek V4 Flash wchodzi w publiczną betę, a dokumentacja API DeepSeek po raz pierwszy ujawnia, że zadania CodeAgent w publicznych benchmarkach tej firmy były uruchamiane w „trybie minimalnym DeepSeek Harness” z dopiskiem „wkrótce”.
• 1 sierpnia 2026 — Lider zespołu Harness otwiera rekrutację do testów wewnętrznych skierowaną do twórców otwartoźródłowych projektów agent-harness. Chińska prasa technologiczna donosi o 769 kandydatach, 712 unikalnych repozytoriach i ponad 1,2 miliona łącznych gwiazdek na GitHubie.
• 11 sierpnia 2026 r. — Sprawa konta nabiera rozgłosu; czarny wieloryb wypływa.
• 13 sierpnia 2026 — v0.1 debiutuje: na licencji MIT, open source na GitHubie, uruchamiane przez npx @deepseek-ai/dsh web. Trop rozwikłany.

Co tak naprawdę trafiło do v0.1
Podgląd dla programistów to środowisko uruchomieniowe agenta dla komputera stacjonarnego i CLI w przestrzeni nazw pakietów Node, zbudowane na meta-strukturze Cordis z zadeklarowaną zasadą projektową „wszystko jest wtyczką”. Modele, narzędzia, umiejętności, sesje, piaskownice, pamięć masowa, pętla agenta, harmonogramowanie i interfejs użytkownika — wszystko to jest wymiennymi wtyczkami Cordis. Dostępne są cztery presety: Standard (pełny zestaw narzędzi agenta kodującego), PTC (model pisze programy w TypeScript, aby koordynować wieloetapowe wywołania narzędzi), Minimal (narzędzie powłoki plus edytor plików — tryb, w którym działały benchmarki V4) oraz Creation (do budowania niestandardowych presetów). Widok Trajectory zapisuje wszystko, co widzi model, w dzienniku sesji z możliwością jedynie dopisywania, który można odtwarzać źródło po źródle — to odpowiedź firmy DeepSeek na zarzut „czarnej skrzynki” dotyczący streszczonej historii agenta.
Kluczowe zastrzeżenie pochodzi od samego DeepSeeka: to wersja developerska, repozytorium zawiera notę o testach wewnętrznych, a zmian łamiących kompatybilność należy się spodziewać, gdy ewoluują podstawowe wtyczki i bazowe API. To ostrzeżenie okazało się słuszne już po kilku godzinach — i stanowi ramę dla poniższych raportów z pola.
Co pokazują pierwsze raporty terenowe
Raport, który posłużył do przygotowania tej aktualizacji, to relacja jednego użytkownika i należy ją tak właśnie odczytywać: teortaxesTex 14 sierpnia opisał sesję DeepSeek Harness, podczas której strumieniowanie tokenów stopniowo zwalniało niemal do zera, interfejs pokazywał pięć z dziewięciu zadań jako ukończone, a po odświeżeniu okazało się, że wszystkie dziewięć faktycznie zostało ukończonych — interfejs renderował stan sprzed około pięćdziesięciu minut. To jeden post na X — nie potwierdzenie ze strony dostawcy — i nie został jeszcze niezależnie zreprodukowany. Ta klasa objawów znajduje jednak potwierdzenie w publicznych danych samego projektu, co sprawia, że warto ją potraktować poważnie.
Dyskusja GitHub #483 w oficjalnym repozytorium, otwarta 13 sierpnia, dokumentuje dokładnie tę rodzinę awarii. Zawartość sesji jest utrwalana za pomocą ograniczonej partii zapisu opóźnionego — zdarzenia czekają w kolejce oczekujących w pamięci, dopóki licznik 200 milisekund nie wyzwoli trwałego zapisu — a interfejs renderuje wyłącznie stan zatwierdzony. Przy dużym obciążeniu współbieżnym to okno znacznie się wydłuża; po nieczystym zamknięciu końcówka w pamięci nigdy nie jest opróżniana, a backend JSONL lub SQLite wczytuje ponownie tylko zatwierdzony prefiks, więc dane wprowadzone przez użytkownika pojawiają się późno lub wcale, a wcześniej widoczna historia znika. Dyskusja wiąże to z dwoma otwartymi zgłoszeniami: #477 (wprowadzanie tekstu przez użytkownika opóźnione przez długi czas przy dużym obciążeniu współbieżnym) i #479 (nowe żądania użytkownika w ogóle nie pojawiają się w widoku rozmowy). Raport terenowy „5/9 na ekranie, 9/9 zrobione" to właśnie ta luka między stanem zatwierdzonym a rzeczywistym ujawniająca się w sesji na żywo.
Szersze opinie o wersji v0.1 są spolaryzowane w sposób, który pasuje do sytuacji. Niektórzy testerzy chwalą architekturę wtyczek jako „samodzielnie złożony pecet z uniwersalnymi portami” na tle zamkniętych rywali; inni wyliczają niedoróbki — zaszyty na sztywno szlak multimodalny oraz udokumentowany błąd polityki agenta, w którym harness zmusza model do analizowania każdego niezerowego kodu wyjścia, a kod wyjścia 1 dla grepa oznaczający „brak dopasowania” zamienia przechodzące testy w pozorne porażki, co napędza samowzmacniającą się pętlę nadmiernej walidacji (61 żądań wobec 32 i 0,17 dolara wobec 0,05 dolara przy tym samym zadaniu w cytowanym porównaniu). Recenzje z pierwszego dnia przypominają podgląd deweloperski z realnymi ambicjami i realnymi problemami warstwy stanu, a nie gotowego rywala dla Claude Code.
"Kompozycyjność czasoprzestrzenna" to nie tylko puenta.
Za końcowym żartem raportu terenowego stoi praca naukowa. DeepSeek Harness jest zbudowane na Cordis, którego projekt wywodzi się z "A Programming Paradigm for Spatiotemporal Composability" — 88-stronicowego formalnego opracowania napisanego wspólnie przez Uniwersytet Pekiński i DeepSeek, którego pierwszym autorem jest Yifan Shi (twórca frameworku chatbotowego Koishi) wraz z Wei Zhang i liderem zespołu Harness, Cui Tianyi. Artykuł rozkłada dynamiczną kompozycję na dwie ortogonalne osie: kompozycję temporalną, w której usunięcie komponentu czysto cofa jego efekty uboczne, jakby nigdy nie istniał, oraz kompozycję przestrzenną, w której komponenty deklarują zależności, a środowisko uruchomieniowe reaktywnie je aktywuje i dezaktywuje w miarę pojawiania się i znikania dostawców.
Żart trafia w sedno, ponieważ stan renderowania UI sprzed pięćdziesięciu minut to błąd kompozycji czasowej w najbardziej dosłownym sensie: środowisko wykonawcze kontynuowało działanie, podczas gdy widoczny stan był zatwierdzany z opóźnieniem względem niego. Luka w trwałości udokumentowana w Discussion #483 — wsadowy zapis z opóźnieniem (write-behind), który może pozostawać daleko w tyle za pętlą wykonawczą — jest dokładnie tym, czemu mają zapobiegać gwarancje opisane w artykule. To, czy warstwa stanu harnessa ostatecznie respektuje te gwarancje w praktyce, jest jednym z prawdziwie otwartych pytań tego wydania, a raporty z pierwszego dnia są pierwszym dowodem na którąkolwiek z możliwości.
Modele leżące u podstaw
Uprząż to produkt; modele to silnik. Oba modele, które DeepSeek prawdopodobnie pod nią umieści, są już aktywne i oba można dziś wywoływać przez OrcaRouter:
• DeepSeek V4 Flash 0731 — ponownie dotrenowana oficjalna wersja wydajnego modelu MoE DeepSeek (284B łącznie / 13B aktywnych), z kontekstem 1M tokenów, maksymalnym wyjściem 384K, domyślnie włączonym trybem myślenia i natywnie płynną obsługą OpenAI Responses API — dialektu, którym posługują się agenci w stylu Codex. Opublikowane przez DeepSeek własne wyniki testów agentowych dla rewizji 0731: 82.7 w Terminal-Bench 2.1, 76.7 w Cybergym, 70.3 w Toolathlon Verified, 68.7 w DSBench-FullStack, 59.6 w DSBench-Hard. Są to dane podawane przez producenta i niepotwierdzone niezależnie, ale to właśnie nimi DeepSeek postanowił się wyróżnić — i wypadają one lepiej nawet od DeepSeek V4 Pro Preview na tym samym zestawie.
• DeepSeek V4 Pro — flagowy model MoE o łącznej wielkości 1,6T / 49B aktywnych parametrów, ten sam kontekst 1M tokenów, otwarte wagi (wydany w kwietniu 2026), wyceniony na 0,44 USD / 0,87 USD za milion tokenów.
Jeśli chodzi o cenę, cały sens polega na tym, że DeepSeek jest tani. DeepSeek V4 Flash 0731 kosztuje mniej więcej 0,147 USD za milion tokenów wejściowych i 0,295 USD za milion tokenów wyjściowych — ceny listowe producenta, które OrcaRouter przekazuje z zerową marżą. Gdy harness dojrzeje, będziesz mógł wskazać mu te same modele, które już dziś możesz wywoływać, a późniejsza podmiana harnessu to zmiana konfiguracji, a nie migracja. Nie potrzebujesz DeepSeek Harness, aby teraz uruchomić którykolwiek z tych modeli.

Wojna kosztów, w którą wchodzi.
To nie jest marginalny rynek. Claude Code podobno osiągnął roczny wskaźnik przychodów (run rate) przekraczający 2,5 miliarda dolarów na początku 2026 roku, a rynek kodowania agentowego szacowany jest na kilka miliardów dolarów. Chińskie laboratorium, które konkuruje niższymi cenami API — i którego modele już działają wewnątrz samego Claude Code — to ruch, który przecenia całą kategorię.
Jeśli chodzi o koszt, wybór platformy jest równie ważny jak wybór modelu. Poziomy test przeprowadzony przez Composio, uruchamiający DeepSeek V4 Flash na ośmiu platformach, wykazał, że najtańsza z nich (platforma open-source "Pi") kosztuje około 0,028 USD za inferencję na jedno pomyślnie wykonane zadanie, podczas gdy Claude Code w tym samym teście osiągnął około 0,195 USD — czyli niemal 7-krotną różnicę w przypadku tej samej klasy zadań. Dodając do tego zgłaszaną przez DeepSeek zniżkę na pamięć podręczną prefiksów oraz osiągane z nim przez platformy innych producentów wskaźniki trafień w pamięci podręcznej na poziomie 99,93%, efektywny koszt pojedynczego zadania dla agenta opartego na DeepSeek staje się bardzo szybko bardzo niski.
Warto też pamiętać, co już dziś jest faktem: DeepSeek udostępnia endpoint kompatybilny z Anthropic (adres bazowy: https://api.deepseek.com/anthropic), a jego własna dokumentacja opisuje, jak skierować Claude Code na modele DeepSeek V4. Produkt harness to próba DeepSeek, by przejąć tę warstwę na własność zamiast ją wynajmować — a DeepSeek zapowiedział znaczącą podwyżkę cen w całej linii V4. Ponieważ OrcaRouter przekazuje ceny katalogowe dostawców bez żadnej marży, nowa stawka jest aktywna po naszej stronie tego samego dnia, w którym wejdzie w życie, bez renegocjacji.

Dlaczego uprząż to nowe pole bitwy
Przesunięcie akcentu z możliwości modelu na dostarczanie zadań. Model klasy frontier to dziś stawka wejścia; o tym, czy zespół faktycznie wypuści agenta, decyduje otaczająca go infrastruktura — oraz dane, które ona wytwarza. Analitycy, w tym CITIC Securities, interpretujący ruch DeepSeek, twierdzą, że dojrzała platforma wykonawcza (harness) stanowi rów obronny z dwóch kumulujących się powodów: zamyka komercyjną pętlę od punktu wejścia do ukończonego zadania, a także generuje dane o długoterminowych trajektoriach zadań, które zasilają trening modeli. Platformy tworzone przez społeczność, takie jak Pi czy DeepSeek-TUI, dowodzą popytu, ale nie przekazują tych danych z powrotem do modelu. Własna platforma DeepSeek już by to robiła — a funkcja Trajectory, dostępna w wersji v0.1, to ten przepływ danych uwidoczniony.
To także dlatego interpretacja „wystarczy zrobić benchmark modelu" jest niepełna. Wyniki DeepSeek V4 Flash w zadaniach agentowych są mocne, ale to właśnie w harnessie DeepSeek liczy na zbudowanie trwałej przewagi — co sprawia, że błędy warstwy stanu w raportach z pierwszego dnia to coś więcej niż kosmetyka. Harness, którego interfejs potrafi opóźnić się o pięćdziesiąt minut względem pętli, to wciąż developer preview; to jeszcze nie fosa obronna.
Co teraz oglądamy
• Czy warstwa stanu dotrzymuje kroku. Opóźnienie zapisu write-behind jest udokumentowane, odtwarzalne i zgłaszane do oficjalnego repozytorium; obserwuj, czy ścieżka opróżniania bufora (flush) zostanie szybko naprawiona, oraz czy projekt, w którym „UI pokazuje tylko stan zatwierdzony”, zmieni się, gdy sesja jest w toku.
• Test natywnej reprodukcji. Cały powód, dla którego to wydanie miało znaczenie, jest taki, że wyniki agenta V4 DeepSeek zostały wygenerowane w trybie „DeepSeek Harness minimal mode” — teraz każdy może zainstalować wersję zapoznawczą i uruchomić te zadania natywnie. Jeśli wartości 82.7 / 87.9 się odtworzą, ostatnie dwa wydania stanowią jeden spójny system; jeśli nie, luka między benchmarkiem dostawcy a rzeczywistością staje się mierzalna.
• Czy ekosystem wtyczek stanie na nogi. Powierzchnia wtyczek oznaczonych #dsh jest realna, ale to, czy strony trzecie dostarczą cokolwiek wartego zainstalowania, pozostaje otwarte.
• Lista cen. DeepSeek nie powiedział nic o tym, ile będzie kosztować sam harness, a ogłoszona podwyżka cen API V4 to kolejna wielka niewiadoma.
• Czy „kompozycyjność czasoprzestrzenna" stanie się listą poprawek, czy też sloganem. Artykuł daje DeepSeekowi rygorystyczny słownik dla dokładnie tego błędu, który ujawnił raport terenowy; testem jest to, czy warstwa stanu v0.1 zbiega się do tych gwarancji.
Szczera ocena: najsilniejszy przedpremierowy sygnał, jaki dał DeepSeek, stał się teraz prawdziwym produktem, ale w wersji developerskiej z udokumentowanymi niedoskonałościami. To, co dziś jest solidne, to para modeli leżących u jego podstaw — DeepSeek V4 Flash 0731 i DeepSeek V4 Pro, oba dostępne na OrcaRouter w cenie katalogowej dostawcy, z zerową marżą, oba nadające się do pętli agenta przez jedno standardowe API. Gdy środowisko ewaluacyjne dojrzeje, sposobem na jego ocenę bez stawiania ścieżki produkcyjnej na wersji v0.1 jest routing: postaw środowisko z przodu do ewaluacji, trzymaj te same modele za jednym endpointem i przełącz się na sprawdzoną kombinację w momencie, gdy zacznie się zacinać. Ta zmiana to modyfikacja w jednej linijce.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
