Titelkort för 'DeepSeek Harness: Den svarta valen bryter ytan': rubrik 'DeepSeek Harness', underrubrik 'Den svarta valen bryter ytan — Vad vi vet hittills om DeepSeeks konkurrent till Claude Code', slogan 'Model + Harness = Agent', chips för 'DeepSeek V4 Flash' och 'DeepSeek V4 Pro', samt sidfot 'Läcka / what-we-know-so-far — inget har släppts ännu'. OrcaRouter-logotyp kompositerad längst ner till höger.
Guides & Insights

DeepSeek Harness: Den svarta valen dyker upp — Vad vi vet hittills om DeepSeeks konkurrent till Claude Code

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

D​eepSeek Harness v0.1 är ute, och den första fältrapporten som betyder något kom mindre än ett dygn senare. Den 14 augusti beskrev samma X-konto som hade startat releasen — teortaxesTex — en session som såg död ut men som faktiskt höll på att slutföras: tokenströmningen saktade in "exponentiellt" till ett krypande tempo, gränssnittet visade fem av nio todos avklarade, och efter en omladdning av sidan visade det sig att alla nio var slutförda. Gränssnittet hade visat tillståndet från ungefär femtio minuter tidigare. "Är detta… vad du menar med spatiotemporal komposabilitet?" — en träffande pik, eftersom ramverket som D​eepSeek byggt detta på bokstavligen har en teori om tid. Det här inlägget började som en läckagespårning; spåret löstes den 13 augusti, när D​eepSeek släppte harnessen som öppen källkod. Det som följer är vad som faktiskt levererades, och vad den första dagen av verklig användning visar om agentlagret som byggs kring DeepSeek V4 Flash 0731 och DeepSeek V4 Pro.

Den ärliga beskrivningen har förändrats sedan det här inlägget först publicerades. När det publicerades hade inget som kallades "D​eepSeek Harness" lanserats och bevisen var en hög offentliga ledtrådar — ett certifierat WeChat-konto, platsannonser, en benchmark-fotnot, ett internt testsamtal. Det är inte längre sant. På kvällen den 13 augusti, Peking-tid, publicerade D​eepSeek v0.1 av harnessen som en MIT-licensierad utvecklarpreview på github.com/deepseek-ai/deepseek-harness, körbar med ett enda npm-kommando, och repot fick över 30 000 GitHub-stjärnor inom några timmar. Läckan blev en produkt. Det som nu är overifierat är inte huruvida harnessen existerar utan hur den beter sig i verkligheten — och de tidiga fältrapporterna är de nya bevisen.

Modell + Harness = Agent: vad en 'harness' faktiskt är

Formeln som D​eepSeek använder internt är Modell + Harness = Agent. Modellen är hjärnan; harnessen är allt annat som får en agent att fungera i praktiken — kontext- och minneshantering, verktygsanrop, uppgiftsplanering, filläsning och filskrivning, terminalexekvering, att mata tillbaka felutdata i loopen, och att bedöma om en uppgift faktiskt är slutförd.

Termen populariserades av A​nthropic och blev branschens referensram för varför kodningsagenter är mer än en bra LLM. En modell som presterar väl på benchmarks kan fortfarande misslyckas i en agentisk loop om den omgivande mekaniken — hur den anropar verktyg, hur den minns vad den gjorde för tio minuter sedan, hur den återhämtar sig när ett kommando misslyckas — är svag. D​eepSeek har gjort den mekaniken till sin uttryckliga produktstrategi, och Harness-teamet är den organisationsenhet som genomför det. De underliggande modellerna levererades redan: DeepSeek V4 Flash 0731 och DeepSeek V4 Pro har båda agentanpassade benchmarkresultat som D​eepSeek genererade i sin egen harness, ända ner till namnet "D​eepSeek Harness minimal mode."

Läckagespåret som slutade den 13 augusti

Det här var aldrig en enda läcka; det var en stapel offentliga ledtrådar som byggts upp sedan mars och som sedan mynnade ut i ett releasedatum. I ungefärlig ordning:

• mars 2026 — Rapporter kopplar Cui Tianyi (崔添翼), en examen i datavetenskap från Zhejiang University och tidigare ingenjör på Jane Street i nio år, till D​eepSeeks agentarbete; pressen identifierar honom senare som ledare för Harness-teamet. Rapporterat, men inte bekräftat av D​eepSeek vid tidpunkten.

• 24 april 2026 — D​eepSeek V4 förhandsvisas, uttryckligen positionerad för agentuppgifter och optimerad för agentverktyg som Claude Code.

• Maj 2026 — D​eepSeek publicerar två Harness-roller på Moka — en produktchef för Agent Harness och en forskningsingenjör, båda baserade i Peking. D​eepSeeks forskare Chen Deli skriver offentligt att målet, kort sagt, är att benchmarka Claude Code och bygga en "D​eepSeek Code Harness".

• juni 2026 — Rekryteringssatsningen fortsätter; teamledaren beskriver avdelningen som underbemannad med "ambitiösa mål och en tung arbetsbelastning."

• 6–7 juli 2026 — WeChat-kontot "D​eepSeek Harness team" registreras och certifieras under D​eepSeeks Beijing-enhet, med en svartvalslogotyp. Ingen utomstående märker det ännu.

• 31 juli 2026 — D​eepSeek V4 Flash:s officiella API går i offentlig beta, och D​eepSeeks API-dokumentation avslöjar — för första gången — att CodeAgent-uppgifterna i dess offentliga benchmarks kördes på "DeepSeek Harness minimal mode," med tillägget "kommer snart."

1 augusti 2026 — Teamledaren för Harness inleder rekrytering för intern testning riktad mot utvecklare av agent-harness-projekt med öppen källkod. Kinesisk tech-press rapporterar 769 sökande, 712 unika repositories och över 1,2 miljoner sammanlagda GitHub-stjärnor.

• 11 augusti 2026 — Bevakningen av kontot blir utbredd; den svarta valen dyker upp.

• 13 augusti 2026 — v0.1 går live: MIT-licensierad, öppen på GitHub, körbar med npx @deepseek-ai/dsh web. Spåret löste sig.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

Vad v0.1 faktiskt levererade

Utvecklarförhandsversionen är en agentruntime för skrivbord och CLI i Node-paketnamnrymden, byggd på Cordis meta-ramverk med den uttalade designprincipen ”allt är ett plugin.” Modeller, verktyg, skills, sessioner, sandlådor, lagring, agentloopen, schemaläggning och gränssnittet är alla utbytbara Cordis-plugin. Fyra presets medföljer: Standard (den kompletta verktygsuppsättningen för kodningsagenter), PTC (modellen skriver TypeScript-program för att koordinera verktygsanrop i flera steg), Minimal (ett skalverktyg plus en filredigerare — det läge som V4-benchmarkarna kördes i) och Creation (för att bygga egna presets). En Trajectory-vy skriver allt som modellen ser till en append-only-sessionslogg som kan spelas upp källa för källa — D​eepSeeks svar på ”black box”-klagomålet om sammanfattad agenthistorik.

Det viktigaste förbehållet är D​eepSeeks eget: detta är en utvecklarförhandsvisning, repot bär en intern testningsnotis, och brytande förändringar förväntas medan kärnplugin och bas-API:er utvecklas. Den varningen visade sig vara befogad inom några timmar – och den ramar in fältrapporterna nedan.

Vad de första fältrapporterna visar

Rapporten som ligger till grund för denna uppdatering är en enda användares berättelse och bör läsas som sådan: teortaxesTex, den 14 augusti, beskrev en D​eepSeek Harness-session där tokenströmningen successivt saktade ner till ett kryp, gränssnittet visade fem av nio todos som klara, och en omladdning avslöjade att alla nio faktiskt hade slutförts – gränssnittet hade renderat tillstånd från ungefär femtio minuter tidigare. Det är ett inlägg på X, inte ett erkännande från leverantören, och inte ännu oberoende reproducerat. Men symptomklassen bekräftas i projektets egna offentliga dokumentation, vilket är det som gör att det är värt att ta på allvar.

Det officiella arkivets GitHub-diskussion #483, inlämnad den 13 augusti, dokumenterar exakt denna felfamilj. Sessionsinnehållet sparas med en begränsad write-behind-batch — händelser ligger i en väntekö i minnet tills en 200-millisekunders timer utlöser en varaktig skrivning — och gränssnittet renderar endast committed state. Under tung samtidig belastning töjs tidsfönstret rejält; efter en oren avstängning töms aldrig den del av kön som ligger kvar i minnet, och JSONL- eller SQLite-backendet läser bara in det committed prefixet, så användarinmatning dyker upp sent eller aldrig och tidigare synlig historik försvinner. Diskussionen kopplar detta till två öppna ärenden: #477 (användartextinmatning fördröjs under lång tid vid tung samtidig belastning) och #479 (nya användarbegäranden visas inte alls i konversationsvyn). Fältrapportens ”5/9 på skärmen, 9/9 klara” är det där gapet mellan committed och faktiskt tillstånd som visar sig i en live-session.

Feedbacken för Broader v0.1 är polariserad på ett passande sätt. Vissa testare prisar pluginarkitekturen som en "självmonterad stationär dator med universella portar" jämfört med stängda rivaler; andra listar brister — en hårdkodad multimodal väg och en dokumenterad agentpolicybugg där testmiljön tvingar modellen att undersöka varje exitkod som inte är noll, medan greps exitkod 1 för "ingen träff" förvandlar godkända tester till skenbara misslyckanden, vilket driver en självförstärkande övervalideringsloop (61 förfrågningar mot 32, och 0,17 dollar mot 0,05 dollar, för samma uppgift i den rapporterade jämförelsen). Recensionerna från lanseringsdagen läses som en utvecklarförhandsversion med verklig ambition och verkliga problem i tillståndslagret, inte som en färdig utmanare till Claude Code.

"Spatiotemporal komponerbarhet" är inte bara en punchline.

Fältrapportens avslutande skämt har en forskningsartikel bakom sig. D​eepSeek Harness är byggt på Cordis, vars design kommer från "A Programming Paradigm for Spatiotemporal Composability" — en 88-sidig formell studie medförfattad av Peking University och D​eepSeek, med Yifan Shi (skaparen av chatbotramverket Koishi) som första författare, tillsammans med Wei Zhang och Harness teamledare, Cui Tianyi. Artikeln delar upp dynamisk komposition i två ortogonala axlar: temporal komposabilitet, där borttagning av en komponent rent ångrar dess sidoeffekter som om den aldrig hade funnits, och spatial komposabilitet, där komponenter deklarerar beroenden och körningen reaktivt aktiverar och avaktiverar dem när leverantörer dyker upp och försvinner.

Skämtet sitter eftersom ett UI-renderingstillstånd från femtio minuter sedan är ett temporalt kompositionsfel i ordets mest bokstavliga bemärkelse: körningsmiljön fortsatte att exekvera medan det synliga tillståndet committades efter den. Persistensglappet som dokumenterats i Diskussion #483 — en write-behind-batch som kan släpa långt efter körslingan — är precis den typ av sak som artikelns garantier är tänkta att förhindra. Huruvida testmiljöns tillståndslager så småningom efterlever dessa garantier i praktiken är en av de genuint öppna frågorna i den här releasen, och rapporterna från dag ett är det första beviset åt endera hållet.

Modellerna under

Selen är produkten; modellerna är motorn. Båda modellerna som D​eepSeek förmodligen kommer att placera under den är redan live, och båda är anropsbara via OrcaRouter idag:

DeepSeek V4 Flash 0731 — den omtränade officiella utgåvan av DeepSeeks effektiva MoE (284B totalt / 13B aktiv), 1M-tokens kontext, 384K max utdata, tankeläge aktiverat som standard, och naturligt flytande i OpenAI Responses API — den dialekt som Codex-liknande agenter talar. DeepSeeks egna publicerade agent-benchmarksiffror för 0731-revisionen: 82,7 på Terminal-Bench 2.1, 76,7 på Cybergym, 70,3 på Toolathlon Verified, 68,7 på DSBench-FullStack, 59,6 på DSBench-Hard. Dessa siffror är leverantörsrapporterade och ej oberoende verifierade, men de är vad DeepSeek valt att leda med, och de överträffar även DeepSeek V4 Pro Preview på samma uppsättning.

• DeepSeek V4 Pro — flaggskeppsmodellen med 1.6T-total / 49B-aktiv MoE, samma 1M-tokenkontext, öppna vikter (släppt april 2026), prissatt till $0.44 / $0.87 per miljon tokens.

När det gäller pris är hela poängen att D​eepSeek är billigt. DeepSeek V4 Flash 0731 kostar ungefär 0.147 USD per miljon input-tokens och 0.295 USD per miljon output-tokens — listpriser från leverantören, som OrcaRouter skickar vidare utan påslag. När harnesset mognar kommer du att kunna peka det mot samma modeller som du redan kan anropa idag, och att byta ut harnesset senare är en konfigurationsändring, inte en migrering. Du behöver inte D​eepSeek Harness för att köra någon av modellerna nu.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

Kostnadskriget som det är på väg in i

Detta är inte en marginell marknad. Claude Code rapporterades ha en årlig intäktstakt på över 2,5 miljarder dollar i början av 2026, och marknaden för agentisk kodning uppskattas till ensiffriga miljarder. En kinesisk labb-aktör som underbjuder API-priset – och vars modeller redan körs inuti Claude Code själv – är ett drag som omprissätter hela kategorin.

Kostnadsmässigt spelar valet av harness lika stor roll som modellen. Ett horisontellt test från Composio, där DeepSeek V4 Flash kördes över åtta harnessar, visade att det billigaste (open source-harnessen "Pi") kostade ungefär 0,028 dollar i inferens per framgångsrik uppgift, jämfört med cirka 0,195 dollar för Claude Code i samma test – en nästan sju gånger så stor skillnad för samma typ av arbete. Lägg därtill D​eepSeeks rapporterade rabatt för prefix-cache och de 99,93 procents cache-träffar som harnessar från tredje part rapporterar med den, så blir den effektiva kostnaden per uppgift för en D​eepSeek-driven agent väldigt liten väldigt snabbt.

Det är också värt att komma ihåg vad som redan gäller idag: D​eepSeek exponerar en A​nthropic-kompatibel slutpunkt (bas-URL https://api.deepseek.com/anthropic), och deras egen dokumentation går igenom hur man pekar Claude Code mot D​eepSeek V4-modeller. Harness-produkten är D​eepSeek som försöker äga det lagret i stället för att hyra det — och D​eepSeek har meddelat att en betydande prisökning över hela V4-serien är på väg. Eftersom OrcaRouter skickar vidare leverantörernas listpriser utan påslag, är det nya priset live hos oss samma dag som det lanseras, utan omförhandling.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Varför selen är den nya slagmarken

Skiftet går från modellförmåga till uppgiftsleverans. En frontmodell är nu en självklarhet; det som avgör om ett team faktiskt levererar en agent är det omgivande maskineriet — och den data det producerar. Analytiker som tolkar D​eepSeeks drag, däribland CITIC Securities, menar att ett moget ramverk är en vallgrav av två samverkande skäl: det sluter den kommersiella loopen från ingångspunkt till färdig uppgift, och det genererar långsiktiga data över uppgiftsbanor som matar modellträning. Community-ramverk som Pi eller D​eepSeek-TUI visar på efterfrågan, men de matar inte tillbaka den datan till modellen. D​eepSeeks eget ramverk skulle göra det — och Trajectory-funktionen som levereras i v0.1 är den datavägen gjord synlig.

Det är också därför en tolkning som bara "benchmarkar modellen" är ofullständig. DeepSeek V4 Flash:s agentpoäng är starka, men det är i harnessen som D​eepSeek förväntar sig att bygga den bestående fördelen — vilket gör buggarna i state-lagret i dag-ett-rapporterna mer än kosmetiska. En harness vars UI kan hamna femtio minuter efter loopen är fortfarande en utveckarförhandsvisning; den är ännu inte vallgraven.

Vad vi tittar på nu

• Huruvida state-lagret håller jämna steg. Write-behind-fördröjningen är dokumenterad, reproducerbar och har anmälts mot det officiella repot; håll koll på om flush-sökvägen fixas snabbt och om designen med ”UI visar endast committed state” ändras när en session pågår.

Det nativa reproduktionstestet. Hela anledningen till att releasen spelade roll är att D​eepSeeks V4-agentpoäng genererades på "D​eepSeek Harness minimal mode" — nu kan vem som helst installera förhandsversionen och köra dessa uppgifter nativt. Om siffrorna 82.7 / 87.9 reproduceras, framstår de två senaste releaserna som ett sammanhängande system; om de inte gör det, blir leverantörs-benchmark-gapet mätbart.

• Huruvida plugin-ekosystemet får fäste. Den #dsh-taggade plugin-ytan är verklig, men huruvida tredjeparter levererar något värt att installera är fortfarande öppet.

• Prislistan. DeepSeek har inte sagt något om vad själva ramverket kommer att kosta, och den annonserade prishöjningen för V4 API är den andra stora okända faktorn.

• Huruvida "spatiotemporal komposabilitet" blir en fixlista eller en slogan. Pappret ger D​eepSeek ett rigoröst ordförråd för exakt det misslyckande fältrapporten lyfte fram; huruvida v0.1-tillståndslagret konvergerar mot dessa garantier är testet.

Den ärliga bedömningen: den starkaste signalen inför lanseringen som D​eepSeek har gett är nu en riktig produkt, men en utvecklarförhandsversion med dokumenterade brister. Det som är stabilt idag är modellparet under den — D​eepSeek V4 Flash 0731 och D​eepSeek V4 Pro, båda live på OrcaRouter till leverantörens listpris utan påslag, båda användbara i agentloopar genom ett standard-API. När testmiljön mognar är sättet att utvärdera den utan att satsa produktionen på en v0.1 att dirigera: placera testmiljön framför för utvärdering, behåll samma modeller bakom en endpoint, och växla över till en beprövad kombination i samma stund som den stannar. Det bytet är en ändring på en rad.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen