
DeepSeek Harness: Den svarta valen dyker upp — Vad vi vet hittills om DeepSeeks konkurrent till Claude Code
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligens49Kodning
DeepSeek Harness v0.1 är ute, och den första fältrapporten som betyder något kom mindre än ett dygn senare. Den 14 augusti beskrev samma X-konto som hade startat releasen — teortaxesTex — en session som såg död ut men som faktiskt höll på att slutföras: tokenströmningen saktade in "exponentiellt" till ett krypande tempo, gränssnittet visade fem av nio todos avklarade, och efter en omladdning av sidan visade det sig att alla nio var slutförda. Gränssnittet hade visat tillståndet från ungefär femtio minuter tidigare. "Är detta… vad du menar med spatiotemporal komposabilitet?" — en träffande pik, eftersom ramverket som DeepSeek byggt detta på bokstavligen har en teori om tid. Det här inlägget började som en läckagespårning; spåret löstes den 13 augusti, när DeepSeek släppte harnessen som öppen källkod. Det som följer är vad som faktiskt levererades, och vad den första dagen av verklig användning visar om agentlagret som byggs kring DeepSeek V4 Flash 0731 och DeepSeek V4 Pro.
Den ärliga beskrivningen har förändrats sedan det här inlägget först publicerades. När det publicerades hade inget som kallades "DeepSeek Harness" lanserats och bevisen var en hög offentliga ledtrådar — ett certifierat WeChat-konto, platsannonser, en benchmark-fotnot, ett internt testsamtal. Det är inte längre sant. På kvällen den 13 augusti, Peking-tid, publicerade DeepSeek v0.1 av harnessen som en MIT-licensierad utvecklarpreview på github.com/deepseek-ai/deepseek-harness, körbar med ett enda npm-kommando, och repot fick över 30 000 GitHub-stjärnor inom några timmar. Läckan blev en produkt. Det som nu är overifierat är inte huruvida harnessen existerar utan hur den beter sig i verkligheten — och de tidiga fältrapporterna är de nya bevisen.
Modell + Harness = Agent: vad en 'harness' faktiskt är
Formeln som DeepSeek använder internt är Modell + Harness = Agent. Modellen är hjärnan; harnessen är allt annat som får en agent att fungera i praktiken — kontext- och minneshantering, verktygsanrop, uppgiftsplanering, filläsning och filskrivning, terminalexekvering, att mata tillbaka felutdata i loopen, och att bedöma om en uppgift faktiskt är slutförd.
Termen populariserades av Anthropic och blev branschens referensram för varför kodningsagenter är mer än en bra LLM. En modell som presterar väl på benchmarks kan fortfarande misslyckas i en agentisk loop om den omgivande mekaniken — hur den anropar verktyg, hur den minns vad den gjorde för tio minuter sedan, hur den återhämtar sig när ett kommando misslyckas — är svag. DeepSeek har gjort den mekaniken till sin uttryckliga produktstrategi, och Harness-teamet är den organisationsenhet som genomför det. De underliggande modellerna levererades redan: DeepSeek V4 Flash 0731 och DeepSeek V4 Pro har båda agentanpassade benchmarkresultat som DeepSeek genererade i sin egen harness, ända ner till namnet "DeepSeek Harness minimal mode."
Läckagespåret som slutade den 13 augusti
Det här var aldrig en enda läcka; det var en stapel offentliga ledtrådar som byggts upp sedan mars och som sedan mynnade ut i ett releasedatum. I ungefärlig ordning:
• mars 2026 — Rapporter kopplar Cui Tianyi (崔添翼), en examen i datavetenskap från Zhejiang University och tidigare ingenjör på Jane Street i nio år, till DeepSeeks agentarbete; pressen identifierar honom senare som ledare för Harness-teamet. Rapporterat, men inte bekräftat av DeepSeek vid tidpunkten.
• 24 april 2026 — DeepSeek V4 förhandsvisas, uttryckligen positionerad för agentuppgifter och optimerad för agentverktyg som Claude Code.
• Maj 2026 — DeepSeek publicerar två Harness-roller på Moka — en produktchef för Agent Harness och en forskningsingenjör, båda baserade i Peking. DeepSeeks forskare Chen Deli skriver offentligt att målet, kort sagt, är att benchmarka Claude Code och bygga en "DeepSeek Code Harness".
• juni 2026 — Rekryteringssatsningen fortsätter; teamledaren beskriver avdelningen som underbemannad med "ambitiösa mål och en tung arbetsbelastning."
• 6–7 juli 2026 — WeChat-kontot "DeepSeek Harness team" registreras och certifieras under DeepSeeks Beijing-enhet, med en svartvalslogotyp. Ingen utomstående märker det ännu.
• 31 juli 2026 — DeepSeek V4 Flash:s officiella API går i offentlig beta, och DeepSeeks API-dokumentation avslöjar — för första gången — att CodeAgent-uppgifterna i dess offentliga benchmarks kördes på "DeepSeek Harness minimal mode," med tillägget "kommer snart."
1 augusti 2026 — Teamledaren för Harness inleder rekrytering för intern testning riktad mot utvecklare av agent-harness-projekt med öppen källkod. Kinesisk tech-press rapporterar 769 sökande, 712 unika repositories och över 1,2 miljoner sammanlagda GitHub-stjärnor.
• 11 augusti 2026 — Bevakningen av kontot blir utbredd; den svarta valen dyker upp.
• 13 augusti 2026 — v0.1 går live: MIT-licensierad, öppen på GitHub, körbar med npx @deepseek-ai/dsh web. Spåret löste sig.

Vad v0.1 faktiskt levererade
Utvecklarförhandsversionen är en agentruntime för skrivbord och CLI i Node-paketnamnrymden, byggd på Cordis meta-ramverk med den uttalade designprincipen ”allt är ett plugin.” Modeller, verktyg, skills, sessioner, sandlådor, lagring, agentloopen, schemaläggning och gränssnittet är alla utbytbara Cordis-plugin. Fyra presets medföljer: Standard (den kompletta verktygsuppsättningen för kodningsagenter), PTC (modellen skriver TypeScript-program för att koordinera verktygsanrop i flera steg), Minimal (ett skalverktyg plus en filredigerare — det läge som V4-benchmarkarna kördes i) och Creation (för att bygga egna presets). En Trajectory-vy skriver allt som modellen ser till en append-only-sessionslogg som kan spelas upp källa för källa — DeepSeeks svar på ”black box”-klagomålet om sammanfattad agenthistorik.
Det viktigaste förbehållet är DeepSeeks eget: detta är en utvecklarförhandsvisning, repot bär en intern testningsnotis, och brytande förändringar förväntas medan kärnplugin och bas-API:er utvecklas. Den varningen visade sig vara befogad inom några timmar – och den ramar in fältrapporterna nedan.
Vad de första fältrapporterna visar
Rapporten som ligger till grund för denna uppdatering är en enda användares berättelse och bör läsas som sådan: teortaxesTex, den 14 augusti, beskrev en DeepSeek Harness-session där tokenströmningen successivt saktade ner till ett kryp, gränssnittet visade fem av nio todos som klara, och en omladdning avslöjade att alla nio faktiskt hade slutförts – gränssnittet hade renderat tillstånd från ungefär femtio minuter tidigare. Det är ett inlägg på X, inte ett erkännande från leverantören, och inte ännu oberoende reproducerat. Men symptomklassen bekräftas i projektets egna offentliga dokumentation, vilket är det som gör att det är värt att ta på allvar.
Det officiella arkivets GitHub-diskussion #483, inlämnad den 13 augusti, dokumenterar exakt denna felfamilj. Sessionsinnehållet sparas med en begränsad write-behind-batch — händelser ligger i en väntekö i minnet tills en 200-millisekunders timer utlöser en varaktig skrivning — och gränssnittet renderar endast committed state. Under tung samtidig belastning töjs tidsfönstret rejält; efter en oren avstängning töms aldrig den del av kön som ligger kvar i minnet, och JSONL- eller SQLite-backendet läser bara in det committed prefixet, så användarinmatning dyker upp sent eller aldrig och tidigare synlig historik försvinner. Diskussionen kopplar detta till två öppna ärenden: #477 (användartextinmatning fördröjs under lång tid vid tung samtidig belastning) och #479 (nya användarbegäranden visas inte alls i konversationsvyn). Fältrapportens ”5/9 på skärmen, 9/9 klara” är det där gapet mellan committed och faktiskt tillstånd som visar sig i en live-session.
Feedbacken för Broader v0.1 är polariserad på ett passande sätt. Vissa testare prisar pluginarkitekturen som en "självmonterad stationär dator med universella portar" jämfört med stängda rivaler; andra listar brister — en hårdkodad multimodal väg och en dokumenterad agentpolicybugg där testmiljön tvingar modellen att undersöka varje exitkod som inte är noll, medan greps exitkod 1 för "ingen träff" förvandlar godkända tester till skenbara misslyckanden, vilket driver en självförstärkande övervalideringsloop (61 förfrågningar mot 32, och 0,17 dollar mot 0,05 dollar, för samma uppgift i den rapporterade jämförelsen). Recensionerna från lanseringsdagen läses som en utvecklarförhandsversion med verklig ambition och verkliga problem i tillståndslagret, inte som en färdig utmanare till Claude Code.
"Spatiotemporal komponerbarhet" är inte bara en punchline.
Fältrapportens avslutande skämt har en forskningsartikel bakom sig. DeepSeek Harness är byggt på Cordis, vars design kommer från "A Programming Paradigm for Spatiotemporal Composability" — en 88-sidig formell studie medförfattad av Peking University och DeepSeek, med Yifan Shi (skaparen av chatbotramverket Koishi) som första författare, tillsammans med Wei Zhang och Harness teamledare, Cui Tianyi. Artikeln delar upp dynamisk komposition i två ortogonala axlar: temporal komposabilitet, där borttagning av en komponent rent ångrar dess sidoeffekter som om den aldrig hade funnits, och spatial komposabilitet, där komponenter deklarerar beroenden och körningen reaktivt aktiverar och avaktiverar dem när leverantörer dyker upp och försvinner.
Skämtet sitter eftersom ett UI-renderingstillstånd från femtio minuter sedan är ett temporalt kompositionsfel i ordets mest bokstavliga bemärkelse: körningsmiljön fortsatte att exekvera medan det synliga tillståndet committades efter den. Persistensglappet som dokumenterats i Diskussion #483 — en write-behind-batch som kan släpa långt efter körslingan — är precis den typ av sak som artikelns garantier är tänkta att förhindra. Huruvida testmiljöns tillståndslager så småningom efterlever dessa garantier i praktiken är en av de genuint öppna frågorna i den här releasen, och rapporterna från dag ett är det första beviset åt endera hållet.
Modellerna under
Selen är produkten; modellerna är motorn. Båda modellerna som DeepSeek förmodligen kommer att placera under den är redan live, och båda är anropsbara via OrcaRouter idag:
DeepSeek V4 Flash 0731 — den omtränade officiella utgåvan av DeepSeeks effektiva MoE (284B totalt / 13B aktiv), 1M-tokens kontext, 384K max utdata, tankeläge aktiverat som standard, och naturligt flytande i OpenAI Responses API — den dialekt som Codex-liknande agenter talar. DeepSeeks egna publicerade agent-benchmarksiffror för 0731-revisionen: 82,7 på Terminal-Bench 2.1, 76,7 på Cybergym, 70,3 på Toolathlon Verified, 68,7 på DSBench-FullStack, 59,6 på DSBench-Hard. Dessa siffror är leverantörsrapporterade och ej oberoende verifierade, men de är vad DeepSeek valt att leda med, och de överträffar även DeepSeek V4 Pro Preview på samma uppsättning.
• DeepSeek V4 Pro — flaggskeppsmodellen med 1.6T-total / 49B-aktiv MoE, samma 1M-tokenkontext, öppna vikter (släppt april 2026), prissatt till $0.44 / $0.87 per miljon tokens.
När det gäller pris är hela poängen att DeepSeek är billigt. DeepSeek V4 Flash 0731 kostar ungefär 0.147 USD per miljon input-tokens och 0.295 USD per miljon output-tokens — listpriser från leverantören, som OrcaRouter skickar vidare utan påslag. När harnesset mognar kommer du att kunna peka det mot samma modeller som du redan kan anropa idag, och att byta ut harnesset senare är en konfigurationsändring, inte en migrering. Du behöver inte DeepSeek Harness för att köra någon av modellerna nu.

Kostnadskriget som det är på väg in i
Detta är inte en marginell marknad. Claude Code rapporterades ha en årlig intäktstakt på över 2,5 miljarder dollar i början av 2026, och marknaden för agentisk kodning uppskattas till ensiffriga miljarder. En kinesisk labb-aktör som underbjuder API-priset – och vars modeller redan körs inuti Claude Code själv – är ett drag som omprissätter hela kategorin.
Kostnadsmässigt spelar valet av harness lika stor roll som modellen. Ett horisontellt test från Composio, där DeepSeek V4 Flash kördes över åtta harnessar, visade att det billigaste (open source-harnessen "Pi") kostade ungefär 0,028 dollar i inferens per framgångsrik uppgift, jämfört med cirka 0,195 dollar för Claude Code i samma test – en nästan sju gånger så stor skillnad för samma typ av arbete. Lägg därtill DeepSeeks rapporterade rabatt för prefix-cache och de 99,93 procents cache-träffar som harnessar från tredje part rapporterar med den, så blir den effektiva kostnaden per uppgift för en DeepSeek-driven agent väldigt liten väldigt snabbt.
Det är också värt att komma ihåg vad som redan gäller idag: DeepSeek exponerar en Anthropic-kompatibel slutpunkt (bas-URL https://api.deepseek.com/anthropic), och deras egen dokumentation går igenom hur man pekar Claude Code mot DeepSeek V4-modeller. Harness-produkten är DeepSeek som försöker äga det lagret i stället för att hyra det — och DeepSeek har meddelat att en betydande prisökning över hela V4-serien är på väg. Eftersom OrcaRouter skickar vidare leverantörernas listpriser utan påslag, är det nya priset live hos oss samma dag som det lanseras, utan omförhandling.

Varför selen är den nya slagmarken
Skiftet går från modellförmåga till uppgiftsleverans. En frontmodell är nu en självklarhet; det som avgör om ett team faktiskt levererar en agent är det omgivande maskineriet — och den data det producerar. Analytiker som tolkar DeepSeeks drag, däribland CITIC Securities, menar att ett moget ramverk är en vallgrav av två samverkande skäl: det sluter den kommersiella loopen från ingångspunkt till färdig uppgift, och det genererar långsiktiga data över uppgiftsbanor som matar modellträning. Community-ramverk som Pi eller DeepSeek-TUI visar på efterfrågan, men de matar inte tillbaka den datan till modellen. DeepSeeks eget ramverk skulle göra det — och Trajectory-funktionen som levereras i v0.1 är den datavägen gjord synlig.
Det är också därför en tolkning som bara "benchmarkar modellen" är ofullständig. DeepSeek V4 Flash:s agentpoäng är starka, men det är i harnessen som DeepSeek förväntar sig att bygga den bestående fördelen — vilket gör buggarna i state-lagret i dag-ett-rapporterna mer än kosmetiska. En harness vars UI kan hamna femtio minuter efter loopen är fortfarande en utveckarförhandsvisning; den är ännu inte vallgraven.
Vad vi tittar på nu
• Huruvida state-lagret håller jämna steg. Write-behind-fördröjningen är dokumenterad, reproducerbar och har anmälts mot det officiella repot; håll koll på om flush-sökvägen fixas snabbt och om designen med ”UI visar endast committed state” ändras när en session pågår.
Det nativa reproduktionstestet. Hela anledningen till att releasen spelade roll är att DeepSeeks V4-agentpoäng genererades på "DeepSeek Harness minimal mode" — nu kan vem som helst installera förhandsversionen och köra dessa uppgifter nativt. Om siffrorna 82.7 / 87.9 reproduceras, framstår de två senaste releaserna som ett sammanhängande system; om de inte gör det, blir leverantörs-benchmark-gapet mätbart.
• Huruvida plugin-ekosystemet får fäste. Den #dsh-taggade plugin-ytan är verklig, men huruvida tredjeparter levererar något värt att installera är fortfarande öppet.
• Prislistan. DeepSeek har inte sagt något om vad själva ramverket kommer att kosta, och den annonserade prishöjningen för V4 API är den andra stora okända faktorn.
• Huruvida "spatiotemporal komposabilitet" blir en fixlista eller en slogan. Pappret ger DeepSeek ett rigoröst ordförråd för exakt det misslyckande fältrapporten lyfte fram; huruvida v0.1-tillståndslagret konvergerar mot dessa garantier är testet.
Den ärliga bedömningen: den starkaste signalen inför lanseringen som DeepSeek har gett är nu en riktig produkt, men en utvecklarförhandsversion med dokumenterade brister. Det som är stabilt idag är modellparet under den — DeepSeek V4 Flash 0731 och DeepSeek V4 Pro, båda live på OrcaRouter till leverantörens listpris utan påslag, båda användbara i agentloopar genom ett standard-API. När testmiljön mognar är sättet att utvärdera den utan att satsa produktionen på en v0.1 att dirigera: placera testmiljön framför för utvärdering, behåll samma modeller bakom en endpoint, och växla över till en beprövad kombination i samma stund som den stannar. Det bytet är en ändring på en rad.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
