
DeepSeek Harness: De Zwarte Walvis komt boven — Wat we tot nu toe weten over DeepSeeks concurrent voor Claude Code
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligentie49Coderen
DeepSeek Harness v0.1 is uitgebracht, en het eerste veldrapport dat ertoe doet kwam minder dan een dag later binnen. Op 14 augustus beschreef hetzelfde X-account dat de releasedatum had bepaald — teortaxesTex — een sessie die er dood uitzag terwijl hij in werkelijkheid nog bezig was: tokenstreaming vertraagde 'exponentieel' tot een slakkengang, de interface toonde vijf van de negen todo's als voltooid, en een paginarefresh onthulde dat alle negen waren afgerond. De UI had dus de status van ongeveer vijftig minuten eerder weergegeven. 'Is dit... wat je bedoelt met spatiotemporele composability?' — een terechte steek, want het framework waarop DeepSeek dit ding bouwde heeft letterlijk een theorie over tijd. Dit bericht begon als een artikel over een lekspoor; het spoor eindigde op 13 augustus, toen DeepSeek de harness als open source uitbracht. Hieronder volgt wat er daadwerkelijk is uitgebracht, en wat de eerste dag van echt gebruik laat zien over de agentlaag die rond DeepSeek V4 Flash 0731 en DeepSeek V4 Pro wordt gebouwd.
De eerlijke voorstelling van zaken is veranderd sinds dit bericht voor het eerst verscheen. Toen het werd gepubliceerd, was er nog niets uitgebracht dat "DeepSeek Harness" heette, en het bewijs was een stapel openbare aanwijzingen — een gecertificeerd WeChat-account, vacatures, een voetnoot bij een benchmark, een oproep voor intern testen. Dat is niet langer waar. Op de avond van 13 augustus Beijing-tijd publiceerde DeepSeek v0.1 van de harness als een onder MIT-licentie uitgebrachte ontwikkelaarspreview op github.com/deepseek-ai/deepseek-harness, uitvoerbaar met een enkel npm-commando, en de repository trok binnen enkele uren meer dan 30.000 GitHub-sterren. Het lek werd een product. Wat nu niet is geverifieerd, is niet of de harness bestaat, maar hoe hij zich gedraagt in het wild — en de eerste veldrapporten zijn het nieuwe bewijs.
Model + Harness = Agent: wat een "harness" eigenlijk is
De formule die DeepSeek intern gebruikt, is Model + Harness = Agent. Het model is het brein; de harness is al het andere dat een agent in de praktijk laat werken — context- en geheugenbeheer, het aanroepen van tools, taakplanning, het lezen en schrijven van bestanden, terminaluitvoering, het terugvoeren van foutuitvoer in de lus, en het beoordelen of een taak daadwerkelijk is voltooid.
De term werd gepopulariseerd door Anthropic en werd het raamwerk van de industrie voor waarom codeeragenten meer zijn dan een goede LLM. Een model dat goed scoort op benchmarks kan nog steeds falen in een agentische lus als de omringende machinerie — hoe het tools aanroept, hoe het onthoudt wat het tien minuten geleden deed, hoe het herstelt wanneer een commando faalt — zwak is. DeepSeek heeft die machinerie omgezet in zijn expliciete productstrategie, en het Harness-team is de afdeling die dat doet. De onderliggende modellen werden al geleverd: DeepSeek V4 Flash 0731 en DeepSeek V4 Pro dragen beide agent-afgestemde benchmarkscores die DeepSeek binnen zijn eigen harness heeft gegenereerd, tot en met de naam "DeepSeek Harness minimal mode."
Het lekspoor dat eindigde op 13 augustus
Dit was nooit een enkel lek; het was een stapel openbare broodkruimels die zich sinds maart hadden opgehoopt en vervolgens uitmondden in een releasedatum. In grove volgorde:
• Maart 2026 — Berichten brengen Cui Tianyi (崔添翼), afgestudeerd in computerwetenschappen aan de Zhejiang-universiteit en negen jaar engineer bij Jane Street, in verband met het agentwerk van DeepSeek; later wijst de pers hem aan als leider van het Harness-team. Gemeld, maar op dat moment niet bevestigd door DeepSeek.
• 24 april 2026 — DeepSeek V4 geeft een preview, expliciet gepositioneerd voor agenttaken en afgestemd op agenttools zoals Claude Code.
• Mei 2026 — DeepSeek plaatst twee Harness-functies op Moka — een Agent Harness-productmanager en een research engineer, beide gevestigd in Beijing. DeepSeek-onderzoeker Chen Deli schrijft publiekelijk dat het doel in het kort is om Claude Code te benchmarken en een "DeepSeek Code Harness" te bouwen.
• Juni 2026 — De wervingscampagne gaat door; de teamleider omschrijft de afdeling als onderbezet met "ambitieuze doelstellingen en een zware werkdruk".
• 6–7 juli 2026 — Het WeChat-account van het "DeepSeek Harness team" wordt geregistreerd en gecertificeerd onder de Beijing-entiteit van DeepSeek, met een zwart-walvislogo. Buitenstaanders merken het nog niet op.
• 31 juli 2026 — De officiële API van DeepSeek V4 Flash gaat in openbare bèta, en de API-documentatie van DeepSeek onthult — voor het eerst — dat de CodeAgent-taken in de openbare benchmarks werden uitgevoerd op "DeepSeek Harness minimal mode", met de kwalificatie "binnenkort beschikbaar".
• 1 augustus 2026 — De teamleider van Harness opent de werving voor interne tests gericht op ontwikkelaars van open-source agent-harness-projecten. De Chinese tech-pers meldt 769 aanmeldingen, 712 unieke repositories en meer dan 1,2 miljoen cumulatieve GitHub-sterren.
• 11 augustus 2026 — De berichtgeving over het account wordt breed opgepakt; de zwarte walvis komt boven water.
• 13 augustus 2026 — v0.1 gaat live: MIT-gelicentieerd, open op GitHub, uitvoerbaar met npx @deepseek-ai/dsh web. Het spoor is opgelost.

Wat v0.1 daadwerkelijk uitbracht
De developer preview is een agent-runtime voor desktop en CLI in de Node-pakketnaamruimte, gebouwd op het Cordis-metaraamwerk met het vermelde ontwerpprincipe 'alles is een plugin.' Modellen, tools, vaardigheden, sessies, sandboxes, opslag, de agent-loop, planning en de UI zijn allemaal vervangbare Cordis-plugins. Er worden vier presets meegeleverd: Standard (de volledige toolset voor codeeragenten), PTC (het model schrijft TypeScript-programma's om meerstaps-toolaanroepen te coördineren), Minimal (een shell-tool plus een bestandseditor — de modus waarop de V4-benchmarks draaiden) en Creation (voor het bouwen van aangepaste presets). Een Trajectory-weergave schrijft alles wat het model ziet naar een append-only-sessielogboek, dat bron per bron kan worden afgespeeld — DeepSeek's antwoord op de 'black box'-klacht over samengevatte agentgeschiedenis.
De belangrijkste kanttekening is die van DeepSeek zelf: dit is een preview voor ontwikkelaars, de repository bevat een melding over intern testen, en er worden brekende wijzigingen verwacht terwijl de kernplug-ins en basis-API's evolueren. Die waarschuwing bleek binnen enkele uren terecht — en dat vormt het kader voor de onderstaande veldrapporten.
Wat de eerste veldrapporten laten zien
Het rapport dat deze update bij elkaar bracht, is het verslag van één gebruiker en moet ook als zodanig worden gelezen: teortaxesTex beschreef op 14 augustus een DeepSeek Harness-sessie waarin het streamen van tokens geleidelijk tot een slakkengang vertraagde, de interface vijf van de negen todo's als voltooid toonde, en een herlaadbeurt onthulde dat alle negen daadwerkelijk waren voltooid — de interface had de status van ongeveer vijftig minuten eerder weergegeven. Het is één X-bericht, geen erkenning van de leverancier, en nog niet onafhankelijk gereproduceerd. Maar de symptoomklasse wordt bevestigd in de eigen openbare registratie van het project, en dat is wat het de moeite waard maakt om serieus te nemen.
De GitHub-discussie #483 in de officiële repository, ingediend op 13 augustus, documenteert precies deze faalfamilie. Sessie-inhoud wordt gepersisteerd met een begrensde write-behind batch — gebeurtenissen zitten in een in-memory wachtrij tot een timer van 200 milliseconden een duurzame schrijfactie activeert — en de interface toont alleen de vastgelegde status. Onder zware gelijktijdige belasting rekt het venster flink op; na een onreine afsluiting wordt de in-memory staart nooit weggeschreven en laadt de JSONL- of SQLite-backend alleen het vastgelegde prefix, waardoor gebruikersinvoer te laat of nooit verschijnt en eerder zichtbare geschiedenis verdwijnt. De discussie koppelt dit aan twee openstaande kwesties: #477 (gebruikerstekstinvoer langdurig vertraagd onder zware gelijktijdige belasting) en #479 (nieuwe gebruikersverzoeken verschijnen helemaal niet in de gespreksweergave). Het veldrapport met "5/9 on screen, 9/9 done" is die kloof tussen vastgelegd en werkelijk die zich in een live sessie voordoet.
De feedback over v0.1 is gepolariseerd op een manier die past. Sommige testers prijzen de plugin-architectuur als een 'zelf in elkaar gezette desktop-pc met universele poorten' vergeleken met gesloten concurrenten; anderen sommen ruwe randjes op — een gehardcodeerd multimodaal pad, en een gedocumenteerde bug in het agentbeleid waarbij de testomgeving het model dwingt om elke exitcode die niet nul is te onderzoeken, terwijl grep's exitcode 1 voor 'geen overeenkomst' succesvolle tests verandert in schijnbare mislukkingen, wat een zichzelf versterkende overvalidatielus oplevert (61 verzoeken tegen 32, en $0,17 tegen $0,05, voor dezelfde taak in de gerapporteerde vergelijking). Reviews vanaf dag één lezen als een developer preview met echte ambitie en echte problemen in de state-laag, niet als een afgewerkte uitdager van Claude Code.
Spatiotemporele composabiliteit is niet zomaar een punchline
De slotgrap van het veldrapport heeft een paper achter zich. DeepSeek Harness is gebouwd op Cordis, waarvan het ontwerp afkomstig is uit "A Programming Paradigm for Spatiotemporal Composability" — een formele studie van 88 pagina's, mede geschreven door de Peking Universiteit en DeepSeek, met als eerste auteur Yifan Shi (maker van het Koishi chatbotframework), samen met Wei Zhang en de Harness-teamleider Cui Tianyi. Het paper ontleedt dynamische compositie in twee orthogonale assen: temporele componerbaarheid, waarbij het verwijderen van een component netjes de neveneffecten ongedaan maakt alsof het nooit bestond, en ruimtelijke componerbaarheid, waarbij componenten afhankelijkheden declareren en de runtime deze reactief activeert en deactiveert naarmate providers verschijnen en verdwijnen.
De grap komt aan omdat een UI-renderstatus van vijftig minuten geleden een temporele compositiefout is in de meest letterlijke zin: de runtime bleef uitvoeren terwijl de zichtbare status erachter werd vastgelegd. De persistentiekloof die is gedocumenteerd in Discussion #483 — een write-behind batch die ver achter kan blijven bij de draaiende lus — is precies het soort zaken dat de garanties van het paper zouden moeten voorkomen. Of de statelaag van de harness die garanties in de praktijk uiteindelijk naleeft, is een van de werkelijk open vragen van deze release, en rapporten van de eerste dag zijn het eerste bewijs in beide richtingen.
De modellen eronder
Het harnas is het product; de modellen zijn de motor. Beide modellen die DeepSeek er vermoedelijk onder zal plaatsen, zijn al live, en beide zijn vandaag al aanroepbaar via OrcaRouter:
• DeepSeek V4 Flash 0731 — de opnieuw post-getrainde officiële release van DeepSeek's efficiënte MoE (284B totaal / 13B actief), 1M-token context, 384K maximale output, denkmodus standaard ingeschakeld, en native vloeiend in de OpenAI Responses API — het dialect dat Codex-stijl agents spreken. DeepSeek's eigen gepubliceerde agent-benchmarkcijfers voor de 0731-revisie: 82.7 op Terminal-Bench 2.1, 76.7 op Cybergym, 70.3 op Toolathlon Verified, 68.7 op DSBench-FullStack, 59.6 op DSBench-Hard. Die cijfers zijn door de leverancier gerapporteerd en niet onafhankelijk gereproduceerd, maar het zijn de cijfers waarmee DeepSeek ervoor koos om uit te pakken, en ze scoren zelfs hoger dan DeepSeek V4 Pro Preview op dezelfde set.
• DeepSeek V4 Pro — het vlaggenschip 1,6T-totaal / 49B-actief MoE, dezelfde context van 1M tokens, open gewichten (uitgebracht in april 2026), geprijsd op $0,44 / $0,87 per miljoen tokens.
Wat de prijs betreft, is het hele punt dat DeepSeek goedkoop is. DeepSeek V4 Flash 0731 draait op ongeveer $0,147 per miljoen invoertokens en $0,295 per miljoen uitvoertokens — leveranciersadviesprijzen, die OrcaRouter zonder opslag doorberekent. Wanneer de harness volwassen is, kun je hem op dezelfde modellen richten die je vandaag al kunt aanroepen, en de harness later in- of uitwisselen is een configuratiewijziging, geen migratie. Je hebt nu geen DeepSeek Harness nodig om een van beide modellen te draaien.

De prijzenoorlog waar het in verzeild raakt
Dit is geen marginale markt. Claude Code zou begin 2026 naar verluidt een jaarlijkse omzetrun-rate van meer dan $2,5 miljard hebben, en de markt voor agentische codering wordt geschat op een laag enkelcijferig miljardenbedrag. Een toetreder uit een Chinees lab dat de API-prijs onderbiedt — en waarvan de modellen al binnen Claude Code zelf draaien — is het soort zet dat de hele categorie herprijst.
Wat kosten betreft, is de keuze van de harness net zo belangrijk als het model. Een horizontale Composio-test met DeepSeek V4 Flash over acht harnesses wees uit dat de goedkoopste (de open-source "Pi"-harness) ongeveer $0,028 aan inferentiekosten per succesvolle taak kostte, tegenover ongeveer $0,195 voor Claude Code in dezelfde test — een bijna 7x verschil voor hetzelfde type werk. Tel daarbij de door DeepSeek gerapporteerde prefix-cachekorting op en de cache-hitpercentages van 99,93% die harnesses van derden ermee rapporteren, en de effectieve kosten per taak voor een door DeepSeek aangedreven agent worden al snel heel laag.
Het is ook de moeite waard om te onthouden wat vandaag al waar is: DeepSeek biedt een Anthropic-compatibel eindpunt aan (basis-URL https://api.deepseek.com/anthropic), en de eigen documentatie beschrijft hoe je Claude Code op DeepSeek V4-modellen richt. Het harnessproduct is DeepSeek's poging om die laag te bezitten in plaats van te huren — en DeepSeek heeft aangekondigd dat er een aanzienlijke prijsstijging voor de hele V4-lijn aankomt. Omdat OrcaRouter de lijstprijzen van providers doorgeeft zonder opslag, is het nieuwe tarief aan onze kant live op dezelfde dag dat het ingaat, zonder heronderhandeling.

Waarom het harnas het nieuwe strijdtoneel is
De verschuiving gaat van modelcapaciteit naar taakuitvoering. Een frontier-model is nu een basisvoorwaarde; wat bepaalt of een team daadwerkelijk een agent uitbrengt, is de omringende infrastructuur — en de data die deze genereert. Analisten die de zet van DeepSeek duiden, onder wie CITIC Securities, stellen dat een volwassen harness een moat is om twee elkaar versterkende redenen: hij sluit de commerciële lus van instappunt tot voltooide taak, en hij genereert taaktrajectdata voor de lange termijn die de modeltraining voeden. Community-harnesses zoals Pi of DeepSeek-TUI tonen de vraag aan, maar ze voeren die data niet terug naar het model. De eigen harness van DeepSeek zou dat wel doen — en de Trajectory-functie die in v0.1 wordt meegeleverd, is dat datapad zichtbaar gemaakt.
Daarom is een lezing van "benchmark gewoon het model" ook onvolledig. DeepSeek V4 Flash's agent-scores zijn sterk, maar de harness is waar DeepSeek verwacht het duurzame voordeel op te bouwen — wat de state-layer bugs in de rapporten van dag één meer dan cosmetisch maakt. Een harness waarvan de UI vijftig minuten achter de loop kan raken, is nog steeds een developer preview; het is nog niet de slotgracht.
Wat we nu kijken
• Of de statuslaag het bijhoudt. De write-behind-vertraging is gedocumenteerd, reproduceerbaar en wordt ingediend tegen de officiële repo; let op of het flush-pad snel wordt gerepareerd en of het ontwerp "UI toont alleen vastgelegde status" verandert wanneer een sessie mid-flight is.
• De native reproductietest. De hele reden dat de release ertoe deed, is dat de V4-agent scores van DeepSeek werden gegenereerd op "DeepSeek Harness minimal mode" — nu kan iedereen de preview installeren en die taken native uitvoeren. Als de cijfers 82.7 / 87.9 gereproduceerd worden, vormen de laatste twee releases één coherent systeem; zo niet, wordt de kloof tussen leverancier en benchmark meetbaar.
• Of het plugin-ecosysteem van de grond komt. Het #dsh-getagde plugin-oppervlak is echt, maar of derde partijen iets leveren dat de moeite waard is om te installeren, staat nog open.
De prijslijst. DeepSeek heeft niets gezegd over wat de harness zelf zal kosten, en de aangekondigde prijsverhoging van de V4-API is de andere grote onbekende.
• Of "spatiotemporele composeerbaarheid" een fixlijst of een slogan wordt. Het paper geeft DeepSeek een rigoureuze woordenschat voor precies het falen dat het veldrapport aan het licht bracht; of de v0.1-statelaag convergeert naar die garanties is de test.
De eerlijke conclusie: het sterkste pre-release signaal dat DeepSeek heeft gegeven, is nu een echt product, maar een developer preview met gedocumenteerde ruwe kantjes. Wat vandaag solide is, is het paar modellen eronder — DeepSeek V4 Flash 0731 en DeepSeek V4 Pro, beide live op OrcaRouter tegen de lijstprijs van de provider, zonder opslag, beide bruikbaar in agent-loops via één standaard API. Wanneer de harness volwassen wordt, is de manier om het te evalueren zonder een productiepad op een v0.1 te vergokken: routeer — zet de harness ervoor ter evaluatie, houd dezelfde modellen achter één endpoint en wijk uit naar een bewezen combinatie zodra het stokt. Die overstap is een wijziging van één regel code.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
