Cartela de título para 'DeepSeek Harness: A Baleia Negra Emerge': manchete 'DeepSeek Harness', subtítulo 'A Baleia Negra Emerge — O que sabemos até agora sobre o concorrente do Claude Code da DeepSeek', tagline 'Modelo + Harness = Agente', chips para 'DeepSeek V4 Flash' e 'DeepSeek V4 Pro', e rodapé 'Vazamento / o-que-sabemos-até-agora — nada foi lançado ainda'. Logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

DeepSeek Harness: A Baleia Negra Emerge — O Que Sabemos Até Agora Sobre o Concorrente do Claude Code da DeepSeek

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

D​eepSeek Harness v0.1 foi lançado, e o primeiro relatório de campo que realmente importa chegou menos de um dia depois. Em 14 de agosto, a mesma conta X que havia definido o relógio do lançamento — teortaxesTex — descreveu uma sessão que parecia morta enquanto, na verdade, estava terminando: o streaming de tokens desacelerou "exponencialmente" até quase parar, a interface mostrava cinco de nove tarefas concluídas, e um recarregamento da página revelou que todas as nove haviam sido concluídas. A interface estava mostrando um estado de aproximadamente cinquenta minutos antes. "É isso… o que você quer dizer com composabilidade espaço-temporal?" — uma provocação justa, porque o framework sobre o qual a D​eepSeek construiu essa coisa literalmente tem uma teoria sobre o tempo. Este post começou como uma matéria sobre o rastro do vazamento; o rastro se encerrou em 13 de agosto, quando a D​eepSeek abriu o código do harness. O que vem a seguir é o que foi efetivamente lançado e o que o primeiro dia de uso real mostra sobre a camada de agentes que está sendo construída em torno do DeepSeek V4 Flash 0731 e do DeepSeek V4 Pro.

O enquadramento honesto mudou desde que este post foi publicado pela primeira vez. Quando foi publicado, nada chamado "D​eepSeek Harness" havia sido lançado, e as evidências eram uma pilha de migalhas públicas — uma conta certificada no WeChat, anúncios de emprego, uma nota de rodapé de benchmark, uma chamada de teste interno. Isso não é mais verdade. Na noite de 13 de agosto, horário de Pequim, a D​eepSeek publicou a v0.1 do harness como uma prévia para desenvolvedores sob licença MIT em github.com/deepseek-ai/deepseek-harness, executável com um único comando npm, e o repositório atraiu mais de 30.000 estrelas no GitHub em poucas horas. O vazamento virou um produto. O que não está verificado agora não é se o harness existe, mas como ele se comporta no mundo real — e os primeiros relatos de campo são as novas evidências.

Modelo + Harness = Agente: o que um "harness" realmente é

A fórmula que a {{1}}D​eepSeek{{/1}} usa internamente é {{2}}Modelo + Estrutura = Agente{{/2}}. O modelo é o {{3}}cérebro{{/3}}; a {{4}}estrutura{{/4}} é todo o resto que faz um agente funcionar na prática — {{5}}gerenciamento de contexto e memória, chamada de ferramentas, planejamento de tarefas, leitura e escrita de arquivos, execução de terminal, realimentação da saída de erros no loop e avaliação se uma tarefa realmente foi concluída{{/5}}.

O termo foi popularizado pela A​nthropic e se tornou o enquadramento da indústria para explicar por que agentes de codificação são mais do que um bom LLM. Um modelo que pontua bem em benchmarks ainda pode falhar em um loop agêntico se a maquinaria ao redor — como ele invoca ferramentas, como lembra o que fez há dez minutos, como se recupera quando um comando falha — for fraca. A D​eepSeek transformou essa maquinaria em sua estratégia explícita de produto, e o time Harness é a estrutura organizacional que faz isso. Os modelos subjacentes já estavam sendo lançados: DeepSeek V4 Flash 0731 e DeepSeek V4 Pro ambos carregam pontuações de benchmark ajustadas para agentes que a D​eepSeek gerou dentro do seu próprio harness, até o nome "D​eepSeek Harness minimal mode".

O rastro do vazamento que terminou em 13 de agosto

Isto nunca foi uma única fuga; foi uma pilha de pistas públicas que se acumularam desde março e depois se resolveram numa data de lançamento. Em ordem aproximada:

Março de 2026 — Relatos ligam Cui Tianyi (崔添翼), graduado em ciência da computação pela Universidade de Zhejiang e ex-engenheiro da Jane Street por nove anos, ao trabalho de agente da D​eepSeek; a imprensa posteriormente o identifica como líder da equipe Harness. Relatado, não confirmado pela D​eepSeek na época.

• 24 de abril de 2026 — DeepSeek V4 é pré-visualizado, explicitamente posicionado para tarefas de agente e ajustado para ferramentas de agente como Claude Code.

• Maio de 2026 — A D​eepSeek publica duas vagas de Harness na Moka — um gerente de produto de Agent Harness e um engenheiro de pesquisa, ambos baseados em Pequim. O pesquisador da D​eepSeek, Chen Deli, escreve publicamente que o objetivo é, em resumo, avaliar o Claude Code e construir um "D​eepSeek Code Harness".

• Junho de 2026 — O esforço de contratação continua; o líder da equipe descreve o departamento como carente de pessoal, com "metas ambiciosas e uma carga de trabalho pesada."

• 6–7 de julho de 2026 — A conta do WeChat da "equipe DeepSeek Harness" é registrada e certificada sob a entidade de Pequim da DeepSeek, com um logotipo de baleia negra. Ninguém de fora percebe ainda.

• 31 de julho de 2026 — a API oficial do DeepSeek V4 Flash entra em beta público, e a documentação da API do D​eepSeek revela — pela primeira vez — que as tarefas do CodeAgent em seus benchmarks públicos foram executadas no "modo mínimo do D​eepSeek Harness", com o qualificador "em breve".

• 1º de agosto de 2026 — O líder da equipe Harness abre recrutamento para testes internos voltado a desenvolvedores de projetos de agent-harness de código aberto. A imprensa de tecnologia chinesa relata 769 candidatos, 712 repositórios únicos e mais de 1,2 milhão de estrelas acumuladas no GitHub.

• 11 de agosto de 2026 — A cobertura da conta ganha amplitude; a baleia negra vem à tona.

• 13 de agosto de 2026 — v0.1 entra no ar: licenciado sob MIT, aberto no GitHub, executável com npx @deepseek-ai/dsh web. A trilha foi resolvida.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

O que v0.1 realmente lançou

A prévia para desenvolvedores é um runtime de agente para desktop e CLI no namespace de pacotes Node, construído sobre o meta-framework Cordis com o princípio de design declarado "tudo é um plugin". Modelos, ferramentas, habilidades, sessões, sandboxes, armazenamento, o loop do agente, agendamento e a interface do usuário são todos plugins Cordis substituíveis. Quatro predefinições são fornecidas: Standard (o conjunto completo de ferramentas de agente de codificação), PTC (o modelo escreve programas TypeScript para coordenar chamadas de ferramentas em várias etapas), Minimal (uma ferramenta de shell mais um editor de arquivos — o modo no qual os benchmarks V4 rodaram) e Creation (para construir predefinições personalizadas). Uma visão Trajectory grava tudo o que o modelo vê em um log de sessão somente de acréscimo, reproduzível fonte por fonte — a resposta da D​eepSeek à reclamação de "caixa preta" sobre o histórico resumido do agente.

O aviso que importa é o do próprio D​eepSeek: esta é uma prévia para desenvolvedores, o repositório traz um aviso de teste interno, e mudanças que quebram a compatibilidade são esperadas enquanto os plugins principais e as APIs base evoluem. Esse aviso se mostrou justificado em poucas horas — e ele enquadra os relatos de campo abaixo.

O que mostram os primeiros relatórios de campo

O relatório que deu origem a esta atualização é o relato de um único usuário e deve ser lido como tal: teortaxesTex, em 14 de agosto, descreveu uma sessão do D​eepSeek Harness em que o streaming de tokens foi ficando cada vez mais lento até quase parar, a interface mostrava cinco de nove tarefas concluídas, e um recarregamento revelou que todas as nove já haviam sido concluídas — a interface estava renderizando o estado de cerca de cinquenta minutos antes. É uma publicação no X, não um reconhecimento do fornecedor, e ainda não foi reproduzida de forma independente. Mas a classe de sintomas é corroborada no registro público do próprio projeto, que é o que faz com que valha a pena levar a sério.

A Discussão #483 do repositório oficial no GitHub, registrada em 13 de agosto, documenta exatamente essa família de falhas. Os conteúdos da sessão são persistidos com um lote de escrita diferida limitado — os eventos ficam em uma fila pendente na memória até que um temporizador de 200 milissegundos dispare uma gravação durável — e a interface renderiza somente o estado confirmado. Sob carga concorrente pesada, a janela se estende consideravelmente; após um encerramento não limpo, a cauda na memória nunca é liberada e o backend JSONL ou SQLite recarrega apenas o prefixo confirmado, então a entrada do usuário aparece tarde ou nunca e o histórico anteriormente visível desaparece. A discussão relaciona isso a duas questões abertas: #477 (entrada de texto do usuário atrasada por muito tempo sob carga concorrente pesada) e #479 (novas solicitações de usuário não aparecendo na visualização da conversa). O relatório de campo "5/9 na tela, 9/9 concluídos" é essa lacuna entre o confirmado e o real aparecendo em uma sessão ativa.

O feedback mais amplo sobre o v0.1 é polarizado de uma forma que faz sentido. Alguns testadores elogiam a arquitetura de plugins como um “PC de mesa montado por conta própria com portas universais” diante de rivais fechados; outros catalogam arestas — um caminho multimodal fixo no código, e um bug documentado na política do agente em que o harness força o modelo a investigar todo código de saída diferente de zero, enquanto o código de saída 1 do grep para “sem correspondência” transforma testes que passam em falhas aparentes, gerando um loop de supervalidação auto-reforçado (61 solicitações contra 32, e US$ 0,17 contra US$ 0,05, na mesma tarefa na comparação relatada). As críticas de primeiro dia parecem de uma prévia para desenvolvedores com ambição real e problemas reais na camada de estado, não de um concorrente finalizado para o Claude Code.

Composabilidade espaço-temporal não é apenas uma piada

A piada de encerramento do relatório de campo tem um artigo por trás dela. O DeepSeek Harness é construído sobre o Cordis, cujo design deriva de "A Programming Paradigm for Spatiotemporal Composability" — um estudo formal de 88 páginas coautorado pela Universidade de Pequim e pela DeepSeek, tendo Yifan Shi (criador do framework de chatbot Koishi) como primeiro autor, ao lado de Wei Zhang e Cui Tianyi, líder da equipe do Harness. O artigo decompõe a composição dinâmica em dois eixos ortogonais: composabilidade temporal, em que remover um componente desfaz de forma limpa seus efeitos colaterais, como se ele nunca tivesse existido; e composabilidade espacial, em que componentes declaram dependências e o runtime as ativa e desativa reativamente conforme provedores aparecem e desaparecem.

A piada funciona porque um estado de renderização de UI de cinquenta minutos atrás é uma falha de composição temporal no sentido mais literal: o runtime continuou executando enquanto o estado visível foi commitado por trás dele. A lacuna de persistência documentada na Discussion #483 — um lote write-behind que pode ficar muito atrás do loop de execução — é exatamente o tipo de coisa que as garantias do artigo deveriam prevenir. Saber se a camada de estado do harness acaba honrando essas garantias na prática é uma das questões genuinamente em aberto desta versão, e os relatos de primeiro dia são a primeira evidência em qualquer direção.

Os modelos subjacentes

O harness é o produto; os modelos são o motor. Ambos os modelos que a D​eepSeek presumivelmente colocará sob ele já estão ativos, e ambos podem ser chamados através do OrcaRouter hoje:

• DeepSeek V4 Flash 0731 — a versão oficial pós-retreinamento do eficiente MoE da D​eepSeek (284B total / 13B ativos), contexto de 1M de tokens, saída máxima de 384K, modo de pensamento ativado por padrão e nativamente fluente na API Responses da O​penAI — o dialeto que os agentes estilo Codex falam. Os números publicados pela própria D​eepSeek em benchmarks de agentes para a revisão 0731: 82.7 no Terminal-Bench 2.1, 76.7 no Cybergym, 70.3 no Toolathlon Verified, 68.7 no DSBench-FullStack, 59.6 no DSBench-Hard. Esses números são relatados pelo fornecedor e não reproduzidos, mas são aqueles com os quais a D​eepSeek escolheu liderar, e superam até o DeepSeek V4 Pro Preview no mesmo conjunto.

• DeepSeek V4 Pro — o carro-chefe MoE com 1,6T no total / 49B ativos, mesmo contexto de 1M de tokens, pesos abertos (lançado em abril de 2026), com preço de US$ 0,44 / US$ 0,87 por milhão de tokens.

Em relação ao preço, a questão central é que o D​eepSeek é barato. O DeepSeek V4 Flash 0731 custa cerca de $0.147 por milhão de tokens de entrada e $0.295 por milhão de tokens de saída — preços de tabela do fornecedor, que o OrcaRouter repassa sem nenhum acréscimo. Quando o harness amadurecer, você poderá apontá-lo para os mesmos modelos que já pode chamar hoje, e trocar o harness depois é uma mudança de configuração, não uma migração. Você não precisa do D​eepSeek Harness para executar nenhum dos modelos agora.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

A guerra de custos em que está entrando

Este não é um mercado marginal. Claude Code estava, segundo relatos, com um ritmo de receita anualizada superior a US$ 2,5 bilhões no início de 2026, e o mercado de codificação por agentes está sendo dimensionado na casa dos bilhões de um dígito. Um entrante de laboratório chinês que subcotiza o preço da API — e cujos modelos já rodam dentro da própria Claude Code — é o tipo de movimento que repreifica toda a categoria.

Em termos de custo, a escolha do harness importa tanto quanto a do modelo. Um teste horizontal da Composio rodando DeepSeek V4 Flash em oito harnesses constatou que o mais barato (o harness open-source "Pi") sai por cerca de US$ 0,028 de inferência por tarefa bem-sucedida, contra cerca de US$ 0,195 para o Claude Code no mesmo teste — uma diferença de quase 7x na mesma classe de trabalho. Some-se a isso o desconto de prefix-cache divulgado pela D​eepSeek e as taxas de cache-hit de 99,93% que harnesses de terceiros reportam com ela, e o custo efetivo por tarefa de um agente alimentado pela D​eepSeek fica muito pequeno muito rapidamente.

Vale também lembrar o que já é verdade hoje: a D​eepSeek expõe um endpoint compatível com a A​nthropic (URL base https://api.deepseek.com/anthropic), e a própria documentação dela mostra como apontar o Claude Code para os modelos D​eepSeek V4. O produto harness é a D​eepSeek tentando ser dona dessa camada em vez de alugá-la — e a D​eepSeek anunciou que um aumento substancial de preço em toda a linha V4 está por vir. Como o OrcaRouter repassa os preços de tabela dos provedores com markup zero, a nova tarifa entra no ar no nosso lado no mesmo dia em que é publicada, sem renegociação.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Por que o arnês é o novo campo de batalha

A mudança é da capacidade do modelo para a entrega de tarefas. Um modelo de fronteira é agora o mínimo necessário; o que decide se uma equipe realmente entrega um agente é a maquinaria ao redor — e os dados que ela produz. Analistas que enquadram o movimento da D​eepSeek, entre eles a CITIC Securities, argumentam que um harness maduro é uma vantagem competitiva por duas razões que se reforçam: ele fecha o ciclo comercial do ponto de entrada até a tarefa concluída e gera dados de trajetória de tarefas de longo horizonte que alimentam o treinamento do modelo. Harnesses da comunidade como Pi ou D​eepSeek-TUI comprovam a demanda, mas não devolvem esses dados ao modelo. O próprio harness da D​eepSeek devolveria — e o recurso Trajectory incluído na v0.1 é esse caminho de dados tornado visível.

É também por isso que uma leitura do tipo "apenas faça benchmark do modelo" é incompleta. As pontuações de agente do DeepSeek V4 Flash são fortes, mas é no harness que a DeepSeek espera construir a vantagem duradoura — o que torna os bugs na camada de estado nos relatórios do primeiro dia mais do que cosméticos. Um harness cuja interface pode atrasar cinquenta minutos em relação ao loop ainda é uma prévia para desenvolvedores; ainda não é o fosso.

O que estamos assistindo agora

• Se a camada de estado acompanha. O atraso de write-behind está documentado, é reproduzível e está sendo reportado ao repositório oficial; observe se o caminho de flush é corrigido rapidamente e se o design "UI mostra apenas estado confirmado" muda quando uma sessão está em andamento.

• O teste de reprodução nativa. Toda a razão pela qual o lançamento foi importante é que as pontuações do agente V4 da D​eepSeek foram geradas no "D​eepSeek Harness minimal mode" — agora qualquer pessoa pode instalar a pré-visualização e executar essas tarefas nativamente. Se os números 82.7 / 87.9 se reproduzirem, os dois últimos lançamentos são lidos como um sistema coerente; se não se reproduzirem, a lacuna entre o benchmark do fornecedor e o real torna-se mensurável.

• Se o ecossistema de plugins ganha tração. A superfície de plugins marcada com #dsh é real, mas se terceiros lançarão algo que valha a pena instalar ainda está em aberto.

• A lista de preços. D​eepSeek não disse nada sobre quanto custará a própria estrutura, e o anunciado aumento de preço da API V4 é a outra grande incógnita.

• Se "componibilidade espaço-temporal" se torna uma lista de correções ou um slogan. O artigo dá à D​eepSeek um vocabulário rigoroso para exatamente a falha que o relatório de campo trouxe à tona; se a camada de estado v0.1 converge para essas garantias é o teste.

A leitura honesta: o sinal de pré-lançamento mais forte da D​eepSeek agora é um produto real, mas uma prévia para desenvolvedores com arestas documentadas. O que é sólido hoje é o par de modelos por trás dele — DeepSeek V4 Flash 0731 e DeepSeek V4 Pro, ambos ativos no OrcaRouter pelo preço de tabela do provedor com zero margem, ambos utilizáveis em loops de agente por meio de uma única API padrão. Quando o harness amadurecer, a forma de avaliá-lo sem apostar um caminho de produção em um v0.1 é rotear: colocar o harness na frente para avaliação, manter os mesmos modelos atrás de um endpoint e fazer failover para uma combinação comprovada no momento em que ele travar. Essa troca é uma mudança de uma linha.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente