
DeepSeek Harness: A Baleia Negra Emerge — O Que Sabemos Até Agora Sobre o Concorrente do Claude Code da DeepSeek
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
DeepSeek Harness v0.1 foi lançado, e o primeiro relatório de campo que realmente importa chegou menos de um dia depois. Em 14 de agosto, a mesma conta X que havia definido o relógio do lançamento — teortaxesTex — descreveu uma sessão que parecia morta enquanto, na verdade, estava terminando: o streaming de tokens desacelerou "exponencialmente" até quase parar, a interface mostrava cinco de nove tarefas concluídas, e um recarregamento da página revelou que todas as nove haviam sido concluídas. A interface estava mostrando um estado de aproximadamente cinquenta minutos antes. "É isso… o que você quer dizer com composabilidade espaço-temporal?" — uma provocação justa, porque o framework sobre o qual a DeepSeek construiu essa coisa literalmente tem uma teoria sobre o tempo. Este post começou como uma matéria sobre o rastro do vazamento; o rastro se encerrou em 13 de agosto, quando a DeepSeek abriu o código do harness. O que vem a seguir é o que foi efetivamente lançado e o que o primeiro dia de uso real mostra sobre a camada de agentes que está sendo construída em torno do DeepSeek V4 Flash 0731 e do DeepSeek V4 Pro.
O enquadramento honesto mudou desde que este post foi publicado pela primeira vez. Quando foi publicado, nada chamado "DeepSeek Harness" havia sido lançado, e as evidências eram uma pilha de migalhas públicas — uma conta certificada no WeChat, anúncios de emprego, uma nota de rodapé de benchmark, uma chamada de teste interno. Isso não é mais verdade. Na noite de 13 de agosto, horário de Pequim, a DeepSeek publicou a v0.1 do harness como uma prévia para desenvolvedores sob licença MIT em github.com/deepseek-ai/deepseek-harness, executável com um único comando npm, e o repositório atraiu mais de 30.000 estrelas no GitHub em poucas horas. O vazamento virou um produto. O que não está verificado agora não é se o harness existe, mas como ele se comporta no mundo real — e os primeiros relatos de campo são as novas evidências.
Modelo + Harness = Agente: o que um "harness" realmente é
A fórmula que a {{1}}DeepSeek{{/1}} usa internamente é {{2}}Modelo + Estrutura = Agente{{/2}}. O modelo é o {{3}}cérebro{{/3}}; a {{4}}estrutura{{/4}} é todo o resto que faz um agente funcionar na prática — {{5}}gerenciamento de contexto e memória, chamada de ferramentas, planejamento de tarefas, leitura e escrita de arquivos, execução de terminal, realimentação da saída de erros no loop e avaliação se uma tarefa realmente foi concluída{{/5}}.
O termo foi popularizado pela Anthropic e se tornou o enquadramento da indústria para explicar por que agentes de codificação são mais do que um bom LLM. Um modelo que pontua bem em benchmarks ainda pode falhar em um loop agêntico se a maquinaria ao redor — como ele invoca ferramentas, como lembra o que fez há dez minutos, como se recupera quando um comando falha — for fraca. A DeepSeek transformou essa maquinaria em sua estratégia explícita de produto, e o time Harness é a estrutura organizacional que faz isso. Os modelos subjacentes já estavam sendo lançados: DeepSeek V4 Flash 0731 e DeepSeek V4 Pro ambos carregam pontuações de benchmark ajustadas para agentes que a DeepSeek gerou dentro do seu próprio harness, até o nome "DeepSeek Harness minimal mode".
O rastro do vazamento que terminou em 13 de agosto
Isto nunca foi uma única fuga; foi uma pilha de pistas públicas que se acumularam desde março e depois se resolveram numa data de lançamento. Em ordem aproximada:
Março de 2026 — Relatos ligam Cui Tianyi (崔添翼), graduado em ciência da computação pela Universidade de Zhejiang e ex-engenheiro da Jane Street por nove anos, ao trabalho de agente da DeepSeek; a imprensa posteriormente o identifica como líder da equipe Harness. Relatado, não confirmado pela DeepSeek na época.
• 24 de abril de 2026 — DeepSeek V4 é pré-visualizado, explicitamente posicionado para tarefas de agente e ajustado para ferramentas de agente como Claude Code.
• Maio de 2026 — A DeepSeek publica duas vagas de Harness na Moka — um gerente de produto de Agent Harness e um engenheiro de pesquisa, ambos baseados em Pequim. O pesquisador da DeepSeek, Chen Deli, escreve publicamente que o objetivo é, em resumo, avaliar o Claude Code e construir um "DeepSeek Code Harness".
• Junho de 2026 — O esforço de contratação continua; o líder da equipe descreve o departamento como carente de pessoal, com "metas ambiciosas e uma carga de trabalho pesada."
• 6–7 de julho de 2026 — A conta do WeChat da "equipe DeepSeek Harness" é registrada e certificada sob a entidade de Pequim da DeepSeek, com um logotipo de baleia negra. Ninguém de fora percebe ainda.
• 31 de julho de 2026 — a API oficial do DeepSeek V4 Flash entra em beta público, e a documentação da API do DeepSeek revela — pela primeira vez — que as tarefas do CodeAgent em seus benchmarks públicos foram executadas no "modo mínimo do DeepSeek Harness", com o qualificador "em breve".
• 1º de agosto de 2026 — O líder da equipe Harness abre recrutamento para testes internos voltado a desenvolvedores de projetos de agent-harness de código aberto. A imprensa de tecnologia chinesa relata 769 candidatos, 712 repositórios únicos e mais de 1,2 milhão de estrelas acumuladas no GitHub.
• 11 de agosto de 2026 — A cobertura da conta ganha amplitude; a baleia negra vem à tona.
• 13 de agosto de 2026 — v0.1 entra no ar: licenciado sob MIT, aberto no GitHub, executável com npx @deepseek-ai/dsh web. A trilha foi resolvida.

O que v0.1 realmente lançou
A prévia para desenvolvedores é um runtime de agente para desktop e CLI no namespace de pacotes Node, construído sobre o meta-framework Cordis com o princípio de design declarado "tudo é um plugin". Modelos, ferramentas, habilidades, sessões, sandboxes, armazenamento, o loop do agente, agendamento e a interface do usuário são todos plugins Cordis substituíveis. Quatro predefinições são fornecidas: Standard (o conjunto completo de ferramentas de agente de codificação), PTC (o modelo escreve programas TypeScript para coordenar chamadas de ferramentas em várias etapas), Minimal (uma ferramenta de shell mais um editor de arquivos — o modo no qual os benchmarks V4 rodaram) e Creation (para construir predefinições personalizadas). Uma visão Trajectory grava tudo o que o modelo vê em um log de sessão somente de acréscimo, reproduzível fonte por fonte — a resposta da DeepSeek à reclamação de "caixa preta" sobre o histórico resumido do agente.
O aviso que importa é o do próprio DeepSeek: esta é uma prévia para desenvolvedores, o repositório traz um aviso de teste interno, e mudanças que quebram a compatibilidade são esperadas enquanto os plugins principais e as APIs base evoluem. Esse aviso se mostrou justificado em poucas horas — e ele enquadra os relatos de campo abaixo.
O que mostram os primeiros relatórios de campo
O relatório que deu origem a esta atualização é o relato de um único usuário e deve ser lido como tal: teortaxesTex, em 14 de agosto, descreveu uma sessão do DeepSeek Harness em que o streaming de tokens foi ficando cada vez mais lento até quase parar, a interface mostrava cinco de nove tarefas concluídas, e um recarregamento revelou que todas as nove já haviam sido concluídas — a interface estava renderizando o estado de cerca de cinquenta minutos antes. É uma publicação no X, não um reconhecimento do fornecedor, e ainda não foi reproduzida de forma independente. Mas a classe de sintomas é corroborada no registro público do próprio projeto, que é o que faz com que valha a pena levar a sério.
A Discussão #483 do repositório oficial no GitHub, registrada em 13 de agosto, documenta exatamente essa família de falhas. Os conteúdos da sessão são persistidos com um lote de escrita diferida limitado — os eventos ficam em uma fila pendente na memória até que um temporizador de 200 milissegundos dispare uma gravação durável — e a interface renderiza somente o estado confirmado. Sob carga concorrente pesada, a janela se estende consideravelmente; após um encerramento não limpo, a cauda na memória nunca é liberada e o backend JSONL ou SQLite recarrega apenas o prefixo confirmado, então a entrada do usuário aparece tarde ou nunca e o histórico anteriormente visível desaparece. A discussão relaciona isso a duas questões abertas: #477 (entrada de texto do usuário atrasada por muito tempo sob carga concorrente pesada) e #479 (novas solicitações de usuário não aparecendo na visualização da conversa). O relatório de campo "5/9 na tela, 9/9 concluídos" é essa lacuna entre o confirmado e o real aparecendo em uma sessão ativa.
O feedback mais amplo sobre o v0.1 é polarizado de uma forma que faz sentido. Alguns testadores elogiam a arquitetura de plugins como um “PC de mesa montado por conta própria com portas universais” diante de rivais fechados; outros catalogam arestas — um caminho multimodal fixo no código, e um bug documentado na política do agente em que o harness força o modelo a investigar todo código de saída diferente de zero, enquanto o código de saída 1 do grep para “sem correspondência” transforma testes que passam em falhas aparentes, gerando um loop de supervalidação auto-reforçado (61 solicitações contra 32, e US$ 0,17 contra US$ 0,05, na mesma tarefa na comparação relatada). As críticas de primeiro dia parecem de uma prévia para desenvolvedores com ambição real e problemas reais na camada de estado, não de um concorrente finalizado para o Claude Code.
Composabilidade espaço-temporal não é apenas uma piada
A piada de encerramento do relatório de campo tem um artigo por trás dela. O DeepSeek Harness é construído sobre o Cordis, cujo design deriva de "A Programming Paradigm for Spatiotemporal Composability" — um estudo formal de 88 páginas coautorado pela Universidade de Pequim e pela DeepSeek, tendo Yifan Shi (criador do framework de chatbot Koishi) como primeiro autor, ao lado de Wei Zhang e Cui Tianyi, líder da equipe do Harness. O artigo decompõe a composição dinâmica em dois eixos ortogonais: composabilidade temporal, em que remover um componente desfaz de forma limpa seus efeitos colaterais, como se ele nunca tivesse existido; e composabilidade espacial, em que componentes declaram dependências e o runtime as ativa e desativa reativamente conforme provedores aparecem e desaparecem.
A piada funciona porque um estado de renderização de UI de cinquenta minutos atrás é uma falha de composição temporal no sentido mais literal: o runtime continuou executando enquanto o estado visível foi commitado por trás dele. A lacuna de persistência documentada na Discussion #483 — um lote write-behind que pode ficar muito atrás do loop de execução — é exatamente o tipo de coisa que as garantias do artigo deveriam prevenir. Saber se a camada de estado do harness acaba honrando essas garantias na prática é uma das questões genuinamente em aberto desta versão, e os relatos de primeiro dia são a primeira evidência em qualquer direção.
Os modelos subjacentes
O harness é o produto; os modelos são o motor. Ambos os modelos que a DeepSeek presumivelmente colocará sob ele já estão ativos, e ambos podem ser chamados através do OrcaRouter hoje:
• DeepSeek V4 Flash 0731 — a versão oficial pós-retreinamento do eficiente MoE da DeepSeek (284B total / 13B ativos), contexto de 1M de tokens, saída máxima de 384K, modo de pensamento ativado por padrão e nativamente fluente na API Responses da OpenAI — o dialeto que os agentes estilo Codex falam. Os números publicados pela própria DeepSeek em benchmarks de agentes para a revisão 0731: 82.7 no Terminal-Bench 2.1, 76.7 no Cybergym, 70.3 no Toolathlon Verified, 68.7 no DSBench-FullStack, 59.6 no DSBench-Hard. Esses números são relatados pelo fornecedor e não reproduzidos, mas são aqueles com os quais a DeepSeek escolheu liderar, e superam até o DeepSeek V4 Pro Preview no mesmo conjunto.
• DeepSeek V4 Pro — o carro-chefe MoE com 1,6T no total / 49B ativos, mesmo contexto de 1M de tokens, pesos abertos (lançado em abril de 2026), com preço de US$ 0,44 / US$ 0,87 por milhão de tokens.
Em relação ao preço, a questão central é que o DeepSeek é barato. O DeepSeek V4 Flash 0731 custa cerca de $0.147 por milhão de tokens de entrada e $0.295 por milhão de tokens de saída — preços de tabela do fornecedor, que o OrcaRouter repassa sem nenhum acréscimo. Quando o harness amadurecer, você poderá apontá-lo para os mesmos modelos que já pode chamar hoje, e trocar o harness depois é uma mudança de configuração, não uma migração. Você não precisa do DeepSeek Harness para executar nenhum dos modelos agora.

A guerra de custos em que está entrando
Este não é um mercado marginal. Claude Code estava, segundo relatos, com um ritmo de receita anualizada superior a US$ 2,5 bilhões no início de 2026, e o mercado de codificação por agentes está sendo dimensionado na casa dos bilhões de um dígito. Um entrante de laboratório chinês que subcotiza o preço da API — e cujos modelos já rodam dentro da própria Claude Code — é o tipo de movimento que repreifica toda a categoria.
Em termos de custo, a escolha do harness importa tanto quanto a do modelo. Um teste horizontal da Composio rodando DeepSeek V4 Flash em oito harnesses constatou que o mais barato (o harness open-source "Pi") sai por cerca de US$ 0,028 de inferência por tarefa bem-sucedida, contra cerca de US$ 0,195 para o Claude Code no mesmo teste — uma diferença de quase 7x na mesma classe de trabalho. Some-se a isso o desconto de prefix-cache divulgado pela DeepSeek e as taxas de cache-hit de 99,93% que harnesses de terceiros reportam com ela, e o custo efetivo por tarefa de um agente alimentado pela DeepSeek fica muito pequeno muito rapidamente.
Vale também lembrar o que já é verdade hoje: a DeepSeek expõe um endpoint compatível com a Anthropic (URL base https://api.deepseek.com/anthropic), e a própria documentação dela mostra como apontar o Claude Code para os modelos DeepSeek V4. O produto harness é a DeepSeek tentando ser dona dessa camada em vez de alugá-la — e a DeepSeek anunciou que um aumento substancial de preço em toda a linha V4 está por vir. Como o OrcaRouter repassa os preços de tabela dos provedores com markup zero, a nova tarifa entra no ar no nosso lado no mesmo dia em que é publicada, sem renegociação.

Por que o arnês é o novo campo de batalha
A mudança é da capacidade do modelo para a entrega de tarefas. Um modelo de fronteira é agora o mínimo necessário; o que decide se uma equipe realmente entrega um agente é a maquinaria ao redor — e os dados que ela produz. Analistas que enquadram o movimento da DeepSeek, entre eles a CITIC Securities, argumentam que um harness maduro é uma vantagem competitiva por duas razões que se reforçam: ele fecha o ciclo comercial do ponto de entrada até a tarefa concluída e gera dados de trajetória de tarefas de longo horizonte que alimentam o treinamento do modelo. Harnesses da comunidade como Pi ou DeepSeek-TUI comprovam a demanda, mas não devolvem esses dados ao modelo. O próprio harness da DeepSeek devolveria — e o recurso Trajectory incluído na v0.1 é esse caminho de dados tornado visível.
É também por isso que uma leitura do tipo "apenas faça benchmark do modelo" é incompleta. As pontuações de agente do DeepSeek V4 Flash são fortes, mas é no harness que a DeepSeek espera construir a vantagem duradoura — o que torna os bugs na camada de estado nos relatórios do primeiro dia mais do que cosméticos. Um harness cuja interface pode atrasar cinquenta minutos em relação ao loop ainda é uma prévia para desenvolvedores; ainda não é o fosso.
O que estamos assistindo agora
• Se a camada de estado acompanha. O atraso de write-behind está documentado, é reproduzível e está sendo reportado ao repositório oficial; observe se o caminho de flush é corrigido rapidamente e se o design "UI mostra apenas estado confirmado" muda quando uma sessão está em andamento.
• O teste de reprodução nativa. Toda a razão pela qual o lançamento foi importante é que as pontuações do agente V4 da DeepSeek foram geradas no "DeepSeek Harness minimal mode" — agora qualquer pessoa pode instalar a pré-visualização e executar essas tarefas nativamente. Se os números 82.7 / 87.9 se reproduzirem, os dois últimos lançamentos são lidos como um sistema coerente; se não se reproduzirem, a lacuna entre o benchmark do fornecedor e o real torna-se mensurável.
• Se o ecossistema de plugins ganha tração. A superfície de plugins marcada com #dsh é real, mas se terceiros lançarão algo que valha a pena instalar ainda está em aberto.
• A lista de preços. DeepSeek não disse nada sobre quanto custará a própria estrutura, e o anunciado aumento de preço da API V4 é a outra grande incógnita.
• Se "componibilidade espaço-temporal" se torna uma lista de correções ou um slogan. O artigo dá à DeepSeek um vocabulário rigoroso para exatamente a falha que o relatório de campo trouxe à tona; se a camada de estado v0.1 converge para essas garantias é o teste.
A leitura honesta: o sinal de pré-lançamento mais forte da DeepSeek agora é um produto real, mas uma prévia para desenvolvedores com arestas documentadas. O que é sólido hoje é o par de modelos por trás dele — DeepSeek V4 Flash 0731 e DeepSeek V4 Pro, ambos ativos no OrcaRouter pelo preço de tabela do provedor com zero margem, ambos utilizáveis em loops de agente por meio de uma única API padrão. Quando o harness amadurecer, a forma de avaliá-lo sem apostar um caminho de produção em um v0.1 é rotear: colocar o harness na frente para avaliação, manter os mesmos modelos atrás de um endpoint e fazer failover para uma combinação comprovada no momento em que ele travar. Essa troca é uma mudança de uma linha.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
