Tarjeta de título para 'DeepSeek Harness: La ballena negra emerge': titular 'DeepSeek Harness', subtítulo 'La ballena negra emerge — Lo que sabemos hasta ahora sobre el competidor de Claude Code de DeepSeek', eslogan 'Modelo + Harness = Agente', chips para 'DeepSeek V4 Flash' y 'DeepSeek V4 Pro', y pie de página 'Filtración / what-we-know-so-far — nada se ha lanzado todavía'. Logotipo de OrcaRouter superpuesto en la esquina inferior derecha.
Guides & Insights

DeepSeek Harness: La ballena negra emerge — Lo que sabemos hasta ahora sobre el competidor de Claude Code de DeepSeek

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

D​eepSeek Harness v0.1 ya está disponible, y el primer informe de campo que importa llegó menos de un día después. El 14 de agosto, la misma cuenta X que había puesto en marcha el reloj del lanzamiento — teortaxesTex — describió una sesión que parecía muerta cuando en realidad estaba terminando: el flujo de tokens se ralentizó "exponencialmente" hasta casi detenerse, la interfaz mostraba cinco de nueve tareas completadas, y al recargar la página se reveló que las nueve se habían completado. La interfaz había estado mostrando el estado de aproximadamente cincuenta minutos antes. "¿Es esto… lo que quieres decir con composabilidad espaciotemporal?" — una pulla justa, porque el marco sobre el que D​eepSeek construyó esto tiene literalmente una teoría sobre el tiempo. Esta publicación comenzó como una pieza de rastreo de filtraciones; el rastro se resolvió el 13 de agosto, cuando D​eepSeek publicó el harness como código abierto. Lo que sigue es lo que realmente se lanzó, y lo que el primer día de uso real muestra sobre la capa de agente que se está construyendo alrededor de DeepSeek V4 Flash 0731 y DeepSeek V4 Pro.

El marco honesto ha cambiado desde que se publicó este post por primera vez. Cuando se publicó, nada llamado "D​eepSeek Harness" había sido lanzado y la evidencia era un montón de migas de pan públicas: una cuenta certificada de WeChat, ofertas de empleo, una nota al pie de un benchmark, una convocatoria de pruebas internas. Eso ya no es cierto. En la noche del 13 de agosto, hora de Pekín, D​eepSeek publicó la v0.1 del harness como una vista previa para desarrolladores con licencia MIT en github.com/deepseek-ai/deepseek-harness, ejecutable con un solo comando npm, y el repositorio obtuvo más de 30,000 estrellas de GitHub en cuestión de horas. La filtración se convirtió en un producto. Lo que ahora no está verificado no es si el harness existe, sino cómo se comporta en el mundo real — y los primeros informes de campo son la nueva evidencia.

Modelo + Arnés = Agente: qué es realmente un "arnés"

La fórmula que D​eepSeek utiliza internamente es Modelo + Arnés = Agente. El modelo es el cerebro; el arnés es todo lo demás que hace que un agente funcione en la práctica: gestión de contexto y memoria, llamada a herramientas, planificación de tareas, lectura y escritura de archivos, ejecución en terminal, retroalimentación de la salida de errores al ciclo, y juzgar si una tarea realmente terminó.

El término fue popularizado por A​nthropic y se convirtió en el marco de la industria para explicar por qué los agentes de codificación son más que un buen LLM. Un modelo que obtiene buenos resultados en benchmarks puede aun así fallar en un bucle agéntico si la maquinaria circundante — cómo invoca herramientas, cómo recuerda lo que hizo hace diez minutos, cómo se recupera cuando falla un comando — es débil. D​eepSeek ha convertido esa maquinaria en su estrategia de producto explícita, y el equipo Harness es la unidad organizativa que lo lleva a cabo. Los modelos subyacentes ya estaban en producción: DeepSeek V4 Flash 0731 y DeepSeek V4 Pro ambos llevan puntajes de benchmark ajustados para agentes que D​eepSeek generó dentro de su propio harness, hasta el nombre "D​eepSeek Harness minimal mode".

El rastro de la filtración que terminó el 13 de agosto.

Esto nunca fue una filtración única; fue una pila de migas de pan públicas que se acumularon desde marzo y luego desembocaron en una fecha de lanzamiento. En orden aproximado:

Marzo de 2026 — Informes vinculan a Cui Tianyi (崔添翼), graduado en informática de la Universidad de Zhejiang y ex ingeniero de Jane Street durante nueve años, con el trabajo de agentes de D​eepSeek; la prensa lo identifica posteriormente como el líder del equipo Harness. Reportado, no confirmado por D​eepSeek en ese momento.

• 24 de abril de 2026 — DeepSeek V4 se presenta en vista previa, posicionado explícitamente para tareas de agente y optimizado para herramientas de agente como Claude Code.

• Mayo de 2026 — D​eepSeek publica dos puestos de Harness en Moka: un gerente de producto de Agent Harness y un ingeniero de investigación, ambos con sede en Beijing. El investigador de D​eepSeek, Chen Deli, escribe públicamente que el objetivo es, en resumen, evaluar Claude Code y construir un "D​eepSeek Code Harness".

• Junio de 2026 — La campaña de contratación continúa; el líder del equipo describe el departamento como falto de personal con "metas ambiciosas y una carga de trabajo pesada."

• 6–7 de julio de 2026 — La cuenta de WeChat «D​eepSeek Harness team» está registrada y certificada bajo la entidad de D​eepSeek en Beijing, con un logotipo de ballena negra. Nadie externo lo nota todavía.

• 31 de julio de 2026 — la API oficial de DeepSeek V4 Flash entra en beta pública, y la documentación de la API de D​eepSeek revela — por primera vez — que las tareas de CodeAgent en sus benchmarks públicos se ejecutaron en "D​eepSeek Harness minimal mode", con el calificador "próximamente".

• 1 de agosto de 2026 — El líder del equipo de Harness abre una convocatoria de pruebas internas dirigida a desarrolladores de proyectos de agent-harness de código abierto. La prensa tecnológica china informa de 769 solicitantes, 712 repositorios únicos y más de 1,2 millones de estrellas acumuladas en GitHub.

• 11 de agosto de 2026 — La cobertura de la cuenta se amplía; emerge la ballena negra.

• 13 de agosto de 2026 — v0.1 se lanza: con licencia MIT, abierto en GitHub, ejecutable con npx @deepseek-ai/dsh web. El sendero quedó resuelto.

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

Lo que realmente se incluyó en v0.1

La vista previa para desarrolladores es un runtime de agente de escritorio y CLI en el espacio de nombres de paquetes de Node, construido sobre el meta-framework Cordis con el principio de diseño declarado "todo es un plugin". Los modelos, herramientas, habilidades, sesiones, sandboxes, almacenamiento, el bucle del agente, la programación de tareas y la interfaz de usuario son todos plugins de Cordis reemplazables. Se incluyen cuatro ajustes preestablecidos: Standard (el conjunto completo de herramientas del agente de codificación), PTC (el modelo escribe programas TypeScript para coordinar llamadas a herramientas de múltiples pasos), Minimal (una herramienta de shell más un editor de archivos, el modo en el que se ejecutaron los benchmarks V4) y Creation (para crear ajustes preestablecidos personalizados). Una vista de Trayectoria escribe todo lo que el modelo ve en un registro de sesión de solo añadidura, reproducible fuente por fuente: la respuesta de D​eepSeek a la queja de "caja negra" sobre el historial resumido del agente.

La advertencia que importa es la del propio D​eepSeek: esto es una vista previa para desarrolladores, el repositorio lleva un aviso de pruebas internas, y se esperan cambios incompatibles mientras evolucionan los plugins centrales y las APIs base. Esa advertencia resultó estar justificada en cuestión de horas — y enmarca los informes de campo a continuación.

Lo que muestran los primeros informes de campo

El informe que dio forma a esta actualización es el relato de un único usuario y debe leerse como tal: teortaxesTex, el 14 de agosto, describió una sesión de D​eepSeek Harness en la que el streaming de tokens se ralentizaba progresivamente hasta casi detenerse, la interfaz mostraba cinco de nueve tareas completadas, y al recargar se reveló que las nueve ya estaban hechas — la interfaz había estado mostrando un estado de aproximadamente cincuenta minutos antes. Es un solo post en X, no un reconocimiento del proveedor, y aún no se ha reproducido de manera independiente. Pero la clase de síntoma está corroborada en el registro público del propio proyecto, que es lo que hace que valga la pena tomarlo en serio.

La discusión n.º 483 del repositorio oficial en GitHub, presentada el 13 de agosto, documenta exactamente esta familia de fallos. Los contenidos de la sesión se persisten con un lote de escritura diferida acotado: los eventos permanecen en una cola pendiente en memoria hasta que un temporizador de 200 milisegundos dispara una escritura duradera, y la interfaz solo representa el estado confirmado. Bajo una carga concurrente intensa, la ventana se estira considerablemente; tras un cierre no limpio, la cola en memoria nunca se vacía y el backend JSONL o SQLite solo recarga el prefijo confirmado, por lo que la entrada del usuario aparece tarde o nunca, y el historial previamente visible desaparece. La discusión relaciona esto con dos problemas abiertos: #477 (la entrada de texto del usuario se retrasa durante mucho tiempo bajo una carga concurrente intensa) y #479 (las nuevas solicitudes de usuario no aparecen en absoluto en la vista de conversación). El «5/9 en pantalla, 9/9 completado» del informe de campo es ese desfase entre lo confirmado y lo real manifestándose en una sesión en vivo.

La retroalimentación general sobre v0.1 está polarizada de una manera que encaja. Algunos probadores elogian la arquitectura de plugins como una "PC de escritorio autoensamblada con puertos universales" en comparación con rivales cerrados; otros catalogan asperezas: una ruta multimodal hardcodeada y un bug documentado en la política del agente donde el harness obliga al modelo a investigar cada código de salida distinto de cero, mientras que el código de salida 1 de grep para "sin coincidencias" convierte pruebas que pasan en fallos aparentes, impulsando un bucle de sobrevalidación que se refuerza a sí mismo (61 solicitudes frente a 32, y $0.17 frente a $0.05, en la misma tarea en la comparación reportada). Las reseñas del primer día se leen como una vista previa para desarrolladores con ambición real y problemas reales en la capa de estado, no como un retador terminado de Claude Code.

"La componibilidad espacio-temporal" no es solo un remate

El chiste final del informe de campo tiene un artículo detrás. D​eepSeek Harness está construido sobre Cordis, cuyo diseño proviene de "A Programming Paradigm for Spatiotemporal Composability" — un estudio formal de 88 páginas coescrito por la Universidad de Pekín y D​eepSeek, con Yifan Shi como primer autor (creador del framework de chatbot Koishi), junto con Wei Zhang y el líder del equipo de Harness, Cui Tianyi. El artículo descompone la composición dinámica en dos ejes ortogonales: la composición temporal, donde al eliminar un componente se revierten limpiamente sus efectos secundarios como si nunca hubiera existido, y la composición espacial, donde los componentes declaran dependencias y el runtime las activa y desactiva de forma reactiva a medida que los proveedores aparecen y desaparecen.

El chiste funciona porque un estado de renderizado de la interfaz de hace cincuenta minutos es un fallo de composición temporal en el sentido más literal: el runtime seguía ejecutándose mientras el estado visible se confirmaba por detrás. La brecha de persistencia documentada en la Discusión #483 — un lote de escritura diferida que puede quedarse muy rezagado respecto al bucle de ejecución — es precisamente el tipo de cosa que las garantías del artículo deberían prevenir. Que la capa de estado del harness termine cumpliendo esas garantías en la práctica es una de las preguntas genuinamente abiertas de esta versión, y los informes del primer día son la primera evidencia en uno u otro sentido.

Los modelos subyacentes

El arnés es el producto; los modelos son el motor. Ambos modelos que D​eepSeek presumiblemente pondrá bajo él ya están en vivo, y ambos se pueden invocar a través de OrcaRouter hoy:

• DeepSeek V4 Flash 0731 — la versión oficial relanzada con re-post-entrenamiento del eficiente MoE de D​eepSeek (284B en total / 13B activos), con contexto de 1M de tokens, salida máxima de 384K, modo de pensamiento activado por defecto y fluidez nativa en la API de O​penAI Responses — el dialecto que hablan los agentes de estilo Codex. Las cifras de benchmarks de agentes publicadas por el propio D​eepSeek para la revisión 0731: 82.7 en Terminal-Bench 2.1, 76.7 en Cybergym, 70.3 en Toolathlon Verified, 68.7 en DSBench-FullStack, 59.6 en DSBench-Hard. Esos números los reporta el proveedor y no han sido reproducidos de forma independiente, pero son las cifras con las que D​eepSeek quiso presentarse, y superan incluso a DeepSeek V4 Pro Preview en el mismo conjunto.

• DeepSeek V4 Pro — el MoE insignia de 1,6 T en total / 49 B activos, mismo contexto de 1 M de tokens, pesos abiertos (lanzado en abril de 2026), con un precio de 0,44 $ / 0,87 $ por millón de tokens.

En cuanto al precio, el punto es que D​eepSeek es barato. DeepSeek V4 Flash 0731 cuesta aproximadamente $0.147 por millón de tokens de entrada y $0.295 por millón de tokens de salida — precios de lista de proveedores, que OrcaRouter transmite sin margen. Cuando el arnés madure, podrás apuntarlo a los mismos modelos a los que ya puedes llamar hoy, y cambiar el arnés más adelante es un cambio de configuración, no una migración. No necesitas D​eepSeek Harness para ejecutar ninguno de los dos modelos ahora.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

La guerra de costos en la que se está adentrando

Este no es un mercado marginal. Según los informes, Claude Code tenía una tasa de ingresos anualizados superior a los 2.500 millones de dólares a principios de 2026, y el mercado de codificación agéntica se estima en miles de millones de un solo dígito. Un competidor de un laboratorio chino que rebaja el precio de la API —y cuyos modelos ya se ejecutan dentro del propio Claude Code— es el tipo de movimiento que repreciaría toda la categoría.

En cuanto al costo, la elección del harness importa tanto como el modelo. Una prueba horizontal de Composio que ejecuta DeepSeek V4 Flash en ocho harnesses encontró que el más barato (el harness de código abierto "Pi") costaba aproximadamente $0.028 de inferencia por tarea exitosa, frente a unos $0.195 para Claude Code en la misma prueba — una brecha de casi 7 veces en la misma clase de trabajo. Añade el descuento de caché de prefijo reportado por D​eepSeek y las tasas de acierto de caché del 99.93% que los harnesses de terceros reportan con él, y el costo efectivo por tarea para un agente impulsado por D​eepSeek se vuelve muy pequeño muy rápido.

También vale la pena recordar lo que ya es cierto hoy: D​eepSeek expone un endpoint compatible con A​nthropic (URL base: https://api.deepseek.com/anthropic), y su propia documentación explica cómo apuntar Claude Code a los modelos D​eepSeek V4. El producto de harness es D​eepSeek intentando adueñarse de esa capa en lugar de alquilarla — y D​eepSeek ha anunciado que se acerca un aumento sustancial de precios en toda la línea V4. Como OrcaRouter traspasa los precios de lista de los proveedores con margen cero, la nueva tarifa está activa en nuestro lado el mismo día en que se publica, sin renegociación.

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

Por qué el harness es el nuevo campo de batalla

El cambio es de la capacidad del modelo a la entrega de tareas. Un modelo frontera es ahora el precio de entrada; lo que decide si un equipo realmente lanza un agente es la maquinaria circundante — y los datos que produce. Los analistas que enmarcan el movimiento de D​eepSeek, entre ellos CITIC Securities, sostienen que un arnés maduro es un foso por dos razones que se refuerzan mutuamente: cierra el bucle comercial desde el punto de entrada hasta la tarea terminada, y genera datos de trayectoria de tareas de largo horizonte que alimentan el entrenamiento del modelo. Los arneses comunitarios como Pi o D​eepSeek-TUI demuestran demanda, pero no devuelven esos datos al modelo. El propio arnés de D​eepSeek lo haría — y la función Trajectory que se incluye en la v0.1 es esa vía de datos hecha visible.

Esa es también la razón por la que una lectura de "solo hacer benchmarks del modelo" es incompleta. Las puntuaciones de agente de DeepSeek V4 Flash son sólidas, pero el harness es donde D​eepSeek espera construir la ventaja duradera — lo que hace que los errores de la capa de estado en los informes del primer día sean más que cosméticos. Un harness cuya interfaz de usuario puede quedarse cincuenta minutos por detrás del bucle sigue siendo una vista previa para desarrolladores; aún no es el foso.

Lo que estamos viendo ahora

• Si la capa de estado se mantiene al día. El retraso de escritura diferida (write-behind) está documentado, es reproducible y se está reportando contra el repositorio oficial; observa si la ruta de vaciado (flush) se corrige rápidamente y si el diseño de «la UI solo muestra el estado confirmado» cambia cuando una sesión está en plena ejecución.

• La prueba de reproducción nativa. La razón principal por la que el lanzamiento importaba es que las puntuaciones del agente V4 de D​eepSeek se generaron en el "modo mínimo de D​eepSeek Harness" — ahora cualquiera puede instalar la vista previa y ejecutar esas tareas de forma nativa. Si las cifras 82.7 / 87.9 se reproducen, los dos últimos lanzamientos se leen como un sistema coherente; si no, la brecha entre el benchmark del proveedor y la realidad se vuelve medible.

• Si el ecosistema de plugins llega a despegar. La superficie de plugins etiquetada con #dsh es real, pero si terceros lanzan algo que valga la pena instalar sigue siendo una incógnita.

• La lista de precios. DeepSeek no ha dicho nada sobre cuánto costará el propio harness, y el anunciado aumento de precios de la API V4 es la otra gran incógnita.

• Si la "componibilidad espaciotemporal" se convierte en una lista de correcciones o en un eslogan. El artículo da a DeepSeek un vocabulario riguroso para exactamente el fallo que el informe de campo reveló; si la capa de estado v0.1 converge en esas garantías es la prueba.

La lectura honesta: la señal de prelanzamiento más fuerte que D​eepSeek ha dado ahora es un producto real, pero una vista previa para desarrolladores con asperezas documentadas. Lo que es sólido hoy es el par de modelos que lo respaldan — DeepSeek V4 Flash 0731 y DeepSeek V4 Pro, ambos disponibles en OrcaRouter al precio de lista del proveedor sin ningún margen, ambos utilizables en bucles de agente a través de una API estándar. Cuando el banco de pruebas madure, la forma de evaluarlo sin arriesgar una ruta de producción por una v0.1 es enrutar: poner el banco de pruebas al frente para la evaluación, mantener los mismos modelos detrás de un solo endpoint, y conmutar por error a una combinación probada en el momento en que se atasque. Ese cambio es una modificación de una sola línea.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario