
dots-note-3.0: El modelo IMO 42/42 filtrado por un PR de vLLM ahora es de código abierto
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El 14 de agosto de 2026, dots-note-3.0 dejó de ser una filtración. El laboratorio Dots Model Lab de Xiaohongshu publicó como código abierto el primer modelo público de su familia dots3 como dots3-note preview — 280 mil millones de parámetros (16 mil millones activos), una ventana de contexto de 512K, con licencia Apache-2.0 — ocho días después de que una pull request de vLLM filtrara la arquitectura del modelo antes del lanzamiento. Los pesos están en Hugging Face, el código en GitHub, y el checkpoint que obtuvo oficialmente 42/42 en la Olimpiada Internacional de Matemáticas de 2026 es, por primera vez, ejecutable por cualquiera.
Ese lanzamiento responde a todas las preguntas abiertas que dejó pendientes el artículo sobre la filtración del 6 de agosto de este blog — tamaño, longitud de contexto, licencia, una ruta en Hugging Face, una fecha de lanzamiento — y convierte una historia de "lo que sabemos hasta ahora" en una que se puede verificar. Lo que sigue es la actualización: qué se publicó, qué confirma la configuración liberada sobre la arquitectura que el PR reveló por primera vez, qué es ahora verificable de forma independiente y qué sigue siendo una afirmación del propio proveedor.
De un borrador de PR a un checkpoint público
La filtración, en resumen: el 6 de agosto de 2026, un colaborador que se hace llamar KurodaKanbei — un autodenominado estudiante de doctorado de la ETH Zúrich, no un empleado de Xiaohongshu — abrió el pull request n.º 51255 de vllm-project/vllm añadiendo soporte para un modelo de lenguaje "Dots3 NOTE". El indicador de borrador se retiró el 7 de agosto a las 13:55 UTC, y las notas de validación del propio PR lo delataban: el autor había ejecutado un servicio DP8/EP8 de 8 GPU "con un checkpoint FP8 de Dots3 NOTE". No puedes validar un checkpoint FP8 que no tienes: quien escribió ese PR tenía el modelo real. Modificaba 14 archivos, incluido un nuevo módulo vllm/models/dots3_note, y llevaba las etiquetas new-model y verified.
Cada una de las cuatro señales que enumeramos el 8 de agosto se ha disparado ya, excepto la que más importa. El repositorio de Hugging Face apareció — dots-studio/dots3-note-prev, Apache-2.0. El anuncio oficial llegó — el lanzamiento de código abierto en sí, hoy. La pila de inferencia dejó de ser un borrador: el soporte de vLLM es nativo en main, y transformers y SGLang ambos incluyen soporte para dots3-note. La cuarta señal, la verificación independiente del resultado matemático 42/42, es la que aún queda pendiente — y ahora es posible de una manera que nunca antes lo fue, porque los pesos son públicos.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Lo que realmente se envió
La tarjeta de modelo publicada convierte las inferencias del PR en una hoja de especificaciones — y los números provienen de la configuración del propio checkpoint, no de un resumen de terceros. dots3-note preview es un modelo de mezcla de expertos:
• 280B total / 16B parámetros activos — 256 expertos enrutados más un experto compartido, enrutamiento top-8, en 1 capa densa + 45 capas MoE con un tamaño oculto de 5,120.
• Ventana de contexto de 512K tokens, vocabulario de 152K, precisión BF16 y FP8.
• Un módulo de predicción multi-token (MTP) — una capa compartida de 1.13B parámetros que predice hasta tres tokens adicionales en paralelo, lo que impulsa la decodificación especulativa sin un modelo de borrador separado.
• Entrada multimodal — texto, imagen, video y audio — que produce salida de texto. El codificador de visión es un MoE ViT (7B en total / 1.2B activos) y el codificador de audio es un modelo denso de 800M.
La nota de alcance del PR decía que el trabajo de vLLM cubría «solo el LLM», con los componentes multimodales fuera de alcance. Eso se refería al parche de inferencia, no al modelo: el checkpoint publicado incluye los codificadores de visión y audio junto con el núcleo del lenguaje. Si quieres la versión multimodal, estás mirando el mismo repositorio, servido a través de las rutas de transformers y SGLang en lugar de la ruta solo-LLM de vLLM que se filtró primero.
Disponibilidad, concretamente: los pesos se encuentran en dots-studio/dots3-note-prev en Hugging Face bajo la licencia Apache-2.0; el código y las recetas de servicio están en el repositorio studio-dots-ai/dots3-note-prev en GitHub; y el acceso alojado es a través del portal API del propio proveedor además de varias plataformas de terceros. Es la primera publicación de pesos abiertos de la familia dots3: la frase "open-sourcing soon" (近期将开源) que Xiaohongshu había utilizado durante dos semanas, según sus declaraciones en chino, se ha cumplido.
La arquitectura que la filtración acertó
El PR describe dots-note-3.0 como "{{1}}estructuralmente relacionado con DeepSeek-V3.2{{/1}}", pero con una mezcla de dos geometrías de atención en una misma pila. La configuración publicada lo confirma. La ficha del modelo divide las 46 capas de atención en 13 capas de atención dispersa (DSA) estilo DeepSeek —con indexación top-2048— y 33 capas de atención de ventana deslizante (SWA), aproximadamente una capa dispersa por cada tres densas. Esa es la estructura de "{{2}}salto entre atención global dispersa y local densa{{/2}}" que el nombre de la rama note-hopper insinuaba, ahora escrita en el propio checkpoint.
Mecánicamente, es la misma idea que DeepSeek introdujo con V3.2: la mitad DSA es un indexador ligero que puntúa cada clave almacenada en caché contra la consulta, mantiene una lista corta de top-k y calcula la atención sobre esa lista en lugar de sobre el contexto completo, reduciendo el coste cuadrático de las secuencias largas a aproximadamente lineal. La mitad de ventana deslizante es el contrapeso: un rango acotado de atención local densa que garantiza que los tokens más recientes siempre reciban atención completa, sin importar lo que decida el indexador disperso. La combinación de dispersión global más densidad local, en el mismo modelo, fue la parte genuinamente inusual de la filtración, y ahora es la parte confirmada.
El resto del diseño es mecánica familiar de la familia DeepSeek, como dijo el PR: un router MoE sin agrupar, MoE con paralelismo de secuencias, prefill fragmentado de contexto largo validado hasta la ventana completa de 512K, y una capa MTP que por defecto usa la atención de ventana deslizante para la decodificación especulativa.
El récord de 42/42 — y lo que ahora se puede comprobar
El resultado de la OMI en sí no cambia, y tampoco la calificación. El 25 de julio de 2026, Xiaohongshu anunció que el modelo había obtenido un perfecto 42/42 en la evaluación oficial de la 67.ª Olimpiada Internacional de Matemáticas en Shanghái, donde solo 7 de los 666 concursantes humanos igualaron el resultado y el corte para el oro fue de 29 — 13 puntos por encima del oro y 7 puntos por encima de los 35/42 de Gemini Deep Think, el mejor resultado previo de IA en la evaluación oficial de la OMI. Esa sigue siendo la versión de la empresa sobre un concurso evaluado oficialmente: la puntuación es real y verificada por el comité, pero las afirmaciones que la rodean — cómo se accedió a los problemas, cómo se controlaron el muestreo y la evaluación — nunca fueron auditadas de forma independiente, porque nadie fuera del laboratorio podía ejecutar el modelo.
Esa es la parte que cambia con el lanzamiento. Con los pesos públicos, el 42/42 ya no es un número que se deba tomar por fe o por la palabra de una solicitud de extracción; es un resultado que un tercero puede intentar reproducir, y eso es lo más valioso y verificable de este lanzamiento. También sigue siendo discutido en los márgenes de la misma manera que hace dos semanas: los medios chinos informaron que Celia de Huawei también obtuvo 42/42 en la misma calificación, por lo que dots-note-3.0 es uno de los primeros en lugar del primero; y la afirmación en X de un socio de Menlo Ventures de que OpenAI, Anthropic, Axiom Math y Kimi K3 de Moonshot también alcanzaron 42/42 este año sigue siendo una publicación social no verificada sin un registro de calificación detrás.
La empresa también publicó nuevas afirmaciones de benchmark junto con el lanzamiento, todas ellas reportadas por el proveedor y sin reproducir hasta ahora. En el benchmark ARC-AGI 3, Dots dice que dots3-note preview obtiene una puntuación de alrededor de 0.35 con un costo de tiempo de prueba reportado de menos de $500. En suites de razonamiento y agentes, incluyendo WebShop, HotpotQA y ALFWorld, afirma que el modelo está a la par o es mejor que modelos con varias veces su cantidad de parámetros activos, con una visión que destaca en su tamaño. Esos son los números de Dots sobre su propio modelo: trátalos así hasta que un laboratorio neutral los vuelva a ejecutar.
Dots también publicó los dos bancos de pruebas que construyó para esta clase de tareas, y hacerlos de código abierto es casi tan útil como el modelo. VibeLifeBench ejecuta 200 tareas en 22 servicios simulados y 288 interfaces de herramientas, comprobando 1,247 condiciones atómicas sobre si un agente se mantiene consistente cuando el entorno cambia a mitad de tarea; según los propios resultados de Dots, el modelo más fuerte probado hasta ahora solo obtiene 32.5 avg@3, y la mayoría de los mejores modelos de peso cerrado fracasan rotundamente. VibeSearchBench es más limitado: 20 dominios, 200 tareas, para probar si un agente pide aclaraciones cuando una solicitud es ambigua. Ambos llevan la misma etiqueta reportada por el proveedor que la cifra de ARC-AGI, pero los bancos de pruebas son públicos, lo que hace que el 32.5 sea falsable en lugar de retórico.
Por qué esto es un modelo de agente, no un modelo matemático.
Ni la filtración ni la puntuación de la IMO deberían engañarte sobre para qué sirve este modelo. El posicionamiento del lanzamiento no son matemáticas — son tareas de horizonte largo y abiertas: planificación de viajes personalizados, flujos de trabajo para preparar bodas, gestionar una pequeña tienda, una renovación del hogar. Tareas sin una única respuesta correcta, objetivos que cambian a mitad de tarea y plazos de horas o días. Ese es un conjunto de benchmarks deliberadamente diferente de las tablas de clasificación de matemáticas y programación, y es donde las decisiones de diseño de dots3-note — el contexto de 512K, el archivo de memoria, el bucle de autocrítica — realmente dan sus frutos.
En el material publicado destacan tres técnicas. Primero, el modelo mantiene un archivo de memoria (memory.md) como resumen continuo del entorno, que es como conserva el estado a lo largo de una sesión larga y abierta. Segundo, utiliza un mecanismo de «autocrítica» —la misma revisión recursiva que, según se describió, usaba la solución del IMO— para detectar y corregir sus propios pasos intermedios. Tercero, la receta de entrenamiento se llama TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): el modelo divide las trayectorias largas en macro-pasos y alterna entre los roles de actor y crítico para generar su propia señal de entrenamiento, que es la razón reportada por la que puede optimizarse en tareas sin respuesta de referencia.
Las demostraciones prácticas del proveedor son el sabor de la afirmación: jugar al constructor de mazos Slay the Spire II hasta el piso 33, resolver los seis niveles de ARC-AGI 3 en 320 pasos, recorrer un problema de razonamiento espacial de renovación del hogar y crear una app de visionOS de principio a fin (12 archivos Swift, 1876 líneas, "BUILD SUCCEEDED"). Trátalas como demostraciones, no como benchmarks, pero son demostraciones de algo específico: un modelo que mantiene un objetivo en mente y realiza muchos pasos sin perder el hilo, que es la capacidad que más escasea actualmente en el mercado de agentes.
Costo, autoalojamiento y cómo probarlo
Los pesos abiertos son gratuitos; el costo de la vista previa de dots3-note reside en dónde se sirve. La receta de referencia de vLLM para el checkpoint FP8 se ejecuta en ocho NVIDIA H100 con paralelismo de tensor 8 y paralelismo de expertos 8: una partida presupuestaria real, no un modelo de laptop. Los equipos con ese tipo de hardware obtienen toda la pila, incluido el decodificado especulativo MTP de 3 tokens y el analizador de llamadas a herramientas dots que incluyen los runtimes. Todos los demás lo usarán alojado: el portal de API del proveedor está disponible, y los endpoints de vista previa alojados se lanzaron en plataformas de terceros el mismo día en que se publicaron los pesos: el 14 de agosto. El nivel de vista previa aparece a $0 por token en las plataformas que lo sirven, según los listados de esas propias plataformas, no de la página de precios del proveedor, por lo que el costo de entrada para probar la vista previa de dots3-note en producción hoy es efectivamente nulo mientras dure la etiqueta de vista previa.
Para los desarrolladores, el argumento de hace dos semanas sobre apostar por un modelo no probado a bajo costo ahora se lee como el argumento sobre evaluar uno recién lanzado — el patrón es idéntico. Dirige una porción de tráfico al nuevo modelo, detrás de una conmutación por error automática, para que un modo de fallo inesperado derribe una ruta de prueba en lugar de una de producción. Para eso sirve un enrutador, y es la versión honesta de la propuesta: la vista previa de dots3-note no está alojada en OrcaRouter al momento de escribir esto, y nadie debería fingir lo contrario. Pero la postura de enrutamiento sobre la que escribimos en el artículo de la filtración se aplica el día en que esté alojada — una API que pueda llegar a un modelo nuevo en el momento en que un proveedor lo aloje, con los precios de lista del proveedor traspasados con un margen del 0% y conmutación por error configurada por solicitud. Mientras tanto, los modelos de la familia DeepSeek con los que este está estructuralmente relacionado ya se pueden invocar de esa manera: DeepSeek V4 Flash y DeepSeek V4 Pro están ambos activos detrás de una sola clave, con los mismos precios de traspaso y conmutación por error por solicitud — un punto de referencia razonable para juzgar cómo se comporta en producción un modelo agente de 16B de parámetros activos como la vista previa de dots3-note.

Qué ver a continuación
Cuatro cosas, aproximadamente en orden de cuánto podrían cambiar el panorama:
• Reproducción independiente de 42/42. Los pesos ya están disponibles; la primera repetición seria por un tercero del resultado de la IMO — o un paquete de evaluación neutral que lo contradiga — es el punto de datos de mayor valor que este lanzamiento puede producir. Hasta entonces, el 42/42 sigue siendo una puntuación calificada oficialmente y reportada por la empresa.
• Los hermanos mayores, jazz y aria. dots3-note preview es la primera versión pública y, según la empresa, el miembro más ligero de la familia dots3. Si 280B total / 16B activo es el pequeño, los dos modelos más grandes son donde las afirmaciones de vanguardia realmente se pondrán a prueba.
Límites del servicio alojado y términos de vista previa. El precio ahora es público — el nivel de vista previa es gratuito por token en las plataformas que lo ofrecen — pero los límites de tasa y si la etiqueta de vista previa conlleva términos especiales seguirán decidiendo quién lo autoaloja frente a quién lo invoca.
• Dónde se ubica en las tablas de clasificación independientes. Las afirmaciones de los proveedores sobre ARC-AGI y las suites de agentes necesitan una medición neutral para convertirse en hechos utilizables — ese es el mismo proceso que separó la exageración de la realidad en cada lanzamiento abierto de este año.
Cuando cubrimos la filtración en agosto, el resumen honesto fue breve: arquitectura real, registro real, sin pesos, sin fecha. Tres de esos cuatro calificativos han desaparecido. La arquitectura es pública, el registro está adjunto a un checkpoint descargable y la fecha ha llegado. Lo que queda es la verificación — y ahora que la vista previa de dots3-note puede ejecutarse en lugar de leerse, la respuesta a si Xiaohongshu construyó el modelo de agente que afirma vendrá de cualquiera que tenga ocho H100s y un banco de pruebas, no de un pull request.
