
dots-note-3.0: O Modelo IMO 42/42 Vazado por um PR do vLLM Agora É Código Aberto
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Em 14 de agosto de 2026, dots-note-3.0 deixou de ser um vazamento. O Dots Model Lab da Xiaohongshu disponibilizou como código aberto o primeiro modelo público de sua família dots3, o dots3-note preview — 280 bilhões de parâmetros (16 bilhões ativos), uma janela de contexto de 512K, licenciado sob Apache-2.0 — oito dias depois que um pull request no vLLM vazou a arquitetura do modelo antes do lançamento. Os pesos estão no Hugging Face, o código está no GitHub, e o checkpoint que oficialmente pontuou 42/42 na Olimpíada Internacional de Matemática de 2026 é, pela primeira vez, executável por qualquer pessoa.
Esse lançamento responde a todas as perguntas em aberto que a matéria sobre o vazamento de 6 de agosto deste blog deixou pendentes — tamanho, comprimento do contexto, licença, um caminho no Hugging Face, uma data de lançamento — e transforma uma história de "o que sabemos até agora" em algo que pode ser verificado. O que segue é a atualização: o que foi lançado, o que a configuração publicada confirma sobre a arquitetura que o PR revelou pela primeira vez, o que agora é verificável de forma independente e o que ainda é afirmação da própria empresa.
De um rascunho de PR a um checkpoint público.
O vazamento, em resumo: em 6 de agosto de 2026, um colaborador que se identifica como KurodaKanbei — um autointitulado doutorando da ETH Zürich, não um funcionário da Xiaohongshu — abriu o pull request #51255 do vllm-project/vllm adicionando suporte para um modelo de linguagem "Dots3 NOTE". A flag de rascunho foi removida em 7 de agosto às 13:55 UTC, e as próprias notas de validação do PR eram a pista: o autor havia executado um serviço DP8/EP8 de 8 GPUs "com um checkpoint FP8 Dots3 NOTE". Você não pode validar um checkpoint FP8 que você não possui — quem escreveu esse PR tinha o modelo real. Ele modificou 14 arquivos, incluindo um novo módulo vllm/models/dots3_note, e carregava as etiquetas new-model e verified.
Todos os quatro sinais que listamos em 8 de agosto já se confirmaram, exceto o que mais importa. O repositório do Hugging Face apareceu — dots-studio/dots3-note-prev, Apache-2.0. O anúncio oficial chegou — o próprio lançamento de código aberto, hoje. A pilha de inferência deixou de ser um rascunho: o suporte ao vLLM é nativo no main, e transformers e SGLang ambos têm suporte a dots3-note. O quarto sinal, a verificação independente do resultado matemático 42/42, ainda está pendente — e agora é possível de uma forma que nunca foi antes, porque os pesos são públicos.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
O que realmente foi lançado
O model card divulgado transforma as inferências do PR em uma ficha de especificações — e os números vêm da própria configuração do checkpoint, não de um resumo de terceiros. O dots3-note preview é um modelo mixture-of-experts:
• 280B total / 16B parâmetros ativos — 256 especialistas roteados mais um especialista compartilhado, roteamento top-8, em 1 camada densa + 45 camadas MoE com dimensão oculta de 5.120.
• Janela de contexto de 512K tokens, vocabulário de 152K, precisão BF16 e FP8.
{{1}}Um módulo de previsão de múltiplos tokens (MTP){{/1}} — {{2}}uma camada compartilhada de 1,13B parâmetros que prevê até três tokens extras em paralelo{{/2}}, {{3}}o que potencializa a decodificação especulativa sem um modelo de rascunho separado{{/3}}.
• Entrada multimodal — texto, imagem, vídeo e áudio — produzindo saída de texto. O codificador de visão é um MoE ViT (7B total / 1.2B ativos) e o codificador de áudio é um dense de 800M.
A nota de escopo do PR dizia que o trabalho do vLLM cobria "apenas o LLM", com os componentes multimodais fora do escopo. Isso era sobre o patch de inferência, não sobre o modelo: o checkpoint lançado inclui os encoders de visão e áudio junto com o núcleo de linguagem. Se você quiser a versão multimodal, está olhando para o mesmo repositório, servido pelos caminhos do transformers e do SGLang, em vez do caminho somente-LLM do vLLM que vazou primeiro.
Disponibilidade, concretamente: os pesos estão em dots-studio/dots3-note-prev no Hugging Face sob a licença Apache-2.0; o código e as receitas de serviço estão no repositório studio-dots-ai/dots3-note-prev no GitHub; e o acesso hospedado é feito pelo portal de API do próprio fornecedor, além de várias plataformas de terceiros. É o primeiro lançamento de pesos abertos da família dots3 — a expressão "open-sourcing soon" (近期将开源) que a Xiaohongshu usou por duas semanas, segundo suas declarações em chinês, foi cumprida.
A arquitetura que o vazamento acertou
O PR descreveu o dots-note-3.0 como "estruturalmente relacionado ao DeepSeek-V3.2", mas com uma mistura de duas geometrias de atenção em uma única pilha. A configuração publicada confirma isso. O model card divide as 46 camadas de atenção em 13 camadas de atenção esparsa no estilo DeepSeek (DSA) — com indexação top-2048 — e 33 camadas de atenção com janela deslizante (SWA), aproximadamente uma camada esparsa para cada três densas. Essa é a estrutura de "salto entre global esparso e local denso" que o nome do branch note-hopper sugeria, agora gravada no próprio checkpoint.
Mecanicamente, é a mesma ideia que a DeepSeek introduziu com o V3.2: a metade DSA é um indexador leve que avalia cada chave em cache contra a consulta, mantém uma lista reduzida top-k e calcula a atenção sobre essa lista em vez do contexto completo — reduzindo o custo quadrático de sequências longas para aproximadamente linear. A metade de janela deslizante é o contrapeso: uma extensão limitada de atenção local densa que garante que os tokens mais recentes recebam sempre atenção total, independentemente do que o indexador esparso decidir. Atenção esparsa global mais atenção local densa, no mesmo modelo, era a parte genuinamente incomum do vazamento — e agora é a parte confirmada.
O restante do blueprint é maquinário familiar da família DeepSeek, como o PR disse: um roteador MoE não agrupado, MoE com paralelismo de sequência, prefill fragmentado de contexto longo validado até a janela completa de 512K, e uma camada MTP que por padrão usa atenção de janela deslizante para decodificação especulativa.
O recorde de 42/42 — e o que agora é verificável
{{1}}O próprio resultado da IMO não muda, e a rotulagem também não. Em 25 de julho de 2026, a Xiaohongshu anunciou que o modelo havia obtido uma pontuação perfeita de 42/42 na avaliação oficial da 67ª Olimpíada Internacional de Matemática em Xangai, onde apenas 7 dos 666 competidores humanos atingiram o mesmo resultado, e o corte para o ouro foi 29 — superando o ouro por 13 pontos e ficando 7 pontos acima dos 35/42 do Gemini Deep Think, o melhor resultado anterior de IA na avaliação oficial da IMO.{{/1}} {{2}}Esse continua sendo o relato da empresa sobre uma competição avaliada oficialmente: a pontuação é real e verificada pelo comitê, mas as alegações em torno do resultado — como os problemas foram acessados, como a amostragem e a avaliação foram controladas — nunca foram auditadas de forma independente, porque ninguém fora do laboratório podia executar o modelo.{{/2}}
Essa é a parte {{1}}que o lançamento muda{{/1}}. Com os pesos públicos, o 42/42 não é mais um número para se aceitar por fé ou pela palavra de um pull request; é um resultado que um terceiro pode tentar reproduzir, e essa é a coisa de maior valor verificável neste lançamento. Também permanece contestado nas margens das mesmas maneiras de duas semanas atrás: veículos chineses reportaram que a Celia da Huawei também marcou 42/42 na mesma avaliação, então o dots-note-3.0 é um dos primeiros, e não o primeiro; e a afirmação de um sócio da Menlo Ventures no X de que OpenAI, Anthropic, Axiom Math e o Kimi K3 da Moonshot também atingiram 42/42 neste ano ainda é uma postagem social não verificada, sem registro de avaliação por trás.
A empresa também publicou novas alegações de benchmark junto com o lançamento, todas reportadas pelo fornecedor e ainda não reproduzidas até agora. No benchmark ARC-AGI 3, a Dots afirma que o dots3-note preview pontua cerca de 0,35 com um custo de tempo de teste reportado abaixo de US$ 500. Em suítes de raciocínio e agentes, incluindo WebShop, HotpotQA e ALFWorld, a empresa afirma que o modelo está no mesmo nível ou é melhor do que modelos com várias vezes sua contagem de parâmetros ativos, com visão que se destaca em seu tamanho. Esses são os números da Dots sobre seu próprio modelo — trate-os assim até que um laboratório neutro os reexecute.
A Dots também lançou os dois harnesses de avaliação que construiu para essa classe de tarefa, e disponibilizá-los como código aberto é quase tão útil quanto o modelo. O VibeLifeBench executa 200 tarefas em 22 serviços simulados e 288 interfaces de ferramentas, verificando 1.247 condições atômicas sobre se um agente permanece consistente enquanto o ambiente muda no meio da tarefa; segundo os próprios resultados da Dots, o modelo mais forte testado até agora obtém apenas 32,5 avg@3, e a maioria dos principais modelos de peso fechado falha completamente. O VibeSearchBench é mais restrito — 20 domínios, 200 tarefas, testando se um agente pede esclarecimento quando uma solicitação é ambígua. Ambos carregam o mesmo rótulo informado pelo fornecedor que o número do ARC-AGI, mas os harnesses são públicos, o que torna o 32,5 falseável em vez de retórico.
Por que este é um modelo de agente, não um modelo matemático.
Nem o vazamento nem a pontuação no IMO devem enganá-lo sobre para que serve este modelo. O posicionamento do lançamento não é matemática — são tarefas de horizonte longo e abertas: planejamento de viagens personalizado, fluxos de trabalho de preparação de casamento, administrar uma pequena loja, uma reforma doméstica. Tarefas sem uma única resposta certa, objetivos que mudam no meio da execução e escalas de tempo de horas ou dias. Esse é um conjunto de benchmarks deliberadamente diferente dos rankings de matemática e programação, e é onde as escolhas de design do dots3-note — o contexto de 512K, o arquivo de memória, o ciclo de autocrítica — realmente compensam.
Três técnicas se destacam no material divulgado. Primeiro, o modelo mantém um arquivo de memória (memory.md) como um resumo contínuo do ambiente, que é como ele mantém o estado ao longo de uma sessão longa e aberta. Segundo, ele usa um mecanismo de "autocrítica" — a mesma autorrevisão recursiva que a solução da IMO foi descrita como usando — para sinalizar e corrigir suas próprias etapas intermediárias. Terceiro, a receita de treinamento se chama TEMPO (Estimativa de Valor Escalonada em Tempo de Teste com Otimização de Política por Macro-etapas): o modelo divide trajetórias longas em macro-etapas e alterna entre os papéis de ator e crítico para gerar seu próprio sinal de treinamento, o que é a razão relatada para que ele possa ser otimizado em tarefas sem resposta de referência.
As demonstrações práticas do fornecedor são o sabor da afirmação: jogando o deckbuilder Slay the Spire II até o andar 33, resolvendo todos os seis níveis do ARC-AGI 3 em 320 passos, percorrendo um problema de raciocínio espacial de reforma residencial e construindo um aplicativo visionOS de ponta a ponta (12 arquivos Swift, 1.876 linhas, "BUILD SUCCEEDED"). Trate-as como demonstrações, não como benchmarks — mas são demonstrações de algo específico: um modelo que mantém um objetivo em mente e executa muitas etapas sem perder o fio da meada, que é a capacidade que mais falta atualmente no mercado de agentes.
Custo, auto-hospedagem e como testar
Os pesos abertos são gratuitos; o custo do preview do dots3-note está em servir o modelo. A receita de referência do vLLM para o checkpoint FP8 roda em oito NVIDIA H100s com paralelismo de tensor 8 e paralelismo de especialistas 8 — uma linha de orçamento real, não um modelo para notebook. Equipes com esse tipo de hardware recebem a pilha completa, incluindo a decodificação especulativa MTP de 3 tokens e o parser de chamada de ferramentas dots que os runtimes incluem. Para todos os demais, a opção é a versão hospedada: o portal de API do fornecedor está no ar, e os endpoints de preview hospedados entraram no ar em plataformas de terceiros no mesmo dia em que os pesos foram lançados — 14 de agosto. O nível de preview está listado a $0 por token nas plataformas que o servem, de acordo com as listagens dessas próprias plataformas, e não com a página de preços do fornecedor; portanto, o custo de entrada para experimentar o preview do dots3-note em produção hoje é efetivamente nulo enquanto durar o selo de preview.
Para desenvolvedores, o argumento de duas semanas sobre apostar barato em um modelo não comprovado agora soa como o argumento sobre avaliar um modelo recém-lançado — o padrão é idêntico. Aponte uma fatia do tráfego para o novo modelo, com failover automático, para que um modo de falha inesperado derrube um caminho de teste em vez de um de produção. É para isso que serve um roteador, e essa é a versão honesta da proposta: o preview do dots3-note não está hospedado no OrcaRouter no momento em que escrevo, e ninguém deveria fingir o contrário. Mas a postura de roteamento sobre a qual escrevemos na matéria sobre o vazamento se aplica no dia em que ele for hospedado — uma única API que pode alcançar um novo modelo no momento em que um provedor o hospeda, com os preços de tabela do provedor repassados com markup de 0% e failover configurado por solicitação. Enquanto isso, os modelos da família DeepSeek aos quais este está estruturalmente relacionado já podem ser acessados dessa forma: DeepSeek V4 Flash e DeepSeek V4 Pro estão ambos ativos com uma única chave, com o mesmo preço de repasse e failover por solicitação — um ponto de referência razoável para avaliar como um modelo de agente com 16B de parâmetros ativos, como o preview do dots3-note, realmente se comporta em produção.

O que assistir em seguida
Quatro coisas, mais ou menos em ordem de quanto poderiam mudar o cenário:
• Reprodução independente de 42/42. Os pesos já foram disponibilizados; a primeira reprodução séria por terceiros do resultado do IMO — ou um pacote de avaliação neutro que o contradiga — é o ponto de dados de maior valor que esta versão pode produzir. Até lá, o 42/42 continua sendo uma pontuação oficialmente avaliada e relatada pela empresa.
• Os irmãos maiores, jazz e aria. O dots3-note preview é o primeiro lançamento público e, segundo a empresa, o membro mais leve da família dots3. Se 280B total / 16B ativo é o pequeno, os dois modelos maiores são onde as alegações de fronteira serão realmente testadas.
• Limites hospedados e termos de preview. O preço agora é público — o nível de preview é gratuito por token nas plataformas que o oferecem — mas os limites de taxa e se o selo de preview carrega termos especiais ainda decidirão quem faz auto-hospedagem versus quem o chama.
• Onde ele se classifica em leaderboards independentes. As alegações de ARC-AGI e agent-suite relatadas pelo fornecedor precisam de uma medição neutra para se tornarem fatos utilizáveis — esse é o mesmo processo que separou o hype da realidade em todos os lançamentos abertos deste ano.
Quando cobrimos o vazamento em agosto, o resumo honesto foi curto: arquitetura real, registro real, sem pesos, sem data. Três desses quatro qualificadores se foram. A arquitetura é pública, o registro está anexado a um checkpoint para download, e a data chegou. O que resta é a verificação — e agora que a dots3-note preview pode ser executada em vez de apenas lida, a resposta sobre se a Xiaohongshu construiu o modelo de agente que afirma virá de qualquer pessoa com oito H100s e um harness de benchmark, não de um pull request.
