Carte de titre pour « dots-note-3.0 : le modèle 42/42 IMO vient de fuiter via une PR vLLM » : gros titre « dots-note-3.0 », sous-titre « Ce qu'on sait à ce jour », et deux cartes à icônes plates — « IMO 2026 · 42/42 » avec une icône de trophée en trait et un badge « évaluation officielle », et « vLLM PR #51255 » avec une icône de fichier de code en trait et un badge « architecture divulguée ». Logo OrcaRouter composé en bas à droite.
Guides & Insights

dots-note-3.0 : Le modèle IMO 42/42 divulgué par une PR vLLM est désormais open source

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le {{1}}14 août 2026{{/1}}, {{2}}dots-note-3.0{{/2}} a cessé d'être une fuite. Le {{3}}Dots Model Lab{{/3}} de {{4}}Xiaohongshu{{/4}} a publié en open source le premier modèle public de sa famille {{KEEP}}dots3{{/KEEP}} sous le nom de {{KEEP}}dots3-note preview{{/KEEP}} — {{5}}280 milliards de paramètres (16 milliards actifs){{/5}}, une fenêtre de contexte de {{6}}512K{{/6}}, licence {{7}}Apache-2.0{{/7}} — huit jours après qu'une pull request de {{8}}vLLM{{/8}} a révélé l'architecture du modèle avant sa sortie officielle. Les poids sont sur {{9}}Hugging Face{{/9}}, le code est sur {{10}}GitHub{{/10}}, et le checkpoint ayant officiellement obtenu la note de {{KEEP}}42/42{{/KEEP}} à l'{{11}}Olympiade internationale de mathématiques 2026{{/11}} est, pour la première fois, exécutable par n'importe qui.

Cette version répond à toutes les questions ouvertes laissées par l’article sur la fuite du 6 août de ce blog — taille, longueur de contexte, licence, un chemin Hugging Face, une date de sortie — et transforme un récit du type « ce que l’on sait jusqu’ici » en un récit vérifiable. Ce qui suit est la mise à jour : ce qui a été publié, ce que la configuration publiée confirme de l’architecture que la PR a révélée en premier, ce qui est désormais vérifiable de manière indépendante, et ce qui reste une simple affirmation du fournisseur.

D'un brouillon de PR à un checkpoint public

La fuite, en bref : le 6 août 2026, un contributeur nommé KurodaKanbei — se présentant comme doctorant à l'ETH Zürich, et non comme employé de Xiaohongshu — a ouvert la pull request #51255 sur vllm-project/vllm, ajoutant la prise en charge d'un modèle de langue « Dots3 NOTE ». L'indicateur de brouillon a été retiré le 7 août à 13 h 55 UTC, et les notes de validation de la PR étaient révélatrices : l'auteur avait exécuté un service 8-GPU DP8/EP8 « avec un checkpoint FP8 Dots3 NOTE ». On ne peut pas valider un checkpoint FP8 que l'on ne possède pas — celui qui a écrit cette PR détenait le modèle réel. Elle touchait 14 fichiers, dont un nouveau module vllm/models/dots3_note, et portait les étiquettes new-model et verified.

Chacun des quatre indices que nous avons listés le 8 août s'est maintenant vérifié, sauf celui qui compte le plus. Le dépôt Hugging Face est apparu — dots-studio/dots3-note-prev, Apache-2.0. L'annonce officielle est tombée — la sortie open-source elle-même, aujourd'hui. La pile d'inférence a cessé d'être un brouillon : le support vLLM est natif sur main, et transformers et SGLang prennent tous deux en charge dots3-note. Le quatrième indice, la vérification indépendante du résultat mathématique 42/42, est celui qui reste en suspens — et il est désormais possible d'une manière qui ne l'a jamais été auparavant, car les poids sont publics.

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

Ce qui a réellement été livré

La fiche modèle publiée transforme les inférences du PR en une fiche technique — et les chiffres proviennent de la configuration propre du checkpoint, et non d'un résumé tiers. L'aperçu dots3-note est un modèle de mélange d'experts :

• 280B de paramètres au total / 16B actifs — 256 experts routés plus un expert partagé, routage top-8, sur 1 couche dense + 45 couches MoE avec une dimension cachée de 5 120.

• Fenêtre de contexte de 512K tokens, vocabulaire de 152K, précision BF16 et FP8.

• Un module de prédiction multi-token (MTP) — une couche partagée de 1,13 milliard de paramètres qui prédit jusqu'à trois jetons supplémentaires en parallèle, ce qui permet le décodage spéculatif sans modèle de brouillon séparé.

• Entrée multimodale — texte, image, vidéo et audio — produisant une sortie textuelle. L'encodeur visuel est un MoE ViT (7B au total / 1.2B actifs) et l'encodeur audio est un dense 800M.

La note de périmètre de la PR indiquait que le travail vLLM couvrait « uniquement le LLM », les composants multimodaux étant exclus du périmètre. Cela concernait le patch d'inférence, pas le modèle : le checkpoint publié embarque les encodeurs vision et audio aux côtés du noyau linguistique. Si vous voulez la version multimodale, il s'agit du même dépôt, servi via les chemins transformers et SGLang plutôt que par le chemin vLLM limité au LLM qui a filtré en premier.

Disponibilité, concrètement : les poids sont hébergés sur dots-studio/dots3-note-prev sur Hugging Face sous licence Apache-2.0 ; le code et les recettes de déploiement se trouvent dans le dépôt studio-dots-ai/dots3-note-prev sur GitHub ; et l'accès hébergé passe par le portail API du fournisseur ainsi que par plusieurs plateformes tierces. Il s'agit de la première version à poids ouverts de la famille dots3 — l'expression « open-sourcing soon » (近期将开源) que Xiaohongshu avait utilisée pendant deux semaines, selon ses déclarations en chinois, a été tenue.

L'architecture que la fuite a bien identifiée

Le PR décrivait dots-note-3.0 comme « structurellement lié à DeepSeek-V3.2 » mais avec un mélange de deux géométries d'attention dans une même pile. Le config publié le confirme. La fiche du modèle répartit les 46 couches d'attention en 13 couches d'attention sparse style DeepSeek (DSA) — avec indexation top-2048 — et 33 couches d'attention à fenêtre glissante (SWA), soit environ une couche sparse pour trois couches denses. C'est la structure « saut entre global sparse et local dense » que le nom de branche note-hopper laissait entendre, désormais inscrite dans le checkpoint lui-même.

Mécaniquement, c'est la même idée que DeepSeek a introduite avec V3.2 : la moitié DSA est un indexeur léger qui score chaque clé en cache par rapport à la requête, conserve une shortlist top-k, et calcule l'attention sur celle-ci au lieu du contexte complet — réduisant le coût quadratique des longues séquences à environ linéaire. La moitié à fenêtre glissante est le contrepoids : une portée bornée d'attention locale dense qui garantit que les tokens les plus récents sont toujours pleinement pris en compte, quelle que soit la décision de l'indexeur sparse. Sparse global plus dense local, dans le même modèle, était la partie vraiment inhabituelle de la fuite — et c'est maintenant la partie confirmée.

Le reste du plan est une mécanique familière de la famille DeepSeek, comme le dit la PR : un routeur MoE non groupé, un MoE séquentiel parallèle, un préremplissage par blocs à contexte long validé sur toute la fenêtre de 512 K, et une couche MTP qui utilise par défaut l'attention à fenêtre glissante pour le décodage spéculatif.

Le record 42/42 — et ce qui est désormais vérifiable.

Le résultat IMO lui-même ne change pas, pas plus que l'étiquetage. Le 25 juillet 2026, Xiaohongshu a annoncé que le modèle avait obtenu un score parfait de 42/42 dans la notation officielle de la 67e Olympiade internationale de mathématiques à Shanghai, où seuls 7 des 666 candidats humains ont égalé ce résultat et où le seuil pour l'or était de 29 — soit 13 points de plus que l'or et 7 points de plus que le 35/42 de Gemini Deep Think, le précédent meilleur résultat d'IA dans la notation officielle de l'IMO. Cela reste la version de l'entreprise concernant un concours noté officiellement : le score est réel et vérifié par le comité, mais les affirmations qui l'entourent — comment les problèmes ont été consultés, comment l'échantillonnage et la notation ont été contrôlés — n'ont jamais fait l'objet d'un audit indépendant, car personne en dehors du laboratoire ne pouvait exécuter le modèle.

C'est l'élément que cette version modifie. Avec les poids rendus publics, le 42/42 n'est plus un chiffre à prendre pour argent comptant ou sur la foi d'une pull request ; c'est un résultat qu'un tiers peut tenter de reproduire, et c'est l'élément vérifiable le plus précieux de cette version. Il reste également contesté à la marge, comme il y a deux semaines : des médias chinois ont rapporté que Celia de Huawei avait elle aussi obtenu 42/42 dans la même évaluation, si bien que dots-note-3.0 est l'un des premiers plutôt que le premier ; et l'affirmation d'un associé de Menlo Ventures sur X selon laquelle OpenAI, Anthropic, Axiom Math et Kimi K3 de Moonshot ont également atteint 42/42 cette année reste un post social non vérifié, sans dossier d'évaluation derrière.

L'entreprise a également publié de nouvelles allégations de performances à l'occasion de la sortie, toutes rapportées par le fournisseur et non reproduites jusqu'à présent. Sur le benchmark ARC-AGI 3, Dots affirme que dots3-note preview obtient un score d'environ 0,35 pour un coût d'inférence déclaré inférieur à 500 $. Sur les suites de raisonnement et d'agents, notamment WebShop, HotpotQA et ALFWorld, elle affirme que le modèle est au niveau ou supérieur à des modèles dont le nombre de paramètres actifs est plusieurs fois supérieur, avec une vision qui se démarque à sa taille. Ce sont les chiffres de Dots sur son propre modèle — traitez-les comme tels jusqu'à ce qu'un laboratoire neutre les réexécute.

Dots a également publié les deux bancs d'évaluation qu'elle a créés pour cette classe de tâches, et les rendre open source est presque aussi utile que le modèle. VibeLifeBench exécute 200 tâches à travers 22 services simulés et 288 interfaces d'outils, en vérifiant 1 247 conditions atomiques pour déterminer si un agent reste cohérent lorsque l'environnement change en cours de tâche ; selon les propres résultats de Dots, le modèle le plus performant testé à ce jour n'obtient que 32,5 avg@3, et la plupart des meilleurs modèles à poids fermés échouent complètement. VibeSearchBench est plus restreint — 20 domaines, 200 tâches, pour tester si un agent demande des clarifications lorsqu'une requête est ambiguë. Les deux portent la même étiquette de résultat déclaré par le fournisseur que le chiffre ARC-AGI, mais les bancs sont publics, ce qui rend le 32,5 falsifiable plutôt que rhétorique.

Pourquoi ceci est un modèle d'agent, et non un modèle mathématique

Ni la fuite ni le score IMO ne devraient vous induire en erreur quant à l’objectif de ce modèle. Le positionnement de cette sortie n’est pas les mathématiques — il s’agit de tâches à long terme et ouvertes : planification de voyages personnalisés, workflows de préparation de mariage, gestion d’une petite boutique, rénovation d’une maison. Des tâches sans réponse unique correcte, des objectifs qui évoluent en cours de route, et des échelles de temps allant de quelques heures à quelques jours. Il s’agit d’un ensemble de benchmarks délibérément différent des classements en mathématiques et en codage, et c’est là que les choix de conception dots3-note — le contexte 512K, le fichier mémoire, la boucle d’auto-critique — portent réellement leurs fruits.

Trois techniques se démarquent dans le matériel publié. Premièrement, le modèle maintient un fichier mémoire (memory.md) qui sert de résumé permanent de l'environnement, ce qui lui permet de conserver son état tout au long d'une longue session ouverte. Deuxièmement, il utilise un mécanisme d'« auto-critique » — le même processus d'auto-examen récursif que celui décrit pour la solution IMO — pour signaler et corriger ses propres étapes intermédiaires. Troisièmement, la méthode d'entraînement s'appelle TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization) : le modèle divise les longues trajectoires en macro-étapes et alterne entre les rôles d'acteur et de critique pour générer son propre signal d'entraînement, ce qui expliquerait, selon les rapports, qu'il puisse être optimisé sur des tâches sans réponse de référence.

Les démos pratiques du fournisseur donnent corps à l’affirmation : jouer au deckbuilder Slay the Spire II jusqu’à l’étage 33, résoudre les six niveaux d’ARC-AGI 3 en 320 étapes, traiter un problème de raisonnement spatial lié à la rénovation d’une maison et créer une application visionOS de bout en bout (12 fichiers Swift, 1 876 lignes, « BUILD SUCCEEDED »). Considérez-les comme des démonstrations, pas comme des benchmarks — mais ce sont des démonstrations d’une chose bien précise : un modèle qui garde un seul objectif en tête et enchaîne de nombreuses étapes sans perdre le fil, ce qui est précisément la capacité qui manque le plus au marché des agents actuellement.

Coût, auto-hébergement et comment l’essayer

Les poids ouverts sont gratuits ; le coût de l’aperçu dots3-note réside là où vous le servez. La recette vLLM de référence pour le checkpoint FP8 tourne sur huit NVIDIA H100 avec un parallélisme de tenseurs de 8 et un parallélisme d’experts de 8 — un vrai poste budgétaire, pas un modèle pour laptop. Les équipes qui disposent de ce type de matériel obtiennent toute la pile, y compris le décodage spéculatif MTP à 3 jetons et l’analyseur d’appels d’outils dots fourni avec les runtimes. Tous les autres passeront par la version hébergée : le portail API du fournisseur est en ligne, et les points de terminaison d’aperçu hébergés ont été mis en service sur des plateformes tierces le jour même de la publication des poids — le 14 août. Le palier d’aperçu est affiché à 0 $ par jeton sur les plateformes qui le servent, selon leurs propres listes plutôt que la page de tarification du fournisseur, donc le coût d’entrée pour essayer l’aperçu dots3-note en production aujourd’hui est effectivement nul tant que la mention d’aperçu reste en vigueur.

Pour les développeurs, l'argument vieux de deux semaines concernant le pari à moindre coût sur un modèle non éprouvé se lit désormais comme celui sur l'évaluation d'un modèle tout juste livré — le schéma est identique. Dirigez une partie du trafic vers le nouveau modèle, derrière un basculement automatique, afin qu'un mode de défaillance surprenant fasse tomber un chemin de test plutôt qu'un chemin de production. C'est à cela que sert un routeur, et c'est la version honnête de l'argumentaire : dots3-note preview n'est pas hébergé sur OrcaRouter à l'heure où nous écrivons, et personne ne devrait prétendre le contraire. Mais la posture de routage que nous avons décrite dans l'article sur la fuite s'applique le jour où un nouveau modèle est hébergé — une API unique capable de l'atteindre dès qu'un fournisseur l'héberge, avec les prix catalogue des fournisseurs répercutés à 0% de marge et un basculement configuré par requête. En attendant, les modèles de la famille DeepSeek auxquels celui-ci est structurellement apparenté sont déjà appelables de cette manière : DeepSeek V4 Flash et DeepSeek V4 Pro sont tous deux disponibles derrière une seule clé API, avec les mêmes prix répercutés et le même basculement par requête — un point de référence raisonnable pour juger comment un modèle agent à 16B de paramètres actifs comme dots3-note preview se comporte réellement en production.

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

Que regarder ensuite

Quatre choses, à peu près dans l'ordre de leur capacité à changer la donne :

• Reproduction indépendante de 42/42. Les poids sont disponibles ; la première réexécution sérieuse par un tiers du résultat IMO — ou un package d'évaluation neutre qui le contredit — est le point de données à plus haute valeur que cette version puisse produire. En attendant, le 42/42 reste un score officiellement noté et déclaré par l'entreprise.

• Les grands frères, jazz et aria. La préversion dots3-note est la première version publique et, selon l’entreprise, le membre le plus léger de la famille dots3. Si 280B total / 16B actifs est le petit modèle, c’est avec les deux modèles plus grands que les prétentions à la pointe seront réellement testées.

• Limites du service hébergé et conditions de l'aperçu. Le prix est désormais public — l'offre d'aperçu est gratuite par jeton sur les plateformes qui la proposent — mais les limites de débit et la question de savoir si l'étiquette d'aperçu comporte des conditions particulières détermineront toujours qui choisit l'auto-hébergement par rapport à qui l'utilise via API.

• Là où il se place sur les classements indépendants. Les affirmations concernant ARC-AGI et les suites d'agents, rapportées par le fournisseur, nécessitent une mesure neutre pour devenir des faits exploitables — c'est le même processus qui a séparé le battage médiatique de la réalité lors de chaque version open source cette année.

Quand nous avons couvert la fuite en août, le résumé honnête était court : architecture réelle, enregistrement réel, pas de poids, pas de date. Trois de ces quatre qualificatifs ont disparu. L'architecture est publique, l'enregistrement est attaché à un point de contrôle téléchargeable, et la date est arrivée. Ce qui reste est la vérification — et maintenant que l'aperçu dots3-note peut être exécuté plutôt que simplement lu, la réponse à la question de savoir si Xiaohongshu a construit le modèle d'agent qu'il prétend viendra de quiconque dispose de huit H100 et d'un harnais de benchmark, non d'une pull request.