
dots-note-3.0: Il modello IMO 42/42 trapelato da una PR di vLLM è ora open-source
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il 14 agosto 2026, dots-note-3.0 ha smesso di essere una fuga di notizie. Il Dots Model Lab di Xiaohongshu ha rilasciato come open source il primo modello pubblico della sua famiglia dots3 come dots3-note preview — 280 miliardi di parametri (16 miliardi attivi), una finestra di contesto di 512K, con licenza Apache-2.0 — otto giorni dopo che una pull request di vLLM aveva divulgato l'architettura del modello prima del rilascio. I pesi sono su Hugging Face, il codice è su GitHub, e il checkpoint che ha ufficialmente ottenuto 42/42 alle Olimpiadi Internazionali di Matematica 2026 è, per la prima volta, eseguibile da chiunque.
Quel rilascio risponde a ogni domanda aperta lasciata in sospeso dall'articolo del 6 agosto di questo blog sulla fuga di notizie — dimensione, lunghezza del contesto, licenza, un percorso su Hugging Face, una data di rilascio — e trasforma una storia del tipo "cosa sappiamo finora" in una che può essere verificata. Di seguito l'aggiornamento: cosa è stato pubblicato, cosa la configurazione rilasciata conferma sull'architettura che la PR ha rivelato per prima, cosa ora è verificabile in modo indipendente e cosa rimane ancora un'affermazione del venditore.
Da una bozza di PR a un checkpoint pubblico
La fuga di notizie, in breve: il 6 agosto 2026, un contributore che si fa chiamare KurodaKanbei — un dottorando dell'ETH di Zurigo, come si autodefinisce, non un dipendente di Xiaohongshu — ha aperto la pull request #51255 di vllm-project/vllm aggiungendo il supporto per un modello linguistico "Dots3 NOTE". Il flag di bozza è stato rimosso il 7 agosto alle 13:55 UTC, e le note di validazione della PR erano l'indizio rivelatore: l'autore aveva eseguito un servizio DP8/EP8 su 8 GPU "con un checkpoint FP8 Dots3 NOTE". Non puoi validare un checkpoint FP8 che non possiedi — chi ha scritto quella PR aveva il modello reale. La PR toccava 14 file, incluso un nuovo modulo vllm/models/dots3_note, e portava le etichette new-model e verified.
Ognuno dei quattro segnali che abbiamo elencato l'8 agosto si è avverato, tranne quello che conta di più. Il repository Hugging Face è apparso — dots-studio/dots3-note-prev, Apache-2.0. L'annuncio ufficiale è arrivato — il rilascio open source stesso, oggi. Lo stack di inferenza ha smesso di essere una bozza: il supporto vLLM è nativo su main, e transformers e SGLang includono entrambi il supporto a dots3-note. Il quarto segnale, la verifica indipendente del risultato matematico 42/42, è ancora in sospeso — e ora è possibile in un modo che non lo era mai stato prima, perché i pesi sono pubblici.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Cosa è stato effettivamente spedito
La model card rilasciata trasforma le inferenze della PR in una scheda tecnica — e i numeri provengono dalla configurazione del checkpoint stesso, non da un riepilogo di terze parti. dots3-note preview è un modello mixture-of-experts:
280B totali / 16B parametri attivi — 256 esperti instradati più un esperto condiviso, routing top-8, su 1 livello denso + 45 livelli MoE con una dimensione nascosta di 5.120.
• Finestra di contesto da 512K token, vocabolario di 152K, precisione BF16 e FP8.
• Un modulo di predizione multi-token (MTP) — uno strato condiviso di 1.13B parametri che prevede fino a tre token extra in parallelo, ed è ciò che alimenta la decodifica speculativa senza un modello di bozza separato.
• Input multimodale — testo, immagine, video e audio — che produce output testuale. L'encoder visivo è un MoE ViT (7B totale / 1.2B attivi) e l'encoder audio è un denso 800M.
La nota sull'ambito della PR diceva che il lavoro su vLLM copriva "solo l'LLM", con i componenti multimodali fuori dall'ambito. Ciò riguardava la patch di inferenza, non il modello: il checkpoint rilasciato include gli encoder visivi e audio insieme al core linguistico. Se vuoi la versione multimodale, stai guardando lo stesso repository, servito tramite i percorsi transformers e SGLang piuttosto che il percorso vLLM solo-LLM che è trapelato per primo.
Disponibilità, concretamente: i pesi si trovano su dots-studio/dots3-note-prev su Hugging Face con licenza Apache-2.0; il codice e le ricette di servizio sono nel repository studio-dots-ai/dots3-note-prev su GitHub; e l'accesso ospitato è tramite il portale API del fornitore oltre a diverse piattaforme di terze parti. È la prima release a pesi aperti della famiglia dots3 — la frase "open-sourcing soon" (近期将开源) che Xiaohongshu aveva usato per due settimane, secondo le sue dichiarazioni in cinese, è stata mantenuta.
L'architettura che la fuga ha azzeccato
La PR ha descritto dots-note-3.0 come "strutturalmente correlato a DeepSeek-V3.2", ma con un mix di due geometrie di attenzione in un unico stack. La configurazione rilasciata lo conferma. La model card suddivide i 46 layer di attenzione in 13 layer di attenzione sparsa in stile DeepSeek (DSA) — con indicizzazione top-2048 — e 33 layer di attenzione a finestra scorrevole (SWA), all'incirca un layer sparso ogni tre densi. Questa è la struttura a "salto tra globale sparso e locale denso" a cui accennava il nome del branch note-hopper, ora scritta nel checkpoint stesso.
Meccanicamente, è la stessa idea che DeepSeek ha introdotto con V3.2: la parte DSA è un indicizzatore leggero che assegna un punteggio a ogni chiave in cache rispetto alla query, mantiene una shortlist top-k e calcola l'attenzione su quella invece che sull'intero contesto — riducendo il costo quadratico delle sequenze lunghe a circa lineare. La parte a finestra scorrevole è il contrappeso: uno span limitato di attenzione locale densa che garantisce che i token più recenti ricevano sempre piena attenzione, qualunque cosa decida l'indicizzatore sparso. L'attenzione sparsa globale più quella locale densa, nello stesso modello, era la parte davvero insolita del leak — ed è ora la parte confermata.
Il resto del progetto presenta i consueti meccanismi della famiglia DeepSeek, come affermato nella PR: un router MoE non raggruppato, MoE sequence-parallel, prefill a blocchi per contesti lunghi validato fino all'intera finestra da 512K, e un layer MTP che per impostazione predefinita usa l'attenzione a finestra scorrevole per la decodifica speculativa.
Il record 42/42 — e ciò che ora è verificabile
Il risultato IMO in sé non cambia, e nemmeno l'etichettatura. Il 25 luglio 2026, Xiaohongshu ha annunciato che il modello aveva totalizzato un perfetto 42/42 nella valutazione ufficiale della 67ª Olimpiade Internazionale di Matematica a Shanghai, dove solo 7 dei 666 concorrenti umani hanno eguagliato il risultato e la soglia per l'oro era 29 — 13 punti sopra l'oro e 7 punti sopra il 35/42 di Gemini Deep Think, il precedente miglior risultato di un'IA nella valutazione ufficiale delle IMO. Questa rimane la versione dell'azienda su una gara valutata ufficialmente: il punteggio è reale e verificato dal comitato, ma le affermazioni circostanti — come sono stati accessibili i problemi, come sono stati controllati campionamento e valutazione — non sono mai state sottoposte a verifica indipendente, perché nessuno al di fuori del laboratorio poteva eseguire il modello.
Questa è la parte che il rilascio cambia. Con i pesi pubblici, il 42/42 non è più un numero da prendere per fede o sulla parola di una pull request; è un risultato che una terza parte può provare a riprodurre, ed è l'aspetto di maggior valore verificabile di questo rilascio. Rimane inoltre marginalmente contestato negli stessi modi di due settimane fa: le testate cinesi hanno riportato che anche Celia di Huawei ha ottenuto 42/42 nella stessa valutazione, quindi dots-note-3.0 è uno dei primi piuttosto che il primo; e l'affermazione su X di un partner di Menlo Ventures secondo cui anche OpenAI, Anthropic, Axiom Math e Kimi K3 di Moonshot avrebbero raggiunto 42/42 quest'anno è ancora un post social non verificato, senza alcuna documentazione di valutazione a supporto.
L'azienda ha inoltre pubblicato nuove affermazioni sui benchmark insieme al rilascio, tutte riportate dal fornitore e finora non riprodotte. Sul benchmark ARC-AGI 3, Dots afferma che dots3-note preview ottiene un punteggio di circa 0,35 con un costo di test-time dichiarato inferiore a 500 dollari. Su suite di ragionamento e agenti come WebShop, HotpotQA e ALFWorld, sostiene che il modello sia alla pari o migliore di modelli con un numero di parametri attivi diverse volte maggiore, con una visione che si distingue per la sua dimensione. Questi sono i numeri di Dots sul proprio modello — trattateli come tali finché un laboratorio neutrale non li riesegue.
Dots ha rilasciato anche i due harness di valutazione che ha costruito per questa classe di compiti, e renderli open-source è quasi utile quanto il modello. VibeLifeBench esegue 200 attività su 22 servizi simulati e 288 interfacce di strumenti, verificando 1.247 condizioni atomiche sulla coerenza di un agente quando l'ambiente cambia a metà attività; secondo i risultati di Dots, il modello più forte testato finora ottiene solo 32.5 avg@3, e la maggior parte dei migliori modelli a peso chiuso fallisce del tutto. VibeSearchBench è più ristretto — 20 domini, 200 attività, per verificare se un agente chiede chiarimenti quando una richiesta è ambigua. Entrambi portano la stessa etichetta dichiarata dal venditore della cifra ARC-AGI, ma gli harness sono pubblici, il che rende il 32.5 falsificabile piuttosto che retorico.
Perché questo è un modello ad agente, non un modello matematico.
Né la fuga di notizie né il punteggio IMO dovrebbero fuorviarti sul vero scopo di questo modello. Il posizionamento di questo rilascio non riguarda la matematica — riguarda compiti a lungo termine e aperti: pianificazione personalizzata di viaggi, flussi di lavoro per la preparazione di un matrimonio, la gestione di un piccolo negozio, una ristrutturazione di casa. Compiti che non hanno un'unica risposta giusta, obiettivi che cambiano a metà attività e tempi che vanno da ore a giorni. Si tratta di un set di benchmark deliberatamente diverso dalle classifiche di matematica e coding, ed è lì che le scelte progettuali di {{1}}dots3-note{{/1}} — il contesto da 512K, il file di memoria, il ciclo di autocritica — danno realmente i loro frutti.
Nel materiale rilasciato spiccano tre tecniche. In primo luogo, il modello conserva un {{1}}file di memoria (memory.md){{/1}} come riepilogo continuo dell'ambiente, che è il modo in cui mantiene lo stato attraverso una sessione lunga e aperta. In secondo luogo, utilizza un meccanismo di {{2}}"auto-critica"{{/2}} — lo stesso riesame ricorsivo che si diceva fosse utilizzato dalla soluzione IMO — per segnalare e correggere i propri passaggi intermedi. In terzo luogo, la ricetta di addestramento si chiama {{3}}TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization){{/3}}: il modello suddivide le lunghe traiettorie in macro-passi e alterna i ruoli di attore e critico per generare il proprio segnale di addestramento, che è il motivo dichiarato per cui può essere ottimizzato su compiti che non hanno una risposta ground-truth.
Le demo pratiche del vendor danno sostanza alla rivendicazione: giocare al deckbuilder Slay the Spire II fino al piano 33, risolvere tutti e sei i livelli di ARC-AGI 3 in 320 passaggi, affrontare un problema di ragionamento spaziale legato alla ristrutturazione di una casa e creare un'app visionOS dall'inizio alla fine (12 file Swift, 1.876 righe, "BUILD SUCCEEDED"). Trattatele come dimostrazioni, non come benchmark — ma sono dimostrazioni di una cosa specifica: un modello che tiene a mente un unico obiettivo e compie molti passaggi senza perdere il filo, che è la capacità di cui il mercato degli agenti ha attualmente più carenza.
Costo, self-hosting e come provarlo
I pesi aperti sono gratuiti; il costo dell'anteprima dots3-note è dove la servi. La ricetta vLLM di riferimento per il checkpoint FP8 viene eseguita su otto NVIDIA H100 con parallelismo tensoriale 8 e parallelismo esperti 8 — una vera linea di budget, non un modello da laptop. I team con quel tipo di hardware ottengono l'intero stack, incluso il decoding speculativo MTP a 3 token e il parser di chiamate di strumenti dots che i runtime includono. Tutti gli altri la useranno come servizio hosted: il portale API del fornitore è attivo, e gli endpoint hosted di anteprima sono andati live su piattaforme di terze parti lo stesso giorno in cui sono stati rilasciati i pesi — 14 agosto. Il livello di anteprima è elencato a $0 per token sulle piattaforme che lo offrono, secondo i listini di quelle stesse piattaforme piuttosto che la pagina dei prezzi del fornitore, quindi il costo di ingresso per provare l'anteprima dots3-note in produzione oggi è di fatto nullo finché dura l'etichetta di anteprima.
Per chi costruisce, la discussione di due settimane fa sul puntare su un modello non ancora provato a basso costo oggi si legge come la discussione sulla valutazione di un modello appena distribuito: lo schema è identico. Indirizza una fetta di traffico verso il nuovo modello, dietro failover automatico, così che una modalità di guasto imprevista abbatta un percorso di test anziché uno di produzione. È a questo che serve un router, ed è la versione onesta della proposta: dots3-note preview non è ospitato su OrcaRouter al momento in cui scriviamo, e nessuno dovrebbe fingere il contrario. Ma la postura di routing di cui abbiamo scritto nell'articolo sulla fuga di notizie si applica dal giorno in cui lo sarà: un'unica API in grado di raggiungere un nuovo modello nel momento in cui un provider lo ospita, con i prezzi di listino dei provider applicati senza markup e failover configurato per singola richiesta. Nel frattempo, i modelli della famiglia DeepSeek a cui questo è strutturalmente correlato sono già chiamabili in quel modo: DeepSeek V4 Flash e DeepSeek V4 Pro sono entrambi attivi dietro un'unica chiave, con lo stesso prezzo pass-through e failover per richiesta: un punto di riferimento ragionevole per valutare come un modello agente con 16B di parametri attivi come dots3-note preview si comporta davvero in produzione.

Cosa guardare dopo
Quattro cose, grosso modo in ordine di quanto potrebbero cambiare il quadro:
• Riproduzione indipendente di 42/42. I pesi sono disponibili; la prima seria riesecuzione da parte di terzi del risultato IMO — o un pacchetto di valutazione neutrale che lo contraddice — è il singolo dato di maggior valore che questa release possa produrre. Fino ad allora, il 42/42 resta un punteggio valutato ufficialmente e riportato dall'azienda.
• I fratelli maggiori, jazz e aria. dots3-note preview è la prima versione pubblica e, secondo l'azienda, il membro più leggero della famiglia dots3. Se 280B total / 16B active è il modello piccolo, i due modelli più grandi sono dove le affermazioni di frontiera verranno effettivamente messe alla prova.
• Limiti hosted e termini di anteprima. Il prezzo è ora pubblico — il livello di anteprima è gratuito per token sulle piattaforme che lo servono — ma i limiti di frequenza e l'eventuale presenza di termini speciali associati al tag di anteprima determineranno ancora chi fa self-hosting rispetto a chi lo chiama.
• Dove si posiziona nelle classifiche indipendenti. Le affermazioni riportate dal fornitore su ARC-AGI e sulle suite di agenti necessitano di una misurazione neutrale per diventare fatti utilizzabili — è lo stesso processo che ha separato l'hype dalla realtà in ogni rilascio open di quest'anno.
{{1}}Quando abbiamo trattato la fuga di notizie ad agosto, il riepilogo onesto era breve: architettura reale, record reale, niente pesi, nessuna data.{{/1}} {{2}}Tre di quei quattro criteri sono spariti.{{/2}} L'architettura è pubblica, il record è allegato a un checkpoint scaricabile e la data è arrivata. {{3}}Ciò che resta è la verifica{{/3}} — e ora che la preview di dots3-note può essere eseguita anziché letta, {{4}}la risposta alla domanda se Xiaohongshu abbia costruito il modello agente che afferma arriverà da chiunque abbia otto H100 e un'infrastruttura di benchmark, non da una pull request.{{/4}}
