
dots-note-3.0: Model IMO 42/42, wyciekły przez PR vLLM, jest teraz open-source
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
14 sierpnia 2026 roku dots-note-3.0 przestał być przeciekiem. Dots Model Lab należące do Xiaohongshu udostępniło jako open source pierwszy publiczny model z rodziny dots3 – oznaczony jako dots3-note preview – liczący 280 miliardów parametrów (16 miliardów aktywnych), z oknem kontekstowym 512K, na licencji Apache-2.0 – osiem dni po tym, jak pull request w vLLM ujawnił architekturę modelu przed premierą. Wagi znajdują się na Hugging Face, kod na GitHubie, a checkpoint, który oficjalnie uzyskał wynik 42/42 na Międzynarodowej Olimpiadzie Matematycznej 2026, jest po raz pierwszy uruchamialny przez każdego.
To wydanie odpowiada na wszystkie otwarte pytania, które pozostawił po sobie artykuł z przeciekiem z 6 sierpnia na tym blogu — rozmiar, długość kontekstu, licencja, ścieżka na Hugging Face, data wydania — i zamienia historię „wiemy na razie tyle" w taką, którą można zweryfikować. Poniżej aktualizacja: co zostało udostępnione, co opublikowana konfiguracja potwierdza na temat architektury, którą jako pierwszy ujawnił PR, co jest teraz niezależnie weryfikowalne, a co wciąż jest jedynie twierdzeniem dostawcy.
Z draftowego PR do publicznego checkpointu
Wyciek w skrócie: 6 sierpnia 2026 r. współtwórca o pseudonimie KurodaKanbei — podający się za doktoranta ETH Zürich, a nie pracownika Xiaohongshu — otworzył pull request #51255 w vllm-project/vllm, dodając wsparcie dla modelu językowego „Dots3 NOTE". Flaga draftu została zdjęta 7 sierpnia o 13:55 UTC, a notatki walidacyjne w PR-ze były wymowne: autor uruchomił usługę na 8 GPU (DP8/EP8) „z checkpointem Dots3 NOTE FP8". Nie da się zwalidować checkpointu FP8, którego się nie ma — kto napisał tego PR-a, miał prawdziwy model. Obejmował on 14 plików, w tym nowy moduł vllm/models/dots3_note, i miał przypięte etykiety new-model oraz verified.
Każdy z czterech sygnałów, które wymieniliśmy 8 sierpnia, już się urzeczywistnił, z wyjątkiem tego najważniejszego. Repozytorium Hugging Face się pojawiło — dots-studio/dots3-note-prev, Apache-2.0. Oficjalne ogłoszenie nadeszło — samo wydanie open-source, dzisiaj. Stos inferencyjny przestał być projektem: wsparcie vLLM jest natywne na main, a transformers i SGLang oba posiadają wsparcie dots3-note. Czwarty sygnał, niezależna weryfikacja wyniku matematycznego 42/42, wciąż pozostaje otwarty — i jest teraz możliwy w sposób, w jaki nigdy wcześniej nie był, ponieważ wagi są publiczne.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Co faktycznie zostało wydane
Opublikowana karta modelu zamienia wnioski z PR w arkusz specyfikacji — a liczby pochodzą z własnej konfiguracji checkpointu, a nie z zewnętrznego podsumowania. dots3-note preview to model mixture-of-experts:
• 280B łącznie / 16B aktywnych parametrów — 256 ekspertów z routingiem oraz jeden wspólny ekspert, routing top-8, na 1 gęstej + 45 warstwach MoE o rozmiarze ukrytym 5,120.
• Okno kontekstowe 512K tokenów, słownik 152K, precyzja BF16 i FP8.
{{1}}Moduł przewidywania wielu tokenów (MTP){{/1}} — {{2}}jedna wspólna warstwa o 1,13B parametrów{{/2}}, która równolegle przewiduje do trzech dodatkowych tokenów, co umożliwia dekodowanie spekulatywne bez osobnego modelu szkicującego.
• Wejście multimodalne — tekst, obraz, wideo i audio — generujące wyjście tekstowe. Enkoder wizyjny to MoE ViT (7B łącznie / 1,2B aktywnych), a enkoder audio to gęsty model 800M.
Zakres notatki PR mówił, że prace nad vLLM obejmują „tylko LLM", a komponenty multimodalne są poza zakresem. Dotyczyło to patcha do inferencji, a nie modelu: opublikowany checkpoint zawiera enkodery wizyjne i audio obok rdzenia językowego. Jeśli chcesz wersję multimodalną, patrzysz na to samo repozytorium, serwowane przez ścieżki transformers i SGLang, a nie przez ścieżkę vLLM tylko-LLM, która wyciekła najpierw.
Dostępność, konkretnie: wagi znajdują się w dots-studio/dots3-note-prev na Hugging Face na licencji Apache-2.0; kod i przepisy dotyczące serwowania są w repozytorium studio-dots-ai/dots3-note-prev na GitHubie; a dostęp hostowany jest przez własny portal API dostawcy oraz kilka platform zewnętrznych. To pierwsze wydanie rodziny dots3 z otwartymi wagami — deklaracja „open-sourcing soon” (近期将开源), której Xiaohongshu używała przez dwa tygodnie, zgodnie z jej chińskojęzycznymi oświadczeniami, została spełniona.
Architektura, którą wyciek trafnie oddał
W PR opisano dots-note-3.0 jako „strukturalnie powiązany z DeepSeek-V3.2”, ale z mieszanką dwóch geometrii uwagi w jednym stosie. Opublikowana konfiguracja to potwierdza. Karta modelu dzieli 46 warstw uwagi na 13 warstw rzadkiej uwagi w stylu DeepSeek (DSA) — z indeksowaniem top-2048 — oraz 33 warstwy uwagi z przesuwnym oknem (SWA), czyli mniej więcej jedną warstwę rzadką na trzy gęste. To właśnie struktura „przeskoku między rzadką globalną a gęstą lokalną uwagą”, na którą wskazywała nazwa gałęzi note-hopper, teraz zapisana w samym checkpointcie.
Mechanicznie to ten sam pomysł, który DeepSeek wprowadził w V3.2: połowa DSA to lekki indeksator, który ocenia każdy zbuforowany klucz względem zapytania, utrzymuje krótką listę top-k i oblicza uwagę na niej zamiast na całym kontekście — redukując kwadratowy koszt długich sekwencji do mniej więcej liniowego. Połowa z przesuwnym oknem jest przeciwwagą: ograniczony zakres gęstej lokalnej uwagi, który gwarantuje, że najnowsze tokeny zawsze są w pełni brane pod uwagę, niezależnie od tego, co zdecyduje rzadki indeksator. Globalna rzadka uwaga plus gęsta lokalna w tym samym modelu to była naprawdę niezwykła część przecieku — i teraz jest to część potwierdzona.
Reszta planu to dobrze znana mechanika rodziny DeepSeek, jak podano w PR: niegrupowany router MoE, MoE z równoległością sekwencji, prefill w fragmentach dla długiego kontekstu, zwalidowany do pełnego okna 512K, oraz warstwa MTP, która domyślnie wykorzystuje uwagę z przesuwanym oknem do dekodowania spekulatywnego.
Rekord 42/42 — i to, co można teraz sprawdzić
Sam wynik IMO się nie zmienia, podobnie jak etykietowanie. 25 lipca 2026 roku Xiaohongshu ogłosiło, że model uzyskał komplet 42/42 punktów w oficjalnej ocenie 67. Międzynarodowej Olimpiady Matematycznej w Szanghaju, gdzie tylko 7 z 666 ludzkich uczestników osiągnęło taki rezultat, a próg złotego medalu wynosił 29 — czyli 13 punktów powyżej progu złota i 7 punktów więcej niż 35/42 Gemini Deep Think, poprzednie najlepsze osiągnięcie AI w oficjalnej ocenie IMO. Takie pozostaje stanowisko firmy w sprawie oficjalnie ocenianego konkursu: wynik jest prawdziwy i zweryfikowany przez komitet, ale towarzyszące mu twierdzenia — w jaki sposób uzyskiwano dostęp do zadań, jak kontrolowano próbkowanie i ocenę — nigdy nie zostały niezależnie zbadane, ponieważ nikt spoza laboratorium nie mógł uruchomić modelu.
To jest ta część, którą zmienia wydanie. Przy publicznych wagach 42/42 nie jest już liczbą, którą trzeba przyjąć na wiarę lub na słowo w pull requeście; to wynik, który osoba trzecia może spróbować odtworzyć, i to jest najbardziej wartościowa, weryfikowalna rzecz w tym wydaniu. Nadal pozostaje jednak kwestionowany na marginesach w ten sam sposób, co dwa tygodnie temu: chińskie media podały, że Celia od Huawei również uzyskała 42/42 w tym samym ocenianiu, więc dots-note-3.0 jest jednym z pierwszych, a nie pierwszym; a twierdzenie partnera Menlo Ventures na X, że OpenAI, Anthropic, Axiom Math i Kimi K3 od Moonshot również osiągnęły 42/42 w tym roku, wciąż jest niezweryfikowanym postem w mediach społecznościowych, bez żadnych zapisów oceny.
Firma opublikowała również nowe twierdzenia dotyczące benchmarków wraz z wydaniem, wszystkie pochodzące od producenta i jak dotąd niezreplikowane. W benchmarku ARC-AGI 3 Dots twierdzi, że dots3-note preview osiąga wynik około 0,35 przy deklarowanym koszcie testowania poniżej 500 dolarów. W zestawach dotyczących rozumowania i agentów, w tym WebShop, HotpotQA i ALFWorld, model ma dorównywać lub przewyższać modele o kilkukrotnie większej liczbie aktywnych parametrów, a jego wizja wyróżnia się jak na jego rozmiar. To liczby Dotsa dotyczące jego własnego modelu — tak należy je traktować, dopóki neutralne laboratorium ich nie powtórzy.
Dots opublikowało również dwa zestawy ewaluacyjne, które zbudowało dla tej klasy zadań, a udostępnienie ich jako open source jest niemal tak samo przydatne jak sam model. VibeLifeBench uruchamia 200 zadań w ramach 22 symulowanych usług i 288 interfejsów narzędzi, sprawdzając 1 247 atomowych warunków dotyczących tego, czy agent pozostaje spójny, gdy środowisko zmienia się w trakcie zadania; według wyników samego Dots, najsilniejszy dotychczas przetestowany model osiąga jedynie 32,5 avg@3, a większość czołowych modeli o zamkniętych wagach całkowicie nie zdaje egzaminu. VibeSearchBench jest węższy — 20 domen, 200 zadań, testujących, czy agent prosi o wyjaśnienie, gdy zapytanie jest niejednoznaczne. Oba mają ten sam raportowany przez dostawcę wskaźnik co wynik ARC-AGI, ale zestawy ewaluacyjne są publiczne, co czyni 32,5 wartością poddającą się falsyfikacji, a nie jedynie retoryczną.
Dlaczego to jest model agentowy, a nie model matematyczny?
Ani wyciek, ani wynik IMO nie powinny wprowadzić cię w błąd co do tego, do czego służy ten model. Pozycjonowanie premiery to nie matematyka — to zadania o długim horyzoncie czasowym i otwartym końcu: spersonalizowane planowanie podróży, procesy przygotowań ślubnych, prowadzenie małego sklepu, remont domu. To zadania bez jednej poprawnej odpowiedzi, o celach zmieniających się w trakcie pracy i horyzontach czasowych rzędu godzin lub dni. To celowo inny zestaw benchmarków niż rankingi matematyczno-programistyczne i właśnie tam decyzje projektowe dots3-note — kontekst 512K, plik pamięci, pętla samokrytyki — naprawdę przynoszą efekty.
W opublikowanym materiale wyróżniają się trzy techniki. Po pierwsze, model utrzymuje plik pamięci (memory.md) jako bieżące podsumowanie środowiska, co pozwala mu przenosić stan przez długą, otwartą sesję. Po drugie, wykorzystuje mechanizm „samokrytyki” – ten sam rekurencyjny samoprzegląd, który według opisu stosowało rozwiązanie IMO – aby wykrywać i naprawiać własne kroki pośrednie. Po trzecie, procedura treningowa nosi nazwę TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): model dzieli długie trajektorie na makrokroki i naprzemiennie pełni role aktora i krytyka, aby generować własny sygnał treningowy, co – według doniesień – jest powodem, dla którego można go optymalizować na zadaniach bez znanej prawidłowej odpowiedzi.
Praktyczne pokazy dostawcy nadają treść temu twierdzeniu: granie w deckbuildera Slay the Spire II do 33. poziomu, rozwiązanie wszystkich sześciu poziomów ARC-AGI 3 w 320 krokach, przejście przez problem rozumowania przestrzennego związanego z remontem domu oraz zbudowanie aplikacji visionOS od początku do końca (12 plików Swift, 1876 linii, „BUILD SUCCEEDED"). Traktuj je jak demonstracje, a nie benchmarki — ale są to demonstracje czegoś konkretnego: modelu, który nie traci z oczu jednego celu i wykonuje wiele kroków bez gubienia wątku, czyli umiejętności, której na rynku agentów obecnie najbardziej brakuje.
Koszt, self-hosting i jak to wypróbować
Otwarte wagi są darmowe; koszt dots3-note preview ponosisz tam, gdzie go uruchamiasz. Referencyjna konfiguracja vLLM dla checkpointu FP8 działa na ośmiu układach NVIDIA H100 z tensor parallelism 8 i expert parallelism 8 — to realna pozycja w budżecie, a nie model na laptopa. Zespoły dysponujące takim sprzętem otrzymują cały stos, w tym spekulatywne dekodowanie MTP oparte na 3 tokenach oraz parser wywołań narzędzi dots, dostarczany z runtime'ami. Wszyscy inni nazwą to hostowanym: portal API dostawcy działa, a hostowane punkty końcowe preview uruchomiono na platformach zewnętrznych tego samego dnia, w którym wypuszczono wagi — 14 sierpnia. Warstwa preview jest wyceniona na 0 USD za token na platformach, które ją udostępniają, według własnych cenników tych platform, a nie strony cenowej dostawcy, więc koszt wejścia w wypróbowanie dots3-note preview w produkcji dzisiaj jest praktycznie zerowy, dopóki trwa oznaczenie preview.
Dla twórców argument sprzed dwóch tygodni o tanim stawianiu na nieprzetestowany model brzmi dziś jak argument o ocenie modelu, który właśnie trafił na rynek — wzorzec jest identyczny. Skieruj fragment ruchu na nowy model, za automatycznym przełączaniem awaryjnym, aby zaskakujący tryb awarii wyłączył ścieżkę testową zamiast produkcyjnej. Do tego właśnie służy router i to jest uczciwa wersja tej propozycji: w chwili pisania tego tekstu podgląd dots3-note nie jest hostowany na OrcaRouter i nikt nie powinien udawać, że jest inaczej. Ale podejście do routingu, o którym pisaliśmy w artykule o wycieku, zacznie obowiązywać w dniu, w którym to nastąpi — jedno API, które może dotrzeć do nowego modelu w momencie, gdy dostawca go udostępni, z cenami katalogowymi dostawcy przekazywanymi bez marży i przełączaniem awaryjnym konfigurowanym dla każdego żądania. Tymczasem modele z rodziny DeepSeek, z którymi ten jest strukturalnie powiązany, są już wywoływalne w ten sposób: DeepSeek V4 Flash i DeepSeek V4 Pro są oba aktywne pod jednym kluczem, z tymi samymi cenami pass-through i przełączaniem awaryjnym dla każdego żądania — co stanowi rozsądny punkt odniesienia do oceny, jak model agentowy z 16 miliardami aktywnych parametrów, taki jak dots3-note preview, faktycznie zachowuje się w produkcji.

Co obejrzeć dalej
Cztery rzeczy, z grubsza w kolejności tego, jak bardzo mogłyby zmienić obraz sytuacji:
• Niezależne odtworzenie wyniku 42/42. Wagi zostały udostępnione; pierwsze poważne niezależne powtórzenie wyniku IMO — albo neutralny pakiet ewaluacyjny, który mu przeczy — jest najcenniejszym pojedynczym punktem danych, jakie może wygenerować to wydanie. Do tego czasu 42/42 pozostaje oficjalnie ocenionym wynikiem raportowanym przez firmę.
• Większe rodzeństwo: jazz i aria. dots3-note preview to pierwsze publiczne wydanie i, według firmy, najlżejszy członek rodziny dots3. Jeśli 280B łącznie / 16B aktywnych to ten mały, to dwa większe modele będą prawdziwym sprawdzianem dla twierdzeń o granicach możliwości.
• Limity wersji hostowanej i warunki wersji zapoznawczej. Cena jest teraz publiczna — poziom zapoznawczy jest darmowy za token na platformach, które go udostępniają — ale limity szybkości i to, czy etykieta „preview” wiąże się ze specjalnymi warunkami, nadal zadecydują o tym, kto hostuje samodzielnie, a kto korzysta z API.
• Gdzie plasuje się na niezależnych rankingach. Raportowane przez dostawcę wyniki ARC-AGI i twierdzenia dotyczące zestawów agentowych wymagają neutralnego pomiaru, aby stać się użytecznymi faktami — to ten sam proces, który przy każdej tegorocznej otwartej premierze oddzielił marketingowy szum od rzeczywistości.
Kiedy w sierpniu opisaliśmy wyciek, uczciwe podsumowanie było krótkie: prawdziwa architektura, prawdziwy wynik, brak wag, brak daty. Z tych czterech zastrzeżeń trzy już nieaktualne. Architektura jest publiczna, wynik jest dołączony do możliwego do pobrania punktu kontrolnego, a data nadeszła. Pozostaje weryfikacja — a teraz, gdy wersję zapoznawczą dots3-note można uruchomić, a nie tylko o niej czytać, odpowiedź na pytanie, czy Xiaohongshu zbudował model agenta, który twierdzi, że zbudował, będzie pochodzić od każdego, kto ma osiem układów H100 i platformę benchmarkową, a nie od pull requesta.
