
dots-note-3.0: модель, набравшая 42/42 на IMO и утёкшая через PR в vLLM, теперь с открытым исходным кодом
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
14 августа 2026 года dots-note-3.0 перестал быть утечкой. Лаборатория Dots Model Lab компании Xiaohongshu открыла первую публичную модель из семейства dots3 как dots3-note preview — 280 миллиардов параметров (16 миллиардов активных), контекстное окно 512K, лицензия Apache-2.0 — через восемь дней после того, как pull request в vLLM раскрыл архитектуру модели до релиза. Веса доступны на Hugging Face, код — на GitHub, а чекпоинт, официально набравший 42/42 на Международной математической олимпиаде 2026 года, впервые может запустить любой желающий.
Этот релиз отвечает на все открытые вопросы, которые оставил нерешёнными материал в этом блоге об утечке от 6 августа, — размер, длину контекста, лицензию, путь на Hugging Face, дату релиза — и превращает историю «что мы знаем на данный момент» в историю, которую можно проверить. Далее — обновление: что вышло, что опубликованная конфигурация подтверждает об архитектуре, впервые раскрытой в PR, что теперь можно проверить независимо, а что остаётся лишь заявлением самого вендора.
От черновика PR до публичного чекпоинта
Утечка, если кратко: 6 августа 2026 года контрибьютор под ником KurodaKanbei — называющий себя аспирантом ETH Zürich, а не сотрудником Xiaohongshu — открыл pull request #51255 в vllm-project/vllm, добавив поддержку языковой модели «Dots3 NOTE». Пометка «черновик» была снята 7 августа в 13:55 UTC, и красноречивее всего были заметки о валидации в самом PR: автор запускал 8-GPU сервис DP8/EP8 «с чекпойнтом Dots3 NOTE FP8». Нельзя проверить FP8-чекпойнт, которого у тебя нет, — тот, кто написал этот PR, располагал реальной моделью. Он затрагивал 14 файлов, включая новый модуль vllm/models/dots3_note, и имел метки new-model и verified.
Все четыре сигнала, которые мы перечислили 8 августа, сработали, кроме самого важного. Репозиторий на Hugging Face появился — dots-studio/dots3-note-prev, Apache-2.0. Официальное объявление вышло — сам релиз открытого кода, сегодня. Стек инференса перестал быть черновиком: поддержка vLLM нативно встроена в main, а transformers и SGLang обе поддерживают dots3-note. Четвертый сигнал — независимая проверка математического результата 42/42 — по-прежнему остается невыполненным, но теперь он стал возможен так, как не был возможен никогда прежде, потому что веса открыты.
![Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).](https://cms.orcarouter.ai/api/media/file/2-11.png)
Что на самом деле было выпущено
Опубликованная карточка модели превращает выводы PR в спецификацию — и цифры берутся из собственной конфигурации чекпоинта, а не из сторонней сводки. Превью dots3-note — это модель со смесью экспертов:
• 280B всего / 16B активных параметров — 256 маршрутизируемых экспертов плюс один общий эксперт, маршрутизация top-8, на 1 плотном + 45 MoE-слоях с размером скрытого слоя 5,120.
• Окно контекста 512K токенов, словарь 152K, точность BF16 и FP8.
• Модуль многотокенного предсказания (MTP) — один общий слой с 1,13 млрд параметров, который параллельно предсказывает до трёх дополнительных токенов, что обеспечивает спекулятивное декодирование без отдельной модели-черновика.
• Мультимодальный ввод — текст, изображение, видео и аудио — создающий текстовый вывод. Визуальный энкодер представляет собой MoE ViT (7B всего / 1.2B активных), а аудио-энкодер — плотный 800M.
В примечании к объёму PR говорилось, что работы по vLLM охватывают «только LLM», а мультимодальные компоненты не входят в объём. Это касалось патча для инференса, а не модели: выпущенный чекпойнт включает зрительный и аудиоэнкодеры вместе с языковым ядром. Если вам нужна мультимодальная версия, вы смотрите на тот же репозиторий, обслуживаемый через пути transformers и SGLang, а не через путь vLLM только для LLM, который утёк первым.
Доступность, если конкретно: веса находятся в dots-studio/dots3-note-prev на Hugging Face под лицензией Apache-2.0; код и рецепты обслуживания — в репозитории studio-dots-ai/dots3-note-prev на GitHub; а хостинг-доступ осуществляется через собственный API-портал вендора и несколько сторонних платформ. Это первый выпуск с открытыми весами в семействе dots3 — формулировка «open-sourcing soon» (近期将开源), которую Xiaohongshu использовала в течение двух недель, согласно её заявлениям на китайском языке, наконец реализована.
Архитектура, которую утечка описала верно
В PR модель dots-note-3.0 описывалась как «структурно родственная DeepSeek-V3.2», но с сочетанием двух геометрий attention в одном стеке. Опубликованная конфигурация это подтверждает. В карточке модели 46 слоёв attention разбиты на 13 слоёв разрежённого attention в стиле DeepSeek (DSA) — с индексацией top-2048 — и 33 слоя скользящего окна attention (SWA), то есть примерно один разрежённый слой на каждые три плотных. Это и есть та самая структура «переход между разрежённым глобальным и плотным локальным», на которую намекало название ветки note-hopper, теперь зафиксированная прямо в чекпоинте.
Механически это та же идея, которую DeepSeek представила в V3.2: половина DSA — это лёгкий индексатор, который оценивает каждый кэшированный ключ относительно запроса, сохраняет короткий список top-k и вычисляет внимание по нему, а не по всему контексту — снижая квадратичную стоимость длинных последовательностей до примерно линейной. Половина со скользящим окном — это противовес: ограниченный диапазон плотного локального внимания, гарантирующий, что самые последние токены всегда полностью учитываются, независимо от того, что решает разреженный индексатор. Глобальное разреженное плюс плотное локальное в одной модели — это и была действительно необычная часть утечки — и теперь она подтверждена.
Остальная часть архитектуры — это знакомая механика семейства DeepSeek, как и говорилось в PR: негруппированный маршрутизатор MoE, sequence-parallel MoE, чанкованный prefill для длинного контекста, проверенный вплоть до полного окна 512K, и слой MTP, который по умолчанию использует внимание со скользящим окном для спекулятивного декодирования.
Рекорд 42/42 — и то, что теперь можно проверить
Сам результат IMO не меняется, как и его маркировка. 25 июля 2026 года Xiaohongshu объявила, что модель набрала идеальные 42/42 на официальном оценивании 67-й Международной математической олимпиады в Шанхае, где лишь 7 из 666 участников-людей повторили этот результат, а порог золотой медали составлял 29 баллов, — на 13 баллов выше золотой отметки и на 7 баллов выше результата Gemini Deep Think (35/42), предыдущего лучшего результата ИИ на официальном оценивании IMO. Это остаётся версией компании об официально оценённом соревновании: результат реален и подтверждён комитетом, но сопутствующие утверждения — как были получены задачи, как контролировались выборка и оценивание — никогда не проверялись независимо, поскольку никто за пределами лаборатории не мог запустить модель.
Это та часть, которую меняет релиз. С открытыми весами 42/42 — это уже не цифра, которую нужно принимать на веру или на слово из pull request; это результат, который третья сторона может попытаться воспроизвести, и это самое ценное, что можно проверить в этом релизе. Он также остаётся спорным по краям, как и две недели назад: китайские издания сообщили, что Celia от Huawei тоже набрала 42/42 в той же оценке, так что dots-note-3.0 — один из первых, а не первый; и заявление партнёра Menlo Ventures в X о том, что OpenAI, Anthropic, Axiom Math и Kimi K3 от Moonshot также достигли 42/42 в этом году, всё ещё остаётся непроверенным постом в соцсетях без каких-либо данных об оценке за ним.
Компания также опубликовала свежие заявления о бенчмарках вместе с релизом — все они предоставлены вендором и пока никем не воспроизведены. На бенчмарке ARC-AGI 3 Dots утверждает, что dots3-note preview набирает около 0,35 при заявленной стоимости тестового прогона менее $500. По наборам задач на рассуждение и агентские сценарии, включая WebShop, HotpotQA и ALFWorld, она заявляет, что модель не уступает или превосходит модели с в несколько раз большим числом активных параметров, а зрение у неё заметно выделяется для её размера. Это цифры Dots о собственной модели — относитесь к ним соответственно, пока нейтральная лаборатория не перепроверит их.
Dots также выпустила два оценочных стенда, созданных для этого класса задач, и открытие их исходного кода почти так же полезно, как и сама модель. VibeLifeBench запускает 200 задач в 22 симулированных сервисах и 288 интерфейсах инструментов, проверяя 1247 атомарных условий на то, сохраняет ли агент согласованность, когда среда меняется в середине задачи; согласно собственным результатам Dots, сильнейшая из протестированных на данный момент моделей набирает лишь 32.5 avg@3, а большинство ведущих моделей с закрытыми весами полностью проваливаются. VibeSearchBench уже — 20 доменов, 200 задач, проверяющих, запрашивает ли агент уточнение при неоднозначном запросе. Оба несут ту же заявленную разработчиком метку, что и показатель ARC-AGI, но стенды открыты для публики, что делает результат 32.5 опровержимым, а не риторическим.
Почему это агентная модель, а не математическая модель
Ни утечка, ни оценка IMO не должны вводить вас в заблуждение относительно предназначения этой модели. Позиционирование релиза строится не вокруг математики — это долгосрочные открытые задачи: персонализированное планирование путешествий, подготовка к свадьбе, управление небольшим магазином, ремонт дома. Задачи без единственного правильного ответа, цели которых меняются в процессе, а горизонт — часы или дни. Это намеренно иной набор бенчмарков, чем таблицы лидеров по математике и программированию, и именно здесь дизайнерские решения dots3-note — контекст в 512K, файл памяти, цикл самокритики — действительно окупаются.
В опубликованных материалах особенно выделяются три техники. Во-первых, модель ведёт файл памяти (memory.md) как текущую сводку состояния окружения — так она сохраняет контекст в ходе длительного открытого сеанса. Во-вторых, она использует механизм «самокритики» — ту же рекурсивную самопроверку, которая, как описывалось, применялась в решении IMO, — чтобы выявлять и исправлять собственные промежуточные шаги. В-третьих, рецепт обучения называется TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): модель разбивает длинные траектории на макрошаги и чередует роли актёра и критика, чтобы генерировать собственный обучающий сигнал; как сообщается, именно поэтому её можно оптимизировать на задачах без эталонного ответа.
Практические демонстрации вендора — это суть заявления: прохождение колодостроителя Slay the Spire II до 33-го этажа, решение всех шести уровней ARC-AGI 3 за 320 шагов, разбор задачи на пространственное мышление, связанной с ремонтом дома, и создание visionOS-приложения от начала до конца (12 файлов Swift, 1 876 строк, «BUILD SUCCEEDED»). Относитесь к ним как к демонстрациям, а не бенчмаркам — но это демонстрации конкретной вещи: модели, которая удерживает в голове одну цель и выполняет много шагов, не теряя нити, а именно этой способности сейчас больше всего не хватает на рынке агентов.
Стоимость, самостоятельный хостинг и как попробовать
Открытые веса бесплатны; стоимость превью dots3-note зависит от того, где вы его развёртываете. Эталонный рецепт vLLM для чекпоинта FP8 работает на восьми NVIDIA H100 с тензорным параллелизмом 8 и параллелизмом экспертов 8 — это реальная строка бюджета, а не модель для ноутбука. Команды, у которых есть такое железо, получают весь стек, включая спекулятивное декодирование MTP на 3 токена и парсер вызовов инструментов dots, который поставляется в рантаймах. Все остальные будут работать с ним через хостинг: портал API вендора уже работает, а хостируемые превью-эндпоинты заработали на сторонних платформах в тот же день, когда вышли веса, — 14 августа. Превью-тариф указан как $0 за токен на платформах, которые его обслуживают, согласно собственным описаниям этих платформ, а не странице цен вендора, так что фактическая стоимость попытки опробовать превью dots3-note в продакшене сегодня практически равна нулю, пока действует метка превью.
Для разработчиков аргумент двухнедельной давности о том, чтобы дёшево поставить на непроверенную модель, теперь читается как аргумент об оценке только что выпущенной — паттерн тот же. Направьте часть трафика на новую модель за автоматическим аварийным переключением, чтобы неожиданный режим отказа обрушил тестовый путь, а не продакшен. Это то, для чего и нужен роутер, и это честная версия питча: на момент написания dots3-note preview не размещён на OrcaRouter, и никто не должен делать вид, что это не так. Но подход к маршрутизации, о котором мы писали в материале про утечку, применим с того дня, когда это произойдёт: один API, который достаёт новую модель в тот момент, когда провайдер её размещает, с ценами из прайс-листа провайдера без наценки и аварийным переключением, настраиваемым на каждый запрос. Тем временем модели семейства DeepSeek, к которым эта структурно близка, уже можно вызывать так: DeepSeek V4 Flash и DeepSeek V4 Pro обе доступны по одному ключу, с тем же принципом передачи цен без наценки и аварийным переключением на каждый запрос — разумная точка отсчёта, чтобы судить, как агентная модель с 16B активными параметрами вроде dots3-note preview на самом деле ведёт себя в продакшене.

Что посмотреть дальше
Четыре вещи, примерно в порядке того, насколько сильно они могут изменить картину:
• Независимое воспроизведение результата 42/42. Веса опубликованы; первый серьёзный сторонний повторный прогон результата IMO — или нейтральный оценочный пакет, который ему противоречит, — это самый ценный единичный показатель, который может дать этот релиз. До тех пор 42/42 остаётся официально оценённым результатом, заявленным компанией.
• Старшие собратья, jazz и aria. dots3-note preview — это первый публичный релиз и, по словам компании, самый лёгкий представитель семейства dots3. Если 280B всего / 16B активных — это малая модель, то две более крупные модели — это то, где на самом деле будут проверяться заявления о передовом уровне.
• Лимиты размещённых моделей и условия предварительной версии. Цена теперь публична — предварительный тариф бесплатен за токен на платформах, которые его предоставляют, — но лимиты запросов и то, предусматривает ли тег preview особые условия, по-прежнему будут определять, кто будет разворачивать модель самостоятельно, а кто вызывать её через API.
• Где он окажется в независимых рейтингах. Заявленные вендором показатели ARC-AGI и агентских наборов требуют нейтральной оценки, чтобы стать достоверными фактами, — это тот же процесс, который отделил шумиху от реальности в каждом открытом релизе в этом году.
Когда мы освещали утечку в августе, честное резюме было кратким: реальная архитектура, реальные данные, нет весов, нет даты. Три из этих четырёх оговорок уже неактуальны. Архитектура публична, данные привязаны к загружаемому чекпоинту, и дата наступила. Остаётся лишь проверка — и теперь, когда preview dots3-note можно запустить, а не читать о нём, ответ на вопрос, построила ли Xiaohongshu ту агентную модель, о которой заявляет, придёт от любого, у кого есть восемь H100 и бенчмарк-харнесс, а не от пулл-реквеста.
