Сгенерированная hero-карточка под названием MiniMax M3.1, со значком «НЕ ПОДТВЕРЖДЕНО — ЕЩЁ НЕ ВЫПУЩЕНО» и подзаголовком «Приватный чекпоинт на 250 ГБ, утёкшая заметка об архитектуре и вендор, который ничего не сказал». На трёх чипах указано: «Чекпоинт: MiniMax-M3.1-preview-private», «62 файла / 48 safetensors / 250 ГБ» и «Окно наблюдения: неделя 28 сентября 2026». Левая карточка гласит: «Утверждение: разреженное внимание, внимание Q8KV4, эксперты NVFP4, спекулятивное декодирование DSpark и новое поле reasoning_effort»; правая карточка гласит: «Запуск не подтверждён: нет весов, нет карточки модели, нет страницы с ценами, нет идентификатора модели в API». Логотип OrcaRouter расположен в правом нижнем углу.
Guides & Insights

MiniMax M3.1: что говорят слитые документы предварительного просмотра — и что никто не подтвердил

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

На Hugging Face есть 250-ГБ чекпоинт под названием MiniMax-M3.1-preview-private, который никто за пределами нескольких партнёров по инференсу открыть не может. Есть документ, датированный 22 сентября, который читается в точности как архитектурная заметка вендора и циркулирует в публичном инженерном репозитории партнёров, а не на собственном сайте вендора. А 26 сентября широко читаемый наблюдатель за моделями опубликовал, что MiniMax M3.1 — «следующая грядущая модель на предстоящую неделю» и что он уже тестирует её превью. Сложите эти три вещи вместе — и вы получите всю публичную летопись MiniMax M3.1: модели, чьё название, архитектурные изменения, число весов и неделя появления уже в обороте, и при этом вендор публично не сказал ни слова ни об одном из этих пунктов. Предшественник, от которого она происходит, MiniMax M3, — совсем другая история: он вышел, и именно поэтому кому-либо вообще есть дело до этой.

Вот как невыпущенная модель выглядит снаружи, и стоит быть точными в отношении формы доказательств, потому что три линии не одинаково сильны. Существование чекпойнта подтверждается: несколько независимых источников указывают на одно и то же название приватного репозитория и одинаковое количество файлов. Документ об архитектуре так не подтверждается — это расшифровка третьей стороны, и он может быть подлинным, устаревшим или частично выдуманным. Утверждение о «следующей неделе» — это ожидание человека, а не график. Всё в этой статье помечено по той силе, которой оно фактически обладает, и ничто здесь не следует читать как анонс релиза.

Причина, по которой MiniMax M3.1 заслуживает статьи ещё до своего появления, — это предшественник. По большинству оценок, MiniMax M3 был самой сильной моделью с открытыми весами, выпущенной MiniMax, — моделью с контекстом в 1 млн токенов, работающей с текстом, изображениями и видео, которая достигла показателя 29,2 в Artificial Analysis Intelligence Index и до сих пор остаётся одной из немногих открытых моделей, способных сохранять связность на действительно длинном контексте. Если M3.1 выйдет в последнюю неделю сентября, то цифры, которые важны разработчику, — это не правдоподобность утечки, а то, что изменилось в слоях, и во сколько обходится его обслуживание, — и по обоим этим пунктам слитый документ на удивление конкретен.

Что подтверждено, а что лишь циркулирует

Честное разделение по состоянию на 27 сентября 2026 года:

• Подтверждено: публичной версии MiniMax M3.1 не существует. Организация MiniMaxAI на Hugging Face возвращает 401 — ответ платформы «не найдено или не видно вам» — одинаково для MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview и MiniMaxAI/MiniMax-M3.1-preview-private. Её самые новые публичные загрузки — по-прежнему MiniMax-Music3 (7 августа 2026 г.) и MiniMax-H3 (28 июля 2026 г.).

• Подтверждено: MiniMax M3.1 невозможно маршрутизировать нигде, где мы можем это проверить. Он отсутствует в каталоге моделей OrcaRouter и в публичных списках, которые мы отслеживаем; модель MiniMax, которую вы действительно можете вызвать сегодня, — это MiniMax M3, доступная по адресу minimax/minimax-m3.

• Подтверждено: MiniMax ничего не опубликовала. Ни карточки модели, ни поста в блоге, ни страницы с ценами, ни весов, ни идентификатора модели API. Запуск не освещался в прессе, потому что запуска не было.

• В обращении: документ по архитектуре. Он дословно воспроизведён в публичном репозитории — longsco/innoferra-eval, наборе для подключения партнёров к хостируемым конечным точкам моделей, созданном 23 сентября 2026 года, — под именем файла PREVIEW-20260922.md, с заголовком, описывающим его как документ поставщика, предоставленный 25 сентября, и с оговоркой: «название модели, дата выпуска провайдером и публичный запуск остаются зависящими от фактического релиза». Это собственная оговорка документа, а не наша, и она верна: копия документа поставщика, сделанная третьей стороной, не является заявлением MiniMax.

• В обращении: чекпойнт на 250 ГБ и его второй дроп. Спецификация онбординга репозитория фиксирует приватный мультимодальный чекпойнт в MiniMaxAI/MiniMax-M3.1-preview-private — 62 файла, 48 файлов safetensors, примерно 250 ГБ, строка архитектуры MiniMaxM3SparseForConditionalGeneration — а затем более крупный второй дроп, MiniMax-M3.1-preview2-dspark-private, на 101 файл и около 236 ГБ, который добавил спекулятивный драфт fp8 объёмом 2,3 ГБ. Оба приватные. Мы не можем открыть ни один из них, и вы тоже.

• В обращении: хронология. Публикация от 26 сентября — единственная публичная датировка, которую кто-либо предлагал, а «предстоящая неделя» — это ожидание. Рассматривайте неделю с 28 сентября как окно для наблюдения, а не как дату.

Единственный документ, в котором есть инженерные подробности

A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'

Все конкретные сведения об устройстве MiniMax M3.1 восходят к тому единственному markdown-файлу плюс к двум сопутствующим материалам в том же репозитории: демонстрационному документу SGLang, описывающему, как предполагается обслуживать этот чекпойнт, и spec.yaml, которому, как предполагается, должен соответствовать партнёрский эндпоинт. Если читать репозиторий целиком, он выглядит как провайдер инференса, делающий ровно то, что делает провайдер инференса, — получает ранний дроп от MiniMax, записывает, что изменилось, и строит для него набор проверок. Репозиторий — не пресс-кит, и он написан не для того, чтобы кого-то убеждать.

Это довод в его пользу — и одновременно предел того, что оно доказывает. Ничто в нём не подписано MiniMax. Три документа согласуются друг с другом так, как согласуются настоящие документы, — одни и те же константы квантования, одни и те же имена переменных среды, одни и те же флаги запуска, — и расходятся так, как расходятся настоящие дропы: в предварительной версии от 22 сентября сказано, что у нового метода спекулятивного декодирования нет головы уверенности, а во втором дропе чекпоинта шла черновая конфигурация, в которой enable_confidence_head установлен в true. Подделка обычно не включала бы дугу исправлений. Но «необычайно связно» — не то же самое, что «подтверждено», и типичная ошибка читателя — принять приведённые ниже константы за опубликованный дизайн MiniMax, тогда как они в лучшем случае являются приватным дизайном MiniMax в чьём-то чужом прочтении.

Пять инженерных изменений, согласно тому документу

Вот разница между MiniMax M3 и MiniMax M3.1, как её описывает документ. Каждая строка получена от вендора и не проверена — ни одна независимая сторона не измеряла выходные данные MiniMax M3.1 какого-либо рода.

• Охват внимания. Полное внимание в первых трёх слоях заменяется разреженным вниманием, поэтому все слои являются разреженными. В MiniMax M3 первые три слоя служили якорем полного внимания в разреженном стеке.

• Точность внимания — «Q8KV4». Запросы, включая запросы индексатора, выходят из проекции в BF16 и приводятся к FP8 E4M3. Ключи и значения — снова включая принадлежащие индексатору — квантуются в E2M1, четырёхбитный формат, блоками по 16, с поблочным масштабом E4M3, равным amax/6, ограниченным диапазоном [1/512, 448]. В документе особо подчёркивается, что лестница использует округление по правилу «половина к чётному» с асимметричными порогами, что внешний масштаб тензора равен ровно 1 и что нулевая величина должна кодироваться как положительный ноль. M3 использовал восьмибитный тракт KV того же семейства, так что это снова вдвое уменьшает число байтов KV.

• Точность экспертов. Маршрутизируемые эксперты MoE переходят с MXFP8 на W4A4 NVFP4, при этом общий эксперт намеренно исключён. Для двух проекций экспертов используются разные схемы активации: FC1 использует динамический построчный масштаб, равный 2688, делённому на абсолютный максимум строки, причём построчный масштаб применяется после GEMM, но до функции активации; FC2 использует фиксированный внешний масштаб 16. Практическое следствие, прямо прописанное в README партнёра, звучит без обиняков: «провайдер, который прогоняет чекпоинт через стандартный путь NVFP4 без них, будет молча выдавать другие численные результаты».

• Спекулятивное декодирование. Голова многотокенного предсказания в стиле EAGLE исчезла — её заменил метод, который MiniMax называет DSpark: обычная марковская голова, а в документе от 22 сентября — без головы уверенности. Это изменение сильнее всего влияет на то, как ощущается обслуживаемый эндпоинт, потому что это единственный в архитектуре рычаг скорости на поток. Демонстрационный движок, который MiniMax выпустил вместе с чекпойнтом, не включает DSpark, и провайдер измерил разрыв: на том же фрейме в 80 000 токенов без спекуляции пропускная способность на поток составляет 63,9 токена в секунду при параллелизме 1 и падает ниже 60 к параллелизму 4, поэтому вывод самого документа таков: без DSpark стек не может удерживать целевой показатель задержки под нагрузкой.

• Новое поле запроса. MiniMax M3.1 добавляет поле верхнего уровня reasoning_effort, принимающее значения max, xhigh, high, medium или low, которое шаблон чата внедряет в системный промпт как тег усилия. У M3 был только переключатель thinking со значениями adaptive и disabled. В документе странно и отдельно отмечается, что поле передаётся без валидации и без обязательного значения по умолчанию — что провайдер истолковал как разрешение либо принимать, либо отклонять значение, не указанное в списке, и что означает, что два соответствующих требованиям эндпоинта могут вести себя по-разному при одном и том же запросе.

A generated single-column infographic titled 'MiniMax M3.1 — the scoreboard', listing six vendor-document deltas: 'Attention: all layers sparse', 'KV precision: Q8KV4, E2M1 blocks of 16', 'Routed experts: W4A4 NVFP4', 'Spec-decode: DSpark, no confidence head', 'Reasoning control: reasoning_effort max to low', and 'Benchmarks: none published'. A footer reads 'MiniMax M3.1 terms per a 2026-09-22 vendor preview document cited in partner engineering notes; unaudited, no independent scores exist.' The OrcaRouter logo sits bottom-right.

Две детали в чекпойнте стоит отметить отдельно, потому что такие вещи обычно опускают в посте о запуске. Во-первых, чекпойнт поставляется и с конфигурацией препроцессора изображений, и с конфигурацией препроцессора видео — MiniMax M3.1 по своей конструкции является мультимодальной моделью, а не текстовой моделью, к которой позже прикрутили зрение, и рекомендация самого провайдера — не отклонять входные изображения в новом стеке. Во-вторых, второй выпуск чекпойнта полностью удалил ключи MTP и NEXTN и не добавил ничего, что их заменяло бы, поэтому драфт DSpark пришлось выпустить как отдельный артефакт размером 2,3 ГБ. В основных весах нет драфт-головы, которую можно было бы включить.

Почему нет результатов бенчмарков M3.1 и почему это не упущение

Каждая заметка об утечке рано или поздно доходит до места, где либо выдумывает таблицу бенчмарков, либо признаёт, что её нет. У MiniMax M3.1 её нет. В партнёрской спецификации об этом сказано прямо — в поле, которое существует исключительно для того, чтобы кто-то не совершил эту ошибку:

• «Базовые показатели для 3.1 ещё не опубликованы; не используйте цифры M3 в качестве критериев приёмки.»

Эта инструкция — самое полезное предложение во всём корпусе, потому что ленивая версия этой статьи записывает оценки MiniMax M3 в Artificial Analysis под заголовком MiniMax M3.1. А она не должна. Тот же репозиторий запускает пробы AIME-25 и GPQA-Diamond против собственного эндпоинта MiniMax M3.1 и записывает их как сравнения «участник команды против поставщика» при ещё не устоявшихся оценках: на GPQA-Diamond — 0,904 для запуска команды против 0,813 для запуска поставщика, а на подмножестве MMLU-Pro из 600 вопросов — 0,898 против 0,821. Это два расходящихся запуска одной и той же оценки, а не результат модели, и они помечены как превью с учётом повторов. Любой, кто сегодня цитирует единственную цифру бенчмарка MiniMax M3.1, цитирует то, чего ещё не существует.

Что такое MiniMax M3, чтобы можно было оценить масштаб сиквела

MiniMax M3 вышел в конце мая 2026 года и появился на Hugging Face 2 июня — 428 млрд общих параметров при 23 млрд активных, 60 слоёв, 128 маршрутизируемых экспертов с маршрутизацией top-4, 4 головы KV против 64 голов внимания и контекстное окно в 1 048 576 токенов при максимальном выводе 512 000. Что касается независимых оценок, Artificial Analysis присуждает ему 29,2 балла в Intelligence Index, ставя его на 60-е место из 145 отобранных моделей, с 58,6 в индексе программирования и p50 в 3 348 миллисекунд до первого токена в нашей собственной телеметрии маршрутизации. Собственная ключевая цифра MiniMax для него — 83,5 в BrowseComp, что является показателем вендора и как таковое не прошло аудит.

Цены — это то, что лучше всего сохраняет актуальность в цикле утечек. MiniMax M3 стоит $0.30 за миллион входных токенов и $1.20 за миллион выходных токенов, при этом чтение из кэша стоит $0.06, и она уже доступна на OrcaRouter как minimax/minimax-m3, по цене из прайс-листа провайдера с наценкой 0%, так что если MiniMax назначит на M3.1 такую же цену, новый тариф будет доступен у нас в тот же день, когда он появится, а не спустя цикл выставления счетов.

Смысл повторения всего этого — не ностальгия. Он в том, что единственная причина, по которой кто-либо на этой неделе обновляет страницу организации Hugging Face, — это то, что MiniMax M3 была достаточно хороша, поэтому её преемник стал вопросом продакшена, а не просто зрелищем, — и что модель с 428 миллиардами параметров и контекстом 1M по цене $0.30/$1.20 задаёт планку по соотношению цена/производительность, которую M3.1 должна преодолеть, а не только планку по возможностям.

Аспект анонимного листинга — и почему на него, возможно, уже ответили

Одну тему из начала сентября стоит здесь закрыть. На сторонней платформе для программирования появился анонимный стелс-листинг с контекстом в 1 000 000 токенов, ценой $0 и обязательными уровнями рассуждений, и мы освещали его под именем Space Bunny Alpha, отметив базовую частоту, с которой любой анонимный листинг такого рода в итоге оказывается чьим-то вендорским релизом — Pony Alpha стал моделью Zhipu, Hunter Alpha — моделью Xiaomi, Ox Alpha — релизом MiniMax под другим названием. Токенизатор и отпечатки аномалий в том листинге указывали на предварительный чекпоинт MiniMax. Если MiniMax M3.1 действительно появится на этой неделе, наиболее вероятная трактовка состоит в том, что анонимный листинг был его полевым тестом, и тайна разрешится объявлением, а не дальнейшими форензическими изысканиями. Это умозаключение, а не доказательство, и это последнее умозаключение в этом материале.

A headless Chromium screenshot of OrcaRouter's own model page for minimax/minimax-m3, showing the breadcrumb 'Models - MiniMax: MiniMax M3', a summary describing a 428B-parameter MoE with 23B active parameters and a 1M-token context window powered by MiniMax Sparse Attention, a PERFORMANCE panel reading Avg Latency 3.2 s, Throughput 210.9 tok/s, Uptime 100.00%, Total Tokens 89.8M and Error Rate 0.13%, a MiniMax provider card reading 92.07M tokens routed in 7 days, P50 TTFT 4.26s and P95 TTFT 10.00s, and the listing rows 1,048,576 Context window, $0.30/M input and $1.20/M output.

На что обратить внимание и что делать на этой неделе

Сигналы, которые превратили бы это из утечки в запуск, конкретны и проверяемы, и это не те, на которые обычно ориентируются комментарии. Публичный репозиторий Hugging Face в организации MiniMaxAI — а не приватный — с карточкой модели — самый сильный отдельный индикатор; история загрузок организации открыта и датирует каждый релиз с точностью до дня. Страница модели MiniMax или идентификатор модели в API — второй. Опубликованная цена — третий, и именно он важен для бюджета. Таблица бенчмарков на Artificial Analysis, датированная после релиза, — четвёртый, и единственный, который является независимым.

До тех пор практическая позиция для любого, кто что-то создаёт, не отличается от любой другой недели перед релизом: модель, которую вы можете использовать сегодня, — это MiniMax M3, один API-ключ открывает доступ к ней наряду с более чем 200 другими моделями, автоматическое переключение при сбое означает, что сбой эндпоинта не становится вашим простоем, а закреплённый или смешанный маршрут через DSL маршрутизации или пул моделей, отвечающих вместе через объединение моделей, — это способ снизить риски для модели, которую вы ещё не запустили в продакшен. Если M3.1 появится, это будет замена одного идентификатора модели, а не миграция — и в этом весь аргумент против создания кастомной интеграции на основе утечки.

Одно эта статья точно не будет делать — притворяться, что знает, когда. Контрольная точка реальна, документы конкретны, а самое последнее публичное утверждение — это слова одного человека: «на следующей неделе». Из этих трёх только первые два можно проверить самостоятельно.