
MiniMax M3.1: что говорят слитые документы предварительного просмотра — и что никто не подтвердил
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 434 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 183 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
На Hugging Face есть 250-ГБ чекпоинт под названием MiniMax-M3.1-preview-private, который никто за пределами нескольких партнёров по инференсу открыть не может. Есть документ, датированный 22 сентября, который читается в точности как архитектурная заметка вендора и циркулирует в публичном инженерном репозитории партнёров, а не на собственном сайте вендора. А 26 сентября широко читаемый наблюдатель за моделями опубликовал, что MiniMax M3.1 — «следующая грядущая модель на предстоящую неделю» и что он уже тестирует её превью. Сложите эти три вещи вместе — и вы получите всю публичную летопись MiniMax M3.1: модели, чьё название, архитектурные изменения, число весов и неделя появления уже в обороте, и при этом вендор публично не сказал ни слова ни об одном из этих пунктов. Предшественник, от которого она происходит, MiniMax M3, — совсем другая история: он вышел, и именно поэтому кому-либо вообще есть дело до этой.
Вот как невыпущенная модель выглядит снаружи, и стоит быть точными в отношении формы доказательств, потому что три линии не одинаково сильны. Существование чекпойнта подтверждается: несколько независимых источников указывают на одно и то же название приватного репозитория и одинаковое количество файлов. Документ об архитектуре так не подтверждается — это расшифровка третьей стороны, и он может быть подлинным, устаревшим или частично выдуманным. Утверждение о «следующей неделе» — это ожидание человека, а не график. Всё в этой статье помечено по той силе, которой оно фактически обладает, и ничто здесь не следует читать как анонс релиза.
Причина, по которой MiniMax M3.1 заслуживает статьи ещё до своего появления, — это предшественник. По большинству оценок, MiniMax M3 был самой сильной моделью с открытыми весами, выпущенной MiniMax, — моделью с контекстом в 1 млн токенов, работающей с текстом, изображениями и видео, которая достигла показателя 29,2 в Artificial Analysis Intelligence Index и до сих пор остаётся одной из немногих открытых моделей, способных сохранять связность на действительно длинном контексте. Если M3.1 выйдет в последнюю неделю сентября, то цифры, которые важны разработчику, — это не правдоподобность утечки, а то, что изменилось в слоях, и во сколько обходится его обслуживание, — и по обоим этим пунктам слитый документ на удивление конкретен.
Что подтверждено, а что лишь циркулирует
Честное разделение по состоянию на 27 сентября 2026 года:
• Подтверждено: публичной версии MiniMax M3.1 не существует. Организация MiniMaxAI на Hugging Face возвращает 401 — ответ платформы «не найдено или не видно вам» — одинаково для MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview и MiniMaxAI/MiniMax-M3.1-preview-private. Её самые новые публичные загрузки — по-прежнему MiniMax-Music3 (7 августа 2026 г.) и MiniMax-H3 (28 июля 2026 г.).
• Подтверждено: MiniMax M3.1 невозможно маршрутизировать нигде, где мы можем это проверить. Он отсутствует в каталоге моделей OrcaRouter и в публичных списках, которые мы отслеживаем; модель MiniMax, которую вы действительно можете вызвать сегодня, — это MiniMax M3, доступная по адресу minimax/minimax-m3.
• Подтверждено: MiniMax ничего не опубликовала. Ни карточки модели, ни поста в блоге, ни страницы с ценами, ни весов, ни идентификатора модели API. Запуск не освещался в прессе, потому что запуска не было.
• В обращении: документ по архитектуре. Он дословно воспроизведён в публичном репозитории — longsco/innoferra-eval, наборе для подключения партнёров к хостируемым конечным точкам моделей, созданном 23 сентября 2026 года, — под именем файла PREVIEW-20260922.md, с заголовком, описывающим его как документ поставщика, предоставленный 25 сентября, и с оговоркой: «название модели, дата выпуска провайдером и публичный запуск остаются зависящими от фактического релиза». Это собственная оговорка документа, а не наша, и она верна: копия документа поставщика, сделанная третьей стороной, не является заявлением MiniMax.
• В обращении: чекпойнт на 250 ГБ и его второй дроп. Спецификация онбординга репозитория фиксирует приватный мультимодальный чекпойнт в MiniMaxAI/MiniMax-M3.1-preview-private — 62 файла, 48 файлов safetensors, примерно 250 ГБ, строка архитектуры MiniMaxM3SparseForConditionalGeneration — а затем более крупный второй дроп, MiniMax-M3.1-preview2-dspark-private, на 101 файл и около 236 ГБ, который добавил спекулятивный драфт fp8 объёмом 2,3 ГБ. Оба приватные. Мы не можем открыть ни один из них, и вы тоже.
• В обращении: хронология. Публикация от 26 сентября — единственная публичная датировка, которую кто-либо предлагал, а «предстоящая неделя» — это ожидание. Рассматривайте неделю с 28 сентября как окно для наблюдения, а не как дату.
Единственный документ, в котором есть инженерные подробности
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
Все конкретные сведения об устройстве MiniMax M3.1 восходят к тому единственному markdown-файлу плюс к двум сопутствующим материалам в том же репозитории: демонстрационному документу SGLang, описывающему, как предполагается обслуживать этот чекпойнт, и spec.yaml, которому, как предполагается, должен соответствовать партнёрский эндпоинт. Если читать репозиторий целиком, он выглядит как провайдер инференса, делающий ровно то, что делает провайдер инференса, — получает ранний дроп от MiniMax, записывает, что изменилось, и строит для него набор проверок. Репозиторий — не пресс-кит, и он написан не для того, чтобы кого-то убеждать.
Это довод в его пользу — и одновременно предел того, что оно доказывает. Ничто в нём не подписано MiniMax. Три документа согласуются друг с другом так, как согласуются настоящие документы, — одни и те же константы квантования, одни и те же имена переменных среды, одни и те же флаги запуска, — и расходятся так, как расходятся настоящие дропы: в предварительной версии от 22 сентября сказано, что у нового метода спекулятивного декодирования нет головы уверенности, а во втором дропе чекпоинта шла черновая конфигурация, в которой enable_confidence_head установлен в true. Подделка обычно не включала бы дугу исправлений. Но «необычайно связно» — не то же самое, что «подтверждено», и типичная ошибка читателя — принять приведённые ниже константы за опубликованный дизайн MiniMax, тогда как они в лучшем случае являются приватным дизайном MiniMax в чьём-то чужом прочтении.
Пять инженерных изменений, согласно тому документу
Вот разница между MiniMax M3 и MiniMax M3.1, как её описывает документ. Каждая строка получена от вендора и не проверена — ни одна независимая сторона не измеряла выходные данные MiniMax M3.1 какого-либо рода.
• Охват внимания. Полное внимание в первых трёх слоях заменяется разреженным вниманием, поэтому все слои являются разреженными. В MiniMax M3 первые три слоя служили якорем полного внимания в разреженном стеке.
• Точность внимания — «Q8KV4». Запросы, включая запросы индексатора, выходят из проекции в BF16 и приводятся к FP8 E4M3. Ключи и значения — снова включая принадлежащие индексатору — квантуются в E2M1, четырёхбитный формат, блоками по 16, с поблочным масштабом E4M3, равным amax/6, ограниченным диапазоном [1/512, 448]. В документе особо подчёркивается, что лестница использует округление по правилу «половина к чётному» с асимметричными порогами, что внешний масштаб тензора равен ровно 1 и что нулевая величина должна кодироваться как положительный ноль. M3 использовал восьмибитный тракт KV того же семейства, так что это снова вдвое уменьшает число байтов KV.
• Точность экспертов. Маршрутизируемые эксперты MoE переходят с MXFP8 на W4A4 NVFP4, при этом общий эксперт намеренно исключён. Для двух проекций экспертов используются разные схемы активации: FC1 использует динамический построчный масштаб, равный 2688, делённому на абсолютный максимум строки, причём построчный масштаб применяется после GEMM, но до функции активации; FC2 использует фиксированный внешний масштаб 16. Практическое следствие, прямо прописанное в README партнёра, звучит без обиняков: «провайдер, который прогоняет чекпоинт через стандартный путь NVFP4 без них, будет молча выдавать другие численные результаты».
• Спекулятивное декодирование. Голова многотокенного предсказания в стиле EAGLE исчезла — её заменил метод, который MiniMax называет DSpark: обычная марковская голова, а в документе от 22 сентября — без головы уверенности. Это изменение сильнее всего влияет на то, как ощущается обслуживаемый эндпоинт, потому что это единственный в архитектуре рычаг скорости на поток. Демонстрационный движок, который MiniMax выпустил вместе с чекпойнтом, не включает DSpark, и провайдер измерил разрыв: на том же фрейме в 80 000 токенов без спекуляции пропускная способность на поток составляет 63,9 токена в секунду при параллелизме 1 и падает ниже 60 к параллелизму 4, поэтому вывод самого документа таков: без DSpark стек не может удерживать целевой показатель задержки под нагрузкой.
• Новое поле запроса. MiniMax M3.1 добавляет поле верхнего уровня reasoning_effort, принимающее значения max, xhigh, high, medium или low, которое шаблон чата внедряет в системный промпт как тег усилия. У M3 был только переключатель thinking со значениями adaptive и disabled. В документе странно и отдельно отмечается, что поле передаётся без валидации и без обязательного значения по умолчанию — что провайдер истолковал как разрешение либо принимать, либо отклонять значение, не указанное в списке, и что означает, что два соответствующих требованиям эндпоинта могут вести себя по-разному при одном и том же запросе.

Две детали в чекпойнте стоит отметить отдельно, потому что такие вещи обычно опускают в посте о запуске. Во-первых, чекпойнт поставляется и с конфигурацией препроцессора изображений, и с конфигурацией препроцессора видео — MiniMax M3.1 по своей конструкции является мультимодальной моделью, а не текстовой моделью, к которой позже прикрутили зрение, и рекомендация самого провайдера — не отклонять входные изображения в новом стеке. Во-вторых, второй выпуск чекпойнта полностью удалил ключи MTP и NEXTN и не добавил ничего, что их заменяло бы, поэтому драфт DSpark пришлось выпустить как отдельный артефакт размером 2,3 ГБ. В основных весах нет драфт-головы, которую можно было бы включить.
Почему нет результатов бенчмарков M3.1 и почему это не упущение
Каждая заметка об утечке рано или поздно доходит до места, где либо выдумывает таблицу бенчмарков, либо признаёт, что её нет. У MiniMax M3.1 её нет. В партнёрской спецификации об этом сказано прямо — в поле, которое существует исключительно для того, чтобы кто-то не совершил эту ошибку:
• «Базовые показатели для 3.1 ещё не опубликованы; не используйте цифры M3 в качестве критериев приёмки.»
Эта инструкция — самое полезное предложение во всём корпусе, потому что ленивая версия этой статьи записывает оценки MiniMax M3 в Artificial Analysis под заголовком MiniMax M3.1. А она не должна. Тот же репозиторий запускает пробы AIME-25 и GPQA-Diamond против собственного эндпоинта MiniMax M3.1 и записывает их как сравнения «участник команды против поставщика» при ещё не устоявшихся оценках: на GPQA-Diamond — 0,904 для запуска команды против 0,813 для запуска поставщика, а на подмножестве MMLU-Pro из 600 вопросов — 0,898 против 0,821. Это два расходящихся запуска одной и той же оценки, а не результат модели, и они помечены как превью с учётом повторов. Любой, кто сегодня цитирует единственную цифру бенчмарка MiniMax M3.1, цитирует то, чего ещё не существует.
Что такое MiniMax M3, чтобы можно было оценить масштаб сиквела
MiniMax M3 вышел в конце мая 2026 года и появился на Hugging Face 2 июня — 428 млрд общих параметров при 23 млрд активных, 60 слоёв, 128 маршрутизируемых экспертов с маршрутизацией top-4, 4 головы KV против 64 голов внимания и контекстное окно в 1 048 576 токенов при максимальном выводе 512 000. Что касается независимых оценок, Artificial Analysis присуждает ему 29,2 балла в Intelligence Index, ставя его на 60-е место из 145 отобранных моделей, с 58,6 в индексе программирования и p50 в 3 348 миллисекунд до первого токена в нашей собственной телеметрии маршрутизации. Собственная ключевая цифра MiniMax для него — 83,5 в BrowseComp, что является показателем вендора и как таковое не прошло аудит.
Цены — это то, что лучше всего сохраняет актуальность в цикле утечек. MiniMax M3 стоит $0.30 за миллион входных токенов и $1.20 за миллион выходных токенов, при этом чтение из кэша стоит $0.06, и она уже доступна на OrcaRouter как minimax/minimax-m3, по цене из прайс-листа провайдера с наценкой 0%, так что если MiniMax назначит на M3.1 такую же цену, новый тариф будет доступен у нас в тот же день, когда он появится, а не спустя цикл выставления счетов.
Смысл повторения всего этого — не ностальгия. Он в том, что единственная причина, по которой кто-либо на этой неделе обновляет страницу организации Hugging Face, — это то, что MiniMax M3 была достаточно хороша, поэтому её преемник стал вопросом продакшена, а не просто зрелищем, — и что модель с 428 миллиардами параметров и контекстом 1M по цене $0.30/$1.20 задаёт планку по соотношению цена/производительность, которую M3.1 должна преодолеть, а не только планку по возможностям.
Аспект анонимного листинга — и почему на него, возможно, уже ответили
Одну тему из начала сентября стоит здесь закрыть. На сторонней платформе для программирования появился анонимный стелс-листинг с контекстом в 1 000 000 токенов, ценой $0 и обязательными уровнями рассуждений, и мы освещали его под именем Space Bunny Alpha, отметив базовую частоту, с которой любой анонимный листинг такого рода в итоге оказывается чьим-то вендорским релизом — Pony Alpha стал моделью Zhipu, Hunter Alpha — моделью Xiaomi, Ox Alpha — релизом MiniMax под другим названием. Токенизатор и отпечатки аномалий в том листинге указывали на предварительный чекпоинт MiniMax. Если MiniMax M3.1 действительно появится на этой неделе, наиболее вероятная трактовка состоит в том, что анонимный листинг был его полевым тестом, и тайна разрешится объявлением, а не дальнейшими форензическими изысканиями. Это умозаключение, а не доказательство, и это последнее умозаключение в этом материале.

На что обратить внимание и что делать на этой неделе
Сигналы, которые превратили бы это из утечки в запуск, конкретны и проверяемы, и это не те, на которые обычно ориентируются комментарии. Публичный репозиторий Hugging Face в организации MiniMaxAI — а не приватный — с карточкой модели — самый сильный отдельный индикатор; история загрузок организации открыта и датирует каждый релиз с точностью до дня. Страница модели MiniMax или идентификатор модели в API — второй. Опубликованная цена — третий, и именно он важен для бюджета. Таблица бенчмарков на Artificial Analysis, датированная после релиза, — четвёртый, и единственный, который является независимым.
До тех пор практическая позиция для любого, кто что-то создаёт, не отличается от любой другой недели перед релизом: модель, которую вы можете использовать сегодня, — это MiniMax M3, один API-ключ открывает доступ к ней наряду с более чем 200 другими моделями, автоматическое переключение при сбое означает, что сбой эндпоинта не становится вашим простоем, а закреплённый или смешанный маршрут через DSL маршрутизации или пул моделей, отвечающих вместе через объединение моделей, — это способ снизить риски для модели, которую вы ещё не запустили в продакшен. Если M3.1 появится, это будет замена одного идентификатора модели, а не миграция — и в этом весь аргумент против создания кастомной интеграции на основе утечки.
Одно эта статья точно не будет делать — притворяться, что знает, когда. Контрольная точка реальна, документы конкретны, а самое последнее публичное утверждение — это слова одного человека: «на следующей неделе». Из этих трёх только первые два можно проверить самостоятельно.
