
Kimi K4: что на самом деле утверждает утечка и почему «меньше активных параметров» — вот что было бы главной новостью
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 506 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 183 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Один пост разом ввёл в оборот четыре названия неанонсированных моделей. Список начинается с Kimi K4, предположительно следующего поколения от Moonshot AI, которое стоит рядом с GLM-5.5 Flash и GLM-5.4 от Z.ai и DeepSeek V4.1P — и сам автор делает акцент не на каком-либо из флагманских названий, а на подозрении относительно арифметики, лежащей в основе K4: что та может активировать меньше параметров, чем модель, которую она заменяет. Это утверждение не подтверждено. Не существует ни карточки модели Kimi K4, ни весов, ни идентификатора API, ни цены, ни маршрута — и то же самое верно для каждого названия от Z.ai в этом списке. Что стоит сделать сейчас — так это разобраться, какие из этих утверждений можно было бы проверить, как выглядит выпущенная базовая версия и что на самом деле означал бы более разреженный K4.
Сигнал и его уровень
Это ранний сигнал, и читать его следует именно так. Пост, в котором он приводится, — это скорее прочтение соглашений об именовании моделей, а не отчёт о наблюдении: в нём «GLM-5.5 Flash, GLM-5.4» отмечены как интересная номенклатура, а Kimi K4 назван «очень странным»; затем предлагается спекулятивный механизм — меньше активированных экспертов — без утверждения, что были замечены конфиг, список чекпоинтов или staging-эндпоинт.
Ничто в открытых источниках не противоречит этим названиям, но и не подтверждает их. Такая асимметрия нормальна для этой стадии цикла выпуска, и именно поэтому полезный шаг — зафиксировать базовый уровень и тесты, а не строить дальнейшие предположения. Название в посте — это гипотеза о продукте, а не доказательство его существования.
Базовый уровень, с которым сравнивали бы Kimi K4
Kimi K3 существует, выпущен и на удивление хорошо задокументирован, что делает его надёжной точкой отсчёта. В собственной карточке модели Moonshot описывается модель Mixture-of-Experts с 2,8 трлн параметров, которая активирует 104 млрд параметров на токен, распределённых по 93 слоям — одному плотному и 92 разреженным. Разреженность агрессивна и указана прямо: на каждый токен срабатывают 16 из 896 экспертов вдобавок к 2 общим экспертам, что, по заявлению Moonshot, даёт примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с Kimi K2.
Стек внимания — вот где K3 отходит от предыдущего поколения. Из его 92 разреженных слоёв 69 используют Kimi Delta Attention — гибридный механизм линейного внимания, — а 24 используют гейтированное MLA; соотношение 3:1, при котором меньшинство слоёв с полным вниманием сохраняется, а остальные переходят на более дешёвый линейный путь. Слои содержат остаточную связь внимания каждые 12 блоков, функция активации — SiTU-GLU, а вся модель обучается с весами MXFP4 и активациями MXFP8 в рамках обучения с учётом квантования. Длина контекста — 1 048 576 токенов, размер словаря — 163 840, а зрение проходит через энкодер MoonViT-V2 с 401 млн параметров, что делает K3 изначально способным работать с изображениями, а не мультимодальным за счёт внешней надстройки.

Вот те показатели, которые преемнику предстоит сдвинуть. Обратите внимание, что они подразумевают в отношении идеи «меньше активных параметров»: K3 — уже чрезвычайно разреженная модель. На каждый токен она активирует около 3,7% от общего числа своих параметров. K4, которая активировала бы менее 104B, не урезала бы лишнее в дизайне с избыточным запасом — она откатывала бы назад коэффициент разреженности, который Moonshot публично преподнесла как победу, и сделала бы это в том поколении, где все остальные идут в противоположном направлении.
Что означало бы «меньше активных параметров», если это правда
Возможны две трактовки, и они указывают в противоположные стороны. Благожелательная трактовка — архитектурная: Moonshot могла бы развивать гибрид KDA дальше, заменяя ещё больше слоёв полного внимания линейными и перебалансируя бюджет экспертов так, чтобы меньшее число активаций давало более длинный контекст, более дешёвое обслуживание или лучшее соотношение качества на флоп. Согласно этой трактовке, меньшее число активных параметров — это уточнение того же тезиса, который уже утверждает K3: разреженность — это стратегия масштабирования, а не компромисс.
Другое прочтение состоит в том, что K4 вовсе не является единым преемником. Линейка Kimi уже один раз разветвилась в этом году, а в сообщениях по-разному намекали на K3.1, K3.2 и K4 как на три разных продукта. K4, который активирует меньше, чем K3, в семействе, где выпускается отдельный вариант для кодинга, по крайней мере в равной степени согласуется с репозиционированием, как и с прямым апгрейдом. Оба прочтения — спекуляция. Ни одно из них не определяется постом.
Есть также аспект лицензии, который никто не затронул. Веса K3 выпущены под лицензией Kimi K3 License — нестандартной лицензией категории «другая», а не стандартной открытой лицензией, и это первая открытая модель класса 3T. Унаследует ли более разреженная K4 эту лицензию или сузит её, для тех, кто строит на этих весах, значит больше, чем несколько пунктов рейтинга в индексе.

Остальные три имени в том же посте
GLM-5.5 Flash и GLM-5.4 — более удивительная пара, и не из-за цифр. Опубликованный потолок Z.ai — GLM-5.3, выпущенный 14 августа 2026 года с 743 млрд параметров, а GLM-5.3-Flash последовал 26 августа, при этом релизы весов BF16 и Flash-BF16 вышли 25 августа. В собственной документации Z.ai перечислены ровно три текущих идентификатора моделей: glm-5.3, glm-5.3-flash и glm-5.2. Не существует ни GLM-5.4, ни GLM-5.5, ни GLM-5.5 Flash — и странной частью является направление именования, поскольку поколение 5.5, предшествующее 5.4, — это не то, как Z.ai когда-либо нумеровала семейство. Номера версий, появляющиеся не по порядку в утечке, — знакомый режим сбоя: обычно это соседние продукты, внутренние кодовые названия или метка уровня обслуживания, а не новая базовая модель.
DeepSeek V4.1P — имя, которое, по словам автора сигнала, интересует его больше всего, и именно его из этих четырёх проще всего проверить. В документации API DeepSeek указаны ровно две актуальные строки моделей: deepseek-flash и deepseek-v4-pro. У суффикса «P» нет соответствия ни в одном идентификаторе DeepSeek, а самый свежий выпуск весов в собственной организации DeepSeek — DeepSeek-V4.1-Flash, опубликованный 10 сентября 2026 года. V4.1P, скорее всего, была бы моделью-собратом уровня Pro для той модели — но «скорее всего» — это догадка о строке, а не о продукте.
Откуда тебе знать, что хоть что-то из этого реально?
Четыре названия проваливают один и тот же тест одинаковым образом, что делает ожидание простым, а не мучительным. Настоящий релиз оставляет артефакты, и каждый из них легко проверить:
• Карточка модели в собственной организации вендора на Hugging Face. Новейшая модель Moonshot — Kimi-K3, созданная 13 июня 2026 года; у Z.ai новейшие — семейство GLM-5.3 от 25 августа; у DeepSeek новейшая — DeepSeek-V4.1-Flash от 10 сентября. Ничего более нового нет ни у одного из этих трёх.
• Конфиг, который решает спор. Конкретно для K4 поля, на которые стоит смотреть, — это num_experts и num_experts_per_token — у K3 там 896 и 16. Конфиг K4 с меньшим значением на токен — это и есть утверждение из этой утечки, подтверждаемое или опровергаемое в одном файле.
• Маршрутизируемая модель. Название, фигурирующее в каталоге, — это название, за которым стоят цена, контекстное окно и провайдер; у названия, которое есть только в посте, ничего этого нет.

Что можно маршрутизировать сегодня
Практическая сторона этой утечки в том, что поколение, которое она описывает, — не то, на чём можно строить. Работает предыдущее, и задача роутера — сделать разрыв между поколениями решением о маршрутизации, а не проектом миграции. Kimi K3 уже доступна с полным контекстом в 1M токенов и нативным зрением, по цене $3.00 за миллион входных токенов и $15.00 за миллион выходных, а чтение из кэша — $0.30: тарификация идёт по цене провайдера без наценки, поэтому изменение цены поставщика на K3 отражается в вашем счёте в тот же день, а не в следующем цикле пересмотра цен. Kimi K3 в OrcaRouter содержит полную спецификацию и актуальный тариф.
То же самое относится и к остальной части линейки. GLM-5.3, GLM-5.3-Flash и DeepSeek V4.1 Flash — все они маршрутизируются наравне с Kimi K3 через одну совместимую с OpenAI конечную точку, охватывающую более 200 моделей, с автоматическим переключением при деградации провайдера и DSL маршрутизации для выражения предпочтений — потолков стоимости, минимального уровня качества, бюджетов задержки — в виде политики, а не логики отдельного вызова. Когда появится Kimi K4, GLM-5.5 Flash или DeepSeek V4.1P, миграция сведётся к изменению одной строки в политике маршрутизации и ни к чему больше. Объединение моделей позволяет комбинировать выводы нескольких моделей на одной конечной точке, когда задаче это идёт на пользу.
Чтобы прямо сказать, чем это не является: ни одно из четырёх утёкших названий сегодня не является маршрутом на OrcaRouter. Мы их не хостим и не можем обслуживать.
Итог
Интересное утверждение здесь — не номера версий. А механизм: флагман нового поколения, который активирует меньше параметров, чем его предшественник, стал бы заявлением о том, что Moonshot считает разреженность, а не сырое число активируемых параметров, той осью, по которой стоит двигаться, и разбиение экспертов 16 из 896 в K3 — уже аргумент в этом направлении. Каждая часть этого утверждения не подтверждена: у Kimi K4, GLM-5.5 Flash, GLM-5.4 и DeepSeek V4.1P нет ни карточек модели, ни весов, ни идентификаторов API, ни цен, а собственные каталоги вендоров в каждом случае останавливаются на одно поколение раньше. Воспринимайте эти названия как анонс вопроса, а не ответа — и если вам прямо сейчас нужны открытые веса уровня фронтира при контексте 1M, Kimi K3 — это модель, которая уже существует.
Когда Kimi K4 действительно появится, автоматическое переключение при сбое — вот что не даёт миграции превратиться в инцидент
