Сгенерированная карточка-заголовок с текстом "Kimi K4" и подзаголовком "что говорит утечка, а что — нет", бейджем "УТЕЧКА / НЕ ПОДТВЕРЖДЕНО", тремя строками друг под другом "Нет карточки модели", "Нет весов" и "Нет цены или маршрута" и нижней строкой "По состоянию на 25 сентября 2026 года", с логотипом OrcaRouter, наложенным в правом нижнем углу.
Guides & Insights

Kimi K4: что на самом деле утверждает утечка и почему «меньше активных параметров» — вот что было бы главной новостью

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Один пост разом ввёл в оборот четыре названия неанонсированных моделей. Список начинается с K​imi K4, предположительно следующего поколения от Moonshot AI, которое стоит рядом с GLM-5.5 Flash и GLM-5.4 от Z.ai и D​eepSeek V4.1P — и сам автор делает акцент не на каком-либо из флагманских названий, а на подозрении относительно арифметики, лежащей в основе K4: что та может активировать меньше параметров, чем модель, которую она заменяет. Это утверждение не подтверждено. Не существует ни карточки модели K​imi K4, ни весов, ни идентификатора API, ни цены, ни маршрута — и то же самое верно для каждого названия от Z.ai в этом списке. Что стоит сделать сейчас — так это разобраться, какие из этих утверждений можно было бы проверить, как выглядит выпущенная базовая версия и что на самом деле означал бы более разреженный K4.

Сигнал и его уровень

Это ранний сигнал, и читать его следует именно так. Пост, в котором он приводится, — это скорее прочтение соглашений об именовании моделей, а не отчёт о наблюдении: в нём «GLM-5.5 Flash, GLM-5.4» отмечены как интересная номенклатура, а K​imi K4 назван «очень странным»; затем предлагается спекулятивный механизм — меньше активированных экспертов — без утверждения, что были замечены конфиг, список чекпоинтов или staging-эндпоинт.

Ничто в открытых источниках не противоречит этим названиям, но и не подтверждает их. Такая асимметрия нормальна для этой стадии цикла выпуска, и именно поэтому полезный шаг — зафиксировать базовый уровень и тесты, а не строить дальнейшие предположения. Название в посте — это гипотеза о продукте, а не доказательство его существования.

Базовый уровень, с которым сравнивали бы Kimi K4

Kimi K3 существует, выпущен и на удивление хорошо задокументирован, что делает его надёжной точкой отсчёта. В собственной карточке модели Moonshot описывается модель Mixture-of-Experts с 2,8 трлн параметров, которая активирует 104 млрд параметров на токен, распределённых по 93 слоям — одному плотному и 92 разреженным. Разреженность агрессивна и указана прямо: на каждый токен срабатывают 16 из 896 экспертов вдобавок к 2 общим экспертам, что, по заявлению Moonshot, даёт примерно 2,5-кратное улучшение эффективности масштабирования по сравнению с Kimi K2.

Стек внимания — вот где K3 отходит от предыдущего поколения. Из его 92 разреженных слоёв 69 используют Kimi Delta Attention — гибридный механизм линейного внимания, — а 24 используют гейтированное MLA; соотношение 3:1, при котором меньшинство слоёв с полным вниманием сохраняется, а остальные переходят на более дешёвый линейный путь. Слои содержат остаточную связь внимания каждые 12 блоков, функция активации — SiTU-GLU, а вся модель обучается с весами MXFP4 и активациями MXFP8 в рамках обучения с учётом квантования. Длина контекста — 1 048 576 токенов, размер словаря — 163 840, а зрение проходит через энкодер MoonViT-V2 с 401 млн параметров, что делает K3 изначально способным работать с изображениями, а не мультимодальным за счёт внешней надстройки.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Вот те показатели, которые преемнику предстоит сдвинуть. Обратите внимание, что они подразумевают в отношении идеи «меньше активных параметров»: K3 — уже чрезвычайно разреженная модель. На каждый токен она активирует около 3,7% от общего числа своих параметров. K4, которая активировала бы менее 104B, не урезала бы лишнее в дизайне с избыточным запасом — она откатывала бы назад коэффициент разреженности, который Moonshot публично преподнесла как победу, и сделала бы это в том поколении, где все остальные идут в противоположном направлении.

Что означало бы «меньше активных параметров», если это правда

Возможны две трактовки, и они указывают в противоположные стороны. Благожелательная трактовка — архитектурная: Moonshot могла бы развивать гибрид KDA дальше, заменяя ещё больше слоёв полного внимания линейными и перебалансируя бюджет экспертов так, чтобы меньшее число активаций давало более длинный контекст, более дешёвое обслуживание или лучшее соотношение качества на флоп. Согласно этой трактовке, меньшее число активных параметров — это уточнение того же тезиса, который уже утверждает K3: разреженность — это стратегия масштабирования, а не компромисс.

Другое прочтение состоит в том, что K4 вовсе не является единым преемником. Линейка Kimi уже один раз разветвилась в этом году, а в сообщениях по-разному намекали на K3.1, K3.2 и K4 как на три разных продукта. K4, который активирует меньше, чем K3, в семействе, где выпускается отдельный вариант для кодинга, по крайней мере в равной степени согласуется с репозиционированием, как и с прямым апгрейдом. Оба прочтения — спекуляция. Ни одно из них не определяется постом.

Есть также аспект лицензии, который никто не затронул. Веса K3 выпущены под лицензией Kimi K3 License — нестандартной лицензией категории «другая», а не стандартной открытой лицензией, и это первая открытая модель класса 3T. Унаследует ли более разреженная K4 эту лицензию или сузит её, для тех, кто строит на этих весах, значит больше, чем несколько пунктов рейтинга в индексе.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Остальные три имени в том же посте

GLM-5.5 Flash и GLM-5.4 — более удивительная пара, и не из-за цифр. Опубликованный потолок Z.ai — GLM-5.3, выпущенный 14 августа 2026 года с 743 млрд параметров, а GLM-5.3-Flash последовал 26 августа, при этом релизы весов BF16 и Flash-BF16 вышли 25 августа. В собственной документации Z.ai перечислены ровно три текущих идентификатора моделей: glm-5.3, glm-5.3-flash и glm-5.2. Не существует ни GLM-5.4, ни GLM-5.5, ни GLM-5.5 Flash — и странной частью является направление именования, поскольку поколение 5.5, предшествующее 5.4, — это не то, как Z.ai когда-либо нумеровала семейство. Номера версий, появляющиеся не по порядку в утечке, — знакомый режим сбоя: обычно это соседние продукты, внутренние кодовые названия или метка уровня обслуживания, а не новая базовая модель.

D​eepSeek V4.1P — имя, которое, по словам автора сигнала, интересует его больше всего, и именно его из этих четырёх проще всего проверить. В документации API D​eepSeek указаны ровно две актуальные строки моделей: deepseek-flash и deepseek-v4-pro. У суффикса «P» нет соответствия ни в одном идентификаторе D​eepSeek, а самый свежий выпуск весов в собственной организации D​eepSeek — DeepSeek-V4.1-Flash, опубликованный 10 сентября 2026 года. V4.1P, скорее всего, была бы моделью-собратом уровня Pro для той модели — но «скорее всего» — это догадка о строке, а не о продукте.

Откуда тебе знать, что хоть что-то из этого реально?

Четыре названия проваливают один и тот же тест одинаковым образом, что делает ожидание простым, а не мучительным. Настоящий релиз оставляет артефакты, и каждый из них легко проверить:

• Карточка модели в собственной организации вендора на Hugging Face. Новейшая модель Moonshot — Kimi-K3, созданная 13 июня 2026 года; у Z.ai новейшие — семейство GLM-5.3 от 25 августа; у DeepSeek новейшая — DeepSeek-V4.1-Flash от 10 сентября. Ничего более нового нет ни у одного из этих трёх.

• Конфиг, который решает спор. Конкретно для K4 поля, на которые стоит смотреть, — это num_experts и num_experts_per_token — у K3 там 896 и 16. Конфиг K4 с меньшим значением на токен — это и есть утверждение из этой утечки, подтверждаемое или опровергаемое в одном файле.

• Маршрутизируемая модель. Название, фигурирующее в каталоге, — это название, за которым стоят цена, контекстное окно и провайдер; у названия, которое есть только в посте, ничего этого нет.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Что можно маршрутизировать сегодня

Практическая сторона этой утечки в том, что поколение, которое она описывает, — не то, на чём можно строить. Работает предыдущее, и задача роутера — сделать разрыв между поколениями решением о маршрутизации, а не проектом миграции. Kimi K3 уже доступна с полным контекстом в 1M токенов и нативным зрением, по цене $3.00 за миллион входных токенов и $15.00 за миллион выходных, а чтение из кэша — $0.30: тарификация идёт по цене провайдера без наценки, поэтому изменение цены поставщика на K3 отражается в вашем счёте в тот же день, а не в следующем цикле пересмотра цен. Kimi K3 в OrcaRouter содержит полную спецификацию и актуальный тариф.

То же самое относится и к остальной части линейки. GLM-5.3, GLM-5.3-Flash и DeepSeek V4.1 Flash — все они маршрутизируются наравне с Kimi K3 через одну совместимую с OpenAI конечную точку, охватывающую более 200 моделей, с автоматическим переключением при деградации провайдера и DSL маршрутизации для выражения предпочтений — потолков стоимости, минимального уровня качества, бюджетов задержки — в виде политики, а не логики отдельного вызова. Когда появится K​imi K4, GLM-5.5 Flash или D​eepSeek V4.1P, миграция сведётся к изменению одной строки в политике маршрутизации и ни к чему больше. Объединение моделей позволяет комбинировать выводы нескольких моделей на одной конечной точке, когда задаче это идёт на пользу.

Чтобы прямо сказать, чем это не является: ни одно из четырёх утёкших названий сегодня не является маршрутом на OrcaRouter. Мы их не хостим и не можем обслуживать.

Итог

Интересное утверждение здесь — не номера версий. А механизм: флагман нового поколения, который активирует меньше параметров, чем его предшественник, стал бы заявлением о том, что Moonshot считает разреженность, а не сырое число активируемых параметров, той осью, по которой стоит двигаться, и разбиение экспертов 16 из 896 в K3 — уже аргумент в этом направлении. Каждая часть этого утверждения не подтверждена: у K​imi K4, GLM-5.5 Flash, GLM-5.4 и D​eepSeek V4.1P нет ни карточек модели, ни весов, ни идентификаторов API, ни цен, а собственные каталоги вендоров в каждом случае останавливаются на одно поколение раньше. Воспринимайте эти названия как анонс вопроса, а не ответа — и если вам прямо сейчас нужны открытые веса уровня фронтира при контексте 1M, K​imi K3 — это модель, которая уже существует.

Когда K​imi K4 действительно появится, автоматическое переключение при сбое — вот что не даёт миграции превратиться в инцидент