
Kimi Linear распространяется: все модели, которые мы можем проверить, действительно работают на KDA
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- qwenНОВИНКАQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 198 tok/s
- orcaНОВИНКАOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Интеллект42Кодинг
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Интеллект39Кодинг
- anthropicAnthropic: Claude Sonnet 52026-06-3055Интеллект72Кодинг
- klingKling: Kling 3.0 Turbo2026-06-1757Интеллект52Кодинг57Математика
- z-aiZ.ai: GLM 5.22026-06-1653Интеллект69Кодинг60Математика
«Вау! Kimi-Linear набирает популярность! Это уже, кажется, третья внешняя модель, которую я вижу». Это и был весь пост — одна строка от @teortaxesTex, опубликованная 5 августа 2026 года, с прикреплённым скриншотом и без единой названной модели. Короткая ссылка в нём ведёт на изображение, а не на репозиторий, так что переходить некуда и подтвердить нечем. Утверждение в любом случае можно проверить, и оно значит больше, чем может показаться из одной строки: если лаборатории, помимо Moonshot AI, теперь строят свои модели на дизайне внимания, лежащем в основе Kimi-Linear-48B-A3B-Instruct и Kimi K3, то Kimi Delta Attention перестала быть внутренней фишкой одной лаборатории и начала становиться ингредиентом, который другие берут на вооружение. Поэтому вместо скриншота мы пошли искать сами модели. Короткий ответ: самый убедительный случай — Ling-3.0-flash, у которой в собственной карточке модели описан стек из слоёв KDA и MLA в соотношении 5:1; самый полезный случай — исследовательский чекпоинт американской лаборатории, который количественно оценивает, во что обходится чистый KDA; а на frontier-уровне, кроме Moonshot, его никто не выпустил.
Что утверждается и что не утверждается
Один практик, один скриншот, модель не названа, подтверждения нет. Это вся доказательная база для утверждения о «завоевании признания» — и это следует воспринимать как приглашение проверить, а не как новость. Мы не смогли воспроизвести этот скриншот, поэтому ничто ниже не является его подтверждением. Всё, что изложено далее, — это то, что показывали публичные метаданные моделей 5 августа 2026 года, когда мы проводили проверку, а также то, что каждая лаборатория сообщает в собственной карточке модели. Если цифра взята из собственных измерений вендора, она помечена соответствующим образом, потому что в этой истории почти каждая громкая цифра именно такова.
Один экран на Kimi Linear, потому что «adoption» означает внедрение этого
Kimi Linear — это архитектура внимания, опубликованная командой Kimi как arXiv 2510.26692 30 октября 2025 года, а не продукт. Её ядро — Kimi Delta Attention (KDA), которая берёт Gated DeltaNet и заменяет её грубый гейт забывания на мелкозернистое поканальное затухание, так что рекуррентное состояние учится тому, что сохранять, по каналам, а не целиком. Обновление реструктурируется в чанкованную форму Diagonal-Plus-Low-Rank, специально для того, чтобы оно попадало на тензорные ядра, а не оставляло их без дела. Именно аппаратная направленность является смыслом этой конструкции: линейное внимание всегда было дёшево в теории и обычно разочаровывало на практике.
Выпущенные контрольные точки — Kimi-Linear-48B-A3B-Base и Kimi-Linear-48B-A3B-Instruct — имеют 48B суммарных параметров при 3B активных, окно контекста на 1M токенов и лицензию MIT. Слои чередуются примерно в соотношении 3:1: двадцать слоёв KDA к семи слоям Multi-Head Latent Attention, так что три из четырёх слоёв — дешёвый рекуррентный тип, а каждый четвёртый сохраняет точное глобальное внимание.
Что сообщает Moonshot, все показатели измерены относительно полной базовой модели MLA, обученной по идентичной рецептуре, — цифры вендора, не воспроизведённые независимо:
• Скорость декодирования — до 6 раз быстрее по времени на выходной токен при контексте 1M по сравнению с полным MLA
• KV cache — до 75% меньше, что и обеспечивает пропускную способность
• Длинный контекст — RULER при 128k: 84.3 для Kimi Linear с ускорением 3.98x, против 81.3 для базовой модели MLA
• Короткий контекст — MMLU-Pro при 4k: 51,0 против 47,2 для базовой модели MLA и 47,9 для гибрида Gated DeltaNet, примерно с той же скоростью, что и полное внимание, так что архитектура не покупает скорость на длинном контексте ценой качества на коротком.
• Абляция при предобучении — гибрид 3:1 достигает валидационной перплексии 5.65, тогда как полное внимание показывает 5.77
Честное ограничение всего этого: доказательства на сопоставимых базовых моделях заканчиваются на 48B. Никто не создал полновнимательного аналога Kimi K3 на 2.8T для сравнения, а по состоянию на факт-чек заявлений об архитектуре K3 в конце июля 2026 года независимых исследований долгоконтекстного воспроизведения без обходных путей опубликовано не было ни для одной из моделей. История об эффективности хорошо подтверждена. История о том, что модель «превосходит полное внимание», подтверждена в исследовательском масштабе лабораторией, написавшей статью.

Пока что успех выражается в загрузках, а не в чужих архитектурах: 98 164 загрузки за последний месяц, 570 лайков, один провайдер инференса на Hugging Face и дерево моделей из 2 адаптеров, 8 дообучений и 24 квантизаций. Популярно, несомненно. Другой вопрос — скопировали ли её.
Самый убедительный пример внедрения: Ling-3.0-flash
Ling-3.0-flash — это именно та модель, которая делает это заявление реальным. На её карточке на Hugging Face описана нативная гибридная архитектура с линейным вниманием, построенная из чередующегося стека 5:1 из Kimi Delta Attention и MLA — 35 слоёв KDA и 7 слоёв gated MLA — на модели Mixture-of-Experts со 124B параметров и 5.1B активных на токен, с контекстом 256K, обученным по прогрессии 8K → 32K → 256K, и лицензией MIT. Это не исследовательская игрушка от любителя; это выпущенная модель из признанной лаборатории, и она называет модуль внимания Moonshot в собственном описании архитектуры.
Кроме того, она более агрессивна в этом отношении, чем Moonshot. Moonshot сохраняет один слой точного внимания из четырёх, а Ling-3.0-flash — один из шести. Если конструкция является обузой, вы её хеджируете; вы не тратите меньше глобальных слоёв, чем люди, которые её изобрели. В сравнении с более ранним поколением это перелом: обзоры архитектур февраля 2026 года, каталогизировавшие этот класс моделей, показывали предыдущий флагман Ling на Lightning Attention в паре с MLA в соотношении 7:1. Механизм изменился между поколениями, и направление изменения было в сторону KDA.
Две оговорки, которые мы не будем замалчивать. Это заявлено в карточке: мы прочитали собственное описание архитектуры репозитория и его конфигурацию, в которой объявлен пользовательский тип модели bailing_hybrid с реализацией BailingMoeV3 — мы не проверяли ядра, чтобы подтвердить, что математика является KDA, а не вдохновлена KDA. И в репозитории вообще нет тега KDA; то, что всплывает при поиске по тегу, — это сторонняя GGUF-конвертация, которую пометил кто-то другой. Это полезное предупреждение о методе, и оно напрямую подводит к следующим двум разделам.
Arcee AI провел эксперимент, который Moonshot не провел.
Самое показательное внешнее применение KDA — это вообще не продукт. Примерно через шесть недель после публикации статьи Kimi Linear, в середине декабря 2025 года, Arcee AI опубликовала два исследовательских чекпойнта под лицензией Apache-2.0 — AFM-4.5B-Base-KDA-Only и AFM-4.5B-Base-KDA-NoPE — на базе собственной реализации ArceeKDAForCausalLM, с явной пометкой kimi-delta-attention. Их вопрос был тем, которого гибридный дизайн Moonshot тщательно избегает: можно ли полностью заменить полное внимание? Поэтому они преобразовали все 24 слоя внимания в KDA, не оставив ни одного слоя глобального внимания, и дистиллировали результат из исходной AFM-4.5B-Base как учителя при длине последовательности 32k.
Их сообщённые результаты: учитель против чистого KDA-студента:
• MMLU — с 63.1 до 55.8, реальное, но преодолимое падение
• GSM8K — с 52.1 до 26.8, примерно вдвое
• HellaSwag — с 78.0 до 74.3, почти без изменений

Форма этого повреждения — вот что интересно. Широкие знания и продолжение на основе здравого смысла в основном переживают пропускание через рекуррентное состояние фиксированного размера. Многошаговая арифметика, которой нужно точное извлечение промежуточных результатов, записанных моделью несколько шагов назад, — не переживает. Arcee также сообщает, что деградация на длинном контексте происходит плавно, без резкого обрыва. В совокупности это самое наглядное публичное доказательство того, почему каждое серьёзное развёртывание KDA — гибридное: глобальные слои Moonshot (один из четырёх) и Ant (один из шести) — это не робость, а та часть, которая сохраняет арифметику.
Что это не так: это не вердикт о KDA в масштабе. Это дистилляция модели на 4.5B параметров, а не предобучение с нуля, и дистилляция в изменённую архитектуру теряет то, что предобучение с нуля не потеряло бы. Воспринимайте это как абляцию, которую у вендора не было стимула публиковать, — из независимой лаборатории, у которой не было заинтересованности в результате.
Длинный хвост: скопление крошечных репозиториев KDA за одну неделю.
Под двумя серьёзными случаями находится россыпь мелких, и именно даты делают их достойными упоминания. NEXIVON-1B-BASE, загруженный 31 июля 2026 года, указывает свой тип модели буквально как kda — Apache-2.0, 285 загрузок, без лайков. qingyi-kda-0.6b, на той же неделе, представляет собой дообучение Qwen3-0.6B-Base с собственной реализацией qingyi_kda. Scrapegoat-Tiny-Coder, также на той неделе, сочетает тег kda с собственной конструкцией «двухдорожечного параллельного внимания». Ещё две модели, maccy-106m-base и maccy-96m-16k-base, получили тег kimi-delta-attention 27 и 28 июля.
Ни одна из этих вещей сама по себе не важна — лайки в одну цифру, неизвестные авторы, исследовательские масштабы числа параметров. В совокупности они, вероятно, и есть то, что подсчитывает счётчик «третьей внешней модели, которую я вижу», и мы не можем подтвердить, какие именно три, поскольку в посте не названа ни одна. Сигнал в них — не модели, а десять дней: четыре независимых небольших обучающих прогона достигли KDA за полторы недели, а это происходит, когда ядро перестаёт быть исследовательским артефактом и становится тем, что можно за выходные вставить в обучающий скрипт.
Чего не нашла зачистка.
Мы отправили запрос в Hugging Face по всем репозиториям, содержащим тип модели kimi_linear. Таких оказалось 47. Все, кроме трёх, содержат в названии «Kimi», а те, что не принадлежат самой Moonshot, являются производными, а не прямыми внедрениями: AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF и MLX-квантизации при любой разрядности; варианты REAP с экспертным прунингом на 35B от Cerebras; а также сборки FlagRelease FlagOS чекпойнта Instruct для ускорителей NVIDIA, MetaX и Hygon. Последняя группа действительно интересна по другой причине — кто-то проделал работу, чтобы заставить KDA работать на отечественных китайских чипах, — но ничто из этого не является работой другой лаборатории над собственной моделью.
Ни одна фронтирная модель за пределами Moonshot не заявляет KDA. Ling-3.0-flash с общим объемом 124B и 5.1B активных параметров — это потолок внешнего внедрения на данный момент.
И у этого метода есть уязвимое место, которое стоит назвать, поскольку оно противоречит нашему собственному отрицательному результату. Лаборатория, которая заново реализует KDA, регистрирует собственный тип модели — arcee_kda, qingyi_kda, bailing_hybrid, — поэтому систематические проверки тегов стабильно занижают количество именно тех последователей, которых мы ищем, и модель может использовать этот механизм, ни разу не написав «KDA» в своей карточке. Отсутствие тега — слабое свидетельство, а не доказательство. Если существует четвёртый или пятый тихий последователь, именно так он и останется незамеченным.
Все остальные выбрали другое линейное внимание.
Причина, по которой «Kimi Linear набирает популярность», вообще является историей, заключается в том, что почти весь 2026 год она её не набирала. Гибридное линейное внимание захватило область моделей с открытыми весами — но не этот его вариант. Согласно архитектурным обзорам, опубликованным в феврале 2026 года: Qwen3-Next 80B-A3B и Qwen3.5-397B-A17B обе сочетают Gated DeltaNet с гейтированным вниманием в соотношении 3:1, то есть Qwen3.5-397B-A17B содержит 45 рекуррентных слоёв против 15 слоёв полного внимания из 60. Предыдущий флагман Ling использовал Lightning Attention с MLA в соотношении 7:1. Nemotron 3 Nano 30B-A3B и Super 120B-A12B — это гибриды на Mamba-2, с всего 6 слоями внимания в 52-слойной архитектуре и 8 в 88-слойной, соответственно. GLM-5 осталась на MLA и добавила поверх разрежённое внимание (sparse attention). MiniMax-M2.5 пошла совершенно другим путём и сохранила обычное многоголовое внимание, предположительно ради надёжности. А Kimi K2.5 — собственный флагман Moonshot до K3 — использовала MLA: лаборатория опубликовала KDA в октябре 2025 года и не включала его в свою фронтирную модель до июля 2026 года.
Итак, категория победила, а вариант — нет. Все согласны, что три четверти ваших слоёв могут быть рекуррентными, но никто не сошёлся во мнении, какая именно рекуррентность нужна. Отличительная особенность KDA — поканальный вентиль затухания, и её цена в том, что вам нужны её собственные ядра и механизм кэширования префиксов, а не путь Gated DeltaNet, который уже был у половины экосистемы. До этого месяца эту цену платила одна лаборатория.
Внедрение, которое уже произошло, — в серверных стеках.
Архитектуры распространяются не потому, что они элегантны; они распространяются, когда инфраструктура делает их дешёвыми. Для KDA эта часть уже сделана, и это произошло быстрее, чем распространение модельных карточек. И vLLM, и SGLang выпустили поддержку с первого дня, когда веса Kimi K3 появились 27 июля 2026 года, причём Moonshot встроил свою реализацию префиксного кэширования KDA непосредственно в vLLM, а не поддерживал форк. SGLang выпустил объединённые ядра KDA и Gated DeltaNet и сообщил о росте логической ёмкости KV с 1,5 млн до 12,2 млн токенов на идентичном оборудовании — это его собственный замер и самый конкретный сторонний показатель эффективности во всей этой истории. Эталонные ядра находятся в fla-core, и любой небольшой запуск обучения может их импортировать.
В этом разница между тем, как Arcee потребовала целенаправленных исследовательских усилий в декабре 2025 года, и тем, как четыре анонимных репозитория в течение одной недели июля 2026 года просто объявили о KDA. Механизм стал устанавливаемой зависимостью. Последует ли за этим фронтир — отдельный вопрос, но аргумент о трении против KDA практически испарился.
Что это меняет, если вы покупаете только токены.
Ничего о вашем коде. Вы никогда не вызываете KDA; вы воспринимаете его как то, сколько стоит контекст на миллион токенов и сколько времени занимает получение первого токена. Kimi K3 — это модель, где это проявляется коммерчески уже сегодня: на OrcaRouter она стоит $3.00 за миллион входных токенов и $15.00 за миллион выходных, с полным контекстом на 1M токенов и измеренным p50 временем до первого токена 8.88 секунд за последние семь дней. Эти экономические показатели, по сути, и обеспечивает гибрид KDA 3:1: обслуживание контекста в миллион токенов по цене, которая просто дорогая, а не запретительная.

Исследовательский чекпоинт — совсем другое дело. Kimi-Linear-48B-A3B-Instruct распространяется по лицензии MIT, и на его странице на Hugging Face указан лишь один провайдер инференса, а в OrcaRouter этой модели нет. Если вы хотите её запустить, это означает самостоятельный хостинг или использование этого провайдера. Расчёты для самостоятельного хостинга более благоприятны, чем можно предположить по количеству параметров: веса на 48B в bf16 занимают примерно 96 ГБ, так что потребуются две карты по 80 ГБ, тогда как 4-битные конверсии MLX и GGUF укладываются примерно в 25–30 ГБ и помещаются на одну карту или в хорошо укомплектованный Mac. Ling-3.0-flash также сегодня отсутствует в OrcaRouter. Мы не собираемся делать вид, что это не так, чтобы подкрепить некий тезис о маршрутизации.
Маршрутизация здесь важна тем, насколько дорого обходится ошибка в архитектурной ставке. Гибридные модели линейного внимания — это ровно тот класс, где таблица бенчмарков вендора и ваша рабочая нагрузка могут разойтись: рекуррентное состояние фиксированного размера не справляется с паттернами извлечения, которые не видны ни в одном агрегированном показателе, — и именно об этом говорит тот уменьшенный вдвое показатель GSM8K. Прогон сравнения через один API-ключ на 200+ моделях означает, что тест — это изменённая строка модели, а не закупочный цикл: всё по прайс-листу провайдера, с нулевой наценкой с нашей стороны и автоматическим фейловером, чтобы модель с длинным контекстом, которую вы всё ещё оцениваете, не становилась единой точкой отказа в продакшн-пути. Попробуйте это на своём трафике с длинным контекстом в течение дня. Это более дешёвый ответ, чем любая таблица бенчмарков, включая нашу.
Вопросы, которые действительно стоит задавать
Kimi Linear — это то же самое, что и Kimi K3?
Нет, и смешение этих понятий — самая распространённая ошибка в освещении обеих тем. Kimi Linear — это архитектурная статья плюс исследовательская модель с общим объёмом 48B и 3B активных параметров, контекстом в 1M, выпущенная под лицензией MIT в конце 2025 года, чтобы продемонстрировать, что гибрид с высокой долей KDA превосходит полную MLA при сопоставимом обучении. Kimi K3 — это флагман Moonshot с 2,8 триллиона параметров от июля 2026 года — 104B активных, изначально мультимодальная, контекст 1M — который довёл идею KDA в соотношении 3:1 до масштаба передового рубежа и добавил Attention Residuals, отдельный приём, который, по данным лаборатории, даёт около 25% эффективности обучения при дополнительных затратах менее 2%. Общий механизм, но совершенно иные масштаб, возможности и цена. Бенчмарки одного говорят очень мало о другом.
Почему лаборатория выбрала бы KDA вместо Gated DeltaNet, если большинство выбрало Gated DeltaNet?
KDA — это строгое уточнение Gated DeltaNet, поэтому вопрос в том, оправдывает ли уточнение затраты на переход. Суть уточнения в затворе: Gated DeltaNet затухает свою рекуррентную память с помощью одного скаляра на шаг, а KDA обучает затухание для каждого канала признаков, что позволяет состоянию хранить имя переменной на протяжении десяти тысяч токенов, одновременно сбрасывая предложение, в котором оно встретилось. Абляция Moonshot оценивает это примерно в 0,12 перплексии на валидации при 48B, а её блочная формулировка DPLR была написана, чтобы загружать тензорные ядра, так что дополнительная выразительность не стоит той пропускной способности, которую она приносит. Против этого можно сказать, что Gated DeltaNet уже имела широкую поддержку ядер и фреймворков до того, как та или другая стали модными, а это стоит реального инженерного времени. Ответ 2026 года был в основном «не стоит». Ling-3.0-flash — это первая ставка производственного масштаба в обратную сторону.
Должно ли что-то из этого повлиять на то, что я разверну в этом квартале?
Только если вы работаете с очень длинными контекстами. Если ваши промпты укладываются примерно в 32 тысячи токенов, гибридное линейное внимание — это деталь реализации, не влияющая на выбор модели; выбирайте как обычно по качеству, цене и задержке. Если вы выходите на 128 тысяч токенов и более, стоит знать, что модели, удерживающие ваши расходы в разумных пределах при такой длине, — это всё чаще KDA-гибриды, и что их опубликованные результаты на длинных контекстах — это агрегированные бенчмарки, а не состязательные тесты на воспроизведение. Тестируйте извлечение информации на вашей реальной длине контекста, а не доверяйте оценке RULER. Этот совет был бы тем же самым, будь это механизм Gated DeltaNet или Mamba-2.
Что это означает для утверждения
Направление верное, и масштаб меньше, чем кажется. Что можно проверить 5 августа 2026 года — это одна продакшн-модель из признанной лаборатории, одна исследовательская пара из независимой американской лаборатории, опубликовавшая честные ограничения, несколько репозиториев размером менее 1B за последние десять дней и экосистема обслуживания, которая уже поглотила ядро. Это больше, чем «трюк одной лаборатории», и намного меньше, чем стандарт. Показатель, за которым стоит следить, — не три внешние модели, а то, выпустит ли следующая передовая open-weight модель от лаборатории, не являющейся Moonshot, поканальный гейтинг, и опубликует ли кто-то за пределами Moonshot recall-пробу, проверяющую, что именно забывает состояние фиксированного размера. И то и другое скажет вам больше, чем очередной скриншот.
