
Kimi Linear는 확산 중: 검증 가능한 모든 모델이 실제로 KDA를 실행합니다
- metaNEWMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenNEWQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 198 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
- grokxAI: Grok 4.52026-07-0856지능72코딩
- tencentTencent: Hy32026-07-0642지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3055지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1653지능69코딩60수학
"와! Kimi-Linear가 채택되고 있어! 내가 보는 세 번째 외부 모델이네." 그게 게시물의 전부였다. 2026년 8월 5일 @teortaxesTex가 쓴 한 줄에 스크린샷이 첨부되어 있고, 언급된 모델은 하나도 없었다. 거기 있는 단축 링크는 저장소가 아니라 이미지로 연결되므로, 클릭해서 볼 것도 확인할 것도 없다. 그 주장은 어차피 검증 가능하며, 한 줄짜리 글이 암시하는 것보다 더 중요하다. 만약 Moonshot AI 외의 연구소들이 지금 다음 모델들의 어텐션 설계를 기반으로 만들고 있다면 — Kimi-Linear-48B-A3B-Instruct 및 Kimi K3 — Kimi Delta Attention은 더 이상 한 연구소의 내부 비법이 아니라 다른 사람들이 도입하는 요소가 되었다는 뜻이다. 그래서 우리는 스크린샷 대신 모델을 찾아보았다. 짧게 말하면, 가장 유력한 사례는 Ling-3.0-flash인데, 그 자체 모델 카드에 KDA와 MLA 층이 5:1로 쌓여 있다고 설명되어 있다. 가장 유용한 사례는 순수 KDA가 얼마나 비용이 드는지 정량화한 미국 연구소의 연구용 체크포인트이고, 최전방 규모에서는 Moonshot 외에는 아무도 이를 출시하지 않았다.
주장이 무엇인지, 그리고 무엇이 아닌지
한 명의 실무자, 하나의 스크린샷, 모델 이름 없음, 확인 없음. 그것이 "채택 확산"의 전체 증거 기반이며, 뉴스라기보다 확인하라는 신호로 읽어야 한다. 우리는 그 스크린샷을 재현할 수 없었으므로, 아래 내용 중 어떤 것도 그것을 확인하는 것이 아니다. 뒤에 이어지는 모든 것은 2026년 8월 5일 우리가 검색했을 때 공개 모델 메타데이터에 나타난 것과, 각 연구소가 자체 모델 카드에서 밝힌 내용이다. 어떤 숫자가 공급업체 자체 측정에서 나온 경우 그렇게 표시되어 있는데, 이 특정 이야기에서는 거의 모든 주요 수치가 그렇기 때문이다.
Kimi Linear의 한 화면, "adoption"이란 이것을 채택하는 것을 의미하기 때문입니다.
{{1}}Kimi Linear{{/1}}는 {{2}}Kimi Team{{/2}}이 2025년 10월 30일에 arXiv 2510.26692로 발표한 어텐션 아키텍처로, 제품이 아닙니다. 핵심은 {{5}}Kimi Delta Attention (KDA){{/5}}로, {{6}}Gated DeltaNet{{/6}}을 기반으로 거친 망각 게이트를 세밀한 채널별 감쇠로 대체합니다. 이로써 순환 상태는 통째로가 아니라 채널별로 무엇을 유지할지 학습합니다. 업데이트는 청크 단위의 Diagonal-Plus-Low-Rank 형태로 재구성되어, 텐서 코어를 유휴 상태로 두지 않고 그 위에서 실행되도록 합니다. 이러한 하드웨어 중심의 접근이 바로 이 설계의 요점입니다. 선형 어텐션은 이론상으로는 항상 저렴하지만, 실제로는 대개 실망스러운 결과를 보여줍니다.
공개된 체크포인트 — Kimi-Linear-48B-A3B-Base 및 Kimi-Linear-48B-A3B-Instruct — 는 총 48B 파라미터 중 3B만 활성화되며, 1M-토큰 컨텍스트 창과 MIT 라이선스를 갖추고 있습니다. 레이어는 대략 3:1 비율로 교차하여, 20개의 KDA 레이어와 7개의 Multi-Head Latent Attention 레이어로 구성됩니다. 따라서 4개 중 3개 레이어는 저비용 순환형이고, 네 번째마다 정확한 전역 어텐션을 유지합니다.
Moonshot이 보고하는 내용은 모두 동일한 레시피로 학습된 full-MLA 기준선 대비 측정된 수치입니다 — 공급업체 제공 수치이며, 독립적으로 재현된 결과가 아닙니다:
• 디코딩 처리량 — 1M 컨텍스트에서 전체 MLA 대비 출력 토큰당 시간이 최대 6배 더 빠름
• KV cache — 최대 75% 더 작아짐, 이것이 처리량의 원천입니다
• 긴 컨텍스트 — 128k RULER: Kimi Linear가 3.98배 속도 향상으로 84.3, MLA 베이스라인은 81.3
간단히 말해, MMLU-Pro 4k에서 51.0을 기록하여 MLA 기준선(47.2)과 Gated DeltaNet 하이브리드(47.9)를 능가했으며, 전체 어텐션과 거의 동일한 속도를 유지합니다. 따라서 이 설계는 긴 컨텍스트 속도를 얻기 위해 짧은 컨텍스트 품질을 희생하지 않습니다.
• 사전 학습 제거 실험 — 3:1 하이브리드는 검증 퍼플렉서티 5.65에 도달하는 반면, 전체 어텐션은 5.77에 머문다
이 모든 것에 대한 정직한 한계는 다음과 같다: 동일 조건 기준선(matched-baseline) 증거는 48B에서 멈춘다. 아무도 Kimi K3와 비교할 수 있는 완전 어텐션 방식의 2.8T 모델을 만들지 않았으며, 2026년 7월 말에 K3 아키텍처 주장을 사실 확인한 시점 기준으로 두 모델 모두에 대해 독립적이고 지름길이 없는 장문맥 회상 테스트가 발표된 적이 없다. 효율성 이야기는 잘 뒷받침되고 있다. "완전 어텐션을 능가한다"는 이야기는 해당 논문을 작성한 연구소에 의해 연구 규모에서 뒷받침되고 있다.

지금까지의 견인력은 다른 사람들의 아키텍처라기보다는 다운로드처럼 보였습니다: 지난 한 달간 98,164회 다운로드, 570개의 좋아요, Hugging Face에 등재된 한 개의 추론 제공업체, 그리고 2개의 어댑터, 8개의 파인튠, 24개의 양자화로 구성된 모델 트리. 분명히 인기가 있습니다. 복제 여부는 별개의 문제입니다.
가장 강력한 도입 사례: Ling-3.0-flash
Ling-3.0-flash는 그 주장을 실제로 실현하는 모델입니다. 해당 Hugging Face 카드에는 5:1 비율로 번갈아 쌓은 Kimi Delta Attention과 MLA로 구성된 네이티브 하이브리드 선형 어텐션 아키텍처가 설명되어 있습니다. 즉, 124B 파라미터의 Mixture-of-Experts 모델에서 35개의 KDA 레이어와 7개의 게이트 MLA 레이어로 구성되며, 토큰당 5.1B 활성 파라미터를 사용하고, 8K→32K→256K 순차 학습을 통해 256K 컨텍스트를 지원하며, MIT 라이선스를 따릅니다. 이는 취미 개발자의 연구용 장난감이 아니라, 기존 연구소에서 출시한 실제 배포 모델이며, 자체 아키텍처 설명에서 Moonshot의 어텐션 모듈을 명시적으로 언급합니다.
또한 Moonshot보다 더 공격적이다. Moonshot은 4개 중 1개를 정확 어텐션 레이어로 유지하는 반면, Ling-3.0-flash는 6개 중 1개를 유지한다. 설계가 약점이라면 헤지해야지, 그것을 발명한 사람들보다 더 적은 글로벌 레이어를 사용해서는 안 된다. 이전 세대와 함께 읽으면, 이것은 전환이다: 이 모델 클래스를 분류한 2026년 2월 아키텍처 조사에서는 이전 Ling 플래그십이 Lightning Attention과 MLA를 7:1 비율로 짝지어 사용했다. 메커니즘은 세대 간에 변경되었고, 변경된 방향은 KDA를 향한 것이었다.
우리가 얼버무리지 않을 두 가지 주의사항이 있습니다. 이것은 {{1}}카드에 보고된{{/1}} 사항입니다. 즉, 저장소 자체의 아키텍처 설명과 구성을 읽었으며, 여기에는 커스텀 {{2}}bailing_hybrid 모델 유형(BailingMoeV3 구현 포함){{/2}}이 선언되어 있습니다. 다만, 커널을 감사하여 그 수학이 KDA에서 영감을 받은 것이 아니라 실제 {{3}}KDA{{/3}}인지 확인하지는 않았습니다. 그리고 그 저장소에는 KDA 태그가 전혀 없으며, 태그 검색에 나타나는 것은 다른 누군가가 라벨을 붙인 제3자 GGUF 변환물입니다. 이는 방법론에 관한 유용한 경고이며, 다음 두 섹션으로 직접 이어집니다.
Arcee AI는 Moonshot이 하지 않은 실험을 실행했다.
KDA의 가장 유익한 외부 사용 사례는 전혀 제품이 아닙니다. Kimi Linear 논문 발표 약 6주 후인 2025년 12월 중순, Arcee AI는 자체 ArceeKDAForCausalLM 구현을 통해 두 개의 Apache-2.0 연구 체크포인트(AFM-4.5B-Base-KDA-Only와 AFM-4.5B-Base-KDA-NoPE)를 공개했으며, 이를 명시적으로 kimi-delta-attention으로 태그했습니다. 그들이 던진 질문은 Moonshot의 하이브리드 설계가 신중히 피해가는 바로 그 질문, 즉 전체 어텐션을 완전히 대체할 수 있는가였습니다. 그래서 그들은 전역 어텐션 레이어를 하나도 남기지 않고 24개 어텐션 레이어를 모두 KDA로 변환했으며, 원본 AFM-4.5B-Base를 32k 시퀀스 길이의 티처로 삼아 그 결과를 증류했습니다.
그들이 보고한 결과, 교사 대 순수 KDA 학생:
• MMLU — 63.1에서 55.8로, 실질적이지만 견딜 수 있는 하락
• GSM8K — 52.1에서 26.8로, 대략 절반으로 줄어듦
• HellaSwag — 78.0에서 74.3으로, 거의 그대로 유지됨

그 손상의 형태가 흥미로운 부분이다. 광범위한 지식과 상식적 이어가기는 고정 크기의 순환 상태를 통과할 때 대부분 살아남는다. 하지만 모델이 몇 단계 전에 써 둔 중간 결과를 정확히 꺼내야 하는 다단계 연산은 그렇지 못하다. Arcee는 또한 장기 컨텍스트 성능 저하가 급격한 절벽 없이 완만하다고 보고한다. 종합하면, 이는 모든 진지한 KDA 배포가 하이브리드인 이유에 대한 가장 명확한 공개 증거다. Moonshot의 4개 중 1개꼴 전역 레이어와 Ant의 6개 중 1개꼴은 소심함이 아니라 연산을 유지하는 부분이다.
이것이 아닌 것: 대규모 KDA에 대한 평가. 이것은 4.5B 증류일 뿐, 사전 학습 실행이 아닙니다. 그리고 변경된 구조로의 증류는 처음부터 사전 학습할 때라면 잃지 않을 것들을 잃습니다. 벤더가 공개할 유인이 없었던 절제 연구로 읽으십시오 — 답에 대한 이해관계가 없는 독립 연구소가 수행한 것입니다.
롱테일: 단 일주일 만에 등장한 작은 KDA 저장소 무리
두 가지 심각한 사례 아래에는 작은 사례들이 흩어져 있으며, 날짜가 이들을 언급할 가치가 있게 만든다. 2026년 7월 31일에 업로드된 NEXIVON-1B-BASE는 모델 유형을 말 그대로 kda로 선언한다 — Apache-2.0, 다운로드 285회, 좋아요 없음. 같은 주에 나온 qingyi-kda-0.6b는 맞춤형 qingyi_kda 구현을 제공하는 Qwen3-0.6B-Base 파인튠이다. 역시 그 주에 공개된 Scrapegoat-Tiny-Coder는 kda 태그와 자체 "듀얼 트랙 병렬 어텐션" 설계를 결합한다. 두 가지가 더 있는데, maccy-106m-base와 maccy-96m-16k-base는 7월 27일과 28일에 kimi-delta-attention으로 태그되었다.
이것들 중 어느 것도 단독으로는 중요하지 않습니다 — 한 자릿수 좋아요, 알 수 없는 작성자, 연구 규모의 파라미터 수. 종합적으로 볼 때 그것들은 아마도 "내가 보는 세 번째 외부 모델" 집계가 세는 대상일 것이며, 게시물이 어떤 것도 지명하지 않았기 때문에 우리는 어느 세 개인지 확인할 수 없습니다. 그 안의 신호는 모델이 아니라 10일입니다: 4개의 독립적인 소규모 학습 실행이 1주일 반 만에 KDA에 도달했는데, 이는 커널이 연구 산출물에서 벗어나 주말 동안 훈련 스크립트에 그냥 넣을 수 있는 무언가가 될 때 일어나는 일입니다.
수색이 찾지 못한 것
우리는 Hugging Face에서 kimi_linear 모델 유형을 보유한 모든 저장소를 조회했습니다. 총 47개였습니다. 그중 세 개를 제외한 전부는 이름에 "Kimi"가 들어 있으며, Moonshot 자체 것이 아닌 것들은 채택자가 아니라 파생물입니다: 모든 비트 심도의 AWQ, GPTQ, FP8, NVFP4, SINQ, GGUF 및 MLX 양자화; Cerebras의 REAP 전문가 가지치기 35B 변형; 그리고 NVIDIA, MetaX, Hygon 가속기용 Instruct 체크포인트의 FlagRelease FlagOS 빌드입니다. 마지막 그룹은 다른 이유로 진정으로 흥미롭습니다. 누군가 KDA를 국산 중국 실리콘에서 실행되도록 만드는 작업을 했기 때문입니다. 하지만 그것 중 어느 것도 다른 연구소가 다른 모델을 설계한 것은 아닙니다.
Moonshot 외의 어떤 프론티어 규모 모델도 KDA를 선언하지 않습니다. 124B 총 파라미터와 5.1B 활성 파라미터를 가진 Ling-3.0-flash가 현재 외부 채택의 상한선입니다.
그리고 그 방법에는 이름 붙일 만한 허점이 하나 있다. 이는 우리 자신의 부정적 결과와 상충되기 때문이다. KDA를 재구현하는 연구소는 고유한 모델 유형(arcee_kda, qingyi_kda, bailing_hybrid)을 등록하므로, 태그 검색은 우리가 찾는 바로 그 채택자들을 체계적으로 과소계상한다. 게다가 모델은 카드에 "KDA"라고 전혀 쓰지 않고도 그 메커니즘을 사용할 수 있다. 태그에 없다는 것은 약한 증거일 뿐, 증명은 아니다. 네 번째나 다섯 번째의 조용한 채택자가 존재한다면, 그것이 바로 그렇게 보이지 않게 머무는 방식이다.
다른 사람들은 모두 서로 다른 선형 어텐션을 골랐다.
'Kimi Linear가 채택을 늘려 가고 있다'는 것이 화제가 되는 이유는, 2026년 대부분의 기간 동안 실제로는 그렇지 않았기 때문이다. 하이브리드 선형 어텐션은 오픈웨이트 분야를 휩쓸었지만, 이 변형은 그렇지 않았다. 2026년 2월에 발표된 아키텍처 조사에 따르면, Qwen3-Next 80B-A3B와 Qwen3.5-397B-A17B는 모두 Gated DeltaNet과 게이티드 어텐션을 3:1 비율로 결합한다. 즉, Qwen3.5-397B-A17B는 총 60개 레이어 중 45개를 순환 레이어로, 15개를 전체 어텐션 레이어로 운영한다. 이전 Ling 플래그십은 MLA와 Lightning Attention을 7:1로 사용했다. Nemotron 3 Nano 30B-A3B와 Super 120B-A12B는 Mamba-2 하이브리드로, 각각 52개 레이어 스택 중 6개, 88개 레이어 스택 중 8개만 어텐션 레이어다. GLM-5는 MLA를 유지하고 그 위에 스파스 어텐션을 추가했다. MiniMax-M2.5는 완전히 반대 방향으로 가서 일반 멀티헤드 어텐션을 유지했는데, 알려진 바에 따르면 신뢰성 때문이었다. 그리고 K3 이전 Moonshot의 자체 플래그십이었던 Kimi K2.5는 MLA였다. 연구소는 2025년 10월 KDA를 발표했지만, 2026년 7월이 되어서야 프론티어 모델에 적용했다.
그래서 카테고리는 승리했고 변형은 그렇지 못했다. 모두가 당신의 레이어 중 4분의 3은 순환적일 수 있다는 데 동의하지만, 어떤 순환 방식인지에 대해서는 아무도 동의하지 않았다. KDA의 차별점은 채널별 감쇠 게이트이며, 그 대가로 생태계의 절반이 이미 갖고 있던 Gated DeltaNet 경로 대신 KDA의 커스텀 커널과 프리픽스 캐싱 배관이 필요하다는 것이다. 이번 달까지는 한 연구실만 그 비용을 감당했다.
이미 일어난 채택은 서빙 스택에 있습니다
아키텍처는 우아해서 퍼지는 것이 아니라, 인프라가 그 비용을 낮출 때 퍼진다. KDA의 경우 이 부분은 이미 끝났으며, 모델 카드 채택보다 더 빠르게 이루어졌다. vLLM과 SGLang은 모두 Kimi K3의 가중치가 2026년 7월 27일에 공개되자 데이제로(day-zero) 지원을 제공했고, Moonshot은 자체 포크를 유지하는 대신 KDA 프리픽스 캐싱 구현을 vLLM 자체에 업스트림으로 기여했다. SGLang은 융합된 KDA 및 Gated DeltaNet 커널을 제공했으며, 동일한 하드웨어에서 논리적 KV 용량이 150만 토큰에서 1220만 토큰으로 증가했다고 보고했다. 이는 SGLang 자체 측정값이며, 이 전체 이야기에서 가장 구체적인 제3자 효율성 수치다. 참조 커널은 fla-core에 있으며, 어떤 소규모 학습 실행에서도 이를 가져올 수 있다.
이것이 2025년 12월 Arcee가 의도적인 연구 노력이 필요했던 것과 2026년 7월의 어느 한 주 동안 네 개의 익명 저장소가 가볍게 KDA를 선언한 것의 차이입니다. 그 메커니즘은 설치하는 의존성이 되었습니다. 프런티어가 뒤따르는지는 별개의 문제이지만, KDA에 반대하는 마찰 논쟁은 대부분 사라졌습니다.
토큰만 구매하는 경우 무엇이 달라지나요?
당신의 코드와는 아무 관련이 없습니다. 당신은 KDA를 호출하지 않으며, 그저 백만 토큰 컨텍스트의 비용과 첫 번째 토큰이 나올 때까지 걸리는 시간으로 이를 경험할 뿐입니다. Kimi K3는 오늘날 그 점이 상업적으로 드러나는 모델입니다 — OrcaRouter에서 이 모델은 백만 입력 토큰당 3.00달러, 백만 출력 토큰당 15.00달러에 실행되며, 전체 1M 토큰 컨텍스트와 지난 7일 동안 측정된 p50 첫 토큰 도달 시간 8.88초를 제공합니다. 그러한 경제성은 본질적으로 3:1 KDA 하이브리드가 제공하는 것입니다: 백만 토큰 컨텍스트를 서비스하는 비용이 단지 비쌀 뿐, 감당할 수 없을 정도는 아닌 가격을 말입니다.

연구 체크포인트는 별개의 문제입니다. Kimi-Linear-48B-A3B-Instruct는 MIT 라이선스로 배포되며 Hugging Face 페이지에 추론 제공자가 하나 등재되어 있습니다. OrcaRouter에는 없으므로, 실행하려면 자체 호스팅을 하거나 해당 제공자를 이용해야 한다는 뜻입니다. 자체 호스팅의 계산은 파라미터 수가 암시하는 것보다 부담이 적습니다. bf16 기준 48B 가중치는 약 96GB이므로 80GB 카드 두 장이 필요하고, 4비트 MLX 및 GGUF 변환본은 25-30GB 수준이라 단일 카드나 사양이 좋은 Mac에서 실행할 수 있습니다. Ling-3.0-flash 역시 현재 OrcaRouter에 없습니다. 우리는 라우팅에 관한 주장을 하기 위해 그렇지 않은 척 하지 않겠습니다.
여기서 라우팅이 실제로 중요해지는 지점은 아키텍처에 대한 베팅이 틀렸을 때의 비용입니다. 하이브리드 선형 어텐션 모델은 공급업체의 벤치마크 표와 여러분의 워크로드가 서로 어긋날 수 있는 바로 그 부류입니다. 고정 크기의 순환 상태는 어떤 종합 점수도 드러내지 못하는 검색 패턴에서 실패하는데, 이것이 절반으로 줄어든 GSM8K 수치가 주는 교훈입니다. 하나의 API 키로 200개 이상의 모델을 비교하는 것은 테스트가 조달 사이클이 아니라 변경된 모델 문자열 하나로 수행된다는 뜻이며, 공급업체 정가에 우리 측 마크업은 0%, 자동 장애 조치(failover)가 적용되어 아직 평가 중인 장문 컨텍스트 모델이 프로덕션 경로에서 단일 장애점이 되지 않도록 합니다. 직접 하루 동안 여러분의 장문 컨텍스트 트래픽으로 시도해 보세요. 그것은 우리 것을 포함한 어떤 벤치마크 표보다 더 저렴한 답입니다.
실제로 물어볼 가치가 있는 질문들
Kimi Linear와 Kimi K3는 같은 것인가요?
아니요, 이 둘을 혼동하는 것은 두 제품을 다룰 때 가장 흔한 오류입니다. Kimi Linear는 아키텍처 논문과 총 48B 파라미터(활성 3B) 규모의 연구용 모델로, 1M 컨텍스트를 지원하며 2025년 말 MIT 라이선스로 공개되었습니다. 동일한 학습 조건에서 KDA 중심 하이브리드가 완전한 MLA보다 우수함을 입증하기 위한 모델입니다. Kimi K3는 Moonshot의 2026년 7월 플래그십 모델로, 총 2.8조 파라미터(활성 104B)에 네이티브 멀티모달, 1M 컨텍스트를 갖추고 있습니다. KDA 3:1 비율 아이디어를 프런티어 규모로 확장했으며, 여기에 Attention Residuals라는 별도의 기법을 추가했습니다. 이 기법은 연구소에 따르면 약 2% 미만의 추가 비용으로 약 25%의 학습 효율 향상을 가져옵니다. 공유된 메커니즘, 그러나 완전히 다른 규모, 성능, 가격입니다. 한쪽의 벤치마크로 다른 쪽에 대해 알 수 있는 것은 매우 제한적입니다.
대부분이 Gated DeltaNet을 선택했는데, 왜 어떤 연구실은 KDA를 선택할까요?
KDA는 Gated DeltaNet을 엄격하게 정제한 버전이므로, 그 정제가 전환 비용을 감수할 만한 가치가 있는지가 핵심이다. 정제의 핵심은 게이트다. Gated DeltaNet은 매 스텝 하나의 스칼라로 순환 메모리를 감쇠시키는 반면, KDA는 특성 채널별 감쇠를 학습한다. 덕분에 상태는 변수가 등장했던 문장을 비워내면서도 그 변수 이름을 만 개의 토큰에 걸쳐 유지할 수 있다. Moonshot의 절제 실험은 이 효과를 48B에서 약 0.12의 검증 퍼플렉서티로 평가했고, KDA의 청크 기반 DPLR 공식은 텐서 코어를 바쁘게 유지하도록 설계되었기 때문에 추가 표현력이 벌어들인 처리량을 깎아먹지 않는다. 반면, Gated DeltaNet은 어느 쪽이 유행하기 전부터 이미 폭넓은 커널·프레임워크 지원을 갖추고 있었으며, 이는 실질적인 엔지니어링 시간의 가치가 있다. 2026년의 대답은 대체로 "그럴 가치가 없다"였다. Ling-3.0-flash는 그 반대 방향으로 건 최초의 프로덕션 규모 베팅이다.
혹시 이 중에 이번 분기에 배포할 내용을 바꿔야 할 것이 있나요?
매우 긴 컨텍스트를 실행하는 경우에만 해당됩니다. 프롬프트가 약 32k 토큰 미만이라면, 하이브리드 선형 어텐션은 구현 세부 사항일 뿐이며 모델 선택에 영향을 미치지 않습니다. 평소처럼 품질, 가격, 지연 시간을 기준으로 선택하세요. 128k 이상을 사용한다면, 해당 길이에서 비용을 합리적으로 유지해 주는 모델이 점점 더 KDA 하이브리드라는 점과, 이들이 공개한 긴 컨텍스트 점수가 적대적 회상 탐침이 아닌 종합 벤치마크라는 점을 알아 두는 것이 좋습니다. RULER 점수를 맹신하지 말고 실제 컨텍스트 길이에서 검색(retrieval)을 테스트하세요. 그 메커니즘이 Gated DeltaNet이나 Mamba-2였다 하더라도 이 조언은 동일했을 것입니다.
이것이 그 주장을 어떻게 남겨두는지
방향적으로는 맞고, 들리는 것보다는 규모가 작다. 2026년 8월 5일에 검증 가능한 것은 기존 연구소에서 나온 프로덕션 모델 하나, 솔직한 단점을 발표한 독립 미국 연구소의 연구 페어 하나, 지난 10일간의 소수의 sub-1B 저장소, 그리고 이미 커널을 흡수한 서빙 생태계다. 그것은 '한 연구소의 트릭' 그 이상이면서 표준보다는 훨씬 못 미친다. 주목해야 할 숫자는 외부 모델 세 개가 아니라, Moonshot이 아닌 연구소의 다음 프런티어 오픈웨이트 릴리스가 채널별 게이팅을 탑재하는지 여부와, Moonshot 외부의 누군가가 고정 크기 상태가 실제로 무엇을 잊는지 테스트하는 리콜 프로브를 발표하는지 여부다. 둘 다 또 다른 스크린샷보다 더 많은 것을 말해줄 것이다.
