생성된 타이틀 카드에는 "Kimi K4"라는 제목, "유출이 말하는 것, 그리고 말하지 않는 것"이라는 부제, "유출 / 미검증" 배지, "모델 카드 없음", "가중치 없음", "가격 또는 라우트 없음"이라고 적힌 세로로 쌓인 세 줄, 그리고 "2026년 9월 25일 기준"이라는 바닥글 줄이 표시되어 있으며, OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Kimi K4: 유출된 내용이 실제로 주장하는 것, 그리고 왜 "더 적은 활성 파라미터"가 진짜 핵심이 될 것인가

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

단 한 편의 게시물이 아직 발표되지 않은 네 가지 모델 이름을 한꺼번에 유통시키고 있다. 목록은 K​imi K4로 시작한다. Moonshot AI의 차기작으로 추정되는 이 모델은 다음 모델들과 나란히 놓여 있다: GLM-5.5 Flash와 GLM-5.4는 Z.ai에서 나온 것이며, D​eepSeek V4.1P — 그리고 작성자 자신이 강조하는 것은 어떤 플래그십 이름도 아니고, K4 밑에 깔린 산술에 대한 의혹, 즉 K4가 자신이 대체하는 모델보다 더 적은 파라미터를 활성화할 수 있다는 점이다. 그 주장은 검증되지 않았다. K​imi K4 모델 카드도, 가중치도, API 식별자도, 가격도, 경로도 없으며, 목록에 있는 모든 Z.ai 이름도 마찬가지다. 지금 해 볼 가치가 있는 일은 이 주장들 중 어느 것이 확인 가능한지, 출시된 기준 모델은 어떤 모습인지, 그리고 더 희소한 K4가 실제로 무엇을 의미할지를 따져 보는 것이다.

시그널, 그리고 그 티어

이것은 초기 신호이며, 그렇게 읽어야 한다. 이를 담고 있는 게시물은 목격 보고라기보다 모델 명명 규칙에 대한 해석이다: "GLM-5.5 Flash, GLM-5.4"를 흥미로운 명명법으로 짚고, K​imi K4를 "매우 이상하다"고 부르며, 그런 다음 설정이나 체크포인트 목록, 스테이징 엔드포인트를 봤다고 주장하지 않으면서 더 적게 활성화되는 전문가라는 추측성 메커니즘을 제시한다.

공개 기록상 그 이름들을 반박하는 내용은 없고, 그렇다고 뒷받침하는 내용도 없습니다. 이러한 비대칭성은 릴리스 주기의 이 단계에서는 정상이며, 바로 그렇기 때문에 유용한 행보는 더 추측하는 것이 아니라 기준선과 테스트를 확정하는 것입니다. 게시물에 등장하는 이름은 제품에 대한 가설일 뿐, 제품의 증거가 아닙니다.

Kimi K4를 측정할 기준선

Kimi K3는 실제로 존재하고 출시되었으며, 유난히 잘 문서화되어 있어 확고한 기준점이 된다. Moonshot의 자체 모델 카드는 2.8조 파라미터 Mixture-of-Experts 모델을 설명하는데, 이 모델은 토큰당 104B 파라미터를 활성화하며 93개 레이어에 걸쳐 있다 — 하나의 dense 레이어와 92개의 sparse 레이어다. 희소성은 공격적이며 명확히 명시되어 있다: 토큰당 896개 전문가 중 16개가 발동하고, 2개의 공유 전문가에 더해지며, Moonshot은 이를 Kimi K2 대비 스케일링 효율이 약 2.5배 향상된 것으로 평가한다.

어텐션 스택은 K3가 이전 세대와 결별하는 지점이다. 92개 희소 레이어 중 69개는 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention을 사용하고, 24개는 gated MLA를 사용한다. 이는 3:1 분할로, 소수의 전체 어텐션 레이어만 유지하고 나머지는 더 저렴한 선형 경로로 보낸다. 레이어는 12개 블록마다 어텐션 잔차를 전달하며, 활성화 함수는 SiTU-GLU이고, 전체 모델은 양자화 인식 학습 아래 MXFP4 가중치와 MXFP8 활성화로 학습된다. 컨텍스트 길이는 1,048,576토큰, 어휘는 163,840개이며, 비전은 4억 100만 파라미터의 MoonViT-V2 인코더를 통해 처리된다. 따라서 K3는 멀티모달을 덧붙인 방식이 아니라 기본적으로 이미지 처리 능력을 갖춘다.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

그것들은 후속 모델이 바꿔 놓아야 하는 숫자들이다. 그 숫자들이 "더 적은 활성 파라미터"라는 발상에 대해 무엇을 시사하는지 주목하라: K3는 이미 극도로 희소한 모델이다. 토큰당 전체 파라미터 수의 약 3.7%를 활성화한다. 104B 미만을 활성화하는 K4는 과잉 설계에서 군살을 빼는 것이 아니라, Moonshot이 공개적으로 성과로 내세워 온 희소성 비율을 되돌리는 것이 될 것이며, 그것도 나머지 업계가 반대 방향으로 가고 있는 세대에서 그렇게 할 것이다.

"활성 파라미터가 더 적다"는 말이 사실이라면 그것이 무엇을 의미할까

두 가지 해석이 가능하며, 이들은 서로 반대 방향을 가리킨다. 더 호의적인 해석은 아키텍처적이다. Moonshot은 KDA 하이브리드를 더 확장하여 더 많은 전체 어텐션 층을 선형 층으로 교체하고 전문가 예산을 재조정함으로써, 더 낮은 활성화 수가 더 긴 컨텍스트, 더 저렴한 서빙 풋프린트, 또는 더 나은 품질/FLOP 비율을 확보하게 할 수 있다. 그 해석에 따르면, 더 적은 활성 파라미터는 K3가 이미 제시한 동일한 논지, 즉 희소성이 타협이 아니라 스케일링 전략이라는 논지의 정교화다.

다른 해석은 K4가 전혀 일률적인 후속 모델이 아니라는 것이다. K​imi의 라인은 올해 이미 한 차례 분기했고, 보도들은 K3.1, K3.2, K4를 서로 다른 세 제품으로 여러모로 암시해 왔다. 별도의 코딩 변형을 함께 내놓는 제품군에서 K3보다 활성화가 적은 K4는, 단순한 업그레이드와 마찬가지로 재포지셔닝과도 최소한 일관된다. 두 해석 모두 추측이다. 어느 쪽도 게시물 하나로 확정되지 않는다.

아무도 다루지 않은 라이선스 측면도 있다. K3의 가중치는 표준 오픈소스 라이선스가 아닌 맞춤형 "기타" 라이선스인 Kimi K3 License 아래 공개되었으며, 최초의 공개 3T급 모델이다. 더 희소한 K4가 그 라이선스를 그대로 물려받을지, 아니면 범위를 좁힐지는 가중치 위에 구축하는 사람에게 인덱스 점수 몇 점보다 더 중요하다.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

같은 게시물에 있는 나머지 세 이름

GLM-5.5 Flash와 GLM-5.4는 더 놀라운 한 쌍인데, 그 이유가 수치 때문만은 아니다. Z.ai가 공개한 상한은 GLM-5.3으로, 2026년 8월 14일에 743B 파라미터로 출시되었고, GLM-5.3-Flash가 8월 26일에 뒤이어 나왔으며 BF16 및 Flash-BF16 가중치 릴리스는 8월 25일에 공개되었다. Z.ai 자체 문서에는 현재 모델 식별자를 정확히 세 개만 나열한다: glm-5.3, glm-5.3-flash, glm-5.2. GLM-5.4도, GLM-5.5도, GLM-5.5 Flash도 없다 — 그리고 이상한 점은 명명 방향인데, 5.5 세대가 5.4 세대보다 앞서는 것은 Z.ai가 지금까지 패밀리에 번호를 매겨온 방식이 아니다. 유출에서 버전 번호가 순서를 벗어나 나타나는 것은 익숙한 실패 모드다: 그것들은 새로운 기본 모델이라기보다 인접 제품, 내부 코드명, 또는 서빙 티어 레이블인 경향이 있다.

DeepSeek V4.1P는 해당 시그널의 작성자가 가장 관심을 갖는다고 밝힌 이름이며, 네 가지 중 확인하기 가장 쉽다. DeepSeek의 API 문서에는 현재 모델 문자열이 정확히 두 개 명시되어 있다: deepseek-flash 및 deepseek-v4-pro. "P" 접미사는 어떤 DeepSeek 식별자에도 대응하는 것이 없으며, DeepSeek 자체 조직에서 가장 최근에 공개한 가중치는 2026년 9월 10일에 공개된 DeepSeek-V4.1-Flash이다. V4.1P는 그 모델의 Pro 등급 형제 모델일 가능성이 가장 크다 — 하지만 "가장 가능성이 크다"는 것은 문자열에 대한 추측이지 제품에 대한 것이 아니다.

이 중에 뭐가 진짜인지 네가 어떻게 알겠어?

그 네 이름은 같은 방식으로 같은 테스트에서 실패한다. 그 덕분에 기다림은 괴롭기보다는 수월하다. 진짜 릴리스는 아티팩트를 남기며, 그 각각은 확인하는 데 비용이 적게 든다:

• 벤더 자체의 Hugging Face 조직에 있는 모델 카드. Moonshot의 최신 항목은 2026년 6월 13일에 만들어진 Kimi-K3입니다. Z.ai의 최신 제품은 8월 25일자의 GLM-5.3 제품군이며, D​eepSeek의 최신 제품은 9월 10일자의 DeepSeek-V4.1-Flash입니다. 이 세 곳 어디에도 더 새로운 것은 없습니다.

• 논쟁을 종결하는 설정. 특히 K4의 경우, 찾아야 할 필드는 num_experts 및 num_experts_per_token — K3의 값은 896과 16입니다. 토큰당 수치가 더 낮은 K4 설정이라면, 이 유출의 주장이 단일 파일에서 확인되거나 반박되는 것입니다.

• 라우팅 가능한 모델. 카탈로그에 등장하는 이름은 가격과 컨텍스트 윈도우, 그리고 그 뒤에 있는 제공자를 갖춘 이름이다. 게시물에만 있는 이름은 그중 아무것도 갖추지 못한다.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

오늘 라우팅할 수 있는 것

실용적으로 보면, 이 유출이 설명하는 세대는 여러분이 기반으로 삼을 수 있는 세대가 아닙니다. 실제로 가동 중인 것은 이전 세대이며, 라우터의 역할은 세대 간 격차를 마이그레이션 프로젝트가 아니라 라우팅 결정으로 만드는 것입니다. Kimi K3는 현재 전체 1M 토큰 컨텍스트와 네이티브 비전을 갖추고 이용 가능하며, 가격은 백만 입력 토큰당 $3.00, 백만 출력 토큰당 $15.00, 캐시 읽기는 $0.30입니다 — 공급자 요율로 청구되며 마크업이 전혀 없기 때문에, K3의 공급업체 가격 변경은 다음 재가격 주기가 아니라 같은 날 청구서에 반영됩니다. OrcaRouter의 Kimi K3는 전체 스펙 시트와 현재 요금을 제공합니다.

보드의 나머지 부분에도 같은 원칙이 적용됩니다. GLM-5.3, GLM-5.3-Flash, DeepSeek V4.1 Flash는 모두 Kimi K3와 나란히 라우팅할 수 있으며, 200개 이상의 모델을 아우르는 단일 OpenAI 호환 엔드포인트를 통해, 제공자가 성능이 저하될 때 자동 페일오버가 이루어지고 선호도를 표현하기 위한 라우팅 DSL이 제공됩니다. 비용 상한, 품질 하한, 지연 시간 예산 같은 것들을 호출별 로직이 아니라 정책으로서 말입니다. K​imi K4, GLM-5.5 Flash 또는 D​eepSeek V4.1P가 등장하면, 마이그레이션은 라우팅 정책에서 문자열 하나를 바꾸는 것 외에는 아무것도 아닙니다. 모델 퓨전을 사용하면 어떤 작업이 그로부터 이점을 얻을 때 동일한 엔드포인트에서 여러 모델의 출력을 결합할 수 있습니다.

분명히 말하자면, 그것이 아닌 것은 다음과 같습니다: 유출된 네 개의 이름 중 어느 것도 현재 OrcaRouter의 라우트가 아닙니다. 우리는 그것들을 호스팅하지 않으며 제공할 수도 없습니다.

결론

여기서 흥미로운 주장은 버전 번호가 아니다. 그것은 메커니즘, 즉 차세대 플래그십이 전작보다 더 적은 매개변수를 활성화한다는 것은 Moonshot이 원시 활성화 수가 아니라 희소성이 밀어붙일 가치가 있는 축이라고 믿는다는 진술일 것이다. 그리고 K3의 896개 중 16개 전문가 분할은 이미 그 방향의 논거다. 이 주장의 모든 부분은 검증되지 않았다: K​imi K4, GLM-5.5 Flash, GLM-5.4, D​eepSeek V4.1P에는 모델 카드도, 가중치도, API 식별자도, 가격도 없으며, 각 공급업체의 자체 카탈로그는 각각 한 세대 이전에서 멈춘다. 이 이름들을 답이 아니라 질문의 미리보기로 취급하라 — 그리고 오늘 1M 컨텍스트에서 프런티어급 오픈 가중치가 필요하다면, Kimi K3가 이미 존재하는 모델이다.

K​​ K4가 실제로 도착하면, 자동 페일오버가 바로 마이그레이션이 장애로 이어지지 않게 하는 것입니다