
Kimi K4: 유출된 내용이 실제로 주장하는 것, 그리고 왜 "더 적은 활성 파라미터"가 진짜 핵심이 될 것인가
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 506 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
단 한 편의 게시물이 아직 발표되지 않은 네 가지 모델 이름을 한꺼번에 유통시키고 있다. 목록은 Kimi K4로 시작한다. Moonshot AI의 차기작으로 추정되는 이 모델은 다음 모델들과 나란히 놓여 있다: GLM-5.5 Flash와 GLM-5.4는 Z.ai에서 나온 것이며, DeepSeek V4.1P — 그리고 작성자 자신이 강조하는 것은 어떤 플래그십 이름도 아니고, K4 밑에 깔린 산술에 대한 의혹, 즉 K4가 자신이 대체하는 모델보다 더 적은 파라미터를 활성화할 수 있다는 점이다. 그 주장은 검증되지 않았다. Kimi K4 모델 카드도, 가중치도, API 식별자도, 가격도, 경로도 없으며, 목록에 있는 모든 Z.ai 이름도 마찬가지다. 지금 해 볼 가치가 있는 일은 이 주장들 중 어느 것이 확인 가능한지, 출시된 기준 모델은 어떤 모습인지, 그리고 더 희소한 K4가 실제로 무엇을 의미할지를 따져 보는 것이다.
시그널, 그리고 그 티어
이것은 초기 신호이며, 그렇게 읽어야 한다. 이를 담고 있는 게시물은 목격 보고라기보다 모델 명명 규칙에 대한 해석이다: "GLM-5.5 Flash, GLM-5.4"를 흥미로운 명명법으로 짚고, Kimi K4를 "매우 이상하다"고 부르며, 그런 다음 설정이나 체크포인트 목록, 스테이징 엔드포인트를 봤다고 주장하지 않으면서 더 적게 활성화되는 전문가라는 추측성 메커니즘을 제시한다.
공개 기록상 그 이름들을 반박하는 내용은 없고, 그렇다고 뒷받침하는 내용도 없습니다. 이러한 비대칭성은 릴리스 주기의 이 단계에서는 정상이며, 바로 그렇기 때문에 유용한 행보는 더 추측하는 것이 아니라 기준선과 테스트를 확정하는 것입니다. 게시물에 등장하는 이름은 제품에 대한 가설일 뿐, 제품의 증거가 아닙니다.
Kimi K4를 측정할 기준선
Kimi K3는 실제로 존재하고 출시되었으며, 유난히 잘 문서화되어 있어 확고한 기준점이 된다. Moonshot의 자체 모델 카드는 2.8조 파라미터 Mixture-of-Experts 모델을 설명하는데, 이 모델은 토큰당 104B 파라미터를 활성화하며 93개 레이어에 걸쳐 있다 — 하나의 dense 레이어와 92개의 sparse 레이어다. 희소성은 공격적이며 명확히 명시되어 있다: 토큰당 896개 전문가 중 16개가 발동하고, 2개의 공유 전문가에 더해지며, Moonshot은 이를 Kimi K2 대비 스케일링 효율이 약 2.5배 향상된 것으로 평가한다.
어텐션 스택은 K3가 이전 세대와 결별하는 지점이다. 92개 희소 레이어 중 69개는 하이브리드 선형 어텐션 메커니즘인 Kimi Delta Attention을 사용하고, 24개는 gated MLA를 사용한다. 이는 3:1 분할로, 소수의 전체 어텐션 레이어만 유지하고 나머지는 더 저렴한 선형 경로로 보낸다. 레이어는 12개 블록마다 어텐션 잔차를 전달하며, 활성화 함수는 SiTU-GLU이고, 전체 모델은 양자화 인식 학습 아래 MXFP4 가중치와 MXFP8 활성화로 학습된다. 컨텍스트 길이는 1,048,576토큰, 어휘는 163,840개이며, 비전은 4억 100만 파라미터의 MoonViT-V2 인코더를 통해 처리된다. 따라서 K3는 멀티모달을 덧붙인 방식이 아니라 기본적으로 이미지 처리 능력을 갖춘다.

그것들은 후속 모델이 바꿔 놓아야 하는 숫자들이다. 그 숫자들이 "더 적은 활성 파라미터"라는 발상에 대해 무엇을 시사하는지 주목하라: K3는 이미 극도로 희소한 모델이다. 토큰당 전체 파라미터 수의 약 3.7%를 활성화한다. 104B 미만을 활성화하는 K4는 과잉 설계에서 군살을 빼는 것이 아니라, Moonshot이 공개적으로 성과로 내세워 온 희소성 비율을 되돌리는 것이 될 것이며, 그것도 나머지 업계가 반대 방향으로 가고 있는 세대에서 그렇게 할 것이다.
"활성 파라미터가 더 적다"는 말이 사실이라면 그것이 무엇을 의미할까
두 가지 해석이 가능하며, 이들은 서로 반대 방향을 가리킨다. 더 호의적인 해석은 아키텍처적이다. Moonshot은 KDA 하이브리드를 더 확장하여 더 많은 전체 어텐션 층을 선형 층으로 교체하고 전문가 예산을 재조정함으로써, 더 낮은 활성화 수가 더 긴 컨텍스트, 더 저렴한 서빙 풋프린트, 또는 더 나은 품질/FLOP 비율을 확보하게 할 수 있다. 그 해석에 따르면, 더 적은 활성 파라미터는 K3가 이미 제시한 동일한 논지, 즉 희소성이 타협이 아니라 스케일링 전략이라는 논지의 정교화다.
다른 해석은 K4가 전혀 일률적인 후속 모델이 아니라는 것이다. Kimi의 라인은 올해 이미 한 차례 분기했고, 보도들은 K3.1, K3.2, K4를 서로 다른 세 제품으로 여러모로 암시해 왔다. 별도의 코딩 변형을 함께 내놓는 제품군에서 K3보다 활성화가 적은 K4는, 단순한 업그레이드와 마찬가지로 재포지셔닝과도 최소한 일관된다. 두 해석 모두 추측이다. 어느 쪽도 게시물 하나로 확정되지 않는다.
아무도 다루지 않은 라이선스 측면도 있다. K3의 가중치는 표준 오픈소스 라이선스가 아닌 맞춤형 "기타" 라이선스인 Kimi K3 License 아래 공개되었으며, 최초의 공개 3T급 모델이다. 더 희소한 K4가 그 라이선스를 그대로 물려받을지, 아니면 범위를 좁힐지는 가중치 위에 구축하는 사람에게 인덱스 점수 몇 점보다 더 중요하다.

같은 게시물에 있는 나머지 세 이름
GLM-5.5 Flash와 GLM-5.4는 더 놀라운 한 쌍인데, 그 이유가 수치 때문만은 아니다. Z.ai가 공개한 상한은 GLM-5.3으로, 2026년 8월 14일에 743B 파라미터로 출시되었고, GLM-5.3-Flash가 8월 26일에 뒤이어 나왔으며 BF16 및 Flash-BF16 가중치 릴리스는 8월 25일에 공개되었다. Z.ai 자체 문서에는 현재 모델 식별자를 정확히 세 개만 나열한다: glm-5.3, glm-5.3-flash, glm-5.2. GLM-5.4도, GLM-5.5도, GLM-5.5 Flash도 없다 — 그리고 이상한 점은 명명 방향인데, 5.5 세대가 5.4 세대보다 앞서는 것은 Z.ai가 지금까지 패밀리에 번호를 매겨온 방식이 아니다. 유출에서 버전 번호가 순서를 벗어나 나타나는 것은 익숙한 실패 모드다: 그것들은 새로운 기본 모델이라기보다 인접 제품, 내부 코드명, 또는 서빙 티어 레이블인 경향이 있다.
DeepSeek V4.1P는 해당 시그널의 작성자가 가장 관심을 갖는다고 밝힌 이름이며, 네 가지 중 확인하기 가장 쉽다. DeepSeek의 API 문서에는 현재 모델 문자열이 정확히 두 개 명시되어 있다: deepseek-flash 및 deepseek-v4-pro. "P" 접미사는 어떤 DeepSeek 식별자에도 대응하는 것이 없으며, DeepSeek 자체 조직에서 가장 최근에 공개한 가중치는 2026년 9월 10일에 공개된 DeepSeek-V4.1-Flash이다. V4.1P는 그 모델의 Pro 등급 형제 모델일 가능성이 가장 크다 — 하지만 "가장 가능성이 크다"는 것은 문자열에 대한 추측이지 제품에 대한 것이 아니다.
이 중에 뭐가 진짜인지 네가 어떻게 알겠어?
그 네 이름은 같은 방식으로 같은 테스트에서 실패한다. 그 덕분에 기다림은 괴롭기보다는 수월하다. 진짜 릴리스는 아티팩트를 남기며, 그 각각은 확인하는 데 비용이 적게 든다:
• 벤더 자체의 Hugging Face 조직에 있는 모델 카드. Moonshot의 최신 항목은 2026년 6월 13일에 만들어진 Kimi-K3입니다. Z.ai의 최신 제품은 8월 25일자의 GLM-5.3 제품군이며, DeepSeek의 최신 제품은 9월 10일자의 DeepSeek-V4.1-Flash입니다. 이 세 곳 어디에도 더 새로운 것은 없습니다.
• 논쟁을 종결하는 설정. 특히 K4의 경우, 찾아야 할 필드는 num_experts 및 num_experts_per_token — K3의 값은 896과 16입니다. 토큰당 수치가 더 낮은 K4 설정이라면, 이 유출의 주장이 단일 파일에서 확인되거나 반박되는 것입니다.
• 라우팅 가능한 모델. 카탈로그에 등장하는 이름은 가격과 컨텍스트 윈도우, 그리고 그 뒤에 있는 제공자를 갖춘 이름이다. 게시물에만 있는 이름은 그중 아무것도 갖추지 못한다.

오늘 라우팅할 수 있는 것
실용적으로 보면, 이 유출이 설명하는 세대는 여러분이 기반으로 삼을 수 있는 세대가 아닙니다. 실제로 가동 중인 것은 이전 세대이며, 라우터의 역할은 세대 간 격차를 마이그레이션 프로젝트가 아니라 라우팅 결정으로 만드는 것입니다. Kimi K3는 현재 전체 1M 토큰 컨텍스트와 네이티브 비전을 갖추고 이용 가능하며, 가격은 백만 입력 토큰당 $3.00, 백만 출력 토큰당 $15.00, 캐시 읽기는 $0.30입니다 — 공급자 요율로 청구되며 마크업이 전혀 없기 때문에, K3의 공급업체 가격 변경은 다음 재가격 주기가 아니라 같은 날 청구서에 반영됩니다. OrcaRouter의 Kimi K3는 전체 스펙 시트와 현재 요금을 제공합니다.
보드의 나머지 부분에도 같은 원칙이 적용됩니다. GLM-5.3, GLM-5.3-Flash, DeepSeek V4.1 Flash는 모두 Kimi K3와 나란히 라우팅할 수 있으며, 200개 이상의 모델을 아우르는 단일 OpenAI 호환 엔드포인트를 통해, 제공자가 성능이 저하될 때 자동 페일오버가 이루어지고 선호도를 표현하기 위한 라우팅 DSL이 제공됩니다. 비용 상한, 품질 하한, 지연 시간 예산 같은 것들을 호출별 로직이 아니라 정책으로서 말입니다. Kimi K4, GLM-5.5 Flash 또는 DeepSeek V4.1P가 등장하면, 마이그레이션은 라우팅 정책에서 문자열 하나를 바꾸는 것 외에는 아무것도 아닙니다. 모델 퓨전을 사용하면 어떤 작업이 그로부터 이점을 얻을 때 동일한 엔드포인트에서 여러 모델의 출력을 결합할 수 있습니다.
분명히 말하자면, 그것이 아닌 것은 다음과 같습니다: 유출된 네 개의 이름 중 어느 것도 현재 OrcaRouter의 라우트가 아닙니다. 우리는 그것들을 호스팅하지 않으며 제공할 수도 없습니다.
결론
여기서 흥미로운 주장은 버전 번호가 아니다. 그것은 메커니즘, 즉 차세대 플래그십이 전작보다 더 적은 매개변수를 활성화한다는 것은 Moonshot이 원시 활성화 수가 아니라 희소성이 밀어붙일 가치가 있는 축이라고 믿는다는 진술일 것이다. 그리고 K3의 896개 중 16개 전문가 분할은 이미 그 방향의 논거다. 이 주장의 모든 부분은 검증되지 않았다: Kimi K4, GLM-5.5 Flash, GLM-5.4, DeepSeek V4.1P에는 모델 카드도, 가중치도, API 식별자도, 가격도 없으며, 각 공급업체의 자체 카탈로그는 각각 한 세대 이전에서 멈춘다. 이 이름들을 답이 아니라 질문의 미리보기로 취급하라 — 그리고 오늘 1M 컨텍스트에서 프런티어급 오픈 가중치가 필요하다면, Kimi K3가 이미 존재하는 모델이다.
K K4가 실제로 도착하면, 자동 페일오버가 바로 마이그레이션이 장애로 이어지지 않게 하는 것입니다
