Một thẻ tiêu đề được tạo có nội dung "Kimi K4" với phụ đề "những gì rò rỉ nói, và những gì nó không nói", một huy hiệu RÒ RỈ / CHƯA XÁC MINH, ba dòng xếp chồng đọc "Không có thẻ mô hình", "Không có trọng số" và "Không có giá hoặc tuyến đường", và một dòng chân trang "Tính đến ngày 25 tháng 9 năm 2026", với logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Kimi K4: vụ rò rỉ thực sự tuyên bố điều gì, và vì sao “ít tham số hoạt động hơn” mới là câu chuyện thật sự

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Một bài đăng duy nhất đã đưa bốn cái tên model chưa được công bố vào lưu hành cùng một lúc. Danh sách bắt đầu với K​imi K4, được cho là thế hệ kế tiếp từ Moonshot AI, nằm bên cạnh GLM-5.5 Flash và GLM-5.4 của Z.ai cùng D​eepSeek V4.1P — và trọng tâm của chính tác giả không nằm ở bất kỳ cái tên flagship nào mà ở một nghi ngờ về phép toán bên dưới K4: rằng nó có thể kích hoạt ít tham số hơn so với model mà nó thay thế. Khẳng định đó chưa được kiểm chứng. Không có model card nào cho K​imi K4, không có weights, không có định danh API, không có giá và không có route, và điều tương tự cũng đúng với mọi cái tên Z.ai trong danh sách. Điều đáng làm lúc này là xác định xem khẳng định nào trong số này có thể kiểm chứng được, baseline đã phát hành trông ra sao, và một K4 thưa hơn thực sự sẽ có nghĩa là gì.

Tín hiệu, và cấp độ của nó

Đây là một tín hiệu sớm, và nó nên được đọc như vậy. Bài đăng mang tín hiệu này là một bài phân tích về quy ước đặt tên mô hình hơn là một báo cáo về một lần nhìn thấy: nó đánh dấu "GLM-5.5 Flash, GLM-5.4" là một cách đặt tên thú vị và gọi K​imi K4 là "rất kỳ lạ", sau đó đưa ra một cơ chế mang tính suy đoán — ít chuyên gia được kích hoạt hơn — mà không tuyên bố đã nhìn thấy một cấu hình, một danh sách checkpoint, hay một endpoint staging.

Không có gì trong hồ sơ công khai phản bác những cái tên đó, và cũng không có gì xác nhận chúng. Sự bất đối xứng đó là bình thường ở giai đoạn này của một chu kỳ phát hành, và chính vì thế mà việc hữu ích cần làm là sửa đường cơ sở và các bài kiểm thử, chứ không phải suy đoán thêm. Một cái tên trong một bài đăng là một giả thuyết về một sản phẩm, chứ không phải bằng chứng cho thấy sản phẩm đó tồn tại.

Mốc cơ sở mà một Kimi K4 sẽ được đo lường dựa vào

Kimi K3 là thật, đã được phát hành và được ghi chép tài liệu đặc biệt đầy đủ, khiến nó trở thành một điểm tham chiếu vững chắc. Thẻ mô hình của chính Moonshot mô tả một mô hình Mixture-of-Experts 2,8 nghìn tỷ tham số, kích hoạt 104B tham số mỗi token, trải trên 93 lớp — một lớp dày đặc và 92 lớp thưa. Độ thưa ở đây rất mạnh và được nêu rõ ràng: 16 trong số 896 chuyên gia hoạt động mỗi token, cộng thêm 2 chuyên gia chia sẻ, điều mà Moonshot cho là mang lại cải thiện khoảng 2,5× về hiệu quả mở rộng so với Kimi K2.

Ngăn xếp attention là nơi K3 khác biệt so với thế hệ trước. Trong 92 lớp thưa của mình, 69 lớp sử dụng Kimi Delta Attention — một cơ chế attention tuyến tính lai — và 24 lớp sử dụng gated MLA, tỷ lệ chia 3:1 giữ lại một số ít lớp full-attention và đẩy phần còn lại sang đường tuyến tính rẻ hơn. Các lớp mang một attention residual sau mỗi 12 khối, hàm kích hoạt là SiTU-GLU, và toàn bộ mô hình được huấn luyện với trọng số MXFP4 và activation MXFP8 theo phương pháp huấn luyện nhận biết lượng tử hóa. Độ dài ngữ cảnh là 1.048.576 token, từ vựng là 163.840, và phần thị giác chạy qua bộ mã hóa MoonViT-V2 401M tham số, khiến K3 có khả năng hình ảnh vốn có thay vì đa phương thức kiểu gắn thêm.

Screenshot of the Artificial Analysis model page for Kimi K3 (max), headed "Released July 2026", whose comparison summary reads In $3.00 / Out $15.00 and describes the model as leading on intelligence but expensive next to other open-weight models of similar size, notably slow and somewhat verbose, with text and image input and a 1M-token context window.

Đó là những con số mà một bản kế nhiệm phải thay đổi. Hãy lưu ý những gì chúng ngụ ý về ý tưởng “ít tham số hoạt động hơn”: K3 vốn đã là một mô hình cực kỳ thưa. Nó kích hoạt khoảng 3,7% tổng số tham số của mình cho mỗi token. Một K4 kích hoạt ít hơn 104B sẽ không phải là cắt bỏ phần dư thừa khỏi một thiết kế được cấp phát quá mức — mà là lùi lại so với một tỷ lệ thưa mà Moonshot đã công khai coi là một thắng lợi, và nó sẽ làm vậy ngay ở thế hệ mà phần còn lại của lĩnh vực đang đi theo hướng ngược lại.

“Ít tham số hoạt động hơn” sẽ có nghĩa là gì nếu điều đó là đúng

Có hai cách đọc và chúng chỉ về hai hướng trái ngược nhau. Cách đọc thiện chí mang tính kiến trúc: Moonshot có thể đang mở rộng hybrid KDA hơn nữa, thay thế thêm nhiều lớp full-attention bằng các lớp tuyến tính và tái cân bằng ngân sách chuyên gia sao cho số lượng kích hoạt thấp hơn đổi lấy ngữ cảnh dài hơn, dấu chân phục vụ rẻ hơn, hoặc tỷ lệ chất lượng trên mỗi flop tốt hơn. Theo cách đọc đó, ít tham số hoạt động hơn là một sự tinh chỉnh của chính luận đề mà K3 đã nêu — rằng tính thưa là một chiến lược mở rộng quy mô, chứ không phải một sự thỏa hiệp.

Cách hiểu còn lại là K4 hoàn toàn không phải là một bản kế nhiệm đồng nhất. Dòng của Kimi đã phân nhánh một lần trong năm nay, và các báo cáo đã có nhiều cách ám chỉ khác nhau về K3.1, K3.2 và K4 như ba sản phẩm riêng biệt. Một K4 kích hoạt ít hơn K3, trong một dòng vốn đi kèm một biến thể lập trình riêng, thì ít nhất cũng phù hợp với việc tái định vị không kém gì so với một bản nâng cấp thẳng. Cả hai cách hiểu đều là suy đoán. Một bài đăng không giải quyết được cách nào.

Còn một khía cạnh giấy phép mà chưa ai đề cập. Trọng số của K3 được phát hành theo Giấy phép Kimi K3, một giấy phép "khác" tùy chỉnh chứ không phải một giấy phép mã nguồn mở tiêu chuẩn, và đây là mô hình mở đầu tiên thuộc lớp 3T. Việc một K4 thưa hơn có kế thừa giấy phép đó hay thu hẹp nó lại hay không quan trọng hơn đối với bất kỳ ai xây dựng trên trọng số đó so với vài điểm chỉ số.

A generated two-column scoreboard titled "Kimi K3 vs Kimi K4 — the scoreboard", with six shared rows: Status (K3 "released 15 July 2026" vs K4 "unreleased"), Total parameters ("2.8T" vs "unverified"), Activated parameters ("104B" vs "unverified"), Experts per token ("16 of 896" vs "unverified"), Context ("1M tokens" vs "unverified") and Price ("$3 / $15" vs "none"), with the footer line "Kimi K3 figures per Moonshot's model card; Kimi K4 has no model card, weights or price."

Ba cái tên còn lại trong cùng bài đăng

GLM-5.5 Flash và GLM-5.4 là cặp gây ngạc nhiên hơn, và không phải vì những con số. Mức trần được Z.ai công bố là GLM-5.3, ra mắt ngày 14 tháng 8 năm 2026 với 743B tham số, tiếp theo là GLM-5.3-Flash vào ngày 26 tháng 8 và các bản phát hành trọng số BF16 cùng Flash-BF16 vào ngày 25 tháng 8. Tài liệu của chính Z.ai liệt kê đúng ba định danh mô hình hiện hành: glm-5.3, glm-5.3-flash và glm-5.2. Không có GLM-5.4, không có GLM-5.5 và không có GLM-5.5 Flash — và hướng đặt tên mới là phần kỳ lạ, vì một thế hệ 5.5 đứng trước một thế hệ 5.4 không phải là cách Z.ai từng đánh số một dòng mô hình. Các số phiên bản xuất hiện không đúng thứ tự trong một vụ rò rỉ là một kiểu sai sót quen thuộc: chúng thường là những sản phẩm liền kề, tên mã nội bộ, hoặc một nhãn bậc phục vụ chứ không phải một mô hình nền tảng mới.

D​eepSeek V4.1P là cái tên mà tác giả của tín hiệu nói rằng họ quan tâm nhất, và đây là cái dễ kiểm chứng nhất trong bốn cái. Tài liệu API của D​eepSeek nêu tên chính xác hai chuỗi mô hình hiện hành: deepseek-flash và deepseek-v4-pro. Hậu tố "P" không có đối ứng nào trong bất kỳ định danh nào của D​eepSeek, và bản phát hành trọng số gần đây nhất trong tổ chức của chính D​eepSeek là DeepSeek-V4.1-Flash, được công bố ngày 10 tháng 9 năm 2026. Một V4.1P rất có thể sẽ là phiên bản cùng cấp Pro của mô hình đó — nhưng "rất có thể" là một phỏng đoán về một chuỗi ký tự, chứ không phải về một sản phẩm.

Làm sao bạn có thể biết bất kỳ điều nào trong số này là thật

Bốn cái tên đều trượt cùng một bài kiểm tra theo cùng một cách, khiến việc chờ đợi trở nên đơn giản thay vì khổ sở. Một bản phát hành thực sự để lại các tạo tác, và việc kiểm tra từng thứ đều không tốn kém:

• Một model card trong chính tổ chức Hugging Face của nhà cung cấp. Mục mới nhất của Moonshot là Kimi-K3, được tạo ngày 13 tháng 6 năm 2026; những mục mới nhất của Z.ai là dòng GLM-5.3 từ ngày 25 tháng 8; mục mới nhất của DeepSeek là DeepSeek-V4.1-Flash từ ngày 10 tháng 9. Không có gì mới hơn tồn tại ở bất kỳ tổ chức nào trong số ba tổ chức này.

• Một cấu hình giúp chấm dứt tranh cãi. Cụ thể với K4, những trường cần tìm là num_experts và num_experts_per_token — cấu hình của K3 ghi 896 và 16. Một cấu hình K4 với con số tính trên mỗi token thấp hơn chính là tuyên bố trong rò rỉ này, được xác nhận hay bị bác bỏ chỉ trong một tệp duy nhất.

• Một mô hình có thể định tuyến. Một cái tên xuất hiện trong danh mục là cái tên có giá, có cửa sổ ngữ cảnh và có nhà cung cấp đằng sau; một cái tên chỉ nằm trong một bài đăng thì không có những thứ đó.

Screenshot of the OrcaRouter model page for kimi/kimi-k3 by MoonshotAI, dated 2026-07-15, with Vision, Tools, JSON and Reasoning capability chips and pricing of $3.00 per million input tokens and $15.00 per million output tokens.

Những gì bạn có thể định tuyến hôm nay

Cách hiểu thực tế của thông tin rò rỉ này là thế hệ mà nó mô tả không phải là thứ bạn có thể xây dựng dựa trên. Thứ đang hoạt động thực tế là thế hệ trước, và nhiệm vụ của router là biến khoảng cách giữa các thế hệ thành một quyết định định tuyến thay vì một dự án di trú. Kimi K3 hiện đã có sẵn với ngữ cảnh đầy đủ 1M token và khả năng thị giác gốc, có giá $3.00 cho mỗi triệu token đầu vào và $15.00 cho mỗi triệu token đầu ra, với lượt đọc cache ở mức $0.30 — được tính theo mức giá của nhà cung cấp, không cộng thêm, đó là lý do vì sao thay đổi giá của nhà cung cấp đối với K3 đến hóa đơn của bạn ngay trong ngày thay vì vào chu kỳ định giá lại kế tiếp. Kimi K3 trên OrcaRouter mang đầy đủ bảng thông số kỹ thuật và mức giá hiện tại.

Điều tương tự cũng đúng với phần còn lại của bảng. GLM-5.3, GLM-5.3-Flash và DeepSeek V4.1 Flash đều có thể định tuyến cùng với Kimi K3, qua một endpoint tương thích OpenAI bao phủ hơn 200 mô hình, với khả năng chuyển đổi dự phòng tự động khi một nhà cung cấp suy giảm và một DSL định tuyến để biểu đạt các tùy chọn — mức trần chi phí, mức sàn chất lượng, ngân sách độ trễ — dưới dạng chính sách thay vì logic cho từng lệnh gọi. Khi Kimi K4, GLM-5.5 Flash hay DeepSeek V4.1P thực sự xuất hiện, việc di trú chỉ là thay đổi một chuỗi trong chính sách định tuyến và không gì khác. Hợp nhất mô hình cho phép bạn kết hợp đầu ra từ nhiều mô hình trên cùng một endpoint khi một tác vụ được hưởng lợi từ điều đó.

Để nói rõ điều đó không phải là gì: không có cái tên nào trong số bốn cái tên bị rò rỉ là một route trên OrcaRouter ở thời điểm hiện tại. Chúng tôi không host chúng và không thể phục vụ chúng.

Điểm mấu chốt

Tuyên bố đáng chú ý ở đây không nằm ở các số phiên bản. Mà nằm ở cơ chế — một mẫu flagship thế hệ kế tiếp chỉ kích hoạt ít tham số hơn so với phiên bản tiền nhiệm sẽ là một tuyên bố rằng Moonshot tin tính thưa, chứ không phải số lượng tham số kích hoạt thô, mới là trục đáng để theo đuổi, và cách chia 16-trong-896 expert của K3 vốn đã là một lập luận theo hướng đó. Mọi phần của tuyên bố này đều chưa được xác minh: Kimi K4, GLM-5.5 Flash, GLM-5.4 và DeepSeek V4.1P không có model card, không có trọng số, không có định danh API và không có giá, còn danh mục của chính các nhà cung cấp trong mỗi trường hợp đều dừng lại sớm hơn một thế hệ. Hãy coi những cái tên này như bản xem trước của một câu hỏi, chứ không phải câu trả lời — và nếu hôm nay bạn cần trọng số mở đẳng cấp tiên phong với ngữ cảnh 1M, thì Kimi K3 chính là mô hình đã tồn tại.

Khi Kimi K4 thực sự ra mắt, chuyển đổi dự phòng tự động chính là thứ giữ cho quá trình di chuyển không biến thành sự cố