
Mô hình 3T của DeepSeek: Sự mở rộng quy mô phải chờ đợi các cụm máy chủ
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Vào ngày 14 tháng 9, DeepSeek sẽ ngừng cung cấp DeepSeek V4 Pro — mẫu flagship 1,6 nghìn tỷ tham số mà hãng đã đưa vào phát hành rộng rãi vào ngày 13 tháng 8 — và trả lời mọi lệnh gọi đến deepseek-v4-pro bằng DeepSeek V4.1 Flash, mô hình 552 tỷ tham số được phát hành ngày 10 tháng 9. Bốn ngày trước khi việc chuyển đổi đó được công bố, một người theo dõi DeepSeek ẩn danh đã đăng một điều sắc bén theo hướng ngược lại: rằng phòng thí nghiệm đã và đang nghiên cứu một mô hình 3 nghìn tỷ tham số, "có lẽ là một Engram 1T tham số khác", và rằng lý do nó chưa ra mắt là vấn đề kinh tế chứ không phải năng lực.
Không có gì về mô hình đó được xác nhận. Không có tên, không có kho mã, không có tệp cấu hình, không có đánh giá chuẩn, không có thời điểm phát hành — chỉ một bài đăng trên X, được dẫn nguồn từ “nguồn tin đáng tin cậy”, với chi tiết thú vị nhất của nó được chính tác giả đánh dấu rõ ràng là suy đoán. Hãy coi đó là một tín hiệu, không phải một sự thật. Dù sao nó vẫn đáng đọc, bởi vì hai nửa của tuyên bố kéo theo hai hướng ngược nhau và chỉ một trong số đó có khả năng trụ được khi chạm trán với lộ trình của chính DeepSeek.
Rò rỉ thực sự nói điều gì, và điều gì nó không nói
Bài đăng đến từ tài khoản teortaxesTex, một người theo dõi DeepSeek lâu năm, người tự nhận là fan của phòng thí nghiệm này từ năm 2023. Nội dung đầy đủ như sau: "Thực ra tôi có nguồn tin đáng tin cậy rằng DeepSeek đang làm một mô hình 3T (backbone, có thể là một Engram 1T tham số nữa nhưng đó là suy đoán của tôi). Họ chỉ không chắc liệu việc hậu huấn luyện và phục vụ nó có kinh tế hay không. Khi các cụm của họ phát triển, chúng ta sẽ thấy một số..."
Bốn điều trong hai câu đó đều có sức nặng, và một trong số đó hoàn toàn không phải là sự thật. “Nguồn tin đáng tin cậy” không được nêu tên. Số lượng tham số xuất hiện dưới dạng một con số duy nhất, không có sự tách biệt giữa tổng số và số đang hoạt động. Phần bên lề về Engram được chính người suy đoán gán nhãn là suy đoán. Và “khi các cụm của chúng phát triển” là một mệnh đề điều kiện không kèm mốc ngày tháng nào.
• Điều gì đang được khẳng định — rằng một mô hình DeepSeek 3 nghìn tỷ tham số đang tồn tại ở một giai đoạn phát triển nào đó.
• Điều mà rõ ràng là phỏng đoán của chính tác giả — rằng khoảng 1T trong đó là bộ nhớ Engram.
• Những gì chưa được biết — tên gọi, kiến trúc, số lượng tham số hoạt động, cửa sổ ngữ cảnh, trạng thái huấn luyện, và liệu nó có được phát hành thành sản phẩm hay không.
• Điều có thể xác minh được ngay bây giờ — không có gì. Không có kho lưu trữ, thẻ mô hình, dòng định giá hay mục tài liệu nào của DeepSeek đề cập đến nó.
Ngay cả phép tính cũng mơ hồ. "Mô hình 3T (backbone, có lẽ thêm 1T tham số Engram)" hỗ trợ hai cách hiểu: một mô hình 3T trong đó khoảng 1T là Engram, hoặc một backbone 3T cùng với thêm 1T Engram bên cạnh, tổng cộng khoảng 4T. Khoảng cách đó rộng tới một nghìn tỷ tham số, và nó làm thay đổi hóa đơn phục vụ nhiều hơn mức mà hầu hết các phòng thí nghiệm chi cho một lần chạy huấn luyện.
Cũng cần nhớ rằng thành tích của tài khoản này là pha trộn, chứ không phải đạt đẳng cấp tiên tri. Anh ta đọc thông báo ngày 9 tháng 9 của DeepSeek về việc định tuyến lại lưu lượng V4 Pro như bằng chứng rằng phòng thí nghiệm đã "giải quyết các vấn đề kiến trúc của dòng V4" — một suy luận hợp lý, nhưng vẫn chỉ là suy luận. Đầu tháng 9, anh ta cũng đưa ra ý tưởng rằng một mô hình tàng hình ẩn danh trên một nền tảng lập trình của bên thứ ba chính là MiMo-V3-Flash của Xiaomi, điều mà chưa ai xác nhận. Tín hiệu sớm hữu ích; không phải là một nguồn đáng tin chính thức.
Phần thú vị là bảng bộ nhớ, không phải số lượng tham số
Engram là thật, và đó là lý do khiến tuyên bố 3T đáng tin hơn so với cảm giác ban đầu. DeepSeek đã công bố kiến trúc bộ nhớ có điều kiện vào tháng 1 năm 2026 kèm mã nguồn mở, và nó làm một việc khác thường: tách truy xuất kiến thức tĩnh khỏi suy luận động. Thay vì tiêu tốn sức tính toán GPU để nhớ lại dữ kiện, mô hình băm ngữ cảnh của mình thành các bảng nhúng được giữ trong DRAM và truy xuất trong thời gian không đổi, không có công việc GPU nào trong luồng tra cứu, cộng thêm một cơ chế gating triệt tiêu một ký ức được truy xuất khi nó xung đột với ngữ cảnh xung quanh.
Những con số mà DeepSeek báo cáo cho cấu hình thử nghiệm của chính họ là những con số đáng để bám lấy: một bảng embedding 100 tỷ tham số được offload sang DRAM với mức suy hao thông lượng dưới 3%, và độ chính xác needle-in-a-haystack 97% ở 1M token, so với 84,2% đối với attention tiêu chuẩn. Đó là những con số của chính phòng thí nghiệm, không phải do chúng tôi tái lập. Các đánh giá độc lập ban đầu được cho là đã đạt mức 93–96% ở cùng độ dài ngữ cảnh — cao hơn đường cơ sở, nhưng thấp hơn mức tuyên bố.
Phóng đại ý tưởng đó lên gấp mười lần và hình dạng của vụ rò rỉ sẽ thay đổi. Nếu phần lớn các tham số bổ sung của một mô hình 3T là bộ nhớ bảng băm nằm trong DRAM chứ không phải các expert đang tranh giành HBM, thì “3T” không còn là đại diện cho “không thể phục vụ”. Tổng số tham số và chi phí phục vụ tách rời nhau. Đó là ý tưởng thực sự mới trong vụ rò rỉ này, và đó là phần mà nghiên cứu đã công bố thực sự ủng hộ.
Điều đáng lưu ý là bài báo Engram được cho là không đề cập đến chi phí phát sinh khi suy luận — độ trễ và thông lượng — đúng nơi mà một bảng tra cứu nằm trong DRAM sẽ lộ diện nếu nó lộ diện ở bất kỳ đâu. Bộ nhớ mà bạn phải đi lấy không phải là bộ nhớ bạn có được miễn phí.

Vì sao September của chính DeepSeek lại lập luận ngược lại
Lập luận phản đối việc một sản phẩm 3T sớm ra mắt là DeepSeek vừa thực hiện thí nghiệm ở mức 1.6T và tự trả lời câu hỏi của chính mình bằng một thứ nhỏ hơn. Thang V4 như hiện tại:
• DeepSeek-V4-Flash-0731 — tổng cộng 284B tham số, 13B hoạt động trên mỗi token.
• DeepSeek-V4-Pro-0813 — tổng 1.6T, 49B hoạt động, trọng số mở theo giấy phép MIT.
• DeepSeek V4.1 Flash — xương sống 552B trên thiết kế Causal Encoder-Decoder, kích hoạt 8B tham số mỗi token trong quá trình prefill và 16B trong quá trình decode.
Vào trưa ngày 14 tháng 9 theo giờ Bắc Kinh, bậc giữa ra mắt. DeepSeek đưa V4 Pro ngoại tuyến và định tuyến các yêu cầu dành cho deepseek-v4-pro sang V4.1 Flash, tính phí theo mức giá của Flash, cho đến khi có V4.1 Pro. Trang báo giá chính thức hôm nay có hai dòng, và xét theo quy mô, không dòng nào là phiên bản kế nhiệm của mô hình đã ngừng: deepseek-flash ở mức $0,30 mỗi triệu token đầu vào và $1,20 mỗi triệu token đầu ra vào giờ cao điểm, deepseek-v4-pro ở mức $1,32 và $3,96, với mức giá ngoài giờ cao điểm bằng một nửa các con số đó. Cả hai đều liệt kê cửa sổ ngữ cảnh 1M token và giới hạn đầu ra 384.000 token.
Hướng đi không hề khó nhận ra. Một phòng thí nghiệm loại bỏ mô hình lớn nhất của mình để chuyển sang một mô hình chỉ kích hoạt một phần mười số tham số trên mỗi token đã kết luận rằng đơn vị kinh tế của năng lực tiên phong không phải là checkpoint lớn nhất mà nó có thể huấn luyện. Một mô hình 3T mà nhà xây dựng không chắc có thể được "hậu huấn luyện và phục vụ một cách kinh tế" không phải là tin đồn về sự do dự; nó mô tả một phòng thí nghiệm hiện đã có dữ liệu đo lường về phương án thay thế.
Hậu huấn luyện là nửa sắc bén hơn của vấn đề đó. Việc hậu huấn luyện toàn bộ tham số của dòng DeepSeek-V4-Pro trên SuperPOD CloudMatrix384 của Huawei đã được dự án SLAI T-Rex của bên thứ ba báo cáo đạt 34,22% MFU, xấp xỉ 2,93 lần công thức cơ sở mở. Đó là một con số đáng khích lệ — một con số từ bên thứ ba, trên một mô hình 1,6T. Tăng gấp đôi phần xương sống gần như tăng gấp đôi chi phí trước khi phục vụ dù chỉ một token.

Khi các cụm của chúng phát triển
Điều khoản then chốt trong bản rò rỉ là điều khoản cuối cùng, bởi vì đó là phần duy nhất có dấu vết giấy tờ công khai. DeepSeek được cho là đang lên kế hoạch dùng ít nhất 160.000 accelerator Ascend 950DT của Huawei tại một trung tâm dữ liệu mới ở Ulanqab, Nội Mông, với đơn hàng trị giá khoảng 2,56 tỷ USD — một trong những cụm chip AI do Trung Quốc sản xuất lớn nhất mà bất kỳ ai từng thử xây dựng.
Những lưu ý đi kèm kế hoạch đó quan trọng hơn dòng tít. Các chip được dự kiến dùng cho suy luận, không phải huấn luyện: DeepSeek từng thử huấn luyện trên silicon của Huawei và vẫn huấn luyện trên bộ tăng tốc Nvidia, đây là bước mà một mô hình 3T thực sự cần. Thời gian giao hàng có thể mất hơn một năm. Một phần công suất dự kiến đi vào hoạt động từ cuối năm 2027 đến đầu năm 2028. Và nguồn cung bộ nhớ băng thông cao, chứ không phải logic, được dự kiến sẽ giới hạn số lượng đơn vị 950DT mà Huawei có thể sản xuất trong năm nay.
Vậy cách đọc lạc quan về "khi các cụm của họ phát triển" đặt một mô hình 3T vào sớm nhất là quãng 2027–2028, còn cách đọc bi quan — rằng nó vẫn chỉ là một sản phẩm nghiên cứu và không bao giờ trở thành sản phẩm — thì khớp với mọi thứ DeepSeek đã tung ra trong năm 2026. Môi trường tính toán quanh phòng thí nghiệm này cũng là một vấn đề chính sách gây tranh cãi chứ không phải câu hỏi thuần túy về nguồn cung: ngày 8–9 tháng 9, NSA, FBI và CISA cùng cáo buộc sáu phòng thí nghiệm Trung Quốc, trong đó có DeepSeek, đã chưng cất các mô hình tiên tiến của Mỹ ở "quy mô công nghiệp", một cáo buộc mà Bộ Thương mại Trung Quốc bác bỏ. Dù người ta diễn giải cáo buộc đó thế nào, một bản phát hành phụ thuộc vào sự tăng trưởng của cụm máy chủ cũng phụ thuộc vào những quyết định mà không ai bên trong DeepSeek kiểm soát được.
Điều gì sẽ biến điều này từ một vụ rò rỉ thành một màn ra mắt?
Danh sách kiểm tra thì ngắn gọn và cụ thể, và chưa có mục nào trong đó được kích hoạt:
• Một kho lưu trữ thuộc tổ chức deepseek-ai trên Hugging Face, với tên checkpoint được đánh phiên bản thay vì slug theo họ mô hình.
• Một hàng mới trên trang Models & Pricing của DeepSeek.
• Một mục có ghi ngày trên bảng tin tài liệu API, theo định dạng newsYYMMDD thường lệ của lab.
• Một mã định danh mô hình, không phải tên dòng — các phiên bản DeepSeek là các checkpoint, và một slug dòng trần cho đến nay vẫn có nghĩa là một bản xem trước.
Cột mốc gần hơn là V4.1 Pro, mà một thành viên nhóm DeepSeek đã nhắc đến vào ngày 9 tháng 9 như là điểm kết thúc của cửa sổ định tuyến. Nó không có thông số kỹ thuật được công bố, không có số lượng tham số, không có giá và cũng không có ngày. Theo một nghĩa nào đó, V4.1 Pro là phép thử cho rò rỉ này: nếu mẫu flagship tiếp theo ra mắt ở mức xấp xỉ 1.6T của V4 Pro hoặc thấp hơn, thì tuyên bố 3T đã tụt lại ít nhất một thế hệ.
Tất cả những điều này có ý nghĩa gì nếu bạn đang chọn một mô hình trong tuần này
Một mô hình 3T không phải là một quyết định mua sắm vào năm 2026, và bài học thực tiễn từ tháng 9 của DeepSeek hoàn toàn không nằm ở quy mô. Bài học là: mô hình đứng sau một endpoint có thể thay đổi trong khi tên của endpoint vẫn giữ nguyên y hệt. Bất kỳ ai gọi deepseek-v4-pro thông qua một lớp trừu tượng sẽ nhận được một mô hình khác, nhỏ hơn, rẻ hơn vào ngày 14 tháng 9 mà không cần chạm vào mã của họ. Bất kỳ ai gắn trực tiếp vào triển khai của một nhà cung cấp duy nhất cho ID đó sẽ nhận được bất cứ điều gì nhà cung cấp đó quyết định làm.
Cả DeepSeek V4.1 Flash và DeepSeek V4 Pro đều có trên OrcaRouter dưới cùng một key với mức markup 0% — giá niêm yết của nhà cung cấp được chuyển tiếp nguyên vẹn, nghĩa là thay đổi giá ngày 10 tháng 9 của DeepSeek đã có hiệu lực ở đây ngay trong cùng ngày với giá niêm yết, chứ không phải ở một phiên bản đã bị đội giá nào đó. Trang model ghi $0.15 cho mỗi triệu token đầu vào và $0.60 cho mỗi triệu token đầu ra trong khung giờ thấp điểm, đây là con số thấp điểm của chính DeepSeek và không cộng thêm gì. Chuyển đổi dự phòng tự động giữa các nhà cung cấp là tính năng kém hào nhoáng nhưng lại quan trọng nhất trong một tuần như tuần này: khi một nhà cung cấp hoán đổi model ngay bên dưới một endpoint, lớp định tuyến chính là nơi việc đó trở thành một thay đổi cấu hình thay vì một cuộc di trú.
Nếu một mô hình DeepSeek 3T có ngày được phát hành, nó sẽ được phục vụ bởi bất kỳ ai có đủ cụm máy để chứa nó, với mức giá do năng lực tính toán quyết định. Chính lớp định tuyến đó cũng là nơi bạn sẽ gặp nó — mà không cần hợp đồng thứ hai và không cần xây dựng lại bất cứ thứ gì.

Câu hỏi để ngỏ không phải là liệu DeepSeek có thể xây dựng một mô hình 3 nghìn tỷ tham số hay không. Ba bài báo kiến trúc đã công bố, một thiết kế bộ nhớ đang hoạt động và một mô hình 552B mà nhà sản xuất nói rằng vượt trội so với mô hình tiền nhiệm 1,6T của chính mình — tất cả đều cho thấy phòng thí nghiệm này biết cách làm. Vấn đề là liệu có ai sẽ trả tiền để phục vụ nó hay không — và dựa trên bằng chứng của hai tuần qua, chính DeepSeek cũng không chắc. Hãy theo dõi cụm máy chủ, không phải số lượng tham số. Trang định giá sẽ cho bạn biết DeepSeek thực sự phát hành những gì nhanh hơn bất kỳ thông tin rò rỉ nào.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
