
LLaDA2.2-mini: Trọng số Diffusion Agent của Ant inclusionAI âm thầm xuất hiện vào ngày 5 tháng 9
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Vào lúc 05:16 UTC ngày 5 tháng 9 năm 2026, một kho lưu trữ Hugging Face tên là inclusionAI/LLaDA2.2-mini đã ra đời, và tính đến thời điểm viết bài này, đó gần như là toàn bộ câu chuyện của bản phát hành: trọng số đã được tải lên, thẻ mô hình đã được viết, còn nhà cung cấp — inclusionAI, phòng thí nghiệm của Ant Group đứng sau dòng mô hình khuếch tán LLaDA — vẫn chưa nói gì về nó. Không có bài đăng ra mắt, không có chiến dịch truyền thông xã hội, không có mục nào trong bảng mô hình trên README GitHub của inclusionAI/LLaDA2.X, nơi chỉ có LLaDA2.2-flash lớn hơn đứng một mình. Hai mươi tư giờ sau khi kho lưu trữ xuất hiện, bộ đếm lượt tải của nó vẫn hiển thị con số không. Đây là một bài viết dạng "những gì chúng ta biết đến nay" về LLaDA2.2-mini, và sự chặt chẽ của thể loại này rất quan trọng ở đây, bởi vì hầu như mọi con số thú vị gắn với mô hình đều là những con số mà inclusionAI tự gõ lên thẻ mô hình của họ. Bài viết này tách bạch những gì có thể xác minh độc lập về bản phát hành với những gì do nhà cung cấp công bố, đồng thời nêu tên các câu hỏi còn bỏ ngỏ thay vì lấp liếm chúng.
Bản tóm tắt ngắn dành cho những ai chỉ cần nắm được hình dung chung: LLaDA2.2-mini là phiên bản nhỏ hơn của mô hình ngôn ngữ khuếch tán LLaDA2.2-flash mà inclusionAI công bố vào tháng 7 năm 2026. Bản nhỏ này hiện có dưới dạng checkpoint mixture-of-experts 16 tỷ tham số, chỉ kích hoạt 1,4 tỷ tham số cho mỗi token, hỗ trợ ngữ cảnh 128K và được huấn luyện cho các tác vụ agentic — gọi công cụ, hiệu chỉnh nhiều lượt — bằng một bộ giải mã khuếch tán có thể chèn và xóa token ngay giữa quá trình sinh văn bản. Mô hình được cấp phép Apache-2.0. Và vì bộ trọng số mới ra đời được một ngày, không kèm theo thông báo chính thức nào, nên chưa tồn tại hạ tầng hỗ trợ thông thường: chưa có đánh giá độc lập, chưa có hosted API nào mà chúng tôi có thể tìm thấy, cũng chưa có hướng dẫn vận hành (serving) nào ngoài những gì bản thân thẻ mô hình khuyến nghị. Điều bạn có thể kiểm chứng hôm nay là kiến trúc, giấy phép và những con số mà inclusionAI đã chọn công bố.
Việc phát hành là một kho lưu trữ, không phải một sự kiện
Hãy bắt đầu bằng thứ có thể kiểm tra mà không cần tin bất kỳ ai. API Hugging Face ghi nhận inclusionAI/LLaDA2.2-mini được tạo vào ngày 5 tháng 9 năm 2026 và được sửa đổi lần cuối cùng vào đúng ngày đó. Mô hình được cấp phép Apache-2.0, sử dụng định dạng safetensors với tensor bf16, có kèm chat template, và yêu cầu trust_remote_code vì kiến trúc diffusion được phân phối dưới dạng mã mô hình tùy chỉnh. Kho lưu trữ anh em của nó, inclusionAI/LLaDA2.2-flash, được tạo vào ngày 16 tháng 7 năm 2026, đã thu hút hàng nghìn lượt tải và hàng chục lượt thích trong những tuần kể từ đó, đồng thời đã được công bố công khai. Bản mini thì không có thông báo ra mắt cũng như sự đón nhận — trong ngày đầu tiên, nó chỉ ghi nhận lượt thích ở mức một chữ số và hoàn toàn không có lượt tải nào.

Phần chú ý duy nhất mà bên thứ ba dành cho mô hình mini cho đến nay là một trang tổng hợp đã đăng lại thẻ mô hình trong vòng vài giờ sau khi kho lưu trữ xuất hiện; đó là bản sao của thẻ, không phải nguồn độc lập và không mang thông tin nào mà bản thân kho lưu trữ không có. Đó là toàn bộ hồ sơ công khai tính đến ngày 6 tháng 9. Góc nhìn quan trọng đối với người đọc đang cân nhắc có nên chú ý hay không: inclusionAI đã hai lần âm thầm phát hành trọng số khuếch tán trong cùng một tuần — mô hình này vào ngày 5 tháng 9 và các checkpoint tạo sinh ảnh LLaDA-Image vào ngày hôm trước — vậy nên việc âm thầm đăng kho lưu trữ có vẻ là một hình thức phát hành đã được thiết lập của phòng thí nghiệm, chứ không phải tình cờ. Không có gì trong hình thức đó cho chúng ta biết liệu sắp có thông báo chính thức hay không.
LLaDA2.2-mini thực sự là gì
Kiến trúc chính là phần thú vị nhất của mô hình này và nó được mô tả đầy đủ trên thẻ. LLaDA2.2-mini là mô hình ngôn ngữ khuếch tán hỗn hợp chuyên gia (mixture-of-experts) được xây dựng trên bộ khung LLaDA2.0-mini. Các mô hình ngôn ngữ khuếch tán đảo ngược vòng lặp sinh thông thường: thay vì mô hình tự hồi quy dự đoán lần lượt từng token tiếp theo, một mô hình ngôn ngữ khuếch tán khởi đầu từ một khối token bị che hoặc nhiễu và tinh chỉnh toàn bộ khối đó song song, khử nhiễu dần để đạt tới một chuỗi mạch lạc. Quá trình sinh của LLaDA2.2 bổ sung thứ mà inclusionAI gọi là chỉnh sửa Levenshtein: hai token điều khiển, DELETE và INSERT, cho phép bộ giải mã thay đổi độ dài và cấu trúc của chuỗi đang tạo ra thay vì chỉ thay đổi nội dung — cắt bỏ một đoạn dư thừa đã viết, hoặc mở một điểm chèn vào nơi cần đặt ngữ cảnh mới (chẳng hạn như kết quả trả về từ công cụ). Đây là cơ chế mà dòng mô hình này sử dụng để giúp việc giải mã khuếch tán hoạt động trong các vòng lặp đa lượt có sử dụng công cụ — nơi mô hình tự hồi quy chỉ cần chờ lượt người dùng tiếp theo, còn mô hình khuếch tán dạng khối thì phải sửa lại những gì nó đã sinh trước đó.
Toàn bộ thông số liên quan, đều lấy thẳng từ thẻ mô hình: 16 tỷ tham số tổng cộng chưa tính embeddings, 1,4 tỷ tham số được kích hoạt cho mỗi token qua MoE 256 chuyên gia, định tuyến 8 chuyên gia mỗi token; 20 lớp, 16 đầu attention, 4 đầu KV; từ vựng 157.184 token; phép nhúng vị trí xoay (rotary position embeddings); và cửa sổ ngữ cảnh 128K. Kỹ thuật có tên Block Routing giới hạn chuyên gia nào được kích hoạt ở cấp độ diffusion-block, và nhờ đó mô hình giữ được ngữ cảnh 128K trong phạm vi xử lý khả thi trên một GPU tiêu dùng duy nhất. Thẻ mô hình định vị sản phẩm cho card đồ họa từ 24GB trở lên và khuyến nghị SGLang làm backend phục vụ cho các tác vụ agent ngữ cảnh dài.

Trên đây là vị trí của bản phát hành này trong dòng thời gian của họ mô hình — chính dòng kế thừa đó khiến "LLaDA2.2-mini" trở nên dễ hiểu. LLaDA2.0, ra mắt tháng 11/2025, là mô hình ngôn ngữ khuếch tán đầu tiên được mở rộng lên 100 tỷ tham số; LLaDA2.1, ra mắt tháng 2/2026, bổ sung khả năng chỉnh sửa token để khuếch tán văn bản nhanh hơn; thế hệ LLaDA2.2, ra mắt tháng 7/2026 cùng LLaDA2.2-flash và bản báo cáo kỹ thuật, đã định hướng cả họ mô hình sang các tác tử. Mini là mảnh ghép của thế hệ ấy vốn chỉ là lời hứa cho đến nay: tin bài về bản phát hành tháng 7 từng nhắc đến một biến thể 16B nhẹ hơn của flash để triển khai với chi phí thấp hơn, nhưng bộ trọng số độc lập phải đến ngày 5/9 mới thực sự xuất hiện.
Các con số trên thẻ, được ghi nhãn đúng như bản chất của chúng.
Bảng điểm chuẩn trên thẻ mô hình do chính inclusionAI công bố, được in vào đúng ngày trọng số được đăng tải, và chưa có phòng thí nghiệm độc lập nào tái lập được bất kỳ con số nào trong đó — Artificial Analysis không có mục nào cho LLaDA2.2-mini, và chúng tôi cũng không tìm thấy bất kỳ lần chạy thử nào từ bên thứ ba. Hãy đọc các con số đó như những tuyên bố có định hướng từ phía nhà cung cấp, chứ không phải dữ liệu đo lường thực tế. Trong khuôn khổ đó, câu chuyện mà thẻ mô hình kể là nhất quán: LLaDA2.2-mini là một chuyên gia về tác nhân và ngữ cảnh dài, và nó đánh đổi một số điểm trên các điểm chuẩn tổng quát để đạt được điều đó.
Trung bình agentic — 59.00, từ τ²-Bench 57.50, Claw-Eval 57.16 và PinchBench 62.33 (do nhà cung cấp báo cáo).
• Function calling — 47.68 trên BFCL v4, tăng từ 25.05 và 28.44 tương ứng của LLaDA2.0-mini và LLaDA2.1-mini; 69.02 trên BFCL v3 cũ hơn.
• Ngữ cảnh dài — 34.99 trên LongBench v2, hơn gấp đôi mức 15.51 và 12.13 mà các bản mini trước đó đạt được, đây chính là thành quả cụ thể của cửa sổ 128K.
• Tổng quát — điểm trung bình tổng quát 46,47, với AIME 2026 ở mức 35,05, OlympiadBench 61,11, LiveCodeBench v6 28,14, GPQA-Diamond 44,41, và IFBench 24,93 — một vài trong số đó thấp hơn một chút so với các bản mini trước đó, cái giá thấy rõ của việc dùng ngân sách huấn luyện cho hành vi tác tử thay vào đó.

Điểm cuối cùng đó rất đáng để ta dừng lại suy ngẫm, vì nó chính là lý do trung thực khiến một nhóm chọn mô hình này thay vì một mô hình đa năng mạnh hơn trên giấy tờ. LLaDA2.2-mini không khẳng định mình là mô hình nhỏ tốt nhất về toán học hay khả năng làm theo chỉ dẫn; nó khẳng định mình giỏi ở đúng thứ mà các mô hình khuếch tán vốn yếu trong quá khứ — công việc kéo dài qua nhiều lượt tương tác và sử dụng công cụ — trong khi vẫn giữ số tham số hoạt động đủ thấp để tạo ra khác biệt thực sự trên một GPU. Mức tăng vọt trên BFCL v4 và LongBench v2 là những con số sẽ trụ vững qua một lần chạy kiểm chứng độc lập nếu bảng thông số nhìn chung là chính xác.
Chạy nó, và phần khung còn thiếu.
Về mặt lý thuyết, cách chạy LLaDA2.2-mini khá đơn giản, vì bản phát hành này là bản thuần Transformers: thẻ mô hình cho thấy việc tải nó với AutoModelForCausalLM và trust_remote_code=True trên transformers ≥ 5.2.0, sau đó gọi generate với các tham số đặc thù cho diffusion — độ dài khối 32 và nhiệt độ 0.0 là các mặc định được khuyến nghị, và thẻ mô hình đề xuất độ dài đầu ra 32.768 token cho hầu hết các truy vấn. Đối với việc phục vụ ngữ cảnh dài theo hướng tác tử, nó trỏ đến SGLang, và người dùng Trung Quốc đại lục có một bản sao ModelScope. Điều chưa tồn tại là hệ sinh thái xung quanh: không có API lưu trữ nào trên bất kỳ nhà cung cấp nào chúng tôi có thể xác minh, không có bản dựng GGUF nào chúng tôi tìm thấy, và hỗ trợ framework vẫn đang dần ổn định — công việc về kiến trúc LLaDA2 của cộng đồng llama.cpp còn mới, nên câu chuyện lượng tử hóa vẫn còn mỏng.
Tổ hợp đó — một mô hình giải mã thực sự mới, mới chỉ một ngày tuổi, chỉ có thể tự lưu trữ — chính là tình huống mà một lớp định tuyến chứng minh được giá trị của mình mà không cần giả vờ rằng mô hình mới đã sẵn sàng cho production. Cách thử LLaDA2.2-mini một cách có trách nhiệm là tự chạy nó trên một tuyến thử nghiệm trong khi production vẫn dùng một mô hình đã trưởng thành, và đó là mục đích của thiết lập OrcaRouter: một API duy nhất cho hơn 200 mô hình với đúng giá niêm yết của nhà cung cấp, 0% markup, tự động chuyển đổi dự phòng (failover) để checkpoint mới một ngày tuổi bị treo không kéo sập quy trình làm việc, và DSL định tuyến để kết hợp một lệnh gọi diffusion tự lưu trữ với các mô hình tự hồi quy được lưu trữ đám mây phía sau một khóa API duy nhất. Khi — nếu — một nhà cung cấp niêm yết LLaDA2.2-mini, cơ chế pass-through tương tự vẫn được áp dụng và mức giá bạn thấy chính là mức giá của nhà cung cấp. Cho đến lúc đó, thông tin minh bạch về mức độ khả dụng là: hãy tải bộ trọng số Apache-2.0 từ Hugging Face hoặc ModelScope về và tự chạy chúng.
Xem gì tiếp theo
Three things would turn this what-we-know-so-far into a real story, and all three are absent today. First, an announcement: if the LLaDA2.2-flash pattern holds, a launch post and technical-report coverage could follow the quiet repo drop, and it would likely add training details the card omits. Second, an independent run: the agentic average of 59.00 and the BFCL v4 score of 47.68 are the claims most worth reproducing, because agentic benchmarks are the ones where harness choice moves scores the most. Third, serving maturity: SGLang serving guides, a vLLM path, and community quantizations would tell you whether the 1.4B-active footprint is as cheap to operate in practice as the spec sheet suggests. None of those exist on September 6. The weights are real, the license is permissive, and the architecture genuinely is a different way of running an agent — but the evidence that it is a good agent is, for now, one vendor's card.
