Ling-3.0-flash: Những gì chúng ta hiện biết về MoE tầng nhanh trọng số mở của Ant Group
Guides & Insights

Ling-3.0-flash: Những gì chúng ta hiện biết về MoE tầng nhanh trọng số mở của Ant Group

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Phòng thí nghiệm InclusionAI của Tập đoàn Ant đã chính thức phát hành Ling-3.0-flash — công bố vào ngày 24 tháng 7 năm 2026 và mở mã nguồn theo giấy phép MIT vào ngày 7 tháng 8 — và bức tranh đã thay đổi rất nhiều so với bản xem trước mà chúng tôi đăng ở đây vào tháng 7. Đây là mô hình native hybrid-reasoning mixture-of-experts với tổng tham số 124B và chỉ 5,1B tham số hoạt động cho mỗi token, được xây dựng như tầng nhanh, rẻ của gia đình Ling. Hai con số đã thay đổi mọi thứ: Artificial Analysis hiện chấm điểm nó 38 trên Chỉ số Trí tuệ (tăng 24 điểm so với thế hệ tầng nhanh trước đó, Ling-2.6-flash) và đặt nó trên biên giới Pareto của trọng số mở về trí tuệ so với tổng tham số. Trọng số đã có sẵn trên Hugging Face và ModelScope.

Khi chúng tôi lần đầu đưa tin về mẫu này vào ngày 24 tháng 7, tóm tắt trung thực là: {{1}}chỉ có API, không có trọng số, không có tuyên bố cấp phép, không có điểm chuẩn độc lập{{/1}}. Cả bốn nhận định đó giờ đây đều đã lỗi thời. Ant đã mã nguồn mở các trọng số theo giấy phép MIT vào ngày 7 tháng 8, và Artificial Analysis từ đó đã công bố một bản đánh giá độc lập đầy đủ. Bản cập nhật này sửa lại bản tin gốc cho phù hợp — các nhãn {{2}}chưa xác minh{{/2}} từng chiếm ưu thế trong bài đăng tháng 7 giờ chỉ áp dụng cho một nhóm tuyên bố hẹp hơn nhiều, chủ yếu là {{3}}các con số tốc độ tối đa của Ant{{/3}}, thay vì toàn bộ mô hình.

Tóm tắt.Ling-3.0-flash là MoE trọng số mở thuộc dòng tốc độ cao của Ant Group: 124B tổng / 5.1B kích hoạt, giấy phép MIT, ngữ cảnh gốc 256K (262K khi phục vụ). Artificial Analysis cho nó điểm Intelligence Index là 38 — tăng 24 điểm so với Ling-2.6-flash thế hệ trước và nằm trên biên Pareto của các mô hình trọng số mở giữa trí tuệ và tổng số tham số — với tốc độ sinh token đo được khoảng 368 token/giây. Trọng số có trên Hugging Face và ModelScope theo giấy phép MIT. Vẫn chỉ do nhà cung cấp công bố: tuyên bố thông lượng đỉnh 1.100+ token/giây, con số thời gian đến token đầu tiên dưới 100ms, và bảng benchmark trên model card. Giá API chính hãng là $0.075 cho token đầu vào / $0.22 cho token đầu ra trên mỗi 1 triệu token (giảm 80% khi trúng cache); gói miễn phí khi ra mắt đã kết thúc vào ngày 3 tháng 8.

Những điểm chính rút ra

• Đây là phân khúc nhanh/rẻ, không phải mẫu chủ lực. Mẫu chủ lực 1 nghìn tỷ tham số của thế hệ trước vẫn là mô hình lớn nhất của InclusionAI; Ling-3.0-flash là phiên bản nhỏ hơn, nhanh hơn, nhắm đến văn bản khối lượng lớn và gọi công cụ.

• Các trọng số hiện được mở theo giấy phép MIT. Các trọng số đã được đưa lên Hugging Face (inclusionAI/Ling-3.0-flash) và ModelScope vào ngày 7 tháng 8 theo giấy phép MIT — trái ngược với tình trạng "chỉ có API" hồi tháng 7.

• Cuối cùng nó cũng đã có điểm số độc lập. Artificial Analysis đo được Chỉ số trí tuệ là 38, tăng 24 so với Ling-2.6-flash, và đưa mô hình này lên đường biên Pareto của các mô hình trọng số mở về trí tuệ so với tổng số tham số.

• Tốc độ hiện đã được đo một phần.AA đạt tốc độ đầu ra khoảng 368 token/giây và thời gian đến token đầu tiên ~1,98 giây; con số đỉnh 1.100+ token/giây mà Ant công bố vẫn chỉ là số liệu từ nhà cung cấp.

• Giá đã được ấn định và đợt ra mắt miễn phí đã kết thúc. API bên thứ nhất niêm yết $0.075 đầu vào / $0.22 đầu ra trên mỗi 1M token, kèm chiết khấu 80% khi trúng bộ nhớ đệm; gói miễn phí khi ra mắt đã hết hạn vào ngày 3 tháng 8.

• Đây là một phần trong gia đình ba mô hình.InclusionAI chia dòng sản phẩm của mình thành Ling (MoE văn bản và công cụ đa dụng, chính là mô hình này), Ring (suy luận) và Ming (đa phương thức).

Lưu ý về cách đọc bản cập nhật này: đây là bản sửa đổi của bản xem trước ngày 24 tháng 7, được viết sau khi các trọng số được mở công khai và những điểm số độc lập đầu tiên xuất hiện. Mọi thông số kỹ thuật, điểm chuẩn và giá bên dưới đều được ghi rõ nguồn. Khi Ant Group là nguồn duy nhất — các tuyên bố về tốc độ tối đa và bảng điểm chuẩn trên thẻ mô hình — chúng tôi nói rõ điều đó. Khi Artificial Analysis đã đo lường điều gì đó một cách độc lập, chúng tôi trích dẫn điều đó.

Những gì chúng ta thực sự biết

Kiến trúc này hiện đã được tài liệu hóa đầy đủ trên model card. Ling-3.0-flash sử dụng một ngăn xếp attention lai-tuyến tính thuần bản địa — các lớp Kimi Delta Attention (KDA) và Gated MLA xen kẽ theo tỷ lệ 5:1 (35 KDA + 7 MLA), với KDA sử dụng cơ chế gating đường chéo mịn — nằm trên nền MoE thưa 1/64 (512 expert định tuyến, 8 expert được kích hoạt cho mỗi token). Đó chính là cách mô hình đạt tổng cộng 124B tham số trong khi chỉ có 5.1B tham số hoạt động. Cửa sổ ngữ cảnh là 256K thuần bản địa, được phục vụ ở mức 262,144 token trong các recipe suy luận, và Ant tuyên bố kiến trúc này có thể mở rộng lên 1M. Độ dài đầu ra tối đa không được tiết lộ. Mô hình chỉ hỗ trợ văn bản với khả năng gọi công cụ (tool-calling); đầu vào đa phương thức nằm ở dòng Ming riêng biệt.

Hai định dạng trọng số được phòng thí nghiệm công bố — BF16 (khoảng 255GB) và FP8 (khoảng 128GB) — và các biến thể lượng tử hóa từ cộng đồng đã được liên kết từ thẻ mô hình. Các công thức triển khai của chính phòng thí nghiệm nhắm đến SGLang và vLLM.

Tính khả dụng: trọng số mở dưới giấy phép MIT

Ngày 7 tháng 8, nhóm InclusionAI của Ant Group đã mở mã nguồn trọng số theo giấy phép MIT trên Hugging Face (inclusionAI/Ling-3.0-flash) và ModelScope. Đây là giấy phép cho phép sử dụng thương mại một cách linh hoạt — cùng loại giấy phép mà Ling 2.0 và Ling 2.6 đã phát hành — và điều đó có nghĩa là bạn có thể tự lưu trữ, tinh chỉnh và triển khai Ling-3.0-flash thay vì thuê qua API. Mô hình cũng có thể được gọi thông qua chính API dành cho nhà phát triển của Ant và một số nền tảng bên thứ ba. Với một mô hình phân khúc nhanh ở mức giá này, câu hỏi thú vị hơn là nên tự lưu trữ (FP8 chạy trong khoảng 128GB) hay tiếp tục dùng qua API.

Điểm số độc lập: chỉ số trí tuệ AA là 38

Sự thay đổi lớn nhất so với bài đăng tháng 7 là giờ đây đã có các số liệu độc lập. Artificial Analysis có một trang dành riêng cho Ling-3.0-flash và đo mô hình này ở mức 38 trên Chỉ số Intelligence Index — cao hơn 24 điểm so với thế hệ fast-tier trước đó, Ling-2.6-flash (14), đồng thời ngang bằng với MiMo-V2.5 và Qwen 3.6 27B trong khi chỉ kích hoạt một phần nhỏ tham số của chúng. Artificial Analysis cũng xếp mô hình này nằm trên biên giới Pareto của các mô hình trọng số mở về trí tuệ so với tổng tham số: không có mô hình trọng số mở nào có tổng tham số ít hơn mà đạt điểm cao hơn. Mô hình trọng số mở dẫn đầu phân khúc flash trên AA, DeepSeek V4 Flash, vẫn đạt điểm cao hơn (Chỉ số 52 ở mức nỗ lực suy luận tối đa).

Kết quả về khả năng agentic và ngữ cảnh dài cũng cho thấy xu hướng mạnh mẽ. Trên bộ đánh giá τ3-Bench Banking của AA, Ling-3.0-flash đạt 27%, xếp thứ hai trong nhóm mô hình mã nguồn mở hạng flash, sau DeepSeek V4 Flash (39%). Trên GDPval-AA v2, mô hình đạt Elo 1108, tăng từ mức 545 của Ling-2.6-flash. Ant đã huấn luyện mô hình trên hơn 10.000 môi trường tương tác (theo báo cáo từ nhà cung cấp) và định vị nó như một nút thực thi cho các quy trình agent — nhanh, rẻ, dùng một lần, trong khi phần suy luận nặng được giao cho một mô hình chủ lực lớn hơn.

Một lưu ý về nguồn dữ liệu: bảng benchmark trên thẻ mô hình của Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — là do nhà cung cấp báo cáo và chưa được tái lập một cách độc lập. Hãy coi đó là những tuyên bố của chính phòng thí nghiệm, cùng loại với các con số tốc độ tối đa bên dưới.

Tốc độ: được đo, sau đó được công bố

Câu chuyện về tốc độ giờ đây là hai câu chuyện khác nhau. Một cách độc lập, Artificial Analysis đo được khoảng 368 token/giây ở đầu ra và thời gian đến token đầu tiên ~1,98 giây trên API của bên thứ nhất — thực sự nhanh đối với một MoE có 5,1B tham số hoạt động, và đủ để xếp mô hình ở gần đầu bảng về tốc độ. Riêng biệt, Ant Group tuyên bố tốc độ đầu ra trung bình trên 1.100 token/giây trên các cấu hình GPU cụ thể và thời gian đến token đầu tiên dưới 100ms với lớp bộ nhớ đệm phân cấp cấp cụm được xây dựng trên SGLang HiCache và Mooncake. Bộ số liệu thứ hai này chỉ từ nhà cung cấp — được đo trên phần cứng và cấu hình xử lý theo lô mà Ant kiểm soát, không có bản chạy lại độc lập nào được công bố. Để lập kế hoạch, hãy dùng con số của AA; coi mức 1.100+ token/giây là trần tiếp thị cần tự xác minh trên khối lượng công việc của bạn.

Giá cả: rẻ, và chương trình khuyến mãi đã kết thúc.

Artificial Analysis niêm yết API bên thứ nhất với giá $0,075 cho mỗi 1M token đầu vào và $0,22 cho mỗi 1M token đầu ra, cache hit ở mức $0,015 (−80%) — tất cả đều do nhà cung cấp định giá. Gói miễn phí khi ra mắt (500k token miễn phí/ngày, truy cập API miễn phí) đã kết thúc vào ngày 3 tháng 8, và Ant đã triển khai đợt giảm giá tạm thời 75% cho Ling Studio đến hết ngày 31 tháng 8 năm 2026, sau đó giá niêm yết sẽ được áp dụng. Ngay cả ở mức giá niêm yết đầy đủ, $0,075/$0,22 đưa Ling-3.0-flash vào phân khúc giá rẻ một cách vững chắc đối với một mô hình có Index 38.

Với mức giá thấp như thế này, chi phí chuyển đổi quan trọng hơn giá trên mỗi token. OrcaRouter tồn tại để giúp việc chuyển đổi đó trở nên rẻ: một API cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển qua với mức chênh lệch 0%, và tự động chuyển đổi dự phòng giữa các nhà cung cấp — để khi một mô hình mới mở như thế này trông có vẻ tốt trên giấy tờ, bạn có thể thử nghiệm nó với khối lượng công việc thực tế của mình mà không cần hợp đồng thứ hai, và quay trở lại một mô hình khác dưới cùng một khóa API nếu nó không đáp ứng tốt cho một tác vụ cụ thể.

Gia đình Ling / Ring / Ming

Ling-3.0-flash không tồn tại độc lập — InclusionAI tổ chức các bản phát hành của mình thành ba dòng sản phẩm có tên riêng, mỗi dòng nhắm đến một vai trò khác nhau. {{1}}Ling là dòng MoE đa dụng cho việc sinh văn bản và gọi công cụ hằng ngày, còn Ling-3.0-flash nằm ở phân khúc nhanh/rẻ của dòng này, thấp hơn một bậc so với mô hình chủ lực 1T tham số của thế hệ trước. Ring là dòng tập trung vào suy luận, được xây dựng cho chuỗi suy luận đa bước. Ming là dòng đa phương thức.{{/1}} Nếu tác vụ của bạn cần khả năng suy luận nặng hơn hoặc đầu vào hình ảnh, mô hình InclusionAI phù hợp có lẽ không phải Ling-3.0-flash — nó được thiết kế cho khối lượng lớn và tốc độ trong lĩnh vực văn bản và công cụ.

Dành cho ai: ba tình huống

1. Các pipeline xử lý văn bản hoặc gọi công cụ khối lượng lớn, nhạy cảm với độ trễ

Đây là sân nhà của mô hình. Với chỉ số Index độc lập là 38, giấy phép MIT và tốc độ đo được khoảng 368 tok/s, canh bạc về tầng tốc độ cao giờ đã có thể kiểm chứng thay vì chỉ là giả thuyết — bạn có thể chạy tập đánh giá của riêng mình trên nó, hoặc tải trọng số về và tự lưu trữ. Chỉ cần đừng xây dựng dựa trên con số trần 1.100+ tok/s của nhà cung cấp cho đến khi bạn đã đo được trên khối lượng công việc của mình.

2. Các nhóm muốn có ngữ cảnh dài với ngân sách hạn chế

Với ngữ cảnh gốc 256K (phục vụ 262K) và lộ trình đã công bố lên 1M, ở mức giá $0.075/$0.22, đây là sự kết hợp hấp dẫn cho các tác vụ nặng về truy xuất hoặc xử lý tài liệu. Các số liệu về ngữ cảnh dài trong thẻ mô hình là do nhà cung cấp báo cáo, vì vậy hãy đưa nó vào danh sách rút gọn cùng với các lựa chọn ngữ cảnh dài đã được thiết lập và xác minh trên bộ ngữ liệu của riêng bạn trước khi quyết định.

3. Các nhà quan sát theo dõi bối cảnh MoE của Trung Quốc và lộ trình của InclusionAI

Câu hỏi của tháng Bảy — liệu InclusionAI có tiếp tục hoạt động? — giờ đã có câu trả lời: có, MIT, và nhanh chóng. Ling-3.0-flash đạt đến biên giới Pareto AA với 5.1B tham số hoạt động là một điểm dữ liệu cho bất kỳ ai theo dõi cách các phòng thí nghiệm Trung Quốc cạnh tranh về hiệu quả thay vì số lượng tham số thô.

Còn điều gì vẫn chưa được xác minh?

Danh sách ngắn, khi những khoảng trống lớn đã được lấp. Các tuyên bố về tốc độ đỉnh của nhà cung cấp (1.100+ tok/s, TTFT dưới 100ms) chưa có phép đo lại độc lập. Bảng benchmark trên thẻ mô hình là do nhà cung cấp tự báo cáo. Các biến thể FP4/INT4 và đường triển khai DGX-Spark đơn lẻ là do nhà cung cấp tự công bố. Và về kiến thức, Omniscience Index của AA cho thấy sự cải thiện so với thế hệ trước chủ yếu đến từ việc chọn không trả lời — tỷ lệ ảo giác giảm (97% → 44%) trong khi độ chính xác chỉ tăng nhẹ (16% → 18%) — vì vậy đừng nhầm lẫn bước nhảy của chỉ số chính với một bước nhảy vọt kiến thức toàn diện.

Khi nào không nên sử dụng

Bỏ qua Ling-3.0-flash cho các tác vụ đa phương thức — đó là lĩnh vực của dòng Ming. Bỏ qua nó nếu bạn cần một flagship lý luận mạnh thay vì một bộ thực thi nhanh — đó là lĩnh vực của Ring. Nếu bạn định tự lưu trữ, hãy dự trù ngân sách cho phần cứng thực tế: BF16 khoảng 255GB, FP8 khoảng 128GB. Và nếu một con số tuyên bố quan trọng với bạn, hãy xác minh nó — các con số về tốc độ tối đa và ngữ cảnh dài là do Ant đưa ra cho đến khi một phòng thí nghiệm độc lập chạy lại chúng.

Câu hỏi thường gặp

Ling-3.0-flash có trọng số mở không?

Vâng. Các trọng số đã được mã nguồn mở vào ngày 7 tháng 8 theo giấy phép MIT, trên Hugging Face (inclusionAI/Ling-3.0-flash) và ModelScope. Đây là giấy phép cho phép sử dụng thương mại — cùng loại giấy phép mà Ling 2.0 và Ling 2.6 đã phát hành.

Ling-3.0-flash hoạt động như thế nào trên các điểm chuẩn?

Artificial Analysis đo lường Chỉ số Trí tuệ ở mức 38, tăng 24 điểm so với Ling-2.6-flash, và đặt mô hình này trên ranh giới Pareto mã nguồn mở về trí tuệ so với tổng tham số. Bảng điểm chuẩn trên thẻ mô hình của Ant (ví dụ SWE-Bench Pro 56.6) do nhà cung cấp báo cáo và chưa được tái tạo độc lập.

Nó thực sự nhanh như thế nào?

Artificial Analysis đo được tốc độ đầu ra khoảng 368 token/giây với thời gian đến token đầu tiên (TTFT) ~1,98 giây trên API chính hãng. Ant tuyên bố thông lượng đỉnh 1.100+ token/giây và TTFT dưới 100ms trên các cấu hình GPU cụ thể — đó là số liệu từ nhà cung cấp, chưa có phép đo lại độc lập.

Ling-3.0-flash có giá bao nhiêu?

AA niêm yết API bên thứ nhất ở mức 0,075 USD cho mỗi 1M token đầu vào và 0,22 USD cho mỗi 1M token đầu ra, với mức chiết khấu 80% cho cache-hit. Gói miễn phí khi ra mắt đã kết thúc vào ngày 3 tháng 8, và giai đoạn giảm 75% tạm thời trên Ling Studio kéo dài đến hết ngày 31 tháng 8 năm 2026.

Cửa sổ ngữ cảnh lớn như thế nào?

256K nguyên bản, được phục vụ với 262.144 token; Ant tuyên bố kiến trúc có thể mở rộng lên 1M. Độ dài đầu ra tối đa không được tiết lộ.

Sự khác biệt giữa Ling, Ring và Ming là gì?

Ling là dòng MoE đa dụng dành cho văn bản và gọi công cụ của InclusionAI, với Ling-3.0-flash nằm ở phân khúc nhanh/rẻ. Ring là dòng tập trung vào suy luận. Ming xử lý các tác vụ đa phương thức. Chúng là các họ riêng biệt cho các công việc khác nhau, không phải các cấp bậc của một mô hình.

Ling-3.0-flash có giống với bản flagship 1T trước đó không?

Không. Ling-3.0-flash là bản mới hơn, nhỏ hơn trong phân khúc nhanh (124B tổng / 5.1B hoạt động). Mô hình chủ lực 1T tham số của thế hệ trước vẫn là mô hình lớn hơn.

Tôi có nên sử dụng Ling-3.0-flash trong sản xuất hôm nay không?

Vì giờ đã có điểm số độc lập và giấy phép MIT, lựa chọn này dễ biện minh hơn hồi tháng 7. Trước tiên hãy chạy bộ đánh giá của riêng bạn, kiểm chứng các tuyên bố về tốc độ của nhà cung cấp so với khối lượng công việc của bạn, rồi quyết định giữa API và tự lưu trữ (FP8 chạy trong khoảng 128GB). Các con số chỉ có từ nhà cung cấp còn lại có phạm vi đủ hẹp để lên kế hoạch xoay quanh chúng.

Kết luận

Ling-3.0-flash đã tiến từ "thông số kỹ thuật và tuyên bố của nhà cung cấp" sang "trọng số mở và được đánh giá độc lập" chỉ trong hai tuần. Chỉ số AA Intelligence Index 38 với 5,1B tham số hoạt động — nằm trên đường biên Pareto của các mô hình trọng số mở, được cấp phép MIT, với giá $0,075/$0,22 — khiến nó trở thành một trong những mô hình trọng số mở hiệu quả nhất bạn có thể sử dụng ngay lúc này, và là mô hình bạn thực sự có thể tự chạy. Các lưu ý đã thu hẹp hơn trước: các con số về tốc độ đỉnh và model-card vẫn thuộc về Ant cho đến khi một phòng thí nghiệm độc lập tái lập được chúng. Với nhu cầu xử lý văn bản khối lượng lớn và gọi công cụ ở mức giá này, nó xứng đáng được đánh giá thực sự.