Ling-3.0-flash: Những gì chúng ta thực sự biết về Fast-Tier MoE mới của Ant Group (Và những gì chúng ta không biết)
Guides & Insights

Ling-3.0-flash: Những gì chúng ta thực sự biết về Fast-Tier MoE mới của Ant Group (Và những gì chúng ta không biết)

Tác giả

Jim Song

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Phòng thí nghiệm InclusionAI của Tập đoàn Ant đã phát hành Ling-3.0-flash vào khoảng ngày 23 tháng 7 năm 2026 — nghĩa là nó mới chỉ ra mắt vài ngày tính đến thời điểm bài viết ngắn này. Đây là mô hình ngôn ngữ hỗn hợp chuyên gia (MoE) với tổng số 124B tham số và khoảng 5.1B tham số hoạt động cho mỗi token (tỷ lệ thưa thớt khoảng 24:1), được xây dựng cho việc sinh văn bản và gọi công cụ. Nó được định vị là tầng nhanh và rẻ của dòng Ling; vị trí hàng đầu vẫn thuộc về Ling-2.6-1T lớn hơn nhiều (tổng 1T / 63B hoạt động). Hiện tại, quyền truy cập chỉ thông qua API — qua cổng nhà phát triển của Ant, qua OpenRouter với tên inclusionai/ling-3.0-flash, và qua ZenMux.

Đó là toàn bộ bức tranh đã được xác nhận, và đáng để thẳng thắn về lý do tại sao bản tóm tắt này có vẻ thận trọng hơn một bài viết mô hình điển hình. Không có trọng số Hugging Face, không có kho lưu trữ GitHub cho Ling-V3, và không có tuyên bố cấp phép rõ ràng — một sự thay đổi thực sự so với Ling 2.0 và Ling 2.6, cả hai đều được phát hành dưới dạng trọng số mở theo giấy phép MIT. Cũng không có dữ liệu điểm chuẩn độc lập dưới bất kỳ hình thức nào: Artificial Analysis, công cụ đánh giá bên thứ ba phổ biến nhất cho loại mô hình này, vẫn chưa có trang riêng cho nó. Mọi con số về hiệu suất và tốc độ hiện đang được lưu hành đều bắt nguồn từ chính Tập đoàn Ant.

Tóm tắt.Ling-3.0-flash là mô hình MoE có 124B/5.1B-active từ Ant Group's InclusionAI, được phát hành trong vài ngày qua, chỉ có API, không có trọng số trên Hugging Face và giấy phép chưa được xác nhận. Các tuyên bố của nhà cung cấp — thông lượng đỉnh 1000 token/giây, thời gian đến token đầu tiên dưới 100ms — vẫn chưa có xác minh độc lập và chưa có điểm Artificial Analysis cho mô hình cụ thể này. Ling-2.6-flash thế hệ trước đạt chỉ số Artificial Analysis Intelligence Index chỉ 14 (Ling-2.6-1T đạt 26), đây là bối cảnh hữu ích nhưng không thay thế được khả năng thực sự của 3.0-flash. Giá cả (¥0.40 đầu vào / ¥1.20 đầu ra trên 1M token, hiện đang miễn phí trong tuần ra mắt với 500k token miễn phí/ngày) rõ ràng là khuyến mãi và có khả năng thay đổi. Hãy coi mọi thứ ở đây là bản xem trước, không phải kết luận cuối cùng.

Những điểm chính rút ra

Đây là tầng nhanh/rẻ, không phải là sản phẩm chủ lực. Ling-2.6-1T vẫn là mô hình lớn nhất của InclusionAI; Ling-3.0-flash là một phiên bản nhỏ hơn, rẻ hơn, nhanh hơn, nhắm đến việc sử dụng khối lượng lớn.

Chưa có benchmark độc lập nào. Artificial Analysis không có trang cho Ling-3.0-flash. Các số liệu công khai duy nhất là của Ant Group, và tài liệu của Ant hiện không hiển thị bảng benchmark nào cho mô hình này.

Tuyên bố về tốc độ chỉ đến từ nhà cung cấp. Tốc độ cao nhất 1000 token/giây và thời gian đến token đầu tiên dưới 100ms đến từ Ant Group, không có bài kiểm tra thông lượng của bên thứ ba nào xác nhận các con số này.

Không có trọng số mở, giấy phép chưa được xác nhận. Không có kho lưu trữ Hugging Face và không có dự án GitHub Ling-V3. Các thế hệ Ling trước đều được cấp phép MIT; liệu 3.0-flash có theo sau hay không chưa rõ.

Giá cả là chương trình khuyến mãi trong tuần ra mắt.Mức ¥0.40/¥1.20 cho mỗi 1M token trên nền tảng Ant hiện đang được miễn, cùng với 500k token miễn phí/ngày và một danh sách OpenRouter miễn phí — không điều nào trong số đó nên được cho là sẽ tiếp tục khi chương trình khuyến mãi kết thúc.

Đây là một phần của dòng sản phẩm ba mô hình. InclusionAI chia dòng sản phẩm của mình thành Ling (MoE đa năng, mô hình này), Ring (tập trung suy luận) và Ming (đa phương thức).

Lưu ý về cách đọc bản tóm tắt này:Mọi thông số kỹ thuật, điểm chuẩn và giá bên dưới đều được ghi rõ nguồn. Khi Ant Group là nguồn duy nhất, chúng tôi nói rõ điều đó và thận trọng tương ứng. Khi các mô hình Ling thế hệ trước có điểm số độc lập, chúng tôi trích dẫn chúng để làm bối cảnh — không phải để thay thế dữ liệu về chính Ling-3.0-flash, vốn chưa tồn tại. Điều này có khả năng cần một bản cập nhật tiếp theo khi các bài kiểm tra độc lập được thực hiện.

Những gì chúng ta thực sự biết

Về mặt kiến trúc, Ling-3.0-flash là một mô hình MoE thưa: tổng cộng 124B tham số, với khoảng 5,1B tham số hoạt động trên mỗi token, điều này khiến nó rẻ và nhanh khi chạy so với kích thước tổng thể. Cửa sổ ngữ cảnh là 256K token theo {{1}}tài liệu của chính Ant{{/1}}, với tuyên bố từ nhà cung cấp rằng có thể mở rộng lên 1M; danh sách của OpenRouter hiển thị 262.144 token, phù hợp với con số 256K. Độ dài đầu ra tối đa không được tiết lộ ở bất kỳ đâu chúng tôi tìm thấy. Mô hình hỗ trợ tạo văn bản tiêu chuẩn và gọi công cụ, nhưng không có đầu vào hoặc đầu ra đa phương thức nào được đề cập — khả năng đó thuộc về dòng Ming riêng biệt.

Về tính khả dụng, hình ảnh này chỉ dành cho API và nhất quán trên ba tuyến đường chúng tôi tìm thấy: nền tảng nhà phát triển riêng của Ant Group, OpenRouter (được liệt kê là inclusionai/ling-3.0-flash) và ZenMux. Không có dịch vụ nào trong số này công bố trọng số có thể tải xuống. Không có trang tổ chức GitHub nào cho dự án "Ling-V3", và tài liệu của Ant không nêu giấy phép cho mô hình cụ thể này — một khoảng trống đáng kể, vì Ling 2.0 và Ling 2.6 đều được phát hành dưới dạng trọng số mở theo giấy phép MIT. Cho đến khi InclusionAI làm rõ điều này, đừng cho rằng Ling-3.0-flash sẽ được mở, và cũng đừng cho rằng nó sẽ không.

Các khoảng trống: điều chưa được xác minh

Khoảng cách lớn nhất là các chuẩn đánh giá. Tại thời điểm viết bài này, Artificial Analysis — nhà đánh giá độc lập thường được trích dẫn nhất cho chính xác loại mô hình này — không có trang nào cho Ling-3.0-flash; mẫu URL thường dẫn đến trang đó trả về lỗi 404. Điều đó có nghĩa là hiện tại không có điểm số về lý luận, lập trình hoặc toán học của bên thứ ba nào cho mô hình này, từ Artificial Analysis hoặc bất kỳ nhà đánh giá độc lập nào khác mà chúng tôi có thể tìm thấy. Tài liệu của chính Ant càng làm tăng thêm vấn đề này: nó hoàn toàn không công bố bảng chuẩn đánh giá cho 3.0-flash, dù là từ nhà cung cấp hay bất kỳ nguồn nào khác, điều này là bất thường đối với một bản phát hành mô hình và đáng được lưu ý.

Để có bối cảnh sơ lược, các mô hình Ling thế hệ trước có điểm số độc lập. Ling-2.6-flash đạt Chỉ số Trí tuệ Phân tích Nhân tạo của Artificial Analysis là 14, và Ling-2.6-1T lớn hơn đạt 26 — cả hai đều thua xa các mô hình trọng lượng mở hàng đầu được Artificial Analysis theo dõi vào thời điểm đó. Số liệu từ nhà cung cấp của Ant cho Ling-2.6-flash công bố 61,2% trên SWE-bench Verified và 73,85% trên AIME2026. Không con số nào trong số này nên được áp dụng trực tiếp cho Ling-3.0-flash; một thế hệ mới với kiến trúc mới có thể tiến triển theo cả hai hướng, và cho đến khi một nhà đánh giá độc lập thực sự chạy thử nghiệm, bất kỳ tuyên bố về khả năng nào của 3.0-flash cũng chỉ là phỏng đoán được ngụy trang thành sự thật.

Tuyên bố tốc độ của nhà cung cấp: nhanh trên giấy tờ, chưa được kiểm chứng trong thực tế.

Lời quảng cáo nổi bật của Ant Group cho Ling-3.0-flash không phải là chất lượng suy luận — mà là tốc độ thô. Nhà cung cấp tuyên bố thông lượng đỉnh 1000 token mỗi giây và thời gian đến token đầu tiên dưới 100 mili giây, cả hai điều này sẽ thực sự nhanh nếu được xác nhận. Nhưng "nếu được xác nhận" đang làm một công việc thực sự trong câu đó: những con số này chỉ đến từ tài liệu của Ant Group, được đo lường trong các điều kiện mà Ant kiểm soát và chưa tiết lộ đầy đủ (phần cứng, kích thước lô, độ dài lời nhắc và tải đều ảnh hưởng đáng kể đến số liệu thông lượng). Không có phòng thí nghiệm độc lập nào công bố kết quả đo lại. Cho đến khi ai đó ngoài Ant chạy một bài kiểm tra tương đương, hãy coi 1000 tok/s và TTFT dưới 100ms là số liệu tiếp thị đáng để kiểm tra với khối lượng công việc của bạn, không phải là sự thật đã được xác nhận.

Định giá, và tại sao nó là một mục tiêu luôn thay đổi

Trên nền tảng riêng của Ant Group, giá niêm yết cho Ling-3.0-flash là ¥0,40 cho mỗi 1M token đầu vào và ¥1,20 cho mỗi 1M token đầu ra — rẻ theo thiết kế, phù hợp với định vị của nó là tầng nhanh/rẻ. Nhưng mức giá niêm yết đó thực ra không phải là giá mà ai cũng đang trả ngay bây giờ: Ant đang chạy chương trình khuyến mãi tuần ra mắt miễn phí, và riêng biệt cung cấp 500k token miễn phí mỗi ngày trên nền tảng của họ. Danh sách của OpenRouter hiển thị biến thể ling-3.0-flash:free với giá $0/$0. Không điều nào trong số này nên bị hiểu nhầm là mức giá ổn định. Khuyến mãi ra mắt sẽ hết hạn, các tầng miễn phí bị giới hạn, và bản thân các con số ¥0,40/¥1,20 cũng có thể thay đổi khi có dữ liệu sử dụng thực tế. Nếu bạn đang lên kế hoạch chi tiêu sản xuất dựa trên mô hình này, hãy lập ngân sách dựa trên giá niêm yết, không phải giá khuyến mãi, và kiểm tra lại trước khi cam kết.

Gia đình Ling / Ring / Ming

Ling-3.0-flash không tồn tại độc lập — InclusionAI tổ chức các bản phát hành của mình thành ba họ có tên, mỗi họ nhằm vào một công việc khác nhau. Ling là dòng MoE đa năng, bao gồm tạo văn bản hàng ngày và gọi công cụ; Ling-3.0-flash nằm ở đầu nhanh/rẻ của nó, với Ling-2.6-1T vẫn là soái hạm lớn hơn. Ring là dòng tập trung vào lập luận của InclusionAI, được xây dựng cho các tác vụ dựa trên chuỗi suy luận nhiều bước thay vì thông lượng thô. Ming là dòng đa phương thức, xử lý hình ảnh và các phương thức phi văn bản khác mà Ling không chạm tới. Nếu tác vụ của bạn cần lập luận nặng hơn hoặc đầu vào đa phương thức, mô hình InclusionAI phù hợp có lẽ không phải là Ling-3.0-flash — nó được xây dựng cho khối lượng và tốc độ trong làn văn bản và công cụ, không phải để mở rộng sang lãnh thổ của hai họ kia.

Dành cho ai: ba tình huống

1. Đường ống xử lý văn bản hoặc gọi công cụ có độ trễ nhạy cảm và khối lượng lớn — như một thử nghiệm, không phải một cam kết.

Nếu khối lượng công việc của bạn chủ yếu là sinh văn bản nhạy cảm với thông lượng hoặc gọi công cụ — chat, tác nhân nhẹ, các lệnh gọi API tần suất cao — thì định vị của Ling-3.0-flash (số lượng tham số hoạt động nhỏ, TTFT dưới 100ms như tuyên bố, giá khởi chạy gần như miễn phí) khiến nó đáng để dùng thử. Vấn đề là "đáng để dùng thử" khác với "đáng để chuyển lưu lượng sản xuất sang." Không có dữ liệu điểm chuẩn độc lập nào, bạn chính là điểm chuẩn ngay lúc này: hãy chạy bộ đánh giá của riêng bạn qua nó trước khi tin tưởng nó với bất cứ thứ gì hướng đến khách hàng, và đừng xây dựng mô hình chi phí dựa trên giá khuyến mãi hiện tại.

2. Các nhóm cần ngữ cảnh dài với ngân sách hạn chế

Một cửa sổ ngữ cảnh 256K (với tuyên bố của nhà cung cấp về khả năng mở rộng lên 1M) ở mức giá niêm yết thực sự thấp là một sự kết hợp hấp dẫn cho các trường hợp sử dụng nặng về truy xuất hoặc xử lý tài liệu, với điều kiện chất lượng suy luận thực tế của mô hình được duy trì trên độ dài ngữ cảnh đó — điều mà một lần nữa, chưa có nguồn độc lập nào kiểm tra. Đây là một ứng viên hợp lý để đưa vào danh sách rút gọn cùng với các tùy chọn ngữ cảnh dài giá rẻ đã có, nhưng nên được đánh giá song song với chúng thay vì được chấp nhận chỉ dựa trên bảng thông số kỹ thuật của Ant.

3. Những người theo dõi bối cảnh MoE của Trung Quốc và lộ trình InclusionAI

Đối với các nhóm theo dõi bối cảnh cạnh tranh của các phòng thí nghiệm mô hình Trung Quốc mở và bán mở, thay vì triển khai bất kỳ mô hình đơn lẻ nào vào sản xuất, Ling-3.0-flash là một điểm dữ liệu hữu ích: nó cho thấy InclusionAI đang lặp lại nhanh chóng ở cấp độ nhanh của mình, có khả năng lùi bước khỏi trọng số mở (ít nhất là hiện tại), và tiếp tục đặt cược vào cấu trúc ba họ (Ling/Ring/Ming) thay vì một mô hình tổng quát. Đáng để đánh dấu và xem lại khi có sự rõ ràng về điểm chuẩn và giấy phép.

Khi nào không nên sử dụng

Bỏ qua Ling-3.0-flash cho bất cứ việc gì bạn cần trích dẫn một tuyên bố về khả năng đã được xác thực — không có điểm chuẩn độc lập nào để dẫn chứng, vì vậy bất kỳ phát biểu nào về khả năng suy luận, lập trình hoặc toán học của nó hiện đều không thể kiểm chứng. Bỏ qua nó nếu bạn cần trọng số mở để tự lưu trữ, tinh chỉnh hoặc tuân thủ quy định; không có trọng số nào có sẵn, và giấy phép cho mô hình cụ thể này thậm chí còn chưa được công bố, chứ đừng nói đến việc xác nhận là cho phép. Bỏ qua nó cho các tác vụ đa phương thức — đó là nhiệm vụ của dòng Ming, không phải của Ling. Và hãy thận trọng khi xây dựng mô hình chi phí dựa trên định giá hiện tại: tuần ra mắt miễn phí, 500k token miễn phí hàng ngày và gói OpenRouter miễn phí đều là khuyến mãi, và giá niêm yết ¥0,40/¥1,20 mà nó có thể quay lại chưa từng được kiểm tra với các mẫu sử dụng thực tế.

Câu hỏi thường gặp

Ling-3.0-flash có trọng số mở không?

Hiện tại không có. Tính đến thời điểm viết bài này, không có kho lưu trữ Hugging Face và cũng không có dự án GitHub cho Ling-V3. Các thế hệ Ling trước đó (2.0 và 2.6) được phát hành dưới giấy phép MIT dưới dạng trọng số mở, nhưng không có gì xác nhận rằng Ling-3.0-flash sẽ tuân theo mô hình đó — hoặc sẽ không.

Ling-3.0-flash hoạt động như thế nào trên các điểm chuẩn?

Chưa có điểm chuẩn độc lập nào cho nó — Artificial Analysis chưa có trang cho mô hình này. Tài liệu của Ant Group cũng không công bố bảng điểm chuẩn cho nó. Để có bối cảnh lịch sử tham khảo, Ling-2.6-flash thế hệ trước đạt Chỉ số Trí tuệ Artificial Analysis là 14, và Ling-2.6-1T đạt 26, nhưng không nên cho rằng con số nào trong số đó áp dụng cho thế hệ mới này.

Nó thực sự nhanh như thế nào?

Ant Group tuyên bố thông lượng đỉnh 1000 token/giây và thời gian đến token đầu tiên dưới 100ms. Cả hai đều là số liệu chỉ từ nhà cung cấp, chưa có công bố đo lường độc lập nào. Hãy coi chúng là những tuyên bố cần xác minh trên khối lượng công việc của riêng bạn, không phải hiệu suất đã được xác nhận.

Ling-3.0-flash có giá bao nhiêu?

Định giá danh sách trên nền tảng của Ant là ¥0,40 cho mỗi 1 triệu token đầu vào và ¥1,20 cho mỗi 1 triệu token đầu ra, nhưng hiện tại miễn phí trong thời gian khuyến mãi tuần ra mắt, đồng thời cũng có sẵn 500k token miễn phí/ngày. OpenRouter cũng liệt kê một phiên bản miễn phí. Mong đợi các điều khoản khuyến mãi này sẽ thay đổi.

Cửa sổ ngữ cảnh lớn như thế nào?

256K token theo tài liệu của Ant, với tuyên bố của nhà cung cấp rằng có thể mở rộng lên 1M. Danh sách của OpenRouter hiển thị 262.144 token, phù hợp với con số 256K. Độ dài đầu ra tối đa không được tiết lộ.

Sự khác biệt giữa Ling, Ring và Ming là gì?

Ling là dòng mô hình MoE đa năng về văn bản và gọi công cụ của InclusionAI, và Ling-3.0-flash nằm ở đầu nhanh/rẻ của dòng. Ring là dòng tập trung vào lý luận. Ming xử lý các tác vụ đa phương thức. Chúng là các họ mô hình riêng biệt được xây dựng cho các công việc khác nhau, không phải các cấp bậc của cùng một mô hình.

Ling-3.0-flash có giống với Ling-2.6-1T không?

Không. Ling-2.6-1T là flagship lớn hơn của InclusionAI (tổng 1T / 63B tham số hoạt động) và vẫn là một mô hình riêng biệt, lớn hơn. Ling-3.0-flash (tổng 124B / ~5.1B tham số hoạt động) là bản phát hành mới hơn, nhỏ hơn, thuộc phân khúc nhanh hơn.

Tôi có nên sử dụng Ling-3.0-flash trong sản xuất hôm nay không?

Chỉ sau khi tự chạy đánh giá của riêng bạn. Với không có điểm chuẩn độc lập, giấy phép chưa được xác nhận và mức giá hiện đang khuyến mãi, việc thử nghiệm là hợp lý nhưng còn quá sớm để giao các khối lượng công việc quan trọng về sản xuất hoặc nhạy cảm về tuân thủ cho nó mà không có thử nghiệm của riêng bạn và kế hoạch cho những gì xảy ra khi các điều khoản khuyến mãi kết thúc.

Kết luận

Ling-3.0-flash thực sự là một bản phát hành mới đáng để theo dõi — một mô hình MoE 124B/5.1B-active nhắm thẳng vào các tác vụ văn bản và gọi công cụ nhanh, rẻ, khối lượng lớn, đến từ một phòng thí nghiệm đã từng phát hành các mô hình đáng tin cậy trước đây. Nhưng hiện tại, nó mới chỉ là một bảng thông số kỹ thuật và một loạt tuyên bố từ nhà cung cấp, chứ chưa phải một sản phẩm đã được xác minh: không có điểm chuẩn độc lập, không có trọng số mở, không có giấy phép xác nhận, và giá cả rõ ràng chỉ là khuyến mãi. Đó không phải là lý do để gạt bỏ nó — mà là lý do để thử nghiệm một cách thận trọng, tự mình xác minh các tuyên bố quan trọng, và xem lại bài viết ngắn này sau khi Artificial Analysis hoặc một tổ chức đánh giá độc lập khác công bố số liệu thực tế.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

Liên hệ với chúng tôi

Tham gia cộng đồng

DiscordEmailXGitHubYouTube