
Ling-3.1-flash được công bố, không mở: ~560B tham số, ngữ cảnh 1M token và một biểu đồ mà chỉ Ant đã chạy
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 262 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Đội Ling của Ant Group đã công bố thông số cho mô hình tầng nhanh tiếp theo của mình vào ngày 30 tháng 9 năm 2026, và ngay lập tức nói rằng bạn chưa thể có nó. Ling-3.1-flash là một mixture-of-experts khoảng 560 tỷ tham số, kích hoạt khoảng 25 tỷ tham số mỗi token và có cửa sổ ngữ cảnh lên tới 1 triệu token, theo thông báo về mô hình mà Ant đăng từ tài khoản @AntLingAGI của chính mình. Câu định hình bản phát hành này là câu nằm ngay sau phần thông số kỹ thuật: “Chúng tôi dự định sớm mở mã nguồn mô hình.” Tính đến hôm nay, không có kho lưu trữ Ling-3.1-flash nào trên Hugging Face, không có giấy phép, không có tệp trọng số nào có thể tải xuống và không có đánh giá nào từ bất kỳ ai ngoài Ant Group. Những gì tồn tại là một biểu đồ benchmark, một bề mặt sản phẩm đang vận hành và một lời hứa.
Sự phân biệt đó chính là toàn bộ câu chuyện, và đáng để nói thẳng về điều đó, bởi vì cách diễn giải mà hầu hết mọi người tiếp cận trước tiên — một bản phát hành trọng số mở thuộc lớp 500B từ Trung Quốc, tiệm cận mức tiên tiến nhất — mô tả một điều chưa hề xảy ra. Ling-3.1-flash không phải là một bản phát hành mở. Nó là một bản đã được công bố. Hai điều này không hề gần nhau, và khoảng cách giữa chúng chính là nơi mà một người đọc có thể bị thiệt: nếu bạn lập kế hoạch năng lực, dự trù ngân sách cho một thử nghiệm thí điểm, hoặc viết một ghi chú mua sắm xoay quanh những trọng số mở chưa tồn tại, thì bạn đang lập kế hoạch dựa trên một thông cáo báo chí.
Thông báo thực sự chứa những gì
Bài đăng ngắn và các con số trong đó rất cụ thể. Ant nêu tổng số tham số khoảng 560 tỷ so với khoảng 25 tỷ tham số hoạt động trên mỗi token, tỷ lệ gần 1 trên 22, dày đặc hơn một chút so với thế hệ Ling-3.0-flash mà nó kế nhiệm — mô hình đó chạy tổng 124 tỷ so với 5,1 tỷ hoạt động, khoảng 1 trên 24, trên một thân mô hình nhỏ hơn một phần tư kích thước. Ngữ cảnh được trích dẫn là "lên đến 1M token", gấp bốn lần cửa sổ 262.144 token mà dòng Ling-3.0-flash phục vụ hiện nay. Ba điểm số nổi bật được đính kèm: 1.673 Elo trên GDPVal-AA v2.1, 75,16 trên FrontierSWE và 65,35 trên HealthBench Professional.
Mọi con số trong đó đều do nhà cung cấp tự báo cáo, là dữ liệu bên thứ nhất, và không được công bố dưới bất kỳ hình thức nào để bên thứ ba có thể chạy lại. Không có khung đánh giá, không có bộ prompt, không có cấu hình chạy, và không có seed — và, căn bản hơn, không có trọng số để chạy chúng trên đó. Nếu các con số của Ant là đúng, mô hình này nằm trong nhóm hàng đầu các bản phát hành mô hình mở của Trung Quốc; hiện tại không có cách nào để biết liệu chúng có đúng hay không.
Biểu đồ, và lưu ý vốn đã nằm sẵn trong đó

Ant đã công bố Ling-3.1-flash cùng một bảng điểm chuẩn nhiều ô, đặt nó vào nhóm các mô hình tiên phong và cận tiên phong: GPT-5.6 Sol, Claude Opus 5, Kimi K3, hai mục từ dòng GLM, và DeepSeek-V4.1-Flash. Trên khắp các ô, cột Ling nằm ở hoặc gần vị trí dẫn đầu ở các thước đo tác tử và lập trình, và ở khoảng giữa bảng ở các thước đo đa lượt và theo lĩnh vực chuyên biệt. Hãy đọc nó đúng như bản chất của nó — sự lựa chọn tác vụ của chính nhà cung cấp, được rút ra từ một bộ bao gồm công việc tác tử đa dụng, lập trình, các tác vụ lĩnh vực ngân hàng và chăm sóc sức khỏe — và đó là một bảng trông có vẻ đáng tin.
Tuy nhiên, hãy nhìn xem những cái tên có trên đó, và một điều nổi bật. Các mô hình ngang hàng ở tuyến đầu mà Ant chọn là GPT-5.6 Sol và Claude Opus 5. Hiện cả hai mô hình đó đều đã lỗi thời một thế hệ. Opus 5.5 và GPT-6 Sol đều ra mắt vào ngày 22 tháng 9 năm 2026, cùng một ngày, và cả hai hiện đều có thể định tuyến. Những mô hình mới nhất mà Ant không đưa lên bảng điểm lại chính là những mô hình mà người đọc sẽ muốn nó được đo lường so với — đây cũng chính là lời phàn nàn đã xuất hiện trong làn sóng bình luận đầu tiên về bản phát hành: mong muốn rằng một mô hình ra mắt vào tháng 10 lẽ ra phải được benchmark so với các mô hình tiên phong của tháng 10 thay vì của tháng 7. Đó không phải là lời chê mô hình, vốn rất có thể vẫn đứng vững. Đó là lý do để coi bảng điểm như một tuyên bố mang tính định hướng hơn là một phán quyết, và để lưu ý rằng phép so sánh mà Ant chọn tô điểm cho kết quả ít hơn việc nó khiến kết quả trông đã cũ.
Nơi bạn có thể chạm vào nó, và một chú thích không được giải thích
Hôm nay có đúng một nơi Ling-3.1-flash chạy cho người dùng: sản phẩm của chính Ant. Giao diện Ling Studio tại ling.tbox.cn liệt kê Ling-3.1-flash trong bộ chọn mô hình, và phần mô tả của chính ứng dụng về mô hình này rộng hơn thẻ benchmark — ứng dụng giới thiệu nó cho “các tác nhân đa dụng, tìm kiếm, công việc văn phòng thường ngày và phát triển phần mềm/mã nguồn”, đúng kiểu định vị quen thuộc cho phân khúc này: không phải mô hình suy luận sâu nhất trong dòng, mà là mô hình được thiết kế để được gọi liên tục và rẻ.
Bề mặt đó cũng mang chi tiết khó xử nhất của bản phát hành. Chính chú thích cuối trang của thẻ benchmark nói rằng HealthBench Professional — con số 65.35, một trong ba con số trong văn bản thông báo — đã được “đánh giá trong môi trường AQ”, và nói thêm rằng các năng lực chăm sóc sức khỏe của Ling-3.1-flash “hiện chỉ có thể được trải nghiệm trong AQ”. Không có gì trên thẻ giải thích AQ là gì, và không có tài liệu công khai nào chúng tôi có thể tìm thấy định nghĩa được nó. Một điểm số nổi bật có kèm theo yếu tố hạn định về môi trường, trong đó môi trường không được nêu tên, không phải là một kết quả có thể tái lập; đó là một bản demo sản phẩm với một con số bên cạnh.
Điều gì có thể biết được, và điều gì thì không
Việc phân loại bản phát hành này vào hai nhóm đó là điều hữu ích nhất mà một độc giả có thể làm với nó ngay hôm nay.
Hiện có thể biết được: các tham số, số lượng tham số hoạt động và cửa sổ ngữ cảnh như nhà cung cấp công bố; ba benchmark của nhà cung cấp; sự tồn tại của mô hình trong sản phẩm của chính Ant; tập so sánh mà Ant đã chọn; việc chưa công bố trọng số, giấy phép hay model card nào; và việc Artificial Analysis, đơn vị đã chấm điểm độc lập thế hệ trước, không có trang Ling-3.1-flash. Tính đến thời điểm viết bài, quy trình chấm điểm độc lập từng khiến con số 20 điểm trên Intelligence Index của Ling-3.0-flash trở nên có thể hiểu được vẫn chưa công bố bất kỳ điều gì về 3.1.
Hiện chưa thể biết: liệu các trọng số có thực sự được mở hay không, và theo giấy phép nào; liệu kiến trúc là phiên bản mở rộng của ngăn xếp hybrid Ling-3.0 hay là thứ gì đó mới; mô hình tốn bao nhiêu qua API của Ant, nếu nó có giá API; cách nó hoạt động trong ngữ cảnh dài trên thực tế, khác với cách cửa sổ được chỉ định; và liệu khoảng cách trên benchmark có đứng vững khi một bên không thuộc Ant chạy cùng các tác vụ. Mỗi điều trong số đó là câu hỏi mà một mô hình đã phát hành trả lời ngay từ ngày đầu tiên, còn một mô hình đã được công bố sẽ trả lời vào một ngày nào đó sau này chưa được ấn định.

Cách đọc một ngày như thế này
Mô thức này giờ đã đủ phổ biến để có thể gọi tên. Một phòng thí nghiệm Trung Quốc có thành tích mạnh mẽ tung ra một model card và một biểu đồ benchmark, các con số đạt mức gần tiên phong, cộng đồng phản ứng với các con số, rồi trọng số xuất hiện — hoặc không — vài tuần sau đó. Ling-3.0-flash đã chạy đúng kịch bản đó vào mùa hè này, và thật đáng để nhớ nó đã kết thúc ra sao: Ant công bố nó vào ngày 24 tháng 7 năm 2026 dưới dạng mô hình chỉ có API, không có tuyên bố giấy phép và không có benchmark độc lập, và trọng số theo MIT mãi đến ngày 7 tháng 8 mới xuất hiện trên Hugging Face, hai tuần sau công bố. Ling-3.1-flash đang ở điểm tương đương trong vòng cung đó ngay ngày đầu tiên, với khác biệt bổ sung rằng lần này lời hứa mở mã nguồn được nêu rõ trong thông báo thay vì chỉ được suy ra.
Không có mô hình nào Ant chọn làm điểm so sánh nằm trong danh mục của chúng tôi với tư cách là chủ thể của bài viết — Ling-3.1-flash, Ling-3.0-flash và Ling-3.0-flash-VL đều trả về trạng thái không tìm thấy trên danh mục OrcaRouter hôm nay, và chúng tôi sẽ không giả vờ điều ngược lại. Nhưng ba trong số các mô hình ngang hàng trên biểu đồ đó hiện có thể định tuyến ngay: Claude Opus 5, GPT-5.6 Sol và DeepSeek-V4.1-Flash đều nằm sau một khóa duy nhất, theo giá niêm yết của nhà cung cấp, không cộng thêm phụ phí, với khả năng chuyển đổi dự phòng tự động giữa chúng. Điều đó quan trọng hơn mức nghe có vẻ trong một tuần như tuần này, bởi vì cách trung thực để đánh giá một mô hình đã được công bố là chạy phép so sánh mà Ant đang mời gọi — với những mô hình bạn thực sự có thể gọi — trong khi chủ thể của phép so sánh vẫn còn là một biểu đồ.
Khi trọng số được phát hành, câu hỏi hữu ích sẽ không phải là liệu Ling-3.1-flash có đánh bại Opus 5 trên một xếp hạng Elo hay không. Mà sẽ là liệu một MoE ~560B với ~25B tham số hoạt động có thể duy trì ngữ cảnh 1M token ở một mức giá khiến tính thưa trở nên đáng giá hay không, và liệu giấy phép có đủ thoáng để tự triển khai hay không. Đó là hai câu hỏi mà thông báo không trả lời, và chúng là những câu hỏi duy nhất sẽ quyết định liệu đây có trở thành một mô hình để người ta xây dựng tiếp hay chỉ là một slide trong bài trình bày kế tiếp của ai đó. Hiện tại: cái tên là thật, các con số chỉ do Ant đưa ra, và trọng số vẫn chỉ là một câu.

