Thẻ hero biên tập được tạo có tiêu đề "Ling-3.1-flash đã hoạt động và miễn phí trong hai tuần" cùng phụ đề "560B MoE thực sự phục vụ những gì hôm nay". Bốn thẻ bo tròn ghi "Tham số: tổng 560B / ~25B hoạt động", "Ngữ cảnh: 262.144 token", "Giới hạn đầu ra: 32.768 token" và "Trọng số: không được công bố", phía trên dòng chân trang ghi "Thông số do nhà cung cấp công bố; không có giá sau dùng thử được công bố."
Guides & Insights

Ling-3.1-flash đã ra mắt và miễn phí trong hai tuần: 560B MoE thực sự cung cấp những gì

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ling-3.1-flash, mô hình mixture-of-experts khoảng 560 tỷ tham số mà phòng thí nghiệm inclusionAI của Ant Group công bố vào ngày 29 đến 30 tháng 9 năm 2026, đã không còn chỉ là một thông cáo báo chí trong tuần này: giờ đây nó trả lời các yêu cầu trên một API thương mại đang hoạt động. Mô hình đang chạy thử miễn phí hai tuần trên một cổng suy luận của bên thứ ba, và nó cũng xuất hiện trong sản phẩm Ling Studio của chính Ant — điều đó đưa câu hỏi từ “liệu nó có tồn tại” sang “nó thực sự phục vụ cái gì”. Câu trả lời hẹp hơn những gì các con số trên tiêu đề gợi ý. Ling-3.1-flash là văn bản vào, văn bản ra; nó phục vụ ngữ cảnh 262.144 token (256K) mặc dù thông báo nêu 1M là mục tiêu cuối cùng; đầu ra của nó bị giới hạn ở 32.768 token; và chưa ai công bố mức giá bạn sẽ phải trả vào ngày thứ mười lăm, khi cửa sổ miễn phí đóng lại và các trọng số được cho là sẽ theo sau.

Khoảng cách giữa thẻ công bố và endpoint trực tiếp là điều hữu ích để bám lấy, bởi vì phần lớn tin bài về bản phát hành này đọc thông số kỹ thuật như thể mô hình đang phát hành chúng ngay hôm nay. Nhưng không phải vậy. Ling-3.1-flash là mô hình thứ hai từ phòng thí nghiệm này trong vòng ba tháng ra mắt dưới dạng thứ mà công cụ theo dõi độc lập LLM Releases thẳng thừng xếp vào mục “trọng số chưa được phát hành”, và sự khác biệt giữa những gì Ant nói về mô hình và những gì một nhà phát triển có thể gọi tới ngay lúc này chính là chỗ mà một ngân sách hoặc một dự án thí điểm có thể âm thầm đi sai hướng.

Điều gì đã thay đổi giữa thời điểm công bố và hôm nay?

Bản thân thông báo là một bài đăng thông số kỹ thuật: tổng cộng ~560B tham số, ~25B tham số hoạt động mỗi token, tối đa 1M token ngữ cảnh, ba con số đánh giá nổi bật, và một lời hứa — “chúng tôi dự định sớm mở mã nguồn mô hình.” Không có gì trong số đó thay đổi. Điều đã thay đổi là tính sẵn có. Trong vòng một ngày sau thông báo, mô hình đã có thể truy cập trên một nền tảng edge thương mại, và bản dùng thử miễn phí cung cấp đúng cùng một endpoint thực như bản trả phí: cùng bề mặt API, cùng phương thức chỉ văn bản, cùng công tắc chế độ suy nghĩ cho công việc agent dài hạn.

Với bất kỳ ai đang cân nhắc có nên dành thời gian kỹ thuật cho nó hay không, bản dùng thử là toàn bộ câu chuyện trong tuần này, và nó có hai mặt. Suy luận miễn phí trong hai tuần là một cách thực sự rẻ để xem mô hình hành xử thế nào với chính các câu lệnh của bạn — một điều hiếm thấy ở một mô hình có quy mô này. Nhưng miễn phí là một trạng thái khuyến mãi, không phải là một mức giá. Hiện vẫn chưa có bảng giá sau dùng thử nào được công bố cho Ling-3.1-flash ở bất cứ đâu, nên mọi mô hình chi phí bạn xây dựng dựa trên gói miễn phí chỉ là tạm thời cho đến khi Ant và các nhà cung cấp dịch vụ của nó đưa ra con số.

Bảng thông số kỹ thuật, và ba con số vẫn còn là những lời hứa

• Tham số — tổng 560B, kích hoạt khoảng ~25B mỗi token. Theo công bố của nhà cung cấp, và gần gấp bốn lần thế hệ trước với tổng 124B / 5,1B kích hoạt. Tỷ lệ thưa vẫn giữ ở mức gần 1/22, nên phần kích hoạt không gọn hơn đáng kể — mô hình chỉ đơn thuần lớn hơn nhiều so với mô hình mà nó kế nhiệm.

• Ngữ cảnh — hiện được phục vụ ở 262.144 token. “Tối đa 1M” là mục tiêu sau khi cửa sổ được bật; đó không phải là thứ endpoint dùng thử cung cấp cho bạn, và đây là cách hiểu sai phổ biến nhất về bản phát hành này.

• Đầu ra — tối đa 32.768 token. Hợp lý cho các vòng lặp agent, eo hẹp nếu bạn định tạo tài liệu dài trong một lần.

• Phương thức — văn bản vào, văn bản ra. Đây là mô hình văn bản. Thị giác, âm thanh và đầu vào tệp không thuộc đợt ra mắt, và chưa có ngày nào được đưa ra cho chúng.

• Suy luận — một ngăn xếp lai với công tắc chế độ tư duy tường minh, cùng kiểu mẫu mà thế hệ trước đã sử dụng, hướng tới công việc tác nhân đa bước và gọi công cụ thay vì trò chuyện một lượt.

• Trọng số và giấy phép — chưa được công bố. Đây là con số quan trọng nhất và cũng là con số hoàn toàn chưa có giá trị nào cho đến nay: không có kho lưu trữ Hugging Face, không có văn bản giấy phép và không có checkpoint có thể tải xuống nào tồn tại tính đến hôm nay.

Ant Group's own Ling-3.1-flash benchmark chart, published 30 September 2026. Twelve bar-chart panels cover GDPval-AA v2.1 (1,673 for Ling-3.1-flash), tau-squared Banking (47.60), SkillsBench (69.70), Automationbench public (52.50), Terminal-Bench 4.0 (40.40), CyberGym (87.90), FrontierSWE (75.16), SWE Atlas Codebase QnA (55.92), Finance Agent v2 (57.87), HealthBench Professional (65.35), DRACO (85.49) and MultiChallenge (69.78), with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment and that Ling-3.1-flash's healthcare capabilities can currently be experienced only in AQ.

Thẻ benchmark, đọc với mức giảm giá mà nó cần

Báo cáo của chính Ant đưa Ling-3.1-flash đạt mức tổng hợp 81,0 trên năm benchmark tác tử, với 40,4% trên Terminal-Bench 4.0, 55,9% trên SWE-Atlas và 65,35% trên HealthBench Professional; tài liệu của chính công ty còn bổ sung 1.673 Elo trên GDPVal-AA v2.1 và 75,16 trên FrontierSWE. Mọi con số trong đó đều do bên thứ nhất cung cấp. Không có harness, không có bộ prompt và không có trọng số để bất kỳ ai khác chạy lại bộ kiểm thử, đây là lưu ý tiêu chuẩn đối với một mô hình ở giai đoạn này — và ở đây cần nói thẳng rằng: một điểm số của nhà cung cấp chưa được tái lập là một lời khẳng định về một mô hình, chứ không phải là một phép đo về nó.

Thẻ này cũng mang tính thông tin theo một cách mà những người tạo ra nó có thể không chủ ý. Kết quả 40,4% trên Terminal-Bench 4.0 nằm khá xa so với tầng tiên phong; Claude Sonnet 5.5, một mô hình hạng trung chứ không phải flagship, đạt 70,6% trên cùng phiên bản của benchmark đó. Cách hiểu trung thực không phải là Ling-3.1-flash yếu — 40,4% là một con số agentic-terminal đáng nể đối với một mô hình được định vị về chi phí — mà là cách diễn đạt "gần với tiên phong trên các benchmark chính" lan truyền trên mạng xã hội vào ngày công bố không trụ nổi khi đối chiếu với các hàng cụ thể. Benchmark mà mô hình trông mạnh nhất, HealthBench Professional với 65,35, cũng là benchmark mang chú thích khó xử: Ant tuyên bố nó được đánh giá trong một môi trường mà họ gọi là AQ và rằng khả năng chăm sóc sức khỏe của mô hình "hiện chỉ có thể được trải nghiệm trong AQ", mà không định nghĩa AQ là gì ở bất kỳ đâu công khai. Một điểm số hào nhoáng gắn với một môi trường không tên là một bản demo, không phải một kết quả có thể tái lập.

Vì sao việc một mô hình lớn ra mắt dưới dạng bản dùng thử mới là tin tức thực sự

Điều thú vị hơn ở đây là trình tự, chứ không phải các tham số. Ling-3.0-flash đi thẳng đến trọng số mở. Còn mô hình này đang ra mắt theo kiểu dùng thử trước, khi trọng số, giấy phép và giá chính thức đều bị giữ lại, cùng cam kết công khai chỉ mở mã nguồn sau khi giai đoạn miễn phí kết thúc. Đó là một bài bản phát hành thương mại khoác áo một thông báo mô hình mở, và đó là một thay đổi thực sự đáng theo dõi: nếu trọng số xuất hiện dưới một giấy phép thoáng, cộng đồng sẽ có một mô hình nền 560B để tinh chỉnh và chưng cất; nếu chúng đến kèm những ràng buộc thương mại, thì bản dùng thử hai tuần chính là sản phẩm, còn câu "mã nguồn mở" chỉ là tiếp thị. Dù thế nào, lựa chọn này cũng rơi vào trong cửa sổ dùng thử, và đó mới là điều đáng để theo dõi hơn là bất kỳ một dòng điểm chuẩn đơn lẻ nào.

Nó chạy ở đâu, và bức tranh định tuyến trung thực

Hiện tại, Ling-3.1-flash có thể truy cập được thông qua chính bề mặt sản phẩm của nhà cung cấp và qua các nền tảng suy luận của bên thứ ba đang chạy bản dùng thử — và chỉ có vậy. Hôm nay nó không có trong danh mục của OrcaRouter; tra cứu trên API mô hình công khai của chúng tôi cho Ling-3.1-flash, Ling-3.0-flash và biến thể Ling-3.0 vision đều trả về not-found, và chúng tôi sẽ không giả vờ điều ngược lại. Khi một endpoint Ant thực sự đạt được khả dụng chung với giá niêm yết được công bố, mô hình chuyển tiếp mà OrcaRouter vận hành — giá niêm yết của nhà cung cấp được chuyển tiếp với zero markup, nên khi nhà cung cấp giảm giá, phía chúng tôi có hiệu lực ngay trong cùng ngày — chính là thỏa thuận phù hợp với một mô hình mà giá cả vẫn chưa được ấn định.

Điều bạn có thể làm ngay hôm nay, mà không cần chờ đợi quyết định về giấy phép, là chạy phép so sánh thực sự quan trọng đối với một mô hình chưa được kiểm chứng: đo nó với các mô hình tầng Flash mà bạn có thể gọi ngay bây giờ. Gemini 3.8 Flash và DeepSeek-V4.1-Flash đều có trong danh mục của chúng tôi theo giá niêm yết của nhà cung cấp, chỉ sau một API key, với cơ chế tự động chuyển đổi dự phòng giữa chúng. Đối với một mô hình đang dùng thử miễn phí mà cả trọng số lẫn bảng giá đều chưa rõ, đó là cách hợp lý để giữ nó — thêm một ứng viên mà bạn có thể định tuyến tới trong khi bản dùng thử còn hiệu lực, và một đường đi production không phụ thuộc vào điều gì sẽ xảy ra vào ngày thứ mười lăm.

Headless capture of Ant's Ling Studio interface with Ling-3.1-flash selected in the model picker. The centre panel shows the model-experience card headed "Ling-3.1-flash Model Experience", describing the model as strong at general-purpose agents, search, routine office work and software/code development, above three starter tasks (Hot Spot Scout, Interaction Design Master, Product Assistant). The Model Settings panel on the right shows Max Length 262144, temperature 0.6, top_k 20, top_p 0.95 and Thinking enabled.

Việc cần làm trong tuần này

Nếu mô hình này liên quan đến công việc của bạn, bản dùng thử chính là lý do để hành động ngay thay vì chờ câu hỏi về trọng số mở được giải quyết — hai tuần suy luận miễn phí trên một MoE 560B là đánh giá rẻ nhất mà bạn có được, và câu trả lời cho “liệu nó có đứng vững trên các prompt của tôi không” đã có ngay hôm nay, dù câu trả lời cho “liệu tôi có thể tự vận hành nó không” thì chưa. Ba điều cần kiểm tra trong lúc cửa sổ này còn mở, theo thứ tự:

• Hãy chạy khối lượng công việc của chính bạn, không phải thẻ điểm chuẩn. Những con số được công bố là tập hợp các tác vụ do Ant lựa chọn; chính những câu lệnh của bạn mới là thứ quyết định stack của bạn.

• Hãy kiểm thử ngữ cảnh mà bạn thực sự sẽ dùng. Endpoint phục vụ 262.144 token, không phải 1M. Nếu thiết kế của bạn phụ thuộc vào cửa sổ lớn hơn, thì bạn đang thiết kế dựa trên một lời hứa.

• Không xây dựng mô hình chi phí dựa trên "miễn phí". Miễn phí chỉ là trạng thái kéo dài hai tuần. Cho đến khi bảng giá được công bố, hãy lên kế hoạch chuyển trở lại mô hình Flash-tier có tính phí làm mặc định và coi Ling-3.1-flash là năng lực bổ sung.

Thông báo là thật và mô hình đang chạy, điều mà một tuần trước không thể nói được. Nhưng đã phát hành-và-mở và đang chạy-thử là những trạng thái khác nhau, và trường hợp này chắc chắn thuộc trạng thái thứ hai — một đặc tả 560B, một endpoint 256K, một bảng benchmark chỉ do nhà cung cấp công bố, và một đồng hồ hai tuần vốn là thời hạn chắc chắn duy nhất trong toàn bộ đợt phát hành.

Generated editorial card titled "Ling-3.1-flash on trial - what to verify this week" listing six rounded rows: "Your workload: run it, not the card"; "Context: 262,144 served, not 1M"; "Cost model: free is a two-week state"; "Weights: none published, promise only"; "Fallback: keep a priced Flash-tier route"; "Deadline: the trial window is the only firm date", above a footer reading "Vendor-stated specs; no published post-trial rate card."

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày