Thẻ tiêu đề Hero cho 'Ling-3.1-flash đạt 41 trên AA Intelligence Index', phụ đề '560B tổng / 25B active MoE từ Ant Group'. Một thẻ lớn bo tròn mang số '41' với nhãn 'Artificial Analysis Intelligence Index v4.3.2'; bên dưới là một thẻ nhỏ thứ hai ghi 'so với 20' với nhãn 'Ling-3.0-flash'. Một dòng chân trang ghi 'Số liệu Index được đo độc lập bởi Artificial Analysis; mô hình phát hành 2026-10-01.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Ling-3.1-flash đạt 41 trên Artificial Analysis Intelligence Index: Mô hình MoE 560B gấp đôi thế hệ tiền nhiệm

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ling-3.1-flash, mô hình hỗn hợp chuyên gia 560 tỷ tham số của Ant Group, giờ đây mang một con số mà chính phòng thí nghiệm của nó không viết ra: 41 trên Artificial Analysis Intelligence Index. Chỉ số này do đơn vị đánh giá độc lập vận hành, trên phần cứng do đơn vị đánh giá kiểm soát, dựa trên một bộ kiểm thử cố định — và nó đặt mô hình cao hơn 21 điểm so với người tiền nhiệm trực tiếp của chính nó, Ling-3.0-flash, mô hình vẫn đang ở mức 20 trên cùng chỉ số. Ant công bố Ling-3.1-flash vào cuối tháng 9 năm 2026, Artificial Analysis ghi ngày phát hành là 1 tháng 10, và nó trẻ hơn ba tháng so với mô hình mà nó gấp đôi.

Khoảng cách đó chính là câu chuyện. Một mức tăng 21 điểm trên một chỉ số tổng hợp được mười đánh giá khác nhau cung cấp đầu vào không phải là thứ mà một biểu đồ của nhà cung cấp có thể làm giả, và cũng không phải là thứ mà blog này có thể viết cách đây hai tuần, khi phép đo duy nhất tồn tại của Ling-3.1-flash là thẻ điểm chuẩn của chính Ant: 1.673 Elo trên GDPval-AA v2.1, 75,16 trên FrontierSWE, 65,35 trên HealthBench Professional. Những con số đó là những tuyên bố có thật của một phòng thí nghiệm có thật, nhưng chưa được tái lập. Con số 41 thì khác về bản chất. Đây là con số đầu tiên trong bản phát hành này mà một bên thứ ba có thể đối chiếu.

Điều mà 41 thực sự đo lường

Chỉ số Trí tuệ Artificial Analysis v4.3.2 là một tổ hợp có trọng số gồm mười đánh giá: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR v1.1. Đọc một chỉ số tổng hợp một cách tách biệt là một sai lầm, vì vậy các hàng theo từng đánh giá quan trọng hơn con số tiêu đề:

• GDPval-AA — 1.621,75 cho Ling-3.1-flash so với 948,35 cho Ling-3.0-flash. Đây là bước nhảy đơn lẻ lớn nhất trong tập hợp và là yếu tố mà phần lớn mức tăng của chỉ số dựa vào.

• GDP.pdf — 0,100 đạt tất cả, tăng từ 0,054. Vẫn thấp về mặt tuyệt đối, nhưng gần như tăng gấp đôi.

• Suy luận ngữ cảnh dài AA-LCR v1.1 — 0,83 so với 0,73 của phiên bản tiền nhiệm, và ngang bằng với DeepSeek V4.1 Flash (Max) ở mức 0,84.

• SciCode — 0.541 so với 0.420. Một mức cải thiện về khoa học lập trình, không phải mức cải thiện chất lượng trò chuyện.

• Suy luận vật lý CritPt — 0.180, so với 0.017 trước đó. Gấp mười lần phiên bản tiền nhiệm trên một cơ sở nhỏ.

• AA-Omniscience — +2.22, so với −17.88 của Ling-3.0-flash. Mục này được thảo luận ở bên dưới, vì nó đi ngược lại tiêu đề chính.

Ling-3.0-flash không chỉ đơn thuần thua Ling-3.1-flash trên những dòng này; nó còn sụp đổ ở hai trong số đó. Nó đạt 0,032 trên AutomationBench-AA và đúng 0,000 trên Terminal-Bench 4.0. Đó là bối cảnh mà con số 41 cần được đọc trong đó — phiên bản tiền nhiệm là một mô hình trọng số mở, rẻ, hiệu quả, nhưng về cơ bản không có chút năng lực tác tử-terminal nào cả.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

Nguồn tạo ra lợi ích nằm ở đâu: công việc do tác nhân AI, không phải hội thoại

So sánh các đóng góp chỉ số của Ling-3.1-flash với hai mô hình tầng Flash mà nó thường được xếp cạnh nhất, và một quy luật hiện ra mà con số tổng hợp che giấu. DeepSeek V4.1 Flash (Max) đạt 39 trên cùng chỉ số và GLM 5.3 Flash đạt 42, nên cả ba đều nằm trong một dải ba điểm. Nhưng chúng đạt tới đó từ những điểm xuất phát khác nhau.

• Công việc trên terminal mang tính tác nhân — Ling-3.1-flash 0.333 trên Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.

• Công việc thực tế dạng tác tử — Ling-3.1-flash 1.621,75 Elo trên GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.

• Khoa học lập trình — Ling-3.1-flash 0.541 trên SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.

Cách hiểu hẹp là Ling-3.1-flash có tính cạnh tranh trên các benchmark agentic và nhỉnh hơn một chút ở SciCode. Cách hiểu hữu ích là nó mạnh nhất trong ba mô hình ở hai thước đo agentic-terminal mà hầu hết mọi người ám chỉ khi nói "liệu nó có thể điều khiển một vòng lặp công cụ" — và nó xếp sau cả hai ở thước đo độ tin cậy tri thức. Đó là một hình dạng cụ thể, không phải một chiến thắng tổng quát, và đáng để gọi tên trước khi bất kỳ ai mua một khối lượng công việc chỉ dựa trên con số chỉ số.

Hóa đơn đi kèm với một mô hình lớn hơn

Ling-3.0-flash có giá $0.07 mỗi triệu token đầu vào và $0.22 mỗi triệu token đầu ra trên API riêng của Ant, và nó là trọng số mở theo giấy phép MIT. Ling-3.1-flash thì vẫn chưa có cả hai điều đó. Artificial Analysis ghi nhận chi phí vận hành của nó là $0.30 mỗi triệu token đầu vào và $0.90 mỗi triệu token đầu ra — với mức giá khi trúng bộ nhớ đệm là $0.06, tức giảm 80% so với giá đầu vào — được đo trên API riêng của InclusionAI với vai trò nhà cung cấp dịch vụ. Đó là mức tăng khoảng bốn lần giá đầu vào so với mô hình mà nó thay thế, để đổi lấy mức tăng 21 điểm trên chỉ số.

Liệu sự đánh đổi đó có tốt hay không phụ thuộc hoàn toàn vào khối lượng công việc, và bản thân chỉ số có thể định giá nó: chạy cả mười bài đánh giá Intelligence Index với Ling-3.1-flash tốn khoảng 960 USD ở mức giá đó, so với khoảng 477 USD cho DeepSeek V4.1 Flash (Max) và 280 USD cho GLM 5.3 Flash. Lý do không chỉ nằm ở bảng giá. Ling-3.1-flash là một mô hình suy luận rất dài dòng — nó đã đốt 220 triệu token đầu ra khi xử lý chỉ số, cao hơn hẳn mức trung vị của phân khúc giá, và các lượt đánh giá của nó trung bình khoảng 357 giây mỗi tác vụ, so với 285 giây của DeepSeek V4.1 Flash (Max) và 979 giây của GLM 5.3 Flash. Tính theo từng tác vụ, Ling-3.1-flash tốn khoảng 0,99 USD, so với 0,27 USD của DeepSeek và 0,25 USD của GLM 5.3 Flash.

Không có điều nào trong số này nhìn thấy được từ 41, và tất cả đều lên hóa đơn. Một mô hình có thể thắng một chỉ số và mất ngân sách.

Hai con số mâu thuẫn với tiêu đề

Đầu tiên là độ tin cậy của kiến thức. Ling-3.1-flash đạt +2,22 trên AA-Omniscience, thang đo đánh giá liệu một mô hình có biết mình biết gì hay không: câu trả lời đúng được cộng điểm, ảo giác bị trừ điểm, và việc từ chối trả lời không tốn điểm nào. Tỷ lệ chính xác của nó là 29,1% và tỷ lệ ảo giác là 37,9%. Đặt bên cạnh các mô hình cùng dòng, đây là hồ sơ yếu nhất trong nhóm — GLM 5.3 Flash đạt +7,47 với tỷ lệ ảo giác 27,6%, còn DeepSeek V4.1 Flash (Max) đạt −5,30 với tỷ lệ ảo giác đáng kinh ngạc lên tới 96,5% trong số các câu hỏi được trả lời. Điểm tổng hợp thưởng cho Ling-3.1-flash vì năng lực mà nó thể hiện, chứ không phải vì độ tin cậy mà nó thể hiện năng lực đó, và một mô hình bịa ra một phần ba những gì nó khẳng định thì cần có cơ chế truy xuất bao quanh nó khi vận hành trong môi trường production.

Điều thứ hai là ngữ cảnh. Artificial Analysis liệt kê Ling-3.1-flash với cửa sổ ngữ cảnh 1.000.000 token. Tài liệu công bố của chính Ant cũng nêu 1M là mục tiêu. Nhưng tài liệu dành cho nhà phát triển của Ant, vốn liệt kê cửa sổ của dòng mô hình này theo từng mô hình, ghi Ling-3.0-flash có 256K gốc, có thể mở rộng lên 1M, và vẫn chưa hề có mục nào cho Ling-3.1-flash. Hàng ngữ cảnh dài đặc trưng thực sự được đo — AA-LCR ở mức 0,83 — là điểm suy luận trên ngữ cảnh dài, không phải phép đo cửa sổ được phục vụ. Hãy coi 1M là mức trần được công bố và xác thực cửa sổ thực tế được cung cấp bằng yêu cầu ngữ cảnh dài của riêng bạn trước khi thiết kế dựa trên nó.

Nó thể hiện như thế nào trên bảng thông số kỹ thuật

Bức tranh theo từng chiều, chủ ngữ đứng trước, trên mỗi dòng:

• Tổng số tham số — Ling-3.1-flash 560B so với DeepSeek V4.1 Flash (Max) 552B so với GLM 5.3 Flash 320B.

• Số tham số hoạt động trên mỗi token — Ling-3.1-flash 25B so với DeepSeek V4.1 Flash (Max) 16B so với GLM 5.3 Flash 18B. Ling-3.1-flash kích hoạt nhiều nhất, và đó là một lý do khiến chi phí phục vụ của nó nằm ở mức như hiện tại.

• Trọng số và giấy phép — Ling-3.1-flash không được công bố (độc quyền, không có văn bản giấy phép) so với DeepSeek V4.1 Flash (Max) mở theo MIT so với GLM 5.3 Flash mở theo MIT.

• Ngữ cảnh công bố — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 Flash 1M. Cả ba đều tuyên bố cùng một mức trần; chỉ hai trong số đó có checkpoint có thể tải xuống để bạn kiểm chứng.

• Phương thức — Ling-3.1-flash nhập văn bản, xuất văn bản so với DeepSeek V4.1 Flash (Max) nhập văn bản và hình ảnh so với GLM 5.3 Flash nhập văn bản, hình ảnh và video. Đây là trục duy nhất mà Ling-3.1-flash đơn giản là tụt hậu, và không có hàng benchmark nào bù đắp được cho điều đó.

• Giá trên API của nhà cung cấp — Ling-3.1-flash 0,30 / 0,90 đô la trên mỗi triệu token đầu vào / đầu ra so với DeepSeek V4.1 Flash (Max) 0,30 / 1,20 đô la so với GLM 5.3 Flash 0,15 / 0,50 đô la.

• Điểm chỉ số — 41 so với 39 so với 42. Chênh lệch ba điểm trong một so sánh ba bên không phải là một bảng xếp hạng; đó là một thế hòa được phân định bởi đánh giá nào tình cờ giống với khối lượng công việc của người đọc.

Nơi bạn có thể gọi nó

Ling-3.1-flash hiện không có trên danh mục của OrcaRouter — tra cứu trên API mô hình công khai của chúng tôi đối với mô hình thuộc InclusionAI trả về kết quả không tìm thấy, và chúng tôi sẽ không ngụ ý điều ngược lại. Hiện tại nó chạy trên API riêng của Ant và trên các nền tảng bên thứ ba cung cấp bản phát hành này, đó là mức độ sẵn có trung thực của nó. Điều đáng lưu ý cho bất kỳ ai so sánh ba mô hình ở trên là hai mô hình còn lại hiện có thể định tuyến được: DeepSeek V4.1 Flash và GLM 5.3 Flash đều nằm trong danh mục của OrcaRouter ở mức giá niêm yết của nhà cung cấp với không cộng thêm phí, sau một khóa API duy nhất, với tính năng chuyển đổi dự phòng tự động giữa chúng. Nếu so sánh ở trên cho thấy khối lượng công việc của bạn quan tâm đến độ tin cậy kiến thức hơn là công việc terminal dạng tác tử, thì GLM 5.3 Flash là mô hình nên thử — và bạn có thể thử nó với DeepSeek V4.1 Flash trên cùng một khóa mà không cần hợp đồng thứ hai hay một dòng mã máy khách mới.

Những gì 41 thay đổi, và những gì nó không thay đổi

Điều nó thay đổi là vị thế của bản phát hành. Ling-3.1-flash không còn là một bản thông số kỹ thuật kèm theo biểu đồ của nhà cung cấp; nó là một mô hình có vị trí được đo lường độc lập, và vị trí đó là một bước nhảy vọt thực sự mang tính thế hệ về năng lực agentic so với Ling-3.0-flash — kiểu bước nhảy đến từ thay đổi thiết kế chứ không phải từ việc thêm tài nguyên tính toán trên cùng một công thức. Điều nó không thay đổi là bất cứ điều gì về thu mua. Trọng số vẫn đóng, giấy phép vẫn chưa được viết ra, phương thức vẫn chỉ có văn bản, và giá cao gần gấp bốn lần so với phiên bản tiền nhiệm để đổi lấy mức cải thiện tập trung vào các tác vụ agent và terminal.

Nếu công việc của bạn là các vòng lặp agent, điều khiển công cụ và chuỗi công cụ dài, thì 41 là con số có ý nghĩa nhất được công bố về mô hình này cho đến nay và nó xứng đáng được xem xét nghiêm túc trong khi độ sẵn có vẫn đang mở rộng. Nếu công việc của bạn là đa phương thức, hoặc hỏi đáp quan trọng về kiến thức, hoặc suy luận khối lượng lớn nhạy cảm với ngân sách, thì 41 không chạm tới bài toán của bạn — và GLM 5.3 Flash, vốn đã có thể định tuyến và đã mở theo giấy phép MIT với mức giá đầu ra bằng một nửa, là mô hình được định vị tốt hơn trong ba mô hình. Chỉ số cho bạn biết Ling-3.1-flash đang ở đâu. Nó không cho bạn biết liệu bạn có nên quan tâm hay không, và câu hỏi đó được trả lời bằng chính những gì bạn đang xây dựng.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày