
Ling-3.1-flash so với Ling-3.0-flash: Cửa sổ 1M token và lượng tham số gấp 4,5 lần thực sự thay đổi điều gì
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 262 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Dòng Ling của Ant Group có một bậc nhanh mới, và lần này nó chỉ mới được công bố vỏn vẹn trong một câu. Ling-3.1-flash được công bố vào ngày 30 tháng 9 năm 2026 — khoảng 560 tỷ tham số tổng cộng, khoảng 25 tỷ tham số hoạt động mỗi token, cửa sổ ngữ cảnh được ghi là lên tới 1 triệu token, và kèm theo một câu nói quen thuộc: “Chúng tôi dự định sớm mở mã nguồn mô hình.” Mô hình mà nó thay thế ở vị trí đầu dòng nhanh, Ling-3.0-flash, là một thứ hoàn toàn khác biệt về mọi phương diện: 124 tỷ tham số tổng cộng, 5,1 tỷ tham số hoạt động mỗi token, ngữ cảnh phục vụ 262.144 token, trọng số được cấp phép MIT trên Hugging Face kể từ ngày 7 tháng 8, và Chỉ số Thông minh Artificial Analysis độc lập đạt 20. Một trong hai mô hình này bạn có thể tải về ngay hôm nay. Mô hình còn lại thì bạn chỉ có thể đọc về nó. So sánh chúng thực sự hữu ích, nhưng chỉ khi cuộc so sánh bắt đầu từ đó.
Phép tính trên tít bài thì dễ và có phần hơi gây hiểu lầm. Ling-3.1-flash có tổng số tham số khoảng 4,5 lần Ling-3.0-flash và số tham số hoạt động khoảng 4,9 lần — 25B so với 5,1B mỗi token. Cách đọc hời hợt sẽ nói “mô hình lớn hơn nhiều, do đó thông minh hơn nhiều”. Cách đọc kỹ càng hơn là Ant gần như đã giữ nguyên tỷ lệ thưa trong khi mở rộng phần thân, và thứ mà điều đó mang lại là dung lượng, không nhất thiết là độ sâu suy luận trên mỗi token: một mô hình định tuyến 25B trong tổng 560B qua mỗi token đang thực hiện nhiều công việc hơn trên mỗi token so với mô hình chỉ định tuyến 5,1B, nhưng nó cũng phải trả khoảng gấp năm lần chi phí tính toán trên mỗi token để làm điều đó. Sự đánh đổi đó có đáng hay không hoàn toàn phụ thuộc vào việc kiến trúc của Ant có xử lý hiệu quả lượng tham số tăng thêm hay không — và đó là câu hỏi mà thông báo không trả lời.
Hai mô hình, đặt cạnh nhau
Đặt các dữ kiện đã công bố cạnh nhau và các thế hệ tách ra rõ ràng. Mỗi dòng dưới đây nêu những gì Ant hoặc một đơn vị đánh giá độc lập đã thực sự công bố; chỗ nào thiếu một con số, thì thiếu là vì chưa có ai công bố con số đó.
• Tổng số tham số — Ling-3.1-flash: ~560B (nhà cung cấp). Ling-3.0-flash: 124B (thẻ mô hình).
• Số tham số hoạt động trên mỗi token — Ling-3.1-flash: ~25B (nhà cung cấp). Ling-3.0-flash: 5.1B (thẻ mô hình).
• Cửa sổ ngữ cảnh — Ling-3.1-flash: tối đa 1M token (nhà cung cấp). Ling-3.0-flash: 256K gốc, được phục vụ ở 262,144 (thẻ mô hình và công thức suy luận).
• Trọng số và giấy phép — Ling-3.1-flash: chưa được công bố; không có kho lưu trữ, không có giấy phép (đã kiểm tra ngày 30 tháng 9 và kiểm tra lại vào ngày 1 tháng 10 năm 2026). Ling-3.0-flash: MIT, có trên Hugging Face với tên inclusionAI/Ling-3.0-flash và trên ModelScope kể từ ngày 7 tháng 8 năm 2026.
• Định dạng trọng số — Ling-3.1-flash: không có sẵn. Ling-3.0-flash: BF16 (~255GB) và FP8 (~128GB) từ phòng thí nghiệm, cùng với các bản lượng tử hóa từ cộng đồng.
• Nguồn gốc đánh giá chuẩn — Ling-3.1-flash: hoàn toàn do nhà cung cấp báo cáo, không có bộ kiểm thử công khai, không có trọng số để chạy lại. Ling-3.0-flash: được Artificial Analysis đánh giá độc lập với Chỉ số Thông minh là 20, cùng với tốc độ đầu ra và khối lượng sinh token đã được đo lường và công bố kèm theo.
• Tính khả dụng — Ling-3.1-flash: chỉ có trong sản phẩm Ling Studio của riêng Ant. Ling-3.0-flash: có thể tự triển khai, đồng thời có thể gọi qua API dành cho nhà phát triển của Ant.

Công suất dư thừa có lẽ để làm gì
Mô tả một dòng của chính Ant về Ling-3.1-flash là thông tin hữu ích nhất trong bản phát hành. Ứng dụng Ling Studio giới thiệu nó cho "các tác tử đa dụng, tìm kiếm, công việc văn phòng thường ngày và phát triển phần mềm/mã nguồn" — một cách định vị cho công việc văn phòng và tác tử, không phải cách định vị theo benchmark suy luận. Điều đó nhất quán với cách dòng sản phẩm này được tổ chức: Ling là dòng văn bản và công cụ đa dụng, Ring là dòng suy luận, còn Ming xử lý đa phương thức. Ling-3.0-flash đã chiếm cùng vị trí ở thế hệ trước, và nó rõ ràng thuộc phân khúc nhanh, rẻ chứ không phải sản phẩm chủ lực.
Nhìn việc mở rộng quy mô theo góc độ đó thì nó hợp lý. Các khối lượng công việc mang tính tác tử và gọi công cụ thì dài, lặp lại và ngốn ngữ cảnh: một vòng lặp tác tử duy nhất có thể đốt hàng chục nghìn token đầu ra công cụ tích lũy trước khi nó thực hiện hành động, vì vậy cửa sổ 1M token là một yêu cầu chức năng chứ không phải một điểm nhấn hào nhoáng trên bảng thông số. Mở rộng tổng số tham số trong khi vẫn giữ một tỷ lệ tham số hoạt động lớn là cách bạn thêm kiến thức thế giới và độ sâu tuân thủ chỉ dẫn cho một mô hình vẫn phải đủ nhanh để nằm trong một vòng lặp. Ant không xây dựng một mẫu flagship chậm hơn, thông minh hơn ở đây; nó đang xây dựng một tầng nhanh lớn hơn.
Lập luận ngược lại là chi phí, và đó chính là cùng một phép tính đến từ hướng ngược lại. Năng lực tăng thêm không miễn phí ở thời điểm suy luận — nó phải trả cho mỗi token, và Ant hoàn toàn không công bố mức giá nào cho Ling-3.1-flash: không có bảng giá API, không có chiết khấu cache, không có gì tương đương với mức $0.075/$0.22 mỗi triệu token mà thế hệ trước niêm yết. Đó là con số còn thiếu có thể quyết định phép so sánh này, và nó đang thiếu.
Các benchmark, và ai đã chạy chúng
Ling-3.1-flash ra mắt với ba điểm số trông mạnh mẽ khi xét riêng lẻ: 1.673 Elo trên GDPVal-AA v2.1, 75,16 trên FrontierSWE và 65,35 trên HealthBench Professional. Cả ba đều là của chính Ant, lấy từ thông báo, và không có điểm nào được một phòng thí nghiệm bên ngoài tái lập. Hệ quả thực tế là chúng có thể được so sánh với số liệu của các nhà cung cấp khác nhưng không thể so với các số liệu độc lập — và Chỉ số Thông minh 20 điểm của Artificial Analysis cho Ling-3.0-flash là một con số độc lập trên một thang đo khác, nên đặt hai bên cạnh nhau sẽ là so sánh một phép đo với một tuyên bố. Không có trang Ling-3.1-flash trên Artificial Analysis vào thời điểm viết bài.
Một chú thích trên chính biểu đồ của Ant đáng được nêu riêng. Thẻ nêu rằng kết quả HealthBench Professional được đánh giá trong "môi trường AQ" và rằng các năng lực chăm sóc sức khỏe của Ling-3.1-flash hiện chỉ có thể được trải nghiệm trong AQ. Không có tài liệu công khai nào giải thích AQ là gì. Một điểm số nổi bật đi kèm với yếu tố định lượng về môi trường không tên không phải là thứ mà một nhóm bên ngoài có thể tái tạo, ngay cả khi đã có trọng số.
Tuần này thực sự nên dùng cái nào?
Câu hỏi về thế hệ được giải đáp theo những cách khác nhau tùy vào việc bạn cần gì hôm nay, và với gần như tất cả mọi người, câu trả lời ngay lúc này không phải là mẫu mới hơn.
Nếu bạn cần chạy thứ gì đó trong tuần này, Ling-3.0-flash là mô hình duy nhất trong hai mô hình tồn tại ở dạng dùng được: trọng số MIT mà bạn có thể tự host, FP8 nếu bạn muốn dung lượng nhỏ hơn, giá API chính hãng được công bố, và một điểm số độc lập cho bạn biết mình sẽ nhận được gì. Đây là một mô hình thực sự tốt trong phân khúc của nó — đánh giá độc lập đặt nó trên biên giới Pareto của trọng số mở về trí tuệ so với tổng số tham số, và đánh giá cao tốc độ của nó, với lưu ý rằng nó dài dòng bất thường và tạo ra khoảng 260M token trong quá trình được đánh giá, so với mức trung vị gần 100M.
Nếu bạn đang lập kế hoạch cho sáu tháng tới, Ling-3.1-flash là hướng phát triển và chưa phải là một thành phần. Những điều cụ thể cần theo dõi trước khi nó trở thành một thành phần: liệu trọng số có thực sự được mở và theo giấy phép nào, liệu cửa sổ được phục vụ có thực sự là 1M hay chỉ là phần mở rộng của một ngữ cảnh gốc ngắn hơn, chi phí trên mỗi triệu token là bao nhiêu, và liệu một phòng thí nghiệm độc lập có tái lập được 75.16 trên FrontierSWE hay không. Bất kỳ điều nào trong số đó thành hiện thực cũng sẽ là lý do để chạy lại so sánh. Chưa có điều nào thành hiện thực.

Phần này nằm ở đâu trong ngăn xếp định tuyến
Không mô hình Ling nào có trong danh mục của chúng tôi hôm nay — Ling-3.0-flash, Ling-3.0-flash-VL và Ling-3.1-flash đều trả về not-found trên API mô hình OrcaRouter, nên câu trả lời trung thực cho câu hỏi "tôi có thể gọi nó thông qua các bạn không" là không, ít nhất là hiện tại. Điều mà một lớp định tuyến thực sự có ích trong một tuần như tuần này nằm ở nửa còn lại của vấn đề: những mô hình mà bạn sẽ dùng làm chuẩn để đánh giá một ứng viên. Claude Opus 5, GPT-5.6 Sol và DeepSeek-V4.1-Flash đều là các tuyến đang hoạt động với giá niêm yết của nhà cung cấp và không có phụ phí, và một router giữ chúng phía sau một khóa với chuyển đổi dự phòng tự động chính là cách bạn giữ một hệ thống đánh giá luôn hướng tới một mục tiêu đang thay đổi mà không phải duy trì bốn tích hợp. Khi trọng số của Ling-3.1-flash được phát hành và giấy phép đã rõ ràng, thì hình dạng của quyết định cũng sẽ như vậy: thêm một endpoint, chứ không phải xây lại toàn bộ stack.
Bản tóm lược theo thế hệ thì ngắn gọn. Ling-3.0-flash là một mô hình đã được phát hành, được đánh giá độc lập, có giấy phép cấp phép tự do, và có thể tự host ngay hôm nay. Ling-3.1-flash là một lời hứa lớn hơn, có ngữ cảnh dài hơn, tốn kém hơn khi vận hành mà Ant vẫn chưa cung cấp dưới bất kỳ hình thức nào mà một nhà phát triển có thể sử dụng. Coi cái thứ hai là một bản nâng cấp cho cái thứ nhất chính là sai lầm mà bản phát hành này mời gọi, và các con số vẫn chưa ủng hộ điều đó.

