Thẻ tiêu đề hero cho 'Ling-3.1-flash vs DeepSeek V4.1 Flash', với phụ đề 'Hai điểm chỉ số, gấp ba lần hóa đơn'. Hai thẻ bo góc nằm cạnh nhau với một khoảng cách rõ ràng: thẻ bên trái, được dán nhãn 'Ling-3.1-flash', ghi 'AA Index: 41', 'Chi phí mỗi tác vụ: $0.99', 'Trọng số: đóng'; thẻ bên phải, được dán nhãn 'DeepSeek V4.1 Flash (Max)', ghi 'AA Index: 39', 'Chi phí mỗi tác vụ: $0.27', 'Trọng số: MIT'. Một dòng chân trang ghi 'Chi phí và số liệu chỉ số theo Artificial Analysis.' Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Ling-3.1-flash vs DeepSeek V4.1 Flash: Hai điểm chỉ số, hóa đơn gấp ba lần

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ling-3.1-flash và DeepSeek V4.1 Flash (Max) cách nhau hai điểm trên Chỉ số Trí tuệ Artificial Analysis — 41 so với 39 — và giá cả thì chẳng hề gần nhau. Chạy mười bài đánh giá tạo nên chỉ số đó với từng mô hình, Ling-3.1-flash tốn khoảng $0,99 mỗi tác vụ, so với $0,27 của DeepSeek. Cả hai đều là mô hình mixture-of-experts với ~550 tỷ tham số và ngữ cảnh 1 triệu token như được tuyên bố. Một bên là mô hình đóng, chỉ xử lý văn bản, đến từ phòng thí nghiệm InclusionAI của Ant Group, phát hành ngày 2026-10-01 và vẫn chưa công bố trọng số hay giấy phép. Bên còn lại đã mở theo giấy phép MIT từ ngày 2026-09-10, nhận cả hình ảnh lẫn văn bản, chạy trên 23 nhà cung cấp, và là mô hình mà hầu hết các đội nhóm hẳn đã có sẵn trong tệp cấu hình. So sánh này không hề cân sức trên hầu hết các khía cạnh. Câu hỏi thú vị là tại sao hai điểm đó lại tồn tại.

Nơi Ling-3.1-flash thực sự vượt trội

Nó dẫn đầu ở các đánh giá đo lường việc điều khiển terminal và viết mã phải chạy được, và khoảng cách này đáng được nêu rõ chính vì con số tổng hợp đã che giấu nó.

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 so với DeepSeek V4.1 Flash (Max) 0.268. Xét về giá trị tuyệt đối, cả hai đều là những con số khiêm tốn; khoảng cách bằng một phần tư điểm số của DeepSeek.

• SciCode — 0.541 so với 0.519.

• Suy luận vật lý CritPt — 0.180 so với 0.143.

• Công việc thực tế mang tính tác tử GDPval-AA — 1.621,75 Elo so với 1.600 Elo.

Hai trong bốn kết quả đó gần như ngang bằng, một là thắng sít sao, và Terminal-Bench 4.0 là dòng duy nhất mà khác biệt sẽ trụ được nếu đổi seed. Đối chiếu điều đó với những chỗ DeepSeek thắng: công việc tri thức dạng agentic của AA-Briefcase v1.1 ở mức 1.420,47 Elo so với 1.400,35, AutomationBench-AA ở mức 0,689 so với 0,617, suy luận ngữ cảnh dài AA-LCR ở mức 0,84 so với 0,83, và — dòng quan trọng nhất đối với production — AA-Omniscience ở mức −5,30 so với +2,22 của Ling-3.1-flash trên một thước đo mà ảo giác còn tệ hơn cả việc từ chối. Độ chính xác của DeepSeek ở đó là 46,4%, với tỷ lệ ảo giác 96,5% trong số những câu nó trả lời; Ling-3.1-flash trả lời đúng 29,1% với tỷ lệ ảo giác 37,9%. Cả hai đều không phải là mô hình mà bạn có thể chỉ thẳng vào một cơ sở tri thức mà không có truy xuất ở phía trước.

Khoảng cách về giá lớn hơn khoảng cách về chỉ số, và đó không chỉ là bảng giá.

Mức giá niêm yết trông gần như giống hệt nhau. Artificial Analysis ghi nhận cả hai ở mức $0.30 cho mỗi triệu token đầu vào. Chúng khác biệt rõ rệt ở hai con số còn lại:

• Đầu ra — Ling-3.1-flash 0,90 đô la một triệu so với DeepSeek V4.1 Flash (Max) 1,20 đô la một triệu. Ở đây, Ling-3.1-flash rõ ràng là mô hình rẻ hơn, rẻ hơn 25%.

• Đọc cache — Ling-3.1-flash $0.06 mỗi triệu so với DeepSeek V4.1 Flash (Max) $0.006 mỗi triệu, mức giảm giá 98% so với mức 80%. Đây là điểm mà hai mô hình không còn có thể so sánh với nhau.

Mức giá hỗn hợp ở tỷ lệ trúng cache/đầu vào/đầu ra 7:2:1 cho ra $0,192 đối với Ling-3.1-flash và $0,184 đối với DeepSeek V4.1 Flash (Max) — gần như hòa nhau. Nhưng tỷ lệ hỗn hợp là một giả định về cách bạn dùng một mô hình, và giả định đó đang gánh phần lớn trọng lượng. Bất kỳ khối lượng công việc nào tái sử dụng prompt nhiều — một system prompt dài, một phần mở đầu truy hồi, một vòng lặp agent gửi lại ngữ cảnh tích lũy ở mỗi lượt — đều đẩy tỷ lệ hiệu dụng về phía đọc cache, và ở đó chênh lệch 10× về giá cache sẽ chi phối. Khối lượng token cũng cộng dồn theo cách tương tự: Ling-3.1-flash là một reasoner nói nhiều, tạo ra 220 triệu token đầu ra qua các đánh giá chỉ mục so với 250 triệu của DeepSeek, và trung bình khoảng 357 giây mỗi tác vụ đánh giá so với 285 giây của DeepSeek. Nó suy nghĩ nhiều hơn cho mỗi câu trả lời và mất nhiều thời gian hơn để làm điều đó.

A two-column generated scoreboard titled 'Ling-3.1-flash vs DeepSeek V4.1 Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Cost per task: $0.99', 'Terminal-Bench: 0.333', 'Cache read: $0.06', 'Weights: closed', 'Modality: text'; the right column, 'DeepSeek V4.1 Flash (Max)', reads 'AA Index: 39', 'Cost per task: $0.27', 'Terminal-Bench: 0.268', 'Cache read: $0.006', 'Weights: MIT', 'Modality: text + image'. A footer line reads 'Both columns per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Một ví dụ minh họa: cùng một vòng lặp agent trên cả hai

Lấy một agent điều khiển công cụ chạy 1M token đầu vào mỗi tác vụ, với 90% trong số đó được phục vụ từ cache, và trả về 200.000 token đầu ra. Trên Ling-3.1-flash với các con số ở trên: 900.000 token đầu vào được cache ở mức $0.06 cộng 100.000 token đầu vào mới ở mức $0.30 cộng 200.000 token đầu ra ở mức $0.90, tổng cộng khoảng $0.26 mỗi tác vụ. Vòng lặp tương tự trên DeepSeek V4.1 Flash (Max) tốn khoảng $0.14 — gần bằng một nửa.

Bây giờ hãy áp dụng lịch của DeepSeek, vì đây là phần mà hầu hết các so sánh bỏ qua. Mức giá ngoài giờ cao điểm của DeepSeek là mức ở trên, và ngoài giờ cao điểm bao gồm cuối tuần và phần lớn thời gian trong ngày; nhưng trong hai khung giờ ngày thường, 01:00–04:00 và 06:00–10:00 UTC, giá đầu vào và bộ nhớ đệm tăng gấp đôi. Chuyển cùng vòng lặp đó vào khung giờ cao điểm và chi phí của DeepSeek rơi vào khoảng $0.28 — lúc đó bảng giá cố định, cao hơn của Ling-3.1-flash là lựa chọn rẻ hơn cho giờ đó và khoản chiết khấu bộ nhớ đệm 10× đã bị đồng hồ vô hiệu hóa.

Toàn bộ quyết định nằm gọn trong một cặp số. Nếu lưu lượng agent của bạn có tỷ lệ cache cao và bạn có thể lên lịch cho nó, DeepSeek V4.1 Flash (Max) tốn khoảng một nửa chi phí so với Ling-3.1-flash để đổi lấy mức chênh lệch chỉ số hai điểm. Nếu lưu lượng của bạn có tỷ lệ cache cao và rơi vào các khung giờ cao điểm của DeepSeek, hai mô hình có chi phí gần như tương đương, và dòng terminal-agent tốt hơn một chút của Ling-3.1-flash trở thành yếu tố phân định.

Các trục mà không có gì để so sánh

Ba chiều không gần nhau, và chúng chính là những yếu tố thường quyết định kiến trúc trước khi giá cả được bàn tới.

• Trọng số và giấy phép — Ling-3.1-flash chưa công bố trọng số, không có văn bản giấy phép, và Artificial Analysis xếp nó vào loại độc quyền. DeepSeek V4.1 Flash (Max) là trọng số mở theo MIT, có thể tải xuống từ Hugging Face, với việc sử dụng cho mục đích thương mại được cho phép. Một trong hai có thể tự lưu trữ, tinh chỉnh và chạy trong môi trường air-gapped; cái còn lại thì không.

• Phương thức — Ling-3.1-flash là văn bản vào, văn bản ra. DeepSeek V4.1 Flash (Max) chấp nhận hình ảnh cùng với văn bản và được đánh giá trên các benchmark đa phương thức. Nếu bất kỳ phần nào trong pipeline của bạn đưa cho mô hình một ảnh chụp màn hình, một biểu đồ hay một bản scan, thì sự so sánh kết thúc tại đó.

Bề mặt phục vụ — DeepSeek V4.1 Flash (Max) có sẵn thông qua 23 nhà cung cấp, bao gồm OrcaRouter; Ling-3.1-flash chạy qua API riêng của nhà phát hành và các nền tảng bên thứ ba phân phối bản phát hành của nó. Đối với lộ trình production, số lượng nhà cung cấp là một đặc tính về khả năng phục hồi, chứ không phải một cuộc thi về độ phổ biến.

Một điểm bất đối xứng nữa không xuất hiện trong bất kỳ danh sách nào kể trên: DeepSeek V4.1 Flash (Max) hỗ trợ 384.000 token đầu ra trong một phản hồi duy nhất. Ant chưa công bố độ dài đầu ra tối đa cho Ling-3.1-flash, nên hiện chưa thể định cỡ một tác vụ sinh dài dựa trên nó. Việc không có giới hạn được công bố không đồng nghĩa với việc giới hạn đó nhỏ, nhưng nó cũng không phải là một con số mà bạn có thể dựa vào để thiết kế.

Chạy cả hai, và điều đó thực sự trông như thế nào

Ling-3.1-flash hiện không có trong danh mục của OrcaRouter — tra cứu trên API mô hình công khai của chúng tôi trả về kết quả không tìm thấy đối với mô hình thuộc InclusionAI, và bài viết này sẽ không giả vờ rằng có. DeepSeek V4.1 Flash hiện có thể định tuyến ngay tại giá niêm yết với mức chênh lệch bằng không, vì vậy khi nhà cung cấp thay đổi giá thì phía chúng tôi cập nhật ngay trong cùng ngày giá đó được áp dụng, và nó nằm sau cùng một khóa API duy nhất như phần còn lại của danh mục, với tính năng chuyển đổi dự phòng tự động giữa các nhà cung cấp thượng nguồn.

Sự bất đối xứng đó có một dạng thức thực tiễn. Cách hợp lý để duy trì một so sánh mà trong đó một mô hình là đóng, có giá gần gấp bốn lần phiên bản tiền nhiệm và chỉ có thể tiếp cận qua một nhà cung cấp duy nhất, là giữ mô hình mở, được phục vụ rộng rãi làm đường mặc định và coi kẻ thách thức như một thứ để bạn thử nghiệm thay vì một thứ bạn cam kết gắn bó. DeepSeek V4.1 Flash (Max) có thể gánh vòng lặp sản xuất ngay hôm nay — trọng số mở, đầu vào hình ảnh, đầu ra 384K, chiết khấu bộ nhớ đệm 98% — trong khi Ling-3.1-flash đảm nhận công việc đặc thù cho agent, nơi các mức chênh lệch Terminal-Bench và SciCode của nó thực sự phát huy tác dụng. Vì cả hai đều nói định dạng chat-completions tương thích OpenAI, sự phân chia đó là một quyết định định tuyến chứ không phải một dự án tích hợp: một endpoint, một khóa, và một quy tắc gửi các tác vụ mà mỗi mô hình làm tốt hơn một cách đo lường được.

Phán quyết

Dựa trên bằng chứng hiện có, DeepSeek V4.1 Flash (Max) thắng trong cuộc so tài này, và nó thắng chủ yếu nhờ những thứ không liên quan gì đến hai điểm Index: trọng số mở theo giấy phép MIT, đầu vào hình ảnh, 384.000 token đầu ra, mức giảm giá 98% cho cache, và 23 nhà cung cấp để chuyển đổi dự phòng giữa họ. Lập luận của Ling-3.1-flash hẹp hơn nhưng có thật — nó là tác nhân terminal-và-công cụ tốt hơn trong hai, và nó là cái duy nhất trong cặp đã không công bố bảng giá có hệ số giờ cao điểm được gài sẵn.

Hai điều sẽ thay đổi đánh giá này. Nếu Ant công bố trọng số theo một giấy phép thoáng, khoảng cách về độ mở sẽ khép lại và việc so sánh trở thành một cuộc trò chuyện thuần túy về năng lực và chi phí. Và nếu cửa sổ ngữ cảnh dài được phục vụ của Ant được xác thực ở mức 1M token mà cả hai mô hình đều công bố, thì tuyên bố ngang bằng về ngữ cảnh không còn chỉ là một tuyên bố nữa. Cho đến lúc đó, tóm tắt trung thực là một mô hình có thể thắng một dòng trong benchmark tác tử mà vẫn thua cuộc đánh giá — và rằng khoảng cách chỉ số hai điểm giữa các mô hình này đáng giá khoảng 3,6× chi phí mỗi tác vụ, một đánh đổi mà chỉ một khối lượng công việc cụ thể mới nên chấp nhận.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, in English, captured 2026-10-07. The page header reads 'DeepSeek V4.1 Flash', 'ctx 1M tokens', 'Max output 384K', inputs 'text + image' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-09-10. Four stat tiles read $0.15, $0.60, 1.81 s and 6.04 s. The description states the model 'accepts text and image input, carries a context window of 1,048,576 tokens, and can generate up to 384,000 tokens in a single response. OrcaRouter bills it at $0.15 per 1M input tokens and $0.60 per 1M output tokens.' A code sample shows base_url https://api.orcarouter.ai/v1 with model 'deepseek/deepseek-v4.1-flash'.Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Max), in English, captured 2026-10-07, marked 'Open weights model' and 'Released September 2026'. It shows an Intelligence Index of 39, 227 output tokens per second, $0.27 cost per Intelligence Index task, 250M output tokens generated across the index, input $0.30 with a 98% cache discount and output $1.20 per 1M tokens, a 1M context window, text and image input, 552B total parameters, 16B active parameters, and a licence of MIT with weights on Hugging Face.