
Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Hai canh bạc về tầm nhìn mở
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Ling-3.0-flash-VL và DeepSeek V4 Flash Vision Exp là hai mô hình thị giác trọng số mở trong hạng cân này mà một nhóm có thể tải về và phục vụ trong thực tế ngay hôm nay, và chúng được xây dựng bởi những người bất đồng về mục đích của thị giác. Ling-3.0-flash-VL, từ phòng thí nghiệm inclusionAI của Ant Group, kích hoạt khoảng 5,5B trong số 124B tham số của nó trên mỗi token và coi thị giác như một thứ cần được áp dụng bên trong vòng lặp phản hồi — tạo, kết xuất, nhìn, hiệu chỉnh — với chi phí suy luận thấp nhất có thể. DeepSeek V4 Flash Vision Exp, bản dựng đa phương thức đầu tiên của DeepSeek, kết hợp cửa sổ ngữ cảnh 1M token với đầu ra tối đa 384K token và coi thị giác như một đầu vào nữa mà một tác nhân đọc trên đường hoàn thành một công việc dài. Một mô hình được tối ưu hóa cho việc suy nghĩ tốn ít chi phí đến mức nào. Mô hình kia được tối ưu hóa cho việc nó có thể chứa bao nhiêu trong khi suy nghĩ.
Sự khác biệt đó, chứ không phải một mức chênh lệch benchmark, mới là điều nên chi phối lựa chọn. Hai mô hình không có giao thức đánh giá chung nào để đối chiếu, và chỉ một trong hai mới có điểm số độc lập. Phần tiếp theo là hình hài trung thực của cuộc so tài: những đặt cược về kiến trúc, các thông số thực sự khác biệt, tình hình benchmark cùng lý do vì sao nó còn mỏng, chi phí của mỗi bên, và bên nào thắng với công việc nào — cộng thêm phần chúng tôi nói thẳng bên nào trong hai bên nằm trong danh mục của chúng tôi.
Hai canh bạc, được phát biểu một cách chính xác
Phía Ling của điều này là một đặt cược vào độ thưa kích hoạt như là đòn bẩy chi phí chính. Ling-3.0-flash-VL là một mixture-of-experts thưa với tổng cộng 124B tham số — thẻ mô hình cho thấy khoảng 124.8B, và SGLang cookbook mô tả 5.1B hoạt động trong khi thẻ nói khoảng 5.5B — chạy một phần thân lai 42 lớp luân phiên Kimi Delta Attention với các khối MLA có cổng theo tỷ lệ 5:1. Một bộ mã hóa thị giác độ phân giải tùy ý và một bộ chiếu MLP hai lớp cấp dữ liệu cho phần thân đó, với VideoRoPE xử lý vị trí không gian và thời gian để các khung video xếp theo thứ tự mạch lạc. Hệ quả kiến trúc là một mô hình chỉ tốn một phần nhỏ so với một mô hình dày đặc 124B để chạy mỗi token, đó chính là toàn bộ lý do nó xuất hiện trên biên giới trí tuệ-so-với-tham-số-hoạt-động.
Phía DeepSeek là một canh bạc vào ngữ cảnh và sức bền agentic. DeepSeek V4 Flash Vision Exp lấy kiến trúc văn bản DeepSeek-V4-Flash và thêm một bộ mã hóa thị giác cùng một bộ căn chỉnh, rồi tiếp tục huấn luyện — một nguồn ước tính kết quả vào khoảng 305B tham số, điều mà DeepSeek chưa xác nhận chi tiết. Mô hình mang cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 384.000 token, hỗ trợ đầu ra JSON, gọi công cụ, Responses API, Anthropic API và tiếp nối tiền tố hội thoại, và DeepSeek đã nói rõ rằng đây không phải là mô hình hỏi đáp hình ảnh. Đây là nhận thức cho agent: đọc ảnh chụp màn hình web, giao diện phần mềm và biểu đồ, rồi tiếp tục sang các lệnh gọi công cụ. Hình ảnh được quy đổi thành token và tính phí như vậy, tối đa 384 token mỗi ảnh.
Đọc hai đoạn văn đó cùng nhau và hình hài của quyết định sẽ hiện ra. Nếu khối lượng công việc của bạn là "nhìn vào cái này, quyết định điều gì đó, hành động, nhìn lại," thì số lượng tham số hoạt động của Ling chính là thứ khiến vòng lặp trở nên khả thi với chi phí hợp lý, và thiết kế phản hồi thị giác của nó nhắm chính xác vào điều đó. Nếu khối lượng công việc của bạn là "đọc tài liệu 400 trang này có kèm hình minh họa và tiếp tục," thì cửa sổ ngữ cảnh của DeepSeek chính là tính năng, và không có gì ở phía Ling cạnh tranh được với nó.
Tại sao phép so sánh benchmark lại mỏng hơn vẻ ngoài của nó
Đây là phần mà hầu hết các so sánh đều bỏ qua, và việc bỏ qua nó tạo ra một bảng số liệu chẳng có ý nghĩa gì. Đây là thực trạng thực tế của bằng chứng.
Ling-3.0-flash-VL có một phép đo độc lập: 25 trên Chỉ số Trí tuệ Artificial Analysis v4.3, xếp hạng #2 trong số 64 ở cùng lớp kích thước, so với trung vị của lớp là 8. Thẻ thông số của nhà cung cấp lại công bố riêng mức 42 theo giao thức Chỉ số Trí tuệ v4.1.1, đây là thang đo đã ngừng sử dụng và không thể so sánh được — hãy coi mức 42 là chưa được tái lập.
DeepSeek V4 Flash Vision Exp không có trang Artificial Analysis nào cả. Mọi con số được công bố cho nó đều là của chính DeepSeek, từ thông báo phát hành, và một số trong đó được nêu rõ là tương đối so với Opus-4.8 thay vì theo một giao thức cố định. Đó không phải là lời chỉ trích các con số; đó là một nhận định về những gì bạn có thể làm với chúng. Bạn không thể đặt một mô hình được chấm điểm độc lập và một mô hình chỉ được nhà cung cấp chấm điểm vào cùng một cột rồi tuyên bố người thắng, và bất kỳ trang nào làm vậy là đang tạo ra một kết quả.
Điều hợp thức là so sánh từng mô hình với hồ sơ được báo cáo của chính nó, cùng với nguồn gốc xuất xứ được đính kèm:
• Ling-3.0-flash-VL, độc lập — Chỉ số Trí tuệ 25 trên v4.3, #2 trong số 64 cùng lớp, trung vị của lớp là 8, theo Artificial Analysisbr /> • Ling-3.0-flash-VL, nhà cung cấp — 42 trên giao thức v4.1.1 đã ngừng áp dụng, và 1,441 so với 1,440 của GPT-5.4 trong Image-to-WebDev Arena với tên "linthium"; cả hai đều do nhà cung cấp báo cáo và mức chênh lệch trên arena nằm trong nhiễu Elobr /> • DeepSeek V4 Flash Vision Exp, nhà cung cấp — Terminal Bench 2.1 83.9; DeepSWE 59.3 so với 58.0 của Opus-4.8; Agents' Last Exam 27.3 so với 25.7 của Opus-4.8; Toolathlon-Verified 75.9; Cybergym 75.3; Chartography 64.3; NL2Repo 57.7; DSBench-Hard 63.6; ZeroBench Pass@5 35.0; ApexBench Pass@1 36.5; AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp, độc lập — không có công bố nào
Hãy để ý xem danh sách của DeepSeek chủ yếu gồm những gì: các đánh giá về tác tử và kỹ thuật phần mềm, chứ không phải đánh giá về thị giác. Cách DeepSeek tự định vị là trên các tác vụ văn bản thuần, mô hình thị giác này ngang bằng với DeepSeek-V4-Flash chính thức mà không có sự suy giảm nào, và những cải thiện nằm ở các benchmark tác tử đa phương thức — nơi DeepSeek mô tả kết quả là đang tiến gần đến Opus-4.8 chứ không phải vượt qua nó, đồng thời thừa nhận một khoảng cách khoảng mười điểm trên các tác vụ khoa học dữ liệu có cấu trúc và lập trình là NL2Repo và DSBench-Hard. Đó là một tập hợp tuyên bố thận trọng một cách bất thường, và nó cho bạn thấy mô hình đang được bán như một nâng cấp về nhận thức cho một hệ thống tác tử hiện có, chứ không phải như một giới hạn mới.

Những thông số kỹ thuật thực sự khác biệt
Phần lớn nội dung trong hai bảng thông số kỹ thuật đều tương đồng: cả hai đều mở trọng số theo MIT, cả hai đều nhận văn bản và hình ảnh đầu vào rồi trả về văn bản, cả hai đều phát hành trọng số BF16 cùng các bản dựng lượng tử hóa, cả hai đều có công thức phục vụ được công bố, và cả hai đều xử lý video ở một dạng nào đó. Những khác biệt tập trung ở bốn điểm.
• Tham số — Ling-3.0-flash-VL có tổng cộng 124B với khoảng 5,5B tham số hoạt động mỗi token; DeepSeek V4 Flash Vision Exp được báo cáo khoảng 305B nhưng không có số liệu tham số hoạt động được công bốbr /> • Cửa sổ ngữ cảnh — Ling-3.0-flash-VL đo được 262K token theo Artificial Analysis, so với 256K mà model card của chính nó nêu; DeepSeek V4 Flash Vision Exp chạy 1.048.576 token nativebr /> • Đầu ra tối đa — Ling-3.0-flash-VL ngắn hơn nhiều, chỉ trong khoảng hàng chục nghìn token; DeepSeek V4 Flash Vision Exp đạt 384.000br /> • Xử lý hình ảnh — Ling-3.0-flash-VL chấp nhận tối đa 40 hình ảnh mỗi yêu cầu, mỗi hình tối đa 16.384 × 784 pixel, chỉ base64; DeepSeek V4 Flash Vision Exp chấp nhận base64, URL bên ngoài hoặc tham chiếu Files API, và giới hạn chi phí hình ảnh ở 384 token mỗi hìnhbr /> • Tham số hoạt động — Ling-3.0-flash-VL kích hoạt khoảng 5,5B tham số mỗi token; DeepSeek V4 Flash Vision Exp chưa công bố số liệu tham số hoạt động
Hàng xử lý hình ảnh là hàng thường bị đánh giá thấp. Giới hạn cứng 384 token mỗi ảnh nghĩa là một biểu đồ dày đặc hay ảnh chụp toàn trang bị nén xuống gần như cùng ngân sách với một ảnh thu nhỏ — rẻ, và mất mát theo cách ảnh hưởng đến các tác vụ đọc cần độ chi tiết cao. Cách tiếp cận của Ling đi theo hướng ngược lại: ngân sách pixel rất lớn cho mỗi ảnh, chỉ truyền tải bằng base64, và do đó payload yêu cầu nặng hơn nhiều. Cái nào tốt hơn phụ thuộc hoàn toàn vào việc ảnh của bạn là ảnh chụp tài liệu bạn cần đọc chính xác, hay ảnh chụp màn hình UI bạn cần hiểu một cách tương đối.
Dòng bị đánh giá thấp thứ hai là đầu ra tối đa. Mức trần hàng chục nghìn token của Ling-3.0-flash-VL thì ổn cho một vòng lặp mô tả-rồi-sửa, nhưng lại gây hạn chế cho bất cứ thứ gì muốn xuất ra một artifact lớn — một tệp được tạo dài, một bản viết lại toàn bộ tài liệu, một diff dài hàng nghìn dòng. Đầu ra 384K của DeepSeek tồn tại chính xác vì khối lượng công việc dự kiến của nó kết thúc bằng một kết quả gọi công cụ lớn hoặc một artifact được tạo ra. Nếu pipeline của bạn kỳ vọng mô hình trả lại một thứ gì đó dài, thì chỉ riêng dòng đó quyết định cuộc đối đầu trước khi bất kỳ benchmark nào kịp làm điều đó.
Giá, và sự khác biệt giữa miễn phí và không định giá
DeepSeek V4 Flash Vision Exp có một con số thực trong danh mục của chúng tôi: $0,24 cho mỗi 1 triệu token đầu vào và $0,73 cho mỗi 1 triệu token đầu ra, với cửa sổ ngữ cảnh 1.048.576 token và đầu ra tối đa 384.000 token, có thể truy cập dưới dạng deepseek/deepseek-v4-flash-vision-exp. Đó là mức giá đã công bố, được tính phí theo cùng cách như V4-Flash bản văn bản, với hình ảnh được quy đổi thành token ở mức tối đa 384 token mỗi hình ảnh. Đó là mức giá bạn có thể đưa vào bảng tính.
Ling-3.0-flash-VL không có mức giá như vậy. Trang Artificial Analysis liệt kê nó ở mức 0,00 USD cho mỗi 1M token đầu vào và 0,00 USD cho mỗi 1M token đầu ra so với mức trung vị của các đối thủ cùng loại là 0,14 USD và 0,40 USD — nhưng đó phản ánh bản dùng thử miễn phí đang chạy trên Ling Studio của Ant, chứ không phải là biểu giá chính thức. Tài liệu đa phương thức của Ant không công bố giá theo token cho mô hình thị giác, nên không có gì để đối chiếu với mức 0 đó. Mô hình anh em chỉ xử lý văn bản là Ling-3.0-flash đã được niêm yết ở mức khoảng 0,075 USD cho mỗi 1M token đầu vào và 0,22 USD cho mỗi 1M token đầu ra, và các bản phát hành Ling theo lĩnh vực chuyên biệt của Ant đã ra mắt dưới dạng API miễn phí, điều này gợi ý một diện mạo cuối cùng tương tự — nhưng gợi ý thì không phải là giá.
Đặt chúng cạnh nhau một cách trung thực và so sánh chi phí là: một mô hình có mức giá, mô hình kia có một cửa sổ khuyến mãi và một phỏng đoán hợp lý. Bất kỳ ai khẳng định Ling-3.0-flash-VL rẻ hơn DeepSeek V4 Flash Vision Exp đang so sánh bản dùng thử miễn phí với giá niêm yết. Tuyên bố có thể bảo vệ được là Ling-3.0-flash-VL rất có khả năng sẽ rẻ hơn trên mỗi token khi đã được định giá, vì 5,5B tham số hoạt động là một lợi thế cấu trúc mà không thay đổi giá nào xóa bỏ được — với lưu ý rằng tính dài dòng của Ling-3.0-flash-VL ăn vào đó. Artificial Analysis ghi nhận nó đốt 160M token đầu ra trên Intelligence Index, xếp hạng #8 trên 64 so với trung vị 84M và được dán nhãn "rất dài dòng". Bạn trả tiền cho mỗi token được tạo ra, nên một mô hình nói gần gấp đôi để đạt cùng câu trả lời sẽ trả lại một phần những gì mà kích hoạt thưa của nó giành được.
Cái nào, để làm gì
Cây quyết định trung thực phân nhánh theo ngữ cảnh và độ dài đầu ra trước khi phân nhánh theo bất kỳ điều gì khác, bởi vì đó chính là những chiều mà hai mô hình không thể thay thế cho nhau.
Chọn DeepSeek V4 Flash Vision Exp khi công việc của bạn dài và kết thúc bằng một sản phẩm đầu ra: tài liệu hàng trăm trang có hình minh họa, cơ sở mã được đọc từ đầu đến cuối, vòng lặp agent cần xuất ra một kết quả lớn, khối lượng công việc mà bạn muốn bàn giao một hình ảnh bằng URL hoặc tham chiếu Files API thay vì base64, và các pipeline mà bạn cần Responses API, tiếp nối tiền tố, hoặc mức giá trên mỗi token được công bố để bạn có thể lập ngân sách dựa trên đó. Đây cũng là mô hình duy nhất trong hai mô hình có nhà cung cấp tuyên bố ngang bằng với mô hình văn bản của chính họ trên các tác vụ văn bản, điều này quan trọng nếu một mô hình đang thay thế hai mô hình trong stack của bạn.
Chọn Ling-3.0-flash-VL khi ràng buộc cốt lõi của bạn là chi phí mỗi lần gọi và vòng lặp của bạn ngắn: tự động hóa GUI, kiểm tra ảnh chụp màn hình lặp lại, tạo front-end với chu trình render-rồi-sửa, kiểm tra nhanh tài liệu y tế hoặc tài chính khi bạn cần độ phân giải cao trên mỗi ảnh và có thể chấp nhận đầu ra nhỏ. Số lượng tham số hoạt động 5,5B là lý do để chọn nó, giấy phép MIT là lý do nó an toàn để tự host, và thiết kế vòng phản hồi thị giác nhắm chính xác vào mô hình quan sát-hành động-xác minh-sửa. Hãy lưu ý rằng bạn đang chọn một mô hình chưa được định giá với lối vào miễn phí và không có cam kết về những gì tiếp theo.
Và nếu thứ bạn thực sự cần là một mô hình đọc hình ảnh thành thạo mà không cần đến thái cực nào — không có thủ thuật thưa 5,5B, không có cửa sổ triệu token — thì cả hai đều không phải là câu trả lời đáng quan tâm, và những mô hình thị giác tầm trung thông thường sẽ phục vụ bạn tốt hơn và rẻ hơn so với cả hai mô hình chuyên dụng.
Vận hành chúng, và nơi chúng ta thực sự phù hợp
DeepSeek V4 Flash Vision Exp đã có trong danh mục của chúng tôi. Bạn có thể gọi nó thông qua endpoint tương thích OpenAI của OrcaRouter với chuỗi model deepseek/deepseek-v4-flash-vision-exp, bằng chính key bạn dùng cho mọi thứ khác, ở mức giá niêm yết $0.24/$0.73 mà không cộng thêm gì — giá niêm yết của nhà cung cấp được chuyển thẳng, nên nếu DeepSeek giảm giá thì bạn nhận được ngay trong ngày chứ không phải đợi đến kỳ gia hạn hợp đồng tiếp theo. Nếu đây là lần đầu bạn đưa một model thị giác vào luồng production, thì trên một lớp định tuyến, đây là lựa chọn an toàn hơn trong hai lựa chọn để bắt đầu, vì bạn có thể cấu hình chuỗi dự phòng để khi nhà cung cấp gặp lỗi, hệ thống sẽ thử lại qua một tuyến khác trước khi phản hồi của bạn bắt đầu. Không ai muốn cuộc gọi thị giác production đầu tiên của mình lại là bài học về việc chỉ phụ thuộc vào một nhà cung cấp.

Ling-3.0-flash-VL không có trong danh mục của chúng tôi, và chúng tôi sẽ không ngụ ý điều gì khác. Bạn có thể tiếp cận nó qua nền tảng của chính Ant, nơi công bố một endpoint tương thích OpenAI và một endpoint tương thích Anthropic, qua quyền truy cập dùng thử miễn phí trên Ling Studio, và qua trọng số mở trên Hugging Face, thứ bạn có thể tự phục vụ bằng công thức SGLang đã công bố hoặc bản fork vLLM của chính Ant. Một điều cần kiểm chứng trước khi bạn đầu tư vào hướng đó: các ví dụ API của Ant dùng định danh Ling-3.0-flash-VL-rc1, một dấu hiệu bản ứng viên phát hành (release candidate), và liệu checkpoint được phục vụ có khớp với trọng số mở hay không vẫn chưa được xác nhận công khai. Nếu bạn benchmark với API được host và mong các con số thu được chuyển sang được cho một triển khai BF16 tự host, hãy kiểm chứng giả định đó trước.

Bản tóm tắt đứng vững trước sự soi xét: đây không phải là những câu trả lời đối chọi cho cùng một câu hỏi. DeepSeek V4 Flash Vision Exp là một lớp nhận thức ngữ cảnh dài cho agent với mức giá đã công bố và một bảng điểm chuẩn do nhà cung cấp tự báo cáo, vốn dựa nhiều vào các đánh giá kiểu agentic. Ling-3.0-flash-VL là một mô hình thị giác có chi phí phục vụ thấp với một điểm số độc lập thực sự, một bậc miễn phí không định giá, và thiết kế hướng tới các vòng lặp hiệu chỉnh ngắn. Hãy khớp dạng khối lượng công việc của bạn với dạng của mô hình, và việc chỉ một trong hai có điểm số độc lập trên bảng nên cho biết bạn nên đặt bao nhiêu trọng lượng vào hoạt động tiếp thị của mô hình còn lại.
Cùng một khóa đó truy cập được phần còn lại của danh mục, và bạn có thể duyệt toàn bộ danh mục mô hình để xem còn gì khác nằm sau một endpoint tương thích OpenAI.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
