Thẻ tiêu đề cho Ling-3.0-flash-VL tóm tắt mô hình là một mô hình hỗn hợp chuyên gia đa phương thức gốc với 124 tỷ tham số, 5,5 tỷ tham số hoạt động, đến từ phòng thí nghiệm inclusionAI của Ant Group, phát hành vào tháng 9 năm 2026 theo giấy phép MIT, đạt 25 điểm trên Chỉ số Trí tuệ Artificial Analysis v4.3 và phục vụ 142,9 token đầu ra mỗi giây.
Guides & Insights

Ling-3.0-flash-VL: Mô hình thị giác active 5,5B của Ant đạt vị trí 25 trên Intelligence Index

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Ling-3.0-flash-VL giờ đây đã có một con số benchmark mà không ai tại Ant Group tự gõ ra, và đó chính là tin tức. Mô hình đa phương thức bẩm sinh đầu tiên từ phòng thí nghiệm inclusionAI của Ant được chấm điểm 25 trên Artificial Analysis Intelligence Index — một lần chạy độc lập, trên thang điểm v4.3 hiện hành, được công bố cùng một trang mô hình liệt kê tốc độ, độ trễ và giá của nó. Nó xuất hiện ba tuần sau khi model card của chính nhà cung cấp tuyên bố 42 trên cùng chỉ số, và điều hữu ích nhất mà người đọc có thể làm với hai con số đó là hiểu vì sao chúng không hề mâu thuẫn: Ant đo theo giao thức Intelligence Index v4.1.1, Artificial Analysis đo theo v4.3, và đó là những cây thước khác nhau được dựng từ các bộ đánh giá khác nhau. Con số của nhà cung cấp không hẳn đã sống sót sau khi tiếp xúc với bên thứ ba, mà đúng hơn là được đo lại trên một thang điểm chưa tồn tại vào lúc nó được viết ra.

Mô hình đằng sau điểm số là một mixture-of-experts thưa với 124B tổng tham số và khoảng 5,5B tham số hoạt động mỗi token, được phát hành theo giấy phép MIT với trọng số BF16 và FP8, nhận văn bản, hình ảnh và video và trả về văn bản. Con số tham số hoạt động đó chính là toàn bộ lập luận cho thứ này. Ở mức 5,5B hoạt động, Ling-3.0-flash-VL nằm trên thứ đã trở thành đường cong thú vị nhất trong các mô hình mở — biên giới của trí tuệ được vẽ theo tham số được kích hoạt thay vì tổng kích thước — và nó ở đó vì nó làm được một khối lượng công việc kha khá trên mỗi đơn vị tính toán suy luận, không phải vì nó khổng lồ.

Bài này đề cập những gì thực sự đã phát hành và khi nào, lượt chạy độc lập nói gì, vì sao tuyên bố Pareto đứng vững tốt hơn hầu hết, mô hình tốn bao nhiêu và nơi bạn thực sự có thể gọi nó. Bản ngắn gọn, dành cho ai chỉ muốn thế: Ling-3.0-flash-VL là thật, có trọng số mở, chi phí phục vụ rẻ bất thường, đo lường được là trên trung bình so với phân khúc kích thước của nó, và dài dòng hơn đáng kể cùng chậm ra mắt hơn so với điểm thô gợi ý. Con số 42 do nhà cung cấp công bố chưa từng được tái lập độc lập và không thể so sánh với 25 hiện có trên bảng.

Những gì thực sự đã được phát hành, và dòng thời gian cứ bị san phẳng

Coverage of this release tends to collapse several separate events into one launch date, and the dates matter because they explain why early write-ups described a model that nobody outside Ant could score. The Hugging Face repository inclusionAI/Ling-3.0-flash-VL was created on September 4, 2026 — 64 shards of BF16 weights, an MIT license, a custom-code stack for the bailing_moe_v3_vl architecture, and, for a few days, almost nobody downloading it. The FP8 quantization followed on September 8, roughly 126 GB across 64 shards, with the vision tower kept at higher precision than the expert weights. Artificial Analysis lists the release as September 10, 2026, which is the date its own page anchors to, and the model page carrying the score went live around then.

Vậy nên "phát hành tháng 9 năm 2026" là chính xác nhưng vô dụng. Trình tự thực tế là: trọng số vào ngày 4, một định dạng độ chính xác thứ hai vào ngày 8, và đo lường độc lập vào ngày 10. Lý do điều này quan trọng là một mô hình có trọng số trên đĩa nhưng không có endpoint được host và không có điểm số của bên thứ ba thì, với hầu hết các đội nhóm, vẫn chưa phải là thứ bạn có thể đánh giá — nó là một bản tải về mà bạn phải chuẩn bị hạ tầng cho nó. Ling-3.0-flash-VL đã vượt qua ranh giới đó khi API và điểm số độc lập cùng tồn tại.

Hỗ trợ serving đến cùng lúc với các trọng số chứ không phải sau đó. Ant đã công bố một cookbook triển khai SGLang và duy trì một bản fork vLLM được tinh chỉnh cho Ling theo kiến trúc này, vốn là phần của một bản phát hành mở thường bị chậm trễ hàng tuần. Ở đây thì nó đã không chậm trễ.

Con số trên bảng, và con số trên thẻ

Đây là bức tranh độc lập từ Artificial Analysis, phép đo lường bên thứ ba duy nhất về mô hình này hiện có:

• Chỉ số Trí tuệ — 25 trên v4.3, xếp hạng #2 trong số 64 ở lớp kích thước của nó, so với trung vị cùng lớp là 8br /> • Tổng số tham số — 124Bbr /> • Tham số hoạt động — 5,5B mỗi tokenbr /> • Tốc độ đầu ra — 142,9 token/giây, #10 trong số 64, so với trung vị của các mô hình cùng nhóm là 105,1br /> • Thời gian đến token đầu tiên — 2,21 giây, so với trung vị của các mô hình cùng nhóm là 2,29br /> • Cửa sổ ngữ cảnh — 262K token theo đo lường của Artificial Analysis, so với 256K mà chính thẻ mô hình nêubr /> • Giấy phép — MIT, trọng số mở

Và đây là con số của nhà cung cấp mà nó thường được in bên cạnh: 42 trên giao thức Chỉ số Trí tuệ Artificial Analysis v4.1.1, cao hơn bốn điểm so với mức mà Ling-3.0-flash chỉ dùng văn bản đạt được trên cùng giao thức. Tuyên bố đó nằm trong model card, không có dấu vết đánh giá nào được công bố, và không phải là con số mà Artificial Analysis báo cáo. Hai điều cùng đúng một lúc: con số 42 không được tái lập, và nó không phải bằng chứng cho bất kỳ sự không trung thực nào, bởi vì v4.1.1 và v4.3 không đo cùng một thứ. Artificial Analysis đã trình bày lại chỉ số của mình vào tháng 9 năm 2026 và chấm điểm lại toàn bộ bảng của mình; v4.3 bao gồm mười bài đánh giá, trong đó có AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 và Humanity's Last Exam. Bất kỳ bài viết nào vẫn trích dẫn con số 42 bên cạnh con số 25 mà không nêu rõ phiên bản đều đang so sánh hai bài kiểm tra khác nhau và gọi đó là sự sụt giảm.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

Chi tiết đáng lưu ý ngoài điểm số nổi bật là độ dài dòng. Artificial Analysis ghi nhận Ling-3.0-flash-VL chi 160M token đầu ra để hoàn thành Intelligence Index, xếp hạng #8 trong số 64 so với mức trung vị 84M, và gọi nó là "rất dài dòng". Với một mô hình có lời chào hàng là suy luận rẻ nhờ số lượng tham số hoạt động nhỏ, điều đó đi ngược trực tiếp lại lời chào hàng. Bạn trả tiền theo token, không phải theo tham số. Một mô hình kích hoạt 5.5B nhưng phát ra số lượng token gần gấp đôi mức trung vị để trả lời cùng những câu hỏi sẽ trả lại một phần lợi thế cấu trúc đó ngay tại quầy thanh toán — đúng kiểu tương tác mà bảng giá theo token che giấu và phép đo chi phí theo tác vụ phơi bày.

Tuyên bố Pareto, đặt dưới một chút áp lực

Tuyên bố rằng Ling-3.0-flash-VL nằm trên biên Pareto giữa trí tuệ và tham số hoạt động là điều, một cách bất thường, được dữ liệu độc lập ủng hộ chứ không chỉ cho phép. Trung vị của lớp trên chỉ số này là 8; Ling-3.0-flash-VL đạt 25; và đạt được điều đó trong khi chỉ kích hoạt 5,5 tỷ tham số mỗi token. Đối với các nhóm mà ràng buộc chủ chốt là thông lượng có thể phục vụ — một bộ tăng tốc duy nhất, một ngân sách yêu cầu cố định, một triển khai biên — tỷ lệ đó chính là toàn bộ quyết định, và đây là một màn thể hiện thực sự mạnh mẽ.

Hai lưu ý khiến đây chưa phải là một thắng lợi trọn vẹn. Thứ nhất là sự chênh lệch về số lượng tham số: thẻ mô hình ghi khoảng 5,5B tham số hoạt động, trong khi sách hướng dẫn SGLang mô tả một mô hình có 5,1B tham số hoạt động. Cả hai đều là tài liệu của Ant, khác biệt là nhỏ, và nó chỉ thay đổi đôi chút hình dạng của đường cong chứ không đổi hướng. Thứ hai là "frontier" là một tuyên bố mang tính tương đối về một lĩnh vực thay đổi từng tuần. Việc là mô hình có trí tuệ trên mỗi tham số hoạt động tốt nhất ở một kích cỡ nhất định là vị thế bạn chỉ giữ được cho đến khi mô hình tiếp theo trong phân khúc đó ra mắt, và phân khúc này thì đông đúc.

Màn trình diễn đinh của chính nhà cung cấp — rằng Ling-3.0-flash-VL, khi tranh tài tại Image-to-WebDev Arena dưới biệt danh "linthium", đạt 1,441 so với GPT-5.4 ở mức 1,440 — nên được đọc như một chiêu gây chú ý hơn là một kết quả. Cách biệt một điểm nằm trong ngưỡng nhiễu của Elo đấu trường, lại do nhà cung cấp tự báo cáo, và không phải kiểu khoảng cách quyết định được điều gì. Tuyên bố về năng lực phía sau nó mới thú vị hơn con số: mô hình được xây dựng cho một vòng phản hồi thị giác, trong đó nó tạo mã front-end từ một bố cục, kết xuất đầu ra của chính mình, quan sát bản kết xuất rồi sửa lỗi — quan sát, hành động, kiểm chứng, sửa — thay vì mô tả một lần rồi dừng lại.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Chi phí là bao nhiêu, điều không rõ ràng như vẻ ngoài của nó.

Trang Artificial Analysis liệt kê Ling-3.0-flash-VL ở mức 0,00 USD cho mỗi 1 triệu token đầu vào và 0,00 USD cho mỗi 1 triệu token đầu ra, so với mức trung vị của các đối thủ cùng loại là 0,14 USD và 0,40 USD. Đó không phải là một mức giá. Đó chỉ là vẻ ngoài của một mức giá. Artificial Analysis định giá điểm cuối mà nó có thể thấy, và điểm cuối mà nó có thể thấy là miễn phí — mô hình đang chạy trên Ling Studio của Ant dưới dạng dùng thử miễn phí, và quyền truy cập khuyến mại miễn phí chính là điều mà danh sách phản ánh. Tài liệu đa phương thức của chính Ant hoàn toàn không công bố giá theo token cho mô hình thị giác, nên không có bảng giá nhà cung cấp nào để đối chiếu số 0. Để hình dung về quy mô, người anh em chỉ văn bản Ling-3.0-flash đã được niêm yết ở mức khoảng 0,075 USD cho mỗi 1 triệu token đầu vào và 0,22 USD cho mỗi 1 triệu token đầu ra, và các biến thể Ling theo lĩnh vực cụ thể của Ant cũng ra mắt dưới dạng API miễn phí.

Treat the zero as a testing window rather than a tariff. Free tiers on freshly released models are a customer-acquisition instrument, and the honest planning assumption is that Ling-3.0-flash-VL will eventually carry a price somewhere in the neighbourhood of its text sibling. There is also a live ambiguity the arrival of a paid endpoint will not resolve: Ant's own API examples use the model identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and it remains unclear whether the served checkpoint is byte-identical to the September 4 open weights. If you are benchmarking your own prompts against the hosted API and expecting the results to transfer to a self-hosted BF16 build, that is an assumption you should test before you build on it.

Bức tranh chi phí đảo ngược tùy thuộc vào việc bạn đang đứng ở phía nào. Với một nhóm đã có sẵn bộ tăng tốc, bản dựng FP8 ở khoảng 126 GB vừa vặn trong một node tám GPU thuộc lớp 80GB, và số tham số hoạt động 5,5B nghĩa là bạn đang trả chi phí khấu hao của node đó để đổi lấy một dấu chân tính toán trên mỗi token rất nhỏ — phiên bản rẻ nhất có thể của mô hình này chính là phiên bản bạn tự phục vụ. Với một nhóm không có bộ tăng tốc, câu hỏi là liệu một endpoint trả phí có đến trước khi gói miễn phí đóng lại hay không.

Nơi bạn thực sự có thể gọi nó, bao gồm cả phần mà chúng tôi nói không.

Ling-3.0-flash-VL is reachable through Ant's own platform — an OpenAI-compatible endpoint at api.ant-ling.com/v1/chat/completions and an Anthropic-compatible one alongside it — plus free trial access on Ling Studio, plus open weights you can serve yourself. Independent gateways have begun listing it as well, and that is genuinely the fastest way to try it without provisioning anything.

The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, Deep​Seek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Những điều cần theo dõi từ đây

Ba điều sẽ quyết định liệu bản phát hành này có trông đáng kể sau sáu tháng hay không. Điều thứ nhất là một lần chạy độc lập thứ hai: một điểm số từ một đơn vị đánh giá chỉ là một điểm dữ liệu, và câu hỏi thú vị là liệu vị trí của Ling-3.0-flash-VL trên đường cong trí tuệ so với tham số hoạt động có trụ được với một khung đánh giá khác hay không. Điều thứ hai là giá thật. Cho đến khi Ant công bố bảng giá cho mô hình thị giác, mọi so sánh chi phí liên quan đến nó đều chỉ là ước tính khoác áo một con số, và gói miễn phí đang làm công việc mà lẽ ra một mức giá phải làm. Điều thứ ba là mức chênh lệch chất lượng FP8 — tháp thị giác đã được cố ý giữ ở độ chính xác cao hơn trọng số expert trong bản dựng đó, và liệu phiên bản lượng tử hóa có ngang bằng BF16 trên các tác vụ thị giác chi tiết hay không chính là kiểu câu hỏi chỉ lộ ra khi người ta chạy nó trong môi trường sản xuất thay vì chỉ benchmark nó.

Kết luận có được hôm nay hẹp hơn so với điều mà các bài đưa tin ra mắt ngụ ý và hữu ích hơn so với chỉ riêng điểm số. Ling-3.0-flash-VL là một mô hình thị giác thực sự, được cấp phép MIT, có thể tự triển khai, chỉ kích hoạt một phần nhỏ trong 124B tham số của nó, đạt 25 điểm trên một chỉ số độc lập hiện hành so với trung vị của lớp là 8, và trả lại một phần lợi thế đó thông qua việc dài dòng. Đó là một mô hình tốt với hình dạng trung thực. Con số 42 trên thẻ là một con số đến từ một chiếc thước không còn tồn tại nữa.