Thẻ tiêu đề chính được tạo cho Ling-3.0-flash-VL, với phụ đề 'Ant mở mô hình đa phương thức trên dòng Ling nhanh', hiển thị ba biểu tượng đầu vào có nhãn Văn bản, Hình ảnh và Video ngắn đi qua một chip ghi '124B sparse MoE · 5.5B active' vào một biểu tượng đầu ra văn bản, với các chip chân trang 'MIT weights', 'Live API' và 'FP8' cùng ghi chú 'trọng số được công bố ngày 4 tháng 9 năm 2026', và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Ling-3.0-flash-VL: Ant ra mắt mô hình đa phương thức trên dòng sản phẩm Ling tốc độ cao

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 4 tháng 9 năm 2026, phòng thí nghiệm inclusionAI của Ant Group đã công bố các trọng số có giấy phép MIT cho Ling-3.0-flash-VL trên Hugging Face và cùng ngày, cập nhật tài liệu dành cho nhà phát triển của nền tảng Ant Ling cho phù hợp. Ling-3.0-flash-VL là checkpoint hỗ trợ thị giác đầu tiên trong dòng Ling-3.0-flash: cùng một bộ khung sparse mixture-of-experts khoảng 124 tỷ tham số đã khiến Ling-3.0-flash chỉ đọc văn bản trở thành một trong những mô hình suy luận giá rẻ được nhắc đến nhiều nhất vào cuối mùa hè, giờ đây đọc được cả hình ảnh, đoạn video ngắn cũng như văn bản. Lượng tử hóa FP8 theo sau vào ngày 8 tháng 9, buổi sáng khi bài viết này đang được viết. Vậy là trong vòng bốn ngày, bản phát hành đã có ba bề mặt mà người đọc có thể hành động — trọng số mở, một API chính thức trên nền tảng Ling của Ant, và một điểm số do nhà cung cấp công bố là 42 trên giao thức Artificial Analysis Intelligence Index phiên bản 4.1.1, cao hơn bốn điểm so với mức 38 được đo độc lập của phiên bản văn bản cùng dòng. Điều nó chưa có là một thông báo chính thức: thẻ Hugging Face và hướng dẫn dành cho nhà phát triển chính là toàn bộ buổi ra mắt, đó là lý do bài viết này tách biệt những gì nhà cung cấp công bố với những gì người ngoài có thể xác minh.

Sự ra mắt này quan trọng vì những gì nó tác động đến bản đồ sản phẩm của Ant. Cho đến giữa năm 2026, các mô hình đa phương thức trong danh mục của Ant nằm ở dòng Ming riêng biệt, trong khi Ling-3.0-flash được định vị — kể cả trong bài giải thích của chính blog này về mô hình văn bản — như một tầng nhanh dành cho văn bản và công cụ, phục vụ tác tử, lập trình và nghiên cứu sâu. Ling-3.0-flash-VL xóa bỏ ranh giới đó: nó đưa thông tin hình ảnh vào một mô hình suy luận được xây dựng quanh lượng tham số kích hoạt nhỏ bất thường và các phiên tác tử dài, đồng thời trao kết quả cho nhà phát triển theo ba cách cùng một lúc. Điều đó khiến nó trở thành một quyết định thực sự khác biệt so với các biến thể tinh chỉnh theo lĩnh vực trước đó (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), vốn được phát hành dưới dạng API miễn phí không kèm trọng số. Mô hình này mở, chạy trên nền tảng trả phí của Ant, và còn quá mới đến mức chưa ai bên ngoài nhà cung cấp công bố một lần chạy độc lập nào. Điều cuối cùng đó chính là yếu tố quan trọng nhất trong bài viết này.

Những gì đã được phát hành, và khi nào

Mọi ngày tháng dưới đây đều có thể kiểm tra từ các kho lưu trữ và tài liệu; không có điều gì trong đó dựa trên một thông cáo báo chí không tồn tại.

• Ngày 4 tháng 9 — repo inclusionAI/Ling-3.0-flash-VL trên Hugging Face được tạo ra lúc 15:24 UTC với 64 shard chứa trọng số bf16, một bộ stack mã tùy chỉnh hoàn chỉnh cho bailing_moe_v3_vl — một kiến trúc. Repo cũng có một chat template với chế độ suy luận được bật theo mặc định, cùng một giấy phép MIT. Số lượt tải về tại thời điểm viết bài chỉ ở mức vài chục: đây là một bản phát hành mà chỉ những người theo dõi repo mới phát hiện ra ngay trong ngày đầu.

• Ngày 4 tháng 9 — Cổng thông tin nhà phát triển nền tảng Ling của Ant đã bổ sung hướng dẫn về khả năng hiểu đa phương thức, ghi lại mô hình trên API chính thức (dấu thời gian "cập nhật lần cuối" trên chính trang đó ghi ngày 4 tháng 9 năm 2026). Truyền thông công nghệ Trung Quốc đã đưa tin về tính năng này vào ngày hôm sau, nhấn mạnh vào khả năng hiểu hình ảnh và video ngắn phục vụ cho trả lời câu hỏi trực quan và phân tích nội dung.

• Từ ngày 5 tháng 9 trở đi — hỗ trợ phục vụ và triển khai xuất hiện nhanh chóng: một cẩm nang triển khai SGLang cho mô hình, một nhánh vLLM tùy chỉnh do tổ chức inclusionAI duy trì, và một mục trong thư viện triển khai bring-your-own-weights với điểm cuối chat-completions có sẵn. Đây là các môi trường chạy và cơ sở hạ tầng, không phải các thông báo, nhưng chúng cho thấy mô hình được xây dựng để phục vụ, chứ không chỉ để công bố.

• Ngày 8 tháng 9 — bản lượng tử hóa FP8 inclusionAI/Ling-3.0-flash-VL-fp8 đã ra mắt (64 shards, ~126 GB), với tháp thị giác được cố ý giữ ở độ chính xác cao hơn trong khi các trọng số MoE được nén xuống FP8 E4M3. Đối với việc tự lưu trữ trên ít GPU hơn hoặc GPU nhỏ hơn, đây là checkpoint mà hầu hết mọi người sẽ thực sự tải về.

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

Thẻ ở trên là thứ gần nhất mà bản phát hành này có để thay cho một bài công bố ra mắt — mô tả mô hình, kiến trúc, liên kết đến các công thức SGLang và vLLM, và không có thông báo nào ở nơi khác mà chúng tôi có thể tìm thấy. Lưu ý sự không khớp đáng nêu ra ngay từ đầu: thẻ mô hình cho biết "chỉ 5,5B tham số được kích hoạt cho mỗi token", trong khi sách công thức SGLang viết cùng khoảng thời gian phát hành lại mô tả một mô hình "5.1B hoạt động". Trên một checkpoint hoàn toàn mới, sự khác biệt có lẽ là do cách hạch toán vision-tower chứ không phải hai mô hình khác nhau, nhưng đây chính là loại chi tiết nên được gắn nhãn là còn bỏ ngỏ thay vì bị che lấp đi.

Mô hình 124B kích hoạt 5.5B — giờ đã có mắt

Ling-3.0-flash-VL vẫn giữ nguyên công thức MoE thưa kết hợp (hybrid sparse-MoE) đã định hình phiên bản chỉ xử lý văn bản cùng dòng. Bảng thông số mô tả một {{1}}backbone 42 lớp xen kẽ các lớp Kimi-Delta-Attention và Gated-MLA theo tỷ lệ 5:1{{/1}} — {{2}}cùng nhịp điệu cấu trúc với Ling-3.0-flash{{/2}} — với {{3}}tổng tham số khoảng 124,8 tỷ{{/3}} và {{4}}chỉ một phần nhỏ được kích hoạt trên mỗi token{{/4}}. Điểm mới nằm ở {{5}}khối nhận thức (perception stack){{/5}}: {{6}}một bộ mã hóa thị giác ViT đưa dữ liệu vào backbone ngôn ngữ thông qua bộ chiếu MLP hai lớp{{/6}}, cùng với {{7}}VideoRoPE để mã hóa cả vị trí không gian và thời gian{{/7}} nhờ đó {{8}}các khung hình video xuất hiện theo một thứ tự mà mô hình có thể suy luận{{/8}}. Đầu vào là {{9}}văn bản, hình ảnh và video{{/9}}; đầu ra là {{10}}văn bản{{/10}}.

• Tham số — Tổng cộng 124B, ~5.5B được kích hoạt cho mỗi token theo thẻ nhà cung cấp (xem lưu ý về cách tính ở trên).

• Ngữ cảnh — được quảng cáo là "lên tới 1M token"; các công thức triển khai hiện có đang thực thi 256K nhờ YaRN rope scaling, đây là mức thực tế đáng tin cậy để lên kế hoạch cho đến khi ai đó công bố một lần chạy dài hơn đã được xác minh.

• Suy nghĩ — suy luận được bật theo mặc định thông qua chat template; cả các ví dụ API chính thức lẫn các công thức phục vụ đều cho thấy một tùy chọn enable_thinking: false theo từng yêu cầu dành cho các lệnh gọi nhạy cảm với độ trễ.

• Giấy phép — MIT, áp dụng cho cả hai định dạng chính xác, không có ràng buộc bổ sung. Đây cũng là giấy phép sạch đã khiến việc mở mã nguồn vào tháng 8 của mô hình văn bản trở nên đáng chú ý, và chính là toàn bộ lý do khiến việc tự lưu trữ là một lựa chọn thực tế thay vì một khu vực mơ hồ.

Ý định thiết kế quan trọng không kém bảng thông số kỹ thuật. Ant định vị Ling-3.0-flash-VL là mô hình “đưa thông tin thị giác vào toàn bộ quá trình hiểu, suy luận, hành động và xác minh” — đây là ngôn ngữ của các tác vụ agentic, không phải của chú thích hình ảnh. Một mô hình có thể xem bản ghi màn hình 30 giây, duy trì một phiên gọi công cụ dài trong ngữ cảnh và giữ chi phí kích hoạt ở mức gần 5B tham số là nhắm thẳng vào các tác nhân computer-use và các tác nhân dựa trên video ngắn. Đó là một sản phẩm khác với các mô hình ngôn ngữ-thị giác được tối ưu hóa cho việc hỏi đáp trên ảnh đơn lẻ, và đó là khuôn khổ để đọc mọi benchmark dưới đây.

Những gì API chính thức thực sự chấp nhận

Hướng dẫn nền tảng Ant Ling mô tả Ling-3.0-flash-VL trên hai dạng API: một điểm cuối tương thích OpenAI tại api.ant-ling.com/v1/chat/completions và một điểm cuối tương thích Anthropic tại api.ant-ling.com/anthropic/v1/messages. Các ràng buộc đáng để biết trước khi bạn xây dựng dựa trên nó:

• Hình ảnh — JPEG và PNG, chỉ dùng base64, tối đa 40 hình ảnh cho mỗi yêu cầu, mỗi hình ảnh tối đa 16,384 × 784 pixel và mỗi chuỗi base64 tối đa 32 MB. Tham số tương thích OpenAI image_url.detail sẽ bị bỏ qua; hệ thống tự quyết định độ phân giải bên trong.

• Video — MP4, MOV hoặc WMV, một clip cho mỗi yêu cầu, giới hạn tối đa 30 giây, lấy mẫu với tốc độ cố định 2 khung hình/giây, tối đa 32 khung hình, mã hóa base64 lên đến 32 MB. Video chỉ hoạt động trên endpoint tương thích OpenAI; endpoint tương thích Anthropic chấp nhận văn bản và hình ảnh nhưng không chấp nhận video.

• Mã định danh mô hình — các ví dụ curl trong hướng dẫn gọi mô hình là Ling-3.0-flash-VL-rc1 thay vì Ling-3.0-flash-VL. Hậu tố -rc1 đó là dấu hiệu của bản phát hành thử nghiệm (release candidate) và là một câu hỏi mở thực sự: không có gì trong tài liệu nói rõ nền tảng đang phục vụ bộ trọng số nào hoặc liệu điểm kiểm tra (checkpoint) của API có khớp với bản dựng trọng số mở ngày 4 tháng 9 hay không. Nếu bạn đang đánh giá API so với trọng số mở, đó là điều đầu tiên cần kiểm tra, chứ không phải là điều để giả định.

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

Trang ở trên là nơi chứa các ràng buộc đầu vào — định dạng hình ảnh và video, giới hạn cho mỗi yêu cầu, và hai dạng endpoint. Đây cũng là nơi xác nhận rằng mô hình là một API thương mại trực tiếp đang hoạt động chứ không phải là một bản stub chỉ có tài liệu.

Các con số — và ai đã báo cáo chúng

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

Con số tiêu đề duy nhất trên thẻ là 42 theo giao thức Artificial Analysis Intelligence Index phiên bản 4.1.1, mà Ant cho biết cao hơn bốn điểm so với điểm 38 của Ling-3.0-flash chỉ hỗ trợ văn bản. Sự khác biệt trong câu đó mang tính then chốt. Con số 38 là một phép đo của Artificial Analysis — được chạy độc lập, được công bố trên bảng xếp hạng của họ, và được trích dẫn tán thành trong các bài đưa tin về mô hình văn bản trên toàn ngành. Con số 42 là một tuyên bố trên chính thẻ mô hình của Ant, được thực hiện theo một giao thức chỉ số AA nhưng chưa được Artificial Analysis niêm yết — đơn vị này chưa có trang nào cho Ling-3.0-flash-VL tính đến thời điểm viết bài. Chưa ai ngoài Ant chạy checkpoint này. Hãy coi 42 là một con số từ phía nhà cung cấp thuộc cùng nhóm đã tạo ra con số 38 thực sự của mô hình văn bản — một lý do để xem xét, không phải một con số để trích dẫn như đã được xác lập.

Mọi thứ khác trong bản phát hành đều là định tính hoặc phương pháp luận. Thẻ mô hình mô tả mô hình qua biểu đồ năng lực "hiểu, suy luận, hành động" và ám chỉ một đợt đánh giá Terminal-Bench dạng agentic chạy theo giao thức kiểu AA, nhưng không công bố kết quả số bằng văn bản nào mà chúng tôi có thể tái tạo ở đây; sổ tay triển khai liệt kê các ô độ chính xác (MMMU-Pro, GSM8K) gắn với các cấu hình phục vụ cụ thể, đáng đọc nhưng chỉ là các phép đo liên quan đến hạ tầng, không phải đánh giá độc lập. Tóm tắt trung thực rất ngắn: một mô hình suy luận có khả năng thị giác, hợp lý, chi phí phục vụ thấp, nhưng chưa có bảng điểm độc lập công khai nào.

Chi phí là bao nhiêu, và tiền sử gia đình gợi ý điều gì

Hướng dẫn mô hình đa phương thức của Ant không niêm yết giá theo token cho Ling-3.0-flash-VL, vì vậy mọi con số ở đây chỉ là suy luận và được ghi chú rõ ràng như vậy. Điểm neo hữu ích là phiên bản văn bản anh em trên cùng nền tảng: giá công bố trực tiếp của Ling-3.0-flash vào khoảng $0.075 cho mỗi 1 triệu token đầu vào và $0.22 cho mỗi 1 triệu token đầu ra, với lượt đọc cache rẻ hơn khoảng 80%, còn bảng điều khiển tại Trung Quốc niêm yết giá bằng nhân dân tệ (¥0.40 đầu vào / ¥1.20 đầu ra cho mỗi 1 triệu token) sau đợt khuyến mãi giảm 75% giai đoạn đầu kết thúc ngày 31 tháng 8. Mô hình đa phương thức 124B-A5.5B có chi phí vận hành cao hơn mô hình văn bản 124B-A5.1B — tháp thị giác là thành phần dense và phải xử lý từng token hình ảnh — nên mức giá ngang bằng hoặc nhỉnh hơn một chút so với khoảng giá đó là giả định tiên nghiệm hợp lý. Lịch sử của dòng sản phẩm cũng cho thấy chiều hướng ngược lại: các biến thể theo lĩnh vực Fin và Sante ra mắt dưới dạng API miễn phí, nên Ant đã chứng minh rằng họ sẵn sàng dùng mức giá bằng 0 để gieo mầm việc áp dụng một biến thể Ling mà họ muốn đưa ra thị trường. Việc bản VL sẽ đi theo khoảng giá trả phí của mô hình văn bản hay theo mẫu hình biến thể miễn phí hiện đơn giản là chưa được công bố.

Với tuyến tự lưu trữ, những con số là cụ thể vì các tệp đều công khai. Bản phát hành bf16 cần tải xuống khoảng 250 GB trải trên 64 shard — một bài toán đa GPU mà chỉ những nút đơn lớn nhất mới kham nổi — trong khi bản phát hành FP8 (~126 GB, với tháp thị giác được giữ ở bf16) nằm gọn trên một nút có 8 bộ tăng tốc loại 80 GB và là phiên bản mà hầu hết các đội sẽ thực sự chạy. Các tuyên bố về thông lượng từ cookbook phục vụ thì có, nhưng mang màu sắc nhà cung cấp; hãy lưu ý cảnh báo quen thuộc rằng token/s thực tế phụ thuộc vào phần cứng và batch của bạn.

Lớp định tuyến phù hợp ở đâu — nói thật

Tại thời điểm ra mắt, không cổng mô hình bên thứ ba lớn nào mà chúng tôi kiểm tra liệt kê Ling-3.0-flash-VL, và OrcaRouter — nền tảng định tuyến mà blog này trực thuộc — cũng không phục vụ mô hình này. Không có gì trong bài viết này nên được hiểu là nó đã được phục vụ. Đó là bức tranh trung thực về một mô hình mới bốn ngày tuổi, và cần nói thẳng vì hôm nay độc giả thực sự chỉ có đúng hai lựa chọn: gọi API chính thức của Ant hoặc tự lưu trữ bộ trọng số MIT. Góc độ định tuyến là điều xảy ra tiếp theo. Một khi mô hình như thế này được bên thứ ba đưa vào phục vụ, chính tính kinh tế của bộ định tuyến chuyển tiếp (pass-through router) là lý do để ưu tiên nó khi đánh giá: giá niêm yết của nhà cung cấp được chuyển tiếp với mức phụ giá 0%, nên một đợt giảm giá từ nhà cung cấp (hoặc một thử nghiệm ở bậc miễn phí như các lần ra mắt Fin và Sante) có hiệu lực ngay trong ngày công bố, và chuyển đổi dự phòng tự động cho phép bạn hướng một khối lượng công việc thực tế vào một mô hình mở mới vài ngày tuổi mà không cần đánh cược toàn bộ hệ thống của mình vào thời gian hoạt động của một nhà cung cấp hay hành vi của một checkpoint duy nhất. Với một dòng mô hình đã từng tự định giá lại một lần và phân tách thành bốn biến thể trong sáu tuần, đó không phải là chuyện giả định — đó là sự khác biệt giữa việc tự tay kiểm thử lại mỗi lần Ant thay đổi và kiểm thử lại một lần duy nhất qua một API.

Xem gì

Bản phát hành này vẫn còn quá mới nên các tín hiệu hữu ích chủ yếu là các phép kiểm tra mà bất kỳ ai cũng có thể chạy. Thứ nhất, liệu Artificial Analysis (hoặc một phòng thí nghiệm độc lập khác) có đưa Ling-3.0-flash-VL vào danh sách và xác nhận hay đính chính con số 42 — điểm dữ liệu duy nhất đó tách "mô hình tốt nhất của dòng" khỏi "một con số khác của nhà cung cấp". Thứ hai, liệu -rc1, tức là định danh trên API chính thức, có trỏ tới bộ trọng số mở ngày 4 tháng 9 hay không; nếu không, mô hình trên API và mô hình tự triển khai là khác nhau, và mọi bài so sánh mà bạn đọc gặp đều cần nêu rõ đã dùng mô hình nào. Thứ ba, giá cả: một mức giá VL được công bố trên nền tảng Ling, và liệu nó đi theo bậc trả phí của mô hình văn bản hay theo chiến lược API miễn phí của Fin/Sante. Thứ tư, liệu checkpoint FP8 có giữ được độ chính xác như trên model card khi phục vụ thực tế — việc giữ vision tower ở bf16 là một dấu hiệu tốt, nhưng những tuyên bố về thị giác lượng tử hóa cần một lần chạy thử, không phải một cấu hình. Và thứ năm, câu hỏi về bản đồ sản phẩm: khi thị giác giờ đã nằm trong dòng Ling nhanh, hãy theo dõi xem Ant giữ Ming như một thương hiệu đa phương thức riêng biệt hay để cho hai dòng hội tụ.

{{1}}Với một nhà phát triển, câu trả lời trước mắt rất ngắn gọn.{{/1}} {{2}}Nếu muốn xây dựng dựa trên điều này ngay hôm nay, API chính thức là hướng đi không cần hạ tầng, còn bộ trọng số FP8 là hướng đi tự lưu trữ, và cả hai đều thật sự hiện hữu kể từ tuần này.{{/2}} {{3}}Nếu muốn xây dựng dựa trên con số 42, hãy chờ một ai đó bên ngoài Ant tái lập được nó.{{/3}} {{4}}Mọi thứ thực sự hữu ích ở Ling-3.0-flash-VL — trọng số MIT, một kiến trúc hợp lý, một thiết kế có giá trên mỗi lần kích hoạt cực kỳ cạnh tranh, và một điểm số từ nhà cung cấp đáng được xem xét nghiêm túc — đều đã có đủ; còn điều kiện để nó trở thành lựa chọn mặc định an toàn thì vẫn chưa hoàn tất.{{/4}}