
Ling-3.0-flash-VL so với Ling 3.0 Flash: Một bộ não 124B, giờ đã có đôi mắt
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
Ling-3.0-flash-VL và Ling 3.0 Flash không phải là đối thủ của nhau, và việc xem cặp đôi này như một cuộc so tài giữa các mô hình sẽ dẫn bạn đến kết luận sai lầm. Ling-3.0-flash-VL là checkpoint thị giác-ngôn ngữ mà phòng thí nghiệm inclusionAI của Ant Group phát hành trong tuần này — bộ trọng số đã được đăng tải trên Hugging Face theo giấy phép MIT kể từ ngày 4 tháng 9 năm 2026 — và nó được xây dựng trực tiếp trên Ling 3.0 Flash, mô hình văn bản mở trọng số 124 tỷ tham số của phòng thí nghiệm, vốn là trụ cột của phân khúc tốc độ cao kể từ cuối tháng 7. Hai mô hình này có chung thiết kế MoE lai tuyến tính, có chung tính kinh tế của cơ chế kích hoạt thưa, có chung công thức vận hành với cửa sổ ngữ cảnh 256K và có chung giấy phép MIT. Điều mà checkpoint VL bổ sung là thứ duy nhất mà mô hình văn bản chưa từng có: khả năng nhận nguyên bản đầu vào hình ảnh và video, được truyền qua bộ mã hóa ViT, bộ chiếu MLP hai lớp và bộ mã hóa thời gian VideoRoPE. Vậy nên, phép so sánh rút gọn thành một câu hỏi thực tế duy nhất — nếu tác vụ của bạn không bao giờ đụng đến hình ảnh, thì liệu mô hình có “mắt” có đáng để chuyển sang hay không?
Câu hỏi này sở dĩ đáng đặt ra ngay từ đầu là vì inclusionAI không định vị Ling-3.0-flash-VL như một dòng sản phẩm riêng biệt. Thẻ thông tin mô hình của họ gọi đây là “mô hình đa phương thức gốc thế hệ tiếp theo của chúng tôi”, được xây dựng dựa trên Ling-3.0-flash, kế thừa năng lực ngôn ngữ, suy luận và ngữ cảnh dài của mô hình này, đồng thời mở rộng chúng bằng thị giác tham gia đầy đủ vào vòng lặp hiểu – suy luận – hành động – xác minh, chứ không phải thị giác chỉ được gắn vào như một đầu vào phụ trợ. Với một dòng mô hình mà bản phát hành chủ lực trước đó được xác định rõ là chỉ hỗ trợ văn bản, đây là một sự thay đổi thực sự, và nó làm thay đổi checkpoint mà một đội ngũ chuyên làm việc với văn bản và công cụ nên chọn làm chuẩn.
Hai checkpoint, một backbone
Ling 3.0 Flash, đối thủ trong so sánh này, là phiên bản trưởng thành hơn trong hai mô hình. Được công bố vào cuối tháng 7 năm 2026 và mã nguồn mở theo giấy phép MIT vào ngày 7 tháng 8, đây là mô hình hỗn hợp chuyên gia lai tuyến tính với tổng cộng 124B tham số và khoảng 5,1B tham số kích hoạt trên mỗi token — gồm 35 tầng KDA và 7 tầng Gated MLA xếp theo tỷ lệ 5:1, 512 chuyên gia định tuyến với 8 chuyên gia được kích hoạt, ngữ cảnh gốc 256K được phục vụ ở mức 262.144 token. Mô hình chỉ xử lý văn bản, có hỗ trợ gọi công cụ, suy luận được bật mặc định thông qua mẫu trò chuyện, và có mức chi phí thấp bất thường so với kích thước của nó. Đây cũng là một nửa được ghi nhận đầy đủ của cặp đôi: Artificial Analysis liệt kê nó trên bảng xếp hạng trực tiếp, nơi nó đứng đầu trong số 63 mô hình cùng phân khúc, và đã đo được tốc độ xuất ra khoảng 313 token mỗi giây trên API của nhà cung cấp.
Ling-3.0-flash-VL giữ nguyên kiến trúc đó và bổ sung một khối thị giác phía trên. Bảng mô tả giới thiệu bộ mã hóa thị giác ViT có các đặc trưng được căn chỉnh vào không gian văn bản thông qua bộ chiếu MLP hai lớp, còn VideoRoPE mã hóa cả vị trí không gian lẫn trật tự thời gian, nhờ đó mô hình có thể định vị sự kiện và suy luận trên video dài. Backbone vẫn là kiến trúc lai KDA-to-MLA tỷ lệ 5:1, lần này ở mức 124B tổng / 5.5B kích hoạt cho mỗi token, với thân mô hình gồm 42 lớp. Đầu vào là văn bản, hình ảnh và video; đầu ra là văn bản. Ngữ cảnh được công bố lên tới 1M token, với công thức SGLang được khuyến nghị phục vụ 256K nhờ kỹ thuật mở rộng YaRN. Giống như phiên bản văn bản cùng dòng, mô hình có chế độ thinking bật sẵn theo mặc định (có thể tắt theo từng yêu cầu bằng chat_template_kwargs) và chạy được trên SGLang hoặc một nhánh fork vLLM tùy chỉnh của inclusionAI. Bản BF16 chiếm khoảng 250 GB dung lượng đĩa, trải trên 64 mảnh safetensor — cùng phân khúc một phần tư terabyte với bộ trọng số của phiên bản văn bản.
Mức độ mới của nó ra sao? Tại thời điểm viết bài, kho lưu trữ VL có số lượt tải chỉ ở mức hàng chục, thẻ mô hình của nó vẫn đang được cập nhật, và Artificial Analysis vẫn chưa liệt kê nó. Mọi thứ bên dưới không được gán rõ ràng cho Artificial Analysis là báo cáo của chính inclusionAI.

Bảng tỷ số
Sự bất đối xứng ở đây không nằm ở phẩm chất — mà nằm ở phương thức. Sáu chiều kích nắm bắt quyết định:
• Chỉ số thông minh (thẻ nhà cung cấp, AA Index v4.1.1) — Ling-3.0-flash-VL: 42, do nhà cung cấp báo cáo. Ling 3.0 Flash: 38, con số chỉ số trước đó mà thẻ trích dẫn.
• Bảng xếp hạng trực tiếp AA hôm nay (v4.3) — Ling-3.0-flash-VL: chưa được liệt kê. Ling 3.0 Flash: ước tính 25, xếp hạng #1 trong số 63 ở phân khúc của nó.
• Đầu vào — Ling-3.0-flash-VL: văn bản, hình ảnh và video. Ling 3.0 Flash: chỉ văn bản.
• Ngữ cảnh — cả hai đều tuyên bố hỗ trợ tới 1M token; thực tế hiện nay cả hai đều được phục vụ ở mức 256K (262.144).
• Giá — Ling-3.0-flash-VL: chưa có giá niêm yết; chỉ có trọng số mở MIT. Ling 3.0 Flash: khoảng $0,07 cho mỗi 1M đầu vào và $0,22 cho mỗi 1M đầu ra trên API của chính nhà cung cấp.
• Hãy chọn nó cho — Ling-3.0-flash-VL: tài liệu, ảnh chụp màn hình, biểu đồ, video và các tác nhân thao tác GUI. Ling 3.0 Flash: gọi công cụ thiên về văn bản và các quy trình tác nhân tầm xa.

Bảng điểm mà mô hình văn bản không thể vào được.
Đây chính là nơi hai mô hình thực sự khác biệt, và sự khác biệt mang tính cấu trúc chứ không phải cạnh tranh: trên các benchmark hình ảnh và video, Ling 3.0 Flash chỉ có văn bản không có mục điểm nào cả, vì nó không thể chấp nhận đầu vào đó. Biểu đồ riêng của Ling-3.0-flash-VL — đánh giá của inclusionAI, chưa được tái lập, chạy một phần nội bộ và một phần dựa trên API của đối thủ trong các thiết lập kiểm thử chính thức — đưa ra các con số trên ba nhóm mà thẻ sản phẩm nhấn mạnh. Về hiểu hình ảnh phức tạp, nó đạt MMMU-Pro 79.0 và MathVision 84.87, với con số thấp hơn nhiều là 19.88 trên Humanity's Last Exam-Multimodal, phản ánh độ khó của bộ dữ liệu đó đối với mọi mô hình. Về công việc tài liệu và biểu đồ, nó rất mạnh: OmniDocBench1.5 đạt 91.35 và CharXiv_RQ đạt 81.30. Và trên các bộ đánh giá đa phương thức tác nhân khiến bản phát hành này trở nên thú vị — ClawEval-MM đạt 59.9, WebVoyager đạt 90.83, Vision2Web đạt 57.69 — mô hình được yêu cầu đọc giao diện và hành động dựa trên đó, đây chính xác là công việc của tác nhân GUI mà mô hình văn bản không thể đảm nhận.
Đọc những số liệu đó trong bối cảnh đầy đủ, một bức tranh mạch lạc sẽ hiện ra: đây không phải là một mô hình được tinh chỉnh để thắng các câu đố về hình ảnh, mà là một mô hình được tinh chỉnh để biến pixel thành hành động — đọc bố cục, theo dõi biểu đồ, thao tác trên trang. Trên biểu đồ của chính nhà cung cấp, mô hình này dẫn đầu cuộc so sánh ba bên (Qwen3.8-27B ở mức suy luận cao, Gemini 3.5 Flash-Lite và Kimi-K2.6) tại OmniDocBench, WebVoyager và ClawEval-MM, nhưng lại xếp sau ở các bộ dữ liệu tri thức và suy luận khó như MathVision và HLE-MM. Hãy coi mọi con số trong số đó chỉ là tuyên bố của inclusionAI cho đến khi một phòng thí nghiệm trung lập xác nhận — nhưng hướng tinh chỉnh thì rõ ràng và nhất quán.
Con số duy nhất đáng tranh luận: 42 so với 38
Tuyên bố có khả năng thúc đẩy một đội ngũ chỉ dùng văn bản chuyển đổi nhất chính là tuyên bố tiêu đề: inclusionAI báo cáo Ling-3.0-flash-VL đạt 42 trên Artificial Analysis Intelligence Index (v4.1.1), cao hơn bốn điểm so với mức 38 mà họ quy cho Ling 3.0 Flash trên cùng phiên bản chỉ số. Lưu ý điều chỉ số đó đo lường: điểm tổng hợp v4.1.1 của nó dựa trên các bộ đánh giá văn bản và tác tử — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam và những bộ tương tự, không có bộ nào là tác vụ hình ảnh. Vì vậy, nhà cung cấp đang tuyên bố rằng việc thêm huấn luyện thị giác vào backbone dùng chung đã cải thiện trí tuệ phía văn bản của mô hình thêm bốn điểm, chứ không chỉ đơn thuần là mô hình giờ có thể mô tả hình ảnh. Đây là một tuyên bố đáng chú ý và hoàn toàn hợp lý — việc tinh chỉnh hướng dẫn đa phương thức thường nâng cao khả năng văn bản.
Hai lưu ý về nguồn số liệu giúp giữ con số đó ở đúng tương quan. Thứ nhất, con số 38 là số liệu thuộc một thế hệ chỉ số cũ hơn: Artificial Analysis từ đó đã chuyển bảng xếp hạng trực tiếp của mình sang phiên bản chỉ số mới hơn (v4.3), trong đó hiện tại họ xếp Ling 3.0 Flash ở mức ước tính 25 nhưng vẫn xếp nó đứng đầu trong số 63 mô hình cùng phân khúc. Cặp số liệu 42-vs-38 của nhà cung cấp nằm trên thang đo cũ, vì vậy không nên hiểu là "cao hơn bốn điểm so với mức AA chấm cho mô hình văn bản hiện nay." Thứ hai, con số 42 là số liệu do chính inclusionAI công bố cho một mô hình mà Artificial Analysis chưa niêm yết, và inclusionAI chưa công bố kết quả của checkpoint VL trên từng bộ kiểm tra văn bản riêng lẻ (SWE-Bench, Terminal-Bench) mà biểu đồ mô hình văn bản của chính họ tách riêng. Bốn điểm chính là mức tăng mà bạn cần thấy được tái hiện trước khi dựa vào đó để chuyển một quy trình chỉ xử lý văn bản.

Giá: một cái có giá niêm yết, cái kia thì không.
Bảng so sánh chi phí hiện tại mới chỉ có một mức giá. Ling 3.0 Flash hiện có thể gọi được trên API first-party của nhà cung cấp với giá khoảng 0,07 USD cho mỗi 1 triệu token đầu vào và 0,22 USD cho mỗi 1 triệu token đầu ra — mức giá do nhà cung cấp ấn định, được xác nhận trên bảng niêm yết của Artificial Analysis — với đầu vào được cache có giá rẻ hơn, và các chương trình giảm giá trong thời gian ra mắt đã kết thúc. Ling-3.0-flash-VL chưa có mức giá API nào được công bố ở bất kỳ đâu; bạn vẫn chưa thể trả phí theo token cho mô hình này. Nếu muốn dùng nó trong tuần này, bạn phải tự host: trọng số MIT khoảng 250 GB ở định dạng BF16, trên cùng phân khúc phần cứng mà mô hình văn bản vốn đã yêu cầu — 4× GPU 141GB (H20-3e hoặc H200) hoặc node Blackwell 4 GPU ở tensor-parallel 4, hoặc 8× H100/H800 80GB ở TP8.
Điều đó tái định hình bài toán kinh tế cho một đội ngũ chỉ chuyên về văn bản. Nếu bạn đang mua token, mô hình văn bản với mức giá $0.07/$0.22 vừa rẻ vừa đã được kiểm chứng. Nếu bạn đã tự vận hành mô hình văn bản 124B, checkpoint VL không phải là một khoản đầu tư hạ tầng thứ hai — mà chỉ là thêm ~250 GB trọng số trên cùng một dòng máy chủ, và chỉ hợp lý khi khối lượng công việc thực sự tiêu thụ pixel. Mô hình có mắt chỉ xứng đáng với chi phí bỏ ra khi mắt nằm trong vòng lặp.
Ai nên chọn cái nào
• Chỉ văn bản và khối lượng cao — hãy tiếp tục dùng Ling 3.0 Flash. Bạn sẽ có một mô hình đã được kiểm chứng và xếp hạng AA, mức giá thực tế theo token, cùng khả năng gọi công cụ hoàn thiện. Mức tăng bốn điểm trên chỉ số của mô hình VL chưa được tái lập và thông lượng phía văn bản của nó chưa được đo lường; hiện chưa có bằng chứng nào cho thấy nó là mô hình văn bản tốt hơn — mới chỉ có lời khẳng định rằng nó tốt hơn mà thôi.
• Thị giác bước vào vòng lặp — tài liệu, ảnh chụp màn hình, biểu đồ, hình ảnh, khung hình video hoặc giao diện người dùng mà agent của bạn phải đọc và nhấp vào — Ling-3.0-flash-VL là lựa chọn hiển nhiên, vì nó là cùng một bộ khung suy luận mà bạn đã nắm rõ, với cụm thị giác được bổ sung, thay vì một mô hình đa phương thức riêng biệt mà bạn phải đánh giá lại từ đầu.
• Lưu lượng hỗn hợp, chưa ngã ngũ — phương án ít rủi ro là giữ cả hai khả dụng và định tuyến theo từng yêu cầu thay vì tái cấu trúc hệ thống chỉ quanh một bên. Đó chính là thứ mà một model gateway sinh ra để mang lại cho bạn: một API duy nhất cho hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển thẳng với markup 0%, và tự động chuyển đổi dự phòng khi nhà cung cấp suy giảm. Cả hai checkpoint Ling hiện vẫn chưa nằm sau một endpoint OrcaRouter — giá của mô hình văn bản là giá riêng của nhà cung cấp, còn mô hình VL thì chưa có giá hosted nào — nhưng khi mô hình VL có được một mức giá, việc chuyển một phần lưu lượng sang nó và tiến hành đo lường chỉ là một thay đổi cấu hình, chứ không phải một dự án tích hợp.
Còn thiếu gì nữa?
• Một lần chạy độc lập của Ling-3.0-flash-VL trên Artificial Analysis Intelligence Index hiện tại — số 42 là con số của inclusionAI cho phiên bản chỉ số trước đó.
• Bất kỳ mức giá API lưu trữ nào cho mô hình VL — đây là rào cản lớn nhất duy nhất đối với việc áp dụng thông thường.
• Đã xuất bản các bộ text-only split (SWE-Bench Pro, Terminal-Bench 2.1) dành cho VL checkpoint, để một đội làm việc thuần về văn bản có thể kiểm chứng rằng vision stack không khiến nó mất đi hiệu năng xử lý văn bản nào.
• Một chỉ số độ trễ end-to-end hoặc thông lượng cho VL khi chịu tải hình ảnh — tốc độ của mô hình văn bản được đo; còn của mô hình thị giác thì không.
• Xác nhận trung lập về biểu đồ điểm chuẩn thị giác, một phần trong số đó được chạy trên bộ khung kiểm thử riêng của inclusionAI và ít nhất một điểm chuẩn nội bộ dự kiến sẽ được phát hành sau.
Bản án
Đây không phải là cuộc thi về chất lượng mô hình; đây là một quyết định về phương thức dữ liệu, kèm theo một tuyên bố gồm bốn điểm. Nếu đầu vào của bạn là văn bản, hãy giữ Ling 3.0 Flash — nó rẻ hơn, có trong danh sách AA, và đã được đo lường kiểm chứng, còn lợi thế của mô hình VL so với nó hiện tại chỉ là một con số từ nhà cung cấp trên một thang chỉ số cũ. Nếu khối lượng công việc của bạn bắt đầu từ màn hình — một trang tài liệu, một ảnh chụp màn hình, một biểu đồ, một khung hình video, một GUI mà agent của bạn phải thao tác — thì Ling-3.0-flash-VL chính là bộ não 124B bạn đã hiểu rõ, giờ đây có thể nhìn, và đó là một lựa chọn thực sự mới mà chỉ một tuần trước chưa từng tồn tại trong bậc nhanh (fast tier) của Ling. Hãy áp dụng nó ở những nơi thực sự cần thị giác, kiểm chứng con số 42 trước khi chuyển bất cứ điều gì dựa trên sức mạnh của nó, và giữ cho lựa chọn có thể đảo ngược ở tầng định tuyến cho đến khi có điểm số độc lập và mức giá niêm yết.
