Thẻ hero biên tập được tạo có tiêu đề "Ling-3.1-flash vs Qwen3.8-Flash" với phụ đề "Hai câu trả lời cho cùng một câu hỏi: làm thế nào để bạn xây dựng một tầng nhanh?" Khung bên trái có tiêu đề "Mở rộng quy mô và công bố" mang chú thích "~560B tổng · ~25B hoạt động · ngữ cảnh 1M" và một thẻ ghi "trọng số: sắp ra mắt". Khung bên phải có tiêu đề "Thu gọn và phát hành" mang "125B tổng · 6B hoạt động · xem trước Qwen4" và một thẻ ghi "trọng số: trên Hugging Face".
Engineering & Research

Ling-3.1-flash vs Qwen3.8-Flash: Hai cách để xây dựng một tầng nhanh, và chỉ một trong số chúng được phát hành

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai phòng thí nghiệm Trung Quốc đã cùng nhìn vào một bài toán trong mùa thu này — làm sao xây dựng một mô hình rẻ, nhanh, đủ tốt để nằm trong vòng lặp tác nhân — và đưa ra hai câu trả lời trái ngược. Ling-3.1-flash, được Ant Group công bố ngày 30 tháng 9 năm 2026, là một mô hình hỗn hợp chuyên gia (mixture-of-experts) khoảng 560 tỷ tham số, kích hoạt khoảng 25 tỷ tham số mỗi token, với cửa sổ ngữ cảnh được ghi là lên tới 1 triệu token và ý định đã nêu là sẽ mở mã nguồn "sớm". Qwen3.8-Flash, do đội Qwen của Alibaba phát hành ngày 26 tháng 8 năm 2026, là một mô hình đa phương thức hỗn hợp chuyên gia 125 tỷ tham số, kích hoạt khoảng 6 tỷ tham số mỗi token, với trọng số đã có trên Hugging Face dưới tên Qwen3.8-Flash-Next, một mô hình sản xuất đang hoạt động trên API QwenCloud với giá 0,15 USD cho mỗi triệu token đầu vào và 0,47 USD cho mỗi triệu token đầu ra, và được hỗ trợ ngay từ ngày đầu trong SGLang. Một phòng thí nghiệm mở rộng quy mô và công bố. Phòng còn lại thu nhỏ lại và phát hành. Sự khác biệt đó mang tính chỉ dẫn hơn bất kỳ benchmark nào mà một trong hai phòng thí nghiệm công bố.

Đó cũng là lý do phép so sánh này phải được đọc thật cẩn thận. Ling-3.1-flash không có trọng số, không có giấy phép, không có model card, không có giá API và không có đánh giá độc lập; toàn bộ hồ sơ được công bố chỉ là một bài đăng thông báo, một bảng đánh giá chuẩn của nhà cung cấp và một vị trí trong sản phẩm Ling Studio của chính Ant. Qwen3.8-Flash có tất cả những thứ đó và lợi thế đi trước bốn tuần trong việc được những người không làm việc cho Alibaba chạy thử. So sánh một lựa chọn kiến trúc là công bằng. So sánh năng lực thì chưa.

Hai quyết định thiết kế, và lý do chúng khác biệt

Canh bạc của Qwen là phân khúc nhanh nên khác biệt về cấu trúc so với mẫu chủ lực, chứ không chỉ đơn thuần nhỏ hơn. Qwen3.8-Flash kích hoạt 6 tỷ trong số 125 tỷ tham số của nó — độ thưa khoảng 95% — và có được năng lực từ nơi tính toán được định tuyến chứ không phải từ bề rộng thuần túy. Alibaba đã nói rõ rằng kiến trúc bên dưới, vốn kết hợp Gated DeltaNet với Qwen Sparse Attention và một bảng nhúng N-gram, là bản xem trước sớm của thế hệ Qwen4, được công bố sớm có chủ đích để các engine suy luận, công cụ lượng tử hóa và các mẫu triển khai có thể trưởng thành xung quanh nó trước khi các mô hình đắt đỏ được xây dựng dựa trên nó. Kết quả là một mô hình rẻ trên mỗi token về mặt thiết kế: khoảng 6 tỷ tham số công việc trên mỗi token, với mức giá Alibaba đặt là 0,15 USD cho đầu vào và 0,47 USD cho đầu ra trên mỗi triệu token.

Canh bạc của Ant, theo những gì thông báo tiết lộ, gần với việc mở rộng quy mô theo cách thông thường với một ngữ cảnh rất dài. Ling-3.1-flash duy trì một tỷ lệ hoạt động lớn — khoảng 25 tỷ tham số mỗi token trên tổng 560 tỷ, tức khoảng một trên hai mươi hai — và công bố cửa sổ lên tới 1 triệu token, gấp bốn lần so với thế hệ Ling trước cung cấp. Ứng dụng Ling Studio mô tả nó được xây dựng cho “các tác nhân đa dụng, tìm kiếm, công việc văn phòng thường nhật và phát triển phần mềm/mã nguồn”, vốn là định vị phân khúc nhanh, nhưng kinh tế tham số lại thuộc về một mô hình nặng hơn nhiều. Với cùng một đầu vào, một token đi qua 25 tỷ tham số hoạt động tốn khoảng gấp bốn lần lượng tính toán so với một token đi qua 6 tỷ tham số, trước khi bất kỳ quyết định định giá nào được tính đến.

Không cách tiếp cận nào là sai, và cả hai đều là những câu trả lời có thể bảo vệ được cho câu hỏi "điều gì giới hạn một mô hình rẻ." Qwen đang đặt cược rằng độ thưa và một ngăn xếp attention mới chính là giới hạn trần. Ant đang đặt cược rằng giới hạn trần là ngữ cảnh và tri thức thế giới, và rằng họ có thể chi trả cho phần tính toán. Điều phân biệt họ đối với người đọc không phải là triết lý thiết kế mà là cách đưa ra: một thiết kế bạn có thể tải về và đo lường so với một thiết kế bạn chỉ có thể đọc về nó.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Panels compare Ling-3.1-flash with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash across GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge. A footnote states HealthBench Professional was evaluated in the AQ environment.

Cái giá bạn phải trả cho mỗi thứ là gì, và điều đó có ý nghĩa như thế nào trên thực tế

Khoảng cách giá không hề nhỏ, và cũng không hề sát nhau. Qwen3.8-Flash được công bố ở mức $0.15 mỗi triệu token đầu vào, $0.47 mỗi triệu token đầu ra, và $0.018 mỗi triệu lượt đọc cache — cùng những con số đó trên thông báo của Alibaba, trên model card production của nhà cung cấp, và trên trang model định tuyến mà chúng tôi phục vụ, đó chính là diện mạo của một cơ chế chuyển tiếp không tăng giá 0% khi bạn đối chiếu nó với ba nguồn. Ant hoàn toàn không công bố mức giá nào cho Ling-3.1-flash — không có giá API, không có chiết khấu cache, không có gì tương đương. Con số duy nhất được công bố cho dòng Ling là của thế hệ trước, niêm yết ở mức $0.075 đầu vào và $0.22 đầu ra mỗi triệu token, xấp xỉ một nửa giá đầu vào của Qwen và chưa bằng một nửa giá đầu ra của nó. Nếu hạng Ling mới được định giá gần mức mà bản cũ từng nằm, thì trên giấy nó sẽ hạ giá thấp hơn Qwen3.8-Flash; còn nếu nó được định giá ở đâu đó gần với mức compute mà 25B tham số hoạt động của nó hàm ý, thì sẽ không. Dù thế nào thì đó cũng chỉ là phỏng đoán, vì con số đó không tồn tại.

Ngữ cảnh chính là nơi tuyên bố của Ling thực sự lớn hơn. Ant công bố tối đa 1 triệu token cho Ling-3.1-flash; Qwen3.8-Flash đi kèm ngữ cảnh mặc định 1M token trên API production và cửa sổ gốc 262,144 token trên bản trọng số mở, có thể mở rộng. Có hai điều cần lưu ý đối với con số của Ling và cả hai đều chưa được giải quyết. Thứ nhất, "tối đa 1M" là một thông số kỹ thuật, không phải một phép đo — chưa ai công bố hành vi truy xuất ngữ cảnh dài cho một mô hình mà không ai ngoài Ant có thể gọi được. Thứ hai, thế hệ Ling trước đó có đúng khoảng cách tương tự giữa cửa sổ được quảng cáo và lời giải thích kiến trúc đằng sau nó, và câu trả lời chỉ đến khi trọng số, định dạng và giới hạn ngữ cảnh cuối cùng được công bố. Con số 1M được nhấn mạnh chỉ là một lời hứa. Còn 1M trên Qwen3.8-Flash là giá trị mặc định được phục vụ thực tế để bạn có thể đối chiếu với tuyên bố của Ant.

Tại sao “preview” là từ trung thực ở một phía của điều này

Cách Alibaba tự định vị Qwen3.8-Flash là đây là bản xem trước kiến trúc được phát hành dưới một tên production — các trọng số mở mang hậu tố "Next" chính xác để không ai nhầm lẫn nguyên mẫu với mô hình phục vụ đã tinh chỉnh. Cách định vị đó đã được xác thực bằng diễn biến thực tế thay vì bằng tiếp thị: SGLang đã phát hành hỗ trợ day-0 cho Qwen3.8-Flash-Next ngay trong ngày ra mắt, với mô hình cũng được cấu hình cho Transformers, vLLM và TokenSpeed, và các trọng số kể từ đó đã được tiếp nhận rộng rãi trong các cộng đồng lượng tử hóa. Các phiên bản nhanh chóng trở nên bình thường, đúng như hình hài của một mô hình đã được phát hành.

Thông báo của Ant có cùng hình dạng ở một bước sớm hơn: một bản công bố đặc tả trước khi phát hành, kèm tuyên bố rõ ràng rằng mô hình sẽ sớm được mở mã nguồn. Đây là một cách ra mắt hợp lệ — Ling-3.0-flash đã đi đúng con đường đó vào tháng 7, và các trọng số đã về theo giấy phép MIT vào ngày 7 tháng 8, khoảng hai tuần sau đó. Nhưng tình trạng của hai dự án ngày nay thì không thể so sánh được, và đọc biểu đồ bao nhiêu cũng không thu hẹp được khoảng cách. Đáng để nói cụ thể về những gì một người ngoài có thể mang lại cho từng dự án.

Điều có thể được kiểm chứng một cách độc lập đối với Ling-3.1-flash hôm nay là: thông báo có tồn tại và được ghi ngày 30 tháng 9; rằng các số liệu về tham số, tham số hoạt động và ngữ cảnh là của chính Ant; rằng mô hình xuất hiện trong sản phẩm Ling Studio của Ant; và rằng không có trọng số, giấy phép hay model card nào được công bố. Điều có thể được kiểm chứng một cách độc lập đối với Qwen3.8-Flash là: trọng số có thể tải xuống ở định dạng BF16 và FP8; các điều khoản giấy phép có thể đọc được; giá API được công bố; và các tuyên bố benchmark của Alibaba đã mở cho việc tái tạo kể từ cuối tháng 8. Danh sách thứ hai dài hơn, và đó là toàn bộ sự so sánh được thu nhỏ lại.

Headless capture of the OrcaRouter model page for Qwen3.8 Flash, showing the routed model ID qwen/qwen3.8-flash, a 1M-token context window, 131K maximum output, text, image and video input with text output, capability badges for Vision, Tools, JSON and Reasoning, a production date of 2026-08-26, a pricing block reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, $0.018 cache read and $0.230 cache write, and a performance panel with a 4.47 s p50 time-to-first-token, 10.00 s p95, 105 tok/s output and a 2.9% error rate over the last seven days.

Cách hai điều này thực sự sẽ được đánh giá

Ant đã công bố một thẻ benchmark cho Ling-3.1-flash, đặt nó đối đầu với GPT-5.6 Sol, Claude Opus 5, Kimi K3, hai biến thể GLM và DeepSeek-V4.1-Flash, với các con số nổi bật là 1.673 Elo trên GDPVal-AA v2.1, 75,16 trên FrontierSWE và 65,35 trên HealthBench Professional. Có hai vấn đề nằm trên thẻ đó trước khi bất kỳ ai tranh luận về các con số. Thứ nhất là tập hợp so sánh: cả hai mô hình tiên tiến nhất mà Ant chọn đều đi sau một thế hệ, vì Claude Opus 5.5 và GPT-6 Sol đã ra mắt vào ngày 22 tháng 9 năm 2026 và hiện có thể định tuyến, nghĩa là thẻ này đánh giá một mô hình tháng 10 so với mô hình tiên tiến nhất của tháng 7 thay vì mô hình hiện tại. Thứ hai là một chú thích trên chính thẻ đó, ghi rằng kết quả HealthBench Professional đến từ "môi trường AQ" và rằng các năng lực chăm sóc sức khỏe của mô hình hiện chỉ có thể được trải nghiệm trong AQ — một môi trường mà không có tài liệu công khai nào định nghĩa. Một điểm số nổi bật mà môi trường đánh giá của nó không được nêu tên thì không thể tái lập ngay cả về nguyên tắc.

Ngược lại, những tuyên bố tương tự của Qwen3.8-Flash được đưa ra khi trọng số đã được công bố, và Alibaba đặt cược định vị của mình vào một tuyên bố mà bất kỳ ai cũng có thể kiểm chứng: rằng tỷ lệ thưa, chứ không phải số lượng tham số, mới là nguồn gốc của năng lực. Bốn tuần sử dụng không phải là một phán quyết, nhưng đủ dài để những tuyên bố ấy không còn là điều không thể tranh cãi — và đó là trạng thái hữu ích cho một mô hình.

Thực ra thì hôm nay nên làm gì với cái này

Với những người xây dựng, sự phân định thực tế rất đơn giản. Ling-3.1-flash không phải là một thành phần bạn có thể áp dụng trong tuần này: không có endpoint để gọi, không có trọng số để tự lưu trữ, không có giấy phép để kiểm tra, và không có mức giá để dự trù ngân sách. Dù mô hình cuối cùng có ra sao, nước đi hữu ích lúc này là đặt một mốc kích hoạt — trọng số được công bố, giấy phép thông thoáng, một điểm độc lập trên FrontierSWE ở mức gần 75.16 — rồi xem xét lại. Lịch sử của chính thế hệ trước cho thấy trọng số có thể xuất hiện hai tuần sau thông báo, nên điều kiện kích hoạt đó có thể sớm được thỏa mãn.

Qwen3.8-Flash đã là một thành phần. Nó đang hiện diện trên danh mục của chúng tôi dưới dạng một mô hình định tuyến ở mức giá niêm yết của nhà cung cấp với mức chênh lệch bằng không — thẻ định tuyến ghi $0.15 cho đầu vào, $0.47 cho đầu ra và $0.018 cho mỗi triệu lượt đọc cache, đúng những con số mà Alibaba công bố, đó chính là ý nghĩa thực tế của chính sách chênh lệch 0% chứ không phải trên một slide. Phía sau một khóa duy nhất nó nằm cạnh Claude Opus 5, GPT-5.6 Sol và DeepSeek-V4.1-Flash, nên phép so sánh mà Ant đang mời gọi — một ứng viên đối đầu với đỉnh cao hiện nay — có thể được chạy bằng cách trỏ một cấu hình vào hai tuyến thay vì duy trì hai tích hợp, với tính năng chuyển đổi dự phòng tự động lo liệu vào cuối tuần khi một nhà cung cấp gặp trục trặc. Đó là sự khác biệt giữa một cuộc thảo luận về kiến trúc và một thí nghiệm.

Kết luận, trong chừng mực có thể đưa ra: Qwen đã đặt cược táo bạo hơn vào kiến trúc và đủ tự tin để công bố nó sớm rồi để người ta mổ xẻ. Ant đặt cược nặng hơn — nhiều tham số hơn, nhiều tính toán hoạt động hơn trên mỗi token, nhiều ngữ cảnh hơn — và đến nay đã công bố một biểu đồ thay vì một mô hình. Biểu đồ trông đẹp. Biểu đồ cũng là thứ duy nhất mà người ta có.

Generated three-lane information card. Lane one, "Shipped, priced, licensed", holds "Qwen3.8-Flash — weights on Hugging Face as Qwen3.8-Flash-Next" and "$0.15 in / $0.47 out per 1M tokens, cache $0.018". Lane two, "Announced, unpriced, unlicensed", holds "Ling-3.1-flash — no repository, no licence", "no published API price" and "no independent evaluation". Lane three, "What a reader should do", holds "test the shipped model this week" and "set a trigger for the announced one".

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày